sravanthib commited on
Commit
ad8343f
·
verified ·
1 Parent(s): 3220af4

Training completed

Browse files
Files changed (4) hide show
  1. README.md +3 -3
  2. all_results.json +6 -6
  3. train_results.json +6 -6
  4. trainer_state.json +24 -24
README.md CHANGED
@@ -38,10 +38,10 @@ The following hyperparameters were used during training:
38
  - eval_batch_size: 8
39
  - seed: 42
40
  - distributed_type: multi-GPU
41
- - num_devices: 8
42
  - gradient_accumulation_steps: 10
43
- - total_train_batch_size: 160
44
- - total_eval_batch_size: 64
45
  - optimizer: Use adamw_torch with betas=(0.9,0.999) and epsilon=1e-08 and optimizer_args=No additional optimizer arguments
46
  - lr_scheduler_type: cosine
47
  - lr_scheduler_warmup_ratio: 0.05
 
38
  - eval_batch_size: 8
39
  - seed: 42
40
  - distributed_type: multi-GPU
41
+ - num_devices: 4
42
  - gradient_accumulation_steps: 10
43
+ - total_train_batch_size: 80
44
+ - total_eval_batch_size: 32
45
  - optimizer: Use adamw_torch with betas=(0.9,0.999) and epsilon=1e-08 and optimizer_args=No additional optimizer arguments
46
  - lr_scheduler_type: cosine
47
  - lr_scheduler_warmup_ratio: 0.05
all_results.json CHANGED
@@ -1,8 +1,8 @@
1
  {
2
- "epoch": 7.158730158730159,
3
- "total_flos": 6.287430713700516e+17,
4
- "train_loss": 0.9039687210321427,
5
- "train_runtime": 620.4093,
6
- "train_samples_per_second": 12.895,
7
- "train_steps_per_second": 0.081
8
  }
 
1
  {
2
+ "epoch": 3.88,
3
+ "total_flos": 3.380713971525878e+17,
4
+ "train_loss": 0.9234967929124832,
5
+ "train_runtime": 643.7881,
6
+ "train_samples_per_second": 6.213,
7
+ "train_steps_per_second": 0.078
8
  }
train_results.json CHANGED
@@ -1,8 +1,8 @@
1
  {
2
- "epoch": 7.158730158730159,
3
- "total_flos": 6.287430713700516e+17,
4
- "train_loss": 0.9039687210321427,
5
- "train_runtime": 620.4093,
6
- "train_samples_per_second": 12.895,
7
- "train_steps_per_second": 0.081
8
  }
 
1
  {
2
+ "epoch": 3.88,
3
+ "total_flos": 3.380713971525878e+17,
4
+ "train_loss": 0.9234967929124832,
5
+ "train_runtime": 643.7881,
6
+ "train_samples_per_second": 6.213,
7
+ "train_steps_per_second": 0.078
8
  }
trainer_state.json CHANGED
@@ -2,7 +2,7 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 7.158730158730159,
6
  "eval_steps": 0,
7
  "global_step": 50,
8
  "is_hyper_param_search": false,
@@ -10,54 +10,54 @@
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
- "epoch": 1.4761904761904763,
14
- "grad_norm": 0.3249737322330475,
15
  "learning_rate": 0.0001,
16
- "loss": 4.3222,
17
  "step": 10
18
  },
19
  {
20
- "epoch": 2.9523809523809526,
21
- "grad_norm": 0.1562434732913971,
22
  "learning_rate": 0.0001,
23
- "loss": 0.055,
24
  "step": 20
25
  },
26
  {
27
- "epoch": 4.317460317460317,
28
- "grad_norm": 0.16819268465042114,
29
  "learning_rate": 0.0001,
30
- "loss": 0.0541,
31
  "step": 30
32
  },
33
  {
34
- "epoch": 5.7936507936507935,
35
- "grad_norm": 0.13744346797466278,
36
  "learning_rate": 0.0001,
37
- "loss": 0.0479,
38
  "step": 40
39
  },
40
  {
41
- "epoch": 7.158730158730159,
42
- "grad_norm": 0.11455884575843811,
43
  "learning_rate": 0.0001,
44
- "loss": 0.0406,
45
  "step": 50
46
  },
47
  {
48
- "epoch": 7.158730158730159,
49
  "step": 50,
50
- "total_flos": 6.287430713700516e+17,
51
- "train_loss": 0.9039687210321427,
52
- "train_runtime": 620.4093,
53
- "train_samples_per_second": 12.895,
54
- "train_steps_per_second": 0.081
55
  }
56
  ],
57
  "logging_steps": 10,
58
  "max_steps": 50,
59
  "num_input_tokens_seen": 0,
60
- "num_train_epochs": 9,
61
  "save_steps": 50,
62
  "stateful_callbacks": {
63
  "TrainerControl": {
@@ -71,7 +71,7 @@
71
  "attributes": {}
72
  }
73
  },
74
- "total_flos": 6.287430713700516e+17,
75
  "train_batch_size": 2,
76
  "trial_name": null,
77
  "trial_params": null
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 3.88,
6
  "eval_steps": 0,
7
  "global_step": 50,
8
  "is_hyper_param_search": false,
 
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
+ "epoch": 0.8,
14
+ "grad_norm": 0.5147947669029236,
15
  "learning_rate": 0.0001,
16
+ "loss": 4.4204,
17
  "step": 10
18
  },
19
  {
20
+ "epoch": 1.56,
21
+ "grad_norm": 0.16838183999061584,
22
  "learning_rate": 0.0001,
23
+ "loss": 0.0551,
24
  "step": 20
25
  },
26
  {
27
+ "epoch": 2.32,
28
+ "grad_norm": 0.16586190462112427,
29
  "learning_rate": 0.0001,
30
+ "loss": 0.054,
31
  "step": 30
32
  },
33
  {
34
+ "epoch": 3.08,
35
+ "grad_norm": 0.2226952314376831,
36
  "learning_rate": 0.0001,
37
+ "loss": 0.0473,
38
  "step": 40
39
  },
40
  {
41
+ "epoch": 3.88,
42
+ "grad_norm": 0.10044433176517487,
43
  "learning_rate": 0.0001,
44
+ "loss": 0.0407,
45
  "step": 50
46
  },
47
  {
48
+ "epoch": 3.88,
49
  "step": 50,
50
+ "total_flos": 3.380713971525878e+17,
51
+ "train_loss": 0.9234967929124832,
52
+ "train_runtime": 643.7881,
53
+ "train_samples_per_second": 6.213,
54
+ "train_steps_per_second": 0.078
55
  }
56
  ],
57
  "logging_steps": 10,
58
  "max_steps": 50,
59
  "num_input_tokens_seen": 0,
60
+ "num_train_epochs": 5,
61
  "save_steps": 50,
62
  "stateful_callbacks": {
63
  "TrainerControl": {
 
71
  "attributes": {}
72
  }
73
  },
74
+ "total_flos": 3.380713971525878e+17,
75
  "train_batch_size": 2,
76
  "trial_name": null,
77
  "trial_params": null