CodeIsAbstract commited on
Commit
2f8cd2c
·
verified ·
1 Parent(s): 35ba3ac

Training in progress, step 500, checkpoint

Browse files
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:01fa6858421fdb015bb654a425c3f690795d9e1cf96f456f6b27a6326b7d244c
3
  size 386379
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8dacb143c7ab743e9aaddb52ceaf8b2d3084857f91906714dacd8f4f10e36a82
3
  size 386379
last-checkpoint/pytorch_model.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:a4223bec74f7da5212aa0de8c7257e806561a45c5fccd2838265f2d310699b11
3
  size 1540661735
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a2c3217f16b577cba185ae98ad2a5674a8db2b9276059cf21350bdea694fad62
3
  size 1540661735
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b815622b7dfb0359193f2c3e6cdc190a4c07e6c28cfbaf526d6da260173bd4a4
3
  size 14455
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5fb8116194227284009af0f32eb6c9bf39b120912678b54e07fcb6539f29b5b2
3
  size 14455
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:94b7b1a014f5dad743694fda5858015bfe3bd4c82eac608d649238b91858a560
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b3161ebc22e167d90d7ee5cc1bfde367c6af5f0b04db44c912617eb26a593223
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,172 +2,92 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 1.0,
6
  "eval_steps": 100,
7
- "global_step": 1000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
  "epoch": 0.1,
14
- "grad_norm": 2.191904306411743,
15
  "learning_rate": 0.0003973800426880847,
16
- "loss": 9.861549072265625,
17
  "step": 100
18
  },
19
  {
20
  "epoch": 0.1,
21
- "eval_accuracy": 0.09354794520547945,
22
- "eval_loss": 9.128084182739258,
23
- "eval_runtime": 32.2982,
24
- "eval_samples_per_second": 30.962,
25
- "eval_steps_per_second": 30.962,
26
  "step": 100
27
  },
28
  {
29
  "epoch": 0.2,
30
- "grad_norm": 1.9173266887664795,
31
  "learning_rate": 0.0003762085737488283,
32
- "loss": 8.851971435546876,
33
  "step": 200
34
  },
35
  {
36
  "epoch": 0.2,
37
- "eval_accuracy": 0.10289236790606654,
38
- "eval_loss": 8.73751163482666,
39
- "eval_runtime": 26.6022,
40
- "eval_samples_per_second": 37.591,
41
- "eval_steps_per_second": 37.591,
42
  "step": 200
43
  },
44
  {
45
  "epoch": 0.3,
46
- "grad_norm": 2.392211437225342,
47
  "learning_rate": 0.00033594217168615465,
48
- "loss": 8.558801879882813,
49
  "step": 300
50
  },
51
  {
52
  "epoch": 0.3,
53
- "eval_accuracy": 0.10008610567514677,
54
- "eval_loss": 8.624308586120605,
55
- "eval_runtime": 26.8044,
56
- "eval_samples_per_second": 37.307,
57
- "eval_steps_per_second": 37.307,
58
  "step": 300
59
  },
60
  {
61
  "epoch": 0.4,
62
- "grad_norm": 3.655690908432007,
63
  "learning_rate": 0.00028094432596115747,
64
- "loss": 8.405433349609375,
65
  "step": 400
66
  },
67
  {
68
  "epoch": 0.4,
69
- "eval_accuracy": 0.10092172211350293,
70
- "eval_loss": 8.508211135864258,
71
- "eval_runtime": 26.8389,
72
- "eval_samples_per_second": 37.259,
73
- "eval_steps_per_second": 37.259,
74
  "step": 400
75
  },
76
  {
77
  "epoch": 0.5,
78
- "grad_norm": 8.362494468688965,
79
  "learning_rate": 0.00021717490653764342,
80
- "loss": 8.498648681640624,
81
  "step": 500
82
  },
83
  {
84
  "epoch": 0.5,
85
- "eval_accuracy": 0.07594911937377691,
86
- "eval_loss": 9.306892395019531,
87
- "eval_runtime": 26.9571,
88
- "eval_samples_per_second": 37.096,
89
- "eval_steps_per_second": 37.096,
90
  "step": 500
91
- },
92
- {
93
- "epoch": 0.6,
94
- "grad_norm": 31.606178283691406,
95
- "learning_rate": 0.00015154431949464275,
96
- "loss": 11.733912353515626,
97
- "step": 600
98
- },
99
- {
100
- "epoch": 0.6,
101
- "eval_accuracy": 0.05017808219178082,
102
- "eval_loss": 12.344472885131836,
103
- "eval_runtime": 27.8267,
104
- "eval_samples_per_second": 35.937,
105
- "eval_steps_per_second": 35.937,
106
- "step": 600
107
- },
108
- {
109
- "epoch": 0.7,
110
- "grad_norm": 60.602169036865234,
111
- "learning_rate": 9.11646573017482e-05,
112
- "loss": 12.59990234375,
113
- "step": 700
114
- },
115
- {
116
- "epoch": 0.7,
117
- "eval_accuracy": 0.07920547945205479,
118
- "eval_loss": 11.4829683303833,
119
- "eval_runtime": 26.8514,
120
- "eval_samples_per_second": 37.242,
121
- "eval_steps_per_second": 37.242,
122
- "step": 700
123
- },
124
- {
125
- "epoch": 0.8,
126
- "grad_norm": 28.155149459838867,
127
- "learning_rate": 4.2578993244549506e-05,
128
- "loss": 10.478193359375,
129
- "step": 800
130
- },
131
- {
132
- "epoch": 0.8,
133
- "eval_accuracy": 0.08408610567514677,
134
- "eval_loss": 9.93655776977539,
135
- "eval_runtime": 26.6366,
136
- "eval_samples_per_second": 37.542,
137
- "eval_steps_per_second": 37.542,
138
- "step": 800
139
- },
140
- {
141
- "epoch": 0.9,
142
- "grad_norm": 26.28119468688965,
143
- "learning_rate": 1.1052337907897503e-05,
144
- "loss": 9.994468383789062,
145
- "step": 900
146
- },
147
- {
148
- "epoch": 0.9,
149
- "eval_accuracy": 0.0641252446183953,
150
- "eval_loss": 9.959942817687988,
151
- "eval_runtime": 26.6315,
152
- "eval_samples_per_second": 37.549,
153
- "eval_steps_per_second": 37.549,
154
- "step": 900
155
- },
156
- {
157
- "epoch": 1.0,
158
- "grad_norm": 41.307456970214844,
159
- "learning_rate": 1.093583978573065e-09,
160
- "loss": 9.751447143554687,
161
- "step": 1000
162
- },
163
- {
164
- "epoch": 1.0,
165
- "eval_accuracy": 0.06885127201565558,
166
- "eval_loss": 9.537232398986816,
167
- "eval_runtime": 26.8522,
168
- "eval_samples_per_second": 37.241,
169
- "eval_steps_per_second": 37.241,
170
- "step": 1000
171
  }
172
  ],
173
  "logging_steps": 100,
@@ -182,7 +102,7 @@
182
  "should_evaluate": false,
183
  "should_log": false,
184
  "should_save": true,
185
- "should_training_stop": true
186
  },
187
  "attributes": {}
188
  }
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.5,
6
  "eval_steps": 100,
7
+ "global_step": 500,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
  "epoch": 0.1,
14
+ "grad_norm": 1.297243595123291,
15
  "learning_rate": 0.0003973800426880847,
16
+ "loss": 9.179060668945313,
17
  "step": 100
18
  },
19
  {
20
  "epoch": 0.1,
21
+ "eval_accuracy": 0.09053816046966733,
22
+ "eval_loss": 8.474776268005371,
23
+ "eval_runtime": 32.6103,
24
+ "eval_samples_per_second": 30.665,
25
+ "eval_steps_per_second": 30.665,
26
  "step": 100
27
  },
28
  {
29
  "epoch": 0.2,
30
+ "grad_norm": 1.142166256904602,
31
  "learning_rate": 0.0003762085737488283,
32
+ "loss": 8.30135498046875,
33
  "step": 200
34
  },
35
  {
36
  "epoch": 0.2,
37
+ "eval_accuracy": 0.10549706457925637,
38
+ "eval_loss": 8.138654708862305,
39
+ "eval_runtime": 26.7248,
40
+ "eval_samples_per_second": 37.418,
41
+ "eval_steps_per_second": 37.418,
42
  "step": 200
43
  },
44
  {
45
  "epoch": 0.3,
46
+ "grad_norm": 1.286571741104126,
47
  "learning_rate": 0.00033594217168615465,
48
+ "loss": 7.987710571289062,
49
  "step": 300
50
  },
51
  {
52
  "epoch": 0.3,
53
+ "eval_accuracy": 0.11159295499021527,
54
+ "eval_loss": 7.991443157196045,
55
+ "eval_runtime": 26.5785,
56
+ "eval_samples_per_second": 37.624,
57
+ "eval_steps_per_second": 37.624,
58
  "step": 300
59
  },
60
  {
61
  "epoch": 0.4,
62
+ "grad_norm": 1.262372612953186,
63
  "learning_rate": 0.00028094432596115747,
64
+ "loss": 7.810901489257812,
65
  "step": 400
66
  },
67
  {
68
  "epoch": 0.4,
69
+ "eval_accuracy": 0.10483365949119373,
70
+ "eval_loss": 7.9381818771362305,
71
+ "eval_runtime": 26.6986,
72
+ "eval_samples_per_second": 37.455,
73
+ "eval_steps_per_second": 37.455,
74
  "step": 400
75
  },
76
  {
77
  "epoch": 0.5,
78
+ "grad_norm": 1.2876827716827393,
79
  "learning_rate": 0.00021717490653764342,
80
+ "loss": 7.900021362304687,
81
  "step": 500
82
  },
83
  {
84
  "epoch": 0.5,
85
+ "eval_accuracy": 0.11435420743639922,
86
+ "eval_loss": 7.851724624633789,
87
+ "eval_runtime": 26.5522,
88
+ "eval_samples_per_second": 37.662,
89
+ "eval_steps_per_second": 37.662,
90
  "step": 500
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
91
  }
92
  ],
93
  "logging_steps": 100,
 
102
  "should_evaluate": false,
103
  "should_log": false,
104
  "should_save": true,
105
+ "should_training_stop": false
106
  },
107
  "attributes": {}
108
  }