CodeIsAbstract commited on
Commit
b98f0b6
·
verified ·
1 Parent(s): 6a47bc7

Training in progress, step 1000, checkpoint

Browse files
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:3bade0394fffddee210809f85ef580bee9253cbdc63658c93609636b50849132
3
  size 2252747
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:46934af3573871dfea7d1989ce9b5dd2fc88d7029cc7a29aa49696756084cc0b
3
  size 2252747
last-checkpoint/pytorch_model.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:abb28c9de07f152f7162a5afb9fa57feec1bb26c13b04027682db0fc06632987
3
  size 847648963
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d7c1dfd3789b6cb9dac5da1f24dc7017774f6db9b41bfae170b2278be51dd4a9
3
  size 847648963
last-checkpoint/rng_state_0.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:76e07cf0345bf512c151f0957ea0731d69830b690d0d47fe9335a01fd87ff0d5
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:24d48aa92727987083d0bcdd5037110e1c878d41da32b90284910b671afdf5b0
3
  size 14469
last-checkpoint/rng_state_1.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:4b1e066d0ede72061c950708a201039b55678b711860b01a8850b06ca136b2f7
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d2b754989164ed24b1fd5d21f43dcf0c273ff72d7fdf3d4c2bf4517be9438f53
3
  size 14469
last-checkpoint/rng_state_2.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:c83436d7d707c3d61b15981b0298ffc689a42626328497b706511643f5ceb662
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:457a2882dad2249a075d16bc60a9d6f1d02fc6534344eb7069865c9dd06c7024
3
  size 14469
last-checkpoint/rng_state_3.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:dcdd3e13e6b97f6783c4798cd70e6e48a2104ccaacf287e70c62bf0c09ec3f22
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5f32f9ecfb130472de30af5085eb848eedececce5481930e500b29d06331cb2e
3
  size 14469
last-checkpoint/rng_state_4.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:aa71eeae497ae80be5331ba680216cbc540af220332f0c56f028ebfc2f445e20
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c686ae05e681a5d90696b0c260ad0fb0b06594229199d0b2ed64aea2a4664f46
3
  size 14469
last-checkpoint/rng_state_5.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:c70b31dc63a3cc8a092a19500455139bf70b0744911cd2bfd2067660e23a2f80
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:57ea3dd399ed721886bd76b064bb8fded9d7d8d28cb68a0c9435c18657bd1132
3
  size 14469
last-checkpoint/rng_state_6.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b86db638d3fa6bb27db28786ecb6ac4913c0fd4a25f7498fd0ae3429244b41eb
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:593b9d9100c58eedd0625fa647d716d43154cc6c9f18b0a07aa72c501f7dc81f
3
  size 14469
last-checkpoint/rng_state_7.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:840457dd3ad214440eed9722d63d2231facaf5d2730c8917e33dd9d3a6078932
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e068abc8d6faa0b30472d1c0b5bc53e44130d902bf93caa9b4deb6ce1ebb1d9f
3
  size 14469
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:5b79cc0df1e63ecef3adaaf8ef4c455eb58ccb70431c624030057057995b60a8
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:94b7b1a014f5dad743694fda5858015bfe3bd4c82eac608d649238b91858a560
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.5,
6
  "eval_steps": 50,
7
- "global_step": 500,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": false,
10
  "is_world_process_zero": true,
@@ -133,6 +133,131 @@
133
  "eval_samples_per_second": 13.361,
134
  "eval_steps_per_second": 1.71,
135
  "step": 500
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
136
  }
137
  ],
138
  "logging_steps": 100,
@@ -147,7 +272,7 @@
147
  "should_evaluate": false,
148
  "should_log": false,
149
  "should_save": true,
150
- "should_training_stop": false
151
  },
152
  "attributes": {}
153
  }
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 1.0,
6
  "eval_steps": 50,
7
+ "global_step": 1000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": false,
10
  "is_world_process_zero": true,
 
133
  "eval_samples_per_second": 13.361,
134
  "eval_steps_per_second": 1.71,
135
  "step": 500
136
+ },
137
+ {
138
+ "epoch": 0.55,
139
+ "eval_accuracy": 0.19033070866141732,
140
+ "eval_loss": 44.91364288330078,
141
+ "eval_runtime": 8.7783,
142
+ "eval_samples_per_second": 14.24,
143
+ "eval_steps_per_second": 1.823,
144
+ "step": 550
145
+ },
146
+ {
147
+ "epoch": 0.6,
148
+ "grad_norm": 28925.150390625,
149
+ "learning_rate": 0.0001822824974551769,
150
+ "loss": 1365.12171875,
151
+ "step": 600
152
+ },
153
+ {
154
+ "epoch": 0.6,
155
+ "eval_accuracy": 0.19299212598425197,
156
+ "eval_loss": 44.67140579223633,
157
+ "eval_runtime": 9.3914,
158
+ "eval_samples_per_second": 13.31,
159
+ "eval_steps_per_second": 1.704,
160
+ "step": 600
161
+ },
162
+ {
163
+ "epoch": 0.65,
164
+ "eval_accuracy": 0.19476377952755905,
165
+ "eval_loss": 44.36285400390625,
166
+ "eval_runtime": 11.8603,
167
+ "eval_samples_per_second": 10.539,
168
+ "eval_steps_per_second": 1.349,
169
+ "step": 650
170
+ },
171
+ {
172
+ "epoch": 0.7,
173
+ "grad_norm": 6494.93701171875,
174
+ "learning_rate": 0.0001115146393893927,
175
+ "loss": 1348.1965625,
176
+ "step": 700
177
+ },
178
+ {
179
+ "epoch": 0.7,
180
+ "eval_accuracy": 0.19607086614173228,
181
+ "eval_loss": 44.26563262939453,
182
+ "eval_runtime": 9.2536,
183
+ "eval_samples_per_second": 13.508,
184
+ "eval_steps_per_second": 1.729,
185
+ "step": 700
186
+ },
187
+ {
188
+ "epoch": 0.75,
189
+ "eval_accuracy": 0.19792125984251968,
190
+ "eval_loss": 44.026851654052734,
191
+ "eval_runtime": 13.9865,
192
+ "eval_samples_per_second": 8.937,
193
+ "eval_steps_per_second": 1.144,
194
+ "step": 750
195
+ },
196
+ {
197
+ "epoch": 0.8,
198
+ "grad_norm": 6566.00732421875,
199
+ "learning_rate": 5.269721958838045e-05,
200
+ "loss": 1335.25640625,
201
+ "step": 800
202
+ },
203
+ {
204
+ "epoch": 0.8,
205
+ "eval_accuracy": 0.19969291338582676,
206
+ "eval_loss": 43.83841323852539,
207
+ "eval_runtime": 9.3886,
208
+ "eval_samples_per_second": 13.314,
209
+ "eval_steps_per_second": 1.704,
210
+ "step": 800
211
+ },
212
+ {
213
+ "epoch": 0.85,
214
+ "eval_accuracy": 0.2002755905511811,
215
+ "eval_loss": 43.76130294799805,
216
+ "eval_runtime": 16.2687,
217
+ "eval_samples_per_second": 7.683,
218
+ "eval_steps_per_second": 0.983,
219
+ "step": 850
220
+ },
221
+ {
222
+ "epoch": 0.9,
223
+ "grad_norm": 5925.8193359375,
224
+ "learning_rate": 1.3773856514840955e-05,
225
+ "loss": 1328.743125,
226
+ "step": 900
227
+ },
228
+ {
229
+ "epoch": 0.9,
230
+ "eval_accuracy": 0.20086614173228345,
231
+ "eval_loss": 43.69052505493164,
232
+ "eval_runtime": 9.3216,
233
+ "eval_samples_per_second": 13.41,
234
+ "eval_steps_per_second": 1.716,
235
+ "step": 900
236
+ },
237
+ {
238
+ "epoch": 0.95,
239
+ "eval_accuracy": 0.2008503937007874,
240
+ "eval_loss": 43.665740966796875,
241
+ "eval_runtime": 15.4653,
242
+ "eval_samples_per_second": 8.083,
243
+ "eval_steps_per_second": 1.035,
244
+ "step": 950
245
+ },
246
+ {
247
+ "epoch": 1.0,
248
+ "grad_norm": 6814.45703125,
249
+ "learning_rate": 1.3660336561915898e-09,
250
+ "loss": 1325.8203125,
251
+ "step": 1000
252
+ },
253
+ {
254
+ "epoch": 1.0,
255
+ "eval_accuracy": 0.2012047244094488,
256
+ "eval_loss": 43.653385162353516,
257
+ "eval_runtime": 9.352,
258
+ "eval_samples_per_second": 13.366,
259
+ "eval_steps_per_second": 1.711,
260
+ "step": 1000
261
  }
262
  ],
263
  "logging_steps": 100,
 
272
  "should_evaluate": false,
273
  "should_log": false,
274
  "should_save": true,
275
+ "should_training_stop": true
276
  },
277
  "attributes": {}
278
  }