CodeIsAbstract commited on
Commit
32846ac
·
verified ·
1 Parent(s): 31f5b76

Training in progress, step 900, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:0b60bd2b618a69841c9638940c605adda6c4341ba295b93f3a6e133859850d9b
3
  size 579748776
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:dddca729ab09142c6d4a86292fcb09c8240e120212ff2dea7784702f1c454342
3
  size 579748776
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:f82169ccf1b0127e9b22314f600b128025f5b62090d5a9708b8fcba2a47577d6
3
  size 1159627083
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b9ae4821caa875af2772c8c1c8a8f25674e533cf460c88cc3b72e2ecf795355b
3
  size 1159627083
last-checkpoint/rng_state_0.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b88b1c42229400fab90420f6e5c036d698ae72e0815465d44c9b14b967936d62
3
  size 14917
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5387f6e99d51202c7ef90fef723e457487d08949715af1e6a0aff706c078f5bd
3
  size 14917
last-checkpoint/rng_state_1.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:a24f1bcbda0bf3e5430414e8c982c53ac11d90f165724ef0b93f5942d606b3a0
3
  size 14917
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a6418bc04f5e424107d7c94f43f8158a47397e1e0f7c2b0b675aeed07c6fcfe3
3
  size 14917
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:4be5aafe091abf14e9046be44e4c580810411461427a26c13cdf5ca05ae54bc2
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4fdb738e61f6acc5e69da32f32a665c3f109e78a2b1b3b8004b382d7b5d9fa18
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.3,
6
  "eval_steps": 100,
7
- "global_step": 600,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -230,6 +230,117 @@
230
  "eval_samples_per_second": 63.619,
231
  "eval_steps_per_second": 2.099,
232
  "step": 600
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
233
  }
234
  ],
235
  "logging_steps": 25,
@@ -249,7 +360,7 @@
249
  "attributes": {}
250
  }
251
  },
252
- "total_flos": 4.013344142917632e+17,
253
  "train_batch_size": 64,
254
  "trial_name": null,
255
  "trial_params": null
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.45,
6
  "eval_steps": 100,
7
+ "global_step": 900,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
230
  "eval_samples_per_second": 63.619,
231
  "eval_steps_per_second": 2.099,
232
  "step": 600
233
+ },
234
+ {
235
+ "epoch": 0.3125,
236
+ "grad_norm": 20.58213233947754,
237
+ "learning_rate": 8.465819331784009e-05,
238
+ "loss": 96.2906,
239
+ "step": 625
240
+ },
241
+ {
242
+ "epoch": 0.325,
243
+ "grad_norm": 14.315438270568848,
244
+ "learning_rate": 8.30974265247088e-05,
245
+ "loss": 95.9487,
246
+ "step": 650
247
+ },
248
+ {
249
+ "epoch": 0.3375,
250
+ "grad_norm": 12.04114818572998,
251
+ "learning_rate": 8.147701593190385e-05,
252
+ "loss": 95.4309,
253
+ "step": 675
254
+ },
255
+ {
256
+ "epoch": 0.35,
257
+ "grad_norm": 22.478317260742188,
258
+ "learning_rate": 7.979988162883804e-05,
259
+ "loss": 95.0101,
260
+ "step": 700
261
+ },
262
+ {
263
+ "epoch": 0.35,
264
+ "eval_accuracy": 0.16826703154110645,
265
+ "eval_loss": 5.88900899887085,
266
+ "eval_runtime": 7.5208,
267
+ "eval_samples_per_second": 64.487,
268
+ "eval_steps_per_second": 2.127,
269
+ "step": 700
270
+ },
271
+ {
272
+ "epoch": 0.3625,
273
+ "grad_norm": 50.81674575805664,
274
+ "learning_rate": 7.806904592488408e-05,
275
+ "loss": 94.8858,
276
+ "step": 725
277
+ },
278
+ {
279
+ "epoch": 0.375,
280
+ "grad_norm": 20.65149688720703,
281
+ "learning_rate": 7.628762790296879e-05,
282
+ "loss": 95.0119,
283
+ "step": 750
284
+ },
285
+ {
286
+ "epoch": 0.3875,
287
+ "grad_norm": 22.1734619140625,
288
+ "learning_rate": 7.445883779877482e-05,
289
+ "loss": 94.6604,
290
+ "step": 775
291
+ },
292
+ {
293
+ "epoch": 0.4,
294
+ "grad_norm": 20.18880844116211,
295
+ "learning_rate": 7.258597121567904e-05,
296
+ "loss": 94.2643,
297
+ "step": 800
298
+ },
299
+ {
300
+ "epoch": 0.4,
301
+ "eval_accuracy": 0.17154484269838785,
302
+ "eval_loss": 5.828437328338623,
303
+ "eval_runtime": 7.4208,
304
+ "eval_samples_per_second": 65.357,
305
+ "eval_steps_per_second": 2.156,
306
+ "step": 800
307
+ },
308
+ {
309
+ "epoch": 0.4125,
310
+ "grad_norm": 35.1305046081543,
311
+ "learning_rate": 7.067240318585242e-05,
312
+ "loss": 94.3216,
313
+ "step": 825
314
+ },
315
+ {
316
+ "epoch": 0.425,
317
+ "grad_norm": 9.143704414367676,
318
+ "learning_rate": 6.872158208822398e-05,
319
+ "loss": 93.9239,
320
+ "step": 850
321
+ },
322
+ {
323
+ "epoch": 0.4375,
324
+ "grad_norm": 9.495540618896484,
325
+ "learning_rate": 6.673702343426894e-05,
326
+ "loss": 93.8027,
327
+ "step": 875
328
+ },
329
+ {
330
+ "epoch": 0.45,
331
+ "grad_norm": 19.112733840942383,
332
+ "learning_rate": 6.472230353281925e-05,
333
+ "loss": 93.2266,
334
+ "step": 900
335
+ },
336
+ {
337
+ "epoch": 0.45,
338
+ "eval_accuracy": 0.17456010582705153,
339
+ "eval_loss": 5.77442741394043,
340
+ "eval_runtime": 7.4706,
341
+ "eval_samples_per_second": 64.921,
342
+ "eval_steps_per_second": 2.142,
343
+ "step": 900
344
  }
345
  ],
346
  "logging_steps": 25,
 
360
  "attributes": {}
361
  }
362
  },
363
+ "total_flos": 6.020016214376448e+17,
364
  "train_batch_size": 64,
365
  "trial_name": null,
366
  "trial_params": null