CodeIsAbstract commited on
Commit
791cbea
·
verified ·
1 Parent(s): 674e777

Training in progress, step 6000, checkpoint

Browse files
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:8b8c4f09e4df38c2b9a7b4ea1bb4b3bb55ce4048cf496c490994769c5b20d4a8
3
  size 1442699
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bbdf201f2ca7db57b8feb7c3fd112ee2da171978edf625a10c49da7fb6425229
3
  size 1442699
last-checkpoint/pytorch_model.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:8be8ea274e8c78fb1a6aed38fc7b39f6a706b7c0fc47d551c8c41142e7ae8382
3
  size 499774435
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5209572e45d9d97e930e13c4cbefc87684d2f813ab7698d7f8601f7281f9d968
3
  size 499774435
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:af971d84c55a6494396ed13d3bc14bba9e161e3dc5123551d9be42796da1c2be
3
  size 14455
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:97cacdba2a01c848150f6f5acf2400fd2530701580557a29b8e2ae0aa198e156
3
  size 14455
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:76cf98a8cde877f1e49a9e4b884c4dce3d51bb4035429d464e74acc35ddca024
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:eb2a89a85e1c8ac7ee9b5678d857a4d99090faa37a24489f44839e0801dfe16a
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.08,
6
  "eval_steps": 1000,
7
- "global_step": 4000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -324,6 +324,164 @@
324
  "eval_samples_per_second": 151.355,
325
  "eval_steps_per_second": 18.919,
326
  "step": 4000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
327
  }
328
  ],
329
  "logging_steps": 100,
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.12,
6
  "eval_steps": 1000,
7
+ "global_step": 6000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
324
  "eval_samples_per_second": 151.355,
325
  "eval_steps_per_second": 18.919,
326
  "step": 4000
327
+ },
328
+ {
329
+ "epoch": 0.082,
330
+ "grad_norm": 0.5043853521347046,
331
+ "learning_rate": 0.0019944130517800893,
332
+ "loss": 5.239017944335938,
333
+ "step": 4100
334
+ },
335
+ {
336
+ "epoch": 0.084,
337
+ "grad_norm": 0.3757055699825287,
338
+ "learning_rate": 0.001993693153591457,
339
+ "loss": 5.197454833984375,
340
+ "step": 4200
341
+ },
342
+ {
343
+ "epoch": 0.086,
344
+ "grad_norm": 0.3453492820262909,
345
+ "learning_rate": 0.0019929297880451674,
346
+ "loss": 5.198365478515625,
347
+ "step": 4300
348
+ },
349
+ {
350
+ "epoch": 0.088,
351
+ "grad_norm": 0.4262433350086212,
352
+ "learning_rate": 0.0019921229885333023,
353
+ "loss": 5.171350708007813,
354
+ "step": 4400
355
+ },
356
+ {
357
+ "epoch": 0.09,
358
+ "grad_norm": 0.40825143456459045,
359
+ "learning_rate": 0.001991272790347886,
360
+ "loss": 5.089209899902344,
361
+ "step": 4500
362
+ },
363
+ {
364
+ "epoch": 0.092,
365
+ "grad_norm": 0.4957910180091858,
366
+ "learning_rate": 0.0019903792306793415,
367
+ "loss": 5.19048828125,
368
+ "step": 4600
369
+ },
370
+ {
371
+ "epoch": 0.094,
372
+ "grad_norm": 0.3308526873588562,
373
+ "learning_rate": 0.001989442348614863,
374
+ "loss": 5.067187805175781,
375
+ "step": 4700
376
+ },
377
+ {
378
+ "epoch": 0.096,
379
+ "grad_norm": 0.8154045343399048,
380
+ "learning_rate": 0.0019884621851367075,
381
+ "loss": 4.980618591308594,
382
+ "step": 4800
383
+ },
384
+ {
385
+ "epoch": 0.098,
386
+ "grad_norm": 0.31783750653266907,
387
+ "learning_rate": 0.001987438783120401,
388
+ "loss": 5.060207214355469,
389
+ "step": 4900
390
+ },
391
+ {
392
+ "epoch": 0.1,
393
+ "grad_norm": 0.3620655834674835,
394
+ "learning_rate": 0.001986372187332862,
395
+ "loss": 5.093417358398438,
396
+ "step": 5000
397
+ },
398
+ {
399
+ "epoch": 0.1,
400
+ "eval_accuracy": 0.2061839530332681,
401
+ "eval_loss": 5.202327251434326,
402
+ "eval_runtime": 6.6926,
403
+ "eval_samples_per_second": 149.419,
404
+ "eval_steps_per_second": 18.677,
405
+ "step": 5000
406
+ },
407
+ {
408
+ "epoch": 0.102,
409
+ "grad_norm": 0.5922824144363403,
410
+ "learning_rate": 0.0019852624444304467,
411
+ "loss": 5.105964965820313,
412
+ "step": 5100
413
+ },
414
+ {
415
+ "epoch": 0.104,
416
+ "grad_norm": 0.3136729598045349,
417
+ "learning_rate": 0.0019841096029569044,
418
+ "loss": 5.011907348632812,
419
+ "step": 5200
420
+ },
421
+ {
422
+ "epoch": 0.106,
423
+ "grad_norm": 0.5342575311660767,
424
+ "learning_rate": 0.0019829137133412556,
425
+ "loss": 5.081852111816406,
426
+ "step": 5300
427
+ },
428
+ {
429
+ "epoch": 0.108,
430
+ "grad_norm": 0.26439738273620605,
431
+ "learning_rate": 0.001981674827895587,
432
+ "loss": 4.994610595703125,
433
+ "step": 5400
434
+ },
435
+ {
436
+ "epoch": 0.11,
437
+ "grad_norm": 0.37755730748176575,
438
+ "learning_rate": 0.00198039300081276,
439
+ "loss": 5.054569396972656,
440
+ "step": 5500
441
+ },
442
+ {
443
+ "epoch": 0.112,
444
+ "grad_norm": 0.2924644947052002,
445
+ "learning_rate": 0.0019790682881640448,
446
+ "loss": 4.945042419433594,
447
+ "step": 5600
448
+ },
449
+ {
450
+ "epoch": 0.114,
451
+ "grad_norm": 0.35851046442985535,
452
+ "learning_rate": 0.001977700747896664,
453
+ "loss": 4.959053039550781,
454
+ "step": 5700
455
+ },
456
+ {
457
+ "epoch": 0.116,
458
+ "grad_norm": 0.5607061386108398,
459
+ "learning_rate": 0.001976290439831259,
460
+ "loss": 5.00759521484375,
461
+ "step": 5800
462
+ },
463
+ {
464
+ "epoch": 0.118,
465
+ "grad_norm": 0.41018638014793396,
466
+ "learning_rate": 0.0019748374256592736,
467
+ "loss": 4.933994750976563,
468
+ "step": 5900
469
+ },
470
+ {
471
+ "epoch": 0.12,
472
+ "grad_norm": 0.28882530331611633,
473
+ "learning_rate": 0.0019733417689402543,
474
+ "loss": 5.069781799316406,
475
+ "step": 6000
476
+ },
477
+ {
478
+ "epoch": 0.12,
479
+ "eval_accuracy": 0.21534050880626224,
480
+ "eval_loss": 5.081418037414551,
481
+ "eval_runtime": 6.8091,
482
+ "eval_samples_per_second": 146.862,
483
+ "eval_steps_per_second": 18.358,
484
+ "step": 6000
485
  }
486
  ],
487
  "logging_steps": 100,