CodeIsAbstract commited on
Commit
64459af
·
verified ·
1 Parent(s): 633b1a6

Training in progress, step 8000, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:779a82879b0841465ca1b858d82cac1e88868b011b357cbb5ae641bc4467a2fd
3
  size 469337272
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:052a390e625610a7e9eaa7423d1c31c35602d2615d5245b32002114116020de5
3
  size 469337272
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:2fd40a78565e4f7ddfb41d95ac5573fea5bc25afd2bad35a7bf584b0f9012d4d
3
  size 938825803
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4d82aee273e77605d0f5c6624f80e753f1fd61c733b21927f56600da1789fdb6
3
  size 938825803
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:5e8e748d681e6f71f9b57ae68d6afe316f465cbd0f520ceb97f2e75d98b46b73
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3482ff4d448b35418681eb31100e133b6dd964f5bb4c2c9eca6680b10bd0977e
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:0b3af4aaa142e4a55ebe50a8d2db120dc2b7b23b5e6bb84de2f69f7d1627803e
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:11829097af6776cbee61b048d98aace8148b1dc770060a280833ccf8b49be52d
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.03636363636363636,
6
  "eval_steps": 1000,
7
- "global_step": 4000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -320,6 +320,318 @@
320
  "eval_samples_per_second": 84.704,
321
  "eval_steps_per_second": 21.176,
322
  "step": 4000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
323
  }
324
  ],
325
  "logging_steps": 100,
@@ -339,7 +651,7 @@
339
  "attributes": {}
340
  }
341
  },
342
- "total_flos": 9.9658323984384e+16,
343
  "train_batch_size": 22,
344
  "trial_name": null,
345
  "trial_params": null
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.07272727272727272,
6
  "eval_steps": 1000,
7
+ "global_step": 8000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
320
  "eval_samples_per_second": 84.704,
321
  "eval_steps_per_second": 21.176,
322
  "step": 4000
323
+ },
324
+ {
325
+ "epoch": 0.03727272727272727,
326
+ "grad_norm": 0.2137739211320877,
327
+ "learning_rate": 0.000996814686090343,
328
+ "loss": 3.288787841796875,
329
+ "step": 4100
330
+ },
331
+ {
332
+ "epoch": 0.038181818181818185,
333
+ "grad_norm": 0.20396745204925537,
334
+ "learning_rate": 0.0009966515035386867,
335
+ "loss": 3.277693786621094,
336
+ "step": 4200
337
+ },
338
+ {
339
+ "epoch": 0.03909090909090909,
340
+ "grad_norm": 0.20048071444034576,
341
+ "learning_rate": 0.0009964842588826267,
342
+ "loss": 3.2614068603515625,
343
+ "step": 4300
344
+ },
345
+ {
346
+ "epoch": 0.04,
347
+ "grad_norm": 0.2545357346534729,
348
+ "learning_rate": 0.0009963129534900535,
349
+ "loss": 3.241942138671875,
350
+ "step": 4400
351
+ },
352
+ {
353
+ "epoch": 0.04090909090909091,
354
+ "grad_norm": 0.21150407195091248,
355
+ "learning_rate": 0.0009961375887620715,
356
+ "loss": 3.254181213378906,
357
+ "step": 4500
358
+ },
359
+ {
360
+ "epoch": 0.04181818181818182,
361
+ "grad_norm": 0.25913697481155396,
362
+ "learning_rate": 0.0009959581661329855,
363
+ "loss": 3.256631164550781,
364
+ "step": 4600
365
+ },
366
+ {
367
+ "epoch": 0.042727272727272725,
368
+ "grad_norm": 0.21662315726280212,
369
+ "learning_rate": 0.000995774687070291,
370
+ "loss": 3.246457214355469,
371
+ "step": 4700
372
+ },
373
+ {
374
+ "epoch": 0.04363636363636364,
375
+ "grad_norm": 0.21578437089920044,
376
+ "learning_rate": 0.0009955871530746593,
377
+ "loss": 3.2591009521484375,
378
+ "step": 4800
379
+ },
380
+ {
381
+ "epoch": 0.04454545454545455,
382
+ "grad_norm": 0.2277086228132248,
383
+ "learning_rate": 0.0009953955656799285,
384
+ "loss": 3.2139767456054686,
385
+ "step": 4900
386
+ },
387
+ {
388
+ "epoch": 0.045454545454545456,
389
+ "grad_norm": 0.21145710349082947,
390
+ "learning_rate": 0.0009951999264530885,
391
+ "loss": 3.217757263183594,
392
+ "step": 5000
393
+ },
394
+ {
395
+ "epoch": 0.045454545454545456,
396
+ "eval_loss": 3.559657573699951,
397
+ "eval_runtime": 6.8094,
398
+ "eval_samples_per_second": 84.589,
399
+ "eval_steps_per_second": 21.147,
400
+ "step": 5000
401
+ },
402
+ {
403
+ "epoch": 0.046363636363636364,
404
+ "grad_norm": 0.2059008628129959,
405
+ "learning_rate": 0.0009950002369942693,
406
+ "loss": 3.2310595703125,
407
+ "step": 5100
408
+ },
409
+ {
410
+ "epoch": 0.04727272727272727,
411
+ "grad_norm": 0.31273841857910156,
412
+ "learning_rate": 0.0009947964989367275,
413
+ "loss": 3.236092529296875,
414
+ "step": 5200
415
+ },
416
+ {
417
+ "epoch": 0.04818181818181818,
418
+ "grad_norm": 0.20427817106246948,
419
+ "learning_rate": 0.0009945887139468335,
420
+ "loss": 3.20990966796875,
421
+ "step": 5300
422
+ },
423
+ {
424
+ "epoch": 0.04909090909090909,
425
+ "grad_norm": 0.21813584864139557,
426
+ "learning_rate": 0.0009943768837240572,
427
+ "loss": 3.23782470703125,
428
+ "step": 5400
429
+ },
430
+ {
431
+ "epoch": 0.05,
432
+ "grad_norm": 0.21357640624046326,
433
+ "learning_rate": 0.0009941610100009546,
434
+ "loss": 3.2014178466796874,
435
+ "step": 5500
436
+ },
437
+ {
438
+ "epoch": 0.05090909090909091,
439
+ "grad_norm": 0.19788503646850586,
440
+ "learning_rate": 0.0009939410945431532,
441
+ "loss": 3.201743469238281,
442
+ "step": 5600
443
+ },
444
+ {
445
+ "epoch": 0.05181818181818182,
446
+ "grad_norm": 0.2109798789024353,
447
+ "learning_rate": 0.0009937171391493375,
448
+ "loss": 3.1780130004882814,
449
+ "step": 5700
450
+ },
451
+ {
452
+ "epoch": 0.05272727272727273,
453
+ "grad_norm": 0.1952320784330368,
454
+ "learning_rate": 0.0009934891456512356,
455
+ "loss": 3.1811758422851564,
456
+ "step": 5800
457
+ },
458
+ {
459
+ "epoch": 0.053636363636363635,
460
+ "grad_norm": 0.19197046756744385,
461
+ "learning_rate": 0.0009932571159136023,
462
+ "loss": 3.1767172241210937,
463
+ "step": 5900
464
+ },
465
+ {
466
+ "epoch": 0.05454545454545454,
467
+ "grad_norm": 0.20798423886299133,
468
+ "learning_rate": 0.0009930210518342049,
469
+ "loss": 3.1700228881835937,
470
+ "step": 6000
471
+ },
472
+ {
473
+ "epoch": 0.05454545454545454,
474
+ "eval_loss": 3.494601249694824,
475
+ "eval_runtime": 6.8416,
476
+ "eval_samples_per_second": 84.191,
477
+ "eval_steps_per_second": 21.048,
478
+ "step": 6000
479
+ },
480
+ {
481
+ "epoch": 0.05545454545454546,
482
+ "grad_norm": 0.18669773638248444,
483
+ "learning_rate": 0.0009927809553438077,
484
+ "loss": 3.1545779418945314,
485
+ "step": 6100
486
+ },
487
+ {
488
+ "epoch": 0.056363636363636366,
489
+ "grad_norm": 0.2077275514602661,
490
+ "learning_rate": 0.0009925368284061555,
491
+ "loss": 3.160372619628906,
492
+ "step": 6200
493
+ },
494
+ {
495
+ "epoch": 0.057272727272727274,
496
+ "grad_norm": 0.18006086349487305,
497
+ "learning_rate": 0.000992288673017959,
498
+ "loss": 3.1383782958984376,
499
+ "step": 6300
500
+ },
501
+ {
502
+ "epoch": 0.05818181818181818,
503
+ "grad_norm": 0.19835108518600464,
504
+ "learning_rate": 0.000992036491208877,
505
+ "loss": 3.15177001953125,
506
+ "step": 6400
507
+ },
508
+ {
509
+ "epoch": 0.05909090909090909,
510
+ "grad_norm": 0.19680027663707733,
511
+ "learning_rate": 0.0009917802850414998,
512
+ "loss": 3.16474365234375,
513
+ "step": 6500
514
+ },
515
+ {
516
+ "epoch": 0.06,
517
+ "grad_norm": 0.28204840421676636,
518
+ "learning_rate": 0.0009915200566113338,
519
+ "loss": 3.1483929443359373,
520
+ "step": 6600
521
+ },
522
+ {
523
+ "epoch": 0.060909090909090906,
524
+ "grad_norm": 0.18320120871067047,
525
+ "learning_rate": 0.000991255808046783,
526
+ "loss": 3.150434875488281,
527
+ "step": 6700
528
+ },
529
+ {
530
+ "epoch": 0.06181818181818182,
531
+ "grad_norm": 0.19188480079174042,
532
+ "learning_rate": 0.000990987541509132,
533
+ "loss": 3.118103332519531,
534
+ "step": 6800
535
+ },
536
+ {
537
+ "epoch": 0.06272727272727273,
538
+ "grad_norm": 0.1749107539653778,
539
+ "learning_rate": 0.0009907152591925282,
540
+ "loss": 3.1161154174804686,
541
+ "step": 6900
542
+ },
543
+ {
544
+ "epoch": 0.06363636363636363,
545
+ "grad_norm": 0.17627771198749542,
546
+ "learning_rate": 0.0009904389633239644,
547
+ "loss": 3.140033874511719,
548
+ "step": 7000
549
+ },
550
+ {
551
+ "epoch": 0.06363636363636363,
552
+ "eval_loss": 3.460543632507324,
553
+ "eval_runtime": 6.8262,
554
+ "eval_samples_per_second": 84.381,
555
+ "eval_steps_per_second": 21.095,
556
+ "step": 7000
557
+ },
558
+ {
559
+ "epoch": 0.06454545454545454,
560
+ "grad_norm": 0.19298093020915985,
561
+ "learning_rate": 0.0009901586561632597,
562
+ "loss": 3.1127783203125,
563
+ "step": 7100
564
+ },
565
+ {
566
+ "epoch": 0.06545454545454546,
567
+ "grad_norm": 0.2005312442779541,
568
+ "learning_rate": 0.0009898743400030417,
569
+ "loss": 3.131772155761719,
570
+ "step": 7200
571
+ },
572
+ {
573
+ "epoch": 0.06636363636363636,
574
+ "grad_norm": 0.20932316780090332,
575
+ "learning_rate": 0.0009895860171687276,
576
+ "loss": 3.1065127563476564,
577
+ "step": 7300
578
+ },
579
+ {
580
+ "epoch": 0.06727272727272728,
581
+ "grad_norm": 0.1870882213115692,
582
+ "learning_rate": 0.0009892936900185053,
583
+ "loss": 3.1155380249023437,
584
+ "step": 7400
585
+ },
586
+ {
587
+ "epoch": 0.06818181818181818,
588
+ "grad_norm": 0.18347717821598053,
589
+ "learning_rate": 0.0009889973609433136,
590
+ "loss": 3.094842529296875,
591
+ "step": 7500
592
+ },
593
+ {
594
+ "epoch": 0.06909090909090909,
595
+ "grad_norm": 0.20144793391227722,
596
+ "learning_rate": 0.000988697032366823,
597
+ "loss": 3.1140432739257813,
598
+ "step": 7600
599
+ },
600
+ {
601
+ "epoch": 0.07,
602
+ "grad_norm": 0.17255835235118866,
603
+ "learning_rate": 0.0009883927067454157,
604
+ "loss": 3.0936923217773438,
605
+ "step": 7700
606
+ },
607
+ {
608
+ "epoch": 0.07090909090909091,
609
+ "grad_norm": 0.19149735569953918,
610
+ "learning_rate": 0.0009880843865681666,
611
+ "loss": 3.0889437866210936,
612
+ "step": 7800
613
+ },
614
+ {
615
+ "epoch": 0.07181818181818182,
616
+ "grad_norm": 0.18358978629112244,
617
+ "learning_rate": 0.0009877720743568204,
618
+ "loss": 3.0625601196289063,
619
+ "step": 7900
620
+ },
621
+ {
622
+ "epoch": 0.07272727272727272,
623
+ "grad_norm": 0.16700264811515808,
624
+ "learning_rate": 0.0009874557726657744,
625
+ "loss": 3.0754776000976562,
626
+ "step": 8000
627
+ },
628
+ {
629
+ "epoch": 0.07272727272727272,
630
+ "eval_loss": 3.418283700942993,
631
+ "eval_runtime": 6.8139,
632
+ "eval_samples_per_second": 84.533,
633
+ "eval_steps_per_second": 21.133,
634
+ "step": 8000
635
  }
636
  ],
637
  "logging_steps": 100,
 
651
  "attributes": {}
652
  }
653
  },
654
+ "total_flos": 1.99316647968768e+17,
655
  "train_batch_size": 22,
656
  "trial_name": null,
657
  "trial_params": null