CodeIsAbstract commited on
Commit
7e24ce1
·
verified ·
1 Parent(s): bffe494

Training in progress, step 1800, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:badfbe39f8402d520d6a259ad2deb9dd7e1f6dfb6b9e1a7169877f5ecc01c510
3
  size 579748776
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:206c62db0b89449568ebdd8c25cd017d55ecb7bf6df86bab1e451b3b3fd8f88e
3
  size 579748776
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:4613374d2023ed2b9eeed79a32ef746ff946c02062fd7d42e828096eaa259890
3
  size 1159627083
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5a9af1204c1f4878c612726d1537329b4144d6b734182cd55d2c644c1a10e4b7
3
  size 1159627083
last-checkpoint/rng_state_0.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:71ed970edcf023c3a09dae82375e820aadbfb7a0861253f35a94fb8633387ad3
3
  size 14917
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5445b36fdb78ff76c2ef206d44397c5aad17f330414e24d03bab0de9bf0e9222
3
  size 14917
last-checkpoint/rng_state_1.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:ef3ace7f288164d473a0c04358ab1c2df011edbd9de5a6bde6ef84f6a044d402
3
  size 14917
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:108a89056f023268994da88aac029418224df4448adc2b0cb4d1083cb65ac2b0
3
  size 14917
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:dbe99df1134c19a237dcc24ad13c86b0959bc0c02f203c836365c9b3181e5558
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6d0f2c84615336a1d1664a4244642bd13601391ec93a4749b9c0e0cdc17433aa
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.75,
6
  "eval_steps": 100,
7
- "global_step": 1500,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -563,6 +563,117 @@
563
  "eval_samples_per_second": 64.555,
564
  "eval_steps_per_second": 2.13,
565
  "step": 1500
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
566
  }
567
  ],
568
  "logging_steps": 25,
@@ -582,7 +693,7 @@
582
  "attributes": {}
583
  }
584
  },
585
- "total_flos": 1.003336035729408e+18,
586
  "train_batch_size": 64,
587
  "trial_name": null,
588
  "trial_params": null
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.9,
6
  "eval_steps": 100,
7
+ "global_step": 1800,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
563
  "eval_samples_per_second": 64.555,
564
  "eval_steps_per_second": 2.13,
565
  "step": 1500
566
+ },
567
+ {
568
+ "epoch": 0.7625,
569
+ "grad_norm": 2972.94580078125,
570
+ "learning_rate": 1.5464406188694174e-05,
571
+ "loss": 97.7231,
572
+ "step": 1525
573
+ },
574
+ {
575
+ "epoch": 0.775,
576
+ "grad_norm": 2009.724609375,
577
+ "learning_rate": 1.3960998405293963e-05,
578
+ "loss": 97.6005,
579
+ "step": 1550
580
+ },
581
+ {
582
+ "epoch": 0.7875,
583
+ "grad_norm": 955.8128051757812,
584
+ "learning_rate": 1.2522535338666486e-05,
585
+ "loss": 97.5096,
586
+ "step": 1575
587
+ },
588
+ {
589
+ "epoch": 0.8,
590
+ "grad_norm": 1708.3966064453125,
591
+ "learning_rate": 1.1151609196484447e-05,
592
+ "loss": 97.562,
593
+ "step": 1600
594
+ },
595
+ {
596
+ "epoch": 0.8,
597
+ "eval_accuracy": 0.15179921134611404,
598
+ "eval_loss": 6.027195930480957,
599
+ "eval_runtime": 7.3648,
600
+ "eval_samples_per_second": 65.853,
601
+ "eval_steps_per_second": 2.172,
602
+ "step": 1600
603
+ },
604
+ {
605
+ "epoch": 0.8125,
606
+ "grad_norm": 249.3505096435547,
607
+ "learning_rate": 9.850690480317837e-06,
608
+ "loss": 97.4989,
609
+ "step": 1625
610
+ },
611
+ {
612
+ "epoch": 0.825,
613
+ "grad_norm": 493.7890930175781,
614
+ "learning_rate": 8.622123533623077e-06,
615
+ "loss": 97.3748,
616
+ "step": 1650
617
+ },
618
+ {
619
+ "epoch": 0.8375,
620
+ "grad_norm": 1148.812744140625,
621
+ "learning_rate": 7.468122317077786e-06,
622
+ "loss": 97.3686,
623
+ "step": 1675
624
+ },
625
+ {
626
+ "epoch": 0.85,
627
+ "grad_norm": 719.5657958984375,
628
+ "learning_rate": 6.390766418873812e-06,
629
+ "loss": 97.3206,
630
+ "step": 1700
631
+ },
632
+ {
633
+ "epoch": 0.85,
634
+ "eval_accuracy": 0.15286253086201587,
635
+ "eval_loss": 6.017110824584961,
636
+ "eval_runtime": 7.5198,
637
+ "eval_samples_per_second": 64.496,
638
+ "eval_steps_per_second": 2.128,
639
+ "step": 1700
640
+ },
641
+ {
642
+ "epoch": 0.8625,
643
+ "grad_norm": 585.3778686523438,
644
+ "learning_rate": 5.391997307158919e-06,
645
+ "loss": 97.2298,
646
+ "step": 1725
647
+ },
648
+ {
649
+ "epoch": 0.875,
650
+ "grad_norm": 2988.042236328125,
651
+ "learning_rate": 4.473614831379824e-06,
652
+ "loss": 97.108,
653
+ "step": 1750
654
+ },
655
+ {
656
+ "epoch": 0.8875,
657
+ "grad_norm": 3200.808837890625,
658
+ "learning_rate": 3.6372739788319843e-06,
659
+ "loss": 97.0287,
660
+ "step": 1775
661
+ },
662
+ {
663
+ "epoch": 0.9,
664
+ "grad_norm": 263.6023254394531,
665
+ "learning_rate": 2.88448189226046e-06,
666
+ "loss": 96.8684,
667
+ "step": 1800
668
+ },
669
+ {
670
+ "epoch": 0.9,
671
+ "eval_accuracy": 0.15323817650296123,
672
+ "eval_loss": 6.016338348388672,
673
+ "eval_runtime": 14.8413,
674
+ "eval_samples_per_second": 32.679,
675
+ "eval_steps_per_second": 1.078,
676
+ "step": 1800
677
  }
678
  ],
679
  "logging_steps": 25,
 
693
  "attributes": {}
694
  }
695
  },
696
+ "total_flos": 1.2040032428752896e+18,
697
  "train_batch_size": 64,
698
  "trial_name": null,
699
  "trial_params": null