CodeIsAbstract commited on
Commit
a03e342
·
verified ·
1 Parent(s): 27d39c2

Training in progress, step 10000, checkpoint

Browse files
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:fd74e6589d3e456165c757752a4ea537b0dce0f12a9239822f8f0b87e6fcab08
3
  size 1442699
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:de0e6e5db5288feee0fefc4357eafb906c01848da238f0f1b9aac0e997510dec
3
  size 1442699
last-checkpoint/pytorch_model.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:5c0b03c00b2afb37434503ce30b41dc6f4cc779bf2123b15db0c1a37a46bde51
3
  size 499774435
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:644b3d86f34c31a15e3fe76473fa14f4c704b8d59e60d78e4d6f10a6e753b1b8
3
  size 499774435
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:6b43fdf0f4b166ccbde53eac22fd3e3b4db7ae9dc053939b2b5bbebd405317f8
3
  size 14455
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:86bc1651483ec7d90230200f2b53b997a19bb41b19e2710e0f81a67f62f0b352
3
  size 14455
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:e9567d76a2efaa946d19913fd9fe6f6f70f6f7101d7dcb8866c09743534f2d4d
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:833776bf99a0597a4bf38df86be38e8ac151736eba1d084c9cbb84cab1caf4e9
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.16,
6
  "eval_steps": 1000,
7
- "global_step": 8000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -640,6 +640,164 @@
640
  "eval_samples_per_second": 145.531,
641
  "eval_steps_per_second": 18.191,
642
  "step": 8000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
643
  }
644
  ],
645
  "logging_steps": 100,
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.2,
6
  "eval_steps": 1000,
7
+ "global_step": 10000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
640
  "eval_samples_per_second": 145.531,
641
  "eval_steps_per_second": 18.191,
642
  "step": 8000
643
+ },
644
+ {
645
+ "epoch": 0.162,
646
+ "grad_norm": 0.712541401386261,
647
+ "learning_rate": 0.0019322148017972016,
648
+ "loss": 4.847081909179687,
649
+ "step": 8100
650
+ },
651
+ {
652
+ "epoch": 0.164,
653
+ "grad_norm": 0.47257572412490845,
654
+ "learning_rate": 0.001929800831168135,
655
+ "loss": 4.90064453125,
656
+ "step": 8200
657
+ },
658
+ {
659
+ "epoch": 0.166,
660
+ "grad_norm": 0.3497978150844574,
661
+ "learning_rate": 0.001927346188038576,
662
+ "loss": 4.955650329589844,
663
+ "step": 8300
664
+ },
665
+ {
666
+ "epoch": 0.168,
667
+ "grad_norm": 0.3204037845134735,
668
+ "learning_rate": 0.0019248509797825672,
669
+ "loss": 4.851766967773438,
670
+ "step": 8400
671
+ },
672
+ {
673
+ "epoch": 0.17,
674
+ "grad_norm": 0.3258970379829407,
675
+ "learning_rate": 0.0019223153155486009,
676
+ "loss": 4.883788452148438,
677
+ "step": 8500
678
+ },
679
+ {
680
+ "epoch": 0.172,
681
+ "grad_norm": 0.4524133503437042,
682
+ "learning_rate": 0.0019197393062548454,
683
+ "loss": 4.840924682617188,
684
+ "step": 8600
685
+ },
686
+ {
687
+ "epoch": 0.174,
688
+ "grad_norm": 0.28501275181770325,
689
+ "learning_rate": 0.0019171230645842923,
690
+ "loss": 4.877713317871094,
691
+ "step": 8700
692
+ },
693
+ {
694
+ "epoch": 0.176,
695
+ "grad_norm": 0.4920591711997986,
696
+ "learning_rate": 0.0019144667049798272,
697
+ "loss": 4.900206298828125,
698
+ "step": 8800
699
+ },
700
+ {
701
+ "epoch": 0.178,
702
+ "grad_norm": 0.30207598209381104,
703
+ "learning_rate": 0.0019117703436392253,
704
+ "loss": 4.907836303710938,
705
+ "step": 8900
706
+ },
707
+ {
708
+ "epoch": 0.18,
709
+ "grad_norm": 0.3460649251937866,
710
+ "learning_rate": 0.001909034098510066,
711
+ "loss": 4.8303515625,
712
+ "step": 9000
713
+ },
714
+ {
715
+ "epoch": 0.18,
716
+ "eval_accuracy": 0.22981996086105674,
717
+ "eval_loss": 4.851044178009033,
718
+ "eval_runtime": 6.9243,
719
+ "eval_samples_per_second": 144.418,
720
+ "eval_steps_per_second": 18.052,
721
+ "step": 9000
722
+ },
723
+ {
724
+ "epoch": 0.182,
725
+ "grad_norm": 0.26366087794303894,
726
+ "learning_rate": 0.001906258089284576,
727
+ "loss": 4.757725524902344,
728
+ "step": 9100
729
+ },
730
+ {
731
+ "epoch": 0.184,
732
+ "grad_norm": 0.3308315873146057,
733
+ "learning_rate": 0.0019034424373943915,
734
+ "loss": 4.747350769042969,
735
+ "step": 9200
736
+ },
737
+ {
738
+ "epoch": 0.186,
739
+ "grad_norm": 0.24568253755569458,
740
+ "learning_rate": 0.0019005872660052478,
741
+ "loss": 4.785510559082031,
742
+ "step": 9300
743
+ },
744
+ {
745
+ "epoch": 0.188,
746
+ "grad_norm": 0.43289270997047424,
747
+ "learning_rate": 0.001897692700011591,
748
+ "loss": 4.789692687988281,
749
+ "step": 9400
750
+ },
751
+ {
752
+ "epoch": 0.19,
753
+ "grad_norm": 0.25019797682762146,
754
+ "learning_rate": 0.0018947588660311143,
755
+ "loss": 4.792172241210937,
756
+ "step": 9500
757
+ },
758
+ {
759
+ "epoch": 0.192,
760
+ "grad_norm": 0.6229330897331238,
761
+ "learning_rate": 0.0018917858923992211,
762
+ "loss": 4.777132873535156,
763
+ "step": 9600
764
+ },
765
+ {
766
+ "epoch": 0.194,
767
+ "grad_norm": 0.350772500038147,
768
+ "learning_rate": 0.0018887739091634085,
769
+ "loss": 4.744659423828125,
770
+ "step": 9700
771
+ },
772
+ {
773
+ "epoch": 0.196,
774
+ "grad_norm": 0.23172135651111603,
775
+ "learning_rate": 0.0018857230480775807,
776
+ "loss": 4.748968811035156,
777
+ "step": 9800
778
+ },
779
+ {
780
+ "epoch": 0.198,
781
+ "grad_norm": 0.3821462392807007,
782
+ "learning_rate": 0.0018826334425962855,
783
+ "loss": 4.802294616699219,
784
+ "step": 9900
785
+ },
786
+ {
787
+ "epoch": 0.2,
788
+ "grad_norm": 0.2725774645805359,
789
+ "learning_rate": 0.0018795052278688753,
790
+ "loss": 4.774011535644531,
791
+ "step": 10000
792
+ },
793
+ {
794
+ "epoch": 0.2,
795
+ "eval_accuracy": 0.23221135029354206,
796
+ "eval_loss": 4.819427967071533,
797
+ "eval_runtime": 6.9031,
798
+ "eval_samples_per_second": 144.863,
799
+ "eval_steps_per_second": 18.108,
800
+ "step": 10000
801
  }
802
  ],
803
  "logging_steps": 100,