CodeIsAbstract commited on
Commit
071a9bb
·
verified ·
1 Parent(s): 39b9316

Training in progress, step 10000, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:3a481e433fa6eac80981a2ff00a0f8f7cf3e3e08ee088dd15e950410638af8d4
3
  size 496262784
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:903447f03d58f6091e77f6c8e86618532694f7851f4bae993e86c4ce18c6f156
3
  size 496262784
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:80c48bc7e746e70fff3e665a65cbf1675701d35dc75d28205041543695987838
3
  size 992621963
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:43d16ca2f5f37c1c8859b2af1e7c37a0df1c1e053e9beab3ae0485a01ee4349e
3
  size 992621963
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:38818bd9f30dd9f6202fc8de57f60ee4722cb7b211723c490ff280c9aeccae51
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:78c70ce0d856bbf974b0d8a026254698e4f48063d82d2b6e496aefa99327d481
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:1d444c1a49dd1792c344220625a92a47a0fd68dd629b20f674d9dfda9433cfe5
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4bd014c1a4ed62bfbd75417f39dbd6d002ac8b7b9a0b143e7b7bcaa971ce4138
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.16,
6
  "eval_steps": 1000,
7
- "global_step": 8000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -640,6 +640,164 @@
640
  "eval_samples_per_second": 327.521,
641
  "eval_steps_per_second": 20.586,
642
  "step": 8000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
643
  }
644
  ],
645
  "logging_steps": 100,
@@ -659,7 +817,7 @@
659
  "attributes": {}
660
  }
661
  },
662
- "total_flos": 2.5084035072e+17,
663
  "train_batch_size": 120,
664
  "trial_name": null,
665
  "trial_params": null
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.2,
6
  "eval_steps": 1000,
7
+ "global_step": 10000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
640
  "eval_samples_per_second": 327.521,
641
  "eval_steps_per_second": 20.586,
642
  "step": 8000
643
+ },
644
+ {
645
+ "epoch": 0.162,
646
+ "grad_norm": 0.23801666498184204,
647
+ "learning_rate": 0.0005631375438337147,
648
+ "loss": 3.632862548828125,
649
+ "step": 8100
650
+ },
651
+ {
652
+ "epoch": 0.164,
653
+ "grad_norm": 0.23611237108707428,
654
+ "learning_rate": 0.0005622243281143698,
655
+ "loss": 3.6399630737304687,
656
+ "step": 8200
657
+ },
658
+ {
659
+ "epoch": 0.166,
660
+ "grad_norm": 0.23898784816265106,
661
+ "learning_rate": 0.0005613006978341218,
662
+ "loss": 3.6880291748046874,
663
+ "step": 8300
664
+ },
665
+ {
666
+ "epoch": 0.168,
667
+ "grad_norm": 0.29460519552230835,
668
+ "learning_rate": 0.0005603666896760804,
669
+ "loss": 3.7291055297851563,
670
+ "step": 8400
671
+ },
672
+ {
673
+ "epoch": 0.17,
674
+ "grad_norm": 0.2292584925889969,
675
+ "learning_rate": 0.0005594223407355256,
676
+ "loss": 3.7337985229492188,
677
+ "step": 8500
678
+ },
679
+ {
680
+ "epoch": 0.172,
681
+ "grad_norm": 0.2524070739746094,
682
+ "learning_rate": 0.0005584676885184341,
683
+ "loss": 3.7386798095703124,
684
+ "step": 8600
685
+ },
686
+ {
687
+ "epoch": 0.174,
688
+ "grad_norm": 0.25900545716285706,
689
+ "learning_rate": 0.0005575027709399899,
690
+ "loss": 3.7031732177734376,
691
+ "step": 8700
692
+ },
693
+ {
694
+ "epoch": 0.176,
695
+ "grad_norm": 0.22311732172966003,
696
+ "learning_rate": 0.0005565276263230785,
697
+ "loss": 3.71237060546875,
698
+ "step": 8800
699
+ },
700
+ {
701
+ "epoch": 0.178,
702
+ "grad_norm": 0.23083606362342834,
703
+ "learning_rate": 0.0005555422933967647,
704
+ "loss": 3.6988143920898438,
705
+ "step": 8900
706
+ },
707
+ {
708
+ "epoch": 0.18,
709
+ "grad_norm": 0.23646661639213562,
710
+ "learning_rate": 0.0005545468112947544,
711
+ "loss": 3.692724609375,
712
+ "step": 9000
713
+ },
714
+ {
715
+ "epoch": 0.18,
716
+ "eval_accuracy": 0.3474917099443364,
717
+ "eval_loss": 3.6365442276000977,
718
+ "eval_runtime": 5.728,
719
+ "eval_samples_per_second": 338.859,
720
+ "eval_steps_per_second": 21.299,
721
+ "step": 9000
722
+ },
723
+ {
724
+ "epoch": 0.182,
725
+ "grad_norm": 0.2665349841117859,
726
+ "learning_rate": 0.0005535412195538409,
727
+ "loss": 3.683785400390625,
728
+ "step": 9100
729
+ },
730
+ {
731
+ "epoch": 0.184,
732
+ "grad_norm": 0.22817476093769073,
733
+ "learning_rate": 0.0005525255581123336,
734
+ "loss": 3.6991543579101562,
735
+ "step": 9200
736
+ },
737
+ {
738
+ "epoch": 0.186,
739
+ "grad_norm": 0.2592155635356903,
740
+ "learning_rate": 0.000551499867308473,
741
+ "loss": 3.6590890502929687,
742
+ "step": 9300
743
+ },
744
+ {
745
+ "epoch": 0.188,
746
+ "grad_norm": 0.24686357378959656,
747
+ "learning_rate": 0.0005504641878788275,
748
+ "loss": 3.6509600830078126,
749
+ "step": 9400
750
+ },
751
+ {
752
+ "epoch": 0.19,
753
+ "grad_norm": 0.22637774050235748,
754
+ "learning_rate": 0.0005494185609566764,
755
+ "loss": 3.666563720703125,
756
+ "step": 9500
757
+ },
758
+ {
759
+ "epoch": 0.192,
760
+ "grad_norm": 0.21554476022720337,
761
+ "learning_rate": 0.0005483630280703757,
762
+ "loss": 3.6956219482421875,
763
+ "step": 9600
764
+ },
765
+ {
766
+ "epoch": 0.194,
767
+ "grad_norm": 0.2128387987613678,
768
+ "learning_rate": 0.0005472976311417091,
769
+ "loss": 3.661249084472656,
770
+ "step": 9700
771
+ },
772
+ {
773
+ "epoch": 0.196,
774
+ "grad_norm": 0.21794714033603668,
775
+ "learning_rate": 0.0005462224124842225,
776
+ "loss": 3.6454119873046875,
777
+ "step": 9800
778
+ },
779
+ {
780
+ "epoch": 0.198,
781
+ "grad_norm": 0.23011332750320435,
782
+ "learning_rate": 0.0005451374148015441,
783
+ "loss": 3.6472012329101564,
784
+ "step": 9900
785
+ },
786
+ {
787
+ "epoch": 0.2,
788
+ "grad_norm": 0.21280302107334137,
789
+ "learning_rate": 0.0005440426811856883,
790
+ "loss": 3.6411611938476565,
791
+ "step": 10000
792
+ },
793
+ {
794
+ "epoch": 0.2,
795
+ "eval_accuracy": 0.3510436547424966,
796
+ "eval_loss": 3.6030726432800293,
797
+ "eval_runtime": 5.6604,
798
+ "eval_samples_per_second": 342.906,
799
+ "eval_steps_per_second": 21.553,
800
+ "step": 10000
801
  }
802
  ],
803
  "logging_steps": 100,
 
817
  "attributes": {}
818
  }
819
  },
820
+ "total_flos": 3.135504384e+17,
821
  "train_batch_size": 120,
822
  "trial_name": null,
823
  "trial_params": null