CodeIsAbstract commited on
Commit
e6e723a
·
verified ·
1 Parent(s): 7b47e48

Training in progress, step 12000, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:052a390e625610a7e9eaa7423d1c31c35602d2615d5245b32002114116020de5
3
  size 469337272
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4eda0e89aa4d3d282525d77c55d3bb3bc455baed6788b7932726886a4fec8d9d
3
  size 469337272
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:4d82aee273e77605d0f5c6624f80e753f1fd61c733b21927f56600da1789fdb6
3
  size 938825803
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1edb7194df3a9589c4165f828399d05a5b3aae13f4977bb578f5509f2695427b
3
  size 938825803
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:3482ff4d448b35418681eb31100e133b6dd964f5bb4c2c9eca6680b10bd0977e
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2c47bf8207ce24fd1d44b017f106d799e41cb97bfb17f06383eccd30d2f40350
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:11829097af6776cbee61b048d98aace8148b1dc770060a280833ccf8b49be52d
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:54283825bf988fc504a674e83415482fb216062ac68ed73b527e8f8eb54d9eec
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.07272727272727272,
6
  "eval_steps": 1000,
7
- "global_step": 8000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -632,6 +632,318 @@
632
  "eval_samples_per_second": 84.533,
633
  "eval_steps_per_second": 21.133,
634
  "step": 8000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
635
  }
636
  ],
637
  "logging_steps": 100,
@@ -651,7 +963,7 @@
651
  "attributes": {}
652
  }
653
  },
654
- "total_flos": 1.99316647968768e+17,
655
  "train_batch_size": 22,
656
  "trial_name": null,
657
  "trial_params": null
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.10909090909090909,
6
  "eval_steps": 1000,
7
+ "global_step": 12000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
632
  "eval_samples_per_second": 84.533,
633
  "eval_steps_per_second": 21.133,
634
  "step": 8000
635
+ },
636
+ {
637
+ "epoch": 0.07363636363636364,
638
+ "grad_norm": 0.18711890280246735,
639
+ "learning_rate": 0.0009871354840820543,
640
+ "loss": 3.0751129150390626,
641
+ "step": 8100
642
+ },
643
+ {
644
+ "epoch": 0.07454545454545454,
645
+ "grad_norm": 0.19081872701644897,
646
+ "learning_rate": 0.0009868112112252953,
647
+ "loss": 3.069129638671875,
648
+ "step": 8200
649
+ },
650
+ {
651
+ "epoch": 0.07545454545454545,
652
+ "grad_norm": 0.18380340933799744,
653
+ "learning_rate": 0.0009864829567477196,
654
+ "loss": 3.0967727661132813,
655
+ "step": 8300
656
+ },
657
+ {
658
+ "epoch": 0.07636363636363637,
659
+ "grad_norm": 0.1662234514951706,
660
+ "learning_rate": 0.0009861507233341154,
661
+ "loss": 3.0465274047851563,
662
+ "step": 8400
663
+ },
664
+ {
665
+ "epoch": 0.07727272727272727,
666
+ "grad_norm": 0.1769150197505951,
667
+ "learning_rate": 0.0009858145137018137,
668
+ "loss": 3.05833251953125,
669
+ "step": 8500
670
+ },
671
+ {
672
+ "epoch": 0.07818181818181819,
673
+ "grad_norm": 0.18805448710918427,
674
+ "learning_rate": 0.0009854743306006682,
675
+ "loss": 3.0252114868164064,
676
+ "step": 8600
677
+ },
678
+ {
679
+ "epoch": 0.07909090909090909,
680
+ "grad_norm": 0.18553867936134338,
681
+ "learning_rate": 0.0009851301768130304,
682
+ "loss": 3.0619546508789064,
683
+ "step": 8700
684
+ },
685
+ {
686
+ "epoch": 0.08,
687
+ "grad_norm": 0.18448372185230255,
688
+ "learning_rate": 0.0009847820551537288,
689
+ "loss": 3.076944580078125,
690
+ "step": 8800
691
+ },
692
+ {
693
+ "epoch": 0.0809090909090909,
694
+ "grad_norm": 0.18073825538158417,
695
+ "learning_rate": 0.0009844299684700442,
696
+ "loss": 3.04953857421875,
697
+ "step": 8900
698
+ },
699
+ {
700
+ "epoch": 0.08181818181818182,
701
+ "grad_norm": 0.18676605820655823,
702
+ "learning_rate": 0.000984073919641688,
703
+ "loss": 3.052662658691406,
704
+ "step": 9000
705
+ },
706
+ {
707
+ "epoch": 0.08181818181818182,
708
+ "eval_loss": 3.390735626220703,
709
+ "eval_runtime": 6.8573,
710
+ "eval_samples_per_second": 83.999,
711
+ "eval_steps_per_second": 21.0,
712
+ "step": 9000
713
+ },
714
+ {
715
+ "epoch": 0.08272727272727273,
716
+ "grad_norm": 0.1843118667602539,
717
+ "learning_rate": 0.0009837139115807777,
718
+ "loss": 3.0578955078125,
719
+ "step": 9100
720
+ },
721
+ {
722
+ "epoch": 0.08363636363636363,
723
+ "grad_norm": 0.1908266246318817,
724
+ "learning_rate": 0.0009833499472318129,
725
+ "loss": 3.0461907958984376,
726
+ "step": 9200
727
+ },
728
+ {
729
+ "epoch": 0.08454545454545455,
730
+ "grad_norm": 0.17415334284305573,
731
+ "learning_rate": 0.0009829820295716525,
732
+ "loss": 3.0242233276367188,
733
+ "step": 9300
734
+ },
735
+ {
736
+ "epoch": 0.08545454545454545,
737
+ "grad_norm": 0.161512091755867,
738
+ "learning_rate": 0.0009826101616094885,
739
+ "loss": 3.06851806640625,
740
+ "step": 9400
741
+ },
742
+ {
743
+ "epoch": 0.08636363636363636,
744
+ "grad_norm": 0.17435242235660553,
745
+ "learning_rate": 0.000982234346386823,
746
+ "loss": 3.04041015625,
747
+ "step": 9500
748
+ },
749
+ {
750
+ "epoch": 0.08727272727272728,
751
+ "grad_norm": 0.17635726928710938,
752
+ "learning_rate": 0.0009818545869774427,
753
+ "loss": 3.0322161865234376,
754
+ "step": 9600
755
+ },
756
+ {
757
+ "epoch": 0.08818181818181818,
758
+ "grad_norm": 0.19083574414253235,
759
+ "learning_rate": 0.000981470886487393,
760
+ "loss": 3.0362371826171874,
761
+ "step": 9700
762
+ },
763
+ {
764
+ "epoch": 0.0890909090909091,
765
+ "grad_norm": 0.1669977903366089,
766
+ "learning_rate": 0.000981083248054954,
767
+ "loss": 3.0415472412109374,
768
+ "step": 9800
769
+ },
770
+ {
771
+ "epoch": 0.09,
772
+ "grad_norm": 0.1624830961227417,
773
+ "learning_rate": 0.000980691674850614,
774
+ "loss": 3.03228271484375,
775
+ "step": 9900
776
+ },
777
+ {
778
+ "epoch": 0.09090909090909091,
779
+ "grad_norm": 0.20320835709571838,
780
+ "learning_rate": 0.000980296170077044,
781
+ "loss": 3.0213031005859374,
782
+ "step": 10000
783
+ },
784
+ {
785
+ "epoch": 0.09090909090909091,
786
+ "eval_loss": 3.3655972480773926,
787
+ "eval_runtime": 6.8194,
788
+ "eval_samples_per_second": 84.465,
789
+ "eval_steps_per_second": 21.116,
790
+ "step": 10000
791
+ },
792
+ {
793
+ "epoch": 0.09181818181818181,
794
+ "grad_norm": 0.1716221123933792,
795
+ "learning_rate": 0.000979896736969071,
796
+ "loss": 3.018829345703125,
797
+ "step": 10100
798
+ },
799
+ {
800
+ "epoch": 0.09272727272727273,
801
+ "grad_norm": 0.18420584499835968,
802
+ "learning_rate": 0.0009794933787936513,
803
+ "loss": 3.0364111328125,
804
+ "step": 10200
805
+ },
806
+ {
807
+ "epoch": 0.09363636363636364,
808
+ "grad_norm": 0.16853921115398407,
809
+ "learning_rate": 0.000979086098849845,
810
+ "loss": 2.9975177001953126,
811
+ "step": 10300
812
+ },
813
+ {
814
+ "epoch": 0.09454545454545454,
815
+ "grad_norm": 0.17749086022377014,
816
+ "learning_rate": 0.000978674900468788,
817
+ "loss": 3.025662536621094,
818
+ "step": 10400
819
+ },
820
+ {
821
+ "epoch": 0.09545454545454546,
822
+ "grad_norm": 0.17817527055740356,
823
+ "learning_rate": 0.0009782597870136652,
824
+ "loss": 3.0068899536132814,
825
+ "step": 10500
826
+ },
827
+ {
828
+ "epoch": 0.09636363636363636,
829
+ "grad_norm": 0.16383598744869232,
830
+ "learning_rate": 0.0009778407618796824,
831
+ "loss": 2.9598651123046875,
832
+ "step": 10600
833
+ },
834
+ {
835
+ "epoch": 0.09727272727272727,
836
+ "grad_norm": 0.18420074880123138,
837
+ "learning_rate": 0.0009774178284940392,
838
+ "loss": 2.9876394653320313,
839
+ "step": 10700
840
+ },
841
+ {
842
+ "epoch": 0.09818181818181818,
843
+ "grad_norm": 0.16747510433197021,
844
+ "learning_rate": 0.0009769909903159007,
845
+ "loss": 3.0132855224609374,
846
+ "step": 10800
847
+ },
848
+ {
849
+ "epoch": 0.09909090909090909,
850
+ "grad_norm": 0.15621648728847504,
851
+ "learning_rate": 0.0009765602508363697,
852
+ "loss": 3.0095565795898436,
853
+ "step": 10900
854
+ },
855
+ {
856
+ "epoch": 0.1,
857
+ "grad_norm": 0.1697891354560852,
858
+ "learning_rate": 0.0009761256135784568,
859
+ "loss": 3.0590411376953126,
860
+ "step": 11000
861
+ },
862
+ {
863
+ "epoch": 0.1,
864
+ "eval_loss": 3.3478543758392334,
865
+ "eval_runtime": 6.8379,
866
+ "eval_samples_per_second": 84.236,
867
+ "eval_steps_per_second": 21.059,
868
+ "step": 11000
869
+ },
870
+ {
871
+ "epoch": 0.1009090909090909,
872
+ "grad_norm": 0.15818284451961517,
873
+ "learning_rate": 0.0009756870820970532,
874
+ "loss": 3.015447692871094,
875
+ "step": 11100
876
+ },
877
+ {
878
+ "epoch": 0.10181818181818182,
879
+ "grad_norm": 0.16059984266757965,
880
+ "learning_rate": 0.0009752446599789003,
881
+ "loss": 2.9939862060546876,
882
+ "step": 11200
883
+ },
884
+ {
885
+ "epoch": 0.10272727272727272,
886
+ "grad_norm": 0.16179029643535614,
887
+ "learning_rate": 0.0009747983508425615,
888
+ "loss": 2.989024963378906,
889
+ "step": 11300
890
+ },
891
+ {
892
+ "epoch": 0.10363636363636364,
893
+ "grad_norm": 0.16419965028762817,
894
+ "learning_rate": 0.0009743481583383919,
895
+ "loss": 2.9855859375,
896
+ "step": 11400
897
+ },
898
+ {
899
+ "epoch": 0.10454545454545454,
900
+ "grad_norm": 0.17154866456985474,
901
+ "learning_rate": 0.0009738940861485082,
902
+ "loss": 2.9723300170898437,
903
+ "step": 11500
904
+ },
905
+ {
906
+ "epoch": 0.10545454545454545,
907
+ "grad_norm": 0.16613702476024628,
908
+ "learning_rate": 0.0009734361379867597,
909
+ "loss": 3.022707214355469,
910
+ "step": 11600
911
+ },
912
+ {
913
+ "epoch": 0.10636363636363637,
914
+ "grad_norm": 0.16711774468421936,
915
+ "learning_rate": 0.0009729743175986965,
916
+ "loss": 2.99096923828125,
917
+ "step": 11700
918
+ },
919
+ {
920
+ "epoch": 0.10727272727272727,
921
+ "grad_norm": 0.16586251556873322,
922
+ "learning_rate": 0.00097250862876154,
923
+ "loss": 2.977761535644531,
924
+ "step": 11800
925
+ },
926
+ {
927
+ "epoch": 0.10818181818181818,
928
+ "grad_norm": 0.1719771921634674,
929
+ "learning_rate": 0.0009720390752841515,
930
+ "loss": 2.97351318359375,
931
+ "step": 11900
932
+ },
933
+ {
934
+ "epoch": 0.10909090909090909,
935
+ "grad_norm": 0.17710699141025543,
936
+ "learning_rate": 0.000971565661007001,
937
+ "loss": 2.976995849609375,
938
+ "step": 12000
939
+ },
940
+ {
941
+ "epoch": 0.10909090909090909,
942
+ "eval_loss": 3.324172019958496,
943
+ "eval_runtime": 6.855,
944
+ "eval_samples_per_second": 84.026,
945
+ "eval_steps_per_second": 21.006,
946
+ "step": 12000
947
  }
948
  ],
949
  "logging_steps": 100,
 
963
  "attributes": {}
964
  }
965
  },
966
+ "total_flos": 2.98974971953152e+17,
967
  "train_batch_size": 22,
968
  "trial_name": null,
969
  "trial_params": null