CodeIsAbstract commited on
Commit
a255288
·
verified ·
1 Parent(s): 6c5c0a1

Training in progress, step 12000, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:5380c87b8a1992262417a07584f7e2ad84f4c2f88005d931c232bf8ae2edd651
3
  size 529337896
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:30c52112c96ec25f31baf587e4ea477ab4159bb1c63abe90bcc28c81ca010247
3
  size 529337896
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:d345cb2206543c9c855d8cd93c9763b056b3b514641a19501f256c2c6ec77df7
3
  size 871247243
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1f7e9850bee199260d6d224038c95a23455b03a11ddd77fdb4a243a7fb5a4fa4
3
  size 871247243
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:58c4ef51004bd7cb63819242ee70337c219b896f88e964689c3e3e6e457044c6
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:52385b94ea56e4debf05c2da14392180d553361a3ff764d1b252b9267d0e1fa2
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:833776bf99a0597a4bf38df86be38e8ac151736eba1d084c9cbb84cab1caf4e9
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:43ab2089bb2cb7b873a77ac8e24a3b3b2416ededca3811b6bb0922f61bea4c99
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.2,
6
  "eval_steps": 1000,
7
- "global_step": 10000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -798,6 +798,164 @@
798
  "eval_samples_per_second": 56.058,
799
  "eval_steps_per_second": 0.448,
800
  "step": 10000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
801
  }
802
  ],
803
  "logging_steps": 100,
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.24,
6
  "eval_steps": 1000,
7
+ "global_step": 12000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
798
  "eval_samples_per_second": 56.058,
799
  "eval_steps_per_second": 0.448,
800
  "step": 10000
801
+ },
802
+ {
803
+ "epoch": 0.202,
804
+ "grad_norm": 0.13834109902381897,
805
+ "learning_rate": 0.0018763385407335963,
806
+ "loss": 3.5627,
807
+ "step": 10100
808
+ },
809
+ {
810
+ "epoch": 0.204,
811
+ "grad_norm": 0.15819378197193146,
812
+ "learning_rate": 0.001873133519711602,
813
+ "loss": 3.5634,
814
+ "step": 10200
815
+ },
816
+ {
817
+ "epoch": 0.206,
818
+ "grad_norm": 0.1618553251028061,
819
+ "learning_rate": 0.0018698903050008956,
820
+ "loss": 3.5768,
821
+ "step": 10300
822
+ },
823
+ {
824
+ "epoch": 0.208,
825
+ "grad_norm": 0.14207501709461212,
826
+ "learning_rate": 0.0018666090384701947,
827
+ "loss": 3.5676,
828
+ "step": 10400
829
+ },
830
+ {
831
+ "epoch": 0.21,
832
+ "grad_norm": 0.13513191044330597,
833
+ "learning_rate": 0.001863289863652727,
834
+ "loss": 3.5653,
835
+ "step": 10500
836
+ },
837
+ {
838
+ "epoch": 0.212,
839
+ "grad_norm": 0.12555710971355438,
840
+ "learning_rate": 0.0018599329257399516,
841
+ "loss": 3.5577,
842
+ "step": 10600
843
+ },
844
+ {
845
+ "epoch": 0.214,
846
+ "grad_norm": 0.129461869597435,
847
+ "learning_rate": 0.0018565383715752083,
848
+ "loss": 3.576,
849
+ "step": 10700
850
+ },
851
+ {
852
+ "epoch": 0.216,
853
+ "grad_norm": 0.11782678216695786,
854
+ "learning_rate": 0.0018531063496472927,
855
+ "loss": 3.5695,
856
+ "step": 10800
857
+ },
858
+ {
859
+ "epoch": 0.218,
860
+ "grad_norm": 0.1391923427581787,
861
+ "learning_rate": 0.0018496370100839622,
862
+ "loss": 3.5478,
863
+ "step": 10900
864
+ },
865
+ {
866
+ "epoch": 0.22,
867
+ "grad_norm": 0.15454861521720886,
868
+ "learning_rate": 0.0018461305046453683,
869
+ "loss": 3.56,
870
+ "step": 11000
871
+ },
872
+ {
873
+ "epoch": 0.22,
874
+ "eval_accuracy": 0.3610430528375734,
875
+ "eval_loss": 3.5181522369384766,
876
+ "eval_runtime": 12.5872,
877
+ "eval_samples_per_second": 79.446,
878
+ "eval_steps_per_second": 0.636,
879
+ "step": 11000
880
+ },
881
+ {
882
+ "epoch": 0.222,
883
+ "grad_norm": 0.14800433814525604,
884
+ "learning_rate": 0.0018425869867174187,
885
+ "loss": 3.5559,
886
+ "step": 11100
887
+ },
888
+ {
889
+ "epoch": 0.224,
890
+ "grad_norm": 0.16677607595920563,
891
+ "learning_rate": 0.0018390066113050665,
892
+ "loss": 3.5393,
893
+ "step": 11200
894
+ },
895
+ {
896
+ "epoch": 0.226,
897
+ "grad_norm": 0.17119687795639038,
898
+ "learning_rate": 0.0018353895350255317,
899
+ "loss": 3.5503,
900
+ "step": 11300
901
+ },
902
+ {
903
+ "epoch": 0.228,
904
+ "grad_norm": 0.16998586058616638,
905
+ "learning_rate": 0.0018317359161014477,
906
+ "loss": 3.5546,
907
+ "step": 11400
908
+ },
909
+ {
910
+ "epoch": 0.23,
911
+ "grad_norm": 0.16900590062141418,
912
+ "learning_rate": 0.001828045914353943,
913
+ "loss": 3.5485,
914
+ "step": 11500
915
+ },
916
+ {
917
+ "epoch": 0.232,
918
+ "grad_norm": 0.13857169449329376,
919
+ "learning_rate": 0.0018243196911956476,
920
+ "loss": 3.5357,
921
+ "step": 11600
922
+ },
923
+ {
924
+ "epoch": 0.234,
925
+ "grad_norm": 0.134566068649292,
926
+ "learning_rate": 0.0018205574096236336,
927
+ "loss": 3.5478,
928
+ "step": 11700
929
+ },
930
+ {
931
+ "epoch": 0.236,
932
+ "grad_norm": 0.13580797612667084,
933
+ "learning_rate": 0.0018167592342122857,
934
+ "loss": 3.5452,
935
+ "step": 11800
936
+ },
937
+ {
938
+ "epoch": 0.238,
939
+ "grad_norm": 0.16239416599273682,
940
+ "learning_rate": 0.0018129253311061002,
941
+ "loss": 3.5256,
942
+ "step": 11900
943
+ },
944
+ {
945
+ "epoch": 0.24,
946
+ "grad_norm": 0.16310077905654907,
947
+ "learning_rate": 0.0018090558680124193,
948
+ "loss": 3.5331,
949
+ "step": 12000
950
+ },
951
+ {
952
+ "epoch": 0.24,
953
+ "eval_accuracy": 0.3630156555772994,
954
+ "eval_loss": 3.4982736110687256,
955
+ "eval_runtime": 12.3123,
956
+ "eval_samples_per_second": 81.22,
957
+ "eval_steps_per_second": 0.65,
958
+ "step": 12000
959
  }
960
  ],
961
  "logging_steps": 100,