CodeIsAbstract commited on
Commit
af10532
·
verified ·
1 Parent(s): 6afc022

Training in progress, step 12000, checkpoint

Browse files
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:de0e6e5db5288feee0fefc4357eafb906c01848da238f0f1b9aac0e997510dec
3
  size 1442699
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4bf78147f8e343a711c04d4bced1b1a3bee4e119ef0f393d9d961e3d7be9bbf4
3
  size 1442699
last-checkpoint/pytorch_model.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:644b3d86f34c31a15e3fe76473fa14f4c704b8d59e60d78e4d6f10a6e753b1b8
3
  size 499774435
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f11349bd4f131a5fba4fe75d7c08a58fc14a9f73c279ad7c85382a75c423a593
3
  size 499774435
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:86bc1651483ec7d90230200f2b53b997a19bb41b19e2710e0f81a67f62f0b352
3
  size 14455
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:149d23a52063855ad630babdef2c6cdf6cb494879a59b9a4f1ccc02ef38dc56a
3
  size 14455
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:833776bf99a0597a4bf38df86be38e8ac151736eba1d084c9cbb84cab1caf4e9
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:43ab2089bb2cb7b873a77ac8e24a3b3b2416ededca3811b6bb0922f61bea4c99
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.2,
6
  "eval_steps": 1000,
7
- "global_step": 10000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -798,6 +798,164 @@
798
  "eval_samples_per_second": 144.863,
799
  "eval_steps_per_second": 18.108,
800
  "step": 10000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
801
  }
802
  ],
803
  "logging_steps": 100,
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.24,
6
  "eval_steps": 1000,
7
+ "global_step": 12000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
798
  "eval_samples_per_second": 144.863,
799
  "eval_steps_per_second": 18.108,
800
  "step": 10000
801
+ },
802
+ {
803
+ "epoch": 0.202,
804
+ "grad_norm": 0.4188442528247833,
805
+ "learning_rate": 0.0018763385407335963,
806
+ "loss": 4.784246215820312,
807
+ "step": 10100
808
+ },
809
+ {
810
+ "epoch": 0.204,
811
+ "grad_norm": 0.24621133506298065,
812
+ "learning_rate": 0.001873133519711602,
813
+ "loss": 4.787679748535156,
814
+ "step": 10200
815
+ },
816
+ {
817
+ "epoch": 0.206,
818
+ "grad_norm": 0.5215740203857422,
819
+ "learning_rate": 0.0018698903050008956,
820
+ "loss": 4.709499206542969,
821
+ "step": 10300
822
+ },
823
+ {
824
+ "epoch": 0.208,
825
+ "grad_norm": 0.4617030918598175,
826
+ "learning_rate": 0.0018666090384701947,
827
+ "loss": 4.747078552246093,
828
+ "step": 10400
829
+ },
830
+ {
831
+ "epoch": 0.21,
832
+ "grad_norm": 0.29167914390563965,
833
+ "learning_rate": 0.001863289863652727,
834
+ "loss": 4.661806945800781,
835
+ "step": 10500
836
+ },
837
+ {
838
+ "epoch": 0.212,
839
+ "grad_norm": 0.4101203680038452,
840
+ "learning_rate": 0.0018599329257399516,
841
+ "loss": 4.659268493652344,
842
+ "step": 10600
843
+ },
844
+ {
845
+ "epoch": 0.214,
846
+ "grad_norm": 0.31853312253952026,
847
+ "learning_rate": 0.0018565383715752083,
848
+ "loss": 4.701767272949219,
849
+ "step": 10700
850
+ },
851
+ {
852
+ "epoch": 0.216,
853
+ "grad_norm": 0.2906162440776825,
854
+ "learning_rate": 0.0018531063496472927,
855
+ "loss": 4.690833435058594,
856
+ "step": 10800
857
+ },
858
+ {
859
+ "epoch": 0.218,
860
+ "grad_norm": 0.3280249238014221,
861
+ "learning_rate": 0.0018496370100839622,
862
+ "loss": 4.6896670532226565,
863
+ "step": 10900
864
+ },
865
+ {
866
+ "epoch": 0.22,
867
+ "grad_norm": 0.3699072301387787,
868
+ "learning_rate": 0.0018461305046453683,
869
+ "loss": 4.636054382324219,
870
+ "step": 11000
871
+ },
872
+ {
873
+ "epoch": 0.22,
874
+ "eval_accuracy": 0.2340371819960861,
875
+ "eval_loss": 4.797712326049805,
876
+ "eval_runtime": 6.7202,
877
+ "eval_samples_per_second": 148.805,
878
+ "eval_steps_per_second": 18.601,
879
+ "step": 11000
880
+ },
881
+ {
882
+ "epoch": 0.222,
883
+ "grad_norm": 0.24158497154712677,
884
+ "learning_rate": 0.0018425869867174187,
885
+ "loss": 4.711828002929687,
886
+ "step": 11100
887
+ },
888
+ {
889
+ "epoch": 0.224,
890
+ "grad_norm": 0.4193456172943115,
891
+ "learning_rate": 0.0018390066113050665,
892
+ "loss": 4.724891357421875,
893
+ "step": 11200
894
+ },
895
+ {
896
+ "epoch": 0.226,
897
+ "grad_norm": 0.3414510190486908,
898
+ "learning_rate": 0.0018353895350255317,
899
+ "loss": 4.649370727539062,
900
+ "step": 11300
901
+ },
902
+ {
903
+ "epoch": 0.228,
904
+ "grad_norm": 0.2959993779659271,
905
+ "learning_rate": 0.0018317359161014477,
906
+ "loss": 4.620471801757812,
907
+ "step": 11400
908
+ },
909
+ {
910
+ "epoch": 0.23,
911
+ "grad_norm": 0.35871621966362,
912
+ "learning_rate": 0.001828045914353943,
913
+ "loss": 4.65095458984375,
914
+ "step": 11500
915
+ },
916
+ {
917
+ "epoch": 0.232,
918
+ "grad_norm": 0.8000448942184448,
919
+ "learning_rate": 0.0018243196911956476,
920
+ "loss": 4.606728210449218,
921
+ "step": 11600
922
+ },
923
+ {
924
+ "epoch": 0.234,
925
+ "grad_norm": 0.3677903115749359,
926
+ "learning_rate": 0.0018205574096236336,
927
+ "loss": 4.599508361816406,
928
+ "step": 11700
929
+ },
930
+ {
931
+ "epoch": 0.236,
932
+ "grad_norm": 0.5635560750961304,
933
+ "learning_rate": 0.0018167592342122857,
934
+ "loss": 4.591564331054688,
935
+ "step": 11800
936
+ },
937
+ {
938
+ "epoch": 0.238,
939
+ "grad_norm": 0.29384273290634155,
940
+ "learning_rate": 0.0018129253311061002,
941
+ "loss": 4.715082092285156,
942
+ "step": 11900
943
+ },
944
+ {
945
+ "epoch": 0.24,
946
+ "grad_norm": 0.34943443536758423,
947
+ "learning_rate": 0.0018090558680124193,
948
+ "loss": 4.741492919921875,
949
+ "step": 12000
950
+ },
951
+ {
952
+ "epoch": 0.24,
953
+ "eval_accuracy": 0.24006849315068493,
954
+ "eval_loss": 4.731167316436768,
955
+ "eval_runtime": 6.7722,
956
+ "eval_samples_per_second": 147.662,
957
+ "eval_steps_per_second": 18.458,
958
+ "step": 12000
959
  }
960
  ],
961
  "logging_steps": 100,