CodeIsAbstract commited on
Commit
2054e02
·
verified ·
1 Parent(s): cd571ea

Training in progress, step 12000, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:172b83ee8c0c178fc631d554a3d8e1a9ee973cecb6292c8a65ea9cf6b9413a5f
3
  size 579824888
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:38983cc6baa199b78ad222dae4c477c4bd0c63e2458372366630348ee28383b5
3
  size 579824888
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:4bb1ba220a967824aa67b3f408cb2411ac14a2a8f57c220950876c97a9607f93
3
  size 1159794763
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7fd8341a68b63315868b34bd0e54e5f6c54b4a66537f640753aed597e0d3b48d
3
  size 1159794763
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:62b01f9ae52b370a3c5177e3cbec51226c2ec58f411c1ee0496cca95d179b183
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4d31404d4c654929d8c8604a09997c74ec2ccd4b35e0d5562c9b8d160dc81e06
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:687c619a9c245be775b1ee059ceaff574f576584c143ed02ddcab0296c87f35b
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:51b5657716e2096af61b1cdab76b9fd3dc4ab393f10b4ad41400692973ae8e3f
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.2,
6
  "eval_steps": 1000,
7
- "global_step": 10000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -798,6 +798,164 @@
798
  "eval_samples_per_second": 307.239,
799
  "eval_steps_per_second": 19.311,
800
  "step": 10000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
801
  }
802
  ],
803
  "logging_steps": 100,
@@ -817,7 +975,7 @@
817
  "attributes": {}
818
  }
819
  },
820
- "total_flos": 3.919960866816e+17,
821
  "train_batch_size": 120,
822
  "trial_name": null,
823
  "trial_params": null
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.24,
6
  "eval_steps": 1000,
7
+ "global_step": 12000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
798
  "eval_samples_per_second": 307.239,
799
  "eval_steps_per_second": 19.311,
800
  "step": 10000
801
+ },
802
+ {
803
+ "epoch": 0.202,
804
+ "grad_norm": 0.18158847093582153,
805
+ "learning_rate": 0.0009048970918589055,
806
+ "loss": 3.607147521972656,
807
+ "step": 10100
808
+ },
809
+ {
810
+ "epoch": 0.204,
811
+ "grad_norm": 0.15705344080924988,
812
+ "learning_rate": 0.0009030403007569094,
813
+ "loss": 3.5972610473632813,
814
+ "step": 10200
815
+ },
816
+ {
817
+ "epoch": 0.206,
818
+ "grad_norm": 0.18561947345733643,
819
+ "learning_rate": 0.0009011675024148955,
820
+ "loss": 3.5994192504882814,
821
+ "step": 10300
822
+ },
823
+ {
824
+ "epoch": 0.208,
825
+ "grad_norm": 0.17375363409519196,
826
+ "learning_rate": 0.0008992787712133476,
827
+ "loss": 3.592384948730469,
828
+ "step": 10400
829
+ },
830
+ {
831
+ "epoch": 0.21,
832
+ "grad_norm": 0.14704184234142303,
833
+ "learning_rate": 0.0008973741821655428,
834
+ "loss": 3.5763116455078126,
835
+ "step": 10500
836
+ },
837
+ {
838
+ "epoch": 0.212,
839
+ "grad_norm": 0.1663106381893158,
840
+ "learning_rate": 0.0008954538109145713,
841
+ "loss": 3.59366455078125,
842
+ "step": 10600
843
+ },
844
+ {
845
+ "epoch": 0.214,
846
+ "grad_norm": 0.15191592276096344,
847
+ "learning_rate": 0.0008935177337303337,
848
+ "loss": 3.5883197021484374,
849
+ "step": 10700
850
+ },
851
+ {
852
+ "epoch": 0.216,
853
+ "grad_norm": 0.15566915273666382,
854
+ "learning_rate": 0.0008915660275065107,
855
+ "loss": 3.5549887084960936,
856
+ "step": 10800
857
+ },
858
+ {
859
+ "epoch": 0.218,
860
+ "grad_norm": 0.17490389943122864,
861
+ "learning_rate": 0.0008895987697575093,
862
+ "loss": 3.558960266113281,
863
+ "step": 10900
864
+ },
865
+ {
866
+ "epoch": 0.22,
867
+ "grad_norm": 0.17277678847312927,
868
+ "learning_rate": 0.0008876160386153846,
869
+ "loss": 3.5671484375,
870
+ "step": 11000
871
+ },
872
+ {
873
+ "epoch": 0.22,
874
+ "eval_accuracy": 0.3558709927196726,
875
+ "eval_loss": 3.554290771484375,
876
+ "eval_runtime": 6.8937,
877
+ "eval_samples_per_second": 281.559,
878
+ "eval_steps_per_second": 17.697,
879
+ "step": 11000
880
+ },
881
+ {
882
+ "epoch": 0.222,
883
+ "grad_norm": 0.15808428823947906,
884
+ "learning_rate": 0.0008856179128267363,
885
+ "loss": 3.578575439453125,
886
+ "step": 11100
887
+ },
888
+ {
889
+ "epoch": 0.224,
890
+ "grad_norm": 0.14474111795425415,
891
+ "learning_rate": 0.0008836044717495819,
892
+ "loss": 3.5772747802734375,
893
+ "step": 11200
894
+ },
895
+ {
896
+ "epoch": 0.226,
897
+ "grad_norm": 0.1413886845111847,
898
+ "learning_rate": 0.0008815757953502035,
899
+ "loss": 3.556199645996094,
900
+ "step": 11300
901
+ },
902
+ {
903
+ "epoch": 0.228,
904
+ "grad_norm": 0.1502675712108612,
905
+ "learning_rate": 0.0008795319641999735,
906
+ "loss": 3.570118103027344,
907
+ "step": 11400
908
+ },
909
+ {
910
+ "epoch": 0.23,
911
+ "grad_norm": 0.1517445147037506,
912
+ "learning_rate": 0.0008774730594721534,
913
+ "loss": 3.5563198852539064,
914
+ "step": 11500
915
+ },
916
+ {
917
+ "epoch": 0.232,
918
+ "grad_norm": 0.16406166553497314,
919
+ "learning_rate": 0.0008753991629386706,
920
+ "loss": 3.5616604614257814,
921
+ "step": 11600
922
+ },
923
+ {
924
+ "epoch": 0.234,
925
+ "grad_norm": 0.14764074981212616,
926
+ "learning_rate": 0.0008733103569668701,
927
+ "loss": 3.5495458984375,
928
+ "step": 11700
929
+ },
930
+ {
931
+ "epoch": 0.236,
932
+ "grad_norm": 0.17058512568473816,
933
+ "learning_rate": 0.0008712067245162439,
934
+ "loss": 3.5244882202148435,
935
+ "step": 11800
936
+ },
937
+ {
938
+ "epoch": 0.238,
939
+ "grad_norm": 0.16127121448516846,
940
+ "learning_rate": 0.0008690883491351356,
941
+ "loss": 3.5396826171875,
942
+ "step": 11900
943
+ },
944
+ {
945
+ "epoch": 0.24,
946
+ "grad_norm": 0.14211590588092804,
947
+ "learning_rate": 0.0008669553149574224,
948
+ "loss": 3.522979431152344,
949
+ "step": 12000
950
+ },
951
+ {
952
+ "epoch": 0.24,
953
+ "eval_accuracy": 0.3578128166428224,
954
+ "eval_loss": 3.5307533740997314,
955
+ "eval_runtime": 6.6725,
956
+ "eval_samples_per_second": 290.897,
957
+ "eval_steps_per_second": 18.284,
958
+ "step": 12000
959
  }
960
  ],
961
  "logging_steps": 100,
 
975
  "attributes": {}
976
  }
977
  },
978
+ "total_flos": 4.7039530401792e+17,
979
  "train_batch_size": 120,
980
  "trial_name": null,
981
  "trial_params": null