CodeIsAbstract commited on
Commit
ff08e17
·
verified ·
1 Parent(s): 131176e

Training in progress, step 38000, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:d197cd9a3404a8c8f67910780423aecd5fdc3add3f182e0d82ab6682395c0006
3
  size 529337896
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:dd7bc3b6641670f074b55a5b4f90528448bcea90e89d866eadc79e22cadf1bd2
3
  size 529337896
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:419fd2c3e0ba5d1952d3f93465eeb172ba6dac85f67c82c9eeb58a6bc214cded
3
  size 871247243
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:805511bda687dc757ba933396fffe6806155d85d1eb99922300896d858f2b615
3
  size 871247243
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:6a202a832e7dde4f4f295f57293a1d0bb6e0f939cebe50d0b66fc7a8608bef7a
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4fffdc0b55d45a254da995950f6ade5109e1182c4a9a3b190cf11bc8c48d0b82
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:d525574f54acfd6c1c0d9e8a984a9fe4782c94abdc8722296a2554b91af7e0e9
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:40c934a53b7d741f620d2fd5ca3781d46f7df109d0ca475956382429898d18f8
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.72,
6
  "eval_steps": 1000,
7
- "global_step": 36000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -2852,6 +2852,164 @@
2852
  "eval_samples_per_second": 85.261,
2853
  "eval_steps_per_second": 0.682,
2854
  "step": 36000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
2855
  }
2856
  ],
2857
  "logging_steps": 100,
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.76,
6
  "eval_steps": 1000,
7
+ "global_step": 38000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
2852
  "eval_samples_per_second": 85.261,
2853
  "eval_steps_per_second": 0.682,
2854
  "step": 36000
2855
+ },
2856
+ {
2857
+ "epoch": 0.722,
2858
+ "grad_norm": 0.14137360453605652,
2859
+ "learning_rate": 0.0003936988995130556,
2860
+ "loss": 3.254,
2861
+ "step": 36100
2862
+ },
2863
+ {
2864
+ "epoch": 0.724,
2865
+ "grad_norm": 0.1477884203195572,
2866
+ "learning_rate": 0.0003884526092395261,
2867
+ "loss": 3.25,
2868
+ "step": 36200
2869
+ },
2870
+ {
2871
+ "epoch": 0.726,
2872
+ "grad_norm": 0.14579065144062042,
2873
+ "learning_rate": 0.00038323307003000693,
2874
+ "loss": 3.2324,
2875
+ "step": 36300
2876
+ },
2877
+ {
2878
+ "epoch": 0.728,
2879
+ "grad_norm": 0.18951904773712158,
2880
+ "learning_rate": 0.0003780405102040524,
2881
+ "loss": 3.2393,
2882
+ "step": 36400
2883
+ },
2884
+ {
2885
+ "epoch": 0.73,
2886
+ "grad_norm": 0.1553814709186554,
2887
+ "learning_rate": 0.0003728751569010509,
2888
+ "loss": 3.2329,
2889
+ "step": 36500
2890
+ },
2891
+ {
2892
+ "epoch": 0.732,
2893
+ "grad_norm": 0.15148834884166718,
2894
+ "learning_rate": 0.00036773723607028965,
2895
+ "loss": 3.2493,
2896
+ "step": 36600
2897
+ },
2898
+ {
2899
+ "epoch": 0.734,
2900
+ "grad_norm": 0.14959374070167542,
2901
+ "learning_rate": 0.00036262697246107,
2902
+ "loss": 3.2412,
2903
+ "step": 36700
2904
+ },
2905
+ {
2906
+ "epoch": 0.736,
2907
+ "grad_norm": 0.15129899978637695,
2908
+ "learning_rate": 0.0003575445896128768,
2909
+ "loss": 3.2299,
2910
+ "step": 36800
2911
+ },
2912
+ {
2913
+ "epoch": 0.738,
2914
+ "grad_norm": 0.14516687393188477,
2915
+ "learning_rate": 0.0003524903098456013,
2916
+ "loss": 3.2402,
2917
+ "step": 36900
2918
+ },
2919
+ {
2920
+ "epoch": 0.74,
2921
+ "grad_norm": 0.14438898861408234,
2922
+ "learning_rate": 0.00034746435424981315,
2923
+ "loss": 3.2538,
2924
+ "step": 37000
2925
+ },
2926
+ {
2927
+ "epoch": 0.74,
2928
+ "eval_accuracy": 0.3904481409001957,
2929
+ "eval_loss": 3.250405788421631,
2930
+ "eval_runtime": 11.8201,
2931
+ "eval_samples_per_second": 84.602,
2932
+ "eval_steps_per_second": 0.677,
2933
+ "step": 37000
2934
+ },
2935
+ {
2936
+ "epoch": 0.742,
2937
+ "grad_norm": 0.21630696952342987,
2938
+ "learning_rate": 0.00034246694267709257,
2939
+ "loss": 3.2171,
2940
+ "step": 37100
2941
+ },
2942
+ {
2943
+ "epoch": 0.744,
2944
+ "grad_norm": 0.14735347032546997,
2945
+ "learning_rate": 0.0003374982937304113,
2946
+ "loss": 3.2346,
2947
+ "step": 37200
2948
+ },
2949
+ {
2950
+ "epoch": 0.746,
2951
+ "grad_norm": 0.15532496571540833,
2952
+ "learning_rate": 0.0003325586247545698,
2953
+ "loss": 3.2403,
2954
+ "step": 37300
2955
+ },
2956
+ {
2957
+ "epoch": 0.748,
2958
+ "grad_norm": 0.17086553573608398,
2959
+ "learning_rate": 0.00032764815182669205,
2960
+ "loss": 3.2336,
2961
+ "step": 37400
2962
+ },
2963
+ {
2964
+ "epoch": 0.75,
2965
+ "grad_norm": 0.14083310961723328,
2966
+ "learning_rate": 0.00032276708974677117,
2967
+ "loss": 3.2287,
2968
+ "step": 37500
2969
+ },
2970
+ {
2971
+ "epoch": 0.752,
2972
+ "grad_norm": 0.13698738813400269,
2973
+ "learning_rate": 0.00031791565202827533,
2974
+ "loss": 3.2262,
2975
+ "step": 37600
2976
+ },
2977
+ {
2978
+ "epoch": 0.754,
2979
+ "grad_norm": 0.1423436999320984,
2980
+ "learning_rate": 0.0003130940508888063,
2981
+ "loss": 3.2448,
2982
+ "step": 37700
2983
+ },
2984
+ {
2985
+ "epoch": 0.756,
2986
+ "grad_norm": 0.2180064171552658,
2987
+ "learning_rate": 0.00030830249724081817,
2988
+ "loss": 3.2235,
2989
+ "step": 37800
2990
+ },
2991
+ {
2992
+ "epoch": 0.758,
2993
+ "grad_norm": 0.16625255346298218,
2994
+ "learning_rate": 0.0003035412006823901,
2995
+ "loss": 3.2224,
2996
+ "step": 37900
2997
+ },
2998
+ {
2999
+ "epoch": 0.76,
3000
+ "grad_norm": 0.14719747006893158,
3001
+ "learning_rate": 0.0002988103694880576,
3002
+ "loss": 3.2353,
3003
+ "step": 38000
3004
+ },
3005
+ {
3006
+ "epoch": 0.76,
3007
+ "eval_accuracy": 0.39081996086105675,
3008
+ "eval_loss": 3.2475223541259766,
3009
+ "eval_runtime": 11.4579,
3010
+ "eval_samples_per_second": 87.276,
3011
+ "eval_steps_per_second": 0.698,
3012
+ "step": 38000
3013
  }
3014
  ],
3015
  "logging_steps": 100,