CodeIsAbstract commited on
Commit
a738d80
·
verified ·
1 Parent(s): 7b3efd7

Training in progress, step 26000, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:a393eecc8859798c86704ccd1740b6f825f3063101dfb84fb1c0e1bb44fc8bb9
3
  size 529337896
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e8fe178b2c865524971da242eead5a0a0fec5b3cb218040e9e466496006f5885
3
  size 529337896
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:c1597d5dd75462983a2c5a48479f862672dc9074eaa7c62526cd140d73656352
3
  size 871247243
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0bcee50e95784bd04fda383abb23615395a0ad72d918cfafb72b7cef0032329d
3
  size 871247243
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:629924d74f807859938a2e0544d41b7fc7e7257734a23d6398e9f4c4c430a987
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b061322e6ec670b87a8f9896d884fe5261ed4165781876f01308a3b5eff45c4a
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:28b503174003f93898a1090cb2b211d63af9d1104e10530d32ee248925b03f40
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:891e10d00e5e712dd3d3f62daa558798b38eee3e75855dd02223a9bfb9d6ca61
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.48,
6
  "eval_steps": 1000,
7
- "global_step": 24000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -1904,6 +1904,164 @@
1904
  "eval_samples_per_second": 77.587,
1905
  "eval_steps_per_second": 0.621,
1906
  "step": 24000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1907
  }
1908
  ],
1909
  "logging_steps": 100,
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.52,
6
  "eval_steps": 1000,
7
+ "global_step": 26000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
1904
  "eval_samples_per_second": 77.587,
1905
  "eval_steps_per_second": 0.621,
1906
  "step": 24000
1907
+ },
1908
+ {
1909
+ "epoch": 0.482,
1910
+ "grad_norm": 0.17039372026920319,
1911
+ "learning_rate": 0.0011417851417431346,
1912
+ "loss": 3.3587,
1913
+ "step": 24100
1914
+ },
1915
+ {
1916
+ "epoch": 0.484,
1917
+ "grad_norm": 0.16372039914131165,
1918
+ "learning_rate": 0.0011352350261391204,
1919
+ "loss": 3.3488,
1920
+ "step": 24200
1921
+ },
1922
+ {
1923
+ "epoch": 0.486,
1924
+ "grad_norm": 0.15907979011535645,
1925
+ "learning_rate": 0.0011286789949169628,
1926
+ "loss": 3.3638,
1927
+ "step": 24300
1928
+ },
1929
+ {
1930
+ "epoch": 0.488,
1931
+ "grad_norm": 0.15641772747039795,
1932
+ "learning_rate": 0.001122117334858705,
1933
+ "loss": 3.3627,
1934
+ "step": 24400
1935
+ },
1936
+ {
1937
+ "epoch": 0.49,
1938
+ "grad_norm": 0.17920181155204773,
1939
+ "learning_rate": 0.0011155503329926151,
1940
+ "loss": 3.3278,
1941
+ "step": 24500
1942
+ },
1943
+ {
1944
+ "epoch": 0.492,
1945
+ "grad_norm": 0.16552342474460602,
1946
+ "learning_rate": 0.001108978276580629,
1947
+ "loss": 3.3653,
1948
+ "step": 24600
1949
+ },
1950
+ {
1951
+ "epoch": 0.494,
1952
+ "grad_norm": 0.17901502549648285,
1953
+ "learning_rate": 0.001102401453105785,
1954
+ "loss": 3.3626,
1955
+ "step": 24700
1956
+ },
1957
+ {
1958
+ "epoch": 0.496,
1959
+ "grad_norm": 0.17022928595542908,
1960
+ "learning_rate": 0.001095820150259647,
1961
+ "loss": 3.3391,
1962
+ "step": 24800
1963
+ },
1964
+ {
1965
+ "epoch": 0.498,
1966
+ "grad_norm": 0.1806282252073288,
1967
+ "learning_rate": 0.0010892346559297226,
1968
+ "loss": 3.3476,
1969
+ "step": 24900
1970
+ },
1971
+ {
1972
+ "epoch": 0.5,
1973
+ "grad_norm": 0.16578249633312225,
1974
+ "learning_rate": 0.0010826452581868676,
1975
+ "loss": 3.3586,
1976
+ "step": 25000
1977
+ },
1978
+ {
1979
+ "epoch": 0.5,
1980
+ "eval_accuracy": 0.38070841487279844,
1981
+ "eval_loss": 3.3385705947875977,
1982
+ "eval_runtime": 17.5524,
1983
+ "eval_samples_per_second": 56.972,
1984
+ "eval_steps_per_second": 0.456,
1985
+ "step": 25000
1986
+ },
1987
+ {
1988
+ "epoch": 0.502,
1989
+ "grad_norm": 0.14317767322063446,
1990
+ "learning_rate": 0.001076052245272686,
1991
+ "loss": 3.3494,
1992
+ "step": 25100
1993
+ },
1994
+ {
1995
+ "epoch": 0.504,
1996
+ "grad_norm": 0.18083012104034424,
1997
+ "learning_rate": 0.0010694559055869205,
1998
+ "loss": 3.3425,
1999
+ "step": 25200
2000
+ },
2001
+ {
2002
+ "epoch": 0.506,
2003
+ "grad_norm": 0.1475485861301422,
2004
+ "learning_rate": 0.0010628565276748394,
2005
+ "loss": 3.3346,
2006
+ "step": 25300
2007
+ },
2008
+ {
2009
+ "epoch": 0.508,
2010
+ "grad_norm": 0.19806760549545288,
2011
+ "learning_rate": 0.0010562544002146108,
2012
+ "loss": 3.359,
2013
+ "step": 25400
2014
+ },
2015
+ {
2016
+ "epoch": 0.51,
2017
+ "grad_norm": 0.1636313647031784,
2018
+ "learning_rate": 0.0010496498120046778,
2019
+ "loss": 3.351,
2020
+ "step": 25500
2021
+ },
2022
+ {
2023
+ "epoch": 0.512,
2024
+ "grad_norm": 0.14796622097492218,
2025
+ "learning_rate": 0.0010430430519511244,
2026
+ "loss": 3.3308,
2027
+ "step": 25600
2028
+ },
2029
+ {
2030
+ "epoch": 0.514,
2031
+ "grad_norm": 0.15158209204673767,
2032
+ "learning_rate": 0.001036434409055039,
2033
+ "loss": 3.3462,
2034
+ "step": 25700
2035
+ },
2036
+ {
2037
+ "epoch": 0.516,
2038
+ "grad_norm": 0.1509816199541092,
2039
+ "learning_rate": 0.0010298241723998701,
2040
+ "loss": 3.3612,
2041
+ "step": 25800
2042
+ },
2043
+ {
2044
+ "epoch": 0.518,
2045
+ "grad_norm": 0.2039985954761505,
2046
+ "learning_rate": 0.001023212631138783,
2047
+ "loss": 3.3233,
2048
+ "step": 25900
2049
+ },
2050
+ {
2051
+ "epoch": 0.52,
2052
+ "grad_norm": 0.15846829116344452,
2053
+ "learning_rate": 0.001016600074482012,
2054
+ "loss": 3.3338,
2055
+ "step": 26000
2056
+ },
2057
+ {
2058
+ "epoch": 0.52,
2059
+ "eval_accuracy": 0.381559686888454,
2060
+ "eval_loss": 3.330564498901367,
2061
+ "eval_runtime": 11.5688,
2062
+ "eval_samples_per_second": 86.439,
2063
+ "eval_steps_per_second": 0.692,
2064
+ "step": 26000
2065
  }
2066
  ],
2067
  "logging_steps": 100,