Training in progress, step 26000, checkpoint
Browse files
last-checkpoint/model.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 529337896
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:e8fe178b2c865524971da242eead5a0a0fec5b3cb218040e9e466496006f5885
|
| 3 |
size 529337896
|
last-checkpoint/optimizer.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 871247243
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:0bcee50e95784bd04fda383abb23615395a0ad72d918cfafb72b7cef0032329d
|
| 3 |
size 871247243
|
last-checkpoint/rng_state.pth
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 14645
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:b061322e6ec670b87a8f9896d884fe5261ed4165781876f01308a3b5eff45c4a
|
| 3 |
size 14645
|
last-checkpoint/scheduler.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 1465
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:891e10d00e5e712dd3d3f62daa558798b38eee3e75855dd02223a9bfb9d6ca61
|
| 3 |
size 1465
|
last-checkpoint/trainer_state.json
CHANGED
|
@@ -2,9 +2,9 @@
|
|
| 2 |
"best_global_step": null,
|
| 3 |
"best_metric": null,
|
| 4 |
"best_model_checkpoint": null,
|
| 5 |
-
"epoch": 0.
|
| 6 |
"eval_steps": 1000,
|
| 7 |
-
"global_step":
|
| 8 |
"is_hyper_param_search": false,
|
| 9 |
"is_local_process_zero": true,
|
| 10 |
"is_world_process_zero": true,
|
|
@@ -1904,6 +1904,164 @@
|
|
| 1904 |
"eval_samples_per_second": 77.587,
|
| 1905 |
"eval_steps_per_second": 0.621,
|
| 1906 |
"step": 24000
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1907 |
}
|
| 1908 |
],
|
| 1909 |
"logging_steps": 100,
|
|
|
|
| 2 |
"best_global_step": null,
|
| 3 |
"best_metric": null,
|
| 4 |
"best_model_checkpoint": null,
|
| 5 |
+
"epoch": 0.52,
|
| 6 |
"eval_steps": 1000,
|
| 7 |
+
"global_step": 26000,
|
| 8 |
"is_hyper_param_search": false,
|
| 9 |
"is_local_process_zero": true,
|
| 10 |
"is_world_process_zero": true,
|
|
|
|
| 1904 |
"eval_samples_per_second": 77.587,
|
| 1905 |
"eval_steps_per_second": 0.621,
|
| 1906 |
"step": 24000
|
| 1907 |
+
},
|
| 1908 |
+
{
|
| 1909 |
+
"epoch": 0.482,
|
| 1910 |
+
"grad_norm": 0.17039372026920319,
|
| 1911 |
+
"learning_rate": 0.0011417851417431346,
|
| 1912 |
+
"loss": 3.3587,
|
| 1913 |
+
"step": 24100
|
| 1914 |
+
},
|
| 1915 |
+
{
|
| 1916 |
+
"epoch": 0.484,
|
| 1917 |
+
"grad_norm": 0.16372039914131165,
|
| 1918 |
+
"learning_rate": 0.0011352350261391204,
|
| 1919 |
+
"loss": 3.3488,
|
| 1920 |
+
"step": 24200
|
| 1921 |
+
},
|
| 1922 |
+
{
|
| 1923 |
+
"epoch": 0.486,
|
| 1924 |
+
"grad_norm": 0.15907979011535645,
|
| 1925 |
+
"learning_rate": 0.0011286789949169628,
|
| 1926 |
+
"loss": 3.3638,
|
| 1927 |
+
"step": 24300
|
| 1928 |
+
},
|
| 1929 |
+
{
|
| 1930 |
+
"epoch": 0.488,
|
| 1931 |
+
"grad_norm": 0.15641772747039795,
|
| 1932 |
+
"learning_rate": 0.001122117334858705,
|
| 1933 |
+
"loss": 3.3627,
|
| 1934 |
+
"step": 24400
|
| 1935 |
+
},
|
| 1936 |
+
{
|
| 1937 |
+
"epoch": 0.49,
|
| 1938 |
+
"grad_norm": 0.17920181155204773,
|
| 1939 |
+
"learning_rate": 0.0011155503329926151,
|
| 1940 |
+
"loss": 3.3278,
|
| 1941 |
+
"step": 24500
|
| 1942 |
+
},
|
| 1943 |
+
{
|
| 1944 |
+
"epoch": 0.492,
|
| 1945 |
+
"grad_norm": 0.16552342474460602,
|
| 1946 |
+
"learning_rate": 0.001108978276580629,
|
| 1947 |
+
"loss": 3.3653,
|
| 1948 |
+
"step": 24600
|
| 1949 |
+
},
|
| 1950 |
+
{
|
| 1951 |
+
"epoch": 0.494,
|
| 1952 |
+
"grad_norm": 0.17901502549648285,
|
| 1953 |
+
"learning_rate": 0.001102401453105785,
|
| 1954 |
+
"loss": 3.3626,
|
| 1955 |
+
"step": 24700
|
| 1956 |
+
},
|
| 1957 |
+
{
|
| 1958 |
+
"epoch": 0.496,
|
| 1959 |
+
"grad_norm": 0.17022928595542908,
|
| 1960 |
+
"learning_rate": 0.001095820150259647,
|
| 1961 |
+
"loss": 3.3391,
|
| 1962 |
+
"step": 24800
|
| 1963 |
+
},
|
| 1964 |
+
{
|
| 1965 |
+
"epoch": 0.498,
|
| 1966 |
+
"grad_norm": 0.1806282252073288,
|
| 1967 |
+
"learning_rate": 0.0010892346559297226,
|
| 1968 |
+
"loss": 3.3476,
|
| 1969 |
+
"step": 24900
|
| 1970 |
+
},
|
| 1971 |
+
{
|
| 1972 |
+
"epoch": 0.5,
|
| 1973 |
+
"grad_norm": 0.16578249633312225,
|
| 1974 |
+
"learning_rate": 0.0010826452581868676,
|
| 1975 |
+
"loss": 3.3586,
|
| 1976 |
+
"step": 25000
|
| 1977 |
+
},
|
| 1978 |
+
{
|
| 1979 |
+
"epoch": 0.5,
|
| 1980 |
+
"eval_accuracy": 0.38070841487279844,
|
| 1981 |
+
"eval_loss": 3.3385705947875977,
|
| 1982 |
+
"eval_runtime": 17.5524,
|
| 1983 |
+
"eval_samples_per_second": 56.972,
|
| 1984 |
+
"eval_steps_per_second": 0.456,
|
| 1985 |
+
"step": 25000
|
| 1986 |
+
},
|
| 1987 |
+
{
|
| 1988 |
+
"epoch": 0.502,
|
| 1989 |
+
"grad_norm": 0.14317767322063446,
|
| 1990 |
+
"learning_rate": 0.001076052245272686,
|
| 1991 |
+
"loss": 3.3494,
|
| 1992 |
+
"step": 25100
|
| 1993 |
+
},
|
| 1994 |
+
{
|
| 1995 |
+
"epoch": 0.504,
|
| 1996 |
+
"grad_norm": 0.18083012104034424,
|
| 1997 |
+
"learning_rate": 0.0010694559055869205,
|
| 1998 |
+
"loss": 3.3425,
|
| 1999 |
+
"step": 25200
|
| 2000 |
+
},
|
| 2001 |
+
{
|
| 2002 |
+
"epoch": 0.506,
|
| 2003 |
+
"grad_norm": 0.1475485861301422,
|
| 2004 |
+
"learning_rate": 0.0010628565276748394,
|
| 2005 |
+
"loss": 3.3346,
|
| 2006 |
+
"step": 25300
|
| 2007 |
+
},
|
| 2008 |
+
{
|
| 2009 |
+
"epoch": 0.508,
|
| 2010 |
+
"grad_norm": 0.19806760549545288,
|
| 2011 |
+
"learning_rate": 0.0010562544002146108,
|
| 2012 |
+
"loss": 3.359,
|
| 2013 |
+
"step": 25400
|
| 2014 |
+
},
|
| 2015 |
+
{
|
| 2016 |
+
"epoch": 0.51,
|
| 2017 |
+
"grad_norm": 0.1636313647031784,
|
| 2018 |
+
"learning_rate": 0.0010496498120046778,
|
| 2019 |
+
"loss": 3.351,
|
| 2020 |
+
"step": 25500
|
| 2021 |
+
},
|
| 2022 |
+
{
|
| 2023 |
+
"epoch": 0.512,
|
| 2024 |
+
"grad_norm": 0.14796622097492218,
|
| 2025 |
+
"learning_rate": 0.0010430430519511244,
|
| 2026 |
+
"loss": 3.3308,
|
| 2027 |
+
"step": 25600
|
| 2028 |
+
},
|
| 2029 |
+
{
|
| 2030 |
+
"epoch": 0.514,
|
| 2031 |
+
"grad_norm": 0.15158209204673767,
|
| 2032 |
+
"learning_rate": 0.001036434409055039,
|
| 2033 |
+
"loss": 3.3462,
|
| 2034 |
+
"step": 25700
|
| 2035 |
+
},
|
| 2036 |
+
{
|
| 2037 |
+
"epoch": 0.516,
|
| 2038 |
+
"grad_norm": 0.1509816199541092,
|
| 2039 |
+
"learning_rate": 0.0010298241723998701,
|
| 2040 |
+
"loss": 3.3612,
|
| 2041 |
+
"step": 25800
|
| 2042 |
+
},
|
| 2043 |
+
{
|
| 2044 |
+
"epoch": 0.518,
|
| 2045 |
+
"grad_norm": 0.2039985954761505,
|
| 2046 |
+
"learning_rate": 0.001023212631138783,
|
| 2047 |
+
"loss": 3.3233,
|
| 2048 |
+
"step": 25900
|
| 2049 |
+
},
|
| 2050 |
+
{
|
| 2051 |
+
"epoch": 0.52,
|
| 2052 |
+
"grad_norm": 0.15846829116344452,
|
| 2053 |
+
"learning_rate": 0.001016600074482012,
|
| 2054 |
+
"loss": 3.3338,
|
| 2055 |
+
"step": 26000
|
| 2056 |
+
},
|
| 2057 |
+
{
|
| 2058 |
+
"epoch": 0.52,
|
| 2059 |
+
"eval_accuracy": 0.381559686888454,
|
| 2060 |
+
"eval_loss": 3.330564498901367,
|
| 2061 |
+
"eval_runtime": 11.5688,
|
| 2062 |
+
"eval_samples_per_second": 86.439,
|
| 2063 |
+
"eval_steps_per_second": 0.692,
|
| 2064 |
+
"step": 26000
|
| 2065 |
}
|
| 2066 |
],
|
| 2067 |
"logging_steps": 100,
|