CodeIsAbstract commited on
Commit
dc1b0e8
·
verified ·
1 Parent(s): 1c37636

Training in progress, step 28000, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:91939e0b72ed547f5c93280b369185295f37271995fd46a6edb271145c07605c
3
  size 469337272
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:78d2e42563ecfd65d97699a72f4be839c4815a628d9aafa31de38f84519e5ebf
3
  size 469337272
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:c4519573d36d90ba131c7875410ba23ca2fd486818679adec360ef2a2dd49f18
3
  size 938825803
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d6cf00bdfb1404208c2471c83afcc106348ceb61f5610d2591e45fff9be83487
3
  size 938825803
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:68a1e729745879daefb80abbed0a2e5c919e4730374ec35c85a8be9176df6bb5
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:09745e8006c686b7ca1b3f3ce96dc9d5406d13f67ce84984ece76a3860e0757b
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:d44e1b79b7ca3c1d7f485201d49324d3b81b5df8a48270324b94dd9cdfe85a81
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1a7a45fe9f879fdefbf9d22a9cd4381d35f0cc9247510e28a7632ac32b2c74e6
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.21818181818181817,
6
  "eval_steps": 1000,
7
- "global_step": 24000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -1880,6 +1880,318 @@
1880
  "eval_samples_per_second": 84.315,
1881
  "eval_steps_per_second": 21.079,
1882
  "step": 24000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1883
  }
1884
  ],
1885
  "logging_steps": 100,
@@ -1899,7 +2211,7 @@
1899
  "attributes": {}
1900
  }
1901
  },
1902
- "total_flos": 5.97949943906304e+17,
1903
  "train_batch_size": 22,
1904
  "trial_name": null,
1905
  "trial_params": null
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.2545454545454545,
6
  "eval_steps": 1000,
7
+ "global_step": 28000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
1880
  "eval_samples_per_second": 84.315,
1881
  "eval_steps_per_second": 21.079,
1882
  "step": 24000
1883
+ },
1884
+ {
1885
+ "epoch": 0.2190909090909091,
1886
+ "grad_norm": 0.15911774337291718,
1887
+ "learning_rate": 0.0008872361524354357,
1888
+ "loss": 2.8208258056640627,
1889
+ "step": 24100
1890
+ },
1891
+ {
1892
+ "epoch": 0.22,
1893
+ "grad_norm": 0.14365383982658386,
1894
+ "learning_rate": 0.0008863299746814158,
1895
+ "loss": 2.82010986328125,
1896
+ "step": 24200
1897
+ },
1898
+ {
1899
+ "epoch": 0.22090909090909092,
1900
+ "grad_norm": 0.16335056722164154,
1901
+ "learning_rate": 0.0008854206371409452,
1902
+ "loss": 2.863214416503906,
1903
+ "step": 24300
1904
+ },
1905
+ {
1906
+ "epoch": 0.22181818181818183,
1907
+ "grad_norm": 0.15806064009666443,
1908
+ "learning_rate": 0.0008845081472514806,
1909
+ "loss": 2.8272698974609374,
1910
+ "step": 24400
1911
+ },
1912
+ {
1913
+ "epoch": 0.22272727272727272,
1914
+ "grad_norm": 0.1631830632686615,
1915
+ "learning_rate": 0.0008835925124762616,
1916
+ "loss": 2.8286688232421877,
1917
+ "step": 24500
1918
+ },
1919
+ {
1920
+ "epoch": 0.22363636363636363,
1921
+ "grad_norm": 0.142561137676239,
1922
+ "learning_rate": 0.0008826737403042499,
1923
+ "loss": 2.823035888671875,
1924
+ "step": 24600
1925
+ },
1926
+ {
1927
+ "epoch": 0.22454545454545455,
1928
+ "grad_norm": 0.17523014545440674,
1929
+ "learning_rate": 0.0008817518382500677,
1930
+ "loss": 2.830491027832031,
1931
+ "step": 24700
1932
+ },
1933
+ {
1934
+ "epoch": 0.22545454545454546,
1935
+ "grad_norm": 0.15598313510417938,
1936
+ "learning_rate": 0.0008808268138539369,
1937
+ "loss": 2.8227529907226563,
1938
+ "step": 24800
1939
+ },
1940
+ {
1941
+ "epoch": 0.22636363636363635,
1942
+ "grad_norm": 0.1439158320426941,
1943
+ "learning_rate": 0.0008798986746816162,
1944
+ "loss": 2.8210317993164065,
1945
+ "step": 24900
1946
+ },
1947
+ {
1948
+ "epoch": 0.22727272727272727,
1949
+ "grad_norm": 0.14227908849716187,
1950
+ "learning_rate": 0.0008789674283243409,
1951
+ "loss": 2.8191732788085937,
1952
+ "step": 25000
1953
+ },
1954
+ {
1955
+ "epoch": 0.22727272727272727,
1956
+ "eval_loss": 3.1780831813812256,
1957
+ "eval_runtime": 6.8053,
1958
+ "eval_samples_per_second": 84.639,
1959
+ "eval_steps_per_second": 21.16,
1960
+ "step": 25000
1961
+ },
1962
+ {
1963
+ "epoch": 0.22818181818181818,
1964
+ "grad_norm": 0.15105608105659485,
1965
+ "learning_rate": 0.0008780330823987592,
1966
+ "loss": 2.8317742919921876,
1967
+ "step": 25100
1968
+ },
1969
+ {
1970
+ "epoch": 0.2290909090909091,
1971
+ "grad_norm": 0.16510829329490662,
1972
+ "learning_rate": 0.0008770956445468713,
1973
+ "loss": 2.8396697998046876,
1974
+ "step": 25200
1975
+ },
1976
+ {
1977
+ "epoch": 0.23,
1978
+ "grad_norm": 0.13736529648303986,
1979
+ "learning_rate": 0.0008761551224359657,
1980
+ "loss": 2.859419860839844,
1981
+ "step": 25300
1982
+ },
1983
+ {
1984
+ "epoch": 0.2309090909090909,
1985
+ "grad_norm": 0.17783844470977783,
1986
+ "learning_rate": 0.0008752115237585567,
1987
+ "loss": 2.813878173828125,
1988
+ "step": 25400
1989
+ },
1990
+ {
1991
+ "epoch": 0.2318181818181818,
1992
+ "grad_norm": 0.15228304266929626,
1993
+ "learning_rate": 0.0008742648562323228,
1994
+ "loss": 2.7972647094726564,
1995
+ "step": 25500
1996
+ },
1997
+ {
1998
+ "epoch": 0.23272727272727273,
1999
+ "grad_norm": 0.17638841271400452,
2000
+ "learning_rate": 0.0008733151276000417,
2001
+ "loss": 2.84191650390625,
2002
+ "step": 25600
2003
+ },
2004
+ {
2005
+ "epoch": 0.23363636363636364,
2006
+ "grad_norm": 0.15283086895942688,
2007
+ "learning_rate": 0.0008723623456295282,
2008
+ "loss": 2.8249298095703126,
2009
+ "step": 25700
2010
+ },
2011
+ {
2012
+ "epoch": 0.23454545454545456,
2013
+ "grad_norm": 0.15044672787189484,
2014
+ "learning_rate": 0.0008714065181135701,
2015
+ "loss": 2.8220599365234373,
2016
+ "step": 25800
2017
+ },
2018
+ {
2019
+ "epoch": 0.23545454545454544,
2020
+ "grad_norm": 0.149523064494133,
2021
+ "learning_rate": 0.0008704476528698649,
2022
+ "loss": 2.7989315795898437,
2023
+ "step": 25900
2024
+ },
2025
+ {
2026
+ "epoch": 0.23636363636363636,
2027
+ "grad_norm": 0.15856775641441345,
2028
+ "learning_rate": 0.0008694857577409556,
2029
+ "loss": 2.7933050537109376,
2030
+ "step": 26000
2031
+ },
2032
+ {
2033
+ "epoch": 0.23636363636363636,
2034
+ "eval_loss": 3.1705970764160156,
2035
+ "eval_runtime": 6.8357,
2036
+ "eval_samples_per_second": 84.264,
2037
+ "eval_steps_per_second": 21.066,
2038
+ "step": 26000
2039
+ },
2040
+ {
2041
+ "epoch": 0.23727272727272727,
2042
+ "grad_norm": 0.15482839941978455,
2043
+ "learning_rate": 0.0008685208405941662,
2044
+ "loss": 2.8198681640625,
2045
+ "step": 26100
2046
+ },
2047
+ {
2048
+ "epoch": 0.2381818181818182,
2049
+ "grad_norm": 0.14043229818344116,
2050
+ "learning_rate": 0.0008675529093215384,
2051
+ "loss": 2.8507424926757814,
2052
+ "step": 26200
2053
+ },
2054
+ {
2055
+ "epoch": 0.2390909090909091,
2056
+ "grad_norm": 0.13602057099342346,
2057
+ "learning_rate": 0.0008665819718397658,
2058
+ "loss": 2.841172180175781,
2059
+ "step": 26300
2060
+ },
2061
+ {
2062
+ "epoch": 0.24,
2063
+ "grad_norm": 0.1507735699415207,
2064
+ "learning_rate": 0.0008656080360901299,
2065
+ "loss": 2.8332550048828127,
2066
+ "step": 26400
2067
+ },
2068
+ {
2069
+ "epoch": 0.2409090909090909,
2070
+ "grad_norm": 0.14570394158363342,
2071
+ "learning_rate": 0.0008646311100384352,
2072
+ "loss": 2.815726013183594,
2073
+ "step": 26500
2074
+ },
2075
+ {
2076
+ "epoch": 0.24181818181818182,
2077
+ "grad_norm": 0.15119144320487976,
2078
+ "learning_rate": 0.0008636512016749436,
2079
+ "loss": 2.7973052978515627,
2080
+ "step": 26600
2081
+ },
2082
+ {
2083
+ "epoch": 0.24272727272727274,
2084
+ "grad_norm": 0.1478470116853714,
2085
+ "learning_rate": 0.0008626683190143092,
2086
+ "loss": 2.8057537841796876,
2087
+ "step": 26700
2088
+ },
2089
+ {
2090
+ "epoch": 0.24363636363636362,
2091
+ "grad_norm": 0.17405441403388977,
2092
+ "learning_rate": 0.0008616824700955132,
2093
+ "loss": 2.8201614379882813,
2094
+ "step": 26800
2095
+ },
2096
+ {
2097
+ "epoch": 0.24454545454545454,
2098
+ "grad_norm": 0.1828102022409439,
2099
+ "learning_rate": 0.0008606936629817973,
2100
+ "loss": 2.817716064453125,
2101
+ "step": 26900
2102
+ },
2103
+ {
2104
+ "epoch": 0.24545454545454545,
2105
+ "grad_norm": 0.1402510702610016,
2106
+ "learning_rate": 0.0008597019057605986,
2107
+ "loss": 2.8126416015625,
2108
+ "step": 27000
2109
+ },
2110
+ {
2111
+ "epoch": 0.24545454545454545,
2112
+ "eval_loss": 3.1654067039489746,
2113
+ "eval_runtime": 6.8224,
2114
+ "eval_samples_per_second": 84.428,
2115
+ "eval_steps_per_second": 21.107,
2116
+ "step": 27000
2117
+ },
2118
+ {
2119
+ "epoch": 0.24636363636363637,
2120
+ "grad_norm": 0.15282770991325378,
2121
+ "learning_rate": 0.000858707206543483,
2122
+ "loss": 2.814878234863281,
2123
+ "step": 27100
2124
+ },
2125
+ {
2126
+ "epoch": 0.24727272727272728,
2127
+ "grad_norm": 0.1374608278274536,
2128
+ "learning_rate": 0.0008577095734660788,
2129
+ "loss": 2.8010260009765626,
2130
+ "step": 27200
2131
+ },
2132
+ {
2133
+ "epoch": 0.24818181818181817,
2134
+ "grad_norm": 0.14548851549625397,
2135
+ "learning_rate": 0.0008567090146880105,
2136
+ "loss": 2.828005676269531,
2137
+ "step": 27300
2138
+ },
2139
+ {
2140
+ "epoch": 0.24909090909090909,
2141
+ "grad_norm": 0.1567397266626358,
2142
+ "learning_rate": 0.0008557055383928316,
2143
+ "loss": 2.78892578125,
2144
+ "step": 27400
2145
+ },
2146
+ {
2147
+ "epoch": 0.25,
2148
+ "grad_norm": 0.17172624170780182,
2149
+ "learning_rate": 0.0008546991527879581,
2150
+ "loss": 2.8362548828125,
2151
+ "step": 27500
2152
+ },
2153
+ {
2154
+ "epoch": 0.2509090909090909,
2155
+ "grad_norm": 0.1834629327058792,
2156
+ "learning_rate": 0.000853689866104601,
2157
+ "loss": 2.799326171875,
2158
+ "step": 27600
2159
+ },
2160
+ {
2161
+ "epoch": 0.25181818181818183,
2162
+ "grad_norm": 0.14964266121387482,
2163
+ "learning_rate": 0.0008526776865976997,
2164
+ "loss": 2.7806500244140624,
2165
+ "step": 27700
2166
+ },
2167
+ {
2168
+ "epoch": 0.25272727272727274,
2169
+ "grad_norm": 0.1613718867301941,
2170
+ "learning_rate": 0.0008516626225458535,
2171
+ "loss": 2.8114141845703124,
2172
+ "step": 27800
2173
+ },
2174
+ {
2175
+ "epoch": 0.25363636363636366,
2176
+ "grad_norm": 0.15746520459651947,
2177
+ "learning_rate": 0.0008506446822512541,
2178
+ "loss": 2.7960455322265627,
2179
+ "step": 27900
2180
+ },
2181
+ {
2182
+ "epoch": 0.2545454545454545,
2183
+ "grad_norm": 0.14515548944473267,
2184
+ "learning_rate": 0.0008496238740396188,
2185
+ "loss": 2.848003234863281,
2186
+ "step": 28000
2187
+ },
2188
+ {
2189
+ "epoch": 0.2545454545454545,
2190
+ "eval_loss": 3.1647140979766846,
2191
+ "eval_runtime": 6.7942,
2192
+ "eval_samples_per_second": 84.778,
2193
+ "eval_steps_per_second": 21.195,
2194
+ "step": 28000
2195
  }
2196
  ],
2197
  "logging_steps": 100,
 
2211
  "attributes": {}
2212
  }
2213
  },
2214
+ "total_flos": 6.97608267890688e+17,
2215
  "train_batch_size": 22,
2216
  "trial_name": null,
2217
  "trial_params": null