CodeIsAbstract commited on
Commit
9a91f5e
·
verified ·
1 Parent(s): c32e1ba

Training in progress, step 28000, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:e8fe178b2c865524971da242eead5a0a0fec5b3cb218040e9e466496006f5885
3
  size 529337896
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:cb0afa22ccef3c9a0ea3428b0ce49c7b49b701311e5530f6aed60817e79bf7b8
3
  size 529337896
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:0bcee50e95784bd04fda383abb23615395a0ad72d918cfafb72b7cef0032329d
3
  size 871247243
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:81aa75d70b877656bae98d60d9c24f3b5ef7089addac00c7ceb5e35601234b5b
3
  size 871247243
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b061322e6ec670b87a8f9896d884fe5261ed4165781876f01308a3b5eff45c4a
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:90d5c80c4317aec1cdd8b32ba40e7d9a283d92dfcce7300ea3ed6edd63c76074
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:891e10d00e5e712dd3d3f62daa558798b38eee3e75855dd02223a9bfb9d6ca61
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:72d75c8ad1707fd318e0f938501ec9134a4023e423bf08958c45c5e922653226
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.52,
6
  "eval_steps": 1000,
7
- "global_step": 26000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -2062,6 +2062,164 @@
2062
  "eval_samples_per_second": 86.439,
2063
  "eval_steps_per_second": 0.692,
2064
  "step": 26000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
2065
  }
2066
  ],
2067
  "logging_steps": 100,
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.56,
6
  "eval_steps": 1000,
7
+ "global_step": 28000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
2062
  "eval_samples_per_second": 86.439,
2063
  "eval_steps_per_second": 0.692,
2064
  "step": 26000
2065
+ },
2066
+ {
2067
+ "epoch": 0.522,
2068
+ "grad_norm": 0.16366560757160187,
2069
+ "learning_rate": 0.0010099867916842063,
2070
+ "loss": 3.349,
2071
+ "step": 26100
2072
+ },
2073
+ {
2074
+ "epoch": 0.524,
2075
+ "grad_norm": 0.18745005130767822,
2076
+ "learning_rate": 0.00100337307203178,
2077
+ "loss": 3.3381,
2078
+ "step": 26200
2079
+ },
2080
+ {
2081
+ "epoch": 0.526,
2082
+ "grad_norm": 0.14261376857757568,
2083
+ "learning_rate": 0.0009967592048302552,
2084
+ "loss": 3.334,
2085
+ "step": 26300
2086
+ },
2087
+ {
2088
+ "epoch": 0.528,
2089
+ "grad_norm": 0.16403239965438843,
2090
+ "learning_rate": 0.0009901454793916102,
2091
+ "loss": 3.3253,
2092
+ "step": 26400
2093
+ },
2094
+ {
2095
+ "epoch": 0.53,
2096
+ "grad_norm": 0.1447836309671402,
2097
+ "learning_rate": 0.00098353218502162,
2098
+ "loss": 3.3442,
2099
+ "step": 26500
2100
+ },
2101
+ {
2102
+ "epoch": 0.532,
2103
+ "grad_norm": 0.18312039971351624,
2104
+ "learning_rate": 0.0009769196110072061,
2105
+ "loss": 3.338,
2106
+ "step": 26600
2107
+ },
2108
+ {
2109
+ "epoch": 0.534,
2110
+ "grad_norm": 0.1727229803800583,
2111
+ "learning_rate": 0.0009703080466037767,
2112
+ "loss": 3.3183,
2113
+ "step": 26700
2114
+ },
2115
+ {
2116
+ "epoch": 0.536,
2117
+ "grad_norm": 0.15190576016902924,
2118
+ "learning_rate": 0.0009636977810225777,
2119
+ "loss": 3.3387,
2120
+ "step": 26800
2121
+ },
2122
+ {
2123
+ "epoch": 0.538,
2124
+ "grad_norm": 0.1397494077682495,
2125
+ "learning_rate": 0.0009570891034180394,
2126
+ "loss": 3.3415,
2127
+ "step": 26900
2128
+ },
2129
+ {
2130
+ "epoch": 0.54,
2131
+ "grad_norm": 0.1609794944524765,
2132
+ "learning_rate": 0.0009504823028751295,
2133
+ "loss": 3.3174,
2134
+ "step": 27000
2135
+ },
2136
+ {
2137
+ "epoch": 0.54,
2138
+ "eval_accuracy": 0.38231311154598824,
2139
+ "eval_loss": 3.3193719387054443,
2140
+ "eval_runtime": 11.9776,
2141
+ "eval_samples_per_second": 83.489,
2142
+ "eval_steps_per_second": 0.668,
2143
+ "step": 27000
2144
+ },
2145
+ {
2146
+ "epoch": 0.542,
2147
+ "grad_norm": 0.14202991127967834,
2148
+ "learning_rate": 0.0009438776683967071,
2149
+ "loss": 3.334,
2150
+ "step": 27100
2151
+ },
2152
+ {
2153
+ "epoch": 0.544,
2154
+ "grad_norm": 0.14222672581672668,
2155
+ "learning_rate": 0.0009372754888908796,
2156
+ "loss": 3.329,
2157
+ "step": 27200
2158
+ },
2159
+ {
2160
+ "epoch": 0.546,
2161
+ "grad_norm": 0.2155715525150299,
2162
+ "learning_rate": 0.000930676053158368,
2163
+ "loss": 3.3328,
2164
+ "step": 27300
2165
+ },
2166
+ {
2167
+ "epoch": 0.548,
2168
+ "grad_norm": 0.14550994336605072,
2169
+ "learning_rate": 0.0009240796498798694,
2170
+ "loss": 3.3314,
2171
+ "step": 27400
2172
+ },
2173
+ {
2174
+ "epoch": 0.55,
2175
+ "grad_norm": 0.1446721851825714,
2176
+ "learning_rate": 0.0009174865676034329,
2177
+ "loss": 3.322,
2178
+ "step": 27500
2179
+ },
2180
+ {
2181
+ "epoch": 0.552,
2182
+ "grad_norm": 0.15072402358055115,
2183
+ "learning_rate": 0.000910897094731836,
2184
+ "loss": 3.3292,
2185
+ "step": 27600
2186
+ },
2187
+ {
2188
+ "epoch": 0.554,
2189
+ "grad_norm": 0.14199484884738922,
2190
+ "learning_rate": 0.0009043115195099688,
2191
+ "loss": 3.3319,
2192
+ "step": 27700
2193
+ },
2194
+ {
2195
+ "epoch": 0.556,
2196
+ "grad_norm": 0.1559506356716156,
2197
+ "learning_rate": 0.0008977301300122259,
2198
+ "loss": 3.3161,
2199
+ "step": 27800
2200
+ },
2201
+ {
2202
+ "epoch": 0.558,
2203
+ "grad_norm": 0.14755868911743164,
2204
+ "learning_rate": 0.0008911532141299046,
2205
+ "loss": 3.3283,
2206
+ "step": 27900
2207
+ },
2208
+ {
2209
+ "epoch": 0.56,
2210
+ "grad_norm": 0.17486320436000824,
2211
+ "learning_rate": 0.000884581059558612,
2212
+ "loss": 3.3317,
2213
+ "step": 28000
2214
+ },
2215
+ {
2216
+ "epoch": 0.56,
2217
+ "eval_accuracy": 0.38318786692759293,
2218
+ "eval_loss": 3.3127212524414062,
2219
+ "eval_runtime": 13.6461,
2220
+ "eval_samples_per_second": 73.281,
2221
+ "eval_steps_per_second": 0.586,
2222
+ "step": 28000
2223
  }
2224
  ],
2225
  "logging_steps": 100,