CodeIsAbstract commited on
Commit
3b9d018
·
verified ·
1 Parent(s): 6f936d9

Training in progress, step 1500, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b5918f923e94a1c71c1343bdcf10beeef3df1b930ad244fba32fd7f174ba907d
3
  size 847599616
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:13ffc792f3d259993d089983addf06408c5d4168bb80ae4e93d9e27c88ac2002
3
  size 847599616
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:3efa0ed49bd9be95076d7069e5e9edf45f6b79f66e0033c9a85e8f6d1f88f0b2
3
  size 1386414411
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7a67906f8c7c9a7e76b55b46a0195852521231f190af25c50db78e7a42712a24
3
  size 1386414411
last-checkpoint/rng_state_0.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:536f3bf5d8d9a338dc3c13d4a9497341d1858e9170a623670fdf984c7300d07b
3
  size 14917
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:38fd2ee53c77ea2f7dbd66aca15b5e373033905c0f24009f095167575b44f3c3
3
  size 14917
last-checkpoint/rng_state_1.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:feac55dc4e1aa4e2fb9533ef48c19881a76f1225ae029d1ded10aa6105f9d143
3
  size 14917
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6633e86d4c67f74dfdd7f692c12dadf065f71b50d638c022301ad30cc5a4b374
3
  size 14917
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:a05fb06c8f2309f7e205252b1a3311f0b9687d7493c125c7e1233cf078e7b73e
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4fda8308b847684d2c9f3c998b6decc82d851c5d48d991f8092b8612e3e1813b
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.3333333333333333,
6
  "eval_steps": 200,
7
- "global_step": 1000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -193,6 +193,94 @@
193
  "eval_samples_per_second": 63.185,
194
  "eval_steps_per_second": 2.022,
195
  "step": 1000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
196
  }
197
  ],
198
  "logging_steps": 50,
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.5,
6
  "eval_steps": 200,
7
+ "global_step": 1500,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
193
  "eval_samples_per_second": 63.185,
194
  "eval_steps_per_second": 2.022,
195
  "step": 1000
196
+ },
197
+ {
198
+ "epoch": 0.35,
199
+ "grad_norm": 869790.875,
200
+ "learning_rate": 7.739353226541009e-05,
201
+ "loss": 78.3315,
202
+ "step": 1050
203
+ },
204
+ {
205
+ "epoch": 0.36666666666666664,
206
+ "grad_norm": 131137.71875,
207
+ "learning_rate": 7.504771636387163e-05,
208
+ "loss": 79.5684,
209
+ "step": 1100
210
+ },
211
+ {
212
+ "epoch": 0.38333333333333336,
213
+ "grad_norm": 188537.671875,
214
+ "learning_rate": 7.262583137097018e-05,
215
+ "loss": 79.0903,
216
+ "step": 1150
217
+ },
218
+ {
219
+ "epoch": 0.4,
220
+ "grad_norm": 38120.7890625,
221
+ "learning_rate": 7.013523247183e-05,
222
+ "loss": 79.5616,
223
+ "step": 1200
224
+ },
225
+ {
226
+ "epoch": 0.4,
227
+ "eval_accuracy": 0.2313888600523758,
228
+ "eval_loss": 4.960353374481201,
229
+ "eval_runtime": 7.869,
230
+ "eval_samples_per_second": 63.54,
231
+ "eval_steps_per_second": 2.033,
232
+ "step": 1200
233
+ },
234
+ {
235
+ "epoch": 0.4166666666666667,
236
+ "grad_norm": 178847.84375,
237
+ "learning_rate": 6.758348353345014e-05,
238
+ "loss": 78.9412,
239
+ "step": 1250
240
+ },
241
+ {
242
+ "epoch": 0.43333333333333335,
243
+ "grad_norm": 72944.7734375,
244
+ "learning_rate": 6.497833413348909e-05,
245
+ "loss": 78.9907,
246
+ "step": 1300
247
+ },
248
+ {
249
+ "epoch": 0.45,
250
+ "grad_norm": 82608.953125,
251
+ "learning_rate": 6.232769602505203e-05,
252
+ "loss": 78.8287,
253
+ "step": 1350
254
+ },
255
+ {
256
+ "epoch": 0.4666666666666667,
257
+ "grad_norm": 321814.40625,
258
+ "learning_rate": 5.963961910895676e-05,
259
+ "loss": 79.5967,
260
+ "step": 1400
261
+ },
262
+ {
263
+ "epoch": 0.4666666666666667,
264
+ "eval_accuracy": 0.22584767922654594,
265
+ "eval_loss": 5.036545753479004,
266
+ "eval_runtime": 8.0524,
267
+ "eval_samples_per_second": 62.094,
268
+ "eval_steps_per_second": 1.987,
269
+ "step": 1400
270
+ },
271
+ {
272
+ "epoch": 0.48333333333333334,
273
+ "grad_norm": 27832.90625,
274
+ "learning_rate": 5.692226698644938e-05,
275
+ "loss": 80.2996,
276
+ "step": 1450
277
+ },
278
+ {
279
+ "epoch": 0.5,
280
+ "grad_norm": 165018.953125,
281
+ "learning_rate": 5.418389216661579e-05,
282
+ "loss": 82.4446,
283
+ "step": 1500
284
  }
285
  ],
286
  "logging_steps": 50,