CodeIsAbstract commited on
Commit
229d773
·
verified ·
1 Parent(s): da73b46

Training in progress, step 180, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:c5e352bbc53dcdadcadec8245e6c4f457ebf7790fac51411b3b999cf44649beb
3
  size 847599616
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:12cdf2f4883dfe1cb904465c7a4280e60176df37be64c2c0be202f1ddef6d40d
3
  size 847599616
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:0a9d95665e37557687138c324ea96e1690e085e25829ffe4d8d0d87a57bee2f6
3
  size 1386414411
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:dc49098fa120abedb28fd7ea6da1802cfe2e944fb530ea93e0b43c79a14ae2c2
3
  size 1386414411
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:134a484e532ba4537112198f3087f08c6b36bc828e582ece1b5ba2be14f856b0
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:204484338aec1b64d23614eb2933e81e590b07783a7ad537045df85e45aa13d1
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:c40d5e94eed411043d006187ef3d57f655338dfd7cfaaf34e38342dbbae53acc
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f420a398e501a060ab026373fbb64a49ebca6f8ce9e0b9e60155447b04592b02
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.7,
6
  "eval_steps": 20,
7
- "global_step": 140,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -267,6 +267,80 @@
267
  "eval_samples_per_second": 170.824,
268
  "eval_steps_per_second": 28.528,
269
  "step": 140
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
270
  }
271
  ],
272
  "logging_steps": 5,
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.9,
6
  "eval_steps": 20,
7
+ "global_step": 180,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
267
  "eval_samples_per_second": 170.824,
268
  "eval_steps_per_second": 28.528,
269
  "step": 140
270
+ },
271
+ {
272
+ "epoch": 0.725,
273
+ "grad_norm": 3.915391683578491,
274
+ "learning_rate": 7.978377054339498e-07,
275
+ "loss": 18.57097473144531,
276
+ "step": 145
277
+ },
278
+ {
279
+ "epoch": 0.75,
280
+ "grad_norm": 3.8307833671569824,
281
+ "learning_rate": 6.699508557723032e-07,
282
+ "loss": 18.58392333984375,
283
+ "step": 150
284
+ },
285
+ {
286
+ "epoch": 0.775,
287
+ "grad_norm": 3.8549070358276367,
288
+ "learning_rate": 5.511495904178221e-07,
289
+ "loss": 18.670741271972656,
290
+ "step": 155
291
+ },
292
+ {
293
+ "epoch": 0.8,
294
+ "grad_norm": 3.9556758403778076,
295
+ "learning_rate": 4.4224544247577535e-07,
296
+ "loss": 18.56670227050781,
297
+ "step": 160
298
+ },
299
+ {
300
+ "epoch": 0.8,
301
+ "eval_accuracy": 0.07810371819960861,
302
+ "eval_loss": 9.292845726013184,
303
+ "eval_runtime": 5.9755,
304
+ "eval_samples_per_second": 167.349,
305
+ "eval_steps_per_second": 27.947,
306
+ "step": 160
307
+ },
308
+ {
309
+ "epoch": 0.825,
310
+ "grad_norm": 3.857797145843506,
311
+ "learning_rate": 3.439823377039599e-07,
312
+ "loss": 18.518038940429687,
313
+ "step": 165
314
+ },
315
+ {
316
+ "epoch": 0.85,
317
+ "grad_norm": 4.037227153778076,
318
+ "learning_rate": 2.570315127454452e-07,
319
+ "loss": 18.696867370605467,
320
+ "step": 170
321
+ },
322
+ {
323
+ "epoch": 0.875,
324
+ "grad_norm": 3.76861572265625,
325
+ "learning_rate": 1.8198692990167497e-07,
326
+ "loss": 18.457827758789062,
327
+ "step": 175
328
+ },
329
+ {
330
+ "epoch": 0.9,
331
+ "grad_norm": 3.7363455295562744,
332
+ "learning_rate": 1.1936121976767767e-07,
333
+ "loss": 18.609834289550783,
334
+ "step": 180
335
+ },
336
+ {
337
+ "epoch": 0.9,
338
+ "eval_accuracy": 0.07823287671232877,
339
+ "eval_loss": 9.286931037902832,
340
+ "eval_runtime": 5.7992,
341
+ "eval_samples_per_second": 172.439,
342
+ "eval_steps_per_second": 28.797,
343
+ "step": 180
344
  }
345
  ],
346
  "logging_steps": 5,