CodeIsAbstract commited on
Commit
f29b8a2
·
verified ·
1 Parent(s): 1bc7dbc

Training in progress, step 140, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:058f12df8fdc50c32a197f5f5c952f739fe65ac649ff7a369a57bd28761b307a
3
  size 847599616
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:184e18cfcd9552369bf51740f68926e3162f9bdbb01d2b69fbb0ec79edd52a45
3
  size 847599616
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:75e7be1ace81f748a01dd0da135950b137996dc9c206f8885eb59fc7fbceefd6
3
  size 350603
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:971f78334d57716402776ec08101e08f7885ef96295540a7de3ac17f04991f8b
3
  size 350603
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:443907af357cccf92496cdd4e04b21f17558d4acf38fddc732c70cd7db47e70d
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bfad5b1db434a4570e357f1971d87bf80fdc19c2e91af8a74bce9bbf251a95cc
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:cc32de04bd8951ded22e38a3a317dcc3e3d6e420820aadb0c1fc7777161631b4
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c40d5e94eed411043d006187ef3d57f655338dfd7cfaaf34e38342dbbae53acc
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.6,
6
  "eval_steps": 20,
7
- "global_step": 120,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -230,6 +230,43 @@
230
  "eval_samples_per_second": 356.77,
231
  "eval_steps_per_second": 59.581,
232
  "step": 120
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
233
  }
234
  ],
235
  "logging_steps": 5,
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.7,
6
  "eval_steps": 20,
7
+ "global_step": 140,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
230
  "eval_samples_per_second": 356.77,
231
  "eval_steps_per_second": 59.581,
232
  "step": 120
233
+ },
234
+ {
235
+ "epoch": 0.625,
236
+ "grad_norm": 0.5889272093772888,
237
+ "learning_rate": 1.3819660112501052e-06,
238
+ "loss": 20.15807647705078,
239
+ "step": 125
240
+ },
241
+ {
242
+ "epoch": 0.65,
243
+ "grad_norm": 0.5750179886817932,
244
+ "learning_rate": 1.227001661415096e-06,
245
+ "loss": 20.040406799316408,
246
+ "step": 130
247
+ },
248
+ {
249
+ "epoch": 0.675,
250
+ "grad_norm": 0.719745934009552,
251
+ "learning_rate": 1.0773176740426246e-06,
252
+ "loss": 20.01085662841797,
253
+ "step": 135
254
+ },
255
+ {
256
+ "epoch": 0.7,
257
+ "grad_norm": 0.7709663510322571,
258
+ "learning_rate": 9.339365425440129e-07,
259
+ "loss": 19.724040222167968,
260
+ "step": 140
261
+ },
262
+ {
263
+ "epoch": 0.7,
264
+ "eval_accuracy": 0.07247619047619047,
265
+ "eval_loss": 9.954747200012207,
266
+ "eval_runtime": 2.6401,
267
+ "eval_samples_per_second": 378.767,
268
+ "eval_steps_per_second": 63.254,
269
+ "step": 140
270
  }
271
  ],
272
  "logging_steps": 5,