CodeIsAbstract commited on
Commit
42c9a86
·
verified ·
1 Parent(s): a699de7

Training in progress, step 140, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:77c00e25cdc0159a953b89e31ee75fb9f4f04268f163b9148e898a67d1ad3fe2
3
  size 847599616
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:dc5bdefdaf7ffa59db1d2244a9bf82cb79bb779b47177bfcfe82cbe4e23b05d1
3
  size 847599616
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:75ec1a2907af41bcd49fe20d0461096a9770864c1c9061542df1c79e4a507473
3
  size 350603
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:27b83988569e6745308f920b05adabfd2539a9e6e063c09c7eb24770d002a296
3
  size 350603
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:96a091ed1da45753ae33db029e7b844183915b5f9838c10180e2883aeefdf91d
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c247b88b6d33018a1baf3f963dc59f2afb08b3ad86ca462a6417c10f3bb5cf51
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:7815f17b7bd928390d8a057e2a19101b8f840de5d7f859603bfc35694ee86edf
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c40d5e94eed411043d006187ef3d57f655338dfd7cfaaf34e38342dbbae53acc
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.5,
6
  "eval_steps": 20,
7
- "global_step": 100,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -193,6 +193,80 @@
193
  "eval_samples_per_second": 414.406,
194
  "eval_steps_per_second": 69.206,
195
  "step": 100
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
196
  }
197
  ],
198
  "logging_steps": 5,
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.7,
6
  "eval_steps": 20,
7
+ "global_step": 140,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
193
  "eval_samples_per_second": 414.406,
194
  "eval_steps_per_second": 69.206,
195
  "step": 100
196
+ },
197
+ {
198
+ "epoch": 0.525,
199
+ "grad_norm": 0.4181952476501465,
200
+ "learning_rate": 2.033067889532717e-06,
201
+ "loss": 10.07513656616211,
202
+ "step": 105
203
+ },
204
+ {
205
+ "epoch": 0.55,
206
+ "grad_norm": 0.5301581025123596,
207
+ "learning_rate": 1.8678188313486012e-06,
208
+ "loss": 10.312834930419921,
209
+ "step": 110
210
+ },
211
+ {
212
+ "epoch": 0.575,
213
+ "grad_norm": 0.5450895428657532,
214
+ "learning_rate": 1.7034727045763157e-06,
215
+ "loss": 10.073713684082032,
216
+ "step": 115
217
+ },
218
+ {
219
+ "epoch": 0.6,
220
+ "grad_norm": 0.4884032905101776,
221
+ "learning_rate": 1.541152159906497e-06,
222
+ "loss": 10.02478485107422,
223
+ "step": 120
224
+ },
225
+ {
226
+ "epoch": 0.6,
227
+ "eval_accuracy": 0.06626984126984127,
228
+ "eval_loss": 10.08950138092041,
229
+ "eval_runtime": 2.5801,
230
+ "eval_samples_per_second": 387.588,
231
+ "eval_steps_per_second": 64.727,
232
+ "step": 120
233
+ },
234
+ {
235
+ "epoch": 0.625,
236
+ "grad_norm": 0.45030277967453003,
237
+ "learning_rate": 1.3819660112501052e-06,
238
+ "loss": 10.068260192871094,
239
+ "step": 125
240
+ },
241
+ {
242
+ "epoch": 0.65,
243
+ "grad_norm": 0.47731924057006836,
244
+ "learning_rate": 1.227001661415096e-06,
245
+ "loss": 10.119559478759765,
246
+ "step": 130
247
+ },
248
+ {
249
+ "epoch": 0.675,
250
+ "grad_norm": 0.4541228711605072,
251
+ "learning_rate": 1.0773176740426246e-06,
252
+ "loss": 10.025191497802734,
253
+ "step": 135
254
+ },
255
+ {
256
+ "epoch": 0.7,
257
+ "grad_norm": 0.5474848747253418,
258
+ "learning_rate": 9.339365425440129e-07,
259
+ "loss": 9.916156005859374,
260
+ "step": 140
261
+ },
262
+ {
263
+ "epoch": 0.7,
264
+ "eval_accuracy": 0.06855555555555555,
265
+ "eval_loss": 9.982182502746582,
266
+ "eval_runtime": 2.4782,
267
+ "eval_samples_per_second": 403.514,
268
+ "eval_steps_per_second": 67.387,
269
+ "step": 140
270
  }
271
  ],
272
  "logging_steps": 5,