CodeIsAbstract commited on
Commit
061bc39
·
verified ·
1 Parent(s): a33d50c

Training in progress, step 140, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:296451955b91a879b69542db0ed8f120795369ac922259c8fd78ab3b037e8e8f
3
  size 847599616
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c5e352bbc53dcdadcadec8245e6c4f457ebf7790fac51411b3b999cf44649beb
3
  size 847599616
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:421372eadde9efaf736416f68e72ffb171c721f0dbad12b193f1b2885ea775f5
3
  size 1386414411
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0a9d95665e37557687138c324ea96e1690e085e25829ffe4d8d0d87a57bee2f6
3
  size 1386414411
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:3cd719d277ab3a3c6d7d709a00e4a19652ccafb36d0add1dae3055b0f75c16da
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:134a484e532ba4537112198f3087f08c6b36bc828e582ece1b5ba2be14f856b0
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:7815f17b7bd928390d8a057e2a19101b8f840de5d7f859603bfc35694ee86edf
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c40d5e94eed411043d006187ef3d57f655338dfd7cfaaf34e38342dbbae53acc
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.5,
6
  "eval_steps": 20,
7
- "global_step": 100,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -193,6 +193,80 @@
193
  "eval_samples_per_second": 173.409,
194
  "eval_steps_per_second": 28.959,
195
  "step": 100
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
196
  }
197
  ],
198
  "logging_steps": 5,
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.7,
6
  "eval_steps": 20,
7
+ "global_step": 140,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
193
  "eval_samples_per_second": 173.409,
194
  "eval_steps_per_second": 28.959,
195
  "step": 100
196
+ },
197
+ {
198
+ "epoch": 0.525,
199
+ "grad_norm": 3.9933605194091797,
200
+ "learning_rate": 2.033067889532717e-06,
201
+ "loss": 18.811434936523437,
202
+ "step": 105
203
+ },
204
+ {
205
+ "epoch": 0.55,
206
+ "grad_norm": 3.9667704105377197,
207
+ "learning_rate": 1.8678188313486012e-06,
208
+ "loss": 18.78875732421875,
209
+ "step": 110
210
+ },
211
+ {
212
+ "epoch": 0.575,
213
+ "grad_norm": 4.048539161682129,
214
+ "learning_rate": 1.7034727045763157e-06,
215
+ "loss": 18.773907470703126,
216
+ "step": 115
217
+ },
218
+ {
219
+ "epoch": 0.6,
220
+ "grad_norm": 3.9434831142425537,
221
+ "learning_rate": 1.541152159906497e-06,
222
+ "loss": 18.89387664794922,
223
+ "step": 120
224
+ },
225
+ {
226
+ "epoch": 0.6,
227
+ "eval_accuracy": 0.0761252446183953,
228
+ "eval_loss": 9.337961196899414,
229
+ "eval_runtime": 5.872,
230
+ "eval_samples_per_second": 170.3,
231
+ "eval_steps_per_second": 28.44,
232
+ "step": 120
233
+ },
234
+ {
235
+ "epoch": 0.625,
236
+ "grad_norm": 3.8308157920837402,
237
+ "learning_rate": 1.3819660112501052e-06,
238
+ "loss": 18.72384033203125,
239
+ "step": 125
240
+ },
241
+ {
242
+ "epoch": 0.65,
243
+ "grad_norm": 4.8196702003479,
244
+ "learning_rate": 1.227001661415096e-06,
245
+ "loss": 18.456109619140626,
246
+ "step": 130
247
+ },
248
+ {
249
+ "epoch": 0.675,
250
+ "grad_norm": 8.1970796585083,
251
+ "learning_rate": 1.0773176740426246e-06,
252
+ "loss": 18.59037628173828,
253
+ "step": 135
254
+ },
255
+ {
256
+ "epoch": 0.7,
257
+ "grad_norm": 4.069243907928467,
258
+ "learning_rate": 9.339365425440129e-07,
259
+ "loss": 18.677517700195313,
260
+ "step": 140
261
+ },
262
+ {
263
+ "epoch": 0.7,
264
+ "eval_accuracy": 0.0767279843444227,
265
+ "eval_loss": 9.3079252243042,
266
+ "eval_runtime": 5.854,
267
+ "eval_samples_per_second": 170.824,
268
+ "eval_steps_per_second": 28.528,
269
+ "step": 140
270
  }
271
  ],
272
  "logging_steps": 5,