CodeIsAbstract commited on
Commit
0ce463c
·
verified ·
1 Parent(s): 6f385d6

Training in progress, step 200, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:133c80160271e4ee303a39ebbcac2ba90475e81972268eda8240ef021606ce06
3
  size 847599616
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6e95a88630e617675befbab4e666351d69d856382da4bda087bb3a19eedb9b10
3
  size 847599616
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:022053f484369f1c2fe6c5ac9387cfd79d83f6019f7b9da3652fc52af5a8b30a
3
  size 350603
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6169a4394a09d1aa6e26376804969472c16f7db53679a1fb38b5bf24149df51f
3
  size 350603
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:a14ea651aa56969d3e22c9ba563855987e3222470a3a49128fb73a819760aa1e
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0bef41f725df412ca95cdfe05f60b1b444d77c340f60fb943e0b05b8ff85dc70
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:f420a398e501a060ab026373fbb64a49ebca6f8ce9e0b9e60155447b04592b02
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ab66db99117673b461ceb8f3865fe0441f45aa01085a419aba1737c22700a3ed
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.9,
6
  "eval_steps": 20,
7
- "global_step": 180,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -341,6 +341,43 @@
341
  "eval_samples_per_second": 390.315,
342
  "eval_steps_per_second": 65.183,
343
  "step": 180
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
344
  }
345
  ],
346
  "logging_steps": 5,
@@ -355,7 +392,7 @@
355
  "should_evaluate": false,
356
  "should_log": false,
357
  "should_save": true,
358
- "should_training_stop": false
359
  },
360
  "attributes": {}
361
  }
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 1.0,
6
  "eval_steps": 20,
7
+ "global_step": 200,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
341
  "eval_samples_per_second": 390.315,
342
  "eval_steps_per_second": 65.183,
343
  "step": 180
344
+ },
345
+ {
346
+ "epoch": 0.925,
347
+ "grad_norm": 0.7244570255279541,
348
+ "learning_rate": 6.958217944530287e-08,
349
+ "loss": 19.646340942382814,
350
+ "step": 185
351
+ },
352
+ {
353
+ "epoch": 0.95,
354
+ "grad_norm": 0.8131192922592163,
355
+ "learning_rate": 3.2989850255235265e-08,
356
+ "loss": 19.582081604003907,
357
+ "step": 190
358
+ },
359
+ {
360
+ "epoch": 0.975,
361
+ "grad_norm": 0.8881648182868958,
362
+ "learning_rate": 9.834194909977168e-09,
363
+ "loss": 19.577865600585938,
364
+ "step": 195
365
+ },
366
+ {
367
+ "epoch": 1.0,
368
+ "grad_norm": 0.9109742641448975,
369
+ "learning_rate": 2.7339001506199164e-10,
370
+ "loss": 19.3023681640625,
371
+ "step": 200
372
+ },
373
+ {
374
+ "epoch": 1.0,
375
+ "eval_accuracy": 0.07755555555555556,
376
+ "eval_loss": 9.678764343261719,
377
+ "eval_runtime": 2.5817,
378
+ "eval_samples_per_second": 387.336,
379
+ "eval_steps_per_second": 64.685,
380
+ "step": 200
381
  }
382
  ],
383
  "logging_steps": 5,
 
392
  "should_evaluate": false,
393
  "should_log": false,
394
  "should_save": true,
395
+ "should_training_stop": true
396
  },
397
  "attributes": {}
398
  }