CodeIsAbstract commited on
Commit
dadc93c
·
verified ·
1 Parent(s): 2db43a6

Training in progress, step 140, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:d47f50d75e32624acd21703332c797184b665fb4d2b10847a7d7de1432abb3a1
3
  size 847599616
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c5deddc4532a7e43a9d0f9fbe82070649a4eb6e36c4c10045bb971c255475d45
3
  size 847599616
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:f1345b0a7769c8848417baabda9535c454ba0aef0691913ff0f8c0d83f03bfc3
3
  size 350603
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:930c0e2ebbffa6eaa81c1c13cb56bae07035671452615a27785b151dda07ab8f
3
  size 350603
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:443907af357cccf92496cdd4e04b21f17558d4acf38fddc732c70cd7db47e70d
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bfad5b1db434a4570e357f1971d87bf80fdc19c2e91af8a74bce9bbf251a95cc
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:cc32de04bd8951ded22e38a3a317dcc3e3d6e420820aadb0c1fc7777161631b4
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c40d5e94eed411043d006187ef3d57f655338dfd7cfaaf34e38342dbbae53acc
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.6,
6
  "eval_steps": 20,
7
- "global_step": 120,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -230,6 +230,43 @@
230
  "eval_samples_per_second": 370.215,
231
  "eval_steps_per_second": 61.826,
232
  "step": 120
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
233
  }
234
  ],
235
  "logging_steps": 5,
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.7,
6
  "eval_steps": 20,
7
+ "global_step": 140,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
230
  "eval_samples_per_second": 370.215,
231
  "eval_steps_per_second": 61.826,
232
  "step": 120
233
+ },
234
+ {
235
+ "epoch": 0.625,
236
+ "grad_norm": 0.24475905299186707,
237
+ "learning_rate": 1.3819660112501052e-06,
238
+ "loss": 22.0078369140625,
239
+ "step": 125
240
+ },
241
+ {
242
+ "epoch": 0.65,
243
+ "grad_norm": 0.2379191815853119,
244
+ "learning_rate": 1.227001661415096e-06,
245
+ "loss": 22.009359741210936,
246
+ "step": 130
247
+ },
248
+ {
249
+ "epoch": 0.675,
250
+ "grad_norm": 0.26111480593681335,
251
+ "learning_rate": 1.0773176740426246e-06,
252
+ "loss": 21.976290893554687,
253
+ "step": 135
254
+ },
255
+ {
256
+ "epoch": 0.7,
257
+ "grad_norm": 0.28270959854125977,
258
+ "learning_rate": 9.339365425440129e-07,
259
+ "loss": 22.019345092773438,
260
+ "step": 140
261
+ },
262
+ {
263
+ "epoch": 0.7,
264
+ "eval_accuracy": 3.1746031746031745e-05,
265
+ "eval_loss": 11.009251594543457,
266
+ "eval_runtime": 2.5123,
267
+ "eval_samples_per_second": 398.045,
268
+ "eval_steps_per_second": 66.473,
269
+ "step": 140
270
  }
271
  ],
272
  "logging_steps": 5,