CodeIsAbstract commited on
Commit
933bdc8
·
verified ·
1 Parent(s): 6972672

Training in progress, step 100, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:05146d0139b00f4be557d2f9fb9850bd3c3eef0191546e8127aeaca409558595
3
  size 847599616
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f6a427c8d68c66b1624c75f774a560c40fdebdb2d941db156176d4f64f868f39
3
  size 847599616
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:d763a617ca5e65007be84779b9da87d83b12cd96b4abaead9266b6ea7c245274
3
  size 1386414411
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:43abfe5db79179aacaa8d41c7e4a05eb44e72d224079595d6d693845af52a2d8
3
  size 1386414411
last-checkpoint/rng_state_0.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:c27d5e9c91dc5b481af1a74df9cf562559184e94009cb11852e3c2011ad2ace9
3
  size 14917
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:172c187709f4e107d7af2bbca0feab9c6e8888e30d1d3ca9aacd5e9bf0ab1a69
3
  size 14917
last-checkpoint/rng_state_1.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:50f189793170f205a894136fd88e55d8f1f19c6ff974d6ec6c00c36064a79076
3
  size 14917
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5253c46d70f6e7398a95913bd2b428f7e1052a7a71f011fabefce2b0c0342d83
3
  size 14917
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:c546bfb0b72265a73baa6ed5d9e7f51e075e736bf2a6896c42c569e9647b77e7
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:28ce995976843ea29dcf27303959f0b6a782b62ac5ec5d7682e78bdf61d82c85
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.09,
6
  "eval_steps": 5,
7
- "global_step": 90,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -170,6 +170,31 @@
170
  "eval_samples_per_second": 13.864,
171
  "eval_steps_per_second": 6.932,
172
  "step": 90
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
173
  }
174
  ],
175
  "logging_steps": 100,
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.1,
6
  "eval_steps": 5,
7
+ "global_step": 100,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
170
  "eval_samples_per_second": 13.864,
171
  "eval_steps_per_second": 6.932,
172
  "step": 90
173
+ },
174
+ {
175
+ "epoch": 0.095,
176
+ "eval_accuracy": 0.06873333333333333,
177
+ "eval_loss": 16.8882999420166,
178
+ "eval_runtime": 40.7406,
179
+ "eval_samples_per_second": 12.273,
180
+ "eval_steps_per_second": 6.136,
181
+ "step": 95
182
+ },
183
+ {
184
+ "epoch": 0.1,
185
+ "grad_norm": 3.5192229747772217,
186
+ "learning_rate": 3.973800426880847e-06,
187
+ "loss": 144.29556640625,
188
+ "step": 100
189
+ },
190
+ {
191
+ "epoch": 0.1,
192
+ "eval_accuracy": 0.07646666666666667,
193
+ "eval_loss": 16.831998825073242,
194
+ "eval_runtime": 35.9838,
195
+ "eval_samples_per_second": 13.895,
196
+ "eval_steps_per_second": 6.948,
197
+ "step": 100
198
  }
199
  ],
200
  "logging_steps": 100,