CodeIsAbstract commited on
Commit
32ee220
·
verified ·
1 Parent(s): 9f5a2ea

Training in progress, step 4000, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:3e844c140f0b364ef240d9d283f3474471aa887e9a4e7f8afe6ca0d5062fa1d8
3
  size 847599616
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:eec6ae3c232115c0c2fe4bcf646b1c03138328548b645022df7b55df2d6ff03b
3
  size 847599616
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:d6e57c8be8d618705f188b94fc5169164f579e23fc7d687c76672146f866dfc5
3
  size 1386414411
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2c8dc5c30771f73079678db63765b219aafca9ea4b8e33ef2987d0d846fa62d3
3
  size 1386414411
last-checkpoint/rng_state_0.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:9cd45c472c02f69686aade1ec7cee7512c8dba6e6bde5e0bd023fd4f8f2f3548
3
  size 14917
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7864fb6e928e45d4215a1ae96eab6e34cbc82f54e4a38e3cf2e1449f98239105
3
  size 14917
last-checkpoint/rng_state_1.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:09714a2ef70dd987c21ebd404103aea88be622e980ab90fe03c4cb22a4d6d0de
3
  size 14917
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bb8ff3d7c5e846455471242a9719dd9767ec3729631e3efca61eaecbd0ad4ee7
3
  size 14917
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:c0ed1549b52af39b27c28b24276ca81b4d37dad6af883ad09a3c1268b5bcb1b0
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:561e0049aa6e5e793844e867537a9c947ef9ba1ad03fe6ba44d328d1dffc9702
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.13333333333333333,
6
  "eval_steps": 1000,
7
- "global_step": 2000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -166,6 +166,164 @@
166
  "eval_samples_per_second": 7.646,
167
  "eval_steps_per_second": 0.382,
168
  "step": 2000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
169
  }
170
  ],
171
  "logging_steps": 100,
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.26666666666666666,
6
  "eval_steps": 1000,
7
+ "global_step": 4000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
166
  "eval_samples_per_second": 7.646,
167
  "eval_steps_per_second": 0.382,
168
  "step": 2000
169
+ },
170
+ {
171
+ "epoch": 0.14,
172
+ "grad_norm": 1.456148386001587,
173
+ "learning_rate": 0.00039122008179569447,
174
+ "loss": 10.4031689453125,
175
+ "step": 2100
176
+ },
177
+ {
178
+ "epoch": 0.14666666666666667,
179
+ "grad_norm": 1.4301263093948364,
180
+ "learning_rate": 0.00038988163405964595,
181
+ "loss": 10.173363037109375,
182
+ "step": 2200
183
+ },
184
+ {
185
+ "epoch": 0.15333333333333332,
186
+ "grad_norm": 1.0371617078781128,
187
+ "learning_rate": 0.00038845090041619265,
188
+ "loss": 10.063040771484374,
189
+ "step": 2300
190
+ },
191
+ {
192
+ "epoch": 0.16,
193
+ "grad_norm": 1.0449143648147583,
194
+ "learning_rate": 0.0003869285762277543,
195
+ "loss": 10.145305786132813,
196
+ "step": 2400
197
+ },
198
+ {
199
+ "epoch": 0.16666666666666666,
200
+ "grad_norm": 1.491047739982605,
201
+ "learning_rate": 0.00038531540137141165,
202
+ "loss": 10.095411376953125,
203
+ "step": 2500
204
+ },
205
+ {
206
+ "epoch": 0.17333333333333334,
207
+ "grad_norm": 1.216232419013977,
208
+ "learning_rate": 0.0003836121598793126,
209
+ "loss": 10.10360107421875,
210
+ "step": 2600
211
+ },
212
+ {
213
+ "epoch": 0.18,
214
+ "grad_norm": 1.0485482215881348,
215
+ "learning_rate": 0.0003818196795576189,
216
+ "loss": 9.9664892578125,
217
+ "step": 2700
218
+ },
219
+ {
220
+ "epoch": 0.18666666666666668,
221
+ "grad_norm": 1.1029548645019531,
222
+ "learning_rate": 0.00037993883158417654,
223
+ "loss": 9.9088525390625,
224
+ "step": 2800
225
+ },
226
+ {
227
+ "epoch": 0.19333333333333333,
228
+ "grad_norm": 1.0070501565933228,
229
+ "learning_rate": 0.00037797053008510834,
230
+ "loss": 9.888450927734375,
231
+ "step": 2900
232
+ },
233
+ {
234
+ "epoch": 0.2,
235
+ "grad_norm": 1.1356112957000732,
236
+ "learning_rate": 0.00037591573169053167,
237
+ "loss": 9.8390869140625,
238
+ "step": 3000
239
+ },
240
+ {
241
+ "epoch": 0.2,
242
+ "eval_accuracy": 0.2266908023483366,
243
+ "eval_loss": 9.943662643432617,
244
+ "eval_runtime": 65.3824,
245
+ "eval_samples_per_second": 7.647,
246
+ "eval_steps_per_second": 0.382,
247
+ "step": 3000
248
+ },
249
+ {
250
+ "epoch": 0.20666666666666667,
251
+ "grad_norm": 1.178817629814148,
252
+ "learning_rate": 0.0003737754350696192,
253
+ "loss": 9.806249389648437,
254
+ "step": 3100
255
+ },
256
+ {
257
+ "epoch": 0.21333333333333335,
258
+ "grad_norm": 1.1421138048171997,
259
+ "learning_rate": 0.00037155068044522735,
260
+ "loss": 9.715457763671875,
261
+ "step": 3200
262
+ },
263
+ {
264
+ "epoch": 0.22,
265
+ "grad_norm": 1.6934456825256348,
266
+ "learning_rate": 0.00036924254908832937,
267
+ "loss": 9.71255859375,
268
+ "step": 3300
269
+ },
270
+ {
271
+ "epoch": 0.22666666666666666,
272
+ "grad_norm": 1.1598275899887085,
273
+ "learning_rate": 0.00036685216279249815,
274
+ "loss": 9.716998291015624,
275
+ "step": 3400
276
+ },
277
+ {
278
+ "epoch": 0.23333333333333334,
279
+ "grad_norm": 1.1768417358398438,
280
+ "learning_rate": 0.000364380683328694,
281
+ "loss": 9.557822875976562,
282
+ "step": 3500
283
+ },
284
+ {
285
+ "epoch": 0.24,
286
+ "grad_norm": 1.4840753078460693,
287
+ "learning_rate": 0.0003618293118806232,
288
+ "loss": 9.56420654296875,
289
+ "step": 3600
290
+ },
291
+ {
292
+ "epoch": 0.24666666666666667,
293
+ "grad_norm": 1.2799503803253174,
294
+ "learning_rate": 0.00035919928846094094,
295
+ "loss": 9.548779296875,
296
+ "step": 3700
297
+ },
298
+ {
299
+ "epoch": 0.25333333333333335,
300
+ "grad_norm": 1.1078740358352661,
301
+ "learning_rate": 0.00035649189130858256,
302
+ "loss": 9.44154541015625,
303
+ "step": 3800
304
+ },
305
+ {
306
+ "epoch": 0.26,
307
+ "grad_norm": 1.173609972000122,
308
+ "learning_rate": 0.00035370843626751663,
309
+ "loss": 9.414360961914063,
310
+ "step": 3900
311
+ },
312
+ {
313
+ "epoch": 0.26666666666666666,
314
+ "grad_norm": 1.2394672632217407,
315
+ "learning_rate": 0.00035085027614722075,
316
+ "loss": 9.300681762695312,
317
+ "step": 4000
318
+ },
319
+ {
320
+ "epoch": 0.26666666666666666,
321
+ "eval_accuracy": 0.2545146771037182,
322
+ "eval_loss": 9.379138946533203,
323
+ "eval_runtime": 65.4591,
324
+ "eval_samples_per_second": 7.638,
325
+ "eval_steps_per_second": 0.382,
326
+ "step": 4000
327
  }
328
  ],
329
  "logging_steps": 100,