ChiefTheLord commited on
Commit
2838a21
·
verified ·
1 Parent(s): 0c43a4c

Upload folder using huggingface_hub

Browse files
checkpoints-v1.3/checkpoint-10240/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9e6634a78b327712856504fb465a0635797eade7db44f8aa3a353dce7134f07b
3
+ size 4634068
checkpoints-v1.3/checkpoint-10240/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1742382c8e27fd8b5e625bfc706a8e0c4a5c0253e348693b7489219efc2a07f9
3
+ size 1121995
checkpoints-v1.3/checkpoint-10240/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d95ec4ff72b3a3694a7e0170340b972320337fb9ed91ccae10da983d02ef0337
3
+ size 14645
checkpoints-v1.3/checkpoint-10240/scaler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:df1fbd7e12410fdb6bb0abd3113128f3412b14ebe6a73178008f5074beadf68a
3
+ size 1383
checkpoints-v1.3/checkpoint-10240/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ca1522025c020e1c97d736fab7ff200620e603348507bd723aae3d12bd3b97ff
3
+ size 1465
checkpoints-v1.3/checkpoint-10240/trainer_state.json ADDED
@@ -0,0 +1,524 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.1042191451791012,
6
+ "eval_steps": 1024,
7
+ "global_step": 10240,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.0026054786294775305,
14
+ "grad_norm": 0.6768632531166077,
15
+ "learning_rate": 4.9804687500000004e-05,
16
+ "loss": 0.666217029094696,
17
+ "step": 256
18
+ },
19
+ {
20
+ "epoch": 0.005210957258955061,
21
+ "grad_norm": 0.7611387372016907,
22
+ "learning_rate": 9.98046875e-05,
23
+ "loss": 0.46460574865341187,
24
+ "step": 512
25
+ },
26
+ {
27
+ "epoch": 0.007816435888432591,
28
+ "grad_norm": 3.202936887741089,
29
+ "learning_rate": 9.999832063013975e-05,
30
+ "loss": 0.3047865331172943,
31
+ "step": 768
32
+ },
33
+ {
34
+ "epoch": 0.010421914517910122,
35
+ "grad_norm": 2.767078161239624,
36
+ "learning_rate": 9.999325626552273e-05,
37
+ "loss": 0.20353302359580994,
38
+ "step": 1024
39
+ },
40
+ {
41
+ "epoch": 0.010421914517910122,
42
+ "eval_acc": 0.9056051816259112,
43
+ "eval_gap": 0.65849609375,
44
+ "eval_loss": 0.24813499578407833,
45
+ "eval_neg": 0.10586111886160714,
46
+ "eval_pos": 0.7643833705357143,
47
+ "step": 1024
48
+ },
49
+ {
50
+ "epoch": 0.010421914517910122,
51
+ "eval_acc": 0.9056051816259112,
52
+ "eval_gap": 0.65849609375,
53
+ "eval_loss": 0.24813499578407833,
54
+ "eval_neg": 0.10586111886160714,
55
+ "eval_pos": 0.7643833705357143,
56
+ "eval_runtime": 11.5511,
57
+ "eval_samples_per_second": 190.458,
58
+ "eval_steps_per_second": 3.03,
59
+ "step": 1024
60
+ },
61
+ {
62
+ "epoch": 0.01302739314738765,
63
+ "grad_norm": 1.7397773265838623,
64
+ "learning_rate": 9.99848072231934e-05,
65
+ "loss": 0.10323332250118256,
66
+ "step": 1280
67
+ },
68
+ {
69
+ "epoch": 0.015632871776865183,
70
+ "grad_norm": 0.5150644183158875,
71
+ "learning_rate": 9.997297407517456e-05,
72
+ "loss": 0.08242284506559372,
73
+ "step": 1536
74
+ },
75
+ {
76
+ "epoch": 0.018238350406342713,
77
+ "grad_norm": 0.7313013076782227,
78
+ "learning_rate": 9.995775762260215e-05,
79
+ "loss": 0.06939949095249176,
80
+ "step": 1792
81
+ },
82
+ {
83
+ "epoch": 0.020843829035820244,
84
+ "grad_norm": 2.599472999572754,
85
+ "learning_rate": 9.993915889567087e-05,
86
+ "loss": 0.06290815025568008,
87
+ "step": 2048
88
+ },
89
+ {
90
+ "epoch": 0.020843829035820244,
91
+ "eval_acc": 0.9576885104179382,
92
+ "eval_gap": 0.8409040178571429,
93
+ "eval_loss": 0.10907792725733348,
94
+ "eval_neg": 0.09029192243303572,
95
+ "eval_pos": 0.9311662946428572,
96
+ "step": 2048
97
+ },
98
+ {
99
+ "epoch": 0.020843829035820244,
100
+ "eval_acc": 0.9576885104179382,
101
+ "eval_gap": 0.8409040178571429,
102
+ "eval_loss": 0.10907792725733348,
103
+ "eval_neg": 0.09029192243303572,
104
+ "eval_pos": 0.9311662946428572,
105
+ "eval_runtime": 11.5084,
106
+ "eval_samples_per_second": 191.164,
107
+ "eval_steps_per_second": 3.041,
108
+ "step": 2048
109
+ },
110
+ {
111
+ "epoch": 0.023449307665297774,
112
+ "grad_norm": 0.5858944654464722,
113
+ "learning_rate": 9.991717915356446e-05,
114
+ "loss": 0.05567435547709465,
115
+ "step": 2304
116
+ },
117
+ {
118
+ "epoch": 0.0260547862947753,
119
+ "grad_norm": 0.7901586890220642,
120
+ "learning_rate": 9.989181988437053e-05,
121
+ "loss": 0.05114856734871864,
122
+ "step": 2560
123
+ },
124
+ {
125
+ "epoch": 0.028660264924252832,
126
+ "grad_norm": 0.8466191291809082,
127
+ "learning_rate": 9.986308280497967e-05,
128
+ "loss": 0.04558824002742767,
129
+ "step": 2816
130
+ },
131
+ {
132
+ "epoch": 0.031265743553730366,
133
+ "grad_norm": 0.2479318380355835,
134
+ "learning_rate": 9.983096986096934e-05,
135
+ "loss": 0.04197113215923309,
136
+ "step": 3072
137
+ },
138
+ {
139
+ "epoch": 0.031265743553730366,
140
+ "eval_acc": 0.9745039888790675,
141
+ "eval_gap": 0.9002511160714286,
142
+ "eval_loss": 0.07157694122620992,
143
+ "eval_neg": 0.04814627511160714,
144
+ "eval_pos": 0.9484235491071429,
145
+ "step": 3072
146
+ },
147
+ {
148
+ "epoch": 0.031265743553730366,
149
+ "eval_acc": 0.9745039888790675,
150
+ "eval_gap": 0.9002511160714286,
151
+ "eval_loss": 0.07157694122620992,
152
+ "eval_neg": 0.04814627511160714,
153
+ "eval_pos": 0.9484235491071429,
154
+ "eval_runtime": 11.6071,
155
+ "eval_samples_per_second": 189.539,
156
+ "eval_steps_per_second": 3.015,
157
+ "step": 3072
158
+ },
159
+ {
160
+ "epoch": 0.03387122218320789,
161
+ "grad_norm": 0.44913774728775024,
162
+ "learning_rate": 9.97954832264721e-05,
163
+ "loss": 0.04050295054912567,
164
+ "step": 3328
165
+ },
166
+ {
167
+ "epoch": 0.03647670081268543,
168
+ "grad_norm": 0.4910290539264679,
169
+ "learning_rate": 9.975662530402843e-05,
170
+ "loss": 0.03661082684993744,
171
+ "step": 3584
172
+ },
173
+ {
174
+ "epoch": 0.039082179442162954,
175
+ "grad_norm": 0.7061027884483337,
176
+ "learning_rate": 9.971439872442399e-05,
177
+ "loss": 0.03790655359625816,
178
+ "step": 3840
179
+ },
180
+ {
181
+ "epoch": 0.04168765807164049,
182
+ "grad_norm": 1.5880284309387207,
183
+ "learning_rate": 9.966880634651166e-05,
184
+ "loss": 0.03482869639992714,
185
+ "step": 4096
186
+ },
187
+ {
188
+ "epoch": 0.04168765807164049,
189
+ "eval_acc": 0.9759424822671073,
190
+ "eval_gap": 0.9098214285714286,
191
+ "eval_loss": 0.06747848434107644,
192
+ "eval_neg": 0.04893787928989955,
193
+ "eval_pos": 0.9588588169642858,
194
+ "step": 4096
195
+ },
196
+ {
197
+ "epoch": 0.04168765807164049,
198
+ "eval_acc": 0.9759424822671073,
199
+ "eval_gap": 0.9098214285714286,
200
+ "eval_loss": 0.06747848434107644,
201
+ "eval_neg": 0.04893787928989955,
202
+ "eval_pos": 0.9588588169642858,
203
+ "eval_runtime": 11.7135,
204
+ "eval_samples_per_second": 187.818,
205
+ "eval_steps_per_second": 2.988,
206
+ "step": 4096
207
+ },
208
+ {
209
+ "epoch": 0.044293136701118015,
210
+ "grad_norm": 0.18764200806617737,
211
+ "learning_rate": 9.961985125701787e-05,
212
+ "loss": 0.0340995118021965,
213
+ "step": 4352
214
+ },
215
+ {
216
+ "epoch": 0.04689861533059555,
217
+ "grad_norm": 0.12677673995494843,
218
+ "learning_rate": 9.956753677033363e-05,
219
+ "loss": 0.032815080136060715,
220
+ "step": 4608
221
+ },
222
+ {
223
+ "epoch": 0.049504093960073076,
224
+ "grad_norm": 0.3894726634025574,
225
+ "learning_rate": 9.95118664282902e-05,
226
+ "loss": 0.03092392161488533,
227
+ "step": 4864
228
+ },
229
+ {
230
+ "epoch": 0.0521095725895506,
231
+ "grad_norm": 0.5825901031494141,
232
+ "learning_rate": 9.945284399991925e-05,
233
+ "loss": 0.0337848924100399,
234
+ "step": 5120
235
+ },
236
+ {
237
+ "epoch": 0.0521095725895506,
238
+ "eval_acc": 0.9801587496485029,
239
+ "eval_gap": 0.9224609375,
240
+ "eval_loss": 0.05970690926270825,
241
+ "eval_neg": 0.04791543143136161,
242
+ "eval_pos": 0.9703404017857142,
243
+ "step": 5120
244
+ },
245
+ {
246
+ "epoch": 0.0521095725895506,
247
+ "eval_acc": 0.9801587496485029,
248
+ "eval_gap": 0.9224609375,
249
+ "eval_loss": 0.05970690926270825,
250
+ "eval_neg": 0.04791543143136161,
251
+ "eval_pos": 0.9703404017857142,
252
+ "eval_runtime": 11.5781,
253
+ "eval_samples_per_second": 190.013,
254
+ "eval_steps_per_second": 3.023,
255
+ "step": 5120
256
+ },
257
+ {
258
+ "epoch": 0.05471505121902814,
259
+ "grad_norm": 0.38748735189437866,
260
+ "learning_rate": 9.939047348119769e-05,
261
+ "loss": 0.030142318457365036,
262
+ "step": 5376
263
+ },
264
+ {
265
+ "epoch": 0.057320529848505664,
266
+ "grad_norm": 0.27703332901000977,
267
+ "learning_rate": 9.932475909477713e-05,
268
+ "loss": 0.03031122498214245,
269
+ "step": 5632
270
+ },
271
+ {
272
+ "epoch": 0.0599260084779832,
273
+ "grad_norm": 0.4905368685722351,
274
+ "learning_rate": 9.925570528969803e-05,
275
+ "loss": 0.027261599898338318,
276
+ "step": 5888
277
+ },
278
+ {
279
+ "epoch": 0.06253148710746073,
280
+ "grad_norm": 0.6853195428848267,
281
+ "learning_rate": 9.918331674108844e-05,
282
+ "loss": 0.028637079522013664,
283
+ "step": 6144
284
+ },
285
+ {
286
+ "epoch": 0.06253148710746073,
287
+ "eval_acc": 0.9826885104179383,
288
+ "eval_gap": 0.9291155133928571,
289
+ "eval_loss": 0.0543118260002562,
290
+ "eval_neg": 0.04116423470633371,
291
+ "eval_pos": 0.9702566964285714,
292
+ "step": 6144
293
+ },
294
+ {
295
+ "epoch": 0.06253148710746073,
296
+ "eval_acc": 0.9826885104179383,
297
+ "eval_gap": 0.9291155133928571,
298
+ "eval_loss": 0.0543118260002562,
299
+ "eval_neg": 0.04116423470633371,
300
+ "eval_pos": 0.9702566964285714,
301
+ "eval_runtime": 11.3233,
302
+ "eval_samples_per_second": 194.289,
303
+ "eval_steps_per_second": 3.091,
304
+ "step": 6144
305
+ },
306
+ {
307
+ "epoch": 0.06513696573693825,
308
+ "grad_norm": 0.34094464778900146,
309
+ "learning_rate": 9.91075983498475e-05,
310
+ "loss": 0.02751798741519451,
311
+ "step": 6400
312
+ },
313
+ {
314
+ "epoch": 0.06774244436641579,
315
+ "grad_norm": 0.5183176398277283,
316
+ "learning_rate": 9.902855524231368e-05,
317
+ "loss": 0.028319211676716805,
318
+ "step": 6656
319
+ },
320
+ {
321
+ "epoch": 0.07034792299589332,
322
+ "grad_norm": 0.4686974287033081,
323
+ "learning_rate": 9.89461927699176e-05,
324
+ "loss": 0.027841968461871147,
325
+ "step": 6912
326
+ },
327
+ {
328
+ "epoch": 0.07295340162537085,
329
+ "grad_norm": 0.48985323309898376,
330
+ "learning_rate": 9.886051650881986e-05,
331
+ "loss": 0.025898020714521408,
332
+ "step": 7168
333
+ },
334
+ {
335
+ "epoch": 0.07295340162537085,
336
+ "eval_acc": 0.9843254157475063,
337
+ "eval_gap": 0.93515625,
338
+ "eval_loss": 0.05201355703175068,
339
+ "eval_neg": 0.03936669485909598,
340
+ "eval_pos": 0.9745256696428571,
341
+ "step": 7168
342
+ },
343
+ {
344
+ "epoch": 0.07295340162537085,
345
+ "eval_acc": 0.9843254157475063,
346
+ "eval_gap": 0.93515625,
347
+ "eval_loss": 0.05201355703175068,
348
+ "eval_neg": 0.03936669485909598,
349
+ "eval_pos": 0.9745256696428571,
350
+ "eval_runtime": 11.3523,
351
+ "eval_samples_per_second": 193.793,
352
+ "eval_steps_per_second": 3.083,
353
+ "step": 7168
354
+ },
355
+ {
356
+ "epoch": 0.07555888025484837,
357
+ "grad_norm": 0.9054098129272461,
358
+ "learning_rate": 9.877153225953341e-05,
359
+ "loss": 0.02771976962685585,
360
+ "step": 7424
361
+ },
362
+ {
363
+ "epoch": 0.07816435888432591,
364
+ "grad_norm": 0.1680811196565628,
365
+ "learning_rate": 9.867924604653094e-05,
366
+ "loss": 0.027917755767703056,
367
+ "step": 7680
368
+ },
369
+ {
370
+ "epoch": 0.08076983751380344,
371
+ "grad_norm": 0.19059687852859497,
372
+ "learning_rate": 9.858366411783688e-05,
373
+ "loss": 0.025375036522746086,
374
+ "step": 7936
375
+ },
376
+ {
377
+ "epoch": 0.08337531614328098,
378
+ "grad_norm": 0.5264661312103271,
379
+ "learning_rate": 9.848479294460454e-05,
380
+ "loss": 0.02571159414947033,
381
+ "step": 8192
382
+ },
383
+ {
384
+ "epoch": 0.08337531614328098,
385
+ "eval_acc": 0.9853174788611275,
386
+ "eval_gap": 0.9412806919642858,
387
+ "eval_loss": 0.048451720497437886,
388
+ "eval_neg": 0.03673537118094308,
389
+ "eval_pos": 0.9779017857142858,
390
+ "step": 8192
391
+ },
392
+ {
393
+ "epoch": 0.08337531614328098,
394
+ "eval_acc": 0.9853174788611275,
395
+ "eval_gap": 0.9412806919642858,
396
+ "eval_loss": 0.048451720497437886,
397
+ "eval_neg": 0.03673537118094308,
398
+ "eval_pos": 0.9779017857142858,
399
+ "eval_runtime": 11.4872,
400
+ "eval_samples_per_second": 191.517,
401
+ "eval_steps_per_second": 3.047,
402
+ "step": 8192
403
+ },
404
+ {
405
+ "epoch": 0.0859807947727585,
406
+ "grad_norm": 0.7129268050193787,
407
+ "learning_rate": 9.838263922067783e-05,
408
+ "loss": 0.024671752005815506,
409
+ "step": 8448
410
+ },
411
+ {
412
+ "epoch": 0.08858627340223603,
413
+ "grad_norm": 0.26395970582962036,
414
+ "learning_rate": 9.827720986213824e-05,
415
+ "loss": 0.022725798189640045,
416
+ "step": 8704
417
+ },
418
+ {
419
+ "epoch": 0.09119175203171356,
420
+ "grad_norm": 0.3604643642902374,
421
+ "learning_rate": 9.816851200683649e-05,
422
+ "loss": 0.025862637907266617,
423
+ "step": 8960
424
+ },
425
+ {
426
+ "epoch": 0.0937972306611911,
427
+ "grad_norm": 0.17066827416419983,
428
+ "learning_rate": 9.805655301390928e-05,
429
+ "loss": 0.025739867240190506,
430
+ "step": 9216
431
+ },
432
+ {
433
+ "epoch": 0.0937972306611911,
434
+ "eval_acc": 0.9840277961322239,
435
+ "eval_gap": 0.9294921875,
436
+ "eval_loss": 0.05072044464094298,
437
+ "eval_neg": 0.04041453770228794,
438
+ "eval_pos": 0.9698381696428572,
439
+ "step": 9216
440
+ },
441
+ {
442
+ "epoch": 0.0937972306611911,
443
+ "eval_acc": 0.9840277961322239,
444
+ "eval_gap": 0.9294921875,
445
+ "eval_loss": 0.05072044464094298,
446
+ "eval_neg": 0.04041453770228794,
447
+ "eval_pos": 0.9698381696428572,
448
+ "eval_runtime": 11.5447,
449
+ "eval_samples_per_second": 190.563,
450
+ "eval_steps_per_second": 3.032,
451
+ "step": 9216
452
+ },
453
+ {
454
+ "epoch": 0.09640270929066862,
455
+ "grad_norm": 0.12745517492294312,
456
+ "learning_rate": 9.794134046328113e-05,
457
+ "loss": 0.024888301268219948,
458
+ "step": 9472
459
+ },
460
+ {
461
+ "epoch": 0.09900818792014615,
462
+ "grad_norm": 0.5470172166824341,
463
+ "learning_rate": 9.782288215515113e-05,
464
+ "loss": 0.02433888427913189,
465
+ "step": 9728
466
+ },
467
+ {
468
+ "epoch": 0.10161366654962369,
469
+ "grad_norm": 0.2533114552497864,
470
+ "learning_rate": 9.770118610946487e-05,
471
+ "loss": 0.026410939171910286,
472
+ "step": 9984
473
+ },
474
+ {
475
+ "epoch": 0.1042191451791012,
476
+ "grad_norm": 0.16786547005176544,
477
+ "learning_rate": 9.757626056537147e-05,
478
+ "loss": 0.023928755894303322,
479
+ "step": 10240
480
+ },
481
+ {
482
+ "epoch": 0.1042191451791012,
483
+ "eval_acc": 0.9864087496485029,
484
+ "eval_gap": 0.9403738839285715,
485
+ "eval_loss": 0.043760570218520506,
486
+ "eval_neg": 0.0355271475655692,
487
+ "eval_pos": 0.9759068080357143,
488
+ "step": 10240
489
+ },
490
+ {
491
+ "epoch": 0.1042191451791012,
492
+ "eval_acc": 0.9864087496485029,
493
+ "eval_gap": 0.9403738839285715,
494
+ "eval_loss": 0.043760570218520506,
495
+ "eval_neg": 0.0355271475655692,
496
+ "eval_pos": 0.9759068080357143,
497
+ "eval_runtime": 11.2984,
498
+ "eval_samples_per_second": 194.717,
499
+ "eval_steps_per_second": 3.098,
500
+ "step": 10240
501
+ }
502
+ ],
503
+ "logging_steps": 256,
504
+ "max_steps": 98255,
505
+ "num_input_tokens_seen": 0,
506
+ "num_train_epochs": 1,
507
+ "save_steps": 1024,
508
+ "stateful_callbacks": {
509
+ "TrainerControl": {
510
+ "args": {
511
+ "should_epoch_stop": false,
512
+ "should_evaluate": false,
513
+ "should_log": false,
514
+ "should_save": true,
515
+ "should_training_stop": false
516
+ },
517
+ "attributes": {}
518
+ }
519
+ },
520
+ "total_flos": 0.0,
521
+ "train_batch_size": 64,
522
+ "trial_name": null,
523
+ "trial_params": null
524
+ }
checkpoints-v1.3/checkpoint-10240/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ffa5ebeb5ef161964405bdeb26634ed974ccd3ca70a293defa183a0abc5178c7
3
+ size 5137