Gege24 commited on
Commit
c3cbdd2
·
verified ·
1 Parent(s): 6228505

Upload checkpoint from task 1

Browse files
adapter_config.json CHANGED
@@ -29,13 +29,13 @@
29
  "rank_pattern": {},
30
  "revision": null,
31
  "target_modules": [
 
32
  "q_proj",
33
- "up_proj",
34
- "v_proj",
35
  "o_proj",
36
- "k_proj",
37
  "down_proj",
38
- "gate_proj"
 
 
39
  ],
40
  "target_parameters": null,
41
  "task_type": "CAUSAL_LM",
 
29
  "rank_pattern": {},
30
  "revision": null,
31
  "target_modules": [
32
+ "k_proj",
33
  "q_proj",
 
 
34
  "o_proj",
 
35
  "down_proj",
36
+ "up_proj",
37
+ "gate_proj",
38
+ "v_proj"
39
  ],
40
  "target_parameters": null,
41
  "task_type": "CAUSAL_LM",
adapter_model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:39224a614d588f842f93da0fe21a6c4b78dd20343673a1920303f0c5aacdd1de
3
  size 239536272
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4c54843db773c25a827d2d13d02d4a752008596f1bf18d861d2c05a49cc5e126
3
  size 239536272
loss.txt CHANGED
@@ -1 +1 @@
1
- 340,no_eval
 
1
+ 316,no_eval
trainer_state.json CHANGED
@@ -2,630 +2,585 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 3.953488372093023,
6
  "eval_steps": 500,
7
- "global_step": 340,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
- "epoch": 0.05813953488372093,
14
- "grad_norm": 3.3227427005767822,
15
  "learning_rate": 1.3636363636363635e-05,
16
- "loss": 1.4688,
17
- "mean_token_accuracy": 0.681653356552124,
18
- "num_tokens": 908617.0,
19
  "step": 5
20
  },
21
  {
22
- "epoch": 0.11627906976744186,
23
- "grad_norm": 0.8916869759559631,
24
  "learning_rate": 3.068181818181818e-05,
25
- "loss": 1.3353,
26
- "mean_token_accuracy": 0.693474531173706,
27
- "num_tokens": 1787376.0,
28
  "step": 10
29
  },
30
  {
31
- "epoch": 0.1744186046511628,
32
- "grad_norm": 0.5437080264091492,
33
  "learning_rate": 4.7727272727272724e-05,
34
- "loss": 1.1146,
35
- "mean_token_accuracy": 0.7165812611579895,
36
- "num_tokens": 2673208.0,
37
  "step": 15
38
  },
39
  {
40
- "epoch": 0.23255813953488372,
41
- "grad_norm": 0.441089004278183,
42
  "learning_rate": 6.477272727272727e-05,
43
- "loss": 0.9604,
44
- "mean_token_accuracy": 0.7472989082336425,
45
- "num_tokens": 3579185.0,
46
  "step": 20
47
  },
48
  {
49
- "epoch": 0.29069767441860467,
50
- "grad_norm": 0.3763512372970581,
51
- "learning_rate": 7.4997725098906e-05,
52
- "loss": 0.9084,
53
- "mean_token_accuracy": 0.7577781558036805,
54
- "num_tokens": 4407100.0,
55
  "step": 25
56
  },
57
  {
58
- "epoch": 0.3488372093023256,
59
- "grad_norm": 0.3838900327682495,
60
- "learning_rate": 7.497213668780336e-05,
61
- "loss": 0.7685,
62
- "mean_token_accuracy": 0.7860511183738709,
63
- "num_tokens": 5296594.0,
64
  "step": 30
65
  },
66
  {
67
- "epoch": 0.4069767441860465,
68
- "grad_norm": 0.3650754988193512,
69
- "learning_rate": 7.491814219525521e-05,
70
- "loss": 0.7932,
71
- "mean_token_accuracy": 0.7775424718856812,
72
- "num_tokens": 6169145.0,
73
  "step": 35
74
  },
75
  {
76
- "epoch": 0.46511627906976744,
77
- "grad_norm": 0.3387715518474579,
78
- "learning_rate": 7.483579620945575e-05,
79
- "loss": 0.6983,
80
- "mean_token_accuracy": 0.8077743411064148,
81
- "num_tokens": 7089714.0,
82
  "step": 40
83
  },
84
  {
85
- "epoch": 0.5232558139534884,
86
- "grad_norm": 0.3948509991168976,
87
- "learning_rate": 7.472518198183393e-05,
88
- "loss": 0.6689,
89
- "mean_token_accuracy": 0.8084866642951966,
90
- "num_tokens": 7960840.0,
91
  "step": 45
92
  },
93
  {
94
- "epoch": 0.5813953488372093,
95
- "grad_norm": 0.33756810426712036,
96
- "learning_rate": 7.458641134288672e-05,
97
- "loss": 0.6744,
98
- "mean_token_accuracy": 0.8019166707992553,
99
- "num_tokens": 8876139.0,
100
  "step": 50
101
  },
102
  {
103
- "epoch": 0.6395348837209303,
104
- "grad_norm": 0.3875386118888855,
105
- "learning_rate": 7.441962458911889e-05,
106
- "loss": 0.6292,
107
- "mean_token_accuracy": 0.8159096598625183,
108
- "num_tokens": 9749095.0,
109
  "step": 55
110
  },
111
  {
112
- "epoch": 0.6976744186046512,
113
- "grad_norm": 0.4815349876880646,
114
- "learning_rate": 7.422499034120398e-05,
115
- "loss": 0.5822,
116
- "mean_token_accuracy": 0.827684223651886,
117
- "num_tokens": 10610501.0,
118
  "step": 60
119
  },
120
  {
121
- "epoch": 0.7558139534883721,
122
- "grad_norm": 0.43496716022491455,
123
- "learning_rate": 7.400270537350939e-05,
124
- "loss": 0.6027,
125
- "mean_token_accuracy": 0.8274801731109619,
126
- "num_tokens": 11478956.0,
127
  "step": 65
128
  },
129
  {
130
- "epoch": 0.813953488372093,
131
- "grad_norm": 0.3981734812259674,
132
- "learning_rate": 7.375299441515847e-05,
133
- "loss": 0.5875,
134
- "mean_token_accuracy": 0.8244443655014038,
135
- "num_tokens": 12434088.0,
136
  "step": 70
137
  },
138
  {
139
- "epoch": 0.872093023255814,
140
- "grad_norm": 0.45824673771858215,
141
- "learning_rate": 7.347610992283035e-05,
142
- "loss": 0.5896,
143
- "mean_token_accuracy": 0.8241708278656006,
144
- "num_tokens": 13289313.0,
145
  "step": 75
146
  },
147
  {
148
- "epoch": 0.9302325581395349,
149
- "grad_norm": 0.47565343976020813,
150
- "learning_rate": 7.317233182552728e-05,
151
- "loss": 0.5606,
152
- "mean_token_accuracy": 0.8319092392921448,
153
- "num_tokens": 14176300.0,
154
  "step": 80
155
  },
156
  {
157
- "epoch": 0.9883720930232558,
158
- "grad_norm": 0.6352036595344543,
159
- "learning_rate": 7.284196724156777e-05,
160
- "loss": 0.549,
161
- "mean_token_accuracy": 0.833467161655426,
162
- "num_tokens": 15039331.0,
163
  "step": 85
164
  },
165
  {
166
- "epoch": 1.0465116279069768,
167
- "grad_norm": 0.4878791868686676,
168
- "learning_rate": 7.248535016809117e-05,
169
- "loss": 0.5266,
170
- "mean_token_accuracy": 0.838879406452179,
171
- "num_tokens": 15951728.0,
172
  "step": 90
173
  },
174
  {
175
- "epoch": 1.1046511627906976,
176
- "grad_norm": 0.4694942831993103,
177
- "learning_rate": 7.210284114338817e-05,
178
- "loss": 0.5094,
179
- "mean_token_accuracy": 0.8451227068901062,
180
- "num_tokens": 16854757.0,
181
  "step": 95
182
  },
183
  {
184
- "epoch": 1.1627906976744187,
185
- "grad_norm": 0.5654356479644775,
186
- "learning_rate": 7.169482688239809e-05,
187
- "loss": 0.4883,
188
- "mean_token_accuracy": 0.8548959255218506,
189
- "num_tokens": 17710044.0,
190
  "step": 100
191
  },
192
  {
193
- "epoch": 1.2209302325581395,
194
- "grad_norm": 0.5400692224502563,
195
- "learning_rate": 7.126171988574178e-05,
196
- "loss": 0.4735,
197
- "mean_token_accuracy": 0.8540786027908325,
198
- "num_tokens": 18583272.0,
199
  "step": 105
200
  },
201
  {
202
- "epoch": 1.2790697674418605,
203
- "grad_norm": 0.4803585112094879,
204
- "learning_rate": 7.080395802268541e-05,
205
- "loss": 0.4838,
206
- "mean_token_accuracy": 0.8504316091537476,
207
- "num_tokens": 19479917.0,
208
  "step": 110
209
  },
210
  {
211
- "epoch": 1.3372093023255813,
212
- "grad_norm": 0.5055525898933411,
213
- "learning_rate": 7.032200408845642e-05,
214
- "loss": 0.4719,
215
- "mean_token_accuracy": 0.85212082862854,
216
- "num_tokens": 20428580.0,
217
  "step": 115
218
  },
219
  {
220
- "epoch": 1.3953488372093024,
221
- "grad_norm": 0.4785888195037842,
222
- "learning_rate": 6.981634533635966e-05,
223
- "loss": 0.4994,
224
- "mean_token_accuracy": 0.8442901730537414,
225
- "num_tokens": 21312035.0,
226
  "step": 120
227
  },
228
  {
229
- "epoch": 1.4534883720930232,
230
- "grad_norm": 0.5483599901199341,
231
- "learning_rate": 6.928749298516651e-05,
232
- "loss": 0.4768,
233
- "mean_token_accuracy": 0.8488313317298889,
234
- "num_tokens": 22198657.0,
235
  "step": 125
236
  },
237
  {
238
- "epoch": 1.5116279069767442,
239
- "grad_norm": 0.44508588314056396,
240
- "learning_rate": 6.873598170227484e-05,
241
- "loss": 0.4623,
242
- "mean_token_accuracy": 0.8573606014251709,
243
- "num_tokens": 23065110.0,
244
  "step": 130
245
  },
246
  {
247
- "epoch": 1.5697674418604652,
248
- "grad_norm": 0.49224478006362915,
249
- "learning_rate": 6.816236906316267e-05,
250
- "loss": 0.4661,
251
- "mean_token_accuracy": 0.8557985186576843,
252
- "num_tokens": 23996595.0,
253
  "step": 135
254
  },
255
  {
256
- "epoch": 1.627906976744186,
257
- "grad_norm": 0.5778976678848267,
258
- "learning_rate": 6.756723498768182e-05,
259
- "loss": 0.4473,
260
- "mean_token_accuracy": 0.8574177622795105,
261
- "num_tokens": 24922107.0,
262
  "step": 140
263
  },
264
  {
265
- "epoch": 1.6860465116279069,
266
- "grad_norm": 0.5565524101257324,
267
- "learning_rate": 6.695118115376152e-05,
268
- "loss": 0.452,
269
- "mean_token_accuracy": 0.860586965084076,
270
- "num_tokens": 25764329.0,
271
  "step": 145
272
  },
273
  {
274
- "epoch": 1.744186046511628,
275
- "grad_norm": 0.5819323062896729,
276
- "learning_rate": 6.631483038911461e-05,
277
- "loss": 0.4172,
278
- "mean_token_accuracy": 0.8694151997566223,
279
- "num_tokens": 26602076.0,
280
  "step": 150
281
  },
282
  {
283
- "epoch": 1.802325581395349,
284
- "grad_norm": 0.5286712050437927,
285
- "learning_rate": 6.565882604156153e-05,
286
- "loss": 0.441,
287
- "mean_token_accuracy": 0.860273253917694,
288
- "num_tokens": 27485385.0,
289
  "step": 155
290
  },
291
  {
292
- "epoch": 1.8604651162790697,
293
- "grad_norm": 0.5142207145690918,
294
- "learning_rate": 6.498383132860849e-05,
295
- "loss": 0.4278,
296
- "mean_token_accuracy": 0.8661178708076477,
297
- "num_tokens": 28360637.0,
298
  "step": 160
299
  },
300
  {
301
- "epoch": 1.9186046511627906,
302
- "grad_norm": 0.6509299278259277,
303
- "learning_rate": 6.429052866693743e-05,
304
- "loss": 0.3881,
305
- "mean_token_accuracy": 0.8775515556335449,
306
- "num_tokens": 29230029.0,
307
  "step": 165
308
  },
309
  {
310
- "epoch": 1.9767441860465116,
311
- "grad_norm": 0.5916144847869873,
312
- "learning_rate": 6.357961898248585e-05,
313
- "loss": 0.4298,
314
- "mean_token_accuracy": 0.8624862432479858,
315
- "num_tokens": 30082134.0,
316
  "step": 170
317
  },
318
  {
319
- "epoch": 2.0348837209302326,
320
- "grad_norm": 0.5240158438682556,
321
- "learning_rate": 6.285182100181375e-05,
322
- "loss": 0.4223,
323
- "mean_token_accuracy": 0.8699663758277894,
324
- "num_tokens": 30945309.0,
325
  "step": 175
326
  },
327
  {
328
- "epoch": 2.0930232558139537,
329
- "grad_norm": 0.66953444480896,
330
- "learning_rate": 6.21078705254742e-05,
331
- "loss": 0.3731,
332
- "mean_token_accuracy": 0.8814450383186341,
333
- "num_tokens": 31798059.0,
334
  "step": 180
335
  },
336
  {
337
- "epoch": 2.1511627906976742,
338
- "grad_norm": 0.5697144865989685,
339
- "learning_rate": 6.134851968412226e-05,
340
- "loss": 0.3781,
341
- "mean_token_accuracy": 0.8790240526199341,
342
- "num_tokens": 32700506.0,
343
  "step": 185
344
  },
345
  {
346
- "epoch": 2.2093023255813953,
347
- "grad_norm": 0.5728302001953125,
348
- "learning_rate": 6.0574536178114176e-05,
349
- "loss": 0.3828,
350
- "mean_token_accuracy": 0.8748290300369262,
351
- "num_tokens": 33560105.0,
352
  "step": 190
353
  },
354
  {
355
- "epoch": 2.2674418604651163,
356
- "grad_norm": 0.5915728807449341,
357
- "learning_rate": 5.978670250136575e-05,
358
- "loss": 0.3966,
359
- "mean_token_accuracy": 0.8702341914176941,
360
- "num_tokens": 34453105.0,
361
  "step": 195
362
  },
363
  {
364
- "epoch": 2.3255813953488373,
365
- "grad_norm": 0.6768730878829956,
366
- "learning_rate": 5.898581515025438e-05,
367
- "loss": 0.3926,
368
- "mean_token_accuracy": 0.8739870071411133,
369
- "num_tokens": 35321541.0,
370
  "step": 200
371
  },
372
  {
373
- "epoch": 2.383720930232558,
374
- "grad_norm": 0.6103410124778748,
375
- "learning_rate": 5.8172683818364765e-05,
376
- "loss": 0.3922,
377
- "mean_token_accuracy": 0.8750384330749512,
378
- "num_tokens": 36269855.0,
379
  "step": 205
380
  },
381
  {
382
- "epoch": 2.441860465116279,
383
- "grad_norm": 0.710746169090271,
384
- "learning_rate": 5.734813057789223e-05,
385
- "loss": 0.3572,
386
- "mean_token_accuracy": 0.882230567932129,
387
- "num_tokens": 37156235.0,
388
  "step": 210
389
  },
390
  {
391
- "epoch": 2.5,
392
- "grad_norm": 0.6437317132949829,
393
- "learning_rate": 5.651298904853137e-05,
394
- "loss": 0.369,
395
- "mean_token_accuracy": 0.8787329792976379,
396
- "num_tokens": 38070007.0,
397
  "step": 215
398
  },
399
  {
400
- "epoch": 2.558139534883721,
401
- "grad_norm": 0.7597388029098511,
402
- "learning_rate": 5.5668103554690244e-05,
403
- "loss": 0.3664,
404
- "mean_token_accuracy": 0.8813632965087891,
405
- "num_tokens": 38893789.0,
406
  "step": 220
407
  },
408
  {
409
- "epoch": 2.616279069767442,
410
- "grad_norm": 0.7274823784828186,
411
- "learning_rate": 5.4814328271882056e-05,
412
- "loss": 0.3853,
413
- "mean_token_accuracy": 0.8771765947341919,
414
- "num_tokens": 39778380.0,
415
  "step": 225
416
  },
417
  {
418
- "epoch": 2.6744186046511627,
419
- "grad_norm": 0.6335929036140442,
420
- "learning_rate": 5.395252636315752e-05,
421
- "loss": 0.3582,
422
- "mean_token_accuracy": 0.8801517844200134,
423
- "num_tokens": 40736100.0,
424
  "step": 230
425
  },
426
  {
427
- "epoch": 2.7325581395348837,
428
- "grad_norm": 0.6215701699256897,
429
- "learning_rate": 5.3083569106450794e-05,
430
- "loss": 0.3791,
431
- "mean_token_accuracy": 0.8791951894760132,
432
- "num_tokens": 41627731.0,
433
  "step": 235
434
  },
435
  {
436
- "epoch": 2.7906976744186047,
437
- "grad_norm": 0.6210712194442749,
438
- "learning_rate": 5.220833501372133e-05,
439
- "loss": 0.3515,
440
- "mean_token_accuracy": 0.8856444358825684,
441
- "num_tokens": 42480686.0,
442
  "step": 240
443
  },
444
  {
445
- "epoch": 2.8488372093023253,
446
- "grad_norm": 0.7439652681350708,
447
- "learning_rate": 5.132770894278215e-05,
448
- "loss": 0.3675,
449
- "mean_token_accuracy": 0.8832207322120667,
450
- "num_tokens": 43371025.0,
451
  "step": 245
452
  },
453
  {
454
- "epoch": 2.9069767441860463,
455
- "grad_norm": 0.6188499927520752,
456
- "learning_rate": 5.044258120271251e-05,
457
- "loss": 0.352,
458
- "mean_token_accuracy": 0.8845577120780945,
459
- "num_tokens": 44272951.0,
460
  "step": 250
461
  },
462
  {
463
- "epoch": 2.9651162790697674,
464
- "grad_norm": 0.6540551781654358,
465
- "learning_rate": 4.955384665375935e-05,
466
- "loss": 0.3452,
467
- "mean_token_accuracy": 0.88858562707901,
468
- "num_tokens": 45112833.0,
469
  "step": 255
470
  },
471
  {
472
- "epoch": 3.0232558139534884,
473
- "grad_norm": 0.6577905416488647,
474
- "learning_rate": 4.866240380263745e-05,
475
- "loss": 0.3457,
476
- "mean_token_accuracy": 0.8881999373435974,
477
- "num_tokens": 46027094.0,
478
  "step": 260
479
  },
480
  {
481
- "epoch": 3.0813953488372094,
482
- "grad_norm": 0.6692069172859192,
483
- "learning_rate": 4.776915389414318e-05,
484
- "loss": 0.3019,
485
- "mean_token_accuracy": 0.8964720010757447,
486
- "num_tokens": 46908302.0,
487
  "step": 265
488
  },
489
  {
490
- "epoch": 3.13953488372093,
491
- "grad_norm": 0.7803618311882019,
492
- "learning_rate": 4.6874999999999994e-05,
493
- "loss": 0.3246,
494
- "mean_token_accuracy": 0.8924661874771118,
495
- "num_tokens": 47718514.0,
496
  "step": 270
497
  },
498
  {
499
- "epoch": 3.197674418604651,
500
- "grad_norm": 0.7068886756896973,
501
- "learning_rate": 4.598084610585681e-05,
502
- "loss": 0.3173,
503
- "mean_token_accuracy": 0.8940881609916687,
504
- "num_tokens": 48605257.0,
505
  "step": 275
506
  },
507
  {
508
- "epoch": 3.255813953488372,
509
- "grad_norm": 0.7091385722160339,
510
- "learning_rate": 4.5087596197362554e-05,
511
- "loss": 0.3168,
512
- "mean_token_accuracy": 0.8936636090278626,
513
- "num_tokens": 49456564.0,
514
  "step": 280
515
  },
516
  {
517
- "epoch": 3.313953488372093,
518
- "grad_norm": 0.6630744338035583,
519
- "learning_rate": 4.4196153346240655e-05,
520
- "loss": 0.2912,
521
- "mean_token_accuracy": 0.9037835001945496,
522
- "num_tokens": 50363507.0,
523
  "step": 285
524
  },
525
  {
526
- "epoch": 3.3720930232558137,
527
- "grad_norm": 0.6711844205856323,
528
- "learning_rate": 4.330741879728747e-05,
529
- "loss": 0.3108,
530
- "mean_token_accuracy": 0.8963549494743347,
531
- "num_tokens": 51248723.0,
532
  "step": 290
533
  },
534
  {
535
- "epoch": 3.4302325581395348,
536
- "grad_norm": 0.7731291651725769,
537
- "learning_rate": 4.2422291057217845e-05,
538
- "loss": 0.3233,
539
- "mean_token_accuracy": 0.8919758558273315,
540
- "num_tokens": 52178931.0,
541
  "step": 295
542
  },
543
  {
544
- "epoch": 3.488372093023256,
545
- "grad_norm": 0.6275913715362549,
546
- "learning_rate": 4.154166498627867e-05,
547
- "loss": 0.3004,
548
- "mean_token_accuracy": 0.9027432203292847,
549
- "num_tokens": 53069706.0,
550
  "step": 300
551
  },
552
  {
553
- "epoch": 3.546511627906977,
554
- "grad_norm": 0.6897523403167725,
555
- "learning_rate": 4.0666430893549215e-05,
556
- "loss": 0.3173,
557
- "mean_token_accuracy": 0.8981173038482666,
558
- "num_tokens": 53953607.0,
559
  "step": 305
560
  },
561
  {
562
- "epoch": 3.604651162790698,
563
- "grad_norm": 0.6881428956985474,
564
- "learning_rate": 3.979747363684247e-05,
565
- "loss": 0.296,
566
- "mean_token_accuracy": 0.9011698007583618,
567
- "num_tokens": 54899379.0,
568
  "step": 310
569
  },
570
  {
571
- "epoch": 3.6627906976744184,
572
- "grad_norm": 0.7619199752807617,
573
- "learning_rate": 3.893567172811793e-05,
574
- "loss": 0.2697,
575
- "mean_token_accuracy": 0.9105530261993409,
576
- "num_tokens": 55775716.0,
577
  "step": 315
578
- },
579
- {
580
- "epoch": 3.7209302325581395,
581
- "grad_norm": 0.729427695274353,
582
- "learning_rate": 3.808189644530976e-05,
583
- "loss": 0.3051,
584
- "mean_token_accuracy": 0.8989696025848388,
585
- "num_tokens": 56661263.0,
586
- "step": 320
587
- },
588
- {
589
- "epoch": 3.7790697674418605,
590
- "grad_norm": 0.7754212021827698,
591
- "learning_rate": 3.723701095146863e-05,
592
- "loss": 0.2984,
593
- "mean_token_accuracy": 0.9011304140090942,
594
- "num_tokens": 57550955.0,
595
- "step": 325
596
- },
597
- {
598
- "epoch": 3.8372093023255816,
599
- "grad_norm": 0.7051293253898621,
600
- "learning_rate": 3.640186942210777e-05,
601
- "loss": 0.2973,
602
- "mean_token_accuracy": 0.9021319508552551,
603
- "num_tokens": 58438033.0,
604
- "step": 330
605
- },
606
- {
607
- "epoch": 3.895348837209302,
608
- "grad_norm": 0.8103964328765869,
609
- "learning_rate": 3.557731618163524e-05,
610
- "loss": 0.2739,
611
- "mean_token_accuracy": 0.9081305980682373,
612
- "num_tokens": 59306335.0,
613
- "step": 335
614
- },
615
- {
616
- "epoch": 3.953488372093023,
617
- "grad_norm": 0.764350175857544,
618
- "learning_rate": 3.476418484974561e-05,
619
- "loss": 0.3025,
620
- "mean_token_accuracy": 0.9021538257598877,
621
- "num_tokens": 60146879.0,
622
- "step": 340
623
  }
624
  ],
625
  "logging_steps": 5,
626
- "max_steps": 516,
627
  "num_input_tokens_seen": 0,
628
- "num_train_epochs": 6,
629
  "save_steps": 500,
630
  "stateful_callbacks": {
631
  "TrainerControl": {
@@ -639,7 +594,7 @@
639
  "attributes": {}
640
  }
641
  },
642
- "total_flos": 1.0229688130810675e+18,
643
  "train_batch_size": 48,
644
  "trial_name": null,
645
  "trial_params": null
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 3.95,
6
  "eval_steps": 500,
7
+ "global_step": 316,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
+ "epoch": 0.0625,
14
+ "grad_norm": 2.886897563934326,
15
  "learning_rate": 1.3636363636363635e-05,
16
+ "loss": 1.3691,
17
+ "mean_token_accuracy": 0.6758252620697022,
18
+ "num_tokens": 967205.0,
19
  "step": 5
20
  },
21
  {
22
+ "epoch": 0.125,
23
+ "grad_norm": 0.7570586800575256,
24
  "learning_rate": 3.068181818181818e-05,
25
+ "loss": 1.269,
26
+ "mean_token_accuracy": 0.6787961244583129,
27
+ "num_tokens": 1921321.0,
28
  "step": 10
29
  },
30
  {
31
+ "epoch": 0.1875,
32
+ "grad_norm": 0.5072895288467407,
33
  "learning_rate": 4.7727272727272724e-05,
34
+ "loss": 1.1276,
35
+ "mean_token_accuracy": 0.7031140804290772,
36
+ "num_tokens": 2869536.0,
37
  "step": 15
38
  },
39
  {
40
+ "epoch": 0.25,
41
+ "grad_norm": 0.43829378485679626,
42
  "learning_rate": 6.477272727272727e-05,
43
+ "loss": 1.0321,
44
+ "mean_token_accuracy": 0.7193317890167237,
45
+ "num_tokens": 3858500.0,
46
  "step": 20
47
  },
48
  {
49
+ "epoch": 0.3125,
50
+ "grad_norm": 0.4101383090019226,
51
+ "learning_rate": 7.499374865230175e-05,
52
+ "loss": 0.9679,
53
+ "mean_token_accuracy": 0.734985601902008,
54
+ "num_tokens": 4789698.0,
55
  "step": 25
56
  },
57
  {
58
+ "epoch": 0.375,
59
+ "grad_norm": 0.4972609281539917,
60
+ "learning_rate": 7.492345290159602e-05,
61
+ "loss": 0.8265,
62
+ "mean_token_accuracy": 0.7632619500160217,
63
+ "num_tokens": 5778900.0,
64
  "step": 30
65
  },
66
  {
67
+ "epoch": 0.4375,
68
+ "grad_norm": 0.3812519609928131,
69
+ "learning_rate": 7.477524313699733e-05,
70
+ "loss": 0.777,
71
+ "mean_token_accuracy": 0.780980110168457,
72
+ "num_tokens": 6747243.0,
73
  "step": 35
74
  },
75
  {
76
+ "epoch": 0.5,
77
+ "grad_norm": 0.41406524181365967,
78
+ "learning_rate": 7.454953106098704e-05,
79
+ "loss": 0.745,
80
+ "mean_token_accuracy": 0.7827757239341736,
81
+ "num_tokens": 7718219.0,
82
  "step": 40
83
  },
84
  {
85
+ "epoch": 0.5625,
86
+ "grad_norm": 0.4349099099636078,
87
+ "learning_rate": 7.42469436647895e-05,
88
+ "loss": 0.7068,
89
+ "mean_token_accuracy": 0.7929372310638427,
90
+ "num_tokens": 8655461.0,
91
  "step": 45
92
  },
93
  {
94
+ "epoch": 0.625,
95
+ "grad_norm": 0.4021725356578827,
96
+ "learning_rate": 7.386832148669304e-05,
97
+ "loss": 0.7122,
98
+ "mean_token_accuracy": 0.7939839363098145,
99
+ "num_tokens": 9604900.0,
100
  "step": 50
101
  },
102
  {
103
+ "epoch": 0.6875,
104
+ "grad_norm": 0.4050525426864624,
105
+ "learning_rate": 7.341471627717199e-05,
106
+ "loss": 0.6396,
107
+ "mean_token_accuracy": 0.813041603565216,
108
+ "num_tokens": 10597014.0,
109
  "step": 55
110
  },
111
  {
112
+ "epoch": 0.75,
113
+ "grad_norm": 0.4006189703941345,
114
+ "learning_rate": 7.288738807729602e-05,
115
+ "loss": 0.6521,
116
+ "mean_token_accuracy": 0.8042582392692565,
117
+ "num_tokens": 11601956.0,
118
  "step": 60
119
  },
120
  {
121
+ "epoch": 0.8125,
122
+ "grad_norm": 0.41143348813056946,
123
+ "learning_rate": 7.228780171854215e-05,
124
+ "loss": 0.638,
125
+ "mean_token_accuracy": 0.8092883229255676,
126
+ "num_tokens": 12547547.0,
127
  "step": 65
128
  },
129
  {
130
+ "epoch": 0.875,
131
+ "grad_norm": 0.534580409526825,
132
+ "learning_rate": 7.161762275373244e-05,
133
+ "loss": 0.5964,
134
+ "mean_token_accuracy": 0.8182763457298279,
135
+ "num_tokens": 13518585.0,
136
  "step": 70
137
  },
138
  {
139
+ "epoch": 0.9375,
140
+ "grad_norm": 0.5157734751701355,
141
+ "learning_rate": 7.087871283040086e-05,
142
+ "loss": 0.6566,
143
+ "mean_token_accuracy": 0.7993115663528443,
144
+ "num_tokens": 14487359.0,
145
  "step": 75
146
  },
147
  {
148
+ "epoch": 1.0,
149
+ "grad_norm": 0.47575053572654724,
150
+ "learning_rate": 7.007312451944087e-05,
151
+ "loss": 0.5802,
152
+ "mean_token_accuracy": 0.8218901753425598,
153
+ "num_tokens": 15456737.0,
154
  "step": 80
155
  },
156
  {
157
+ "epoch": 1.0625,
158
+ "grad_norm": 0.5268984436988831,
159
+ "learning_rate": 6.92030956133992e-05,
160
+ "loss": 0.5475,
161
+ "mean_token_accuracy": 0.8278343200683593,
162
+ "num_tokens": 16398357.0,
163
  "step": 85
164
  },
165
  {
166
+ "epoch": 1.125,
167
+ "grad_norm": 0.4960674047470093,
168
+ "learning_rate": 6.827104291025441e-05,
169
+ "loss": 0.546,
170
+ "mean_token_accuracy": 0.828590726852417,
171
+ "num_tokens": 17358500.0,
172
  "step": 90
173
  },
174
  {
175
+ "epoch": 1.1875,
176
+ "grad_norm": 0.5320209860801697,
177
+ "learning_rate": 6.727955549994725e-05,
178
+ "loss": 0.5207,
179
+ "mean_token_accuracy": 0.8370408773422241,
180
+ "num_tokens": 18342498.0,
181
  "step": 95
182
  },
183
  {
184
+ "epoch": 1.25,
185
+ "grad_norm": 0.579660177230835,
186
+ "learning_rate": 6.623138757231244e-05,
187
+ "loss": 0.5369,
188
+ "mean_token_accuracy": 0.835267984867096,
189
+ "num_tokens": 19327440.0,
190
  "step": 100
191
  },
192
  {
193
+ "epoch": 1.3125,
194
+ "grad_norm": 0.551972508430481,
195
+ "learning_rate": 6.512945076638986e-05,
196
+ "loss": 0.5268,
197
+ "mean_token_accuracy": 0.8328914523124695,
198
+ "num_tokens": 20296574.0,
199
  "step": 105
200
  },
201
  {
202
+ "epoch": 1.375,
203
+ "grad_norm": 0.47652754187583923,
204
+ "learning_rate": 6.397680608236752e-05,
205
+ "loss": 0.5298,
206
+ "mean_token_accuracy": 0.8306650876998901,
207
+ "num_tokens": 21246957.0,
208
  "step": 110
209
  },
210
  {
211
+ "epoch": 1.4375,
212
+ "grad_norm": 0.5899170637130737,
213
+ "learning_rate": 6.277665537862383e-05,
214
+ "loss": 0.5315,
215
+ "mean_token_accuracy": 0.8339821338653565,
216
+ "num_tokens": 22189101.0,
217
  "step": 115
218
  },
219
  {
220
+ "epoch": 1.5,
221
+ "grad_norm": 0.5031387805938721,
222
+ "learning_rate": 6.153233247748881e-05,
223
+ "loss": 0.4929,
224
+ "mean_token_accuracy": 0.8448952674865723,
225
+ "num_tokens": 23178128.0,
226
  "step": 120
227
  },
228
  {
229
+ "epoch": 1.5625,
230
+ "grad_norm": 0.5996953248977661,
231
+ "learning_rate": 6.0247293904430945e-05,
232
+ "loss": 0.4807,
233
+ "mean_token_accuracy": 0.8454113602638245,
234
+ "num_tokens": 24150209.0,
235
  "step": 125
236
  },
237
  {
238
+ "epoch": 1.625,
239
+ "grad_norm": 0.5869215726852417,
240
+ "learning_rate": 5.892510928639492e-05,
241
+ "loss": 0.4759,
242
+ "mean_token_accuracy": 0.8487537622451782,
243
+ "num_tokens": 25114253.0,
244
  "step": 130
245
  },
246
  {
247
+ "epoch": 1.6875,
248
+ "grad_norm": 0.6149603128433228,
249
+ "learning_rate": 5.756945143596188e-05,
250
+ "loss": 0.4714,
251
+ "mean_token_accuracy": 0.8475272536277771,
252
+ "num_tokens": 26051613.0,
253
  "step": 135
254
  },
255
  {
256
+ "epoch": 1.75,
257
+ "grad_norm": 0.6760532259941101,
258
+ "learning_rate": 5.6184086148876894e-05,
259
+ "loss": 0.5068,
260
+ "mean_token_accuracy": 0.8413119912147522,
261
+ "num_tokens": 26990255.0,
262
  "step": 140
263
  },
264
  {
265
+ "epoch": 1.8125,
266
+ "grad_norm": 0.6503332853317261,
267
+ "learning_rate": 5.477286174328442e-05,
268
+ "loss": 0.4402,
269
+ "mean_token_accuracy": 0.8568204998970032,
270
+ "num_tokens": 27999730.0,
271
  "step": 145
272
  },
273
  {
274
+ "epoch": 1.875,
275
+ "grad_norm": 0.611965000629425,
276
+ "learning_rate": 5.333969836972997e-05,
277
+ "loss": 0.4814,
278
+ "mean_token_accuracy": 0.8444833040237427,
279
+ "num_tokens": 28967267.0,
280
  "step": 150
281
  },
282
  {
283
+ "epoch": 1.9375,
284
+ "grad_norm": 0.6395599842071533,
285
+ "learning_rate": 5.188857712162322e-05,
286
+ "loss": 0.4613,
287
+ "mean_token_accuracy": 0.8521966099739074,
288
+ "num_tokens": 29916924.0,
289
  "step": 155
290
  },
291
  {
292
+ "epoch": 2.0,
293
+ "grad_norm": 0.670397937297821,
294
+ "learning_rate": 5.042352897641175e-05,
295
+ "loss": 0.4742,
296
+ "mean_token_accuracy": 0.8465383648872375,
297
+ "num_tokens": 30895018.0,
298
  "step": 160
299
  },
300
  {
301
+ "epoch": 2.0625,
302
+ "grad_norm": 0.6061509847640991,
303
+ "learning_rate": 4.894862359818504e-05,
304
+ "loss": 0.4264,
305
+ "mean_token_accuracy": 0.8613315701484681,
306
+ "num_tokens": 31832051.0,
307
  "step": 165
308
  },
309
  {
310
+ "epoch": 2.125,
311
+ "grad_norm": 0.6346914768218994,
312
+ "learning_rate": 4.746795803281343e-05,
313
+ "loss": 0.4153,
314
+ "mean_token_accuracy": 0.8654327511787414,
315
+ "num_tokens": 32782084.0,
316
  "step": 170
317
  },
318
  {
319
+ "epoch": 2.1875,
320
+ "grad_norm": 0.6239711046218872,
321
+ "learning_rate": 4.59856453270249e-05,
322
+ "loss": 0.4147,
323
+ "mean_token_accuracy": 0.8632163763046264,
324
+ "num_tokens": 33740572.0,
325
  "step": 175
326
  },
327
  {
328
+ "epoch": 2.25,
329
+ "grad_norm": 0.5688380002975464,
330
+ "learning_rate": 4.450580310303404e-05,
331
+ "loss": 0.4035,
332
+ "mean_token_accuracy": 0.864958119392395,
333
+ "num_tokens": 34760832.0,
334
  "step": 180
335
  },
336
  {
337
+ "epoch": 2.3125,
338
+ "grad_norm": 0.6970889568328857,
339
+ "learning_rate": 4.303254212046112e-05,
340
+ "loss": 0.4278,
341
+ "mean_token_accuracy": 0.8623119592666626,
342
+ "num_tokens": 35675387.0,
343
  "step": 185
344
  },
345
  {
346
+ "epoch": 2.375,
347
+ "grad_norm": 0.6932367086410522,
348
+ "learning_rate": 4.156995485731436e-05,
349
+ "loss": 0.4167,
350
+ "mean_token_accuracy": 0.8627482533454895,
351
+ "num_tokens": 36654691.0,
352
  "step": 190
353
  },
354
  {
355
+ "epoch": 2.4375,
356
+ "grad_norm": 0.74919193983078,
357
+ "learning_rate": 4.0122104141755454e-05,
358
+ "loss": 0.4041,
359
+ "mean_token_accuracy": 0.8695870995521545,
360
+ "num_tokens": 37623031.0,
361
  "step": 195
362
  },
363
  {
364
+ "epoch": 2.5,
365
+ "grad_norm": 0.6283291578292847,
366
+ "learning_rate": 3.869301186622754e-05,
367
+ "loss": 0.3863,
368
+ "mean_token_accuracy": 0.8726918458938598,
369
+ "num_tokens": 38620801.0,
370
  "step": 200
371
  },
372
  {
373
+ "epoch": 2.5625,
374
+ "grad_norm": 0.5696513652801514,
375
+ "learning_rate": 3.728664781529596e-05,
376
+ "loss": 0.3979,
377
+ "mean_token_accuracy": 0.8664975047111512,
378
+ "num_tokens": 39619709.0,
379
  "step": 205
380
  },
381
  {
382
+ "epoch": 2.625,
383
+ "grad_norm": 0.804267168045044,
384
+ "learning_rate": 3.590691863823604e-05,
385
+ "loss": 0.4252,
386
+ "mean_token_accuracy": 0.8591230988502503,
387
+ "num_tokens": 40603368.0,
388
  "step": 210
389
  },
390
  {
391
+ "epoch": 2.6875,
392
+ "grad_norm": 0.8184316158294678,
393
+ "learning_rate": 3.4557656997000574e-05,
394
+ "loss": 0.4003,
395
+ "mean_token_accuracy": 0.8659304857254029,
396
+ "num_tokens": 41548896.0,
397
  "step": 215
398
  },
399
  {
400
+ "epoch": 2.75,
401
+ "grad_norm": 0.8127630352973938,
402
+ "learning_rate": 3.324261091971178e-05,
403
+ "loss": 0.3871,
404
+ "mean_token_accuracy": 0.8709235548973083,
405
+ "num_tokens": 42524953.0,
406
  "step": 220
407
  },
408
  {
409
+ "epoch": 2.8125,
410
+ "grad_norm": 0.7622901797294617,
411
+ "learning_rate": 3.1965433389252365e-05,
412
+ "loss": 0.3845,
413
+ "mean_token_accuracy": 0.8702649950981141,
414
+ "num_tokens": 43484492.0,
415
  "step": 225
416
  },
417
  {
418
+ "epoch": 2.875,
419
+ "grad_norm": 0.6691771149635315,
420
+ "learning_rate": 3.0729672195876615e-05,
421
+ "loss": 0.3907,
422
+ "mean_token_accuracy": 0.8697134971618652,
423
+ "num_tokens": 44459752.0,
424
  "step": 230
425
  },
426
  {
427
+ "epoch": 2.9375,
428
+ "grad_norm": 0.8623871207237244,
429
+ "learning_rate": 2.953876008202943e-05,
430
+ "loss": 0.4045,
431
+ "mean_token_accuracy": 0.8645989656448364,
432
+ "num_tokens": 45374136.0,
433
  "step": 235
434
  },
435
  {
436
+ "epoch": 3.0,
437
+ "grad_norm": 0.6397231817245483,
438
+ "learning_rate": 2.8396005206749356e-05,
439
+ "loss": 0.3915,
440
+ "mean_token_accuracy": 0.8694759726524353,
441
+ "num_tokens": 46347054.0,
442
  "step": 240
443
  },
444
  {
445
+ "epoch": 3.0625,
446
+ "grad_norm": 0.6764381527900696,
447
+ "learning_rate": 2.7304581956143917e-05,
448
+ "loss": 0.3568,
449
+ "mean_token_accuracy": 0.8802210927009583,
450
+ "num_tokens": 47320044.0,
451
  "step": 245
452
  },
453
  {
454
+ "epoch": 3.125,
455
+ "grad_norm": 0.7345840334892273,
456
+ "learning_rate": 2.626752212546434e-05,
457
+ "loss": 0.3549,
458
+ "mean_token_accuracy": 0.878583550453186,
459
+ "num_tokens": 48309769.0,
460
  "step": 250
461
  },
462
  {
463
+ "epoch": 3.1875,
464
+ "grad_norm": 0.8476727604866028,
465
+ "learning_rate": 2.528770649727422e-05,
466
+ "loss": 0.3341,
467
+ "mean_token_accuracy": 0.8889845728874206,
468
+ "num_tokens": 49276272.0,
469
  "step": 255
470
  },
471
  {
472
+ "epoch": 3.25,
473
+ "grad_norm": 0.825459361076355,
474
+ "learning_rate": 2.4367856839106895e-05,
475
+ "loss": 0.3821,
476
+ "mean_token_accuracy": 0.8741106748580932,
477
+ "num_tokens": 50223204.0,
478
  "step": 260
479
  },
480
  {
481
+ "epoch": 3.3125,
482
+ "grad_norm": 0.7627800703048706,
483
+ "learning_rate": 2.3510528342840405e-05,
484
+ "loss": 0.3394,
485
+ "mean_token_accuracy": 0.8844169974327087,
486
+ "num_tokens": 51217236.0,
487
  "step": 265
488
  },
489
  {
490
+ "epoch": 3.375,
491
+ "grad_norm": 0.7601186037063599,
492
+ "learning_rate": 2.2718102526792474e-05,
493
+ "loss": 0.334,
494
+ "mean_token_accuracy": 0.8848990678787232,
495
+ "num_tokens": 52214250.0,
496
  "step": 270
497
  },
498
  {
499
+ "epoch": 3.4375,
500
+ "grad_norm": 1.0226414203643799,
501
+ "learning_rate": 2.1992780620252184e-05,
502
+ "loss": 0.3371,
503
+ "mean_token_accuracy": 0.8848458886146545,
504
+ "num_tokens": 53147457.0,
505
  "step": 275
506
  },
507
  {
508
+ "epoch": 3.5,
509
+ "grad_norm": 0.6799741387367249,
510
+ "learning_rate": 2.1336577448825122e-05,
511
+ "loss": 0.3391,
512
+ "mean_token_accuracy": 0.884827721118927,
513
+ "num_tokens": 54144048.0,
514
  "step": 280
515
  },
516
  {
517
+ "epoch": 3.5625,
518
+ "grad_norm": 0.7272220849990845,
519
+ "learning_rate": 2.075131583757742e-05,
520
+ "loss": 0.3392,
521
+ "mean_token_accuracy": 0.8837083220481873,
522
+ "num_tokens": 55118118.0,
523
  "step": 285
524
  },
525
  {
526
+ "epoch": 3.625,
527
+ "grad_norm": 0.7519774436950684,
528
+ "learning_rate": 2.0238621547525902e-05,
529
+ "loss": 0.3381,
530
+ "mean_token_accuracy": 0.8849397540092468,
531
+ "num_tokens": 56034052.0,
532
  "step": 290
533
  },
534
  {
535
+ "epoch": 3.6875,
536
+ "grad_norm": 0.917468249797821,
537
+ "learning_rate": 1.979991875953994e-05,
538
+ "loss": 0.3109,
539
+ "mean_token_accuracy": 0.8913192272186279,
540
+ "num_tokens": 56994081.0,
541
  "step": 295
542
  },
543
  {
544
+ "epoch": 3.75,
545
+ "grad_norm": 0.7441599369049072,
546
+ "learning_rate": 1.943642611819996e-05,
547
+ "loss": 0.3364,
548
+ "mean_token_accuracy": 0.8865782380104065,
549
+ "num_tokens": 57997199.0,
550
  "step": 300
551
  },
552
  {
553
+ "epoch": 3.8125,
554
+ "grad_norm": 0.9184499382972717,
555
+ "learning_rate": 1.9149153346602176e-05,
556
+ "loss": 0.3488,
557
+ "mean_token_accuracy": 0.8831375479698181,
558
+ "num_tokens": 58922928.0,
559
  "step": 305
560
  },
561
  {
562
+ "epoch": 3.875,
563
+ "grad_norm": 0.8689393997192383,
564
+ "learning_rate": 1.893889844151295e-05,
565
+ "loss": 0.3406,
566
+ "mean_token_accuracy": 0.884752631187439,
567
+ "num_tokens": 59846729.0,
568
  "step": 310
569
  },
570
  {
571
+ "epoch": 3.9375,
572
+ "grad_norm": 0.822659432888031,
573
+ "learning_rate": 1.8806245456664362e-05,
574
+ "loss": 0.336,
575
+ "mean_token_accuracy": 0.8861027598381043,
576
+ "num_tokens": 60832044.0,
577
  "step": 315
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
578
  }
579
  ],
580
  "logging_steps": 5,
581
+ "max_steps": 320,
582
  "num_input_tokens_seen": 0,
583
+ "num_train_epochs": 4,
584
  "save_steps": 500,
585
  "stateful_callbacks": {
586
  "TrainerControl": {
 
594
  "attributes": {}
595
  }
596
  },
597
+ "total_flos": 1.0379419406848492e+18,
598
  "train_batch_size": 48,
599
  "trial_name": null,
600
  "trial_params": null
training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:11b2dc08c61f0b0bd6c9cf3944edb9af5b3264a14ba67c0aff78512d95aa186b
3
  size 6417
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c8fb0fe44069b4bae4e0c71790211b8428792f864c7811e300552e9a7dba13cc
3
  size 6417