File size: 18,187 Bytes
7170091
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
163
164
165
166
167
168
169
170
171
172
173
174
175
176
177
178
179
180
181
182
183
184
185
186
187
188
189
190
191
192
193
194
195
196
197
198
199
200
201
202
203
204
205
206
207
208
209
210
211
212
213
214
215
216
217
218
219
220
221
222
223
224
225
226
227
228
229
230
231
232
233
234
235
236
237
238
239
240
241
242
243
244
245
246
247
248
249
250
251
252
253
254
255
256
257
258
259
260
261
262
263
264
265
266
267
268
269
270
271
272
273
274
275
276
277
278
279
280
281
282
283
284
285
286
287
288
289
290
291
292
293
294
295
296
297
298
299
300
301
302
303
304
305
306
307
308
309
310
311
312
313
314
315
316
317
318
319
320
321
322
323
324
325
326
327
328
329
330
331
332
333
334
335
336
337
338
339
340
341
342
343
344
345
346
347
348
349
350
351
352
353
354
355
356
357
358
359
360
361
362
363
364
365
366
367
368
369
370
371
372
373
374
375
376
377
378
379
380
381
382
383
384
385
386
387
388
389
390
391
392
393
394
395
396
397
398
399
400
401
402
403
404
405
406
407
408
409
410
411
412
413
414
415
416
417
418
419
420
421
422
423
424
425
426
427
428
429
430
431
432
433
434
435
436
437
438
439
440
441
442
443
444
445
446
447
448
449
450
451
452
453
454
455
456
457
458
459
460
461
462
463
464
465
466
467
468
469
470
471
472
473
474
475
476
477
478
479
480
481
482
483
484
485
486
487
488
489
490
491
492
493
494
495
496
497
498
499
500
501
502
503
504
505
506
507
508
509
510
511
512
513
514
515
516
517
518
519
520
521
522
523
524
525
526
527
528
529
530
531
532
533
534
535
536
537
538
539
540
541
542
543
544
545
546
547
548
549
550
551
552
553
554
555
556
557
558
559
560
561
562
563
564
565
566
567
568
569
570
571
572
573
574
575
576
577
578
579
580
581
582
583
584
585
586
587
588
589
590
591
592
593
594
595
596
597
598
599
600
601
602
603
604
605
606
607
608
609
610
611
612
613
614
615
616
617
618
619
620
621
622
623
624
625
626
627
628
629
630
631
632
633
634
635
{
  "best_global_step": null,
  "best_metric": null,
  "best_model_checkpoint": null,
  "epoch": 3.0,
  "eval_steps": 500,
  "global_step": 60,
  "is_hyper_param_search": false,
  "is_local_process_zero": true,
  "is_world_process_zero": true,
  "log_history": [
    {
      "entropy": 0.3058870881795883,
      "epoch": 0.05063291139240506,
      "grad_norm": 1.2109375,
      "learning_rate": 0.0,
      "loss": 0.8967164754867554,
      "mean_token_accuracy": 0.7853250801563263,
      "num_tokens": 4094.0,
      "step": 1
    },
    {
      "entropy": 0.2770821340382099,
      "epoch": 0.10126582278481013,
      "grad_norm": 1.1953125,
      "learning_rate": 4e-05,
      "loss": 0.8378055095672607,
      "mean_token_accuracy": 0.8762781769037247,
      "num_tokens": 8270.0,
      "step": 2
    },
    {
      "entropy": 0.33289381861686707,
      "epoch": 0.1518987341772152,
      "grad_norm": 2.28125,
      "learning_rate": 8e-05,
      "loss": 1.3381309509277344,
      "mean_token_accuracy": 0.8489641100168228,
      "num_tokens": 12538.0,
      "step": 3
    },
    {
      "entropy": 0.2396358586847782,
      "epoch": 0.20253164556962025,
      "grad_norm": 0.8125,
      "learning_rate": 0.00012,
      "loss": 0.4996604919433594,
      "mean_token_accuracy": 0.9098183065652847,
      "num_tokens": 16803.0,
      "step": 4
    },
    {
      "entropy": 0.3024279847741127,
      "epoch": 0.25316455696202533,
      "grad_norm": 1.015625,
      "learning_rate": 0.00016,
      "loss": 0.57768714427948,
      "mean_token_accuracy": 0.8811647891998291,
      "num_tokens": 21541.0,
      "step": 5
    },
    {
      "entropy": 0.2746536508202553,
      "epoch": 0.3037974683544304,
      "grad_norm": 0.84375,
      "learning_rate": 0.0002,
      "loss": 0.2727876305580139,
      "mean_token_accuracy": 0.925768256187439,
      "num_tokens": 25660.0,
      "step": 6
    },
    {
      "entropy": 0.21791627258062363,
      "epoch": 0.35443037974683544,
      "grad_norm": 0.515625,
      "learning_rate": 0.00019636363636363636,
      "loss": 0.13589006662368774,
      "mean_token_accuracy": 0.9386249780654907,
      "num_tokens": 29675.0,
      "step": 7
    },
    {
      "entropy": 0.23072286322712898,
      "epoch": 0.4050632911392405,
      "grad_norm": 0.66796875,
      "learning_rate": 0.00019272727272727274,
      "loss": 0.22619852423667908,
      "mean_token_accuracy": 0.9601024985313416,
      "num_tokens": 33786.0,
      "step": 8
    },
    {
      "entropy": 0.12776251882314682,
      "epoch": 0.45569620253164556,
      "grad_norm": 0.3359375,
      "learning_rate": 0.0001890909090909091,
      "loss": 0.12999381124973297,
      "mean_token_accuracy": 0.964403823018074,
      "num_tokens": 38029.0,
      "step": 9
    },
    {
      "entropy": 0.15997863747179508,
      "epoch": 0.5063291139240507,
      "grad_norm": 0.380859375,
      "learning_rate": 0.00018545454545454545,
      "loss": 0.1289505809545517,
      "mean_token_accuracy": 0.9806439429521561,
      "num_tokens": 41940.0,
      "step": 10
    },
    {
      "entropy": 0.17812986858189106,
      "epoch": 0.5569620253164557,
      "grad_norm": 0.6328125,
      "learning_rate": 0.00018181818181818183,
      "loss": 0.09373250603675842,
      "mean_token_accuracy": 0.9405141770839691,
      "num_tokens": 45774.0,
      "step": 11
    },
    {
      "entropy": 0.12172849662601948,
      "epoch": 0.6075949367088608,
      "grad_norm": 0.2177734375,
      "learning_rate": 0.0001781818181818182,
      "loss": 0.03453471511602402,
      "mean_token_accuracy": 1.0,
      "num_tokens": 49748.0,
      "step": 12
    },
    {
      "entropy": 0.18016426265239716,
      "epoch": 0.6582278481012658,
      "grad_norm": 0.28125,
      "learning_rate": 0.00017454545454545454,
      "loss": 0.156061589717865,
      "mean_token_accuracy": 0.9543326944112778,
      "num_tokens": 54197.0,
      "step": 13
    },
    {
      "entropy": 0.13954658806324005,
      "epoch": 0.7088607594936709,
      "grad_norm": 0.296875,
      "learning_rate": 0.0001709090909090909,
      "loss": 0.10283268988132477,
      "mean_token_accuracy": 0.9802946299314499,
      "num_tokens": 58556.0,
      "step": 14
    },
    {
      "entropy": 0.08406208734959364,
      "epoch": 0.759493670886076,
      "grad_norm": 0.5234375,
      "learning_rate": 0.00016727272727272728,
      "loss": 0.057560667395591736,
      "mean_token_accuracy": 0.9583040475845337,
      "num_tokens": 62314.0,
      "step": 15
    },
    {
      "entropy": 0.14593530632555485,
      "epoch": 0.810126582278481,
      "grad_norm": 0.2890625,
      "learning_rate": 0.00016363636363636366,
      "loss": 0.13262268900871277,
      "mean_token_accuracy": 0.9821915328502655,
      "num_tokens": 66709.0,
      "step": 16
    },
    {
      "entropy": 0.12713714689016342,
      "epoch": 0.8607594936708861,
      "grad_norm": 0.232421875,
      "learning_rate": 0.00016,
      "loss": 0.098836250603199,
      "mean_token_accuracy": 0.9742450714111328,
      "num_tokens": 71033.0,
      "step": 17
    },
    {
      "entropy": 0.07605009153485298,
      "epoch": 0.9113924050632911,
      "grad_norm": 0.275390625,
      "learning_rate": 0.00015636363636363637,
      "loss": 0.06675960123538971,
      "mean_token_accuracy": 0.9730987101793289,
      "num_tokens": 75240.0,
      "step": 18
    },
    {
      "entropy": 0.08511319197714329,
      "epoch": 0.9620253164556962,
      "grad_norm": 0.251953125,
      "learning_rate": 0.00015272727272727275,
      "loss": 0.06137944757938385,
      "mean_token_accuracy": 0.9560078978538513,
      "num_tokens": 79484.0,
      "step": 19
    },
    {
      "entropy": 0.09591637427608173,
      "epoch": 1.0,
      "grad_norm": 0.1982421875,
      "learning_rate": 0.0001490909090909091,
      "loss": 0.09518605470657349,
      "mean_token_accuracy": 0.9860279361406962,
      "num_tokens": 82572.0,
      "step": 20
    },
    {
      "entropy": 0.09083444299176335,
      "epoch": 1.0506329113924051,
      "grad_norm": 0.2294921875,
      "learning_rate": 0.00014545454545454546,
      "loss": 0.06781512498855591,
      "mean_token_accuracy": 0.9847126454114914,
      "num_tokens": 87051.0,
      "step": 21
    },
    {
      "entropy": 0.07092627324163914,
      "epoch": 1.1012658227848102,
      "grad_norm": 0.1875,
      "learning_rate": 0.00014181818181818184,
      "loss": 0.051979709416627884,
      "mean_token_accuracy": 0.9823355972766876,
      "num_tokens": 91753.0,
      "step": 22
    },
    {
      "entropy": 0.05573681928217411,
      "epoch": 1.1518987341772151,
      "grad_norm": 0.373046875,
      "learning_rate": 0.0001381818181818182,
      "loss": 0.04127391055226326,
      "mean_token_accuracy": 0.9915009140968323,
      "num_tokens": 95997.0,
      "step": 23
    },
    {
      "entropy": 0.06601053988561034,
      "epoch": 1.2025316455696202,
      "grad_norm": 0.1669921875,
      "learning_rate": 0.00013454545454545455,
      "loss": 0.029800206422805786,
      "mean_token_accuracy": 0.99110147356987,
      "num_tokens": 100340.0,
      "step": 24
    },
    {
      "entropy": 0.06689108535647392,
      "epoch": 1.2531645569620253,
      "grad_norm": 0.1572265625,
      "learning_rate": 0.00013090909090909093,
      "loss": 0.03818785399198532,
      "mean_token_accuracy": 0.98154416680336,
      "num_tokens": 104255.0,
      "step": 25
    },
    {
      "entropy": 0.11440154490992427,
      "epoch": 1.3037974683544304,
      "grad_norm": 0.197265625,
      "learning_rate": 0.00012727272727272728,
      "loss": 0.07071410864591599,
      "mean_token_accuracy": 0.9655913859605789,
      "num_tokens": 108510.0,
      "step": 26
    },
    {
      "entropy": 0.05173112731426954,
      "epoch": 1.3544303797468356,
      "grad_norm": 0.181640625,
      "learning_rate": 0.00012363636363636364,
      "loss": 0.04332485422492027,
      "mean_token_accuracy": 0.9889708757400513,
      "num_tokens": 112648.0,
      "step": 27
    },
    {
      "entropy": 0.11879035737365484,
      "epoch": 1.4050632911392404,
      "grad_norm": 0.2890625,
      "learning_rate": 0.00012,
      "loss": 0.030448323115706444,
      "mean_token_accuracy": 0.9249999970197678,
      "num_tokens": 116428.0,
      "step": 28
    },
    {
      "entropy": 0.04456495773047209,
      "epoch": 1.4556962025316456,
      "grad_norm": 0.263671875,
      "learning_rate": 0.00011636363636363636,
      "loss": 0.026923775672912598,
      "mean_token_accuracy": 0.9970930218696594,
      "num_tokens": 120223.0,
      "step": 29
    },
    {
      "entropy": 0.05467428918927908,
      "epoch": 1.5063291139240507,
      "grad_norm": 0.30078125,
      "learning_rate": 0.00011272727272727272,
      "loss": 0.05243736505508423,
      "mean_token_accuracy": 0.9819361567497253,
      "num_tokens": 124463.0,
      "step": 30
    },
    {
      "entropy": 0.12604457885026932,
      "epoch": 1.5569620253164556,
      "grad_norm": 0.232421875,
      "learning_rate": 0.00010909090909090909,
      "loss": 0.09929254651069641,
      "mean_token_accuracy": 0.9316810220479965,
      "num_tokens": 128541.0,
      "step": 31
    },
    {
      "entropy": 0.05706793861463666,
      "epoch": 1.6075949367088609,
      "grad_norm": 0.1513671875,
      "learning_rate": 0.00010545454545454545,
      "loss": 0.06422308087348938,
      "mean_token_accuracy": 0.986874520778656,
      "num_tokens": 133117.0,
      "step": 32
    },
    {
      "entropy": 0.07498226407915354,
      "epoch": 1.6582278481012658,
      "grad_norm": 0.21484375,
      "learning_rate": 0.00010181818181818181,
      "loss": 0.0917193740606308,
      "mean_token_accuracy": 0.9649497419595718,
      "num_tokens": 137164.0,
      "step": 33
    },
    {
      "entropy": 0.04969165986403823,
      "epoch": 1.7088607594936709,
      "grad_norm": 0.1845703125,
      "learning_rate": 9.818181818181818e-05,
      "loss": 0.03874623030424118,
      "mean_token_accuracy": 0.9855220764875412,
      "num_tokens": 141297.0,
      "step": 34
    },
    {
      "entropy": 0.059562995098531246,
      "epoch": 1.759493670886076,
      "grad_norm": 0.234375,
      "learning_rate": 9.454545454545455e-05,
      "loss": 0.07269799709320068,
      "mean_token_accuracy": 0.9904753267765045,
      "num_tokens": 145157.0,
      "step": 35
    },
    {
      "entropy": 0.06618588929995894,
      "epoch": 1.810126582278481,
      "grad_norm": 0.154296875,
      "learning_rate": 9.090909090909092e-05,
      "loss": 0.05096203833818436,
      "mean_token_accuracy": 0.9642254859209061,
      "num_tokens": 149499.0,
      "step": 36
    },
    {
      "entropy": 0.06980292382650077,
      "epoch": 1.8607594936708862,
      "grad_norm": 0.2080078125,
      "learning_rate": 8.727272727272727e-05,
      "loss": 0.015605948865413666,
      "mean_token_accuracy": 0.9749999940395355,
      "num_tokens": 153413.0,
      "step": 37
    },
    {
      "entropy": 0.0673763882368803,
      "epoch": 1.9113924050632911,
      "grad_norm": 0.56640625,
      "learning_rate": 8.363636363636364e-05,
      "loss": 0.12869100272655487,
      "mean_token_accuracy": 0.9618695080280304,
      "num_tokens": 157547.0,
      "step": 38
    },
    {
      "entropy": 0.04205051809549332,
      "epoch": 1.9620253164556962,
      "grad_norm": 0.1533203125,
      "learning_rate": 8e-05,
      "loss": 0.051324643194675446,
      "mean_token_accuracy": 0.9915735274553299,
      "num_tokens": 161912.0,
      "step": 39
    },
    {
      "entropy": 0.03731320612132549,
      "epoch": 2.0,
      "grad_norm": 0.15234375,
      "learning_rate": 7.636363636363637e-05,
      "loss": 0.03378448635339737,
      "mean_token_accuracy": 0.9946303764979044,
      "num_tokens": 165144.0,
      "step": 40
    },
    {
      "entropy": 0.07533124275505543,
      "epoch": 2.050632911392405,
      "grad_norm": 0.216796875,
      "learning_rate": 7.272727272727273e-05,
      "loss": 0.04694521799683571,
      "mean_token_accuracy": 0.9949748814105988,
      "num_tokens": 169344.0,
      "step": 41
    },
    {
      "entropy": 0.045258086174726486,
      "epoch": 2.1012658227848102,
      "grad_norm": 0.158203125,
      "learning_rate": 6.90909090909091e-05,
      "loss": 0.03484552353620529,
      "mean_token_accuracy": 0.9914986789226532,
      "num_tokens": 173572.0,
      "step": 42
    },
    {
      "entropy": 0.05962226795963943,
      "epoch": 2.151898734177215,
      "grad_norm": 0.15234375,
      "learning_rate": 6.545454545454546e-05,
      "loss": 0.05552398040890694,
      "mean_token_accuracy": 0.9867942631244659,
      "num_tokens": 178049.0,
      "step": 43
    },
    {
      "entropy": 0.04453732492402196,
      "epoch": 2.2025316455696204,
      "grad_norm": 0.25,
      "learning_rate": 6.181818181818182e-05,
      "loss": 0.07184948027133942,
      "mean_token_accuracy": 0.9885145127773285,
      "num_tokens": 182147.0,
      "step": 44
    },
    {
      "entropy": 0.036392109002918005,
      "epoch": 2.2531645569620253,
      "grad_norm": 0.26953125,
      "learning_rate": 5.818181818181818e-05,
      "loss": 0.028611719608306885,
      "mean_token_accuracy": 0.9898450970649719,
      "num_tokens": 186075.0,
      "step": 45
    },
    {
      "entropy": 0.046361514599993825,
      "epoch": 2.3037974683544302,
      "grad_norm": 0.1630859375,
      "learning_rate": 5.4545454545454546e-05,
      "loss": 0.02000986412167549,
      "mean_token_accuracy": 0.9895833283662796,
      "num_tokens": 189736.0,
      "step": 46
    },
    {
      "entropy": 0.059202448232099414,
      "epoch": 2.3544303797468356,
      "grad_norm": 0.2216796875,
      "learning_rate": 5.090909090909091e-05,
      "loss": 0.03575129061937332,
      "mean_token_accuracy": 0.9949752688407898,
      "num_tokens": 194069.0,
      "step": 47
    },
    {
      "entropy": 0.0532573452219367,
      "epoch": 2.4050632911392404,
      "grad_norm": 0.13671875,
      "learning_rate": 4.7272727272727275e-05,
      "loss": 0.037198036909103394,
      "mean_token_accuracy": 0.9947335422039032,
      "num_tokens": 198435.0,
      "step": 48
    },
    {
      "entropy": 0.046060606604442,
      "epoch": 2.4556962025316453,
      "grad_norm": 0.171875,
      "learning_rate": 4.3636363636363636e-05,
      "loss": 0.0407770499587059,
      "mean_token_accuracy": 0.9934192597866058,
      "num_tokens": 202365.0,
      "step": 49
    },
    {
      "entropy": 0.051424249075353146,
      "epoch": 2.5063291139240507,
      "grad_norm": 0.2353515625,
      "learning_rate": 4e-05,
      "loss": 0.04629915952682495,
      "mean_token_accuracy": 0.9804457575082779,
      "num_tokens": 206300.0,
      "step": 50
    },
    {
      "entropy": 0.05351645685732365,
      "epoch": 2.5569620253164556,
      "grad_norm": 0.1474609375,
      "learning_rate": 3.6363636363636364e-05,
      "loss": 0.03186073899269104,
      "mean_token_accuracy": 0.9686382859945297,
      "num_tokens": 210440.0,
      "step": 51
    },
    {
      "entropy": 0.0505744197871536,
      "epoch": 2.607594936708861,
      "grad_norm": 0.1328125,
      "learning_rate": 3.272727272727273e-05,
      "loss": 0.034618668258190155,
      "mean_token_accuracy": 0.9690476208925247,
      "num_tokens": 214755.0,
      "step": 52
    },
    {
      "entropy": 0.09076045430265367,
      "epoch": 2.6582278481012658,
      "grad_norm": 0.1123046875,
      "learning_rate": 2.909090909090909e-05,
      "loss": 0.03738842159509659,
      "mean_token_accuracy": 0.9946236610412598,
      "num_tokens": 219052.0,
      "step": 53
    },
    {
      "entropy": 0.03509035054594278,
      "epoch": 2.708860759493671,
      "grad_norm": 0.09716796875,
      "learning_rate": 2.5454545454545454e-05,
      "loss": 0.017466925084590912,
      "mean_token_accuracy": 0.9951923042535782,
      "num_tokens": 223211.0,
      "step": 54
    },
    {
      "entropy": 0.03864420251920819,
      "epoch": 2.759493670886076,
      "grad_norm": 0.10595703125,
      "learning_rate": 2.1818181818181818e-05,
      "loss": 0.023350555449724197,
      "mean_token_accuracy": 0.9902347922325134,
      "num_tokens": 227258.0,
      "step": 55
    },
    {
      "entropy": 0.06260875472798944,
      "epoch": 2.810126582278481,
      "grad_norm": 0.2333984375,
      "learning_rate": 1.8181818181818182e-05,
      "loss": 0.06964948028326035,
      "mean_token_accuracy": 0.9637512564659119,
      "num_tokens": 231368.0,
      "step": 56
    },
    {
      "entropy": 0.03902584942989051,
      "epoch": 2.8607594936708862,
      "grad_norm": 0.08447265625,
      "learning_rate": 1.4545454545454545e-05,
      "loss": 0.026787985116243362,
      "mean_token_accuracy": 0.9909819066524506,
      "num_tokens": 235881.0,
      "step": 57
    },
    {
      "entropy": 0.026682122610509396,
      "epoch": 2.911392405063291,
      "grad_norm": 0.1455078125,
      "learning_rate": 1.0909090909090909e-05,
      "loss": 0.017513107508420944,
      "mean_token_accuracy": 0.9918909966945648,
      "num_tokens": 240330.0,
      "step": 58
    },
    {
      "entropy": 0.02819057530723512,
      "epoch": 2.962025316455696,
      "grad_norm": 0.126953125,
      "learning_rate": 7.272727272727272e-06,
      "loss": 0.016973333433270454,
      "mean_token_accuracy": 0.9969512224197388,
      "num_tokens": 244397.0,
      "step": 59
    },
    {
      "entropy": 0.09315565973520279,
      "epoch": 3.0,
      "grad_norm": 0.1376953125,
      "learning_rate": 3.636363636363636e-06,
      "loss": 0.037921059876680374,
      "mean_token_accuracy": 0.9591470758120219,
      "num_tokens": 247716.0,
      "step": 60
    }
  ],
  "logging_steps": 1,
  "max_steps": 60,
  "num_input_tokens_seen": 0,
  "num_train_epochs": 3,
  "save_steps": 500,
  "stateful_callbacks": {
    "TrainerControl": {
      "args": {
        "should_epoch_stop": false,
        "should_evaluate": false,
        "should_log": false,
        "should_save": true,
        "should_training_stop": true
      },
      "attributes": {}
    }
  },
  "total_flos": 4269851314864128.0,
  "train_batch_size": 1,
  "trial_name": null,
  "trial_params": null
}