File size: 39,973 Bytes
8e74b89
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
163
164
165
166
167
168
169
170
171
172
173
174
175
176
177
178
179
180
181
182
{"entropy": 0.8749912828207016, "epoch": 0.005714285714285714, "grad_norm": 0.494140625, "learning_rate": 0.0, "loss": 0.35, "mean_token_accuracy": 0.8977917954325676, "num_tokens": 29411.0, "step": 1}
{"entropy": 0.875585176050663, "epoch": 0.011428571428571429, "grad_norm": 0.44921875, "learning_rate": 1.111111111111111e-06, "loss": 0.108, "mean_token_accuracy": 0.9535237550735474, "num_tokens": 54683.0, "step": 2}
{"entropy": 0.9626811370253563, "epoch": 0.017142857142857144, "grad_norm": 0.494140625, "learning_rate": 2.222222222222222e-06, "loss": 0.1226, "mean_token_accuracy": 0.9568850845098495, "num_tokens": 75772.0, "step": 3}
{"entropy": 0.9870915822684765, "epoch": 0.022857142857142857, "grad_norm": 0.671875, "learning_rate": 3.3333333333333333e-06, "loss": 0.2987, "mean_token_accuracy": 0.9255228415131569, "num_tokens": 94596.0, "step": 4}
{"entropy": 0.9431633446365595, "epoch": 0.02857142857142857, "grad_norm": 1.6328125, "learning_rate": 4.444444444444444e-06, "loss": 0.3896, "mean_token_accuracy": 0.9072471372783184, "num_tokens": 114864.0, "step": 5}
{"entropy": 0.8606603350490332, "epoch": 0.03428571428571429, "grad_norm": 0.59765625, "learning_rate": 5.555555555555557e-06, "loss": 0.4749, "mean_token_accuracy": 0.8948077894747257, "num_tokens": 138676.0, "step": 6}
{"entropy": 0.8535148575901985, "epoch": 0.04, "grad_norm": 0.60546875, "learning_rate": 6.666666666666667e-06, "loss": 0.1483, "mean_token_accuracy": 0.9479962512850761, "num_tokens": 164003.0, "step": 7}
{"entropy": 0.9910166934132576, "epoch": 0.045714285714285714, "grad_norm": 0.453125, "learning_rate": 7.77777777777778e-06, "loss": 0.3066, "mean_token_accuracy": 0.9498882181942463, "num_tokens": 185952.0, "step": 8}
{"entropy": 0.9770639836788177, "epoch": 0.05142857142857143, "grad_norm": 0.6796875, "learning_rate": 8.888888888888888e-06, "loss": 0.4671, "mean_token_accuracy": 0.893197625875473, "num_tokens": 204243.0, "step": 9}
{"entropy": 0.9742397665977478, "epoch": 0.05714285714285714, "grad_norm": 0.6953125, "learning_rate": 1e-05, "loss": 0.3377, "mean_token_accuracy": 0.8987404629588127, "num_tokens": 223465.0, "step": 10}
{"entropy": 0.8626804165542126, "epoch": 0.06285714285714286, "grad_norm": 0.70703125, "learning_rate": 9.99910461334869e-06, "loss": 0.5433, "mean_token_accuracy": 0.9067845679819584, "num_tokens": 245021.0, "step": 11}
{"entropy": 0.9500371664762497, "epoch": 0.06857142857142857, "grad_norm": 0.57421875, "learning_rate": 9.996418774081658e-06, "loss": 0.4075, "mean_token_accuracy": 0.9532840885221958, "num_tokens": 268768.0, "step": 12}
{"entropy": 0.8756210878491402, "epoch": 0.07428571428571429, "grad_norm": 0.55859375, "learning_rate": 9.991943444144758e-06, "loss": 0.3333, "mean_token_accuracy": 0.9239994585514069, "num_tokens": 291342.0, "step": 13}
{"entropy": 0.9877203069627285, "epoch": 0.08, "grad_norm": 0.298828125, "learning_rate": 9.985680226398261e-06, "loss": 0.051, "mean_token_accuracy": 0.9740834198892117, "num_tokens": 311741.0, "step": 14}
{"entropy": 0.9451847337186337, "epoch": 0.08571428571428572, "grad_norm": 0.462890625, "learning_rate": 9.977631364042796e-06, "loss": 0.2506, "mean_token_accuracy": 0.9314159639179707, "num_tokens": 336791.0, "step": 15}
{"entropy": 1.0535272359848022, "epoch": 0.09142857142857143, "grad_norm": 0.443359375, "learning_rate": 9.967799739815925e-06, "loss": 0.1661, "mean_token_accuracy": 0.9449756816029549, "num_tokens": 355547.0, "step": 16}
{"entropy": 0.8473225496709347, "epoch": 0.09714285714285714, "grad_norm": 0.37109375, "learning_rate": 9.956188874959686e-06, "loss": 0.1392, "mean_token_accuracy": 0.9268854539841413, "num_tokens": 378069.0, "step": 17}
{"entropy": 0.8464508075267076, "epoch": 0.10285714285714286, "grad_norm": 0.27734375, "learning_rate": 9.942802927959444e-06, "loss": 0.1095, "mean_token_accuracy": 0.9479888863861561, "num_tokens": 402338.0, "step": 18}
{"entropy": 0.9170358963310719, "epoch": 0.10857142857142857, "grad_norm": 0.333984375, "learning_rate": 9.927646693054498e-06, "loss": 0.0719, "mean_token_accuracy": 0.978356346487999, "num_tokens": 425500.0, "step": 19}
{"entropy": 0.8572139944881201, "epoch": 0.11428571428571428, "grad_norm": 0.3203125, "learning_rate": 9.910725598521014e-06, "loss": 0.1026, "mean_token_accuracy": 0.9628097862005234, "num_tokens": 448855.0, "step": 20}
{"entropy": 0.7983267344534397, "epoch": 0.12, "grad_norm": 0.20703125, "learning_rate": 9.892045704727864e-06, "loss": 0.0308, "mean_token_accuracy": 0.9713204726576805, "num_tokens": 479318.0, "step": 21}
{"entropy": 0.8835957311093807, "epoch": 0.12571428571428572, "grad_norm": 0.357421875, "learning_rate": 9.871613701966067e-06, "loss": 0.1352, "mean_token_accuracy": 0.9699565283954144, "num_tokens": 499352.0, "step": 22}
{"entropy": 0.8213062435388565, "epoch": 0.13142857142857142, "grad_norm": 0.462890625, "learning_rate": 9.849436908052636e-06, "loss": 0.1679, "mean_token_accuracy": 0.9590318724513054, "num_tokens": 521144.0, "step": 23}
{"entropy": 0.948228694498539, "epoch": 0.13714285714285715, "grad_norm": 0.515625, "learning_rate": 9.825523265709667e-06, "loss": 0.3717, "mean_token_accuracy": 0.9018147587776184, "num_tokens": 540147.0, "step": 24}
{"entropy": 0.8118924200534821, "epoch": 0.14285714285714285, "grad_norm": 0.451171875, "learning_rate": 9.799881339719615e-06, "loss": 0.381, "mean_token_accuracy": 0.8814735785126686, "num_tokens": 565734.0, "step": 25}
{"entropy": 0.7852364294230938, "epoch": 0.14857142857142858, "grad_norm": 0.625, "learning_rate": 9.772520313857777e-06, "loss": 0.516, "mean_token_accuracy": 0.8841418623924255, "num_tokens": 589632.0, "step": 26}
{"entropy": 0.8675227835774422, "epoch": 0.15428571428571428, "grad_norm": 0.31640625, "learning_rate": 9.743449987603082e-06, "loss": 0.0974, "mean_token_accuracy": 0.9476801715791225, "num_tokens": 609264.0, "step": 27}
{"entropy": 0.8951734602451324, "epoch": 0.16, "grad_norm": 0.49609375, "learning_rate": 9.712680772628365e-06, "loss": 0.1979, "mean_token_accuracy": 0.9428337290883064, "num_tokens": 630959.0, "step": 28}
{"entropy": 0.808982141315937, "epoch": 0.1657142857142857, "grad_norm": 0.35546875, "learning_rate": 9.680223689071364e-06, "loss": 0.2369, "mean_token_accuracy": 0.9508304186165333, "num_tokens": 651742.0, "step": 29}
{"entropy": 0.8595655560493469, "epoch": 0.17142857142857143, "grad_norm": 0.48046875, "learning_rate": 9.646090361587828e-06, "loss": 0.2099, "mean_token_accuracy": 0.9459701962769032, "num_tokens": 673005.0, "step": 30}
{"entropy": 0.9097736775875092, "epoch": 0.17714285714285713, "grad_norm": 0.51171875, "learning_rate": 9.610293015188067e-06, "loss": 0.127, "mean_token_accuracy": 0.9653318747878075, "num_tokens": 695196.0, "step": 31}
{"entropy": 0.8208987936377525, "epoch": 0.18285714285714286, "grad_norm": 0.474609375, "learning_rate": 9.572844470858537e-06, "loss": 0.3805, "mean_token_accuracy": 0.8996468931436539, "num_tokens": 720448.0, "step": 32}
{"entropy": 0.8851851001381874, "epoch": 0.18857142857142858, "grad_norm": 0.388671875, "learning_rate": 9.533758140969913e-06, "loss": 0.1802, "mean_token_accuracy": 0.9502685889601707, "num_tokens": 741368.0, "step": 33}
{"entropy": 0.8407743759453297, "epoch": 0.19428571428571428, "grad_norm": 0.58984375, "learning_rate": 9.493048024473413e-06, "loss": 0.2724, "mean_token_accuracy": 0.9375377260148525, "num_tokens": 762498.0, "step": 34}
{"entropy": 0.7037532348185778, "epoch": 0.2, "grad_norm": 0.283203125, "learning_rate": 9.450728701886985e-06, "loss": 0.09, "mean_token_accuracy": 0.9488834552466869, "num_tokens": 790572.0, "step": 35}
{"epoch": 0.2, "eval_entropy": 0.8689000523835421, "eval_loss": 0.3127354085445404, "eval_mean_token_accuracy": 0.9241019106656313, "eval_num_tokens": 790572.0, "eval_runtime": 90.9265, "eval_samples_per_second": 4.399, "eval_steps_per_second": 4.399, "step": 35}
{"entropy": 0.9641305468976498, "epoch": 0.2057142857142857, "grad_norm": 0.26171875, "learning_rate": 9.406815330073244e-06, "loss": 0.0987, "mean_token_accuracy": 0.9563006423413754, "num_tokens": 811589.0, "step": 36}
{"entropy": 0.8417863231152296, "epoch": 0.21142857142857144, "grad_norm": 0.9296875, "learning_rate": 9.36132363681097e-06, "loss": 0.4473, "mean_token_accuracy": 0.9201415926218033, "num_tokens": 835343.0, "step": 37}
{"entropy": 0.9279076214879751, "epoch": 0.21714285714285714, "grad_norm": 0.234375, "learning_rate": 9.314269915162115e-06, "loss": 0.0366, "mean_token_accuracy": 0.9819578677415848, "num_tokens": 857745.0, "step": 38}
{"entropy": 0.9102700352668762, "epoch": 0.22285714285714286, "grad_norm": 0.8515625, "learning_rate": 9.265671017636384e-06, "loss": 0.4769, "mean_token_accuracy": 0.9464839920401573, "num_tokens": 885412.0, "step": 39}
{"entropy": 0.8781285881996155, "epoch": 0.22857142857142856, "grad_norm": 0.671875, "learning_rate": 9.215544350155423e-06, "loss": 0.4407, "mean_token_accuracy": 0.9192753657698631, "num_tokens": 907272.0, "step": 40}
{"entropy": 0.884316835552454, "epoch": 0.2342857142857143, "grad_norm": 0.57421875, "learning_rate": 9.163907865818806e-06, "loss": 0.3331, "mean_token_accuracy": 0.9058137945830822, "num_tokens": 929992.0, "step": 41}
{"entropy": 0.9548828471451998, "epoch": 0.24, "grad_norm": 0.52734375, "learning_rate": 9.110780058474052e-06, "loss": 0.2486, "mean_token_accuracy": 0.9495599456131458, "num_tokens": 949716.0, "step": 42}
{"entropy": 0.8926267586648464, "epoch": 0.24571428571428572, "grad_norm": 0.8828125, "learning_rate": 9.056179956092961e-06, "loss": 0.5837, "mean_token_accuracy": 0.8974111899733543, "num_tokens": 971635.0, "step": 43}
{"entropy": 0.7238617390394211, "epoch": 0.25142857142857145, "grad_norm": 0.314453125, "learning_rate": 9.000127113956673e-06, "loss": 0.2067, "mean_token_accuracy": 0.9391417279839516, "num_tokens": 996008.0, "step": 44}
{"entropy": 0.7713149264454842, "epoch": 0.2571428571428571, "grad_norm": 0.1904296875, "learning_rate": 8.94264160765183e-06, "loss": 0.1132, "mean_token_accuracy": 0.9410833567380905, "num_tokens": 1021812.0, "step": 45}
{"entropy": 0.906012874096632, "epoch": 0.26285714285714284, "grad_norm": 0.376953125, "learning_rate": 8.883744025880429e-06, "loss": 0.1349, "mean_token_accuracy": 0.9730539433658123, "num_tokens": 1042776.0, "step": 46}
{"entropy": 0.893264701589942, "epoch": 0.26857142857142857, "grad_norm": 0.55078125, "learning_rate": 8.823455463085873e-06, "loss": 0.3195, "mean_token_accuracy": 0.907339371740818, "num_tokens": 1070161.0, "step": 47}
{"entropy": 0.9435957297682762, "epoch": 0.2742857142857143, "grad_norm": 0.376953125, "learning_rate": 8.761797511897907e-06, "loss": 0.0763, "mean_token_accuracy": 0.9643098935484886, "num_tokens": 1092383.0, "step": 48}
{"entropy": 0.9334972836077213, "epoch": 0.28, "grad_norm": 0.40625, "learning_rate": 8.698792255399104e-06, "loss": 0.0661, "mean_token_accuracy": 0.9583298973739147, "num_tokens": 1114220.0, "step": 49}
{"entropy": 0.8552105147391558, "epoch": 0.2857142857142857, "grad_norm": 0.271484375, "learning_rate": 8.634462259215719e-06, "loss": 0.0947, "mean_token_accuracy": 0.974045418202877, "num_tokens": 1136124.0, "step": 50}
{"entropy": 0.8368009328842163, "epoch": 0.2914285714285714, "grad_norm": 0.5, "learning_rate": 8.568830563435695e-06, "loss": 0.2611, "mean_token_accuracy": 0.9241638034582138, "num_tokens": 1160123.0, "step": 51}
{"entropy": 0.7590750344097614, "epoch": 0.29714285714285715, "grad_norm": 0.51953125, "learning_rate": 8.501920674356755e-06, "loss": 0.2207, "mean_token_accuracy": 0.9286937117576599, "num_tokens": 1184958.0, "step": 52}
{"entropy": 0.9840590953826904, "epoch": 0.3028571428571429, "grad_norm": 0.58203125, "learning_rate": 8.433756556067506e-06, "loss": 0.22, "mean_token_accuracy": 0.908040776848793, "num_tokens": 1200609.0, "step": 53}
{"entropy": 0.9369215555489063, "epoch": 0.30857142857142855, "grad_norm": 0.28125, "learning_rate": 8.364362621864595e-06, "loss": 0.0742, "mean_token_accuracy": 0.9590763710439205, "num_tokens": 1220859.0, "step": 54}
{"entropy": 0.791748657822609, "epoch": 0.3142857142857143, "grad_norm": 0.33984375, "learning_rate": 8.29376372550897e-06, "loss": 0.1522, "mean_token_accuracy": 0.9422268383204937, "num_tokens": 1248991.0, "step": 55}
{"entropy": 0.8576459661126137, "epoch": 0.32, "grad_norm": 0.431640625, "learning_rate": 8.221985152324385e-06, "loss": 0.1875, "mean_token_accuracy": 0.9321193210780621, "num_tokens": 1276785.0, "step": 56}
{"entropy": 0.8861603923141956, "epoch": 0.32571428571428573, "grad_norm": 0.4296875, "learning_rate": 8.149052610141357e-06, "loss": 0.1736, "mean_token_accuracy": 0.9611009992659092, "num_tokens": 1295280.0, "step": 57}
{"entropy": 0.8505105189979076, "epoch": 0.3314285714285714, "grad_norm": 0.380859375, "learning_rate": 8.07499222008977e-06, "loss": 0.1473, "mean_token_accuracy": 0.959467314183712, "num_tokens": 1316096.0, "step": 58}
{"entropy": 0.918358813971281, "epoch": 0.33714285714285713, "grad_norm": 0.427734375, "learning_rate": 7.999830507243478e-06, "loss": 0.1743, "mean_token_accuracy": 0.9617721550166607, "num_tokens": 1340263.0, "step": 59}
{"entropy": 0.7842087559401989, "epoch": 0.34285714285714286, "grad_norm": 0.318359375, "learning_rate": 7.923594391120237e-06, "loss": 0.0953, "mean_token_accuracy": 0.968870148062706, "num_tokens": 1364628.0, "step": 60}
{"entropy": 0.8913918249309063, "epoch": 0.3485714285714286, "grad_norm": 0.5, "learning_rate": 7.846311176040331e-06, "loss": 0.3246, "mean_token_accuracy": 0.9421980828046799, "num_tokens": 1386415.0, "step": 61}
{"entropy": 0.861630380153656, "epoch": 0.35428571428571426, "grad_norm": 0.43359375, "learning_rate": 7.768008541347423e-06, "loss": 0.3042, "mean_token_accuracy": 0.9076553024351597, "num_tokens": 1409474.0, "step": 62}
{"entropy": 0.858629435300827, "epoch": 0.36, "grad_norm": 0.43359375, "learning_rate": 7.688714531495061e-06, "loss": 0.2292, "mean_token_accuracy": 0.9376597180962563, "num_tokens": 1435711.0, "step": 63}
{"entropy": 0.9525596722960472, "epoch": 0.3657142857142857, "grad_norm": 0.625, "learning_rate": 7.608457546002423e-06, "loss": 0.0645, "mean_token_accuracy": 0.9651173837482929, "num_tokens": 1457807.0, "step": 64}
{"entropy": 0.9927118942141533, "epoch": 0.37142857142857144, "grad_norm": 0.5859375, "learning_rate": 7.527266329282905e-06, "loss": 0.3301, "mean_token_accuracy": 0.910726185888052, "num_tokens": 1478686.0, "step": 65}
{"entropy": 0.8207175862044096, "epoch": 0.37714285714285717, "grad_norm": 0.318359375, "learning_rate": 7.445169960349167e-06, "loss": 0.1321, "mean_token_accuracy": 0.9752165786921978, "num_tokens": 1504665.0, "step": 66}
{"entropy": 0.7939795292913914, "epoch": 0.38285714285714284, "grad_norm": 0.267578125, "learning_rate": 7.362197842398355e-06, "loss": 0.0607, "mean_token_accuracy": 0.9890137501060963, "num_tokens": 1531122.0, "step": 67}
{"entropy": 0.8998405113816261, "epoch": 0.38857142857142857, "grad_norm": 0.50390625, "learning_rate": 7.278379692281209e-06, "loss": 0.2199, "mean_token_accuracy": 0.9454703703522682, "num_tokens": 1555455.0, "step": 68}
{"entropy": 0.900477584451437, "epoch": 0.3942857142857143, "grad_norm": 0.412109375, "learning_rate": 7.193745529858827e-06, "loss": 0.1587, "mean_token_accuracy": 0.9558433368802071, "num_tokens": 1581569.0, "step": 69}
{"entropy": 0.8638413399457932, "epoch": 0.4, "grad_norm": 0.400390625, "learning_rate": 7.10832566725092e-06, "loss": 0.1142, "mean_token_accuracy": 0.9596346840262413, "num_tokens": 1606126.0, "step": 70}
{"epoch": 0.4, "eval_entropy": 0.8763485141098499, "eval_loss": 0.2973862886428833, "eval_mean_token_accuracy": 0.9280769071727991, "eval_num_tokens": 1606126.0, "eval_runtime": 91.5273, "eval_samples_per_second": 4.37, "eval_steps_per_second": 4.37, "step": 70}
{"entropy": 0.9078505225479603, "epoch": 0.4057142857142857, "grad_norm": 0.41796875, "learning_rate": 7.022150697979385e-06, "loss": 0.1814, "mean_token_accuracy": 0.9287765622138977, "num_tokens": 1624592.0, "step": 71}
{"entropy": 0.882373970001936, "epoch": 0.4114285714285714, "grad_norm": 0.2275390625, "learning_rate": 6.9352514860110876e-06, "loss": 0.1, "mean_token_accuracy": 0.9773332364857197, "num_tokens": 1644996.0, "step": 72}
{"entropy": 0.8143801726400852, "epoch": 0.41714285714285715, "grad_norm": 0.318359375, "learning_rate": 6.847659154703785e-06, "loss": 0.1004, "mean_token_accuracy": 0.9484822899103165, "num_tokens": 1672992.0, "step": 73}
{"entropy": 0.8206119015812874, "epoch": 0.4228571428571429, "grad_norm": 0.46875, "learning_rate": 6.759405075659165e-06, "loss": 0.1754, "mean_token_accuracy": 0.9521096795797348, "num_tokens": 1698329.0, "step": 74}
{"entropy": 0.8256349451839924, "epoch": 0.42857142857142855, "grad_norm": 0.1708984375, "learning_rate": 6.6705208574869504e-06, "loss": 0.0452, "mean_token_accuracy": 0.9771151430904865, "num_tokens": 1723576.0, "step": 75}
{"entropy": 0.7869148999452591, "epoch": 0.4342857142857143, "grad_norm": 0.3203125, "learning_rate": 6.58103833448412e-06, "loss": 0.1119, "mean_token_accuracy": 0.9510597065091133, "num_tokens": 1750632.0, "step": 76}
{"entropy": 0.9072761423885822, "epoch": 0.44, "grad_norm": 0.56640625, "learning_rate": 6.490989555233328e-06, "loss": 0.2573, "mean_token_accuracy": 0.9290625192224979, "num_tokens": 1771479.0, "step": 77}
{"entropy": 0.8767102062702179, "epoch": 0.44571428571428573, "grad_norm": 0.55078125, "learning_rate": 6.4004067711245366e-06, "loss": 0.4063, "mean_token_accuracy": 0.9356401972472668, "num_tokens": 1794342.0, "step": 78}
{"entropy": 0.8600077293813229, "epoch": 0.4514285714285714, "grad_norm": 0.515625, "learning_rate": 6.309322424804034e-06, "loss": 0.4222, "mean_token_accuracy": 0.8884662203490734, "num_tokens": 1815232.0, "step": 79}
{"entropy": 0.8075901996344328, "epoch": 0.45714285714285713, "grad_norm": 0.2158203125, "learning_rate": 6.2177691385549595e-06, "loss": 0.0395, "mean_token_accuracy": 0.9654630422592163, "num_tokens": 1843699.0, "step": 80}
{"entropy": 0.9111120142042637, "epoch": 0.46285714285714286, "grad_norm": 0.53125, "learning_rate": 6.125779702613471e-06, "loss": 0.2, "mean_token_accuracy": 0.9453306347131729, "num_tokens": 1863178.0, "step": 81}
{"entropy": 0.8782064206898212, "epoch": 0.4685714285714286, "grad_norm": 0.6953125, "learning_rate": 6.033387063424765e-06, "loss": 0.5846, "mean_token_accuracy": 0.8993191905319691, "num_tokens": 1886505.0, "step": 82}
{"entropy": 0.7901722844690084, "epoch": 0.4742857142857143, "grad_norm": 0.125, "learning_rate": 5.94062431184317e-06, "loss": 0.0243, "mean_token_accuracy": 0.9816068820655346, "num_tokens": 1911651.0, "step": 83}
{"entropy": 0.7807160075753927, "epoch": 0.48, "grad_norm": 0.1943359375, "learning_rate": 5.8475246712804845e-06, "loss": 0.0649, "mean_token_accuracy": 0.9530936926603317, "num_tokens": 1939727.0, "step": 84}
{"entropy": 0.805871419608593, "epoch": 0.4857142857142857, "grad_norm": 0.47265625, "learning_rate": 5.7541214858068705e-06, "loss": 0.3212, "mean_token_accuracy": 0.9191376678645611, "num_tokens": 1961164.0, "step": 85}
{"entropy": 0.8677656650543213, "epoch": 0.49142857142857144, "grad_norm": 0.423828125, "learning_rate": 5.660448208208513e-06, "loss": 0.2838, "mean_token_accuracy": 0.8779561948031187, "num_tokens": 1983306.0, "step": 86}
{"entropy": 0.8968867547810078, "epoch": 0.49714285714285716, "grad_norm": 0.287109375, "learning_rate": 5.566538388006351e-06, "loss": 0.1242, "mean_token_accuracy": 0.9707877077162266, "num_tokens": 2005414.0, "step": 87}
{"entropy": 0.9857515692710876, "epoch": 0.5028571428571429, "grad_norm": 0.359375, "learning_rate": 5.472425659440157e-06, "loss": 0.201, "mean_token_accuracy": 0.9621238149702549, "num_tokens": 2026778.0, "step": 88}
{"entropy": 0.7767338864505291, "epoch": 0.5085714285714286, "grad_norm": 0.52734375, "learning_rate": 5.378143729422285e-06, "loss": 0.2234, "mean_token_accuracy": 0.937239296734333, "num_tokens": 2049698.0, "step": 89}
{"entropy": 0.8967469111084938, "epoch": 0.5142857142857142, "grad_norm": 0.404296875, "learning_rate": 5.2837263654653715e-06, "loss": 0.1559, "mean_token_accuracy": 0.9657112322747707, "num_tokens": 2073815.0, "step": 90}
{"entropy": 0.9205988571047783, "epoch": 0.52, "grad_norm": 0.373046875, "learning_rate": 5.189207383588353e-06, "loss": 0.1183, "mean_token_accuracy": 0.9595021493732929, "num_tokens": 2094140.0, "step": 91}
{"entropy": 0.8038613423705101, "epoch": 0.5257142857142857, "grad_norm": 0.22265625, "learning_rate": 5.094620636205096e-06, "loss": 0.0705, "mean_token_accuracy": 0.9323722533881664, "num_tokens": 2119725.0, "step": 92}
{"entropy": 0.8465629853308201, "epoch": 0.5314285714285715, "grad_norm": 0.33203125, "learning_rate": 5e-06, "loss": 0.0788, "mean_token_accuracy": 0.9482800886034966, "num_tokens": 2140739.0, "step": 93}
{"entropy": 0.8711249753832817, "epoch": 0.5371428571428571, "grad_norm": 0.255859375, "learning_rate": 4.905379363794907e-06, "loss": 0.0661, "mean_token_accuracy": 0.9701907262206078, "num_tokens": 2165915.0, "step": 94}
{"entropy": 0.8372658789157867, "epoch": 0.5428571428571428, "grad_norm": 0.49609375, "learning_rate": 4.81079261641165e-06, "loss": 0.2275, "mean_token_accuracy": 0.9530695639550686, "num_tokens": 2190737.0, "step": 95}
{"entropy": 0.852743711322546, "epoch": 0.5485714285714286, "grad_norm": 0.291015625, "learning_rate": 4.71627363453463e-06, "loss": 0.0795, "mean_token_accuracy": 0.954478558152914, "num_tokens": 2215151.0, "step": 96}
{"entropy": 0.8570697363466024, "epoch": 0.5542857142857143, "grad_norm": 0.6484375, "learning_rate": 4.6218562705777185e-06, "loss": 0.2531, "mean_token_accuracy": 0.9405127912759781, "num_tokens": 2235956.0, "step": 97}
{"entropy": 0.9492372311651707, "epoch": 0.56, "grad_norm": 0.703125, "learning_rate": 4.527574340559844e-06, "loss": 0.4012, "mean_token_accuracy": 0.9081198573112488, "num_tokens": 2255596.0, "step": 98}
{"entropy": 0.8674456924200058, "epoch": 0.5657142857142857, "grad_norm": 0.28515625, "learning_rate": 4.4334616119936516e-06, "loss": 0.1056, "mean_token_accuracy": 0.9499292522668839, "num_tokens": 2278085.0, "step": 99}
{"entropy": 0.830165795981884, "epoch": 0.5714285714285714, "grad_norm": 0.390625, "learning_rate": 4.33955179179149e-06, "loss": 0.2439, "mean_token_accuracy": 0.9636958874762058, "num_tokens": 2306986.0, "step": 100}
{"entropy": 0.8232245780527592, "epoch": 0.5771428571428572, "grad_norm": 0.404296875, "learning_rate": 4.245878514193131e-06, "loss": 0.2359, "mean_token_accuracy": 0.9303237311542034, "num_tokens": 2329681.0, "step": 101}
{"entropy": 0.8297377564013004, "epoch": 0.5828571428571429, "grad_norm": 0.5703125, "learning_rate": 4.152475328719517e-06, "loss": 0.3075, "mean_token_accuracy": 0.9233161471784115, "num_tokens": 2354228.0, "step": 102}
{"entropy": 0.7650180887430906, "epoch": 0.5885714285714285, "grad_norm": 0.33203125, "learning_rate": 4.059375688156833e-06, "loss": 0.1562, "mean_token_accuracy": 0.9361786916851997, "num_tokens": 2385307.0, "step": 103}
{"entropy": 0.9238808788359165, "epoch": 0.5942857142857143, "grad_norm": 0.337890625, "learning_rate": 3.966612936575235e-06, "loss": 0.1913, "mean_token_accuracy": 0.943382054567337, "num_tokens": 2406416.0, "step": 104}
{"entropy": 0.8188824839890003, "epoch": 0.6, "grad_norm": 0.625, "learning_rate": 3.87422029738653e-06, "loss": 0.3352, "mean_token_accuracy": 0.9394205138087273, "num_tokens": 2430896.0, "step": 105}
{"epoch": 0.6, "eval_entropy": 0.8769993405789137, "eval_loss": 0.29554080963134766, "eval_mean_token_accuracy": 0.9284648544341326, "eval_num_tokens": 2430896.0, "eval_runtime": 92.2684, "eval_samples_per_second": 4.335, "eval_steps_per_second": 4.335, "step": 105}
{"entropy": 0.7958486191928387, "epoch": 0.6057142857142858, "grad_norm": 0.55078125, "learning_rate": 3.782230861445041e-06, "loss": 0.1744, "mean_token_accuracy": 0.9372597932815552, "num_tokens": 2455348.0, "step": 106}
{"entropy": 0.8819582648575306, "epoch": 0.6114285714285714, "grad_norm": 0.396484375, "learning_rate": 3.6906775751959667e-06, "loss": 0.2265, "mean_token_accuracy": 0.94641899690032, "num_tokens": 2477983.0, "step": 107}
{"entropy": 0.8169359490275383, "epoch": 0.6171428571428571, "grad_norm": 0.24609375, "learning_rate": 3.5995932288754655e-06, "loss": 0.0609, "mean_token_accuracy": 0.9687152951955795, "num_tokens": 2507481.0, "step": 108}
{"entropy": 0.8248496986925602, "epoch": 0.6228571428571429, "grad_norm": 0.376953125, "learning_rate": 3.509010444766674e-06, "loss": 0.1682, "mean_token_accuracy": 0.9509099498391151, "num_tokens": 2535270.0, "step": 109}
{"entropy": 0.8315382190048695, "epoch": 0.6285714285714286, "grad_norm": 0.220703125, "learning_rate": 3.4189616655158803e-06, "loss": 0.0472, "mean_token_accuracy": 0.9836984872817993, "num_tokens": 2557838.0, "step": 110}
{"entropy": 0.8726284876465797, "epoch": 0.6342857142857142, "grad_norm": 0.70703125, "learning_rate": 3.3294791425130512e-06, "loss": 0.4566, "mean_token_accuracy": 0.928321436047554, "num_tokens": 2578074.0, "step": 111}
{"entropy": 0.8420686684548855, "epoch": 0.64, "grad_norm": 0.36328125, "learning_rate": 3.240594924340835e-06, "loss": 0.2126, "mean_token_accuracy": 0.9412459097802639, "num_tokens": 2602045.0, "step": 112}
{"entropy": 0.8329183645546436, "epoch": 0.6457142857142857, "grad_norm": 0.466796875, "learning_rate": 3.1523408452962156e-06, "loss": 0.2633, "mean_token_accuracy": 0.8766915369778872, "num_tokens": 2627102.0, "step": 113}
{"entropy": 0.9313436187803745, "epoch": 0.6514285714285715, "grad_norm": 0.90625, "learning_rate": 3.0647485139889145e-06, "loss": 0.6254, "mean_token_accuracy": 0.9516336657106876, "num_tokens": 2645394.0, "step": 114}
{"entropy": 0.7338366992771626, "epoch": 0.6571428571428571, "grad_norm": 0.08203125, "learning_rate": 2.9778493020206155e-06, "loss": 0.0284, "mean_token_accuracy": 0.9934831894934177, "num_tokens": 2676753.0, "step": 115}
{"entropy": 0.8697643727064133, "epoch": 0.6628571428571428, "grad_norm": 0.1796875, "learning_rate": 2.89167433274908e-06, "loss": 0.0259, "mean_token_accuracy": 0.9898367673158646, "num_tokens": 2699287.0, "step": 116}
{"entropy": 0.9010032936930656, "epoch": 0.6685714285714286, "grad_norm": 0.380859375, "learning_rate": 2.806254470141174e-06, "loss": 0.0833, "mean_token_accuracy": 0.9675994291901588, "num_tokens": 2717961.0, "step": 117}
{"entropy": 0.8322379067540169, "epoch": 0.6742857142857143, "grad_norm": 0.67578125, "learning_rate": 2.721620307718793e-06, "loss": 0.291, "mean_token_accuracy": 0.9172481000423431, "num_tokens": 2737566.0, "step": 118}
{"entropy": 0.8995933551341295, "epoch": 0.68, "grad_norm": 0.294921875, "learning_rate": 2.6378021576016467e-06, "loss": 0.0553, "mean_token_accuracy": 0.9801531247794628, "num_tokens": 2757255.0, "step": 119}
{"entropy": 0.9271344300359488, "epoch": 0.6857142857142857, "grad_norm": 0.408203125, "learning_rate": 2.554830039650834e-06, "loss": 0.1783, "mean_token_accuracy": 0.9709099903702736, "num_tokens": 2780854.0, "step": 120}
{"entropy": 0.8354959785938263, "epoch": 0.6914285714285714, "grad_norm": 0.2294921875, "learning_rate": 2.4727336707170973e-06, "loss": 0.0792, "mean_token_accuracy": 0.9483233764767647, "num_tokens": 2798499.0, "step": 121}
{"entropy": 0.8634845986962318, "epoch": 0.6971428571428572, "grad_norm": 0.58203125, "learning_rate": 2.391542453997578e-06, "loss": 0.3701, "mean_token_accuracy": 0.92283009365201, "num_tokens": 2819541.0, "step": 122}
{"entropy": 0.86484663374722, "epoch": 0.7028571428571428, "grad_norm": 0.236328125, "learning_rate": 2.3112854685049397e-06, "loss": 0.0666, "mean_token_accuracy": 0.9604465216398239, "num_tokens": 2841267.0, "step": 123}
{"entropy": 0.7959853485226631, "epoch": 0.7085714285714285, "grad_norm": 0.40625, "learning_rate": 2.2319914586525776e-06, "loss": 0.2689, "mean_token_accuracy": 0.902481097728014, "num_tokens": 2864290.0, "step": 124}
{"entropy": 0.8018485866487026, "epoch": 0.7142857142857143, "grad_norm": 0.396484375, "learning_rate": 2.1536888239596714e-06, "loss": 0.1782, "mean_token_accuracy": 0.9672268815338612, "num_tokens": 2893566.0, "step": 125}
{"entropy": 0.9180811122059822, "epoch": 0.72, "grad_norm": 0.333984375, "learning_rate": 2.0764056088797646e-06, "loss": 0.2034, "mean_token_accuracy": 0.9149210341274738, "num_tokens": 2915934.0, "step": 126}
{"entropy": 0.791705853305757, "epoch": 0.7257142857142858, "grad_norm": 0.38671875, "learning_rate": 2.000169492756523e-06, "loss": 0.2103, "mean_token_accuracy": 0.9592764638364315, "num_tokens": 2938796.0, "step": 127}
{"entropy": 0.8573960512876511, "epoch": 0.7314285714285714, "grad_norm": 0.4765625, "learning_rate": 1.9250077799102323e-06, "loss": 0.2499, "mean_token_accuracy": 0.9304524399340153, "num_tokens": 2959725.0, "step": 128}
{"entropy": 0.7847526092082262, "epoch": 0.7371428571428571, "grad_norm": 0.4296875, "learning_rate": 1.8509473898586432e-06, "loss": 0.272, "mean_token_accuracy": 0.9468899220228195, "num_tokens": 2986539.0, "step": 129}
{"entropy": 0.7972419206053019, "epoch": 0.7428571428571429, "grad_norm": 0.57421875, "learning_rate": 1.7780148476756148e-06, "loss": 0.2415, "mean_token_accuracy": 0.9312585778534412, "num_tokens": 3008033.0, "step": 130}
{"entropy": 0.9854478649795055, "epoch": 0.7485714285714286, "grad_norm": 0.2109375, "learning_rate": 1.7062362744910321e-06, "loss": 0.0378, "mean_token_accuracy": 0.9740675985813141, "num_tokens": 3022847.0, "step": 131}
{"entropy": 0.8525507673621178, "epoch": 0.7542857142857143, "grad_norm": 0.1787109375, "learning_rate": 1.6356373781354058e-06, "loss": 0.0312, "mean_token_accuracy": 0.9881799481809139, "num_tokens": 3044199.0, "step": 132}
{"entropy": 0.8705133143812418, "epoch": 0.76, "grad_norm": 0.52734375, "learning_rate": 1.566243443932496e-06, "loss": 0.3131, "mean_token_accuracy": 0.9179901443421841, "num_tokens": 3066790.0, "step": 133}
{"entropy": 0.9212304092943668, "epoch": 0.7657142857142857, "grad_norm": 0.69140625, "learning_rate": 1.4980793256432474e-06, "loss": 0.462, "mean_token_accuracy": 0.9063639305531979, "num_tokens": 3087500.0, "step": 134}
{"entropy": 0.8802409656345844, "epoch": 0.7714285714285715, "grad_norm": 0.419921875, "learning_rate": 1.4311694365643048e-06, "loss": 0.146, "mean_token_accuracy": 0.9382250271737576, "num_tokens": 3107519.0, "step": 135}
{"entropy": 0.9647825062274933, "epoch": 0.7771428571428571, "grad_norm": 0.97265625, "learning_rate": 1.3655377407842813e-06, "loss": 0.404, "mean_token_accuracy": 0.9323740191757679, "num_tokens": 3126461.0, "step": 136}
{"entropy": 0.8492281846702099, "epoch": 0.7828571428571428, "grad_norm": 0.484375, "learning_rate": 1.3012077446008969e-06, "loss": 0.2494, "mean_token_accuracy": 0.919997077435255, "num_tokens": 3153010.0, "step": 137}
{"entropy": 0.8203707411885262, "epoch": 0.7885714285714286, "grad_norm": 0.1865234375, "learning_rate": 1.2382024881020937e-06, "loss": 0.0568, "mean_token_accuracy": 0.9940986521542072, "num_tokens": 3181545.0, "step": 138}
{"entropy": 0.8615991920232773, "epoch": 0.7942857142857143, "grad_norm": 0.291015625, "learning_rate": 1.1765445369141276e-06, "loss": 0.1005, "mean_token_accuracy": 0.9564622417092323, "num_tokens": 3207389.0, "step": 139}
{"entropy": 0.9613388143479824, "epoch": 0.8, "grad_norm": 0.2734375, "learning_rate": 1.1162559741195733e-06, "loss": 0.032, "mean_token_accuracy": 0.9898938909173012, "num_tokens": 3227144.0, "step": 140}
{"epoch": 0.8, "eval_entropy": 0.8764541779458522, "eval_loss": 0.2953108847141266, "eval_mean_token_accuracy": 0.9284577775746584, "eval_num_tokens": 3227144.0, "eval_runtime": 91.8643, "eval_samples_per_second": 4.354, "eval_steps_per_second": 4.354, "step": 140}
{"entropy": 0.9436263218522072, "epoch": 0.8057142857142857, "grad_norm": 0.453125, "learning_rate": 1.057358392348171e-06, "loss": 0.2514, "mean_token_accuracy": 0.9310437515377998, "num_tokens": 3247750.0, "step": 141}
{"entropy": 0.8511663135141134, "epoch": 0.8114285714285714, "grad_norm": 0.330078125, "learning_rate": 9.998728860433277e-07, "loss": 0.1464, "mean_token_accuracy": 0.9337452948093414, "num_tokens": 3278158.0, "step": 142}
{"entropy": 0.8985432125627995, "epoch": 0.8171428571428572, "grad_norm": 0.55078125, "learning_rate": 9.438200439070388e-07, "loss": 0.3484, "mean_token_accuracy": 0.9249872528016567, "num_tokens": 3297566.0, "step": 143}
{"entropy": 0.8434502705931664, "epoch": 0.8228571428571428, "grad_norm": 0.1611328125, "learning_rate": 8.892199415259501e-07, "loss": 0.0588, "mean_token_accuracy": 0.9789597801864147, "num_tokens": 3321048.0, "step": 144}
{"entropy": 0.7833346650004387, "epoch": 0.8285714285714286, "grad_norm": 0.58203125, "learning_rate": 8.360921341811956e-07, "loss": 0.2072, "mean_token_accuracy": 0.9664384685456753, "num_tokens": 3348746.0, "step": 145}
{"entropy": 0.8700702637434006, "epoch": 0.8342857142857143, "grad_norm": 0.33203125, "learning_rate": 7.844556498445788e-07, "loss": 0.0734, "mean_token_accuracy": 0.9684953950345516, "num_tokens": 3375740.0, "step": 146}
{"entropy": 0.7348683997988701, "epoch": 0.84, "grad_norm": 0.59765625, "learning_rate": 7.343289823636168e-07, "loss": 0.2837, "mean_token_accuracy": 0.957360677421093, "num_tokens": 3400641.0, "step": 147}
{"entropy": 0.9618206657469273, "epoch": 0.8457142857142858, "grad_norm": 0.322265625, "learning_rate": 6.857300848378857e-07, "loss": 0.1192, "mean_token_accuracy": 0.9487035945057869, "num_tokens": 3419359.0, "step": 148}
{"entropy": 0.7841342575848103, "epoch": 0.8514285714285714, "grad_norm": 0.5859375, "learning_rate": 6.386763631890313e-07, "loss": 0.2124, "mean_token_accuracy": 0.9248572364449501, "num_tokens": 3443856.0, "step": 149}
{"entropy": 0.826301820576191, "epoch": 0.8571428571428571, "grad_norm": 0.22265625, "learning_rate": 5.931846699267558e-07, "loss": 0.0611, "mean_token_accuracy": 0.9684226177632809, "num_tokens": 3465048.0, "step": 150}
{"entropy": 0.8140004500746727, "epoch": 0.8628571428571429, "grad_norm": 0.490234375, "learning_rate": 5.492712981130171e-07, "loss": 0.2893, "mean_token_accuracy": 0.9164738897234201, "num_tokens": 3488250.0, "step": 151}
{"entropy": 0.9298283979296684, "epoch": 0.8685714285714285, "grad_norm": 0.431640625, "learning_rate": 5.0695197552659e-07, "loss": 0.203, "mean_token_accuracy": 0.9512322805821896, "num_tokens": 3507381.0, "step": 152}
{"entropy": 0.9326702170073986, "epoch": 0.8742857142857143, "grad_norm": 0.3984375, "learning_rate": 4.6624185903008713e-07, "loss": 0.1791, "mean_token_accuracy": 0.9534324109554291, "num_tokens": 3526862.0, "step": 153}
{"entropy": 0.884672824293375, "epoch": 0.88, "grad_norm": 0.265625, "learning_rate": 4.271555291414636e-07, "loss": 0.0939, "mean_token_accuracy": 0.9811095856130123, "num_tokens": 3548347.0, "step": 154}
{"entropy": 0.9188402555882931, "epoch": 0.8857142857142857, "grad_norm": 0.435546875, "learning_rate": 3.8970698481193225e-07, "loss": 0.1395, "mean_token_accuracy": 0.9461647681891918, "num_tokens": 3576901.0, "step": 155}
{"entropy": 0.8714124243706465, "epoch": 0.8914285714285715, "grad_norm": 0.361328125, "learning_rate": 3.539096384121743e-07, "loss": 0.1468, "mean_token_accuracy": 0.9493271261453629, "num_tokens": 3599612.0, "step": 156}
{"entropy": 0.9496984779834747, "epoch": 0.8971428571428571, "grad_norm": 0.5390625, "learning_rate": 3.1977631092863613e-07, "loss": 0.2511, "mean_token_accuracy": 0.9505422003567219, "num_tokens": 3617034.0, "step": 157}
{"entropy": 0.8597098160535097, "epoch": 0.9028571428571428, "grad_norm": 0.5546875, "learning_rate": 2.873192273716369e-07, "loss": 0.2373, "mean_token_accuracy": 0.9237680397927761, "num_tokens": 3638314.0, "step": 158}
{"entropy": 0.9527708999812603, "epoch": 0.9085714285714286, "grad_norm": 0.50390625, "learning_rate": 2.5655001239691836e-07, "loss": 0.4676, "mean_token_accuracy": 0.8877900540828705, "num_tokens": 3657174.0, "step": 159}
{"entropy": 0.8717995695769787, "epoch": 0.9142857142857143, "grad_norm": 0.30078125, "learning_rate": 2.274796861422246e-07, "loss": 0.1154, "mean_token_accuracy": 0.9691611863672733, "num_tokens": 3680533.0, "step": 160}
{"entropy": 0.9644824899733067, "epoch": 0.92, "grad_norm": 0.490234375, "learning_rate": 2.0011866028038617e-07, "loss": 0.3064, "mean_token_accuracy": 0.9448754377663136, "num_tokens": 3699327.0, "step": 161}
{"entropy": 0.9328950606286526, "epoch": 0.9257142857142857, "grad_norm": 0.451171875, "learning_rate": 1.7447673429033361e-07, "loss": 0.2076, "mean_token_accuracy": 0.9191295467317104, "num_tokens": 3715091.0, "step": 162}
{"entropy": 0.8879067096859217, "epoch": 0.9314285714285714, "grad_norm": 0.337890625, "learning_rate": 1.5056309194736385e-07, "loss": 0.1653, "mean_token_accuracy": 0.9486363902688026, "num_tokens": 3743127.0, "step": 163}
{"entropy": 0.894222728908062, "epoch": 0.9371428571428572, "grad_norm": 0.359375, "learning_rate": 1.2838629803393343e-07, "loss": 0.1275, "mean_token_accuracy": 0.946167778223753, "num_tokens": 3762752.0, "step": 164}
{"entropy": 0.9304006136953831, "epoch": 0.9428571428571428, "grad_norm": 0.5859375, "learning_rate": 1.0795429527213685e-07, "loss": 0.3773, "mean_token_accuracy": 0.9494738765060902, "num_tokens": 3782981.0, "step": 165}
{"entropy": 0.8676423355937004, "epoch": 0.9485714285714286, "grad_norm": 0.32421875, "learning_rate": 8.927440147898703e-08, "loss": 0.1509, "mean_token_accuracy": 0.9403471313416958, "num_tokens": 3806706.0, "step": 166}
{"entropy": 0.9638898521661758, "epoch": 0.9542857142857143, "grad_norm": 0.470703125, "learning_rate": 7.235330694550402e-08, "loss": 0.1, "mean_token_accuracy": 0.9673289954662323, "num_tokens": 3825999.0, "step": 167}
{"entropy": 0.8009177055209875, "epoch": 0.96, "grad_norm": 0.2109375, "learning_rate": 5.7197072040557356e-08, "loss": 0.0312, "mean_token_accuracy": 0.9841561615467072, "num_tokens": 3848460.0, "step": 168}
{"entropy": 0.8380727805197239, "epoch": 0.9657142857142857, "grad_norm": 0.466796875, "learning_rate": 4.381112504031337e-08, "loss": 0.2418, "mean_token_accuracy": 0.933722235262394, "num_tokens": 3872166.0, "step": 169}
{"entropy": 0.941684365272522, "epoch": 0.9714285714285714, "grad_norm": 0.45703125, "learning_rate": 3.220026018407541e-08, "loss": 0.1822, "mean_token_accuracy": 0.9650504402816296, "num_tokens": 3890730.0, "step": 170}
{"entropy": 0.9139348827302456, "epoch": 0.9771428571428571, "grad_norm": 0.7890625, "learning_rate": 2.236863595720562e-08, "loss": 0.3801, "mean_token_accuracy": 0.9626536183059216, "num_tokens": 3913632.0, "step": 171}
{"entropy": 0.8308483064174652, "epoch": 0.9828571428571429, "grad_norm": 0.3203125, "learning_rate": 1.431977360173975e-08, "loss": 0.1153, "mean_token_accuracy": 0.9826219528913498, "num_tokens": 3941084.0, "step": 172}
{"entropy": 0.8064244762063026, "epoch": 0.9885714285714285, "grad_norm": 0.41796875, "learning_rate": 8.056555855243675e-09, "loss": 0.1146, "mean_token_accuracy": 0.9666525050997734, "num_tokens": 3966629.0, "step": 173}
{"entropy": 0.8301513195037842, "epoch": 0.9942857142857143, "grad_norm": 0.65234375, "learning_rate": 3.5812259183426457e-09, "loss": 0.499, "mean_token_accuracy": 0.8793967552483082, "num_tokens": 3990275.0, "step": 174}
{"entropy": 0.9384108036756516, "epoch": 1.0, "grad_norm": 0.322265625, "learning_rate": 8.953866513111698e-10, "loss": 0.193, "mean_token_accuracy": 0.9713231772184372, "num_tokens": 4009115.0, "step": 175}
{"epoch": 1.0, "eval_entropy": 0.8765361993014813, "eval_loss": 0.2955912947654724, "eval_mean_token_accuracy": 0.9287241496890783, "eval_num_tokens": 4009115.0, "eval_runtime": 91.0144, "eval_samples_per_second": 4.395, "eval_steps_per_second": 4.395, "step": 175}
{"epoch": 1.0, "step": 175, "total_flos": 1.8415547714724864e+17, "train_loss": 0.2099171816344772, "train_runtime": 2968.5511, "train_samples_per_second": 0.943, "train_steps_per_second": 0.059}