devanshty commited on
Commit
428807e
·
verified ·
1 Parent(s): c71fb60

Upload training_log.json with huggingface_hub

Browse files
Files changed (1) hide show
  1. training_log.json +667 -0
training_log.json ADDED
@@ -0,0 +1,667 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": 246,
3
+ "best_metric": 0.244215190410614,
4
+ "best_model_checkpoint": "C:\\Users\\Devansh Tyagi\\Desktop\\Projects\\Code-Autopsy\\checkpoints\\checkpoint-246",
5
+ "epoch": 3.0,
6
+ "eval_steps": 20,
7
+ "global_step": 246,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "entropy": 1.2720158830285073,
14
+ "epoch": 0.06144393241167435,
15
+ "grad_norm": 0.2734375,
16
+ "learning_rate": 6.153846153846155e-05,
17
+ "loss": 2.1623348236083983,
18
+ "mean_token_accuracy": 0.6029356420040131,
19
+ "num_tokens": 7832.0,
20
+ "step": 5
21
+ },
22
+ {
23
+ "entropy": 1.2995335638523102,
24
+ "epoch": 0.1228878648233487,
25
+ "grad_norm": 0.435546875,
26
+ "learning_rate": 0.00013846153846153847,
27
+ "loss": 2.1435720443725588,
28
+ "mean_token_accuracy": 0.6072336934506893,
29
+ "num_tokens": 15169.0,
30
+ "step": 10
31
+ },
32
+ {
33
+ "entropy": 1.3567075744271277,
34
+ "epoch": 0.18433179723502305,
35
+ "grad_norm": 0.5703125,
36
+ "learning_rate": 0.00019999091026277928,
37
+ "loss": 1.8734064102172852,
38
+ "mean_token_accuracy": 0.6238010875880718,
39
+ "num_tokens": 22884.0,
40
+ "step": 15
41
+ },
42
+ {
43
+ "entropy": 1.5021331459283829,
44
+ "epoch": 0.2457757296466974,
45
+ "grad_norm": 0.59765625,
46
+ "learning_rate": 0.0001996729429353878,
47
+ "loss": 1.6023683547973633,
48
+ "mean_token_accuracy": 0.6496468104422093,
49
+ "num_tokens": 30047.0,
50
+ "step": 20
51
+ },
52
+ {
53
+ "epoch": 0.2457757296466974,
54
+ "eval_entropy": 1.4432531578900063,
55
+ "eval_loss": 1.3970026969909668,
56
+ "eval_mean_token_accuracy": 0.6886225922466958,
57
+ "eval_num_tokens": 30047.0,
58
+ "eval_runtime": 98.8045,
59
+ "eval_samples_per_second": 0.739,
60
+ "eval_steps_per_second": 0.739,
61
+ "step": 20
62
+ },
63
+ {
64
+ "entropy": 1.3366006165742874,
65
+ "epoch": 0.30721966205837176,
66
+ "grad_norm": 0.6171875,
67
+ "learning_rate": 0.00019890213986358148,
68
+ "loss": 1.2767066955566406,
69
+ "mean_token_accuracy": 0.7060731440782547,
70
+ "num_tokens": 37561.0,
71
+ "step": 25
72
+ },
73
+ {
74
+ "entropy": 0.8943048655986786,
75
+ "epoch": 0.3686635944700461,
76
+ "grad_norm": 0.69921875,
77
+ "learning_rate": 0.00019768200297248193,
78
+ "loss": 0.9884555816650391,
79
+ "mean_token_accuracy": 0.772250434756279,
80
+ "num_tokens": 45476.0,
81
+ "step": 30
82
+ },
83
+ {
84
+ "entropy": 0.6866158157587051,
85
+ "epoch": 0.43010752688172044,
86
+ "grad_norm": 0.734375,
87
+ "learning_rate": 0.00019601807560796713,
88
+ "loss": 0.7711129665374756,
89
+ "mean_token_accuracy": 0.8339575499296188,
90
+ "num_tokens": 53130.0,
91
+ "step": 35
92
+ },
93
+ {
94
+ "entropy": 0.6559636496007443,
95
+ "epoch": 0.4915514592933948,
96
+ "grad_norm": 0.86328125,
97
+ "learning_rate": 0.00019391791735205182,
98
+ "loss": 0.6632838726043702,
99
+ "mean_token_accuracy": 0.8613109961152077,
100
+ "num_tokens": 60631.0,
101
+ "step": 40
102
+ },
103
+ {
104
+ "epoch": 0.4915514592933948,
105
+ "eval_entropy": 0.5521646117510861,
106
+ "eval_loss": 0.630871057510376,
107
+ "eval_mean_token_accuracy": 0.8730851166868863,
108
+ "eval_num_tokens": 60631.0,
109
+ "eval_runtime": 97.1898,
110
+ "eval_samples_per_second": 0.751,
111
+ "eval_steps_per_second": 0.751,
112
+ "step": 40
113
+ },
114
+ {
115
+ "entropy": 0.5553950414061546,
116
+ "epoch": 0.5529953917050692,
117
+ "grad_norm": 0.68359375,
118
+ "learning_rate": 0.00019139106967807062,
119
+ "loss": 0.6109470844268798,
120
+ "mean_token_accuracy": 0.8708647087216377,
121
+ "num_tokens": 68147.0,
122
+ "step": 45
123
+ },
124
+ {
125
+ "entropy": 0.5107979021966458,
126
+ "epoch": 0.6144393241167435,
127
+ "grad_norm": 0.498046875,
128
+ "learning_rate": 0.0001884490126017005,
129
+ "loss": 0.5680758953094482,
130
+ "mean_token_accuracy": 0.8782492533326149,
131
+ "num_tokens": 75622.0,
132
+ "step": 50
133
+ },
134
+ {
135
+ "entropy": 0.5033965408802032,
136
+ "epoch": 0.6758832565284179,
137
+ "grad_norm": 0.50390625,
138
+ "learning_rate": 0.00018510511252476587,
139
+ "loss": 0.5488744735717773,
140
+ "mean_token_accuracy": 0.8770601689815521,
141
+ "num_tokens": 83564.0,
142
+ "step": 55
143
+ },
144
+ {
145
+ "entropy": 0.4694289192557335,
146
+ "epoch": 0.7373271889400922,
147
+ "grad_norm": 0.4375,
148
+ "learning_rate": 0.00018137456150878303,
149
+ "loss": 0.4926635265350342,
150
+ "mean_token_accuracy": 0.8881596863269806,
151
+ "num_tokens": 91409.0,
152
+ "step": 60
153
+ },
154
+ {
155
+ "epoch": 0.7373271889400922,
156
+ "eval_entropy": 0.4363853490515931,
157
+ "eval_loss": 0.46880096197128296,
158
+ "eval_mean_token_accuracy": 0.8960385273580682,
159
+ "eval_num_tokens": 91409.0,
160
+ "eval_runtime": 95.7743,
161
+ "eval_samples_per_second": 0.762,
162
+ "eval_steps_per_second": 0.762,
163
+ "step": 60
164
+ },
165
+ {
166
+ "entropy": 0.43721060529351236,
167
+ "epoch": 0.7987711213517665,
168
+ "grad_norm": 0.60546875,
169
+ "learning_rate": 0.00017727430825413792,
170
+ "loss": 0.4627737522125244,
171
+ "mean_token_accuracy": 0.9004349738359452,
172
+ "num_tokens": 98711.0,
173
+ "step": 65
174
+ },
175
+ {
176
+ "entropy": 0.4222001314163208,
177
+ "epoch": 0.8602150537634409,
178
+ "grad_norm": 0.66015625,
179
+ "learning_rate": 0.00017282298109847345,
180
+ "loss": 0.47431230545043945,
181
+ "mean_token_accuracy": 0.8917310431599617,
182
+ "num_tokens": 105785.0,
183
+ "step": 70
184
+ },
185
+ {
186
+ "entropy": 0.4233152411878109,
187
+ "epoch": 0.9216589861751152,
188
+ "grad_norm": 0.443359375,
189
+ "learning_rate": 0.00016804080338412108,
190
+ "loss": 0.4605244159698486,
191
+ "mean_token_accuracy": 0.902459979057312,
192
+ "num_tokens": 112840.0,
193
+ "step": 75
194
+ },
195
+ {
196
+ "entropy": 0.4323478534817696,
197
+ "epoch": 0.9831029185867896,
198
+ "grad_norm": 0.4453125,
199
+ "learning_rate": 0.00016294950157908132,
200
+ "loss": 0.44331941604614256,
201
+ "mean_token_accuracy": 0.897197200357914,
202
+ "num_tokens": 120233.0,
203
+ "step": 80
204
+ },
205
+ {
206
+ "epoch": 0.9831029185867896,
207
+ "eval_entropy": 0.4033231739312002,
208
+ "eval_loss": 0.39226189255714417,
209
+ "eval_mean_token_accuracy": 0.9040106412482588,
210
+ "eval_num_tokens": 120233.0,
211
+ "eval_runtime": 99.948,
212
+ "eval_samples_per_second": 0.73,
213
+ "eval_steps_per_second": 0.73,
214
+ "step": 80
215
+ },
216
+ {
217
+ "entropy": 0.4201068043708801,
218
+ "epoch": 1.0368663594470047,
219
+ "grad_norm": 0.5,
220
+ "learning_rate": 0.00015757220656897896,
221
+ "loss": 0.41355881690979,
222
+ "mean_token_accuracy": 0.9027445759092059,
223
+ "num_tokens": 126530.0,
224
+ "step": 85
225
+ },
226
+ {
227
+ "entropy": 0.3881114762276411,
228
+ "epoch": 1.098310291858679,
229
+ "grad_norm": 0.4609375,
230
+ "learning_rate": 0.00015193334856844528,
231
+ "loss": 0.3866158723831177,
232
+ "mean_token_accuracy": 0.9028143763542176,
233
+ "num_tokens": 134195.0,
234
+ "step": 90
235
+ },
236
+ {
237
+ "entropy": 0.37071702964603903,
238
+ "epoch": 1.1597542242703534,
239
+ "grad_norm": 0.58203125,
240
+ "learning_rate": 0.00014605854612936728,
241
+ "loss": 0.38562917709350586,
242
+ "mean_token_accuracy": 0.9037379220128059,
243
+ "num_tokens": 142095.0,
244
+ "step": 95
245
+ },
246
+ {
247
+ "entropy": 0.39508153647184374,
248
+ "epoch": 1.2211981566820276,
249
+ "grad_norm": 0.498046875,
250
+ "learning_rate": 0.00013997448975026382,
251
+ "loss": 0.37968151569366454,
252
+ "mean_token_accuracy": 0.902898819744587,
253
+ "num_tokens": 150281.0,
254
+ "step": 100
255
+ },
256
+ {
257
+ "epoch": 1.2211981566820276,
258
+ "eval_entropy": 0.3728377917041517,
259
+ "eval_loss": 0.32667699456214905,
260
+ "eval_mean_token_accuracy": 0.9168023311928527,
261
+ "eval_num_tokens": 150281.0,
262
+ "eval_runtime": 100.3144,
263
+ "eval_samples_per_second": 0.728,
264
+ "eval_steps_per_second": 0.728,
265
+ "step": 100
266
+ },
267
+ {
268
+ "entropy": 0.3990515094250441,
269
+ "epoch": 1.282642089093702,
270
+ "grad_norm": 0.498046875,
271
+ "learning_rate": 0.00013370882061557635,
272
+ "loss": 0.35355989933013915,
273
+ "mean_token_accuracy": 0.9085300818085671,
274
+ "num_tokens": 158311.0,
275
+ "step": 105
276
+ },
277
+ {
278
+ "entropy": 0.34259250313043593,
279
+ "epoch": 1.3440860215053765,
280
+ "grad_norm": 0.515625,
281
+ "learning_rate": 0.0001272900050157875,
282
+ "loss": 0.3187845706939697,
283
+ "mean_token_accuracy": 0.9141712740063668,
284
+ "num_tokens": 165531.0,
285
+ "step": 110
286
+ },
287
+ {
288
+ "entropy": 0.3513215810060501,
289
+ "epoch": 1.4055299539170507,
290
+ "grad_norm": 0.447265625,
291
+ "learning_rate": 0.00012074720501890484,
292
+ "loss": 0.34308681488037107,
293
+ "mean_token_accuracy": 0.9139169871807098,
294
+ "num_tokens": 172730.0,
295
+ "step": 115
296
+ },
297
+ {
298
+ "entropy": 0.3432418659329414,
299
+ "epoch": 1.466973886328725,
300
+ "grad_norm": 0.4609375,
301
+ "learning_rate": 0.00011411014598087644,
302
+ "loss": 0.3543131113052368,
303
+ "mean_token_accuracy": 0.9060193613171578,
304
+ "num_tokens": 180674.0,
305
+ "step": 120
306
+ },
307
+ {
308
+ "epoch": 1.466973886328725,
309
+ "eval_entropy": 0.3156628967964486,
310
+ "eval_loss": 0.28925180435180664,
311
+ "eval_mean_token_accuracy": 0.9195440672848323,
312
+ "eval_num_tokens": 180674.0,
313
+ "eval_runtime": 100.8258,
314
+ "eval_samples_per_second": 0.724,
315
+ "eval_steps_per_second": 0.724,
316
+ "step": 120
317
+ },
318
+ {
319
+ "entropy": 0.328844403848052,
320
+ "epoch": 1.5284178187403994,
321
+ "grad_norm": 0.6484375,
322
+ "learning_rate": 0.0001074089814968676,
323
+ "loss": 0.3134729862213135,
324
+ "mean_token_accuracy": 0.9172038078308106,
325
+ "num_tokens": 187909.0,
326
+ "step": 125
327
+ },
328
+ {
329
+ "entropy": 0.3347533904016018,
330
+ "epoch": 1.5898617511520738,
331
+ "grad_norm": 0.46484375,
332
+ "learning_rate": 0.0001006741564069543,
333
+ "loss": 0.32318768501281736,
334
+ "mean_token_accuracy": 0.915935255587101,
335
+ "num_tokens": 195418.0,
336
+ "step": 130
337
+ },
338
+ {
339
+ "entropy": 0.31085881143808364,
340
+ "epoch": 1.651305683563748,
341
+ "grad_norm": 0.6953125,
342
+ "learning_rate": 9.393626847862763e-05,
343
+ "loss": 0.28849263191223146,
344
+ "mean_token_accuracy": 0.9287568554282188,
345
+ "num_tokens": 202302.0,
346
+ "step": 135
347
+ },
348
+ {
349
+ "entropy": 0.36759571749716996,
350
+ "epoch": 1.7127496159754223,
351
+ "grad_norm": 0.5546875,
352
+ "learning_rate": 8.722592939451625e-05,
353
+ "loss": 0.3258425951004028,
354
+ "mean_token_accuracy": 0.9135418727993965,
355
+ "num_tokens": 210159.0,
356
+ "step": 140
357
+ },
358
+ {
359
+ "epoch": 1.7127496159754223,
360
+ "eval_entropy": 0.2999503336948891,
361
+ "eval_loss": 0.2642817199230194,
362
+ "eval_mean_token_accuracy": 0.9280164380596109,
363
+ "eval_num_tokens": 210159.0,
364
+ "eval_runtime": 95.0047,
365
+ "eval_samples_per_second": 0.768,
366
+ "eval_steps_per_second": 0.768,
367
+ "step": 140
368
+ },
369
+ {
370
+ "entropy": 0.2923012483865023,
371
+ "epoch": 1.7741935483870968,
372
+ "grad_norm": 0.470703125,
373
+ "learning_rate": 8.057362567688942e-05,
374
+ "loss": 0.28111426830291747,
375
+ "mean_token_accuracy": 0.9294544145464897,
376
+ "num_tokens": 217668.0,
377
+ "step": 145
378
+ },
379
+ {
380
+ "entropy": 0.3098321039229631,
381
+ "epoch": 1.8356374807987712,
382
+ "grad_norm": 0.400390625,
383
+ "learning_rate": 7.400958018079008e-05,
384
+ "loss": 0.2959801197052002,
385
+ "mean_token_accuracy": 0.9246162533760071,
386
+ "num_tokens": 224914.0,
387
+ "step": 150
388
+ },
389
+ {
390
+ "entropy": 0.30831411490216853,
391
+ "epoch": 1.8970814132104454,
392
+ "grad_norm": 0.435546875,
393
+ "learning_rate": 6.756361478506578e-05,
394
+ "loss": 0.3086764097213745,
395
+ "mean_token_accuracy": 0.9224985137581825,
396
+ "num_tokens": 232318.0,
397
+ "step": 155
398
+ },
399
+ {
400
+ "entropy": 0.29551686625927687,
401
+ "epoch": 1.9585253456221197,
402
+ "grad_norm": 0.58203125,
403
+ "learning_rate": 6.1265014905121e-05,
404
+ "loss": 0.2773712635040283,
405
+ "mean_token_accuracy": 0.9252645134925842,
406
+ "num_tokens": 239672.0,
407
+ "step": 160
408
+ },
409
+ {
410
+ "epoch": 1.9585253456221197,
411
+ "eval_entropy": 0.26235738804895586,
412
+ "eval_loss": 0.25179651379585266,
413
+ "eval_mean_token_accuracy": 0.9296977715949489,
414
+ "eval_num_tokens": 239672.0,
415
+ "eval_runtime": 95.912,
416
+ "eval_samples_per_second": 0.761,
417
+ "eval_steps_per_second": 0.761,
418
+ "step": 160
419
+ },
420
+ {
421
+ "entropy": 0.26158358571784834,
422
+ "epoch": 2.0122887864823347,
423
+ "grad_norm": 0.4140625,
424
+ "learning_rate": 5.5142396442938795e-05,
425
+ "loss": 0.24724166393280028,
426
+ "mean_token_accuracy": 0.9323797225952148,
427
+ "num_tokens": 246006.0,
428
+ "step": 165
429
+ },
430
+ {
431
+ "entropy": 0.2724688397720456,
432
+ "epoch": 2.0737327188940093,
433
+ "grad_norm": 0.61328125,
434
+ "learning_rate": 4.9223575778847085e-05,
435
+ "loss": 0.2526975393295288,
436
+ "mean_token_accuracy": 0.9308534324169159,
437
+ "num_tokens": 253437.0,
438
+ "step": 170
439
+ },
440
+ {
441
+ "entropy": 0.2712310256436467,
442
+ "epoch": 2.1351766513056836,
443
+ "grad_norm": 0.439453125,
444
+ "learning_rate": 4.353544339568448e-05,
445
+ "loss": 0.2677891254425049,
446
+ "mean_token_accuracy": 0.9274151250720024,
447
+ "num_tokens": 260911.0,
448
+ "step": 175
449
+ },
450
+ {
451
+ "entropy": 0.2781375008635223,
452
+ "epoch": 2.196620583717358,
453
+ "grad_norm": 0.55078125,
454
+ "learning_rate": 3.8103841709519084e-05,
455
+ "loss": 0.29916017055511473,
456
+ "mean_token_accuracy": 0.9209732711315155,
457
+ "num_tokens": 268425.0,
458
+ "step": 180
459
+ },
460
+ {
461
+ "epoch": 2.196620583717358,
462
+ "eval_entropy": 0.2463044097570524,
463
+ "eval_loss": 0.24747803807258606,
464
+ "eval_mean_token_accuracy": 0.930726853135514,
465
+ "eval_num_tokens": 268425.0,
466
+ "eval_runtime": 95.1097,
467
+ "eval_samples_per_second": 0.768,
468
+ "eval_steps_per_second": 0.768,
469
+ "step": 180
470
+ },
471
+ {
472
+ "entropy": 0.2690023283474147,
473
+ "epoch": 2.258064516129032,
474
+ "grad_norm": 0.4765625,
475
+ "learning_rate": 3.29534476619609e-05,
476
+ "loss": 0.27658329010009763,
477
+ "mean_token_accuracy": 0.9289590641856194,
478
+ "num_tokens": 275782.0,
479
+ "step": 185
480
+ },
481
+ {
482
+ "entropy": 0.2697915196418762,
483
+ "epoch": 2.3195084485407067,
484
+ "grad_norm": 0.44921875,
485
+ "learning_rate": 2.8107660607477328e-05,
486
+ "loss": 0.28579936027526853,
487
+ "mean_token_accuracy": 0.9249747917056084,
488
+ "num_tokens": 283440.0,
489
+ "step": 190
490
+ },
491
+ {
492
+ "entropy": 0.28678075782954693,
493
+ "epoch": 2.380952380952381,
494
+ "grad_norm": 0.5078125,
495
+ "learning_rate": 2.3588496005063287e-05,
496
+ "loss": 0.300011134147644,
497
+ "mean_token_accuracy": 0.9201881185173988,
498
+ "num_tokens": 290391.0,
499
+ "step": 195
500
+ },
501
+ {
502
+ "entropy": 0.2683371202088892,
503
+ "epoch": 2.442396313364055,
504
+ "grad_norm": 0.49609375,
505
+ "learning_rate": 1.9416485397247795e-05,
506
+ "loss": 0.26392982006072996,
507
+ "mean_token_accuracy": 0.9297228127717971,
508
+ "num_tokens": 298116.0,
509
+ "step": 200
510
+ },
511
+ {
512
+ "epoch": 2.442396313364055,
513
+ "eval_entropy": 0.24947702108997188,
514
+ "eval_loss": 0.24490928649902344,
515
+ "eval_mean_token_accuracy": 0.931492513989749,
516
+ "eval_num_tokens": 298116.0,
517
+ "eval_runtime": 96.5333,
518
+ "eval_samples_per_second": 0.756,
519
+ "eval_steps_per_second": 0.756,
520
+ "step": 200
521
+ },
522
+ {
523
+ "entropy": 0.27692094454541805,
524
+ "epoch": 2.50384024577573,
525
+ "grad_norm": 0.396484375,
526
+ "learning_rate": 1.5610583130854128e-05,
527
+ "loss": 0.2804937601089478,
528
+ "mean_token_accuracy": 0.922454084455967,
529
+ "num_tokens": 305768.0,
530
+ "step": 205
531
+ },
532
+ {
533
+ "entropy": 0.29743164833635094,
534
+ "epoch": 2.565284178187404,
535
+ "grad_norm": 0.396484375,
536
+ "learning_rate": 1.2188080243301437e-05,
537
+ "loss": 0.29574849605560305,
538
+ "mean_token_accuracy": 0.9198502600193024,
539
+ "num_tokens": 313660.0,
540
+ "step": 210
541
+ },
542
+ {
543
+ "entropy": 0.2640182925388217,
544
+ "epoch": 2.6267281105990783,
545
+ "grad_norm": 0.49609375,
546
+ "learning_rate": 9.164525905680709e-06,
547
+ "loss": 0.25743927955627444,
548
+ "mean_token_accuracy": 0.9311310544610023,
549
+ "num_tokens": 320841.0,
550
+ "step": 215
551
+ },
552
+ {
553
+ "entropy": 0.27618018090724944,
554
+ "epoch": 2.688172043010753,
555
+ "grad_norm": 0.51953125,
556
+ "learning_rate": 6.553656779506468e-06,
557
+ "loss": 0.2789269685745239,
558
+ "mean_token_accuracy": 0.9260447949171067,
559
+ "num_tokens": 328470.0,
560
+ "step": 220
561
+ },
562
+ {
563
+ "epoch": 2.688172043010753,
564
+ "eval_entropy": 0.24862186620904975,
565
+ "eval_loss": 0.24429786205291748,
566
+ "eval_mean_token_accuracy": 0.9314827543415435,
567
+ "eval_num_tokens": 328470.0,
568
+ "eval_runtime": 93.481,
569
+ "eval_samples_per_second": 0.781,
570
+ "eval_steps_per_second": 0.781,
571
+ "step": 220
572
+ },
573
+ {
574
+ "entropy": 0.2760592779144645,
575
+ "epoch": 2.749615975422427,
576
+ "grad_norm": 0.40625,
577
+ "learning_rate": 4.367334608091389e-06,
578
+ "loss": 0.29435703754425047,
579
+ "mean_token_accuracy": 0.9220241814851761,
580
+ "num_tokens": 336107.0,
581
+ "step": 225
582
+ },
583
+ {
584
+ "entropy": 0.2630997773259878,
585
+ "epoch": 2.8110599078341014,
586
+ "grad_norm": 0.466796875,
587
+ "learning_rate": 2.6154923260801934e-06,
588
+ "loss": 0.2583890914916992,
589
+ "mean_token_accuracy": 0.9310009226202964,
590
+ "num_tokens": 343384.0,
591
+ "step": 230
592
+ },
593
+ {
594
+ "entropy": 0.28990690847858785,
595
+ "epoch": 2.8725038402457757,
596
+ "grad_norm": 0.390625,
597
+ "learning_rate": 1.3060889319784885e-06,
598
+ "loss": 0.2960776090621948,
599
+ "mean_token_accuracy": 0.9223004102706909,
600
+ "num_tokens": 351180.0,
601
+ "step": 235
602
+ },
603
+ {
604
+ "entropy": 0.2609599939547479,
605
+ "epoch": 2.93394777265745,
606
+ "grad_norm": 0.388671875,
607
+ "learning_rate": 4.4507332870059594e-07,
608
+ "loss": 0.25511951446533204,
609
+ "mean_token_accuracy": 0.9273923814296723,
610
+ "num_tokens": 359106.0,
611
+ "step": 240
612
+ },
613
+ {
614
+ "epoch": 2.93394777265745,
615
+ "eval_entropy": 0.24859930197261784,
616
+ "eval_loss": 0.24424654245376587,
617
+ "eval_mean_token_accuracy": 0.9321725441984934,
618
+ "eval_num_tokens": 359106.0,
619
+ "eval_runtime": 96.2762,
620
+ "eval_samples_per_second": 0.758,
621
+ "eval_steps_per_second": 0.758,
622
+ "step": 240
623
+ },
624
+ {
625
+ "entropy": 0.2684542080387473,
626
+ "epoch": 2.9953917050691246,
627
+ "grad_norm": 0.390625,
628
+ "learning_rate": 3.635729641654484e-08,
629
+ "loss": 0.2732724666595459,
630
+ "mean_token_accuracy": 0.9262633189558983,
631
+ "num_tokens": 366418.0,
632
+ "step": 245
633
+ },
634
+ {
635
+ "epoch": 3.0,
636
+ "eval_entropy": 0.24880487002330284,
637
+ "eval_loss": 0.244215190410614,
638
+ "eval_mean_token_accuracy": 0.9320176945973749,
639
+ "eval_num_tokens": 366954.0,
640
+ "eval_runtime": 94.6685,
641
+ "eval_samples_per_second": 0.771,
642
+ "eval_steps_per_second": 0.771,
643
+ "step": 246
644
+ }
645
+ ],
646
+ "logging_steps": 5,
647
+ "max_steps": 246,
648
+ "num_input_tokens_seen": 0,
649
+ "num_train_epochs": 3,
650
+ "save_steps": 20,
651
+ "stateful_callbacks": {
652
+ "TrainerControl": {
653
+ "args": {
654
+ "should_epoch_stop": false,
655
+ "should_evaluate": false,
656
+ "should_log": false,
657
+ "should_save": true,
658
+ "should_training_stop": true
659
+ },
660
+ "attributes": {}
661
+ }
662
+ },
663
+ "total_flos": 1.5578662344763392e+16,
664
+ "train_batch_size": 1,
665
+ "trial_name": null,
666
+ "trial_params": null
667
+ }