cryptobiosis's picture
Publish sanitized Stage 4 Repair SFT release
8e74b89 verified
Raw
History Blame Contribute Delete
51.3 kB
{
"max_steps": 175,
"save_steps": 35,
"is_world_process_zero": true,
"train_batch_size": 1,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"is_hyper_param_search": false,
"num_input_tokens_seen": 0,
"log_history": [
{
"entropy": 0.8749912828207016,
"epoch": 0.005714285714285714,
"grad_norm": 0.494140625,
"learning_rate": 0.0,
"loss": 0.35,
"mean_token_accuracy": 0.8977917954325676,
"num_tokens": 29411.0,
"step": 1
},
{
"entropy": 0.875585176050663,
"epoch": 0.011428571428571429,
"grad_norm": 0.44921875,
"learning_rate": 1.111111111111111e-06,
"loss": 0.108,
"mean_token_accuracy": 0.9535237550735474,
"num_tokens": 54683.0,
"step": 2
},
{
"entropy": 0.9626811370253563,
"epoch": 0.017142857142857144,
"grad_norm": 0.494140625,
"learning_rate": 2.222222222222222e-06,
"loss": 0.1226,
"mean_token_accuracy": 0.9568850845098495,
"num_tokens": 75772.0,
"step": 3
},
{
"entropy": 0.9870915822684765,
"epoch": 0.022857142857142857,
"grad_norm": 0.671875,
"learning_rate": 3.3333333333333333e-06,
"loss": 0.2987,
"mean_token_accuracy": 0.9255228415131569,
"num_tokens": 94596.0,
"step": 4
},
{
"entropy": 0.9431633446365595,
"epoch": 0.02857142857142857,
"grad_norm": 1.6328125,
"learning_rate": 4.444444444444444e-06,
"loss": 0.3896,
"mean_token_accuracy": 0.9072471372783184,
"num_tokens": 114864.0,
"step": 5
},
{
"entropy": 0.8606603350490332,
"epoch": 0.03428571428571429,
"grad_norm": 0.59765625,
"learning_rate": 5.555555555555557e-06,
"loss": 0.4749,
"mean_token_accuracy": 0.8948077894747257,
"num_tokens": 138676.0,
"step": 6
},
{
"entropy": 0.8535148575901985,
"epoch": 0.04,
"grad_norm": 0.60546875,
"learning_rate": 6.666666666666667e-06,
"loss": 0.1483,
"mean_token_accuracy": 0.9479962512850761,
"num_tokens": 164003.0,
"step": 7
},
{
"entropy": 0.9910166934132576,
"epoch": 0.045714285714285714,
"grad_norm": 0.453125,
"learning_rate": 7.77777777777778e-06,
"loss": 0.3066,
"mean_token_accuracy": 0.9498882181942463,
"num_tokens": 185952.0,
"step": 8
},
{
"entropy": 0.9770639836788177,
"epoch": 0.05142857142857143,
"grad_norm": 0.6796875,
"learning_rate": 8.888888888888888e-06,
"loss": 0.4671,
"mean_token_accuracy": 0.893197625875473,
"num_tokens": 204243.0,
"step": 9
},
{
"entropy": 0.9742397665977478,
"epoch": 0.05714285714285714,
"grad_norm": 0.6953125,
"learning_rate": 1e-05,
"loss": 0.3377,
"mean_token_accuracy": 0.8987404629588127,
"num_tokens": 223465.0,
"step": 10
},
{
"entropy": 0.8626804165542126,
"epoch": 0.06285714285714286,
"grad_norm": 0.70703125,
"learning_rate": 9.99910461334869e-06,
"loss": 0.5433,
"mean_token_accuracy": 0.9067845679819584,
"num_tokens": 245021.0,
"step": 11
},
{
"entropy": 0.9500371664762497,
"epoch": 0.06857142857142857,
"grad_norm": 0.57421875,
"learning_rate": 9.996418774081658e-06,
"loss": 0.4075,
"mean_token_accuracy": 0.9532840885221958,
"num_tokens": 268768.0,
"step": 12
},
{
"entropy": 0.8756210878491402,
"epoch": 0.07428571428571429,
"grad_norm": 0.55859375,
"learning_rate": 9.991943444144758e-06,
"loss": 0.3333,
"mean_token_accuracy": 0.9239994585514069,
"num_tokens": 291342.0,
"step": 13
},
{
"entropy": 0.9877203069627285,
"epoch": 0.08,
"grad_norm": 0.298828125,
"learning_rate": 9.985680226398261e-06,
"loss": 0.051,
"mean_token_accuracy": 0.9740834198892117,
"num_tokens": 311741.0,
"step": 14
},
{
"entropy": 0.9451847337186337,
"epoch": 0.08571428571428572,
"grad_norm": 0.462890625,
"learning_rate": 9.977631364042796e-06,
"loss": 0.2506,
"mean_token_accuracy": 0.9314159639179707,
"num_tokens": 336791.0,
"step": 15
},
{
"entropy": 1.0535272359848022,
"epoch": 0.09142857142857143,
"grad_norm": 0.443359375,
"learning_rate": 9.967799739815925e-06,
"loss": 0.1661,
"mean_token_accuracy": 0.9449756816029549,
"num_tokens": 355547.0,
"step": 16
},
{
"entropy": 0.8473225496709347,
"epoch": 0.09714285714285714,
"grad_norm": 0.37109375,
"learning_rate": 9.956188874959686e-06,
"loss": 0.1392,
"mean_token_accuracy": 0.9268854539841413,
"num_tokens": 378069.0,
"step": 17
},
{
"entropy": 0.8464508075267076,
"epoch": 0.10285714285714286,
"grad_norm": 0.27734375,
"learning_rate": 9.942802927959444e-06,
"loss": 0.1095,
"mean_token_accuracy": 0.9479888863861561,
"num_tokens": 402338.0,
"step": 18
},
{
"entropy": 0.9170358963310719,
"epoch": 0.10857142857142857,
"grad_norm": 0.333984375,
"learning_rate": 9.927646693054498e-06,
"loss": 0.0719,
"mean_token_accuracy": 0.978356346487999,
"num_tokens": 425500.0,
"step": 19
},
{
"entropy": 0.8572139944881201,
"epoch": 0.11428571428571428,
"grad_norm": 0.3203125,
"learning_rate": 9.910725598521014e-06,
"loss": 0.1026,
"mean_token_accuracy": 0.9628097862005234,
"num_tokens": 448855.0,
"step": 20
},
{
"entropy": 0.7983267344534397,
"epoch": 0.12,
"grad_norm": 0.20703125,
"learning_rate": 9.892045704727864e-06,
"loss": 0.0308,
"mean_token_accuracy": 0.9713204726576805,
"num_tokens": 479318.0,
"step": 21
},
{
"entropy": 0.8835957311093807,
"epoch": 0.12571428571428572,
"grad_norm": 0.357421875,
"learning_rate": 9.871613701966067e-06,
"loss": 0.1352,
"mean_token_accuracy": 0.9699565283954144,
"num_tokens": 499352.0,
"step": 22
},
{
"entropy": 0.8213062435388565,
"epoch": 0.13142857142857142,
"grad_norm": 0.462890625,
"learning_rate": 9.849436908052636e-06,
"loss": 0.1679,
"mean_token_accuracy": 0.9590318724513054,
"num_tokens": 521144.0,
"step": 23
},
{
"entropy": 0.948228694498539,
"epoch": 0.13714285714285715,
"grad_norm": 0.515625,
"learning_rate": 9.825523265709667e-06,
"loss": 0.3717,
"mean_token_accuracy": 0.9018147587776184,
"num_tokens": 540147.0,
"step": 24
},
{
"entropy": 0.8118924200534821,
"epoch": 0.14285714285714285,
"grad_norm": 0.451171875,
"learning_rate": 9.799881339719615e-06,
"loss": 0.381,
"mean_token_accuracy": 0.8814735785126686,
"num_tokens": 565734.0,
"step": 25
},
{
"entropy": 0.7852364294230938,
"epoch": 0.14857142857142858,
"grad_norm": 0.625,
"learning_rate": 9.772520313857777e-06,
"loss": 0.516,
"mean_token_accuracy": 0.8841418623924255,
"num_tokens": 589632.0,
"step": 26
},
{
"entropy": 0.8675227835774422,
"epoch": 0.15428571428571428,
"grad_norm": 0.31640625,
"learning_rate": 9.743449987603082e-06,
"loss": 0.0974,
"mean_token_accuracy": 0.9476801715791225,
"num_tokens": 609264.0,
"step": 27
},
{
"entropy": 0.8951734602451324,
"epoch": 0.16,
"grad_norm": 0.49609375,
"learning_rate": 9.712680772628365e-06,
"loss": 0.1979,
"mean_token_accuracy": 0.9428337290883064,
"num_tokens": 630959.0,
"step": 28
},
{
"entropy": 0.808982141315937,
"epoch": 0.1657142857142857,
"grad_norm": 0.35546875,
"learning_rate": 9.680223689071364e-06,
"loss": 0.2369,
"mean_token_accuracy": 0.9508304186165333,
"num_tokens": 651742.0,
"step": 29
},
{
"entropy": 0.8595655560493469,
"epoch": 0.17142857142857143,
"grad_norm": 0.48046875,
"learning_rate": 9.646090361587828e-06,
"loss": 0.2099,
"mean_token_accuracy": 0.9459701962769032,
"num_tokens": 673005.0,
"step": 30
},
{
"entropy": 0.9097736775875092,
"epoch": 0.17714285714285713,
"grad_norm": 0.51171875,
"learning_rate": 9.610293015188067e-06,
"loss": 0.127,
"mean_token_accuracy": 0.9653318747878075,
"num_tokens": 695196.0,
"step": 31
},
{
"entropy": 0.8208987936377525,
"epoch": 0.18285714285714286,
"grad_norm": 0.474609375,
"learning_rate": 9.572844470858537e-06,
"loss": 0.3805,
"mean_token_accuracy": 0.8996468931436539,
"num_tokens": 720448.0,
"step": 32
},
{
"entropy": 0.8851851001381874,
"epoch": 0.18857142857142858,
"grad_norm": 0.388671875,
"learning_rate": 9.533758140969913e-06,
"loss": 0.1802,
"mean_token_accuracy": 0.9502685889601707,
"num_tokens": 741368.0,
"step": 33
},
{
"entropy": 0.8407743759453297,
"epoch": 0.19428571428571428,
"grad_norm": 0.58984375,
"learning_rate": 9.493048024473413e-06,
"loss": 0.2724,
"mean_token_accuracy": 0.9375377260148525,
"num_tokens": 762498.0,
"step": 34
},
{
"entropy": 0.7037532348185778,
"epoch": 0.2,
"grad_norm": 0.283203125,
"learning_rate": 9.450728701886985e-06,
"loss": 0.09,
"mean_token_accuracy": 0.9488834552466869,
"num_tokens": 790572.0,
"step": 35
},
{
"epoch": 0.2,
"eval_entropy": 0.8689000523835421,
"eval_loss": 0.3127354085445404,
"eval_mean_token_accuracy": 0.9241019106656313,
"eval_num_tokens": 790572.0,
"eval_runtime": 90.9265,
"eval_samples_per_second": 4.399,
"eval_steps_per_second": 4.399,
"step": 35
},
{
"entropy": 0.9641305468976498,
"epoch": 0.2057142857142857,
"grad_norm": 0.26171875,
"learning_rate": 9.406815330073244e-06,
"loss": 0.0987,
"mean_token_accuracy": 0.9563006423413754,
"num_tokens": 811589.0,
"step": 36
},
{
"entropy": 0.8417863231152296,
"epoch": 0.21142857142857144,
"grad_norm": 0.9296875,
"learning_rate": 9.36132363681097e-06,
"loss": 0.4473,
"mean_token_accuracy": 0.9201415926218033,
"num_tokens": 835343.0,
"step": 37
},
{
"entropy": 0.9279076214879751,
"epoch": 0.21714285714285714,
"grad_norm": 0.234375,
"learning_rate": 9.314269915162115e-06,
"loss": 0.0366,
"mean_token_accuracy": 0.9819578677415848,
"num_tokens": 857745.0,
"step": 38
},
{
"entropy": 0.9102700352668762,
"epoch": 0.22285714285714286,
"grad_norm": 0.8515625,
"learning_rate": 9.265671017636384e-06,
"loss": 0.4769,
"mean_token_accuracy": 0.9464839920401573,
"num_tokens": 885412.0,
"step": 39
},
{
"entropy": 0.8781285881996155,
"epoch": 0.22857142857142856,
"grad_norm": 0.671875,
"learning_rate": 9.215544350155423e-06,
"loss": 0.4407,
"mean_token_accuracy": 0.9192753657698631,
"num_tokens": 907272.0,
"step": 40
},
{
"entropy": 0.884316835552454,
"epoch": 0.2342857142857143,
"grad_norm": 0.57421875,
"learning_rate": 9.163907865818806e-06,
"loss": 0.3331,
"mean_token_accuracy": 0.9058137945830822,
"num_tokens": 929992.0,
"step": 41
},
{
"entropy": 0.9548828471451998,
"epoch": 0.24,
"grad_norm": 0.52734375,
"learning_rate": 9.110780058474052e-06,
"loss": 0.2486,
"mean_token_accuracy": 0.9495599456131458,
"num_tokens": 949716.0,
"step": 42
},
{
"entropy": 0.8926267586648464,
"epoch": 0.24571428571428572,
"grad_norm": 0.8828125,
"learning_rate": 9.056179956092961e-06,
"loss": 0.5837,
"mean_token_accuracy": 0.8974111899733543,
"num_tokens": 971635.0,
"step": 43
},
{
"entropy": 0.7238617390394211,
"epoch": 0.25142857142857145,
"grad_norm": 0.314453125,
"learning_rate": 9.000127113956673e-06,
"loss": 0.2067,
"mean_token_accuracy": 0.9391417279839516,
"num_tokens": 996008.0,
"step": 44
},
{
"entropy": 0.7713149264454842,
"epoch": 0.2571428571428571,
"grad_norm": 0.1904296875,
"learning_rate": 8.94264160765183e-06,
"loss": 0.1132,
"mean_token_accuracy": 0.9410833567380905,
"num_tokens": 1021812.0,
"step": 45
},
{
"entropy": 0.906012874096632,
"epoch": 0.26285714285714284,
"grad_norm": 0.376953125,
"learning_rate": 8.883744025880429e-06,
"loss": 0.1349,
"mean_token_accuracy": 0.9730539433658123,
"num_tokens": 1042776.0,
"step": 46
},
{
"entropy": 0.893264701589942,
"epoch": 0.26857142857142857,
"grad_norm": 0.55078125,
"learning_rate": 8.823455463085873e-06,
"loss": 0.3195,
"mean_token_accuracy": 0.907339371740818,
"num_tokens": 1070161.0,
"step": 47
},
{
"entropy": 0.9435957297682762,
"epoch": 0.2742857142857143,
"grad_norm": 0.376953125,
"learning_rate": 8.761797511897907e-06,
"loss": 0.0763,
"mean_token_accuracy": 0.9643098935484886,
"num_tokens": 1092383.0,
"step": 48
},
{
"entropy": 0.9334972836077213,
"epoch": 0.28,
"grad_norm": 0.40625,
"learning_rate": 8.698792255399104e-06,
"loss": 0.0661,
"mean_token_accuracy": 0.9583298973739147,
"num_tokens": 1114220.0,
"step": 49
},
{
"entropy": 0.8552105147391558,
"epoch": 0.2857142857142857,
"grad_norm": 0.271484375,
"learning_rate": 8.634462259215719e-06,
"loss": 0.0947,
"mean_token_accuracy": 0.974045418202877,
"num_tokens": 1136124.0,
"step": 50
},
{
"entropy": 0.8368009328842163,
"epoch": 0.2914285714285714,
"grad_norm": 0.5,
"learning_rate": 8.568830563435695e-06,
"loss": 0.2611,
"mean_token_accuracy": 0.9241638034582138,
"num_tokens": 1160123.0,
"step": 51
},
{
"entropy": 0.7590750344097614,
"epoch": 0.29714285714285715,
"grad_norm": 0.51953125,
"learning_rate": 8.501920674356755e-06,
"loss": 0.2207,
"mean_token_accuracy": 0.9286937117576599,
"num_tokens": 1184958.0,
"step": 52
},
{
"entropy": 0.9840590953826904,
"epoch": 0.3028571428571429,
"grad_norm": 0.58203125,
"learning_rate": 8.433756556067506e-06,
"loss": 0.22,
"mean_token_accuracy": 0.908040776848793,
"num_tokens": 1200609.0,
"step": 53
},
{
"entropy": 0.9369215555489063,
"epoch": 0.30857142857142855,
"grad_norm": 0.28125,
"learning_rate": 8.364362621864595e-06,
"loss": 0.0742,
"mean_token_accuracy": 0.9590763710439205,
"num_tokens": 1220859.0,
"step": 54
},
{
"entropy": 0.791748657822609,
"epoch": 0.3142857142857143,
"grad_norm": 0.33984375,
"learning_rate": 8.29376372550897e-06,
"loss": 0.1522,
"mean_token_accuracy": 0.9422268383204937,
"num_tokens": 1248991.0,
"step": 55
},
{
"entropy": 0.8576459661126137,
"epoch": 0.32,
"grad_norm": 0.431640625,
"learning_rate": 8.221985152324385e-06,
"loss": 0.1875,
"mean_token_accuracy": 0.9321193210780621,
"num_tokens": 1276785.0,
"step": 56
},
{
"entropy": 0.8861603923141956,
"epoch": 0.32571428571428573,
"grad_norm": 0.4296875,
"learning_rate": 8.149052610141357e-06,
"loss": 0.1736,
"mean_token_accuracy": 0.9611009992659092,
"num_tokens": 1295280.0,
"step": 57
},
{
"entropy": 0.8505105189979076,
"epoch": 0.3314285714285714,
"grad_norm": 0.380859375,
"learning_rate": 8.07499222008977e-06,
"loss": 0.1473,
"mean_token_accuracy": 0.959467314183712,
"num_tokens": 1316096.0,
"step": 58
},
{
"entropy": 0.918358813971281,
"epoch": 0.33714285714285713,
"grad_norm": 0.427734375,
"learning_rate": 7.999830507243478e-06,
"loss": 0.1743,
"mean_token_accuracy": 0.9617721550166607,
"num_tokens": 1340263.0,
"step": 59
},
{
"entropy": 0.7842087559401989,
"epoch": 0.34285714285714286,
"grad_norm": 0.318359375,
"learning_rate": 7.923594391120237e-06,
"loss": 0.0953,
"mean_token_accuracy": 0.968870148062706,
"num_tokens": 1364628.0,
"step": 60
},
{
"entropy": 0.8913918249309063,
"epoch": 0.3485714285714286,
"grad_norm": 0.5,
"learning_rate": 7.846311176040331e-06,
"loss": 0.3246,
"mean_token_accuracy": 0.9421980828046799,
"num_tokens": 1386415.0,
"step": 61
},
{
"entropy": 0.861630380153656,
"epoch": 0.35428571428571426,
"grad_norm": 0.43359375,
"learning_rate": 7.768008541347423e-06,
"loss": 0.3042,
"mean_token_accuracy": 0.9076553024351597,
"num_tokens": 1409474.0,
"step": 62
},
{
"entropy": 0.858629435300827,
"epoch": 0.36,
"grad_norm": 0.43359375,
"learning_rate": 7.688714531495061e-06,
"loss": 0.2292,
"mean_token_accuracy": 0.9376597180962563,
"num_tokens": 1435711.0,
"step": 63
},
{
"entropy": 0.9525596722960472,
"epoch": 0.3657142857142857,
"grad_norm": 0.625,
"learning_rate": 7.608457546002423e-06,
"loss": 0.0645,
"mean_token_accuracy": 0.9651173837482929,
"num_tokens": 1457807.0,
"step": 64
},
{
"entropy": 0.9927118942141533,
"epoch": 0.37142857142857144,
"grad_norm": 0.5859375,
"learning_rate": 7.527266329282905e-06,
"loss": 0.3301,
"mean_token_accuracy": 0.910726185888052,
"num_tokens": 1478686.0,
"step": 65
},
{
"entropy": 0.8207175862044096,
"epoch": 0.37714285714285717,
"grad_norm": 0.318359375,
"learning_rate": 7.445169960349167e-06,
"loss": 0.1321,
"mean_token_accuracy": 0.9752165786921978,
"num_tokens": 1504665.0,
"step": 66
},
{
"entropy": 0.7939795292913914,
"epoch": 0.38285714285714284,
"grad_norm": 0.267578125,
"learning_rate": 7.362197842398355e-06,
"loss": 0.0607,
"mean_token_accuracy": 0.9890137501060963,
"num_tokens": 1531122.0,
"step": 67
},
{
"entropy": 0.8998405113816261,
"epoch": 0.38857142857142857,
"grad_norm": 0.50390625,
"learning_rate": 7.278379692281209e-06,
"loss": 0.2199,
"mean_token_accuracy": 0.9454703703522682,
"num_tokens": 1555455.0,
"step": 68
},
{
"entropy": 0.900477584451437,
"epoch": 0.3942857142857143,
"grad_norm": 0.412109375,
"learning_rate": 7.193745529858827e-06,
"loss": 0.1587,
"mean_token_accuracy": 0.9558433368802071,
"num_tokens": 1581569.0,
"step": 69
},
{
"entropy": 0.8638413399457932,
"epoch": 0.4,
"grad_norm": 0.400390625,
"learning_rate": 7.10832566725092e-06,
"loss": 0.1142,
"mean_token_accuracy": 0.9596346840262413,
"num_tokens": 1606126.0,
"step": 70
},
{
"epoch": 0.4,
"eval_entropy": 0.8763485141098499,
"eval_loss": 0.2973862886428833,
"eval_mean_token_accuracy": 0.9280769071727991,
"eval_num_tokens": 1606126.0,
"eval_runtime": 91.5273,
"eval_samples_per_second": 4.37,
"eval_steps_per_second": 4.37,
"step": 70
},
{
"entropy": 0.9078505225479603,
"epoch": 0.4057142857142857,
"grad_norm": 0.41796875,
"learning_rate": 7.022150697979385e-06,
"loss": 0.1814,
"mean_token_accuracy": 0.9287765622138977,
"num_tokens": 1624592.0,
"step": 71
},
{
"entropy": 0.882373970001936,
"epoch": 0.4114285714285714,
"grad_norm": 0.2275390625,
"learning_rate": 6.9352514860110876e-06,
"loss": 0.1,
"mean_token_accuracy": 0.9773332364857197,
"num_tokens": 1644996.0,
"step": 72
},
{
"entropy": 0.8143801726400852,
"epoch": 0.41714285714285715,
"grad_norm": 0.318359375,
"learning_rate": 6.847659154703785e-06,
"loss": 0.1004,
"mean_token_accuracy": 0.9484822899103165,
"num_tokens": 1672992.0,
"step": 73
},
{
"entropy": 0.8206119015812874,
"epoch": 0.4228571428571429,
"grad_norm": 0.46875,
"learning_rate": 6.759405075659165e-06,
"loss": 0.1754,
"mean_token_accuracy": 0.9521096795797348,
"num_tokens": 1698329.0,
"step": 74
},
{
"entropy": 0.8256349451839924,
"epoch": 0.42857142857142855,
"grad_norm": 0.1708984375,
"learning_rate": 6.6705208574869504e-06,
"loss": 0.0452,
"mean_token_accuracy": 0.9771151430904865,
"num_tokens": 1723576.0,
"step": 75
},
{
"entropy": 0.7869148999452591,
"epoch": 0.4342857142857143,
"grad_norm": 0.3203125,
"learning_rate": 6.58103833448412e-06,
"loss": 0.1119,
"mean_token_accuracy": 0.9510597065091133,
"num_tokens": 1750632.0,
"step": 76
},
{
"entropy": 0.9072761423885822,
"epoch": 0.44,
"grad_norm": 0.56640625,
"learning_rate": 6.490989555233328e-06,
"loss": 0.2573,
"mean_token_accuracy": 0.9290625192224979,
"num_tokens": 1771479.0,
"step": 77
},
{
"entropy": 0.8767102062702179,
"epoch": 0.44571428571428573,
"grad_norm": 0.55078125,
"learning_rate": 6.4004067711245366e-06,
"loss": 0.4063,
"mean_token_accuracy": 0.9356401972472668,
"num_tokens": 1794342.0,
"step": 78
},
{
"entropy": 0.8600077293813229,
"epoch": 0.4514285714285714,
"grad_norm": 0.515625,
"learning_rate": 6.309322424804034e-06,
"loss": 0.4222,
"mean_token_accuracy": 0.8884662203490734,
"num_tokens": 1815232.0,
"step": 79
},
{
"entropy": 0.8075901996344328,
"epoch": 0.45714285714285713,
"grad_norm": 0.2158203125,
"learning_rate": 6.2177691385549595e-06,
"loss": 0.0395,
"mean_token_accuracy": 0.9654630422592163,
"num_tokens": 1843699.0,
"step": 80
},
{
"entropy": 0.9111120142042637,
"epoch": 0.46285714285714286,
"grad_norm": 0.53125,
"learning_rate": 6.125779702613471e-06,
"loss": 0.2,
"mean_token_accuracy": 0.9453306347131729,
"num_tokens": 1863178.0,
"step": 81
},
{
"entropy": 0.8782064206898212,
"epoch": 0.4685714285714286,
"grad_norm": 0.6953125,
"learning_rate": 6.033387063424765e-06,
"loss": 0.5846,
"mean_token_accuracy": 0.8993191905319691,
"num_tokens": 1886505.0,
"step": 82
},
{
"entropy": 0.7901722844690084,
"epoch": 0.4742857142857143,
"grad_norm": 0.125,
"learning_rate": 5.94062431184317e-06,
"loss": 0.0243,
"mean_token_accuracy": 0.9816068820655346,
"num_tokens": 1911651.0,
"step": 83
},
{
"entropy": 0.7807160075753927,
"epoch": 0.48,
"grad_norm": 0.1943359375,
"learning_rate": 5.8475246712804845e-06,
"loss": 0.0649,
"mean_token_accuracy": 0.9530936926603317,
"num_tokens": 1939727.0,
"step": 84
},
{
"entropy": 0.805871419608593,
"epoch": 0.4857142857142857,
"grad_norm": 0.47265625,
"learning_rate": 5.7541214858068705e-06,
"loss": 0.3212,
"mean_token_accuracy": 0.9191376678645611,
"num_tokens": 1961164.0,
"step": 85
},
{
"entropy": 0.8677656650543213,
"epoch": 0.49142857142857144,
"grad_norm": 0.423828125,
"learning_rate": 5.660448208208513e-06,
"loss": 0.2838,
"mean_token_accuracy": 0.8779561948031187,
"num_tokens": 1983306.0,
"step": 86
},
{
"entropy": 0.8968867547810078,
"epoch": 0.49714285714285716,
"grad_norm": 0.287109375,
"learning_rate": 5.566538388006351e-06,
"loss": 0.1242,
"mean_token_accuracy": 0.9707877077162266,
"num_tokens": 2005414.0,
"step": 87
},
{
"entropy": 0.9857515692710876,
"epoch": 0.5028571428571429,
"grad_norm": 0.359375,
"learning_rate": 5.472425659440157e-06,
"loss": 0.201,
"mean_token_accuracy": 0.9621238149702549,
"num_tokens": 2026778.0,
"step": 88
},
{
"entropy": 0.7767338864505291,
"epoch": 0.5085714285714286,
"grad_norm": 0.52734375,
"learning_rate": 5.378143729422285e-06,
"loss": 0.2234,
"mean_token_accuracy": 0.937239296734333,
"num_tokens": 2049698.0,
"step": 89
},
{
"entropy": 0.8967469111084938,
"epoch": 0.5142857142857142,
"grad_norm": 0.404296875,
"learning_rate": 5.2837263654653715e-06,
"loss": 0.1559,
"mean_token_accuracy": 0.9657112322747707,
"num_tokens": 2073815.0,
"step": 90
},
{
"entropy": 0.9205988571047783,
"epoch": 0.52,
"grad_norm": 0.373046875,
"learning_rate": 5.189207383588353e-06,
"loss": 0.1183,
"mean_token_accuracy": 0.9595021493732929,
"num_tokens": 2094140.0,
"step": 91
},
{
"entropy": 0.8038613423705101,
"epoch": 0.5257142857142857,
"grad_norm": 0.22265625,
"learning_rate": 5.094620636205096e-06,
"loss": 0.0705,
"mean_token_accuracy": 0.9323722533881664,
"num_tokens": 2119725.0,
"step": 92
},
{
"entropy": 0.8465629853308201,
"epoch": 0.5314285714285715,
"grad_norm": 0.33203125,
"learning_rate": 5e-06,
"loss": 0.0788,
"mean_token_accuracy": 0.9482800886034966,
"num_tokens": 2140739.0,
"step": 93
},
{
"entropy": 0.8711249753832817,
"epoch": 0.5371428571428571,
"grad_norm": 0.255859375,
"learning_rate": 4.905379363794907e-06,
"loss": 0.0661,
"mean_token_accuracy": 0.9701907262206078,
"num_tokens": 2165915.0,
"step": 94
},
{
"entropy": 0.8372658789157867,
"epoch": 0.5428571428571428,
"grad_norm": 0.49609375,
"learning_rate": 4.81079261641165e-06,
"loss": 0.2275,
"mean_token_accuracy": 0.9530695639550686,
"num_tokens": 2190737.0,
"step": 95
},
{
"entropy": 0.852743711322546,
"epoch": 0.5485714285714286,
"grad_norm": 0.291015625,
"learning_rate": 4.71627363453463e-06,
"loss": 0.0795,
"mean_token_accuracy": 0.954478558152914,
"num_tokens": 2215151.0,
"step": 96
},
{
"entropy": 0.8570697363466024,
"epoch": 0.5542857142857143,
"grad_norm": 0.6484375,
"learning_rate": 4.6218562705777185e-06,
"loss": 0.2531,
"mean_token_accuracy": 0.9405127912759781,
"num_tokens": 2235956.0,
"step": 97
},
{
"entropy": 0.9492372311651707,
"epoch": 0.56,
"grad_norm": 0.703125,
"learning_rate": 4.527574340559844e-06,
"loss": 0.4012,
"mean_token_accuracy": 0.9081198573112488,
"num_tokens": 2255596.0,
"step": 98
},
{
"entropy": 0.8674456924200058,
"epoch": 0.5657142857142857,
"grad_norm": 0.28515625,
"learning_rate": 4.4334616119936516e-06,
"loss": 0.1056,
"mean_token_accuracy": 0.9499292522668839,
"num_tokens": 2278085.0,
"step": 99
},
{
"entropy": 0.830165795981884,
"epoch": 0.5714285714285714,
"grad_norm": 0.390625,
"learning_rate": 4.33955179179149e-06,
"loss": 0.2439,
"mean_token_accuracy": 0.9636958874762058,
"num_tokens": 2306986.0,
"step": 100
},
{
"entropy": 0.8232245780527592,
"epoch": 0.5771428571428572,
"grad_norm": 0.404296875,
"learning_rate": 4.245878514193131e-06,
"loss": 0.2359,
"mean_token_accuracy": 0.9303237311542034,
"num_tokens": 2329681.0,
"step": 101
},
{
"entropy": 0.8297377564013004,
"epoch": 0.5828571428571429,
"grad_norm": 0.5703125,
"learning_rate": 4.152475328719517e-06,
"loss": 0.3075,
"mean_token_accuracy": 0.9233161471784115,
"num_tokens": 2354228.0,
"step": 102
},
{
"entropy": 0.7650180887430906,
"epoch": 0.5885714285714285,
"grad_norm": 0.33203125,
"learning_rate": 4.059375688156833e-06,
"loss": 0.1562,
"mean_token_accuracy": 0.9361786916851997,
"num_tokens": 2385307.0,
"step": 103
},
{
"entropy": 0.9238808788359165,
"epoch": 0.5942857142857143,
"grad_norm": 0.337890625,
"learning_rate": 3.966612936575235e-06,
"loss": 0.1913,
"mean_token_accuracy": 0.943382054567337,
"num_tokens": 2406416.0,
"step": 104
},
{
"entropy": 0.8188824839890003,
"epoch": 0.6,
"grad_norm": 0.625,
"learning_rate": 3.87422029738653e-06,
"loss": 0.3352,
"mean_token_accuracy": 0.9394205138087273,
"num_tokens": 2430896.0,
"step": 105
},
{
"epoch": 0.6,
"eval_entropy": 0.8769993405789137,
"eval_loss": 0.29554080963134766,
"eval_mean_token_accuracy": 0.9284648544341326,
"eval_num_tokens": 2430896.0,
"eval_runtime": 92.2684,
"eval_samples_per_second": 4.335,
"eval_steps_per_second": 4.335,
"step": 105
},
{
"entropy": 0.7958486191928387,
"epoch": 0.6057142857142858,
"grad_norm": 0.55078125,
"learning_rate": 3.782230861445041e-06,
"loss": 0.1744,
"mean_token_accuracy": 0.9372597932815552,
"num_tokens": 2455348.0,
"step": 106
},
{
"entropy": 0.8819582648575306,
"epoch": 0.6114285714285714,
"grad_norm": 0.396484375,
"learning_rate": 3.6906775751959667e-06,
"loss": 0.2265,
"mean_token_accuracy": 0.94641899690032,
"num_tokens": 2477983.0,
"step": 107
},
{
"entropy": 0.8169359490275383,
"epoch": 0.6171428571428571,
"grad_norm": 0.24609375,
"learning_rate": 3.5995932288754655e-06,
"loss": 0.0609,
"mean_token_accuracy": 0.9687152951955795,
"num_tokens": 2507481.0,
"step": 108
},
{
"entropy": 0.8248496986925602,
"epoch": 0.6228571428571429,
"grad_norm": 0.376953125,
"learning_rate": 3.509010444766674e-06,
"loss": 0.1682,
"mean_token_accuracy": 0.9509099498391151,
"num_tokens": 2535270.0,
"step": 109
},
{
"entropy": 0.8315382190048695,
"epoch": 0.6285714285714286,
"grad_norm": 0.220703125,
"learning_rate": 3.4189616655158803e-06,
"loss": 0.0472,
"mean_token_accuracy": 0.9836984872817993,
"num_tokens": 2557838.0,
"step": 110
},
{
"entropy": 0.8726284876465797,
"epoch": 0.6342857142857142,
"grad_norm": 0.70703125,
"learning_rate": 3.3294791425130512e-06,
"loss": 0.4566,
"mean_token_accuracy": 0.928321436047554,
"num_tokens": 2578074.0,
"step": 111
},
{
"entropy": 0.8420686684548855,
"epoch": 0.64,
"grad_norm": 0.36328125,
"learning_rate": 3.240594924340835e-06,
"loss": 0.2126,
"mean_token_accuracy": 0.9412459097802639,
"num_tokens": 2602045.0,
"step": 112
},
{
"entropy": 0.8329183645546436,
"epoch": 0.6457142857142857,
"grad_norm": 0.466796875,
"learning_rate": 3.1523408452962156e-06,
"loss": 0.2633,
"mean_token_accuracy": 0.8766915369778872,
"num_tokens": 2627102.0,
"step": 113
},
{
"entropy": 0.9313436187803745,
"epoch": 0.6514285714285715,
"grad_norm": 0.90625,
"learning_rate": 3.0647485139889145e-06,
"loss": 0.6254,
"mean_token_accuracy": 0.9516336657106876,
"num_tokens": 2645394.0,
"step": 114
},
{
"entropy": 0.7338366992771626,
"epoch": 0.6571428571428571,
"grad_norm": 0.08203125,
"learning_rate": 2.9778493020206155e-06,
"loss": 0.0284,
"mean_token_accuracy": 0.9934831894934177,
"num_tokens": 2676753.0,
"step": 115
},
{
"entropy": 0.8697643727064133,
"epoch": 0.6628571428571428,
"grad_norm": 0.1796875,
"learning_rate": 2.89167433274908e-06,
"loss": 0.0259,
"mean_token_accuracy": 0.9898367673158646,
"num_tokens": 2699287.0,
"step": 116
},
{
"entropy": 0.9010032936930656,
"epoch": 0.6685714285714286,
"grad_norm": 0.380859375,
"learning_rate": 2.806254470141174e-06,
"loss": 0.0833,
"mean_token_accuracy": 0.9675994291901588,
"num_tokens": 2717961.0,
"step": 117
},
{
"entropy": 0.8322379067540169,
"epoch": 0.6742857142857143,
"grad_norm": 0.67578125,
"learning_rate": 2.721620307718793e-06,
"loss": 0.291,
"mean_token_accuracy": 0.9172481000423431,
"num_tokens": 2737566.0,
"step": 118
},
{
"entropy": 0.8995933551341295,
"epoch": 0.68,
"grad_norm": 0.294921875,
"learning_rate": 2.6378021576016467e-06,
"loss": 0.0553,
"mean_token_accuracy": 0.9801531247794628,
"num_tokens": 2757255.0,
"step": 119
},
{
"entropy": 0.9271344300359488,
"epoch": 0.6857142857142857,
"grad_norm": 0.408203125,
"learning_rate": 2.554830039650834e-06,
"loss": 0.1783,
"mean_token_accuracy": 0.9709099903702736,
"num_tokens": 2780854.0,
"step": 120
},
{
"entropy": 0.8354959785938263,
"epoch": 0.6914285714285714,
"grad_norm": 0.2294921875,
"learning_rate": 2.4727336707170973e-06,
"loss": 0.0792,
"mean_token_accuracy": 0.9483233764767647,
"num_tokens": 2798499.0,
"step": 121
},
{
"entropy": 0.8634845986962318,
"epoch": 0.6971428571428572,
"grad_norm": 0.58203125,
"learning_rate": 2.391542453997578e-06,
"loss": 0.3701,
"mean_token_accuracy": 0.92283009365201,
"num_tokens": 2819541.0,
"step": 122
},
{
"entropy": 0.86484663374722,
"epoch": 0.7028571428571428,
"grad_norm": 0.236328125,
"learning_rate": 2.3112854685049397e-06,
"loss": 0.0666,
"mean_token_accuracy": 0.9604465216398239,
"num_tokens": 2841267.0,
"step": 123
},
{
"entropy": 0.7959853485226631,
"epoch": 0.7085714285714285,
"grad_norm": 0.40625,
"learning_rate": 2.2319914586525776e-06,
"loss": 0.2689,
"mean_token_accuracy": 0.902481097728014,
"num_tokens": 2864290.0,
"step": 124
},
{
"entropy": 0.8018485866487026,
"epoch": 0.7142857142857143,
"grad_norm": 0.396484375,
"learning_rate": 2.1536888239596714e-06,
"loss": 0.1782,
"mean_token_accuracy": 0.9672268815338612,
"num_tokens": 2893566.0,
"step": 125
},
{
"entropy": 0.9180811122059822,
"epoch": 0.72,
"grad_norm": 0.333984375,
"learning_rate": 2.0764056088797646e-06,
"loss": 0.2034,
"mean_token_accuracy": 0.9149210341274738,
"num_tokens": 2915934.0,
"step": 126
},
{
"entropy": 0.791705853305757,
"epoch": 0.7257142857142858,
"grad_norm": 0.38671875,
"learning_rate": 2.000169492756523e-06,
"loss": 0.2103,
"mean_token_accuracy": 0.9592764638364315,
"num_tokens": 2938796.0,
"step": 127
},
{
"entropy": 0.8573960512876511,
"epoch": 0.7314285714285714,
"grad_norm": 0.4765625,
"learning_rate": 1.9250077799102323e-06,
"loss": 0.2499,
"mean_token_accuracy": 0.9304524399340153,
"num_tokens": 2959725.0,
"step": 128
},
{
"entropy": 0.7847526092082262,
"epoch": 0.7371428571428571,
"grad_norm": 0.4296875,
"learning_rate": 1.8509473898586432e-06,
"loss": 0.272,
"mean_token_accuracy": 0.9468899220228195,
"num_tokens": 2986539.0,
"step": 129
},
{
"entropy": 0.7972419206053019,
"epoch": 0.7428571428571429,
"grad_norm": 0.57421875,
"learning_rate": 1.7780148476756148e-06,
"loss": 0.2415,
"mean_token_accuracy": 0.9312585778534412,
"num_tokens": 3008033.0,
"step": 130
},
{
"entropy": 0.9854478649795055,
"epoch": 0.7485714285714286,
"grad_norm": 0.2109375,
"learning_rate": 1.7062362744910321e-06,
"loss": 0.0378,
"mean_token_accuracy": 0.9740675985813141,
"num_tokens": 3022847.0,
"step": 131
},
{
"entropy": 0.8525507673621178,
"epoch": 0.7542857142857143,
"grad_norm": 0.1787109375,
"learning_rate": 1.6356373781354058e-06,
"loss": 0.0312,
"mean_token_accuracy": 0.9881799481809139,
"num_tokens": 3044199.0,
"step": 132
},
{
"entropy": 0.8705133143812418,
"epoch": 0.76,
"grad_norm": 0.52734375,
"learning_rate": 1.566243443932496e-06,
"loss": 0.3131,
"mean_token_accuracy": 0.9179901443421841,
"num_tokens": 3066790.0,
"step": 133
},
{
"entropy": 0.9212304092943668,
"epoch": 0.7657142857142857,
"grad_norm": 0.69140625,
"learning_rate": 1.4980793256432474e-06,
"loss": 0.462,
"mean_token_accuracy": 0.9063639305531979,
"num_tokens": 3087500.0,
"step": 134
},
{
"entropy": 0.8802409656345844,
"epoch": 0.7714285714285715,
"grad_norm": 0.419921875,
"learning_rate": 1.4311694365643048e-06,
"loss": 0.146,
"mean_token_accuracy": 0.9382250271737576,
"num_tokens": 3107519.0,
"step": 135
},
{
"entropy": 0.9647825062274933,
"epoch": 0.7771428571428571,
"grad_norm": 0.97265625,
"learning_rate": 1.3655377407842813e-06,
"loss": 0.404,
"mean_token_accuracy": 0.9323740191757679,
"num_tokens": 3126461.0,
"step": 136
},
{
"entropy": 0.8492281846702099,
"epoch": 0.7828571428571428,
"grad_norm": 0.484375,
"learning_rate": 1.3012077446008969e-06,
"loss": 0.2494,
"mean_token_accuracy": 0.919997077435255,
"num_tokens": 3153010.0,
"step": 137
},
{
"entropy": 0.8203707411885262,
"epoch": 0.7885714285714286,
"grad_norm": 0.1865234375,
"learning_rate": 1.2382024881020937e-06,
"loss": 0.0568,
"mean_token_accuracy": 0.9940986521542072,
"num_tokens": 3181545.0,
"step": 138
},
{
"entropy": 0.8615991920232773,
"epoch": 0.7942857142857143,
"grad_norm": 0.291015625,
"learning_rate": 1.1765445369141276e-06,
"loss": 0.1005,
"mean_token_accuracy": 0.9564622417092323,
"num_tokens": 3207389.0,
"step": 139
},
{
"entropy": 0.9613388143479824,
"epoch": 0.8,
"grad_norm": 0.2734375,
"learning_rate": 1.1162559741195733e-06,
"loss": 0.032,
"mean_token_accuracy": 0.9898938909173012,
"num_tokens": 3227144.0,
"step": 140
},
{
"epoch": 0.8,
"eval_entropy": 0.8764541779458522,
"eval_loss": 0.2953108847141266,
"eval_mean_token_accuracy": 0.9284577775746584,
"eval_num_tokens": 3227144.0,
"eval_runtime": 91.8643,
"eval_samples_per_second": 4.354,
"eval_steps_per_second": 4.354,
"step": 140
},
{
"entropy": 0.9436263218522072,
"epoch": 0.8057142857142857,
"grad_norm": 0.453125,
"learning_rate": 1.057358392348171e-06,
"loss": 0.2514,
"mean_token_accuracy": 0.9310437515377998,
"num_tokens": 3247750.0,
"step": 141
},
{
"entropy": 0.8511663135141134,
"epoch": 0.8114285714285714,
"grad_norm": 0.330078125,
"learning_rate": 9.998728860433277e-07,
"loss": 0.1464,
"mean_token_accuracy": 0.9337452948093414,
"num_tokens": 3278158.0,
"step": 142
},
{
"entropy": 0.8985432125627995,
"epoch": 0.8171428571428572,
"grad_norm": 0.55078125,
"learning_rate": 9.438200439070388e-07,
"loss": 0.3484,
"mean_token_accuracy": 0.9249872528016567,
"num_tokens": 3297566.0,
"step": 143
},
{
"entropy": 0.8434502705931664,
"epoch": 0.8228571428571428,
"grad_norm": 0.1611328125,
"learning_rate": 8.892199415259501e-07,
"loss": 0.0588,
"mean_token_accuracy": 0.9789597801864147,
"num_tokens": 3321048.0,
"step": 144
},
{
"entropy": 0.7833346650004387,
"epoch": 0.8285714285714286,
"grad_norm": 0.58203125,
"learning_rate": 8.360921341811956e-07,
"loss": 0.2072,
"mean_token_accuracy": 0.9664384685456753,
"num_tokens": 3348746.0,
"step": 145
},
{
"entropy": 0.8700702637434006,
"epoch": 0.8342857142857143,
"grad_norm": 0.33203125,
"learning_rate": 7.844556498445788e-07,
"loss": 0.0734,
"mean_token_accuracy": 0.9684953950345516,
"num_tokens": 3375740.0,
"step": 146
},
{
"entropy": 0.7348683997988701,
"epoch": 0.84,
"grad_norm": 0.59765625,
"learning_rate": 7.343289823636168e-07,
"loss": 0.2837,
"mean_token_accuracy": 0.957360677421093,
"num_tokens": 3400641.0,
"step": 147
},
{
"entropy": 0.9618206657469273,
"epoch": 0.8457142857142858,
"grad_norm": 0.322265625,
"learning_rate": 6.857300848378857e-07,
"loss": 0.1192,
"mean_token_accuracy": 0.9487035945057869,
"num_tokens": 3419359.0,
"step": 148
},
{
"entropy": 0.7841342575848103,
"epoch": 0.8514285714285714,
"grad_norm": 0.5859375,
"learning_rate": 6.386763631890313e-07,
"loss": 0.2124,
"mean_token_accuracy": 0.9248572364449501,
"num_tokens": 3443856.0,
"step": 149
},
{
"entropy": 0.826301820576191,
"epoch": 0.8571428571428571,
"grad_norm": 0.22265625,
"learning_rate": 5.931846699267558e-07,
"loss": 0.0611,
"mean_token_accuracy": 0.9684226177632809,
"num_tokens": 3465048.0,
"step": 150
},
{
"entropy": 0.8140004500746727,
"epoch": 0.8628571428571429,
"grad_norm": 0.490234375,
"learning_rate": 5.492712981130171e-07,
"loss": 0.2893,
"mean_token_accuracy": 0.9164738897234201,
"num_tokens": 3488250.0,
"step": 151
},
{
"entropy": 0.9298283979296684,
"epoch": 0.8685714285714285,
"grad_norm": 0.431640625,
"learning_rate": 5.0695197552659e-07,
"loss": 0.203,
"mean_token_accuracy": 0.9512322805821896,
"num_tokens": 3507381.0,
"step": 152
},
{
"entropy": 0.9326702170073986,
"epoch": 0.8742857142857143,
"grad_norm": 0.3984375,
"learning_rate": 4.6624185903008713e-07,
"loss": 0.1791,
"mean_token_accuracy": 0.9534324109554291,
"num_tokens": 3526862.0,
"step": 153
},
{
"entropy": 0.884672824293375,
"epoch": 0.88,
"grad_norm": 0.265625,
"learning_rate": 4.271555291414636e-07,
"loss": 0.0939,
"mean_token_accuracy": 0.9811095856130123,
"num_tokens": 3548347.0,
"step": 154
},
{
"entropy": 0.9188402555882931,
"epoch": 0.8857142857142857,
"grad_norm": 0.435546875,
"learning_rate": 3.8970698481193225e-07,
"loss": 0.1395,
"mean_token_accuracy": 0.9461647681891918,
"num_tokens": 3576901.0,
"step": 155
},
{
"entropy": 0.8714124243706465,
"epoch": 0.8914285714285715,
"grad_norm": 0.361328125,
"learning_rate": 3.539096384121743e-07,
"loss": 0.1468,
"mean_token_accuracy": 0.9493271261453629,
"num_tokens": 3599612.0,
"step": 156
},
{
"entropy": 0.9496984779834747,
"epoch": 0.8971428571428571,
"grad_norm": 0.5390625,
"learning_rate": 3.1977631092863613e-07,
"loss": 0.2511,
"mean_token_accuracy": 0.9505422003567219,
"num_tokens": 3617034.0,
"step": 157
},
{
"entropy": 0.8597098160535097,
"epoch": 0.9028571428571428,
"grad_norm": 0.5546875,
"learning_rate": 2.873192273716369e-07,
"loss": 0.2373,
"mean_token_accuracy": 0.9237680397927761,
"num_tokens": 3638314.0,
"step": 158
},
{
"entropy": 0.9527708999812603,
"epoch": 0.9085714285714286,
"grad_norm": 0.50390625,
"learning_rate": 2.5655001239691836e-07,
"loss": 0.4676,
"mean_token_accuracy": 0.8877900540828705,
"num_tokens": 3657174.0,
"step": 159
},
{
"entropy": 0.8717995695769787,
"epoch": 0.9142857142857143,
"grad_norm": 0.30078125,
"learning_rate": 2.274796861422246e-07,
"loss": 0.1154,
"mean_token_accuracy": 0.9691611863672733,
"num_tokens": 3680533.0,
"step": 160
},
{
"entropy": 0.9644824899733067,
"epoch": 0.92,
"grad_norm": 0.490234375,
"learning_rate": 2.0011866028038617e-07,
"loss": 0.3064,
"mean_token_accuracy": 0.9448754377663136,
"num_tokens": 3699327.0,
"step": 161
},
{
"entropy": 0.9328950606286526,
"epoch": 0.9257142857142857,
"grad_norm": 0.451171875,
"learning_rate": 1.7447673429033361e-07,
"loss": 0.2076,
"mean_token_accuracy": 0.9191295467317104,
"num_tokens": 3715091.0,
"step": 162
},
{
"entropy": 0.8879067096859217,
"epoch": 0.9314285714285714,
"grad_norm": 0.337890625,
"learning_rate": 1.5056309194736385e-07,
"loss": 0.1653,
"mean_token_accuracy": 0.9486363902688026,
"num_tokens": 3743127.0,
"step": 163
},
{
"entropy": 0.894222728908062,
"epoch": 0.9371428571428572,
"grad_norm": 0.359375,
"learning_rate": 1.2838629803393343e-07,
"loss": 0.1275,
"mean_token_accuracy": 0.946167778223753,
"num_tokens": 3762752.0,
"step": 164
},
{
"entropy": 0.9304006136953831,
"epoch": 0.9428571428571428,
"grad_norm": 0.5859375,
"learning_rate": 1.0795429527213685e-07,
"loss": 0.3773,
"mean_token_accuracy": 0.9494738765060902,
"num_tokens": 3782981.0,
"step": 165
},
{
"entropy": 0.8676423355937004,
"epoch": 0.9485714285714286,
"grad_norm": 0.32421875,
"learning_rate": 8.927440147898703e-08,
"loss": 0.1509,
"mean_token_accuracy": 0.9403471313416958,
"num_tokens": 3806706.0,
"step": 166
},
{
"entropy": 0.9638898521661758,
"epoch": 0.9542857142857143,
"grad_norm": 0.470703125,
"learning_rate": 7.235330694550402e-08,
"loss": 0.1,
"mean_token_accuracy": 0.9673289954662323,
"num_tokens": 3825999.0,
"step": 167
},
{
"entropy": 0.8009177055209875,
"epoch": 0.96,
"grad_norm": 0.2109375,
"learning_rate": 5.7197072040557356e-08,
"loss": 0.0312,
"mean_token_accuracy": 0.9841561615467072,
"num_tokens": 3848460.0,
"step": 168
},
{
"entropy": 0.8380727805197239,
"epoch": 0.9657142857142857,
"grad_norm": 0.466796875,
"learning_rate": 4.381112504031337e-08,
"loss": 0.2418,
"mean_token_accuracy": 0.933722235262394,
"num_tokens": 3872166.0,
"step": 169
},
{
"entropy": 0.941684365272522,
"epoch": 0.9714285714285714,
"grad_norm": 0.45703125,
"learning_rate": 3.220026018407541e-08,
"loss": 0.1822,
"mean_token_accuracy": 0.9650504402816296,
"num_tokens": 3890730.0,
"step": 170
},
{
"entropy": 0.9139348827302456,
"epoch": 0.9771428571428571,
"grad_norm": 0.7890625,
"learning_rate": 2.236863595720562e-08,
"loss": 0.3801,
"mean_token_accuracy": 0.9626536183059216,
"num_tokens": 3913632.0,
"step": 171
},
{
"entropy": 0.8308483064174652,
"epoch": 0.9828571428571429,
"grad_norm": 0.3203125,
"learning_rate": 1.431977360173975e-08,
"loss": 0.1153,
"mean_token_accuracy": 0.9826219528913498,
"num_tokens": 3941084.0,
"step": 172
},
{
"entropy": 0.8064244762063026,
"epoch": 0.9885714285714285,
"grad_norm": 0.41796875,
"learning_rate": 8.056555855243675e-09,
"loss": 0.1146,
"mean_token_accuracy": 0.9666525050997734,
"num_tokens": 3966629.0,
"step": 173
},
{
"entropy": 0.8301513195037842,
"epoch": 0.9942857142857143,
"grad_norm": 0.65234375,
"learning_rate": 3.5812259183426457e-09,
"loss": 0.499,
"mean_token_accuracy": 0.8793967552483082,
"num_tokens": 3990275.0,
"step": 174
},
{
"entropy": 0.9384108036756516,
"epoch": 1.0,
"grad_norm": 0.322265625,
"learning_rate": 8.953866513111698e-10,
"loss": 0.193,
"mean_token_accuracy": 0.9713231772184372,
"num_tokens": 4009115.0,
"step": 175
},
{
"epoch": 1.0,
"eval_entropy": 0.8765361993014813,
"eval_loss": 0.2955912947654724,
"eval_mean_token_accuracy": 0.9287241496890783,
"eval_num_tokens": 4009115.0,
"eval_runtime": 91.0144,
"eval_samples_per_second": 4.395,
"eval_steps_per_second": 4.395,
"step": 175
},
{
"epoch": 1.0,
"step": 175,
"total_flos": 1.8415547714724864e+17,
"train_loss": 0.2099171816344772,
"train_runtime": 2968.5511,
"train_samples_per_second": 0.943,
"train_steps_per_second": 0.059
}
],
"trial_params": null,
"global_step": 175,
"is_local_process_zero": true,
"total_flos": 1.8415547714724864e+17,
"num_train_epochs": 1,
"epoch": 1.0,
"best_metric": null,
"trial_name": null
}