{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 6911, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "ce_loss": 2.031, "epoch": 0.0014469947727313835, "grad_norm": 29.5, "hf_loss_ratio": 1.0, "learning_rate": 1.298076923076923e-06, "loss": 2.031, "mean_token_accuracy": 0.7030675932765007, "num_tokens": 741730.0, "step": 10, "train_ppl": 7.621345 }, { "ce_loss": 2.091, "epoch": 0.002893989545462767, "grad_norm": 27.0, "hf_loss_ratio": 1.0, "learning_rate": 2.7403846153846155e-06, "loss": 2.091, "mean_token_accuracy": 0.6888238519430161, "num_tokens": 1459999.0, "step": 20, "train_ppl": 8.093004 }, { "ce_loss": 1.9679, "epoch": 0.004340984318194151, "grad_norm": 25.75, "hf_loss_ratio": 1.0, "learning_rate": 4.182692307692308e-06, "loss": 1.9679, "mean_token_accuracy": 0.6994533620774745, "num_tokens": 2205386.0, "step": 30, "train_ppl": 7.155398 }, { "ce_loss": 1.6513, "epoch": 0.005787979090925534, "grad_norm": 12.4375, "hf_loss_ratio": 1.0, "learning_rate": 5.625e-06, "loss": 1.6513, "mean_token_accuracy": 0.7152167946100235, "num_tokens": 2952129.0, "step": 40, "train_ppl": 5.21397 }, { "ce_loss": 1.5017, "epoch": 0.007234973863656917, "grad_norm": 8.3125, "hf_loss_ratio": 1.0, "learning_rate": 7.067307692307692e-06, "loss": 1.5017, "mean_token_accuracy": 0.7155109643936157, "num_tokens": 3667912.0, "step": 50, "train_ppl": 4.489093 }, { "ce_loss": 1.3397, "epoch": 0.008681968636388301, "grad_norm": 3.328125, "hf_loss_ratio": 1.0, "learning_rate": 8.509615384615384e-06, "loss": 1.3397, "mean_token_accuracy": 0.7240443922579288, "num_tokens": 4427526.0, "step": 60, "train_ppl": 3.817909 }, { "ce_loss": 1.2534, "epoch": 0.010128963409119684, "grad_norm": 3.609375, "hf_loss_ratio": 1.0, "learning_rate": 9.951923076923077e-06, "loss": 1.2534, "mean_token_accuracy": 0.7320300832390785, "num_tokens": 5160176.0, "step": 70, "train_ppl": 3.502394 }, { "ce_loss": 1.1852, "epoch": 0.011575958181851068, "grad_norm": 4.0625, "hf_loss_ratio": 1.0, "learning_rate": 1.139423076923077e-05, "loss": 1.1852, "mean_token_accuracy": 0.7428010664880276, "num_tokens": 5911569.0, "step": 80, "train_ppl": 3.27122 }, { "ce_loss": 1.131, "epoch": 0.013022952954582452, "grad_norm": 1.296875, "hf_loss_ratio": 1.0, "learning_rate": 1.2836538461538462e-05, "loss": 1.131, "mean_token_accuracy": 0.7550130240619183, "num_tokens": 6689615.0, "step": 90, "train_ppl": 3.098752 }, { "ce_loss": 1.1475, "epoch": 0.014469947727313835, "grad_norm": 1.1015625, "hf_loss_ratio": 1.0, "learning_rate": 1.4278846153846154e-05, "loss": 1.1475, "mean_token_accuracy": 0.7511672869324684, "num_tokens": 7426028.0, "step": 100, "train_ppl": 3.150303 }, { "ce_loss": 1.107, "epoch": 0.015916942500045217, "grad_norm": 1.1328125, "hf_loss_ratio": 1.0, "learning_rate": 1.5721153846153848e-05, "loss": 1.107, "mean_token_accuracy": 0.761037639528513, "num_tokens": 8168535.0, "step": 110, "train_ppl": 3.025315 }, { "ce_loss": 1.155, "epoch": 0.017363937272776603, "grad_norm": 1.078125, "hf_loss_ratio": 1.0, "learning_rate": 1.7163461538461537e-05, "loss": 1.155, "mean_token_accuracy": 0.7489694423973561, "num_tokens": 8913465.0, "step": 120, "train_ppl": 3.174086 }, { "ce_loss": 1.1527, "epoch": 0.018810932045507985, "grad_norm": 1.203125, "hf_loss_ratio": 1.0, "learning_rate": 1.8605769230769233e-05, "loss": 1.1527, "mean_token_accuracy": 0.7528368845582009, "num_tokens": 9631331.0, "step": 130, "train_ppl": 3.166877 }, { "ce_loss": 1.0897, "epoch": 0.020257926818239368, "grad_norm": 1.2578125, "hf_loss_ratio": 1.0, "learning_rate": 2.0048076923076922e-05, "loss": 1.0897, "mean_token_accuracy": 0.7576698914170266, "num_tokens": 10387986.0, "step": 140, "train_ppl": 2.973338 }, { "ce_loss": 1.0838, "epoch": 0.021704921590970754, "grad_norm": 0.99609375, "hf_loss_ratio": 1.0, "learning_rate": 2.1490384615384615e-05, "loss": 1.0838, "mean_token_accuracy": 0.7615541353821754, "num_tokens": 11156736.0, "step": 150, "train_ppl": 2.955747 }, { "ce_loss": 1.1045, "epoch": 0.023151916363702136, "grad_norm": 1.25, "hf_loss_ratio": 1.0, "learning_rate": 2.2932692307692307e-05, "loss": 1.1045, "mean_token_accuracy": 0.7566463962197304, "num_tokens": 11873395.0, "step": 160, "train_ppl": 3.017859 }, { "ce_loss": 1.0972, "epoch": 0.02459891113643352, "grad_norm": 1.125, "hf_loss_ratio": 1.0, "learning_rate": 2.4375e-05, "loss": 1.0972, "mean_token_accuracy": 0.7590832710266113, "num_tokens": 12608710.0, "step": 170, "train_ppl": 2.995746 }, { "ce_loss": 1.0663, "epoch": 0.026045905909164904, "grad_norm": 1.2734375, "hf_loss_ratio": 1.0, "learning_rate": 2.5817307692307695e-05, "loss": 1.0663, "mean_token_accuracy": 0.7631561934947968, "num_tokens": 13355138.0, "step": 180, "train_ppl": 2.904723 }, { "ce_loss": 1.0532, "epoch": 0.027492900681896287, "grad_norm": 1.1015625, "hf_loss_ratio": 1.0, "learning_rate": 2.7259615384615384e-05, "loss": 1.0532, "mean_token_accuracy": 0.7637556858360768, "num_tokens": 14107781.0, "step": 190, "train_ppl": 2.866803 }, { "ce_loss": 1.0673, "epoch": 0.02893989545462767, "grad_norm": 1.2421875, "hf_loss_ratio": 1.0, "learning_rate": 2.870192307692308e-05, "loss": 1.0673, "mean_token_accuracy": 0.7635537907481194, "num_tokens": 14852277.0, "step": 200, "train_ppl": 2.90758 }, { "ce_loss": 1.0755, "epoch": 0.030386890227359055, "grad_norm": 1.2421875, "hf_loss_ratio": 1.0, "learning_rate": 2.9995524392063257e-05, "loss": 1.0755, "mean_token_accuracy": 0.7621265381574631, "num_tokens": 15546431.0, "step": 210, "train_ppl": 2.93156 }, { "ce_loss": 1.125, "epoch": 0.031833885000090434, "grad_norm": 1.03125, "hf_loss_ratio": 1.0, "learning_rate": 2.9950768312695806e-05, "loss": 1.125, "mean_token_accuracy": 0.7530753210186958, "num_tokens": 16272344.0, "step": 220, "train_ppl": 3.080183 }, { "ce_loss": 1.0847, "epoch": 0.03328087977282182, "grad_norm": 1.375, "hf_loss_ratio": 1.0, "learning_rate": 2.9906012233328362e-05, "loss": 1.0847, "mean_token_accuracy": 0.7561856605112552, "num_tokens": 17017303.0, "step": 230, "train_ppl": 2.958519 }, { "ce_loss": 1.0307, "epoch": 0.034727874545553206, "grad_norm": 1.140625, "hf_loss_ratio": 1.0, "learning_rate": 2.9861256153960914e-05, "loss": 1.0307, "mean_token_accuracy": 0.7656997129321098, "num_tokens": 17774573.0, "step": 240, "train_ppl": 2.803042 }, { "ce_loss": 1.0565, "epoch": 0.036174869318284585, "grad_norm": 1.15625, "hf_loss_ratio": 1.0, "learning_rate": 2.9816500074593467e-05, "loss": 1.0565, "mean_token_accuracy": 0.7623364008963108, "num_tokens": 18506619.0, "step": 250, "train_ppl": 2.876351 }, { "ce_loss": 1.047, "epoch": 0.03762186409101597, "grad_norm": 1.3828125, "hf_loss_ratio": 1.0, "learning_rate": 2.977174399522602e-05, "loss": 1.047, "mean_token_accuracy": 0.7634409129619598, "num_tokens": 19281733.0, "step": 260, "train_ppl": 2.84913 }, { "ce_loss": 1.0546, "epoch": 0.039068858863747356, "grad_norm": 1.0390625, "hf_loss_ratio": 1.0, "learning_rate": 2.9726987915858572e-05, "loss": 1.0546, "mean_token_accuracy": 0.7609510987997055, "num_tokens": 19987179.0, "step": 270, "train_ppl": 2.870774 }, { "ce_loss": 1.0431, "epoch": 0.040515853636478735, "grad_norm": 0.99609375, "hf_loss_ratio": 1.0, "learning_rate": 2.9682231836491124e-05, "loss": 1.0431, "mean_token_accuracy": 0.7634642273187637, "num_tokens": 20745404.0, "step": 280, "train_ppl": 2.838059 }, { "ce_loss": 1.0446, "epoch": 0.04196284840921012, "grad_norm": 1.203125, "hf_loss_ratio": 1.0, "learning_rate": 2.9637475757123677e-05, "loss": 1.0446, "mean_token_accuracy": 0.7675992861390114, "num_tokens": 21490797.0, "step": 290, "train_ppl": 2.842357 }, { "ce_loss": 1.0772, "epoch": 0.04340984318194151, "grad_norm": 1.125, "hf_loss_ratio": 1.0, "learning_rate": 2.959271967775623e-05, "loss": 1.0772, "mean_token_accuracy": 0.7634236924350262, "num_tokens": 22209441.0, "step": 300, "train_ppl": 2.936523 }, { "ce_loss": 1.0581, "epoch": 0.044856837954672886, "grad_norm": 1.203125, "hf_loss_ratio": 1.0, "learning_rate": 2.954796359838878e-05, "loss": 1.0581, "mean_token_accuracy": 0.7604357182979584, "num_tokens": 22924851.0, "step": 310, "train_ppl": 2.880844 }, { "ce_loss": 1.0396, "epoch": 0.04630383272740427, "grad_norm": 1.125, "hf_loss_ratio": 1.0, "learning_rate": 2.9503207519021337e-05, "loss": 1.0396, "mean_token_accuracy": 0.7631719268858432, "num_tokens": 23660815.0, "step": 320, "train_ppl": 2.828141 }, { "ce_loss": 1.0448, "epoch": 0.04775082750013566, "grad_norm": 1.015625, "hf_loss_ratio": 1.0, "learning_rate": 2.9458451439653886e-05, "loss": 1.0448, "mean_token_accuracy": 0.7706776842474937, "num_tokens": 24378060.0, "step": 330, "train_ppl": 2.842827 }, { "ce_loss": 1.0389, "epoch": 0.04919782227286704, "grad_norm": 1.03125, "hf_loss_ratio": 1.0, "learning_rate": 2.941369536028644e-05, "loss": 1.0389, "mean_token_accuracy": 0.7651800148189067, "num_tokens": 25130726.0, "step": 340, "train_ppl": 2.826159 }, { "ce_loss": 1.0548, "epoch": 0.05064481704559842, "grad_norm": 0.96484375, "hf_loss_ratio": 1.0, "learning_rate": 2.9368939280918995e-05, "loss": 1.0548, "mean_token_accuracy": 0.7646659754216671, "num_tokens": 25862673.0, "step": 350, "train_ppl": 2.871468 }, { "ce_loss": 1.0698, "epoch": 0.05209181181832981, "grad_norm": 1.1484375, "hf_loss_ratio": 1.0, "learning_rate": 2.9324183201551544e-05, "loss": 1.0698, "mean_token_accuracy": 0.763071033358574, "num_tokens": 26609121.0, "step": 360, "train_ppl": 2.914941 }, { "ce_loss": 1.0739, "epoch": 0.05353880659106119, "grad_norm": 1.3125, "hf_loss_ratio": 1.0, "learning_rate": 2.92794271221841e-05, "loss": 1.0739, "mean_token_accuracy": 0.759658782184124, "num_tokens": 27343011.0, "step": 370, "train_ppl": 2.926805 }, { "ce_loss": 1.0897, "epoch": 0.05498580136379257, "grad_norm": 1.09375, "hf_loss_ratio": 1.0, "learning_rate": 2.923467104281665e-05, "loss": 1.0897, "mean_token_accuracy": 0.7550988748669625, "num_tokens": 28067081.0, "step": 380, "train_ppl": 2.973326 }, { "ce_loss": 1.0626, "epoch": 0.05643279613652396, "grad_norm": 1.203125, "hf_loss_ratio": 1.0, "learning_rate": 2.91899149634492e-05, "loss": 1.0626, "mean_token_accuracy": 0.757635698467493, "num_tokens": 28798187.0, "step": 390, "train_ppl": 2.893869 }, { "ce_loss": 1.036, "epoch": 0.05787979090925534, "grad_norm": 1.0546875, "hf_loss_ratio": 1.0, "learning_rate": 2.9145158884081757e-05, "loss": 1.036, "mean_token_accuracy": 0.7649780534207821, "num_tokens": 29531903.0, "step": 400, "train_ppl": 2.817834 }, { "ce_loss": 1.0533, "epoch": 0.059326785681986724, "grad_norm": 0.94140625, "hf_loss_ratio": 1.0, "learning_rate": 2.9100402804714306e-05, "loss": 1.0533, "mean_token_accuracy": 0.760666860640049, "num_tokens": 30241613.0, "step": 410, "train_ppl": 2.867077 }, { "ce_loss": 0.9798, "epoch": 0.06077378045471811, "grad_norm": 1.1484375, "hf_loss_ratio": 1.0, "learning_rate": 2.9055646725346862e-05, "loss": 0.9798, "mean_token_accuracy": 0.7770380131900311, "num_tokens": 31009377.0, "step": 420, "train_ppl": 2.663858 }, { "ce_loss": 1.0212, "epoch": 0.06222077522744949, "grad_norm": 1.1953125, "hf_loss_ratio": 1.0, "learning_rate": 2.9010890645979414e-05, "loss": 1.0212, "mean_token_accuracy": 0.7705600343644619, "num_tokens": 31733086.0, "step": 430, "train_ppl": 2.77655 }, { "ce_loss": 1.0513, "epoch": 0.06366777000018087, "grad_norm": 1.125, "hf_loss_ratio": 1.0, "learning_rate": 2.8966134566611963e-05, "loss": 1.0513, "mean_token_accuracy": 0.7623658269643784, "num_tokens": 32494212.0, "step": 440, "train_ppl": 2.861398 }, { "ce_loss": 1.0261, "epoch": 0.06511476477291225, "grad_norm": 0.99609375, "hf_loss_ratio": 1.0, "learning_rate": 2.892137848724452e-05, "loss": 1.0261, "mean_token_accuracy": 0.766685140132904, "num_tokens": 33249862.0, "step": 450, "train_ppl": 2.790203 }, { "ce_loss": 1.0145, "epoch": 0.06656175954564364, "grad_norm": 1.28125, "hf_loss_ratio": 1.0, "learning_rate": 2.8876622407877068e-05, "loss": 1.0145, "mean_token_accuracy": 0.7710323743522167, "num_tokens": 33978600.0, "step": 460, "train_ppl": 2.757857 }, { "ce_loss": 1.0187, "epoch": 0.06800875431837503, "grad_norm": 1.171875, "hf_loss_ratio": 1.0, "learning_rate": 2.8831866328509624e-05, "loss": 1.0187, "mean_token_accuracy": 0.7671968981623649, "num_tokens": 34723642.0, "step": 470, "train_ppl": 2.76952 }, { "ce_loss": 1.0289, "epoch": 0.06945574909110641, "grad_norm": 1.078125, "hf_loss_ratio": 1.0, "learning_rate": 2.8787110249142176e-05, "loss": 1.0289, "mean_token_accuracy": 0.7625186502933502, "num_tokens": 35439133.0, "step": 480, "train_ppl": 2.797885 }, { "ce_loss": 1.0018, "epoch": 0.0709027438638378, "grad_norm": 0.9609375, "hf_loss_ratio": 1.0, "learning_rate": 2.8742354169774726e-05, "loss": 1.0018, "mean_token_accuracy": 0.7706348761916161, "num_tokens": 36184470.0, "step": 490, "train_ppl": 2.723119 }, { "ce_loss": 1.023, "epoch": 0.07234973863656917, "grad_norm": 1.1484375, "hf_loss_ratio": 1.0, "learning_rate": 2.869759809040728e-05, "loss": 1.023, "mean_token_accuracy": 0.7653927527368068, "num_tokens": 36919930.0, "step": 500, "train_ppl": 2.781612 }, { "ce_loss": 1.0274, "epoch": 0.07379673340930056, "grad_norm": 1.1015625, "hf_loss_ratio": 1.0, "learning_rate": 2.8652842011039834e-05, "loss": 1.0274, "mean_token_accuracy": 0.7650810860097408, "num_tokens": 37645758.0, "step": 510, "train_ppl": 2.793777 }, { "ce_loss": 1.0478, "epoch": 0.07524372818203194, "grad_norm": 1.1328125, "hf_loss_ratio": 1.0, "learning_rate": 2.8608085931672386e-05, "loss": 1.0478, "mean_token_accuracy": 0.7612765856087208, "num_tokens": 38363698.0, "step": 520, "train_ppl": 2.85138 }, { "ce_loss": 1.0149, "epoch": 0.07669072295476333, "grad_norm": 0.96875, "hf_loss_ratio": 1.0, "learning_rate": 2.856332985230494e-05, "loss": 1.0149, "mean_token_accuracy": 0.7682214416563511, "num_tokens": 39095412.0, "step": 530, "train_ppl": 2.759008 }, { "ce_loss": 1.0218, "epoch": 0.07813771772749471, "grad_norm": 1.0, "hf_loss_ratio": 1.0, "learning_rate": 2.8518573772937495e-05, "loss": 1.0218, "mean_token_accuracy": 0.7704101949930191, "num_tokens": 39877031.0, "step": 540, "train_ppl": 2.778117 }, { "ce_loss": 1.0751, "epoch": 0.0795847125002261, "grad_norm": 1.171875, "hf_loss_ratio": 1.0, "learning_rate": 2.8473817693570044e-05, "loss": 1.0751, "mean_token_accuracy": 0.7600487649440766, "num_tokens": 40593628.0, "step": 550, "train_ppl": 2.930418 }, { "ce_loss": 0.9919, "epoch": 0.08103170727295747, "grad_norm": 0.9609375, "hf_loss_ratio": 1.0, "learning_rate": 2.8429061614202596e-05, "loss": 0.9919, "mean_token_accuracy": 0.7756079971790314, "num_tokens": 41350737.0, "step": 560, "train_ppl": 2.696299 }, { "ce_loss": 1.0013, "epoch": 0.08247870204568886, "grad_norm": 1.1015625, "hf_loss_ratio": 1.0, "learning_rate": 2.838430553483515e-05, "loss": 1.0013, "mean_token_accuracy": 0.768417052924633, "num_tokens": 42091923.0, "step": 570, "train_ppl": 2.721766 }, { "ce_loss": 1.0212, "epoch": 0.08392569681842024, "grad_norm": 1.0390625, "hf_loss_ratio": 1.0, "learning_rate": 2.83395494554677e-05, "loss": 1.0212, "mean_token_accuracy": 0.7705964192748069, "num_tokens": 42843505.0, "step": 580, "train_ppl": 2.776561 }, { "ce_loss": 0.9852, "epoch": 0.08537269159115163, "grad_norm": 0.98828125, "hf_loss_ratio": 1.0, "learning_rate": 2.8294793376100257e-05, "loss": 0.9852, "mean_token_accuracy": 0.7744002252817154, "num_tokens": 43582786.0, "step": 590, "train_ppl": 2.678277 }, { "ce_loss": 1.0398, "epoch": 0.08681968636388301, "grad_norm": 1.0625, "hf_loss_ratio": 1.0, "learning_rate": 2.8250037296732806e-05, "loss": 1.0398, "mean_token_accuracy": 0.7641379170119762, "num_tokens": 44305457.0, "step": 600, "train_ppl": 2.828777 }, { "ce_loss": 1.0506, "epoch": 0.0882666811366144, "grad_norm": 0.96875, "hf_loss_ratio": 1.0, "learning_rate": 2.8205281217365358e-05, "loss": 1.0506, "mean_token_accuracy": 0.7625304482877254, "num_tokens": 45041194.0, "step": 610, "train_ppl": 2.859436 }, { "ce_loss": 1.0399, "epoch": 0.08971367590934577, "grad_norm": 1.0234375, "hf_loss_ratio": 1.0, "learning_rate": 2.8160525137997914e-05, "loss": 1.0399, "mean_token_accuracy": 0.7632023870944977, "num_tokens": 45759428.0, "step": 620, "train_ppl": 2.828851 }, { "ce_loss": 0.9818, "epoch": 0.09116067068207716, "grad_norm": 1.015625, "hf_loss_ratio": 1.0, "learning_rate": 2.8115769058630463e-05, "loss": 0.9818, "mean_token_accuracy": 0.7739991441369056, "num_tokens": 46539074.0, "step": 630, "train_ppl": 2.669149 }, { "ce_loss": 1.0629, "epoch": 0.09260766545480854, "grad_norm": 1.3671875, "hf_loss_ratio": 1.0, "learning_rate": 2.807101297926302e-05, "loss": 1.0629, "mean_token_accuracy": 0.7601286731660366, "num_tokens": 47260819.0, "step": 640, "train_ppl": 2.894784 }, { "ce_loss": 1.0038, "epoch": 0.09405466022753993, "grad_norm": 1.109375, "hf_loss_ratio": 1.0, "learning_rate": 2.802625689989557e-05, "loss": 1.0038, "mean_token_accuracy": 0.77047905549407, "num_tokens": 48047185.0, "step": 650, "train_ppl": 2.728604 }, { "ce_loss": 0.9987, "epoch": 0.09550165500027132, "grad_norm": 1.03125, "hf_loss_ratio": 1.0, "learning_rate": 2.798150082052812e-05, "loss": 0.9987, "mean_token_accuracy": 0.7709697797894478, "num_tokens": 48790335.0, "step": 660, "train_ppl": 2.714848 }, { "ce_loss": 1.0216, "epoch": 0.0969486497730027, "grad_norm": 1.0078125, "hf_loss_ratio": 1.0, "learning_rate": 2.7936744741160676e-05, "loss": 1.0216, "mean_token_accuracy": 0.7681831575930118, "num_tokens": 49512949.0, "step": 670, "train_ppl": 2.777644 }, { "ce_loss": 1.0012, "epoch": 0.09839564454573407, "grad_norm": 1.15625, "hf_loss_ratio": 1.0, "learning_rate": 2.7891988661793225e-05, "loss": 1.0012, "mean_token_accuracy": 0.7718318410217762, "num_tokens": 50255708.0, "step": 680, "train_ppl": 2.721635 }, { "ce_loss": 1.0218, "epoch": 0.09984263931846546, "grad_norm": 1.0234375, "hf_loss_ratio": 1.0, "learning_rate": 2.784723258242578e-05, "loss": 1.0218, "mean_token_accuracy": 0.7731546863913537, "num_tokens": 51030898.0, "step": 690, "train_ppl": 2.778237 }, { "ce_loss": 1.0546, "epoch": 0.10128963409119685, "grad_norm": 1.0078125, "hf_loss_ratio": 1.0, "learning_rate": 2.7802476503058334e-05, "loss": 1.0546, "mean_token_accuracy": 0.7618527382612228, "num_tokens": 51766323.0, "step": 700, "train_ppl": 2.870824 }, { "ce_loss": 1.0146, "epoch": 0.10273662886392823, "grad_norm": 1.2109375, "hf_loss_ratio": 1.0, "learning_rate": 2.7757720423690883e-05, "loss": 1.0146, "mean_token_accuracy": 0.7683967478573323, "num_tokens": 52478018.0, "step": 710, "train_ppl": 2.758134 }, { "ce_loss": 0.9898, "epoch": 0.10418362363665962, "grad_norm": 1.2578125, "hf_loss_ratio": 1.0, "learning_rate": 2.771296434432344e-05, "loss": 0.9898, "mean_token_accuracy": 0.7749556273221969, "num_tokens": 53197381.0, "step": 720, "train_ppl": 2.690634 }, { "ce_loss": 1.0148, "epoch": 0.105630618409391, "grad_norm": 1.3828125, "hf_loss_ratio": 1.0, "learning_rate": 2.766820826495599e-05, "loss": 1.0148, "mean_token_accuracy": 0.7660286217927933, "num_tokens": 53959271.0, "step": 730, "train_ppl": 2.758879 }, { "ce_loss": 0.9988, "epoch": 0.10707761318212237, "grad_norm": 1.2890625, "hf_loss_ratio": 1.0, "learning_rate": 2.7623452185588543e-05, "loss": 0.9988, "mean_token_accuracy": 0.7756357662379741, "num_tokens": 54734873.0, "step": 740, "train_ppl": 2.715152 }, { "ce_loss": 0.9886, "epoch": 0.10852460795485376, "grad_norm": 1.25, "hf_loss_ratio": 1.0, "learning_rate": 2.7578696106221096e-05, "loss": 0.9886, "mean_token_accuracy": 0.7769335299730301, "num_tokens": 55488727.0, "step": 750, "train_ppl": 2.687502 }, { "ce_loss": 1.0076, "epoch": 0.10997160272758515, "grad_norm": 0.9296875, "hf_loss_ratio": 1.0, "learning_rate": 2.753394002685365e-05, "loss": 1.0076, "mean_token_accuracy": 0.7681085780262947, "num_tokens": 56208627.0, "step": 760, "train_ppl": 2.739055 }, { "ce_loss": 0.9727, "epoch": 0.11141859750031653, "grad_norm": 1.375, "hf_loss_ratio": 1.0, "learning_rate": 2.74891839474862e-05, "loss": 0.9727, "mean_token_accuracy": 0.7748353876173496, "num_tokens": 56980088.0, "step": 770, "train_ppl": 2.645072 }, { "ce_loss": 0.9921, "epoch": 0.11286559227304792, "grad_norm": 0.9609375, "hf_loss_ratio": 1.0, "learning_rate": 2.7444427868118753e-05, "loss": 0.9921, "mean_token_accuracy": 0.7719174005091191, "num_tokens": 57698460.0, "step": 780, "train_ppl": 2.697013 }, { "ce_loss": 1.0101, "epoch": 0.11431258704577929, "grad_norm": 0.98828125, "hf_loss_ratio": 1.0, "learning_rate": 2.7399671788751306e-05, "loss": 1.0101, "mean_token_accuracy": 0.7697246864438057, "num_tokens": 58420421.0, "step": 790, "train_ppl": 2.74584 }, { "ce_loss": 1.0296, "epoch": 0.11575958181851068, "grad_norm": 1.0, "hf_loss_ratio": 1.0, "learning_rate": 2.7354915709383858e-05, "loss": 1.0296, "mean_token_accuracy": 0.7663743153214455, "num_tokens": 59148535.0, "step": 800, "train_ppl": 2.80003 }, { "ce_loss": 0.9826, "epoch": 0.11720657659124206, "grad_norm": 1.1953125, "hf_loss_ratio": 1.0, "learning_rate": 2.7310159630016414e-05, "loss": 0.9826, "mean_token_accuracy": 0.7738265834748745, "num_tokens": 59886300.0, "step": 810, "train_ppl": 2.67137 }, { "ce_loss": 0.9979, "epoch": 0.11865357136397345, "grad_norm": 0.953125, "hf_loss_ratio": 1.0, "learning_rate": 2.7265403550648963e-05, "loss": 0.9979, "mean_token_accuracy": 0.7731278233230114, "num_tokens": 60616165.0, "step": 820, "train_ppl": 2.712621 }, { "ce_loss": 1.001, "epoch": 0.12010056613670483, "grad_norm": 1.09375, "hf_loss_ratio": 1.0, "learning_rate": 2.7220647471281515e-05, "loss": 1.001, "mean_token_accuracy": 0.7734205923974514, "num_tokens": 61333780.0, "step": 830, "train_ppl": 2.720872 }, { "ce_loss": 0.9622, "epoch": 0.12154756090943622, "grad_norm": 0.96875, "hf_loss_ratio": 1.0, "learning_rate": 2.717589139191407e-05, "loss": 0.9622, "mean_token_accuracy": 0.7805940173566341, "num_tokens": 62084399.0, "step": 840, "train_ppl": 2.617573 }, { "ce_loss": 1.0292, "epoch": 0.12299455568216759, "grad_norm": 1.0546875, "hf_loss_ratio": 1.0, "learning_rate": 2.713113531254662e-05, "loss": 1.0292, "mean_token_accuracy": 0.7698862083256245, "num_tokens": 62786252.0, "step": 850, "train_ppl": 2.798803 }, { "ce_loss": 0.9863, "epoch": 0.12444155045489898, "grad_norm": 0.94921875, "hf_loss_ratio": 1.0, "learning_rate": 2.7086379233179176e-05, "loss": 0.9863, "mean_token_accuracy": 0.7744859166443347, "num_tokens": 63552303.0, "step": 860, "train_ppl": 2.681383 }, { "ce_loss": 1.0463, "epoch": 0.12588854522763038, "grad_norm": 1.109375, "hf_loss_ratio": 1.0, "learning_rate": 2.7041623153811725e-05, "loss": 1.0463, "mean_token_accuracy": 0.7598242215812206, "num_tokens": 64291902.0, "step": 870, "train_ppl": 2.846986 }, { "ce_loss": 1.0143, "epoch": 0.12733554000036174, "grad_norm": 1.1171875, "hf_loss_ratio": 1.0, "learning_rate": 2.6996867074444278e-05, "loss": 1.0143, "mean_token_accuracy": 0.7722109064459801, "num_tokens": 65062010.0, "step": 880, "train_ppl": 2.757514 }, { "ce_loss": 0.9824, "epoch": 0.12878253477309312, "grad_norm": 1.1328125, "hf_loss_ratio": 1.0, "learning_rate": 2.6952110995076834e-05, "loss": 0.9824, "mean_token_accuracy": 0.7738293096423149, "num_tokens": 65801609.0, "step": 890, "train_ppl": 2.67092 }, { "ce_loss": 1.0333, "epoch": 0.1302295295458245, "grad_norm": 1.0546875, "hf_loss_ratio": 1.0, "learning_rate": 2.6907354915709383e-05, "loss": 1.0333, "mean_token_accuracy": 0.7661075979471207, "num_tokens": 66511678.0, "step": 900, "train_ppl": 2.810267 }, { "ce_loss": 1.0035, "epoch": 0.1316765243185559, "grad_norm": 1.1328125, "hf_loss_ratio": 1.0, "learning_rate": 2.686259883634194e-05, "loss": 1.0035, "mean_token_accuracy": 0.7725445240736007, "num_tokens": 67237118.0, "step": 910, "train_ppl": 2.727891 }, { "ce_loss": 1.0143, "epoch": 0.13312351909128728, "grad_norm": 0.95703125, "hf_loss_ratio": 1.0, "learning_rate": 2.681784275697449e-05, "loss": 1.0143, "mean_token_accuracy": 0.770337475836277, "num_tokens": 67960278.0, "step": 920, "train_ppl": 2.757525 }, { "ce_loss": 1.0292, "epoch": 0.13457051386401866, "grad_norm": 1.03125, "hf_loss_ratio": 1.0, "learning_rate": 2.677308667760704e-05, "loss": 1.0292, "mean_token_accuracy": 0.7616572365164757, "num_tokens": 68667137.0, "step": 930, "train_ppl": 2.798916 }, { "ce_loss": 0.9922, "epoch": 0.13601750863675005, "grad_norm": 0.88671875, "hf_loss_ratio": 1.0, "learning_rate": 2.6728330598239596e-05, "loss": 0.9922, "mean_token_accuracy": 0.7753356233239174, "num_tokens": 69397579.0, "step": 940, "train_ppl": 2.697085 }, { "ce_loss": 1.0193, "epoch": 0.13746450340948144, "grad_norm": 1.21875, "hf_loss_ratio": 1.0, "learning_rate": 2.6683574518872145e-05, "loss": 1.0193, "mean_token_accuracy": 0.7674314551055431, "num_tokens": 70138483.0, "step": 950, "train_ppl": 2.771351 }, { "ce_loss": 1.0101, "epoch": 0.13891149818221282, "grad_norm": 1.0234375, "hf_loss_ratio": 1.0, "learning_rate": 2.66388184395047e-05, "loss": 1.0101, "mean_token_accuracy": 0.7684113517403602, "num_tokens": 70893702.0, "step": 960, "train_ppl": 2.745858 }, { "ce_loss": 0.9906, "epoch": 0.1403584929549442, "grad_norm": 1.1171875, "hf_loss_ratio": 1.0, "learning_rate": 2.6594062360137253e-05, "loss": 0.9906, "mean_token_accuracy": 0.7723499283194541, "num_tokens": 71651876.0, "step": 970, "train_ppl": 2.692868 }, { "ce_loss": 1.0207, "epoch": 0.1418054877276756, "grad_norm": 1.328125, "hf_loss_ratio": 1.0, "learning_rate": 2.6549306280769806e-05, "loss": 1.0207, "mean_token_accuracy": 0.7665747530758381, "num_tokens": 72377679.0, "step": 980, "train_ppl": 2.775166 }, { "ce_loss": 0.9936, "epoch": 0.14325248250040698, "grad_norm": 1.078125, "hf_loss_ratio": 1.0, "learning_rate": 2.6504550201402358e-05, "loss": 0.9936, "mean_token_accuracy": 0.7710120238363742, "num_tokens": 73103927.0, "step": 990, "train_ppl": 2.700822 }, { "ce_loss": 0.9695, "epoch": 0.14469947727313834, "grad_norm": 1.09375, "hf_loss_ratio": 1.0, "learning_rate": 2.645979412203491e-05, "loss": 0.9695, "mean_token_accuracy": 0.7770053826272487, "num_tokens": 73844957.0, "step": 1000, "train_ppl": 2.636754 }, { "ce_loss": 1.0049, "epoch": 0.14614647204586972, "grad_norm": 0.96484375, "hf_loss_ratio": 1.0, "learning_rate": 2.6415038042667463e-05, "loss": 1.0049, "mean_token_accuracy": 0.7748589895665645, "num_tokens": 74603514.0, "step": 1010, "train_ppl": 2.731605 }, { "ce_loss": 1.0422, "epoch": 0.1475934668186011, "grad_norm": 0.99609375, "hf_loss_ratio": 1.0, "learning_rate": 2.6370281963300015e-05, "loss": 1.0422, "mean_token_accuracy": 0.7634790919721126, "num_tokens": 75341775.0, "step": 1020, "train_ppl": 2.835447 }, { "ce_loss": 0.9876, "epoch": 0.1490404615913325, "grad_norm": 1.0625, "hf_loss_ratio": 1.0, "learning_rate": 2.632552588393257e-05, "loss": 0.9876, "mean_token_accuracy": 0.7736144475638866, "num_tokens": 76068700.0, "step": 1030, "train_ppl": 2.684756 }, { "ce_loss": 0.9743, "epoch": 0.15048745636406388, "grad_norm": 1.328125, "hf_loss_ratio": 1.0, "learning_rate": 2.628076980456512e-05, "loss": 0.9743, "mean_token_accuracy": 0.7698041521012783, "num_tokens": 76790471.0, "step": 1040, "train_ppl": 2.649441 }, { "ce_loss": 1.0106, "epoch": 0.15193445113679527, "grad_norm": 0.953125, "hf_loss_ratio": 1.0, "learning_rate": 2.6236013725197673e-05, "loss": 1.0106, "mean_token_accuracy": 0.7718939520418644, "num_tokens": 77528424.0, "step": 1050, "train_ppl": 2.747122 }, { "ce_loss": 0.9585, "epoch": 0.15338144590952665, "grad_norm": 0.984375, "hf_loss_ratio": 1.0, "learning_rate": 2.6191257645830225e-05, "loss": 0.9585, "mean_token_accuracy": 0.7821242325007915, "num_tokens": 78282846.0, "step": 1060, "train_ppl": 2.607741 }, { "ce_loss": 1.0218, "epoch": 0.15482844068225804, "grad_norm": 0.95703125, "hf_loss_ratio": 1.0, "learning_rate": 2.6146501566462778e-05, "loss": 1.0218, "mean_token_accuracy": 0.766200902312994, "num_tokens": 79027597.0, "step": 1070, "train_ppl": 2.778107 }, { "ce_loss": 0.9949, "epoch": 0.15627543545498943, "grad_norm": 1.0390625, "hf_loss_ratio": 1.0, "learning_rate": 2.6101745487095333e-05, "loss": 0.9949, "mean_token_accuracy": 0.7705755203962326, "num_tokens": 79743637.0, "step": 1080, "train_ppl": 2.70455 }, { "ce_loss": 1.0277, "epoch": 0.1577224302277208, "grad_norm": 1.1015625, "hf_loss_ratio": 1.0, "learning_rate": 2.6056989407727882e-05, "loss": 1.0277, "mean_token_accuracy": 0.7647506572306156, "num_tokens": 80473185.0, "step": 1090, "train_ppl": 2.794623 }, { "ce_loss": 0.965, "epoch": 0.1591694250004522, "grad_norm": 0.97265625, "hf_loss_ratio": 1.0, "learning_rate": 2.6012233328360435e-05, "loss": 0.965, "mean_token_accuracy": 0.7723382718861103, "num_tokens": 81206214.0, "step": 1100, "train_ppl": 2.624738 }, { "ce_loss": 0.988, "epoch": 0.16061641977318358, "grad_norm": 1.0078125, "hf_loss_ratio": 1.0, "learning_rate": 2.596747724899299e-05, "loss": 0.988, "mean_token_accuracy": 0.7725288093090057, "num_tokens": 81957112.0, "step": 1110, "train_ppl": 2.685843 }, { "ce_loss": 0.9953, "epoch": 0.16206341454591494, "grad_norm": 1.0625, "hf_loss_ratio": 1.0, "learning_rate": 2.592272116962554e-05, "loss": 0.9953, "mean_token_accuracy": 0.771150516718626, "num_tokens": 82713929.0, "step": 1120, "train_ppl": 2.705614 }, { "ce_loss": 1.0077, "epoch": 0.16351040931864633, "grad_norm": 1.015625, "hf_loss_ratio": 1.0, "learning_rate": 2.5877965090258096e-05, "loss": 1.0077, "mean_token_accuracy": 0.7694192692637444, "num_tokens": 83463522.0, "step": 1130, "train_ppl": 2.739307 }, { "ce_loss": 1.0273, "epoch": 0.1649574040913777, "grad_norm": 1.0078125, "hf_loss_ratio": 1.0, "learning_rate": 2.5833209010890648e-05, "loss": 1.0273, "mean_token_accuracy": 0.769251874089241, "num_tokens": 84188031.0, "step": 1140, "train_ppl": 2.793589 }, { "ce_loss": 1.0097, "epoch": 0.1664043988641091, "grad_norm": 0.953125, "hf_loss_ratio": 1.0, "learning_rate": 2.5788452931523197e-05, "loss": 1.0097, "mean_token_accuracy": 0.7688002400100231, "num_tokens": 84918572.0, "step": 1150, "train_ppl": 2.74465 }, { "ce_loss": 0.9846, "epoch": 0.16785139363684048, "grad_norm": 1.0546875, "hf_loss_ratio": 1.0, "learning_rate": 2.5743696852155753e-05, "loss": 0.9846, "mean_token_accuracy": 0.7792325161397458, "num_tokens": 85637924.0, "step": 1160, "train_ppl": 2.676852 }, { "ce_loss": 0.971, "epoch": 0.16929838840957187, "grad_norm": 1.109375, "hf_loss_ratio": 1.0, "learning_rate": 2.5698940772788302e-05, "loss": 0.971, "mean_token_accuracy": 0.7782729744911194, "num_tokens": 86375295.0, "step": 1170, "train_ppl": 2.640504 }, { "ce_loss": 1.0133, "epoch": 0.17074538318230326, "grad_norm": 1.1875, "hf_loss_ratio": 1.0, "learning_rate": 2.5654184693420858e-05, "loss": 1.0133, "mean_token_accuracy": 0.7730432473123073, "num_tokens": 87109044.0, "step": 1180, "train_ppl": 2.754625 }, { "ce_loss": 0.9703, "epoch": 0.17219237795503464, "grad_norm": 1.0234375, "hf_loss_ratio": 1.0, "learning_rate": 2.560942861405341e-05, "loss": 0.9703, "mean_token_accuracy": 0.7804669737815857, "num_tokens": 87823377.0, "step": 1190, "train_ppl": 2.638814 }, { "ce_loss": 0.9692, "epoch": 0.17363937272776603, "grad_norm": 1.078125, "hf_loss_ratio": 1.0, "learning_rate": 2.5564672534685963e-05, "loss": 0.9692, "mean_token_accuracy": 0.7746523730456829, "num_tokens": 88551984.0, "step": 1200, "train_ppl": 2.635899 }, { "ce_loss": 0.9945, "epoch": 0.17508636750049741, "grad_norm": 1.015625, "hf_loss_ratio": 1.0, "learning_rate": 2.5519916455318515e-05, "loss": 0.9945, "mean_token_accuracy": 0.7793050222098827, "num_tokens": 89293732.0, "step": 1210, "train_ppl": 2.703368 }, { "ce_loss": 0.9821, "epoch": 0.1765333622732288, "grad_norm": 1.234375, "hf_loss_ratio": 1.0, "learning_rate": 2.5475160375951068e-05, "loss": 0.9821, "mean_token_accuracy": 0.7767940178513527, "num_tokens": 90009099.0, "step": 1220, "train_ppl": 2.670185 }, { "ce_loss": 0.9914, "epoch": 0.17798035704596016, "grad_norm": 1.09375, "hf_loss_ratio": 1.0, "learning_rate": 2.543040429658362e-05, "loss": 0.9914, "mean_token_accuracy": 0.7680940054357052, "num_tokens": 90713440.0, "step": 1230, "train_ppl": 2.69505 }, { "ce_loss": 0.9752, "epoch": 0.17942735181869154, "grad_norm": 1.1484375, "hf_loss_ratio": 1.0, "learning_rate": 2.5385648217216173e-05, "loss": 0.9752, "mean_token_accuracy": 0.7775831647217274, "num_tokens": 91458197.0, "step": 1240, "train_ppl": 2.651746 }, { "ce_loss": 0.972, "epoch": 0.18087434659142293, "grad_norm": 1.046875, "hf_loss_ratio": 1.0, "learning_rate": 2.5340892137848725e-05, "loss": 0.972, "mean_token_accuracy": 0.7771682500839233, "num_tokens": 92204785.0, "step": 1250, "train_ppl": 2.64311 }, { "ce_loss": 0.9545, "epoch": 0.18232134136415432, "grad_norm": 1.1796875, "hf_loss_ratio": 1.0, "learning_rate": 2.5296136058481277e-05, "loss": 0.9545, "mean_token_accuracy": 0.7803010269999504, "num_tokens": 92965785.0, "step": 1260, "train_ppl": 2.597424 }, { "ce_loss": 0.9658, "epoch": 0.1837683361368857, "grad_norm": 1.046875, "hf_loss_ratio": 1.0, "learning_rate": 2.525137997911383e-05, "loss": 0.9658, "mean_token_accuracy": 0.7732729889452458, "num_tokens": 93749479.0, "step": 1270, "train_ppl": 2.626844 }, { "ce_loss": 0.9175, "epoch": 0.1852153309096171, "grad_norm": 1.140625, "hf_loss_ratio": 1.0, "learning_rate": 2.5206623899746382e-05, "loss": 0.9175, "mean_token_accuracy": 0.7875691160559655, "num_tokens": 94490987.0, "step": 1280, "train_ppl": 2.50292 }, { "ce_loss": 1.0091, "epoch": 0.18666232568234847, "grad_norm": 1.015625, "hf_loss_ratio": 1.0, "learning_rate": 2.5161867820378935e-05, "loss": 1.0091, "mean_token_accuracy": 0.7689063064754009, "num_tokens": 95239798.0, "step": 1290, "train_ppl": 2.74315 }, { "ce_loss": 0.9981, "epoch": 0.18810932045507986, "grad_norm": 1.2578125, "hf_loss_ratio": 1.0, "learning_rate": 2.511711174101149e-05, "loss": 0.9981, "mean_token_accuracy": 0.7733910351991653, "num_tokens": 95971638.0, "step": 1300, "train_ppl": 2.713218 }, { "ce_loss": 0.973, "epoch": 0.18955631522781125, "grad_norm": 1.1171875, "hf_loss_ratio": 1.0, "learning_rate": 2.507235566164404e-05, "loss": 0.973, "mean_token_accuracy": 0.7790097333490849, "num_tokens": 96708517.0, "step": 1310, "train_ppl": 2.645934 }, { "ce_loss": 0.994, "epoch": 0.19100331000054263, "grad_norm": 0.90625, "hf_loss_ratio": 1.0, "learning_rate": 2.5027599582276592e-05, "loss": 0.994, "mean_token_accuracy": 0.7691507421433925, "num_tokens": 97438831.0, "step": 1320, "train_ppl": 2.701936 }, { "ce_loss": 0.9829, "epoch": 0.19245030477327402, "grad_norm": 1.0390625, "hf_loss_ratio": 1.0, "learning_rate": 2.4982843502909148e-05, "loss": 0.9829, "mean_token_accuracy": 0.7720185928046703, "num_tokens": 98167703.0, "step": 1330, "train_ppl": 2.672221 }, { "ce_loss": 1.0042, "epoch": 0.1938972995460054, "grad_norm": 1.203125, "hf_loss_ratio": 1.0, "learning_rate": 2.4938087423541697e-05, "loss": 1.0042, "mean_token_accuracy": 0.773903863132, "num_tokens": 98916022.0, "step": 1340, "train_ppl": 2.72972 }, { "ce_loss": 1.0223, "epoch": 0.19534429431873676, "grad_norm": 1.28125, "hf_loss_ratio": 1.0, "learning_rate": 2.4893331344174253e-05, "loss": 1.0223, "mean_token_accuracy": 0.7680788926780224, "num_tokens": 99656326.0, "step": 1350, "train_ppl": 2.779674 }, { "ce_loss": 1.0159, "epoch": 0.19679128909146815, "grad_norm": 1.2578125, "hf_loss_ratio": 1.0, "learning_rate": 2.4848575264806802e-05, "loss": 1.0159, "mean_token_accuracy": 0.7670142784714699, "num_tokens": 100366830.0, "step": 1360, "train_ppl": 2.761858 }, { "ce_loss": 0.9412, "epoch": 0.19823828386419953, "grad_norm": 1.1484375, "hf_loss_ratio": 1.0, "learning_rate": 2.4803819185439354e-05, "loss": 0.9412, "mean_token_accuracy": 0.7805588349699975, "num_tokens": 101103405.0, "step": 1370, "train_ppl": 2.562954 }, { "ce_loss": 1.0126, "epoch": 0.19968527863693092, "grad_norm": 1.1484375, "hf_loss_ratio": 1.0, "learning_rate": 2.475906310607191e-05, "loss": 1.0126, "mean_token_accuracy": 0.769621242582798, "num_tokens": 101841805.0, "step": 1380, "train_ppl": 2.752685 }, { "ce_loss": 0.9851, "epoch": 0.2011322734096623, "grad_norm": 1.0390625, "hf_loss_ratio": 1.0, "learning_rate": 2.471430702670446e-05, "loss": 0.9851, "mean_token_accuracy": 0.7694549061357975, "num_tokens": 102587079.0, "step": 1390, "train_ppl": 2.67799 }, { "ce_loss": 1.0044, "epoch": 0.2025792681823937, "grad_norm": 1.0390625, "hf_loss_ratio": 1.0, "learning_rate": 2.4669550947337015e-05, "loss": 1.0044, "mean_token_accuracy": 0.7683346226811409, "num_tokens": 103349174.0, "step": 1400, "train_ppl": 2.730359 }, { "ce_loss": 0.9611, "epoch": 0.20402626295512508, "grad_norm": 1.0078125, "hf_loss_ratio": 1.0, "learning_rate": 2.4624794867969568e-05, "loss": 0.9611, "mean_token_accuracy": 0.7769466623663902, "num_tokens": 104090462.0, "step": 1410, "train_ppl": 2.614475 }, { "ce_loss": 0.9999, "epoch": 0.20547325772785646, "grad_norm": 1.5625, "hf_loss_ratio": 1.0, "learning_rate": 2.458003878860212e-05, "loss": 0.9999, "mean_token_accuracy": 0.7739646673202515, "num_tokens": 104807032.0, "step": 1420, "train_ppl": 2.718026 }, { "ce_loss": 0.992, "epoch": 0.20692025250058785, "grad_norm": 1.046875, "hf_loss_ratio": 1.0, "learning_rate": 2.4535282709234672e-05, "loss": 0.992, "mean_token_accuracy": 0.7719819858670235, "num_tokens": 105536067.0, "step": 1430, "train_ppl": 2.696496 }, { "ce_loss": 0.965, "epoch": 0.20836724727331923, "grad_norm": 1.0703125, "hf_loss_ratio": 1.0, "learning_rate": 2.4490526629867225e-05, "loss": 0.965, "mean_token_accuracy": 0.782091249525547, "num_tokens": 106292581.0, "step": 1440, "train_ppl": 2.624887 }, { "ce_loss": 1.0016, "epoch": 0.20981424204605062, "grad_norm": 1.15625, "hf_loss_ratio": 1.0, "learning_rate": 2.4445770550499777e-05, "loss": 1.0016, "mean_token_accuracy": 0.7689143389463424, "num_tokens": 107002756.0, "step": 1450, "train_ppl": 2.722517 }, { "ce_loss": 0.9808, "epoch": 0.211261236818782, "grad_norm": 0.8984375, "hf_loss_ratio": 1.0, "learning_rate": 2.440101447113233e-05, "loss": 0.9808, "mean_token_accuracy": 0.7709385193884373, "num_tokens": 107735109.0, "step": 1460, "train_ppl": 2.666501 }, { "ce_loss": 0.965, "epoch": 0.21270823159151336, "grad_norm": 1.109375, "hf_loss_ratio": 1.0, "learning_rate": 2.4356258391764882e-05, "loss": 0.965, "mean_token_accuracy": 0.7816490411758423, "num_tokens": 108488189.0, "step": 1470, "train_ppl": 2.624826 }, { "ce_loss": 0.984, "epoch": 0.21415522636424475, "grad_norm": 1.0703125, "hf_loss_ratio": 1.0, "learning_rate": 2.4311502312397435e-05, "loss": 0.984, "mean_token_accuracy": 0.7733917005360127, "num_tokens": 109227381.0, "step": 1480, "train_ppl": 2.675031 }, { "ce_loss": 1.0325, "epoch": 0.21560222113697614, "grad_norm": 1.0390625, "hf_loss_ratio": 1.0, "learning_rate": 2.4266746233029987e-05, "loss": 1.0325, "mean_token_accuracy": 0.7697164453566074, "num_tokens": 109967419.0, "step": 1490, "train_ppl": 2.808141 }, { "ce_loss": 0.9488, "epoch": 0.21704921590970752, "grad_norm": 1.0859375, "hf_loss_ratio": 1.0, "learning_rate": 2.422199015366254e-05, "loss": 0.9488, "mean_token_accuracy": 0.779134713858366, "num_tokens": 110728249.0, "step": 1500, "train_ppl": 2.582697 }, { "ce_loss": 1.0317, "epoch": 0.2184962106824389, "grad_norm": 1.0078125, "hf_loss_ratio": 1.0, "learning_rate": 2.4177234074295092e-05, "loss": 1.0317, "mean_token_accuracy": 0.7620711497962475, "num_tokens": 111457904.0, "step": 1510, "train_ppl": 2.805772 }, { "ce_loss": 0.9886, "epoch": 0.2199432054551703, "grad_norm": 1.015625, "hf_loss_ratio": 1.0, "learning_rate": 2.4132477994927648e-05, "loss": 0.9886, "mean_token_accuracy": 0.7727661252021789, "num_tokens": 112189931.0, "step": 1520, "train_ppl": 2.687597 }, { "ce_loss": 1.0147, "epoch": 0.22139020022790168, "grad_norm": 1.015625, "hf_loss_ratio": 1.0, "learning_rate": 2.4087721915560197e-05, "loss": 1.0147, "mean_token_accuracy": 0.7641719624400138, "num_tokens": 112953522.0, "step": 1530, "train_ppl": 2.758408 }, { "ce_loss": 0.9716, "epoch": 0.22283719500063306, "grad_norm": 1.0078125, "hf_loss_ratio": 1.0, "learning_rate": 2.404296583619275e-05, "loss": 0.9716, "mean_token_accuracy": 0.7772294074296952, "num_tokens": 113698414.0, "step": 1540, "train_ppl": 2.642101 }, { "ce_loss": 0.9623, "epoch": 0.22428418977336445, "grad_norm": 1.0234375, "hf_loss_ratio": 1.0, "learning_rate": 2.3998209756825302e-05, "loss": 0.9623, "mean_token_accuracy": 0.7757225722074509, "num_tokens": 114430630.0, "step": 1550, "train_ppl": 2.617647 }, { "ce_loss": 0.997, "epoch": 0.22573118454609584, "grad_norm": 1.015625, "hf_loss_ratio": 1.0, "learning_rate": 2.3953453677457854e-05, "loss": 0.997, "mean_token_accuracy": 0.7703205697238446, "num_tokens": 115166141.0, "step": 1560, "train_ppl": 2.710057 }, { "ce_loss": 0.9953, "epoch": 0.22717817931882722, "grad_norm": 1.4609375, "hf_loss_ratio": 1.0, "learning_rate": 2.390869759809041e-05, "loss": 0.9953, "mean_token_accuracy": 0.771430192887783, "num_tokens": 115889580.0, "step": 1570, "train_ppl": 2.705503 }, { "ce_loss": 0.9531, "epoch": 0.22862517409155858, "grad_norm": 1.1171875, "hf_loss_ratio": 1.0, "learning_rate": 2.386394151872296e-05, "loss": 0.9531, "mean_token_accuracy": 0.781104639172554, "num_tokens": 116629845.0, "step": 1580, "train_ppl": 2.593619 }, { "ce_loss": 0.9679, "epoch": 0.23007216886428997, "grad_norm": 1.0390625, "hf_loss_ratio": 1.0, "learning_rate": 2.381918543935551e-05, "loss": 0.9679, "mean_token_accuracy": 0.7786240108311177, "num_tokens": 117372885.0, "step": 1590, "train_ppl": 2.632371 }, { "ce_loss": 0.9785, "epoch": 0.23151916363702135, "grad_norm": 1.4296875, "hf_loss_ratio": 1.0, "learning_rate": 2.3774429359988067e-05, "loss": 0.9785, "mean_token_accuracy": 0.7776103042066097, "num_tokens": 118132367.0, "step": 1600, "train_ppl": 2.66055 }, { "ce_loss": 0.9715, "epoch": 0.23296615840975274, "grad_norm": 1.1328125, "hf_loss_ratio": 1.0, "learning_rate": 2.3729673280620616e-05, "loss": 0.9715, "mean_token_accuracy": 0.7777374930679798, "num_tokens": 118846692.0, "step": 1610, "train_ppl": 2.641897 }, { "ce_loss": 0.9917, "epoch": 0.23441315318248412, "grad_norm": 1.0, "hf_loss_ratio": 1.0, "learning_rate": 2.3684917201253172e-05, "loss": 0.9917, "mean_token_accuracy": 0.7717310026288032, "num_tokens": 119577822.0, "step": 1620, "train_ppl": 2.695707 }, { "ce_loss": 1.0171, "epoch": 0.2358601479552155, "grad_norm": 1.3125, "hf_loss_ratio": 1.0, "learning_rate": 2.3640161121885725e-05, "loss": 1.0171, "mean_token_accuracy": 0.7664790794253349, "num_tokens": 120308082.0, "step": 1630, "train_ppl": 2.765049 }, { "ce_loss": 0.9736, "epoch": 0.2373071427279469, "grad_norm": 1.078125, "hf_loss_ratio": 1.0, "learning_rate": 2.3595405042518274e-05, "loss": 0.9736, "mean_token_accuracy": 0.7768724001944065, "num_tokens": 121049818.0, "step": 1640, "train_ppl": 2.647552 }, { "ce_loss": 0.9504, "epoch": 0.23875413750067828, "grad_norm": 1.0859375, "hf_loss_ratio": 1.0, "learning_rate": 2.355064896315083e-05, "loss": 0.9504, "mean_token_accuracy": 0.783089691400528, "num_tokens": 121788637.0, "step": 1650, "train_ppl": 2.586798 }, { "ce_loss": 0.9677, "epoch": 0.24020113227340967, "grad_norm": 1.0, "hf_loss_ratio": 1.0, "learning_rate": 2.350589288378338e-05, "loss": 0.9677, "mean_token_accuracy": 0.7775506429374218, "num_tokens": 122522757.0, "step": 1660, "train_ppl": 2.63188 }, { "ce_loss": 0.9579, "epoch": 0.24164812704614105, "grad_norm": 1.0859375, "hf_loss_ratio": 1.0, "learning_rate": 2.3461136804415935e-05, "loss": 0.9579, "mean_token_accuracy": 0.7754926040768624, "num_tokens": 123241955.0, "step": 1670, "train_ppl": 2.606329 }, { "ce_loss": 0.9865, "epoch": 0.24309512181887244, "grad_norm": 0.984375, "hf_loss_ratio": 1.0, "learning_rate": 2.3416380725048487e-05, "loss": 0.9865, "mean_token_accuracy": 0.7741681657731533, "num_tokens": 123980600.0, "step": 1680, "train_ppl": 2.681846 }, { "ce_loss": 1.0253, "epoch": 0.24454211659160383, "grad_norm": 0.93359375, "hf_loss_ratio": 1.0, "learning_rate": 2.337162464568104e-05, "loss": 1.0253, "mean_token_accuracy": 0.7667008370161057, "num_tokens": 124695571.0, "step": 1690, "train_ppl": 2.787846 }, { "ce_loss": 0.9638, "epoch": 0.24598911136433518, "grad_norm": 0.9375, "hf_loss_ratio": 1.0, "learning_rate": 2.3326868566313592e-05, "loss": 0.9638, "mean_token_accuracy": 0.7810881577432156, "num_tokens": 125462307.0, "step": 1700, "train_ppl": 2.621706 }, { "ce_loss": 1.0031, "epoch": 0.24743610613706657, "grad_norm": 1.0625, "hf_loss_ratio": 1.0, "learning_rate": 2.3282112486946144e-05, "loss": 1.0031, "mean_token_accuracy": 0.7722915470600128, "num_tokens": 126188660.0, "step": 1710, "train_ppl": 2.726587 }, { "ce_loss": 0.9951, "epoch": 0.24888310090979796, "grad_norm": 1.09375, "hf_loss_ratio": 1.0, "learning_rate": 2.3237356407578697e-05, "loss": 0.9951, "mean_token_accuracy": 0.7689005501568318, "num_tokens": 126922149.0, "step": 1720, "train_ppl": 2.704929 }, { "ce_loss": 0.968, "epoch": 0.25033009568252934, "grad_norm": 1.1484375, "hf_loss_ratio": 1.0, "learning_rate": 2.319260032821125e-05, "loss": 0.968, "mean_token_accuracy": 0.7733873896300792, "num_tokens": 127665260.0, "step": 1730, "train_ppl": 2.632612 }, { "ce_loss": 0.951, "epoch": 0.25177709045526075, "grad_norm": 1.046875, "hf_loss_ratio": 1.0, "learning_rate": 2.31478442488438e-05, "loss": 0.951, "mean_token_accuracy": 0.7792448908090591, "num_tokens": 128389924.0, "step": 1740, "train_ppl": 2.58818 }, { "ce_loss": 0.9992, "epoch": 0.2532240852279921, "grad_norm": 1.1640625, "hf_loss_ratio": 1.0, "learning_rate": 2.3103088169476354e-05, "loss": 0.9992, "mean_token_accuracy": 0.7671849623322486, "num_tokens": 129141013.0, "step": 1750, "train_ppl": 2.716049 }, { "ce_loss": 0.9825, "epoch": 0.25467108000072347, "grad_norm": 0.9375, "hf_loss_ratio": 1.0, "learning_rate": 2.3058332090108907e-05, "loss": 0.9825, "mean_token_accuracy": 0.7744820192456245, "num_tokens": 129895565.0, "step": 1760, "train_ppl": 2.671033 }, { "ce_loss": 1.0052, "epoch": 0.2561180747734549, "grad_norm": 1.1875, "hf_loss_ratio": 1.0, "learning_rate": 2.301357601074146e-05, "loss": 1.0052, "mean_token_accuracy": 0.7750261440873146, "num_tokens": 130621739.0, "step": 1770, "train_ppl": 2.73239 }, { "ce_loss": 0.9681, "epoch": 0.25756506954618624, "grad_norm": 1.171875, "hf_loss_ratio": 1.0, "learning_rate": 2.296881993137401e-05, "loss": 0.9681, "mean_token_accuracy": 0.7767448596656322, "num_tokens": 131345170.0, "step": 1780, "train_ppl": 2.633028 }, { "ce_loss": 0.9402, "epoch": 0.25901206431891766, "grad_norm": 1.1953125, "hf_loss_ratio": 1.0, "learning_rate": 2.2924063852006567e-05, "loss": 0.9402, "mean_token_accuracy": 0.7856816701591015, "num_tokens": 132065199.0, "step": 1790, "train_ppl": 2.560536 }, { "ce_loss": 0.9967, "epoch": 0.260459059091649, "grad_norm": 1.1171875, "hf_loss_ratio": 1.0, "learning_rate": 2.2879307772639116e-05, "loss": 0.9967, "mean_token_accuracy": 0.7735986836254597, "num_tokens": 132781605.0, "step": 1800, "train_ppl": 2.709426 }, { "ce_loss": 0.9958, "epoch": 0.26190605386438043, "grad_norm": 1.0, "hf_loss_ratio": 1.0, "learning_rate": 2.283455169327167e-05, "loss": 0.9958, "mean_token_accuracy": 0.7739541471004486, "num_tokens": 133519634.0, "step": 1810, "train_ppl": 2.706818 }, { "ce_loss": 0.9826, "epoch": 0.2633530486371118, "grad_norm": 1.1015625, "hf_loss_ratio": 1.0, "learning_rate": 2.2789795613904225e-05, "loss": 0.9826, "mean_token_accuracy": 0.7771935254335404, "num_tokens": 134253497.0, "step": 1820, "train_ppl": 2.671278 }, { "ce_loss": 0.9624, "epoch": 0.2648000434098432, "grad_norm": 1.140625, "hf_loss_ratio": 1.0, "learning_rate": 2.2745039534536774e-05, "loss": 0.9624, "mean_token_accuracy": 0.7789321012794972, "num_tokens": 135020505.0, "step": 1830, "train_ppl": 2.618061 }, { "ce_loss": 0.9873, "epoch": 0.26624703818257456, "grad_norm": 1.0546875, "hf_loss_ratio": 1.0, "learning_rate": 2.270028345516933e-05, "loss": 0.9873, "mean_token_accuracy": 0.7744618967175484, "num_tokens": 135773285.0, "step": 1840, "train_ppl": 2.683909 }, { "ce_loss": 0.9925, "epoch": 0.26769403295530597, "grad_norm": 1.015625, "hf_loss_ratio": 1.0, "learning_rate": 2.265552737580188e-05, "loss": 0.9925, "mean_token_accuracy": 0.7759519070386887, "num_tokens": 136497732.0, "step": 1850, "train_ppl": 2.697987 }, { "ce_loss": 0.9889, "epoch": 0.26914102772803733, "grad_norm": 1.25, "hf_loss_ratio": 1.0, "learning_rate": 2.261077129643443e-05, "loss": 0.9889, "mean_token_accuracy": 0.772041554749012, "num_tokens": 137175891.0, "step": 1860, "train_ppl": 2.688219 }, { "ce_loss": 0.9832, "epoch": 0.27058802250076874, "grad_norm": 1.109375, "hf_loss_ratio": 1.0, "learning_rate": 2.2566015217066987e-05, "loss": 0.9832, "mean_token_accuracy": 0.770769814401865, "num_tokens": 137910825.0, "step": 1870, "train_ppl": 2.672975 }, { "ce_loss": 0.9957, "epoch": 0.2720350172735001, "grad_norm": 1.09375, "hf_loss_ratio": 1.0, "learning_rate": 2.2521259137699536e-05, "loss": 0.9957, "mean_token_accuracy": 0.7698277346789837, "num_tokens": 138609576.0, "step": 1880, "train_ppl": 2.7066 }, { "ce_loss": 0.9988, "epoch": 0.27348201204623146, "grad_norm": 1.0859375, "hf_loss_ratio": 1.0, "learning_rate": 2.2476503058332092e-05, "loss": 0.9988, "mean_token_accuracy": 0.771542327105999, "num_tokens": 139318503.0, "step": 1890, "train_ppl": 2.714913 }, { "ce_loss": 1.0168, "epoch": 0.2749290068189629, "grad_norm": 1.2578125, "hf_loss_ratio": 1.0, "learning_rate": 2.2431746978964644e-05, "loss": 1.0168, "mean_token_accuracy": 0.7615082763135433, "num_tokens": 140054302.0, "step": 1900, "train_ppl": 2.764403 }, { "ce_loss": 0.983, "epoch": 0.27637600159169423, "grad_norm": 1.0078125, "hf_loss_ratio": 1.0, "learning_rate": 2.2386990899597197e-05, "loss": 0.983, "mean_token_accuracy": 0.7786808654665947, "num_tokens": 140797270.0, "step": 1910, "train_ppl": 2.67259 }, { "ce_loss": 1.0197, "epoch": 0.27782299636442565, "grad_norm": 0.99609375, "hf_loss_ratio": 1.0, "learning_rate": 2.234223482022975e-05, "loss": 1.0197, "mean_token_accuracy": 0.7617739595472812, "num_tokens": 141527803.0, "step": 1920, "train_ppl": 2.772385 }, { "ce_loss": 0.9801, "epoch": 0.279269991137157, "grad_norm": 0.94140625, "hf_loss_ratio": 1.0, "learning_rate": 2.22974787408623e-05, "loss": 0.9801, "mean_token_accuracy": 0.7726086884737015, "num_tokens": 142259241.0, "step": 1930, "train_ppl": 2.664847 }, { "ce_loss": 0.9964, "epoch": 0.2807169859098884, "grad_norm": 1.078125, "hf_loss_ratio": 1.0, "learning_rate": 2.2252722661494854e-05, "loss": 0.9964, "mean_token_accuracy": 0.7709591925144196, "num_tokens": 143023815.0, "step": 1940, "train_ppl": 2.70848 }, { "ce_loss": 1.002, "epoch": 0.2821639806826198, "grad_norm": 1.0546875, "hf_loss_ratio": 1.0, "learning_rate": 2.2207966582127406e-05, "loss": 1.002, "mean_token_accuracy": 0.7686372242867947, "num_tokens": 143780140.0, "step": 1950, "train_ppl": 2.723817 }, { "ce_loss": 1.0256, "epoch": 0.2836109754553512, "grad_norm": 1.1484375, "hf_loss_ratio": 1.0, "learning_rate": 2.216321050275996e-05, "loss": 1.0256, "mean_token_accuracy": 0.7672031052410603, "num_tokens": 144495655.0, "step": 1960, "train_ppl": 2.788658 }, { "ce_loss": 1.014, "epoch": 0.28505797022808255, "grad_norm": 0.98828125, "hf_loss_ratio": 1.0, "learning_rate": 2.211845442339251e-05, "loss": 1.014, "mean_token_accuracy": 0.7690494567155838, "num_tokens": 145192447.0, "step": 1970, "train_ppl": 2.756653 }, { "ce_loss": 0.9811, "epoch": 0.28650496500081396, "grad_norm": 0.984375, "hf_loss_ratio": 1.0, "learning_rate": 2.2073698344025064e-05, "loss": 0.9811, "mean_token_accuracy": 0.7795913711190223, "num_tokens": 145925116.0, "step": 1980, "train_ppl": 2.667272 }, { "ce_loss": 1.0033, "epoch": 0.2879519597735453, "grad_norm": 1.109375, "hf_loss_ratio": 1.0, "learning_rate": 2.2028942264657616e-05, "loss": 1.0033, "mean_token_accuracy": 0.771687439084053, "num_tokens": 146651269.0, "step": 1990, "train_ppl": 2.727271 }, { "ce_loss": 0.9813, "epoch": 0.2893989545462767, "grad_norm": 1.3984375, "hf_loss_ratio": 1.0, "learning_rate": 2.198418618529017e-05, "loss": 0.9813, "mean_token_accuracy": 0.7775134235620499, "num_tokens": 147381768.0, "step": 2000, "train_ppl": 2.66782 }, { "ce_loss": 0.9635, "epoch": 0.2908459493190081, "grad_norm": 1.0703125, "hf_loss_ratio": 1.0, "learning_rate": 2.1939430105922724e-05, "loss": 0.9635, "mean_token_accuracy": 0.77833351790905, "num_tokens": 148133098.0, "step": 2010, "train_ppl": 2.620909 }, { "ce_loss": 0.9986, "epoch": 0.29229294409173945, "grad_norm": 1.0234375, "hf_loss_ratio": 1.0, "learning_rate": 2.1894674026555274e-05, "loss": 0.9986, "mean_token_accuracy": 0.768501528352499, "num_tokens": 148873416.0, "step": 2020, "train_ppl": 2.714389 }, { "ce_loss": 0.982, "epoch": 0.29373993886447086, "grad_norm": 1.0234375, "hf_loss_ratio": 1.0, "learning_rate": 2.1849917947187826e-05, "loss": 0.982, "mean_token_accuracy": 0.7724484153091907, "num_tokens": 149593131.0, "step": 2030, "train_ppl": 2.66977 }, { "ce_loss": 0.9759, "epoch": 0.2951869336372022, "grad_norm": 1.109375, "hf_loss_ratio": 1.0, "learning_rate": 2.180516186782038e-05, "loss": 0.9759, "mean_token_accuracy": 0.775026997178793, "num_tokens": 150341769.0, "step": 2040, "train_ppl": 2.653647 }, { "ce_loss": 0.9829, "epoch": 0.29663392840993363, "grad_norm": 1.171875, "hf_loss_ratio": 1.0, "learning_rate": 2.176040578845293e-05, "loss": 0.9829, "mean_token_accuracy": 0.7747074596583843, "num_tokens": 151082730.0, "step": 2050, "train_ppl": 2.672224 }, { "ce_loss": 0.9525, "epoch": 0.298080923182665, "grad_norm": 0.90625, "hf_loss_ratio": 1.0, "learning_rate": 2.1715649709085487e-05, "loss": 0.9525, "mean_token_accuracy": 0.7772355630993844, "num_tokens": 151831662.0, "step": 2060, "train_ppl": 2.592082 }, { "ce_loss": 0.9725, "epoch": 0.2995279179553964, "grad_norm": 1.171875, "hf_loss_ratio": 1.0, "learning_rate": 2.1670893629718036e-05, "loss": 0.9725, "mean_token_accuracy": 0.778071166574955, "num_tokens": 152542559.0, "step": 2070, "train_ppl": 2.644496 }, { "ce_loss": 0.9505, "epoch": 0.30097491272812776, "grad_norm": 1.0625, "hf_loss_ratio": 1.0, "learning_rate": 2.1626137550350588e-05, "loss": 0.9505, "mean_token_accuracy": 0.780910176038742, "num_tokens": 153266179.0, "step": 2080, "train_ppl": 2.586885 }, { "ce_loss": 1.0026, "epoch": 0.3024219075008592, "grad_norm": 0.97265625, "hf_loss_ratio": 1.0, "learning_rate": 2.1581381470983144e-05, "loss": 1.0026, "mean_token_accuracy": 0.7699606984853744, "num_tokens": 153970933.0, "step": 2090, "train_ppl": 2.725251 }, { "ce_loss": 0.9648, "epoch": 0.30386890227359054, "grad_norm": 1.0546875, "hf_loss_ratio": 1.0, "learning_rate": 2.1536625391615693e-05, "loss": 0.9648, "mean_token_accuracy": 0.7735878027975559, "num_tokens": 154711094.0, "step": 2100, "train_ppl": 2.624383 }, { "ce_loss": 0.9964, "epoch": 0.3053158970463219, "grad_norm": 1.09375, "hf_loss_ratio": 1.0, "learning_rate": 2.149186931224825e-05, "loss": 0.9964, "mean_token_accuracy": 0.7693284347653389, "num_tokens": 155440558.0, "step": 2110, "train_ppl": 2.70838 }, { "ce_loss": 0.9726, "epoch": 0.3067628918190533, "grad_norm": 0.98046875, "hf_loss_ratio": 1.0, "learning_rate": 2.14471132328808e-05, "loss": 0.9726, "mean_token_accuracy": 0.7746382050216198, "num_tokens": 156165366.0, "step": 2120, "train_ppl": 2.644842 }, { "ce_loss": 0.9639, "epoch": 0.30820988659178467, "grad_norm": 0.8984375, "hf_loss_ratio": 1.0, "learning_rate": 2.1402357153513354e-05, "loss": 0.9639, "mean_token_accuracy": 0.7744808107614517, "num_tokens": 156890899.0, "step": 2130, "train_ppl": 2.622018 }, { "ce_loss": 0.9989, "epoch": 0.3096568813645161, "grad_norm": 1.125, "hf_loss_ratio": 1.0, "learning_rate": 2.1357601074145906e-05, "loss": 0.9989, "mean_token_accuracy": 0.767997769266367, "num_tokens": 157604658.0, "step": 2140, "train_ppl": 2.715335 }, { "ce_loss": 0.9718, "epoch": 0.31110387613724744, "grad_norm": 1.234375, "hf_loss_ratio": 1.0, "learning_rate": 2.1312844994778455e-05, "loss": 0.9718, "mean_token_accuracy": 0.78013886064291, "num_tokens": 158336316.0, "step": 2150, "train_ppl": 2.642823 }, { "ce_loss": 0.9457, "epoch": 0.31255087090997885, "grad_norm": 1.4609375, "hf_loss_ratio": 1.0, "learning_rate": 2.126808891541101e-05, "loss": 0.9457, "mean_token_accuracy": 0.7810127899050713, "num_tokens": 159052431.0, "step": 2160, "train_ppl": 2.57449 }, { "ce_loss": 0.9374, "epoch": 0.3139978656827102, "grad_norm": 0.98828125, "hf_loss_ratio": 1.0, "learning_rate": 2.1223332836043564e-05, "loss": 0.9374, "mean_token_accuracy": 0.7826711490750313, "num_tokens": 159747771.0, "step": 2170, "train_ppl": 2.553444 }, { "ce_loss": 1.0028, "epoch": 0.3154448604554416, "grad_norm": 1.1640625, "hf_loss_ratio": 1.0, "learning_rate": 2.1178576756676116e-05, "loss": 1.0028, "mean_token_accuracy": 0.7743060775101185, "num_tokens": 160475032.0, "step": 2180, "train_ppl": 2.725815 }, { "ce_loss": 0.9964, "epoch": 0.316891855228173, "grad_norm": 1.078125, "hf_loss_ratio": 1.0, "learning_rate": 2.113382067730867e-05, "loss": 0.9964, "mean_token_accuracy": 0.7711601614952087, "num_tokens": 161204515.0, "step": 2190, "train_ppl": 2.708637 }, { "ce_loss": 1.0099, "epoch": 0.3183388500009044, "grad_norm": 1.0703125, "hf_loss_ratio": 1.0, "learning_rate": 2.108906459794122e-05, "loss": 1.0099, "mean_token_accuracy": 0.7715992897748947, "num_tokens": 161961019.0, "step": 2200, "train_ppl": 2.745375 }, { "ce_loss": 0.9498, "epoch": 0.31978584477363575, "grad_norm": 0.90234375, "hf_loss_ratio": 1.0, "learning_rate": 2.1044308518573773e-05, "loss": 0.9498, "mean_token_accuracy": 0.7826919294893742, "num_tokens": 162710799.0, "step": 2210, "train_ppl": 2.58529 }, { "ce_loss": 0.9621, "epoch": 0.32123283954636717, "grad_norm": 1.0234375, "hf_loss_ratio": 1.0, "learning_rate": 2.0999552439206326e-05, "loss": 0.9621, "mean_token_accuracy": 0.775107191503048, "num_tokens": 163439737.0, "step": 2220, "train_ppl": 2.61714 }, { "ce_loss": 0.9943, "epoch": 0.3226798343190985, "grad_norm": 1.078125, "hf_loss_ratio": 1.0, "learning_rate": 2.0954796359838878e-05, "loss": 0.9943, "mean_token_accuracy": 0.7698855645954609, "num_tokens": 164145582.0, "step": 2230, "train_ppl": 2.702918 }, { "ce_loss": 0.9771, "epoch": 0.3241268290918299, "grad_norm": 1.0625, "hf_loss_ratio": 1.0, "learning_rate": 2.091004028047143e-05, "loss": 0.9771, "mean_token_accuracy": 0.7765941433608532, "num_tokens": 164896393.0, "step": 2240, "train_ppl": 2.656623 }, { "ce_loss": 1.0023, "epoch": 0.3255738238645613, "grad_norm": 1.046875, "hf_loss_ratio": 1.0, "learning_rate": 2.0865284201103983e-05, "loss": 1.0023, "mean_token_accuracy": 0.7708912000060082, "num_tokens": 165627341.0, "step": 2250, "train_ppl": 2.724545 }, { "ce_loss": 0.9689, "epoch": 0.32702081863729265, "grad_norm": 1.3125, "hf_loss_ratio": 1.0, "learning_rate": 2.0820528121736536e-05, "loss": 0.9689, "mean_token_accuracy": 0.7807579897344112, "num_tokens": 166354943.0, "step": 2260, "train_ppl": 2.635139 }, { "ce_loss": 1.0493, "epoch": 0.32846781341002407, "grad_norm": 1.046875, "hf_loss_ratio": 1.0, "learning_rate": 2.0775772042369088e-05, "loss": 1.0493, "mean_token_accuracy": 0.7613647289574146, "num_tokens": 167066270.0, "step": 2270, "train_ppl": 2.855513 }, { "ce_loss": 0.9991, "epoch": 0.3299148081827554, "grad_norm": 1.0234375, "hf_loss_ratio": 1.0, "learning_rate": 2.0731015963001644e-05, "loss": 0.9991, "mean_token_accuracy": 0.7712046861648559, "num_tokens": 167801986.0, "step": 2280, "train_ppl": 2.715823 }, { "ce_loss": 0.9657, "epoch": 0.33136180295548684, "grad_norm": 1.078125, "hf_loss_ratio": 1.0, "learning_rate": 2.0686259883634193e-05, "loss": 0.9657, "mean_token_accuracy": 0.7770779870450497, "num_tokens": 168554289.0, "step": 2290, "train_ppl": 2.626717 }, { "ce_loss": 0.9849, "epoch": 0.3328087977282182, "grad_norm": 0.953125, "hf_loss_ratio": 1.0, "learning_rate": 2.0641503804266745e-05, "loss": 0.9849, "mean_token_accuracy": 0.7736143194139004, "num_tokens": 169286476.0, "step": 2300, "train_ppl": 2.677655 }, { "ce_loss": 0.9921, "epoch": 0.3342557925009496, "grad_norm": 1.0703125, "hf_loss_ratio": 1.0, "learning_rate": 2.05967477248993e-05, "loss": 0.9921, "mean_token_accuracy": 0.7730519793927669, "num_tokens": 170017128.0, "step": 2310, "train_ppl": 2.696846 }, { "ce_loss": 0.9767, "epoch": 0.33570278727368097, "grad_norm": 0.97265625, "hf_loss_ratio": 1.0, "learning_rate": 2.055199164553185e-05, "loss": 0.9767, "mean_token_accuracy": 0.7729025609791279, "num_tokens": 170740098.0, "step": 2320, "train_ppl": 2.655607 }, { "ce_loss": 0.9937, "epoch": 0.3371497820464124, "grad_norm": 0.91796875, "hf_loss_ratio": 1.0, "learning_rate": 2.0507235566164406e-05, "loss": 0.9937, "mean_token_accuracy": 0.7697398900985718, "num_tokens": 171468647.0, "step": 2330, "train_ppl": 2.701241 }, { "ce_loss": 0.9793, "epoch": 0.33859677681914374, "grad_norm": 0.85546875, "hf_loss_ratio": 1.0, "learning_rate": 2.0462479486796955e-05, "loss": 0.9793, "mean_token_accuracy": 0.7745302498340607, "num_tokens": 172205055.0, "step": 2340, "train_ppl": 2.662539 }, { "ce_loss": 0.9681, "epoch": 0.3400437715918751, "grad_norm": 1.1796875, "hf_loss_ratio": 1.0, "learning_rate": 2.041772340742951e-05, "loss": 0.9681, "mean_token_accuracy": 0.7831182412803173, "num_tokens": 172927359.0, "step": 2350, "train_ppl": 2.633018 }, { "ce_loss": 0.9964, "epoch": 0.3414907663646065, "grad_norm": 1.3515625, "hf_loss_ratio": 1.0, "learning_rate": 2.0372967328062063e-05, "loss": 0.9964, "mean_token_accuracy": 0.7754109688103199, "num_tokens": 173673857.0, "step": 2360, "train_ppl": 2.708586 }, { "ce_loss": 0.9587, "epoch": 0.34293776113733787, "grad_norm": 0.83203125, "hf_loss_ratio": 1.0, "learning_rate": 2.0328211248694613e-05, "loss": 0.9587, "mean_token_accuracy": 0.779682033509016, "num_tokens": 174453403.0, "step": 2370, "train_ppl": 2.608364 }, { "ce_loss": 0.9886, "epoch": 0.3443847559100693, "grad_norm": 1.0390625, "hf_loss_ratio": 1.0, "learning_rate": 2.028345516932717e-05, "loss": 0.9886, "mean_token_accuracy": 0.7737836137413978, "num_tokens": 175185041.0, "step": 2380, "train_ppl": 2.687588 }, { "ce_loss": 1.0085, "epoch": 0.34583175068280064, "grad_norm": 1.4765625, "hf_loss_ratio": 1.0, "learning_rate": 2.023869908995972e-05, "loss": 1.0085, "mean_token_accuracy": 0.7715661711990833, "num_tokens": 175943212.0, "step": 2390, "train_ppl": 2.741487 }, { "ce_loss": 0.9599, "epoch": 0.34727874545553206, "grad_norm": 1.1484375, "hf_loss_ratio": 1.0, "learning_rate": 2.0193943010592273e-05, "loss": 0.9599, "mean_token_accuracy": 0.7831589214503765, "num_tokens": 176663659.0, "step": 2400, "train_ppl": 2.611419 }, { "ce_loss": 0.9629, "epoch": 0.3487257402282634, "grad_norm": 1.0234375, "hf_loss_ratio": 1.0, "learning_rate": 2.0149186931224826e-05, "loss": 0.9629, "mean_token_accuracy": 0.7757728450000286, "num_tokens": 177369018.0, "step": 2410, "train_ppl": 2.61941 }, { "ce_loss": 1.0039, "epoch": 0.35017273500099483, "grad_norm": 0.984375, "hf_loss_ratio": 1.0, "learning_rate": 2.0104430851857378e-05, "loss": 1.0039, "mean_token_accuracy": 0.7666012078523636, "num_tokens": 178089918.0, "step": 2420, "train_ppl": 2.728987 }, { "ce_loss": 0.9237, "epoch": 0.3516197297737262, "grad_norm": 0.9375, "hf_loss_ratio": 1.0, "learning_rate": 2.005967477248993e-05, "loss": 0.9237, "mean_token_accuracy": 0.7838417246937752, "num_tokens": 178829829.0, "step": 2430, "train_ppl": 2.518548 }, { "ce_loss": 0.9632, "epoch": 0.3530667245464576, "grad_norm": 1.125, "hf_loss_ratio": 1.0, "learning_rate": 2.0014918693122483e-05, "loss": 0.9632, "mean_token_accuracy": 0.7799612589180469, "num_tokens": 179584153.0, "step": 2440, "train_ppl": 2.620184 }, { "ce_loss": 0.9362, "epoch": 0.35451371931918896, "grad_norm": 0.9375, "hf_loss_ratio": 1.0, "learning_rate": 1.9970162613755035e-05, "loss": 0.9362, "mean_token_accuracy": 0.7820769309997558, "num_tokens": 180331127.0, "step": 2450, "train_ppl": 2.550154 }, { "ce_loss": 1.0117, "epoch": 0.3559607140919203, "grad_norm": 0.8828125, "hf_loss_ratio": 1.0, "learning_rate": 1.9925406534387588e-05, "loss": 1.0117, "mean_token_accuracy": 0.771592228859663, "num_tokens": 181067782.0, "step": 2460, "train_ppl": 2.750146 }, { "ce_loss": 0.9859, "epoch": 0.35740770886465173, "grad_norm": 1.0234375, "hf_loss_ratio": 1.0, "learning_rate": 1.988065045502014e-05, "loss": 0.9859, "mean_token_accuracy": 0.7738970972597599, "num_tokens": 181793714.0, "step": 2470, "train_ppl": 2.680159 }, { "ce_loss": 0.962, "epoch": 0.3588547036373831, "grad_norm": 0.96875, "hf_loss_ratio": 1.0, "learning_rate": 1.9835894375652693e-05, "loss": 0.962, "mean_token_accuracy": 0.7789099134504796, "num_tokens": 182531886.0, "step": 2480, "train_ppl": 2.616999 }, { "ce_loss": 0.9957, "epoch": 0.3603016984101145, "grad_norm": 0.953125, "hf_loss_ratio": 1.0, "learning_rate": 1.9791138296285245e-05, "loss": 0.9957, "mean_token_accuracy": 0.7706431902945041, "num_tokens": 183300557.0, "step": 2490, "train_ppl": 2.706542 }, { "ce_loss": 0.96, "epoch": 0.36174869318284586, "grad_norm": 1.0703125, "hf_loss_ratio": 1.0, "learning_rate": 1.97463822169178e-05, "loss": 0.96, "mean_token_accuracy": 0.7810012176632881, "num_tokens": 184029451.0, "step": 2500, "train_ppl": 2.611579 }, { "ce_loss": 0.9386, "epoch": 0.3631956879555773, "grad_norm": 1.296875, "hf_loss_ratio": 1.0, "learning_rate": 1.970162613755035e-05, "loss": 0.9386, "mean_token_accuracy": 0.7798774808645248, "num_tokens": 184746003.0, "step": 2510, "train_ppl": 2.556315 }, { "ce_loss": 0.9735, "epoch": 0.36464268272830863, "grad_norm": 0.92578125, "hf_loss_ratio": 1.0, "learning_rate": 1.9656870058182903e-05, "loss": 0.9735, "mean_token_accuracy": 0.7773295849561691, "num_tokens": 185472125.0, "step": 2520, "train_ppl": 2.647223 }, { "ce_loss": 0.9715, "epoch": 0.36608967750104005, "grad_norm": 0.859375, "hf_loss_ratio": 1.0, "learning_rate": 1.9612113978815455e-05, "loss": 0.9715, "mean_token_accuracy": 0.7736013270914555, "num_tokens": 186174697.0, "step": 2530, "train_ppl": 2.641837 }, { "ce_loss": 0.9793, "epoch": 0.3675366722737714, "grad_norm": 0.85546875, "hf_loss_ratio": 1.0, "learning_rate": 1.9567357899448007e-05, "loss": 0.9793, "mean_token_accuracy": 0.7726230010390281, "num_tokens": 186899192.0, "step": 2540, "train_ppl": 2.662494 }, { "ce_loss": 0.9658, "epoch": 0.3689836670465028, "grad_norm": 0.98046875, "hf_loss_ratio": 1.0, "learning_rate": 1.9522601820080563e-05, "loss": 0.9658, "mean_token_accuracy": 0.7793243020772934, "num_tokens": 187634580.0, "step": 2550, "train_ppl": 2.626758 }, { "ce_loss": 0.965, "epoch": 0.3704306618192342, "grad_norm": 0.94140625, "hf_loss_ratio": 1.0, "learning_rate": 1.9477845740713112e-05, "loss": 0.965, "mean_token_accuracy": 0.7768558643758297, "num_tokens": 188388282.0, "step": 2560, "train_ppl": 2.62484 }, { "ce_loss": 0.994, "epoch": 0.3718776565919656, "grad_norm": 1.09375, "hf_loss_ratio": 1.0, "learning_rate": 1.9433089661345668e-05, "loss": 0.994, "mean_token_accuracy": 0.7724675111472606, "num_tokens": 189139246.0, "step": 2570, "train_ppl": 2.701906 }, { "ce_loss": 0.9555, "epoch": 0.37332465136469695, "grad_norm": 0.9765625, "hf_loss_ratio": 1.0, "learning_rate": 1.938833358197822e-05, "loss": 0.9555, "mean_token_accuracy": 0.7806055322289467, "num_tokens": 189883875.0, "step": 2580, "train_ppl": 2.599917 }, { "ce_loss": 0.9659, "epoch": 0.3747716461374283, "grad_norm": 1.1875, "hf_loss_ratio": 1.0, "learning_rate": 1.934357750261077e-05, "loss": 0.9659, "mean_token_accuracy": 0.7724411226809025, "num_tokens": 190614990.0, "step": 2590, "train_ppl": 2.627258 }, { "ce_loss": 0.989, "epoch": 0.3762186409101597, "grad_norm": 1.015625, "hf_loss_ratio": 1.0, "learning_rate": 1.9298821423243326e-05, "loss": 0.989, "mean_token_accuracy": 0.7706497214734555, "num_tokens": 191328905.0, "step": 2600, "train_ppl": 2.688509 }, { "ce_loss": 0.9799, "epoch": 0.3776656356828911, "grad_norm": 1.015625, "hf_loss_ratio": 1.0, "learning_rate": 1.9254065343875878e-05, "loss": 0.9799, "mean_token_accuracy": 0.7754726015031338, "num_tokens": 192110447.0, "step": 2610, "train_ppl": 2.664275 }, { "ce_loss": 0.9918, "epoch": 0.3791126304556225, "grad_norm": 1.046875, "hf_loss_ratio": 1.0, "learning_rate": 1.920930926450843e-05, "loss": 0.9918, "mean_token_accuracy": 0.7714382395148277, "num_tokens": 192833107.0, "step": 2620, "train_ppl": 2.696216 }, { "ce_loss": 0.9743, "epoch": 0.38055962522835385, "grad_norm": 1.046875, "hf_loss_ratio": 1.0, "learning_rate": 1.9164553185140983e-05, "loss": 0.9743, "mean_token_accuracy": 0.7756662987172603, "num_tokens": 193562730.0, "step": 2630, "train_ppl": 2.649196 }, { "ce_loss": 0.9543, "epoch": 0.38200662000108526, "grad_norm": 1.0390625, "hf_loss_ratio": 1.0, "learning_rate": 1.9119797105773532e-05, "loss": 0.9543, "mean_token_accuracy": 0.7818400040268898, "num_tokens": 194291195.0, "step": 2640, "train_ppl": 2.596973 }, { "ce_loss": 0.9645, "epoch": 0.3834536147738166, "grad_norm": 0.84375, "hf_loss_ratio": 1.0, "learning_rate": 1.9075041026406088e-05, "loss": 0.9645, "mean_token_accuracy": 0.778757381439209, "num_tokens": 195035036.0, "step": 2650, "train_ppl": 2.623353 }, { "ce_loss": 0.9554, "epoch": 0.38490060954654803, "grad_norm": 1.109375, "hf_loss_ratio": 1.0, "learning_rate": 1.903028494703864e-05, "loss": 0.9554, "mean_token_accuracy": 0.7815173707902432, "num_tokens": 195753802.0, "step": 2660, "train_ppl": 2.599595 }, { "ce_loss": 0.9807, "epoch": 0.3863476043192794, "grad_norm": 1.1953125, "hf_loss_ratio": 1.0, "learning_rate": 1.8985528867671193e-05, "loss": 0.9807, "mean_token_accuracy": 0.7753617249429225, "num_tokens": 196473205.0, "step": 2670, "train_ppl": 2.666363 }, { "ce_loss": 1.0086, "epoch": 0.3877945990920108, "grad_norm": 1.015625, "hf_loss_ratio": 1.0, "learning_rate": 1.8940772788303745e-05, "loss": 1.0086, "mean_token_accuracy": 0.7668839745223522, "num_tokens": 197209393.0, "step": 2680, "train_ppl": 2.741868 }, { "ce_loss": 0.9412, "epoch": 0.38924159386474216, "grad_norm": 1.0, "hf_loss_ratio": 1.0, "learning_rate": 1.8896016708936298e-05, "loss": 0.9412, "mean_token_accuracy": 0.7830228976905346, "num_tokens": 197950507.0, "step": 2690, "train_ppl": 2.56312 }, { "ce_loss": 0.9285, "epoch": 0.3906885886374735, "grad_norm": 1.03125, "hf_loss_ratio": 1.0, "learning_rate": 1.885126062956885e-05, "loss": 0.9285, "mean_token_accuracy": 0.7872582785785198, "num_tokens": 198707373.0, "step": 2700, "train_ppl": 2.530723 }, { "ce_loss": 1.004, "epoch": 0.39213558341020494, "grad_norm": 0.96875, "hf_loss_ratio": 1.0, "learning_rate": 1.8806504550201402e-05, "loss": 1.004, "mean_token_accuracy": 0.7696459926664829, "num_tokens": 199432253.0, "step": 2710, "train_ppl": 2.729275 }, { "ce_loss": 0.9438, "epoch": 0.3935825781829363, "grad_norm": 0.8984375, "hf_loss_ratio": 1.0, "learning_rate": 1.8761748470833958e-05, "loss": 0.9438, "mean_token_accuracy": 0.7834368832409382, "num_tokens": 200205289.0, "step": 2720, "train_ppl": 2.569663 }, { "ce_loss": 0.9668, "epoch": 0.3950295729556677, "grad_norm": 0.96875, "hf_loss_ratio": 1.0, "learning_rate": 1.8716992391466507e-05, "loss": 0.9668, "mean_token_accuracy": 0.7788598984479904, "num_tokens": 200948293.0, "step": 2730, "train_ppl": 2.629388 }, { "ce_loss": 0.9844, "epoch": 0.39647656772839907, "grad_norm": 1.0546875, "hf_loss_ratio": 1.0, "learning_rate": 1.867223631209906e-05, "loss": 0.9844, "mean_token_accuracy": 0.7698593437671661, "num_tokens": 201693594.0, "step": 2740, "train_ppl": 2.676329 }, { "ce_loss": 0.9749, "epoch": 0.3979235625011305, "grad_norm": 0.94140625, "hf_loss_ratio": 1.0, "learning_rate": 1.8627480232731612e-05, "loss": 0.9749, "mean_token_accuracy": 0.7773583248257637, "num_tokens": 202425022.0, "step": 2750, "train_ppl": 2.650845 }, { "ce_loss": 0.969, "epoch": 0.39937055727386184, "grad_norm": 1.09375, "hf_loss_ratio": 1.0, "learning_rate": 1.8582724153364165e-05, "loss": 0.969, "mean_token_accuracy": 0.7747991502285003, "num_tokens": 203166750.0, "step": 2760, "train_ppl": 2.635431 }, { "ce_loss": 0.9665, "epoch": 0.40081755204659325, "grad_norm": 1.15625, "hf_loss_ratio": 1.0, "learning_rate": 1.853796807399672e-05, "loss": 0.9665, "mean_token_accuracy": 0.773398594558239, "num_tokens": 203882390.0, "step": 2770, "train_ppl": 2.628676 }, { "ce_loss": 0.9587, "epoch": 0.4022645468193246, "grad_norm": 1.125, "hf_loss_ratio": 1.0, "learning_rate": 1.849321199462927e-05, "loss": 0.9587, "mean_token_accuracy": 0.7789006575942039, "num_tokens": 204626671.0, "step": 2780, "train_ppl": 2.608222 }, { "ce_loss": 0.9712, "epoch": 0.403711541592056, "grad_norm": 0.94140625, "hf_loss_ratio": 1.0, "learning_rate": 1.8448455915261825e-05, "loss": 0.9712, "mean_token_accuracy": 0.7756584413349629, "num_tokens": 205353873.0, "step": 2790, "train_ppl": 2.641169 }, { "ce_loss": 0.9684, "epoch": 0.4051585363647874, "grad_norm": 1.0078125, "hf_loss_ratio": 1.0, "learning_rate": 1.8403699835894378e-05, "loss": 0.9684, "mean_token_accuracy": 0.7775221608579159, "num_tokens": 206089475.0, "step": 2800, "train_ppl": 2.63379 }, { "ce_loss": 1.0109, "epoch": 0.40660553113751874, "grad_norm": 1.0625, "hf_loss_ratio": 1.0, "learning_rate": 1.8358943756526927e-05, "loss": 1.0109, "mean_token_accuracy": 0.7700402162969112, "num_tokens": 206830670.0, "step": 2810, "train_ppl": 2.747938 }, { "ce_loss": 0.945, "epoch": 0.40805252591025015, "grad_norm": 1.0703125, "hf_loss_ratio": 1.0, "learning_rate": 1.8314187677159483e-05, "loss": 0.945, "mean_token_accuracy": 0.7814373821020126, "num_tokens": 207591527.0, "step": 2820, "train_ppl": 2.572862 }, { "ce_loss": 0.9544, "epoch": 0.4094995206829815, "grad_norm": 0.99609375, "hf_loss_ratio": 1.0, "learning_rate": 1.8269431597792032e-05, "loss": 0.9544, "mean_token_accuracy": 0.7797525011003017, "num_tokens": 208339441.0, "step": 2830, "train_ppl": 2.597219 }, { "ce_loss": 0.9706, "epoch": 0.4109465154557129, "grad_norm": 1.015625, "hf_loss_ratio": 1.0, "learning_rate": 1.8224675518424588e-05, "loss": 0.9706, "mean_token_accuracy": 0.7762934103608131, "num_tokens": 209078453.0, "step": 2840, "train_ppl": 2.639582 }, { "ce_loss": 0.9529, "epoch": 0.4123935102284443, "grad_norm": 1.359375, "hf_loss_ratio": 1.0, "learning_rate": 1.817991943905714e-05, "loss": 0.9529, "mean_token_accuracy": 0.7769104249775409, "num_tokens": 209817755.0, "step": 2850, "train_ppl": 2.593285 }, { "ce_loss": 0.9647, "epoch": 0.4138405050011757, "grad_norm": 0.984375, "hf_loss_ratio": 1.0, "learning_rate": 1.813516335968969e-05, "loss": 0.9647, "mean_token_accuracy": 0.7746372953057289, "num_tokens": 210572147.0, "step": 2860, "train_ppl": 2.624049 }, { "ce_loss": 0.9791, "epoch": 0.41528749977390705, "grad_norm": 1.0390625, "hf_loss_ratio": 1.0, "learning_rate": 1.8090407280322245e-05, "loss": 0.9791, "mean_token_accuracy": 0.7739841856062413, "num_tokens": 211317422.0, "step": 2870, "train_ppl": 2.662128 }, { "ce_loss": 0.9535, "epoch": 0.41673449454663847, "grad_norm": 1.0390625, "hf_loss_ratio": 1.0, "learning_rate": 1.8045651200954797e-05, "loss": 0.9535, "mean_token_accuracy": 0.7812499180436134, "num_tokens": 212076246.0, "step": 2880, "train_ppl": 2.594664 }, { "ce_loss": 0.989, "epoch": 0.4181814893193698, "grad_norm": 1.0390625, "hf_loss_ratio": 1.0, "learning_rate": 1.800089512158735e-05, "loss": 0.989, "mean_token_accuracy": 0.7691139645874501, "num_tokens": 212763964.0, "step": 2890, "train_ppl": 2.688652 }, { "ce_loss": 0.952, "epoch": 0.41962848409210124, "grad_norm": 0.95703125, "hf_loss_ratio": 1.0, "learning_rate": 1.7956139042219902e-05, "loss": 0.952, "mean_token_accuracy": 0.777950644493103, "num_tokens": 213512388.0, "step": 2900, "train_ppl": 2.590762 }, { "ce_loss": 0.9988, "epoch": 0.4210754788648326, "grad_norm": 1.03125, "hf_loss_ratio": 1.0, "learning_rate": 1.7911382962852455e-05, "loss": 0.9988, "mean_token_accuracy": 0.7697994232177734, "num_tokens": 214220646.0, "step": 2910, "train_ppl": 2.715134 }, { "ce_loss": 0.9738, "epoch": 0.422522473637564, "grad_norm": 1.109375, "hf_loss_ratio": 1.0, "learning_rate": 1.7866626883485007e-05, "loss": 0.9738, "mean_token_accuracy": 0.7759139001369476, "num_tokens": 214925657.0, "step": 2920, "train_ppl": 2.647943 }, { "ce_loss": 0.9857, "epoch": 0.42396946841029537, "grad_norm": 1.0546875, "hf_loss_ratio": 1.0, "learning_rate": 1.782187080411756e-05, "loss": 0.9857, "mean_token_accuracy": 0.7746396206319333, "num_tokens": 215622023.0, "step": 2930, "train_ppl": 2.679806 }, { "ce_loss": 0.9942, "epoch": 0.4254164631830267, "grad_norm": 1.15625, "hf_loss_ratio": 1.0, "learning_rate": 1.7777114724750112e-05, "loss": 0.9942, "mean_token_accuracy": 0.7746829591691494, "num_tokens": 216363572.0, "step": 2940, "train_ppl": 2.702513 }, { "ce_loss": 0.9358, "epoch": 0.42686345795575814, "grad_norm": 1.015625, "hf_loss_ratio": 1.0, "learning_rate": 1.7732358645382665e-05, "loss": 0.9358, "mean_token_accuracy": 0.7809817381203175, "num_tokens": 217117940.0, "step": 2950, "train_ppl": 2.549177 }, { "ce_loss": 0.9511, "epoch": 0.4283104527284895, "grad_norm": 1.15625, "hf_loss_ratio": 1.0, "learning_rate": 1.7687602566015217e-05, "loss": 0.9511, "mean_token_accuracy": 0.774829763174057, "num_tokens": 217882702.0, "step": 2960, "train_ppl": 2.588437 }, { "ce_loss": 0.9726, "epoch": 0.4297574475012209, "grad_norm": 0.99609375, "hf_loss_ratio": 1.0, "learning_rate": 1.764284648664777e-05, "loss": 0.9726, "mean_token_accuracy": 0.7748524136841297, "num_tokens": 218610599.0, "step": 2970, "train_ppl": 2.64482 }, { "ce_loss": 0.9812, "epoch": 0.43120444227395227, "grad_norm": 1.0703125, "hf_loss_ratio": 1.0, "learning_rate": 1.7598090407280322e-05, "loss": 0.9812, "mean_token_accuracy": 0.7769106313586235, "num_tokens": 219344239.0, "step": 2980, "train_ppl": 2.667774 }, { "ce_loss": 0.9636, "epoch": 0.4326514370466837, "grad_norm": 1.125, "hf_loss_ratio": 1.0, "learning_rate": 1.7553334327912878e-05, "loss": 0.9636, "mean_token_accuracy": 0.7774206228554249, "num_tokens": 220070330.0, "step": 2990, "train_ppl": 2.621097 }, { "ce_loss": 0.9503, "epoch": 0.43409843181941504, "grad_norm": 1.03125, "hf_loss_ratio": 1.0, "learning_rate": 1.7508578248545427e-05, "loss": 0.9503, "mean_token_accuracy": 0.7805333323776722, "num_tokens": 220786645.0, "step": 3000, "train_ppl": 2.586443 }, { "ce_loss": 0.9727, "epoch": 0.43554542659214646, "grad_norm": 1.078125, "hf_loss_ratio": 1.0, "learning_rate": 1.746382216917798e-05, "loss": 0.9727, "mean_token_accuracy": 0.7798659265041351, "num_tokens": 221501835.0, "step": 3010, "train_ppl": 2.644989 }, { "ce_loss": 0.976, "epoch": 0.4369924213648778, "grad_norm": 0.984375, "hf_loss_ratio": 1.0, "learning_rate": 1.741906608981053e-05, "loss": 0.976, "mean_token_accuracy": 0.7753879025578498, "num_tokens": 222228551.0, "step": 3020, "train_ppl": 2.65379 }, { "ce_loss": 0.9761, "epoch": 0.43843941613760923, "grad_norm": 0.94140625, "hf_loss_ratio": 1.0, "learning_rate": 1.7374310010443084e-05, "loss": 0.9761, "mean_token_accuracy": 0.7760777927935123, "num_tokens": 222946933.0, "step": 3030, "train_ppl": 2.654151 }, { "ce_loss": 0.9944, "epoch": 0.4398864109103406, "grad_norm": 0.98046875, "hf_loss_ratio": 1.0, "learning_rate": 1.732955393107564e-05, "loss": 0.9944, "mean_token_accuracy": 0.7701233983039856, "num_tokens": 223687091.0, "step": 3040, "train_ppl": 2.703226 }, { "ce_loss": 0.9391, "epoch": 0.44133340568307194, "grad_norm": 0.97265625, "hf_loss_ratio": 1.0, "learning_rate": 1.728479785170819e-05, "loss": 0.9391, "mean_token_accuracy": 0.7819373540580272, "num_tokens": 224415889.0, "step": 3050, "train_ppl": 2.557619 }, { "ce_loss": 0.9311, "epoch": 0.44278040045580336, "grad_norm": 0.8828125, "hf_loss_ratio": 1.0, "learning_rate": 1.7240041772340745e-05, "loss": 0.9311, "mean_token_accuracy": 0.7835486814379692, "num_tokens": 225175613.0, "step": 3060, "train_ppl": 2.537334 }, { "ce_loss": 0.9712, "epoch": 0.4442273952285347, "grad_norm": 1.015625, "hf_loss_ratio": 1.0, "learning_rate": 1.7195285692973297e-05, "loss": 0.9712, "mean_token_accuracy": 0.7758528731763363, "num_tokens": 225931362.0, "step": 3070, "train_ppl": 2.641217 }, { "ce_loss": 0.9468, "epoch": 0.44567439000126613, "grad_norm": 0.9140625, "hf_loss_ratio": 1.0, "learning_rate": 1.7150529613605846e-05, "loss": 0.9468, "mean_token_accuracy": 0.7813886523246765, "num_tokens": 226658710.0, "step": 3080, "train_ppl": 2.577371 }, { "ce_loss": 0.9776, "epoch": 0.4471213847739975, "grad_norm": 1.2265625, "hf_loss_ratio": 1.0, "learning_rate": 1.7105773534238402e-05, "loss": 0.9776, "mean_token_accuracy": 0.7746784225106239, "num_tokens": 227404471.0, "step": 3090, "train_ppl": 2.658194 }, { "ce_loss": 0.9739, "epoch": 0.4485683795467289, "grad_norm": 1.078125, "hf_loss_ratio": 1.0, "learning_rate": 1.7061017454870955e-05, "loss": 0.9739, "mean_token_accuracy": 0.7733561553061008, "num_tokens": 228132005.0, "step": 3100, "train_ppl": 2.648246 }, { "ce_loss": 0.9602, "epoch": 0.45001537431946026, "grad_norm": 0.88671875, "hf_loss_ratio": 1.0, "learning_rate": 1.7016261375503507e-05, "loss": 0.9602, "mean_token_accuracy": 0.7756247140467167, "num_tokens": 228859507.0, "step": 3110, "train_ppl": 2.612151 }, { "ce_loss": 0.979, "epoch": 0.4514623690921917, "grad_norm": 1.1328125, "hf_loss_ratio": 1.0, "learning_rate": 1.697150529613606e-05, "loss": 0.979, "mean_token_accuracy": 0.7758997343480587, "num_tokens": 229580037.0, "step": 3120, "train_ppl": 2.661712 }, { "ce_loss": 0.9772, "epoch": 0.45290936386492303, "grad_norm": 1.0078125, "hf_loss_ratio": 1.0, "learning_rate": 1.692674921676861e-05, "loss": 0.9772, "mean_token_accuracy": 0.7744156174361706, "num_tokens": 230322304.0, "step": 3130, "train_ppl": 2.657003 }, { "ce_loss": 0.9562, "epoch": 0.45435635863765444, "grad_norm": 1.109375, "hf_loss_ratio": 1.0, "learning_rate": 1.6881993137401164e-05, "loss": 0.9562, "mean_token_accuracy": 0.7790285974740982, "num_tokens": 231059980.0, "step": 3140, "train_ppl": 2.601828 }, { "ce_loss": 0.9527, "epoch": 0.4558033534103858, "grad_norm": 0.9609375, "hf_loss_ratio": 1.0, "learning_rate": 1.6837237058033717e-05, "loss": 0.9527, "mean_token_accuracy": 0.7776475623250008, "num_tokens": 231819587.0, "step": 3150, "train_ppl": 2.592802 }, { "ce_loss": 0.9886, "epoch": 0.45725034818311716, "grad_norm": 1.1015625, "hf_loss_ratio": 1.0, "learning_rate": 1.679248097866627e-05, "loss": 0.9886, "mean_token_accuracy": 0.7710159003734589, "num_tokens": 232549725.0, "step": 3160, "train_ppl": 2.687503 }, { "ce_loss": 0.9606, "epoch": 0.4586973429558486, "grad_norm": 0.9765625, "hf_loss_ratio": 1.0, "learning_rate": 1.6747724899298822e-05, "loss": 0.9606, "mean_token_accuracy": 0.7811665050685406, "num_tokens": 233291132.0, "step": 3170, "train_ppl": 2.613236 }, { "ce_loss": 0.9511, "epoch": 0.46014433772857993, "grad_norm": 1.0234375, "hf_loss_ratio": 1.0, "learning_rate": 1.6702968819931374e-05, "loss": 0.9511, "mean_token_accuracy": 0.7800517350435257, "num_tokens": 234041516.0, "step": 3180, "train_ppl": 2.588567 }, { "ce_loss": 0.924, "epoch": 0.46159133250131135, "grad_norm": 0.91796875, "hf_loss_ratio": 1.0, "learning_rate": 1.6658212740563927e-05, "loss": 0.924, "mean_token_accuracy": 0.7832289874553681, "num_tokens": 234793582.0, "step": 3190, "train_ppl": 2.519274 }, { "ce_loss": 1.01, "epoch": 0.4630383272740427, "grad_norm": 1.0859375, "hf_loss_ratio": 1.0, "learning_rate": 1.661345666119648e-05, "loss": 1.01, "mean_token_accuracy": 0.7669910915195942, "num_tokens": 235509780.0, "step": 3200, "train_ppl": 2.745611 }, { "ce_loss": 0.988, "epoch": 0.4644853220467741, "grad_norm": 1.0625, "hf_loss_ratio": 1.0, "learning_rate": 1.6568700581829035e-05, "loss": 0.988, "mean_token_accuracy": 0.7717112138867378, "num_tokens": 236219024.0, "step": 3210, "train_ppl": 2.685961 }, { "ce_loss": 0.9403, "epoch": 0.4659323168195055, "grad_norm": 0.96875, "hf_loss_ratio": 1.0, "learning_rate": 1.6523944502461584e-05, "loss": 0.9403, "mean_token_accuracy": 0.7790117606520652, "num_tokens": 236975108.0, "step": 3220, "train_ppl": 2.560643 }, { "ce_loss": 0.9728, "epoch": 0.4673793115922369, "grad_norm": 0.9921875, "hf_loss_ratio": 1.0, "learning_rate": 1.6479188423094136e-05, "loss": 0.9728, "mean_token_accuracy": 0.7795041255652905, "num_tokens": 237724462.0, "step": 3230, "train_ppl": 2.645343 }, { "ce_loss": 0.9416, "epoch": 0.46882630636496825, "grad_norm": 0.921875, "hf_loss_ratio": 1.0, "learning_rate": 1.643443234372669e-05, "loss": 0.9416, "mean_token_accuracy": 0.7821677893400192, "num_tokens": 238490711.0, "step": 3240, "train_ppl": 2.564148 }, { "ce_loss": 0.9657, "epoch": 0.47027330113769966, "grad_norm": 1.0625, "hf_loss_ratio": 1.0, "learning_rate": 1.638967626435924e-05, "loss": 0.9657, "mean_token_accuracy": 0.7754031218588352, "num_tokens": 239227350.0, "step": 3250, "train_ppl": 2.626516 }, { "ce_loss": 0.9453, "epoch": 0.471720295910431, "grad_norm": 1.03125, "hf_loss_ratio": 1.0, "learning_rate": 1.6344920184991797e-05, "loss": 0.9453, "mean_token_accuracy": 0.7826674081385135, "num_tokens": 239948015.0, "step": 3260, "train_ppl": 2.57358 }, { "ce_loss": 0.9745, "epoch": 0.47316729068316243, "grad_norm": 0.90625, "hf_loss_ratio": 1.0, "learning_rate": 1.6300164105624346e-05, "loss": 0.9745, "mean_token_accuracy": 0.7750352688133717, "num_tokens": 240720149.0, "step": 3270, "train_ppl": 2.649788 }, { "ce_loss": 0.9767, "epoch": 0.4746142854558938, "grad_norm": 1.1015625, "hf_loss_ratio": 1.0, "learning_rate": 1.6255408026256902e-05, "loss": 0.9767, "mean_token_accuracy": 0.7757932528853416, "num_tokens": 241430604.0, "step": 3280, "train_ppl": 2.655572 }, { "ce_loss": 0.9825, "epoch": 0.47606128022862515, "grad_norm": 0.96875, "hf_loss_ratio": 1.0, "learning_rate": 1.6210651946889455e-05, "loss": 0.9825, "mean_token_accuracy": 0.7717338934540748, "num_tokens": 242181967.0, "step": 3290, "train_ppl": 2.671143 }, { "ce_loss": 0.9452, "epoch": 0.47750827500135656, "grad_norm": 0.96484375, "hf_loss_ratio": 1.0, "learning_rate": 1.6165895867522004e-05, "loss": 0.9452, "mean_token_accuracy": 0.7806530050933361, "num_tokens": 242920132.0, "step": 3300, "train_ppl": 2.57345 }, { "ce_loss": 0.9595, "epoch": 0.4789552697740879, "grad_norm": 1.265625, "hf_loss_ratio": 1.0, "learning_rate": 1.612113978815456e-05, "loss": 0.9595, "mean_token_accuracy": 0.7763951353728771, "num_tokens": 243640350.0, "step": 3310, "train_ppl": 2.610434 }, { "ce_loss": 0.9676, "epoch": 0.48040226454681934, "grad_norm": 1.0234375, "hf_loss_ratio": 1.0, "learning_rate": 1.607638370878711e-05, "loss": 0.9676, "mean_token_accuracy": 0.774853790551424, "num_tokens": 244365334.0, "step": 3320, "train_ppl": 2.631576 }, { "ce_loss": 0.9558, "epoch": 0.4818492593195507, "grad_norm": 1.1796875, "hf_loss_ratio": 1.0, "learning_rate": 1.6031627629419664e-05, "loss": 0.9558, "mean_token_accuracy": 0.7763160079717636, "num_tokens": 245108674.0, "step": 3330, "train_ppl": 2.600818 }, { "ce_loss": 0.9885, "epoch": 0.4832962540922821, "grad_norm": 1.109375, "hf_loss_ratio": 1.0, "learning_rate": 1.5986871550052217e-05, "loss": 0.9885, "mean_token_accuracy": 0.7731200739741325, "num_tokens": 245851700.0, "step": 3340, "train_ppl": 2.687179 }, { "ce_loss": 0.9778, "epoch": 0.48474324886501347, "grad_norm": 1.078125, "hf_loss_ratio": 1.0, "learning_rate": 1.5942115470684766e-05, "loss": 0.9778, "mean_token_accuracy": 0.7771647915244102, "num_tokens": 246580552.0, "step": 3350, "train_ppl": 2.658483 }, { "ce_loss": 0.969, "epoch": 0.4861902436377449, "grad_norm": 1.1171875, "hf_loss_ratio": 1.0, "learning_rate": 1.589735939131732e-05, "loss": 0.969, "mean_token_accuracy": 0.7781485505402088, "num_tokens": 247303795.0, "step": 3360, "train_ppl": 2.635424 }, { "ce_loss": 0.9672, "epoch": 0.48763723841047624, "grad_norm": 1.015625, "hf_loss_ratio": 1.0, "learning_rate": 1.5852603311949874e-05, "loss": 0.9672, "mean_token_accuracy": 0.7760098949074745, "num_tokens": 248058038.0, "step": 3370, "train_ppl": 2.630652 }, { "ce_loss": 0.9829, "epoch": 0.48908423318320765, "grad_norm": 1.09375, "hf_loss_ratio": 1.0, "learning_rate": 1.5807847232582427e-05, "loss": 0.9829, "mean_token_accuracy": 0.774996928870678, "num_tokens": 248796994.0, "step": 3380, "train_ppl": 2.672328 }, { "ce_loss": 0.9999, "epoch": 0.490531227955939, "grad_norm": 1.0390625, "hf_loss_ratio": 1.0, "learning_rate": 1.576309115321498e-05, "loss": 0.9999, "mean_token_accuracy": 0.769992358237505, "num_tokens": 249528539.0, "step": 3390, "train_ppl": 2.717897 }, { "ce_loss": 0.9744, "epoch": 0.49197822272867037, "grad_norm": 1.25, "hf_loss_ratio": 1.0, "learning_rate": 1.571833507384753e-05, "loss": 0.9744, "mean_token_accuracy": 0.7775142967700959, "num_tokens": 250271300.0, "step": 3400, "train_ppl": 2.649573 }, { "ce_loss": 0.9612, "epoch": 0.4934252175014018, "grad_norm": 1.078125, "hf_loss_ratio": 1.0, "learning_rate": 1.5673578994480084e-05, "loss": 0.9612, "mean_token_accuracy": 0.7808264754712582, "num_tokens": 251018244.0, "step": 3410, "train_ppl": 2.614842 }, { "ce_loss": 0.9807, "epoch": 0.49487221227413314, "grad_norm": 1.0, "hf_loss_ratio": 1.0, "learning_rate": 1.5628822915112636e-05, "loss": 0.9807, "mean_token_accuracy": 0.7724880896508693, "num_tokens": 251737409.0, "step": 3420, "train_ppl": 2.666417 }, { "ce_loss": 0.9971, "epoch": 0.49631920704686455, "grad_norm": 1.125, "hf_loss_ratio": 1.0, "learning_rate": 1.558406683574519e-05, "loss": 0.9971, "mean_token_accuracy": 0.7721994496881962, "num_tokens": 252452177.0, "step": 3430, "train_ppl": 2.7103 }, { "ce_loss": 0.9659, "epoch": 0.4977662018195959, "grad_norm": 0.98828125, "hf_loss_ratio": 1.0, "learning_rate": 1.553931075637774e-05, "loss": 0.9659, "mean_token_accuracy": 0.7731683790683747, "num_tokens": 253164867.0, "step": 3440, "train_ppl": 2.62711 }, { "ce_loss": 0.9876, "epoch": 0.4992131965923273, "grad_norm": 0.96875, "hf_loss_ratio": 1.0, "learning_rate": 1.5494554677010294e-05, "loss": 0.9876, "mean_token_accuracy": 0.7709869779646397, "num_tokens": 253890732.0, "step": 3450, "train_ppl": 2.684681 }, { "ce_loss": 0.9918, "epoch": 0.5006601913650587, "grad_norm": 1.0703125, "hf_loss_ratio": 1.0, "learning_rate": 1.5449798597642846e-05, "loss": 0.9918, "mean_token_accuracy": 0.7687140062451363, "num_tokens": 254619763.0, "step": 3460, "train_ppl": 2.696074 }, { "ce_loss": 0.9504, "epoch": 0.50210718613779, "grad_norm": 0.94140625, "hf_loss_ratio": 1.0, "learning_rate": 1.54050425182754e-05, "loss": 0.9504, "mean_token_accuracy": 0.7793492712080479, "num_tokens": 255363436.0, "step": 3470, "train_ppl": 2.586716 }, { "ce_loss": 0.9599, "epoch": 0.5035541809105215, "grad_norm": 0.9296875, "hf_loss_ratio": 1.0, "learning_rate": 1.5360286438907954e-05, "loss": 0.9599, "mean_token_accuracy": 0.7774735637009144, "num_tokens": 256115802.0, "step": 3480, "train_ppl": 2.61146 }, { "ce_loss": 0.9649, "epoch": 0.5050011756832529, "grad_norm": 1.078125, "hf_loss_ratio": 1.0, "learning_rate": 1.5315530359540503e-05, "loss": 0.9649, "mean_token_accuracy": 0.7754439219832421, "num_tokens": 256842141.0, "step": 3490, "train_ppl": 2.62447 }, { "ce_loss": 0.9671, "epoch": 0.5064481704559842, "grad_norm": 1.1484375, "hf_loss_ratio": 1.0, "learning_rate": 1.527077428017306e-05, "loss": 0.9671, "mean_token_accuracy": 0.7746169321238995, "num_tokens": 257574760.0, "step": 3500, "train_ppl": 2.630219 }, { "ce_loss": 0.9834, "epoch": 0.5078951652287156, "grad_norm": 1.171875, "hf_loss_ratio": 1.0, "learning_rate": 1.5226018200805612e-05, "loss": 0.9834, "mean_token_accuracy": 0.7728622667491436, "num_tokens": 258285032.0, "step": 3510, "train_ppl": 2.673492 }, { "ce_loss": 0.9703, "epoch": 0.5093421600014469, "grad_norm": 1.1171875, "hf_loss_ratio": 1.0, "learning_rate": 1.5181262121438162e-05, "loss": 0.9703, "mean_token_accuracy": 0.7742777064442634, "num_tokens": 258999939.0, "step": 3520, "train_ppl": 2.638679 }, { "ce_loss": 0.9218, "epoch": 0.5107891547741784, "grad_norm": 0.9296875, "hf_loss_ratio": 1.0, "learning_rate": 1.5136506042070715e-05, "loss": 0.9218, "mean_token_accuracy": 0.7861278541386127, "num_tokens": 259763192.0, "step": 3530, "train_ppl": 2.513912 }, { "ce_loss": 0.9292, "epoch": 0.5122361495469098, "grad_norm": 0.9375, "hf_loss_ratio": 1.0, "learning_rate": 1.5091749962703266e-05, "loss": 0.9292, "mean_token_accuracy": 0.7805077292025089, "num_tokens": 260499543.0, "step": 3540, "train_ppl": 2.532375 }, { "ce_loss": 0.9898, "epoch": 0.5136831443196411, "grad_norm": 1.0078125, "hf_loss_ratio": 1.0, "learning_rate": 1.504699388333582e-05, "loss": 0.9898, "mean_token_accuracy": 0.7731637723743916, "num_tokens": 261254442.0, "step": 3550, "train_ppl": 2.690609 }, { "ce_loss": 0.9634, "epoch": 0.5151301390923725, "grad_norm": 1.0625, "hf_loss_ratio": 1.0, "learning_rate": 1.5002237803968374e-05, "loss": 0.9634, "mean_token_accuracy": 0.779674281924963, "num_tokens": 262015435.0, "step": 3560, "train_ppl": 2.620479 }, { "ce_loss": 0.9716, "epoch": 0.516577133865104, "grad_norm": 1.1171875, "hf_loss_ratio": 1.0, "learning_rate": 1.4957481724600926e-05, "loss": 0.9716, "mean_token_accuracy": 0.776695205271244, "num_tokens": 262693267.0, "step": 3570, "train_ppl": 2.642217 }, { "ce_loss": 1.0025, "epoch": 0.5180241286378353, "grad_norm": 0.94140625, "hf_loss_ratio": 1.0, "learning_rate": 1.4912725645233479e-05, "loss": 1.0025, "mean_token_accuracy": 0.7727914996445179, "num_tokens": 263442598.0, "step": 3580, "train_ppl": 2.725135 }, { "ce_loss": 0.9628, "epoch": 0.5194711234105667, "grad_norm": 1.046875, "hf_loss_ratio": 1.0, "learning_rate": 1.486796956586603e-05, "loss": 0.9628, "mean_token_accuracy": 0.7818873479962349, "num_tokens": 264210381.0, "step": 3590, "train_ppl": 2.618999 }, { "ce_loss": 0.9571, "epoch": 0.520918118183298, "grad_norm": 0.921875, "hf_loss_ratio": 1.0, "learning_rate": 1.4823213486498582e-05, "loss": 0.9571, "mean_token_accuracy": 0.7811072282493114, "num_tokens": 264954557.0, "step": 3600, "train_ppl": 2.60412 }, { "ce_loss": 0.9555, "epoch": 0.5223651129560295, "grad_norm": 1.046875, "hf_loss_ratio": 1.0, "learning_rate": 1.4778457407131136e-05, "loss": 0.9555, "mean_token_accuracy": 0.7785631224513054, "num_tokens": 265708667.0, "step": 3610, "train_ppl": 2.600049 }, { "ce_loss": 0.9794, "epoch": 0.5238121077287609, "grad_norm": 1.0, "hf_loss_ratio": 1.0, "learning_rate": 1.4733701327763689e-05, "loss": 0.9794, "mean_token_accuracy": 0.7781493321061135, "num_tokens": 266443298.0, "step": 3620, "train_ppl": 2.662788 }, { "ce_loss": 0.9757, "epoch": 0.5252591025014922, "grad_norm": 0.96484375, "hf_loss_ratio": 1.0, "learning_rate": 1.4688945248396241e-05, "loss": 0.9757, "mean_token_accuracy": 0.7720276661217212, "num_tokens": 267173324.0, "step": 3630, "train_ppl": 2.653105 }, { "ce_loss": 1.0308, "epoch": 0.5267060972742236, "grad_norm": 1.1953125, "hf_loss_ratio": 1.0, "learning_rate": 1.4644189169028794e-05, "loss": 1.0308, "mean_token_accuracy": 0.7638523608446122, "num_tokens": 267915944.0, "step": 3640, "train_ppl": 2.803437 }, { "ce_loss": 0.9602, "epoch": 0.5281530920469549, "grad_norm": 0.953125, "hf_loss_ratio": 1.0, "learning_rate": 1.4599433089661346e-05, "loss": 0.9602, "mean_token_accuracy": 0.7759406618773937, "num_tokens": 268643319.0, "step": 3650, "train_ppl": 2.612157 }, { "ce_loss": 0.9652, "epoch": 0.5296000868196864, "grad_norm": 1.0703125, "hf_loss_ratio": 1.0, "learning_rate": 1.4554677010293898e-05, "loss": 0.9652, "mean_token_accuracy": 0.779689010232687, "num_tokens": 269367307.0, "step": 3660, "train_ppl": 2.625382 }, { "ce_loss": 0.9504, "epoch": 0.5310470815924178, "grad_norm": 0.8828125, "hf_loss_ratio": 1.0, "learning_rate": 1.4509920930926451e-05, "loss": 0.9504, "mean_token_accuracy": 0.7774218022823334, "num_tokens": 270092592.0, "step": 3670, "train_ppl": 2.586776 }, { "ce_loss": 0.9583, "epoch": 0.5324940763651491, "grad_norm": 1.171875, "hf_loss_ratio": 1.0, "learning_rate": 1.4465164851559005e-05, "loss": 0.9583, "mean_token_accuracy": 0.7736941121518612, "num_tokens": 270860558.0, "step": 3680, "train_ppl": 2.60739 }, { "ce_loss": 0.9978, "epoch": 0.5339410711378805, "grad_norm": 1.0546875, "hf_loss_ratio": 1.0, "learning_rate": 1.4420408772191557e-05, "loss": 0.9978, "mean_token_accuracy": 0.7728485822677612, "num_tokens": 271584192.0, "step": 3690, "train_ppl": 2.712288 }, { "ce_loss": 1.0123, "epoch": 0.5353880659106119, "grad_norm": 1.15625, "hf_loss_ratio": 1.0, "learning_rate": 1.4375652692824108e-05, "loss": 1.0123, "mean_token_accuracy": 0.767830940335989, "num_tokens": 272333891.0, "step": 3700, "train_ppl": 2.751963 }, { "ce_loss": 0.9239, "epoch": 0.5368350606833433, "grad_norm": 1.046875, "hf_loss_ratio": 1.0, "learning_rate": 1.433089661345666e-05, "loss": 0.9239, "mean_token_accuracy": 0.7862473480403424, "num_tokens": 273099133.0, "step": 3710, "train_ppl": 2.51917 }, { "ce_loss": 0.958, "epoch": 0.5382820554560747, "grad_norm": 1.015625, "hf_loss_ratio": 1.0, "learning_rate": 1.4286140534089215e-05, "loss": 0.958, "mean_token_accuracy": 0.7815881177783013, "num_tokens": 273852553.0, "step": 3720, "train_ppl": 2.606516 }, { "ce_loss": 0.9936, "epoch": 0.539729050228806, "grad_norm": 0.91015625, "hf_loss_ratio": 1.0, "learning_rate": 1.4241384454721767e-05, "loss": 0.9936, "mean_token_accuracy": 0.7692437112331391, "num_tokens": 274580358.0, "step": 3730, "train_ppl": 2.700827 }, { "ce_loss": 0.9692, "epoch": 0.5411760450015375, "grad_norm": 0.9375, "hf_loss_ratio": 1.0, "learning_rate": 1.419662837535432e-05, "loss": 0.9692, "mean_token_accuracy": 0.7750534601509571, "num_tokens": 275333561.0, "step": 3740, "train_ppl": 2.635919 }, { "ce_loss": 0.9531, "epoch": 0.5426230397742688, "grad_norm": 0.98046875, "hf_loss_ratio": 1.0, "learning_rate": 1.415187229598687e-05, "loss": 0.9531, "mean_token_accuracy": 0.7767747581005097, "num_tokens": 276083858.0, "step": 3750, "train_ppl": 2.593638 }, { "ce_loss": 0.9443, "epoch": 0.5440700345470002, "grad_norm": 1.0859375, "hf_loss_ratio": 1.0, "learning_rate": 1.4107116216619425e-05, "loss": 0.9443, "mean_token_accuracy": 0.7835570797324181, "num_tokens": 276851059.0, "step": 3760, "train_ppl": 2.570927 }, { "ce_loss": 0.9737, "epoch": 0.5455170293197316, "grad_norm": 1.03125, "hf_loss_ratio": 1.0, "learning_rate": 1.4062360137251977e-05, "loss": 0.9737, "mean_token_accuracy": 0.776416502147913, "num_tokens": 277581787.0, "step": 3770, "train_ppl": 2.647673 }, { "ce_loss": 0.9387, "epoch": 0.5469640240924629, "grad_norm": 1.0078125, "hf_loss_ratio": 1.0, "learning_rate": 1.401760405788453e-05, "loss": 0.9387, "mean_token_accuracy": 0.7881631642580033, "num_tokens": 278297127.0, "step": 3780, "train_ppl": 2.5567 }, { "ce_loss": 0.9493, "epoch": 0.5484110188651944, "grad_norm": 1.1171875, "hf_loss_ratio": 1.0, "learning_rate": 1.3972847978517082e-05, "loss": 0.9493, "mean_token_accuracy": 0.7784359693527222, "num_tokens": 279053770.0, "step": 3790, "train_ppl": 2.583983 }, { "ce_loss": 0.9715, "epoch": 0.5498580136379257, "grad_norm": 1.015625, "hf_loss_ratio": 1.0, "learning_rate": 1.3928091899149636e-05, "loss": 0.9715, "mean_token_accuracy": 0.7738523662090302, "num_tokens": 279793403.0, "step": 3800, "train_ppl": 2.641912 }, { "ce_loss": 0.9772, "epoch": 0.5513050084106571, "grad_norm": 1.0078125, "hf_loss_ratio": 1.0, "learning_rate": 1.3883335819782187e-05, "loss": 0.9772, "mean_token_accuracy": 0.776868187636137, "num_tokens": 280525655.0, "step": 3810, "train_ppl": 2.657016 }, { "ce_loss": 0.926, "epoch": 0.5527520031833885, "grad_norm": 1.1640625, "hf_loss_ratio": 1.0, "learning_rate": 1.383857974041474e-05, "loss": 0.926, "mean_token_accuracy": 0.7910705611109734, "num_tokens": 281261170.0, "step": 3820, "train_ppl": 2.524335 }, { "ce_loss": 0.9649, "epoch": 0.5541989979561199, "grad_norm": 1.28125, "hf_loss_ratio": 1.0, "learning_rate": 1.3793823661047293e-05, "loss": 0.9649, "mean_token_accuracy": 0.7791670545935631, "num_tokens": 281985897.0, "step": 3830, "train_ppl": 2.624451 }, { "ce_loss": 0.9677, "epoch": 0.5556459927288513, "grad_norm": 0.98828125, "hf_loss_ratio": 1.0, "learning_rate": 1.3749067581679846e-05, "loss": 0.9677, "mean_token_accuracy": 0.7748836219310761, "num_tokens": 282721456.0, "step": 3840, "train_ppl": 2.631954 }, { "ce_loss": 1.0129, "epoch": 0.5570929875015826, "grad_norm": 0.921875, "hf_loss_ratio": 1.0, "learning_rate": 1.3704311502312398e-05, "loss": 1.0129, "mean_token_accuracy": 0.7665625207126141, "num_tokens": 283434742.0, "step": 3850, "train_ppl": 2.753628 }, { "ce_loss": 0.9751, "epoch": 0.558539982274314, "grad_norm": 1.046875, "hf_loss_ratio": 1.0, "learning_rate": 1.3659555422944949e-05, "loss": 0.9751, "mean_token_accuracy": 0.7772414043545723, "num_tokens": 284159932.0, "step": 3860, "train_ppl": 2.651563 }, { "ce_loss": 0.96, "epoch": 0.5599869770470454, "grad_norm": 0.91015625, "hf_loss_ratio": 1.0, "learning_rate": 1.3614799343577503e-05, "loss": 0.96, "mean_token_accuracy": 0.7742170818150044, "num_tokens": 284892821.0, "step": 3870, "train_ppl": 2.611629 }, { "ce_loss": 0.9735, "epoch": 0.5614339718197768, "grad_norm": 0.98046875, "hf_loss_ratio": 1.0, "learning_rate": 1.3570043264210056e-05, "loss": 0.9735, "mean_token_accuracy": 0.7700681336224079, "num_tokens": 285587737.0, "step": 3880, "train_ppl": 2.647213 }, { "ce_loss": 0.9218, "epoch": 0.5628809665925082, "grad_norm": 1.0625, "hf_loss_ratio": 1.0, "learning_rate": 1.3525287184842608e-05, "loss": 0.9218, "mean_token_accuracy": 0.7871894739568234, "num_tokens": 286313582.0, "step": 3890, "train_ppl": 2.51389 }, { "ce_loss": 0.941, "epoch": 0.5643279613652395, "grad_norm": 0.953125, "hf_loss_ratio": 1.0, "learning_rate": 1.348053110547516e-05, "loss": 0.941, "mean_token_accuracy": 0.7820699147880077, "num_tokens": 287064151.0, "step": 3900, "train_ppl": 2.562492 }, { "ce_loss": 0.9296, "epoch": 0.5657749561379709, "grad_norm": 0.91796875, "hf_loss_ratio": 1.0, "learning_rate": 1.3435775026107715e-05, "loss": 0.9296, "mean_token_accuracy": 0.7859035260975361, "num_tokens": 287813874.0, "step": 3910, "train_ppl": 2.53357 }, { "ce_loss": 0.9445, "epoch": 0.5672219509107024, "grad_norm": 0.859375, "hf_loss_ratio": 1.0, "learning_rate": 1.3391018946740265e-05, "loss": 0.9445, "mean_token_accuracy": 0.782135433703661, "num_tokens": 288570496.0, "step": 3920, "train_ppl": 2.571643 }, { "ce_loss": 0.9839, "epoch": 0.5686689456834337, "grad_norm": 2.546875, "hf_loss_ratio": 1.0, "learning_rate": 1.3346262867372818e-05, "loss": 0.9839, "mean_token_accuracy": 0.7735799729824067, "num_tokens": 289350278.0, "step": 3930, "train_ppl": 2.674829 }, { "ce_loss": 0.971, "epoch": 0.5701159404561651, "grad_norm": 0.92578125, "hf_loss_ratio": 1.0, "learning_rate": 1.330150678800537e-05, "loss": 0.971, "mean_token_accuracy": 0.7777773514389992, "num_tokens": 290079342.0, "step": 3940, "train_ppl": 2.640477 }, { "ce_loss": 0.9539, "epoch": 0.5715629352288965, "grad_norm": 1.0234375, "hf_loss_ratio": 1.0, "learning_rate": 1.3256750708637924e-05, "loss": 0.9539, "mean_token_accuracy": 0.7781407319009304, "num_tokens": 290832879.0, "step": 3950, "train_ppl": 2.595897 }, { "ce_loss": 0.9775, "epoch": 0.5730099300016279, "grad_norm": 1.09375, "hf_loss_ratio": 1.0, "learning_rate": 1.3211994629270477e-05, "loss": 0.9775, "mean_token_accuracy": 0.7747543424367904, "num_tokens": 291565544.0, "step": 3960, "train_ppl": 2.6577 }, { "ce_loss": 0.9625, "epoch": 0.5744569247743593, "grad_norm": 1.0, "hf_loss_ratio": 1.0, "learning_rate": 1.3167238549903028e-05, "loss": 0.9625, "mean_token_accuracy": 0.778536244481802, "num_tokens": 292316435.0, "step": 3970, "train_ppl": 2.618189 }, { "ce_loss": 0.94, "epoch": 0.5759039195470906, "grad_norm": 0.94140625, "hf_loss_ratio": 1.0, "learning_rate": 1.312248247053558e-05, "loss": 0.94, "mean_token_accuracy": 0.7783068805932999, "num_tokens": 293058454.0, "step": 3980, "train_ppl": 2.560027 }, { "ce_loss": 1.0024, "epoch": 0.577350914319822, "grad_norm": 1.046875, "hf_loss_ratio": 1.0, "learning_rate": 1.3077726391168134e-05, "loss": 1.0024, "mean_token_accuracy": 0.7662229061126709, "num_tokens": 293783644.0, "step": 3990, "train_ppl": 2.724925 }, { "ce_loss": 0.9491, "epoch": 0.5787979090925534, "grad_norm": 1.0859375, "hf_loss_ratio": 1.0, "learning_rate": 1.3032970311800687e-05, "loss": 0.9491, "mean_token_accuracy": 0.781515534222126, "num_tokens": 294511489.0, "step": 4000, "train_ppl": 2.583289 }, { "ce_loss": 0.9735, "epoch": 0.5802449038652848, "grad_norm": 1.1015625, "hf_loss_ratio": 1.0, "learning_rate": 1.2988214232433239e-05, "loss": 0.9735, "mean_token_accuracy": 0.7806210406124592, "num_tokens": 295248215.0, "step": 4010, "train_ppl": 2.647139 }, { "ce_loss": 0.9393, "epoch": 0.5816918986380162, "grad_norm": 1.09375, "hf_loss_ratio": 1.0, "learning_rate": 1.2943458153065793e-05, "loss": 0.9393, "mean_token_accuracy": 0.7846732117235661, "num_tokens": 295989738.0, "step": 4020, "train_ppl": 2.558143 }, { "ce_loss": 0.9621, "epoch": 0.5831388934107475, "grad_norm": 1.109375, "hf_loss_ratio": 1.0, "learning_rate": 1.2898702073698344e-05, "loss": 0.9621, "mean_token_accuracy": 0.7784810028970242, "num_tokens": 296702866.0, "step": 4030, "train_ppl": 2.617144 }, { "ce_loss": 0.9765, "epoch": 0.5845858881834789, "grad_norm": 1.0, "hf_loss_ratio": 1.0, "learning_rate": 1.2853945994330896e-05, "loss": 0.9765, "mean_token_accuracy": 0.7725668139755726, "num_tokens": 297439737.0, "step": 4040, "train_ppl": 2.655217 }, { "ce_loss": 0.9885, "epoch": 0.5860328829562104, "grad_norm": 1.1875, "hf_loss_ratio": 1.0, "learning_rate": 1.2809189914963449e-05, "loss": 0.9885, "mean_token_accuracy": 0.774877705425024, "num_tokens": 298188647.0, "step": 4050, "train_ppl": 2.687219 }, { "ce_loss": 0.9545, "epoch": 0.5874798777289417, "grad_norm": 0.91796875, "hf_loss_ratio": 1.0, "learning_rate": 1.2764433835596003e-05, "loss": 0.9545, "mean_token_accuracy": 0.7752919748425484, "num_tokens": 298937830.0, "step": 4060, "train_ppl": 2.597323 }, { "ce_loss": 0.9608, "epoch": 0.5889268725016731, "grad_norm": 1.078125, "hf_loss_ratio": 1.0, "learning_rate": 1.2719677756228555e-05, "loss": 0.9608, "mean_token_accuracy": 0.7775414235889911, "num_tokens": 299669340.0, "step": 4070, "train_ppl": 2.613706 }, { "ce_loss": 0.9499, "epoch": 0.5903738672744044, "grad_norm": 1.0390625, "hf_loss_ratio": 1.0, "learning_rate": 1.2674921676861106e-05, "loss": 0.9499, "mean_token_accuracy": 0.7804868087172508, "num_tokens": 300386836.0, "step": 4080, "train_ppl": 2.585417 }, { "ce_loss": 0.9535, "epoch": 0.5918208620471359, "grad_norm": 1.0078125, "hf_loss_ratio": 1.0, "learning_rate": 1.2630165597493659e-05, "loss": 0.9535, "mean_token_accuracy": 0.7813090972602368, "num_tokens": 301161416.0, "step": 4090, "train_ppl": 2.594834 }, { "ce_loss": 0.9412, "epoch": 0.5932678568198673, "grad_norm": 1.109375, "hf_loss_ratio": 1.0, "learning_rate": 1.2585409518126213e-05, "loss": 0.9412, "mean_token_accuracy": 0.777237968891859, "num_tokens": 301895700.0, "step": 4100, "train_ppl": 2.562928 }, { "ce_loss": 0.9596, "epoch": 0.5947148515925986, "grad_norm": 1.078125, "hf_loss_ratio": 1.0, "learning_rate": 1.2540653438758765e-05, "loss": 0.9596, "mean_token_accuracy": 0.775063581764698, "num_tokens": 302652783.0, "step": 4110, "train_ppl": 2.610559 }, { "ce_loss": 0.938, "epoch": 0.59616184636533, "grad_norm": 1.171875, "hf_loss_ratio": 1.0, "learning_rate": 1.2495897359391318e-05, "loss": 0.938, "mean_token_accuracy": 0.7807605281472206, "num_tokens": 303377816.0, "step": 4120, "train_ppl": 2.554922 }, { "ce_loss": 0.9801, "epoch": 0.5976088411380613, "grad_norm": 1.0625, "hf_loss_ratio": 1.0, "learning_rate": 1.245114128002387e-05, "loss": 0.9801, "mean_token_accuracy": 0.7739221796393394, "num_tokens": 304113074.0, "step": 4130, "train_ppl": 2.664789 }, { "ce_loss": 0.9596, "epoch": 0.5990558359107928, "grad_norm": 1.0546875, "hf_loss_ratio": 1.0, "learning_rate": 1.2406385200656423e-05, "loss": 0.9596, "mean_token_accuracy": 0.7742515958845615, "num_tokens": 304844350.0, "step": 4140, "train_ppl": 2.610675 }, { "ce_loss": 0.964, "epoch": 0.6005028306835242, "grad_norm": 1.1015625, "hf_loss_ratio": 1.0, "learning_rate": 1.2361629121288975e-05, "loss": 0.964, "mean_token_accuracy": 0.7800977975130081, "num_tokens": 305579813.0, "step": 4150, "train_ppl": 2.622038 }, { "ce_loss": 0.9532, "epoch": 0.6019498254562555, "grad_norm": 1.078125, "hf_loss_ratio": 1.0, "learning_rate": 1.2316873041921527e-05, "loss": 0.9532, "mean_token_accuracy": 0.7812970593571663, "num_tokens": 306304960.0, "step": 4160, "train_ppl": 2.594026 }, { "ce_loss": 0.9601, "epoch": 0.6033968202289869, "grad_norm": 1.1015625, "hf_loss_ratio": 1.0, "learning_rate": 1.2272116962554082e-05, "loss": 0.9601, "mean_token_accuracy": 0.7800398364663124, "num_tokens": 307042663.0, "step": 4170, "train_ppl": 2.611905 }, { "ce_loss": 0.9685, "epoch": 0.6048438150017184, "grad_norm": 0.8984375, "hf_loss_ratio": 1.0, "learning_rate": 1.2227360883186634e-05, "loss": 0.9685, "mean_token_accuracy": 0.776139622181654, "num_tokens": 307757206.0, "step": 4180, "train_ppl": 2.63396 }, { "ce_loss": 0.9863, "epoch": 0.6062908097744497, "grad_norm": 0.88671875, "hf_loss_ratio": 1.0, "learning_rate": 1.2182604803819185e-05, "loss": 0.9863, "mean_token_accuracy": 0.7687765277922154, "num_tokens": 308492203.0, "step": 4190, "train_ppl": 2.681368 }, { "ce_loss": 0.9499, "epoch": 0.6077378045471811, "grad_norm": 1.09375, "hf_loss_ratio": 1.0, "learning_rate": 1.2137848724451737e-05, "loss": 0.9499, "mean_token_accuracy": 0.7795483432710171, "num_tokens": 309220000.0, "step": 4200, "train_ppl": 2.585347 }, { "ce_loss": 0.9506, "epoch": 0.6091847993199124, "grad_norm": 1.0, "hf_loss_ratio": 1.0, "learning_rate": 1.2093092645084291e-05, "loss": 0.9506, "mean_token_accuracy": 0.7806940786540508, "num_tokens": 309954206.0, "step": 4210, "train_ppl": 2.587363 }, { "ce_loss": 0.9777, "epoch": 0.6106317940926438, "grad_norm": 1.234375, "hf_loss_ratio": 1.0, "learning_rate": 1.2048336565716844e-05, "loss": 0.9777, "mean_token_accuracy": 0.7771054945886136, "num_tokens": 310673874.0, "step": 4220, "train_ppl": 2.658411 }, { "ce_loss": 0.9427, "epoch": 0.6120787888653753, "grad_norm": 0.97265625, "hf_loss_ratio": 1.0, "learning_rate": 1.2003580486349396e-05, "loss": 0.9427, "mean_token_accuracy": 0.7819586515426635, "num_tokens": 311425629.0, "step": 4230, "train_ppl": 2.567005 }, { "ce_loss": 0.9469, "epoch": 0.6135257836381066, "grad_norm": 1.1875, "hf_loss_ratio": 1.0, "learning_rate": 1.1958824406981949e-05, "loss": 0.9469, "mean_token_accuracy": 0.7801039353013038, "num_tokens": 312149916.0, "step": 4240, "train_ppl": 2.577795 }, { "ce_loss": 0.9829, "epoch": 0.614972778410838, "grad_norm": 0.9609375, "hf_loss_ratio": 1.0, "learning_rate": 1.1914068327614501e-05, "loss": 0.9829, "mean_token_accuracy": 0.7737744726240635, "num_tokens": 312871666.0, "step": 4250, "train_ppl": 2.672162 }, { "ce_loss": 0.9819, "epoch": 0.6164197731835693, "grad_norm": 1.21875, "hf_loss_ratio": 1.0, "learning_rate": 1.1869312248247054e-05, "loss": 0.9819, "mean_token_accuracy": 0.7720717005431652, "num_tokens": 313601563.0, "step": 4260, "train_ppl": 2.669572 }, { "ce_loss": 0.9503, "epoch": 0.6178667679563008, "grad_norm": 1.015625, "hf_loss_ratio": 1.0, "learning_rate": 1.1824556168879606e-05, "loss": 0.9503, "mean_token_accuracy": 0.7818848460912704, "num_tokens": 314353822.0, "step": 4270, "train_ppl": 2.58643 }, { "ce_loss": 0.945, "epoch": 0.6193137627290322, "grad_norm": 1.1328125, "hf_loss_ratio": 1.0, "learning_rate": 1.1779800089512159e-05, "loss": 0.945, "mean_token_accuracy": 0.7822961673140526, "num_tokens": 315066430.0, "step": 4280, "train_ppl": 2.57272 }, { "ce_loss": 0.9851, "epoch": 0.6207607575017635, "grad_norm": 1.0859375, "hf_loss_ratio": 1.0, "learning_rate": 1.1735044010144713e-05, "loss": 0.9851, "mean_token_accuracy": 0.7730609364807606, "num_tokens": 315802006.0, "step": 4290, "train_ppl": 2.678082 }, { "ce_loss": 0.9502, "epoch": 0.6222077522744949, "grad_norm": 0.984375, "hf_loss_ratio": 1.0, "learning_rate": 1.1690287930777263e-05, "loss": 0.9502, "mean_token_accuracy": 0.7806099034845829, "num_tokens": 316597439.0, "step": 4300, "train_ppl": 2.586201 }, { "ce_loss": 0.9809, "epoch": 0.6236547470472263, "grad_norm": 0.94140625, "hf_loss_ratio": 1.0, "learning_rate": 1.1645531851409816e-05, "loss": 0.9809, "mean_token_accuracy": 0.773340854048729, "num_tokens": 317357015.0, "step": 4310, "train_ppl": 2.666982 }, { "ce_loss": 0.9792, "epoch": 0.6251017418199577, "grad_norm": 0.9921875, "hf_loss_ratio": 1.0, "learning_rate": 1.160077577204237e-05, "loss": 0.9792, "mean_token_accuracy": 0.7763313055038452, "num_tokens": 318074229.0, "step": 4320, "train_ppl": 2.662203 }, { "ce_loss": 0.9621, "epoch": 0.6265487365926891, "grad_norm": 1.1640625, "hf_loss_ratio": 1.0, "learning_rate": 1.1556019692674922e-05, "loss": 0.9621, "mean_token_accuracy": 0.775955218076706, "num_tokens": 318793337.0, "step": 4330, "train_ppl": 2.617267 }, { "ce_loss": 0.9433, "epoch": 0.6279957313654204, "grad_norm": 1.1015625, "hf_loss_ratio": 1.0, "learning_rate": 1.1511263613307475e-05, "loss": 0.9433, "mean_token_accuracy": 0.7845971286296844, "num_tokens": 319523789.0, "step": 4340, "train_ppl": 2.568444 }, { "ce_loss": 0.9728, "epoch": 0.6294427261381518, "grad_norm": 1.03125, "hf_loss_ratio": 1.0, "learning_rate": 1.1466507533940027e-05, "loss": 0.9728, "mean_token_accuracy": 0.7732916258275508, "num_tokens": 320236607.0, "step": 4350, "train_ppl": 2.645373 }, { "ce_loss": 0.9608, "epoch": 0.6308897209108832, "grad_norm": 1.1796875, "hf_loss_ratio": 1.0, "learning_rate": 1.142175145457258e-05, "loss": 0.9608, "mean_token_accuracy": 0.7798072099685669, "num_tokens": 320964949.0, "step": 4360, "train_ppl": 2.613791 }, { "ce_loss": 0.9866, "epoch": 0.6323367156836146, "grad_norm": 1.171875, "hf_loss_ratio": 1.0, "learning_rate": 1.1376995375205132e-05, "loss": 0.9866, "mean_token_accuracy": 0.7727800719439983, "num_tokens": 321671284.0, "step": 4370, "train_ppl": 2.682008 }, { "ce_loss": 0.9446, "epoch": 0.633783710456346, "grad_norm": 0.90625, "hf_loss_ratio": 1.0, "learning_rate": 1.1332239295837685e-05, "loss": 0.9446, "mean_token_accuracy": 0.7807809986174107, "num_tokens": 322413391.0, "step": 4380, "train_ppl": 2.571716 }, { "ce_loss": 0.9443, "epoch": 0.6352307052290773, "grad_norm": 1.1953125, "hf_loss_ratio": 1.0, "learning_rate": 1.1287483216470237e-05, "loss": 0.9443, "mean_token_accuracy": 0.7804166525602341, "num_tokens": 323139704.0, "step": 4390, "train_ppl": 2.570885 }, { "ce_loss": 0.9331, "epoch": 0.6366777000018088, "grad_norm": 1.0078125, "hf_loss_ratio": 1.0, "learning_rate": 1.1242727137102791e-05, "loss": 0.9331, "mean_token_accuracy": 0.7856282263994216, "num_tokens": 323894610.0, "step": 4400, "train_ppl": 2.54235 }, { "ce_loss": 1.0027, "epoch": 0.6381246947745401, "grad_norm": 1.046875, "hf_loss_ratio": 1.0, "learning_rate": 1.1197971057735342e-05, "loss": 1.0027, "mean_token_accuracy": 0.7679429657757282, "num_tokens": 324636289.0, "step": 4410, "train_ppl": 2.725621 }, { "ce_loss": 0.981, "epoch": 0.6395716895472715, "grad_norm": 0.8828125, "hf_loss_ratio": 1.0, "learning_rate": 1.1153214978367894e-05, "loss": 0.981, "mean_token_accuracy": 0.7753245957195759, "num_tokens": 325386589.0, "step": 4420, "train_ppl": 2.667189 }, { "ce_loss": 0.9547, "epoch": 0.6410186843200029, "grad_norm": 0.9375, "hf_loss_ratio": 1.0, "learning_rate": 1.1108458899000447e-05, "loss": 0.9547, "mean_token_accuracy": 0.778544618934393, "num_tokens": 326155177.0, "step": 4430, "train_ppl": 2.597782 }, { "ce_loss": 0.9627, "epoch": 0.6424656790927343, "grad_norm": 1.0625, "hf_loss_ratio": 1.0, "learning_rate": 1.1063702819633001e-05, "loss": 0.9627, "mean_token_accuracy": 0.7790204137563705, "num_tokens": 326889827.0, "step": 4440, "train_ppl": 2.618685 }, { "ce_loss": 0.9919, "epoch": 0.6439126738654657, "grad_norm": 1.0625, "hf_loss_ratio": 1.0, "learning_rate": 1.1018946740265554e-05, "loss": 0.9919, "mean_token_accuracy": 0.7769460953772068, "num_tokens": 327593189.0, "step": 4450, "train_ppl": 2.69623 }, { "ce_loss": 0.9627, "epoch": 0.645359668638197, "grad_norm": 1.0546875, "hf_loss_ratio": 1.0, "learning_rate": 1.0974190660898106e-05, "loss": 0.9627, "mean_token_accuracy": 0.7764194391667842, "num_tokens": 328366781.0, "step": 4460, "train_ppl": 2.618665 }, { "ce_loss": 0.9249, "epoch": 0.6468066634109284, "grad_norm": 1.1015625, "hf_loss_ratio": 1.0, "learning_rate": 1.0929434581530658e-05, "loss": 0.9249, "mean_token_accuracy": 0.779874175786972, "num_tokens": 329095559.0, "step": 4470, "train_ppl": 2.521557 }, { "ce_loss": 0.9713, "epoch": 0.6482536581836598, "grad_norm": 1.078125, "hf_loss_ratio": 1.0, "learning_rate": 1.0884678502163211e-05, "loss": 0.9713, "mean_token_accuracy": 0.7740052983164787, "num_tokens": 329811677.0, "step": 4480, "train_ppl": 2.641304 }, { "ce_loss": 0.9528, "epoch": 0.6497006529563912, "grad_norm": 1.03125, "hf_loss_ratio": 1.0, "learning_rate": 1.0839922422795763e-05, "loss": 0.9528, "mean_token_accuracy": 0.7821832969784737, "num_tokens": 330551710.0, "step": 4490, "train_ppl": 2.592979 }, { "ce_loss": 0.9515, "epoch": 0.6511476477291226, "grad_norm": 0.99609375, "hf_loss_ratio": 1.0, "learning_rate": 1.0795166343428316e-05, "loss": 0.9515, "mean_token_accuracy": 0.7812347248196602, "num_tokens": 331296938.0, "step": 4500, "train_ppl": 2.589622 }, { "ce_loss": 0.9432, "epoch": 0.652594642501854, "grad_norm": 0.91796875, "hf_loss_ratio": 1.0, "learning_rate": 1.075041026406087e-05, "loss": 0.9432, "mean_token_accuracy": 0.7813379496335984, "num_tokens": 332025952.0, "step": 4510, "train_ppl": 2.568238 }, { "ce_loss": 1.0099, "epoch": 0.6540416372745853, "grad_norm": 1.0625, "hf_loss_ratio": 1.0, "learning_rate": 1.070565418469342e-05, "loss": 1.0099, "mean_token_accuracy": 0.7635823853313923, "num_tokens": 332771616.0, "step": 4520, "train_ppl": 2.745205 }, { "ce_loss": 0.9694, "epoch": 0.6554886320473168, "grad_norm": 0.87890625, "hf_loss_ratio": 1.0, "learning_rate": 1.0660898105325973e-05, "loss": 0.9694, "mean_token_accuracy": 0.7710436776280403, "num_tokens": 333522538.0, "step": 4530, "train_ppl": 2.636479 }, { "ce_loss": 0.9682, "epoch": 0.6569356268200481, "grad_norm": 1.078125, "hf_loss_ratio": 1.0, "learning_rate": 1.0616142025958526e-05, "loss": 0.9682, "mean_token_accuracy": 0.7808797568082809, "num_tokens": 334235618.0, "step": 4540, "train_ppl": 2.633224 }, { "ce_loss": 0.9577, "epoch": 0.6583826215927795, "grad_norm": 1.0390625, "hf_loss_ratio": 1.0, "learning_rate": 1.057138594659108e-05, "loss": 0.9577, "mean_token_accuracy": 0.7794765748083592, "num_tokens": 334986466.0, "step": 4550, "train_ppl": 2.605761 }, { "ce_loss": 0.9243, "epoch": 0.6598296163655109, "grad_norm": 1.109375, "hf_loss_ratio": 1.0, "learning_rate": 1.0526629867223632e-05, "loss": 0.9243, "mean_token_accuracy": 0.788041090220213, "num_tokens": 335711214.0, "step": 4560, "train_ppl": 2.520199 }, { "ce_loss": 0.9528, "epoch": 0.6612766111382422, "grad_norm": 1.078125, "hf_loss_ratio": 1.0, "learning_rate": 1.0481873787856185e-05, "loss": 0.9528, "mean_token_accuracy": 0.7787193424999714, "num_tokens": 336437137.0, "step": 4570, "train_ppl": 2.592964 }, { "ce_loss": 0.9448, "epoch": 0.6627236059109737, "grad_norm": 0.8828125, "hf_loss_ratio": 1.0, "learning_rate": 1.0437117708488735e-05, "loss": 0.9448, "mean_token_accuracy": 0.7806118883192539, "num_tokens": 337180631.0, "step": 4580, "train_ppl": 2.572427 }, { "ce_loss": 0.954, "epoch": 0.664170600683705, "grad_norm": 1.09375, "hf_loss_ratio": 1.0, "learning_rate": 1.039236162912129e-05, "loss": 0.954, "mean_token_accuracy": 0.7802353672683239, "num_tokens": 337939742.0, "step": 4590, "train_ppl": 2.596065 }, { "ce_loss": 0.9637, "epoch": 0.6656175954564364, "grad_norm": 0.94921875, "hf_loss_ratio": 1.0, "learning_rate": 1.0347605549753842e-05, "loss": 0.9637, "mean_token_accuracy": 0.7783378548920155, "num_tokens": 338675720.0, "step": 4600, "train_ppl": 2.621249 }, { "ce_loss": 0.9487, "epoch": 0.6670645902291678, "grad_norm": 1.2109375, "hf_loss_ratio": 1.0, "learning_rate": 1.0302849470386394e-05, "loss": 0.9487, "mean_token_accuracy": 0.7817958757281304, "num_tokens": 339387696.0, "step": 4610, "train_ppl": 2.582235 }, { "ce_loss": 0.9513, "epoch": 0.6685115850018992, "grad_norm": 0.9921875, "hf_loss_ratio": 1.0, "learning_rate": 1.0258093391018948e-05, "loss": 0.9513, "mean_token_accuracy": 0.7807927936315536, "num_tokens": 340133225.0, "step": 4620, "train_ppl": 2.58913 }, { "ce_loss": 1.0216, "epoch": 0.6699585797746306, "grad_norm": 1.1796875, "hf_loss_ratio": 1.0, "learning_rate": 1.02133373116515e-05, "loss": 1.0216, "mean_token_accuracy": 0.7636558651924134, "num_tokens": 340874723.0, "step": 4630, "train_ppl": 2.777752 }, { "ce_loss": 1.0065, "epoch": 0.6714055745473619, "grad_norm": 1.0546875, "hf_loss_ratio": 1.0, "learning_rate": 1.0168581232284052e-05, "loss": 1.0065, "mean_token_accuracy": 0.7711653731763363, "num_tokens": 341581981.0, "step": 4640, "train_ppl": 2.736106 }, { "ce_loss": 0.9494, "epoch": 0.6728525693200933, "grad_norm": 0.94921875, "hf_loss_ratio": 1.0, "learning_rate": 1.0123825152916604e-05, "loss": 0.9494, "mean_token_accuracy": 0.7801486007869244, "num_tokens": 342305325.0, "step": 4650, "train_ppl": 2.584225 }, { "ce_loss": 1.0076, "epoch": 0.6742995640928248, "grad_norm": 0.99609375, "hf_loss_ratio": 1.0, "learning_rate": 1.0079069073549158e-05, "loss": 1.0076, "mean_token_accuracy": 0.7673116207122803, "num_tokens": 343028770.0, "step": 4660, "train_ppl": 2.739132 }, { "ce_loss": 0.9494, "epoch": 0.6757465588655561, "grad_norm": 1.015625, "hf_loss_ratio": 1.0, "learning_rate": 1.003431299418171e-05, "loss": 0.9494, "mean_token_accuracy": 0.7784094549715519, "num_tokens": 343727815.0, "step": 4670, "train_ppl": 2.58426 }, { "ce_loss": 0.9739, "epoch": 0.6771935536382875, "grad_norm": 0.86328125, "hf_loss_ratio": 1.0, "learning_rate": 9.989556914814263e-06, "loss": 0.9739, "mean_token_accuracy": 0.7748332381248474, "num_tokens": 344496287.0, "step": 4680, "train_ppl": 2.648136 }, { "ce_loss": 0.9277, "epoch": 0.6786405484110188, "grad_norm": 1.03125, "hf_loss_ratio": 1.0, "learning_rate": 9.944800835446814e-06, "loss": 0.9277, "mean_token_accuracy": 0.7852459564805031, "num_tokens": 345252142.0, "step": 4690, "train_ppl": 2.528671 }, { "ce_loss": 0.9513, "epoch": 0.6800875431837502, "grad_norm": 0.8984375, "hf_loss_ratio": 1.0, "learning_rate": 9.900044756079368e-06, "loss": 0.9513, "mean_token_accuracy": 0.7755139887332916, "num_tokens": 345968711.0, "step": 4700, "train_ppl": 2.588961 }, { "ce_loss": 0.9771, "epoch": 0.6815345379564817, "grad_norm": 1.0703125, "hf_loss_ratio": 1.0, "learning_rate": 9.85528867671192e-06, "loss": 0.9771, "mean_token_accuracy": 0.7777153819799423, "num_tokens": 346713582.0, "step": 4710, "train_ppl": 2.656647 }, { "ce_loss": 0.9743, "epoch": 0.682981532729213, "grad_norm": 1.0703125, "hf_loss_ratio": 1.0, "learning_rate": 9.810532597344473e-06, "loss": 0.9743, "mean_token_accuracy": 0.7767357155680656, "num_tokens": 347439699.0, "step": 4720, "train_ppl": 2.64929 }, { "ce_loss": 0.9481, "epoch": 0.6844285275019444, "grad_norm": 0.94140625, "hf_loss_ratio": 1.0, "learning_rate": 9.765776517977025e-06, "loss": 0.9481, "mean_token_accuracy": 0.7791095830500125, "num_tokens": 348184084.0, "step": 4730, "train_ppl": 2.580792 }, { "ce_loss": 0.9604, "epoch": 0.6858755222746757, "grad_norm": 0.89453125, "hf_loss_ratio": 1.0, "learning_rate": 9.721020438609578e-06, "loss": 0.9604, "mean_token_accuracy": 0.7775398962199688, "num_tokens": 348919169.0, "step": 4740, "train_ppl": 2.612626 }, { "ce_loss": 0.8995, "epoch": 0.6873225170474072, "grad_norm": 1.140625, "hf_loss_ratio": 1.0, "learning_rate": 9.67626435924213e-06, "loss": 0.8995, "mean_token_accuracy": 0.7857723847031594, "num_tokens": 349661624.0, "step": 4750, "train_ppl": 2.458453 }, { "ce_loss": 0.9861, "epoch": 0.6887695118201386, "grad_norm": 1.25, "hf_loss_ratio": 1.0, "learning_rate": 9.631508279874683e-06, "loss": 0.9861, "mean_token_accuracy": 0.7729386761784554, "num_tokens": 350399970.0, "step": 4760, "train_ppl": 2.680691 }, { "ce_loss": 0.9508, "epoch": 0.6902165065928699, "grad_norm": 0.96875, "hf_loss_ratio": 1.0, "learning_rate": 9.586752200507235e-06, "loss": 0.9508, "mean_token_accuracy": 0.778910332173109, "num_tokens": 351129477.0, "step": 4770, "train_ppl": 2.587908 }, { "ce_loss": 0.948, "epoch": 0.6916635013656013, "grad_norm": 1.109375, "hf_loss_ratio": 1.0, "learning_rate": 9.54199612113979e-06, "loss": 0.948, "mean_token_accuracy": 0.7814707688987255, "num_tokens": 351858724.0, "step": 4780, "train_ppl": 2.580426 }, { "ce_loss": 0.9298, "epoch": 0.6931104961383328, "grad_norm": 0.8203125, "hf_loss_ratio": 1.0, "learning_rate": 9.497240041772342e-06, "loss": 0.9298, "mean_token_accuracy": 0.7840299472212792, "num_tokens": 352600340.0, "step": 4790, "train_ppl": 2.533983 }, { "ce_loss": 0.9513, "epoch": 0.6945574909110641, "grad_norm": 1.2421875, "hf_loss_ratio": 1.0, "learning_rate": 9.452483962404893e-06, "loss": 0.9513, "mean_token_accuracy": 0.7826124854385853, "num_tokens": 353357441.0, "step": 4800, "train_ppl": 2.589095 }, { "ce_loss": 0.9323, "epoch": 0.6960044856837955, "grad_norm": 1.09375, "hf_loss_ratio": 1.0, "learning_rate": 9.407727883037447e-06, "loss": 0.9323, "mean_token_accuracy": 0.787242216616869, "num_tokens": 354113021.0, "step": 4810, "train_ppl": 2.540341 }, { "ce_loss": 0.9677, "epoch": 0.6974514804565268, "grad_norm": 1.03125, "hf_loss_ratio": 1.0, "learning_rate": 9.362971803669999e-06, "loss": 0.9677, "mean_token_accuracy": 0.7780552484095097, "num_tokens": 354852637.0, "step": 4820, "train_ppl": 2.631944 }, { "ce_loss": 0.9494, "epoch": 0.6988984752292582, "grad_norm": 1.109375, "hf_loss_ratio": 1.0, "learning_rate": 9.318215724302552e-06, "loss": 0.9494, "mean_token_accuracy": 0.7799071431159973, "num_tokens": 355576304.0, "step": 4830, "train_ppl": 2.584123 }, { "ce_loss": 0.9728, "epoch": 0.7003454700019897, "grad_norm": 1.015625, "hf_loss_ratio": 1.0, "learning_rate": 9.273459644935104e-06, "loss": 0.9728, "mean_token_accuracy": 0.7771174512803555, "num_tokens": 356285418.0, "step": 4840, "train_ppl": 2.645322 }, { "ce_loss": 0.9722, "epoch": 0.701792464774721, "grad_norm": 0.9921875, "hf_loss_ratio": 1.0, "learning_rate": 9.228703565567656e-06, "loss": 0.9722, "mean_token_accuracy": 0.7724181763827801, "num_tokens": 357011227.0, "step": 4850, "train_ppl": 2.643664 }, { "ce_loss": 0.9436, "epoch": 0.7032394595474524, "grad_norm": 1.5078125, "hf_loss_ratio": 1.0, "learning_rate": 9.183947486200209e-06, "loss": 0.9436, "mean_token_accuracy": 0.7861829474568367, "num_tokens": 357765044.0, "step": 4860, "train_ppl": 2.569213 }, { "ce_loss": 0.9813, "epoch": 0.7046864543201837, "grad_norm": 1.2578125, "hf_loss_ratio": 1.0, "learning_rate": 9.139191406832761e-06, "loss": 0.9813, "mean_token_accuracy": 0.7709318250417709, "num_tokens": 358480087.0, "step": 4870, "train_ppl": 2.667803 }, { "ce_loss": 0.9635, "epoch": 0.7061334490929152, "grad_norm": 0.91015625, "hf_loss_ratio": 1.0, "learning_rate": 9.094435327465314e-06, "loss": 0.9635, "mean_token_accuracy": 0.7794269703328609, "num_tokens": 359225911.0, "step": 4880, "train_ppl": 2.620869 }, { "ce_loss": 0.97, "epoch": 0.7075804438656466, "grad_norm": 1.03125, "hf_loss_ratio": 1.0, "learning_rate": 9.049679248097868e-06, "loss": 0.97, "mean_token_accuracy": 0.777967818826437, "num_tokens": 359966433.0, "step": 4890, "train_ppl": 2.637852 }, { "ce_loss": 0.9711, "epoch": 0.7090274386383779, "grad_norm": 0.984375, "hf_loss_ratio": 1.0, "learning_rate": 9.00492316873042e-06, "loss": 0.9711, "mean_token_accuracy": 0.7772382542490959, "num_tokens": 360710714.0, "step": 4900, "train_ppl": 2.640824 }, { "ce_loss": 0.9834, "epoch": 0.7104744334111093, "grad_norm": 1.0546875, "hf_loss_ratio": 1.0, "learning_rate": 8.960167089362971e-06, "loss": 0.9834, "mean_token_accuracy": 0.7759847708046437, "num_tokens": 361431042.0, "step": 4910, "train_ppl": 2.673438 }, { "ce_loss": 0.9929, "epoch": 0.7119214281838406, "grad_norm": 1.1796875, "hf_loss_ratio": 1.0, "learning_rate": 8.915411009995524e-06, "loss": 0.9929, "mean_token_accuracy": 0.7740428909659386, "num_tokens": 362150095.0, "step": 4920, "train_ppl": 2.699036 }, { "ce_loss": 0.8871, "epoch": 0.7133684229565721, "grad_norm": 1.1015625, "hf_loss_ratio": 1.0, "learning_rate": 8.870654930628078e-06, "loss": 0.8871, "mean_token_accuracy": 0.7937179610133172, "num_tokens": 362916644.0, "step": 4930, "train_ppl": 2.428081 }, { "ce_loss": 0.9567, "epoch": 0.7148154177293035, "grad_norm": 0.99609375, "hf_loss_ratio": 1.0, "learning_rate": 8.82589885126063e-06, "loss": 0.9567, "mean_token_accuracy": 0.7758529260754585, "num_tokens": 363661364.0, "step": 4940, "train_ppl": 2.603105 }, { "ce_loss": 0.9611, "epoch": 0.7162624125020348, "grad_norm": 0.94921875, "hf_loss_ratio": 1.0, "learning_rate": 8.781142771893183e-06, "loss": 0.9611, "mean_token_accuracy": 0.7716841556131839, "num_tokens": 364395584.0, "step": 4950, "train_ppl": 2.614648 }, { "ce_loss": 0.9578, "epoch": 0.7177094072747662, "grad_norm": 1.2265625, "hf_loss_ratio": 1.0, "learning_rate": 8.736386692525735e-06, "loss": 0.9578, "mean_token_accuracy": 0.7815270647406578, "num_tokens": 365122476.0, "step": 4960, "train_ppl": 2.605926 }, { "ce_loss": 0.9854, "epoch": 0.7191564020474976, "grad_norm": 0.9375, "hf_loss_ratio": 1.0, "learning_rate": 8.691630613158287e-06, "loss": 0.9854, "mean_token_accuracy": 0.7658473886549473, "num_tokens": 365839126.0, "step": 4970, "train_ppl": 2.678892 }, { "ce_loss": 0.9621, "epoch": 0.720603396820229, "grad_norm": 0.9453125, "hf_loss_ratio": 1.0, "learning_rate": 8.64687453379084e-06, "loss": 0.9621, "mean_token_accuracy": 0.7814343258738518, "num_tokens": 366576655.0, "step": 4980, "train_ppl": 2.617123 }, { "ce_loss": 1.0258, "epoch": 0.7220503915929604, "grad_norm": 1.0234375, "hf_loss_ratio": 1.0, "learning_rate": 8.602118454423392e-06, "loss": 1.0258, "mean_token_accuracy": 0.763127225637436, "num_tokens": 367298471.0, "step": 4990, "train_ppl": 2.789273 }, { "ce_loss": 0.9444, "epoch": 0.7234973863656917, "grad_norm": 1.2890625, "hf_loss_ratio": 1.0, "learning_rate": 8.557362375055947e-06, "loss": 0.9444, "mean_token_accuracy": 0.780534103512764, "num_tokens": 368033809.0, "step": 5000, "train_ppl": 2.571163 }, { "ce_loss": 0.9551, "epoch": 0.7249443811384232, "grad_norm": 0.99609375, "hf_loss_ratio": 1.0, "learning_rate": 8.512606295688499e-06, "loss": 0.9551, "mean_token_accuracy": 0.7752326272428036, "num_tokens": 368778901.0, "step": 5010, "train_ppl": 2.599014 }, { "ce_loss": 0.9666, "epoch": 0.7263913759111545, "grad_norm": 1.09375, "hf_loss_ratio": 1.0, "learning_rate": 8.46785021632105e-06, "loss": 0.9666, "mean_token_accuracy": 0.7790293991565704, "num_tokens": 369523679.0, "step": 5020, "train_ppl": 2.629102 }, { "ce_loss": 0.9558, "epoch": 0.7278383706838859, "grad_norm": 1.0234375, "hf_loss_ratio": 1.0, "learning_rate": 8.423094136953602e-06, "loss": 0.9558, "mean_token_accuracy": 0.7781360924243927, "num_tokens": 370232105.0, "step": 5030, "train_ppl": 2.60069 }, { "ce_loss": 0.9697, "epoch": 0.7292853654566173, "grad_norm": 1.109375, "hf_loss_ratio": 1.0, "learning_rate": 8.378338057586156e-06, "loss": 0.9697, "mean_token_accuracy": 0.7776457980275154, "num_tokens": 370983473.0, "step": 5040, "train_ppl": 2.637224 }, { "ce_loss": 0.9737, "epoch": 0.7307323602293486, "grad_norm": 0.89453125, "hf_loss_ratio": 1.0, "learning_rate": 8.333581978218709e-06, "loss": 0.9737, "mean_token_accuracy": 0.7714293286204338, "num_tokens": 371688241.0, "step": 5050, "train_ppl": 2.647609 }, { "ce_loss": 0.9645, "epoch": 0.7321793550020801, "grad_norm": 1.09375, "hf_loss_ratio": 1.0, "learning_rate": 8.288825898851261e-06, "loss": 0.9645, "mean_token_accuracy": 0.7733834199607372, "num_tokens": 372423026.0, "step": 5060, "train_ppl": 2.623403 }, { "ce_loss": 0.9878, "epoch": 0.7336263497748114, "grad_norm": 1.0078125, "hf_loss_ratio": 1.0, "learning_rate": 8.244069819483812e-06, "loss": 0.9878, "mean_token_accuracy": 0.7733451426029205, "num_tokens": 373159103.0, "step": 5070, "train_ppl": 2.685398 }, { "ce_loss": 0.9405, "epoch": 0.7350733445475428, "grad_norm": 1.03125, "hf_loss_ratio": 1.0, "learning_rate": 8.199313740116366e-06, "loss": 0.9405, "mean_token_accuracy": 0.7828592106699943, "num_tokens": 373883566.0, "step": 5080, "train_ppl": 2.561212 }, { "ce_loss": 0.9523, "epoch": 0.7365203393202742, "grad_norm": 1.015625, "hf_loss_ratio": 1.0, "learning_rate": 8.154557660748919e-06, "loss": 0.9523, "mean_token_accuracy": 0.7811919517815114, "num_tokens": 374630857.0, "step": 5090, "train_ppl": 2.59161 }, { "ce_loss": 0.9657, "epoch": 0.7379673340930056, "grad_norm": 1.0703125, "hf_loss_ratio": 1.0, "learning_rate": 8.109801581381471e-06, "loss": 0.9657, "mean_token_accuracy": 0.7764380730688571, "num_tokens": 375369612.0, "step": 5100, "train_ppl": 2.626685 }, { "ce_loss": 0.9604, "epoch": 0.739414328865737, "grad_norm": 1.171875, "hf_loss_ratio": 1.0, "learning_rate": 8.065045502014025e-06, "loss": 0.9604, "mean_token_accuracy": 0.7770444475114345, "num_tokens": 376090335.0, "step": 5110, "train_ppl": 2.61263 }, { "ce_loss": 1.002, "epoch": 0.7408613236384683, "grad_norm": 1.046875, "hf_loss_ratio": 1.0, "learning_rate": 8.020289422646576e-06, "loss": 1.002, "mean_token_accuracy": 0.7697369538247585, "num_tokens": 376821458.0, "step": 5120, "train_ppl": 2.72377 }, { "ce_loss": 0.9565, "epoch": 0.7423083184111997, "grad_norm": 0.953125, "hf_loss_ratio": 1.0, "learning_rate": 7.975533343279128e-06, "loss": 0.9565, "mean_token_accuracy": 0.7750547006726265, "num_tokens": 377545855.0, "step": 5130, "train_ppl": 2.602465 }, { "ce_loss": 0.9469, "epoch": 0.7437553131839312, "grad_norm": 1.1875, "hf_loss_ratio": 1.0, "learning_rate": 7.93077726391168e-06, "loss": 0.9469, "mean_token_accuracy": 0.7794501177966595, "num_tokens": 378284520.0, "step": 5140, "train_ppl": 2.577716 }, { "ce_loss": 0.9937, "epoch": 0.7452023079566625, "grad_norm": 0.9921875, "hf_loss_ratio": 1.0, "learning_rate": 7.886021184544235e-06, "loss": 0.9937, "mean_token_accuracy": 0.7733355782926082, "num_tokens": 379035001.0, "step": 5150, "train_ppl": 2.701191 }, { "ce_loss": 0.97, "epoch": 0.7466493027293939, "grad_norm": 0.98046875, "hf_loss_ratio": 1.0, "learning_rate": 7.841265105176787e-06, "loss": 0.97, "mean_token_accuracy": 0.7776248715817928, "num_tokens": 379752153.0, "step": 5160, "train_ppl": 2.638073 }, { "ce_loss": 0.9501, "epoch": 0.7480962975021253, "grad_norm": 0.8515625, "hf_loss_ratio": 1.0, "learning_rate": 7.79650902580934e-06, "loss": 0.9501, "mean_token_accuracy": 0.7786346770823002, "num_tokens": 380519482.0, "step": 5170, "train_ppl": 2.586042 }, { "ce_loss": 0.9668, "epoch": 0.7495432922748566, "grad_norm": 1.03125, "hf_loss_ratio": 1.0, "learning_rate": 7.75175294644189e-06, "loss": 0.9668, "mean_token_accuracy": 0.7759903006255626, "num_tokens": 381261662.0, "step": 5180, "train_ppl": 2.629544 }, { "ce_loss": 0.9573, "epoch": 0.7509902870475881, "grad_norm": 1.15625, "hf_loss_ratio": 1.0, "learning_rate": 7.706996867074445e-06, "loss": 0.9573, "mean_token_accuracy": 0.7775361500680447, "num_tokens": 382020074.0, "step": 5190, "train_ppl": 2.604706 }, { "ce_loss": 0.9541, "epoch": 0.7524372818203194, "grad_norm": 0.9765625, "hf_loss_ratio": 1.0, "learning_rate": 7.662240787706997e-06, "loss": 0.9541, "mean_token_accuracy": 0.7822102926671505, "num_tokens": 382778555.0, "step": 5200, "train_ppl": 2.596456 }, { "ce_loss": 1.0105, "epoch": 0.7538842765930508, "grad_norm": 0.9453125, "hf_loss_ratio": 1.0, "learning_rate": 7.61748470833955e-06, "loss": 1.0105, "mean_token_accuracy": 0.7733402147889137, "num_tokens": 383501391.0, "step": 5210, "train_ppl": 2.746933 }, { "ce_loss": 0.9784, "epoch": 0.7553312713657822, "grad_norm": 0.9375, "hf_loss_ratio": 1.0, "learning_rate": 7.572728628972101e-06, "loss": 0.9784, "mean_token_accuracy": 0.7757657401263713, "num_tokens": 384255141.0, "step": 5220, "train_ppl": 2.660156 }, { "ce_loss": 0.984, "epoch": 0.7567782661385136, "grad_norm": 0.93359375, "hf_loss_ratio": 1.0, "learning_rate": 7.527972549604655e-06, "loss": 0.984, "mean_token_accuracy": 0.7741045750677585, "num_tokens": 385007740.0, "step": 5230, "train_ppl": 2.675041 }, { "ce_loss": 0.9386, "epoch": 0.758225260911245, "grad_norm": 1.015625, "hf_loss_ratio": 1.0, "learning_rate": 7.483216470237208e-06, "loss": 0.9386, "mean_token_accuracy": 0.778788211196661, "num_tokens": 385746131.0, "step": 5240, "train_ppl": 2.556274 }, { "ce_loss": 0.9838, "epoch": 0.7596722556839763, "grad_norm": 0.99609375, "hf_loss_ratio": 1.0, "learning_rate": 7.438460390869759e-06, "loss": 0.9838, "mean_token_accuracy": 0.7773367874324322, "num_tokens": 386477070.0, "step": 5250, "train_ppl": 2.674711 }, { "ce_loss": 0.919, "epoch": 0.7611192504567077, "grad_norm": 0.94140625, "hf_loss_ratio": 1.0, "learning_rate": 7.393704311502313e-06, "loss": 0.919, "mean_token_accuracy": 0.7863423444330693, "num_tokens": 387230161.0, "step": 5260, "train_ppl": 2.506717 }, { "ce_loss": 0.9727, "epoch": 0.762566245229439, "grad_norm": 0.9609375, "hf_loss_ratio": 1.0, "learning_rate": 7.348948232134866e-06, "loss": 0.9727, "mean_token_accuracy": 0.7754369527101517, "num_tokens": 387918499.0, "step": 5270, "train_ppl": 2.645059 }, { "ce_loss": 0.9702, "epoch": 0.7640132400021705, "grad_norm": 1.0234375, "hf_loss_ratio": 1.0, "learning_rate": 7.3041921527674176e-06, "loss": 0.9702, "mean_token_accuracy": 0.7701122313737869, "num_tokens": 388648572.0, "step": 5280, "train_ppl": 2.638576 }, { "ce_loss": 0.9647, "epoch": 0.7654602347749019, "grad_norm": 0.96875, "hf_loss_ratio": 1.0, "learning_rate": 7.259436073399971e-06, "loss": 0.9647, "mean_token_accuracy": 0.7734049685299397, "num_tokens": 389377954.0, "step": 5290, "train_ppl": 2.623948 }, { "ce_loss": 0.9537, "epoch": 0.7669072295476332, "grad_norm": 1.03125, "hf_loss_ratio": 1.0, "learning_rate": 7.2146799940325225e-06, "loss": 0.9537, "mean_token_accuracy": 0.7833194971084595, "num_tokens": 390123270.0, "step": 5300, "train_ppl": 2.595421 }, { "ce_loss": 0.9901, "epoch": 0.7683542243203646, "grad_norm": 0.9140625, "hf_loss_ratio": 1.0, "learning_rate": 7.169923914665076e-06, "loss": 0.9901, "mean_token_accuracy": 0.7688067726790905, "num_tokens": 390821555.0, "step": 5310, "train_ppl": 2.691614 }, { "ce_loss": 0.9358, "epoch": 0.7698012190930961, "grad_norm": 1.0546875, "hf_loss_ratio": 1.0, "learning_rate": 7.125167835297628e-06, "loss": 0.9358, "mean_token_accuracy": 0.7849721722304821, "num_tokens": 391571244.0, "step": 5320, "train_ppl": 2.549222 }, { "ce_loss": 0.9291, "epoch": 0.7712482138658274, "grad_norm": 0.9921875, "hf_loss_ratio": 1.0, "learning_rate": 7.080411755930181e-06, "loss": 0.9291, "mean_token_accuracy": 0.7855656445026398, "num_tokens": 392336959.0, "step": 5330, "train_ppl": 2.532116 }, { "ce_loss": 0.9654, "epoch": 0.7726952086385588, "grad_norm": 1.0234375, "hf_loss_ratio": 1.0, "learning_rate": 7.035655676562733e-06, "loss": 0.9654, "mean_token_accuracy": 0.7771142728626728, "num_tokens": 393084871.0, "step": 5340, "train_ppl": 2.625794 }, { "ce_loss": 0.9783, "epoch": 0.7741422034112901, "grad_norm": 1.1015625, "hf_loss_ratio": 1.0, "learning_rate": 6.990899597195286e-06, "loss": 0.9783, "mean_token_accuracy": 0.7791860036551952, "num_tokens": 393816389.0, "step": 5350, "train_ppl": 2.65986 }, { "ce_loss": 0.9563, "epoch": 0.7755891981840216, "grad_norm": 1.078125, "hf_loss_ratio": 1.0, "learning_rate": 6.946143517827838e-06, "loss": 0.9563, "mean_token_accuracy": 0.7763482123613358, "num_tokens": 394555157.0, "step": 5360, "train_ppl": 2.601922 }, { "ce_loss": 0.9661, "epoch": 0.777036192956753, "grad_norm": 1.140625, "hf_loss_ratio": 1.0, "learning_rate": 6.901387438460391e-06, "loss": 0.9661, "mean_token_accuracy": 0.7747901313006877, "num_tokens": 395279049.0, "step": 5370, "train_ppl": 2.627785 }, { "ce_loss": 0.9884, "epoch": 0.7784831877294843, "grad_norm": 1.2265625, "hf_loss_ratio": 1.0, "learning_rate": 6.856631359092944e-06, "loss": 0.9884, "mean_token_accuracy": 0.7725025109946728, "num_tokens": 396001112.0, "step": 5380, "train_ppl": 2.687061 }, { "ce_loss": 0.9704, "epoch": 0.7799301825022157, "grad_norm": 1.09375, "hf_loss_ratio": 1.0, "learning_rate": 6.811875279725496e-06, "loss": 0.9704, "mean_token_accuracy": 0.7769171021878719, "num_tokens": 396728173.0, "step": 5390, "train_ppl": 2.638889 }, { "ce_loss": 0.993, "epoch": 0.781377177274947, "grad_norm": 1.1484375, "hf_loss_ratio": 1.0, "learning_rate": 6.767119200358049e-06, "loss": 0.993, "mean_token_accuracy": 0.7736337415874004, "num_tokens": 397449602.0, "step": 5400, "train_ppl": 2.69944 }, { "ce_loss": 0.9458, "epoch": 0.7828241720476785, "grad_norm": 1.15625, "hf_loss_ratio": 1.0, "learning_rate": 6.722363120990601e-06, "loss": 0.9458, "mean_token_accuracy": 0.7815995380282402, "num_tokens": 398215793.0, "step": 5410, "train_ppl": 2.57481 }, { "ce_loss": 0.9971, "epoch": 0.7842711668204099, "grad_norm": 1.171875, "hf_loss_ratio": 1.0, "learning_rate": 6.677607041623154e-06, "loss": 0.9971, "mean_token_accuracy": 0.7720453962683678, "num_tokens": 398935756.0, "step": 5420, "train_ppl": 2.710507 }, { "ce_loss": 0.9424, "epoch": 0.7857181615931412, "grad_norm": 1.0234375, "hf_loss_ratio": 1.0, "learning_rate": 6.632850962255707e-06, "loss": 0.9424, "mean_token_accuracy": 0.7884068295359612, "num_tokens": 399665412.0, "step": 5430, "train_ppl": 2.566172 }, { "ce_loss": 0.9487, "epoch": 0.7871651563658726, "grad_norm": 1.015625, "hf_loss_ratio": 1.0, "learning_rate": 6.588094882888259e-06, "loss": 0.9487, "mean_token_accuracy": 0.7788920432329178, "num_tokens": 400397909.0, "step": 5440, "train_ppl": 2.582247 }, { "ce_loss": 0.9804, "epoch": 0.7886121511386041, "grad_norm": 1.0390625, "hf_loss_ratio": 1.0, "learning_rate": 6.543338803520812e-06, "loss": 0.9804, "mean_token_accuracy": 0.7754887655377388, "num_tokens": 401128916.0, "step": 5450, "train_ppl": 2.665399 }, { "ce_loss": 0.9368, "epoch": 0.7900591459113354, "grad_norm": 1.1015625, "hf_loss_ratio": 1.0, "learning_rate": 6.498582724153365e-06, "loss": 0.9368, "mean_token_accuracy": 0.7829912155866623, "num_tokens": 401864725.0, "step": 5460, "train_ppl": 2.551742 }, { "ce_loss": 0.914, "epoch": 0.7915061406840668, "grad_norm": 0.8984375, "hf_loss_ratio": 1.0, "learning_rate": 6.453826644785917e-06, "loss": 0.914, "mean_token_accuracy": 0.7870276011526585, "num_tokens": 402619013.0, "step": 5470, "train_ppl": 2.49429 }, { "ce_loss": 0.9494, "epoch": 0.7929531354567981, "grad_norm": 1.1953125, "hf_loss_ratio": 1.0, "learning_rate": 6.40907056541847e-06, "loss": 0.9494, "mean_token_accuracy": 0.7810823060572147, "num_tokens": 403360148.0, "step": 5480, "train_ppl": 2.584185 }, { "ce_loss": 0.9483, "epoch": 0.7944001302295296, "grad_norm": 0.94140625, "hf_loss_ratio": 1.0, "learning_rate": 6.3643144860510215e-06, "loss": 0.9483, "mean_token_accuracy": 0.7813143357634544, "num_tokens": 404097450.0, "step": 5490, "train_ppl": 2.581417 }, { "ce_loss": 0.9487, "epoch": 0.795847125002261, "grad_norm": 1.109375, "hf_loss_ratio": 1.0, "learning_rate": 6.319558406683575e-06, "loss": 0.9487, "mean_token_accuracy": 0.7773936979472638, "num_tokens": 404828623.0, "step": 5500, "train_ppl": 2.582243 }, { "ce_loss": 0.9635, "epoch": 0.7972941197749923, "grad_norm": 1.03125, "hf_loss_ratio": 1.0, "learning_rate": 6.274802327316127e-06, "loss": 0.9635, "mean_token_accuracy": 0.7771599672734737, "num_tokens": 405544900.0, "step": 5510, "train_ppl": 2.620934 }, { "ce_loss": 0.9981, "epoch": 0.7987411145477237, "grad_norm": 0.96484375, "hf_loss_ratio": 1.0, "learning_rate": 6.23004624794868e-06, "loss": 0.9981, "mean_token_accuracy": 0.7708815522491932, "num_tokens": 406250286.0, "step": 5520, "train_ppl": 2.713164 }, { "ce_loss": 0.933, "epoch": 0.800188109320455, "grad_norm": 1.09375, "hf_loss_ratio": 1.0, "learning_rate": 6.185290168581232e-06, "loss": 0.933, "mean_token_accuracy": 0.7810772813856601, "num_tokens": 407002048.0, "step": 5530, "train_ppl": 2.542244 }, { "ce_loss": 0.9519, "epoch": 0.8016351040931865, "grad_norm": 0.9453125, "hf_loss_ratio": 1.0, "learning_rate": 6.140534089213785e-06, "loss": 0.9519, "mean_token_accuracy": 0.7769171491265296, "num_tokens": 407721865.0, "step": 5540, "train_ppl": 2.590526 }, { "ce_loss": 0.9631, "epoch": 0.8030820988659179, "grad_norm": 1.0625, "hf_loss_ratio": 1.0, "learning_rate": 6.095778009846337e-06, "loss": 0.9631, "mean_token_accuracy": 0.7787568613886833, "num_tokens": 408443748.0, "step": 5550, "train_ppl": 2.619744 }, { "ce_loss": 0.9813, "epoch": 0.8045290936386492, "grad_norm": 1.1484375, "hf_loss_ratio": 1.0, "learning_rate": 6.05102193047889e-06, "loss": 0.9813, "mean_token_accuracy": 0.7767161875963211, "num_tokens": 409181659.0, "step": 5560, "train_ppl": 2.667798 }, { "ce_loss": 0.9693, "epoch": 0.8059760884113806, "grad_norm": 1.015625, "hf_loss_ratio": 1.0, "learning_rate": 6.006265851111443e-06, "loss": 0.9693, "mean_token_accuracy": 0.7756986141204834, "num_tokens": 409915769.0, "step": 5570, "train_ppl": 2.636003 }, { "ce_loss": 0.949, "epoch": 0.807423083184112, "grad_norm": 1.0625, "hf_loss_ratio": 1.0, "learning_rate": 5.961509771743995e-06, "loss": 0.949, "mean_token_accuracy": 0.7831607341766358, "num_tokens": 410630144.0, "step": 5580, "train_ppl": 2.58318 }, { "ce_loss": 0.9709, "epoch": 0.8088700779568434, "grad_norm": 0.953125, "hf_loss_ratio": 1.0, "learning_rate": 5.9167536923765485e-06, "loss": 0.9709, "mean_token_accuracy": 0.7774527162313462, "num_tokens": 411368980.0, "step": 5590, "train_ppl": 2.640323 }, { "ce_loss": 0.9781, "epoch": 0.8103170727295748, "grad_norm": 1.1171875, "hf_loss_ratio": 1.0, "learning_rate": 5.8719976130091e-06, "loss": 0.9781, "mean_token_accuracy": 0.7690740667283535, "num_tokens": 412088296.0, "step": 5600, "train_ppl": 2.659381 }, { "ce_loss": 0.9521, "epoch": 0.8117640675023061, "grad_norm": 1.0234375, "hf_loss_ratio": 1.0, "learning_rate": 5.827241533641653e-06, "loss": 0.9521, "mean_token_accuracy": 0.7769833728671074, "num_tokens": 412841228.0, "step": 5610, "train_ppl": 2.591169 }, { "ce_loss": 0.9835, "epoch": 0.8132110622750375, "grad_norm": 0.953125, "hf_loss_ratio": 1.0, "learning_rate": 5.782485454274206e-06, "loss": 0.9835, "mean_token_accuracy": 0.7742873176932334, "num_tokens": 413566071.0, "step": 5620, "train_ppl": 2.673852 }, { "ce_loss": 0.9541, "epoch": 0.814658057047769, "grad_norm": 0.98046875, "hf_loss_ratio": 1.0, "learning_rate": 5.737729374906758e-06, "loss": 0.9541, "mean_token_accuracy": 0.7803828045725822, "num_tokens": 414300956.0, "step": 5630, "train_ppl": 2.596387 }, { "ce_loss": 0.9433, "epoch": 0.8161050518205003, "grad_norm": 1.1796875, "hf_loss_ratio": 1.0, "learning_rate": 5.692973295539311e-06, "loss": 0.9433, "mean_token_accuracy": 0.7835976503789425, "num_tokens": 415039032.0, "step": 5640, "train_ppl": 2.568448 }, { "ce_loss": 0.9447, "epoch": 0.8175520465932317, "grad_norm": 1.359375, "hf_loss_ratio": 1.0, "learning_rate": 5.648217216171864e-06, "loss": 0.9447, "mean_token_accuracy": 0.7802014254033566, "num_tokens": 415767715.0, "step": 5650, "train_ppl": 2.572132 }, { "ce_loss": 0.9441, "epoch": 0.818999041365963, "grad_norm": 0.96875, "hf_loss_ratio": 1.0, "learning_rate": 5.603461136804416e-06, "loss": 0.9441, "mean_token_accuracy": 0.7781417928636074, "num_tokens": 416488092.0, "step": 5660, "train_ppl": 2.57039 }, { "ce_loss": 0.9421, "epoch": 0.8204460361386945, "grad_norm": 1.0, "hf_loss_ratio": 1.0, "learning_rate": 5.558705057436969e-06, "loss": 0.9421, "mean_token_accuracy": 0.7813565135002136, "num_tokens": 417257450.0, "step": 5670, "train_ppl": 2.565343 }, { "ce_loss": 0.9452, "epoch": 0.8218930309114258, "grad_norm": 1.0390625, "hf_loss_ratio": 1.0, "learning_rate": 5.513948978069521e-06, "loss": 0.9452, "mean_token_accuracy": 0.7794762089848518, "num_tokens": 417990179.0, "step": 5680, "train_ppl": 2.573453 }, { "ce_loss": 0.9678, "epoch": 0.8233400256841572, "grad_norm": 1.0546875, "hf_loss_ratio": 1.0, "learning_rate": 5.469192898702074e-06, "loss": 0.9678, "mean_token_accuracy": 0.774018281698227, "num_tokens": 418715129.0, "step": 5690, "train_ppl": 2.632052 }, { "ce_loss": 0.9779, "epoch": 0.8247870204568886, "grad_norm": 0.984375, "hf_loss_ratio": 1.0, "learning_rate": 5.424436819334626e-06, "loss": 0.9779, "mean_token_accuracy": 0.7748581573367119, "num_tokens": 419427338.0, "step": 5700, "train_ppl": 2.658952 }, { "ce_loss": 0.9699, "epoch": 0.82623401522962, "grad_norm": 0.9296875, "hf_loss_ratio": 1.0, "learning_rate": 5.379680739967179e-06, "loss": 0.9699, "mean_token_accuracy": 0.7738823585212231, "num_tokens": 420154243.0, "step": 5710, "train_ppl": 2.63778 }, { "ce_loss": 0.9736, "epoch": 0.8276810100023514, "grad_norm": 0.9921875, "hf_loss_ratio": 1.0, "learning_rate": 5.334924660599731e-06, "loss": 0.9736, "mean_token_accuracy": 0.7746640965342522, "num_tokens": 420886232.0, "step": 5720, "train_ppl": 2.64758 }, { "ce_loss": 0.9375, "epoch": 0.8291280047750827, "grad_norm": 0.98828125, "hf_loss_ratio": 1.0, "learning_rate": 5.290168581232284e-06, "loss": 0.9375, "mean_token_accuracy": 0.7802526973187923, "num_tokens": 421614581.0, "step": 5730, "train_ppl": 2.553698 }, { "ce_loss": 0.9554, "epoch": 0.8305749995478141, "grad_norm": 0.9296875, "hf_loss_ratio": 1.0, "learning_rate": 5.245412501864837e-06, "loss": 0.9554, "mean_token_accuracy": 0.7804835855960846, "num_tokens": 422341792.0, "step": 5740, "train_ppl": 2.599622 }, { "ce_loss": 0.9732, "epoch": 0.8320219943205455, "grad_norm": 1.140625, "hf_loss_ratio": 1.0, "learning_rate": 5.200656422497389e-06, "loss": 0.9732, "mean_token_accuracy": 0.7791908659040928, "num_tokens": 423060466.0, "step": 5750, "train_ppl": 2.64629 }, { "ce_loss": 0.9559, "epoch": 0.8334689890932769, "grad_norm": 1.03125, "hf_loss_ratio": 1.0, "learning_rate": 5.155900343129943e-06, "loss": 0.9559, "mean_token_accuracy": 0.7781409621238708, "num_tokens": 423782605.0, "step": 5760, "train_ppl": 2.601 }, { "ce_loss": 0.9811, "epoch": 0.8349159838660083, "grad_norm": 1.140625, "hf_loss_ratio": 1.0, "learning_rate": 5.111144263762494e-06, "loss": 0.9811, "mean_token_accuracy": 0.7751675873994828, "num_tokens": 424502076.0, "step": 5770, "train_ppl": 2.667354 }, { "ce_loss": 1.0067, "epoch": 0.8363629786387397, "grad_norm": 1.1796875, "hf_loss_ratio": 1.0, "learning_rate": 5.0663881843950475e-06, "loss": 1.0067, "mean_token_accuracy": 0.7735206983983517, "num_tokens": 425218196.0, "step": 5780, "train_ppl": 2.73669 }, { "ce_loss": 0.9582, "epoch": 0.837809973411471, "grad_norm": 0.859375, "hf_loss_ratio": 1.0, "learning_rate": 5.0216321050276e-06, "loss": 0.9582, "mean_token_accuracy": 0.7766490906476975, "num_tokens": 425984680.0, "step": 5790, "train_ppl": 2.607062 }, { "ce_loss": 0.9832, "epoch": 0.8392569681842025, "grad_norm": 1.1875, "hf_loss_ratio": 1.0, "learning_rate": 4.976876025660152e-06, "loss": 0.9832, "mean_token_accuracy": 0.7742396548390389, "num_tokens": 426712707.0, "step": 5800, "train_ppl": 2.673103 }, { "ce_loss": 1.0091, "epoch": 0.8407039629569338, "grad_norm": 1.078125, "hf_loss_ratio": 1.0, "learning_rate": 4.932119946292705e-06, "loss": 1.0091, "mean_token_accuracy": 0.7674178771674633, "num_tokens": 427433528.0, "step": 5810, "train_ppl": 2.743111 }, { "ce_loss": 0.937, "epoch": 0.8421509577296652, "grad_norm": 0.9296875, "hf_loss_ratio": 1.0, "learning_rate": 4.887363866925257e-06, "loss": 0.937, "mean_token_accuracy": 0.7804404981434345, "num_tokens": 428172138.0, "step": 5820, "train_ppl": 2.55243 }, { "ce_loss": 0.9125, "epoch": 0.8435979525023966, "grad_norm": 1.1875, "hf_loss_ratio": 1.0, "learning_rate": 4.84260778755781e-06, "loss": 0.9125, "mean_token_accuracy": 0.7849298395216465, "num_tokens": 428911668.0, "step": 5830, "train_ppl": 2.490453 }, { "ce_loss": 0.9878, "epoch": 0.845044947275128, "grad_norm": 0.97265625, "hf_loss_ratio": 1.0, "learning_rate": 4.797851708190363e-06, "loss": 0.9878, "mean_token_accuracy": 0.7694531783461571, "num_tokens": 429645052.0, "step": 5840, "train_ppl": 2.685387 }, { "ce_loss": 0.9736, "epoch": 0.8464919420478594, "grad_norm": 1.1953125, "hf_loss_ratio": 1.0, "learning_rate": 4.753095628822915e-06, "loss": 0.9736, "mean_token_accuracy": 0.7751254610717296, "num_tokens": 430378612.0, "step": 5850, "train_ppl": 2.64755 }, { "ce_loss": 0.9663, "epoch": 0.8479389368205907, "grad_norm": 1.171875, "hf_loss_ratio": 1.0, "learning_rate": 4.708339549455468e-06, "loss": 0.9663, "mean_token_accuracy": 0.7708243384957314, "num_tokens": 431064544.0, "step": 5860, "train_ppl": 2.628303 }, { "ce_loss": 0.9792, "epoch": 0.8493859315933221, "grad_norm": 1.0625, "hf_loss_ratio": 1.0, "learning_rate": 4.66358347008802e-06, "loss": 0.9792, "mean_token_accuracy": 0.7783576816320419, "num_tokens": 431809385.0, "step": 5870, "train_ppl": 2.662384 }, { "ce_loss": 0.9809, "epoch": 0.8508329263660535, "grad_norm": 1.15625, "hf_loss_ratio": 1.0, "learning_rate": 4.618827390720573e-06, "loss": 0.9809, "mean_token_accuracy": 0.7732638500630855, "num_tokens": 432564699.0, "step": 5880, "train_ppl": 2.666948 }, { "ce_loss": 0.9614, "epoch": 0.8522799211387849, "grad_norm": 1.171875, "hf_loss_ratio": 1.0, "learning_rate": 4.574071311353125e-06, "loss": 0.9614, "mean_token_accuracy": 0.7784347735345364, "num_tokens": 433285549.0, "step": 5890, "train_ppl": 2.615387 }, { "ce_loss": 0.9669, "epoch": 0.8537269159115163, "grad_norm": 1.109375, "hf_loss_ratio": 1.0, "learning_rate": 4.5293152319856785e-06, "loss": 0.9669, "mean_token_accuracy": 0.7765318714082241, "num_tokens": 434017224.0, "step": 5900, "train_ppl": 2.62971 }, { "ce_loss": 0.9632, "epoch": 0.8551739106842476, "grad_norm": 1.0, "hf_loss_ratio": 1.0, "learning_rate": 4.484559152618231e-06, "loss": 0.9632, "mean_token_accuracy": 0.7763010829687118, "num_tokens": 434766145.0, "step": 5910, "train_ppl": 2.620017 }, { "ce_loss": 0.9542, "epoch": 0.856620905456979, "grad_norm": 1.0, "hf_loss_ratio": 1.0, "learning_rate": 4.4398030732507834e-06, "loss": 0.9542, "mean_token_accuracy": 0.780161052197218, "num_tokens": 435503031.0, "step": 5920, "train_ppl": 2.596702 }, { "ce_loss": 0.9372, "epoch": 0.8580679002297105, "grad_norm": 1.015625, "hf_loss_ratio": 1.0, "learning_rate": 4.395046993883336e-06, "loss": 0.9372, "mean_token_accuracy": 0.7774905152618885, "num_tokens": 436240735.0, "step": 5930, "train_ppl": 2.552895 }, { "ce_loss": 0.9657, "epoch": 0.8595148950024418, "grad_norm": 1.0859375, "hf_loss_ratio": 1.0, "learning_rate": 4.350290914515888e-06, "loss": 0.9657, "mean_token_accuracy": 0.776423779129982, "num_tokens": 436981949.0, "step": 5940, "train_ppl": 2.62665 }, { "ce_loss": 0.9574, "epoch": 0.8609618897751732, "grad_norm": 1.1015625, "hf_loss_ratio": 1.0, "learning_rate": 4.305534835148442e-06, "loss": 0.9574, "mean_token_accuracy": 0.7750987179577351, "num_tokens": 437750102.0, "step": 5950, "train_ppl": 2.605002 }, { "ce_loss": 0.9409, "epoch": 0.8624088845479045, "grad_norm": 0.984375, "hf_loss_ratio": 1.0, "learning_rate": 4.260778755780993e-06, "loss": 0.9409, "mean_token_accuracy": 0.7818285569548606, "num_tokens": 438508119.0, "step": 5960, "train_ppl": 2.562181 }, { "ce_loss": 1.0036, "epoch": 0.8638558793206359, "grad_norm": 1.1796875, "hf_loss_ratio": 1.0, "learning_rate": 4.2160226764135465e-06, "loss": 1.0036, "mean_token_accuracy": 0.767191369086504, "num_tokens": 439276410.0, "step": 5970, "train_ppl": 2.727961 }, { "ce_loss": 0.9487, "epoch": 0.8653028740933674, "grad_norm": 0.89453125, "hf_loss_ratio": 1.0, "learning_rate": 4.171266597046099e-06, "loss": 0.9487, "mean_token_accuracy": 0.7764919579029084, "num_tokens": 440026754.0, "step": 5980, "train_ppl": 2.582388 }, { "ce_loss": 0.971, "epoch": 0.8667498688660987, "grad_norm": 1.046875, "hf_loss_ratio": 1.0, "learning_rate": 4.126510517678651e-06, "loss": 0.971, "mean_token_accuracy": 0.7749002501368523, "num_tokens": 440761601.0, "step": 5990, "train_ppl": 2.640495 }, { "ce_loss": 0.9995, "epoch": 0.8681968636388301, "grad_norm": 1.171875, "hf_loss_ratio": 1.0, "learning_rate": 4.081754438311204e-06, "loss": 0.9995, "mean_token_accuracy": 0.7680262356996537, "num_tokens": 441480022.0, "step": 6000, "train_ppl": 2.716909 }, { "ce_loss": 0.9768, "epoch": 0.8696438584115614, "grad_norm": 0.98828125, "hf_loss_ratio": 1.0, "learning_rate": 4.036998358943757e-06, "loss": 0.9768, "mean_token_accuracy": 0.7749585300683975, "num_tokens": 442223925.0, "step": 6010, "train_ppl": 2.65607 }, { "ce_loss": 0.9682, "epoch": 0.8710908531842929, "grad_norm": 1.0546875, "hf_loss_ratio": 1.0, "learning_rate": 3.992242279576309e-06, "loss": 0.9682, "mean_token_accuracy": 0.7721332833170891, "num_tokens": 442962668.0, "step": 6020, "train_ppl": 2.63316 }, { "ce_loss": 0.983, "epoch": 0.8725378479570243, "grad_norm": 1.0546875, "hf_loss_ratio": 1.0, "learning_rate": 3.947486200208862e-06, "loss": 0.983, "mean_token_accuracy": 0.7761274553835392, "num_tokens": 443689137.0, "step": 6030, "train_ppl": 2.672528 }, { "ce_loss": 0.9732, "epoch": 0.8739848427297556, "grad_norm": 1.046875, "hf_loss_ratio": 1.0, "learning_rate": 3.902730120841414e-06, "loss": 0.9732, "mean_token_accuracy": 0.7740906737744808, "num_tokens": 444401316.0, "step": 6040, "train_ppl": 2.646453 }, { "ce_loss": 0.9723, "epoch": 0.875431837502487, "grad_norm": 1.046875, "hf_loss_ratio": 1.0, "learning_rate": 3.857974041473967e-06, "loss": 0.9723, "mean_token_accuracy": 0.7794286720454693, "num_tokens": 445116577.0, "step": 6050, "train_ppl": 2.643935 }, { "ce_loss": 0.9684, "epoch": 0.8768788322752185, "grad_norm": 1.171875, "hf_loss_ratio": 1.0, "learning_rate": 3.81321796210652e-06, "loss": 0.9684, "mean_token_accuracy": 0.7808907024562359, "num_tokens": 445876002.0, "step": 6060, "train_ppl": 2.633708 }, { "ce_loss": 0.9711, "epoch": 0.8783258270479498, "grad_norm": 1.0078125, "hf_loss_ratio": 1.0, "learning_rate": 3.7684618827390723e-06, "loss": 0.9711, "mean_token_accuracy": 0.7762280680239201, "num_tokens": 446605260.0, "step": 6070, "train_ppl": 2.640865 }, { "ce_loss": 0.95, "epoch": 0.8797728218206812, "grad_norm": 1.0625, "hf_loss_ratio": 1.0, "learning_rate": 3.7237058033716247e-06, "loss": 0.95, "mean_token_accuracy": 0.7792424105107785, "num_tokens": 447358325.0, "step": 6080, "train_ppl": 2.585616 }, { "ce_loss": 0.959, "epoch": 0.8812198165934125, "grad_norm": 1.1171875, "hf_loss_ratio": 1.0, "learning_rate": 3.678949724004177e-06, "loss": 0.959, "mean_token_accuracy": 0.7746827162802219, "num_tokens": 448100945.0, "step": 6090, "train_ppl": 2.609138 }, { "ce_loss": 0.9417, "epoch": 0.8826668113661439, "grad_norm": 0.8671875, "hf_loss_ratio": 1.0, "learning_rate": 3.6341936446367296e-06, "loss": 0.9417, "mean_token_accuracy": 0.7761165231466294, "num_tokens": 448857359.0, "step": 6100, "train_ppl": 2.564342 }, { "ce_loss": 0.9845, "epoch": 0.8841138061388754, "grad_norm": 1.1796875, "hf_loss_ratio": 1.0, "learning_rate": 3.5894375652692825e-06, "loss": 0.9845, "mean_token_accuracy": 0.7675826340913773, "num_tokens": 449575975.0, "step": 6110, "train_ppl": 2.67659 }, { "ce_loss": 0.964, "epoch": 0.8855608009116067, "grad_norm": 1.109375, "hf_loss_ratio": 1.0, "learning_rate": 3.544681485901835e-06, "loss": 0.964, "mean_token_accuracy": 0.7789463967084884, "num_tokens": 450301560.0, "step": 6120, "train_ppl": 2.622228 }, { "ce_loss": 0.9757, "epoch": 0.8870077956843381, "grad_norm": 1.046875, "hf_loss_ratio": 1.0, "learning_rate": 3.4999254065343874e-06, "loss": 0.9757, "mean_token_accuracy": 0.7748393803834915, "num_tokens": 451046846.0, "step": 6130, "train_ppl": 2.652971 }, { "ce_loss": 0.9732, "epoch": 0.8884547904570694, "grad_norm": 1.046875, "hf_loss_ratio": 1.0, "learning_rate": 3.4551693271669406e-06, "loss": 0.9732, "mean_token_accuracy": 0.7820017896592617, "num_tokens": 451811972.0, "step": 6140, "train_ppl": 2.646348 }, { "ce_loss": 0.9461, "epoch": 0.8899017852298009, "grad_norm": 1.0546875, "hf_loss_ratio": 1.0, "learning_rate": 3.410413247799493e-06, "loss": 0.9461, "mean_token_accuracy": 0.7822142690420151, "num_tokens": 452565156.0, "step": 6150, "train_ppl": 2.575566 }, { "ce_loss": 1.0128, "epoch": 0.8913487800025323, "grad_norm": 1.09375, "hf_loss_ratio": 1.0, "learning_rate": 3.3656571684320455e-06, "loss": 1.0128, "mean_token_accuracy": 0.7665348842740058, "num_tokens": 453300539.0, "step": 6160, "train_ppl": 2.753163 }, { "ce_loss": 0.9794, "epoch": 0.8927957747752636, "grad_norm": 1.2578125, "hf_loss_ratio": 1.0, "learning_rate": 3.320901089064598e-06, "loss": 0.9794, "mean_token_accuracy": 0.7745142556726933, "num_tokens": 454032470.0, "step": 6170, "train_ppl": 2.66287 }, { "ce_loss": 0.9568, "epoch": 0.894242769547995, "grad_norm": 0.96875, "hf_loss_ratio": 1.0, "learning_rate": 3.276145009697151e-06, "loss": 0.9568, "mean_token_accuracy": 0.7779201343655586, "num_tokens": 454766140.0, "step": 6180, "train_ppl": 2.603474 }, { "ce_loss": 0.9672, "epoch": 0.8956897643207264, "grad_norm": 0.9921875, "hf_loss_ratio": 1.0, "learning_rate": 3.2313889303297033e-06, "loss": 0.9672, "mean_token_accuracy": 0.7766256541013717, "num_tokens": 455497600.0, "step": 6190, "train_ppl": 2.630683 }, { "ce_loss": 0.9608, "epoch": 0.8971367590934578, "grad_norm": 1.125, "hf_loss_ratio": 1.0, "learning_rate": 3.1866328509622557e-06, "loss": 0.9608, "mean_token_accuracy": 0.7783399567008018, "num_tokens": 456213968.0, "step": 6200, "train_ppl": 2.613881 }, { "ce_loss": 0.989, "epoch": 0.8985837538661892, "grad_norm": 1.046875, "hf_loss_ratio": 1.0, "learning_rate": 3.141876771594808e-06, "loss": 0.989, "mean_token_accuracy": 0.7722627222537994, "num_tokens": 456980565.0, "step": 6210, "train_ppl": 2.688524 }, { "ce_loss": 0.9211, "epoch": 0.9000307486389205, "grad_norm": 0.90625, "hf_loss_ratio": 1.0, "learning_rate": 3.097120692227361e-06, "loss": 0.9211, "mean_token_accuracy": 0.785981647670269, "num_tokens": 457749115.0, "step": 6220, "train_ppl": 2.511994 }, { "ce_loss": 0.9593, "epoch": 0.9014777434116519, "grad_norm": 0.9296875, "hf_loss_ratio": 1.0, "learning_rate": 3.0523646128599135e-06, "loss": 0.9593, "mean_token_accuracy": 0.7805201202630997, "num_tokens": 458489401.0, "step": 6230, "train_ppl": 2.609812 }, { "ce_loss": 0.9827, "epoch": 0.9029247381843833, "grad_norm": 0.953125, "hf_loss_ratio": 1.0, "learning_rate": 3.007608533492466e-06, "loss": 0.9827, "mean_token_accuracy": 0.7736832290887833, "num_tokens": 459226574.0, "step": 6240, "train_ppl": 2.671592 }, { "ce_loss": 0.9776, "epoch": 0.9043717329571147, "grad_norm": 1.0703125, "hf_loss_ratio": 1.0, "learning_rate": 2.962852454125019e-06, "loss": 0.9776, "mean_token_accuracy": 0.776441466808319, "num_tokens": 459960745.0, "step": 6250, "train_ppl": 2.658195 }, { "ce_loss": 0.9535, "epoch": 0.9058187277298461, "grad_norm": 0.9609375, "hf_loss_ratio": 1.0, "learning_rate": 2.9180963747575713e-06, "loss": 0.9535, "mean_token_accuracy": 0.7777935616672039, "num_tokens": 460692141.0, "step": 6260, "train_ppl": 2.594836 }, { "ce_loss": 0.9883, "epoch": 0.9072657225025774, "grad_norm": 1.0234375, "hf_loss_ratio": 1.0, "learning_rate": 2.8733402953901237e-06, "loss": 0.9883, "mean_token_accuracy": 0.7695657543838024, "num_tokens": 461408471.0, "step": 6270, "train_ppl": 2.686754 }, { "ce_loss": 0.9433, "epoch": 0.9087127172753089, "grad_norm": 0.921875, "hf_loss_ratio": 1.0, "learning_rate": 2.828584216022676e-06, "loss": 0.9433, "mean_token_accuracy": 0.780649583786726, "num_tokens": 462170112.0, "step": 6280, "train_ppl": 2.568511 }, { "ce_loss": 0.9745, "epoch": 0.9101597120480402, "grad_norm": 1.1328125, "hf_loss_ratio": 1.0, "learning_rate": 2.783828136655229e-06, "loss": 0.9745, "mean_token_accuracy": 0.7758511275053024, "num_tokens": 462877827.0, "step": 6290, "train_ppl": 2.64988 }, { "ce_loss": 0.9634, "epoch": 0.9116067068207716, "grad_norm": 0.984375, "hf_loss_ratio": 1.0, "learning_rate": 2.739072057287782e-06, "loss": 0.9634, "mean_token_accuracy": 0.7743300221860409, "num_tokens": 463601430.0, "step": 6300, "train_ppl": 2.620472 }, { "ce_loss": 0.9451, "epoch": 0.913053701593503, "grad_norm": 1.015625, "hf_loss_ratio": 1.0, "learning_rate": 2.6943159779203344e-06, "loss": 0.9451, "mean_token_accuracy": 0.7799232237040996, "num_tokens": 464318344.0, "step": 6310, "train_ppl": 2.572968 }, { "ce_loss": 0.9682, "epoch": 0.9145006963662343, "grad_norm": 0.94921875, "hf_loss_ratio": 1.0, "learning_rate": 2.649559898552887e-06, "loss": 0.9682, "mean_token_accuracy": 0.7786154381930828, "num_tokens": 465051370.0, "step": 6320, "train_ppl": 2.633079 }, { "ce_loss": 0.9604, "epoch": 0.9159476911389658, "grad_norm": 0.9296875, "hf_loss_ratio": 1.0, "learning_rate": 2.6048038191854397e-06, "loss": 0.9604, "mean_token_accuracy": 0.7759640254080296, "num_tokens": 465801154.0, "step": 6330, "train_ppl": 2.612643 }, { "ce_loss": 0.9521, "epoch": 0.9173946859116971, "grad_norm": 1.03125, "hf_loss_ratio": 1.0, "learning_rate": 2.560047739817992e-06, "loss": 0.9521, "mean_token_accuracy": 0.7819162972271443, "num_tokens": 466570155.0, "step": 6340, "train_ppl": 2.591263 }, { "ce_loss": 0.9604, "epoch": 0.9188416806844285, "grad_norm": 1.046875, "hf_loss_ratio": 1.0, "learning_rate": 2.5152916604505446e-06, "loss": 0.9604, "mean_token_accuracy": 0.7824667453765869, "num_tokens": 467322541.0, "step": 6350, "train_ppl": 2.612788 }, { "ce_loss": 0.9365, "epoch": 0.9202886754571599, "grad_norm": 1.0625, "hf_loss_ratio": 1.0, "learning_rate": 2.470535581083097e-06, "loss": 0.9365, "mean_token_accuracy": 0.7835808910429478, "num_tokens": 468075229.0, "step": 6360, "train_ppl": 2.550947 }, { "ce_loss": 0.9473, "epoch": 0.9217356702298913, "grad_norm": 0.9609375, "hf_loss_ratio": 1.0, "learning_rate": 2.42577950171565e-06, "loss": 0.9473, "mean_token_accuracy": 0.77774076461792, "num_tokens": 468820005.0, "step": 6370, "train_ppl": 2.578614 }, { "ce_loss": 0.9618, "epoch": 0.9231826650026227, "grad_norm": 1.0390625, "hf_loss_ratio": 1.0, "learning_rate": 2.3810234223482023e-06, "loss": 0.9618, "mean_token_accuracy": 0.7733399920165539, "num_tokens": 469537339.0, "step": 6380, "train_ppl": 2.616365 }, { "ce_loss": 0.9568, "epoch": 0.924629659775354, "grad_norm": 0.95703125, "hf_loss_ratio": 1.0, "learning_rate": 2.3362673429807548e-06, "loss": 0.9568, "mean_token_accuracy": 0.7792744718492031, "num_tokens": 470264281.0, "step": 6390, "train_ppl": 2.603469 }, { "ce_loss": 0.9704, "epoch": 0.9260766545480854, "grad_norm": 1.0546875, "hf_loss_ratio": 1.0, "learning_rate": 2.2915112636133076e-06, "loss": 0.9704, "mean_token_accuracy": 0.7776748731732368, "num_tokens": 470997935.0, "step": 6400, "train_ppl": 2.639119 }, { "ce_loss": 0.9537, "epoch": 0.9275236493208169, "grad_norm": 1.015625, "hf_loss_ratio": 1.0, "learning_rate": 2.24675518424586e-06, "loss": 0.9537, "mean_token_accuracy": 0.7739205956459045, "num_tokens": 471749710.0, "step": 6410, "train_ppl": 2.595221 }, { "ce_loss": 0.9648, "epoch": 0.9289706440935482, "grad_norm": 1.0234375, "hf_loss_ratio": 1.0, "learning_rate": 2.2019991048784125e-06, "loss": 0.9648, "mean_token_accuracy": 0.7769439205527305, "num_tokens": 472473330.0, "step": 6420, "train_ppl": 2.624186 }, { "ce_loss": 0.9727, "epoch": 0.9304176388662796, "grad_norm": 0.96875, "hf_loss_ratio": 1.0, "learning_rate": 2.157243025510965e-06, "loss": 0.9727, "mean_token_accuracy": 0.771061759442091, "num_tokens": 473203701.0, "step": 6430, "train_ppl": 2.645201 }, { "ce_loss": 0.9369, "epoch": 0.931864633639011, "grad_norm": 1.1796875, "hf_loss_ratio": 1.0, "learning_rate": 2.112486946143518e-06, "loss": 0.9369, "mean_token_accuracy": 0.7875291585922242, "num_tokens": 473951304.0, "step": 6440, "train_ppl": 2.551984 }, { "ce_loss": 0.963, "epoch": 0.9333116284117423, "grad_norm": 1.1171875, "hf_loss_ratio": 1.0, "learning_rate": 2.0677308667760703e-06, "loss": 0.963, "mean_token_accuracy": 0.7799215823411941, "num_tokens": 474681697.0, "step": 6450, "train_ppl": 2.619448 }, { "ce_loss": 0.9581, "epoch": 0.9347586231844738, "grad_norm": 1.0625, "hf_loss_ratio": 1.0, "learning_rate": 2.022974787408623e-06, "loss": 0.9581, "mean_token_accuracy": 0.7823777303099633, "num_tokens": 475396883.0, "step": 6460, "train_ppl": 2.606745 }, { "ce_loss": 0.9942, "epoch": 0.9362056179572051, "grad_norm": 1.1015625, "hf_loss_ratio": 1.0, "learning_rate": 1.9782187080411756e-06, "loss": 0.9942, "mean_token_accuracy": 0.7746273078024387, "num_tokens": 476110094.0, "step": 6470, "train_ppl": 2.702625 }, { "ce_loss": 0.954, "epoch": 0.9376526127299365, "grad_norm": 1.0546875, "hf_loss_ratio": 1.0, "learning_rate": 1.9334626286737285e-06, "loss": 0.954, "mean_token_accuracy": 0.7780710026621819, "num_tokens": 476856061.0, "step": 6480, "train_ppl": 2.59616 }, { "ce_loss": 0.9533, "epoch": 0.9390996075026679, "grad_norm": 1.09375, "hf_loss_ratio": 1.0, "learning_rate": 1.888706549306281e-06, "loss": 0.9533, "mean_token_accuracy": 0.7776739954948425, "num_tokens": 477582700.0, "step": 6490, "train_ppl": 2.594139 }, { "ce_loss": 0.9816, "epoch": 0.9405466022753993, "grad_norm": 1.046875, "hf_loss_ratio": 1.0, "learning_rate": 1.8439504699388336e-06, "loss": 0.9816, "mean_token_accuracy": 0.774020179361105, "num_tokens": 478295644.0, "step": 6500, "train_ppl": 2.66881 }, { "ce_loss": 0.9186, "epoch": 0.9419935970481307, "grad_norm": 0.98046875, "hf_loss_ratio": 1.0, "learning_rate": 1.799194390571386e-06, "loss": 0.9186, "mean_token_accuracy": 0.7841186247766018, "num_tokens": 479045896.0, "step": 6510, "train_ppl": 2.505872 }, { "ce_loss": 0.956, "epoch": 0.943440591820862, "grad_norm": 1.0859375, "hf_loss_ratio": 1.0, "learning_rate": 1.7544383112039387e-06, "loss": 0.956, "mean_token_accuracy": 0.7821230754256249, "num_tokens": 479771982.0, "step": 6520, "train_ppl": 2.601145 }, { "ce_loss": 0.962, "epoch": 0.9448875865935934, "grad_norm": 1.1171875, "hf_loss_ratio": 1.0, "learning_rate": 1.7096822318364911e-06, "loss": 0.962, "mean_token_accuracy": 0.7803165823221206, "num_tokens": 480534412.0, "step": 6530, "train_ppl": 2.616837 }, { "ce_loss": 0.9292, "epoch": 0.9463345813663249, "grad_norm": 1.09375, "hf_loss_ratio": 1.0, "learning_rate": 1.6649261524690438e-06, "loss": 0.9292, "mean_token_accuracy": 0.7858192339539528, "num_tokens": 481283576.0, "step": 6540, "train_ppl": 2.53254 }, { "ce_loss": 0.9411, "epoch": 0.9477815761390562, "grad_norm": 1.1640625, "hf_loss_ratio": 1.0, "learning_rate": 1.6201700731015962e-06, "loss": 0.9411, "mean_token_accuracy": 0.7775696411728859, "num_tokens": 482029882.0, "step": 6550, "train_ppl": 2.562835 }, { "ce_loss": 0.9532, "epoch": 0.9492285709117876, "grad_norm": 1.0703125, "hf_loss_ratio": 1.0, "learning_rate": 1.575413993734149e-06, "loss": 0.9532, "mean_token_accuracy": 0.7774538859724999, "num_tokens": 482773749.0, "step": 6560, "train_ppl": 2.594032 }, { "ce_loss": 1.0142, "epoch": 0.9506755656845189, "grad_norm": 1.0859375, "hf_loss_ratio": 1.0, "learning_rate": 1.5306579143667016e-06, "loss": 1.0142, "mean_token_accuracy": 0.7689271204173564, "num_tokens": 483502307.0, "step": 6570, "train_ppl": 2.757271 }, { "ce_loss": 0.9734, "epoch": 0.9521225604572503, "grad_norm": 0.92578125, "hf_loss_ratio": 1.0, "learning_rate": 1.4859018349992542e-06, "loss": 0.9734, "mean_token_accuracy": 0.7774414747953415, "num_tokens": 484237741.0, "step": 6580, "train_ppl": 2.646816 }, { "ce_loss": 0.9492, "epoch": 0.9535695552299818, "grad_norm": 1.0234375, "hf_loss_ratio": 1.0, "learning_rate": 1.4411457556318067e-06, "loss": 0.9492, "mean_token_accuracy": 0.7777016542851924, "num_tokens": 484965896.0, "step": 6590, "train_ppl": 2.583514 }, { "ce_loss": 0.9268, "epoch": 0.9550165500027131, "grad_norm": 1.125, "hf_loss_ratio": 1.0, "learning_rate": 1.3963896762643593e-06, "loss": 0.9268, "mean_token_accuracy": 0.783556516468525, "num_tokens": 485698087.0, "step": 6600, "train_ppl": 2.526361 }, { "ce_loss": 0.9347, "epoch": 0.9564635447754445, "grad_norm": 0.89453125, "hf_loss_ratio": 1.0, "learning_rate": 1.3516335968969118e-06, "loss": 0.9347, "mean_token_accuracy": 0.780432254821062, "num_tokens": 486457104.0, "step": 6610, "train_ppl": 2.546429 }, { "ce_loss": 1.0135, "epoch": 0.9579105395481758, "grad_norm": 1.0625, "hf_loss_ratio": 1.0, "learning_rate": 1.3068775175294644e-06, "loss": 1.0135, "mean_token_accuracy": 0.7681482747197151, "num_tokens": 487180072.0, "step": 6620, "train_ppl": 2.75519 }, { "ce_loss": 0.9701, "epoch": 0.9593575343209073, "grad_norm": 1.140625, "hf_loss_ratio": 1.0, "learning_rate": 1.262121438162017e-06, "loss": 0.9701, "mean_token_accuracy": 0.7749063238501549, "num_tokens": 487910962.0, "step": 6630, "train_ppl": 2.638147 }, { "ce_loss": 0.9673, "epoch": 0.9608045290936387, "grad_norm": 1.140625, "hf_loss_ratio": 1.0, "learning_rate": 1.2173653587945695e-06, "loss": 0.9673, "mean_token_accuracy": 0.7772574447095394, "num_tokens": 488651402.0, "step": 6640, "train_ppl": 2.630719 }, { "ce_loss": 0.9763, "epoch": 0.96225152386637, "grad_norm": 0.90625, "hf_loss_ratio": 1.0, "learning_rate": 1.1726092794271224e-06, "loss": 0.9763, "mean_token_accuracy": 0.7743536755442619, "num_tokens": 489384716.0, "step": 6650, "train_ppl": 2.654588 }, { "ce_loss": 0.9938, "epoch": 0.9636985186391014, "grad_norm": 1.2578125, "hf_loss_ratio": 1.0, "learning_rate": 1.1278532000596748e-06, "loss": 0.9938, "mean_token_accuracy": 0.7713238671422005, "num_tokens": 490102736.0, "step": 6660, "train_ppl": 2.701489 }, { "ce_loss": 0.9418, "epoch": 0.9651455134118327, "grad_norm": 1.0078125, "hf_loss_ratio": 1.0, "learning_rate": 1.0830971206922275e-06, "loss": 0.9418, "mean_token_accuracy": 0.7814336843788624, "num_tokens": 490846680.0, "step": 6670, "train_ppl": 2.564615 }, { "ce_loss": 0.9167, "epoch": 0.9665925081845642, "grad_norm": 1.125, "hf_loss_ratio": 1.0, "learning_rate": 1.03834104132478e-06, "loss": 0.9167, "mean_token_accuracy": 0.7847115240991116, "num_tokens": 491610969.0, "step": 6680, "train_ppl": 2.500937 }, { "ce_loss": 0.935, "epoch": 0.9680395029572956, "grad_norm": 0.99609375, "hf_loss_ratio": 1.0, "learning_rate": 9.935849619573326e-07, "loss": 0.935, "mean_token_accuracy": 0.7818123020231724, "num_tokens": 492324309.0, "step": 6690, "train_ppl": 2.547313 }, { "ce_loss": 0.9192, "epoch": 0.9694864977300269, "grad_norm": 0.9453125, "hf_loss_ratio": 1.0, "learning_rate": 9.488288825898852e-07, "loss": 0.9192, "mean_token_accuracy": 0.785324689000845, "num_tokens": 493060014.0, "step": 6700, "train_ppl": 2.507398 }, { "ce_loss": 0.942, "epoch": 0.9709334925027583, "grad_norm": 0.90234375, "hf_loss_ratio": 1.0, "learning_rate": 9.040728032224378e-07, "loss": 0.942, "mean_token_accuracy": 0.7809490516781807, "num_tokens": 493814561.0, "step": 6710, "train_ppl": 2.5651 }, { "ce_loss": 0.9721, "epoch": 0.9723804872754898, "grad_norm": 0.98828125, "hf_loss_ratio": 1.0, "learning_rate": 8.593167238549904e-07, "loss": 0.9721, "mean_token_accuracy": 0.7768593326210975, "num_tokens": 494565870.0, "step": 6720, "train_ppl": 2.643587 }, { "ce_loss": 0.9211, "epoch": 0.9738274820482211, "grad_norm": 0.9296875, "hf_loss_ratio": 1.0, "learning_rate": 8.145606444875429e-07, "loss": 0.9211, "mean_token_accuracy": 0.7829136967658996, "num_tokens": 495296800.0, "step": 6730, "train_ppl": 2.511992 }, { "ce_loss": 0.939, "epoch": 0.9752744768209525, "grad_norm": 1.0, "hf_loss_ratio": 1.0, "learning_rate": 7.698045651200955e-07, "loss": 0.939, "mean_token_accuracy": 0.7814122512936592, "num_tokens": 496031622.0, "step": 6740, "train_ppl": 2.557372 }, { "ce_loss": 0.9804, "epoch": 0.9767214715936838, "grad_norm": 1.109375, "hf_loss_ratio": 1.0, "learning_rate": 7.250484857526481e-07, "loss": 0.9804, "mean_token_accuracy": 0.7736301675438881, "num_tokens": 496761090.0, "step": 6750, "train_ppl": 2.665465 }, { "ce_loss": 0.9504, "epoch": 0.9781684663664153, "grad_norm": 1.171875, "hf_loss_ratio": 1.0, "learning_rate": 6.802924063852007e-07, "loss": 0.9504, "mean_token_accuracy": 0.7740707725286484, "num_tokens": 497494104.0, "step": 6760, "train_ppl": 2.586672 }, { "ce_loss": 0.9557, "epoch": 0.9796154611391467, "grad_norm": 1.0078125, "hf_loss_ratio": 1.0, "learning_rate": 6.355363270177532e-07, "loss": 0.9557, "mean_token_accuracy": 0.7776445716619491, "num_tokens": 498236331.0, "step": 6770, "train_ppl": 2.600574 }, { "ce_loss": 0.9616, "epoch": 0.981062455911878, "grad_norm": 0.99609375, "hf_loss_ratio": 1.0, "learning_rate": 5.907802476503058e-07, "loss": 0.9616, "mean_token_accuracy": 0.779218465089798, "num_tokens": 498972935.0, "step": 6780, "train_ppl": 2.615954 }, { "ce_loss": 0.9659, "epoch": 0.9825094506846094, "grad_norm": 0.9140625, "hf_loss_ratio": 1.0, "learning_rate": 5.460241682828584e-07, "loss": 0.9659, "mean_token_accuracy": 0.7770897686481476, "num_tokens": 499702836.0, "step": 6790, "train_ppl": 2.627128 }, { "ce_loss": 0.963, "epoch": 0.9839564454573407, "grad_norm": 0.86328125, "hf_loss_ratio": 1.0, "learning_rate": 5.01268088915411e-07, "loss": 0.963, "mean_token_accuracy": 0.7763608016073704, "num_tokens": 500426876.0, "step": 6800, "train_ppl": 2.61959 }, { "ce_loss": 0.9661, "epoch": 0.9854034402300722, "grad_norm": 1.03125, "hf_loss_ratio": 1.0, "learning_rate": 4.565120095479636e-07, "loss": 0.9661, "mean_token_accuracy": 0.7763193972408772, "num_tokens": 501156440.0, "step": 6810, "train_ppl": 2.627785 }, { "ce_loss": 0.9835, "epoch": 0.9868504350028036, "grad_norm": 1.1328125, "hf_loss_ratio": 1.0, "learning_rate": 4.117559301805162e-07, "loss": 0.9835, "mean_token_accuracy": 0.7768892168998718, "num_tokens": 501903400.0, "step": 6820, "train_ppl": 2.673742 }, { "ce_loss": 0.9503, "epoch": 0.9882974297755349, "grad_norm": 0.8828125, "hf_loss_ratio": 1.0, "learning_rate": 3.6699985081306876e-07, "loss": 0.9503, "mean_token_accuracy": 0.7742002509534359, "num_tokens": 502621668.0, "step": 6830, "train_ppl": 2.586448 }, { "ce_loss": 0.9498, "epoch": 0.9897444245482663, "grad_norm": 1.0625, "hf_loss_ratio": 1.0, "learning_rate": 3.222437714456214e-07, "loss": 0.9498, "mean_token_accuracy": 0.7802133716642856, "num_tokens": 503362803.0, "step": 6840, "train_ppl": 2.585163 }, { "ce_loss": 0.9616, "epoch": 0.9911914193209977, "grad_norm": 0.94140625, "hf_loss_ratio": 1.0, "learning_rate": 2.7748769207817397e-07, "loss": 0.9616, "mean_token_accuracy": 0.7740616850554943, "num_tokens": 504081933.0, "step": 6850, "train_ppl": 2.61597 }, { "ce_loss": 0.9839, "epoch": 0.9926384140937291, "grad_norm": 1.0703125, "hf_loss_ratio": 1.0, "learning_rate": 2.3273161271072654e-07, "loss": 0.9839, "mean_token_accuracy": 0.7735910393297672, "num_tokens": 504825189.0, "step": 6860, "train_ppl": 2.674826 }, { "ce_loss": 0.9994, "epoch": 0.9940854088664605, "grad_norm": 1.015625, "hf_loss_ratio": 1.0, "learning_rate": 1.8797553334327912e-07, "loss": 0.9994, "mean_token_accuracy": 0.7692562341690063, "num_tokens": 505545177.0, "step": 6870, "train_ppl": 2.716574 }, { "ce_loss": 0.9407, "epoch": 0.9955324036391918, "grad_norm": 0.97265625, "hf_loss_ratio": 1.0, "learning_rate": 1.4321945397583173e-07, "loss": 0.9407, "mean_token_accuracy": 0.7753926180303097, "num_tokens": 506272927.0, "step": 6880, "train_ppl": 2.561663 }, { "ce_loss": 0.939, "epoch": 0.9969793984119233, "grad_norm": 1.0234375, "hf_loss_ratio": 1.0, "learning_rate": 9.84633746083843e-08, "loss": 0.939, "mean_token_accuracy": 0.7804414540529251, "num_tokens": 507019095.0, "step": 6890, "train_ppl": 2.557452 }, { "ce_loss": 0.9604, "epoch": 0.9984263931846546, "grad_norm": 0.875, "hf_loss_ratio": 1.0, "learning_rate": 5.37072952409369e-08, "loss": 0.9604, "mean_token_accuracy": 0.7800676345825195, "num_tokens": 507751520.0, "step": 6900, "train_ppl": 2.612688 }, { "ce_loss": 0.9879, "epoch": 0.999873387957386, "grad_norm": 1.0703125, "hf_loss_ratio": 1.0, "learning_rate": 8.951215873489483e-09, "loss": 0.9879, "mean_token_accuracy": 0.7773638620972634, "num_tokens": 508477238.0, "step": 6910, "train_ppl": 2.685598 }, { "ce_loss": 0.8887, "epoch": 1.0, "mean_token_accuracy": 0.8112924013819013, "num_tokens": 508537895.0, "step": 6911, "total_flos": 6.189458802853544e+18, "train_loss": 0.9857371548739723, "train_ppl": 2.431889, "train_runtime": 23521.9665, "train_samples_per_second": 37.607, "train_steps_per_second": 0.294 } ], "logging_steps": 10, "max_steps": 6911, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": false, "should_training_stop": false }, "attributes": {} } }, "total_flos": 6.189458802853544e+18, "train_batch_size": 2, "trial_name": null, "trial_params": null }