icml_repro_scratch / recipe /source_training /trainer_state.json
keepsloading's picture
Upload folder using huggingface_hub
46b9eea verified
Raw
History Blame Contribute Delete
228 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 6911,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"ce_loss": 2.031,
"epoch": 0.0014469947727313835,
"grad_norm": 29.5,
"hf_loss_ratio": 1.0,
"learning_rate": 1.298076923076923e-06,
"loss": 2.031,
"mean_token_accuracy": 0.7030675932765007,
"num_tokens": 741730.0,
"step": 10,
"train_ppl": 7.621345
},
{
"ce_loss": 2.091,
"epoch": 0.002893989545462767,
"grad_norm": 27.0,
"hf_loss_ratio": 1.0,
"learning_rate": 2.7403846153846155e-06,
"loss": 2.091,
"mean_token_accuracy": 0.6888238519430161,
"num_tokens": 1459999.0,
"step": 20,
"train_ppl": 8.093004
},
{
"ce_loss": 1.9679,
"epoch": 0.004340984318194151,
"grad_norm": 25.75,
"hf_loss_ratio": 1.0,
"learning_rate": 4.182692307692308e-06,
"loss": 1.9679,
"mean_token_accuracy": 0.6994533620774745,
"num_tokens": 2205386.0,
"step": 30,
"train_ppl": 7.155398
},
{
"ce_loss": 1.6513,
"epoch": 0.005787979090925534,
"grad_norm": 12.4375,
"hf_loss_ratio": 1.0,
"learning_rate": 5.625e-06,
"loss": 1.6513,
"mean_token_accuracy": 0.7152167946100235,
"num_tokens": 2952129.0,
"step": 40,
"train_ppl": 5.21397
},
{
"ce_loss": 1.5017,
"epoch": 0.007234973863656917,
"grad_norm": 8.3125,
"hf_loss_ratio": 1.0,
"learning_rate": 7.067307692307692e-06,
"loss": 1.5017,
"mean_token_accuracy": 0.7155109643936157,
"num_tokens": 3667912.0,
"step": 50,
"train_ppl": 4.489093
},
{
"ce_loss": 1.3397,
"epoch": 0.008681968636388301,
"grad_norm": 3.328125,
"hf_loss_ratio": 1.0,
"learning_rate": 8.509615384615384e-06,
"loss": 1.3397,
"mean_token_accuracy": 0.7240443922579288,
"num_tokens": 4427526.0,
"step": 60,
"train_ppl": 3.817909
},
{
"ce_loss": 1.2534,
"epoch": 0.010128963409119684,
"grad_norm": 3.609375,
"hf_loss_ratio": 1.0,
"learning_rate": 9.951923076923077e-06,
"loss": 1.2534,
"mean_token_accuracy": 0.7320300832390785,
"num_tokens": 5160176.0,
"step": 70,
"train_ppl": 3.502394
},
{
"ce_loss": 1.1852,
"epoch": 0.011575958181851068,
"grad_norm": 4.0625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.139423076923077e-05,
"loss": 1.1852,
"mean_token_accuracy": 0.7428010664880276,
"num_tokens": 5911569.0,
"step": 80,
"train_ppl": 3.27122
},
{
"ce_loss": 1.131,
"epoch": 0.013022952954582452,
"grad_norm": 1.296875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.2836538461538462e-05,
"loss": 1.131,
"mean_token_accuracy": 0.7550130240619183,
"num_tokens": 6689615.0,
"step": 90,
"train_ppl": 3.098752
},
{
"ce_loss": 1.1475,
"epoch": 0.014469947727313835,
"grad_norm": 1.1015625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.4278846153846154e-05,
"loss": 1.1475,
"mean_token_accuracy": 0.7511672869324684,
"num_tokens": 7426028.0,
"step": 100,
"train_ppl": 3.150303
},
{
"ce_loss": 1.107,
"epoch": 0.015916942500045217,
"grad_norm": 1.1328125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.5721153846153848e-05,
"loss": 1.107,
"mean_token_accuracy": 0.761037639528513,
"num_tokens": 8168535.0,
"step": 110,
"train_ppl": 3.025315
},
{
"ce_loss": 1.155,
"epoch": 0.017363937272776603,
"grad_norm": 1.078125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.7163461538461537e-05,
"loss": 1.155,
"mean_token_accuracy": 0.7489694423973561,
"num_tokens": 8913465.0,
"step": 120,
"train_ppl": 3.174086
},
{
"ce_loss": 1.1527,
"epoch": 0.018810932045507985,
"grad_norm": 1.203125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.8605769230769233e-05,
"loss": 1.1527,
"mean_token_accuracy": 0.7528368845582009,
"num_tokens": 9631331.0,
"step": 130,
"train_ppl": 3.166877
},
{
"ce_loss": 1.0897,
"epoch": 0.020257926818239368,
"grad_norm": 1.2578125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.0048076923076922e-05,
"loss": 1.0897,
"mean_token_accuracy": 0.7576698914170266,
"num_tokens": 10387986.0,
"step": 140,
"train_ppl": 2.973338
},
{
"ce_loss": 1.0838,
"epoch": 0.021704921590970754,
"grad_norm": 0.99609375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.1490384615384615e-05,
"loss": 1.0838,
"mean_token_accuracy": 0.7615541353821754,
"num_tokens": 11156736.0,
"step": 150,
"train_ppl": 2.955747
},
{
"ce_loss": 1.1045,
"epoch": 0.023151916363702136,
"grad_norm": 1.25,
"hf_loss_ratio": 1.0,
"learning_rate": 2.2932692307692307e-05,
"loss": 1.1045,
"mean_token_accuracy": 0.7566463962197304,
"num_tokens": 11873395.0,
"step": 160,
"train_ppl": 3.017859
},
{
"ce_loss": 1.0972,
"epoch": 0.02459891113643352,
"grad_norm": 1.125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.4375e-05,
"loss": 1.0972,
"mean_token_accuracy": 0.7590832710266113,
"num_tokens": 12608710.0,
"step": 170,
"train_ppl": 2.995746
},
{
"ce_loss": 1.0663,
"epoch": 0.026045905909164904,
"grad_norm": 1.2734375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.5817307692307695e-05,
"loss": 1.0663,
"mean_token_accuracy": 0.7631561934947968,
"num_tokens": 13355138.0,
"step": 180,
"train_ppl": 2.904723
},
{
"ce_loss": 1.0532,
"epoch": 0.027492900681896287,
"grad_norm": 1.1015625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.7259615384615384e-05,
"loss": 1.0532,
"mean_token_accuracy": 0.7637556858360768,
"num_tokens": 14107781.0,
"step": 190,
"train_ppl": 2.866803
},
{
"ce_loss": 1.0673,
"epoch": 0.02893989545462767,
"grad_norm": 1.2421875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.870192307692308e-05,
"loss": 1.0673,
"mean_token_accuracy": 0.7635537907481194,
"num_tokens": 14852277.0,
"step": 200,
"train_ppl": 2.90758
},
{
"ce_loss": 1.0755,
"epoch": 0.030386890227359055,
"grad_norm": 1.2421875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.9995524392063257e-05,
"loss": 1.0755,
"mean_token_accuracy": 0.7621265381574631,
"num_tokens": 15546431.0,
"step": 210,
"train_ppl": 2.93156
},
{
"ce_loss": 1.125,
"epoch": 0.031833885000090434,
"grad_norm": 1.03125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.9950768312695806e-05,
"loss": 1.125,
"mean_token_accuracy": 0.7530753210186958,
"num_tokens": 16272344.0,
"step": 220,
"train_ppl": 3.080183
},
{
"ce_loss": 1.0847,
"epoch": 0.03328087977282182,
"grad_norm": 1.375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.9906012233328362e-05,
"loss": 1.0847,
"mean_token_accuracy": 0.7561856605112552,
"num_tokens": 17017303.0,
"step": 230,
"train_ppl": 2.958519
},
{
"ce_loss": 1.0307,
"epoch": 0.034727874545553206,
"grad_norm": 1.140625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.9861256153960914e-05,
"loss": 1.0307,
"mean_token_accuracy": 0.7656997129321098,
"num_tokens": 17774573.0,
"step": 240,
"train_ppl": 2.803042
},
{
"ce_loss": 1.0565,
"epoch": 0.036174869318284585,
"grad_norm": 1.15625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.9816500074593467e-05,
"loss": 1.0565,
"mean_token_accuracy": 0.7623364008963108,
"num_tokens": 18506619.0,
"step": 250,
"train_ppl": 2.876351
},
{
"ce_loss": 1.047,
"epoch": 0.03762186409101597,
"grad_norm": 1.3828125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.977174399522602e-05,
"loss": 1.047,
"mean_token_accuracy": 0.7634409129619598,
"num_tokens": 19281733.0,
"step": 260,
"train_ppl": 2.84913
},
{
"ce_loss": 1.0546,
"epoch": 0.039068858863747356,
"grad_norm": 1.0390625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.9726987915858572e-05,
"loss": 1.0546,
"mean_token_accuracy": 0.7609510987997055,
"num_tokens": 19987179.0,
"step": 270,
"train_ppl": 2.870774
},
{
"ce_loss": 1.0431,
"epoch": 0.040515853636478735,
"grad_norm": 0.99609375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.9682231836491124e-05,
"loss": 1.0431,
"mean_token_accuracy": 0.7634642273187637,
"num_tokens": 20745404.0,
"step": 280,
"train_ppl": 2.838059
},
{
"ce_loss": 1.0446,
"epoch": 0.04196284840921012,
"grad_norm": 1.203125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.9637475757123677e-05,
"loss": 1.0446,
"mean_token_accuracy": 0.7675992861390114,
"num_tokens": 21490797.0,
"step": 290,
"train_ppl": 2.842357
},
{
"ce_loss": 1.0772,
"epoch": 0.04340984318194151,
"grad_norm": 1.125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.959271967775623e-05,
"loss": 1.0772,
"mean_token_accuracy": 0.7634236924350262,
"num_tokens": 22209441.0,
"step": 300,
"train_ppl": 2.936523
},
{
"ce_loss": 1.0581,
"epoch": 0.044856837954672886,
"grad_norm": 1.203125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.954796359838878e-05,
"loss": 1.0581,
"mean_token_accuracy": 0.7604357182979584,
"num_tokens": 22924851.0,
"step": 310,
"train_ppl": 2.880844
},
{
"ce_loss": 1.0396,
"epoch": 0.04630383272740427,
"grad_norm": 1.125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.9503207519021337e-05,
"loss": 1.0396,
"mean_token_accuracy": 0.7631719268858432,
"num_tokens": 23660815.0,
"step": 320,
"train_ppl": 2.828141
},
{
"ce_loss": 1.0448,
"epoch": 0.04775082750013566,
"grad_norm": 1.015625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.9458451439653886e-05,
"loss": 1.0448,
"mean_token_accuracy": 0.7706776842474937,
"num_tokens": 24378060.0,
"step": 330,
"train_ppl": 2.842827
},
{
"ce_loss": 1.0389,
"epoch": 0.04919782227286704,
"grad_norm": 1.03125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.941369536028644e-05,
"loss": 1.0389,
"mean_token_accuracy": 0.7651800148189067,
"num_tokens": 25130726.0,
"step": 340,
"train_ppl": 2.826159
},
{
"ce_loss": 1.0548,
"epoch": 0.05064481704559842,
"grad_norm": 0.96484375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.9368939280918995e-05,
"loss": 1.0548,
"mean_token_accuracy": 0.7646659754216671,
"num_tokens": 25862673.0,
"step": 350,
"train_ppl": 2.871468
},
{
"ce_loss": 1.0698,
"epoch": 0.05209181181832981,
"grad_norm": 1.1484375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.9324183201551544e-05,
"loss": 1.0698,
"mean_token_accuracy": 0.763071033358574,
"num_tokens": 26609121.0,
"step": 360,
"train_ppl": 2.914941
},
{
"ce_loss": 1.0739,
"epoch": 0.05353880659106119,
"grad_norm": 1.3125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.92794271221841e-05,
"loss": 1.0739,
"mean_token_accuracy": 0.759658782184124,
"num_tokens": 27343011.0,
"step": 370,
"train_ppl": 2.926805
},
{
"ce_loss": 1.0897,
"epoch": 0.05498580136379257,
"grad_norm": 1.09375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.923467104281665e-05,
"loss": 1.0897,
"mean_token_accuracy": 0.7550988748669625,
"num_tokens": 28067081.0,
"step": 380,
"train_ppl": 2.973326
},
{
"ce_loss": 1.0626,
"epoch": 0.05643279613652396,
"grad_norm": 1.203125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.91899149634492e-05,
"loss": 1.0626,
"mean_token_accuracy": 0.757635698467493,
"num_tokens": 28798187.0,
"step": 390,
"train_ppl": 2.893869
},
{
"ce_loss": 1.036,
"epoch": 0.05787979090925534,
"grad_norm": 1.0546875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.9145158884081757e-05,
"loss": 1.036,
"mean_token_accuracy": 0.7649780534207821,
"num_tokens": 29531903.0,
"step": 400,
"train_ppl": 2.817834
},
{
"ce_loss": 1.0533,
"epoch": 0.059326785681986724,
"grad_norm": 0.94140625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.9100402804714306e-05,
"loss": 1.0533,
"mean_token_accuracy": 0.760666860640049,
"num_tokens": 30241613.0,
"step": 410,
"train_ppl": 2.867077
},
{
"ce_loss": 0.9798,
"epoch": 0.06077378045471811,
"grad_norm": 1.1484375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.9055646725346862e-05,
"loss": 0.9798,
"mean_token_accuracy": 0.7770380131900311,
"num_tokens": 31009377.0,
"step": 420,
"train_ppl": 2.663858
},
{
"ce_loss": 1.0212,
"epoch": 0.06222077522744949,
"grad_norm": 1.1953125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.9010890645979414e-05,
"loss": 1.0212,
"mean_token_accuracy": 0.7705600343644619,
"num_tokens": 31733086.0,
"step": 430,
"train_ppl": 2.77655
},
{
"ce_loss": 1.0513,
"epoch": 0.06366777000018087,
"grad_norm": 1.125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.8966134566611963e-05,
"loss": 1.0513,
"mean_token_accuracy": 0.7623658269643784,
"num_tokens": 32494212.0,
"step": 440,
"train_ppl": 2.861398
},
{
"ce_loss": 1.0261,
"epoch": 0.06511476477291225,
"grad_norm": 0.99609375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.892137848724452e-05,
"loss": 1.0261,
"mean_token_accuracy": 0.766685140132904,
"num_tokens": 33249862.0,
"step": 450,
"train_ppl": 2.790203
},
{
"ce_loss": 1.0145,
"epoch": 0.06656175954564364,
"grad_norm": 1.28125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.8876622407877068e-05,
"loss": 1.0145,
"mean_token_accuracy": 0.7710323743522167,
"num_tokens": 33978600.0,
"step": 460,
"train_ppl": 2.757857
},
{
"ce_loss": 1.0187,
"epoch": 0.06800875431837503,
"grad_norm": 1.171875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.8831866328509624e-05,
"loss": 1.0187,
"mean_token_accuracy": 0.7671968981623649,
"num_tokens": 34723642.0,
"step": 470,
"train_ppl": 2.76952
},
{
"ce_loss": 1.0289,
"epoch": 0.06945574909110641,
"grad_norm": 1.078125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.8787110249142176e-05,
"loss": 1.0289,
"mean_token_accuracy": 0.7625186502933502,
"num_tokens": 35439133.0,
"step": 480,
"train_ppl": 2.797885
},
{
"ce_loss": 1.0018,
"epoch": 0.0709027438638378,
"grad_norm": 0.9609375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.8742354169774726e-05,
"loss": 1.0018,
"mean_token_accuracy": 0.7706348761916161,
"num_tokens": 36184470.0,
"step": 490,
"train_ppl": 2.723119
},
{
"ce_loss": 1.023,
"epoch": 0.07234973863656917,
"grad_norm": 1.1484375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.869759809040728e-05,
"loss": 1.023,
"mean_token_accuracy": 0.7653927527368068,
"num_tokens": 36919930.0,
"step": 500,
"train_ppl": 2.781612
},
{
"ce_loss": 1.0274,
"epoch": 0.07379673340930056,
"grad_norm": 1.1015625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.8652842011039834e-05,
"loss": 1.0274,
"mean_token_accuracy": 0.7650810860097408,
"num_tokens": 37645758.0,
"step": 510,
"train_ppl": 2.793777
},
{
"ce_loss": 1.0478,
"epoch": 0.07524372818203194,
"grad_norm": 1.1328125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.8608085931672386e-05,
"loss": 1.0478,
"mean_token_accuracy": 0.7612765856087208,
"num_tokens": 38363698.0,
"step": 520,
"train_ppl": 2.85138
},
{
"ce_loss": 1.0149,
"epoch": 0.07669072295476333,
"grad_norm": 0.96875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.856332985230494e-05,
"loss": 1.0149,
"mean_token_accuracy": 0.7682214416563511,
"num_tokens": 39095412.0,
"step": 530,
"train_ppl": 2.759008
},
{
"ce_loss": 1.0218,
"epoch": 0.07813771772749471,
"grad_norm": 1.0,
"hf_loss_ratio": 1.0,
"learning_rate": 2.8518573772937495e-05,
"loss": 1.0218,
"mean_token_accuracy": 0.7704101949930191,
"num_tokens": 39877031.0,
"step": 540,
"train_ppl": 2.778117
},
{
"ce_loss": 1.0751,
"epoch": 0.0795847125002261,
"grad_norm": 1.171875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.8473817693570044e-05,
"loss": 1.0751,
"mean_token_accuracy": 0.7600487649440766,
"num_tokens": 40593628.0,
"step": 550,
"train_ppl": 2.930418
},
{
"ce_loss": 0.9919,
"epoch": 0.08103170727295747,
"grad_norm": 0.9609375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.8429061614202596e-05,
"loss": 0.9919,
"mean_token_accuracy": 0.7756079971790314,
"num_tokens": 41350737.0,
"step": 560,
"train_ppl": 2.696299
},
{
"ce_loss": 1.0013,
"epoch": 0.08247870204568886,
"grad_norm": 1.1015625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.838430553483515e-05,
"loss": 1.0013,
"mean_token_accuracy": 0.768417052924633,
"num_tokens": 42091923.0,
"step": 570,
"train_ppl": 2.721766
},
{
"ce_loss": 1.0212,
"epoch": 0.08392569681842024,
"grad_norm": 1.0390625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.83395494554677e-05,
"loss": 1.0212,
"mean_token_accuracy": 0.7705964192748069,
"num_tokens": 42843505.0,
"step": 580,
"train_ppl": 2.776561
},
{
"ce_loss": 0.9852,
"epoch": 0.08537269159115163,
"grad_norm": 0.98828125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.8294793376100257e-05,
"loss": 0.9852,
"mean_token_accuracy": 0.7744002252817154,
"num_tokens": 43582786.0,
"step": 590,
"train_ppl": 2.678277
},
{
"ce_loss": 1.0398,
"epoch": 0.08681968636388301,
"grad_norm": 1.0625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.8250037296732806e-05,
"loss": 1.0398,
"mean_token_accuracy": 0.7641379170119762,
"num_tokens": 44305457.0,
"step": 600,
"train_ppl": 2.828777
},
{
"ce_loss": 1.0506,
"epoch": 0.0882666811366144,
"grad_norm": 0.96875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.8205281217365358e-05,
"loss": 1.0506,
"mean_token_accuracy": 0.7625304482877254,
"num_tokens": 45041194.0,
"step": 610,
"train_ppl": 2.859436
},
{
"ce_loss": 1.0399,
"epoch": 0.08971367590934577,
"grad_norm": 1.0234375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.8160525137997914e-05,
"loss": 1.0399,
"mean_token_accuracy": 0.7632023870944977,
"num_tokens": 45759428.0,
"step": 620,
"train_ppl": 2.828851
},
{
"ce_loss": 0.9818,
"epoch": 0.09116067068207716,
"grad_norm": 1.015625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.8115769058630463e-05,
"loss": 0.9818,
"mean_token_accuracy": 0.7739991441369056,
"num_tokens": 46539074.0,
"step": 630,
"train_ppl": 2.669149
},
{
"ce_loss": 1.0629,
"epoch": 0.09260766545480854,
"grad_norm": 1.3671875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.807101297926302e-05,
"loss": 1.0629,
"mean_token_accuracy": 0.7601286731660366,
"num_tokens": 47260819.0,
"step": 640,
"train_ppl": 2.894784
},
{
"ce_loss": 1.0038,
"epoch": 0.09405466022753993,
"grad_norm": 1.109375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.802625689989557e-05,
"loss": 1.0038,
"mean_token_accuracy": 0.77047905549407,
"num_tokens": 48047185.0,
"step": 650,
"train_ppl": 2.728604
},
{
"ce_loss": 0.9987,
"epoch": 0.09550165500027132,
"grad_norm": 1.03125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.798150082052812e-05,
"loss": 0.9987,
"mean_token_accuracy": 0.7709697797894478,
"num_tokens": 48790335.0,
"step": 660,
"train_ppl": 2.714848
},
{
"ce_loss": 1.0216,
"epoch": 0.0969486497730027,
"grad_norm": 1.0078125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.7936744741160676e-05,
"loss": 1.0216,
"mean_token_accuracy": 0.7681831575930118,
"num_tokens": 49512949.0,
"step": 670,
"train_ppl": 2.777644
},
{
"ce_loss": 1.0012,
"epoch": 0.09839564454573407,
"grad_norm": 1.15625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.7891988661793225e-05,
"loss": 1.0012,
"mean_token_accuracy": 0.7718318410217762,
"num_tokens": 50255708.0,
"step": 680,
"train_ppl": 2.721635
},
{
"ce_loss": 1.0218,
"epoch": 0.09984263931846546,
"grad_norm": 1.0234375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.784723258242578e-05,
"loss": 1.0218,
"mean_token_accuracy": 0.7731546863913537,
"num_tokens": 51030898.0,
"step": 690,
"train_ppl": 2.778237
},
{
"ce_loss": 1.0546,
"epoch": 0.10128963409119685,
"grad_norm": 1.0078125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.7802476503058334e-05,
"loss": 1.0546,
"mean_token_accuracy": 0.7618527382612228,
"num_tokens": 51766323.0,
"step": 700,
"train_ppl": 2.870824
},
{
"ce_loss": 1.0146,
"epoch": 0.10273662886392823,
"grad_norm": 1.2109375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.7757720423690883e-05,
"loss": 1.0146,
"mean_token_accuracy": 0.7683967478573323,
"num_tokens": 52478018.0,
"step": 710,
"train_ppl": 2.758134
},
{
"ce_loss": 0.9898,
"epoch": 0.10418362363665962,
"grad_norm": 1.2578125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.771296434432344e-05,
"loss": 0.9898,
"mean_token_accuracy": 0.7749556273221969,
"num_tokens": 53197381.0,
"step": 720,
"train_ppl": 2.690634
},
{
"ce_loss": 1.0148,
"epoch": 0.105630618409391,
"grad_norm": 1.3828125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.766820826495599e-05,
"loss": 1.0148,
"mean_token_accuracy": 0.7660286217927933,
"num_tokens": 53959271.0,
"step": 730,
"train_ppl": 2.758879
},
{
"ce_loss": 0.9988,
"epoch": 0.10707761318212237,
"grad_norm": 1.2890625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.7623452185588543e-05,
"loss": 0.9988,
"mean_token_accuracy": 0.7756357662379741,
"num_tokens": 54734873.0,
"step": 740,
"train_ppl": 2.715152
},
{
"ce_loss": 0.9886,
"epoch": 0.10852460795485376,
"grad_norm": 1.25,
"hf_loss_ratio": 1.0,
"learning_rate": 2.7578696106221096e-05,
"loss": 0.9886,
"mean_token_accuracy": 0.7769335299730301,
"num_tokens": 55488727.0,
"step": 750,
"train_ppl": 2.687502
},
{
"ce_loss": 1.0076,
"epoch": 0.10997160272758515,
"grad_norm": 0.9296875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.753394002685365e-05,
"loss": 1.0076,
"mean_token_accuracy": 0.7681085780262947,
"num_tokens": 56208627.0,
"step": 760,
"train_ppl": 2.739055
},
{
"ce_loss": 0.9727,
"epoch": 0.11141859750031653,
"grad_norm": 1.375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.74891839474862e-05,
"loss": 0.9727,
"mean_token_accuracy": 0.7748353876173496,
"num_tokens": 56980088.0,
"step": 770,
"train_ppl": 2.645072
},
{
"ce_loss": 0.9921,
"epoch": 0.11286559227304792,
"grad_norm": 0.9609375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.7444427868118753e-05,
"loss": 0.9921,
"mean_token_accuracy": 0.7719174005091191,
"num_tokens": 57698460.0,
"step": 780,
"train_ppl": 2.697013
},
{
"ce_loss": 1.0101,
"epoch": 0.11431258704577929,
"grad_norm": 0.98828125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.7399671788751306e-05,
"loss": 1.0101,
"mean_token_accuracy": 0.7697246864438057,
"num_tokens": 58420421.0,
"step": 790,
"train_ppl": 2.74584
},
{
"ce_loss": 1.0296,
"epoch": 0.11575958181851068,
"grad_norm": 1.0,
"hf_loss_ratio": 1.0,
"learning_rate": 2.7354915709383858e-05,
"loss": 1.0296,
"mean_token_accuracy": 0.7663743153214455,
"num_tokens": 59148535.0,
"step": 800,
"train_ppl": 2.80003
},
{
"ce_loss": 0.9826,
"epoch": 0.11720657659124206,
"grad_norm": 1.1953125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.7310159630016414e-05,
"loss": 0.9826,
"mean_token_accuracy": 0.7738265834748745,
"num_tokens": 59886300.0,
"step": 810,
"train_ppl": 2.67137
},
{
"ce_loss": 0.9979,
"epoch": 0.11865357136397345,
"grad_norm": 0.953125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.7265403550648963e-05,
"loss": 0.9979,
"mean_token_accuracy": 0.7731278233230114,
"num_tokens": 60616165.0,
"step": 820,
"train_ppl": 2.712621
},
{
"ce_loss": 1.001,
"epoch": 0.12010056613670483,
"grad_norm": 1.09375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.7220647471281515e-05,
"loss": 1.001,
"mean_token_accuracy": 0.7734205923974514,
"num_tokens": 61333780.0,
"step": 830,
"train_ppl": 2.720872
},
{
"ce_loss": 0.9622,
"epoch": 0.12154756090943622,
"grad_norm": 0.96875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.717589139191407e-05,
"loss": 0.9622,
"mean_token_accuracy": 0.7805940173566341,
"num_tokens": 62084399.0,
"step": 840,
"train_ppl": 2.617573
},
{
"ce_loss": 1.0292,
"epoch": 0.12299455568216759,
"grad_norm": 1.0546875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.713113531254662e-05,
"loss": 1.0292,
"mean_token_accuracy": 0.7698862083256245,
"num_tokens": 62786252.0,
"step": 850,
"train_ppl": 2.798803
},
{
"ce_loss": 0.9863,
"epoch": 0.12444155045489898,
"grad_norm": 0.94921875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.7086379233179176e-05,
"loss": 0.9863,
"mean_token_accuracy": 0.7744859166443347,
"num_tokens": 63552303.0,
"step": 860,
"train_ppl": 2.681383
},
{
"ce_loss": 1.0463,
"epoch": 0.12588854522763038,
"grad_norm": 1.109375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.7041623153811725e-05,
"loss": 1.0463,
"mean_token_accuracy": 0.7598242215812206,
"num_tokens": 64291902.0,
"step": 870,
"train_ppl": 2.846986
},
{
"ce_loss": 1.0143,
"epoch": 0.12733554000036174,
"grad_norm": 1.1171875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.6996867074444278e-05,
"loss": 1.0143,
"mean_token_accuracy": 0.7722109064459801,
"num_tokens": 65062010.0,
"step": 880,
"train_ppl": 2.757514
},
{
"ce_loss": 0.9824,
"epoch": 0.12878253477309312,
"grad_norm": 1.1328125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.6952110995076834e-05,
"loss": 0.9824,
"mean_token_accuracy": 0.7738293096423149,
"num_tokens": 65801609.0,
"step": 890,
"train_ppl": 2.67092
},
{
"ce_loss": 1.0333,
"epoch": 0.1302295295458245,
"grad_norm": 1.0546875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.6907354915709383e-05,
"loss": 1.0333,
"mean_token_accuracy": 0.7661075979471207,
"num_tokens": 66511678.0,
"step": 900,
"train_ppl": 2.810267
},
{
"ce_loss": 1.0035,
"epoch": 0.1316765243185559,
"grad_norm": 1.1328125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.686259883634194e-05,
"loss": 1.0035,
"mean_token_accuracy": 0.7725445240736007,
"num_tokens": 67237118.0,
"step": 910,
"train_ppl": 2.727891
},
{
"ce_loss": 1.0143,
"epoch": 0.13312351909128728,
"grad_norm": 0.95703125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.681784275697449e-05,
"loss": 1.0143,
"mean_token_accuracy": 0.770337475836277,
"num_tokens": 67960278.0,
"step": 920,
"train_ppl": 2.757525
},
{
"ce_loss": 1.0292,
"epoch": 0.13457051386401866,
"grad_norm": 1.03125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.677308667760704e-05,
"loss": 1.0292,
"mean_token_accuracy": 0.7616572365164757,
"num_tokens": 68667137.0,
"step": 930,
"train_ppl": 2.798916
},
{
"ce_loss": 0.9922,
"epoch": 0.13601750863675005,
"grad_norm": 0.88671875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.6728330598239596e-05,
"loss": 0.9922,
"mean_token_accuracy": 0.7753356233239174,
"num_tokens": 69397579.0,
"step": 940,
"train_ppl": 2.697085
},
{
"ce_loss": 1.0193,
"epoch": 0.13746450340948144,
"grad_norm": 1.21875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.6683574518872145e-05,
"loss": 1.0193,
"mean_token_accuracy": 0.7674314551055431,
"num_tokens": 70138483.0,
"step": 950,
"train_ppl": 2.771351
},
{
"ce_loss": 1.0101,
"epoch": 0.13891149818221282,
"grad_norm": 1.0234375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.66388184395047e-05,
"loss": 1.0101,
"mean_token_accuracy": 0.7684113517403602,
"num_tokens": 70893702.0,
"step": 960,
"train_ppl": 2.745858
},
{
"ce_loss": 0.9906,
"epoch": 0.1403584929549442,
"grad_norm": 1.1171875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.6594062360137253e-05,
"loss": 0.9906,
"mean_token_accuracy": 0.7723499283194541,
"num_tokens": 71651876.0,
"step": 970,
"train_ppl": 2.692868
},
{
"ce_loss": 1.0207,
"epoch": 0.1418054877276756,
"grad_norm": 1.328125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.6549306280769806e-05,
"loss": 1.0207,
"mean_token_accuracy": 0.7665747530758381,
"num_tokens": 72377679.0,
"step": 980,
"train_ppl": 2.775166
},
{
"ce_loss": 0.9936,
"epoch": 0.14325248250040698,
"grad_norm": 1.078125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.6504550201402358e-05,
"loss": 0.9936,
"mean_token_accuracy": 0.7710120238363742,
"num_tokens": 73103927.0,
"step": 990,
"train_ppl": 2.700822
},
{
"ce_loss": 0.9695,
"epoch": 0.14469947727313834,
"grad_norm": 1.09375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.645979412203491e-05,
"loss": 0.9695,
"mean_token_accuracy": 0.7770053826272487,
"num_tokens": 73844957.0,
"step": 1000,
"train_ppl": 2.636754
},
{
"ce_loss": 1.0049,
"epoch": 0.14614647204586972,
"grad_norm": 0.96484375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.6415038042667463e-05,
"loss": 1.0049,
"mean_token_accuracy": 0.7748589895665645,
"num_tokens": 74603514.0,
"step": 1010,
"train_ppl": 2.731605
},
{
"ce_loss": 1.0422,
"epoch": 0.1475934668186011,
"grad_norm": 0.99609375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.6370281963300015e-05,
"loss": 1.0422,
"mean_token_accuracy": 0.7634790919721126,
"num_tokens": 75341775.0,
"step": 1020,
"train_ppl": 2.835447
},
{
"ce_loss": 0.9876,
"epoch": 0.1490404615913325,
"grad_norm": 1.0625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.632552588393257e-05,
"loss": 0.9876,
"mean_token_accuracy": 0.7736144475638866,
"num_tokens": 76068700.0,
"step": 1030,
"train_ppl": 2.684756
},
{
"ce_loss": 0.9743,
"epoch": 0.15048745636406388,
"grad_norm": 1.328125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.628076980456512e-05,
"loss": 0.9743,
"mean_token_accuracy": 0.7698041521012783,
"num_tokens": 76790471.0,
"step": 1040,
"train_ppl": 2.649441
},
{
"ce_loss": 1.0106,
"epoch": 0.15193445113679527,
"grad_norm": 0.953125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.6236013725197673e-05,
"loss": 1.0106,
"mean_token_accuracy": 0.7718939520418644,
"num_tokens": 77528424.0,
"step": 1050,
"train_ppl": 2.747122
},
{
"ce_loss": 0.9585,
"epoch": 0.15338144590952665,
"grad_norm": 0.984375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.6191257645830225e-05,
"loss": 0.9585,
"mean_token_accuracy": 0.7821242325007915,
"num_tokens": 78282846.0,
"step": 1060,
"train_ppl": 2.607741
},
{
"ce_loss": 1.0218,
"epoch": 0.15482844068225804,
"grad_norm": 0.95703125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.6146501566462778e-05,
"loss": 1.0218,
"mean_token_accuracy": 0.766200902312994,
"num_tokens": 79027597.0,
"step": 1070,
"train_ppl": 2.778107
},
{
"ce_loss": 0.9949,
"epoch": 0.15627543545498943,
"grad_norm": 1.0390625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.6101745487095333e-05,
"loss": 0.9949,
"mean_token_accuracy": 0.7705755203962326,
"num_tokens": 79743637.0,
"step": 1080,
"train_ppl": 2.70455
},
{
"ce_loss": 1.0277,
"epoch": 0.1577224302277208,
"grad_norm": 1.1015625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.6056989407727882e-05,
"loss": 1.0277,
"mean_token_accuracy": 0.7647506572306156,
"num_tokens": 80473185.0,
"step": 1090,
"train_ppl": 2.794623
},
{
"ce_loss": 0.965,
"epoch": 0.1591694250004522,
"grad_norm": 0.97265625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.6012233328360435e-05,
"loss": 0.965,
"mean_token_accuracy": 0.7723382718861103,
"num_tokens": 81206214.0,
"step": 1100,
"train_ppl": 2.624738
},
{
"ce_loss": 0.988,
"epoch": 0.16061641977318358,
"grad_norm": 1.0078125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.596747724899299e-05,
"loss": 0.988,
"mean_token_accuracy": 0.7725288093090057,
"num_tokens": 81957112.0,
"step": 1110,
"train_ppl": 2.685843
},
{
"ce_loss": 0.9953,
"epoch": 0.16206341454591494,
"grad_norm": 1.0625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.592272116962554e-05,
"loss": 0.9953,
"mean_token_accuracy": 0.771150516718626,
"num_tokens": 82713929.0,
"step": 1120,
"train_ppl": 2.705614
},
{
"ce_loss": 1.0077,
"epoch": 0.16351040931864633,
"grad_norm": 1.015625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.5877965090258096e-05,
"loss": 1.0077,
"mean_token_accuracy": 0.7694192692637444,
"num_tokens": 83463522.0,
"step": 1130,
"train_ppl": 2.739307
},
{
"ce_loss": 1.0273,
"epoch": 0.1649574040913777,
"grad_norm": 1.0078125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.5833209010890648e-05,
"loss": 1.0273,
"mean_token_accuracy": 0.769251874089241,
"num_tokens": 84188031.0,
"step": 1140,
"train_ppl": 2.793589
},
{
"ce_loss": 1.0097,
"epoch": 0.1664043988641091,
"grad_norm": 0.953125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.5788452931523197e-05,
"loss": 1.0097,
"mean_token_accuracy": 0.7688002400100231,
"num_tokens": 84918572.0,
"step": 1150,
"train_ppl": 2.74465
},
{
"ce_loss": 0.9846,
"epoch": 0.16785139363684048,
"grad_norm": 1.0546875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.5743696852155753e-05,
"loss": 0.9846,
"mean_token_accuracy": 0.7792325161397458,
"num_tokens": 85637924.0,
"step": 1160,
"train_ppl": 2.676852
},
{
"ce_loss": 0.971,
"epoch": 0.16929838840957187,
"grad_norm": 1.109375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.5698940772788302e-05,
"loss": 0.971,
"mean_token_accuracy": 0.7782729744911194,
"num_tokens": 86375295.0,
"step": 1170,
"train_ppl": 2.640504
},
{
"ce_loss": 1.0133,
"epoch": 0.17074538318230326,
"grad_norm": 1.1875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.5654184693420858e-05,
"loss": 1.0133,
"mean_token_accuracy": 0.7730432473123073,
"num_tokens": 87109044.0,
"step": 1180,
"train_ppl": 2.754625
},
{
"ce_loss": 0.9703,
"epoch": 0.17219237795503464,
"grad_norm": 1.0234375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.560942861405341e-05,
"loss": 0.9703,
"mean_token_accuracy": 0.7804669737815857,
"num_tokens": 87823377.0,
"step": 1190,
"train_ppl": 2.638814
},
{
"ce_loss": 0.9692,
"epoch": 0.17363937272776603,
"grad_norm": 1.078125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.5564672534685963e-05,
"loss": 0.9692,
"mean_token_accuracy": 0.7746523730456829,
"num_tokens": 88551984.0,
"step": 1200,
"train_ppl": 2.635899
},
{
"ce_loss": 0.9945,
"epoch": 0.17508636750049741,
"grad_norm": 1.015625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.5519916455318515e-05,
"loss": 0.9945,
"mean_token_accuracy": 0.7793050222098827,
"num_tokens": 89293732.0,
"step": 1210,
"train_ppl": 2.703368
},
{
"ce_loss": 0.9821,
"epoch": 0.1765333622732288,
"grad_norm": 1.234375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.5475160375951068e-05,
"loss": 0.9821,
"mean_token_accuracy": 0.7767940178513527,
"num_tokens": 90009099.0,
"step": 1220,
"train_ppl": 2.670185
},
{
"ce_loss": 0.9914,
"epoch": 0.17798035704596016,
"grad_norm": 1.09375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.543040429658362e-05,
"loss": 0.9914,
"mean_token_accuracy": 0.7680940054357052,
"num_tokens": 90713440.0,
"step": 1230,
"train_ppl": 2.69505
},
{
"ce_loss": 0.9752,
"epoch": 0.17942735181869154,
"grad_norm": 1.1484375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.5385648217216173e-05,
"loss": 0.9752,
"mean_token_accuracy": 0.7775831647217274,
"num_tokens": 91458197.0,
"step": 1240,
"train_ppl": 2.651746
},
{
"ce_loss": 0.972,
"epoch": 0.18087434659142293,
"grad_norm": 1.046875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.5340892137848725e-05,
"loss": 0.972,
"mean_token_accuracy": 0.7771682500839233,
"num_tokens": 92204785.0,
"step": 1250,
"train_ppl": 2.64311
},
{
"ce_loss": 0.9545,
"epoch": 0.18232134136415432,
"grad_norm": 1.1796875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.5296136058481277e-05,
"loss": 0.9545,
"mean_token_accuracy": 0.7803010269999504,
"num_tokens": 92965785.0,
"step": 1260,
"train_ppl": 2.597424
},
{
"ce_loss": 0.9658,
"epoch": 0.1837683361368857,
"grad_norm": 1.046875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.525137997911383e-05,
"loss": 0.9658,
"mean_token_accuracy": 0.7732729889452458,
"num_tokens": 93749479.0,
"step": 1270,
"train_ppl": 2.626844
},
{
"ce_loss": 0.9175,
"epoch": 0.1852153309096171,
"grad_norm": 1.140625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.5206623899746382e-05,
"loss": 0.9175,
"mean_token_accuracy": 0.7875691160559655,
"num_tokens": 94490987.0,
"step": 1280,
"train_ppl": 2.50292
},
{
"ce_loss": 1.0091,
"epoch": 0.18666232568234847,
"grad_norm": 1.015625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.5161867820378935e-05,
"loss": 1.0091,
"mean_token_accuracy": 0.7689063064754009,
"num_tokens": 95239798.0,
"step": 1290,
"train_ppl": 2.74315
},
{
"ce_loss": 0.9981,
"epoch": 0.18810932045507986,
"grad_norm": 1.2578125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.511711174101149e-05,
"loss": 0.9981,
"mean_token_accuracy": 0.7733910351991653,
"num_tokens": 95971638.0,
"step": 1300,
"train_ppl": 2.713218
},
{
"ce_loss": 0.973,
"epoch": 0.18955631522781125,
"grad_norm": 1.1171875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.507235566164404e-05,
"loss": 0.973,
"mean_token_accuracy": 0.7790097333490849,
"num_tokens": 96708517.0,
"step": 1310,
"train_ppl": 2.645934
},
{
"ce_loss": 0.994,
"epoch": 0.19100331000054263,
"grad_norm": 0.90625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.5027599582276592e-05,
"loss": 0.994,
"mean_token_accuracy": 0.7691507421433925,
"num_tokens": 97438831.0,
"step": 1320,
"train_ppl": 2.701936
},
{
"ce_loss": 0.9829,
"epoch": 0.19245030477327402,
"grad_norm": 1.0390625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.4982843502909148e-05,
"loss": 0.9829,
"mean_token_accuracy": 0.7720185928046703,
"num_tokens": 98167703.0,
"step": 1330,
"train_ppl": 2.672221
},
{
"ce_loss": 1.0042,
"epoch": 0.1938972995460054,
"grad_norm": 1.203125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.4938087423541697e-05,
"loss": 1.0042,
"mean_token_accuracy": 0.773903863132,
"num_tokens": 98916022.0,
"step": 1340,
"train_ppl": 2.72972
},
{
"ce_loss": 1.0223,
"epoch": 0.19534429431873676,
"grad_norm": 1.28125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.4893331344174253e-05,
"loss": 1.0223,
"mean_token_accuracy": 0.7680788926780224,
"num_tokens": 99656326.0,
"step": 1350,
"train_ppl": 2.779674
},
{
"ce_loss": 1.0159,
"epoch": 0.19679128909146815,
"grad_norm": 1.2578125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.4848575264806802e-05,
"loss": 1.0159,
"mean_token_accuracy": 0.7670142784714699,
"num_tokens": 100366830.0,
"step": 1360,
"train_ppl": 2.761858
},
{
"ce_loss": 0.9412,
"epoch": 0.19823828386419953,
"grad_norm": 1.1484375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.4803819185439354e-05,
"loss": 0.9412,
"mean_token_accuracy": 0.7805588349699975,
"num_tokens": 101103405.0,
"step": 1370,
"train_ppl": 2.562954
},
{
"ce_loss": 1.0126,
"epoch": 0.19968527863693092,
"grad_norm": 1.1484375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.475906310607191e-05,
"loss": 1.0126,
"mean_token_accuracy": 0.769621242582798,
"num_tokens": 101841805.0,
"step": 1380,
"train_ppl": 2.752685
},
{
"ce_loss": 0.9851,
"epoch": 0.2011322734096623,
"grad_norm": 1.0390625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.471430702670446e-05,
"loss": 0.9851,
"mean_token_accuracy": 0.7694549061357975,
"num_tokens": 102587079.0,
"step": 1390,
"train_ppl": 2.67799
},
{
"ce_loss": 1.0044,
"epoch": 0.2025792681823937,
"grad_norm": 1.0390625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.4669550947337015e-05,
"loss": 1.0044,
"mean_token_accuracy": 0.7683346226811409,
"num_tokens": 103349174.0,
"step": 1400,
"train_ppl": 2.730359
},
{
"ce_loss": 0.9611,
"epoch": 0.20402626295512508,
"grad_norm": 1.0078125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.4624794867969568e-05,
"loss": 0.9611,
"mean_token_accuracy": 0.7769466623663902,
"num_tokens": 104090462.0,
"step": 1410,
"train_ppl": 2.614475
},
{
"ce_loss": 0.9999,
"epoch": 0.20547325772785646,
"grad_norm": 1.5625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.458003878860212e-05,
"loss": 0.9999,
"mean_token_accuracy": 0.7739646673202515,
"num_tokens": 104807032.0,
"step": 1420,
"train_ppl": 2.718026
},
{
"ce_loss": 0.992,
"epoch": 0.20692025250058785,
"grad_norm": 1.046875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.4535282709234672e-05,
"loss": 0.992,
"mean_token_accuracy": 0.7719819858670235,
"num_tokens": 105536067.0,
"step": 1430,
"train_ppl": 2.696496
},
{
"ce_loss": 0.965,
"epoch": 0.20836724727331923,
"grad_norm": 1.0703125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.4490526629867225e-05,
"loss": 0.965,
"mean_token_accuracy": 0.782091249525547,
"num_tokens": 106292581.0,
"step": 1440,
"train_ppl": 2.624887
},
{
"ce_loss": 1.0016,
"epoch": 0.20981424204605062,
"grad_norm": 1.15625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.4445770550499777e-05,
"loss": 1.0016,
"mean_token_accuracy": 0.7689143389463424,
"num_tokens": 107002756.0,
"step": 1450,
"train_ppl": 2.722517
},
{
"ce_loss": 0.9808,
"epoch": 0.211261236818782,
"grad_norm": 0.8984375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.440101447113233e-05,
"loss": 0.9808,
"mean_token_accuracy": 0.7709385193884373,
"num_tokens": 107735109.0,
"step": 1460,
"train_ppl": 2.666501
},
{
"ce_loss": 0.965,
"epoch": 0.21270823159151336,
"grad_norm": 1.109375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.4356258391764882e-05,
"loss": 0.965,
"mean_token_accuracy": 0.7816490411758423,
"num_tokens": 108488189.0,
"step": 1470,
"train_ppl": 2.624826
},
{
"ce_loss": 0.984,
"epoch": 0.21415522636424475,
"grad_norm": 1.0703125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.4311502312397435e-05,
"loss": 0.984,
"mean_token_accuracy": 0.7733917005360127,
"num_tokens": 109227381.0,
"step": 1480,
"train_ppl": 2.675031
},
{
"ce_loss": 1.0325,
"epoch": 0.21560222113697614,
"grad_norm": 1.0390625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.4266746233029987e-05,
"loss": 1.0325,
"mean_token_accuracy": 0.7697164453566074,
"num_tokens": 109967419.0,
"step": 1490,
"train_ppl": 2.808141
},
{
"ce_loss": 0.9488,
"epoch": 0.21704921590970752,
"grad_norm": 1.0859375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.422199015366254e-05,
"loss": 0.9488,
"mean_token_accuracy": 0.779134713858366,
"num_tokens": 110728249.0,
"step": 1500,
"train_ppl": 2.582697
},
{
"ce_loss": 1.0317,
"epoch": 0.2184962106824389,
"grad_norm": 1.0078125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.4177234074295092e-05,
"loss": 1.0317,
"mean_token_accuracy": 0.7620711497962475,
"num_tokens": 111457904.0,
"step": 1510,
"train_ppl": 2.805772
},
{
"ce_loss": 0.9886,
"epoch": 0.2199432054551703,
"grad_norm": 1.015625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.4132477994927648e-05,
"loss": 0.9886,
"mean_token_accuracy": 0.7727661252021789,
"num_tokens": 112189931.0,
"step": 1520,
"train_ppl": 2.687597
},
{
"ce_loss": 1.0147,
"epoch": 0.22139020022790168,
"grad_norm": 1.015625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.4087721915560197e-05,
"loss": 1.0147,
"mean_token_accuracy": 0.7641719624400138,
"num_tokens": 112953522.0,
"step": 1530,
"train_ppl": 2.758408
},
{
"ce_loss": 0.9716,
"epoch": 0.22283719500063306,
"grad_norm": 1.0078125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.404296583619275e-05,
"loss": 0.9716,
"mean_token_accuracy": 0.7772294074296952,
"num_tokens": 113698414.0,
"step": 1540,
"train_ppl": 2.642101
},
{
"ce_loss": 0.9623,
"epoch": 0.22428418977336445,
"grad_norm": 1.0234375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.3998209756825302e-05,
"loss": 0.9623,
"mean_token_accuracy": 0.7757225722074509,
"num_tokens": 114430630.0,
"step": 1550,
"train_ppl": 2.617647
},
{
"ce_loss": 0.997,
"epoch": 0.22573118454609584,
"grad_norm": 1.015625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.3953453677457854e-05,
"loss": 0.997,
"mean_token_accuracy": 0.7703205697238446,
"num_tokens": 115166141.0,
"step": 1560,
"train_ppl": 2.710057
},
{
"ce_loss": 0.9953,
"epoch": 0.22717817931882722,
"grad_norm": 1.4609375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.390869759809041e-05,
"loss": 0.9953,
"mean_token_accuracy": 0.771430192887783,
"num_tokens": 115889580.0,
"step": 1570,
"train_ppl": 2.705503
},
{
"ce_loss": 0.9531,
"epoch": 0.22862517409155858,
"grad_norm": 1.1171875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.386394151872296e-05,
"loss": 0.9531,
"mean_token_accuracy": 0.781104639172554,
"num_tokens": 116629845.0,
"step": 1580,
"train_ppl": 2.593619
},
{
"ce_loss": 0.9679,
"epoch": 0.23007216886428997,
"grad_norm": 1.0390625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.381918543935551e-05,
"loss": 0.9679,
"mean_token_accuracy": 0.7786240108311177,
"num_tokens": 117372885.0,
"step": 1590,
"train_ppl": 2.632371
},
{
"ce_loss": 0.9785,
"epoch": 0.23151916363702135,
"grad_norm": 1.4296875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.3774429359988067e-05,
"loss": 0.9785,
"mean_token_accuracy": 0.7776103042066097,
"num_tokens": 118132367.0,
"step": 1600,
"train_ppl": 2.66055
},
{
"ce_loss": 0.9715,
"epoch": 0.23296615840975274,
"grad_norm": 1.1328125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.3729673280620616e-05,
"loss": 0.9715,
"mean_token_accuracy": 0.7777374930679798,
"num_tokens": 118846692.0,
"step": 1610,
"train_ppl": 2.641897
},
{
"ce_loss": 0.9917,
"epoch": 0.23441315318248412,
"grad_norm": 1.0,
"hf_loss_ratio": 1.0,
"learning_rate": 2.3684917201253172e-05,
"loss": 0.9917,
"mean_token_accuracy": 0.7717310026288032,
"num_tokens": 119577822.0,
"step": 1620,
"train_ppl": 2.695707
},
{
"ce_loss": 1.0171,
"epoch": 0.2358601479552155,
"grad_norm": 1.3125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.3640161121885725e-05,
"loss": 1.0171,
"mean_token_accuracy": 0.7664790794253349,
"num_tokens": 120308082.0,
"step": 1630,
"train_ppl": 2.765049
},
{
"ce_loss": 0.9736,
"epoch": 0.2373071427279469,
"grad_norm": 1.078125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.3595405042518274e-05,
"loss": 0.9736,
"mean_token_accuracy": 0.7768724001944065,
"num_tokens": 121049818.0,
"step": 1640,
"train_ppl": 2.647552
},
{
"ce_loss": 0.9504,
"epoch": 0.23875413750067828,
"grad_norm": 1.0859375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.355064896315083e-05,
"loss": 0.9504,
"mean_token_accuracy": 0.783089691400528,
"num_tokens": 121788637.0,
"step": 1650,
"train_ppl": 2.586798
},
{
"ce_loss": 0.9677,
"epoch": 0.24020113227340967,
"grad_norm": 1.0,
"hf_loss_ratio": 1.0,
"learning_rate": 2.350589288378338e-05,
"loss": 0.9677,
"mean_token_accuracy": 0.7775506429374218,
"num_tokens": 122522757.0,
"step": 1660,
"train_ppl": 2.63188
},
{
"ce_loss": 0.9579,
"epoch": 0.24164812704614105,
"grad_norm": 1.0859375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.3461136804415935e-05,
"loss": 0.9579,
"mean_token_accuracy": 0.7754926040768624,
"num_tokens": 123241955.0,
"step": 1670,
"train_ppl": 2.606329
},
{
"ce_loss": 0.9865,
"epoch": 0.24309512181887244,
"grad_norm": 0.984375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.3416380725048487e-05,
"loss": 0.9865,
"mean_token_accuracy": 0.7741681657731533,
"num_tokens": 123980600.0,
"step": 1680,
"train_ppl": 2.681846
},
{
"ce_loss": 1.0253,
"epoch": 0.24454211659160383,
"grad_norm": 0.93359375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.337162464568104e-05,
"loss": 1.0253,
"mean_token_accuracy": 0.7667008370161057,
"num_tokens": 124695571.0,
"step": 1690,
"train_ppl": 2.787846
},
{
"ce_loss": 0.9638,
"epoch": 0.24598911136433518,
"grad_norm": 0.9375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.3326868566313592e-05,
"loss": 0.9638,
"mean_token_accuracy": 0.7810881577432156,
"num_tokens": 125462307.0,
"step": 1700,
"train_ppl": 2.621706
},
{
"ce_loss": 1.0031,
"epoch": 0.24743610613706657,
"grad_norm": 1.0625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.3282112486946144e-05,
"loss": 1.0031,
"mean_token_accuracy": 0.7722915470600128,
"num_tokens": 126188660.0,
"step": 1710,
"train_ppl": 2.726587
},
{
"ce_loss": 0.9951,
"epoch": 0.24888310090979796,
"grad_norm": 1.09375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.3237356407578697e-05,
"loss": 0.9951,
"mean_token_accuracy": 0.7689005501568318,
"num_tokens": 126922149.0,
"step": 1720,
"train_ppl": 2.704929
},
{
"ce_loss": 0.968,
"epoch": 0.25033009568252934,
"grad_norm": 1.1484375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.319260032821125e-05,
"loss": 0.968,
"mean_token_accuracy": 0.7733873896300792,
"num_tokens": 127665260.0,
"step": 1730,
"train_ppl": 2.632612
},
{
"ce_loss": 0.951,
"epoch": 0.25177709045526075,
"grad_norm": 1.046875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.31478442488438e-05,
"loss": 0.951,
"mean_token_accuracy": 0.7792448908090591,
"num_tokens": 128389924.0,
"step": 1740,
"train_ppl": 2.58818
},
{
"ce_loss": 0.9992,
"epoch": 0.2532240852279921,
"grad_norm": 1.1640625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.3103088169476354e-05,
"loss": 0.9992,
"mean_token_accuracy": 0.7671849623322486,
"num_tokens": 129141013.0,
"step": 1750,
"train_ppl": 2.716049
},
{
"ce_loss": 0.9825,
"epoch": 0.25467108000072347,
"grad_norm": 0.9375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.3058332090108907e-05,
"loss": 0.9825,
"mean_token_accuracy": 0.7744820192456245,
"num_tokens": 129895565.0,
"step": 1760,
"train_ppl": 2.671033
},
{
"ce_loss": 1.0052,
"epoch": 0.2561180747734549,
"grad_norm": 1.1875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.301357601074146e-05,
"loss": 1.0052,
"mean_token_accuracy": 0.7750261440873146,
"num_tokens": 130621739.0,
"step": 1770,
"train_ppl": 2.73239
},
{
"ce_loss": 0.9681,
"epoch": 0.25756506954618624,
"grad_norm": 1.171875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.296881993137401e-05,
"loss": 0.9681,
"mean_token_accuracy": 0.7767448596656322,
"num_tokens": 131345170.0,
"step": 1780,
"train_ppl": 2.633028
},
{
"ce_loss": 0.9402,
"epoch": 0.25901206431891766,
"grad_norm": 1.1953125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.2924063852006567e-05,
"loss": 0.9402,
"mean_token_accuracy": 0.7856816701591015,
"num_tokens": 132065199.0,
"step": 1790,
"train_ppl": 2.560536
},
{
"ce_loss": 0.9967,
"epoch": 0.260459059091649,
"grad_norm": 1.1171875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.2879307772639116e-05,
"loss": 0.9967,
"mean_token_accuracy": 0.7735986836254597,
"num_tokens": 132781605.0,
"step": 1800,
"train_ppl": 2.709426
},
{
"ce_loss": 0.9958,
"epoch": 0.26190605386438043,
"grad_norm": 1.0,
"hf_loss_ratio": 1.0,
"learning_rate": 2.283455169327167e-05,
"loss": 0.9958,
"mean_token_accuracy": 0.7739541471004486,
"num_tokens": 133519634.0,
"step": 1810,
"train_ppl": 2.706818
},
{
"ce_loss": 0.9826,
"epoch": 0.2633530486371118,
"grad_norm": 1.1015625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.2789795613904225e-05,
"loss": 0.9826,
"mean_token_accuracy": 0.7771935254335404,
"num_tokens": 134253497.0,
"step": 1820,
"train_ppl": 2.671278
},
{
"ce_loss": 0.9624,
"epoch": 0.2648000434098432,
"grad_norm": 1.140625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.2745039534536774e-05,
"loss": 0.9624,
"mean_token_accuracy": 0.7789321012794972,
"num_tokens": 135020505.0,
"step": 1830,
"train_ppl": 2.618061
},
{
"ce_loss": 0.9873,
"epoch": 0.26624703818257456,
"grad_norm": 1.0546875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.270028345516933e-05,
"loss": 0.9873,
"mean_token_accuracy": 0.7744618967175484,
"num_tokens": 135773285.0,
"step": 1840,
"train_ppl": 2.683909
},
{
"ce_loss": 0.9925,
"epoch": 0.26769403295530597,
"grad_norm": 1.015625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.265552737580188e-05,
"loss": 0.9925,
"mean_token_accuracy": 0.7759519070386887,
"num_tokens": 136497732.0,
"step": 1850,
"train_ppl": 2.697987
},
{
"ce_loss": 0.9889,
"epoch": 0.26914102772803733,
"grad_norm": 1.25,
"hf_loss_ratio": 1.0,
"learning_rate": 2.261077129643443e-05,
"loss": 0.9889,
"mean_token_accuracy": 0.772041554749012,
"num_tokens": 137175891.0,
"step": 1860,
"train_ppl": 2.688219
},
{
"ce_loss": 0.9832,
"epoch": 0.27058802250076874,
"grad_norm": 1.109375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.2566015217066987e-05,
"loss": 0.9832,
"mean_token_accuracy": 0.770769814401865,
"num_tokens": 137910825.0,
"step": 1870,
"train_ppl": 2.672975
},
{
"ce_loss": 0.9957,
"epoch": 0.2720350172735001,
"grad_norm": 1.09375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.2521259137699536e-05,
"loss": 0.9957,
"mean_token_accuracy": 0.7698277346789837,
"num_tokens": 138609576.0,
"step": 1880,
"train_ppl": 2.7066
},
{
"ce_loss": 0.9988,
"epoch": 0.27348201204623146,
"grad_norm": 1.0859375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.2476503058332092e-05,
"loss": 0.9988,
"mean_token_accuracy": 0.771542327105999,
"num_tokens": 139318503.0,
"step": 1890,
"train_ppl": 2.714913
},
{
"ce_loss": 1.0168,
"epoch": 0.2749290068189629,
"grad_norm": 1.2578125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.2431746978964644e-05,
"loss": 1.0168,
"mean_token_accuracy": 0.7615082763135433,
"num_tokens": 140054302.0,
"step": 1900,
"train_ppl": 2.764403
},
{
"ce_loss": 0.983,
"epoch": 0.27637600159169423,
"grad_norm": 1.0078125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.2386990899597197e-05,
"loss": 0.983,
"mean_token_accuracy": 0.7786808654665947,
"num_tokens": 140797270.0,
"step": 1910,
"train_ppl": 2.67259
},
{
"ce_loss": 1.0197,
"epoch": 0.27782299636442565,
"grad_norm": 0.99609375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.234223482022975e-05,
"loss": 1.0197,
"mean_token_accuracy": 0.7617739595472812,
"num_tokens": 141527803.0,
"step": 1920,
"train_ppl": 2.772385
},
{
"ce_loss": 0.9801,
"epoch": 0.279269991137157,
"grad_norm": 0.94140625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.22974787408623e-05,
"loss": 0.9801,
"mean_token_accuracy": 0.7726086884737015,
"num_tokens": 142259241.0,
"step": 1930,
"train_ppl": 2.664847
},
{
"ce_loss": 0.9964,
"epoch": 0.2807169859098884,
"grad_norm": 1.078125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.2252722661494854e-05,
"loss": 0.9964,
"mean_token_accuracy": 0.7709591925144196,
"num_tokens": 143023815.0,
"step": 1940,
"train_ppl": 2.70848
},
{
"ce_loss": 1.002,
"epoch": 0.2821639806826198,
"grad_norm": 1.0546875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.2207966582127406e-05,
"loss": 1.002,
"mean_token_accuracy": 0.7686372242867947,
"num_tokens": 143780140.0,
"step": 1950,
"train_ppl": 2.723817
},
{
"ce_loss": 1.0256,
"epoch": 0.2836109754553512,
"grad_norm": 1.1484375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.216321050275996e-05,
"loss": 1.0256,
"mean_token_accuracy": 0.7672031052410603,
"num_tokens": 144495655.0,
"step": 1960,
"train_ppl": 2.788658
},
{
"ce_loss": 1.014,
"epoch": 0.28505797022808255,
"grad_norm": 0.98828125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.211845442339251e-05,
"loss": 1.014,
"mean_token_accuracy": 0.7690494567155838,
"num_tokens": 145192447.0,
"step": 1970,
"train_ppl": 2.756653
},
{
"ce_loss": 0.9811,
"epoch": 0.28650496500081396,
"grad_norm": 0.984375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.2073698344025064e-05,
"loss": 0.9811,
"mean_token_accuracy": 0.7795913711190223,
"num_tokens": 145925116.0,
"step": 1980,
"train_ppl": 2.667272
},
{
"ce_loss": 1.0033,
"epoch": 0.2879519597735453,
"grad_norm": 1.109375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.2028942264657616e-05,
"loss": 1.0033,
"mean_token_accuracy": 0.771687439084053,
"num_tokens": 146651269.0,
"step": 1990,
"train_ppl": 2.727271
},
{
"ce_loss": 0.9813,
"epoch": 0.2893989545462767,
"grad_norm": 1.3984375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.198418618529017e-05,
"loss": 0.9813,
"mean_token_accuracy": 0.7775134235620499,
"num_tokens": 147381768.0,
"step": 2000,
"train_ppl": 2.66782
},
{
"ce_loss": 0.9635,
"epoch": 0.2908459493190081,
"grad_norm": 1.0703125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.1939430105922724e-05,
"loss": 0.9635,
"mean_token_accuracy": 0.77833351790905,
"num_tokens": 148133098.0,
"step": 2010,
"train_ppl": 2.620909
},
{
"ce_loss": 0.9986,
"epoch": 0.29229294409173945,
"grad_norm": 1.0234375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.1894674026555274e-05,
"loss": 0.9986,
"mean_token_accuracy": 0.768501528352499,
"num_tokens": 148873416.0,
"step": 2020,
"train_ppl": 2.714389
},
{
"ce_loss": 0.982,
"epoch": 0.29373993886447086,
"grad_norm": 1.0234375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.1849917947187826e-05,
"loss": 0.982,
"mean_token_accuracy": 0.7724484153091907,
"num_tokens": 149593131.0,
"step": 2030,
"train_ppl": 2.66977
},
{
"ce_loss": 0.9759,
"epoch": 0.2951869336372022,
"grad_norm": 1.109375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.180516186782038e-05,
"loss": 0.9759,
"mean_token_accuracy": 0.775026997178793,
"num_tokens": 150341769.0,
"step": 2040,
"train_ppl": 2.653647
},
{
"ce_loss": 0.9829,
"epoch": 0.29663392840993363,
"grad_norm": 1.171875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.176040578845293e-05,
"loss": 0.9829,
"mean_token_accuracy": 0.7747074596583843,
"num_tokens": 151082730.0,
"step": 2050,
"train_ppl": 2.672224
},
{
"ce_loss": 0.9525,
"epoch": 0.298080923182665,
"grad_norm": 0.90625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.1715649709085487e-05,
"loss": 0.9525,
"mean_token_accuracy": 0.7772355630993844,
"num_tokens": 151831662.0,
"step": 2060,
"train_ppl": 2.592082
},
{
"ce_loss": 0.9725,
"epoch": 0.2995279179553964,
"grad_norm": 1.171875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.1670893629718036e-05,
"loss": 0.9725,
"mean_token_accuracy": 0.778071166574955,
"num_tokens": 152542559.0,
"step": 2070,
"train_ppl": 2.644496
},
{
"ce_loss": 0.9505,
"epoch": 0.30097491272812776,
"grad_norm": 1.0625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.1626137550350588e-05,
"loss": 0.9505,
"mean_token_accuracy": 0.780910176038742,
"num_tokens": 153266179.0,
"step": 2080,
"train_ppl": 2.586885
},
{
"ce_loss": 1.0026,
"epoch": 0.3024219075008592,
"grad_norm": 0.97265625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.1581381470983144e-05,
"loss": 1.0026,
"mean_token_accuracy": 0.7699606984853744,
"num_tokens": 153970933.0,
"step": 2090,
"train_ppl": 2.725251
},
{
"ce_loss": 0.9648,
"epoch": 0.30386890227359054,
"grad_norm": 1.0546875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.1536625391615693e-05,
"loss": 0.9648,
"mean_token_accuracy": 0.7735878027975559,
"num_tokens": 154711094.0,
"step": 2100,
"train_ppl": 2.624383
},
{
"ce_loss": 0.9964,
"epoch": 0.3053158970463219,
"grad_norm": 1.09375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.149186931224825e-05,
"loss": 0.9964,
"mean_token_accuracy": 0.7693284347653389,
"num_tokens": 155440558.0,
"step": 2110,
"train_ppl": 2.70838
},
{
"ce_loss": 0.9726,
"epoch": 0.3067628918190533,
"grad_norm": 0.98046875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.14471132328808e-05,
"loss": 0.9726,
"mean_token_accuracy": 0.7746382050216198,
"num_tokens": 156165366.0,
"step": 2120,
"train_ppl": 2.644842
},
{
"ce_loss": 0.9639,
"epoch": 0.30820988659178467,
"grad_norm": 0.8984375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.1402357153513354e-05,
"loss": 0.9639,
"mean_token_accuracy": 0.7744808107614517,
"num_tokens": 156890899.0,
"step": 2130,
"train_ppl": 2.622018
},
{
"ce_loss": 0.9989,
"epoch": 0.3096568813645161,
"grad_norm": 1.125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.1357601074145906e-05,
"loss": 0.9989,
"mean_token_accuracy": 0.767997769266367,
"num_tokens": 157604658.0,
"step": 2140,
"train_ppl": 2.715335
},
{
"ce_loss": 0.9718,
"epoch": 0.31110387613724744,
"grad_norm": 1.234375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.1312844994778455e-05,
"loss": 0.9718,
"mean_token_accuracy": 0.78013886064291,
"num_tokens": 158336316.0,
"step": 2150,
"train_ppl": 2.642823
},
{
"ce_loss": 0.9457,
"epoch": 0.31255087090997885,
"grad_norm": 1.4609375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.126808891541101e-05,
"loss": 0.9457,
"mean_token_accuracy": 0.7810127899050713,
"num_tokens": 159052431.0,
"step": 2160,
"train_ppl": 2.57449
},
{
"ce_loss": 0.9374,
"epoch": 0.3139978656827102,
"grad_norm": 0.98828125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.1223332836043564e-05,
"loss": 0.9374,
"mean_token_accuracy": 0.7826711490750313,
"num_tokens": 159747771.0,
"step": 2170,
"train_ppl": 2.553444
},
{
"ce_loss": 1.0028,
"epoch": 0.3154448604554416,
"grad_norm": 1.1640625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.1178576756676116e-05,
"loss": 1.0028,
"mean_token_accuracy": 0.7743060775101185,
"num_tokens": 160475032.0,
"step": 2180,
"train_ppl": 2.725815
},
{
"ce_loss": 0.9964,
"epoch": 0.316891855228173,
"grad_norm": 1.078125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.113382067730867e-05,
"loss": 0.9964,
"mean_token_accuracy": 0.7711601614952087,
"num_tokens": 161204515.0,
"step": 2190,
"train_ppl": 2.708637
},
{
"ce_loss": 1.0099,
"epoch": 0.3183388500009044,
"grad_norm": 1.0703125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.108906459794122e-05,
"loss": 1.0099,
"mean_token_accuracy": 0.7715992897748947,
"num_tokens": 161961019.0,
"step": 2200,
"train_ppl": 2.745375
},
{
"ce_loss": 0.9498,
"epoch": 0.31978584477363575,
"grad_norm": 0.90234375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.1044308518573773e-05,
"loss": 0.9498,
"mean_token_accuracy": 0.7826919294893742,
"num_tokens": 162710799.0,
"step": 2210,
"train_ppl": 2.58529
},
{
"ce_loss": 0.9621,
"epoch": 0.32123283954636717,
"grad_norm": 1.0234375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.0999552439206326e-05,
"loss": 0.9621,
"mean_token_accuracy": 0.775107191503048,
"num_tokens": 163439737.0,
"step": 2220,
"train_ppl": 2.61714
},
{
"ce_loss": 0.9943,
"epoch": 0.3226798343190985,
"grad_norm": 1.078125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.0954796359838878e-05,
"loss": 0.9943,
"mean_token_accuracy": 0.7698855645954609,
"num_tokens": 164145582.0,
"step": 2230,
"train_ppl": 2.702918
},
{
"ce_loss": 0.9771,
"epoch": 0.3241268290918299,
"grad_norm": 1.0625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.091004028047143e-05,
"loss": 0.9771,
"mean_token_accuracy": 0.7765941433608532,
"num_tokens": 164896393.0,
"step": 2240,
"train_ppl": 2.656623
},
{
"ce_loss": 1.0023,
"epoch": 0.3255738238645613,
"grad_norm": 1.046875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.0865284201103983e-05,
"loss": 1.0023,
"mean_token_accuracy": 0.7708912000060082,
"num_tokens": 165627341.0,
"step": 2250,
"train_ppl": 2.724545
},
{
"ce_loss": 0.9689,
"epoch": 0.32702081863729265,
"grad_norm": 1.3125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.0820528121736536e-05,
"loss": 0.9689,
"mean_token_accuracy": 0.7807579897344112,
"num_tokens": 166354943.0,
"step": 2260,
"train_ppl": 2.635139
},
{
"ce_loss": 1.0493,
"epoch": 0.32846781341002407,
"grad_norm": 1.046875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.0775772042369088e-05,
"loss": 1.0493,
"mean_token_accuracy": 0.7613647289574146,
"num_tokens": 167066270.0,
"step": 2270,
"train_ppl": 2.855513
},
{
"ce_loss": 0.9991,
"epoch": 0.3299148081827554,
"grad_norm": 1.0234375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.0731015963001644e-05,
"loss": 0.9991,
"mean_token_accuracy": 0.7712046861648559,
"num_tokens": 167801986.0,
"step": 2280,
"train_ppl": 2.715823
},
{
"ce_loss": 0.9657,
"epoch": 0.33136180295548684,
"grad_norm": 1.078125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.0686259883634193e-05,
"loss": 0.9657,
"mean_token_accuracy": 0.7770779870450497,
"num_tokens": 168554289.0,
"step": 2290,
"train_ppl": 2.626717
},
{
"ce_loss": 0.9849,
"epoch": 0.3328087977282182,
"grad_norm": 0.953125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.0641503804266745e-05,
"loss": 0.9849,
"mean_token_accuracy": 0.7736143194139004,
"num_tokens": 169286476.0,
"step": 2300,
"train_ppl": 2.677655
},
{
"ce_loss": 0.9921,
"epoch": 0.3342557925009496,
"grad_norm": 1.0703125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.05967477248993e-05,
"loss": 0.9921,
"mean_token_accuracy": 0.7730519793927669,
"num_tokens": 170017128.0,
"step": 2310,
"train_ppl": 2.696846
},
{
"ce_loss": 0.9767,
"epoch": 0.33570278727368097,
"grad_norm": 0.97265625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.055199164553185e-05,
"loss": 0.9767,
"mean_token_accuracy": 0.7729025609791279,
"num_tokens": 170740098.0,
"step": 2320,
"train_ppl": 2.655607
},
{
"ce_loss": 0.9937,
"epoch": 0.3371497820464124,
"grad_norm": 0.91796875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.0507235566164406e-05,
"loss": 0.9937,
"mean_token_accuracy": 0.7697398900985718,
"num_tokens": 171468647.0,
"step": 2330,
"train_ppl": 2.701241
},
{
"ce_loss": 0.9793,
"epoch": 0.33859677681914374,
"grad_norm": 0.85546875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.0462479486796955e-05,
"loss": 0.9793,
"mean_token_accuracy": 0.7745302498340607,
"num_tokens": 172205055.0,
"step": 2340,
"train_ppl": 2.662539
},
{
"ce_loss": 0.9681,
"epoch": 0.3400437715918751,
"grad_norm": 1.1796875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.041772340742951e-05,
"loss": 0.9681,
"mean_token_accuracy": 0.7831182412803173,
"num_tokens": 172927359.0,
"step": 2350,
"train_ppl": 2.633018
},
{
"ce_loss": 0.9964,
"epoch": 0.3414907663646065,
"grad_norm": 1.3515625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.0372967328062063e-05,
"loss": 0.9964,
"mean_token_accuracy": 0.7754109688103199,
"num_tokens": 173673857.0,
"step": 2360,
"train_ppl": 2.708586
},
{
"ce_loss": 0.9587,
"epoch": 0.34293776113733787,
"grad_norm": 0.83203125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.0328211248694613e-05,
"loss": 0.9587,
"mean_token_accuracy": 0.779682033509016,
"num_tokens": 174453403.0,
"step": 2370,
"train_ppl": 2.608364
},
{
"ce_loss": 0.9886,
"epoch": 0.3443847559100693,
"grad_norm": 1.0390625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.028345516932717e-05,
"loss": 0.9886,
"mean_token_accuracy": 0.7737836137413978,
"num_tokens": 175185041.0,
"step": 2380,
"train_ppl": 2.687588
},
{
"ce_loss": 1.0085,
"epoch": 0.34583175068280064,
"grad_norm": 1.4765625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.023869908995972e-05,
"loss": 1.0085,
"mean_token_accuracy": 0.7715661711990833,
"num_tokens": 175943212.0,
"step": 2390,
"train_ppl": 2.741487
},
{
"ce_loss": 0.9599,
"epoch": 0.34727874545553206,
"grad_norm": 1.1484375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.0193943010592273e-05,
"loss": 0.9599,
"mean_token_accuracy": 0.7831589214503765,
"num_tokens": 176663659.0,
"step": 2400,
"train_ppl": 2.611419
},
{
"ce_loss": 0.9629,
"epoch": 0.3487257402282634,
"grad_norm": 1.0234375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.0149186931224826e-05,
"loss": 0.9629,
"mean_token_accuracy": 0.7757728450000286,
"num_tokens": 177369018.0,
"step": 2410,
"train_ppl": 2.61941
},
{
"ce_loss": 1.0039,
"epoch": 0.35017273500099483,
"grad_norm": 0.984375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.0104430851857378e-05,
"loss": 1.0039,
"mean_token_accuracy": 0.7666012078523636,
"num_tokens": 178089918.0,
"step": 2420,
"train_ppl": 2.728987
},
{
"ce_loss": 0.9237,
"epoch": 0.3516197297737262,
"grad_norm": 0.9375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.005967477248993e-05,
"loss": 0.9237,
"mean_token_accuracy": 0.7838417246937752,
"num_tokens": 178829829.0,
"step": 2430,
"train_ppl": 2.518548
},
{
"ce_loss": 0.9632,
"epoch": 0.3530667245464576,
"grad_norm": 1.125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.0014918693122483e-05,
"loss": 0.9632,
"mean_token_accuracy": 0.7799612589180469,
"num_tokens": 179584153.0,
"step": 2440,
"train_ppl": 2.620184
},
{
"ce_loss": 0.9362,
"epoch": 0.35451371931918896,
"grad_norm": 0.9375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.9970162613755035e-05,
"loss": 0.9362,
"mean_token_accuracy": 0.7820769309997558,
"num_tokens": 180331127.0,
"step": 2450,
"train_ppl": 2.550154
},
{
"ce_loss": 1.0117,
"epoch": 0.3559607140919203,
"grad_norm": 0.8828125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.9925406534387588e-05,
"loss": 1.0117,
"mean_token_accuracy": 0.771592228859663,
"num_tokens": 181067782.0,
"step": 2460,
"train_ppl": 2.750146
},
{
"ce_loss": 0.9859,
"epoch": 0.35740770886465173,
"grad_norm": 1.0234375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.988065045502014e-05,
"loss": 0.9859,
"mean_token_accuracy": 0.7738970972597599,
"num_tokens": 181793714.0,
"step": 2470,
"train_ppl": 2.680159
},
{
"ce_loss": 0.962,
"epoch": 0.3588547036373831,
"grad_norm": 0.96875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.9835894375652693e-05,
"loss": 0.962,
"mean_token_accuracy": 0.7789099134504796,
"num_tokens": 182531886.0,
"step": 2480,
"train_ppl": 2.616999
},
{
"ce_loss": 0.9957,
"epoch": 0.3603016984101145,
"grad_norm": 0.953125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.9791138296285245e-05,
"loss": 0.9957,
"mean_token_accuracy": 0.7706431902945041,
"num_tokens": 183300557.0,
"step": 2490,
"train_ppl": 2.706542
},
{
"ce_loss": 0.96,
"epoch": 0.36174869318284586,
"grad_norm": 1.0703125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.97463822169178e-05,
"loss": 0.96,
"mean_token_accuracy": 0.7810012176632881,
"num_tokens": 184029451.0,
"step": 2500,
"train_ppl": 2.611579
},
{
"ce_loss": 0.9386,
"epoch": 0.3631956879555773,
"grad_norm": 1.296875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.970162613755035e-05,
"loss": 0.9386,
"mean_token_accuracy": 0.7798774808645248,
"num_tokens": 184746003.0,
"step": 2510,
"train_ppl": 2.556315
},
{
"ce_loss": 0.9735,
"epoch": 0.36464268272830863,
"grad_norm": 0.92578125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.9656870058182903e-05,
"loss": 0.9735,
"mean_token_accuracy": 0.7773295849561691,
"num_tokens": 185472125.0,
"step": 2520,
"train_ppl": 2.647223
},
{
"ce_loss": 0.9715,
"epoch": 0.36608967750104005,
"grad_norm": 0.859375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.9612113978815455e-05,
"loss": 0.9715,
"mean_token_accuracy": 0.7736013270914555,
"num_tokens": 186174697.0,
"step": 2530,
"train_ppl": 2.641837
},
{
"ce_loss": 0.9793,
"epoch": 0.3675366722737714,
"grad_norm": 0.85546875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.9567357899448007e-05,
"loss": 0.9793,
"mean_token_accuracy": 0.7726230010390281,
"num_tokens": 186899192.0,
"step": 2540,
"train_ppl": 2.662494
},
{
"ce_loss": 0.9658,
"epoch": 0.3689836670465028,
"grad_norm": 0.98046875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.9522601820080563e-05,
"loss": 0.9658,
"mean_token_accuracy": 0.7793243020772934,
"num_tokens": 187634580.0,
"step": 2550,
"train_ppl": 2.626758
},
{
"ce_loss": 0.965,
"epoch": 0.3704306618192342,
"grad_norm": 0.94140625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.9477845740713112e-05,
"loss": 0.965,
"mean_token_accuracy": 0.7768558643758297,
"num_tokens": 188388282.0,
"step": 2560,
"train_ppl": 2.62484
},
{
"ce_loss": 0.994,
"epoch": 0.3718776565919656,
"grad_norm": 1.09375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.9433089661345668e-05,
"loss": 0.994,
"mean_token_accuracy": 0.7724675111472606,
"num_tokens": 189139246.0,
"step": 2570,
"train_ppl": 2.701906
},
{
"ce_loss": 0.9555,
"epoch": 0.37332465136469695,
"grad_norm": 0.9765625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.938833358197822e-05,
"loss": 0.9555,
"mean_token_accuracy": 0.7806055322289467,
"num_tokens": 189883875.0,
"step": 2580,
"train_ppl": 2.599917
},
{
"ce_loss": 0.9659,
"epoch": 0.3747716461374283,
"grad_norm": 1.1875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.934357750261077e-05,
"loss": 0.9659,
"mean_token_accuracy": 0.7724411226809025,
"num_tokens": 190614990.0,
"step": 2590,
"train_ppl": 2.627258
},
{
"ce_loss": 0.989,
"epoch": 0.3762186409101597,
"grad_norm": 1.015625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.9298821423243326e-05,
"loss": 0.989,
"mean_token_accuracy": 0.7706497214734555,
"num_tokens": 191328905.0,
"step": 2600,
"train_ppl": 2.688509
},
{
"ce_loss": 0.9799,
"epoch": 0.3776656356828911,
"grad_norm": 1.015625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.9254065343875878e-05,
"loss": 0.9799,
"mean_token_accuracy": 0.7754726015031338,
"num_tokens": 192110447.0,
"step": 2610,
"train_ppl": 2.664275
},
{
"ce_loss": 0.9918,
"epoch": 0.3791126304556225,
"grad_norm": 1.046875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.920930926450843e-05,
"loss": 0.9918,
"mean_token_accuracy": 0.7714382395148277,
"num_tokens": 192833107.0,
"step": 2620,
"train_ppl": 2.696216
},
{
"ce_loss": 0.9743,
"epoch": 0.38055962522835385,
"grad_norm": 1.046875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.9164553185140983e-05,
"loss": 0.9743,
"mean_token_accuracy": 0.7756662987172603,
"num_tokens": 193562730.0,
"step": 2630,
"train_ppl": 2.649196
},
{
"ce_loss": 0.9543,
"epoch": 0.38200662000108526,
"grad_norm": 1.0390625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.9119797105773532e-05,
"loss": 0.9543,
"mean_token_accuracy": 0.7818400040268898,
"num_tokens": 194291195.0,
"step": 2640,
"train_ppl": 2.596973
},
{
"ce_loss": 0.9645,
"epoch": 0.3834536147738166,
"grad_norm": 0.84375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.9075041026406088e-05,
"loss": 0.9645,
"mean_token_accuracy": 0.778757381439209,
"num_tokens": 195035036.0,
"step": 2650,
"train_ppl": 2.623353
},
{
"ce_loss": 0.9554,
"epoch": 0.38490060954654803,
"grad_norm": 1.109375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.903028494703864e-05,
"loss": 0.9554,
"mean_token_accuracy": 0.7815173707902432,
"num_tokens": 195753802.0,
"step": 2660,
"train_ppl": 2.599595
},
{
"ce_loss": 0.9807,
"epoch": 0.3863476043192794,
"grad_norm": 1.1953125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.8985528867671193e-05,
"loss": 0.9807,
"mean_token_accuracy": 0.7753617249429225,
"num_tokens": 196473205.0,
"step": 2670,
"train_ppl": 2.666363
},
{
"ce_loss": 1.0086,
"epoch": 0.3877945990920108,
"grad_norm": 1.015625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.8940772788303745e-05,
"loss": 1.0086,
"mean_token_accuracy": 0.7668839745223522,
"num_tokens": 197209393.0,
"step": 2680,
"train_ppl": 2.741868
},
{
"ce_loss": 0.9412,
"epoch": 0.38924159386474216,
"grad_norm": 1.0,
"hf_loss_ratio": 1.0,
"learning_rate": 1.8896016708936298e-05,
"loss": 0.9412,
"mean_token_accuracy": 0.7830228976905346,
"num_tokens": 197950507.0,
"step": 2690,
"train_ppl": 2.56312
},
{
"ce_loss": 0.9285,
"epoch": 0.3906885886374735,
"grad_norm": 1.03125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.885126062956885e-05,
"loss": 0.9285,
"mean_token_accuracy": 0.7872582785785198,
"num_tokens": 198707373.0,
"step": 2700,
"train_ppl": 2.530723
},
{
"ce_loss": 1.004,
"epoch": 0.39213558341020494,
"grad_norm": 0.96875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.8806504550201402e-05,
"loss": 1.004,
"mean_token_accuracy": 0.7696459926664829,
"num_tokens": 199432253.0,
"step": 2710,
"train_ppl": 2.729275
},
{
"ce_loss": 0.9438,
"epoch": 0.3935825781829363,
"grad_norm": 0.8984375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.8761748470833958e-05,
"loss": 0.9438,
"mean_token_accuracy": 0.7834368832409382,
"num_tokens": 200205289.0,
"step": 2720,
"train_ppl": 2.569663
},
{
"ce_loss": 0.9668,
"epoch": 0.3950295729556677,
"grad_norm": 0.96875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.8716992391466507e-05,
"loss": 0.9668,
"mean_token_accuracy": 0.7788598984479904,
"num_tokens": 200948293.0,
"step": 2730,
"train_ppl": 2.629388
},
{
"ce_loss": 0.9844,
"epoch": 0.39647656772839907,
"grad_norm": 1.0546875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.867223631209906e-05,
"loss": 0.9844,
"mean_token_accuracy": 0.7698593437671661,
"num_tokens": 201693594.0,
"step": 2740,
"train_ppl": 2.676329
},
{
"ce_loss": 0.9749,
"epoch": 0.3979235625011305,
"grad_norm": 0.94140625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.8627480232731612e-05,
"loss": 0.9749,
"mean_token_accuracy": 0.7773583248257637,
"num_tokens": 202425022.0,
"step": 2750,
"train_ppl": 2.650845
},
{
"ce_loss": 0.969,
"epoch": 0.39937055727386184,
"grad_norm": 1.09375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.8582724153364165e-05,
"loss": 0.969,
"mean_token_accuracy": 0.7747991502285003,
"num_tokens": 203166750.0,
"step": 2760,
"train_ppl": 2.635431
},
{
"ce_loss": 0.9665,
"epoch": 0.40081755204659325,
"grad_norm": 1.15625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.853796807399672e-05,
"loss": 0.9665,
"mean_token_accuracy": 0.773398594558239,
"num_tokens": 203882390.0,
"step": 2770,
"train_ppl": 2.628676
},
{
"ce_loss": 0.9587,
"epoch": 0.4022645468193246,
"grad_norm": 1.125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.849321199462927e-05,
"loss": 0.9587,
"mean_token_accuracy": 0.7789006575942039,
"num_tokens": 204626671.0,
"step": 2780,
"train_ppl": 2.608222
},
{
"ce_loss": 0.9712,
"epoch": 0.403711541592056,
"grad_norm": 0.94140625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.8448455915261825e-05,
"loss": 0.9712,
"mean_token_accuracy": 0.7756584413349629,
"num_tokens": 205353873.0,
"step": 2790,
"train_ppl": 2.641169
},
{
"ce_loss": 0.9684,
"epoch": 0.4051585363647874,
"grad_norm": 1.0078125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.8403699835894378e-05,
"loss": 0.9684,
"mean_token_accuracy": 0.7775221608579159,
"num_tokens": 206089475.0,
"step": 2800,
"train_ppl": 2.63379
},
{
"ce_loss": 1.0109,
"epoch": 0.40660553113751874,
"grad_norm": 1.0625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.8358943756526927e-05,
"loss": 1.0109,
"mean_token_accuracy": 0.7700402162969112,
"num_tokens": 206830670.0,
"step": 2810,
"train_ppl": 2.747938
},
{
"ce_loss": 0.945,
"epoch": 0.40805252591025015,
"grad_norm": 1.0703125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.8314187677159483e-05,
"loss": 0.945,
"mean_token_accuracy": 0.7814373821020126,
"num_tokens": 207591527.0,
"step": 2820,
"train_ppl": 2.572862
},
{
"ce_loss": 0.9544,
"epoch": 0.4094995206829815,
"grad_norm": 0.99609375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.8269431597792032e-05,
"loss": 0.9544,
"mean_token_accuracy": 0.7797525011003017,
"num_tokens": 208339441.0,
"step": 2830,
"train_ppl": 2.597219
},
{
"ce_loss": 0.9706,
"epoch": 0.4109465154557129,
"grad_norm": 1.015625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.8224675518424588e-05,
"loss": 0.9706,
"mean_token_accuracy": 0.7762934103608131,
"num_tokens": 209078453.0,
"step": 2840,
"train_ppl": 2.639582
},
{
"ce_loss": 0.9529,
"epoch": 0.4123935102284443,
"grad_norm": 1.359375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.817991943905714e-05,
"loss": 0.9529,
"mean_token_accuracy": 0.7769104249775409,
"num_tokens": 209817755.0,
"step": 2850,
"train_ppl": 2.593285
},
{
"ce_loss": 0.9647,
"epoch": 0.4138405050011757,
"grad_norm": 0.984375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.813516335968969e-05,
"loss": 0.9647,
"mean_token_accuracy": 0.7746372953057289,
"num_tokens": 210572147.0,
"step": 2860,
"train_ppl": 2.624049
},
{
"ce_loss": 0.9791,
"epoch": 0.41528749977390705,
"grad_norm": 1.0390625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.8090407280322245e-05,
"loss": 0.9791,
"mean_token_accuracy": 0.7739841856062413,
"num_tokens": 211317422.0,
"step": 2870,
"train_ppl": 2.662128
},
{
"ce_loss": 0.9535,
"epoch": 0.41673449454663847,
"grad_norm": 1.0390625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.8045651200954797e-05,
"loss": 0.9535,
"mean_token_accuracy": 0.7812499180436134,
"num_tokens": 212076246.0,
"step": 2880,
"train_ppl": 2.594664
},
{
"ce_loss": 0.989,
"epoch": 0.4181814893193698,
"grad_norm": 1.0390625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.800089512158735e-05,
"loss": 0.989,
"mean_token_accuracy": 0.7691139645874501,
"num_tokens": 212763964.0,
"step": 2890,
"train_ppl": 2.688652
},
{
"ce_loss": 0.952,
"epoch": 0.41962848409210124,
"grad_norm": 0.95703125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.7956139042219902e-05,
"loss": 0.952,
"mean_token_accuracy": 0.777950644493103,
"num_tokens": 213512388.0,
"step": 2900,
"train_ppl": 2.590762
},
{
"ce_loss": 0.9988,
"epoch": 0.4210754788648326,
"grad_norm": 1.03125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.7911382962852455e-05,
"loss": 0.9988,
"mean_token_accuracy": 0.7697994232177734,
"num_tokens": 214220646.0,
"step": 2910,
"train_ppl": 2.715134
},
{
"ce_loss": 0.9738,
"epoch": 0.422522473637564,
"grad_norm": 1.109375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.7866626883485007e-05,
"loss": 0.9738,
"mean_token_accuracy": 0.7759139001369476,
"num_tokens": 214925657.0,
"step": 2920,
"train_ppl": 2.647943
},
{
"ce_loss": 0.9857,
"epoch": 0.42396946841029537,
"grad_norm": 1.0546875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.782187080411756e-05,
"loss": 0.9857,
"mean_token_accuracy": 0.7746396206319333,
"num_tokens": 215622023.0,
"step": 2930,
"train_ppl": 2.679806
},
{
"ce_loss": 0.9942,
"epoch": 0.4254164631830267,
"grad_norm": 1.15625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.7777114724750112e-05,
"loss": 0.9942,
"mean_token_accuracy": 0.7746829591691494,
"num_tokens": 216363572.0,
"step": 2940,
"train_ppl": 2.702513
},
{
"ce_loss": 0.9358,
"epoch": 0.42686345795575814,
"grad_norm": 1.015625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.7732358645382665e-05,
"loss": 0.9358,
"mean_token_accuracy": 0.7809817381203175,
"num_tokens": 217117940.0,
"step": 2950,
"train_ppl": 2.549177
},
{
"ce_loss": 0.9511,
"epoch": 0.4283104527284895,
"grad_norm": 1.15625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.7687602566015217e-05,
"loss": 0.9511,
"mean_token_accuracy": 0.774829763174057,
"num_tokens": 217882702.0,
"step": 2960,
"train_ppl": 2.588437
},
{
"ce_loss": 0.9726,
"epoch": 0.4297574475012209,
"grad_norm": 0.99609375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.764284648664777e-05,
"loss": 0.9726,
"mean_token_accuracy": 0.7748524136841297,
"num_tokens": 218610599.0,
"step": 2970,
"train_ppl": 2.64482
},
{
"ce_loss": 0.9812,
"epoch": 0.43120444227395227,
"grad_norm": 1.0703125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.7598090407280322e-05,
"loss": 0.9812,
"mean_token_accuracy": 0.7769106313586235,
"num_tokens": 219344239.0,
"step": 2980,
"train_ppl": 2.667774
},
{
"ce_loss": 0.9636,
"epoch": 0.4326514370466837,
"grad_norm": 1.125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.7553334327912878e-05,
"loss": 0.9636,
"mean_token_accuracy": 0.7774206228554249,
"num_tokens": 220070330.0,
"step": 2990,
"train_ppl": 2.621097
},
{
"ce_loss": 0.9503,
"epoch": 0.43409843181941504,
"grad_norm": 1.03125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.7508578248545427e-05,
"loss": 0.9503,
"mean_token_accuracy": 0.7805333323776722,
"num_tokens": 220786645.0,
"step": 3000,
"train_ppl": 2.586443
},
{
"ce_loss": 0.9727,
"epoch": 0.43554542659214646,
"grad_norm": 1.078125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.746382216917798e-05,
"loss": 0.9727,
"mean_token_accuracy": 0.7798659265041351,
"num_tokens": 221501835.0,
"step": 3010,
"train_ppl": 2.644989
},
{
"ce_loss": 0.976,
"epoch": 0.4369924213648778,
"grad_norm": 0.984375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.741906608981053e-05,
"loss": 0.976,
"mean_token_accuracy": 0.7753879025578498,
"num_tokens": 222228551.0,
"step": 3020,
"train_ppl": 2.65379
},
{
"ce_loss": 0.9761,
"epoch": 0.43843941613760923,
"grad_norm": 0.94140625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.7374310010443084e-05,
"loss": 0.9761,
"mean_token_accuracy": 0.7760777927935123,
"num_tokens": 222946933.0,
"step": 3030,
"train_ppl": 2.654151
},
{
"ce_loss": 0.9944,
"epoch": 0.4398864109103406,
"grad_norm": 0.98046875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.732955393107564e-05,
"loss": 0.9944,
"mean_token_accuracy": 0.7701233983039856,
"num_tokens": 223687091.0,
"step": 3040,
"train_ppl": 2.703226
},
{
"ce_loss": 0.9391,
"epoch": 0.44133340568307194,
"grad_norm": 0.97265625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.728479785170819e-05,
"loss": 0.9391,
"mean_token_accuracy": 0.7819373540580272,
"num_tokens": 224415889.0,
"step": 3050,
"train_ppl": 2.557619
},
{
"ce_loss": 0.9311,
"epoch": 0.44278040045580336,
"grad_norm": 0.8828125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.7240041772340745e-05,
"loss": 0.9311,
"mean_token_accuracy": 0.7835486814379692,
"num_tokens": 225175613.0,
"step": 3060,
"train_ppl": 2.537334
},
{
"ce_loss": 0.9712,
"epoch": 0.4442273952285347,
"grad_norm": 1.015625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.7195285692973297e-05,
"loss": 0.9712,
"mean_token_accuracy": 0.7758528731763363,
"num_tokens": 225931362.0,
"step": 3070,
"train_ppl": 2.641217
},
{
"ce_loss": 0.9468,
"epoch": 0.44567439000126613,
"grad_norm": 0.9140625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.7150529613605846e-05,
"loss": 0.9468,
"mean_token_accuracy": 0.7813886523246765,
"num_tokens": 226658710.0,
"step": 3080,
"train_ppl": 2.577371
},
{
"ce_loss": 0.9776,
"epoch": 0.4471213847739975,
"grad_norm": 1.2265625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.7105773534238402e-05,
"loss": 0.9776,
"mean_token_accuracy": 0.7746784225106239,
"num_tokens": 227404471.0,
"step": 3090,
"train_ppl": 2.658194
},
{
"ce_loss": 0.9739,
"epoch": 0.4485683795467289,
"grad_norm": 1.078125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.7061017454870955e-05,
"loss": 0.9739,
"mean_token_accuracy": 0.7733561553061008,
"num_tokens": 228132005.0,
"step": 3100,
"train_ppl": 2.648246
},
{
"ce_loss": 0.9602,
"epoch": 0.45001537431946026,
"grad_norm": 0.88671875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.7016261375503507e-05,
"loss": 0.9602,
"mean_token_accuracy": 0.7756247140467167,
"num_tokens": 228859507.0,
"step": 3110,
"train_ppl": 2.612151
},
{
"ce_loss": 0.979,
"epoch": 0.4514623690921917,
"grad_norm": 1.1328125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.697150529613606e-05,
"loss": 0.979,
"mean_token_accuracy": 0.7758997343480587,
"num_tokens": 229580037.0,
"step": 3120,
"train_ppl": 2.661712
},
{
"ce_loss": 0.9772,
"epoch": 0.45290936386492303,
"grad_norm": 1.0078125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.692674921676861e-05,
"loss": 0.9772,
"mean_token_accuracy": 0.7744156174361706,
"num_tokens": 230322304.0,
"step": 3130,
"train_ppl": 2.657003
},
{
"ce_loss": 0.9562,
"epoch": 0.45435635863765444,
"grad_norm": 1.109375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.6881993137401164e-05,
"loss": 0.9562,
"mean_token_accuracy": 0.7790285974740982,
"num_tokens": 231059980.0,
"step": 3140,
"train_ppl": 2.601828
},
{
"ce_loss": 0.9527,
"epoch": 0.4558033534103858,
"grad_norm": 0.9609375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.6837237058033717e-05,
"loss": 0.9527,
"mean_token_accuracy": 0.7776475623250008,
"num_tokens": 231819587.0,
"step": 3150,
"train_ppl": 2.592802
},
{
"ce_loss": 0.9886,
"epoch": 0.45725034818311716,
"grad_norm": 1.1015625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.679248097866627e-05,
"loss": 0.9886,
"mean_token_accuracy": 0.7710159003734589,
"num_tokens": 232549725.0,
"step": 3160,
"train_ppl": 2.687503
},
{
"ce_loss": 0.9606,
"epoch": 0.4586973429558486,
"grad_norm": 0.9765625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.6747724899298822e-05,
"loss": 0.9606,
"mean_token_accuracy": 0.7811665050685406,
"num_tokens": 233291132.0,
"step": 3170,
"train_ppl": 2.613236
},
{
"ce_loss": 0.9511,
"epoch": 0.46014433772857993,
"grad_norm": 1.0234375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.6702968819931374e-05,
"loss": 0.9511,
"mean_token_accuracy": 0.7800517350435257,
"num_tokens": 234041516.0,
"step": 3180,
"train_ppl": 2.588567
},
{
"ce_loss": 0.924,
"epoch": 0.46159133250131135,
"grad_norm": 0.91796875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.6658212740563927e-05,
"loss": 0.924,
"mean_token_accuracy": 0.7832289874553681,
"num_tokens": 234793582.0,
"step": 3190,
"train_ppl": 2.519274
},
{
"ce_loss": 1.01,
"epoch": 0.4630383272740427,
"grad_norm": 1.0859375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.661345666119648e-05,
"loss": 1.01,
"mean_token_accuracy": 0.7669910915195942,
"num_tokens": 235509780.0,
"step": 3200,
"train_ppl": 2.745611
},
{
"ce_loss": 0.988,
"epoch": 0.4644853220467741,
"grad_norm": 1.0625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.6568700581829035e-05,
"loss": 0.988,
"mean_token_accuracy": 0.7717112138867378,
"num_tokens": 236219024.0,
"step": 3210,
"train_ppl": 2.685961
},
{
"ce_loss": 0.9403,
"epoch": 0.4659323168195055,
"grad_norm": 0.96875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.6523944502461584e-05,
"loss": 0.9403,
"mean_token_accuracy": 0.7790117606520652,
"num_tokens": 236975108.0,
"step": 3220,
"train_ppl": 2.560643
},
{
"ce_loss": 0.9728,
"epoch": 0.4673793115922369,
"grad_norm": 0.9921875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.6479188423094136e-05,
"loss": 0.9728,
"mean_token_accuracy": 0.7795041255652905,
"num_tokens": 237724462.0,
"step": 3230,
"train_ppl": 2.645343
},
{
"ce_loss": 0.9416,
"epoch": 0.46882630636496825,
"grad_norm": 0.921875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.643443234372669e-05,
"loss": 0.9416,
"mean_token_accuracy": 0.7821677893400192,
"num_tokens": 238490711.0,
"step": 3240,
"train_ppl": 2.564148
},
{
"ce_loss": 0.9657,
"epoch": 0.47027330113769966,
"grad_norm": 1.0625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.638967626435924e-05,
"loss": 0.9657,
"mean_token_accuracy": 0.7754031218588352,
"num_tokens": 239227350.0,
"step": 3250,
"train_ppl": 2.626516
},
{
"ce_loss": 0.9453,
"epoch": 0.471720295910431,
"grad_norm": 1.03125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.6344920184991797e-05,
"loss": 0.9453,
"mean_token_accuracy": 0.7826674081385135,
"num_tokens": 239948015.0,
"step": 3260,
"train_ppl": 2.57358
},
{
"ce_loss": 0.9745,
"epoch": 0.47316729068316243,
"grad_norm": 0.90625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.6300164105624346e-05,
"loss": 0.9745,
"mean_token_accuracy": 0.7750352688133717,
"num_tokens": 240720149.0,
"step": 3270,
"train_ppl": 2.649788
},
{
"ce_loss": 0.9767,
"epoch": 0.4746142854558938,
"grad_norm": 1.1015625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.6255408026256902e-05,
"loss": 0.9767,
"mean_token_accuracy": 0.7757932528853416,
"num_tokens": 241430604.0,
"step": 3280,
"train_ppl": 2.655572
},
{
"ce_loss": 0.9825,
"epoch": 0.47606128022862515,
"grad_norm": 0.96875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.6210651946889455e-05,
"loss": 0.9825,
"mean_token_accuracy": 0.7717338934540748,
"num_tokens": 242181967.0,
"step": 3290,
"train_ppl": 2.671143
},
{
"ce_loss": 0.9452,
"epoch": 0.47750827500135656,
"grad_norm": 0.96484375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.6165895867522004e-05,
"loss": 0.9452,
"mean_token_accuracy": 0.7806530050933361,
"num_tokens": 242920132.0,
"step": 3300,
"train_ppl": 2.57345
},
{
"ce_loss": 0.9595,
"epoch": 0.4789552697740879,
"grad_norm": 1.265625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.612113978815456e-05,
"loss": 0.9595,
"mean_token_accuracy": 0.7763951353728771,
"num_tokens": 243640350.0,
"step": 3310,
"train_ppl": 2.610434
},
{
"ce_loss": 0.9676,
"epoch": 0.48040226454681934,
"grad_norm": 1.0234375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.607638370878711e-05,
"loss": 0.9676,
"mean_token_accuracy": 0.774853790551424,
"num_tokens": 244365334.0,
"step": 3320,
"train_ppl": 2.631576
},
{
"ce_loss": 0.9558,
"epoch": 0.4818492593195507,
"grad_norm": 1.1796875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.6031627629419664e-05,
"loss": 0.9558,
"mean_token_accuracy": 0.7763160079717636,
"num_tokens": 245108674.0,
"step": 3330,
"train_ppl": 2.600818
},
{
"ce_loss": 0.9885,
"epoch": 0.4832962540922821,
"grad_norm": 1.109375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.5986871550052217e-05,
"loss": 0.9885,
"mean_token_accuracy": 0.7731200739741325,
"num_tokens": 245851700.0,
"step": 3340,
"train_ppl": 2.687179
},
{
"ce_loss": 0.9778,
"epoch": 0.48474324886501347,
"grad_norm": 1.078125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.5942115470684766e-05,
"loss": 0.9778,
"mean_token_accuracy": 0.7771647915244102,
"num_tokens": 246580552.0,
"step": 3350,
"train_ppl": 2.658483
},
{
"ce_loss": 0.969,
"epoch": 0.4861902436377449,
"grad_norm": 1.1171875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.589735939131732e-05,
"loss": 0.969,
"mean_token_accuracy": 0.7781485505402088,
"num_tokens": 247303795.0,
"step": 3360,
"train_ppl": 2.635424
},
{
"ce_loss": 0.9672,
"epoch": 0.48763723841047624,
"grad_norm": 1.015625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.5852603311949874e-05,
"loss": 0.9672,
"mean_token_accuracy": 0.7760098949074745,
"num_tokens": 248058038.0,
"step": 3370,
"train_ppl": 2.630652
},
{
"ce_loss": 0.9829,
"epoch": 0.48908423318320765,
"grad_norm": 1.09375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.5807847232582427e-05,
"loss": 0.9829,
"mean_token_accuracy": 0.774996928870678,
"num_tokens": 248796994.0,
"step": 3380,
"train_ppl": 2.672328
},
{
"ce_loss": 0.9999,
"epoch": 0.490531227955939,
"grad_norm": 1.0390625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.576309115321498e-05,
"loss": 0.9999,
"mean_token_accuracy": 0.769992358237505,
"num_tokens": 249528539.0,
"step": 3390,
"train_ppl": 2.717897
},
{
"ce_loss": 0.9744,
"epoch": 0.49197822272867037,
"grad_norm": 1.25,
"hf_loss_ratio": 1.0,
"learning_rate": 1.571833507384753e-05,
"loss": 0.9744,
"mean_token_accuracy": 0.7775142967700959,
"num_tokens": 250271300.0,
"step": 3400,
"train_ppl": 2.649573
},
{
"ce_loss": 0.9612,
"epoch": 0.4934252175014018,
"grad_norm": 1.078125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.5673578994480084e-05,
"loss": 0.9612,
"mean_token_accuracy": 0.7808264754712582,
"num_tokens": 251018244.0,
"step": 3410,
"train_ppl": 2.614842
},
{
"ce_loss": 0.9807,
"epoch": 0.49487221227413314,
"grad_norm": 1.0,
"hf_loss_ratio": 1.0,
"learning_rate": 1.5628822915112636e-05,
"loss": 0.9807,
"mean_token_accuracy": 0.7724880896508693,
"num_tokens": 251737409.0,
"step": 3420,
"train_ppl": 2.666417
},
{
"ce_loss": 0.9971,
"epoch": 0.49631920704686455,
"grad_norm": 1.125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.558406683574519e-05,
"loss": 0.9971,
"mean_token_accuracy": 0.7721994496881962,
"num_tokens": 252452177.0,
"step": 3430,
"train_ppl": 2.7103
},
{
"ce_loss": 0.9659,
"epoch": 0.4977662018195959,
"grad_norm": 0.98828125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.553931075637774e-05,
"loss": 0.9659,
"mean_token_accuracy": 0.7731683790683747,
"num_tokens": 253164867.0,
"step": 3440,
"train_ppl": 2.62711
},
{
"ce_loss": 0.9876,
"epoch": 0.4992131965923273,
"grad_norm": 0.96875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.5494554677010294e-05,
"loss": 0.9876,
"mean_token_accuracy": 0.7709869779646397,
"num_tokens": 253890732.0,
"step": 3450,
"train_ppl": 2.684681
},
{
"ce_loss": 0.9918,
"epoch": 0.5006601913650587,
"grad_norm": 1.0703125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.5449798597642846e-05,
"loss": 0.9918,
"mean_token_accuracy": 0.7687140062451363,
"num_tokens": 254619763.0,
"step": 3460,
"train_ppl": 2.696074
},
{
"ce_loss": 0.9504,
"epoch": 0.50210718613779,
"grad_norm": 0.94140625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.54050425182754e-05,
"loss": 0.9504,
"mean_token_accuracy": 0.7793492712080479,
"num_tokens": 255363436.0,
"step": 3470,
"train_ppl": 2.586716
},
{
"ce_loss": 0.9599,
"epoch": 0.5035541809105215,
"grad_norm": 0.9296875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.5360286438907954e-05,
"loss": 0.9599,
"mean_token_accuracy": 0.7774735637009144,
"num_tokens": 256115802.0,
"step": 3480,
"train_ppl": 2.61146
},
{
"ce_loss": 0.9649,
"epoch": 0.5050011756832529,
"grad_norm": 1.078125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.5315530359540503e-05,
"loss": 0.9649,
"mean_token_accuracy": 0.7754439219832421,
"num_tokens": 256842141.0,
"step": 3490,
"train_ppl": 2.62447
},
{
"ce_loss": 0.9671,
"epoch": 0.5064481704559842,
"grad_norm": 1.1484375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.527077428017306e-05,
"loss": 0.9671,
"mean_token_accuracy": 0.7746169321238995,
"num_tokens": 257574760.0,
"step": 3500,
"train_ppl": 2.630219
},
{
"ce_loss": 0.9834,
"epoch": 0.5078951652287156,
"grad_norm": 1.171875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.5226018200805612e-05,
"loss": 0.9834,
"mean_token_accuracy": 0.7728622667491436,
"num_tokens": 258285032.0,
"step": 3510,
"train_ppl": 2.673492
},
{
"ce_loss": 0.9703,
"epoch": 0.5093421600014469,
"grad_norm": 1.1171875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.5181262121438162e-05,
"loss": 0.9703,
"mean_token_accuracy": 0.7742777064442634,
"num_tokens": 258999939.0,
"step": 3520,
"train_ppl": 2.638679
},
{
"ce_loss": 0.9218,
"epoch": 0.5107891547741784,
"grad_norm": 0.9296875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.5136506042070715e-05,
"loss": 0.9218,
"mean_token_accuracy": 0.7861278541386127,
"num_tokens": 259763192.0,
"step": 3530,
"train_ppl": 2.513912
},
{
"ce_loss": 0.9292,
"epoch": 0.5122361495469098,
"grad_norm": 0.9375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.5091749962703266e-05,
"loss": 0.9292,
"mean_token_accuracy": 0.7805077292025089,
"num_tokens": 260499543.0,
"step": 3540,
"train_ppl": 2.532375
},
{
"ce_loss": 0.9898,
"epoch": 0.5136831443196411,
"grad_norm": 1.0078125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.504699388333582e-05,
"loss": 0.9898,
"mean_token_accuracy": 0.7731637723743916,
"num_tokens": 261254442.0,
"step": 3550,
"train_ppl": 2.690609
},
{
"ce_loss": 0.9634,
"epoch": 0.5151301390923725,
"grad_norm": 1.0625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.5002237803968374e-05,
"loss": 0.9634,
"mean_token_accuracy": 0.779674281924963,
"num_tokens": 262015435.0,
"step": 3560,
"train_ppl": 2.620479
},
{
"ce_loss": 0.9716,
"epoch": 0.516577133865104,
"grad_norm": 1.1171875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.4957481724600926e-05,
"loss": 0.9716,
"mean_token_accuracy": 0.776695205271244,
"num_tokens": 262693267.0,
"step": 3570,
"train_ppl": 2.642217
},
{
"ce_loss": 1.0025,
"epoch": 0.5180241286378353,
"grad_norm": 0.94140625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.4912725645233479e-05,
"loss": 1.0025,
"mean_token_accuracy": 0.7727914996445179,
"num_tokens": 263442598.0,
"step": 3580,
"train_ppl": 2.725135
},
{
"ce_loss": 0.9628,
"epoch": 0.5194711234105667,
"grad_norm": 1.046875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.486796956586603e-05,
"loss": 0.9628,
"mean_token_accuracy": 0.7818873479962349,
"num_tokens": 264210381.0,
"step": 3590,
"train_ppl": 2.618999
},
{
"ce_loss": 0.9571,
"epoch": 0.520918118183298,
"grad_norm": 0.921875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.4823213486498582e-05,
"loss": 0.9571,
"mean_token_accuracy": 0.7811072282493114,
"num_tokens": 264954557.0,
"step": 3600,
"train_ppl": 2.60412
},
{
"ce_loss": 0.9555,
"epoch": 0.5223651129560295,
"grad_norm": 1.046875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.4778457407131136e-05,
"loss": 0.9555,
"mean_token_accuracy": 0.7785631224513054,
"num_tokens": 265708667.0,
"step": 3610,
"train_ppl": 2.600049
},
{
"ce_loss": 0.9794,
"epoch": 0.5238121077287609,
"grad_norm": 1.0,
"hf_loss_ratio": 1.0,
"learning_rate": 1.4733701327763689e-05,
"loss": 0.9794,
"mean_token_accuracy": 0.7781493321061135,
"num_tokens": 266443298.0,
"step": 3620,
"train_ppl": 2.662788
},
{
"ce_loss": 0.9757,
"epoch": 0.5252591025014922,
"grad_norm": 0.96484375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.4688945248396241e-05,
"loss": 0.9757,
"mean_token_accuracy": 0.7720276661217212,
"num_tokens": 267173324.0,
"step": 3630,
"train_ppl": 2.653105
},
{
"ce_loss": 1.0308,
"epoch": 0.5267060972742236,
"grad_norm": 1.1953125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.4644189169028794e-05,
"loss": 1.0308,
"mean_token_accuracy": 0.7638523608446122,
"num_tokens": 267915944.0,
"step": 3640,
"train_ppl": 2.803437
},
{
"ce_loss": 0.9602,
"epoch": 0.5281530920469549,
"grad_norm": 0.953125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.4599433089661346e-05,
"loss": 0.9602,
"mean_token_accuracy": 0.7759406618773937,
"num_tokens": 268643319.0,
"step": 3650,
"train_ppl": 2.612157
},
{
"ce_loss": 0.9652,
"epoch": 0.5296000868196864,
"grad_norm": 1.0703125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.4554677010293898e-05,
"loss": 0.9652,
"mean_token_accuracy": 0.779689010232687,
"num_tokens": 269367307.0,
"step": 3660,
"train_ppl": 2.625382
},
{
"ce_loss": 0.9504,
"epoch": 0.5310470815924178,
"grad_norm": 0.8828125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.4509920930926451e-05,
"loss": 0.9504,
"mean_token_accuracy": 0.7774218022823334,
"num_tokens": 270092592.0,
"step": 3670,
"train_ppl": 2.586776
},
{
"ce_loss": 0.9583,
"epoch": 0.5324940763651491,
"grad_norm": 1.171875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.4465164851559005e-05,
"loss": 0.9583,
"mean_token_accuracy": 0.7736941121518612,
"num_tokens": 270860558.0,
"step": 3680,
"train_ppl": 2.60739
},
{
"ce_loss": 0.9978,
"epoch": 0.5339410711378805,
"grad_norm": 1.0546875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.4420408772191557e-05,
"loss": 0.9978,
"mean_token_accuracy": 0.7728485822677612,
"num_tokens": 271584192.0,
"step": 3690,
"train_ppl": 2.712288
},
{
"ce_loss": 1.0123,
"epoch": 0.5353880659106119,
"grad_norm": 1.15625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.4375652692824108e-05,
"loss": 1.0123,
"mean_token_accuracy": 0.767830940335989,
"num_tokens": 272333891.0,
"step": 3700,
"train_ppl": 2.751963
},
{
"ce_loss": 0.9239,
"epoch": 0.5368350606833433,
"grad_norm": 1.046875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.433089661345666e-05,
"loss": 0.9239,
"mean_token_accuracy": 0.7862473480403424,
"num_tokens": 273099133.0,
"step": 3710,
"train_ppl": 2.51917
},
{
"ce_loss": 0.958,
"epoch": 0.5382820554560747,
"grad_norm": 1.015625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.4286140534089215e-05,
"loss": 0.958,
"mean_token_accuracy": 0.7815881177783013,
"num_tokens": 273852553.0,
"step": 3720,
"train_ppl": 2.606516
},
{
"ce_loss": 0.9936,
"epoch": 0.539729050228806,
"grad_norm": 0.91015625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.4241384454721767e-05,
"loss": 0.9936,
"mean_token_accuracy": 0.7692437112331391,
"num_tokens": 274580358.0,
"step": 3730,
"train_ppl": 2.700827
},
{
"ce_loss": 0.9692,
"epoch": 0.5411760450015375,
"grad_norm": 0.9375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.419662837535432e-05,
"loss": 0.9692,
"mean_token_accuracy": 0.7750534601509571,
"num_tokens": 275333561.0,
"step": 3740,
"train_ppl": 2.635919
},
{
"ce_loss": 0.9531,
"epoch": 0.5426230397742688,
"grad_norm": 0.98046875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.415187229598687e-05,
"loss": 0.9531,
"mean_token_accuracy": 0.7767747581005097,
"num_tokens": 276083858.0,
"step": 3750,
"train_ppl": 2.593638
},
{
"ce_loss": 0.9443,
"epoch": 0.5440700345470002,
"grad_norm": 1.0859375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.4107116216619425e-05,
"loss": 0.9443,
"mean_token_accuracy": 0.7835570797324181,
"num_tokens": 276851059.0,
"step": 3760,
"train_ppl": 2.570927
},
{
"ce_loss": 0.9737,
"epoch": 0.5455170293197316,
"grad_norm": 1.03125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.4062360137251977e-05,
"loss": 0.9737,
"mean_token_accuracy": 0.776416502147913,
"num_tokens": 277581787.0,
"step": 3770,
"train_ppl": 2.647673
},
{
"ce_loss": 0.9387,
"epoch": 0.5469640240924629,
"grad_norm": 1.0078125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.401760405788453e-05,
"loss": 0.9387,
"mean_token_accuracy": 0.7881631642580033,
"num_tokens": 278297127.0,
"step": 3780,
"train_ppl": 2.5567
},
{
"ce_loss": 0.9493,
"epoch": 0.5484110188651944,
"grad_norm": 1.1171875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.3972847978517082e-05,
"loss": 0.9493,
"mean_token_accuracy": 0.7784359693527222,
"num_tokens": 279053770.0,
"step": 3790,
"train_ppl": 2.583983
},
{
"ce_loss": 0.9715,
"epoch": 0.5498580136379257,
"grad_norm": 1.015625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.3928091899149636e-05,
"loss": 0.9715,
"mean_token_accuracy": 0.7738523662090302,
"num_tokens": 279793403.0,
"step": 3800,
"train_ppl": 2.641912
},
{
"ce_loss": 0.9772,
"epoch": 0.5513050084106571,
"grad_norm": 1.0078125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.3883335819782187e-05,
"loss": 0.9772,
"mean_token_accuracy": 0.776868187636137,
"num_tokens": 280525655.0,
"step": 3810,
"train_ppl": 2.657016
},
{
"ce_loss": 0.926,
"epoch": 0.5527520031833885,
"grad_norm": 1.1640625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.383857974041474e-05,
"loss": 0.926,
"mean_token_accuracy": 0.7910705611109734,
"num_tokens": 281261170.0,
"step": 3820,
"train_ppl": 2.524335
},
{
"ce_loss": 0.9649,
"epoch": 0.5541989979561199,
"grad_norm": 1.28125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.3793823661047293e-05,
"loss": 0.9649,
"mean_token_accuracy": 0.7791670545935631,
"num_tokens": 281985897.0,
"step": 3830,
"train_ppl": 2.624451
},
{
"ce_loss": 0.9677,
"epoch": 0.5556459927288513,
"grad_norm": 0.98828125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.3749067581679846e-05,
"loss": 0.9677,
"mean_token_accuracy": 0.7748836219310761,
"num_tokens": 282721456.0,
"step": 3840,
"train_ppl": 2.631954
},
{
"ce_loss": 1.0129,
"epoch": 0.5570929875015826,
"grad_norm": 0.921875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.3704311502312398e-05,
"loss": 1.0129,
"mean_token_accuracy": 0.7665625207126141,
"num_tokens": 283434742.0,
"step": 3850,
"train_ppl": 2.753628
},
{
"ce_loss": 0.9751,
"epoch": 0.558539982274314,
"grad_norm": 1.046875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.3659555422944949e-05,
"loss": 0.9751,
"mean_token_accuracy": 0.7772414043545723,
"num_tokens": 284159932.0,
"step": 3860,
"train_ppl": 2.651563
},
{
"ce_loss": 0.96,
"epoch": 0.5599869770470454,
"grad_norm": 0.91015625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.3614799343577503e-05,
"loss": 0.96,
"mean_token_accuracy": 0.7742170818150044,
"num_tokens": 284892821.0,
"step": 3870,
"train_ppl": 2.611629
},
{
"ce_loss": 0.9735,
"epoch": 0.5614339718197768,
"grad_norm": 0.98046875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.3570043264210056e-05,
"loss": 0.9735,
"mean_token_accuracy": 0.7700681336224079,
"num_tokens": 285587737.0,
"step": 3880,
"train_ppl": 2.647213
},
{
"ce_loss": 0.9218,
"epoch": 0.5628809665925082,
"grad_norm": 1.0625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.3525287184842608e-05,
"loss": 0.9218,
"mean_token_accuracy": 0.7871894739568234,
"num_tokens": 286313582.0,
"step": 3890,
"train_ppl": 2.51389
},
{
"ce_loss": 0.941,
"epoch": 0.5643279613652395,
"grad_norm": 0.953125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.348053110547516e-05,
"loss": 0.941,
"mean_token_accuracy": 0.7820699147880077,
"num_tokens": 287064151.0,
"step": 3900,
"train_ppl": 2.562492
},
{
"ce_loss": 0.9296,
"epoch": 0.5657749561379709,
"grad_norm": 0.91796875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.3435775026107715e-05,
"loss": 0.9296,
"mean_token_accuracy": 0.7859035260975361,
"num_tokens": 287813874.0,
"step": 3910,
"train_ppl": 2.53357
},
{
"ce_loss": 0.9445,
"epoch": 0.5672219509107024,
"grad_norm": 0.859375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.3391018946740265e-05,
"loss": 0.9445,
"mean_token_accuracy": 0.782135433703661,
"num_tokens": 288570496.0,
"step": 3920,
"train_ppl": 2.571643
},
{
"ce_loss": 0.9839,
"epoch": 0.5686689456834337,
"grad_norm": 2.546875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.3346262867372818e-05,
"loss": 0.9839,
"mean_token_accuracy": 0.7735799729824067,
"num_tokens": 289350278.0,
"step": 3930,
"train_ppl": 2.674829
},
{
"ce_loss": 0.971,
"epoch": 0.5701159404561651,
"grad_norm": 0.92578125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.330150678800537e-05,
"loss": 0.971,
"mean_token_accuracy": 0.7777773514389992,
"num_tokens": 290079342.0,
"step": 3940,
"train_ppl": 2.640477
},
{
"ce_loss": 0.9539,
"epoch": 0.5715629352288965,
"grad_norm": 1.0234375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.3256750708637924e-05,
"loss": 0.9539,
"mean_token_accuracy": 0.7781407319009304,
"num_tokens": 290832879.0,
"step": 3950,
"train_ppl": 2.595897
},
{
"ce_loss": 0.9775,
"epoch": 0.5730099300016279,
"grad_norm": 1.09375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.3211994629270477e-05,
"loss": 0.9775,
"mean_token_accuracy": 0.7747543424367904,
"num_tokens": 291565544.0,
"step": 3960,
"train_ppl": 2.6577
},
{
"ce_loss": 0.9625,
"epoch": 0.5744569247743593,
"grad_norm": 1.0,
"hf_loss_ratio": 1.0,
"learning_rate": 1.3167238549903028e-05,
"loss": 0.9625,
"mean_token_accuracy": 0.778536244481802,
"num_tokens": 292316435.0,
"step": 3970,
"train_ppl": 2.618189
},
{
"ce_loss": 0.94,
"epoch": 0.5759039195470906,
"grad_norm": 0.94140625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.312248247053558e-05,
"loss": 0.94,
"mean_token_accuracy": 0.7783068805932999,
"num_tokens": 293058454.0,
"step": 3980,
"train_ppl": 2.560027
},
{
"ce_loss": 1.0024,
"epoch": 0.577350914319822,
"grad_norm": 1.046875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.3077726391168134e-05,
"loss": 1.0024,
"mean_token_accuracy": 0.7662229061126709,
"num_tokens": 293783644.0,
"step": 3990,
"train_ppl": 2.724925
},
{
"ce_loss": 0.9491,
"epoch": 0.5787979090925534,
"grad_norm": 1.0859375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.3032970311800687e-05,
"loss": 0.9491,
"mean_token_accuracy": 0.781515534222126,
"num_tokens": 294511489.0,
"step": 4000,
"train_ppl": 2.583289
},
{
"ce_loss": 0.9735,
"epoch": 0.5802449038652848,
"grad_norm": 1.1015625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.2988214232433239e-05,
"loss": 0.9735,
"mean_token_accuracy": 0.7806210406124592,
"num_tokens": 295248215.0,
"step": 4010,
"train_ppl": 2.647139
},
{
"ce_loss": 0.9393,
"epoch": 0.5816918986380162,
"grad_norm": 1.09375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.2943458153065793e-05,
"loss": 0.9393,
"mean_token_accuracy": 0.7846732117235661,
"num_tokens": 295989738.0,
"step": 4020,
"train_ppl": 2.558143
},
{
"ce_loss": 0.9621,
"epoch": 0.5831388934107475,
"grad_norm": 1.109375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.2898702073698344e-05,
"loss": 0.9621,
"mean_token_accuracy": 0.7784810028970242,
"num_tokens": 296702866.0,
"step": 4030,
"train_ppl": 2.617144
},
{
"ce_loss": 0.9765,
"epoch": 0.5845858881834789,
"grad_norm": 1.0,
"hf_loss_ratio": 1.0,
"learning_rate": 1.2853945994330896e-05,
"loss": 0.9765,
"mean_token_accuracy": 0.7725668139755726,
"num_tokens": 297439737.0,
"step": 4040,
"train_ppl": 2.655217
},
{
"ce_loss": 0.9885,
"epoch": 0.5860328829562104,
"grad_norm": 1.1875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.2809189914963449e-05,
"loss": 0.9885,
"mean_token_accuracy": 0.774877705425024,
"num_tokens": 298188647.0,
"step": 4050,
"train_ppl": 2.687219
},
{
"ce_loss": 0.9545,
"epoch": 0.5874798777289417,
"grad_norm": 0.91796875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.2764433835596003e-05,
"loss": 0.9545,
"mean_token_accuracy": 0.7752919748425484,
"num_tokens": 298937830.0,
"step": 4060,
"train_ppl": 2.597323
},
{
"ce_loss": 0.9608,
"epoch": 0.5889268725016731,
"grad_norm": 1.078125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.2719677756228555e-05,
"loss": 0.9608,
"mean_token_accuracy": 0.7775414235889911,
"num_tokens": 299669340.0,
"step": 4070,
"train_ppl": 2.613706
},
{
"ce_loss": 0.9499,
"epoch": 0.5903738672744044,
"grad_norm": 1.0390625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.2674921676861106e-05,
"loss": 0.9499,
"mean_token_accuracy": 0.7804868087172508,
"num_tokens": 300386836.0,
"step": 4080,
"train_ppl": 2.585417
},
{
"ce_loss": 0.9535,
"epoch": 0.5918208620471359,
"grad_norm": 1.0078125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.2630165597493659e-05,
"loss": 0.9535,
"mean_token_accuracy": 0.7813090972602368,
"num_tokens": 301161416.0,
"step": 4090,
"train_ppl": 2.594834
},
{
"ce_loss": 0.9412,
"epoch": 0.5932678568198673,
"grad_norm": 1.109375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.2585409518126213e-05,
"loss": 0.9412,
"mean_token_accuracy": 0.777237968891859,
"num_tokens": 301895700.0,
"step": 4100,
"train_ppl": 2.562928
},
{
"ce_loss": 0.9596,
"epoch": 0.5947148515925986,
"grad_norm": 1.078125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.2540653438758765e-05,
"loss": 0.9596,
"mean_token_accuracy": 0.775063581764698,
"num_tokens": 302652783.0,
"step": 4110,
"train_ppl": 2.610559
},
{
"ce_loss": 0.938,
"epoch": 0.59616184636533,
"grad_norm": 1.171875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.2495897359391318e-05,
"loss": 0.938,
"mean_token_accuracy": 0.7807605281472206,
"num_tokens": 303377816.0,
"step": 4120,
"train_ppl": 2.554922
},
{
"ce_loss": 0.9801,
"epoch": 0.5976088411380613,
"grad_norm": 1.0625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.245114128002387e-05,
"loss": 0.9801,
"mean_token_accuracy": 0.7739221796393394,
"num_tokens": 304113074.0,
"step": 4130,
"train_ppl": 2.664789
},
{
"ce_loss": 0.9596,
"epoch": 0.5990558359107928,
"grad_norm": 1.0546875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.2406385200656423e-05,
"loss": 0.9596,
"mean_token_accuracy": 0.7742515958845615,
"num_tokens": 304844350.0,
"step": 4140,
"train_ppl": 2.610675
},
{
"ce_loss": 0.964,
"epoch": 0.6005028306835242,
"grad_norm": 1.1015625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.2361629121288975e-05,
"loss": 0.964,
"mean_token_accuracy": 0.7800977975130081,
"num_tokens": 305579813.0,
"step": 4150,
"train_ppl": 2.622038
},
{
"ce_loss": 0.9532,
"epoch": 0.6019498254562555,
"grad_norm": 1.078125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.2316873041921527e-05,
"loss": 0.9532,
"mean_token_accuracy": 0.7812970593571663,
"num_tokens": 306304960.0,
"step": 4160,
"train_ppl": 2.594026
},
{
"ce_loss": 0.9601,
"epoch": 0.6033968202289869,
"grad_norm": 1.1015625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.2272116962554082e-05,
"loss": 0.9601,
"mean_token_accuracy": 0.7800398364663124,
"num_tokens": 307042663.0,
"step": 4170,
"train_ppl": 2.611905
},
{
"ce_loss": 0.9685,
"epoch": 0.6048438150017184,
"grad_norm": 0.8984375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.2227360883186634e-05,
"loss": 0.9685,
"mean_token_accuracy": 0.776139622181654,
"num_tokens": 307757206.0,
"step": 4180,
"train_ppl": 2.63396
},
{
"ce_loss": 0.9863,
"epoch": 0.6062908097744497,
"grad_norm": 0.88671875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.2182604803819185e-05,
"loss": 0.9863,
"mean_token_accuracy": 0.7687765277922154,
"num_tokens": 308492203.0,
"step": 4190,
"train_ppl": 2.681368
},
{
"ce_loss": 0.9499,
"epoch": 0.6077378045471811,
"grad_norm": 1.09375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.2137848724451737e-05,
"loss": 0.9499,
"mean_token_accuracy": 0.7795483432710171,
"num_tokens": 309220000.0,
"step": 4200,
"train_ppl": 2.585347
},
{
"ce_loss": 0.9506,
"epoch": 0.6091847993199124,
"grad_norm": 1.0,
"hf_loss_ratio": 1.0,
"learning_rate": 1.2093092645084291e-05,
"loss": 0.9506,
"mean_token_accuracy": 0.7806940786540508,
"num_tokens": 309954206.0,
"step": 4210,
"train_ppl": 2.587363
},
{
"ce_loss": 0.9777,
"epoch": 0.6106317940926438,
"grad_norm": 1.234375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.2048336565716844e-05,
"loss": 0.9777,
"mean_token_accuracy": 0.7771054945886136,
"num_tokens": 310673874.0,
"step": 4220,
"train_ppl": 2.658411
},
{
"ce_loss": 0.9427,
"epoch": 0.6120787888653753,
"grad_norm": 0.97265625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.2003580486349396e-05,
"loss": 0.9427,
"mean_token_accuracy": 0.7819586515426635,
"num_tokens": 311425629.0,
"step": 4230,
"train_ppl": 2.567005
},
{
"ce_loss": 0.9469,
"epoch": 0.6135257836381066,
"grad_norm": 1.1875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.1958824406981949e-05,
"loss": 0.9469,
"mean_token_accuracy": 0.7801039353013038,
"num_tokens": 312149916.0,
"step": 4240,
"train_ppl": 2.577795
},
{
"ce_loss": 0.9829,
"epoch": 0.614972778410838,
"grad_norm": 0.9609375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.1914068327614501e-05,
"loss": 0.9829,
"mean_token_accuracy": 0.7737744726240635,
"num_tokens": 312871666.0,
"step": 4250,
"train_ppl": 2.672162
},
{
"ce_loss": 0.9819,
"epoch": 0.6164197731835693,
"grad_norm": 1.21875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.1869312248247054e-05,
"loss": 0.9819,
"mean_token_accuracy": 0.7720717005431652,
"num_tokens": 313601563.0,
"step": 4260,
"train_ppl": 2.669572
},
{
"ce_loss": 0.9503,
"epoch": 0.6178667679563008,
"grad_norm": 1.015625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.1824556168879606e-05,
"loss": 0.9503,
"mean_token_accuracy": 0.7818848460912704,
"num_tokens": 314353822.0,
"step": 4270,
"train_ppl": 2.58643
},
{
"ce_loss": 0.945,
"epoch": 0.6193137627290322,
"grad_norm": 1.1328125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.1779800089512159e-05,
"loss": 0.945,
"mean_token_accuracy": 0.7822961673140526,
"num_tokens": 315066430.0,
"step": 4280,
"train_ppl": 2.57272
},
{
"ce_loss": 0.9851,
"epoch": 0.6207607575017635,
"grad_norm": 1.0859375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.1735044010144713e-05,
"loss": 0.9851,
"mean_token_accuracy": 0.7730609364807606,
"num_tokens": 315802006.0,
"step": 4290,
"train_ppl": 2.678082
},
{
"ce_loss": 0.9502,
"epoch": 0.6222077522744949,
"grad_norm": 0.984375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.1690287930777263e-05,
"loss": 0.9502,
"mean_token_accuracy": 0.7806099034845829,
"num_tokens": 316597439.0,
"step": 4300,
"train_ppl": 2.586201
},
{
"ce_loss": 0.9809,
"epoch": 0.6236547470472263,
"grad_norm": 0.94140625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.1645531851409816e-05,
"loss": 0.9809,
"mean_token_accuracy": 0.773340854048729,
"num_tokens": 317357015.0,
"step": 4310,
"train_ppl": 2.666982
},
{
"ce_loss": 0.9792,
"epoch": 0.6251017418199577,
"grad_norm": 0.9921875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.160077577204237e-05,
"loss": 0.9792,
"mean_token_accuracy": 0.7763313055038452,
"num_tokens": 318074229.0,
"step": 4320,
"train_ppl": 2.662203
},
{
"ce_loss": 0.9621,
"epoch": 0.6265487365926891,
"grad_norm": 1.1640625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.1556019692674922e-05,
"loss": 0.9621,
"mean_token_accuracy": 0.775955218076706,
"num_tokens": 318793337.0,
"step": 4330,
"train_ppl": 2.617267
},
{
"ce_loss": 0.9433,
"epoch": 0.6279957313654204,
"grad_norm": 1.1015625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.1511263613307475e-05,
"loss": 0.9433,
"mean_token_accuracy": 0.7845971286296844,
"num_tokens": 319523789.0,
"step": 4340,
"train_ppl": 2.568444
},
{
"ce_loss": 0.9728,
"epoch": 0.6294427261381518,
"grad_norm": 1.03125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.1466507533940027e-05,
"loss": 0.9728,
"mean_token_accuracy": 0.7732916258275508,
"num_tokens": 320236607.0,
"step": 4350,
"train_ppl": 2.645373
},
{
"ce_loss": 0.9608,
"epoch": 0.6308897209108832,
"grad_norm": 1.1796875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.142175145457258e-05,
"loss": 0.9608,
"mean_token_accuracy": 0.7798072099685669,
"num_tokens": 320964949.0,
"step": 4360,
"train_ppl": 2.613791
},
{
"ce_loss": 0.9866,
"epoch": 0.6323367156836146,
"grad_norm": 1.171875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.1376995375205132e-05,
"loss": 0.9866,
"mean_token_accuracy": 0.7727800719439983,
"num_tokens": 321671284.0,
"step": 4370,
"train_ppl": 2.682008
},
{
"ce_loss": 0.9446,
"epoch": 0.633783710456346,
"grad_norm": 0.90625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.1332239295837685e-05,
"loss": 0.9446,
"mean_token_accuracy": 0.7807809986174107,
"num_tokens": 322413391.0,
"step": 4380,
"train_ppl": 2.571716
},
{
"ce_loss": 0.9443,
"epoch": 0.6352307052290773,
"grad_norm": 1.1953125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.1287483216470237e-05,
"loss": 0.9443,
"mean_token_accuracy": 0.7804166525602341,
"num_tokens": 323139704.0,
"step": 4390,
"train_ppl": 2.570885
},
{
"ce_loss": 0.9331,
"epoch": 0.6366777000018088,
"grad_norm": 1.0078125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.1242727137102791e-05,
"loss": 0.9331,
"mean_token_accuracy": 0.7856282263994216,
"num_tokens": 323894610.0,
"step": 4400,
"train_ppl": 2.54235
},
{
"ce_loss": 1.0027,
"epoch": 0.6381246947745401,
"grad_norm": 1.046875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.1197971057735342e-05,
"loss": 1.0027,
"mean_token_accuracy": 0.7679429657757282,
"num_tokens": 324636289.0,
"step": 4410,
"train_ppl": 2.725621
},
{
"ce_loss": 0.981,
"epoch": 0.6395716895472715,
"grad_norm": 0.8828125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.1153214978367894e-05,
"loss": 0.981,
"mean_token_accuracy": 0.7753245957195759,
"num_tokens": 325386589.0,
"step": 4420,
"train_ppl": 2.667189
},
{
"ce_loss": 0.9547,
"epoch": 0.6410186843200029,
"grad_norm": 0.9375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.1108458899000447e-05,
"loss": 0.9547,
"mean_token_accuracy": 0.778544618934393,
"num_tokens": 326155177.0,
"step": 4430,
"train_ppl": 2.597782
},
{
"ce_loss": 0.9627,
"epoch": 0.6424656790927343,
"grad_norm": 1.0625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.1063702819633001e-05,
"loss": 0.9627,
"mean_token_accuracy": 0.7790204137563705,
"num_tokens": 326889827.0,
"step": 4440,
"train_ppl": 2.618685
},
{
"ce_loss": 0.9919,
"epoch": 0.6439126738654657,
"grad_norm": 1.0625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.1018946740265554e-05,
"loss": 0.9919,
"mean_token_accuracy": 0.7769460953772068,
"num_tokens": 327593189.0,
"step": 4450,
"train_ppl": 2.69623
},
{
"ce_loss": 0.9627,
"epoch": 0.645359668638197,
"grad_norm": 1.0546875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.0974190660898106e-05,
"loss": 0.9627,
"mean_token_accuracy": 0.7764194391667842,
"num_tokens": 328366781.0,
"step": 4460,
"train_ppl": 2.618665
},
{
"ce_loss": 0.9249,
"epoch": 0.6468066634109284,
"grad_norm": 1.1015625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.0929434581530658e-05,
"loss": 0.9249,
"mean_token_accuracy": 0.779874175786972,
"num_tokens": 329095559.0,
"step": 4470,
"train_ppl": 2.521557
},
{
"ce_loss": 0.9713,
"epoch": 0.6482536581836598,
"grad_norm": 1.078125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.0884678502163211e-05,
"loss": 0.9713,
"mean_token_accuracy": 0.7740052983164787,
"num_tokens": 329811677.0,
"step": 4480,
"train_ppl": 2.641304
},
{
"ce_loss": 0.9528,
"epoch": 0.6497006529563912,
"grad_norm": 1.03125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.0839922422795763e-05,
"loss": 0.9528,
"mean_token_accuracy": 0.7821832969784737,
"num_tokens": 330551710.0,
"step": 4490,
"train_ppl": 2.592979
},
{
"ce_loss": 0.9515,
"epoch": 0.6511476477291226,
"grad_norm": 0.99609375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.0795166343428316e-05,
"loss": 0.9515,
"mean_token_accuracy": 0.7812347248196602,
"num_tokens": 331296938.0,
"step": 4500,
"train_ppl": 2.589622
},
{
"ce_loss": 0.9432,
"epoch": 0.652594642501854,
"grad_norm": 0.91796875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.075041026406087e-05,
"loss": 0.9432,
"mean_token_accuracy": 0.7813379496335984,
"num_tokens": 332025952.0,
"step": 4510,
"train_ppl": 2.568238
},
{
"ce_loss": 1.0099,
"epoch": 0.6540416372745853,
"grad_norm": 1.0625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.070565418469342e-05,
"loss": 1.0099,
"mean_token_accuracy": 0.7635823853313923,
"num_tokens": 332771616.0,
"step": 4520,
"train_ppl": 2.745205
},
{
"ce_loss": 0.9694,
"epoch": 0.6554886320473168,
"grad_norm": 0.87890625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.0660898105325973e-05,
"loss": 0.9694,
"mean_token_accuracy": 0.7710436776280403,
"num_tokens": 333522538.0,
"step": 4530,
"train_ppl": 2.636479
},
{
"ce_loss": 0.9682,
"epoch": 0.6569356268200481,
"grad_norm": 1.078125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.0616142025958526e-05,
"loss": 0.9682,
"mean_token_accuracy": 0.7808797568082809,
"num_tokens": 334235618.0,
"step": 4540,
"train_ppl": 2.633224
},
{
"ce_loss": 0.9577,
"epoch": 0.6583826215927795,
"grad_norm": 1.0390625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.057138594659108e-05,
"loss": 0.9577,
"mean_token_accuracy": 0.7794765748083592,
"num_tokens": 334986466.0,
"step": 4550,
"train_ppl": 2.605761
},
{
"ce_loss": 0.9243,
"epoch": 0.6598296163655109,
"grad_norm": 1.109375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.0526629867223632e-05,
"loss": 0.9243,
"mean_token_accuracy": 0.788041090220213,
"num_tokens": 335711214.0,
"step": 4560,
"train_ppl": 2.520199
},
{
"ce_loss": 0.9528,
"epoch": 0.6612766111382422,
"grad_norm": 1.078125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.0481873787856185e-05,
"loss": 0.9528,
"mean_token_accuracy": 0.7787193424999714,
"num_tokens": 336437137.0,
"step": 4570,
"train_ppl": 2.592964
},
{
"ce_loss": 0.9448,
"epoch": 0.6627236059109737,
"grad_norm": 0.8828125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.0437117708488735e-05,
"loss": 0.9448,
"mean_token_accuracy": 0.7806118883192539,
"num_tokens": 337180631.0,
"step": 4580,
"train_ppl": 2.572427
},
{
"ce_loss": 0.954,
"epoch": 0.664170600683705,
"grad_norm": 1.09375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.039236162912129e-05,
"loss": 0.954,
"mean_token_accuracy": 0.7802353672683239,
"num_tokens": 337939742.0,
"step": 4590,
"train_ppl": 2.596065
},
{
"ce_loss": 0.9637,
"epoch": 0.6656175954564364,
"grad_norm": 0.94921875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.0347605549753842e-05,
"loss": 0.9637,
"mean_token_accuracy": 0.7783378548920155,
"num_tokens": 338675720.0,
"step": 4600,
"train_ppl": 2.621249
},
{
"ce_loss": 0.9487,
"epoch": 0.6670645902291678,
"grad_norm": 1.2109375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.0302849470386394e-05,
"loss": 0.9487,
"mean_token_accuracy": 0.7817958757281304,
"num_tokens": 339387696.0,
"step": 4610,
"train_ppl": 2.582235
},
{
"ce_loss": 0.9513,
"epoch": 0.6685115850018992,
"grad_norm": 0.9921875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.0258093391018948e-05,
"loss": 0.9513,
"mean_token_accuracy": 0.7807927936315536,
"num_tokens": 340133225.0,
"step": 4620,
"train_ppl": 2.58913
},
{
"ce_loss": 1.0216,
"epoch": 0.6699585797746306,
"grad_norm": 1.1796875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.02133373116515e-05,
"loss": 1.0216,
"mean_token_accuracy": 0.7636558651924134,
"num_tokens": 340874723.0,
"step": 4630,
"train_ppl": 2.777752
},
{
"ce_loss": 1.0065,
"epoch": 0.6714055745473619,
"grad_norm": 1.0546875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.0168581232284052e-05,
"loss": 1.0065,
"mean_token_accuracy": 0.7711653731763363,
"num_tokens": 341581981.0,
"step": 4640,
"train_ppl": 2.736106
},
{
"ce_loss": 0.9494,
"epoch": 0.6728525693200933,
"grad_norm": 0.94921875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.0123825152916604e-05,
"loss": 0.9494,
"mean_token_accuracy": 0.7801486007869244,
"num_tokens": 342305325.0,
"step": 4650,
"train_ppl": 2.584225
},
{
"ce_loss": 1.0076,
"epoch": 0.6742995640928248,
"grad_norm": 0.99609375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.0079069073549158e-05,
"loss": 1.0076,
"mean_token_accuracy": 0.7673116207122803,
"num_tokens": 343028770.0,
"step": 4660,
"train_ppl": 2.739132
},
{
"ce_loss": 0.9494,
"epoch": 0.6757465588655561,
"grad_norm": 1.015625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.003431299418171e-05,
"loss": 0.9494,
"mean_token_accuracy": 0.7784094549715519,
"num_tokens": 343727815.0,
"step": 4670,
"train_ppl": 2.58426
},
{
"ce_loss": 0.9739,
"epoch": 0.6771935536382875,
"grad_norm": 0.86328125,
"hf_loss_ratio": 1.0,
"learning_rate": 9.989556914814263e-06,
"loss": 0.9739,
"mean_token_accuracy": 0.7748332381248474,
"num_tokens": 344496287.0,
"step": 4680,
"train_ppl": 2.648136
},
{
"ce_loss": 0.9277,
"epoch": 0.6786405484110188,
"grad_norm": 1.03125,
"hf_loss_ratio": 1.0,
"learning_rate": 9.944800835446814e-06,
"loss": 0.9277,
"mean_token_accuracy": 0.7852459564805031,
"num_tokens": 345252142.0,
"step": 4690,
"train_ppl": 2.528671
},
{
"ce_loss": 0.9513,
"epoch": 0.6800875431837502,
"grad_norm": 0.8984375,
"hf_loss_ratio": 1.0,
"learning_rate": 9.900044756079368e-06,
"loss": 0.9513,
"mean_token_accuracy": 0.7755139887332916,
"num_tokens": 345968711.0,
"step": 4700,
"train_ppl": 2.588961
},
{
"ce_loss": 0.9771,
"epoch": 0.6815345379564817,
"grad_norm": 1.0703125,
"hf_loss_ratio": 1.0,
"learning_rate": 9.85528867671192e-06,
"loss": 0.9771,
"mean_token_accuracy": 0.7777153819799423,
"num_tokens": 346713582.0,
"step": 4710,
"train_ppl": 2.656647
},
{
"ce_loss": 0.9743,
"epoch": 0.682981532729213,
"grad_norm": 1.0703125,
"hf_loss_ratio": 1.0,
"learning_rate": 9.810532597344473e-06,
"loss": 0.9743,
"mean_token_accuracy": 0.7767357155680656,
"num_tokens": 347439699.0,
"step": 4720,
"train_ppl": 2.64929
},
{
"ce_loss": 0.9481,
"epoch": 0.6844285275019444,
"grad_norm": 0.94140625,
"hf_loss_ratio": 1.0,
"learning_rate": 9.765776517977025e-06,
"loss": 0.9481,
"mean_token_accuracy": 0.7791095830500125,
"num_tokens": 348184084.0,
"step": 4730,
"train_ppl": 2.580792
},
{
"ce_loss": 0.9604,
"epoch": 0.6858755222746757,
"grad_norm": 0.89453125,
"hf_loss_ratio": 1.0,
"learning_rate": 9.721020438609578e-06,
"loss": 0.9604,
"mean_token_accuracy": 0.7775398962199688,
"num_tokens": 348919169.0,
"step": 4740,
"train_ppl": 2.612626
},
{
"ce_loss": 0.8995,
"epoch": 0.6873225170474072,
"grad_norm": 1.140625,
"hf_loss_ratio": 1.0,
"learning_rate": 9.67626435924213e-06,
"loss": 0.8995,
"mean_token_accuracy": 0.7857723847031594,
"num_tokens": 349661624.0,
"step": 4750,
"train_ppl": 2.458453
},
{
"ce_loss": 0.9861,
"epoch": 0.6887695118201386,
"grad_norm": 1.25,
"hf_loss_ratio": 1.0,
"learning_rate": 9.631508279874683e-06,
"loss": 0.9861,
"mean_token_accuracy": 0.7729386761784554,
"num_tokens": 350399970.0,
"step": 4760,
"train_ppl": 2.680691
},
{
"ce_loss": 0.9508,
"epoch": 0.6902165065928699,
"grad_norm": 0.96875,
"hf_loss_ratio": 1.0,
"learning_rate": 9.586752200507235e-06,
"loss": 0.9508,
"mean_token_accuracy": 0.778910332173109,
"num_tokens": 351129477.0,
"step": 4770,
"train_ppl": 2.587908
},
{
"ce_loss": 0.948,
"epoch": 0.6916635013656013,
"grad_norm": 1.109375,
"hf_loss_ratio": 1.0,
"learning_rate": 9.54199612113979e-06,
"loss": 0.948,
"mean_token_accuracy": 0.7814707688987255,
"num_tokens": 351858724.0,
"step": 4780,
"train_ppl": 2.580426
},
{
"ce_loss": 0.9298,
"epoch": 0.6931104961383328,
"grad_norm": 0.8203125,
"hf_loss_ratio": 1.0,
"learning_rate": 9.497240041772342e-06,
"loss": 0.9298,
"mean_token_accuracy": 0.7840299472212792,
"num_tokens": 352600340.0,
"step": 4790,
"train_ppl": 2.533983
},
{
"ce_loss": 0.9513,
"epoch": 0.6945574909110641,
"grad_norm": 1.2421875,
"hf_loss_ratio": 1.0,
"learning_rate": 9.452483962404893e-06,
"loss": 0.9513,
"mean_token_accuracy": 0.7826124854385853,
"num_tokens": 353357441.0,
"step": 4800,
"train_ppl": 2.589095
},
{
"ce_loss": 0.9323,
"epoch": 0.6960044856837955,
"grad_norm": 1.09375,
"hf_loss_ratio": 1.0,
"learning_rate": 9.407727883037447e-06,
"loss": 0.9323,
"mean_token_accuracy": 0.787242216616869,
"num_tokens": 354113021.0,
"step": 4810,
"train_ppl": 2.540341
},
{
"ce_loss": 0.9677,
"epoch": 0.6974514804565268,
"grad_norm": 1.03125,
"hf_loss_ratio": 1.0,
"learning_rate": 9.362971803669999e-06,
"loss": 0.9677,
"mean_token_accuracy": 0.7780552484095097,
"num_tokens": 354852637.0,
"step": 4820,
"train_ppl": 2.631944
},
{
"ce_loss": 0.9494,
"epoch": 0.6988984752292582,
"grad_norm": 1.109375,
"hf_loss_ratio": 1.0,
"learning_rate": 9.318215724302552e-06,
"loss": 0.9494,
"mean_token_accuracy": 0.7799071431159973,
"num_tokens": 355576304.0,
"step": 4830,
"train_ppl": 2.584123
},
{
"ce_loss": 0.9728,
"epoch": 0.7003454700019897,
"grad_norm": 1.015625,
"hf_loss_ratio": 1.0,
"learning_rate": 9.273459644935104e-06,
"loss": 0.9728,
"mean_token_accuracy": 0.7771174512803555,
"num_tokens": 356285418.0,
"step": 4840,
"train_ppl": 2.645322
},
{
"ce_loss": 0.9722,
"epoch": 0.701792464774721,
"grad_norm": 0.9921875,
"hf_loss_ratio": 1.0,
"learning_rate": 9.228703565567656e-06,
"loss": 0.9722,
"mean_token_accuracy": 0.7724181763827801,
"num_tokens": 357011227.0,
"step": 4850,
"train_ppl": 2.643664
},
{
"ce_loss": 0.9436,
"epoch": 0.7032394595474524,
"grad_norm": 1.5078125,
"hf_loss_ratio": 1.0,
"learning_rate": 9.183947486200209e-06,
"loss": 0.9436,
"mean_token_accuracy": 0.7861829474568367,
"num_tokens": 357765044.0,
"step": 4860,
"train_ppl": 2.569213
},
{
"ce_loss": 0.9813,
"epoch": 0.7046864543201837,
"grad_norm": 1.2578125,
"hf_loss_ratio": 1.0,
"learning_rate": 9.139191406832761e-06,
"loss": 0.9813,
"mean_token_accuracy": 0.7709318250417709,
"num_tokens": 358480087.0,
"step": 4870,
"train_ppl": 2.667803
},
{
"ce_loss": 0.9635,
"epoch": 0.7061334490929152,
"grad_norm": 0.91015625,
"hf_loss_ratio": 1.0,
"learning_rate": 9.094435327465314e-06,
"loss": 0.9635,
"mean_token_accuracy": 0.7794269703328609,
"num_tokens": 359225911.0,
"step": 4880,
"train_ppl": 2.620869
},
{
"ce_loss": 0.97,
"epoch": 0.7075804438656466,
"grad_norm": 1.03125,
"hf_loss_ratio": 1.0,
"learning_rate": 9.049679248097868e-06,
"loss": 0.97,
"mean_token_accuracy": 0.777967818826437,
"num_tokens": 359966433.0,
"step": 4890,
"train_ppl": 2.637852
},
{
"ce_loss": 0.9711,
"epoch": 0.7090274386383779,
"grad_norm": 0.984375,
"hf_loss_ratio": 1.0,
"learning_rate": 9.00492316873042e-06,
"loss": 0.9711,
"mean_token_accuracy": 0.7772382542490959,
"num_tokens": 360710714.0,
"step": 4900,
"train_ppl": 2.640824
},
{
"ce_loss": 0.9834,
"epoch": 0.7104744334111093,
"grad_norm": 1.0546875,
"hf_loss_ratio": 1.0,
"learning_rate": 8.960167089362971e-06,
"loss": 0.9834,
"mean_token_accuracy": 0.7759847708046437,
"num_tokens": 361431042.0,
"step": 4910,
"train_ppl": 2.673438
},
{
"ce_loss": 0.9929,
"epoch": 0.7119214281838406,
"grad_norm": 1.1796875,
"hf_loss_ratio": 1.0,
"learning_rate": 8.915411009995524e-06,
"loss": 0.9929,
"mean_token_accuracy": 0.7740428909659386,
"num_tokens": 362150095.0,
"step": 4920,
"train_ppl": 2.699036
},
{
"ce_loss": 0.8871,
"epoch": 0.7133684229565721,
"grad_norm": 1.1015625,
"hf_loss_ratio": 1.0,
"learning_rate": 8.870654930628078e-06,
"loss": 0.8871,
"mean_token_accuracy": 0.7937179610133172,
"num_tokens": 362916644.0,
"step": 4930,
"train_ppl": 2.428081
},
{
"ce_loss": 0.9567,
"epoch": 0.7148154177293035,
"grad_norm": 0.99609375,
"hf_loss_ratio": 1.0,
"learning_rate": 8.82589885126063e-06,
"loss": 0.9567,
"mean_token_accuracy": 0.7758529260754585,
"num_tokens": 363661364.0,
"step": 4940,
"train_ppl": 2.603105
},
{
"ce_loss": 0.9611,
"epoch": 0.7162624125020348,
"grad_norm": 0.94921875,
"hf_loss_ratio": 1.0,
"learning_rate": 8.781142771893183e-06,
"loss": 0.9611,
"mean_token_accuracy": 0.7716841556131839,
"num_tokens": 364395584.0,
"step": 4950,
"train_ppl": 2.614648
},
{
"ce_loss": 0.9578,
"epoch": 0.7177094072747662,
"grad_norm": 1.2265625,
"hf_loss_ratio": 1.0,
"learning_rate": 8.736386692525735e-06,
"loss": 0.9578,
"mean_token_accuracy": 0.7815270647406578,
"num_tokens": 365122476.0,
"step": 4960,
"train_ppl": 2.605926
},
{
"ce_loss": 0.9854,
"epoch": 0.7191564020474976,
"grad_norm": 0.9375,
"hf_loss_ratio": 1.0,
"learning_rate": 8.691630613158287e-06,
"loss": 0.9854,
"mean_token_accuracy": 0.7658473886549473,
"num_tokens": 365839126.0,
"step": 4970,
"train_ppl": 2.678892
},
{
"ce_loss": 0.9621,
"epoch": 0.720603396820229,
"grad_norm": 0.9453125,
"hf_loss_ratio": 1.0,
"learning_rate": 8.64687453379084e-06,
"loss": 0.9621,
"mean_token_accuracy": 0.7814343258738518,
"num_tokens": 366576655.0,
"step": 4980,
"train_ppl": 2.617123
},
{
"ce_loss": 1.0258,
"epoch": 0.7220503915929604,
"grad_norm": 1.0234375,
"hf_loss_ratio": 1.0,
"learning_rate": 8.602118454423392e-06,
"loss": 1.0258,
"mean_token_accuracy": 0.763127225637436,
"num_tokens": 367298471.0,
"step": 4990,
"train_ppl": 2.789273
},
{
"ce_loss": 0.9444,
"epoch": 0.7234973863656917,
"grad_norm": 1.2890625,
"hf_loss_ratio": 1.0,
"learning_rate": 8.557362375055947e-06,
"loss": 0.9444,
"mean_token_accuracy": 0.780534103512764,
"num_tokens": 368033809.0,
"step": 5000,
"train_ppl": 2.571163
},
{
"ce_loss": 0.9551,
"epoch": 0.7249443811384232,
"grad_norm": 0.99609375,
"hf_loss_ratio": 1.0,
"learning_rate": 8.512606295688499e-06,
"loss": 0.9551,
"mean_token_accuracy": 0.7752326272428036,
"num_tokens": 368778901.0,
"step": 5010,
"train_ppl": 2.599014
},
{
"ce_loss": 0.9666,
"epoch": 0.7263913759111545,
"grad_norm": 1.09375,
"hf_loss_ratio": 1.0,
"learning_rate": 8.46785021632105e-06,
"loss": 0.9666,
"mean_token_accuracy": 0.7790293991565704,
"num_tokens": 369523679.0,
"step": 5020,
"train_ppl": 2.629102
},
{
"ce_loss": 0.9558,
"epoch": 0.7278383706838859,
"grad_norm": 1.0234375,
"hf_loss_ratio": 1.0,
"learning_rate": 8.423094136953602e-06,
"loss": 0.9558,
"mean_token_accuracy": 0.7781360924243927,
"num_tokens": 370232105.0,
"step": 5030,
"train_ppl": 2.60069
},
{
"ce_loss": 0.9697,
"epoch": 0.7292853654566173,
"grad_norm": 1.109375,
"hf_loss_ratio": 1.0,
"learning_rate": 8.378338057586156e-06,
"loss": 0.9697,
"mean_token_accuracy": 0.7776457980275154,
"num_tokens": 370983473.0,
"step": 5040,
"train_ppl": 2.637224
},
{
"ce_loss": 0.9737,
"epoch": 0.7307323602293486,
"grad_norm": 0.89453125,
"hf_loss_ratio": 1.0,
"learning_rate": 8.333581978218709e-06,
"loss": 0.9737,
"mean_token_accuracy": 0.7714293286204338,
"num_tokens": 371688241.0,
"step": 5050,
"train_ppl": 2.647609
},
{
"ce_loss": 0.9645,
"epoch": 0.7321793550020801,
"grad_norm": 1.09375,
"hf_loss_ratio": 1.0,
"learning_rate": 8.288825898851261e-06,
"loss": 0.9645,
"mean_token_accuracy": 0.7733834199607372,
"num_tokens": 372423026.0,
"step": 5060,
"train_ppl": 2.623403
},
{
"ce_loss": 0.9878,
"epoch": 0.7336263497748114,
"grad_norm": 1.0078125,
"hf_loss_ratio": 1.0,
"learning_rate": 8.244069819483812e-06,
"loss": 0.9878,
"mean_token_accuracy": 0.7733451426029205,
"num_tokens": 373159103.0,
"step": 5070,
"train_ppl": 2.685398
},
{
"ce_loss": 0.9405,
"epoch": 0.7350733445475428,
"grad_norm": 1.03125,
"hf_loss_ratio": 1.0,
"learning_rate": 8.199313740116366e-06,
"loss": 0.9405,
"mean_token_accuracy": 0.7828592106699943,
"num_tokens": 373883566.0,
"step": 5080,
"train_ppl": 2.561212
},
{
"ce_loss": 0.9523,
"epoch": 0.7365203393202742,
"grad_norm": 1.015625,
"hf_loss_ratio": 1.0,
"learning_rate": 8.154557660748919e-06,
"loss": 0.9523,
"mean_token_accuracy": 0.7811919517815114,
"num_tokens": 374630857.0,
"step": 5090,
"train_ppl": 2.59161
},
{
"ce_loss": 0.9657,
"epoch": 0.7379673340930056,
"grad_norm": 1.0703125,
"hf_loss_ratio": 1.0,
"learning_rate": 8.109801581381471e-06,
"loss": 0.9657,
"mean_token_accuracy": 0.7764380730688571,
"num_tokens": 375369612.0,
"step": 5100,
"train_ppl": 2.626685
},
{
"ce_loss": 0.9604,
"epoch": 0.739414328865737,
"grad_norm": 1.171875,
"hf_loss_ratio": 1.0,
"learning_rate": 8.065045502014025e-06,
"loss": 0.9604,
"mean_token_accuracy": 0.7770444475114345,
"num_tokens": 376090335.0,
"step": 5110,
"train_ppl": 2.61263
},
{
"ce_loss": 1.002,
"epoch": 0.7408613236384683,
"grad_norm": 1.046875,
"hf_loss_ratio": 1.0,
"learning_rate": 8.020289422646576e-06,
"loss": 1.002,
"mean_token_accuracy": 0.7697369538247585,
"num_tokens": 376821458.0,
"step": 5120,
"train_ppl": 2.72377
},
{
"ce_loss": 0.9565,
"epoch": 0.7423083184111997,
"grad_norm": 0.953125,
"hf_loss_ratio": 1.0,
"learning_rate": 7.975533343279128e-06,
"loss": 0.9565,
"mean_token_accuracy": 0.7750547006726265,
"num_tokens": 377545855.0,
"step": 5130,
"train_ppl": 2.602465
},
{
"ce_loss": 0.9469,
"epoch": 0.7437553131839312,
"grad_norm": 1.1875,
"hf_loss_ratio": 1.0,
"learning_rate": 7.93077726391168e-06,
"loss": 0.9469,
"mean_token_accuracy": 0.7794501177966595,
"num_tokens": 378284520.0,
"step": 5140,
"train_ppl": 2.577716
},
{
"ce_loss": 0.9937,
"epoch": 0.7452023079566625,
"grad_norm": 0.9921875,
"hf_loss_ratio": 1.0,
"learning_rate": 7.886021184544235e-06,
"loss": 0.9937,
"mean_token_accuracy": 0.7733355782926082,
"num_tokens": 379035001.0,
"step": 5150,
"train_ppl": 2.701191
},
{
"ce_loss": 0.97,
"epoch": 0.7466493027293939,
"grad_norm": 0.98046875,
"hf_loss_ratio": 1.0,
"learning_rate": 7.841265105176787e-06,
"loss": 0.97,
"mean_token_accuracy": 0.7776248715817928,
"num_tokens": 379752153.0,
"step": 5160,
"train_ppl": 2.638073
},
{
"ce_loss": 0.9501,
"epoch": 0.7480962975021253,
"grad_norm": 0.8515625,
"hf_loss_ratio": 1.0,
"learning_rate": 7.79650902580934e-06,
"loss": 0.9501,
"mean_token_accuracy": 0.7786346770823002,
"num_tokens": 380519482.0,
"step": 5170,
"train_ppl": 2.586042
},
{
"ce_loss": 0.9668,
"epoch": 0.7495432922748566,
"grad_norm": 1.03125,
"hf_loss_ratio": 1.0,
"learning_rate": 7.75175294644189e-06,
"loss": 0.9668,
"mean_token_accuracy": 0.7759903006255626,
"num_tokens": 381261662.0,
"step": 5180,
"train_ppl": 2.629544
},
{
"ce_loss": 0.9573,
"epoch": 0.7509902870475881,
"grad_norm": 1.15625,
"hf_loss_ratio": 1.0,
"learning_rate": 7.706996867074445e-06,
"loss": 0.9573,
"mean_token_accuracy": 0.7775361500680447,
"num_tokens": 382020074.0,
"step": 5190,
"train_ppl": 2.604706
},
{
"ce_loss": 0.9541,
"epoch": 0.7524372818203194,
"grad_norm": 0.9765625,
"hf_loss_ratio": 1.0,
"learning_rate": 7.662240787706997e-06,
"loss": 0.9541,
"mean_token_accuracy": 0.7822102926671505,
"num_tokens": 382778555.0,
"step": 5200,
"train_ppl": 2.596456
},
{
"ce_loss": 1.0105,
"epoch": 0.7538842765930508,
"grad_norm": 0.9453125,
"hf_loss_ratio": 1.0,
"learning_rate": 7.61748470833955e-06,
"loss": 1.0105,
"mean_token_accuracy": 0.7733402147889137,
"num_tokens": 383501391.0,
"step": 5210,
"train_ppl": 2.746933
},
{
"ce_loss": 0.9784,
"epoch": 0.7553312713657822,
"grad_norm": 0.9375,
"hf_loss_ratio": 1.0,
"learning_rate": 7.572728628972101e-06,
"loss": 0.9784,
"mean_token_accuracy": 0.7757657401263713,
"num_tokens": 384255141.0,
"step": 5220,
"train_ppl": 2.660156
},
{
"ce_loss": 0.984,
"epoch": 0.7567782661385136,
"grad_norm": 0.93359375,
"hf_loss_ratio": 1.0,
"learning_rate": 7.527972549604655e-06,
"loss": 0.984,
"mean_token_accuracy": 0.7741045750677585,
"num_tokens": 385007740.0,
"step": 5230,
"train_ppl": 2.675041
},
{
"ce_loss": 0.9386,
"epoch": 0.758225260911245,
"grad_norm": 1.015625,
"hf_loss_ratio": 1.0,
"learning_rate": 7.483216470237208e-06,
"loss": 0.9386,
"mean_token_accuracy": 0.778788211196661,
"num_tokens": 385746131.0,
"step": 5240,
"train_ppl": 2.556274
},
{
"ce_loss": 0.9838,
"epoch": 0.7596722556839763,
"grad_norm": 0.99609375,
"hf_loss_ratio": 1.0,
"learning_rate": 7.438460390869759e-06,
"loss": 0.9838,
"mean_token_accuracy": 0.7773367874324322,
"num_tokens": 386477070.0,
"step": 5250,
"train_ppl": 2.674711
},
{
"ce_loss": 0.919,
"epoch": 0.7611192504567077,
"grad_norm": 0.94140625,
"hf_loss_ratio": 1.0,
"learning_rate": 7.393704311502313e-06,
"loss": 0.919,
"mean_token_accuracy": 0.7863423444330693,
"num_tokens": 387230161.0,
"step": 5260,
"train_ppl": 2.506717
},
{
"ce_loss": 0.9727,
"epoch": 0.762566245229439,
"grad_norm": 0.9609375,
"hf_loss_ratio": 1.0,
"learning_rate": 7.348948232134866e-06,
"loss": 0.9727,
"mean_token_accuracy": 0.7754369527101517,
"num_tokens": 387918499.0,
"step": 5270,
"train_ppl": 2.645059
},
{
"ce_loss": 0.9702,
"epoch": 0.7640132400021705,
"grad_norm": 1.0234375,
"hf_loss_ratio": 1.0,
"learning_rate": 7.3041921527674176e-06,
"loss": 0.9702,
"mean_token_accuracy": 0.7701122313737869,
"num_tokens": 388648572.0,
"step": 5280,
"train_ppl": 2.638576
},
{
"ce_loss": 0.9647,
"epoch": 0.7654602347749019,
"grad_norm": 0.96875,
"hf_loss_ratio": 1.0,
"learning_rate": 7.259436073399971e-06,
"loss": 0.9647,
"mean_token_accuracy": 0.7734049685299397,
"num_tokens": 389377954.0,
"step": 5290,
"train_ppl": 2.623948
},
{
"ce_loss": 0.9537,
"epoch": 0.7669072295476332,
"grad_norm": 1.03125,
"hf_loss_ratio": 1.0,
"learning_rate": 7.2146799940325225e-06,
"loss": 0.9537,
"mean_token_accuracy": 0.7833194971084595,
"num_tokens": 390123270.0,
"step": 5300,
"train_ppl": 2.595421
},
{
"ce_loss": 0.9901,
"epoch": 0.7683542243203646,
"grad_norm": 0.9140625,
"hf_loss_ratio": 1.0,
"learning_rate": 7.169923914665076e-06,
"loss": 0.9901,
"mean_token_accuracy": 0.7688067726790905,
"num_tokens": 390821555.0,
"step": 5310,
"train_ppl": 2.691614
},
{
"ce_loss": 0.9358,
"epoch": 0.7698012190930961,
"grad_norm": 1.0546875,
"hf_loss_ratio": 1.0,
"learning_rate": 7.125167835297628e-06,
"loss": 0.9358,
"mean_token_accuracy": 0.7849721722304821,
"num_tokens": 391571244.0,
"step": 5320,
"train_ppl": 2.549222
},
{
"ce_loss": 0.9291,
"epoch": 0.7712482138658274,
"grad_norm": 0.9921875,
"hf_loss_ratio": 1.0,
"learning_rate": 7.080411755930181e-06,
"loss": 0.9291,
"mean_token_accuracy": 0.7855656445026398,
"num_tokens": 392336959.0,
"step": 5330,
"train_ppl": 2.532116
},
{
"ce_loss": 0.9654,
"epoch": 0.7726952086385588,
"grad_norm": 1.0234375,
"hf_loss_ratio": 1.0,
"learning_rate": 7.035655676562733e-06,
"loss": 0.9654,
"mean_token_accuracy": 0.7771142728626728,
"num_tokens": 393084871.0,
"step": 5340,
"train_ppl": 2.625794
},
{
"ce_loss": 0.9783,
"epoch": 0.7741422034112901,
"grad_norm": 1.1015625,
"hf_loss_ratio": 1.0,
"learning_rate": 6.990899597195286e-06,
"loss": 0.9783,
"mean_token_accuracy": 0.7791860036551952,
"num_tokens": 393816389.0,
"step": 5350,
"train_ppl": 2.65986
},
{
"ce_loss": 0.9563,
"epoch": 0.7755891981840216,
"grad_norm": 1.078125,
"hf_loss_ratio": 1.0,
"learning_rate": 6.946143517827838e-06,
"loss": 0.9563,
"mean_token_accuracy": 0.7763482123613358,
"num_tokens": 394555157.0,
"step": 5360,
"train_ppl": 2.601922
},
{
"ce_loss": 0.9661,
"epoch": 0.777036192956753,
"grad_norm": 1.140625,
"hf_loss_ratio": 1.0,
"learning_rate": 6.901387438460391e-06,
"loss": 0.9661,
"mean_token_accuracy": 0.7747901313006877,
"num_tokens": 395279049.0,
"step": 5370,
"train_ppl": 2.627785
},
{
"ce_loss": 0.9884,
"epoch": 0.7784831877294843,
"grad_norm": 1.2265625,
"hf_loss_ratio": 1.0,
"learning_rate": 6.856631359092944e-06,
"loss": 0.9884,
"mean_token_accuracy": 0.7725025109946728,
"num_tokens": 396001112.0,
"step": 5380,
"train_ppl": 2.687061
},
{
"ce_loss": 0.9704,
"epoch": 0.7799301825022157,
"grad_norm": 1.09375,
"hf_loss_ratio": 1.0,
"learning_rate": 6.811875279725496e-06,
"loss": 0.9704,
"mean_token_accuracy": 0.7769171021878719,
"num_tokens": 396728173.0,
"step": 5390,
"train_ppl": 2.638889
},
{
"ce_loss": 0.993,
"epoch": 0.781377177274947,
"grad_norm": 1.1484375,
"hf_loss_ratio": 1.0,
"learning_rate": 6.767119200358049e-06,
"loss": 0.993,
"mean_token_accuracy": 0.7736337415874004,
"num_tokens": 397449602.0,
"step": 5400,
"train_ppl": 2.69944
},
{
"ce_loss": 0.9458,
"epoch": 0.7828241720476785,
"grad_norm": 1.15625,
"hf_loss_ratio": 1.0,
"learning_rate": 6.722363120990601e-06,
"loss": 0.9458,
"mean_token_accuracy": 0.7815995380282402,
"num_tokens": 398215793.0,
"step": 5410,
"train_ppl": 2.57481
},
{
"ce_loss": 0.9971,
"epoch": 0.7842711668204099,
"grad_norm": 1.171875,
"hf_loss_ratio": 1.0,
"learning_rate": 6.677607041623154e-06,
"loss": 0.9971,
"mean_token_accuracy": 0.7720453962683678,
"num_tokens": 398935756.0,
"step": 5420,
"train_ppl": 2.710507
},
{
"ce_loss": 0.9424,
"epoch": 0.7857181615931412,
"grad_norm": 1.0234375,
"hf_loss_ratio": 1.0,
"learning_rate": 6.632850962255707e-06,
"loss": 0.9424,
"mean_token_accuracy": 0.7884068295359612,
"num_tokens": 399665412.0,
"step": 5430,
"train_ppl": 2.566172
},
{
"ce_loss": 0.9487,
"epoch": 0.7871651563658726,
"grad_norm": 1.015625,
"hf_loss_ratio": 1.0,
"learning_rate": 6.588094882888259e-06,
"loss": 0.9487,
"mean_token_accuracy": 0.7788920432329178,
"num_tokens": 400397909.0,
"step": 5440,
"train_ppl": 2.582247
},
{
"ce_loss": 0.9804,
"epoch": 0.7886121511386041,
"grad_norm": 1.0390625,
"hf_loss_ratio": 1.0,
"learning_rate": 6.543338803520812e-06,
"loss": 0.9804,
"mean_token_accuracy": 0.7754887655377388,
"num_tokens": 401128916.0,
"step": 5450,
"train_ppl": 2.665399
},
{
"ce_loss": 0.9368,
"epoch": 0.7900591459113354,
"grad_norm": 1.1015625,
"hf_loss_ratio": 1.0,
"learning_rate": 6.498582724153365e-06,
"loss": 0.9368,
"mean_token_accuracy": 0.7829912155866623,
"num_tokens": 401864725.0,
"step": 5460,
"train_ppl": 2.551742
},
{
"ce_loss": 0.914,
"epoch": 0.7915061406840668,
"grad_norm": 0.8984375,
"hf_loss_ratio": 1.0,
"learning_rate": 6.453826644785917e-06,
"loss": 0.914,
"mean_token_accuracy": 0.7870276011526585,
"num_tokens": 402619013.0,
"step": 5470,
"train_ppl": 2.49429
},
{
"ce_loss": 0.9494,
"epoch": 0.7929531354567981,
"grad_norm": 1.1953125,
"hf_loss_ratio": 1.0,
"learning_rate": 6.40907056541847e-06,
"loss": 0.9494,
"mean_token_accuracy": 0.7810823060572147,
"num_tokens": 403360148.0,
"step": 5480,
"train_ppl": 2.584185
},
{
"ce_loss": 0.9483,
"epoch": 0.7944001302295296,
"grad_norm": 0.94140625,
"hf_loss_ratio": 1.0,
"learning_rate": 6.3643144860510215e-06,
"loss": 0.9483,
"mean_token_accuracy": 0.7813143357634544,
"num_tokens": 404097450.0,
"step": 5490,
"train_ppl": 2.581417
},
{
"ce_loss": 0.9487,
"epoch": 0.795847125002261,
"grad_norm": 1.109375,
"hf_loss_ratio": 1.0,
"learning_rate": 6.319558406683575e-06,
"loss": 0.9487,
"mean_token_accuracy": 0.7773936979472638,
"num_tokens": 404828623.0,
"step": 5500,
"train_ppl": 2.582243
},
{
"ce_loss": 0.9635,
"epoch": 0.7972941197749923,
"grad_norm": 1.03125,
"hf_loss_ratio": 1.0,
"learning_rate": 6.274802327316127e-06,
"loss": 0.9635,
"mean_token_accuracy": 0.7771599672734737,
"num_tokens": 405544900.0,
"step": 5510,
"train_ppl": 2.620934
},
{
"ce_loss": 0.9981,
"epoch": 0.7987411145477237,
"grad_norm": 0.96484375,
"hf_loss_ratio": 1.0,
"learning_rate": 6.23004624794868e-06,
"loss": 0.9981,
"mean_token_accuracy": 0.7708815522491932,
"num_tokens": 406250286.0,
"step": 5520,
"train_ppl": 2.713164
},
{
"ce_loss": 0.933,
"epoch": 0.800188109320455,
"grad_norm": 1.09375,
"hf_loss_ratio": 1.0,
"learning_rate": 6.185290168581232e-06,
"loss": 0.933,
"mean_token_accuracy": 0.7810772813856601,
"num_tokens": 407002048.0,
"step": 5530,
"train_ppl": 2.542244
},
{
"ce_loss": 0.9519,
"epoch": 0.8016351040931865,
"grad_norm": 0.9453125,
"hf_loss_ratio": 1.0,
"learning_rate": 6.140534089213785e-06,
"loss": 0.9519,
"mean_token_accuracy": 0.7769171491265296,
"num_tokens": 407721865.0,
"step": 5540,
"train_ppl": 2.590526
},
{
"ce_loss": 0.9631,
"epoch": 0.8030820988659179,
"grad_norm": 1.0625,
"hf_loss_ratio": 1.0,
"learning_rate": 6.095778009846337e-06,
"loss": 0.9631,
"mean_token_accuracy": 0.7787568613886833,
"num_tokens": 408443748.0,
"step": 5550,
"train_ppl": 2.619744
},
{
"ce_loss": 0.9813,
"epoch": 0.8045290936386492,
"grad_norm": 1.1484375,
"hf_loss_ratio": 1.0,
"learning_rate": 6.05102193047889e-06,
"loss": 0.9813,
"mean_token_accuracy": 0.7767161875963211,
"num_tokens": 409181659.0,
"step": 5560,
"train_ppl": 2.667798
},
{
"ce_loss": 0.9693,
"epoch": 0.8059760884113806,
"grad_norm": 1.015625,
"hf_loss_ratio": 1.0,
"learning_rate": 6.006265851111443e-06,
"loss": 0.9693,
"mean_token_accuracy": 0.7756986141204834,
"num_tokens": 409915769.0,
"step": 5570,
"train_ppl": 2.636003
},
{
"ce_loss": 0.949,
"epoch": 0.807423083184112,
"grad_norm": 1.0625,
"hf_loss_ratio": 1.0,
"learning_rate": 5.961509771743995e-06,
"loss": 0.949,
"mean_token_accuracy": 0.7831607341766358,
"num_tokens": 410630144.0,
"step": 5580,
"train_ppl": 2.58318
},
{
"ce_loss": 0.9709,
"epoch": 0.8088700779568434,
"grad_norm": 0.953125,
"hf_loss_ratio": 1.0,
"learning_rate": 5.9167536923765485e-06,
"loss": 0.9709,
"mean_token_accuracy": 0.7774527162313462,
"num_tokens": 411368980.0,
"step": 5590,
"train_ppl": 2.640323
},
{
"ce_loss": 0.9781,
"epoch": 0.8103170727295748,
"grad_norm": 1.1171875,
"hf_loss_ratio": 1.0,
"learning_rate": 5.8719976130091e-06,
"loss": 0.9781,
"mean_token_accuracy": 0.7690740667283535,
"num_tokens": 412088296.0,
"step": 5600,
"train_ppl": 2.659381
},
{
"ce_loss": 0.9521,
"epoch": 0.8117640675023061,
"grad_norm": 1.0234375,
"hf_loss_ratio": 1.0,
"learning_rate": 5.827241533641653e-06,
"loss": 0.9521,
"mean_token_accuracy": 0.7769833728671074,
"num_tokens": 412841228.0,
"step": 5610,
"train_ppl": 2.591169
},
{
"ce_loss": 0.9835,
"epoch": 0.8132110622750375,
"grad_norm": 0.953125,
"hf_loss_ratio": 1.0,
"learning_rate": 5.782485454274206e-06,
"loss": 0.9835,
"mean_token_accuracy": 0.7742873176932334,
"num_tokens": 413566071.0,
"step": 5620,
"train_ppl": 2.673852
},
{
"ce_loss": 0.9541,
"epoch": 0.814658057047769,
"grad_norm": 0.98046875,
"hf_loss_ratio": 1.0,
"learning_rate": 5.737729374906758e-06,
"loss": 0.9541,
"mean_token_accuracy": 0.7803828045725822,
"num_tokens": 414300956.0,
"step": 5630,
"train_ppl": 2.596387
},
{
"ce_loss": 0.9433,
"epoch": 0.8161050518205003,
"grad_norm": 1.1796875,
"hf_loss_ratio": 1.0,
"learning_rate": 5.692973295539311e-06,
"loss": 0.9433,
"mean_token_accuracy": 0.7835976503789425,
"num_tokens": 415039032.0,
"step": 5640,
"train_ppl": 2.568448
},
{
"ce_loss": 0.9447,
"epoch": 0.8175520465932317,
"grad_norm": 1.359375,
"hf_loss_ratio": 1.0,
"learning_rate": 5.648217216171864e-06,
"loss": 0.9447,
"mean_token_accuracy": 0.7802014254033566,
"num_tokens": 415767715.0,
"step": 5650,
"train_ppl": 2.572132
},
{
"ce_loss": 0.9441,
"epoch": 0.818999041365963,
"grad_norm": 0.96875,
"hf_loss_ratio": 1.0,
"learning_rate": 5.603461136804416e-06,
"loss": 0.9441,
"mean_token_accuracy": 0.7781417928636074,
"num_tokens": 416488092.0,
"step": 5660,
"train_ppl": 2.57039
},
{
"ce_loss": 0.9421,
"epoch": 0.8204460361386945,
"grad_norm": 1.0,
"hf_loss_ratio": 1.0,
"learning_rate": 5.558705057436969e-06,
"loss": 0.9421,
"mean_token_accuracy": 0.7813565135002136,
"num_tokens": 417257450.0,
"step": 5670,
"train_ppl": 2.565343
},
{
"ce_loss": 0.9452,
"epoch": 0.8218930309114258,
"grad_norm": 1.0390625,
"hf_loss_ratio": 1.0,
"learning_rate": 5.513948978069521e-06,
"loss": 0.9452,
"mean_token_accuracy": 0.7794762089848518,
"num_tokens": 417990179.0,
"step": 5680,
"train_ppl": 2.573453
},
{
"ce_loss": 0.9678,
"epoch": 0.8233400256841572,
"grad_norm": 1.0546875,
"hf_loss_ratio": 1.0,
"learning_rate": 5.469192898702074e-06,
"loss": 0.9678,
"mean_token_accuracy": 0.774018281698227,
"num_tokens": 418715129.0,
"step": 5690,
"train_ppl": 2.632052
},
{
"ce_loss": 0.9779,
"epoch": 0.8247870204568886,
"grad_norm": 0.984375,
"hf_loss_ratio": 1.0,
"learning_rate": 5.424436819334626e-06,
"loss": 0.9779,
"mean_token_accuracy": 0.7748581573367119,
"num_tokens": 419427338.0,
"step": 5700,
"train_ppl": 2.658952
},
{
"ce_loss": 0.9699,
"epoch": 0.82623401522962,
"grad_norm": 0.9296875,
"hf_loss_ratio": 1.0,
"learning_rate": 5.379680739967179e-06,
"loss": 0.9699,
"mean_token_accuracy": 0.7738823585212231,
"num_tokens": 420154243.0,
"step": 5710,
"train_ppl": 2.63778
},
{
"ce_loss": 0.9736,
"epoch": 0.8276810100023514,
"grad_norm": 0.9921875,
"hf_loss_ratio": 1.0,
"learning_rate": 5.334924660599731e-06,
"loss": 0.9736,
"mean_token_accuracy": 0.7746640965342522,
"num_tokens": 420886232.0,
"step": 5720,
"train_ppl": 2.64758
},
{
"ce_loss": 0.9375,
"epoch": 0.8291280047750827,
"grad_norm": 0.98828125,
"hf_loss_ratio": 1.0,
"learning_rate": 5.290168581232284e-06,
"loss": 0.9375,
"mean_token_accuracy": 0.7802526973187923,
"num_tokens": 421614581.0,
"step": 5730,
"train_ppl": 2.553698
},
{
"ce_loss": 0.9554,
"epoch": 0.8305749995478141,
"grad_norm": 0.9296875,
"hf_loss_ratio": 1.0,
"learning_rate": 5.245412501864837e-06,
"loss": 0.9554,
"mean_token_accuracy": 0.7804835855960846,
"num_tokens": 422341792.0,
"step": 5740,
"train_ppl": 2.599622
},
{
"ce_loss": 0.9732,
"epoch": 0.8320219943205455,
"grad_norm": 1.140625,
"hf_loss_ratio": 1.0,
"learning_rate": 5.200656422497389e-06,
"loss": 0.9732,
"mean_token_accuracy": 0.7791908659040928,
"num_tokens": 423060466.0,
"step": 5750,
"train_ppl": 2.64629
},
{
"ce_loss": 0.9559,
"epoch": 0.8334689890932769,
"grad_norm": 1.03125,
"hf_loss_ratio": 1.0,
"learning_rate": 5.155900343129943e-06,
"loss": 0.9559,
"mean_token_accuracy": 0.7781409621238708,
"num_tokens": 423782605.0,
"step": 5760,
"train_ppl": 2.601
},
{
"ce_loss": 0.9811,
"epoch": 0.8349159838660083,
"grad_norm": 1.140625,
"hf_loss_ratio": 1.0,
"learning_rate": 5.111144263762494e-06,
"loss": 0.9811,
"mean_token_accuracy": 0.7751675873994828,
"num_tokens": 424502076.0,
"step": 5770,
"train_ppl": 2.667354
},
{
"ce_loss": 1.0067,
"epoch": 0.8363629786387397,
"grad_norm": 1.1796875,
"hf_loss_ratio": 1.0,
"learning_rate": 5.0663881843950475e-06,
"loss": 1.0067,
"mean_token_accuracy": 0.7735206983983517,
"num_tokens": 425218196.0,
"step": 5780,
"train_ppl": 2.73669
},
{
"ce_loss": 0.9582,
"epoch": 0.837809973411471,
"grad_norm": 0.859375,
"hf_loss_ratio": 1.0,
"learning_rate": 5.0216321050276e-06,
"loss": 0.9582,
"mean_token_accuracy": 0.7766490906476975,
"num_tokens": 425984680.0,
"step": 5790,
"train_ppl": 2.607062
},
{
"ce_loss": 0.9832,
"epoch": 0.8392569681842025,
"grad_norm": 1.1875,
"hf_loss_ratio": 1.0,
"learning_rate": 4.976876025660152e-06,
"loss": 0.9832,
"mean_token_accuracy": 0.7742396548390389,
"num_tokens": 426712707.0,
"step": 5800,
"train_ppl": 2.673103
},
{
"ce_loss": 1.0091,
"epoch": 0.8407039629569338,
"grad_norm": 1.078125,
"hf_loss_ratio": 1.0,
"learning_rate": 4.932119946292705e-06,
"loss": 1.0091,
"mean_token_accuracy": 0.7674178771674633,
"num_tokens": 427433528.0,
"step": 5810,
"train_ppl": 2.743111
},
{
"ce_loss": 0.937,
"epoch": 0.8421509577296652,
"grad_norm": 0.9296875,
"hf_loss_ratio": 1.0,
"learning_rate": 4.887363866925257e-06,
"loss": 0.937,
"mean_token_accuracy": 0.7804404981434345,
"num_tokens": 428172138.0,
"step": 5820,
"train_ppl": 2.55243
},
{
"ce_loss": 0.9125,
"epoch": 0.8435979525023966,
"grad_norm": 1.1875,
"hf_loss_ratio": 1.0,
"learning_rate": 4.84260778755781e-06,
"loss": 0.9125,
"mean_token_accuracy": 0.7849298395216465,
"num_tokens": 428911668.0,
"step": 5830,
"train_ppl": 2.490453
},
{
"ce_loss": 0.9878,
"epoch": 0.845044947275128,
"grad_norm": 0.97265625,
"hf_loss_ratio": 1.0,
"learning_rate": 4.797851708190363e-06,
"loss": 0.9878,
"mean_token_accuracy": 0.7694531783461571,
"num_tokens": 429645052.0,
"step": 5840,
"train_ppl": 2.685387
},
{
"ce_loss": 0.9736,
"epoch": 0.8464919420478594,
"grad_norm": 1.1953125,
"hf_loss_ratio": 1.0,
"learning_rate": 4.753095628822915e-06,
"loss": 0.9736,
"mean_token_accuracy": 0.7751254610717296,
"num_tokens": 430378612.0,
"step": 5850,
"train_ppl": 2.64755
},
{
"ce_loss": 0.9663,
"epoch": 0.8479389368205907,
"grad_norm": 1.171875,
"hf_loss_ratio": 1.0,
"learning_rate": 4.708339549455468e-06,
"loss": 0.9663,
"mean_token_accuracy": 0.7708243384957314,
"num_tokens": 431064544.0,
"step": 5860,
"train_ppl": 2.628303
},
{
"ce_loss": 0.9792,
"epoch": 0.8493859315933221,
"grad_norm": 1.0625,
"hf_loss_ratio": 1.0,
"learning_rate": 4.66358347008802e-06,
"loss": 0.9792,
"mean_token_accuracy": 0.7783576816320419,
"num_tokens": 431809385.0,
"step": 5870,
"train_ppl": 2.662384
},
{
"ce_loss": 0.9809,
"epoch": 0.8508329263660535,
"grad_norm": 1.15625,
"hf_loss_ratio": 1.0,
"learning_rate": 4.618827390720573e-06,
"loss": 0.9809,
"mean_token_accuracy": 0.7732638500630855,
"num_tokens": 432564699.0,
"step": 5880,
"train_ppl": 2.666948
},
{
"ce_loss": 0.9614,
"epoch": 0.8522799211387849,
"grad_norm": 1.171875,
"hf_loss_ratio": 1.0,
"learning_rate": 4.574071311353125e-06,
"loss": 0.9614,
"mean_token_accuracy": 0.7784347735345364,
"num_tokens": 433285549.0,
"step": 5890,
"train_ppl": 2.615387
},
{
"ce_loss": 0.9669,
"epoch": 0.8537269159115163,
"grad_norm": 1.109375,
"hf_loss_ratio": 1.0,
"learning_rate": 4.5293152319856785e-06,
"loss": 0.9669,
"mean_token_accuracy": 0.7765318714082241,
"num_tokens": 434017224.0,
"step": 5900,
"train_ppl": 2.62971
},
{
"ce_loss": 0.9632,
"epoch": 0.8551739106842476,
"grad_norm": 1.0,
"hf_loss_ratio": 1.0,
"learning_rate": 4.484559152618231e-06,
"loss": 0.9632,
"mean_token_accuracy": 0.7763010829687118,
"num_tokens": 434766145.0,
"step": 5910,
"train_ppl": 2.620017
},
{
"ce_loss": 0.9542,
"epoch": 0.856620905456979,
"grad_norm": 1.0,
"hf_loss_ratio": 1.0,
"learning_rate": 4.4398030732507834e-06,
"loss": 0.9542,
"mean_token_accuracy": 0.780161052197218,
"num_tokens": 435503031.0,
"step": 5920,
"train_ppl": 2.596702
},
{
"ce_loss": 0.9372,
"epoch": 0.8580679002297105,
"grad_norm": 1.015625,
"hf_loss_ratio": 1.0,
"learning_rate": 4.395046993883336e-06,
"loss": 0.9372,
"mean_token_accuracy": 0.7774905152618885,
"num_tokens": 436240735.0,
"step": 5930,
"train_ppl": 2.552895
},
{
"ce_loss": 0.9657,
"epoch": 0.8595148950024418,
"grad_norm": 1.0859375,
"hf_loss_ratio": 1.0,
"learning_rate": 4.350290914515888e-06,
"loss": 0.9657,
"mean_token_accuracy": 0.776423779129982,
"num_tokens": 436981949.0,
"step": 5940,
"train_ppl": 2.62665
},
{
"ce_loss": 0.9574,
"epoch": 0.8609618897751732,
"grad_norm": 1.1015625,
"hf_loss_ratio": 1.0,
"learning_rate": 4.305534835148442e-06,
"loss": 0.9574,
"mean_token_accuracy": 0.7750987179577351,
"num_tokens": 437750102.0,
"step": 5950,
"train_ppl": 2.605002
},
{
"ce_loss": 0.9409,
"epoch": 0.8624088845479045,
"grad_norm": 0.984375,
"hf_loss_ratio": 1.0,
"learning_rate": 4.260778755780993e-06,
"loss": 0.9409,
"mean_token_accuracy": 0.7818285569548606,
"num_tokens": 438508119.0,
"step": 5960,
"train_ppl": 2.562181
},
{
"ce_loss": 1.0036,
"epoch": 0.8638558793206359,
"grad_norm": 1.1796875,
"hf_loss_ratio": 1.0,
"learning_rate": 4.2160226764135465e-06,
"loss": 1.0036,
"mean_token_accuracy": 0.767191369086504,
"num_tokens": 439276410.0,
"step": 5970,
"train_ppl": 2.727961
},
{
"ce_loss": 0.9487,
"epoch": 0.8653028740933674,
"grad_norm": 0.89453125,
"hf_loss_ratio": 1.0,
"learning_rate": 4.171266597046099e-06,
"loss": 0.9487,
"mean_token_accuracy": 0.7764919579029084,
"num_tokens": 440026754.0,
"step": 5980,
"train_ppl": 2.582388
},
{
"ce_loss": 0.971,
"epoch": 0.8667498688660987,
"grad_norm": 1.046875,
"hf_loss_ratio": 1.0,
"learning_rate": 4.126510517678651e-06,
"loss": 0.971,
"mean_token_accuracy": 0.7749002501368523,
"num_tokens": 440761601.0,
"step": 5990,
"train_ppl": 2.640495
},
{
"ce_loss": 0.9995,
"epoch": 0.8681968636388301,
"grad_norm": 1.171875,
"hf_loss_ratio": 1.0,
"learning_rate": 4.081754438311204e-06,
"loss": 0.9995,
"mean_token_accuracy": 0.7680262356996537,
"num_tokens": 441480022.0,
"step": 6000,
"train_ppl": 2.716909
},
{
"ce_loss": 0.9768,
"epoch": 0.8696438584115614,
"grad_norm": 0.98828125,
"hf_loss_ratio": 1.0,
"learning_rate": 4.036998358943757e-06,
"loss": 0.9768,
"mean_token_accuracy": 0.7749585300683975,
"num_tokens": 442223925.0,
"step": 6010,
"train_ppl": 2.65607
},
{
"ce_loss": 0.9682,
"epoch": 0.8710908531842929,
"grad_norm": 1.0546875,
"hf_loss_ratio": 1.0,
"learning_rate": 3.992242279576309e-06,
"loss": 0.9682,
"mean_token_accuracy": 0.7721332833170891,
"num_tokens": 442962668.0,
"step": 6020,
"train_ppl": 2.63316
},
{
"ce_loss": 0.983,
"epoch": 0.8725378479570243,
"grad_norm": 1.0546875,
"hf_loss_ratio": 1.0,
"learning_rate": 3.947486200208862e-06,
"loss": 0.983,
"mean_token_accuracy": 0.7761274553835392,
"num_tokens": 443689137.0,
"step": 6030,
"train_ppl": 2.672528
},
{
"ce_loss": 0.9732,
"epoch": 0.8739848427297556,
"grad_norm": 1.046875,
"hf_loss_ratio": 1.0,
"learning_rate": 3.902730120841414e-06,
"loss": 0.9732,
"mean_token_accuracy": 0.7740906737744808,
"num_tokens": 444401316.0,
"step": 6040,
"train_ppl": 2.646453
},
{
"ce_loss": 0.9723,
"epoch": 0.875431837502487,
"grad_norm": 1.046875,
"hf_loss_ratio": 1.0,
"learning_rate": 3.857974041473967e-06,
"loss": 0.9723,
"mean_token_accuracy": 0.7794286720454693,
"num_tokens": 445116577.0,
"step": 6050,
"train_ppl": 2.643935
},
{
"ce_loss": 0.9684,
"epoch": 0.8768788322752185,
"grad_norm": 1.171875,
"hf_loss_ratio": 1.0,
"learning_rate": 3.81321796210652e-06,
"loss": 0.9684,
"mean_token_accuracy": 0.7808907024562359,
"num_tokens": 445876002.0,
"step": 6060,
"train_ppl": 2.633708
},
{
"ce_loss": 0.9711,
"epoch": 0.8783258270479498,
"grad_norm": 1.0078125,
"hf_loss_ratio": 1.0,
"learning_rate": 3.7684618827390723e-06,
"loss": 0.9711,
"mean_token_accuracy": 0.7762280680239201,
"num_tokens": 446605260.0,
"step": 6070,
"train_ppl": 2.640865
},
{
"ce_loss": 0.95,
"epoch": 0.8797728218206812,
"grad_norm": 1.0625,
"hf_loss_ratio": 1.0,
"learning_rate": 3.7237058033716247e-06,
"loss": 0.95,
"mean_token_accuracy": 0.7792424105107785,
"num_tokens": 447358325.0,
"step": 6080,
"train_ppl": 2.585616
},
{
"ce_loss": 0.959,
"epoch": 0.8812198165934125,
"grad_norm": 1.1171875,
"hf_loss_ratio": 1.0,
"learning_rate": 3.678949724004177e-06,
"loss": 0.959,
"mean_token_accuracy": 0.7746827162802219,
"num_tokens": 448100945.0,
"step": 6090,
"train_ppl": 2.609138
},
{
"ce_loss": 0.9417,
"epoch": 0.8826668113661439,
"grad_norm": 0.8671875,
"hf_loss_ratio": 1.0,
"learning_rate": 3.6341936446367296e-06,
"loss": 0.9417,
"mean_token_accuracy": 0.7761165231466294,
"num_tokens": 448857359.0,
"step": 6100,
"train_ppl": 2.564342
},
{
"ce_loss": 0.9845,
"epoch": 0.8841138061388754,
"grad_norm": 1.1796875,
"hf_loss_ratio": 1.0,
"learning_rate": 3.5894375652692825e-06,
"loss": 0.9845,
"mean_token_accuracy": 0.7675826340913773,
"num_tokens": 449575975.0,
"step": 6110,
"train_ppl": 2.67659
},
{
"ce_loss": 0.964,
"epoch": 0.8855608009116067,
"grad_norm": 1.109375,
"hf_loss_ratio": 1.0,
"learning_rate": 3.544681485901835e-06,
"loss": 0.964,
"mean_token_accuracy": 0.7789463967084884,
"num_tokens": 450301560.0,
"step": 6120,
"train_ppl": 2.622228
},
{
"ce_loss": 0.9757,
"epoch": 0.8870077956843381,
"grad_norm": 1.046875,
"hf_loss_ratio": 1.0,
"learning_rate": 3.4999254065343874e-06,
"loss": 0.9757,
"mean_token_accuracy": 0.7748393803834915,
"num_tokens": 451046846.0,
"step": 6130,
"train_ppl": 2.652971
},
{
"ce_loss": 0.9732,
"epoch": 0.8884547904570694,
"grad_norm": 1.046875,
"hf_loss_ratio": 1.0,
"learning_rate": 3.4551693271669406e-06,
"loss": 0.9732,
"mean_token_accuracy": 0.7820017896592617,
"num_tokens": 451811972.0,
"step": 6140,
"train_ppl": 2.646348
},
{
"ce_loss": 0.9461,
"epoch": 0.8899017852298009,
"grad_norm": 1.0546875,
"hf_loss_ratio": 1.0,
"learning_rate": 3.410413247799493e-06,
"loss": 0.9461,
"mean_token_accuracy": 0.7822142690420151,
"num_tokens": 452565156.0,
"step": 6150,
"train_ppl": 2.575566
},
{
"ce_loss": 1.0128,
"epoch": 0.8913487800025323,
"grad_norm": 1.09375,
"hf_loss_ratio": 1.0,
"learning_rate": 3.3656571684320455e-06,
"loss": 1.0128,
"mean_token_accuracy": 0.7665348842740058,
"num_tokens": 453300539.0,
"step": 6160,
"train_ppl": 2.753163
},
{
"ce_loss": 0.9794,
"epoch": 0.8927957747752636,
"grad_norm": 1.2578125,
"hf_loss_ratio": 1.0,
"learning_rate": 3.320901089064598e-06,
"loss": 0.9794,
"mean_token_accuracy": 0.7745142556726933,
"num_tokens": 454032470.0,
"step": 6170,
"train_ppl": 2.66287
},
{
"ce_loss": 0.9568,
"epoch": 0.894242769547995,
"grad_norm": 0.96875,
"hf_loss_ratio": 1.0,
"learning_rate": 3.276145009697151e-06,
"loss": 0.9568,
"mean_token_accuracy": 0.7779201343655586,
"num_tokens": 454766140.0,
"step": 6180,
"train_ppl": 2.603474
},
{
"ce_loss": 0.9672,
"epoch": 0.8956897643207264,
"grad_norm": 0.9921875,
"hf_loss_ratio": 1.0,
"learning_rate": 3.2313889303297033e-06,
"loss": 0.9672,
"mean_token_accuracy": 0.7766256541013717,
"num_tokens": 455497600.0,
"step": 6190,
"train_ppl": 2.630683
},
{
"ce_loss": 0.9608,
"epoch": 0.8971367590934578,
"grad_norm": 1.125,
"hf_loss_ratio": 1.0,
"learning_rate": 3.1866328509622557e-06,
"loss": 0.9608,
"mean_token_accuracy": 0.7783399567008018,
"num_tokens": 456213968.0,
"step": 6200,
"train_ppl": 2.613881
},
{
"ce_loss": 0.989,
"epoch": 0.8985837538661892,
"grad_norm": 1.046875,
"hf_loss_ratio": 1.0,
"learning_rate": 3.141876771594808e-06,
"loss": 0.989,
"mean_token_accuracy": 0.7722627222537994,
"num_tokens": 456980565.0,
"step": 6210,
"train_ppl": 2.688524
},
{
"ce_loss": 0.9211,
"epoch": 0.9000307486389205,
"grad_norm": 0.90625,
"hf_loss_ratio": 1.0,
"learning_rate": 3.097120692227361e-06,
"loss": 0.9211,
"mean_token_accuracy": 0.785981647670269,
"num_tokens": 457749115.0,
"step": 6220,
"train_ppl": 2.511994
},
{
"ce_loss": 0.9593,
"epoch": 0.9014777434116519,
"grad_norm": 0.9296875,
"hf_loss_ratio": 1.0,
"learning_rate": 3.0523646128599135e-06,
"loss": 0.9593,
"mean_token_accuracy": 0.7805201202630997,
"num_tokens": 458489401.0,
"step": 6230,
"train_ppl": 2.609812
},
{
"ce_loss": 0.9827,
"epoch": 0.9029247381843833,
"grad_norm": 0.953125,
"hf_loss_ratio": 1.0,
"learning_rate": 3.007608533492466e-06,
"loss": 0.9827,
"mean_token_accuracy": 0.7736832290887833,
"num_tokens": 459226574.0,
"step": 6240,
"train_ppl": 2.671592
},
{
"ce_loss": 0.9776,
"epoch": 0.9043717329571147,
"grad_norm": 1.0703125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.962852454125019e-06,
"loss": 0.9776,
"mean_token_accuracy": 0.776441466808319,
"num_tokens": 459960745.0,
"step": 6250,
"train_ppl": 2.658195
},
{
"ce_loss": 0.9535,
"epoch": 0.9058187277298461,
"grad_norm": 0.9609375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.9180963747575713e-06,
"loss": 0.9535,
"mean_token_accuracy": 0.7777935616672039,
"num_tokens": 460692141.0,
"step": 6260,
"train_ppl": 2.594836
},
{
"ce_loss": 0.9883,
"epoch": 0.9072657225025774,
"grad_norm": 1.0234375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.8733402953901237e-06,
"loss": 0.9883,
"mean_token_accuracy": 0.7695657543838024,
"num_tokens": 461408471.0,
"step": 6270,
"train_ppl": 2.686754
},
{
"ce_loss": 0.9433,
"epoch": 0.9087127172753089,
"grad_norm": 0.921875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.828584216022676e-06,
"loss": 0.9433,
"mean_token_accuracy": 0.780649583786726,
"num_tokens": 462170112.0,
"step": 6280,
"train_ppl": 2.568511
},
{
"ce_loss": 0.9745,
"epoch": 0.9101597120480402,
"grad_norm": 1.1328125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.783828136655229e-06,
"loss": 0.9745,
"mean_token_accuracy": 0.7758511275053024,
"num_tokens": 462877827.0,
"step": 6290,
"train_ppl": 2.64988
},
{
"ce_loss": 0.9634,
"epoch": 0.9116067068207716,
"grad_norm": 0.984375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.739072057287782e-06,
"loss": 0.9634,
"mean_token_accuracy": 0.7743300221860409,
"num_tokens": 463601430.0,
"step": 6300,
"train_ppl": 2.620472
},
{
"ce_loss": 0.9451,
"epoch": 0.913053701593503,
"grad_norm": 1.015625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.6943159779203344e-06,
"loss": 0.9451,
"mean_token_accuracy": 0.7799232237040996,
"num_tokens": 464318344.0,
"step": 6310,
"train_ppl": 2.572968
},
{
"ce_loss": 0.9682,
"epoch": 0.9145006963662343,
"grad_norm": 0.94921875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.649559898552887e-06,
"loss": 0.9682,
"mean_token_accuracy": 0.7786154381930828,
"num_tokens": 465051370.0,
"step": 6320,
"train_ppl": 2.633079
},
{
"ce_loss": 0.9604,
"epoch": 0.9159476911389658,
"grad_norm": 0.9296875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.6048038191854397e-06,
"loss": 0.9604,
"mean_token_accuracy": 0.7759640254080296,
"num_tokens": 465801154.0,
"step": 6330,
"train_ppl": 2.612643
},
{
"ce_loss": 0.9521,
"epoch": 0.9173946859116971,
"grad_norm": 1.03125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.560047739817992e-06,
"loss": 0.9521,
"mean_token_accuracy": 0.7819162972271443,
"num_tokens": 466570155.0,
"step": 6340,
"train_ppl": 2.591263
},
{
"ce_loss": 0.9604,
"epoch": 0.9188416806844285,
"grad_norm": 1.046875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.5152916604505446e-06,
"loss": 0.9604,
"mean_token_accuracy": 0.7824667453765869,
"num_tokens": 467322541.0,
"step": 6350,
"train_ppl": 2.612788
},
{
"ce_loss": 0.9365,
"epoch": 0.9202886754571599,
"grad_norm": 1.0625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.470535581083097e-06,
"loss": 0.9365,
"mean_token_accuracy": 0.7835808910429478,
"num_tokens": 468075229.0,
"step": 6360,
"train_ppl": 2.550947
},
{
"ce_loss": 0.9473,
"epoch": 0.9217356702298913,
"grad_norm": 0.9609375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.42577950171565e-06,
"loss": 0.9473,
"mean_token_accuracy": 0.77774076461792,
"num_tokens": 468820005.0,
"step": 6370,
"train_ppl": 2.578614
},
{
"ce_loss": 0.9618,
"epoch": 0.9231826650026227,
"grad_norm": 1.0390625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.3810234223482023e-06,
"loss": 0.9618,
"mean_token_accuracy": 0.7733399920165539,
"num_tokens": 469537339.0,
"step": 6380,
"train_ppl": 2.616365
},
{
"ce_loss": 0.9568,
"epoch": 0.924629659775354,
"grad_norm": 0.95703125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.3362673429807548e-06,
"loss": 0.9568,
"mean_token_accuracy": 0.7792744718492031,
"num_tokens": 470264281.0,
"step": 6390,
"train_ppl": 2.603469
},
{
"ce_loss": 0.9704,
"epoch": 0.9260766545480854,
"grad_norm": 1.0546875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.2915112636133076e-06,
"loss": 0.9704,
"mean_token_accuracy": 0.7776748731732368,
"num_tokens": 470997935.0,
"step": 6400,
"train_ppl": 2.639119
},
{
"ce_loss": 0.9537,
"epoch": 0.9275236493208169,
"grad_norm": 1.015625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.24675518424586e-06,
"loss": 0.9537,
"mean_token_accuracy": 0.7739205956459045,
"num_tokens": 471749710.0,
"step": 6410,
"train_ppl": 2.595221
},
{
"ce_loss": 0.9648,
"epoch": 0.9289706440935482,
"grad_norm": 1.0234375,
"hf_loss_ratio": 1.0,
"learning_rate": 2.2019991048784125e-06,
"loss": 0.9648,
"mean_token_accuracy": 0.7769439205527305,
"num_tokens": 472473330.0,
"step": 6420,
"train_ppl": 2.624186
},
{
"ce_loss": 0.9727,
"epoch": 0.9304176388662796,
"grad_norm": 0.96875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.157243025510965e-06,
"loss": 0.9727,
"mean_token_accuracy": 0.771061759442091,
"num_tokens": 473203701.0,
"step": 6430,
"train_ppl": 2.645201
},
{
"ce_loss": 0.9369,
"epoch": 0.931864633639011,
"grad_norm": 1.1796875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.112486946143518e-06,
"loss": 0.9369,
"mean_token_accuracy": 0.7875291585922242,
"num_tokens": 473951304.0,
"step": 6440,
"train_ppl": 2.551984
},
{
"ce_loss": 0.963,
"epoch": 0.9333116284117423,
"grad_norm": 1.1171875,
"hf_loss_ratio": 1.0,
"learning_rate": 2.0677308667760703e-06,
"loss": 0.963,
"mean_token_accuracy": 0.7799215823411941,
"num_tokens": 474681697.0,
"step": 6450,
"train_ppl": 2.619448
},
{
"ce_loss": 0.9581,
"epoch": 0.9347586231844738,
"grad_norm": 1.0625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.022974787408623e-06,
"loss": 0.9581,
"mean_token_accuracy": 0.7823777303099633,
"num_tokens": 475396883.0,
"step": 6460,
"train_ppl": 2.606745
},
{
"ce_loss": 0.9942,
"epoch": 0.9362056179572051,
"grad_norm": 1.1015625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.9782187080411756e-06,
"loss": 0.9942,
"mean_token_accuracy": 0.7746273078024387,
"num_tokens": 476110094.0,
"step": 6470,
"train_ppl": 2.702625
},
{
"ce_loss": 0.954,
"epoch": 0.9376526127299365,
"grad_norm": 1.0546875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.9334626286737285e-06,
"loss": 0.954,
"mean_token_accuracy": 0.7780710026621819,
"num_tokens": 476856061.0,
"step": 6480,
"train_ppl": 2.59616
},
{
"ce_loss": 0.9533,
"epoch": 0.9390996075026679,
"grad_norm": 1.09375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.888706549306281e-06,
"loss": 0.9533,
"mean_token_accuracy": 0.7776739954948425,
"num_tokens": 477582700.0,
"step": 6490,
"train_ppl": 2.594139
},
{
"ce_loss": 0.9816,
"epoch": 0.9405466022753993,
"grad_norm": 1.046875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.8439504699388336e-06,
"loss": 0.9816,
"mean_token_accuracy": 0.774020179361105,
"num_tokens": 478295644.0,
"step": 6500,
"train_ppl": 2.66881
},
{
"ce_loss": 0.9186,
"epoch": 0.9419935970481307,
"grad_norm": 0.98046875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.799194390571386e-06,
"loss": 0.9186,
"mean_token_accuracy": 0.7841186247766018,
"num_tokens": 479045896.0,
"step": 6510,
"train_ppl": 2.505872
},
{
"ce_loss": 0.956,
"epoch": 0.943440591820862,
"grad_norm": 1.0859375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.7544383112039387e-06,
"loss": 0.956,
"mean_token_accuracy": 0.7821230754256249,
"num_tokens": 479771982.0,
"step": 6520,
"train_ppl": 2.601145
},
{
"ce_loss": 0.962,
"epoch": 0.9448875865935934,
"grad_norm": 1.1171875,
"hf_loss_ratio": 1.0,
"learning_rate": 1.7096822318364911e-06,
"loss": 0.962,
"mean_token_accuracy": 0.7803165823221206,
"num_tokens": 480534412.0,
"step": 6530,
"train_ppl": 2.616837
},
{
"ce_loss": 0.9292,
"epoch": 0.9463345813663249,
"grad_norm": 1.09375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.6649261524690438e-06,
"loss": 0.9292,
"mean_token_accuracy": 0.7858192339539528,
"num_tokens": 481283576.0,
"step": 6540,
"train_ppl": 2.53254
},
{
"ce_loss": 0.9411,
"epoch": 0.9477815761390562,
"grad_norm": 1.1640625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.6201700731015962e-06,
"loss": 0.9411,
"mean_token_accuracy": 0.7775696411728859,
"num_tokens": 482029882.0,
"step": 6550,
"train_ppl": 2.562835
},
{
"ce_loss": 0.9532,
"epoch": 0.9492285709117876,
"grad_norm": 1.0703125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.575413993734149e-06,
"loss": 0.9532,
"mean_token_accuracy": 0.7774538859724999,
"num_tokens": 482773749.0,
"step": 6560,
"train_ppl": 2.594032
},
{
"ce_loss": 1.0142,
"epoch": 0.9506755656845189,
"grad_norm": 1.0859375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.5306579143667016e-06,
"loss": 1.0142,
"mean_token_accuracy": 0.7689271204173564,
"num_tokens": 483502307.0,
"step": 6570,
"train_ppl": 2.757271
},
{
"ce_loss": 0.9734,
"epoch": 0.9521225604572503,
"grad_norm": 0.92578125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.4859018349992542e-06,
"loss": 0.9734,
"mean_token_accuracy": 0.7774414747953415,
"num_tokens": 484237741.0,
"step": 6580,
"train_ppl": 2.646816
},
{
"ce_loss": 0.9492,
"epoch": 0.9535695552299818,
"grad_norm": 1.0234375,
"hf_loss_ratio": 1.0,
"learning_rate": 1.4411457556318067e-06,
"loss": 0.9492,
"mean_token_accuracy": 0.7777016542851924,
"num_tokens": 484965896.0,
"step": 6590,
"train_ppl": 2.583514
},
{
"ce_loss": 0.9268,
"epoch": 0.9550165500027131,
"grad_norm": 1.125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.3963896762643593e-06,
"loss": 0.9268,
"mean_token_accuracy": 0.783556516468525,
"num_tokens": 485698087.0,
"step": 6600,
"train_ppl": 2.526361
},
{
"ce_loss": 0.9347,
"epoch": 0.9564635447754445,
"grad_norm": 0.89453125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.3516335968969118e-06,
"loss": 0.9347,
"mean_token_accuracy": 0.780432254821062,
"num_tokens": 486457104.0,
"step": 6610,
"train_ppl": 2.546429
},
{
"ce_loss": 1.0135,
"epoch": 0.9579105395481758,
"grad_norm": 1.0625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.3068775175294644e-06,
"loss": 1.0135,
"mean_token_accuracy": 0.7681482747197151,
"num_tokens": 487180072.0,
"step": 6620,
"train_ppl": 2.75519
},
{
"ce_loss": 0.9701,
"epoch": 0.9593575343209073,
"grad_norm": 1.140625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.262121438162017e-06,
"loss": 0.9701,
"mean_token_accuracy": 0.7749063238501549,
"num_tokens": 487910962.0,
"step": 6630,
"train_ppl": 2.638147
},
{
"ce_loss": 0.9673,
"epoch": 0.9608045290936387,
"grad_norm": 1.140625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.2173653587945695e-06,
"loss": 0.9673,
"mean_token_accuracy": 0.7772574447095394,
"num_tokens": 488651402.0,
"step": 6640,
"train_ppl": 2.630719
},
{
"ce_loss": 0.9763,
"epoch": 0.96225152386637,
"grad_norm": 0.90625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.1726092794271224e-06,
"loss": 0.9763,
"mean_token_accuracy": 0.7743536755442619,
"num_tokens": 489384716.0,
"step": 6650,
"train_ppl": 2.654588
},
{
"ce_loss": 0.9938,
"epoch": 0.9636985186391014,
"grad_norm": 1.2578125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.1278532000596748e-06,
"loss": 0.9938,
"mean_token_accuracy": 0.7713238671422005,
"num_tokens": 490102736.0,
"step": 6660,
"train_ppl": 2.701489
},
{
"ce_loss": 0.9418,
"epoch": 0.9651455134118327,
"grad_norm": 1.0078125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.0830971206922275e-06,
"loss": 0.9418,
"mean_token_accuracy": 0.7814336843788624,
"num_tokens": 490846680.0,
"step": 6670,
"train_ppl": 2.564615
},
{
"ce_loss": 0.9167,
"epoch": 0.9665925081845642,
"grad_norm": 1.125,
"hf_loss_ratio": 1.0,
"learning_rate": 1.03834104132478e-06,
"loss": 0.9167,
"mean_token_accuracy": 0.7847115240991116,
"num_tokens": 491610969.0,
"step": 6680,
"train_ppl": 2.500937
},
{
"ce_loss": 0.935,
"epoch": 0.9680395029572956,
"grad_norm": 0.99609375,
"hf_loss_ratio": 1.0,
"learning_rate": 9.935849619573326e-07,
"loss": 0.935,
"mean_token_accuracy": 0.7818123020231724,
"num_tokens": 492324309.0,
"step": 6690,
"train_ppl": 2.547313
},
{
"ce_loss": 0.9192,
"epoch": 0.9694864977300269,
"grad_norm": 0.9453125,
"hf_loss_ratio": 1.0,
"learning_rate": 9.488288825898852e-07,
"loss": 0.9192,
"mean_token_accuracy": 0.785324689000845,
"num_tokens": 493060014.0,
"step": 6700,
"train_ppl": 2.507398
},
{
"ce_loss": 0.942,
"epoch": 0.9709334925027583,
"grad_norm": 0.90234375,
"hf_loss_ratio": 1.0,
"learning_rate": 9.040728032224378e-07,
"loss": 0.942,
"mean_token_accuracy": 0.7809490516781807,
"num_tokens": 493814561.0,
"step": 6710,
"train_ppl": 2.5651
},
{
"ce_loss": 0.9721,
"epoch": 0.9723804872754898,
"grad_norm": 0.98828125,
"hf_loss_ratio": 1.0,
"learning_rate": 8.593167238549904e-07,
"loss": 0.9721,
"mean_token_accuracy": 0.7768593326210975,
"num_tokens": 494565870.0,
"step": 6720,
"train_ppl": 2.643587
},
{
"ce_loss": 0.9211,
"epoch": 0.9738274820482211,
"grad_norm": 0.9296875,
"hf_loss_ratio": 1.0,
"learning_rate": 8.145606444875429e-07,
"loss": 0.9211,
"mean_token_accuracy": 0.7829136967658996,
"num_tokens": 495296800.0,
"step": 6730,
"train_ppl": 2.511992
},
{
"ce_loss": 0.939,
"epoch": 0.9752744768209525,
"grad_norm": 1.0,
"hf_loss_ratio": 1.0,
"learning_rate": 7.698045651200955e-07,
"loss": 0.939,
"mean_token_accuracy": 0.7814122512936592,
"num_tokens": 496031622.0,
"step": 6740,
"train_ppl": 2.557372
},
{
"ce_loss": 0.9804,
"epoch": 0.9767214715936838,
"grad_norm": 1.109375,
"hf_loss_ratio": 1.0,
"learning_rate": 7.250484857526481e-07,
"loss": 0.9804,
"mean_token_accuracy": 0.7736301675438881,
"num_tokens": 496761090.0,
"step": 6750,
"train_ppl": 2.665465
},
{
"ce_loss": 0.9504,
"epoch": 0.9781684663664153,
"grad_norm": 1.171875,
"hf_loss_ratio": 1.0,
"learning_rate": 6.802924063852007e-07,
"loss": 0.9504,
"mean_token_accuracy": 0.7740707725286484,
"num_tokens": 497494104.0,
"step": 6760,
"train_ppl": 2.586672
},
{
"ce_loss": 0.9557,
"epoch": 0.9796154611391467,
"grad_norm": 1.0078125,
"hf_loss_ratio": 1.0,
"learning_rate": 6.355363270177532e-07,
"loss": 0.9557,
"mean_token_accuracy": 0.7776445716619491,
"num_tokens": 498236331.0,
"step": 6770,
"train_ppl": 2.600574
},
{
"ce_loss": 0.9616,
"epoch": 0.981062455911878,
"grad_norm": 0.99609375,
"hf_loss_ratio": 1.0,
"learning_rate": 5.907802476503058e-07,
"loss": 0.9616,
"mean_token_accuracy": 0.779218465089798,
"num_tokens": 498972935.0,
"step": 6780,
"train_ppl": 2.615954
},
{
"ce_loss": 0.9659,
"epoch": 0.9825094506846094,
"grad_norm": 0.9140625,
"hf_loss_ratio": 1.0,
"learning_rate": 5.460241682828584e-07,
"loss": 0.9659,
"mean_token_accuracy": 0.7770897686481476,
"num_tokens": 499702836.0,
"step": 6790,
"train_ppl": 2.627128
},
{
"ce_loss": 0.963,
"epoch": 0.9839564454573407,
"grad_norm": 0.86328125,
"hf_loss_ratio": 1.0,
"learning_rate": 5.01268088915411e-07,
"loss": 0.963,
"mean_token_accuracy": 0.7763608016073704,
"num_tokens": 500426876.0,
"step": 6800,
"train_ppl": 2.61959
},
{
"ce_loss": 0.9661,
"epoch": 0.9854034402300722,
"grad_norm": 1.03125,
"hf_loss_ratio": 1.0,
"learning_rate": 4.565120095479636e-07,
"loss": 0.9661,
"mean_token_accuracy": 0.7763193972408772,
"num_tokens": 501156440.0,
"step": 6810,
"train_ppl": 2.627785
},
{
"ce_loss": 0.9835,
"epoch": 0.9868504350028036,
"grad_norm": 1.1328125,
"hf_loss_ratio": 1.0,
"learning_rate": 4.117559301805162e-07,
"loss": 0.9835,
"mean_token_accuracy": 0.7768892168998718,
"num_tokens": 501903400.0,
"step": 6820,
"train_ppl": 2.673742
},
{
"ce_loss": 0.9503,
"epoch": 0.9882974297755349,
"grad_norm": 0.8828125,
"hf_loss_ratio": 1.0,
"learning_rate": 3.6699985081306876e-07,
"loss": 0.9503,
"mean_token_accuracy": 0.7742002509534359,
"num_tokens": 502621668.0,
"step": 6830,
"train_ppl": 2.586448
},
{
"ce_loss": 0.9498,
"epoch": 0.9897444245482663,
"grad_norm": 1.0625,
"hf_loss_ratio": 1.0,
"learning_rate": 3.222437714456214e-07,
"loss": 0.9498,
"mean_token_accuracy": 0.7802133716642856,
"num_tokens": 503362803.0,
"step": 6840,
"train_ppl": 2.585163
},
{
"ce_loss": 0.9616,
"epoch": 0.9911914193209977,
"grad_norm": 0.94140625,
"hf_loss_ratio": 1.0,
"learning_rate": 2.7748769207817397e-07,
"loss": 0.9616,
"mean_token_accuracy": 0.7740616850554943,
"num_tokens": 504081933.0,
"step": 6850,
"train_ppl": 2.61597
},
{
"ce_loss": 0.9839,
"epoch": 0.9926384140937291,
"grad_norm": 1.0703125,
"hf_loss_ratio": 1.0,
"learning_rate": 2.3273161271072654e-07,
"loss": 0.9839,
"mean_token_accuracy": 0.7735910393297672,
"num_tokens": 504825189.0,
"step": 6860,
"train_ppl": 2.674826
},
{
"ce_loss": 0.9994,
"epoch": 0.9940854088664605,
"grad_norm": 1.015625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.8797553334327912e-07,
"loss": 0.9994,
"mean_token_accuracy": 0.7692562341690063,
"num_tokens": 505545177.0,
"step": 6870,
"train_ppl": 2.716574
},
{
"ce_loss": 0.9407,
"epoch": 0.9955324036391918,
"grad_norm": 0.97265625,
"hf_loss_ratio": 1.0,
"learning_rate": 1.4321945397583173e-07,
"loss": 0.9407,
"mean_token_accuracy": 0.7753926180303097,
"num_tokens": 506272927.0,
"step": 6880,
"train_ppl": 2.561663
},
{
"ce_loss": 0.939,
"epoch": 0.9969793984119233,
"grad_norm": 1.0234375,
"hf_loss_ratio": 1.0,
"learning_rate": 9.84633746083843e-08,
"loss": 0.939,
"mean_token_accuracy": 0.7804414540529251,
"num_tokens": 507019095.0,
"step": 6890,
"train_ppl": 2.557452
},
{
"ce_loss": 0.9604,
"epoch": 0.9984263931846546,
"grad_norm": 0.875,
"hf_loss_ratio": 1.0,
"learning_rate": 5.37072952409369e-08,
"loss": 0.9604,
"mean_token_accuracy": 0.7800676345825195,
"num_tokens": 507751520.0,
"step": 6900,
"train_ppl": 2.612688
},
{
"ce_loss": 0.9879,
"epoch": 0.999873387957386,
"grad_norm": 1.0703125,
"hf_loss_ratio": 1.0,
"learning_rate": 8.951215873489483e-09,
"loss": 0.9879,
"mean_token_accuracy": 0.7773638620972634,
"num_tokens": 508477238.0,
"step": 6910,
"train_ppl": 2.685598
},
{
"ce_loss": 0.8887,
"epoch": 1.0,
"mean_token_accuracy": 0.8112924013819013,
"num_tokens": 508537895.0,
"step": 6911,
"total_flos": 6.189458802853544e+18,
"train_loss": 0.9857371548739723,
"train_ppl": 2.431889,
"train_runtime": 23521.9665,
"train_samples_per_second": 37.607,
"train_steps_per_second": 0.294
}
],
"logging_steps": 10,
"max_steps": 6911,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": false,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 6.189458802853544e+18,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}