Qwen2.5-3B-Instruct-Math-Unsloth / trainer_state.json
FormlessAI's picture
Upload folder using huggingface_hub
a7f9a9b verified
Raw
History Blame Contribute Delete
74.4 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.0,
"eval_steps": 25,
"global_step": 248,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.00808080808080808,
"grad_norm": 34.29597854614258,
"learning_rate": 0.0,
"loss": 0.9949,
"num_input_tokens_seen": 24048,
"step": 1,
"train_runtime": 17.3014,
"train_tokens_per_second": 1389.947
},
{
"epoch": 0.01616161616161616,
"grad_norm": 35.52030944824219,
"learning_rate": 4.000000000000001e-06,
"loss": 1.0553,
"num_input_tokens_seen": 48096,
"step": 2,
"train_runtime": 19.429,
"train_tokens_per_second": 2475.474
},
{
"epoch": 0.024242424242424242,
"grad_norm": 25.08833122253418,
"learning_rate": 8.000000000000001e-06,
"loss": 0.8931,
"num_input_tokens_seen": 68416,
"step": 3,
"train_runtime": 21.2655,
"train_tokens_per_second": 3217.224
},
{
"epoch": 0.03232323232323232,
"grad_norm": 15.185912132263184,
"learning_rate": 1.2e-05,
"loss": 0.6129,
"num_input_tokens_seen": 90432,
"step": 4,
"train_runtime": 23.2211,
"train_tokens_per_second": 3894.39
},
{
"epoch": 0.04040404040404041,
"grad_norm": 15.486276626586914,
"learning_rate": 1.6000000000000003e-05,
"loss": 0.5151,
"num_input_tokens_seen": 110544,
"step": 5,
"train_runtime": 25.0374,
"train_tokens_per_second": 4415.159
},
{
"epoch": 0.048484848484848485,
"grad_norm": 6.518914699554443,
"learning_rate": 2e-05,
"loss": 0.3906,
"num_input_tokens_seen": 135584,
"step": 6,
"train_runtime": 27.2726,
"train_tokens_per_second": 4971.445
},
{
"epoch": 0.05656565656565657,
"grad_norm": 3.689831256866455,
"learning_rate": 1.991769547325103e-05,
"loss": 0.3707,
"num_input_tokens_seen": 159200,
"step": 7,
"train_runtime": 29.3859,
"train_tokens_per_second": 5417.559
},
{
"epoch": 0.06464646464646465,
"grad_norm": 2.442633867263794,
"learning_rate": 1.983539094650206e-05,
"loss": 0.361,
"num_input_tokens_seen": 182224,
"step": 8,
"train_runtime": 31.4524,
"train_tokens_per_second": 5793.636
},
{
"epoch": 0.07272727272727272,
"grad_norm": 2.300377368927002,
"learning_rate": 1.9753086419753087e-05,
"loss": 0.3582,
"num_input_tokens_seen": 205472,
"step": 9,
"train_runtime": 33.5262,
"train_tokens_per_second": 6128.691
},
{
"epoch": 0.08080808080808081,
"grad_norm": 1.9368574619293213,
"learning_rate": 1.9670781893004115e-05,
"loss": 0.3134,
"num_input_tokens_seen": 230400,
"step": 10,
"train_runtime": 36.915,
"train_tokens_per_second": 6241.36
},
{
"epoch": 0.08888888888888889,
"grad_norm": 2.0495376586914062,
"learning_rate": 1.9588477366255147e-05,
"loss": 0.3375,
"num_input_tokens_seen": 252736,
"step": 11,
"train_runtime": 38.9446,
"train_tokens_per_second": 6489.625
},
{
"epoch": 0.09696969696969697,
"grad_norm": 2.28267502784729,
"learning_rate": 1.9506172839506175e-05,
"loss": 0.3242,
"num_input_tokens_seen": 273584,
"step": 12,
"train_runtime": 40.8507,
"train_tokens_per_second": 6697.174
},
{
"epoch": 0.10505050505050505,
"grad_norm": 2.2189362049102783,
"learning_rate": 1.9423868312757203e-05,
"loss": 0.3666,
"num_input_tokens_seen": 299968,
"step": 13,
"train_runtime": 43.2004,
"train_tokens_per_second": 6943.636
},
{
"epoch": 0.11313131313131314,
"grad_norm": 2.0740907192230225,
"learning_rate": 1.934156378600823e-05,
"loss": 0.3772,
"num_input_tokens_seen": 322480,
"step": 14,
"train_runtime": 45.2552,
"train_tokens_per_second": 7125.818
},
{
"epoch": 0.12121212121212122,
"grad_norm": 2.38155460357666,
"learning_rate": 1.925925925925926e-05,
"loss": 0.362,
"num_input_tokens_seen": 344864,
"step": 15,
"train_runtime": 47.2767,
"train_tokens_per_second": 7294.584
},
{
"epoch": 0.1292929292929293,
"grad_norm": 1.8321378231048584,
"learning_rate": 1.9176954732510288e-05,
"loss": 0.3286,
"num_input_tokens_seen": 369296,
"step": 16,
"train_runtime": 49.4673,
"train_tokens_per_second": 7465.459
},
{
"epoch": 0.13737373737373737,
"grad_norm": 2.0253713130950928,
"learning_rate": 1.9094650205761317e-05,
"loss": 0.3555,
"num_input_tokens_seen": 390944,
"step": 17,
"train_runtime": 51.4481,
"train_tokens_per_second": 7598.811
},
{
"epoch": 0.14545454545454545,
"grad_norm": 1.9212645292282104,
"learning_rate": 1.901234567901235e-05,
"loss": 0.3191,
"num_input_tokens_seen": 414144,
"step": 18,
"train_runtime": 53.5341,
"train_tokens_per_second": 7736.071
},
{
"epoch": 0.15353535353535352,
"grad_norm": 1.9833357334136963,
"learning_rate": 1.8930041152263377e-05,
"loss": 0.3033,
"num_input_tokens_seen": 435840,
"step": 19,
"train_runtime": 55.4996,
"train_tokens_per_second": 7853.023
},
{
"epoch": 0.16161616161616163,
"grad_norm": 1.8135859966278076,
"learning_rate": 1.8847736625514405e-05,
"loss": 0.3375,
"num_input_tokens_seen": 459808,
"step": 20,
"train_runtime": 57.6671,
"train_tokens_per_second": 7973.49
},
{
"epoch": 0.1696969696969697,
"grad_norm": 1.9057047367095947,
"learning_rate": 1.8765432098765433e-05,
"loss": 0.3338,
"num_input_tokens_seen": 479504,
"step": 21,
"train_runtime": 59.4876,
"train_tokens_per_second": 8060.567
},
{
"epoch": 0.17777777777777778,
"grad_norm": 1.8097015619277954,
"learning_rate": 1.868312757201646e-05,
"loss": 0.3333,
"num_input_tokens_seen": 505712,
"step": 22,
"train_runtime": 61.8524,
"train_tokens_per_second": 8176.108
},
{
"epoch": 0.18585858585858586,
"grad_norm": 2.087014675140381,
"learning_rate": 1.860082304526749e-05,
"loss": 0.3309,
"num_input_tokens_seen": 525456,
"step": 23,
"train_runtime": 63.693,
"train_tokens_per_second": 8249.829
},
{
"epoch": 0.19393939393939394,
"grad_norm": 2.135472536087036,
"learning_rate": 1.851851851851852e-05,
"loss": 0.3742,
"num_input_tokens_seen": 548928,
"step": 24,
"train_runtime": 65.8153,
"train_tokens_per_second": 8340.436
},
{
"epoch": 0.20202020202020202,
"grad_norm": 2.068189859390259,
"learning_rate": 1.843621399176955e-05,
"loss": 0.3191,
"num_input_tokens_seen": 568608,
"step": 25,
"train_runtime": 67.6509,
"train_tokens_per_second": 8405.03
},
{
"epoch": 0.20202020202020202,
"eval_loss": 0.30983325839042664,
"eval_runtime": 10.55,
"eval_samples_per_second": 83.318,
"eval_steps_per_second": 5.213,
"num_input_tokens_seen": 568608,
"step": 25
},
{
"epoch": 0.2101010101010101,
"grad_norm": 2.005445718765259,
"learning_rate": 1.835390946502058e-05,
"loss": 0.3055,
"num_input_tokens_seen": 592240,
"step": 26,
"train_runtime": 81.0864,
"train_tokens_per_second": 7303.813
},
{
"epoch": 0.21818181818181817,
"grad_norm": 1.9169626235961914,
"learning_rate": 1.8271604938271607e-05,
"loss": 0.2896,
"num_input_tokens_seen": 613168,
"step": 27,
"train_runtime": 83.0241,
"train_tokens_per_second": 7385.42
},
{
"epoch": 0.22626262626262628,
"grad_norm": 1.8428266048431396,
"learning_rate": 1.8189300411522635e-05,
"loss": 0.3012,
"num_input_tokens_seen": 637552,
"step": 28,
"train_runtime": 85.2155,
"train_tokens_per_second": 7481.643
},
{
"epoch": 0.23434343434343435,
"grad_norm": 1.9976342916488647,
"learning_rate": 1.8106995884773663e-05,
"loss": 0.3314,
"num_input_tokens_seen": 661184,
"step": 29,
"train_runtime": 87.3748,
"train_tokens_per_second": 7567.217
},
{
"epoch": 0.24242424242424243,
"grad_norm": 1.928344964981079,
"learning_rate": 1.802469135802469e-05,
"loss": 0.3567,
"num_input_tokens_seen": 683072,
"step": 30,
"train_runtime": 89.3764,
"train_tokens_per_second": 7642.645
},
{
"epoch": 0.2505050505050505,
"grad_norm": 1.8772201538085938,
"learning_rate": 1.7942386831275723e-05,
"loss": 0.3105,
"num_input_tokens_seen": 703776,
"step": 31,
"train_runtime": 107.296,
"train_tokens_per_second": 6559.199
},
{
"epoch": 0.2585858585858586,
"grad_norm": 1.742013692855835,
"learning_rate": 1.786008230452675e-05,
"loss": 0.3078,
"num_input_tokens_seen": 729584,
"step": 32,
"train_runtime": 109.5875,
"train_tokens_per_second": 6657.545
},
{
"epoch": 0.26666666666666666,
"grad_norm": 2.0742855072021484,
"learning_rate": 1.7777777777777777e-05,
"loss": 0.3568,
"num_input_tokens_seen": 752672,
"step": 33,
"train_runtime": 111.6837,
"train_tokens_per_second": 6739.321
},
{
"epoch": 0.27474747474747474,
"grad_norm": 2.038970947265625,
"learning_rate": 1.769547325102881e-05,
"loss": 0.3193,
"num_input_tokens_seen": 776672,
"step": 34,
"train_runtime": 113.8655,
"train_tokens_per_second": 6820.962
},
{
"epoch": 0.2828282828282828,
"grad_norm": 1.8307162523269653,
"learning_rate": 1.7613168724279837e-05,
"loss": 0.3426,
"num_input_tokens_seen": 801296,
"step": 35,
"train_runtime": 116.0796,
"train_tokens_per_second": 6902.987
},
{
"epoch": 0.2909090909090909,
"grad_norm": 2.0113823413848877,
"learning_rate": 1.7530864197530865e-05,
"loss": 0.3058,
"num_input_tokens_seen": 822368,
"step": 36,
"train_runtime": 117.9981,
"train_tokens_per_second": 6969.331
},
{
"epoch": 0.298989898989899,
"grad_norm": 1.922239899635315,
"learning_rate": 1.7448559670781893e-05,
"loss": 0.2951,
"num_input_tokens_seen": 848928,
"step": 37,
"train_runtime": 120.382,
"train_tokens_per_second": 7051.954
},
{
"epoch": 0.30707070707070705,
"grad_norm": 1.8546710014343262,
"learning_rate": 1.7366255144032925e-05,
"loss": 0.2751,
"num_input_tokens_seen": 870672,
"step": 38,
"train_runtime": 122.3477,
"train_tokens_per_second": 7116.372
},
{
"epoch": 0.3151515151515151,
"grad_norm": 2.022054433822632,
"learning_rate": 1.728395061728395e-05,
"loss": 0.3516,
"num_input_tokens_seen": 892064,
"step": 39,
"train_runtime": 124.3075,
"train_tokens_per_second": 7176.271
},
{
"epoch": 0.32323232323232326,
"grad_norm": 1.8261455297470093,
"learning_rate": 1.720164609053498e-05,
"loss": 0.3178,
"num_input_tokens_seen": 915680,
"step": 40,
"train_runtime": 126.4529,
"train_tokens_per_second": 7241.273
},
{
"epoch": 0.33131313131313134,
"grad_norm": 2.0345096588134766,
"learning_rate": 1.711934156378601e-05,
"loss": 0.3142,
"num_input_tokens_seen": 935216,
"step": 41,
"train_runtime": 128.2566,
"train_tokens_per_second": 7291.759
},
{
"epoch": 0.3393939393939394,
"grad_norm": 1.9947233200073242,
"learning_rate": 1.7037037037037038e-05,
"loss": 0.3049,
"num_input_tokens_seen": 956864,
"step": 42,
"train_runtime": 130.2476,
"train_tokens_per_second": 7346.5
},
{
"epoch": 0.3474747474747475,
"grad_norm": 2.135382652282715,
"learning_rate": 1.6954732510288067e-05,
"loss": 0.3233,
"num_input_tokens_seen": 981440,
"step": 43,
"train_runtime": 132.4658,
"train_tokens_per_second": 7409.008
},
{
"epoch": 0.35555555555555557,
"grad_norm": 2.0088696479797363,
"learning_rate": 1.68724279835391e-05,
"loss": 0.297,
"num_input_tokens_seen": 1001232,
"step": 44,
"train_runtime": 134.324,
"train_tokens_per_second": 7453.858
},
{
"epoch": 0.36363636363636365,
"grad_norm": 1.9240626096725464,
"learning_rate": 1.6790123456790123e-05,
"loss": 0.2836,
"num_input_tokens_seen": 1027680,
"step": 45,
"train_runtime": 136.7055,
"train_tokens_per_second": 7517.473
},
{
"epoch": 0.3717171717171717,
"grad_norm": 1.9892817735671997,
"learning_rate": 1.670781893004115e-05,
"loss": 0.3567,
"num_input_tokens_seen": 1049968,
"step": 46,
"train_runtime": 138.7457,
"train_tokens_per_second": 7567.57
},
{
"epoch": 0.3797979797979798,
"grad_norm": 2.067185401916504,
"learning_rate": 1.6625514403292183e-05,
"loss": 0.3299,
"num_input_tokens_seen": 1071840,
"step": 47,
"train_runtime": 140.7519,
"train_tokens_per_second": 7615.101
},
{
"epoch": 0.3878787878787879,
"grad_norm": 1.953230619430542,
"learning_rate": 1.654320987654321e-05,
"loss": 0.2794,
"num_input_tokens_seen": 1092864,
"step": 48,
"train_runtime": 142.7001,
"train_tokens_per_second": 7658.469
},
{
"epoch": 0.39595959595959596,
"grad_norm": 1.9437150955200195,
"learning_rate": 1.646090534979424e-05,
"loss": 0.3269,
"num_input_tokens_seen": 1117040,
"step": 49,
"train_runtime": 144.8716,
"train_tokens_per_second": 7710.55
},
{
"epoch": 0.40404040404040403,
"grad_norm": 1.921739101409912,
"learning_rate": 1.6378600823045268e-05,
"loss": 0.3297,
"num_input_tokens_seen": 1140240,
"step": 50,
"train_runtime": 146.9806,
"train_tokens_per_second": 7757.759
},
{
"epoch": 0.40404040404040403,
"eval_loss": 0.30039629340171814,
"eval_runtime": 7.062,
"eval_samples_per_second": 124.469,
"eval_steps_per_second": 7.788,
"num_input_tokens_seen": 1140240,
"step": 50
},
{
"epoch": 0.4121212121212121,
"grad_norm": 2.030803918838501,
"learning_rate": 1.6296296296296297e-05,
"loss": 0.317,
"num_input_tokens_seen": 1161104,
"step": 51,
"train_runtime": 155.9849,
"train_tokens_per_second": 7443.696
},
{
"epoch": 0.4202020202020202,
"grad_norm": 1.6810036897659302,
"learning_rate": 1.6213991769547325e-05,
"loss": 0.3059,
"num_input_tokens_seen": 1189328,
"step": 52,
"train_runtime": 158.5167,
"train_tokens_per_second": 7502.855
},
{
"epoch": 0.42828282828282827,
"grad_norm": 1.7849842309951782,
"learning_rate": 1.6131687242798357e-05,
"loss": 0.2731,
"num_input_tokens_seen": 1211120,
"step": 53,
"train_runtime": 160.4993,
"train_tokens_per_second": 7545.95
},
{
"epoch": 0.43636363636363634,
"grad_norm": 1.7593951225280762,
"learning_rate": 1.6049382716049385e-05,
"loss": 0.2982,
"num_input_tokens_seen": 1234080,
"step": 54,
"train_runtime": 162.5873,
"train_tokens_per_second": 7590.26
},
{
"epoch": 0.4444444444444444,
"grad_norm": 1.9831680059432983,
"learning_rate": 1.5967078189300413e-05,
"loss": 0.3024,
"num_input_tokens_seen": 1256880,
"step": 55,
"train_runtime": 164.6649,
"train_tokens_per_second": 7632.957
},
{
"epoch": 0.45252525252525255,
"grad_norm": 1.9270755052566528,
"learning_rate": 1.588477366255144e-05,
"loss": 0.3484,
"num_input_tokens_seen": 1281376,
"step": 56,
"train_runtime": 166.8926,
"train_tokens_per_second": 7677.849
},
{
"epoch": 0.46060606060606063,
"grad_norm": 1.7645379304885864,
"learning_rate": 1.580246913580247e-05,
"loss": 0.2909,
"num_input_tokens_seen": 1309216,
"step": 57,
"train_runtime": 169.4269,
"train_tokens_per_second": 7727.323
},
{
"epoch": 0.4686868686868687,
"grad_norm": 2.019009590148926,
"learning_rate": 1.5720164609053498e-05,
"loss": 0.37,
"num_input_tokens_seen": 1331120,
"step": 58,
"train_runtime": 171.4602,
"train_tokens_per_second": 7763.433
},
{
"epoch": 0.4767676767676768,
"grad_norm": 1.8868393898010254,
"learning_rate": 1.5637860082304527e-05,
"loss": 0.2952,
"num_input_tokens_seen": 1354976,
"step": 59,
"train_runtime": 173.6145,
"train_tokens_per_second": 7804.51
},
{
"epoch": 0.48484848484848486,
"grad_norm": 2.1054604053497314,
"learning_rate": 1.555555555555556e-05,
"loss": 0.3012,
"num_input_tokens_seen": 1376976,
"step": 60,
"train_runtime": 175.6397,
"train_tokens_per_second": 7839.778
},
{
"epoch": 0.49292929292929294,
"grad_norm": 1.8059983253479004,
"learning_rate": 1.5473251028806587e-05,
"loss": 0.3007,
"num_input_tokens_seen": 1397952,
"step": 61,
"train_runtime": 193.5698,
"train_tokens_per_second": 7221.952
},
{
"epoch": 0.501010101010101,
"grad_norm": 1.8705294132232666,
"learning_rate": 1.5390946502057615e-05,
"loss": 0.2984,
"num_input_tokens_seen": 1417712,
"step": 62,
"train_runtime": 195.3895,
"train_tokens_per_second": 7255.825
},
{
"epoch": 0.509090909090909,
"grad_norm": 1.9110565185546875,
"learning_rate": 1.5308641975308643e-05,
"loss": 0.2868,
"num_input_tokens_seen": 1438544,
"step": 63,
"train_runtime": 197.311,
"train_tokens_per_second": 7290.746
},
{
"epoch": 0.5171717171717172,
"grad_norm": 1.8605395555496216,
"learning_rate": 1.5226337448559672e-05,
"loss": 0.2894,
"num_input_tokens_seen": 1461776,
"step": 64,
"train_runtime": 199.4092,
"train_tokens_per_second": 7330.533
},
{
"epoch": 0.5252525252525253,
"grad_norm": 1.9197546243667603,
"learning_rate": 1.51440329218107e-05,
"loss": 0.3344,
"num_input_tokens_seen": 1483600,
"step": 65,
"train_runtime": 201.3793,
"train_tokens_per_second": 7367.193
},
{
"epoch": 0.5333333333333333,
"grad_norm": 1.8143887519836426,
"learning_rate": 1.506172839506173e-05,
"loss": 0.3272,
"num_input_tokens_seen": 1507280,
"step": 66,
"train_runtime": 203.5195,
"train_tokens_per_second": 7406.072
},
{
"epoch": 0.5414141414141415,
"grad_norm": 1.9554014205932617,
"learning_rate": 1.4979423868312758e-05,
"loss": 0.3072,
"num_input_tokens_seen": 1530176,
"step": 67,
"train_runtime": 205.5865,
"train_tokens_per_second": 7442.978
},
{
"epoch": 0.5494949494949495,
"grad_norm": 1.8135331869125366,
"learning_rate": 1.4897119341563788e-05,
"loss": 0.2907,
"num_input_tokens_seen": 1553520,
"step": 68,
"train_runtime": 207.7058,
"train_tokens_per_second": 7479.424
},
{
"epoch": 0.5575757575757576,
"grad_norm": 1.7284748554229736,
"learning_rate": 1.4814814814814815e-05,
"loss": 0.3004,
"num_input_tokens_seen": 1577728,
"step": 69,
"train_runtime": 209.9215,
"train_tokens_per_second": 7515.801
},
{
"epoch": 0.5656565656565656,
"grad_norm": 1.9973853826522827,
"learning_rate": 1.4732510288065845e-05,
"loss": 0.2774,
"num_input_tokens_seen": 1598448,
"step": 70,
"train_runtime": 211.8265,
"train_tokens_per_second": 7546.025
},
{
"epoch": 0.5737373737373738,
"grad_norm": 1.867518663406372,
"learning_rate": 1.4650205761316873e-05,
"loss": 0.2953,
"num_input_tokens_seen": 1619616,
"step": 71,
"train_runtime": 213.7737,
"train_tokens_per_second": 7576.311
},
{
"epoch": 0.5818181818181818,
"grad_norm": 1.87697172164917,
"learning_rate": 1.4567901234567903e-05,
"loss": 0.3165,
"num_input_tokens_seen": 1647504,
"step": 72,
"train_runtime": 216.2825,
"train_tokens_per_second": 7617.373
},
{
"epoch": 0.5898989898989899,
"grad_norm": 2.0404067039489746,
"learning_rate": 1.4485596707818932e-05,
"loss": 0.325,
"num_input_tokens_seen": 1669600,
"step": 73,
"train_runtime": 218.3171,
"train_tokens_per_second": 7647.592
},
{
"epoch": 0.597979797979798,
"grad_norm": 1.9081746339797974,
"learning_rate": 1.4403292181069962e-05,
"loss": 0.3295,
"num_input_tokens_seen": 1692464,
"step": 74,
"train_runtime": 220.4059,
"train_tokens_per_second": 7678.851
},
{
"epoch": 0.6060606060606061,
"grad_norm": 1.9184836149215698,
"learning_rate": 1.4320987654320988e-05,
"loss": 0.3046,
"num_input_tokens_seen": 1714544,
"step": 75,
"train_runtime": 222.438,
"train_tokens_per_second": 7707.964
},
{
"epoch": 0.6060606060606061,
"eval_loss": 0.2966873049736023,
"eval_runtime": 7.0993,
"eval_samples_per_second": 123.814,
"eval_steps_per_second": 7.747,
"num_input_tokens_seen": 1714544,
"step": 75
},
{
"epoch": 0.6141414141414141,
"grad_norm": 1.9091130495071411,
"learning_rate": 1.4238683127572017e-05,
"loss": 0.3117,
"num_input_tokens_seen": 1734992,
"step": 76,
"train_runtime": 231.4507,
"train_tokens_per_second": 7496.164
},
{
"epoch": 0.6222222222222222,
"grad_norm": 1.8281859159469604,
"learning_rate": 1.4156378600823047e-05,
"loss": 0.3165,
"num_input_tokens_seen": 1758528,
"step": 77,
"train_runtime": 233.6112,
"train_tokens_per_second": 7527.584
},
{
"epoch": 0.6303030303030303,
"grad_norm": 2.0086405277252197,
"learning_rate": 1.4074074074074075e-05,
"loss": 0.3239,
"num_input_tokens_seen": 1782768,
"step": 78,
"train_runtime": 235.7867,
"train_tokens_per_second": 7560.935
},
{
"epoch": 0.6383838383838384,
"grad_norm": 1.9040608406066895,
"learning_rate": 1.3991769547325105e-05,
"loss": 0.3269,
"num_input_tokens_seen": 1806000,
"step": 79,
"train_runtime": 237.8964,
"train_tokens_per_second": 7591.539
},
{
"epoch": 0.6464646464646465,
"grad_norm": 1.8077948093414307,
"learning_rate": 1.3909465020576133e-05,
"loss": 0.3069,
"num_input_tokens_seen": 1833264,
"step": 80,
"train_runtime": 240.3427,
"train_tokens_per_second": 7627.708
},
{
"epoch": 0.6545454545454545,
"grad_norm": 2.132566452026367,
"learning_rate": 1.3827160493827162e-05,
"loss": 0.3564,
"num_input_tokens_seen": 1855920,
"step": 81,
"train_runtime": 242.4326,
"train_tokens_per_second": 7655.407
},
{
"epoch": 0.6626262626262627,
"grad_norm": 1.9666991233825684,
"learning_rate": 1.374485596707819e-05,
"loss": 0.3299,
"num_input_tokens_seen": 1877664,
"step": 82,
"train_runtime": 244.4539,
"train_tokens_per_second": 7681.055
},
{
"epoch": 0.6707070707070707,
"grad_norm": 1.7784312963485718,
"learning_rate": 1.366255144032922e-05,
"loss": 0.2704,
"num_input_tokens_seen": 1901152,
"step": 83,
"train_runtime": 246.5816,
"train_tokens_per_second": 7710.033
},
{
"epoch": 0.6787878787878788,
"grad_norm": 1.9089895486831665,
"learning_rate": 1.3580246913580248e-05,
"loss": 0.3071,
"num_input_tokens_seen": 1927440,
"step": 84,
"train_runtime": 248.9261,
"train_tokens_per_second": 7743.02
},
{
"epoch": 0.6868686868686869,
"grad_norm": 2.1388967037200928,
"learning_rate": 1.3497942386831278e-05,
"loss": 0.3121,
"num_input_tokens_seen": 1951408,
"step": 85,
"train_runtime": 251.0849,
"train_tokens_per_second": 7771.906
},
{
"epoch": 0.694949494949495,
"grad_norm": 1.9663597345352173,
"learning_rate": 1.3415637860082307e-05,
"loss": 0.3255,
"num_input_tokens_seen": 1973200,
"step": 86,
"train_runtime": 253.071,
"train_tokens_per_second": 7797.022
},
{
"epoch": 0.703030303030303,
"grad_norm": 1.8622767925262451,
"learning_rate": 1.3333333333333333e-05,
"loss": 0.3316,
"num_input_tokens_seen": 1994528,
"step": 87,
"train_runtime": 255.0392,
"train_tokens_per_second": 7820.476
},
{
"epoch": 0.7111111111111111,
"grad_norm": 2.091785430908203,
"learning_rate": 1.3251028806584363e-05,
"loss": 0.29,
"num_input_tokens_seen": 2019248,
"step": 88,
"train_runtime": 257.2586,
"train_tokens_per_second": 7849.097
},
{
"epoch": 0.7191919191919192,
"grad_norm": 1.9802072048187256,
"learning_rate": 1.3168724279835392e-05,
"loss": 0.3108,
"num_input_tokens_seen": 2040592,
"step": 89,
"train_runtime": 259.2297,
"train_tokens_per_second": 7871.751
},
{
"epoch": 0.7272727272727273,
"grad_norm": 1.8566641807556152,
"learning_rate": 1.3086419753086422e-05,
"loss": 0.2818,
"num_input_tokens_seen": 2062032,
"step": 90,
"train_runtime": 261.2082,
"train_tokens_per_second": 7894.21
},
{
"epoch": 0.7353535353535353,
"grad_norm": 2.006922960281372,
"learning_rate": 1.300411522633745e-05,
"loss": 0.2786,
"num_input_tokens_seen": 2082368,
"step": 91,
"train_runtime": 279.7434,
"train_tokens_per_second": 7443.85
},
{
"epoch": 0.7434343434343434,
"grad_norm": 1.9318790435791016,
"learning_rate": 1.2921810699588477e-05,
"loss": 0.2882,
"num_input_tokens_seen": 2104976,
"step": 92,
"train_runtime": 281.7953,
"train_tokens_per_second": 7469.876
},
{
"epoch": 0.7515151515151515,
"grad_norm": 2.0379955768585205,
"learning_rate": 1.2839506172839507e-05,
"loss": 0.3164,
"num_input_tokens_seen": 2125664,
"step": 93,
"train_runtime": 283.6716,
"train_tokens_per_second": 7493.396
},
{
"epoch": 0.7595959595959596,
"grad_norm": 1.7655056715011597,
"learning_rate": 1.2757201646090535e-05,
"loss": 0.2632,
"num_input_tokens_seen": 2151216,
"step": 94,
"train_runtime": 285.9821,
"train_tokens_per_second": 7522.204
},
{
"epoch": 0.7676767676767676,
"grad_norm": 2.0078585147857666,
"learning_rate": 1.2674897119341565e-05,
"loss": 0.3138,
"num_input_tokens_seen": 2174480,
"step": 95,
"train_runtime": 288.0796,
"train_tokens_per_second": 7548.192
},
{
"epoch": 0.7757575757575758,
"grad_norm": 1.8399180173873901,
"learning_rate": 1.2592592592592593e-05,
"loss": 0.2765,
"num_input_tokens_seen": 2198048,
"step": 96,
"train_runtime": 290.2011,
"train_tokens_per_second": 7574.225
},
{
"epoch": 0.7838383838383839,
"grad_norm": 2.049941301345825,
"learning_rate": 1.2510288065843623e-05,
"loss": 0.3136,
"num_input_tokens_seen": 2218944,
"step": 97,
"train_runtime": 292.1183,
"train_tokens_per_second": 7596.047
},
{
"epoch": 0.7919191919191919,
"grad_norm": 1.8334540128707886,
"learning_rate": 1.242798353909465e-05,
"loss": 0.3265,
"num_input_tokens_seen": 2244752,
"step": 98,
"train_runtime": 294.4345,
"train_tokens_per_second": 7623.944
},
{
"epoch": 0.8,
"grad_norm": 2.317540168762207,
"learning_rate": 1.234567901234568e-05,
"loss": 0.3505,
"num_input_tokens_seen": 2267728,
"step": 99,
"train_runtime": 296.5099,
"train_tokens_per_second": 7648.068
},
{
"epoch": 0.8080808080808081,
"grad_norm": 1.9731619358062744,
"learning_rate": 1.2263374485596708e-05,
"loss": 0.2984,
"num_input_tokens_seen": 2289328,
"step": 100,
"train_runtime": 298.4904,
"train_tokens_per_second": 7669.686
},
{
"epoch": 0.8080808080808081,
"eval_loss": 0.29423120617866516,
"eval_runtime": 7.029,
"eval_samples_per_second": 125.053,
"eval_steps_per_second": 7.825,
"num_input_tokens_seen": 2289328,
"step": 100
},
{
"epoch": 0.8161616161616162,
"grad_norm": 2.0644495487213135,
"learning_rate": 1.2181069958847738e-05,
"loss": 0.326,
"num_input_tokens_seen": 2313216,
"step": 101,
"train_runtime": 307.6926,
"train_tokens_per_second": 7517.945
},
{
"epoch": 0.8242424242424242,
"grad_norm": 1.9370036125183105,
"learning_rate": 1.2098765432098767e-05,
"loss": 0.2865,
"num_input_tokens_seen": 2333152,
"step": 102,
"train_runtime": 309.5355,
"train_tokens_per_second": 7537.591
},
{
"epoch": 0.8323232323232324,
"grad_norm": 1.9265321493148804,
"learning_rate": 1.2016460905349797e-05,
"loss": 0.3275,
"num_input_tokens_seen": 2355744,
"step": 103,
"train_runtime": 311.5913,
"train_tokens_per_second": 7560.365
},
{
"epoch": 0.8404040404040404,
"grad_norm": 1.9668643474578857,
"learning_rate": 1.1934156378600823e-05,
"loss": 0.3592,
"num_input_tokens_seen": 2376560,
"step": 104,
"train_runtime": 313.4969,
"train_tokens_per_second": 7580.81
},
{
"epoch": 0.8484848484848485,
"grad_norm": 1.9941215515136719,
"learning_rate": 1.1851851851851852e-05,
"loss": 0.2986,
"num_input_tokens_seen": 2400896,
"step": 105,
"train_runtime": 315.6988,
"train_tokens_per_second": 7605.02
},
{
"epoch": 0.8565656565656565,
"grad_norm": 2.070256233215332,
"learning_rate": 1.1769547325102882e-05,
"loss": 0.3146,
"num_input_tokens_seen": 2423632,
"step": 106,
"train_runtime": 317.7728,
"train_tokens_per_second": 7626.933
},
{
"epoch": 0.8646464646464647,
"grad_norm": 1.929892659187317,
"learning_rate": 1.168724279835391e-05,
"loss": 0.33,
"num_input_tokens_seen": 2448432,
"step": 107,
"train_runtime": 320.0049,
"train_tokens_per_second": 7651.233
},
{
"epoch": 0.8727272727272727,
"grad_norm": 1.7959911823272705,
"learning_rate": 1.160493827160494e-05,
"loss": 0.3109,
"num_input_tokens_seen": 2470768,
"step": 108,
"train_runtime": 322.0228,
"train_tokens_per_second": 7672.65
},
{
"epoch": 0.8808080808080808,
"grad_norm": 1.8385419845581055,
"learning_rate": 1.1522633744855968e-05,
"loss": 0.2902,
"num_input_tokens_seen": 2494944,
"step": 109,
"train_runtime": 324.2378,
"train_tokens_per_second": 7694.798
},
{
"epoch": 0.8888888888888888,
"grad_norm": 1.9622164964675903,
"learning_rate": 1.1440329218106997e-05,
"loss": 0.3503,
"num_input_tokens_seen": 2515760,
"step": 110,
"train_runtime": 326.16,
"train_tokens_per_second": 7713.268
},
{
"epoch": 0.896969696969697,
"grad_norm": 1.9579459428787231,
"learning_rate": 1.1358024691358025e-05,
"loss": 0.2731,
"num_input_tokens_seen": 2537792,
"step": 111,
"train_runtime": 328.183,
"train_tokens_per_second": 7732.857
},
{
"epoch": 0.9050505050505051,
"grad_norm": 1.8197929859161377,
"learning_rate": 1.1275720164609055e-05,
"loss": 0.2742,
"num_input_tokens_seen": 2562032,
"step": 112,
"train_runtime": 330.3793,
"train_tokens_per_second": 7754.819
},
{
"epoch": 0.9131313131313131,
"grad_norm": 2.2101240158081055,
"learning_rate": 1.1193415637860083e-05,
"loss": 0.3154,
"num_input_tokens_seen": 2583760,
"step": 113,
"train_runtime": 332.3672,
"train_tokens_per_second": 7773.81
},
{
"epoch": 0.9212121212121213,
"grad_norm": 1.961485743522644,
"learning_rate": 1.1111111111111113e-05,
"loss": 0.2789,
"num_input_tokens_seen": 2607776,
"step": 114,
"train_runtime": 334.5191,
"train_tokens_per_second": 7795.596
},
{
"epoch": 0.9292929292929293,
"grad_norm": 2.0995683670043945,
"learning_rate": 1.1028806584362142e-05,
"loss": 0.3263,
"num_input_tokens_seen": 2630208,
"step": 115,
"train_runtime": 336.587,
"train_tokens_per_second": 7814.349
},
{
"epoch": 0.9373737373737374,
"grad_norm": 2.0641095638275146,
"learning_rate": 1.0946502057613168e-05,
"loss": 0.2851,
"num_input_tokens_seen": 2650208,
"step": 116,
"train_runtime": 338.4264,
"train_tokens_per_second": 7830.972
},
{
"epoch": 0.9454545454545454,
"grad_norm": 2.0057430267333984,
"learning_rate": 1.0864197530864198e-05,
"loss": 0.3165,
"num_input_tokens_seen": 2672592,
"step": 117,
"train_runtime": 340.4808,
"train_tokens_per_second": 7849.464
},
{
"epoch": 0.9535353535353536,
"grad_norm": 1.996042251586914,
"learning_rate": 1.0781893004115227e-05,
"loss": 0.2761,
"num_input_tokens_seen": 2698064,
"step": 118,
"train_runtime": 342.8571,
"train_tokens_per_second": 7869.354
},
{
"epoch": 0.9616161616161616,
"grad_norm": 1.9719218015670776,
"learning_rate": 1.0699588477366257e-05,
"loss": 0.3056,
"num_input_tokens_seen": 2719680,
"step": 119,
"train_runtime": 344.8444,
"train_tokens_per_second": 7886.688
},
{
"epoch": 0.9696969696969697,
"grad_norm": 1.7962714433670044,
"learning_rate": 1.0617283950617285e-05,
"loss": 0.2745,
"num_input_tokens_seen": 2742400,
"step": 120,
"train_runtime": 346.9298,
"train_tokens_per_second": 7904.768
},
{
"epoch": 0.9777777777777777,
"grad_norm": 1.91484797000885,
"learning_rate": 1.0534979423868315e-05,
"loss": 0.2906,
"num_input_tokens_seen": 2766112,
"step": 121,
"train_runtime": 365.0207,
"train_tokens_per_second": 7577.96
},
{
"epoch": 0.9858585858585859,
"grad_norm": 1.9865151643753052,
"learning_rate": 1.0452674897119342e-05,
"loss": 0.291,
"num_input_tokens_seen": 2787952,
"step": 122,
"train_runtime": 366.9952,
"train_tokens_per_second": 7596.699
},
{
"epoch": 0.9939393939393939,
"grad_norm": 2.03933048248291,
"learning_rate": 1.037037037037037e-05,
"loss": 0.3486,
"num_input_tokens_seen": 2811632,
"step": 123,
"train_runtime": 369.1409,
"train_tokens_per_second": 7616.69
},
{
"epoch": 1.0,
"grad_norm": 2.3509812355041504,
"learning_rate": 1.02880658436214e-05,
"loss": 0.2723,
"num_input_tokens_seen": 2825206,
"step": 124,
"train_runtime": 372.5555,
"train_tokens_per_second": 7583.315
},
{
"epoch": 1.0080808080808081,
"grad_norm": 2.5542423725128174,
"learning_rate": 1.0205761316872428e-05,
"loss": 0.271,
"num_input_tokens_seen": 2847206,
"step": 125,
"train_runtime": 374.5469,
"train_tokens_per_second": 7601.734
},
{
"epoch": 1.0080808080808081,
"eval_loss": 0.2926430106163025,
"eval_runtime": 7.026,
"eval_samples_per_second": 125.107,
"eval_steps_per_second": 7.828,
"num_input_tokens_seen": 2847206,
"step": 125
},
{
"epoch": 1.0161616161616163,
"grad_norm": 2.485454797744751,
"learning_rate": 1.0123456790123458e-05,
"loss": 0.2351,
"num_input_tokens_seen": 2867190,
"step": 126,
"train_runtime": 383.4417,
"train_tokens_per_second": 7477.513
},
{
"epoch": 1.0242424242424242,
"grad_norm": 1.870703101158142,
"learning_rate": 1.0041152263374487e-05,
"loss": 0.2432,
"num_input_tokens_seen": 2888710,
"step": 127,
"train_runtime": 385.4176,
"train_tokens_per_second": 7495.014
},
{
"epoch": 1.0323232323232323,
"grad_norm": 1.9022161960601807,
"learning_rate": 9.958847736625515e-06,
"loss": 0.2415,
"num_input_tokens_seen": 2913990,
"step": 128,
"train_runtime": 387.7088,
"train_tokens_per_second": 7515.925
},
{
"epoch": 1.0404040404040404,
"grad_norm": 2.121541738510132,
"learning_rate": 9.876543209876543e-06,
"loss": 0.2421,
"num_input_tokens_seen": 2938246,
"step": 129,
"train_runtime": 389.9127,
"train_tokens_per_second": 7535.65
},
{
"epoch": 1.0484848484848486,
"grad_norm": 1.8283259868621826,
"learning_rate": 9.794238683127573e-06,
"loss": 0.2525,
"num_input_tokens_seen": 2962326,
"step": 130,
"train_runtime": 392.1155,
"train_tokens_per_second": 7554.729
},
{
"epoch": 1.0565656565656565,
"grad_norm": 2.0393452644348145,
"learning_rate": 9.711934156378602e-06,
"loss": 0.2636,
"num_input_tokens_seen": 2983126,
"step": 131,
"train_runtime": 394.0236,
"train_tokens_per_second": 7570.933
},
{
"epoch": 1.0646464646464646,
"grad_norm": 2.0195391178131104,
"learning_rate": 9.62962962962963e-06,
"loss": 0.2488,
"num_input_tokens_seen": 3005606,
"step": 132,
"train_runtime": 396.0787,
"train_tokens_per_second": 7588.405
},
{
"epoch": 1.0727272727272728,
"grad_norm": 2.2477834224700928,
"learning_rate": 9.547325102880658e-06,
"loss": 0.2564,
"num_input_tokens_seen": 3027926,
"step": 133,
"train_runtime": 398.1422,
"train_tokens_per_second": 7605.138
},
{
"epoch": 1.0808080808080809,
"grad_norm": 2.251457691192627,
"learning_rate": 9.465020576131688e-06,
"loss": 0.2514,
"num_input_tokens_seen": 3052294,
"step": 134,
"train_runtime": 400.3525,
"train_tokens_per_second": 7624.016
},
{
"epoch": 1.0888888888888888,
"grad_norm": 2.3457224369049072,
"learning_rate": 9.382716049382717e-06,
"loss": 0.2447,
"num_input_tokens_seen": 3073014,
"step": 135,
"train_runtime": 402.2692,
"train_tokens_per_second": 7639.198
},
{
"epoch": 1.096969696969697,
"grad_norm": 2.5215225219726562,
"learning_rate": 9.300411522633745e-06,
"loss": 0.2123,
"num_input_tokens_seen": 3095126,
"step": 136,
"train_runtime": 404.2858,
"train_tokens_per_second": 7655.786
},
{
"epoch": 1.105050505050505,
"grad_norm": 2.9330391883850098,
"learning_rate": 9.218106995884775e-06,
"loss": 0.2813,
"num_input_tokens_seen": 3116438,
"step": 137,
"train_runtime": 406.2489,
"train_tokens_per_second": 7671.252
},
{
"epoch": 1.1131313131313132,
"grad_norm": 2.4419281482696533,
"learning_rate": 9.135802469135803e-06,
"loss": 0.2355,
"num_input_tokens_seen": 3139174,
"step": 138,
"train_runtime": 408.3028,
"train_tokens_per_second": 7688.348
},
{
"epoch": 1.121212121212121,
"grad_norm": 2.1203596591949463,
"learning_rate": 9.053497942386832e-06,
"loss": 0.2362,
"num_input_tokens_seen": 3165206,
"step": 139,
"train_runtime": 410.6277,
"train_tokens_per_second": 7708.214
},
{
"epoch": 1.1292929292929292,
"grad_norm": 2.388300657272339,
"learning_rate": 8.971193415637862e-06,
"loss": 0.2683,
"num_input_tokens_seen": 3189942,
"step": 140,
"train_runtime": 412.8585,
"train_tokens_per_second": 7726.478
},
{
"epoch": 1.1373737373737374,
"grad_norm": 2.1845967769622803,
"learning_rate": 8.888888888888888e-06,
"loss": 0.2414,
"num_input_tokens_seen": 3213878,
"step": 141,
"train_runtime": 415.0261,
"train_tokens_per_second": 7743.798
},
{
"epoch": 1.1454545454545455,
"grad_norm": 1.9687696695327759,
"learning_rate": 8.806584362139918e-06,
"loss": 0.2828,
"num_input_tokens_seen": 3236806,
"step": 142,
"train_runtime": 417.1211,
"train_tokens_per_second": 7759.872
},
{
"epoch": 1.1535353535353536,
"grad_norm": 2.1155526638031006,
"learning_rate": 8.724279835390947e-06,
"loss": 0.2821,
"num_input_tokens_seen": 3258822,
"step": 143,
"train_runtime": 419.1343,
"train_tokens_per_second": 7775.127
},
{
"epoch": 1.1616161616161615,
"grad_norm": 2.031667947769165,
"learning_rate": 8.641975308641975e-06,
"loss": 0.2472,
"num_input_tokens_seen": 3280694,
"step": 144,
"train_runtime": 421.1299,
"train_tokens_per_second": 7790.219
},
{
"epoch": 1.1696969696969697,
"grad_norm": 2.065946340560913,
"learning_rate": 8.559670781893005e-06,
"loss": 0.24,
"num_input_tokens_seen": 3305894,
"step": 145,
"train_runtime": 423.386,
"train_tokens_per_second": 7808.226
},
{
"epoch": 1.1777777777777778,
"grad_norm": 2.0876126289367676,
"learning_rate": 8.477366255144033e-06,
"loss": 0.2466,
"num_input_tokens_seen": 3327526,
"step": 146,
"train_runtime": 425.3809,
"train_tokens_per_second": 7822.462
},
{
"epoch": 1.185858585858586,
"grad_norm": 1.9692819118499756,
"learning_rate": 8.395061728395062e-06,
"loss": 0.2462,
"num_input_tokens_seen": 3349414,
"step": 147,
"train_runtime": 427.3897,
"train_tokens_per_second": 7836.909
},
{
"epoch": 1.1939393939393939,
"grad_norm": 2.186434030532837,
"learning_rate": 8.312757201646092e-06,
"loss": 0.3039,
"num_input_tokens_seen": 3373782,
"step": 148,
"train_runtime": 429.5935,
"train_tokens_per_second": 7853.429
},
{
"epoch": 1.202020202020202,
"grad_norm": 2.0272040367126465,
"learning_rate": 8.23045267489712e-06,
"loss": 0.2476,
"num_input_tokens_seen": 3397254,
"step": 149,
"train_runtime": 431.7412,
"train_tokens_per_second": 7868.729
},
{
"epoch": 1.2101010101010101,
"grad_norm": 1.9289153814315796,
"learning_rate": 8.148148148148148e-06,
"loss": 0.2371,
"num_input_tokens_seen": 3420102,
"step": 150,
"train_runtime": 433.8468,
"train_tokens_per_second": 7883.202
},
{
"epoch": 1.2101010101010101,
"eval_loss": 0.2959754765033722,
"eval_runtime": 7.0833,
"eval_samples_per_second": 124.095,
"eval_steps_per_second": 7.765,
"num_input_tokens_seen": 3420102,
"step": 150
},
{
"epoch": 1.2181818181818183,
"grad_norm": 2.1007144451141357,
"learning_rate": 8.065843621399178e-06,
"loss": 0.265,
"num_input_tokens_seen": 3440438,
"step": 151,
"train_runtime": 461.0146,
"train_tokens_per_second": 7462.752
},
{
"epoch": 1.2262626262626264,
"grad_norm": 2.0250070095062256,
"learning_rate": 7.983539094650207e-06,
"loss": 0.2486,
"num_input_tokens_seen": 3466054,
"step": 152,
"train_runtime": 463.3174,
"train_tokens_per_second": 7480.949
},
{
"epoch": 1.2343434343434343,
"grad_norm": 1.7474883794784546,
"learning_rate": 7.901234567901235e-06,
"loss": 0.2172,
"num_input_tokens_seen": 3492278,
"step": 153,
"train_runtime": 465.6949,
"train_tokens_per_second": 7499.068
},
{
"epoch": 1.2424242424242424,
"grad_norm": 1.8963685035705566,
"learning_rate": 7.818930041152263e-06,
"loss": 0.2187,
"num_input_tokens_seen": 3512582,
"step": 154,
"train_runtime": 467.5775,
"train_tokens_per_second": 7512.299
},
{
"epoch": 1.2505050505050506,
"grad_norm": 1.9363595247268677,
"learning_rate": 7.736625514403293e-06,
"loss": 0.2594,
"num_input_tokens_seen": 3535750,
"step": 155,
"train_runtime": 469.6918,
"train_tokens_per_second": 7527.809
},
{
"epoch": 1.2585858585858585,
"grad_norm": 2.0793097019195557,
"learning_rate": 7.654320987654322e-06,
"loss": 0.2463,
"num_input_tokens_seen": 3559894,
"step": 156,
"train_runtime": 471.8957,
"train_tokens_per_second": 7543.816
},
{
"epoch": 1.2666666666666666,
"grad_norm": 2.071737289428711,
"learning_rate": 7.57201646090535e-06,
"loss": 0.2553,
"num_input_tokens_seen": 3580390,
"step": 157,
"train_runtime": 473.7908,
"train_tokens_per_second": 7556.901
},
{
"epoch": 1.2747474747474747,
"grad_norm": 1.9994101524353027,
"learning_rate": 7.489711934156379e-06,
"loss": 0.2189,
"num_input_tokens_seen": 3601750,
"step": 158,
"train_runtime": 475.7442,
"train_tokens_per_second": 7570.77
},
{
"epoch": 1.2828282828282829,
"grad_norm": 2.021566867828369,
"learning_rate": 7.4074074074074075e-06,
"loss": 0.2453,
"num_input_tokens_seen": 3629030,
"step": 159,
"train_runtime": 478.1887,
"train_tokens_per_second": 7589.117
},
{
"epoch": 1.290909090909091,
"grad_norm": 2.1607470512390137,
"learning_rate": 7.325102880658437e-06,
"loss": 0.2541,
"num_input_tokens_seen": 3654358,
"step": 160,
"train_runtime": 480.4853,
"train_tokens_per_second": 7605.556
},
{
"epoch": 1.298989898989899,
"grad_norm": 2.1245932579040527,
"learning_rate": 7.242798353909466e-06,
"loss": 0.2361,
"num_input_tokens_seen": 3680758,
"step": 161,
"train_runtime": 482.8693,
"train_tokens_per_second": 7622.68
},
{
"epoch": 1.307070707070707,
"grad_norm": 2.2660951614379883,
"learning_rate": 7.160493827160494e-06,
"loss": 0.2438,
"num_input_tokens_seen": 3704022,
"step": 162,
"train_runtime": 485.004,
"train_tokens_per_second": 7637.096
},
{
"epoch": 1.3151515151515152,
"grad_norm": 2.2035646438598633,
"learning_rate": 7.078189300411523e-06,
"loss": 0.2482,
"num_input_tokens_seen": 3727814,
"step": 163,
"train_runtime": 487.1455,
"train_tokens_per_second": 7652.362
},
{
"epoch": 1.3232323232323233,
"grad_norm": 2.1511008739471436,
"learning_rate": 6.9958847736625525e-06,
"loss": 0.2547,
"num_input_tokens_seen": 3749606,
"step": 164,
"train_runtime": 489.1325,
"train_tokens_per_second": 7665.828
},
{
"epoch": 1.3313131313131312,
"grad_norm": 2.249523878097534,
"learning_rate": 6.913580246913581e-06,
"loss": 0.2968,
"num_input_tokens_seen": 3774710,
"step": 165,
"train_runtime": 491.419,
"train_tokens_per_second": 7681.245
},
{
"epoch": 1.3393939393939394,
"grad_norm": 2.0948562622070312,
"learning_rate": 6.83127572016461e-06,
"loss": 0.2359,
"num_input_tokens_seen": 3793814,
"step": 166,
"train_runtime": 493.2079,
"train_tokens_per_second": 7692.119
},
{
"epoch": 1.3474747474747475,
"grad_norm": 2.107844591140747,
"learning_rate": 6.748971193415639e-06,
"loss": 0.2737,
"num_input_tokens_seen": 3818662,
"step": 167,
"train_runtime": 495.4635,
"train_tokens_per_second": 7707.251
},
{
"epoch": 1.3555555555555556,
"grad_norm": 2.3334641456604004,
"learning_rate": 6.666666666666667e-06,
"loss": 0.2596,
"num_input_tokens_seen": 3841606,
"step": 168,
"train_runtime": 497.5542,
"train_tokens_per_second": 7720.98
},
{
"epoch": 1.3636363636363638,
"grad_norm": 2.0350282192230225,
"learning_rate": 6.584362139917696e-06,
"loss": 0.2443,
"num_input_tokens_seen": 3863830,
"step": 169,
"train_runtime": 499.6021,
"train_tokens_per_second": 7733.815
},
{
"epoch": 1.3717171717171717,
"grad_norm": 2.1754233837127686,
"learning_rate": 6.502057613168725e-06,
"loss": 0.2618,
"num_input_tokens_seen": 3886230,
"step": 170,
"train_runtime": 501.6397,
"train_tokens_per_second": 7747.055
},
{
"epoch": 1.3797979797979798,
"grad_norm": 2.145559072494507,
"learning_rate": 6.419753086419753e-06,
"loss": 0.2353,
"num_input_tokens_seen": 3908982,
"step": 171,
"train_runtime": 503.6986,
"train_tokens_per_second": 7760.557
},
{
"epoch": 1.387878787878788,
"grad_norm": 2.020923376083374,
"learning_rate": 6.3374485596707825e-06,
"loss": 0.2178,
"num_input_tokens_seen": 3936150,
"step": 172,
"train_runtime": 506.1611,
"train_tokens_per_second": 7776.477
},
{
"epoch": 1.3959595959595958,
"grad_norm": 2.0729899406433105,
"learning_rate": 6.255144032921812e-06,
"loss": 0.2592,
"num_input_tokens_seen": 3959430,
"step": 173,
"train_runtime": 508.2944,
"train_tokens_per_second": 7789.639
},
{
"epoch": 1.404040404040404,
"grad_norm": 2.098947525024414,
"learning_rate": 6.17283950617284e-06,
"loss": 0.2497,
"num_input_tokens_seen": 3981126,
"step": 174,
"train_runtime": 510.3129,
"train_tokens_per_second": 7801.344
},
{
"epoch": 1.412121212121212,
"grad_norm": 2.200272560119629,
"learning_rate": 6.090534979423869e-06,
"loss": 0.2587,
"num_input_tokens_seen": 4006118,
"step": 175,
"train_runtime": 512.5647,
"train_tokens_per_second": 7815.829
},
{
"epoch": 1.412121212121212,
"eval_loss": 0.29883837699890137,
"eval_runtime": 7.1029,
"eval_samples_per_second": 123.753,
"eval_steps_per_second": 7.743,
"num_input_tokens_seen": 4006118,
"step": 175
},
{
"epoch": 1.4202020202020202,
"grad_norm": 2.150625228881836,
"learning_rate": 6.008230452674898e-06,
"loss": 0.2508,
"num_input_tokens_seen": 4034054,
"step": 176,
"train_runtime": 522.2099,
"train_tokens_per_second": 7724.967
},
{
"epoch": 1.4282828282828284,
"grad_norm": 2.0687313079833984,
"learning_rate": 5.925925925925926e-06,
"loss": 0.2393,
"num_input_tokens_seen": 4058646,
"step": 177,
"train_runtime": 524.4627,
"train_tokens_per_second": 7738.674
},
{
"epoch": 1.4363636363636363,
"grad_norm": 2.018831253051758,
"learning_rate": 5.843621399176955e-06,
"loss": 0.2712,
"num_input_tokens_seen": 4083414,
"step": 178,
"train_runtime": 526.7043,
"train_tokens_per_second": 7752.764
},
{
"epoch": 1.4444444444444444,
"grad_norm": 2.097909450531006,
"learning_rate": 5.761316872427984e-06,
"loss": 0.2601,
"num_input_tokens_seen": 4107190,
"step": 179,
"train_runtime": 528.9031,
"train_tokens_per_second": 7765.487
},
{
"epoch": 1.4525252525252526,
"grad_norm": 2.1564548015594482,
"learning_rate": 5.6790123456790125e-06,
"loss": 0.3076,
"num_input_tokens_seen": 4129958,
"step": 180,
"train_runtime": 531.0094,
"train_tokens_per_second": 7777.561
},
{
"epoch": 1.4606060606060607,
"grad_norm": 2.1547343730926514,
"learning_rate": 5.596707818930042e-06,
"loss": 0.2285,
"num_input_tokens_seen": 4153302,
"step": 181,
"train_runtime": 551.2055,
"train_tokens_per_second": 7534.943
},
{
"epoch": 1.4686868686868686,
"grad_norm": 2.0703673362731934,
"learning_rate": 5.514403292181071e-06,
"loss": 0.237,
"num_input_tokens_seen": 4175222,
"step": 182,
"train_runtime": 553.2018,
"train_tokens_per_second": 7547.375
},
{
"epoch": 1.4767676767676767,
"grad_norm": 1.8771171569824219,
"learning_rate": 5.432098765432099e-06,
"loss": 0.2437,
"num_input_tokens_seen": 4196966,
"step": 183,
"train_runtime": 555.2016,
"train_tokens_per_second": 7559.355
},
{
"epoch": 1.4848484848484849,
"grad_norm": 2.054640293121338,
"learning_rate": 5.349794238683128e-06,
"loss": 0.259,
"num_input_tokens_seen": 4222630,
"step": 184,
"train_runtime": 557.5348,
"train_tokens_per_second": 7573.752
},
{
"epoch": 1.492929292929293,
"grad_norm": 2.0560507774353027,
"learning_rate": 5.2674897119341575e-06,
"loss": 0.2397,
"num_input_tokens_seen": 4243798,
"step": 185,
"train_runtime": 559.4718,
"train_tokens_per_second": 7585.365
},
{
"epoch": 1.5010101010101011,
"grad_norm": 2.1618330478668213,
"learning_rate": 5.185185185185185e-06,
"loss": 0.254,
"num_input_tokens_seen": 4265174,
"step": 186,
"train_runtime": 561.4461,
"train_tokens_per_second": 7596.765
},
{
"epoch": 1.509090909090909,
"grad_norm": 1.9395222663879395,
"learning_rate": 5.102880658436214e-06,
"loss": 0.2269,
"num_input_tokens_seen": 4286374,
"step": 187,
"train_runtime": 563.42,
"train_tokens_per_second": 7607.777
},
{
"epoch": 1.5171717171717172,
"grad_norm": 1.9343959093093872,
"learning_rate": 5.020576131687243e-06,
"loss": 0.2284,
"num_input_tokens_seen": 4314534,
"step": 188,
"train_runtime": 565.9536,
"train_tokens_per_second": 7623.477
},
{
"epoch": 1.5252525252525253,
"grad_norm": 2.2199180126190186,
"learning_rate": 4.938271604938272e-06,
"loss": 0.2729,
"num_input_tokens_seen": 4334726,
"step": 189,
"train_runtime": 567.8322,
"train_tokens_per_second": 7633.815
},
{
"epoch": 1.5333333333333332,
"grad_norm": 2.422062397003174,
"learning_rate": 4.855967078189301e-06,
"loss": 0.2577,
"num_input_tokens_seen": 4357238,
"step": 190,
"train_runtime": 569.9123,
"train_tokens_per_second": 7645.453
},
{
"epoch": 1.5414141414141413,
"grad_norm": 2.182530641555786,
"learning_rate": 4.773662551440329e-06,
"loss": 0.2506,
"num_input_tokens_seen": 4380310,
"step": 191,
"train_runtime": 572.0127,
"train_tokens_per_second": 7657.714
},
{
"epoch": 1.5494949494949495,
"grad_norm": 1.9306634664535522,
"learning_rate": 4.691358024691358e-06,
"loss": 0.2492,
"num_input_tokens_seen": 4402598,
"step": 192,
"train_runtime": 574.0447,
"train_tokens_per_second": 7669.434
},
{
"epoch": 1.5575757575757576,
"grad_norm": 2.064788818359375,
"learning_rate": 4.6090534979423875e-06,
"loss": 0.2417,
"num_input_tokens_seen": 4426854,
"step": 193,
"train_runtime": 576.2391,
"train_tokens_per_second": 7682.321
},
{
"epoch": 1.5656565656565657,
"grad_norm": 2.1123790740966797,
"learning_rate": 4.526748971193416e-06,
"loss": 0.2702,
"num_input_tokens_seen": 4452422,
"step": 194,
"train_runtime": 578.5618,
"train_tokens_per_second": 7695.673
},
{
"epoch": 1.5737373737373739,
"grad_norm": 2.039179563522339,
"learning_rate": 4.444444444444444e-06,
"loss": 0.2523,
"num_input_tokens_seen": 4479574,
"step": 195,
"train_runtime": 581.0195,
"train_tokens_per_second": 7709.852
},
{
"epoch": 1.5818181818181818,
"grad_norm": 2.136936664581299,
"learning_rate": 4.362139917695473e-06,
"loss": 0.2797,
"num_input_tokens_seen": 4499862,
"step": 196,
"train_runtime": 582.8938,
"train_tokens_per_second": 7719.867
},
{
"epoch": 1.58989898989899,
"grad_norm": 2.0336132049560547,
"learning_rate": 4.2798353909465025e-06,
"loss": 0.2496,
"num_input_tokens_seen": 4522614,
"step": 197,
"train_runtime": 584.992,
"train_tokens_per_second": 7731.07
},
{
"epoch": 1.5979797979797978,
"grad_norm": 1.997153639793396,
"learning_rate": 4.197530864197531e-06,
"loss": 0.2318,
"num_input_tokens_seen": 4544022,
"step": 198,
"train_runtime": 586.9586,
"train_tokens_per_second": 7741.64
},
{
"epoch": 1.606060606060606,
"grad_norm": 1.994828224182129,
"learning_rate": 4.11522633744856e-06,
"loss": 0.2436,
"num_input_tokens_seen": 4566198,
"step": 199,
"train_runtime": 588.9959,
"train_tokens_per_second": 7752.512
},
{
"epoch": 1.614141414141414,
"grad_norm": 2.174928665161133,
"learning_rate": 4.032921810699589e-06,
"loss": 0.2769,
"num_input_tokens_seen": 4588070,
"step": 200,
"train_runtime": 590.9965,
"train_tokens_per_second": 7763.277
},
{
"epoch": 1.614141414141414,
"eval_loss": 0.2970900535583496,
"eval_runtime": 7.1151,
"eval_samples_per_second": 123.539,
"eval_steps_per_second": 7.73,
"num_input_tokens_seen": 4588070,
"step": 200
},
{
"epoch": 1.6222222222222222,
"grad_norm": 2.186704158782959,
"learning_rate": 3.9506172839506175e-06,
"loss": 0.2691,
"num_input_tokens_seen": 4612646,
"step": 201,
"train_runtime": 600.3639,
"train_tokens_per_second": 7683.084
},
{
"epoch": 1.6303030303030304,
"grad_norm": 2.1499741077423096,
"learning_rate": 3.868312757201647e-06,
"loss": 0.2562,
"num_input_tokens_seen": 4633446,
"step": 202,
"train_runtime": 602.3025,
"train_tokens_per_second": 7692.889
},
{
"epoch": 1.6383838383838385,
"grad_norm": 2.155334711074829,
"learning_rate": 3.786008230452675e-06,
"loss": 0.2389,
"num_input_tokens_seen": 4656278,
"step": 203,
"train_runtime": 604.4073,
"train_tokens_per_second": 7703.875
},
{
"epoch": 1.6464646464646466,
"grad_norm": 2.1553854942321777,
"learning_rate": 3.7037037037037037e-06,
"loss": 0.2447,
"num_input_tokens_seen": 4678006,
"step": 204,
"train_runtime": 606.4147,
"train_tokens_per_second": 7714.203
},
{
"epoch": 1.6545454545454545,
"grad_norm": 2.211529493331909,
"learning_rate": 3.621399176954733e-06,
"loss": 0.2673,
"num_input_tokens_seen": 4701206,
"step": 205,
"train_runtime": 608.5378,
"train_tokens_per_second": 7725.414
},
{
"epoch": 1.6626262626262627,
"grad_norm": 1.99440336227417,
"learning_rate": 3.5390946502057617e-06,
"loss": 0.2631,
"num_input_tokens_seen": 4724646,
"step": 206,
"train_runtime": 610.695,
"train_tokens_per_second": 7736.507
},
{
"epoch": 1.6707070707070706,
"grad_norm": 2.078808307647705,
"learning_rate": 3.4567901234567904e-06,
"loss": 0.2474,
"num_input_tokens_seen": 4748998,
"step": 207,
"train_runtime": 612.9302,
"train_tokens_per_second": 7748.025
},
{
"epoch": 1.6787878787878787,
"grad_norm": 2.2216312885284424,
"learning_rate": 3.3744855967078196e-06,
"loss": 0.2523,
"num_input_tokens_seen": 4768294,
"step": 208,
"train_runtime": 614.7311,
"train_tokens_per_second": 7756.715
},
{
"epoch": 1.6868686868686869,
"grad_norm": 2.1256401538848877,
"learning_rate": 3.292181069958848e-06,
"loss": 0.2799,
"num_input_tokens_seen": 4792550,
"step": 209,
"train_runtime": 616.9493,
"train_tokens_per_second": 7768.143
},
{
"epoch": 1.694949494949495,
"grad_norm": 2.0942769050598145,
"learning_rate": 3.2098765432098767e-06,
"loss": 0.259,
"num_input_tokens_seen": 4816006,
"step": 210,
"train_runtime": 619.088,
"train_tokens_per_second": 7779.194
},
{
"epoch": 1.7030303030303031,
"grad_norm": 1.9659632444381714,
"learning_rate": 3.127572016460906e-06,
"loss": 0.271,
"num_input_tokens_seen": 4839222,
"step": 211,
"train_runtime": 639.404,
"train_tokens_per_second": 7568.332
},
{
"epoch": 1.7111111111111112,
"grad_norm": 1.9326211214065552,
"learning_rate": 3.0452674897119346e-06,
"loss": 0.2437,
"num_input_tokens_seen": 4862822,
"step": 212,
"train_runtime": 641.5123,
"train_tokens_per_second": 7580.247
},
{
"epoch": 1.7191919191919192,
"grad_norm": 2.3900415897369385,
"learning_rate": 2.962962962962963e-06,
"loss": 0.3026,
"num_input_tokens_seen": 4884582,
"step": 213,
"train_runtime": 643.5091,
"train_tokens_per_second": 7590.541
},
{
"epoch": 1.7272727272727273,
"grad_norm": 2.0574638843536377,
"learning_rate": 2.880658436213992e-06,
"loss": 0.2525,
"num_input_tokens_seen": 4909174,
"step": 214,
"train_runtime": 645.7213,
"train_tokens_per_second": 7602.62
},
{
"epoch": 1.7353535353535352,
"grad_norm": 2.039299726486206,
"learning_rate": 2.798353909465021e-06,
"loss": 0.2637,
"num_input_tokens_seen": 4933798,
"step": 215,
"train_runtime": 647.9549,
"train_tokens_per_second": 7614.416
},
{
"epoch": 1.7434343434343433,
"grad_norm": 2.1611974239349365,
"learning_rate": 2.7160493827160496e-06,
"loss": 0.2601,
"num_input_tokens_seen": 4952742,
"step": 216,
"train_runtime": 649.7285,
"train_tokens_per_second": 7622.787
},
{
"epoch": 1.7515151515151515,
"grad_norm": 1.8820812702178955,
"learning_rate": 2.6337448559670788e-06,
"loss": 0.2407,
"num_input_tokens_seen": 4976246,
"step": 217,
"train_runtime": 651.852,
"train_tokens_per_second": 7634.012
},
{
"epoch": 1.7595959595959596,
"grad_norm": 2.016808271408081,
"learning_rate": 2.551440329218107e-06,
"loss": 0.2237,
"num_input_tokens_seen": 4995798,
"step": 218,
"train_runtime": 653.6727,
"train_tokens_per_second": 7642.66
},
{
"epoch": 1.7676767676767677,
"grad_norm": 2.027350902557373,
"learning_rate": 2.469135802469136e-06,
"loss": 0.2408,
"num_input_tokens_seen": 5018838,
"step": 219,
"train_runtime": 655.7795,
"train_tokens_per_second": 7653.241
},
{
"epoch": 1.7757575757575759,
"grad_norm": 2.164444923400879,
"learning_rate": 2.3868312757201646e-06,
"loss": 0.2154,
"num_input_tokens_seen": 5041782,
"step": 220,
"train_runtime": 657.8444,
"train_tokens_per_second": 7664.094
},
{
"epoch": 1.783838383838384,
"grad_norm": 2.082343339920044,
"learning_rate": 2.3045267489711937e-06,
"loss": 0.2569,
"num_input_tokens_seen": 5063478,
"step": 221,
"train_runtime": 659.8611,
"train_tokens_per_second": 7673.552
},
{
"epoch": 1.791919191919192,
"grad_norm": 2.043057680130005,
"learning_rate": 2.222222222222222e-06,
"loss": 0.2536,
"num_input_tokens_seen": 5085526,
"step": 222,
"train_runtime": 661.8702,
"train_tokens_per_second": 7683.57
},
{
"epoch": 1.8,
"grad_norm": 1.9899940490722656,
"learning_rate": 2.1399176954732512e-06,
"loss": 0.2755,
"num_input_tokens_seen": 5109430,
"step": 223,
"train_runtime": 664.0648,
"train_tokens_per_second": 7694.173
},
{
"epoch": 1.808080808080808,
"grad_norm": 2.1286203861236572,
"learning_rate": 2.05761316872428e-06,
"loss": 0.2391,
"num_input_tokens_seen": 5132182,
"step": 224,
"train_runtime": 666.1433,
"train_tokens_per_second": 7704.321
},
{
"epoch": 1.816161616161616,
"grad_norm": 1.9586842060089111,
"learning_rate": 1.9753086419753087e-06,
"loss": 0.2511,
"num_input_tokens_seen": 5153622,
"step": 225,
"train_runtime": 668.1036,
"train_tokens_per_second": 7713.807
},
{
"epoch": 1.816161616161616,
"eval_loss": 0.29719212651252747,
"eval_runtime": 7.0733,
"eval_samples_per_second": 124.27,
"eval_steps_per_second": 7.776,
"num_input_tokens_seen": 5153622,
"step": 225
},
{
"epoch": 1.8242424242424242,
"grad_norm": 2.056194543838501,
"learning_rate": 1.8930041152263375e-06,
"loss": 0.239,
"num_input_tokens_seen": 5178470,
"step": 226,
"train_runtime": 677.4315,
"train_tokens_per_second": 7644.27
},
{
"epoch": 1.8323232323232324,
"grad_norm": 2.03861403465271,
"learning_rate": 1.8106995884773665e-06,
"loss": 0.2453,
"num_input_tokens_seen": 5199062,
"step": 227,
"train_runtime": 679.3306,
"train_tokens_per_second": 7653.214
},
{
"epoch": 1.8404040404040405,
"grad_norm": 2.454902410507202,
"learning_rate": 1.7283950617283952e-06,
"loss": 0.2815,
"num_input_tokens_seen": 5218134,
"step": 228,
"train_runtime": 681.1112,
"train_tokens_per_second": 7661.207
},
{
"epoch": 1.8484848484848486,
"grad_norm": 2.0664114952087402,
"learning_rate": 1.646090534979424e-06,
"loss": 0.2481,
"num_input_tokens_seen": 5242054,
"step": 229,
"train_runtime": 683.2902,
"train_tokens_per_second": 7671.783
},
{
"epoch": 1.8565656565656565,
"grad_norm": 2.1586387157440186,
"learning_rate": 1.563786008230453e-06,
"loss": 0.2255,
"num_input_tokens_seen": 5264518,
"step": 230,
"train_runtime": 685.3446,
"train_tokens_per_second": 7681.564
},
{
"epoch": 1.8646464646464647,
"grad_norm": 2.2115135192871094,
"learning_rate": 1.4814814814814815e-06,
"loss": 0.2941,
"num_input_tokens_seen": 5284374,
"step": 231,
"train_runtime": 687.1947,
"train_tokens_per_second": 7689.777
},
{
"epoch": 1.8727272727272726,
"grad_norm": 1.9213886260986328,
"learning_rate": 1.3991769547325104e-06,
"loss": 0.2309,
"num_input_tokens_seen": 5303622,
"step": 232,
"train_runtime": 688.9977,
"train_tokens_per_second": 7697.591
},
{
"epoch": 1.8808080808080807,
"grad_norm": 1.919615387916565,
"learning_rate": 1.3168724279835394e-06,
"loss": 0.2332,
"num_input_tokens_seen": 5329718,
"step": 233,
"train_runtime": 691.3575,
"train_tokens_per_second": 7709.062
},
{
"epoch": 1.8888888888888888,
"grad_norm": 1.9546780586242676,
"learning_rate": 1.234567901234568e-06,
"loss": 0.2468,
"num_input_tokens_seen": 5349718,
"step": 234,
"train_runtime": 693.227,
"train_tokens_per_second": 7717.123
},
{
"epoch": 1.896969696969697,
"grad_norm": 2.1279263496398926,
"learning_rate": 1.1522633744855969e-06,
"loss": 0.2711,
"num_input_tokens_seen": 5369638,
"step": 235,
"train_runtime": 695.0864,
"train_tokens_per_second": 7725.137
},
{
"epoch": 1.905050505050505,
"grad_norm": 2.0568149089813232,
"learning_rate": 1.0699588477366256e-06,
"loss": 0.262,
"num_input_tokens_seen": 5392726,
"step": 236,
"train_runtime": 697.1851,
"train_tokens_per_second": 7734.999
},
{
"epoch": 1.9131313131313132,
"grad_norm": 2.307243824005127,
"learning_rate": 9.876543209876544e-07,
"loss": 0.2773,
"num_input_tokens_seen": 5412470,
"step": 237,
"train_runtime": 699.0602,
"train_tokens_per_second": 7742.495
},
{
"epoch": 1.9212121212121214,
"grad_norm": 2.0928726196289062,
"learning_rate": 9.053497942386832e-07,
"loss": 0.2715,
"num_input_tokens_seen": 5437894,
"step": 238,
"train_runtime": 701.3562,
"train_tokens_per_second": 7753.398
},
{
"epoch": 1.9292929292929293,
"grad_norm": 2.1170663833618164,
"learning_rate": 8.23045267489712e-07,
"loss": 0.2814,
"num_input_tokens_seen": 5461686,
"step": 239,
"train_runtime": 703.5235,
"train_tokens_per_second": 7763.331
},
{
"epoch": 1.9373737373737374,
"grad_norm": 1.9261893033981323,
"learning_rate": 7.407407407407407e-07,
"loss": 0.2426,
"num_input_tokens_seen": 5486054,
"step": 240,
"train_runtime": 705.7339,
"train_tokens_per_second": 7773.545
},
{
"epoch": 1.9454545454545453,
"grad_norm": 2.053776741027832,
"learning_rate": 6.584362139917697e-07,
"loss": 0.2712,
"num_input_tokens_seen": 5509142,
"step": 241,
"train_runtime": 726.1192,
"train_tokens_per_second": 7587.104
},
{
"epoch": 1.9535353535353535,
"grad_norm": 1.9918407201766968,
"learning_rate": 5.761316872427984e-07,
"loss": 0.2019,
"num_input_tokens_seen": 5528598,
"step": 242,
"train_runtime": 727.9519,
"train_tokens_per_second": 7594.73
},
{
"epoch": 1.9616161616161616,
"grad_norm": 1.8533083200454712,
"learning_rate": 4.938271604938272e-07,
"loss": 0.2358,
"num_input_tokens_seen": 5551926,
"step": 243,
"train_runtime": 730.0608,
"train_tokens_per_second": 7604.744
},
{
"epoch": 1.9696969696969697,
"grad_norm": 1.9955955743789673,
"learning_rate": 4.11522633744856e-07,
"loss": 0.2237,
"num_input_tokens_seen": 5574326,
"step": 244,
"train_runtime": 732.1133,
"train_tokens_per_second": 7614.021
},
{
"epoch": 1.9777777777777779,
"grad_norm": 2.0239830017089844,
"learning_rate": 3.2921810699588484e-07,
"loss": 0.2742,
"num_input_tokens_seen": 5598310,
"step": 245,
"train_runtime": 734.2562,
"train_tokens_per_second": 7624.464
},
{
"epoch": 1.985858585858586,
"grad_norm": 2.1352379322052,
"learning_rate": 2.469135802469136e-07,
"loss": 0.2701,
"num_input_tokens_seen": 5620534,
"step": 246,
"train_runtime": 736.283,
"train_tokens_per_second": 7633.66
},
{
"epoch": 1.993939393939394,
"grad_norm": 2.292893171310425,
"learning_rate": 1.6460905349794242e-07,
"loss": 0.2626,
"num_input_tokens_seen": 5640982,
"step": 247,
"train_runtime": 738.169,
"train_tokens_per_second": 7641.857
},
{
"epoch": 2.0,
"grad_norm": 2.7160730361938477,
"learning_rate": 8.230452674897121e-08,
"loss": 0.2577,
"num_input_tokens_seen": 5653442,
"step": 248,
"train_runtime": 739.3962,
"train_tokens_per_second": 7646.025
}
],
"logging_steps": 1,
"max_steps": 248,
"num_input_tokens_seen": 5653442,
"num_train_epochs": 2,
"save_steps": 30,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 9.412213509169152e+16,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}