Qwen2.5-7B-Instruct-Math-Unsloth / trainer_state.json
FormlessAI's picture
Upload folder using huggingface_hub
53684c1 verified
Raw
History Blame Contribute Delete
74.6 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.0,
"eval_steps": 25,
"global_step": 248,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.00808080808080808,
"grad_norm": 0.9913852214813232,
"learning_rate": 0.0,
"loss": 1.3233,
"num_input_tokens_seen": 24048,
"step": 1,
"train_runtime": 5.5427,
"train_tokens_per_second": 4338.668
},
{
"epoch": 0.01616161616161616,
"grad_norm": 1.0378535985946655,
"learning_rate": 4e-05,
"loss": 1.3425,
"num_input_tokens_seen": 48096,
"step": 2,
"train_runtime": 8.8764,
"train_tokens_per_second": 5418.441
},
{
"epoch": 0.024242424242424242,
"grad_norm": 1.0206665992736816,
"learning_rate": 8e-05,
"loss": 1.3516,
"num_input_tokens_seen": 68416,
"step": 3,
"train_runtime": 11.7535,
"train_tokens_per_second": 5820.919
},
{
"epoch": 0.03232323232323232,
"grad_norm": 1.2065541744232178,
"learning_rate": 0.00012,
"loss": 1.3039,
"num_input_tokens_seen": 90432,
"step": 4,
"train_runtime": 14.8511,
"train_tokens_per_second": 6089.231
},
{
"epoch": 0.04040404040404041,
"grad_norm": 1.3231337070465088,
"learning_rate": 0.00016,
"loss": 1.0488,
"num_input_tokens_seen": 110544,
"step": 5,
"train_runtime": 17.7213,
"train_tokens_per_second": 6237.921
},
{
"epoch": 0.048484848484848485,
"grad_norm": 0.7355687022209167,
"learning_rate": 0.0002,
"loss": 0.649,
"num_input_tokens_seen": 135584,
"step": 6,
"train_runtime": 21.4984,
"train_tokens_per_second": 6306.704
},
{
"epoch": 0.05656565656565657,
"grad_norm": 0.7402859926223755,
"learning_rate": 0.0001991769547325103,
"loss": 0.4857,
"num_input_tokens_seen": 159200,
"step": 7,
"train_runtime": 24.8086,
"train_tokens_per_second": 6417.137
},
{
"epoch": 0.06464646464646465,
"grad_norm": 0.5103421807289124,
"learning_rate": 0.0001983539094650206,
"loss": 0.371,
"num_input_tokens_seen": 182224,
"step": 8,
"train_runtime": 28.0753,
"train_tokens_per_second": 6490.548
},
{
"epoch": 0.07272727272727272,
"grad_norm": 0.3125229477882385,
"learning_rate": 0.00019753086419753085,
"loss": 0.3324,
"num_input_tokens_seen": 205472,
"step": 9,
"train_runtime": 31.3551,
"train_tokens_per_second": 6553.073
},
{
"epoch": 0.08080808080808081,
"grad_norm": 0.33310967683792114,
"learning_rate": 0.00019670781893004114,
"loss": 0.2862,
"num_input_tokens_seen": 230400,
"step": 10,
"train_runtime": 34.8863,
"train_tokens_per_second": 6604.316
},
{
"epoch": 0.08888888888888889,
"grad_norm": 0.33717748522758484,
"learning_rate": 0.00019588477366255146,
"loss": 0.2973,
"num_input_tokens_seen": 252736,
"step": 11,
"train_runtime": 38.0785,
"train_tokens_per_second": 6637.239
},
{
"epoch": 0.09696969696969697,
"grad_norm": 0.383858859539032,
"learning_rate": 0.00019506172839506175,
"loss": 0.2761,
"num_input_tokens_seen": 273584,
"step": 12,
"train_runtime": 41.108,
"train_tokens_per_second": 6655.248
},
{
"epoch": 0.10505050505050505,
"grad_norm": 0.33506128191947937,
"learning_rate": 0.00019423868312757204,
"loss": 0.3092,
"num_input_tokens_seen": 299968,
"step": 13,
"train_runtime": 44.8301,
"train_tokens_per_second": 6691.217
},
{
"epoch": 0.11313131313131314,
"grad_norm": 0.25691795349121094,
"learning_rate": 0.00019341563786008233,
"loss": 0.2943,
"num_input_tokens_seen": 322480,
"step": 14,
"train_runtime": 48.0773,
"train_tokens_per_second": 6707.535
},
{
"epoch": 0.12121212121212122,
"grad_norm": 0.23056800663471222,
"learning_rate": 0.0001925925925925926,
"loss": 0.2575,
"num_input_tokens_seen": 344864,
"step": 15,
"train_runtime": 51.2647,
"train_tokens_per_second": 6727.124
},
{
"epoch": 0.1292929292929293,
"grad_norm": 0.2146308422088623,
"learning_rate": 0.00019176954732510288,
"loss": 0.2441,
"num_input_tokens_seen": 369296,
"step": 16,
"train_runtime": 54.7643,
"train_tokens_per_second": 6743.376
},
{
"epoch": 0.13737373737373737,
"grad_norm": 0.18066899478435516,
"learning_rate": 0.00019094650205761317,
"loss": 0.2686,
"num_input_tokens_seen": 390944,
"step": 17,
"train_runtime": 57.902,
"train_tokens_per_second": 6751.823
},
{
"epoch": 0.14545454545454545,
"grad_norm": 0.18266606330871582,
"learning_rate": 0.00019012345679012346,
"loss": 0.2484,
"num_input_tokens_seen": 414144,
"step": 18,
"train_runtime": 61.2046,
"train_tokens_per_second": 6766.553
},
{
"epoch": 0.15353535353535352,
"grad_norm": 0.18596097826957703,
"learning_rate": 0.00018930041152263375,
"loss": 0.2215,
"num_input_tokens_seen": 435840,
"step": 19,
"train_runtime": 64.3043,
"train_tokens_per_second": 6777.778
},
{
"epoch": 0.16161616161616163,
"grad_norm": 0.19186538457870483,
"learning_rate": 0.00018847736625514404,
"loss": 0.2181,
"num_input_tokens_seen": 459808,
"step": 20,
"train_runtime": 67.7619,
"train_tokens_per_second": 6785.644
},
{
"epoch": 0.1696969696969697,
"grad_norm": 0.1703331023454666,
"learning_rate": 0.00018765432098765433,
"loss": 0.2441,
"num_input_tokens_seen": 479504,
"step": 21,
"train_runtime": 70.6513,
"train_tokens_per_second": 6786.914
},
{
"epoch": 0.17777777777777778,
"grad_norm": 0.17710761725902557,
"learning_rate": 0.00018683127572016462,
"loss": 0.2475,
"num_input_tokens_seen": 505712,
"step": 22,
"train_runtime": 74.4032,
"train_tokens_per_second": 6796.911
},
{
"epoch": 0.18585858585858586,
"grad_norm": 0.18230487406253815,
"learning_rate": 0.0001860082304526749,
"loss": 0.2586,
"num_input_tokens_seen": 525456,
"step": 23,
"train_runtime": 77.2642,
"train_tokens_per_second": 6800.768
},
{
"epoch": 0.19393939393939394,
"grad_norm": 0.16953755915164948,
"learning_rate": 0.0001851851851851852,
"loss": 0.2548,
"num_input_tokens_seen": 548928,
"step": 24,
"train_runtime": 80.6542,
"train_tokens_per_second": 6805.941
},
{
"epoch": 0.20202020202020202,
"grad_norm": 0.1729792058467865,
"learning_rate": 0.0001843621399176955,
"loss": 0.221,
"num_input_tokens_seen": 568608,
"step": 25,
"train_runtime": 83.58,
"train_tokens_per_second": 6803.16
},
{
"epoch": 0.20202020202020202,
"eval_loss": 0.2138330042362213,
"eval_runtime": 15.9812,
"eval_samples_per_second": 55.002,
"eval_steps_per_second": 3.442,
"num_input_tokens_seen": 568608,
"step": 25
},
{
"epoch": 0.2101010101010101,
"grad_norm": 0.1425217092037201,
"learning_rate": 0.00018353909465020578,
"loss": 0.2036,
"num_input_tokens_seen": 592240,
"step": 26,
"train_runtime": 103.0213,
"train_tokens_per_second": 5748.712
},
{
"epoch": 0.21818181818181817,
"grad_norm": 0.1629820615053177,
"learning_rate": 0.00018271604938271605,
"loss": 0.1973,
"num_input_tokens_seen": 613168,
"step": 27,
"train_runtime": 106.1403,
"train_tokens_per_second": 5776.96
},
{
"epoch": 0.22626262626262628,
"grad_norm": 0.13308098912239075,
"learning_rate": 0.00018189300411522634,
"loss": 0.2178,
"num_input_tokens_seen": 637552,
"step": 28,
"train_runtime": 109.6485,
"train_tokens_per_second": 5814.508
},
{
"epoch": 0.23434343434343435,
"grad_norm": 0.13057714700698853,
"learning_rate": 0.00018106995884773663,
"loss": 0.2244,
"num_input_tokens_seen": 661184,
"step": 29,
"train_runtime": 113.0702,
"train_tokens_per_second": 5847.551
},
{
"epoch": 0.24242424242424243,
"grad_norm": 0.15625949203968048,
"learning_rate": 0.00018024691358024692,
"loss": 0.2448,
"num_input_tokens_seen": 683072,
"step": 30,
"train_runtime": 116.2536,
"train_tokens_per_second": 5875.704
},
{
"epoch": 0.2505050505050505,
"grad_norm": 0.1479414701461792,
"learning_rate": 0.0001794238683127572,
"loss": 0.2132,
"num_input_tokens_seen": 703776,
"step": 31,
"train_runtime": 119.8681,
"train_tokens_per_second": 5871.251
},
{
"epoch": 0.2585858585858586,
"grad_norm": 0.12871505320072174,
"learning_rate": 0.0001786008230452675,
"loss": 0.2193,
"num_input_tokens_seen": 729584,
"step": 32,
"train_runtime": 123.5834,
"train_tokens_per_second": 5903.574
},
{
"epoch": 0.26666666666666666,
"grad_norm": 0.13625787198543549,
"learning_rate": 0.00017777777777777779,
"loss": 0.2572,
"num_input_tokens_seen": 752672,
"step": 33,
"train_runtime": 126.9484,
"train_tokens_per_second": 5928.961
},
{
"epoch": 0.27474747474747474,
"grad_norm": 0.13514648377895355,
"learning_rate": 0.00017695473251028808,
"loss": 0.1983,
"num_input_tokens_seen": 776672,
"step": 34,
"train_runtime": 130.4118,
"train_tokens_per_second": 5955.537
},
{
"epoch": 0.2828282828282828,
"grad_norm": 0.13971051573753357,
"learning_rate": 0.00017613168724279837,
"loss": 0.2283,
"num_input_tokens_seen": 801296,
"step": 35,
"train_runtime": 133.967,
"train_tokens_per_second": 5981.294
},
{
"epoch": 0.2909090909090909,
"grad_norm": 0.1429297775030136,
"learning_rate": 0.00017530864197530866,
"loss": 0.199,
"num_input_tokens_seen": 822368,
"step": 36,
"train_runtime": 137.0476,
"train_tokens_per_second": 6000.599
},
{
"epoch": 0.298989898989899,
"grad_norm": 0.13625267148017883,
"learning_rate": 0.00017448559670781895,
"loss": 0.1851,
"num_input_tokens_seen": 848928,
"step": 37,
"train_runtime": 140.8511,
"train_tokens_per_second": 6027.132
},
{
"epoch": 0.30707070707070705,
"grad_norm": 0.13639648258686066,
"learning_rate": 0.00017366255144032924,
"loss": 0.1784,
"num_input_tokens_seen": 870672,
"step": 38,
"train_runtime": 143.9915,
"train_tokens_per_second": 6046.692
},
{
"epoch": 0.3151515151515151,
"grad_norm": 0.15709735453128815,
"learning_rate": 0.0001728395061728395,
"loss": 0.2379,
"num_input_tokens_seen": 892064,
"step": 39,
"train_runtime": 147.1192,
"train_tokens_per_second": 6063.547
},
{
"epoch": 0.32323232323232326,
"grad_norm": 0.13749410212039948,
"learning_rate": 0.0001720164609053498,
"loss": 0.2086,
"num_input_tokens_seen": 915680,
"step": 40,
"train_runtime": 150.5405,
"train_tokens_per_second": 6082.617
},
{
"epoch": 0.33131313131313134,
"grad_norm": 0.15497097373008728,
"learning_rate": 0.00017119341563786008,
"loss": 0.2155,
"num_input_tokens_seen": 935216,
"step": 41,
"train_runtime": 153.3826,
"train_tokens_per_second": 6097.277
},
{
"epoch": 0.3393939393939394,
"grad_norm": 0.14246957004070282,
"learning_rate": 0.00017037037037037037,
"loss": 0.1926,
"num_input_tokens_seen": 956864,
"step": 42,
"train_runtime": 156.5384,
"train_tokens_per_second": 6112.648
},
{
"epoch": 0.3474747474747475,
"grad_norm": 0.1377769261598587,
"learning_rate": 0.00016954732510288066,
"loss": 0.2117,
"num_input_tokens_seen": 981440,
"step": 43,
"train_runtime": 160.0454,
"train_tokens_per_second": 6132.259
},
{
"epoch": 0.35555555555555557,
"grad_norm": 0.1453401744365692,
"learning_rate": 0.00016872427983539098,
"loss": 0.1787,
"num_input_tokens_seen": 1001232,
"step": 44,
"train_runtime": 162.9716,
"train_tokens_per_second": 6143.599
},
{
"epoch": 0.36363636363636365,
"grad_norm": 0.13512200117111206,
"learning_rate": 0.00016790123456790124,
"loss": 0.1778,
"num_input_tokens_seen": 1027680,
"step": 45,
"train_runtime": 166.7953,
"train_tokens_per_second": 6161.325
},
{
"epoch": 0.3717171717171717,
"grad_norm": 0.14032725989818573,
"learning_rate": 0.00016707818930041153,
"loss": 0.2622,
"num_input_tokens_seen": 1049968,
"step": 46,
"train_runtime": 170.0243,
"train_tokens_per_second": 6175.401
},
{
"epoch": 0.3797979797979798,
"grad_norm": 0.13695235550403595,
"learning_rate": 0.00016625514403292182,
"loss": 0.2172,
"num_input_tokens_seen": 1071840,
"step": 47,
"train_runtime": 173.2045,
"train_tokens_per_second": 6188.291
},
{
"epoch": 0.3878787878787879,
"grad_norm": 0.14571040868759155,
"learning_rate": 0.0001654320987654321,
"loss": 0.1682,
"num_input_tokens_seen": 1092864,
"step": 48,
"train_runtime": 176.2872,
"train_tokens_per_second": 6199.339
},
{
"epoch": 0.39595959595959596,
"grad_norm": 0.13497225940227509,
"learning_rate": 0.0001646090534979424,
"loss": 0.2167,
"num_input_tokens_seen": 1117040,
"step": 49,
"train_runtime": 179.7447,
"train_tokens_per_second": 6214.592
},
{
"epoch": 0.40404040404040403,
"grad_norm": 0.13479158282279968,
"learning_rate": 0.0001637860082304527,
"loss": 0.2188,
"num_input_tokens_seen": 1140240,
"step": 50,
"train_runtime": 183.112,
"train_tokens_per_second": 6227.007
},
{
"epoch": 0.40404040404040403,
"eval_loss": 0.19270148873329163,
"eval_runtime": 15.9678,
"eval_samples_per_second": 55.048,
"eval_steps_per_second": 3.444,
"num_input_tokens_seen": 1140240,
"step": 50
},
{
"epoch": 0.4121212121212121,
"grad_norm": 0.14810238778591156,
"learning_rate": 0.00016296296296296295,
"loss": 0.1908,
"num_input_tokens_seen": 1161104,
"step": 51,
"train_runtime": 202.1269,
"train_tokens_per_second": 5744.431
},
{
"epoch": 0.4202020202020202,
"grad_norm": 0.12631717324256897,
"learning_rate": 0.00016213991769547324,
"loss": 0.2194,
"num_input_tokens_seen": 1189328,
"step": 52,
"train_runtime": 206.1876,
"train_tokens_per_second": 5768.183
},
{
"epoch": 0.42828282828282827,
"grad_norm": 0.12934885919094086,
"learning_rate": 0.00016131687242798353,
"loss": 0.1682,
"num_input_tokens_seen": 1211120,
"step": 53,
"train_runtime": 209.3667,
"train_tokens_per_second": 5784.684
},
{
"epoch": 0.43636363636363634,
"grad_norm": 0.1369091421365738,
"learning_rate": 0.00016049382716049385,
"loss": 0.1882,
"num_input_tokens_seen": 1234080,
"step": 54,
"train_runtime": 212.7157,
"train_tokens_per_second": 5801.546
},
{
"epoch": 0.4444444444444444,
"grad_norm": 0.14891834557056427,
"learning_rate": 0.00015967078189300414,
"loss": 0.1898,
"num_input_tokens_seen": 1256880,
"step": 55,
"train_runtime": 216.0146,
"train_tokens_per_second": 5818.495
},
{
"epoch": 0.45252525252525255,
"grad_norm": 0.15192829072475433,
"learning_rate": 0.00015884773662551443,
"loss": 0.2452,
"num_input_tokens_seen": 1281376,
"step": 56,
"train_runtime": 219.5282,
"train_tokens_per_second": 5836.954
},
{
"epoch": 0.46060606060606063,
"grad_norm": 0.13381753861904144,
"learning_rate": 0.0001580246913580247,
"loss": 0.1983,
"num_input_tokens_seen": 1309216,
"step": 57,
"train_runtime": 223.5427,
"train_tokens_per_second": 5856.67
},
{
"epoch": 0.4686868686868687,
"grad_norm": 0.14824049174785614,
"learning_rate": 0.00015720164609053498,
"loss": 0.2358,
"num_input_tokens_seen": 1331120,
"step": 58,
"train_runtime": 226.7435,
"train_tokens_per_second": 5870.599
},
{
"epoch": 0.4767676767676768,
"grad_norm": 0.15301313996315002,
"learning_rate": 0.00015637860082304527,
"loss": 0.1871,
"num_input_tokens_seen": 1354976,
"step": 59,
"train_runtime": 230.1754,
"train_tokens_per_second": 5886.711
},
{
"epoch": 0.48484848484848486,
"grad_norm": 0.1360855996608734,
"learning_rate": 0.00015555555555555556,
"loss": 0.2078,
"num_input_tokens_seen": 1376976,
"step": 60,
"train_runtime": 233.3715,
"train_tokens_per_second": 5900.36
},
{
"epoch": 0.49292929292929294,
"grad_norm": 0.1479628086090088,
"learning_rate": 0.00015473251028806585,
"loss": 0.2039,
"num_input_tokens_seen": 1397952,
"step": 61,
"train_runtime": 236.9762,
"train_tokens_per_second": 5899.125
},
{
"epoch": 0.501010101010101,
"grad_norm": 0.13906534016132355,
"learning_rate": 0.00015390946502057614,
"loss": 0.1926,
"num_input_tokens_seen": 1417712,
"step": 62,
"train_runtime": 239.842,
"train_tokens_per_second": 5911.024
},
{
"epoch": 0.509090909090909,
"grad_norm": 0.1498580425977707,
"learning_rate": 0.0001530864197530864,
"loss": 0.1674,
"num_input_tokens_seen": 1438544,
"step": 63,
"train_runtime": 242.9024,
"train_tokens_per_second": 5922.312
},
{
"epoch": 0.5171717171717172,
"grad_norm": 0.13896457850933075,
"learning_rate": 0.00015226337448559672,
"loss": 0.1779,
"num_input_tokens_seen": 1461776,
"step": 64,
"train_runtime": 246.286,
"train_tokens_per_second": 5935.278
},
{
"epoch": 0.5252525252525253,
"grad_norm": 0.15526247024536133,
"learning_rate": 0.000151440329218107,
"loss": 0.2209,
"num_input_tokens_seen": 1483600,
"step": 65,
"train_runtime": 249.4086,
"train_tokens_per_second": 5948.472
},
{
"epoch": 0.5333333333333333,
"grad_norm": 0.15172874927520752,
"learning_rate": 0.0001506172839506173,
"loss": 0.1939,
"num_input_tokens_seen": 1507280,
"step": 66,
"train_runtime": 252.8239,
"train_tokens_per_second": 5961.777
},
{
"epoch": 0.5414141414141415,
"grad_norm": 0.15608155727386475,
"learning_rate": 0.0001497942386831276,
"loss": 0.2115,
"num_input_tokens_seen": 1530176,
"step": 67,
"train_runtime": 256.1302,
"train_tokens_per_second": 5974.211
},
{
"epoch": 0.5494949494949495,
"grad_norm": 0.13221146166324615,
"learning_rate": 0.00014897119341563788,
"loss": 0.1864,
"num_input_tokens_seen": 1553520,
"step": 68,
"train_runtime": 259.5354,
"train_tokens_per_second": 5985.772
},
{
"epoch": 0.5575757575757576,
"grad_norm": 0.13630913197994232,
"learning_rate": 0.00014814814814814815,
"loss": 0.1888,
"num_input_tokens_seen": 1577728,
"step": 69,
"train_runtime": 263.0794,
"train_tokens_per_second": 5997.155
},
{
"epoch": 0.5656565656565656,
"grad_norm": 0.1588101089000702,
"learning_rate": 0.00014732510288065844,
"loss": 0.1622,
"num_input_tokens_seen": 1598448,
"step": 70,
"train_runtime": 266.1041,
"train_tokens_per_second": 6006.852
},
{
"epoch": 0.5737373737373738,
"grad_norm": 0.1479269117116928,
"learning_rate": 0.00014650205761316873,
"loss": 0.1665,
"num_input_tokens_seen": 1619616,
"step": 71,
"train_runtime": 269.2171,
"train_tokens_per_second": 6016.021
},
{
"epoch": 0.5818181818181818,
"grad_norm": 0.1633758842945099,
"learning_rate": 0.00014567901234567902,
"loss": 0.2066,
"num_input_tokens_seen": 1647504,
"step": 72,
"train_runtime": 273.2086,
"train_tokens_per_second": 6030.206
},
{
"epoch": 0.5898989898989899,
"grad_norm": 0.1569192260503769,
"learning_rate": 0.0001448559670781893,
"loss": 0.2209,
"num_input_tokens_seen": 1669600,
"step": 73,
"train_runtime": 276.4483,
"train_tokens_per_second": 6039.465
},
{
"epoch": 0.597979797979798,
"grad_norm": 0.15907315909862518,
"learning_rate": 0.0001440329218106996,
"loss": 0.203,
"num_input_tokens_seen": 1692464,
"step": 74,
"train_runtime": 279.7549,
"train_tokens_per_second": 6049.811
},
{
"epoch": 0.6060606060606061,
"grad_norm": 0.15339483320713043,
"learning_rate": 0.00014320987654320989,
"loss": 0.1902,
"num_input_tokens_seen": 1714544,
"step": 75,
"train_runtime": 282.9625,
"train_tokens_per_second": 6059.263
},
{
"epoch": 0.6060606060606061,
"eval_loss": 0.18341881036758423,
"eval_runtime": 15.9903,
"eval_samples_per_second": 54.971,
"eval_steps_per_second": 3.44,
"num_input_tokens_seen": 1714544,
"step": 75
},
{
"epoch": 0.6141414141414141,
"grad_norm": 0.1519935429096222,
"learning_rate": 0.00014238683127572018,
"loss": 0.1774,
"num_input_tokens_seen": 1734992,
"step": 76,
"train_runtime": 301.9584,
"train_tokens_per_second": 5745.799
},
{
"epoch": 0.6222222222222222,
"grad_norm": 0.1523190289735794,
"learning_rate": 0.00014156378600823047,
"loss": 0.188,
"num_input_tokens_seen": 1758528,
"step": 77,
"train_runtime": 305.3612,
"train_tokens_per_second": 5758.846
},
{
"epoch": 0.6303030303030303,
"grad_norm": 0.16023258864879608,
"learning_rate": 0.00014074074074074076,
"loss": 0.2015,
"num_input_tokens_seen": 1782768,
"step": 78,
"train_runtime": 308.8338,
"train_tokens_per_second": 5772.58
},
{
"epoch": 0.6383838383838384,
"grad_norm": 0.15232358872890472,
"learning_rate": 0.00013991769547325105,
"loss": 0.1844,
"num_input_tokens_seen": 1806000,
"step": 79,
"train_runtime": 312.204,
"train_tokens_per_second": 5784.679
},
{
"epoch": 0.6464646464646465,
"grad_norm": 0.15448316931724548,
"learning_rate": 0.00013909465020576134,
"loss": 0.1729,
"num_input_tokens_seen": 1833264,
"step": 80,
"train_runtime": 316.1144,
"train_tokens_per_second": 5799.368
},
{
"epoch": 0.6545454545454545,
"grad_norm": 0.16937431693077087,
"learning_rate": 0.0001382716049382716,
"loss": 0.2037,
"num_input_tokens_seen": 1855920,
"step": 81,
"train_runtime": 319.4445,
"train_tokens_per_second": 5809.835
},
{
"epoch": 0.6626262626262627,
"grad_norm": 0.1692294478416443,
"learning_rate": 0.0001374485596707819,
"loss": 0.2102,
"num_input_tokens_seen": 1877664,
"step": 82,
"train_runtime": 322.623,
"train_tokens_per_second": 5819.994
},
{
"epoch": 0.6707070707070707,
"grad_norm": 0.15476073324680328,
"learning_rate": 0.00013662551440329218,
"loss": 0.1601,
"num_input_tokens_seen": 1901152,
"step": 83,
"train_runtime": 326.007,
"train_tokens_per_second": 5831.63
},
{
"epoch": 0.6787878787878788,
"grad_norm": 0.1650950163602829,
"learning_rate": 0.00013580246913580247,
"loss": 0.2074,
"num_input_tokens_seen": 1927440,
"step": 84,
"train_runtime": 329.7391,
"train_tokens_per_second": 5845.348
},
{
"epoch": 0.6868686868686869,
"grad_norm": 0.17345544695854187,
"learning_rate": 0.00013497942386831276,
"loss": 0.1916,
"num_input_tokens_seen": 1951408,
"step": 85,
"train_runtime": 333.1884,
"train_tokens_per_second": 5856.771
},
{
"epoch": 0.694949494949495,
"grad_norm": 0.16704945266246796,
"learning_rate": 0.00013415637860082305,
"loss": 0.2071,
"num_input_tokens_seen": 1973200,
"step": 86,
"train_runtime": 336.3437,
"train_tokens_per_second": 5866.619
},
{
"epoch": 0.703030303030303,
"grad_norm": 0.14658761024475098,
"learning_rate": 0.00013333333333333334,
"loss": 0.228,
"num_input_tokens_seen": 1994528,
"step": 87,
"train_runtime": 339.4404,
"train_tokens_per_second": 5875.93
},
{
"epoch": 0.7111111111111111,
"grad_norm": 0.17460143566131592,
"learning_rate": 0.00013251028806584363,
"loss": 0.1777,
"num_input_tokens_seen": 2019248,
"step": 88,
"train_runtime": 343.0056,
"train_tokens_per_second": 5886.924
},
{
"epoch": 0.7191919191919192,
"grad_norm": 0.1555347740650177,
"learning_rate": 0.00013168724279835392,
"loss": 0.1718,
"num_input_tokens_seen": 2040592,
"step": 89,
"train_runtime": 346.1188,
"train_tokens_per_second": 5895.641
},
{
"epoch": 0.7272727272727273,
"grad_norm": 0.14311373233795166,
"learning_rate": 0.0001308641975308642,
"loss": 0.1703,
"num_input_tokens_seen": 2062032,
"step": 90,
"train_runtime": 349.2336,
"train_tokens_per_second": 5904.449
},
{
"epoch": 0.7353535353535353,
"grad_norm": 0.15284591913223267,
"learning_rate": 0.0001300411522633745,
"loss": 0.1685,
"num_input_tokens_seen": 2082368,
"step": 91,
"train_runtime": 352.7694,
"train_tokens_per_second": 5902.915
},
{
"epoch": 0.7434343434343434,
"grad_norm": 0.155190110206604,
"learning_rate": 0.00012921810699588476,
"loss": 0.1604,
"num_input_tokens_seen": 2104976,
"step": 92,
"train_runtime": 356.0443,
"train_tokens_per_second": 5912.118
},
{
"epoch": 0.7515151515151515,
"grad_norm": 0.15990827977657318,
"learning_rate": 0.00012839506172839505,
"loss": 0.1926,
"num_input_tokens_seen": 2125664,
"step": 93,
"train_runtime": 359.04,
"train_tokens_per_second": 5920.41
},
{
"epoch": 0.7595959595959596,
"grad_norm": 0.14356884360313416,
"learning_rate": 0.00012757201646090534,
"loss": 0.157,
"num_input_tokens_seen": 2151216,
"step": 94,
"train_runtime": 362.7537,
"train_tokens_per_second": 5930.238
},
{
"epoch": 0.7676767676767676,
"grad_norm": 0.16834881901741028,
"learning_rate": 0.00012674897119341563,
"loss": 0.1684,
"num_input_tokens_seen": 2174480,
"step": 95,
"train_runtime": 366.0908,
"train_tokens_per_second": 5939.729
},
{
"epoch": 0.7757575757575758,
"grad_norm": 0.15969020128250122,
"learning_rate": 0.00012592592592592592,
"loss": 0.1817,
"num_input_tokens_seen": 2198048,
"step": 96,
"train_runtime": 369.4885,
"train_tokens_per_second": 5948.894
},
{
"epoch": 0.7838383838383839,
"grad_norm": 0.17647744715213776,
"learning_rate": 0.00012510288065843624,
"loss": 0.1925,
"num_input_tokens_seen": 2218944,
"step": 97,
"train_runtime": 372.5447,
"train_tokens_per_second": 5956.182
},
{
"epoch": 0.7919191919191919,
"grad_norm": 0.15452450513839722,
"learning_rate": 0.0001242798353909465,
"loss": 0.2199,
"num_input_tokens_seen": 2244752,
"step": 98,
"train_runtime": 376.2965,
"train_tokens_per_second": 5965.381
},
{
"epoch": 0.8,
"grad_norm": 0.16536033153533936,
"learning_rate": 0.0001234567901234568,
"loss": 0.202,
"num_input_tokens_seen": 2267728,
"step": 99,
"train_runtime": 379.6467,
"train_tokens_per_second": 5973.259
},
{
"epoch": 0.8080808080808081,
"grad_norm": 0.15133647620677948,
"learning_rate": 0.00012263374485596708,
"loss": 0.177,
"num_input_tokens_seen": 2289328,
"step": 100,
"train_runtime": 382.7931,
"train_tokens_per_second": 5980.589
},
{
"epoch": 0.8080808080808081,
"eval_loss": 0.17801880836486816,
"eval_runtime": 15.9675,
"eval_samples_per_second": 55.049,
"eval_steps_per_second": 3.444,
"num_input_tokens_seen": 2289328,
"step": 100
},
{
"epoch": 0.8161616161616162,
"grad_norm": 0.1537664383649826,
"learning_rate": 0.00012181069958847737,
"loss": 0.2092,
"num_input_tokens_seen": 2313216,
"step": 101,
"train_runtime": 402.2143,
"train_tokens_per_second": 5751.203
},
{
"epoch": 0.8242424242424242,
"grad_norm": 0.15654610097408295,
"learning_rate": 0.00012098765432098766,
"loss": 0.1664,
"num_input_tokens_seen": 2333152,
"step": 102,
"train_runtime": 405.1177,
"train_tokens_per_second": 5759.195
},
{
"epoch": 0.8323232323232324,
"grad_norm": 0.15154822170734406,
"learning_rate": 0.00012016460905349795,
"loss": 0.2069,
"num_input_tokens_seen": 2355744,
"step": 103,
"train_runtime": 408.4074,
"train_tokens_per_second": 5768.123
},
{
"epoch": 0.8404040404040404,
"grad_norm": 0.16599127650260925,
"learning_rate": 0.00011934156378600823,
"loss": 0.2347,
"num_input_tokens_seen": 2376560,
"step": 104,
"train_runtime": 411.4246,
"train_tokens_per_second": 5776.418
},
{
"epoch": 0.8484848484848485,
"grad_norm": 0.1642574518918991,
"learning_rate": 0.00011851851851851852,
"loss": 0.185,
"num_input_tokens_seen": 2400896,
"step": 105,
"train_runtime": 414.9439,
"train_tokens_per_second": 5786.074
},
{
"epoch": 0.8565656565656565,
"grad_norm": 0.15395912528038025,
"learning_rate": 0.00011769547325102881,
"loss": 0.179,
"num_input_tokens_seen": 2423632,
"step": 106,
"train_runtime": 418.2763,
"train_tokens_per_second": 5794.332
},
{
"epoch": 0.8646464646464647,
"grad_norm": 0.16491572558879852,
"learning_rate": 0.0001168724279835391,
"loss": 0.2168,
"num_input_tokens_seen": 2448432,
"step": 107,
"train_runtime": 421.8552,
"train_tokens_per_second": 5803.963
},
{
"epoch": 0.8727272727272727,
"grad_norm": 0.16017423570156097,
"learning_rate": 0.00011604938271604939,
"loss": 0.1826,
"num_input_tokens_seen": 2470768,
"step": 108,
"train_runtime": 425.0496,
"train_tokens_per_second": 5812.893
},
{
"epoch": 0.8808080808080808,
"grad_norm": 0.14728578925132751,
"learning_rate": 0.00011522633744855968,
"loss": 0.1907,
"num_input_tokens_seen": 2494944,
"step": 109,
"train_runtime": 428.5398,
"train_tokens_per_second": 5821.965
},
{
"epoch": 0.8888888888888888,
"grad_norm": 0.17022450268268585,
"learning_rate": 0.00011440329218106996,
"loss": 0.2021,
"num_input_tokens_seen": 2515760,
"step": 110,
"train_runtime": 431.6001,
"train_tokens_per_second": 5828.914
},
{
"epoch": 0.896969696969697,
"grad_norm": 0.16193877160549164,
"learning_rate": 0.00011358024691358025,
"loss": 0.1559,
"num_input_tokens_seen": 2537792,
"step": 111,
"train_runtime": 434.8205,
"train_tokens_per_second": 5836.414
},
{
"epoch": 0.9050505050505051,
"grad_norm": 0.14079837501049042,
"learning_rate": 0.00011275720164609054,
"loss": 0.1667,
"num_input_tokens_seen": 2562032,
"step": 112,
"train_runtime": 438.3575,
"train_tokens_per_second": 5844.618
},
{
"epoch": 0.9131313131313131,
"grad_norm": 0.1725139021873474,
"learning_rate": 0.00011193415637860083,
"loss": 0.1913,
"num_input_tokens_seen": 2583760,
"step": 113,
"train_runtime": 441.5306,
"train_tokens_per_second": 5851.826
},
{
"epoch": 0.9212121212121213,
"grad_norm": 0.1663820445537567,
"learning_rate": 0.00011111111111111112,
"loss": 0.1441,
"num_input_tokens_seen": 2607776,
"step": 114,
"train_runtime": 445.0017,
"train_tokens_per_second": 5860.149
},
{
"epoch": 0.9292929292929293,
"grad_norm": 0.16796670854091644,
"learning_rate": 0.0001102880658436214,
"loss": 0.2076,
"num_input_tokens_seen": 2630208,
"step": 115,
"train_runtime": 448.275,
"train_tokens_per_second": 5867.398
},
{
"epoch": 0.9373737373737374,
"grad_norm": 0.16379429399967194,
"learning_rate": 0.00010946502057613168,
"loss": 0.1832,
"num_input_tokens_seen": 2650208,
"step": 116,
"train_runtime": 451.1977,
"train_tokens_per_second": 5873.718
},
{
"epoch": 0.9454545454545454,
"grad_norm": 0.1663283109664917,
"learning_rate": 0.00010864197530864197,
"loss": 0.2013,
"num_input_tokens_seen": 2672592,
"step": 117,
"train_runtime": 454.4485,
"train_tokens_per_second": 5880.957
},
{
"epoch": 0.9535353535353536,
"grad_norm": 0.16695767641067505,
"learning_rate": 0.00010781893004115226,
"loss": 0.1462,
"num_input_tokens_seen": 2698064,
"step": 118,
"train_runtime": 458.1001,
"train_tokens_per_second": 5889.682
},
{
"epoch": 0.9616161616161616,
"grad_norm": 0.1588376760482788,
"learning_rate": 0.00010699588477366255,
"loss": 0.1837,
"num_input_tokens_seen": 2719680,
"step": 119,
"train_runtime": 461.2512,
"train_tokens_per_second": 5896.31
},
{
"epoch": 0.9696969696969697,
"grad_norm": 0.1472574770450592,
"learning_rate": 0.00010617283950617284,
"loss": 0.1742,
"num_input_tokens_seen": 2742400,
"step": 120,
"train_runtime": 464.5791,
"train_tokens_per_second": 5902.978
},
{
"epoch": 0.9777777777777777,
"grad_norm": 0.17550979554653168,
"learning_rate": 0.00010534979423868315,
"loss": 0.1364,
"num_input_tokens_seen": 2766112,
"step": 121,
"train_runtime": 468.5285,
"train_tokens_per_second": 5903.829
},
{
"epoch": 0.9858585858585859,
"grad_norm": 0.15758642554283142,
"learning_rate": 0.00010452674897119341,
"loss": 0.1775,
"num_input_tokens_seen": 2787952,
"step": 122,
"train_runtime": 471.7104,
"train_tokens_per_second": 5910.304
},
{
"epoch": 0.9939393939393939,
"grad_norm": 0.16019918024539948,
"learning_rate": 0.0001037037037037037,
"loss": 0.2096,
"num_input_tokens_seen": 2811632,
"step": 123,
"train_runtime": 475.1248,
"train_tokens_per_second": 5917.671
},
{
"epoch": 1.0,
"grad_norm": 0.2007690817117691,
"learning_rate": 0.00010288065843621399,
"loss": 0.1646,
"num_input_tokens_seen": 2825206,
"step": 124,
"train_runtime": 477.1077,
"train_tokens_per_second": 5921.527
},
{
"epoch": 1.0080808080808081,
"grad_norm": 0.14078141748905182,
"learning_rate": 0.00010205761316872428,
"loss": 0.1363,
"num_input_tokens_seen": 2847206,
"step": 125,
"train_runtime": 480.3107,
"train_tokens_per_second": 5927.842
},
{
"epoch": 1.0080808080808081,
"eval_loss": 0.1743689626455307,
"eval_runtime": 15.9727,
"eval_samples_per_second": 55.031,
"eval_steps_per_second": 3.443,
"num_input_tokens_seen": 2847206,
"step": 125
},
{
"epoch": 1.0161616161616163,
"grad_norm": 0.14959807693958282,
"learning_rate": 0.00010123456790123458,
"loss": 0.1373,
"num_input_tokens_seen": 2867190,
"step": 126,
"train_runtime": 499.2365,
"train_tokens_per_second": 5743.15
},
{
"epoch": 1.0242424242424242,
"grad_norm": 0.14410553872585297,
"learning_rate": 0.00010041152263374487,
"loss": 0.1391,
"num_input_tokens_seen": 2888710,
"step": 127,
"train_runtime": 502.361,
"train_tokens_per_second": 5750.268
},
{
"epoch": 1.0323232323232323,
"grad_norm": 0.14210668206214905,
"learning_rate": 9.958847736625515e-05,
"loss": 0.1514,
"num_input_tokens_seen": 2913990,
"step": 128,
"train_runtime": 506.0209,
"train_tokens_per_second": 5758.636
},
{
"epoch": 1.0404040404040404,
"grad_norm": 0.14086109399795532,
"learning_rate": 9.876543209876543e-05,
"loss": 0.1384,
"num_input_tokens_seen": 2938246,
"step": 129,
"train_runtime": 509.5108,
"train_tokens_per_second": 5766.799
},
{
"epoch": 1.0484848484848486,
"grad_norm": 0.1444181203842163,
"learning_rate": 9.794238683127573e-05,
"loss": 0.1694,
"num_input_tokens_seen": 2962326,
"step": 130,
"train_runtime": 513.0283,
"train_tokens_per_second": 5774.196
},
{
"epoch": 1.0565656565656565,
"grad_norm": 0.15412774682044983,
"learning_rate": 9.711934156378602e-05,
"loss": 0.1657,
"num_input_tokens_seen": 2983126,
"step": 131,
"train_runtime": 516.07,
"train_tokens_per_second": 5780.468
},
{
"epoch": 1.0646464646464646,
"grad_norm": 0.1612967848777771,
"learning_rate": 9.62962962962963e-05,
"loss": 0.1738,
"num_input_tokens_seen": 3005606,
"step": 132,
"train_runtime": 519.3068,
"train_tokens_per_second": 5787.727
},
{
"epoch": 1.0727272727272728,
"grad_norm": 0.1550590842962265,
"learning_rate": 9.547325102880659e-05,
"loss": 0.1634,
"num_input_tokens_seen": 3027926,
"step": 133,
"train_runtime": 522.5599,
"train_tokens_per_second": 5794.41
},
{
"epoch": 1.0808080808080809,
"grad_norm": 0.1607086956501007,
"learning_rate": 9.465020576131688e-05,
"loss": 0.1507,
"num_input_tokens_seen": 3052294,
"step": 134,
"train_runtime": 526.0714,
"train_tokens_per_second": 5802.053
},
{
"epoch": 1.0888888888888888,
"grad_norm": 0.14786848425865173,
"learning_rate": 9.382716049382717e-05,
"loss": 0.1371,
"num_input_tokens_seen": 3073014,
"step": 135,
"train_runtime": 529.0875,
"train_tokens_per_second": 5808.139
},
{
"epoch": 1.096969696969697,
"grad_norm": 0.14476324617862701,
"learning_rate": 9.300411522633746e-05,
"loss": 0.1223,
"num_input_tokens_seen": 3095126,
"step": 136,
"train_runtime": 532.2833,
"train_tokens_per_second": 5814.809
},
{
"epoch": 1.105050505050505,
"grad_norm": 0.17048926651477814,
"learning_rate": 9.218106995884775e-05,
"loss": 0.1542,
"num_input_tokens_seen": 3116438,
"step": 137,
"train_runtime": 535.3914,
"train_tokens_per_second": 5820.859
},
{
"epoch": 1.1131313131313132,
"grad_norm": 0.14804477989673615,
"learning_rate": 9.135802469135802e-05,
"loss": 0.129,
"num_input_tokens_seen": 3139174,
"step": 138,
"train_runtime": 538.6924,
"train_tokens_per_second": 5827.396
},
{
"epoch": 1.121212121212121,
"grad_norm": 0.14984357357025146,
"learning_rate": 9.053497942386831e-05,
"loss": 0.139,
"num_input_tokens_seen": 3165206,
"step": 139,
"train_runtime": 542.4266,
"train_tokens_per_second": 5835.27
},
{
"epoch": 1.1292929292929292,
"grad_norm": 0.1541273444890976,
"learning_rate": 8.97119341563786e-05,
"loss": 0.139,
"num_input_tokens_seen": 3189942,
"step": 140,
"train_runtime": 545.9937,
"train_tokens_per_second": 5842.452
},
{
"epoch": 1.1373737373737374,
"grad_norm": 0.1608126163482666,
"learning_rate": 8.888888888888889e-05,
"loss": 0.1145,
"num_input_tokens_seen": 3213878,
"step": 141,
"train_runtime": 549.4275,
"train_tokens_per_second": 5849.503
},
{
"epoch": 1.1454545454545455,
"grad_norm": 0.15520773828029633,
"learning_rate": 8.806584362139918e-05,
"loss": 0.185,
"num_input_tokens_seen": 3236806,
"step": 142,
"train_runtime": 552.7146,
"train_tokens_per_second": 5856.197
},
{
"epoch": 1.1535353535353536,
"grad_norm": 0.17958641052246094,
"learning_rate": 8.724279835390947e-05,
"loss": 0.1744,
"num_input_tokens_seen": 3258822,
"step": 143,
"train_runtime": 555.9036,
"train_tokens_per_second": 5862.207
},
{
"epoch": 1.1616161616161615,
"grad_norm": 0.15695422887802124,
"learning_rate": 8.641975308641975e-05,
"loss": 0.1292,
"num_input_tokens_seen": 3280694,
"step": 144,
"train_runtime": 559.0968,
"train_tokens_per_second": 5867.846
},
{
"epoch": 1.1696969696969697,
"grad_norm": 0.15811026096343994,
"learning_rate": 8.559670781893004e-05,
"loss": 0.1366,
"num_input_tokens_seen": 3305894,
"step": 145,
"train_runtime": 562.6785,
"train_tokens_per_second": 5875.281
},
{
"epoch": 1.1777777777777778,
"grad_norm": 0.18241523206233978,
"learning_rate": 8.477366255144033e-05,
"loss": 0.1277,
"num_input_tokens_seen": 3327526,
"step": 146,
"train_runtime": 565.8579,
"train_tokens_per_second": 5880.498
},
{
"epoch": 1.185858585858586,
"grad_norm": 0.18478727340698242,
"learning_rate": 8.395061728395062e-05,
"loss": 0.1556,
"num_input_tokens_seen": 3349414,
"step": 147,
"train_runtime": 569.0152,
"train_tokens_per_second": 5886.335
},
{
"epoch": 1.1939393939393939,
"grad_norm": 0.18235282599925995,
"learning_rate": 8.312757201646091e-05,
"loss": 0.185,
"num_input_tokens_seen": 3373782,
"step": 148,
"train_runtime": 572.5108,
"train_tokens_per_second": 5892.958
},
{
"epoch": 1.202020202020202,
"grad_norm": 0.16526545584201813,
"learning_rate": 8.23045267489712e-05,
"loss": 0.1417,
"num_input_tokens_seen": 3397254,
"step": 149,
"train_runtime": 575.9284,
"train_tokens_per_second": 5898.744
},
{
"epoch": 1.2101010101010101,
"grad_norm": 0.1843811720609665,
"learning_rate": 8.148148148148148e-05,
"loss": 0.1289,
"num_input_tokens_seen": 3420102,
"step": 150,
"train_runtime": 579.2683,
"train_tokens_per_second": 5904.176
},
{
"epoch": 1.2101010101010101,
"eval_loss": 0.17398151755332947,
"eval_runtime": 15.974,
"eval_samples_per_second": 55.027,
"eval_steps_per_second": 3.443,
"num_input_tokens_seen": 3420102,
"step": 150
},
{
"epoch": 1.2181818181818183,
"grad_norm": 0.20147649943828583,
"learning_rate": 8.065843621399177e-05,
"loss": 0.1823,
"num_input_tokens_seen": 3440438,
"step": 151,
"train_runtime": 598.6689,
"train_tokens_per_second": 5746.813
},
{
"epoch": 1.2262626262626264,
"grad_norm": 0.16948151588439941,
"learning_rate": 7.983539094650207e-05,
"loss": 0.1352,
"num_input_tokens_seen": 3466054,
"step": 152,
"train_runtime": 602.3354,
"train_tokens_per_second": 5754.358
},
{
"epoch": 1.2343434343434343,
"grad_norm": 0.13926386833190918,
"learning_rate": 7.901234567901235e-05,
"loss": 0.1396,
"num_input_tokens_seen": 3492278,
"step": 153,
"train_runtime": 606.1274,
"train_tokens_per_second": 5761.624
},
{
"epoch": 1.2424242424242424,
"grad_norm": 0.1492907702922821,
"learning_rate": 7.818930041152264e-05,
"loss": 0.1222,
"num_input_tokens_seen": 3512582,
"step": 154,
"train_runtime": 609.1167,
"train_tokens_per_second": 5766.681
},
{
"epoch": 1.2505050505050506,
"grad_norm": 0.17096783220767975,
"learning_rate": 7.736625514403293e-05,
"loss": 0.1434,
"num_input_tokens_seen": 3535750,
"step": 155,
"train_runtime": 612.4626,
"train_tokens_per_second": 5773.005
},
{
"epoch": 1.2585858585858585,
"grad_norm": 0.1619611382484436,
"learning_rate": 7.65432098765432e-05,
"loss": 0.142,
"num_input_tokens_seen": 3559894,
"step": 156,
"train_runtime": 615.9667,
"train_tokens_per_second": 5779.361
},
{
"epoch": 1.2666666666666666,
"grad_norm": 0.18333695828914642,
"learning_rate": 7.57201646090535e-05,
"loss": 0.1433,
"num_input_tokens_seen": 3580390,
"step": 157,
"train_runtime": 618.9828,
"train_tokens_per_second": 5784.312
},
{
"epoch": 1.2747474747474747,
"grad_norm": 0.1673658788204193,
"learning_rate": 7.48971193415638e-05,
"loss": 0.1168,
"num_input_tokens_seen": 3601750,
"step": 158,
"train_runtime": 622.0976,
"train_tokens_per_second": 5789.686
},
{
"epoch": 1.2828282828282829,
"grad_norm": 0.16368548572063446,
"learning_rate": 7.407407407407407e-05,
"loss": 0.1345,
"num_input_tokens_seen": 3629030,
"step": 159,
"train_runtime": 625.9653,
"train_tokens_per_second": 5797.494
},
{
"epoch": 1.290909090909091,
"grad_norm": 0.18099236488342285,
"learning_rate": 7.325102880658436e-05,
"loss": 0.1503,
"num_input_tokens_seen": 3654358,
"step": 160,
"train_runtime": 629.6159,
"train_tokens_per_second": 5804.107
},
{
"epoch": 1.298989898989899,
"grad_norm": 0.17030303180217743,
"learning_rate": 7.242798353909465e-05,
"loss": 0.1414,
"num_input_tokens_seen": 3680758,
"step": 161,
"train_runtime": 633.4286,
"train_tokens_per_second": 5810.849
},
{
"epoch": 1.307070707070707,
"grad_norm": 0.1868920922279358,
"learning_rate": 7.160493827160494e-05,
"loss": 0.1348,
"num_input_tokens_seen": 3704022,
"step": 162,
"train_runtime": 636.8172,
"train_tokens_per_second": 5816.461
},
{
"epoch": 1.3151515151515152,
"grad_norm": 0.18310731649398804,
"learning_rate": 7.078189300411523e-05,
"loss": 0.1241,
"num_input_tokens_seen": 3727814,
"step": 163,
"train_runtime": 640.2506,
"train_tokens_per_second": 5822.429
},
{
"epoch": 1.3232323232323233,
"grad_norm": 0.188144713640213,
"learning_rate": 6.995884773662552e-05,
"loss": 0.1568,
"num_input_tokens_seen": 3749606,
"step": 164,
"train_runtime": 643.4135,
"train_tokens_per_second": 5827.677
},
{
"epoch": 1.3313131313131312,
"grad_norm": 0.19525550305843353,
"learning_rate": 6.91358024691358e-05,
"loss": 0.1781,
"num_input_tokens_seen": 3774710,
"step": 165,
"train_runtime": 647.0635,
"train_tokens_per_second": 5833.601
},
{
"epoch": 1.3393939393939394,
"grad_norm": 0.18591126799583435,
"learning_rate": 6.831275720164609e-05,
"loss": 0.1231,
"num_input_tokens_seen": 3793814,
"step": 166,
"train_runtime": 649.8581,
"train_tokens_per_second": 5837.911
},
{
"epoch": 1.3474747474747475,
"grad_norm": 0.19412674009799957,
"learning_rate": 6.748971193415638e-05,
"loss": 0.1545,
"num_input_tokens_seen": 3818662,
"step": 167,
"train_runtime": 653.4715,
"train_tokens_per_second": 5843.655
},
{
"epoch": 1.3555555555555556,
"grad_norm": 0.16812458634376526,
"learning_rate": 6.666666666666667e-05,
"loss": 0.1414,
"num_input_tokens_seen": 3841606,
"step": 168,
"train_runtime": 656.7714,
"train_tokens_per_second": 5849.228
},
{
"epoch": 1.3636363636363638,
"grad_norm": 0.18051378428936005,
"learning_rate": 6.584362139917696e-05,
"loss": 0.144,
"num_input_tokens_seen": 3863830,
"step": 169,
"train_runtime": 660.006,
"train_tokens_per_second": 5854.234
},
{
"epoch": 1.3717171717171717,
"grad_norm": 0.19069063663482666,
"learning_rate": 6.502057613168725e-05,
"loss": 0.1649,
"num_input_tokens_seen": 3886230,
"step": 170,
"train_runtime": 663.2462,
"train_tokens_per_second": 5859.408
},
{
"epoch": 1.3797979797979798,
"grad_norm": 0.18689148128032684,
"learning_rate": 6.419753086419753e-05,
"loss": 0.1425,
"num_input_tokens_seen": 3908982,
"step": 171,
"train_runtime": 666.5218,
"train_tokens_per_second": 5864.747
},
{
"epoch": 1.387878787878788,
"grad_norm": 0.14730970561504364,
"learning_rate": 6.337448559670782e-05,
"loss": 0.1336,
"num_input_tokens_seen": 3936150,
"step": 172,
"train_runtime": 670.4336,
"train_tokens_per_second": 5871.052
},
{
"epoch": 1.3959595959595958,
"grad_norm": 0.177509605884552,
"learning_rate": 6.255144032921812e-05,
"loss": 0.1545,
"num_input_tokens_seen": 3959430,
"step": 173,
"train_runtime": 673.8214,
"train_tokens_per_second": 5876.083
},
{
"epoch": 1.404040404040404,
"grad_norm": 0.17181722819805145,
"learning_rate": 6.17283950617284e-05,
"loss": 0.1462,
"num_input_tokens_seen": 3981126,
"step": 174,
"train_runtime": 677.031,
"train_tokens_per_second": 5880.271
},
{
"epoch": 1.412121212121212,
"grad_norm": 0.1883271485567093,
"learning_rate": 6.0905349794238687e-05,
"loss": 0.1511,
"num_input_tokens_seen": 4006118,
"step": 175,
"train_runtime": 680.6168,
"train_tokens_per_second": 5886.011
},
{
"epoch": 1.412121212121212,
"eval_loss": 0.1727769374847412,
"eval_runtime": 15.9835,
"eval_samples_per_second": 54.994,
"eval_steps_per_second": 3.441,
"num_input_tokens_seen": 4006118,
"step": 175
},
{
"epoch": 1.4202020202020202,
"grad_norm": 0.17214921116828918,
"learning_rate": 6.0082304526748977e-05,
"loss": 0.1669,
"num_input_tokens_seen": 4034054,
"step": 176,
"train_runtime": 700.6314,
"train_tokens_per_second": 5757.74
},
{
"epoch": 1.4282828282828284,
"grad_norm": 0.17713947594165802,
"learning_rate": 5.925925925925926e-05,
"loss": 0.1356,
"num_input_tokens_seen": 4058646,
"step": 177,
"train_runtime": 704.1834,
"train_tokens_per_second": 5763.62
},
{
"epoch": 1.4363636363636363,
"grad_norm": 0.18645597994327545,
"learning_rate": 5.843621399176955e-05,
"loss": 0.1573,
"num_input_tokens_seen": 4083414,
"step": 178,
"train_runtime": 707.7598,
"train_tokens_per_second": 5769.491
},
{
"epoch": 1.4444444444444444,
"grad_norm": 0.1776132434606552,
"learning_rate": 5.761316872427984e-05,
"loss": 0.1338,
"num_input_tokens_seen": 4107190,
"step": 179,
"train_runtime": 711.2238,
"train_tokens_per_second": 5774.821
},
{
"epoch": 1.4525252525252526,
"grad_norm": 0.1832626312971115,
"learning_rate": 5.679012345679012e-05,
"loss": 0.2298,
"num_input_tokens_seen": 4129958,
"step": 180,
"train_runtime": 714.5258,
"train_tokens_per_second": 5779.999
},
{
"epoch": 1.4606060606060607,
"grad_norm": 0.17791666090488434,
"learning_rate": 5.596707818930041e-05,
"loss": 0.1267,
"num_input_tokens_seen": 4153302,
"step": 181,
"train_runtime": 718.4279,
"train_tokens_per_second": 5781.098
},
{
"epoch": 1.4686868686868686,
"grad_norm": 0.18174052238464355,
"learning_rate": 5.51440329218107e-05,
"loss": 0.1311,
"num_input_tokens_seen": 4175222,
"step": 182,
"train_runtime": 721.5861,
"train_tokens_per_second": 5786.173
},
{
"epoch": 1.4767676767676767,
"grad_norm": 0.17272153496742249,
"learning_rate": 5.4320987654320986e-05,
"loss": 0.1454,
"num_input_tokens_seen": 4196966,
"step": 183,
"train_runtime": 724.781,
"train_tokens_per_second": 5790.668
},
{
"epoch": 1.4848484848484849,
"grad_norm": 0.18341264128684998,
"learning_rate": 5.3497942386831277e-05,
"loss": 0.1295,
"num_input_tokens_seen": 4222630,
"step": 184,
"train_runtime": 728.4765,
"train_tokens_per_second": 5796.522
},
{
"epoch": 1.492929292929293,
"grad_norm": 0.18532636761665344,
"learning_rate": 5.267489711934157e-05,
"loss": 0.1311,
"num_input_tokens_seen": 4243798,
"step": 185,
"train_runtime": 731.5451,
"train_tokens_per_second": 5801.143
},
{
"epoch": 1.5010101010101011,
"grad_norm": 0.19856366515159607,
"learning_rate": 5.185185185185185e-05,
"loss": 0.1532,
"num_input_tokens_seen": 4265174,
"step": 186,
"train_runtime": 734.668,
"train_tokens_per_second": 5805.581
},
{
"epoch": 1.509090909090909,
"grad_norm": 0.1887090802192688,
"learning_rate": 5.102880658436214e-05,
"loss": 0.108,
"num_input_tokens_seen": 4286374,
"step": 187,
"train_runtime": 737.8004,
"train_tokens_per_second": 5809.666
},
{
"epoch": 1.5171717171717172,
"grad_norm": 0.16914108395576477,
"learning_rate": 5.020576131687244e-05,
"loss": 0.1231,
"num_input_tokens_seen": 4314534,
"step": 188,
"train_runtime": 741.8365,
"train_tokens_per_second": 5816.017
},
{
"epoch": 1.5252525252525253,
"grad_norm": 0.207884281873703,
"learning_rate": 4.938271604938271e-05,
"loss": 0.1846,
"num_input_tokens_seen": 4334726,
"step": 189,
"train_runtime": 744.774,
"train_tokens_per_second": 5820.189
},
{
"epoch": 1.5333333333333332,
"grad_norm": 0.21083691716194153,
"learning_rate": 4.855967078189301e-05,
"loss": 0.1274,
"num_input_tokens_seen": 4357238,
"step": 190,
"train_runtime": 748.0199,
"train_tokens_per_second": 5825.029
},
{
"epoch": 1.5414141414141413,
"grad_norm": 0.18116632103919983,
"learning_rate": 4.773662551440329e-05,
"loss": 0.1457,
"num_input_tokens_seen": 4380310,
"step": 191,
"train_runtime": 751.3376,
"train_tokens_per_second": 5830.015
},
{
"epoch": 1.5494949494949495,
"grad_norm": 0.1774257868528366,
"learning_rate": 4.691358024691358e-05,
"loss": 0.1638,
"num_input_tokens_seen": 4402598,
"step": 192,
"train_runtime": 754.5705,
"train_tokens_per_second": 5834.575
},
{
"epoch": 1.5575757575757576,
"grad_norm": 0.17490142583847046,
"learning_rate": 4.609053497942387e-05,
"loss": 0.1287,
"num_input_tokens_seen": 4426854,
"step": 193,
"train_runtime": 758.0657,
"train_tokens_per_second": 5839.671
},
{
"epoch": 1.5656565656565657,
"grad_norm": 0.17895734310150146,
"learning_rate": 4.5267489711934157e-05,
"loss": 0.1565,
"num_input_tokens_seen": 4452422,
"step": 194,
"train_runtime": 761.7593,
"train_tokens_per_second": 5844.92
},
{
"epoch": 1.5737373737373739,
"grad_norm": 0.19911067187786102,
"learning_rate": 4.4444444444444447e-05,
"loss": 0.161,
"num_input_tokens_seen": 4479574,
"step": 195,
"train_runtime": 765.648,
"train_tokens_per_second": 5850.697
},
{
"epoch": 1.5818181818181818,
"grad_norm": 0.20772644877433777,
"learning_rate": 4.3621399176954737e-05,
"loss": 0.1791,
"num_input_tokens_seen": 4499862,
"step": 196,
"train_runtime": 768.5633,
"train_tokens_per_second": 5854.901
},
{
"epoch": 1.58989898989899,
"grad_norm": 0.20278632640838623,
"learning_rate": 4.279835390946502e-05,
"loss": 0.1221,
"num_input_tokens_seen": 4522614,
"step": 197,
"train_runtime": 771.8795,
"train_tokens_per_second": 5859.223
},
{
"epoch": 1.5979797979797978,
"grad_norm": 0.19286850094795227,
"learning_rate": 4.197530864197531e-05,
"loss": 0.1297,
"num_input_tokens_seen": 4544022,
"step": 198,
"train_runtime": 775.0258,
"train_tokens_per_second": 5863.059
},
{
"epoch": 1.606060606060606,
"grad_norm": 0.1876365840435028,
"learning_rate": 4.11522633744856e-05,
"loss": 0.1301,
"num_input_tokens_seen": 4566198,
"step": 199,
"train_runtime": 778.2557,
"train_tokens_per_second": 5867.221
},
{
"epoch": 1.614141414141414,
"grad_norm": 0.1976366490125656,
"learning_rate": 4.032921810699588e-05,
"loss": 0.1522,
"num_input_tokens_seen": 4588070,
"step": 200,
"train_runtime": 781.4257,
"train_tokens_per_second": 5871.409
},
{
"epoch": 1.614141414141414,
"eval_loss": 0.17329195141792297,
"eval_runtime": 15.9586,
"eval_samples_per_second": 55.08,
"eval_steps_per_second": 3.446,
"num_input_tokens_seen": 4588070,
"step": 200
},
{
"epoch": 1.6222222222222222,
"grad_norm": 0.2171986699104309,
"learning_rate": 3.950617283950617e-05,
"loss": 0.1527,
"num_input_tokens_seen": 4612646,
"step": 201,
"train_runtime": 800.9346,
"train_tokens_per_second": 5759.079
},
{
"epoch": 1.6303030303030304,
"grad_norm": 0.18816785514354706,
"learning_rate": 3.868312757201646e-05,
"loss": 0.1419,
"num_input_tokens_seen": 4633446,
"step": 202,
"train_runtime": 804.007,
"train_tokens_per_second": 5762.942
},
{
"epoch": 1.6383838383838385,
"grad_norm": 0.1965034157037735,
"learning_rate": 3.786008230452675e-05,
"loss": 0.1294,
"num_input_tokens_seen": 4656278,
"step": 203,
"train_runtime": 807.3253,
"train_tokens_per_second": 5767.536
},
{
"epoch": 1.6464646464646466,
"grad_norm": 0.20697784423828125,
"learning_rate": 3.7037037037037037e-05,
"loss": 0.1277,
"num_input_tokens_seen": 4678006,
"step": 204,
"train_runtime": 810.4618,
"train_tokens_per_second": 5772.025
},
{
"epoch": 1.6545454545454545,
"grad_norm": 0.1958000510931015,
"learning_rate": 3.6213991769547327e-05,
"loss": 0.1268,
"num_input_tokens_seen": 4701206,
"step": 205,
"train_runtime": 813.8387,
"train_tokens_per_second": 5776.582
},
{
"epoch": 1.6626262626262627,
"grad_norm": 0.1861943006515503,
"learning_rate": 3.539094650205762e-05,
"loss": 0.1549,
"num_input_tokens_seen": 4724646,
"step": 206,
"train_runtime": 817.2582,
"train_tokens_per_second": 5781.093
},
{
"epoch": 1.6707070707070706,
"grad_norm": 0.1965884119272232,
"learning_rate": 3.45679012345679e-05,
"loss": 0.1221,
"num_input_tokens_seen": 4748998,
"step": 207,
"train_runtime": 820.7842,
"train_tokens_per_second": 5785.927
},
{
"epoch": 1.6787878787878787,
"grad_norm": 0.23105938732624054,
"learning_rate": 3.374485596707819e-05,
"loss": 0.1353,
"num_input_tokens_seen": 4768294,
"step": 208,
"train_runtime": 823.5916,
"train_tokens_per_second": 5789.634
},
{
"epoch": 1.6868686868686869,
"grad_norm": 0.17601825296878815,
"learning_rate": 3.292181069958848e-05,
"loss": 0.1743,
"num_input_tokens_seen": 4792550,
"step": 209,
"train_runtime": 827.116,
"train_tokens_per_second": 5794.29
},
{
"epoch": 1.694949494949495,
"grad_norm": 0.192215234041214,
"learning_rate": 3.209876543209876e-05,
"loss": 0.1441,
"num_input_tokens_seen": 4816006,
"step": 210,
"train_runtime": 830.4803,
"train_tokens_per_second": 5799.061
},
{
"epoch": 1.7030303030303031,
"grad_norm": 0.1799449473619461,
"learning_rate": 3.127572016460906e-05,
"loss": 0.1755,
"num_input_tokens_seen": 4839222,
"step": 211,
"train_runtime": 834.3314,
"train_tokens_per_second": 5800.12
},
{
"epoch": 1.7111111111111112,
"grad_norm": 0.18329425156116486,
"learning_rate": 3.0452674897119343e-05,
"loss": 0.1469,
"num_input_tokens_seen": 4862822,
"step": 212,
"train_runtime": 837.7144,
"train_tokens_per_second": 5804.869
},
{
"epoch": 1.7191919191919192,
"grad_norm": 0.2032759040594101,
"learning_rate": 2.962962962962963e-05,
"loss": 0.1809,
"num_input_tokens_seen": 4884582,
"step": 213,
"train_runtime": 840.9065,
"train_tokens_per_second": 5808.71
},
{
"epoch": 1.7272727272727273,
"grad_norm": 0.20157882571220398,
"learning_rate": 2.880658436213992e-05,
"loss": 0.1466,
"num_input_tokens_seen": 4909174,
"step": 214,
"train_runtime": 844.4537,
"train_tokens_per_second": 5813.432
},
{
"epoch": 1.7353535353535352,
"grad_norm": 0.1857813447713852,
"learning_rate": 2.7983539094650207e-05,
"loss": 0.1549,
"num_input_tokens_seen": 4933798,
"step": 215,
"train_runtime": 848.0304,
"train_tokens_per_second": 5817.949
},
{
"epoch": 1.7434343434343433,
"grad_norm": 0.21499592065811157,
"learning_rate": 2.7160493827160493e-05,
"loss": 0.1383,
"num_input_tokens_seen": 4952742,
"step": 216,
"train_runtime": 850.8052,
"train_tokens_per_second": 5821.241
},
{
"epoch": 1.7515151515151515,
"grad_norm": 0.17735537886619568,
"learning_rate": 2.6337448559670787e-05,
"loss": 0.1496,
"num_input_tokens_seen": 4976246,
"step": 217,
"train_runtime": 854.1841,
"train_tokens_per_second": 5825.73
},
{
"epoch": 1.7595959595959596,
"grad_norm": 0.18576224148273468,
"learning_rate": 2.551440329218107e-05,
"loss": 0.1409,
"num_input_tokens_seen": 4995798,
"step": 218,
"train_runtime": 857.0834,
"train_tokens_per_second": 5828.836
},
{
"epoch": 1.7676767676767677,
"grad_norm": 0.18721511960029602,
"learning_rate": 2.4691358024691357e-05,
"loss": 0.1294,
"num_input_tokens_seen": 5018838,
"step": 219,
"train_runtime": 860.4125,
"train_tokens_per_second": 5833.06
},
{
"epoch": 1.7757575757575759,
"grad_norm": 0.18898357450962067,
"learning_rate": 2.3868312757201647e-05,
"loss": 0.1011,
"num_input_tokens_seen": 5041782,
"step": 220,
"train_runtime": 863.7343,
"train_tokens_per_second": 5837.191
},
{
"epoch": 1.783838383838384,
"grad_norm": 0.1976945698261261,
"learning_rate": 2.3045267489711937e-05,
"loss": 0.1584,
"num_input_tokens_seen": 5063478,
"step": 221,
"train_runtime": 866.9236,
"train_tokens_per_second": 5840.743
},
{
"epoch": 1.791919191919192,
"grad_norm": 0.19949166476726532,
"learning_rate": 2.2222222222222223e-05,
"loss": 0.1523,
"num_input_tokens_seen": 5085526,
"step": 222,
"train_runtime": 870.1255,
"train_tokens_per_second": 5844.589
},
{
"epoch": 1.8,
"grad_norm": 0.181776225566864,
"learning_rate": 2.139917695473251e-05,
"loss": 0.1641,
"num_input_tokens_seen": 5109430,
"step": 223,
"train_runtime": 873.6231,
"train_tokens_per_second": 5848.552
},
{
"epoch": 1.808080808080808,
"grad_norm": 0.21610131859779358,
"learning_rate": 2.05761316872428e-05,
"loss": 0.116,
"num_input_tokens_seen": 5132182,
"step": 224,
"train_runtime": 876.9236,
"train_tokens_per_second": 5852.485
},
{
"epoch": 1.816161616161616,
"grad_norm": 0.19361373782157898,
"learning_rate": 1.9753086419753087e-05,
"loss": 0.1369,
"num_input_tokens_seen": 5153622,
"step": 225,
"train_runtime": 880.0664,
"train_tokens_per_second": 5855.947
},
{
"epoch": 1.816161616161616,
"eval_loss": 0.1724003553390503,
"eval_runtime": 15.9947,
"eval_samples_per_second": 54.956,
"eval_steps_per_second": 3.439,
"num_input_tokens_seen": 5153622,
"step": 225
},
{
"epoch": 1.8242424242424242,
"grad_norm": 0.19882901012897491,
"learning_rate": 1.8930041152263377e-05,
"loss": 0.1499,
"num_input_tokens_seen": 5178470,
"step": 226,
"train_runtime": 899.6327,
"train_tokens_per_second": 5756.205
},
{
"epoch": 1.8323232323232324,
"grad_norm": 0.19828850030899048,
"learning_rate": 1.8106995884773663e-05,
"loss": 0.1295,
"num_input_tokens_seen": 5199062,
"step": 227,
"train_runtime": 902.6363,
"train_tokens_per_second": 5759.864
},
{
"epoch": 1.8404040404040405,
"grad_norm": 0.2071538269519806,
"learning_rate": 1.728395061728395e-05,
"loss": 0.1739,
"num_input_tokens_seen": 5218134,
"step": 228,
"train_runtime": 905.4534,
"train_tokens_per_second": 5763.006
},
{
"epoch": 1.8484848484848486,
"grad_norm": 0.20533259212970734,
"learning_rate": 1.646090534979424e-05,
"loss": 0.1343,
"num_input_tokens_seen": 5242054,
"step": 229,
"train_runtime": 908.9457,
"train_tokens_per_second": 5767.181
},
{
"epoch": 1.8565656565656565,
"grad_norm": 0.19329999387264252,
"learning_rate": 1.563786008230453e-05,
"loss": 0.1266,
"num_input_tokens_seen": 5264518,
"step": 230,
"train_runtime": 912.2004,
"train_tokens_per_second": 5771.23
},
{
"epoch": 1.8646464646464647,
"grad_norm": 0.20547281205654144,
"learning_rate": 1.4814814814814815e-05,
"loss": 0.1622,
"num_input_tokens_seen": 5284374,
"step": 231,
"train_runtime": 915.1219,
"train_tokens_per_second": 5774.503
},
{
"epoch": 1.8727272727272726,
"grad_norm": 0.20196233689785004,
"learning_rate": 1.3991769547325103e-05,
"loss": 0.1211,
"num_input_tokens_seen": 5303622,
"step": 232,
"train_runtime": 917.9986,
"train_tokens_per_second": 5777.375
},
{
"epoch": 1.8808080808080807,
"grad_norm": 0.17019926011562347,
"learning_rate": 1.3168724279835393e-05,
"loss": 0.1297,
"num_input_tokens_seen": 5329718,
"step": 233,
"train_runtime": 921.75,
"train_tokens_per_second": 5782.173
},
{
"epoch": 1.8888888888888888,
"grad_norm": 0.1855989396572113,
"learning_rate": 1.2345679012345678e-05,
"loss": 0.1502,
"num_input_tokens_seen": 5349718,
"step": 234,
"train_runtime": 924.7021,
"train_tokens_per_second": 5785.342
},
{
"epoch": 1.896969696969697,
"grad_norm": 0.21048571169376373,
"learning_rate": 1.1522633744855968e-05,
"loss": 0.1483,
"num_input_tokens_seen": 5369638,
"step": 235,
"train_runtime": 927.6143,
"train_tokens_per_second": 5788.654
},
{
"epoch": 1.905050505050505,
"grad_norm": 0.20776841044425964,
"learning_rate": 1.0699588477366255e-05,
"loss": 0.1553,
"num_input_tokens_seen": 5392726,
"step": 236,
"train_runtime": 930.986,
"train_tokens_per_second": 5792.489
},
{
"epoch": 1.9131313131313132,
"grad_norm": 0.22271353006362915,
"learning_rate": 9.876543209876543e-06,
"loss": 0.1699,
"num_input_tokens_seen": 5412470,
"step": 237,
"train_runtime": 933.9223,
"train_tokens_per_second": 5795.418
},
{
"epoch": 1.9212121212121214,
"grad_norm": 0.20936141908168793,
"learning_rate": 9.053497942386832e-06,
"loss": 0.1471,
"num_input_tokens_seen": 5437894,
"step": 238,
"train_runtime": 937.5658,
"train_tokens_per_second": 5800.013
},
{
"epoch": 1.9292929292929293,
"grad_norm": 0.18848469853401184,
"learning_rate": 8.23045267489712e-06,
"loss": 0.1898,
"num_input_tokens_seen": 5461686,
"step": 239,
"train_runtime": 940.9924,
"train_tokens_per_second": 5804.177
},
{
"epoch": 1.9373737373737374,
"grad_norm": 0.17875902354717255,
"learning_rate": 7.4074074074074075e-06,
"loss": 0.147,
"num_input_tokens_seen": 5486054,
"step": 240,
"train_runtime": 944.4956,
"train_tokens_per_second": 5808.448
},
{
"epoch": 1.9454545454545453,
"grad_norm": 0.21896323561668396,
"learning_rate": 6.584362139917697e-06,
"loss": 0.1621,
"num_input_tokens_seen": 5509142,
"step": 241,
"train_runtime": 948.3591,
"train_tokens_per_second": 5809.131
},
{
"epoch": 1.9535353535353535,
"grad_norm": 0.19773228466510773,
"learning_rate": 5.761316872427984e-06,
"loss": 0.1263,
"num_input_tokens_seen": 5528598,
"step": 242,
"train_runtime": 951.2561,
"train_tokens_per_second": 5811.892
},
{
"epoch": 1.9616161616161616,
"grad_norm": 0.1763569563627243,
"learning_rate": 4.938271604938272e-06,
"loss": 0.1158,
"num_input_tokens_seen": 5551926,
"step": 243,
"train_runtime": 954.6378,
"train_tokens_per_second": 5815.741
},
{
"epoch": 1.9696969696969697,
"grad_norm": 0.17359760403633118,
"learning_rate": 4.11522633744856e-06,
"loss": 0.1097,
"num_input_tokens_seen": 5574326,
"step": 244,
"train_runtime": 957.9246,
"train_tokens_per_second": 5819.17
},
{
"epoch": 1.9777777777777779,
"grad_norm": 0.2085653394460678,
"learning_rate": 3.2921810699588483e-06,
"loss": 0.194,
"num_input_tokens_seen": 5598310,
"step": 245,
"train_runtime": 961.3777,
"train_tokens_per_second": 5823.216
},
{
"epoch": 1.985858585858586,
"grad_norm": 0.183889701962471,
"learning_rate": 2.469135802469136e-06,
"loss": 0.1558,
"num_input_tokens_seen": 5620534,
"step": 246,
"train_runtime": 964.6204,
"train_tokens_per_second": 5826.68
},
{
"epoch": 1.993939393939394,
"grad_norm": 0.20709186792373657,
"learning_rate": 1.6460905349794242e-06,
"loss": 0.1613,
"num_input_tokens_seen": 5640982,
"step": 247,
"train_runtime": 967.6377,
"train_tokens_per_second": 5829.643
},
{
"epoch": 2.0,
"grad_norm": 0.2510419189929962,
"learning_rate": 8.230452674897121e-07,
"loss": 0.1576,
"num_input_tokens_seen": 5653442,
"step": 248,
"train_runtime": 969.499,
"train_tokens_per_second": 5831.303
}
],
"logging_steps": 1,
"max_steps": 248,
"num_input_tokens_seen": 5653442,
"num_train_epochs": 2,
"save_steps": 30,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 2.4120939382807142e+17,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}