{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0, "eval_steps": 25, "global_step": 248, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.00808080808080808, "grad_norm": 34.29597854614258, "learning_rate": 0.0, "loss": 0.9949, "num_input_tokens_seen": 24048, "step": 1, "train_runtime": 17.3014, "train_tokens_per_second": 1389.947 }, { "epoch": 0.01616161616161616, "grad_norm": 35.52030944824219, "learning_rate": 4.000000000000001e-06, "loss": 1.0553, "num_input_tokens_seen": 48096, "step": 2, "train_runtime": 19.429, "train_tokens_per_second": 2475.474 }, { "epoch": 0.024242424242424242, "grad_norm": 25.08833122253418, "learning_rate": 8.000000000000001e-06, "loss": 0.8931, "num_input_tokens_seen": 68416, "step": 3, "train_runtime": 21.2655, "train_tokens_per_second": 3217.224 }, { "epoch": 0.03232323232323232, "grad_norm": 15.185912132263184, "learning_rate": 1.2e-05, "loss": 0.6129, "num_input_tokens_seen": 90432, "step": 4, "train_runtime": 23.2211, "train_tokens_per_second": 3894.39 }, { "epoch": 0.04040404040404041, "grad_norm": 15.486276626586914, "learning_rate": 1.6000000000000003e-05, "loss": 0.5151, "num_input_tokens_seen": 110544, "step": 5, "train_runtime": 25.0374, "train_tokens_per_second": 4415.159 }, { "epoch": 0.048484848484848485, "grad_norm": 6.518914699554443, "learning_rate": 2e-05, "loss": 0.3906, "num_input_tokens_seen": 135584, "step": 6, "train_runtime": 27.2726, "train_tokens_per_second": 4971.445 }, { "epoch": 0.05656565656565657, "grad_norm": 3.689831256866455, "learning_rate": 1.991769547325103e-05, "loss": 0.3707, "num_input_tokens_seen": 159200, "step": 7, "train_runtime": 29.3859, "train_tokens_per_second": 5417.559 }, { "epoch": 0.06464646464646465, "grad_norm": 2.442633867263794, "learning_rate": 1.983539094650206e-05, "loss": 0.361, "num_input_tokens_seen": 182224, "step": 8, "train_runtime": 31.4524, "train_tokens_per_second": 5793.636 }, { "epoch": 0.07272727272727272, "grad_norm": 2.300377368927002, "learning_rate": 1.9753086419753087e-05, "loss": 0.3582, "num_input_tokens_seen": 205472, "step": 9, "train_runtime": 33.5262, "train_tokens_per_second": 6128.691 }, { "epoch": 0.08080808080808081, "grad_norm": 1.9368574619293213, "learning_rate": 1.9670781893004115e-05, "loss": 0.3134, "num_input_tokens_seen": 230400, "step": 10, "train_runtime": 36.915, "train_tokens_per_second": 6241.36 }, { "epoch": 0.08888888888888889, "grad_norm": 2.0495376586914062, "learning_rate": 1.9588477366255147e-05, "loss": 0.3375, "num_input_tokens_seen": 252736, "step": 11, "train_runtime": 38.9446, "train_tokens_per_second": 6489.625 }, { "epoch": 0.09696969696969697, "grad_norm": 2.28267502784729, "learning_rate": 1.9506172839506175e-05, "loss": 0.3242, "num_input_tokens_seen": 273584, "step": 12, "train_runtime": 40.8507, "train_tokens_per_second": 6697.174 }, { "epoch": 0.10505050505050505, "grad_norm": 2.2189362049102783, "learning_rate": 1.9423868312757203e-05, "loss": 0.3666, "num_input_tokens_seen": 299968, "step": 13, "train_runtime": 43.2004, "train_tokens_per_second": 6943.636 }, { "epoch": 0.11313131313131314, "grad_norm": 2.0740907192230225, "learning_rate": 1.934156378600823e-05, "loss": 0.3772, "num_input_tokens_seen": 322480, "step": 14, "train_runtime": 45.2552, "train_tokens_per_second": 7125.818 }, { "epoch": 0.12121212121212122, "grad_norm": 2.38155460357666, "learning_rate": 1.925925925925926e-05, "loss": 0.362, "num_input_tokens_seen": 344864, "step": 15, "train_runtime": 47.2767, "train_tokens_per_second": 7294.584 }, { "epoch": 0.1292929292929293, "grad_norm": 1.8321378231048584, "learning_rate": 1.9176954732510288e-05, "loss": 0.3286, "num_input_tokens_seen": 369296, "step": 16, "train_runtime": 49.4673, "train_tokens_per_second": 7465.459 }, { "epoch": 0.13737373737373737, "grad_norm": 2.0253713130950928, "learning_rate": 1.9094650205761317e-05, "loss": 0.3555, "num_input_tokens_seen": 390944, "step": 17, "train_runtime": 51.4481, "train_tokens_per_second": 7598.811 }, { "epoch": 0.14545454545454545, "grad_norm": 1.9212645292282104, "learning_rate": 1.901234567901235e-05, "loss": 0.3191, "num_input_tokens_seen": 414144, "step": 18, "train_runtime": 53.5341, "train_tokens_per_second": 7736.071 }, { "epoch": 0.15353535353535352, "grad_norm": 1.9833357334136963, "learning_rate": 1.8930041152263377e-05, "loss": 0.3033, "num_input_tokens_seen": 435840, "step": 19, "train_runtime": 55.4996, "train_tokens_per_second": 7853.023 }, { "epoch": 0.16161616161616163, "grad_norm": 1.8135859966278076, "learning_rate": 1.8847736625514405e-05, "loss": 0.3375, "num_input_tokens_seen": 459808, "step": 20, "train_runtime": 57.6671, "train_tokens_per_second": 7973.49 }, { "epoch": 0.1696969696969697, "grad_norm": 1.9057047367095947, "learning_rate": 1.8765432098765433e-05, "loss": 0.3338, "num_input_tokens_seen": 479504, "step": 21, "train_runtime": 59.4876, "train_tokens_per_second": 8060.567 }, { "epoch": 0.17777777777777778, "grad_norm": 1.8097015619277954, "learning_rate": 1.868312757201646e-05, "loss": 0.3333, "num_input_tokens_seen": 505712, "step": 22, "train_runtime": 61.8524, "train_tokens_per_second": 8176.108 }, { "epoch": 0.18585858585858586, "grad_norm": 2.087014675140381, "learning_rate": 1.860082304526749e-05, "loss": 0.3309, "num_input_tokens_seen": 525456, "step": 23, "train_runtime": 63.693, "train_tokens_per_second": 8249.829 }, { "epoch": 0.19393939393939394, "grad_norm": 2.135472536087036, "learning_rate": 1.851851851851852e-05, "loss": 0.3742, "num_input_tokens_seen": 548928, "step": 24, "train_runtime": 65.8153, "train_tokens_per_second": 8340.436 }, { "epoch": 0.20202020202020202, "grad_norm": 2.068189859390259, "learning_rate": 1.843621399176955e-05, "loss": 0.3191, "num_input_tokens_seen": 568608, "step": 25, "train_runtime": 67.6509, "train_tokens_per_second": 8405.03 }, { "epoch": 0.20202020202020202, "eval_loss": 0.30983325839042664, "eval_runtime": 10.55, "eval_samples_per_second": 83.318, "eval_steps_per_second": 5.213, "num_input_tokens_seen": 568608, "step": 25 }, { "epoch": 0.2101010101010101, "grad_norm": 2.005445718765259, "learning_rate": 1.835390946502058e-05, "loss": 0.3055, "num_input_tokens_seen": 592240, "step": 26, "train_runtime": 81.0864, "train_tokens_per_second": 7303.813 }, { "epoch": 0.21818181818181817, "grad_norm": 1.9169626235961914, "learning_rate": 1.8271604938271607e-05, "loss": 0.2896, "num_input_tokens_seen": 613168, "step": 27, "train_runtime": 83.0241, "train_tokens_per_second": 7385.42 }, { "epoch": 0.22626262626262628, "grad_norm": 1.8428266048431396, "learning_rate": 1.8189300411522635e-05, "loss": 0.3012, "num_input_tokens_seen": 637552, "step": 28, "train_runtime": 85.2155, "train_tokens_per_second": 7481.643 }, { "epoch": 0.23434343434343435, "grad_norm": 1.9976342916488647, "learning_rate": 1.8106995884773663e-05, "loss": 0.3314, "num_input_tokens_seen": 661184, "step": 29, "train_runtime": 87.3748, "train_tokens_per_second": 7567.217 }, { "epoch": 0.24242424242424243, "grad_norm": 1.928344964981079, "learning_rate": 1.802469135802469e-05, "loss": 0.3567, "num_input_tokens_seen": 683072, "step": 30, "train_runtime": 89.3764, "train_tokens_per_second": 7642.645 }, { "epoch": 0.2505050505050505, "grad_norm": 1.8772201538085938, "learning_rate": 1.7942386831275723e-05, "loss": 0.3105, "num_input_tokens_seen": 703776, "step": 31, "train_runtime": 107.296, "train_tokens_per_second": 6559.199 }, { "epoch": 0.2585858585858586, "grad_norm": 1.742013692855835, "learning_rate": 1.786008230452675e-05, "loss": 0.3078, "num_input_tokens_seen": 729584, "step": 32, "train_runtime": 109.5875, "train_tokens_per_second": 6657.545 }, { "epoch": 0.26666666666666666, "grad_norm": 2.0742855072021484, "learning_rate": 1.7777777777777777e-05, "loss": 0.3568, "num_input_tokens_seen": 752672, "step": 33, "train_runtime": 111.6837, "train_tokens_per_second": 6739.321 }, { "epoch": 0.27474747474747474, "grad_norm": 2.038970947265625, "learning_rate": 1.769547325102881e-05, "loss": 0.3193, "num_input_tokens_seen": 776672, "step": 34, "train_runtime": 113.8655, "train_tokens_per_second": 6820.962 }, { "epoch": 0.2828282828282828, "grad_norm": 1.8307162523269653, "learning_rate": 1.7613168724279837e-05, "loss": 0.3426, "num_input_tokens_seen": 801296, "step": 35, "train_runtime": 116.0796, "train_tokens_per_second": 6902.987 }, { "epoch": 0.2909090909090909, "grad_norm": 2.0113823413848877, "learning_rate": 1.7530864197530865e-05, "loss": 0.3058, "num_input_tokens_seen": 822368, "step": 36, "train_runtime": 117.9981, "train_tokens_per_second": 6969.331 }, { "epoch": 0.298989898989899, "grad_norm": 1.922239899635315, "learning_rate": 1.7448559670781893e-05, "loss": 0.2951, "num_input_tokens_seen": 848928, "step": 37, "train_runtime": 120.382, "train_tokens_per_second": 7051.954 }, { "epoch": 0.30707070707070705, "grad_norm": 1.8546710014343262, "learning_rate": 1.7366255144032925e-05, "loss": 0.2751, "num_input_tokens_seen": 870672, "step": 38, "train_runtime": 122.3477, "train_tokens_per_second": 7116.372 }, { "epoch": 0.3151515151515151, "grad_norm": 2.022054433822632, "learning_rate": 1.728395061728395e-05, "loss": 0.3516, "num_input_tokens_seen": 892064, "step": 39, "train_runtime": 124.3075, "train_tokens_per_second": 7176.271 }, { "epoch": 0.32323232323232326, "grad_norm": 1.8261455297470093, "learning_rate": 1.720164609053498e-05, "loss": 0.3178, "num_input_tokens_seen": 915680, "step": 40, "train_runtime": 126.4529, "train_tokens_per_second": 7241.273 }, { "epoch": 0.33131313131313134, "grad_norm": 2.0345096588134766, "learning_rate": 1.711934156378601e-05, "loss": 0.3142, "num_input_tokens_seen": 935216, "step": 41, "train_runtime": 128.2566, "train_tokens_per_second": 7291.759 }, { "epoch": 0.3393939393939394, "grad_norm": 1.9947233200073242, "learning_rate": 1.7037037037037038e-05, "loss": 0.3049, "num_input_tokens_seen": 956864, "step": 42, "train_runtime": 130.2476, "train_tokens_per_second": 7346.5 }, { "epoch": 0.3474747474747475, "grad_norm": 2.135382652282715, "learning_rate": 1.6954732510288067e-05, "loss": 0.3233, "num_input_tokens_seen": 981440, "step": 43, "train_runtime": 132.4658, "train_tokens_per_second": 7409.008 }, { "epoch": 0.35555555555555557, "grad_norm": 2.0088696479797363, "learning_rate": 1.68724279835391e-05, "loss": 0.297, "num_input_tokens_seen": 1001232, "step": 44, "train_runtime": 134.324, "train_tokens_per_second": 7453.858 }, { "epoch": 0.36363636363636365, "grad_norm": 1.9240626096725464, "learning_rate": 1.6790123456790123e-05, "loss": 0.2836, "num_input_tokens_seen": 1027680, "step": 45, "train_runtime": 136.7055, "train_tokens_per_second": 7517.473 }, { "epoch": 0.3717171717171717, "grad_norm": 1.9892817735671997, "learning_rate": 1.670781893004115e-05, "loss": 0.3567, "num_input_tokens_seen": 1049968, "step": 46, "train_runtime": 138.7457, "train_tokens_per_second": 7567.57 }, { "epoch": 0.3797979797979798, "grad_norm": 2.067185401916504, "learning_rate": 1.6625514403292183e-05, "loss": 0.3299, "num_input_tokens_seen": 1071840, "step": 47, "train_runtime": 140.7519, "train_tokens_per_second": 7615.101 }, { "epoch": 0.3878787878787879, "grad_norm": 1.953230619430542, "learning_rate": 1.654320987654321e-05, "loss": 0.2794, "num_input_tokens_seen": 1092864, "step": 48, "train_runtime": 142.7001, "train_tokens_per_second": 7658.469 }, { "epoch": 0.39595959595959596, "grad_norm": 1.9437150955200195, "learning_rate": 1.646090534979424e-05, "loss": 0.3269, "num_input_tokens_seen": 1117040, "step": 49, "train_runtime": 144.8716, "train_tokens_per_second": 7710.55 }, { "epoch": 0.40404040404040403, "grad_norm": 1.921739101409912, "learning_rate": 1.6378600823045268e-05, "loss": 0.3297, "num_input_tokens_seen": 1140240, "step": 50, "train_runtime": 146.9806, "train_tokens_per_second": 7757.759 }, { "epoch": 0.40404040404040403, "eval_loss": 0.30039629340171814, "eval_runtime": 7.062, "eval_samples_per_second": 124.469, "eval_steps_per_second": 7.788, "num_input_tokens_seen": 1140240, "step": 50 }, { "epoch": 0.4121212121212121, "grad_norm": 2.030803918838501, "learning_rate": 1.6296296296296297e-05, "loss": 0.317, "num_input_tokens_seen": 1161104, "step": 51, "train_runtime": 155.9849, "train_tokens_per_second": 7443.696 }, { "epoch": 0.4202020202020202, "grad_norm": 1.6810036897659302, "learning_rate": 1.6213991769547325e-05, "loss": 0.3059, "num_input_tokens_seen": 1189328, "step": 52, "train_runtime": 158.5167, "train_tokens_per_second": 7502.855 }, { "epoch": 0.42828282828282827, "grad_norm": 1.7849842309951782, "learning_rate": 1.6131687242798357e-05, "loss": 0.2731, "num_input_tokens_seen": 1211120, "step": 53, "train_runtime": 160.4993, "train_tokens_per_second": 7545.95 }, { "epoch": 0.43636363636363634, "grad_norm": 1.7593951225280762, "learning_rate": 1.6049382716049385e-05, "loss": 0.2982, "num_input_tokens_seen": 1234080, "step": 54, "train_runtime": 162.5873, "train_tokens_per_second": 7590.26 }, { "epoch": 0.4444444444444444, "grad_norm": 1.9831680059432983, "learning_rate": 1.5967078189300413e-05, "loss": 0.3024, "num_input_tokens_seen": 1256880, "step": 55, "train_runtime": 164.6649, "train_tokens_per_second": 7632.957 }, { "epoch": 0.45252525252525255, "grad_norm": 1.9270755052566528, "learning_rate": 1.588477366255144e-05, "loss": 0.3484, "num_input_tokens_seen": 1281376, "step": 56, "train_runtime": 166.8926, "train_tokens_per_second": 7677.849 }, { "epoch": 0.46060606060606063, "grad_norm": 1.7645379304885864, "learning_rate": 1.580246913580247e-05, "loss": 0.2909, "num_input_tokens_seen": 1309216, "step": 57, "train_runtime": 169.4269, "train_tokens_per_second": 7727.323 }, { "epoch": 0.4686868686868687, "grad_norm": 2.019009590148926, "learning_rate": 1.5720164609053498e-05, "loss": 0.37, "num_input_tokens_seen": 1331120, "step": 58, "train_runtime": 171.4602, "train_tokens_per_second": 7763.433 }, { "epoch": 0.4767676767676768, "grad_norm": 1.8868393898010254, "learning_rate": 1.5637860082304527e-05, "loss": 0.2952, "num_input_tokens_seen": 1354976, "step": 59, "train_runtime": 173.6145, "train_tokens_per_second": 7804.51 }, { "epoch": 0.48484848484848486, "grad_norm": 2.1054604053497314, "learning_rate": 1.555555555555556e-05, "loss": 0.3012, "num_input_tokens_seen": 1376976, "step": 60, "train_runtime": 175.6397, "train_tokens_per_second": 7839.778 }, { "epoch": 0.49292929292929294, "grad_norm": 1.8059983253479004, "learning_rate": 1.5473251028806587e-05, "loss": 0.3007, "num_input_tokens_seen": 1397952, "step": 61, "train_runtime": 193.5698, "train_tokens_per_second": 7221.952 }, { "epoch": 0.501010101010101, "grad_norm": 1.8705294132232666, "learning_rate": 1.5390946502057615e-05, "loss": 0.2984, "num_input_tokens_seen": 1417712, "step": 62, "train_runtime": 195.3895, "train_tokens_per_second": 7255.825 }, { "epoch": 0.509090909090909, "grad_norm": 1.9110565185546875, "learning_rate": 1.5308641975308643e-05, "loss": 0.2868, "num_input_tokens_seen": 1438544, "step": 63, "train_runtime": 197.311, "train_tokens_per_second": 7290.746 }, { "epoch": 0.5171717171717172, "grad_norm": 1.8605395555496216, "learning_rate": 1.5226337448559672e-05, "loss": 0.2894, "num_input_tokens_seen": 1461776, "step": 64, "train_runtime": 199.4092, "train_tokens_per_second": 7330.533 }, { "epoch": 0.5252525252525253, "grad_norm": 1.9197546243667603, "learning_rate": 1.51440329218107e-05, "loss": 0.3344, "num_input_tokens_seen": 1483600, "step": 65, "train_runtime": 201.3793, "train_tokens_per_second": 7367.193 }, { "epoch": 0.5333333333333333, "grad_norm": 1.8143887519836426, "learning_rate": 1.506172839506173e-05, "loss": 0.3272, "num_input_tokens_seen": 1507280, "step": 66, "train_runtime": 203.5195, "train_tokens_per_second": 7406.072 }, { "epoch": 0.5414141414141415, "grad_norm": 1.9554014205932617, "learning_rate": 1.4979423868312758e-05, "loss": 0.3072, "num_input_tokens_seen": 1530176, "step": 67, "train_runtime": 205.5865, "train_tokens_per_second": 7442.978 }, { "epoch": 0.5494949494949495, "grad_norm": 1.8135331869125366, "learning_rate": 1.4897119341563788e-05, "loss": 0.2907, "num_input_tokens_seen": 1553520, "step": 68, "train_runtime": 207.7058, "train_tokens_per_second": 7479.424 }, { "epoch": 0.5575757575757576, "grad_norm": 1.7284748554229736, "learning_rate": 1.4814814814814815e-05, "loss": 0.3004, "num_input_tokens_seen": 1577728, "step": 69, "train_runtime": 209.9215, "train_tokens_per_second": 7515.801 }, { "epoch": 0.5656565656565656, "grad_norm": 1.9973853826522827, "learning_rate": 1.4732510288065845e-05, "loss": 0.2774, "num_input_tokens_seen": 1598448, "step": 70, "train_runtime": 211.8265, "train_tokens_per_second": 7546.025 }, { "epoch": 0.5737373737373738, "grad_norm": 1.867518663406372, "learning_rate": 1.4650205761316873e-05, "loss": 0.2953, "num_input_tokens_seen": 1619616, "step": 71, "train_runtime": 213.7737, "train_tokens_per_second": 7576.311 }, { "epoch": 0.5818181818181818, "grad_norm": 1.87697172164917, "learning_rate": 1.4567901234567903e-05, "loss": 0.3165, "num_input_tokens_seen": 1647504, "step": 72, "train_runtime": 216.2825, "train_tokens_per_second": 7617.373 }, { "epoch": 0.5898989898989899, "grad_norm": 2.0404067039489746, "learning_rate": 1.4485596707818932e-05, "loss": 0.325, "num_input_tokens_seen": 1669600, "step": 73, "train_runtime": 218.3171, "train_tokens_per_second": 7647.592 }, { "epoch": 0.597979797979798, "grad_norm": 1.9081746339797974, "learning_rate": 1.4403292181069962e-05, "loss": 0.3295, "num_input_tokens_seen": 1692464, "step": 74, "train_runtime": 220.4059, "train_tokens_per_second": 7678.851 }, { "epoch": 0.6060606060606061, "grad_norm": 1.9184836149215698, "learning_rate": 1.4320987654320988e-05, "loss": 0.3046, "num_input_tokens_seen": 1714544, "step": 75, "train_runtime": 222.438, "train_tokens_per_second": 7707.964 }, { "epoch": 0.6060606060606061, "eval_loss": 0.2966873049736023, "eval_runtime": 7.0993, "eval_samples_per_second": 123.814, "eval_steps_per_second": 7.747, "num_input_tokens_seen": 1714544, "step": 75 }, { "epoch": 0.6141414141414141, "grad_norm": 1.9091130495071411, "learning_rate": 1.4238683127572017e-05, "loss": 0.3117, "num_input_tokens_seen": 1734992, "step": 76, "train_runtime": 231.4507, "train_tokens_per_second": 7496.164 }, { "epoch": 0.6222222222222222, "grad_norm": 1.8281859159469604, "learning_rate": 1.4156378600823047e-05, "loss": 0.3165, "num_input_tokens_seen": 1758528, "step": 77, "train_runtime": 233.6112, "train_tokens_per_second": 7527.584 }, { "epoch": 0.6303030303030303, "grad_norm": 2.0086405277252197, "learning_rate": 1.4074074074074075e-05, "loss": 0.3239, "num_input_tokens_seen": 1782768, "step": 78, "train_runtime": 235.7867, "train_tokens_per_second": 7560.935 }, { "epoch": 0.6383838383838384, "grad_norm": 1.9040608406066895, "learning_rate": 1.3991769547325105e-05, "loss": 0.3269, "num_input_tokens_seen": 1806000, "step": 79, "train_runtime": 237.8964, "train_tokens_per_second": 7591.539 }, { "epoch": 0.6464646464646465, "grad_norm": 1.8077948093414307, "learning_rate": 1.3909465020576133e-05, "loss": 0.3069, "num_input_tokens_seen": 1833264, "step": 80, "train_runtime": 240.3427, "train_tokens_per_second": 7627.708 }, { "epoch": 0.6545454545454545, "grad_norm": 2.132566452026367, "learning_rate": 1.3827160493827162e-05, "loss": 0.3564, "num_input_tokens_seen": 1855920, "step": 81, "train_runtime": 242.4326, "train_tokens_per_second": 7655.407 }, { "epoch": 0.6626262626262627, "grad_norm": 1.9666991233825684, "learning_rate": 1.374485596707819e-05, "loss": 0.3299, "num_input_tokens_seen": 1877664, "step": 82, "train_runtime": 244.4539, "train_tokens_per_second": 7681.055 }, { "epoch": 0.6707070707070707, "grad_norm": 1.7784312963485718, "learning_rate": 1.366255144032922e-05, "loss": 0.2704, "num_input_tokens_seen": 1901152, "step": 83, "train_runtime": 246.5816, "train_tokens_per_second": 7710.033 }, { "epoch": 0.6787878787878788, "grad_norm": 1.9089895486831665, "learning_rate": 1.3580246913580248e-05, "loss": 0.3071, "num_input_tokens_seen": 1927440, "step": 84, "train_runtime": 248.9261, "train_tokens_per_second": 7743.02 }, { "epoch": 0.6868686868686869, "grad_norm": 2.1388967037200928, "learning_rate": 1.3497942386831278e-05, "loss": 0.3121, "num_input_tokens_seen": 1951408, "step": 85, "train_runtime": 251.0849, "train_tokens_per_second": 7771.906 }, { "epoch": 0.694949494949495, "grad_norm": 1.9663597345352173, "learning_rate": 1.3415637860082307e-05, "loss": 0.3255, "num_input_tokens_seen": 1973200, "step": 86, "train_runtime": 253.071, "train_tokens_per_second": 7797.022 }, { "epoch": 0.703030303030303, "grad_norm": 1.8622767925262451, "learning_rate": 1.3333333333333333e-05, "loss": 0.3316, "num_input_tokens_seen": 1994528, "step": 87, "train_runtime": 255.0392, "train_tokens_per_second": 7820.476 }, { "epoch": 0.7111111111111111, "grad_norm": 2.091785430908203, "learning_rate": 1.3251028806584363e-05, "loss": 0.29, "num_input_tokens_seen": 2019248, "step": 88, "train_runtime": 257.2586, "train_tokens_per_second": 7849.097 }, { "epoch": 0.7191919191919192, "grad_norm": 1.9802072048187256, "learning_rate": 1.3168724279835392e-05, "loss": 0.3108, "num_input_tokens_seen": 2040592, "step": 89, "train_runtime": 259.2297, "train_tokens_per_second": 7871.751 }, { "epoch": 0.7272727272727273, "grad_norm": 1.8566641807556152, "learning_rate": 1.3086419753086422e-05, "loss": 0.2818, "num_input_tokens_seen": 2062032, "step": 90, "train_runtime": 261.2082, "train_tokens_per_second": 7894.21 }, { "epoch": 0.7353535353535353, "grad_norm": 2.006922960281372, "learning_rate": 1.300411522633745e-05, "loss": 0.2786, "num_input_tokens_seen": 2082368, "step": 91, "train_runtime": 279.7434, "train_tokens_per_second": 7443.85 }, { "epoch": 0.7434343434343434, "grad_norm": 1.9318790435791016, "learning_rate": 1.2921810699588477e-05, "loss": 0.2882, "num_input_tokens_seen": 2104976, "step": 92, "train_runtime": 281.7953, "train_tokens_per_second": 7469.876 }, { "epoch": 0.7515151515151515, "grad_norm": 2.0379955768585205, "learning_rate": 1.2839506172839507e-05, "loss": 0.3164, "num_input_tokens_seen": 2125664, "step": 93, "train_runtime": 283.6716, "train_tokens_per_second": 7493.396 }, { "epoch": 0.7595959595959596, "grad_norm": 1.7655056715011597, "learning_rate": 1.2757201646090535e-05, "loss": 0.2632, "num_input_tokens_seen": 2151216, "step": 94, "train_runtime": 285.9821, "train_tokens_per_second": 7522.204 }, { "epoch": 0.7676767676767676, "grad_norm": 2.0078585147857666, "learning_rate": 1.2674897119341565e-05, "loss": 0.3138, "num_input_tokens_seen": 2174480, "step": 95, "train_runtime": 288.0796, "train_tokens_per_second": 7548.192 }, { "epoch": 0.7757575757575758, "grad_norm": 1.8399180173873901, "learning_rate": 1.2592592592592593e-05, "loss": 0.2765, "num_input_tokens_seen": 2198048, "step": 96, "train_runtime": 290.2011, "train_tokens_per_second": 7574.225 }, { "epoch": 0.7838383838383839, "grad_norm": 2.049941301345825, "learning_rate": 1.2510288065843623e-05, "loss": 0.3136, "num_input_tokens_seen": 2218944, "step": 97, "train_runtime": 292.1183, "train_tokens_per_second": 7596.047 }, { "epoch": 0.7919191919191919, "grad_norm": 1.8334540128707886, "learning_rate": 1.242798353909465e-05, "loss": 0.3265, "num_input_tokens_seen": 2244752, "step": 98, "train_runtime": 294.4345, "train_tokens_per_second": 7623.944 }, { "epoch": 0.8, "grad_norm": 2.317540168762207, "learning_rate": 1.234567901234568e-05, "loss": 0.3505, "num_input_tokens_seen": 2267728, "step": 99, "train_runtime": 296.5099, "train_tokens_per_second": 7648.068 }, { "epoch": 0.8080808080808081, "grad_norm": 1.9731619358062744, "learning_rate": 1.2263374485596708e-05, "loss": 0.2984, "num_input_tokens_seen": 2289328, "step": 100, "train_runtime": 298.4904, "train_tokens_per_second": 7669.686 }, { "epoch": 0.8080808080808081, "eval_loss": 0.29423120617866516, "eval_runtime": 7.029, "eval_samples_per_second": 125.053, "eval_steps_per_second": 7.825, "num_input_tokens_seen": 2289328, "step": 100 }, { "epoch": 0.8161616161616162, "grad_norm": 2.0644495487213135, "learning_rate": 1.2181069958847738e-05, "loss": 0.326, "num_input_tokens_seen": 2313216, "step": 101, "train_runtime": 307.6926, "train_tokens_per_second": 7517.945 }, { "epoch": 0.8242424242424242, "grad_norm": 1.9370036125183105, "learning_rate": 1.2098765432098767e-05, "loss": 0.2865, "num_input_tokens_seen": 2333152, "step": 102, "train_runtime": 309.5355, "train_tokens_per_second": 7537.591 }, { "epoch": 0.8323232323232324, "grad_norm": 1.9265321493148804, "learning_rate": 1.2016460905349797e-05, "loss": 0.3275, "num_input_tokens_seen": 2355744, "step": 103, "train_runtime": 311.5913, "train_tokens_per_second": 7560.365 }, { "epoch": 0.8404040404040404, "grad_norm": 1.9668643474578857, "learning_rate": 1.1934156378600823e-05, "loss": 0.3592, "num_input_tokens_seen": 2376560, "step": 104, "train_runtime": 313.4969, "train_tokens_per_second": 7580.81 }, { "epoch": 0.8484848484848485, "grad_norm": 1.9941215515136719, "learning_rate": 1.1851851851851852e-05, "loss": 0.2986, "num_input_tokens_seen": 2400896, "step": 105, "train_runtime": 315.6988, "train_tokens_per_second": 7605.02 }, { "epoch": 0.8565656565656565, "grad_norm": 2.070256233215332, "learning_rate": 1.1769547325102882e-05, "loss": 0.3146, "num_input_tokens_seen": 2423632, "step": 106, "train_runtime": 317.7728, "train_tokens_per_second": 7626.933 }, { "epoch": 0.8646464646464647, "grad_norm": 1.929892659187317, "learning_rate": 1.168724279835391e-05, "loss": 0.33, "num_input_tokens_seen": 2448432, "step": 107, "train_runtime": 320.0049, "train_tokens_per_second": 7651.233 }, { "epoch": 0.8727272727272727, "grad_norm": 1.7959911823272705, "learning_rate": 1.160493827160494e-05, "loss": 0.3109, "num_input_tokens_seen": 2470768, "step": 108, "train_runtime": 322.0228, "train_tokens_per_second": 7672.65 }, { "epoch": 0.8808080808080808, "grad_norm": 1.8385419845581055, "learning_rate": 1.1522633744855968e-05, "loss": 0.2902, "num_input_tokens_seen": 2494944, "step": 109, "train_runtime": 324.2378, "train_tokens_per_second": 7694.798 }, { "epoch": 0.8888888888888888, "grad_norm": 1.9622164964675903, "learning_rate": 1.1440329218106997e-05, "loss": 0.3503, "num_input_tokens_seen": 2515760, "step": 110, "train_runtime": 326.16, "train_tokens_per_second": 7713.268 }, { "epoch": 0.896969696969697, "grad_norm": 1.9579459428787231, "learning_rate": 1.1358024691358025e-05, "loss": 0.2731, "num_input_tokens_seen": 2537792, "step": 111, "train_runtime": 328.183, "train_tokens_per_second": 7732.857 }, { "epoch": 0.9050505050505051, "grad_norm": 1.8197929859161377, "learning_rate": 1.1275720164609055e-05, "loss": 0.2742, "num_input_tokens_seen": 2562032, "step": 112, "train_runtime": 330.3793, "train_tokens_per_second": 7754.819 }, { "epoch": 0.9131313131313131, "grad_norm": 2.2101240158081055, "learning_rate": 1.1193415637860083e-05, "loss": 0.3154, "num_input_tokens_seen": 2583760, "step": 113, "train_runtime": 332.3672, "train_tokens_per_second": 7773.81 }, { "epoch": 0.9212121212121213, "grad_norm": 1.961485743522644, "learning_rate": 1.1111111111111113e-05, "loss": 0.2789, "num_input_tokens_seen": 2607776, "step": 114, "train_runtime": 334.5191, "train_tokens_per_second": 7795.596 }, { "epoch": 0.9292929292929293, "grad_norm": 2.0995683670043945, "learning_rate": 1.1028806584362142e-05, "loss": 0.3263, "num_input_tokens_seen": 2630208, "step": 115, "train_runtime": 336.587, "train_tokens_per_second": 7814.349 }, { "epoch": 0.9373737373737374, "grad_norm": 2.0641095638275146, "learning_rate": 1.0946502057613168e-05, "loss": 0.2851, "num_input_tokens_seen": 2650208, "step": 116, "train_runtime": 338.4264, "train_tokens_per_second": 7830.972 }, { "epoch": 0.9454545454545454, "grad_norm": 2.0057430267333984, "learning_rate": 1.0864197530864198e-05, "loss": 0.3165, "num_input_tokens_seen": 2672592, "step": 117, "train_runtime": 340.4808, "train_tokens_per_second": 7849.464 }, { "epoch": 0.9535353535353536, "grad_norm": 1.996042251586914, "learning_rate": 1.0781893004115227e-05, "loss": 0.2761, "num_input_tokens_seen": 2698064, "step": 118, "train_runtime": 342.8571, "train_tokens_per_second": 7869.354 }, { "epoch": 0.9616161616161616, "grad_norm": 1.9719218015670776, "learning_rate": 1.0699588477366257e-05, "loss": 0.3056, "num_input_tokens_seen": 2719680, "step": 119, "train_runtime": 344.8444, "train_tokens_per_second": 7886.688 }, { "epoch": 0.9696969696969697, "grad_norm": 1.7962714433670044, "learning_rate": 1.0617283950617285e-05, "loss": 0.2745, "num_input_tokens_seen": 2742400, "step": 120, "train_runtime": 346.9298, "train_tokens_per_second": 7904.768 }, { "epoch": 0.9777777777777777, "grad_norm": 1.91484797000885, "learning_rate": 1.0534979423868315e-05, "loss": 0.2906, "num_input_tokens_seen": 2766112, "step": 121, "train_runtime": 365.0207, "train_tokens_per_second": 7577.96 }, { "epoch": 0.9858585858585859, "grad_norm": 1.9865151643753052, "learning_rate": 1.0452674897119342e-05, "loss": 0.291, "num_input_tokens_seen": 2787952, "step": 122, "train_runtime": 366.9952, "train_tokens_per_second": 7596.699 }, { "epoch": 0.9939393939393939, "grad_norm": 2.03933048248291, "learning_rate": 1.037037037037037e-05, "loss": 0.3486, "num_input_tokens_seen": 2811632, "step": 123, "train_runtime": 369.1409, "train_tokens_per_second": 7616.69 }, { "epoch": 1.0, "grad_norm": 2.3509812355041504, "learning_rate": 1.02880658436214e-05, "loss": 0.2723, "num_input_tokens_seen": 2825206, "step": 124, "train_runtime": 372.5555, "train_tokens_per_second": 7583.315 }, { "epoch": 1.0080808080808081, "grad_norm": 2.5542423725128174, "learning_rate": 1.0205761316872428e-05, "loss": 0.271, "num_input_tokens_seen": 2847206, "step": 125, "train_runtime": 374.5469, "train_tokens_per_second": 7601.734 }, { "epoch": 1.0080808080808081, "eval_loss": 0.2926430106163025, "eval_runtime": 7.026, "eval_samples_per_second": 125.107, "eval_steps_per_second": 7.828, "num_input_tokens_seen": 2847206, "step": 125 }, { "epoch": 1.0161616161616163, "grad_norm": 2.485454797744751, "learning_rate": 1.0123456790123458e-05, "loss": 0.2351, "num_input_tokens_seen": 2867190, "step": 126, "train_runtime": 383.4417, "train_tokens_per_second": 7477.513 }, { "epoch": 1.0242424242424242, "grad_norm": 1.870703101158142, "learning_rate": 1.0041152263374487e-05, "loss": 0.2432, "num_input_tokens_seen": 2888710, "step": 127, "train_runtime": 385.4176, "train_tokens_per_second": 7495.014 }, { "epoch": 1.0323232323232323, "grad_norm": 1.9022161960601807, "learning_rate": 9.958847736625515e-06, "loss": 0.2415, "num_input_tokens_seen": 2913990, "step": 128, "train_runtime": 387.7088, "train_tokens_per_second": 7515.925 }, { "epoch": 1.0404040404040404, "grad_norm": 2.121541738510132, "learning_rate": 9.876543209876543e-06, "loss": 0.2421, "num_input_tokens_seen": 2938246, "step": 129, "train_runtime": 389.9127, "train_tokens_per_second": 7535.65 }, { "epoch": 1.0484848484848486, "grad_norm": 1.8283259868621826, "learning_rate": 9.794238683127573e-06, "loss": 0.2525, "num_input_tokens_seen": 2962326, "step": 130, "train_runtime": 392.1155, "train_tokens_per_second": 7554.729 }, { "epoch": 1.0565656565656565, "grad_norm": 2.0393452644348145, "learning_rate": 9.711934156378602e-06, "loss": 0.2636, "num_input_tokens_seen": 2983126, "step": 131, "train_runtime": 394.0236, "train_tokens_per_second": 7570.933 }, { "epoch": 1.0646464646464646, "grad_norm": 2.0195391178131104, "learning_rate": 9.62962962962963e-06, "loss": 0.2488, "num_input_tokens_seen": 3005606, "step": 132, "train_runtime": 396.0787, "train_tokens_per_second": 7588.405 }, { "epoch": 1.0727272727272728, "grad_norm": 2.2477834224700928, "learning_rate": 9.547325102880658e-06, "loss": 0.2564, "num_input_tokens_seen": 3027926, "step": 133, "train_runtime": 398.1422, "train_tokens_per_second": 7605.138 }, { "epoch": 1.0808080808080809, "grad_norm": 2.251457691192627, "learning_rate": 9.465020576131688e-06, "loss": 0.2514, "num_input_tokens_seen": 3052294, "step": 134, "train_runtime": 400.3525, "train_tokens_per_second": 7624.016 }, { "epoch": 1.0888888888888888, "grad_norm": 2.3457224369049072, "learning_rate": 9.382716049382717e-06, "loss": 0.2447, "num_input_tokens_seen": 3073014, "step": 135, "train_runtime": 402.2692, "train_tokens_per_second": 7639.198 }, { "epoch": 1.096969696969697, "grad_norm": 2.5215225219726562, "learning_rate": 9.300411522633745e-06, "loss": 0.2123, "num_input_tokens_seen": 3095126, "step": 136, "train_runtime": 404.2858, "train_tokens_per_second": 7655.786 }, { "epoch": 1.105050505050505, "grad_norm": 2.9330391883850098, "learning_rate": 9.218106995884775e-06, "loss": 0.2813, "num_input_tokens_seen": 3116438, "step": 137, "train_runtime": 406.2489, "train_tokens_per_second": 7671.252 }, { "epoch": 1.1131313131313132, "grad_norm": 2.4419281482696533, "learning_rate": 9.135802469135803e-06, "loss": 0.2355, "num_input_tokens_seen": 3139174, "step": 138, "train_runtime": 408.3028, "train_tokens_per_second": 7688.348 }, { "epoch": 1.121212121212121, "grad_norm": 2.1203596591949463, "learning_rate": 9.053497942386832e-06, "loss": 0.2362, "num_input_tokens_seen": 3165206, "step": 139, "train_runtime": 410.6277, "train_tokens_per_second": 7708.214 }, { "epoch": 1.1292929292929292, "grad_norm": 2.388300657272339, "learning_rate": 8.971193415637862e-06, "loss": 0.2683, "num_input_tokens_seen": 3189942, "step": 140, "train_runtime": 412.8585, "train_tokens_per_second": 7726.478 }, { "epoch": 1.1373737373737374, "grad_norm": 2.1845967769622803, "learning_rate": 8.888888888888888e-06, "loss": 0.2414, "num_input_tokens_seen": 3213878, "step": 141, "train_runtime": 415.0261, "train_tokens_per_second": 7743.798 }, { "epoch": 1.1454545454545455, "grad_norm": 1.9687696695327759, "learning_rate": 8.806584362139918e-06, "loss": 0.2828, "num_input_tokens_seen": 3236806, "step": 142, "train_runtime": 417.1211, "train_tokens_per_second": 7759.872 }, { "epoch": 1.1535353535353536, "grad_norm": 2.1155526638031006, "learning_rate": 8.724279835390947e-06, "loss": 0.2821, "num_input_tokens_seen": 3258822, "step": 143, "train_runtime": 419.1343, "train_tokens_per_second": 7775.127 }, { "epoch": 1.1616161616161615, "grad_norm": 2.031667947769165, "learning_rate": 8.641975308641975e-06, "loss": 0.2472, "num_input_tokens_seen": 3280694, "step": 144, "train_runtime": 421.1299, "train_tokens_per_second": 7790.219 }, { "epoch": 1.1696969696969697, "grad_norm": 2.065946340560913, "learning_rate": 8.559670781893005e-06, "loss": 0.24, "num_input_tokens_seen": 3305894, "step": 145, "train_runtime": 423.386, "train_tokens_per_second": 7808.226 }, { "epoch": 1.1777777777777778, "grad_norm": 2.0876126289367676, "learning_rate": 8.477366255144033e-06, "loss": 0.2466, "num_input_tokens_seen": 3327526, "step": 146, "train_runtime": 425.3809, "train_tokens_per_second": 7822.462 }, { "epoch": 1.185858585858586, "grad_norm": 1.9692819118499756, "learning_rate": 8.395061728395062e-06, "loss": 0.2462, "num_input_tokens_seen": 3349414, "step": 147, "train_runtime": 427.3897, "train_tokens_per_second": 7836.909 }, { "epoch": 1.1939393939393939, "grad_norm": 2.186434030532837, "learning_rate": 8.312757201646092e-06, "loss": 0.3039, "num_input_tokens_seen": 3373782, "step": 148, "train_runtime": 429.5935, "train_tokens_per_second": 7853.429 }, { "epoch": 1.202020202020202, "grad_norm": 2.0272040367126465, "learning_rate": 8.23045267489712e-06, "loss": 0.2476, "num_input_tokens_seen": 3397254, "step": 149, "train_runtime": 431.7412, "train_tokens_per_second": 7868.729 }, { "epoch": 1.2101010101010101, "grad_norm": 1.9289153814315796, "learning_rate": 8.148148148148148e-06, "loss": 0.2371, "num_input_tokens_seen": 3420102, "step": 150, "train_runtime": 433.8468, "train_tokens_per_second": 7883.202 }, { "epoch": 1.2101010101010101, "eval_loss": 0.2959754765033722, "eval_runtime": 7.0833, "eval_samples_per_second": 124.095, "eval_steps_per_second": 7.765, "num_input_tokens_seen": 3420102, "step": 150 }, { "epoch": 1.2181818181818183, "grad_norm": 2.1007144451141357, "learning_rate": 8.065843621399178e-06, "loss": 0.265, "num_input_tokens_seen": 3440438, "step": 151, "train_runtime": 461.0146, "train_tokens_per_second": 7462.752 }, { "epoch": 1.2262626262626264, "grad_norm": 2.0250070095062256, "learning_rate": 7.983539094650207e-06, "loss": 0.2486, "num_input_tokens_seen": 3466054, "step": 152, "train_runtime": 463.3174, "train_tokens_per_second": 7480.949 }, { "epoch": 1.2343434343434343, "grad_norm": 1.7474883794784546, "learning_rate": 7.901234567901235e-06, "loss": 0.2172, "num_input_tokens_seen": 3492278, "step": 153, "train_runtime": 465.6949, "train_tokens_per_second": 7499.068 }, { "epoch": 1.2424242424242424, "grad_norm": 1.8963685035705566, "learning_rate": 7.818930041152263e-06, "loss": 0.2187, "num_input_tokens_seen": 3512582, "step": 154, "train_runtime": 467.5775, "train_tokens_per_second": 7512.299 }, { "epoch": 1.2505050505050506, "grad_norm": 1.9363595247268677, "learning_rate": 7.736625514403293e-06, "loss": 0.2594, "num_input_tokens_seen": 3535750, "step": 155, "train_runtime": 469.6918, "train_tokens_per_second": 7527.809 }, { "epoch": 1.2585858585858585, "grad_norm": 2.0793097019195557, "learning_rate": 7.654320987654322e-06, "loss": 0.2463, "num_input_tokens_seen": 3559894, "step": 156, "train_runtime": 471.8957, "train_tokens_per_second": 7543.816 }, { "epoch": 1.2666666666666666, "grad_norm": 2.071737289428711, "learning_rate": 7.57201646090535e-06, "loss": 0.2553, "num_input_tokens_seen": 3580390, "step": 157, "train_runtime": 473.7908, "train_tokens_per_second": 7556.901 }, { "epoch": 1.2747474747474747, "grad_norm": 1.9994101524353027, "learning_rate": 7.489711934156379e-06, "loss": 0.2189, "num_input_tokens_seen": 3601750, "step": 158, "train_runtime": 475.7442, "train_tokens_per_second": 7570.77 }, { "epoch": 1.2828282828282829, "grad_norm": 2.021566867828369, "learning_rate": 7.4074074074074075e-06, "loss": 0.2453, "num_input_tokens_seen": 3629030, "step": 159, "train_runtime": 478.1887, "train_tokens_per_second": 7589.117 }, { "epoch": 1.290909090909091, "grad_norm": 2.1607470512390137, "learning_rate": 7.325102880658437e-06, "loss": 0.2541, "num_input_tokens_seen": 3654358, "step": 160, "train_runtime": 480.4853, "train_tokens_per_second": 7605.556 }, { "epoch": 1.298989898989899, "grad_norm": 2.1245932579040527, "learning_rate": 7.242798353909466e-06, "loss": 0.2361, "num_input_tokens_seen": 3680758, "step": 161, "train_runtime": 482.8693, "train_tokens_per_second": 7622.68 }, { "epoch": 1.307070707070707, "grad_norm": 2.2660951614379883, "learning_rate": 7.160493827160494e-06, "loss": 0.2438, "num_input_tokens_seen": 3704022, "step": 162, "train_runtime": 485.004, "train_tokens_per_second": 7637.096 }, { "epoch": 1.3151515151515152, "grad_norm": 2.2035646438598633, "learning_rate": 7.078189300411523e-06, "loss": 0.2482, "num_input_tokens_seen": 3727814, "step": 163, "train_runtime": 487.1455, "train_tokens_per_second": 7652.362 }, { "epoch": 1.3232323232323233, "grad_norm": 2.1511008739471436, "learning_rate": 6.9958847736625525e-06, "loss": 0.2547, "num_input_tokens_seen": 3749606, "step": 164, "train_runtime": 489.1325, "train_tokens_per_second": 7665.828 }, { "epoch": 1.3313131313131312, "grad_norm": 2.249523878097534, "learning_rate": 6.913580246913581e-06, "loss": 0.2968, "num_input_tokens_seen": 3774710, "step": 165, "train_runtime": 491.419, "train_tokens_per_second": 7681.245 }, { "epoch": 1.3393939393939394, "grad_norm": 2.0948562622070312, "learning_rate": 6.83127572016461e-06, "loss": 0.2359, "num_input_tokens_seen": 3793814, "step": 166, "train_runtime": 493.2079, "train_tokens_per_second": 7692.119 }, { "epoch": 1.3474747474747475, "grad_norm": 2.107844591140747, "learning_rate": 6.748971193415639e-06, "loss": 0.2737, "num_input_tokens_seen": 3818662, "step": 167, "train_runtime": 495.4635, "train_tokens_per_second": 7707.251 }, { "epoch": 1.3555555555555556, "grad_norm": 2.3334641456604004, "learning_rate": 6.666666666666667e-06, "loss": 0.2596, "num_input_tokens_seen": 3841606, "step": 168, "train_runtime": 497.5542, "train_tokens_per_second": 7720.98 }, { "epoch": 1.3636363636363638, "grad_norm": 2.0350282192230225, "learning_rate": 6.584362139917696e-06, "loss": 0.2443, "num_input_tokens_seen": 3863830, "step": 169, "train_runtime": 499.6021, "train_tokens_per_second": 7733.815 }, { "epoch": 1.3717171717171717, "grad_norm": 2.1754233837127686, "learning_rate": 6.502057613168725e-06, "loss": 0.2618, "num_input_tokens_seen": 3886230, "step": 170, "train_runtime": 501.6397, "train_tokens_per_second": 7747.055 }, { "epoch": 1.3797979797979798, "grad_norm": 2.145559072494507, "learning_rate": 6.419753086419753e-06, "loss": 0.2353, "num_input_tokens_seen": 3908982, "step": 171, "train_runtime": 503.6986, "train_tokens_per_second": 7760.557 }, { "epoch": 1.387878787878788, "grad_norm": 2.020923376083374, "learning_rate": 6.3374485596707825e-06, "loss": 0.2178, "num_input_tokens_seen": 3936150, "step": 172, "train_runtime": 506.1611, "train_tokens_per_second": 7776.477 }, { "epoch": 1.3959595959595958, "grad_norm": 2.0729899406433105, "learning_rate": 6.255144032921812e-06, "loss": 0.2592, "num_input_tokens_seen": 3959430, "step": 173, "train_runtime": 508.2944, "train_tokens_per_second": 7789.639 }, { "epoch": 1.404040404040404, "grad_norm": 2.098947525024414, "learning_rate": 6.17283950617284e-06, "loss": 0.2497, "num_input_tokens_seen": 3981126, "step": 174, "train_runtime": 510.3129, "train_tokens_per_second": 7801.344 }, { "epoch": 1.412121212121212, "grad_norm": 2.200272560119629, "learning_rate": 6.090534979423869e-06, "loss": 0.2587, "num_input_tokens_seen": 4006118, "step": 175, "train_runtime": 512.5647, "train_tokens_per_second": 7815.829 }, { "epoch": 1.412121212121212, "eval_loss": 0.29883837699890137, "eval_runtime": 7.1029, "eval_samples_per_second": 123.753, "eval_steps_per_second": 7.743, "num_input_tokens_seen": 4006118, "step": 175 }, { "epoch": 1.4202020202020202, "grad_norm": 2.150625228881836, "learning_rate": 6.008230452674898e-06, "loss": 0.2508, "num_input_tokens_seen": 4034054, "step": 176, "train_runtime": 522.2099, "train_tokens_per_second": 7724.967 }, { "epoch": 1.4282828282828284, "grad_norm": 2.0687313079833984, "learning_rate": 5.925925925925926e-06, "loss": 0.2393, "num_input_tokens_seen": 4058646, "step": 177, "train_runtime": 524.4627, "train_tokens_per_second": 7738.674 }, { "epoch": 1.4363636363636363, "grad_norm": 2.018831253051758, "learning_rate": 5.843621399176955e-06, "loss": 0.2712, "num_input_tokens_seen": 4083414, "step": 178, "train_runtime": 526.7043, "train_tokens_per_second": 7752.764 }, { "epoch": 1.4444444444444444, "grad_norm": 2.097909450531006, "learning_rate": 5.761316872427984e-06, "loss": 0.2601, "num_input_tokens_seen": 4107190, "step": 179, "train_runtime": 528.9031, "train_tokens_per_second": 7765.487 }, { "epoch": 1.4525252525252526, "grad_norm": 2.1564548015594482, "learning_rate": 5.6790123456790125e-06, "loss": 0.3076, "num_input_tokens_seen": 4129958, "step": 180, "train_runtime": 531.0094, "train_tokens_per_second": 7777.561 }, { "epoch": 1.4606060606060607, "grad_norm": 2.1547343730926514, "learning_rate": 5.596707818930042e-06, "loss": 0.2285, "num_input_tokens_seen": 4153302, "step": 181, "train_runtime": 551.2055, "train_tokens_per_second": 7534.943 }, { "epoch": 1.4686868686868686, "grad_norm": 2.0703673362731934, "learning_rate": 5.514403292181071e-06, "loss": 0.237, "num_input_tokens_seen": 4175222, "step": 182, "train_runtime": 553.2018, "train_tokens_per_second": 7547.375 }, { "epoch": 1.4767676767676767, "grad_norm": 1.8771171569824219, "learning_rate": 5.432098765432099e-06, "loss": 0.2437, "num_input_tokens_seen": 4196966, "step": 183, "train_runtime": 555.2016, "train_tokens_per_second": 7559.355 }, { "epoch": 1.4848484848484849, "grad_norm": 2.054640293121338, "learning_rate": 5.349794238683128e-06, "loss": 0.259, "num_input_tokens_seen": 4222630, "step": 184, "train_runtime": 557.5348, "train_tokens_per_second": 7573.752 }, { "epoch": 1.492929292929293, "grad_norm": 2.0560507774353027, "learning_rate": 5.2674897119341575e-06, "loss": 0.2397, "num_input_tokens_seen": 4243798, "step": 185, "train_runtime": 559.4718, "train_tokens_per_second": 7585.365 }, { "epoch": 1.5010101010101011, "grad_norm": 2.1618330478668213, "learning_rate": 5.185185185185185e-06, "loss": 0.254, "num_input_tokens_seen": 4265174, "step": 186, "train_runtime": 561.4461, "train_tokens_per_second": 7596.765 }, { "epoch": 1.509090909090909, "grad_norm": 1.9395222663879395, "learning_rate": 5.102880658436214e-06, "loss": 0.2269, "num_input_tokens_seen": 4286374, "step": 187, "train_runtime": 563.42, "train_tokens_per_second": 7607.777 }, { "epoch": 1.5171717171717172, "grad_norm": 1.9343959093093872, "learning_rate": 5.020576131687243e-06, "loss": 0.2284, "num_input_tokens_seen": 4314534, "step": 188, "train_runtime": 565.9536, "train_tokens_per_second": 7623.477 }, { "epoch": 1.5252525252525253, "grad_norm": 2.2199180126190186, "learning_rate": 4.938271604938272e-06, "loss": 0.2729, "num_input_tokens_seen": 4334726, "step": 189, "train_runtime": 567.8322, "train_tokens_per_second": 7633.815 }, { "epoch": 1.5333333333333332, "grad_norm": 2.422062397003174, "learning_rate": 4.855967078189301e-06, "loss": 0.2577, "num_input_tokens_seen": 4357238, "step": 190, "train_runtime": 569.9123, "train_tokens_per_second": 7645.453 }, { "epoch": 1.5414141414141413, "grad_norm": 2.182530641555786, "learning_rate": 4.773662551440329e-06, "loss": 0.2506, "num_input_tokens_seen": 4380310, "step": 191, "train_runtime": 572.0127, "train_tokens_per_second": 7657.714 }, { "epoch": 1.5494949494949495, "grad_norm": 1.9306634664535522, "learning_rate": 4.691358024691358e-06, "loss": 0.2492, "num_input_tokens_seen": 4402598, "step": 192, "train_runtime": 574.0447, "train_tokens_per_second": 7669.434 }, { "epoch": 1.5575757575757576, "grad_norm": 2.064788818359375, "learning_rate": 4.6090534979423875e-06, "loss": 0.2417, "num_input_tokens_seen": 4426854, "step": 193, "train_runtime": 576.2391, "train_tokens_per_second": 7682.321 }, { "epoch": 1.5656565656565657, "grad_norm": 2.1123790740966797, "learning_rate": 4.526748971193416e-06, "loss": 0.2702, "num_input_tokens_seen": 4452422, "step": 194, "train_runtime": 578.5618, "train_tokens_per_second": 7695.673 }, { "epoch": 1.5737373737373739, "grad_norm": 2.039179563522339, "learning_rate": 4.444444444444444e-06, "loss": 0.2523, "num_input_tokens_seen": 4479574, "step": 195, "train_runtime": 581.0195, "train_tokens_per_second": 7709.852 }, { "epoch": 1.5818181818181818, "grad_norm": 2.136936664581299, "learning_rate": 4.362139917695473e-06, "loss": 0.2797, "num_input_tokens_seen": 4499862, "step": 196, "train_runtime": 582.8938, "train_tokens_per_second": 7719.867 }, { "epoch": 1.58989898989899, "grad_norm": 2.0336132049560547, "learning_rate": 4.2798353909465025e-06, "loss": 0.2496, "num_input_tokens_seen": 4522614, "step": 197, "train_runtime": 584.992, "train_tokens_per_second": 7731.07 }, { "epoch": 1.5979797979797978, "grad_norm": 1.997153639793396, "learning_rate": 4.197530864197531e-06, "loss": 0.2318, "num_input_tokens_seen": 4544022, "step": 198, "train_runtime": 586.9586, "train_tokens_per_second": 7741.64 }, { "epoch": 1.606060606060606, "grad_norm": 1.994828224182129, "learning_rate": 4.11522633744856e-06, "loss": 0.2436, "num_input_tokens_seen": 4566198, "step": 199, "train_runtime": 588.9959, "train_tokens_per_second": 7752.512 }, { "epoch": 1.614141414141414, "grad_norm": 2.174928665161133, "learning_rate": 4.032921810699589e-06, "loss": 0.2769, "num_input_tokens_seen": 4588070, "step": 200, "train_runtime": 590.9965, "train_tokens_per_second": 7763.277 }, { "epoch": 1.614141414141414, "eval_loss": 0.2970900535583496, "eval_runtime": 7.1151, "eval_samples_per_second": 123.539, "eval_steps_per_second": 7.73, "num_input_tokens_seen": 4588070, "step": 200 }, { "epoch": 1.6222222222222222, "grad_norm": 2.186704158782959, "learning_rate": 3.9506172839506175e-06, "loss": 0.2691, "num_input_tokens_seen": 4612646, "step": 201, "train_runtime": 600.3639, "train_tokens_per_second": 7683.084 }, { "epoch": 1.6303030303030304, "grad_norm": 2.1499741077423096, "learning_rate": 3.868312757201647e-06, "loss": 0.2562, "num_input_tokens_seen": 4633446, "step": 202, "train_runtime": 602.3025, "train_tokens_per_second": 7692.889 }, { "epoch": 1.6383838383838385, "grad_norm": 2.155334711074829, "learning_rate": 3.786008230452675e-06, "loss": 0.2389, "num_input_tokens_seen": 4656278, "step": 203, "train_runtime": 604.4073, "train_tokens_per_second": 7703.875 }, { "epoch": 1.6464646464646466, "grad_norm": 2.1553854942321777, "learning_rate": 3.7037037037037037e-06, "loss": 0.2447, "num_input_tokens_seen": 4678006, "step": 204, "train_runtime": 606.4147, "train_tokens_per_second": 7714.203 }, { "epoch": 1.6545454545454545, "grad_norm": 2.211529493331909, "learning_rate": 3.621399176954733e-06, "loss": 0.2673, "num_input_tokens_seen": 4701206, "step": 205, "train_runtime": 608.5378, "train_tokens_per_second": 7725.414 }, { "epoch": 1.6626262626262627, "grad_norm": 1.99440336227417, "learning_rate": 3.5390946502057617e-06, "loss": 0.2631, "num_input_tokens_seen": 4724646, "step": 206, "train_runtime": 610.695, "train_tokens_per_second": 7736.507 }, { "epoch": 1.6707070707070706, "grad_norm": 2.078808307647705, "learning_rate": 3.4567901234567904e-06, "loss": 0.2474, "num_input_tokens_seen": 4748998, "step": 207, "train_runtime": 612.9302, "train_tokens_per_second": 7748.025 }, { "epoch": 1.6787878787878787, "grad_norm": 2.2216312885284424, "learning_rate": 3.3744855967078196e-06, "loss": 0.2523, "num_input_tokens_seen": 4768294, "step": 208, "train_runtime": 614.7311, "train_tokens_per_second": 7756.715 }, { "epoch": 1.6868686868686869, "grad_norm": 2.1256401538848877, "learning_rate": 3.292181069958848e-06, "loss": 0.2799, "num_input_tokens_seen": 4792550, "step": 209, "train_runtime": 616.9493, "train_tokens_per_second": 7768.143 }, { "epoch": 1.694949494949495, "grad_norm": 2.0942769050598145, "learning_rate": 3.2098765432098767e-06, "loss": 0.259, "num_input_tokens_seen": 4816006, "step": 210, "train_runtime": 619.088, "train_tokens_per_second": 7779.194 }, { "epoch": 1.7030303030303031, "grad_norm": 1.9659632444381714, "learning_rate": 3.127572016460906e-06, "loss": 0.271, "num_input_tokens_seen": 4839222, "step": 211, "train_runtime": 639.404, "train_tokens_per_second": 7568.332 }, { "epoch": 1.7111111111111112, "grad_norm": 1.9326211214065552, "learning_rate": 3.0452674897119346e-06, "loss": 0.2437, "num_input_tokens_seen": 4862822, "step": 212, "train_runtime": 641.5123, "train_tokens_per_second": 7580.247 }, { "epoch": 1.7191919191919192, "grad_norm": 2.3900415897369385, "learning_rate": 2.962962962962963e-06, "loss": 0.3026, "num_input_tokens_seen": 4884582, "step": 213, "train_runtime": 643.5091, "train_tokens_per_second": 7590.541 }, { "epoch": 1.7272727272727273, "grad_norm": 2.0574638843536377, "learning_rate": 2.880658436213992e-06, "loss": 0.2525, "num_input_tokens_seen": 4909174, "step": 214, "train_runtime": 645.7213, "train_tokens_per_second": 7602.62 }, { "epoch": 1.7353535353535352, "grad_norm": 2.039299726486206, "learning_rate": 2.798353909465021e-06, "loss": 0.2637, "num_input_tokens_seen": 4933798, "step": 215, "train_runtime": 647.9549, "train_tokens_per_second": 7614.416 }, { "epoch": 1.7434343434343433, "grad_norm": 2.1611974239349365, "learning_rate": 2.7160493827160496e-06, "loss": 0.2601, "num_input_tokens_seen": 4952742, "step": 216, "train_runtime": 649.7285, "train_tokens_per_second": 7622.787 }, { "epoch": 1.7515151515151515, "grad_norm": 1.8820812702178955, "learning_rate": 2.6337448559670788e-06, "loss": 0.2407, "num_input_tokens_seen": 4976246, "step": 217, "train_runtime": 651.852, "train_tokens_per_second": 7634.012 }, { "epoch": 1.7595959595959596, "grad_norm": 2.016808271408081, "learning_rate": 2.551440329218107e-06, "loss": 0.2237, "num_input_tokens_seen": 4995798, "step": 218, "train_runtime": 653.6727, "train_tokens_per_second": 7642.66 }, { "epoch": 1.7676767676767677, "grad_norm": 2.027350902557373, "learning_rate": 2.469135802469136e-06, "loss": 0.2408, "num_input_tokens_seen": 5018838, "step": 219, "train_runtime": 655.7795, "train_tokens_per_second": 7653.241 }, { "epoch": 1.7757575757575759, "grad_norm": 2.164444923400879, "learning_rate": 2.3868312757201646e-06, "loss": 0.2154, "num_input_tokens_seen": 5041782, "step": 220, "train_runtime": 657.8444, "train_tokens_per_second": 7664.094 }, { "epoch": 1.783838383838384, "grad_norm": 2.082343339920044, "learning_rate": 2.3045267489711937e-06, "loss": 0.2569, "num_input_tokens_seen": 5063478, "step": 221, "train_runtime": 659.8611, "train_tokens_per_second": 7673.552 }, { "epoch": 1.791919191919192, "grad_norm": 2.043057680130005, "learning_rate": 2.222222222222222e-06, "loss": 0.2536, "num_input_tokens_seen": 5085526, "step": 222, "train_runtime": 661.8702, "train_tokens_per_second": 7683.57 }, { "epoch": 1.8, "grad_norm": 1.9899940490722656, "learning_rate": 2.1399176954732512e-06, "loss": 0.2755, "num_input_tokens_seen": 5109430, "step": 223, "train_runtime": 664.0648, "train_tokens_per_second": 7694.173 }, { "epoch": 1.808080808080808, "grad_norm": 2.1286203861236572, "learning_rate": 2.05761316872428e-06, "loss": 0.2391, "num_input_tokens_seen": 5132182, "step": 224, "train_runtime": 666.1433, "train_tokens_per_second": 7704.321 }, { "epoch": 1.816161616161616, "grad_norm": 1.9586842060089111, "learning_rate": 1.9753086419753087e-06, "loss": 0.2511, "num_input_tokens_seen": 5153622, "step": 225, "train_runtime": 668.1036, "train_tokens_per_second": 7713.807 }, { "epoch": 1.816161616161616, "eval_loss": 0.29719212651252747, "eval_runtime": 7.0733, "eval_samples_per_second": 124.27, "eval_steps_per_second": 7.776, "num_input_tokens_seen": 5153622, "step": 225 }, { "epoch": 1.8242424242424242, "grad_norm": 2.056194543838501, "learning_rate": 1.8930041152263375e-06, "loss": 0.239, "num_input_tokens_seen": 5178470, "step": 226, "train_runtime": 677.4315, "train_tokens_per_second": 7644.27 }, { "epoch": 1.8323232323232324, "grad_norm": 2.03861403465271, "learning_rate": 1.8106995884773665e-06, "loss": 0.2453, "num_input_tokens_seen": 5199062, "step": 227, "train_runtime": 679.3306, "train_tokens_per_second": 7653.214 }, { "epoch": 1.8404040404040405, "grad_norm": 2.454902410507202, "learning_rate": 1.7283950617283952e-06, "loss": 0.2815, "num_input_tokens_seen": 5218134, "step": 228, "train_runtime": 681.1112, "train_tokens_per_second": 7661.207 }, { "epoch": 1.8484848484848486, "grad_norm": 2.0664114952087402, "learning_rate": 1.646090534979424e-06, "loss": 0.2481, "num_input_tokens_seen": 5242054, "step": 229, "train_runtime": 683.2902, "train_tokens_per_second": 7671.783 }, { "epoch": 1.8565656565656565, "grad_norm": 2.1586387157440186, "learning_rate": 1.563786008230453e-06, "loss": 0.2255, "num_input_tokens_seen": 5264518, "step": 230, "train_runtime": 685.3446, "train_tokens_per_second": 7681.564 }, { "epoch": 1.8646464646464647, "grad_norm": 2.2115135192871094, "learning_rate": 1.4814814814814815e-06, "loss": 0.2941, "num_input_tokens_seen": 5284374, "step": 231, "train_runtime": 687.1947, "train_tokens_per_second": 7689.777 }, { "epoch": 1.8727272727272726, "grad_norm": 1.9213886260986328, "learning_rate": 1.3991769547325104e-06, "loss": 0.2309, "num_input_tokens_seen": 5303622, "step": 232, "train_runtime": 688.9977, "train_tokens_per_second": 7697.591 }, { "epoch": 1.8808080808080807, "grad_norm": 1.919615387916565, "learning_rate": 1.3168724279835394e-06, "loss": 0.2332, "num_input_tokens_seen": 5329718, "step": 233, "train_runtime": 691.3575, "train_tokens_per_second": 7709.062 }, { "epoch": 1.8888888888888888, "grad_norm": 1.9546780586242676, "learning_rate": 1.234567901234568e-06, "loss": 0.2468, "num_input_tokens_seen": 5349718, "step": 234, "train_runtime": 693.227, "train_tokens_per_second": 7717.123 }, { "epoch": 1.896969696969697, "grad_norm": 2.1279263496398926, "learning_rate": 1.1522633744855969e-06, "loss": 0.2711, "num_input_tokens_seen": 5369638, "step": 235, "train_runtime": 695.0864, "train_tokens_per_second": 7725.137 }, { "epoch": 1.905050505050505, "grad_norm": 2.0568149089813232, "learning_rate": 1.0699588477366256e-06, "loss": 0.262, "num_input_tokens_seen": 5392726, "step": 236, "train_runtime": 697.1851, "train_tokens_per_second": 7734.999 }, { "epoch": 1.9131313131313132, "grad_norm": 2.307243824005127, "learning_rate": 9.876543209876544e-07, "loss": 0.2773, "num_input_tokens_seen": 5412470, "step": 237, "train_runtime": 699.0602, "train_tokens_per_second": 7742.495 }, { "epoch": 1.9212121212121214, "grad_norm": 2.0928726196289062, "learning_rate": 9.053497942386832e-07, "loss": 0.2715, "num_input_tokens_seen": 5437894, "step": 238, "train_runtime": 701.3562, "train_tokens_per_second": 7753.398 }, { "epoch": 1.9292929292929293, "grad_norm": 2.1170663833618164, "learning_rate": 8.23045267489712e-07, "loss": 0.2814, "num_input_tokens_seen": 5461686, "step": 239, "train_runtime": 703.5235, "train_tokens_per_second": 7763.331 }, { "epoch": 1.9373737373737374, "grad_norm": 1.9261893033981323, "learning_rate": 7.407407407407407e-07, "loss": 0.2426, "num_input_tokens_seen": 5486054, "step": 240, "train_runtime": 705.7339, "train_tokens_per_second": 7773.545 }, { "epoch": 1.9454545454545453, "grad_norm": 2.053776741027832, "learning_rate": 6.584362139917697e-07, "loss": 0.2712, "num_input_tokens_seen": 5509142, "step": 241, "train_runtime": 726.1192, "train_tokens_per_second": 7587.104 }, { "epoch": 1.9535353535353535, "grad_norm": 1.9918407201766968, "learning_rate": 5.761316872427984e-07, "loss": 0.2019, "num_input_tokens_seen": 5528598, "step": 242, "train_runtime": 727.9519, "train_tokens_per_second": 7594.73 }, { "epoch": 1.9616161616161616, "grad_norm": 1.8533083200454712, "learning_rate": 4.938271604938272e-07, "loss": 0.2358, "num_input_tokens_seen": 5551926, "step": 243, "train_runtime": 730.0608, "train_tokens_per_second": 7604.744 }, { "epoch": 1.9696969696969697, "grad_norm": 1.9955955743789673, "learning_rate": 4.11522633744856e-07, "loss": 0.2237, "num_input_tokens_seen": 5574326, "step": 244, "train_runtime": 732.1133, "train_tokens_per_second": 7614.021 }, { "epoch": 1.9777777777777779, "grad_norm": 2.0239830017089844, "learning_rate": 3.2921810699588484e-07, "loss": 0.2742, "num_input_tokens_seen": 5598310, "step": 245, "train_runtime": 734.2562, "train_tokens_per_second": 7624.464 }, { "epoch": 1.985858585858586, "grad_norm": 2.1352379322052, "learning_rate": 2.469135802469136e-07, "loss": 0.2701, "num_input_tokens_seen": 5620534, "step": 246, "train_runtime": 736.283, "train_tokens_per_second": 7633.66 }, { "epoch": 1.993939393939394, "grad_norm": 2.292893171310425, "learning_rate": 1.6460905349794242e-07, "loss": 0.2626, "num_input_tokens_seen": 5640982, "step": 247, "train_runtime": 738.169, "train_tokens_per_second": 7641.857 }, { "epoch": 2.0, "grad_norm": 2.7160730361938477, "learning_rate": 8.230452674897121e-08, "loss": 0.2577, "num_input_tokens_seen": 5653442, "step": 248, "train_runtime": 739.3962, "train_tokens_per_second": 7646.025 } ], "logging_steps": 1, "max_steps": 248, "num_input_tokens_seen": 5653442, "num_train_epochs": 2, "save_steps": 30, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 9.412213509169152e+16, "train_batch_size": 16, "trial_name": null, "trial_params": null }