{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0, "eval_steps": 25, "global_step": 248, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.00808080808080808, "grad_norm": 0.9913852214813232, "learning_rate": 0.0, "loss": 1.3233, "num_input_tokens_seen": 24048, "step": 1, "train_runtime": 5.5427, "train_tokens_per_second": 4338.668 }, { "epoch": 0.01616161616161616, "grad_norm": 1.0378535985946655, "learning_rate": 4e-05, "loss": 1.3425, "num_input_tokens_seen": 48096, "step": 2, "train_runtime": 8.8764, "train_tokens_per_second": 5418.441 }, { "epoch": 0.024242424242424242, "grad_norm": 1.0206665992736816, "learning_rate": 8e-05, "loss": 1.3516, "num_input_tokens_seen": 68416, "step": 3, "train_runtime": 11.7535, "train_tokens_per_second": 5820.919 }, { "epoch": 0.03232323232323232, "grad_norm": 1.2065541744232178, "learning_rate": 0.00012, "loss": 1.3039, "num_input_tokens_seen": 90432, "step": 4, "train_runtime": 14.8511, "train_tokens_per_second": 6089.231 }, { "epoch": 0.04040404040404041, "grad_norm": 1.3231337070465088, "learning_rate": 0.00016, "loss": 1.0488, "num_input_tokens_seen": 110544, "step": 5, "train_runtime": 17.7213, "train_tokens_per_second": 6237.921 }, { "epoch": 0.048484848484848485, "grad_norm": 0.7355687022209167, "learning_rate": 0.0002, "loss": 0.649, "num_input_tokens_seen": 135584, "step": 6, "train_runtime": 21.4984, "train_tokens_per_second": 6306.704 }, { "epoch": 0.05656565656565657, "grad_norm": 0.7402859926223755, "learning_rate": 0.0001991769547325103, "loss": 0.4857, "num_input_tokens_seen": 159200, "step": 7, "train_runtime": 24.8086, "train_tokens_per_second": 6417.137 }, { "epoch": 0.06464646464646465, "grad_norm": 0.5103421807289124, "learning_rate": 0.0001983539094650206, "loss": 0.371, "num_input_tokens_seen": 182224, "step": 8, "train_runtime": 28.0753, "train_tokens_per_second": 6490.548 }, { "epoch": 0.07272727272727272, "grad_norm": 0.3125229477882385, "learning_rate": 0.00019753086419753085, "loss": 0.3324, "num_input_tokens_seen": 205472, "step": 9, "train_runtime": 31.3551, "train_tokens_per_second": 6553.073 }, { "epoch": 0.08080808080808081, "grad_norm": 0.33310967683792114, "learning_rate": 0.00019670781893004114, "loss": 0.2862, "num_input_tokens_seen": 230400, "step": 10, "train_runtime": 34.8863, "train_tokens_per_second": 6604.316 }, { "epoch": 0.08888888888888889, "grad_norm": 0.33717748522758484, "learning_rate": 0.00019588477366255146, "loss": 0.2973, "num_input_tokens_seen": 252736, "step": 11, "train_runtime": 38.0785, "train_tokens_per_second": 6637.239 }, { "epoch": 0.09696969696969697, "grad_norm": 0.383858859539032, "learning_rate": 0.00019506172839506175, "loss": 0.2761, "num_input_tokens_seen": 273584, "step": 12, "train_runtime": 41.108, "train_tokens_per_second": 6655.248 }, { "epoch": 0.10505050505050505, "grad_norm": 0.33506128191947937, "learning_rate": 0.00019423868312757204, "loss": 0.3092, "num_input_tokens_seen": 299968, "step": 13, "train_runtime": 44.8301, "train_tokens_per_second": 6691.217 }, { "epoch": 0.11313131313131314, "grad_norm": 0.25691795349121094, "learning_rate": 0.00019341563786008233, "loss": 0.2943, "num_input_tokens_seen": 322480, "step": 14, "train_runtime": 48.0773, "train_tokens_per_second": 6707.535 }, { "epoch": 0.12121212121212122, "grad_norm": 0.23056800663471222, "learning_rate": 0.0001925925925925926, "loss": 0.2575, "num_input_tokens_seen": 344864, "step": 15, "train_runtime": 51.2647, "train_tokens_per_second": 6727.124 }, { "epoch": 0.1292929292929293, "grad_norm": 0.2146308422088623, "learning_rate": 0.00019176954732510288, "loss": 0.2441, "num_input_tokens_seen": 369296, "step": 16, "train_runtime": 54.7643, "train_tokens_per_second": 6743.376 }, { "epoch": 0.13737373737373737, "grad_norm": 0.18066899478435516, "learning_rate": 0.00019094650205761317, "loss": 0.2686, "num_input_tokens_seen": 390944, "step": 17, "train_runtime": 57.902, "train_tokens_per_second": 6751.823 }, { "epoch": 0.14545454545454545, "grad_norm": 0.18266606330871582, "learning_rate": 0.00019012345679012346, "loss": 0.2484, "num_input_tokens_seen": 414144, "step": 18, "train_runtime": 61.2046, "train_tokens_per_second": 6766.553 }, { "epoch": 0.15353535353535352, "grad_norm": 0.18596097826957703, "learning_rate": 0.00018930041152263375, "loss": 0.2215, "num_input_tokens_seen": 435840, "step": 19, "train_runtime": 64.3043, "train_tokens_per_second": 6777.778 }, { "epoch": 0.16161616161616163, "grad_norm": 0.19186538457870483, "learning_rate": 0.00018847736625514404, "loss": 0.2181, "num_input_tokens_seen": 459808, "step": 20, "train_runtime": 67.7619, "train_tokens_per_second": 6785.644 }, { "epoch": 0.1696969696969697, "grad_norm": 0.1703331023454666, "learning_rate": 0.00018765432098765433, "loss": 0.2441, "num_input_tokens_seen": 479504, "step": 21, "train_runtime": 70.6513, "train_tokens_per_second": 6786.914 }, { "epoch": 0.17777777777777778, "grad_norm": 0.17710761725902557, "learning_rate": 0.00018683127572016462, "loss": 0.2475, "num_input_tokens_seen": 505712, "step": 22, "train_runtime": 74.4032, "train_tokens_per_second": 6796.911 }, { "epoch": 0.18585858585858586, "grad_norm": 0.18230487406253815, "learning_rate": 0.0001860082304526749, "loss": 0.2586, "num_input_tokens_seen": 525456, "step": 23, "train_runtime": 77.2642, "train_tokens_per_second": 6800.768 }, { "epoch": 0.19393939393939394, "grad_norm": 0.16953755915164948, "learning_rate": 0.0001851851851851852, "loss": 0.2548, "num_input_tokens_seen": 548928, "step": 24, "train_runtime": 80.6542, "train_tokens_per_second": 6805.941 }, { "epoch": 0.20202020202020202, "grad_norm": 0.1729792058467865, "learning_rate": 0.0001843621399176955, "loss": 0.221, "num_input_tokens_seen": 568608, "step": 25, "train_runtime": 83.58, "train_tokens_per_second": 6803.16 }, { "epoch": 0.20202020202020202, "eval_loss": 0.2138330042362213, "eval_runtime": 15.9812, "eval_samples_per_second": 55.002, "eval_steps_per_second": 3.442, "num_input_tokens_seen": 568608, "step": 25 }, { "epoch": 0.2101010101010101, "grad_norm": 0.1425217092037201, "learning_rate": 0.00018353909465020578, "loss": 0.2036, "num_input_tokens_seen": 592240, "step": 26, "train_runtime": 103.0213, "train_tokens_per_second": 5748.712 }, { "epoch": 0.21818181818181817, "grad_norm": 0.1629820615053177, "learning_rate": 0.00018271604938271605, "loss": 0.1973, "num_input_tokens_seen": 613168, "step": 27, "train_runtime": 106.1403, "train_tokens_per_second": 5776.96 }, { "epoch": 0.22626262626262628, "grad_norm": 0.13308098912239075, "learning_rate": 0.00018189300411522634, "loss": 0.2178, "num_input_tokens_seen": 637552, "step": 28, "train_runtime": 109.6485, "train_tokens_per_second": 5814.508 }, { "epoch": 0.23434343434343435, "grad_norm": 0.13057714700698853, "learning_rate": 0.00018106995884773663, "loss": 0.2244, "num_input_tokens_seen": 661184, "step": 29, "train_runtime": 113.0702, "train_tokens_per_second": 5847.551 }, { "epoch": 0.24242424242424243, "grad_norm": 0.15625949203968048, "learning_rate": 0.00018024691358024692, "loss": 0.2448, "num_input_tokens_seen": 683072, "step": 30, "train_runtime": 116.2536, "train_tokens_per_second": 5875.704 }, { "epoch": 0.2505050505050505, "grad_norm": 0.1479414701461792, "learning_rate": 0.0001794238683127572, "loss": 0.2132, "num_input_tokens_seen": 703776, "step": 31, "train_runtime": 119.8681, "train_tokens_per_second": 5871.251 }, { "epoch": 0.2585858585858586, "grad_norm": 0.12871505320072174, "learning_rate": 0.0001786008230452675, "loss": 0.2193, "num_input_tokens_seen": 729584, "step": 32, "train_runtime": 123.5834, "train_tokens_per_second": 5903.574 }, { "epoch": 0.26666666666666666, "grad_norm": 0.13625787198543549, "learning_rate": 0.00017777777777777779, "loss": 0.2572, "num_input_tokens_seen": 752672, "step": 33, "train_runtime": 126.9484, "train_tokens_per_second": 5928.961 }, { "epoch": 0.27474747474747474, "grad_norm": 0.13514648377895355, "learning_rate": 0.00017695473251028808, "loss": 0.1983, "num_input_tokens_seen": 776672, "step": 34, "train_runtime": 130.4118, "train_tokens_per_second": 5955.537 }, { "epoch": 0.2828282828282828, "grad_norm": 0.13971051573753357, "learning_rate": 0.00017613168724279837, "loss": 0.2283, "num_input_tokens_seen": 801296, "step": 35, "train_runtime": 133.967, "train_tokens_per_second": 5981.294 }, { "epoch": 0.2909090909090909, "grad_norm": 0.1429297775030136, "learning_rate": 0.00017530864197530866, "loss": 0.199, "num_input_tokens_seen": 822368, "step": 36, "train_runtime": 137.0476, "train_tokens_per_second": 6000.599 }, { "epoch": 0.298989898989899, "grad_norm": 0.13625267148017883, "learning_rate": 0.00017448559670781895, "loss": 0.1851, "num_input_tokens_seen": 848928, "step": 37, "train_runtime": 140.8511, "train_tokens_per_second": 6027.132 }, { "epoch": 0.30707070707070705, "grad_norm": 0.13639648258686066, "learning_rate": 0.00017366255144032924, "loss": 0.1784, "num_input_tokens_seen": 870672, "step": 38, "train_runtime": 143.9915, "train_tokens_per_second": 6046.692 }, { "epoch": 0.3151515151515151, "grad_norm": 0.15709735453128815, "learning_rate": 0.0001728395061728395, "loss": 0.2379, "num_input_tokens_seen": 892064, "step": 39, "train_runtime": 147.1192, "train_tokens_per_second": 6063.547 }, { "epoch": 0.32323232323232326, "grad_norm": 0.13749410212039948, "learning_rate": 0.0001720164609053498, "loss": 0.2086, "num_input_tokens_seen": 915680, "step": 40, "train_runtime": 150.5405, "train_tokens_per_second": 6082.617 }, { "epoch": 0.33131313131313134, "grad_norm": 0.15497097373008728, "learning_rate": 0.00017119341563786008, "loss": 0.2155, "num_input_tokens_seen": 935216, "step": 41, "train_runtime": 153.3826, "train_tokens_per_second": 6097.277 }, { "epoch": 0.3393939393939394, "grad_norm": 0.14246957004070282, "learning_rate": 0.00017037037037037037, "loss": 0.1926, "num_input_tokens_seen": 956864, "step": 42, "train_runtime": 156.5384, "train_tokens_per_second": 6112.648 }, { "epoch": 0.3474747474747475, "grad_norm": 0.1377769261598587, "learning_rate": 0.00016954732510288066, "loss": 0.2117, "num_input_tokens_seen": 981440, "step": 43, "train_runtime": 160.0454, "train_tokens_per_second": 6132.259 }, { "epoch": 0.35555555555555557, "grad_norm": 0.1453401744365692, "learning_rate": 0.00016872427983539098, "loss": 0.1787, "num_input_tokens_seen": 1001232, "step": 44, "train_runtime": 162.9716, "train_tokens_per_second": 6143.599 }, { "epoch": 0.36363636363636365, "grad_norm": 0.13512200117111206, "learning_rate": 0.00016790123456790124, "loss": 0.1778, "num_input_tokens_seen": 1027680, "step": 45, "train_runtime": 166.7953, "train_tokens_per_second": 6161.325 }, { "epoch": 0.3717171717171717, "grad_norm": 0.14032725989818573, "learning_rate": 0.00016707818930041153, "loss": 0.2622, "num_input_tokens_seen": 1049968, "step": 46, "train_runtime": 170.0243, "train_tokens_per_second": 6175.401 }, { "epoch": 0.3797979797979798, "grad_norm": 0.13695235550403595, "learning_rate": 0.00016625514403292182, "loss": 0.2172, "num_input_tokens_seen": 1071840, "step": 47, "train_runtime": 173.2045, "train_tokens_per_second": 6188.291 }, { "epoch": 0.3878787878787879, "grad_norm": 0.14571040868759155, "learning_rate": 0.0001654320987654321, "loss": 0.1682, "num_input_tokens_seen": 1092864, "step": 48, "train_runtime": 176.2872, "train_tokens_per_second": 6199.339 }, { "epoch": 0.39595959595959596, "grad_norm": 0.13497225940227509, "learning_rate": 0.0001646090534979424, "loss": 0.2167, "num_input_tokens_seen": 1117040, "step": 49, "train_runtime": 179.7447, "train_tokens_per_second": 6214.592 }, { "epoch": 0.40404040404040403, "grad_norm": 0.13479158282279968, "learning_rate": 0.0001637860082304527, "loss": 0.2188, "num_input_tokens_seen": 1140240, "step": 50, "train_runtime": 183.112, "train_tokens_per_second": 6227.007 }, { "epoch": 0.40404040404040403, "eval_loss": 0.19270148873329163, "eval_runtime": 15.9678, "eval_samples_per_second": 55.048, "eval_steps_per_second": 3.444, "num_input_tokens_seen": 1140240, "step": 50 }, { "epoch": 0.4121212121212121, "grad_norm": 0.14810238778591156, "learning_rate": 0.00016296296296296295, "loss": 0.1908, "num_input_tokens_seen": 1161104, "step": 51, "train_runtime": 202.1269, "train_tokens_per_second": 5744.431 }, { "epoch": 0.4202020202020202, "grad_norm": 0.12631717324256897, "learning_rate": 0.00016213991769547324, "loss": 0.2194, "num_input_tokens_seen": 1189328, "step": 52, "train_runtime": 206.1876, "train_tokens_per_second": 5768.183 }, { "epoch": 0.42828282828282827, "grad_norm": 0.12934885919094086, "learning_rate": 0.00016131687242798353, "loss": 0.1682, "num_input_tokens_seen": 1211120, "step": 53, "train_runtime": 209.3667, "train_tokens_per_second": 5784.684 }, { "epoch": 0.43636363636363634, "grad_norm": 0.1369091421365738, "learning_rate": 0.00016049382716049385, "loss": 0.1882, "num_input_tokens_seen": 1234080, "step": 54, "train_runtime": 212.7157, "train_tokens_per_second": 5801.546 }, { "epoch": 0.4444444444444444, "grad_norm": 0.14891834557056427, "learning_rate": 0.00015967078189300414, "loss": 0.1898, "num_input_tokens_seen": 1256880, "step": 55, "train_runtime": 216.0146, "train_tokens_per_second": 5818.495 }, { "epoch": 0.45252525252525255, "grad_norm": 0.15192829072475433, "learning_rate": 0.00015884773662551443, "loss": 0.2452, "num_input_tokens_seen": 1281376, "step": 56, "train_runtime": 219.5282, "train_tokens_per_second": 5836.954 }, { "epoch": 0.46060606060606063, "grad_norm": 0.13381753861904144, "learning_rate": 0.0001580246913580247, "loss": 0.1983, "num_input_tokens_seen": 1309216, "step": 57, "train_runtime": 223.5427, "train_tokens_per_second": 5856.67 }, { "epoch": 0.4686868686868687, "grad_norm": 0.14824049174785614, "learning_rate": 0.00015720164609053498, "loss": 0.2358, "num_input_tokens_seen": 1331120, "step": 58, "train_runtime": 226.7435, "train_tokens_per_second": 5870.599 }, { "epoch": 0.4767676767676768, "grad_norm": 0.15301313996315002, "learning_rate": 0.00015637860082304527, "loss": 0.1871, "num_input_tokens_seen": 1354976, "step": 59, "train_runtime": 230.1754, "train_tokens_per_second": 5886.711 }, { "epoch": 0.48484848484848486, "grad_norm": 0.1360855996608734, "learning_rate": 0.00015555555555555556, "loss": 0.2078, "num_input_tokens_seen": 1376976, "step": 60, "train_runtime": 233.3715, "train_tokens_per_second": 5900.36 }, { "epoch": 0.49292929292929294, "grad_norm": 0.1479628086090088, "learning_rate": 0.00015473251028806585, "loss": 0.2039, "num_input_tokens_seen": 1397952, "step": 61, "train_runtime": 236.9762, "train_tokens_per_second": 5899.125 }, { "epoch": 0.501010101010101, "grad_norm": 0.13906534016132355, "learning_rate": 0.00015390946502057614, "loss": 0.1926, "num_input_tokens_seen": 1417712, "step": 62, "train_runtime": 239.842, "train_tokens_per_second": 5911.024 }, { "epoch": 0.509090909090909, "grad_norm": 0.1498580425977707, "learning_rate": 0.0001530864197530864, "loss": 0.1674, "num_input_tokens_seen": 1438544, "step": 63, "train_runtime": 242.9024, "train_tokens_per_second": 5922.312 }, { "epoch": 0.5171717171717172, "grad_norm": 0.13896457850933075, "learning_rate": 0.00015226337448559672, "loss": 0.1779, "num_input_tokens_seen": 1461776, "step": 64, "train_runtime": 246.286, "train_tokens_per_second": 5935.278 }, { "epoch": 0.5252525252525253, "grad_norm": 0.15526247024536133, "learning_rate": 0.000151440329218107, "loss": 0.2209, "num_input_tokens_seen": 1483600, "step": 65, "train_runtime": 249.4086, "train_tokens_per_second": 5948.472 }, { "epoch": 0.5333333333333333, "grad_norm": 0.15172874927520752, "learning_rate": 0.0001506172839506173, "loss": 0.1939, "num_input_tokens_seen": 1507280, "step": 66, "train_runtime": 252.8239, "train_tokens_per_second": 5961.777 }, { "epoch": 0.5414141414141415, "grad_norm": 0.15608155727386475, "learning_rate": 0.0001497942386831276, "loss": 0.2115, "num_input_tokens_seen": 1530176, "step": 67, "train_runtime": 256.1302, "train_tokens_per_second": 5974.211 }, { "epoch": 0.5494949494949495, "grad_norm": 0.13221146166324615, "learning_rate": 0.00014897119341563788, "loss": 0.1864, "num_input_tokens_seen": 1553520, "step": 68, "train_runtime": 259.5354, "train_tokens_per_second": 5985.772 }, { "epoch": 0.5575757575757576, "grad_norm": 0.13630913197994232, "learning_rate": 0.00014814814814814815, "loss": 0.1888, "num_input_tokens_seen": 1577728, "step": 69, "train_runtime": 263.0794, "train_tokens_per_second": 5997.155 }, { "epoch": 0.5656565656565656, "grad_norm": 0.1588101089000702, "learning_rate": 0.00014732510288065844, "loss": 0.1622, "num_input_tokens_seen": 1598448, "step": 70, "train_runtime": 266.1041, "train_tokens_per_second": 6006.852 }, { "epoch": 0.5737373737373738, "grad_norm": 0.1479269117116928, "learning_rate": 0.00014650205761316873, "loss": 0.1665, "num_input_tokens_seen": 1619616, "step": 71, "train_runtime": 269.2171, "train_tokens_per_second": 6016.021 }, { "epoch": 0.5818181818181818, "grad_norm": 0.1633758842945099, "learning_rate": 0.00014567901234567902, "loss": 0.2066, "num_input_tokens_seen": 1647504, "step": 72, "train_runtime": 273.2086, "train_tokens_per_second": 6030.206 }, { "epoch": 0.5898989898989899, "grad_norm": 0.1569192260503769, "learning_rate": 0.0001448559670781893, "loss": 0.2209, "num_input_tokens_seen": 1669600, "step": 73, "train_runtime": 276.4483, "train_tokens_per_second": 6039.465 }, { "epoch": 0.597979797979798, "grad_norm": 0.15907315909862518, "learning_rate": 0.0001440329218106996, "loss": 0.203, "num_input_tokens_seen": 1692464, "step": 74, "train_runtime": 279.7549, "train_tokens_per_second": 6049.811 }, { "epoch": 0.6060606060606061, "grad_norm": 0.15339483320713043, "learning_rate": 0.00014320987654320989, "loss": 0.1902, "num_input_tokens_seen": 1714544, "step": 75, "train_runtime": 282.9625, "train_tokens_per_second": 6059.263 }, { "epoch": 0.6060606060606061, "eval_loss": 0.18341881036758423, "eval_runtime": 15.9903, "eval_samples_per_second": 54.971, "eval_steps_per_second": 3.44, "num_input_tokens_seen": 1714544, "step": 75 }, { "epoch": 0.6141414141414141, "grad_norm": 0.1519935429096222, "learning_rate": 0.00014238683127572018, "loss": 0.1774, "num_input_tokens_seen": 1734992, "step": 76, "train_runtime": 301.9584, "train_tokens_per_second": 5745.799 }, { "epoch": 0.6222222222222222, "grad_norm": 0.1523190289735794, "learning_rate": 0.00014156378600823047, "loss": 0.188, "num_input_tokens_seen": 1758528, "step": 77, "train_runtime": 305.3612, "train_tokens_per_second": 5758.846 }, { "epoch": 0.6303030303030303, "grad_norm": 0.16023258864879608, "learning_rate": 0.00014074074074074076, "loss": 0.2015, "num_input_tokens_seen": 1782768, "step": 78, "train_runtime": 308.8338, "train_tokens_per_second": 5772.58 }, { "epoch": 0.6383838383838384, "grad_norm": 0.15232358872890472, "learning_rate": 0.00013991769547325105, "loss": 0.1844, "num_input_tokens_seen": 1806000, "step": 79, "train_runtime": 312.204, "train_tokens_per_second": 5784.679 }, { "epoch": 0.6464646464646465, "grad_norm": 0.15448316931724548, "learning_rate": 0.00013909465020576134, "loss": 0.1729, "num_input_tokens_seen": 1833264, "step": 80, "train_runtime": 316.1144, "train_tokens_per_second": 5799.368 }, { "epoch": 0.6545454545454545, "grad_norm": 0.16937431693077087, "learning_rate": 0.0001382716049382716, "loss": 0.2037, "num_input_tokens_seen": 1855920, "step": 81, "train_runtime": 319.4445, "train_tokens_per_second": 5809.835 }, { "epoch": 0.6626262626262627, "grad_norm": 0.1692294478416443, "learning_rate": 0.0001374485596707819, "loss": 0.2102, "num_input_tokens_seen": 1877664, "step": 82, "train_runtime": 322.623, "train_tokens_per_second": 5819.994 }, { "epoch": 0.6707070707070707, "grad_norm": 0.15476073324680328, "learning_rate": 0.00013662551440329218, "loss": 0.1601, "num_input_tokens_seen": 1901152, "step": 83, "train_runtime": 326.007, "train_tokens_per_second": 5831.63 }, { "epoch": 0.6787878787878788, "grad_norm": 0.1650950163602829, "learning_rate": 0.00013580246913580247, "loss": 0.2074, "num_input_tokens_seen": 1927440, "step": 84, "train_runtime": 329.7391, "train_tokens_per_second": 5845.348 }, { "epoch": 0.6868686868686869, "grad_norm": 0.17345544695854187, "learning_rate": 0.00013497942386831276, "loss": 0.1916, "num_input_tokens_seen": 1951408, "step": 85, "train_runtime": 333.1884, "train_tokens_per_second": 5856.771 }, { "epoch": 0.694949494949495, "grad_norm": 0.16704945266246796, "learning_rate": 0.00013415637860082305, "loss": 0.2071, "num_input_tokens_seen": 1973200, "step": 86, "train_runtime": 336.3437, "train_tokens_per_second": 5866.619 }, { "epoch": 0.703030303030303, "grad_norm": 0.14658761024475098, "learning_rate": 0.00013333333333333334, "loss": 0.228, "num_input_tokens_seen": 1994528, "step": 87, "train_runtime": 339.4404, "train_tokens_per_second": 5875.93 }, { "epoch": 0.7111111111111111, "grad_norm": 0.17460143566131592, "learning_rate": 0.00013251028806584363, "loss": 0.1777, "num_input_tokens_seen": 2019248, "step": 88, "train_runtime": 343.0056, "train_tokens_per_second": 5886.924 }, { "epoch": 0.7191919191919192, "grad_norm": 0.1555347740650177, "learning_rate": 0.00013168724279835392, "loss": 0.1718, "num_input_tokens_seen": 2040592, "step": 89, "train_runtime": 346.1188, "train_tokens_per_second": 5895.641 }, { "epoch": 0.7272727272727273, "grad_norm": 0.14311373233795166, "learning_rate": 0.0001308641975308642, "loss": 0.1703, "num_input_tokens_seen": 2062032, "step": 90, "train_runtime": 349.2336, "train_tokens_per_second": 5904.449 }, { "epoch": 0.7353535353535353, "grad_norm": 0.15284591913223267, "learning_rate": 0.0001300411522633745, "loss": 0.1685, "num_input_tokens_seen": 2082368, "step": 91, "train_runtime": 352.7694, "train_tokens_per_second": 5902.915 }, { "epoch": 0.7434343434343434, "grad_norm": 0.155190110206604, "learning_rate": 0.00012921810699588476, "loss": 0.1604, "num_input_tokens_seen": 2104976, "step": 92, "train_runtime": 356.0443, "train_tokens_per_second": 5912.118 }, { "epoch": 0.7515151515151515, "grad_norm": 0.15990827977657318, "learning_rate": 0.00012839506172839505, "loss": 0.1926, "num_input_tokens_seen": 2125664, "step": 93, "train_runtime": 359.04, "train_tokens_per_second": 5920.41 }, { "epoch": 0.7595959595959596, "grad_norm": 0.14356884360313416, "learning_rate": 0.00012757201646090534, "loss": 0.157, "num_input_tokens_seen": 2151216, "step": 94, "train_runtime": 362.7537, "train_tokens_per_second": 5930.238 }, { "epoch": 0.7676767676767676, "grad_norm": 0.16834881901741028, "learning_rate": 0.00012674897119341563, "loss": 0.1684, "num_input_tokens_seen": 2174480, "step": 95, "train_runtime": 366.0908, "train_tokens_per_second": 5939.729 }, { "epoch": 0.7757575757575758, "grad_norm": 0.15969020128250122, "learning_rate": 0.00012592592592592592, "loss": 0.1817, "num_input_tokens_seen": 2198048, "step": 96, "train_runtime": 369.4885, "train_tokens_per_second": 5948.894 }, { "epoch": 0.7838383838383839, "grad_norm": 0.17647744715213776, "learning_rate": 0.00012510288065843624, "loss": 0.1925, "num_input_tokens_seen": 2218944, "step": 97, "train_runtime": 372.5447, "train_tokens_per_second": 5956.182 }, { "epoch": 0.7919191919191919, "grad_norm": 0.15452450513839722, "learning_rate": 0.0001242798353909465, "loss": 0.2199, "num_input_tokens_seen": 2244752, "step": 98, "train_runtime": 376.2965, "train_tokens_per_second": 5965.381 }, { "epoch": 0.8, "grad_norm": 0.16536033153533936, "learning_rate": 0.0001234567901234568, "loss": 0.202, "num_input_tokens_seen": 2267728, "step": 99, "train_runtime": 379.6467, "train_tokens_per_second": 5973.259 }, { "epoch": 0.8080808080808081, "grad_norm": 0.15133647620677948, "learning_rate": 0.00012263374485596708, "loss": 0.177, "num_input_tokens_seen": 2289328, "step": 100, "train_runtime": 382.7931, "train_tokens_per_second": 5980.589 }, { "epoch": 0.8080808080808081, "eval_loss": 0.17801880836486816, "eval_runtime": 15.9675, "eval_samples_per_second": 55.049, "eval_steps_per_second": 3.444, "num_input_tokens_seen": 2289328, "step": 100 }, { "epoch": 0.8161616161616162, "grad_norm": 0.1537664383649826, "learning_rate": 0.00012181069958847737, "loss": 0.2092, "num_input_tokens_seen": 2313216, "step": 101, "train_runtime": 402.2143, "train_tokens_per_second": 5751.203 }, { "epoch": 0.8242424242424242, "grad_norm": 0.15654610097408295, "learning_rate": 0.00012098765432098766, "loss": 0.1664, "num_input_tokens_seen": 2333152, "step": 102, "train_runtime": 405.1177, "train_tokens_per_second": 5759.195 }, { "epoch": 0.8323232323232324, "grad_norm": 0.15154822170734406, "learning_rate": 0.00012016460905349795, "loss": 0.2069, "num_input_tokens_seen": 2355744, "step": 103, "train_runtime": 408.4074, "train_tokens_per_second": 5768.123 }, { "epoch": 0.8404040404040404, "grad_norm": 0.16599127650260925, "learning_rate": 0.00011934156378600823, "loss": 0.2347, "num_input_tokens_seen": 2376560, "step": 104, "train_runtime": 411.4246, "train_tokens_per_second": 5776.418 }, { "epoch": 0.8484848484848485, "grad_norm": 0.1642574518918991, "learning_rate": 0.00011851851851851852, "loss": 0.185, "num_input_tokens_seen": 2400896, "step": 105, "train_runtime": 414.9439, "train_tokens_per_second": 5786.074 }, { "epoch": 0.8565656565656565, "grad_norm": 0.15395912528038025, "learning_rate": 0.00011769547325102881, "loss": 0.179, "num_input_tokens_seen": 2423632, "step": 106, "train_runtime": 418.2763, "train_tokens_per_second": 5794.332 }, { "epoch": 0.8646464646464647, "grad_norm": 0.16491572558879852, "learning_rate": 0.0001168724279835391, "loss": 0.2168, "num_input_tokens_seen": 2448432, "step": 107, "train_runtime": 421.8552, "train_tokens_per_second": 5803.963 }, { "epoch": 0.8727272727272727, "grad_norm": 0.16017423570156097, "learning_rate": 0.00011604938271604939, "loss": 0.1826, "num_input_tokens_seen": 2470768, "step": 108, "train_runtime": 425.0496, "train_tokens_per_second": 5812.893 }, { "epoch": 0.8808080808080808, "grad_norm": 0.14728578925132751, "learning_rate": 0.00011522633744855968, "loss": 0.1907, "num_input_tokens_seen": 2494944, "step": 109, "train_runtime": 428.5398, "train_tokens_per_second": 5821.965 }, { "epoch": 0.8888888888888888, "grad_norm": 0.17022450268268585, "learning_rate": 0.00011440329218106996, "loss": 0.2021, "num_input_tokens_seen": 2515760, "step": 110, "train_runtime": 431.6001, "train_tokens_per_second": 5828.914 }, { "epoch": 0.896969696969697, "grad_norm": 0.16193877160549164, "learning_rate": 0.00011358024691358025, "loss": 0.1559, "num_input_tokens_seen": 2537792, "step": 111, "train_runtime": 434.8205, "train_tokens_per_second": 5836.414 }, { "epoch": 0.9050505050505051, "grad_norm": 0.14079837501049042, "learning_rate": 0.00011275720164609054, "loss": 0.1667, "num_input_tokens_seen": 2562032, "step": 112, "train_runtime": 438.3575, "train_tokens_per_second": 5844.618 }, { "epoch": 0.9131313131313131, "grad_norm": 0.1725139021873474, "learning_rate": 0.00011193415637860083, "loss": 0.1913, "num_input_tokens_seen": 2583760, "step": 113, "train_runtime": 441.5306, "train_tokens_per_second": 5851.826 }, { "epoch": 0.9212121212121213, "grad_norm": 0.1663820445537567, "learning_rate": 0.00011111111111111112, "loss": 0.1441, "num_input_tokens_seen": 2607776, "step": 114, "train_runtime": 445.0017, "train_tokens_per_second": 5860.149 }, { "epoch": 0.9292929292929293, "grad_norm": 0.16796670854091644, "learning_rate": 0.0001102880658436214, "loss": 0.2076, "num_input_tokens_seen": 2630208, "step": 115, "train_runtime": 448.275, "train_tokens_per_second": 5867.398 }, { "epoch": 0.9373737373737374, "grad_norm": 0.16379429399967194, "learning_rate": 0.00010946502057613168, "loss": 0.1832, "num_input_tokens_seen": 2650208, "step": 116, "train_runtime": 451.1977, "train_tokens_per_second": 5873.718 }, { "epoch": 0.9454545454545454, "grad_norm": 0.1663283109664917, "learning_rate": 0.00010864197530864197, "loss": 0.2013, "num_input_tokens_seen": 2672592, "step": 117, "train_runtime": 454.4485, "train_tokens_per_second": 5880.957 }, { "epoch": 0.9535353535353536, "grad_norm": 0.16695767641067505, "learning_rate": 0.00010781893004115226, "loss": 0.1462, "num_input_tokens_seen": 2698064, "step": 118, "train_runtime": 458.1001, "train_tokens_per_second": 5889.682 }, { "epoch": 0.9616161616161616, "grad_norm": 0.1588376760482788, "learning_rate": 0.00010699588477366255, "loss": 0.1837, "num_input_tokens_seen": 2719680, "step": 119, "train_runtime": 461.2512, "train_tokens_per_second": 5896.31 }, { "epoch": 0.9696969696969697, "grad_norm": 0.1472574770450592, "learning_rate": 0.00010617283950617284, "loss": 0.1742, "num_input_tokens_seen": 2742400, "step": 120, "train_runtime": 464.5791, "train_tokens_per_second": 5902.978 }, { "epoch": 0.9777777777777777, "grad_norm": 0.17550979554653168, "learning_rate": 0.00010534979423868315, "loss": 0.1364, "num_input_tokens_seen": 2766112, "step": 121, "train_runtime": 468.5285, "train_tokens_per_second": 5903.829 }, { "epoch": 0.9858585858585859, "grad_norm": 0.15758642554283142, "learning_rate": 0.00010452674897119341, "loss": 0.1775, "num_input_tokens_seen": 2787952, "step": 122, "train_runtime": 471.7104, "train_tokens_per_second": 5910.304 }, { "epoch": 0.9939393939393939, "grad_norm": 0.16019918024539948, "learning_rate": 0.0001037037037037037, "loss": 0.2096, "num_input_tokens_seen": 2811632, "step": 123, "train_runtime": 475.1248, "train_tokens_per_second": 5917.671 }, { "epoch": 1.0, "grad_norm": 0.2007690817117691, "learning_rate": 0.00010288065843621399, "loss": 0.1646, "num_input_tokens_seen": 2825206, "step": 124, "train_runtime": 477.1077, "train_tokens_per_second": 5921.527 }, { "epoch": 1.0080808080808081, "grad_norm": 0.14078141748905182, "learning_rate": 0.00010205761316872428, "loss": 0.1363, "num_input_tokens_seen": 2847206, "step": 125, "train_runtime": 480.3107, "train_tokens_per_second": 5927.842 }, { "epoch": 1.0080808080808081, "eval_loss": 0.1743689626455307, "eval_runtime": 15.9727, "eval_samples_per_second": 55.031, "eval_steps_per_second": 3.443, "num_input_tokens_seen": 2847206, "step": 125 }, { "epoch": 1.0161616161616163, "grad_norm": 0.14959807693958282, "learning_rate": 0.00010123456790123458, "loss": 0.1373, "num_input_tokens_seen": 2867190, "step": 126, "train_runtime": 499.2365, "train_tokens_per_second": 5743.15 }, { "epoch": 1.0242424242424242, "grad_norm": 0.14410553872585297, "learning_rate": 0.00010041152263374487, "loss": 0.1391, "num_input_tokens_seen": 2888710, "step": 127, "train_runtime": 502.361, "train_tokens_per_second": 5750.268 }, { "epoch": 1.0323232323232323, "grad_norm": 0.14210668206214905, "learning_rate": 9.958847736625515e-05, "loss": 0.1514, "num_input_tokens_seen": 2913990, "step": 128, "train_runtime": 506.0209, "train_tokens_per_second": 5758.636 }, { "epoch": 1.0404040404040404, "grad_norm": 0.14086109399795532, "learning_rate": 9.876543209876543e-05, "loss": 0.1384, "num_input_tokens_seen": 2938246, "step": 129, "train_runtime": 509.5108, "train_tokens_per_second": 5766.799 }, { "epoch": 1.0484848484848486, "grad_norm": 0.1444181203842163, "learning_rate": 9.794238683127573e-05, "loss": 0.1694, "num_input_tokens_seen": 2962326, "step": 130, "train_runtime": 513.0283, "train_tokens_per_second": 5774.196 }, { "epoch": 1.0565656565656565, "grad_norm": 0.15412774682044983, "learning_rate": 9.711934156378602e-05, "loss": 0.1657, "num_input_tokens_seen": 2983126, "step": 131, "train_runtime": 516.07, "train_tokens_per_second": 5780.468 }, { "epoch": 1.0646464646464646, "grad_norm": 0.1612967848777771, "learning_rate": 9.62962962962963e-05, "loss": 0.1738, "num_input_tokens_seen": 3005606, "step": 132, "train_runtime": 519.3068, "train_tokens_per_second": 5787.727 }, { "epoch": 1.0727272727272728, "grad_norm": 0.1550590842962265, "learning_rate": 9.547325102880659e-05, "loss": 0.1634, "num_input_tokens_seen": 3027926, "step": 133, "train_runtime": 522.5599, "train_tokens_per_second": 5794.41 }, { "epoch": 1.0808080808080809, "grad_norm": 0.1607086956501007, "learning_rate": 9.465020576131688e-05, "loss": 0.1507, "num_input_tokens_seen": 3052294, "step": 134, "train_runtime": 526.0714, "train_tokens_per_second": 5802.053 }, { "epoch": 1.0888888888888888, "grad_norm": 0.14786848425865173, "learning_rate": 9.382716049382717e-05, "loss": 0.1371, "num_input_tokens_seen": 3073014, "step": 135, "train_runtime": 529.0875, "train_tokens_per_second": 5808.139 }, { "epoch": 1.096969696969697, "grad_norm": 0.14476324617862701, "learning_rate": 9.300411522633746e-05, "loss": 0.1223, "num_input_tokens_seen": 3095126, "step": 136, "train_runtime": 532.2833, "train_tokens_per_second": 5814.809 }, { "epoch": 1.105050505050505, "grad_norm": 0.17048926651477814, "learning_rate": 9.218106995884775e-05, "loss": 0.1542, "num_input_tokens_seen": 3116438, "step": 137, "train_runtime": 535.3914, "train_tokens_per_second": 5820.859 }, { "epoch": 1.1131313131313132, "grad_norm": 0.14804477989673615, "learning_rate": 9.135802469135802e-05, "loss": 0.129, "num_input_tokens_seen": 3139174, "step": 138, "train_runtime": 538.6924, "train_tokens_per_second": 5827.396 }, { "epoch": 1.121212121212121, "grad_norm": 0.14984357357025146, "learning_rate": 9.053497942386831e-05, "loss": 0.139, "num_input_tokens_seen": 3165206, "step": 139, "train_runtime": 542.4266, "train_tokens_per_second": 5835.27 }, { "epoch": 1.1292929292929292, "grad_norm": 0.1541273444890976, "learning_rate": 8.97119341563786e-05, "loss": 0.139, "num_input_tokens_seen": 3189942, "step": 140, "train_runtime": 545.9937, "train_tokens_per_second": 5842.452 }, { "epoch": 1.1373737373737374, "grad_norm": 0.1608126163482666, "learning_rate": 8.888888888888889e-05, "loss": 0.1145, "num_input_tokens_seen": 3213878, "step": 141, "train_runtime": 549.4275, "train_tokens_per_second": 5849.503 }, { "epoch": 1.1454545454545455, "grad_norm": 0.15520773828029633, "learning_rate": 8.806584362139918e-05, "loss": 0.185, "num_input_tokens_seen": 3236806, "step": 142, "train_runtime": 552.7146, "train_tokens_per_second": 5856.197 }, { "epoch": 1.1535353535353536, "grad_norm": 0.17958641052246094, "learning_rate": 8.724279835390947e-05, "loss": 0.1744, "num_input_tokens_seen": 3258822, "step": 143, "train_runtime": 555.9036, "train_tokens_per_second": 5862.207 }, { "epoch": 1.1616161616161615, "grad_norm": 0.15695422887802124, "learning_rate": 8.641975308641975e-05, "loss": 0.1292, "num_input_tokens_seen": 3280694, "step": 144, "train_runtime": 559.0968, "train_tokens_per_second": 5867.846 }, { "epoch": 1.1696969696969697, "grad_norm": 0.15811026096343994, "learning_rate": 8.559670781893004e-05, "loss": 0.1366, "num_input_tokens_seen": 3305894, "step": 145, "train_runtime": 562.6785, "train_tokens_per_second": 5875.281 }, { "epoch": 1.1777777777777778, "grad_norm": 0.18241523206233978, "learning_rate": 8.477366255144033e-05, "loss": 0.1277, "num_input_tokens_seen": 3327526, "step": 146, "train_runtime": 565.8579, "train_tokens_per_second": 5880.498 }, { "epoch": 1.185858585858586, "grad_norm": 0.18478727340698242, "learning_rate": 8.395061728395062e-05, "loss": 0.1556, "num_input_tokens_seen": 3349414, "step": 147, "train_runtime": 569.0152, "train_tokens_per_second": 5886.335 }, { "epoch": 1.1939393939393939, "grad_norm": 0.18235282599925995, "learning_rate": 8.312757201646091e-05, "loss": 0.185, "num_input_tokens_seen": 3373782, "step": 148, "train_runtime": 572.5108, "train_tokens_per_second": 5892.958 }, { "epoch": 1.202020202020202, "grad_norm": 0.16526545584201813, "learning_rate": 8.23045267489712e-05, "loss": 0.1417, "num_input_tokens_seen": 3397254, "step": 149, "train_runtime": 575.9284, "train_tokens_per_second": 5898.744 }, { "epoch": 1.2101010101010101, "grad_norm": 0.1843811720609665, "learning_rate": 8.148148148148148e-05, "loss": 0.1289, "num_input_tokens_seen": 3420102, "step": 150, "train_runtime": 579.2683, "train_tokens_per_second": 5904.176 }, { "epoch": 1.2101010101010101, "eval_loss": 0.17398151755332947, "eval_runtime": 15.974, "eval_samples_per_second": 55.027, "eval_steps_per_second": 3.443, "num_input_tokens_seen": 3420102, "step": 150 }, { "epoch": 1.2181818181818183, "grad_norm": 0.20147649943828583, "learning_rate": 8.065843621399177e-05, "loss": 0.1823, "num_input_tokens_seen": 3440438, "step": 151, "train_runtime": 598.6689, "train_tokens_per_second": 5746.813 }, { "epoch": 1.2262626262626264, "grad_norm": 0.16948151588439941, "learning_rate": 7.983539094650207e-05, "loss": 0.1352, "num_input_tokens_seen": 3466054, "step": 152, "train_runtime": 602.3354, "train_tokens_per_second": 5754.358 }, { "epoch": 1.2343434343434343, "grad_norm": 0.13926386833190918, "learning_rate": 7.901234567901235e-05, "loss": 0.1396, "num_input_tokens_seen": 3492278, "step": 153, "train_runtime": 606.1274, "train_tokens_per_second": 5761.624 }, { "epoch": 1.2424242424242424, "grad_norm": 0.1492907702922821, "learning_rate": 7.818930041152264e-05, "loss": 0.1222, "num_input_tokens_seen": 3512582, "step": 154, "train_runtime": 609.1167, "train_tokens_per_second": 5766.681 }, { "epoch": 1.2505050505050506, "grad_norm": 0.17096783220767975, "learning_rate": 7.736625514403293e-05, "loss": 0.1434, "num_input_tokens_seen": 3535750, "step": 155, "train_runtime": 612.4626, "train_tokens_per_second": 5773.005 }, { "epoch": 1.2585858585858585, "grad_norm": 0.1619611382484436, "learning_rate": 7.65432098765432e-05, "loss": 0.142, "num_input_tokens_seen": 3559894, "step": 156, "train_runtime": 615.9667, "train_tokens_per_second": 5779.361 }, { "epoch": 1.2666666666666666, "grad_norm": 0.18333695828914642, "learning_rate": 7.57201646090535e-05, "loss": 0.1433, "num_input_tokens_seen": 3580390, "step": 157, "train_runtime": 618.9828, "train_tokens_per_second": 5784.312 }, { "epoch": 1.2747474747474747, "grad_norm": 0.1673658788204193, "learning_rate": 7.48971193415638e-05, "loss": 0.1168, "num_input_tokens_seen": 3601750, "step": 158, "train_runtime": 622.0976, "train_tokens_per_second": 5789.686 }, { "epoch": 1.2828282828282829, "grad_norm": 0.16368548572063446, "learning_rate": 7.407407407407407e-05, "loss": 0.1345, "num_input_tokens_seen": 3629030, "step": 159, "train_runtime": 625.9653, "train_tokens_per_second": 5797.494 }, { "epoch": 1.290909090909091, "grad_norm": 0.18099236488342285, "learning_rate": 7.325102880658436e-05, "loss": 0.1503, "num_input_tokens_seen": 3654358, "step": 160, "train_runtime": 629.6159, "train_tokens_per_second": 5804.107 }, { "epoch": 1.298989898989899, "grad_norm": 0.17030303180217743, "learning_rate": 7.242798353909465e-05, "loss": 0.1414, "num_input_tokens_seen": 3680758, "step": 161, "train_runtime": 633.4286, "train_tokens_per_second": 5810.849 }, { "epoch": 1.307070707070707, "grad_norm": 0.1868920922279358, "learning_rate": 7.160493827160494e-05, "loss": 0.1348, "num_input_tokens_seen": 3704022, "step": 162, "train_runtime": 636.8172, "train_tokens_per_second": 5816.461 }, { "epoch": 1.3151515151515152, "grad_norm": 0.18310731649398804, "learning_rate": 7.078189300411523e-05, "loss": 0.1241, "num_input_tokens_seen": 3727814, "step": 163, "train_runtime": 640.2506, "train_tokens_per_second": 5822.429 }, { "epoch": 1.3232323232323233, "grad_norm": 0.188144713640213, "learning_rate": 6.995884773662552e-05, "loss": 0.1568, "num_input_tokens_seen": 3749606, "step": 164, "train_runtime": 643.4135, "train_tokens_per_second": 5827.677 }, { "epoch": 1.3313131313131312, "grad_norm": 0.19525550305843353, "learning_rate": 6.91358024691358e-05, "loss": 0.1781, "num_input_tokens_seen": 3774710, "step": 165, "train_runtime": 647.0635, "train_tokens_per_second": 5833.601 }, { "epoch": 1.3393939393939394, "grad_norm": 0.18591126799583435, "learning_rate": 6.831275720164609e-05, "loss": 0.1231, "num_input_tokens_seen": 3793814, "step": 166, "train_runtime": 649.8581, "train_tokens_per_second": 5837.911 }, { "epoch": 1.3474747474747475, "grad_norm": 0.19412674009799957, "learning_rate": 6.748971193415638e-05, "loss": 0.1545, "num_input_tokens_seen": 3818662, "step": 167, "train_runtime": 653.4715, "train_tokens_per_second": 5843.655 }, { "epoch": 1.3555555555555556, "grad_norm": 0.16812458634376526, "learning_rate": 6.666666666666667e-05, "loss": 0.1414, "num_input_tokens_seen": 3841606, "step": 168, "train_runtime": 656.7714, "train_tokens_per_second": 5849.228 }, { "epoch": 1.3636363636363638, "grad_norm": 0.18051378428936005, "learning_rate": 6.584362139917696e-05, "loss": 0.144, "num_input_tokens_seen": 3863830, "step": 169, "train_runtime": 660.006, "train_tokens_per_second": 5854.234 }, { "epoch": 1.3717171717171717, "grad_norm": 0.19069063663482666, "learning_rate": 6.502057613168725e-05, "loss": 0.1649, "num_input_tokens_seen": 3886230, "step": 170, "train_runtime": 663.2462, "train_tokens_per_second": 5859.408 }, { "epoch": 1.3797979797979798, "grad_norm": 0.18689148128032684, "learning_rate": 6.419753086419753e-05, "loss": 0.1425, "num_input_tokens_seen": 3908982, "step": 171, "train_runtime": 666.5218, "train_tokens_per_second": 5864.747 }, { "epoch": 1.387878787878788, "grad_norm": 0.14730970561504364, "learning_rate": 6.337448559670782e-05, "loss": 0.1336, "num_input_tokens_seen": 3936150, "step": 172, "train_runtime": 670.4336, "train_tokens_per_second": 5871.052 }, { "epoch": 1.3959595959595958, "grad_norm": 0.177509605884552, "learning_rate": 6.255144032921812e-05, "loss": 0.1545, "num_input_tokens_seen": 3959430, "step": 173, "train_runtime": 673.8214, "train_tokens_per_second": 5876.083 }, { "epoch": 1.404040404040404, "grad_norm": 0.17181722819805145, "learning_rate": 6.17283950617284e-05, "loss": 0.1462, "num_input_tokens_seen": 3981126, "step": 174, "train_runtime": 677.031, "train_tokens_per_second": 5880.271 }, { "epoch": 1.412121212121212, "grad_norm": 0.1883271485567093, "learning_rate": 6.0905349794238687e-05, "loss": 0.1511, "num_input_tokens_seen": 4006118, "step": 175, "train_runtime": 680.6168, "train_tokens_per_second": 5886.011 }, { "epoch": 1.412121212121212, "eval_loss": 0.1727769374847412, "eval_runtime": 15.9835, "eval_samples_per_second": 54.994, "eval_steps_per_second": 3.441, "num_input_tokens_seen": 4006118, "step": 175 }, { "epoch": 1.4202020202020202, "grad_norm": 0.17214921116828918, "learning_rate": 6.0082304526748977e-05, "loss": 0.1669, "num_input_tokens_seen": 4034054, "step": 176, "train_runtime": 700.6314, "train_tokens_per_second": 5757.74 }, { "epoch": 1.4282828282828284, "grad_norm": 0.17713947594165802, "learning_rate": 5.925925925925926e-05, "loss": 0.1356, "num_input_tokens_seen": 4058646, "step": 177, "train_runtime": 704.1834, "train_tokens_per_second": 5763.62 }, { "epoch": 1.4363636363636363, "grad_norm": 0.18645597994327545, "learning_rate": 5.843621399176955e-05, "loss": 0.1573, "num_input_tokens_seen": 4083414, "step": 178, "train_runtime": 707.7598, "train_tokens_per_second": 5769.491 }, { "epoch": 1.4444444444444444, "grad_norm": 0.1776132434606552, "learning_rate": 5.761316872427984e-05, "loss": 0.1338, "num_input_tokens_seen": 4107190, "step": 179, "train_runtime": 711.2238, "train_tokens_per_second": 5774.821 }, { "epoch": 1.4525252525252526, "grad_norm": 0.1832626312971115, "learning_rate": 5.679012345679012e-05, "loss": 0.2298, "num_input_tokens_seen": 4129958, "step": 180, "train_runtime": 714.5258, "train_tokens_per_second": 5779.999 }, { "epoch": 1.4606060606060607, "grad_norm": 0.17791666090488434, "learning_rate": 5.596707818930041e-05, "loss": 0.1267, "num_input_tokens_seen": 4153302, "step": 181, "train_runtime": 718.4279, "train_tokens_per_second": 5781.098 }, { "epoch": 1.4686868686868686, "grad_norm": 0.18174052238464355, "learning_rate": 5.51440329218107e-05, "loss": 0.1311, "num_input_tokens_seen": 4175222, "step": 182, "train_runtime": 721.5861, "train_tokens_per_second": 5786.173 }, { "epoch": 1.4767676767676767, "grad_norm": 0.17272153496742249, "learning_rate": 5.4320987654320986e-05, "loss": 0.1454, "num_input_tokens_seen": 4196966, "step": 183, "train_runtime": 724.781, "train_tokens_per_second": 5790.668 }, { "epoch": 1.4848484848484849, "grad_norm": 0.18341264128684998, "learning_rate": 5.3497942386831277e-05, "loss": 0.1295, "num_input_tokens_seen": 4222630, "step": 184, "train_runtime": 728.4765, "train_tokens_per_second": 5796.522 }, { "epoch": 1.492929292929293, "grad_norm": 0.18532636761665344, "learning_rate": 5.267489711934157e-05, "loss": 0.1311, "num_input_tokens_seen": 4243798, "step": 185, "train_runtime": 731.5451, "train_tokens_per_second": 5801.143 }, { "epoch": 1.5010101010101011, "grad_norm": 0.19856366515159607, "learning_rate": 5.185185185185185e-05, "loss": 0.1532, "num_input_tokens_seen": 4265174, "step": 186, "train_runtime": 734.668, "train_tokens_per_second": 5805.581 }, { "epoch": 1.509090909090909, "grad_norm": 0.1887090802192688, "learning_rate": 5.102880658436214e-05, "loss": 0.108, "num_input_tokens_seen": 4286374, "step": 187, "train_runtime": 737.8004, "train_tokens_per_second": 5809.666 }, { "epoch": 1.5171717171717172, "grad_norm": 0.16914108395576477, "learning_rate": 5.020576131687244e-05, "loss": 0.1231, "num_input_tokens_seen": 4314534, "step": 188, "train_runtime": 741.8365, "train_tokens_per_second": 5816.017 }, { "epoch": 1.5252525252525253, "grad_norm": 0.207884281873703, "learning_rate": 4.938271604938271e-05, "loss": 0.1846, "num_input_tokens_seen": 4334726, "step": 189, "train_runtime": 744.774, "train_tokens_per_second": 5820.189 }, { "epoch": 1.5333333333333332, "grad_norm": 0.21083691716194153, "learning_rate": 4.855967078189301e-05, "loss": 0.1274, "num_input_tokens_seen": 4357238, "step": 190, "train_runtime": 748.0199, "train_tokens_per_second": 5825.029 }, { "epoch": 1.5414141414141413, "grad_norm": 0.18116632103919983, "learning_rate": 4.773662551440329e-05, "loss": 0.1457, "num_input_tokens_seen": 4380310, "step": 191, "train_runtime": 751.3376, "train_tokens_per_second": 5830.015 }, { "epoch": 1.5494949494949495, "grad_norm": 0.1774257868528366, "learning_rate": 4.691358024691358e-05, "loss": 0.1638, "num_input_tokens_seen": 4402598, "step": 192, "train_runtime": 754.5705, "train_tokens_per_second": 5834.575 }, { "epoch": 1.5575757575757576, "grad_norm": 0.17490142583847046, "learning_rate": 4.609053497942387e-05, "loss": 0.1287, "num_input_tokens_seen": 4426854, "step": 193, "train_runtime": 758.0657, "train_tokens_per_second": 5839.671 }, { "epoch": 1.5656565656565657, "grad_norm": 0.17895734310150146, "learning_rate": 4.5267489711934157e-05, "loss": 0.1565, "num_input_tokens_seen": 4452422, "step": 194, "train_runtime": 761.7593, "train_tokens_per_second": 5844.92 }, { "epoch": 1.5737373737373739, "grad_norm": 0.19911067187786102, "learning_rate": 4.4444444444444447e-05, "loss": 0.161, "num_input_tokens_seen": 4479574, "step": 195, "train_runtime": 765.648, "train_tokens_per_second": 5850.697 }, { "epoch": 1.5818181818181818, "grad_norm": 0.20772644877433777, "learning_rate": 4.3621399176954737e-05, "loss": 0.1791, "num_input_tokens_seen": 4499862, "step": 196, "train_runtime": 768.5633, "train_tokens_per_second": 5854.901 }, { "epoch": 1.58989898989899, "grad_norm": 0.20278632640838623, "learning_rate": 4.279835390946502e-05, "loss": 0.1221, "num_input_tokens_seen": 4522614, "step": 197, "train_runtime": 771.8795, "train_tokens_per_second": 5859.223 }, { "epoch": 1.5979797979797978, "grad_norm": 0.19286850094795227, "learning_rate": 4.197530864197531e-05, "loss": 0.1297, "num_input_tokens_seen": 4544022, "step": 198, "train_runtime": 775.0258, "train_tokens_per_second": 5863.059 }, { "epoch": 1.606060606060606, "grad_norm": 0.1876365840435028, "learning_rate": 4.11522633744856e-05, "loss": 0.1301, "num_input_tokens_seen": 4566198, "step": 199, "train_runtime": 778.2557, "train_tokens_per_second": 5867.221 }, { "epoch": 1.614141414141414, "grad_norm": 0.1976366490125656, "learning_rate": 4.032921810699588e-05, "loss": 0.1522, "num_input_tokens_seen": 4588070, "step": 200, "train_runtime": 781.4257, "train_tokens_per_second": 5871.409 }, { "epoch": 1.614141414141414, "eval_loss": 0.17329195141792297, "eval_runtime": 15.9586, "eval_samples_per_second": 55.08, "eval_steps_per_second": 3.446, "num_input_tokens_seen": 4588070, "step": 200 }, { "epoch": 1.6222222222222222, "grad_norm": 0.2171986699104309, "learning_rate": 3.950617283950617e-05, "loss": 0.1527, "num_input_tokens_seen": 4612646, "step": 201, "train_runtime": 800.9346, "train_tokens_per_second": 5759.079 }, { "epoch": 1.6303030303030304, "grad_norm": 0.18816785514354706, "learning_rate": 3.868312757201646e-05, "loss": 0.1419, "num_input_tokens_seen": 4633446, "step": 202, "train_runtime": 804.007, "train_tokens_per_second": 5762.942 }, { "epoch": 1.6383838383838385, "grad_norm": 0.1965034157037735, "learning_rate": 3.786008230452675e-05, "loss": 0.1294, "num_input_tokens_seen": 4656278, "step": 203, "train_runtime": 807.3253, "train_tokens_per_second": 5767.536 }, { "epoch": 1.6464646464646466, "grad_norm": 0.20697784423828125, "learning_rate": 3.7037037037037037e-05, "loss": 0.1277, "num_input_tokens_seen": 4678006, "step": 204, "train_runtime": 810.4618, "train_tokens_per_second": 5772.025 }, { "epoch": 1.6545454545454545, "grad_norm": 0.1958000510931015, "learning_rate": 3.6213991769547327e-05, "loss": 0.1268, "num_input_tokens_seen": 4701206, "step": 205, "train_runtime": 813.8387, "train_tokens_per_second": 5776.582 }, { "epoch": 1.6626262626262627, "grad_norm": 0.1861943006515503, "learning_rate": 3.539094650205762e-05, "loss": 0.1549, "num_input_tokens_seen": 4724646, "step": 206, "train_runtime": 817.2582, "train_tokens_per_second": 5781.093 }, { "epoch": 1.6707070707070706, "grad_norm": 0.1965884119272232, "learning_rate": 3.45679012345679e-05, "loss": 0.1221, "num_input_tokens_seen": 4748998, "step": 207, "train_runtime": 820.7842, "train_tokens_per_second": 5785.927 }, { "epoch": 1.6787878787878787, "grad_norm": 0.23105938732624054, "learning_rate": 3.374485596707819e-05, "loss": 0.1353, "num_input_tokens_seen": 4768294, "step": 208, "train_runtime": 823.5916, "train_tokens_per_second": 5789.634 }, { "epoch": 1.6868686868686869, "grad_norm": 0.17601825296878815, "learning_rate": 3.292181069958848e-05, "loss": 0.1743, "num_input_tokens_seen": 4792550, "step": 209, "train_runtime": 827.116, "train_tokens_per_second": 5794.29 }, { "epoch": 1.694949494949495, "grad_norm": 0.192215234041214, "learning_rate": 3.209876543209876e-05, "loss": 0.1441, "num_input_tokens_seen": 4816006, "step": 210, "train_runtime": 830.4803, "train_tokens_per_second": 5799.061 }, { "epoch": 1.7030303030303031, "grad_norm": 0.1799449473619461, "learning_rate": 3.127572016460906e-05, "loss": 0.1755, "num_input_tokens_seen": 4839222, "step": 211, "train_runtime": 834.3314, "train_tokens_per_second": 5800.12 }, { "epoch": 1.7111111111111112, "grad_norm": 0.18329425156116486, "learning_rate": 3.0452674897119343e-05, "loss": 0.1469, "num_input_tokens_seen": 4862822, "step": 212, "train_runtime": 837.7144, "train_tokens_per_second": 5804.869 }, { "epoch": 1.7191919191919192, "grad_norm": 0.2032759040594101, "learning_rate": 2.962962962962963e-05, "loss": 0.1809, "num_input_tokens_seen": 4884582, "step": 213, "train_runtime": 840.9065, "train_tokens_per_second": 5808.71 }, { "epoch": 1.7272727272727273, "grad_norm": 0.20157882571220398, "learning_rate": 2.880658436213992e-05, "loss": 0.1466, "num_input_tokens_seen": 4909174, "step": 214, "train_runtime": 844.4537, "train_tokens_per_second": 5813.432 }, { "epoch": 1.7353535353535352, "grad_norm": 0.1857813447713852, "learning_rate": 2.7983539094650207e-05, "loss": 0.1549, "num_input_tokens_seen": 4933798, "step": 215, "train_runtime": 848.0304, "train_tokens_per_second": 5817.949 }, { "epoch": 1.7434343434343433, "grad_norm": 0.21499592065811157, "learning_rate": 2.7160493827160493e-05, "loss": 0.1383, "num_input_tokens_seen": 4952742, "step": 216, "train_runtime": 850.8052, "train_tokens_per_second": 5821.241 }, { "epoch": 1.7515151515151515, "grad_norm": 0.17735537886619568, "learning_rate": 2.6337448559670787e-05, "loss": 0.1496, "num_input_tokens_seen": 4976246, "step": 217, "train_runtime": 854.1841, "train_tokens_per_second": 5825.73 }, { "epoch": 1.7595959595959596, "grad_norm": 0.18576224148273468, "learning_rate": 2.551440329218107e-05, "loss": 0.1409, "num_input_tokens_seen": 4995798, "step": 218, "train_runtime": 857.0834, "train_tokens_per_second": 5828.836 }, { "epoch": 1.7676767676767677, "grad_norm": 0.18721511960029602, "learning_rate": 2.4691358024691357e-05, "loss": 0.1294, "num_input_tokens_seen": 5018838, "step": 219, "train_runtime": 860.4125, "train_tokens_per_second": 5833.06 }, { "epoch": 1.7757575757575759, "grad_norm": 0.18898357450962067, "learning_rate": 2.3868312757201647e-05, "loss": 0.1011, "num_input_tokens_seen": 5041782, "step": 220, "train_runtime": 863.7343, "train_tokens_per_second": 5837.191 }, { "epoch": 1.783838383838384, "grad_norm": 0.1976945698261261, "learning_rate": 2.3045267489711937e-05, "loss": 0.1584, "num_input_tokens_seen": 5063478, "step": 221, "train_runtime": 866.9236, "train_tokens_per_second": 5840.743 }, { "epoch": 1.791919191919192, "grad_norm": 0.19949166476726532, "learning_rate": 2.2222222222222223e-05, "loss": 0.1523, "num_input_tokens_seen": 5085526, "step": 222, "train_runtime": 870.1255, "train_tokens_per_second": 5844.589 }, { "epoch": 1.8, "grad_norm": 0.181776225566864, "learning_rate": 2.139917695473251e-05, "loss": 0.1641, "num_input_tokens_seen": 5109430, "step": 223, "train_runtime": 873.6231, "train_tokens_per_second": 5848.552 }, { "epoch": 1.808080808080808, "grad_norm": 0.21610131859779358, "learning_rate": 2.05761316872428e-05, "loss": 0.116, "num_input_tokens_seen": 5132182, "step": 224, "train_runtime": 876.9236, "train_tokens_per_second": 5852.485 }, { "epoch": 1.816161616161616, "grad_norm": 0.19361373782157898, "learning_rate": 1.9753086419753087e-05, "loss": 0.1369, "num_input_tokens_seen": 5153622, "step": 225, "train_runtime": 880.0664, "train_tokens_per_second": 5855.947 }, { "epoch": 1.816161616161616, "eval_loss": 0.1724003553390503, "eval_runtime": 15.9947, "eval_samples_per_second": 54.956, "eval_steps_per_second": 3.439, "num_input_tokens_seen": 5153622, "step": 225 }, { "epoch": 1.8242424242424242, "grad_norm": 0.19882901012897491, "learning_rate": 1.8930041152263377e-05, "loss": 0.1499, "num_input_tokens_seen": 5178470, "step": 226, "train_runtime": 899.6327, "train_tokens_per_second": 5756.205 }, { "epoch": 1.8323232323232324, "grad_norm": 0.19828850030899048, "learning_rate": 1.8106995884773663e-05, "loss": 0.1295, "num_input_tokens_seen": 5199062, "step": 227, "train_runtime": 902.6363, "train_tokens_per_second": 5759.864 }, { "epoch": 1.8404040404040405, "grad_norm": 0.2071538269519806, "learning_rate": 1.728395061728395e-05, "loss": 0.1739, "num_input_tokens_seen": 5218134, "step": 228, "train_runtime": 905.4534, "train_tokens_per_second": 5763.006 }, { "epoch": 1.8484848484848486, "grad_norm": 0.20533259212970734, "learning_rate": 1.646090534979424e-05, "loss": 0.1343, "num_input_tokens_seen": 5242054, "step": 229, "train_runtime": 908.9457, "train_tokens_per_second": 5767.181 }, { "epoch": 1.8565656565656565, "grad_norm": 0.19329999387264252, "learning_rate": 1.563786008230453e-05, "loss": 0.1266, "num_input_tokens_seen": 5264518, "step": 230, "train_runtime": 912.2004, "train_tokens_per_second": 5771.23 }, { "epoch": 1.8646464646464647, "grad_norm": 0.20547281205654144, "learning_rate": 1.4814814814814815e-05, "loss": 0.1622, "num_input_tokens_seen": 5284374, "step": 231, "train_runtime": 915.1219, "train_tokens_per_second": 5774.503 }, { "epoch": 1.8727272727272726, "grad_norm": 0.20196233689785004, "learning_rate": 1.3991769547325103e-05, "loss": 0.1211, "num_input_tokens_seen": 5303622, "step": 232, "train_runtime": 917.9986, "train_tokens_per_second": 5777.375 }, { "epoch": 1.8808080808080807, "grad_norm": 0.17019926011562347, "learning_rate": 1.3168724279835393e-05, "loss": 0.1297, "num_input_tokens_seen": 5329718, "step": 233, "train_runtime": 921.75, "train_tokens_per_second": 5782.173 }, { "epoch": 1.8888888888888888, "grad_norm": 0.1855989396572113, "learning_rate": 1.2345679012345678e-05, "loss": 0.1502, "num_input_tokens_seen": 5349718, "step": 234, "train_runtime": 924.7021, "train_tokens_per_second": 5785.342 }, { "epoch": 1.896969696969697, "grad_norm": 0.21048571169376373, "learning_rate": 1.1522633744855968e-05, "loss": 0.1483, "num_input_tokens_seen": 5369638, "step": 235, "train_runtime": 927.6143, "train_tokens_per_second": 5788.654 }, { "epoch": 1.905050505050505, "grad_norm": 0.20776841044425964, "learning_rate": 1.0699588477366255e-05, "loss": 0.1553, "num_input_tokens_seen": 5392726, "step": 236, "train_runtime": 930.986, "train_tokens_per_second": 5792.489 }, { "epoch": 1.9131313131313132, "grad_norm": 0.22271353006362915, "learning_rate": 9.876543209876543e-06, "loss": 0.1699, "num_input_tokens_seen": 5412470, "step": 237, "train_runtime": 933.9223, "train_tokens_per_second": 5795.418 }, { "epoch": 1.9212121212121214, "grad_norm": 0.20936141908168793, "learning_rate": 9.053497942386832e-06, "loss": 0.1471, "num_input_tokens_seen": 5437894, "step": 238, "train_runtime": 937.5658, "train_tokens_per_second": 5800.013 }, { "epoch": 1.9292929292929293, "grad_norm": 0.18848469853401184, "learning_rate": 8.23045267489712e-06, "loss": 0.1898, "num_input_tokens_seen": 5461686, "step": 239, "train_runtime": 940.9924, "train_tokens_per_second": 5804.177 }, { "epoch": 1.9373737373737374, "grad_norm": 0.17875902354717255, "learning_rate": 7.4074074074074075e-06, "loss": 0.147, "num_input_tokens_seen": 5486054, "step": 240, "train_runtime": 944.4956, "train_tokens_per_second": 5808.448 }, { "epoch": 1.9454545454545453, "grad_norm": 0.21896323561668396, "learning_rate": 6.584362139917697e-06, "loss": 0.1621, "num_input_tokens_seen": 5509142, "step": 241, "train_runtime": 948.3591, "train_tokens_per_second": 5809.131 }, { "epoch": 1.9535353535353535, "grad_norm": 0.19773228466510773, "learning_rate": 5.761316872427984e-06, "loss": 0.1263, "num_input_tokens_seen": 5528598, "step": 242, "train_runtime": 951.2561, "train_tokens_per_second": 5811.892 }, { "epoch": 1.9616161616161616, "grad_norm": 0.1763569563627243, "learning_rate": 4.938271604938272e-06, "loss": 0.1158, "num_input_tokens_seen": 5551926, "step": 243, "train_runtime": 954.6378, "train_tokens_per_second": 5815.741 }, { "epoch": 1.9696969696969697, "grad_norm": 0.17359760403633118, "learning_rate": 4.11522633744856e-06, "loss": 0.1097, "num_input_tokens_seen": 5574326, "step": 244, "train_runtime": 957.9246, "train_tokens_per_second": 5819.17 }, { "epoch": 1.9777777777777779, "grad_norm": 0.2085653394460678, "learning_rate": 3.2921810699588483e-06, "loss": 0.194, "num_input_tokens_seen": 5598310, "step": 245, "train_runtime": 961.3777, "train_tokens_per_second": 5823.216 }, { "epoch": 1.985858585858586, "grad_norm": 0.183889701962471, "learning_rate": 2.469135802469136e-06, "loss": 0.1558, "num_input_tokens_seen": 5620534, "step": 246, "train_runtime": 964.6204, "train_tokens_per_second": 5826.68 }, { "epoch": 1.993939393939394, "grad_norm": 0.20709186792373657, "learning_rate": 1.6460905349794242e-06, "loss": 0.1613, "num_input_tokens_seen": 5640982, "step": 247, "train_runtime": 967.6377, "train_tokens_per_second": 5829.643 }, { "epoch": 2.0, "grad_norm": 0.2510419189929962, "learning_rate": 8.230452674897121e-07, "loss": 0.1576, "num_input_tokens_seen": 5653442, "step": 248, "train_runtime": 969.499, "train_tokens_per_second": 5831.303 } ], "logging_steps": 1, "max_steps": 248, "num_input_tokens_seen": 5653442, "num_train_epochs": 2, "save_steps": 30, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.4120939382807142e+17, "train_batch_size": 16, "trial_name": null, "trial_params": null }