{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0, "eval_steps": 117, "global_step": 1170, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0017094017094017094, "grad_norm": 0.4250143766403198, "learning_rate": 0.0, "loss": 1.518, "num_input_tokens_seen": 6088, "step": 1, "train_runtime": 6.2191, "train_tokens_per_second": 978.921 }, { "epoch": 0.003418803418803419, "grad_norm": 0.42283380031585693, "learning_rate": 4e-05, "loss": 1.4678, "num_input_tokens_seen": 11808, "step": 2, "train_runtime": 9.8285, "train_tokens_per_second": 1201.403 }, { "epoch": 0.005128205128205128, "grad_norm": 0.40052852034568787, "learning_rate": 8e-05, "loss": 1.3678, "num_input_tokens_seen": 18304, "step": 3, "train_runtime": 13.9109, "train_tokens_per_second": 1315.798 }, { "epoch": 0.006837606837606838, "grad_norm": 0.6133590340614319, "learning_rate": 0.00012, "loss": 1.5195, "num_input_tokens_seen": 23752, "step": 4, "train_runtime": 17.5271, "train_tokens_per_second": 1355.159 }, { "epoch": 0.008547008547008548, "grad_norm": 0.5969431400299072, "learning_rate": 0.00016, "loss": 0.9666, "num_input_tokens_seen": 30536, "step": 5, "train_runtime": 21.9024, "train_tokens_per_second": 1394.188 }, { "epoch": 0.010256410256410256, "grad_norm": 0.780890703201294, "learning_rate": 0.0002, "loss": 0.816, "num_input_tokens_seen": 35152, "step": 6, "train_runtime": 25.0032, "train_tokens_per_second": 1405.901 }, { "epoch": 0.011965811965811967, "grad_norm": 0.2505766451358795, "learning_rate": 0.00019982832618025754, "loss": 0.4829, "num_input_tokens_seen": 45688, "step": 7, "train_runtime": 33.1628, "train_tokens_per_second": 1377.688 }, { "epoch": 0.013675213675213675, "grad_norm": 0.22040167450904846, "learning_rate": 0.00019965665236051504, "loss": 0.3633, "num_input_tokens_seen": 55504, "step": 8, "train_runtime": 39.2433, "train_tokens_per_second": 1414.355 }, { "epoch": 0.015384615384615385, "grad_norm": 0.18094895780086517, "learning_rate": 0.00019948497854077254, "loss": 0.4153, "num_input_tokens_seen": 62664, "step": 9, "train_runtime": 43.8042, "train_tokens_per_second": 1430.547 }, { "epoch": 0.017094017094017096, "grad_norm": 0.19979114830493927, "learning_rate": 0.00019931330472103005, "loss": 0.4687, "num_input_tokens_seen": 69264, "step": 10, "train_runtime": 48.0067, "train_tokens_per_second": 1442.8 }, { "epoch": 0.018803418803418803, "grad_norm": 0.13777591288089752, "learning_rate": 0.00019914163090128758, "loss": 0.3691, "num_input_tokens_seen": 76296, "step": 11, "train_runtime": 52.4921, "train_tokens_per_second": 1453.476 }, { "epoch": 0.020512820512820513, "grad_norm": 0.18852345645427704, "learning_rate": 0.00019896995708154508, "loss": 0.4321, "num_input_tokens_seen": 81088, "step": 12, "train_runtime": 55.6144, "train_tokens_per_second": 1458.039 }, { "epoch": 0.022222222222222223, "grad_norm": 0.161995068192482, "learning_rate": 0.00019879828326180258, "loss": 0.3859, "num_input_tokens_seen": 86336, "step": 13, "train_runtime": 59.0226, "train_tokens_per_second": 1462.761 }, { "epoch": 0.023931623931623933, "grad_norm": 0.17920617759227753, "learning_rate": 0.00019862660944206008, "loss": 0.4851, "num_input_tokens_seen": 92520, "step": 14, "train_runtime": 63.0338, "train_tokens_per_second": 1467.785 }, { "epoch": 0.02564102564102564, "grad_norm": 0.18425999581813812, "learning_rate": 0.0001984549356223176, "loss": 0.4319, "num_input_tokens_seen": 99352, "step": 15, "train_runtime": 67.3828, "train_tokens_per_second": 1474.441 }, { "epoch": 0.02735042735042735, "grad_norm": 0.1532442718744278, "learning_rate": 0.00019828326180257511, "loss": 0.5035, "num_input_tokens_seen": 105464, "step": 16, "train_runtime": 71.3114, "train_tokens_per_second": 1478.922 }, { "epoch": 0.02905982905982906, "grad_norm": 0.1138884648680687, "learning_rate": 0.00019811158798283262, "loss": 0.3167, "num_input_tokens_seen": 113576, "step": 17, "train_runtime": 76.3581, "train_tokens_per_second": 1487.412 }, { "epoch": 0.03076923076923077, "grad_norm": 0.1539948731660843, "learning_rate": 0.00019793991416309015, "loss": 0.4765, "num_input_tokens_seen": 118448, "step": 18, "train_runtime": 79.6038, "train_tokens_per_second": 1487.97 }, { "epoch": 0.03247863247863248, "grad_norm": 0.11567585170269012, "learning_rate": 0.00019776824034334765, "loss": 0.423, "num_input_tokens_seen": 126120, "step": 19, "train_runtime": 84.4957, "train_tokens_per_second": 1492.621 }, { "epoch": 0.03418803418803419, "grad_norm": 0.1400221586227417, "learning_rate": 0.00019759656652360515, "loss": 0.4563, "num_input_tokens_seen": 132752, "step": 20, "train_runtime": 88.698, "train_tokens_per_second": 1496.674 }, { "epoch": 0.035897435897435895, "grad_norm": 0.13252879679203033, "learning_rate": 0.00019742489270386265, "loss": 0.3811, "num_input_tokens_seen": 139568, "step": 21, "train_runtime": 92.9809, "train_tokens_per_second": 1501.039 }, { "epoch": 0.037606837606837605, "grad_norm": 0.11468011885881424, "learning_rate": 0.00019725321888412018, "loss": 0.3752, "num_input_tokens_seen": 144896, "step": 22, "train_runtime": 96.4953, "train_tokens_per_second": 1501.586 }, { "epoch": 0.039316239316239315, "grad_norm": 0.1273491531610489, "learning_rate": 0.00019708154506437769, "loss": 0.5735, "num_input_tokens_seen": 149888, "step": 23, "train_runtime": 99.8529, "train_tokens_per_second": 1501.089 }, { "epoch": 0.041025641025641026, "grad_norm": 0.115237295627594, "learning_rate": 0.00019690987124463521, "loss": 0.3692, "num_input_tokens_seen": 155416, "step": 24, "train_runtime": 103.4634, "train_tokens_per_second": 1502.135 }, { "epoch": 0.042735042735042736, "grad_norm": 0.11244790256023407, "learning_rate": 0.00019673819742489272, "loss": 0.362, "num_input_tokens_seen": 162096, "step": 25, "train_runtime": 107.7741, "train_tokens_per_second": 1504.035 }, { "epoch": 0.044444444444444446, "grad_norm": 0.1112871989607811, "learning_rate": 0.00019656652360515022, "loss": 0.3231, "num_input_tokens_seen": 169184, "step": 26, "train_runtime": 112.2991, "train_tokens_per_second": 1506.549 }, { "epoch": 0.046153846153846156, "grad_norm": 0.10700014233589172, "learning_rate": 0.00019639484978540775, "loss": 0.4011, "num_input_tokens_seen": 176064, "step": 27, "train_runtime": 116.6504, "train_tokens_per_second": 1509.33 }, { "epoch": 0.04786324786324787, "grad_norm": 0.09945544600486755, "learning_rate": 0.00019622317596566525, "loss": 0.4002, "num_input_tokens_seen": 183784, "step": 28, "train_runtime": 121.5197, "train_tokens_per_second": 1512.38 }, { "epoch": 0.04957264957264957, "grad_norm": 0.11044273525476456, "learning_rate": 0.00019605150214592275, "loss": 0.5269, "num_input_tokens_seen": 190200, "step": 29, "train_runtime": 125.6386, "train_tokens_per_second": 1513.866 }, { "epoch": 0.05128205128205128, "grad_norm": 0.09791948646306992, "learning_rate": 0.00019587982832618026, "loss": 0.4054, "num_input_tokens_seen": 197152, "step": 30, "train_runtime": 129.9816, "train_tokens_per_second": 1516.769 }, { "epoch": 0.05299145299145299, "grad_norm": 0.09980098158121109, "learning_rate": 0.00019570815450643779, "loss": 0.5087, "num_input_tokens_seen": 202824, "step": 31, "train_runtime": 137.1025, "train_tokens_per_second": 1479.361 }, { "epoch": 0.0547008547008547, "grad_norm": 0.12963376939296722, "learning_rate": 0.0001955364806866953, "loss": 0.5493, "num_input_tokens_seen": 207640, "step": 32, "train_runtime": 140.4253, "train_tokens_per_second": 1478.651 }, { "epoch": 0.05641025641025641, "grad_norm": 0.0860801488161087, "learning_rate": 0.0001953648068669528, "loss": 0.3875, "num_input_tokens_seen": 214648, "step": 33, "train_runtime": 144.9087, "train_tokens_per_second": 1481.264 }, { "epoch": 0.05811965811965812, "grad_norm": 0.11512323468923569, "learning_rate": 0.00019519313304721032, "loss": 0.5298, "num_input_tokens_seen": 220632, "step": 34, "train_runtime": 148.7677, "train_tokens_per_second": 1483.064 }, { "epoch": 0.05982905982905983, "grad_norm": 0.09134849905967712, "learning_rate": 0.00019502145922746782, "loss": 0.3995, "num_input_tokens_seen": 225952, "step": 35, "train_runtime": 152.2771, "train_tokens_per_second": 1483.821 }, { "epoch": 0.06153846153846154, "grad_norm": 0.08371111750602722, "learning_rate": 0.00019484978540772535, "loss": 0.3972, "num_input_tokens_seen": 231512, "step": 36, "train_runtime": 155.8719, "train_tokens_per_second": 1485.271 }, { "epoch": 0.06324786324786325, "grad_norm": 0.10832574218511581, "learning_rate": 0.00019467811158798283, "loss": 0.6165, "num_input_tokens_seen": 237608, "step": 37, "train_runtime": 159.803, "train_tokens_per_second": 1486.88 }, { "epoch": 0.06495726495726496, "grad_norm": 0.08655951172113419, "learning_rate": 0.00019450643776824036, "loss": 0.3368, "num_input_tokens_seen": 245056, "step": 38, "train_runtime": 164.5499, "train_tokens_per_second": 1489.25 }, { "epoch": 0.06666666666666667, "grad_norm": 0.1013326346874237, "learning_rate": 0.00019433476394849786, "loss": 0.4206, "num_input_tokens_seen": 250840, "step": 39, "train_runtime": 168.3364, "train_tokens_per_second": 1490.111 }, { "epoch": 0.06837606837606838, "grad_norm": 0.09398815035820007, "learning_rate": 0.0001941630901287554, "loss": 0.4084, "num_input_tokens_seen": 258976, "step": 40, "train_runtime": 173.4242, "train_tokens_per_second": 1493.309 }, { "epoch": 0.07008547008547009, "grad_norm": 0.09392287582159042, "learning_rate": 0.00019399141630901286, "loss": 0.4611, "num_input_tokens_seen": 266368, "step": 41, "train_runtime": 178.0545, "train_tokens_per_second": 1495.992 }, { "epoch": 0.07179487179487179, "grad_norm": 0.09110905230045319, "learning_rate": 0.0001938197424892704, "loss": 0.3737, "num_input_tokens_seen": 272608, "step": 42, "train_runtime": 182.0937, "train_tokens_per_second": 1497.075 }, { "epoch": 0.0735042735042735, "grad_norm": 0.12417464703321457, "learning_rate": 0.00019364806866952792, "loss": 0.3449, "num_input_tokens_seen": 281928, "step": 43, "train_runtime": 187.7546, "train_tokens_per_second": 1501.577 }, { "epoch": 0.07521367521367521, "grad_norm": 0.08885443955659866, "learning_rate": 0.00019347639484978542, "loss": 0.3705, "num_input_tokens_seen": 287584, "step": 44, "train_runtime": 191.4739, "train_tokens_per_second": 1501.949 }, { "epoch": 0.07692307692307693, "grad_norm": 0.101967953145504, "learning_rate": 0.00019330472103004293, "loss": 0.3949, "num_input_tokens_seen": 291480, "step": 45, "train_runtime": 194.2615, "train_tokens_per_second": 1500.452 }, { "epoch": 0.07863247863247863, "grad_norm": 0.09961338341236115, "learning_rate": 0.00019313304721030043, "loss": 0.4503, "num_input_tokens_seen": 297024, "step": 46, "train_runtime": 197.902, "train_tokens_per_second": 1500.864 }, { "epoch": 0.08034188034188035, "grad_norm": 0.0889606773853302, "learning_rate": 0.00019296137339055796, "loss": 0.4031, "num_input_tokens_seen": 303648, "step": 47, "train_runtime": 202.0341, "train_tokens_per_second": 1502.954 }, { "epoch": 0.08205128205128205, "grad_norm": 0.09531895071268082, "learning_rate": 0.00019278969957081546, "loss": 0.4417, "num_input_tokens_seen": 309056, "step": 48, "train_runtime": 205.5638, "train_tokens_per_second": 1503.456 }, { "epoch": 0.08376068376068375, "grad_norm": 0.08631931990385056, "learning_rate": 0.00019261802575107296, "loss": 0.4553, "num_input_tokens_seen": 316400, "step": 49, "train_runtime": 210.172, "train_tokens_per_second": 1505.434 }, { "epoch": 0.08547008547008547, "grad_norm": 0.08847703784704208, "learning_rate": 0.00019244635193133047, "loss": 0.3219, "num_input_tokens_seen": 323200, "step": 50, "train_runtime": 214.5176, "train_tokens_per_second": 1506.636 }, { "epoch": 0.08717948717948718, "grad_norm": 0.11054311692714691, "learning_rate": 0.000192274678111588, "loss": 0.4683, "num_input_tokens_seen": 328312, "step": 51, "train_runtime": 217.9764, "train_tokens_per_second": 1506.181 }, { "epoch": 0.08888888888888889, "grad_norm": 0.09251222759485245, "learning_rate": 0.00019210300429184553, "loss": 0.4102, "num_input_tokens_seen": 333800, "step": 52, "train_runtime": 221.5458, "train_tokens_per_second": 1506.686 }, { "epoch": 0.0905982905982906, "grad_norm": 0.0774988904595375, "learning_rate": 0.000191931330472103, "loss": 0.3548, "num_input_tokens_seen": 342048, "step": 53, "train_runtime": 226.7275, "train_tokens_per_second": 1508.631 }, { "epoch": 0.09230769230769231, "grad_norm": 0.12202516943216324, "learning_rate": 0.00019175965665236053, "loss": 0.5613, "num_input_tokens_seen": 347624, "step": 54, "train_runtime": 230.3617, "train_tokens_per_second": 1509.035 }, { "epoch": 0.09401709401709402, "grad_norm": 0.10605426132678986, "learning_rate": 0.00019158798283261803, "loss": 0.4176, "num_input_tokens_seen": 352416, "step": 55, "train_runtime": 233.4925, "train_tokens_per_second": 1509.325 }, { "epoch": 0.09572649572649573, "grad_norm": 0.11558322608470917, "learning_rate": 0.00019141630901287556, "loss": 0.4917, "num_input_tokens_seen": 357896, "step": 56, "train_runtime": 237.0248, "train_tokens_per_second": 1509.952 }, { "epoch": 0.09743589743589744, "grad_norm": 0.09910829365253448, "learning_rate": 0.00019124463519313304, "loss": 0.4792, "num_input_tokens_seen": 364720, "step": 57, "train_runtime": 241.3172, "train_tokens_per_second": 1511.371 }, { "epoch": 0.09914529914529914, "grad_norm": 0.1221349686384201, "learning_rate": 0.00019107296137339057, "loss": 0.4691, "num_input_tokens_seen": 369984, "step": 58, "train_runtime": 244.7282, "train_tokens_per_second": 1511.816 }, { "epoch": 0.10085470085470086, "grad_norm": 0.08596599102020264, "learning_rate": 0.00019090128755364807, "loss": 0.3253, "num_input_tokens_seen": 376832, "step": 59, "train_runtime": 249.045, "train_tokens_per_second": 1513.108 }, { "epoch": 0.10256410256410256, "grad_norm": 0.10098423808813095, "learning_rate": 0.0001907296137339056, "loss": 0.3785, "num_input_tokens_seen": 383320, "step": 60, "train_runtime": 253.2014, "train_tokens_per_second": 1513.894 }, { "epoch": 0.10427350427350428, "grad_norm": 0.10320388525724411, "learning_rate": 0.0001905579399141631, "loss": 0.4157, "num_input_tokens_seen": 388816, "step": 61, "train_runtime": 258.8284, "train_tokens_per_second": 1502.215 }, { "epoch": 0.10598290598290598, "grad_norm": 0.1285121887922287, "learning_rate": 0.0001903862660944206, "loss": 0.4692, "num_input_tokens_seen": 394272, "step": 62, "train_runtime": 262.3864, "train_tokens_per_second": 1502.639 }, { "epoch": 0.1076923076923077, "grad_norm": 0.09725423902273178, "learning_rate": 0.00019021459227467813, "loss": 0.3565, "num_input_tokens_seen": 401608, "step": 63, "train_runtime": 267.0812, "train_tokens_per_second": 1503.692 }, { "epoch": 0.1094017094017094, "grad_norm": 0.09742418676614761, "learning_rate": 0.00019004291845493563, "loss": 0.4284, "num_input_tokens_seen": 406744, "step": 64, "train_runtime": 270.5234, "train_tokens_per_second": 1503.545 }, { "epoch": 0.1111111111111111, "grad_norm": 0.10458344221115112, "learning_rate": 0.00018987124463519314, "loss": 0.4902, "num_input_tokens_seen": 412400, "step": 65, "train_runtime": 274.2503, "train_tokens_per_second": 1503.736 }, { "epoch": 0.11282051282051282, "grad_norm": 0.10790280252695084, "learning_rate": 0.00018969957081545064, "loss": 0.3972, "num_input_tokens_seen": 418328, "step": 66, "train_runtime": 278.0127, "train_tokens_per_second": 1504.708 }, { "epoch": 0.11452991452991453, "grad_norm": 0.11004123091697693, "learning_rate": 0.00018952789699570817, "loss": 0.5001, "num_input_tokens_seen": 423608, "step": 67, "train_runtime": 281.5247, "train_tokens_per_second": 1504.692 }, { "epoch": 0.11623931623931624, "grad_norm": 0.09410227090120316, "learning_rate": 0.00018935622317596567, "loss": 0.3218, "num_input_tokens_seen": 430864, "step": 68, "train_runtime": 286.005, "train_tokens_per_second": 1506.491 }, { "epoch": 0.11794871794871795, "grad_norm": 0.08077986538410187, "learning_rate": 0.00018918454935622317, "loss": 0.4251, "num_input_tokens_seen": 438136, "step": 69, "train_runtime": 290.6532, "train_tokens_per_second": 1507.418 }, { "epoch": 0.11965811965811966, "grad_norm": 0.09709861129522324, "learning_rate": 0.0001890128755364807, "loss": 0.305, "num_input_tokens_seen": 444304, "step": 70, "train_runtime": 294.7262, "train_tokens_per_second": 1507.514 }, { "epoch": 0.12136752136752137, "grad_norm": 0.07995827496051788, "learning_rate": 0.0001888412017167382, "loss": 0.3157, "num_input_tokens_seen": 449944, "step": 71, "train_runtime": 298.499, "train_tokens_per_second": 1507.355 }, { "epoch": 0.12307692307692308, "grad_norm": 0.11763301491737366, "learning_rate": 0.00018866952789699574, "loss": 0.614, "num_input_tokens_seen": 456280, "step": 72, "train_runtime": 302.4916, "train_tokens_per_second": 1508.406 }, { "epoch": 0.12478632478632479, "grad_norm": 0.13120430707931519, "learning_rate": 0.0001884978540772532, "loss": 0.429, "num_input_tokens_seen": 461752, "step": 73, "train_runtime": 306.0652, "train_tokens_per_second": 1508.672 }, { "epoch": 0.1264957264957265, "grad_norm": 0.11087733507156372, "learning_rate": 0.00018832618025751074, "loss": 0.4589, "num_input_tokens_seen": 467256, "step": 74, "train_runtime": 309.6589, "train_tokens_per_second": 1508.938 }, { "epoch": 0.1282051282051282, "grad_norm": 0.08506280928850174, "learning_rate": 0.00018815450643776824, "loss": 0.3565, "num_input_tokens_seen": 472728, "step": 75, "train_runtime": 313.2853, "train_tokens_per_second": 1508.938 }, { "epoch": 0.12991452991452992, "grad_norm": 0.09503644704818726, "learning_rate": 0.00018798283261802577, "loss": 0.3387, "num_input_tokens_seen": 478992, "step": 76, "train_runtime": 317.1949, "train_tokens_per_second": 1510.087 }, { "epoch": 0.13162393162393163, "grad_norm": 0.08575405180454254, "learning_rate": 0.00018781115879828325, "loss": 0.3635, "num_input_tokens_seen": 485832, "step": 77, "train_runtime": 321.5107, "train_tokens_per_second": 1511.091 }, { "epoch": 0.13333333333333333, "grad_norm": 0.10871604830026627, "learning_rate": 0.00018763948497854078, "loss": 0.4296, "num_input_tokens_seen": 490928, "step": 78, "train_runtime": 324.876, "train_tokens_per_second": 1511.124 }, { "epoch": 0.13504273504273503, "grad_norm": 0.1150660291314125, "learning_rate": 0.0001874678111587983, "loss": 0.4239, "num_input_tokens_seen": 495328, "step": 79, "train_runtime": 327.8846, "train_tokens_per_second": 1510.678 }, { "epoch": 0.13675213675213677, "grad_norm": 0.09480957686901093, "learning_rate": 0.0001872961373390558, "loss": 0.5293, "num_input_tokens_seen": 500544, "step": 80, "train_runtime": 331.3228, "train_tokens_per_second": 1510.744 }, { "epoch": 0.13846153846153847, "grad_norm": 0.10827576369047165, "learning_rate": 0.0001871244635193133, "loss": 0.3564, "num_input_tokens_seen": 508392, "step": 81, "train_runtime": 336.1583, "train_tokens_per_second": 1512.359 }, { "epoch": 0.14017094017094017, "grad_norm": 0.11873910576105118, "learning_rate": 0.0001869527896995708, "loss": 0.3257, "num_input_tokens_seen": 513256, "step": 82, "train_runtime": 339.3559, "train_tokens_per_second": 1512.442 }, { "epoch": 0.14188034188034188, "grad_norm": 0.0916254073381424, "learning_rate": 0.00018678111587982834, "loss": 0.4016, "num_input_tokens_seen": 521168, "step": 83, "train_runtime": 344.2306, "train_tokens_per_second": 1514.008 }, { "epoch": 0.14358974358974358, "grad_norm": 0.08179375529289246, "learning_rate": 0.00018660944206008584, "loss": 0.1876, "num_input_tokens_seen": 535992, "step": 84, "train_runtime": 356.5513, "train_tokens_per_second": 1503.268 }, { "epoch": 0.1452991452991453, "grad_norm": 0.10662805289030075, "learning_rate": 0.00018643776824034335, "loss": 0.4497, "num_input_tokens_seen": 540728, "step": 85, "train_runtime": 359.8356, "train_tokens_per_second": 1502.708 }, { "epoch": 0.147008547008547, "grad_norm": 0.09463411569595337, "learning_rate": 0.00018626609442060085, "loss": 0.5027, "num_input_tokens_seen": 547776, "step": 86, "train_runtime": 364.3736, "train_tokens_per_second": 1503.336 }, { "epoch": 0.14871794871794872, "grad_norm": 0.12029843032360077, "learning_rate": 0.00018609442060085838, "loss": 0.4105, "num_input_tokens_seen": 552712, "step": 87, "train_runtime": 367.7054, "train_tokens_per_second": 1503.138 }, { "epoch": 0.15042735042735042, "grad_norm": 0.08062440901994705, "learning_rate": 0.0001859227467811159, "loss": 0.418, "num_input_tokens_seen": 559664, "step": 88, "train_runtime": 372.2417, "train_tokens_per_second": 1503.496 }, { "epoch": 0.15213675213675212, "grad_norm": 0.10988523811101913, "learning_rate": 0.00018575107296137338, "loss": 0.4045, "num_input_tokens_seen": 564984, "step": 89, "train_runtime": 375.6853, "train_tokens_per_second": 1503.876 }, { "epoch": 0.15384615384615385, "grad_norm": 0.08529689162969589, "learning_rate": 0.0001855793991416309, "loss": 0.2621, "num_input_tokens_seen": 570904, "step": 90, "train_runtime": 379.4257, "train_tokens_per_second": 1504.653 }, { "epoch": 0.15555555555555556, "grad_norm": 0.0883374810218811, "learning_rate": 0.00018540772532188842, "loss": 0.4192, "num_input_tokens_seen": 578592, "step": 91, "train_runtime": 386.3897, "train_tokens_per_second": 1497.431 }, { "epoch": 0.15726495726495726, "grad_norm": 0.09064248204231262, "learning_rate": 0.00018523605150214595, "loss": 0.587, "num_input_tokens_seen": 585320, "step": 92, "train_runtime": 390.6938, "train_tokens_per_second": 1498.155 }, { "epoch": 0.15897435897435896, "grad_norm": 0.0960068479180336, "learning_rate": 0.00018506437768240342, "loss": 0.4497, "num_input_tokens_seen": 591128, "step": 93, "train_runtime": 394.5866, "train_tokens_per_second": 1498.095 }, { "epoch": 0.1606837606837607, "grad_norm": 0.08961305022239685, "learning_rate": 0.00018489270386266095, "loss": 0.3829, "num_input_tokens_seen": 597296, "step": 94, "train_runtime": 398.5175, "train_tokens_per_second": 1498.795 }, { "epoch": 0.1623931623931624, "grad_norm": 0.07730946689844131, "learning_rate": 0.00018472103004291848, "loss": 0.3776, "num_input_tokens_seen": 604664, "step": 95, "train_runtime": 403.2132, "train_tokens_per_second": 1499.613 }, { "epoch": 0.1641025641025641, "grad_norm": 0.07900130748748779, "learning_rate": 0.00018454935622317598, "loss": 0.4371, "num_input_tokens_seen": 612288, "step": 96, "train_runtime": 407.9353, "train_tokens_per_second": 1500.944 }, { "epoch": 0.1658119658119658, "grad_norm": 0.08631894737482071, "learning_rate": 0.00018437768240343348, "loss": 0.4397, "num_input_tokens_seen": 619168, "step": 97, "train_runtime": 412.3324, "train_tokens_per_second": 1501.623 }, { "epoch": 0.1675213675213675, "grad_norm": 0.10031551122665405, "learning_rate": 0.000184206008583691, "loss": 0.4387, "num_input_tokens_seen": 624400, "step": 98, "train_runtime": 415.8434, "train_tokens_per_second": 1501.527 }, { "epoch": 0.16923076923076924, "grad_norm": 0.07904055714607239, "learning_rate": 0.00018403433476394852, "loss": 0.3353, "num_input_tokens_seen": 632536, "step": 99, "train_runtime": 420.8949, "train_tokens_per_second": 1502.836 }, { "epoch": 0.17094017094017094, "grad_norm": 0.11156652867794037, "learning_rate": 0.00018386266094420602, "loss": 0.4099, "num_input_tokens_seen": 638680, "step": 100, "train_runtime": 424.9889, "train_tokens_per_second": 1502.816 }, { "epoch": 0.17264957264957265, "grad_norm": 0.08511320501565933, "learning_rate": 0.00018369098712446352, "loss": 0.4528, "num_input_tokens_seen": 644608, "step": 101, "train_runtime": 428.8153, "train_tokens_per_second": 1503.23 }, { "epoch": 0.17435897435897435, "grad_norm": 0.0914352536201477, "learning_rate": 0.00018351931330472102, "loss": 0.4464, "num_input_tokens_seen": 653032, "step": 102, "train_runtime": 434.0457, "train_tokens_per_second": 1504.524 }, { "epoch": 0.17606837606837608, "grad_norm": 0.0785689502954483, "learning_rate": 0.00018334763948497855, "loss": 0.353, "num_input_tokens_seen": 659008, "step": 103, "train_runtime": 437.8871, "train_tokens_per_second": 1504.973 }, { "epoch": 0.17777777777777778, "grad_norm": 0.0988244116306305, "learning_rate": 0.00018317596566523608, "loss": 0.552, "num_input_tokens_seen": 664320, "step": 104, "train_runtime": 441.435, "train_tokens_per_second": 1504.91 }, { "epoch": 0.1794871794871795, "grad_norm": 0.0942261815071106, "learning_rate": 0.00018300429184549356, "loss": 0.4421, "num_input_tokens_seen": 670136, "step": 105, "train_runtime": 445.279, "train_tokens_per_second": 1504.98 }, { "epoch": 0.1811965811965812, "grad_norm": 0.08600349724292755, "learning_rate": 0.0001828326180257511, "loss": 0.3713, "num_input_tokens_seen": 677616, "step": 106, "train_runtime": 450.0186, "train_tokens_per_second": 1505.751 }, { "epoch": 0.1829059829059829, "grad_norm": 0.104121632874012, "learning_rate": 0.0001826609442060086, "loss": 0.5, "num_input_tokens_seen": 682872, "step": 107, "train_runtime": 453.5698, "train_tokens_per_second": 1505.55 }, { "epoch": 0.18461538461538463, "grad_norm": 0.09976616501808167, "learning_rate": 0.00018248927038626612, "loss": 0.5722, "num_input_tokens_seen": 688880, "step": 108, "train_runtime": 457.5283, "train_tokens_per_second": 1505.656 }, { "epoch": 0.18632478632478633, "grad_norm": 0.09686106443405151, "learning_rate": 0.00018231759656652362, "loss": 0.3717, "num_input_tokens_seen": 694384, "step": 109, "train_runtime": 461.1352, "train_tokens_per_second": 1505.814 }, { "epoch": 0.18803418803418803, "grad_norm": 0.08702944964170456, "learning_rate": 0.00018214592274678112, "loss": 0.4682, "num_input_tokens_seen": 702888, "step": 110, "train_runtime": 466.3341, "train_tokens_per_second": 1507.263 }, { "epoch": 0.18974358974358974, "grad_norm": 0.0813233032822609, "learning_rate": 0.00018197424892703863, "loss": 0.3174, "num_input_tokens_seen": 708344, "step": 111, "train_runtime": 469.8961, "train_tokens_per_second": 1507.448 }, { "epoch": 0.19145299145299147, "grad_norm": 0.07839726656675339, "learning_rate": 0.00018180257510729616, "loss": 0.4506, "num_input_tokens_seen": 716048, "step": 112, "train_runtime": 474.733, "train_tokens_per_second": 1508.317 }, { "epoch": 0.19316239316239317, "grad_norm": 0.10011430829763412, "learning_rate": 0.00018163090128755366, "loss": 0.4048, "num_input_tokens_seen": 720496, "step": 113, "train_runtime": 477.7631, "train_tokens_per_second": 1508.061 }, { "epoch": 0.19487179487179487, "grad_norm": 0.11349597573280334, "learning_rate": 0.00018145922746781116, "loss": 0.4511, "num_input_tokens_seen": 726112, "step": 114, "train_runtime": 481.4317, "train_tokens_per_second": 1508.235 }, { "epoch": 0.19658119658119658, "grad_norm": 0.099846251308918, "learning_rate": 0.0001812875536480687, "loss": 0.4463, "num_input_tokens_seen": 732528, "step": 115, "train_runtime": 485.6263, "train_tokens_per_second": 1508.419 }, { "epoch": 0.19829059829059828, "grad_norm": 0.08845727145671844, "learning_rate": 0.0001811158798283262, "loss": 0.4187, "num_input_tokens_seen": 738224, "step": 116, "train_runtime": 489.3463, "train_tokens_per_second": 1508.592 }, { "epoch": 0.2, "grad_norm": 0.08002110570669174, "learning_rate": 0.0001809442060085837, "loss": 0.3403, "num_input_tokens_seen": 744104, "step": 117, "train_runtime": 493.2012, "train_tokens_per_second": 1508.723 }, { "epoch": 0.2, "eval_loss": 0.40587517619132996, "eval_runtime": 40.1503, "eval_samples_per_second": 24.857, "eval_steps_per_second": 3.113, "num_input_tokens_seen": 744104, "step": 117 }, { "epoch": 0.20170940170940171, "grad_norm": 0.09665407240390778, "learning_rate": 0.0001807725321888412, "loss": 0.5484, "num_input_tokens_seen": 748408, "step": 118, "train_runtime": 536.2984, "train_tokens_per_second": 1395.507 }, { "epoch": 0.20341880341880342, "grad_norm": 0.073427215218544, "learning_rate": 0.00018060085836909873, "loss": 0.4037, "num_input_tokens_seen": 754976, "step": 119, "train_runtime": 540.4931, "train_tokens_per_second": 1396.828 }, { "epoch": 0.20512820512820512, "grad_norm": 0.07861398160457611, "learning_rate": 0.00018042918454935623, "loss": 0.4175, "num_input_tokens_seen": 761608, "step": 120, "train_runtime": 544.7639, "train_tokens_per_second": 1398.051 }, { "epoch": 0.20683760683760682, "grad_norm": 0.08523395657539368, "learning_rate": 0.00018025751072961373, "loss": 0.4514, "num_input_tokens_seen": 766696, "step": 121, "train_runtime": 550.2584, "train_tokens_per_second": 1393.338 }, { "epoch": 0.20854700854700856, "grad_norm": 0.10175268352031708, "learning_rate": 0.00018008583690987126, "loss": 0.5498, "num_input_tokens_seen": 771816, "step": 122, "train_runtime": 553.5915, "train_tokens_per_second": 1394.198 }, { "epoch": 0.21025641025641026, "grad_norm": 0.07897434383630753, "learning_rate": 0.00017991416309012876, "loss": 0.3669, "num_input_tokens_seen": 779816, "step": 123, "train_runtime": 558.5531, "train_tokens_per_second": 1396.136 }, { "epoch": 0.21196581196581196, "grad_norm": 0.10032803565263748, "learning_rate": 0.0001797424892703863, "loss": 0.3945, "num_input_tokens_seen": 784600, "step": 124, "train_runtime": 561.7266, "train_tokens_per_second": 1396.765 }, { "epoch": 0.21367521367521367, "grad_norm": 0.10458017885684967, "learning_rate": 0.0001795708154506438, "loss": 0.4762, "num_input_tokens_seen": 790456, "step": 125, "train_runtime": 565.5377, "train_tokens_per_second": 1397.707 }, { "epoch": 0.2153846153846154, "grad_norm": 0.09089679270982742, "learning_rate": 0.0001793991416309013, "loss": 0.3702, "num_input_tokens_seen": 796736, "step": 126, "train_runtime": 569.5205, "train_tokens_per_second": 1398.959 }, { "epoch": 0.2170940170940171, "grad_norm": 0.06831668317317963, "learning_rate": 0.0001792274678111588, "loss": 0.3713, "num_input_tokens_seen": 804176, "step": 127, "train_runtime": 574.2202, "train_tokens_per_second": 1400.466 }, { "epoch": 0.2188034188034188, "grad_norm": 0.083027184009552, "learning_rate": 0.00017905579399141633, "loss": 0.4235, "num_input_tokens_seen": 809584, "step": 128, "train_runtime": 577.782, "train_tokens_per_second": 1401.193 }, { "epoch": 0.2205128205128205, "grad_norm": 0.11360776424407959, "learning_rate": 0.00017888412017167383, "loss": 0.4361, "num_input_tokens_seen": 814840, "step": 129, "train_runtime": 581.233, "train_tokens_per_second": 1401.916 }, { "epoch": 0.2222222222222222, "grad_norm": 0.08979545533657074, "learning_rate": 0.00017871244635193133, "loss": 0.4393, "num_input_tokens_seen": 821288, "step": 130, "train_runtime": 585.3382, "train_tokens_per_second": 1403.1 }, { "epoch": 0.22393162393162394, "grad_norm": 0.08497156947851181, "learning_rate": 0.00017854077253218886, "loss": 0.5048, "num_input_tokens_seen": 827120, "step": 131, "train_runtime": 589.1115, "train_tokens_per_second": 1404.013 }, { "epoch": 0.22564102564102564, "grad_norm": 0.0827530175447464, "learning_rate": 0.00017836909871244637, "loss": 0.4593, "num_input_tokens_seen": 834872, "step": 132, "train_runtime": 594.0487, "train_tokens_per_second": 1405.393 }, { "epoch": 0.22735042735042735, "grad_norm": 0.08185572922229767, "learning_rate": 0.00017819742489270387, "loss": 0.4384, "num_input_tokens_seen": 842384, "step": 133, "train_runtime": 598.7695, "train_tokens_per_second": 1406.859 }, { "epoch": 0.22905982905982905, "grad_norm": 0.07782582938671112, "learning_rate": 0.00017802575107296137, "loss": 0.3566, "num_input_tokens_seen": 848280, "step": 134, "train_runtime": 602.5201, "train_tokens_per_second": 1407.887 }, { "epoch": 0.23076923076923078, "grad_norm": 0.08689026534557343, "learning_rate": 0.0001778540772532189, "loss": 0.4375, "num_input_tokens_seen": 853712, "step": 135, "train_runtime": 606.0639, "train_tokens_per_second": 1408.617 }, { "epoch": 0.23247863247863249, "grad_norm": 0.08213752508163452, "learning_rate": 0.0001776824034334764, "loss": 0.4607, "num_input_tokens_seen": 860096, "step": 136, "train_runtime": 610.1344, "train_tokens_per_second": 1409.683 }, { "epoch": 0.2341880341880342, "grad_norm": 0.10310304164886475, "learning_rate": 0.0001775107296137339, "loss": 0.5032, "num_input_tokens_seen": 865432, "step": 137, "train_runtime": 613.6063, "train_tokens_per_second": 1410.403 }, { "epoch": 0.2358974358974359, "grad_norm": 0.09156456589698792, "learning_rate": 0.0001773390557939914, "loss": 0.3892, "num_input_tokens_seen": 871368, "step": 138, "train_runtime": 617.5677, "train_tokens_per_second": 1410.968 }, { "epoch": 0.2376068376068376, "grad_norm": 0.091376394033432, "learning_rate": 0.00017716738197424894, "loss": 0.3485, "num_input_tokens_seen": 878000, "step": 139, "train_runtime": 621.9067, "train_tokens_per_second": 1411.787 }, { "epoch": 0.23931623931623933, "grad_norm": 0.08833985775709152, "learning_rate": 0.00017699570815450647, "loss": 0.4308, "num_input_tokens_seen": 884944, "step": 140, "train_runtime": 626.1591, "train_tokens_per_second": 1413.289 }, { "epoch": 0.24102564102564103, "grad_norm": 0.077347531914711, "learning_rate": 0.00017682403433476397, "loss": 0.4437, "num_input_tokens_seen": 892048, "step": 141, "train_runtime": 630.5956, "train_tokens_per_second": 1414.612 }, { "epoch": 0.24273504273504273, "grad_norm": 0.08778735250234604, "learning_rate": 0.00017665236051502147, "loss": 0.4004, "num_input_tokens_seen": 899272, "step": 142, "train_runtime": 635.1106, "train_tokens_per_second": 1415.93 }, { "epoch": 0.24444444444444444, "grad_norm": 0.07579584419727325, "learning_rate": 0.00017648068669527897, "loss": 0.3275, "num_input_tokens_seen": 905736, "step": 143, "train_runtime": 639.1325, "train_tokens_per_second": 1417.133 }, { "epoch": 0.24615384615384617, "grad_norm": 0.09621628373861313, "learning_rate": 0.0001763090128755365, "loss": 0.3186, "num_input_tokens_seen": 911992, "step": 144, "train_runtime": 643.0987, "train_tokens_per_second": 1418.121 }, { "epoch": 0.24786324786324787, "grad_norm": 0.08134900778532028, "learning_rate": 0.000176137339055794, "loss": 0.4076, "num_input_tokens_seen": 919056, "step": 145, "train_runtime": 647.5843, "train_tokens_per_second": 1419.207 }, { "epoch": 0.24957264957264957, "grad_norm": 0.08956107497215271, "learning_rate": 0.0001759656652360515, "loss": 0.442, "num_input_tokens_seen": 926560, "step": 146, "train_runtime": 652.2666, "train_tokens_per_second": 1420.523 }, { "epoch": 0.2512820512820513, "grad_norm": 0.09825581312179565, "learning_rate": 0.000175793991416309, "loss": 0.4903, "num_input_tokens_seen": 932616, "step": 147, "train_runtime": 656.1634, "train_tokens_per_second": 1421.317 }, { "epoch": 0.252991452991453, "grad_norm": 0.0692400187253952, "learning_rate": 0.00017562231759656654, "loss": 0.4363, "num_input_tokens_seen": 943096, "step": 148, "train_runtime": 662.5318, "train_tokens_per_second": 1423.473 }, { "epoch": 0.2547008547008547, "grad_norm": 0.08518907427787781, "learning_rate": 0.00017545064377682404, "loss": 0.507, "num_input_tokens_seen": 949704, "step": 149, "train_runtime": 666.7, "train_tokens_per_second": 1424.485 }, { "epoch": 0.2564102564102564, "grad_norm": 0.07248781621456146, "learning_rate": 0.00017527896995708154, "loss": 0.4597, "num_input_tokens_seen": 958480, "step": 150, "train_runtime": 672.0909, "train_tokens_per_second": 1426.117 }, { "epoch": 0.25811965811965815, "grad_norm": 0.08344928175210953, "learning_rate": 0.00017510729613733907, "loss": 0.4066, "num_input_tokens_seen": 962848, "step": 151, "train_runtime": 677.1767, "train_tokens_per_second": 1421.856 }, { "epoch": 0.25982905982905985, "grad_norm": 0.08732214570045471, "learning_rate": 0.00017493562231759658, "loss": 0.4012, "num_input_tokens_seen": 969200, "step": 152, "train_runtime": 681.1815, "train_tokens_per_second": 1422.822 }, { "epoch": 0.26153846153846155, "grad_norm": 0.0862775668501854, "learning_rate": 0.00017476394849785408, "loss": 0.4044, "num_input_tokens_seen": 977976, "step": 153, "train_runtime": 686.6033, "train_tokens_per_second": 1424.368 }, { "epoch": 0.26324786324786326, "grad_norm": 0.09334586560726166, "learning_rate": 0.00017459227467811158, "loss": 0.4974, "num_input_tokens_seen": 982864, "step": 154, "train_runtime": 689.9455, "train_tokens_per_second": 1424.553 }, { "epoch": 0.26495726495726496, "grad_norm": 0.09835942089557648, "learning_rate": 0.0001744206008583691, "loss": 0.4172, "num_input_tokens_seen": 987816, "step": 155, "train_runtime": 693.2463, "train_tokens_per_second": 1424.913 }, { "epoch": 0.26666666666666666, "grad_norm": 0.09492865204811096, "learning_rate": 0.0001742489270386266, "loss": 0.6536, "num_input_tokens_seen": 995184, "step": 156, "train_runtime": 697.9501, "train_tokens_per_second": 1425.867 }, { "epoch": 0.26837606837606837, "grad_norm": 0.11019627749919891, "learning_rate": 0.00017407725321888414, "loss": 0.3825, "num_input_tokens_seen": 1001744, "step": 157, "train_runtime": 702.1512, "train_tokens_per_second": 1426.678 }, { "epoch": 0.27008547008547007, "grad_norm": 0.07688013464212418, "learning_rate": 0.00017390557939914164, "loss": 0.3832, "num_input_tokens_seen": 1009000, "step": 158, "train_runtime": 706.7516, "train_tokens_per_second": 1427.659 }, { "epoch": 0.2717948717948718, "grad_norm": 0.07811388373374939, "learning_rate": 0.00017373390557939915, "loss": 0.3388, "num_input_tokens_seen": 1016968, "step": 159, "train_runtime": 711.6447, "train_tokens_per_second": 1429.039 }, { "epoch": 0.27350427350427353, "grad_norm": 0.08074574917554855, "learning_rate": 0.00017356223175965668, "loss": 0.3884, "num_input_tokens_seen": 1023360, "step": 160, "train_runtime": 715.701, "train_tokens_per_second": 1429.871 }, { "epoch": 0.27521367521367524, "grad_norm": 0.08296569436788559, "learning_rate": 0.00017339055793991418, "loss": 0.4869, "num_input_tokens_seen": 1030056, "step": 161, "train_runtime": 719.8879, "train_tokens_per_second": 1430.856 }, { "epoch": 0.27692307692307694, "grad_norm": 0.08286713808774948, "learning_rate": 0.00017321888412017168, "loss": 0.4112, "num_input_tokens_seen": 1035944, "step": 162, "train_runtime": 723.7165, "train_tokens_per_second": 1431.422 }, { "epoch": 0.27863247863247864, "grad_norm": 0.08952026814222336, "learning_rate": 0.00017304721030042918, "loss": 0.5178, "num_input_tokens_seen": 1041072, "step": 163, "train_runtime": 727.2547, "train_tokens_per_second": 1431.509 }, { "epoch": 0.28034188034188035, "grad_norm": 0.08672165125608444, "learning_rate": 0.0001728755364806867, "loss": 0.5141, "num_input_tokens_seen": 1046504, "step": 164, "train_runtime": 730.8063, "train_tokens_per_second": 1431.985 }, { "epoch": 0.28205128205128205, "grad_norm": 0.07433119416236877, "learning_rate": 0.00017270386266094421, "loss": 0.3705, "num_input_tokens_seen": 1053320, "step": 165, "train_runtime": 735.1927, "train_tokens_per_second": 1432.713 }, { "epoch": 0.28376068376068375, "grad_norm": 0.09836415946483612, "learning_rate": 0.00017253218884120172, "loss": 0.4012, "num_input_tokens_seen": 1058256, "step": 166, "train_runtime": 738.4481, "train_tokens_per_second": 1433.081 }, { "epoch": 0.28547008547008546, "grad_norm": 0.07832959294319153, "learning_rate": 0.00017236051502145925, "loss": 0.4682, "num_input_tokens_seen": 1066112, "step": 167, "train_runtime": 743.4085, "train_tokens_per_second": 1434.086 }, { "epoch": 0.28717948717948716, "grad_norm": 0.08503518998622894, "learning_rate": 0.00017218884120171675, "loss": 0.3681, "num_input_tokens_seen": 1072952, "step": 168, "train_runtime": 747.782, "train_tokens_per_second": 1434.846 }, { "epoch": 0.28888888888888886, "grad_norm": 0.09327785670757294, "learning_rate": 0.00017201716738197428, "loss": 0.4025, "num_input_tokens_seen": 1077256, "step": 169, "train_runtime": 750.8076, "train_tokens_per_second": 1434.796 }, { "epoch": 0.2905982905982906, "grad_norm": 0.09186345338821411, "learning_rate": 0.00017184549356223175, "loss": 0.3879, "num_input_tokens_seen": 1084024, "step": 170, "train_runtime": 755.0495, "train_tokens_per_second": 1435.699 }, { "epoch": 0.2923076923076923, "grad_norm": 0.10323686897754669, "learning_rate": 0.00017167381974248928, "loss": 0.4933, "num_input_tokens_seen": 1088616, "step": 171, "train_runtime": 758.2012, "train_tokens_per_second": 1435.788 }, { "epoch": 0.294017094017094, "grad_norm": 0.09350578486919403, "learning_rate": 0.00017150214592274679, "loss": 0.4143, "num_input_tokens_seen": 1093688, "step": 172, "train_runtime": 761.4934, "train_tokens_per_second": 1436.241 }, { "epoch": 0.29572649572649573, "grad_norm": 0.08342265337705612, "learning_rate": 0.00017133047210300431, "loss": 0.5081, "num_input_tokens_seen": 1102040, "step": 173, "train_runtime": 766.6178, "train_tokens_per_second": 1437.535 }, { "epoch": 0.29743589743589743, "grad_norm": 0.08377649635076523, "learning_rate": 0.0001711587982832618, "loss": 0.3301, "num_input_tokens_seen": 1108952, "step": 174, "train_runtime": 771.0497, "train_tokens_per_second": 1438.237 }, { "epoch": 0.29914529914529914, "grad_norm": 0.0985167846083641, "learning_rate": 0.00017098712446351932, "loss": 0.4349, "num_input_tokens_seen": 1114632, "step": 175, "train_runtime": 774.8477, "train_tokens_per_second": 1438.518 }, { "epoch": 0.30085470085470084, "grad_norm": 0.08420700579881668, "learning_rate": 0.00017081545064377685, "loss": 0.3511, "num_input_tokens_seen": 1120864, "step": 176, "train_runtime": 778.8626, "train_tokens_per_second": 1439.104 }, { "epoch": 0.30256410256410254, "grad_norm": 0.09592931717634201, "learning_rate": 0.00017064377682403435, "loss": 0.41, "num_input_tokens_seen": 1125952, "step": 177, "train_runtime": 782.2927, "train_tokens_per_second": 1439.298 }, { "epoch": 0.30427350427350425, "grad_norm": 0.1051315888762474, "learning_rate": 0.00017047210300429185, "loss": 0.4207, "num_input_tokens_seen": 1131248, "step": 178, "train_runtime": 785.7848, "train_tokens_per_second": 1439.641 }, { "epoch": 0.305982905982906, "grad_norm": 0.08925200253725052, "learning_rate": 0.00017030042918454936, "loss": 0.4633, "num_input_tokens_seen": 1136936, "step": 179, "train_runtime": 789.5893, "train_tokens_per_second": 1439.908 }, { "epoch": 0.3076923076923077, "grad_norm": 0.0915122926235199, "learning_rate": 0.00017012875536480689, "loss": 0.4684, "num_input_tokens_seen": 1142672, "step": 180, "train_runtime": 793.454, "train_tokens_per_second": 1440.124 }, { "epoch": 0.3094017094017094, "grad_norm": 0.08007518202066422, "learning_rate": 0.0001699570815450644, "loss": 0.3796, "num_input_tokens_seen": 1148560, "step": 181, "train_runtime": 799.6238, "train_tokens_per_second": 1436.375 }, { "epoch": 0.3111111111111111, "grad_norm": 0.07503318041563034, "learning_rate": 0.0001697854077253219, "loss": 0.4707, "num_input_tokens_seen": 1154464, "step": 182, "train_runtime": 803.5538, "train_tokens_per_second": 1436.698 }, { "epoch": 0.3128205128205128, "grad_norm": 0.08250313997268677, "learning_rate": 0.0001696137339055794, "loss": 0.353, "num_input_tokens_seen": 1160784, "step": 183, "train_runtime": 807.6568, "train_tokens_per_second": 1437.224 }, { "epoch": 0.3145299145299145, "grad_norm": 0.08271831274032593, "learning_rate": 0.00016944206008583692, "loss": 0.3339, "num_input_tokens_seen": 1168784, "step": 184, "train_runtime": 812.761, "train_tokens_per_second": 1438.042 }, { "epoch": 0.3162393162393162, "grad_norm": 0.0855436846613884, "learning_rate": 0.00016927038626609445, "loss": 0.4262, "num_input_tokens_seen": 1174328, "step": 185, "train_runtime": 816.4748, "train_tokens_per_second": 1438.291 }, { "epoch": 0.31794871794871793, "grad_norm": 0.0945754274725914, "learning_rate": 0.00016909871244635193, "loss": 0.4788, "num_input_tokens_seen": 1181472, "step": 186, "train_runtime": 820.9842, "train_tokens_per_second": 1439.092 }, { "epoch": 0.31965811965811963, "grad_norm": 0.08868105709552765, "learning_rate": 0.00016892703862660946, "loss": 0.3443, "num_input_tokens_seen": 1186512, "step": 187, "train_runtime": 824.2996, "train_tokens_per_second": 1439.418 }, { "epoch": 0.3213675213675214, "grad_norm": 0.08292389661073685, "learning_rate": 0.00016875536480686696, "loss": 0.4366, "num_input_tokens_seen": 1193368, "step": 188, "train_runtime": 828.6712, "train_tokens_per_second": 1440.098 }, { "epoch": 0.3230769230769231, "grad_norm": 0.08975725620985031, "learning_rate": 0.0001685836909871245, "loss": 0.4329, "num_input_tokens_seen": 1199040, "step": 189, "train_runtime": 832.4326, "train_tokens_per_second": 1440.405 }, { "epoch": 0.3247863247863248, "grad_norm": 0.0817112997174263, "learning_rate": 0.00016841201716738196, "loss": 0.3662, "num_input_tokens_seen": 1206688, "step": 190, "train_runtime": 837.2183, "train_tokens_per_second": 1441.306 }, { "epoch": 0.3264957264957265, "grad_norm": 0.07979970425367355, "learning_rate": 0.0001682403433476395, "loss": 0.398, "num_input_tokens_seen": 1212200, "step": 191, "train_runtime": 840.9362, "train_tokens_per_second": 1441.489 }, { "epoch": 0.3282051282051282, "grad_norm": 0.07939396798610687, "learning_rate": 0.000168068669527897, "loss": 0.3686, "num_input_tokens_seen": 1216776, "step": 192, "train_runtime": 843.9694, "train_tokens_per_second": 1441.73 }, { "epoch": 0.3299145299145299, "grad_norm": 0.07741633802652359, "learning_rate": 0.00016789699570815452, "loss": 0.425, "num_input_tokens_seen": 1226144, "step": 193, "train_runtime": 849.6943, "train_tokens_per_second": 1443.041 }, { "epoch": 0.3316239316239316, "grad_norm": 0.09136336296796799, "learning_rate": 0.00016772532188841203, "loss": 0.3931, "num_input_tokens_seen": 1231528, "step": 194, "train_runtime": 853.2848, "train_tokens_per_second": 1443.279 }, { "epoch": 0.3333333333333333, "grad_norm": 0.08121038973331451, "learning_rate": 0.00016755364806866953, "loss": 0.463, "num_input_tokens_seen": 1238208, "step": 195, "train_runtime": 857.5308, "train_tokens_per_second": 1443.923 }, { "epoch": 0.335042735042735, "grad_norm": 0.07446426898241043, "learning_rate": 0.00016738197424892706, "loss": 0.3814, "num_input_tokens_seen": 1246368, "step": 196, "train_runtime": 862.7002, "train_tokens_per_second": 1444.729 }, { "epoch": 0.3367521367521368, "grad_norm": 0.08591346442699432, "learning_rate": 0.00016721030042918456, "loss": 0.4053, "num_input_tokens_seen": 1253176, "step": 197, "train_runtime": 867.0626, "train_tokens_per_second": 1445.312 }, { "epoch": 0.3384615384615385, "grad_norm": 0.0990113615989685, "learning_rate": 0.00016703862660944206, "loss": 0.3617, "num_input_tokens_seen": 1257328, "step": 198, "train_runtime": 869.9717, "train_tokens_per_second": 1445.252 }, { "epoch": 0.3401709401709402, "grad_norm": 0.08174863457679749, "learning_rate": 0.00016686695278969957, "loss": 0.2952, "num_input_tokens_seen": 1262752, "step": 199, "train_runtime": 873.6148, "train_tokens_per_second": 1445.433 }, { "epoch": 0.3418803418803419, "grad_norm": 0.0933527871966362, "learning_rate": 0.0001666952789699571, "loss": 0.4163, "num_input_tokens_seen": 1268184, "step": 200, "train_runtime": 877.2752, "train_tokens_per_second": 1445.594 }, { "epoch": 0.3435897435897436, "grad_norm": 0.1140134260058403, "learning_rate": 0.0001665236051502146, "loss": 0.4031, "num_input_tokens_seen": 1272472, "step": 201, "train_runtime": 880.2048, "train_tokens_per_second": 1445.654 }, { "epoch": 0.3452991452991453, "grad_norm": 0.08693648129701614, "learning_rate": 0.0001663519313304721, "loss": 0.6282, "num_input_tokens_seen": 1281824, "step": 202, "train_runtime": 886.0089, "train_tokens_per_second": 1446.739 }, { "epoch": 0.347008547008547, "grad_norm": 0.07994189858436584, "learning_rate": 0.00016618025751072963, "loss": 0.4113, "num_input_tokens_seen": 1289504, "step": 203, "train_runtime": 890.7326, "train_tokens_per_second": 1447.689 }, { "epoch": 0.3487179487179487, "grad_norm": 0.09394797682762146, "learning_rate": 0.00016600858369098713, "loss": 0.4092, "num_input_tokens_seen": 1297680, "step": 204, "train_runtime": 895.8276, "train_tokens_per_second": 1448.582 }, { "epoch": 0.3504273504273504, "grad_norm": 0.1045864149928093, "learning_rate": 0.00016583690987124466, "loss": 0.4665, "num_input_tokens_seen": 1303120, "step": 205, "train_runtime": 899.4257, "train_tokens_per_second": 1448.836 }, { "epoch": 0.35213675213675216, "grad_norm": 0.09909515082836151, "learning_rate": 0.00016566523605150214, "loss": 0.3833, "num_input_tokens_seen": 1308704, "step": 206, "train_runtime": 903.0277, "train_tokens_per_second": 1449.24 }, { "epoch": 0.35384615384615387, "grad_norm": 0.09417211264371872, "learning_rate": 0.00016549356223175967, "loss": 0.4637, "num_input_tokens_seen": 1318024, "step": 207, "train_runtime": 908.7522, "train_tokens_per_second": 1450.367 }, { "epoch": 0.35555555555555557, "grad_norm": 0.08689752966165543, "learning_rate": 0.00016532188841201717, "loss": 0.3688, "num_input_tokens_seen": 1323376, "step": 208, "train_runtime": 912.3212, "train_tokens_per_second": 1450.559 }, { "epoch": 0.3572649572649573, "grad_norm": 0.10346587747335434, "learning_rate": 0.0001651502145922747, "loss": 0.417, "num_input_tokens_seen": 1329344, "step": 209, "train_runtime": 916.1738, "train_tokens_per_second": 1450.974 }, { "epoch": 0.358974358974359, "grad_norm": 0.08489441126585007, "learning_rate": 0.00016497854077253217, "loss": 0.3553, "num_input_tokens_seen": 1335584, "step": 210, "train_runtime": 920.2847, "train_tokens_per_second": 1451.273 }, { "epoch": 0.3606837606837607, "grad_norm": 0.10042458772659302, "learning_rate": 0.0001648068669527897, "loss": 0.4154, "num_input_tokens_seen": 1340328, "step": 211, "train_runtime": 925.545, "train_tokens_per_second": 1448.15 }, { "epoch": 0.3623931623931624, "grad_norm": 0.10793930292129517, "learning_rate": 0.00016463519313304723, "loss": 0.3644, "num_input_tokens_seen": 1345400, "step": 212, "train_runtime": 928.914, "train_tokens_per_second": 1448.358 }, { "epoch": 0.3641025641025641, "grad_norm": 0.08157683908939362, "learning_rate": 0.00016446351931330473, "loss": 0.3851, "num_input_tokens_seen": 1352168, "step": 213, "train_runtime": 933.2462, "train_tokens_per_second": 1448.887 }, { "epoch": 0.3658119658119658, "grad_norm": 0.08290579169988632, "learning_rate": 0.00016429184549356224, "loss": 0.4271, "num_input_tokens_seen": 1357488, "step": 214, "train_runtime": 936.7821, "train_tokens_per_second": 1449.097 }, { "epoch": 0.36752136752136755, "grad_norm": 0.09265032410621643, "learning_rate": 0.00016412017167381974, "loss": 0.3743, "num_input_tokens_seen": 1363552, "step": 215, "train_runtime": 940.8128, "train_tokens_per_second": 1449.334 }, { "epoch": 0.36923076923076925, "grad_norm": 0.11796024441719055, "learning_rate": 0.00016394849785407727, "loss": 0.5261, "num_input_tokens_seen": 1368296, "step": 216, "train_runtime": 943.9494, "train_tokens_per_second": 1449.544 }, { "epoch": 0.37094017094017095, "grad_norm": 0.08797245472669601, "learning_rate": 0.00016377682403433477, "loss": 0.4256, "num_input_tokens_seen": 1374640, "step": 217, "train_runtime": 947.9289, "train_tokens_per_second": 1450.151 }, { "epoch": 0.37264957264957266, "grad_norm": 0.09329722076654434, "learning_rate": 0.00016360515021459227, "loss": 0.4461, "num_input_tokens_seen": 1379760, "step": 218, "train_runtime": 951.2715, "train_tokens_per_second": 1450.438 }, { "epoch": 0.37435897435897436, "grad_norm": 0.09663166105747223, "learning_rate": 0.00016343347639484978, "loss": 0.3487, "num_input_tokens_seen": 1384368, "step": 219, "train_runtime": 954.3992, "train_tokens_per_second": 1450.513 }, { "epoch": 0.37606837606837606, "grad_norm": 0.07949472963809967, "learning_rate": 0.0001632618025751073, "loss": 0.3311, "num_input_tokens_seen": 1389488, "step": 220, "train_runtime": 957.768, "train_tokens_per_second": 1450.756 }, { "epoch": 0.37777777777777777, "grad_norm": 0.07584179192781448, "learning_rate": 0.00016309012875536483, "loss": 0.524, "num_input_tokens_seen": 1396320, "step": 221, "train_runtime": 962.0694, "train_tokens_per_second": 1451.371 }, { "epoch": 0.37948717948717947, "grad_norm": 0.08242885023355484, "learning_rate": 0.0001629184549356223, "loss": 0.4083, "num_input_tokens_seen": 1403024, "step": 222, "train_runtime": 966.312, "train_tokens_per_second": 1451.937 }, { "epoch": 0.3811965811965812, "grad_norm": 0.08721666783094406, "learning_rate": 0.00016274678111587984, "loss": 0.4642, "num_input_tokens_seen": 1413336, "step": 223, "train_runtime": 972.5941, "train_tokens_per_second": 1453.161 }, { "epoch": 0.38290598290598293, "grad_norm": 0.08998598903417587, "learning_rate": 0.00016257510729613734, "loss": 0.3536, "num_input_tokens_seen": 1418664, "step": 224, "train_runtime": 976.0647, "train_tokens_per_second": 1453.453 }, { "epoch": 0.38461538461538464, "grad_norm": 0.09844992309808731, "learning_rate": 0.00016240343347639487, "loss": 0.4508, "num_input_tokens_seen": 1424488, "step": 225, "train_runtime": 979.8777, "train_tokens_per_second": 1453.741 }, { "epoch": 0.38632478632478634, "grad_norm": 0.0743747279047966, "learning_rate": 0.00016223175965665235, "loss": 0.4139, "num_input_tokens_seen": 1430656, "step": 226, "train_runtime": 983.8135, "train_tokens_per_second": 1454.194 }, { "epoch": 0.38803418803418804, "grad_norm": 0.09330051392316818, "learning_rate": 0.00016206008583690988, "loss": 0.3968, "num_input_tokens_seen": 1436704, "step": 227, "train_runtime": 987.722, "train_tokens_per_second": 1454.563 }, { "epoch": 0.38974358974358975, "grad_norm": 0.08090078085660934, "learning_rate": 0.00016188841201716738, "loss": 0.4065, "num_input_tokens_seen": 1442192, "step": 228, "train_runtime": 991.2265, "train_tokens_per_second": 1454.957 }, { "epoch": 0.39145299145299145, "grad_norm": 0.09302696585655212, "learning_rate": 0.0001617167381974249, "loss": 0.5249, "num_input_tokens_seen": 1446968, "step": 229, "train_runtime": 994.4101, "train_tokens_per_second": 1455.102 }, { "epoch": 0.39316239316239315, "grad_norm": 0.09254134446382523, "learning_rate": 0.0001615450643776824, "loss": 0.492, "num_input_tokens_seen": 1451760, "step": 230, "train_runtime": 997.6396, "train_tokens_per_second": 1455.195 }, { "epoch": 0.39487179487179486, "grad_norm": 0.07806482911109924, "learning_rate": 0.0001613733905579399, "loss": 0.3763, "num_input_tokens_seen": 1458224, "step": 231, "train_runtime": 1001.7272, "train_tokens_per_second": 1455.71 }, { "epoch": 0.39658119658119656, "grad_norm": 0.09533582627773285, "learning_rate": 0.00016120171673819744, "loss": 0.3539, "num_input_tokens_seen": 1466568, "step": 232, "train_runtime": 1006.8859, "train_tokens_per_second": 1456.538 }, { "epoch": 0.39829059829059826, "grad_norm": 0.08084721863269806, "learning_rate": 0.00016103004291845494, "loss": 0.3963, "num_input_tokens_seen": 1471888, "step": 233, "train_runtime": 1010.3453, "train_tokens_per_second": 1456.817 }, { "epoch": 0.4, "grad_norm": 0.11491655558347702, "learning_rate": 0.00016085836909871245, "loss": 0.5211, "num_input_tokens_seen": 1475936, "step": 234, "train_runtime": 1013.2193, "train_tokens_per_second": 1456.68 }, { "epoch": 0.4, "eval_loss": 0.40096667408943176, "eval_runtime": 39.8121, "eval_samples_per_second": 25.068, "eval_steps_per_second": 3.14, "num_input_tokens_seen": 1475936, "step": 234 }, { "epoch": 0.4017094017094017, "grad_norm": 0.09031600505113602, "learning_rate": 0.00016068669527896995, "loss": 0.3919, "num_input_tokens_seen": 1480152, "step": 235, "train_runtime": 1055.9664, "train_tokens_per_second": 1401.704 }, { "epoch": 0.40341880341880343, "grad_norm": 0.07933737337589264, "learning_rate": 0.00016051502145922748, "loss": 0.3459, "num_input_tokens_seen": 1487376, "step": 236, "train_runtime": 1060.4849, "train_tokens_per_second": 1402.543 }, { "epoch": 0.40512820512820513, "grad_norm": 0.10257117450237274, "learning_rate": 0.00016034334763948498, "loss": 0.4875, "num_input_tokens_seen": 1491480, "step": 237, "train_runtime": 1063.2453, "train_tokens_per_second": 1402.762 }, { "epoch": 0.40683760683760684, "grad_norm": 0.07746583223342896, "learning_rate": 0.00016017167381974248, "loss": 0.4194, "num_input_tokens_seen": 1498224, "step": 238, "train_runtime": 1067.6608, "train_tokens_per_second": 1403.277 }, { "epoch": 0.40854700854700854, "grad_norm": 0.08215701580047607, "learning_rate": 0.00016, "loss": 0.3321, "num_input_tokens_seen": 1505016, "step": 239, "train_runtime": 1071.959, "train_tokens_per_second": 1403.986 }, { "epoch": 0.41025641025641024, "grad_norm": 0.08626586198806763, "learning_rate": 0.00015982832618025752, "loss": 0.352, "num_input_tokens_seen": 1510872, "step": 240, "train_runtime": 1075.7766, "train_tokens_per_second": 1404.448 }, { "epoch": 0.41196581196581195, "grad_norm": 0.07768667489290237, "learning_rate": 0.00015965665236051504, "loss": 0.3635, "num_input_tokens_seen": 1518680, "step": 241, "train_runtime": 1083.0754, "train_tokens_per_second": 1402.192 }, { "epoch": 0.41367521367521365, "grad_norm": 0.09436383098363876, "learning_rate": 0.00015948497854077255, "loss": 0.3873, "num_input_tokens_seen": 1523408, "step": 242, "train_runtime": 1086.2718, "train_tokens_per_second": 1402.419 }, { "epoch": 0.4153846153846154, "grad_norm": 0.10022980719804764, "learning_rate": 0.00015931330472103005, "loss": 0.4982, "num_input_tokens_seen": 1527088, "step": 243, "train_runtime": 1088.8585, "train_tokens_per_second": 1402.467 }, { "epoch": 0.4170940170940171, "grad_norm": 0.07399852573871613, "learning_rate": 0.00015914163090128755, "loss": 0.428, "num_input_tokens_seen": 1537712, "step": 244, "train_runtime": 1095.1717, "train_tokens_per_second": 1404.083 }, { "epoch": 0.4188034188034188, "grad_norm": 0.09640722721815109, "learning_rate": 0.00015896995708154508, "loss": 0.4273, "num_input_tokens_seen": 1544256, "step": 245, "train_runtime": 1099.4433, "train_tokens_per_second": 1404.58 }, { "epoch": 0.4205128205128205, "grad_norm": 0.08752251416444778, "learning_rate": 0.00015879828326180258, "loss": 0.3741, "num_input_tokens_seen": 1549216, "step": 246, "train_runtime": 1102.808, "train_tokens_per_second": 1404.792 }, { "epoch": 0.4222222222222222, "grad_norm": 0.09055118262767792, "learning_rate": 0.00015862660944206009, "loss": 0.3215, "num_input_tokens_seen": 1553936, "step": 247, "train_runtime": 1106.0798, "train_tokens_per_second": 1404.904 }, { "epoch": 0.4239316239316239, "grad_norm": 0.09065423905849457, "learning_rate": 0.00015845493562231762, "loss": 0.3577, "num_input_tokens_seen": 1559952, "step": 248, "train_runtime": 1110.0108, "train_tokens_per_second": 1405.349 }, { "epoch": 0.4256410256410256, "grad_norm": 0.07726360857486725, "learning_rate": 0.00015828326180257512, "loss": 0.3056, "num_input_tokens_seen": 1565544, "step": 249, "train_runtime": 1113.7626, "train_tokens_per_second": 1405.635 }, { "epoch": 0.42735042735042733, "grad_norm": 0.11181222647428513, "learning_rate": 0.00015811158798283262, "loss": 0.4, "num_input_tokens_seen": 1570120, "step": 250, "train_runtime": 1116.8239, "train_tokens_per_second": 1405.88 }, { "epoch": 0.42905982905982903, "grad_norm": 0.09931083768606186, "learning_rate": 0.00015793991416309012, "loss": 0.4628, "num_input_tokens_seen": 1576664, "step": 251, "train_runtime": 1120.9296, "train_tokens_per_second": 1406.568 }, { "epoch": 0.4307692307692308, "grad_norm": 0.1047554761171341, "learning_rate": 0.00015776824034334765, "loss": 0.5433, "num_input_tokens_seen": 1580232, "step": 252, "train_runtime": 1123.4358, "train_tokens_per_second": 1406.606 }, { "epoch": 0.4324786324786325, "grad_norm": 0.09181802719831467, "learning_rate": 0.00015759656652360515, "loss": 0.5485, "num_input_tokens_seen": 1587000, "step": 253, "train_runtime": 1127.7713, "train_tokens_per_second": 1407.2 }, { "epoch": 0.4341880341880342, "grad_norm": 0.08955714106559753, "learning_rate": 0.00015742489270386266, "loss": 0.3696, "num_input_tokens_seen": 1592184, "step": 254, "train_runtime": 1131.1496, "train_tokens_per_second": 1407.58 }, { "epoch": 0.4358974358974359, "grad_norm": 0.08395666629076004, "learning_rate": 0.00015725321888412016, "loss": 0.3811, "num_input_tokens_seen": 1597400, "step": 255, "train_runtime": 1134.6396, "train_tokens_per_second": 1407.848 }, { "epoch": 0.4376068376068376, "grad_norm": 0.08952012658119202, "learning_rate": 0.0001570815450643777, "loss": 0.5207, "num_input_tokens_seen": 1603560, "step": 256, "train_runtime": 1138.5956, "train_tokens_per_second": 1408.367 }, { "epoch": 0.4393162393162393, "grad_norm": 0.07518703490495682, "learning_rate": 0.00015690987124463522, "loss": 0.341, "num_input_tokens_seen": 1609952, "step": 257, "train_runtime": 1142.6858, "train_tokens_per_second": 1408.919 }, { "epoch": 0.441025641025641, "grad_norm": 0.08981534093618393, "learning_rate": 0.00015673819742489272, "loss": 0.3535, "num_input_tokens_seen": 1614952, "step": 258, "train_runtime": 1146.1364, "train_tokens_per_second": 1409.04 }, { "epoch": 0.4427350427350427, "grad_norm": 0.09569933265447617, "learning_rate": 0.00015656652360515022, "loss": 0.4656, "num_input_tokens_seen": 1621848, "step": 259, "train_runtime": 1150.5402, "train_tokens_per_second": 1409.64 }, { "epoch": 0.4444444444444444, "grad_norm": 0.0871426984667778, "learning_rate": 0.00015639484978540773, "loss": 0.3592, "num_input_tokens_seen": 1629144, "step": 260, "train_runtime": 1155.1465, "train_tokens_per_second": 1410.335 }, { "epoch": 0.4461538461538462, "grad_norm": 0.07977623492479324, "learning_rate": 0.00015622317596566525, "loss": 0.4316, "num_input_tokens_seen": 1635464, "step": 261, "train_runtime": 1159.1609, "train_tokens_per_second": 1410.903 }, { "epoch": 0.4478632478632479, "grad_norm": 0.10125043988227844, "learning_rate": 0.00015605150214592276, "loss": 0.3631, "num_input_tokens_seen": 1640440, "step": 262, "train_runtime": 1162.4822, "train_tokens_per_second": 1411.153 }, { "epoch": 0.4495726495726496, "grad_norm": 0.0801963284611702, "learning_rate": 0.00015587982832618026, "loss": 0.3788, "num_input_tokens_seen": 1647488, "step": 263, "train_runtime": 1167.0278, "train_tokens_per_second": 1411.696 }, { "epoch": 0.4512820512820513, "grad_norm": 0.07716058194637299, "learning_rate": 0.0001557081545064378, "loss": 0.4523, "num_input_tokens_seen": 1653720, "step": 264, "train_runtime": 1170.999, "train_tokens_per_second": 1412.23 }, { "epoch": 0.452991452991453, "grad_norm": 0.07113456726074219, "learning_rate": 0.0001555364806866953, "loss": 0.4483, "num_input_tokens_seen": 1662984, "step": 265, "train_runtime": 1176.6605, "train_tokens_per_second": 1413.308 }, { "epoch": 0.4547008547008547, "grad_norm": 0.08501028269529343, "learning_rate": 0.0001553648068669528, "loss": 0.3744, "num_input_tokens_seen": 1669240, "step": 266, "train_runtime": 1180.5615, "train_tokens_per_second": 1413.937 }, { "epoch": 0.4564102564102564, "grad_norm": 0.12146402895450592, "learning_rate": 0.0001551931330472103, "loss": 0.5228, "num_input_tokens_seen": 1674392, "step": 267, "train_runtime": 1183.9915, "train_tokens_per_second": 1414.193 }, { "epoch": 0.4581196581196581, "grad_norm": 0.08500533550977707, "learning_rate": 0.00015502145922746783, "loss": 0.4029, "num_input_tokens_seen": 1680704, "step": 268, "train_runtime": 1188.0637, "train_tokens_per_second": 1414.658 }, { "epoch": 0.4598290598290598, "grad_norm": 0.08828039467334747, "learning_rate": 0.00015484978540772533, "loss": 0.3817, "num_input_tokens_seen": 1688032, "step": 269, "train_runtime": 1192.6736, "train_tokens_per_second": 1415.334 }, { "epoch": 0.46153846153846156, "grad_norm": 0.09044201672077179, "learning_rate": 0.00015467811158798283, "loss": 0.2898, "num_input_tokens_seen": 1695632, "step": 270, "train_runtime": 1197.4796, "train_tokens_per_second": 1416.001 }, { "epoch": 0.46324786324786327, "grad_norm": 0.08178558945655823, "learning_rate": 0.00015450643776824033, "loss": 0.3721, "num_input_tokens_seen": 1701256, "step": 271, "train_runtime": 1203.6359, "train_tokens_per_second": 1413.431 }, { "epoch": 0.46495726495726497, "grad_norm": 0.08540398627519608, "learning_rate": 0.00015433476394849786, "loss": 0.4181, "num_input_tokens_seen": 1706352, "step": 272, "train_runtime": 1206.9569, "train_tokens_per_second": 1413.764 }, { "epoch": 0.4666666666666667, "grad_norm": 0.08019081503152847, "learning_rate": 0.0001541630901287554, "loss": 0.3428, "num_input_tokens_seen": 1711728, "step": 273, "train_runtime": 1210.514, "train_tokens_per_second": 1414.051 }, { "epoch": 0.4683760683760684, "grad_norm": 0.09295406192541122, "learning_rate": 0.0001539914163090129, "loss": 0.4543, "num_input_tokens_seen": 1716512, "step": 274, "train_runtime": 1213.6938, "train_tokens_per_second": 1414.287 }, { "epoch": 0.4700854700854701, "grad_norm": 0.07860468327999115, "learning_rate": 0.0001538197424892704, "loss": 0.4592, "num_input_tokens_seen": 1722200, "step": 275, "train_runtime": 1217.3819, "train_tokens_per_second": 1414.675 }, { "epoch": 0.4717948717948718, "grad_norm": 0.08995640277862549, "learning_rate": 0.0001536480686695279, "loss": 0.3845, "num_input_tokens_seen": 1726088, "step": 276, "train_runtime": 1220.143, "train_tokens_per_second": 1414.66 }, { "epoch": 0.4735042735042735, "grad_norm": 0.08785276114940643, "learning_rate": 0.00015347639484978543, "loss": 0.4225, "num_input_tokens_seen": 1733392, "step": 277, "train_runtime": 1224.7221, "train_tokens_per_second": 1415.335 }, { "epoch": 0.4752136752136752, "grad_norm": 0.0918450802564621, "learning_rate": 0.00015330472103004293, "loss": 0.4922, "num_input_tokens_seen": 1739624, "step": 278, "train_runtime": 1228.6485, "train_tokens_per_second": 1415.884 }, { "epoch": 0.47692307692307695, "grad_norm": 0.07409488409757614, "learning_rate": 0.00015313304721030043, "loss": 0.3089, "num_input_tokens_seen": 1745512, "step": 279, "train_runtime": 1232.4839, "train_tokens_per_second": 1416.255 }, { "epoch": 0.47863247863247865, "grad_norm": 0.08338349312543869, "learning_rate": 0.00015296137339055794, "loss": 0.3837, "num_input_tokens_seen": 1751352, "step": 280, "train_runtime": 1236.2127, "train_tokens_per_second": 1416.708 }, { "epoch": 0.48034188034188036, "grad_norm": 0.08887634426355362, "learning_rate": 0.00015278969957081546, "loss": 0.4143, "num_input_tokens_seen": 1757360, "step": 281, "train_runtime": 1240.1646, "train_tokens_per_second": 1417.038 }, { "epoch": 0.48205128205128206, "grad_norm": 0.08524525165557861, "learning_rate": 0.00015261802575107297, "loss": 0.4217, "num_input_tokens_seen": 1762880, "step": 282, "train_runtime": 1243.7701, "train_tokens_per_second": 1417.368 }, { "epoch": 0.48376068376068376, "grad_norm": 0.08796384930610657, "learning_rate": 0.00015244635193133047, "loss": 0.5087, "num_input_tokens_seen": 1768064, "step": 283, "train_runtime": 1247.2163, "train_tokens_per_second": 1417.608 }, { "epoch": 0.48547008547008547, "grad_norm": 0.08289546519517899, "learning_rate": 0.000152274678111588, "loss": 0.3867, "num_input_tokens_seen": 1774344, "step": 284, "train_runtime": 1251.4095, "train_tokens_per_second": 1417.876 }, { "epoch": 0.48717948717948717, "grad_norm": 0.09948357194662094, "learning_rate": 0.0001521030042918455, "loss": 0.4324, "num_input_tokens_seen": 1779720, "step": 285, "train_runtime": 1255.0103, "train_tokens_per_second": 1418.092 }, { "epoch": 0.4888888888888889, "grad_norm": 0.08023009449243546, "learning_rate": 0.000151931330472103, "loss": 0.2635, "num_input_tokens_seen": 1789384, "step": 286, "train_runtime": 1260.9634, "train_tokens_per_second": 1419.061 }, { "epoch": 0.4905982905982906, "grad_norm": 0.08087978512048721, "learning_rate": 0.0001517596566523605, "loss": 0.3492, "num_input_tokens_seen": 1794880, "step": 287, "train_runtime": 1264.6081, "train_tokens_per_second": 1419.317 }, { "epoch": 0.49230769230769234, "grad_norm": 0.07231873273849487, "learning_rate": 0.00015158798283261804, "loss": 0.3468, "num_input_tokens_seen": 1800104, "step": 288, "train_runtime": 1268.0921, "train_tokens_per_second": 1419.537 }, { "epoch": 0.49401709401709404, "grad_norm": 0.07424788177013397, "learning_rate": 0.00015141630901287554, "loss": 0.3704, "num_input_tokens_seen": 1805928, "step": 289, "train_runtime": 1271.8437, "train_tokens_per_second": 1419.929 }, { "epoch": 0.49572649572649574, "grad_norm": 0.09837713837623596, "learning_rate": 0.00015124463519313307, "loss": 0.45, "num_input_tokens_seen": 1810824, "step": 290, "train_runtime": 1275.0248, "train_tokens_per_second": 1420.227 }, { "epoch": 0.49743589743589745, "grad_norm": 0.08725966513156891, "learning_rate": 0.00015107296137339057, "loss": 0.4393, "num_input_tokens_seen": 1815928, "step": 291, "train_runtime": 1278.4107, "train_tokens_per_second": 1420.457 }, { "epoch": 0.49914529914529915, "grad_norm": 0.08219818770885468, "learning_rate": 0.00015090128755364807, "loss": 0.4083, "num_input_tokens_seen": 1822272, "step": 292, "train_runtime": 1282.5809, "train_tokens_per_second": 1420.785 }, { "epoch": 0.5008547008547009, "grad_norm": 0.08088050782680511, "learning_rate": 0.0001507296137339056, "loss": 0.3627, "num_input_tokens_seen": 1828008, "step": 293, "train_runtime": 1286.3907, "train_tokens_per_second": 1421.036 }, { "epoch": 0.5025641025641026, "grad_norm": 0.07896595448255539, "learning_rate": 0.0001505579399141631, "loss": 0.3942, "num_input_tokens_seen": 1836360, "step": 294, "train_runtime": 1291.5001, "train_tokens_per_second": 1421.881 }, { "epoch": 0.5042735042735043, "grad_norm": 0.09844955801963806, "learning_rate": 0.0001503862660944206, "loss": 0.4604, "num_input_tokens_seen": 1843848, "step": 295, "train_runtime": 1296.2401, "train_tokens_per_second": 1422.459 }, { "epoch": 0.505982905982906, "grad_norm": 0.07079170644283295, "learning_rate": 0.0001502145922746781, "loss": 0.2805, "num_input_tokens_seen": 1851360, "step": 296, "train_runtime": 1300.9484, "train_tokens_per_second": 1423.085 }, { "epoch": 0.5076923076923077, "grad_norm": 0.09218448400497437, "learning_rate": 0.00015004291845493564, "loss": 0.3511, "num_input_tokens_seen": 1855936, "step": 297, "train_runtime": 1304.0647, "train_tokens_per_second": 1423.193 }, { "epoch": 0.5094017094017094, "grad_norm": 0.09190265834331512, "learning_rate": 0.00014987124463519314, "loss": 0.3471, "num_input_tokens_seen": 1863072, "step": 298, "train_runtime": 1308.6096, "train_tokens_per_second": 1423.703 }, { "epoch": 0.5111111111111111, "grad_norm": 0.09502872824668884, "learning_rate": 0.00014969957081545064, "loss": 0.4892, "num_input_tokens_seen": 1869608, "step": 299, "train_runtime": 1312.7245, "train_tokens_per_second": 1424.22 }, { "epoch": 0.5128205128205128, "grad_norm": 0.10176997631788254, "learning_rate": 0.00014952789699570817, "loss": 0.4568, "num_input_tokens_seen": 1875904, "step": 300, "train_runtime": 1316.7069, "train_tokens_per_second": 1424.694 }, { "epoch": 0.5145299145299145, "grad_norm": 0.10159771889448166, "learning_rate": 0.00014935622317596567, "loss": 0.3938, "num_input_tokens_seen": 1880448, "step": 301, "train_runtime": 1321.8403, "train_tokens_per_second": 1422.599 }, { "epoch": 0.5162393162393163, "grad_norm": 0.07759668678045273, "learning_rate": 0.0001491845493562232, "loss": 0.4137, "num_input_tokens_seen": 1888856, "step": 302, "train_runtime": 1327.1569, "train_tokens_per_second": 1423.235 }, { "epoch": 0.517948717948718, "grad_norm": 0.06867683678865433, "learning_rate": 0.00014901287553648068, "loss": 0.3298, "num_input_tokens_seen": 1895272, "step": 303, "train_runtime": 1331.3216, "train_tokens_per_second": 1423.602 }, { "epoch": 0.5196581196581197, "grad_norm": 0.09469713270664215, "learning_rate": 0.0001488412017167382, "loss": 0.3788, "num_input_tokens_seen": 1901800, "step": 304, "train_runtime": 1335.4905, "train_tokens_per_second": 1424.046 }, { "epoch": 0.5213675213675214, "grad_norm": 0.07816332578659058, "learning_rate": 0.0001486695278969957, "loss": 0.428, "num_input_tokens_seen": 1908632, "step": 305, "train_runtime": 1339.8213, "train_tokens_per_second": 1424.542 }, { "epoch": 0.5230769230769231, "grad_norm": 0.08694681525230408, "learning_rate": 0.00014849785407725324, "loss": 0.3145, "num_input_tokens_seen": 1913720, "step": 306, "train_runtime": 1343.2127, "train_tokens_per_second": 1424.733 }, { "epoch": 0.5247863247863248, "grad_norm": 0.053747374564409256, "learning_rate": 0.00014832618025751072, "loss": 0.3026, "num_input_tokens_seen": 1927400, "step": 307, "train_runtime": 1351.386, "train_tokens_per_second": 1426.239 }, { "epoch": 0.5264957264957265, "grad_norm": 0.09011126309633255, "learning_rate": 0.00014815450643776825, "loss": 0.3607, "num_input_tokens_seen": 1933544, "step": 308, "train_runtime": 1355.3093, "train_tokens_per_second": 1426.644 }, { "epoch": 0.5282051282051282, "grad_norm": 0.08776524662971497, "learning_rate": 0.00014798283261802578, "loss": 0.4278, "num_input_tokens_seen": 1938896, "step": 309, "train_runtime": 1358.8461, "train_tokens_per_second": 1426.869 }, { "epoch": 0.5299145299145299, "grad_norm": 0.10794860124588013, "learning_rate": 0.00014781115879828328, "loss": 0.5204, "num_input_tokens_seen": 1945288, "step": 310, "train_runtime": 1363.0326, "train_tokens_per_second": 1427.176 }, { "epoch": 0.5316239316239316, "grad_norm": 0.08652819693088531, "learning_rate": 0.00014763948497854078, "loss": 0.3907, "num_input_tokens_seen": 1951448, "step": 311, "train_runtime": 1366.9784, "train_tokens_per_second": 1427.563 }, { "epoch": 0.5333333333333333, "grad_norm": 0.10126706957817078, "learning_rate": 0.00014746781115879828, "loss": 0.4945, "num_input_tokens_seen": 1956456, "step": 312, "train_runtime": 1370.372, "train_tokens_per_second": 1427.682 }, { "epoch": 0.535042735042735, "grad_norm": 0.10532712191343307, "learning_rate": 0.0001472961373390558, "loss": 0.4276, "num_input_tokens_seen": 1961216, "step": 313, "train_runtime": 1373.4969, "train_tokens_per_second": 1427.9 }, { "epoch": 0.5367521367521367, "grad_norm": 0.09144797176122665, "learning_rate": 0.00014712446351931331, "loss": 0.4097, "num_input_tokens_seen": 1967176, "step": 314, "train_runtime": 1377.3529, "train_tokens_per_second": 1428.229 }, { "epoch": 0.5384615384615384, "grad_norm": 0.07700413465499878, "learning_rate": 0.00014695278969957082, "loss": 0.5064, "num_input_tokens_seen": 1973824, "step": 315, "train_runtime": 1381.6847, "train_tokens_per_second": 1428.563 }, { "epoch": 0.5401709401709401, "grad_norm": 0.10635288059711456, "learning_rate": 0.00014678111587982832, "loss": 0.464, "num_input_tokens_seen": 1978280, "step": 316, "train_runtime": 1384.7125, "train_tokens_per_second": 1428.658 }, { "epoch": 0.5418803418803418, "grad_norm": 0.1100783571600914, "learning_rate": 0.00014660944206008585, "loss": 0.4738, "num_input_tokens_seen": 1984584, "step": 317, "train_runtime": 1388.7531, "train_tokens_per_second": 1429.04 }, { "epoch": 0.5435897435897435, "grad_norm": 0.09916520863771439, "learning_rate": 0.00014643776824034338, "loss": 0.4941, "num_input_tokens_seen": 1990456, "step": 318, "train_runtime": 1392.6048, "train_tokens_per_second": 1429.304 }, { "epoch": 0.5452991452991452, "grad_norm": 0.11754505336284637, "learning_rate": 0.00014626609442060085, "loss": 0.4537, "num_input_tokens_seen": 1996424, "step": 319, "train_runtime": 1396.5367, "train_tokens_per_second": 1429.554 }, { "epoch": 0.5470085470085471, "grad_norm": 0.09356576949357986, "learning_rate": 0.00014609442060085838, "loss": 0.3945, "num_input_tokens_seen": 2002712, "step": 320, "train_runtime": 1400.5323, "train_tokens_per_second": 1429.965 }, { "epoch": 0.5487179487179488, "grad_norm": 0.08926735818386078, "learning_rate": 0.00014592274678111588, "loss": 0.34, "num_input_tokens_seen": 2010392, "step": 321, "train_runtime": 1405.3404, "train_tokens_per_second": 1430.537 }, { "epoch": 0.5504273504273505, "grad_norm": 0.0716586783528328, "learning_rate": 0.00014575107296137341, "loss": 0.3498, "num_input_tokens_seen": 2018112, "step": 322, "train_runtime": 1410.1769, "train_tokens_per_second": 1431.106 }, { "epoch": 0.5521367521367522, "grad_norm": 0.08030697703361511, "learning_rate": 0.0001455793991416309, "loss": 0.4488, "num_input_tokens_seen": 2024360, "step": 323, "train_runtime": 1414.2132, "train_tokens_per_second": 1431.439 }, { "epoch": 0.5538461538461539, "grad_norm": 0.08266004920005798, "learning_rate": 0.00014540772532188842, "loss": 0.3271, "num_input_tokens_seen": 2029784, "step": 324, "train_runtime": 1417.8782, "train_tokens_per_second": 1431.564 }, { "epoch": 0.5555555555555556, "grad_norm": 0.0910225510597229, "learning_rate": 0.00014523605150214592, "loss": 0.3246, "num_input_tokens_seen": 2035024, "step": 325, "train_runtime": 1421.4156, "train_tokens_per_second": 1431.688 }, { "epoch": 0.5572649572649573, "grad_norm": 0.10865269601345062, "learning_rate": 0.00014506437768240345, "loss": 0.4211, "num_input_tokens_seen": 2039312, "step": 326, "train_runtime": 1424.3146, "train_tokens_per_second": 1431.785 }, { "epoch": 0.558974358974359, "grad_norm": 0.0958554595708847, "learning_rate": 0.00014489270386266095, "loss": 0.4778, "num_input_tokens_seen": 2046432, "step": 327, "train_runtime": 1428.8104, "train_tokens_per_second": 1432.263 }, { "epoch": 0.5606837606837607, "grad_norm": 0.09468738734722137, "learning_rate": 0.00014472103004291846, "loss": 0.4299, "num_input_tokens_seen": 2051776, "step": 328, "train_runtime": 1432.395, "train_tokens_per_second": 1432.409 }, { "epoch": 0.5623931623931624, "grad_norm": 0.06919053196907043, "learning_rate": 0.00014454935622317599, "loss": 0.3952, "num_input_tokens_seen": 2057712, "step": 329, "train_runtime": 1436.3095, "train_tokens_per_second": 1432.638 }, { "epoch": 0.5641025641025641, "grad_norm": 0.08503609895706177, "learning_rate": 0.0001443776824034335, "loss": 0.49, "num_input_tokens_seen": 2061968, "step": 330, "train_runtime": 1439.2203, "train_tokens_per_second": 1432.698 }, { "epoch": 0.5658119658119658, "grad_norm": 0.08844102919101715, "learning_rate": 0.000144206008583691, "loss": 0.4348, "num_input_tokens_seen": 2067504, "step": 331, "train_runtime": 1444.8321, "train_tokens_per_second": 1430.965 }, { "epoch": 0.5675213675213675, "grad_norm": 0.08457052707672119, "learning_rate": 0.0001440343347639485, "loss": 0.4158, "num_input_tokens_seen": 2072688, "step": 332, "train_runtime": 1448.2405, "train_tokens_per_second": 1431.177 }, { "epoch": 0.5692307692307692, "grad_norm": 0.08367235213518143, "learning_rate": 0.00014386266094420602, "loss": 0.331, "num_input_tokens_seen": 2077200, "step": 333, "train_runtime": 1451.3343, "train_tokens_per_second": 1431.235 }, { "epoch": 0.5709401709401709, "grad_norm": 0.09541928768157959, "learning_rate": 0.00014369098712446352, "loss": 0.3559, "num_input_tokens_seen": 2081992, "step": 334, "train_runtime": 1454.5461, "train_tokens_per_second": 1431.369 }, { "epoch": 0.5726495726495726, "grad_norm": 0.08940909057855606, "learning_rate": 0.00014351931330472103, "loss": 0.3756, "num_input_tokens_seen": 2087928, "step": 335, "train_runtime": 1458.4391, "train_tokens_per_second": 1431.618 }, { "epoch": 0.5743589743589743, "grad_norm": 0.07144365459680557, "learning_rate": 0.00014334763948497856, "loss": 0.3767, "num_input_tokens_seen": 2096776, "step": 336, "train_runtime": 1463.9741, "train_tokens_per_second": 1432.249 }, { "epoch": 0.576068376068376, "grad_norm": 0.1072118952870369, "learning_rate": 0.00014317596566523606, "loss": 0.4711, "num_input_tokens_seen": 2100736, "step": 337, "train_runtime": 1466.8178, "train_tokens_per_second": 1432.172 }, { "epoch": 0.5777777777777777, "grad_norm": 0.09300663322210312, "learning_rate": 0.0001430042918454936, "loss": 0.3452, "num_input_tokens_seen": 2107160, "step": 338, "train_runtime": 1471.0439, "train_tokens_per_second": 1432.425 }, { "epoch": 0.5794871794871795, "grad_norm": 0.07325253635644913, "learning_rate": 0.00014283261802575106, "loss": 0.4553, "num_input_tokens_seen": 2113784, "step": 339, "train_runtime": 1475.4308, "train_tokens_per_second": 1432.655 }, { "epoch": 0.5811965811965812, "grad_norm": 0.07705891877412796, "learning_rate": 0.0001426609442060086, "loss": 0.3485, "num_input_tokens_seen": 2120384, "step": 340, "train_runtime": 1479.6085, "train_tokens_per_second": 1433.071 }, { "epoch": 0.582905982905983, "grad_norm": 0.08625199645757675, "learning_rate": 0.0001424892703862661, "loss": 0.4506, "num_input_tokens_seen": 2126768, "step": 341, "train_runtime": 1483.7964, "train_tokens_per_second": 1433.329 }, { "epoch": 0.5846153846153846, "grad_norm": 0.0800558477640152, "learning_rate": 0.00014231759656652362, "loss": 0.3653, "num_input_tokens_seen": 2132224, "step": 342, "train_runtime": 1487.3113, "train_tokens_per_second": 1433.61 }, { "epoch": 0.5863247863247864, "grad_norm": 0.08397111296653748, "learning_rate": 0.0001421459227467811, "loss": 0.4463, "num_input_tokens_seen": 2137720, "step": 343, "train_runtime": 1490.9075, "train_tokens_per_second": 1433.838 }, { "epoch": 0.588034188034188, "grad_norm": 0.07987198978662491, "learning_rate": 0.00014197424892703863, "loss": 0.4335, "num_input_tokens_seen": 2143688, "step": 344, "train_runtime": 1494.8312, "train_tokens_per_second": 1434.067 }, { "epoch": 0.5897435897435898, "grad_norm": 0.08058437705039978, "learning_rate": 0.00014180257510729616, "loss": 0.4047, "num_input_tokens_seen": 2149424, "step": 345, "train_runtime": 1498.5271, "train_tokens_per_second": 1434.358 }, { "epoch": 0.5914529914529915, "grad_norm": 0.08178169280290604, "learning_rate": 0.00014163090128755366, "loss": 0.4263, "num_input_tokens_seen": 2154792, "step": 346, "train_runtime": 1502.107, "train_tokens_per_second": 1434.513 }, { "epoch": 0.5931623931623932, "grad_norm": 0.09406203776597977, "learning_rate": 0.00014145922746781116, "loss": 0.3642, "num_input_tokens_seen": 2159888, "step": 347, "train_runtime": 1505.4719, "train_tokens_per_second": 1434.692 }, { "epoch": 0.5948717948717949, "grad_norm": 0.08521080017089844, "learning_rate": 0.00014128755364806867, "loss": 0.4245, "num_input_tokens_seen": 2164880, "step": 348, "train_runtime": 1508.7988, "train_tokens_per_second": 1434.837 }, { "epoch": 0.5965811965811966, "grad_norm": 0.09558600187301636, "learning_rate": 0.0001411158798283262, "loss": 0.5506, "num_input_tokens_seen": 2169712, "step": 349, "train_runtime": 1512.0048, "train_tokens_per_second": 1434.99 }, { "epoch": 0.5982905982905983, "grad_norm": 0.09704317897558212, "learning_rate": 0.0001409442060085837, "loss": 0.4522, "num_input_tokens_seen": 2176688, "step": 350, "train_runtime": 1516.4757, "train_tokens_per_second": 1435.36 }, { "epoch": 0.6, "grad_norm": 0.07796601951122284, "learning_rate": 0.0001407725321888412, "loss": 0.3903, "num_input_tokens_seen": 2182704, "step": 351, "train_runtime": 1520.4129, "train_tokens_per_second": 1435.599 }, { "epoch": 0.6, "eval_loss": 0.39889562129974365, "eval_runtime": 40.1503, "eval_samples_per_second": 24.857, "eval_steps_per_second": 3.113, "num_input_tokens_seen": 2182704, "step": 351 }, { "epoch": 0.6017094017094017, "grad_norm": 0.09079721570014954, "learning_rate": 0.0001406008583690987, "loss": 0.4283, "num_input_tokens_seen": 2188192, "step": 352, "train_runtime": 1564.2922, "train_tokens_per_second": 1398.838 }, { "epoch": 0.6034188034188034, "grad_norm": 0.0738375186920166, "learning_rate": 0.00014042918454935623, "loss": 0.4441, "num_input_tokens_seen": 2196224, "step": 353, "train_runtime": 1569.3087, "train_tokens_per_second": 1399.485 }, { "epoch": 0.6051282051282051, "grad_norm": 0.09894047677516937, "learning_rate": 0.00014025751072961376, "loss": 0.5074, "num_input_tokens_seen": 2200912, "step": 354, "train_runtime": 1572.4562, "train_tokens_per_second": 1399.665 }, { "epoch": 0.6068376068376068, "grad_norm": 0.07697256654500961, "learning_rate": 0.00014008583690987124, "loss": 0.3198, "num_input_tokens_seen": 2206576, "step": 355, "train_runtime": 1576.2927, "train_tokens_per_second": 1399.852 }, { "epoch": 0.6085470085470085, "grad_norm": 0.10991324484348297, "learning_rate": 0.00013991416309012877, "loss": 0.444, "num_input_tokens_seen": 2210776, "step": 356, "train_runtime": 1579.1755, "train_tokens_per_second": 1399.956 }, { "epoch": 0.6102564102564103, "grad_norm": 0.09266971796751022, "learning_rate": 0.00013974248927038627, "loss": 0.3746, "num_input_tokens_seen": 2215184, "step": 357, "train_runtime": 1582.2121, "train_tokens_per_second": 1400.055 }, { "epoch": 0.611965811965812, "grad_norm": 0.07689535617828369, "learning_rate": 0.0001395708154506438, "loss": 0.3114, "num_input_tokens_seen": 2221480, "step": 358, "train_runtime": 1586.3483, "train_tokens_per_second": 1400.373 }, { "epoch": 0.6136752136752137, "grad_norm": 0.09256884455680847, "learning_rate": 0.00013939914163090127, "loss": 0.5355, "num_input_tokens_seen": 2227224, "step": 359, "train_runtime": 1590.0739, "train_tokens_per_second": 1400.705 }, { "epoch": 0.6153846153846154, "grad_norm": 0.10408233106136322, "learning_rate": 0.0001392274678111588, "loss": 0.4115, "num_input_tokens_seen": 2232224, "step": 360, "train_runtime": 1593.3627, "train_tokens_per_second": 1400.952 }, { "epoch": 0.6170940170940171, "grad_norm": 0.0907105803489685, "learning_rate": 0.0001390557939914163, "loss": 0.3445, "num_input_tokens_seen": 2236584, "step": 361, "train_runtime": 1598.5561, "train_tokens_per_second": 1399.128 }, { "epoch": 0.6188034188034188, "grad_norm": 0.0865362212061882, "learning_rate": 0.00013888412017167383, "loss": 0.4831, "num_input_tokens_seen": 2241096, "step": 362, "train_runtime": 1601.6168, "train_tokens_per_second": 1399.271 }, { "epoch": 0.6205128205128205, "grad_norm": 0.09336186200380325, "learning_rate": 0.00013871244635193134, "loss": 0.3674, "num_input_tokens_seen": 2245488, "step": 363, "train_runtime": 1604.583, "train_tokens_per_second": 1399.422 }, { "epoch": 0.6222222222222222, "grad_norm": 0.09631265699863434, "learning_rate": 0.00013854077253218884, "loss": 0.3435, "num_input_tokens_seen": 2250184, "step": 364, "train_runtime": 1607.6918, "train_tokens_per_second": 1399.636 }, { "epoch": 0.6239316239316239, "grad_norm": 0.10324070602655411, "learning_rate": 0.00013836909871244637, "loss": 0.4786, "num_input_tokens_seen": 2255360, "step": 365, "train_runtime": 1611.2468, "train_tokens_per_second": 1399.761 }, { "epoch": 0.6256410256410256, "grad_norm": 0.08939824253320694, "learning_rate": 0.00013819742489270387, "loss": 0.4553, "num_input_tokens_seen": 2261184, "step": 366, "train_runtime": 1615.0109, "train_tokens_per_second": 1400.105 }, { "epoch": 0.6273504273504273, "grad_norm": 0.09298057854175568, "learning_rate": 0.00013802575107296137, "loss": 0.3719, "num_input_tokens_seen": 2267688, "step": 367, "train_runtime": 1619.2073, "train_tokens_per_second": 1400.493 }, { "epoch": 0.629059829059829, "grad_norm": 0.09285794943571091, "learning_rate": 0.00013785407725321888, "loss": 0.3364, "num_input_tokens_seen": 2272200, "step": 368, "train_runtime": 1622.2382, "train_tokens_per_second": 1400.657 }, { "epoch": 0.6307692307692307, "grad_norm": 0.08546578139066696, "learning_rate": 0.0001376824034334764, "loss": 0.3205, "num_input_tokens_seen": 2276488, "step": 369, "train_runtime": 1625.2365, "train_tokens_per_second": 1400.712 }, { "epoch": 0.6324786324786325, "grad_norm": 0.08365242183208466, "learning_rate": 0.0001375107296137339, "loss": 0.3349, "num_input_tokens_seen": 2281184, "step": 370, "train_runtime": 1628.4726, "train_tokens_per_second": 1400.812 }, { "epoch": 0.6341880341880342, "grad_norm": 0.07910430431365967, "learning_rate": 0.0001373390557939914, "loss": 0.3611, "num_input_tokens_seen": 2286696, "step": 371, "train_runtime": 1632.1432, "train_tokens_per_second": 1401.039 }, { "epoch": 0.6358974358974359, "grad_norm": 0.0918528288602829, "learning_rate": 0.00013716738197424894, "loss": 0.5565, "num_input_tokens_seen": 2291648, "step": 372, "train_runtime": 1635.5649, "train_tokens_per_second": 1401.136 }, { "epoch": 0.6376068376068376, "grad_norm": 0.07989461719989777, "learning_rate": 0.00013699570815450644, "loss": 0.4643, "num_input_tokens_seen": 2298904, "step": 373, "train_runtime": 1640.2116, "train_tokens_per_second": 1401.59 }, { "epoch": 0.6393162393162393, "grad_norm": 0.09709218889474869, "learning_rate": 0.00013682403433476397, "loss": 0.2924, "num_input_tokens_seen": 2304656, "step": 374, "train_runtime": 1644.0348, "train_tokens_per_second": 1401.829 }, { "epoch": 0.6410256410256411, "grad_norm": 0.08683669567108154, "learning_rate": 0.00013665236051502147, "loss": 0.399, "num_input_tokens_seen": 2309560, "step": 375, "train_runtime": 1647.3687, "train_tokens_per_second": 1401.969 }, { "epoch": 0.6427350427350428, "grad_norm": 0.09597049653530121, "learning_rate": 0.00013648068669527898, "loss": 0.4146, "num_input_tokens_seen": 2314304, "step": 376, "train_runtime": 1650.5219, "train_tokens_per_second": 1402.165 }, { "epoch": 0.6444444444444445, "grad_norm": 0.10446120798587799, "learning_rate": 0.00013630901287553648, "loss": 0.4616, "num_input_tokens_seen": 2319912, "step": 377, "train_runtime": 1654.2418, "train_tokens_per_second": 1402.402 }, { "epoch": 0.6461538461538462, "grad_norm": 0.10042799264192581, "learning_rate": 0.000136137339055794, "loss": 0.4273, "num_input_tokens_seen": 2324896, "step": 378, "train_runtime": 1657.6904, "train_tokens_per_second": 1402.491 }, { "epoch": 0.6478632478632479, "grad_norm": 0.09080878645181656, "learning_rate": 0.0001359656652360515, "loss": 0.371, "num_input_tokens_seen": 2329696, "step": 379, "train_runtime": 1660.9598, "train_tokens_per_second": 1402.62 }, { "epoch": 0.6495726495726496, "grad_norm": 0.09960087388753891, "learning_rate": 0.000135793991416309, "loss": 0.478, "num_input_tokens_seen": 2335952, "step": 380, "train_runtime": 1665.0537, "train_tokens_per_second": 1402.929 }, { "epoch": 0.6512820512820513, "grad_norm": 0.09628906100988388, "learning_rate": 0.00013562231759656654, "loss": 0.5056, "num_input_tokens_seen": 2341424, "step": 381, "train_runtime": 1668.6974, "train_tokens_per_second": 1403.145 }, { "epoch": 0.652991452991453, "grad_norm": 0.09442561119794846, "learning_rate": 0.00013545064377682404, "loss": 0.4214, "num_input_tokens_seen": 2346280, "step": 382, "train_runtime": 1671.9888, "train_tokens_per_second": 1403.287 }, { "epoch": 0.6547008547008547, "grad_norm": 0.08291413635015488, "learning_rate": 0.00013527896995708155, "loss": 0.3663, "num_input_tokens_seen": 2351856, "step": 383, "train_runtime": 1675.6596, "train_tokens_per_second": 1403.54 }, { "epoch": 0.6564102564102564, "grad_norm": 0.08272901922464371, "learning_rate": 0.00013510729613733905, "loss": 0.4371, "num_input_tokens_seen": 2358488, "step": 384, "train_runtime": 1679.9498, "train_tokens_per_second": 1403.904 }, { "epoch": 0.6581196581196581, "grad_norm": 0.09740111231803894, "learning_rate": 0.00013493562231759658, "loss": 0.4235, "num_input_tokens_seen": 2363344, "step": 385, "train_runtime": 1683.3637, "train_tokens_per_second": 1403.941 }, { "epoch": 0.6598290598290598, "grad_norm": 0.10885223746299744, "learning_rate": 0.00013476394849785408, "loss": 0.5086, "num_input_tokens_seen": 2369912, "step": 386, "train_runtime": 1687.682, "train_tokens_per_second": 1404.241 }, { "epoch": 0.6615384615384615, "grad_norm": 0.08678839355707169, "learning_rate": 0.00013459227467811158, "loss": 0.2697, "num_input_tokens_seen": 2374184, "step": 387, "train_runtime": 1690.6282, "train_tokens_per_second": 1404.321 }, { "epoch": 0.6632478632478632, "grad_norm": 0.08202622830867767, "learning_rate": 0.00013442060085836909, "loss": 0.4109, "num_input_tokens_seen": 2379040, "step": 388, "train_runtime": 1693.9423, "train_tokens_per_second": 1404.44 }, { "epoch": 0.6649572649572649, "grad_norm": 0.08018656075000763, "learning_rate": 0.00013424892703862662, "loss": 0.4139, "num_input_tokens_seen": 2387224, "step": 389, "train_runtime": 1699.0756, "train_tokens_per_second": 1405.013 }, { "epoch": 0.6666666666666666, "grad_norm": 0.08134426176548004, "learning_rate": 0.00013407725321888414, "loss": 0.4374, "num_input_tokens_seen": 2392080, "step": 390, "train_runtime": 1702.3937, "train_tokens_per_second": 1405.127 }, { "epoch": 0.6683760683760683, "grad_norm": 0.07251180708408356, "learning_rate": 0.00013390557939914165, "loss": 0.3994, "num_input_tokens_seen": 2398128, "step": 391, "train_runtime": 1708.3925, "train_tokens_per_second": 1403.734 }, { "epoch": 0.67008547008547, "grad_norm": 0.08818169683218002, "learning_rate": 0.00013373390557939915, "loss": 0.4005, "num_input_tokens_seen": 2404440, "step": 392, "train_runtime": 1712.4305, "train_tokens_per_second": 1404.11 }, { "epoch": 0.6717948717948717, "grad_norm": 0.0823337659239769, "learning_rate": 0.00013356223175965665, "loss": 0.3136, "num_input_tokens_seen": 2412128, "step": 393, "train_runtime": 1717.3418, "train_tokens_per_second": 1404.571 }, { "epoch": 0.6735042735042736, "grad_norm": 0.09980267286300659, "learning_rate": 0.00013339055793991418, "loss": 0.4452, "num_input_tokens_seen": 2416536, "step": 394, "train_runtime": 1720.4905, "train_tokens_per_second": 1404.562 }, { "epoch": 0.6752136752136753, "grad_norm": 0.08660242706537247, "learning_rate": 0.00013321888412017168, "loss": 0.4983, "num_input_tokens_seen": 2421080, "step": 395, "train_runtime": 1723.5853, "train_tokens_per_second": 1404.677 }, { "epoch": 0.676923076923077, "grad_norm": 0.10475271195173264, "learning_rate": 0.00013304721030042919, "loss": 0.4383, "num_input_tokens_seen": 2427376, "step": 396, "train_runtime": 1727.6892, "train_tokens_per_second": 1404.984 }, { "epoch": 0.6786324786324787, "grad_norm": 0.08192956447601318, "learning_rate": 0.0001328755364806867, "loss": 0.3392, "num_input_tokens_seen": 2435120, "step": 397, "train_runtime": 1732.6657, "train_tokens_per_second": 1405.418 }, { "epoch": 0.6803418803418804, "grad_norm": 0.07553105801343918, "learning_rate": 0.00013270386266094422, "loss": 0.383, "num_input_tokens_seen": 2442576, "step": 398, "train_runtime": 1737.418, "train_tokens_per_second": 1405.866 }, { "epoch": 0.6820512820512821, "grad_norm": 0.1032620221376419, "learning_rate": 0.00013253218884120172, "loss": 0.4186, "num_input_tokens_seen": 2448784, "step": 399, "train_runtime": 1741.4935, "train_tokens_per_second": 1406.14 }, { "epoch": 0.6837606837606838, "grad_norm": 0.10456489771604538, "learning_rate": 0.00013236051502145922, "loss": 0.4697, "num_input_tokens_seen": 2455504, "step": 400, "train_runtime": 1745.7367, "train_tokens_per_second": 1406.572 }, { "epoch": 0.6854700854700855, "grad_norm": 0.09265512973070145, "learning_rate": 0.00013218884120171675, "loss": 0.4487, "num_input_tokens_seen": 2461560, "step": 401, "train_runtime": 1749.5632, "train_tokens_per_second": 1406.957 }, { "epoch": 0.6871794871794872, "grad_norm": 0.07256102561950684, "learning_rate": 0.00013201716738197425, "loss": 0.3153, "num_input_tokens_seen": 2468800, "step": 402, "train_runtime": 1754.2231, "train_tokens_per_second": 1407.347 }, { "epoch": 0.6888888888888889, "grad_norm": 0.07364867627620697, "learning_rate": 0.00013184549356223176, "loss": 0.3433, "num_input_tokens_seen": 2477720, "step": 403, "train_runtime": 1759.7128, "train_tokens_per_second": 1408.025 }, { "epoch": 0.6905982905982906, "grad_norm": 0.08628483861684799, "learning_rate": 0.00013167381974248926, "loss": 0.3985, "num_input_tokens_seen": 2486192, "step": 404, "train_runtime": 1765.0347, "train_tokens_per_second": 1408.58 }, { "epoch": 0.6923076923076923, "grad_norm": 0.08556502312421799, "learning_rate": 0.0001315021459227468, "loss": 0.3041, "num_input_tokens_seen": 2492480, "step": 405, "train_runtime": 1769.0985, "train_tokens_per_second": 1408.898 }, { "epoch": 0.694017094017094, "grad_norm": 0.10038785636425018, "learning_rate": 0.0001313304721030043, "loss": 0.9755, "num_input_tokens_seen": 2498112, "step": 406, "train_runtime": 1772.8297, "train_tokens_per_second": 1409.11 }, { "epoch": 0.6957264957264957, "grad_norm": 0.09080588072538376, "learning_rate": 0.00013115879828326182, "loss": 0.3674, "num_input_tokens_seen": 2502984, "step": 407, "train_runtime": 1776.2479, "train_tokens_per_second": 1409.141 }, { "epoch": 0.6974358974358974, "grad_norm": 0.08220319449901581, "learning_rate": 0.00013098712446351932, "loss": 0.3126, "num_input_tokens_seen": 2507112, "step": 408, "train_runtime": 1779.1809, "train_tokens_per_second": 1409.138 }, { "epoch": 0.6991452991452991, "grad_norm": 0.11195231974124908, "learning_rate": 0.00013081545064377683, "loss": 0.3934, "num_input_tokens_seen": 2515928, "step": 409, "train_runtime": 1784.7765, "train_tokens_per_second": 1409.66 }, { "epoch": 0.7008547008547008, "grad_norm": 0.09571472555398941, "learning_rate": 0.00013064377682403435, "loss": 0.3706, "num_input_tokens_seen": 2521944, "step": 410, "train_runtime": 1788.7202, "train_tokens_per_second": 1409.915 }, { "epoch": 0.7025641025641025, "grad_norm": 0.09179401397705078, "learning_rate": 0.00013047210300429186, "loss": 0.2979, "num_input_tokens_seen": 2526848, "step": 411, "train_runtime": 1792.0136, "train_tokens_per_second": 1410.061 }, { "epoch": 0.7042735042735043, "grad_norm": 0.09440741688013077, "learning_rate": 0.00013030042918454936, "loss": 0.5097, "num_input_tokens_seen": 2533784, "step": 412, "train_runtime": 1796.3941, "train_tokens_per_second": 1410.483 }, { "epoch": 0.705982905982906, "grad_norm": 0.11012144386768341, "learning_rate": 0.00013012875536480686, "loss": 0.385, "num_input_tokens_seen": 2538112, "step": 413, "train_runtime": 1799.4714, "train_tokens_per_second": 1410.476 }, { "epoch": 0.7076923076923077, "grad_norm": 0.08006038516759872, "learning_rate": 0.0001299570815450644, "loss": 0.4715, "num_input_tokens_seen": 2544952, "step": 414, "train_runtime": 1803.9087, "train_tokens_per_second": 1410.799 }, { "epoch": 0.7094017094017094, "grad_norm": 0.0850716233253479, "learning_rate": 0.0001297854077253219, "loss": 0.3632, "num_input_tokens_seen": 2550800, "step": 415, "train_runtime": 1807.7422, "train_tokens_per_second": 1411.042 }, { "epoch": 0.7111111111111111, "grad_norm": 0.08932614326477051, "learning_rate": 0.0001296137339055794, "loss": 0.4279, "num_input_tokens_seen": 2557144, "step": 416, "train_runtime": 1811.9042, "train_tokens_per_second": 1411.302 }, { "epoch": 0.7128205128205128, "grad_norm": 0.08836366981267929, "learning_rate": 0.00012944206008583693, "loss": 0.404, "num_input_tokens_seen": 2562936, "step": 417, "train_runtime": 1815.6127, "train_tokens_per_second": 1411.609 }, { "epoch": 0.7145299145299145, "grad_norm": 0.08833774924278259, "learning_rate": 0.00012927038626609443, "loss": 0.4296, "num_input_tokens_seen": 2567728, "step": 418, "train_runtime": 1818.8812, "train_tokens_per_second": 1411.707 }, { "epoch": 0.7162393162393162, "grad_norm": 0.0948844775557518, "learning_rate": 0.00012909871244635193, "loss": 0.398, "num_input_tokens_seen": 2573784, "step": 419, "train_runtime": 1822.8202, "train_tokens_per_second": 1411.979 }, { "epoch": 0.717948717948718, "grad_norm": 0.08557496964931488, "learning_rate": 0.00012892703862660943, "loss": 0.4048, "num_input_tokens_seen": 2580104, "step": 420, "train_runtime": 1826.9724, "train_tokens_per_second": 1412.229 }, { "epoch": 0.7196581196581197, "grad_norm": 0.10961645841598511, "learning_rate": 0.00012875536480686696, "loss": 0.3888, "num_input_tokens_seen": 2586304, "step": 421, "train_runtime": 1833.0299, "train_tokens_per_second": 1410.945 }, { "epoch": 0.7213675213675214, "grad_norm": 0.09428433328866959, "learning_rate": 0.00012858369098712446, "loss": 0.3787, "num_input_tokens_seen": 2591328, "step": 422, "train_runtime": 1836.3708, "train_tokens_per_second": 1411.114 }, { "epoch": 0.7230769230769231, "grad_norm": 0.07983230799436569, "learning_rate": 0.000128412017167382, "loss": 0.4333, "num_input_tokens_seen": 2597392, "step": 423, "train_runtime": 1840.3075, "train_tokens_per_second": 1411.39 }, { "epoch": 0.7247863247863248, "grad_norm": 0.09758428484201431, "learning_rate": 0.0001282403433476395, "loss": 0.4846, "num_input_tokens_seen": 2603632, "step": 424, "train_runtime": 1844.4191, "train_tokens_per_second": 1411.627 }, { "epoch": 0.7264957264957265, "grad_norm": 0.11297962069511414, "learning_rate": 0.000128068669527897, "loss": 0.4252, "num_input_tokens_seen": 2609304, "step": 425, "train_runtime": 1848.0395, "train_tokens_per_second": 1411.931 }, { "epoch": 0.7282051282051282, "grad_norm": 0.10584045201539993, "learning_rate": 0.00012789699570815453, "loss": 0.3543, "num_input_tokens_seen": 2613512, "step": 426, "train_runtime": 1850.9158, "train_tokens_per_second": 1412.01 }, { "epoch": 0.7299145299145299, "grad_norm": 0.10154668241739273, "learning_rate": 0.00012772532188841203, "loss": 0.546, "num_input_tokens_seen": 2618824, "step": 427, "train_runtime": 1854.4991, "train_tokens_per_second": 1412.146 }, { "epoch": 0.7316239316239316, "grad_norm": 0.10194077342748642, "learning_rate": 0.00012755364806866953, "loss": 0.4355, "num_input_tokens_seen": 2626440, "step": 428, "train_runtime": 1859.1535, "train_tokens_per_second": 1412.707 }, { "epoch": 0.7333333333333333, "grad_norm": 0.059250883758068085, "learning_rate": 0.00012738197424892704, "loss": 0.3542, "num_input_tokens_seen": 2640696, "step": 429, "train_runtime": 1867.9636, "train_tokens_per_second": 1413.676 }, { "epoch": 0.7350427350427351, "grad_norm": 0.09271879494190216, "learning_rate": 0.00012721030042918456, "loss": 0.3714, "num_input_tokens_seen": 2645552, "step": 430, "train_runtime": 1871.1549, "train_tokens_per_second": 1413.861 }, { "epoch": 0.7367521367521368, "grad_norm": 0.10251565277576447, "learning_rate": 0.00012703862660944207, "loss": 0.402, "num_input_tokens_seen": 2650008, "step": 431, "train_runtime": 1874.2478, "train_tokens_per_second": 1413.905 }, { "epoch": 0.7384615384615385, "grad_norm": 0.08104413002729416, "learning_rate": 0.00012686695278969957, "loss": 0.3586, "num_input_tokens_seen": 2657184, "step": 432, "train_runtime": 1878.7478, "train_tokens_per_second": 1414.338 }, { "epoch": 0.7401709401709402, "grad_norm": 0.08250881731510162, "learning_rate": 0.0001266952789699571, "loss": 0.4122, "num_input_tokens_seen": 2662408, "step": 433, "train_runtime": 1882.2806, "train_tokens_per_second": 1414.459 }, { "epoch": 0.7418803418803419, "grad_norm": 0.08179739117622375, "learning_rate": 0.0001265236051502146, "loss": 0.3988, "num_input_tokens_seen": 2668632, "step": 434, "train_runtime": 1886.2827, "train_tokens_per_second": 1414.757 }, { "epoch": 0.7435897435897436, "grad_norm": 0.09739404171705246, "learning_rate": 0.00012635193133047213, "loss": 0.4507, "num_input_tokens_seen": 2675376, "step": 435, "train_runtime": 1890.5915, "train_tokens_per_second": 1415.1 }, { "epoch": 0.7452991452991453, "grad_norm": 0.08292689919471741, "learning_rate": 0.0001261802575107296, "loss": 0.344, "num_input_tokens_seen": 2681072, "step": 436, "train_runtime": 1894.2808, "train_tokens_per_second": 1415.351 }, { "epoch": 0.747008547008547, "grad_norm": 0.10009622573852539, "learning_rate": 0.00012600858369098714, "loss": 0.4121, "num_input_tokens_seen": 2687664, "step": 437, "train_runtime": 1898.7144, "train_tokens_per_second": 1415.518 }, { "epoch": 0.7487179487179487, "grad_norm": 0.08162456750869751, "learning_rate": 0.00012583690987124464, "loss": 0.38, "num_input_tokens_seen": 2692888, "step": 438, "train_runtime": 1902.2857, "train_tokens_per_second": 1415.607 }, { "epoch": 0.7504273504273504, "grad_norm": 0.10055331140756607, "learning_rate": 0.00012566523605150217, "loss": 0.5579, "num_input_tokens_seen": 2698192, "step": 439, "train_runtime": 1905.8783, "train_tokens_per_second": 1415.721 }, { "epoch": 0.7521367521367521, "grad_norm": 0.08599859476089478, "learning_rate": 0.00012549356223175964, "loss": 0.4105, "num_input_tokens_seen": 2706400, "step": 440, "train_runtime": 1911.01, "train_tokens_per_second": 1416.214 }, { "epoch": 0.7538461538461538, "grad_norm": 0.10321099311113358, "learning_rate": 0.00012532188841201717, "loss": 0.5507, "num_input_tokens_seen": 2711248, "step": 441, "train_runtime": 1914.2832, "train_tokens_per_second": 1416.325 }, { "epoch": 0.7555555555555555, "grad_norm": 0.08138895779848099, "learning_rate": 0.0001251502145922747, "loss": 0.3421, "num_input_tokens_seen": 2717984, "step": 442, "train_runtime": 1918.6058, "train_tokens_per_second": 1416.645 }, { "epoch": 0.7572649572649572, "grad_norm": 0.09042924642562866, "learning_rate": 0.0001249785407725322, "loss": 0.4009, "num_input_tokens_seen": 2724304, "step": 443, "train_runtime": 1922.6265, "train_tokens_per_second": 1416.97 }, { "epoch": 0.7589743589743589, "grad_norm": 0.08353422582149506, "learning_rate": 0.0001248068669527897, "loss": 0.5339, "num_input_tokens_seen": 2730536, "step": 444, "train_runtime": 1926.6415, "train_tokens_per_second": 1417.252 }, { "epoch": 0.7606837606837606, "grad_norm": 0.08057735860347748, "learning_rate": 0.0001246351931330472, "loss": 0.2139, "num_input_tokens_seen": 2739592, "step": 445, "train_runtime": 1932.3746, "train_tokens_per_second": 1417.733 }, { "epoch": 0.7623931623931623, "grad_norm": 0.08368086814880371, "learning_rate": 0.00012446351931330474, "loss": 0.4547, "num_input_tokens_seen": 2746472, "step": 446, "train_runtime": 1936.8148, "train_tokens_per_second": 1418.035 }, { "epoch": 0.764102564102564, "grad_norm": 0.09206908941268921, "learning_rate": 0.00012429184549356224, "loss": 0.364, "num_input_tokens_seen": 2752544, "step": 447, "train_runtime": 1940.8003, "train_tokens_per_second": 1418.252 }, { "epoch": 0.7658119658119659, "grad_norm": 0.09689074009656906, "learning_rate": 0.00012412017167381974, "loss": 0.3698, "num_input_tokens_seen": 2756232, "step": 448, "train_runtime": 1943.3995, "train_tokens_per_second": 1418.253 }, { "epoch": 0.7675213675213676, "grad_norm": 0.11510168761014938, "learning_rate": 0.00012394849785407725, "loss": 0.4782, "num_input_tokens_seen": 2763704, "step": 449, "train_runtime": 1948.0738, "train_tokens_per_second": 1418.685 }, { "epoch": 0.7692307692307693, "grad_norm": 0.10438208281993866, "learning_rate": 0.00012377682403433477, "loss": 0.4068, "num_input_tokens_seen": 2771048, "step": 450, "train_runtime": 1952.7876, "train_tokens_per_second": 1419.022 }, { "epoch": 0.770940170940171, "grad_norm": 0.09076783806085587, "learning_rate": 0.0001236051502145923, "loss": 0.4336, "num_input_tokens_seen": 2776848, "step": 451, "train_runtime": 1958.6056, "train_tokens_per_second": 1417.768 }, { "epoch": 0.7726495726495727, "grad_norm": 0.09839843213558197, "learning_rate": 0.00012343347639484978, "loss": 0.4169, "num_input_tokens_seen": 2781392, "step": 452, "train_runtime": 1961.7188, "train_tokens_per_second": 1417.834 }, { "epoch": 0.7743589743589744, "grad_norm": 0.11131442338228226, "learning_rate": 0.0001232618025751073, "loss": 0.3881, "num_input_tokens_seen": 2785736, "step": 453, "train_runtime": 1964.6246, "train_tokens_per_second": 1417.948 }, { "epoch": 0.7760683760683761, "grad_norm": 0.09070441126823425, "learning_rate": 0.0001230901287553648, "loss": 0.399, "num_input_tokens_seen": 2790968, "step": 454, "train_runtime": 1968.1511, "train_tokens_per_second": 1418.066 }, { "epoch": 0.7777777777777778, "grad_norm": 0.09357093274593353, "learning_rate": 0.00012291845493562234, "loss": 0.4989, "num_input_tokens_seen": 2795968, "step": 455, "train_runtime": 1971.5124, "train_tokens_per_second": 1418.184 }, { "epoch": 0.7794871794871795, "grad_norm": 0.08152603358030319, "learning_rate": 0.00012274678111587982, "loss": 0.397, "num_input_tokens_seen": 2801968, "step": 456, "train_runtime": 1975.4058, "train_tokens_per_second": 1418.427 }, { "epoch": 0.7811965811965812, "grad_norm": 0.08832139521837234, "learning_rate": 0.00012257510729613735, "loss": 0.4593, "num_input_tokens_seen": 2806896, "step": 457, "train_runtime": 1978.6286, "train_tokens_per_second": 1418.607 }, { "epoch": 0.7829059829059829, "grad_norm": 0.09871666878461838, "learning_rate": 0.00012240343347639485, "loss": 0.5688, "num_input_tokens_seen": 2811904, "step": 458, "train_runtime": 1981.985, "train_tokens_per_second": 1418.731 }, { "epoch": 0.7846153846153846, "grad_norm": 0.08846089243888855, "learning_rate": 0.00012223175965665238, "loss": 0.3872, "num_input_tokens_seen": 2817760, "step": 459, "train_runtime": 1985.7982, "train_tokens_per_second": 1418.956 }, { "epoch": 0.7863247863247863, "grad_norm": 0.07381941378116608, "learning_rate": 0.0001220600858369099, "loss": 0.397, "num_input_tokens_seen": 2828936, "step": 460, "train_runtime": 1992.6291, "train_tokens_per_second": 1419.7 }, { "epoch": 0.788034188034188, "grad_norm": 0.0786755383014679, "learning_rate": 0.00012188841201716738, "loss": 0.3676, "num_input_tokens_seen": 2834352, "step": 461, "train_runtime": 1996.1137, "train_tokens_per_second": 1419.935 }, { "epoch": 0.7897435897435897, "grad_norm": 0.09888231754302979, "learning_rate": 0.00012171673819742491, "loss": 0.6124, "num_input_tokens_seen": 2839672, "step": 462, "train_runtime": 1999.6256, "train_tokens_per_second": 1420.102 }, { "epoch": 0.7914529914529914, "grad_norm": 0.07366322726011276, "learning_rate": 0.0001215450643776824, "loss": 0.3307, "num_input_tokens_seen": 2845376, "step": 463, "train_runtime": 2003.3598, "train_tokens_per_second": 1420.302 }, { "epoch": 0.7931623931623931, "grad_norm": 0.10405825823545456, "learning_rate": 0.00012137339055793993, "loss": 0.5077, "num_input_tokens_seen": 2850056, "step": 464, "train_runtime": 2006.5829, "train_tokens_per_second": 1420.353 }, { "epoch": 0.7948717948717948, "grad_norm": 0.0754900574684143, "learning_rate": 0.00012120171673819742, "loss": 0.2874, "num_input_tokens_seen": 2856648, "step": 465, "train_runtime": 2010.8653, "train_tokens_per_second": 1420.606 }, { "epoch": 0.7965811965811965, "grad_norm": 0.08353781700134277, "learning_rate": 0.00012103004291845495, "loss": 0.3667, "num_input_tokens_seen": 2862632, "step": 466, "train_runtime": 2014.8034, "train_tokens_per_second": 1420.8 }, { "epoch": 0.7982905982905983, "grad_norm": 0.07881499826908112, "learning_rate": 0.00012085836909871244, "loss": 0.6024, "num_input_tokens_seen": 2870288, "step": 467, "train_runtime": 2019.6398, "train_tokens_per_second": 1421.188 }, { "epoch": 0.8, "grad_norm": 0.08371937274932861, "learning_rate": 0.00012068669527896997, "loss": 0.3757, "num_input_tokens_seen": 2876552, "step": 468, "train_runtime": 2023.5632, "train_tokens_per_second": 1421.528 }, { "epoch": 0.8, "eval_loss": 0.3975943326950073, "eval_runtime": 40.2348, "eval_samples_per_second": 24.804, "eval_steps_per_second": 3.107, "num_input_tokens_seen": 2876552, "step": 468 }, { "epoch": 0.8017094017094017, "grad_norm": 0.09587102383375168, "learning_rate": 0.00012051502145922748, "loss": 0.4033, "num_input_tokens_seen": 2880952, "step": 469, "train_runtime": 2066.7148, "train_tokens_per_second": 1393.977 }, { "epoch": 0.8034188034188035, "grad_norm": 0.07546790689229965, "learning_rate": 0.00012034334763948498, "loss": 0.295, "num_input_tokens_seen": 2888184, "step": 470, "train_runtime": 2071.1851, "train_tokens_per_second": 1394.46 }, { "epoch": 0.8051282051282052, "grad_norm": 0.10362780094146729, "learning_rate": 0.0001201716738197425, "loss": 0.3668, "num_input_tokens_seen": 2899416, "step": 471, "train_runtime": 2078.0557, "train_tokens_per_second": 1395.254 }, { "epoch": 0.8068376068376069, "grad_norm": 0.07979272305965424, "learning_rate": 0.00012, "loss": 0.3491, "num_input_tokens_seen": 2904592, "step": 472, "train_runtime": 2081.4118, "train_tokens_per_second": 1395.491 }, { "epoch": 0.8085470085470086, "grad_norm": 0.08196493983268738, "learning_rate": 0.00011982832618025752, "loss": 0.3491, "num_input_tokens_seen": 2909616, "step": 473, "train_runtime": 2084.8475, "train_tokens_per_second": 1395.601 }, { "epoch": 0.8102564102564103, "grad_norm": 0.10573233664035797, "learning_rate": 0.00011965665236051502, "loss": 0.4396, "num_input_tokens_seen": 2913824, "step": 474, "train_runtime": 2087.7209, "train_tokens_per_second": 1395.696 }, { "epoch": 0.811965811965812, "grad_norm": 0.11220520734786987, "learning_rate": 0.00011948497854077254, "loss": 0.4309, "num_input_tokens_seen": 2920208, "step": 475, "train_runtime": 2091.7609, "train_tokens_per_second": 1396.052 }, { "epoch": 0.8136752136752137, "grad_norm": 0.07423815131187439, "learning_rate": 0.00011931330472103004, "loss": 0.338, "num_input_tokens_seen": 2926144, "step": 476, "train_runtime": 2095.6855, "train_tokens_per_second": 1396.271 }, { "epoch": 0.8153846153846154, "grad_norm": 0.07826936990022659, "learning_rate": 0.00011914163090128756, "loss": 0.3758, "num_input_tokens_seen": 2933112, "step": 477, "train_runtime": 2100.1257, "train_tokens_per_second": 1396.636 }, { "epoch": 0.8170940170940171, "grad_norm": 0.10059487074613571, "learning_rate": 0.00011896995708154509, "loss": 0.4095, "num_input_tokens_seen": 2940512, "step": 478, "train_runtime": 2104.7295, "train_tokens_per_second": 1397.097 }, { "epoch": 0.8188034188034188, "grad_norm": 0.10775360465049744, "learning_rate": 0.00011879828326180257, "loss": 0.4641, "num_input_tokens_seen": 2946016, "step": 479, "train_runtime": 2108.2514, "train_tokens_per_second": 1397.374 }, { "epoch": 0.8205128205128205, "grad_norm": 0.08371871709823608, "learning_rate": 0.0001186266094420601, "loss": 0.4006, "num_input_tokens_seen": 2950256, "step": 480, "train_runtime": 2111.2163, "train_tokens_per_second": 1397.42 }, { "epoch": 0.8222222222222222, "grad_norm": 0.09858489036560059, "learning_rate": 0.00011845493562231759, "loss": 0.4827, "num_input_tokens_seen": 2954528, "step": 481, "train_runtime": 2116.2112, "train_tokens_per_second": 1396.14 }, { "epoch": 0.8239316239316239, "grad_norm": 0.10172171145677567, "learning_rate": 0.00011828326180257512, "loss": 0.4265, "num_input_tokens_seen": 2959568, "step": 482, "train_runtime": 2119.6177, "train_tokens_per_second": 1396.274 }, { "epoch": 0.8256410256410256, "grad_norm": 0.07476787269115448, "learning_rate": 0.00011811158798283261, "loss": 0.426, "num_input_tokens_seen": 2969808, "step": 483, "train_runtime": 2125.8709, "train_tokens_per_second": 1396.984 }, { "epoch": 0.8273504273504273, "grad_norm": 0.1218891367316246, "learning_rate": 0.00011793991416309014, "loss": 0.4376, "num_input_tokens_seen": 2975584, "step": 484, "train_runtime": 2129.7262, "train_tokens_per_second": 1397.167 }, { "epoch": 0.8290598290598291, "grad_norm": 0.09157467633485794, "learning_rate": 0.00011776824034334764, "loss": 0.4647, "num_input_tokens_seen": 2983568, "step": 485, "train_runtime": 2134.8436, "train_tokens_per_second": 1397.558 }, { "epoch": 0.8307692307692308, "grad_norm": 0.08052816987037659, "learning_rate": 0.00011759656652360516, "loss": 0.34, "num_input_tokens_seen": 2990136, "step": 486, "train_runtime": 2139.0965, "train_tokens_per_second": 1397.85 }, { "epoch": 0.8324786324786325, "grad_norm": 0.09681648761034012, "learning_rate": 0.00011742489270386267, "loss": 0.5222, "num_input_tokens_seen": 2995648, "step": 487, "train_runtime": 2142.6907, "train_tokens_per_second": 1398.078 }, { "epoch": 0.8341880341880342, "grad_norm": 0.09712634235620499, "learning_rate": 0.00011725321888412018, "loss": 0.4272, "num_input_tokens_seen": 2999936, "step": 488, "train_runtime": 2145.6273, "train_tokens_per_second": 1398.163 }, { "epoch": 0.8358974358974359, "grad_norm": 0.08245320618152618, "learning_rate": 0.00011708154506437769, "loss": 0.4377, "num_input_tokens_seen": 3006392, "step": 489, "train_runtime": 2149.8266, "train_tokens_per_second": 1398.435 }, { "epoch": 0.8376068376068376, "grad_norm": 0.09992548078298569, "learning_rate": 0.0001169098712446352, "loss": 0.4934, "num_input_tokens_seen": 3012312, "step": 490, "train_runtime": 2153.6393, "train_tokens_per_second": 1398.708 }, { "epoch": 0.8393162393162393, "grad_norm": 0.08246449381113052, "learning_rate": 0.00011673819742489271, "loss": 0.4387, "num_input_tokens_seen": 3019104, "step": 491, "train_runtime": 2158.108, "train_tokens_per_second": 1398.959 }, { "epoch": 0.841025641025641, "grad_norm": 0.08337292075157166, "learning_rate": 0.00011656652360515021, "loss": 0.4912, "num_input_tokens_seen": 3025664, "step": 492, "train_runtime": 2162.3996, "train_tokens_per_second": 1399.216 }, { "epoch": 0.8427350427350427, "grad_norm": 0.06182870268821716, "learning_rate": 0.00011639484978540773, "loss": 0.3326, "num_input_tokens_seen": 3033776, "step": 493, "train_runtime": 2167.5232, "train_tokens_per_second": 1399.651 }, { "epoch": 0.8444444444444444, "grad_norm": 0.09150062501430511, "learning_rate": 0.00011622317596566523, "loss": 0.4187, "num_input_tokens_seen": 3038744, "step": 494, "train_runtime": 2170.893, "train_tokens_per_second": 1399.767 }, { "epoch": 0.8461538461538461, "grad_norm": 0.06586892902851105, "learning_rate": 0.00011605150214592275, "loss": 0.271, "num_input_tokens_seen": 3046920, "step": 495, "train_runtime": 2176.1904, "train_tokens_per_second": 1400.116 }, { "epoch": 0.8478632478632478, "grad_norm": 0.0771869495511055, "learning_rate": 0.00011587982832618028, "loss": 0.3341, "num_input_tokens_seen": 3057816, "step": 496, "train_runtime": 2182.8707, "train_tokens_per_second": 1400.823 }, { "epoch": 0.8495726495726496, "grad_norm": 0.07207699120044708, "learning_rate": 0.00011570815450643777, "loss": 0.3464, "num_input_tokens_seen": 3064472, "step": 497, "train_runtime": 2187.2355, "train_tokens_per_second": 1401.071 }, { "epoch": 0.8512820512820513, "grad_norm": 0.087531179189682, "learning_rate": 0.0001155364806866953, "loss": 0.4572, "num_input_tokens_seen": 3069264, "step": 498, "train_runtime": 2190.4257, "train_tokens_per_second": 1401.218 }, { "epoch": 0.852991452991453, "grad_norm": 0.07901884615421295, "learning_rate": 0.00011536480686695278, "loss": 0.3738, "num_input_tokens_seen": 3075112, "step": 499, "train_runtime": 2194.3188, "train_tokens_per_second": 1401.397 }, { "epoch": 0.8547008547008547, "grad_norm": 0.0702543780207634, "learning_rate": 0.00011519313304721031, "loss": 0.3385, "num_input_tokens_seen": 3081824, "step": 500, "train_runtime": 2198.62, "train_tokens_per_second": 1401.708 }, { "epoch": 0.8564102564102564, "grad_norm": 0.06980577856302261, "learning_rate": 0.00011502145922746782, "loss": 0.3095, "num_input_tokens_seen": 3090464, "step": 501, "train_runtime": 2203.9777, "train_tokens_per_second": 1402.221 }, { "epoch": 0.8581196581196581, "grad_norm": 0.08610618114471436, "learning_rate": 0.00011484978540772533, "loss": 0.3978, "num_input_tokens_seen": 3096072, "step": 502, "train_runtime": 2207.7148, "train_tokens_per_second": 1402.388 }, { "epoch": 0.8598290598290599, "grad_norm": 0.09656289964914322, "learning_rate": 0.00011467811158798283, "loss": 0.4409, "num_input_tokens_seen": 3100552, "step": 503, "train_runtime": 2210.8981, "train_tokens_per_second": 1402.395 }, { "epoch": 0.8615384615384616, "grad_norm": 0.09101828932762146, "learning_rate": 0.00011450643776824035, "loss": 0.3892, "num_input_tokens_seen": 3105368, "step": 504, "train_runtime": 2214.1665, "train_tokens_per_second": 1402.5 }, { "epoch": 0.8632478632478633, "grad_norm": 0.08322126418352127, "learning_rate": 0.00011433476394849787, "loss": 0.4806, "num_input_tokens_seen": 3112744, "step": 505, "train_runtime": 2218.8487, "train_tokens_per_second": 1402.864 }, { "epoch": 0.864957264957265, "grad_norm": 0.07923685014247894, "learning_rate": 0.00011416309012875537, "loss": 0.4667, "num_input_tokens_seen": 3119008, "step": 506, "train_runtime": 2222.9295, "train_tokens_per_second": 1403.107 }, { "epoch": 0.8666666666666667, "grad_norm": 0.08297446370124817, "learning_rate": 0.00011399141630901288, "loss": 0.4381, "num_input_tokens_seen": 3126120, "step": 507, "train_runtime": 2227.4066, "train_tokens_per_second": 1403.48 }, { "epoch": 0.8683760683760684, "grad_norm": 0.09984984993934631, "learning_rate": 0.00011381974248927039, "loss": 0.5017, "num_input_tokens_seen": 3131432, "step": 508, "train_runtime": 2230.9301, "train_tokens_per_second": 1403.644 }, { "epoch": 0.8700854700854701, "grad_norm": 0.07992815226316452, "learning_rate": 0.0001136480686695279, "loss": 0.3426, "num_input_tokens_seen": 3137440, "step": 509, "train_runtime": 2234.8499, "train_tokens_per_second": 1403.871 }, { "epoch": 0.8717948717948718, "grad_norm": 0.09450999647378922, "learning_rate": 0.0001134763948497854, "loss": 0.417, "num_input_tokens_seen": 3142752, "step": 510, "train_runtime": 2238.3582, "train_tokens_per_second": 1404.043 }, { "epoch": 0.8735042735042735, "grad_norm": 0.09634573012590408, "learning_rate": 0.00011330472103004292, "loss": 0.4263, "num_input_tokens_seen": 3147904, "step": 511, "train_runtime": 2244.2827, "train_tokens_per_second": 1402.633 }, { "epoch": 0.8752136752136752, "grad_norm": 0.08692895621061325, "learning_rate": 0.00011313304721030042, "loss": 0.4547, "num_input_tokens_seen": 3155136, "step": 512, "train_runtime": 2248.902, "train_tokens_per_second": 1402.967 }, { "epoch": 0.8769230769230769, "grad_norm": 0.09777207672595978, "learning_rate": 0.00011296137339055794, "loss": 0.391, "num_input_tokens_seen": 3161728, "step": 513, "train_runtime": 2253.1795, "train_tokens_per_second": 1403.23 }, { "epoch": 0.8786324786324786, "grad_norm": 0.06957412511110306, "learning_rate": 0.00011278969957081547, "loss": 0.4446, "num_input_tokens_seen": 3168800, "step": 514, "train_runtime": 2257.7407, "train_tokens_per_second": 1403.527 }, { "epoch": 0.8803418803418803, "grad_norm": 0.09542404860258102, "learning_rate": 0.00011261802575107297, "loss": 0.4259, "num_input_tokens_seen": 3175224, "step": 515, "train_runtime": 2261.9216, "train_tokens_per_second": 1403.773 }, { "epoch": 0.882051282051282, "grad_norm": 0.08433569967746735, "learning_rate": 0.00011244635193133049, "loss": 0.3827, "num_input_tokens_seen": 3181096, "step": 516, "train_runtime": 2265.8164, "train_tokens_per_second": 1403.951 }, { "epoch": 0.8837606837606837, "grad_norm": 0.06952463835477829, "learning_rate": 0.00011227467811158799, "loss": 0.282, "num_input_tokens_seen": 3186880, "step": 517, "train_runtime": 2269.6547, "train_tokens_per_second": 1404.125 }, { "epoch": 0.8854700854700854, "grad_norm": 0.12418562173843384, "learning_rate": 0.0001121030042918455, "loss": 0.3922, "num_input_tokens_seen": 3194480, "step": 518, "train_runtime": 2274.5284, "train_tokens_per_second": 1404.458 }, { "epoch": 0.8871794871794871, "grad_norm": 0.10115774720907211, "learning_rate": 0.00011193133047210301, "loss": 0.4714, "num_input_tokens_seen": 3200424, "step": 519, "train_runtime": 2278.4811, "train_tokens_per_second": 1404.631 }, { "epoch": 0.8888888888888888, "grad_norm": 0.09031491726636887, "learning_rate": 0.00011175965665236052, "loss": 0.4023, "num_input_tokens_seen": 3205768, "step": 520, "train_runtime": 2282.1166, "train_tokens_per_second": 1404.735 }, { "epoch": 0.8905982905982905, "grad_norm": 0.08610999584197998, "learning_rate": 0.00011158798283261803, "loss": 0.3608, "num_input_tokens_seen": 3212416, "step": 521, "train_runtime": 2286.4575, "train_tokens_per_second": 1404.975 }, { "epoch": 0.8923076923076924, "grad_norm": 0.0851425752043724, "learning_rate": 0.00011141630901287554, "loss": 0.4337, "num_input_tokens_seen": 3217720, "step": 522, "train_runtime": 2290.031, "train_tokens_per_second": 1405.099 }, { "epoch": 0.8940170940170941, "grad_norm": 0.07973898947238922, "learning_rate": 0.00011124463519313306, "loss": 0.3752, "num_input_tokens_seen": 3222528, "step": 523, "train_runtime": 2293.2223, "train_tokens_per_second": 1405.24 }, { "epoch": 0.8957264957264958, "grad_norm": 0.0735258162021637, "learning_rate": 0.00011107296137339056, "loss": 0.2528, "num_input_tokens_seen": 3228424, "step": 524, "train_runtime": 2297.1669, "train_tokens_per_second": 1405.394 }, { "epoch": 0.8974358974358975, "grad_norm": 0.08155602961778641, "learning_rate": 0.00011090128755364808, "loss": 0.3476, "num_input_tokens_seen": 3233072, "step": 525, "train_runtime": 2300.3205, "train_tokens_per_second": 1405.488 }, { "epoch": 0.8991452991452992, "grad_norm": 0.12425163388252258, "learning_rate": 0.00011072961373390558, "loss": 0.4724, "num_input_tokens_seen": 3237264, "step": 526, "train_runtime": 2303.2241, "train_tokens_per_second": 1405.536 }, { "epoch": 0.9008547008547009, "grad_norm": 0.10108618438243866, "learning_rate": 0.0001105579399141631, "loss": 0.4843, "num_input_tokens_seen": 3241480, "step": 527, "train_runtime": 2306.1928, "train_tokens_per_second": 1405.555 }, { "epoch": 0.9025641025641026, "grad_norm": 0.10584156215190887, "learning_rate": 0.0001103862660944206, "loss": 0.4872, "num_input_tokens_seen": 3246152, "step": 528, "train_runtime": 2309.4182, "train_tokens_per_second": 1405.615 }, { "epoch": 0.9042735042735043, "grad_norm": 0.07442856580018997, "learning_rate": 0.00011021459227467811, "loss": 0.3933, "num_input_tokens_seen": 3253160, "step": 529, "train_runtime": 2313.9463, "train_tokens_per_second": 1405.893 }, { "epoch": 0.905982905982906, "grad_norm": 0.08017449080944061, "learning_rate": 0.00011004291845493561, "loss": 0.3851, "num_input_tokens_seen": 3260120, "step": 530, "train_runtime": 2318.4343, "train_tokens_per_second": 1406.173 }, { "epoch": 0.9076923076923077, "grad_norm": 0.08193705230951309, "learning_rate": 0.00010987124463519314, "loss": 0.4319, "num_input_tokens_seen": 3265248, "step": 531, "train_runtime": 2321.9214, "train_tokens_per_second": 1406.27 }, { "epoch": 0.9094017094017094, "grad_norm": 0.10451549291610718, "learning_rate": 0.00010969957081545066, "loss": 0.468, "num_input_tokens_seen": 3271504, "step": 532, "train_runtime": 2325.9367, "train_tokens_per_second": 1406.532 }, { "epoch": 0.9111111111111111, "grad_norm": 0.08480311930179596, "learning_rate": 0.00010952789699570816, "loss": 0.3204, "num_input_tokens_seen": 3277336, "step": 533, "train_runtime": 2329.8184, "train_tokens_per_second": 1406.692 }, { "epoch": 0.9128205128205128, "grad_norm": 0.11771999299526215, "learning_rate": 0.00010935622317596568, "loss": 0.4402, "num_input_tokens_seen": 3281200, "step": 534, "train_runtime": 2332.5771, "train_tokens_per_second": 1406.684 }, { "epoch": 0.9145299145299145, "grad_norm": 0.09482161700725555, "learning_rate": 0.00010918454935622318, "loss": 0.4203, "num_input_tokens_seen": 3288080, "step": 535, "train_runtime": 2336.9908, "train_tokens_per_second": 1406.972 }, { "epoch": 0.9162393162393162, "grad_norm": 0.08046115934848785, "learning_rate": 0.0001090128755364807, "loss": 0.3672, "num_input_tokens_seen": 3295160, "step": 536, "train_runtime": 2341.5133, "train_tokens_per_second": 1407.278 }, { "epoch": 0.9179487179487179, "grad_norm": 0.0700264498591423, "learning_rate": 0.0001088412017167382, "loss": 0.4366, "num_input_tokens_seen": 3304208, "step": 537, "train_runtime": 2347.0429, "train_tokens_per_second": 1407.817 }, { "epoch": 0.9196581196581196, "grad_norm": 0.0773264542222023, "learning_rate": 0.00010866952789699572, "loss": 0.3111, "num_input_tokens_seen": 3311160, "step": 538, "train_runtime": 2351.412, "train_tokens_per_second": 1408.158 }, { "epoch": 0.9213675213675213, "grad_norm": 0.09096362441778183, "learning_rate": 0.00010849785407725322, "loss": 0.3933, "num_input_tokens_seen": 3315912, "step": 539, "train_runtime": 2354.6076, "train_tokens_per_second": 1408.265 }, { "epoch": 0.9230769230769231, "grad_norm": 0.07224144041538239, "learning_rate": 0.00010832618025751073, "loss": 0.3323, "num_input_tokens_seen": 3324072, "step": 540, "train_runtime": 2359.683, "train_tokens_per_second": 1408.694 }, { "epoch": 0.9247863247863248, "grad_norm": 0.0825057327747345, "learning_rate": 0.00010815450643776825, "loss": 0.3806, "num_input_tokens_seen": 3328808, "step": 541, "train_runtime": 2364.9808, "train_tokens_per_second": 1407.541 }, { "epoch": 0.9264957264957265, "grad_norm": 0.09786176681518555, "learning_rate": 0.00010798283261802575, "loss": 0.3953, "num_input_tokens_seen": 3339576, "step": 542, "train_runtime": 2371.5338, "train_tokens_per_second": 1408.192 }, { "epoch": 0.9282051282051282, "grad_norm": 0.08032157272100449, "learning_rate": 0.00010781115879828327, "loss": 0.3554, "num_input_tokens_seen": 3346712, "step": 543, "train_runtime": 2376.1571, "train_tokens_per_second": 1408.456 }, { "epoch": 0.9299145299145299, "grad_norm": 0.07897566258907318, "learning_rate": 0.00010763948497854077, "loss": 0.4126, "num_input_tokens_seen": 3352832, "step": 544, "train_runtime": 2380.1411, "train_tokens_per_second": 1408.669 }, { "epoch": 0.9316239316239316, "grad_norm": 0.09934298694133759, "learning_rate": 0.0001074678111587983, "loss": 0.402, "num_input_tokens_seen": 3357992, "step": 545, "train_runtime": 2383.715, "train_tokens_per_second": 1408.722 }, { "epoch": 0.9333333333333333, "grad_norm": 0.11830101907253265, "learning_rate": 0.00010729613733905579, "loss": 0.3796, "num_input_tokens_seen": 3363672, "step": 546, "train_runtime": 2387.4938, "train_tokens_per_second": 1408.871 }, { "epoch": 0.935042735042735, "grad_norm": 0.09613929688930511, "learning_rate": 0.00010712446351931332, "loss": 0.4991, "num_input_tokens_seen": 3368520, "step": 547, "train_runtime": 2390.7547, "train_tokens_per_second": 1408.978 }, { "epoch": 0.9367521367521368, "grad_norm": 0.08919502049684525, "learning_rate": 0.0001069527896995708, "loss": 0.3698, "num_input_tokens_seen": 3373184, "step": 548, "train_runtime": 2393.9857, "train_tokens_per_second": 1409.024 }, { "epoch": 0.9384615384615385, "grad_norm": 0.09076035767793655, "learning_rate": 0.00010678111587982834, "loss": 0.541, "num_input_tokens_seen": 3378288, "step": 549, "train_runtime": 2397.3665, "train_tokens_per_second": 1409.166 }, { "epoch": 0.9401709401709402, "grad_norm": 0.07492446899414062, "learning_rate": 0.00010660944206008585, "loss": 0.4197, "num_input_tokens_seen": 3385600, "step": 550, "train_runtime": 2402.0343, "train_tokens_per_second": 1409.472 }, { "epoch": 0.9418803418803419, "grad_norm": 0.09239984303712845, "learning_rate": 0.00010643776824034335, "loss": 0.4034, "num_input_tokens_seen": 3390528, "step": 551, "train_runtime": 2405.2548, "train_tokens_per_second": 1409.634 }, { "epoch": 0.9435897435897436, "grad_norm": 0.0913330614566803, "learning_rate": 0.00010626609442060087, "loss": 0.3552, "num_input_tokens_seen": 3396984, "step": 552, "train_runtime": 2409.3976, "train_tokens_per_second": 1409.889 }, { "epoch": 0.9452991452991453, "grad_norm": 0.07622038573026657, "learning_rate": 0.00010609442060085837, "loss": 0.4532, "num_input_tokens_seen": 3404064, "step": 553, "train_runtime": 2413.8636, "train_tokens_per_second": 1410.214 }, { "epoch": 0.947008547008547, "grad_norm": 0.08276895433664322, "learning_rate": 0.00010592274678111589, "loss": 0.4015, "num_input_tokens_seen": 3411192, "step": 554, "train_runtime": 2418.3946, "train_tokens_per_second": 1410.519 }, { "epoch": 0.9487179487179487, "grad_norm": 0.11180777847766876, "learning_rate": 0.00010575107296137339, "loss": 0.3798, "num_input_tokens_seen": 3416296, "step": 555, "train_runtime": 2421.8251, "train_tokens_per_second": 1410.629 }, { "epoch": 0.9504273504273504, "grad_norm": 0.08645719289779663, "learning_rate": 0.0001055793991416309, "loss": 0.3381, "num_input_tokens_seen": 3422928, "step": 556, "train_runtime": 2426.0854, "train_tokens_per_second": 1410.885 }, { "epoch": 0.9521367521367521, "grad_norm": 0.0832013487815857, "learning_rate": 0.00010540772532188841, "loss": 0.4564, "num_input_tokens_seen": 3429968, "step": 557, "train_runtime": 2430.5605, "train_tokens_per_second": 1411.184 }, { "epoch": 0.9538461538461539, "grad_norm": 0.0959947481751442, "learning_rate": 0.00010523605150214593, "loss": 0.3677, "num_input_tokens_seen": 3436672, "step": 558, "train_runtime": 2434.8462, "train_tokens_per_second": 1411.453 }, { "epoch": 0.9555555555555556, "grad_norm": 0.11064450442790985, "learning_rate": 0.00010506437768240344, "loss": 0.4121, "num_input_tokens_seen": 3445016, "step": 559, "train_runtime": 2439.9861, "train_tokens_per_second": 1411.9 }, { "epoch": 0.9572649572649573, "grad_norm": 0.0816698893904686, "learning_rate": 0.00010489270386266094, "loss": 0.3565, "num_input_tokens_seen": 3452888, "step": 560, "train_runtime": 2444.9883, "train_tokens_per_second": 1412.231 }, { "epoch": 0.958974358974359, "grad_norm": 0.07744520902633667, "learning_rate": 0.00010472103004291847, "loss": 0.3107, "num_input_tokens_seen": 3458640, "step": 561, "train_runtime": 2448.7297, "train_tokens_per_second": 1412.422 }, { "epoch": 0.9606837606837607, "grad_norm": 0.08622029423713684, "learning_rate": 0.00010454935622317596, "loss": 0.4368, "num_input_tokens_seen": 3465472, "step": 562, "train_runtime": 2453.114, "train_tokens_per_second": 1412.683 }, { "epoch": 0.9623931623931624, "grad_norm": 0.13964629173278809, "learning_rate": 0.00010437768240343349, "loss": 0.3164, "num_input_tokens_seen": 3469568, "step": 563, "train_runtime": 2456.0226, "train_tokens_per_second": 1412.678 }, { "epoch": 0.9641025641025641, "grad_norm": 0.07157761603593826, "learning_rate": 0.00010420600858369098, "loss": 0.2602, "num_input_tokens_seen": 3488040, "step": 564, "train_runtime": 2474.1915, "train_tokens_per_second": 1409.77 }, { "epoch": 0.9658119658119658, "grad_norm": 0.08262784779071808, "learning_rate": 0.00010403433476394851, "loss": 0.5607, "num_input_tokens_seen": 3493808, "step": 565, "train_runtime": 2478.017, "train_tokens_per_second": 1409.921 }, { "epoch": 0.9675213675213675, "grad_norm": 0.07769016921520233, "learning_rate": 0.000103862660944206, "loss": 0.3689, "num_input_tokens_seen": 3501520, "step": 566, "train_runtime": 2482.9061, "train_tokens_per_second": 1410.251 }, { "epoch": 0.9692307692307692, "grad_norm": 0.08556525409221649, "learning_rate": 0.00010369098712446353, "loss": 0.3556, "num_input_tokens_seen": 3505560, "step": 567, "train_runtime": 2485.7706, "train_tokens_per_second": 1410.251 }, { "epoch": 0.9709401709401709, "grad_norm": 0.07327679544687271, "learning_rate": 0.00010351931330472104, "loss": 0.3068, "num_input_tokens_seen": 3510384, "step": 568, "train_runtime": 2489.0695, "train_tokens_per_second": 1410.32 }, { "epoch": 0.9726495726495726, "grad_norm": 0.0801009014248848, "learning_rate": 0.00010334763948497855, "loss": 0.3229, "num_input_tokens_seen": 3517104, "step": 569, "train_runtime": 2493.3461, "train_tokens_per_second": 1410.596 }, { "epoch": 0.9743589743589743, "grad_norm": 0.06246993690729141, "learning_rate": 0.00010317596566523606, "loss": 0.2222, "num_input_tokens_seen": 3526656, "step": 570, "train_runtime": 2499.1803, "train_tokens_per_second": 1411.125 }, { "epoch": 0.976068376068376, "grad_norm": 0.1202109083533287, "learning_rate": 0.00010300429184549356, "loss": 0.5679, "num_input_tokens_seen": 3531512, "step": 571, "train_runtime": 2504.4144, "train_tokens_per_second": 1410.115 }, { "epoch": 0.9777777777777777, "grad_norm": 0.08485902100801468, "learning_rate": 0.00010283261802575108, "loss": 0.3944, "num_input_tokens_seen": 3538680, "step": 572, "train_runtime": 2508.9249, "train_tokens_per_second": 1410.437 }, { "epoch": 0.9794871794871794, "grad_norm": 0.07959533482789993, "learning_rate": 0.00010266094420600858, "loss": 0.4062, "num_input_tokens_seen": 3546464, "step": 573, "train_runtime": 2513.8989, "train_tokens_per_second": 1410.742 }, { "epoch": 0.9811965811965812, "grad_norm": 0.09233636409044266, "learning_rate": 0.0001024892703862661, "loss": 0.3835, "num_input_tokens_seen": 3552456, "step": 574, "train_runtime": 2517.8592, "train_tokens_per_second": 1410.903 }, { "epoch": 0.9829059829059829, "grad_norm": 0.09226620197296143, "learning_rate": 0.0001023175965665236, "loss": 0.406, "num_input_tokens_seen": 3558408, "step": 575, "train_runtime": 2521.7196, "train_tokens_per_second": 1411.104 }, { "epoch": 0.9846153846153847, "grad_norm": 0.09293176978826523, "learning_rate": 0.00010214592274678112, "loss": 0.4517, "num_input_tokens_seen": 3562888, "step": 576, "train_runtime": 2524.8827, "train_tokens_per_second": 1411.11 }, { "epoch": 0.9863247863247864, "grad_norm": 0.09278377890586853, "learning_rate": 0.00010197424892703865, "loss": 0.3824, "num_input_tokens_seen": 3569056, "step": 577, "train_runtime": 2528.8642, "train_tokens_per_second": 1411.328 }, { "epoch": 0.9880341880341881, "grad_norm": 0.08279518783092499, "learning_rate": 0.00010180257510729614, "loss": 0.3324, "num_input_tokens_seen": 3575144, "step": 578, "train_runtime": 2532.8766, "train_tokens_per_second": 1411.496 }, { "epoch": 0.9897435897435898, "grad_norm": 0.10000254958868027, "learning_rate": 0.00010163090128755366, "loss": 0.5108, "num_input_tokens_seen": 3581656, "step": 579, "train_runtime": 2537.0696, "train_tokens_per_second": 1411.729 }, { "epoch": 0.9914529914529915, "grad_norm": 0.08659250289201736, "learning_rate": 0.00010145922746781115, "loss": 0.4577, "num_input_tokens_seen": 3587680, "step": 580, "train_runtime": 2541.0662, "train_tokens_per_second": 1411.88 }, { "epoch": 0.9931623931623932, "grad_norm": 0.07771515846252441, "learning_rate": 0.00010128755364806868, "loss": 0.4422, "num_input_tokens_seen": 3593504, "step": 581, "train_runtime": 2544.9092, "train_tokens_per_second": 1412.036 }, { "epoch": 0.9948717948717949, "grad_norm": 0.07676418870687485, "learning_rate": 0.00010111587982832617, "loss": 0.3758, "num_input_tokens_seen": 3600384, "step": 582, "train_runtime": 2549.2938, "train_tokens_per_second": 1412.306 }, { "epoch": 0.9965811965811966, "grad_norm": 0.08909256011247635, "learning_rate": 0.0001009442060085837, "loss": 0.3669, "num_input_tokens_seen": 3605464, "step": 583, "train_runtime": 2552.6971, "train_tokens_per_second": 1412.414 }, { "epoch": 0.9982905982905983, "grad_norm": 0.08806303888559341, "learning_rate": 0.00010077253218884119, "loss": 0.3305, "num_input_tokens_seen": 3611536, "step": 584, "train_runtime": 2556.5698, "train_tokens_per_second": 1412.649 }, { "epoch": 1.0, "grad_norm": 0.08583690226078033, "learning_rate": 0.00010060085836909872, "loss": 0.3828, "num_input_tokens_seen": 3618422, "step": 585, "train_runtime": 2560.9505, "train_tokens_per_second": 1412.921 }, { "epoch": 1.0, "eval_loss": 0.39605432748794556, "eval_runtime": 40.3316, "eval_samples_per_second": 24.745, "eval_steps_per_second": 3.099, "num_input_tokens_seen": 3618422, "step": 585 }, { "epoch": 1.0017094017094017, "grad_norm": 0.08948741853237152, "learning_rate": 0.00010042918454935624, "loss": 0.3274, "num_input_tokens_seen": 3622718, "step": 586, "train_runtime": 2604.2915, "train_tokens_per_second": 1391.057 }, { "epoch": 1.0034188034188034, "grad_norm": 0.08865802735090256, "learning_rate": 0.00010025751072961374, "loss": 0.3752, "num_input_tokens_seen": 3628366, "step": 587, "train_runtime": 2608.0141, "train_tokens_per_second": 1391.237 }, { "epoch": 1.005128205128205, "grad_norm": 0.08882749825716019, "learning_rate": 0.00010008583690987125, "loss": 0.3247, "num_input_tokens_seen": 3634422, "step": 588, "train_runtime": 2611.9678, "train_tokens_per_second": 1391.45 }, { "epoch": 1.0068376068376068, "grad_norm": 0.07764381170272827, "learning_rate": 9.991416309012877e-05, "loss": 0.3212, "num_input_tokens_seen": 3642062, "step": 589, "train_runtime": 2616.7435, "train_tokens_per_second": 1391.83 }, { "epoch": 1.0085470085470085, "grad_norm": 0.07668716460466385, "learning_rate": 9.974248927038627e-05, "loss": 0.2789, "num_input_tokens_seen": 3647678, "step": 590, "train_runtime": 2620.4702, "train_tokens_per_second": 1391.994 }, { "epoch": 1.0102564102564102, "grad_norm": 0.08743472397327423, "learning_rate": 9.957081545064379e-05, "loss": 0.4002, "num_input_tokens_seen": 3652086, "step": 591, "train_runtime": 2623.6804, "train_tokens_per_second": 1391.971 }, { "epoch": 1.011965811965812, "grad_norm": 0.0788293108344078, "learning_rate": 9.939914163090129e-05, "loss": 0.3955, "num_input_tokens_seen": 3658766, "step": 592, "train_runtime": 2627.9769, "train_tokens_per_second": 1392.237 }, { "epoch": 1.0136752136752136, "grad_norm": 0.08279833942651749, "learning_rate": 9.92274678111588e-05, "loss": 0.3241, "num_input_tokens_seen": 3663790, "step": 593, "train_runtime": 2631.3729, "train_tokens_per_second": 1392.349 }, { "epoch": 1.0153846153846153, "grad_norm": 0.09472624957561493, "learning_rate": 9.905579399141631e-05, "loss": 0.319, "num_input_tokens_seen": 3667814, "step": 594, "train_runtime": 2634.1893, "train_tokens_per_second": 1392.388 }, { "epoch": 1.017094017094017, "grad_norm": 0.0776962861418724, "learning_rate": 9.888412017167382e-05, "loss": 0.3256, "num_input_tokens_seen": 3673086, "step": 595, "train_runtime": 2637.6636, "train_tokens_per_second": 1392.553 }, { "epoch": 1.0188034188034187, "grad_norm": 0.08131415396928787, "learning_rate": 9.871244635193133e-05, "loss": 0.4514, "num_input_tokens_seen": 3679750, "step": 596, "train_runtime": 2642.0566, "train_tokens_per_second": 1392.76 }, { "epoch": 1.0205128205128204, "grad_norm": 0.08639644086360931, "learning_rate": 9.854077253218884e-05, "loss": 0.4259, "num_input_tokens_seen": 3686286, "step": 597, "train_runtime": 2646.3002, "train_tokens_per_second": 1392.996 }, { "epoch": 1.0222222222222221, "grad_norm": 0.07753600180149078, "learning_rate": 9.836909871244636e-05, "loss": 0.345, "num_input_tokens_seen": 3692046, "step": 598, "train_runtime": 2650.0207, "train_tokens_per_second": 1393.214 }, { "epoch": 1.0239316239316238, "grad_norm": 0.1012101024389267, "learning_rate": 9.819742489270387e-05, "loss": 0.43, "num_input_tokens_seen": 3698230, "step": 599, "train_runtime": 2654.0616, "train_tokens_per_second": 1393.423 }, { "epoch": 1.0256410256410255, "grad_norm": 0.08087831735610962, "learning_rate": 9.802575107296138e-05, "loss": 0.2885, "num_input_tokens_seen": 3705894, "step": 600, "train_runtime": 2658.9893, "train_tokens_per_second": 1393.723 }, { "epoch": 1.0273504273504273, "grad_norm": 0.09200716018676758, "learning_rate": 9.785407725321889e-05, "loss": 0.3635, "num_input_tokens_seen": 3712206, "step": 601, "train_runtime": 2665.0844, "train_tokens_per_second": 1392.904 }, { "epoch": 1.029059829059829, "grad_norm": 0.08871855586767197, "learning_rate": 9.76824034334764e-05, "loss": 0.3291, "num_input_tokens_seen": 3718302, "step": 602, "train_runtime": 2669.0702, "train_tokens_per_second": 1393.108 }, { "epoch": 1.0307692307692307, "grad_norm": 0.08718711137771606, "learning_rate": 9.751072961373391e-05, "loss": 0.343, "num_input_tokens_seen": 3722894, "step": 603, "train_runtime": 2672.2548, "train_tokens_per_second": 1393.166 }, { "epoch": 1.0324786324786326, "grad_norm": 0.1148778423666954, "learning_rate": 9.733905579399141e-05, "loss": 0.46, "num_input_tokens_seen": 3728318, "step": 604, "train_runtime": 2675.8538, "train_tokens_per_second": 1393.319 }, { "epoch": 1.0341880341880343, "grad_norm": 0.09517476707696915, "learning_rate": 9.716738197424893e-05, "loss": 0.3318, "num_input_tokens_seen": 3733382, "step": 605, "train_runtime": 2679.2474, "train_tokens_per_second": 1393.444 }, { "epoch": 1.035897435897436, "grad_norm": 0.08098772168159485, "learning_rate": 9.699570815450643e-05, "loss": 0.4015, "num_input_tokens_seen": 3740134, "step": 606, "train_runtime": 2683.621, "train_tokens_per_second": 1393.689 }, { "epoch": 1.0376068376068377, "grad_norm": 0.08234472572803497, "learning_rate": 9.682403433476396e-05, "loss": 0.3397, "num_input_tokens_seen": 3748294, "step": 607, "train_runtime": 2688.737, "train_tokens_per_second": 1394.072 }, { "epoch": 1.0393162393162394, "grad_norm": 0.09244134277105331, "learning_rate": 9.665236051502146e-05, "loss": 0.4135, "num_input_tokens_seen": 3757438, "step": 608, "train_runtime": 2694.5363, "train_tokens_per_second": 1394.466 }, { "epoch": 1.041025641025641, "grad_norm": 0.10387304425239563, "learning_rate": 9.648068669527898e-05, "loss": 0.3957, "num_input_tokens_seen": 3764318, "step": 609, "train_runtime": 2699.0049, "train_tokens_per_second": 1394.706 }, { "epoch": 1.0427350427350428, "grad_norm": 0.10354664921760559, "learning_rate": 9.630901287553648e-05, "loss": 0.3482, "num_input_tokens_seen": 3768958, "step": 610, "train_runtime": 2702.2905, "train_tokens_per_second": 1394.727 }, { "epoch": 1.0444444444444445, "grad_norm": 0.09723416715860367, "learning_rate": 9.6137339055794e-05, "loss": 0.3646, "num_input_tokens_seen": 3774318, "step": 611, "train_runtime": 2705.8739, "train_tokens_per_second": 1394.861 }, { "epoch": 1.0461538461538462, "grad_norm": 0.12522576749324799, "learning_rate": 9.59656652360515e-05, "loss": 0.4124, "num_input_tokens_seen": 3778782, "step": 612, "train_runtime": 2708.8626, "train_tokens_per_second": 1394.97 }, { "epoch": 1.047863247863248, "grad_norm": 0.07524297386407852, "learning_rate": 9.579399141630902e-05, "loss": 0.2649, "num_input_tokens_seen": 3791542, "step": 613, "train_runtime": 2716.6371, "train_tokens_per_second": 1395.675 }, { "epoch": 1.0495726495726496, "grad_norm": 0.09840003401041031, "learning_rate": 9.562231759656652e-05, "loss": 0.2911, "num_input_tokens_seen": 3798062, "step": 614, "train_runtime": 2720.7491, "train_tokens_per_second": 1395.962 }, { "epoch": 1.0512820512820513, "grad_norm": 0.08430645614862442, "learning_rate": 9.545064377682403e-05, "loss": 0.2807, "num_input_tokens_seen": 3805886, "step": 615, "train_runtime": 2725.6421, "train_tokens_per_second": 1396.326 }, { "epoch": 1.052991452991453, "grad_norm": 0.09602045267820358, "learning_rate": 9.527896995708155e-05, "loss": 0.3352, "num_input_tokens_seen": 3812678, "step": 616, "train_runtime": 2729.9694, "train_tokens_per_second": 1396.601 }, { "epoch": 1.0547008547008547, "grad_norm": 0.11685816943645477, "learning_rate": 9.510729613733907e-05, "loss": 0.3145, "num_input_tokens_seen": 3817918, "step": 617, "train_runtime": 2733.4384, "train_tokens_per_second": 1396.746 }, { "epoch": 1.0564102564102564, "grad_norm": 0.10211452841758728, "learning_rate": 9.493562231759657e-05, "loss": 0.4132, "num_input_tokens_seen": 3823910, "step": 618, "train_runtime": 2737.3388, "train_tokens_per_second": 1396.944 }, { "epoch": 1.0581196581196581, "grad_norm": 0.08317096531391144, "learning_rate": 9.476394849785408e-05, "loss": 0.3044, "num_input_tokens_seen": 3831590, "step": 619, "train_runtime": 2742.2732, "train_tokens_per_second": 1397.231 }, { "epoch": 1.0598290598290598, "grad_norm": 0.10162318497896194, "learning_rate": 9.459227467811159e-05, "loss": 0.3509, "num_input_tokens_seen": 3838574, "step": 620, "train_runtime": 2746.7086, "train_tokens_per_second": 1397.518 }, { "epoch": 1.0615384615384615, "grad_norm": 0.11026163399219513, "learning_rate": 9.44206008583691e-05, "loss": 0.3539, "num_input_tokens_seen": 3845406, "step": 621, "train_runtime": 2750.9862, "train_tokens_per_second": 1397.828 }, { "epoch": 1.0632478632478632, "grad_norm": 0.10371764004230499, "learning_rate": 9.42489270386266e-05, "loss": 0.3829, "num_input_tokens_seen": 3851846, "step": 622, "train_runtime": 2755.1883, "train_tokens_per_second": 1398.034 }, { "epoch": 1.064957264957265, "grad_norm": 0.12548448145389557, "learning_rate": 9.407725321888412e-05, "loss": 0.4213, "num_input_tokens_seen": 3857550, "step": 623, "train_runtime": 2758.8716, "train_tokens_per_second": 1398.235 }, { "epoch": 1.0666666666666667, "grad_norm": 0.10498113930225372, "learning_rate": 9.390557939914162e-05, "loss": 0.4485, "num_input_tokens_seen": 3863470, "step": 624, "train_runtime": 2762.81, "train_tokens_per_second": 1398.384 }, { "epoch": 1.0683760683760684, "grad_norm": 0.1048503890633583, "learning_rate": 9.373390557939915e-05, "loss": 0.3127, "num_input_tokens_seen": 3869654, "step": 625, "train_runtime": 2766.7958, "train_tokens_per_second": 1398.605 }, { "epoch": 1.07008547008547, "grad_norm": 0.09524165093898773, "learning_rate": 9.356223175965666e-05, "loss": 0.3127, "num_input_tokens_seen": 3878486, "step": 626, "train_runtime": 2772.2649, "train_tokens_per_second": 1399.032 }, { "epoch": 1.0717948717948718, "grad_norm": 0.10186054557561874, "learning_rate": 9.339055793991417e-05, "loss": 0.3342, "num_input_tokens_seen": 3883590, "step": 627, "train_runtime": 2775.6835, "train_tokens_per_second": 1399.147 }, { "epoch": 1.0735042735042735, "grad_norm": 0.09904703497886658, "learning_rate": 9.321888412017167e-05, "loss": 0.3603, "num_input_tokens_seen": 3890358, "step": 628, "train_runtime": 2780.0801, "train_tokens_per_second": 1399.369 }, { "epoch": 1.0752136752136752, "grad_norm": 0.11625757068395615, "learning_rate": 9.304721030042919e-05, "loss": 0.4212, "num_input_tokens_seen": 3895574, "step": 629, "train_runtime": 2783.6001, "train_tokens_per_second": 1399.473 }, { "epoch": 1.0769230769230769, "grad_norm": 0.09834125638008118, "learning_rate": 9.287553648068669e-05, "loss": 0.3934, "num_input_tokens_seen": 3903326, "step": 630, "train_runtime": 2788.4609, "train_tokens_per_second": 1399.814 }, { "epoch": 1.0786324786324786, "grad_norm": 0.11049104481935501, "learning_rate": 9.270386266094421e-05, "loss": 0.3621, "num_input_tokens_seen": 3909342, "step": 631, "train_runtime": 2794.4207, "train_tokens_per_second": 1398.981 }, { "epoch": 1.0803418803418803, "grad_norm": 0.1120554581284523, "learning_rate": 9.253218884120171e-05, "loss": 0.3118, "num_input_tokens_seen": 3914966, "step": 632, "train_runtime": 2798.1277, "train_tokens_per_second": 1399.138 }, { "epoch": 1.082051282051282, "grad_norm": 0.11459173262119293, "learning_rate": 9.236051502145924e-05, "loss": 0.3686, "num_input_tokens_seen": 3921462, "step": 633, "train_runtime": 2802.3884, "train_tokens_per_second": 1399.328 }, { "epoch": 1.0837606837606837, "grad_norm": 0.11084756255149841, "learning_rate": 9.218884120171674e-05, "loss": 0.3529, "num_input_tokens_seen": 3927558, "step": 634, "train_runtime": 2806.299, "train_tokens_per_second": 1399.551 }, { "epoch": 1.0854700854700854, "grad_norm": 0.12373020499944687, "learning_rate": 9.201716738197426e-05, "loss": 0.4522, "num_input_tokens_seen": 3932094, "step": 635, "train_runtime": 2809.3759, "train_tokens_per_second": 1399.633 }, { "epoch": 1.087179487179487, "grad_norm": 0.08477049320936203, "learning_rate": 9.184549356223176e-05, "loss": 0.3035, "num_input_tokens_seen": 3941230, "step": 636, "train_runtime": 2815.0844, "train_tokens_per_second": 1400.04 }, { "epoch": 1.0888888888888888, "grad_norm": 0.1090676486492157, "learning_rate": 9.167381974248928e-05, "loss": 0.4409, "num_input_tokens_seen": 3947470, "step": 637, "train_runtime": 2819.144, "train_tokens_per_second": 1400.237 }, { "epoch": 1.0905982905982905, "grad_norm": 0.12120052427053452, "learning_rate": 9.150214592274678e-05, "loss": 0.4599, "num_input_tokens_seen": 3953878, "step": 638, "train_runtime": 2823.1637, "train_tokens_per_second": 1400.513 }, { "epoch": 1.0923076923076924, "grad_norm": 0.11783261597156525, "learning_rate": 9.13304721030043e-05, "loss": 0.3354, "num_input_tokens_seen": 3958406, "step": 639, "train_runtime": 2826.2247, "train_tokens_per_second": 1400.598 }, { "epoch": 1.0940170940170941, "grad_norm": 0.09893219918012619, "learning_rate": 9.115879828326181e-05, "loss": 0.2526, "num_input_tokens_seen": 3964966, "step": 640, "train_runtime": 2830.4214, "train_tokens_per_second": 1400.839 }, { "epoch": 1.0957264957264958, "grad_norm": 0.12095890194177628, "learning_rate": 9.098712446351931e-05, "loss": 0.3913, "num_input_tokens_seen": 3971974, "step": 641, "train_runtime": 2834.9317, "train_tokens_per_second": 1401.083 }, { "epoch": 1.0974358974358975, "grad_norm": 0.10970400273799896, "learning_rate": 9.081545064377683e-05, "loss": 0.2948, "num_input_tokens_seen": 3977078, "step": 642, "train_runtime": 2838.3405, "train_tokens_per_second": 1401.198 }, { "epoch": 1.0991452991452992, "grad_norm": 0.11889484524726868, "learning_rate": 9.064377682403434e-05, "loss": 0.335, "num_input_tokens_seen": 3984550, "step": 643, "train_runtime": 2842.9124, "train_tokens_per_second": 1401.573 }, { "epoch": 1.100854700854701, "grad_norm": 0.09870035946369171, "learning_rate": 9.047210300429185e-05, "loss": 0.2858, "num_input_tokens_seen": 3991398, "step": 644, "train_runtime": 2847.409, "train_tokens_per_second": 1401.765 }, { "epoch": 1.1025641025641026, "grad_norm": 0.13711033761501312, "learning_rate": 9.030042918454936e-05, "loss": 0.3647, "num_input_tokens_seen": 3995926, "step": 645, "train_runtime": 2850.5247, "train_tokens_per_second": 1401.821 }, { "epoch": 1.1042735042735043, "grad_norm": 0.10438720136880875, "learning_rate": 9.012875536480687e-05, "loss": 0.2409, "num_input_tokens_seen": 4003198, "step": 646, "train_runtime": 2855.1319, "train_tokens_per_second": 1402.106 }, { "epoch": 1.105982905982906, "grad_norm": 0.15836024284362793, "learning_rate": 8.995708154506438e-05, "loss": 0.3368, "num_input_tokens_seen": 4008270, "step": 647, "train_runtime": 2858.5235, "train_tokens_per_second": 1402.217 }, { "epoch": 1.1076923076923078, "grad_norm": 0.10418689996004105, "learning_rate": 8.97854077253219e-05, "loss": 0.3241, "num_input_tokens_seen": 4014838, "step": 648, "train_runtime": 2862.7868, "train_tokens_per_second": 1402.423 }, { "epoch": 1.1094017094017095, "grad_norm": 0.1044258251786232, "learning_rate": 8.96137339055794e-05, "loss": 0.2804, "num_input_tokens_seen": 4022990, "step": 649, "train_runtime": 2867.905, "train_tokens_per_second": 1402.763 }, { "epoch": 1.1111111111111112, "grad_norm": 0.10561820864677429, "learning_rate": 8.944206008583692e-05, "loss": 0.2887, "num_input_tokens_seen": 4030286, "step": 650, "train_runtime": 2872.5702, "train_tokens_per_second": 1403.024 }, { "epoch": 1.1128205128205129, "grad_norm": 0.11144879460334778, "learning_rate": 8.927038626609443e-05, "loss": 0.3114, "num_input_tokens_seen": 4036790, "step": 651, "train_runtime": 2876.8141, "train_tokens_per_second": 1403.215 }, { "epoch": 1.1145299145299146, "grad_norm": 0.14294514060020447, "learning_rate": 8.909871244635193e-05, "loss": 0.3772, "num_input_tokens_seen": 4040950, "step": 652, "train_runtime": 2879.6357, "train_tokens_per_second": 1403.285 }, { "epoch": 1.1162393162393163, "grad_norm": 0.1573735773563385, "learning_rate": 8.892703862660945e-05, "loss": 0.3632, "num_input_tokens_seen": 4045150, "step": 653, "train_runtime": 2882.5288, "train_tokens_per_second": 1403.334 }, { "epoch": 1.117948717948718, "grad_norm": 0.12260954082012177, "learning_rate": 8.875536480686695e-05, "loss": 0.3622, "num_input_tokens_seen": 4051350, "step": 654, "train_runtime": 2886.5663, "train_tokens_per_second": 1403.519 }, { "epoch": 1.1196581196581197, "grad_norm": 0.12595947086811066, "learning_rate": 8.858369098712447e-05, "loss": 0.3106, "num_input_tokens_seen": 4055846, "step": 655, "train_runtime": 2889.7758, "train_tokens_per_second": 1403.516 }, { "epoch": 1.1213675213675214, "grad_norm": 0.10922437906265259, "learning_rate": 8.841201716738198e-05, "loss": 0.3463, "num_input_tokens_seen": 4064006, "step": 656, "train_runtime": 2894.9551, "train_tokens_per_second": 1403.824 }, { "epoch": 1.123076923076923, "grad_norm": 0.13162162899971008, "learning_rate": 8.824034334763949e-05, "loss": 0.3693, "num_input_tokens_seen": 4069158, "step": 657, "train_runtime": 2898.4174, "train_tokens_per_second": 1403.924 }, { "epoch": 1.1247863247863248, "grad_norm": 0.09306973218917847, "learning_rate": 8.8068669527897e-05, "loss": 0.2135, "num_input_tokens_seen": 4075910, "step": 658, "train_runtime": 2902.7564, "train_tokens_per_second": 1404.152 }, { "epoch": 1.1264957264957265, "grad_norm": 0.11251482367515564, "learning_rate": 8.78969957081545e-05, "loss": 0.2678, "num_input_tokens_seen": 4083350, "step": 659, "train_runtime": 2907.453, "train_tokens_per_second": 1404.442 }, { "epoch": 1.1282051282051282, "grad_norm": 0.11792943626642227, "learning_rate": 8.772532188841202e-05, "loss": 0.3796, "num_input_tokens_seen": 4088502, "step": 660, "train_runtime": 2910.9225, "train_tokens_per_second": 1404.538 }, { "epoch": 1.12991452991453, "grad_norm": 0.13532239198684692, "learning_rate": 8.755364806866954e-05, "loss": 0.3234, "num_input_tokens_seen": 4094158, "step": 661, "train_runtime": 2916.6295, "train_tokens_per_second": 1403.729 }, { "epoch": 1.1316239316239316, "grad_norm": 0.1649348884820938, "learning_rate": 8.738197424892704e-05, "loss": 0.2733, "num_input_tokens_seen": 4100614, "step": 662, "train_runtime": 2920.8065, "train_tokens_per_second": 1403.932 }, { "epoch": 1.1333333333333333, "grad_norm": 0.12547938525676727, "learning_rate": 8.721030042918455e-05, "loss": 0.3671, "num_input_tokens_seen": 4104630, "step": 663, "train_runtime": 2923.6894, "train_tokens_per_second": 1403.921 }, { "epoch": 1.135042735042735, "grad_norm": 0.1248277947306633, "learning_rate": 8.703862660944207e-05, "loss": 0.3165, "num_input_tokens_seen": 4111406, "step": 664, "train_runtime": 2928.0537, "train_tokens_per_second": 1404.143 }, { "epoch": 1.1367521367521367, "grad_norm": 0.10170157998800278, "learning_rate": 8.686695278969957e-05, "loss": 0.2983, "num_input_tokens_seen": 4119070, "step": 665, "train_runtime": 2932.9305, "train_tokens_per_second": 1404.421 }, { "epoch": 1.1384615384615384, "grad_norm": 0.12390810996294022, "learning_rate": 8.669527896995709e-05, "loss": 0.3526, "num_input_tokens_seen": 4124734, "step": 666, "train_runtime": 2936.6426, "train_tokens_per_second": 1404.575 }, { "epoch": 1.1401709401709401, "grad_norm": 0.1411864310503006, "learning_rate": 8.652360515021459e-05, "loss": 0.3677, "num_input_tokens_seen": 4129230, "step": 667, "train_runtime": 2939.7387, "train_tokens_per_second": 1404.625 }, { "epoch": 1.1418803418803418, "grad_norm": 0.15506789088249207, "learning_rate": 8.635193133047211e-05, "loss": 0.4179, "num_input_tokens_seen": 4134566, "step": 668, "train_runtime": 2943.2748, "train_tokens_per_second": 1404.75 }, { "epoch": 1.1435897435897435, "grad_norm": 0.12583504617214203, "learning_rate": 8.618025751072962e-05, "loss": 0.335, "num_input_tokens_seen": 4139998, "step": 669, "train_runtime": 2946.9935, "train_tokens_per_second": 1404.821 }, { "epoch": 1.1452991452991452, "grad_norm": 0.1164029911160469, "learning_rate": 8.600858369098714e-05, "loss": 0.3436, "num_input_tokens_seen": 4145854, "step": 670, "train_runtime": 2950.7518, "train_tokens_per_second": 1405.016 }, { "epoch": 1.147008547008547, "grad_norm": 0.11394175887107849, "learning_rate": 8.583690987124464e-05, "loss": 0.3931, "num_input_tokens_seen": 4154062, "step": 671, "train_runtime": 2955.921, "train_tokens_per_second": 1405.336 }, { "epoch": 1.1487179487179486, "grad_norm": 0.1256456822156906, "learning_rate": 8.566523605150216e-05, "loss": 0.3797, "num_input_tokens_seen": 4159086, "step": 672, "train_runtime": 2959.2691, "train_tokens_per_second": 1405.444 }, { "epoch": 1.1504273504273503, "grad_norm": 0.11079292744398117, "learning_rate": 8.549356223175966e-05, "loss": 0.3967, "num_input_tokens_seen": 4167806, "step": 673, "train_runtime": 2964.6253, "train_tokens_per_second": 1405.846 }, { "epoch": 1.152136752136752, "grad_norm": 0.11943069845438004, "learning_rate": 8.532188841201718e-05, "loss": 0.4008, "num_input_tokens_seen": 4173558, "step": 674, "train_runtime": 2968.3878, "train_tokens_per_second": 1406.002 }, { "epoch": 1.1538461538461537, "grad_norm": 0.1307218074798584, "learning_rate": 8.515021459227468e-05, "loss": 0.3377, "num_input_tokens_seen": 4178718, "step": 675, "train_runtime": 2971.9038, "train_tokens_per_second": 1406.074 }, { "epoch": 1.1555555555555554, "grad_norm": 0.11272697895765305, "learning_rate": 8.49785407725322e-05, "loss": 0.3091, "num_input_tokens_seen": 4185366, "step": 676, "train_runtime": 2976.1919, "train_tokens_per_second": 1406.282 }, { "epoch": 1.1572649572649572, "grad_norm": 0.12259600311517715, "learning_rate": 8.48068669527897e-05, "loss": 0.2661, "num_input_tokens_seen": 4190998, "step": 677, "train_runtime": 2979.8773, "train_tokens_per_second": 1406.433 }, { "epoch": 1.1589743589743589, "grad_norm": 0.1330793797969818, "learning_rate": 8.463519313304723e-05, "loss": 0.3186, "num_input_tokens_seen": 4196758, "step": 678, "train_runtime": 2983.6254, "train_tokens_per_second": 1406.597 }, { "epoch": 1.1606837606837608, "grad_norm": 0.13795171678066254, "learning_rate": 8.446351931330473e-05, "loss": 0.4127, "num_input_tokens_seen": 4202318, "step": 679, "train_runtime": 2987.2952, "train_tokens_per_second": 1406.73 }, { "epoch": 1.1623931623931625, "grad_norm": 0.1282401978969574, "learning_rate": 8.429184549356224e-05, "loss": 0.3593, "num_input_tokens_seen": 4207182, "step": 680, "train_runtime": 2990.5405, "train_tokens_per_second": 1406.83 }, { "epoch": 1.1641025641025642, "grad_norm": 0.12769852578639984, "learning_rate": 8.412017167381975e-05, "loss": 0.3226, "num_input_tokens_seen": 4212214, "step": 681, "train_runtime": 2993.9992, "train_tokens_per_second": 1406.885 }, { "epoch": 1.165811965811966, "grad_norm": 0.11880778521299362, "learning_rate": 8.394849785407726e-05, "loss": 0.3876, "num_input_tokens_seen": 4218710, "step": 682, "train_runtime": 2998.2223, "train_tokens_per_second": 1407.07 }, { "epoch": 1.1675213675213676, "grad_norm": 0.12354989349842072, "learning_rate": 8.377682403433476e-05, "loss": 0.4613, "num_input_tokens_seen": 4224726, "step": 683, "train_runtime": 3002.1266, "train_tokens_per_second": 1407.244 }, { "epoch": 1.1692307692307693, "grad_norm": 0.1455572098493576, "learning_rate": 8.360515021459228e-05, "loss": 0.4111, "num_input_tokens_seen": 4230606, "step": 684, "train_runtime": 3005.9145, "train_tokens_per_second": 1407.427 }, { "epoch": 1.170940170940171, "grad_norm": 0.1312953233718872, "learning_rate": 8.343347639484978e-05, "loss": 0.2817, "num_input_tokens_seen": 4234918, "step": 685, "train_runtime": 3008.9265, "train_tokens_per_second": 1407.451 }, { "epoch": 1.1726495726495727, "grad_norm": 0.11988040059804916, "learning_rate": 8.32618025751073e-05, "loss": 0.3142, "num_input_tokens_seen": 4239622, "step": 686, "train_runtime": 3012.0648, "train_tokens_per_second": 1407.547 }, { "epoch": 1.1743589743589744, "grad_norm": 0.12248189002275467, "learning_rate": 8.309012875536481e-05, "loss": 0.3699, "num_input_tokens_seen": 4246046, "step": 687, "train_runtime": 3016.2638, "train_tokens_per_second": 1407.717 }, { "epoch": 1.176068376068376, "grad_norm": 0.13097332417964935, "learning_rate": 8.291845493562233e-05, "loss": 0.4192, "num_input_tokens_seen": 4252182, "step": 688, "train_runtime": 3020.2889, "train_tokens_per_second": 1407.873 }, { "epoch": 1.1777777777777778, "grad_norm": 0.1253839135169983, "learning_rate": 8.274678111587983e-05, "loss": 0.33, "num_input_tokens_seen": 4258126, "step": 689, "train_runtime": 3024.21, "train_tokens_per_second": 1408.013 }, { "epoch": 1.1794871794871795, "grad_norm": 0.11824435740709305, "learning_rate": 8.257510729613735e-05, "loss": 0.3657, "num_input_tokens_seen": 4263766, "step": 690, "train_runtime": 3027.9432, "train_tokens_per_second": 1408.139 }, { "epoch": 1.1811965811965812, "grad_norm": 0.10008279979228973, "learning_rate": 8.240343347639485e-05, "loss": 0.2639, "num_input_tokens_seen": 4271606, "step": 691, "train_runtime": 3035.004, "train_tokens_per_second": 1407.447 }, { "epoch": 1.182905982905983, "grad_norm": 0.13148897886276245, "learning_rate": 8.223175965665237e-05, "loss": 0.3419, "num_input_tokens_seen": 4277814, "step": 692, "train_runtime": 3039.0799, "train_tokens_per_second": 1407.602 }, { "epoch": 1.1846153846153846, "grad_norm": 0.12744757533073425, "learning_rate": 8.206008583690987e-05, "loss": 0.3128, "num_input_tokens_seen": 4284254, "step": 693, "train_runtime": 3043.1921, "train_tokens_per_second": 1407.816 }, { "epoch": 1.1863247863247863, "grad_norm": 0.10180284082889557, "learning_rate": 8.188841201716739e-05, "loss": 0.2579, "num_input_tokens_seen": 4292718, "step": 694, "train_runtime": 3048.4277, "train_tokens_per_second": 1408.174 }, { "epoch": 1.188034188034188, "grad_norm": 0.11092183738946915, "learning_rate": 8.171673819742489e-05, "loss": 0.2859, "num_input_tokens_seen": 4299326, "step": 695, "train_runtime": 3052.7332, "train_tokens_per_second": 1408.353 }, { "epoch": 1.1897435897435897, "grad_norm": 0.11507410556077957, "learning_rate": 8.154506437768242e-05, "loss": 0.2612, "num_input_tokens_seen": 4305558, "step": 696, "train_runtime": 3056.7517, "train_tokens_per_second": 1408.54 }, { "epoch": 1.1914529914529914, "grad_norm": 0.12987719476222992, "learning_rate": 8.137339055793992e-05, "loss": 0.348, "num_input_tokens_seen": 4312030, "step": 697, "train_runtime": 3060.9536, "train_tokens_per_second": 1408.721 }, { "epoch": 1.1931623931623931, "grad_norm": 0.13223910331726074, "learning_rate": 8.120171673819744e-05, "loss": 0.2785, "num_input_tokens_seen": 4316510, "step": 698, "train_runtime": 3064.0436, "train_tokens_per_second": 1408.763 }, { "epoch": 1.1948717948717948, "grad_norm": 0.11111994832754135, "learning_rate": 8.103004291845494e-05, "loss": 0.2969, "num_input_tokens_seen": 4324606, "step": 699, "train_runtime": 3069.1412, "train_tokens_per_second": 1409.061 }, { "epoch": 1.1965811965811965, "grad_norm": 0.1413484662771225, "learning_rate": 8.085836909871245e-05, "loss": 0.3364, "num_input_tokens_seen": 4329830, "step": 700, "train_runtime": 3072.6351, "train_tokens_per_second": 1409.159 }, { "epoch": 1.1982905982905983, "grad_norm": 0.1474023163318634, "learning_rate": 8.068669527896996e-05, "loss": 0.3746, "num_input_tokens_seen": 4334662, "step": 701, "train_runtime": 3075.8988, "train_tokens_per_second": 1409.234 }, { "epoch": 1.2, "grad_norm": 0.13913953304290771, "learning_rate": 8.051502145922747e-05, "loss": 0.3741, "num_input_tokens_seen": 4340158, "step": 702, "train_runtime": 3079.5939, "train_tokens_per_second": 1409.328 }, { "epoch": 1.2, "eval_loss": 0.4070233404636383, "eval_runtime": 40.246, "eval_samples_per_second": 24.798, "eval_steps_per_second": 3.106, "num_input_tokens_seen": 4340158, "step": 702 }, { "epoch": 1.2017094017094017, "grad_norm": 0.15744465589523315, "learning_rate": 8.034334763948497e-05, "loss": 0.3205, "num_input_tokens_seen": 4344510, "step": 703, "train_runtime": 3122.7838, "train_tokens_per_second": 1391.23 }, { "epoch": 1.2034188034188034, "grad_norm": 0.10824355483055115, "learning_rate": 8.017167381974249e-05, "loss": 0.3016, "num_input_tokens_seen": 4351566, "step": 704, "train_runtime": 3127.2592, "train_tokens_per_second": 1391.495 }, { "epoch": 1.205128205128205, "grad_norm": 0.14710809290409088, "learning_rate": 8e-05, "loss": 0.4078, "num_input_tokens_seen": 4357350, "step": 705, "train_runtime": 3131.0621, "train_tokens_per_second": 1391.652 }, { "epoch": 1.2068376068376068, "grad_norm": 0.1302827000617981, "learning_rate": 7.982832618025752e-05, "loss": 0.3591, "num_input_tokens_seen": 4363374, "step": 706, "train_runtime": 3135.006, "train_tokens_per_second": 1391.823 }, { "epoch": 1.2085470085470085, "grad_norm": 0.12259086221456528, "learning_rate": 7.965665236051502e-05, "loss": 0.3385, "num_input_tokens_seen": 4369726, "step": 707, "train_runtime": 3139.1212, "train_tokens_per_second": 1392.022 }, { "epoch": 1.2102564102564102, "grad_norm": 0.14181672036647797, "learning_rate": 7.948497854077254e-05, "loss": 0.3, "num_input_tokens_seen": 4375566, "step": 708, "train_runtime": 3142.8713, "train_tokens_per_second": 1392.219 }, { "epoch": 1.2119658119658119, "grad_norm": 0.1263398677110672, "learning_rate": 7.931330472103004e-05, "loss": 0.326, "num_input_tokens_seen": 4382422, "step": 709, "train_runtime": 3147.2669, "train_tokens_per_second": 1392.453 }, { "epoch": 1.2136752136752136, "grad_norm": 0.13287968933582306, "learning_rate": 7.914163090128756e-05, "loss": 0.3703, "num_input_tokens_seen": 4387598, "step": 710, "train_runtime": 3150.6679, "train_tokens_per_second": 1392.593 }, { "epoch": 1.2153846153846155, "grad_norm": 0.1080661490559578, "learning_rate": 7.896995708154506e-05, "loss": 0.2662, "num_input_tokens_seen": 4393070, "step": 711, "train_runtime": 3154.3344, "train_tokens_per_second": 1392.709 }, { "epoch": 1.2170940170940172, "grad_norm": 0.15643350780010223, "learning_rate": 7.879828326180258e-05, "loss": 0.3682, "num_input_tokens_seen": 4400974, "step": 712, "train_runtime": 3159.2844, "train_tokens_per_second": 1393.029 }, { "epoch": 1.218803418803419, "grad_norm": 0.13371539115905762, "learning_rate": 7.862660944206008e-05, "loss": 0.2962, "num_input_tokens_seen": 4407534, "step": 713, "train_runtime": 3163.505, "train_tokens_per_second": 1393.244 }, { "epoch": 1.2205128205128206, "grad_norm": 0.12932796776294708, "learning_rate": 7.845493562231761e-05, "loss": 0.4288, "num_input_tokens_seen": 4414006, "step": 714, "train_runtime": 3167.7424, "train_tokens_per_second": 1393.423 }, { "epoch": 1.2222222222222223, "grad_norm": 0.13061010837554932, "learning_rate": 7.828326180257511e-05, "loss": 0.3212, "num_input_tokens_seen": 4419822, "step": 715, "train_runtime": 3171.4916, "train_tokens_per_second": 1393.61 }, { "epoch": 1.223931623931624, "grad_norm": 0.15035027265548706, "learning_rate": 7.811158798283263e-05, "loss": 0.3392, "num_input_tokens_seen": 4424894, "step": 716, "train_runtime": 3174.9326, "train_tokens_per_second": 1393.697 }, { "epoch": 1.2256410256410257, "grad_norm": 0.13823997974395752, "learning_rate": 7.793991416309013e-05, "loss": 0.3443, "num_input_tokens_seen": 4429934, "step": 717, "train_runtime": 3178.3439, "train_tokens_per_second": 1393.787 }, { "epoch": 1.2273504273504274, "grad_norm": 0.12821649014949799, "learning_rate": 7.776824034334765e-05, "loss": 0.3079, "num_input_tokens_seen": 4437350, "step": 718, "train_runtime": 3182.9631, "train_tokens_per_second": 1394.094 }, { "epoch": 1.2290598290598291, "grad_norm": 0.15762051939964294, "learning_rate": 7.759656652360515e-05, "loss": 0.3233, "num_input_tokens_seen": 4443350, "step": 719, "train_runtime": 3186.8324, "train_tokens_per_second": 1394.284 }, { "epoch": 1.2307692307692308, "grad_norm": 0.12094758450984955, "learning_rate": 7.742489270386266e-05, "loss": 0.3412, "num_input_tokens_seen": 4450358, "step": 720, "train_runtime": 3191.2311, "train_tokens_per_second": 1394.558 }, { "epoch": 1.2324786324786325, "grad_norm": 0.14245277643203735, "learning_rate": 7.725321888412017e-05, "loss": 0.3852, "num_input_tokens_seen": 4455006, "step": 721, "train_runtime": 3196.5176, "train_tokens_per_second": 1393.706 }, { "epoch": 1.2341880341880342, "grad_norm": 0.12726493179798126, "learning_rate": 7.70815450643777e-05, "loss": 0.3124, "num_input_tokens_seen": 4460062, "step": 722, "train_runtime": 3199.9064, "train_tokens_per_second": 1393.81 }, { "epoch": 1.235897435897436, "grad_norm": 0.1353270411491394, "learning_rate": 7.69098712446352e-05, "loss": 0.4404, "num_input_tokens_seen": 4465926, "step": 723, "train_runtime": 3203.6787, "train_tokens_per_second": 1393.999 }, { "epoch": 1.2376068376068377, "grad_norm": 0.12000975012779236, "learning_rate": 7.673819742489271e-05, "loss": 0.415, "num_input_tokens_seen": 4473902, "step": 724, "train_runtime": 3208.6199, "train_tokens_per_second": 1394.338 }, { "epoch": 1.2393162393162394, "grad_norm": 0.14204196631908417, "learning_rate": 7.656652360515022e-05, "loss": 0.3714, "num_input_tokens_seen": 4479870, "step": 725, "train_runtime": 3212.4525, "train_tokens_per_second": 1394.533 }, { "epoch": 1.241025641025641, "grad_norm": 0.15379798412322998, "learning_rate": 7.639484978540773e-05, "loss": 0.3517, "num_input_tokens_seen": 4484942, "step": 726, "train_runtime": 3215.8195, "train_tokens_per_second": 1394.65 }, { "epoch": 1.2427350427350428, "grad_norm": 0.14596928656101227, "learning_rate": 7.622317596566523e-05, "loss": 0.3631, "num_input_tokens_seen": 4489038, "step": 727, "train_runtime": 3218.5973, "train_tokens_per_second": 1394.719 }, { "epoch": 1.2444444444444445, "grad_norm": 0.13844047486782074, "learning_rate": 7.605150214592275e-05, "loss": 0.3868, "num_input_tokens_seen": 4494750, "step": 728, "train_runtime": 3222.3484, "train_tokens_per_second": 1394.868 }, { "epoch": 1.2461538461538462, "grad_norm": 0.13620500266551971, "learning_rate": 7.587982832618025e-05, "loss": 0.3273, "num_input_tokens_seen": 4499982, "step": 729, "train_runtime": 3225.86, "train_tokens_per_second": 1394.971 }, { "epoch": 1.2478632478632479, "grad_norm": 0.11844179034233093, "learning_rate": 7.570815450643777e-05, "loss": 0.3236, "num_input_tokens_seen": 4508150, "step": 730, "train_runtime": 3230.9631, "train_tokens_per_second": 1395.296 }, { "epoch": 1.2495726495726496, "grad_norm": 0.12672026455402374, "learning_rate": 7.553648068669528e-05, "loss": 0.3344, "num_input_tokens_seen": 4514606, "step": 731, "train_runtime": 3235.0964, "train_tokens_per_second": 1395.509 }, { "epoch": 1.2512820512820513, "grad_norm": 0.13571657240390778, "learning_rate": 7.53648068669528e-05, "loss": 0.4214, "num_input_tokens_seen": 4523526, "step": 732, "train_runtime": 3240.687, "train_tokens_per_second": 1395.854 }, { "epoch": 1.252991452991453, "grad_norm": 0.14158177375793457, "learning_rate": 7.51931330472103e-05, "loss": 0.257, "num_input_tokens_seen": 4528758, "step": 733, "train_runtime": 3244.1781, "train_tokens_per_second": 1395.965 }, { "epoch": 1.2547008547008547, "grad_norm": 0.12700851261615753, "learning_rate": 7.502145922746782e-05, "loss": 0.4369, "num_input_tokens_seen": 4535382, "step": 734, "train_runtime": 3248.4052, "train_tokens_per_second": 1396.187 }, { "epoch": 1.2564102564102564, "grad_norm": 0.1430508941411972, "learning_rate": 7.484978540772532e-05, "loss": 0.3833, "num_input_tokens_seen": 4541614, "step": 735, "train_runtime": 3252.4598, "train_tokens_per_second": 1396.363 }, { "epoch": 1.258119658119658, "grad_norm": 0.12764482200145721, "learning_rate": 7.467811158798284e-05, "loss": 0.4148, "num_input_tokens_seen": 4548046, "step": 736, "train_runtime": 3256.6496, "train_tokens_per_second": 1396.541 }, { "epoch": 1.2598290598290598, "grad_norm": 0.13472262024879456, "learning_rate": 7.450643776824034e-05, "loss": 0.3777, "num_input_tokens_seen": 4553950, "step": 737, "train_runtime": 3260.4005, "train_tokens_per_second": 1396.746 }, { "epoch": 1.2615384615384615, "grad_norm": 0.1314297914505005, "learning_rate": 7.433476394849786e-05, "loss": 0.4397, "num_input_tokens_seen": 4558846, "step": 738, "train_runtime": 3263.7018, "train_tokens_per_second": 1396.833 }, { "epoch": 1.2632478632478632, "grad_norm": 0.14270712435245514, "learning_rate": 7.416309012875536e-05, "loss": 0.3093, "num_input_tokens_seen": 4563726, "step": 739, "train_runtime": 3266.9431, "train_tokens_per_second": 1396.941 }, { "epoch": 1.264957264957265, "grad_norm": 0.1482027918100357, "learning_rate": 7.399141630901289e-05, "loss": 0.4741, "num_input_tokens_seen": 4571278, "step": 740, "train_runtime": 3271.6203, "train_tokens_per_second": 1397.252 }, { "epoch": 1.2666666666666666, "grad_norm": 0.12276957184076309, "learning_rate": 7.381974248927039e-05, "loss": 0.3511, "num_input_tokens_seen": 4577710, "step": 741, "train_runtime": 3275.6213, "train_tokens_per_second": 1397.509 }, { "epoch": 1.2683760683760683, "grad_norm": 0.13464733958244324, "learning_rate": 7.36480686695279e-05, "loss": 0.3685, "num_input_tokens_seen": 4583294, "step": 742, "train_runtime": 3279.1819, "train_tokens_per_second": 1397.694 }, { "epoch": 1.27008547008547, "grad_norm": 0.12158236652612686, "learning_rate": 7.347639484978541e-05, "loss": 0.2883, "num_input_tokens_seen": 4588590, "step": 743, "train_runtime": 3282.5387, "train_tokens_per_second": 1397.878 }, { "epoch": 1.2717948717948717, "grad_norm": 0.13294081389904022, "learning_rate": 7.330472103004292e-05, "loss": 0.437, "num_input_tokens_seen": 4595566, "step": 744, "train_runtime": 3286.9142, "train_tokens_per_second": 1398.14 }, { "epoch": 1.2735042735042734, "grad_norm": 0.1501665860414505, "learning_rate": 7.313304721030043e-05, "loss": 0.5661, "num_input_tokens_seen": 4599918, "step": 745, "train_runtime": 3289.8586, "train_tokens_per_second": 1398.211 }, { "epoch": 1.2752136752136751, "grad_norm": 0.14475314319133759, "learning_rate": 7.296137339055794e-05, "loss": 0.4791, "num_input_tokens_seen": 4605942, "step": 746, "train_runtime": 3293.6594, "train_tokens_per_second": 1398.427 }, { "epoch": 1.2769230769230768, "grad_norm": 0.12351132929325104, "learning_rate": 7.278969957081544e-05, "loss": 0.3623, "num_input_tokens_seen": 4611150, "step": 747, "train_runtime": 3297.0543, "train_tokens_per_second": 1398.567 }, { "epoch": 1.2786324786324785, "grad_norm": 0.13310228288173676, "learning_rate": 7.261802575107296e-05, "loss": 0.3743, "num_input_tokens_seen": 4616758, "step": 748, "train_runtime": 3300.7146, "train_tokens_per_second": 1398.715 }, { "epoch": 1.2803418803418802, "grad_norm": 0.09973648190498352, "learning_rate": 7.244635193133048e-05, "loss": 0.2891, "num_input_tokens_seen": 4626662, "step": 749, "train_runtime": 3306.7934, "train_tokens_per_second": 1399.139 }, { "epoch": 1.282051282051282, "grad_norm": 0.14369341731071472, "learning_rate": 7.227467811158799e-05, "loss": 0.3285, "num_input_tokens_seen": 4631822, "step": 750, "train_runtime": 3310.203, "train_tokens_per_second": 1399.256 }, { "epoch": 1.2837606837606836, "grad_norm": 0.1476762741804123, "learning_rate": 7.21030042918455e-05, "loss": 0.4658, "num_input_tokens_seen": 4636590, "step": 751, "train_runtime": 3315.5788, "train_tokens_per_second": 1398.426 }, { "epoch": 1.2854700854700853, "grad_norm": 0.11374587565660477, "learning_rate": 7.193133047210301e-05, "loss": 0.3681, "num_input_tokens_seen": 4644318, "step": 752, "train_runtime": 3320.3931, "train_tokens_per_second": 1398.725 }, { "epoch": 1.287179487179487, "grad_norm": 0.11597425490617752, "learning_rate": 7.175965665236051e-05, "loss": 0.357, "num_input_tokens_seen": 4650038, "step": 753, "train_runtime": 3324.1736, "train_tokens_per_second": 1398.855 }, { "epoch": 1.2888888888888888, "grad_norm": 0.13681602478027344, "learning_rate": 7.158798283261803e-05, "loss": 0.3438, "num_input_tokens_seen": 4657070, "step": 754, "train_runtime": 3328.6588, "train_tokens_per_second": 1399.083 }, { "epoch": 1.2905982905982907, "grad_norm": 0.13616129755973816, "learning_rate": 7.141630901287553e-05, "loss": 0.3903, "num_input_tokens_seen": 4662454, "step": 755, "train_runtime": 3332.1591, "train_tokens_per_second": 1399.229 }, { "epoch": 1.2923076923076924, "grad_norm": 0.11485311388969421, "learning_rate": 7.124463519313305e-05, "loss": 0.2805, "num_input_tokens_seen": 4668550, "step": 756, "train_runtime": 3336.0659, "train_tokens_per_second": 1399.418 }, { "epoch": 1.294017094017094, "grad_norm": 0.10654192417860031, "learning_rate": 7.107296137339055e-05, "loss": 0.3048, "num_input_tokens_seen": 4674622, "step": 757, "train_runtime": 3339.9603, "train_tokens_per_second": 1399.604 }, { "epoch": 1.2957264957264958, "grad_norm": 0.11485373228788376, "learning_rate": 7.090128755364808e-05, "loss": 0.3378, "num_input_tokens_seen": 4681182, "step": 758, "train_runtime": 3344.152, "train_tokens_per_second": 1399.811 }, { "epoch": 1.2974358974358975, "grad_norm": 0.12688450515270233, "learning_rate": 7.072961373390558e-05, "loss": 0.3171, "num_input_tokens_seen": 4688046, "step": 759, "train_runtime": 3348.539, "train_tokens_per_second": 1400.027 }, { "epoch": 1.2991452991452992, "grad_norm": 0.14865227043628693, "learning_rate": 7.05579399141631e-05, "loss": 0.4053, "num_input_tokens_seen": 4693070, "step": 760, "train_runtime": 3351.8787, "train_tokens_per_second": 1400.131 }, { "epoch": 1.300854700854701, "grad_norm": 0.11336711049079895, "learning_rate": 7.03862660944206e-05, "loss": 0.4168, "num_input_tokens_seen": 4700366, "step": 761, "train_runtime": 3356.4783, "train_tokens_per_second": 1400.386 }, { "epoch": 1.3025641025641026, "grad_norm": 0.12746818363666534, "learning_rate": 7.021459227467812e-05, "loss": 0.3034, "num_input_tokens_seen": 4705990, "step": 762, "train_runtime": 3360.1127, "train_tokens_per_second": 1400.545 }, { "epoch": 1.3042735042735043, "grad_norm": 0.12251978367567062, "learning_rate": 7.004291845493562e-05, "loss": 0.2748, "num_input_tokens_seen": 4714262, "step": 763, "train_runtime": 3365.1365, "train_tokens_per_second": 1400.913 }, { "epoch": 1.305982905982906, "grad_norm": 0.13442695140838623, "learning_rate": 6.987124463519313e-05, "loss": 0.295, "num_input_tokens_seen": 4719134, "step": 764, "train_runtime": 3368.3798, "train_tokens_per_second": 1401.01 }, { "epoch": 1.3076923076923077, "grad_norm": 0.12905444204807281, "learning_rate": 6.969957081545064e-05, "loss": 0.3244, "num_input_tokens_seen": 4725510, "step": 765, "train_runtime": 3372.4643, "train_tokens_per_second": 1401.204 }, { "epoch": 1.3094017094017094, "grad_norm": 0.11190018802881241, "learning_rate": 6.952789699570815e-05, "loss": 0.3076, "num_input_tokens_seen": 4733854, "step": 766, "train_runtime": 3377.5045, "train_tokens_per_second": 1401.583 }, { "epoch": 1.3111111111111111, "grad_norm": 0.17238380014896393, "learning_rate": 6.935622317596567e-05, "loss": 0.2737, "num_input_tokens_seen": 4739286, "step": 767, "train_runtime": 3381.0372, "train_tokens_per_second": 1401.725 }, { "epoch": 1.3128205128205128, "grad_norm": 0.17607900500297546, "learning_rate": 6.918454935622318e-05, "loss": 0.3432, "num_input_tokens_seen": 4745774, "step": 768, "train_runtime": 3385.2278, "train_tokens_per_second": 1401.907 }, { "epoch": 1.3145299145299145, "grad_norm": 0.1317862719297409, "learning_rate": 6.901287553648069e-05, "loss": 0.3515, "num_input_tokens_seen": 4752102, "step": 769, "train_runtime": 3389.3012, "train_tokens_per_second": 1402.089 }, { "epoch": 1.3162393162393162, "grad_norm": 0.14107532799243927, "learning_rate": 6.88412017167382e-05, "loss": 0.3412, "num_input_tokens_seen": 4756838, "step": 770, "train_runtime": 3392.4585, "train_tokens_per_second": 1402.18 }, { "epoch": 1.317948717948718, "grad_norm": 0.13236303627490997, "learning_rate": 6.86695278969957e-05, "loss": 0.3439, "num_input_tokens_seen": 4762030, "step": 771, "train_runtime": 3395.9367, "train_tokens_per_second": 1402.273 }, { "epoch": 1.3196581196581196, "grad_norm": 0.1498628854751587, "learning_rate": 6.849785407725322e-05, "loss": 0.3687, "num_input_tokens_seen": 4768278, "step": 772, "train_runtime": 3400.0481, "train_tokens_per_second": 1402.415 }, { "epoch": 1.3213675213675213, "grad_norm": 0.14370892941951752, "learning_rate": 6.832618025751074e-05, "loss": 0.2666, "num_input_tokens_seen": 4774286, "step": 773, "train_runtime": 3403.935, "train_tokens_per_second": 1402.578 }, { "epoch": 1.323076923076923, "grad_norm": 0.10908810794353485, "learning_rate": 6.815450643776824e-05, "loss": 0.3024, "num_input_tokens_seen": 4782158, "step": 774, "train_runtime": 3408.873, "train_tokens_per_second": 1402.856 }, { "epoch": 1.3247863247863247, "grad_norm": 0.14470210671424866, "learning_rate": 6.798283261802576e-05, "loss": 0.4275, "num_input_tokens_seen": 4787766, "step": 775, "train_runtime": 3412.4916, "train_tokens_per_second": 1403.012 }, { "epoch": 1.3264957264957264, "grad_norm": 0.13045263290405273, "learning_rate": 6.781115879828327e-05, "loss": 0.2805, "num_input_tokens_seen": 4793574, "step": 776, "train_runtime": 3416.2588, "train_tokens_per_second": 1403.165 }, { "epoch": 1.3282051282051281, "grad_norm": 0.13219225406646729, "learning_rate": 6.763948497854077e-05, "loss": 0.3582, "num_input_tokens_seen": 4799806, "step": 777, "train_runtime": 3420.2931, "train_tokens_per_second": 1403.332 }, { "epoch": 1.3299145299145299, "grad_norm": 0.1638411432504654, "learning_rate": 6.746781115879829e-05, "loss": 0.4126, "num_input_tokens_seen": 4804742, "step": 778, "train_runtime": 3423.6145, "train_tokens_per_second": 1403.412 }, { "epoch": 1.3316239316239316, "grad_norm": 0.14201755821704865, "learning_rate": 6.729613733905579e-05, "loss": 0.3419, "num_input_tokens_seen": 4810782, "step": 779, "train_runtime": 3427.5338, "train_tokens_per_second": 1403.57 }, { "epoch": 1.3333333333333333, "grad_norm": 0.15089352428913116, "learning_rate": 6.712446351931331e-05, "loss": 0.2885, "num_input_tokens_seen": 4817070, "step": 780, "train_runtime": 3431.5635, "train_tokens_per_second": 1403.754 }, { "epoch": 1.335042735042735, "grad_norm": 0.13004031777381897, "learning_rate": 6.695278969957082e-05, "loss": 0.3854, "num_input_tokens_seen": 4823494, "step": 781, "train_runtime": 3437.7554, "train_tokens_per_second": 1403.094 }, { "epoch": 1.3367521367521369, "grad_norm": 0.15346503257751465, "learning_rate": 6.678111587982833e-05, "loss": 0.4984, "num_input_tokens_seen": 4830086, "step": 782, "train_runtime": 3442.0415, "train_tokens_per_second": 1403.262 }, { "epoch": 1.3384615384615386, "grad_norm": 0.14129255712032318, "learning_rate": 6.660944206008584e-05, "loss": 0.2954, "num_input_tokens_seen": 4834182, "step": 783, "train_runtime": 3444.8732, "train_tokens_per_second": 1403.298 }, { "epoch": 1.3401709401709403, "grad_norm": 0.11984660476446152, "learning_rate": 6.643776824034334e-05, "loss": 0.3082, "num_input_tokens_seen": 4840982, "step": 784, "train_runtime": 3449.1751, "train_tokens_per_second": 1403.519 }, { "epoch": 1.341880341880342, "grad_norm": 0.09363918751478195, "learning_rate": 6.626609442060086e-05, "loss": 0.2449, "num_input_tokens_seen": 4848502, "step": 785, "train_runtime": 3453.9244, "train_tokens_per_second": 1403.766 }, { "epoch": 1.3435897435897437, "grad_norm": 0.1427582949399948, "learning_rate": 6.609442060085838e-05, "loss": 0.3177, "num_input_tokens_seen": 4852918, "step": 786, "train_runtime": 3456.9516, "train_tokens_per_second": 1403.814 }, { "epoch": 1.3452991452991454, "grad_norm": 0.17200025916099548, "learning_rate": 6.592274678111588e-05, "loss": 0.3403, "num_input_tokens_seen": 4857702, "step": 787, "train_runtime": 3460.13, "train_tokens_per_second": 1403.907 }, { "epoch": 1.347008547008547, "grad_norm": 0.11825034767389297, "learning_rate": 6.57510729613734e-05, "loss": 0.3184, "num_input_tokens_seen": 4865798, "step": 788, "train_runtime": 3465.1861, "train_tokens_per_second": 1404.195 }, { "epoch": 1.3487179487179488, "grad_norm": 0.12618689239025116, "learning_rate": 6.557939914163091e-05, "loss": 0.3325, "num_input_tokens_seen": 4872190, "step": 789, "train_runtime": 3469.3589, "train_tokens_per_second": 1404.349 }, { "epoch": 1.3504273504273505, "grad_norm": 0.152120903134346, "learning_rate": 6.540772532188841e-05, "loss": 0.4916, "num_input_tokens_seen": 4879126, "step": 790, "train_runtime": 3473.7659, "train_tokens_per_second": 1404.564 }, { "epoch": 1.3521367521367522, "grad_norm": 0.18881268799304962, "learning_rate": 6.523605150214593e-05, "loss": 0.3321, "num_input_tokens_seen": 4885526, "step": 791, "train_runtime": 3477.8095, "train_tokens_per_second": 1404.771 }, { "epoch": 1.353846153846154, "grad_norm": 0.11601816117763519, "learning_rate": 6.506437768240343e-05, "loss": 0.3422, "num_input_tokens_seen": 4892726, "step": 792, "train_runtime": 3482.3464, "train_tokens_per_second": 1405.008 }, { "epoch": 1.3555555555555556, "grad_norm": 0.14055293798446655, "learning_rate": 6.489270386266095e-05, "loss": 0.3659, "num_input_tokens_seen": 4898358, "step": 793, "train_runtime": 3485.9704, "train_tokens_per_second": 1405.163 }, { "epoch": 1.3572649572649573, "grad_norm": 0.13708831369876862, "learning_rate": 6.472103004291846e-05, "loss": 0.3883, "num_input_tokens_seen": 4903222, "step": 794, "train_runtime": 3489.2494, "train_tokens_per_second": 1405.237 }, { "epoch": 1.358974358974359, "grad_norm": 0.1181880459189415, "learning_rate": 6.454935622317597e-05, "loss": 0.3499, "num_input_tokens_seen": 4909550, "step": 795, "train_runtime": 3493.3108, "train_tokens_per_second": 1405.415 }, { "epoch": 1.3606837606837607, "grad_norm": 0.1416664868593216, "learning_rate": 6.437768240343348e-05, "loss": 0.3251, "num_input_tokens_seen": 4914894, "step": 796, "train_runtime": 3496.8801, "train_tokens_per_second": 1405.508 }, { "epoch": 1.3623931623931624, "grad_norm": 0.14663483202457428, "learning_rate": 6.4206008583691e-05, "loss": 0.4227, "num_input_tokens_seen": 4921046, "step": 797, "train_runtime": 3500.8366, "train_tokens_per_second": 1405.677 }, { "epoch": 1.3641025641025641, "grad_norm": 0.1496182233095169, "learning_rate": 6.40343347639485e-05, "loss": 0.4552, "num_input_tokens_seen": 4927342, "step": 798, "train_runtime": 3504.826, "train_tokens_per_second": 1405.874 }, { "epoch": 1.3658119658119658, "grad_norm": 0.15900661051273346, "learning_rate": 6.386266094420602e-05, "loss": 0.3935, "num_input_tokens_seen": 4933422, "step": 799, "train_runtime": 3508.8577, "train_tokens_per_second": 1405.991 }, { "epoch": 1.3675213675213675, "grad_norm": 0.16213171184062958, "learning_rate": 6.369098712446352e-05, "loss": 0.3777, "num_input_tokens_seen": 4937910, "step": 800, "train_runtime": 3511.8753, "train_tokens_per_second": 1406.061 }, { "epoch": 1.3692307692307693, "grad_norm": 0.1332091987133026, "learning_rate": 6.351931330472103e-05, "loss": 0.3411, "num_input_tokens_seen": 4945310, "step": 801, "train_runtime": 3516.581, "train_tokens_per_second": 1406.284 }, { "epoch": 1.370940170940171, "grad_norm": 0.12687839567661285, "learning_rate": 6.334763948497855e-05, "loss": 0.3497, "num_input_tokens_seen": 4952318, "step": 802, "train_runtime": 3521.058, "train_tokens_per_second": 1406.486 }, { "epoch": 1.3726495726495727, "grad_norm": 0.13601604104042053, "learning_rate": 6.317596566523607e-05, "loss": 0.3821, "num_input_tokens_seen": 4957638, "step": 803, "train_runtime": 3524.6153, "train_tokens_per_second": 1406.576 }, { "epoch": 1.3743589743589744, "grad_norm": 0.12945939600467682, "learning_rate": 6.300429184549357e-05, "loss": 0.3478, "num_input_tokens_seen": 4964622, "step": 804, "train_runtime": 3529.0468, "train_tokens_per_second": 1406.788 }, { "epoch": 1.376068376068376, "grad_norm": 0.13379725813865662, "learning_rate": 6.283261802575108e-05, "loss": 0.3145, "num_input_tokens_seen": 4975366, "step": 805, "train_runtime": 3535.554, "train_tokens_per_second": 1407.238 }, { "epoch": 1.3777777777777778, "grad_norm": 0.12784002721309662, "learning_rate": 6.266094420600859e-05, "loss": 0.3537, "num_input_tokens_seen": 4984470, "step": 806, "train_runtime": 3541.2817, "train_tokens_per_second": 1407.533 }, { "epoch": 1.3794871794871795, "grad_norm": 0.1543240249156952, "learning_rate": 6.24892703862661e-05, "loss": 0.5405, "num_input_tokens_seen": 4990494, "step": 807, "train_runtime": 3545.1709, "train_tokens_per_second": 1407.688 }, { "epoch": 1.3811965811965812, "grad_norm": 0.14580953121185303, "learning_rate": 6.23175965665236e-05, "loss": 0.3638, "num_input_tokens_seen": 4996022, "step": 808, "train_runtime": 3548.7602, "train_tokens_per_second": 1407.822 }, { "epoch": 1.3829059829059829, "grad_norm": 0.13987824320793152, "learning_rate": 6.214592274678112e-05, "loss": 0.2967, "num_input_tokens_seen": 5003358, "step": 809, "train_runtime": 3553.3322, "train_tokens_per_second": 1408.075 }, { "epoch": 1.3846153846153846, "grad_norm": 0.15021635591983795, "learning_rate": 6.197424892703862e-05, "loss": 0.3521, "num_input_tokens_seen": 5009470, "step": 810, "train_runtime": 3557.3125, "train_tokens_per_second": 1408.218 }, { "epoch": 1.3863247863247863, "grad_norm": 0.17432373762130737, "learning_rate": 6.180257510729615e-05, "loss": 0.4223, "num_input_tokens_seen": 5013910, "step": 811, "train_runtime": 3562.3066, "train_tokens_per_second": 1407.49 }, { "epoch": 1.388034188034188, "grad_norm": 0.12946096062660217, "learning_rate": 6.163090128755365e-05, "loss": 0.3144, "num_input_tokens_seen": 5020934, "step": 812, "train_runtime": 3566.7167, "train_tokens_per_second": 1407.719 }, { "epoch": 1.3897435897435897, "grad_norm": 0.14947237074375153, "learning_rate": 6.145922746781117e-05, "loss": 0.3538, "num_input_tokens_seen": 5026366, "step": 813, "train_runtime": 3570.2494, "train_tokens_per_second": 1407.847 }, { "epoch": 1.3914529914529914, "grad_norm": 0.16150113940238953, "learning_rate": 6.128755364806867e-05, "loss": 0.4022, "num_input_tokens_seen": 5032670, "step": 814, "train_runtime": 3574.3152, "train_tokens_per_second": 1408.01 }, { "epoch": 1.393162393162393, "grad_norm": 0.13235805928707123, "learning_rate": 6.111587982832619e-05, "loss": 0.4002, "num_input_tokens_seen": 5038006, "step": 815, "train_runtime": 3577.9246, "train_tokens_per_second": 1408.081 }, { "epoch": 1.3948717948717948, "grad_norm": 0.13235850632190704, "learning_rate": 6.094420600858369e-05, "loss": 0.3106, "num_input_tokens_seen": 5042966, "step": 816, "train_runtime": 3581.2275, "train_tokens_per_second": 1408.167 }, { "epoch": 1.3965811965811965, "grad_norm": 0.12829095125198364, "learning_rate": 6.07725321888412e-05, "loss": 0.3089, "num_input_tokens_seen": 5048478, "step": 817, "train_runtime": 3584.7901, "train_tokens_per_second": 1408.305 }, { "epoch": 1.3982905982905982, "grad_norm": 0.128507599234581, "learning_rate": 6.060085836909871e-05, "loss": 0.3642, "num_input_tokens_seen": 5054262, "step": 818, "train_runtime": 3588.5263, "train_tokens_per_second": 1408.451 }, { "epoch": 1.4, "grad_norm": 0.1573978215456009, "learning_rate": 6.042918454935622e-05, "loss": 0.4736, "num_input_tokens_seen": 5059318, "step": 819, "train_runtime": 3591.913, "train_tokens_per_second": 1408.53 }, { "epoch": 1.4, "eval_loss": 0.40713953971862793, "eval_runtime": 39.9732, "eval_samples_per_second": 24.967, "eval_steps_per_second": 3.127, "num_input_tokens_seen": 5059318, "step": 819 }, { "epoch": 1.4017094017094016, "grad_norm": 0.14844471216201782, "learning_rate": 6.025751072961374e-05, "loss": 0.357, "num_input_tokens_seen": 5065662, "step": 820, "train_runtime": 3635.9646, "train_tokens_per_second": 1393.21 }, { "epoch": 1.4034188034188033, "grad_norm": 0.1275315284729004, "learning_rate": 6.008583690987125e-05, "loss": 0.3142, "num_input_tokens_seen": 5072030, "step": 821, "train_runtime": 3639.9817, "train_tokens_per_second": 1393.422 }, { "epoch": 1.405128205128205, "grad_norm": 0.1327238231897354, "learning_rate": 5.991416309012876e-05, "loss": 0.3219, "num_input_tokens_seen": 5077102, "step": 822, "train_runtime": 3643.3247, "train_tokens_per_second": 1393.535 }, { "epoch": 1.4068376068376067, "grad_norm": 0.1424541175365448, "learning_rate": 5.974248927038627e-05, "loss": 0.3149, "num_input_tokens_seen": 5084094, "step": 823, "train_runtime": 3647.8224, "train_tokens_per_second": 1393.734 }, { "epoch": 1.4085470085470084, "grad_norm": 0.1389557421207428, "learning_rate": 5.957081545064378e-05, "loss": 0.388, "num_input_tokens_seen": 5089366, "step": 824, "train_runtime": 3651.3158, "train_tokens_per_second": 1393.844 }, { "epoch": 1.4102564102564101, "grad_norm": 0.16298536956310272, "learning_rate": 5.939914163090129e-05, "loss": 0.4075, "num_input_tokens_seen": 5094734, "step": 825, "train_runtime": 3654.7291, "train_tokens_per_second": 1394.011 }, { "epoch": 1.4119658119658118, "grad_norm": 0.12247509509325027, "learning_rate": 5.9227467811158796e-05, "loss": 0.3127, "num_input_tokens_seen": 5102198, "step": 826, "train_runtime": 3659.4415, "train_tokens_per_second": 1394.256 }, { "epoch": 1.4136752136752135, "grad_norm": 0.15482676029205322, "learning_rate": 5.9055793991416305e-05, "loss": 0.3002, "num_input_tokens_seen": 5111134, "step": 827, "train_runtime": 3665.0056, "train_tokens_per_second": 1394.577 }, { "epoch": 1.4153846153846155, "grad_norm": 0.14611922204494476, "learning_rate": 5.888412017167382e-05, "loss": 0.352, "num_input_tokens_seen": 5115230, "step": 828, "train_runtime": 3667.7611, "train_tokens_per_second": 1394.646 }, { "epoch": 1.4170940170940172, "grad_norm": 0.17032893002033234, "learning_rate": 5.871244635193134e-05, "loss": 0.3732, "num_input_tokens_seen": 5120990, "step": 829, "train_runtime": 3671.46, "train_tokens_per_second": 1394.81 }, { "epoch": 1.4188034188034189, "grad_norm": 0.13741740584373474, "learning_rate": 5.8540772532188846e-05, "loss": 0.2781, "num_input_tokens_seen": 5126070, "step": 830, "train_runtime": 3674.8572, "train_tokens_per_second": 1394.903 }, { "epoch": 1.4205128205128206, "grad_norm": 0.1337319314479828, "learning_rate": 5.8369098712446355e-05, "loss": 0.2903, "num_input_tokens_seen": 5131270, "step": 831, "train_runtime": 3678.3235, "train_tokens_per_second": 1395.002 }, { "epoch": 1.4222222222222223, "grad_norm": 0.14914950728416443, "learning_rate": 5.8197424892703864e-05, "loss": 0.3417, "num_input_tokens_seen": 5136918, "step": 832, "train_runtime": 3682.0496, "train_tokens_per_second": 1395.125 }, { "epoch": 1.423931623931624, "grad_norm": 0.162494957447052, "learning_rate": 5.8025751072961374e-05, "loss": 0.423, "num_input_tokens_seen": 5142158, "step": 833, "train_runtime": 3685.5503, "train_tokens_per_second": 1395.221 }, { "epoch": 1.4256410256410257, "grad_norm": 0.14546248316764832, "learning_rate": 5.785407725321888e-05, "loss": 0.3648, "num_input_tokens_seen": 5148094, "step": 834, "train_runtime": 3689.3363, "train_tokens_per_second": 1395.398 }, { "epoch": 1.4273504273504274, "grad_norm": 0.15214349329471588, "learning_rate": 5.768240343347639e-05, "loss": 0.3288, "num_input_tokens_seen": 5152742, "step": 835, "train_runtime": 3692.4044, "train_tokens_per_second": 1395.498 }, { "epoch": 1.429059829059829, "grad_norm": 0.13268783688545227, "learning_rate": 5.751072961373391e-05, "loss": 0.3101, "num_input_tokens_seen": 5158358, "step": 836, "train_runtime": 3696.043, "train_tokens_per_second": 1395.643 }, { "epoch": 1.4307692307692308, "grad_norm": 0.1861671358346939, "learning_rate": 5.733905579399142e-05, "loss": 0.4137, "num_input_tokens_seen": 5163294, "step": 837, "train_runtime": 3699.3676, "train_tokens_per_second": 1395.723 }, { "epoch": 1.4324786324786325, "grad_norm": 0.13023094832897186, "learning_rate": 5.716738197424893e-05, "loss": 0.3631, "num_input_tokens_seen": 5168686, "step": 838, "train_runtime": 3702.9614, "train_tokens_per_second": 1395.825 }, { "epoch": 1.4341880341880342, "grad_norm": 0.11844179034233093, "learning_rate": 5.699570815450644e-05, "loss": 0.2492, "num_input_tokens_seen": 5177182, "step": 839, "train_runtime": 3708.2961, "train_tokens_per_second": 1396.108 }, { "epoch": 1.435897435897436, "grad_norm": 0.15760420262813568, "learning_rate": 5.682403433476395e-05, "loss": 0.3296, "num_input_tokens_seen": 5181222, "step": 840, "train_runtime": 3711.0998, "train_tokens_per_second": 1396.142 }, { "epoch": 1.4376068376068376, "grad_norm": 0.1670273393392563, "learning_rate": 5.665236051502146e-05, "loss": 0.3472, "num_input_tokens_seen": 5188286, "step": 841, "train_runtime": 3717.6952, "train_tokens_per_second": 1395.565 }, { "epoch": 1.4393162393162393, "grad_norm": 0.16332553327083588, "learning_rate": 5.648068669527897e-05, "loss": 0.3388, "num_input_tokens_seen": 5192998, "step": 842, "train_runtime": 3720.9156, "train_tokens_per_second": 1395.624 }, { "epoch": 1.441025641025641, "grad_norm": 0.15031462907791138, "learning_rate": 5.6309012875536485e-05, "loss": 0.4377, "num_input_tokens_seen": 5198462, "step": 843, "train_runtime": 3724.5247, "train_tokens_per_second": 1395.738 }, { "epoch": 1.4427350427350427, "grad_norm": 0.13682641088962555, "learning_rate": 5.6137339055793995e-05, "loss": 0.2486, "num_input_tokens_seen": 5202982, "step": 844, "train_runtime": 3727.5494, "train_tokens_per_second": 1395.818 }, { "epoch": 1.4444444444444444, "grad_norm": 0.1407112032175064, "learning_rate": 5.5965665236051504e-05, "loss": 0.3894, "num_input_tokens_seen": 5211254, "step": 845, "train_runtime": 3732.8344, "train_tokens_per_second": 1396.058 }, { "epoch": 1.4461538461538461, "grad_norm": 0.16395379602909088, "learning_rate": 5.579399141630901e-05, "loss": 0.5773, "num_input_tokens_seen": 5216782, "step": 846, "train_runtime": 3736.5208, "train_tokens_per_second": 1396.16 }, { "epoch": 1.4478632478632478, "grad_norm": 0.13352353870868683, "learning_rate": 5.562231759656653e-05, "loss": 0.3843, "num_input_tokens_seen": 5222070, "step": 847, "train_runtime": 3740.0075, "train_tokens_per_second": 1396.273 }, { "epoch": 1.4495726495726495, "grad_norm": 0.1692342758178711, "learning_rate": 5.545064377682404e-05, "loss": 0.4467, "num_input_tokens_seen": 5227246, "step": 848, "train_runtime": 3743.4389, "train_tokens_per_second": 1396.375 }, { "epoch": 1.4512820512820512, "grad_norm": 0.15134482085704803, "learning_rate": 5.527896995708155e-05, "loss": 0.241, "num_input_tokens_seen": 5235518, "step": 849, "train_runtime": 3748.4958, "train_tokens_per_second": 1396.698 }, { "epoch": 1.452991452991453, "grad_norm": 0.14503733813762665, "learning_rate": 5.5107296137339056e-05, "loss": 0.3709, "num_input_tokens_seen": 5240966, "step": 850, "train_runtime": 3752.1211, "train_tokens_per_second": 1396.801 }, { "epoch": 1.4547008547008546, "grad_norm": 0.1375107765197754, "learning_rate": 5.493562231759657e-05, "loss": 0.2942, "num_input_tokens_seen": 5245934, "step": 851, "train_runtime": 3755.3802, "train_tokens_per_second": 1396.912 }, { "epoch": 1.4564102564102563, "grad_norm": 0.122276172041893, "learning_rate": 5.476394849785408e-05, "loss": 0.3244, "num_input_tokens_seen": 5253238, "step": 852, "train_runtime": 3759.9878, "train_tokens_per_second": 1397.142 }, { "epoch": 1.458119658119658, "grad_norm": 0.15556900203227997, "learning_rate": 5.459227467811159e-05, "loss": 0.3869, "num_input_tokens_seen": 5259758, "step": 853, "train_runtime": 3764.1834, "train_tokens_per_second": 1397.317 }, { "epoch": 1.4598290598290597, "grad_norm": 0.14983288943767548, "learning_rate": 5.44206008583691e-05, "loss": 0.385, "num_input_tokens_seen": 5265518, "step": 854, "train_runtime": 3767.8711, "train_tokens_per_second": 1397.478 }, { "epoch": 1.4615384615384617, "grad_norm": 0.1455240398645401, "learning_rate": 5.424892703862661e-05, "loss": 0.4104, "num_input_tokens_seen": 5272654, "step": 855, "train_runtime": 3772.3838, "train_tokens_per_second": 1397.698 }, { "epoch": 1.4632478632478634, "grad_norm": 0.19445322453975677, "learning_rate": 5.4077253218884125e-05, "loss": 0.4355, "num_input_tokens_seen": 5279846, "step": 856, "train_runtime": 3776.8801, "train_tokens_per_second": 1397.938 }, { "epoch": 1.464957264957265, "grad_norm": 0.15882650017738342, "learning_rate": 5.3905579399141634e-05, "loss": 0.4704, "num_input_tokens_seen": 5284854, "step": 857, "train_runtime": 3780.1753, "train_tokens_per_second": 1398.045 }, { "epoch": 1.4666666666666668, "grad_norm": 0.14064083993434906, "learning_rate": 5.373390557939915e-05, "loss": 0.4001, "num_input_tokens_seen": 5290262, "step": 858, "train_runtime": 3783.6813, "train_tokens_per_second": 1398.179 }, { "epoch": 1.4683760683760685, "grad_norm": 0.13175015151500702, "learning_rate": 5.356223175965666e-05, "loss": 0.4009, "num_input_tokens_seen": 5299142, "step": 859, "train_runtime": 3789.1831, "train_tokens_per_second": 1398.492 }, { "epoch": 1.4700854700854702, "grad_norm": 0.12459183484315872, "learning_rate": 5.339055793991417e-05, "loss": 0.5154, "num_input_tokens_seen": 5305334, "step": 860, "train_runtime": 3793.1945, "train_tokens_per_second": 1398.645 }, { "epoch": 1.471794871794872, "grad_norm": 0.13496418297290802, "learning_rate": 5.321888412017168e-05, "loss": 0.5302, "num_input_tokens_seen": 5312582, "step": 861, "train_runtime": 3797.8243, "train_tokens_per_second": 1398.849 }, { "epoch": 1.4735042735042736, "grad_norm": 0.12612996995449066, "learning_rate": 5.3047210300429186e-05, "loss": 0.3437, "num_input_tokens_seen": 5318646, "step": 862, "train_runtime": 3801.9229, "train_tokens_per_second": 1398.936 }, { "epoch": 1.4752136752136753, "grad_norm": 0.15236078202724457, "learning_rate": 5.2875536480686695e-05, "loss": 0.3329, "num_input_tokens_seen": 5323214, "step": 863, "train_runtime": 3804.9799, "train_tokens_per_second": 1399.012 }, { "epoch": 1.476923076923077, "grad_norm": 0.14306163787841797, "learning_rate": 5.2703862660944205e-05, "loss": 0.3123, "num_input_tokens_seen": 5328902, "step": 864, "train_runtime": 3808.7041, "train_tokens_per_second": 1399.138 }, { "epoch": 1.4786324786324787, "grad_norm": 0.1255759447813034, "learning_rate": 5.253218884120172e-05, "loss": 0.2965, "num_input_tokens_seen": 5334094, "step": 865, "train_runtime": 3812.1793, "train_tokens_per_second": 1399.224 }, { "epoch": 1.4803418803418804, "grad_norm": 0.15679959952831268, "learning_rate": 5.2360515021459236e-05, "loss": 0.5092, "num_input_tokens_seen": 5339710, "step": 866, "train_runtime": 3815.8784, "train_tokens_per_second": 1399.34 }, { "epoch": 1.4820512820512821, "grad_norm": 0.14153476059436798, "learning_rate": 5.2188841201716746e-05, "loss": 0.3473, "num_input_tokens_seen": 5346190, "step": 867, "train_runtime": 3819.9095, "train_tokens_per_second": 1399.559 }, { "epoch": 1.4837606837606838, "grad_norm": 0.13382677733898163, "learning_rate": 5.2017167381974255e-05, "loss": 0.3588, "num_input_tokens_seen": 5352462, "step": 868, "train_runtime": 3824.0287, "train_tokens_per_second": 1399.692 }, { "epoch": 1.4854700854700855, "grad_norm": 0.16382722556591034, "learning_rate": 5.1845493562231764e-05, "loss": 0.3964, "num_input_tokens_seen": 5356254, "step": 869, "train_runtime": 3826.6221, "train_tokens_per_second": 1399.734 }, { "epoch": 1.4871794871794872, "grad_norm": 0.14120569825172424, "learning_rate": 5.167381974248927e-05, "loss": 0.3463, "num_input_tokens_seen": 5363590, "step": 870, "train_runtime": 3831.2189, "train_tokens_per_second": 1399.97 }, { "epoch": 1.488888888888889, "grad_norm": 0.16003507375717163, "learning_rate": 5.150214592274678e-05, "loss": 0.3489, "num_input_tokens_seen": 5368462, "step": 871, "train_runtime": 3836.5884, "train_tokens_per_second": 1399.28 }, { "epoch": 1.4905982905982906, "grad_norm": 0.1279754787683487, "learning_rate": 5.133047210300429e-05, "loss": 0.341, "num_input_tokens_seen": 5373550, "step": 872, "train_runtime": 3840.064, "train_tokens_per_second": 1399.339 }, { "epoch": 1.4923076923076923, "grad_norm": 0.16718865931034088, "learning_rate": 5.11587982832618e-05, "loss": 0.3997, "num_input_tokens_seen": 5379134, "step": 873, "train_runtime": 3843.6488, "train_tokens_per_second": 1399.486 }, { "epoch": 1.494017094017094, "grad_norm": 0.12986551225185394, "learning_rate": 5.098712446351932e-05, "loss": 0.3132, "num_input_tokens_seen": 5388758, "step": 874, "train_runtime": 3849.7111, "train_tokens_per_second": 1399.782 }, { "epoch": 1.4957264957264957, "grad_norm": 0.1360234171152115, "learning_rate": 5.081545064377683e-05, "loss": 0.2856, "num_input_tokens_seen": 5393182, "step": 875, "train_runtime": 3852.7029, "train_tokens_per_second": 1399.844 }, { "epoch": 1.4974358974358974, "grad_norm": 0.17069897055625916, "learning_rate": 5.064377682403434e-05, "loss": 0.4769, "num_input_tokens_seen": 5398094, "step": 876, "train_runtime": 3856.0373, "train_tokens_per_second": 1399.907 }, { "epoch": 1.4991452991452991, "grad_norm": 0.15237049758434296, "learning_rate": 5.047210300429185e-05, "loss": 0.3108, "num_input_tokens_seen": 5406302, "step": 877, "train_runtime": 3861.1411, "train_tokens_per_second": 1400.182 }, { "epoch": 1.5008547008547009, "grad_norm": 0.18374916911125183, "learning_rate": 5.030042918454936e-05, "loss": 0.3626, "num_input_tokens_seen": 5410838, "step": 878, "train_runtime": 3864.2838, "train_tokens_per_second": 1400.218 }, { "epoch": 1.5025641025641026, "grad_norm": 0.15585371851921082, "learning_rate": 5.012875536480687e-05, "loss": 0.3773, "num_input_tokens_seen": 5417318, "step": 879, "train_runtime": 3868.4233, "train_tokens_per_second": 1400.394 }, { "epoch": 1.5042735042735043, "grad_norm": 0.18755033612251282, "learning_rate": 4.9957081545064385e-05, "loss": 0.4022, "num_input_tokens_seen": 5421910, "step": 880, "train_runtime": 3871.5671, "train_tokens_per_second": 1400.443 }, { "epoch": 1.505982905982906, "grad_norm": 0.1306111067533493, "learning_rate": 4.9785407725321894e-05, "loss": 0.2989, "num_input_tokens_seen": 5427630, "step": 881, "train_runtime": 3875.3642, "train_tokens_per_second": 1400.547 }, { "epoch": 1.5076923076923077, "grad_norm": 0.14471091330051422, "learning_rate": 4.96137339055794e-05, "loss": 0.3487, "num_input_tokens_seen": 5434654, "step": 882, "train_runtime": 3879.7092, "train_tokens_per_second": 1400.789 }, { "epoch": 1.5094017094017094, "grad_norm": 0.1394500881433487, "learning_rate": 4.944206008583691e-05, "loss": 0.3425, "num_input_tokens_seen": 5441006, "step": 883, "train_runtime": 3883.8235, "train_tokens_per_second": 1400.941 }, { "epoch": 1.511111111111111, "grad_norm": 0.1315561830997467, "learning_rate": 4.927038626609442e-05, "loss": 0.2697, "num_input_tokens_seen": 5445926, "step": 884, "train_runtime": 3887.1139, "train_tokens_per_second": 1401.02 }, { "epoch": 1.5128205128205128, "grad_norm": 0.14249852299690247, "learning_rate": 4.909871244635194e-05, "loss": 0.3622, "num_input_tokens_seen": 5452246, "step": 885, "train_runtime": 3891.1997, "train_tokens_per_second": 1401.174 }, { "epoch": 1.5145299145299145, "grad_norm": 0.16895607113838196, "learning_rate": 4.8927038626609446e-05, "loss": 0.4891, "num_input_tokens_seen": 5456854, "step": 886, "train_runtime": 3894.3609, "train_tokens_per_second": 1401.219 }, { "epoch": 1.5162393162393162, "grad_norm": 0.1550210863351822, "learning_rate": 4.8755364806866956e-05, "loss": 0.4051, "num_input_tokens_seen": 5463430, "step": 887, "train_runtime": 3898.5586, "train_tokens_per_second": 1401.397 }, { "epoch": 1.5179487179487179, "grad_norm": 0.1588016301393509, "learning_rate": 4.8583690987124465e-05, "loss": 0.3086, "num_input_tokens_seen": 5468830, "step": 888, "train_runtime": 3902.1609, "train_tokens_per_second": 1401.488 }, { "epoch": 1.5196581196581196, "grad_norm": 0.1528807431459427, "learning_rate": 4.841201716738198e-05, "loss": 0.384, "num_input_tokens_seen": 5474166, "step": 889, "train_runtime": 3905.7353, "train_tokens_per_second": 1401.571 }, { "epoch": 1.5213675213675213, "grad_norm": 0.1336115598678589, "learning_rate": 4.824034334763949e-05, "loss": 0.337, "num_input_tokens_seen": 5480990, "step": 890, "train_runtime": 3910.1338, "train_tokens_per_second": 1401.74 }, { "epoch": 1.523076923076923, "grad_norm": 0.14113153517246246, "learning_rate": 4.8068669527897e-05, "loss": 0.3582, "num_input_tokens_seen": 5487366, "step": 891, "train_runtime": 3914.2226, "train_tokens_per_second": 1401.904 }, { "epoch": 1.5247863247863247, "grad_norm": 0.14740779995918274, "learning_rate": 4.789699570815451e-05, "loss": 0.3241, "num_input_tokens_seen": 5491782, "step": 892, "train_runtime": 3917.2888, "train_tokens_per_second": 1401.934 }, { "epoch": 1.5264957264957264, "grad_norm": 0.1684054136276245, "learning_rate": 4.772532188841202e-05, "loss": 0.3419, "num_input_tokens_seen": 5498598, "step": 893, "train_runtime": 3921.6413, "train_tokens_per_second": 1402.116 }, { "epoch": 1.528205128205128, "grad_norm": 0.1600559949874878, "learning_rate": 4.755364806866953e-05, "loss": 0.3971, "num_input_tokens_seen": 5504558, "step": 894, "train_runtime": 3925.5164, "train_tokens_per_second": 1402.251 }, { "epoch": 1.5299145299145298, "grad_norm": 0.16193747520446777, "learning_rate": 4.738197424892704e-05, "loss": 0.1982, "num_input_tokens_seen": 5518366, "step": 895, "train_runtime": 3933.7663, "train_tokens_per_second": 1402.82 }, { "epoch": 1.5316239316239315, "grad_norm": 0.1655426323413849, "learning_rate": 4.721030042918455e-05, "loss": 0.4295, "num_input_tokens_seen": 5523782, "step": 896, "train_runtime": 3937.3438, "train_tokens_per_second": 1402.921 }, { "epoch": 1.5333333333333332, "grad_norm": 0.18400371074676514, "learning_rate": 4.703862660944206e-05, "loss": 0.4301, "num_input_tokens_seen": 5529142, "step": 897, "train_runtime": 3940.9012, "train_tokens_per_second": 1403.015 }, { "epoch": 1.535042735042735, "grad_norm": 0.1289558857679367, "learning_rate": 4.6866952789699576e-05, "loss": 0.2999, "num_input_tokens_seen": 5536438, "step": 898, "train_runtime": 3945.5414, "train_tokens_per_second": 1403.214 }, { "epoch": 1.5367521367521366, "grad_norm": 0.13847073912620544, "learning_rate": 4.6695278969957086e-05, "loss": 0.4114, "num_input_tokens_seen": 5544542, "step": 899, "train_runtime": 3950.6248, "train_tokens_per_second": 1403.46 }, { "epoch": 1.5384615384615383, "grad_norm": 0.130548357963562, "learning_rate": 4.6523605150214595e-05, "loss": 0.3208, "num_input_tokens_seen": 5551966, "step": 900, "train_runtime": 3955.355, "train_tokens_per_second": 1403.658 }, { "epoch": 1.54017094017094, "grad_norm": 0.12483415752649307, "learning_rate": 4.6351931330472104e-05, "loss": 0.3094, "num_input_tokens_seen": 5559310, "step": 901, "train_runtime": 3962.2691, "train_tokens_per_second": 1403.062 }, { "epoch": 1.5418803418803417, "grad_norm": 0.1626817137002945, "learning_rate": 4.618025751072962e-05, "loss": 0.5097, "num_input_tokens_seen": 5566126, "step": 902, "train_runtime": 3966.5485, "train_tokens_per_second": 1403.267 }, { "epoch": 1.5435897435897434, "grad_norm": 0.12783609330654144, "learning_rate": 4.600858369098713e-05, "loss": 0.376, "num_input_tokens_seen": 5573526, "step": 903, "train_runtime": 3971.1289, "train_tokens_per_second": 1403.512 }, { "epoch": 1.5452991452991451, "grad_norm": 0.12774644792079926, "learning_rate": 4.583690987124464e-05, "loss": 0.3011, "num_input_tokens_seen": 5579950, "step": 904, "train_runtime": 3975.2459, "train_tokens_per_second": 1403.674 }, { "epoch": 1.547008547008547, "grad_norm": 0.13785552978515625, "learning_rate": 4.566523605150215e-05, "loss": 0.2532, "num_input_tokens_seen": 5592222, "step": 905, "train_runtime": 3982.6088, "train_tokens_per_second": 1404.161 }, { "epoch": 1.5487179487179488, "grad_norm": 0.10258350521326065, "learning_rate": 4.5493562231759656e-05, "loss": 0.2478, "num_input_tokens_seen": 5601822, "step": 906, "train_runtime": 3988.4826, "train_tokens_per_second": 1404.5 }, { "epoch": 1.5504273504273505, "grad_norm": 0.14077666401863098, "learning_rate": 4.532188841201717e-05, "loss": 0.2856, "num_input_tokens_seen": 5606942, "step": 907, "train_runtime": 3991.8287, "train_tokens_per_second": 1404.605 }, { "epoch": 1.5521367521367522, "grad_norm": 0.15848904848098755, "learning_rate": 4.515021459227468e-05, "loss": 0.4184, "num_input_tokens_seen": 5611870, "step": 908, "train_runtime": 3995.0262, "train_tokens_per_second": 1404.714 }, { "epoch": 1.5538461538461539, "grad_norm": 0.14436501264572144, "learning_rate": 4.497854077253219e-05, "loss": 0.3977, "num_input_tokens_seen": 5618398, "step": 909, "train_runtime": 3999.2042, "train_tokens_per_second": 1404.879 }, { "epoch": 1.5555555555555556, "grad_norm": 0.13145920634269714, "learning_rate": 4.48068669527897e-05, "loss": 0.3204, "num_input_tokens_seen": 5627286, "step": 910, "train_runtime": 4004.6715, "train_tokens_per_second": 1405.18 }, { "epoch": 1.5572649572649573, "grad_norm": 0.15464188158512115, "learning_rate": 4.4635193133047216e-05, "loss": 0.2961, "num_input_tokens_seen": 5631254, "step": 911, "train_runtime": 4007.4026, "train_tokens_per_second": 1405.213 }, { "epoch": 1.558974358974359, "grad_norm": 0.15370634198188782, "learning_rate": 4.4463519313304725e-05, "loss": 0.3432, "num_input_tokens_seen": 5638078, "step": 912, "train_runtime": 4011.673, "train_tokens_per_second": 1405.418 }, { "epoch": 1.5606837606837607, "grad_norm": 0.11987742781639099, "learning_rate": 4.4291845493562234e-05, "loss": 0.2736, "num_input_tokens_seen": 5647550, "step": 913, "train_runtime": 4017.4402, "train_tokens_per_second": 1405.758 }, { "epoch": 1.5623931623931624, "grad_norm": 0.1432374119758606, "learning_rate": 4.412017167381974e-05, "loss": 0.3456, "num_input_tokens_seen": 5654566, "step": 914, "train_runtime": 4021.8492, "train_tokens_per_second": 1405.962 }, { "epoch": 1.564102564102564, "grad_norm": 0.14146411418914795, "learning_rate": 4.394849785407725e-05, "loss": 0.2831, "num_input_tokens_seen": 5661366, "step": 915, "train_runtime": 4026.1282, "train_tokens_per_second": 1406.156 }, { "epoch": 1.5658119658119658, "grad_norm": 0.1362568885087967, "learning_rate": 4.377682403433477e-05, "loss": 0.3261, "num_input_tokens_seen": 5667022, "step": 916, "train_runtime": 4029.7803, "train_tokens_per_second": 1406.286 }, { "epoch": 1.5675213675213675, "grad_norm": 0.13071489334106445, "learning_rate": 4.360515021459228e-05, "loss": 0.264, "num_input_tokens_seen": 5674158, "step": 917, "train_runtime": 4034.3501, "train_tokens_per_second": 1406.461 }, { "epoch": 1.5692307692307692, "grad_norm": 0.1308346837759018, "learning_rate": 4.3433476394849786e-05, "loss": 0.2655, "num_input_tokens_seen": 5681038, "step": 918, "train_runtime": 4038.6578, "train_tokens_per_second": 1406.665 }, { "epoch": 1.570940170940171, "grad_norm": 0.14354775846004486, "learning_rate": 4.3261802575107296e-05, "loss": 0.3548, "num_input_tokens_seen": 5689142, "step": 919, "train_runtime": 4043.681, "train_tokens_per_second": 1406.922 }, { "epoch": 1.5726495726495726, "grad_norm": 0.14994634687900543, "learning_rate": 4.309012875536481e-05, "loss": 0.3652, "num_input_tokens_seen": 5694430, "step": 920, "train_runtime": 4047.0891, "train_tokens_per_second": 1407.043 }, { "epoch": 1.5743589743589743, "grad_norm": 0.14056207239627838, "learning_rate": 4.291845493562232e-05, "loss": 0.2809, "num_input_tokens_seen": 5699694, "step": 921, "train_runtime": 4050.4592, "train_tokens_per_second": 1407.172 }, { "epoch": 1.576068376068376, "grad_norm": 0.1594097912311554, "learning_rate": 4.274678111587983e-05, "loss": 0.4683, "num_input_tokens_seen": 5706182, "step": 922, "train_runtime": 4054.6337, "train_tokens_per_second": 1407.324 }, { "epoch": 1.5777777777777777, "grad_norm": 0.16299133002758026, "learning_rate": 4.257510729613734e-05, "loss": 0.4031, "num_input_tokens_seen": 5711566, "step": 923, "train_runtime": 4058.0973, "train_tokens_per_second": 1407.449 }, { "epoch": 1.5794871794871796, "grad_norm": 0.18204393982887268, "learning_rate": 4.240343347639485e-05, "loss": 0.4191, "num_input_tokens_seen": 5717422, "step": 924, "train_runtime": 4061.8526, "train_tokens_per_second": 1407.59 }, { "epoch": 1.5811965811965814, "grad_norm": 0.16016630828380585, "learning_rate": 4.2231759656652364e-05, "loss": 0.3527, "num_input_tokens_seen": 5721734, "step": 925, "train_runtime": 4064.8253, "train_tokens_per_second": 1407.621 }, { "epoch": 1.582905982905983, "grad_norm": 0.15261352062225342, "learning_rate": 4.206008583690987e-05, "loss": 0.2939, "num_input_tokens_seen": 5726726, "step": 926, "train_runtime": 4068.1454, "train_tokens_per_second": 1407.699 }, { "epoch": 1.5846153846153848, "grad_norm": 0.14059829711914062, "learning_rate": 4.188841201716738e-05, "loss": 0.345, "num_input_tokens_seen": 5732878, "step": 927, "train_runtime": 4072.1298, "train_tokens_per_second": 1407.833 }, { "epoch": 1.5863247863247865, "grad_norm": 0.15168927609920502, "learning_rate": 4.171673819742489e-05, "loss": 0.2833, "num_input_tokens_seen": 5738606, "step": 928, "train_runtime": 4075.9083, "train_tokens_per_second": 1407.933 }, { "epoch": 1.5880341880341882, "grad_norm": 0.14608868956565857, "learning_rate": 4.154506437768241e-05, "loss": 0.3264, "num_input_tokens_seen": 5744222, "step": 929, "train_runtime": 4079.5662, "train_tokens_per_second": 1408.047 }, { "epoch": 1.5897435897435899, "grad_norm": 0.13235428929328918, "learning_rate": 4.1373390557939917e-05, "loss": 0.3547, "num_input_tokens_seen": 5751422, "step": 930, "train_runtime": 4084.0105, "train_tokens_per_second": 1408.278 }, { "epoch": 1.5914529914529916, "grad_norm": 0.15778063237667084, "learning_rate": 4.1201716738197426e-05, "loss": 0.3659, "num_input_tokens_seen": 5757270, "step": 931, "train_runtime": 4089.841, "train_tokens_per_second": 1407.7 }, { "epoch": 1.5931623931623933, "grad_norm": 0.14234130084514618, "learning_rate": 4.1030042918454935e-05, "loss": 0.3474, "num_input_tokens_seen": 5763062, "step": 932, "train_runtime": 4093.5857, "train_tokens_per_second": 1407.827 }, { "epoch": 1.594871794871795, "grad_norm": 0.15950438380241394, "learning_rate": 4.0858369098712444e-05, "loss": 0.3991, "num_input_tokens_seen": 5769542, "step": 933, "train_runtime": 4097.7094, "train_tokens_per_second": 1407.992 }, { "epoch": 1.5965811965811967, "grad_norm": 0.15297670662403107, "learning_rate": 4.068669527896996e-05, "loss": 0.4014, "num_input_tokens_seen": 5777038, "step": 934, "train_runtime": 4102.3551, "train_tokens_per_second": 1408.225 }, { "epoch": 1.5982905982905984, "grad_norm": 0.14198969304561615, "learning_rate": 4.051502145922747e-05, "loss": 0.324, "num_input_tokens_seen": 5783518, "step": 935, "train_runtime": 4106.4425, "train_tokens_per_second": 1408.401 }, { "epoch": 1.6, "grad_norm": 0.18063846230506897, "learning_rate": 4.034334763948498e-05, "loss": 0.2441, "num_input_tokens_seen": 5789382, "step": 936, "train_runtime": 4110.1508, "train_tokens_per_second": 1408.557 }, { "epoch": 1.6, "eval_loss": 0.4057992100715637, "eval_runtime": 39.8829, "eval_samples_per_second": 25.023, "eval_steps_per_second": 3.134, "num_input_tokens_seen": 5789382, "step": 936 }, { "epoch": 1.6017094017094018, "grad_norm": 0.17349766194820404, "learning_rate": 4.017167381974249e-05, "loss": 0.4031, "num_input_tokens_seen": 5793958, "step": 937, "train_runtime": 4153.1322, "train_tokens_per_second": 1395.082 }, { "epoch": 1.6034188034188035, "grad_norm": 0.14728385210037231, "learning_rate": 4e-05, "loss": 0.3286, "num_input_tokens_seen": 5801366, "step": 938, "train_runtime": 4157.8001, "train_tokens_per_second": 1395.297 }, { "epoch": 1.6051282051282052, "grad_norm": 0.15259931981563568, "learning_rate": 3.982832618025751e-05, "loss": 0.3429, "num_input_tokens_seen": 5807702, "step": 939, "train_runtime": 4161.8686, "train_tokens_per_second": 1395.455 }, { "epoch": 1.606837606837607, "grad_norm": 0.15199637413024902, "learning_rate": 3.965665236051502e-05, "loss": 0.3543, "num_input_tokens_seen": 5814662, "step": 940, "train_runtime": 4166.1977, "train_tokens_per_second": 1395.676 }, { "epoch": 1.6085470085470086, "grad_norm": 0.16361570358276367, "learning_rate": 3.948497854077253e-05, "loss": 0.367, "num_input_tokens_seen": 5819478, "step": 941, "train_runtime": 4169.3434, "train_tokens_per_second": 1395.778 }, { "epoch": 1.6102564102564103, "grad_norm": 0.1512775421142578, "learning_rate": 3.931330472103004e-05, "loss": 0.338, "num_input_tokens_seen": 5826830, "step": 942, "train_runtime": 4173.9012, "train_tokens_per_second": 1396.015 }, { "epoch": 1.611965811965812, "grad_norm": 0.1339310258626938, "learning_rate": 3.9141630901287556e-05, "loss": 0.3077, "num_input_tokens_seen": 5833174, "step": 943, "train_runtime": 4178.0154, "train_tokens_per_second": 1396.159 }, { "epoch": 1.6136752136752137, "grad_norm": 0.17570827901363373, "learning_rate": 3.8969957081545065e-05, "loss": 0.3698, "num_input_tokens_seen": 5837766, "step": 944, "train_runtime": 4181.1294, "train_tokens_per_second": 1396.217 }, { "epoch": 1.6153846153846154, "grad_norm": 0.1571483314037323, "learning_rate": 3.8798283261802574e-05, "loss": 0.4129, "num_input_tokens_seen": 5843358, "step": 945, "train_runtime": 4184.7637, "train_tokens_per_second": 1396.341 }, { "epoch": 1.6170940170940171, "grad_norm": 0.1724429428577423, "learning_rate": 3.862660944206008e-05, "loss": 0.4613, "num_input_tokens_seen": 5849022, "step": 946, "train_runtime": 4188.4421, "train_tokens_per_second": 1396.467 }, { "epoch": 1.6188034188034188, "grad_norm": 0.1553131341934204, "learning_rate": 3.84549356223176e-05, "loss": 0.3879, "num_input_tokens_seen": 5854078, "step": 947, "train_runtime": 4191.7577, "train_tokens_per_second": 1396.569 }, { "epoch": 1.6205128205128205, "grad_norm": 0.12425386160612106, "learning_rate": 3.828326180257511e-05, "loss": 0.2773, "num_input_tokens_seen": 5861006, "step": 948, "train_runtime": 4196.1024, "train_tokens_per_second": 1396.774 }, { "epoch": 1.6222222222222222, "grad_norm": 0.14096501469612122, "learning_rate": 3.811158798283262e-05, "loss": 0.34, "num_input_tokens_seen": 5865774, "step": 949, "train_runtime": 4199.3625, "train_tokens_per_second": 1396.825 }, { "epoch": 1.623931623931624, "grad_norm": 0.1395706981420517, "learning_rate": 3.7939914163090127e-05, "loss": 0.3407, "num_input_tokens_seen": 5871974, "step": 950, "train_runtime": 4203.3207, "train_tokens_per_second": 1396.985 }, { "epoch": 1.6256410256410256, "grad_norm": 0.17341846227645874, "learning_rate": 3.776824034334764e-05, "loss": 0.4103, "num_input_tokens_seen": 5877782, "step": 951, "train_runtime": 4207.092, "train_tokens_per_second": 1397.113 }, { "epoch": 1.6273504273504273, "grad_norm": 0.13125059008598328, "learning_rate": 3.759656652360515e-05, "loss": 0.2613, "num_input_tokens_seen": 5884166, "step": 952, "train_runtime": 4211.2144, "train_tokens_per_second": 1397.261 }, { "epoch": 1.629059829059829, "grad_norm": 0.15653657913208008, "learning_rate": 3.742489270386266e-05, "loss": 0.348, "num_input_tokens_seen": 5890622, "step": 953, "train_runtime": 4215.4326, "train_tokens_per_second": 1397.394 }, { "epoch": 1.6307692307692307, "grad_norm": 0.16723714768886566, "learning_rate": 3.725321888412017e-05, "loss": 0.4219, "num_input_tokens_seen": 5895502, "step": 954, "train_runtime": 4218.7165, "train_tokens_per_second": 1397.463 }, { "epoch": 1.6324786324786325, "grad_norm": 0.146444633603096, "learning_rate": 3.708154506437768e-05, "loss": 0.2672, "num_input_tokens_seen": 5901414, "step": 955, "train_runtime": 4222.6691, "train_tokens_per_second": 1397.555 }, { "epoch": 1.6341880341880342, "grad_norm": 0.11249315738677979, "learning_rate": 3.6909871244635195e-05, "loss": 0.2149, "num_input_tokens_seen": 5909254, "step": 956, "train_runtime": 4227.5922, "train_tokens_per_second": 1397.782 }, { "epoch": 1.6358974358974359, "grad_norm": 0.14980441331863403, "learning_rate": 3.6738197424892704e-05, "loss": 0.3522, "num_input_tokens_seen": 5914310, "step": 957, "train_runtime": 4231.0393, "train_tokens_per_second": 1397.839 }, { "epoch": 1.6376068376068376, "grad_norm": 0.13074517250061035, "learning_rate": 3.656652360515021e-05, "loss": 0.2345, "num_input_tokens_seen": 5921494, "step": 958, "train_runtime": 4235.5622, "train_tokens_per_second": 1398.042 }, { "epoch": 1.6393162393162393, "grad_norm": 0.14216265082359314, "learning_rate": 3.639484978540772e-05, "loss": 0.3773, "num_input_tokens_seen": 5927062, "step": 959, "train_runtime": 4239.1985, "train_tokens_per_second": 1398.156 }, { "epoch": 1.641025641025641, "grad_norm": 0.16056610643863678, "learning_rate": 3.622317596566524e-05, "loss": 0.3857, "num_input_tokens_seen": 5934134, "step": 960, "train_runtime": 4243.7395, "train_tokens_per_second": 1398.327 }, { "epoch": 1.6427350427350427, "grad_norm": 0.1462031453847885, "learning_rate": 3.605150214592275e-05, "loss": 0.3269, "num_input_tokens_seen": 5939398, "step": 961, "train_runtime": 4249.3319, "train_tokens_per_second": 1397.725 }, { "epoch": 1.6444444444444444, "grad_norm": 0.1907830536365509, "learning_rate": 3.587982832618026e-05, "loss": 0.5159, "num_input_tokens_seen": 5944502, "step": 962, "train_runtime": 4252.8018, "train_tokens_per_second": 1397.785 }, { "epoch": 1.646153846153846, "grad_norm": 0.16608525812625885, "learning_rate": 3.5708154506437766e-05, "loss": 0.3244, "num_input_tokens_seen": 5950342, "step": 963, "train_runtime": 4256.5589, "train_tokens_per_second": 1397.923 }, { "epoch": 1.6478632478632478, "grad_norm": 0.14312684535980225, "learning_rate": 3.5536480686695275e-05, "loss": 0.3154, "num_input_tokens_seen": 5955310, "step": 964, "train_runtime": 4259.9178, "train_tokens_per_second": 1397.987 }, { "epoch": 1.6495726495726495, "grad_norm": 0.12518402934074402, "learning_rate": 3.536480686695279e-05, "loss": 0.3291, "num_input_tokens_seen": 5965774, "step": 965, "train_runtime": 4266.2276, "train_tokens_per_second": 1398.372 }, { "epoch": 1.6512820512820512, "grad_norm": 0.13345399498939514, "learning_rate": 3.51931330472103e-05, "loss": 0.3288, "num_input_tokens_seen": 5973430, "step": 966, "train_runtime": 4271.1227, "train_tokens_per_second": 1398.562 }, { "epoch": 1.652991452991453, "grad_norm": 0.14265747368335724, "learning_rate": 3.502145922746781e-05, "loss": 0.3364, "num_input_tokens_seen": 5978654, "step": 967, "train_runtime": 4274.6629, "train_tokens_per_second": 1398.626 }, { "epoch": 1.6547008547008546, "grad_norm": 0.16501638293266296, "learning_rate": 3.484978540772532e-05, "loss": 0.3486, "num_input_tokens_seen": 5983806, "step": 968, "train_runtime": 4278.033, "train_tokens_per_second": 1398.728 }, { "epoch": 1.6564102564102563, "grad_norm": 0.1431581974029541, "learning_rate": 3.4678111587982834e-05, "loss": 0.3881, "num_input_tokens_seen": 5993574, "step": 969, "train_runtime": 4284.1459, "train_tokens_per_second": 1399.013 }, { "epoch": 1.658119658119658, "grad_norm": 0.14108191430568695, "learning_rate": 3.450643776824034e-05, "loss": 0.3189, "num_input_tokens_seen": 6000262, "step": 970, "train_runtime": 4288.3925, "train_tokens_per_second": 1399.187 }, { "epoch": 1.6598290598290597, "grad_norm": 0.16081646084785461, "learning_rate": 3.433476394849785e-05, "loss": 0.3586, "num_input_tokens_seen": 6005062, "step": 971, "train_runtime": 4291.5438, "train_tokens_per_second": 1399.278 }, { "epoch": 1.6615384615384614, "grad_norm": 0.16049602627754211, "learning_rate": 3.416309012875537e-05, "loss": 0.3027, "num_input_tokens_seen": 6009998, "step": 972, "train_runtime": 4294.9154, "train_tokens_per_second": 1399.329 }, { "epoch": 1.6632478632478631, "grad_norm": 0.14511296153068542, "learning_rate": 3.399141630901288e-05, "loss": 0.358, "num_input_tokens_seen": 6017742, "step": 973, "train_runtime": 4299.8283, "train_tokens_per_second": 1399.531 }, { "epoch": 1.6649572649572648, "grad_norm": 0.1554926484823227, "learning_rate": 3.381974248927039e-05, "loss": 0.3312, "num_input_tokens_seen": 6024430, "step": 974, "train_runtime": 4304.1438, "train_tokens_per_second": 1399.681 }, { "epoch": 1.6666666666666665, "grad_norm": 0.163766011595726, "learning_rate": 3.3648068669527896e-05, "loss": 0.38, "num_input_tokens_seen": 6030750, "step": 975, "train_runtime": 4308.2834, "train_tokens_per_second": 1399.803 }, { "epoch": 1.6683760683760682, "grad_norm": 0.18036513030529022, "learning_rate": 3.347639484978541e-05, "loss": 0.4304, "num_input_tokens_seen": 6035278, "step": 976, "train_runtime": 4311.3418, "train_tokens_per_second": 1399.861 }, { "epoch": 1.67008547008547, "grad_norm": 0.16275691986083984, "learning_rate": 3.330472103004292e-05, "loss": 0.3478, "num_input_tokens_seen": 6041366, "step": 977, "train_runtime": 4315.3401, "train_tokens_per_second": 1399.974 }, { "epoch": 1.6717948717948716, "grad_norm": 0.13549788296222687, "learning_rate": 3.313304721030043e-05, "loss": 0.3254, "num_input_tokens_seen": 6047142, "step": 978, "train_runtime": 4319.1359, "train_tokens_per_second": 1400.081 }, { "epoch": 1.6735042735042736, "grad_norm": 0.15927636623382568, "learning_rate": 3.296137339055794e-05, "loss": 0.3495, "num_input_tokens_seen": 6053086, "step": 979, "train_runtime": 4322.9032, "train_tokens_per_second": 1400.236 }, { "epoch": 1.6752136752136753, "grad_norm": 0.14179955422878265, "learning_rate": 3.2789699570815455e-05, "loss": 0.3902, "num_input_tokens_seen": 6060382, "step": 980, "train_runtime": 4327.5542, "train_tokens_per_second": 1400.417 }, { "epoch": 1.676923076923077, "grad_norm": 0.13718022406101227, "learning_rate": 3.2618025751072964e-05, "loss": 0.325, "num_input_tokens_seen": 6067214, "step": 981, "train_runtime": 4331.8978, "train_tokens_per_second": 1400.59 }, { "epoch": 1.6786324786324787, "grad_norm": 0.14240792393684387, "learning_rate": 3.2446351931330473e-05, "loss": 0.3153, "num_input_tokens_seen": 6072542, "step": 982, "train_runtime": 4335.4612, "train_tokens_per_second": 1400.668 }, { "epoch": 1.6803418803418804, "grad_norm": 0.17063497006893158, "learning_rate": 3.227467811158798e-05, "loss": 0.3474, "num_input_tokens_seen": 6077822, "step": 983, "train_runtime": 4339.0337, "train_tokens_per_second": 1400.732 }, { "epoch": 1.682051282051282, "grad_norm": 0.1793319284915924, "learning_rate": 3.21030042918455e-05, "loss": 0.3506, "num_input_tokens_seen": 6082414, "step": 984, "train_runtime": 4342.1991, "train_tokens_per_second": 1400.768 }, { "epoch": 1.6837606837606838, "grad_norm": 0.15594610571861267, "learning_rate": 3.193133047210301e-05, "loss": 0.3521, "num_input_tokens_seen": 6088374, "step": 985, "train_runtime": 4346.1065, "train_tokens_per_second": 1400.88 }, { "epoch": 1.6854700854700855, "grad_norm": 0.1668577343225479, "learning_rate": 3.175965665236052e-05, "loss": 0.3075, "num_input_tokens_seen": 6099598, "step": 986, "train_runtime": 4353.0219, "train_tokens_per_second": 1401.233 }, { "epoch": 1.6871794871794872, "grad_norm": 0.15573537349700928, "learning_rate": 3.158798283261803e-05, "loss": 0.3101, "num_input_tokens_seen": 6106238, "step": 987, "train_runtime": 4357.3365, "train_tokens_per_second": 1401.369 }, { "epoch": 1.6888888888888889, "grad_norm": 0.1659414917230606, "learning_rate": 3.141630901287554e-05, "loss": 0.3679, "num_input_tokens_seen": 6112990, "step": 988, "train_runtime": 4361.6346, "train_tokens_per_second": 1401.536 }, { "epoch": 1.6905982905982906, "grad_norm": 0.13771456480026245, "learning_rate": 3.124463519313305e-05, "loss": 0.2698, "num_input_tokens_seen": 6121190, "step": 989, "train_runtime": 4366.785, "train_tokens_per_second": 1401.761 }, { "epoch": 1.6923076923076923, "grad_norm": 0.17398853600025177, "learning_rate": 3.107296137339056e-05, "loss": 0.3585, "num_input_tokens_seen": 6126838, "step": 990, "train_runtime": 4370.4426, "train_tokens_per_second": 1401.88 }, { "epoch": 1.694017094017094, "grad_norm": 0.16992250084877014, "learning_rate": 3.0901287553648076e-05, "loss": 0.3688, "num_input_tokens_seen": 6132214, "step": 991, "train_runtime": 4376.044, "train_tokens_per_second": 1401.315 }, { "epoch": 1.6957264957264957, "grad_norm": 0.14736062288284302, "learning_rate": 3.0729613733905585e-05, "loss": 0.4102, "num_input_tokens_seen": 6139086, "step": 992, "train_runtime": 4380.4121, "train_tokens_per_second": 1401.486 }, { "epoch": 1.6974358974358974, "grad_norm": 0.09231652319431305, "learning_rate": 3.0557939914163094e-05, "loss": 0.1844, "num_input_tokens_seen": 6149238, "step": 993, "train_runtime": 4386.5474, "train_tokens_per_second": 1401.84 }, { "epoch": 1.699145299145299, "grad_norm": 0.17811483144760132, "learning_rate": 3.03862660944206e-05, "loss": 0.4097, "num_input_tokens_seen": 6154366, "step": 994, "train_runtime": 4389.9507, "train_tokens_per_second": 1401.921 }, { "epoch": 1.7008547008547008, "grad_norm": 0.15624217689037323, "learning_rate": 3.021459227467811e-05, "loss": 0.3516, "num_input_tokens_seen": 6159286, "step": 995, "train_runtime": 4393.3511, "train_tokens_per_second": 1401.956 }, { "epoch": 1.7025641025641025, "grad_norm": 0.1756419837474823, "learning_rate": 3.0042918454935625e-05, "loss": 0.3392, "num_input_tokens_seen": 6164166, "step": 996, "train_runtime": 4396.6508, "train_tokens_per_second": 1402.014 }, { "epoch": 1.7042735042735044, "grad_norm": 0.11751808226108551, "learning_rate": 2.9871244635193134e-05, "loss": 0.2156, "num_input_tokens_seen": 6172630, "step": 997, "train_runtime": 4401.9216, "train_tokens_per_second": 1402.258 }, { "epoch": 1.7059829059829061, "grad_norm": 0.1824459284543991, "learning_rate": 2.9699570815450643e-05, "loss": 0.3685, "num_input_tokens_seen": 6177326, "step": 998, "train_runtime": 4405.0787, "train_tokens_per_second": 1402.319 }, { "epoch": 1.7076923076923078, "grad_norm": 0.15616580843925476, "learning_rate": 2.9527896995708153e-05, "loss": 0.3737, "num_input_tokens_seen": 6182622, "step": 999, "train_runtime": 4408.5719, "train_tokens_per_second": 1402.409 }, { "epoch": 1.7094017094017095, "grad_norm": 0.1718655824661255, "learning_rate": 2.935622317596567e-05, "loss": 0.4426, "num_input_tokens_seen": 6189630, "step": 1000, "train_runtime": 4412.9794, "train_tokens_per_second": 1402.597 }, { "epoch": 1.7111111111111112, "grad_norm": 0.14478078484535217, "learning_rate": 2.9184549356223178e-05, "loss": 0.2377, "num_input_tokens_seen": 6196462, "step": 1001, "train_runtime": 4417.29, "train_tokens_per_second": 1402.775 }, { "epoch": 1.712820512820513, "grad_norm": 0.14062879979610443, "learning_rate": 2.9012875536480687e-05, "loss": 0.2676, "num_input_tokens_seen": 6204102, "step": 1002, "train_runtime": 4422.1082, "train_tokens_per_second": 1402.974 }, { "epoch": 1.7145299145299147, "grad_norm": 0.13248053193092346, "learning_rate": 2.8841201716738196e-05, "loss": 0.3631, "num_input_tokens_seen": 6210486, "step": 1003, "train_runtime": 4426.2686, "train_tokens_per_second": 1403.097 }, { "epoch": 1.7162393162393164, "grad_norm": 0.1455918848514557, "learning_rate": 2.866952789699571e-05, "loss": 0.3268, "num_input_tokens_seen": 6216734, "step": 1004, "train_runtime": 4430.3644, "train_tokens_per_second": 1403.211 }, { "epoch": 1.717948717948718, "grad_norm": 0.16086509823799133, "learning_rate": 2.849785407725322e-05, "loss": 0.2984, "num_input_tokens_seen": 6221590, "step": 1005, "train_runtime": 4433.6172, "train_tokens_per_second": 1403.276 }, { "epoch": 1.7196581196581198, "grad_norm": 0.24680602550506592, "learning_rate": 2.832618025751073e-05, "loss": 0.3334, "num_input_tokens_seen": 6229086, "step": 1006, "train_runtime": 4438.3525, "train_tokens_per_second": 1403.468 }, { "epoch": 1.7213675213675215, "grad_norm": 0.15239591896533966, "learning_rate": 2.8154506437768243e-05, "loss": 0.3622, "num_input_tokens_seen": 6235030, "step": 1007, "train_runtime": 4442.1313, "train_tokens_per_second": 1403.612 }, { "epoch": 1.7230769230769232, "grad_norm": 0.18432646989822388, "learning_rate": 2.7982832618025752e-05, "loss": 0.4047, "num_input_tokens_seen": 6240934, "step": 1008, "train_runtime": 4446.0001, "train_tokens_per_second": 1403.719 }, { "epoch": 1.7247863247863249, "grad_norm": 0.15836463868618011, "learning_rate": 2.7811158798283264e-05, "loss": 0.3048, "num_input_tokens_seen": 6249862, "step": 1009, "train_runtime": 4451.485, "train_tokens_per_second": 1403.995 }, { "epoch": 1.7264957264957266, "grad_norm": 0.15719516575336456, "learning_rate": 2.7639484978540774e-05, "loss": 0.3226, "num_input_tokens_seen": 6257486, "step": 1010, "train_runtime": 4456.2732, "train_tokens_per_second": 1404.197 }, { "epoch": 1.7282051282051283, "grad_norm": 0.15233346819877625, "learning_rate": 2.7467811158798286e-05, "loss": 0.3904, "num_input_tokens_seen": 6263398, "step": 1011, "train_runtime": 4460.0746, "train_tokens_per_second": 1404.326 }, { "epoch": 1.72991452991453, "grad_norm": 0.16483135521411896, "learning_rate": 2.7296137339055795e-05, "loss": 0.3194, "num_input_tokens_seen": 6267510, "step": 1012, "train_runtime": 4462.9455, "train_tokens_per_second": 1404.344 }, { "epoch": 1.7316239316239317, "grad_norm": 0.12890520691871643, "learning_rate": 2.7124463519313304e-05, "loss": 0.278, "num_input_tokens_seen": 6274342, "step": 1013, "train_runtime": 4467.431, "train_tokens_per_second": 1404.463 }, { "epoch": 1.7333333333333334, "grad_norm": 0.14849728345870972, "learning_rate": 2.6952789699570817e-05, "loss": 0.3502, "num_input_tokens_seen": 6279782, "step": 1014, "train_runtime": 4471.0355, "train_tokens_per_second": 1404.548 }, { "epoch": 1.735042735042735, "grad_norm": 0.15156908333301544, "learning_rate": 2.678111587982833e-05, "loss": 0.2686, "num_input_tokens_seen": 6286150, "step": 1015, "train_runtime": 4475.1422, "train_tokens_per_second": 1404.682 }, { "epoch": 1.7367521367521368, "grad_norm": 0.167219877243042, "learning_rate": 2.660944206008584e-05, "loss": 0.3783, "num_input_tokens_seen": 6291254, "step": 1016, "train_runtime": 4478.5112, "train_tokens_per_second": 1404.765 }, { "epoch": 1.7384615384615385, "grad_norm": 0.11013533920049667, "learning_rate": 2.6437768240343348e-05, "loss": 0.2325, "num_input_tokens_seen": 6297734, "step": 1017, "train_runtime": 4482.7092, "train_tokens_per_second": 1404.895 }, { "epoch": 1.7401709401709402, "grad_norm": 0.14911878108978271, "learning_rate": 2.626609442060086e-05, "loss": 0.3542, "num_input_tokens_seen": 6304838, "step": 1018, "train_runtime": 4487.1017, "train_tokens_per_second": 1405.103 }, { "epoch": 1.741880341880342, "grad_norm": 0.15777182579040527, "learning_rate": 2.6094420600858373e-05, "loss": 0.399, "num_input_tokens_seen": 6310614, "step": 1019, "train_runtime": 4490.9301, "train_tokens_per_second": 1405.191 }, { "epoch": 1.7435897435897436, "grad_norm": 0.13833945989608765, "learning_rate": 2.5922746781115882e-05, "loss": 0.337, "num_input_tokens_seen": 6318622, "step": 1020, "train_runtime": 4495.9494, "train_tokens_per_second": 1405.403 }, { "epoch": 1.7452991452991453, "grad_norm": 0.1786230504512787, "learning_rate": 2.575107296137339e-05, "loss": 0.331, "num_input_tokens_seen": 6324174, "step": 1021, "train_runtime": 4501.5449, "train_tokens_per_second": 1404.89 }, { "epoch": 1.747008547008547, "grad_norm": 0.12603215873241425, "learning_rate": 2.55793991416309e-05, "loss": 0.2773, "num_input_tokens_seen": 6332590, "step": 1022, "train_runtime": 4506.7954, "train_tokens_per_second": 1405.12 }, { "epoch": 1.7487179487179487, "grad_norm": 0.18076284229755402, "learning_rate": 2.5407725321888416e-05, "loss": 0.3666, "num_input_tokens_seen": 6337286, "step": 1023, "train_runtime": 4509.9478, "train_tokens_per_second": 1405.179 }, { "epoch": 1.7504273504273504, "grad_norm": 0.15938463807106018, "learning_rate": 2.5236051502145925e-05, "loss": 0.3929, "num_input_tokens_seen": 6342718, "step": 1024, "train_runtime": 4513.6662, "train_tokens_per_second": 1405.225 }, { "epoch": 1.7521367521367521, "grad_norm": 0.14623907208442688, "learning_rate": 2.5064377682403434e-05, "loss": 0.2741, "num_input_tokens_seen": 6347494, "step": 1025, "train_runtime": 4516.821, "train_tokens_per_second": 1405.301 }, { "epoch": 1.7538461538461538, "grad_norm": 0.13452006876468658, "learning_rate": 2.4892703862660947e-05, "loss": 0.3146, "num_input_tokens_seen": 6353366, "step": 1026, "train_runtime": 4520.7165, "train_tokens_per_second": 1405.389 }, { "epoch": 1.7555555555555555, "grad_norm": 0.09792611002922058, "learning_rate": 2.4721030042918456e-05, "loss": 0.24, "num_input_tokens_seen": 6368022, "step": 1027, "train_runtime": 4529.5761, "train_tokens_per_second": 1405.876 }, { "epoch": 1.7572649572649572, "grad_norm": 0.1469515562057495, "learning_rate": 2.454935622317597e-05, "loss": 0.2991, "num_input_tokens_seen": 6373742, "step": 1028, "train_runtime": 4533.4245, "train_tokens_per_second": 1405.944 }, { "epoch": 1.758974358974359, "grad_norm": 0.14302274584770203, "learning_rate": 2.4377682403433478e-05, "loss": 0.4099, "num_input_tokens_seen": 6380934, "step": 1029, "train_runtime": 4538.0583, "train_tokens_per_second": 1406.093 }, { "epoch": 1.7606837606837606, "grad_norm": 0.1585194617509842, "learning_rate": 2.420600858369099e-05, "loss": 0.3884, "num_input_tokens_seen": 6384662, "step": 1030, "train_runtime": 4540.8411, "train_tokens_per_second": 1406.053 }, { "epoch": 1.7623931623931623, "grad_norm": 0.16706667840480804, "learning_rate": 2.40343347639485e-05, "loss": 0.3835, "num_input_tokens_seen": 6389966, "step": 1031, "train_runtime": 4544.4381, "train_tokens_per_second": 1406.107 }, { "epoch": 1.764102564102564, "grad_norm": 0.15659315884113312, "learning_rate": 2.386266094420601e-05, "loss": 0.3452, "num_input_tokens_seen": 6395846, "step": 1032, "train_runtime": 4548.2609, "train_tokens_per_second": 1406.218 }, { "epoch": 1.7658119658119658, "grad_norm": 0.15282271802425385, "learning_rate": 2.369098712446352e-05, "loss": 0.3265, "num_input_tokens_seen": 6402358, "step": 1033, "train_runtime": 4552.448, "train_tokens_per_second": 1406.355 }, { "epoch": 1.7675213675213675, "grad_norm": 0.15687775611877441, "learning_rate": 2.351931330472103e-05, "loss": 0.3049, "num_input_tokens_seen": 6407302, "step": 1034, "train_runtime": 4555.7062, "train_tokens_per_second": 1406.434 }, { "epoch": 1.7692307692307692, "grad_norm": 0.17506225407123566, "learning_rate": 2.3347639484978543e-05, "loss": 0.477, "num_input_tokens_seen": 6411742, "step": 1035, "train_runtime": 4558.7076, "train_tokens_per_second": 1406.482 }, { "epoch": 1.7709401709401709, "grad_norm": 0.16328084468841553, "learning_rate": 2.3175965665236052e-05, "loss": 0.3114, "num_input_tokens_seen": 6419462, "step": 1036, "train_runtime": 4563.6036, "train_tokens_per_second": 1406.665 }, { "epoch": 1.7726495726495726, "grad_norm": 0.20261751115322113, "learning_rate": 2.3004291845493564e-05, "loss": 0.2963, "num_input_tokens_seen": 6426198, "step": 1037, "train_runtime": 4567.8768, "train_tokens_per_second": 1406.824 }, { "epoch": 1.7743589743589743, "grad_norm": 0.15363574028015137, "learning_rate": 2.2832618025751074e-05, "loss": 0.3716, "num_input_tokens_seen": 6432110, "step": 1038, "train_runtime": 4571.7893, "train_tokens_per_second": 1406.913 }, { "epoch": 1.776068376068376, "grad_norm": 0.16166916489601135, "learning_rate": 2.2660944206008586e-05, "loss": 0.3069, "num_input_tokens_seen": 6436894, "step": 1039, "train_runtime": 4575.0332, "train_tokens_per_second": 1406.961 }, { "epoch": 1.7777777777777777, "grad_norm": 0.13780422508716583, "learning_rate": 2.2489270386266095e-05, "loss": 0.32, "num_input_tokens_seen": 6442478, "step": 1040, "train_runtime": 4578.7364, "train_tokens_per_second": 1407.043 }, { "epoch": 1.7794871794871794, "grad_norm": 0.13809658586978912, "learning_rate": 2.2317596566523608e-05, "loss": 0.3943, "num_input_tokens_seen": 6452022, "step": 1041, "train_runtime": 4584.5201, "train_tokens_per_second": 1407.349 }, { "epoch": 1.781196581196581, "grad_norm": 0.1384420543909073, "learning_rate": 2.2145922746781117e-05, "loss": 0.3566, "num_input_tokens_seen": 6457366, "step": 1042, "train_runtime": 4588.1267, "train_tokens_per_second": 1407.408 }, { "epoch": 1.7829059829059828, "grad_norm": 0.14281603693962097, "learning_rate": 2.1974248927038626e-05, "loss": 0.29, "num_input_tokens_seen": 6463758, "step": 1043, "train_runtime": 4592.2407, "train_tokens_per_second": 1407.539 }, { "epoch": 1.7846153846153845, "grad_norm": 0.1341668963432312, "learning_rate": 2.180257510729614e-05, "loss": 0.3113, "num_input_tokens_seen": 6470814, "step": 1044, "train_runtime": 4596.7241, "train_tokens_per_second": 1407.701 }, { "epoch": 1.7863247863247862, "grad_norm": 0.12165071070194244, "learning_rate": 2.1630901287553648e-05, "loss": 0.2428, "num_input_tokens_seen": 6478470, "step": 1045, "train_runtime": 4601.6129, "train_tokens_per_second": 1407.869 }, { "epoch": 1.788034188034188, "grad_norm": 0.12957434356212616, "learning_rate": 2.145922746781116e-05, "loss": 0.3294, "num_input_tokens_seen": 6485742, "step": 1046, "train_runtime": 4606.2305, "train_tokens_per_second": 1408.037 }, { "epoch": 1.7897435897435896, "grad_norm": 0.15326030552387238, "learning_rate": 2.128755364806867e-05, "loss": 0.2989, "num_input_tokens_seen": 6490534, "step": 1047, "train_runtime": 4609.394, "train_tokens_per_second": 1408.11 }, { "epoch": 1.7914529914529913, "grad_norm": 0.1443042904138565, "learning_rate": 2.1115879828326182e-05, "loss": 0.321, "num_input_tokens_seen": 6496446, "step": 1048, "train_runtime": 4613.259, "train_tokens_per_second": 1408.212 }, { "epoch": 1.793162393162393, "grad_norm": 0.14335471391677856, "learning_rate": 2.094420600858369e-05, "loss": 0.3075, "num_input_tokens_seen": 6500918, "step": 1049, "train_runtime": 4616.2414, "train_tokens_per_second": 1408.271 }, { "epoch": 1.7948717948717947, "grad_norm": 0.14600598812103271, "learning_rate": 2.0772532188841204e-05, "loss": 0.2909, "num_input_tokens_seen": 6507990, "step": 1050, "train_runtime": 4620.7168, "train_tokens_per_second": 1408.437 }, { "epoch": 1.7965811965811964, "grad_norm": 0.18093526363372803, "learning_rate": 2.0600858369098713e-05, "loss": 0.3847, "num_input_tokens_seen": 6512422, "step": 1051, "train_runtime": 4625.7264, "train_tokens_per_second": 1407.87 }, { "epoch": 1.7982905982905983, "grad_norm": 0.16364380717277527, "learning_rate": 2.0429184549356222e-05, "loss": 0.4275, "num_input_tokens_seen": 6518614, "step": 1052, "train_runtime": 4629.7613, "train_tokens_per_second": 1407.981 }, { "epoch": 1.8, "grad_norm": 0.1316070705652237, "learning_rate": 2.0257510729613735e-05, "loss": 0.3271, "num_input_tokens_seen": 6526590, "step": 1053, "train_runtime": 4634.7196, "train_tokens_per_second": 1408.195 }, { "epoch": 1.8, "eval_loss": 0.404507040977478, "eval_runtime": 40.0997, "eval_samples_per_second": 24.888, "eval_steps_per_second": 3.117, "num_input_tokens_seen": 6526590, "step": 1053 }, { "epoch": 1.8017094017094017, "grad_norm": 0.15155088901519775, "learning_rate": 2.0085836909871244e-05, "loss": 0.332, "num_input_tokens_seen": 6531142, "step": 1054, "train_runtime": 4677.9352, "train_tokens_per_second": 1396.159 }, { "epoch": 1.8034188034188035, "grad_norm": 0.16894248127937317, "learning_rate": 1.9914163090128756e-05, "loss": 0.3468, "num_input_tokens_seen": 6535878, "step": 1055, "train_runtime": 4681.1277, "train_tokens_per_second": 1396.219 }, { "epoch": 1.8051282051282052, "grad_norm": 0.16134795546531677, "learning_rate": 1.9742489270386265e-05, "loss": 0.4106, "num_input_tokens_seen": 6540734, "step": 1056, "train_runtime": 4684.3719, "train_tokens_per_second": 1396.288 }, { "epoch": 1.8068376068376069, "grad_norm": 0.15336063504219055, "learning_rate": 1.9570815450643778e-05, "loss": 0.3094, "num_input_tokens_seen": 6546686, "step": 1057, "train_runtime": 4688.2462, "train_tokens_per_second": 1396.404 }, { "epoch": 1.8085470085470086, "grad_norm": 0.14268825948238373, "learning_rate": 1.9399141630901287e-05, "loss": 0.273, "num_input_tokens_seen": 6551342, "step": 1058, "train_runtime": 4691.4225, "train_tokens_per_second": 1396.451 }, { "epoch": 1.8102564102564103, "grad_norm": 0.14494940638542175, "learning_rate": 1.92274678111588e-05, "loss": 0.3132, "num_input_tokens_seen": 6557974, "step": 1059, "train_runtime": 4695.6758, "train_tokens_per_second": 1396.599 }, { "epoch": 1.811965811965812, "grad_norm": 0.18244661390781403, "learning_rate": 1.905579399141631e-05, "loss": 0.5737, "num_input_tokens_seen": 6562998, "step": 1060, "train_runtime": 4698.9602, "train_tokens_per_second": 1396.692 }, { "epoch": 1.8136752136752137, "grad_norm": 0.1533288210630417, "learning_rate": 1.888412017167382e-05, "loss": 0.441, "num_input_tokens_seen": 6569270, "step": 1061, "train_runtime": 4702.9527, "train_tokens_per_second": 1396.839 }, { "epoch": 1.8153846153846154, "grad_norm": 0.17031623423099518, "learning_rate": 1.871244635193133e-05, "loss": 0.3263, "num_input_tokens_seen": 6576398, "step": 1062, "train_runtime": 4707.3688, "train_tokens_per_second": 1397.043 }, { "epoch": 1.817094017094017, "grad_norm": 0.15098752081394196, "learning_rate": 1.854077253218884e-05, "loss": 0.3944, "num_input_tokens_seen": 6583126, "step": 1063, "train_runtime": 4711.6687, "train_tokens_per_second": 1397.196 }, { "epoch": 1.8188034188034188, "grad_norm": 0.14613556861877441, "learning_rate": 1.8369098712446352e-05, "loss": 0.3597, "num_input_tokens_seen": 6588926, "step": 1064, "train_runtime": 4715.3802, "train_tokens_per_second": 1397.327 }, { "epoch": 1.8205128205128205, "grad_norm": 0.14206819236278534, "learning_rate": 1.819742489270386e-05, "loss": 0.4242, "num_input_tokens_seen": 6596990, "step": 1065, "train_runtime": 4720.4135, "train_tokens_per_second": 1397.545 }, { "epoch": 1.8222222222222222, "grad_norm": 0.140799418091774, "learning_rate": 1.8025751072961374e-05, "loss": 0.3399, "num_input_tokens_seen": 6602190, "step": 1066, "train_runtime": 4723.9657, "train_tokens_per_second": 1397.595 }, { "epoch": 1.823931623931624, "grad_norm": 0.19462433457374573, "learning_rate": 1.7854077253218883e-05, "loss": 0.3512, "num_input_tokens_seen": 6607014, "step": 1067, "train_runtime": 4727.1472, "train_tokens_per_second": 1397.675 }, { "epoch": 1.8256410256410256, "grad_norm": 0.13291078805923462, "learning_rate": 1.7682403433476395e-05, "loss": 0.3843, "num_input_tokens_seen": 6613678, "step": 1068, "train_runtime": 4731.4386, "train_tokens_per_second": 1397.815 }, { "epoch": 1.8273504273504273, "grad_norm": 0.15383653342723846, "learning_rate": 1.7510729613733905e-05, "loss": 0.3471, "num_input_tokens_seen": 6618774, "step": 1069, "train_runtime": 4734.8385, "train_tokens_per_second": 1397.888 }, { "epoch": 1.8290598290598292, "grad_norm": 0.1934920996427536, "learning_rate": 1.7339055793991417e-05, "loss": 0.4046, "num_input_tokens_seen": 6623158, "step": 1070, "train_runtime": 4737.8828, "train_tokens_per_second": 1397.915 }, { "epoch": 1.830769230769231, "grad_norm": 0.14363759756088257, "learning_rate": 1.7167381974248926e-05, "loss": 0.3881, "num_input_tokens_seen": 6629886, "step": 1071, "train_runtime": 4742.2138, "train_tokens_per_second": 1398.057 }, { "epoch": 1.8324786324786326, "grad_norm": 0.16139546036720276, "learning_rate": 1.699570815450644e-05, "loss": 0.4487, "num_input_tokens_seen": 6636854, "step": 1072, "train_runtime": 4746.7336, "train_tokens_per_second": 1398.194 }, { "epoch": 1.8341880341880343, "grad_norm": 0.1400468498468399, "learning_rate": 1.6824034334763948e-05, "loss": 0.3305, "num_input_tokens_seen": 6642486, "step": 1073, "train_runtime": 4750.5141, "train_tokens_per_second": 1398.267 }, { "epoch": 1.835897435897436, "grad_norm": 0.13978594541549683, "learning_rate": 1.665236051502146e-05, "loss": 0.6809, "num_input_tokens_seen": 6649566, "step": 1074, "train_runtime": 4755.0422, "train_tokens_per_second": 1398.424 }, { "epoch": 1.8376068376068377, "grad_norm": 0.1702847182750702, "learning_rate": 1.648068669527897e-05, "loss": 0.4449, "num_input_tokens_seen": 6655126, "step": 1075, "train_runtime": 4758.7098, "train_tokens_per_second": 1398.515 }, { "epoch": 1.8393162393162394, "grad_norm": 0.17050866782665253, "learning_rate": 1.6309012875536482e-05, "loss": 0.3379, "num_input_tokens_seen": 6659030, "step": 1076, "train_runtime": 4761.477, "train_tokens_per_second": 1398.522 }, { "epoch": 1.8410256410256411, "grad_norm": 0.13685175776481628, "learning_rate": 1.613733905579399e-05, "loss": 0.278, "num_input_tokens_seen": 6665878, "step": 1077, "train_runtime": 4765.8908, "train_tokens_per_second": 1398.664 }, { "epoch": 1.8427350427350428, "grad_norm": 0.15728789567947388, "learning_rate": 1.5965665236051504e-05, "loss": 0.4222, "num_input_tokens_seen": 6673366, "step": 1078, "train_runtime": 4770.5968, "train_tokens_per_second": 1398.853 }, { "epoch": 1.8444444444444446, "grad_norm": 0.1324002593755722, "learning_rate": 1.5793991416309016e-05, "loss": 0.2461, "num_input_tokens_seen": 6683390, "step": 1079, "train_runtime": 4776.8061, "train_tokens_per_second": 1399.134 }, { "epoch": 1.8461538461538463, "grad_norm": 0.16516079008579254, "learning_rate": 1.5622317596566525e-05, "loss": 0.4134, "num_input_tokens_seen": 6688182, "step": 1080, "train_runtime": 4780.0471, "train_tokens_per_second": 1399.187 }, { "epoch": 1.847863247863248, "grad_norm": 0.15185537934303284, "learning_rate": 1.5450643776824038e-05, "loss": 0.4063, "num_input_tokens_seen": 6693006, "step": 1081, "train_runtime": 4785.5138, "train_tokens_per_second": 1398.597 }, { "epoch": 1.8495726495726497, "grad_norm": 0.15653982758522034, "learning_rate": 1.5278969957081547e-05, "loss": 0.3766, "num_input_tokens_seen": 6698870, "step": 1082, "train_runtime": 4789.2559, "train_tokens_per_second": 1398.729 }, { "epoch": 1.8512820512820514, "grad_norm": 0.1651298999786377, "learning_rate": 1.5107296137339055e-05, "loss": 0.3813, "num_input_tokens_seen": 6704446, "step": 1083, "train_runtime": 4792.9155, "train_tokens_per_second": 1398.824 }, { "epoch": 1.852991452991453, "grad_norm": 0.13992318511009216, "learning_rate": 1.4935622317596567e-05, "loss": 0.3536, "num_input_tokens_seen": 6712214, "step": 1084, "train_runtime": 4797.8044, "train_tokens_per_second": 1399.018 }, { "epoch": 1.8547008547008548, "grad_norm": 0.18008194863796234, "learning_rate": 1.4763948497854076e-05, "loss": 0.4277, "num_input_tokens_seen": 6718494, "step": 1085, "train_runtime": 4801.9402, "train_tokens_per_second": 1399.121 }, { "epoch": 1.8564102564102565, "grad_norm": 0.14547497034072876, "learning_rate": 1.4592274678111589e-05, "loss": 0.3601, "num_input_tokens_seen": 6725166, "step": 1086, "train_runtime": 4806.2732, "train_tokens_per_second": 1399.248 }, { "epoch": 1.8581196581196582, "grad_norm": 0.16261422634124756, "learning_rate": 1.4420600858369098e-05, "loss": 0.2693, "num_input_tokens_seen": 6730998, "step": 1087, "train_runtime": 4810.0482, "train_tokens_per_second": 1399.362 }, { "epoch": 1.8598290598290599, "grad_norm": 0.18159757554531097, "learning_rate": 1.424892703862661e-05, "loss": 0.3637, "num_input_tokens_seen": 6736422, "step": 1088, "train_runtime": 4813.51, "train_tokens_per_second": 1399.482 }, { "epoch": 1.8615384615384616, "grad_norm": 0.17222821712493896, "learning_rate": 1.4077253218884121e-05, "loss": 0.3602, "num_input_tokens_seen": 6740854, "step": 1089, "train_runtime": 4816.5377, "train_tokens_per_second": 1399.523 }, { "epoch": 1.8632478632478633, "grad_norm": 0.2024536430835724, "learning_rate": 1.3905579399141632e-05, "loss": 0.4612, "num_input_tokens_seen": 6746086, "step": 1090, "train_runtime": 4820.0103, "train_tokens_per_second": 1399.6 }, { "epoch": 1.864957264957265, "grad_norm": 0.17339684069156647, "learning_rate": 1.3733905579399143e-05, "loss": 0.3912, "num_input_tokens_seen": 6751998, "step": 1091, "train_runtime": 4823.8611, "train_tokens_per_second": 1399.708 }, { "epoch": 1.8666666666666667, "grad_norm": 0.15908282995224, "learning_rate": 1.3562231759656652e-05, "loss": 0.4084, "num_input_tokens_seen": 6757014, "step": 1092, "train_runtime": 4827.2695, "train_tokens_per_second": 1399.759 }, { "epoch": 1.8683760683760684, "grad_norm": 0.15388384461402893, "learning_rate": 1.3390557939914165e-05, "loss": 0.3886, "num_input_tokens_seen": 6763046, "step": 1093, "train_runtime": 4831.1646, "train_tokens_per_second": 1399.879 }, { "epoch": 1.87008547008547, "grad_norm": 0.159906804561615, "learning_rate": 1.3218884120171674e-05, "loss": 0.3046, "num_input_tokens_seen": 6767926, "step": 1094, "train_runtime": 4834.4979, "train_tokens_per_second": 1399.923 }, { "epoch": 1.8717948717948718, "grad_norm": 0.14533422887325287, "learning_rate": 1.3047210300429186e-05, "loss": 0.3364, "num_input_tokens_seen": 6773470, "step": 1095, "train_runtime": 4838.153, "train_tokens_per_second": 1400.012 }, { "epoch": 1.8735042735042735, "grad_norm": 0.1425410658121109, "learning_rate": 1.2875536480686696e-05, "loss": 0.34, "num_input_tokens_seen": 6780046, "step": 1096, "train_runtime": 4842.3489, "train_tokens_per_second": 1400.156 }, { "epoch": 1.8752136752136752, "grad_norm": 0.17550382018089294, "learning_rate": 1.2703862660944208e-05, "loss": 0.3715, "num_input_tokens_seen": 6784934, "step": 1097, "train_runtime": 4845.5655, "train_tokens_per_second": 1400.236 }, { "epoch": 1.876923076923077, "grad_norm": 0.14778852462768555, "learning_rate": 1.2532188841201717e-05, "loss": 0.3221, "num_input_tokens_seen": 6792326, "step": 1098, "train_runtime": 4850.2742, "train_tokens_per_second": 1400.4 }, { "epoch": 1.8786324786324786, "grad_norm": 0.16497938334941864, "learning_rate": 1.2360515021459228e-05, "loss": 0.4165, "num_input_tokens_seen": 6798566, "step": 1099, "train_runtime": 4854.305, "train_tokens_per_second": 1400.523 }, { "epoch": 1.8803418803418803, "grad_norm": 0.197905495762825, "learning_rate": 1.2188841201716739e-05, "loss": 0.3145, "num_input_tokens_seen": 6802638, "step": 1100, "train_runtime": 4857.1375, "train_tokens_per_second": 1400.545 }, { "epoch": 1.882051282051282, "grad_norm": 0.17154602706432343, "learning_rate": 1.201716738197425e-05, "loss": 0.3308, "num_input_tokens_seen": 6807246, "step": 1101, "train_runtime": 4860.2531, "train_tokens_per_second": 1400.595 }, { "epoch": 1.8837606837606837, "grad_norm": 0.16185066103935242, "learning_rate": 1.184549356223176e-05, "loss": 0.4201, "num_input_tokens_seen": 6813470, "step": 1102, "train_runtime": 4864.2681, "train_tokens_per_second": 1400.718 }, { "epoch": 1.8854700854700854, "grad_norm": 0.14669010043144226, "learning_rate": 1.1673819742489271e-05, "loss": 0.277, "num_input_tokens_seen": 6819462, "step": 1103, "train_runtime": 4868.1501, "train_tokens_per_second": 1400.832 }, { "epoch": 1.8871794871794871, "grad_norm": 0.14133639633655548, "learning_rate": 1.1502145922746782e-05, "loss": 0.2909, "num_input_tokens_seen": 6825846, "step": 1104, "train_runtime": 4872.1267, "train_tokens_per_second": 1400.999 }, { "epoch": 1.8888888888888888, "grad_norm": 0.15974490344524384, "learning_rate": 1.1330472103004293e-05, "loss": 0.409, "num_input_tokens_seen": 6830438, "step": 1105, "train_runtime": 4875.179, "train_tokens_per_second": 1401.064 }, { "epoch": 1.8905982905982905, "grad_norm": 0.14427092671394348, "learning_rate": 1.1158798283261804e-05, "loss": 0.3139, "num_input_tokens_seen": 6837246, "step": 1106, "train_runtime": 4879.5448, "train_tokens_per_second": 1401.206 }, { "epoch": 1.8923076923076922, "grad_norm": 0.1914999932050705, "learning_rate": 1.0987124463519313e-05, "loss": 0.5047, "num_input_tokens_seen": 6842374, "step": 1107, "train_runtime": 4882.9114, "train_tokens_per_second": 1401.29 }, { "epoch": 1.894017094017094, "grad_norm": 0.1484641432762146, "learning_rate": 1.0815450643776824e-05, "loss": 0.3216, "num_input_tokens_seen": 6850582, "step": 1108, "train_runtime": 4888.0245, "train_tokens_per_second": 1401.503 }, { "epoch": 1.8957264957264957, "grad_norm": 0.14059650897979736, "learning_rate": 1.0643776824034335e-05, "loss": 0.2703, "num_input_tokens_seen": 6856102, "step": 1109, "train_runtime": 4891.5942, "train_tokens_per_second": 1401.609 }, { "epoch": 1.8974358974358974, "grad_norm": 0.20912344753742218, "learning_rate": 1.0472103004291846e-05, "loss": 0.3141, "num_input_tokens_seen": 6862710, "step": 1110, "train_runtime": 4895.7904, "train_tokens_per_second": 1401.757 }, { "epoch": 1.899145299145299, "grad_norm": 0.1622704267501831, "learning_rate": 1.0300429184549356e-05, "loss": 0.3853, "num_input_tokens_seen": 6869022, "step": 1111, "train_runtime": 4901.9521, "train_tokens_per_second": 1401.283 }, { "epoch": 1.9008547008547008, "grad_norm": 0.1645922064781189, "learning_rate": 1.0128755364806867e-05, "loss": 0.3398, "num_input_tokens_seen": 6874726, "step": 1112, "train_runtime": 4905.6953, "train_tokens_per_second": 1401.376 }, { "epoch": 1.9025641025641025, "grad_norm": 0.1458289623260498, "learning_rate": 9.957081545064378e-06, "loss": 0.317, "num_input_tokens_seen": 6881630, "step": 1113, "train_runtime": 4910.1371, "train_tokens_per_second": 1401.515 }, { "epoch": 1.9042735042735042, "grad_norm": 0.12950517237186432, "learning_rate": 9.785407725321889e-06, "loss": 0.3292, "num_input_tokens_seen": 6889566, "step": 1114, "train_runtime": 4915.0767, "train_tokens_per_second": 1401.721 }, { "epoch": 1.9059829059829059, "grad_norm": 0.17092257738113403, "learning_rate": 9.6137339055794e-06, "loss": 0.3772, "num_input_tokens_seen": 6897254, "step": 1115, "train_runtime": 4919.8978, "train_tokens_per_second": 1401.91 }, { "epoch": 1.9076923076923076, "grad_norm": 0.15210705995559692, "learning_rate": 9.44206008583691e-06, "loss": 0.2851, "num_input_tokens_seen": 6903030, "step": 1116, "train_runtime": 4923.6154, "train_tokens_per_second": 1402.025 }, { "epoch": 1.9094017094017093, "grad_norm": 0.17195074260234833, "learning_rate": 9.27038626609442e-06, "loss": 0.3031, "num_input_tokens_seen": 6908182, "step": 1117, "train_runtime": 4926.9947, "train_tokens_per_second": 1402.109 }, { "epoch": 1.911111111111111, "grad_norm": 0.1584848016500473, "learning_rate": 9.09871244635193e-06, "loss": 0.3616, "num_input_tokens_seen": 6913494, "step": 1118, "train_runtime": 4930.5631, "train_tokens_per_second": 1402.171 }, { "epoch": 1.9128205128205127, "grad_norm": 0.1975264549255371, "learning_rate": 8.927038626609441e-06, "loss": 0.4163, "num_input_tokens_seen": 6918062, "step": 1119, "train_runtime": 4933.5796, "train_tokens_per_second": 1402.24 }, { "epoch": 1.9145299145299144, "grad_norm": 0.16457124054431915, "learning_rate": 8.755364806866952e-06, "loss": 0.3484, "num_input_tokens_seen": 6924510, "step": 1120, "train_runtime": 4937.7657, "train_tokens_per_second": 1402.357 }, { "epoch": 1.916239316239316, "grad_norm": 0.17964407801628113, "learning_rate": 8.583690987124463e-06, "loss": 0.3722, "num_input_tokens_seen": 6929198, "step": 1121, "train_runtime": 4940.9815, "train_tokens_per_second": 1402.393 }, { "epoch": 1.9179487179487178, "grad_norm": 0.1665036529302597, "learning_rate": 8.412017167381974e-06, "loss": 0.3422, "num_input_tokens_seen": 6934638, "step": 1122, "train_runtime": 4944.5768, "train_tokens_per_second": 1402.474 }, { "epoch": 1.9196581196581195, "grad_norm": 0.15092073380947113, "learning_rate": 8.240343347639485e-06, "loss": 0.3241, "num_input_tokens_seen": 6939854, "step": 1123, "train_runtime": 4948.0723, "train_tokens_per_second": 1402.537 }, { "epoch": 1.9213675213675212, "grad_norm": 0.14096640050411224, "learning_rate": 8.068669527896996e-06, "loss": 0.3273, "num_input_tokens_seen": 6946214, "step": 1124, "train_runtime": 4952.1614, "train_tokens_per_second": 1402.663 }, { "epoch": 1.9230769230769231, "grad_norm": 0.1625843495130539, "learning_rate": 7.896995708154508e-06, "loss": 0.3869, "num_input_tokens_seen": 6951950, "step": 1125, "train_runtime": 4955.9684, "train_tokens_per_second": 1402.743 }, { "epoch": 1.9247863247863248, "grad_norm": 0.17909951508045197, "learning_rate": 7.725321888412019e-06, "loss": 0.3497, "num_input_tokens_seen": 6957638, "step": 1126, "train_runtime": 4959.737, "train_tokens_per_second": 1402.824 }, { "epoch": 1.9264957264957265, "grad_norm": 0.17353759706020355, "learning_rate": 7.553648068669527e-06, "loss": 0.3897, "num_input_tokens_seen": 6962374, "step": 1127, "train_runtime": 4962.8962, "train_tokens_per_second": 1402.885 }, { "epoch": 1.9282051282051282, "grad_norm": 0.15928848087787628, "learning_rate": 7.381974248927038e-06, "loss": 0.3673, "num_input_tokens_seen": 6969438, "step": 1128, "train_runtime": 4967.3831, "train_tokens_per_second": 1403.04 }, { "epoch": 1.92991452991453, "grad_norm": 0.1764049082994461, "learning_rate": 7.210300429184549e-06, "loss": 0.4195, "num_input_tokens_seen": 6974686, "step": 1129, "train_runtime": 4970.8962, "train_tokens_per_second": 1403.104 }, { "epoch": 1.9316239316239316, "grad_norm": 0.16329072415828705, "learning_rate": 7.038626609442061e-06, "loss": 0.4364, "num_input_tokens_seen": 6978790, "step": 1130, "train_runtime": 4973.7668, "train_tokens_per_second": 1403.12 }, { "epoch": 1.9333333333333333, "grad_norm": 0.1772487908601761, "learning_rate": 6.8669527896995715e-06, "loss": 0.2383, "num_input_tokens_seen": 6983270, "step": 1131, "train_runtime": 4976.8686, "train_tokens_per_second": 1403.145 }, { "epoch": 1.935042735042735, "grad_norm": 0.14440268278121948, "learning_rate": 6.695278969957082e-06, "loss": 0.3158, "num_input_tokens_seen": 6990422, "step": 1132, "train_runtime": 4981.4235, "train_tokens_per_second": 1403.298 }, { "epoch": 1.9367521367521368, "grad_norm": 0.12382279336452484, "learning_rate": 6.523605150214593e-06, "loss": 0.2929, "num_input_tokens_seen": 6996510, "step": 1133, "train_runtime": 4985.3586, "train_tokens_per_second": 1403.412 }, { "epoch": 1.9384615384615385, "grad_norm": 0.1855405867099762, "learning_rate": 6.351931330472104e-06, "loss": 0.3417, "num_input_tokens_seen": 7001694, "step": 1134, "train_runtime": 4988.8358, "train_tokens_per_second": 1403.473 }, { "epoch": 1.9401709401709402, "grad_norm": 0.17923769354820251, "learning_rate": 6.180257510729614e-06, "loss": 0.4127, "num_input_tokens_seen": 7006406, "step": 1135, "train_runtime": 4992.0156, "train_tokens_per_second": 1403.522 }, { "epoch": 1.9418803418803419, "grad_norm": 0.16682113707065582, "learning_rate": 6.008583690987125e-06, "loss": 0.3125, "num_input_tokens_seen": 7011622, "step": 1136, "train_runtime": 4995.5472, "train_tokens_per_second": 1403.574 }, { "epoch": 1.9435897435897436, "grad_norm": 0.15530408918857574, "learning_rate": 5.836909871244636e-06, "loss": 0.3365, "num_input_tokens_seen": 7016462, "step": 1137, "train_runtime": 4998.7709, "train_tokens_per_second": 1403.637 }, { "epoch": 1.9452991452991453, "grad_norm": 0.13905546069145203, "learning_rate": 5.6652360515021465e-06, "loss": 0.3441, "num_input_tokens_seen": 7024086, "step": 1138, "train_runtime": 5003.5809, "train_tokens_per_second": 1403.812 }, { "epoch": 1.947008547008547, "grad_norm": 0.16939112544059753, "learning_rate": 5.4935622317596565e-06, "loss": 0.3539, "num_input_tokens_seen": 7028750, "step": 1139, "train_runtime": 5006.7812, "train_tokens_per_second": 1403.846 }, { "epoch": 1.9487179487179487, "grad_norm": 0.15002712607383728, "learning_rate": 5.321888412017167e-06, "loss": 0.3174, "num_input_tokens_seen": 7033710, "step": 1140, "train_runtime": 5010.1585, "train_tokens_per_second": 1403.89 }, { "epoch": 1.9504273504273504, "grad_norm": 0.18167702853679657, "learning_rate": 5.150214592274678e-06, "loss": 0.4735, "num_input_tokens_seen": 7038134, "step": 1141, "train_runtime": 5015.1806, "train_tokens_per_second": 1403.366 }, { "epoch": 1.952136752136752, "grad_norm": 0.19326065480709076, "learning_rate": 4.978540772532189e-06, "loss": 0.4024, "num_input_tokens_seen": 7045182, "step": 1142, "train_runtime": 5019.6695, "train_tokens_per_second": 1403.515 }, { "epoch": 1.953846153846154, "grad_norm": 0.15256325900554657, "learning_rate": 4.8068669527897e-06, "loss": 0.4067, "num_input_tokens_seen": 7051910, "step": 1143, "train_runtime": 5024.001, "train_tokens_per_second": 1403.644 }, { "epoch": 1.9555555555555557, "grad_norm": 0.14433787763118744, "learning_rate": 4.63519313304721e-06, "loss": 0.3536, "num_input_tokens_seen": 7057862, "step": 1144, "train_runtime": 5027.9685, "train_tokens_per_second": 1403.72 }, { "epoch": 1.9572649572649574, "grad_norm": 0.13618534803390503, "learning_rate": 4.463519313304721e-06, "loss": 0.3097, "num_input_tokens_seen": 7065950, "step": 1145, "train_runtime": 5033.0872, "train_tokens_per_second": 1403.9 }, { "epoch": 1.9589743589743591, "grad_norm": 0.18025486171245575, "learning_rate": 4.2918454935622316e-06, "loss": 0.5036, "num_input_tokens_seen": 7070798, "step": 1146, "train_runtime": 5036.3826, "train_tokens_per_second": 1403.944 }, { "epoch": 1.9606837606837608, "grad_norm": 0.14855344593524933, "learning_rate": 4.120171673819742e-06, "loss": 0.358, "num_input_tokens_seen": 7076262, "step": 1147, "train_runtime": 5039.9834, "train_tokens_per_second": 1404.025 }, { "epoch": 1.9623931623931625, "grad_norm": 0.14267109334468842, "learning_rate": 3.948497854077254e-06, "loss": 0.314, "num_input_tokens_seen": 7082518, "step": 1148, "train_runtime": 5044.05, "train_tokens_per_second": 1404.133 }, { "epoch": 1.9641025641025642, "grad_norm": 0.14983952045440674, "learning_rate": 3.7768240343347637e-06, "loss": 0.3844, "num_input_tokens_seen": 7088558, "step": 1149, "train_runtime": 5047.9368, "train_tokens_per_second": 1404.249 }, { "epoch": 1.965811965811966, "grad_norm": 0.1477644294500351, "learning_rate": 3.6051502145922745e-06, "loss": 0.2836, "num_input_tokens_seen": 7095926, "step": 1150, "train_runtime": 5052.6961, "train_tokens_per_second": 1404.384 }, { "epoch": 1.9675213675213676, "grad_norm": 0.17511659860610962, "learning_rate": 3.4334763948497858e-06, "loss": 0.3682, "num_input_tokens_seen": 7100846, "step": 1151, "train_runtime": 5056.0814, "train_tokens_per_second": 1404.417 }, { "epoch": 1.9692307692307693, "grad_norm": 0.15633749961853027, "learning_rate": 3.2618025751072966e-06, "loss": 0.2592, "num_input_tokens_seen": 7105150, "step": 1152, "train_runtime": 5059.0018, "train_tokens_per_second": 1404.457 }, { "epoch": 1.970940170940171, "grad_norm": 0.15015672147274017, "learning_rate": 3.090128755364807e-06, "loss": 0.3362, "num_input_tokens_seen": 7112038, "step": 1153, "train_runtime": 5063.4562, "train_tokens_per_second": 1404.582 }, { "epoch": 1.9726495726495727, "grad_norm": 0.14071433246135712, "learning_rate": 2.918454935622318e-06, "loss": 0.2969, "num_input_tokens_seen": 7118214, "step": 1154, "train_runtime": 5067.4234, "train_tokens_per_second": 1404.701 }, { "epoch": 1.9743589743589745, "grad_norm": 0.16674835979938507, "learning_rate": 2.7467811158798283e-06, "loss": 0.4497, "num_input_tokens_seen": 7124414, "step": 1155, "train_runtime": 5071.4815, "train_tokens_per_second": 1404.799 }, { "epoch": 1.9760683760683762, "grad_norm": 0.16165152192115784, "learning_rate": 2.575107296137339e-06, "loss": 0.3373, "num_input_tokens_seen": 7128862, "step": 1156, "train_runtime": 5074.4614, "train_tokens_per_second": 1404.851 }, { "epoch": 1.9777777777777779, "grad_norm": 0.17277656495571136, "learning_rate": 2.40343347639485e-06, "loss": 0.2393, "num_input_tokens_seen": 7146230, "step": 1157, "train_runtime": 5084.9281, "train_tokens_per_second": 1405.375 }, { "epoch": 1.9794871794871796, "grad_norm": 0.17875243723392487, "learning_rate": 2.2317596566523604e-06, "loss": 0.4351, "num_input_tokens_seen": 7152230, "step": 1158, "train_runtime": 5088.821, "train_tokens_per_second": 1405.479 }, { "epoch": 1.9811965811965813, "grad_norm": 0.15034790337085724, "learning_rate": 2.060085836909871e-06, "loss": 0.337, "num_input_tokens_seen": 7157270, "step": 1159, "train_runtime": 5092.1754, "train_tokens_per_second": 1405.543 }, { "epoch": 1.982905982905983, "grad_norm": 0.15507899224758148, "learning_rate": 1.8884120171673818e-06, "loss": 0.3092, "num_input_tokens_seen": 7162982, "step": 1160, "train_runtime": 5095.8972, "train_tokens_per_second": 1405.637 }, { "epoch": 1.9846153846153847, "grad_norm": 0.14410509169101715, "learning_rate": 1.7167381974248929e-06, "loss": 0.3034, "num_input_tokens_seen": 7169934, "step": 1161, "train_runtime": 5100.2993, "train_tokens_per_second": 1405.787 }, { "epoch": 1.9863247863247864, "grad_norm": 0.1652487963438034, "learning_rate": 1.5450643776824035e-06, "loss": 0.3926, "num_input_tokens_seen": 7175958, "step": 1162, "train_runtime": 5104.1999, "train_tokens_per_second": 1405.893 }, { "epoch": 1.988034188034188, "grad_norm": 0.12866978347301483, "learning_rate": 1.3733905579399141e-06, "loss": 0.216, "num_input_tokens_seen": 7192558, "step": 1163, "train_runtime": 5113.9801, "train_tokens_per_second": 1406.45 }, { "epoch": 1.9897435897435898, "grad_norm": 0.1544247269630432, "learning_rate": 1.201716738197425e-06, "loss": 0.3591, "num_input_tokens_seen": 7198806, "step": 1164, "train_runtime": 5117.9515, "train_tokens_per_second": 1406.58 }, { "epoch": 1.9914529914529915, "grad_norm": 0.14498887956142426, "learning_rate": 1.0300429184549356e-06, "loss": 0.3196, "num_input_tokens_seen": 7205486, "step": 1165, "train_runtime": 5122.3014, "train_tokens_per_second": 1406.689 }, { "epoch": 1.9931623931623932, "grad_norm": 0.1625777930021286, "learning_rate": 8.583690987124464e-07, "loss": 0.3314, "num_input_tokens_seen": 7210694, "step": 1166, "train_runtime": 5125.7917, "train_tokens_per_second": 1406.747 }, { "epoch": 1.994871794871795, "grad_norm": 0.16056707501411438, "learning_rate": 6.866952789699571e-07, "loss": 0.4212, "num_input_tokens_seen": 7216110, "step": 1167, "train_runtime": 5129.3371, "train_tokens_per_second": 1406.831 }, { "epoch": 1.9965811965811966, "grad_norm": 0.17116740345954895, "learning_rate": 5.150214592274678e-07, "loss": 0.3152, "num_input_tokens_seen": 7222086, "step": 1168, "train_runtime": 5133.2419, "train_tokens_per_second": 1406.925 }, { "epoch": 1.9982905982905983, "grad_norm": 0.13754986226558685, "learning_rate": 3.4334763948497853e-07, "loss": 0.3062, "num_input_tokens_seen": 7228470, "step": 1169, "train_runtime": 5137.3693, "train_tokens_per_second": 1407.037 }, { "epoch": 2.0, "grad_norm": 0.1478198617696762, "learning_rate": 1.7167381974248927e-07, "loss": 0.3072, "num_input_tokens_seen": 7234780, "step": 1170, "train_runtime": 5141.5156, "train_tokens_per_second": 1407.13 }, { "epoch": 2.0, "eval_loss": 0.40483909845352173, "eval_runtime": 40.6231, "eval_samples_per_second": 24.567, "eval_steps_per_second": 3.077, "num_input_tokens_seen": 7234780, "step": 1170 } ], "logging_steps": 1, "max_steps": 1170, "num_input_tokens_seen": 7234780, "num_train_epochs": 2, "save_steps": 30, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.400044806730752e+18, "train_batch_size": 8, "trial_name": null, "trial_params": null }