{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 156, "global_step": 1556, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0006428801028608164, "grad_norm": 1.4815346002578735, "learning_rate": 0.0, "loss": 3.0354, "num_input_tokens_seen": 58240, "step": 1, "train_runtime": 14.0904, "train_tokens_per_second": 4133.31 }, { "epoch": 0.0012857602057216328, "grad_norm": 1.3779746294021606, "learning_rate": 4e-05, "loss": 2.9584, "num_input_tokens_seen": 102384, "step": 2, "train_runtime": 20.0807, "train_tokens_per_second": 5098.638 }, { "epoch": 0.0019286403085824494, "grad_norm": 1.3874965906143188, "learning_rate": 8e-05, "loss": 3.1628, "num_input_tokens_seen": 164480, "step": 3, "train_runtime": 29.0202, "train_tokens_per_second": 5667.774 }, { "epoch": 0.0025715204114432656, "grad_norm": 1.467178225517273, "learning_rate": 0.00012, "loss": 2.8477, "num_input_tokens_seen": 227360, "step": 4, "train_runtime": 37.6089, "train_tokens_per_second": 6045.37 }, { "epoch": 0.0032144005143040825, "grad_norm": 1.5457735061645508, "learning_rate": 0.00016, "loss": 2.7233, "num_input_tokens_seen": 264512, "step": 5, "train_runtime": 42.7595, "train_tokens_per_second": 6186.034 }, { "epoch": 0.003857280617164899, "grad_norm": 1.178829312324524, "learning_rate": 0.0002, "loss": 2.1801, "num_input_tokens_seen": 309424, "step": 6, "train_runtime": 48.9842, "train_tokens_per_second": 6316.809 }, { "epoch": 0.004500160720025715, "grad_norm": 0.8789910078048706, "learning_rate": 0.00019987105093488073, "loss": 1.8974, "num_input_tokens_seen": 402160, "step": 7, "train_runtime": 61.7856, "train_tokens_per_second": 6508.96 }, { "epoch": 0.005143040822886531, "grad_norm": 0.673732578754425, "learning_rate": 0.00019974210186976145, "loss": 1.7119, "num_input_tokens_seen": 438624, "step": 8, "train_runtime": 66.8435, "train_tokens_per_second": 6561.957 }, { "epoch": 0.0057859209257473485, "grad_norm": 0.521441638469696, "learning_rate": 0.00019961315280464216, "loss": 1.4815, "num_input_tokens_seen": 486400, "step": 9, "train_runtime": 73.4648, "train_tokens_per_second": 6620.858 }, { "epoch": 0.006428801028608165, "grad_norm": 0.6127826571464539, "learning_rate": 0.0001994842037395229, "loss": 1.5544, "num_input_tokens_seen": 542512, "step": 10, "train_runtime": 81.1977, "train_tokens_per_second": 6681.374 }, { "epoch": 0.007071681131468981, "grad_norm": 0.640856146812439, "learning_rate": 0.0001993552546744036, "loss": 1.4353, "num_input_tokens_seen": 588752, "step": 11, "train_runtime": 87.6246, "train_tokens_per_second": 6719.029 }, { "epoch": 0.007714561234329798, "grad_norm": 0.48673883080482483, "learning_rate": 0.00019922630560928435, "loss": 1.3777, "num_input_tokens_seen": 652208, "step": 12, "train_runtime": 96.4514, "train_tokens_per_second": 6762.039 }, { "epoch": 0.008357441337190614, "grad_norm": 0.7254194021224976, "learning_rate": 0.00019909735654416506, "loss": 1.534, "num_input_tokens_seen": 713088, "step": 13, "train_runtime": 104.9169, "train_tokens_per_second": 6796.692 }, { "epoch": 0.00900032144005143, "grad_norm": 0.43824103474617004, "learning_rate": 0.00019896840747904578, "loss": 1.3674, "num_input_tokens_seen": 755024, "step": 14, "train_runtime": 110.719, "train_tokens_per_second": 6819.28 }, { "epoch": 0.009643201542912247, "grad_norm": 0.3844089210033417, "learning_rate": 0.0001988394584139265, "loss": 1.3111, "num_input_tokens_seen": 804912, "step": 15, "train_runtime": 117.6264, "train_tokens_per_second": 6842.954 }, { "epoch": 0.010286081645773062, "grad_norm": 0.35496699810028076, "learning_rate": 0.00019871050934880725, "loss": 1.2114, "num_input_tokens_seen": 873424, "step": 16, "train_runtime": 127.1638, "train_tokens_per_second": 6868.496 }, { "epoch": 0.01092896174863388, "grad_norm": 0.43963053822517395, "learning_rate": 0.00019858156028368796, "loss": 1.1994, "num_input_tokens_seen": 907520, "step": 17, "train_runtime": 131.9627, "train_tokens_per_second": 6877.095 }, { "epoch": 0.011571841851494697, "grad_norm": 0.33540457487106323, "learning_rate": 0.00019845261121856868, "loss": 1.254, "num_input_tokens_seen": 952896, "step": 18, "train_runtime": 138.2745, "train_tokens_per_second": 6891.337 }, { "epoch": 0.012214721954355513, "grad_norm": 0.2950117588043213, "learning_rate": 0.0001983236621534494, "loss": 1.1624, "num_input_tokens_seen": 1005344, "step": 19, "train_runtime": 145.6011, "train_tokens_per_second": 6904.781 }, { "epoch": 0.01285760205721633, "grad_norm": 0.2870226502418518, "learning_rate": 0.00019819471308833012, "loss": 1.1386, "num_input_tokens_seen": 1040544, "step": 20, "train_runtime": 150.5659, "train_tokens_per_second": 6910.886 }, { "epoch": 0.013500482160077145, "grad_norm": 0.27605196833610535, "learning_rate": 0.00019806576402321084, "loss": 1.2057, "num_input_tokens_seen": 1080432, "step": 21, "train_runtime": 156.1378, "train_tokens_per_second": 6919.735 }, { "epoch": 0.014143362262937963, "grad_norm": 0.29624828696250916, "learning_rate": 0.00019793681495809155, "loss": 1.2303, "num_input_tokens_seen": 1148496, "step": 22, "train_runtime": 165.7289, "train_tokens_per_second": 6929.969 }, { "epoch": 0.014786242365798778, "grad_norm": 0.2731878459453583, "learning_rate": 0.0001978078658929723, "loss": 1.0739, "num_input_tokens_seen": 1189760, "step": 23, "train_runtime": 171.4728, "train_tokens_per_second": 6938.478 }, { "epoch": 0.015429122468659595, "grad_norm": 0.33944907784461975, "learning_rate": 0.000197678916827853, "loss": 1.0303, "num_input_tokens_seen": 1226432, "step": 24, "train_runtime": 176.634, "train_tokens_per_second": 6943.352 }, { "epoch": 0.016072002571520413, "grad_norm": 0.2622462511062622, "learning_rate": 0.00019754996776273374, "loss": 1.3015, "num_input_tokens_seen": 1266848, "step": 25, "train_runtime": 182.3158, "train_tokens_per_second": 6948.647 }, { "epoch": 0.01671488267438123, "grad_norm": 0.24616512656211853, "learning_rate": 0.00019742101869761445, "loss": 1.1244, "num_input_tokens_seen": 1323584, "step": 26, "train_runtime": 190.2408, "train_tokens_per_second": 6957.415 }, { "epoch": 0.017357762777242044, "grad_norm": 0.23589050769805908, "learning_rate": 0.00019729206963249517, "loss": 1.1235, "num_input_tokens_seen": 1361104, "step": 27, "train_runtime": 195.5135, "train_tokens_per_second": 6961.687 }, { "epoch": 0.01800064288010286, "grad_norm": 0.23991915583610535, "learning_rate": 0.0001971631205673759, "loss": 1.1462, "num_input_tokens_seen": 1398528, "step": 28, "train_runtime": 200.794, "train_tokens_per_second": 6964.989 }, { "epoch": 0.01864352298296368, "grad_norm": 0.2634638547897339, "learning_rate": 0.00019703417150225663, "loss": 1.2721, "num_input_tokens_seen": 1435776, "step": 29, "train_runtime": 206.0467, "train_tokens_per_second": 6968.207 }, { "epoch": 0.019286403085824494, "grad_norm": 0.19377130270004272, "learning_rate": 0.00019690522243713733, "loss": 1.1832, "num_input_tokens_seen": 1478496, "step": 30, "train_runtime": 212.0993, "train_tokens_per_second": 6970.772 }, { "epoch": 0.01992928318868531, "grad_norm": 0.18850353360176086, "learning_rate": 0.00019677627337201807, "loss": 1.0619, "num_input_tokens_seen": 1532256, "step": 31, "train_runtime": 220.2613, "train_tokens_per_second": 6956.537 }, { "epoch": 0.020572163291546125, "grad_norm": 0.17500188946723938, "learning_rate": 0.0001966473243068988, "loss": 1.1776, "num_input_tokens_seen": 1579456, "step": 32, "train_runtime": 226.8725, "train_tokens_per_second": 6961.867 }, { "epoch": 0.021215043394406944, "grad_norm": 0.21095849573612213, "learning_rate": 0.0001965183752417795, "loss": 1.1431, "num_input_tokens_seen": 1624896, "step": 33, "train_runtime": 233.2234, "train_tokens_per_second": 6967.124 }, { "epoch": 0.02185792349726776, "grad_norm": 0.18223783373832703, "learning_rate": 0.00019638942617666023, "loss": 1.1791, "num_input_tokens_seen": 1669808, "step": 34, "train_runtime": 239.4782, "train_tokens_per_second": 6972.692 }, { "epoch": 0.022500803600128575, "grad_norm": 0.21014757454395294, "learning_rate": 0.00019626047711154094, "loss": 1.1142, "num_input_tokens_seen": 1738240, "step": 35, "train_runtime": 249.0199, "train_tokens_per_second": 6980.327 }, { "epoch": 0.023143683702989394, "grad_norm": 0.19807523488998413, "learning_rate": 0.0001961315280464217, "loss": 1.2255, "num_input_tokens_seen": 1788656, "step": 36, "train_runtime": 256.0945, "train_tokens_per_second": 6984.36 }, { "epoch": 0.02378656380585021, "grad_norm": 0.2257339507341385, "learning_rate": 0.00019600257898130238, "loss": 1.1833, "num_input_tokens_seen": 1830592, "step": 37, "train_runtime": 262.0096, "train_tokens_per_second": 6986.737 }, { "epoch": 0.024429443908711025, "grad_norm": 0.16706082224845886, "learning_rate": 0.00019587362991618313, "loss": 1.0836, "num_input_tokens_seen": 1889488, "step": 38, "train_runtime": 270.2441, "train_tokens_per_second": 6991.783 }, { "epoch": 0.02507232401157184, "grad_norm": 0.17788530886173248, "learning_rate": 0.00019574468085106384, "loss": 1.1416, "num_input_tokens_seen": 1926928, "step": 39, "train_runtime": 275.5398, "train_tokens_per_second": 6993.283 }, { "epoch": 0.02571520411443266, "grad_norm": 0.20560547709465027, "learning_rate": 0.00019561573178594456, "loss": 1.1354, "num_input_tokens_seen": 1975616, "step": 40, "train_runtime": 282.4472, "train_tokens_per_second": 6994.638 }, { "epoch": 0.026358084217293475, "grad_norm": 0.18634942173957825, "learning_rate": 0.00019548678272082528, "loss": 1.1416, "num_input_tokens_seen": 2020672, "step": 41, "train_runtime": 288.8056, "train_tokens_per_second": 6996.65 }, { "epoch": 0.02700096432015429, "grad_norm": 0.2036864012479782, "learning_rate": 0.00019535783365570602, "loss": 1.0778, "num_input_tokens_seen": 2059120, "step": 42, "train_runtime": 294.2046, "train_tokens_per_second": 6998.94 }, { "epoch": 0.027643844423015106, "grad_norm": 0.15779554843902588, "learning_rate": 0.00019522888459058672, "loss": 1.0298, "num_input_tokens_seen": 2113040, "step": 43, "train_runtime": 301.7907, "train_tokens_per_second": 7001.675 }, { "epoch": 0.028286724525875925, "grad_norm": 0.1940307766199112, "learning_rate": 0.00019509993552546746, "loss": 1.2145, "num_input_tokens_seen": 2168464, "step": 44, "train_runtime": 309.5156, "train_tokens_per_second": 7005.992 }, { "epoch": 0.02892960462873674, "grad_norm": 0.1537512242794037, "learning_rate": 0.00019497098646034818, "loss": 1.0519, "num_input_tokens_seen": 2221904, "step": 45, "train_runtime": 317.0459, "train_tokens_per_second": 7008.147 }, { "epoch": 0.029572484731597556, "grad_norm": 0.16348929703235626, "learning_rate": 0.0001948420373952289, "loss": 1.1651, "num_input_tokens_seen": 2261088, "step": 46, "train_runtime": 322.608, "train_tokens_per_second": 7008.778 }, { "epoch": 0.030215364834458372, "grad_norm": 0.1592399775981903, "learning_rate": 0.00019471308833010962, "loss": 1.0866, "num_input_tokens_seen": 2301040, "step": 47, "train_runtime": 328.2327, "train_tokens_per_second": 7010.392 }, { "epoch": 0.03085824493731919, "grad_norm": 0.15753492712974548, "learning_rate": 0.00019458413926499033, "loss": 1.2199, "num_input_tokens_seen": 2340080, "step": 48, "train_runtime": 333.7329, "train_tokens_per_second": 7011.835 }, { "epoch": 0.03150112504018, "grad_norm": 0.16081875562667847, "learning_rate": 0.00019445519019987105, "loss": 1.0763, "num_input_tokens_seen": 2385008, "step": 49, "train_runtime": 340.0525, "train_tokens_per_second": 7013.647 }, { "epoch": 0.032144005143040826, "grad_norm": 0.18117882311344147, "learning_rate": 0.00019432624113475177, "loss": 1.1252, "num_input_tokens_seen": 2424432, "step": 50, "train_runtime": 345.6231, "train_tokens_per_second": 7014.671 }, { "epoch": 0.03278688524590164, "grad_norm": 0.196014404296875, "learning_rate": 0.00019419729206963251, "loss": 1.1195, "num_input_tokens_seen": 2483664, "step": 51, "train_runtime": 353.9289, "train_tokens_per_second": 7017.409 }, { "epoch": 0.03342976534876246, "grad_norm": 0.17965562641620636, "learning_rate": 0.00019406834300451323, "loss": 1.1258, "num_input_tokens_seen": 2518352, "step": 52, "train_runtime": 358.8626, "train_tokens_per_second": 7017.594 }, { "epoch": 0.03407264545162327, "grad_norm": 0.1602979451417923, "learning_rate": 0.00019393939393939395, "loss": 1.0905, "num_input_tokens_seen": 2576704, "step": 53, "train_runtime": 367.0539, "train_tokens_per_second": 7019.961 }, { "epoch": 0.03471552555448409, "grad_norm": 0.17046068608760834, "learning_rate": 0.00019381044487427467, "loss": 1.1841, "num_input_tokens_seen": 2616624, "step": 54, "train_runtime": 372.6815, "train_tokens_per_second": 7021.074 }, { "epoch": 0.0353584056573449, "grad_norm": 0.15942060947418213, "learning_rate": 0.0001936814958091554, "loss": 1.0914, "num_input_tokens_seen": 2671344, "step": 55, "train_runtime": 380.3215, "train_tokens_per_second": 7023.911 }, { "epoch": 0.03600128576020572, "grad_norm": 0.17654664814472198, "learning_rate": 0.0001935525467440361, "loss": 1.0943, "num_input_tokens_seen": 2715520, "step": 56, "train_runtime": 386.5062, "train_tokens_per_second": 7025.813 }, { "epoch": 0.03664416586306654, "grad_norm": 0.23010510206222534, "learning_rate": 0.00019342359767891685, "loss": 1.1784, "num_input_tokens_seen": 2762960, "step": 57, "train_runtime": 393.1797, "train_tokens_per_second": 7027.219 }, { "epoch": 0.03728704596592736, "grad_norm": 0.17523719370365143, "learning_rate": 0.00019329464861379757, "loss": 1.1282, "num_input_tokens_seen": 2816064, "step": 58, "train_runtime": 400.6116, "train_tokens_per_second": 7029.413 }, { "epoch": 0.03792992606878817, "grad_norm": 0.21163171529769897, "learning_rate": 0.0001931656995486783, "loss": 1.0851, "num_input_tokens_seen": 2855264, "step": 59, "train_runtime": 406.1575, "train_tokens_per_second": 7029.942 }, { "epoch": 0.03857280617164899, "grad_norm": 0.25337469577789307, "learning_rate": 0.000193036750483559, "loss": 1.2117, "num_input_tokens_seen": 2904656, "step": 60, "train_runtime": 413.1009, "train_tokens_per_second": 7031.348 }, { "epoch": 0.0392156862745098, "grad_norm": 0.19712360203266144, "learning_rate": 0.00019290780141843972, "loss": 1.2204, "num_input_tokens_seen": 2971088, "step": 61, "train_runtime": 422.9897, "train_tokens_per_second": 7024.019 }, { "epoch": 0.03985856637737062, "grad_norm": 0.19821137189865112, "learning_rate": 0.00019277885235332044, "loss": 1.0626, "num_input_tokens_seen": 3013552, "step": 62, "train_runtime": 428.9561, "train_tokens_per_second": 7025.315 }, { "epoch": 0.040501446480231434, "grad_norm": 0.17856234312057495, "learning_rate": 0.00019264990328820116, "loss": 1.0619, "num_input_tokens_seen": 3059952, "step": 63, "train_runtime": 435.4318, "train_tokens_per_second": 7027.397 }, { "epoch": 0.04114432658309225, "grad_norm": 0.18660882115364075, "learning_rate": 0.0001925209542230819, "loss": 1.0679, "num_input_tokens_seen": 3107920, "step": 64, "train_runtime": 442.1457, "train_tokens_per_second": 7029.175 }, { "epoch": 0.04178720668595307, "grad_norm": 0.1943148672580719, "learning_rate": 0.0001923920051579626, "loss": 1.1859, "num_input_tokens_seen": 3155936, "step": 65, "train_runtime": 448.9004, "train_tokens_per_second": 7030.371 }, { "epoch": 0.04243008678881389, "grad_norm": 0.18507765233516693, "learning_rate": 0.00019226305609284334, "loss": 1.0599, "num_input_tokens_seen": 3190864, "step": 66, "train_runtime": 453.8531, "train_tokens_per_second": 7030.609 }, { "epoch": 0.043072966891674704, "grad_norm": 0.17876607179641724, "learning_rate": 0.00019213410702772406, "loss": 1.1394, "num_input_tokens_seen": 3233616, "step": 67, "train_runtime": 459.8348, "train_tokens_per_second": 7032.126 }, { "epoch": 0.04371584699453552, "grad_norm": 0.19422762095928192, "learning_rate": 0.00019200515796260478, "loss": 1.0683, "num_input_tokens_seen": 3303616, "step": 68, "train_runtime": 469.6416, "train_tokens_per_second": 7034.334 }, { "epoch": 0.044358727097396335, "grad_norm": 0.2042950987815857, "learning_rate": 0.0001918762088974855, "loss": 1.1002, "num_input_tokens_seen": 3353936, "step": 69, "train_runtime": 476.682, "train_tokens_per_second": 7036.003 }, { "epoch": 0.04500160720025715, "grad_norm": 0.18014422059059143, "learning_rate": 0.00019174725983236624, "loss": 0.9397, "num_input_tokens_seen": 3398368, "step": 70, "train_runtime": 482.9344, "train_tokens_per_second": 7036.915 }, { "epoch": 0.045644487303117966, "grad_norm": 0.16590985655784607, "learning_rate": 0.00019161831076724693, "loss": 1.0775, "num_input_tokens_seen": 3444640, "step": 71, "train_runtime": 489.4489, "train_tokens_per_second": 7037.793 }, { "epoch": 0.04628736740597879, "grad_norm": 0.19661296904087067, "learning_rate": 0.00019148936170212768, "loss": 1.1763, "num_input_tokens_seen": 3486768, "step": 72, "train_runtime": 495.3941, "train_tokens_per_second": 7038.372 }, { "epoch": 0.046930247508839604, "grad_norm": 0.18453364074230194, "learning_rate": 0.0001913604126370084, "loss": 1.0713, "num_input_tokens_seen": 3540944, "step": 73, "train_runtime": 502.9706, "train_tokens_per_second": 7040.062 }, { "epoch": 0.04757312761170042, "grad_norm": 0.1981048732995987, "learning_rate": 0.0001912314635718891, "loss": 1.1318, "num_input_tokens_seen": 3600416, "step": 74, "train_runtime": 511.3315, "train_tokens_per_second": 7041.255 }, { "epoch": 0.048216007714561235, "grad_norm": 0.19020932912826538, "learning_rate": 0.00019110251450676983, "loss": 1.1775, "num_input_tokens_seen": 3643216, "step": 75, "train_runtime": 517.3293, "train_tokens_per_second": 7042.354 }, { "epoch": 0.04885888781742205, "grad_norm": 0.19130156934261322, "learning_rate": 0.00019097356544165055, "loss": 1.0635, "num_input_tokens_seen": 3690592, "step": 76, "train_runtime": 523.9724, "train_tokens_per_second": 7043.485 }, { "epoch": 0.049501767920282866, "grad_norm": 0.191071018576622, "learning_rate": 0.0001908446163765313, "loss": 1.2032, "num_input_tokens_seen": 3743680, "step": 77, "train_runtime": 531.4274, "train_tokens_per_second": 7044.575 }, { "epoch": 0.05014464802314368, "grad_norm": 0.19254839420318604, "learning_rate": 0.00019071566731141199, "loss": 1.0561, "num_input_tokens_seen": 3788096, "step": 78, "train_runtime": 537.6994, "train_tokens_per_second": 7045.007 }, { "epoch": 0.0507875281260045, "grad_norm": 0.21967262029647827, "learning_rate": 0.00019058671824629273, "loss": 1.0789, "num_input_tokens_seen": 3824128, "step": 79, "train_runtime": 542.7932, "train_tokens_per_second": 7045.276 }, { "epoch": 0.05143040822886532, "grad_norm": 0.1794055998325348, "learning_rate": 0.00019045776918117345, "loss": 1.1144, "num_input_tokens_seen": 3869600, "step": 80, "train_runtime": 549.2268, "train_tokens_per_second": 7045.541 }, { "epoch": 0.052073288331726135, "grad_norm": 0.22182276844978333, "learning_rate": 0.00019032882011605417, "loss": 1.0452, "num_input_tokens_seen": 3930416, "step": 81, "train_runtime": 557.7179, "train_tokens_per_second": 7047.319 }, { "epoch": 0.05271616843458695, "grad_norm": 0.1964883953332901, "learning_rate": 0.00019019987105093489, "loss": 1.1264, "num_input_tokens_seen": 3994528, "step": 82, "train_runtime": 566.7719, "train_tokens_per_second": 7047.859 }, { "epoch": 0.053359048537447766, "grad_norm": 0.18389713764190674, "learning_rate": 0.00019007092198581563, "loss": 1.1044, "num_input_tokens_seen": 4025760, "step": 83, "train_runtime": 571.2105, "train_tokens_per_second": 7047.769 }, { "epoch": 0.05400192864030858, "grad_norm": 0.21487605571746826, "learning_rate": 0.00018994197292069632, "loss": 1.0369, "num_input_tokens_seen": 4073840, "step": 84, "train_runtime": 577.9687, "train_tokens_per_second": 7048.548 }, { "epoch": 0.0546448087431694, "grad_norm": 0.21032066643238068, "learning_rate": 0.00018981302385557707, "loss": 1.0615, "num_input_tokens_seen": 4108976, "step": 85, "train_runtime": 582.9533, "train_tokens_per_second": 7048.551 }, { "epoch": 0.05528768884603021, "grad_norm": 0.19567039608955383, "learning_rate": 0.00018968407479045778, "loss": 0.9216, "num_input_tokens_seen": 4164832, "step": 86, "train_runtime": 590.7405, "train_tokens_per_second": 7050.188 }, { "epoch": 0.055930568948891035, "grad_norm": 0.2140112817287445, "learning_rate": 0.00018955512572533848, "loss": 1.1268, "num_input_tokens_seen": 4223920, "step": 87, "train_runtime": 599.009, "train_tokens_per_second": 7051.513 }, { "epoch": 0.05657344905175185, "grad_norm": 0.2232234627008438, "learning_rate": 0.00018942617666021922, "loss": 1.1666, "num_input_tokens_seen": 4257440, "step": 88, "train_runtime": 603.7538, "train_tokens_per_second": 7051.616 }, { "epoch": 0.057216329154612666, "grad_norm": 0.20844654738903046, "learning_rate": 0.00018929722759509994, "loss": 0.9959, "num_input_tokens_seen": 4291488, "step": 89, "train_runtime": 608.6239, "train_tokens_per_second": 7051.133 }, { "epoch": 0.05785920925747348, "grad_norm": 0.21762102842330933, "learning_rate": 0.00018916827852998066, "loss": 1.0791, "num_input_tokens_seen": 4350704, "step": 90, "train_runtime": 616.9377, "train_tokens_per_second": 7052.097 }, { "epoch": 0.0585020893603343, "grad_norm": 0.2169635146856308, "learning_rate": 0.00018903932946486138, "loss": 1.169, "num_input_tokens_seen": 4390512, "step": 91, "train_runtime": 623.0766, "train_tokens_per_second": 7046.505 }, { "epoch": 0.05914496946319511, "grad_norm": 0.19721537828445435, "learning_rate": 0.00018891038039974212, "loss": 1.0508, "num_input_tokens_seen": 4441920, "step": 92, "train_runtime": 630.2606, "train_tokens_per_second": 7047.751 }, { "epoch": 0.05978784956605593, "grad_norm": 0.23010528087615967, "learning_rate": 0.00018878143133462284, "loss": 0.9817, "num_input_tokens_seen": 4486672, "step": 93, "train_runtime": 636.5612, "train_tokens_per_second": 7048.297 }, { "epoch": 0.060430729668916744, "grad_norm": 0.19669458270072937, "learning_rate": 0.00018865248226950356, "loss": 1.0702, "num_input_tokens_seen": 4538384, "step": 94, "train_runtime": 643.8004, "train_tokens_per_second": 7049.365 }, { "epoch": 0.061073609771777566, "grad_norm": 0.33032017946243286, "learning_rate": 0.00018852353320438427, "loss": 1.0299, "num_input_tokens_seen": 4589312, "step": 95, "train_runtime": 651.0321, "train_tokens_per_second": 7049.287 }, { "epoch": 0.06171648987463838, "grad_norm": 0.18110264837741852, "learning_rate": 0.00018839458413926502, "loss": 0.9553, "num_input_tokens_seen": 4626080, "step": 96, "train_runtime": 656.2234, "train_tokens_per_second": 7049.55 }, { "epoch": 0.0623593699774992, "grad_norm": 0.2149723619222641, "learning_rate": 0.0001882656350741457, "loss": 1.1532, "num_input_tokens_seen": 4668624, "step": 97, "train_runtime": 662.2157, "train_tokens_per_second": 7050.005 }, { "epoch": 0.06300225008036, "grad_norm": 0.21420878171920776, "learning_rate": 0.00018813668600902646, "loss": 1.1092, "num_input_tokens_seen": 4724240, "step": 98, "train_runtime": 670.094, "train_tokens_per_second": 7050.115 }, { "epoch": 0.06364513018322084, "grad_norm": 0.21070437133312225, "learning_rate": 0.00018800773694390717, "loss": 0.9589, "num_input_tokens_seen": 4795776, "step": 99, "train_runtime": 680.0991, "train_tokens_per_second": 7051.584 }, { "epoch": 0.06428801028608165, "grad_norm": 0.19431836903095245, "learning_rate": 0.0001878787878787879, "loss": 1.0636, "num_input_tokens_seen": 4851008, "step": 100, "train_runtime": 687.8429, "train_tokens_per_second": 7052.494 }, { "epoch": 0.06493089038894247, "grad_norm": 0.20360679924488068, "learning_rate": 0.0001877498388136686, "loss": 1.1182, "num_input_tokens_seen": 4891088, "step": 101, "train_runtime": 693.4719, "train_tokens_per_second": 7053.044 }, { "epoch": 0.06557377049180328, "grad_norm": 0.21350686252117157, "learning_rate": 0.00018762088974854933, "loss": 1.0525, "num_input_tokens_seen": 4952416, "step": 102, "train_runtime": 702.1041, "train_tokens_per_second": 7053.678 }, { "epoch": 0.0662166505946641, "grad_norm": 0.2190914750099182, "learning_rate": 0.00018749194068343005, "loss": 1.0602, "num_input_tokens_seen": 5000400, "step": 103, "train_runtime": 708.8252, "train_tokens_per_second": 7054.489 }, { "epoch": 0.06685953069752491, "grad_norm": 0.21608233451843262, "learning_rate": 0.00018736299161831077, "loss": 1.1176, "num_input_tokens_seen": 5048592, "step": 104, "train_runtime": 715.5961, "train_tokens_per_second": 7055.086 }, { "epoch": 0.06750241080038573, "grad_norm": 0.21670708060264587, "learning_rate": 0.0001872340425531915, "loss": 1.1591, "num_input_tokens_seen": 5081664, "step": 105, "train_runtime": 720.3252, "train_tokens_per_second": 7054.68 }, { "epoch": 0.06814529090324654, "grad_norm": 0.20723669230937958, "learning_rate": 0.0001871050934880722, "loss": 1.0741, "num_input_tokens_seen": 5133264, "step": 106, "train_runtime": 727.5521, "train_tokens_per_second": 7055.528 }, { "epoch": 0.06878817100610736, "grad_norm": 0.22334900498390198, "learning_rate": 0.00018697614442295295, "loss": 1.2012, "num_input_tokens_seen": 5180464, "step": 107, "train_runtime": 734.1803, "train_tokens_per_second": 7056.12 }, { "epoch": 0.06943105110896818, "grad_norm": 0.19817394018173218, "learning_rate": 0.00018684719535783366, "loss": 1.0348, "num_input_tokens_seen": 5227712, "step": 108, "train_runtime": 740.8405, "train_tokens_per_second": 7056.461 }, { "epoch": 0.07007393121182899, "grad_norm": 0.22613032162189484, "learning_rate": 0.00018671824629271438, "loss": 1.0507, "num_input_tokens_seen": 5297424, "step": 109, "train_runtime": 750.5378, "train_tokens_per_second": 7058.171 }, { "epoch": 0.0707168113146898, "grad_norm": 0.19790789484977722, "learning_rate": 0.0001865892972275951, "loss": 1.1512, "num_input_tokens_seen": 5353920, "step": 110, "train_runtime": 758.4763, "train_tokens_per_second": 7058.783 }, { "epoch": 0.07135969141755062, "grad_norm": 0.19805489480495453, "learning_rate": 0.00018646034816247585, "loss": 1.0392, "num_input_tokens_seen": 5387872, "step": 111, "train_runtime": 763.2666, "train_tokens_per_second": 7058.965 }, { "epoch": 0.07200257152041144, "grad_norm": 0.21664251387119293, "learning_rate": 0.00018633139909735656, "loss": 1.0399, "num_input_tokens_seen": 5431632, "step": 112, "train_runtime": 769.3579, "train_tokens_per_second": 7059.954 }, { "epoch": 0.07264545162327225, "grad_norm": 0.21840597689151764, "learning_rate": 0.00018620245003223728, "loss": 1.0969, "num_input_tokens_seen": 5478704, "step": 113, "train_runtime": 775.8252, "train_tokens_per_second": 7061.776 }, { "epoch": 0.07328833172613308, "grad_norm": 0.1976010650396347, "learning_rate": 0.000186073500967118, "loss": 0.9954, "num_input_tokens_seen": 5528176, "step": 114, "train_runtime": 782.6383, "train_tokens_per_second": 7063.513 }, { "epoch": 0.0739312118289939, "grad_norm": 0.19003896415233612, "learning_rate": 0.00018594455190199872, "loss": 1.0055, "num_input_tokens_seen": 5593040, "step": 115, "train_runtime": 791.6683, "train_tokens_per_second": 7064.878 }, { "epoch": 0.07457409193185471, "grad_norm": 0.1933498978614807, "learning_rate": 0.00018581560283687944, "loss": 1.0906, "num_input_tokens_seen": 5633680, "step": 116, "train_runtime": 797.3292, "train_tokens_per_second": 7065.689 }, { "epoch": 0.07521697203471553, "grad_norm": 0.2050444781780243, "learning_rate": 0.00018568665377176016, "loss": 0.9672, "num_input_tokens_seen": 5683744, "step": 117, "train_runtime": 804.286, "train_tokens_per_second": 7066.819 }, { "epoch": 0.07585985213757634, "grad_norm": 0.20085984468460083, "learning_rate": 0.0001855577047066409, "loss": 1.0086, "num_input_tokens_seen": 5718912, "step": 118, "train_runtime": 809.2226, "train_tokens_per_second": 7067.168 }, { "epoch": 0.07650273224043716, "grad_norm": 0.2239076942205429, "learning_rate": 0.0001854287556415216, "loss": 1.0371, "num_input_tokens_seen": 5787328, "step": 119, "train_runtime": 818.7746, "train_tokens_per_second": 7068.28 }, { "epoch": 0.07714561234329798, "grad_norm": 0.2009563148021698, "learning_rate": 0.00018529980657640234, "loss": 1.1895, "num_input_tokens_seen": 5823296, "step": 120, "train_runtime": 823.7933, "train_tokens_per_second": 7068.88 }, { "epoch": 0.07778849244615879, "grad_norm": 0.24800238013267517, "learning_rate": 0.00018517085751128305, "loss": 1.0178, "num_input_tokens_seen": 5891968, "step": 121, "train_runtime": 833.7905, "train_tokens_per_second": 7066.485 }, { "epoch": 0.0784313725490196, "grad_norm": 0.20752151310443878, "learning_rate": 0.00018504190844616377, "loss": 1.1151, "num_input_tokens_seen": 5945280, "step": 122, "train_runtime": 841.1288, "train_tokens_per_second": 7068.216 }, { "epoch": 0.07907425265188042, "grad_norm": 0.22319258749485016, "learning_rate": 0.0001849129593810445, "loss": 0.9032, "num_input_tokens_seen": 5991152, "step": 123, "train_runtime": 847.4512, "train_tokens_per_second": 7069.613 }, { "epoch": 0.07971713275474124, "grad_norm": 0.23252902925014496, "learning_rate": 0.00018478401031592524, "loss": 1.1092, "num_input_tokens_seen": 6027488, "step": 124, "train_runtime": 852.5296, "train_tokens_per_second": 7070.122 }, { "epoch": 0.08036001285760205, "grad_norm": 0.2191491425037384, "learning_rate": 0.00018465506125080593, "loss": 1.1129, "num_input_tokens_seen": 6064384, "step": 125, "train_runtime": 857.6884, "train_tokens_per_second": 7070.614 }, { "epoch": 0.08100289296046287, "grad_norm": 0.2259877622127533, "learning_rate": 0.00018452611218568667, "loss": 1.1156, "num_input_tokens_seen": 6157600, "step": 126, "train_runtime": 870.549, "train_tokens_per_second": 7073.238 }, { "epoch": 0.08164577306332368, "grad_norm": 0.22781765460968018, "learning_rate": 0.0001843971631205674, "loss": 1.1326, "num_input_tokens_seen": 6197904, "step": 127, "train_runtime": 876.1256, "train_tokens_per_second": 7074.218 }, { "epoch": 0.0822886531661845, "grad_norm": 0.1966547816991806, "learning_rate": 0.0001842682140554481, "loss": 1.0326, "num_input_tokens_seen": 6242368, "step": 128, "train_runtime": 882.251, "train_tokens_per_second": 7075.501 }, { "epoch": 0.08293153326904533, "grad_norm": 0.22219525277614594, "learning_rate": 0.00018413926499032883, "loss": 1.0803, "num_input_tokens_seen": 6306416, "step": 129, "train_runtime": 891.1022, "train_tokens_per_second": 7077.096 }, { "epoch": 0.08357441337190614, "grad_norm": 0.1935926377773285, "learning_rate": 0.00018401031592520954, "loss": 1.1262, "num_input_tokens_seen": 6356528, "step": 130, "train_runtime": 897.9981, "train_tokens_per_second": 7078.554 }, { "epoch": 0.08421729347476696, "grad_norm": 0.2209094762802124, "learning_rate": 0.00018388136686009026, "loss": 1.163, "num_input_tokens_seen": 6422768, "step": 131, "train_runtime": 907.1079, "train_tokens_per_second": 7080.49 }, { "epoch": 0.08486017357762778, "grad_norm": 0.223740816116333, "learning_rate": 0.00018375241779497098, "loss": 1.1249, "num_input_tokens_seen": 6464640, "step": 132, "train_runtime": 912.8481, "train_tokens_per_second": 7081.835 }, { "epoch": 0.08550305368048859, "grad_norm": 0.2206628918647766, "learning_rate": 0.00018362346872985173, "loss": 1.0312, "num_input_tokens_seen": 6500848, "step": 133, "train_runtime": 917.9064, "train_tokens_per_second": 7082.256 }, { "epoch": 0.08614593378334941, "grad_norm": 0.23904292285442352, "learning_rate": 0.00018349451966473244, "loss": 1.1285, "num_input_tokens_seen": 6553072, "step": 134, "train_runtime": 925.0205, "train_tokens_per_second": 7084.245 }, { "epoch": 0.08678881388621022, "grad_norm": 0.21213850378990173, "learning_rate": 0.00018336557059961316, "loss": 0.9785, "num_input_tokens_seen": 6593648, "step": 135, "train_runtime": 930.6399, "train_tokens_per_second": 7085.069 }, { "epoch": 0.08743169398907104, "grad_norm": 0.25068166851997375, "learning_rate": 0.00018323662153449388, "loss": 0.9906, "num_input_tokens_seen": 6655792, "step": 136, "train_runtime": 939.2004, "train_tokens_per_second": 7086.658 }, { "epoch": 0.08807457409193185, "grad_norm": 0.2144203633069992, "learning_rate": 0.00018310767246937463, "loss": 1.1189, "num_input_tokens_seen": 6701456, "step": 137, "train_runtime": 945.4803, "train_tokens_per_second": 7087.885 }, { "epoch": 0.08871745419479267, "grad_norm": 0.219550222158432, "learning_rate": 0.00018297872340425532, "loss": 0.969, "num_input_tokens_seen": 6757216, "step": 138, "train_runtime": 953.1781, "train_tokens_per_second": 7089.143 }, { "epoch": 0.08936033429765348, "grad_norm": 0.2444351464509964, "learning_rate": 0.00018284977433913606, "loss": 1.1312, "num_input_tokens_seen": 6801888, "step": 139, "train_runtime": 959.3814, "train_tokens_per_second": 7089.869 }, { "epoch": 0.0900032144005143, "grad_norm": 0.1964501291513443, "learning_rate": 0.00018272082527401678, "loss": 1.0268, "num_input_tokens_seen": 6866432, "step": 140, "train_runtime": 968.3634, "train_tokens_per_second": 7090.759 }, { "epoch": 0.09064609450337512, "grad_norm": 0.2163739949464798, "learning_rate": 0.00018259187620889747, "loss": 0.9358, "num_input_tokens_seen": 6911232, "step": 141, "train_runtime": 974.5993, "train_tokens_per_second": 7091.357 }, { "epoch": 0.09128897460623593, "grad_norm": 0.25095582008361816, "learning_rate": 0.00018246292714377822, "loss": 1.0278, "num_input_tokens_seen": 6968496, "step": 142, "train_runtime": 982.5023, "train_tokens_per_second": 7092.6 }, { "epoch": 0.09193185470909675, "grad_norm": 0.2552036941051483, "learning_rate": 0.00018233397807865893, "loss": 1.2132, "num_input_tokens_seen": 7001616, "step": 143, "train_runtime": 987.1499, "train_tokens_per_second": 7092.759 }, { "epoch": 0.09257473481195758, "grad_norm": 0.2304268479347229, "learning_rate": 0.00018220502901353965, "loss": 1.087, "num_input_tokens_seen": 7039440, "step": 144, "train_runtime": 992.4368, "train_tokens_per_second": 7093.086 }, { "epoch": 0.09321761491481839, "grad_norm": 0.24973514676094055, "learning_rate": 0.00018207607994842037, "loss": 1.0373, "num_input_tokens_seen": 7090448, "step": 145, "train_runtime": 999.5329, "train_tokens_per_second": 7093.761 }, { "epoch": 0.09386049501767921, "grad_norm": 0.24035415053367615, "learning_rate": 0.00018194713088330112, "loss": 0.9661, "num_input_tokens_seen": 7132352, "step": 146, "train_runtime": 1005.376, "train_tokens_per_second": 7094.213 }, { "epoch": 0.09450337512054002, "grad_norm": 0.2570725977420807, "learning_rate": 0.00018181818181818183, "loss": 1.0897, "num_input_tokens_seen": 7178112, "step": 147, "train_runtime": 1011.7434, "train_tokens_per_second": 7094.795 }, { "epoch": 0.09514625522340084, "grad_norm": 0.2333613485097885, "learning_rate": 0.00018168923275306255, "loss": 1.1247, "num_input_tokens_seen": 7213856, "step": 148, "train_runtime": 1016.7771, "train_tokens_per_second": 7094.825 }, { "epoch": 0.09578913532626165, "grad_norm": 0.2136976569890976, "learning_rate": 0.00018156028368794327, "loss": 1.0022, "num_input_tokens_seen": 7257296, "step": 149, "train_runtime": 1022.8844, "train_tokens_per_second": 7094.933 }, { "epoch": 0.09643201542912247, "grad_norm": 0.23702369630336761, "learning_rate": 0.000181431334622824, "loss": 1.2264, "num_input_tokens_seen": 7302064, "step": 150, "train_runtime": 1029.1706, "train_tokens_per_second": 7095.096 }, { "epoch": 0.09707489553198329, "grad_norm": 0.2674248218536377, "learning_rate": 0.0001813023855577047, "loss": 1.0873, "num_input_tokens_seen": 7351824, "step": 151, "train_runtime": 1036.6946, "train_tokens_per_second": 7091.601 }, { "epoch": 0.0977177756348441, "grad_norm": 0.21677564084529877, "learning_rate": 0.00018117343649258545, "loss": 1.087, "num_input_tokens_seen": 7413824, "step": 152, "train_runtime": 1045.3339, "train_tokens_per_second": 7092.302 }, { "epoch": 0.09836065573770492, "grad_norm": 0.2248373031616211, "learning_rate": 0.00018104448742746617, "loss": 1.0474, "num_input_tokens_seen": 7454160, "step": 153, "train_runtime": 1050.9856, "train_tokens_per_second": 7092.542 }, { "epoch": 0.09900353584056573, "grad_norm": 0.22680656611919403, "learning_rate": 0.0001809155383623469, "loss": 1.087, "num_input_tokens_seen": 7493616, "step": 154, "train_runtime": 1056.5707, "train_tokens_per_second": 7092.394 }, { "epoch": 0.09964641594342655, "grad_norm": 0.19268976151943207, "learning_rate": 0.0001807865892972276, "loss": 0.8812, "num_input_tokens_seen": 7538000, "step": 155, "train_runtime": 1062.8564, "train_tokens_per_second": 7092.21 }, { "epoch": 0.10028929604628736, "grad_norm": 0.22635945677757263, "learning_rate": 0.00018065764023210832, "loss": 1.0733, "num_input_tokens_seen": 7581424, "step": 156, "train_runtime": 1068.9436, "train_tokens_per_second": 7092.445 }, { "epoch": 0.10028929604628736, "eval_loss": 1.0724854469299316, "eval_runtime": 39.9606, "eval_samples_per_second": 24.875, "eval_steps_per_second": 1.577, "num_input_tokens_seen": 7581424, "step": 156 }, { "epoch": 0.10093217614914818, "grad_norm": 0.1949465125799179, "learning_rate": 0.00018052869116698904, "loss": 1.0841, "num_input_tokens_seen": 7627072, "step": 157, "train_runtime": 1115.3292, "train_tokens_per_second": 6838.404 }, { "epoch": 0.101575056252009, "grad_norm": 0.22935912013053894, "learning_rate": 0.00018039974210186976, "loss": 1.0461, "num_input_tokens_seen": 7661936, "step": 158, "train_runtime": 1120.2715, "train_tokens_per_second": 6839.357 }, { "epoch": 0.10221793635486982, "grad_norm": 0.1948421150445938, "learning_rate": 0.0001802707930367505, "loss": 1.1345, "num_input_tokens_seen": 7713968, "step": 159, "train_runtime": 1127.5172, "train_tokens_per_second": 6841.552 }, { "epoch": 0.10286081645773064, "grad_norm": 0.212183877825737, "learning_rate": 0.0001801418439716312, "loss": 1.0388, "num_input_tokens_seen": 7752976, "step": 160, "train_runtime": 1132.9323, "train_tokens_per_second": 6843.283 }, { "epoch": 0.10350369656059145, "grad_norm": 0.21781344711780548, "learning_rate": 0.00018001289490651194, "loss": 1.0323, "num_input_tokens_seen": 7791104, "step": 161, "train_runtime": 1138.279, "train_tokens_per_second": 6844.635 }, { "epoch": 0.10414657666345227, "grad_norm": 0.24289098381996155, "learning_rate": 0.00017988394584139266, "loss": 0.9597, "num_input_tokens_seen": 7843168, "step": 162, "train_runtime": 1145.4597, "train_tokens_per_second": 6847.179 }, { "epoch": 0.10478945676631309, "grad_norm": 0.22889725863933563, "learning_rate": 0.00017975499677627338, "loss": 1.0462, "num_input_tokens_seen": 7888016, "step": 163, "train_runtime": 1151.7079, "train_tokens_per_second": 6848.973 }, { "epoch": 0.1054323368691739, "grad_norm": 0.2221020758152008, "learning_rate": 0.0001796260477111541, "loss": 1.0538, "num_input_tokens_seen": 7942304, "step": 164, "train_runtime": 1159.2432, "train_tokens_per_second": 6851.284 }, { "epoch": 0.10607521697203472, "grad_norm": 0.19479186832904816, "learning_rate": 0.00017949709864603484, "loss": 0.9074, "num_input_tokens_seen": 7980496, "step": 165, "train_runtime": 1164.6073, "train_tokens_per_second": 6852.521 }, { "epoch": 0.10671809707489553, "grad_norm": 0.2103356570005417, "learning_rate": 0.00017936814958091553, "loss": 0.9725, "num_input_tokens_seen": 8031264, "step": 166, "train_runtime": 1171.6399, "train_tokens_per_second": 6854.721 }, { "epoch": 0.10736097717775635, "grad_norm": 0.2254662811756134, "learning_rate": 0.00017923920051579628, "loss": 1.018, "num_input_tokens_seen": 8074720, "step": 167, "train_runtime": 1177.7123, "train_tokens_per_second": 6856.276 }, { "epoch": 0.10800385728061716, "grad_norm": 0.23099878430366516, "learning_rate": 0.000179110251450677, "loss": 0.9887, "num_input_tokens_seen": 8117776, "step": 168, "train_runtime": 1183.679, "train_tokens_per_second": 6858.089 }, { "epoch": 0.10864673738347798, "grad_norm": 0.22438518702983856, "learning_rate": 0.00017898130238555771, "loss": 1.0775, "num_input_tokens_seen": 8183888, "step": 169, "train_runtime": 1192.8273, "train_tokens_per_second": 6860.916 }, { "epoch": 0.1092896174863388, "grad_norm": 0.2522250711917877, "learning_rate": 0.00017885235332043843, "loss": 1.1234, "num_input_tokens_seen": 8243600, "step": 170, "train_runtime": 1201.0972, "train_tokens_per_second": 6863.391 }, { "epoch": 0.10993249758919961, "grad_norm": 0.23084506392478943, "learning_rate": 0.00017872340425531915, "loss": 1.1419, "num_input_tokens_seen": 8315104, "step": 171, "train_runtime": 1211.0141, "train_tokens_per_second": 6866.232 }, { "epoch": 0.11057537769206043, "grad_norm": 0.21146203577518463, "learning_rate": 0.0001785944551901999, "loss": 0.9589, "num_input_tokens_seen": 8361632, "step": 172, "train_runtime": 1217.4549, "train_tokens_per_second": 6868.125 }, { "epoch": 0.11121825779492124, "grad_norm": 0.2073734998703003, "learning_rate": 0.0001784655061250806, "loss": 1.0018, "num_input_tokens_seen": 8398272, "step": 173, "train_runtime": 1222.5503, "train_tokens_per_second": 6869.47 }, { "epoch": 0.11186113789778207, "grad_norm": 0.23064003884792328, "learning_rate": 0.00017833655705996133, "loss": 1.0175, "num_input_tokens_seen": 8436592, "step": 174, "train_runtime": 1227.8678, "train_tokens_per_second": 6870.928 }, { "epoch": 0.11250401800064289, "grad_norm": 0.2068207710981369, "learning_rate": 0.00017820760799484205, "loss": 0.9224, "num_input_tokens_seen": 8486672, "step": 175, "train_runtime": 1234.8255, "train_tokens_per_second": 6872.77 }, { "epoch": 0.1131468981035037, "grad_norm": 0.21776925027370453, "learning_rate": 0.00017807865892972277, "loss": 1.0478, "num_input_tokens_seen": 8573280, "step": 176, "train_runtime": 1246.8789, "train_tokens_per_second": 6875.792 }, { "epoch": 0.11378977820636452, "grad_norm": 0.2205696552991867, "learning_rate": 0.00017794970986460349, "loss": 0.993, "num_input_tokens_seen": 8631824, "step": 177, "train_runtime": 1255.0271, "train_tokens_per_second": 6877.799 }, { "epoch": 0.11443265830922533, "grad_norm": 0.22359175980091095, "learning_rate": 0.00017782076079948423, "loss": 1.0263, "num_input_tokens_seen": 8669328, "step": 178, "train_runtime": 1260.2564, "train_tokens_per_second": 6879.019 }, { "epoch": 0.11507553841208615, "grad_norm": 0.21172000467777252, "learning_rate": 0.00017769181173436492, "loss": 0.916, "num_input_tokens_seen": 8708768, "step": 179, "train_runtime": 1265.7239, "train_tokens_per_second": 6880.464 }, { "epoch": 0.11571841851494696, "grad_norm": 0.2595050036907196, "learning_rate": 0.00017756286266924567, "loss": 1.174, "num_input_tokens_seen": 8761984, "step": 180, "train_runtime": 1273.0455, "train_tokens_per_second": 6882.695 }, { "epoch": 0.11636129861780778, "grad_norm": 0.21484827995300293, "learning_rate": 0.00017743391360412639, "loss": 1.0035, "num_input_tokens_seen": 8804384, "step": 181, "train_runtime": 1279.4701, "train_tokens_per_second": 6881.274 }, { "epoch": 0.1170041787206686, "grad_norm": 0.21428106725215912, "learning_rate": 0.00017730496453900708, "loss": 0.8851, "num_input_tokens_seen": 8861280, "step": 182, "train_runtime": 1287.2763, "train_tokens_per_second": 6883.743 }, { "epoch": 0.11764705882352941, "grad_norm": 0.20558470487594604, "learning_rate": 0.00017717601547388782, "loss": 1.0338, "num_input_tokens_seen": 8918064, "step": 183, "train_runtime": 1295.0934, "train_tokens_per_second": 6886.039 }, { "epoch": 0.11828993892639023, "grad_norm": 0.21777905523777008, "learning_rate": 0.00017704706640876854, "loss": 0.9756, "num_input_tokens_seen": 8960192, "step": 184, "train_runtime": 1300.9164, "train_tokens_per_second": 6887.6 }, { "epoch": 0.11893281902925104, "grad_norm": 0.21575364470481873, "learning_rate": 0.00017691811734364926, "loss": 1.0877, "num_input_tokens_seen": 8998128, "step": 185, "train_runtime": 1306.1898, "train_tokens_per_second": 6888.837 }, { "epoch": 0.11957569913211186, "grad_norm": 0.2269899994134903, "learning_rate": 0.00017678916827852998, "loss": 1.0258, "num_input_tokens_seen": 9055952, "step": 186, "train_runtime": 1314.1654, "train_tokens_per_second": 6891.029 }, { "epoch": 0.12021857923497267, "grad_norm": 0.24424798786640167, "learning_rate": 0.00017666021921341072, "loss": 1.0449, "num_input_tokens_seen": 9116272, "step": 187, "train_runtime": 1322.4634, "train_tokens_per_second": 6893.402 }, { "epoch": 0.12086145933783349, "grad_norm": 0.22270651161670685, "learning_rate": 0.00017653127014829144, "loss": 1.0173, "num_input_tokens_seen": 9164416, "step": 188, "train_runtime": 1329.1451, "train_tokens_per_second": 6894.97 }, { "epoch": 0.12150433944069432, "grad_norm": 0.2047732174396515, "learning_rate": 0.00017640232108317216, "loss": 0.9592, "num_input_tokens_seen": 9195696, "step": 189, "train_runtime": 1333.5875, "train_tokens_per_second": 6895.457 }, { "epoch": 0.12214721954355513, "grad_norm": 0.24051836133003235, "learning_rate": 0.00017627337201805288, "loss": 1.0174, "num_input_tokens_seen": 9251120, "step": 190, "train_runtime": 1341.2546, "train_tokens_per_second": 6897.363 }, { "epoch": 0.12279009964641595, "grad_norm": 0.23167778551578522, "learning_rate": 0.0001761444229529336, "loss": 1.145, "num_input_tokens_seen": 9311872, "step": 191, "train_runtime": 1349.7292, "train_tokens_per_second": 6899.067 }, { "epoch": 0.12343297974927676, "grad_norm": 0.22334854304790497, "learning_rate": 0.0001760154738878143, "loss": 1.0342, "num_input_tokens_seen": 9344960, "step": 192, "train_runtime": 1354.3406, "train_tokens_per_second": 6900.007 }, { "epoch": 0.12407585985213758, "grad_norm": 0.21167592704296112, "learning_rate": 0.00017588652482269506, "loss": 1.0305, "num_input_tokens_seen": 9406096, "step": 193, "train_runtime": 1362.8133, "train_tokens_per_second": 6901.969 }, { "epoch": 0.1247187399549984, "grad_norm": 0.2151985913515091, "learning_rate": 0.00017575757575757578, "loss": 1.0412, "num_input_tokens_seen": 9475040, "step": 194, "train_runtime": 1372.3769, "train_tokens_per_second": 6904.109 }, { "epoch": 0.1253616200578592, "grad_norm": 0.22665420174598694, "learning_rate": 0.00017562862669245647, "loss": 1.1126, "num_input_tokens_seen": 9530432, "step": 195, "train_runtime": 1380.1019, "train_tokens_per_second": 6905.6 }, { "epoch": 0.12600450016072, "grad_norm": 0.2426138073205948, "learning_rate": 0.0001754996776273372, "loss": 1.0301, "num_input_tokens_seen": 9595536, "step": 196, "train_runtime": 1389.1031, "train_tokens_per_second": 6907.721 }, { "epoch": 0.12664738026358086, "grad_norm": 0.28386926651000977, "learning_rate": 0.00017537072856221793, "loss": 0.9756, "num_input_tokens_seen": 9633680, "step": 197, "train_runtime": 1394.4152, "train_tokens_per_second": 6908.76 }, { "epoch": 0.12729026036644167, "grad_norm": 0.21381893754005432, "learning_rate": 0.00017524177949709865, "loss": 1.0494, "num_input_tokens_seen": 9704480, "step": 198, "train_runtime": 1404.1835, "train_tokens_per_second": 6911.119 }, { "epoch": 0.1279331404693025, "grad_norm": 0.23659008741378784, "learning_rate": 0.00017511283043197937, "loss": 1.0873, "num_input_tokens_seen": 9762144, "step": 199, "train_runtime": 1412.2135, "train_tokens_per_second": 6912.654 }, { "epoch": 0.1285760205721633, "grad_norm": 0.25226446986198425, "learning_rate": 0.0001749838813668601, "loss": 1.0107, "num_input_tokens_seen": 9803008, "step": 200, "train_runtime": 1417.8691, "train_tokens_per_second": 6913.902 }, { "epoch": 0.12921890067502412, "grad_norm": 0.2516157925128937, "learning_rate": 0.0001748549323017408, "loss": 1.0264, "num_input_tokens_seen": 9844768, "step": 201, "train_runtime": 1423.6304, "train_tokens_per_second": 6915.255 }, { "epoch": 0.12986178077788493, "grad_norm": 0.24535000324249268, "learning_rate": 0.00017472598323662155, "loss": 1.0769, "num_input_tokens_seen": 9926304, "step": 202, "train_runtime": 1434.9118, "train_tokens_per_second": 6917.71 }, { "epoch": 0.13050466088074575, "grad_norm": 0.22521895170211792, "learning_rate": 0.00017459703417150227, "loss": 0.9298, "num_input_tokens_seen": 9964880, "step": 203, "train_runtime": 1440.226, "train_tokens_per_second": 6918.97 }, { "epoch": 0.13114754098360656, "grad_norm": 0.22114278376102448, "learning_rate": 0.00017446808510638298, "loss": 1.0312, "num_input_tokens_seen": 10016000, "step": 204, "train_runtime": 1447.364, "train_tokens_per_second": 6920.166 }, { "epoch": 0.13179042108646738, "grad_norm": 0.25172755122184753, "learning_rate": 0.0001743391360412637, "loss": 0.9959, "num_input_tokens_seen": 10066848, "step": 205, "train_runtime": 1454.362, "train_tokens_per_second": 6921.831 }, { "epoch": 0.1324333011893282, "grad_norm": 0.21752239763736725, "learning_rate": 0.00017421018697614445, "loss": 1.0253, "num_input_tokens_seen": 10121968, "step": 206, "train_runtime": 1461.9531, "train_tokens_per_second": 6923.593 }, { "epoch": 0.133076181292189, "grad_norm": 0.2266158163547516, "learning_rate": 0.00017408123791102517, "loss": 1.0936, "num_input_tokens_seen": 10168336, "step": 207, "train_runtime": 1468.3641, "train_tokens_per_second": 6924.942 }, { "epoch": 0.13371906139504983, "grad_norm": 0.25873246788978577, "learning_rate": 0.00017395228884590588, "loss": 1.038, "num_input_tokens_seen": 10203984, "step": 208, "train_runtime": 1473.3039, "train_tokens_per_second": 6925.919 }, { "epoch": 0.13436194149791064, "grad_norm": 0.21677619218826294, "learning_rate": 0.0001738233397807866, "loss": 1.0556, "num_input_tokens_seen": 10246608, "step": 209, "train_runtime": 1479.2216, "train_tokens_per_second": 6927.027 }, { "epoch": 0.13500482160077146, "grad_norm": 0.22836393117904663, "learning_rate": 0.00017369439071566732, "loss": 0.9201, "num_input_tokens_seen": 10277088, "step": 210, "train_runtime": 1483.493, "train_tokens_per_second": 6927.628 }, { "epoch": 0.13564770170363227, "grad_norm": 0.24446630477905273, "learning_rate": 0.00017356544165054804, "loss": 0.9526, "num_input_tokens_seen": 10320416, "step": 211, "train_runtime": 1489.9864, "train_tokens_per_second": 6926.517 }, { "epoch": 0.1362905818064931, "grad_norm": 0.2546757757663727, "learning_rate": 0.00017343649258542876, "loss": 1.109, "num_input_tokens_seen": 10357904, "step": 212, "train_runtime": 1495.1661, "train_tokens_per_second": 6927.594 }, { "epoch": 0.1369334619093539, "grad_norm": 0.20647278428077698, "learning_rate": 0.0001733075435203095, "loss": 1.0048, "num_input_tokens_seen": 10414032, "step": 213, "train_runtime": 1502.9339, "train_tokens_per_second": 6929.135 }, { "epoch": 0.13757634201221472, "grad_norm": 0.21804779767990112, "learning_rate": 0.0001731785944551902, "loss": 0.8408, "num_input_tokens_seen": 10461408, "step": 214, "train_runtime": 1509.429, "train_tokens_per_second": 6930.706 }, { "epoch": 0.13821922211507554, "grad_norm": 0.20865757763385773, "learning_rate": 0.00017304964539007094, "loss": 1.0862, "num_input_tokens_seen": 10504464, "step": 215, "train_runtime": 1515.3812, "train_tokens_per_second": 6931.895 }, { "epoch": 0.13886210221793635, "grad_norm": 0.3014566898345947, "learning_rate": 0.00017292069632495166, "loss": 1.0654, "num_input_tokens_seen": 10569680, "step": 216, "train_runtime": 1524.3124, "train_tokens_per_second": 6934.064 }, { "epoch": 0.13950498232079717, "grad_norm": 0.2809727191925049, "learning_rate": 0.00017279174725983237, "loss": 1.0455, "num_input_tokens_seen": 10619856, "step": 217, "train_runtime": 1531.2676, "train_tokens_per_second": 6935.336 }, { "epoch": 0.14014786242365798, "grad_norm": 0.22862663865089417, "learning_rate": 0.0001726627981947131, "loss": 0.9765, "num_input_tokens_seen": 10677552, "step": 218, "train_runtime": 1539.2513, "train_tokens_per_second": 6936.848 }, { "epoch": 0.1407907425265188, "grad_norm": 0.21180987358093262, "learning_rate": 0.00017253384912959384, "loss": 0.9582, "num_input_tokens_seen": 10729824, "step": 219, "train_runtime": 1546.5127, "train_tokens_per_second": 6938.077 }, { "epoch": 0.1414336226293796, "grad_norm": 0.2360568344593048, "learning_rate": 0.00017240490006447453, "loss": 1.0123, "num_input_tokens_seen": 10786064, "step": 220, "train_runtime": 1554.3812, "train_tokens_per_second": 6939.137 }, { "epoch": 0.14207650273224043, "grad_norm": 0.2420787811279297, "learning_rate": 0.00017227595099935527, "loss": 1.0137, "num_input_tokens_seen": 10816624, "step": 221, "train_runtime": 1558.7253, "train_tokens_per_second": 6939.404 }, { "epoch": 0.14271938283510124, "grad_norm": 0.21091967821121216, "learning_rate": 0.000172147001934236, "loss": 1.0136, "num_input_tokens_seen": 10863712, "step": 222, "train_runtime": 1565.3264, "train_tokens_per_second": 6940.222 }, { "epoch": 0.14336226293796206, "grad_norm": 0.2029949128627777, "learning_rate": 0.0001720180528691167, "loss": 0.9917, "num_input_tokens_seen": 10921872, "step": 223, "train_runtime": 1573.4217, "train_tokens_per_second": 6941.478 }, { "epoch": 0.14400514304082287, "grad_norm": 0.23956239223480225, "learning_rate": 0.00017188910380399743, "loss": 0.9445, "num_input_tokens_seen": 10966448, "step": 224, "train_runtime": 1579.6133, "train_tokens_per_second": 6942.489 }, { "epoch": 0.1446480231436837, "grad_norm": 0.21189863979816437, "learning_rate": 0.00017176015473887815, "loss": 1.0501, "num_input_tokens_seen": 11014368, "step": 225, "train_runtime": 1586.2995, "train_tokens_per_second": 6943.435 }, { "epoch": 0.1452909032465445, "grad_norm": 0.22365020215511322, "learning_rate": 0.00017163120567375886, "loss": 1.0064, "num_input_tokens_seen": 11062784, "step": 226, "train_runtime": 1593.0071, "train_tokens_per_second": 6944.592 }, { "epoch": 0.14593378334940535, "grad_norm": 0.22429963946342468, "learning_rate": 0.00017150225660863958, "loss": 1.0248, "num_input_tokens_seen": 11103616, "step": 227, "train_runtime": 1598.7121, "train_tokens_per_second": 6945.351 }, { "epoch": 0.14657666345226616, "grad_norm": 0.20400308072566986, "learning_rate": 0.00017137330754352033, "loss": 0.963, "num_input_tokens_seen": 11138032, "step": 228, "train_runtime": 1603.5508, "train_tokens_per_second": 6945.855 }, { "epoch": 0.14721954355512698, "grad_norm": 0.22514568269252777, "learning_rate": 0.00017124435847840105, "loss": 0.9966, "num_input_tokens_seen": 11178224, "step": 229, "train_runtime": 1609.1071, "train_tokens_per_second": 6946.849 }, { "epoch": 0.1478624236579878, "grad_norm": 0.21329401433467865, "learning_rate": 0.00017111540941328176, "loss": 0.9087, "num_input_tokens_seen": 11219712, "step": 230, "train_runtime": 1614.89, "train_tokens_per_second": 6947.663 }, { "epoch": 0.1485053037608486, "grad_norm": 0.23918579518795013, "learning_rate": 0.00017098646034816248, "loss": 0.9757, "num_input_tokens_seen": 11269872, "step": 231, "train_runtime": 1621.7982, "train_tokens_per_second": 6948.998 }, { "epoch": 0.14914818386370943, "grad_norm": 0.2166871875524521, "learning_rate": 0.00017085751128304323, "loss": 1.1711, "num_input_tokens_seen": 11319904, "step": 232, "train_runtime": 1628.7208, "train_tokens_per_second": 6950.181 }, { "epoch": 0.14979106396657024, "grad_norm": 0.25991290807724, "learning_rate": 0.00017072856221792392, "loss": 0.9433, "num_input_tokens_seen": 11354720, "step": 233, "train_runtime": 1633.5841, "train_tokens_per_second": 6950.802 }, { "epoch": 0.15043394406943106, "grad_norm": 0.23324406147003174, "learning_rate": 0.00017059961315280466, "loss": 1.0064, "num_input_tokens_seen": 11405392, "step": 234, "train_runtime": 1640.5727, "train_tokens_per_second": 6952.079 }, { "epoch": 0.15107682417229187, "grad_norm": 0.2757960557937622, "learning_rate": 0.00017047066408768538, "loss": 1.0475, "num_input_tokens_seen": 11468880, "step": 235, "train_runtime": 1649.396, "train_tokens_per_second": 6953.382 }, { "epoch": 0.1517197042751527, "grad_norm": 0.19429758191108704, "learning_rate": 0.00017034171502256607, "loss": 0.8813, "num_input_tokens_seen": 11504256, "step": 236, "train_runtime": 1654.3414, "train_tokens_per_second": 6953.979 }, { "epoch": 0.1523625843780135, "grad_norm": 0.21211576461791992, "learning_rate": 0.00017021276595744682, "loss": 1.0322, "num_input_tokens_seen": 11561280, "step": 237, "train_runtime": 1662.2186, "train_tokens_per_second": 6955.33 }, { "epoch": 0.15300546448087432, "grad_norm": 0.22346429526805878, "learning_rate": 0.00017008381689232754, "loss": 1.0374, "num_input_tokens_seen": 11595856, "step": 238, "train_runtime": 1667.077, "train_tokens_per_second": 6955.801 }, { "epoch": 0.15364834458373514, "grad_norm": 0.2228838950395584, "learning_rate": 0.00016995486782720825, "loss": 1.0827, "num_input_tokens_seen": 11657568, "step": 239, "train_runtime": 1675.586, "train_tokens_per_second": 6957.308 }, { "epoch": 0.15429122468659595, "grad_norm": 0.2152034342288971, "learning_rate": 0.00016982591876208897, "loss": 0.9675, "num_input_tokens_seen": 11706000, "step": 240, "train_runtime": 1682.2153, "train_tokens_per_second": 6958.681 }, { "epoch": 0.15493410478945677, "grad_norm": 0.2260894626379013, "learning_rate": 0.00016969696969696972, "loss": 1.0304, "num_input_tokens_seen": 11741536, "step": 241, "train_runtime": 1687.6844, "train_tokens_per_second": 6957.187 }, { "epoch": 0.15557698489231758, "grad_norm": 0.23029419779777527, "learning_rate": 0.0001695680206318504, "loss": 0.9199, "num_input_tokens_seen": 11781760, "step": 242, "train_runtime": 1693.2406, "train_tokens_per_second": 6958.113 }, { "epoch": 0.1562198649951784, "grad_norm": 0.22995297610759735, "learning_rate": 0.00016943907156673115, "loss": 1.0472, "num_input_tokens_seen": 11817488, "step": 243, "train_runtime": 1698.2011, "train_tokens_per_second": 6958.827 }, { "epoch": 0.1568627450980392, "grad_norm": 0.22286485135555267, "learning_rate": 0.00016931012250161187, "loss": 1.0351, "num_input_tokens_seen": 11871216, "step": 244, "train_runtime": 1705.5842, "train_tokens_per_second": 6960.205 }, { "epoch": 0.15750562520090003, "grad_norm": 0.22770291566848755, "learning_rate": 0.0001691811734364926, "loss": 1.0394, "num_input_tokens_seen": 11923056, "step": 245, "train_runtime": 1712.7388, "train_tokens_per_second": 6961.398 }, { "epoch": 0.15814850530376084, "grad_norm": 0.22315266728401184, "learning_rate": 0.0001690522243713733, "loss": 1.1564, "num_input_tokens_seen": 11965232, "step": 246, "train_runtime": 1718.5507, "train_tokens_per_second": 6962.397 }, { "epoch": 0.15879138540662166, "grad_norm": 0.15868711471557617, "learning_rate": 0.00016892327530625405, "loss": 0.6357, "num_input_tokens_seen": 12029632, "step": 247, "train_runtime": 1727.516, "train_tokens_per_second": 6963.543 }, { "epoch": 0.15943426550948248, "grad_norm": 0.25372278690338135, "learning_rate": 0.00016879432624113477, "loss": 1.0601, "num_input_tokens_seen": 12072080, "step": 248, "train_runtime": 1733.3318, "train_tokens_per_second": 6964.668 }, { "epoch": 0.1600771456123433, "grad_norm": 0.22227583825588226, "learning_rate": 0.00016866537717601546, "loss": 1.0248, "num_input_tokens_seen": 12108464, "step": 249, "train_runtime": 1738.3796, "train_tokens_per_second": 6965.374 }, { "epoch": 0.1607200257152041, "grad_norm": 0.2230069488286972, "learning_rate": 0.0001685364281108962, "loss": 0.9572, "num_input_tokens_seen": 12160512, "step": 250, "train_runtime": 1745.61, "train_tokens_per_second": 6966.339 }, { "epoch": 0.16136290581806492, "grad_norm": 0.23262253403663635, "learning_rate": 0.00016840747904577693, "loss": 1.1385, "num_input_tokens_seen": 12203120, "step": 251, "train_runtime": 1751.4966, "train_tokens_per_second": 6967.253 }, { "epoch": 0.16200578592092574, "grad_norm": 0.23355282843112946, "learning_rate": 0.00016827852998065764, "loss": 0.9223, "num_input_tokens_seen": 12264608, "step": 252, "train_runtime": 1760.0334, "train_tokens_per_second": 6968.395 }, { "epoch": 0.16264866602378655, "grad_norm": 0.2217501848936081, "learning_rate": 0.00016814958091553836, "loss": 1.0235, "num_input_tokens_seen": 12327648, "step": 253, "train_runtime": 1768.8714, "train_tokens_per_second": 6969.217 }, { "epoch": 0.16329154612664737, "grad_norm": 0.222650945186615, "learning_rate": 0.0001680206318504191, "loss": 0.9988, "num_input_tokens_seen": 12388624, "step": 254, "train_runtime": 1777.4265, "train_tokens_per_second": 6969.978 }, { "epoch": 0.16393442622950818, "grad_norm": 0.22060762345790863, "learning_rate": 0.0001678916827852998, "loss": 1.0221, "num_input_tokens_seen": 12465440, "step": 255, "train_runtime": 1788.246, "train_tokens_per_second": 6970.763 }, { "epoch": 0.164577306332369, "grad_norm": 0.21604016423225403, "learning_rate": 0.00016776273372018054, "loss": 0.9783, "num_input_tokens_seen": 12517344, "step": 256, "train_runtime": 1795.5256, "train_tokens_per_second": 6971.409 }, { "epoch": 0.16522018643522984, "grad_norm": 0.2075498253107071, "learning_rate": 0.00016763378465506126, "loss": 1.0503, "num_input_tokens_seen": 12565440, "step": 257, "train_runtime": 1802.277, "train_tokens_per_second": 6971.981 }, { "epoch": 0.16586306653809066, "grad_norm": 0.2417847365140915, "learning_rate": 0.00016750483558994198, "loss": 1.0369, "num_input_tokens_seen": 12611408, "step": 258, "train_runtime": 1808.6976, "train_tokens_per_second": 6972.646 }, { "epoch": 0.16650594664095147, "grad_norm": 0.2209647297859192, "learning_rate": 0.0001673758865248227, "loss": 1.0149, "num_input_tokens_seen": 12650032, "step": 259, "train_runtime": 1814.1769, "train_tokens_per_second": 6972.877 }, { "epoch": 0.1671488267438123, "grad_norm": 0.2291407436132431, "learning_rate": 0.00016724693745970344, "loss": 1.1034, "num_input_tokens_seen": 12712656, "step": 260, "train_runtime": 1823.0164, "train_tokens_per_second": 6973.418 }, { "epoch": 0.1677917068466731, "grad_norm": 0.21010412275791168, "learning_rate": 0.00016711798839458413, "loss": 1.0496, "num_input_tokens_seen": 12750384, "step": 261, "train_runtime": 1828.4006, "train_tokens_per_second": 6973.518 }, { "epoch": 0.16843458694953392, "grad_norm": 0.2299986481666565, "learning_rate": 0.00016698903932946488, "loss": 1.053, "num_input_tokens_seen": 12788976, "step": 262, "train_runtime": 1833.8738, "train_tokens_per_second": 6973.749 }, { "epoch": 0.16907746705239474, "grad_norm": 0.21923059225082397, "learning_rate": 0.0001668600902643456, "loss": 1.0072, "num_input_tokens_seen": 12836720, "step": 263, "train_runtime": 1840.6434, "train_tokens_per_second": 6974.039 }, { "epoch": 0.16972034715525555, "grad_norm": 0.2251053899526596, "learning_rate": 0.00016673114119922632, "loss": 0.9474, "num_input_tokens_seen": 12893312, "step": 264, "train_runtime": 1848.5649, "train_tokens_per_second": 6974.768 }, { "epoch": 0.17036322725811637, "grad_norm": 0.2260395586490631, "learning_rate": 0.00016660219213410703, "loss": 0.9149, "num_input_tokens_seen": 12926224, "step": 265, "train_runtime": 1853.2179, "train_tokens_per_second": 6975.016 }, { "epoch": 0.17100610736097718, "grad_norm": 0.21920432150363922, "learning_rate": 0.00016647324306898775, "loss": 0.9037, "num_input_tokens_seen": 12966480, "step": 266, "train_runtime": 1858.9134, "train_tokens_per_second": 6975.301 }, { "epoch": 0.171648987463838, "grad_norm": 0.20153847336769104, "learning_rate": 0.0001663442940038685, "loss": 0.9807, "num_input_tokens_seen": 13004816, "step": 267, "train_runtime": 1864.2918, "train_tokens_per_second": 6975.741 }, { "epoch": 0.17229186756669881, "grad_norm": 0.2206585705280304, "learning_rate": 0.0001662153449387492, "loss": 0.8857, "num_input_tokens_seen": 13045632, "step": 268, "train_runtime": 1869.9874, "train_tokens_per_second": 6976.321 }, { "epoch": 0.17293474766955963, "grad_norm": 0.21724189817905426, "learning_rate": 0.00016608639587362993, "loss": 1.0563, "num_input_tokens_seen": 13085504, "step": 269, "train_runtime": 1875.625, "train_tokens_per_second": 6976.61 }, { "epoch": 0.17357762777242045, "grad_norm": 0.22223103046417236, "learning_rate": 0.00016595744680851065, "loss": 1.0327, "num_input_tokens_seen": 13128048, "step": 270, "train_runtime": 1881.5955, "train_tokens_per_second": 6977.083 }, { "epoch": 0.17422050787528126, "grad_norm": 0.2211606651544571, "learning_rate": 0.00016582849774339137, "loss": 0.9248, "num_input_tokens_seen": 13179008, "step": 271, "train_runtime": 1889.3405, "train_tokens_per_second": 6975.454 }, { "epoch": 0.17486338797814208, "grad_norm": 0.223886638879776, "learning_rate": 0.0001656995486782721, "loss": 1.0344, "num_input_tokens_seen": 13219472, "step": 272, "train_runtime": 1895.0504, "train_tokens_per_second": 6975.789 }, { "epoch": 0.1755062680810029, "grad_norm": 0.22049862146377563, "learning_rate": 0.00016557059961315283, "loss": 1.0321, "num_input_tokens_seen": 13266560, "step": 273, "train_runtime": 1901.6853, "train_tokens_per_second": 6976.212 }, { "epoch": 0.1761491481838637, "grad_norm": 0.21115176379680634, "learning_rate": 0.00016544165054803352, "loss": 0.9625, "num_input_tokens_seen": 13303536, "step": 274, "train_runtime": 1906.9531, "train_tokens_per_second": 6976.331 }, { "epoch": 0.17679202828672452, "grad_norm": 0.2265198975801468, "learning_rate": 0.00016531270148291427, "loss": 1.063, "num_input_tokens_seen": 13344512, "step": 275, "train_runtime": 1912.7241, "train_tokens_per_second": 6976.705 }, { "epoch": 0.17743490838958534, "grad_norm": 0.22062142193317413, "learning_rate": 0.000165183752417795, "loss": 1.0361, "num_input_tokens_seen": 13390368, "step": 276, "train_runtime": 1919.1466, "train_tokens_per_second": 6977.251 }, { "epoch": 0.17807778849244615, "grad_norm": 0.21890532970428467, "learning_rate": 0.00016505480335267568, "loss": 1.0226, "num_input_tokens_seen": 13439984, "step": 277, "train_runtime": 1926.079, "train_tokens_per_second": 6977.899 }, { "epoch": 0.17872066859530697, "grad_norm": 0.19763115048408508, "learning_rate": 0.00016492585428755642, "loss": 1.0388, "num_input_tokens_seen": 13506464, "step": 278, "train_runtime": 1935.4136, "train_tokens_per_second": 6978.593 }, { "epoch": 0.17936354869816779, "grad_norm": 0.2263236939907074, "learning_rate": 0.00016479690522243714, "loss": 1.0409, "num_input_tokens_seen": 13548112, "step": 279, "train_runtime": 1941.2548, "train_tokens_per_second": 6979.049 }, { "epoch": 0.1800064288010286, "grad_norm": 0.20944298803806305, "learning_rate": 0.00016466795615731786, "loss": 1.0429, "num_input_tokens_seen": 13593520, "step": 280, "train_runtime": 1947.5837, "train_tokens_per_second": 6979.685 }, { "epoch": 0.18064930890388942, "grad_norm": 0.20669174194335938, "learning_rate": 0.00016453900709219858, "loss": 1.0351, "num_input_tokens_seen": 13633696, "step": 281, "train_runtime": 1953.2138, "train_tokens_per_second": 6980.135 }, { "epoch": 0.18129218900675023, "grad_norm": 0.22448189556598663, "learning_rate": 0.00016441005802707932, "loss": 1.0267, "num_input_tokens_seen": 13680928, "step": 282, "train_runtime": 1959.8731, "train_tokens_per_second": 6980.517 }, { "epoch": 0.18193506910961105, "grad_norm": 0.23241977393627167, "learning_rate": 0.00016428110896196004, "loss": 0.9453, "num_input_tokens_seen": 13730304, "step": 283, "train_runtime": 1966.8014, "train_tokens_per_second": 6981.032 }, { "epoch": 0.18257794921247186, "grad_norm": 0.23002482950687408, "learning_rate": 0.00016415215989684076, "loss": 0.9982, "num_input_tokens_seen": 13783552, "step": 284, "train_runtime": 1974.272, "train_tokens_per_second": 6981.587 }, { "epoch": 0.18322082931533268, "grad_norm": 0.22926917672157288, "learning_rate": 0.00016402321083172148, "loss": 1.1197, "num_input_tokens_seen": 13836400, "step": 285, "train_runtime": 1981.6555, "train_tokens_per_second": 6982.243 }, { "epoch": 0.1838637094181935, "grad_norm": 0.20413215458393097, "learning_rate": 0.0001638942617666022, "loss": 0.955, "num_input_tokens_seen": 13893248, "step": 286, "train_runtime": 1989.6672, "train_tokens_per_second": 6982.699 }, { "epoch": 0.18450658952105434, "grad_norm": 0.2088879644870758, "learning_rate": 0.00016376531270148291, "loss": 0.8842, "num_input_tokens_seen": 13938304, "step": 287, "train_runtime": 1995.9845, "train_tokens_per_second": 6983.173 }, { "epoch": 0.18514946962391515, "grad_norm": 0.21762271225452423, "learning_rate": 0.00016363636363636366, "loss": 1.0652, "num_input_tokens_seen": 13976848, "step": 288, "train_runtime": 2001.3961, "train_tokens_per_second": 6983.549 }, { "epoch": 0.18579234972677597, "grad_norm": 0.2539909780025482, "learning_rate": 0.00016350741457124438, "loss": 1.0878, "num_input_tokens_seen": 14025536, "step": 289, "train_runtime": 2008.2605, "train_tokens_per_second": 6983.923 }, { "epoch": 0.18643522982963678, "grad_norm": 0.21907879412174225, "learning_rate": 0.00016337846550612507, "loss": 1.0875, "num_input_tokens_seen": 14060912, "step": 290, "train_runtime": 2013.3476, "train_tokens_per_second": 6983.847 }, { "epoch": 0.1870781099324976, "grad_norm": 0.2488570660352707, "learning_rate": 0.0001632495164410058, "loss": 1.009, "num_input_tokens_seen": 14118128, "step": 291, "train_runtime": 2021.445, "train_tokens_per_second": 6984.176 }, { "epoch": 0.18772099003535841, "grad_norm": 0.2508719265460968, "learning_rate": 0.00016312056737588653, "loss": 0.9741, "num_input_tokens_seen": 14149312, "step": 292, "train_runtime": 2025.9095, "train_tokens_per_second": 6984.178 }, { "epoch": 0.18836387013821923, "grad_norm": 0.2172834575176239, "learning_rate": 0.00016299161831076725, "loss": 1.0391, "num_input_tokens_seen": 14218928, "step": 293, "train_runtime": 2035.6049, "train_tokens_per_second": 6985.112 }, { "epoch": 0.18900675024108005, "grad_norm": 0.213466614484787, "learning_rate": 0.00016286266924564797, "loss": 1.0612, "num_input_tokens_seen": 14255008, "step": 294, "train_runtime": 2040.7249, "train_tokens_per_second": 6985.267 }, { "epoch": 0.18964963034394086, "grad_norm": 0.21678265929222107, "learning_rate": 0.0001627337201805287, "loss": 0.9694, "num_input_tokens_seen": 14288208, "step": 295, "train_runtime": 2045.4091, "train_tokens_per_second": 6985.501 }, { "epoch": 0.19029251044680168, "grad_norm": 0.21735024452209473, "learning_rate": 0.0001626047711154094, "loss": 0.9697, "num_input_tokens_seen": 14336704, "step": 296, "train_runtime": 2052.1745, "train_tokens_per_second": 6986.104 }, { "epoch": 0.1909353905496625, "grad_norm": 0.2252785861492157, "learning_rate": 0.00016247582205029015, "loss": 0.9943, "num_input_tokens_seen": 14376112, "step": 297, "train_runtime": 2057.6427, "train_tokens_per_second": 6986.69 }, { "epoch": 0.1915782706525233, "grad_norm": 0.22839459776878357, "learning_rate": 0.00016234687298517087, "loss": 0.9697, "num_input_tokens_seen": 14417840, "step": 298, "train_runtime": 2063.4637, "train_tokens_per_second": 6987.203 }, { "epoch": 0.19222115075538412, "grad_norm": 0.2202254831790924, "learning_rate": 0.00016221792392005159, "loss": 0.9729, "num_input_tokens_seen": 14470960, "step": 299, "train_runtime": 2070.8486, "train_tokens_per_second": 6987.937 }, { "epoch": 0.19286403085824494, "grad_norm": 0.21936999261379242, "learning_rate": 0.0001620889748549323, "loss": 0.9936, "num_input_tokens_seen": 14510896, "step": 300, "train_runtime": 2076.5004, "train_tokens_per_second": 6988.15 }, { "epoch": 0.19350691096110575, "grad_norm": 0.21325935423374176, "learning_rate": 0.00016196002578981305, "loss": 1.1782, "num_input_tokens_seen": 14559328, "step": 301, "train_runtime": 2083.8514, "train_tokens_per_second": 6986.74 }, { "epoch": 0.19414979106396657, "grad_norm": 0.2144458293914795, "learning_rate": 0.00016183107672469374, "loss": 1.0087, "num_input_tokens_seen": 14601008, "step": 302, "train_runtime": 2089.7659, "train_tokens_per_second": 6986.911 }, { "epoch": 0.19479267116682739, "grad_norm": 0.22481171786785126, "learning_rate": 0.00016170212765957446, "loss": 0.8639, "num_input_tokens_seen": 14647408, "step": 303, "train_runtime": 2096.2153, "train_tokens_per_second": 6987.549 }, { "epoch": 0.1954355512696882, "grad_norm": 0.212294340133667, "learning_rate": 0.0001615731785944552, "loss": 0.984, "num_input_tokens_seen": 14691920, "step": 304, "train_runtime": 2102.516, "train_tokens_per_second": 6987.78 }, { "epoch": 0.19607843137254902, "grad_norm": 0.237873375415802, "learning_rate": 0.00016144422952933592, "loss": 0.9527, "num_input_tokens_seen": 14739696, "step": 305, "train_runtime": 2109.2496, "train_tokens_per_second": 6988.123 }, { "epoch": 0.19672131147540983, "grad_norm": 0.2184976041316986, "learning_rate": 0.00016131528046421664, "loss": 1.0345, "num_input_tokens_seen": 14780704, "step": 306, "train_runtime": 2115.0693, "train_tokens_per_second": 6988.284 }, { "epoch": 0.19736419157827065, "grad_norm": 0.22368647158145905, "learning_rate": 0.00016118633139909736, "loss": 1.0269, "num_input_tokens_seen": 14815456, "step": 307, "train_runtime": 2120.0285, "train_tokens_per_second": 6988.329 }, { "epoch": 0.19800707168113146, "grad_norm": 0.22638754546642303, "learning_rate": 0.0001610573823339781, "loss": 1.0508, "num_input_tokens_seen": 14859568, "step": 308, "train_runtime": 2126.1887, "train_tokens_per_second": 6988.828 }, { "epoch": 0.19864995178399228, "grad_norm": 0.22508348524570465, "learning_rate": 0.0001609284332688588, "loss": 1.1461, "num_input_tokens_seen": 14893728, "step": 309, "train_runtime": 2131.0369, "train_tokens_per_second": 6988.958 }, { "epoch": 0.1992928318868531, "grad_norm": 0.21122296154499054, "learning_rate": 0.00016079948420373954, "loss": 1.0852, "num_input_tokens_seen": 14937536, "step": 310, "train_runtime": 2137.149, "train_tokens_per_second": 6989.469 }, { "epoch": 0.1999357119897139, "grad_norm": 0.2315026819705963, "learning_rate": 0.00016067053513862026, "loss": 1.0333, "num_input_tokens_seen": 14984160, "step": 311, "train_runtime": 2143.6598, "train_tokens_per_second": 6989.99 }, { "epoch": 0.20057859209257473, "grad_norm": 0.23183020949363708, "learning_rate": 0.00016054158607350098, "loss": 0.933, "num_input_tokens_seen": 15023328, "step": 312, "train_runtime": 2149.2207, "train_tokens_per_second": 6990.128 }, { "epoch": 0.20057859209257473, "eval_loss": 1.0449717044830322, "eval_runtime": 39.9901, "eval_samples_per_second": 24.856, "eval_steps_per_second": 1.575, "num_input_tokens_seen": 15023328, "step": 312 }, { "epoch": 0.20122147219543554, "grad_norm": 0.2052253782749176, "learning_rate": 0.0001604126370083817, "loss": 1.088, "num_input_tokens_seen": 15064848, "step": 313, "train_runtime": 2195.0514, "train_tokens_per_second": 6863.096 }, { "epoch": 0.20186435229829636, "grad_norm": 0.2076413780450821, "learning_rate": 0.00016028368794326244, "loss": 0.9505, "num_input_tokens_seen": 15107216, "step": 314, "train_runtime": 2201.0734, "train_tokens_per_second": 6863.567 }, { "epoch": 0.20250723240115717, "grad_norm": 0.22141262888908386, "learning_rate": 0.00016015473887814313, "loss": 1.0592, "num_input_tokens_seen": 15167120, "step": 315, "train_runtime": 2209.4569, "train_tokens_per_second": 6864.637 }, { "epoch": 0.203150112504018, "grad_norm": 0.23321790993213654, "learning_rate": 0.00016002578981302387, "loss": 1.1055, "num_input_tokens_seen": 15213584, "step": 316, "train_runtime": 2216.0238, "train_tokens_per_second": 6865.262 }, { "epoch": 0.2037929926068788, "grad_norm": 0.199346125125885, "learning_rate": 0.0001598968407479046, "loss": 0.9193, "num_input_tokens_seen": 15251280, "step": 317, "train_runtime": 2221.3256, "train_tokens_per_second": 6865.846 }, { "epoch": 0.20443587270973965, "grad_norm": 0.20624004304409027, "learning_rate": 0.0001597678916827853, "loss": 0.9764, "num_input_tokens_seen": 15291984, "step": 318, "train_runtime": 2227.0722, "train_tokens_per_second": 6866.407 }, { "epoch": 0.20507875281260046, "grad_norm": 0.21078018844127655, "learning_rate": 0.00015963894261766603, "loss": 1.0383, "num_input_tokens_seen": 15368032, "step": 319, "train_runtime": 2237.8039, "train_tokens_per_second": 6867.461 }, { "epoch": 0.20572163291546128, "grad_norm": 0.224661186337471, "learning_rate": 0.00015950999355254675, "loss": 1.1089, "num_input_tokens_seen": 15415200, "step": 320, "train_runtime": 2244.409, "train_tokens_per_second": 6868.267 }, { "epoch": 0.2063645130183221, "grad_norm": 0.22397011518478394, "learning_rate": 0.00015938104448742747, "loss": 0.8939, "num_input_tokens_seen": 15466512, "step": 321, "train_runtime": 2251.6208, "train_tokens_per_second": 6869.057 }, { "epoch": 0.2070073931211829, "grad_norm": 0.2197643667459488, "learning_rate": 0.00015925209542230818, "loss": 0.9243, "num_input_tokens_seen": 15508848, "step": 322, "train_runtime": 2257.5953, "train_tokens_per_second": 6869.632 }, { "epoch": 0.20765027322404372, "grad_norm": 0.2126566618680954, "learning_rate": 0.00015912314635718893, "loss": 1.0816, "num_input_tokens_seen": 15569040, "step": 323, "train_runtime": 2266.0805, "train_tokens_per_second": 6870.471 }, { "epoch": 0.20829315332690454, "grad_norm": 0.22825764119625092, "learning_rate": 0.00015899419729206965, "loss": 1.0619, "num_input_tokens_seen": 15624560, "step": 324, "train_runtime": 2273.8965, "train_tokens_per_second": 6871.271 }, { "epoch": 0.20893603342976536, "grad_norm": 0.23155193030834198, "learning_rate": 0.00015886524822695037, "loss": 1.1336, "num_input_tokens_seen": 15676384, "step": 325, "train_runtime": 2281.1802, "train_tokens_per_second": 6872.05 }, { "epoch": 0.20957891353262617, "grad_norm": 0.2167881578207016, "learning_rate": 0.00015873629916183108, "loss": 0.9745, "num_input_tokens_seen": 15715376, "step": 326, "train_runtime": 2286.7205, "train_tokens_per_second": 6872.452 }, { "epoch": 0.210221793635487, "grad_norm": 0.22079265117645264, "learning_rate": 0.00015860735009671183, "loss": 1.0279, "num_input_tokens_seen": 15755296, "step": 327, "train_runtime": 2292.4006, "train_tokens_per_second": 6872.837 }, { "epoch": 0.2108646737383478, "grad_norm": 0.20521511137485504, "learning_rate": 0.00015847840103159252, "loss": 0.9797, "num_input_tokens_seen": 15796304, "step": 328, "train_runtime": 2298.1842, "train_tokens_per_second": 6873.385 }, { "epoch": 0.21150755384120862, "grad_norm": 0.20652268826961517, "learning_rate": 0.00015834945196647326, "loss": 1.0131, "num_input_tokens_seen": 15861888, "step": 329, "train_runtime": 2307.3506, "train_tokens_per_second": 6874.503 }, { "epoch": 0.21215043394406943, "grad_norm": 0.2393670231103897, "learning_rate": 0.00015822050290135398, "loss": 1.0919, "num_input_tokens_seen": 15918912, "step": 330, "train_runtime": 2315.3599, "train_tokens_per_second": 6875.351 }, { "epoch": 0.21279331404693025, "grad_norm": 0.22710706293582916, "learning_rate": 0.00015809155383623467, "loss": 0.8762, "num_input_tokens_seen": 15964208, "step": 331, "train_runtime": 2322.1834, "train_tokens_per_second": 6874.654 }, { "epoch": 0.21343619414979106, "grad_norm": 0.2203913927078247, "learning_rate": 0.00015796260477111542, "loss": 0.9199, "num_input_tokens_seen": 16005184, "step": 332, "train_runtime": 2327.9642, "train_tokens_per_second": 6875.185 }, { "epoch": 0.21407907425265188, "grad_norm": 0.21308915317058563, "learning_rate": 0.00015783365570599614, "loss": 1.072, "num_input_tokens_seen": 16059904, "step": 333, "train_runtime": 2335.62, "train_tokens_per_second": 6876.077 }, { "epoch": 0.2147219543555127, "grad_norm": 0.20549263060092926, "learning_rate": 0.00015770470664087686, "loss": 0.8769, "num_input_tokens_seen": 16107120, "step": 334, "train_runtime": 2342.2351, "train_tokens_per_second": 6876.816 }, { "epoch": 0.2153648344583735, "grad_norm": 0.2424677014350891, "learning_rate": 0.00015757575757575757, "loss": 0.9632, "num_input_tokens_seen": 16167296, "step": 335, "train_runtime": 2350.7127, "train_tokens_per_second": 6877.615 }, { "epoch": 0.21600771456123433, "grad_norm": 0.2267872840166092, "learning_rate": 0.00015744680851063832, "loss": 1.0203, "num_input_tokens_seen": 16204688, "step": 336, "train_runtime": 2355.9807, "train_tokens_per_second": 6878.107 }, { "epoch": 0.21665059466409514, "grad_norm": 0.22265243530273438, "learning_rate": 0.000157317859445519, "loss": 0.944, "num_input_tokens_seen": 16260720, "step": 337, "train_runtime": 2363.8103, "train_tokens_per_second": 6879.029 }, { "epoch": 0.21729347476695596, "grad_norm": 0.21381650865077972, "learning_rate": 0.00015718891038039975, "loss": 0.9924, "num_input_tokens_seen": 16311056, "step": 338, "train_runtime": 2370.8636, "train_tokens_per_second": 6879.795 }, { "epoch": 0.21793635486981677, "grad_norm": 0.22315365076065063, "learning_rate": 0.00015705996131528047, "loss": 0.9271, "num_input_tokens_seen": 16373312, "step": 339, "train_runtime": 2379.5316, "train_tokens_per_second": 6880.897 }, { "epoch": 0.2185792349726776, "grad_norm": 0.20747241377830505, "learning_rate": 0.0001569310122501612, "loss": 0.9806, "num_input_tokens_seen": 16460896, "step": 340, "train_runtime": 2391.8054, "train_tokens_per_second": 6882.205 }, { "epoch": 0.2192221150755384, "grad_norm": 0.22228913009166718, "learning_rate": 0.0001568020631850419, "loss": 0.9529, "num_input_tokens_seen": 16500624, "step": 341, "train_runtime": 2397.4202, "train_tokens_per_second": 6882.658 }, { "epoch": 0.21986499517839922, "grad_norm": 0.22346661984920502, "learning_rate": 0.00015667311411992265, "loss": 1.0819, "num_input_tokens_seen": 16562912, "step": 342, "train_runtime": 2406.137, "train_tokens_per_second": 6883.611 }, { "epoch": 0.22050787528126004, "grad_norm": 0.21236997842788696, "learning_rate": 0.00015654416505480337, "loss": 1.0681, "num_input_tokens_seen": 16641856, "step": 343, "train_runtime": 2417.3084, "train_tokens_per_second": 6884.457 }, { "epoch": 0.22115075538412085, "grad_norm": 0.22987902164459229, "learning_rate": 0.00015641521598968406, "loss": 0.9596, "num_input_tokens_seen": 16680544, "step": 344, "train_runtime": 2422.7728, "train_tokens_per_second": 6884.898 }, { "epoch": 0.22179363548698167, "grad_norm": 0.2243010699748993, "learning_rate": 0.0001562862669245648, "loss": 1.0497, "num_input_tokens_seen": 16731376, "step": 345, "train_runtime": 2429.8931, "train_tokens_per_second": 6885.643 }, { "epoch": 0.22243651558984248, "grad_norm": 0.20788230001926422, "learning_rate": 0.00015615731785944553, "loss": 1.0496, "num_input_tokens_seen": 16777760, "step": 346, "train_runtime": 2436.3871, "train_tokens_per_second": 6886.328 }, { "epoch": 0.2230793956927033, "grad_norm": 0.20559217035770416, "learning_rate": 0.00015602836879432625, "loss": 1.0781, "num_input_tokens_seen": 16820112, "step": 347, "train_runtime": 2442.3361, "train_tokens_per_second": 6886.895 }, { "epoch": 0.22372227579556414, "grad_norm": 0.22564542293548584, "learning_rate": 0.00015589941972920696, "loss": 0.9787, "num_input_tokens_seen": 16862384, "step": 348, "train_runtime": 2448.2489, "train_tokens_per_second": 6887.529 }, { "epoch": 0.22436515589842496, "grad_norm": 0.20842592418193817, "learning_rate": 0.0001557704706640877, "loss": 0.9991, "num_input_tokens_seen": 16904848, "step": 349, "train_runtime": 2454.2617, "train_tokens_per_second": 6887.957 }, { "epoch": 0.22500803600128577, "grad_norm": 0.2145644873380661, "learning_rate": 0.0001556415215989684, "loss": 1.1338, "num_input_tokens_seen": 16962400, "step": 350, "train_runtime": 2462.3222, "train_tokens_per_second": 6888.782 }, { "epoch": 0.2256509161041466, "grad_norm": 0.22125239670276642, "learning_rate": 0.00015551257253384914, "loss": 0.9465, "num_input_tokens_seen": 17031360, "step": 351, "train_runtime": 2471.9125, "train_tokens_per_second": 6889.953 }, { "epoch": 0.2262937962070074, "grad_norm": 0.22434987127780914, "learning_rate": 0.00015538362346872986, "loss": 1.0576, "num_input_tokens_seen": 17070768, "step": 352, "train_runtime": 2477.4513, "train_tokens_per_second": 6890.456 }, { "epoch": 0.22693667630986822, "grad_norm": 0.2168796807527542, "learning_rate": 0.00015525467440361058, "loss": 0.9702, "num_input_tokens_seen": 17133312, "step": 353, "train_runtime": 2486.2278, "train_tokens_per_second": 6891.288 }, { "epoch": 0.22757955641272903, "grad_norm": 0.2135160118341446, "learning_rate": 0.0001551257253384913, "loss": 0.9385, "num_input_tokens_seen": 17209040, "step": 354, "train_runtime": 2496.8564, "train_tokens_per_second": 6892.283 }, { "epoch": 0.22822243651558985, "grad_norm": 0.20850864052772522, "learning_rate": 0.00015499677627337204, "loss": 1.0142, "num_input_tokens_seen": 17249168, "step": 355, "train_runtime": 2502.4956, "train_tokens_per_second": 6892.786 }, { "epoch": 0.22886531661845066, "grad_norm": 0.22662048041820526, "learning_rate": 0.00015486782720825274, "loss": 1.101, "num_input_tokens_seen": 17286880, "step": 356, "train_runtime": 2507.7503, "train_tokens_per_second": 6893.382 }, { "epoch": 0.22950819672131148, "grad_norm": 0.25150901079177856, "learning_rate": 0.00015473887814313345, "loss": 1.0504, "num_input_tokens_seen": 17336416, "step": 357, "train_runtime": 2514.6955, "train_tokens_per_second": 6894.042 }, { "epoch": 0.2301510768241723, "grad_norm": 0.22188004851341248, "learning_rate": 0.0001546099290780142, "loss": 0.9251, "num_input_tokens_seen": 17372624, "step": 358, "train_runtime": 2519.8241, "train_tokens_per_second": 6894.38 }, { "epoch": 0.2307939569270331, "grad_norm": 0.2283482849597931, "learning_rate": 0.00015448098001289492, "loss": 0.9696, "num_input_tokens_seen": 17405232, "step": 359, "train_runtime": 2524.4397, "train_tokens_per_second": 6894.691 }, { "epoch": 0.23143683702989393, "grad_norm": 0.23135900497436523, "learning_rate": 0.00015435203094777563, "loss": 1.0346, "num_input_tokens_seen": 17464912, "step": 360, "train_runtime": 2532.7593, "train_tokens_per_second": 6895.607 }, { "epoch": 0.23207971713275474, "grad_norm": 0.20459306240081787, "learning_rate": 0.00015422308188265635, "loss": 0.9895, "num_input_tokens_seen": 17504080, "step": 361, "train_runtime": 2538.8167, "train_tokens_per_second": 6894.582 }, { "epoch": 0.23272259723561556, "grad_norm": 0.23917587101459503, "learning_rate": 0.00015409413281753707, "loss": 1.1129, "num_input_tokens_seen": 17550544, "step": 362, "train_runtime": 2545.3315, "train_tokens_per_second": 6895.19 }, { "epoch": 0.23336547733847637, "grad_norm": 0.21495625376701355, "learning_rate": 0.0001539651837524178, "loss": 0.9594, "num_input_tokens_seen": 17597312, "step": 363, "train_runtime": 2551.871, "train_tokens_per_second": 6895.847 }, { "epoch": 0.2340083574413372, "grad_norm": 0.21964554488658905, "learning_rate": 0.00015383623468729853, "loss": 0.9654, "num_input_tokens_seen": 17638976, "step": 364, "train_runtime": 2557.6614, "train_tokens_per_second": 6896.525 }, { "epoch": 0.234651237544198, "grad_norm": 0.20798838138580322, "learning_rate": 0.00015370728562217925, "loss": 1.0088, "num_input_tokens_seen": 17681408, "step": 365, "train_runtime": 2563.5782, "train_tokens_per_second": 6897.16 }, { "epoch": 0.23529411764705882, "grad_norm": 0.2274344116449356, "learning_rate": 0.00015357833655705997, "loss": 1.0474, "num_input_tokens_seen": 17721088, "step": 366, "train_runtime": 2569.1892, "train_tokens_per_second": 6897.541 }, { "epoch": 0.23593699774991964, "grad_norm": 0.21265920996665955, "learning_rate": 0.0001534493874919407, "loss": 1.0855, "num_input_tokens_seen": 17774192, "step": 367, "train_runtime": 2576.6447, "train_tokens_per_second": 6898.193 }, { "epoch": 0.23657987785278045, "grad_norm": 0.20594769716262817, "learning_rate": 0.00015332043842682143, "loss": 1.0002, "num_input_tokens_seen": 17806736, "step": 368, "train_runtime": 2581.2698, "train_tokens_per_second": 6898.44 }, { "epoch": 0.23722275795564127, "grad_norm": 0.23406660556793213, "learning_rate": 0.00015319148936170213, "loss": 0.9609, "num_input_tokens_seen": 17851600, "step": 369, "train_runtime": 2587.5545, "train_tokens_per_second": 6899.024 }, { "epoch": 0.23786563805850208, "grad_norm": 0.2062958925962448, "learning_rate": 0.00015306254029658287, "loss": 0.9404, "num_input_tokens_seen": 17900896, "step": 370, "train_runtime": 2594.5321, "train_tokens_per_second": 6899.47 }, { "epoch": 0.2385085181613629, "grad_norm": 0.21552585065364838, "learning_rate": 0.0001529335912314636, "loss": 1.0565, "num_input_tokens_seen": 17944608, "step": 371, "train_runtime": 2600.689, "train_tokens_per_second": 6899.944 }, { "epoch": 0.2391513982642237, "grad_norm": 0.2339625358581543, "learning_rate": 0.00015280464216634428, "loss": 1.0835, "num_input_tokens_seen": 17997248, "step": 372, "train_runtime": 2608.1398, "train_tokens_per_second": 6900.415 }, { "epoch": 0.23979427836708453, "grad_norm": 0.20932239294052124, "learning_rate": 0.00015267569310122502, "loss": 0.8882, "num_input_tokens_seen": 18038784, "step": 373, "train_runtime": 2614.0203, "train_tokens_per_second": 6900.782 }, { "epoch": 0.24043715846994534, "grad_norm": 0.21244873106479645, "learning_rate": 0.00015254674403610574, "loss": 1.1622, "num_input_tokens_seen": 18100272, "step": 374, "train_runtime": 2622.6304, "train_tokens_per_second": 6901.572 }, { "epoch": 0.24108003857280616, "grad_norm": 0.2197032868862152, "learning_rate": 0.00015241779497098646, "loss": 1.0074, "num_input_tokens_seen": 18139376, "step": 375, "train_runtime": 2628.1043, "train_tokens_per_second": 6902.076 }, { "epoch": 0.24172291867566698, "grad_norm": 0.2254268378019333, "learning_rate": 0.00015228884590586718, "loss": 1.1203, "num_input_tokens_seen": 18183152, "step": 376, "train_runtime": 2634.2959, "train_tokens_per_second": 6902.471 }, { "epoch": 0.2423657987785278, "grad_norm": 0.22068928182125092, "learning_rate": 0.00015215989684074792, "loss": 1.0726, "num_input_tokens_seen": 18246832, "step": 377, "train_runtime": 2643.2335, "train_tokens_per_second": 6903.224 }, { "epoch": 0.24300867888138863, "grad_norm": 0.2326030731201172, "learning_rate": 0.00015203094777562864, "loss": 1.037, "num_input_tokens_seen": 18294272, "step": 378, "train_runtime": 2649.8373, "train_tokens_per_second": 6903.923 }, { "epoch": 0.24365155898424945, "grad_norm": 0.20725147426128387, "learning_rate": 0.00015190199871050936, "loss": 1.0334, "num_input_tokens_seen": 18358048, "step": 379, "train_runtime": 2658.7607, "train_tokens_per_second": 6904.739 }, { "epoch": 0.24429443908711027, "grad_norm": 0.22106829285621643, "learning_rate": 0.00015177304964539008, "loss": 0.919, "num_input_tokens_seen": 18415040, "step": 380, "train_runtime": 2666.8029, "train_tokens_per_second": 6905.287 }, { "epoch": 0.24493731918997108, "grad_norm": 0.21206669509410858, "learning_rate": 0.0001516441005802708, "loss": 1.0846, "num_input_tokens_seen": 18457616, "step": 381, "train_runtime": 2672.8188, "train_tokens_per_second": 6905.674 }, { "epoch": 0.2455801992928319, "grad_norm": 0.2023545801639557, "learning_rate": 0.00015151515151515152, "loss": 1.0256, "num_input_tokens_seen": 18501568, "step": 382, "train_runtime": 2678.9798, "train_tokens_per_second": 6906.199 }, { "epoch": 0.2462230793956927, "grad_norm": 0.22866152226924896, "learning_rate": 0.00015138620245003226, "loss": 1.0998, "num_input_tokens_seen": 18549424, "step": 383, "train_runtime": 2685.7401, "train_tokens_per_second": 6906.634 }, { "epoch": 0.24686595949855353, "grad_norm": 0.20636679232120514, "learning_rate": 0.00015125725338491298, "loss": 1.0465, "num_input_tokens_seen": 18586848, "step": 384, "train_runtime": 2691.0114, "train_tokens_per_second": 6907.012 }, { "epoch": 0.24750883960141434, "grad_norm": 0.23085221648216248, "learning_rate": 0.00015112830431979367, "loss": 1.0254, "num_input_tokens_seen": 18626480, "step": 385, "train_runtime": 2696.519, "train_tokens_per_second": 6907.602 }, { "epoch": 0.24815171970427516, "grad_norm": 0.22030708193778992, "learning_rate": 0.00015099935525467441, "loss": 1.0352, "num_input_tokens_seen": 18689568, "step": 386, "train_runtime": 2705.3041, "train_tokens_per_second": 6908.491 }, { "epoch": 0.24879459980713597, "grad_norm": 0.22935743629932404, "learning_rate": 0.00015087040618955513, "loss": 1.146, "num_input_tokens_seen": 18726704, "step": 387, "train_runtime": 2710.5029, "train_tokens_per_second": 6908.941 }, { "epoch": 0.2494374799099968, "grad_norm": 0.20517560839653015, "learning_rate": 0.00015074145712443585, "loss": 1.022, "num_input_tokens_seen": 18766496, "step": 388, "train_runtime": 2716.0753, "train_tokens_per_second": 6909.417 }, { "epoch": 0.2500803600128576, "grad_norm": 0.22025009989738464, "learning_rate": 0.00015061250805931657, "loss": 0.9693, "num_input_tokens_seen": 18816080, "step": 389, "train_runtime": 2722.9496, "train_tokens_per_second": 6910.183 }, { "epoch": 0.2507232401157184, "grad_norm": 0.21232417225837708, "learning_rate": 0.00015048355899419731, "loss": 1.2909, "num_input_tokens_seen": 18882448, "step": 390, "train_runtime": 2732.2319, "train_tokens_per_second": 6910.998 }, { "epoch": 0.25136612021857924, "grad_norm": 0.23262064158916473, "learning_rate": 0.000150354609929078, "loss": 1.0109, "num_input_tokens_seen": 18914880, "step": 391, "train_runtime": 2737.3571, "train_tokens_per_second": 6909.906 }, { "epoch": 0.25200900032144, "grad_norm": 0.22956109046936035, "learning_rate": 0.00015022566086395875, "loss": 1.0905, "num_input_tokens_seen": 18956000, "step": 392, "train_runtime": 2743.0989, "train_tokens_per_second": 6910.433 }, { "epoch": 0.25265188042430087, "grad_norm": 0.22758060693740845, "learning_rate": 0.00015009671179883947, "loss": 0.8537, "num_input_tokens_seen": 18994240, "step": 393, "train_runtime": 2748.4514, "train_tokens_per_second": 6910.888 }, { "epoch": 0.2532947605271617, "grad_norm": 0.23041218519210815, "learning_rate": 0.0001499677627337202, "loss": 1.0148, "num_input_tokens_seen": 19043488, "step": 394, "train_runtime": 2755.3445, "train_tokens_per_second": 6911.473 }, { "epoch": 0.2539376406300225, "grad_norm": 0.22266460955142975, "learning_rate": 0.0001498388136686009, "loss": 0.9664, "num_input_tokens_seen": 19104592, "step": 395, "train_runtime": 2763.8353, "train_tokens_per_second": 6912.348 }, { "epoch": 0.25458052073288334, "grad_norm": 0.21018558740615845, "learning_rate": 0.00014970986460348165, "loss": 0.96, "num_input_tokens_seen": 19162144, "step": 396, "train_runtime": 2771.8439, "train_tokens_per_second": 6913.14 }, { "epoch": 0.25522340083574413, "grad_norm": 0.2324586659669876, "learning_rate": 0.00014958091553836234, "loss": 0.9965, "num_input_tokens_seen": 19213072, "step": 397, "train_runtime": 2778.8865, "train_tokens_per_second": 6913.946 }, { "epoch": 0.255866280938605, "grad_norm": 0.22461821138858795, "learning_rate": 0.00014945196647324306, "loss": 1.0135, "num_input_tokens_seen": 19264752, "step": 398, "train_runtime": 2786.0111, "train_tokens_per_second": 6914.815 }, { "epoch": 0.25650916104146576, "grad_norm": 0.21653743088245392, "learning_rate": 0.0001493230174081238, "loss": 0.9953, "num_input_tokens_seen": 19314720, "step": 399, "train_runtime": 2792.9395, "train_tokens_per_second": 6915.552 }, { "epoch": 0.2571520411443266, "grad_norm": 0.1964331865310669, "learning_rate": 0.00014919406834300452, "loss": 1.0134, "num_input_tokens_seen": 19372448, "step": 400, "train_runtime": 2800.9649, "train_tokens_per_second": 6916.348 }, { "epoch": 0.2577949212471874, "grad_norm": 0.22261105477809906, "learning_rate": 0.00014906511927788524, "loss": 0.8945, "num_input_tokens_seen": 19419152, "step": 401, "train_runtime": 2807.4236, "train_tokens_per_second": 6917.072 }, { "epoch": 0.25843780135004824, "grad_norm": 0.21433231234550476, "learning_rate": 0.00014893617021276596, "loss": 0.9175, "num_input_tokens_seen": 19473936, "step": 402, "train_runtime": 2814.9768, "train_tokens_per_second": 6917.974 }, { "epoch": 0.259080681452909, "grad_norm": 0.20293863117694855, "learning_rate": 0.0001488072211476467, "loss": 1.085, "num_input_tokens_seen": 19520528, "step": 403, "train_runtime": 2821.3854, "train_tokens_per_second": 6918.774 }, { "epoch": 0.25972356155576987, "grad_norm": 0.2340640276670456, "learning_rate": 0.0001486782720825274, "loss": 0.9965, "num_input_tokens_seen": 19573120, "step": 404, "train_runtime": 2828.5815, "train_tokens_per_second": 6919.765 }, { "epoch": 0.26036644165863065, "grad_norm": 0.22344012558460236, "learning_rate": 0.00014854932301740814, "loss": 0.9849, "num_input_tokens_seen": 19623328, "step": 405, "train_runtime": 2835.5013, "train_tokens_per_second": 6920.585 }, { "epoch": 0.2610093217614915, "grad_norm": 0.1989823281764984, "learning_rate": 0.00014842037395228886, "loss": 1.0261, "num_input_tokens_seen": 19663536, "step": 406, "train_runtime": 2841.0622, "train_tokens_per_second": 6921.192 }, { "epoch": 0.2616522018643523, "grad_norm": 0.25294196605682373, "learning_rate": 0.00014829142488716958, "loss": 1.0592, "num_input_tokens_seen": 19716272, "step": 407, "train_runtime": 2848.3461, "train_tokens_per_second": 6922.007 }, { "epoch": 0.26229508196721313, "grad_norm": 0.19655641913414001, "learning_rate": 0.0001481624758220503, "loss": 1.0594, "num_input_tokens_seen": 19757136, "step": 408, "train_runtime": 2854.032, "train_tokens_per_second": 6922.535 }, { "epoch": 0.2629379620700739, "grad_norm": 0.2105259895324707, "learning_rate": 0.00014803352675693104, "loss": 0.9865, "num_input_tokens_seen": 19798336, "step": 409, "train_runtime": 2859.7906, "train_tokens_per_second": 6923.002 }, { "epoch": 0.26358084217293476, "grad_norm": 0.23902744054794312, "learning_rate": 0.00014790457769181173, "loss": 0.9191, "num_input_tokens_seen": 19835600, "step": 410, "train_runtime": 2864.9574, "train_tokens_per_second": 6923.523 }, { "epoch": 0.26422372227579555, "grad_norm": 0.20994171500205994, "learning_rate": 0.00014777562862669245, "loss": 1.0072, "num_input_tokens_seen": 19888144, "step": 411, "train_runtime": 2872.2647, "train_tokens_per_second": 6924.203 }, { "epoch": 0.2648666023786564, "grad_norm": 0.2297692447900772, "learning_rate": 0.0001476466795615732, "loss": 0.892, "num_input_tokens_seen": 19919472, "step": 412, "train_runtime": 2876.6558, "train_tokens_per_second": 6924.524 }, { "epoch": 0.2655094824815172, "grad_norm": 0.23039385676383972, "learning_rate": 0.00014751773049645389, "loss": 0.9413, "num_input_tokens_seen": 19970784, "step": 413, "train_runtime": 2883.6897, "train_tokens_per_second": 6925.427 }, { "epoch": 0.266152362584378, "grad_norm": 0.22210006415843964, "learning_rate": 0.00014738878143133463, "loss": 1.0716, "num_input_tokens_seen": 20016944, "step": 414, "train_runtime": 2890.0507, "train_tokens_per_second": 6926.157 }, { "epoch": 0.2667952426872388, "grad_norm": 0.21822607517242432, "learning_rate": 0.00014725983236621535, "loss": 1.063, "num_input_tokens_seen": 20073952, "step": 415, "train_runtime": 2897.8885, "train_tokens_per_second": 6927.096 }, { "epoch": 0.26743812279009965, "grad_norm": 0.226910799741745, "learning_rate": 0.00014713088330109607, "loss": 1.0704, "num_input_tokens_seen": 20148912, "step": 416, "train_runtime": 2908.257, "train_tokens_per_second": 6928.174 }, { "epoch": 0.26808100289296044, "grad_norm": 0.20137490332126617, "learning_rate": 0.00014700193423597678, "loss": 0.9697, "num_input_tokens_seen": 20206416, "step": 417, "train_runtime": 2916.1441, "train_tokens_per_second": 6929.155 }, { "epoch": 0.2687238829958213, "grad_norm": 0.21282772719860077, "learning_rate": 0.00014687298517085753, "loss": 0.9607, "num_input_tokens_seen": 20248576, "step": 418, "train_runtime": 2921.9462, "train_tokens_per_second": 6929.825 }, { "epoch": 0.26936676309868207, "grad_norm": 0.21868926286697388, "learning_rate": 0.00014674403610573825, "loss": 0.9257, "num_input_tokens_seen": 20293872, "step": 419, "train_runtime": 2928.1578, "train_tokens_per_second": 6930.594 }, { "epoch": 0.2700096432015429, "grad_norm": 0.19923853874206543, "learning_rate": 0.00014661508704061897, "loss": 1.0378, "num_input_tokens_seen": 20332000, "step": 420, "train_runtime": 2933.4328, "train_tokens_per_second": 6931.129 }, { "epoch": 0.2706525233044037, "grad_norm": 0.2215918004512787, "learning_rate": 0.00014648613797549968, "loss": 1.0737, "num_input_tokens_seen": 20383904, "step": 421, "train_runtime": 2941.1143, "train_tokens_per_second": 6930.674 }, { "epoch": 0.27129540340726455, "grad_norm": 0.21484601497650146, "learning_rate": 0.0001463571889103804, "loss": 0.9174, "num_input_tokens_seen": 20462464, "step": 422, "train_runtime": 2951.9415, "train_tokens_per_second": 6931.866 }, { "epoch": 0.2719382835101254, "grad_norm": 0.24356883764266968, "learning_rate": 0.00014622823984526112, "loss": 1.0667, "num_input_tokens_seen": 20516160, "step": 423, "train_runtime": 2959.3036, "train_tokens_per_second": 6932.766 }, { "epoch": 0.2725811636129862, "grad_norm": 0.22561974823474884, "learning_rate": 0.00014609929078014187, "loss": 1.0216, "num_input_tokens_seen": 20555504, "step": 424, "train_runtime": 2964.7521, "train_tokens_per_second": 6933.296 }, { "epoch": 0.273224043715847, "grad_norm": 0.22649145126342773, "learning_rate": 0.00014597034171502258, "loss": 0.99, "num_input_tokens_seen": 20635824, "step": 425, "train_runtime": 2975.8312, "train_tokens_per_second": 6934.474 }, { "epoch": 0.2738669238187078, "grad_norm": 0.2253292202949524, "learning_rate": 0.00014584139264990328, "loss": 1.0371, "num_input_tokens_seen": 20675360, "step": 426, "train_runtime": 2981.2815, "train_tokens_per_second": 6935.058 }, { "epoch": 0.27450980392156865, "grad_norm": 0.21163207292556763, "learning_rate": 0.00014571244358478402, "loss": 0.9201, "num_input_tokens_seen": 20721296, "step": 427, "train_runtime": 2987.6584, "train_tokens_per_second": 6935.631 }, { "epoch": 0.27515268402442944, "grad_norm": 0.21027563512325287, "learning_rate": 0.00014558349451966474, "loss": 0.9869, "num_input_tokens_seen": 20756176, "step": 428, "train_runtime": 2992.5875, "train_tokens_per_second": 6935.863 }, { "epoch": 0.2757955641272903, "grad_norm": 0.2262483835220337, "learning_rate": 0.00014545454545454546, "loss": 0.9857, "num_input_tokens_seen": 20795920, "step": 429, "train_runtime": 2998.1707, "train_tokens_per_second": 6936.203 }, { "epoch": 0.27643844423015107, "grad_norm": 0.20631232857704163, "learning_rate": 0.00014532559638942617, "loss": 0.8497, "num_input_tokens_seen": 20833296, "step": 430, "train_runtime": 3003.4181, "train_tokens_per_second": 6936.529 }, { "epoch": 0.2770813243330119, "grad_norm": 0.20906981825828552, "learning_rate": 0.00014519664732430692, "loss": 0.9911, "num_input_tokens_seen": 20881552, "step": 431, "train_runtime": 3010.1323, "train_tokens_per_second": 6937.088 }, { "epoch": 0.2777242044358727, "grad_norm": 0.1900017410516739, "learning_rate": 0.0001450676982591876, "loss": 0.9406, "num_input_tokens_seen": 20920416, "step": 432, "train_runtime": 3015.588, "train_tokens_per_second": 6937.425 }, { "epoch": 0.27836708453873354, "grad_norm": 0.23332680761814117, "learning_rate": 0.00014493874919406836, "loss": 0.9818, "num_input_tokens_seen": 20958432, "step": 433, "train_runtime": 3020.9117, "train_tokens_per_second": 6937.784 }, { "epoch": 0.27900996464159433, "grad_norm": 0.20991705358028412, "learning_rate": 0.00014480980012894907, "loss": 0.9668, "num_input_tokens_seen": 21000656, "step": 434, "train_runtime": 3026.8788, "train_tokens_per_second": 6938.057 }, { "epoch": 0.2796528447444552, "grad_norm": 0.23032096028327942, "learning_rate": 0.0001446808510638298, "loss": 0.9968, "num_input_tokens_seen": 21036128, "step": 435, "train_runtime": 3031.9131, "train_tokens_per_second": 6938.236 }, { "epoch": 0.28029572484731596, "grad_norm": 0.20887252688407898, "learning_rate": 0.0001445519019987105, "loss": 0.928, "num_input_tokens_seen": 21075744, "step": 436, "train_runtime": 3037.5307, "train_tokens_per_second": 6938.446 }, { "epoch": 0.2809386049501768, "grad_norm": 0.22414767742156982, "learning_rate": 0.00014442295293359126, "loss": 0.9507, "num_input_tokens_seen": 21130784, "step": 437, "train_runtime": 3045.287, "train_tokens_per_second": 6938.848 }, { "epoch": 0.2815814850530376, "grad_norm": 0.22513002157211304, "learning_rate": 0.00014429400386847197, "loss": 1.0848, "num_input_tokens_seen": 21180912, "step": 438, "train_runtime": 3052.2626, "train_tokens_per_second": 6939.413 }, { "epoch": 0.28222436515589844, "grad_norm": 0.21031957864761353, "learning_rate": 0.00014416505480335266, "loss": 0.9672, "num_input_tokens_seen": 21221936, "step": 439, "train_runtime": 3058.0003, "train_tokens_per_second": 6939.808 }, { "epoch": 0.2828672452587592, "grad_norm": 0.2110009789466858, "learning_rate": 0.0001440361057382334, "loss": 0.9508, "num_input_tokens_seen": 21256336, "step": 440, "train_runtime": 3062.9106, "train_tokens_per_second": 6939.914 }, { "epoch": 0.28351012536162007, "grad_norm": 0.2163558304309845, "learning_rate": 0.00014390715667311413, "loss": 0.9935, "num_input_tokens_seen": 21293856, "step": 441, "train_runtime": 3068.2246, "train_tokens_per_second": 6940.123 }, { "epoch": 0.28415300546448086, "grad_norm": 0.2277555614709854, "learning_rate": 0.00014377820760799485, "loss": 0.9512, "num_input_tokens_seen": 21326368, "step": 442, "train_runtime": 3072.8392, "train_tokens_per_second": 6940.281 }, { "epoch": 0.2847958855673417, "grad_norm": 0.228995680809021, "learning_rate": 0.00014364925854287556, "loss": 0.9446, "num_input_tokens_seen": 21373968, "step": 443, "train_runtime": 3079.4766, "train_tokens_per_second": 6940.78 }, { "epoch": 0.2854387656702025, "grad_norm": 0.21971489489078522, "learning_rate": 0.0001435203094777563, "loss": 1.0327, "num_input_tokens_seen": 21422752, "step": 444, "train_runtime": 3086.3349, "train_tokens_per_second": 6941.162 }, { "epoch": 0.28608164577306333, "grad_norm": 0.22412551939487457, "learning_rate": 0.000143391360412637, "loss": 1.0243, "num_input_tokens_seen": 21460832, "step": 445, "train_runtime": 3091.6768, "train_tokens_per_second": 6941.486 }, { "epoch": 0.2867245258759241, "grad_norm": 0.23160946369171143, "learning_rate": 0.00014326241134751775, "loss": 1.0057, "num_input_tokens_seen": 21503984, "step": 446, "train_runtime": 3097.7463, "train_tokens_per_second": 6941.816 }, { "epoch": 0.28736740597878496, "grad_norm": 0.2109261304140091, "learning_rate": 0.00014313346228239846, "loss": 0.9851, "num_input_tokens_seen": 21548880, "step": 447, "train_runtime": 3104.093, "train_tokens_per_second": 6942.086 }, { "epoch": 0.28801028608164575, "grad_norm": 0.22187648713588715, "learning_rate": 0.00014300451321727918, "loss": 0.8728, "num_input_tokens_seen": 21596320, "step": 448, "train_runtime": 3110.7629, "train_tokens_per_second": 6942.451 }, { "epoch": 0.2886531661845066, "grad_norm": 0.23777811229228973, "learning_rate": 0.0001428755641521599, "loss": 1.1549, "num_input_tokens_seen": 21641584, "step": 449, "train_runtime": 3117.1594, "train_tokens_per_second": 6942.726 }, { "epoch": 0.2892960462873674, "grad_norm": 0.22787660360336304, "learning_rate": 0.00014274661508704065, "loss": 1.0658, "num_input_tokens_seen": 21699088, "step": 450, "train_runtime": 3125.1717, "train_tokens_per_second": 6943.327 }, { "epoch": 0.2899389263902282, "grad_norm": 0.23120397329330444, "learning_rate": 0.00014261766602192134, "loss": 1.0974, "num_input_tokens_seen": 21743200, "step": 451, "train_runtime": 3131.8371, "train_tokens_per_second": 6942.634 }, { "epoch": 0.290581806493089, "grad_norm": 0.20242908596992493, "learning_rate": 0.00014248871695680205, "loss": 0.853, "num_input_tokens_seen": 21782304, "step": 452, "train_runtime": 3137.3582, "train_tokens_per_second": 6942.881 }, { "epoch": 0.29122468659594986, "grad_norm": 0.20652198791503906, "learning_rate": 0.0001423597678916828, "loss": 0.9178, "num_input_tokens_seen": 21833456, "step": 453, "train_runtime": 3144.5316, "train_tokens_per_second": 6943.309 }, { "epoch": 0.2918675666988107, "grad_norm": 0.21495656669139862, "learning_rate": 0.00014223081882656352, "loss": 0.8723, "num_input_tokens_seen": 21880688, "step": 454, "train_runtime": 3151.1193, "train_tokens_per_second": 6943.783 }, { "epoch": 0.2925104468016715, "grad_norm": 0.20841602981090546, "learning_rate": 0.00014210186976144424, "loss": 0.9809, "num_input_tokens_seen": 21929696, "step": 455, "train_runtime": 3158.045, "train_tokens_per_second": 6944.073 }, { "epoch": 0.29315332690453233, "grad_norm": 0.2267104536294937, "learning_rate": 0.00014197292069632495, "loss": 1.0488, "num_input_tokens_seen": 22003776, "step": 456, "train_runtime": 3168.4062, "train_tokens_per_second": 6944.746 }, { "epoch": 0.2937962070073931, "grad_norm": 0.22157594561576843, "learning_rate": 0.00014184397163120567, "loss": 0.9029, "num_input_tokens_seen": 22049024, "step": 457, "train_runtime": 3174.7818, "train_tokens_per_second": 6945.052 }, { "epoch": 0.29443908711025396, "grad_norm": 0.21928298473358154, "learning_rate": 0.0001417150225660864, "loss": 0.9906, "num_input_tokens_seen": 22092448, "step": 458, "train_runtime": 3180.8825, "train_tokens_per_second": 6945.383 }, { "epoch": 0.29508196721311475, "grad_norm": 0.23455502092838287, "learning_rate": 0.00014158607350096714, "loss": 0.9531, "num_input_tokens_seen": 22130688, "step": 459, "train_runtime": 3186.288, "train_tokens_per_second": 6945.602 }, { "epoch": 0.2957248473159756, "grad_norm": 0.24930107593536377, "learning_rate": 0.00014145712443584785, "loss": 1.0249, "num_input_tokens_seen": 22206608, "step": 460, "train_runtime": 3196.925, "train_tokens_per_second": 6946.24 }, { "epoch": 0.2963677274188364, "grad_norm": 0.2500987648963928, "learning_rate": 0.00014132817537072857, "loss": 0.9792, "num_input_tokens_seen": 22240000, "step": 461, "train_runtime": 3201.6743, "train_tokens_per_second": 6946.366 }, { "epoch": 0.2970106075216972, "grad_norm": 0.2103571742773056, "learning_rate": 0.0001411992263056093, "loss": 0.9678, "num_input_tokens_seen": 22294912, "step": 462, "train_runtime": 3209.4273, "train_tokens_per_second": 6946.695 }, { "epoch": 0.297653487624558, "grad_norm": 0.21802906692028046, "learning_rate": 0.00014107027724049004, "loss": 1.0285, "num_input_tokens_seen": 22332432, "step": 463, "train_runtime": 3214.7693, "train_tokens_per_second": 6946.823 }, { "epoch": 0.29829636772741885, "grad_norm": 0.2042447030544281, "learning_rate": 0.00014094132817537073, "loss": 0.9883, "num_input_tokens_seen": 22366544, "step": 464, "train_runtime": 3219.6424, "train_tokens_per_second": 6946.903 }, { "epoch": 0.29893924783027964, "grad_norm": 0.2040151059627533, "learning_rate": 0.00014081237911025144, "loss": 0.9602, "num_input_tokens_seen": 22401552, "step": 465, "train_runtime": 3224.6289, "train_tokens_per_second": 6947.017 }, { "epoch": 0.2995821279331405, "grad_norm": 0.2195388823747635, "learning_rate": 0.0001406834300451322, "loss": 1.0522, "num_input_tokens_seen": 22472880, "step": 466, "train_runtime": 3234.6144, "train_tokens_per_second": 6947.623 }, { "epoch": 0.3002250080360013, "grad_norm": 0.2215881049633026, "learning_rate": 0.00014055448098001288, "loss": 0.9738, "num_input_tokens_seen": 22532464, "step": 467, "train_runtime": 3243.0088, "train_tokens_per_second": 6948.012 }, { "epoch": 0.3008678881388621, "grad_norm": 0.2088415026664734, "learning_rate": 0.00014042553191489363, "loss": 1.0041, "num_input_tokens_seen": 22579504, "step": 468, "train_runtime": 3249.5829, "train_tokens_per_second": 6948.431 }, { "epoch": 0.3008678881388621, "eval_loss": 1.0304499864578247, "eval_runtime": 40.087, "eval_samples_per_second": 24.796, "eval_steps_per_second": 1.572, "num_input_tokens_seen": 22579504, "step": 468 }, { "epoch": 0.3015107682417229, "grad_norm": 0.22007477283477783, "learning_rate": 0.00014029658284977434, "loss": 0.8784, "num_input_tokens_seen": 22638304, "step": 469, "train_runtime": 3297.9748, "train_tokens_per_second": 6864.305 }, { "epoch": 0.30215364834458375, "grad_norm": 0.21239815652370453, "learning_rate": 0.00014016763378465506, "loss": 1.0087, "num_input_tokens_seen": 22720144, "step": 470, "train_runtime": 3309.4305, "train_tokens_per_second": 6865.273 }, { "epoch": 0.30279652844744454, "grad_norm": 0.21392999589443207, "learning_rate": 0.00014003868471953578, "loss": 0.9459, "num_input_tokens_seen": 22758576, "step": 471, "train_runtime": 3314.8836, "train_tokens_per_second": 6865.573 }, { "epoch": 0.3034394085503054, "grad_norm": 0.24180610477924347, "learning_rate": 0.00013990973565441653, "loss": 0.9437, "num_input_tokens_seen": 22814256, "step": 472, "train_runtime": 3322.696, "train_tokens_per_second": 6866.188 }, { "epoch": 0.30408228865316617, "grad_norm": 0.22510194778442383, "learning_rate": 0.00013978078658929722, "loss": 0.9329, "num_input_tokens_seen": 22866640, "step": 473, "train_runtime": 3330.041, "train_tokens_per_second": 6866.774 }, { "epoch": 0.304725168756027, "grad_norm": 0.2063971608877182, "learning_rate": 0.00013965183752417796, "loss": 0.9578, "num_input_tokens_seen": 22902608, "step": 474, "train_runtime": 3335.1437, "train_tokens_per_second": 6867.053 }, { "epoch": 0.3053680488588878, "grad_norm": 0.22402247786521912, "learning_rate": 0.00013952288845905868, "loss": 1.0159, "num_input_tokens_seen": 22968496, "step": 475, "train_runtime": 3344.4383, "train_tokens_per_second": 6867.669 }, { "epoch": 0.30601092896174864, "grad_norm": 0.24827386438846588, "learning_rate": 0.0001393939393939394, "loss": 0.987, "num_input_tokens_seen": 22997648, "step": 476, "train_runtime": 3348.5796, "train_tokens_per_second": 6867.882 }, { "epoch": 0.30665380906460943, "grad_norm": 0.21244807541370392, "learning_rate": 0.00013926499032882012, "loss": 1.0285, "num_input_tokens_seen": 23042048, "step": 477, "train_runtime": 3354.8491, "train_tokens_per_second": 6868.281 }, { "epoch": 0.30729668916747027, "grad_norm": 0.23184971511363983, "learning_rate": 0.00013913604126370086, "loss": 1.1143, "num_input_tokens_seen": 23084368, "step": 478, "train_runtime": 3360.8138, "train_tokens_per_second": 6868.684 }, { "epoch": 0.30793956927033106, "grad_norm": 0.23399090766906738, "learning_rate": 0.00013900709219858158, "loss": 1.0699, "num_input_tokens_seen": 23129632, "step": 479, "train_runtime": 3367.1699, "train_tokens_per_second": 6869.161 }, { "epoch": 0.3085824493731919, "grad_norm": 0.2339830994606018, "learning_rate": 0.00013887814313346227, "loss": 0.9267, "num_input_tokens_seen": 23166080, "step": 480, "train_runtime": 3372.3301, "train_tokens_per_second": 6869.458 }, { "epoch": 0.3092253294760527, "grad_norm": 0.21304185688495636, "learning_rate": 0.00013874919406834302, "loss": 1.0969, "num_input_tokens_seen": 23205632, "step": 481, "train_runtime": 3378.4889, "train_tokens_per_second": 6868.642 }, { "epoch": 0.30986820957891353, "grad_norm": 0.21676377952098846, "learning_rate": 0.00013862024500322373, "loss": 1.054, "num_input_tokens_seen": 23263680, "step": 482, "train_runtime": 3386.5884, "train_tokens_per_second": 6869.356 }, { "epoch": 0.3105110896817743, "grad_norm": 0.20853395760059357, "learning_rate": 0.00013849129593810445, "loss": 0.9668, "num_input_tokens_seen": 23314128, "step": 483, "train_runtime": 3393.6327, "train_tokens_per_second": 6869.962 }, { "epoch": 0.31115396978463516, "grad_norm": 0.20457607507705688, "learning_rate": 0.00013836234687298517, "loss": 1.1696, "num_input_tokens_seen": 23372528, "step": 484, "train_runtime": 3401.8284, "train_tokens_per_second": 6870.578 }, { "epoch": 0.311796849887496, "grad_norm": 0.2261870801448822, "learning_rate": 0.00013823339780786592, "loss": 1.0568, "num_input_tokens_seen": 23415520, "step": 485, "train_runtime": 3407.7745, "train_tokens_per_second": 6871.206 }, { "epoch": 0.3124397299903568, "grad_norm": 0.2235896736383438, "learning_rate": 0.0001381044487427466, "loss": 0.9828, "num_input_tokens_seen": 23469776, "step": 486, "train_runtime": 3415.3123, "train_tokens_per_second": 6871.927 }, { "epoch": 0.31308261009321764, "grad_norm": 0.20803005993366241, "learning_rate": 0.00013797549967762735, "loss": 0.9982, "num_input_tokens_seen": 23524704, "step": 487, "train_runtime": 3422.985, "train_tokens_per_second": 6872.57 }, { "epoch": 0.3137254901960784, "grad_norm": 0.21710795164108276, "learning_rate": 0.00013784655061250807, "loss": 1.0199, "num_input_tokens_seen": 23574352, "step": 488, "train_runtime": 3429.8894, "train_tokens_per_second": 6873.211 }, { "epoch": 0.31436837029893927, "grad_norm": 0.20312581956386566, "learning_rate": 0.0001377176015473888, "loss": 0.8987, "num_input_tokens_seen": 23627760, "step": 489, "train_runtime": 3437.2668, "train_tokens_per_second": 6873.997 }, { "epoch": 0.31501125040180006, "grad_norm": 0.20755556225776672, "learning_rate": 0.0001375886524822695, "loss": 0.9631, "num_input_tokens_seen": 23663664, "step": 490, "train_runtime": 3442.3155, "train_tokens_per_second": 6874.345 }, { "epoch": 0.3156541305046609, "grad_norm": 0.23552921414375305, "learning_rate": 0.00013745970341715025, "loss": 1.0089, "num_input_tokens_seen": 23715280, "step": 491, "train_runtime": 3449.4922, "train_tokens_per_second": 6875.006 }, { "epoch": 0.3162970106075217, "grad_norm": 0.22361139953136444, "learning_rate": 0.00013733075435203094, "loss": 1.0316, "num_input_tokens_seen": 23755296, "step": 492, "train_runtime": 3455.0373, "train_tokens_per_second": 6875.554 }, { "epoch": 0.31693989071038253, "grad_norm": 0.22092361748218536, "learning_rate": 0.00013720180528691166, "loss": 0.9885, "num_input_tokens_seen": 23809776, "step": 493, "train_runtime": 3462.606, "train_tokens_per_second": 6876.259 }, { "epoch": 0.3175827708132433, "grad_norm": 0.2110934853553772, "learning_rate": 0.0001370728562217924, "loss": 0.9728, "num_input_tokens_seen": 23846256, "step": 494, "train_runtime": 3467.7687, "train_tokens_per_second": 6876.542 }, { "epoch": 0.31822565091610416, "grad_norm": 0.22661617398262024, "learning_rate": 0.00013694390715667312, "loss": 0.9672, "num_input_tokens_seen": 23881296, "step": 495, "train_runtime": 3472.6479, "train_tokens_per_second": 6876.97 }, { "epoch": 0.31886853101896495, "grad_norm": 0.21662630140781403, "learning_rate": 0.00013681495809155384, "loss": 1.0207, "num_input_tokens_seen": 23922768, "step": 496, "train_runtime": 3478.4065, "train_tokens_per_second": 6877.508 }, { "epoch": 0.3195114111218258, "grad_norm": 0.21633575856685638, "learning_rate": 0.00013668600902643456, "loss": 0.9655, "num_input_tokens_seen": 23968688, "step": 497, "train_runtime": 3484.7432, "train_tokens_per_second": 6878.179 }, { "epoch": 0.3201542912246866, "grad_norm": 0.22479382157325745, "learning_rate": 0.0001365570599613153, "loss": 1.0251, "num_input_tokens_seen": 24019088, "step": 498, "train_runtime": 3491.7117, "train_tokens_per_second": 6878.886 }, { "epoch": 0.3207971713275474, "grad_norm": 0.23307350277900696, "learning_rate": 0.000136428110896196, "loss": 1.005, "num_input_tokens_seen": 24097408, "step": 499, "train_runtime": 3502.5666, "train_tokens_per_second": 6879.929 }, { "epoch": 0.3214400514304082, "grad_norm": 0.23394767940044403, "learning_rate": 0.00013629916183107674, "loss": 0.9901, "num_input_tokens_seen": 24135088, "step": 500, "train_runtime": 3507.8283, "train_tokens_per_second": 6880.35 }, { "epoch": 0.32208293153326906, "grad_norm": 0.21206118166446686, "learning_rate": 0.00013617021276595746, "loss": 1.0684, "num_input_tokens_seen": 24179280, "step": 501, "train_runtime": 3513.9813, "train_tokens_per_second": 6880.879 }, { "epoch": 0.32272581163612984, "grad_norm": 0.21079224348068237, "learning_rate": 0.00013604126370083818, "loss": 0.9874, "num_input_tokens_seen": 24220336, "step": 502, "train_runtime": 3519.7213, "train_tokens_per_second": 6881.322 }, { "epoch": 0.3233686917389907, "grad_norm": 0.20273390412330627, "learning_rate": 0.0001359123146357189, "loss": 1.0484, "num_input_tokens_seen": 24262736, "step": 503, "train_runtime": 3525.6356, "train_tokens_per_second": 6881.805 }, { "epoch": 0.3240115718418515, "grad_norm": 0.20427271723747253, "learning_rate": 0.00013578336557059964, "loss": 0.9679, "num_input_tokens_seen": 24308064, "step": 504, "train_runtime": 3531.8857, "train_tokens_per_second": 6882.461 }, { "epoch": 0.3246544519447123, "grad_norm": 0.2109527736902237, "learning_rate": 0.00013565441650548033, "loss": 0.9445, "num_input_tokens_seen": 24345008, "step": 505, "train_runtime": 3537.0403, "train_tokens_per_second": 6882.875 }, { "epoch": 0.3252973320475731, "grad_norm": 0.2220373898744583, "learning_rate": 0.00013552546744036105, "loss": 1.0339, "num_input_tokens_seen": 24382368, "step": 506, "train_runtime": 3542.2658, "train_tokens_per_second": 6883.269 }, { "epoch": 0.32594021215043395, "grad_norm": 0.21177394688129425, "learning_rate": 0.0001353965183752418, "loss": 1.0558, "num_input_tokens_seen": 24424272, "step": 507, "train_runtime": 3548.0552, "train_tokens_per_second": 6883.848 }, { "epoch": 0.32658309225329474, "grad_norm": 0.2130356878042221, "learning_rate": 0.0001352675693101225, "loss": 0.9415, "num_input_tokens_seen": 24497040, "step": 508, "train_runtime": 3558.1332, "train_tokens_per_second": 6884.801 }, { "epoch": 0.3272259723561556, "grad_norm": 0.21283923089504242, "learning_rate": 0.00013513862024500323, "loss": 1.0213, "num_input_tokens_seen": 24538912, "step": 509, "train_runtime": 3563.9332, "train_tokens_per_second": 6885.346 }, { "epoch": 0.32786885245901637, "grad_norm": 0.23125970363616943, "learning_rate": 0.00013500967117988395, "loss": 1.0807, "num_input_tokens_seen": 24586896, "step": 510, "train_runtime": 3570.5716, "train_tokens_per_second": 6885.983 }, { "epoch": 0.3285117325618772, "grad_norm": 0.20956462621688843, "learning_rate": 0.00013488072211476467, "loss": 0.9554, "num_input_tokens_seen": 24636288, "step": 511, "train_runtime": 3577.9296, "train_tokens_per_second": 6885.627 }, { "epoch": 0.329154612664738, "grad_norm": 0.20466941595077515, "learning_rate": 0.00013475177304964539, "loss": 0.9407, "num_input_tokens_seen": 24700208, "step": 512, "train_runtime": 3586.7348, "train_tokens_per_second": 6886.544 }, { "epoch": 0.32979749276759884, "grad_norm": 0.21156948804855347, "learning_rate": 0.00013462282398452613, "loss": 1.0416, "num_input_tokens_seen": 24767520, "step": 513, "train_runtime": 3596.058, "train_tokens_per_second": 6887.408 }, { "epoch": 0.3304403728704597, "grad_norm": 0.21754856407642365, "learning_rate": 0.00013449387491940685, "loss": 0.9787, "num_input_tokens_seen": 24809824, "step": 514, "train_runtime": 3601.8511, "train_tokens_per_second": 6888.076 }, { "epoch": 0.3310832529733205, "grad_norm": 0.20795920491218567, "learning_rate": 0.00013436492585428757, "loss": 0.8816, "num_input_tokens_seen": 24859872, "step": 515, "train_runtime": 3608.7952, "train_tokens_per_second": 6888.69 }, { "epoch": 0.3317261330761813, "grad_norm": 0.22304174304008484, "learning_rate": 0.00013423597678916829, "loss": 0.9804, "num_input_tokens_seen": 24893568, "step": 516, "train_runtime": 3613.4725, "train_tokens_per_second": 6889.099 }, { "epoch": 0.3323690131790421, "grad_norm": 0.22424030303955078, "learning_rate": 0.000134107027724049, "loss": 1.058, "num_input_tokens_seen": 24947216, "step": 517, "train_runtime": 3620.8973, "train_tokens_per_second": 6889.788 }, { "epoch": 0.33301189328190295, "grad_norm": 0.2329922467470169, "learning_rate": 0.00013397807865892972, "loss": 0.9558, "num_input_tokens_seen": 25002624, "step": 518, "train_runtime": 3628.6094, "train_tokens_per_second": 6890.415 }, { "epoch": 0.33365477338476374, "grad_norm": 0.2094709426164627, "learning_rate": 0.00013384912959381044, "loss": 1.1208, "num_input_tokens_seen": 25052704, "step": 519, "train_runtime": 3635.5352, "train_tokens_per_second": 6891.064 }, { "epoch": 0.3342976534876246, "grad_norm": 0.2430083155632019, "learning_rate": 0.00013372018052869119, "loss": 1.0242, "num_input_tokens_seen": 25096752, "step": 520, "train_runtime": 3641.648, "train_tokens_per_second": 6891.592 }, { "epoch": 0.33494053359048537, "grad_norm": 0.22180068492889404, "learning_rate": 0.00013359123146357188, "loss": 0.9733, "num_input_tokens_seen": 25143664, "step": 521, "train_runtime": 3648.0565, "train_tokens_per_second": 6892.345 }, { "epoch": 0.3355834136933462, "grad_norm": 0.2066153585910797, "learning_rate": 0.00013346228239845262, "loss": 0.9317, "num_input_tokens_seen": 25205920, "step": 522, "train_runtime": 3656.7402, "train_tokens_per_second": 6893.003 }, { "epoch": 0.336226293796207, "grad_norm": 0.24886547029018402, "learning_rate": 0.00013333333333333334, "loss": 1.0372, "num_input_tokens_seen": 25243200, "step": 523, "train_runtime": 3661.941, "train_tokens_per_second": 6893.393 }, { "epoch": 0.33686917389906784, "grad_norm": 0.21790605783462524, "learning_rate": 0.00013320438426821406, "loss": 0.9581, "num_input_tokens_seen": 25303376, "step": 524, "train_runtime": 3670.3457, "train_tokens_per_second": 6894.004 }, { "epoch": 0.33751205400192863, "grad_norm": 0.2200934737920761, "learning_rate": 0.00013307543520309478, "loss": 0.9435, "num_input_tokens_seen": 25353728, "step": 525, "train_runtime": 3677.2854, "train_tokens_per_second": 6894.686 }, { "epoch": 0.3381549341047895, "grad_norm": 0.20982544124126434, "learning_rate": 0.00013294648613797552, "loss": 0.9352, "num_input_tokens_seen": 25394720, "step": 526, "train_runtime": 3682.9962, "train_tokens_per_second": 6895.125 }, { "epoch": 0.33879781420765026, "grad_norm": 0.22811082005500793, "learning_rate": 0.0001328175370728562, "loss": 1.0701, "num_input_tokens_seen": 25434592, "step": 527, "train_runtime": 3688.5184, "train_tokens_per_second": 6895.612 }, { "epoch": 0.3394406943105111, "grad_norm": 0.2045535147190094, "learning_rate": 0.00013268858800773696, "loss": 1.0568, "num_input_tokens_seen": 25479168, "step": 528, "train_runtime": 3694.6898, "train_tokens_per_second": 6896.159 }, { "epoch": 0.3400835744133719, "grad_norm": 0.22363616526126862, "learning_rate": 0.00013255963894261768, "loss": 1.0645, "num_input_tokens_seen": 25542432, "step": 529, "train_runtime": 3703.4384, "train_tokens_per_second": 6896.951 }, { "epoch": 0.34072645451623274, "grad_norm": 0.21083000302314758, "learning_rate": 0.0001324306898774984, "loss": 0.8455, "num_input_tokens_seen": 25583328, "step": 530, "train_runtime": 3709.103, "train_tokens_per_second": 6897.443 }, { "epoch": 0.3413693346190935, "grad_norm": 0.2215147763490677, "learning_rate": 0.0001323017408123791, "loss": 1.0028, "num_input_tokens_seen": 25624320, "step": 531, "train_runtime": 3714.8407, "train_tokens_per_second": 6897.825 }, { "epoch": 0.34201221472195437, "grad_norm": 0.2467392385005951, "learning_rate": 0.00013217279174725983, "loss": 0.9723, "num_input_tokens_seen": 25682048, "step": 532, "train_runtime": 3722.9065, "train_tokens_per_second": 6898.386 }, { "epoch": 0.34265509482481515, "grad_norm": 0.24092997610569, "learning_rate": 0.00013204384268214058, "loss": 0.8117, "num_input_tokens_seen": 25724176, "step": 533, "train_runtime": 3728.829, "train_tokens_per_second": 6898.728 }, { "epoch": 0.343297974927676, "grad_norm": 0.22751258313655853, "learning_rate": 0.00013191489361702127, "loss": 0.9201, "num_input_tokens_seen": 25770528, "step": 534, "train_runtime": 3735.3326, "train_tokens_per_second": 6899.125 }, { "epoch": 0.3439408550305368, "grad_norm": 0.2548338770866394, "learning_rate": 0.000131785944551902, "loss": 1.087, "num_input_tokens_seen": 25820896, "step": 535, "train_runtime": 3742.4211, "train_tokens_per_second": 6899.516 }, { "epoch": 0.34458373513339763, "grad_norm": 0.2448054552078247, "learning_rate": 0.00013165699548678273, "loss": 0.9634, "num_input_tokens_seen": 25859488, "step": 536, "train_runtime": 3747.8476, "train_tokens_per_second": 6899.824 }, { "epoch": 0.3452266152362584, "grad_norm": 0.22934119403362274, "learning_rate": 0.00013152804642166345, "loss": 1.0141, "num_input_tokens_seen": 25909280, "step": 537, "train_runtime": 3754.7496, "train_tokens_per_second": 6900.402 }, { "epoch": 0.34586949533911926, "grad_norm": 0.24733909964561462, "learning_rate": 0.00013139909735654417, "loss": 1.0, "num_input_tokens_seen": 25953088, "step": 538, "train_runtime": 3760.8823, "train_tokens_per_second": 6900.798 }, { "epoch": 0.34651237544198005, "grad_norm": 0.23463451862335205, "learning_rate": 0.0001312701482914249, "loss": 0.9776, "num_input_tokens_seen": 26013008, "step": 539, "train_runtime": 3769.2386, "train_tokens_per_second": 6901.396 }, { "epoch": 0.3471552555448409, "grad_norm": 0.2205786406993866, "learning_rate": 0.0001311411992263056, "loss": 0.9417, "num_input_tokens_seen": 26060880, "step": 540, "train_runtime": 3775.9441, "train_tokens_per_second": 6901.818 }, { "epoch": 0.3477981356477017, "grad_norm": 0.24714644253253937, "learning_rate": 0.00013101225016118635, "loss": 1.079, "num_input_tokens_seen": 26099840, "step": 541, "train_runtime": 3781.9194, "train_tokens_per_second": 6901.215 }, { "epoch": 0.3484410157505625, "grad_norm": 0.21026214957237244, "learning_rate": 0.00013088330109606707, "loss": 0.9243, "num_input_tokens_seen": 26132576, "step": 542, "train_runtime": 3786.5674, "train_tokens_per_second": 6901.389 }, { "epoch": 0.3490838958534233, "grad_norm": 0.21683214604854584, "learning_rate": 0.00013075435203094778, "loss": 1.0338, "num_input_tokens_seen": 26188816, "step": 543, "train_runtime": 3794.4579, "train_tokens_per_second": 6901.86 }, { "epoch": 0.34972677595628415, "grad_norm": 0.23099243640899658, "learning_rate": 0.0001306254029658285, "loss": 0.9737, "num_input_tokens_seen": 26243056, "step": 544, "train_runtime": 3802.0591, "train_tokens_per_second": 6902.327 }, { "epoch": 0.350369656059145, "grad_norm": 0.22725285589694977, "learning_rate": 0.00013049645390070925, "loss": 0.959, "num_input_tokens_seen": 26294640, "step": 545, "train_runtime": 3809.2339, "train_tokens_per_second": 6902.868 }, { "epoch": 0.3510125361620058, "grad_norm": 0.2573927342891693, "learning_rate": 0.00013036750483558994, "loss": 0.9467, "num_input_tokens_seen": 26336240, "step": 546, "train_runtime": 3815.0662, "train_tokens_per_second": 6903.22 }, { "epoch": 0.3516554162648666, "grad_norm": 0.22747130692005157, "learning_rate": 0.00013023855577047066, "loss": 0.9114, "num_input_tokens_seen": 26387344, "step": 547, "train_runtime": 3822.2615, "train_tokens_per_second": 6903.595 }, { "epoch": 0.3522982963677274, "grad_norm": 0.22548294067382812, "learning_rate": 0.0001301096067053514, "loss": 0.9211, "num_input_tokens_seen": 26430704, "step": 548, "train_runtime": 3828.3276, "train_tokens_per_second": 6903.982 }, { "epoch": 0.35294117647058826, "grad_norm": 0.21985627710819244, "learning_rate": 0.00012998065764023212, "loss": 1.0221, "num_input_tokens_seen": 26490432, "step": 549, "train_runtime": 3836.6822, "train_tokens_per_second": 6904.516 }, { "epoch": 0.35358405657344905, "grad_norm": 0.21374687552452087, "learning_rate": 0.00012985170857511284, "loss": 1.0297, "num_input_tokens_seen": 26535888, "step": 550, "train_runtime": 3843.0736, "train_tokens_per_second": 6904.861 }, { "epoch": 0.3542269366763099, "grad_norm": 0.243165522813797, "learning_rate": 0.00012972275950999356, "loss": 1.1353, "num_input_tokens_seen": 26566720, "step": 551, "train_runtime": 3847.4679, "train_tokens_per_second": 6904.988 }, { "epoch": 0.3548698167791707, "grad_norm": 0.24455544352531433, "learning_rate": 0.00012959381044487427, "loss": 1.0217, "num_input_tokens_seen": 26606912, "step": 552, "train_runtime": 3853.1324, "train_tokens_per_second": 6905.268 }, { "epoch": 0.3555126968820315, "grad_norm": 0.22101067006587982, "learning_rate": 0.000129464861379755, "loss": 0.9031, "num_input_tokens_seen": 26642352, "step": 553, "train_runtime": 3858.1639, "train_tokens_per_second": 6905.448 }, { "epoch": 0.3561555769848923, "grad_norm": 0.20512044429779053, "learning_rate": 0.00012933591231463574, "loss": 1.0668, "num_input_tokens_seen": 26681264, "step": 554, "train_runtime": 3863.6705, "train_tokens_per_second": 6905.678 }, { "epoch": 0.35679845708775315, "grad_norm": 0.2276490330696106, "learning_rate": 0.00012920696324951646, "loss": 1.0823, "num_input_tokens_seen": 26730576, "step": 555, "train_runtime": 3870.5592, "train_tokens_per_second": 6906.128 }, { "epoch": 0.35744133719061394, "grad_norm": 0.23173771798610687, "learning_rate": 0.00012907801418439717, "loss": 1.0071, "num_input_tokens_seen": 26781632, "step": 556, "train_runtime": 3877.726, "train_tokens_per_second": 6906.53 }, { "epoch": 0.3580842172934748, "grad_norm": 0.21714136004447937, "learning_rate": 0.0001289490651192779, "loss": 0.9671, "num_input_tokens_seen": 26844144, "step": 557, "train_runtime": 3886.4338, "train_tokens_per_second": 6907.14 }, { "epoch": 0.35872709739633557, "grad_norm": 0.2281978577375412, "learning_rate": 0.00012882011605415864, "loss": 0.8735, "num_input_tokens_seen": 26882384, "step": 558, "train_runtime": 3891.8083, "train_tokens_per_second": 6907.428 }, { "epoch": 0.3593699774991964, "grad_norm": 0.2230071723461151, "learning_rate": 0.00012869116698903933, "loss": 1.1621, "num_input_tokens_seen": 26924112, "step": 559, "train_runtime": 3897.6836, "train_tokens_per_second": 6907.721 }, { "epoch": 0.3600128576020572, "grad_norm": 0.21923069655895233, "learning_rate": 0.00012856221792392005, "loss": 1.0041, "num_input_tokens_seen": 26954864, "step": 560, "train_runtime": 3902.0753, "train_tokens_per_second": 6907.828 }, { "epoch": 0.36065573770491804, "grad_norm": 0.21977007389068604, "learning_rate": 0.0001284332688588008, "loss": 0.9363, "num_input_tokens_seen": 27009328, "step": 561, "train_runtime": 3909.7824, "train_tokens_per_second": 6908.141 }, { "epoch": 0.36129861780777883, "grad_norm": 0.2261383831501007, "learning_rate": 0.00012830431979368148, "loss": 0.9468, "num_input_tokens_seen": 27050640, "step": 562, "train_runtime": 3915.6115, "train_tokens_per_second": 6908.408 }, { "epoch": 0.3619414979106397, "grad_norm": 0.22950001060962677, "learning_rate": 0.00012817537072856223, "loss": 0.9635, "num_input_tokens_seen": 27107952, "step": 563, "train_runtime": 3923.6042, "train_tokens_per_second": 6908.942 }, { "epoch": 0.36258437801350046, "grad_norm": 0.20494036376476288, "learning_rate": 0.00012804642166344295, "loss": 0.9518, "num_input_tokens_seen": 27149680, "step": 564, "train_runtime": 3929.5027, "train_tokens_per_second": 6909.19 }, { "epoch": 0.3632272581163613, "grad_norm": 0.2079777717590332, "learning_rate": 0.00012791747259832366, "loss": 0.9171, "num_input_tokens_seen": 27204672, "step": 565, "train_runtime": 3937.259, "train_tokens_per_second": 6909.546 }, { "epoch": 0.3638701382192221, "grad_norm": 0.22996214032173157, "learning_rate": 0.00012778852353320438, "loss": 1.1146, "num_input_tokens_seen": 27257552, "step": 566, "train_runtime": 3944.6632, "train_tokens_per_second": 6909.982 }, { "epoch": 0.36451301832208294, "grad_norm": 0.22713743150234222, "learning_rate": 0.00012765957446808513, "loss": 0.9419, "num_input_tokens_seen": 27297616, "step": 567, "train_runtime": 3950.3514, "train_tokens_per_second": 6910.174 }, { "epoch": 0.3651558984249437, "grad_norm": 0.22290444374084473, "learning_rate": 0.00012753062540296582, "loss": 0.9696, "num_input_tokens_seen": 27354432, "step": 568, "train_runtime": 3958.3118, "train_tokens_per_second": 6910.631 }, { "epoch": 0.36579877852780457, "grad_norm": 0.2305925339460373, "learning_rate": 0.00012740167633784656, "loss": 0.9383, "num_input_tokens_seen": 27388640, "step": 569, "train_runtime": 3963.1821, "train_tokens_per_second": 6910.77 }, { "epoch": 0.36644165863066536, "grad_norm": 0.2095453143119812, "learning_rate": 0.00012727272727272728, "loss": 0.9092, "num_input_tokens_seen": 27426656, "step": 570, "train_runtime": 3968.5432, "train_tokens_per_second": 6911.014 }, { "epoch": 0.3670845387335262, "grad_norm": 0.2165188491344452, "learning_rate": 0.000127143778207608, "loss": 0.86, "num_input_tokens_seen": 27469616, "step": 571, "train_runtime": 3975.127, "train_tokens_per_second": 6910.374 }, { "epoch": 0.367727418836387, "grad_norm": 0.21359601616859436, "learning_rate": 0.00012701482914248872, "loss": 0.9545, "num_input_tokens_seen": 27509728, "step": 572, "train_runtime": 3980.7541, "train_tokens_per_second": 6910.683 }, { "epoch": 0.36837029893924783, "grad_norm": 0.21762266755104065, "learning_rate": 0.00012688588007736944, "loss": 1.1062, "num_input_tokens_seen": 27559888, "step": 573, "train_runtime": 3987.8327, "train_tokens_per_second": 6910.994 }, { "epoch": 0.3690131790421087, "grad_norm": 0.22264431416988373, "learning_rate": 0.00012675693101225018, "loss": 0.939, "num_input_tokens_seen": 27619392, "step": 574, "train_runtime": 3996.2479, "train_tokens_per_second": 6911.331 }, { "epoch": 0.36965605914496946, "grad_norm": 0.21523094177246094, "learning_rate": 0.00012662798194713087, "loss": 1.0106, "num_input_tokens_seen": 27660256, "step": 575, "train_runtime": 4001.9951, "train_tokens_per_second": 6911.617 }, { "epoch": 0.3702989392478303, "grad_norm": 0.20433154702186584, "learning_rate": 0.00012649903288201162, "loss": 0.8952, "num_input_tokens_seen": 27711360, "step": 576, "train_runtime": 4009.176, "train_tokens_per_second": 6911.984 }, { "epoch": 0.3709418193506911, "grad_norm": 0.21504226326942444, "learning_rate": 0.00012637008381689234, "loss": 0.9748, "num_input_tokens_seen": 27785872, "step": 577, "train_runtime": 4019.6649, "train_tokens_per_second": 6912.485 }, { "epoch": 0.37158469945355194, "grad_norm": 0.22260011732578278, "learning_rate": 0.00012624113475177305, "loss": 1.0449, "num_input_tokens_seen": 27831328, "step": 578, "train_runtime": 4026.0195, "train_tokens_per_second": 6912.865 }, { "epoch": 0.3722275795564127, "grad_norm": 0.21825265884399414, "learning_rate": 0.00012611218568665377, "loss": 0.8929, "num_input_tokens_seen": 27858000, "step": 579, "train_runtime": 4029.8615, "train_tokens_per_second": 6912.893 }, { "epoch": 0.37287045965927357, "grad_norm": 0.21789203584194183, "learning_rate": 0.00012598323662153452, "loss": 1.1042, "num_input_tokens_seen": 27905360, "step": 580, "train_runtime": 4036.5269, "train_tokens_per_second": 6913.21 }, { "epoch": 0.37351333976213436, "grad_norm": 0.2369895726442337, "learning_rate": 0.0001258542875564152, "loss": 0.9221, "num_input_tokens_seen": 27939744, "step": 581, "train_runtime": 4041.3997, "train_tokens_per_second": 6913.383 }, { "epoch": 0.3741562198649952, "grad_norm": 0.21872176229953766, "learning_rate": 0.00012572533849129595, "loss": 1.0185, "num_input_tokens_seen": 27982016, "step": 582, "train_runtime": 4047.3382, "train_tokens_per_second": 6913.684 }, { "epoch": 0.374799099967856, "grad_norm": 0.22556743025779724, "learning_rate": 0.00012559638942617667, "loss": 1.0568, "num_input_tokens_seen": 28026144, "step": 583, "train_runtime": 4053.5359, "train_tokens_per_second": 6913.999 }, { "epoch": 0.37544198007071683, "grad_norm": 0.20244669914245605, "learning_rate": 0.0001254674403610574, "loss": 1.2114, "num_input_tokens_seen": 28096992, "step": 584, "train_runtime": 4063.4542, "train_tokens_per_second": 6914.558 }, { "epoch": 0.3760848601735776, "grad_norm": 0.17933306097984314, "learning_rate": 0.0001253384912959381, "loss": 0.9909, "num_input_tokens_seen": 28145312, "step": 585, "train_runtime": 4070.2961, "train_tokens_per_second": 6914.807 }, { "epoch": 0.37672774027643846, "grad_norm": 0.21245713531970978, "learning_rate": 0.00012520954223081883, "loss": 1.0352, "num_input_tokens_seen": 28188176, "step": 586, "train_runtime": 4076.3544, "train_tokens_per_second": 6915.045 }, { "epoch": 0.37737062037929925, "grad_norm": 0.21566520631313324, "learning_rate": 0.00012508059316569954, "loss": 0.9848, "num_input_tokens_seen": 28224368, "step": 587, "train_runtime": 4081.4827, "train_tokens_per_second": 6915.224 }, { "epoch": 0.3780135004821601, "grad_norm": 0.22781872749328613, "learning_rate": 0.00012495164410058026, "loss": 1.1376, "num_input_tokens_seen": 28286320, "step": 588, "train_runtime": 4090.184, "train_tokens_per_second": 6915.66 }, { "epoch": 0.3786563805850209, "grad_norm": 0.20224601030349731, "learning_rate": 0.000124822695035461, "loss": 1.0087, "num_input_tokens_seen": 28334400, "step": 589, "train_runtime": 4096.9721, "train_tokens_per_second": 6915.937 }, { "epoch": 0.3792992606878817, "grad_norm": 0.21622709929943085, "learning_rate": 0.00012469374597034173, "loss": 1.0467, "num_input_tokens_seen": 28411456, "step": 590, "train_runtime": 4107.7924, "train_tokens_per_second": 6916.478 }, { "epoch": 0.3799421407907425, "grad_norm": 0.2303570955991745, "learning_rate": 0.00012456479690522244, "loss": 0.894, "num_input_tokens_seen": 28487168, "step": 591, "train_runtime": 4118.4367, "train_tokens_per_second": 6916.986 }, { "epoch": 0.38058502089360335, "grad_norm": 0.23342084884643555, "learning_rate": 0.00012443584784010316, "loss": 0.9435, "num_input_tokens_seen": 28544832, "step": 592, "train_runtime": 4126.5979, "train_tokens_per_second": 6917.28 }, { "epoch": 0.38122790099646414, "grad_norm": 0.22476206719875336, "learning_rate": 0.0001243068987749839, "loss": 0.9244, "num_input_tokens_seen": 28571696, "step": 593, "train_runtime": 4130.4665, "train_tokens_per_second": 6917.305 }, { "epoch": 0.381870781099325, "grad_norm": 0.23770561814308167, "learning_rate": 0.0001241779497098646, "loss": 0.952, "num_input_tokens_seen": 28610848, "step": 594, "train_runtime": 4136.0008, "train_tokens_per_second": 6917.515 }, { "epoch": 0.3825136612021858, "grad_norm": 0.2344546765089035, "learning_rate": 0.00012404900064474534, "loss": 0.9873, "num_input_tokens_seen": 28661696, "step": 595, "train_runtime": 4143.1852, "train_tokens_per_second": 6917.793 }, { "epoch": 0.3831565413050466, "grad_norm": 0.2203758805990219, "learning_rate": 0.00012392005157962606, "loss": 0.9037, "num_input_tokens_seen": 28702016, "step": 596, "train_runtime": 4148.8302, "train_tokens_per_second": 6918.098 }, { "epoch": 0.3837994214079074, "grad_norm": 0.23991960287094116, "learning_rate": 0.00012379110251450678, "loss": 1.0986, "num_input_tokens_seen": 28750608, "step": 597, "train_runtime": 4155.6771, "train_tokens_per_second": 6918.393 }, { "epoch": 0.38444230151076825, "grad_norm": 0.2651250958442688, "learning_rate": 0.0001236621534493875, "loss": 1.0733, "num_input_tokens_seen": 28802192, "step": 598, "train_runtime": 4162.9186, "train_tokens_per_second": 6918.75 }, { "epoch": 0.38508518161362904, "grad_norm": 0.19469523429870605, "learning_rate": 0.00012353320438426824, "loss": 0.8291, "num_input_tokens_seen": 28836496, "step": 599, "train_runtime": 4167.7908, "train_tokens_per_second": 6918.892 }, { "epoch": 0.3857280617164899, "grad_norm": 0.21888983249664307, "learning_rate": 0.00012340425531914893, "loss": 0.9539, "num_input_tokens_seen": 28889152, "step": 600, "train_runtime": 4175.156, "train_tokens_per_second": 6919.299 }, { "epoch": 0.38637094181935067, "grad_norm": 0.21506822109222412, "learning_rate": 0.00012327530625402965, "loss": 1.0613, "num_input_tokens_seen": 28954208, "step": 601, "train_runtime": 4184.9056, "train_tokens_per_second": 6918.724 }, { "epoch": 0.3870138219222115, "grad_norm": 0.20702601969242096, "learning_rate": 0.0001231463571889104, "loss": 1.0223, "num_input_tokens_seen": 28990576, "step": 602, "train_runtime": 4190.0373, "train_tokens_per_second": 6918.93 }, { "epoch": 0.3876567020250723, "grad_norm": 0.21783804893493652, "learning_rate": 0.0001230174081237911, "loss": 1.1475, "num_input_tokens_seen": 29044912, "step": 603, "train_runtime": 4197.6381, "train_tokens_per_second": 6919.346 }, { "epoch": 0.38829958212793314, "grad_norm": 0.2323097288608551, "learning_rate": 0.00012288845905867183, "loss": 0.9286, "num_input_tokens_seen": 29102384, "step": 604, "train_runtime": 4205.7063, "train_tokens_per_second": 6919.738 }, { "epoch": 0.388942462230794, "grad_norm": 0.23841801285743713, "learning_rate": 0.00012275950999355255, "loss": 1.0584, "num_input_tokens_seen": 29164656, "step": 605, "train_runtime": 4214.5376, "train_tokens_per_second": 6920.013 }, { "epoch": 0.38958534233365477, "grad_norm": 0.20748752355575562, "learning_rate": 0.00012263056092843327, "loss": 1.0395, "num_input_tokens_seen": 29225600, "step": 606, "train_runtime": 4223.1606, "train_tokens_per_second": 6920.315 }, { "epoch": 0.3902282224365156, "grad_norm": 0.2151229828596115, "learning_rate": 0.000122501611863314, "loss": 1.0344, "num_input_tokens_seen": 29262288, "step": 607, "train_runtime": 4228.3802, "train_tokens_per_second": 6920.449 }, { "epoch": 0.3908711025393764, "grad_norm": 0.21405351161956787, "learning_rate": 0.00012237266279819473, "loss": 0.9952, "num_input_tokens_seen": 29308352, "step": 608, "train_runtime": 4234.8569, "train_tokens_per_second": 6920.742 }, { "epoch": 0.39151398264223725, "grad_norm": 0.23500262200832367, "learning_rate": 0.00012224371373307545, "loss": 1.0545, "num_input_tokens_seen": 29358352, "step": 609, "train_runtime": 4241.8241, "train_tokens_per_second": 6921.162 }, { "epoch": 0.39215686274509803, "grad_norm": 0.2577454745769501, "learning_rate": 0.00012211476466795617, "loss": 1.0378, "num_input_tokens_seen": 29394896, "step": 610, "train_runtime": 4246.9734, "train_tokens_per_second": 6921.375 }, { "epoch": 0.3927997428479589, "grad_norm": 0.2507747411727905, "learning_rate": 0.00012198581560283689, "loss": 0.9745, "num_input_tokens_seen": 29475024, "step": 611, "train_runtime": 4258.173, "train_tokens_per_second": 6921.988 }, { "epoch": 0.39344262295081966, "grad_norm": 0.20818312466144562, "learning_rate": 0.00012185686653771762, "loss": 1.0457, "num_input_tokens_seen": 29524560, "step": 612, "train_runtime": 4265.1329, "train_tokens_per_second": 6922.307 }, { "epoch": 0.3940855030536805, "grad_norm": 0.20738723874092102, "learning_rate": 0.00012172791747259832, "loss": 0.9007, "num_input_tokens_seen": 29557488, "step": 613, "train_runtime": 4269.8032, "train_tokens_per_second": 6922.447 }, { "epoch": 0.3947283831565413, "grad_norm": 0.23783709108829498, "learning_rate": 0.00012159896840747904, "loss": 0.9693, "num_input_tokens_seen": 29606720, "step": 614, "train_runtime": 4276.6802, "train_tokens_per_second": 6922.828 }, { "epoch": 0.39537126325940214, "grad_norm": 0.2414642572402954, "learning_rate": 0.00012147001934235977, "loss": 0.9164, "num_input_tokens_seen": 29659248, "step": 615, "train_runtime": 4284.0389, "train_tokens_per_second": 6923.198 }, { "epoch": 0.3960141433622629, "grad_norm": 0.2816667854785919, "learning_rate": 0.00012134107027724049, "loss": 1.08, "num_input_tokens_seen": 29692640, "step": 616, "train_runtime": 4288.753, "train_tokens_per_second": 6923.374 }, { "epoch": 0.39665702346512377, "grad_norm": 0.22061841189861298, "learning_rate": 0.00012121212121212122, "loss": 0.942, "num_input_tokens_seen": 29749232, "step": 617, "train_runtime": 4296.6122, "train_tokens_per_second": 6923.881 }, { "epoch": 0.39729990356798456, "grad_norm": 0.22501406073570251, "learning_rate": 0.00012108317214700193, "loss": 0.9142, "num_input_tokens_seen": 29782464, "step": 618, "train_runtime": 4301.2713, "train_tokens_per_second": 6924.107 }, { "epoch": 0.3979427836708454, "grad_norm": 0.22138579189777374, "learning_rate": 0.00012095422308188267, "loss": 1.0032, "num_input_tokens_seen": 29827024, "step": 619, "train_runtime": 4307.5291, "train_tokens_per_second": 6924.393 }, { "epoch": 0.3985856637737062, "grad_norm": 0.23382511734962463, "learning_rate": 0.00012082527401676338, "loss": 0.9978, "num_input_tokens_seen": 29871056, "step": 620, "train_runtime": 4313.6531, "train_tokens_per_second": 6924.77 }, { "epoch": 0.39922854387656703, "grad_norm": 0.2238994836807251, "learning_rate": 0.00012069632495164411, "loss": 1.2913, "num_input_tokens_seen": 29931440, "step": 621, "train_runtime": 4321.992, "train_tokens_per_second": 6925.381 }, { "epoch": 0.3998714239794278, "grad_norm": 0.21180926263332367, "learning_rate": 0.00012056737588652483, "loss": 0.955, "num_input_tokens_seen": 29969744, "step": 622, "train_runtime": 4327.3136, "train_tokens_per_second": 6925.716 }, { "epoch": 0.40051430408228866, "grad_norm": 0.23319873213768005, "learning_rate": 0.00012043842682140556, "loss": 1.0568, "num_input_tokens_seen": 30001616, "step": 623, "train_runtime": 4331.7652, "train_tokens_per_second": 6925.956 }, { "epoch": 0.40115718418514945, "grad_norm": 0.22872281074523926, "learning_rate": 0.00012030947775628628, "loss": 1.0755, "num_input_tokens_seen": 30061664, "step": 624, "train_runtime": 4340.096, "train_tokens_per_second": 6926.498 }, { "epoch": 0.40115718418514945, "eval_loss": 1.0195001363754272, "eval_runtime": 39.6587, "eval_samples_per_second": 25.064, "eval_steps_per_second": 1.589, "num_input_tokens_seen": 30061664, "step": 624 }, { "epoch": 0.4018000642880103, "grad_norm": 0.21049852669239044, "learning_rate": 0.00012018052869116701, "loss": 0.9652, "num_input_tokens_seen": 30099536, "step": 625, "train_runtime": 4385.0645, "train_tokens_per_second": 6864.103 }, { "epoch": 0.4024429443908711, "grad_norm": 0.21458666026592255, "learning_rate": 0.00012005157962604771, "loss": 0.9631, "num_input_tokens_seen": 30156400, "step": 626, "train_runtime": 4392.9933, "train_tokens_per_second": 6864.659 }, { "epoch": 0.4030858244937319, "grad_norm": 0.21649177372455597, "learning_rate": 0.00011992263056092843, "loss": 0.9611, "num_input_tokens_seen": 30199968, "step": 627, "train_runtime": 4399.0421, "train_tokens_per_second": 6865.124 }, { "epoch": 0.4037287045965927, "grad_norm": 0.2240186184644699, "learning_rate": 0.00011979368149580916, "loss": 0.931, "num_input_tokens_seen": 30233536, "step": 628, "train_runtime": 4403.7362, "train_tokens_per_second": 6865.428 }, { "epoch": 0.40437158469945356, "grad_norm": 0.1959734410047531, "learning_rate": 0.00011966473243068988, "loss": 0.9257, "num_input_tokens_seen": 30280816, "step": 629, "train_runtime": 4410.2782, "train_tokens_per_second": 6865.965 }, { "epoch": 0.40501446480231434, "grad_norm": 0.22301970422267914, "learning_rate": 0.00011953578336557061, "loss": 1.0331, "num_input_tokens_seen": 30319856, "step": 630, "train_runtime": 4415.7542, "train_tokens_per_second": 6866.292 }, { "epoch": 0.4056573449051752, "grad_norm": 0.21817179024219513, "learning_rate": 0.00011940683430045132, "loss": 0.9312, "num_input_tokens_seen": 30366832, "step": 631, "train_runtime": 4422.9045, "train_tokens_per_second": 6865.812 }, { "epoch": 0.406300225008036, "grad_norm": 0.21276038885116577, "learning_rate": 0.00011927788523533205, "loss": 1.0818, "num_input_tokens_seen": 30411472, "step": 632, "train_runtime": 4429.0946, "train_tokens_per_second": 6866.295 }, { "epoch": 0.4069431051108968, "grad_norm": 0.20637577772140503, "learning_rate": 0.00011914893617021277, "loss": 1.0118, "num_input_tokens_seen": 30450272, "step": 633, "train_runtime": 4434.5087, "train_tokens_per_second": 6866.662 }, { "epoch": 0.4075859852137576, "grad_norm": 0.21434983611106873, "learning_rate": 0.0001190199871050935, "loss": 0.9965, "num_input_tokens_seen": 30497536, "step": 634, "train_runtime": 4441.0991, "train_tokens_per_second": 6867.115 }, { "epoch": 0.40822886531661845, "grad_norm": 0.21265575289726257, "learning_rate": 0.00011889103803997422, "loss": 0.9129, "num_input_tokens_seen": 30555504, "step": 635, "train_runtime": 4449.2162, "train_tokens_per_second": 6867.615 }, { "epoch": 0.4088717454194793, "grad_norm": 0.22651416063308716, "learning_rate": 0.00011876208897485495, "loss": 0.9242, "num_input_tokens_seen": 30595360, "step": 636, "train_runtime": 4454.752, "train_tokens_per_second": 6868.028 }, { "epoch": 0.4095146255223401, "grad_norm": 0.20967771112918854, "learning_rate": 0.00011863313990973565, "loss": 0.9452, "num_input_tokens_seen": 30627360, "step": 637, "train_runtime": 4459.2199, "train_tokens_per_second": 6868.322 }, { "epoch": 0.4101575056252009, "grad_norm": 0.19460758566856384, "learning_rate": 0.0001185041908446164, "loss": 0.7967, "num_input_tokens_seen": 30675744, "step": 638, "train_runtime": 4465.9439, "train_tokens_per_second": 6868.815 }, { "epoch": 0.4108003857280617, "grad_norm": 0.21010765433311462, "learning_rate": 0.0001183752417794971, "loss": 0.9081, "num_input_tokens_seen": 30708240, "step": 639, "train_runtime": 4470.5297, "train_tokens_per_second": 6869.038 }, { "epoch": 0.41144326583092256, "grad_norm": 0.23160742223262787, "learning_rate": 0.00011824629271437782, "loss": 1.072, "num_input_tokens_seen": 30756592, "step": 640, "train_runtime": 4477.2619, "train_tokens_per_second": 6869.509 }, { "epoch": 0.41208614593378334, "grad_norm": 0.22536088526248932, "learning_rate": 0.00011811734364925855, "loss": 1.0498, "num_input_tokens_seen": 30808704, "step": 641, "train_runtime": 4484.5345, "train_tokens_per_second": 6869.989 }, { "epoch": 0.4127290260366442, "grad_norm": 0.21694333851337433, "learning_rate": 0.00011798839458413926, "loss": 0.9911, "num_input_tokens_seen": 30850400, "step": 642, "train_runtime": 4490.3558, "train_tokens_per_second": 6870.369 }, { "epoch": 0.413371906139505, "grad_norm": 0.22314226627349854, "learning_rate": 0.00011785944551901999, "loss": 1.0367, "num_input_tokens_seen": 30909184, "step": 643, "train_runtime": 4498.5039, "train_tokens_per_second": 6870.992 }, { "epoch": 0.4140147862423658, "grad_norm": 0.21192863583564758, "learning_rate": 0.00011773049645390071, "loss": 0.9676, "num_input_tokens_seen": 30964544, "step": 644, "train_runtime": 4506.3238, "train_tokens_per_second": 6871.354 }, { "epoch": 0.4146576663452266, "grad_norm": 0.21439877152442932, "learning_rate": 0.00011760154738878144, "loss": 0.9365, "num_input_tokens_seen": 31015952, "step": 645, "train_runtime": 4513.4906, "train_tokens_per_second": 6871.833 }, { "epoch": 0.41530054644808745, "grad_norm": 0.22022485733032227, "learning_rate": 0.00011747259832366216, "loss": 1.0268, "num_input_tokens_seen": 31076064, "step": 646, "train_runtime": 4522.0091, "train_tokens_per_second": 6872.181 }, { "epoch": 0.41594342655094824, "grad_norm": 0.22051121294498444, "learning_rate": 0.00011734364925854289, "loss": 0.9622, "num_input_tokens_seen": 31123008, "step": 647, "train_runtime": 4528.5517, "train_tokens_per_second": 6872.618 }, { "epoch": 0.4165863066538091, "grad_norm": 0.22413188219070435, "learning_rate": 0.00011721470019342359, "loss": 0.9393, "num_input_tokens_seen": 31158768, "step": 648, "train_runtime": 4533.6072, "train_tokens_per_second": 6872.842 }, { "epoch": 0.41722918675666987, "grad_norm": 0.21698571741580963, "learning_rate": 0.00011708575112830434, "loss": 0.9853, "num_input_tokens_seen": 31196608, "step": 649, "train_runtime": 4538.8981, "train_tokens_per_second": 6873.168 }, { "epoch": 0.4178720668595307, "grad_norm": 0.22137726843357086, "learning_rate": 0.00011695680206318504, "loss": 1.027, "num_input_tokens_seen": 31238256, "step": 650, "train_runtime": 4544.6888, "train_tokens_per_second": 6873.574 }, { "epoch": 0.4185149469623915, "grad_norm": 0.2062436044216156, "learning_rate": 0.00011682785299806577, "loss": 1.0151, "num_input_tokens_seen": 31283008, "step": 651, "train_runtime": 4550.8603, "train_tokens_per_second": 6874.087 }, { "epoch": 0.41915782706525234, "grad_norm": 0.21680644154548645, "learning_rate": 0.00011669890393294649, "loss": 1.0544, "num_input_tokens_seen": 31321264, "step": 652, "train_runtime": 4556.2232, "train_tokens_per_second": 6874.392 }, { "epoch": 0.41980070716811313, "grad_norm": 0.20638515055179596, "learning_rate": 0.00011656995486782722, "loss": 0.9003, "num_input_tokens_seen": 31356928, "step": 653, "train_runtime": 4561.2955, "train_tokens_per_second": 6874.566 }, { "epoch": 0.420443587270974, "grad_norm": 0.20695024728775024, "learning_rate": 0.00011644100580270794, "loss": 0.9458, "num_input_tokens_seen": 31394000, "step": 654, "train_runtime": 4566.543, "train_tokens_per_second": 6874.785 }, { "epoch": 0.42108646737383476, "grad_norm": 0.20706257224082947, "learning_rate": 0.00011631205673758865, "loss": 1.0082, "num_input_tokens_seen": 31430544, "step": 655, "train_runtime": 4571.683, "train_tokens_per_second": 6875.049 }, { "epoch": 0.4217293474766956, "grad_norm": 0.23636630177497864, "learning_rate": 0.00011618310767246938, "loss": 1.0523, "num_input_tokens_seen": 31476864, "step": 656, "train_runtime": 4578.185, "train_tokens_per_second": 6875.402 }, { "epoch": 0.4223722275795564, "grad_norm": 0.2097059190273285, "learning_rate": 0.0001160541586073501, "loss": 0.8199, "num_input_tokens_seen": 31526576, "step": 657, "train_runtime": 4585.1503, "train_tokens_per_second": 6875.8 }, { "epoch": 0.42301510768241724, "grad_norm": 0.22159291803836823, "learning_rate": 0.00011592520954223083, "loss": 0.9934, "num_input_tokens_seen": 31566736, "step": 658, "train_runtime": 4590.7784, "train_tokens_per_second": 6876.118 }, { "epoch": 0.423657987785278, "grad_norm": 0.2194710522890091, "learning_rate": 0.00011579626047711155, "loss": 0.9837, "num_input_tokens_seen": 31604992, "step": 659, "train_runtime": 4596.148, "train_tokens_per_second": 6876.409 }, { "epoch": 0.42430086788813887, "grad_norm": 0.2124231904745102, "learning_rate": 0.00011566731141199228, "loss": 0.9482, "num_input_tokens_seen": 31641088, "step": 660, "train_runtime": 4601.1459, "train_tokens_per_second": 6876.784 }, { "epoch": 0.42494374799099965, "grad_norm": 0.2047438621520996, "learning_rate": 0.00011553836234687298, "loss": 0.8637, "num_input_tokens_seen": 31685744, "step": 661, "train_runtime": 4607.9012, "train_tokens_per_second": 6876.394 }, { "epoch": 0.4255866280938605, "grad_norm": 0.23964186012744904, "learning_rate": 0.00011540941328175371, "loss": 1.0124, "num_input_tokens_seen": 31718608, "step": 662, "train_runtime": 4612.5423, "train_tokens_per_second": 6876.6 }, { "epoch": 0.4262295081967213, "grad_norm": 0.22414755821228027, "learning_rate": 0.00011528046421663443, "loss": 1.0236, "num_input_tokens_seen": 31773472, "step": 663, "train_runtime": 4620.2165, "train_tokens_per_second": 6877.053 }, { "epoch": 0.42687238829958213, "grad_norm": 0.20792655646800995, "learning_rate": 0.00011515151515151516, "loss": 1.0071, "num_input_tokens_seen": 31831120, "step": 664, "train_runtime": 4628.3237, "train_tokens_per_second": 6877.462 }, { "epoch": 0.42751526840244297, "grad_norm": 0.22675418853759766, "learning_rate": 0.00011502256608639588, "loss": 0.9932, "num_input_tokens_seen": 31870400, "step": 665, "train_runtime": 4633.8504, "train_tokens_per_second": 6877.736 }, { "epoch": 0.42815814850530376, "grad_norm": 0.20541276037693024, "learning_rate": 0.00011489361702127661, "loss": 0.9302, "num_input_tokens_seen": 31921072, "step": 666, "train_runtime": 4640.9182, "train_tokens_per_second": 6878.18 }, { "epoch": 0.4288010286081646, "grad_norm": 0.20797085762023926, "learning_rate": 0.00011476466795615732, "loss": 0.9894, "num_input_tokens_seen": 31959600, "step": 667, "train_runtime": 4646.3473, "train_tokens_per_second": 6878.435 }, { "epoch": 0.4294439087110254, "grad_norm": 0.22054386138916016, "learning_rate": 0.00011463571889103804, "loss": 0.8813, "num_input_tokens_seen": 32003888, "step": 668, "train_runtime": 4652.5271, "train_tokens_per_second": 6878.818 }, { "epoch": 0.43008678881388623, "grad_norm": 0.2270301729440689, "learning_rate": 0.00011450676982591877, "loss": 1.0675, "num_input_tokens_seen": 32054864, "step": 669, "train_runtime": 4659.6237, "train_tokens_per_second": 6879.282 }, { "epoch": 0.430729668916747, "grad_norm": 0.2037355899810791, "learning_rate": 0.00011437782076079949, "loss": 0.9287, "num_input_tokens_seen": 32096768, "step": 670, "train_runtime": 4665.4868, "train_tokens_per_second": 6879.618 }, { "epoch": 0.43137254901960786, "grad_norm": 0.2622132897377014, "learning_rate": 0.00011424887169568022, "loss": 0.9492, "num_input_tokens_seen": 32134112, "step": 671, "train_runtime": 4670.6869, "train_tokens_per_second": 6879.954 }, { "epoch": 0.43201542912246865, "grad_norm": 0.1913800835609436, "learning_rate": 0.00011411992263056092, "loss": 0.9271, "num_input_tokens_seen": 32173216, "step": 672, "train_runtime": 4676.1106, "train_tokens_per_second": 6880.337 }, { "epoch": 0.4326583092253295, "grad_norm": 0.2154611498117447, "learning_rate": 0.00011399097356544165, "loss": 0.9622, "num_input_tokens_seen": 32215968, "step": 673, "train_runtime": 4682.0757, "train_tokens_per_second": 6880.702 }, { "epoch": 0.4333011893281903, "grad_norm": 0.22015735507011414, "learning_rate": 0.00011386202450032237, "loss": 1.0512, "num_input_tokens_seen": 32255728, "step": 674, "train_runtime": 4687.6013, "train_tokens_per_second": 6881.073 }, { "epoch": 0.4339440694310511, "grad_norm": 0.16371029615402222, "learning_rate": 0.0001137330754352031, "loss": 0.6272, "num_input_tokens_seen": 32320576, "step": 675, "train_runtime": 4696.653, "train_tokens_per_second": 6881.619 }, { "epoch": 0.4345869495339119, "grad_norm": 0.22172540426254272, "learning_rate": 0.00011360412637008382, "loss": 0.9891, "num_input_tokens_seen": 32362384, "step": 676, "train_runtime": 4702.4813, "train_tokens_per_second": 6881.98 }, { "epoch": 0.43522982963677276, "grad_norm": 0.22036395967006683, "learning_rate": 0.00011347517730496455, "loss": 1.0239, "num_input_tokens_seen": 32400048, "step": 677, "train_runtime": 4707.7622, "train_tokens_per_second": 6882.261 }, { "epoch": 0.43587270973963355, "grad_norm": 0.22396039962768555, "learning_rate": 0.00011334622823984526, "loss": 1.0223, "num_input_tokens_seen": 32446432, "step": 678, "train_runtime": 4714.1851, "train_tokens_per_second": 6882.723 }, { "epoch": 0.4365155898424944, "grad_norm": 0.23210053145885468, "learning_rate": 0.000113217279174726, "loss": 0.9947, "num_input_tokens_seen": 32499440, "step": 679, "train_runtime": 4721.5273, "train_tokens_per_second": 6883.247 }, { "epoch": 0.4371584699453552, "grad_norm": 0.22264118492603302, "learning_rate": 0.00011308833010960671, "loss": 0.9648, "num_input_tokens_seen": 32542192, "step": 680, "train_runtime": 4727.528, "train_tokens_per_second": 6883.554 }, { "epoch": 0.437801350048216, "grad_norm": 0.23207049071788788, "learning_rate": 0.00011295938104448743, "loss": 1.039, "num_input_tokens_seen": 32576320, "step": 681, "train_runtime": 4732.3421, "train_tokens_per_second": 6883.763 }, { "epoch": 0.4384442301510768, "grad_norm": 0.20451678335666656, "learning_rate": 0.00011283043197936816, "loss": 0.86, "num_input_tokens_seen": 32639232, "step": 682, "train_runtime": 4741.1386, "train_tokens_per_second": 6884.26 }, { "epoch": 0.43908711025393765, "grad_norm": 0.21010853350162506, "learning_rate": 0.00011270148291424886, "loss": 0.949, "num_input_tokens_seen": 32688096, "step": 683, "train_runtime": 4747.9314, "train_tokens_per_second": 6884.703 }, { "epoch": 0.43972999035679844, "grad_norm": 0.229692742228508, "learning_rate": 0.00011257253384912961, "loss": 1.0432, "num_input_tokens_seen": 32752512, "step": 684, "train_runtime": 4756.8786, "train_tokens_per_second": 6885.295 }, { "epoch": 0.4403728704596593, "grad_norm": 0.21229156851768494, "learning_rate": 0.00011244358478401031, "loss": 0.9829, "num_input_tokens_seen": 32799184, "step": 685, "train_runtime": 4763.3748, "train_tokens_per_second": 6885.703 }, { "epoch": 0.44101575056252007, "grad_norm": 0.2042849361896515, "learning_rate": 0.00011231463571889104, "loss": 1.1422, "num_input_tokens_seen": 32851248, "step": 686, "train_runtime": 4770.5849, "train_tokens_per_second": 6886.21 }, { "epoch": 0.4416586306653809, "grad_norm": 0.22981370985507965, "learning_rate": 0.00011218568665377176, "loss": 1.1633, "num_input_tokens_seen": 32918608, "step": 687, "train_runtime": 4779.9642, "train_tokens_per_second": 6886.79 }, { "epoch": 0.4423015107682417, "grad_norm": 0.2342732697725296, "learning_rate": 0.0001120567375886525, "loss": 0.9755, "num_input_tokens_seen": 32955376, "step": 688, "train_runtime": 4785.1234, "train_tokens_per_second": 6887.048 }, { "epoch": 0.44294439087110254, "grad_norm": 0.2190224826335907, "learning_rate": 0.00011192778852353321, "loss": 0.9443, "num_input_tokens_seen": 33001280, "step": 689, "train_runtime": 4791.5486, "train_tokens_per_second": 6887.393 }, { "epoch": 0.44358727097396333, "grad_norm": 0.20389577746391296, "learning_rate": 0.00011179883945841394, "loss": 0.9415, "num_input_tokens_seen": 33060048, "step": 690, "train_runtime": 4799.7228, "train_tokens_per_second": 6887.908 }, { "epoch": 0.4442301510768242, "grad_norm": 0.2384883016347885, "learning_rate": 0.00011166989039329465, "loss": 0.9189, "num_input_tokens_seen": 33100688, "step": 691, "train_runtime": 4805.9254, "train_tokens_per_second": 6887.474 }, { "epoch": 0.44487303117968496, "grad_norm": 0.2082808017730713, "learning_rate": 0.00011154094132817538, "loss": 0.8782, "num_input_tokens_seen": 33152336, "step": 692, "train_runtime": 4813.1569, "train_tokens_per_second": 6887.857 }, { "epoch": 0.4455159112825458, "grad_norm": 0.2516237497329712, "learning_rate": 0.0001114119922630561, "loss": 0.9324, "num_input_tokens_seen": 33189920, "step": 693, "train_runtime": 4818.4834, "train_tokens_per_second": 6888.043 }, { "epoch": 0.4461587913854066, "grad_norm": 0.23709340393543243, "learning_rate": 0.0001112830431979368, "loss": 0.9557, "num_input_tokens_seen": 33260768, "step": 694, "train_runtime": 4828.4263, "train_tokens_per_second": 6888.532 }, { "epoch": 0.44680167148826744, "grad_norm": 0.20567552745342255, "learning_rate": 0.00011115409413281755, "loss": 0.9644, "num_input_tokens_seen": 33324816, "step": 695, "train_runtime": 4837.3309, "train_tokens_per_second": 6889.092 }, { "epoch": 0.4474445515911283, "grad_norm": 0.23268231749534607, "learning_rate": 0.00011102514506769825, "loss": 1.1173, "num_input_tokens_seen": 33360608, "step": 696, "train_runtime": 4842.3614, "train_tokens_per_second": 6889.326 }, { "epoch": 0.44808743169398907, "grad_norm": 0.21495988965034485, "learning_rate": 0.00011089619600257898, "loss": 0.8198, "num_input_tokens_seen": 33417952, "step": 697, "train_runtime": 4850.2634, "train_tokens_per_second": 6889.925 }, { "epoch": 0.4487303117968499, "grad_norm": 0.21632738411426544, "learning_rate": 0.0001107672469374597, "loss": 0.9627, "num_input_tokens_seen": 33459424, "step": 698, "train_runtime": 4856.0055, "train_tokens_per_second": 6890.318 }, { "epoch": 0.4493731918997107, "grad_norm": 0.21286652982234955, "learning_rate": 0.00011063829787234043, "loss": 0.9581, "num_input_tokens_seen": 33514128, "step": 699, "train_runtime": 4863.6708, "train_tokens_per_second": 6890.706 }, { "epoch": 0.45001607200257154, "grad_norm": 0.20469930768013, "learning_rate": 0.00011050934880722115, "loss": 0.8758, "num_input_tokens_seen": 33571600, "step": 700, "train_runtime": 4871.7374, "train_tokens_per_second": 6891.094 }, { "epoch": 0.45065895210543233, "grad_norm": 0.22726038098335266, "learning_rate": 0.00011038039974210188, "loss": 1.0946, "num_input_tokens_seen": 33617424, "step": 701, "train_runtime": 4878.1349, "train_tokens_per_second": 6891.45 }, { "epoch": 0.4513018322082932, "grad_norm": 0.22706422209739685, "learning_rate": 0.00011025145067698259, "loss": 0.9967, "num_input_tokens_seen": 33659984, "step": 702, "train_runtime": 4884.0638, "train_tokens_per_second": 6891.799 }, { "epoch": 0.45194471231115396, "grad_norm": 0.2139998823404312, "learning_rate": 0.00011012250161186332, "loss": 0.9974, "num_input_tokens_seen": 33711920, "step": 703, "train_runtime": 4891.2803, "train_tokens_per_second": 6892.249 }, { "epoch": 0.4525875924140148, "grad_norm": 0.1970311999320984, "learning_rate": 0.00010999355254674404, "loss": 0.9625, "num_input_tokens_seen": 33759344, "step": 704, "train_runtime": 4897.9042, "train_tokens_per_second": 6892.61 }, { "epoch": 0.4532304725168756, "grad_norm": 0.22025848925113678, "learning_rate": 0.00010986460348162477, "loss": 1.1195, "num_input_tokens_seen": 33799712, "step": 705, "train_runtime": 4903.5939, "train_tokens_per_second": 6892.845 }, { "epoch": 0.45387335261973644, "grad_norm": 0.2358890026807785, "learning_rate": 0.00010973565441650549, "loss": 0.9897, "num_input_tokens_seen": 33846080, "step": 706, "train_runtime": 4910.1395, "train_tokens_per_second": 6893.099 }, { "epoch": 0.4545162327225972, "grad_norm": 0.2292589545249939, "learning_rate": 0.00010960670535138622, "loss": 1.0153, "num_input_tokens_seen": 33887872, "step": 707, "train_runtime": 4915.9598, "train_tokens_per_second": 6893.44 }, { "epoch": 0.45515911282545807, "grad_norm": 0.2088674008846283, "learning_rate": 0.00010947775628626692, "loss": 0.9935, "num_input_tokens_seen": 33929488, "step": 708, "train_runtime": 4921.7787, "train_tokens_per_second": 6893.745 }, { "epoch": 0.45580199292831886, "grad_norm": 0.2125674933195114, "learning_rate": 0.00010934880722114764, "loss": 0.918, "num_input_tokens_seen": 33965600, "step": 709, "train_runtime": 4926.8406, "train_tokens_per_second": 6893.992 }, { "epoch": 0.4564448730311797, "grad_norm": 0.21705789864063263, "learning_rate": 0.00010921985815602837, "loss": 0.9987, "num_input_tokens_seen": 34018016, "step": 710, "train_runtime": 4934.1229, "train_tokens_per_second": 6894.44 }, { "epoch": 0.4570877531340405, "grad_norm": 0.22935166954994202, "learning_rate": 0.00010909090909090909, "loss": 0.9295, "num_input_tokens_seen": 34076464, "step": 711, "train_runtime": 4942.3293, "train_tokens_per_second": 6894.819 }, { "epoch": 0.45773063323690133, "grad_norm": 0.21767853200435638, "learning_rate": 0.00010896196002578982, "loss": 0.967, "num_input_tokens_seen": 34118112, "step": 712, "train_runtime": 4948.1513, "train_tokens_per_second": 6895.123 }, { "epoch": 0.4583735133397621, "grad_norm": 0.23016303777694702, "learning_rate": 0.00010883301096067053, "loss": 0.9883, "num_input_tokens_seen": 34161248, "step": 713, "train_runtime": 4954.2205, "train_tokens_per_second": 6895.383 }, { "epoch": 0.45901639344262296, "grad_norm": 0.20562049746513367, "learning_rate": 0.00010870406189555127, "loss": 0.9099, "num_input_tokens_seen": 34220720, "step": 714, "train_runtime": 4962.5412, "train_tokens_per_second": 6895.806 }, { "epoch": 0.45965927354548375, "grad_norm": 0.22300930321216583, "learning_rate": 0.00010857511283043198, "loss": 0.9613, "num_input_tokens_seen": 34274288, "step": 715, "train_runtime": 4970.0724, "train_tokens_per_second": 6896.135 }, { "epoch": 0.4603021536483446, "grad_norm": 0.21331855654716492, "learning_rate": 0.00010844616376531271, "loss": 0.9472, "num_input_tokens_seen": 34320880, "step": 716, "train_runtime": 4976.636, "train_tokens_per_second": 6896.402 }, { "epoch": 0.4609450337512054, "grad_norm": 0.21685561537742615, "learning_rate": 0.00010831721470019343, "loss": 1.0051, "num_input_tokens_seen": 34376192, "step": 717, "train_runtime": 4984.3693, "train_tokens_per_second": 6896.799 }, { "epoch": 0.4615879138540662, "grad_norm": 0.23412403464317322, "learning_rate": 0.00010818826563507416, "loss": 1.0075, "num_input_tokens_seen": 34430176, "step": 718, "train_runtime": 4991.9671, "train_tokens_per_second": 6897.116 }, { "epoch": 0.462230793956927, "grad_norm": 0.22776493430137634, "learning_rate": 0.00010805931656995488, "loss": 1.0074, "num_input_tokens_seen": 34486272, "step": 719, "train_runtime": 4999.8436, "train_tokens_per_second": 6897.47 }, { "epoch": 0.46287367405978785, "grad_norm": 0.21548962593078613, "learning_rate": 0.00010793036750483561, "loss": 0.9424, "num_input_tokens_seen": 34556976, "step": 720, "train_runtime": 5009.7319, "train_tokens_per_second": 6897.969 }, { "epoch": 0.46351655416264864, "grad_norm": 0.2266944944858551, "learning_rate": 0.00010780141843971631, "loss": 1.0024, "num_input_tokens_seen": 34598672, "step": 721, "train_runtime": 5016.1173, "train_tokens_per_second": 6897.501 }, { "epoch": 0.4641594342655095, "grad_norm": 0.23636233806610107, "learning_rate": 0.00010767246937459703, "loss": 1.0415, "num_input_tokens_seen": 34637408, "step": 722, "train_runtime": 5021.57, "train_tokens_per_second": 6897.725 }, { "epoch": 0.4648023143683703, "grad_norm": 0.21734626591205597, "learning_rate": 0.00010754352030947776, "loss": 0.9927, "num_input_tokens_seen": 34677456, "step": 723, "train_runtime": 5027.186, "train_tokens_per_second": 6897.985 }, { "epoch": 0.4654451944712311, "grad_norm": 0.19954009354114532, "learning_rate": 0.00010741457124435847, "loss": 1.0602, "num_input_tokens_seen": 34722688, "step": 724, "train_runtime": 5033.5411, "train_tokens_per_second": 6898.262 }, { "epoch": 0.46608807457409196, "grad_norm": 0.2060932070016861, "learning_rate": 0.00010728562217923921, "loss": 0.8783, "num_input_tokens_seen": 34774800, "step": 725, "train_runtime": 5040.8584, "train_tokens_per_second": 6898.587 }, { "epoch": 0.46673095467695275, "grad_norm": 0.2004295140504837, "learning_rate": 0.00010715667311411992, "loss": 0.8934, "num_input_tokens_seen": 34810768, "step": 726, "train_runtime": 5045.9606, "train_tokens_per_second": 6898.74 }, { "epoch": 0.4673738347798136, "grad_norm": 0.20946674048900604, "learning_rate": 0.00010702772404900065, "loss": 0.827, "num_input_tokens_seen": 34863024, "step": 727, "train_runtime": 5053.2176, "train_tokens_per_second": 6899.173 }, { "epoch": 0.4680167148826744, "grad_norm": 0.20330943167209625, "learning_rate": 0.00010689877498388137, "loss": 1.0435, "num_input_tokens_seen": 34902256, "step": 728, "train_runtime": 5058.7326, "train_tokens_per_second": 6899.407 }, { "epoch": 0.4686595949855352, "grad_norm": 0.21033909916877747, "learning_rate": 0.0001067698259187621, "loss": 0.9367, "num_input_tokens_seen": 34961184, "step": 729, "train_runtime": 5067.0185, "train_tokens_per_second": 6899.755 }, { "epoch": 0.469302475088396, "grad_norm": 0.21685197949409485, "learning_rate": 0.00010664087685364282, "loss": 1.0288, "num_input_tokens_seen": 35004000, "step": 730, "train_runtime": 5073.0146, "train_tokens_per_second": 6900.039 }, { "epoch": 0.46994535519125685, "grad_norm": 0.20428651571273804, "learning_rate": 0.00010651192778852355, "loss": 0.9739, "num_input_tokens_seen": 35044128, "step": 731, "train_runtime": 5078.6457, "train_tokens_per_second": 6900.29 }, { "epoch": 0.47058823529411764, "grad_norm": 0.20795543491840363, "learning_rate": 0.00010638297872340425, "loss": 0.9113, "num_input_tokens_seen": 35076784, "step": 732, "train_runtime": 5083.3209, "train_tokens_per_second": 6900.368 }, { "epoch": 0.4712311153969785, "grad_norm": 0.2232762724161148, "learning_rate": 0.00010625402965828499, "loss": 0.8051, "num_input_tokens_seen": 35115712, "step": 733, "train_runtime": 5088.7741, "train_tokens_per_second": 6900.623 }, { "epoch": 0.47187399549983927, "grad_norm": 0.2067340910434723, "learning_rate": 0.0001061250805931657, "loss": 0.9404, "num_input_tokens_seen": 35148368, "step": 734, "train_runtime": 5093.3669, "train_tokens_per_second": 6900.812 }, { "epoch": 0.4725168756027001, "grad_norm": 0.21283183991909027, "learning_rate": 0.00010599613152804642, "loss": 0.9125, "num_input_tokens_seen": 35185088, "step": 735, "train_runtime": 5098.5136, "train_tokens_per_second": 6901.048 }, { "epoch": 0.4731597557055609, "grad_norm": 0.22728654742240906, "learning_rate": 0.00010586718246292715, "loss": 1.0397, "num_input_tokens_seen": 35232928, "step": 736, "train_runtime": 5105.159, "train_tokens_per_second": 6901.436 }, { "epoch": 0.47380263580842175, "grad_norm": 0.22465203702449799, "learning_rate": 0.00010573823339780786, "loss": 0.9188, "num_input_tokens_seen": 35280848, "step": 737, "train_runtime": 5111.7911, "train_tokens_per_second": 6901.856 }, { "epoch": 0.47444551591128253, "grad_norm": 0.21893534064292908, "learning_rate": 0.00010560928433268859, "loss": 1.0128, "num_input_tokens_seen": 35339920, "step": 738, "train_runtime": 5120.1115, "train_tokens_per_second": 6902.178 }, { "epoch": 0.4750883960141434, "grad_norm": 0.22276096045970917, "learning_rate": 0.00010548033526756931, "loss": 0.9431, "num_input_tokens_seen": 35388384, "step": 739, "train_runtime": 5126.8792, "train_tokens_per_second": 6902.52 }, { "epoch": 0.47573127611700416, "grad_norm": 0.21816401183605194, "learning_rate": 0.00010535138620245004, "loss": 1.0065, "num_input_tokens_seen": 35431600, "step": 740, "train_runtime": 5132.9116, "train_tokens_per_second": 6902.827 }, { "epoch": 0.476374156219865, "grad_norm": 0.2419298142194748, "learning_rate": 0.00010522243713733076, "loss": 1.009, "num_input_tokens_seen": 35486368, "step": 741, "train_runtime": 5140.5982, "train_tokens_per_second": 6903.159 }, { "epoch": 0.4770170363227258, "grad_norm": 0.2303159534931183, "learning_rate": 0.00010509348807221149, "loss": 1.0134, "num_input_tokens_seen": 35520352, "step": 742, "train_runtime": 5145.3929, "train_tokens_per_second": 6903.331 }, { "epoch": 0.47765991642558664, "grad_norm": 0.21811984479427338, "learning_rate": 0.0001049645390070922, "loss": 0.8346, "num_input_tokens_seen": 35557856, "step": 743, "train_runtime": 5150.6741, "train_tokens_per_second": 6903.534 }, { "epoch": 0.4783027965284474, "grad_norm": 0.22950100898742676, "learning_rate": 0.00010483558994197294, "loss": 0.9851, "num_input_tokens_seen": 35603856, "step": 744, "train_runtime": 5157.1004, "train_tokens_per_second": 6903.852 }, { "epoch": 0.47894567663130827, "grad_norm": 0.22559398412704468, "learning_rate": 0.00010470664087685364, "loss": 0.9259, "num_input_tokens_seen": 35647760, "step": 745, "train_runtime": 5163.2802, "train_tokens_per_second": 6904.092 }, { "epoch": 0.47958855673416906, "grad_norm": 0.2145167589187622, "learning_rate": 0.00010457769181173438, "loss": 0.9911, "num_input_tokens_seen": 35698448, "step": 746, "train_runtime": 5170.3491, "train_tokens_per_second": 6904.456 }, { "epoch": 0.4802314368370299, "grad_norm": 0.20136818289756775, "learning_rate": 0.0001044487427466151, "loss": 0.8966, "num_input_tokens_seen": 35744928, "step": 747, "train_runtime": 5176.8823, "train_tokens_per_second": 6904.721 }, { "epoch": 0.4808743169398907, "grad_norm": 0.2237679660320282, "learning_rate": 0.0001043197936814958, "loss": 0.8031, "num_input_tokens_seen": 35782080, "step": 748, "train_runtime": 5182.113, "train_tokens_per_second": 6904.921 }, { "epoch": 0.48151719704275153, "grad_norm": 0.22918713092803955, "learning_rate": 0.00010419084461637654, "loss": 0.898, "num_input_tokens_seen": 35823216, "step": 749, "train_runtime": 5187.9503, "train_tokens_per_second": 6905.081 }, { "epoch": 0.4821600771456123, "grad_norm": 0.21593888103961945, "learning_rate": 0.00010406189555125725, "loss": 0.9395, "num_input_tokens_seen": 35862640, "step": 750, "train_runtime": 5193.54, "train_tokens_per_second": 6905.24 }, { "epoch": 0.48280295724847316, "grad_norm": 0.24713970720767975, "learning_rate": 0.00010393294648613798, "loss": 0.9388, "num_input_tokens_seen": 35913136, "step": 751, "train_runtime": 5201.1565, "train_tokens_per_second": 6904.837 }, { "epoch": 0.48344583735133395, "grad_norm": 0.21903486549854279, "learning_rate": 0.0001038039974210187, "loss": 1.0879, "num_input_tokens_seen": 35988592, "step": 752, "train_runtime": 5211.7508, "train_tokens_per_second": 6905.279 }, { "epoch": 0.4840887174541948, "grad_norm": 0.21665923297405243, "learning_rate": 0.00010367504835589943, "loss": 1.2186, "num_input_tokens_seen": 36034608, "step": 753, "train_runtime": 5218.1905, "train_tokens_per_second": 6905.575 }, { "epoch": 0.4847315975570556, "grad_norm": 0.23793700337409973, "learning_rate": 0.00010354609929078013, "loss": 0.9369, "num_input_tokens_seen": 36084560, "step": 754, "train_runtime": 5225.0719, "train_tokens_per_second": 6906.041 }, { "epoch": 0.4853744776599164, "grad_norm": 0.22704121470451355, "learning_rate": 0.00010341715022566088, "loss": 1.0209, "num_input_tokens_seen": 36123968, "step": 755, "train_runtime": 5230.5664, "train_tokens_per_second": 6906.32 }, { "epoch": 0.48601735776277727, "grad_norm": 0.21854600310325623, "learning_rate": 0.00010328820116054158, "loss": 0.9209, "num_input_tokens_seen": 36160400, "step": 756, "train_runtime": 5235.7065, "train_tokens_per_second": 6906.499 }, { "epoch": 0.48666023786563806, "grad_norm": 0.21820661425590515, "learning_rate": 0.00010315925209542232, "loss": 0.8536, "num_input_tokens_seen": 36201760, "step": 757, "train_runtime": 5241.4811, "train_tokens_per_second": 6906.781 }, { "epoch": 0.4873031179684989, "grad_norm": 0.2267056107521057, "learning_rate": 0.00010303030303030303, "loss": 1.039, "num_input_tokens_seen": 36241792, "step": 758, "train_runtime": 5247.1175, "train_tokens_per_second": 6906.991 }, { "epoch": 0.4879459980713597, "grad_norm": 0.21134983003139496, "learning_rate": 0.00010290135396518377, "loss": 0.9895, "num_input_tokens_seen": 36283280, "step": 759, "train_runtime": 5252.9079, "train_tokens_per_second": 6907.275 }, { "epoch": 0.48858887817422053, "grad_norm": 0.2200525552034378, "learning_rate": 0.00010277240490006448, "loss": 1.0206, "num_input_tokens_seen": 36322064, "step": 760, "train_runtime": 5258.4012, "train_tokens_per_second": 6907.435 }, { "epoch": 0.4892317582770813, "grad_norm": 0.2264779657125473, "learning_rate": 0.00010264345583494522, "loss": 0.9971, "num_input_tokens_seen": 36358512, "step": 761, "train_runtime": 5263.5554, "train_tokens_per_second": 6907.596 }, { "epoch": 0.48987463837994216, "grad_norm": 0.20705893635749817, "learning_rate": 0.00010251450676982592, "loss": 0.8841, "num_input_tokens_seen": 36395296, "step": 762, "train_runtime": 5268.7278, "train_tokens_per_second": 6907.796 }, { "epoch": 0.49051751848280295, "grad_norm": 0.21519790589809418, "learning_rate": 0.00010238555770470664, "loss": 0.8807, "num_input_tokens_seen": 36449152, "step": 763, "train_runtime": 5276.297, "train_tokens_per_second": 6908.093 }, { "epoch": 0.4911603985856638, "grad_norm": 0.19477756321430206, "learning_rate": 0.00010225660863958737, "loss": 1.0622, "num_input_tokens_seen": 36529264, "step": 764, "train_runtime": 5287.6156, "train_tokens_per_second": 6908.457 }, { "epoch": 0.4918032786885246, "grad_norm": 0.22233176231384277, "learning_rate": 0.00010212765957446809, "loss": 1.0275, "num_input_tokens_seen": 36579232, "step": 765, "train_runtime": 5294.6526, "train_tokens_per_second": 6908.712 }, { "epoch": 0.4924461587913854, "grad_norm": 0.20059292018413544, "learning_rate": 0.00010199871050934882, "loss": 0.9885, "num_input_tokens_seen": 36654368, "step": 766, "train_runtime": 5305.214, "train_tokens_per_second": 6909.121 }, { "epoch": 0.4930890388942462, "grad_norm": 0.2213578075170517, "learning_rate": 0.00010186976144422952, "loss": 1.066, "num_input_tokens_seen": 36694352, "step": 767, "train_runtime": 5310.8501, "train_tokens_per_second": 6909.318 }, { "epoch": 0.49373191899710706, "grad_norm": 0.21473011374473572, "learning_rate": 0.00010174081237911026, "loss": 1.0383, "num_input_tokens_seen": 36753792, "step": 768, "train_runtime": 5319.2558, "train_tokens_per_second": 6909.574 }, { "epoch": 0.49437479909996784, "grad_norm": 0.22463928163051605, "learning_rate": 0.00010161186331399097, "loss": 0.9858, "num_input_tokens_seen": 36822496, "step": 769, "train_runtime": 5328.9486, "train_tokens_per_second": 6909.899 }, { "epoch": 0.4950176792028287, "grad_norm": 0.2096138745546341, "learning_rate": 0.0001014829142488717, "loss": 0.856, "num_input_tokens_seen": 36871792, "step": 770, "train_runtime": 5335.831, "train_tokens_per_second": 6910.225 }, { "epoch": 0.4956605593056895, "grad_norm": 0.2219269871711731, "learning_rate": 0.00010135396518375242, "loss": 0.8585, "num_input_tokens_seen": 36914608, "step": 771, "train_runtime": 5341.8262, "train_tokens_per_second": 6910.485 }, { "epoch": 0.4963034394085503, "grad_norm": 0.19027844071388245, "learning_rate": 0.00010122501611863316, "loss": 0.9252, "num_input_tokens_seen": 36966544, "step": 772, "train_runtime": 5349.0613, "train_tokens_per_second": 6910.847 }, { "epoch": 0.4969463195114111, "grad_norm": 0.23160985112190247, "learning_rate": 0.00010109606705351386, "loss": 1.0037, "num_input_tokens_seen": 37004928, "step": 773, "train_runtime": 5354.4843, "train_tokens_per_second": 6911.016 }, { "epoch": 0.49758919961427195, "grad_norm": 0.2228197604417801, "learning_rate": 0.0001009671179883946, "loss": 0.9763, "num_input_tokens_seen": 37045872, "step": 774, "train_runtime": 5360.271, "train_tokens_per_second": 6911.194 }, { "epoch": 0.49823207971713274, "grad_norm": 0.2354273945093155, "learning_rate": 0.00010083816892327531, "loss": 1.0797, "num_input_tokens_seen": 37115744, "step": 775, "train_runtime": 5370.0681, "train_tokens_per_second": 6911.596 }, { "epoch": 0.4988749598199936, "grad_norm": 0.22572071850299835, "learning_rate": 0.00010070921985815603, "loss": 0.9801, "num_input_tokens_seen": 37167536, "step": 776, "train_runtime": 5377.3506, "train_tokens_per_second": 6911.868 }, { "epoch": 0.49951783992285437, "grad_norm": 0.22266492247581482, "learning_rate": 0.00010058027079303676, "loss": 1.0543, "num_input_tokens_seen": 37222160, "step": 777, "train_runtime": 5385.0841, "train_tokens_per_second": 6912.085 }, { "epoch": 0.5001607200257152, "grad_norm": 0.21932601928710938, "learning_rate": 0.00010045132172791746, "loss": 0.9456, "num_input_tokens_seen": 37267312, "step": 778, "train_runtime": 5391.4001, "train_tokens_per_second": 6912.363 }, { "epoch": 0.500803600128576, "grad_norm": 0.22067613899707794, "learning_rate": 0.00010032237266279821, "loss": 0.979, "num_input_tokens_seen": 37312176, "step": 779, "train_runtime": 5397.7267, "train_tokens_per_second": 6912.572 }, { "epoch": 0.5014464802314368, "grad_norm": 0.22810345888137817, "learning_rate": 0.00010019342359767891, "loss": 1.0039, "num_input_tokens_seen": 37372080, "step": 780, "train_runtime": 5406.202, "train_tokens_per_second": 6912.816 }, { "epoch": 0.5014464802314368, "eval_loss": 1.0119534730911255, "eval_runtime": 40.1144, "eval_samples_per_second": 24.779, "eval_steps_per_second": 1.571, "num_input_tokens_seen": 37372080, "step": 780 }, { "epoch": 0.5020893603342976, "grad_norm": 0.2170599102973938, "learning_rate": 0.00010006447453255965, "loss": 0.9351, "num_input_tokens_seen": 37405264, "step": 781, "train_runtime": 5451.6653, "train_tokens_per_second": 6861.255 }, { "epoch": 0.5027322404371585, "grad_norm": 0.21231862902641296, "learning_rate": 9.993552546744036e-05, "loss": 0.9615, "num_input_tokens_seen": 37447872, "step": 782, "train_runtime": 5457.6793, "train_tokens_per_second": 6861.501 }, { "epoch": 0.5033751205400193, "grad_norm": 0.2113790363073349, "learning_rate": 9.980657640232108e-05, "loss": 1.0439, "num_input_tokens_seen": 37488944, "step": 783, "train_runtime": 5463.5208, "train_tokens_per_second": 6861.682 }, { "epoch": 0.50401800064288, "grad_norm": 0.2181268185377121, "learning_rate": 9.96776273372018e-05, "loss": 1.0294, "num_input_tokens_seen": 37556592, "step": 784, "train_runtime": 5473.0127, "train_tokens_per_second": 6862.142 }, { "epoch": 0.5046608807457409, "grad_norm": 0.2144027054309845, "learning_rate": 9.954867827208253e-05, "loss": 0.9804, "num_input_tokens_seen": 37592480, "step": 785, "train_runtime": 5478.0658, "train_tokens_per_second": 6862.364 }, { "epoch": 0.5053037608486017, "grad_norm": 0.2277204841375351, "learning_rate": 9.941972920696325e-05, "loss": 1.0026, "num_input_tokens_seen": 37631008, "step": 786, "train_runtime": 5483.4784, "train_tokens_per_second": 6862.616 }, { "epoch": 0.5059466409514626, "grad_norm": 0.2240583598613739, "learning_rate": 9.929078014184398e-05, "loss": 0.9938, "num_input_tokens_seen": 37670928, "step": 787, "train_runtime": 5489.1164, "train_tokens_per_second": 6862.84 }, { "epoch": 0.5065895210543234, "grad_norm": 0.2214142084121704, "learning_rate": 9.91618310767247e-05, "loss": 0.9126, "num_input_tokens_seen": 37706112, "step": 788, "train_runtime": 5494.179, "train_tokens_per_second": 6862.92 }, { "epoch": 0.5072324011571842, "grad_norm": 0.27018073201179504, "learning_rate": 9.903288201160542e-05, "loss": 1.1332, "num_input_tokens_seen": 37774016, "step": 789, "train_runtime": 5503.7935, "train_tokens_per_second": 6863.269 }, { "epoch": 0.507875281260045, "grad_norm": 0.2212986946105957, "learning_rate": 9.890393294648615e-05, "loss": 1.0088, "num_input_tokens_seen": 37829152, "step": 790, "train_runtime": 5511.5653, "train_tokens_per_second": 6863.595 }, { "epoch": 0.5085181613629058, "grad_norm": 0.2240961641073227, "learning_rate": 9.877498388136687e-05, "loss": 1.0432, "num_input_tokens_seen": 37897120, "step": 791, "train_runtime": 5521.1096, "train_tokens_per_second": 6864.04 }, { "epoch": 0.5091610414657667, "grad_norm": 0.22257636487483978, "learning_rate": 9.864603481624759e-05, "loss": 0.8842, "num_input_tokens_seen": 37958560, "step": 792, "train_runtime": 5529.7519, "train_tokens_per_second": 6864.424 }, { "epoch": 0.5098039215686274, "grad_norm": 0.22161521017551422, "learning_rate": 9.851708575112832e-05, "loss": 0.9624, "num_input_tokens_seen": 37996224, "step": 793, "train_runtime": 5535.1111, "train_tokens_per_second": 6864.582 }, { "epoch": 0.5104468016714883, "grad_norm": 0.22766484320163727, "learning_rate": 9.838813668600904e-05, "loss": 1.0029, "num_input_tokens_seen": 38037360, "step": 794, "train_runtime": 5540.9151, "train_tokens_per_second": 6864.816 }, { "epoch": 0.5110896817743491, "grad_norm": 0.20991362631320953, "learning_rate": 9.825918762088975e-05, "loss": 0.985, "num_input_tokens_seen": 38071184, "step": 795, "train_runtime": 5545.7174, "train_tokens_per_second": 6864.97 }, { "epoch": 0.51173256187721, "grad_norm": 0.20548021793365479, "learning_rate": 9.813023855577047e-05, "loss": 0.9304, "num_input_tokens_seen": 38114448, "step": 796, "train_runtime": 5551.8401, "train_tokens_per_second": 6865.192 }, { "epoch": 0.5123754419800707, "grad_norm": 0.21104614436626434, "learning_rate": 9.800128949065119e-05, "loss": 0.9289, "num_input_tokens_seen": 38169520, "step": 797, "train_runtime": 5559.6111, "train_tokens_per_second": 6865.502 }, { "epoch": 0.5130183220829315, "grad_norm": 0.261750191450119, "learning_rate": 9.787234042553192e-05, "loss": 1.0508, "num_input_tokens_seen": 38217456, "step": 798, "train_runtime": 5566.3756, "train_tokens_per_second": 6865.77 }, { "epoch": 0.5136612021857924, "grad_norm": 0.21956448256969452, "learning_rate": 9.774339136041264e-05, "loss": 1.0698, "num_input_tokens_seen": 38264448, "step": 799, "train_runtime": 5572.9589, "train_tokens_per_second": 6866.092 }, { "epoch": 0.5143040822886532, "grad_norm": 0.21060562133789062, "learning_rate": 9.761444229529336e-05, "loss": 0.9054, "num_input_tokens_seen": 38323808, "step": 800, "train_runtime": 5581.3308, "train_tokens_per_second": 6866.428 }, { "epoch": 0.5149469623915139, "grad_norm": 0.21071135997772217, "learning_rate": 9.748549323017409e-05, "loss": 0.8784, "num_input_tokens_seen": 38387104, "step": 801, "train_runtime": 5590.2262, "train_tokens_per_second": 6866.825 }, { "epoch": 0.5155898424943748, "grad_norm": 0.21163177490234375, "learning_rate": 9.735654416505481e-05, "loss": 0.9145, "num_input_tokens_seen": 38431408, "step": 802, "train_runtime": 5596.5181, "train_tokens_per_second": 6867.021 }, { "epoch": 0.5162327225972356, "grad_norm": 0.22283923625946045, "learning_rate": 9.722759509993553e-05, "loss": 0.958, "num_input_tokens_seen": 38494624, "step": 803, "train_runtime": 5605.4124, "train_tokens_per_second": 6867.403 }, { "epoch": 0.5168756027000965, "grad_norm": 0.22431445121765137, "learning_rate": 9.709864603481626e-05, "loss": 1.0125, "num_input_tokens_seen": 38539232, "step": 804, "train_runtime": 5611.6718, "train_tokens_per_second": 6867.692 }, { "epoch": 0.5175184828029572, "grad_norm": 0.23587460815906525, "learning_rate": 9.696969696969698e-05, "loss": 1.0458, "num_input_tokens_seen": 38576064, "step": 805, "train_runtime": 5616.914, "train_tokens_per_second": 6867.84 }, { "epoch": 0.518161362905818, "grad_norm": 0.207449272274971, "learning_rate": 9.68407479045777e-05, "loss": 1.0524, "num_input_tokens_seen": 38632640, "step": 806, "train_runtime": 5624.8634, "train_tokens_per_second": 6868.192 }, { "epoch": 0.5188042430086789, "grad_norm": 0.21176041662693024, "learning_rate": 9.671179883945843e-05, "loss": 0.9592, "num_input_tokens_seen": 38682864, "step": 807, "train_runtime": 5631.9549, "train_tokens_per_second": 6868.461 }, { "epoch": 0.5194471231115397, "grad_norm": 0.21222098171710968, "learning_rate": 9.658284977433914e-05, "loss": 0.9656, "num_input_tokens_seen": 38726928, "step": 808, "train_runtime": 5638.1731, "train_tokens_per_second": 6868.701 }, { "epoch": 0.5200900032144005, "grad_norm": 0.2217748910188675, "learning_rate": 9.645390070921986e-05, "loss": 1.1452, "num_input_tokens_seen": 38768208, "step": 809, "train_runtime": 5643.9671, "train_tokens_per_second": 6868.964 }, { "epoch": 0.5207328833172613, "grad_norm": 0.2218509018421173, "learning_rate": 9.632495164410058e-05, "loss": 1.0318, "num_input_tokens_seen": 38814848, "step": 810, "train_runtime": 5650.5568, "train_tokens_per_second": 6869.208 }, { "epoch": 0.5213757634201222, "grad_norm": 0.21409547328948975, "learning_rate": 9.61960025789813e-05, "loss": 1.0752, "num_input_tokens_seen": 38852192, "step": 811, "train_runtime": 5656.3876, "train_tokens_per_second": 6868.729 }, { "epoch": 0.522018643522983, "grad_norm": 0.2177419811487198, "learning_rate": 9.606705351386203e-05, "loss": 0.9027, "num_input_tokens_seen": 38899840, "step": 812, "train_runtime": 5663.0105, "train_tokens_per_second": 6869.11 }, { "epoch": 0.5226615236258437, "grad_norm": 0.20673255622386932, "learning_rate": 9.593810444874275e-05, "loss": 0.9976, "num_input_tokens_seen": 38941680, "step": 813, "train_runtime": 5668.9566, "train_tokens_per_second": 6869.285 }, { "epoch": 0.5233044037287046, "grad_norm": 0.22064630687236786, "learning_rate": 9.580915538362347e-05, "loss": 1.053, "num_input_tokens_seen": 38995920, "step": 814, "train_runtime": 5676.6459, "train_tokens_per_second": 6869.535 }, { "epoch": 0.5239472838315654, "grad_norm": 0.19912369549274445, "learning_rate": 9.56802063185042e-05, "loss": 0.9567, "num_input_tokens_seen": 39033728, "step": 815, "train_runtime": 5681.9727, "train_tokens_per_second": 6869.749 }, { "epoch": 0.5245901639344263, "grad_norm": 0.2328333854675293, "learning_rate": 9.555125725338492e-05, "loss": 0.9518, "num_input_tokens_seen": 39066896, "step": 816, "train_runtime": 5686.6796, "train_tokens_per_second": 6869.896 }, { "epoch": 0.5252330440372871, "grad_norm": 0.2665647268295288, "learning_rate": 9.542230818826565e-05, "loss": 0.9155, "num_input_tokens_seen": 39112144, "step": 817, "train_runtime": 5693.0716, "train_tokens_per_second": 6870.13 }, { "epoch": 0.5258759241401478, "grad_norm": 0.21602346003055573, "learning_rate": 9.529335912314637e-05, "loss": 0.9097, "num_input_tokens_seen": 39169712, "step": 818, "train_runtime": 5701.2268, "train_tokens_per_second": 6870.401 }, { "epoch": 0.5265188042430087, "grad_norm": 0.21335062384605408, "learning_rate": 9.516441005802708e-05, "loss": 0.9175, "num_input_tokens_seen": 39226352, "step": 819, "train_runtime": 5709.206, "train_tokens_per_second": 6870.719 }, { "epoch": 0.5271616843458695, "grad_norm": 0.21426311135292053, "learning_rate": 9.503546099290782e-05, "loss": 1.0489, "num_input_tokens_seen": 39276496, "step": 820, "train_runtime": 5716.279, "train_tokens_per_second": 6870.99 }, { "epoch": 0.5278045644487304, "grad_norm": 0.22840139269828796, "learning_rate": 9.490651192778853e-05, "loss": 0.9286, "num_input_tokens_seen": 39316784, "step": 821, "train_runtime": 5721.9319, "train_tokens_per_second": 6871.243 }, { "epoch": 0.5284474445515911, "grad_norm": 0.22848589718341827, "learning_rate": 9.477756286266924e-05, "loss": 0.9535, "num_input_tokens_seen": 39354496, "step": 822, "train_runtime": 5727.2483, "train_tokens_per_second": 6871.449 }, { "epoch": 0.5290903246544519, "grad_norm": 0.21826131641864777, "learning_rate": 9.464861379754997e-05, "loss": 1.0541, "num_input_tokens_seen": 39409184, "step": 823, "train_runtime": 5734.924, "train_tokens_per_second": 6871.788 }, { "epoch": 0.5297332047573128, "grad_norm": 0.21087752282619476, "learning_rate": 9.451966473243069e-05, "loss": 1.0101, "num_input_tokens_seen": 39446544, "step": 824, "train_runtime": 5740.2346, "train_tokens_per_second": 6871.939 }, { "epoch": 0.5303760848601736, "grad_norm": 0.2084406465291977, "learning_rate": 9.439071566731142e-05, "loss": 0.8512, "num_input_tokens_seen": 39491200, "step": 825, "train_runtime": 5746.5125, "train_tokens_per_second": 6872.203 }, { "epoch": 0.5310189649630344, "grad_norm": 0.21428586542606354, "learning_rate": 9.426176660219214e-05, "loss": 0.9252, "num_input_tokens_seen": 39526512, "step": 826, "train_runtime": 5751.5278, "train_tokens_per_second": 6872.35 }, { "epoch": 0.5316618450658952, "grad_norm": 0.21495121717453003, "learning_rate": 9.413281753707286e-05, "loss": 0.9177, "num_input_tokens_seen": 39582784, "step": 827, "train_runtime": 5759.4735, "train_tokens_per_second": 6872.639 }, { "epoch": 0.532304725168756, "grad_norm": 0.23897185921669006, "learning_rate": 9.400386847195359e-05, "loss": 0.9302, "num_input_tokens_seen": 39632240, "step": 828, "train_runtime": 5766.4408, "train_tokens_per_second": 6872.912 }, { "epoch": 0.5329476052716169, "grad_norm": 0.21306166052818298, "learning_rate": 9.38749194068343e-05, "loss": 0.9407, "num_input_tokens_seen": 39679152, "step": 829, "train_runtime": 5773.0632, "train_tokens_per_second": 6873.154 }, { "epoch": 0.5335904853744776, "grad_norm": 0.24286721646785736, "learning_rate": 9.374597034171502e-05, "loss": 0.87, "num_input_tokens_seen": 39729280, "step": 830, "train_runtime": 5780.0687, "train_tokens_per_second": 6873.496 }, { "epoch": 0.5342333654773385, "grad_norm": 0.21733801066875458, "learning_rate": 9.361702127659576e-05, "loss": 1.0095, "num_input_tokens_seen": 39769760, "step": 831, "train_runtime": 5785.7904, "train_tokens_per_second": 6873.695 }, { "epoch": 0.5348762455801993, "grad_norm": 0.19941464066505432, "learning_rate": 9.348807221147647e-05, "loss": 0.8936, "num_input_tokens_seen": 39811328, "step": 832, "train_runtime": 5791.6483, "train_tokens_per_second": 6873.92 }, { "epoch": 0.5355191256830601, "grad_norm": 0.22359183430671692, "learning_rate": 9.335912314635719e-05, "loss": 1.0963, "num_input_tokens_seen": 39847168, "step": 833, "train_runtime": 5796.7331, "train_tokens_per_second": 6874.073 }, { "epoch": 0.5361620057859209, "grad_norm": 0.23717975616455078, "learning_rate": 9.323017408123792e-05, "loss": 0.9002, "num_input_tokens_seen": 39909168, "step": 834, "train_runtime": 5805.3823, "train_tokens_per_second": 6874.512 }, { "epoch": 0.5368048858887817, "grad_norm": 0.21464844048023224, "learning_rate": 9.310122501611864e-05, "loss": 0.9609, "num_input_tokens_seen": 39953264, "step": 835, "train_runtime": 5811.6133, "train_tokens_per_second": 6874.729 }, { "epoch": 0.5374477659916426, "grad_norm": 0.20704124867916107, "learning_rate": 9.297227595099936e-05, "loss": 0.9292, "num_input_tokens_seen": 40025024, "step": 836, "train_runtime": 5821.7066, "train_tokens_per_second": 6875.136 }, { "epoch": 0.5380906460945034, "grad_norm": 0.2311316728591919, "learning_rate": 9.284332688588008e-05, "loss": 1.0163, "num_input_tokens_seen": 40068128, "step": 837, "train_runtime": 5827.7726, "train_tokens_per_second": 6875.376 }, { "epoch": 0.5387335261973641, "grad_norm": 0.20525947213172913, "learning_rate": 9.27143778207608e-05, "loss": 0.8296, "num_input_tokens_seen": 40106032, "step": 838, "train_runtime": 5833.108, "train_tokens_per_second": 6875.585 }, { "epoch": 0.539376406300225, "grad_norm": 0.22608095407485962, "learning_rate": 9.258542875564153e-05, "loss": 0.9444, "num_input_tokens_seen": 40150368, "step": 839, "train_runtime": 5839.3826, "train_tokens_per_second": 6875.79 }, { "epoch": 0.5400192864030858, "grad_norm": 0.21035784482955933, "learning_rate": 9.245647969052225e-05, "loss": 0.9388, "num_input_tokens_seen": 40202592, "step": 840, "train_runtime": 5846.7137, "train_tokens_per_second": 6876.101 }, { "epoch": 0.5406621665059467, "grad_norm": 0.2148246020078659, "learning_rate": 9.232753062540296e-05, "loss": 0.9992, "num_input_tokens_seen": 40260592, "step": 841, "train_runtime": 5855.3499, "train_tokens_per_second": 6875.864 }, { "epoch": 0.5413050466088074, "grad_norm": 0.20591579377651215, "learning_rate": 9.21985815602837e-05, "loss": 1.0278, "num_input_tokens_seen": 40296272, "step": 842, "train_runtime": 5860.3641, "train_tokens_per_second": 6876.07 }, { "epoch": 0.5419479267116682, "grad_norm": 0.19806860387325287, "learning_rate": 9.206963249516441e-05, "loss": 0.941, "num_input_tokens_seen": 40331984, "step": 843, "train_runtime": 5865.4433, "train_tokens_per_second": 6876.204 }, { "epoch": 0.5425908068145291, "grad_norm": 0.2135857492685318, "learning_rate": 9.194068343004513e-05, "loss": 0.9578, "num_input_tokens_seen": 40367648, "step": 844, "train_runtime": 5870.5212, "train_tokens_per_second": 6876.331 }, { "epoch": 0.5432336869173899, "grad_norm": 0.20810310542583466, "learning_rate": 9.181173436492586e-05, "loss": 0.9486, "num_input_tokens_seen": 40428800, "step": 845, "train_runtime": 5879.0687, "train_tokens_per_second": 6876.735 }, { "epoch": 0.5438765670202508, "grad_norm": 0.2066211998462677, "learning_rate": 9.168278529980658e-05, "loss": 0.9881, "num_input_tokens_seen": 40481600, "step": 846, "train_runtime": 5886.4452, "train_tokens_per_second": 6877.088 }, { "epoch": 0.5445194471231115, "grad_norm": 0.22638893127441406, "learning_rate": 9.155383623468731e-05, "loss": 1.0343, "num_input_tokens_seen": 40518064, "step": 847, "train_runtime": 5891.6303, "train_tokens_per_second": 6877.224 }, { "epoch": 0.5451623272259724, "grad_norm": 0.2309054434299469, "learning_rate": 9.142488716956803e-05, "loss": 0.8937, "num_input_tokens_seen": 40580432, "step": 848, "train_runtime": 5900.405, "train_tokens_per_second": 6877.567 }, { "epoch": 0.5458052073288332, "grad_norm": 0.21096345782279968, "learning_rate": 9.129593810444874e-05, "loss": 0.9058, "num_input_tokens_seen": 40636384, "step": 849, "train_runtime": 5908.2116, "train_tokens_per_second": 6877.95 }, { "epoch": 0.546448087431694, "grad_norm": 0.23349037766456604, "learning_rate": 9.116698903932947e-05, "loss": 1.0517, "num_input_tokens_seen": 40700768, "step": 850, "train_runtime": 5917.2501, "train_tokens_per_second": 6878.325 }, { "epoch": 0.5470909675345548, "grad_norm": 0.24514555931091309, "learning_rate": 9.103803997421019e-05, "loss": 0.9398, "num_input_tokens_seen": 40762272, "step": 851, "train_runtime": 5925.9076, "train_tokens_per_second": 6878.655 }, { "epoch": 0.5477338476374156, "grad_norm": 0.2217293083667755, "learning_rate": 9.090909090909092e-05, "loss": 1.0893, "num_input_tokens_seen": 40803104, "step": 852, "train_runtime": 5931.6651, "train_tokens_per_second": 6878.862 }, { "epoch": 0.5483767277402765, "grad_norm": 0.21611201763153076, "learning_rate": 9.078014184397164e-05, "loss": 0.9538, "num_input_tokens_seen": 40844208, "step": 853, "train_runtime": 5937.4707, "train_tokens_per_second": 6879.058 }, { "epoch": 0.5490196078431373, "grad_norm": 0.21386729180812836, "learning_rate": 9.065119277885235e-05, "loss": 1.022, "num_input_tokens_seen": 40903888, "step": 854, "train_runtime": 5945.8847, "train_tokens_per_second": 6879.361 }, { "epoch": 0.549662487945998, "grad_norm": 0.22319400310516357, "learning_rate": 9.052224371373309e-05, "loss": 0.9228, "num_input_tokens_seen": 40961344, "step": 855, "train_runtime": 5953.914, "train_tokens_per_second": 6879.734 }, { "epoch": 0.5503053680488589, "grad_norm": 0.22674967348575592, "learning_rate": 9.03932946486138e-05, "loss": 0.9645, "num_input_tokens_seen": 41008160, "step": 856, "train_runtime": 5960.523, "train_tokens_per_second": 6879.96 }, { "epoch": 0.5509482481517197, "grad_norm": 0.23880483210086823, "learning_rate": 9.026434558349452e-05, "loss": 0.8906, "num_input_tokens_seen": 41042464, "step": 857, "train_runtime": 5965.3763, "train_tokens_per_second": 6880.113 }, { "epoch": 0.5515911282545806, "grad_norm": 0.21060539782047272, "learning_rate": 9.013539651837525e-05, "loss": 1.0402, "num_input_tokens_seen": 41082064, "step": 858, "train_runtime": 5970.9961, "train_tokens_per_second": 6880.27 }, { "epoch": 0.5522340083574413, "grad_norm": 0.2186761349439621, "learning_rate": 9.000644745325597e-05, "loss": 0.95, "num_input_tokens_seen": 41123552, "step": 859, "train_runtime": 5976.8549, "train_tokens_per_second": 6880.467 }, { "epoch": 0.5528768884603021, "grad_norm": 0.2016412615776062, "learning_rate": 8.987749838813669e-05, "loss": 0.9186, "num_input_tokens_seen": 41168240, "step": 860, "train_runtime": 5983.0983, "train_tokens_per_second": 6880.756 }, { "epoch": 0.553519768563163, "grad_norm": 0.21804280579090118, "learning_rate": 8.974854932301742e-05, "loss": 0.9289, "num_input_tokens_seen": 41234384, "step": 861, "train_runtime": 5992.3826, "train_tokens_per_second": 6881.133 }, { "epoch": 0.5541626486660238, "grad_norm": 0.21665385365486145, "learning_rate": 8.961960025789814e-05, "loss": 0.9558, "num_input_tokens_seen": 41272016, "step": 862, "train_runtime": 5997.6849, "train_tokens_per_second": 6881.324 }, { "epoch": 0.5548055287688846, "grad_norm": 0.2189703732728958, "learning_rate": 8.949065119277886e-05, "loss": 0.9443, "num_input_tokens_seen": 41320896, "step": 863, "train_runtime": 6004.5713, "train_tokens_per_second": 6881.573 }, { "epoch": 0.5554484088717454, "grad_norm": 0.2256087064743042, "learning_rate": 8.936170212765958e-05, "loss": 0.9379, "num_input_tokens_seen": 41367872, "step": 864, "train_runtime": 6011.1948, "train_tokens_per_second": 6881.805 }, { "epoch": 0.5560912889746062, "grad_norm": 0.22272774577140808, "learning_rate": 8.92327530625403e-05, "loss": 0.9655, "num_input_tokens_seen": 41413008, "step": 865, "train_runtime": 6017.569, "train_tokens_per_second": 6882.016 }, { "epoch": 0.5567341690774671, "grad_norm": 0.2210770696401596, "learning_rate": 8.910380399742103e-05, "loss": 0.9604, "num_input_tokens_seen": 41457152, "step": 866, "train_runtime": 6023.8013, "train_tokens_per_second": 6882.224 }, { "epoch": 0.5573770491803278, "grad_norm": 0.21450798213481903, "learning_rate": 8.897485493230174e-05, "loss": 1.0894, "num_input_tokens_seen": 41521120, "step": 867, "train_runtime": 6032.7832, "train_tokens_per_second": 6882.581 }, { "epoch": 0.5580199292831887, "grad_norm": 0.23895588517189026, "learning_rate": 8.884590586718246e-05, "loss": 0.8939, "num_input_tokens_seen": 41581344, "step": 868, "train_runtime": 6041.1988, "train_tokens_per_second": 6882.962 }, { "epoch": 0.5586628093860495, "grad_norm": 0.23894917964935303, "learning_rate": 8.871695680206319e-05, "loss": 0.9768, "num_input_tokens_seen": 41618224, "step": 869, "train_runtime": 6046.4132, "train_tokens_per_second": 6883.126 }, { "epoch": 0.5593056894889104, "grad_norm": 0.23007355630397797, "learning_rate": 8.858800773694391e-05, "loss": 0.9947, "num_input_tokens_seen": 41655376, "step": 870, "train_runtime": 6051.6787, "train_tokens_per_second": 6883.276 }, { "epoch": 0.5599485695917711, "grad_norm": 0.22590278089046478, "learning_rate": 8.845905867182463e-05, "loss": 0.8208, "num_input_tokens_seen": 41687184, "step": 871, "train_runtime": 6056.7009, "train_tokens_per_second": 6882.82 }, { "epoch": 0.5605914496946319, "grad_norm": 0.2513355016708374, "learning_rate": 8.833010960670536e-05, "loss": 1.1157, "num_input_tokens_seen": 41779632, "step": 872, "train_runtime": 6069.7172, "train_tokens_per_second": 6883.291 }, { "epoch": 0.5612343297974928, "grad_norm": 0.21992050111293793, "learning_rate": 8.820116054158608e-05, "loss": 1.0661, "num_input_tokens_seen": 41819712, "step": 873, "train_runtime": 6075.3753, "train_tokens_per_second": 6883.478 }, { "epoch": 0.5618772099003536, "grad_norm": 0.20959214866161346, "learning_rate": 8.80722114764668e-05, "loss": 1.1405, "num_input_tokens_seen": 41864224, "step": 874, "train_runtime": 6081.6646, "train_tokens_per_second": 6883.679 }, { "epoch": 0.5625200900032143, "grad_norm": 0.21922095119953156, "learning_rate": 8.794326241134753e-05, "loss": 0.9449, "num_input_tokens_seen": 41895120, "step": 875, "train_runtime": 6086.082, "train_tokens_per_second": 6883.759 }, { "epoch": 0.5631629701060752, "grad_norm": 0.2277074009180069, "learning_rate": 8.781431334622823e-05, "loss": 0.9949, "num_input_tokens_seen": 41938720, "step": 876, "train_runtime": 6092.2718, "train_tokens_per_second": 6883.921 }, { "epoch": 0.563805850208936, "grad_norm": 0.23298637568950653, "learning_rate": 8.768536428110897e-05, "loss": 1.0172, "num_input_tokens_seen": 41987904, "step": 877, "train_runtime": 6099.2057, "train_tokens_per_second": 6884.159 }, { "epoch": 0.5644487303117969, "grad_norm": 0.21925728023052216, "learning_rate": 8.755641521598968e-05, "loss": 0.9435, "num_input_tokens_seen": 42027456, "step": 878, "train_runtime": 6104.797, "train_tokens_per_second": 6884.333 }, { "epoch": 0.5650916104146577, "grad_norm": 0.2143392413854599, "learning_rate": 8.74274661508704e-05, "loss": 0.992, "num_input_tokens_seen": 42088400, "step": 879, "train_runtime": 6113.3262, "train_tokens_per_second": 6884.697 }, { "epoch": 0.5657344905175185, "grad_norm": 0.2037908136844635, "learning_rate": 8.729851708575113e-05, "loss": 0.8212, "num_input_tokens_seen": 42121408, "step": 880, "train_runtime": 6118.001, "train_tokens_per_second": 6884.832 }, { "epoch": 0.5663773706203793, "grad_norm": 0.21776051819324493, "learning_rate": 8.716956802063185e-05, "loss": 1.0319, "num_input_tokens_seen": 42167056, "step": 881, "train_runtime": 6124.4423, "train_tokens_per_second": 6885.044 }, { "epoch": 0.5670202507232401, "grad_norm": 0.1910998821258545, "learning_rate": 8.704061895551258e-05, "loss": 1.0724, "num_input_tokens_seen": 42207408, "step": 882, "train_runtime": 6130.0885, "train_tokens_per_second": 6885.285 }, { "epoch": 0.567663130826101, "grad_norm": 0.21779921650886536, "learning_rate": 8.69116698903933e-05, "loss": 0.9752, "num_input_tokens_seen": 42249360, "step": 883, "train_runtime": 6136.0045, "train_tokens_per_second": 6885.484 }, { "epoch": 0.5683060109289617, "grad_norm": 0.2009030431509018, "learning_rate": 8.678272082527402e-05, "loss": 0.9272, "num_input_tokens_seen": 42307536, "step": 884, "train_runtime": 6144.1609, "train_tokens_per_second": 6885.812 }, { "epoch": 0.5689488910318226, "grad_norm": 0.20714476704597473, "learning_rate": 8.665377176015475e-05, "loss": 0.9203, "num_input_tokens_seen": 42365472, "step": 885, "train_runtime": 6152.2851, "train_tokens_per_second": 6886.136 }, { "epoch": 0.5695917711346834, "grad_norm": 0.22802214324474335, "learning_rate": 8.652482269503547e-05, "loss": 1.0257, "num_input_tokens_seen": 42429312, "step": 886, "train_runtime": 6161.2401, "train_tokens_per_second": 6886.489 }, { "epoch": 0.5702346512375442, "grad_norm": 0.24137407541275024, "learning_rate": 8.639587362991619e-05, "loss": 1.0293, "num_input_tokens_seen": 42468416, "step": 887, "train_runtime": 6166.8111, "train_tokens_per_second": 6886.609 }, { "epoch": 0.570877531340405, "grad_norm": 0.23040415346622467, "learning_rate": 8.626692456479692e-05, "loss": 0.8444, "num_input_tokens_seen": 42520688, "step": 888, "train_runtime": 6174.1119, "train_tokens_per_second": 6886.932 }, { "epoch": 0.5715204114432658, "grad_norm": 0.19980192184448242, "learning_rate": 8.613797549967764e-05, "loss": 0.8182, "num_input_tokens_seen": 42572048, "step": 889, "train_runtime": 6181.3308, "train_tokens_per_second": 6887.198 }, { "epoch": 0.5721632915461267, "grad_norm": 0.22542989253997803, "learning_rate": 8.600902643455835e-05, "loss": 1.0732, "num_input_tokens_seen": 42609424, "step": 890, "train_runtime": 6186.6135, "train_tokens_per_second": 6887.358 }, { "epoch": 0.5728061716489875, "grad_norm": 0.23115967214107513, "learning_rate": 8.588007736943907e-05, "loss": 0.9204, "num_input_tokens_seen": 42643936, "step": 891, "train_runtime": 6191.4711, "train_tokens_per_second": 6887.529 }, { "epoch": 0.5734490517518482, "grad_norm": 0.23263217508792877, "learning_rate": 8.575112830431979e-05, "loss": 0.9213, "num_input_tokens_seen": 42688720, "step": 892, "train_runtime": 6197.6985, "train_tokens_per_second": 6887.834 }, { "epoch": 0.5740919318547091, "grad_norm": 0.22807829082012177, "learning_rate": 8.562217923920052e-05, "loss": 1.0849, "num_input_tokens_seen": 42732496, "step": 893, "train_runtime": 6203.7686, "train_tokens_per_second": 6888.151 }, { "epoch": 0.5747348119575699, "grad_norm": 0.21378318965435028, "learning_rate": 8.549323017408124e-05, "loss": 0.8884, "num_input_tokens_seen": 42779216, "step": 894, "train_runtime": 6210.2206, "train_tokens_per_second": 6888.518 }, { "epoch": 0.5753776920604308, "grad_norm": 0.20278410613536835, "learning_rate": 8.536428110896196e-05, "loss": 0.9375, "num_input_tokens_seen": 42819792, "step": 895, "train_runtime": 6215.8757, "train_tokens_per_second": 6888.779 }, { "epoch": 0.5760205721632915, "grad_norm": 0.20692852139472961, "learning_rate": 8.523533204384269e-05, "loss": 0.9632, "num_input_tokens_seen": 42878464, "step": 896, "train_runtime": 6224.1169, "train_tokens_per_second": 6889.084 }, { "epoch": 0.5766634522661523, "grad_norm": 0.2214338183403015, "learning_rate": 8.510638297872341e-05, "loss": 1.0123, "num_input_tokens_seen": 42932576, "step": 897, "train_runtime": 6231.7369, "train_tokens_per_second": 6889.344 }, { "epoch": 0.5773063323690132, "grad_norm": 0.2511458992958069, "learning_rate": 8.497743391360413e-05, "loss": 0.8736, "num_input_tokens_seen": 43004368, "step": 898, "train_runtime": 6241.8144, "train_tokens_per_second": 6889.722 }, { "epoch": 0.577949212471874, "grad_norm": 0.21616335213184357, "learning_rate": 8.484848484848486e-05, "loss": 0.8995, "num_input_tokens_seen": 43039600, "step": 899, "train_runtime": 6246.7721, "train_tokens_per_second": 6889.894 }, { "epoch": 0.5785920925747348, "grad_norm": 0.22274382412433624, "learning_rate": 8.471953578336558e-05, "loss": 1.0423, "num_input_tokens_seen": 43085184, "step": 900, "train_runtime": 6253.1468, "train_tokens_per_second": 6890.16 }, { "epoch": 0.5792349726775956, "grad_norm": 0.22178566455841064, "learning_rate": 8.45905867182463e-05, "loss": 0.9354, "num_input_tokens_seen": 43164352, "step": 901, "train_runtime": 6264.699, "train_tokens_per_second": 6890.092 }, { "epoch": 0.5798778527804564, "grad_norm": 0.22248417139053345, "learning_rate": 8.446163765312703e-05, "loss": 1.0238, "num_input_tokens_seen": 43196160, "step": 902, "train_runtime": 6269.2226, "train_tokens_per_second": 6890.194 }, { "epoch": 0.5805207328833173, "grad_norm": 0.20994658768177032, "learning_rate": 8.433268858800773e-05, "loss": 1.0422, "num_input_tokens_seen": 43258992, "step": 903, "train_runtime": 6278.1231, "train_tokens_per_second": 6890.434 }, { "epoch": 0.581163612986178, "grad_norm": 0.23427492380142212, "learning_rate": 8.420373952288846e-05, "loss": 0.9556, "num_input_tokens_seen": 43328208, "step": 904, "train_runtime": 6287.8019, "train_tokens_per_second": 6890.835 }, { "epoch": 0.5818064930890389, "grad_norm": 0.24690331518650055, "learning_rate": 8.407479045776918e-05, "loss": 0.9847, "num_input_tokens_seen": 43381440, "step": 905, "train_runtime": 6295.28, "train_tokens_per_second": 6891.106 }, { "epoch": 0.5824493731918997, "grad_norm": 0.1973118931055069, "learning_rate": 8.39458413926499e-05, "loss": 0.8898, "num_input_tokens_seen": 43428560, "step": 906, "train_runtime": 6301.8974, "train_tokens_per_second": 6891.347 }, { "epoch": 0.5830922532947606, "grad_norm": 0.2366381287574768, "learning_rate": 8.381689232753063e-05, "loss": 0.9489, "num_input_tokens_seen": 43467968, "step": 907, "train_runtime": 6307.4496, "train_tokens_per_second": 6891.528 }, { "epoch": 0.5837351333976214, "grad_norm": 0.23190288245677948, "learning_rate": 8.368794326241135e-05, "loss": 0.8342, "num_input_tokens_seen": 43531200, "step": 908, "train_runtime": 6316.3141, "train_tokens_per_second": 6891.868 }, { "epoch": 0.5843780135004821, "grad_norm": 0.23574669659137726, "learning_rate": 8.355899419729207e-05, "loss": 1.1343, "num_input_tokens_seen": 43599280, "step": 909, "train_runtime": 6325.8663, "train_tokens_per_second": 6892.223 }, { "epoch": 0.585020893603343, "grad_norm": 0.21268287301063538, "learning_rate": 8.34300451321728e-05, "loss": 0.8419, "num_input_tokens_seen": 43637872, "step": 910, "train_runtime": 6331.2741, "train_tokens_per_second": 6892.431 }, { "epoch": 0.5856637737062038, "grad_norm": 0.2215997725725174, "learning_rate": 8.330109606705352e-05, "loss": 1.0209, "num_input_tokens_seen": 43689440, "step": 911, "train_runtime": 6338.5247, "train_tokens_per_second": 6892.683 }, { "epoch": 0.5863066538090647, "grad_norm": 0.21488438546657562, "learning_rate": 8.317214700193425e-05, "loss": 0.86, "num_input_tokens_seen": 43746672, "step": 912, "train_runtime": 6346.582, "train_tokens_per_second": 6892.95 }, { "epoch": 0.5869495339119254, "grad_norm": 0.23541532456874847, "learning_rate": 8.304319793681497e-05, "loss": 0.9567, "num_input_tokens_seen": 43817744, "step": 913, "train_runtime": 6356.4817, "train_tokens_per_second": 6893.396 }, { "epoch": 0.5875924140147862, "grad_norm": 0.22803905606269836, "learning_rate": 8.291424887169568e-05, "loss": 1.1268, "num_input_tokens_seen": 43851520, "step": 914, "train_runtime": 6361.3016, "train_tokens_per_second": 6893.482 }, { "epoch": 0.5882352941176471, "grad_norm": 0.21955518424510956, "learning_rate": 8.278529980657642e-05, "loss": 0.9847, "num_input_tokens_seen": 43895232, "step": 915, "train_runtime": 6367.4054, "train_tokens_per_second": 6893.739 }, { "epoch": 0.5888781742205079, "grad_norm": 0.20941504836082458, "learning_rate": 8.265635074145713e-05, "loss": 0.9002, "num_input_tokens_seen": 43933248, "step": 916, "train_runtime": 6372.7546, "train_tokens_per_second": 6893.918 }, { "epoch": 0.5895210543233687, "grad_norm": 0.2331460863351822, "learning_rate": 8.252740167633784e-05, "loss": 0.9279, "num_input_tokens_seen": 43976928, "step": 917, "train_runtime": 6378.8552, "train_tokens_per_second": 6894.173 }, { "epoch": 0.5901639344262295, "grad_norm": 0.21849630773067474, "learning_rate": 8.239845261121857e-05, "loss": 0.9592, "num_input_tokens_seen": 44037440, "step": 918, "train_runtime": 6387.3069, "train_tokens_per_second": 6894.524 }, { "epoch": 0.5908068145290903, "grad_norm": 0.20870837569236755, "learning_rate": 8.226950354609929e-05, "loss": 0.934, "num_input_tokens_seen": 44071488, "step": 919, "train_runtime": 6392.1384, "train_tokens_per_second": 6894.639 }, { "epoch": 0.5914496946319512, "grad_norm": 0.2119072824716568, "learning_rate": 8.214055448098002e-05, "loss": 0.8326, "num_input_tokens_seen": 44101040, "step": 920, "train_runtime": 6396.3504, "train_tokens_per_second": 6894.719 }, { "epoch": 0.5920925747348119, "grad_norm": 0.23690038919448853, "learning_rate": 8.201160541586074e-05, "loss": 1.0202, "num_input_tokens_seen": 44157248, "step": 921, "train_runtime": 6404.3079, "train_tokens_per_second": 6894.929 }, { "epoch": 0.5927354548376728, "grad_norm": 0.22710008919239044, "learning_rate": 8.188265635074146e-05, "loss": 1.0342, "num_input_tokens_seen": 44224064, "step": 922, "train_runtime": 6413.7279, "train_tokens_per_second": 6895.22 }, { "epoch": 0.5933783349405336, "grad_norm": 0.2313239574432373, "learning_rate": 8.175370728562219e-05, "loss": 0.8901, "num_input_tokens_seen": 44274672, "step": 923, "train_runtime": 6420.8058, "train_tokens_per_second": 6895.501 }, { "epoch": 0.5940212150433944, "grad_norm": 0.22043012082576752, "learning_rate": 8.16247582205029e-05, "loss": 1.0042, "num_input_tokens_seen": 44318736, "step": 924, "train_runtime": 6427.0153, "train_tokens_per_second": 6895.695 }, { "epoch": 0.5946640951462552, "grad_norm": 0.2008189857006073, "learning_rate": 8.149580915538362e-05, "loss": 0.9335, "num_input_tokens_seen": 44358256, "step": 925, "train_runtime": 6432.5716, "train_tokens_per_second": 6895.882 }, { "epoch": 0.595306975249116, "grad_norm": 0.1697245091199875, "learning_rate": 8.136686009026436e-05, "loss": 0.7817, "num_input_tokens_seen": 44434544, "step": 926, "train_runtime": 6443.2477, "train_tokens_per_second": 6896.296 }, { "epoch": 0.5959498553519769, "grad_norm": 0.21377557516098022, "learning_rate": 8.123791102514507e-05, "loss": 0.8774, "num_input_tokens_seen": 44492352, "step": 927, "train_runtime": 6451.3472, "train_tokens_per_second": 6896.599 }, { "epoch": 0.5965927354548377, "grad_norm": 0.21762780845165253, "learning_rate": 8.110896196002579e-05, "loss": 1.0206, "num_input_tokens_seen": 44523424, "step": 928, "train_runtime": 6455.7713, "train_tokens_per_second": 6896.685 }, { "epoch": 0.5972356155576984, "grad_norm": 0.22104495763778687, "learning_rate": 8.098001289490652e-05, "loss": 1.0388, "num_input_tokens_seen": 44569904, "step": 929, "train_runtime": 6462.3358, "train_tokens_per_second": 6896.872 }, { "epoch": 0.5978784956605593, "grad_norm": 0.23265767097473145, "learning_rate": 8.085106382978723e-05, "loss": 0.9364, "num_input_tokens_seen": 44644992, "step": 930, "train_runtime": 6472.904, "train_tokens_per_second": 6897.212 }, { "epoch": 0.5985213757634201, "grad_norm": 0.23737984895706177, "learning_rate": 8.072211476466796e-05, "loss": 0.9437, "num_input_tokens_seen": 44683088, "step": 931, "train_runtime": 6478.8445, "train_tokens_per_second": 6896.768 }, { "epoch": 0.599164255866281, "grad_norm": 0.23196366429328918, "learning_rate": 8.059316569954868e-05, "loss": 0.9364, "num_input_tokens_seen": 44731184, "step": 932, "train_runtime": 6485.6032, "train_tokens_per_second": 6896.997 }, { "epoch": 0.5998071359691417, "grad_norm": 0.20719966292381287, "learning_rate": 8.04642166344294e-05, "loss": 0.9187, "num_input_tokens_seen": 44782240, "step": 933, "train_runtime": 6492.7686, "train_tokens_per_second": 6897.249 }, { "epoch": 0.6004500160720025, "grad_norm": 0.2094103842973709, "learning_rate": 8.033526756931013e-05, "loss": 0.945, "num_input_tokens_seen": 44833904, "step": 934, "train_runtime": 6500.0655, "train_tokens_per_second": 6897.454 }, { "epoch": 0.6010928961748634, "grad_norm": 0.23072101175785065, "learning_rate": 8.020631850419085e-05, "loss": 0.9558, "num_input_tokens_seen": 44872496, "step": 935, "train_runtime": 6505.5009, "train_tokens_per_second": 6897.623 }, { "epoch": 0.6017357762777242, "grad_norm": 0.23481076955795288, "learning_rate": 8.007736943907156e-05, "loss": 0.9275, "num_input_tokens_seen": 44909856, "step": 936, "train_runtime": 6510.7323, "train_tokens_per_second": 6897.819 }, { "epoch": 0.6017357762777242, "eval_loss": 1.0076556205749512, "eval_runtime": 40.0319, "eval_samples_per_second": 24.83, "eval_steps_per_second": 1.574, "num_input_tokens_seen": 44909856, "step": 936 }, { "epoch": 0.6023786563805851, "grad_norm": 0.2573668360710144, "learning_rate": 7.99484203739523e-05, "loss": 0.941, "num_input_tokens_seen": 44964080, "step": 937, "train_runtime": 6558.4171, "train_tokens_per_second": 6855.935 }, { "epoch": 0.6030215364834458, "grad_norm": 0.2350708395242691, "learning_rate": 7.981947130883301e-05, "loss": 1.0511, "num_input_tokens_seen": 45013536, "step": 938, "train_runtime": 6565.4248, "train_tokens_per_second": 6856.15 }, { "epoch": 0.6036644165863067, "grad_norm": 0.22017408907413483, "learning_rate": 7.969052224371373e-05, "loss": 1.0908, "num_input_tokens_seen": 45062928, "step": 939, "train_runtime": 6572.3543, "train_tokens_per_second": 6856.436 }, { "epoch": 0.6043072966891675, "grad_norm": 0.19787846505641937, "learning_rate": 7.956157317859446e-05, "loss": 0.8993, "num_input_tokens_seen": 45108224, "step": 940, "train_runtime": 6578.7161, "train_tokens_per_second": 6856.691 }, { "epoch": 0.6049501767920283, "grad_norm": 0.21461884677410126, "learning_rate": 7.943262411347518e-05, "loss": 0.833, "num_input_tokens_seen": 45151552, "step": 941, "train_runtime": 6584.7583, "train_tokens_per_second": 6856.979 }, { "epoch": 0.6055930568948891, "grad_norm": 0.2068055421113968, "learning_rate": 7.930367504835591e-05, "loss": 1.0113, "num_input_tokens_seen": 45207248, "step": 942, "train_runtime": 6592.6019, "train_tokens_per_second": 6857.27 }, { "epoch": 0.6062359369977499, "grad_norm": 0.22537890076637268, "learning_rate": 7.917472598323663e-05, "loss": 1.0316, "num_input_tokens_seen": 45246032, "step": 943, "train_runtime": 6598.0453, "train_tokens_per_second": 6857.49 }, { "epoch": 0.6068788171006108, "grad_norm": 0.2297266274690628, "learning_rate": 7.904577691811734e-05, "loss": 0.9796, "num_input_tokens_seen": 45285568, "step": 944, "train_runtime": 6603.5907, "train_tokens_per_second": 6857.719 }, { "epoch": 0.6075216972034716, "grad_norm": 0.2185073047876358, "learning_rate": 7.891682785299807e-05, "loss": 1.025, "num_input_tokens_seen": 45349424, "step": 945, "train_runtime": 6612.5255, "train_tokens_per_second": 6858.11 }, { "epoch": 0.6081645773063323, "grad_norm": 0.20334357023239136, "learning_rate": 7.878787878787879e-05, "loss": 0.9352, "num_input_tokens_seen": 45382528, "step": 946, "train_runtime": 6617.202, "train_tokens_per_second": 6858.265 }, { "epoch": 0.6088074574091932, "grad_norm": 0.22521203756332397, "learning_rate": 7.86589297227595e-05, "loss": 0.9307, "num_input_tokens_seen": 45434592, "step": 947, "train_runtime": 6624.4965, "train_tokens_per_second": 6858.573 }, { "epoch": 0.609450337512054, "grad_norm": 0.21149739623069763, "learning_rate": 7.852998065764024e-05, "loss": 1.0105, "num_input_tokens_seen": 45490192, "step": 948, "train_runtime": 6632.1883, "train_tokens_per_second": 6859.002 }, { "epoch": 0.6100932176149149, "grad_norm": 0.21434244513511658, "learning_rate": 7.840103159252095e-05, "loss": 0.9318, "num_input_tokens_seen": 45542496, "step": 949, "train_runtime": 6639.4349, "train_tokens_per_second": 6859.393 }, { "epoch": 0.6107360977177756, "grad_norm": 0.19788849353790283, "learning_rate": 7.827208252740169e-05, "loss": 0.9998, "num_input_tokens_seen": 45587712, "step": 950, "train_runtime": 6645.7335, "train_tokens_per_second": 6859.696 }, { "epoch": 0.6113789778206364, "grad_norm": 0.24048268795013428, "learning_rate": 7.81431334622824e-05, "loss": 0.9126, "num_input_tokens_seen": 45626816, "step": 951, "train_runtime": 6651.1735, "train_tokens_per_second": 6859.965 }, { "epoch": 0.6120218579234973, "grad_norm": 0.2160108983516693, "learning_rate": 7.801418439716312e-05, "loss": 1.0111, "num_input_tokens_seen": 45672320, "step": 952, "train_runtime": 6657.4991, "train_tokens_per_second": 6860.282 }, { "epoch": 0.6126647380263581, "grad_norm": 0.2314816117286682, "learning_rate": 7.788523533204385e-05, "loss": 1.0468, "num_input_tokens_seen": 45720000, "step": 953, "train_runtime": 6664.057, "train_tokens_per_second": 6860.686 }, { "epoch": 0.6133076181292189, "grad_norm": 0.22002699971199036, "learning_rate": 7.775628626692457e-05, "loss": 1.0283, "num_input_tokens_seen": 45752288, "step": 954, "train_runtime": 6668.585, "train_tokens_per_second": 6860.869 }, { "epoch": 0.6139504982320797, "grad_norm": 0.2057672142982483, "learning_rate": 7.762733720180529e-05, "loss": 0.9906, "num_input_tokens_seen": 45787136, "step": 955, "train_runtime": 6673.4818, "train_tokens_per_second": 6861.056 }, { "epoch": 0.6145933783349405, "grad_norm": 0.22810469567775726, "learning_rate": 7.749838813668602e-05, "loss": 1.0197, "num_input_tokens_seen": 45832416, "step": 956, "train_runtime": 6679.7842, "train_tokens_per_second": 6861.362 }, { "epoch": 0.6152362584378014, "grad_norm": 0.2123366743326187, "learning_rate": 7.736943907156673e-05, "loss": 0.9164, "num_input_tokens_seen": 45872960, "step": 957, "train_runtime": 6685.4446, "train_tokens_per_second": 6861.617 }, { "epoch": 0.6158791385406621, "grad_norm": 0.19447851181030273, "learning_rate": 7.724049000644746e-05, "loss": 0.9516, "num_input_tokens_seen": 45910544, "step": 958, "train_runtime": 6690.7329, "train_tokens_per_second": 6861.811 }, { "epoch": 0.616522018643523, "grad_norm": 0.22850489616394043, "learning_rate": 7.711154094132818e-05, "loss": 1.0786, "num_input_tokens_seen": 45960944, "step": 959, "train_runtime": 6697.7183, "train_tokens_per_second": 6862.179 }, { "epoch": 0.6171648987463838, "grad_norm": 0.21646857261657715, "learning_rate": 7.69825918762089e-05, "loss": 0.9976, "num_input_tokens_seen": 46010656, "step": 960, "train_runtime": 6704.5387, "train_tokens_per_second": 6862.613 }, { "epoch": 0.6178077788492446, "grad_norm": 0.2174510955810547, "learning_rate": 7.685364281108963e-05, "loss": 0.9598, "num_input_tokens_seen": 46054448, "step": 961, "train_runtime": 6711.1106, "train_tokens_per_second": 6862.418 }, { "epoch": 0.6184506589521054, "grad_norm": 0.20922686159610748, "learning_rate": 7.672469374597034e-05, "loss": 0.8961, "num_input_tokens_seen": 46090672, "step": 962, "train_runtime": 6716.1748, "train_tokens_per_second": 6862.637 }, { "epoch": 0.6190935390549662, "grad_norm": 0.22034646570682526, "learning_rate": 7.659574468085106e-05, "loss": 1.0259, "num_input_tokens_seen": 46126704, "step": 963, "train_runtime": 6721.2076, "train_tokens_per_second": 6862.86 }, { "epoch": 0.6197364191578271, "grad_norm": 0.22129416465759277, "learning_rate": 7.64667956157318e-05, "loss": 0.9486, "num_input_tokens_seen": 46176464, "step": 964, "train_runtime": 6728.1278, "train_tokens_per_second": 6863.197 }, { "epoch": 0.6203792992606879, "grad_norm": 0.21850019693374634, "learning_rate": 7.633784655061251e-05, "loss": 0.965, "num_input_tokens_seen": 46221184, "step": 965, "train_runtime": 6734.3203, "train_tokens_per_second": 6863.526 }, { "epoch": 0.6210221793635486, "grad_norm": 0.2046729326248169, "learning_rate": 7.620889748549323e-05, "loss": 0.9319, "num_input_tokens_seen": 46265680, "step": 966, "train_runtime": 6740.5364, "train_tokens_per_second": 6863.798 }, { "epoch": 0.6216650594664095, "grad_norm": 0.21326079964637756, "learning_rate": 7.607994842037396e-05, "loss": 0.9574, "num_input_tokens_seen": 46301680, "step": 967, "train_runtime": 6745.584, "train_tokens_per_second": 6863.999 }, { "epoch": 0.6223079395692703, "grad_norm": 0.213593527674675, "learning_rate": 7.595099935525468e-05, "loss": 0.9439, "num_input_tokens_seen": 46350304, "step": 968, "train_runtime": 6752.2772, "train_tokens_per_second": 6864.396 }, { "epoch": 0.6229508196721312, "grad_norm": 0.21795116364955902, "learning_rate": 7.58220502901354e-05, "loss": 0.86, "num_input_tokens_seen": 46390528, "step": 969, "train_runtime": 6757.8381, "train_tokens_per_second": 6864.7 }, { "epoch": 0.623593699774992, "grad_norm": 0.20645615458488464, "learning_rate": 7.569310122501613e-05, "loss": 0.8959, "num_input_tokens_seen": 46450176, "step": 970, "train_runtime": 6766.119, "train_tokens_per_second": 6865.114 }, { "epoch": 0.6242365798778527, "grad_norm": 0.21638134121894836, "learning_rate": 7.556415215989683e-05, "loss": 1.0205, "num_input_tokens_seen": 46488288, "step": 971, "train_runtime": 6771.3952, "train_tokens_per_second": 6865.393 }, { "epoch": 0.6248794599807136, "grad_norm": 0.21955394744873047, "learning_rate": 7.543520309477757e-05, "loss": 0.9762, "num_input_tokens_seen": 46531296, "step": 972, "train_runtime": 6777.3266, "train_tokens_per_second": 6865.73 }, { "epoch": 0.6255223400835744, "grad_norm": 0.23245960474014282, "learning_rate": 7.530625402965828e-05, "loss": 0.917, "num_input_tokens_seen": 46565248, "step": 973, "train_runtime": 6782.116, "train_tokens_per_second": 6865.888 }, { "epoch": 0.6261652201864353, "grad_norm": 0.20442916452884674, "learning_rate": 7.5177304964539e-05, "loss": 0.8955, "num_input_tokens_seen": 46611184, "step": 974, "train_runtime": 6788.4548, "train_tokens_per_second": 6866.244 }, { "epoch": 0.626808100289296, "grad_norm": 0.22477011382579803, "learning_rate": 7.504835589941973e-05, "loss": 0.9841, "num_input_tokens_seen": 46654144, "step": 975, "train_runtime": 6794.4059, "train_tokens_per_second": 6866.552 }, { "epoch": 0.6274509803921569, "grad_norm": 0.219425231218338, "learning_rate": 7.491940683430045e-05, "loss": 1.0111, "num_input_tokens_seen": 46716160, "step": 976, "train_runtime": 6802.9733, "train_tokens_per_second": 6867.021 }, { "epoch": 0.6280938604950177, "grad_norm": 0.2272089719772339, "learning_rate": 7.479045776918117e-05, "loss": 0.9653, "num_input_tokens_seen": 46761376, "step": 977, "train_runtime": 6809.176, "train_tokens_per_second": 6867.406 }, { "epoch": 0.6287367405978785, "grad_norm": 0.2164466679096222, "learning_rate": 7.46615087040619e-05, "loss": 0.9439, "num_input_tokens_seen": 46797264, "step": 978, "train_runtime": 6814.1155, "train_tokens_per_second": 6867.695 }, { "epoch": 0.6293796207007393, "grad_norm": 0.21363511681556702, "learning_rate": 7.453255963894262e-05, "loss": 0.9783, "num_input_tokens_seen": 46834144, "step": 979, "train_runtime": 6819.2729, "train_tokens_per_second": 6867.909 }, { "epoch": 0.6300225008036001, "grad_norm": 0.2254478931427002, "learning_rate": 7.440361057382335e-05, "loss": 1.0318, "num_input_tokens_seen": 46880720, "step": 980, "train_runtime": 6825.6472, "train_tokens_per_second": 6868.319 }, { "epoch": 0.630665380906461, "grad_norm": 0.22620360553264618, "learning_rate": 7.427466150870407e-05, "loss": 0.9323, "num_input_tokens_seen": 46917472, "step": 981, "train_runtime": 6830.7439, "train_tokens_per_second": 6868.574 }, { "epoch": 0.6313082610093218, "grad_norm": 0.21192996203899384, "learning_rate": 7.414571244358479e-05, "loss": 0.8626, "num_input_tokens_seen": 46978192, "step": 982, "train_runtime": 6839.1256, "train_tokens_per_second": 6869.035 }, { "epoch": 0.6319511411121825, "grad_norm": 0.22016724944114685, "learning_rate": 7.401676337846552e-05, "loss": 0.9411, "num_input_tokens_seen": 47047760, "step": 983, "train_runtime": 6848.6862, "train_tokens_per_second": 6869.604 }, { "epoch": 0.6325940212150434, "grad_norm": 0.24845948815345764, "learning_rate": 7.388781431334622e-05, "loss": 1.0784, "num_input_tokens_seen": 47098816, "step": 984, "train_runtime": 6855.6941, "train_tokens_per_second": 6870.029 }, { "epoch": 0.6332369013179042, "grad_norm": 0.2411433309316635, "learning_rate": 7.375886524822694e-05, "loss": 0.9888, "num_input_tokens_seen": 47154208, "step": 985, "train_runtime": 6863.351, "train_tokens_per_second": 6870.435 }, { "epoch": 0.6338797814207651, "grad_norm": 0.22008250653743744, "learning_rate": 7.362991618310767e-05, "loss": 0.9903, "num_input_tokens_seen": 47198608, "step": 986, "train_runtime": 6869.4842, "train_tokens_per_second": 6870.764 }, { "epoch": 0.6345226615236258, "grad_norm": 0.23359744250774384, "learning_rate": 7.350096711798839e-05, "loss": 1.0394, "num_input_tokens_seen": 47235120, "step": 987, "train_runtime": 6874.5459, "train_tokens_per_second": 6871.017 }, { "epoch": 0.6351655416264866, "grad_norm": 0.21749937534332275, "learning_rate": 7.337201805286912e-05, "loss": 0.9307, "num_input_tokens_seen": 47277952, "step": 988, "train_runtime": 6880.4288, "train_tokens_per_second": 6871.367 }, { "epoch": 0.6358084217293475, "grad_norm": 0.23919233679771423, "learning_rate": 7.324306898774984e-05, "loss": 0.9935, "num_input_tokens_seen": 47332336, "step": 989, "train_runtime": 6887.9261, "train_tokens_per_second": 6871.783 }, { "epoch": 0.6364513018322083, "grad_norm": 0.22570660710334778, "learning_rate": 7.311411992263056e-05, "loss": 0.9237, "num_input_tokens_seen": 47368256, "step": 990, "train_runtime": 6893.0199, "train_tokens_per_second": 6871.916 }, { "epoch": 0.6370941819350691, "grad_norm": 0.23035700619220734, "learning_rate": 7.298517085751129e-05, "loss": 1.0694, "num_input_tokens_seen": 47402480, "step": 991, "train_runtime": 6898.3258, "train_tokens_per_second": 6871.592 }, { "epoch": 0.6377370620379299, "grad_norm": 0.24699033796787262, "learning_rate": 7.285622179239201e-05, "loss": 0.997, "num_input_tokens_seen": 47478224, "step": 992, "train_runtime": 6908.8665, "train_tokens_per_second": 6872.071 }, { "epoch": 0.6383799421407907, "grad_norm": 0.20100495219230652, "learning_rate": 7.272727272727273e-05, "loss": 0.8458, "num_input_tokens_seen": 47516640, "step": 993, "train_runtime": 6914.2512, "train_tokens_per_second": 6872.276 }, { "epoch": 0.6390228222436516, "grad_norm": 0.20696420967578888, "learning_rate": 7.259832366215346e-05, "loss": 0.9597, "num_input_tokens_seen": 47558624, "step": 994, "train_runtime": 6920.1393, "train_tokens_per_second": 6872.495 }, { "epoch": 0.6396657023465123, "grad_norm": 0.23742607235908508, "learning_rate": 7.246937459703418e-05, "loss": 0.9151, "num_input_tokens_seen": 47629440, "step": 995, "train_runtime": 6930.0426, "train_tokens_per_second": 6872.893 }, { "epoch": 0.6403085824493732, "grad_norm": 0.21890178322792053, "learning_rate": 7.23404255319149e-05, "loss": 0.8402, "num_input_tokens_seen": 47668032, "step": 996, "train_runtime": 6935.4916, "train_tokens_per_second": 6873.057 }, { "epoch": 0.640951462552234, "grad_norm": 0.21457263827323914, "learning_rate": 7.221147646679563e-05, "loss": 0.9283, "num_input_tokens_seen": 47727584, "step": 997, "train_runtime": 6943.8296, "train_tokens_per_second": 6873.381 }, { "epoch": 0.6415943426550949, "grad_norm": 0.24617235362529755, "learning_rate": 7.208252740167633e-05, "loss": 1.0306, "num_input_tokens_seen": 47766352, "step": 998, "train_runtime": 6949.2829, "train_tokens_per_second": 6873.566 }, { "epoch": 0.6422372227579557, "grad_norm": 0.21127833425998688, "learning_rate": 7.195357833655706e-05, "loss": 0.9085, "num_input_tokens_seen": 47815232, "step": 999, "train_runtime": 6956.0924, "train_tokens_per_second": 6873.864 }, { "epoch": 0.6428801028608164, "grad_norm": 0.22037668526172638, "learning_rate": 7.182462927143778e-05, "loss": 1.0263, "num_input_tokens_seen": 47858784, "step": 1000, "train_runtime": 6962.152, "train_tokens_per_second": 6874.137 }, { "epoch": 0.6435229829636773, "grad_norm": 0.2265874296426773, "learning_rate": 7.16956802063185e-05, "loss": 1.0295, "num_input_tokens_seen": 47933472, "step": 1001, "train_runtime": 6972.5362, "train_tokens_per_second": 6874.611 }, { "epoch": 0.6441658630665381, "grad_norm": 0.22066611051559448, "learning_rate": 7.156673114119923e-05, "loss": 0.9419, "num_input_tokens_seen": 47997584, "step": 1002, "train_runtime": 6981.3745, "train_tokens_per_second": 6875.091 }, { "epoch": 0.644808743169399, "grad_norm": 0.2365170419216156, "learning_rate": 7.143778207607995e-05, "loss": 0.8646, "num_input_tokens_seen": 48063616, "step": 1003, "train_runtime": 6990.5257, "train_tokens_per_second": 6875.537 }, { "epoch": 0.6454516232722597, "grad_norm": 0.19993442296981812, "learning_rate": 7.130883301096067e-05, "loss": 0.8968, "num_input_tokens_seen": 48127984, "step": 1004, "train_runtime": 6999.4566, "train_tokens_per_second": 6875.96 }, { "epoch": 0.6460945033751205, "grad_norm": 0.21699395775794983, "learning_rate": 7.11798839458414e-05, "loss": 0.9993, "num_input_tokens_seen": 48180272, "step": 1005, "train_runtime": 7006.6964, "train_tokens_per_second": 6876.318 }, { "epoch": 0.6467373834779814, "grad_norm": 0.2222331166267395, "learning_rate": 7.105093488072212e-05, "loss": 0.9866, "num_input_tokens_seen": 48244928, "step": 1006, "train_runtime": 7015.6856, "train_tokens_per_second": 6876.723 }, { "epoch": 0.6473802635808422, "grad_norm": 0.20489053428173065, "learning_rate": 7.092198581560284e-05, "loss": 0.8411, "num_input_tokens_seen": 48295296, "step": 1007, "train_runtime": 7022.675, "train_tokens_per_second": 6877.051 }, { "epoch": 0.648023143683703, "grad_norm": 0.2395627647638321, "learning_rate": 7.079303675048357e-05, "loss": 1.0088, "num_input_tokens_seen": 48326816, "step": 1008, "train_runtime": 7027.137, "train_tokens_per_second": 6877.17 }, { "epoch": 0.6486660237865638, "grad_norm": 0.22366495430469513, "learning_rate": 7.066408768536429e-05, "loss": 1.0026, "num_input_tokens_seen": 48363488, "step": 1009, "train_runtime": 7032.2438, "train_tokens_per_second": 6877.391 }, { "epoch": 0.6493089038894246, "grad_norm": 0.23582132160663605, "learning_rate": 7.053513862024502e-05, "loss": 0.9802, "num_input_tokens_seen": 48429872, "step": 1010, "train_runtime": 7041.4949, "train_tokens_per_second": 6877.783 }, { "epoch": 0.6499517839922855, "grad_norm": 0.23157043755054474, "learning_rate": 7.040618955512572e-05, "loss": 1.0195, "num_input_tokens_seen": 48491216, "step": 1011, "train_runtime": 7050.0327, "train_tokens_per_second": 6878.155 }, { "epoch": 0.6505946640951462, "grad_norm": 0.22757606208324432, "learning_rate": 7.027724049000644e-05, "loss": 0.9446, "num_input_tokens_seen": 48536352, "step": 1012, "train_runtime": 7056.2998, "train_tokens_per_second": 6878.442 }, { "epoch": 0.6512375441980071, "grad_norm": 0.22248154878616333, "learning_rate": 7.014829142488717e-05, "loss": 0.9717, "num_input_tokens_seen": 48578576, "step": 1013, "train_runtime": 7062.133, "train_tokens_per_second": 6878.74 }, { "epoch": 0.6518804243008679, "grad_norm": 0.23368652164936066, "learning_rate": 7.001934235976789e-05, "loss": 0.9362, "num_input_tokens_seen": 48636000, "step": 1014, "train_runtime": 7070.1159, "train_tokens_per_second": 6879.095 }, { "epoch": 0.6525233044037287, "grad_norm": 0.21449260413646698, "learning_rate": 6.989039329464861e-05, "loss": 0.901, "num_input_tokens_seen": 48669152, "step": 1015, "train_runtime": 7074.7527, "train_tokens_per_second": 6879.273 }, { "epoch": 0.6531661845065895, "grad_norm": 0.2274601012468338, "learning_rate": 6.976144422952934e-05, "loss": 0.9272, "num_input_tokens_seen": 48704112, "step": 1016, "train_runtime": 7079.616, "train_tokens_per_second": 6879.485 }, { "epoch": 0.6538090646094503, "grad_norm": 0.2232244312763214, "learning_rate": 6.963249516441006e-05, "loss": 1.0063, "num_input_tokens_seen": 48765600, "step": 1017, "train_runtime": 7088.0798, "train_tokens_per_second": 6879.945 }, { "epoch": 0.6544519447123112, "grad_norm": 0.2260793298482895, "learning_rate": 6.950354609929079e-05, "loss": 0.8803, "num_input_tokens_seen": 48806128, "step": 1018, "train_runtime": 7093.6664, "train_tokens_per_second": 6880.24 }, { "epoch": 0.655094824815172, "grad_norm": 0.23438192903995514, "learning_rate": 6.937459703417151e-05, "loss": 1.0313, "num_input_tokens_seen": 48849328, "step": 1019, "train_runtime": 7099.6643, "train_tokens_per_second": 6880.512 }, { "epoch": 0.6557377049180327, "grad_norm": 0.23910987377166748, "learning_rate": 6.924564796905223e-05, "loss": 0.9334, "num_input_tokens_seen": 48891040, "step": 1020, "train_runtime": 7105.4233, "train_tokens_per_second": 6880.806 }, { "epoch": 0.6563805850208936, "grad_norm": 0.2428818792104721, "learning_rate": 6.911669890393296e-05, "loss": 1.0331, "num_input_tokens_seen": 48953104, "step": 1021, "train_runtime": 7114.4728, "train_tokens_per_second": 6880.777 }, { "epoch": 0.6570234651237544, "grad_norm": 0.24574337899684906, "learning_rate": 6.898774983881368e-05, "loss": 1.0121, "num_input_tokens_seen": 48992464, "step": 1022, "train_runtime": 7119.9009, "train_tokens_per_second": 6881.06 }, { "epoch": 0.6576663452266153, "grad_norm": 0.24428240954875946, "learning_rate": 6.88588007736944e-05, "loss": 1.0972, "num_input_tokens_seen": 49039008, "step": 1023, "train_runtime": 7126.2761, "train_tokens_per_second": 6881.435 }, { "epoch": 0.658309225329476, "grad_norm": 0.2183476835489273, "learning_rate": 6.872985170857513e-05, "loss": 0.9851, "num_input_tokens_seen": 49085344, "step": 1024, "train_runtime": 7132.642, "train_tokens_per_second": 6881.79 }, { "epoch": 0.6589521054323368, "grad_norm": 0.24681338667869568, "learning_rate": 6.860090264345583e-05, "loss": 0.9841, "num_input_tokens_seen": 49150688, "step": 1025, "train_runtime": 7141.7025, "train_tokens_per_second": 6882.209 }, { "epoch": 0.6595949855351977, "grad_norm": 0.21444672346115112, "learning_rate": 6.847195357833656e-05, "loss": 0.9491, "num_input_tokens_seen": 49191440, "step": 1026, "train_runtime": 7147.3276, "train_tokens_per_second": 6882.494 }, { "epoch": 0.6602378656380585, "grad_norm": 0.21985282003879547, "learning_rate": 6.834300451321728e-05, "loss": 0.9602, "num_input_tokens_seen": 49248928, "step": 1027, "train_runtime": 7155.1844, "train_tokens_per_second": 6882.971 }, { "epoch": 0.6608807457409194, "grad_norm": 0.24706678092479706, "learning_rate": 6.8214055448098e-05, "loss": 1.0032, "num_input_tokens_seen": 49306448, "step": 1028, "train_runtime": 7163.1356, "train_tokens_per_second": 6883.361 }, { "epoch": 0.6615236258437801, "grad_norm": 0.22101391851902008, "learning_rate": 6.808510638297873e-05, "loss": 1.0164, "num_input_tokens_seen": 49353728, "step": 1029, "train_runtime": 7169.5972, "train_tokens_per_second": 6883.752 }, { "epoch": 0.662166505946641, "grad_norm": 0.21555444598197937, "learning_rate": 6.795615731785945e-05, "loss": 0.8685, "num_input_tokens_seen": 49414256, "step": 1030, "train_runtime": 7177.9909, "train_tokens_per_second": 6884.135 }, { "epoch": 0.6628093860495018, "grad_norm": 0.23320741951465607, "learning_rate": 6.782720825274017e-05, "loss": 1.0389, "num_input_tokens_seen": 49487152, "step": 1031, "train_runtime": 7188.0883, "train_tokens_per_second": 6884.605 }, { "epoch": 0.6634522661523626, "grad_norm": 0.23155942559242249, "learning_rate": 6.76982591876209e-05, "loss": 0.9408, "num_input_tokens_seen": 49526848, "step": 1032, "train_runtime": 7193.6458, "train_tokens_per_second": 6884.805 }, { "epoch": 0.6640951462552234, "grad_norm": 0.2161242812871933, "learning_rate": 6.756931012250162e-05, "loss": 0.9456, "num_input_tokens_seen": 49585168, "step": 1033, "train_runtime": 7201.6963, "train_tokens_per_second": 6885.207 }, { "epoch": 0.6647380263580842, "grad_norm": 0.20924127101898193, "learning_rate": 6.744036105738233e-05, "loss": 0.9401, "num_input_tokens_seen": 49632320, "step": 1034, "train_runtime": 7208.1656, "train_tokens_per_second": 6885.569 }, { "epoch": 0.665380906460945, "grad_norm": 0.21134765446186066, "learning_rate": 6.731141199226307e-05, "loss": 1.0104, "num_input_tokens_seen": 49682064, "step": 1035, "train_runtime": 7215.068, "train_tokens_per_second": 6885.876 }, { "epoch": 0.6660237865638059, "grad_norm": 0.21447201073169708, "learning_rate": 6.718246292714378e-05, "loss": 0.9398, "num_input_tokens_seen": 49729392, "step": 1036, "train_runtime": 7221.566, "train_tokens_per_second": 6886.234 }, { "epoch": 0.6666666666666666, "grad_norm": 0.22306424379348755, "learning_rate": 6.70535138620245e-05, "loss": 0.9365, "num_input_tokens_seen": 49793296, "step": 1037, "train_runtime": 7230.3142, "train_tokens_per_second": 6886.74 }, { "epoch": 0.6673095467695275, "grad_norm": 0.2094729244709015, "learning_rate": 6.692456479690522e-05, "loss": 0.992, "num_input_tokens_seen": 49836256, "step": 1038, "train_runtime": 7236.29, "train_tokens_per_second": 6886.99 }, { "epoch": 0.6679524268723883, "grad_norm": 0.21107782423496246, "learning_rate": 6.679561573178594e-05, "loss": 0.9429, "num_input_tokens_seen": 49899120, "step": 1039, "train_runtime": 7244.9437, "train_tokens_per_second": 6887.441 }, { "epoch": 0.6685953069752492, "grad_norm": 0.2193991243839264, "learning_rate": 6.666666666666667e-05, "loss": 0.875, "num_input_tokens_seen": 49970224, "step": 1040, "train_runtime": 7254.7327, "train_tokens_per_second": 6887.948 }, { "epoch": 0.6692381870781099, "grad_norm": 0.20523865520954132, "learning_rate": 6.653771760154739e-05, "loss": 0.9484, "num_input_tokens_seen": 50030208, "step": 1041, "train_runtime": 7263.034, "train_tokens_per_second": 6888.335 }, { "epoch": 0.6698810671809707, "grad_norm": 0.242182657122612, "learning_rate": 6.64087685364281e-05, "loss": 0.9938, "num_input_tokens_seen": 50109888, "step": 1042, "train_runtime": 7274.1431, "train_tokens_per_second": 6888.769 }, { "epoch": 0.6705239472838316, "grad_norm": 0.21813493967056274, "learning_rate": 6.627981947130884e-05, "loss": 1.0141, "num_input_tokens_seen": 50173184, "step": 1043, "train_runtime": 7282.8986, "train_tokens_per_second": 6889.178 }, { "epoch": 0.6711668273866924, "grad_norm": 0.2105100452899933, "learning_rate": 6.615087040618956e-05, "loss": 0.8706, "num_input_tokens_seen": 50229232, "step": 1044, "train_runtime": 7290.7196, "train_tokens_per_second": 6889.475 }, { "epoch": 0.6718097074895532, "grad_norm": 0.21437270939350128, "learning_rate": 6.602192134107029e-05, "loss": 1.0573, "num_input_tokens_seen": 50277392, "step": 1045, "train_runtime": 7297.3971, "train_tokens_per_second": 6889.771 }, { "epoch": 0.672452587592414, "grad_norm": 0.24188022315502167, "learning_rate": 6.5892972275951e-05, "loss": 0.984, "num_input_tokens_seen": 50334688, "step": 1046, "train_runtime": 7305.3843, "train_tokens_per_second": 6890.081 }, { "epoch": 0.6730954676952748, "grad_norm": 0.2214278280735016, "learning_rate": 6.576402321083172e-05, "loss": 0.9764, "num_input_tokens_seen": 50380240, "step": 1047, "train_runtime": 7311.6909, "train_tokens_per_second": 6890.368 }, { "epoch": 0.6737383477981357, "grad_norm": 0.20579014718532562, "learning_rate": 6.563507414571246e-05, "loss": 1.1293, "num_input_tokens_seen": 50424352, "step": 1048, "train_runtime": 7317.8961, "train_tokens_per_second": 6890.553 }, { "epoch": 0.6743812279009964, "grad_norm": 0.21741363406181335, "learning_rate": 6.550612508059317e-05, "loss": 0.9443, "num_input_tokens_seen": 50467216, "step": 1049, "train_runtime": 7323.8851, "train_tokens_per_second": 6890.771 }, { "epoch": 0.6750241080038573, "grad_norm": 0.2026466727256775, "learning_rate": 6.537717601547389e-05, "loss": 0.854, "num_input_tokens_seen": 50501040, "step": 1050, "train_runtime": 7328.7043, "train_tokens_per_second": 6890.855 }, { "epoch": 0.6756669881067181, "grad_norm": 0.18450354039669037, "learning_rate": 6.524822695035462e-05, "loss": 0.8429, "num_input_tokens_seen": 50542768, "step": 1051, "train_runtime": 7335.0852, "train_tokens_per_second": 6890.55 }, { "epoch": 0.676309868209579, "grad_norm": 0.2224583476781845, "learning_rate": 6.511927788523533e-05, "loss": 0.9466, "num_input_tokens_seen": 50632528, "step": 1052, "train_runtime": 7347.6703, "train_tokens_per_second": 6890.963 }, { "epoch": 0.6769527483124397, "grad_norm": 0.20810087025165558, "learning_rate": 6.499032882011606e-05, "loss": 0.875, "num_input_tokens_seen": 50685568, "step": 1053, "train_runtime": 7355.0956, "train_tokens_per_second": 6891.218 }, { "epoch": 0.6775956284153005, "grad_norm": 0.2427845001220703, "learning_rate": 6.486137975499678e-05, "loss": 1.0109, "num_input_tokens_seen": 50744800, "step": 1054, "train_runtime": 7363.4158, "train_tokens_per_second": 6891.476 }, { "epoch": 0.6782385085181614, "grad_norm": 0.2223530411720276, "learning_rate": 6.47324306898775e-05, "loss": 0.7355, "num_input_tokens_seen": 50788688, "step": 1055, "train_runtime": 7369.5565, "train_tokens_per_second": 6891.689 }, { "epoch": 0.6788813886210222, "grad_norm": 0.2333330661058426, "learning_rate": 6.460348162475823e-05, "loss": 0.9833, "num_input_tokens_seen": 50832736, "step": 1056, "train_runtime": 7375.7831, "train_tokens_per_second": 6891.843 }, { "epoch": 0.6795242687238829, "grad_norm": 0.21342216432094574, "learning_rate": 6.447453255963895e-05, "loss": 0.8388, "num_input_tokens_seen": 50879456, "step": 1057, "train_runtime": 7382.3467, "train_tokens_per_second": 6892.044 }, { "epoch": 0.6801671488267438, "grad_norm": 0.2341690957546234, "learning_rate": 6.434558349451966e-05, "loss": 0.9347, "num_input_tokens_seen": 50934720, "step": 1058, "train_runtime": 7390.0582, "train_tokens_per_second": 6892.33 }, { "epoch": 0.6808100289296046, "grad_norm": 0.2247081845998764, "learning_rate": 6.42166344294004e-05, "loss": 0.8637, "num_input_tokens_seen": 50990400, "step": 1059, "train_runtime": 7397.8508, "train_tokens_per_second": 6892.596 }, { "epoch": 0.6814529090324655, "grad_norm": 0.23331518471240997, "learning_rate": 6.408768536428111e-05, "loss": 1.1459, "num_input_tokens_seen": 51031360, "step": 1060, "train_runtime": 7403.6192, "train_tokens_per_second": 6892.759 }, { "epoch": 0.6820957891353263, "grad_norm": 0.2078360766172409, "learning_rate": 6.395873629916183e-05, "loss": 0.8934, "num_input_tokens_seen": 51068048, "step": 1061, "train_runtime": 7408.8002, "train_tokens_per_second": 6892.89 }, { "epoch": 0.682738669238187, "grad_norm": 0.24373888969421387, "learning_rate": 6.382978723404256e-05, "loss": 0.9581, "num_input_tokens_seen": 51104944, "step": 1062, "train_runtime": 7414.0038, "train_tokens_per_second": 6893.029 }, { "epoch": 0.6833815493410479, "grad_norm": 0.2216201275587082, "learning_rate": 6.370083816892328e-05, "loss": 1.0246, "num_input_tokens_seen": 51153904, "step": 1063, "train_runtime": 7420.8674, "train_tokens_per_second": 6893.251 }, { "epoch": 0.6840244294439087, "grad_norm": 0.25028952956199646, "learning_rate": 6.3571889103804e-05, "loss": 1.2053, "num_input_tokens_seen": 51212272, "step": 1064, "train_runtime": 7429.1124, "train_tokens_per_second": 6893.458 }, { "epoch": 0.6846673095467696, "grad_norm": 0.1991652399301529, "learning_rate": 6.344294003868472e-05, "loss": 0.8922, "num_input_tokens_seen": 51249952, "step": 1065, "train_runtime": 7434.4247, "train_tokens_per_second": 6893.6 }, { "epoch": 0.6853101896496303, "grad_norm": 0.22701826691627502, "learning_rate": 6.331399097356544e-05, "loss": 0.9936, "num_input_tokens_seen": 51302224, "step": 1066, "train_runtime": 7441.7003, "train_tokens_per_second": 6893.885 }, { "epoch": 0.6859530697524912, "grad_norm": 0.21672441065311432, "learning_rate": 6.318504190844617e-05, "loss": 1.0611, "num_input_tokens_seen": 51367808, "step": 1067, "train_runtime": 7450.9283, "train_tokens_per_second": 6894.149 }, { "epoch": 0.686595949855352, "grad_norm": 0.22594638168811798, "learning_rate": 6.305609284332689e-05, "loss": 0.93, "num_input_tokens_seen": 51436192, "step": 1068, "train_runtime": 7460.4525, "train_tokens_per_second": 6894.514 }, { "epoch": 0.6872388299582128, "grad_norm": 0.22045005857944489, "learning_rate": 6.29271437782076e-05, "loss": 0.9998, "num_input_tokens_seen": 51487824, "step": 1069, "train_runtime": 7467.708, "train_tokens_per_second": 6894.729 }, { "epoch": 0.6878817100610736, "grad_norm": 0.2007933109998703, "learning_rate": 6.279819471308834e-05, "loss": 0.959, "num_input_tokens_seen": 51533248, "step": 1070, "train_runtime": 7474.0741, "train_tokens_per_second": 6894.934 }, { "epoch": 0.6885245901639344, "grad_norm": 0.2333477884531021, "learning_rate": 6.266924564796905e-05, "loss": 1.0436, "num_input_tokens_seen": 51590096, "step": 1071, "train_runtime": 7482.0555, "train_tokens_per_second": 6895.177 }, { "epoch": 0.6891674702667953, "grad_norm": 0.2452705204486847, "learning_rate": 6.254029658284977e-05, "loss": 1.1345, "num_input_tokens_seen": 51660640, "step": 1072, "train_runtime": 7491.8973, "train_tokens_per_second": 6895.535 }, { "epoch": 0.6898103503696561, "grad_norm": 0.2273714393377304, "learning_rate": 6.24113475177305e-05, "loss": 0.9046, "num_input_tokens_seen": 51722848, "step": 1073, "train_runtime": 7500.6012, "train_tokens_per_second": 6895.827 }, { "epoch": 0.6904532304725168, "grad_norm": 0.22089748084545135, "learning_rate": 6.228239845261122e-05, "loss": 0.9745, "num_input_tokens_seen": 51760048, "step": 1074, "train_runtime": 7505.8386, "train_tokens_per_second": 6895.971 }, { "epoch": 0.6910961105753777, "grad_norm": 0.20138859748840332, "learning_rate": 6.215344938749195e-05, "loss": 0.8623, "num_input_tokens_seen": 51805552, "step": 1075, "train_runtime": 7512.2247, "train_tokens_per_second": 6896.166 }, { "epoch": 0.6917389906782385, "grad_norm": 0.20670074224472046, "learning_rate": 6.202450032237267e-05, "loss": 0.9809, "num_input_tokens_seen": 51870080, "step": 1076, "train_runtime": 7521.3065, "train_tokens_per_second": 6896.419 }, { "epoch": 0.6923818707810994, "grad_norm": 0.22219733893871307, "learning_rate": 6.189555125725339e-05, "loss": 0.9614, "num_input_tokens_seen": 51916400, "step": 1077, "train_runtime": 7527.8271, "train_tokens_per_second": 6896.598 }, { "epoch": 0.6930247508839601, "grad_norm": 0.2168516218662262, "learning_rate": 6.176660219213412e-05, "loss": 0.9194, "num_input_tokens_seen": 51950992, "step": 1078, "train_runtime": 7532.7731, "train_tokens_per_second": 6896.662 }, { "epoch": 0.6936676309868209, "grad_norm": 0.2015160173177719, "learning_rate": 6.163765312701483e-05, "loss": 0.891, "num_input_tokens_seen": 51983408, "step": 1079, "train_runtime": 7537.4038, "train_tokens_per_second": 6896.726 }, { "epoch": 0.6943105110896818, "grad_norm": 0.21054089069366455, "learning_rate": 6.150870406189554e-05, "loss": 0.9726, "num_input_tokens_seen": 52063120, "step": 1080, "train_runtime": 7548.7363, "train_tokens_per_second": 6896.932 }, { "epoch": 0.6949533911925426, "grad_norm": 0.2329845428466797, "learning_rate": 6.137975499677628e-05, "loss": 1.0234, "num_input_tokens_seen": 52108432, "step": 1081, "train_runtime": 7555.6633, "train_tokens_per_second": 6896.606 }, { "epoch": 0.6955962712954034, "grad_norm": 0.24675798416137695, "learning_rate": 6.1250805931657e-05, "loss": 1.0005, "num_input_tokens_seen": 52164368, "step": 1082, "train_runtime": 7563.4869, "train_tokens_per_second": 6896.868 }, { "epoch": 0.6962391513982642, "grad_norm": 0.21558962762355804, "learning_rate": 6.112185686653773e-05, "loss": 0.961, "num_input_tokens_seen": 52213952, "step": 1083, "train_runtime": 7570.4103, "train_tokens_per_second": 6897.11 }, { "epoch": 0.696882031501125, "grad_norm": 0.21725592017173767, "learning_rate": 6.0992907801418444e-05, "loss": 0.9962, "num_input_tokens_seen": 52275392, "step": 1084, "train_runtime": 7578.9986, "train_tokens_per_second": 6897.401 }, { "epoch": 0.6975249116039859, "grad_norm": 0.20202240347862244, "learning_rate": 6.086395873629916e-05, "loss": 0.8846, "num_input_tokens_seen": 52326960, "step": 1085, "train_runtime": 7586.2257, "train_tokens_per_second": 6897.628 }, { "epoch": 0.6981677917068466, "grad_norm": 0.24250298738479614, "learning_rate": 6.0735009671179887e-05, "loss": 0.9109, "num_input_tokens_seen": 52357504, "step": 1086, "train_runtime": 7590.5452, "train_tokens_per_second": 6897.726 }, { "epoch": 0.6988106718097075, "grad_norm": 0.21728849411010742, "learning_rate": 6.060606060606061e-05, "loss": 0.9872, "num_input_tokens_seen": 52401488, "step": 1087, "train_runtime": 7596.6765, "train_tokens_per_second": 6897.949 }, { "epoch": 0.6994535519125683, "grad_norm": 0.20992811024188995, "learning_rate": 6.0477111540941336e-05, "loss": 0.9504, "num_input_tokens_seen": 52467152, "step": 1088, "train_runtime": 7605.7442, "train_tokens_per_second": 6898.359 }, { "epoch": 0.7000964320154291, "grad_norm": 0.20924942195415497, "learning_rate": 6.0348162475822054e-05, "loss": 1.0382, "num_input_tokens_seen": 52521776, "step": 1089, "train_runtime": 7613.3461, "train_tokens_per_second": 6898.645 }, { "epoch": 0.70073931211829, "grad_norm": 0.23880977928638458, "learning_rate": 6.021921341070278e-05, "loss": 1.0625, "num_input_tokens_seen": 52560640, "step": 1090, "train_runtime": 7618.7656, "train_tokens_per_second": 6898.839 }, { "epoch": 0.7013821922211507, "grad_norm": 0.22585086524486542, "learning_rate": 6.0090264345583504e-05, "loss": 0.9023, "num_input_tokens_seen": 52595664, "step": 1091, "train_runtime": 7623.6886, "train_tokens_per_second": 6898.979 }, { "epoch": 0.7020250723240116, "grad_norm": 0.2203749567270279, "learning_rate": 5.9961315280464216e-05, "loss": 0.9401, "num_input_tokens_seen": 52628416, "step": 1092, "train_runtime": 7628.3522, "train_tokens_per_second": 6899.054 }, { "epoch": 0.7020250723240116, "eval_loss": 1.002116084098816, "eval_runtime": 39.9717, "eval_samples_per_second": 24.868, "eval_steps_per_second": 1.576, "num_input_tokens_seen": 52628416, "step": 1092 }, { "epoch": 0.7026679524268724, "grad_norm": 0.20180866122245789, "learning_rate": 5.983236621534494e-05, "loss": 0.8595, "num_input_tokens_seen": 52685664, "step": 1093, "train_runtime": 7676.3331, "train_tokens_per_second": 6863.39 }, { "epoch": 0.7033108325297333, "grad_norm": 0.21487735211849213, "learning_rate": 5.970341715022566e-05, "loss": 0.9204, "num_input_tokens_seen": 52728496, "step": 1094, "train_runtime": 7682.3441, "train_tokens_per_second": 6863.595 }, { "epoch": 0.703953712632594, "grad_norm": 0.21911489963531494, "learning_rate": 5.9574468085106384e-05, "loss": 0.8805, "num_input_tokens_seen": 52793232, "step": 1095, "train_runtime": 7691.3798, "train_tokens_per_second": 6863.948 }, { "epoch": 0.7045965927354548, "grad_norm": 0.21352975070476532, "learning_rate": 5.944551901998711e-05, "loss": 0.9869, "num_input_tokens_seen": 52845856, "step": 1096, "train_runtime": 7698.7181, "train_tokens_per_second": 6864.241 }, { "epoch": 0.7052394728383157, "grad_norm": 0.22658900916576385, "learning_rate": 5.9316569954867827e-05, "loss": 0.8745, "num_input_tokens_seen": 52907328, "step": 1097, "train_runtime": 7707.3226, "train_tokens_per_second": 6864.553 }, { "epoch": 0.7058823529411765, "grad_norm": 0.21794851124286652, "learning_rate": 5.918762088974855e-05, "loss": 0.9739, "num_input_tokens_seen": 52945344, "step": 1098, "train_runtime": 7712.6946, "train_tokens_per_second": 6864.701 }, { "epoch": 0.7065252330440372, "grad_norm": 0.22467251121997833, "learning_rate": 5.9058671824629276e-05, "loss": 0.9488, "num_input_tokens_seen": 52998032, "step": 1099, "train_runtime": 7720.1682, "train_tokens_per_second": 6864.881 }, { "epoch": 0.7071681131468981, "grad_norm": 0.23567631840705872, "learning_rate": 5.8929722759509994e-05, "loss": 1.0229, "num_input_tokens_seen": 53048416, "step": 1100, "train_runtime": 7727.1563, "train_tokens_per_second": 6865.193 }, { "epoch": 0.7078109932497589, "grad_norm": 0.22417950630187988, "learning_rate": 5.880077369439072e-05, "loss": 0.8845, "num_input_tokens_seen": 53087632, "step": 1101, "train_runtime": 7732.6797, "train_tokens_per_second": 6865.36 }, { "epoch": 0.7084538733526198, "grad_norm": 0.23154444992542267, "learning_rate": 5.8671824629271444e-05, "loss": 0.9673, "num_input_tokens_seen": 53131856, "step": 1102, "train_runtime": 7738.8958, "train_tokens_per_second": 6865.56 }, { "epoch": 0.7090967534554805, "grad_norm": 0.22846034169197083, "learning_rate": 5.854287556415217e-05, "loss": 0.9304, "num_input_tokens_seen": 53194192, "step": 1103, "train_runtime": 7747.5318, "train_tokens_per_second": 6865.953 }, { "epoch": 0.7097396335583414, "grad_norm": 0.22535398602485657, "learning_rate": 5.841392649903289e-05, "loss": 0.9926, "num_input_tokens_seen": 53237296, "step": 1104, "train_runtime": 7753.5662, "train_tokens_per_second": 6866.169 }, { "epoch": 0.7103825136612022, "grad_norm": 0.21644599735736847, "learning_rate": 5.828497743391361e-05, "loss": 0.8929, "num_input_tokens_seen": 53293872, "step": 1105, "train_runtime": 7761.4556, "train_tokens_per_second": 6866.479 }, { "epoch": 0.711025393764063, "grad_norm": 0.2133343517780304, "learning_rate": 5.8156028368794324e-05, "loss": 1.0127, "num_input_tokens_seen": 53336256, "step": 1106, "train_runtime": 7767.4386, "train_tokens_per_second": 6866.647 }, { "epoch": 0.7116682738669238, "grad_norm": 0.21515777707099915, "learning_rate": 5.802707930367505e-05, "loss": 1.0408, "num_input_tokens_seen": 53374128, "step": 1107, "train_runtime": 7772.794, "train_tokens_per_second": 6866.788 }, { "epoch": 0.7123111539697846, "grad_norm": 0.223897784948349, "learning_rate": 5.789813023855577e-05, "loss": 1.0293, "num_input_tokens_seen": 53418320, "step": 1108, "train_runtime": 7779.0117, "train_tokens_per_second": 6866.98 }, { "epoch": 0.7129540340726455, "grad_norm": 0.23518460988998413, "learning_rate": 5.776918117343649e-05, "loss": 0.9154, "num_input_tokens_seen": 53474272, "step": 1109, "train_runtime": 7786.7968, "train_tokens_per_second": 6867.3 }, { "epoch": 0.7135969141755063, "grad_norm": 0.24510706961154938, "learning_rate": 5.7640232108317216e-05, "loss": 0.9749, "num_input_tokens_seen": 53510944, "step": 1110, "train_runtime": 7791.917, "train_tokens_per_second": 6867.494 }, { "epoch": 0.714239794278367, "grad_norm": 0.22904647886753082, "learning_rate": 5.751128304319794e-05, "loss": 0.9732, "num_input_tokens_seen": 53566928, "step": 1111, "train_runtime": 7800.2156, "train_tokens_per_second": 6867.365 }, { "epoch": 0.7148826743812279, "grad_norm": 0.24273896217346191, "learning_rate": 5.738233397807866e-05, "loss": 0.9793, "num_input_tokens_seen": 53626144, "step": 1112, "train_runtime": 7808.4556, "train_tokens_per_second": 6867.702 }, { "epoch": 0.7155255544840887, "grad_norm": 0.23252332210540771, "learning_rate": 5.7253384912959384e-05, "loss": 0.9698, "num_input_tokens_seen": 53662896, "step": 1113, "train_runtime": 7813.5812, "train_tokens_per_second": 6867.9 }, { "epoch": 0.7161684345869496, "grad_norm": 0.21385739743709564, "learning_rate": 5.712443584784011e-05, "loss": 0.9627, "num_input_tokens_seen": 53702752, "step": 1114, "train_runtime": 7819.1534, "train_tokens_per_second": 6868.103 }, { "epoch": 0.7168113146898103, "grad_norm": 0.22277802228927612, "learning_rate": 5.699548678272083e-05, "loss": 0.9046, "num_input_tokens_seen": 53753744, "step": 1115, "train_runtime": 7826.2367, "train_tokens_per_second": 6868.403 }, { "epoch": 0.7174541947926711, "grad_norm": 0.24389879405498505, "learning_rate": 5.686653771760155e-05, "loss": 0.9821, "num_input_tokens_seen": 53797728, "step": 1116, "train_runtime": 7832.3144, "train_tokens_per_second": 6868.689 }, { "epoch": 0.718097074895532, "grad_norm": 0.22600604593753815, "learning_rate": 5.673758865248228e-05, "loss": 0.9745, "num_input_tokens_seen": 53832608, "step": 1117, "train_runtime": 7837.1799, "train_tokens_per_second": 6868.875 }, { "epoch": 0.7187399549983928, "grad_norm": 0.22461646795272827, "learning_rate": 5.6608639587363e-05, "loss": 0.966, "num_input_tokens_seen": 53870880, "step": 1118, "train_runtime": 7842.5366, "train_tokens_per_second": 6869.063 }, { "epoch": 0.7193828351012537, "grad_norm": 0.2225736677646637, "learning_rate": 5.647969052224371e-05, "loss": 0.9372, "num_input_tokens_seen": 53912432, "step": 1119, "train_runtime": 7848.3282, "train_tokens_per_second": 6869.289 }, { "epoch": 0.7200257152041144, "grad_norm": 0.20642247796058655, "learning_rate": 5.635074145712443e-05, "loss": 0.9846, "num_input_tokens_seen": 53955376, "step": 1120, "train_runtime": 7854.2753, "train_tokens_per_second": 6869.555 }, { "epoch": 0.7206685953069752, "grad_norm": 0.20037145912647247, "learning_rate": 5.6221792392005156e-05, "loss": 0.9248, "num_input_tokens_seen": 54010848, "step": 1121, "train_runtime": 7861.9353, "train_tokens_per_second": 6869.918 }, { "epoch": 0.7213114754098361, "grad_norm": 0.21794676780700684, "learning_rate": 5.609284332688588e-05, "loss": 0.8596, "num_input_tokens_seen": 54044656, "step": 1122, "train_runtime": 7866.6604, "train_tokens_per_second": 6870.089 }, { "epoch": 0.7219543555126969, "grad_norm": 0.23393063247203827, "learning_rate": 5.5963894261766606e-05, "loss": 1.0028, "num_input_tokens_seen": 54100128, "step": 1123, "train_runtime": 7874.2817, "train_tokens_per_second": 6870.484 }, { "epoch": 0.7225972356155577, "grad_norm": 0.22931329905986786, "learning_rate": 5.5834945196647324e-05, "loss": 1.0313, "num_input_tokens_seen": 54153344, "step": 1124, "train_runtime": 7881.6167, "train_tokens_per_second": 6870.842 }, { "epoch": 0.7232401157184185, "grad_norm": 0.22053447365760803, "learning_rate": 5.570599613152805e-05, "loss": 0.861, "num_input_tokens_seen": 54222704, "step": 1125, "train_runtime": 7891.1353, "train_tokens_per_second": 6871.344 }, { "epoch": 0.7238829958212794, "grad_norm": 0.22127224504947662, "learning_rate": 5.5577047066408774e-05, "loss": 0.8733, "num_input_tokens_seen": 54263936, "step": 1126, "train_runtime": 7896.8263, "train_tokens_per_second": 6871.613 }, { "epoch": 0.7245258759241402, "grad_norm": 0.20868195593357086, "learning_rate": 5.544809800128949e-05, "loss": 1.0278, "num_input_tokens_seen": 54308544, "step": 1127, "train_runtime": 7903.0171, "train_tokens_per_second": 6871.875 }, { "epoch": 0.7251687560270009, "grad_norm": 0.2393093705177307, "learning_rate": 5.531914893617022e-05, "loss": 1.0157, "num_input_tokens_seen": 54355248, "step": 1128, "train_runtime": 7909.4817, "train_tokens_per_second": 6872.163 }, { "epoch": 0.7258116361298618, "grad_norm": 0.24080771207809448, "learning_rate": 5.519019987105094e-05, "loss": 0.948, "num_input_tokens_seen": 54398944, "step": 1129, "train_runtime": 7915.4679, "train_tokens_per_second": 6872.486 }, { "epoch": 0.7264545162327226, "grad_norm": 0.22321158647537231, "learning_rate": 5.506125080593166e-05, "loss": 0.9862, "num_input_tokens_seen": 54439088, "step": 1130, "train_runtime": 7921.003, "train_tokens_per_second": 6872.752 }, { "epoch": 0.7270973963355835, "grad_norm": 0.2523844838142395, "learning_rate": 5.4932301740812385e-05, "loss": 0.9001, "num_input_tokens_seen": 54505696, "step": 1131, "train_runtime": 7930.1312, "train_tokens_per_second": 6873.24 }, { "epoch": 0.7277402764384442, "grad_norm": 0.22878628969192505, "learning_rate": 5.480335267569311e-05, "loss": 0.9857, "num_input_tokens_seen": 54556000, "step": 1132, "train_runtime": 7937.1096, "train_tokens_per_second": 6873.535 }, { "epoch": 0.728383156541305, "grad_norm": 0.2232838124036789, "learning_rate": 5.467440361057382e-05, "loss": 0.943, "num_input_tokens_seen": 54593344, "step": 1133, "train_runtime": 7942.2821, "train_tokens_per_second": 6873.76 }, { "epoch": 0.7290260366441659, "grad_norm": 0.23237422108650208, "learning_rate": 5.4545454545454546e-05, "loss": 1.0123, "num_input_tokens_seen": 54646032, "step": 1134, "train_runtime": 7949.4332, "train_tokens_per_second": 6874.205 }, { "epoch": 0.7296689167470267, "grad_norm": 0.21997365355491638, "learning_rate": 5.4416505480335264e-05, "loss": 0.8986, "num_input_tokens_seen": 54695088, "step": 1135, "train_runtime": 7956.23, "train_tokens_per_second": 6874.498 }, { "epoch": 0.7303117968498875, "grad_norm": 0.23271259665489197, "learning_rate": 5.428755641521599e-05, "loss": 0.8801, "num_input_tokens_seen": 54752464, "step": 1136, "train_runtime": 7964.1444, "train_tokens_per_second": 6874.871 }, { "epoch": 0.7309546769527483, "grad_norm": 0.24548843502998352, "learning_rate": 5.4158607350096714e-05, "loss": 0.9257, "num_input_tokens_seen": 54792336, "step": 1137, "train_runtime": 7969.6902, "train_tokens_per_second": 6875.09 }, { "epoch": 0.7315975570556091, "grad_norm": 0.2421896904706955, "learning_rate": 5.402965828497744e-05, "loss": 1.0737, "num_input_tokens_seen": 54834752, "step": 1138, "train_runtime": 7975.5384, "train_tokens_per_second": 6875.367 }, { "epoch": 0.73224043715847, "grad_norm": 0.23351521790027618, "learning_rate": 5.390070921985816e-05, "loss": 0.9608, "num_input_tokens_seen": 54886640, "step": 1139, "train_runtime": 7982.717, "train_tokens_per_second": 6875.684 }, { "epoch": 0.7328833172613307, "grad_norm": 0.23344506323337555, "learning_rate": 5.377176015473888e-05, "loss": 0.9816, "num_input_tokens_seen": 54954016, "step": 1140, "train_runtime": 7991.9968, "train_tokens_per_second": 6876.131 }, { "epoch": 0.7335261973641916, "grad_norm": 0.23483243584632874, "learning_rate": 5.364281108961961e-05, "loss": 1.0239, "num_input_tokens_seen": 55011264, "step": 1141, "train_runtime": 8000.4982, "train_tokens_per_second": 6875.98 }, { "epoch": 0.7341690774670524, "grad_norm": 0.2115328162908554, "learning_rate": 5.3513862024500325e-05, "loss": 0.9455, "num_input_tokens_seen": 55064576, "step": 1142, "train_runtime": 8007.8404, "train_tokens_per_second": 6876.333 }, { "epoch": 0.7348119575699132, "grad_norm": 0.23102976381778717, "learning_rate": 5.338491295938105e-05, "loss": 1.0438, "num_input_tokens_seen": 55113792, "step": 1143, "train_runtime": 8014.6035, "train_tokens_per_second": 6876.671 }, { "epoch": 0.735454837672774, "grad_norm": 0.2138880044221878, "learning_rate": 5.3255963894261775e-05, "loss": 1.0519, "num_input_tokens_seen": 55160768, "step": 1144, "train_runtime": 8021.058, "train_tokens_per_second": 6876.994 }, { "epoch": 0.7360977177756348, "grad_norm": 0.22077840566635132, "learning_rate": 5.312701482914249e-05, "loss": 0.999, "num_input_tokens_seen": 55207872, "step": 1145, "train_runtime": 8027.5436, "train_tokens_per_second": 6877.306 }, { "epoch": 0.7367405978784957, "grad_norm": 0.22485333681106567, "learning_rate": 5.299806576402321e-05, "loss": 0.9196, "num_input_tokens_seen": 55258304, "step": 1146, "train_runtime": 8034.4365, "train_tokens_per_second": 6877.683 }, { "epoch": 0.7373834779813565, "grad_norm": 0.22138972580432892, "learning_rate": 5.286911669890393e-05, "loss": 0.9889, "num_input_tokens_seen": 55313520, "step": 1147, "train_runtime": 8042.0983, "train_tokens_per_second": 6877.996 }, { "epoch": 0.7380263580842173, "grad_norm": 0.23767682909965515, "learning_rate": 5.2740167633784654e-05, "loss": 0.9317, "num_input_tokens_seen": 55366688, "step": 1148, "train_runtime": 8049.4084, "train_tokens_per_second": 6878.355 }, { "epoch": 0.7386692381870781, "grad_norm": 0.21733619272708893, "learning_rate": 5.261121856866538e-05, "loss": 1.0789, "num_input_tokens_seen": 55407632, "step": 1149, "train_runtime": 8055.0656, "train_tokens_per_second": 6878.607 }, { "epoch": 0.7393121182899389, "grad_norm": 0.23163765668869019, "learning_rate": 5.24822695035461e-05, "loss": 1.0057, "num_input_tokens_seen": 55460928, "step": 1150, "train_runtime": 8062.3716, "train_tokens_per_second": 6878.984 }, { "epoch": 0.7399549983927998, "grad_norm": 0.21014994382858276, "learning_rate": 5.235332043842682e-05, "loss": 0.9287, "num_input_tokens_seen": 55505344, "step": 1151, "train_runtime": 8068.5377, "train_tokens_per_second": 6879.232 }, { "epoch": 0.7405978784956606, "grad_norm": 0.225826233625412, "learning_rate": 5.222437137330755e-05, "loss": 0.9094, "num_input_tokens_seen": 55542640, "step": 1152, "train_runtime": 8073.7681, "train_tokens_per_second": 6879.395 }, { "epoch": 0.7412407585985213, "grad_norm": 0.20695921778678894, "learning_rate": 5.209542230818827e-05, "loss": 0.9438, "num_input_tokens_seen": 55584288, "step": 1153, "train_runtime": 8079.5894, "train_tokens_per_second": 6879.593 }, { "epoch": 0.7418836387013822, "grad_norm": 0.23178590834140778, "learning_rate": 5.196647324306899e-05, "loss": 0.9829, "num_input_tokens_seen": 55639888, "step": 1154, "train_runtime": 8087.3713, "train_tokens_per_second": 6879.848 }, { "epoch": 0.742526518804243, "grad_norm": 0.22732076048851013, "learning_rate": 5.1837524177949715e-05, "loss": 1.0151, "num_input_tokens_seen": 55680480, "step": 1155, "train_runtime": 8093.0698, "train_tokens_per_second": 6880.02 }, { "epoch": 0.7431693989071039, "grad_norm": 0.2244046926498413, "learning_rate": 5.170857511283044e-05, "loss": 1.0104, "num_input_tokens_seen": 55723328, "step": 1156, "train_runtime": 8099.1214, "train_tokens_per_second": 6880.17 }, { "epoch": 0.7438122790099646, "grad_norm": 0.23200780153274536, "learning_rate": 5.157962604771116e-05, "loss": 1.0062, "num_input_tokens_seen": 55768816, "step": 1157, "train_runtime": 8105.5226, "train_tokens_per_second": 6880.348 }, { "epoch": 0.7444551591128254, "grad_norm": 0.21963828802108765, "learning_rate": 5.145067698259188e-05, "loss": 0.9265, "num_input_tokens_seen": 55835024, "step": 1158, "train_runtime": 8114.7836, "train_tokens_per_second": 6880.655 }, { "epoch": 0.7450980392156863, "grad_norm": 0.20844990015029907, "learning_rate": 5.132172791747261e-05, "loss": 0.9126, "num_input_tokens_seen": 55879152, "step": 1159, "train_runtime": 8120.9672, "train_tokens_per_second": 6880.849 }, { "epoch": 0.7457409193185471, "grad_norm": 0.2319706231355667, "learning_rate": 5.119277885235332e-05, "loss": 1.1053, "num_input_tokens_seen": 55932224, "step": 1160, "train_runtime": 8128.4026, "train_tokens_per_second": 6881.084 }, { "epoch": 0.7463837994214079, "grad_norm": 0.2260400801897049, "learning_rate": 5.1063829787234044e-05, "loss": 0.9339, "num_input_tokens_seen": 55985392, "step": 1161, "train_runtime": 8135.8349, "train_tokens_per_second": 6881.333 }, { "epoch": 0.7470266795242687, "grad_norm": 0.2468838393688202, "learning_rate": 5.093488072211476e-05, "loss": 0.9742, "num_input_tokens_seen": 56028096, "step": 1162, "train_runtime": 8141.77, "train_tokens_per_second": 6881.562 }, { "epoch": 0.7476695596271296, "grad_norm": 0.23743107914924622, "learning_rate": 5.080593165699549e-05, "loss": 0.9592, "num_input_tokens_seen": 56083904, "step": 1163, "train_runtime": 8149.5139, "train_tokens_per_second": 6881.871 }, { "epoch": 0.7483124397299904, "grad_norm": 0.230645552277565, "learning_rate": 5.067698259187621e-05, "loss": 0.9732, "num_input_tokens_seen": 56116832, "step": 1164, "train_runtime": 8154.1629, "train_tokens_per_second": 6881.986 }, { "epoch": 0.7489553198328511, "grad_norm": 0.21561990678310394, "learning_rate": 5.054803352675693e-05, "loss": 0.9405, "num_input_tokens_seen": 56161920, "step": 1165, "train_runtime": 8160.4444, "train_tokens_per_second": 6882.213 }, { "epoch": 0.749598199935712, "grad_norm": 0.2270730882883072, "learning_rate": 5.0419084461637655e-05, "loss": 1.0281, "num_input_tokens_seen": 56211712, "step": 1166, "train_runtime": 8167.4132, "train_tokens_per_second": 6882.438 }, { "epoch": 0.7502410800385728, "grad_norm": 0.23744960129261017, "learning_rate": 5.029013539651838e-05, "loss": 0.9077, "num_input_tokens_seen": 56250912, "step": 1167, "train_runtime": 8172.9494, "train_tokens_per_second": 6882.572 }, { "epoch": 0.7508839601414337, "grad_norm": 0.24074719846248627, "learning_rate": 5.0161186331399105e-05, "loss": 1.0299, "num_input_tokens_seen": 56320176, "step": 1168, "train_runtime": 8182.589, "train_tokens_per_second": 6882.929 }, { "epoch": 0.7515268402442944, "grad_norm": 0.2285345196723938, "learning_rate": 5.003223726627982e-05, "loss": 1.0016, "num_input_tokens_seen": 56372112, "step": 1169, "train_runtime": 8189.9035, "train_tokens_per_second": 6883.123 }, { "epoch": 0.7521697203471552, "grad_norm": 0.24572432041168213, "learning_rate": 4.990328820116054e-05, "loss": 0.883, "num_input_tokens_seen": 56428272, "step": 1170, "train_runtime": 8197.7663, "train_tokens_per_second": 6883.372 }, { "epoch": 0.7528126004500161, "grad_norm": 0.22612586617469788, "learning_rate": 4.9774339136041266e-05, "loss": 0.8977, "num_input_tokens_seen": 56501376, "step": 1171, "train_runtime": 8208.6044, "train_tokens_per_second": 6883.189 }, { "epoch": 0.7534554805528769, "grad_norm": 0.23137860000133514, "learning_rate": 4.964539007092199e-05, "loss": 1.0062, "num_input_tokens_seen": 56557344, "step": 1172, "train_runtime": 8216.4609, "train_tokens_per_second": 6883.419 }, { "epoch": 0.7540983606557377, "grad_norm": 0.21029794216156006, "learning_rate": 4.951644100580271e-05, "loss": 0.925, "num_input_tokens_seen": 56603296, "step": 1173, "train_runtime": 8222.8421, "train_tokens_per_second": 6883.666 }, { "epoch": 0.7547412407585985, "grad_norm": 0.2205536663532257, "learning_rate": 4.9387491940683434e-05, "loss": 0.9305, "num_input_tokens_seen": 56658960, "step": 1174, "train_runtime": 8230.6725, "train_tokens_per_second": 6883.88 }, { "epoch": 0.7553841208614593, "grad_norm": 0.22032520174980164, "learning_rate": 4.925854287556416e-05, "loss": 0.9456, "num_input_tokens_seen": 56695088, "step": 1175, "train_runtime": 8235.7777, "train_tokens_per_second": 6883.999 }, { "epoch": 0.7560270009643202, "grad_norm": 0.22646676003932953, "learning_rate": 4.912959381044488e-05, "loss": 1.0539, "num_input_tokens_seen": 56740304, "step": 1176, "train_runtime": 8242.1556, "train_tokens_per_second": 6884.158 }, { "epoch": 0.7566698810671809, "grad_norm": 0.24559547007083893, "learning_rate": 4.9000644745325595e-05, "loss": 0.988, "num_input_tokens_seen": 56798672, "step": 1177, "train_runtime": 8250.314, "train_tokens_per_second": 6884.425 }, { "epoch": 0.7573127611700418, "grad_norm": 0.21654796600341797, "learning_rate": 4.887169568020632e-05, "loss": 0.9943, "num_input_tokens_seen": 56843280, "step": 1178, "train_runtime": 8256.5134, "train_tokens_per_second": 6884.659 }, { "epoch": 0.7579556412729026, "grad_norm": 0.2150622457265854, "learning_rate": 4.8742746615087045e-05, "loss": 0.9943, "num_input_tokens_seen": 56898112, "step": 1179, "train_runtime": 8264.2324, "train_tokens_per_second": 6884.864 }, { "epoch": 0.7585985213757634, "grad_norm": 0.22791166603565216, "learning_rate": 4.861379754996776e-05, "loss": 0.9494, "num_input_tokens_seen": 56950448, "step": 1180, "train_runtime": 8271.587, "train_tokens_per_second": 6885.069 }, { "epoch": 0.7592414014786243, "grad_norm": 0.21735823154449463, "learning_rate": 4.848484848484849e-05, "loss": 0.9485, "num_input_tokens_seen": 56979856, "step": 1181, "train_runtime": 8275.7774, "train_tokens_per_second": 6885.136 }, { "epoch": 0.759884281581485, "grad_norm": 0.22657233476638794, "learning_rate": 4.835589941972921e-05, "loss": 0.9565, "num_input_tokens_seen": 57036800, "step": 1182, "train_runtime": 8283.7895, "train_tokens_per_second": 6885.351 }, { "epoch": 0.7605271616843459, "grad_norm": 0.21392716467380524, "learning_rate": 4.822695035460993e-05, "loss": 1.0406, "num_input_tokens_seen": 57084048, "step": 1183, "train_runtime": 8290.4276, "train_tokens_per_second": 6885.537 }, { "epoch": 0.7611700417872067, "grad_norm": 0.2238176167011261, "learning_rate": 4.809800128949065e-05, "loss": 1.0245, "num_input_tokens_seen": 57143824, "step": 1184, "train_runtime": 8298.876, "train_tokens_per_second": 6885.731 }, { "epoch": 0.7618129218900676, "grad_norm": 0.21898095309734344, "learning_rate": 4.7969052224371374e-05, "loss": 1.0304, "num_input_tokens_seen": 57183152, "step": 1185, "train_runtime": 8304.3882, "train_tokens_per_second": 6885.896 }, { "epoch": 0.7624558019929283, "grad_norm": 0.2068723440170288, "learning_rate": 4.78401031592521e-05, "loss": 0.9284, "num_input_tokens_seen": 57222176, "step": 1186, "train_runtime": 8309.9032, "train_tokens_per_second": 6886.022 }, { "epoch": 0.7630986820957891, "grad_norm": 0.22520464658737183, "learning_rate": 4.7711154094132824e-05, "loss": 0.9208, "num_input_tokens_seen": 57264864, "step": 1187, "train_runtime": 8315.896, "train_tokens_per_second": 6886.193 }, { "epoch": 0.76374156219865, "grad_norm": 0.22291500866413116, "learning_rate": 4.758220502901354e-05, "loss": 0.9927, "num_input_tokens_seen": 57305552, "step": 1188, "train_runtime": 8321.6354, "train_tokens_per_second": 6886.333 }, { "epoch": 0.7643844423015108, "grad_norm": 0.23212119936943054, "learning_rate": 4.745325596389427e-05, "loss": 0.9143, "num_input_tokens_seen": 57345392, "step": 1189, "train_runtime": 8327.2897, "train_tokens_per_second": 6886.441 }, { "epoch": 0.7650273224043715, "grad_norm": 0.24220021069049835, "learning_rate": 4.7324306898774985e-05, "loss": 0.9725, "num_input_tokens_seen": 57401472, "step": 1190, "train_runtime": 8335.2033, "train_tokens_per_second": 6886.631 }, { "epoch": 0.7656702025072324, "grad_norm": 0.22186042368412018, "learning_rate": 4.719535783365571e-05, "loss": 0.9678, "num_input_tokens_seen": 57442512, "step": 1191, "train_runtime": 8340.9492, "train_tokens_per_second": 6886.808 }, { "epoch": 0.7663130826100932, "grad_norm": 0.23403644561767578, "learning_rate": 4.706640876853643e-05, "loss": 0.9648, "num_input_tokens_seen": 57483120, "step": 1192, "train_runtime": 8346.684, "train_tokens_per_second": 6886.941 }, { "epoch": 0.7669559627129541, "grad_norm": 0.22645071148872375, "learning_rate": 4.693745970341715e-05, "loss": 0.9198, "num_input_tokens_seen": 57525104, "step": 1193, "train_runtime": 8352.5785, "train_tokens_per_second": 6887.107 }, { "epoch": 0.7675988428158148, "grad_norm": 0.2159106433391571, "learning_rate": 4.680851063829788e-05, "loss": 0.9795, "num_input_tokens_seen": 57565168, "step": 1194, "train_runtime": 8358.1865, "train_tokens_per_second": 6887.28 }, { "epoch": 0.7682417229186757, "grad_norm": 0.22750870883464813, "learning_rate": 4.6679561573178596e-05, "loss": 0.8687, "num_input_tokens_seen": 57614672, "step": 1195, "train_runtime": 8365.1418, "train_tokens_per_second": 6887.471 }, { "epoch": 0.7688846030215365, "grad_norm": 0.21381807327270508, "learning_rate": 4.655061250805932e-05, "loss": 1.0295, "num_input_tokens_seen": 57658208, "step": 1196, "train_runtime": 8371.2702, "train_tokens_per_second": 6887.63 }, { "epoch": 0.7695274831243973, "grad_norm": 0.2144988477230072, "learning_rate": 4.642166344294004e-05, "loss": 0.9495, "num_input_tokens_seen": 57712400, "step": 1197, "train_runtime": 8378.8176, "train_tokens_per_second": 6887.893 }, { "epoch": 0.7701703632272581, "grad_norm": 0.23491157591342926, "learning_rate": 4.6292714377820764e-05, "loss": 1.0421, "num_input_tokens_seen": 57762512, "step": 1198, "train_runtime": 8385.8252, "train_tokens_per_second": 6888.113 }, { "epoch": 0.7708132433301189, "grad_norm": 0.2191002517938614, "learning_rate": 4.616376531270148e-05, "loss": 0.9837, "num_input_tokens_seen": 57801200, "step": 1199, "train_runtime": 8391.2734, "train_tokens_per_second": 6888.251 }, { "epoch": 0.7714561234329798, "grad_norm": 0.24052459001541138, "learning_rate": 4.603481624758221e-05, "loss": 0.9505, "num_input_tokens_seen": 57848416, "step": 1200, "train_runtime": 8397.9153, "train_tokens_per_second": 6888.426 }, { "epoch": 0.7720990035358406, "grad_norm": 0.21337009966373444, "learning_rate": 4.590586718246293e-05, "loss": 1.0245, "num_input_tokens_seen": 57912256, "step": 1201, "train_runtime": 8407.4519, "train_tokens_per_second": 6888.205 }, { "epoch": 0.7727418836387013, "grad_norm": 0.2229907065629959, "learning_rate": 4.5776918117343656e-05, "loss": 1.0446, "num_input_tokens_seen": 57950320, "step": 1202, "train_runtime": 8412.8371, "train_tokens_per_second": 6888.321 }, { "epoch": 0.7733847637415622, "grad_norm": 0.21816016733646393, "learning_rate": 4.564796905222437e-05, "loss": 0.9966, "num_input_tokens_seen": 58008464, "step": 1203, "train_runtime": 8421.0592, "train_tokens_per_second": 6888.5 }, { "epoch": 0.774027643844423, "grad_norm": 0.2395995855331421, "learning_rate": 4.551901998710509e-05, "loss": 0.9236, "num_input_tokens_seen": 58046464, "step": 1204, "train_runtime": 8426.4054, "train_tokens_per_second": 6888.639 }, { "epoch": 0.7746705239472839, "grad_norm": 0.22368338704109192, "learning_rate": 4.539007092198582e-05, "loss": 0.9081, "num_input_tokens_seen": 58099648, "step": 1205, "train_runtime": 8433.8425, "train_tokens_per_second": 6888.87 }, { "epoch": 0.7753134040501446, "grad_norm": 0.2314455807209015, "learning_rate": 4.526112185686654e-05, "loss": 1.0343, "num_input_tokens_seen": 58145440, "step": 1206, "train_runtime": 8440.2523, "train_tokens_per_second": 6889.064 }, { "epoch": 0.7759562841530054, "grad_norm": 0.22723662853240967, "learning_rate": 4.513217279174726e-05, "loss": 0.9582, "num_input_tokens_seen": 58191472, "step": 1207, "train_runtime": 8446.7219, "train_tokens_per_second": 6889.237 }, { "epoch": 0.7765991642558663, "grad_norm": 0.21512675285339355, "learning_rate": 4.5003223726627986e-05, "loss": 0.9875, "num_input_tokens_seen": 58242688, "step": 1208, "train_runtime": 8453.9052, "train_tokens_per_second": 6889.442 }, { "epoch": 0.7772420443587271, "grad_norm": 0.21539998054504395, "learning_rate": 4.487427466150871e-05, "loss": 0.9029, "num_input_tokens_seen": 58292320, "step": 1209, "train_runtime": 8460.89, "train_tokens_per_second": 6889.62 }, { "epoch": 0.777884924461588, "grad_norm": 0.2292962372303009, "learning_rate": 4.474532559638943e-05, "loss": 0.9405, "num_input_tokens_seen": 58335520, "step": 1210, "train_runtime": 8466.9635, "train_tokens_per_second": 6889.781 }, { "epoch": 0.7785278045644487, "grad_norm": 0.22950732707977295, "learning_rate": 4.461637653127015e-05, "loss": 0.9055, "num_input_tokens_seen": 58409648, "step": 1211, "train_runtime": 8477.3793, "train_tokens_per_second": 6890.06 }, { "epoch": 0.7791706846673095, "grad_norm": 0.2094380408525467, "learning_rate": 4.448742746615087e-05, "loss": 1.0754, "num_input_tokens_seen": 58446592, "step": 1212, "train_runtime": 8482.5952, "train_tokens_per_second": 6890.178 }, { "epoch": 0.7798135647701704, "grad_norm": 0.21322154998779297, "learning_rate": 4.4358478401031597e-05, "loss": 0.9984, "num_input_tokens_seen": 58523840, "step": 1213, "train_runtime": 8493.4865, "train_tokens_per_second": 6890.438 }, { "epoch": 0.7804564448730312, "grad_norm": 0.2207326591014862, "learning_rate": 4.4229529335912315e-05, "loss": 0.9486, "num_input_tokens_seen": 58565120, "step": 1214, "train_runtime": 8499.3099, "train_tokens_per_second": 6890.574 }, { "epoch": 0.781099324975892, "grad_norm": 0.22177189588546753, "learning_rate": 4.410058027079304e-05, "loss": 1.0167, "num_input_tokens_seen": 58601776, "step": 1215, "train_runtime": 8504.5197, "train_tokens_per_second": 6890.663 }, { "epoch": 0.7817422050787528, "grad_norm": 0.23585543036460876, "learning_rate": 4.3971631205673764e-05, "loss": 1.004, "num_input_tokens_seen": 58648016, "step": 1216, "train_runtime": 8511.012, "train_tokens_per_second": 6890.839 }, { "epoch": 0.7823850851816136, "grad_norm": 0.22136184573173523, "learning_rate": 4.384268214055448e-05, "loss": 0.982, "num_input_tokens_seen": 58688384, "step": 1217, "train_runtime": 8516.686, "train_tokens_per_second": 6890.988 }, { "epoch": 0.7830279652844745, "grad_norm": 0.25705647468566895, "learning_rate": 4.37137330754352e-05, "loss": 0.9643, "num_input_tokens_seen": 58736880, "step": 1218, "train_runtime": 8523.4446, "train_tokens_per_second": 6891.214 }, { "epoch": 0.7836708453873352, "grad_norm": 0.21513555943965912, "learning_rate": 4.3584784010315926e-05, "loss": 0.9442, "num_input_tokens_seen": 58786448, "step": 1219, "train_runtime": 8530.4163, "train_tokens_per_second": 6891.393 }, { "epoch": 0.7843137254901961, "grad_norm": 0.21693727374076843, "learning_rate": 4.345583494519665e-05, "loss": 0.9013, "num_input_tokens_seen": 58826464, "step": 1220, "train_runtime": 8536.0745, "train_tokens_per_second": 6891.512 }, { "epoch": 0.7849566055930569, "grad_norm": 0.22054851055145264, "learning_rate": 4.3326885880077375e-05, "loss": 0.8901, "num_input_tokens_seen": 58875904, "step": 1221, "train_runtime": 8543.0507, "train_tokens_per_second": 6891.672 }, { "epoch": 0.7855994856959178, "grad_norm": 0.2086583971977234, "learning_rate": 4.3197936814958094e-05, "loss": 0.939, "num_input_tokens_seen": 58917904, "step": 1222, "train_runtime": 8548.9468, "train_tokens_per_second": 6891.832 }, { "epoch": 0.7862423657987785, "grad_norm": 0.22025592625141144, "learning_rate": 4.306898774983882e-05, "loss": 0.9353, "num_input_tokens_seen": 58968256, "step": 1223, "train_runtime": 8556.0367, "train_tokens_per_second": 6892.006 }, { "epoch": 0.7868852459016393, "grad_norm": 0.22146140038967133, "learning_rate": 4.2940038684719537e-05, "loss": 0.8715, "num_input_tokens_seen": 59012672, "step": 1224, "train_runtime": 8562.2887, "train_tokens_per_second": 6892.161 }, { "epoch": 0.7875281260045002, "grad_norm": 0.21178406476974487, "learning_rate": 4.281108961960026e-05, "loss": 0.9546, "num_input_tokens_seen": 59060096, "step": 1225, "train_runtime": 8568.9631, "train_tokens_per_second": 6892.327 }, { "epoch": 0.788171006107361, "grad_norm": 0.236673966050148, "learning_rate": 4.268214055448098e-05, "loss": 0.976, "num_input_tokens_seen": 59099840, "step": 1226, "train_runtime": 8574.612, "train_tokens_per_second": 6892.421 }, { "epoch": 0.7888138862102217, "grad_norm": 0.23856617510318756, "learning_rate": 4.2553191489361704e-05, "loss": 0.8789, "num_input_tokens_seen": 59146000, "step": 1227, "train_runtime": 8581.1157, "train_tokens_per_second": 6892.577 }, { "epoch": 0.7894567663130826, "grad_norm": 0.22620564699172974, "learning_rate": 4.242424242424243e-05, "loss": 0.9081, "num_input_tokens_seen": 59180640, "step": 1228, "train_runtime": 8586.0547, "train_tokens_per_second": 6892.647 }, { "epoch": 0.7900996464159434, "grad_norm": 0.2247392237186432, "learning_rate": 4.229529335912315e-05, "loss": 0.9257, "num_input_tokens_seen": 59242176, "step": 1229, "train_runtime": 8594.7528, "train_tokens_per_second": 6892.831 }, { "epoch": 0.7907425265188043, "grad_norm": 0.2251686453819275, "learning_rate": 4.2166344294003866e-05, "loss": 0.9371, "num_input_tokens_seen": 59288336, "step": 1230, "train_runtime": 8601.2625, "train_tokens_per_second": 6892.981 }, { "epoch": 0.791385406621665, "grad_norm": 0.21998196840286255, "learning_rate": 4.203739522888459e-05, "loss": 0.8956, "num_input_tokens_seen": 59337408, "step": 1231, "train_runtime": 8608.7066, "train_tokens_per_second": 6892.72 }, { "epoch": 0.7920282867245259, "grad_norm": 0.21279209852218628, "learning_rate": 4.1908446163765315e-05, "loss": 0.862, "num_input_tokens_seen": 59381904, "step": 1232, "train_runtime": 8614.9445, "train_tokens_per_second": 6892.895 }, { "epoch": 0.7926711668273867, "grad_norm": 0.2197798490524292, "learning_rate": 4.1779497098646034e-05, "loss": 0.9011, "num_input_tokens_seen": 59422240, "step": 1233, "train_runtime": 8620.6309, "train_tokens_per_second": 6893.027 }, { "epoch": 0.7933140469302475, "grad_norm": 0.21757225692272186, "learning_rate": 4.165054803352676e-05, "loss": 0.97, "num_input_tokens_seen": 59478848, "step": 1234, "train_runtime": 8628.5712, "train_tokens_per_second": 6893.244 }, { "epoch": 0.7939569270331083, "grad_norm": 0.21754653751850128, "learning_rate": 4.152159896840748e-05, "loss": 0.863, "num_input_tokens_seen": 59522960, "step": 1235, "train_runtime": 8634.7754, "train_tokens_per_second": 6893.4 }, { "epoch": 0.7945998071359691, "grad_norm": 0.2172289490699768, "learning_rate": 4.139264990328821e-05, "loss": 0.9865, "num_input_tokens_seen": 59562832, "step": 1236, "train_runtime": 8640.4108, "train_tokens_per_second": 6893.518 }, { "epoch": 0.79524268723883, "grad_norm": 0.21205008029937744, "learning_rate": 4.126370083816892e-05, "loss": 0.8675, "num_input_tokens_seen": 59600784, "step": 1237, "train_runtime": 8645.7572, "train_tokens_per_second": 6893.645 }, { "epoch": 0.7958855673416908, "grad_norm": 0.22735366225242615, "learning_rate": 4.1134751773049644e-05, "loss": 0.9441, "num_input_tokens_seen": 59636464, "step": 1238, "train_runtime": 8650.8144, "train_tokens_per_second": 6893.74 }, { "epoch": 0.7965284474445516, "grad_norm": 0.23327912390232086, "learning_rate": 4.100580270793037e-05, "loss": 0.9658, "num_input_tokens_seen": 59675792, "step": 1239, "train_runtime": 8656.3391, "train_tokens_per_second": 6893.883 }, { "epoch": 0.7971713275474124, "grad_norm": 0.22936224937438965, "learning_rate": 4.0876853642811094e-05, "loss": 0.9035, "num_input_tokens_seen": 59713312, "step": 1240, "train_runtime": 8661.6216, "train_tokens_per_second": 6894.011 }, { "epoch": 0.7978142076502732, "grad_norm": 0.3092407286167145, "learning_rate": 4.074790457769181e-05, "loss": 0.9441, "num_input_tokens_seen": 59750992, "step": 1241, "train_runtime": 8666.9545, "train_tokens_per_second": 6894.116 }, { "epoch": 0.7984570877531341, "grad_norm": 0.2089376598596573, "learning_rate": 4.061895551257254e-05, "loss": 0.9926, "num_input_tokens_seen": 59800864, "step": 1242, "train_runtime": 8673.9447, "train_tokens_per_second": 6894.31 }, { "epoch": 0.7990999678559949, "grad_norm": 0.22079479694366455, "learning_rate": 4.049000644745326e-05, "loss": 0.8473, "num_input_tokens_seen": 59834160, "step": 1243, "train_runtime": 8678.6795, "train_tokens_per_second": 6894.385 }, { "epoch": 0.7997428479588556, "grad_norm": 0.21040008962154388, "learning_rate": 4.036105738233398e-05, "loss": 0.915, "num_input_tokens_seen": 59872256, "step": 1244, "train_runtime": 8684.0907, "train_tokens_per_second": 6894.476 }, { "epoch": 0.8003857280617165, "grad_norm": 0.2410404533147812, "learning_rate": 4.02321083172147e-05, "loss": 1.0353, "num_input_tokens_seen": 59923728, "step": 1245, "train_runtime": 8691.3682, "train_tokens_per_second": 6894.625 }, { "epoch": 0.8010286081645773, "grad_norm": 0.23142696917057037, "learning_rate": 4.010315925209542e-05, "loss": 0.8739, "num_input_tokens_seen": 59959872, "step": 1246, "train_runtime": 8696.5196, "train_tokens_per_second": 6894.698 }, { "epoch": 0.8016714882674382, "grad_norm": 0.2280237376689911, "learning_rate": 3.997421018697615e-05, "loss": 1.0204, "num_input_tokens_seen": 60011952, "step": 1247, "train_runtime": 8703.7998, "train_tokens_per_second": 6894.914 }, { "epoch": 0.8023143683702989, "grad_norm": 0.21406146883964539, "learning_rate": 3.9845261121856866e-05, "loss": 0.9072, "num_input_tokens_seen": 60061136, "step": 1248, "train_runtime": 8710.6904, "train_tokens_per_second": 6895.106 }, { "epoch": 0.8023143683702989, "eval_loss": 0.9978415369987488, "eval_runtime": 40.0681, "eval_samples_per_second": 24.808, "eval_steps_per_second": 1.572, "num_input_tokens_seen": 60061136, "step": 1248 }, { "epoch": 0.8029572484731597, "grad_norm": 0.24779734015464783, "learning_rate": 3.971631205673759e-05, "loss": 0.9878, "num_input_tokens_seen": 60104144, "step": 1249, "train_runtime": 8756.8321, "train_tokens_per_second": 6863.686 }, { "epoch": 0.8036001285760206, "grad_norm": 0.2491709291934967, "learning_rate": 3.9587362991618316e-05, "loss": 0.9887, "num_input_tokens_seen": 60145840, "step": 1250, "train_runtime": 8762.7546, "train_tokens_per_second": 6863.805 }, { "epoch": 0.8042430086788814, "grad_norm": 0.2274121791124344, "learning_rate": 3.9458413926499034e-05, "loss": 0.8389, "num_input_tokens_seen": 60193536, "step": 1251, "train_runtime": 8769.4626, "train_tokens_per_second": 6863.994 }, { "epoch": 0.8048858887817422, "grad_norm": 0.21966342628002167, "learning_rate": 3.932946486137975e-05, "loss": 0.8693, "num_input_tokens_seen": 60243184, "step": 1252, "train_runtime": 8776.4333, "train_tokens_per_second": 6864.199 }, { "epoch": 0.805528768884603, "grad_norm": 0.23420031368732452, "learning_rate": 3.920051579626048e-05, "loss": 0.9123, "num_input_tokens_seen": 60272752, "step": 1253, "train_runtime": 8780.6698, "train_tokens_per_second": 6864.254 }, { "epoch": 0.8061716489874639, "grad_norm": 0.22144600749015808, "learning_rate": 3.90715667311412e-05, "loss": 0.9243, "num_input_tokens_seen": 60316464, "step": 1254, "train_runtime": 8786.8427, "train_tokens_per_second": 6864.407 }, { "epoch": 0.8068145290903247, "grad_norm": 0.22973129153251648, "learning_rate": 3.894261766602193e-05, "loss": 0.8757, "num_input_tokens_seen": 60370112, "step": 1255, "train_runtime": 8794.3484, "train_tokens_per_second": 6864.649 }, { "epoch": 0.8074574091931854, "grad_norm": 0.21880486607551575, "learning_rate": 3.8813668600902645e-05, "loss": 0.9781, "num_input_tokens_seen": 60426192, "step": 1256, "train_runtime": 8802.1636, "train_tokens_per_second": 6864.925 }, { "epoch": 0.8081002892960463, "grad_norm": 0.23579160869121552, "learning_rate": 3.868471953578336e-05, "loss": 0.9731, "num_input_tokens_seen": 60469616, "step": 1257, "train_runtime": 8808.3158, "train_tokens_per_second": 6865.06 }, { "epoch": 0.8087431693989071, "grad_norm": 0.23246201872825623, "learning_rate": 3.855577047066409e-05, "loss": 0.9306, "num_input_tokens_seen": 60512592, "step": 1258, "train_runtime": 8814.3148, "train_tokens_per_second": 6865.263 }, { "epoch": 0.809386049501768, "grad_norm": 0.2275032103061676, "learning_rate": 3.842682140554481e-05, "loss": 0.9319, "num_input_tokens_seen": 60574896, "step": 1259, "train_runtime": 8823.0076, "train_tokens_per_second": 6865.561 }, { "epoch": 0.8100289296046287, "grad_norm": 0.22882547974586487, "learning_rate": 3.829787234042553e-05, "loss": 1.0166, "num_input_tokens_seen": 60622112, "step": 1260, "train_runtime": 8829.6587, "train_tokens_per_second": 6865.737 }, { "epoch": 0.8106718097074895, "grad_norm": 0.24896188080310822, "learning_rate": 3.8168923275306256e-05, "loss": 1.0336, "num_input_tokens_seen": 60673776, "step": 1261, "train_runtime": 8837.388, "train_tokens_per_second": 6865.578 }, { "epoch": 0.8113146898103504, "grad_norm": 0.24217981100082397, "learning_rate": 3.803997421018698e-05, "loss": 1.0291, "num_input_tokens_seen": 60719712, "step": 1262, "train_runtime": 8843.8394, "train_tokens_per_second": 6865.764 }, { "epoch": 0.8119575699132112, "grad_norm": 0.24342891573905945, "learning_rate": 3.79110251450677e-05, "loss": 0.8978, "num_input_tokens_seen": 60759008, "step": 1263, "train_runtime": 8849.3883, "train_tokens_per_second": 6865.899 }, { "epoch": 0.812600450016072, "grad_norm": 0.21937716007232666, "learning_rate": 3.778207607994842e-05, "loss": 0.9114, "num_input_tokens_seen": 60793760, "step": 1264, "train_runtime": 8854.3231, "train_tokens_per_second": 6865.997 }, { "epoch": 0.8132433301189328, "grad_norm": 0.22124840319156647, "learning_rate": 3.765312701482914e-05, "loss": 0.8901, "num_input_tokens_seen": 60842800, "step": 1265, "train_runtime": 8861.218, "train_tokens_per_second": 6866.189 }, { "epoch": 0.8138862102217936, "grad_norm": 0.24157920479774475, "learning_rate": 3.752417794970987e-05, "loss": 1.0071, "num_input_tokens_seen": 60885248, "step": 1266, "train_runtime": 8867.1823, "train_tokens_per_second": 6866.358 }, { "epoch": 0.8145290903246545, "grad_norm": 0.21528279781341553, "learning_rate": 3.7395228884590585e-05, "loss": 0.925, "num_input_tokens_seen": 60937568, "step": 1267, "train_runtime": 8874.5446, "train_tokens_per_second": 6866.557 }, { "epoch": 0.8151719704275152, "grad_norm": 0.28632667660713196, "learning_rate": 3.726627981947131e-05, "loss": 0.9065, "num_input_tokens_seen": 60974000, "step": 1268, "train_runtime": 8879.6749, "train_tokens_per_second": 6866.693 }, { "epoch": 0.8158148505303761, "grad_norm": 0.21082501113414764, "learning_rate": 3.7137330754352035e-05, "loss": 0.8591, "num_input_tokens_seen": 61010336, "step": 1269, "train_runtime": 8884.8106, "train_tokens_per_second": 6866.813 }, { "epoch": 0.8164577306332369, "grad_norm": 0.2408752143383026, "learning_rate": 3.700838168923276e-05, "loss": 0.9138, "num_input_tokens_seen": 61060768, "step": 1270, "train_runtime": 8891.9102, "train_tokens_per_second": 6867.002 }, { "epoch": 0.8171006107360977, "grad_norm": 0.2305835634469986, "learning_rate": 3.687943262411347e-05, "loss": 0.8796, "num_input_tokens_seen": 61095104, "step": 1271, "train_runtime": 8896.7968, "train_tokens_per_second": 6867.09 }, { "epoch": 0.8177434908389586, "grad_norm": 0.2463512271642685, "learning_rate": 3.6750483558994196e-05, "loss": 0.9345, "num_input_tokens_seen": 61136608, "step": 1272, "train_runtime": 8902.6282, "train_tokens_per_second": 6867.254 }, { "epoch": 0.8183863709418193, "grad_norm": 0.22142194211483002, "learning_rate": 3.662153449387492e-05, "loss": 0.9516, "num_input_tokens_seen": 61183712, "step": 1273, "train_runtime": 8909.2587, "train_tokens_per_second": 6867.43 }, { "epoch": 0.8190292510446802, "grad_norm": 0.22028407454490662, "learning_rate": 3.6492585428755646e-05, "loss": 0.9311, "num_input_tokens_seen": 61260576, "step": 1274, "train_runtime": 8920.0131, "train_tokens_per_second": 6867.768 }, { "epoch": 0.819672131147541, "grad_norm": 0.21425789594650269, "learning_rate": 3.6363636363636364e-05, "loss": 1.0058, "num_input_tokens_seen": 61301920, "step": 1275, "train_runtime": 8925.9034, "train_tokens_per_second": 6867.867 }, { "epoch": 0.8203150112504018, "grad_norm": 0.24809955060482025, "learning_rate": 3.623468729851709e-05, "loss": 1.0607, "num_input_tokens_seen": 61362656, "step": 1276, "train_runtime": 8934.4359, "train_tokens_per_second": 6868.106 }, { "epoch": 0.8209578913532626, "grad_norm": 0.20570631325244904, "learning_rate": 3.6105738233397814e-05, "loss": 0.903, "num_input_tokens_seen": 61408960, "step": 1277, "train_runtime": 8940.9874, "train_tokens_per_second": 6868.253 }, { "epoch": 0.8216007714561234, "grad_norm": 0.234993577003479, "learning_rate": 3.597678916827853e-05, "loss": 1.0065, "num_input_tokens_seen": 61457568, "step": 1278, "train_runtime": 8947.87, "train_tokens_per_second": 6868.402 }, { "epoch": 0.8222436515589843, "grad_norm": 0.21434393525123596, "learning_rate": 3.584784010315925e-05, "loss": 0.9359, "num_input_tokens_seen": 61494944, "step": 1279, "train_runtime": 8953.174, "train_tokens_per_second": 6868.508 }, { "epoch": 0.8228865316618451, "grad_norm": 0.23359251022338867, "learning_rate": 3.5718891038039975e-05, "loss": 0.9728, "num_input_tokens_seen": 61549936, "step": 1280, "train_runtime": 8960.8875, "train_tokens_per_second": 6868.732 }, { "epoch": 0.8235294117647058, "grad_norm": 0.23295457661151886, "learning_rate": 3.55899419729207e-05, "loss": 0.9831, "num_input_tokens_seen": 61597104, "step": 1281, "train_runtime": 8967.5677, "train_tokens_per_second": 6868.875 }, { "epoch": 0.8241722918675667, "grad_norm": 0.23427145183086395, "learning_rate": 3.546099290780142e-05, "loss": 0.9904, "num_input_tokens_seen": 61649024, "step": 1282, "train_runtime": 8974.8213, "train_tokens_per_second": 6869.109 }, { "epoch": 0.8248151719704275, "grad_norm": 0.25249189138412476, "learning_rate": 3.533204384268214e-05, "loss": 1.3934, "num_input_tokens_seen": 61705136, "step": 1283, "train_runtime": 8982.6911, "train_tokens_per_second": 6869.337 }, { "epoch": 0.8254580520732884, "grad_norm": 0.22632817924022675, "learning_rate": 3.520309477756286e-05, "loss": 0.9095, "num_input_tokens_seen": 61776336, "step": 1284, "train_runtime": 8992.6871, "train_tokens_per_second": 6869.619 }, { "epoch": 0.8261009321761491, "grad_norm": 0.22133934497833252, "learning_rate": 3.5074145712443586e-05, "loss": 0.9181, "num_input_tokens_seen": 61814624, "step": 1285, "train_runtime": 8998.1163, "train_tokens_per_second": 6869.729 }, { "epoch": 0.82674381227901, "grad_norm": 0.21737878024578094, "learning_rate": 3.4945196647324304e-05, "loss": 0.992, "num_input_tokens_seen": 61885232, "step": 1286, "train_runtime": 9007.9965, "train_tokens_per_second": 6870.033 }, { "epoch": 0.8273866923818708, "grad_norm": 0.24849003553390503, "learning_rate": 3.481624758220503e-05, "loss": 1.1027, "num_input_tokens_seen": 61920896, "step": 1287, "train_runtime": 9013.0615, "train_tokens_per_second": 6870.129 }, { "epoch": 0.8280295724847316, "grad_norm": 0.21847772598266602, "learning_rate": 3.4687298517085754e-05, "loss": 0.9722, "num_input_tokens_seen": 61973696, "step": 1288, "train_runtime": 9020.5141, "train_tokens_per_second": 6870.306 }, { "epoch": 0.8286724525875924, "grad_norm": 0.22305962443351746, "learning_rate": 3.455834945196648e-05, "loss": 1.0413, "num_input_tokens_seen": 62009824, "step": 1289, "train_runtime": 9025.6725, "train_tokens_per_second": 6870.383 }, { "epoch": 0.8293153326904532, "grad_norm": 0.21231709420681, "learning_rate": 3.44294003868472e-05, "loss": 0.8639, "num_input_tokens_seen": 62091072, "step": 1290, "train_runtime": 9037.0685, "train_tokens_per_second": 6870.709 }, { "epoch": 0.829958212793314, "grad_norm": 0.21660618484020233, "learning_rate": 3.4300451321727915e-05, "loss": 0.914, "num_input_tokens_seen": 62127408, "step": 1291, "train_runtime": 9042.7565, "train_tokens_per_second": 6870.406 }, { "epoch": 0.8306010928961749, "grad_norm": 0.2337297797203064, "learning_rate": 3.417150225660864e-05, "loss": 0.9785, "num_input_tokens_seen": 62184736, "step": 1292, "train_runtime": 9050.7518, "train_tokens_per_second": 6870.671 }, { "epoch": 0.8312439729990356, "grad_norm": 0.23421838879585266, "learning_rate": 3.4042553191489365e-05, "loss": 1.07, "num_input_tokens_seen": 62217472, "step": 1293, "train_runtime": 9055.4066, "train_tokens_per_second": 6870.754 }, { "epoch": 0.8318868531018965, "grad_norm": 0.23266111314296722, "learning_rate": 3.391360412637008e-05, "loss": 0.9908, "num_input_tokens_seen": 62260736, "step": 1294, "train_runtime": 9061.4565, "train_tokens_per_second": 6870.941 }, { "epoch": 0.8325297332047573, "grad_norm": 0.2197062373161316, "learning_rate": 3.378465506125081e-05, "loss": 0.9503, "num_input_tokens_seen": 62299360, "step": 1295, "train_runtime": 9066.9208, "train_tokens_per_second": 6871.06 }, { "epoch": 0.8331726133076182, "grad_norm": 0.21622958779335022, "learning_rate": 3.365570599613153e-05, "loss": 0.9882, "num_input_tokens_seen": 62338960, "step": 1296, "train_runtime": 9072.4918, "train_tokens_per_second": 6871.206 }, { "epoch": 0.8338154934104789, "grad_norm": 0.21843262016773224, "learning_rate": 3.352675693101225e-05, "loss": 0.9831, "num_input_tokens_seen": 62378832, "step": 1297, "train_runtime": 9078.1235, "train_tokens_per_second": 6871.335 }, { "epoch": 0.8344583735133397, "grad_norm": 0.22889907658100128, "learning_rate": 3.339780786589297e-05, "loss": 0.8782, "num_input_tokens_seen": 62420640, "step": 1298, "train_runtime": 9083.9834, "train_tokens_per_second": 6871.505 }, { "epoch": 0.8351012536162006, "grad_norm": 0.23234236240386963, "learning_rate": 3.3268858800773694e-05, "loss": 0.8964, "num_input_tokens_seen": 62468304, "step": 1299, "train_runtime": 9090.7185, "train_tokens_per_second": 6871.658 }, { "epoch": 0.8357441337190614, "grad_norm": 0.210599884390831, "learning_rate": 3.313990973565442e-05, "loss": 0.9152, "num_input_tokens_seen": 62512080, "step": 1300, "train_runtime": 9096.8766, "train_tokens_per_second": 6871.818 }, { "epoch": 0.8363870138219223, "grad_norm": 0.2227179855108261, "learning_rate": 3.3010960670535144e-05, "loss": 0.9977, "num_input_tokens_seen": 62551312, "step": 1301, "train_runtime": 9102.3838, "train_tokens_per_second": 6871.97 }, { "epoch": 0.837029893924783, "grad_norm": 0.2382332682609558, "learning_rate": 3.288201160541586e-05, "loss": 0.937, "num_input_tokens_seen": 62600304, "step": 1302, "train_runtime": 9109.25, "train_tokens_per_second": 6872.169 }, { "epoch": 0.8376727740276438, "grad_norm": 0.20747257769107819, "learning_rate": 3.275306254029659e-05, "loss": 1.0066, "num_input_tokens_seen": 62653216, "step": 1303, "train_runtime": 9116.6433, "train_tokens_per_second": 6872.4 }, { "epoch": 0.8383156541305047, "grad_norm": 0.20847642421722412, "learning_rate": 3.262411347517731e-05, "loss": 0.9644, "num_input_tokens_seen": 62696416, "step": 1304, "train_runtime": 9122.7469, "train_tokens_per_second": 6872.537 }, { "epoch": 0.8389585342333655, "grad_norm": 0.22569946944713593, "learning_rate": 3.249516441005803e-05, "loss": 0.9966, "num_input_tokens_seen": 62734384, "step": 1305, "train_runtime": 9128.136, "train_tokens_per_second": 6872.639 }, { "epoch": 0.8396014143362263, "grad_norm": 0.21350441873073578, "learning_rate": 3.236621534493875e-05, "loss": 0.8312, "num_input_tokens_seen": 62784304, "step": 1306, "train_runtime": 9135.2632, "train_tokens_per_second": 6872.742 }, { "epoch": 0.8402442944390871, "grad_norm": 0.2505035698413849, "learning_rate": 3.223726627981947e-05, "loss": 0.7903, "num_input_tokens_seen": 62827200, "step": 1307, "train_runtime": 9141.2689, "train_tokens_per_second": 6872.919 }, { "epoch": 0.840887174541948, "grad_norm": 0.22541561722755432, "learning_rate": 3.21083172147002e-05, "loss": 0.958, "num_input_tokens_seen": 62877392, "step": 1308, "train_runtime": 9148.37, "train_tokens_per_second": 6873.07 }, { "epoch": 0.8415300546448088, "grad_norm": 0.2288602888584137, "learning_rate": 3.1979368149580916e-05, "loss": 0.939, "num_input_tokens_seen": 62934912, "step": 1309, "train_runtime": 9156.462, "train_tokens_per_second": 6873.278 }, { "epoch": 0.8421729347476695, "grad_norm": 0.21767346560955048, "learning_rate": 3.185041908446164e-05, "loss": 0.8732, "num_input_tokens_seen": 62972032, "step": 1310, "train_runtime": 9161.7436, "train_tokens_per_second": 6873.368 }, { "epoch": 0.8428158148505304, "grad_norm": 0.23855219781398773, "learning_rate": 3.172147001934236e-05, "loss": 0.9919, "num_input_tokens_seen": 63013904, "step": 1311, "train_runtime": 9167.6385, "train_tokens_per_second": 6873.515 }, { "epoch": 0.8434586949533912, "grad_norm": 0.22057105600833893, "learning_rate": 3.1592520954223084e-05, "loss": 0.8627, "num_input_tokens_seen": 63077488, "step": 1312, "train_runtime": 9176.5594, "train_tokens_per_second": 6873.762 }, { "epoch": 0.844101575056252, "grad_norm": 0.2043379843235016, "learning_rate": 3.14635718891038e-05, "loss": 0.8982, "num_input_tokens_seen": 63126688, "step": 1313, "train_runtime": 9183.4801, "train_tokens_per_second": 6873.94 }, { "epoch": 0.8447444551591128, "grad_norm": 0.20252691209316254, "learning_rate": 3.133462282398453e-05, "loss": 0.8743, "num_input_tokens_seen": 63165360, "step": 1314, "train_runtime": 9188.9999, "train_tokens_per_second": 6874.019 }, { "epoch": 0.8453873352619736, "grad_norm": 0.24319347739219666, "learning_rate": 3.120567375886525e-05, "loss": 1.0114, "num_input_tokens_seen": 63205120, "step": 1315, "train_runtime": 9194.6333, "train_tokens_per_second": 6874.132 }, { "epoch": 0.8460302153648345, "grad_norm": 0.24205361306667328, "learning_rate": 3.107672469374598e-05, "loss": 0.9002, "num_input_tokens_seen": 63253072, "step": 1316, "train_runtime": 9201.357, "train_tokens_per_second": 6874.32 }, { "epoch": 0.8466730954676953, "grad_norm": 0.22536036372184753, "learning_rate": 3.0947775628626695e-05, "loss": 0.9127, "num_input_tokens_seen": 63294464, "step": 1317, "train_runtime": 9207.1647, "train_tokens_per_second": 6874.479 }, { "epoch": 0.847315975570556, "grad_norm": 0.2225712686777115, "learning_rate": 3.081882656350741e-05, "loss": 1.092, "num_input_tokens_seen": 63341584, "step": 1318, "train_runtime": 9213.7477, "train_tokens_per_second": 6874.682 }, { "epoch": 0.8479588556734169, "grad_norm": 0.2246129810810089, "learning_rate": 3.068987749838814e-05, "loss": 0.9754, "num_input_tokens_seen": 63383728, "step": 1319, "train_runtime": 9219.7143, "train_tokens_per_second": 6874.804 }, { "epoch": 0.8486017357762777, "grad_norm": 0.22739674150943756, "learning_rate": 3.056092843326886e-05, "loss": 0.8704, "num_input_tokens_seen": 63431200, "step": 1320, "train_runtime": 9226.3672, "train_tokens_per_second": 6874.992 }, { "epoch": 0.8492446158791386, "grad_norm": 0.23638106882572174, "learning_rate": 3.043197936814958e-05, "loss": 0.9812, "num_input_tokens_seen": 63468624, "step": 1321, "train_runtime": 9232.2044, "train_tokens_per_second": 6874.699 }, { "epoch": 0.8498874959819993, "grad_norm": 0.2244069129228592, "learning_rate": 3.0303030303030306e-05, "loss": 0.9947, "num_input_tokens_seen": 63519392, "step": 1322, "train_runtime": 9239.3341, "train_tokens_per_second": 6874.889 }, { "epoch": 0.8505303760848602, "grad_norm": 0.21489335596561432, "learning_rate": 3.0174081237911027e-05, "loss": 0.8827, "num_input_tokens_seen": 63558224, "step": 1323, "train_runtime": 9244.8389, "train_tokens_per_second": 6874.995 }, { "epoch": 0.851173256187721, "grad_norm": 0.2280271053314209, "learning_rate": 3.0045132172791752e-05, "loss": 0.9427, "num_input_tokens_seen": 63611792, "step": 1324, "train_runtime": 9252.3795, "train_tokens_per_second": 6875.182 }, { "epoch": 0.8518161362905818, "grad_norm": 0.2121179848909378, "learning_rate": 2.991618310767247e-05, "loss": 0.9785, "num_input_tokens_seen": 63668368, "step": 1325, "train_runtime": 9260.2535, "train_tokens_per_second": 6875.445 }, { "epoch": 0.8524590163934426, "grad_norm": 0.2208545058965683, "learning_rate": 2.9787234042553192e-05, "loss": 0.8791, "num_input_tokens_seen": 63708352, "step": 1326, "train_runtime": 9265.9015, "train_tokens_per_second": 6875.57 }, { "epoch": 0.8531018964963034, "grad_norm": 0.2271835207939148, "learning_rate": 2.9658284977433913e-05, "loss": 0.9281, "num_input_tokens_seen": 63749152, "step": 1327, "train_runtime": 9271.6298, "train_tokens_per_second": 6875.722 }, { "epoch": 0.8537447765991643, "grad_norm": 0.2530703842639923, "learning_rate": 2.9529335912314638e-05, "loss": 1.0096, "num_input_tokens_seen": 63798240, "step": 1328, "train_runtime": 9278.5301, "train_tokens_per_second": 6875.899 }, { "epoch": 0.8543876567020251, "grad_norm": 0.2180684357881546, "learning_rate": 2.940038684719536e-05, "loss": 0.8982, "num_input_tokens_seen": 63854480, "step": 1329, "train_runtime": 9286.4279, "train_tokens_per_second": 6876.108 }, { "epoch": 0.8550305368048859, "grad_norm": 0.2329641580581665, "learning_rate": 2.9271437782076085e-05, "loss": 1.056, "num_input_tokens_seen": 63919616, "step": 1330, "train_runtime": 9295.4858, "train_tokens_per_second": 6876.415 }, { "epoch": 0.8556734169077467, "grad_norm": 0.24323369562625885, "learning_rate": 2.9142488716956806e-05, "loss": 0.9347, "num_input_tokens_seen": 63953392, "step": 1331, "train_runtime": 9300.3106, "train_tokens_per_second": 6876.479 }, { "epoch": 0.8563162970106075, "grad_norm": 0.23381201922893524, "learning_rate": 2.9013539651837524e-05, "loss": 1.0158, "num_input_tokens_seen": 64022416, "step": 1332, "train_runtime": 9309.9939, "train_tokens_per_second": 6876.741 }, { "epoch": 0.8569591771134684, "grad_norm": 0.20569060742855072, "learning_rate": 2.8884590586718246e-05, "loss": 0.9542, "num_input_tokens_seen": 64084016, "step": 1333, "train_runtime": 9318.5868, "train_tokens_per_second": 6877.01 }, { "epoch": 0.8576020572163292, "grad_norm": 0.2487626075744629, "learning_rate": 2.875564152159897e-05, "loss": 0.8908, "num_input_tokens_seen": 64142288, "step": 1334, "train_runtime": 9326.7236, "train_tokens_per_second": 6877.258 }, { "epoch": 0.8582449373191899, "grad_norm": 0.21883252263069153, "learning_rate": 2.8626692456479692e-05, "loss": 1.0138, "num_input_tokens_seen": 64191808, "step": 1335, "train_runtime": 9333.6551, "train_tokens_per_second": 6877.457 }, { "epoch": 0.8588878174220508, "grad_norm": 0.22027264535427094, "learning_rate": 2.8497743391360414e-05, "loss": 0.7875, "num_input_tokens_seen": 64250336, "step": 1336, "train_runtime": 9341.8962, "train_tokens_per_second": 6877.655 }, { "epoch": 0.8595306975249116, "grad_norm": 0.21138998866081238, "learning_rate": 2.836879432624114e-05, "loss": 0.9741, "num_input_tokens_seen": 64310224, "step": 1337, "train_runtime": 9350.3003, "train_tokens_per_second": 6877.878 }, { "epoch": 0.8601735776277725, "grad_norm": 0.22284504771232605, "learning_rate": 2.8239845261121857e-05, "loss": 1.0089, "num_input_tokens_seen": 64343168, "step": 1338, "train_runtime": 9354.9833, "train_tokens_per_second": 6877.956 }, { "epoch": 0.8608164577306332, "grad_norm": 0.21529455482959747, "learning_rate": 2.8110896196002578e-05, "loss": 0.966, "num_input_tokens_seen": 64389136, "step": 1339, "train_runtime": 9361.4442, "train_tokens_per_second": 6878.12 }, { "epoch": 0.861459337833494, "grad_norm": 0.2132706642150879, "learning_rate": 2.7981947130883303e-05, "loss": 0.8745, "num_input_tokens_seen": 64432304, "step": 1340, "train_runtime": 9367.5306, "train_tokens_per_second": 6878.259 }, { "epoch": 0.8621022179363549, "grad_norm": 0.23623524606227875, "learning_rate": 2.7852998065764025e-05, "loss": 0.9538, "num_input_tokens_seen": 64474288, "step": 1341, "train_runtime": 9373.4733, "train_tokens_per_second": 6878.378 }, { "epoch": 0.8627450980392157, "grad_norm": 0.22249281406402588, "learning_rate": 2.7724049000644746e-05, "loss": 0.8987, "num_input_tokens_seen": 64514576, "step": 1342, "train_runtime": 9379.1133, "train_tokens_per_second": 6878.537 }, { "epoch": 0.8633879781420765, "grad_norm": 0.23305073380470276, "learning_rate": 2.759509993552547e-05, "loss": 0.8426, "num_input_tokens_seen": 64556816, "step": 1343, "train_runtime": 9385.0941, "train_tokens_per_second": 6878.654 }, { "epoch": 0.8640308582449373, "grad_norm": 0.2223258912563324, "learning_rate": 2.7466150870406193e-05, "loss": 1.0508, "num_input_tokens_seen": 64602640, "step": 1344, "train_runtime": 9391.5157, "train_tokens_per_second": 6878.83 }, { "epoch": 0.8646737383477981, "grad_norm": 0.2066197246313095, "learning_rate": 2.733720180528691e-05, "loss": 0.914, "num_input_tokens_seen": 64662432, "step": 1345, "train_runtime": 9399.9503, "train_tokens_per_second": 6879.019 }, { "epoch": 0.865316618450659, "grad_norm": 0.23025156557559967, "learning_rate": 2.7208252740167632e-05, "loss": 1.0049, "num_input_tokens_seen": 64716896, "step": 1346, "train_runtime": 9407.5761, "train_tokens_per_second": 6879.232 }, { "epoch": 0.8659594985535197, "grad_norm": 0.20561859011650085, "learning_rate": 2.7079303675048357e-05, "loss": 0.8103, "num_input_tokens_seen": 64759664, "step": 1347, "train_runtime": 9413.5949, "train_tokens_per_second": 6879.377 }, { "epoch": 0.8666023786563806, "grad_norm": 0.24761579930782318, "learning_rate": 2.695035460992908e-05, "loss": 1.0608, "num_input_tokens_seen": 64801808, "step": 1348, "train_runtime": 9419.5286, "train_tokens_per_second": 6879.517 }, { "epoch": 0.8672452587592414, "grad_norm": 0.23833587765693665, "learning_rate": 2.6821405544809803e-05, "loss": 1.0325, "num_input_tokens_seen": 64856656, "step": 1349, "train_runtime": 9427.206, "train_tokens_per_second": 6879.733 }, { "epoch": 0.8678881388621023, "grad_norm": 0.24994045495986938, "learning_rate": 2.6692456479690525e-05, "loss": 1.0294, "num_input_tokens_seen": 64891456, "step": 1350, "train_runtime": 9432.1515, "train_tokens_per_second": 6879.815 }, { "epoch": 0.868531018964963, "grad_norm": 0.2241462916135788, "learning_rate": 2.6563507414571247e-05, "loss": 1.2096, "num_input_tokens_seen": 64944320, "step": 1351, "train_runtime": 9440.0687, "train_tokens_per_second": 6879.645 }, { "epoch": 0.8691738990678238, "grad_norm": 0.21827709674835205, "learning_rate": 2.6434558349451965e-05, "loss": 0.9132, "num_input_tokens_seen": 65016704, "step": 1352, "train_runtime": 9450.2725, "train_tokens_per_second": 6879.876 }, { "epoch": 0.8698167791706847, "grad_norm": 0.2271472066640854, "learning_rate": 2.630560928433269e-05, "loss": 0.9197, "num_input_tokens_seen": 65057376, "step": 1353, "train_runtime": 9455.9918, "train_tokens_per_second": 6880.016 }, { "epoch": 0.8704596592735455, "grad_norm": 0.22219029068946838, "learning_rate": 2.617666021921341e-05, "loss": 0.9124, "num_input_tokens_seen": 65093680, "step": 1354, "train_runtime": 9461.1493, "train_tokens_per_second": 6880.103 }, { "epoch": 0.8711025393764062, "grad_norm": 0.24440434575080872, "learning_rate": 2.6047711154094136e-05, "loss": 1.0075, "num_input_tokens_seen": 65138896, "step": 1355, "train_runtime": 9467.5476, "train_tokens_per_second": 6880.229 }, { "epoch": 0.8717454194792671, "grad_norm": 0.21005411446094513, "learning_rate": 2.5918762088974857e-05, "loss": 0.9593, "num_input_tokens_seen": 65177488, "step": 1356, "train_runtime": 9472.9808, "train_tokens_per_second": 6880.357 }, { "epoch": 0.8723882995821279, "grad_norm": 0.2265816330909729, "learning_rate": 2.578981302385558e-05, "loss": 0.8899, "num_input_tokens_seen": 65212144, "step": 1357, "train_runtime": 9477.8714, "train_tokens_per_second": 6880.463 }, { "epoch": 0.8730311796849888, "grad_norm": 0.22339262068271637, "learning_rate": 2.5660863958736304e-05, "loss": 0.9877, "num_input_tokens_seen": 65256048, "step": 1358, "train_runtime": 9484.0266, "train_tokens_per_second": 6880.627 }, { "epoch": 0.8736740597878495, "grad_norm": 0.2420601099729538, "learning_rate": 2.5531914893617022e-05, "loss": 0.9584, "num_input_tokens_seen": 65311952, "step": 1359, "train_runtime": 9491.8732, "train_tokens_per_second": 6880.829 }, { "epoch": 0.8743169398907104, "grad_norm": 0.20226748287677765, "learning_rate": 2.5402965828497744e-05, "loss": 0.8146, "num_input_tokens_seen": 65372576, "step": 1360, "train_runtime": 9500.4272, "train_tokens_per_second": 6881.014 }, { "epoch": 0.8749598199935712, "grad_norm": 0.21576273441314697, "learning_rate": 2.5274016763378465e-05, "loss": 0.8867, "num_input_tokens_seen": 65412800, "step": 1361, "train_runtime": 9506.0663, "train_tokens_per_second": 6881.164 }, { "epoch": 0.875602700096432, "grad_norm": 0.22144931554794312, "learning_rate": 2.514506769825919e-05, "loss": 0.9981, "num_input_tokens_seen": 65458672, "step": 1362, "train_runtime": 9512.5325, "train_tokens_per_second": 6881.309 }, { "epoch": 0.8762455801992929, "grad_norm": 0.2183014303445816, "learning_rate": 2.501611863313991e-05, "loss": 0.9481, "num_input_tokens_seen": 65510736, "step": 1363, "train_runtime": 9519.8042, "train_tokens_per_second": 6881.521 }, { "epoch": 0.8768884603021536, "grad_norm": 0.22006624937057495, "learning_rate": 2.4887169568020633e-05, "loss": 1.0402, "num_input_tokens_seen": 65559648, "step": 1364, "train_runtime": 9526.6833, "train_tokens_per_second": 6881.687 }, { "epoch": 0.8775313404050145, "grad_norm": 0.2272113561630249, "learning_rate": 2.4758220502901354e-05, "loss": 0.9189, "num_input_tokens_seen": 65606816, "step": 1365, "train_runtime": 9533.3266, "train_tokens_per_second": 6881.839 }, { "epoch": 0.8781742205078753, "grad_norm": 0.24562184512615204, "learning_rate": 2.462927143778208e-05, "loss": 0.9158, "num_input_tokens_seen": 65670256, "step": 1366, "train_runtime": 9542.221, "train_tokens_per_second": 6882.072 }, { "epoch": 0.8788171006107361, "grad_norm": 0.23116691410541534, "learning_rate": 2.4500322372662797e-05, "loss": 0.899, "num_input_tokens_seen": 65724288, "step": 1367, "train_runtime": 9549.829, "train_tokens_per_second": 6882.248 }, { "epoch": 0.8794599807135969, "grad_norm": 0.2198581099510193, "learning_rate": 2.4371373307543522e-05, "loss": 1.0382, "num_input_tokens_seen": 65770288, "step": 1368, "train_runtime": 9556.201, "train_tokens_per_second": 6882.472 }, { "epoch": 0.8801028608164577, "grad_norm": 0.19544394314289093, "learning_rate": 2.4242424242424244e-05, "loss": 0.8376, "num_input_tokens_seen": 65807296, "step": 1369, "train_runtime": 9561.4451, "train_tokens_per_second": 6882.568 }, { "epoch": 0.8807457409193186, "grad_norm": 0.17657072842121124, "learning_rate": 2.4113475177304965e-05, "loss": 1.138, "num_input_tokens_seen": 65864880, "step": 1370, "train_runtime": 9569.4964, "train_tokens_per_second": 6882.795 }, { "epoch": 0.8813886210221794, "grad_norm": 0.23098967969417572, "learning_rate": 2.3984526112185687e-05, "loss": 0.9083, "num_input_tokens_seen": 65929424, "step": 1371, "train_runtime": 9578.5577, "train_tokens_per_second": 6883.022 }, { "epoch": 0.8820315011250401, "grad_norm": 0.2079899162054062, "learning_rate": 2.3855577047066412e-05, "loss": 0.893, "num_input_tokens_seen": 65964688, "step": 1372, "train_runtime": 9583.6065, "train_tokens_per_second": 6883.076 }, { "epoch": 0.882674381227901, "grad_norm": 0.22222909331321716, "learning_rate": 2.3726627981947133e-05, "loss": 0.9877, "num_input_tokens_seen": 66011776, "step": 1373, "train_runtime": 9590.2359, "train_tokens_per_second": 6883.228 }, { "epoch": 0.8833172613307618, "grad_norm": 0.24297206103801727, "learning_rate": 2.3597678916827855e-05, "loss": 0.9199, "num_input_tokens_seen": 66052704, "step": 1374, "train_runtime": 9596.0189, "train_tokens_per_second": 6883.344 }, { "epoch": 0.8839601414336227, "grad_norm": 0.23367612063884735, "learning_rate": 2.3468729851708576e-05, "loss": 0.9687, "num_input_tokens_seen": 66112288, "step": 1375, "train_runtime": 9604.3258, "train_tokens_per_second": 6883.595 }, { "epoch": 0.8846030215364834, "grad_norm": 0.2388744354248047, "learning_rate": 2.3339780786589298e-05, "loss": 0.9275, "num_input_tokens_seen": 66164032, "step": 1376, "train_runtime": 9611.5218, "train_tokens_per_second": 6883.825 }, { "epoch": 0.8852459016393442, "grad_norm": 0.23560196161270142, "learning_rate": 2.321083172147002e-05, "loss": 1.0068, "num_input_tokens_seen": 66213504, "step": 1377, "train_runtime": 9618.4361, "train_tokens_per_second": 6884.02 }, { "epoch": 0.8858887817422051, "grad_norm": 0.23844046890735626, "learning_rate": 2.308188265635074e-05, "loss": 1.0219, "num_input_tokens_seen": 66253168, "step": 1378, "train_runtime": 9624.0025, "train_tokens_per_second": 6884.159 }, { "epoch": 0.8865316618450659, "grad_norm": 0.23521339893341064, "learning_rate": 2.2952933591231466e-05, "loss": 0.9633, "num_input_tokens_seen": 66290672, "step": 1379, "train_runtime": 9629.2576, "train_tokens_per_second": 6884.297 }, { "epoch": 0.8871745419479267, "grad_norm": 0.21503745019435883, "learning_rate": 2.2823984526112184e-05, "loss": 0.9616, "num_input_tokens_seen": 66347552, "step": 1380, "train_runtime": 9637.1794, "train_tokens_per_second": 6884.541 }, { "epoch": 0.8878174220507875, "grad_norm": 0.20514243841171265, "learning_rate": 2.269503546099291e-05, "loss": 0.8724, "num_input_tokens_seen": 66382528, "step": 1381, "train_runtime": 9642.5803, "train_tokens_per_second": 6884.312 }, { "epoch": 0.8884603021536484, "grad_norm": 0.22188791632652283, "learning_rate": 2.256608639587363e-05, "loss": 0.8934, "num_input_tokens_seen": 66415904, "step": 1382, "train_runtime": 9647.2729, "train_tokens_per_second": 6884.423 }, { "epoch": 0.8891031822565092, "grad_norm": 0.2151537835597992, "learning_rate": 2.2437137330754355e-05, "loss": 0.9754, "num_input_tokens_seen": 66460144, "step": 1383, "train_runtime": 9653.4033, "train_tokens_per_second": 6884.633 }, { "epoch": 0.8897460623593699, "grad_norm": 0.22987443208694458, "learning_rate": 2.2308188265635073e-05, "loss": 0.9966, "num_input_tokens_seen": 66514928, "step": 1384, "train_runtime": 9661.0146, "train_tokens_per_second": 6884.88 }, { "epoch": 0.8903889424622308, "grad_norm": 0.2253212034702301, "learning_rate": 2.2179239200515798e-05, "loss": 0.9591, "num_input_tokens_seen": 66549040, "step": 1385, "train_runtime": 9665.8434, "train_tokens_per_second": 6884.97 }, { "epoch": 0.8910318225650916, "grad_norm": 0.21320044994354248, "learning_rate": 2.205029013539652e-05, "loss": 0.9533, "num_input_tokens_seen": 66583696, "step": 1386, "train_runtime": 9670.7834, "train_tokens_per_second": 6885.036 }, { "epoch": 0.8916747026679525, "grad_norm": 0.23471881449222565, "learning_rate": 2.192134107027724e-05, "loss": 0.9836, "num_input_tokens_seen": 66653536, "step": 1387, "train_runtime": 9680.6401, "train_tokens_per_second": 6885.241 }, { "epoch": 0.8923175827708132, "grad_norm": 0.2249496728181839, "learning_rate": 2.1792392005157963e-05, "loss": 0.87, "num_input_tokens_seen": 66723344, "step": 1388, "train_runtime": 9690.4412, "train_tokens_per_second": 6885.48 }, { "epoch": 0.892960462873674, "grad_norm": 0.2176201492547989, "learning_rate": 2.1663442940038688e-05, "loss": 0.8927, "num_input_tokens_seen": 66757584, "step": 1389, "train_runtime": 9695.3021, "train_tokens_per_second": 6885.56 }, { "epoch": 0.8936033429765349, "grad_norm": 0.23144999146461487, "learning_rate": 2.153449387491941e-05, "loss": 0.9819, "num_input_tokens_seen": 66797680, "step": 1390, "train_runtime": 9701.0265, "train_tokens_per_second": 6885.63 }, { "epoch": 0.8942462230793957, "grad_norm": 0.22405368089675903, "learning_rate": 2.140554480980013e-05, "loss": 0.9472, "num_input_tokens_seen": 66856720, "step": 1391, "train_runtime": 9709.2408, "train_tokens_per_second": 6885.885 }, { "epoch": 0.8948891031822566, "grad_norm": 0.2517498731613159, "learning_rate": 2.1276595744680852e-05, "loss": 0.94, "num_input_tokens_seen": 66897904, "step": 1392, "train_runtime": 9715.0173, "train_tokens_per_second": 6886.03 }, { "epoch": 0.8955319832851173, "grad_norm": 0.22383905947208405, "learning_rate": 2.1147646679561574e-05, "loss": 0.9274, "num_input_tokens_seen": 66959696, "step": 1393, "train_runtime": 9723.6455, "train_tokens_per_second": 6886.275 }, { "epoch": 0.8961748633879781, "grad_norm": 0.21671845018863678, "learning_rate": 2.1018697614442295e-05, "loss": 1.0021, "num_input_tokens_seen": 67030720, "step": 1394, "train_runtime": 9733.6024, "train_tokens_per_second": 6886.527 }, { "epoch": 0.896817743490839, "grad_norm": 0.22518201172351837, "learning_rate": 2.0889748549323017e-05, "loss": 1.0131, "num_input_tokens_seen": 67063200, "step": 1395, "train_runtime": 9738.2374, "train_tokens_per_second": 6886.585 }, { "epoch": 0.8974606235936998, "grad_norm": 0.22435115277767181, "learning_rate": 2.076079948420374e-05, "loss": 0.9225, "num_input_tokens_seen": 67100304, "step": 1396, "train_runtime": 9743.4768, "train_tokens_per_second": 6886.69 }, { "epoch": 0.8981035036965606, "grad_norm": 0.21497158706188202, "learning_rate": 2.063185041908446e-05, "loss": 0.9231, "num_input_tokens_seen": 67137808, "step": 1397, "train_runtime": 9748.7727, "train_tokens_per_second": 6886.796 }, { "epoch": 0.8987463837994214, "grad_norm": 0.23121468722820282, "learning_rate": 2.0502901353965185e-05, "loss": 1.0326, "num_input_tokens_seen": 67179600, "step": 1398, "train_runtime": 9754.6238, "train_tokens_per_second": 6886.949 }, { "epoch": 0.8993892639022822, "grad_norm": 0.22834500670433044, "learning_rate": 2.0373952288845906e-05, "loss": 0.925, "num_input_tokens_seen": 67238208, "step": 1399, "train_runtime": 9762.8304, "train_tokens_per_second": 6887.163 }, { "epoch": 0.9000321440051431, "grad_norm": 0.21778346598148346, "learning_rate": 2.024500322372663e-05, "loss": 0.9272, "num_input_tokens_seen": 67284880, "step": 1400, "train_runtime": 9769.3547, "train_tokens_per_second": 6887.341 }, { "epoch": 0.9006750241080038, "grad_norm": 0.22009389102458954, "learning_rate": 2.011605415860735e-05, "loss": 0.925, "num_input_tokens_seen": 67327776, "step": 1401, "train_runtime": 9775.3488, "train_tokens_per_second": 6887.506 }, { "epoch": 0.9013179042108647, "grad_norm": 0.22195357084274292, "learning_rate": 1.9987105093488074e-05, "loss": 0.856, "num_input_tokens_seen": 67371792, "step": 1402, "train_runtime": 9781.5289, "train_tokens_per_second": 6887.655 }, { "epoch": 0.9019607843137255, "grad_norm": 0.22993923723697662, "learning_rate": 1.9858156028368796e-05, "loss": 0.9366, "num_input_tokens_seen": 67412240, "step": 1403, "train_runtime": 9787.2214, "train_tokens_per_second": 6887.781 }, { "epoch": 0.9026036644165863, "grad_norm": 0.22455386817455292, "learning_rate": 1.9729206963249517e-05, "loss": 1.0493, "num_input_tokens_seen": 67454384, "step": 1404, "train_runtime": 9793.153, "train_tokens_per_second": 6887.913 }, { "epoch": 0.9026036644165863, "eval_loss": 0.9950572848320007, "eval_runtime": 40.0596, "eval_samples_per_second": 24.813, "eval_steps_per_second": 1.573, "num_input_tokens_seen": 67454384, "step": 1404 }, { "epoch": 0.9032465445194471, "grad_norm": 0.22418317198753357, "learning_rate": 1.960025789813024e-05, "loss": 0.9479, "num_input_tokens_seen": 67489760, "step": 1405, "train_runtime": 9838.2156, "train_tokens_per_second": 6859.959 }, { "epoch": 0.9038894246223079, "grad_norm": 0.2270124852657318, "learning_rate": 1.9471308833010964e-05, "loss": 0.9602, "num_input_tokens_seen": 67524768, "step": 1406, "train_runtime": 9843.1519, "train_tokens_per_second": 6860.076 }, { "epoch": 0.9045323047251688, "grad_norm": 0.22935500741004944, "learning_rate": 1.934235976789168e-05, "loss": 0.8195, "num_input_tokens_seen": 67566512, "step": 1407, "train_runtime": 9849.0337, "train_tokens_per_second": 6860.217 }, { "epoch": 0.9051751848280296, "grad_norm": 0.21343062818050385, "learning_rate": 1.9213410702772407e-05, "loss": 0.9033, "num_input_tokens_seen": 67605264, "step": 1408, "train_runtime": 9854.4877, "train_tokens_per_second": 6860.353 }, { "epoch": 0.9058180649308903, "grad_norm": 0.21292684972286224, "learning_rate": 1.9084461637653128e-05, "loss": 0.852, "num_input_tokens_seen": 67641856, "step": 1409, "train_runtime": 9859.7137, "train_tokens_per_second": 6860.428 }, { "epoch": 0.9064609450337512, "grad_norm": 0.23036617040634155, "learning_rate": 1.895551257253385e-05, "loss": 0.964, "num_input_tokens_seen": 67693248, "step": 1410, "train_runtime": 9866.908, "train_tokens_per_second": 6860.634 }, { "epoch": 0.907103825136612, "grad_norm": 0.21956272423267365, "learning_rate": 1.882656350741457e-05, "loss": 0.9122, "num_input_tokens_seen": 67732784, "step": 1411, "train_runtime": 9873.0284, "train_tokens_per_second": 6860.386 }, { "epoch": 0.9077467052394729, "grad_norm": 0.23881959915161133, "learning_rate": 1.8697614442295293e-05, "loss": 0.9352, "num_input_tokens_seen": 67764784, "step": 1412, "train_runtime": 9877.5822, "train_tokens_per_second": 6860.463 }, { "epoch": 0.9083895853423336, "grad_norm": 0.2238263487815857, "learning_rate": 1.8568665377176018e-05, "loss": 0.9374, "num_input_tokens_seen": 67802224, "step": 1413, "train_runtime": 9882.8779, "train_tokens_per_second": 6860.575 }, { "epoch": 0.9090324654451944, "grad_norm": 0.21705101430416107, "learning_rate": 1.8439716312056736e-05, "loss": 0.9895, "num_input_tokens_seen": 67836496, "step": 1414, "train_runtime": 9887.76, "train_tokens_per_second": 6860.654 }, { "epoch": 0.9096753455480553, "grad_norm": 0.22904640436172485, "learning_rate": 1.831076724693746e-05, "loss": 0.9624, "num_input_tokens_seen": 67885632, "step": 1415, "train_runtime": 9894.6359, "train_tokens_per_second": 6860.852 }, { "epoch": 0.9103182256509161, "grad_norm": 0.24583081901073456, "learning_rate": 1.8181818181818182e-05, "loss": 0.9797, "num_input_tokens_seen": 67927120, "step": 1416, "train_runtime": 9900.4602, "train_tokens_per_second": 6861.006 }, { "epoch": 0.9109611057537769, "grad_norm": 0.2447551190853119, "learning_rate": 1.8052869116698907e-05, "loss": 0.942, "num_input_tokens_seen": 67979584, "step": 1417, "train_runtime": 9907.8027, "train_tokens_per_second": 6861.217 }, { "epoch": 0.9116039858566377, "grad_norm": 0.2340712547302246, "learning_rate": 1.7923920051579625e-05, "loss": 0.9678, "num_input_tokens_seen": 68036032, "step": 1418, "train_runtime": 9915.6772, "train_tokens_per_second": 6861.461 }, { "epoch": 0.9122468659594986, "grad_norm": 0.22300267219543457, "learning_rate": 1.779497098646035e-05, "loss": 0.9238, "num_input_tokens_seen": 68083520, "step": 1419, "train_runtime": 9922.2805, "train_tokens_per_second": 6861.681 }, { "epoch": 0.9128897460623594, "grad_norm": 0.24390143156051636, "learning_rate": 1.766602192134107e-05, "loss": 1.028, "num_input_tokens_seen": 68124336, "step": 1420, "train_runtime": 9927.9689, "train_tokens_per_second": 6861.86 }, { "epoch": 0.9135326261652202, "grad_norm": 0.21573801338672638, "learning_rate": 1.7537072856221793e-05, "loss": 0.9566, "num_input_tokens_seen": 68187888, "step": 1421, "train_runtime": 9936.769, "train_tokens_per_second": 6862.179 }, { "epoch": 0.914175506268081, "grad_norm": 0.2340092808008194, "learning_rate": 1.7408123791102515e-05, "loss": 1.0308, "num_input_tokens_seen": 68220832, "step": 1422, "train_runtime": 9941.4125, "train_tokens_per_second": 6862.288 }, { "epoch": 0.9148183863709418, "grad_norm": 0.22807711362838745, "learning_rate": 1.727917472598324e-05, "loss": 0.9513, "num_input_tokens_seen": 68255328, "step": 1423, "train_runtime": 9946.2544, "train_tokens_per_second": 6862.415 }, { "epoch": 0.9154612664738027, "grad_norm": 0.2519054114818573, "learning_rate": 1.7150225660863958e-05, "loss": 0.9472, "num_input_tokens_seen": 68301776, "step": 1424, "train_runtime": 9952.7263, "train_tokens_per_second": 6862.62 }, { "epoch": 0.9161041465766635, "grad_norm": 0.22526559233665466, "learning_rate": 1.7021276595744682e-05, "loss": 1.0598, "num_input_tokens_seen": 68357584, "step": 1425, "train_runtime": 9960.4084, "train_tokens_per_second": 6862.93 }, { "epoch": 0.9167470266795242, "grad_norm": 0.24125026166439056, "learning_rate": 1.6892327530625404e-05, "loss": 0.9811, "num_input_tokens_seen": 68409632, "step": 1426, "train_runtime": 9967.6863, "train_tokens_per_second": 6863.141 }, { "epoch": 0.9173899067823851, "grad_norm": 0.22700725495815277, "learning_rate": 1.6763378465506125e-05, "loss": 0.9205, "num_input_tokens_seen": 68451088, "step": 1427, "train_runtime": 9973.4835, "train_tokens_per_second": 6863.308 }, { "epoch": 0.9180327868852459, "grad_norm": 0.21550695598125458, "learning_rate": 1.6634429400386847e-05, "loss": 0.8762, "num_input_tokens_seen": 68486848, "step": 1428, "train_runtime": 9978.5488, "train_tokens_per_second": 6863.408 }, { "epoch": 0.9186756669881068, "grad_norm": 0.2375817447900772, "learning_rate": 1.6505480335267572e-05, "loss": 0.9705, "num_input_tokens_seen": 68525520, "step": 1429, "train_runtime": 9983.9807, "train_tokens_per_second": 6863.547 }, { "epoch": 0.9193185470909675, "grad_norm": 0.22618383169174194, "learning_rate": 1.6376531270148293e-05, "loss": 0.9702, "num_input_tokens_seen": 68580896, "step": 1430, "train_runtime": 9991.6454, "train_tokens_per_second": 6863.824 }, { "epoch": 0.9199614271938283, "grad_norm": 0.2312181442975998, "learning_rate": 1.6247582205029015e-05, "loss": 1.0483, "num_input_tokens_seen": 68618928, "step": 1431, "train_runtime": 9996.9384, "train_tokens_per_second": 6863.994 }, { "epoch": 0.9206043072966892, "grad_norm": 0.21677947044372559, "learning_rate": 1.6118633139909736e-05, "loss": 1.0033, "num_input_tokens_seen": 68659440, "step": 1432, "train_runtime": 10002.5622, "train_tokens_per_second": 6864.185 }, { "epoch": 0.92124718739955, "grad_norm": 0.24624547362327576, "learning_rate": 1.5989684074790458e-05, "loss": 0.9439, "num_input_tokens_seen": 68698576, "step": 1433, "train_runtime": 10008.0086, "train_tokens_per_second": 6864.36 }, { "epoch": 0.9218900675024108, "grad_norm": 0.22636933624744415, "learning_rate": 1.586073500967118e-05, "loss": 0.974, "num_input_tokens_seen": 68743168, "step": 1434, "train_runtime": 10014.2353, "train_tokens_per_second": 6864.545 }, { "epoch": 0.9225329476052716, "grad_norm": 0.20989619195461273, "learning_rate": 1.57317859445519e-05, "loss": 0.849, "num_input_tokens_seen": 68799680, "step": 1435, "train_runtime": 10022.0254, "train_tokens_per_second": 6864.848 }, { "epoch": 0.9231758277081324, "grad_norm": 0.2507398724555969, "learning_rate": 1.5602836879432626e-05, "loss": 0.9745, "num_input_tokens_seen": 68857664, "step": 1436, "train_runtime": 10030.1234, "train_tokens_per_second": 6865.086 }, { "epoch": 0.9238187078109933, "grad_norm": 0.23638993501663208, "learning_rate": 1.5473887814313347e-05, "loss": 0.9524, "num_input_tokens_seen": 68910064, "step": 1437, "train_runtime": 10037.4646, "train_tokens_per_second": 6865.286 }, { "epoch": 0.924461587913854, "grad_norm": 0.2204284518957138, "learning_rate": 1.534493874919407e-05, "loss": 0.9532, "num_input_tokens_seen": 68958096, "step": 1438, "train_runtime": 10044.1591, "train_tokens_per_second": 6865.492 }, { "epoch": 0.9251044680167149, "grad_norm": 0.23989911377429962, "learning_rate": 1.521598968407479e-05, "loss": 1.0243, "num_input_tokens_seen": 69016288, "step": 1439, "train_runtime": 10052.3433, "train_tokens_per_second": 6865.692 }, { "epoch": 0.9257473481195757, "grad_norm": 0.22689130902290344, "learning_rate": 1.5087040618955514e-05, "loss": 1.0335, "num_input_tokens_seen": 69060416, "step": 1440, "train_runtime": 10058.4885, "train_tokens_per_second": 6865.884 }, { "epoch": 0.9263902282224366, "grad_norm": 0.20910261571407318, "learning_rate": 1.4958091553836235e-05, "loss": 0.8844, "num_input_tokens_seen": 69107248, "step": 1441, "train_runtime": 10065.6688, "train_tokens_per_second": 6865.639 }, { "epoch": 0.9270331083252973, "grad_norm": 0.22202737629413605, "learning_rate": 1.4829142488716957e-05, "loss": 0.9544, "num_input_tokens_seen": 69150096, "step": 1442, "train_runtime": 10071.7232, "train_tokens_per_second": 6865.766 }, { "epoch": 0.9276759884281581, "grad_norm": 0.22584928572177887, "learning_rate": 1.470019342359768e-05, "loss": 0.8774, "num_input_tokens_seen": 69198752, "step": 1443, "train_runtime": 10078.513, "train_tokens_per_second": 6865.968 }, { "epoch": 0.928318868531019, "grad_norm": 0.23412150144577026, "learning_rate": 1.4571244358478403e-05, "loss": 1.0116, "num_input_tokens_seen": 69244912, "step": 1444, "train_runtime": 10084.9759, "train_tokens_per_second": 6866.146 }, { "epoch": 0.9289617486338798, "grad_norm": 0.22440744936466217, "learning_rate": 1.4442295293359123e-05, "loss": 0.9491, "num_input_tokens_seen": 69280640, "step": 1445, "train_runtime": 10089.9793, "train_tokens_per_second": 6866.282 }, { "epoch": 0.9296046287367405, "grad_norm": 0.23212245106697083, "learning_rate": 1.4313346228239846e-05, "loss": 0.8358, "num_input_tokens_seen": 69321088, "step": 1446, "train_runtime": 10095.6451, "train_tokens_per_second": 6866.435 }, { "epoch": 0.9302475088396014, "grad_norm": 0.2366316169500351, "learning_rate": 1.418439716312057e-05, "loss": 0.9141, "num_input_tokens_seen": 69359888, "step": 1447, "train_runtime": 10101.1143, "train_tokens_per_second": 6866.558 }, { "epoch": 0.9308903889424622, "grad_norm": 0.23429423570632935, "learning_rate": 1.4055448098001289e-05, "loss": 1.0872, "num_input_tokens_seen": 69410992, "step": 1448, "train_runtime": 10108.2195, "train_tokens_per_second": 6866.787 }, { "epoch": 0.9315332690453231, "grad_norm": 0.23109328746795654, "learning_rate": 1.3926499032882012e-05, "loss": 0.9236, "num_input_tokens_seen": 69456560, "step": 1449, "train_runtime": 10114.5869, "train_tokens_per_second": 6866.97 }, { "epoch": 0.9321761491481839, "grad_norm": 0.22933979332447052, "learning_rate": 1.3797549967762736e-05, "loss": 0.9109, "num_input_tokens_seen": 69498112, "step": 1450, "train_runtime": 10120.4153, "train_tokens_per_second": 6867.121 }, { "epoch": 0.9328190292510447, "grad_norm": 0.22896629571914673, "learning_rate": 1.3668600902643455e-05, "loss": 0.9436, "num_input_tokens_seen": 69552464, "step": 1451, "train_runtime": 10128.0301, "train_tokens_per_second": 6867.324 }, { "epoch": 0.9334619093539055, "grad_norm": 0.2261325716972351, "learning_rate": 1.3539651837524179e-05, "loss": 0.859, "num_input_tokens_seen": 69604752, "step": 1452, "train_runtime": 10135.2972, "train_tokens_per_second": 6867.559 }, { "epoch": 0.9341047894567663, "grad_norm": 0.23998339474201202, "learning_rate": 1.3410702772404902e-05, "loss": 0.9361, "num_input_tokens_seen": 69666048, "step": 1453, "train_runtime": 10143.7979, "train_tokens_per_second": 6867.847 }, { "epoch": 0.9347476695596272, "grad_norm": 0.2145000845193863, "learning_rate": 1.3281753707285623e-05, "loss": 0.8499, "num_input_tokens_seen": 69726352, "step": 1454, "train_runtime": 10152.1929, "train_tokens_per_second": 6868.107 }, { "epoch": 0.9353905496624879, "grad_norm": 0.2282804548740387, "learning_rate": 1.3152804642166345e-05, "loss": 0.9619, "num_input_tokens_seen": 69777712, "step": 1455, "train_runtime": 10159.3382, "train_tokens_per_second": 6868.332 }, { "epoch": 0.9360334297653488, "grad_norm": 0.21795395016670227, "learning_rate": 1.3023855577047068e-05, "loss": 0.9902, "num_input_tokens_seen": 69859472, "step": 1456, "train_runtime": 10170.8258, "train_tokens_per_second": 6868.614 }, { "epoch": 0.9366763098682096, "grad_norm": 0.2481180876493454, "learning_rate": 1.289490651192779e-05, "loss": 1.0054, "num_input_tokens_seen": 69904928, "step": 1457, "train_runtime": 10177.1651, "train_tokens_per_second": 6868.802 }, { "epoch": 0.9373191899710704, "grad_norm": 0.23332452774047852, "learning_rate": 1.2765957446808511e-05, "loss": 0.9111, "num_input_tokens_seen": 69946176, "step": 1458, "train_runtime": 10182.9769, "train_tokens_per_second": 6868.932 }, { "epoch": 0.9379620700739312, "grad_norm": 0.23579373955726624, "learning_rate": 1.2637008381689233e-05, "loss": 1.0746, "num_input_tokens_seen": 69985952, "step": 1459, "train_runtime": 10188.603, "train_tokens_per_second": 6869.043 }, { "epoch": 0.938604950176792, "grad_norm": 0.25695693492889404, "learning_rate": 1.2508059316569956e-05, "loss": 0.888, "num_input_tokens_seen": 70016992, "step": 1460, "train_runtime": 10193.0063, "train_tokens_per_second": 6869.121 }, { "epoch": 0.9392478302796529, "grad_norm": 0.21970728039741516, "learning_rate": 1.2379110251450677e-05, "loss": 1.016, "num_input_tokens_seen": 70063872, "step": 1461, "train_runtime": 10199.6083, "train_tokens_per_second": 6869.271 }, { "epoch": 0.9398907103825137, "grad_norm": 0.21850202977657318, "learning_rate": 1.2250161186331399e-05, "loss": 0.8753, "num_input_tokens_seen": 70116928, "step": 1462, "train_runtime": 10207.0556, "train_tokens_per_second": 6869.457 }, { "epoch": 0.9405335904853744, "grad_norm": 0.2183936983346939, "learning_rate": 1.2121212121212122e-05, "loss": 0.8533, "num_input_tokens_seen": 70168576, "step": 1463, "train_runtime": 10214.2898, "train_tokens_per_second": 6869.648 }, { "epoch": 0.9411764705882353, "grad_norm": 0.22495919466018677, "learning_rate": 1.1992263056092843e-05, "loss": 0.8346, "num_input_tokens_seen": 70227952, "step": 1464, "train_runtime": 10222.7241, "train_tokens_per_second": 6869.788 }, { "epoch": 0.9418193506910961, "grad_norm": 0.22515498101711273, "learning_rate": 1.1863313990973567e-05, "loss": 1.0316, "num_input_tokens_seen": 70300208, "step": 1465, "train_runtime": 10232.815, "train_tokens_per_second": 6870.075 }, { "epoch": 0.942462230793957, "grad_norm": 0.20822781324386597, "learning_rate": 1.1734364925854288e-05, "loss": 0.8258, "num_input_tokens_seen": 70337472, "step": 1466, "train_runtime": 10238.1087, "train_tokens_per_second": 6870.163 }, { "epoch": 0.9431051108968177, "grad_norm": 0.23032674193382263, "learning_rate": 1.160541586073501e-05, "loss": 0.9532, "num_input_tokens_seen": 70369504, "step": 1467, "train_runtime": 10242.6604, "train_tokens_per_second": 6870.237 }, { "epoch": 0.9437479909996785, "grad_norm": 0.20609726011753082, "learning_rate": 1.1476466795615733e-05, "loss": 0.7868, "num_input_tokens_seen": 70413344, "step": 1468, "train_runtime": 10248.8547, "train_tokens_per_second": 6870.362 }, { "epoch": 0.9443908711025394, "grad_norm": 0.23372110724449158, "learning_rate": 1.1347517730496454e-05, "loss": 0.8516, "num_input_tokens_seen": 70469104, "step": 1469, "train_runtime": 10256.6888, "train_tokens_per_second": 6870.551 }, { "epoch": 0.9450337512054002, "grad_norm": 0.22682523727416992, "learning_rate": 1.1218568665377178e-05, "loss": 0.9136, "num_input_tokens_seen": 70511488, "step": 1470, "train_runtime": 10262.6499, "train_tokens_per_second": 6870.69 }, { "epoch": 0.945676631308261, "grad_norm": 0.2447620928287506, "learning_rate": 1.1089619600257899e-05, "loss": 0.8358, "num_input_tokens_seen": 70573376, "step": 1471, "train_runtime": 10271.8891, "train_tokens_per_second": 6870.535 }, { "epoch": 0.9463195114111218, "grad_norm": 0.2190268188714981, "learning_rate": 1.096067053513862e-05, "loss": 0.9806, "num_input_tokens_seen": 70626032, "step": 1472, "train_runtime": 10279.2403, "train_tokens_per_second": 6870.744 }, { "epoch": 0.9469623915139826, "grad_norm": 0.22610507905483246, "learning_rate": 1.0831721470019344e-05, "loss": 1.0947, "num_input_tokens_seen": 70670400, "step": 1473, "train_runtime": 10285.4855, "train_tokens_per_second": 6870.886 }, { "epoch": 0.9476052716168435, "grad_norm": 0.24609413743019104, "learning_rate": 1.0702772404900065e-05, "loss": 0.9695, "num_input_tokens_seen": 70721200, "step": 1474, "train_runtime": 10292.5271, "train_tokens_per_second": 6871.121 }, { "epoch": 0.9482481517197042, "grad_norm": 0.2186412215232849, "learning_rate": 1.0573823339780787e-05, "loss": 0.8916, "num_input_tokens_seen": 70773392, "step": 1475, "train_runtime": 10299.743, "train_tokens_per_second": 6871.375 }, { "epoch": 0.9488910318225651, "grad_norm": 0.22198593616485596, "learning_rate": 1.0444874274661508e-05, "loss": 0.9986, "num_input_tokens_seen": 70817312, "step": 1476, "train_runtime": 10305.8674, "train_tokens_per_second": 6871.553 }, { "epoch": 0.9495339119254259, "grad_norm": 0.22311225533485413, "learning_rate": 1.031592520954223e-05, "loss": 0.9174, "num_input_tokens_seen": 70855552, "step": 1477, "train_runtime": 10311.2514, "train_tokens_per_second": 6871.673 }, { "epoch": 0.9501767920282868, "grad_norm": 0.22305837273597717, "learning_rate": 1.0186976144422953e-05, "loss": 1.0409, "num_input_tokens_seen": 70897120, "step": 1478, "train_runtime": 10317.0953, "train_tokens_per_second": 6871.81 }, { "epoch": 0.9508196721311475, "grad_norm": 0.21804772317409515, "learning_rate": 1.0058027079303675e-05, "loss": 0.9187, "num_input_tokens_seen": 70947872, "step": 1479, "train_runtime": 10324.2218, "train_tokens_per_second": 6871.983 }, { "epoch": 0.9514625522340083, "grad_norm": 0.24226270616054535, "learning_rate": 9.929078014184398e-06, "loss": 0.9696, "num_input_tokens_seen": 71005248, "step": 1480, "train_runtime": 10332.2825, "train_tokens_per_second": 6872.174 }, { "epoch": 0.9521054323368692, "grad_norm": 0.21511489152908325, "learning_rate": 9.80012894906512e-06, "loss": 0.9717, "num_input_tokens_seen": 71047280, "step": 1481, "train_runtime": 10338.2265, "train_tokens_per_second": 6872.289 }, { "epoch": 0.95274831243973, "grad_norm": 0.23640964925289154, "learning_rate": 9.67117988394584e-06, "loss": 0.9809, "num_input_tokens_seen": 71087584, "step": 1482, "train_runtime": 10343.9144, "train_tokens_per_second": 6872.406 }, { "epoch": 0.9533911925425909, "grad_norm": 0.21565860509872437, "learning_rate": 9.542230818826564e-06, "loss": 0.8432, "num_input_tokens_seen": 71154064, "step": 1483, "train_runtime": 10353.2251, "train_tokens_per_second": 6872.647 }, { "epoch": 0.9540340726454516, "grad_norm": 0.21562111377716064, "learning_rate": 9.413281753707286e-06, "loss": 0.894, "num_input_tokens_seen": 71194080, "step": 1484, "train_runtime": 10358.8752, "train_tokens_per_second": 6872.762 }, { "epoch": 0.9546769527483124, "grad_norm": 0.22925646603107452, "learning_rate": 9.284332688588009e-06, "loss": 1.0213, "num_input_tokens_seen": 71237424, "step": 1485, "train_runtime": 10364.9791, "train_tokens_per_second": 6872.896 }, { "epoch": 0.9553198328511733, "grad_norm": 0.2211703509092331, "learning_rate": 9.15538362346873e-06, "loss": 0.9599, "num_input_tokens_seen": 71294800, "step": 1486, "train_runtime": 10373.0981, "train_tokens_per_second": 6873.048 }, { "epoch": 0.9559627129540341, "grad_norm": 0.2549663782119751, "learning_rate": 9.026434558349453e-06, "loss": 0.9073, "num_input_tokens_seen": 71360176, "step": 1487, "train_runtime": 10382.2284, "train_tokens_per_second": 6873.301 }, { "epoch": 0.9566055930568949, "grad_norm": 0.22406437993049622, "learning_rate": 8.897485493230175e-06, "loss": 0.9863, "num_input_tokens_seen": 71400816, "step": 1488, "train_runtime": 10387.957, "train_tokens_per_second": 6873.422 }, { "epoch": 0.9572484731597557, "grad_norm": 0.2288341373205185, "learning_rate": 8.768536428110897e-06, "loss": 0.9861, "num_input_tokens_seen": 71438720, "step": 1489, "train_runtime": 10393.2868, "train_tokens_per_second": 6873.545 }, { "epoch": 0.9578913532626165, "grad_norm": 0.20654594898223877, "learning_rate": 8.63958736299162e-06, "loss": 0.7846, "num_input_tokens_seen": 71475296, "step": 1490, "train_runtime": 10398.4555, "train_tokens_per_second": 6873.645 }, { "epoch": 0.9585342333654774, "grad_norm": 0.2258782833814621, "learning_rate": 8.510638297872341e-06, "loss": 1.0008, "num_input_tokens_seen": 71518512, "step": 1491, "train_runtime": 10404.5551, "train_tokens_per_second": 6873.769 }, { "epoch": 0.9591771134683381, "grad_norm": 0.217194065451622, "learning_rate": 8.381689232753063e-06, "loss": 0.9591, "num_input_tokens_seen": 71558352, "step": 1492, "train_runtime": 10410.1906, "train_tokens_per_second": 6873.875 }, { "epoch": 0.959819993571199, "grad_norm": 0.21820807456970215, "learning_rate": 8.252740167633786e-06, "loss": 0.9159, "num_input_tokens_seen": 71616752, "step": 1493, "train_runtime": 10418.4046, "train_tokens_per_second": 6874.061 }, { "epoch": 0.9604628736740598, "grad_norm": 0.22350728511810303, "learning_rate": 8.123791102514507e-06, "loss": 0.8806, "num_input_tokens_seen": 71675872, "step": 1494, "train_runtime": 10426.7534, "train_tokens_per_second": 6874.227 }, { "epoch": 0.9611057537769206, "grad_norm": 0.23393666744232178, "learning_rate": 7.994842037395229e-06, "loss": 1.0436, "num_input_tokens_seen": 71720592, "step": 1495, "train_runtime": 10433.0466, "train_tokens_per_second": 6874.367 }, { "epoch": 0.9617486338797814, "grad_norm": 0.2220027595758438, "learning_rate": 7.86589297227595e-06, "loss": 1.0807, "num_input_tokens_seen": 71764048, "step": 1496, "train_runtime": 10439.1482, "train_tokens_per_second": 6874.512 }, { "epoch": 0.9623915139826422, "grad_norm": 0.227558434009552, "learning_rate": 7.736943907156674e-06, "loss": 0.9828, "num_input_tokens_seen": 71808592, "step": 1497, "train_runtime": 10445.3874, "train_tokens_per_second": 6874.67 }, { "epoch": 0.9630343940855031, "grad_norm": 0.2309248149394989, "learning_rate": 7.607994842037395e-06, "loss": 0.9937, "num_input_tokens_seen": 71858480, "step": 1498, "train_runtime": 10452.4313, "train_tokens_per_second": 6874.81 }, { "epoch": 0.9636772741883639, "grad_norm": 0.24256859719753265, "learning_rate": 7.4790457769181176e-06, "loss": 1.0748, "num_input_tokens_seen": 71904512, "step": 1499, "train_runtime": 10458.8953, "train_tokens_per_second": 6874.962 }, { "epoch": 0.9643201542912246, "grad_norm": 0.21975061297416687, "learning_rate": 7.35009671179884e-06, "loss": 0.9066, "num_input_tokens_seen": 71952672, "step": 1500, "train_runtime": 10465.6379, "train_tokens_per_second": 6875.135 }, { "epoch": 0.9649630343940855, "grad_norm": 0.23950344324111938, "learning_rate": 7.2211476466795614e-06, "loss": 1.0634, "num_input_tokens_seen": 71994464, "step": 1501, "train_runtime": 10472.0515, "train_tokens_per_second": 6874.915 }, { "epoch": 0.9656059144969463, "grad_norm": 0.2366107702255249, "learning_rate": 7.092198581560285e-06, "loss": 1.0483, "num_input_tokens_seen": 72044336, "step": 1502, "train_runtime": 10479.0377, "train_tokens_per_second": 6875.091 }, { "epoch": 0.9662487945998072, "grad_norm": 0.20939429104328156, "learning_rate": 6.963249516441006e-06, "loss": 0.9134, "num_input_tokens_seen": 72096384, "step": 1503, "train_runtime": 10486.3482, "train_tokens_per_second": 6875.261 }, { "epoch": 0.9668916747026679, "grad_norm": 0.24359357357025146, "learning_rate": 6.834300451321728e-06, "loss": 1.0708, "num_input_tokens_seen": 72152000, "step": 1504, "train_runtime": 10494.2042, "train_tokens_per_second": 6875.414 }, { "epoch": 0.9675345548055287, "grad_norm": 0.22651512920856476, "learning_rate": 6.705351386202451e-06, "loss": 0.9473, "num_input_tokens_seen": 72203584, "step": 1505, "train_runtime": 10501.4323, "train_tokens_per_second": 6875.594 }, { "epoch": 0.9681774349083896, "grad_norm": 0.2099381536245346, "learning_rate": 6.576402321083172e-06, "loss": 0.8985, "num_input_tokens_seen": 72250368, "step": 1506, "train_runtime": 10508.0099, "train_tokens_per_second": 6875.742 }, { "epoch": 0.9688203150112504, "grad_norm": 0.21460288763046265, "learning_rate": 6.447453255963895e-06, "loss": 0.8075, "num_input_tokens_seen": 72301424, "step": 1507, "train_runtime": 10515.1925, "train_tokens_per_second": 6875.901 }, { "epoch": 0.9694631951141112, "grad_norm": 0.22760364413261414, "learning_rate": 6.318504190844616e-06, "loss": 1.0461, "num_input_tokens_seen": 72363488, "step": 1508, "train_runtime": 10523.9695, "train_tokens_per_second": 6876.064 }, { "epoch": 0.970106075216972, "grad_norm": 0.24012909829616547, "learning_rate": 6.189555125725339e-06, "loss": 0.9455, "num_input_tokens_seen": 72414944, "step": 1509, "train_runtime": 10531.2007, "train_tokens_per_second": 6876.229 }, { "epoch": 0.9707489553198329, "grad_norm": 0.21027275919914246, "learning_rate": 6.060606060606061e-06, "loss": 0.9407, "num_input_tokens_seen": 72449424, "step": 1510, "train_runtime": 10536.112, "train_tokens_per_second": 6876.296 }, { "epoch": 0.9713918354226937, "grad_norm": 0.22606825828552246, "learning_rate": 5.931656995486783e-06, "loss": 0.8168, "num_input_tokens_seen": 72508240, "step": 1511, "train_runtime": 10544.438, "train_tokens_per_second": 6876.444 }, { "epoch": 0.9720347155255545, "grad_norm": 0.2204393595457077, "learning_rate": 5.802707930367505e-06, "loss": 0.9256, "num_input_tokens_seen": 72548032, "step": 1512, "train_runtime": 10550.0785, "train_tokens_per_second": 6876.54 }, { "epoch": 0.9726775956284153, "grad_norm": 0.23502115905284882, "learning_rate": 5.673758865248227e-06, "loss": 0.9147, "num_input_tokens_seen": 72584416, "step": 1513, "train_runtime": 10555.2719, "train_tokens_per_second": 6876.603 }, { "epoch": 0.9733204757312761, "grad_norm": 0.21649810671806335, "learning_rate": 5.5448098001289496e-06, "loss": 0.849, "num_input_tokens_seen": 72646048, "step": 1514, "train_runtime": 10563.968, "train_tokens_per_second": 6876.777 }, { "epoch": 0.973963355834137, "grad_norm": 0.22711792588233948, "learning_rate": 5.415860735009672e-06, "loss": 0.9796, "num_input_tokens_seen": 72690720, "step": 1515, "train_runtime": 10570.2401, "train_tokens_per_second": 6876.922 }, { "epoch": 0.9746062359369978, "grad_norm": 0.2364644706249237, "learning_rate": 5.2869116698903934e-06, "loss": 0.9632, "num_input_tokens_seen": 72759216, "step": 1516, "train_runtime": 10579.834, "train_tokens_per_second": 6877.16 }, { "epoch": 0.9752491160398585, "grad_norm": 0.22103801369667053, "learning_rate": 5.157962604771115e-06, "loss": 1.0121, "num_input_tokens_seen": 72798032, "step": 1517, "train_runtime": 10585.3058, "train_tokens_per_second": 6877.272 }, { "epoch": 0.9758919961427194, "grad_norm": 0.22890672087669373, "learning_rate": 5.029013539651837e-06, "loss": 1.0232, "num_input_tokens_seen": 72837680, "step": 1518, "train_runtime": 10590.9089, "train_tokens_per_second": 6877.378 }, { "epoch": 0.9765348762455802, "grad_norm": 0.22934086620807648, "learning_rate": 4.90006447453256e-06, "loss": 0.9378, "num_input_tokens_seen": 72874688, "step": 1519, "train_runtime": 10596.0774, "train_tokens_per_second": 6877.516 }, { "epoch": 0.9771777563484411, "grad_norm": 0.23011226952075958, "learning_rate": 4.771115409413282e-06, "loss": 0.9678, "num_input_tokens_seen": 72936256, "step": 1520, "train_runtime": 10604.6406, "train_tokens_per_second": 6877.768 }, { "epoch": 0.9778206364513018, "grad_norm": 0.24541643261909485, "learning_rate": 4.642166344294004e-06, "loss": 0.8654, "num_input_tokens_seen": 73006592, "step": 1521, "train_runtime": 10614.4594, "train_tokens_per_second": 6878.032 }, { "epoch": 0.9784635165541626, "grad_norm": 0.22993628680706024, "learning_rate": 4.513217279174727e-06, "loss": 0.8861, "num_input_tokens_seen": 73054544, "step": 1522, "train_runtime": 10621.2121, "train_tokens_per_second": 6878.174 }, { "epoch": 0.9791063966570235, "grad_norm": 0.22999486327171326, "learning_rate": 4.384268214055448e-06, "loss": 0.9199, "num_input_tokens_seen": 73105040, "step": 1523, "train_runtime": 10628.2805, "train_tokens_per_second": 6878.351 }, { "epoch": 0.9797492767598843, "grad_norm": 0.21587304770946503, "learning_rate": 4.255319148936171e-06, "loss": 0.9214, "num_input_tokens_seen": 73143792, "step": 1524, "train_runtime": 10633.7179, "train_tokens_per_second": 6878.478 }, { "epoch": 0.9803921568627451, "grad_norm": 0.2139047533273697, "learning_rate": 4.126370083816893e-06, "loss": 0.934, "num_input_tokens_seen": 73182944, "step": 1525, "train_runtime": 10639.2884, "train_tokens_per_second": 6878.556 }, { "epoch": 0.9810350369656059, "grad_norm": 0.22586394846439362, "learning_rate": 3.9974210186976145e-06, "loss": 0.8524, "num_input_tokens_seen": 73212320, "step": 1526, "train_runtime": 10643.4687, "train_tokens_per_second": 6878.615 }, { "epoch": 0.9816779170684667, "grad_norm": 0.2351096123456955, "learning_rate": 3.868471953578337e-06, "loss": 1.0184, "num_input_tokens_seen": 73250352, "step": 1527, "train_runtime": 10648.8122, "train_tokens_per_second": 6878.735 }, { "epoch": 0.9823207971713276, "grad_norm": 0.23118098080158234, "learning_rate": 3.7395228884590588e-06, "loss": 0.9452, "num_input_tokens_seen": 73296496, "step": 1528, "train_runtime": 10655.2604, "train_tokens_per_second": 6878.902 }, { "epoch": 0.9829636772741883, "grad_norm": 0.22116637229919434, "learning_rate": 3.6105738233397807e-06, "loss": 0.8709, "num_input_tokens_seen": 73337840, "step": 1529, "train_runtime": 10661.0594, "train_tokens_per_second": 6879.039 }, { "epoch": 0.9836065573770492, "grad_norm": 0.21791870892047882, "learning_rate": 3.481624758220503e-06, "loss": 0.9545, "num_input_tokens_seen": 73379968, "step": 1530, "train_runtime": 10667.0265, "train_tokens_per_second": 6879.14 }, { "epoch": 0.98424943747991, "grad_norm": 0.24784664809703827, "learning_rate": 3.3526756931012254e-06, "loss": 0.8842, "num_input_tokens_seen": 73410880, "step": 1531, "train_runtime": 10671.9405, "train_tokens_per_second": 6878.869 }, { "epoch": 0.9848923175827708, "grad_norm": 0.24023281037807465, "learning_rate": 3.2237266279819474e-06, "loss": 0.969, "num_input_tokens_seen": 73447616, "step": 1532, "train_runtime": 10677.1333, "train_tokens_per_second": 6878.964 }, { "epoch": 0.9855351976856316, "grad_norm": 0.22703370451927185, "learning_rate": 3.0947775628626693e-06, "loss": 0.8778, "num_input_tokens_seen": 73491600, "step": 1533, "train_runtime": 10683.2916, "train_tokens_per_second": 6879.116 }, { "epoch": 0.9861780777884924, "grad_norm": 0.2379906177520752, "learning_rate": 2.9658284977433917e-06, "loss": 0.9919, "num_input_tokens_seen": 73531328, "step": 1534, "train_runtime": 10688.8868, "train_tokens_per_second": 6879.232 }, { "epoch": 0.9868209578913533, "grad_norm": 0.2339247614145279, "learning_rate": 2.8368794326241136e-06, "loss": 1.0197, "num_input_tokens_seen": 73580624, "step": 1535, "train_runtime": 10695.8355, "train_tokens_per_second": 6879.371 }, { "epoch": 0.9874638379942141, "grad_norm": 0.2211606651544571, "learning_rate": 2.707930367504836e-06, "loss": 1.2567, "num_input_tokens_seen": 73629520, "step": 1536, "train_runtime": 10702.7009, "train_tokens_per_second": 6879.527 }, { "epoch": 0.9881067180970748, "grad_norm": 0.23319384455680847, "learning_rate": 2.5789813023855575e-06, "loss": 0.9055, "num_input_tokens_seen": 73671728, "step": 1537, "train_runtime": 10708.6418, "train_tokens_per_second": 6879.652 }, { "epoch": 0.9887495981999357, "grad_norm": 0.23008319735527039, "learning_rate": 2.45003223726628e-06, "loss": 0.9364, "num_input_tokens_seen": 73723088, "step": 1538, "train_runtime": 10715.8183, "train_tokens_per_second": 6879.837 }, { "epoch": 0.9893924783027965, "grad_norm": 0.22150327265262604, "learning_rate": 2.321083172147002e-06, "loss": 1.0242, "num_input_tokens_seen": 73777696, "step": 1539, "train_runtime": 10723.5459, "train_tokens_per_second": 6879.972 }, { "epoch": 0.9900353584056574, "grad_norm": 0.21783533692359924, "learning_rate": 2.192134107027724e-06, "loss": 1.0637, "num_input_tokens_seen": 73831504, "step": 1540, "train_runtime": 10731.0934, "train_tokens_per_second": 6880.147 }, { "epoch": 0.9906782385085182, "grad_norm": 0.22133003175258636, "learning_rate": 2.0631850419084465e-06, "loss": 1.0165, "num_input_tokens_seen": 73875968, "step": 1541, "train_runtime": 10737.3327, "train_tokens_per_second": 6880.291 }, { "epoch": 0.991321118611379, "grad_norm": 0.25689297914505005, "learning_rate": 1.9342359767891684e-06, "loss": 1.6965, "num_input_tokens_seen": 73934464, "step": 1542, "train_runtime": 10745.5214, "train_tokens_per_second": 6880.491 }, { "epoch": 0.9919639987142398, "grad_norm": 0.23742981255054474, "learning_rate": 1.8052869116698904e-06, "loss": 0.9891, "num_input_tokens_seen": 73993488, "step": 1543, "train_runtime": 10753.8618, "train_tokens_per_second": 6880.643 }, { "epoch": 0.9926068788171006, "grad_norm": 0.25090768933296204, "learning_rate": 1.6763378465506127e-06, "loss": 1.0532, "num_input_tokens_seen": 74044432, "step": 1544, "train_runtime": 10761.0324, "train_tokens_per_second": 6880.793 }, { "epoch": 0.9932497589199615, "grad_norm": 0.23686262965202332, "learning_rate": 1.5473887814313347e-06, "loss": 1.0108, "num_input_tokens_seen": 74094208, "step": 1545, "train_runtime": 10768.0263, "train_tokens_per_second": 6880.946 }, { "epoch": 0.9938926390228222, "grad_norm": 0.22799675166606903, "learning_rate": 1.4184397163120568e-06, "loss": 1.1222, "num_input_tokens_seen": 74133760, "step": 1546, "train_runtime": 10773.6342, "train_tokens_per_second": 6881.036 }, { "epoch": 0.994535519125683, "grad_norm": 0.22108574211597443, "learning_rate": 1.2894906511927787e-06, "loss": 0.8359, "num_input_tokens_seen": 74183040, "step": 1547, "train_runtime": 10780.5602, "train_tokens_per_second": 6881.186 }, { "epoch": 0.9951783992285439, "grad_norm": 0.24408769607543945, "learning_rate": 1.160541586073501e-06, "loss": 0.9974, "num_input_tokens_seen": 74223408, "step": 1548, "train_runtime": 10786.2555, "train_tokens_per_second": 6881.295 }, { "epoch": 0.9958212793314047, "grad_norm": 0.25479939579963684, "learning_rate": 1.0315925209542232e-06, "loss": 0.9484, "num_input_tokens_seen": 74261936, "step": 1549, "train_runtime": 10791.6911, "train_tokens_per_second": 6881.399 }, { "epoch": 0.9964641594342655, "grad_norm": 0.25188323855400085, "learning_rate": 9.026434558349452e-07, "loss": 0.9854, "num_input_tokens_seen": 74305648, "step": 1550, "train_runtime": 10797.8713, "train_tokens_per_second": 6881.509 }, { "epoch": 0.9971070395371263, "grad_norm": 0.23725450038909912, "learning_rate": 7.736943907156673e-07, "loss": 0.9761, "num_input_tokens_seen": 74354912, "step": 1551, "train_runtime": 10804.7577, "train_tokens_per_second": 6881.682 }, { "epoch": 0.9977499196399872, "grad_norm": 0.2294706404209137, "learning_rate": 6.447453255963894e-07, "loss": 0.903, "num_input_tokens_seen": 74397344, "step": 1552, "train_runtime": 10810.7407, "train_tokens_per_second": 6881.799 }, { "epoch": 0.998392799742848, "grad_norm": 0.2335725575685501, "learning_rate": 5.157962604771116e-07, "loss": 1.0615, "num_input_tokens_seen": 74451520, "step": 1553, "train_runtime": 10818.4341, "train_tokens_per_second": 6881.913 }, { "epoch": 0.9990356798457087, "grad_norm": 0.22153763473033905, "learning_rate": 3.8684719535783366e-07, "loss": 0.9205, "num_input_tokens_seen": 74490944, "step": 1554, "train_runtime": 10824.0166, "train_tokens_per_second": 6882.006 }, { "epoch": 0.9996785599485696, "grad_norm": 0.22652824223041534, "learning_rate": 2.578981302385558e-07, "loss": 0.8884, "num_input_tokens_seen": 74553376, "step": 1555, "train_runtime": 10832.8456, "train_tokens_per_second": 6882.16 }, { "epoch": 1.0, "grad_norm": 0.353055864572525, "learning_rate": 1.289490651192779e-07, "loss": 0.9193, "num_input_tokens_seen": 74567527, "step": 1556, "train_runtime": 10834.9152, "train_tokens_per_second": 6882.151 } ], "logging_steps": 1, "max_steps": 1556, "num_input_tokens_seen": 74567527, "num_train_epochs": 1, "save_steps": 30, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 3.1814933251156285e+18, "train_batch_size": 16, "trial_name": null, "trial_params": null }