{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 500, "global_step": 1395, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.021528525296017224, "grad_norm": 16.47992515563965, "learning_rate": 9.998973021172564e-06, "loss": 1.7834, "num_input_tokens_seen": 43648, "step": 10, "train_runtime": 64.3878, "train_tokens_per_second": 677.892 }, { "epoch": 0.04305705059203445, "grad_norm": 16.372161865234375, "learning_rate": 9.995423512524277e-06, "loss": 0.7676, "num_input_tokens_seen": 87072, "step": 20, "train_runtime": 95.1979, "train_tokens_per_second": 914.642 }, { "epoch": 0.06458557588805167, "grad_norm": 11.686817169189453, "learning_rate": 9.98934059499448e-06, "loss": 0.5817, "num_input_tokens_seen": 131520, "step": 30, "train_runtime": 126.5065, "train_tokens_per_second": 1039.63 }, { "epoch": 0.0861141011840689, "grad_norm": 3.2975926399230957, "learning_rate": 9.980727353510257e-06, "loss": 0.3531, "num_input_tokens_seen": 175680, "step": 40, "train_runtime": 157.6702, "train_tokens_per_second": 1114.225 }, { "epoch": 0.10764262648008611, "grad_norm": 3.4886627197265625, "learning_rate": 9.969588156242282e-06, "loss": 0.3352, "num_input_tokens_seen": 219584, "step": 50, "train_runtime": 188.7104, "train_tokens_per_second": 1163.603 }, { "epoch": 0.12917115177610333, "grad_norm": 3.484487295150757, "learning_rate": 9.95592865238951e-06, "loss": 0.2298, "num_input_tokens_seen": 263392, "step": 60, "train_runtime": 219.7077, "train_tokens_per_second": 1198.829 }, { "epoch": 0.15069967707212056, "grad_norm": 4.422971725463867, "learning_rate": 9.939755769314215e-06, "loss": 0.1981, "num_input_tokens_seen": 306912, "step": 70, "train_runtime": 250.6069, "train_tokens_per_second": 1224.675 }, { "epoch": 0.1722282023681378, "grad_norm": 1.4185198545455933, "learning_rate": 9.9210777090288e-06, "loss": 0.1755, "num_input_tokens_seen": 349824, "step": 80, "train_runtime": 281.2405, "train_tokens_per_second": 1243.86 }, { "epoch": 0.193756727664155, "grad_norm": 1.1935056447982788, "learning_rate": 9.899903944036185e-06, "loss": 0.1791, "num_input_tokens_seen": 393664, "step": 90, "train_runtime": 312.2075, "train_tokens_per_second": 1260.905 }, { "epoch": 0.21528525296017223, "grad_norm": 2.463397741317749, "learning_rate": 9.87624521252587e-06, "loss": 0.2051, "num_input_tokens_seen": 437952, "step": 100, "train_runtime": 343.3508, "train_tokens_per_second": 1275.523 }, { "epoch": 0.23681377825618946, "grad_norm": 3.8650355339050293, "learning_rate": 9.850113512928094e-06, "loss": 0.1912, "num_input_tokens_seen": 481472, "step": 110, "train_runtime": 374.2539, "train_tokens_per_second": 1286.485 }, { "epoch": 0.25834230355220666, "grad_norm": 4.704444885253906, "learning_rate": 9.821522097828884e-06, "loss": 0.1637, "num_input_tokens_seen": 525472, "step": 120, "train_runtime": 405.4374, "train_tokens_per_second": 1296.062 }, { "epoch": 0.2798708288482239, "grad_norm": 2.7267754077911377, "learning_rate": 9.790485467249065e-06, "loss": 0.1537, "num_input_tokens_seen": 569696, "step": 130, "train_runtime": 436.4834, "train_tokens_per_second": 1305.195 }, { "epoch": 0.3013993541442411, "grad_norm": 3.512826681137085, "learning_rate": 9.757019361290621e-06, "loss": 0.1846, "num_input_tokens_seen": 613760, "step": 140, "train_runtime": 467.5968, "train_tokens_per_second": 1312.584 }, { "epoch": 0.32292787944025836, "grad_norm": 2.484517812728882, "learning_rate": 9.721140752154182e-06, "loss": 0.1872, "num_input_tokens_seen": 657824, "step": 150, "train_runtime": 498.6389, "train_tokens_per_second": 1319.239 }, { "epoch": 0.3444564047362756, "grad_norm": 2.296607255935669, "learning_rate": 9.682867835531624e-06, "loss": 0.1372, "num_input_tokens_seen": 701760, "step": 160, "train_runtime": 529.7256, "train_tokens_per_second": 1324.761 }, { "epoch": 0.36598493003229277, "grad_norm": 3.887946128845215, "learning_rate": 9.642220021378212e-06, "loss": 0.2028, "num_input_tokens_seen": 745184, "step": 170, "train_runtime": 560.5239, "train_tokens_per_second": 1329.442 }, { "epoch": 0.38751345532831, "grad_norm": 2.1227307319641113, "learning_rate": 9.59921792406891e-06, "loss": 0.1765, "num_input_tokens_seen": 789216, "step": 180, "train_runtime": 591.5958, "train_tokens_per_second": 1334.046 }, { "epoch": 0.40904198062432723, "grad_norm": 3.007882595062256, "learning_rate": 9.553883351943882e-06, "loss": 0.1882, "num_input_tokens_seen": 832960, "step": 190, "train_runtime": 622.6094, "train_tokens_per_second": 1337.853 }, { "epoch": 0.43057050592034446, "grad_norm": 1.8637208938598633, "learning_rate": 9.506239296248497e-06, "loss": 0.1336, "num_input_tokens_seen": 877664, "step": 200, "train_runtime": 654.0867, "train_tokens_per_second": 1341.816 }, { "epoch": 0.4520990312163617, "grad_norm": 1.1324244737625122, "learning_rate": 9.456309919473384e-06, "loss": 0.1521, "num_input_tokens_seen": 921536, "step": 210, "train_runtime": 685.133, "train_tokens_per_second": 1345.047 }, { "epoch": 0.4736275565123789, "grad_norm": 3.536208391189575, "learning_rate": 9.404120543100553e-06, "loss": 0.1864, "num_input_tokens_seen": 965344, "step": 220, "train_runtime": 716.7323, "train_tokens_per_second": 1346.868 }, { "epoch": 0.4951560818083961, "grad_norm": 1.73074209690094, "learning_rate": 9.34969763476168e-06, "loss": 0.1625, "num_input_tokens_seen": 1008672, "step": 230, "train_runtime": 747.5266, "train_tokens_per_second": 1349.346 }, { "epoch": 0.5166846071044133, "grad_norm": 1.4830386638641357, "learning_rate": 9.293068794815175e-06, "loss": 0.1456, "num_input_tokens_seen": 1051936, "step": 240, "train_runtime": 778.3038, "train_tokens_per_second": 1351.575 }, { "epoch": 0.5382131324004306, "grad_norm": 2.7361512184143066, "learning_rate": 9.234262742348764e-06, "loss": 0.165, "num_input_tokens_seen": 1095904, "step": 250, "train_runtime": 809.3485, "train_tokens_per_second": 1354.057 }, { "epoch": 0.5597416576964478, "grad_norm": 1.9473741054534912, "learning_rate": 9.17330930061471e-06, "loss": 0.1487, "num_input_tokens_seen": 1140064, "step": 260, "train_runtime": 840.5464, "train_tokens_per_second": 1356.337 }, { "epoch": 0.581270182992465, "grad_norm": 2.0610098838806152, "learning_rate": 9.11023938190509e-06, "loss": 0.1687, "num_input_tokens_seen": 1183872, "step": 270, "train_runtime": 871.5774, "train_tokens_per_second": 1358.31 }, { "epoch": 0.6027987082884823, "grad_norm": 3.2189598083496094, "learning_rate": 9.045084971874738e-06, "loss": 0.1511, "num_input_tokens_seen": 1228544, "step": 280, "train_runtime": 903.1191, "train_tokens_per_second": 1360.334 }, { "epoch": 0.6243272335844995, "grad_norm": 3.902757406234741, "learning_rate": 8.977879113319847e-06, "loss": 0.184, "num_input_tokens_seen": 1271968, "step": 290, "train_runtime": 934.0522, "train_tokens_per_second": 1361.774 }, { "epoch": 0.6458557588805167, "grad_norm": 4.2983012199401855, "learning_rate": 8.90865588942046e-06, "loss": 0.1305, "num_input_tokens_seen": 1316096, "step": 300, "train_runtime": 965.1778, "train_tokens_per_second": 1363.579 }, { "epoch": 0.667384284176534, "grad_norm": 2.6156394481658936, "learning_rate": 8.83745040645531e-06, "loss": 0.1405, "num_input_tokens_seen": 1360256, "step": 310, "train_runtime": 996.4077, "train_tokens_per_second": 1365.16 }, { "epoch": 0.6889128094725512, "grad_norm": 1.3506444692611694, "learning_rate": 8.764298775997823e-06, "loss": 0.1651, "num_input_tokens_seen": 1404064, "step": 320, "train_runtime": 1027.5151, "train_tokens_per_second": 1366.466 }, { "epoch": 0.7104413347685683, "grad_norm": 1.5117799043655396, "learning_rate": 8.68923809660227e-06, "loss": 0.1519, "num_input_tokens_seen": 1448256, "step": 330, "train_runtime": 1058.74, "train_tokens_per_second": 1367.905 }, { "epoch": 0.7319698600645855, "grad_norm": 1.2659231424331665, "learning_rate": 8.612306434989395e-06, "loss": 0.1574, "num_input_tokens_seen": 1492448, "step": 340, "train_runtime": 1090.0052, "train_tokens_per_second": 1369.212 }, { "epoch": 0.7534983853606028, "grad_norm": 2.6010894775390625, "learning_rate": 8.53354280674102e-06, "loss": 0.1587, "num_input_tokens_seen": 1537440, "step": 350, "train_runtime": 1121.55, "train_tokens_per_second": 1370.817 }, { "epoch": 0.77502691065662, "grad_norm": 1.6968097686767578, "learning_rate": 8.452987156513457e-06, "loss": 0.1513, "num_input_tokens_seen": 1581280, "step": 360, "train_runtime": 1152.6858, "train_tokens_per_second": 1371.822 }, { "epoch": 0.7965554359526372, "grad_norm": 2.0298380851745605, "learning_rate": 8.370680337779737e-06, "loss": 0.1401, "num_input_tokens_seen": 1625824, "step": 370, "train_runtime": 1184.3507, "train_tokens_per_second": 1372.756 }, { "epoch": 0.8180839612486545, "grad_norm": 2.7614028453826904, "learning_rate": 8.286664092110935e-06, "loss": 0.1135, "num_input_tokens_seen": 1669472, "step": 380, "train_runtime": 1215.2935, "train_tokens_per_second": 1373.719 }, { "epoch": 0.8396124865446717, "grad_norm": 1.6297581195831299, "learning_rate": 8.200981028007095e-06, "loss": 0.1645, "num_input_tokens_seen": 1713312, "step": 390, "train_runtime": 1246.1254, "train_tokens_per_second": 1374.911 }, { "epoch": 0.8611410118406889, "grad_norm": 2.32612943649292, "learning_rate": 8.11367459928851e-06, "loss": 0.1129, "num_input_tokens_seen": 1757056, "step": 400, "train_runtime": 1277.0951, "train_tokens_per_second": 1375.822 }, { "epoch": 0.8826695371367062, "grad_norm": 1.5576270818710327, "learning_rate": 8.024789083058289e-06, "loss": 0.1333, "num_input_tokens_seen": 1801632, "step": 410, "train_runtime": 1308.5556, "train_tokens_per_second": 1376.81 }, { "epoch": 0.9041980624327234, "grad_norm": 8.420344352722168, "learning_rate": 7.934369557247397e-06, "loss": 0.1311, "num_input_tokens_seen": 1845280, "step": 420, "train_runtime": 1339.4668, "train_tokens_per_second": 1377.623 }, { "epoch": 0.9257265877287406, "grad_norm": 1.7291479110717773, "learning_rate": 7.842461877753575e-06, "loss": 0.1395, "num_input_tokens_seen": 1889472, "step": 430, "train_runtime": 1370.6369, "train_tokens_per_second": 1378.536 }, { "epoch": 0.9472551130247578, "grad_norm": 2.441693067550659, "learning_rate": 7.7491126551857e-06, "loss": 0.1175, "num_input_tokens_seen": 1932832, "step": 440, "train_runtime": 1401.3047, "train_tokens_per_second": 1379.309 }, { "epoch": 0.9687836383207751, "grad_norm": 1.3606727123260498, "learning_rate": 7.654369231225398e-06, "loss": 0.1154, "num_input_tokens_seen": 1976000, "step": 450, "train_runtime": 1431.9402, "train_tokens_per_second": 1379.946 }, { "epoch": 0.9903121636167922, "grad_norm": 2.911600351333618, "learning_rate": 7.5582796546179125e-06, "loss": 0.1408, "num_input_tokens_seen": 2019968, "step": 460, "train_runtime": 1463.035, "train_tokens_per_second": 1380.67 }, { "epoch": 1.0107642626480087, "grad_norm": 2.967047929763794, "learning_rate": 7.460892656804366e-06, "loss": 0.1126, "num_input_tokens_seen": 2061440, "step": 470, "train_runtime": 1492.4083, "train_tokens_per_second": 1381.284 }, { "epoch": 1.0322927879440258, "grad_norm": 1.90776789188385, "learning_rate": 7.362257627207818e-06, "loss": 0.1329, "num_input_tokens_seen": 2105216, "step": 480, "train_runtime": 1523.2979, "train_tokens_per_second": 1382.012 }, { "epoch": 1.0538213132400431, "grad_norm": 2.7770872116088867, "learning_rate": 7.2624245881856094e-06, "loss": 0.111, "num_input_tokens_seen": 2149888, "step": 490, "train_runtime": 1554.9287, "train_tokens_per_second": 1382.628 }, { "epoch": 1.0753498385360603, "grad_norm": 1.9737987518310547, "learning_rate": 7.161444169660723e-06, "loss": 0.113, "num_input_tokens_seen": 2194304, "step": 500, "train_runtime": 1586.2216, "train_tokens_per_second": 1383.353 }, { "epoch": 1.0968783638320776, "grad_norm": 1.2335457801818848, "learning_rate": 7.059367583445034e-06, "loss": 0.1303, "num_input_tokens_seen": 2238080, "step": 510, "train_runtime": 1617.0801, "train_tokens_per_second": 1384.025 }, { "epoch": 1.1184068891280947, "grad_norm": 2.525258779525757, "learning_rate": 6.956246597267438e-06, "loss": 0.1404, "num_input_tokens_seen": 2282368, "step": 520, "train_runtime": 1648.4109, "train_tokens_per_second": 1384.587 }, { "epoch": 1.1399354144241118, "grad_norm": 4.016520977020264, "learning_rate": 6.852133508520057e-06, "loss": 0.0972, "num_input_tokens_seen": 2325984, "step": 530, "train_runtime": 1679.3164, "train_tokens_per_second": 1385.078 }, { "epoch": 1.1614639397201292, "grad_norm": 1.405586838722229, "learning_rate": 6.747081117735829e-06, "loss": 0.1092, "num_input_tokens_seen": 2369664, "step": 540, "train_runtime": 1710.2475, "train_tokens_per_second": 1385.568 }, { "epoch": 1.1829924650161463, "grad_norm": 2.151442766189575, "learning_rate": 6.641142701810932e-06, "loss": 0.1186, "num_input_tokens_seen": 2413312, "step": 550, "train_runtime": 1741.213, "train_tokens_per_second": 1385.995 }, { "epoch": 1.2045209903121636, "grad_norm": 1.9706578254699707, "learning_rate": 6.534371986985618e-06, "loss": 0.1332, "num_input_tokens_seen": 2457120, "step": 560, "train_runtime": 1772.1204, "train_tokens_per_second": 1386.542 }, { "epoch": 1.2260495156081808, "grad_norm": 2.3035449981689453, "learning_rate": 6.426823121597169e-06, "loss": 0.1481, "num_input_tokens_seen": 2500736, "step": 570, "train_runtime": 1803.0834, "train_tokens_per_second": 1386.922 }, { "epoch": 1.247578040904198, "grad_norm": 3.713632106781006, "learning_rate": 6.318550648618785e-06, "loss": 0.1332, "num_input_tokens_seen": 2545056, "step": 580, "train_runtime": 1834.1935, "train_tokens_per_second": 1387.561 }, { "epoch": 1.2691065662002152, "grad_norm": 1.8667478561401367, "learning_rate": 6.209609477998339e-06, "loss": 0.0978, "num_input_tokens_seen": 2588416, "step": 590, "train_runtime": 1864.9784, "train_tokens_per_second": 1387.907 }, { "epoch": 1.2906350914962326, "grad_norm": 2.295342445373535, "learning_rate": 6.100054858811012e-06, "loss": 0.1176, "num_input_tokens_seen": 2632352, "step": 600, "train_runtime": 1896.108, "train_tokens_per_second": 1388.292 }, { "epoch": 1.3121636167922497, "grad_norm": 2.2867720127105713, "learning_rate": 5.989942351239954e-06, "loss": 0.1279, "num_input_tokens_seen": 2676640, "step": 610, "train_runtime": 1927.5126, "train_tokens_per_second": 1388.65 }, { "epoch": 1.333692142088267, "grad_norm": 2.1158223152160645, "learning_rate": 5.879327798399155e-06, "loss": 0.1407, "num_input_tokens_seen": 2719968, "step": 620, "train_runtime": 1958.2576, "train_tokens_per_second": 1388.974 }, { "epoch": 1.3552206673842842, "grad_norm": 4.076441287994385, "learning_rate": 5.768267298012841e-06, "loss": 0.1168, "num_input_tokens_seen": 2764352, "step": 630, "train_runtime": 1989.6781, "train_tokens_per_second": 1389.346 }, { "epoch": 1.3767491926803013, "grad_norm": 4.354236602783203, "learning_rate": 5.656817173965733e-06, "loss": 0.1188, "num_input_tokens_seen": 2808832, "step": 640, "train_runtime": 2021.0224, "train_tokens_per_second": 1389.807 }, { "epoch": 1.3982777179763186, "grad_norm": 4.40167236328125, "learning_rate": 5.545033947738624e-06, "loss": 0.1326, "num_input_tokens_seen": 2852192, "step": 650, "train_runtime": 2051.72, "train_tokens_per_second": 1390.147 }, { "epoch": 1.419806243272336, "grad_norm": 2.4845104217529297, "learning_rate": 5.4329743097437316e-06, "loss": 0.1331, "num_input_tokens_seen": 2896256, "step": 660, "train_runtime": 2082.7361, "train_tokens_per_second": 1390.602 }, { "epoch": 1.441334768568353, "grad_norm": 2.7233705520629883, "learning_rate": 5.320695090574386e-06, "loss": 0.1082, "num_input_tokens_seen": 2939552, "step": 670, "train_runtime": 2113.5367, "train_tokens_per_second": 1390.821 }, { "epoch": 1.4628632938643702, "grad_norm": 3.289949893951416, "learning_rate": 5.208253232183625e-06, "loss": 0.1184, "num_input_tokens_seen": 2984000, "step": 680, "train_runtime": 2144.7931, "train_tokens_per_second": 1391.276 }, { "epoch": 1.4843918191603875, "grad_norm": 4.015010833740234, "learning_rate": 5.095705759006311e-06, "loss": 0.0942, "num_input_tokens_seen": 3028192, "step": 690, "train_runtime": 2176.0229, "train_tokens_per_second": 1391.618 }, { "epoch": 1.5059203444564049, "grad_norm": 5.474874973297119, "learning_rate": 4.9831097490394195e-06, "loss": 0.1204, "num_input_tokens_seen": 3071392, "step": 700, "train_runtime": 2206.8218, "train_tokens_per_second": 1391.772 }, { "epoch": 1.527448869752422, "grad_norm": 2.4211018085479736, "learning_rate": 4.870522304895164e-06, "loss": 0.1358, "num_input_tokens_seen": 3114496, "step": 710, "train_runtime": 2237.5127, "train_tokens_per_second": 1391.946 }, { "epoch": 1.5489773950484391, "grad_norm": 2.5446665287017822, "learning_rate": 4.758000524841632e-06, "loss": 0.1313, "num_input_tokens_seen": 3158432, "step": 720, "train_runtime": 2268.6496, "train_tokens_per_second": 1392.208 }, { "epoch": 1.5705059203444565, "grad_norm": 5.643487453460693, "learning_rate": 4.645601473845636e-06, "loss": 0.0879, "num_input_tokens_seen": 3201888, "step": 730, "train_runtime": 2299.4823, "train_tokens_per_second": 1392.439 }, { "epoch": 1.5920344456404736, "grad_norm": 1.8654100894927979, "learning_rate": 4.533382154632442e-06, "loss": 0.0977, "num_input_tokens_seen": 3245856, "step": 740, "train_runtime": 2330.5679, "train_tokens_per_second": 1392.732 }, { "epoch": 1.6135629709364907, "grad_norm": 2.2264926433563232, "learning_rate": 4.421399478777064e-06, "loss": 0.1483, "num_input_tokens_seen": 3290208, "step": 750, "train_runtime": 2361.9169, "train_tokens_per_second": 1393.024 }, { "epoch": 1.635091496232508, "grad_norm": 2.8280999660491943, "learning_rate": 4.3097102378417985e-06, "loss": 0.1285, "num_input_tokens_seen": 3333152, "step": 760, "train_runtime": 2392.5926, "train_tokens_per_second": 1393.113 }, { "epoch": 1.6566200215285254, "grad_norm": 3.5213840007781982, "learning_rate": 4.198371074574597e-06, "loss": 0.1475, "num_input_tokens_seen": 3377664, "step": 770, "train_runtime": 2423.9491, "train_tokens_per_second": 1393.455 }, { "epoch": 1.6781485468245425, "grad_norm": 3.323622226715088, "learning_rate": 4.087438454182942e-06, "loss": 0.0904, "num_input_tokens_seen": 3422400, "step": 780, "train_runtime": 2455.5818, "train_tokens_per_second": 1393.723 }, { "epoch": 1.6996770721205596, "grad_norm": 4.368185997009277, "learning_rate": 3.976968635697732e-06, "loss": 0.1199, "num_input_tokens_seen": 3465760, "step": 790, "train_runtime": 2486.3362, "train_tokens_per_second": 1393.922 }, { "epoch": 1.721205597416577, "grad_norm": 3.0081822872161865, "learning_rate": 3.867017643441746e-06, "loss": 0.102, "num_input_tokens_seen": 3509760, "step": 800, "train_runtime": 2517.434, "train_tokens_per_second": 1394.182 }, { "epoch": 1.7427341227125943, "grad_norm": 3.7257721424102783, "learning_rate": 3.757641238617137e-06, "loss": 0.1194, "num_input_tokens_seen": 3554560, "step": 810, "train_runtime": 2549.4732, "train_tokens_per_second": 1394.233 }, { "epoch": 1.7642626480086114, "grad_norm": 3.8365535736083984, "learning_rate": 3.648894891026358e-06, "loss": 0.1507, "num_input_tokens_seen": 3599488, "step": 820, "train_runtime": 2581.0241, "train_tokens_per_second": 1394.597 }, { "epoch": 1.7857911733046286, "grad_norm": 2.1309561729431152, "learning_rate": 3.5408337509408764e-06, "loss": 0.1015, "num_input_tokens_seen": 3643680, "step": 830, "train_runtime": 2612.3216, "train_tokens_per_second": 1394.805 }, { "epoch": 1.807319698600646, "grad_norm": 2.5082457065582275, "learning_rate": 3.4335126211319412e-06, "loss": 0.1165, "num_input_tokens_seen": 3688160, "step": 840, "train_runtime": 2643.6717, "train_tokens_per_second": 1395.09 }, { "epoch": 1.8288482238966632, "grad_norm": 1.4419660568237305, "learning_rate": 3.32698592907757e-06, "loss": 0.0958, "num_input_tokens_seen": 3731392, "step": 850, "train_runtime": 2674.4286, "train_tokens_per_second": 1395.211 }, { "epoch": 1.8503767491926801, "grad_norm": 2.402513027191162, "learning_rate": 3.2213076993598857e-06, "loss": 0.1505, "num_input_tokens_seen": 3776128, "step": 860, "train_runtime": 2706.116, "train_tokens_per_second": 1395.405 }, { "epoch": 1.8719052744886975, "grad_norm": 0.9779609441757202, "learning_rate": 3.1165315262667535e-06, "loss": 0.1003, "num_input_tokens_seen": 3820896, "step": 870, "train_runtime": 2737.6181, "train_tokens_per_second": 1395.701 }, { "epoch": 1.8934337997847148, "grad_norm": 3.727255344390869, "learning_rate": 3.012710546611659e-06, "loss": 0.1483, "num_input_tokens_seen": 3864704, "step": 880, "train_runtime": 2768.6885, "train_tokens_per_second": 1395.861 }, { "epoch": 1.914962325080732, "grad_norm": 1.5679094791412354, "learning_rate": 2.9098974127856e-06, "loss": 0.117, "num_input_tokens_seen": 3908544, "step": 890, "train_runtime": 2799.6713, "train_tokens_per_second": 1396.072 }, { "epoch": 1.936490850376749, "grad_norm": 2.775408983230591, "learning_rate": 2.8081442660546126e-06, "loss": 0.1303, "num_input_tokens_seen": 3952576, "step": 900, "train_runtime": 2830.9247, "train_tokens_per_second": 1396.214 }, { "epoch": 1.9580193756727664, "grad_norm": 1.0387197732925415, "learning_rate": 2.7075027101165706e-06, "loss": 0.0971, "num_input_tokens_seen": 3996416, "step": 910, "train_runtime": 2862.0695, "train_tokens_per_second": 1396.338 }, { "epoch": 1.9795479009687837, "grad_norm": 3.794166326522827, "learning_rate": 2.6080237849305467e-06, "loss": 0.132, "num_input_tokens_seen": 4040736, "step": 920, "train_runtime": 2893.2903, "train_tokens_per_second": 1396.589 }, { "epoch": 2.0, "grad_norm": 1.547866702079773, "learning_rate": 2.5097579408321264e-06, "loss": 0.093, "num_input_tokens_seen": 4083200, "step": 930, "train_runtime": 2923.2158, "train_tokens_per_second": 1396.818 }, { "epoch": 2.0215285252960173, "grad_norm": 3.5177085399627686, "learning_rate": 2.4127550129477145e-06, "loss": 0.1324, "num_input_tokens_seen": 4127040, "step": 940, "train_runtime": 2954.2784, "train_tokens_per_second": 1396.971 }, { "epoch": 2.0430570505920342, "grad_norm": 1.8717275857925415, "learning_rate": 2.317064195920852e-06, "loss": 0.0841, "num_input_tokens_seen": 4170816, "step": 950, "train_runtime": 2985.3333, "train_tokens_per_second": 1397.102 }, { "epoch": 2.0645855758880516, "grad_norm": 1.233929991722107, "learning_rate": 2.2227340189633508e-06, "loss": 0.1138, "num_input_tokens_seen": 4214272, "step": 960, "train_runtime": 3016.1559, "train_tokens_per_second": 1397.233 }, { "epoch": 2.086114101184069, "grad_norm": 1.6053682565689087, "learning_rate": 2.1298123212439028e-06, "loss": 0.0892, "num_input_tokens_seen": 4258592, "step": 970, "train_runtime": 3047.3824, "train_tokens_per_second": 1397.459 }, { "epoch": 2.1076426264800863, "grad_norm": 2.4293172359466553, "learning_rate": 2.0383462276266347e-06, "loss": 0.1277, "num_input_tokens_seen": 4302656, "step": 980, "train_runtime": 3078.5923, "train_tokens_per_second": 1397.605 }, { "epoch": 2.129171151776103, "grad_norm": 2.0637197494506836, "learning_rate": 1.948382124771927e-06, "loss": 0.0968, "num_input_tokens_seen": 4345888, "step": 990, "train_runtime": 3109.3083, "train_tokens_per_second": 1397.703 }, { "epoch": 2.1506996770721205, "grad_norm": 3.5659446716308594, "learning_rate": 1.8599656376116026e-06, "loss": 0.1226, "num_input_tokens_seen": 4390528, "step": 1000, "train_runtime": 3140.7259, "train_tokens_per_second": 1397.934 }, { "epoch": 2.172228202368138, "grad_norm": 3.0801503658294678, "learning_rate": 1.773141606210431e-06, "loss": 0.1201, "num_input_tokens_seen": 4434784, "step": 1010, "train_runtime": 3178.3674, "train_tokens_per_second": 1395.303 }, { "epoch": 2.193756727664155, "grad_norm": 2.0641636848449707, "learning_rate": 1.687954063025663e-06, "loss": 0.0966, "num_input_tokens_seen": 4478976, "step": 1020, "train_runtime": 3209.6721, "train_tokens_per_second": 1395.462 }, { "epoch": 2.215285252960172, "grad_norm": 2.951422929763794, "learning_rate": 1.604446210576157e-06, "loss": 0.1143, "num_input_tokens_seen": 4523616, "step": 1030, "train_runtime": 3241.2178, "train_tokens_per_second": 1395.653 }, { "epoch": 2.2368137782561894, "grad_norm": 5.046944618225098, "learning_rate": 1.5226603995323897e-06, "loss": 0.1114, "num_input_tokens_seen": 4567264, "step": 1040, "train_runtime": 3272.1686, "train_tokens_per_second": 1395.791 }, { "epoch": 2.2583423035522068, "grad_norm": 1.3710857629776, "learning_rate": 1.4426381072384866e-06, "loss": 0.0981, "num_input_tokens_seen": 4611104, "step": 1050, "train_runtime": 3303.3652, "train_tokens_per_second": 1395.881 }, { "epoch": 2.2798708288482237, "grad_norm": 2.5878543853759766, "learning_rate": 1.3644199166771531e-06, "loss": 0.1135, "num_input_tokens_seen": 4655040, "step": 1060, "train_runtime": 3334.5323, "train_tokens_per_second": 1396.01 }, { "epoch": 2.301399354144241, "grad_norm": 2.481158494949341, "learning_rate": 1.2880454958881794e-06, "loss": 0.1081, "num_input_tokens_seen": 4698432, "step": 1070, "train_runtime": 3365.4557, "train_tokens_per_second": 1396.076 }, { "epoch": 2.3229278794402584, "grad_norm": 1.2142502069473267, "learning_rate": 1.2135535778509545e-06, "loss": 0.0685, "num_input_tokens_seen": 4742848, "step": 1080, "train_runtime": 3396.7938, "train_tokens_per_second": 1396.272 }, { "epoch": 2.3444564047362757, "grad_norm": 3.040208339691162, "learning_rate": 1.1409819408411898e-06, "loss": 0.0857, "num_input_tokens_seen": 4786944, "step": 1090, "train_runtime": 3427.8943, "train_tokens_per_second": 1396.468 }, { "epoch": 2.3659849300322926, "grad_norm": 1.4514607191085815, "learning_rate": 1.070367389271823e-06, "loss": 0.1008, "num_input_tokens_seen": 4830624, "step": 1100, "train_runtime": 3458.8433, "train_tokens_per_second": 1396.601 }, { "epoch": 2.38751345532831, "grad_norm": 3.533973455429077, "learning_rate": 1.001745735027801e-06, "loss": 0.1137, "num_input_tokens_seen": 4874944, "step": 1110, "train_runtime": 3490.3116, "train_tokens_per_second": 1396.707 }, { "epoch": 2.4090419806243273, "grad_norm": 4.195890426635742, "learning_rate": 9.351517793042408e-07, "loss": 0.1038, "num_input_tokens_seen": 4918496, "step": 1120, "train_runtime": 3521.354, "train_tokens_per_second": 1396.763 }, { "epoch": 2.4305705059203446, "grad_norm": 4.139116287231445, "learning_rate": 8.706192949571262e-07, "loss": 0.1194, "num_input_tokens_seen": 4961920, "step": 1130, "train_runtime": 3552.2441, "train_tokens_per_second": 1396.841 }, { "epoch": 2.4520990312163615, "grad_norm": 3.0998311042785645, "learning_rate": 8.081810093755537e-07, "loss": 0.1161, "num_input_tokens_seen": 5005440, "step": 1140, "train_runtime": 3583.1755, "train_tokens_per_second": 1396.928 }, { "epoch": 2.473627556512379, "grad_norm": 2.2539584636688232, "learning_rate": 7.478685878841629e-07, "loss": 0.1, "num_input_tokens_seen": 5049344, "step": 1150, "train_runtime": 3614.3079, "train_tokens_per_second": 1397.043 }, { "epoch": 2.495156081808396, "grad_norm": 3.1125545501708984, "learning_rate": 6.897126176841978e-07, "loss": 0.0996, "num_input_tokens_seen": 5092896, "step": 1160, "train_runtime": 3645.2176, "train_tokens_per_second": 1397.145 }, { "epoch": 2.5166846071044136, "grad_norm": 3.5130155086517334, "learning_rate": 6.337425923413276e-07, "loss": 0.0944, "num_input_tokens_seen": 5136928, "step": 1170, "train_runtime": 3676.3104, "train_tokens_per_second": 1397.305 }, { "epoch": 2.5382131324004304, "grad_norm": 2.059572696685791, "learning_rate": 5.799868968281075e-07, "loss": 0.08, "num_input_tokens_seen": 5180960, "step": 1180, "train_runtime": 3707.5494, "train_tokens_per_second": 1397.408 }, { "epoch": 2.559741657696448, "grad_norm": 4.341704845428467, "learning_rate": 5.284727931286526e-07, "loss": 0.0962, "num_input_tokens_seen": 5225376, "step": 1190, "train_runtime": 3738.9161, "train_tokens_per_second": 1397.564 }, { "epoch": 2.581270182992465, "grad_norm": 2.8424837589263916, "learning_rate": 4.792264064128327e-07, "loss": 0.094, "num_input_tokens_seen": 5268992, "step": 1200, "train_runtime": 3769.9587, "train_tokens_per_second": 1397.626 }, { "epoch": 2.602798708288482, "grad_norm": 3.76309871673584, "learning_rate": 4.322727117869951e-07, "loss": 0.1005, "num_input_tokens_seen": 5312992, "step": 1210, "train_runtime": 3801.0547, "train_tokens_per_second": 1397.768 }, { "epoch": 2.6243272335844994, "grad_norm": 2.470759153366089, "learning_rate": 3.8763552162794983e-07, "loss": 0.1167, "num_input_tokens_seen": 5356448, "step": 1220, "train_runtime": 3831.9201, "train_tokens_per_second": 1397.85 }, { "epoch": 2.6458557588805167, "grad_norm": 2.948512315750122, "learning_rate": 3.453374735066034e-07, "loss": 0.0907, "num_input_tokens_seen": 5400672, "step": 1230, "train_runtime": 3863.178, "train_tokens_per_second": 1397.987 }, { "epoch": 2.667384284176534, "grad_norm": 2.082956552505493, "learning_rate": 3.054000187074224e-07, "loss": 0.1074, "num_input_tokens_seen": 5444576, "step": 1240, "train_runtime": 3894.1783, "train_tokens_per_second": 1398.132 }, { "epoch": 2.6889128094725514, "grad_norm": 2.035034656524658, "learning_rate": 2.678434113494882e-07, "loss": 0.1128, "num_input_tokens_seen": 5488160, "step": 1250, "train_runtime": 3925.0458, "train_tokens_per_second": 1398.241 }, { "epoch": 2.7104413347685683, "grad_norm": 3.7168209552764893, "learning_rate": 2.326866981147091e-07, "loss": 0.1016, "num_input_tokens_seen": 5532000, "step": 1260, "train_runtime": 3956.0804, "train_tokens_per_second": 1398.354 }, { "epoch": 2.7319698600645856, "grad_norm": 4.349425315856934, "learning_rate": 1.999477085883711e-07, "loss": 0.1052, "num_input_tokens_seen": 5575808, "step": 1270, "train_runtime": 3987.1129, "train_tokens_per_second": 1398.458 }, { "epoch": 2.7534983853606025, "grad_norm": 1.8204060792922974, "learning_rate": 1.6964304621693516e-07, "loss": 0.0918, "num_input_tokens_seen": 5619200, "step": 1280, "train_runtime": 4017.8653, "train_tokens_per_second": 1398.554 }, { "epoch": 2.77502691065662, "grad_norm": 3.752577066421509, "learning_rate": 1.4178807988766419e-07, "loss": 0.109, "num_input_tokens_seen": 5662656, "step": 1290, "train_runtime": 4048.795, "train_tokens_per_second": 1398.603 }, { "epoch": 2.7965554359526372, "grad_norm": 3.749866247177124, "learning_rate": 1.1639693613435921e-07, "loss": 0.1224, "num_input_tokens_seen": 5706656, "step": 1300, "train_runtime": 4079.9279, "train_tokens_per_second": 1398.715 }, { "epoch": 2.8180839612486546, "grad_norm": 2.628767251968384, "learning_rate": 9.348249197313918e-08, "loss": 0.0992, "num_input_tokens_seen": 5751232, "step": 1310, "train_runtime": 4111.4798, "train_tokens_per_second": 1398.823 }, { "epoch": 2.839612486544672, "grad_norm": 0.7992174625396729, "learning_rate": 7.305636837191876e-08, "loss": 0.107, "num_input_tokens_seen": 5794976, "step": 1320, "train_runtime": 4142.503, "train_tokens_per_second": 1398.907 }, { "epoch": 2.861141011840689, "grad_norm": 3.0042312145233154, "learning_rate": 5.512892435687645e-08, "loss": 0.0944, "num_input_tokens_seen": 5838368, "step": 1330, "train_runtime": 4173.35, "train_tokens_per_second": 1398.964 }, { "epoch": 2.882669537136706, "grad_norm": 3.208315134048462, "learning_rate": 3.970925175892093e-08, "loss": 0.0867, "num_input_tokens_seen": 5881984, "step": 1340, "train_runtime": 4204.3268, "train_tokens_per_second": 1399.031 }, { "epoch": 2.9041980624327235, "grad_norm": 3.5772690773010254, "learning_rate": 2.6805170602803297e-08, "loss": 0.1075, "num_input_tokens_seen": 5925664, "step": 1350, "train_runtime": 4235.1869, "train_tokens_per_second": 1399.151 }, { "epoch": 2.9257265877287404, "grad_norm": 3.261751413345337, "learning_rate": 1.6423225141223854e-08, "loss": 0.1042, "num_input_tokens_seen": 5969408, "step": 1360, "train_runtime": 4266.2069, "train_tokens_per_second": 1399.231 }, { "epoch": 2.9472551130247577, "grad_norm": 4.744147300720215, "learning_rate": 8.568680535939177e-09, "loss": 0.0964, "num_input_tokens_seen": 6012576, "step": 1370, "train_runtime": 4297.0229, "train_tokens_per_second": 1399.242 }, { "epoch": 2.968783638320775, "grad_norm": 2.3966517448425293, "learning_rate": 3.2455201875586372e-09, "loss": 0.0922, "num_input_tokens_seen": 6056000, "step": 1380, "train_runtime": 4328.462, "train_tokens_per_second": 1399.111 }, { "epoch": 2.9903121636167924, "grad_norm": 1.2950575351715088, "learning_rate": 4.5644371537756363e-10, "loss": 0.115, "num_input_tokens_seen": 6100192, "step": 1390, "train_runtime": 4359.7222, "train_tokens_per_second": 1399.216 }, { "epoch": 3.0, "num_input_tokens_seen": 6120032, "step": 1395, "total_flos": 4.115769119160883e+17, "train_loss": 0.1491297289889346, "train_runtime": 4379.932, "train_samples_per_second": 2.545, "train_steps_per_second": 0.318 } ], "logging_steps": 10, "max_steps": 1395, "num_input_tokens_seen": 6120032, "num_train_epochs": 3, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 4.115769119160883e+17, "train_batch_size": 4, "trial_name": null, "trial_params": null }