{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 78, "global_step": 778, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0012857602057216328, "grad_norm": 59.91437911987305, "learning_rate": 0.0, "loss": 2.8221, "num_input_tokens_seen": 135296, "step": 1, "train_runtime": 22.8878, "train_tokens_per_second": 5911.283 }, { "epoch": 0.0025715204114432656, "grad_norm": 54.928260803222656, "learning_rate": 4.000000000000001e-06, "loss": 2.8194, "num_input_tokens_seen": 295488, "step": 2, "train_runtime": 38.3163, "train_tokens_per_second": 7711.806 }, { "epoch": 0.003857280617164899, "grad_norm": 46.19917297363281, "learning_rate": 8.000000000000001e-06, "loss": 2.5824, "num_input_tokens_seen": 390880, "step": 3, "train_runtime": 46.3319, "train_tokens_per_second": 8436.522 }, { "epoch": 0.005143040822886531, "grad_norm": 29.48894691467285, "learning_rate": 1.2e-05, "loss": 2.1127, "num_input_tokens_seen": 527584, "step": 4, "train_runtime": 58.9913, "train_tokens_per_second": 8943.425 }, { "epoch": 0.006428801028608165, "grad_norm": 12.14394474029541, "learning_rate": 1.6000000000000003e-05, "loss": 1.7084, "num_input_tokens_seen": 644736, "step": 5, "train_runtime": 69.2931, "train_tokens_per_second": 9304.479 }, { "epoch": 0.007714561234329798, "grad_norm": 9.809494018554688, "learning_rate": 2e-05, "loss": 1.681, "num_input_tokens_seen": 777056, "step": 6, "train_runtime": 81.2029, "train_tokens_per_second": 9569.309 }, { "epoch": 0.00900032144005143, "grad_norm": 8.21720027923584, "learning_rate": 1.997412677878396e-05, "loss": 1.6744, "num_input_tokens_seen": 910560, "step": 7, "train_runtime": 93.321, "train_tokens_per_second": 9757.29 }, { "epoch": 0.010286081645773062, "grad_norm": 7.667925834655762, "learning_rate": 1.994825355756792e-05, "loss": 1.4179, "num_input_tokens_seen": 1062912, "step": 8, "train_runtime": 107.311, "train_tokens_per_second": 9904.967 }, { "epoch": 0.011571841851494697, "grad_norm": 6.243086814880371, "learning_rate": 1.9922380336351877e-05, "loss": 1.3252, "num_input_tokens_seen": 1152448, "step": 9, "train_runtime": 114.8712, "train_tokens_per_second": 10032.519 }, { "epoch": 0.01285760205721633, "grad_norm": 4.096212863922119, "learning_rate": 1.9896507115135837e-05, "loss": 1.2179, "num_input_tokens_seen": 1251424, "step": 10, "train_runtime": 123.394, "train_tokens_per_second": 10141.69 }, { "epoch": 0.014143362262937963, "grad_norm": 3.7918293476104736, "learning_rate": 1.9870633893919795e-05, "loss": 1.3145, "num_input_tokens_seen": 1401632, "step": 11, "train_runtime": 137.3677, "train_tokens_per_second": 10203.506 }, { "epoch": 0.015429122468659595, "grad_norm": 2.6636881828308105, "learning_rate": 1.9844760672703752e-05, "loss": 1.1167, "num_input_tokens_seen": 1485088, "step": 12, "train_runtime": 144.3866, "train_tokens_per_second": 10285.495 }, { "epoch": 0.01671488267438123, "grad_norm": 3.1536850929260254, "learning_rate": 1.9818887451487713e-05, "loss": 1.2975, "num_input_tokens_seen": 1599424, "step": 13, "train_runtime": 154.4368, "train_tokens_per_second": 10356.492 }, { "epoch": 0.01800064288010286, "grad_norm": 2.806964874267578, "learning_rate": 1.979301423027167e-05, "loss": 1.2166, "num_input_tokens_seen": 1688192, "step": 14, "train_runtime": 161.9986, "train_tokens_per_second": 10421.031 }, { "epoch": 0.019286403085824494, "grad_norm": 2.8832125663757324, "learning_rate": 1.9767141009055627e-05, "loss": 1.3103, "num_input_tokens_seen": 1779040, "step": 15, "train_runtime": 169.8234, "train_tokens_per_second": 10475.825 }, { "epoch": 0.020572163291546125, "grad_norm": 2.3326032161712646, "learning_rate": 1.9741267787839588e-05, "loss": 1.1936, "num_input_tokens_seen": 1898976, "step": 16, "train_runtime": 180.4047, "train_tokens_per_second": 10526.202 }, { "epoch": 0.02185792349726776, "grad_norm": 2.495771646499634, "learning_rate": 1.971539456662355e-05, "loss": 1.238, "num_input_tokens_seen": 2002496, "step": 17, "train_runtime": 189.3388, "train_tokens_per_second": 10576.258 }, { "epoch": 0.023143683702989394, "grad_norm": 2.3127689361572266, "learning_rate": 1.9689521345407506e-05, "loss": 1.2386, "num_input_tokens_seen": 2148032, "step": 18, "train_runtime": 202.5493, "train_tokens_per_second": 10604.983 }, { "epoch": 0.024429443908711025, "grad_norm": 2.1507444381713867, "learning_rate": 1.9663648124191463e-05, "loss": 1.1955, "num_input_tokens_seen": 2273632, "step": 19, "train_runtime": 214.0022, "train_tokens_per_second": 10624.337 }, { "epoch": 0.02571520411443266, "grad_norm": 2.7235100269317627, "learning_rate": 1.963777490297542e-05, "loss": 1.2066, "num_input_tokens_seen": 2383520, "step": 20, "train_runtime": 223.8834, "train_tokens_per_second": 10646.255 }, { "epoch": 0.02700096432015429, "grad_norm": 2.299577236175537, "learning_rate": 1.961190168175938e-05, "loss": 1.1685, "num_input_tokens_seen": 2483456, "step": 21, "train_runtime": 232.4787, "train_tokens_per_second": 10682.509 }, { "epoch": 0.028286724525875925, "grad_norm": 2.1814215183258057, "learning_rate": 1.9586028460543338e-05, "loss": 1.1816, "num_input_tokens_seen": 2628480, "step": 22, "train_runtime": 245.7507, "train_tokens_per_second": 10695.718 }, { "epoch": 0.029572484731597556, "grad_norm": 1.9551724195480347, "learning_rate": 1.95601552393273e-05, "loss": 1.1728, "num_input_tokens_seen": 2741984, "step": 23, "train_runtime": 255.7533, "train_tokens_per_second": 10721.207 }, { "epoch": 0.03085824493731919, "grad_norm": 1.9535983800888062, "learning_rate": 1.9534282018111256e-05, "loss": 1.2263, "num_input_tokens_seen": 2827744, "step": 24, "train_runtime": 263.0783, "train_tokens_per_second": 10748.679 }, { "epoch": 0.032144005143040826, "grad_norm": 2.2656548023223877, "learning_rate": 1.9508408796895217e-05, "loss": 1.1648, "num_input_tokens_seen": 2926304, "step": 25, "train_runtime": 271.5983, "train_tokens_per_second": 10774.384 }, { "epoch": 0.03342976534876246, "grad_norm": 2.323800563812256, "learning_rate": 1.9482535575679174e-05, "loss": 1.1831, "num_input_tokens_seen": 3039168, "step": 26, "train_runtime": 281.843, "train_tokens_per_second": 10783.195 }, { "epoch": 0.03471552555448409, "grad_norm": 1.9560903310775757, "learning_rate": 1.945666235446313e-05, "loss": 1.2156, "num_input_tokens_seen": 3162080, "step": 27, "train_runtime": 293.1326, "train_tokens_per_second": 10787.199 }, { "epoch": 0.03600128576020572, "grad_norm": 1.7636638879776, "learning_rate": 1.943078913324709e-05, "loss": 1.1564, "num_input_tokens_seen": 3277408, "step": 28, "train_runtime": 303.3144, "train_tokens_per_second": 10805.316 }, { "epoch": 0.03728704596592736, "grad_norm": 1.9402304887771606, "learning_rate": 1.940491591203105e-05, "loss": 1.2378, "num_input_tokens_seen": 3393408, "step": 29, "train_runtime": 313.5538, "train_tokens_per_second": 10822.41 }, { "epoch": 0.03857280617164899, "grad_norm": 2.0136935710906982, "learning_rate": 1.937904269081501e-05, "loss": 1.2205, "num_input_tokens_seen": 3493664, "step": 30, "train_runtime": 322.3163, "train_tokens_per_second": 10839.242 }, { "epoch": 0.03985856637737062, "grad_norm": 2.0718331336975098, "learning_rate": 1.9353169469598967e-05, "loss": 1.2168, "num_input_tokens_seen": 3632128, "step": 31, "train_runtime": 351.6221, "train_tokens_per_second": 10329.636 }, { "epoch": 0.04114432658309225, "grad_norm": 1.8790080547332764, "learning_rate": 1.9327296248382924e-05, "loss": 1.1357, "num_input_tokens_seen": 3740256, "step": 32, "train_runtime": 360.9507, "train_tokens_per_second": 10362.236 }, { "epoch": 0.04243008678881389, "grad_norm": 1.775802731513977, "learning_rate": 1.9301423027166882e-05, "loss": 1.1974, "num_input_tokens_seen": 3836320, "step": 33, "train_runtime": 369.242, "train_tokens_per_second": 10389.716 }, { "epoch": 0.04371584699453552, "grad_norm": 1.7465744018554688, "learning_rate": 1.9275549805950842e-05, "loss": 1.1552, "num_input_tokens_seen": 3973216, "step": 34, "train_runtime": 381.9458, "train_tokens_per_second": 10402.566 }, { "epoch": 0.04500160720025715, "grad_norm": 1.946832299232483, "learning_rate": 1.9249676584734803e-05, "loss": 1.0835, "num_input_tokens_seen": 4098496, "step": 35, "train_runtime": 393.2749, "train_tokens_per_second": 10421.453 }, { "epoch": 0.04628736740597879, "grad_norm": 1.8845430612564087, "learning_rate": 1.922380336351876e-05, "loss": 1.2099, "num_input_tokens_seen": 4211328, "step": 36, "train_runtime": 403.0748, "train_tokens_per_second": 10448.006 }, { "epoch": 0.04757312761170042, "grad_norm": 1.9792522192001343, "learning_rate": 1.9197930142302718e-05, "loss": 1.1743, "num_input_tokens_seen": 4354368, "step": 37, "train_runtime": 416.1989, "train_tokens_per_second": 10462.229 }, { "epoch": 0.04885888781742205, "grad_norm": 1.7486963272094727, "learning_rate": 1.9172056921086678e-05, "loss": 1.1916, "num_input_tokens_seen": 4459872, "step": 38, "train_runtime": 425.2452, "train_tokens_per_second": 10487.765 }, { "epoch": 0.05014464802314368, "grad_norm": 1.8029528856277466, "learning_rate": 1.9146183699870636e-05, "loss": 1.2058, "num_input_tokens_seen": 4586752, "step": 39, "train_runtime": 436.5305, "train_tokens_per_second": 10507.289 }, { "epoch": 0.05143040822886532, "grad_norm": 1.6773114204406738, "learning_rate": 1.9120310478654593e-05, "loss": 1.171, "num_input_tokens_seen": 4679744, "step": 40, "train_runtime": 444.5403, "train_tokens_per_second": 10527.152 }, { "epoch": 0.05271616843458695, "grad_norm": 2.0230824947357178, "learning_rate": 1.909443725743855e-05, "loss": 1.1621, "num_input_tokens_seen": 4834496, "step": 41, "train_runtime": 459.2262, "train_tokens_per_second": 10527.482 }, { "epoch": 0.05400192864030858, "grad_norm": 1.7988804578781128, "learning_rate": 1.906856403622251e-05, "loss": 1.1448, "num_input_tokens_seen": 4924224, "step": 42, "train_runtime": 466.8323, "train_tokens_per_second": 10548.165 }, { "epoch": 0.05528768884603021, "grad_norm": 1.8624871969223022, "learning_rate": 1.904269081500647e-05, "loss": 1.0607, "num_input_tokens_seen": 5027584, "step": 43, "train_runtime": 475.733, "train_tokens_per_second": 10568.078 }, { "epoch": 0.05657344905175185, "grad_norm": 1.902448296546936, "learning_rate": 1.901681759379043e-05, "loss": 1.2209, "num_input_tokens_seen": 5147008, "step": 44, "train_runtime": 486.1981, "train_tokens_per_second": 10586.237 }, { "epoch": 0.05785920925747348, "grad_norm": 1.875640869140625, "learning_rate": 1.8990944372574386e-05, "loss": 1.1073, "num_input_tokens_seen": 5265504, "step": 45, "train_runtime": 497.0036, "train_tokens_per_second": 10594.498 }, { "epoch": 0.05914496946319511, "grad_norm": 1.8521565198898315, "learning_rate": 1.8965071151358347e-05, "loss": 1.1615, "num_input_tokens_seen": 5367456, "step": 46, "train_runtime": 505.7756, "train_tokens_per_second": 10612.328 }, { "epoch": 0.060430729668916744, "grad_norm": 1.8101763725280762, "learning_rate": 1.8939197930142304e-05, "loss": 1.0999, "num_input_tokens_seen": 5491136, "step": 47, "train_runtime": 516.6042, "train_tokens_per_second": 10629.291 }, { "epoch": 0.06171648987463838, "grad_norm": 1.81596040725708, "learning_rate": 1.8913324708926265e-05, "loss": 1.0616, "num_input_tokens_seen": 5608224, "step": 48, "train_runtime": 527.1638, "train_tokens_per_second": 10638.484 }, { "epoch": 0.06300225008036, "grad_norm": 1.988157868385315, "learning_rate": 1.8887451487710222e-05, "loss": 1.2014, "num_input_tokens_seen": 5729248, "step": 49, "train_runtime": 538.0492, "train_tokens_per_second": 10648.187 }, { "epoch": 0.06428801028608165, "grad_norm": 1.8147128820419312, "learning_rate": 1.886157826649418e-05, "loss": 1.0791, "num_input_tokens_seen": 5888672, "step": 50, "train_runtime": 552.8286, "train_tokens_per_second": 10651.895 }, { "epoch": 0.06557377049180328, "grad_norm": 1.8205593824386597, "learning_rate": 1.883570504527814e-05, "loss": 1.1579, "num_input_tokens_seen": 6022656, "step": 51, "train_runtime": 565.0367, "train_tokens_per_second": 10658.875 }, { "epoch": 0.06685953069752491, "grad_norm": 1.8702155351638794, "learning_rate": 1.8809831824062097e-05, "loss": 1.1736, "num_input_tokens_seen": 6122848, "step": 52, "train_runtime": 573.6417, "train_tokens_per_second": 10673.646 }, { "epoch": 0.06814529090324654, "grad_norm": 2.053255796432495, "learning_rate": 1.8783958602846054e-05, "loss": 1.1884, "num_input_tokens_seen": 6219968, "step": 53, "train_runtime": 581.9801, "train_tokens_per_second": 10687.596 }, { "epoch": 0.06943105110896818, "grad_norm": 1.8326001167297363, "learning_rate": 1.8758085381630015e-05, "loss": 1.1875, "num_input_tokens_seen": 6330400, "step": 54, "train_runtime": 591.5047, "train_tokens_per_second": 10702.198 }, { "epoch": 0.0707168113146898, "grad_norm": 1.9650863409042358, "learning_rate": 1.8732212160413976e-05, "loss": 1.1747, "num_input_tokens_seen": 6500608, "step": 55, "train_runtime": 607.6429, "train_tokens_per_second": 10698.072 }, { "epoch": 0.07200257152041144, "grad_norm": 1.8934389352798462, "learning_rate": 1.8706338939197933e-05, "loss": 1.1195, "num_input_tokens_seen": 6600288, "step": 56, "train_runtime": 616.1735, "train_tokens_per_second": 10711.735 }, { "epoch": 0.07328833172613308, "grad_norm": 1.8143988847732544, "learning_rate": 1.868046571798189e-05, "loss": 1.1152, "num_input_tokens_seen": 6713184, "step": 57, "train_runtime": 625.8716, "train_tokens_per_second": 10726.135 }, { "epoch": 0.07457409193185471, "grad_norm": 1.8745934963226318, "learning_rate": 1.8654592496765847e-05, "loss": 1.1131, "num_input_tokens_seen": 6854400, "step": 58, "train_runtime": 638.8924, "train_tokens_per_second": 10728.567 }, { "epoch": 0.07585985213757634, "grad_norm": 1.8524185419082642, "learning_rate": 1.8628719275549808e-05, "loss": 1.0552, "num_input_tokens_seen": 6951744, "step": 59, "train_runtime": 647.376, "train_tokens_per_second": 10738.341 }, { "epoch": 0.07714561234329798, "grad_norm": 1.8481533527374268, "learning_rate": 1.8602846054333765e-05, "loss": 1.1928, "num_input_tokens_seen": 7081184, "step": 60, "train_runtime": 659.3929, "train_tokens_per_second": 10738.945 }, { "epoch": 0.0784313725490196, "grad_norm": 1.8214608430862427, "learning_rate": 1.8576972833117726e-05, "loss": 1.1535, "num_input_tokens_seen": 7226528, "step": 61, "train_runtime": 688.7221, "train_tokens_per_second": 10492.661 }, { "epoch": 0.07971713275474124, "grad_norm": 1.8268235921859741, "learning_rate": 1.8551099611901683e-05, "loss": 1.0817, "num_input_tokens_seen": 7317344, "step": 62, "train_runtime": 696.3751, "train_tokens_per_second": 10507.762 }, { "epoch": 0.08100289296046287, "grad_norm": 1.8014057874679565, "learning_rate": 1.8525226390685644e-05, "loss": 1.1799, "num_input_tokens_seen": 7473824, "step": 63, "train_runtime": 711.0738, "train_tokens_per_second": 10510.616 }, { "epoch": 0.0822886531661845, "grad_norm": 1.826602816581726, "learning_rate": 1.84993531694696e-05, "loss": 1.1546, "num_input_tokens_seen": 7575392, "step": 64, "train_runtime": 719.8185, "train_tokens_per_second": 10524.031 }, { "epoch": 0.08357441337190614, "grad_norm": 1.7211124897003174, "learning_rate": 1.847347994825356e-05, "loss": 1.1899, "num_input_tokens_seen": 7723680, "step": 65, "train_runtime": 733.4703, "train_tokens_per_second": 10530.324 }, { "epoch": 0.08486017357762778, "grad_norm": 1.7656164169311523, "learning_rate": 1.8447606727037516e-05, "loss": 1.2178, "num_input_tokens_seen": 7850144, "step": 66, "train_runtime": 745.1189, "train_tokens_per_second": 10535.425 }, { "epoch": 0.08614593378334941, "grad_norm": 1.8083853721618652, "learning_rate": 1.8421733505821476e-05, "loss": 1.1542, "num_input_tokens_seen": 7950752, "step": 67, "train_runtime": 753.8917, "train_tokens_per_second": 10546.278 }, { "epoch": 0.08743169398907104, "grad_norm": 1.7961894273757935, "learning_rate": 1.8395860284605437e-05, "loss": 1.044, "num_input_tokens_seen": 8080160, "step": 68, "train_runtime": 765.8094, "train_tokens_per_second": 10551.138 }, { "epoch": 0.08871745419479267, "grad_norm": 1.994905710220337, "learning_rate": 1.8369987063389394e-05, "loss": 1.1235, "num_input_tokens_seen": 8218784, "step": 69, "train_runtime": 778.4148, "train_tokens_per_second": 10558.36 }, { "epoch": 0.0900032144005143, "grad_norm": 1.9451382160186768, "learning_rate": 1.834411384217335e-05, "loss": 1.1517, "num_input_tokens_seen": 8333600, "step": 70, "train_runtime": 788.6364, "train_tokens_per_second": 10567.1 }, { "epoch": 0.09128897460623593, "grad_norm": 1.8312456607818604, "learning_rate": 1.8318240620957312e-05, "loss": 1.0547, "num_input_tokens_seen": 8460128, "step": 71, "train_runtime": 799.7803, "train_tokens_per_second": 10578.065 }, { "epoch": 0.09257473481195758, "grad_norm": 1.9686640501022339, "learning_rate": 1.829236739974127e-05, "loss": 1.2261, "num_input_tokens_seen": 8536256, "step": 72, "train_runtime": 806.2621, "train_tokens_per_second": 10587.446 }, { "epoch": 0.09386049501767921, "grad_norm": 1.8814424276351929, "learning_rate": 1.8266494178525227e-05, "loss": 1.0726, "num_input_tokens_seen": 8641280, "step": 73, "train_runtime": 815.3389, "train_tokens_per_second": 10598.39 }, { "epoch": 0.09514625522340084, "grad_norm": 1.9460242986679077, "learning_rate": 1.8240620957309187e-05, "loss": 1.1726, "num_input_tokens_seen": 8743456, "step": 74, "train_runtime": 824.1743, "train_tokens_per_second": 10608.746 }, { "epoch": 0.09643201542912247, "grad_norm": 2.0222864151000977, "learning_rate": 1.8214747736093145e-05, "loss": 1.1902, "num_input_tokens_seen": 8850720, "step": 75, "train_runtime": 833.6218, "train_tokens_per_second": 10617.189 }, { "epoch": 0.0977177756348441, "grad_norm": 1.943700909614563, "learning_rate": 1.8188874514877105e-05, "loss": 1.1683, "num_input_tokens_seen": 8990112, "step": 76, "train_runtime": 846.3567, "train_tokens_per_second": 10622.131 }, { "epoch": 0.09900353584056573, "grad_norm": 2.1447455883026123, "learning_rate": 1.8163001293661063e-05, "loss": 1.1458, "num_input_tokens_seen": 9074080, "step": 77, "train_runtime": 853.5667, "train_tokens_per_second": 10630.78 }, { "epoch": 0.10028929604628736, "grad_norm": 2.0305962562561035, "learning_rate": 1.813712807244502e-05, "loss": 1.0369, "num_input_tokens_seen": 9180160, "step": 78, "train_runtime": 862.9817, "train_tokens_per_second": 10637.723 }, { "epoch": 0.10028929604628736, "eval_loss": 1.1576727628707886, "eval_runtime": 23.0724, "eval_samples_per_second": 43.082, "eval_steps_per_second": 1.387, "num_input_tokens_seen": 9180160, "step": 78 }, { "epoch": 0.101575056252009, "grad_norm": 1.998412847518921, "learning_rate": 1.8111254851228977e-05, "loss": 1.145, "num_input_tokens_seen": 9270560, "step": 79, "train_runtime": 893.8501, "train_tokens_per_second": 10371.492 }, { "epoch": 0.10286081645773064, "grad_norm": 1.8889389038085938, "learning_rate": 1.8085381630012938e-05, "loss": 1.1677, "num_input_tokens_seen": 9389504, "step": 80, "train_runtime": 904.2477, "train_tokens_per_second": 10383.774 }, { "epoch": 0.10414657666345227, "grad_norm": 1.8141217231750488, "learning_rate": 1.80595084087969e-05, "loss": 1.0648, "num_input_tokens_seen": 9498464, "step": 81, "train_runtime": 913.7098, "train_tokens_per_second": 10395.494 }, { "epoch": 0.1054323368691739, "grad_norm": 1.8328213691711426, "learning_rate": 1.8033635187580856e-05, "loss": 1.1208, "num_input_tokens_seen": 9619936, "step": 82, "train_runtime": 924.4896, "train_tokens_per_second": 10405.672 }, { "epoch": 0.10671809707489553, "grad_norm": 1.795311689376831, "learning_rate": 1.8007761966364813e-05, "loss": 1.0181, "num_input_tokens_seen": 9726976, "step": 83, "train_runtime": 933.8495, "train_tokens_per_second": 10416.0 }, { "epoch": 0.10800385728061716, "grad_norm": 1.8454675674438477, "learning_rate": 1.7981888745148774e-05, "loss": 1.0702, "num_input_tokens_seen": 9828896, "step": 84, "train_runtime": 942.6626, "train_tokens_per_second": 10426.738 }, { "epoch": 0.1092896174863388, "grad_norm": 1.9122002124786377, "learning_rate": 1.795601552393273e-05, "loss": 1.184, "num_input_tokens_seen": 10007680, "step": 85, "train_runtime": 960.0623, "train_tokens_per_second": 10423.99 }, { "epoch": 0.11057537769206043, "grad_norm": 1.873637318611145, "learning_rate": 1.7930142302716688e-05, "loss": 1.1323, "num_input_tokens_seen": 10161088, "step": 86, "train_runtime": 974.6068, "train_tokens_per_second": 10425.833 }, { "epoch": 0.11186113789778207, "grad_norm": 1.7707033157348633, "learning_rate": 1.790426908150065e-05, "loss": 1.0968, "num_input_tokens_seen": 10247072, "step": 87, "train_runtime": 981.9572, "train_tokens_per_second": 10435.355 }, { "epoch": 0.1131468981035037, "grad_norm": 1.7864853143692017, "learning_rate": 1.7878395860284606e-05, "loss": 1.0646, "num_input_tokens_seen": 10438112, "step": 88, "train_runtime": 1000.9105, "train_tokens_per_second": 10428.617 }, { "epoch": 0.11443265830922533, "grad_norm": 1.8133771419525146, "learning_rate": 1.7852522639068567e-05, "loss": 1.0905, "num_input_tokens_seen": 10559456, "step": 89, "train_runtime": 1012.136, "train_tokens_per_second": 10432.843 }, { "epoch": 0.11571841851494696, "grad_norm": 1.854591965675354, "learning_rate": 1.7826649417852524e-05, "loss": 1.1079, "num_input_tokens_seen": 10675840, "step": 90, "train_runtime": 1022.5885, "train_tokens_per_second": 10440.015 }, { "epoch": 0.1170041787206686, "grad_norm": 1.7617478370666504, "learning_rate": 1.780077619663648e-05, "loss": 1.0203, "num_input_tokens_seen": 10791936, "step": 91, "train_runtime": 1048.7392, "train_tokens_per_second": 10290.39 }, { "epoch": 0.11828993892639023, "grad_norm": 1.9446653127670288, "learning_rate": 1.7774902975420442e-05, "loss": 1.097, "num_input_tokens_seen": 10917536, "step": 92, "train_runtime": 1059.9578, "train_tokens_per_second": 10299.972 }, { "epoch": 0.11957569913211186, "grad_norm": 1.8482822179794312, "learning_rate": 1.7749029754204403e-05, "loss": 1.1365, "num_input_tokens_seen": 11021824, "step": 93, "train_runtime": 1069.2663, "train_tokens_per_second": 10307.838 }, { "epoch": 0.12086145933783349, "grad_norm": 1.8727803230285645, "learning_rate": 1.772315653298836e-05, "loss": 1.1018, "num_input_tokens_seen": 11159872, "step": 94, "train_runtime": 1081.6899, "train_tokens_per_second": 10317.071 }, { "epoch": 0.12214721954355513, "grad_norm": 1.779184341430664, "learning_rate": 1.7697283311772317e-05, "loss": 1.0668, "num_input_tokens_seen": 11258336, "step": 95, "train_runtime": 1090.2473, "train_tokens_per_second": 10326.406 }, { "epoch": 0.12343297974927676, "grad_norm": 1.8586459159851074, "learning_rate": 1.7671410090556274e-05, "loss": 1.1594, "num_input_tokens_seen": 11381312, "step": 96, "train_runtime": 1101.6291, "train_tokens_per_second": 10331.347 }, { "epoch": 0.1247187399549984, "grad_norm": 1.8665542602539062, "learning_rate": 1.7645536869340235e-05, "loss": 1.108, "num_input_tokens_seen": 11554048, "step": 97, "train_runtime": 1118.3041, "train_tokens_per_second": 10331.759 }, { "epoch": 0.12600450016072, "grad_norm": 1.8169111013412476, "learning_rate": 1.7619663648124192e-05, "loss": 1.1525, "num_input_tokens_seen": 11717152, "step": 98, "train_runtime": 1134.1337, "train_tokens_per_second": 10331.367 }, { "epoch": 0.12729026036644167, "grad_norm": 1.9255194664001465, "learning_rate": 1.759379042690815e-05, "loss": 1.0878, "num_input_tokens_seen": 11854432, "step": 99, "train_runtime": 1146.8016, "train_tokens_per_second": 10336.951 }, { "epoch": 0.1285760205721633, "grad_norm": 1.9415030479431152, "learning_rate": 1.756791720569211e-05, "loss": 1.1299, "num_input_tokens_seen": 11979232, "step": 100, "train_runtime": 1158.3947, "train_tokens_per_second": 10341.235 }, { "epoch": 0.12986178077788493, "grad_norm": 1.9196245670318604, "learning_rate": 1.754204398447607e-05, "loss": 1.124, "num_input_tokens_seen": 12144416, "step": 101, "train_runtime": 1173.9193, "train_tokens_per_second": 10345.188 }, { "epoch": 0.13114754098360656, "grad_norm": 1.8218384981155396, "learning_rate": 1.7516170763260028e-05, "loss": 1.0596, "num_input_tokens_seen": 12261408, "step": 102, "train_runtime": 1184.2447, "train_tokens_per_second": 10353.779 }, { "epoch": 0.1324333011893282, "grad_norm": 1.86562979221344, "learning_rate": 1.7490297542043985e-05, "loss": 1.0873, "num_input_tokens_seen": 12384448, "step": 103, "train_runtime": 1194.8569, "train_tokens_per_second": 10364.796 }, { "epoch": 0.13371906139504983, "grad_norm": 1.9434869289398193, "learning_rate": 1.7464424320827943e-05, "loss": 1.1354, "num_input_tokens_seen": 12476352, "step": 104, "train_runtime": 1202.6401, "train_tokens_per_second": 10374.136 }, { "epoch": 0.13500482160077146, "grad_norm": 1.9082143306732178, "learning_rate": 1.7438551099611903e-05, "loss": 1.0588, "num_input_tokens_seen": 12562464, "step": 105, "train_runtime": 1209.8616, "train_tokens_per_second": 10383.39 }, { "epoch": 0.1362905818064931, "grad_norm": 1.7863415479660034, "learning_rate": 1.7412677878395864e-05, "loss": 1.1061, "num_input_tokens_seen": 12654304, "step": 106, "train_runtime": 1217.5491, "train_tokens_per_second": 10393.26 }, { "epoch": 0.13757634201221472, "grad_norm": 1.872205138206482, "learning_rate": 1.738680465717982e-05, "loss": 0.9919, "num_input_tokens_seen": 12782144, "step": 107, "train_runtime": 1229.0168, "train_tokens_per_second": 10400.3 }, { "epoch": 0.13886210221793635, "grad_norm": 2.2330684661865234, "learning_rate": 1.736093143596378e-05, "loss": 1.1528, "num_input_tokens_seen": 12899840, "step": 108, "train_runtime": 1239.2467, "train_tokens_per_second": 10409.421 }, { "epoch": 0.14014786242365798, "grad_norm": 2.096357822418213, "learning_rate": 1.733505821474774e-05, "loss": 1.0917, "num_input_tokens_seen": 13043392, "step": 109, "train_runtime": 1252.1584, "train_tokens_per_second": 10416.727 }, { "epoch": 0.1414336226293796, "grad_norm": 1.9565867185592651, "learning_rate": 1.7309184993531696e-05, "loss": 1.0547, "num_input_tokens_seen": 13188448, "step": 110, "train_runtime": 1265.437, "train_tokens_per_second": 10422.05 }, { "epoch": 0.14271938283510124, "grad_norm": 1.9779455661773682, "learning_rate": 1.7283311772315654e-05, "loss": 1.0885, "num_input_tokens_seen": 13275616, "step": 111, "train_runtime": 1272.8268, "train_tokens_per_second": 10430.026 }, { "epoch": 0.14400514304082287, "grad_norm": 1.8848296403884888, "learning_rate": 1.725743855109961e-05, "loss": 1.0563, "num_input_tokens_seen": 13401984, "step": 112, "train_runtime": 1284.164, "train_tokens_per_second": 10436.35 }, { "epoch": 0.1452909032465445, "grad_norm": 1.8709964752197266, "learning_rate": 1.723156532988357e-05, "loss": 1.1049, "num_input_tokens_seen": 13516096, "step": 113, "train_runtime": 1294.3698, "train_tokens_per_second": 10442.221 }, { "epoch": 0.14657666345226616, "grad_norm": 1.7715637683868408, "learning_rate": 1.7205692108667532e-05, "loss": 1.0666, "num_input_tokens_seen": 13608128, "step": 114, "train_runtime": 1302.3125, "train_tokens_per_second": 10449.203 }, { "epoch": 0.1478624236579878, "grad_norm": 1.7707303762435913, "learning_rate": 1.717981888745149e-05, "loss": 1.035, "num_input_tokens_seen": 13708288, "step": 115, "train_runtime": 1310.8819, "train_tokens_per_second": 10457.302 }, { "epoch": 0.14914818386370943, "grad_norm": 2.0213918685913086, "learning_rate": 1.7153945666235447e-05, "loss": 1.1718, "num_input_tokens_seen": 13832640, "step": 116, "train_runtime": 1321.8066, "train_tokens_per_second": 10464.95 }, { "epoch": 0.15043394406943106, "grad_norm": 1.9812514781951904, "learning_rate": 1.7128072445019407e-05, "loss": 1.0449, "num_input_tokens_seen": 13942400, "step": 117, "train_runtime": 1331.2362, "train_tokens_per_second": 10473.273 }, { "epoch": 0.1517197042751527, "grad_norm": 1.8844302892684937, "learning_rate": 1.7102199223803365e-05, "loss": 1.045, "num_input_tokens_seen": 14069888, "step": 118, "train_runtime": 1342.8933, "train_tokens_per_second": 10477.294 }, { "epoch": 0.15300546448087432, "grad_norm": 1.816438913345337, "learning_rate": 1.7076326002587325e-05, "loss": 1.1185, "num_input_tokens_seen": 14175328, "step": 119, "train_runtime": 1352.3432, "train_tokens_per_second": 10482.049 }, { "epoch": 0.15429122468659595, "grad_norm": 1.8164008855819702, "learning_rate": 1.7050452781371283e-05, "loss": 1.1141, "num_input_tokens_seen": 14316736, "step": 120, "train_runtime": 1365.1583, "train_tokens_per_second": 10487.235 }, { "epoch": 0.15557698489231758, "grad_norm": 1.9856698513031006, "learning_rate": 1.702457956015524e-05, "loss": 1.0548, "num_input_tokens_seen": 14398720, "step": 121, "train_runtime": 1388.1489, "train_tokens_per_second": 10372.605 }, { "epoch": 0.1568627450980392, "grad_norm": 1.7079716920852661, "learning_rate": 1.69987063389392e-05, "loss": 1.1154, "num_input_tokens_seen": 14510944, "step": 122, "train_runtime": 1398.0002, "train_tokens_per_second": 10379.787 }, { "epoch": 0.15814850530376084, "grad_norm": 2.0213663578033447, "learning_rate": 1.6972833117723158e-05, "loss": 1.1813, "num_input_tokens_seen": 14627488, "step": 123, "train_runtime": 1408.2243, "train_tokens_per_second": 10387.186 }, { "epoch": 0.15943426550948248, "grad_norm": 1.5762097835540771, "learning_rate": 1.6946959896507115e-05, "loss": 0.8798, "num_input_tokens_seen": 14765056, "step": 124, "train_runtime": 1420.9688, "train_tokens_per_second": 10390.838 }, { "epoch": 0.1607200257152041, "grad_norm": 1.9591020345687866, "learning_rate": 1.6921086675291072e-05, "loss": 1.0846, "num_input_tokens_seen": 14870688, "step": 125, "train_runtime": 1430.1584, "train_tokens_per_second": 10397.931 }, { "epoch": 0.16200578592092574, "grad_norm": 1.9856301546096802, "learning_rate": 1.6895213454075033e-05, "loss": 1.1124, "num_input_tokens_seen": 15003424, "step": 126, "train_runtime": 1442.2654, "train_tokens_per_second": 10402.679 }, { "epoch": 0.16329154612664737, "grad_norm": 1.8877084255218506, "learning_rate": 1.6869340232858994e-05, "loss": 1.102, "num_input_tokens_seen": 15167424, "step": 127, "train_runtime": 1457.8734, "train_tokens_per_second": 10403.801 }, { "epoch": 0.164577306332369, "grad_norm": 1.8509068489074707, "learning_rate": 1.684346701164295e-05, "loss": 1.0739, "num_input_tokens_seen": 15348224, "step": 128, "train_runtime": 1475.0417, "train_tokens_per_second": 10405.282 }, { "epoch": 0.16586306653809066, "grad_norm": 1.9316065311431885, "learning_rate": 1.6817593790426908e-05, "loss": 1.1319, "num_input_tokens_seen": 15459680, "step": 129, "train_runtime": 1484.5083, "train_tokens_per_second": 10414.007 }, { "epoch": 0.1671488267438123, "grad_norm": 1.8838239908218384, "learning_rate": 1.679172056921087e-05, "loss": 1.1425, "num_input_tokens_seen": 15599488, "step": 130, "train_runtime": 1497.2084, "train_tokens_per_second": 10419.049 }, { "epoch": 0.16843458694953392, "grad_norm": 1.910106897354126, "learning_rate": 1.6765847347994826e-05, "loss": 1.1367, "num_input_tokens_seen": 15693728, "step": 131, "train_runtime": 1505.1617, "train_tokens_per_second": 10426.606 }, { "epoch": 0.16972034715525555, "grad_norm": 1.8794375658035278, "learning_rate": 1.6739974126778787e-05, "loss": 1.0579, "num_input_tokens_seen": 15827776, "step": 132, "train_runtime": 1517.1331, "train_tokens_per_second": 10432.688 }, { "epoch": 0.17100610736097718, "grad_norm": 1.9578567743301392, "learning_rate": 1.6714100905562744e-05, "loss": 0.9833, "num_input_tokens_seen": 15915456, "step": 133, "train_runtime": 1524.5049, "train_tokens_per_second": 10439.754 }, { "epoch": 0.17229186756669881, "grad_norm": 1.8861867189407349, "learning_rate": 1.66882276843467e-05, "loss": 1.0137, "num_input_tokens_seen": 16006112, "step": 134, "train_runtime": 1532.0904, "train_tokens_per_second": 10447.237 }, { "epoch": 0.17357762777242045, "grad_norm": 1.8860288858413696, "learning_rate": 1.6662354463130662e-05, "loss": 1.1243, "num_input_tokens_seen": 16105472, "step": 135, "train_runtime": 1540.4944, "train_tokens_per_second": 10454.742 }, { "epoch": 0.17486338797814208, "grad_norm": 1.7597628831863403, "learning_rate": 1.663648124191462e-05, "loss": 1.065, "num_input_tokens_seen": 16227296, "step": 136, "train_runtime": 1551.1796, "train_tokens_per_second": 10461.262 }, { "epoch": 0.1761491481838637, "grad_norm": 1.8316805362701416, "learning_rate": 1.6610608020698577e-05, "loss": 1.0799, "num_input_tokens_seen": 16327072, "step": 137, "train_runtime": 1559.8785, "train_tokens_per_second": 10466.887 }, { "epoch": 0.17743490838958534, "grad_norm": 1.965746283531189, "learning_rate": 1.6584734799482537e-05, "loss": 1.1353, "num_input_tokens_seen": 16424576, "step": 138, "train_runtime": 1568.1636, "train_tokens_per_second": 10473.764 }, { "epoch": 0.17872066859530697, "grad_norm": 1.7702914476394653, "learning_rate": 1.6558861578266498e-05, "loss": 1.1117, "num_input_tokens_seen": 16573120, "step": 139, "train_runtime": 1581.7542, "train_tokens_per_second": 10477.684 }, { "epoch": 0.1800064288010286, "grad_norm": 1.8150639533996582, "learning_rate": 1.6532988357050455e-05, "loss": 1.129, "num_input_tokens_seen": 16669440, "step": 140, "train_runtime": 1589.8087, "train_tokens_per_second": 10485.186 }, { "epoch": 0.18129218900675023, "grad_norm": 1.8353360891342163, "learning_rate": 1.6507115135834412e-05, "loss": 1.1148, "num_input_tokens_seen": 16771040, "step": 141, "train_runtime": 1598.5428, "train_tokens_per_second": 10491.455 }, { "epoch": 0.18257794921247186, "grad_norm": 2.064567804336548, "learning_rate": 1.648124191461837e-05, "loss": 1.0626, "num_input_tokens_seen": 16902048, "step": 142, "train_runtime": 1609.9524, "train_tokens_per_second": 10498.477 }, { "epoch": 0.1838637094181935, "grad_norm": 1.8049488067626953, "learning_rate": 1.645536869340233e-05, "loss": 1.1076, "num_input_tokens_seen": 17043808, "step": 143, "train_runtime": 1622.5917, "train_tokens_per_second": 10504.064 }, { "epoch": 0.18514946962391515, "grad_norm": 1.751596212387085, "learning_rate": 1.6429495472186288e-05, "loss": 1.0649, "num_input_tokens_seen": 17140096, "step": 144, "train_runtime": 1630.7355, "train_tokens_per_second": 10510.653 }, { "epoch": 0.18643522982963678, "grad_norm": 1.855686068534851, "learning_rate": 1.6403622250970248e-05, "loss": 1.1758, "num_input_tokens_seen": 17238624, "step": 145, "train_runtime": 1639.2446, "train_tokens_per_second": 10516.2 }, { "epoch": 0.18772099003535841, "grad_norm": 1.9099684953689575, "learning_rate": 1.6377749029754206e-05, "loss": 1.0719, "num_input_tokens_seen": 17360128, "step": 146, "train_runtime": 1650.2244, "train_tokens_per_second": 10519.859 }, { "epoch": 0.18900675024108005, "grad_norm": 1.8072643280029297, "learning_rate": 1.6351875808538166e-05, "loss": 1.1247, "num_input_tokens_seen": 17494240, "step": 147, "train_runtime": 1662.4473, "train_tokens_per_second": 10523.185 }, { "epoch": 0.19029251044680168, "grad_norm": 1.864859938621521, "learning_rate": 1.6326002587322123e-05, "loss": 1.0562, "num_input_tokens_seen": 17584160, "step": 148, "train_runtime": 1670.1325, "train_tokens_per_second": 10528.602 }, { "epoch": 0.1915782706525233, "grad_norm": 1.8772127628326416, "learning_rate": 1.630012936610608e-05, "loss": 1.0535, "num_input_tokens_seen": 17670144, "step": 149, "train_runtime": 1677.3621, "train_tokens_per_second": 10534.484 }, { "epoch": 0.19286403085824494, "grad_norm": 1.7363184690475464, "learning_rate": 1.6274256144890038e-05, "loss": 1.0541, "num_input_tokens_seen": 17771456, "step": 150, "train_runtime": 1686.1324, "train_tokens_per_second": 10539.775 }, { "epoch": 0.19414979106396657, "grad_norm": 1.9292726516723633, "learning_rate": 1.6248382923674e-05, "loss": 1.186, "num_input_tokens_seen": 17875200, "step": 151, "train_runtime": 1711.1828, "train_tokens_per_second": 10446.108 }, { "epoch": 0.1954355512696882, "grad_norm": 1.8201920986175537, "learning_rate": 1.622250970245796e-05, "loss": 1.0198, "num_input_tokens_seen": 17978048, "step": 152, "train_runtime": 1719.8774, "train_tokens_per_second": 10453.098 }, { "epoch": 0.19672131147540983, "grad_norm": 1.9103111028671265, "learning_rate": 1.6196636481241917e-05, "loss": 1.0822, "num_input_tokens_seen": 18092224, "step": 153, "train_runtime": 1730.076, "train_tokens_per_second": 10457.473 }, { "epoch": 0.19800707168113146, "grad_norm": 1.990533709526062, "learning_rate": 1.6170763260025874e-05, "loss": 1.1262, "num_input_tokens_seen": 18180064, "step": 154, "train_runtime": 1737.4747, "train_tokens_per_second": 10463.499 }, { "epoch": 0.1992928318868531, "grad_norm": 1.7888742685317993, "learning_rate": 1.6144890038809835e-05, "loss": 1.1955, "num_input_tokens_seen": 18265056, "step": 155, "train_runtime": 1744.6485, "train_tokens_per_second": 10469.19 }, { "epoch": 0.20057859209257473, "grad_norm": 1.7337497472763062, "learning_rate": 1.6119016817593792e-05, "loss": 1.0541, "num_input_tokens_seen": 18367328, "step": 156, "train_runtime": 1753.372, "train_tokens_per_second": 10475.431 }, { "epoch": 0.20057859209257473, "eval_loss": 1.1330561637878418, "eval_runtime": 22.3584, "eval_samples_per_second": 44.458, "eval_steps_per_second": 1.431, "num_input_tokens_seen": 18367328, "step": 156 }, { "epoch": 0.20186435229829636, "grad_norm": 1.760105848312378, "learning_rate": 1.609314359637775e-05, "loss": 1.092, "num_input_tokens_seen": 18469024, "step": 157, "train_runtime": 1784.5882, "train_tokens_per_second": 10349.179 }, { "epoch": 0.203150112504018, "grad_norm": 2.001173496246338, "learning_rate": 1.606727037516171e-05, "loss": 1.15, "num_input_tokens_seen": 18603648, "step": 158, "train_runtime": 1796.907, "train_tokens_per_second": 10353.15 }, { "epoch": 0.20443587270973965, "grad_norm": 1.806795358657837, "learning_rate": 1.6041397153945667e-05, "loss": 1.024, "num_input_tokens_seen": 18693536, "step": 159, "train_runtime": 1804.6539, "train_tokens_per_second": 10358.516 }, { "epoch": 0.20572163291546128, "grad_norm": 1.9059035778045654, "learning_rate": 1.6015523932729628e-05, "loss": 1.1534, "num_input_tokens_seen": 18854592, "step": 160, "train_runtime": 1819.9574, "train_tokens_per_second": 10359.908 }, { "epoch": 0.2070073931211829, "grad_norm": 1.902287483215332, "learning_rate": 1.5989650711513585e-05, "loss": 0.9808, "num_input_tokens_seen": 18972384, "step": 161, "train_runtime": 1830.4631, "train_tokens_per_second": 10364.8 }, { "epoch": 0.20829315332690454, "grad_norm": 1.9465879201889038, "learning_rate": 1.5963777490297542e-05, "loss": 1.1595, "num_input_tokens_seen": 19119424, "step": 162, "train_runtime": 1844.4228, "train_tokens_per_second": 10366.075 }, { "epoch": 0.20957891353262617, "grad_norm": 1.8765859603881836, "learning_rate": 1.59379042690815e-05, "loss": 1.1413, "num_input_tokens_seen": 19229984, "step": 163, "train_runtime": 1854.1827, "train_tokens_per_second": 10371.138 }, { "epoch": 0.2108646737383478, "grad_norm": 1.9399867057800293, "learning_rate": 1.591203104786546e-05, "loss": 1.0859, "num_input_tokens_seen": 19334016, "step": 164, "train_runtime": 1863.2733, "train_tokens_per_second": 10376.372 }, { "epoch": 0.21215043394406943, "grad_norm": 1.999969244003296, "learning_rate": 1.588615782664942e-05, "loss": 1.1394, "num_input_tokens_seen": 19501312, "step": 165, "train_runtime": 1879.0538, "train_tokens_per_second": 10378.261 }, { "epoch": 0.21343619414979106, "grad_norm": 1.8910810947418213, "learning_rate": 1.5860284605433378e-05, "loss": 0.9774, "num_input_tokens_seen": 19602976, "step": 166, "train_runtime": 1887.7727, "train_tokens_per_second": 10384.182 }, { "epoch": 0.2147219543555127, "grad_norm": 1.824230432510376, "learning_rate": 1.5834411384217335e-05, "loss": 1.0689, "num_input_tokens_seen": 19727904, "step": 167, "train_runtime": 1898.9411, "train_tokens_per_second": 10388.897 }, { "epoch": 0.21600771456123433, "grad_norm": 1.9098621606826782, "learning_rate": 1.5808538163001296e-05, "loss": 1.069, "num_input_tokens_seen": 19844096, "step": 168, "train_runtime": 1909.7001, "train_tokens_per_second": 10391.211 }, { "epoch": 0.21729347476695596, "grad_norm": 1.773947834968567, "learning_rate": 1.5782664941785253e-05, "loss": 1.0426, "num_input_tokens_seen": 19969248, "step": 169, "train_runtime": 1920.8606, "train_tokens_per_second": 10395.99 }, { "epoch": 0.2185792349726776, "grad_norm": 1.7338457107543945, "learning_rate": 1.575679172056921e-05, "loss": 1.0428, "num_input_tokens_seen": 20165376, "step": 170, "train_runtime": 1940.1892, "train_tokens_per_second": 10393.51 }, { "epoch": 0.21986499517839922, "grad_norm": 1.7944598197937012, "learning_rate": 1.573091849935317e-05, "loss": 1.1008, "num_input_tokens_seen": 20282464, "step": 171, "train_runtime": 1950.6375, "train_tokens_per_second": 10397.864 }, { "epoch": 0.22115075538412085, "grad_norm": 1.7881031036376953, "learning_rate": 1.570504527813713e-05, "loss": 1.0998, "num_input_tokens_seen": 20414304, "step": 172, "train_runtime": 1962.9682, "train_tokens_per_second": 10399.712 }, { "epoch": 0.22243651558984248, "grad_norm": 1.8311177492141724, "learning_rate": 1.567917205692109e-05, "loss": 1.1359, "num_input_tokens_seen": 20524000, "step": 173, "train_runtime": 1972.6273, "train_tokens_per_second": 10404.398 }, { "epoch": 0.22372227579556414, "grad_norm": 1.774649739265442, "learning_rate": 1.5653298835705046e-05, "loss": 1.1199, "num_input_tokens_seen": 20615872, "step": 174, "train_runtime": 1980.5452, "train_tokens_per_second": 10409.191 }, { "epoch": 0.22500803600128577, "grad_norm": 1.8202511072158813, "learning_rate": 1.5627425614489004e-05, "loss": 1.1552, "num_input_tokens_seen": 20737184, "step": 175, "train_runtime": 1991.4125, "train_tokens_per_second": 10413.304 }, { "epoch": 0.2262937962070074, "grad_norm": 1.8184281587600708, "learning_rate": 1.5601552393272964e-05, "loss": 1.0945, "num_input_tokens_seen": 20871712, "step": 176, "train_runtime": 2003.8054, "train_tokens_per_second": 10416.038 }, { "epoch": 0.22757955641272903, "grad_norm": 2.0196473598480225, "learning_rate": 1.5575679172056925e-05, "loss": 1.0248, "num_input_tokens_seen": 21029760, "step": 177, "train_runtime": 2018.6807, "train_tokens_per_second": 10417.576 }, { "epoch": 0.22886531661845066, "grad_norm": 1.8468624353408813, "learning_rate": 1.5549805950840882e-05, "loss": 1.1439, "num_input_tokens_seen": 21118112, "step": 178, "train_runtime": 2026.2014, "train_tokens_per_second": 10422.514 }, { "epoch": 0.2301510768241723, "grad_norm": 2.0327556133270264, "learning_rate": 1.552393272962484e-05, "loss": 1.0553, "num_input_tokens_seen": 21217408, "step": 179, "train_runtime": 2034.8324, "train_tokens_per_second": 10427.104 }, { "epoch": 0.23143683702989393, "grad_norm": 1.9502851963043213, "learning_rate": 1.5498059508408797e-05, "loss": 1.0866, "num_input_tokens_seen": 21328928, "step": 180, "train_runtime": 2044.8024, "train_tokens_per_second": 10430.802 }, { "epoch": 0.23272259723561556, "grad_norm": 1.8489340543746948, "learning_rate": 1.5472186287192757e-05, "loss": 1.1345, "num_input_tokens_seen": 21433248, "step": 181, "train_runtime": 2072.5697, "train_tokens_per_second": 10341.388 }, { "epoch": 0.2340083574413372, "grad_norm": 2.063244104385376, "learning_rate": 1.5446313065976715e-05, "loss": 1.0425, "num_input_tokens_seen": 21543552, "step": 182, "train_runtime": 2082.003, "train_tokens_per_second": 10347.513 }, { "epoch": 0.23529411764705882, "grad_norm": 1.8250895738601685, "learning_rate": 1.5420439844760672e-05, "loss": 1.1022, "num_input_tokens_seen": 21631584, "step": 183, "train_runtime": 2089.5086, "train_tokens_per_second": 10352.474 }, { "epoch": 0.23657987785278045, "grad_norm": 1.8058557510375977, "learning_rate": 1.5394566623544633e-05, "loss": 1.1283, "num_input_tokens_seen": 21732768, "step": 184, "train_runtime": 2098.3876, "train_tokens_per_second": 10356.889 }, { "epoch": 0.23786563805850208, "grad_norm": 1.8823782205581665, "learning_rate": 1.5368693402328593e-05, "loss": 1.0454, "num_input_tokens_seen": 21847392, "step": 185, "train_runtime": 2108.5281, "train_tokens_per_second": 10361.442 }, { "epoch": 0.2391513982642237, "grad_norm": 1.9651679992675781, "learning_rate": 1.534282018111255e-05, "loss": 1.1543, "num_input_tokens_seen": 21969408, "step": 186, "train_runtime": 2119.7121, "train_tokens_per_second": 10364.336 }, { "epoch": 0.24043715846994534, "grad_norm": 1.9040675163269043, "learning_rate": 1.5316946959896508e-05, "loss": 1.1195, "num_input_tokens_seen": 22082176, "step": 187, "train_runtime": 2129.7977, "train_tokens_per_second": 10368.204 }, { "epoch": 0.24172291867566698, "grad_norm": 1.8690330982208252, "learning_rate": 1.5291073738680465e-05, "loss": 1.1459, "num_input_tokens_seen": 22172480, "step": 188, "train_runtime": 2137.5122, "train_tokens_per_second": 10373.031 }, { "epoch": 0.24300867888138863, "grad_norm": 1.873816967010498, "learning_rate": 1.5265200517464426e-05, "loss": 1.1256, "num_input_tokens_seen": 22305728, "step": 189, "train_runtime": 2149.436, "train_tokens_per_second": 10377.479 }, { "epoch": 0.24429443908711027, "grad_norm": 1.936040997505188, "learning_rate": 1.5239327296248385e-05, "loss": 1.0522, "num_input_tokens_seen": 22460672, "step": 190, "train_runtime": 2163.9753, "train_tokens_per_second": 10379.357 }, { "epoch": 0.2455801992928319, "grad_norm": 1.8445260524749756, "learning_rate": 1.5213454075032344e-05, "loss": 1.1412, "num_input_tokens_seen": 22556352, "step": 191, "train_runtime": 2172.3429, "train_tokens_per_second": 10383.421 }, { "epoch": 0.24686595949855353, "grad_norm": 1.9163671731948853, "learning_rate": 1.5187580853816301e-05, "loss": 1.1672, "num_input_tokens_seen": 22662624, "step": 192, "train_runtime": 2181.6935, "train_tokens_per_second": 10387.63 }, { "epoch": 0.24815171970427516, "grad_norm": 2.0177226066589355, "learning_rate": 1.516170763260026e-05, "loss": 1.1193, "num_input_tokens_seen": 22789664, "step": 193, "train_runtime": 2193.5134, "train_tokens_per_second": 10389.571 }, { "epoch": 0.2494374799099968, "grad_norm": 1.8356866836547852, "learning_rate": 1.5135834411384219e-05, "loss": 1.1705, "num_input_tokens_seen": 22878816, "step": 194, "train_runtime": 2201.1512, "train_tokens_per_second": 10394.023 }, { "epoch": 0.2507232401157184, "grad_norm": 1.9464590549468994, "learning_rate": 1.5109961190168176e-05, "loss": 1.2413, "num_input_tokens_seen": 23036256, "step": 195, "train_runtime": 2216.0262, "train_tokens_per_second": 10395.299 }, { "epoch": 0.25200900032144, "grad_norm": 1.9846364259719849, "learning_rate": 1.5084087968952135e-05, "loss": 1.1349, "num_input_tokens_seen": 23113184, "step": 196, "train_runtime": 2222.6223, "train_tokens_per_second": 10399.061 }, { "epoch": 0.2532947605271617, "grad_norm": 1.921323537826538, "learning_rate": 1.5058214747736096e-05, "loss": 1.0196, "num_input_tokens_seen": 23227616, "step": 197, "train_runtime": 2232.9722, "train_tokens_per_second": 10402.107 }, { "epoch": 0.25458052073288334, "grad_norm": 1.7825725078582764, "learning_rate": 1.5032341526520053e-05, "loss": 1.0327, "num_input_tokens_seen": 23394208, "step": 198, "train_runtime": 2249.1819, "train_tokens_per_second": 10401.208 }, { "epoch": 0.255866280938605, "grad_norm": 2.1068551540374756, "learning_rate": 1.5006468305304012e-05, "loss": 1.0875, "num_input_tokens_seen": 23528416, "step": 199, "train_runtime": 2261.1565, "train_tokens_per_second": 10405.479 }, { "epoch": 0.2571520411443266, "grad_norm": 1.8937175273895264, "learning_rate": 1.498059508408797e-05, "loss": 1.0898, "num_input_tokens_seen": 23670240, "step": 200, "train_runtime": 2274.3795, "train_tokens_per_second": 10407.34 }, { "epoch": 0.25843780135004824, "grad_norm": 1.8117809295654297, "learning_rate": 1.4954721862871928e-05, "loss": 0.98, "num_input_tokens_seen": 23795712, "step": 201, "train_runtime": 2285.6253, "train_tokens_per_second": 10411.029 }, { "epoch": 0.25972356155576987, "grad_norm": 1.9877797365188599, "learning_rate": 1.4928848641655887e-05, "loss": 1.1332, "num_input_tokens_seen": 23913248, "step": 202, "train_runtime": 2295.9518, "train_tokens_per_second": 10415.396 }, { "epoch": 0.2610093217614915, "grad_norm": 1.832665205001831, "learning_rate": 1.4902975420439846e-05, "loss": 1.0939, "num_input_tokens_seen": 24017152, "step": 203, "train_runtime": 2305.1109, "train_tokens_per_second": 10419.088 }, { "epoch": 0.26229508196721313, "grad_norm": 1.8349584341049194, "learning_rate": 1.4877102199223805e-05, "loss": 1.1451, "num_input_tokens_seen": 24132384, "step": 204, "train_runtime": 2315.2627, "train_tokens_per_second": 10423.173 }, { "epoch": 0.26358084217293476, "grad_norm": 1.8495604991912842, "learning_rate": 1.4851228978007764e-05, "loss": 1.0344, "num_input_tokens_seen": 24217024, "step": 205, "train_runtime": 2322.5078, "train_tokens_per_second": 10427.101 }, { "epoch": 0.2648666023786564, "grad_norm": 1.7923839092254639, "learning_rate": 1.4825355756791721e-05, "loss": 1.0408, "num_input_tokens_seen": 24329984, "step": 206, "train_runtime": 2332.827, "train_tokens_per_second": 10429.399 }, { "epoch": 0.266152362584378, "grad_norm": 1.8214589357376099, "learning_rate": 1.479948253557568e-05, "loss": 1.091, "num_input_tokens_seen": 24451776, "step": 207, "train_runtime": 2343.5108, "train_tokens_per_second": 10433.823 }, { "epoch": 0.26743812279009965, "grad_norm": 1.9028258323669434, "learning_rate": 1.4773609314359637e-05, "loss": 1.1523, "num_input_tokens_seen": 24630016, "step": 208, "train_runtime": 2360.69, "train_tokens_per_second": 10433.397 }, { "epoch": 0.2687238829958213, "grad_norm": 1.80238676071167, "learning_rate": 1.4747736093143598e-05, "loss": 1.0408, "num_input_tokens_seen": 24752800, "step": 209, "train_runtime": 2371.5796, "train_tokens_per_second": 10437.263 }, { "epoch": 0.2700096432015429, "grad_norm": 1.8515748977661133, "learning_rate": 1.4721862871927557e-05, "loss": 1.0605, "num_input_tokens_seen": 24844864, "step": 210, "train_runtime": 2379.4213, "train_tokens_per_second": 10441.557 }, { "epoch": 0.27129540340726455, "grad_norm": 1.831057071685791, "learning_rate": 1.4695989650711514e-05, "loss": 1.074, "num_input_tokens_seen": 25002304, "step": 211, "train_runtime": 2412.4948, "train_tokens_per_second": 10363.672 }, { "epoch": 0.2725811636129862, "grad_norm": 2.014904260635376, "learning_rate": 1.4670116429495473e-05, "loss": 1.1354, "num_input_tokens_seen": 25133536, "step": 212, "train_runtime": 2424.3186, "train_tokens_per_second": 10367.258 }, { "epoch": 0.2738669238187078, "grad_norm": 1.9899771213531494, "learning_rate": 1.4644243208279432e-05, "loss": 1.0888, "num_input_tokens_seen": 25302464, "step": 213, "train_runtime": 2440.569, "train_tokens_per_second": 10367.445 }, { "epoch": 0.27515268402442944, "grad_norm": 1.9485491514205933, "learning_rate": 1.461836998706339e-05, "loss": 1.0257, "num_input_tokens_seen": 25400640, "step": 214, "train_runtime": 2449.2043, "train_tokens_per_second": 10370.976 }, { "epoch": 0.27643844423015107, "grad_norm": 1.7471483945846558, "learning_rate": 1.4592496765847349e-05, "loss": 0.9967, "num_input_tokens_seen": 25491296, "step": 215, "train_runtime": 2456.9876, "train_tokens_per_second": 10375.02 }, { "epoch": 0.2777242044358727, "grad_norm": 1.8240132331848145, "learning_rate": 1.456662354463131e-05, "loss": 1.0384, "num_input_tokens_seen": 25584320, "step": 216, "train_runtime": 2464.9704, "train_tokens_per_second": 10379.159 }, { "epoch": 0.27900996464159433, "grad_norm": 1.8008581399917603, "learning_rate": 1.4540750323415266e-05, "loss": 1.0473, "num_input_tokens_seen": 25675328, "step": 217, "train_runtime": 2472.784, "train_tokens_per_second": 10383.166 }, { "epoch": 0.28029572484731596, "grad_norm": 1.8560556173324585, "learning_rate": 1.4514877102199225e-05, "loss": 1.0333, "num_input_tokens_seen": 25761216, "step": 218, "train_runtime": 2480.13, "train_tokens_per_second": 10387.043 }, { "epoch": 0.2815814850530376, "grad_norm": 1.9014114141464233, "learning_rate": 1.4489003880983183e-05, "loss": 1.1028, "num_input_tokens_seen": 25890592, "step": 219, "train_runtime": 2491.8423, "train_tokens_per_second": 10390.141 }, { "epoch": 0.2828672452587592, "grad_norm": 1.8335984945297241, "learning_rate": 1.4463130659767142e-05, "loss": 1.045, "num_input_tokens_seen": 25970880, "step": 220, "train_runtime": 2498.6975, "train_tokens_per_second": 10393.767 }, { "epoch": 0.28415300546448086, "grad_norm": 1.9171757698059082, "learning_rate": 1.44372574385511e-05, "loss": 1.074, "num_input_tokens_seen": 26051808, "step": 221, "train_runtime": 2505.5849, "train_tokens_per_second": 10397.496 }, { "epoch": 0.2854387656702025, "grad_norm": 1.849561333656311, "learning_rate": 1.4411384217335061e-05, "loss": 1.0662, "num_input_tokens_seen": 26163232, "step": 222, "train_runtime": 2515.3859, "train_tokens_per_second": 10401.28 }, { "epoch": 0.2867245258759241, "grad_norm": 1.886615514755249, "learning_rate": 1.4385510996119019e-05, "loss": 1.1053, "num_input_tokens_seen": 26257664, "step": 223, "train_runtime": 2523.536, "train_tokens_per_second": 10405.108 }, { "epoch": 0.28801028608164575, "grad_norm": 1.7920629978179932, "learning_rate": 1.4359637774902977e-05, "loss": 1.0041, "num_input_tokens_seen": 26368288, "step": 224, "train_runtime": 2533.3464, "train_tokens_per_second": 10408.481 }, { "epoch": 0.2892960462873674, "grad_norm": 1.9786632061004639, "learning_rate": 1.4333764553686935e-05, "loss": 1.1993, "num_input_tokens_seen": 26482400, "step": 225, "train_runtime": 2543.3441, "train_tokens_per_second": 10412.433 }, { "epoch": 0.290581806493089, "grad_norm": 1.9302722215652466, "learning_rate": 1.4307891332470894e-05, "loss": 1.0486, "num_input_tokens_seen": 26580512, "step": 226, "train_runtime": 2551.839, "train_tokens_per_second": 10416.218 }, { "epoch": 0.2918675666988107, "grad_norm": 1.7275605201721191, "learning_rate": 1.4282018111254851e-05, "loss": 0.9721, "num_input_tokens_seen": 26699392, "step": 227, "train_runtime": 2562.4385, "train_tokens_per_second": 10419.525 }, { "epoch": 0.29315332690453233, "grad_norm": 1.8996021747589111, "learning_rate": 1.425614489003881e-05, "loss": 1.0883, "num_input_tokens_seen": 26856992, "step": 228, "train_runtime": 2577.1118, "train_tokens_per_second": 10421.353 }, { "epoch": 0.29443908711025396, "grad_norm": 1.8853155374526978, "learning_rate": 1.423027166882277e-05, "loss": 1.0271, "num_input_tokens_seen": 26964960, "step": 229, "train_runtime": 2586.5183, "train_tokens_per_second": 10425.196 }, { "epoch": 0.2957248473159756, "grad_norm": 1.9568660259246826, "learning_rate": 1.4204398447606728e-05, "loss": 1.0765, "num_input_tokens_seen": 27099008, "step": 230, "train_runtime": 2599.0806, "train_tokens_per_second": 10426.382 }, { "epoch": 0.2970106075216972, "grad_norm": 1.8366093635559082, "learning_rate": 1.4178525226390687e-05, "loss": 1.0547, "num_input_tokens_seen": 27213760, "step": 231, "train_runtime": 2609.5848, "train_tokens_per_second": 10428.387 }, { "epoch": 0.29829636772741885, "grad_norm": 1.8327536582946777, "learning_rate": 1.4152652005174646e-05, "loss": 1.0903, "num_input_tokens_seen": 27297344, "step": 232, "train_runtime": 2616.7236, "train_tokens_per_second": 10431.879 }, { "epoch": 0.2995821279331405, "grad_norm": 1.8904881477355957, "learning_rate": 1.4126778783958603e-05, "loss": 1.0861, "num_input_tokens_seen": 27426688, "step": 233, "train_runtime": 2628.7609, "train_tokens_per_second": 10433.314 }, { "epoch": 0.3008678881388621, "grad_norm": 1.99700927734375, "learning_rate": 1.4100905562742562e-05, "loss": 1.0771, "num_input_tokens_seen": 27563648, "step": 234, "train_runtime": 2641.4168, "train_tokens_per_second": 10435.176 }, { "epoch": 0.3008678881388621, "eval_loss": 1.1202009916305542, "eval_runtime": 22.3846, "eval_samples_per_second": 44.406, "eval_steps_per_second": 1.43, "num_input_tokens_seen": 27563648, "step": 234 }, { "epoch": 0.30215364834458375, "grad_norm": 1.886243462562561, "learning_rate": 1.4075032341526523e-05, "loss": 1.0186, "num_input_tokens_seen": 27753376, "step": 235, "train_runtime": 2682.2789, "train_tokens_per_second": 10346.939 }, { "epoch": 0.3034394085503054, "grad_norm": 1.8130700588226318, "learning_rate": 1.404915912031048e-05, "loss": 1.0335, "num_input_tokens_seen": 27868672, "step": 236, "train_runtime": 2692.3246, "train_tokens_per_second": 10351.156 }, { "epoch": 0.304725168756027, "grad_norm": 1.870937466621399, "learning_rate": 1.4023285899094439e-05, "loss": 1.036, "num_input_tokens_seen": 27970848, "step": 237, "train_runtime": 2701.1905, "train_tokens_per_second": 10355.008 }, { "epoch": 0.30601092896174864, "grad_norm": 1.9421213865280151, "learning_rate": 1.3997412677878396e-05, "loss": 1.0861, "num_input_tokens_seen": 28103104, "step": 238, "train_runtime": 2713.4976, "train_tokens_per_second": 10356.783 }, { "epoch": 0.30729668916747027, "grad_norm": 2.0607948303222656, "learning_rate": 1.3971539456662355e-05, "loss": 1.1563, "num_input_tokens_seen": 28200704, "step": 239, "train_runtime": 2721.862, "train_tokens_per_second": 10360.813 }, { "epoch": 0.3085824493731919, "grad_norm": 1.9641258716583252, "learning_rate": 1.3945666235446314e-05, "loss": 1.0857, "num_input_tokens_seen": 28301088, "step": 240, "train_runtime": 2730.5823, "train_tokens_per_second": 10364.488 }, { "epoch": 0.30986820957891353, "grad_norm": 1.7765169143676758, "learning_rate": 1.3919793014230271e-05, "loss": 1.17, "num_input_tokens_seen": 28407104, "step": 241, "train_runtime": 2757.845, "train_tokens_per_second": 10300.472 }, { "epoch": 0.31115396978463516, "grad_norm": 1.8327834606170654, "learning_rate": 1.3893919793014232e-05, "loss": 1.1576, "num_input_tokens_seen": 28551616, "step": 242, "train_runtime": 2770.8246, "train_tokens_per_second": 10304.375 }, { "epoch": 0.3124397299903568, "grad_norm": 1.8959366083145142, "learning_rate": 1.3868046571798191e-05, "loss": 1.1029, "num_input_tokens_seen": 28676992, "step": 243, "train_runtime": 2781.7813, "train_tokens_per_second": 10308.859 }, { "epoch": 0.3137254901960784, "grad_norm": 1.906044840812683, "learning_rate": 1.3842173350582148e-05, "loss": 1.0936, "num_input_tokens_seen": 28808192, "step": 244, "train_runtime": 2793.4191, "train_tokens_per_second": 10312.879 }, { "epoch": 0.31501125040180006, "grad_norm": 1.6482162475585938, "learning_rate": 1.3816300129366107e-05, "loss": 1.0089, "num_input_tokens_seen": 28911680, "step": 245, "train_runtime": 2802.3761, "train_tokens_per_second": 10316.845 }, { "epoch": 0.3162970106075217, "grad_norm": 2.033006191253662, "learning_rate": 1.3790426908150065e-05, "loss": 1.1089, "num_input_tokens_seen": 29016864, "step": 246, "train_runtime": 2811.4614, "train_tokens_per_second": 10320.919 }, { "epoch": 0.3175827708132433, "grad_norm": 1.7948728799819946, "learning_rate": 1.3764553686934023e-05, "loss": 1.0618, "num_input_tokens_seen": 29131168, "step": 247, "train_runtime": 2821.6622, "train_tokens_per_second": 10324.116 }, { "epoch": 0.31886853101896495, "grad_norm": 1.90618097782135, "learning_rate": 1.3738680465717984e-05, "loss": 1.0781, "num_input_tokens_seen": 29220064, "step": 248, "train_runtime": 2829.145, "train_tokens_per_second": 10328.231 }, { "epoch": 0.3201542912246866, "grad_norm": 1.9356735944747925, "learning_rate": 1.3712807244501941e-05, "loss": 1.081, "num_input_tokens_seen": 29327360, "step": 249, "train_runtime": 2838.3079, "train_tokens_per_second": 10332.691 }, { "epoch": 0.3214400514304082, "grad_norm": 1.9027749300003052, "learning_rate": 1.36869340232859e-05, "loss": 1.0783, "num_input_tokens_seen": 29460416, "step": 250, "train_runtime": 2850.5438, "train_tokens_per_second": 10335.016 }, { "epoch": 0.32272581163612984, "grad_norm": 1.9512473344802856, "learning_rate": 1.366106080206986e-05, "loss": 1.1187, "num_input_tokens_seen": 29560960, "step": 251, "train_runtime": 2859.2337, "train_tokens_per_second": 10338.77 }, { "epoch": 0.3240115718418515, "grad_norm": 1.8211243152618408, "learning_rate": 1.3635187580853817e-05, "loss": 1.0958, "num_input_tokens_seen": 29663328, "step": 252, "train_runtime": 2868.0908, "train_tokens_per_second": 10342.535 }, { "epoch": 0.3252973320475731, "grad_norm": 1.9262733459472656, "learning_rate": 1.3609314359637776e-05, "loss": 1.0872, "num_input_tokens_seen": 29746208, "step": 253, "train_runtime": 2875.16, "train_tokens_per_second": 10345.931 }, { "epoch": 0.32658309225329474, "grad_norm": 1.8188444375991821, "learning_rate": 1.3583441138421733e-05, "loss": 1.0855, "num_input_tokens_seen": 29894432, "step": 254, "train_runtime": 2888.8665, "train_tokens_per_second": 10348.153 }, { "epoch": 0.32786885245901637, "grad_norm": 1.9136427640914917, "learning_rate": 1.3557567917205693e-05, "loss": 1.1348, "num_input_tokens_seen": 29994112, "step": 255, "train_runtime": 2897.5218, "train_tokens_per_second": 10351.643 }, { "epoch": 0.329154612664738, "grad_norm": 1.8818548917770386, "learning_rate": 1.3531694695989652e-05, "loss": 1.0323, "num_input_tokens_seen": 30130016, "step": 256, "train_runtime": 2910.0743, "train_tokens_per_second": 10353.693 }, { "epoch": 0.3304403728704597, "grad_norm": 1.8252167701721191, "learning_rate": 1.350582147477361e-05, "loss": 1.1093, "num_input_tokens_seen": 30265760, "step": 257, "train_runtime": 2922.5727, "train_tokens_per_second": 10355.862 }, { "epoch": 0.3317261330761813, "grad_norm": 1.7374950647354126, "learning_rate": 1.3479948253557569e-05, "loss": 1.0167, "num_input_tokens_seen": 30376608, "step": 258, "train_runtime": 2932.2957, "train_tokens_per_second": 10359.326 }, { "epoch": 0.33301189328190295, "grad_norm": 1.8809834718704224, "learning_rate": 1.3454075032341528e-05, "loss": 1.0811, "num_input_tokens_seen": 30516832, "step": 259, "train_runtime": 2945.3073, "train_tokens_per_second": 10361.171 }, { "epoch": 0.3342976534876246, "grad_norm": 1.8606772422790527, "learning_rate": 1.3428201811125485e-05, "loss": 1.1816, "num_input_tokens_seen": 30630464, "step": 260, "train_runtime": 2955.2838, "train_tokens_per_second": 10364.644 }, { "epoch": 0.3355834136933462, "grad_norm": 1.841683030128479, "learning_rate": 1.3402328589909446e-05, "loss": 1.0374, "num_input_tokens_seen": 30773344, "step": 261, "train_runtime": 2968.6865, "train_tokens_per_second": 10365.98 }, { "epoch": 0.33686917389906784, "grad_norm": 1.9608851671218872, "learning_rate": 1.3376455368693405e-05, "loss": 1.075, "num_input_tokens_seen": 30899296, "step": 262, "train_runtime": 2980.4948, "train_tokens_per_second": 10367.17 }, { "epoch": 0.3381549341047895, "grad_norm": 1.9880949258804321, "learning_rate": 1.3350582147477362e-05, "loss": 1.0203, "num_input_tokens_seen": 31000256, "step": 263, "train_runtime": 2989.2311, "train_tokens_per_second": 10370.645 }, { "epoch": 0.3394406943105111, "grad_norm": 1.9502097368240356, "learning_rate": 1.332470892626132e-05, "loss": 1.1464, "num_input_tokens_seen": 31104768, "step": 264, "train_runtime": 2998.2398, "train_tokens_per_second": 10374.343 }, { "epoch": 0.34072645451623274, "grad_norm": 1.934061050415039, "learning_rate": 1.3298835705045278e-05, "loss": 1.0263, "num_input_tokens_seen": 31232832, "step": 265, "train_runtime": 3009.8265, "train_tokens_per_second": 10376.954 }, { "epoch": 0.34201221472195437, "grad_norm": 1.8722063302993774, "learning_rate": 1.3272962483829237e-05, "loss": 1.0799, "num_input_tokens_seen": 31351872, "step": 266, "train_runtime": 3020.55, "train_tokens_per_second": 10379.524 }, { "epoch": 0.343297974927676, "grad_norm": 1.941330909729004, "learning_rate": 1.3247089262613198e-05, "loss": 0.9481, "num_input_tokens_seen": 31458432, "step": 267, "train_runtime": 3029.8631, "train_tokens_per_second": 10382.79 }, { "epoch": 0.34458373513339763, "grad_norm": 2.109315872192383, "learning_rate": 1.3221216041397157e-05, "loss": 1.1085, "num_input_tokens_seen": 31566048, "step": 268, "train_runtime": 3039.2325, "train_tokens_per_second": 10386.191 }, { "epoch": 0.34586949533911926, "grad_norm": 1.9429577589035034, "learning_rate": 1.3195342820181114e-05, "loss": 1.1085, "num_input_tokens_seen": 31679008, "step": 269, "train_runtime": 3049.0419, "train_tokens_per_second": 10389.824 }, { "epoch": 0.3471552555448409, "grad_norm": 1.8708595037460327, "learning_rate": 1.3169469598965073e-05, "loss": 1.0415, "num_input_tokens_seen": 31805376, "step": 270, "train_runtime": 3060.3402, "train_tokens_per_second": 10392.758 }, { "epoch": 0.3484410157505625, "grad_norm": 1.890461802482605, "learning_rate": 1.314359637774903e-05, "loss": 1.0917, "num_input_tokens_seen": 31887200, "step": 271, "train_runtime": 3085.3071, "train_tokens_per_second": 10335.179 }, { "epoch": 0.34972677595628415, "grad_norm": 1.8630510568618774, "learning_rate": 1.3117723156532989e-05, "loss": 1.0943, "num_input_tokens_seen": 32037536, "step": 272, "train_runtime": 3098.8904, "train_tokens_per_second": 10338.39 }, { "epoch": 0.3510125361620058, "grad_norm": 1.9622751474380493, "learning_rate": 1.3091849935316946e-05, "loss": 1.0348, "num_input_tokens_seen": 32152288, "step": 273, "train_runtime": 3108.918, "train_tokens_per_second": 10341.954 }, { "epoch": 0.3522982963677274, "grad_norm": 1.8532695770263672, "learning_rate": 1.3065976714100907e-05, "loss": 0.9972, "num_input_tokens_seen": 32254592, "step": 274, "train_runtime": 3117.7914, "train_tokens_per_second": 10345.333 }, { "epoch": 0.35358405657344905, "grad_norm": 1.8529016971588135, "learning_rate": 1.3040103492884866e-05, "loss": 1.1095, "num_input_tokens_seen": 32377696, "step": 275, "train_runtime": 3128.8339, "train_tokens_per_second": 10348.167 }, { "epoch": 0.3548698167791707, "grad_norm": 1.9654872417449951, "learning_rate": 1.3014230271668823e-05, "loss": 1.1777, "num_input_tokens_seen": 32464224, "step": 276, "train_runtime": 3136.2376, "train_tokens_per_second": 10351.328 }, { "epoch": 0.3561555769848923, "grad_norm": 1.9332945346832275, "learning_rate": 1.2988357050452782e-05, "loss": 1.0694, "num_input_tokens_seen": 32543360, "step": 277, "train_runtime": 3142.9151, "train_tokens_per_second": 10354.515 }, { "epoch": 0.35744133719061394, "grad_norm": 2.014310121536255, "learning_rate": 1.2962483829236741e-05, "loss": 1.1293, "num_input_tokens_seen": 32652000, "step": 278, "train_runtime": 3152.361, "train_tokens_per_second": 10357.951 }, { "epoch": 0.35872709739633557, "grad_norm": 1.9047924280166626, "learning_rate": 1.2936610608020698e-05, "loss": 1.0027, "num_input_tokens_seen": 32764256, "step": 279, "train_runtime": 3162.2615, "train_tokens_per_second": 10361.021 }, { "epoch": 0.3600128576020572, "grad_norm": 1.825059413909912, "learning_rate": 1.2910737386804659e-05, "loss": 1.1741, "num_input_tokens_seen": 32843744, "step": 280, "train_runtime": 3168.977, "train_tokens_per_second": 10364.147 }, { "epoch": 0.36129861780777883, "grad_norm": 1.831803321838379, "learning_rate": 1.2884864165588618e-05, "loss": 1.022, "num_input_tokens_seen": 32964992, "step": 281, "train_runtime": 3179.9785, "train_tokens_per_second": 10366.42 }, { "epoch": 0.36258437801350046, "grad_norm": 1.70236074924469, "learning_rate": 1.2858990944372575e-05, "loss": 1.0487, "num_input_tokens_seen": 33080992, "step": 282, "train_runtime": 3190.2018, "train_tokens_per_second": 10369.561 }, { "epoch": 0.3638701382192221, "grad_norm": 1.796125888824463, "learning_rate": 1.2833117723156534e-05, "loss": 1.0899, "num_input_tokens_seen": 33226368, "step": 283, "train_runtime": 3203.4864, "train_tokens_per_second": 10371.94 }, { "epoch": 0.3651558984249437, "grad_norm": 1.8778120279312134, "learning_rate": 1.2807244501940492e-05, "loss": 1.0362, "num_input_tokens_seen": 33339552, "step": 284, "train_runtime": 3213.4705, "train_tokens_per_second": 10374.937 }, { "epoch": 0.36644165863066536, "grad_norm": 1.868843913078308, "learning_rate": 1.278137128072445e-05, "loss": 1.0095, "num_input_tokens_seen": 33425280, "step": 285, "train_runtime": 3220.8266, "train_tokens_per_second": 10377.858 }, { "epoch": 0.367727418836387, "grad_norm": 1.8552757501602173, "learning_rate": 1.275549805950841e-05, "loss": 0.9967, "num_input_tokens_seen": 33519872, "step": 286, "train_runtime": 3228.9988, "train_tokens_per_second": 10380.887 }, { "epoch": 0.3690131790421087, "grad_norm": 1.8477954864501953, "learning_rate": 1.272962483829237e-05, "loss": 1.1182, "num_input_tokens_seen": 33670336, "step": 287, "train_runtime": 3243.1369, "train_tokens_per_second": 10382.027 }, { "epoch": 0.3702989392478303, "grad_norm": 1.7322572469711304, "learning_rate": 1.2703751617076327e-05, "loss": 1.0259, "num_input_tokens_seen": 33777152, "step": 288, "train_runtime": 3252.4159, "train_tokens_per_second": 10385.25 }, { "epoch": 0.37158469945355194, "grad_norm": 1.8179206848144531, "learning_rate": 1.2677878395860286e-05, "loss": 1.095, "num_input_tokens_seen": 33933760, "step": 289, "train_runtime": 3267.0848, "train_tokens_per_second": 10386.556 }, { "epoch": 0.37287045965927357, "grad_norm": 1.927725076675415, "learning_rate": 1.2652005174644244e-05, "loss": 1.0971, "num_input_tokens_seen": 34016064, "step": 290, "train_runtime": 3274.2027, "train_tokens_per_second": 10389.114 }, { "epoch": 0.3741562198649952, "grad_norm": 1.8900138139724731, "learning_rate": 1.2626131953428203e-05, "loss": 1.0385, "num_input_tokens_seen": 34105728, "step": 291, "train_runtime": 3281.9209, "train_tokens_per_second": 10392.002 }, { "epoch": 0.37544198007071683, "grad_norm": 1.8767197132110596, "learning_rate": 1.260025873221216e-05, "loss": 1.2325, "num_input_tokens_seen": 34257888, "step": 292, "train_runtime": 3296.0865, "train_tokens_per_second": 10393.504 }, { "epoch": 0.37672774027643846, "grad_norm": 1.6599918603897095, "learning_rate": 1.257438551099612e-05, "loss": 1.0944, "num_input_tokens_seen": 34370272, "step": 293, "train_runtime": 3305.9389, "train_tokens_per_second": 10396.524 }, { "epoch": 0.3780135004821601, "grad_norm": 1.9018691778182983, "learning_rate": 1.254851228978008e-05, "loss": 1.1485, "num_input_tokens_seen": 34497536, "step": 294, "train_runtime": 3317.4286, "train_tokens_per_second": 10398.878 }, { "epoch": 0.3792992606878817, "grad_norm": 1.9373286962509155, "learning_rate": 1.2522639068564037e-05, "loss": 1.1207, "num_input_tokens_seen": 34655552, "step": 295, "train_runtime": 3332.4647, "train_tokens_per_second": 10399.376 }, { "epoch": 0.38058502089360335, "grad_norm": 1.9912974834442139, "learning_rate": 1.2496765847347996e-05, "loss": 1.0018, "num_input_tokens_seen": 34850176, "step": 296, "train_runtime": 3351.492, "train_tokens_per_second": 10398.406 }, { "epoch": 0.381870781099325, "grad_norm": 2.001157760620117, "learning_rate": 1.2470892626131955e-05, "loss": 1.0122, "num_input_tokens_seen": 34929440, "step": 297, "train_runtime": 3358.2119, "train_tokens_per_second": 10401.202 }, { "epoch": 0.3831565413050466, "grad_norm": 1.9736489057540894, "learning_rate": 1.2445019404915912e-05, "loss": 1.0287, "num_input_tokens_seen": 35043488, "step": 298, "train_runtime": 3368.304, "train_tokens_per_second": 10403.897 }, { "epoch": 0.38444230151076825, "grad_norm": 2.0292022228240967, "learning_rate": 1.2419146183699871e-05, "loss": 1.1769, "num_input_tokens_seen": 35170560, "step": 299, "train_runtime": 3379.6518, "train_tokens_per_second": 10406.563 }, { "epoch": 0.3857280617164899, "grad_norm": 1.7314234972000122, "learning_rate": 1.2393272962483832e-05, "loss": 0.97, "num_input_tokens_seen": 35281056, "step": 300, "train_runtime": 3389.3149, "train_tokens_per_second": 10409.495 }, { "epoch": 0.3870138219222115, "grad_norm": 2.0191800594329834, "learning_rate": 1.2367399741267789e-05, "loss": 1.1325, "num_input_tokens_seen": 35388672, "step": 301, "train_runtime": 3417.1135, "train_tokens_per_second": 10356.306 }, { "epoch": 0.38829958212793314, "grad_norm": 1.8068965673446655, "learning_rate": 1.2341526520051748e-05, "loss": 1.1311, "num_input_tokens_seen": 35523712, "step": 302, "train_runtime": 3429.3021, "train_tokens_per_second": 10358.875 }, { "epoch": 0.38958534233365477, "grad_norm": 1.8851860761642456, "learning_rate": 1.2315653298835705e-05, "loss": 1.1328, "num_input_tokens_seen": 35691712, "step": 303, "train_runtime": 3445.5901, "train_tokens_per_second": 10358.665 }, { "epoch": 0.3908711025393764, "grad_norm": 2.3786840438842773, "learning_rate": 1.2289780077619664e-05, "loss": 1.1061, "num_input_tokens_seen": 35780768, "step": 304, "train_runtime": 3453.2825, "train_tokens_per_second": 10361.379 }, { "epoch": 0.39215686274509803, "grad_norm": 1.793230414390564, "learning_rate": 1.2263906856403623e-05, "loss": 1.1275, "num_input_tokens_seen": 35888608, "step": 305, "train_runtime": 3462.6599, "train_tokens_per_second": 10364.462 }, { "epoch": 0.39344262295081966, "grad_norm": 1.8552781343460083, "learning_rate": 1.2238033635187584e-05, "loss": 1.1033, "num_input_tokens_seen": 36048640, "step": 306, "train_runtime": 3477.6998, "train_tokens_per_second": 10365.656 }, { "epoch": 0.3947283831565413, "grad_norm": 1.8553136587142944, "learning_rate": 1.2212160413971541e-05, "loss": 1.0171, "num_input_tokens_seen": 36150336, "step": 307, "train_runtime": 3486.8518, "train_tokens_per_second": 10367.615 }, { "epoch": 0.3960141433622629, "grad_norm": 1.8456462621688843, "learning_rate": 1.21862871927555e-05, "loss": 1.0815, "num_input_tokens_seen": 36262560, "step": 308, "train_runtime": 3496.9741, "train_tokens_per_second": 10369.696 }, { "epoch": 0.39729990356798456, "grad_norm": 2.0002105236053467, "learning_rate": 1.2160413971539457e-05, "loss": 1.0209, "num_input_tokens_seen": 36364320, "step": 309, "train_runtime": 3506.0556, "train_tokens_per_second": 10371.86 }, { "epoch": 0.3985856637737062, "grad_norm": 1.8822708129882812, "learning_rate": 1.2134540750323416e-05, "loss": 1.1019, "num_input_tokens_seen": 36472480, "step": 310, "train_runtime": 3515.5179, "train_tokens_per_second": 10374.71 }, { "epoch": 0.3998714239794278, "grad_norm": 1.954473614692688, "learning_rate": 1.2108667529107373e-05, "loss": 1.2242, "num_input_tokens_seen": 36585792, "step": 311, "train_runtime": 3525.5023, "train_tokens_per_second": 10377.469 }, { "epoch": 0.40115718418514945, "grad_norm": 1.8884960412979126, "learning_rate": 1.2082794307891334e-05, "loss": 1.1584, "num_input_tokens_seen": 36700448, "step": 312, "train_runtime": 3536.0058, "train_tokens_per_second": 10379.069 }, { "epoch": 0.40115718418514945, "eval_loss": 1.112414836883545, "eval_runtime": 22.4354, "eval_samples_per_second": 44.305, "eval_steps_per_second": 1.426, "num_input_tokens_seen": 36700448, "step": 312 }, { "epoch": 0.4024429443908711, "grad_norm": 1.7745190858840942, "learning_rate": 1.2056921086675293e-05, "loss": 1.0609, "num_input_tokens_seen": 36819552, "step": 313, "train_runtime": 3569.0494, "train_tokens_per_second": 10316.347 }, { "epoch": 0.4037287045965927, "grad_norm": 1.9588580131530762, "learning_rate": 1.2031047865459252e-05, "loss": 1.0342, "num_input_tokens_seen": 36901792, "step": 314, "train_runtime": 3576.0188, "train_tokens_per_second": 10319.239 }, { "epoch": 0.40501446480231434, "grad_norm": 1.886616826057434, "learning_rate": 1.200517464424321e-05, "loss": 1.0539, "num_input_tokens_seen": 37002112, "step": 315, "train_runtime": 3584.6465, "train_tokens_per_second": 10322.388 }, { "epoch": 0.406300225008036, "grad_norm": 1.9062621593475342, "learning_rate": 1.1979301423027168e-05, "loss": 1.0985, "num_input_tokens_seen": 37111936, "step": 316, "train_runtime": 3594.3563, "train_tokens_per_second": 10325.058 }, { "epoch": 0.4075859852137576, "grad_norm": 2.068682909011841, "learning_rate": 1.1953428201811125e-05, "loss": 1.097, "num_input_tokens_seen": 37218208, "step": 317, "train_runtime": 3603.7296, "train_tokens_per_second": 10327.692 }, { "epoch": 0.4088717454194793, "grad_norm": 1.958736538887024, "learning_rate": 1.1927554980595084e-05, "loss": 0.9942, "num_input_tokens_seen": 37345632, "step": 318, "train_runtime": 3615.4338, "train_tokens_per_second": 10329.502 }, { "epoch": 0.4101575056252009, "grad_norm": 1.8023805618286133, "learning_rate": 1.1901681759379045e-05, "loss": 0.9653, "num_input_tokens_seen": 37443360, "step": 319, "train_runtime": 3623.7748, "train_tokens_per_second": 10332.695 }, { "epoch": 0.41144326583092256, "grad_norm": 1.9169106483459473, "learning_rate": 1.1875808538163002e-05, "loss": 1.0838, "num_input_tokens_seen": 37545600, "step": 320, "train_runtime": 3632.642, "train_tokens_per_second": 10335.618 }, { "epoch": 0.4127290260366442, "grad_norm": 1.8038839101791382, "learning_rate": 1.1849935316946961e-05, "loss": 1.1069, "num_input_tokens_seen": 37666080, "step": 321, "train_runtime": 3643.3493, "train_tokens_per_second": 10338.311 }, { "epoch": 0.4140147862423658, "grad_norm": 1.7721644639968872, "learning_rate": 1.1824062095730919e-05, "loss": 1.0839, "num_input_tokens_seen": 37822144, "step": 322, "train_runtime": 3657.9869, "train_tokens_per_second": 10339.606 }, { "epoch": 0.41530054644808745, "grad_norm": 1.9049701690673828, "learning_rate": 1.1798188874514877e-05, "loss": 1.0799, "num_input_tokens_seen": 37966560, "step": 323, "train_runtime": 3671.372, "train_tokens_per_second": 10341.246 }, { "epoch": 0.4165863066538091, "grad_norm": 1.980131983757019, "learning_rate": 1.1772315653298836e-05, "loss": 1.0307, "num_input_tokens_seen": 38062112, "step": 324, "train_runtime": 3679.5815, "train_tokens_per_second": 10344.141 }, { "epoch": 0.4178720668595307, "grad_norm": 1.9756392240524292, "learning_rate": 1.1746442432082797e-05, "loss": 1.1018, "num_input_tokens_seen": 38150848, "step": 325, "train_runtime": 3687.0852, "train_tokens_per_second": 10347.157 }, { "epoch": 0.41915782706525234, "grad_norm": 1.896883249282837, "learning_rate": 1.1720569210866754e-05, "loss": 1.1311, "num_input_tokens_seen": 38241536, "step": 326, "train_runtime": 3694.6877, "train_tokens_per_second": 10350.411 }, { "epoch": 0.420443587270974, "grad_norm": 1.739008903503418, "learning_rate": 1.1694695989650713e-05, "loss": 1.0084, "num_input_tokens_seen": 38318656, "step": 327, "train_runtime": 3701.2278, "train_tokens_per_second": 10352.958 }, { "epoch": 0.4217293474766956, "grad_norm": 1.8083174228668213, "learning_rate": 1.166882276843467e-05, "loss": 1.123, "num_input_tokens_seen": 38417472, "step": 328, "train_runtime": 3709.7971, "train_tokens_per_second": 10355.68 }, { "epoch": 0.42301510768241724, "grad_norm": 1.8054888248443604, "learning_rate": 1.164294954721863e-05, "loss": 0.9772, "num_input_tokens_seen": 38536576, "step": 329, "train_runtime": 3720.5243, "train_tokens_per_second": 10357.835 }, { "epoch": 0.42430086788813887, "grad_norm": 1.8551595211029053, "learning_rate": 1.1617076326002587e-05, "loss": 1.0588, "num_input_tokens_seen": 38623488, "step": 330, "train_runtime": 3727.8728, "train_tokens_per_second": 10360.731 }, { "epoch": 0.4255866280938605, "grad_norm": 1.9173765182495117, "learning_rate": 1.1591203104786546e-05, "loss": 1.0059, "num_input_tokens_seen": 38708384, "step": 331, "train_runtime": 3752.9725, "train_tokens_per_second": 10314.06 }, { "epoch": 0.42687238829958213, "grad_norm": 1.9079426527023315, "learning_rate": 1.1565329883570506e-05, "loss": 1.1054, "num_input_tokens_seen": 38843744, "step": 332, "train_runtime": 3765.4725, "train_tokens_per_second": 10315.769 }, { "epoch": 0.42815814850530376, "grad_norm": 1.8765593767166138, "learning_rate": 1.1539456662354465e-05, "loss": 1.0543, "num_input_tokens_seen": 38952768, "step": 333, "train_runtime": 3774.9835, "train_tokens_per_second": 10318.659 }, { "epoch": 0.4294439087110254, "grad_norm": 1.9778969287872314, "learning_rate": 1.1513583441138423e-05, "loss": 1.0328, "num_input_tokens_seen": 39051136, "step": 334, "train_runtime": 3783.4403, "train_tokens_per_second": 10321.594 }, { "epoch": 0.430729668916747, "grad_norm": 1.9157649278640747, "learning_rate": 1.1487710219922382e-05, "loss": 1.0765, "num_input_tokens_seen": 39151392, "step": 335, "train_runtime": 3792.1825, "train_tokens_per_second": 10324.237 }, { "epoch": 0.43201542912246865, "grad_norm": 1.9655895233154297, "learning_rate": 1.1461836998706339e-05, "loss": 1.0175, "num_input_tokens_seen": 39247360, "step": 336, "train_runtime": 3800.3977, "train_tokens_per_second": 10327.172 }, { "epoch": 0.4333011893281903, "grad_norm": 1.8738690614700317, "learning_rate": 1.1435963777490298e-05, "loss": 1.103, "num_input_tokens_seen": 39336896, "step": 337, "train_runtime": 3808.0625, "train_tokens_per_second": 10329.898 }, { "epoch": 0.4345869495339119, "grad_norm": 1.6234264373779297, "learning_rate": 1.1410090556274259e-05, "loss": 0.8555, "num_input_tokens_seen": 39482304, "step": 338, "train_runtime": 3821.6722, "train_tokens_per_second": 10331.159 }, { "epoch": 0.43587270973963355, "grad_norm": 1.8462566137313843, "learning_rate": 1.1384217335058216e-05, "loss": 1.1103, "num_input_tokens_seen": 39575136, "step": 339, "train_runtime": 3829.6789, "train_tokens_per_second": 10333.8 }, { "epoch": 0.4371584699453552, "grad_norm": 1.850907325744629, "learning_rate": 1.1358344113842175e-05, "loss": 1.0596, "num_input_tokens_seen": 39689024, "step": 340, "train_runtime": 3839.7717, "train_tokens_per_second": 10336.298 }, { "epoch": 0.4384442301510768, "grad_norm": 1.863982915878296, "learning_rate": 1.1332470892626132e-05, "loss": 1.0263, "num_input_tokens_seen": 39816832, "step": 341, "train_runtime": 3851.71, "train_tokens_per_second": 10337.443 }, { "epoch": 0.43972999035679844, "grad_norm": 1.933987021446228, "learning_rate": 1.1306597671410091e-05, "loss": 1.0908, "num_input_tokens_seen": 39960768, "step": 342, "train_runtime": 3865.0922, "train_tokens_per_second": 10338.891 }, { "epoch": 0.44101575056252007, "grad_norm": 1.8219382762908936, "learning_rate": 1.128072445019405e-05, "loss": 1.1551, "num_input_tokens_seen": 40086912, "step": 343, "train_runtime": 3876.2397, "train_tokens_per_second": 10341.701 }, { "epoch": 0.4423015107682417, "grad_norm": 1.9455715417861938, "learning_rate": 1.1254851228978007e-05, "loss": 1.1734, "num_input_tokens_seen": 40207200, "step": 344, "train_runtime": 3887.3565, "train_tokens_per_second": 10343.07 }, { "epoch": 0.44358727097396333, "grad_norm": 1.81923246383667, "learning_rate": 1.1228978007761968e-05, "loss": 1.0239, "num_input_tokens_seen": 40346560, "step": 345, "train_runtime": 3900.1116, "train_tokens_per_second": 10344.976 }, { "epoch": 0.44487303117968496, "grad_norm": 1.9423332214355469, "learning_rate": 1.1203104786545927e-05, "loss": 0.9855, "num_input_tokens_seen": 40449888, "step": 346, "train_runtime": 3909.0681, "train_tokens_per_second": 10347.706 }, { "epoch": 0.4461587913854066, "grad_norm": 1.9526299238204956, "learning_rate": 1.1177231565329884e-05, "loss": 1.0271, "num_input_tokens_seen": 40586752, "step": 347, "train_runtime": 3921.8977, "train_tokens_per_second": 10348.753 }, { "epoch": 0.4474445515911283, "grad_norm": 1.8065625429153442, "learning_rate": 1.1151358344113843e-05, "loss": 1.1239, "num_input_tokens_seen": 40696608, "step": 348, "train_runtime": 3931.7547, "train_tokens_per_second": 10350.749 }, { "epoch": 0.4487303117968499, "grad_norm": 1.6349153518676758, "learning_rate": 1.11254851228978e-05, "loss": 0.9781, "num_input_tokens_seen": 40814656, "step": 349, "train_runtime": 3942.1447, "train_tokens_per_second": 10353.414 }, { "epoch": 0.45001607200257154, "grad_norm": 1.7468831539154053, "learning_rate": 1.109961190168176e-05, "loss": 1.0172, "num_input_tokens_seen": 40974816, "step": 350, "train_runtime": 3957.5232, "train_tokens_per_second": 10353.651 }, { "epoch": 0.4513018322082932, "grad_norm": 1.9717236757278442, "learning_rate": 1.107373868046572e-05, "loss": 1.1383, "num_input_tokens_seen": 41075776, "step": 351, "train_runtime": 3966.3179, "train_tokens_per_second": 10356.148 }, { "epoch": 0.4525875924140148, "grad_norm": 1.715475082397461, "learning_rate": 1.1047865459249679e-05, "loss": 1.0579, "num_input_tokens_seen": 41192352, "step": 352, "train_runtime": 3976.6366, "train_tokens_per_second": 10358.591 }, { "epoch": 0.45387335261973644, "grad_norm": 1.936943769454956, "learning_rate": 1.1021992238033636e-05, "loss": 1.1545, "num_input_tokens_seen": 41296928, "step": 353, "train_runtime": 3985.9231, "train_tokens_per_second": 10360.694 }, { "epoch": 0.45515911282545807, "grad_norm": 1.7825515270233154, "learning_rate": 1.0996119016817595e-05, "loss": 1.0933, "num_input_tokens_seen": 41390336, "step": 354, "train_runtime": 3993.8858, "train_tokens_per_second": 10363.425 }, { "epoch": 0.4564448730311797, "grad_norm": 1.7963905334472656, "learning_rate": 1.0970245795601552e-05, "loss": 1.0372, "num_input_tokens_seen": 41491968, "step": 355, "train_runtime": 4002.6542, "train_tokens_per_second": 10366.114 }, { "epoch": 0.45773063323690133, "grad_norm": 1.836431860923767, "learning_rate": 1.0944372574385511e-05, "loss": 1.0373, "num_input_tokens_seen": 41613888, "step": 356, "train_runtime": 4013.7789, "train_tokens_per_second": 10367.758 }, { "epoch": 0.45901639344262296, "grad_norm": 1.9172090291976929, "learning_rate": 1.0918499353169469e-05, "loss": 1.0329, "num_input_tokens_seen": 41745664, "step": 357, "train_runtime": 4025.8189, "train_tokens_per_second": 10369.484 }, { "epoch": 0.4603021536483446, "grad_norm": 1.8832635879516602, "learning_rate": 1.089262613195343e-05, "loss": 1.0411, "num_input_tokens_seen": 41879264, "step": 358, "train_runtime": 4038.136, "train_tokens_per_second": 10370.939 }, { "epoch": 0.4615879138540662, "grad_norm": 1.8881222009658813, "learning_rate": 1.0866752910737388e-05, "loss": 1.1016, "num_input_tokens_seen": 42019424, "step": 359, "train_runtime": 4050.808, "train_tokens_per_second": 10373.097 }, { "epoch": 0.46287367405978785, "grad_norm": 1.8251198530197144, "learning_rate": 1.0840879689521346e-05, "loss": 1.0582, "num_input_tokens_seen": 42184096, "step": 360, "train_runtime": 4066.1572, "train_tokens_per_second": 10374.438 }, { "epoch": 0.4641594342655095, "grad_norm": 1.8713456392288208, "learning_rate": 1.0815006468305305e-05, "loss": 1.111, "num_input_tokens_seen": 42279968, "step": 361, "train_runtime": 4091.1662, "train_tokens_per_second": 10334.454 }, { "epoch": 0.4654451944712311, "grad_norm": 1.8834689855575562, "learning_rate": 1.0789133247089263e-05, "loss": 1.1313, "num_input_tokens_seen": 42376320, "step": 362, "train_runtime": 4099.4271, "train_tokens_per_second": 10337.132 }, { "epoch": 0.46673095467695275, "grad_norm": 1.9569921493530273, "learning_rate": 1.076326002587322e-05, "loss": 0.9795, "num_input_tokens_seen": 42480736, "step": 363, "train_runtime": 4108.5761, "train_tokens_per_second": 10339.528 }, { "epoch": 0.4680167148826744, "grad_norm": 1.9009162187576294, "learning_rate": 1.0737386804657181e-05, "loss": 1.028, "num_input_tokens_seen": 42588928, "step": 364, "train_runtime": 4117.995, "train_tokens_per_second": 10342.151 }, { "epoch": 0.469302475088396, "grad_norm": 1.9303570985794067, "learning_rate": 1.071151358344114e-05, "loss": 1.0805, "num_input_tokens_seen": 42702336, "step": 365, "train_runtime": 4127.9119, "train_tokens_per_second": 10344.779 }, { "epoch": 0.47058823529411764, "grad_norm": 1.8810940980911255, "learning_rate": 1.0685640362225098e-05, "loss": 1.0237, "num_input_tokens_seen": 42778176, "step": 366, "train_runtime": 4134.3506, "train_tokens_per_second": 10347.012 }, { "epoch": 0.47187399549983927, "grad_norm": 1.7211192846298218, "learning_rate": 1.0659767141009057e-05, "loss": 0.9568, "num_input_tokens_seen": 42865536, "step": 367, "train_runtime": 4141.8091, "train_tokens_per_second": 10349.472 }, { "epoch": 0.4731597557055609, "grad_norm": 1.7768193483352661, "learning_rate": 1.0633893919793014e-05, "loss": 1.0588, "num_input_tokens_seen": 42971392, "step": 368, "train_runtime": 4151.0681, "train_tokens_per_second": 10351.888 }, { "epoch": 0.47444551591128253, "grad_norm": 1.8423272371292114, "learning_rate": 1.0608020698576973e-05, "loss": 1.0675, "num_input_tokens_seen": 43112160, "step": 369, "train_runtime": 4164.273, "train_tokens_per_second": 10352.866 }, { "epoch": 0.47573127611700416, "grad_norm": 1.7994762659072876, "learning_rate": 1.0582147477360933e-05, "loss": 1.0544, "num_input_tokens_seen": 43221728, "step": 370, "train_runtime": 4173.8176, "train_tokens_per_second": 10355.443 }, { "epoch": 0.4770170363227258, "grad_norm": 1.8866075277328491, "learning_rate": 1.0556274256144892e-05, "loss": 1.1007, "num_input_tokens_seen": 43330080, "step": 371, "train_runtime": 4183.4643, "train_tokens_per_second": 10357.464 }, { "epoch": 0.4783027965284474, "grad_norm": 1.8547290563583374, "learning_rate": 1.053040103492885e-05, "loss": 0.9975, "num_input_tokens_seen": 43423392, "step": 372, "train_runtime": 4191.3728, "train_tokens_per_second": 10360.184 }, { "epoch": 0.47958855673416906, "grad_norm": 2.1289970874786377, "learning_rate": 1.0504527813712809e-05, "loss": 1.0475, "num_input_tokens_seen": 43536064, "step": 373, "train_runtime": 4201.1006, "train_tokens_per_second": 10363.014 }, { "epoch": 0.4808743169398907, "grad_norm": 1.9905496835708618, "learning_rate": 1.0478654592496766e-05, "loss": 0.9375, "num_input_tokens_seen": 43635072, "step": 374, "train_runtime": 4209.5792, "train_tokens_per_second": 10365.661 }, { "epoch": 0.4821600771456123, "grad_norm": 1.791810393333435, "learning_rate": 1.0452781371280725e-05, "loss": 1.0144, "num_input_tokens_seen": 43724256, "step": 375, "train_runtime": 4217.1636, "train_tokens_per_second": 10368.167 }, { "epoch": 0.48344583735133395, "grad_norm": 1.828808307647705, "learning_rate": 1.0426908150064682e-05, "loss": 1.1086, "num_input_tokens_seen": 43903168, "step": 376, "train_runtime": 4234.1848, "train_tokens_per_second": 10368.742 }, { "epoch": 0.4847315975570556, "grad_norm": 2.0768697261810303, "learning_rate": 1.0401034928848643e-05, "loss": 1.1689, "num_input_tokens_seen": 44021952, "step": 377, "train_runtime": 4244.5157, "train_tokens_per_second": 10371.49 }, { "epoch": 0.48601735776277727, "grad_norm": 1.960158109664917, "learning_rate": 1.0375161707632602e-05, "loss": 1.061, "num_input_tokens_seen": 44108640, "step": 378, "train_runtime": 4251.8678, "train_tokens_per_second": 10373.944 }, { "epoch": 0.4873031179684989, "grad_norm": 1.9121805429458618, "learning_rate": 1.034928848641656e-05, "loss": 1.0433, "num_input_tokens_seen": 44203648, "step": 379, "train_runtime": 4260.0015, "train_tokens_per_second": 10376.44 }, { "epoch": 0.48858887817422053, "grad_norm": 1.8849984407424927, "learning_rate": 1.0323415265200518e-05, "loss": 1.1013, "num_input_tokens_seen": 44291008, "step": 380, "train_runtime": 4267.4727, "train_tokens_per_second": 10378.744 }, { "epoch": 0.48987463837994216, "grad_norm": 1.863187313079834, "learning_rate": 1.0297542043984477e-05, "loss": 1.028, "num_input_tokens_seen": 44377920, "step": 381, "train_runtime": 4274.8697, "train_tokens_per_second": 10381.116 }, { "epoch": 0.4911603985856638, "grad_norm": 1.8333090543746948, "learning_rate": 1.0271668822768434e-05, "loss": 1.075, "num_input_tokens_seen": 44581920, "step": 382, "train_runtime": 4294.9622, "train_tokens_per_second": 10380.049 }, { "epoch": 0.4924461587913854, "grad_norm": 1.873062252998352, "learning_rate": 1.0245795601552395e-05, "loss": 1.1039, "num_input_tokens_seen": 44754688, "step": 383, "train_runtime": 4311.2726, "train_tokens_per_second": 10380.853 }, { "epoch": 0.49373191899710706, "grad_norm": 1.9315266609191895, "learning_rate": 1.0219922380336354e-05, "loss": 1.145, "num_input_tokens_seen": 44880224, "step": 384, "train_runtime": 4323.0272, "train_tokens_per_second": 10381.666 }, { "epoch": 0.4950176792028287, "grad_norm": 1.731623888015747, "learning_rate": 1.0194049159120311e-05, "loss": 1.0024, "num_input_tokens_seen": 45029664, "step": 385, "train_runtime": 4336.9208, "train_tokens_per_second": 10382.865 }, { "epoch": 0.4963034394085503, "grad_norm": 1.618575096130371, "learning_rate": 1.016817593790427e-05, "loss": 0.9817, "num_input_tokens_seen": 45129600, "step": 386, "train_runtime": 4345.5214, "train_tokens_per_second": 10385.313 }, { "epoch": 0.49758919961427195, "grad_norm": 1.8326330184936523, "learning_rate": 1.0142302716688227e-05, "loss": 1.0646, "num_input_tokens_seen": 45219104, "step": 387, "train_runtime": 4353.1201, "train_tokens_per_second": 10387.746 }, { "epoch": 0.4988749598199936, "grad_norm": 1.9410369396209717, "learning_rate": 1.0116429495472186e-05, "loss": 1.1241, "num_input_tokens_seen": 45380032, "step": 388, "train_runtime": 4368.2134, "train_tokens_per_second": 10388.694 }, { "epoch": 0.5001607200257152, "grad_norm": 2.0092506408691406, "learning_rate": 1.0090556274256145e-05, "loss": 1.0946, "num_input_tokens_seen": 45512480, "step": 389, "train_runtime": 4380.1221, "train_tokens_per_second": 10390.687 }, { "epoch": 0.5014464802314368, "grad_norm": 2.0018155574798584, "learning_rate": 1.0064683053040106e-05, "loss": 1.0753, "num_input_tokens_seen": 45640032, "step": 390, "train_runtime": 4391.8578, "train_tokens_per_second": 10391.965 }, { "epoch": 0.5014464802314368, "eval_loss": 1.1071221828460693, "eval_runtime": 22.1149, "eval_samples_per_second": 44.947, "eval_steps_per_second": 1.447, "num_input_tokens_seen": 45640032, "step": 390 }, { "epoch": 0.5027322404371585, "grad_norm": 1.8650777339935303, "learning_rate": 1.0038809831824063e-05, "loss": 1.036, "num_input_tokens_seen": 45720768, "step": 391, "train_runtime": 4437.5417, "train_tokens_per_second": 10303.175 }, { "epoch": 0.50401800064288, "grad_norm": 1.9369052648544312, "learning_rate": 1.0012936610608022e-05, "loss": 1.1169, "num_input_tokens_seen": 45842240, "step": 392, "train_runtime": 4448.5568, "train_tokens_per_second": 10304.969 }, { "epoch": 0.5053037608486017, "grad_norm": 1.8346235752105713, "learning_rate": 9.98706338939198e-06, "loss": 1.0749, "num_input_tokens_seen": 45918976, "step": 393, "train_runtime": 4454.9464, "train_tokens_per_second": 10307.414 }, { "epoch": 0.5065895210543234, "grad_norm": 2.0440127849578857, "learning_rate": 9.961190168175938e-06, "loss": 1.0516, "num_input_tokens_seen": 45999104, "step": 394, "train_runtime": 4461.6884, "train_tokens_per_second": 10309.798 }, { "epoch": 0.507875281260045, "grad_norm": 3.248145341873169, "learning_rate": 9.935316946959897e-06, "loss": 1.1728, "num_input_tokens_seen": 46154144, "step": 395, "train_runtime": 4476.3079, "train_tokens_per_second": 10310.762 }, { "epoch": 0.5091610414657667, "grad_norm": 1.918129801750183, "learning_rate": 9.909443725743856e-06, "loss": 1.0521, "num_input_tokens_seen": 46325344, "step": 396, "train_runtime": 4492.8544, "train_tokens_per_second": 10310.894 }, { "epoch": 0.5104468016714883, "grad_norm": 1.8980101346969604, "learning_rate": 9.883570504527814e-06, "loss": 1.0749, "num_input_tokens_seen": 46411072, "step": 397, "train_runtime": 4500.1395, "train_tokens_per_second": 10313.252 }, { "epoch": 0.51173256187721, "grad_norm": 1.7899583578109741, "learning_rate": 9.857697283311774e-06, "loss": 1.0462, "num_input_tokens_seen": 46509216, "step": 398, "train_runtime": 4508.575, "train_tokens_per_second": 10315.724 }, { "epoch": 0.5130183220829315, "grad_norm": 1.8656114339828491, "learning_rate": 9.831824062095732e-06, "loss": 1.0682, "num_input_tokens_seen": 46644160, "step": 399, "train_runtime": 4520.8245, "train_tokens_per_second": 10317.622 }, { "epoch": 0.5143040822886532, "grad_norm": 1.847536325454712, "learning_rate": 9.80595084087969e-06, "loss": 1.0864, "num_input_tokens_seen": 46783808, "step": 400, "train_runtime": 4533.3771, "train_tokens_per_second": 10319.858 }, { "epoch": 0.5155898424943748, "grad_norm": 1.8390229940414429, "learning_rate": 9.78007761966365e-06, "loss": 0.9831, "num_input_tokens_seen": 46926240, "step": 401, "train_runtime": 4546.39, "train_tokens_per_second": 10321.649 }, { "epoch": 0.5168756027000965, "grad_norm": 1.8536787033081055, "learning_rate": 9.754204398447608e-06, "loss": 1.0727, "num_input_tokens_seen": 47071040, "step": 402, "train_runtime": 4559.4688, "train_tokens_per_second": 10323.799 }, { "epoch": 0.518161362905818, "grad_norm": 1.8034573793411255, "learning_rate": 9.728331177231566e-06, "loss": 1.1378, "num_input_tokens_seen": 47179744, "step": 403, "train_runtime": 4569.0897, "train_tokens_per_second": 10325.852 }, { "epoch": 0.5194471231115397, "grad_norm": 1.8764989376068115, "learning_rate": 9.702457956015525e-06, "loss": 1.0454, "num_input_tokens_seen": 47293760, "step": 404, "train_runtime": 4579.0502, "train_tokens_per_second": 10328.29 }, { "epoch": 0.5207328833172613, "grad_norm": 1.9220011234283447, "learning_rate": 9.676584734799484e-06, "loss": 1.1761, "num_input_tokens_seen": 47392832, "step": 405, "train_runtime": 4587.61, "train_tokens_per_second": 10330.615 }, { "epoch": 0.522018643522983, "grad_norm": 1.879625916481018, "learning_rate": 9.650711513583441e-06, "loss": 1.0923, "num_input_tokens_seen": 47487712, "step": 406, "train_runtime": 4595.7576, "train_tokens_per_second": 10332.945 }, { "epoch": 0.5233044037287046, "grad_norm": 1.839417815208435, "learning_rate": 9.624838292367402e-06, "loss": 1.1236, "num_input_tokens_seen": 47620096, "step": 407, "train_runtime": 4607.8581, "train_tokens_per_second": 10334.541 }, { "epoch": 0.5245901639344263, "grad_norm": 1.8451459407806396, "learning_rate": 9.598965071151359e-06, "loss": 1.0462, "num_input_tokens_seen": 47700000, "step": 408, "train_runtime": 4614.6366, "train_tokens_per_second": 10336.675 }, { "epoch": 0.5258759241401478, "grad_norm": 1.9718786478042603, "learning_rate": 9.573091849935318e-06, "loss": 0.9997, "num_input_tokens_seen": 47834944, "step": 409, "train_runtime": 4626.8909, "train_tokens_per_second": 10338.464 }, { "epoch": 0.5271616843458695, "grad_norm": 1.9811155796051025, "learning_rate": 9.547218628719275e-06, "loss": 1.0761, "num_input_tokens_seen": 47968160, "step": 410, "train_runtime": 4639.1336, "train_tokens_per_second": 10339.896 }, { "epoch": 0.5284474445515911, "grad_norm": 1.8997541666030884, "learning_rate": 9.521345407503236e-06, "loss": 1.027, "num_input_tokens_seen": 48059648, "step": 411, "train_runtime": 4646.969, "train_tokens_per_second": 10342.149 }, { "epoch": 0.5297332047573128, "grad_norm": 1.8173083066940308, "learning_rate": 9.495472186287193e-06, "loss": 1.1339, "num_input_tokens_seen": 48181504, "step": 412, "train_runtime": 4658.0106, "train_tokens_per_second": 10343.794 }, { "epoch": 0.5310189649630344, "grad_norm": 1.7731293439865112, "learning_rate": 9.469598965071152e-06, "loss": 0.9738, "num_input_tokens_seen": 48280416, "step": 413, "train_runtime": 4666.5826, "train_tokens_per_second": 10345.99 }, { "epoch": 0.532304725168756, "grad_norm": 1.9140669107437134, "learning_rate": 9.443725743855111e-06, "loss": 1.0163, "num_input_tokens_seen": 48409600, "step": 414, "train_runtime": 4678.3897, "train_tokens_per_second": 10347.492 }, { "epoch": 0.5335904853744776, "grad_norm": 1.872811198234558, "learning_rate": 9.41785252263907e-06, "loss": 0.9948, "num_input_tokens_seen": 48530944, "step": 415, "train_runtime": 4689.1516, "train_tokens_per_second": 10349.622 }, { "epoch": 0.5348762455801993, "grad_norm": 1.7188026905059814, "learning_rate": 9.391979301423027e-06, "loss": 1.0364, "num_input_tokens_seen": 48621344, "step": 416, "train_runtime": 4696.9538, "train_tokens_per_second": 10351.676 }, { "epoch": 0.5361620057859209, "grad_norm": 1.9433099031448364, "learning_rate": 9.366106080206988e-06, "loss": 1.0985, "num_input_tokens_seen": 48730336, "step": 417, "train_runtime": 4706.5206, "train_tokens_per_second": 10353.792 }, { "epoch": 0.5374477659916426, "grad_norm": 1.8120436668395996, "learning_rate": 9.340232858990945e-06, "loss": 1.0375, "num_input_tokens_seen": 48876416, "step": 418, "train_runtime": 4720.1751, "train_tokens_per_second": 10354.789 }, { "epoch": 0.5387335261973641, "grad_norm": 1.8917372226715088, "learning_rate": 9.314359637774904e-06, "loss": 1.0179, "num_input_tokens_seen": 48968384, "step": 419, "train_runtime": 4728.029, "train_tokens_per_second": 10357.04 }, { "epoch": 0.5400192864030858, "grad_norm": 1.9676231145858765, "learning_rate": 9.288486416558863e-06, "loss": 1.0241, "num_input_tokens_seen": 49076928, "step": 420, "train_runtime": 4737.4729, "train_tokens_per_second": 10359.305 }, { "epoch": 0.5413050466088074, "grad_norm": 1.799108862876892, "learning_rate": 9.262613195342822e-06, "loss": 1.1027, "num_input_tokens_seen": 49202080, "step": 421, "train_runtime": 4765.3676, "train_tokens_per_second": 10324.928 }, { "epoch": 0.5425908068145291, "grad_norm": 1.6937819719314575, "learning_rate": 9.23673997412678e-06, "loss": 1.0448, "num_input_tokens_seen": 49279744, "step": 422, "train_runtime": 4772.0012, "train_tokens_per_second": 10326.851 }, { "epoch": 0.5438765670202508, "grad_norm": 1.8214465379714966, "learning_rate": 9.210866752910738e-06, "loss": 1.0483, "num_input_tokens_seen": 49426304, "step": 423, "train_runtime": 4785.0768, "train_tokens_per_second": 10329.26 }, { "epoch": 0.5451623272259724, "grad_norm": 2.017838954925537, "learning_rate": 9.184993531694697e-06, "loss": 1.0529, "num_input_tokens_seen": 49552544, "step": 424, "train_runtime": 4796.8995, "train_tokens_per_second": 10330.119 }, { "epoch": 0.546448087431694, "grad_norm": 1.8154163360595703, "learning_rate": 9.159120310478656e-06, "loss": 1.0638, "num_input_tokens_seen": 49681152, "step": 425, "train_runtime": 4808.5011, "train_tokens_per_second": 10331.941 }, { "epoch": 0.5477338476374156, "grad_norm": 2.039503574371338, "learning_rate": 9.133247089262613e-06, "loss": 1.1204, "num_input_tokens_seen": 49810272, "step": 426, "train_runtime": 4820.4338, "train_tokens_per_second": 10333.151 }, { "epoch": 0.5490196078431373, "grad_norm": 1.8751721382141113, "learning_rate": 9.107373868046572e-06, "loss": 1.0905, "num_input_tokens_seen": 49931552, "step": 427, "train_runtime": 4831.6448, "train_tokens_per_second": 10334.276 }, { "epoch": 0.5503053680488589, "grad_norm": 1.9049893617630005, "learning_rate": 9.081500646830531e-06, "loss": 1.0296, "num_input_tokens_seen": 50054880, "step": 428, "train_runtime": 4842.7281, "train_tokens_per_second": 10336.091 }, { "epoch": 0.5515911282545806, "grad_norm": 1.743492603302002, "learning_rate": 9.055627425614489e-06, "loss": 1.0613, "num_input_tokens_seen": 50135776, "step": 429, "train_runtime": 4849.6827, "train_tokens_per_second": 10337.95 }, { "epoch": 0.5528768884603021, "grad_norm": 1.752612590789795, "learning_rate": 9.02975420439845e-06, "loss": 1.0087, "num_input_tokens_seen": 50233920, "step": 430, "train_runtime": 4858.229, "train_tokens_per_second": 10339.965 }, { "epoch": 0.5541626486660238, "grad_norm": 1.793007493019104, "learning_rate": 9.003880983182406e-06, "loss": 1.0386, "num_input_tokens_seen": 50364480, "step": 431, "train_runtime": 4870.2509, "train_tokens_per_second": 10341.249 }, { "epoch": 0.5554484088717454, "grad_norm": 1.8837916851043701, "learning_rate": 8.978007761966365e-06, "loss": 1.0343, "num_input_tokens_seen": 50477568, "step": 432, "train_runtime": 4880.2122, "train_tokens_per_second": 10343.314 }, { "epoch": 0.5567341690774671, "grad_norm": 1.8399786949157715, "learning_rate": 8.952134540750324e-06, "loss": 1.0474, "num_input_tokens_seen": 50587904, "step": 433, "train_runtime": 4889.8391, "train_tokens_per_second": 10345.515 }, { "epoch": 0.5580199292831887, "grad_norm": 1.9835869073867798, "learning_rate": 8.926261319534283e-06, "loss": 1.0986, "num_input_tokens_seen": 50748288, "step": 434, "train_runtime": 4904.8056, "train_tokens_per_second": 10346.646 }, { "epoch": 0.5593056894889104, "grad_norm": 2.022273540496826, "learning_rate": 8.90038809831824e-06, "loss": 1.078, "num_input_tokens_seen": 50829376, "step": 435, "train_runtime": 4911.6238, "train_tokens_per_second": 10348.793 }, { "epoch": 0.5605914496946319, "grad_norm": 1.9517446756362915, "learning_rate": 8.874514877102201e-06, "loss": 1.0425, "num_input_tokens_seen": 50990240, "step": 436, "train_runtime": 4927.2726, "train_tokens_per_second": 10348.573 }, { "epoch": 0.5618772099003536, "grad_norm": 1.8184734582901, "learning_rate": 8.848641655886159e-06, "loss": 1.201, "num_input_tokens_seen": 51092736, "step": 437, "train_runtime": 4936.1299, "train_tokens_per_second": 10350.768 }, { "epoch": 0.5631629701060752, "grad_norm": 1.876457929611206, "learning_rate": 8.822768434670118e-06, "loss": 1.0678, "num_input_tokens_seen": 51179680, "step": 438, "train_runtime": 4943.6088, "train_tokens_per_second": 10352.696 }, { "epoch": 0.5644487303117969, "grad_norm": 1.8654677867889404, "learning_rate": 8.796895213454075e-06, "loss": 1.0735, "num_input_tokens_seen": 51292160, "step": 439, "train_runtime": 4953.7338, "train_tokens_per_second": 10354.242 }, { "epoch": 0.5657344905175185, "grad_norm": 1.7864034175872803, "learning_rate": 8.771021992238035e-06, "loss": 1.0005, "num_input_tokens_seen": 51402400, "step": 440, "train_runtime": 4963.8198, "train_tokens_per_second": 10355.412 }, { "epoch": 0.5670202507232401, "grad_norm": 1.8480334281921387, "learning_rate": 8.745148771021993e-06, "loss": 1.146, "num_input_tokens_seen": 51503840, "step": 441, "train_runtime": 4972.6909, "train_tokens_per_second": 10357.338 }, { "epoch": 0.5683060109289617, "grad_norm": 1.8786932229995728, "learning_rate": 8.719275549805952e-06, "loss": 1.032, "num_input_tokens_seen": 51625920, "step": 442, "train_runtime": 4983.5486, "train_tokens_per_second": 10359.269 }, { "epoch": 0.5695917711346834, "grad_norm": 1.8805335760116577, "learning_rate": 8.69340232858991e-06, "loss": 1.0604, "num_input_tokens_seen": 51766848, "step": 443, "train_runtime": 4996.6032, "train_tokens_per_second": 10360.408 }, { "epoch": 0.570877531340405, "grad_norm": 2.044856548309326, "learning_rate": 8.66752910737387e-06, "loss": 1.0327, "num_input_tokens_seen": 51885568, "step": 444, "train_runtime": 5007.1763, "train_tokens_per_second": 10362.241 }, { "epoch": 0.5721632915461267, "grad_norm": 1.7294365167617798, "learning_rate": 8.641655886157827e-06, "loss": 1.0273, "num_input_tokens_seen": 51987968, "step": 445, "train_runtime": 5016.2418, "train_tokens_per_second": 10363.928 }, { "epoch": 0.5734490517518482, "grad_norm": 1.9049499034881592, "learning_rate": 8.615782664941786e-06, "loss": 1.0087, "num_input_tokens_seen": 52075232, "step": 446, "train_runtime": 5023.7352, "train_tokens_per_second": 10365.839 }, { "epoch": 0.5747348119575699, "grad_norm": 1.995016098022461, "learning_rate": 8.589909443725745e-06, "loss": 1.082, "num_input_tokens_seen": 52181120, "step": 447, "train_runtime": 5033.0217, "train_tokens_per_second": 10367.752 }, { "epoch": 0.5760205721632915, "grad_norm": 1.8061517477035522, "learning_rate": 8.564036222509704e-06, "loss": 1.0338, "num_input_tokens_seen": 52312864, "step": 448, "train_runtime": 5045.4751, "train_tokens_per_second": 10368.273 }, { "epoch": 0.5773063323690132, "grad_norm": 1.906706690788269, "learning_rate": 8.538163001293663e-06, "loss": 1.0313, "num_input_tokens_seen": 52492128, "step": 449, "train_runtime": 5062.8483, "train_tokens_per_second": 10368.102 }, { "epoch": 0.5785920925747348, "grad_norm": 1.9607821702957153, "learning_rate": 8.51228978007762e-06, "loss": 1.0598, "num_input_tokens_seen": 52580800, "step": 450, "train_runtime": 5070.3956, "train_tokens_per_second": 10370.157 }, { "epoch": 0.5798778527804564, "grad_norm": 1.8769546747207642, "learning_rate": 8.486416558861579e-06, "loss": 1.0721, "num_input_tokens_seen": 52715552, "step": 451, "train_runtime": 5099.7454, "train_tokens_per_second": 10336.899 }, { "epoch": 0.581163612986178, "grad_norm": 1.8132247924804688, "learning_rate": 8.460543337645536e-06, "loss": 1.0979, "num_input_tokens_seen": 52884896, "step": 452, "train_runtime": 5115.8206, "train_tokens_per_second": 10337.52 }, { "epoch": 0.5824493731918997, "grad_norm": 1.8635915517807007, "learning_rate": 8.434670116429497e-06, "loss": 1.0368, "num_input_tokens_seen": 53008224, "step": 453, "train_runtime": 5126.8881, "train_tokens_per_second": 10339.259 }, { "epoch": 0.5837351333976214, "grad_norm": 1.903838038444519, "learning_rate": 8.408796895213454e-06, "loss": 0.9926, "num_input_tokens_seen": 53141920, "step": 454, "train_runtime": 5138.9508, "train_tokens_per_second": 10341.006 }, { "epoch": 0.585020893603343, "grad_norm": 1.836340069770813, "learning_rate": 8.382923673997413e-06, "loss": 1.0946, "num_input_tokens_seen": 53272960, "step": 455, "train_runtime": 5150.7368, "train_tokens_per_second": 10342.784 }, { "epoch": 0.5863066538090647, "grad_norm": 1.8196651935577393, "learning_rate": 8.357050452781372e-06, "loss": 1.0399, "num_input_tokens_seen": 53416992, "step": 456, "train_runtime": 5163.847, "train_tokens_per_second": 10344.418 }, { "epoch": 0.5875924140147862, "grad_norm": 1.8723372220993042, "learning_rate": 8.331177231565331e-06, "loss": 1.1476, "num_input_tokens_seen": 53533632, "step": 457, "train_runtime": 5174.1711, "train_tokens_per_second": 10346.32 }, { "epoch": 0.5888781742205079, "grad_norm": 1.8454405069351196, "learning_rate": 8.305304010349288e-06, "loss": 1.031, "num_input_tokens_seen": 53631552, "step": 458, "train_runtime": 5182.534, "train_tokens_per_second": 10348.519 }, { "epoch": 0.5901639344262295, "grad_norm": 1.9296767711639404, "learning_rate": 8.279430789133249e-06, "loss": 1.036, "num_input_tokens_seen": 53754528, "step": 459, "train_runtime": 5193.4642, "train_tokens_per_second": 10350.419 }, { "epoch": 0.5914496946319512, "grad_norm": 1.8463411331176758, "learning_rate": 8.253557567917206e-06, "loss": 0.9773, "num_input_tokens_seen": 53828992, "step": 460, "train_runtime": 5199.7389, "train_tokens_per_second": 10352.249 }, { "epoch": 0.5927354548376728, "grad_norm": 1.9723373651504517, "learning_rate": 8.227684346701165e-06, "loss": 1.1172, "num_input_tokens_seen": 54010208, "step": 461, "train_runtime": 5217.2951, "train_tokens_per_second": 10352.147 }, { "epoch": 0.5940212150433944, "grad_norm": 1.9189200401306152, "learning_rate": 8.201811125485124e-06, "loss": 1.0317, "num_input_tokens_seen": 54134656, "step": 462, "train_runtime": 5228.207, "train_tokens_per_second": 10354.344 }, { "epoch": 0.595306975249116, "grad_norm": 1.6208829879760742, "learning_rate": 8.175937904269083e-06, "loss": 0.9256, "num_input_tokens_seen": 54268224, "step": 463, "train_runtime": 5240.6612, "train_tokens_per_second": 10355.225 }, { "epoch": 0.5965927354548377, "grad_norm": 1.9756633043289185, "learning_rate": 8.15006468305304e-06, "loss": 1.0466, "num_input_tokens_seen": 54384544, "step": 464, "train_runtime": 5251.3101, "train_tokens_per_second": 10356.376 }, { "epoch": 0.5978784956605593, "grad_norm": 1.8915356397628784, "learning_rate": 8.124191461837e-06, "loss": 1.0826, "num_input_tokens_seen": 54546208, "step": 465, "train_runtime": 5266.7741, "train_tokens_per_second": 10356.664 }, { "epoch": 0.599164255866281, "grad_norm": 1.9341920614242554, "learning_rate": 8.098318240620958e-06, "loss": 1.0257, "num_input_tokens_seen": 54644864, "step": 466, "train_runtime": 5275.3751, "train_tokens_per_second": 10358.479 }, { "epoch": 0.6004500160720025, "grad_norm": 1.772900104522705, "learning_rate": 8.072445019404917e-06, "loss": 1.0155, "num_input_tokens_seen": 54775808, "step": 467, "train_runtime": 5287.3482, "train_tokens_per_second": 10359.788 }, { "epoch": 0.6017357762777242, "grad_norm": 1.8051958084106445, "learning_rate": 8.046571798188875e-06, "loss": 1.0296, "num_input_tokens_seen": 54865024, "step": 468, "train_runtime": 5294.9344, "train_tokens_per_second": 10361.795 }, { "epoch": 0.6017357762777242, "eval_loss": 1.104156732559204, "eval_runtime": 22.4988, "eval_samples_per_second": 44.18, "eval_steps_per_second": 1.422, "num_input_tokens_seen": 54865024, "step": 468 }, { "epoch": 0.6030215364834458, "grad_norm": 1.9409384727478027, "learning_rate": 8.020698576972833e-06, "loss": 1.0859, "num_input_tokens_seen": 55004192, "step": 469, "train_runtime": 5330.358, "train_tokens_per_second": 10319.043 }, { "epoch": 0.6043072966891675, "grad_norm": 1.7463427782058716, "learning_rate": 7.994825355756792e-06, "loss": 1.0851, "num_input_tokens_seen": 55115104, "step": 470, "train_runtime": 5340.0483, "train_tokens_per_second": 10321.087 }, { "epoch": 0.6055930568948891, "grad_norm": 1.958573579788208, "learning_rate": 7.96895213454075e-06, "loss": 1.0175, "num_input_tokens_seen": 55232576, "step": 471, "train_runtime": 5350.618, "train_tokens_per_second": 10322.654 }, { "epoch": 0.6068788171006108, "grad_norm": 1.8370342254638672, "learning_rate": 7.94307891332471e-06, "loss": 1.0919, "num_input_tokens_seen": 55327584, "step": 472, "train_runtime": 5358.7331, "train_tokens_per_second": 10324.751 }, { "epoch": 0.6081645773063323, "grad_norm": 1.8849748373031616, "learning_rate": 7.917205692108668e-06, "loss": 1.061, "num_input_tokens_seen": 55460224, "step": 473, "train_runtime": 5371.0369, "train_tokens_per_second": 10325.795 }, { "epoch": 0.609450337512054, "grad_norm": 1.8478233814239502, "learning_rate": 7.891332470892627e-06, "loss": 1.0702, "num_input_tokens_seen": 55603200, "step": 474, "train_runtime": 5384.0612, "train_tokens_per_second": 10327.371 }, { "epoch": 0.6107360977177756, "grad_norm": 1.7144081592559814, "learning_rate": 7.865459249676586e-06, "loss": 1.0623, "num_input_tokens_seen": 55715008, "step": 475, "train_runtime": 5393.8386, "train_tokens_per_second": 10329.38 }, { "epoch": 0.6120218579234973, "grad_norm": 1.895750641822815, "learning_rate": 7.839586028460545e-06, "loss": 1.0541, "num_input_tokens_seen": 55814400, "step": 476, "train_runtime": 5402.4312, "train_tokens_per_second": 10331.349 }, { "epoch": 0.6133076181292189, "grad_norm": 1.997480034828186, "learning_rate": 7.813712807244502e-06, "loss": 1.1358, "num_input_tokens_seen": 55905248, "step": 477, "train_runtime": 5410.2074, "train_tokens_per_second": 10333.291 }, { "epoch": 0.6145933783349405, "grad_norm": 1.9574437141418457, "learning_rate": 7.787839586028462e-06, "loss": 1.0872, "num_input_tokens_seen": 55996224, "step": 478, "train_runtime": 5418.1887, "train_tokens_per_second": 10334.86 }, { "epoch": 0.6158791385406621, "grad_norm": 1.738667607307434, "learning_rate": 7.76196636481242e-06, "loss": 1.0266, "num_input_tokens_seen": 56089024, "step": 479, "train_runtime": 5426.2457, "train_tokens_per_second": 10336.617 }, { "epoch": 0.6171648987463838, "grad_norm": 1.8634562492370605, "learning_rate": 7.736093143596379e-06, "loss": 1.1175, "num_input_tokens_seen": 56203232, "step": 480, "train_runtime": 5436.2029, "train_tokens_per_second": 10338.693 }, { "epoch": 0.6184506589521054, "grad_norm": 1.8316950798034668, "learning_rate": 7.710219922380336e-06, "loss": 0.9945, "num_input_tokens_seen": 56293504, "step": 481, "train_runtime": 5460.5999, "train_tokens_per_second": 10309.033 }, { "epoch": 0.6197364191578271, "grad_norm": 1.9369782209396362, "learning_rate": 7.684346701164297e-06, "loss": 1.082, "num_input_tokens_seen": 56402752, "step": 482, "train_runtime": 5470.187, "train_tokens_per_second": 10310.937 }, { "epoch": 0.6210221793635486, "grad_norm": 1.7741248607635498, "learning_rate": 7.658473479948254e-06, "loss": 1.0357, "num_input_tokens_seen": 56505376, "step": 483, "train_runtime": 5479.036, "train_tokens_per_second": 10313.014 }, { "epoch": 0.6223079395692703, "grad_norm": 1.9275310039520264, "learning_rate": 7.632600258732213e-06, "loss": 1.0627, "num_input_tokens_seen": 56607264, "step": 484, "train_runtime": 5487.9536, "train_tokens_per_second": 10314.822 }, { "epoch": 0.623593699774992, "grad_norm": 1.8197015523910522, "learning_rate": 7.606727037516172e-06, "loss": 0.966, "num_input_tokens_seen": 56736576, "step": 485, "train_runtime": 5500.0845, "train_tokens_per_second": 10315.583 }, { "epoch": 0.6248794599807136, "grad_norm": 1.7420237064361572, "learning_rate": 7.58085381630013e-06, "loss": 1.0898, "num_input_tokens_seen": 56832608, "step": 486, "train_runtime": 5508.3187, "train_tokens_per_second": 10317.596 }, { "epoch": 0.6261652201864353, "grad_norm": 1.7904372215270996, "learning_rate": 7.554980595084088e-06, "loss": 0.9849, "num_input_tokens_seen": 56918528, "step": 487, "train_runtime": 5515.7042, "train_tokens_per_second": 10319.358 }, { "epoch": 0.6274509803921569, "grad_norm": 1.901534914970398, "learning_rate": 7.529107373868048e-06, "loss": 1.0978, "num_input_tokens_seen": 57060512, "step": 488, "train_runtime": 5528.8699, "train_tokens_per_second": 10320.466 }, { "epoch": 0.6287367405978785, "grad_norm": 1.8489160537719727, "learning_rate": 7.503234152652006e-06, "loss": 1.0536, "num_input_tokens_seen": 57153408, "step": 489, "train_runtime": 5536.9185, "train_tokens_per_second": 10322.241 }, { "epoch": 0.6300225008036001, "grad_norm": 1.8837651014328003, "learning_rate": 7.477360931435964e-06, "loss": 1.0979, "num_input_tokens_seen": 57244704, "step": 490, "train_runtime": 5544.8307, "train_tokens_per_second": 10323.977 }, { "epoch": 0.6313082610093218, "grad_norm": 1.9377018213272095, "learning_rate": 7.451487710219923e-06, "loss": 0.9867, "num_input_tokens_seen": 57382048, "step": 491, "train_runtime": 5557.3194, "train_tokens_per_second": 10325.49 }, { "epoch": 0.6325940212150434, "grad_norm": 1.971827507019043, "learning_rate": 7.425614489003882e-06, "loss": 1.1096, "num_input_tokens_seen": 57526912, "step": 492, "train_runtime": 5570.7926, "train_tokens_per_second": 10326.522 }, { "epoch": 0.6338797814207651, "grad_norm": 1.8177952766418457, "learning_rate": 7.39974126778784e-06, "loss": 1.0804, "num_input_tokens_seen": 57651648, "step": 493, "train_runtime": 5582.2541, "train_tokens_per_second": 10327.665 }, { "epoch": 0.6351655416264866, "grad_norm": 1.9560736417770386, "learning_rate": 7.373868046571799e-06, "loss": 1.0818, "num_input_tokens_seen": 57742848, "step": 494, "train_runtime": 5590.0563, "train_tokens_per_second": 10329.565 }, { "epoch": 0.6364513018322083, "grad_norm": 2.095134735107422, "learning_rate": 7.347994825355757e-06, "loss": 1.051, "num_input_tokens_seen": 57848384, "step": 495, "train_runtime": 5599.5099, "train_tokens_per_second": 10330.973 }, { "epoch": 0.6377370620379299, "grad_norm": 2.0076119899749756, "learning_rate": 7.322121604139716e-06, "loss": 1.1306, "num_input_tokens_seen": 57996032, "step": 496, "train_runtime": 5613.6125, "train_tokens_per_second": 10331.321 }, { "epoch": 0.6390228222436516, "grad_norm": 1.7557566165924072, "learning_rate": 7.296248382923674e-06, "loss": 0.9975, "num_input_tokens_seen": 58088800, "step": 497, "train_runtime": 5621.5772, "train_tokens_per_second": 10333.185 }, { "epoch": 0.6403085824493732, "grad_norm": 1.983188271522522, "learning_rate": 7.270375161707633e-06, "loss": 0.9731, "num_input_tokens_seen": 58211040, "step": 498, "train_runtime": 5632.8912, "train_tokens_per_second": 10334.132 }, { "epoch": 0.6415943426550949, "grad_norm": 1.955208659172058, "learning_rate": 7.244501940491591e-06, "loss": 1.0637, "num_input_tokens_seen": 58334432, "step": 499, "train_runtime": 5644.1895, "train_tokens_per_second": 10335.307 }, { "epoch": 0.6428801028608164, "grad_norm": 1.839125156402588, "learning_rate": 7.21862871927555e-06, "loss": 1.0653, "num_input_tokens_seen": 58444576, "step": 500, "train_runtime": 5653.6395, "train_tokens_per_second": 10337.514 }, { "epoch": 0.6441658630665381, "grad_norm": 1.8079696893692017, "learning_rate": 7.192755498059509e-06, "loss": 1.0928, "num_input_tokens_seen": 58603360, "step": 501, "train_runtime": 5668.8043, "train_tokens_per_second": 10337.87 }, { "epoch": 0.6454516232722597, "grad_norm": 1.7496858835220337, "learning_rate": 7.166882276843467e-06, "loss": 0.9713, "num_input_tokens_seen": 58771264, "step": 502, "train_runtime": 5684.7051, "train_tokens_per_second": 10338.49 }, { "epoch": 0.6467373834779814, "grad_norm": 2.015773057937622, "learning_rate": 7.1410090556274255e-06, "loss": 1.0992, "num_input_tokens_seen": 58931392, "step": 503, "train_runtime": 5699.5505, "train_tokens_per_second": 10339.656 }, { "epoch": 0.648023143683703, "grad_norm": 1.7812045812606812, "learning_rate": 7.115135834411385e-06, "loss": 1.0177, "num_input_tokens_seen": 59031904, "step": 504, "train_runtime": 5708.5567, "train_tokens_per_second": 10340.951 }, { "epoch": 0.6493089038894246, "grad_norm": 2.226012945175171, "learning_rate": 7.089262613195343e-06, "loss": 1.0775, "num_input_tokens_seen": 59170880, "step": 505, "train_runtime": 5721.3851, "train_tokens_per_second": 10342.055 }, { "epoch": 0.6505946640951462, "grad_norm": 1.7196251153945923, "learning_rate": 7.0633893919793015e-06, "loss": 1.0867, "num_input_tokens_seen": 59305920, "step": 506, "train_runtime": 5733.791, "train_tokens_per_second": 10343.23 }, { "epoch": 0.6518804243008679, "grad_norm": 2.0985634326934814, "learning_rate": 7.037516170763261e-06, "loss": 1.0544, "num_input_tokens_seen": 59429280, "step": 507, "train_runtime": 5744.9517, "train_tokens_per_second": 10344.609 }, { "epoch": 0.6531661845065895, "grad_norm": 1.983805775642395, "learning_rate": 7.0116429495472195e-06, "loss": 0.9989, "num_input_tokens_seen": 59511424, "step": 508, "train_runtime": 5751.8269, "train_tokens_per_second": 10346.525 }, { "epoch": 0.6544519447123112, "grad_norm": 1.8357391357421875, "learning_rate": 6.985769728331178e-06, "loss": 1.0282, "num_input_tokens_seen": 59629280, "step": 509, "train_runtime": 5762.4785, "train_tokens_per_second": 10347.853 }, { "epoch": 0.6557377049180327, "grad_norm": 1.8154447078704834, "learning_rate": 6.959896507115136e-06, "loss": 1.0676, "num_input_tokens_seen": 59728704, "step": 510, "train_runtime": 5771.0809, "train_tokens_per_second": 10349.656 }, { "epoch": 0.6570234651237544, "grad_norm": 1.966147541999817, "learning_rate": 6.9340232858990955e-06, "loss": 1.1222, "num_input_tokens_seen": 59858304, "step": 511, "train_runtime": 5799.4165, "train_tokens_per_second": 10321.436 }, { "epoch": 0.658309225329476, "grad_norm": 1.942854404449463, "learning_rate": 6.908150064683054e-06, "loss": 1.1369, "num_input_tokens_seen": 59962496, "step": 512, "train_runtime": 5808.3201, "train_tokens_per_second": 10323.552 }, { "epoch": 0.6595949855351977, "grad_norm": 2.0717549324035645, "learning_rate": 6.882276843467012e-06, "loss": 1.0623, "num_input_tokens_seen": 60104320, "step": 513, "train_runtime": 5821.4241, "train_tokens_per_second": 10324.676 }, { "epoch": 0.6608807457409194, "grad_norm": 2.0552477836608887, "learning_rate": 6.856403622250971e-06, "loss": 1.079, "num_input_tokens_seen": 60239488, "step": 514, "train_runtime": 5833.6761, "train_tokens_per_second": 10326.163 }, { "epoch": 0.662166505946641, "grad_norm": 1.8785006999969482, "learning_rate": 6.83053040103493e-06, "loss": 1.0287, "num_input_tokens_seen": 60372960, "step": 515, "train_runtime": 5846.0146, "train_tokens_per_second": 10327.2 }, { "epoch": 0.6634522661523626, "grad_norm": 2.1240034103393555, "learning_rate": 6.804657179818888e-06, "loss": 1.093, "num_input_tokens_seen": 60524480, "step": 516, "train_runtime": 5860.475, "train_tokens_per_second": 10327.572 }, { "epoch": 0.6647380263580842, "grad_norm": 1.815077304840088, "learning_rate": 6.778783958602847e-06, "loss": 1.0346, "num_input_tokens_seen": 60655744, "step": 517, "train_runtime": 5872.4212, "train_tokens_per_second": 10328.916 }, { "epoch": 0.6660237865638059, "grad_norm": 1.8126624822616577, "learning_rate": 6.752910737386805e-06, "loss": 1.0734, "num_input_tokens_seen": 60770176, "step": 518, "train_runtime": 5882.5093, "train_tokens_per_second": 10330.655 }, { "epoch": 0.6673095467695275, "grad_norm": 1.7896870374679565, "learning_rate": 6.727037516170764e-06, "loss": 1.0592, "num_input_tokens_seen": 60889088, "step": 519, "train_runtime": 5892.9745, "train_tokens_per_second": 10332.488 }, { "epoch": 0.6685953069752492, "grad_norm": 1.8001877069473267, "learning_rate": 6.701164294954723e-06, "loss": 0.9968, "num_input_tokens_seen": 61065792, "step": 520, "train_runtime": 5909.8573, "train_tokens_per_second": 10332.871 }, { "epoch": 0.6698810671809707, "grad_norm": 1.8801597356796265, "learning_rate": 6.675291073738681e-06, "loss": 1.0645, "num_input_tokens_seen": 61235808, "step": 521, "train_runtime": 5926.3712, "train_tokens_per_second": 10332.766 }, { "epoch": 0.6711668273866924, "grad_norm": 1.8804895877838135, "learning_rate": 6.649417852522639e-06, "loss": 1.0528, "num_input_tokens_seen": 61393632, "step": 522, "train_runtime": 5940.9242, "train_tokens_per_second": 10334.02 }, { "epoch": 0.672452587592414, "grad_norm": 1.9801836013793945, "learning_rate": 6.623544631306599e-06, "loss": 1.1185, "num_input_tokens_seen": 61529632, "step": 523, "train_runtime": 5953.2464, "train_tokens_per_second": 10335.475 }, { "epoch": 0.6737383477981357, "grad_norm": 1.8925362825393677, "learning_rate": 6.597671410090557e-06, "loss": 1.1512, "num_input_tokens_seen": 61631840, "step": 524, "train_runtime": 5962.0027, "train_tokens_per_second": 10337.439 }, { "epoch": 0.6750241080038573, "grad_norm": 1.7096664905548096, "learning_rate": 6.571798188874515e-06, "loss": 1.0007, "num_input_tokens_seen": 61719392, "step": 525, "train_runtime": 5969.4912, "train_tokens_per_second": 10339.138 }, { "epoch": 0.676309868209579, "grad_norm": 1.7562854290008545, "learning_rate": 6.545924967658473e-06, "loss": 0.9808, "num_input_tokens_seen": 61904448, "step": 526, "train_runtime": 5987.4689, "train_tokens_per_second": 10339.001 }, { "epoch": 0.6775956284153005, "grad_norm": 1.9827765226364136, "learning_rate": 6.520051746442433e-06, "loss": 1.0306, "num_input_tokens_seen": 62045888, "step": 527, "train_runtime": 6000.3698, "train_tokens_per_second": 10340.344 }, { "epoch": 0.6788813886210222, "grad_norm": 1.9799909591674805, "learning_rate": 6.494178525226391e-06, "loss": 0.9475, "num_input_tokens_seen": 62144736, "step": 528, "train_runtime": 6008.9407, "train_tokens_per_second": 10342.045 }, { "epoch": 0.6801671488267438, "grad_norm": 1.928503155708313, "learning_rate": 6.468305304010349e-06, "loss": 0.973, "num_input_tokens_seen": 62266400, "step": 529, "train_runtime": 6019.7454, "train_tokens_per_second": 10343.693 }, { "epoch": 0.6814529090324655, "grad_norm": 1.9949895143508911, "learning_rate": 6.442432082794309e-06, "loss": 1.1023, "num_input_tokens_seen": 62377888, "step": 530, "train_runtime": 6029.3488, "train_tokens_per_second": 10345.709 }, { "epoch": 0.682738669238187, "grad_norm": 1.8765671253204346, "learning_rate": 6.416558861578267e-06, "loss": 1.0263, "num_input_tokens_seen": 62462016, "step": 531, "train_runtime": 6036.392, "train_tokens_per_second": 10347.574 }, { "epoch": 0.6840244294439087, "grad_norm": 1.9741531610488892, "learning_rate": 6.390685640362225e-06, "loss": 1.2246, "num_input_tokens_seen": 62610176, "step": 532, "train_runtime": 6050.1111, "train_tokens_per_second": 10348.599 }, { "epoch": 0.6853101896496303, "grad_norm": 1.8716306686401367, "learning_rate": 6.364812419146185e-06, "loss": 1.0364, "num_input_tokens_seen": 62709280, "step": 533, "train_runtime": 6058.5723, "train_tokens_per_second": 10350.505 }, { "epoch": 0.686595949855352, "grad_norm": 1.8738210201263428, "learning_rate": 6.338939197930143e-06, "loss": 1.0923, "num_input_tokens_seen": 62874912, "step": 534, "train_runtime": 6074.0138, "train_tokens_per_second": 10351.46 }, { "epoch": 0.6878817100610736, "grad_norm": 1.8222072124481201, "learning_rate": 6.313065976714101e-06, "loss": 1.0699, "num_input_tokens_seen": 62994208, "step": 535, "train_runtime": 6084.6192, "train_tokens_per_second": 10353.024 }, { "epoch": 0.6891674702667953, "grad_norm": 1.8478925228118896, "learning_rate": 6.28719275549806e-06, "loss": 1.1806, "num_input_tokens_seen": 63145056, "step": 536, "train_runtime": 6098.4851, "train_tokens_per_second": 10354.22 }, { "epoch": 0.6904532304725168, "grad_norm": 2.016186475753784, "learning_rate": 6.261319534282018e-06, "loss": 1.0304, "num_input_tokens_seen": 63269120, "step": 537, "train_runtime": 6110.0516, "train_tokens_per_second": 10354.924 }, { "epoch": 0.6917389906782385, "grad_norm": 1.8224762678146362, "learning_rate": 6.235446313065977e-06, "loss": 1.0067, "num_input_tokens_seen": 63415744, "step": 538, "train_runtime": 6123.7782, "train_tokens_per_second": 10355.657 }, { "epoch": 0.6930247508839601, "grad_norm": 1.7332342863082886, "learning_rate": 6.2095730918499354e-06, "loss": 1.0274, "num_input_tokens_seen": 63508160, "step": 539, "train_runtime": 6131.7391, "train_tokens_per_second": 10357.283 }, { "epoch": 0.6943105110896818, "grad_norm": 1.7827410697937012, "learning_rate": 6.183699870633894e-06, "loss": 1.0193, "num_input_tokens_seen": 63661440, "step": 540, "train_runtime": 6146.5269, "train_tokens_per_second": 10357.303 }, { "epoch": 0.6955962712954034, "grad_norm": 2.020627498626709, "learning_rate": 6.1578266494178525e-06, "loss": 1.0964, "num_input_tokens_seen": 63780032, "step": 541, "train_runtime": 6173.4887, "train_tokens_per_second": 10331.279 }, { "epoch": 0.696882031501125, "grad_norm": 1.7501956224441528, "learning_rate": 6.1319534282018115e-06, "loss": 1.0793, "num_input_tokens_seen": 63918880, "step": 542, "train_runtime": 6185.9809, "train_tokens_per_second": 10332.861 }, { "epoch": 0.6981677917068466, "grad_norm": 1.8000164031982422, "learning_rate": 6.1060802069857704e-06, "loss": 0.9915, "num_input_tokens_seen": 64021696, "step": 543, "train_runtime": 6194.7919, "train_tokens_per_second": 10334.761 }, { "epoch": 0.6994535519125683, "grad_norm": 1.771580696105957, "learning_rate": 6.0802069857697286e-06, "loss": 1.0623, "num_input_tokens_seen": 64140384, "step": 544, "train_runtime": 6205.2559, "train_tokens_per_second": 10336.461 }, { "epoch": 0.70073931211829, "grad_norm": 1.9515384435653687, "learning_rate": 6.054333764553687e-06, "loss": 1.1481, "num_input_tokens_seen": 64242624, "step": 545, "train_runtime": 6214.1214, "train_tokens_per_second": 10338.167 }, { "epoch": 0.7020250723240116, "grad_norm": 1.8691986799240112, "learning_rate": 6.0284605433376465e-06, "loss": 1.0209, "num_input_tokens_seen": 64314496, "step": 546, "train_runtime": 6220.1913, "train_tokens_per_second": 10339.633 }, { "epoch": 0.7020250723240116, "eval_loss": 1.102497935295105, "eval_runtime": 22.3274, "eval_samples_per_second": 44.519, "eval_steps_per_second": 1.433, "num_input_tokens_seen": 64314496, "step": 546 }, { "epoch": 0.7033108325297333, "grad_norm": 1.691506266593933, "learning_rate": 6.002587322121605e-06, "loss": 0.9789, "num_input_tokens_seen": 64429248, "step": 547, "train_runtime": 6252.5897, "train_tokens_per_second": 10304.41 }, { "epoch": 0.7045965927354548, "grad_norm": 1.7860418558120728, "learning_rate": 5.976714100905563e-06, "loss": 1.0317, "num_input_tokens_seen": 64559776, "step": 548, "train_runtime": 6264.281, "train_tokens_per_second": 10306.015 }, { "epoch": 0.7058823529411765, "grad_norm": 2.1169979572296143, "learning_rate": 5.9508408796895225e-06, "loss": 1.0426, "num_input_tokens_seen": 64683264, "step": 549, "train_runtime": 6275.2924, "train_tokens_per_second": 10307.61 }, { "epoch": 0.7071681131468981, "grad_norm": 1.937103271484375, "learning_rate": 5.924967658473481e-06, "loss": 1.0845, "num_input_tokens_seen": 64821728, "step": 550, "train_runtime": 6288.0189, "train_tokens_per_second": 10308.768 }, { "epoch": 0.7084538733526198, "grad_norm": 1.8114924430847168, "learning_rate": 5.899094437257439e-06, "loss": 1.0205, "num_input_tokens_seen": 64920384, "step": 551, "train_runtime": 6296.4281, "train_tokens_per_second": 10310.669 }, { "epoch": 0.7097396335583414, "grad_norm": 1.9015802145004272, "learning_rate": 5.8732212160413986e-06, "loss": 1.0589, "num_input_tokens_seen": 65041088, "step": 552, "train_runtime": 6307.1492, "train_tokens_per_second": 10312.28 }, { "epoch": 0.711025393764063, "grad_norm": 1.871267318725586, "learning_rate": 5.847347994825357e-06, "loss": 1.0599, "num_input_tokens_seen": 65166368, "step": 553, "train_runtime": 6318.2983, "train_tokens_per_second": 10313.911 }, { "epoch": 0.7123111539697846, "grad_norm": 1.7762296199798584, "learning_rate": 5.821474773609315e-06, "loss": 1.1277, "num_input_tokens_seen": 65256192, "step": 554, "train_runtime": 6326.0044, "train_tokens_per_second": 10315.546 }, { "epoch": 0.7135969141755063, "grad_norm": 2.015854835510254, "learning_rate": 5.795601552393273e-06, "loss": 1.048, "num_input_tokens_seen": 65379488, "step": 555, "train_runtime": 6337.3792, "train_tokens_per_second": 10316.487 }, { "epoch": 0.7148826743812279, "grad_norm": 1.9349653720855713, "learning_rate": 5.769728331177233e-06, "loss": 1.0893, "num_input_tokens_seen": 65530368, "step": 556, "train_runtime": 6351.5436, "train_tokens_per_second": 10317.235 }, { "epoch": 0.7161684345869496, "grad_norm": 1.8240134716033936, "learning_rate": 5.743855109961191e-06, "loss": 1.0671, "num_input_tokens_seen": 65613952, "step": 557, "train_runtime": 6358.6261, "train_tokens_per_second": 10318.888 }, { "epoch": 0.7174541947926711, "grad_norm": 1.8752096891403198, "learning_rate": 5.717981888745149e-06, "loss": 1.0451, "num_input_tokens_seen": 65725792, "step": 558, "train_runtime": 6368.3372, "train_tokens_per_second": 10320.715 }, { "epoch": 0.7187399549983928, "grad_norm": 1.9915884733200073, "learning_rate": 5.692108667529108e-06, "loss": 1.0574, "num_input_tokens_seen": 65807680, "step": 559, "train_runtime": 6375.3518, "train_tokens_per_second": 10322.204 }, { "epoch": 0.7200257152041144, "grad_norm": 1.7847318649291992, "learning_rate": 5.666235446313066e-06, "loss": 1.061, "num_input_tokens_seen": 65905312, "step": 560, "train_runtime": 6383.8117, "train_tokens_per_second": 10323.818 }, { "epoch": 0.7213114754098361, "grad_norm": 1.7851864099502563, "learning_rate": 5.640362225097025e-06, "loss": 0.9781, "num_input_tokens_seen": 66025056, "step": 561, "train_runtime": 6394.6288, "train_tokens_per_second": 10325.08 }, { "epoch": 0.7225972356155577, "grad_norm": 2.038956642150879, "learning_rate": 5.614489003880984e-06, "loss": 1.1079, "num_input_tokens_seen": 66161536, "step": 562, "train_runtime": 6406.936, "train_tokens_per_second": 10326.549 }, { "epoch": 0.7238829958212794, "grad_norm": 1.8547343015670776, "learning_rate": 5.588615782664942e-06, "loss": 0.9582, "num_input_tokens_seen": 66301920, "step": 563, "train_runtime": 6419.8653, "train_tokens_per_second": 10327.619 }, { "epoch": 0.7251687560270009, "grad_norm": 1.8734216690063477, "learning_rate": 5.5627425614489e-06, "loss": 1.1257, "num_input_tokens_seen": 66416448, "step": 564, "train_runtime": 6430.0471, "train_tokens_per_second": 10329.076 }, { "epoch": 0.7264545162327226, "grad_norm": 1.9347343444824219, "learning_rate": 5.53686934023286e-06, "loss": 1.0665, "num_input_tokens_seen": 66504544, "step": 565, "train_runtime": 6437.5545, "train_tokens_per_second": 10330.715 }, { "epoch": 0.7277402764384442, "grad_norm": 1.8810735940933228, "learning_rate": 5.510996119016818e-06, "loss": 1.0375, "num_input_tokens_seen": 66656448, "step": 566, "train_runtime": 6451.7561, "train_tokens_per_second": 10331.52 }, { "epoch": 0.7290260366441659, "grad_norm": 1.837829351425171, "learning_rate": 5.485122897800776e-06, "loss": 1.0713, "num_input_tokens_seen": 66759904, "step": 567, "train_runtime": 6460.6494, "train_tokens_per_second": 10333.312 }, { "epoch": 0.7303117968498875, "grad_norm": 1.9980813264846802, "learning_rate": 5.459249676584734e-06, "loss": 0.9986, "num_input_tokens_seen": 66894848, "step": 568, "train_runtime": 6473.0889, "train_tokens_per_second": 10334.301 }, { "epoch": 0.7315975570556091, "grad_norm": 1.976579189300537, "learning_rate": 5.433376455368694e-06, "loss": 1.1012, "num_input_tokens_seen": 66996128, "step": 569, "train_runtime": 6481.9025, "train_tokens_per_second": 10335.874 }, { "epoch": 0.7328833172613307, "grad_norm": 1.903847336769104, "learning_rate": 5.407503234152652e-06, "loss": 1.0675, "num_input_tokens_seen": 67141920, "step": 570, "train_runtime": 6495.5236, "train_tokens_per_second": 10336.645 }, { "epoch": 0.7341690774670524, "grad_norm": 1.9221888780593872, "learning_rate": 5.38163001293661e-06, "loss": 1.0781, "num_input_tokens_seen": 67290336, "step": 571, "train_runtime": 6525.8926, "train_tokens_per_second": 10311.285 }, { "epoch": 0.735454837672774, "grad_norm": 1.808961033821106, "learning_rate": 5.35575679172057e-06, "loss": 1.1462, "num_input_tokens_seen": 67395424, "step": 572, "train_runtime": 6534.8507, "train_tokens_per_second": 10313.231 }, { "epoch": 0.7367405978784957, "grad_norm": 1.8847907781600952, "learning_rate": 5.329883570504528e-06, "loss": 1.0736, "num_input_tokens_seen": 67521888, "step": 573, "train_runtime": 6545.9199, "train_tokens_per_second": 10315.111 }, { "epoch": 0.7380263580842173, "grad_norm": 1.8549025058746338, "learning_rate": 5.304010349288486e-06, "loss": 1.0503, "num_input_tokens_seen": 67665568, "step": 574, "train_runtime": 6559.1726, "train_tokens_per_second": 10316.174 }, { "epoch": 0.7393121182899389, "grad_norm": 1.9307861328125, "learning_rate": 5.278137128072446e-06, "loss": 1.1438, "num_input_tokens_seen": 67774688, "step": 575, "train_runtime": 6568.6043, "train_tokens_per_second": 10317.974 }, { "epoch": 0.7405978784956606, "grad_norm": 1.9152367115020752, "learning_rate": 5.252263906856404e-06, "loss": 1.0097, "num_input_tokens_seen": 67861824, "step": 576, "train_runtime": 6575.9557, "train_tokens_per_second": 10319.69 }, { "epoch": 0.7418836387013822, "grad_norm": 1.8602268695831299, "learning_rate": 5.2263906856403625e-06, "loss": 1.0663, "num_input_tokens_seen": 67982592, "step": 577, "train_runtime": 6586.8236, "train_tokens_per_second": 10320.998 }, { "epoch": 0.7431693989071039, "grad_norm": 1.928527593612671, "learning_rate": 5.200517464424321e-06, "loss": 1.1119, "num_input_tokens_seen": 68088704, "step": 578, "train_runtime": 6595.9873, "train_tokens_per_second": 10322.746 }, { "epoch": 0.7444551591128254, "grad_norm": 2.0047895908355713, "learning_rate": 5.17464424320828e-06, "loss": 1.0698, "num_input_tokens_seen": 68230048, "step": 579, "train_runtime": 6608.8637, "train_tokens_per_second": 10324.021 }, { "epoch": 0.7457409193185471, "grad_norm": 1.8268404006958008, "learning_rate": 5.1487710219922385e-06, "loss": 1.0993, "num_input_tokens_seen": 68349472, "step": 580, "train_runtime": 6619.3705, "train_tokens_per_second": 10325.676 }, { "epoch": 0.7470266795242687, "grad_norm": 2.0684757232666016, "learning_rate": 5.1228978007761975e-06, "loss": 1.0588, "num_input_tokens_seen": 68470720, "step": 581, "train_runtime": 6630.3909, "train_tokens_per_second": 10326.8 }, { "epoch": 0.7483124397299904, "grad_norm": 1.9927403926849365, "learning_rate": 5.0970245795601556e-06, "loss": 1.0661, "num_input_tokens_seen": 68583616, "step": 582, "train_runtime": 6640.5867, "train_tokens_per_second": 10327.945 }, { "epoch": 0.749598199935712, "grad_norm": 1.9514095783233643, "learning_rate": 5.071151358344114e-06, "loss": 1.0833, "num_input_tokens_seen": 68700480, "step": 583, "train_runtime": 6650.9406, "train_tokens_per_second": 10329.438 }, { "epoch": 0.7508839601414337, "grad_norm": 2.018437623977661, "learning_rate": 5.045278137128073e-06, "loss": 1.0668, "num_input_tokens_seen": 68822336, "step": 584, "train_runtime": 6661.8349, "train_tokens_per_second": 10330.838 }, { "epoch": 0.7521697203471552, "grad_norm": 1.8875172138214111, "learning_rate": 5.019404915912032e-06, "loss": 1.0462, "num_input_tokens_seen": 68951936, "step": 585, "train_runtime": 6673.1759, "train_tokens_per_second": 10332.702 }, { "epoch": 0.7534554805528769, "grad_norm": 1.818596363067627, "learning_rate": 4.99353169469599e-06, "loss": 1.04, "num_input_tokens_seen": 69135360, "step": 586, "train_runtime": 6690.4234, "train_tokens_per_second": 10333.48 }, { "epoch": 0.7547412407585985, "grad_norm": 1.750368595123291, "learning_rate": 4.967658473479949e-06, "loss": 1.0268, "num_input_tokens_seen": 69267744, "step": 587, "train_runtime": 6702.7098, "train_tokens_per_second": 10334.29 }, { "epoch": 0.7560270009643202, "grad_norm": 1.8207074403762817, "learning_rate": 4.941785252263907e-06, "loss": 1.0989, "num_input_tokens_seen": 69370016, "step": 588, "train_runtime": 6711.6974, "train_tokens_per_second": 10335.689 }, { "epoch": 0.7573127611700418, "grad_norm": 1.9229310750961304, "learning_rate": 4.915912031047866e-06, "loss": 1.1032, "num_input_tokens_seen": 69495744, "step": 589, "train_runtime": 6722.8508, "train_tokens_per_second": 10337.243 }, { "epoch": 0.7585985213757634, "grad_norm": 1.8761484622955322, "learning_rate": 4.890038809831825e-06, "loss": 1.0723, "num_input_tokens_seen": 69637824, "step": 590, "train_runtime": 6735.7596, "train_tokens_per_second": 10338.526 }, { "epoch": 0.759884281581485, "grad_norm": 1.9209434986114502, "learning_rate": 4.864165588615783e-06, "loss": 1.0539, "num_input_tokens_seen": 69746688, "step": 591, "train_runtime": 6745.3898, "train_tokens_per_second": 10339.905 }, { "epoch": 0.7611700417872067, "grad_norm": 1.8482396602630615, "learning_rate": 4.838292367399742e-06, "loss": 1.1362, "num_input_tokens_seen": 69896288, "step": 592, "train_runtime": 6759.169, "train_tokens_per_second": 10340.959 }, { "epoch": 0.7624558019929283, "grad_norm": 1.7221297025680542, "learning_rate": 4.812419146183701e-06, "loss": 1.0768, "num_input_tokens_seen": 69981248, "step": 593, "train_runtime": 6766.3944, "train_tokens_per_second": 10342.473 }, { "epoch": 0.76374156219865, "grad_norm": 1.803056240081787, "learning_rate": 4.786545924967659e-06, "loss": 1.0445, "num_input_tokens_seen": 70077920, "step": 594, "train_runtime": 6774.6332, "train_tokens_per_second": 10344.165 }, { "epoch": 0.7650273224043715, "grad_norm": 2.036080837249756, "learning_rate": 4.760672703751618e-06, "loss": 1.0569, "num_input_tokens_seen": 70207136, "step": 595, "train_runtime": 6786.3397, "train_tokens_per_second": 10345.361 }, { "epoch": 0.7663130826100932, "grad_norm": 1.8578526973724365, "learning_rate": 4.734799482535576e-06, "loss": 1.0575, "num_input_tokens_seen": 70295488, "step": 596, "train_runtime": 6793.831, "train_tokens_per_second": 10346.959 }, { "epoch": 0.7675988428158148, "grad_norm": 1.8725582361221313, "learning_rate": 4.708926261319535e-06, "loss": 1.0409, "num_input_tokens_seen": 70387808, "step": 597, "train_runtime": 6801.6342, "train_tokens_per_second": 10348.661 }, { "epoch": 0.7688846030215365, "grad_norm": 1.8751484155654907, "learning_rate": 4.683053040103494e-06, "loss": 1.0569, "num_input_tokens_seen": 70502912, "step": 598, "train_runtime": 6811.7789, "train_tokens_per_second": 10350.147 }, { "epoch": 0.7701703632272581, "grad_norm": 1.832022786140442, "learning_rate": 4.657179818887452e-06, "loss": 1.0852, "num_input_tokens_seen": 70629696, "step": 599, "train_runtime": 6822.8214, "train_tokens_per_second": 10351.978 }, { "epoch": 0.7714561234329798, "grad_norm": 1.9740808010101318, "learning_rate": 4.631306597671411e-06, "loss": 1.0614, "num_input_tokens_seen": 70732640, "step": 600, "train_runtime": 6831.678, "train_tokens_per_second": 10353.626 }, { "epoch": 0.7727418836387013, "grad_norm": 1.9888503551483154, "learning_rate": 4.605433376455369e-06, "loss": 1.1406, "num_input_tokens_seen": 70851840, "step": 601, "train_runtime": 6859.0779, "train_tokens_per_second": 10329.645 }, { "epoch": 0.774027643844423, "grad_norm": 2.011823892593384, "learning_rate": 4.579560155239328e-06, "loss": 1.0582, "num_input_tokens_seen": 70977120, "step": 602, "train_runtime": 6870.6102, "train_tokens_per_second": 10330.541 }, { "epoch": 0.7753134040501446, "grad_norm": 1.8113346099853516, "learning_rate": 4.553686934023286e-06, "loss": 1.0753, "num_input_tokens_seen": 71089760, "step": 603, "train_runtime": 6880.2562, "train_tokens_per_second": 10332.429 }, { "epoch": 0.7765991642558663, "grad_norm": 1.8886075019836426, "learning_rate": 4.527813712807244e-06, "loss": 1.067, "num_input_tokens_seen": 71200000, "step": 604, "train_runtime": 6889.8418, "train_tokens_per_second": 10334.054 }, { "epoch": 0.777884924461588, "grad_norm": 1.803390622138977, "learning_rate": 4.501940491591203e-06, "loss": 1.0229, "num_input_tokens_seen": 71313984, "step": 605, "train_runtime": 6899.7826, "train_tokens_per_second": 10335.686 }, { "epoch": 0.7791706846673095, "grad_norm": 1.9048407077789307, "learning_rate": 4.476067270375162e-06, "loss": 1.1005, "num_input_tokens_seen": 71454176, "step": 606, "train_runtime": 6912.9278, "train_tokens_per_second": 10336.312 }, { "epoch": 0.7804564448730312, "grad_norm": 1.7786400318145752, "learning_rate": 4.45019404915912e-06, "loss": 1.0786, "num_input_tokens_seen": 71608032, "step": 607, "train_runtime": 6927.2874, "train_tokens_per_second": 10337.096 }, { "epoch": 0.7817422050787528, "grad_norm": 1.9795823097229004, "learning_rate": 4.424320827943079e-06, "loss": 1.1182, "num_input_tokens_seen": 71703232, "step": 608, "train_runtime": 6935.3945, "train_tokens_per_second": 10338.739 }, { "epoch": 0.7830279652844745, "grad_norm": 2.045689821243286, "learning_rate": 4.398447606727037e-06, "loss": 1.0731, "num_input_tokens_seen": 71800608, "step": 609, "train_runtime": 6943.76, "train_tokens_per_second": 10340.307 }, { "epoch": 0.7843137254901961, "grad_norm": 1.9164133071899414, "learning_rate": 4.372574385510996e-06, "loss": 1.0076, "num_input_tokens_seen": 71902688, "step": 610, "train_runtime": 6952.5948, "train_tokens_per_second": 10341.849 }, { "epoch": 0.7855994856959178, "grad_norm": 1.7875125408172607, "learning_rate": 4.346701164294955e-06, "loss": 1.0059, "num_input_tokens_seen": 71999488, "step": 611, "train_runtime": 6960.8799, "train_tokens_per_second": 10343.446 }, { "epoch": 0.7868852459016393, "grad_norm": 1.7959182262420654, "learning_rate": 4.3208279430789134e-06, "loss": 1.001, "num_input_tokens_seen": 72127648, "step": 612, "train_runtime": 6972.1724, "train_tokens_per_second": 10345.075 }, { "epoch": 0.788171006107361, "grad_norm": 1.9085074663162231, "learning_rate": 4.294954721862872e-06, "loss": 1.0613, "num_input_tokens_seen": 72236512, "step": 613, "train_runtime": 6981.6576, "train_tokens_per_second": 10346.613 }, { "epoch": 0.7894567663130826, "grad_norm": 1.923269271850586, "learning_rate": 4.269081500646831e-06, "loss": 1.0021, "num_input_tokens_seen": 72331104, "step": 614, "train_runtime": 6989.7253, "train_tokens_per_second": 10348.204 }, { "epoch": 0.7907425265188043, "grad_norm": 1.7725319862365723, "learning_rate": 4.2432082794307895e-06, "loss": 1.0252, "num_input_tokens_seen": 72470080, "step": 615, "train_runtime": 7002.3646, "train_tokens_per_second": 10349.373 }, { "epoch": 0.7920282867245259, "grad_norm": 1.854164958000183, "learning_rate": 4.2173350582147484e-06, "loss": 0.9617, "num_input_tokens_seen": 72587776, "step": 616, "train_runtime": 7012.7177, "train_tokens_per_second": 10350.877 }, { "epoch": 0.7933140469302475, "grad_norm": 1.8561328649520874, "learning_rate": 4.1914618369987065e-06, "loss": 1.0435, "num_input_tokens_seen": 72709504, "step": 617, "train_runtime": 7023.2797, "train_tokens_per_second": 10352.642 }, { "epoch": 0.7945998071359691, "grad_norm": 1.8203593492507935, "learning_rate": 4.1655886157826655e-06, "loss": 1.0132, "num_input_tokens_seen": 72799776, "step": 618, "train_runtime": 7030.8864, "train_tokens_per_second": 10354.281 }, { "epoch": 0.7958855673416908, "grad_norm": 1.8547409772872925, "learning_rate": 4.1397153945666245e-06, "loss": 0.9842, "num_input_tokens_seen": 72879840, "step": 619, "train_runtime": 7037.5273, "train_tokens_per_second": 10355.887 }, { "epoch": 0.7971713275474124, "grad_norm": 1.9788426160812378, "learning_rate": 4.113842173350583e-06, "loss": 1.0385, "num_input_tokens_seen": 72971616, "step": 620, "train_runtime": 7045.2634, "train_tokens_per_second": 10357.543 }, { "epoch": 0.7984570877531341, "grad_norm": 1.8518086671829224, "learning_rate": 4.0879689521345415e-06, "loss": 1.0729, "num_input_tokens_seen": 73071392, "step": 621, "train_runtime": 7053.7889, "train_tokens_per_second": 10359.169 }, { "epoch": 0.7997428479588556, "grad_norm": 1.7593944072723389, "learning_rate": 4.0620957309185e-06, "loss": 0.9755, "num_input_tokens_seen": 73155936, "step": 622, "train_runtime": 7060.9396, "train_tokens_per_second": 10360.652 }, { "epoch": 0.8010286081645773, "grad_norm": 1.8963724374771118, "learning_rate": 4.036222509702459e-06, "loss": 1.0652, "num_input_tokens_seen": 73269600, "step": 623, "train_runtime": 7071.1619, "train_tokens_per_second": 10361.748 }, { "epoch": 0.8023143683702989, "grad_norm": 1.8380028009414673, "learning_rate": 4.010349288486417e-06, "loss": 1.0608, "num_input_tokens_seen": 73394752, "step": 624, "train_runtime": 7082.1878, "train_tokens_per_second": 10363.288 }, { "epoch": 0.8023143683702989, "eval_loss": 1.1012874841690063, "eval_runtime": 22.0115, "eval_samples_per_second": 45.158, "eval_steps_per_second": 1.454, "num_input_tokens_seen": 73394752, "step": 624 }, { "epoch": 0.8036001285760206, "grad_norm": 1.9703397750854492, "learning_rate": 3.984476067270375e-06, "loss": 1.0863, "num_input_tokens_seen": 73490912, "step": 625, "train_runtime": 7112.3423, "train_tokens_per_second": 10332.87 }, { "epoch": 0.8048858887817422, "grad_norm": 1.7578519582748413, "learning_rate": 3.958602846054334e-06, "loss": 0.9404, "num_input_tokens_seen": 73610944, "step": 626, "train_runtime": 7122.7514, "train_tokens_per_second": 10334.622 }, { "epoch": 0.8061716489874639, "grad_norm": 1.903511881828308, "learning_rate": 3.932729624838293e-06, "loss": 1.0024, "num_input_tokens_seen": 73704576, "step": 627, "train_runtime": 7130.9357, "train_tokens_per_second": 10335.891 }, { "epoch": 0.8074574091931854, "grad_norm": 1.7375211715698242, "learning_rate": 3.906856403622251e-06, "loss": 1.026, "num_input_tokens_seen": 73846848, "step": 628, "train_runtime": 7143.4942, "train_tokens_per_second": 10337.637 }, { "epoch": 0.8087431693989071, "grad_norm": 1.864484429359436, "learning_rate": 3.88098318240621e-06, "loss": 1.065, "num_input_tokens_seen": 73957984, "step": 629, "train_runtime": 7153.3216, "train_tokens_per_second": 10338.971 }, { "epoch": 0.8100289296046287, "grad_norm": 1.851105809211731, "learning_rate": 3.855109961190168e-06, "loss": 1.0817, "num_input_tokens_seen": 74102016, "step": 630, "train_runtime": 7166.4684, "train_tokens_per_second": 10340.102 }, { "epoch": 0.8113146898103504, "grad_norm": 2.0116357803344727, "learning_rate": 3.829236739974127e-06, "loss": 1.1515, "num_input_tokens_seen": 74214208, "step": 631, "train_runtime": 7192.7679, "train_tokens_per_second": 10317.893 }, { "epoch": 0.812600450016072, "grad_norm": 1.927558422088623, "learning_rate": 3.803363518758086e-06, "loss": 1.0052, "num_input_tokens_seen": 74299168, "step": 632, "train_runtime": 7199.9125, "train_tokens_per_second": 10319.454 }, { "epoch": 0.8138862102217936, "grad_norm": 1.961654543876648, "learning_rate": 3.777490297542044e-06, "loss": 1.0519, "num_input_tokens_seen": 74418176, "step": 633, "train_runtime": 7210.5863, "train_tokens_per_second": 10320.683 }, { "epoch": 0.8151719704275152, "grad_norm": 1.8367573022842407, "learning_rate": 3.751617076326003e-06, "loss": 1.011, "num_input_tokens_seen": 74533024, "step": 634, "train_runtime": 7220.8171, "train_tokens_per_second": 10321.965 }, { "epoch": 0.8164577306332369, "grad_norm": 1.8445461988449097, "learning_rate": 3.7257438551099615e-06, "loss": 0.9722, "num_input_tokens_seen": 74639200, "step": 635, "train_runtime": 7230.1938, "train_tokens_per_second": 10323.264 }, { "epoch": 0.8177434908389586, "grad_norm": 1.9773858785629272, "learning_rate": 3.69987063389392e-06, "loss": 0.9934, "num_input_tokens_seen": 74718656, "step": 636, "train_runtime": 7236.8882, "train_tokens_per_second": 10324.694 }, { "epoch": 0.8190292510446802, "grad_norm": 1.880348801612854, "learning_rate": 3.6739974126778786e-06, "loss": 1.0368, "num_input_tokens_seen": 74883680, "step": 637, "train_runtime": 7252.295, "train_tokens_per_second": 10325.515 }, { "epoch": 0.8203150112504018, "grad_norm": 1.939626932144165, "learning_rate": 3.648124191461837e-06, "loss": 1.135, "num_input_tokens_seen": 75006080, "step": 638, "train_runtime": 7263.2834, "train_tokens_per_second": 10326.746 }, { "epoch": 0.8216007714561234, "grad_norm": 1.7646300792694092, "learning_rate": 3.6222509702457957e-06, "loss": 1.0535, "num_input_tokens_seen": 75128000, "step": 639, "train_runtime": 7274.1683, "train_tokens_per_second": 10328.054 }, { "epoch": 0.8228865316618451, "grad_norm": 2.0148706436157227, "learning_rate": 3.5963777490297546e-06, "loss": 1.0519, "num_input_tokens_seen": 75233216, "step": 640, "train_runtime": 7283.2614, "train_tokens_per_second": 10329.605 }, { "epoch": 0.8241722918675667, "grad_norm": 1.9275726079940796, "learning_rate": 3.5705045278137127e-06, "loss": 1.0881, "num_input_tokens_seen": 75367840, "step": 641, "train_runtime": 7295.2124, "train_tokens_per_second": 10331.137 }, { "epoch": 0.8254580520732884, "grad_norm": 2.142881393432617, "learning_rate": 3.5446313065976717e-06, "loss": 1.2726, "num_input_tokens_seen": 75526528, "step": 642, "train_runtime": 7309.8561, "train_tokens_per_second": 10332.15 }, { "epoch": 0.82674381227901, "grad_norm": 1.8535045385360718, "learning_rate": 3.5187580853816307e-06, "loss": 1.0476, "num_input_tokens_seen": 75662336, "step": 643, "train_runtime": 7322.2115, "train_tokens_per_second": 10333.263 }, { "epoch": 0.8280295724847316, "grad_norm": 1.9154276847839355, "learning_rate": 3.492884864165589e-06, "loss": 1.131, "num_input_tokens_seen": 75779040, "step": 644, "train_runtime": 7332.6834, "train_tokens_per_second": 10334.421 }, { "epoch": 0.8293153326904532, "grad_norm": 1.8441919088363647, "learning_rate": 3.4670116429495478e-06, "loss": 1.049, "num_input_tokens_seen": 75923360, "step": 645, "train_runtime": 7346.1516, "train_tokens_per_second": 10335.12 }, { "epoch": 0.8306010928961749, "grad_norm": 2.044139862060547, "learning_rate": 3.441138421733506e-06, "loss": 1.0502, "num_input_tokens_seen": 76033984, "step": 646, "train_runtime": 7355.8474, "train_tokens_per_second": 10336.536 }, { "epoch": 0.8318868531018965, "grad_norm": 1.9089950323104858, "learning_rate": 3.415265200517465e-06, "loss": 1.1316, "num_input_tokens_seen": 76122944, "step": 647, "train_runtime": 7363.3482, "train_tokens_per_second": 10338.088 }, { "epoch": 0.8331726133076182, "grad_norm": 1.77204430103302, "learning_rate": 3.3893919793014234e-06, "loss": 1.0729, "num_input_tokens_seen": 76216608, "step": 648, "train_runtime": 7371.305, "train_tokens_per_second": 10339.636 }, { "epoch": 0.8344583735133397, "grad_norm": 1.8178905248641968, "learning_rate": 3.363518758085382e-06, "loss": 1.0451, "num_input_tokens_seen": 76310720, "step": 649, "train_runtime": 7379.274, "train_tokens_per_second": 10341.223 }, { "epoch": 0.8357441337190614, "grad_norm": 1.819828748703003, "learning_rate": 3.3376455368693404e-06, "loss": 1.0011, "num_input_tokens_seen": 76423424, "step": 650, "train_runtime": 7389.1813, "train_tokens_per_second": 10342.611 }, { "epoch": 0.837029893924783, "grad_norm": 1.8803701400756836, "learning_rate": 3.3117723156532994e-06, "loss": 1.0684, "num_input_tokens_seen": 76528768, "step": 651, "train_runtime": 7398.2156, "train_tokens_per_second": 10344.22 }, { "epoch": 0.8383156541305047, "grad_norm": 1.7649791240692139, "learning_rate": 3.2858990944372575e-06, "loss": 1.0853, "num_input_tokens_seen": 76637184, "step": 652, "train_runtime": 7407.6495, "train_tokens_per_second": 10345.682 }, { "epoch": 0.8396014143362263, "grad_norm": 1.8651745319366455, "learning_rate": 3.2600258732212165e-06, "loss": 1.016, "num_input_tokens_seen": 76752288, "step": 653, "train_runtime": 7418.1044, "train_tokens_per_second": 10346.617 }, { "epoch": 0.840887174541948, "grad_norm": 2.0024538040161133, "learning_rate": 3.2341526520051746e-06, "loss": 0.9789, "num_input_tokens_seen": 76872672, "step": 654, "train_runtime": 7428.7756, "train_tokens_per_second": 10347.96 }, { "epoch": 0.8421729347476695, "grad_norm": 1.891562581062317, "learning_rate": 3.2082794307891336e-06, "loss": 0.9911, "num_input_tokens_seen": 76990624, "step": 655, "train_runtime": 7439.4116, "train_tokens_per_second": 10349.021 }, { "epoch": 0.8434586949533912, "grad_norm": 1.8575772047042847, "learning_rate": 3.1824062095730925e-06, "loss": 1.0312, "num_input_tokens_seen": 77120544, "step": 656, "train_runtime": 7451.122, "train_tokens_per_second": 10350.192 }, { "epoch": 0.8447444551591128, "grad_norm": 1.7141671180725098, "learning_rate": 3.1565329883570506e-06, "loss": 0.9903, "num_input_tokens_seen": 77225280, "step": 657, "train_runtime": 7460.2728, "train_tokens_per_second": 10351.536 }, { "epoch": 0.8460302153648345, "grad_norm": 2.0042834281921387, "learning_rate": 3.130659767141009e-06, "loss": 1.0529, "num_input_tokens_seen": 77332128, "step": 658, "train_runtime": 7469.5149, "train_tokens_per_second": 10353.032 }, { "epoch": 0.847315975570556, "grad_norm": 1.9022477865219116, "learning_rate": 3.1047865459249677e-06, "loss": 1.0931, "num_input_tokens_seen": 77443168, "step": 659, "train_runtime": 7479.2157, "train_tokens_per_second": 10354.45 }, { "epoch": 0.8486017357762777, "grad_norm": 1.873485803604126, "learning_rate": 3.0789133247089263e-06, "loss": 1.026, "num_input_tokens_seen": 77537376, "step": 660, "train_runtime": 7487.2839, "train_tokens_per_second": 10355.875 }, { "epoch": 0.8498874959819993, "grad_norm": 1.8651823997497559, "learning_rate": 3.0530401034928852e-06, "loss": 1.0775, "num_input_tokens_seen": 77650464, "step": 661, "train_runtime": 7514.0471, "train_tokens_per_second": 10334.04 }, { "epoch": 0.851173256187721, "grad_norm": 1.8203614950180054, "learning_rate": 3.0271668822768433e-06, "loss": 1.0082, "num_input_tokens_seen": 77754656, "step": 662, "train_runtime": 7523.1298, "train_tokens_per_second": 10335.413 }, { "epoch": 0.8524590163934426, "grad_norm": 1.87871515750885, "learning_rate": 3.0012936610608023e-06, "loss": 1.0285, "num_input_tokens_seen": 77863392, "step": 663, "train_runtime": 7532.441, "train_tokens_per_second": 10337.073 }, { "epoch": 0.8537447765991643, "grad_norm": 1.8229897022247314, "learning_rate": 2.9754204398447613e-06, "loss": 1.0719, "num_input_tokens_seen": 77968736, "step": 664, "train_runtime": 7541.5876, "train_tokens_per_second": 10338.504 }, { "epoch": 0.8550305368048859, "grad_norm": 1.788649320602417, "learning_rate": 2.9495472186287194e-06, "loss": 1.0702, "num_input_tokens_seen": 78116000, "step": 665, "train_runtime": 7555.0918, "train_tokens_per_second": 10339.517 }, { "epoch": 0.8563162970106075, "grad_norm": 1.9688736200332642, "learning_rate": 2.9236739974126783e-06, "loss": 1.0683, "num_input_tokens_seen": 78252000, "step": 666, "train_runtime": 7567.7838, "train_tokens_per_second": 10340.147 }, { "epoch": 0.8576020572163292, "grad_norm": 1.8758140802383423, "learning_rate": 2.8978007761966365e-06, "loss": 1.0176, "num_input_tokens_seen": 78400896, "step": 667, "train_runtime": 7581.1157, "train_tokens_per_second": 10341.604 }, { "epoch": 0.8588878174220508, "grad_norm": 1.8528767824172974, "learning_rate": 2.8719275549805954e-06, "loss": 1.0088, "num_input_tokens_seen": 78535872, "step": 668, "train_runtime": 7593.4775, "train_tokens_per_second": 10342.544 }, { "epoch": 0.8601735776277725, "grad_norm": 1.8127259016036987, "learning_rate": 2.846054333764554e-06, "loss": 1.1, "num_input_tokens_seen": 78643040, "step": 669, "train_runtime": 7602.9127, "train_tokens_per_second": 10343.804 }, { "epoch": 0.861459337833494, "grad_norm": 1.833497405052185, "learning_rate": 2.8201811125485125e-06, "loss": 1.0125, "num_input_tokens_seen": 78758208, "step": 670, "train_runtime": 7612.996, "train_tokens_per_second": 10345.232 }, { "epoch": 0.8627450980392157, "grad_norm": 1.9422428607940674, "learning_rate": 2.794307891332471e-06, "loss": 1.034, "num_input_tokens_seen": 78856224, "step": 671, "train_runtime": 7621.3865, "train_tokens_per_second": 10346.703 }, { "epoch": 0.8640308582449373, "grad_norm": 1.9948776960372925, "learning_rate": 2.76843467011643e-06, "loss": 1.0527, "num_input_tokens_seen": 78963072, "step": 672, "train_runtime": 7630.5085, "train_tokens_per_second": 10348.337 }, { "epoch": 0.865316618450659, "grad_norm": 1.8143967390060425, "learning_rate": 2.742561448900388e-06, "loss": 1.0609, "num_input_tokens_seen": 79109120, "step": 673, "train_runtime": 7643.9846, "train_tokens_per_second": 10349.199 }, { "epoch": 0.8666023786563806, "grad_norm": 1.855102777481079, "learning_rate": 2.716688227684347e-06, "loss": 1.0352, "num_input_tokens_seen": 79207456, "step": 674, "train_runtime": 7652.3254, "train_tokens_per_second": 10350.769 }, { "epoch": 0.8678881388621023, "grad_norm": 2.0813863277435303, "learning_rate": 2.690815006468305e-06, "loss": 1.1286, "num_input_tokens_seen": 79317120, "step": 675, "train_runtime": 7661.9866, "train_tokens_per_second": 10352.031 }, { "epoch": 0.8691738990678238, "grad_norm": 1.8220653533935547, "learning_rate": 2.664941785252264e-06, "loss": 1.1715, "num_input_tokens_seen": 79483744, "step": 676, "train_runtime": 7677.6815, "train_tokens_per_second": 10352.571 }, { "epoch": 0.8704596592735455, "grad_norm": 1.8896037340164185, "learning_rate": 2.639068564036223e-06, "loss": 1.0194, "num_input_tokens_seen": 79569024, "step": 677, "train_runtime": 7684.8538, "train_tokens_per_second": 10354.006 }, { "epoch": 0.8717454194792671, "grad_norm": 1.8855335712432861, "learning_rate": 2.6131953428201812e-06, "loss": 1.0903, "num_input_tokens_seen": 79665344, "step": 678, "train_runtime": 7693.2234, "train_tokens_per_second": 10355.262 }, { "epoch": 0.8730311796849888, "grad_norm": 1.8641669750213623, "learning_rate": 2.58732212160414e-06, "loss": 1.0381, "num_input_tokens_seen": 79761120, "step": 679, "train_runtime": 7701.3015, "train_tokens_per_second": 10356.836 }, { "epoch": 0.8743169398907104, "grad_norm": 1.8233321905136108, "learning_rate": 2.5614489003880987e-06, "loss": 0.983, "num_input_tokens_seen": 79924640, "step": 680, "train_runtime": 7716.5881, "train_tokens_per_second": 10357.51 }, { "epoch": 0.875602700096432, "grad_norm": 1.8468879461288452, "learning_rate": 2.535575679172057e-06, "loss": 1.039, "num_input_tokens_seen": 80021344, "step": 681, "train_runtime": 7724.808, "train_tokens_per_second": 10359.007 }, { "epoch": 0.8768884603021536, "grad_norm": 1.7861686944961548, "learning_rate": 2.509702457956016e-06, "loss": 1.0949, "num_input_tokens_seen": 80140384, "step": 682, "train_runtime": 7735.3252, "train_tokens_per_second": 10360.312 }, { "epoch": 0.8781742205078753, "grad_norm": 1.9106656312942505, "learning_rate": 2.4838292367399743e-06, "loss": 1.0139, "num_input_tokens_seen": 80283136, "step": 683, "train_runtime": 7748.4471, "train_tokens_per_second": 10361.19 }, { "epoch": 0.8794599807135969, "grad_norm": 1.7842717170715332, "learning_rate": 2.457956015523933e-06, "loss": 1.0803, "num_input_tokens_seen": 80407520, "step": 684, "train_runtime": 7759.5573, "train_tokens_per_second": 10362.385 }, { "epoch": 0.8807457409193186, "grad_norm": 1.6155146360397339, "learning_rate": 2.4320827943078914e-06, "loss": 1.0904, "num_input_tokens_seen": 80521312, "step": 685, "train_runtime": 7769.6839, "train_tokens_per_second": 10363.525 }, { "epoch": 0.8820315011250401, "grad_norm": 1.9151482582092285, "learning_rate": 2.4062095730918504e-06, "loss": 0.9985, "num_input_tokens_seen": 80650112, "step": 686, "train_runtime": 7781.5312, "train_tokens_per_second": 10364.299 }, { "epoch": 0.8833172613307618, "grad_norm": 1.882094144821167, "learning_rate": 2.380336351875809e-06, "loss": 1.0523, "num_input_tokens_seen": 80751584, "step": 687, "train_runtime": 7790.3656, "train_tokens_per_second": 10365.571 }, { "epoch": 0.8846030215364834, "grad_norm": 1.9243850708007812, "learning_rate": 2.3544631306597675e-06, "loss": 1.0447, "num_input_tokens_seen": 80893472, "step": 688, "train_runtime": 7803.0693, "train_tokens_per_second": 10366.879 }, { "epoch": 0.8858887817422051, "grad_norm": 1.9028187990188599, "learning_rate": 2.328589909443726e-06, "loss": 1.124, "num_input_tokens_seen": 81008832, "step": 689, "train_runtime": 7813.0316, "train_tokens_per_second": 10368.425 }, { "epoch": 0.8871745419479267, "grad_norm": 1.9224538803100586, "learning_rate": 2.3027166882276845e-06, "loss": 1.0497, "num_input_tokens_seen": 81122272, "step": 690, "train_runtime": 7823.0001, "train_tokens_per_second": 10369.714 }, { "epoch": 0.8884603021536484, "grad_norm": 1.7827943563461304, "learning_rate": 2.276843467011643e-06, "loss": 0.9838, "num_input_tokens_seen": 81199616, "step": 691, "train_runtime": 7846.4547, "train_tokens_per_second": 10348.574 }, { "epoch": 0.8897460623593699, "grad_norm": 1.9258924722671509, "learning_rate": 2.2509702457956016e-06, "loss": 1.0869, "num_input_tokens_seen": 81317440, "step": 692, "train_runtime": 7856.7474, "train_tokens_per_second": 10350.013 }, { "epoch": 0.8910318225650916, "grad_norm": 1.7988842725753784, "learning_rate": 2.22509702457956e-06, "loss": 1.0551, "num_input_tokens_seen": 81392096, "step": 693, "train_runtime": 7863.0317, "train_tokens_per_second": 10351.236 }, { "epoch": 0.8923175827708132, "grad_norm": 1.9783662557601929, "learning_rate": 2.1992238033635187e-06, "loss": 1.0206, "num_input_tokens_seen": 81586720, "step": 694, "train_runtime": 7881.7563, "train_tokens_per_second": 10351.338 }, { "epoch": 0.8936033429765349, "grad_norm": 1.8867701292037964, "learning_rate": 2.1733505821474777e-06, "loss": 1.021, "num_input_tokens_seen": 81666304, "step": 695, "train_runtime": 7888.4054, "train_tokens_per_second": 10352.701 }, { "epoch": 0.8948891031822566, "grad_norm": 1.9221513271331787, "learning_rate": 2.147477360931436e-06, "loss": 1.0316, "num_input_tokens_seen": 81798240, "step": 696, "train_runtime": 7900.2219, "train_tokens_per_second": 10353.917 }, { "epoch": 0.8961748633879781, "grad_norm": 1.837570309638977, "learning_rate": 2.1216041397153947e-06, "loss": 1.0778, "num_input_tokens_seen": 81969408, "step": 697, "train_runtime": 7916.1174, "train_tokens_per_second": 10354.749 }, { "epoch": 0.8974606235936998, "grad_norm": 1.9242483377456665, "learning_rate": 2.0957309184993533e-06, "loss": 1.0736, "num_input_tokens_seen": 82059968, "step": 698, "train_runtime": 7923.8396, "train_tokens_per_second": 10356.086 }, { "epoch": 0.8987463837994214, "grad_norm": 1.8562523126602173, "learning_rate": 2.0698576972833122e-06, "loss": 1.0715, "num_input_tokens_seen": 82150944, "step": 699, "train_runtime": 7931.5687, "train_tokens_per_second": 10357.465 }, { "epoch": 0.9000321440051431, "grad_norm": 1.8766613006591797, "learning_rate": 2.0439844760672708e-06, "loss": 1.0177, "num_input_tokens_seen": 82278976, "step": 700, "train_runtime": 7942.9729, "train_tokens_per_second": 10358.713 }, { "epoch": 0.9013179042108647, "grad_norm": 1.8400506973266602, "learning_rate": 2.0181112548512293e-06, "loss": 0.9974, "num_input_tokens_seen": 82380256, "step": 701, "train_runtime": 7951.654, "train_tokens_per_second": 10360.141 }, { "epoch": 0.9026036644165863, "grad_norm": 1.869764804840088, "learning_rate": 1.9922380336351874e-06, "loss": 1.1055, "num_input_tokens_seen": 82467136, "step": 702, "train_runtime": 7959.0198, "train_tokens_per_second": 10361.469 }, { "epoch": 0.9026036644165863, "eval_loss": 1.1008806228637695, "eval_runtime": 21.9435, "eval_samples_per_second": 45.298, "eval_steps_per_second": 1.458, "num_input_tokens_seen": 82467136, "step": 702 }, { "epoch": 0.9038894246223079, "grad_norm": 1.8863102197647095, "learning_rate": 1.9663648124191464e-06, "loss": 1.0474, "num_input_tokens_seen": 82549824, "step": 703, "train_runtime": 7987.8517, "train_tokens_per_second": 10334.421 }, { "epoch": 0.9051751848280296, "grad_norm": 1.9096331596374512, "learning_rate": 1.940491591203105e-06, "loss": 0.9695, "num_input_tokens_seen": 82644544, "step": 704, "train_runtime": 7995.9308, "train_tokens_per_second": 10335.825 }, { "epoch": 0.9064609450337512, "grad_norm": 1.917685627937317, "learning_rate": 1.9146183699870635e-06, "loss": 1.0134, "num_input_tokens_seen": 82744352, "step": 705, "train_runtime": 8004.4871, "train_tokens_per_second": 10337.246 }, { "epoch": 0.9077467052394729, "grad_norm": 1.8343957662582397, "learning_rate": 1.888745148771022e-06, "loss": 1.0128, "num_input_tokens_seen": 82828832, "step": 706, "train_runtime": 8011.5724, "train_tokens_per_second": 10338.649 }, { "epoch": 0.9090324654451944, "grad_norm": 1.8960968255996704, "learning_rate": 1.8628719275549808e-06, "loss": 1.0537, "num_input_tokens_seen": 82904896, "step": 707, "train_runtime": 8017.8668, "train_tokens_per_second": 10340.019 }, { "epoch": 0.9103182256509161, "grad_norm": 1.9157270193099976, "learning_rate": 1.8369987063389393e-06, "loss": 1.0718, "num_input_tokens_seen": 83015168, "step": 708, "train_runtime": 8027.3151, "train_tokens_per_second": 10341.586 }, { "epoch": 0.9116039858566377, "grad_norm": 1.9855552911758423, "learning_rate": 1.8111254851228978e-06, "loss": 1.0452, "num_input_tokens_seen": 83164288, "step": 709, "train_runtime": 8041.0658, "train_tokens_per_second": 10342.446 }, { "epoch": 0.9128897460623594, "grad_norm": 1.8479399681091309, "learning_rate": 1.7852522639068564e-06, "loss": 1.0732, "num_input_tokens_seen": 83269312, "step": 710, "train_runtime": 8050.0869, "train_tokens_per_second": 10343.902 }, { "epoch": 0.914175506268081, "grad_norm": 1.8165806531906128, "learning_rate": 1.7593790426908153e-06, "loss": 1.0951, "num_input_tokens_seen": 83382816, "step": 711, "train_runtime": 8060.1786, "train_tokens_per_second": 10345.033 }, { "epoch": 0.9154612664738027, "grad_norm": 1.933991551399231, "learning_rate": 1.7335058214747739e-06, "loss": 1.0493, "num_input_tokens_seen": 83479968, "step": 712, "train_runtime": 8068.5568, "train_tokens_per_second": 10346.332 }, { "epoch": 0.9167470266795242, "grad_norm": 1.9237388372421265, "learning_rate": 1.7076326002587324e-06, "loss": 1.129, "num_input_tokens_seen": 83614112, "step": 713, "train_runtime": 8080.647, "train_tokens_per_second": 10347.453 }, { "epoch": 0.9180327868852459, "grad_norm": 1.7912081480026245, "learning_rate": 1.681759379042691e-06, "loss": 0.9808, "num_input_tokens_seen": 83697376, "step": 714, "train_runtime": 8087.6795, "train_tokens_per_second": 10348.75 }, { "epoch": 0.9193185470909675, "grad_norm": 1.951076865196228, "learning_rate": 1.6558861578266497e-06, "loss": 1.0593, "num_input_tokens_seen": 83815040, "step": 715, "train_runtime": 8098.1807, "train_tokens_per_second": 10349.86 }, { "epoch": 0.9206043072966892, "grad_norm": 1.97995924949646, "learning_rate": 1.6300129366106082e-06, "loss": 1.1155, "num_input_tokens_seen": 83897792, "step": 716, "train_runtime": 8105.0892, "train_tokens_per_second": 10351.248 }, { "epoch": 0.9218900675024108, "grad_norm": 1.942265510559082, "learning_rate": 1.6041397153945668e-06, "loss": 1.0594, "num_input_tokens_seen": 83994528, "step": 717, "train_runtime": 8113.4146, "train_tokens_per_second": 10352.55 }, { "epoch": 0.9231758277081324, "grad_norm": 1.8772202730178833, "learning_rate": 1.5782664941785253e-06, "loss": 1.0071, "num_input_tokens_seen": 84138560, "step": 718, "train_runtime": 8126.2707, "train_tokens_per_second": 10353.896 }, { "epoch": 0.924461587913854, "grad_norm": 1.8658959865570068, "learning_rate": 1.5523932729624839e-06, "loss": 1.042, "num_input_tokens_seen": 84260672, "step": 719, "train_runtime": 8137.107, "train_tokens_per_second": 10355.114 }, { "epoch": 0.9257473481195757, "grad_norm": 2.0019772052764893, "learning_rate": 1.5265200517464426e-06, "loss": 1.1432, "num_input_tokens_seen": 84396768, "step": 720, "train_runtime": 8149.6434, "train_tokens_per_second": 10355.885 }, { "epoch": 0.9270331083252973, "grad_norm": 1.8118327856063843, "learning_rate": 1.5006468305304011e-06, "loss": 1.0152, "num_input_tokens_seen": 84505152, "step": 721, "train_runtime": 8175.6795, "train_tokens_per_second": 10336.163 }, { "epoch": 0.928318868531019, "grad_norm": 1.8588857650756836, "learning_rate": 1.4747736093143597e-06, "loss": 1.0345, "num_input_tokens_seen": 84622880, "step": 722, "train_runtime": 8185.9126, "train_tokens_per_second": 10337.623 }, { "epoch": 0.9296046287367405, "grad_norm": 1.9721977710723877, "learning_rate": 1.4489003880983182e-06, "loss": 0.9971, "num_input_tokens_seen": 84703392, "step": 723, "train_runtime": 8192.5908, "train_tokens_per_second": 10339.024 }, { "epoch": 0.9308903889424622, "grad_norm": 1.8980185985565186, "learning_rate": 1.423027166882277e-06, "loss": 1.1035, "num_input_tokens_seen": 84808768, "step": 724, "train_runtime": 8201.5607, "train_tokens_per_second": 10340.565 }, { "epoch": 0.9321761491481839, "grad_norm": 1.9349688291549683, "learning_rate": 1.3971539456662355e-06, "loss": 1.0111, "num_input_tokens_seen": 84913856, "step": 725, "train_runtime": 8210.5039, "train_tokens_per_second": 10342.1 }, { "epoch": 0.9334619093539055, "grad_norm": 1.8501139879226685, "learning_rate": 1.371280724450194e-06, "loss": 1.0002, "num_input_tokens_seen": 85059104, "step": 726, "train_runtime": 8223.8201, "train_tokens_per_second": 10343.016 }, { "epoch": 0.9347476695596272, "grad_norm": 1.839609146118164, "learning_rate": 1.3454075032341526e-06, "loss": 1.0067, "num_input_tokens_seen": 85222624, "step": 727, "train_runtime": 8239.0013, "train_tokens_per_second": 10343.805 }, { "epoch": 0.9360334297653488, "grad_norm": 1.8927664756774902, "learning_rate": 1.3195342820181116e-06, "loss": 1.0748, "num_input_tokens_seen": 85403168, "step": 728, "train_runtime": 8256.2939, "train_tokens_per_second": 10344.008 }, { "epoch": 0.9373191899710704, "grad_norm": 1.9910334348678589, "learning_rate": 1.29366106080207e-06, "loss": 1.065, "num_input_tokens_seen": 85504928, "step": 729, "train_runtime": 8265.046, "train_tokens_per_second": 10345.366 }, { "epoch": 0.938604950176792, "grad_norm": 2.0429680347442627, "learning_rate": 1.2677878395860284e-06, "loss": 1.0859, "num_input_tokens_seen": 85584480, "step": 730, "train_runtime": 8271.7915, "train_tokens_per_second": 10346.547 }, { "epoch": 0.9398907103825137, "grad_norm": 1.899824619293213, "learning_rate": 1.2419146183699872e-06, "loss": 1.0421, "num_input_tokens_seen": 85722336, "step": 731, "train_runtime": 8284.1914, "train_tokens_per_second": 10347.701 }, { "epoch": 0.9411764705882353, "grad_norm": 1.7903647422790527, "learning_rate": 1.2160413971539457e-06, "loss": 0.9449, "num_input_tokens_seen": 85865184, "step": 732, "train_runtime": 8297.6936, "train_tokens_per_second": 10348.078 }, { "epoch": 0.942462230793957, "grad_norm": 1.8359401226043701, "learning_rate": 1.1901681759379045e-06, "loss": 1.0292, "num_input_tokens_seen": 85976832, "step": 733, "train_runtime": 8307.6144, "train_tokens_per_second": 10349.16 }, { "epoch": 0.9437479909996785, "grad_norm": 1.7849318981170654, "learning_rate": 1.164294954721863e-06, "loss": 0.9646, "num_input_tokens_seen": 86061920, "step": 734, "train_runtime": 8314.8905, "train_tokens_per_second": 10350.337 }, { "epoch": 0.9450337512054002, "grad_norm": 1.92512845993042, "learning_rate": 1.1384217335058215e-06, "loss": 0.9865, "num_input_tokens_seen": 86189248, "step": 735, "train_runtime": 8326.2348, "train_tokens_per_second": 10351.527 }, { "epoch": 0.9463195114111218, "grad_norm": 1.8651082515716553, "learning_rate": 1.11254851228978e-06, "loss": 1.0223, "num_input_tokens_seen": 86316320, "step": 736, "train_runtime": 8337.4327, "train_tokens_per_second": 10352.866 }, { "epoch": 0.9476052716168435, "grad_norm": 2.024437189102173, "learning_rate": 1.0866752910737388e-06, "loss": 1.1516, "num_input_tokens_seen": 86437952, "step": 737, "train_runtime": 8348.1965, "train_tokens_per_second": 10354.087 }, { "epoch": 0.9488910318225651, "grad_norm": 1.9123945236206055, "learning_rate": 1.0608020698576974e-06, "loss": 1.049, "num_input_tokens_seen": 86553120, "step": 738, "train_runtime": 8358.151, "train_tokens_per_second": 10355.534 }, { "epoch": 0.9501767920282868, "grad_norm": 1.8395739793777466, "learning_rate": 1.0349288486416561e-06, "loss": 1.095, "num_input_tokens_seen": 86637792, "step": 739, "train_runtime": 8365.3725, "train_tokens_per_second": 10356.717 }, { "epoch": 0.9514625522340083, "grad_norm": 1.8441441059112549, "learning_rate": 1.0090556274256147e-06, "loss": 1.0399, "num_input_tokens_seen": 86779232, "step": 740, "train_runtime": 8378.4531, "train_tokens_per_second": 10357.429 }, { "epoch": 0.95274831243973, "grad_norm": 1.9400453567504883, "learning_rate": 9.831824062095732e-07, "loss": 1.0772, "num_input_tokens_seen": 86871712, "step": 741, "train_runtime": 8386.2953, "train_tokens_per_second": 10358.771 }, { "epoch": 0.9540340726454516, "grad_norm": 1.7376289367675781, "learning_rate": 9.573091849935317e-07, "loss": 0.9707, "num_input_tokens_seen": 87009664, "step": 742, "train_runtime": 8398.846, "train_tokens_per_second": 10359.717 }, { "epoch": 0.9553198328511733, "grad_norm": 1.8850547075271606, "learning_rate": 9.314359637774904e-07, "loss": 1.0961, "num_input_tokens_seen": 87136544, "step": 743, "train_runtime": 8410.4197, "train_tokens_per_second": 10360.546 }, { "epoch": 0.9566055930568949, "grad_norm": 1.964850664138794, "learning_rate": 9.055627425614489e-07, "loss": 1.0545, "num_input_tokens_seen": 87257664, "step": 744, "train_runtime": 8421.013, "train_tokens_per_second": 10361.896 }, { "epoch": 0.9578913532626165, "grad_norm": 1.853871464729309, "learning_rate": 8.796895213454077e-07, "loss": 0.9811, "num_input_tokens_seen": 87335232, "step": 745, "train_runtime": 8427.4933, "train_tokens_per_second": 10363.133 }, { "epoch": 0.9591771134683381, "grad_norm": 1.8630493879318237, "learning_rate": 8.538163001293662e-07, "loss": 1.0717, "num_input_tokens_seen": 87423904, "step": 746, "train_runtime": 8434.9496, "train_tokens_per_second": 10364.484 }, { "epoch": 0.9604628736740598, "grad_norm": 1.965602159500122, "learning_rate": 8.279430789133249e-07, "loss": 1.0034, "num_input_tokens_seen": 87578368, "step": 747, "train_runtime": 8449.1667, "train_tokens_per_second": 10365.326 }, { "epoch": 0.9617486338797814, "grad_norm": 2.018232822418213, "learning_rate": 8.020698576972834e-07, "loss": 1.1624, "num_input_tokens_seen": 87677056, "step": 748, "train_runtime": 8457.5855, "train_tokens_per_second": 10366.677 }, { "epoch": 0.9630343940855031, "grad_norm": 1.9769020080566406, "learning_rate": 7.761966364812419e-07, "loss": 1.0854, "num_input_tokens_seen": 87789760, "step": 749, "train_runtime": 8467.576, "train_tokens_per_second": 10367.756 }, { "epoch": 0.9643201542912246, "grad_norm": 1.8354781866073608, "learning_rate": 7.503234152652006e-07, "loss": 1.0912, "num_input_tokens_seen": 87898272, "step": 750, "train_runtime": 8476.9893, "train_tokens_per_second": 10369.044 }, { "epoch": 0.9656059144969463, "grad_norm": 1.9885339736938477, "learning_rate": 7.244501940491591e-07, "loss": 1.1578, "num_input_tokens_seen": 88005184, "step": 751, "train_runtime": 8502.9158, "train_tokens_per_second": 10350.001 }, { "epoch": 0.9668916747026679, "grad_norm": 1.799993872642517, "learning_rate": 6.985769728331178e-07, "loss": 1.0968, "num_input_tokens_seen": 88145856, "step": 752, "train_runtime": 8515.7908, "train_tokens_per_second": 10350.871 }, { "epoch": 0.9681774349083896, "grad_norm": 1.7286502122879028, "learning_rate": 6.727037516170763e-07, "loss": 1.0199, "num_input_tokens_seen": 88253472, "step": 753, "train_runtime": 8525.1284, "train_tokens_per_second": 10352.157 }, { "epoch": 0.9694631951141112, "grad_norm": 1.8545376062393188, "learning_rate": 6.46830530401035e-07, "loss": 1.0294, "num_input_tokens_seen": 88410112, "step": 754, "train_runtime": 8540.0868, "train_tokens_per_second": 10352.367 }, { "epoch": 0.9707489553198329, "grad_norm": 1.7983657121658325, "learning_rate": 6.209573091849936e-07, "loss": 1.0312, "num_input_tokens_seen": 88517184, "step": 755, "train_runtime": 8549.4704, "train_tokens_per_second": 10353.528 }, { "epoch": 0.9720347155255545, "grad_norm": 1.9300833940505981, "learning_rate": 5.950840879689522e-07, "loss": 0.9773, "num_input_tokens_seen": 88644960, "step": 756, "train_runtime": 8561.4036, "train_tokens_per_second": 10354.022 }, { "epoch": 0.9733204757312761, "grad_norm": 1.8282893896102905, "learning_rate": 5.692108667529108e-07, "loss": 0.9824, "num_input_tokens_seen": 88763680, "step": 757, "train_runtime": 8572.4426, "train_tokens_per_second": 10354.538 }, { "epoch": 0.9746062359369978, "grad_norm": 2.0415329933166504, "learning_rate": 5.433376455368694e-07, "loss": 1.0697, "num_input_tokens_seen": 88915392, "step": 758, "train_runtime": 8586.3403, "train_tokens_per_second": 10355.447 }, { "epoch": 0.9758919961427194, "grad_norm": 1.8638561964035034, "learning_rate": 5.174644243208281e-07, "loss": 1.1258, "num_input_tokens_seen": 89018304, "step": 759, "train_runtime": 8595.2138, "train_tokens_per_second": 10356.729 }, { "epoch": 0.9771777563484411, "grad_norm": 1.989698886871338, "learning_rate": 4.915912031047866e-07, "loss": 1.0544, "num_input_tokens_seen": 89134688, "step": 760, "train_runtime": 8605.465, "train_tokens_per_second": 10357.916 }, { "epoch": 0.9784635165541626, "grad_norm": 1.9920203685760498, "learning_rate": 4.657179818887452e-07, "loss": 0.9777, "num_input_tokens_seen": 89292992, "step": 761, "train_runtime": 8620.2862, "train_tokens_per_second": 10358.472 }, { "epoch": 0.9797492767598843, "grad_norm": 1.792285680770874, "learning_rate": 4.3984476067270383e-07, "loss": 1.011, "num_input_tokens_seen": 89397312, "step": 762, "train_runtime": 8629.3843, "train_tokens_per_second": 10359.64 }, { "epoch": 0.9810350369656059, "grad_norm": 1.7668837308883667, "learning_rate": 4.139715394566624e-07, "loss": 1.0001, "num_input_tokens_seen": 89473952, "step": 763, "train_runtime": 8635.848, "train_tokens_per_second": 10360.76 }, { "epoch": 0.9823207971713276, "grad_norm": 2.0289688110351562, "learning_rate": 3.8809831824062096e-07, "loss": 1.0785, "num_input_tokens_seen": 89572416, "step": 764, "train_runtime": 8644.254, "train_tokens_per_second": 10362.076 }, { "epoch": 0.9836065573770492, "grad_norm": 1.9272173643112183, "learning_rate": 3.6222509702457956e-07, "loss": 1.0206, "num_input_tokens_seen": 89671456, "step": 765, "train_runtime": 8652.7996, "train_tokens_per_second": 10363.288 }, { "epoch": 0.9848923175827708, "grad_norm": 2.0589964389801025, "learning_rate": 3.3635187580853815e-07, "loss": 1.029, "num_input_tokens_seen": 89745216, "step": 766, "train_runtime": 8659.0809, "train_tokens_per_second": 10364.289 }, { "epoch": 0.9861780777884924, "grad_norm": 1.846987247467041, "learning_rate": 3.104786545924968e-07, "loss": 1.0234, "num_input_tokens_seen": 89840896, "step": 767, "train_runtime": 8667.3147, "train_tokens_per_second": 10365.482 }, { "epoch": 0.9874638379942141, "grad_norm": 1.9260659217834473, "learning_rate": 2.846054333764554e-07, "loss": 1.2661, "num_input_tokens_seen": 89958592, "step": 768, "train_runtime": 8677.7751, "train_tokens_per_second": 10366.55 }, { "epoch": 0.9887495981999357, "grad_norm": 1.8034597635269165, "learning_rate": 2.5873221216041403e-07, "loss": 1.016, "num_input_tokens_seen": 90066944, "step": 769, "train_runtime": 8687.2356, "train_tokens_per_second": 10367.734 }, { "epoch": 0.9900353584056574, "grad_norm": 1.848668098449707, "learning_rate": 2.328589909443726e-07, "loss": 1.1509, "num_input_tokens_seen": 90199456, "step": 770, "train_runtime": 8699.3479, "train_tokens_per_second": 10368.531 }, { "epoch": 0.991321118611379, "grad_norm": 1.843025803565979, "learning_rate": 2.069857697283312e-07, "loss": 1.4619, "num_input_tokens_seen": 90314368, "step": 771, "train_runtime": 8709.3929, "train_tokens_per_second": 10369.766 }, { "epoch": 0.9926068788171006, "grad_norm": 1.9316155910491943, "learning_rate": 1.8111254851228978e-07, "loss": 1.1308, "num_input_tokens_seen": 90455488, "step": 772, "train_runtime": 8722.3601, "train_tokens_per_second": 10370.529 }, { "epoch": 0.9938926390228222, "grad_norm": 1.8842840194702148, "learning_rate": 1.552393272962484e-07, "loss": 1.181, "num_input_tokens_seen": 90566848, "step": 773, "train_runtime": 8732.2133, "train_tokens_per_second": 10371.58 }, { "epoch": 0.9951783992285439, "grad_norm": 1.918171763420105, "learning_rate": 1.2936610608020701e-07, "loss": 1.0189, "num_input_tokens_seen": 90670336, "step": 774, "train_runtime": 8741.1414, "train_tokens_per_second": 10372.826 }, { "epoch": 0.9964641594342655, "grad_norm": 2.0272796154022217, "learning_rate": 1.034928848641656e-07, "loss": 1.0934, "num_input_tokens_seen": 90764096, "step": 775, "train_runtime": 8749.2474, "train_tokens_per_second": 10373.932 }, { "epoch": 0.9977499196399872, "grad_norm": 1.906491994857788, "learning_rate": 7.76196636481242e-08, "loss": 1.0435, "num_input_tokens_seen": 90880416, "step": 776, "train_runtime": 8759.5236, "train_tokens_per_second": 10375.041 }, { "epoch": 0.9990356798457087, "grad_norm": 1.8904526233673096, "learning_rate": 5.17464424320828e-08, "loss": 1.0791, "num_input_tokens_seen": 91001792, "step": 777, "train_runtime": 8770.7656, "train_tokens_per_second": 10375.581 }, { "epoch": 1.0, "grad_norm": 2.2318460941314697, "learning_rate": 2.58732212160414e-08, "loss": 0.9926, "num_input_tokens_seen": 91103430, "step": 778, "train_runtime": 8781.8231, "train_tokens_per_second": 10374.091 } ], "logging_steps": 1, "max_steps": 778, "num_input_tokens_seen": 91103430, "num_train_epochs": 1, "save_steps": 30, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.5167484420599808e+18, "train_batch_size": 32, "trial_name": null, "trial_params": null }