{ "best_metric": 6.367209434509277, "best_model_checkpoint": "learning_source_20260316/genome_sequence/bert-output/genome_sequence-large/checkpoint-55000", "epoch": 535.6726178924898, "eval_steps": 100, "global_step": 60000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.22179096201829776, "grad_norm": 1.0070414543151855, "learning_rate": 3e-06, "loss": 8.0811, "step": 100 }, { "epoch": 0.22179096201829776, "eval_loss": 7.71008825302124, "eval_runtime": 187.0287, "eval_samples_per_second": 53.468, "eval_steps_per_second": 6.683, "step": 100 }, { "epoch": 0.4435819240365955, "grad_norm": 0.8634200692176819, "learning_rate": 6e-06, "loss": 7.5417, "step": 200 }, { "epoch": 0.4435819240365955, "eval_loss": 7.327251434326172, "eval_runtime": 187.1689, "eval_samples_per_second": 53.428, "eval_steps_per_second": 6.678, "step": 200 }, { "epoch": 0.6653728860548933, "grad_norm": 0.34057387709617615, "learning_rate": 5.989966555183947e-06, "loss": 7.2586, "step": 300 }, { "epoch": 0.6653728860548933, "eval_loss": 7.16713285446167, "eval_runtime": 186.9919, "eval_samples_per_second": 53.478, "eval_steps_per_second": 6.685, "step": 300 }, { "epoch": 0.887163848073191, "grad_norm": 0.21436895430088043, "learning_rate": 5.979933110367893e-06, "loss": 7.1622, "step": 400 }, { "epoch": 0.887163848073191, "eval_loss": 7.128611087799072, "eval_runtime": 186.9143, "eval_samples_per_second": 53.5, "eval_steps_per_second": 6.688, "step": 400 }, { "epoch": 1.1089548100914888, "grad_norm": 0.9315573573112488, "learning_rate": 5.96989966555184e-06, "loss": 7.1284, "step": 500 }, { "epoch": 1.1089548100914888, "eval_loss": 7.088557243347168, "eval_runtime": 187.062, "eval_samples_per_second": 53.458, "eval_steps_per_second": 6.682, "step": 500 }, { "epoch": 1.3307457721097866, "grad_norm": 2.157287359237671, "learning_rate": 5.959866220735786e-06, "loss": 7.0934, "step": 600 }, { "epoch": 1.3307457721097866, "eval_loss": 7.06817102432251, "eval_runtime": 187.1579, "eval_samples_per_second": 53.431, "eval_steps_per_second": 6.679, "step": 600 }, { "epoch": 1.5525367341280842, "grad_norm": 0.6227704286575317, "learning_rate": 5.949832775919732e-06, "loss": 7.0745, "step": 700 }, { "epoch": 1.5525367341280842, "eval_loss": 7.053982734680176, "eval_runtime": 187.1727, "eval_samples_per_second": 53.427, "eval_steps_per_second": 6.678, "step": 700 }, { "epoch": 1.774327696146382, "grad_norm": 0.2588270902633667, "learning_rate": 5.939799331103679e-06, "loss": 7.0637, "step": 800 }, { "epoch": 1.774327696146382, "eval_loss": 7.0445451736450195, "eval_runtime": 187.2068, "eval_samples_per_second": 53.417, "eval_steps_per_second": 6.677, "step": 800 }, { "epoch": 1.9961186581646797, "grad_norm": 0.23316305875778198, "learning_rate": 5.929765886287626e-06, "loss": 7.0551, "step": 900 }, { "epoch": 1.9961186581646797, "eval_loss": 7.040402889251709, "eval_runtime": 187.2019, "eval_samples_per_second": 53.418, "eval_steps_per_second": 6.677, "step": 900 }, { "epoch": 2.2179096201829775, "grad_norm": 0.3035018742084503, "learning_rate": 5.919732441471572e-06, "loss": 7.047, "step": 1000 }, { "epoch": 2.2179096201829775, "eval_loss": 7.034200191497803, "eval_runtime": 187.0513, "eval_samples_per_second": 53.461, "eval_steps_per_second": 6.683, "step": 1000 }, { "epoch": 2.4397005822012754, "grad_norm": 0.17462466657161713, "learning_rate": 5.9096989966555185e-06, "loss": 7.0445, "step": 1100 }, { "epoch": 2.4397005822012754, "eval_loss": 7.031188488006592, "eval_runtime": 187.3229, "eval_samples_per_second": 53.384, "eval_steps_per_second": 6.673, "step": 1100 }, { "epoch": 2.6614915442195732, "grad_norm": 0.33147501945495605, "learning_rate": 5.899665551839465e-06, "loss": 7.0413, "step": 1200 }, { "epoch": 2.6614915442195732, "eval_loss": 7.028659343719482, "eval_runtime": 187.313, "eval_samples_per_second": 53.387, "eval_steps_per_second": 6.673, "step": 1200 }, { "epoch": 2.8832825062378706, "grad_norm": 1.94842529296875, "learning_rate": 5.889632107023412e-06, "loss": 7.0407, "step": 1300 }, { "epoch": 2.8832825062378706, "eval_loss": 7.033056259155273, "eval_runtime": 187.18, "eval_samples_per_second": 53.425, "eval_steps_per_second": 6.678, "step": 1300 }, { "epoch": 3.1050734682561685, "grad_norm": 0.31123045086860657, "learning_rate": 5.879598662207358e-06, "loss": 7.0399, "step": 1400 }, { "epoch": 3.1050734682561685, "eval_loss": 7.026875019073486, "eval_runtime": 194.8815, "eval_samples_per_second": 51.313, "eval_steps_per_second": 6.414, "step": 1400 }, { "epoch": 3.3268644302744663, "grad_norm": 0.6879256367683411, "learning_rate": 5.869565217391305e-06, "loss": 7.0354, "step": 1500 }, { "epoch": 3.3268644302744663, "eval_loss": 7.0256500244140625, "eval_runtime": 186.9583, "eval_samples_per_second": 53.488, "eval_steps_per_second": 6.686, "step": 1500 }, { "epoch": 3.548655392292764, "grad_norm": 0.6064356565475464, "learning_rate": 5.8595317725752514e-06, "loss": 7.0339, "step": 1600 }, { "epoch": 3.548655392292764, "eval_loss": 7.025866985321045, "eval_runtime": 187.1435, "eval_samples_per_second": 53.435, "eval_steps_per_second": 6.679, "step": 1600 }, { "epoch": 3.770446354311062, "grad_norm": 0.7898679971694946, "learning_rate": 5.849498327759197e-06, "loss": 7.0324, "step": 1700 }, { "epoch": 3.770446354311062, "eval_loss": 7.0187907218933105, "eval_runtime": 187.196, "eval_samples_per_second": 53.42, "eval_steps_per_second": 6.677, "step": 1700 }, { "epoch": 3.9922373163293594, "grad_norm": 0.9011751413345337, "learning_rate": 5.839464882943144e-06, "loss": 7.028, "step": 1800 }, { "epoch": 3.9922373163293594, "eval_loss": 7.006008625030518, "eval_runtime": 187.3528, "eval_samples_per_second": 53.375, "eval_steps_per_second": 6.672, "step": 1800 }, { "epoch": 4.214028278347658, "grad_norm": 1.6079226732254028, "learning_rate": 5.829431438127091e-06, "loss": 7.011, "step": 1900 }, { "epoch": 4.214028278347658, "eval_loss": 6.987495422363281, "eval_runtime": 187.4062, "eval_samples_per_second": 53.36, "eval_steps_per_second": 6.67, "step": 1900 }, { "epoch": 4.435819240365955, "grad_norm": 1.481960415840149, "learning_rate": 5.819397993311037e-06, "loss": 6.9459, "step": 2000 }, { "epoch": 4.435819240365955, "eval_loss": 6.7907280921936035, "eval_runtime": 187.5173, "eval_samples_per_second": 53.328, "eval_steps_per_second": 6.666, "step": 2000 }, { "epoch": 4.6576102023842525, "grad_norm": 1.2325085401535034, "learning_rate": 5.8093645484949836e-06, "loss": 6.7706, "step": 2100 }, { "epoch": 4.6576102023842525, "eval_loss": 6.649820327758789, "eval_runtime": 187.8681, "eval_samples_per_second": 53.229, "eval_steps_per_second": 6.654, "step": 2100 }, { "epoch": 4.879401164402551, "grad_norm": 0.5991578698158264, "learning_rate": 5.79933110367893e-06, "loss": 6.6775, "step": 2200 }, { "epoch": 4.879401164402551, "eval_loss": 6.594548225402832, "eval_runtime": 187.9284, "eval_samples_per_second": 53.212, "eval_steps_per_second": 6.651, "step": 2200 }, { "epoch": 5.101192126420848, "grad_norm": 0.5165764093399048, "learning_rate": 5.789297658862876e-06, "loss": 6.6216, "step": 2300 }, { "epoch": 5.101192126420848, "eval_loss": 6.557372570037842, "eval_runtime": 187.4192, "eval_samples_per_second": 53.356, "eval_steps_per_second": 6.67, "step": 2300 }, { "epoch": 5.3229830884391465, "grad_norm": 0.9580274820327759, "learning_rate": 5.779264214046823e-06, "loss": 6.5874, "step": 2400 }, { "epoch": 5.3229830884391465, "eval_loss": 6.537918567657471, "eval_runtime": 187.5204, "eval_samples_per_second": 53.328, "eval_steps_per_second": 6.666, "step": 2400 }, { "epoch": 5.544774050457444, "grad_norm": 1.0393297672271729, "learning_rate": 5.76923076923077e-06, "loss": 6.5652, "step": 2500 }, { "epoch": 5.544774050457444, "eval_loss": 6.521939754486084, "eval_runtime": 187.4537, "eval_samples_per_second": 53.347, "eval_steps_per_second": 6.668, "step": 2500 }, { "epoch": 5.766565012475741, "grad_norm": 0.9627366662025452, "learning_rate": 5.759197324414716e-06, "loss": 6.5446, "step": 2600 }, { "epoch": 5.766565012475741, "eval_loss": 6.509204387664795, "eval_runtime": 187.6214, "eval_samples_per_second": 53.299, "eval_steps_per_second": 6.662, "step": 2600 }, { "epoch": 5.98835597449404, "grad_norm": 0.6260984539985657, "learning_rate": 5.7491638795986624e-06, "loss": 6.5315, "step": 2700 }, { "epoch": 5.98835597449404, "eval_loss": 6.503715515136719, "eval_runtime": 187.5274, "eval_samples_per_second": 53.326, "eval_steps_per_second": 6.666, "step": 2700 }, { "epoch": 6.210146936512337, "grad_norm": 1.0884116888046265, "learning_rate": 5.739130434782609e-06, "loss": 6.5202, "step": 2800 }, { "epoch": 6.210146936512337, "eval_loss": 6.498012065887451, "eval_runtime": 187.9298, "eval_samples_per_second": 53.211, "eval_steps_per_second": 6.651, "step": 2800 }, { "epoch": 6.431937898530635, "grad_norm": 2.436113119125366, "learning_rate": 5.729096989966555e-06, "loss": 6.5118, "step": 2900 }, { "epoch": 6.431937898530635, "eval_loss": 6.493314266204834, "eval_runtime": 187.7394, "eval_samples_per_second": 53.265, "eval_steps_per_second": 6.658, "step": 2900 }, { "epoch": 6.653728860548933, "grad_norm": 0.5587801337242126, "learning_rate": 5.719063545150502e-06, "loss": 6.5023, "step": 3000 }, { "epoch": 6.653728860548933, "eval_loss": 6.485339641571045, "eval_runtime": 187.7624, "eval_samples_per_second": 53.259, "eval_steps_per_second": 6.657, "step": 3000 }, { "epoch": 6.87551982256723, "grad_norm": 0.7650394439697266, "learning_rate": 5.709030100334449e-06, "loss": 6.4958, "step": 3100 }, { "epoch": 6.87551982256723, "eval_loss": 6.47775411605835, "eval_runtime": 187.7412, "eval_samples_per_second": 53.265, "eval_steps_per_second": 6.658, "step": 3100 }, { "epoch": 7.097310784585528, "grad_norm": 0.8987262845039368, "learning_rate": 5.698996655518395e-06, "loss": 6.4903, "step": 3200 }, { "epoch": 7.097310784585528, "eval_loss": 6.474526405334473, "eval_runtime": 187.4357, "eval_samples_per_second": 53.352, "eval_steps_per_second": 6.669, "step": 3200 }, { "epoch": 7.319101746603826, "grad_norm": 1.3211281299591064, "learning_rate": 5.688963210702341e-06, "loss": 6.4853, "step": 3300 }, { "epoch": 7.319101746603826, "eval_loss": 6.471477508544922, "eval_runtime": 184.369, "eval_samples_per_second": 54.239, "eval_steps_per_second": 6.78, "step": 3300 }, { "epoch": 7.540892708622124, "grad_norm": 0.45453569293022156, "learning_rate": 5.678929765886288e-06, "loss": 6.4787, "step": 3400 }, { "epoch": 7.540892708622124, "eval_loss": 6.467108249664307, "eval_runtime": 187.6686, "eval_samples_per_second": 53.285, "eval_steps_per_second": 6.661, "step": 3400 }, { "epoch": 7.762683670640421, "grad_norm": 1.5148217678070068, "learning_rate": 5.668896321070235e-06, "loss": 6.4758, "step": 3500 }, { "epoch": 7.762683670640421, "eval_loss": 6.464193820953369, "eval_runtime": 187.269, "eval_samples_per_second": 53.399, "eval_steps_per_second": 6.675, "step": 3500 }, { "epoch": 7.984474632658719, "grad_norm": 0.7506269216537476, "learning_rate": 5.658862876254181e-06, "loss": 6.4727, "step": 3600 }, { "epoch": 7.984474632658719, "eval_loss": 6.461331367492676, "eval_runtime": 187.3466, "eval_samples_per_second": 53.377, "eval_steps_per_second": 6.672, "step": 3600 }, { "epoch": 8.206265594677017, "grad_norm": 0.7681010961532593, "learning_rate": 5.6488294314381275e-06, "loss": 6.4678, "step": 3700 }, { "epoch": 8.206265594677017, "eval_loss": 6.460472583770752, "eval_runtime": 187.6598, "eval_samples_per_second": 53.288, "eval_steps_per_second": 6.661, "step": 3700 }, { "epoch": 8.428056556695315, "grad_norm": 1.467830777168274, "learning_rate": 5.638795986622074e-06, "loss": 6.4643, "step": 3800 }, { "epoch": 8.428056556695315, "eval_loss": 6.454957485198975, "eval_runtime": 187.5697, "eval_samples_per_second": 53.314, "eval_steps_per_second": 6.664, "step": 3800 }, { "epoch": 8.649847518713612, "grad_norm": 1.0356554985046387, "learning_rate": 5.62876254180602e-06, "loss": 6.459, "step": 3900 }, { "epoch": 8.649847518713612, "eval_loss": 6.457272052764893, "eval_runtime": 187.6233, "eval_samples_per_second": 53.298, "eval_steps_per_second": 6.662, "step": 3900 }, { "epoch": 8.87163848073191, "grad_norm": 1.155139446258545, "learning_rate": 5.618729096989967e-06, "loss": 6.4574, "step": 4000 }, { "epoch": 8.87163848073191, "eval_loss": 6.452768802642822, "eval_runtime": 187.5301, "eval_samples_per_second": 53.325, "eval_steps_per_second": 6.666, "step": 4000 }, { "epoch": 9.093429442750208, "grad_norm": 1.3142337799072266, "learning_rate": 5.608695652173914e-06, "loss": 6.4542, "step": 4100 }, { "epoch": 9.093429442750208, "eval_loss": 6.4489216804504395, "eval_runtime": 187.5651, "eval_samples_per_second": 53.315, "eval_steps_per_second": 6.664, "step": 4100 }, { "epoch": 9.315220404768505, "grad_norm": 1.0297998189926147, "learning_rate": 5.59866220735786e-06, "loss": 6.4502, "step": 4200 }, { "epoch": 9.315220404768505, "eval_loss": 6.446488857269287, "eval_runtime": 187.6096, "eval_samples_per_second": 53.302, "eval_steps_per_second": 6.663, "step": 4200 }, { "epoch": 9.537011366786803, "grad_norm": 1.2892968654632568, "learning_rate": 5.588628762541806e-06, "loss": 6.4486, "step": 4300 }, { "epoch": 9.537011366786803, "eval_loss": 6.445422649383545, "eval_runtime": 187.752, "eval_samples_per_second": 53.262, "eval_steps_per_second": 6.658, "step": 4300 }, { "epoch": 9.758802328805102, "grad_norm": 0.5449041724205017, "learning_rate": 5.578595317725753e-06, "loss": 6.4454, "step": 4400 }, { "epoch": 9.758802328805102, "eval_loss": 6.443131446838379, "eval_runtime": 187.7716, "eval_samples_per_second": 53.256, "eval_steps_per_second": 6.657, "step": 4400 }, { "epoch": 9.9805932908234, "grad_norm": 1.4572607278823853, "learning_rate": 5.568561872909699e-06, "loss": 6.4393, "step": 4500 }, { "epoch": 9.9805932908234, "eval_loss": 6.443836688995361, "eval_runtime": 187.7389, "eval_samples_per_second": 53.265, "eval_steps_per_second": 6.658, "step": 4500 }, { "epoch": 10.202384252841696, "grad_norm": 0.9354243278503418, "learning_rate": 5.558528428093646e-06, "loss": 6.4402, "step": 4600 }, { "epoch": 10.202384252841696, "eval_loss": 6.441638946533203, "eval_runtime": 187.5818, "eval_samples_per_second": 53.31, "eval_steps_per_second": 6.664, "step": 4600 }, { "epoch": 10.424175214859995, "grad_norm": 0.7258580327033997, "learning_rate": 5.548494983277593e-06, "loss": 6.4396, "step": 4700 }, { "epoch": 10.424175214859995, "eval_loss": 6.438319206237793, "eval_runtime": 187.6587, "eval_samples_per_second": 53.288, "eval_steps_per_second": 6.661, "step": 4700 }, { "epoch": 10.645966176878293, "grad_norm": 1.2118555307388306, "learning_rate": 5.5384615384615385e-06, "loss": 6.4367, "step": 4800 }, { "epoch": 10.645966176878293, "eval_loss": 6.441310882568359, "eval_runtime": 187.6565, "eval_samples_per_second": 53.289, "eval_steps_per_second": 6.661, "step": 4800 }, { "epoch": 10.86775713889659, "grad_norm": 1.159846305847168, "learning_rate": 5.528428093645485e-06, "loss": 6.4326, "step": 4900 }, { "epoch": 10.86775713889659, "eval_loss": 6.43587589263916, "eval_runtime": 187.6574, "eval_samples_per_second": 53.289, "eval_steps_per_second": 6.661, "step": 4900 }, { "epoch": 11.089548100914888, "grad_norm": 0.7025282382965088, "learning_rate": 5.518394648829432e-06, "loss": 6.4308, "step": 5000 }, { "epoch": 11.089548100914888, "eval_loss": 6.433752536773682, "eval_runtime": 187.5262, "eval_samples_per_second": 53.326, "eval_steps_per_second": 6.666, "step": 5000 }, { "epoch": 11.311339062933186, "grad_norm": 0.7697749137878418, "learning_rate": 5.508361204013378e-06, "loss": 6.4301, "step": 5100 }, { "epoch": 11.311339062933186, "eval_loss": 6.435794353485107, "eval_runtime": 187.6165, "eval_samples_per_second": 53.3, "eval_steps_per_second": 6.663, "step": 5100 }, { "epoch": 11.533130024951483, "grad_norm": 1.069169044494629, "learning_rate": 5.498327759197324e-06, "loss": 6.4282, "step": 5200 }, { "epoch": 11.533130024951483, "eval_loss": 6.428864479064941, "eval_runtime": 187.7174, "eval_samples_per_second": 53.272, "eval_steps_per_second": 6.659, "step": 5200 }, { "epoch": 11.75492098696978, "grad_norm": 0.7605268955230713, "learning_rate": 5.488294314381271e-06, "loss": 6.427, "step": 5300 }, { "epoch": 11.75492098696978, "eval_loss": 6.429623603820801, "eval_runtime": 187.7429, "eval_samples_per_second": 53.264, "eval_steps_per_second": 6.658, "step": 5300 }, { "epoch": 11.97671194898808, "grad_norm": 1.2731574773788452, "learning_rate": 5.478260869565217e-06, "loss": 6.4248, "step": 5400 }, { "epoch": 11.97671194898808, "eval_loss": 6.4345574378967285, "eval_runtime": 187.759, "eval_samples_per_second": 53.26, "eval_steps_per_second": 6.657, "step": 5400 }, { "epoch": 12.198502911006376, "grad_norm": 0.501266360282898, "learning_rate": 5.468227424749163e-06, "loss": 6.4238, "step": 5500 }, { "epoch": 12.198502911006376, "eval_loss": 6.431957244873047, "eval_runtime": 187.6761, "eval_samples_per_second": 53.283, "eval_steps_per_second": 6.66, "step": 5500 }, { "epoch": 12.420293873024674, "grad_norm": 1.1356490850448608, "learning_rate": 5.45819397993311e-06, "loss": 6.4206, "step": 5600 }, { "epoch": 12.420293873024674, "eval_loss": 6.427853107452393, "eval_runtime": 187.6504, "eval_samples_per_second": 53.291, "eval_steps_per_second": 6.661, "step": 5600 }, { "epoch": 12.642084835042972, "grad_norm": 0.8015862107276917, "learning_rate": 5.448160535117057e-06, "loss": 6.4211, "step": 5700 }, { "epoch": 12.642084835042972, "eval_loss": 6.431809425354004, "eval_runtime": 187.7474, "eval_samples_per_second": 53.263, "eval_steps_per_second": 6.658, "step": 5700 }, { "epoch": 12.86387579706127, "grad_norm": 0.4582173228263855, "learning_rate": 5.438127090301003e-06, "loss": 6.4194, "step": 5800 }, { "epoch": 12.86387579706127, "eval_loss": 6.428267478942871, "eval_runtime": 187.7371, "eval_samples_per_second": 53.266, "eval_steps_per_second": 6.658, "step": 5800 }, { "epoch": 13.085666759079567, "grad_norm": 0.5481283068656921, "learning_rate": 5.4280936454849495e-06, "loss": 6.4158, "step": 5900 }, { "epoch": 13.085666759079567, "eval_loss": 6.426946640014648, "eval_runtime": 187.6213, "eval_samples_per_second": 53.299, "eval_steps_per_second": 6.662, "step": 5900 }, { "epoch": 13.307457721097865, "grad_norm": 0.7986653447151184, "learning_rate": 5.418060200668896e-06, "loss": 6.4177, "step": 6000 }, { "epoch": 13.307457721097865, "eval_loss": 6.428122043609619, "eval_runtime": 187.2985, "eval_samples_per_second": 53.391, "eval_steps_per_second": 6.674, "step": 6000 }, { "epoch": 13.529248683116164, "grad_norm": 0.9855276346206665, "learning_rate": 5.408026755852843e-06, "loss": 6.4158, "step": 6100 }, { "epoch": 13.529248683116164, "eval_loss": 6.425644397735596, "eval_runtime": 187.3504, "eval_samples_per_second": 53.376, "eval_steps_per_second": 6.672, "step": 6100 }, { "epoch": 13.75103964513446, "grad_norm": 0.674077570438385, "learning_rate": 5.397993311036789e-06, "loss": 6.4144, "step": 6200 }, { "epoch": 13.75103964513446, "eval_loss": 6.425694465637207, "eval_runtime": 187.5833, "eval_samples_per_second": 53.31, "eval_steps_per_second": 6.664, "step": 6200 }, { "epoch": 13.972830607152758, "grad_norm": 0.9573073387145996, "learning_rate": 5.387959866220736e-06, "loss": 6.4145, "step": 6300 }, { "epoch": 13.972830607152758, "eval_loss": 6.426056385040283, "eval_runtime": 187.6486, "eval_samples_per_second": 53.291, "eval_steps_per_second": 6.661, "step": 6300 }, { "epoch": 14.194621569171057, "grad_norm": 1.219962239265442, "learning_rate": 5.3779264214046825e-06, "loss": 6.4108, "step": 6400 }, { "epoch": 14.194621569171057, "eval_loss": 6.422914981842041, "eval_runtime": 187.3992, "eval_samples_per_second": 53.362, "eval_steps_per_second": 6.67, "step": 6400 }, { "epoch": 14.416412531189353, "grad_norm": 0.7925574779510498, "learning_rate": 5.367892976588628e-06, "loss": 6.4109, "step": 6500 }, { "epoch": 14.416412531189353, "eval_loss": 6.424429893493652, "eval_runtime": 187.4044, "eval_samples_per_second": 53.361, "eval_steps_per_second": 6.67, "step": 6500 }, { "epoch": 14.638203493207651, "grad_norm": 0.6920539736747742, "learning_rate": 5.357859531772575e-06, "loss": 6.4111, "step": 6600 }, { "epoch": 14.638203493207651, "eval_loss": 6.425134181976318, "eval_runtime": 187.6179, "eval_samples_per_second": 53.3, "eval_steps_per_second": 6.662, "step": 6600 }, { "epoch": 14.85999445522595, "grad_norm": 0.731540322303772, "learning_rate": 5.347826086956522e-06, "loss": 6.4102, "step": 6700 }, { "epoch": 14.85999445522595, "eval_loss": 6.428023338317871, "eval_runtime": 187.5914, "eval_samples_per_second": 53.307, "eval_steps_per_second": 6.663, "step": 6700 }, { "epoch": 15.081785417244248, "grad_norm": 0.9497311115264893, "learning_rate": 5.337792642140468e-06, "loss": 6.4083, "step": 6800 }, { "epoch": 15.081785417244248, "eval_loss": 6.423036098480225, "eval_runtime": 187.4236, "eval_samples_per_second": 53.355, "eval_steps_per_second": 6.669, "step": 6800 }, { "epoch": 15.303576379262545, "grad_norm": 0.6871623396873474, "learning_rate": 5.327759197324415e-06, "loss": 6.4075, "step": 6900 }, { "epoch": 15.303576379262545, "eval_loss": 6.425256729125977, "eval_runtime": 187.5086, "eval_samples_per_second": 53.331, "eval_steps_per_second": 6.666, "step": 6900 }, { "epoch": 15.525367341280843, "grad_norm": 0.5820502042770386, "learning_rate": 5.317725752508361e-06, "loss": 6.4066, "step": 7000 }, { "epoch": 15.525367341280843, "eval_loss": 6.425621509552002, "eval_runtime": 187.786, "eval_samples_per_second": 53.252, "eval_steps_per_second": 6.657, "step": 7000 }, { "epoch": 15.747158303299141, "grad_norm": 1.0221792459487915, "learning_rate": 5.307692307692307e-06, "loss": 6.4074, "step": 7100 }, { "epoch": 15.747158303299141, "eval_loss": 6.419933319091797, "eval_runtime": 187.8686, "eval_samples_per_second": 53.229, "eval_steps_per_second": 6.654, "step": 7100 }, { "epoch": 15.968949265317438, "grad_norm": 0.5439109802246094, "learning_rate": 5.297658862876254e-06, "loss": 6.4051, "step": 7200 }, { "epoch": 15.968949265317438, "eval_loss": 6.417891025543213, "eval_runtime": 187.9103, "eval_samples_per_second": 53.217, "eval_steps_per_second": 6.652, "step": 7200 }, { "epoch": 16.190740227335738, "grad_norm": 0.48691362142562866, "learning_rate": 5.287625418060201e-06, "loss": 6.4048, "step": 7300 }, { "epoch": 16.190740227335738, "eval_loss": 6.4206414222717285, "eval_runtime": 187.7538, "eval_samples_per_second": 53.261, "eval_steps_per_second": 6.658, "step": 7300 }, { "epoch": 16.412531189354034, "grad_norm": 0.4550572633743286, "learning_rate": 5.277591973244147e-06, "loss": 6.4042, "step": 7400 }, { "epoch": 16.412531189354034, "eval_loss": 6.424399375915527, "eval_runtime": 187.7838, "eval_samples_per_second": 53.253, "eval_steps_per_second": 6.657, "step": 7400 }, { "epoch": 16.63432215137233, "grad_norm": 0.9620975852012634, "learning_rate": 5.2675585284280935e-06, "loss": 6.4028, "step": 7500 }, { "epoch": 16.63432215137233, "eval_loss": 6.422457695007324, "eval_runtime": 187.7527, "eval_samples_per_second": 53.262, "eval_steps_per_second": 6.658, "step": 7500 }, { "epoch": 16.85611311339063, "grad_norm": 0.5464668273925781, "learning_rate": 5.25752508361204e-06, "loss": 6.4028, "step": 7600 }, { "epoch": 16.85611311339063, "eval_loss": 6.416252136230469, "eval_runtime": 187.8194, "eval_samples_per_second": 53.243, "eval_steps_per_second": 6.655, "step": 7600 }, { "epoch": 17.077904075408927, "grad_norm": 0.9427766799926758, "learning_rate": 5.247491638795986e-06, "loss": 6.4017, "step": 7700 }, { "epoch": 17.077904075408927, "eval_loss": 6.420745372772217, "eval_runtime": 187.3478, "eval_samples_per_second": 53.377, "eval_steps_per_second": 6.672, "step": 7700 }, { "epoch": 17.299695037427224, "grad_norm": 0.6187496185302734, "learning_rate": 5.237458193979933e-06, "loss": 6.4029, "step": 7800 }, { "epoch": 17.299695037427224, "eval_loss": 6.418467044830322, "eval_runtime": 187.4874, "eval_samples_per_second": 53.337, "eval_steps_per_second": 6.667, "step": 7800 }, { "epoch": 17.521485999445524, "grad_norm": 1.0530321598052979, "learning_rate": 5.22742474916388e-06, "loss": 6.4007, "step": 7900 }, { "epoch": 17.521485999445524, "eval_loss": 6.421618938446045, "eval_runtime": 187.6722, "eval_samples_per_second": 53.284, "eval_steps_per_second": 6.661, "step": 7900 }, { "epoch": 17.74327696146382, "grad_norm": 0.5843673944473267, "learning_rate": 5.2173913043478265e-06, "loss": 6.3996, "step": 8000 }, { "epoch": 17.74327696146382, "eval_loss": 6.414370059967041, "eval_runtime": 187.7088, "eval_samples_per_second": 53.274, "eval_steps_per_second": 6.659, "step": 8000 }, { "epoch": 35.99805932908234, "grad_norm": 0.7473396062850952, "learning_rate": 5.207357859531772e-06, "loss": 6.3985, "step": 8100 }, { "epoch": 35.99805932908234, "eval_loss": 6.4200849533081055, "eval_runtime": 175.8905, "eval_samples_per_second": 56.854, "eval_steps_per_second": 3.553, "step": 8100 }, { "epoch": 36.44164125311894, "grad_norm": 1.399119257926941, "learning_rate": 5.197324414715719e-06, "loss": 6.3988, "step": 8200 }, { "epoch": 36.44164125311894, "eval_loss": 6.415561676025391, "eval_runtime": 175.9246, "eval_samples_per_second": 56.843, "eval_steps_per_second": 3.553, "step": 8200 }, { "epoch": 36.88522317715553, "grad_norm": 0.7817428112030029, "learning_rate": 5.187290969899666e-06, "loss": 6.3974, "step": 8300 }, { "epoch": 36.88522317715553, "eval_loss": 6.418274402618408, "eval_runtime": 175.9184, "eval_samples_per_second": 56.845, "eval_steps_per_second": 3.553, "step": 8300 }, { "epoch": 37.328805101192124, "grad_norm": 0.43301448225975037, "learning_rate": 5.177257525083612e-06, "loss": 6.3975, "step": 8400 }, { "epoch": 37.328805101192124, "eval_loss": 6.416856288909912, "eval_runtime": 175.9451, "eval_samples_per_second": 56.836, "eval_steps_per_second": 3.552, "step": 8400 }, { "epoch": 37.772387025228724, "grad_norm": 0.7033133506774902, "learning_rate": 5.167224080267559e-06, "loss": 6.398, "step": 8500 }, { "epoch": 37.772387025228724, "eval_loss": 6.419331073760986, "eval_runtime": 175.9226, "eval_samples_per_second": 56.843, "eval_steps_per_second": 3.553, "step": 8500 }, { "epoch": 38.21596894926532, "grad_norm": 0.5272181630134583, "learning_rate": 5.157190635451505e-06, "loss": 6.3974, "step": 8600 }, { "epoch": 38.21596894926532, "eval_loss": 6.415123462677002, "eval_runtime": 177.1859, "eval_samples_per_second": 56.438, "eval_steps_per_second": 3.527, "step": 8600 }, { "epoch": 38.65955087330191, "grad_norm": 0.21561351418495178, "learning_rate": 5.147157190635451e-06, "loss": 6.3959, "step": 8700 }, { "epoch": 38.65955087330191, "eval_loss": 6.416403770446777, "eval_runtime": 175.9188, "eval_samples_per_second": 56.844, "eval_steps_per_second": 3.553, "step": 8700 }, { "epoch": 39.10313279733851, "grad_norm": 0.43310365080833435, "learning_rate": 5.137123745819398e-06, "loss": 6.3961, "step": 8800 }, { "epoch": 39.10313279733851, "eval_loss": 6.419050693511963, "eval_runtime": 176.1984, "eval_samples_per_second": 56.754, "eval_steps_per_second": 3.547, "step": 8800 }, { "epoch": 39.5467147213751, "grad_norm": 0.37988752126693726, "learning_rate": 5.127090301003345e-06, "loss": 6.3963, "step": 8900 }, { "epoch": 39.5467147213751, "eval_loss": 6.4194416999816895, "eval_runtime": 177.1378, "eval_samples_per_second": 56.453, "eval_steps_per_second": 3.528, "step": 8900 }, { "epoch": 39.990296645411696, "grad_norm": 0.5972484350204468, "learning_rate": 5.117056856187291e-06, "loss": 6.3957, "step": 9000 }, { "epoch": 39.990296645411696, "eval_loss": 6.413427829742432, "eval_runtime": 177.3512, "eval_samples_per_second": 56.385, "eval_steps_per_second": 3.524, "step": 9000 }, { "epoch": 40.4338785694483, "grad_norm": 0.6110886931419373, "learning_rate": 5.1070234113712375e-06, "loss": 6.3956, "step": 9100 }, { "epoch": 40.4338785694483, "eval_loss": 6.413400650024414, "eval_runtime": 177.2258, "eval_samples_per_second": 56.425, "eval_steps_per_second": 3.527, "step": 9100 }, { "epoch": 40.87746049348489, "grad_norm": 0.45949310064315796, "learning_rate": 5.096989966555184e-06, "loss": 6.3938, "step": 9200 }, { "epoch": 40.87746049348489, "eval_loss": 6.4161882400512695, "eval_runtime": 176.173, "eval_samples_per_second": 56.762, "eval_steps_per_second": 3.548, "step": 9200 }, { "epoch": 41.32104241752148, "grad_norm": 0.2691323459148407, "learning_rate": 5.08695652173913e-06, "loss": 6.3943, "step": 9300 }, { "epoch": 41.32104241752148, "eval_loss": 6.41210412979126, "eval_runtime": 177.2828, "eval_samples_per_second": 56.407, "eval_steps_per_second": 3.525, "step": 9300 }, { "epoch": 41.76462434155808, "grad_norm": 0.6407902836799622, "learning_rate": 5.076923076923077e-06, "loss": 6.3939, "step": 9400 }, { "epoch": 41.76462434155808, "eval_loss": 6.41355562210083, "eval_runtime": 177.2932, "eval_samples_per_second": 56.404, "eval_steps_per_second": 3.525, "step": 9400 }, { "epoch": 42.208206265594676, "grad_norm": 0.3573991656303406, "learning_rate": 5.066889632107024e-06, "loss": 6.3938, "step": 9500 }, { "epoch": 42.208206265594676, "eval_loss": 6.415012836456299, "eval_runtime": 176.0231, "eval_samples_per_second": 56.811, "eval_steps_per_second": 3.551, "step": 9500 }, { "epoch": 42.651788189631276, "grad_norm": 0.5135132074356079, "learning_rate": 5.05685618729097e-06, "loss": 6.3933, "step": 9600 }, { "epoch": 42.651788189631276, "eval_loss": 6.413679122924805, "eval_runtime": 176.0231, "eval_samples_per_second": 56.811, "eval_steps_per_second": 3.551, "step": 9600 }, { "epoch": 43.09537011366787, "grad_norm": 0.6957016587257385, "learning_rate": 5.046822742474916e-06, "loss": 6.393, "step": 9700 }, { "epoch": 43.09537011366787, "eval_loss": 6.414681434631348, "eval_runtime": 176.1102, "eval_samples_per_second": 56.783, "eval_steps_per_second": 3.549, "step": 9700 }, { "epoch": 43.53895203770446, "grad_norm": 0.6068916916847229, "learning_rate": 5.036789297658863e-06, "loss": 6.3921, "step": 9800 }, { "epoch": 43.53895203770446, "eval_loss": 6.4130144119262695, "eval_runtime": 176.7572, "eval_samples_per_second": 56.575, "eval_steps_per_second": 3.536, "step": 9800 }, { "epoch": 43.98253396174106, "grad_norm": 0.5968314409255981, "learning_rate": 5.02675585284281e-06, "loss": 6.3925, "step": 9900 }, { "epoch": 43.98253396174106, "eval_loss": 6.410362720489502, "eval_runtime": 176.0642, "eval_samples_per_second": 56.797, "eval_steps_per_second": 3.55, "step": 9900 }, { "epoch": 44.426115885777655, "grad_norm": 0.4509466886520386, "learning_rate": 5.016722408026756e-06, "loss": 6.391, "step": 10000 }, { "epoch": 44.426115885777655, "eval_loss": 6.412291526794434, "eval_runtime": 176.0769, "eval_samples_per_second": 56.793, "eval_steps_per_second": 3.55, "step": 10000 }, { "epoch": 90.17099135063206, "grad_norm": 0.6186116337776184, "learning_rate": 5.0066889632107026e-06, "loss": 6.391, "step": 10100 }, { "epoch": 90.17099135063206, "eval_loss": 6.412010192871094, "eval_runtime": 89.0077, "eval_samples_per_second": 112.35, "eval_steps_per_second": 3.517, "step": 10100 }, { "epoch": 91.05810601020183, "grad_norm": 0.5779035687446594, "learning_rate": 4.996655518394649e-06, "loss": 6.3897, "step": 10200 }, { "epoch": 91.05810601020183, "eval_loss": 6.411357879638672, "eval_runtime": 88.2289, "eval_samples_per_second": 113.342, "eval_steps_per_second": 3.548, "step": 10200 }, { "epoch": 91.94522066977157, "grad_norm": 0.4683433473110199, "learning_rate": 4.986622073578595e-06, "loss": 6.3909, "step": 10300 }, { "epoch": 91.94522066977157, "eval_loss": 6.40939998626709, "eval_runtime": 88.21, "eval_samples_per_second": 113.366, "eval_steps_per_second": 3.548, "step": 10300 }, { "epoch": 92.83233532934132, "grad_norm": 0.32136374711990356, "learning_rate": 4.976588628762542e-06, "loss": 6.3902, "step": 10400 }, { "epoch": 92.83233532934132, "eval_loss": 6.409432888031006, "eval_runtime": 88.5101, "eval_samples_per_second": 112.982, "eval_steps_per_second": 3.536, "step": 10400 }, { "epoch": 93.71944998891107, "grad_norm": 0.536392092704773, "learning_rate": 4.966555183946489e-06, "loss": 6.3899, "step": 10500 }, { "epoch": 93.71944998891107, "eval_loss": 6.4088335037231445, "eval_runtime": 88.2323, "eval_samples_per_second": 113.337, "eval_steps_per_second": 3.547, "step": 10500 }, { "epoch": 94.60656464848081, "grad_norm": 0.36826851963996887, "learning_rate": 4.956521739130435e-06, "loss": 6.3894, "step": 10600 }, { "epoch": 94.60656464848081, "eval_loss": 6.412118434906006, "eval_runtime": 89.0058, "eval_samples_per_second": 112.352, "eval_steps_per_second": 3.517, "step": 10600 }, { "epoch": 95.49367930805056, "grad_norm": 0.37616053223609924, "learning_rate": 4.9464882943143815e-06, "loss": 6.3882, "step": 10700 }, { "epoch": 95.49367930805056, "eval_loss": 6.4095306396484375, "eval_runtime": 88.2076, "eval_samples_per_second": 113.369, "eval_steps_per_second": 3.548, "step": 10700 }, { "epoch": 96.38079396762032, "grad_norm": 0.5474613904953003, "learning_rate": 4.936454849498328e-06, "loss": 6.3889, "step": 10800 }, { "epoch": 96.38079396762032, "eval_loss": 6.411876678466797, "eval_runtime": 88.2153, "eval_samples_per_second": 113.359, "eval_steps_per_second": 3.548, "step": 10800 }, { "epoch": 97.26790862719007, "grad_norm": 0.5602962970733643, "learning_rate": 4.926421404682274e-06, "loss": 6.3891, "step": 10900 }, { "epoch": 97.26790862719007, "eval_loss": 6.408635139465332, "eval_runtime": 88.9688, "eval_samples_per_second": 112.399, "eval_steps_per_second": 3.518, "step": 10900 }, { "epoch": 98.15502328675981, "grad_norm": 0.46944743394851685, "learning_rate": 4.916387959866221e-06, "loss": 6.388, "step": 11000 }, { "epoch": 98.15502328675981, "eval_loss": 6.408023834228516, "eval_runtime": 89.0299, "eval_samples_per_second": 112.322, "eval_steps_per_second": 3.516, "step": 11000 }, { "epoch": 99.04213794632956, "grad_norm": 0.5612199306488037, "learning_rate": 4.906354515050168e-06, "loss": 6.388, "step": 11100 }, { "epoch": 99.04213794632956, "eval_loss": 6.408627510070801, "eval_runtime": 89.0002, "eval_samples_per_second": 112.359, "eval_steps_per_second": 3.517, "step": 11100 }, { "epoch": 99.92925260589931, "grad_norm": 0.5043811798095703, "learning_rate": 4.8963210702341136e-06, "loss": 6.3866, "step": 11200 }, { "epoch": 99.92925260589931, "eval_loss": 6.4089789390563965, "eval_runtime": 89.0751, "eval_samples_per_second": 112.265, "eval_steps_per_second": 3.514, "step": 11200 }, { "epoch": 100.81636726546907, "grad_norm": 0.5718743205070496, "learning_rate": 4.88628762541806e-06, "loss": 6.3872, "step": 11300 }, { "epoch": 100.81636726546907, "eval_loss": 6.405999183654785, "eval_runtime": 88.2069, "eval_samples_per_second": 113.37, "eval_steps_per_second": 3.548, "step": 11300 }, { "epoch": 101.70348192503882, "grad_norm": 0.5030497312545776, "learning_rate": 4.876254180602007e-06, "loss": 6.3869, "step": 11400 }, { "epoch": 101.70348192503882, "eval_loss": 6.408895969390869, "eval_runtime": 88.2117, "eval_samples_per_second": 113.364, "eval_steps_per_second": 3.548, "step": 11400 }, { "epoch": 102.59059658460856, "grad_norm": 0.3895309269428253, "learning_rate": 4.866220735785953e-06, "loss": 6.3866, "step": 11500 }, { "epoch": 102.59059658460856, "eval_loss": 6.408517360687256, "eval_runtime": 88.1944, "eval_samples_per_second": 113.386, "eval_steps_per_second": 3.549, "step": 11500 }, { "epoch": 103.47771124417831, "grad_norm": 0.3549971282482147, "learning_rate": 4.8561872909699e-06, "loss": 6.3865, "step": 11600 }, { "epoch": 103.47771124417831, "eval_loss": 6.409358501434326, "eval_runtime": 88.1985, "eval_samples_per_second": 113.381, "eval_steps_per_second": 3.549, "step": 11600 }, { "epoch": 104.36482590374806, "grad_norm": 0.3515787720680237, "learning_rate": 4.8461538461538465e-06, "loss": 6.3861, "step": 11700 }, { "epoch": 104.36482590374806, "eval_loss": 6.409560203552246, "eval_runtime": 88.565, "eval_samples_per_second": 112.911, "eval_steps_per_second": 3.534, "step": 11700 }, { "epoch": 105.2519405633178, "grad_norm": 0.5682891011238098, "learning_rate": 4.8361204013377925e-06, "loss": 6.3863, "step": 11800 }, { "epoch": 105.2519405633178, "eval_loss": 6.405972480773926, "eval_runtime": 89.025, "eval_samples_per_second": 112.328, "eval_steps_per_second": 3.516, "step": 11800 }, { "epoch": 106.13905522288756, "grad_norm": 0.3571348488330841, "learning_rate": 4.826086956521739e-06, "loss": 6.385, "step": 11900 }, { "epoch": 106.13905522288756, "eval_loss": 6.399210453033447, "eval_runtime": 88.4184, "eval_samples_per_second": 113.099, "eval_steps_per_second": 3.54, "step": 11900 }, { "epoch": 107.02616988245731, "grad_norm": 0.4465329647064209, "learning_rate": 4.816053511705686e-06, "loss": 6.3854, "step": 12000 }, { "epoch": 107.02616988245731, "eval_loss": 6.4048357009887695, "eval_runtime": 88.2058, "eval_samples_per_second": 113.371, "eval_steps_per_second": 3.549, "step": 12000 }, { "epoch": 107.91328454202706, "grad_norm": 0.3734528422355652, "learning_rate": 4.806020066889633e-06, "loss": 6.3857, "step": 12100 }, { "epoch": 107.91328454202706, "eval_loss": 6.401259422302246, "eval_runtime": 88.9844, "eval_samples_per_second": 112.379, "eval_steps_per_second": 3.517, "step": 12100 }, { "epoch": 108.8003992015968, "grad_norm": 0.48566725850105286, "learning_rate": 4.795986622073579e-06, "loss": 6.3849, "step": 12200 }, { "epoch": 108.8003992015968, "eval_loss": 6.406267166137695, "eval_runtime": 89.0118, "eval_samples_per_second": 112.345, "eval_steps_per_second": 3.516, "step": 12200 }, { "epoch": 109.68751386116655, "grad_norm": 0.35902583599090576, "learning_rate": 4.785953177257525e-06, "loss": 6.3846, "step": 12300 }, { "epoch": 109.68751386116655, "eval_loss": 6.407033443450928, "eval_runtime": 88.9668, "eval_samples_per_second": 112.401, "eval_steps_per_second": 3.518, "step": 12300 }, { "epoch": 110.57462852073631, "grad_norm": 0.6619898676872253, "learning_rate": 4.775919732441472e-06, "loss": 6.3849, "step": 12400 }, { "epoch": 110.57462852073631, "eval_loss": 6.399672031402588, "eval_runtime": 88.1986, "eval_samples_per_second": 113.381, "eval_steps_per_second": 3.549, "step": 12400 }, { "epoch": 111.46174318030606, "grad_norm": 0.4180016815662384, "learning_rate": 4.765886287625418e-06, "loss": 6.3834, "step": 12500 }, { "epoch": 111.46174318030606, "eval_loss": 6.401187419891357, "eval_runtime": 88.2008, "eval_samples_per_second": 113.378, "eval_steps_per_second": 3.549, "step": 12500 }, { "epoch": 112.3488578398758, "grad_norm": 0.4805915951728821, "learning_rate": 4.755852842809365e-06, "loss": 6.3847, "step": 12600 }, { "epoch": 112.3488578398758, "eval_loss": 6.398319721221924, "eval_runtime": 88.2116, "eval_samples_per_second": 113.364, "eval_steps_per_second": 3.548, "step": 12600 }, { "epoch": 113.23597249944555, "grad_norm": 0.5308820009231567, "learning_rate": 4.745819397993312e-06, "loss": 6.3833, "step": 12700 }, { "epoch": 113.23597249944555, "eval_loss": 6.403678894042969, "eval_runtime": 89.0114, "eval_samples_per_second": 112.345, "eval_steps_per_second": 3.516, "step": 12700 }, { "epoch": 114.1230871590153, "grad_norm": 0.48248058557510376, "learning_rate": 4.7357859531772575e-06, "loss": 6.3829, "step": 12800 }, { "epoch": 114.1230871590153, "eval_loss": 6.405944347381592, "eval_runtime": 88.9912, "eval_samples_per_second": 112.371, "eval_steps_per_second": 3.517, "step": 12800 }, { "epoch": 115.01020181858505, "grad_norm": 0.3773874044418335, "learning_rate": 4.725752508361204e-06, "loss": 6.3829, "step": 12900 }, { "epoch": 115.01020181858505, "eval_loss": 6.401638031005859, "eval_runtime": 89.0327, "eval_samples_per_second": 112.318, "eval_steps_per_second": 3.516, "step": 12900 }, { "epoch": 115.8973164781548, "grad_norm": 0.3370400369167328, "learning_rate": 4.715719063545151e-06, "loss": 6.383, "step": 13000 }, { "epoch": 115.8973164781548, "eval_loss": 6.406683921813965, "eval_runtime": 88.2165, "eval_samples_per_second": 113.357, "eval_steps_per_second": 3.548, "step": 13000 }, { "epoch": 116.78443113772455, "grad_norm": 0.30239006876945496, "learning_rate": 4.705685618729097e-06, "loss": 6.3824, "step": 13100 }, { "epoch": 116.78443113772455, "eval_loss": 6.402139663696289, "eval_runtime": 88.197, "eval_samples_per_second": 113.382, "eval_steps_per_second": 3.549, "step": 13100 }, { "epoch": 117.6715457972943, "grad_norm": 0.5257315039634705, "learning_rate": 4.695652173913044e-06, "loss": 6.3825, "step": 13200 }, { "epoch": 117.6715457972943, "eval_loss": 6.398579120635986, "eval_runtime": 88.1944, "eval_samples_per_second": 113.386, "eval_steps_per_second": 3.549, "step": 13200 }, { "epoch": 118.55866045686405, "grad_norm": 0.32334333658218384, "learning_rate": 4.6856187290969905e-06, "loss": 6.3822, "step": 13300 }, { "epoch": 118.55866045686405, "eval_loss": 6.406438827514648, "eval_runtime": 88.2027, "eval_samples_per_second": 113.375, "eval_steps_per_second": 3.549, "step": 13300 }, { "epoch": 119.4457751164338, "grad_norm": 0.34099674224853516, "learning_rate": 4.675585284280936e-06, "loss": 6.3817, "step": 13400 }, { "epoch": 119.4457751164338, "eval_loss": 6.404513835906982, "eval_runtime": 88.1855, "eval_samples_per_second": 113.397, "eval_steps_per_second": 3.549, "step": 13400 }, { "epoch": 120.33288977600355, "grad_norm": 0.3633241653442383, "learning_rate": 4.665551839464883e-06, "loss": 6.3817, "step": 13500 }, { "epoch": 120.33288977600355, "eval_loss": 6.398531913757324, "eval_runtime": 88.9997, "eval_samples_per_second": 112.36, "eval_steps_per_second": 3.517, "step": 13500 }, { "epoch": 121.2200044355733, "grad_norm": 0.28118014335632324, "learning_rate": 4.65551839464883e-06, "loss": 6.3818, "step": 13600 }, { "epoch": 121.2200044355733, "eval_loss": 6.400463104248047, "eval_runtime": 88.2057, "eval_samples_per_second": 113.371, "eval_steps_per_second": 3.549, "step": 13600 }, { "epoch": 122.10711909514305, "grad_norm": 0.3721919655799866, "learning_rate": 4.645484949832776e-06, "loss": 6.3812, "step": 13700 }, { "epoch": 122.10711909514305, "eval_loss": 6.405807971954346, "eval_runtime": 88.4667, "eval_samples_per_second": 113.037, "eval_steps_per_second": 3.538, "step": 13700 }, { "epoch": 122.9942337547128, "grad_norm": 0.3147549033164978, "learning_rate": 4.635451505016723e-06, "loss": 6.3814, "step": 13800 }, { "epoch": 122.9942337547128, "eval_loss": 6.402772426605225, "eval_runtime": 89.0204, "eval_samples_per_second": 112.334, "eval_steps_per_second": 3.516, "step": 13800 }, { "epoch": 123.88134841428254, "grad_norm": 0.21372230350971222, "learning_rate": 4.625418060200669e-06, "loss": 6.3804, "step": 13900 }, { "epoch": 123.88134841428254, "eval_loss": 6.403747081756592, "eval_runtime": 88.2131, "eval_samples_per_second": 113.362, "eval_steps_per_second": 3.548, "step": 13900 }, { "epoch": 124.76846307385229, "grad_norm": 0.3438258767127991, "learning_rate": 4.615384615384616e-06, "loss": 6.3814, "step": 14000 }, { "epoch": 124.76846307385229, "eval_loss": 6.397274494171143, "eval_runtime": 88.1984, "eval_samples_per_second": 113.381, "eval_steps_per_second": 3.549, "step": 14000 }, { "epoch": 125.65557773342205, "grad_norm": 0.22329987585544586, "learning_rate": 4.605351170568562e-06, "loss": 6.3806, "step": 14100 }, { "epoch": 125.65557773342205, "eval_loss": 6.4013991355896, "eval_runtime": 88.1883, "eval_samples_per_second": 113.394, "eval_steps_per_second": 3.549, "step": 14100 }, { "epoch": 126.5426923929918, "grad_norm": 0.4979691803455353, "learning_rate": 4.595317725752509e-06, "loss": 6.3806, "step": 14200 }, { "epoch": 126.5426923929918, "eval_loss": 6.398404121398926, "eval_runtime": 88.1886, "eval_samples_per_second": 113.393, "eval_steps_per_second": 3.549, "step": 14200 }, { "epoch": 127.42980705256154, "grad_norm": 0.3812222182750702, "learning_rate": 4.585284280936456e-06, "loss": 6.3797, "step": 14300 }, { "epoch": 127.42980705256154, "eval_loss": 6.403315544128418, "eval_runtime": 88.1816, "eval_samples_per_second": 113.402, "eval_steps_per_second": 3.549, "step": 14300 }, { "epoch": 128.3169217121313, "grad_norm": 0.33830001950263977, "learning_rate": 4.5752508361204015e-06, "loss": 6.38, "step": 14400 }, { "epoch": 128.3169217121313, "eval_loss": 6.399970054626465, "eval_runtime": 88.3617, "eval_samples_per_second": 113.171, "eval_steps_per_second": 3.542, "step": 14400 }, { "epoch": 129.20403637170105, "grad_norm": 0.41163602471351624, "learning_rate": 4.565217391304348e-06, "loss": 6.3801, "step": 14500 }, { "epoch": 129.20403637170105, "eval_loss": 6.398497581481934, "eval_runtime": 88.9909, "eval_samples_per_second": 112.371, "eval_steps_per_second": 3.517, "step": 14500 }, { "epoch": 130.09115103127078, "grad_norm": 0.3605528771877289, "learning_rate": 4.555183946488295e-06, "loss": 6.3795, "step": 14600 }, { "epoch": 130.09115103127078, "eval_loss": 6.401362419128418, "eval_runtime": 88.9771, "eval_samples_per_second": 112.388, "eval_steps_per_second": 3.518, "step": 14600 }, { "epoch": 130.97826569084054, "grad_norm": 0.2761962115764618, "learning_rate": 4.545150501672241e-06, "loss": 6.38, "step": 14700 }, { "epoch": 130.97826569084054, "eval_loss": 6.400545120239258, "eval_runtime": 88.9856, "eval_samples_per_second": 112.378, "eval_steps_per_second": 3.517, "step": 14700 }, { "epoch": 131.86538035041028, "grad_norm": 0.365429162979126, "learning_rate": 4.535117056856188e-06, "loss": 6.3792, "step": 14800 }, { "epoch": 131.86538035041028, "eval_loss": 6.398355484008789, "eval_runtime": 88.1678, "eval_samples_per_second": 113.42, "eval_steps_per_second": 3.55, "step": 14800 }, { "epoch": 132.75249500998004, "grad_norm": 0.38731637597084045, "learning_rate": 4.5250836120401345e-06, "loss": 6.3786, "step": 14900 }, { "epoch": 132.75249500998004, "eval_loss": 6.404902458190918, "eval_runtime": 88.9734, "eval_samples_per_second": 112.393, "eval_steps_per_second": 3.518, "step": 14900 }, { "epoch": 133.6396096695498, "grad_norm": 0.4588160514831543, "learning_rate": 4.51505016722408e-06, "loss": 6.3786, "step": 15000 }, { "epoch": 133.6396096695498, "eval_loss": 6.4006571769714355, "eval_runtime": 88.1689, "eval_samples_per_second": 113.419, "eval_steps_per_second": 3.55, "step": 15000 }, { "epoch": 134.52672432911953, "grad_norm": 0.36677706241607666, "learning_rate": 4.505016722408027e-06, "loss": 6.3781, "step": 15100 }, { "epoch": 134.52672432911953, "eval_loss": 6.399155616760254, "eval_runtime": 88.1918, "eval_samples_per_second": 113.389, "eval_steps_per_second": 3.549, "step": 15100 }, { "epoch": 135.4138389886893, "grad_norm": 0.45701250433921814, "learning_rate": 4.494983277591973e-06, "loss": 6.3784, "step": 15200 }, { "epoch": 135.4138389886893, "eval_loss": 6.398295879364014, "eval_runtime": 88.4103, "eval_samples_per_second": 113.109, "eval_steps_per_second": 3.54, "step": 15200 }, { "epoch": 136.30095364825902, "grad_norm": 0.325771689414978, "learning_rate": 4.48494983277592e-06, "loss": 6.3782, "step": 15300 }, { "epoch": 136.30095364825902, "eval_loss": 6.395936489105225, "eval_runtime": 88.9861, "eval_samples_per_second": 112.377, "eval_steps_per_second": 3.517, "step": 15300 }, { "epoch": 137.1880683078288, "grad_norm": 0.4405640959739685, "learning_rate": 4.474916387959866e-06, "loss": 6.3787, "step": 15400 }, { "epoch": 137.1880683078288, "eval_loss": 6.403024196624756, "eval_runtime": 89.0043, "eval_samples_per_second": 112.354, "eval_steps_per_second": 3.517, "step": 15400 }, { "epoch": 138.07518296739855, "grad_norm": 0.38074126839637756, "learning_rate": 4.4648829431438125e-06, "loss": 6.3784, "step": 15500 }, { "epoch": 138.07518296739855, "eval_loss": 6.396382808685303, "eval_runtime": 89.0099, "eval_samples_per_second": 112.347, "eval_steps_per_second": 3.516, "step": 15500 }, { "epoch": 138.96229762696828, "grad_norm": 0.3605077862739563, "learning_rate": 4.454849498327759e-06, "loss": 6.3776, "step": 15600 }, { "epoch": 138.96229762696828, "eval_loss": 6.398861885070801, "eval_runtime": 88.1985, "eval_samples_per_second": 113.381, "eval_steps_per_second": 3.549, "step": 15600 }, { "epoch": 139.84941228653804, "grad_norm": 0.3661845028400421, "learning_rate": 4.444816053511705e-06, "loss": 6.3783, "step": 15700 }, { "epoch": 139.84941228653804, "eval_loss": 6.395369529724121, "eval_runtime": 88.2035, "eval_samples_per_second": 113.374, "eval_steps_per_second": 3.549, "step": 15700 }, { "epoch": 140.73652694610777, "grad_norm": 0.30928805470466614, "learning_rate": 4.434782608695652e-06, "loss": 6.3774, "step": 15800 }, { "epoch": 140.73652694610777, "eval_loss": 6.397764682769775, "eval_runtime": 88.2064, "eval_samples_per_second": 113.37, "eval_steps_per_second": 3.548, "step": 15800 }, { "epoch": 141.62364160567753, "grad_norm": 0.2911752462387085, "learning_rate": 4.424749163879599e-06, "loss": 6.3774, "step": 15900 }, { "epoch": 141.62364160567753, "eval_loss": 6.392827033996582, "eval_runtime": 88.2018, "eval_samples_per_second": 113.376, "eval_steps_per_second": 3.549, "step": 15900 }, { "epoch": 142.5107562652473, "grad_norm": 0.36379653215408325, "learning_rate": 4.414715719063545e-06, "loss": 6.3769, "step": 16000 }, { "epoch": 142.5107562652473, "eval_loss": 6.394837379455566, "eval_runtime": 88.1516, "eval_samples_per_second": 113.441, "eval_steps_per_second": 3.551, "step": 16000 }, { "epoch": 143.39787092481703, "grad_norm": 0.3171352744102478, "learning_rate": 4.404682274247491e-06, "loss": 6.3775, "step": 16100 }, { "epoch": 143.39787092481703, "eval_loss": 6.400154113769531, "eval_runtime": 89.0041, "eval_samples_per_second": 112.354, "eval_steps_per_second": 3.517, "step": 16100 }, { "epoch": 144.2849855843868, "grad_norm": 0.28629449009895325, "learning_rate": 4.394648829431438e-06, "loss": 6.3759, "step": 16200 }, { "epoch": 144.2849855843868, "eval_loss": 6.39397668838501, "eval_runtime": 88.9886, "eval_samples_per_second": 112.374, "eval_steps_per_second": 3.517, "step": 16200 }, { "epoch": 145.17210024395652, "grad_norm": 0.20145787298679352, "learning_rate": 4.384615384615384e-06, "loss": 6.3771, "step": 16300 }, { "epoch": 145.17210024395652, "eval_loss": 6.394731521606445, "eval_runtime": 88.9884, "eval_samples_per_second": 112.374, "eval_steps_per_second": 3.517, "step": 16300 }, { "epoch": 146.05921490352628, "grad_norm": 0.3465804159641266, "learning_rate": 4.374581939799331e-06, "loss": 6.3773, "step": 16400 }, { "epoch": 146.05921490352628, "eval_loss": 6.397264003753662, "eval_runtime": 88.9701, "eval_samples_per_second": 112.397, "eval_steps_per_second": 3.518, "step": 16400 }, { "epoch": 146.94632956309604, "grad_norm": 0.37951675057411194, "learning_rate": 4.364548494983278e-06, "loss": 6.3765, "step": 16500 }, { "epoch": 146.94632956309604, "eval_loss": 6.393067359924316, "eval_runtime": 88.2113, "eval_samples_per_second": 113.364, "eval_steps_per_second": 3.548, "step": 16500 }, { "epoch": 147.83344422266578, "grad_norm": 0.28946706652641296, "learning_rate": 4.354515050167224e-06, "loss": 6.3766, "step": 16600 }, { "epoch": 147.83344422266578, "eval_loss": 6.395288467407227, "eval_runtime": 88.2164, "eval_samples_per_second": 113.358, "eval_steps_per_second": 3.548, "step": 16600 }, { "epoch": 148.72055888223554, "grad_norm": 0.33570635318756104, "learning_rate": 4.34448160535117e-06, "loss": 6.3766, "step": 16700 }, { "epoch": 148.72055888223554, "eval_loss": 6.3955864906311035, "eval_runtime": 88.202, "eval_samples_per_second": 113.376, "eval_steps_per_second": 3.549, "step": 16700 }, { "epoch": 149.60767354180527, "grad_norm": 0.2830164134502411, "learning_rate": 4.334448160535117e-06, "loss": 6.3765, "step": 16800 }, { "epoch": 149.60767354180527, "eval_loss": 6.393207550048828, "eval_runtime": 88.1971, "eval_samples_per_second": 113.382, "eval_steps_per_second": 3.549, "step": 16800 }, { "epoch": 150.49478820137503, "grad_norm": 0.3951200544834137, "learning_rate": 4.324414715719064e-06, "loss": 6.3754, "step": 16900 }, { "epoch": 150.49478820137503, "eval_loss": 6.3931732177734375, "eval_runtime": 88.1964, "eval_samples_per_second": 113.383, "eval_steps_per_second": 3.549, "step": 16900 }, { "epoch": 151.3819028609448, "grad_norm": 0.40401121973991394, "learning_rate": 4.31438127090301e-06, "loss": 6.3767, "step": 17000 }, { "epoch": 151.3819028609448, "eval_loss": 6.395325183868408, "eval_runtime": 89.0101, "eval_samples_per_second": 112.347, "eval_steps_per_second": 3.516, "step": 17000 }, { "epoch": 152.26901752051452, "grad_norm": 0.35907265543937683, "learning_rate": 4.3043478260869565e-06, "loss": 6.3756, "step": 17100 }, { "epoch": 152.26901752051452, "eval_loss": 6.391872882843018, "eval_runtime": 88.9952, "eval_samples_per_second": 112.366, "eval_steps_per_second": 3.517, "step": 17100 }, { "epoch": 153.15613218008428, "grad_norm": 0.20859681069850922, "learning_rate": 4.294314381270903e-06, "loss": 6.376, "step": 17200 }, { "epoch": 153.15613218008428, "eval_loss": 6.389963150024414, "eval_runtime": 95.4338, "eval_samples_per_second": 104.785, "eval_steps_per_second": 3.28, "step": 17200 }, { "epoch": 154.04324683965402, "grad_norm": 0.23594261705875397, "learning_rate": 4.284280936454849e-06, "loss": 6.3755, "step": 17300 }, { "epoch": 154.04324683965402, "eval_loss": 6.392347812652588, "eval_runtime": 88.9816, "eval_samples_per_second": 112.383, "eval_steps_per_second": 3.518, "step": 17300 }, { "epoch": 154.93036149922378, "grad_norm": 0.38356783986091614, "learning_rate": 4.274247491638796e-06, "loss": 6.3754, "step": 17400 }, { "epoch": 154.93036149922378, "eval_loss": 6.3949875831604, "eval_runtime": 88.1932, "eval_samples_per_second": 113.387, "eval_steps_per_second": 3.549, "step": 17400 }, { "epoch": 155.8174761587935, "grad_norm": 0.48420754075050354, "learning_rate": 4.264214046822743e-06, "loss": 6.3755, "step": 17500 }, { "epoch": 155.8174761587935, "eval_loss": 6.391012668609619, "eval_runtime": 88.1801, "eval_samples_per_second": 113.404, "eval_steps_per_second": 3.55, "step": 17500 }, { "epoch": 156.70459081836327, "grad_norm": 0.2329307347536087, "learning_rate": 4.254180602006689e-06, "loss": 6.3749, "step": 17600 }, { "epoch": 156.70459081836327, "eval_loss": 6.396329879760742, "eval_runtime": 88.202, "eval_samples_per_second": 113.376, "eval_steps_per_second": 3.549, "step": 17600 }, { "epoch": 157.59170547793303, "grad_norm": 0.3357428312301636, "learning_rate": 4.244147157190635e-06, "loss": 6.3742, "step": 17700 }, { "epoch": 157.59170547793303, "eval_loss": 6.396499156951904, "eval_runtime": 88.2077, "eval_samples_per_second": 113.369, "eval_steps_per_second": 3.548, "step": 17700 }, { "epoch": 158.47882013750277, "grad_norm": 0.34573179483413696, "learning_rate": 4.234113712374582e-06, "loss": 6.3751, "step": 17800 }, { "epoch": 158.47882013750277, "eval_loss": 6.397115707397461, "eval_runtime": 89.0011, "eval_samples_per_second": 112.358, "eval_steps_per_second": 3.517, "step": 17800 }, { "epoch": 159.36593479707253, "grad_norm": 0.2784799039363861, "learning_rate": 4.224080267558528e-06, "loss": 6.3746, "step": 17900 }, { "epoch": 159.36593479707253, "eval_loss": 6.3902907371521, "eval_runtime": 88.9792, "eval_samples_per_second": 112.386, "eval_steps_per_second": 3.518, "step": 17900 }, { "epoch": 160.25304945664226, "grad_norm": 0.3247807025909424, "learning_rate": 4.214046822742475e-06, "loss": 6.3752, "step": 18000 }, { "epoch": 160.25304945664226, "eval_loss": 6.3876519203186035, "eval_runtime": 88.2968, "eval_samples_per_second": 113.254, "eval_steps_per_second": 3.545, "step": 18000 }, { "epoch": 161.14016411621202, "grad_norm": 0.34148281812667847, "learning_rate": 4.2040133779264216e-06, "loss": 6.3743, "step": 18100 }, { "epoch": 161.14016411621202, "eval_loss": 6.394918918609619, "eval_runtime": 88.2131, "eval_samples_per_second": 113.362, "eval_steps_per_second": 3.548, "step": 18100 }, { "epoch": 162.02727877578178, "grad_norm": 0.26453569531440735, "learning_rate": 4.1939799331103675e-06, "loss": 6.3745, "step": 18200 }, { "epoch": 162.02727877578178, "eval_loss": 6.392609596252441, "eval_runtime": 88.4146, "eval_samples_per_second": 113.104, "eval_steps_per_second": 3.54, "step": 18200 }, { "epoch": 162.9143934353515, "grad_norm": 0.3914986848831177, "learning_rate": 4.183946488294314e-06, "loss": 6.373, "step": 18300 }, { "epoch": 162.9143934353515, "eval_loss": 6.394564628601074, "eval_runtime": 89.0398, "eval_samples_per_second": 112.309, "eval_steps_per_second": 3.515, "step": 18300 }, { "epoch": 163.80150809492127, "grad_norm": 0.28945302963256836, "learning_rate": 4.173913043478261e-06, "loss": 6.3742, "step": 18400 }, { "epoch": 163.80150809492127, "eval_loss": 6.388834476470947, "eval_runtime": 88.9988, "eval_samples_per_second": 112.361, "eval_steps_per_second": 3.517, "step": 18400 }, { "epoch": 164.688622754491, "grad_norm": 0.3480592370033264, "learning_rate": 4.163879598662208e-06, "loss": 6.3744, "step": 18500 }, { "epoch": 164.688622754491, "eval_loss": 6.389362335205078, "eval_runtime": 88.197, "eval_samples_per_second": 113.383, "eval_steps_per_second": 3.549, "step": 18500 }, { "epoch": 165.57573741406077, "grad_norm": 0.3804326355457306, "learning_rate": 4.153846153846154e-06, "loss": 6.3738, "step": 18600 }, { "epoch": 165.57573741406077, "eval_loss": 6.391166687011719, "eval_runtime": 88.1914, "eval_samples_per_second": 113.39, "eval_steps_per_second": 3.549, "step": 18600 }, { "epoch": 166.46285207363053, "grad_norm": 0.3824601471424103, "learning_rate": 4.1438127090301005e-06, "loss": 6.3739, "step": 18700 }, { "epoch": 166.46285207363053, "eval_loss": 6.391639709472656, "eval_runtime": 89.0022, "eval_samples_per_second": 112.357, "eval_steps_per_second": 3.517, "step": 18700 }, { "epoch": 167.34996673320026, "grad_norm": 0.5406671762466431, "learning_rate": 4.133779264214047e-06, "loss": 6.3745, "step": 18800 }, { "epoch": 167.34996673320026, "eval_loss": 6.395472049713135, "eval_runtime": 89.0201, "eval_samples_per_second": 112.334, "eval_steps_per_second": 3.516, "step": 18800 }, { "epoch": 168.23708139277002, "grad_norm": 0.2246076464653015, "learning_rate": 4.123745819397993e-06, "loss": 6.3732, "step": 18900 }, { "epoch": 168.23708139277002, "eval_loss": 6.391103744506836, "eval_runtime": 89.0121, "eval_samples_per_second": 112.344, "eval_steps_per_second": 3.516, "step": 18900 }, { "epoch": 169.12419605233976, "grad_norm": 0.2771269977092743, "learning_rate": 4.11371237458194e-06, "loss": 6.3734, "step": 19000 }, { "epoch": 169.12419605233976, "eval_loss": 6.390963077545166, "eval_runtime": 88.1853, "eval_samples_per_second": 113.398, "eval_steps_per_second": 3.549, "step": 19000 }, { "epoch": 170.01131071190952, "grad_norm": 0.2982538640499115, "learning_rate": 4.103678929765887e-06, "loss": 6.3746, "step": 19100 }, { "epoch": 170.01131071190952, "eval_loss": 6.398984432220459, "eval_runtime": 88.1945, "eval_samples_per_second": 113.386, "eval_steps_per_second": 3.549, "step": 19100 }, { "epoch": 170.89842537147928, "grad_norm": 0.22554722428321838, "learning_rate": 4.0936454849498326e-06, "loss": 6.3732, "step": 19200 }, { "epoch": 170.89842537147928, "eval_loss": 6.391036033630371, "eval_runtime": 88.1888, "eval_samples_per_second": 113.393, "eval_steps_per_second": 3.549, "step": 19200 }, { "epoch": 171.785540031049, "grad_norm": 0.3837653398513794, "learning_rate": 4.083612040133779e-06, "loss": 6.374, "step": 19300 }, { "epoch": 171.785540031049, "eval_loss": 6.392332553863525, "eval_runtime": 88.1841, "eval_samples_per_second": 113.399, "eval_steps_per_second": 3.549, "step": 19300 }, { "epoch": 172.67265469061877, "grad_norm": 0.4505990445613861, "learning_rate": 4.073578595317726e-06, "loss": 6.3736, "step": 19400 }, { "epoch": 172.67265469061877, "eval_loss": 6.393078327178955, "eval_runtime": 88.1837, "eval_samples_per_second": 113.4, "eval_steps_per_second": 3.549, "step": 19400 }, { "epoch": 173.5597693501885, "grad_norm": 0.2350095808506012, "learning_rate": 4.063545150501672e-06, "loss": 6.3729, "step": 19500 }, { "epoch": 173.5597693501885, "eval_loss": 6.391619682312012, "eval_runtime": 88.1784, "eval_samples_per_second": 113.406, "eval_steps_per_second": 3.55, "step": 19500 }, { "epoch": 174.44688400975826, "grad_norm": 0.36420518159866333, "learning_rate": 4.053511705685619e-06, "loss": 6.373, "step": 19600 }, { "epoch": 174.44688400975826, "eval_loss": 6.386290550231934, "eval_runtime": 88.1738, "eval_samples_per_second": 113.412, "eval_steps_per_second": 3.55, "step": 19600 }, { "epoch": 175.333998669328, "grad_norm": 0.4323490560054779, "learning_rate": 4.0434782608695655e-06, "loss": 6.3731, "step": 19700 }, { "epoch": 175.333998669328, "eval_loss": 6.385765075683594, "eval_runtime": 89.0281, "eval_samples_per_second": 112.324, "eval_steps_per_second": 3.516, "step": 19700 }, { "epoch": 176.22111332889776, "grad_norm": 0.37750956416130066, "learning_rate": 4.0334448160535115e-06, "loss": 6.373, "step": 19800 }, { "epoch": 176.22111332889776, "eval_loss": 6.3935017585754395, "eval_runtime": 88.1584, "eval_samples_per_second": 113.432, "eval_steps_per_second": 3.55, "step": 19800 }, { "epoch": 177.10822798846752, "grad_norm": 0.28360995650291443, "learning_rate": 4.023411371237458e-06, "loss": 6.3736, "step": 19900 }, { "epoch": 177.10822798846752, "eval_loss": 6.388575077056885, "eval_runtime": 88.1723, "eval_samples_per_second": 113.414, "eval_steps_per_second": 3.55, "step": 19900 }, { "epoch": 177.99534264803725, "grad_norm": 0.2375970482826233, "learning_rate": 4.013377926421405e-06, "loss": 6.3722, "step": 20000 }, { "epoch": 177.99534264803725, "eval_loss": 6.387614727020264, "eval_runtime": 88.1835, "eval_samples_per_second": 113.4, "eval_steps_per_second": 3.549, "step": 20000 }, { "epoch": 178.882457307607, "grad_norm": 0.2644791901111603, "learning_rate": 4.003344481605351e-06, "loss": 6.3732, "step": 20100 }, { "epoch": 178.882457307607, "eval_loss": 6.388434410095215, "eval_runtime": 88.9803, "eval_samples_per_second": 112.384, "eval_steps_per_second": 3.518, "step": 20100 }, { "epoch": 179.76957196717674, "grad_norm": 0.3010362386703491, "learning_rate": 3.993311036789298e-06, "loss": 6.3723, "step": 20200 }, { "epoch": 179.76957196717674, "eval_loss": 6.388959884643555, "eval_runtime": 88.7132, "eval_samples_per_second": 112.723, "eval_steps_per_second": 3.528, "step": 20200 }, { "epoch": 180.6566866267465, "grad_norm": 0.33606797456741333, "learning_rate": 3.9832775919732444e-06, "loss": 6.3728, "step": 20300 }, { "epoch": 180.6566866267465, "eval_loss": 6.3911051750183105, "eval_runtime": 88.163, "eval_samples_per_second": 113.426, "eval_steps_per_second": 3.55, "step": 20300 }, { "epoch": 181.54380128631627, "grad_norm": 0.2511981725692749, "learning_rate": 3.97324414715719e-06, "loss": 6.3715, "step": 20400 }, { "epoch": 181.54380128631627, "eval_loss": 6.390799045562744, "eval_runtime": 88.9917, "eval_samples_per_second": 112.37, "eval_steps_per_second": 3.517, "step": 20400 }, { "epoch": 182.430915945886, "grad_norm": 0.4115006923675537, "learning_rate": 3.963210702341137e-06, "loss": 6.3722, "step": 20500 }, { "epoch": 182.430915945886, "eval_loss": 6.391343116760254, "eval_runtime": 89.0042, "eval_samples_per_second": 112.354, "eval_steps_per_second": 3.517, "step": 20500 }, { "epoch": 183.31803060545576, "grad_norm": 0.37600409984588623, "learning_rate": 3.953177257525084e-06, "loss": 6.3732, "step": 20600 }, { "epoch": 183.31803060545576, "eval_loss": 6.3869404792785645, "eval_runtime": 88.1885, "eval_samples_per_second": 113.393, "eval_steps_per_second": 3.549, "step": 20600 }, { "epoch": 184.2051452650255, "grad_norm": 0.2008831650018692, "learning_rate": 3.943143812709031e-06, "loss": 6.3717, "step": 20700 }, { "epoch": 184.2051452650255, "eval_loss": 6.388400077819824, "eval_runtime": 89.0024, "eval_samples_per_second": 112.357, "eval_steps_per_second": 3.517, "step": 20700 }, { "epoch": 185.09225992459525, "grad_norm": 0.2809048891067505, "learning_rate": 3.9331103678929765e-06, "loss": 6.3716, "step": 20800 }, { "epoch": 185.09225992459525, "eval_loss": 6.388489723205566, "eval_runtime": 89.025, "eval_samples_per_second": 112.328, "eval_steps_per_second": 3.516, "step": 20800 }, { "epoch": 185.97937458416501, "grad_norm": 0.3136514127254486, "learning_rate": 3.923076923076923e-06, "loss": 6.3722, "step": 20900 }, { "epoch": 185.97937458416501, "eval_loss": 6.38933801651001, "eval_runtime": 88.1827, "eval_samples_per_second": 113.401, "eval_steps_per_second": 3.549, "step": 20900 }, { "epoch": 186.86648924373475, "grad_norm": 0.3162117004394531, "learning_rate": 3.91304347826087e-06, "loss": 6.371, "step": 21000 }, { "epoch": 186.86648924373475, "eval_loss": 6.390033721923828, "eval_runtime": 88.1889, "eval_samples_per_second": 113.393, "eval_steps_per_second": 3.549, "step": 21000 }, { "epoch": 187.7536039033045, "grad_norm": 0.23877596855163574, "learning_rate": 3.903010033444816e-06, "loss": 6.3721, "step": 21100 }, { "epoch": 187.7536039033045, "eval_loss": 6.386390686035156, "eval_runtime": 88.199, "eval_samples_per_second": 113.38, "eval_steps_per_second": 3.549, "step": 21100 }, { "epoch": 188.64071856287424, "grad_norm": 0.2724982500076294, "learning_rate": 3.892976588628763e-06, "loss": 6.3721, "step": 21200 }, { "epoch": 188.64071856287424, "eval_loss": 6.392521858215332, "eval_runtime": 88.1971, "eval_samples_per_second": 113.382, "eval_steps_per_second": 3.549, "step": 21200 }, { "epoch": 189.527833222444, "grad_norm": 0.3006499707698822, "learning_rate": 3.8829431438127095e-06, "loss": 6.3718, "step": 21300 }, { "epoch": 189.527833222444, "eval_loss": 6.38844633102417, "eval_runtime": 89.0375, "eval_samples_per_second": 112.312, "eval_steps_per_second": 3.515, "step": 21300 }, { "epoch": 190.41494788201376, "grad_norm": 0.23349860310554504, "learning_rate": 3.8729096989966554e-06, "loss": 6.3721, "step": 21400 }, { "epoch": 190.41494788201376, "eval_loss": 6.385097503662109, "eval_runtime": 89.0004, "eval_samples_per_second": 112.359, "eval_steps_per_second": 3.517, "step": 21400 }, { "epoch": 191.3020625415835, "grad_norm": 0.23078705370426178, "learning_rate": 3.862876254180602e-06, "loss": 6.371, "step": 21500 }, { "epoch": 191.3020625415835, "eval_loss": 6.389979839324951, "eval_runtime": 88.1937, "eval_samples_per_second": 113.387, "eval_steps_per_second": 3.549, "step": 21500 }, { "epoch": 192.18917720115326, "grad_norm": 0.22322630882263184, "learning_rate": 3.852842809364549e-06, "loss": 6.3725, "step": 21600 }, { "epoch": 192.18917720115326, "eval_loss": 6.38612699508667, "eval_runtime": 89.0235, "eval_samples_per_second": 112.33, "eval_steps_per_second": 3.516, "step": 21600 }, { "epoch": 193.076291860723, "grad_norm": 0.34750744700431824, "learning_rate": 3.842809364548495e-06, "loss": 6.3708, "step": 21700 }, { "epoch": 193.076291860723, "eval_loss": 6.3872575759887695, "eval_runtime": 88.1897, "eval_samples_per_second": 113.392, "eval_steps_per_second": 3.549, "step": 21700 }, { "epoch": 193.96340652029275, "grad_norm": 0.22122953832149506, "learning_rate": 3.832775919732442e-06, "loss": 6.372, "step": 21800 }, { "epoch": 193.96340652029275, "eval_loss": 6.389639854431152, "eval_runtime": 88.1935, "eval_samples_per_second": 113.387, "eval_steps_per_second": 3.549, "step": 21800 }, { "epoch": 194.8505211798625, "grad_norm": 0.20957332849502563, "learning_rate": 3.822742474916388e-06, "loss": 6.3723, "step": 21900 }, { "epoch": 194.8505211798625, "eval_loss": 6.3914899826049805, "eval_runtime": 88.631, "eval_samples_per_second": 112.827, "eval_steps_per_second": 3.531, "step": 21900 }, { "epoch": 195.73763583943224, "grad_norm": 0.24526910483837128, "learning_rate": 3.8127090301003347e-06, "loss": 6.3713, "step": 22000 }, { "epoch": 195.73763583943224, "eval_loss": 6.390371799468994, "eval_runtime": 88.1852, "eval_samples_per_second": 113.398, "eval_steps_per_second": 3.549, "step": 22000 }, { "epoch": 196.624750499002, "grad_norm": 0.28146272897720337, "learning_rate": 3.802675585284281e-06, "loss": 6.3711, "step": 22100 }, { "epoch": 196.624750499002, "eval_loss": 6.388413906097412, "eval_runtime": 88.1826, "eval_samples_per_second": 113.401, "eval_steps_per_second": 3.549, "step": 22100 }, { "epoch": 197.51186515857174, "grad_norm": 0.42305833101272583, "learning_rate": 3.792642140468228e-06, "loss": 6.3712, "step": 22200 }, { "epoch": 197.51186515857174, "eval_loss": 6.388478755950928, "eval_runtime": 88.9985, "eval_samples_per_second": 112.361, "eval_steps_per_second": 3.517, "step": 22200 }, { "epoch": 198.3989798181415, "grad_norm": 0.2139986753463745, "learning_rate": 3.782608695652174e-06, "loss": 6.3705, "step": 22300 }, { "epoch": 198.3989798181415, "eval_loss": 6.390077114105225, "eval_runtime": 88.9954, "eval_samples_per_second": 112.365, "eval_steps_per_second": 3.517, "step": 22300 }, { "epoch": 199.28609447771123, "grad_norm": 0.28066742420196533, "learning_rate": 3.7725752508361205e-06, "loss": 6.3712, "step": 22400 }, { "epoch": 199.28609447771123, "eval_loss": 6.386248588562012, "eval_runtime": 88.1802, "eval_samples_per_second": 113.404, "eval_steps_per_second": 3.55, "step": 22400 }, { "epoch": 200.173209137281, "grad_norm": 0.30369654297828674, "learning_rate": 3.7625418060200673e-06, "loss": 6.3703, "step": 22500 }, { "epoch": 200.173209137281, "eval_loss": 6.390934944152832, "eval_runtime": 88.9996, "eval_samples_per_second": 112.36, "eval_steps_per_second": 3.517, "step": 22500 }, { "epoch": 201.06032379685075, "grad_norm": 0.2702006995677948, "learning_rate": 3.7525083612040136e-06, "loss": 6.3711, "step": 22600 }, { "epoch": 201.06032379685075, "eval_loss": 6.38742208480835, "eval_runtime": 88.1934, "eval_samples_per_second": 113.387, "eval_steps_per_second": 3.549, "step": 22600 }, { "epoch": 201.94743845642049, "grad_norm": 0.2468644678592682, "learning_rate": 3.74247491638796e-06, "loss": 6.3717, "step": 22700 }, { "epoch": 201.94743845642049, "eval_loss": 6.383710861206055, "eval_runtime": 88.1839, "eval_samples_per_second": 113.399, "eval_steps_per_second": 3.549, "step": 22700 }, { "epoch": 202.83455311599025, "grad_norm": 0.39605483412742615, "learning_rate": 3.7324414715719067e-06, "loss": 6.3704, "step": 22800 }, { "epoch": 202.83455311599025, "eval_loss": 6.386079788208008, "eval_runtime": 88.1808, "eval_samples_per_second": 113.403, "eval_steps_per_second": 3.55, "step": 22800 }, { "epoch": 203.72166777555998, "grad_norm": 0.26171693205833435, "learning_rate": 3.722408026755853e-06, "loss": 6.3707, "step": 22900 }, { "epoch": 203.72166777555998, "eval_loss": 6.387109279632568, "eval_runtime": 88.1813, "eval_samples_per_second": 113.403, "eval_steps_per_second": 3.55, "step": 22900 }, { "epoch": 204.60878243512974, "grad_norm": 0.26537904143333435, "learning_rate": 3.7123745819398e-06, "loss": 6.3712, "step": 23000 }, { "epoch": 204.60878243512974, "eval_loss": 6.389610290527344, "eval_runtime": 89.0112, "eval_samples_per_second": 112.345, "eval_steps_per_second": 3.516, "step": 23000 }, { "epoch": 205.4958970946995, "grad_norm": 0.2203078716993332, "learning_rate": 3.702341137123746e-06, "loss": 6.3696, "step": 23100 }, { "epoch": 205.4958970946995, "eval_loss": 6.3849568367004395, "eval_runtime": 88.9819, "eval_samples_per_second": 112.382, "eval_steps_per_second": 3.518, "step": 23100 }, { "epoch": 206.38301175426923, "grad_norm": 0.23989248275756836, "learning_rate": 3.6923076923076925e-06, "loss": 6.37, "step": 23200 }, { "epoch": 206.38301175426923, "eval_loss": 6.39259147644043, "eval_runtime": 88.1947, "eval_samples_per_second": 113.386, "eval_steps_per_second": 3.549, "step": 23200 }, { "epoch": 207.270126413839, "grad_norm": 0.2467869073152542, "learning_rate": 3.6822742474916393e-06, "loss": 6.3701, "step": 23300 }, { "epoch": 207.270126413839, "eval_loss": 6.386963367462158, "eval_runtime": 89.001, "eval_samples_per_second": 112.358, "eval_steps_per_second": 3.517, "step": 23300 }, { "epoch": 208.15724107340873, "grad_norm": 0.3064594268798828, "learning_rate": 3.6722408026755856e-06, "loss": 6.3706, "step": 23400 }, { "epoch": 208.15724107340873, "eval_loss": 6.382241249084473, "eval_runtime": 88.1745, "eval_samples_per_second": 113.411, "eval_steps_per_second": 3.55, "step": 23400 }, { "epoch": 209.0443557329785, "grad_norm": 0.2418460100889206, "learning_rate": 3.662207357859532e-06, "loss": 6.3693, "step": 23500 }, { "epoch": 209.0443557329785, "eval_loss": 6.387510776519775, "eval_runtime": 88.983, "eval_samples_per_second": 112.381, "eval_steps_per_second": 3.518, "step": 23500 }, { "epoch": 209.93147039254825, "grad_norm": 0.5038089156150818, "learning_rate": 3.6521739130434787e-06, "loss": 6.3699, "step": 23600 }, { "epoch": 209.93147039254825, "eval_loss": 6.392237663269043, "eval_runtime": 88.1898, "eval_samples_per_second": 113.392, "eval_steps_per_second": 3.549, "step": 23600 }, { "epoch": 210.81858505211798, "grad_norm": 0.30169734358787537, "learning_rate": 3.642140468227425e-06, "loss": 6.3706, "step": 23700 }, { "epoch": 210.81858505211798, "eval_loss": 6.392018795013428, "eval_runtime": 88.9849, "eval_samples_per_second": 112.379, "eval_steps_per_second": 3.517, "step": 23700 }, { "epoch": 211.70569971168774, "grad_norm": 0.2609444558620453, "learning_rate": 3.6321070234113714e-06, "loss": 6.3706, "step": 23800 }, { "epoch": 211.70569971168774, "eval_loss": 6.388724327087402, "eval_runtime": 88.6575, "eval_samples_per_second": 112.794, "eval_steps_per_second": 3.53, "step": 23800 }, { "epoch": 212.59281437125748, "grad_norm": 0.21443623304367065, "learning_rate": 3.622073578595318e-06, "loss": 6.3703, "step": 23900 }, { "epoch": 212.59281437125748, "eval_loss": 6.385756015777588, "eval_runtime": 88.9775, "eval_samples_per_second": 112.388, "eval_steps_per_second": 3.518, "step": 23900 }, { "epoch": 213.47992903082724, "grad_norm": 0.22561503946781158, "learning_rate": 3.6120401337792645e-06, "loss": 6.3697, "step": 24000 }, { "epoch": 213.47992903082724, "eval_loss": 6.388892650604248, "eval_runtime": 88.1935, "eval_samples_per_second": 113.387, "eval_steps_per_second": 3.549, "step": 24000 }, { "epoch": 214.367043690397, "grad_norm": 0.23940326273441315, "learning_rate": 3.6020066889632112e-06, "loss": 6.3689, "step": 24100 }, { "epoch": 214.367043690397, "eval_loss": 6.386131286621094, "eval_runtime": 88.4334, "eval_samples_per_second": 113.079, "eval_steps_per_second": 3.539, "step": 24100 }, { "epoch": 215.25415834996673, "grad_norm": 0.3109673857688904, "learning_rate": 3.5919732441471576e-06, "loss": 6.3694, "step": 24200 }, { "epoch": 215.25415834996673, "eval_loss": 6.3832244873046875, "eval_runtime": 89.0249, "eval_samples_per_second": 112.328, "eval_steps_per_second": 3.516, "step": 24200 }, { "epoch": 216.1412730095365, "grad_norm": 0.2562812566757202, "learning_rate": 3.581939799331104e-06, "loss": 6.3686, "step": 24300 }, { "epoch": 216.1412730095365, "eval_loss": 6.385456085205078, "eval_runtime": 88.1951, "eval_samples_per_second": 113.385, "eval_steps_per_second": 3.549, "step": 24300 }, { "epoch": 217.02838766910622, "grad_norm": 0.33149996399879456, "learning_rate": 3.5719063545150507e-06, "loss": 6.3696, "step": 24400 }, { "epoch": 217.02838766910622, "eval_loss": 6.387702465057373, "eval_runtime": 88.9847, "eval_samples_per_second": 112.379, "eval_steps_per_second": 3.517, "step": 24400 }, { "epoch": 217.91550232867598, "grad_norm": 0.2598579525947571, "learning_rate": 3.561872909698997e-06, "loss": 6.3699, "step": 24500 }, { "epoch": 217.91550232867598, "eval_loss": 6.38595724105835, "eval_runtime": 88.198, "eval_samples_per_second": 113.381, "eval_steps_per_second": 3.549, "step": 24500 }, { "epoch": 218.80261698824572, "grad_norm": 0.2651689648628235, "learning_rate": 3.5518394648829434e-06, "loss": 6.3703, "step": 24600 }, { "epoch": 218.80261698824572, "eval_loss": 6.383368968963623, "eval_runtime": 89.0584, "eval_samples_per_second": 112.286, "eval_steps_per_second": 3.515, "step": 24600 }, { "epoch": 219.68973164781548, "grad_norm": 0.25209030508995056, "learning_rate": 3.54180602006689e-06, "loss": 6.3703, "step": 24700 }, { "epoch": 219.68973164781548, "eval_loss": 6.389649868011475, "eval_runtime": 89.0152, "eval_samples_per_second": 112.34, "eval_steps_per_second": 3.516, "step": 24700 }, { "epoch": 220.57684630738524, "grad_norm": 0.16648085415363312, "learning_rate": 3.5317725752508365e-06, "loss": 6.3694, "step": 24800 }, { "epoch": 220.57684630738524, "eval_loss": 6.384476661682129, "eval_runtime": 89.0288, "eval_samples_per_second": 112.323, "eval_steps_per_second": 3.516, "step": 24800 }, { "epoch": 221.46396096695497, "grad_norm": 0.25535905361175537, "learning_rate": 3.521739130434783e-06, "loss": 6.3701, "step": 24900 }, { "epoch": 221.46396096695497, "eval_loss": 6.383844375610352, "eval_runtime": 88.1889, "eval_samples_per_second": 113.393, "eval_steps_per_second": 3.549, "step": 24900 }, { "epoch": 222.35107562652473, "grad_norm": 0.14982174336910248, "learning_rate": 3.5117056856187296e-06, "loss": 6.3689, "step": 25000 }, { "epoch": 222.35107562652473, "eval_loss": 6.383812427520752, "eval_runtime": 88.1955, "eval_samples_per_second": 113.385, "eval_steps_per_second": 3.549, "step": 25000 }, { "epoch": 223.23819028609446, "grad_norm": 0.24092227220535278, "learning_rate": 3.501672240802676e-06, "loss": 6.3696, "step": 25100 }, { "epoch": 223.23819028609446, "eval_loss": 6.387426376342773, "eval_runtime": 88.8638, "eval_samples_per_second": 112.532, "eval_steps_per_second": 3.522, "step": 25100 }, { "epoch": 224.12530494566423, "grad_norm": 0.3173174262046814, "learning_rate": 3.491638795986622e-06, "loss": 6.3685, "step": 25200 }, { "epoch": 224.12530494566423, "eval_loss": 6.387609004974365, "eval_runtime": 88.9892, "eval_samples_per_second": 112.373, "eval_steps_per_second": 3.517, "step": 25200 }, { "epoch": 225.012419605234, "grad_norm": 0.2092152088880539, "learning_rate": 3.481605351170568e-06, "loss": 6.3695, "step": 25300 }, { "epoch": 225.012419605234, "eval_loss": 6.386031627655029, "eval_runtime": 88.2056, "eval_samples_per_second": 113.371, "eval_steps_per_second": 3.549, "step": 25300 }, { "epoch": 225.89953426480372, "grad_norm": 0.2362297624349594, "learning_rate": 3.471571906354515e-06, "loss": 6.3684, "step": 25400 }, { "epoch": 225.89953426480372, "eval_loss": 6.389245510101318, "eval_runtime": 88.1955, "eval_samples_per_second": 113.384, "eval_steps_per_second": 3.549, "step": 25400 }, { "epoch": 226.78664892437348, "grad_norm": 0.16113384068012238, "learning_rate": 3.4615384615384613e-06, "loss": 6.3688, "step": 25500 }, { "epoch": 226.78664892437348, "eval_loss": 6.388128757476807, "eval_runtime": 88.1884, "eval_samples_per_second": 113.394, "eval_steps_per_second": 3.549, "step": 25500 }, { "epoch": 227.6737635839432, "grad_norm": 0.28249019384384155, "learning_rate": 3.4515050167224076e-06, "loss": 6.3685, "step": 25600 }, { "epoch": 227.6737635839432, "eval_loss": 6.38515043258667, "eval_runtime": 89.0087, "eval_samples_per_second": 112.349, "eval_steps_per_second": 3.517, "step": 25600 }, { "epoch": 228.56087824351297, "grad_norm": 0.2178281992673874, "learning_rate": 3.4414715719063544e-06, "loss": 6.3692, "step": 25700 }, { "epoch": 228.56087824351297, "eval_loss": 6.385435104370117, "eval_runtime": 89.0004, "eval_samples_per_second": 112.359, "eval_steps_per_second": 3.517, "step": 25700 }, { "epoch": 229.44799290308273, "grad_norm": 0.2855147123336792, "learning_rate": 3.4314381270903007e-06, "loss": 6.3691, "step": 25800 }, { "epoch": 229.44799290308273, "eval_loss": 6.384737491607666, "eval_runtime": 89.03, "eval_samples_per_second": 112.322, "eval_steps_per_second": 3.516, "step": 25800 }, { "epoch": 230.33510756265247, "grad_norm": 0.2967989146709442, "learning_rate": 3.4214046822742475e-06, "loss": 6.3688, "step": 25900 }, { "epoch": 230.33510756265247, "eval_loss": 6.380478382110596, "eval_runtime": 88.1811, "eval_samples_per_second": 113.403, "eval_steps_per_second": 3.55, "step": 25900 }, { "epoch": 231.22222222222223, "grad_norm": 0.23676429688930511, "learning_rate": 3.411371237458194e-06, "loss": 6.3689, "step": 26000 }, { "epoch": 231.22222222222223, "eval_loss": 6.383557319641113, "eval_runtime": 88.9992, "eval_samples_per_second": 112.361, "eval_steps_per_second": 3.517, "step": 26000 }, { "epoch": 232.10933688179196, "grad_norm": 0.26867687702178955, "learning_rate": 3.40133779264214e-06, "loss": 6.3687, "step": 26100 }, { "epoch": 232.10933688179196, "eval_loss": 6.382840633392334, "eval_runtime": 88.2227, "eval_samples_per_second": 113.349, "eval_steps_per_second": 3.548, "step": 26100 }, { "epoch": 232.99645154136172, "grad_norm": 0.31317785382270813, "learning_rate": 3.391304347826087e-06, "loss": 6.3681, "step": 26200 }, { "epoch": 232.99645154136172, "eval_loss": 6.383928298950195, "eval_runtime": 88.1948, "eval_samples_per_second": 113.385, "eval_steps_per_second": 3.549, "step": 26200 }, { "epoch": 233.88356620093148, "grad_norm": 0.19290131330490112, "learning_rate": 3.3812709030100333e-06, "loss": 6.3686, "step": 26300 }, { "epoch": 233.88356620093148, "eval_loss": 6.383606910705566, "eval_runtime": 88.1805, "eval_samples_per_second": 113.404, "eval_steps_per_second": 3.55, "step": 26300 }, { "epoch": 234.77068086050122, "grad_norm": 0.2145206481218338, "learning_rate": 3.3712374581939796e-06, "loss": 6.3683, "step": 26400 }, { "epoch": 234.77068086050122, "eval_loss": 6.382413864135742, "eval_runtime": 89.0087, "eval_samples_per_second": 112.349, "eval_steps_per_second": 3.517, "step": 26400 }, { "epoch": 235.65779552007098, "grad_norm": 0.23395557701587677, "learning_rate": 3.3612040133779264e-06, "loss": 6.3685, "step": 26500 }, { "epoch": 235.65779552007098, "eval_loss": 6.381302356719971, "eval_runtime": 89.0044, "eval_samples_per_second": 112.354, "eval_steps_per_second": 3.517, "step": 26500 }, { "epoch": 236.5449101796407, "grad_norm": 0.2277672439813614, "learning_rate": 3.3511705685618727e-06, "loss": 6.3694, "step": 26600 }, { "epoch": 236.5449101796407, "eval_loss": 6.382754325866699, "eval_runtime": 88.1906, "eval_samples_per_second": 113.391, "eval_steps_per_second": 3.549, "step": 26600 }, { "epoch": 237.43202483921047, "grad_norm": 0.15456043183803558, "learning_rate": 3.3411371237458195e-06, "loss": 6.3674, "step": 26700 }, { "epoch": 237.43202483921047, "eval_loss": 6.385075569152832, "eval_runtime": 89.0461, "eval_samples_per_second": 112.301, "eval_steps_per_second": 3.515, "step": 26700 }, { "epoch": 238.31913949878023, "grad_norm": 0.2268277257680893, "learning_rate": 3.331103678929766e-06, "loss": 6.3679, "step": 26800 }, { "epoch": 238.31913949878023, "eval_loss": 6.382864952087402, "eval_runtime": 88.1787, "eval_samples_per_second": 113.406, "eval_steps_per_second": 3.55, "step": 26800 }, { "epoch": 239.20625415834996, "grad_norm": 0.2599903643131256, "learning_rate": 3.321070234113712e-06, "loss": 6.3681, "step": 26900 }, { "epoch": 239.20625415834996, "eval_loss": 6.382370948791504, "eval_runtime": 88.1887, "eval_samples_per_second": 113.393, "eval_steps_per_second": 3.549, "step": 26900 }, { "epoch": 240.09336881791972, "grad_norm": 0.2117336094379425, "learning_rate": 3.311036789297659e-06, "loss": 6.3686, "step": 27000 }, { "epoch": 240.09336881791972, "eval_loss": 6.381521701812744, "eval_runtime": 88.9818, "eval_samples_per_second": 112.382, "eval_steps_per_second": 3.518, "step": 27000 }, { "epoch": 240.98048347748946, "grad_norm": 0.20599253475666046, "learning_rate": 3.3010033444816052e-06, "loss": 6.3683, "step": 27100 }, { "epoch": 240.98048347748946, "eval_loss": 6.382330417633057, "eval_runtime": 88.1957, "eval_samples_per_second": 113.384, "eval_steps_per_second": 3.549, "step": 27100 }, { "epoch": 241.86759813705922, "grad_norm": 0.22722215950489044, "learning_rate": 3.2909698996655516e-06, "loss": 6.3678, "step": 27200 }, { "epoch": 241.86759813705922, "eval_loss": 6.3871564865112305, "eval_runtime": 88.1783, "eval_samples_per_second": 113.407, "eval_steps_per_second": 3.55, "step": 27200 }, { "epoch": 242.75471279662895, "grad_norm": 0.259403795003891, "learning_rate": 3.2809364548494983e-06, "loss": 6.3681, "step": 27300 }, { "epoch": 242.75471279662895, "eval_loss": 6.384130954742432, "eval_runtime": 89.014, "eval_samples_per_second": 112.342, "eval_steps_per_second": 3.516, "step": 27300 }, { "epoch": 243.6418274561987, "grad_norm": 0.25630879402160645, "learning_rate": 3.2709030100334447e-06, "loss": 6.3682, "step": 27400 }, { "epoch": 243.6418274561987, "eval_loss": 6.382914066314697, "eval_runtime": 89.0259, "eval_samples_per_second": 112.327, "eval_steps_per_second": 3.516, "step": 27400 }, { "epoch": 244.52894211576847, "grad_norm": 0.28536516427993774, "learning_rate": 3.260869565217391e-06, "loss": 6.3686, "step": 27500 }, { "epoch": 244.52894211576847, "eval_loss": 6.386742115020752, "eval_runtime": 88.9916, "eval_samples_per_second": 112.37, "eval_steps_per_second": 3.517, "step": 27500 }, { "epoch": 245.4160567753382, "grad_norm": 0.1816515326499939, "learning_rate": 3.2508361204013378e-06, "loss": 6.3667, "step": 27600 }, { "epoch": 245.4160567753382, "eval_loss": 6.380117416381836, "eval_runtime": 88.9894, "eval_samples_per_second": 112.373, "eval_steps_per_second": 3.517, "step": 27600 }, { "epoch": 246.30317143490797, "grad_norm": 0.24183250963687897, "learning_rate": 3.240802675585284e-06, "loss": 6.3675, "step": 27700 }, { "epoch": 246.30317143490797, "eval_loss": 6.3849968910217285, "eval_runtime": 88.1725, "eval_samples_per_second": 113.414, "eval_steps_per_second": 3.55, "step": 27700 }, { "epoch": 247.1902860944777, "grad_norm": 0.28278273344039917, "learning_rate": 3.230769230769231e-06, "loss": 6.368, "step": 27800 }, { "epoch": 247.1902860944777, "eval_loss": 6.382080554962158, "eval_runtime": 88.1841, "eval_samples_per_second": 113.399, "eval_steps_per_second": 3.549, "step": 27800 }, { "epoch": 248.07740075404746, "grad_norm": 0.27085331082344055, "learning_rate": 3.2207357859531772e-06, "loss": 6.3686, "step": 27900 }, { "epoch": 248.07740075404746, "eval_loss": 6.384332656860352, "eval_runtime": 88.1761, "eval_samples_per_second": 113.409, "eval_steps_per_second": 3.55, "step": 27900 }, { "epoch": 248.96451541361722, "grad_norm": 0.18361283838748932, "learning_rate": 3.2107023411371236e-06, "loss": 6.3667, "step": 28000 }, { "epoch": 248.96451541361722, "eval_loss": 6.383978843688965, "eval_runtime": 88.1931, "eval_samples_per_second": 113.388, "eval_steps_per_second": 3.549, "step": 28000 }, { "epoch": 249.85163007318695, "grad_norm": 0.20948508381843567, "learning_rate": 3.2006688963210703e-06, "loss": 6.3683, "step": 28100 }, { "epoch": 249.85163007318695, "eval_loss": 6.383596420288086, "eval_runtime": 88.1945, "eval_samples_per_second": 113.386, "eval_steps_per_second": 3.549, "step": 28100 }, { "epoch": 250.73874473275671, "grad_norm": 0.2579098641872406, "learning_rate": 3.1906354515050167e-06, "loss": 6.3679, "step": 28200 }, { "epoch": 250.73874473275671, "eval_loss": 6.38535213470459, "eval_runtime": 89.0182, "eval_samples_per_second": 112.337, "eval_steps_per_second": 3.516, "step": 28200 }, { "epoch": 251.62585939232645, "grad_norm": 0.16455556452274323, "learning_rate": 3.180602006688963e-06, "loss": 6.3679, "step": 28300 }, { "epoch": 251.62585939232645, "eval_loss": 6.3854899406433105, "eval_runtime": 88.1768, "eval_samples_per_second": 113.409, "eval_steps_per_second": 3.55, "step": 28300 }, { "epoch": 252.5129740518962, "grad_norm": 0.15089711546897888, "learning_rate": 3.1705685618729098e-06, "loss": 6.3674, "step": 28400 }, { "epoch": 252.5129740518962, "eval_loss": 6.380008697509766, "eval_runtime": 88.186, "eval_samples_per_second": 113.397, "eval_steps_per_second": 3.549, "step": 28400 }, { "epoch": 253.40008871146597, "grad_norm": 0.19287870824337006, "learning_rate": 3.160535117056856e-06, "loss": 6.3671, "step": 28500 }, { "epoch": 253.40008871146597, "eval_loss": 6.381292343139648, "eval_runtime": 89.0041, "eval_samples_per_second": 112.354, "eval_steps_per_second": 3.517, "step": 28500 }, { "epoch": 254.2872033710357, "grad_norm": 0.28032493591308594, "learning_rate": 3.1505016722408024e-06, "loss": 6.3684, "step": 28600 }, { "epoch": 254.2872033710357, "eval_loss": 6.381994247436523, "eval_runtime": 88.2052, "eval_samples_per_second": 113.372, "eval_steps_per_second": 3.549, "step": 28600 }, { "epoch": 255.17431803060546, "grad_norm": 0.2228955328464508, "learning_rate": 3.140468227424749e-06, "loss": 6.3673, "step": 28700 }, { "epoch": 255.17431803060546, "eval_loss": 6.3841552734375, "eval_runtime": 88.1783, "eval_samples_per_second": 113.407, "eval_steps_per_second": 3.55, "step": 28700 }, { "epoch": 256.0614326901752, "grad_norm": 0.2289431095123291, "learning_rate": 3.1304347826086955e-06, "loss": 6.3667, "step": 28800 }, { "epoch": 256.0614326901752, "eval_loss": 6.383512020111084, "eval_runtime": 89.0073, "eval_samples_per_second": 112.35, "eval_steps_per_second": 3.517, "step": 28800 }, { "epoch": 256.94854734974496, "grad_norm": 0.17454871535301208, "learning_rate": 3.1204013377926423e-06, "loss": 6.3668, "step": 28900 }, { "epoch": 256.94854734974496, "eval_loss": 6.386359214782715, "eval_runtime": 88.1766, "eval_samples_per_second": 113.409, "eval_steps_per_second": 3.55, "step": 28900 }, { "epoch": 257.8356620093147, "grad_norm": 0.19062787294387817, "learning_rate": 3.1103678929765886e-06, "loss": 6.3671, "step": 29000 }, { "epoch": 257.8356620093147, "eval_loss": 6.382784366607666, "eval_runtime": 89.0271, "eval_samples_per_second": 112.325, "eval_steps_per_second": 3.516, "step": 29000 }, { "epoch": 258.7227766688845, "grad_norm": 0.19611743092536926, "learning_rate": 3.100334448160535e-06, "loss": 6.3673, "step": 29100 }, { "epoch": 258.7227766688845, "eval_loss": 6.378743648529053, "eval_runtime": 89.0, "eval_samples_per_second": 112.36, "eval_steps_per_second": 3.517, "step": 29100 }, { "epoch": 259.6098913284542, "grad_norm": 0.20483489334583282, "learning_rate": 3.0903010033444818e-06, "loss": 6.3666, "step": 29200 }, { "epoch": 259.6098913284542, "eval_loss": 6.384799003601074, "eval_runtime": 88.186, "eval_samples_per_second": 113.397, "eval_steps_per_second": 3.549, "step": 29200 }, { "epoch": 260.49700598802394, "grad_norm": 0.1686568409204483, "learning_rate": 3.080267558528428e-06, "loss": 6.3678, "step": 29300 }, { "epoch": 260.49700598802394, "eval_loss": 6.38092565536499, "eval_runtime": 88.191, "eval_samples_per_second": 113.39, "eval_steps_per_second": 3.549, "step": 29300 }, { "epoch": 261.3841206475937, "grad_norm": 0.16638343036174774, "learning_rate": 3.0702341137123744e-06, "loss": 6.3671, "step": 29400 }, { "epoch": 261.3841206475937, "eval_loss": 6.380900859832764, "eval_runtime": 88.1878, "eval_samples_per_second": 113.394, "eval_steps_per_second": 3.549, "step": 29400 }, { "epoch": 262.27123530716347, "grad_norm": 0.16073353588581085, "learning_rate": 3.060200668896321e-06, "loss": 6.3668, "step": 29500 }, { "epoch": 262.27123530716347, "eval_loss": 6.382925033569336, "eval_runtime": 88.184, "eval_samples_per_second": 113.399, "eval_steps_per_second": 3.549, "step": 29500 }, { "epoch": 263.1583499667332, "grad_norm": 0.2387487143278122, "learning_rate": 3.0501672240802675e-06, "loss": 6.3665, "step": 29600 }, { "epoch": 263.1583499667332, "eval_loss": 6.3799662590026855, "eval_runtime": 88.1877, "eval_samples_per_second": 113.394, "eval_steps_per_second": 3.549, "step": 29600 }, { "epoch": 264.04546462630293, "grad_norm": 0.22873957455158234, "learning_rate": 3.0401337792642143e-06, "loss": 6.3666, "step": 29700 }, { "epoch": 264.04546462630293, "eval_loss": 6.379544734954834, "eval_runtime": 88.1981, "eval_samples_per_second": 113.381, "eval_steps_per_second": 3.549, "step": 29700 }, { "epoch": 264.9325792858727, "grad_norm": 0.20048406720161438, "learning_rate": 3.0301003344481606e-06, "loss": 6.3668, "step": 29800 }, { "epoch": 264.9325792858727, "eval_loss": 6.380821228027344, "eval_runtime": 88.1967, "eval_samples_per_second": 113.383, "eval_steps_per_second": 3.549, "step": 29800 }, { "epoch": 265.81969394544245, "grad_norm": 0.20105549693107605, "learning_rate": 3.020066889632107e-06, "loss": 6.3663, "step": 29900 }, { "epoch": 265.81969394544245, "eval_loss": 6.3833537101745605, "eval_runtime": 88.9918, "eval_samples_per_second": 112.37, "eval_steps_per_second": 3.517, "step": 29900 }, { "epoch": 266.7068086050122, "grad_norm": 0.26339054107666016, "learning_rate": 3.0100334448160537e-06, "loss": 6.3663, "step": 30000 }, { "epoch": 266.7068086050122, "eval_loss": 6.388853073120117, "eval_runtime": 89.0161, "eval_samples_per_second": 112.339, "eval_steps_per_second": 3.516, "step": 30000 }, { "epoch": 267.593923264582, "grad_norm": 0.1931493878364563, "learning_rate": 3e-06, "loss": 6.3666, "step": 30100 }, { "epoch": 267.593923264582, "eval_loss": 6.378931045532227, "eval_runtime": 88.2044, "eval_samples_per_second": 113.373, "eval_steps_per_second": 3.549, "step": 30100 }, { "epoch": 268.4810379241517, "grad_norm": 0.268880158662796, "learning_rate": 2.9899665551839464e-06, "loss": 6.367, "step": 30200 }, { "epoch": 268.4810379241517, "eval_loss": 6.381078243255615, "eval_runtime": 88.182, "eval_samples_per_second": 113.402, "eval_steps_per_second": 3.549, "step": 30200 }, { "epoch": 269.36815258372144, "grad_norm": 0.15537361800670624, "learning_rate": 2.979933110367893e-06, "loss": 6.3659, "step": 30300 }, { "epoch": 269.36815258372144, "eval_loss": 6.38137674331665, "eval_runtime": 88.1976, "eval_samples_per_second": 113.382, "eval_steps_per_second": 3.549, "step": 30300 }, { "epoch": 270.2552672432912, "grad_norm": 0.23357395827770233, "learning_rate": 2.9698996655518395e-06, "loss": 6.3661, "step": 30400 }, { "epoch": 270.2552672432912, "eval_loss": 6.384622573852539, "eval_runtime": 88.1861, "eval_samples_per_second": 113.397, "eval_steps_per_second": 3.549, "step": 30400 }, { "epoch": 271.14238190286096, "grad_norm": 0.29505735635757446, "learning_rate": 2.959866220735786e-06, "loss": 6.3666, "step": 30500 }, { "epoch": 271.14238190286096, "eval_loss": 6.383800983428955, "eval_runtime": 88.188, "eval_samples_per_second": 113.394, "eval_steps_per_second": 3.549, "step": 30500 }, { "epoch": 272.0294965624307, "grad_norm": 0.14850308001041412, "learning_rate": 2.9498327759197326e-06, "loss": 6.3664, "step": 30600 }, { "epoch": 272.0294965624307, "eval_loss": 6.384856224060059, "eval_runtime": 88.1953, "eval_samples_per_second": 113.385, "eval_steps_per_second": 3.549, "step": 30600 }, { "epoch": 272.9166112220004, "grad_norm": 0.16296862065792084, "learning_rate": 2.939799331103679e-06, "loss": 6.3667, "step": 30700 }, { "epoch": 272.9166112220004, "eval_loss": 6.380056858062744, "eval_runtime": 88.6214, "eval_samples_per_second": 112.84, "eval_steps_per_second": 3.532, "step": 30700 }, { "epoch": 273.8037258815702, "grad_norm": 0.212349534034729, "learning_rate": 2.9297658862876257e-06, "loss": 6.3659, "step": 30800 }, { "epoch": 273.8037258815702, "eval_loss": 6.379006862640381, "eval_runtime": 89.0119, "eval_samples_per_second": 112.345, "eval_steps_per_second": 3.516, "step": 30800 }, { "epoch": 274.69084054113995, "grad_norm": 0.18035291135311127, "learning_rate": 2.919732441471572e-06, "loss": 6.3664, "step": 30900 }, { "epoch": 274.69084054113995, "eval_loss": 6.382543563842773, "eval_runtime": 89.0418, "eval_samples_per_second": 112.307, "eval_steps_per_second": 3.515, "step": 30900 }, { "epoch": 275.5779552007097, "grad_norm": 0.24907241761684418, "learning_rate": 2.9096989966555184e-06, "loss": 6.3669, "step": 31000 }, { "epoch": 275.5779552007097, "eval_loss": 6.379300594329834, "eval_runtime": 88.2037, "eval_samples_per_second": 113.374, "eval_steps_per_second": 3.549, "step": 31000 }, { "epoch": 276.4650698602794, "grad_norm": 0.1900593638420105, "learning_rate": 2.899665551839465e-06, "loss": 6.367, "step": 31100 }, { "epoch": 276.4650698602794, "eval_loss": 6.3781561851501465, "eval_runtime": 89.0059, "eval_samples_per_second": 112.352, "eval_steps_per_second": 3.517, "step": 31100 }, { "epoch": 277.3521845198492, "grad_norm": 0.16180412471294403, "learning_rate": 2.8896321070234115e-06, "loss": 6.3663, "step": 31200 }, { "epoch": 277.3521845198492, "eval_loss": 6.377742767333984, "eval_runtime": 89.0264, "eval_samples_per_second": 112.326, "eval_steps_per_second": 3.516, "step": 31200 }, { "epoch": 278.23929917941894, "grad_norm": 0.15212863683700562, "learning_rate": 2.879598662207358e-06, "loss": 6.3667, "step": 31300 }, { "epoch": 278.23929917941894, "eval_loss": 6.379834175109863, "eval_runtime": 88.1893, "eval_samples_per_second": 113.392, "eval_steps_per_second": 3.549, "step": 31300 }, { "epoch": 279.1264138389887, "grad_norm": 0.17719916999340057, "learning_rate": 2.8695652173913046e-06, "loss": 6.3662, "step": 31400 }, { "epoch": 279.1264138389887, "eval_loss": 6.383392333984375, "eval_runtime": 88.1973, "eval_samples_per_second": 113.382, "eval_steps_per_second": 3.549, "step": 31400 }, { "epoch": 280.01352849855846, "grad_norm": 0.25364619493484497, "learning_rate": 2.859531772575251e-06, "loss": 6.3667, "step": 31500 }, { "epoch": 280.01352849855846, "eval_loss": 6.38493537902832, "eval_runtime": 88.2155, "eval_samples_per_second": 113.359, "eval_steps_per_second": 3.548, "step": 31500 }, { "epoch": 280.90064315812816, "grad_norm": 0.14650413393974304, "learning_rate": 2.8494983277591977e-06, "loss": 6.3657, "step": 31600 }, { "epoch": 280.90064315812816, "eval_loss": 6.381402015686035, "eval_runtime": 89.0091, "eval_samples_per_second": 112.348, "eval_steps_per_second": 3.516, "step": 31600 }, { "epoch": 281.7877578176979, "grad_norm": 0.18827463686466217, "learning_rate": 2.839464882943144e-06, "loss": 6.366, "step": 31700 }, { "epoch": 281.7877578176979, "eval_loss": 6.382148265838623, "eval_runtime": 89.0075, "eval_samples_per_second": 112.35, "eval_steps_per_second": 3.517, "step": 31700 }, { "epoch": 282.6748724772677, "grad_norm": 0.1384831815958023, "learning_rate": 2.8294314381270904e-06, "loss": 6.3652, "step": 31800 }, { "epoch": 282.6748724772677, "eval_loss": 6.384429454803467, "eval_runtime": 89.0178, "eval_samples_per_second": 112.337, "eval_steps_per_second": 3.516, "step": 31800 }, { "epoch": 283.56198713683744, "grad_norm": 0.2322372943162918, "learning_rate": 2.819397993311037e-06, "loss": 6.3665, "step": 31900 }, { "epoch": 283.56198713683744, "eval_loss": 6.378748416900635, "eval_runtime": 88.1981, "eval_samples_per_second": 113.381, "eval_steps_per_second": 3.549, "step": 31900 }, { "epoch": 284.4491017964072, "grad_norm": 0.18588069081306458, "learning_rate": 2.8093645484949835e-06, "loss": 6.3655, "step": 32000 }, { "epoch": 284.4491017964072, "eval_loss": 6.383064270019531, "eval_runtime": 88.9701, "eval_samples_per_second": 112.397, "eval_steps_per_second": 3.518, "step": 32000 }, { "epoch": 285.3362164559769, "grad_norm": 0.24989992380142212, "learning_rate": 2.79933110367893e-06, "loss": 6.3657, "step": 32100 }, { "epoch": 285.3362164559769, "eval_loss": 6.381895542144775, "eval_runtime": 88.1861, "eval_samples_per_second": 113.396, "eval_steps_per_second": 3.549, "step": 32100 }, { "epoch": 286.22333111554667, "grad_norm": 0.15007902681827545, "learning_rate": 2.7892976588628766e-06, "loss": 6.3655, "step": 32200 }, { "epoch": 286.22333111554667, "eval_loss": 6.381099224090576, "eval_runtime": 88.2079, "eval_samples_per_second": 113.368, "eval_steps_per_second": 3.548, "step": 32200 }, { "epoch": 287.11044577511643, "grad_norm": 0.1818419098854065, "learning_rate": 2.779264214046823e-06, "loss": 6.3647, "step": 32300 }, { "epoch": 287.11044577511643, "eval_loss": 6.380296230316162, "eval_runtime": 88.1867, "eval_samples_per_second": 113.396, "eval_steps_per_second": 3.549, "step": 32300 }, { "epoch": 287.9975604346862, "grad_norm": 0.16886812448501587, "learning_rate": 2.7692307692307693e-06, "loss": 6.3657, "step": 32400 }, { "epoch": 287.9975604346862, "eval_loss": 6.378762245178223, "eval_runtime": 89.0581, "eval_samples_per_second": 112.286, "eval_steps_per_second": 3.515, "step": 32400 }, { "epoch": 288.88467509425595, "grad_norm": 0.1774781197309494, "learning_rate": 2.759197324414716e-06, "loss": 6.3652, "step": 32500 }, { "epoch": 288.88467509425595, "eval_loss": 6.377442359924316, "eval_runtime": 89.0228, "eval_samples_per_second": 112.331, "eval_steps_per_second": 3.516, "step": 32500 }, { "epoch": 289.77178975382566, "grad_norm": 0.22276373207569122, "learning_rate": 2.749163879598662e-06, "loss": 6.3651, "step": 32600 }, { "epoch": 289.77178975382566, "eval_loss": 6.378692626953125, "eval_runtime": 88.9428, "eval_samples_per_second": 112.432, "eval_steps_per_second": 3.519, "step": 32600 }, { "epoch": 290.6589044133954, "grad_norm": 0.17587396502494812, "learning_rate": 2.7391304347826087e-06, "loss": 6.3659, "step": 32700 }, { "epoch": 290.6589044133954, "eval_loss": 6.381659984588623, "eval_runtime": 88.9921, "eval_samples_per_second": 112.37, "eval_steps_per_second": 3.517, "step": 32700 }, { "epoch": 291.5460190729652, "grad_norm": 0.14095981419086456, "learning_rate": 2.729096989966555e-06, "loss": 6.3658, "step": 32800 }, { "epoch": 291.5460190729652, "eval_loss": 6.3807477951049805, "eval_runtime": 88.2004, "eval_samples_per_second": 113.378, "eval_steps_per_second": 3.549, "step": 32800 }, { "epoch": 292.43313373253494, "grad_norm": 0.24706387519836426, "learning_rate": 2.7190635451505014e-06, "loss": 6.3664, "step": 32900 }, { "epoch": 292.43313373253494, "eval_loss": 6.381751537322998, "eval_runtime": 88.2016, "eval_samples_per_second": 113.377, "eval_steps_per_second": 3.549, "step": 32900 }, { "epoch": 293.3202483921047, "grad_norm": 0.22346995770931244, "learning_rate": 2.709030100334448e-06, "loss": 6.3639, "step": 33000 }, { "epoch": 293.3202483921047, "eval_loss": 6.382026195526123, "eval_runtime": 88.1835, "eval_samples_per_second": 113.4, "eval_steps_per_second": 3.549, "step": 33000 }, { "epoch": 294.2073630516744, "grad_norm": 0.172585129737854, "learning_rate": 2.6989966555183945e-06, "loss": 6.3672, "step": 33100 }, { "epoch": 294.2073630516744, "eval_loss": 6.37891149520874, "eval_runtime": 88.1788, "eval_samples_per_second": 113.406, "eval_steps_per_second": 3.55, "step": 33100 }, { "epoch": 295.09447771124417, "grad_norm": 0.19066356122493744, "learning_rate": 2.6889632107023413e-06, "loss": 6.3665, "step": 33200 }, { "epoch": 295.09447771124417, "eval_loss": 6.381018161773682, "eval_runtime": 88.2083, "eval_samples_per_second": 113.368, "eval_steps_per_second": 3.548, "step": 33200 }, { "epoch": 295.9815923708139, "grad_norm": 0.18018165230751038, "learning_rate": 2.6789297658862876e-06, "loss": 6.3654, "step": 33300 }, { "epoch": 295.9815923708139, "eval_loss": 6.384938716888428, "eval_runtime": 89.0301, "eval_samples_per_second": 112.322, "eval_steps_per_second": 3.516, "step": 33300 }, { "epoch": 296.8687070303837, "grad_norm": 0.20351873338222504, "learning_rate": 2.668896321070234e-06, "loss": 6.3657, "step": 33400 }, { "epoch": 296.8687070303837, "eval_loss": 6.382087230682373, "eval_runtime": 88.6634, "eval_samples_per_second": 112.786, "eval_steps_per_second": 3.53, "step": 33400 }, { "epoch": 297.75582168995345, "grad_norm": 0.13977867364883423, "learning_rate": 2.6588628762541807e-06, "loss": 6.3651, "step": 33500 }, { "epoch": 297.75582168995345, "eval_loss": 6.378364086151123, "eval_runtime": 88.988, "eval_samples_per_second": 112.375, "eval_steps_per_second": 3.517, "step": 33500 }, { "epoch": 298.64293634952315, "grad_norm": 0.17024530470371246, "learning_rate": 2.648829431438127e-06, "loss": 6.3661, "step": 33600 }, { "epoch": 298.64293634952315, "eval_loss": 6.375431060791016, "eval_runtime": 88.1687, "eval_samples_per_second": 113.419, "eval_steps_per_second": 3.55, "step": 33600 }, { "epoch": 299.5300510090929, "grad_norm": 0.2234225571155548, "learning_rate": 2.6387959866220734e-06, "loss": 6.3654, "step": 33700 }, { "epoch": 299.5300510090929, "eval_loss": 6.378067970275879, "eval_runtime": 88.1651, "eval_samples_per_second": 113.424, "eval_steps_per_second": 3.55, "step": 33700 }, { "epoch": 300.4171656686627, "grad_norm": 0.2681805193424225, "learning_rate": 2.62876254180602e-06, "loss": 6.3655, "step": 33800 }, { "epoch": 300.4171656686627, "eval_loss": 6.379166603088379, "eval_runtime": 88.1788, "eval_samples_per_second": 113.406, "eval_steps_per_second": 3.55, "step": 33800 }, { "epoch": 301.30428032823244, "grad_norm": 0.1696304976940155, "learning_rate": 2.6187290969899665e-06, "loss": 6.3653, "step": 33900 }, { "epoch": 301.30428032823244, "eval_loss": 6.376532554626465, "eval_runtime": 88.1839, "eval_samples_per_second": 113.399, "eval_steps_per_second": 3.549, "step": 33900 }, { "epoch": 302.1913949878022, "grad_norm": 0.2099679708480835, "learning_rate": 2.6086956521739132e-06, "loss": 6.3654, "step": 34000 }, { "epoch": 302.1913949878022, "eval_loss": 6.383284568786621, "eval_runtime": 88.1787, "eval_samples_per_second": 113.406, "eval_steps_per_second": 3.55, "step": 34000 }, { "epoch": 303.0785096473719, "grad_norm": 0.16611598432064056, "learning_rate": 2.5986622073578596e-06, "loss": 6.3651, "step": 34100 }, { "epoch": 303.0785096473719, "eval_loss": 6.381277084350586, "eval_runtime": 88.3292, "eval_samples_per_second": 113.213, "eval_steps_per_second": 3.544, "step": 34100 }, { "epoch": 303.96562430694166, "grad_norm": 0.19213254749774933, "learning_rate": 2.588628762541806e-06, "loss": 6.3652, "step": 34200 }, { "epoch": 303.96562430694166, "eval_loss": 6.383517265319824, "eval_runtime": 89.0065, "eval_samples_per_second": 112.351, "eval_steps_per_second": 3.517, "step": 34200 }, { "epoch": 304.8527389665114, "grad_norm": 0.16786985099315643, "learning_rate": 2.5785953177257527e-06, "loss": 6.365, "step": 34300 }, { "epoch": 304.8527389665114, "eval_loss": 6.381478786468506, "eval_runtime": 89.048, "eval_samples_per_second": 112.299, "eval_steps_per_second": 3.515, "step": 34300 }, { "epoch": 305.7398536260812, "grad_norm": 0.1815180480480194, "learning_rate": 2.568561872909699e-06, "loss": 6.365, "step": 34400 }, { "epoch": 305.7398536260812, "eval_loss": 6.379263877868652, "eval_runtime": 89.0151, "eval_samples_per_second": 112.34, "eval_steps_per_second": 3.516, "step": 34400 }, { "epoch": 306.62696828565095, "grad_norm": 0.23312950134277344, "learning_rate": 2.5585284280936454e-06, "loss": 6.3646, "step": 34500 }, { "epoch": 306.62696828565095, "eval_loss": 6.380245685577393, "eval_runtime": 89.0276, "eval_samples_per_second": 112.325, "eval_steps_per_second": 3.516, "step": 34500 }, { "epoch": 307.51408294522065, "grad_norm": 0.17679564654827118, "learning_rate": 2.548494983277592e-06, "loss": 6.3644, "step": 34600 }, { "epoch": 307.51408294522065, "eval_loss": 6.380576133728027, "eval_runtime": 89.0337, "eval_samples_per_second": 112.317, "eval_steps_per_second": 3.516, "step": 34600 }, { "epoch": 308.4011976047904, "grad_norm": 0.15505360066890717, "learning_rate": 2.5384615384615385e-06, "loss": 6.3652, "step": 34700 }, { "epoch": 308.4011976047904, "eval_loss": 6.379436492919922, "eval_runtime": 89.0636, "eval_samples_per_second": 112.279, "eval_steps_per_second": 3.514, "step": 34700 }, { "epoch": 309.2883122643602, "grad_norm": 0.1679382175207138, "learning_rate": 2.528428093645485e-06, "loss": 6.3651, "step": 34800 }, { "epoch": 309.2883122643602, "eval_loss": 6.37863302230835, "eval_runtime": 89.0287, "eval_samples_per_second": 112.323, "eval_steps_per_second": 3.516, "step": 34800 }, { "epoch": 310.17542692392993, "grad_norm": 0.1264224648475647, "learning_rate": 2.5183946488294316e-06, "loss": 6.365, "step": 34900 }, { "epoch": 310.17542692392993, "eval_loss": 6.381104469299316, "eval_runtime": 88.9777, "eval_samples_per_second": 112.388, "eval_steps_per_second": 3.518, "step": 34900 }, { "epoch": 311.0625415834997, "grad_norm": 0.17346155643463135, "learning_rate": 2.508361204013378e-06, "loss": 6.3654, "step": 35000 }, { "epoch": 311.0625415834997, "eval_loss": 6.379766464233398, "eval_runtime": 88.9982, "eval_samples_per_second": 112.362, "eval_steps_per_second": 3.517, "step": 35000 }, { "epoch": 311.9496562430694, "grad_norm": 0.2368006557226181, "learning_rate": 2.4983277591973247e-06, "loss": 6.3649, "step": 35100 }, { "epoch": 311.9496562430694, "eval_loss": 6.376424789428711, "eval_runtime": 89.004, "eval_samples_per_second": 112.354, "eval_steps_per_second": 3.517, "step": 35100 }, { "epoch": 312.83677090263916, "grad_norm": 0.14664936065673828, "learning_rate": 2.488294314381271e-06, "loss": 6.365, "step": 35200 }, { "epoch": 312.83677090263916, "eval_loss": 6.381261825561523, "eval_runtime": 88.9989, "eval_samples_per_second": 112.361, "eval_steps_per_second": 3.517, "step": 35200 }, { "epoch": 313.7238855622089, "grad_norm": 0.19366291165351868, "learning_rate": 2.4782608695652173e-06, "loss": 6.3656, "step": 35300 }, { "epoch": 313.7238855622089, "eval_loss": 6.381620407104492, "eval_runtime": 88.9954, "eval_samples_per_second": 112.365, "eval_steps_per_second": 3.517, "step": 35300 }, { "epoch": 314.6110002217787, "grad_norm": 0.17280568182468414, "learning_rate": 2.468227424749164e-06, "loss": 6.3645, "step": 35400 }, { "epoch": 314.6110002217787, "eval_loss": 6.376659870147705, "eval_runtime": 89.0013, "eval_samples_per_second": 112.358, "eval_steps_per_second": 3.517, "step": 35400 }, { "epoch": 315.49811488134844, "grad_norm": 0.20302744209766388, "learning_rate": 2.4581939799331104e-06, "loss": 6.3645, "step": 35500 }, { "epoch": 315.49811488134844, "eval_loss": 6.376570701599121, "eval_runtime": 88.9754, "eval_samples_per_second": 112.391, "eval_steps_per_second": 3.518, "step": 35500 }, { "epoch": 316.38522954091815, "grad_norm": 0.18067042529582977, "learning_rate": 2.4481605351170568e-06, "loss": 6.3643, "step": 35600 }, { "epoch": 316.38522954091815, "eval_loss": 6.377087593078613, "eval_runtime": 89.0091, "eval_samples_per_second": 112.348, "eval_steps_per_second": 3.516, "step": 35600 }, { "epoch": 317.2723442004879, "grad_norm": 0.17471148073673248, "learning_rate": 2.4381270903010035e-06, "loss": 6.3648, "step": 35700 }, { "epoch": 317.2723442004879, "eval_loss": 6.380537509918213, "eval_runtime": 88.9943, "eval_samples_per_second": 112.367, "eval_steps_per_second": 3.517, "step": 35700 }, { "epoch": 318.15945886005767, "grad_norm": 0.20188532769680023, "learning_rate": 2.42809364548495e-06, "loss": 6.3648, "step": 35800 }, { "epoch": 318.15945886005767, "eval_loss": 6.380505084991455, "eval_runtime": 89.0195, "eval_samples_per_second": 112.335, "eval_steps_per_second": 3.516, "step": 35800 }, { "epoch": 319.04657351962743, "grad_norm": 0.1507243514060974, "learning_rate": 2.4180602006688962e-06, "loss": 6.3644, "step": 35900 }, { "epoch": 319.04657351962743, "eval_loss": 6.3797736167907715, "eval_runtime": 89.0064, "eval_samples_per_second": 112.351, "eval_steps_per_second": 3.517, "step": 35900 }, { "epoch": 319.93368817919713, "grad_norm": 0.21795004606246948, "learning_rate": 2.408026755852843e-06, "loss": 6.3639, "step": 36000 }, { "epoch": 319.93368817919713, "eval_loss": 6.379575729370117, "eval_runtime": 88.9863, "eval_samples_per_second": 112.377, "eval_steps_per_second": 3.517, "step": 36000 }, { "epoch": 322.3211721327382, "grad_norm": 0.16106590628623962, "learning_rate": 2.3979933110367893e-06, "loss": 6.3637, "step": 36100 }, { "epoch": 322.3211721327382, "eval_loss": 6.3763837814331055, "eval_runtime": 51.0122, "eval_samples_per_second": 196.032, "eval_steps_per_second": 3.509, "step": 36100 }, { "epoch": 323.21385600621, "grad_norm": 0.1778295785188675, "learning_rate": 2.387959866220736e-06, "loss": 6.3645, "step": 36200 }, { "epoch": 323.21385600621, "eval_loss": 6.37896728515625, "eval_runtime": 51.0085, "eval_samples_per_second": 196.046, "eval_steps_per_second": 3.509, "step": 36200 }, { "epoch": 324.10653987968175, "grad_norm": 0.16518907248973846, "learning_rate": 2.3779264214046824e-06, "loss": 6.3644, "step": 36300 }, { "epoch": 324.10653987968175, "eval_loss": 6.379991054534912, "eval_runtime": 50.9898, "eval_samples_per_second": 196.118, "eval_steps_per_second": 3.511, "step": 36300 }, { "epoch": 324.9992237531535, "grad_norm": 0.17673678696155548, "learning_rate": 2.3678929765886288e-06, "loss": 6.363, "step": 36400 }, { "epoch": 324.9992237531535, "eval_loss": 6.377546310424805, "eval_runtime": 51.0024, "eval_samples_per_second": 196.069, "eval_steps_per_second": 3.51, "step": 36400 }, { "epoch": 325.89190762662525, "grad_norm": 0.18940462172031403, "learning_rate": 2.3578595317725755e-06, "loss": 6.3639, "step": 36500 }, { "epoch": 325.89190762662525, "eval_loss": 6.381035327911377, "eval_runtime": 50.9912, "eval_samples_per_second": 196.112, "eval_steps_per_second": 3.51, "step": 36500 }, { "epoch": 326.784591500097, "grad_norm": 0.17796489596366882, "learning_rate": 2.347826086956522e-06, "loss": 6.3641, "step": 36600 }, { "epoch": 326.784591500097, "eval_loss": 6.379162311553955, "eval_runtime": 50.9814, "eval_samples_per_second": 196.15, "eval_steps_per_second": 3.511, "step": 36600 }, { "epoch": 327.6772753735688, "grad_norm": 0.14749275147914886, "learning_rate": 2.337792642140468e-06, "loss": 6.3643, "step": 36700 }, { "epoch": 327.6772753735688, "eval_loss": 6.379159450531006, "eval_runtime": 51.0081, "eval_samples_per_second": 196.047, "eval_steps_per_second": 3.509, "step": 36700 }, { "epoch": 328.5699592470406, "grad_norm": 0.2123512327671051, "learning_rate": 2.327759197324415e-06, "loss": 6.3642, "step": 36800 }, { "epoch": 328.5699592470406, "eval_loss": 6.38007116317749, "eval_runtime": 50.9674, "eval_samples_per_second": 196.204, "eval_steps_per_second": 3.512, "step": 36800 }, { "epoch": 329.4626431205123, "grad_norm": 0.16111308336257935, "learning_rate": 2.3177257525083613e-06, "loss": 6.3642, "step": 36900 }, { "epoch": 329.4626431205123, "eval_loss": 6.381565570831299, "eval_runtime": 50.965, "eval_samples_per_second": 196.213, "eval_steps_per_second": 3.512, "step": 36900 }, { "epoch": 330.3553269939841, "grad_norm": 0.1736401915550232, "learning_rate": 2.307692307692308e-06, "loss": 6.3638, "step": 37000 }, { "epoch": 330.3553269939841, "eval_loss": 6.379702568054199, "eval_runtime": 50.9633, "eval_samples_per_second": 196.22, "eval_steps_per_second": 3.512, "step": 37000 }, { "epoch": 331.24801086745583, "grad_norm": 0.144011989235878, "learning_rate": 2.2976588628762544e-06, "loss": 6.3638, "step": 37100 }, { "epoch": 331.24801086745583, "eval_loss": 6.3794684410095215, "eval_runtime": 51.0336, "eval_samples_per_second": 195.949, "eval_steps_per_second": 3.507, "step": 37100 }, { "epoch": 332.14069474092764, "grad_norm": 0.18693791329860687, "learning_rate": 2.2876254180602008e-06, "loss": 6.364, "step": 37200 }, { "epoch": 332.14069474092764, "eval_loss": 6.369089126586914, "eval_runtime": 50.982, "eval_samples_per_second": 196.148, "eval_steps_per_second": 3.511, "step": 37200 }, { "epoch": 333.0333786143994, "grad_norm": 0.2004149854183197, "learning_rate": 2.2775919732441475e-06, "loss": 6.3636, "step": 37300 }, { "epoch": 333.0333786143994, "eval_loss": 6.379798889160156, "eval_runtime": 50.9846, "eval_samples_per_second": 196.138, "eval_steps_per_second": 3.511, "step": 37300 }, { "epoch": 333.92606248787115, "grad_norm": 0.21116772294044495, "learning_rate": 2.267558528428094e-06, "loss": 6.3638, "step": 37400 }, { "epoch": 333.92606248787115, "eval_loss": 6.378098487854004, "eval_runtime": 50.9792, "eval_samples_per_second": 196.159, "eval_steps_per_second": 3.511, "step": 37400 }, { "epoch": 334.8187463613429, "grad_norm": 0.20911183953285217, "learning_rate": 2.25752508361204e-06, "loss": 6.3648, "step": 37500 }, { "epoch": 334.8187463613429, "eval_loss": 6.374560356140137, "eval_runtime": 50.5111, "eval_samples_per_second": 197.976, "eval_steps_per_second": 3.544, "step": 37500 }, { "epoch": 335.71143023481466, "grad_norm": 0.1895991563796997, "learning_rate": 2.2474916387959865e-06, "loss": 6.3629, "step": 37600 }, { "epoch": 335.71143023481466, "eval_loss": 6.377721309661865, "eval_runtime": 50.9554, "eval_samples_per_second": 196.25, "eval_steps_per_second": 3.513, "step": 37600 }, { "epoch": 336.6041141082864, "grad_norm": 0.23114106059074402, "learning_rate": 2.237458193979933e-06, "loss": 6.3648, "step": 37700 }, { "epoch": 336.6041141082864, "eval_loss": 6.377990245819092, "eval_runtime": 51.011, "eval_samples_per_second": 196.036, "eval_steps_per_second": 3.509, "step": 37700 }, { "epoch": 337.4967979817582, "grad_norm": 0.1858934611082077, "learning_rate": 2.2274247491638796e-06, "loss": 6.3632, "step": 37800 }, { "epoch": 337.4967979817582, "eval_loss": 6.380919933319092, "eval_runtime": 50.986, "eval_samples_per_second": 196.132, "eval_steps_per_second": 3.511, "step": 37800 }, { "epoch": 338.38948185523, "grad_norm": 0.1767103672027588, "learning_rate": 2.217391304347826e-06, "loss": 6.3647, "step": 37900 }, { "epoch": 338.38948185523, "eval_loss": 6.374737739562988, "eval_runtime": 50.9864, "eval_samples_per_second": 196.131, "eval_steps_per_second": 3.511, "step": 37900 }, { "epoch": 339.2821657287017, "grad_norm": 0.17408744990825653, "learning_rate": 2.2073578595317723e-06, "loss": 6.3639, "step": 38000 }, { "epoch": 339.2821657287017, "eval_loss": 6.3790283203125, "eval_runtime": 50.9845, "eval_samples_per_second": 196.138, "eval_steps_per_second": 3.511, "step": 38000 }, { "epoch": 340.1748496021735, "grad_norm": 0.16043353080749512, "learning_rate": 2.197324414715719e-06, "loss": 6.3631, "step": 38100 }, { "epoch": 340.1748496021735, "eval_loss": 6.377453327178955, "eval_runtime": 51.0066, "eval_samples_per_second": 196.053, "eval_steps_per_second": 3.509, "step": 38100 }, { "epoch": 341.06753347564523, "grad_norm": 0.18346284329891205, "learning_rate": 2.1872909698996654e-06, "loss": 6.3638, "step": 38200 }, { "epoch": 341.06753347564523, "eval_loss": 6.3782172203063965, "eval_runtime": 50.987, "eval_samples_per_second": 196.129, "eval_steps_per_second": 3.511, "step": 38200 }, { "epoch": 341.96021734911704, "grad_norm": 0.1794682890176773, "learning_rate": 2.177257525083612e-06, "loss": 6.3642, "step": 38300 }, { "epoch": 341.96021734911704, "eval_loss": 6.383487701416016, "eval_runtime": 51.0216, "eval_samples_per_second": 195.996, "eval_steps_per_second": 3.508, "step": 38300 }, { "epoch": 342.8529012225888, "grad_norm": 0.18743447959423065, "learning_rate": 2.1672240802675585e-06, "loss": 6.3635, "step": 38400 }, { "epoch": 342.8529012225888, "eval_loss": 6.378910064697266, "eval_runtime": 50.985, "eval_samples_per_second": 196.136, "eval_steps_per_second": 3.511, "step": 38400 }, { "epoch": 343.74558509606055, "grad_norm": 0.21308189630508423, "learning_rate": 2.157190635451505e-06, "loss": 6.3638, "step": 38500 }, { "epoch": 343.74558509606055, "eval_loss": 6.3776469230651855, "eval_runtime": 51.0198, "eval_samples_per_second": 196.002, "eval_steps_per_second": 3.508, "step": 38500 }, { "epoch": 344.6382689695323, "grad_norm": 0.19906771183013916, "learning_rate": 2.1471571906354516e-06, "loss": 6.3635, "step": 38600 }, { "epoch": 344.6382689695323, "eval_loss": 6.378528118133545, "eval_runtime": 50.8807, "eval_samples_per_second": 196.538, "eval_steps_per_second": 3.518, "step": 38600 }, { "epoch": 345.53095284300406, "grad_norm": 0.15157081186771393, "learning_rate": 2.137123745819398e-06, "loss": 6.3638, "step": 38700 }, { "epoch": 345.53095284300406, "eval_loss": 6.377796649932861, "eval_runtime": 50.9807, "eval_samples_per_second": 196.153, "eval_steps_per_second": 3.511, "step": 38700 }, { "epoch": 346.4236367164758, "grad_norm": 0.13750579953193665, "learning_rate": 2.1270903010033443e-06, "loss": 6.3633, "step": 38800 }, { "epoch": 346.4236367164758, "eval_loss": 6.373489856719971, "eval_runtime": 51.0164, "eval_samples_per_second": 196.015, "eval_steps_per_second": 3.509, "step": 38800 }, { "epoch": 347.3163205899476, "grad_norm": 0.14071586728096008, "learning_rate": 2.117056856187291e-06, "loss": 6.3638, "step": 38900 }, { "epoch": 347.3163205899476, "eval_loss": 6.374903202056885, "eval_runtime": 50.9908, "eval_samples_per_second": 196.114, "eval_steps_per_second": 3.51, "step": 38900 }, { "epoch": 348.2090044634194, "grad_norm": 0.20056802034378052, "learning_rate": 2.1070234113712374e-06, "loss": 6.3625, "step": 39000 }, { "epoch": 348.2090044634194, "eval_loss": 6.374448299407959, "eval_runtime": 50.9627, "eval_samples_per_second": 196.222, "eval_steps_per_second": 3.512, "step": 39000 }, { "epoch": 349.10168833689113, "grad_norm": 0.1474703550338745, "learning_rate": 2.0969899665551837e-06, "loss": 6.3644, "step": 39100 }, { "epoch": 349.10168833689113, "eval_loss": 6.375302314758301, "eval_runtime": 51.0147, "eval_samples_per_second": 196.022, "eval_steps_per_second": 3.509, "step": 39100 }, { "epoch": 349.9943722103629, "grad_norm": 0.1974957287311554, "learning_rate": 2.0869565217391305e-06, "loss": 6.3636, "step": 39200 }, { "epoch": 349.9943722103629, "eval_loss": 6.3749308586120605, "eval_runtime": 50.9972, "eval_samples_per_second": 196.089, "eval_steps_per_second": 3.51, "step": 39200 }, { "epoch": 350.88705608383464, "grad_norm": 0.1811438351869583, "learning_rate": 2.076923076923077e-06, "loss": 6.3641, "step": 39300 }, { "epoch": 350.88705608383464, "eval_loss": 6.373296737670898, "eval_runtime": 51.0664, "eval_samples_per_second": 195.824, "eval_steps_per_second": 3.505, "step": 39300 }, { "epoch": 351.77973995730645, "grad_norm": 0.19500285387039185, "learning_rate": 2.0668896321070236e-06, "loss": 6.3635, "step": 39400 }, { "epoch": 351.77973995730645, "eval_loss": 6.3765153884887695, "eval_runtime": 50.9989, "eval_samples_per_second": 196.083, "eval_steps_per_second": 3.51, "step": 39400 }, { "epoch": 352.6724238307782, "grad_norm": 0.14763915538787842, "learning_rate": 2.05685618729097e-06, "loss": 6.363, "step": 39500 }, { "epoch": 352.6724238307782, "eval_loss": 6.380082607269287, "eval_runtime": 51.0221, "eval_samples_per_second": 195.993, "eval_steps_per_second": 3.508, "step": 39500 }, { "epoch": 353.56510770424995, "grad_norm": 0.14987926185131073, "learning_rate": 2.0468227424749163e-06, "loss": 6.3625, "step": 39600 }, { "epoch": 353.56510770424995, "eval_loss": 6.375669002532959, "eval_runtime": 50.9913, "eval_samples_per_second": 196.112, "eval_steps_per_second": 3.51, "step": 39600 }, { "epoch": 354.4577915777217, "grad_norm": 0.1568908393383026, "learning_rate": 2.036789297658863e-06, "loss": 6.3639, "step": 39700 }, { "epoch": 354.4577915777217, "eval_loss": 6.374993801116943, "eval_runtime": 50.9889, "eval_samples_per_second": 196.121, "eval_steps_per_second": 3.511, "step": 39700 }, { "epoch": 355.35047545119346, "grad_norm": 0.1752849966287613, "learning_rate": 2.0267558528428094e-06, "loss": 6.3636, "step": 39800 }, { "epoch": 355.35047545119346, "eval_loss": 6.3728227615356445, "eval_runtime": 51.0076, "eval_samples_per_second": 196.049, "eval_steps_per_second": 3.509, "step": 39800 }, { "epoch": 356.24315932466527, "grad_norm": 0.15474580228328705, "learning_rate": 2.0167224080267557e-06, "loss": 6.3632, "step": 39900 }, { "epoch": 356.24315932466527, "eval_loss": 6.374934196472168, "eval_runtime": 50.9903, "eval_samples_per_second": 196.116, "eval_steps_per_second": 3.51, "step": 39900 }, { "epoch": 357.135843198137, "grad_norm": 0.1670171320438385, "learning_rate": 2.0066889632107025e-06, "loss": 6.3632, "step": 40000 }, { "epoch": 357.135843198137, "eval_loss": 6.3780436515808105, "eval_runtime": 50.9795, "eval_samples_per_second": 196.157, "eval_steps_per_second": 3.511, "step": 40000 }, { "epoch": 358.0285270716088, "grad_norm": 0.159672349691391, "learning_rate": 1.996655518394649e-06, "loss": 6.3633, "step": 40100 }, { "epoch": 358.0285270716088, "eval_loss": 6.376949310302734, "eval_runtime": 50.9704, "eval_samples_per_second": 196.192, "eval_steps_per_second": 3.512, "step": 40100 }, { "epoch": 358.92121094508053, "grad_norm": 0.11732380092144012, "learning_rate": 1.986622073578595e-06, "loss": 6.3624, "step": 40200 }, { "epoch": 358.92121094508053, "eval_loss": 6.378962516784668, "eval_runtime": 51.2082, "eval_samples_per_second": 195.281, "eval_steps_per_second": 3.496, "step": 40200 }, { "epoch": 359.8138948185523, "grad_norm": 0.16079199314117432, "learning_rate": 1.976588628762542e-06, "loss": 6.3627, "step": 40300 }, { "epoch": 359.8138948185523, "eval_loss": 6.376839637756348, "eval_runtime": 51.2246, "eval_samples_per_second": 195.219, "eval_steps_per_second": 3.494, "step": 40300 }, { "epoch": 360.70657869202404, "grad_norm": 0.1894705593585968, "learning_rate": 1.9665551839464883e-06, "loss": 6.3629, "step": 40400 }, { "epoch": 360.70657869202404, "eval_loss": 6.376771450042725, "eval_runtime": 50.9722, "eval_samples_per_second": 196.185, "eval_steps_per_second": 3.512, "step": 40400 }, { "epoch": 361.59926256549585, "grad_norm": 0.15382538735866547, "learning_rate": 1.956521739130435e-06, "loss": 6.3629, "step": 40500 }, { "epoch": 361.59926256549585, "eval_loss": 6.377914905548096, "eval_runtime": 50.9641, "eval_samples_per_second": 196.217, "eval_steps_per_second": 3.512, "step": 40500 }, { "epoch": 362.4919464389676, "grad_norm": 0.20456081628799438, "learning_rate": 1.9464882943143814e-06, "loss": 6.3619, "step": 40600 }, { "epoch": 362.4919464389676, "eval_loss": 6.38068962097168, "eval_runtime": 50.9716, "eval_samples_per_second": 196.188, "eval_steps_per_second": 3.512, "step": 40600 }, { "epoch": 363.38463031243936, "grad_norm": 0.18184669315814972, "learning_rate": 1.9364548494983277e-06, "loss": 6.3628, "step": 40700 }, { "epoch": 363.38463031243936, "eval_loss": 6.375256061553955, "eval_runtime": 50.9921, "eval_samples_per_second": 196.109, "eval_steps_per_second": 3.51, "step": 40700 }, { "epoch": 364.2773141859111, "grad_norm": 0.12955954670906067, "learning_rate": 1.9264214046822745e-06, "loss": 6.3634, "step": 40800 }, { "epoch": 364.2773141859111, "eval_loss": 6.379732608795166, "eval_runtime": 50.9701, "eval_samples_per_second": 196.193, "eval_steps_per_second": 3.512, "step": 40800 }, { "epoch": 365.16999805938286, "grad_norm": 0.1785167008638382, "learning_rate": 1.916387959866221e-06, "loss": 6.3616, "step": 40900 }, { "epoch": 365.16999805938286, "eval_loss": 6.372657775878906, "eval_runtime": 50.9791, "eval_samples_per_second": 196.159, "eval_steps_per_second": 3.511, "step": 40900 }, { "epoch": 366.0626819328547, "grad_norm": 0.17105770111083984, "learning_rate": 1.9063545150501674e-06, "loss": 6.3622, "step": 41000 }, { "epoch": 366.0626819328547, "eval_loss": 6.378147602081299, "eval_runtime": 50.9646, "eval_samples_per_second": 196.214, "eval_steps_per_second": 3.512, "step": 41000 }, { "epoch": 366.9553658063264, "grad_norm": 0.16092269122600555, "learning_rate": 1.896321070234114e-06, "loss": 6.363, "step": 41100 }, { "epoch": 366.9553658063264, "eval_loss": 6.378008842468262, "eval_runtime": 50.971, "eval_samples_per_second": 196.19, "eval_steps_per_second": 3.512, "step": 41100 }, { "epoch": 367.8480496797982, "grad_norm": 0.18064095079898834, "learning_rate": 1.8862876254180603e-06, "loss": 6.363, "step": 41200 }, { "epoch": 367.8480496797982, "eval_loss": 6.373415470123291, "eval_runtime": 50.9712, "eval_samples_per_second": 196.189, "eval_steps_per_second": 3.512, "step": 41200 }, { "epoch": 368.74073355326993, "grad_norm": 0.14576148986816406, "learning_rate": 1.8762541806020068e-06, "loss": 6.3617, "step": 41300 }, { "epoch": 368.74073355326993, "eval_loss": 6.375607013702393, "eval_runtime": 50.965, "eval_samples_per_second": 196.213, "eval_steps_per_second": 3.512, "step": 41300 }, { "epoch": 369.6334174267417, "grad_norm": 0.14404740929603577, "learning_rate": 1.8662207357859534e-06, "loss": 6.3629, "step": 41400 }, { "epoch": 369.6334174267417, "eval_loss": 6.378086090087891, "eval_runtime": 50.9589, "eval_samples_per_second": 196.236, "eval_steps_per_second": 3.513, "step": 41400 }, { "epoch": 370.52610130021344, "grad_norm": 0.19737081229686737, "learning_rate": 1.8561872909699e-06, "loss": 6.3627, "step": 41500 }, { "epoch": 370.52610130021344, "eval_loss": 6.375402927398682, "eval_runtime": 50.9619, "eval_samples_per_second": 196.225, "eval_steps_per_second": 3.512, "step": 41500 }, { "epoch": 371.41878517368525, "grad_norm": 0.14666880667209625, "learning_rate": 1.8461538461538462e-06, "loss": 6.3621, "step": 41600 }, { "epoch": 371.41878517368525, "eval_loss": 6.375915050506592, "eval_runtime": 50.9649, "eval_samples_per_second": 196.213, "eval_steps_per_second": 3.512, "step": 41600 }, { "epoch": 372.311469047157, "grad_norm": 0.21582022309303284, "learning_rate": 1.8361204013377928e-06, "loss": 6.3626, "step": 41700 }, { "epoch": 372.311469047157, "eval_loss": 6.38447904586792, "eval_runtime": 50.9609, "eval_samples_per_second": 196.229, "eval_steps_per_second": 3.512, "step": 41700 }, { "epoch": 373.20415292062876, "grad_norm": 0.1295013576745987, "learning_rate": 1.8260869565217394e-06, "loss": 6.362, "step": 41800 }, { "epoch": 373.20415292062876, "eval_loss": 6.375004768371582, "eval_runtime": 50.9807, "eval_samples_per_second": 196.153, "eval_steps_per_second": 3.511, "step": 41800 }, { "epoch": 374.0968367941005, "grad_norm": 0.21674145758152008, "learning_rate": 1.8160535117056857e-06, "loss": 6.3622, "step": 41900 }, { "epoch": 374.0968367941005, "eval_loss": 6.373767375946045, "eval_runtime": 50.9601, "eval_samples_per_second": 196.232, "eval_steps_per_second": 3.513, "step": 41900 }, { "epoch": 374.98952066757226, "grad_norm": 0.16833952069282532, "learning_rate": 1.8060200668896322e-06, "loss": 6.3621, "step": 42000 }, { "epoch": 374.98952066757226, "eval_loss": 6.375979900360107, "eval_runtime": 50.9671, "eval_samples_per_second": 196.205, "eval_steps_per_second": 3.512, "step": 42000 }, { "epoch": 375.8822045410441, "grad_norm": 0.13281434774398804, "learning_rate": 1.7959866220735788e-06, "loss": 6.3622, "step": 42100 }, { "epoch": 375.8822045410441, "eval_loss": 6.377115726470947, "eval_runtime": 51.0774, "eval_samples_per_second": 195.781, "eval_steps_per_second": 3.504, "step": 42100 }, { "epoch": 376.77488841451583, "grad_norm": 0.14955252408981323, "learning_rate": 1.7859531772575253e-06, "loss": 6.3622, "step": 42200 }, { "epoch": 376.77488841451583, "eval_loss": 6.378284454345703, "eval_runtime": 50.975, "eval_samples_per_second": 196.175, "eval_steps_per_second": 3.512, "step": 42200 }, { "epoch": 377.6675722879876, "grad_norm": 0.1695183515548706, "learning_rate": 1.7759197324414717e-06, "loss": 6.3609, "step": 42300 }, { "epoch": 377.6675722879876, "eval_loss": 6.377320766448975, "eval_runtime": 50.9555, "eval_samples_per_second": 196.25, "eval_steps_per_second": 3.513, "step": 42300 }, { "epoch": 378.56025616145934, "grad_norm": 0.1487826108932495, "learning_rate": 1.7658862876254182e-06, "loss": 6.3636, "step": 42400 }, { "epoch": 378.56025616145934, "eval_loss": 6.373607158660889, "eval_runtime": 50.958, "eval_samples_per_second": 196.24, "eval_steps_per_second": 3.513, "step": 42400 }, { "epoch": 379.4529400349311, "grad_norm": 0.15890148282051086, "learning_rate": 1.7558528428093648e-06, "loss": 6.3622, "step": 42500 }, { "epoch": 379.4529400349311, "eval_loss": 6.378411769866943, "eval_runtime": 50.9578, "eval_samples_per_second": 196.241, "eval_steps_per_second": 3.513, "step": 42500 }, { "epoch": 380.3456239084029, "grad_norm": 0.13191881775856018, "learning_rate": 1.745819397993311e-06, "loss": 6.3625, "step": 42600 }, { "epoch": 380.3456239084029, "eval_loss": 6.380100250244141, "eval_runtime": 50.9563, "eval_samples_per_second": 196.246, "eval_steps_per_second": 3.513, "step": 42600 }, { "epoch": 381.23830778187465, "grad_norm": 0.13398431241512299, "learning_rate": 1.7357859531772575e-06, "loss": 6.3631, "step": 42700 }, { "epoch": 381.23830778187465, "eval_loss": 6.372678756713867, "eval_runtime": 50.967, "eval_samples_per_second": 196.205, "eval_steps_per_second": 3.512, "step": 42700 }, { "epoch": 382.1309916553464, "grad_norm": 0.1774672120809555, "learning_rate": 1.7257525083612038e-06, "loss": 6.3619, "step": 42800 }, { "epoch": 382.1309916553464, "eval_loss": 6.374143600463867, "eval_runtime": 50.9527, "eval_samples_per_second": 196.26, "eval_steps_per_second": 3.513, "step": 42800 }, { "epoch": 383.02367552881816, "grad_norm": 0.15919719636440277, "learning_rate": 1.7157190635451504e-06, "loss": 6.3625, "step": 42900 }, { "epoch": 383.02367552881816, "eval_loss": 6.380612373352051, "eval_runtime": 50.9597, "eval_samples_per_second": 196.233, "eval_steps_per_second": 3.513, "step": 42900 }, { "epoch": 383.9163594022899, "grad_norm": 0.15100547671318054, "learning_rate": 1.705685618729097e-06, "loss": 6.3624, "step": 43000 }, { "epoch": 383.9163594022899, "eval_loss": 6.375205039978027, "eval_runtime": 51.0178, "eval_samples_per_second": 196.01, "eval_steps_per_second": 3.509, "step": 43000 }, { "epoch": 384.80904327576167, "grad_norm": 0.17773090302944183, "learning_rate": 1.6956521739130435e-06, "loss": 6.3622, "step": 43100 }, { "epoch": 384.80904327576167, "eval_loss": 6.377906322479248, "eval_runtime": 50.9528, "eval_samples_per_second": 196.26, "eval_steps_per_second": 3.513, "step": 43100 }, { "epoch": 385.7017271492335, "grad_norm": 0.16673114895820618, "learning_rate": 1.6856187290969898e-06, "loss": 6.3614, "step": 43200 }, { "epoch": 385.7017271492335, "eval_loss": 6.3741583824157715, "eval_runtime": 50.9886, "eval_samples_per_second": 196.122, "eval_steps_per_second": 3.511, "step": 43200 }, { "epoch": 386.59441102270523, "grad_norm": 0.13911914825439453, "learning_rate": 1.6755852842809363e-06, "loss": 6.3627, "step": 43300 }, { "epoch": 386.59441102270523, "eval_loss": 6.376387596130371, "eval_runtime": 50.9745, "eval_samples_per_second": 196.177, "eval_steps_per_second": 3.512, "step": 43300 }, { "epoch": 387.487094896177, "grad_norm": 0.14674533903598785, "learning_rate": 1.665551839464883e-06, "loss": 6.3615, "step": 43400 }, { "epoch": 387.487094896177, "eval_loss": 6.374913692474365, "eval_runtime": 50.964, "eval_samples_per_second": 196.217, "eval_steps_per_second": 3.512, "step": 43400 }, { "epoch": 388.37977876964874, "grad_norm": 0.14424017071723938, "learning_rate": 1.6555183946488294e-06, "loss": 6.3614, "step": 43500 }, { "epoch": 388.37977876964874, "eval_loss": 6.3738508224487305, "eval_runtime": 50.9746, "eval_samples_per_second": 196.176, "eval_steps_per_second": 3.512, "step": 43500 }, { "epoch": 389.2724626431205, "grad_norm": 0.12726858258247375, "learning_rate": 1.6454849498327758e-06, "loss": 6.3631, "step": 43600 }, { "epoch": 389.2724626431205, "eval_loss": 6.377626895904541, "eval_runtime": 50.9831, "eval_samples_per_second": 196.143, "eval_steps_per_second": 3.511, "step": 43600 }, { "epoch": 390.1651465165923, "grad_norm": 0.1261419951915741, "learning_rate": 1.6354515050167223e-06, "loss": 6.362, "step": 43700 }, { "epoch": 390.1651465165923, "eval_loss": 6.371913433074951, "eval_runtime": 50.9952, "eval_samples_per_second": 196.097, "eval_steps_per_second": 3.51, "step": 43700 }, { "epoch": 391.05783039006405, "grad_norm": 0.15761396288871765, "learning_rate": 1.6254180602006689e-06, "loss": 6.3625, "step": 43800 }, { "epoch": 391.05783039006405, "eval_loss": 6.372257709503174, "eval_runtime": 50.9814, "eval_samples_per_second": 196.15, "eval_steps_per_second": 3.511, "step": 43800 }, { "epoch": 391.9505142635358, "grad_norm": 0.14318187534809113, "learning_rate": 1.6153846153846154e-06, "loss": 6.3622, "step": 43900 }, { "epoch": 391.9505142635358, "eval_loss": 6.375759601593018, "eval_runtime": 50.9942, "eval_samples_per_second": 196.101, "eval_steps_per_second": 3.51, "step": 43900 }, { "epoch": 392.84319813700756, "grad_norm": 0.13848328590393066, "learning_rate": 1.6053511705685618e-06, "loss": 6.3612, "step": 44000 }, { "epoch": 392.84319813700756, "eval_loss": 6.376217842102051, "eval_runtime": 50.9908, "eval_samples_per_second": 196.114, "eval_steps_per_second": 3.51, "step": 44000 }, { "epoch": 393.7358820104793, "grad_norm": 0.13598565757274628, "learning_rate": 1.5953177257525083e-06, "loss": 6.3625, "step": 44100 }, { "epoch": 393.7358820104793, "eval_loss": 6.37490701675415, "eval_runtime": 50.978, "eval_samples_per_second": 196.163, "eval_steps_per_second": 3.511, "step": 44100 }, { "epoch": 394.62856588395107, "grad_norm": 0.14148621261119843, "learning_rate": 1.5852842809364549e-06, "loss": 6.3615, "step": 44200 }, { "epoch": 394.62856588395107, "eval_loss": 6.378378868103027, "eval_runtime": 50.9657, "eval_samples_per_second": 196.21, "eval_steps_per_second": 3.512, "step": 44200 }, { "epoch": 395.5212497574229, "grad_norm": 0.13936679065227509, "learning_rate": 1.5752508361204012e-06, "loss": 6.3626, "step": 44300 }, { "epoch": 395.5212497574229, "eval_loss": 6.374247074127197, "eval_runtime": 50.9816, "eval_samples_per_second": 196.149, "eval_steps_per_second": 3.511, "step": 44300 }, { "epoch": 396.41393363089463, "grad_norm": 0.163307785987854, "learning_rate": 1.5652173913043478e-06, "loss": 6.3611, "step": 44400 }, { "epoch": 396.41393363089463, "eval_loss": 6.37465763092041, "eval_runtime": 50.9876, "eval_samples_per_second": 196.126, "eval_steps_per_second": 3.511, "step": 44400 }, { "epoch": 397.3066175043664, "grad_norm": 0.1514696627855301, "learning_rate": 1.5551839464882943e-06, "loss": 6.3614, "step": 44500 }, { "epoch": 397.3066175043664, "eval_loss": 6.374813079833984, "eval_runtime": 50.9704, "eval_samples_per_second": 196.192, "eval_steps_per_second": 3.512, "step": 44500 }, { "epoch": 398.19930137783814, "grad_norm": 0.12864980101585388, "learning_rate": 1.5451505016722409e-06, "loss": 6.3611, "step": 44600 }, { "epoch": 398.19930137783814, "eval_loss": 6.374229431152344, "eval_runtime": 50.9713, "eval_samples_per_second": 196.189, "eval_steps_per_second": 3.512, "step": 44600 }, { "epoch": 399.0919852513099, "grad_norm": 0.18459634482860565, "learning_rate": 1.5351170568561872e-06, "loss": 6.3623, "step": 44700 }, { "epoch": 399.0919852513099, "eval_loss": 6.374811172485352, "eval_runtime": 50.9833, "eval_samples_per_second": 196.143, "eval_steps_per_second": 3.511, "step": 44700 }, { "epoch": 399.9846691247817, "grad_norm": 0.14292342960834503, "learning_rate": 1.5250836120401338e-06, "loss": 6.3611, "step": 44800 }, { "epoch": 399.9846691247817, "eval_loss": 6.373171329498291, "eval_runtime": 50.971, "eval_samples_per_second": 196.19, "eval_steps_per_second": 3.512, "step": 44800 }, { "epoch": 400.87735299825346, "grad_norm": 0.14087602496147156, "learning_rate": 1.5150501672240803e-06, "loss": 6.3619, "step": 44900 }, { "epoch": 400.87735299825346, "eval_loss": 6.3750786781311035, "eval_runtime": 50.9873, "eval_samples_per_second": 196.127, "eval_steps_per_second": 3.511, "step": 44900 }, { "epoch": 401.7700368717252, "grad_norm": 0.1677563190460205, "learning_rate": 1.5050167224080269e-06, "loss": 6.361, "step": 45000 }, { "epoch": 401.7700368717252, "eval_loss": 6.37678337097168, "eval_runtime": 50.9768, "eval_samples_per_second": 196.168, "eval_steps_per_second": 3.511, "step": 45000 }, { "epoch": 402.66272074519696, "grad_norm": 0.16920335590839386, "learning_rate": 1.4949832775919732e-06, "loss": 6.3622, "step": 45100 }, { "epoch": 402.66272074519696, "eval_loss": 6.371730327606201, "eval_runtime": 51.1672, "eval_samples_per_second": 195.438, "eval_steps_per_second": 3.498, "step": 45100 }, { "epoch": 403.5554046186687, "grad_norm": 0.1975216269493103, "learning_rate": 1.4849498327759198e-06, "loss": 6.3615, "step": 45200 }, { "epoch": 403.5554046186687, "eval_loss": 6.373182773590088, "eval_runtime": 50.97, "eval_samples_per_second": 196.194, "eval_steps_per_second": 3.512, "step": 45200 }, { "epoch": 404.4480884921405, "grad_norm": 0.14191223680973053, "learning_rate": 1.4749163879598663e-06, "loss": 6.3616, "step": 45300 }, { "epoch": 404.4480884921405, "eval_loss": 6.373088359832764, "eval_runtime": 51.0328, "eval_samples_per_second": 195.952, "eval_steps_per_second": 3.508, "step": 45300 }, { "epoch": 405.3407723656123, "grad_norm": 0.1346922665834427, "learning_rate": 1.4648829431438129e-06, "loss": 6.3612, "step": 45400 }, { "epoch": 405.3407723656123, "eval_loss": 6.374698162078857, "eval_runtime": 50.9921, "eval_samples_per_second": 196.109, "eval_steps_per_second": 3.51, "step": 45400 }, { "epoch": 406.23345623908403, "grad_norm": 0.14625421166419983, "learning_rate": 1.4548494983277592e-06, "loss": 6.3618, "step": 45500 }, { "epoch": 406.23345623908403, "eval_loss": 6.374713897705078, "eval_runtime": 50.9902, "eval_samples_per_second": 196.116, "eval_steps_per_second": 3.51, "step": 45500 }, { "epoch": 407.1261401125558, "grad_norm": 0.1339327096939087, "learning_rate": 1.4448160535117058e-06, "loss": 6.3614, "step": 45600 }, { "epoch": 407.1261401125558, "eval_loss": 6.375463962554932, "eval_runtime": 50.9843, "eval_samples_per_second": 196.139, "eval_steps_per_second": 3.511, "step": 45600 }, { "epoch": 408.01882398602754, "grad_norm": 0.1191440001130104, "learning_rate": 1.4347826086956523e-06, "loss": 6.3616, "step": 45700 }, { "epoch": 408.01882398602754, "eval_loss": 6.372775554656982, "eval_runtime": 50.976, "eval_samples_per_second": 196.171, "eval_steps_per_second": 3.511, "step": 45700 }, { "epoch": 408.9115078594993, "grad_norm": 0.14053776860237122, "learning_rate": 1.4247491638795989e-06, "loss": 6.3615, "step": 45800 }, { "epoch": 408.9115078594993, "eval_loss": 6.376742362976074, "eval_runtime": 50.9922, "eval_samples_per_second": 196.108, "eval_steps_per_second": 3.51, "step": 45800 }, { "epoch": 409.8041917329711, "grad_norm": 0.1356232613325119, "learning_rate": 1.4147157190635452e-06, "loss": 6.3608, "step": 45900 }, { "epoch": 409.8041917329711, "eval_loss": 6.3739728927612305, "eval_runtime": 50.9685, "eval_samples_per_second": 196.2, "eval_steps_per_second": 3.512, "step": 45900 }, { "epoch": 410.69687560644286, "grad_norm": 0.17138876020908356, "learning_rate": 1.4046822742474917e-06, "loss": 6.3613, "step": 46000 }, { "epoch": 410.69687560644286, "eval_loss": 6.381918907165527, "eval_runtime": 50.9709, "eval_samples_per_second": 196.19, "eval_steps_per_second": 3.512, "step": 46000 }, { "epoch": 411.5895594799146, "grad_norm": 0.15673908591270447, "learning_rate": 1.3946488294314383e-06, "loss": 6.3619, "step": 46100 }, { "epoch": 411.5895594799146, "eval_loss": 6.375350475311279, "eval_runtime": 50.9723, "eval_samples_per_second": 196.185, "eval_steps_per_second": 3.512, "step": 46100 }, { "epoch": 412.48224335338637, "grad_norm": 0.13772110641002655, "learning_rate": 1.3846153846153846e-06, "loss": 6.3609, "step": 46200 }, { "epoch": 412.48224335338637, "eval_loss": 6.374034881591797, "eval_runtime": 50.9636, "eval_samples_per_second": 196.219, "eval_steps_per_second": 3.512, "step": 46200 }, { "epoch": 413.3749272268581, "grad_norm": 0.12614521384239197, "learning_rate": 1.374581939799331e-06, "loss": 6.3617, "step": 46300 }, { "epoch": 413.3749272268581, "eval_loss": 6.375347137451172, "eval_runtime": 50.9521, "eval_samples_per_second": 196.263, "eval_steps_per_second": 3.513, "step": 46300 }, { "epoch": 414.26761110032993, "grad_norm": 0.13640394806861877, "learning_rate": 1.3645484949832775e-06, "loss": 6.3608, "step": 46400 }, { "epoch": 414.26761110032993, "eval_loss": 6.378127574920654, "eval_runtime": 50.9727, "eval_samples_per_second": 196.184, "eval_steps_per_second": 3.512, "step": 46400 }, { "epoch": 415.1602949738017, "grad_norm": 0.17697331309318542, "learning_rate": 1.354515050167224e-06, "loss": 6.3614, "step": 46500 }, { "epoch": 415.1602949738017, "eval_loss": 6.370326995849609, "eval_runtime": 50.9684, "eval_samples_per_second": 196.2, "eval_steps_per_second": 3.512, "step": 46500 }, { "epoch": 416.05297884727344, "grad_norm": 0.12979310750961304, "learning_rate": 1.3444816053511706e-06, "loss": 6.3618, "step": 46600 }, { "epoch": 416.05297884727344, "eval_loss": 6.3708062171936035, "eval_runtime": 50.983, "eval_samples_per_second": 196.144, "eval_steps_per_second": 3.511, "step": 46600 }, { "epoch": 416.9456627207452, "grad_norm": 0.1369139850139618, "learning_rate": 1.334448160535117e-06, "loss": 6.3616, "step": 46700 }, { "epoch": 416.9456627207452, "eval_loss": 6.375351905822754, "eval_runtime": 50.979, "eval_samples_per_second": 196.159, "eval_steps_per_second": 3.511, "step": 46700 }, { "epoch": 417.83834659421694, "grad_norm": 0.1491391658782959, "learning_rate": 1.3244147157190635e-06, "loss": 6.3612, "step": 46800 }, { "epoch": 417.83834659421694, "eval_loss": 6.378176689147949, "eval_runtime": 50.9644, "eval_samples_per_second": 196.215, "eval_steps_per_second": 3.512, "step": 46800 }, { "epoch": 418.7310304676887, "grad_norm": 0.1265108585357666, "learning_rate": 1.31438127090301e-06, "loss": 6.361, "step": 46900 }, { "epoch": 418.7310304676887, "eval_loss": 6.372585773468018, "eval_runtime": 50.9948, "eval_samples_per_second": 196.098, "eval_steps_per_second": 3.51, "step": 46900 }, { "epoch": 419.6237143411605, "grad_norm": 0.16357433795928955, "learning_rate": 1.3043478260869566e-06, "loss": 6.3608, "step": 47000 }, { "epoch": 419.6237143411605, "eval_loss": 6.373856067657471, "eval_runtime": 50.9849, "eval_samples_per_second": 196.137, "eval_steps_per_second": 3.511, "step": 47000 }, { "epoch": 420.51639821463226, "grad_norm": 0.12764860689640045, "learning_rate": 1.294314381270903e-06, "loss": 6.3618, "step": 47100 }, { "epoch": 420.51639821463226, "eval_loss": 6.377871513366699, "eval_runtime": 50.9803, "eval_samples_per_second": 196.154, "eval_steps_per_second": 3.511, "step": 47100 }, { "epoch": 421.409082088104, "grad_norm": 0.14270265400409698, "learning_rate": 1.2842809364548495e-06, "loss": 6.3608, "step": 47200 }, { "epoch": 421.409082088104, "eval_loss": 6.3771162033081055, "eval_runtime": 50.9877, "eval_samples_per_second": 196.126, "eval_steps_per_second": 3.511, "step": 47200 }, { "epoch": 422.30176596157577, "grad_norm": 0.13178826868534088, "learning_rate": 1.274247491638796e-06, "loss": 6.3612, "step": 47300 }, { "epoch": 422.30176596157577, "eval_loss": 6.375566482543945, "eval_runtime": 50.9884, "eval_samples_per_second": 196.123, "eval_steps_per_second": 3.511, "step": 47300 }, { "epoch": 423.1944498350475, "grad_norm": 0.17805926501750946, "learning_rate": 1.2642140468227424e-06, "loss": 6.361, "step": 47400 }, { "epoch": 423.1944498350475, "eval_loss": 6.3782830238342285, "eval_runtime": 50.983, "eval_samples_per_second": 196.144, "eval_steps_per_second": 3.511, "step": 47400 }, { "epoch": 424.08713370851933, "grad_norm": 0.12532693147659302, "learning_rate": 1.254180602006689e-06, "loss": 6.3615, "step": 47500 }, { "epoch": 424.08713370851933, "eval_loss": 6.372131824493408, "eval_runtime": 50.9739, "eval_samples_per_second": 196.179, "eval_steps_per_second": 3.512, "step": 47500 }, { "epoch": 424.9798175819911, "grad_norm": 0.18605230748653412, "learning_rate": 1.2441471571906355e-06, "loss": 6.3608, "step": 47600 }, { "epoch": 424.9798175819911, "eval_loss": 6.375829696655273, "eval_runtime": 50.9794, "eval_samples_per_second": 196.158, "eval_steps_per_second": 3.511, "step": 47600 }, { "epoch": 425.87250145546284, "grad_norm": 0.13004036247730255, "learning_rate": 1.234113712374582e-06, "loss": 6.3611, "step": 47700 }, { "epoch": 425.87250145546284, "eval_loss": 6.3748297691345215, "eval_runtime": 50.9638, "eval_samples_per_second": 196.218, "eval_steps_per_second": 3.512, "step": 47700 }, { "epoch": 426.7651853289346, "grad_norm": 0.14566391706466675, "learning_rate": 1.2240802675585284e-06, "loss": 6.3614, "step": 47800 }, { "epoch": 426.7651853289346, "eval_loss": 6.375539302825928, "eval_runtime": 50.9667, "eval_samples_per_second": 196.206, "eval_steps_per_second": 3.512, "step": 47800 }, { "epoch": 427.65786920240635, "grad_norm": 0.12622636556625366, "learning_rate": 1.214046822742475e-06, "loss": 6.3602, "step": 47900 }, { "epoch": 427.65786920240635, "eval_loss": 6.371495723724365, "eval_runtime": 50.9753, "eval_samples_per_second": 196.174, "eval_steps_per_second": 3.512, "step": 47900 }, { "epoch": 428.55055307587816, "grad_norm": 0.14083540439605713, "learning_rate": 1.2040133779264215e-06, "loss": 6.3616, "step": 48000 }, { "epoch": 428.55055307587816, "eval_loss": 6.37429141998291, "eval_runtime": 50.9764, "eval_samples_per_second": 196.169, "eval_steps_per_second": 3.511, "step": 48000 }, { "epoch": 429.4432369493499, "grad_norm": 0.12131120264530182, "learning_rate": 1.193979933110368e-06, "loss": 6.3611, "step": 48100 }, { "epoch": 429.4432369493499, "eval_loss": 6.371769428253174, "eval_runtime": 51.0086, "eval_samples_per_second": 196.045, "eval_steps_per_second": 3.509, "step": 48100 }, { "epoch": 430.33592082282166, "grad_norm": 0.11834459006786346, "learning_rate": 1.1839464882943144e-06, "loss": 6.3605, "step": 48200 }, { "epoch": 430.33592082282166, "eval_loss": 6.368320465087891, "eval_runtime": 50.9661, "eval_samples_per_second": 196.209, "eval_steps_per_second": 3.512, "step": 48200 }, { "epoch": 431.2286046962934, "grad_norm": 0.13733911514282227, "learning_rate": 1.173913043478261e-06, "loss": 6.3607, "step": 48300 }, { "epoch": 431.2286046962934, "eval_loss": 6.371362686157227, "eval_runtime": 50.9504, "eval_samples_per_second": 196.269, "eval_steps_per_second": 3.513, "step": 48300 }, { "epoch": 432.12128856976517, "grad_norm": 0.12458811700344086, "learning_rate": 1.1638795986622075e-06, "loss": 6.3604, "step": 48400 }, { "epoch": 432.12128856976517, "eval_loss": 6.372464179992676, "eval_runtime": 50.9762, "eval_samples_per_second": 196.17, "eval_steps_per_second": 3.511, "step": 48400 }, { "epoch": 433.0139724432369, "grad_norm": 0.16090624034404755, "learning_rate": 1.153846153846154e-06, "loss": 6.3611, "step": 48500 }, { "epoch": 433.0139724432369, "eval_loss": 6.373631000518799, "eval_runtime": 50.9618, "eval_samples_per_second": 196.226, "eval_steps_per_second": 3.512, "step": 48500 }, { "epoch": 433.90665631670873, "grad_norm": 0.12443886697292328, "learning_rate": 1.1438127090301004e-06, "loss": 6.361, "step": 48600 }, { "epoch": 433.90665631670873, "eval_loss": 6.3762993812561035, "eval_runtime": 50.9606, "eval_samples_per_second": 196.23, "eval_steps_per_second": 3.513, "step": 48600 }, { "epoch": 434.7993401901805, "grad_norm": 0.14061865210533142, "learning_rate": 1.133779264214047e-06, "loss": 6.36, "step": 48700 }, { "epoch": 434.7993401901805, "eval_loss": 6.3731865882873535, "eval_runtime": 50.9932, "eval_samples_per_second": 196.105, "eval_steps_per_second": 3.51, "step": 48700 }, { "epoch": 435.69202406365224, "grad_norm": 0.12875817716121674, "learning_rate": 1.1237458193979933e-06, "loss": 6.3614, "step": 48800 }, { "epoch": 435.69202406365224, "eval_loss": 6.372591018676758, "eval_runtime": 50.9814, "eval_samples_per_second": 196.15, "eval_steps_per_second": 3.511, "step": 48800 }, { "epoch": 436.584707937124, "grad_norm": 0.1300763338804245, "learning_rate": 1.1137123745819398e-06, "loss": 6.3611, "step": 48900 }, { "epoch": 436.584707937124, "eval_loss": 6.375086784362793, "eval_runtime": 50.9667, "eval_samples_per_second": 196.207, "eval_steps_per_second": 3.512, "step": 48900 }, { "epoch": 437.47739181059575, "grad_norm": 0.12522312998771667, "learning_rate": 1.1036789297658862e-06, "loss": 6.3605, "step": 49000 }, { "epoch": 437.47739181059575, "eval_loss": 6.373082637786865, "eval_runtime": 50.9686, "eval_samples_per_second": 196.199, "eval_steps_per_second": 3.512, "step": 49000 }, { "epoch": 438.37007568406756, "grad_norm": 0.15034428238868713, "learning_rate": 1.0936454849498327e-06, "loss": 6.3601, "step": 49100 }, { "epoch": 438.37007568406756, "eval_loss": 6.369637489318848, "eval_runtime": 50.9806, "eval_samples_per_second": 196.153, "eval_steps_per_second": 3.511, "step": 49100 }, { "epoch": 439.2627595575393, "grad_norm": 0.14699020981788635, "learning_rate": 1.0836120401337793e-06, "loss": 6.3602, "step": 49200 }, { "epoch": 439.2627595575393, "eval_loss": 6.3717498779296875, "eval_runtime": 50.9494, "eval_samples_per_second": 196.273, "eval_steps_per_second": 3.513, "step": 49200 }, { "epoch": 440.15544343101107, "grad_norm": 0.1339484453201294, "learning_rate": 1.0735785953177258e-06, "loss": 6.3608, "step": 49300 }, { "epoch": 440.15544343101107, "eval_loss": 6.374644756317139, "eval_runtime": 50.9591, "eval_samples_per_second": 196.236, "eval_steps_per_second": 3.513, "step": 49300 }, { "epoch": 441.0481273044828, "grad_norm": 0.10889836400747299, "learning_rate": 1.0635451505016722e-06, "loss": 6.3602, "step": 49400 }, { "epoch": 441.0481273044828, "eval_loss": 6.375630855560303, "eval_runtime": 50.9618, "eval_samples_per_second": 196.225, "eval_steps_per_second": 3.512, "step": 49400 }, { "epoch": 441.9408111779546, "grad_norm": 0.135609433054924, "learning_rate": 1.0535117056856187e-06, "loss": 6.3596, "step": 49500 }, { "epoch": 441.9408111779546, "eval_loss": 6.37455940246582, "eval_runtime": 50.968, "eval_samples_per_second": 196.201, "eval_steps_per_second": 3.512, "step": 49500 }, { "epoch": 442.8334950514263, "grad_norm": 0.13086004555225372, "learning_rate": 1.0434782608695653e-06, "loss": 6.3601, "step": 49600 }, { "epoch": 442.8334950514263, "eval_loss": 6.375424385070801, "eval_runtime": 50.9762, "eval_samples_per_second": 196.17, "eval_steps_per_second": 3.511, "step": 49600 }, { "epoch": 443.72617892489814, "grad_norm": 0.1462557315826416, "learning_rate": 1.0334448160535118e-06, "loss": 6.3606, "step": 49700 }, { "epoch": 443.72617892489814, "eval_loss": 6.376568794250488, "eval_runtime": 50.9824, "eval_samples_per_second": 196.146, "eval_steps_per_second": 3.511, "step": 49700 }, { "epoch": 444.6188627983699, "grad_norm": 0.15183542668819427, "learning_rate": 1.0234113712374581e-06, "loss": 6.3595, "step": 49800 }, { "epoch": 444.6188627983699, "eval_loss": 6.368979454040527, "eval_runtime": 50.9624, "eval_samples_per_second": 196.223, "eval_steps_per_second": 3.512, "step": 49800 }, { "epoch": 445.51154667184164, "grad_norm": 0.1357332020998001, "learning_rate": 1.0133779264214047e-06, "loss": 6.3605, "step": 49900 }, { "epoch": 445.51154667184164, "eval_loss": 6.374391555786133, "eval_runtime": 50.959, "eval_samples_per_second": 196.236, "eval_steps_per_second": 3.513, "step": 49900 }, { "epoch": 446.4042305453134, "grad_norm": 0.14846473932266235, "learning_rate": 1.0033444816053512e-06, "loss": 6.3608, "step": 50000 }, { "epoch": 446.4042305453134, "eval_loss": 6.372031211853027, "eval_runtime": 50.9866, "eval_samples_per_second": 196.13, "eval_steps_per_second": 3.511, "step": 50000 }, { "epoch": 447.29691441878515, "grad_norm": 0.1612795740365982, "learning_rate": 9.933110367892976e-07, "loss": 6.3606, "step": 50100 }, { "epoch": 447.29691441878515, "eval_loss": 6.372196674346924, "eval_runtime": 51.0079, "eval_samples_per_second": 196.048, "eval_steps_per_second": 3.509, "step": 50100 }, { "epoch": 448.18959829225696, "grad_norm": 0.1360219269990921, "learning_rate": 9.832775919732441e-07, "loss": 6.3605, "step": 50200 }, { "epoch": 448.18959829225696, "eval_loss": 6.374830722808838, "eval_runtime": 50.9535, "eval_samples_per_second": 196.257, "eval_steps_per_second": 3.513, "step": 50200 }, { "epoch": 449.0822821657287, "grad_norm": 0.14171314239501953, "learning_rate": 9.732441471571907e-07, "loss": 6.36, "step": 50300 }, { "epoch": 449.0822821657287, "eval_loss": 6.374056816101074, "eval_runtime": 50.9648, "eval_samples_per_second": 196.214, "eval_steps_per_second": 3.512, "step": 50300 }, { "epoch": 449.97496603920047, "grad_norm": 0.10322766751050949, "learning_rate": 9.632107023411372e-07, "loss": 6.3595, "step": 50400 }, { "epoch": 449.97496603920047, "eval_loss": 6.373784065246582, "eval_runtime": 50.9502, "eval_samples_per_second": 196.27, "eval_steps_per_second": 3.513, "step": 50400 }, { "epoch": 450.8676499126722, "grad_norm": 0.14763601124286652, "learning_rate": 9.531772575250837e-07, "loss": 6.3593, "step": 50500 }, { "epoch": 450.8676499126722, "eval_loss": 6.373796463012695, "eval_runtime": 50.9901, "eval_samples_per_second": 196.117, "eval_steps_per_second": 3.51, "step": 50500 }, { "epoch": 451.760333786144, "grad_norm": 0.18021999299526215, "learning_rate": 9.431438127090301e-07, "loss": 6.3612, "step": 50600 }, { "epoch": 451.760333786144, "eval_loss": 6.371494293212891, "eval_runtime": 50.9922, "eval_samples_per_second": 196.108, "eval_steps_per_second": 3.51, "step": 50600 }, { "epoch": 452.6530176596158, "grad_norm": 0.1338716447353363, "learning_rate": 9.331103678929767e-07, "loss": 6.3594, "step": 50700 }, { "epoch": 452.6530176596158, "eval_loss": 6.3735032081604, "eval_runtime": 50.4979, "eval_samples_per_second": 198.028, "eval_steps_per_second": 3.545, "step": 50700 }, { "epoch": 453.54570153308754, "grad_norm": 0.11512942612171173, "learning_rate": 9.230769230769231e-07, "loss": 6.3605, "step": 50800 }, { "epoch": 453.54570153308754, "eval_loss": 6.373264789581299, "eval_runtime": 50.9877, "eval_samples_per_second": 196.126, "eval_steps_per_second": 3.511, "step": 50800 }, { "epoch": 454.4383854065593, "grad_norm": 0.09796648472547531, "learning_rate": 9.130434782608697e-07, "loss": 6.3601, "step": 50900 }, { "epoch": 454.4383854065593, "eval_loss": 6.374275207519531, "eval_runtime": 50.9875, "eval_samples_per_second": 196.126, "eval_steps_per_second": 3.511, "step": 50900 }, { "epoch": 455.33106928003104, "grad_norm": 0.1316356211900711, "learning_rate": 9.030100334448161e-07, "loss": 6.3601, "step": 51000 }, { "epoch": 455.33106928003104, "eval_loss": 6.374828338623047, "eval_runtime": 50.4891, "eval_samples_per_second": 198.063, "eval_steps_per_second": 3.545, "step": 51000 }, { "epoch": 456.2237531535028, "grad_norm": 0.17832376062870026, "learning_rate": 8.929765886287627e-07, "loss": 6.3604, "step": 51100 }, { "epoch": 456.2237531535028, "eval_loss": 6.371827602386475, "eval_runtime": 50.9826, "eval_samples_per_second": 196.145, "eval_steps_per_second": 3.511, "step": 51100 }, { "epoch": 457.11643702697455, "grad_norm": 0.14637400209903717, "learning_rate": 8.829431438127091e-07, "loss": 6.36, "step": 51200 }, { "epoch": 457.11643702697455, "eval_loss": 6.375898361206055, "eval_runtime": 50.495, "eval_samples_per_second": 198.039, "eval_steps_per_second": 3.545, "step": 51200 }, { "epoch": 458.00912090044636, "grad_norm": 0.16641865670681, "learning_rate": 8.729096989966555e-07, "loss": 6.3595, "step": 51300 }, { "epoch": 458.00912090044636, "eval_loss": 6.375617027282715, "eval_runtime": 50.9794, "eval_samples_per_second": 196.158, "eval_steps_per_second": 3.511, "step": 51300 }, { "epoch": 458.9018047739181, "grad_norm": 0.12667568027973175, "learning_rate": 8.628762541806019e-07, "loss": 6.3599, "step": 51400 }, { "epoch": 458.9018047739181, "eval_loss": 6.368325710296631, "eval_runtime": 50.4918, "eval_samples_per_second": 198.052, "eval_steps_per_second": 3.545, "step": 51400 }, { "epoch": 459.79448864738987, "grad_norm": 0.1586967408657074, "learning_rate": 8.528428093645485e-07, "loss": 6.3599, "step": 51500 }, { "epoch": 459.79448864738987, "eval_loss": 6.37186861038208, "eval_runtime": 50.9603, "eval_samples_per_second": 196.231, "eval_steps_per_second": 3.513, "step": 51500 }, { "epoch": 460.6871725208616, "grad_norm": 0.11572112888097763, "learning_rate": 8.428093645484949e-07, "loss": 6.3597, "step": 51600 }, { "epoch": 460.6871725208616, "eval_loss": 6.371321678161621, "eval_runtime": 50.9929, "eval_samples_per_second": 196.106, "eval_steps_per_second": 3.51, "step": 51600 }, { "epoch": 461.5798563943334, "grad_norm": 0.12478705495595932, "learning_rate": 8.327759197324414e-07, "loss": 6.3598, "step": 51700 }, { "epoch": 461.5798563943334, "eval_loss": 6.373435974121094, "eval_runtime": 50.9766, "eval_samples_per_second": 196.168, "eval_steps_per_second": 3.511, "step": 51700 }, { "epoch": 462.4725402678052, "grad_norm": 0.12946990132331848, "learning_rate": 8.227424749163879e-07, "loss": 6.3613, "step": 51800 }, { "epoch": 462.4725402678052, "eval_loss": 6.371443748474121, "eval_runtime": 50.9724, "eval_samples_per_second": 196.185, "eval_steps_per_second": 3.512, "step": 51800 }, { "epoch": 463.36522414127694, "grad_norm": 0.13125728070735931, "learning_rate": 8.127090301003344e-07, "loss": 6.3602, "step": 51900 }, { "epoch": 463.36522414127694, "eval_loss": 6.373104095458984, "eval_runtime": 50.946, "eval_samples_per_second": 196.286, "eval_steps_per_second": 3.514, "step": 51900 }, { "epoch": 464.2579080147487, "grad_norm": 0.1575118899345398, "learning_rate": 8.026755852842809e-07, "loss": 6.3599, "step": 52000 }, { "epoch": 464.2579080147487, "eval_loss": 6.371898651123047, "eval_runtime": 50.9549, "eval_samples_per_second": 196.252, "eval_steps_per_second": 3.513, "step": 52000 }, { "epoch": 465.15059188822045, "grad_norm": 0.13345403969287872, "learning_rate": 7.926421404682274e-07, "loss": 6.3604, "step": 52100 }, { "epoch": 465.15059188822045, "eval_loss": 6.374370098114014, "eval_runtime": 50.488, "eval_samples_per_second": 198.067, "eval_steps_per_second": 3.545, "step": 52100 }, { "epoch": 466.0432757616922, "grad_norm": 0.12134841084480286, "learning_rate": 7.826086956521739e-07, "loss": 6.3597, "step": 52200 }, { "epoch": 466.0432757616922, "eval_loss": 6.370124816894531, "eval_runtime": 50.9572, "eval_samples_per_second": 196.243, "eval_steps_per_second": 3.513, "step": 52200 }, { "epoch": 466.93595963516395, "grad_norm": 0.14935283362865448, "learning_rate": 7.725752508361204e-07, "loss": 6.3599, "step": 52300 }, { "epoch": 466.93595963516395, "eval_loss": 6.372580051422119, "eval_runtime": 50.9516, "eval_samples_per_second": 196.265, "eval_steps_per_second": 3.513, "step": 52300 }, { "epoch": 467.82864350863576, "grad_norm": 0.11806395649909973, "learning_rate": 7.625418060200669e-07, "loss": 6.3602, "step": 52400 }, { "epoch": 467.82864350863576, "eval_loss": 6.37704610824585, "eval_runtime": 50.9684, "eval_samples_per_second": 196.2, "eval_steps_per_second": 3.512, "step": 52400 }, { "epoch": 468.7213273821075, "grad_norm": 0.1526840329170227, "learning_rate": 7.525083612040134e-07, "loss": 6.3594, "step": 52500 }, { "epoch": 468.7213273821075, "eval_loss": 6.372363090515137, "eval_runtime": 50.9653, "eval_samples_per_second": 196.212, "eval_steps_per_second": 3.512, "step": 52500 }, { "epoch": 469.61401125557927, "grad_norm": 0.1198643147945404, "learning_rate": 7.424749163879599e-07, "loss": 6.3602, "step": 52600 }, { "epoch": 469.61401125557927, "eval_loss": 6.370110034942627, "eval_runtime": 50.9739, "eval_samples_per_second": 196.179, "eval_steps_per_second": 3.512, "step": 52600 }, { "epoch": 470.506695129051, "grad_norm": 0.12439325451850891, "learning_rate": 7.324414715719064e-07, "loss": 6.3597, "step": 52700 }, { "epoch": 470.506695129051, "eval_loss": 6.370666980743408, "eval_runtime": 50.4975, "eval_samples_per_second": 198.03, "eval_steps_per_second": 3.545, "step": 52700 }, { "epoch": 471.3993790025228, "grad_norm": 0.13444113731384277, "learning_rate": 7.224080267558529e-07, "loss": 6.359, "step": 52800 }, { "epoch": 471.3993790025228, "eval_loss": 6.369675159454346, "eval_runtime": 50.9791, "eval_samples_per_second": 196.159, "eval_steps_per_second": 3.511, "step": 52800 }, { "epoch": 472.2920628759946, "grad_norm": 0.11212828010320663, "learning_rate": 7.123745819397994e-07, "loss": 6.3595, "step": 52900 }, { "epoch": 472.2920628759946, "eval_loss": 6.36935567855835, "eval_runtime": 50.9962, "eval_samples_per_second": 196.093, "eval_steps_per_second": 3.51, "step": 52900 }, { "epoch": 473.18474674946634, "grad_norm": 0.1080106794834137, "learning_rate": 7.023411371237459e-07, "loss": 6.3595, "step": 53000 }, { "epoch": 473.18474674946634, "eval_loss": 6.37483024597168, "eval_runtime": 50.9694, "eval_samples_per_second": 196.196, "eval_steps_per_second": 3.512, "step": 53000 }, { "epoch": 474.0774306229381, "grad_norm": 0.131260484457016, "learning_rate": 6.923076923076923e-07, "loss": 6.3599, "step": 53100 }, { "epoch": 474.0774306229381, "eval_loss": 6.372048377990723, "eval_runtime": 50.9726, "eval_samples_per_second": 196.184, "eval_steps_per_second": 3.512, "step": 53100 }, { "epoch": 474.97011449640985, "grad_norm": 0.11120131611824036, "learning_rate": 6.822742474916388e-07, "loss": 6.3595, "step": 53200 }, { "epoch": 474.97011449640985, "eval_loss": 6.371298789978027, "eval_runtime": 50.9746, "eval_samples_per_second": 196.176, "eval_steps_per_second": 3.512, "step": 53200 }, { "epoch": 475.8627983698816, "grad_norm": 0.1382032185792923, "learning_rate": 6.722408026755853e-07, "loss": 6.3597, "step": 53300 }, { "epoch": 475.8627983698816, "eval_loss": 6.375929832458496, "eval_runtime": 50.9847, "eval_samples_per_second": 196.137, "eval_steps_per_second": 3.511, "step": 53300 }, { "epoch": 476.7554822433534, "grad_norm": 0.11284707486629486, "learning_rate": 6.622073578595318e-07, "loss": 6.3591, "step": 53400 }, { "epoch": 476.7554822433534, "eval_loss": 6.373961925506592, "eval_runtime": 50.9718, "eval_samples_per_second": 196.187, "eval_steps_per_second": 3.512, "step": 53400 }, { "epoch": 477.64816611682517, "grad_norm": 0.11296847462654114, "learning_rate": 6.521739130434783e-07, "loss": 6.3599, "step": 53500 }, { "epoch": 477.64816611682517, "eval_loss": 6.373483657836914, "eval_runtime": 50.9566, "eval_samples_per_second": 196.245, "eval_steps_per_second": 3.513, "step": 53500 }, { "epoch": 478.5408499902969, "grad_norm": 0.1363115906715393, "learning_rate": 6.421404682274248e-07, "loss": 6.3597, "step": 53600 }, { "epoch": 478.5408499902969, "eval_loss": 6.37340784072876, "eval_runtime": 50.9626, "eval_samples_per_second": 196.222, "eval_steps_per_second": 3.512, "step": 53600 }, { "epoch": 479.4335338637687, "grad_norm": 0.12509457767009735, "learning_rate": 6.321070234113712e-07, "loss": 6.3593, "step": 53700 }, { "epoch": 479.4335338637687, "eval_loss": 6.374527931213379, "eval_runtime": 50.9733, "eval_samples_per_second": 196.181, "eval_steps_per_second": 3.512, "step": 53700 }, { "epoch": 480.3262177372404, "grad_norm": 0.1320326179265976, "learning_rate": 6.220735785953178e-07, "loss": 6.3593, "step": 53800 }, { "epoch": 480.3262177372404, "eval_loss": 6.376550674438477, "eval_runtime": 50.966, "eval_samples_per_second": 196.209, "eval_steps_per_second": 3.512, "step": 53800 }, { "epoch": 481.2189016107122, "grad_norm": 0.1382244974374771, "learning_rate": 6.120401337792642e-07, "loss": 6.3598, "step": 53900 }, { "epoch": 481.2189016107122, "eval_loss": 6.372669696807861, "eval_runtime": 50.9557, "eval_samples_per_second": 196.249, "eval_steps_per_second": 3.513, "step": 53900 }, { "epoch": 482.111585484184, "grad_norm": 0.12267334014177322, "learning_rate": 6.020066889632107e-07, "loss": 6.3601, "step": 54000 }, { "epoch": 482.111585484184, "eval_loss": 6.377495765686035, "eval_runtime": 50.9659, "eval_samples_per_second": 196.21, "eval_steps_per_second": 3.512, "step": 54000 }, { "epoch": 483.00426935765574, "grad_norm": 0.13831213116645813, "learning_rate": 5.919732441471572e-07, "loss": 6.3593, "step": 54100 }, { "epoch": 483.00426935765574, "eval_loss": 6.3768439292907715, "eval_runtime": 51.0259, "eval_samples_per_second": 195.979, "eval_steps_per_second": 3.508, "step": 54100 }, { "epoch": 483.8969532311275, "grad_norm": 0.127532958984375, "learning_rate": 5.819397993311037e-07, "loss": 6.36, "step": 54200 }, { "epoch": 483.8969532311275, "eval_loss": 6.369021415710449, "eval_runtime": 50.5058, "eval_samples_per_second": 197.997, "eval_steps_per_second": 3.544, "step": 54200 }, { "epoch": 484.78963710459925, "grad_norm": 0.11770881712436676, "learning_rate": 5.719063545150502e-07, "loss": 6.3589, "step": 54300 }, { "epoch": 484.78963710459925, "eval_loss": 6.375646591186523, "eval_runtime": 50.9866, "eval_samples_per_second": 196.13, "eval_steps_per_second": 3.511, "step": 54300 }, { "epoch": 485.682320978071, "grad_norm": 0.1295900046825409, "learning_rate": 5.618729096989966e-07, "loss": 6.3594, "step": 54400 }, { "epoch": 485.682320978071, "eval_loss": 6.371916770935059, "eval_runtime": 50.9696, "eval_samples_per_second": 196.196, "eval_steps_per_second": 3.512, "step": 54400 }, { "epoch": 486.5750048515428, "grad_norm": 0.11955253779888153, "learning_rate": 5.518394648829431e-07, "loss": 6.3595, "step": 54500 }, { "epoch": 486.5750048515428, "eval_loss": 6.3733906745910645, "eval_runtime": 50.9551, "eval_samples_per_second": 196.251, "eval_steps_per_second": 3.513, "step": 54500 }, { "epoch": 487.46768872501457, "grad_norm": 0.12596124410629272, "learning_rate": 5.418060200668896e-07, "loss": 6.3597, "step": 54600 }, { "epoch": 487.46768872501457, "eval_loss": 6.372114658355713, "eval_runtime": 50.4972, "eval_samples_per_second": 198.031, "eval_steps_per_second": 3.545, "step": 54600 }, { "epoch": 488.3603725984863, "grad_norm": 0.1110687404870987, "learning_rate": 5.317725752508361e-07, "loss": 6.3591, "step": 54700 }, { "epoch": 488.3603725984863, "eval_loss": 6.370881080627441, "eval_runtime": 50.963, "eval_samples_per_second": 196.221, "eval_steps_per_second": 3.512, "step": 54700 }, { "epoch": 489.2530564719581, "grad_norm": 0.12368372082710266, "learning_rate": 5.217391304347826e-07, "loss": 6.3595, "step": 54800 }, { "epoch": 489.2530564719581, "eval_loss": 6.371975421905518, "eval_runtime": 50.9641, "eval_samples_per_second": 196.216, "eval_steps_per_second": 3.512, "step": 54800 }, { "epoch": 490.14574034542983, "grad_norm": 0.1045992448925972, "learning_rate": 5.117056856187291e-07, "loss": 6.3587, "step": 54900 }, { "epoch": 490.14574034542983, "eval_loss": 6.374923229217529, "eval_runtime": 50.9721, "eval_samples_per_second": 196.186, "eval_steps_per_second": 3.512, "step": 54900 }, { "epoch": 491.03842421890164, "grad_norm": 0.12338841706514359, "learning_rate": 5.016722408026756e-07, "loss": 6.3605, "step": 55000 }, { "epoch": 491.03842421890164, "eval_loss": 6.367209434509277, "eval_runtime": 50.9647, "eval_samples_per_second": 196.214, "eval_steps_per_second": 3.512, "step": 55000 }, { "epoch": 491.9311080923734, "grad_norm": 0.12877170741558075, "learning_rate": 4.916387959866221e-07, "loss": 6.3591, "step": 55100 }, { "epoch": 491.9311080923734, "eval_loss": 6.373247146606445, "eval_runtime": 50.9752, "eval_samples_per_second": 196.174, "eval_steps_per_second": 3.512, "step": 55100 }, { "epoch": 492.82379196584515, "grad_norm": 0.1188189759850502, "learning_rate": 4.816053511705686e-07, "loss": 6.3586, "step": 55200 }, { "epoch": 492.82379196584515, "eval_loss": 6.371592998504639, "eval_runtime": 50.9797, "eval_samples_per_second": 196.157, "eval_steps_per_second": 3.511, "step": 55200 }, { "epoch": 493.7164758393169, "grad_norm": 0.14705920219421387, "learning_rate": 4.7157190635451506e-07, "loss": 6.3589, "step": 55300 }, { "epoch": 493.7164758393169, "eval_loss": 6.375323295593262, "eval_runtime": 50.9746, "eval_samples_per_second": 196.176, "eval_steps_per_second": 3.512, "step": 55300 }, { "epoch": 494.60915971278865, "grad_norm": 0.1193486750125885, "learning_rate": 4.6153846153846156e-07, "loss": 6.3604, "step": 55400 }, { "epoch": 494.60915971278865, "eval_loss": 6.3740973472595215, "eval_runtime": 50.966, "eval_samples_per_second": 196.209, "eval_steps_per_second": 3.512, "step": 55400 }, { "epoch": 495.5018435862604, "grad_norm": 0.12742812931537628, "learning_rate": 4.5150501672240806e-07, "loss": 6.3603, "step": 55500 }, { "epoch": 495.5018435862604, "eval_loss": 6.37678337097168, "eval_runtime": 50.9604, "eval_samples_per_second": 196.231, "eval_steps_per_second": 3.513, "step": 55500 }, { "epoch": 496.3945274597322, "grad_norm": 0.1414756029844284, "learning_rate": 4.4147157190635456e-07, "loss": 6.3595, "step": 55600 }, { "epoch": 496.3945274597322, "eval_loss": 6.373994827270508, "eval_runtime": 50.9792, "eval_samples_per_second": 196.158, "eval_steps_per_second": 3.511, "step": 55600 }, { "epoch": 497.28721133320397, "grad_norm": 0.11560999602079391, "learning_rate": 4.3143812709030095e-07, "loss": 6.3599, "step": 55700 }, { "epoch": 497.28721133320397, "eval_loss": 6.374427318572998, "eval_runtime": 50.5007, "eval_samples_per_second": 198.017, "eval_steps_per_second": 3.545, "step": 55700 }, { "epoch": 498.1798952066757, "grad_norm": 0.16057543456554413, "learning_rate": 4.2140468227424745e-07, "loss": 6.3604, "step": 55800 }, { "epoch": 498.1798952066757, "eval_loss": 6.375630855560303, "eval_runtime": 50.9586, "eval_samples_per_second": 196.238, "eval_steps_per_second": 3.513, "step": 55800 }, { "epoch": 499.0725790801475, "grad_norm": 0.14680643379688263, "learning_rate": 4.1137123745819395e-07, "loss": 6.3589, "step": 55900 }, { "epoch": 499.0725790801475, "eval_loss": 6.373570919036865, "eval_runtime": 50.4998, "eval_samples_per_second": 198.02, "eval_steps_per_second": 3.545, "step": 55900 }, { "epoch": 499.96526295361923, "grad_norm": 0.12228725850582123, "learning_rate": 4.0133779264214045e-07, "loss": 6.3594, "step": 56000 }, { "epoch": 499.96526295361923, "eval_loss": 6.371649742126465, "eval_runtime": 50.9786, "eval_samples_per_second": 196.161, "eval_steps_per_second": 3.511, "step": 56000 }, { "epoch": 500.85794682709104, "grad_norm": 0.12265335768461227, "learning_rate": 3.9130434782608694e-07, "loss": 6.3594, "step": 56100 }, { "epoch": 500.85794682709104, "eval_loss": 6.376364231109619, "eval_runtime": 50.9881, "eval_samples_per_second": 196.124, "eval_steps_per_second": 3.511, "step": 56100 }, { "epoch": 501.7506307005628, "grad_norm": 0.10380034893751144, "learning_rate": 3.8127090301003344e-07, "loss": 6.36, "step": 56200 }, { "epoch": 501.7506307005628, "eval_loss": 6.37660551071167, "eval_runtime": 50.9903, "eval_samples_per_second": 196.116, "eval_steps_per_second": 3.51, "step": 56200 }, { "epoch": 502.64331457403455, "grad_norm": 0.1066294014453888, "learning_rate": 3.7123745819397994e-07, "loss": 6.3596, "step": 56300 }, { "epoch": 502.64331457403455, "eval_loss": 6.371345043182373, "eval_runtime": 51.0067, "eval_samples_per_second": 196.053, "eval_steps_per_second": 3.509, "step": 56300 }, { "epoch": 503.5359984475063, "grad_norm": 0.12047789245843887, "learning_rate": 3.6120401337792644e-07, "loss": 6.3592, "step": 56400 }, { "epoch": 503.5359984475063, "eval_loss": 6.371187686920166, "eval_runtime": 50.502, "eval_samples_per_second": 198.012, "eval_steps_per_second": 3.544, "step": 56400 }, { "epoch": 504.42868232097806, "grad_norm": 0.12361543625593185, "learning_rate": 3.5117056856187294e-07, "loss": 6.3589, "step": 56500 }, { "epoch": 504.42868232097806, "eval_loss": 6.369196891784668, "eval_runtime": 50.9845, "eval_samples_per_second": 196.138, "eval_steps_per_second": 3.511, "step": 56500 }, { "epoch": 505.3213661944498, "grad_norm": 0.10645488649606705, "learning_rate": 3.411371237458194e-07, "loss": 6.3595, "step": 56600 }, { "epoch": 505.3213661944498, "eval_loss": 6.372078895568848, "eval_runtime": 50.9783, "eval_samples_per_second": 196.162, "eval_steps_per_second": 3.511, "step": 56600 }, { "epoch": 506.2140500679216, "grad_norm": 0.12366556376218796, "learning_rate": 3.311036789297659e-07, "loss": 6.3604, "step": 56700 }, { "epoch": 506.2140500679216, "eval_loss": 6.3741960525512695, "eval_runtime": 50.54, "eval_samples_per_second": 197.863, "eval_steps_per_second": 3.542, "step": 56700 }, { "epoch": 507.1067339413934, "grad_norm": 0.10554321855306625, "learning_rate": 3.210702341137124e-07, "loss": 6.3593, "step": 56800 }, { "epoch": 507.1067339413934, "eval_loss": 6.375464916229248, "eval_runtime": 50.9673, "eval_samples_per_second": 196.204, "eval_steps_per_second": 3.512, "step": 56800 }, { "epoch": 507.9994178148651, "grad_norm": 0.11263983696699142, "learning_rate": 3.110367892976589e-07, "loss": 6.3597, "step": 56900 }, { "epoch": 507.9994178148651, "eval_loss": 6.370204925537109, "eval_runtime": 50.9973, "eval_samples_per_second": 196.089, "eval_steps_per_second": 3.51, "step": 56900 }, { "epoch": 508.8921016883369, "grad_norm": 0.11769650131464005, "learning_rate": 3.010033444816054e-07, "loss": 6.3589, "step": 57000 }, { "epoch": 508.8921016883369, "eval_loss": 6.374892234802246, "eval_runtime": 51.0033, "eval_samples_per_second": 196.066, "eval_steps_per_second": 3.51, "step": 57000 }, { "epoch": 509.78478556180863, "grad_norm": 0.12533652782440186, "learning_rate": 2.9096989966555187e-07, "loss": 6.3585, "step": 57100 }, { "epoch": 509.78478556180863, "eval_loss": 6.370015621185303, "eval_runtime": 50.9934, "eval_samples_per_second": 196.104, "eval_steps_per_second": 3.51, "step": 57100 }, { "epoch": 510.67746943528044, "grad_norm": 0.11758119612932205, "learning_rate": 2.809364548494983e-07, "loss": 6.3588, "step": 57200 }, { "epoch": 510.67746943528044, "eval_loss": 6.374600410461426, "eval_runtime": 50.4993, "eval_samples_per_second": 198.023, "eval_steps_per_second": 3.545, "step": 57200 }, { "epoch": 511.5701533087522, "grad_norm": 0.13065285980701447, "learning_rate": 2.709030100334448e-07, "loss": 6.3595, "step": 57300 }, { "epoch": 511.5701533087522, "eval_loss": 6.372690677642822, "eval_runtime": 50.9923, "eval_samples_per_second": 196.108, "eval_steps_per_second": 3.51, "step": 57300 }, { "epoch": 512.4628371822239, "grad_norm": 0.11216452717781067, "learning_rate": 2.608695652173913e-07, "loss": 6.3594, "step": 57400 }, { "epoch": 512.4628371822239, "eval_loss": 6.370244026184082, "eval_runtime": 50.981, "eval_samples_per_second": 196.152, "eval_steps_per_second": 3.511, "step": 57400 }, { "epoch": 513.3555210556957, "grad_norm": 0.11593976616859436, "learning_rate": 2.508361204013378e-07, "loss": 6.3599, "step": 57500 }, { "epoch": 513.3555210556957, "eval_loss": 6.3737688064575195, "eval_runtime": 50.9877, "eval_samples_per_second": 196.126, "eval_steps_per_second": 3.511, "step": 57500 }, { "epoch": 514.2482049291675, "grad_norm": 0.1154174879193306, "learning_rate": 2.408026755852843e-07, "loss": 6.3598, "step": 57600 }, { "epoch": 514.2482049291675, "eval_loss": 6.373289108276367, "eval_runtime": 50.9752, "eval_samples_per_second": 196.174, "eval_steps_per_second": 3.512, "step": 57600 }, { "epoch": 515.1408888026392, "grad_norm": 0.12078119069337845, "learning_rate": 2.3076923076923078e-07, "loss": 6.3592, "step": 57700 }, { "epoch": 515.1408888026392, "eval_loss": 6.371698379516602, "eval_runtime": 50.9768, "eval_samples_per_second": 196.168, "eval_steps_per_second": 3.511, "step": 57700 }, { "epoch": 516.033572676111, "grad_norm": 0.09368869662284851, "learning_rate": 2.2073578595317728e-07, "loss": 6.3593, "step": 57800 }, { "epoch": 516.033572676111, "eval_loss": 6.372560024261475, "eval_runtime": 50.9893, "eval_samples_per_second": 196.119, "eval_steps_per_second": 3.511, "step": 57800 }, { "epoch": 516.9262565495827, "grad_norm": 0.09950955212116241, "learning_rate": 2.1070234113712372e-07, "loss": 6.3593, "step": 57900 }, { "epoch": 516.9262565495827, "eval_loss": 6.375257968902588, "eval_runtime": 50.9655, "eval_samples_per_second": 196.211, "eval_steps_per_second": 3.512, "step": 57900 }, { "epoch": 517.8189404230545, "grad_norm": 0.12712809443473816, "learning_rate": 2.0066889632107022e-07, "loss": 6.3587, "step": 58000 }, { "epoch": 517.8189404230545, "eval_loss": 6.374295234680176, "eval_runtime": 50.9826, "eval_samples_per_second": 196.145, "eval_steps_per_second": 3.511, "step": 58000 }, { "epoch": 518.7116242965263, "grad_norm": 0.11053524911403656, "learning_rate": 1.9063545150501672e-07, "loss": 6.3594, "step": 58100 }, { "epoch": 518.7116242965263, "eval_loss": 6.376541614532471, "eval_runtime": 50.9747, "eval_samples_per_second": 196.176, "eval_steps_per_second": 3.512, "step": 58100 }, { "epoch": 519.604308169998, "grad_norm": 0.10716045647859573, "learning_rate": 1.8060200668896322e-07, "loss": 6.3586, "step": 58200 }, { "epoch": 519.604308169998, "eval_loss": 6.373443126678467, "eval_runtime": 50.9793, "eval_samples_per_second": 196.158, "eval_steps_per_second": 3.511, "step": 58200 }, { "epoch": 520.4969920434698, "grad_norm": 0.1010851114988327, "learning_rate": 1.705685618729097e-07, "loss": 6.3583, "step": 58300 }, { "epoch": 520.4969920434698, "eval_loss": 6.375570297241211, "eval_runtime": 50.9829, "eval_samples_per_second": 196.144, "eval_steps_per_second": 3.511, "step": 58300 }, { "epoch": 521.3896759169415, "grad_norm": 0.10243038833141327, "learning_rate": 1.605351170568562e-07, "loss": 6.359, "step": 58400 }, { "epoch": 521.3896759169415, "eval_loss": 6.37014627456665, "eval_runtime": 50.9806, "eval_samples_per_second": 196.153, "eval_steps_per_second": 3.511, "step": 58400 }, { "epoch": 522.2823597904134, "grad_norm": 0.11007111519575119, "learning_rate": 1.505016722408027e-07, "loss": 6.3597, "step": 58500 }, { "epoch": 522.2823597904134, "eval_loss": 6.367834091186523, "eval_runtime": 50.9773, "eval_samples_per_second": 196.166, "eval_steps_per_second": 3.511, "step": 58500 }, { "epoch": 523.1750436638852, "grad_norm": 0.10557661205530167, "learning_rate": 1.4046822742474916e-07, "loss": 6.3597, "step": 58600 }, { "epoch": 523.1750436638852, "eval_loss": 6.3743696212768555, "eval_runtime": 50.9815, "eval_samples_per_second": 196.15, "eval_steps_per_second": 3.511, "step": 58600 }, { "epoch": 524.0677275373569, "grad_norm": 0.11409670859575272, "learning_rate": 1.3043478260869566e-07, "loss": 6.3595, "step": 58700 }, { "epoch": 524.0677275373569, "eval_loss": 6.372434139251709, "eval_runtime": 50.9833, "eval_samples_per_second": 196.143, "eval_steps_per_second": 3.511, "step": 58700 }, { "epoch": 524.9604114108287, "grad_norm": 0.11429371684789658, "learning_rate": 1.2040133779264215e-07, "loss": 6.3583, "step": 58800 }, { "epoch": 524.9604114108287, "eval_loss": 6.374448776245117, "eval_runtime": 50.9877, "eval_samples_per_second": 196.126, "eval_steps_per_second": 3.511, "step": 58800 }, { "epoch": 525.8530952843004, "grad_norm": 0.11243493109941483, "learning_rate": 1.1036789297658864e-07, "loss": 6.3594, "step": 58900 }, { "epoch": 525.8530952843004, "eval_loss": 6.372460842132568, "eval_runtime": 50.9747, "eval_samples_per_second": 196.176, "eval_steps_per_second": 3.512, "step": 58900 }, { "epoch": 526.7457791577722, "grad_norm": 0.10929535329341888, "learning_rate": 1.0033444816053511e-07, "loss": 6.3596, "step": 59000 }, { "epoch": 526.7457791577722, "eval_loss": 6.372054576873779, "eval_runtime": 50.9854, "eval_samples_per_second": 196.134, "eval_steps_per_second": 3.511, "step": 59000 }, { "epoch": 527.638463031244, "grad_norm": 0.10336798429489136, "learning_rate": 9.030100334448161e-08, "loss": 6.3588, "step": 59100 }, { "epoch": 527.638463031244, "eval_loss": 6.373047828674316, "eval_runtime": 50.9782, "eval_samples_per_second": 196.162, "eval_steps_per_second": 3.511, "step": 59100 }, { "epoch": 528.5311469047157, "grad_norm": 0.11266309767961502, "learning_rate": 8.02675585284281e-08, "loss": 6.3602, "step": 59200 }, { "epoch": 528.5311469047157, "eval_loss": 6.370576858520508, "eval_runtime": 51.0093, "eval_samples_per_second": 196.043, "eval_steps_per_second": 3.509, "step": 59200 }, { "epoch": 529.4238307781875, "grad_norm": 0.10325779765844345, "learning_rate": 7.023411371237458e-08, "loss": 6.3595, "step": 59300 }, { "epoch": 529.4238307781875, "eval_loss": 6.371870994567871, "eval_runtime": 50.501, "eval_samples_per_second": 198.016, "eval_steps_per_second": 3.544, "step": 59300 }, { "epoch": 530.3165146516592, "grad_norm": 0.09962137043476105, "learning_rate": 6.020066889632108e-08, "loss": 6.358, "step": 59400 }, { "epoch": 530.3165146516592, "eval_loss": 6.365788459777832, "eval_runtime": 50.983, "eval_samples_per_second": 196.144, "eval_steps_per_second": 3.511, "step": 59400 }, { "epoch": 531.209198525131, "grad_norm": 0.10900256037712097, "learning_rate": 5.0167224080267556e-08, "loss": 6.359, "step": 59500 }, { "epoch": 531.209198525131, "eval_loss": 6.371830940246582, "eval_runtime": 46.7226, "eval_samples_per_second": 214.029, "eval_steps_per_second": 3.831, "step": 59500 }, { "epoch": 532.1018823986028, "grad_norm": 0.10019946843385696, "learning_rate": 4.013377926421405e-08, "loss": 6.3591, "step": 59600 }, { "epoch": 532.1018823986028, "eval_loss": 6.372683048248291, "eval_runtime": 50.9869, "eval_samples_per_second": 196.129, "eval_steps_per_second": 3.511, "step": 59600 }, { "epoch": 532.9945662720745, "grad_norm": 0.10921988636255264, "learning_rate": 3.010033444816054e-08, "loss": 6.3601, "step": 59700 }, { "epoch": 532.9945662720745, "eval_loss": 6.371883392333984, "eval_runtime": 50.5044, "eval_samples_per_second": 198.002, "eval_steps_per_second": 3.544, "step": 59700 }, { "epoch": 533.8872501455463, "grad_norm": 0.09983010590076447, "learning_rate": 2.0066889632107024e-08, "loss": 6.3597, "step": 59800 }, { "epoch": 533.8872501455463, "eval_loss": 6.372203350067139, "eval_runtime": 51.0084, "eval_samples_per_second": 196.046, "eval_steps_per_second": 3.509, "step": 59800 }, { "epoch": 534.779934019018, "grad_norm": 0.10680444538593292, "learning_rate": 1.0033444816053512e-08, "loss": 6.3592, "step": 59900 }, { "epoch": 534.779934019018, "eval_loss": 6.379711627960205, "eval_runtime": 50.9976, "eval_samples_per_second": 196.088, "eval_steps_per_second": 3.51, "step": 59900 }, { "epoch": 535.6726178924898, "grad_norm": 0.10077936947345734, "learning_rate": 0.0, "loss": 6.3593, "step": 60000 }, { "epoch": 535.6726178924898, "eval_loss": 6.370903968811035, "eval_runtime": 50.9925, "eval_samples_per_second": 196.107, "eval_steps_per_second": 3.51, "step": 60000 } ], "logging_steps": 100, "max_steps": 60000, "num_input_tokens_seen": 0, "num_train_epochs": 536, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 4.808412969204368e+20, "train_batch_size": 8, "trial_name": null, "trial_params": null }