{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 234, "global_step": 2340, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0004273960893257827, "grad_norm": 9.14111614227295, "learning_rate": 0.0, "loss": 0.21726450324058533, "num_input_tokens_seen": 1154, "step": 1, "train_runtime": 12.1331, "train_tokens_per_second": 95.111 }, { "epoch": 0.0008547921786515654, "grad_norm": 13.571990013122559, "learning_rate": 4.000000000000001e-06, "loss": 0.35620906949043274, "num_input_tokens_seen": 1926, "step": 2, "train_runtime": 14.3269, "train_tokens_per_second": 134.432 }, { "epoch": 0.001282188267977348, "grad_norm": 6.499567985534668, "learning_rate": 8.000000000000001e-06, "loss": 0.21047340333461761, "num_input_tokens_seen": 2966, "step": 3, "train_runtime": 16.552, "train_tokens_per_second": 179.193 }, { "epoch": 0.0017095843573031308, "grad_norm": 4.277872562408447, "learning_rate": 1.2e-05, "loss": 0.18391455709934235, "num_input_tokens_seen": 3778, "step": 4, "train_runtime": 18.8009, "train_tokens_per_second": 200.948 }, { "epoch": 0.0021369804466289132, "grad_norm": 5.078300476074219, "learning_rate": 1.6000000000000003e-05, "loss": 0.17812903225421906, "num_input_tokens_seen": 4340, "step": 5, "train_runtime": 20.8672, "train_tokens_per_second": 207.982 }, { "epoch": 0.002564376535954696, "grad_norm": 3.261840581893921, "learning_rate": 2e-05, "loss": 0.2035450041294098, "num_input_tokens_seen": 5598, "step": 6, "train_runtime": 23.0631, "train_tokens_per_second": 242.726 }, { "epoch": 0.0029917726252804786, "grad_norm": 4.089930057525635, "learning_rate": 1.9991434689507495e-05, "loss": 0.11088275164365768, "num_input_tokens_seen": 6630, "step": 7, "train_runtime": 25.209, "train_tokens_per_second": 263.001 }, { "epoch": 0.0034191687146062615, "grad_norm": 2.839904308319092, "learning_rate": 1.9982869379014992e-05, "loss": 0.12259666621685028, "num_input_tokens_seen": 7824, "step": 8, "train_runtime": 27.407, "train_tokens_per_second": 285.474 }, { "epoch": 0.003846564803932044, "grad_norm": 3.0211679935455322, "learning_rate": 1.9974304068522486e-05, "loss": 0.08603208512067795, "num_input_tokens_seen": 8920, "step": 9, "train_runtime": 29.5794, "train_tokens_per_second": 301.562 }, { "epoch": 0.0042739608932578265, "grad_norm": 2.7547717094421387, "learning_rate": 1.996573875802998e-05, "loss": 0.1716809868812561, "num_input_tokens_seen": 10266, "step": 10, "train_runtime": 31.7953, "train_tokens_per_second": 322.878 }, { "epoch": 0.004701356982583609, "grad_norm": 2.4462404251098633, "learning_rate": 1.9957173447537473e-05, "loss": 0.10024883598089218, "num_input_tokens_seen": 11024, "step": 11, "train_runtime": 33.8434, "train_tokens_per_second": 325.736 }, { "epoch": 0.005128753071909392, "grad_norm": 2.9624831676483154, "learning_rate": 1.994860813704497e-05, "loss": 0.20874907076358795, "num_input_tokens_seen": 12374, "step": 12, "train_runtime": 36.0888, "train_tokens_per_second": 342.877 }, { "epoch": 0.005556149161235174, "grad_norm": 3.645580291748047, "learning_rate": 1.9940042826552463e-05, "loss": 0.17093905806541443, "num_input_tokens_seen": 13532, "step": 13, "train_runtime": 38.2732, "train_tokens_per_second": 353.564 }, { "epoch": 0.005983545250560957, "grad_norm": 3.387136697769165, "learning_rate": 1.9931477516059957e-05, "loss": 0.12048695981502533, "num_input_tokens_seen": 14356, "step": 14, "train_runtime": 40.4212, "train_tokens_per_second": 355.16 }, { "epoch": 0.00641094133988674, "grad_norm": 3.199143648147583, "learning_rate": 1.9922912205567454e-05, "loss": 0.1609961837530136, "num_input_tokens_seen": 15532, "step": 15, "train_runtime": 42.62, "train_tokens_per_second": 364.43 }, { "epoch": 0.006838337429212523, "grad_norm": 2.954838275909424, "learning_rate": 1.9914346895074948e-05, "loss": 0.1544017344713211, "num_input_tokens_seen": 16276, "step": 16, "train_runtime": 44.7305, "train_tokens_per_second": 363.868 }, { "epoch": 0.007265733518538305, "grad_norm": 3.1137399673461914, "learning_rate": 1.990578158458244e-05, "loss": 0.0799512267112732, "num_input_tokens_seen": 17076, "step": 17, "train_runtime": 46.8507, "train_tokens_per_second": 364.477 }, { "epoch": 0.007693129607864088, "grad_norm": 2.0236153602600098, "learning_rate": 1.9897216274089938e-05, "loss": 0.07863675057888031, "num_input_tokens_seen": 18224, "step": 18, "train_runtime": 49.0208, "train_tokens_per_second": 371.76 }, { "epoch": 0.00812052569718987, "grad_norm": 2.745185375213623, "learning_rate": 1.9888650963597432e-05, "loss": 0.0929172933101654, "num_input_tokens_seen": 19792, "step": 19, "train_runtime": 51.4059, "train_tokens_per_second": 385.015 }, { "epoch": 0.008547921786515653, "grad_norm": 2.367658853530884, "learning_rate": 1.9880085653104925e-05, "loss": 0.12210556864738464, "num_input_tokens_seen": 20890, "step": 20, "train_runtime": 53.5825, "train_tokens_per_second": 389.866 }, { "epoch": 0.008975317875841436, "grad_norm": 3.4798147678375244, "learning_rate": 1.987152034261242e-05, "loss": 0.13251161575317383, "num_input_tokens_seen": 21788, "step": 21, "train_runtime": 55.6981, "train_tokens_per_second": 391.18 }, { "epoch": 0.009402713965167219, "grad_norm": 3.735536575317383, "learning_rate": 1.9862955032119916e-05, "loss": 0.1198655366897583, "num_input_tokens_seen": 22586, "step": 22, "train_runtime": 57.7941, "train_tokens_per_second": 390.801 }, { "epoch": 0.009830110054493002, "grad_norm": 2.751854181289673, "learning_rate": 1.985438972162741e-05, "loss": 0.11355586349964142, "num_input_tokens_seen": 23474, "step": 23, "train_runtime": 59.9163, "train_tokens_per_second": 391.78 }, { "epoch": 0.010257506143818785, "grad_norm": 3.438530206680298, "learning_rate": 1.9845824411134906e-05, "loss": 0.16267995536327362, "num_input_tokens_seen": 24318, "step": 24, "train_runtime": 62.0331, "train_tokens_per_second": 392.016 }, { "epoch": 0.010684902233144567, "grad_norm": 2.3223185539245605, "learning_rate": 1.98372591006424e-05, "loss": 0.18063999712467194, "num_input_tokens_seen": 25596, "step": 25, "train_runtime": 64.282, "train_tokens_per_second": 398.183 }, { "epoch": 0.011112298322470349, "grad_norm": 2.390918493270874, "learning_rate": 1.9828693790149897e-05, "loss": 0.08224872499704361, "num_input_tokens_seen": 27330, "step": 26, "train_runtime": 66.7305, "train_tokens_per_second": 409.558 }, { "epoch": 0.011539694411796132, "grad_norm": 3.343850612640381, "learning_rate": 1.982012847965739e-05, "loss": 0.14506331086158752, "num_input_tokens_seen": 28246, "step": 27, "train_runtime": 68.8536, "train_tokens_per_second": 410.233 }, { "epoch": 0.011967090501121914, "grad_norm": 2.507873773574829, "learning_rate": 1.9811563169164884e-05, "loss": 0.0809740275144577, "num_input_tokens_seen": 29652, "step": 28, "train_runtime": 71.0635, "train_tokens_per_second": 417.261 }, { "epoch": 0.012394486590447697, "grad_norm": 9.32749080657959, "learning_rate": 1.9802997858672378e-05, "loss": 0.20142711699008942, "num_input_tokens_seen": 30714, "step": 29, "train_runtime": 73.3281, "train_tokens_per_second": 418.857 }, { "epoch": 0.01282188267977348, "grad_norm": 1.748494029045105, "learning_rate": 1.9794432548179875e-05, "loss": 0.10139460861682892, "num_input_tokens_seen": 32788, "step": 30, "train_runtime": 75.7604, "train_tokens_per_second": 432.786 }, { "epoch": 0.013249278769099263, "grad_norm": 2.136369466781616, "learning_rate": 1.9785867237687368e-05, "loss": 0.07564827799797058, "num_input_tokens_seen": 34168, "step": 31, "train_runtime": 92.5711, "train_tokens_per_second": 369.1 }, { "epoch": 0.013676674858425046, "grad_norm": 3.196265697479248, "learning_rate": 1.9777301927194862e-05, "loss": 0.12035083025693893, "num_input_tokens_seen": 35112, "step": 32, "train_runtime": 94.6973, "train_tokens_per_second": 370.781 }, { "epoch": 0.014104070947750827, "grad_norm": 2.6035709381103516, "learning_rate": 1.976873661670236e-05, "loss": 0.12550172209739685, "num_input_tokens_seen": 36280, "step": 33, "train_runtime": 96.8858, "train_tokens_per_second": 374.461 }, { "epoch": 0.01453146703707661, "grad_norm": 1.9573886394500732, "learning_rate": 1.9760171306209852e-05, "loss": 0.10325965285301208, "num_input_tokens_seen": 37392, "step": 34, "train_runtime": 99.0973, "train_tokens_per_second": 377.326 }, { "epoch": 0.014958863126402393, "grad_norm": 2.2740912437438965, "learning_rate": 1.9751605995717346e-05, "loss": 0.1205965206027031, "num_input_tokens_seen": 38426, "step": 35, "train_runtime": 101.244, "train_tokens_per_second": 379.539 }, { "epoch": 0.015386259215728176, "grad_norm": 4.021089553833008, "learning_rate": 1.9743040685224843e-05, "loss": 0.16274608671665192, "num_input_tokens_seen": 39142, "step": 36, "train_runtime": 103.2831, "train_tokens_per_second": 378.978 }, { "epoch": 0.015813655305053957, "grad_norm": 3.387068271636963, "learning_rate": 1.9734475374732337e-05, "loss": 0.1876910924911499, "num_input_tokens_seen": 40582, "step": 37, "train_runtime": 105.5614, "train_tokens_per_second": 384.44 }, { "epoch": 0.01624105139437974, "grad_norm": 2.8090980052948, "learning_rate": 1.972591006423983e-05, "loss": 0.14450424909591675, "num_input_tokens_seen": 41558, "step": 38, "train_runtime": 107.6691, "train_tokens_per_second": 385.979 }, { "epoch": 0.016668447483705523, "grad_norm": 3.532721519470215, "learning_rate": 1.9717344753747324e-05, "loss": 0.14360390603542328, "num_input_tokens_seen": 43008, "step": 39, "train_runtime": 109.9286, "train_tokens_per_second": 391.236 }, { "epoch": 0.017095843573031306, "grad_norm": 2.9382805824279785, "learning_rate": 1.970877944325482e-05, "loss": 0.14307570457458496, "num_input_tokens_seen": 43638, "step": 40, "train_runtime": 111.9664, "train_tokens_per_second": 389.742 }, { "epoch": 0.01752323966235709, "grad_norm": 2.8658647537231445, "learning_rate": 1.9700214132762314e-05, "loss": 0.12519389390945435, "num_input_tokens_seen": 44638, "step": 41, "train_runtime": 114.1116, "train_tokens_per_second": 391.178 }, { "epoch": 0.01795063575168287, "grad_norm": 1.6191413402557373, "learning_rate": 1.9691648822269808e-05, "loss": 0.056612834334373474, "num_input_tokens_seen": 45956, "step": 42, "train_runtime": 116.3631, "train_tokens_per_second": 394.936 }, { "epoch": 0.018378031841008655, "grad_norm": 2.833674192428589, "learning_rate": 1.9683083511777305e-05, "loss": 0.14162088930606842, "num_input_tokens_seen": 46938, "step": 43, "train_runtime": 118.4983, "train_tokens_per_second": 396.107 }, { "epoch": 0.018805427930334438, "grad_norm": 2.1288228034973145, "learning_rate": 1.96745182012848e-05, "loss": 0.12884970009326935, "num_input_tokens_seen": 48790, "step": 44, "train_runtime": 120.8259, "train_tokens_per_second": 403.804 }, { "epoch": 0.01923282401966022, "grad_norm": 3.1711273193359375, "learning_rate": 1.9665952890792292e-05, "loss": 0.14132612943649292, "num_input_tokens_seen": 49788, "step": 45, "train_runtime": 122.9274, "train_tokens_per_second": 405.02 }, { "epoch": 0.019660220108986003, "grad_norm": 3.3076086044311523, "learning_rate": 1.9657387580299786e-05, "loss": 0.12955069541931152, "num_input_tokens_seen": 50982, "step": 46, "train_runtime": 125.1368, "train_tokens_per_second": 407.41 }, { "epoch": 0.020087616198311786, "grad_norm": 4.046682357788086, "learning_rate": 1.9648822269807283e-05, "loss": 0.15046128630638123, "num_input_tokens_seen": 51774, "step": 47, "train_runtime": 127.2411, "train_tokens_per_second": 406.897 }, { "epoch": 0.02051501228763757, "grad_norm": 2.9671101570129395, "learning_rate": 1.9640256959314776e-05, "loss": 0.1432068794965744, "num_input_tokens_seen": 52456, "step": 48, "train_runtime": 129.2862, "train_tokens_per_second": 405.735 }, { "epoch": 0.020942408376963352, "grad_norm": 2.9615638256073, "learning_rate": 1.963169164882227e-05, "loss": 0.11182968318462372, "num_input_tokens_seen": 53518, "step": 49, "train_runtime": 131.4665, "train_tokens_per_second": 407.085 }, { "epoch": 0.021369804466289135, "grad_norm": 2.3533644676208496, "learning_rate": 1.9623126338329767e-05, "loss": 0.0767638236284256, "num_input_tokens_seen": 54192, "step": 50, "train_runtime": 133.5584, "train_tokens_per_second": 405.755 }, { "epoch": 0.021797200555614914, "grad_norm": 3.2768988609313965, "learning_rate": 1.961456102783726e-05, "loss": 0.1644146591424942, "num_input_tokens_seen": 55238, "step": 51, "train_runtime": 135.7162, "train_tokens_per_second": 407.011 }, { "epoch": 0.022224596644940697, "grad_norm": 3.0618464946746826, "learning_rate": 1.9605995717344754e-05, "loss": 0.10548470914363861, "num_input_tokens_seen": 55944, "step": 52, "train_runtime": 137.7924, "train_tokens_per_second": 406.002 }, { "epoch": 0.02265199273426648, "grad_norm": 1.9948461055755615, "learning_rate": 1.959743040685225e-05, "loss": 0.11291508376598358, "num_input_tokens_seen": 57432, "step": 53, "train_runtime": 140.1, "train_tokens_per_second": 409.936 }, { "epoch": 0.023079388823592263, "grad_norm": 3.476478099822998, "learning_rate": 1.9588865096359744e-05, "loss": 0.11228299140930176, "num_input_tokens_seen": 58132, "step": 54, "train_runtime": 142.1935, "train_tokens_per_second": 408.823 }, { "epoch": 0.023506784912918046, "grad_norm": 3.6434085369110107, "learning_rate": 1.9580299785867238e-05, "loss": 0.23393051326274872, "num_input_tokens_seen": 59050, "step": 55, "train_runtime": 144.3042, "train_tokens_per_second": 409.205 }, { "epoch": 0.02393418100224383, "grad_norm": 2.5962419509887695, "learning_rate": 1.957173447537473e-05, "loss": 0.1370583325624466, "num_input_tokens_seen": 60142, "step": 56, "train_runtime": 146.4428, "train_tokens_per_second": 410.686 }, { "epoch": 0.024361577091569612, "grad_norm": 3.1055679321289062, "learning_rate": 1.956316916488223e-05, "loss": 0.09925813972949982, "num_input_tokens_seen": 60816, "step": 57, "train_runtime": 148.5012, "train_tokens_per_second": 409.532 }, { "epoch": 0.024788973180895395, "grad_norm": 2.9782164096832275, "learning_rate": 1.9554603854389726e-05, "loss": 0.18971489369869232, "num_input_tokens_seen": 61912, "step": 58, "train_runtime": 150.6795, "train_tokens_per_second": 410.885 }, { "epoch": 0.025216369270221178, "grad_norm": 2.759922742843628, "learning_rate": 1.954603854389722e-05, "loss": 0.1085483729839325, "num_input_tokens_seen": 63102, "step": 59, "train_runtime": 152.893, "train_tokens_per_second": 412.72 }, { "epoch": 0.02564376535954696, "grad_norm": 2.0845162868499756, "learning_rate": 1.9537473233404713e-05, "loss": 0.0876690223813057, "num_input_tokens_seen": 64178, "step": 60, "train_runtime": 155.0612, "train_tokens_per_second": 413.888 }, { "epoch": 0.026071161448872743, "grad_norm": 2.9664435386657715, "learning_rate": 1.952890792291221e-05, "loss": 0.15988248586654663, "num_input_tokens_seen": 65130, "step": 61, "train_runtime": 169.7061, "train_tokens_per_second": 383.781 }, { "epoch": 0.026498557538198526, "grad_norm": 2.35333251953125, "learning_rate": 1.9520342612419703e-05, "loss": 0.1349293291568756, "num_input_tokens_seen": 66482, "step": 62, "train_runtime": 171.9969, "train_tokens_per_second": 386.53 }, { "epoch": 0.02692595362752431, "grad_norm": 3.8661534786224365, "learning_rate": 1.9511777301927197e-05, "loss": 0.19301962852478027, "num_input_tokens_seen": 67294, "step": 63, "train_runtime": 174.1011, "train_tokens_per_second": 386.523 }, { "epoch": 0.027353349716850092, "grad_norm": 3.158799648284912, "learning_rate": 1.950321199143469e-05, "loss": 0.15264831483364105, "num_input_tokens_seen": 68030, "step": 64, "train_runtime": 176.1776, "train_tokens_per_second": 386.144 }, { "epoch": 0.027780745806175875, "grad_norm": 2.5029361248016357, "learning_rate": 1.9494646680942187e-05, "loss": 0.11615459620952606, "num_input_tokens_seen": 69248, "step": 65, "train_runtime": 178.436, "train_tokens_per_second": 388.083 }, { "epoch": 0.028208141895501655, "grad_norm": 2.39737868309021, "learning_rate": 1.948608137044968e-05, "loss": 0.11769278347492218, "num_input_tokens_seen": 70370, "step": 66, "train_runtime": 180.632, "train_tokens_per_second": 389.577 }, { "epoch": 0.028635537984827437, "grad_norm": 2.833765745162964, "learning_rate": 1.9477516059957175e-05, "loss": 0.11099628359079361, "num_input_tokens_seen": 71626, "step": 67, "train_runtime": 182.8654, "train_tokens_per_second": 391.687 }, { "epoch": 0.02906293407415322, "grad_norm": 2.0754895210266113, "learning_rate": 1.946895074946467e-05, "loss": 0.10504400730133057, "num_input_tokens_seen": 73088, "step": 68, "train_runtime": 185.1474, "train_tokens_per_second": 394.756 }, { "epoch": 0.029490330163479003, "grad_norm": 4.698664665222168, "learning_rate": 1.9460385438972165e-05, "loss": 0.11828333139419556, "num_input_tokens_seen": 73794, "step": 69, "train_runtime": 187.2644, "train_tokens_per_second": 394.063 }, { "epoch": 0.029917726252804786, "grad_norm": 2.6300766468048096, "learning_rate": 1.945182012847966e-05, "loss": 0.1361745297908783, "num_input_tokens_seen": 74550, "step": 70, "train_runtime": 189.3593, "train_tokens_per_second": 393.696 }, { "epoch": 0.03034512234213057, "grad_norm": 2.975100517272949, "learning_rate": 1.9443254817987152e-05, "loss": 0.20098119974136353, "num_input_tokens_seen": 75664, "step": 71, "train_runtime": 191.5467, "train_tokens_per_second": 395.016 }, { "epoch": 0.030772518431456352, "grad_norm": 3.710899591445923, "learning_rate": 1.943468950749465e-05, "loss": 0.16764453053474426, "num_input_tokens_seen": 76658, "step": 72, "train_runtime": 193.7714, "train_tokens_per_second": 395.61 }, { "epoch": 0.031199914520782135, "grad_norm": 3.4315569400787354, "learning_rate": 1.9426124197002143e-05, "loss": 0.10653313994407654, "num_input_tokens_seen": 77340, "step": 73, "train_runtime": 195.8266, "train_tokens_per_second": 394.941 }, { "epoch": 0.031627310610107914, "grad_norm": 3.3026206493377686, "learning_rate": 1.9417558886509636e-05, "loss": 0.21571186184883118, "num_input_tokens_seen": 78280, "step": 74, "train_runtime": 197.9437, "train_tokens_per_second": 395.466 }, { "epoch": 0.0320547066994337, "grad_norm": 4.470591068267822, "learning_rate": 1.9408993576017133e-05, "loss": 0.15138877928256989, "num_input_tokens_seen": 79984, "step": 75, "train_runtime": 200.2775, "train_tokens_per_second": 399.366 }, { "epoch": 0.03248210278875948, "grad_norm": 2.452955484390259, "learning_rate": 1.9400428265524627e-05, "loss": 0.1523466855287552, "num_input_tokens_seen": 81050, "step": 76, "train_runtime": 202.4585, "train_tokens_per_second": 400.329 }, { "epoch": 0.032909498878085267, "grad_norm": 2.775866985321045, "learning_rate": 1.939186295503212e-05, "loss": 0.16505104303359985, "num_input_tokens_seen": 82148, "step": 77, "train_runtime": 204.6439, "train_tokens_per_second": 401.419 }, { "epoch": 0.033336894967411046, "grad_norm": 2.287738084793091, "learning_rate": 1.9383297644539617e-05, "loss": 0.14218983054161072, "num_input_tokens_seen": 83480, "step": 78, "train_runtime": 206.8838, "train_tokens_per_second": 403.512 }, { "epoch": 0.03376429105673683, "grad_norm": 5.012575626373291, "learning_rate": 1.937473233404711e-05, "loss": 0.19431844353675842, "num_input_tokens_seen": 84510, "step": 79, "train_runtime": 209.0563, "train_tokens_per_second": 404.245 }, { "epoch": 0.03419168714606261, "grad_norm": 2.3963444232940674, "learning_rate": 1.9366167023554605e-05, "loss": 0.09664961695671082, "num_input_tokens_seen": 85856, "step": 80, "train_runtime": 211.2962, "train_tokens_per_second": 406.33 }, { "epoch": 0.0346190832353884, "grad_norm": 2.7534611225128174, "learning_rate": 1.9357601713062098e-05, "loss": 0.10577772557735443, "num_input_tokens_seen": 86658, "step": 81, "train_runtime": 213.3725, "train_tokens_per_second": 406.135 }, { "epoch": 0.03504647932471418, "grad_norm": 1.8196276426315308, "learning_rate": 1.9349036402569595e-05, "loss": 0.12409847229719162, "num_input_tokens_seen": 88316, "step": 82, "train_runtime": 215.6855, "train_tokens_per_second": 409.467 }, { "epoch": 0.035473875414039964, "grad_norm": 2.1968817710876465, "learning_rate": 1.934047109207709e-05, "loss": 0.09177117049694061, "num_input_tokens_seen": 89176, "step": 83, "train_runtime": 217.8148, "train_tokens_per_second": 409.412 }, { "epoch": 0.03590127150336574, "grad_norm": 3.3404345512390137, "learning_rate": 1.9331905781584582e-05, "loss": 0.14738020300865173, "num_input_tokens_seen": 90190, "step": 84, "train_runtime": 219.9637, "train_tokens_per_second": 410.022 }, { "epoch": 0.03632866759269153, "grad_norm": 1.7804222106933594, "learning_rate": 1.932334047109208e-05, "loss": 0.10943267494440079, "num_input_tokens_seen": 91646, "step": 85, "train_runtime": 222.2124, "train_tokens_per_second": 412.425 }, { "epoch": 0.03675606368201731, "grad_norm": 4.095219612121582, "learning_rate": 1.9314775160599573e-05, "loss": 0.1152762919664383, "num_input_tokens_seen": 92540, "step": 86, "train_runtime": 224.3367, "train_tokens_per_second": 412.505 }, { "epoch": 0.037183459771343096, "grad_norm": 2.9774389266967773, "learning_rate": 1.9306209850107067e-05, "loss": 0.15725484490394592, "num_input_tokens_seen": 93406, "step": 87, "train_runtime": 226.4236, "train_tokens_per_second": 412.528 }, { "epoch": 0.037610855860668875, "grad_norm": 2.6223371028900146, "learning_rate": 1.929764453961456e-05, "loss": 0.08795279264450073, "num_input_tokens_seen": 94042, "step": 88, "train_runtime": 228.4803, "train_tokens_per_second": 411.598 }, { "epoch": 0.038038251949994654, "grad_norm": 2.9591426849365234, "learning_rate": 1.9289079229122057e-05, "loss": 0.14193153381347656, "num_input_tokens_seen": 94768, "step": 89, "train_runtime": 230.5694, "train_tokens_per_second": 411.017 }, { "epoch": 0.03846564803932044, "grad_norm": 3.3232381343841553, "learning_rate": 1.928051391862955e-05, "loss": 0.13330227136611938, "num_input_tokens_seen": 95510, "step": 90, "train_runtime": 232.665, "train_tokens_per_second": 410.504 }, { "epoch": 0.03889304412864622, "grad_norm": 2.6954174041748047, "learning_rate": 1.9271948608137044e-05, "loss": 0.14643427729606628, "num_input_tokens_seen": 96404, "step": 91, "train_runtime": 247.5547, "train_tokens_per_second": 389.425 }, { "epoch": 0.03932044021797201, "grad_norm": 3.4643115997314453, "learning_rate": 1.926338329764454e-05, "loss": 0.262195348739624, "num_input_tokens_seen": 97326, "step": 92, "train_runtime": 249.6645, "train_tokens_per_second": 389.827 }, { "epoch": 0.039747836307297786, "grad_norm": 2.8510966300964355, "learning_rate": 1.9254817987152038e-05, "loss": 0.11224470287561417, "num_input_tokens_seen": 98670, "step": 93, "train_runtime": 251.8743, "train_tokens_per_second": 391.743 }, { "epoch": 0.04017523239662357, "grad_norm": 2.7037439346313477, "learning_rate": 1.9246252676659532e-05, "loss": 0.14719970524311066, "num_input_tokens_seen": 99802, "step": 94, "train_runtime": 254.0152, "train_tokens_per_second": 392.898 }, { "epoch": 0.04060262848594935, "grad_norm": 2.3708066940307617, "learning_rate": 1.9237687366167025e-05, "loss": 0.11163226515054703, "num_input_tokens_seen": 100602, "step": 95, "train_runtime": 256.0744, "train_tokens_per_second": 392.862 }, { "epoch": 0.04103002457527514, "grad_norm": 3.19515323638916, "learning_rate": 1.9229122055674522e-05, "loss": 0.17545676231384277, "num_input_tokens_seen": 101492, "step": 96, "train_runtime": 258.2043, "train_tokens_per_second": 393.069 }, { "epoch": 0.04145742066460092, "grad_norm": 1.8117717504501343, "learning_rate": 1.9220556745182016e-05, "loss": 0.10086990892887115, "num_input_tokens_seen": 102878, "step": 97, "train_runtime": 260.4581, "train_tokens_per_second": 394.989 }, { "epoch": 0.041884816753926704, "grad_norm": 3.0650646686553955, "learning_rate": 1.921199143468951e-05, "loss": 0.1313072144985199, "num_input_tokens_seen": 103492, "step": 98, "train_runtime": 262.5091, "train_tokens_per_second": 394.242 }, { "epoch": 0.042312212843252484, "grad_norm": 3.3805437088012695, "learning_rate": 1.9203426124197003e-05, "loss": 0.1240580677986145, "num_input_tokens_seen": 104662, "step": 99, "train_runtime": 264.6925, "train_tokens_per_second": 395.41 }, { "epoch": 0.04273960893257827, "grad_norm": 3.6072335243225098, "learning_rate": 1.91948608137045e-05, "loss": 0.18898653984069824, "num_input_tokens_seen": 105546, "step": 100, "train_runtime": 266.8165, "train_tokens_per_second": 395.575 }, { "epoch": 0.04316700502190405, "grad_norm": 2.737124443054199, "learning_rate": 1.9186295503211994e-05, "loss": 0.11584174633026123, "num_input_tokens_seen": 106606, "step": 101, "train_runtime": 269.1023, "train_tokens_per_second": 396.154 }, { "epoch": 0.04359440111122983, "grad_norm": 4.503042697906494, "learning_rate": 1.9177730192719487e-05, "loss": 0.08784925192594528, "num_input_tokens_seen": 107334, "step": 102, "train_runtime": 271.3214, "train_tokens_per_second": 395.597 }, { "epoch": 0.044021797200555615, "grad_norm": 2.8012304306030273, "learning_rate": 1.9169164882226984e-05, "loss": 0.14326158165931702, "num_input_tokens_seen": 108792, "step": 103, "train_runtime": 273.5492, "train_tokens_per_second": 397.705 }, { "epoch": 0.044449193289881395, "grad_norm": 3.640925168991089, "learning_rate": 1.9160599571734478e-05, "loss": 0.12522439658641815, "num_input_tokens_seen": 109786, "step": 104, "train_runtime": 275.6638, "train_tokens_per_second": 398.26 }, { "epoch": 0.04487658937920718, "grad_norm": 2.4012043476104736, "learning_rate": 1.915203426124197e-05, "loss": 0.14218813180923462, "num_input_tokens_seen": 111036, "step": 105, "train_runtime": 277.8666, "train_tokens_per_second": 399.602 }, { "epoch": 0.04530398546853296, "grad_norm": 2.4177777767181396, "learning_rate": 1.9143468950749465e-05, "loss": 0.09716714918613434, "num_input_tokens_seen": 112130, "step": 106, "train_runtime": 280.0427, "train_tokens_per_second": 400.403 }, { "epoch": 0.04573138155785875, "grad_norm": 3.3823659420013428, "learning_rate": 1.9134903640256962e-05, "loss": 0.20361191034317017, "num_input_tokens_seen": 112996, "step": 107, "train_runtime": 282.1522, "train_tokens_per_second": 400.479 }, { "epoch": 0.046158777647184526, "grad_norm": 2.135305881500244, "learning_rate": 1.9126338329764455e-05, "loss": 0.09638367593288422, "num_input_tokens_seen": 113962, "step": 108, "train_runtime": 284.2948, "train_tokens_per_second": 400.859 }, { "epoch": 0.04658617373651031, "grad_norm": 2.566462516784668, "learning_rate": 1.911777301927195e-05, "loss": 0.16817453503608704, "num_input_tokens_seen": 115666, "step": 109, "train_runtime": 286.5897, "train_tokens_per_second": 403.594 }, { "epoch": 0.04701356982583609, "grad_norm": 2.8588247299194336, "learning_rate": 1.9109207708779446e-05, "loss": 0.1660233587026596, "num_input_tokens_seen": 116624, "step": 110, "train_runtime": 288.7227, "train_tokens_per_second": 403.931 }, { "epoch": 0.04744096591516188, "grad_norm": 2.2879586219787598, "learning_rate": 1.910064239828694e-05, "loss": 0.09440014511346817, "num_input_tokens_seen": 117428, "step": 111, "train_runtime": 290.8628, "train_tokens_per_second": 403.723 }, { "epoch": 0.04786836200448766, "grad_norm": 2.0961356163024902, "learning_rate": 1.9092077087794433e-05, "loss": 0.10546403378248215, "num_input_tokens_seen": 118680, "step": 112, "train_runtime": 293.102, "train_tokens_per_second": 404.91 }, { "epoch": 0.048295758093813444, "grad_norm": 2.0368144512176514, "learning_rate": 1.908351177730193e-05, "loss": 0.14511381089687347, "num_input_tokens_seen": 119692, "step": 113, "train_runtime": 295.251, "train_tokens_per_second": 405.391 }, { "epoch": 0.048723154183139224, "grad_norm": 2.633056640625, "learning_rate": 1.9074946466809424e-05, "loss": 0.12467923015356064, "num_input_tokens_seen": 120922, "step": 114, "train_runtime": 297.4186, "train_tokens_per_second": 406.572 }, { "epoch": 0.04915055027246501, "grad_norm": 3.234384536743164, "learning_rate": 1.9066381156316917e-05, "loss": 0.13998226821422577, "num_input_tokens_seen": 121918, "step": 115, "train_runtime": 299.5902, "train_tokens_per_second": 406.949 }, { "epoch": 0.04957794636179079, "grad_norm": 2.9627978801727295, "learning_rate": 1.905781584582441e-05, "loss": 0.2414434254169464, "num_input_tokens_seen": 122906, "step": 116, "train_runtime": 301.7292, "train_tokens_per_second": 407.339 }, { "epoch": 0.05000534245111657, "grad_norm": 2.544501781463623, "learning_rate": 1.9049250535331908e-05, "loss": 0.10913316160440445, "num_input_tokens_seen": 123910, "step": 117, "train_runtime": 303.8362, "train_tokens_per_second": 407.818 }, { "epoch": 0.050432738540442355, "grad_norm": 1.9286752939224243, "learning_rate": 1.90406852248394e-05, "loss": 0.12419462203979492, "num_input_tokens_seen": 125102, "step": 118, "train_runtime": 306.0863, "train_tokens_per_second": 408.715 }, { "epoch": 0.050860134629768135, "grad_norm": 3.931507110595703, "learning_rate": 1.9032119914346895e-05, "loss": 0.2112111747264862, "num_input_tokens_seen": 126132, "step": 119, "train_runtime": 308.1982, "train_tokens_per_second": 409.256 }, { "epoch": 0.05128753071909392, "grad_norm": 4.836315631866455, "learning_rate": 1.9023554603854392e-05, "loss": 0.16022446751594543, "num_input_tokens_seen": 127110, "step": 120, "train_runtime": 310.336, "train_tokens_per_second": 409.588 }, { "epoch": 0.0517149268084197, "grad_norm": 2.537309408187866, "learning_rate": 1.9014989293361886e-05, "loss": 0.14001011848449707, "num_input_tokens_seen": 127798, "step": 121, "train_runtime": 325.1648, "train_tokens_per_second": 393.025 }, { "epoch": 0.05214232289774549, "grad_norm": 3.5574090480804443, "learning_rate": 1.900642398286938e-05, "loss": 0.23435810208320618, "num_input_tokens_seen": 128626, "step": 122, "train_runtime": 327.3093, "train_tokens_per_second": 392.98 }, { "epoch": 0.052569718987071266, "grad_norm": 2.6286706924438477, "learning_rate": 1.8997858672376873e-05, "loss": 0.1562124788761139, "num_input_tokens_seen": 129792, "step": 123, "train_runtime": 329.6428, "train_tokens_per_second": 393.735 }, { "epoch": 0.05299711507639705, "grad_norm": 3.146498680114746, "learning_rate": 1.898929336188437e-05, "loss": 0.17668110132217407, "num_input_tokens_seen": 131134, "step": 124, "train_runtime": 331.8446, "train_tokens_per_second": 395.167 }, { "epoch": 0.05342451116572283, "grad_norm": 3.4509334564208984, "learning_rate": 1.8980728051391863e-05, "loss": 0.17292949557304382, "num_input_tokens_seen": 132050, "step": 125, "train_runtime": 333.9527, "train_tokens_per_second": 395.415 }, { "epoch": 0.05385190725504862, "grad_norm": 2.534871816635132, "learning_rate": 1.8972162740899357e-05, "loss": 0.10803905129432678, "num_input_tokens_seen": 133038, "step": 126, "train_runtime": 336.1115, "train_tokens_per_second": 395.815 }, { "epoch": 0.0542793033443744, "grad_norm": 3.044832468032837, "learning_rate": 1.8963597430406854e-05, "loss": 0.2335970103740692, "num_input_tokens_seen": 134130, "step": 127, "train_runtime": 338.3016, "train_tokens_per_second": 396.481 }, { "epoch": 0.054706699433700184, "grad_norm": 2.9310450553894043, "learning_rate": 1.895503211991435e-05, "loss": 0.16756904125213623, "num_input_tokens_seen": 134706, "step": 128, "train_runtime": 340.3321, "train_tokens_per_second": 395.807 }, { "epoch": 0.055134095523025964, "grad_norm": 2.2983131408691406, "learning_rate": 1.8946466809421844e-05, "loss": 0.13437138497829437, "num_input_tokens_seen": 135978, "step": 129, "train_runtime": 342.5484, "train_tokens_per_second": 396.96 }, { "epoch": 0.05556149161235175, "grad_norm": 2.626601219177246, "learning_rate": 1.8937901498929338e-05, "loss": 0.12764504551887512, "num_input_tokens_seen": 137126, "step": 130, "train_runtime": 344.7782, "train_tokens_per_second": 397.722 }, { "epoch": 0.05598888770167753, "grad_norm": 2.019998073577881, "learning_rate": 1.892933618843683e-05, "loss": 0.13619019091129303, "num_input_tokens_seen": 138358, "step": 131, "train_runtime": 347.0358, "train_tokens_per_second": 398.685 }, { "epoch": 0.05641628379100331, "grad_norm": 2.5856571197509766, "learning_rate": 1.892077087794433e-05, "loss": 0.15411287546157837, "num_input_tokens_seen": 139642, "step": 132, "train_runtime": 349.283, "train_tokens_per_second": 399.796 }, { "epoch": 0.056843679880329095, "grad_norm": 3.2656030654907227, "learning_rate": 1.8912205567451822e-05, "loss": 0.15369434654712677, "num_input_tokens_seen": 140602, "step": 133, "train_runtime": 351.3998, "train_tokens_per_second": 400.12 }, { "epoch": 0.057271075969654875, "grad_norm": 2.674243688583374, "learning_rate": 1.8903640256959316e-05, "loss": 0.14965379238128662, "num_input_tokens_seen": 141428, "step": 134, "train_runtime": 353.5227, "train_tokens_per_second": 400.053 }, { "epoch": 0.05769847205898066, "grad_norm": 2.88669753074646, "learning_rate": 1.8895074946466813e-05, "loss": 0.209254652261734, "num_input_tokens_seen": 142422, "step": 135, "train_runtime": 355.6628, "train_tokens_per_second": 400.441 }, { "epoch": 0.05812586814830644, "grad_norm": 2.648721933364868, "learning_rate": 1.8886509635974306e-05, "loss": 0.1788233518600464, "num_input_tokens_seen": 143346, "step": 136, "train_runtime": 357.7754, "train_tokens_per_second": 400.659 }, { "epoch": 0.05855326423763223, "grad_norm": 3.3400492668151855, "learning_rate": 1.88779443254818e-05, "loss": 0.12309592962265015, "num_input_tokens_seen": 144322, "step": 137, "train_runtime": 359.9237, "train_tokens_per_second": 400.979 }, { "epoch": 0.05898066032695801, "grad_norm": 2.2111668586730957, "learning_rate": 1.8869379014989297e-05, "loss": 0.14022229611873627, "num_input_tokens_seen": 145602, "step": 138, "train_runtime": 362.1712, "train_tokens_per_second": 402.025 }, { "epoch": 0.05940805641628379, "grad_norm": 2.625178098678589, "learning_rate": 1.886081370449679e-05, "loss": 0.13012517988681793, "num_input_tokens_seen": 146480, "step": 139, "train_runtime": 364.2828, "train_tokens_per_second": 402.105 }, { "epoch": 0.05983545250560957, "grad_norm": 2.639256715774536, "learning_rate": 1.8852248394004284e-05, "loss": 0.12265259772539139, "num_input_tokens_seen": 147280, "step": 140, "train_runtime": 366.3331, "train_tokens_per_second": 402.038 }, { "epoch": 0.06026284859493536, "grad_norm": 1.7917380332946777, "learning_rate": 1.8843683083511778e-05, "loss": 0.07711537182331085, "num_input_tokens_seen": 148260, "step": 141, "train_runtime": 368.4477, "train_tokens_per_second": 402.391 }, { "epoch": 0.06069024468426114, "grad_norm": 2.7852940559387207, "learning_rate": 1.8835117773019275e-05, "loss": 0.19466297328472137, "num_input_tokens_seen": 149334, "step": 142, "train_runtime": 370.5824, "train_tokens_per_second": 402.971 }, { "epoch": 0.061117640773586925, "grad_norm": 3.0726804733276367, "learning_rate": 1.8826552462526768e-05, "loss": 0.1678939312696457, "num_input_tokens_seen": 150540, "step": 143, "train_runtime": 372.7552, "train_tokens_per_second": 403.857 }, { "epoch": 0.061545036862912704, "grad_norm": 3.7869203090667725, "learning_rate": 1.8817987152034262e-05, "loss": 0.11771175265312195, "num_input_tokens_seen": 151166, "step": 144, "train_runtime": 374.8031, "train_tokens_per_second": 403.321 }, { "epoch": 0.06197243295223849, "grad_norm": 1.8861055374145508, "learning_rate": 1.880942184154176e-05, "loss": 0.12411846965551376, "num_input_tokens_seen": 152380, "step": 145, "train_runtime": 377.0193, "train_tokens_per_second": 404.17 }, { "epoch": 0.06239982904156427, "grad_norm": 3.237966299057007, "learning_rate": 1.8800856531049252e-05, "loss": 0.22751623392105103, "num_input_tokens_seen": 153262, "step": 146, "train_runtime": 379.1431, "train_tokens_per_second": 404.233 }, { "epoch": 0.06282722513089005, "grad_norm": 3.3436999320983887, "learning_rate": 1.8792291220556746e-05, "loss": 0.2286110818386078, "num_input_tokens_seen": 154144, "step": 147, "train_runtime": 381.256, "train_tokens_per_second": 404.306 }, { "epoch": 0.06325462122021583, "grad_norm": 3.9338934421539307, "learning_rate": 1.878372591006424e-05, "loss": 0.21310165524482727, "num_input_tokens_seen": 155234, "step": 148, "train_runtime": 383.3973, "train_tokens_per_second": 404.891 }, { "epoch": 0.06368201730954162, "grad_norm": 2.587639570236206, "learning_rate": 1.8775160599571736e-05, "loss": 0.12459132075309753, "num_input_tokens_seen": 156324, "step": 149, "train_runtime": 385.57, "train_tokens_per_second": 405.436 }, { "epoch": 0.0641094133988674, "grad_norm": 2.183586835861206, "learning_rate": 1.876659528907923e-05, "loss": 0.1108795702457428, "num_input_tokens_seen": 157768, "step": 150, "train_runtime": 387.8474, "train_tokens_per_second": 406.779 }, { "epoch": 0.06453680948819318, "grad_norm": 3.4277262687683105, "learning_rate": 1.8758029978586724e-05, "loss": 0.14123637974262238, "num_input_tokens_seen": 158492, "step": 151, "train_runtime": 402.7861, "train_tokens_per_second": 393.489 }, { "epoch": 0.06496420557751896, "grad_norm": 2.3510217666625977, "learning_rate": 1.874946466809422e-05, "loss": 0.12269590049982071, "num_input_tokens_seen": 159674, "step": 152, "train_runtime": 404.9707, "train_tokens_per_second": 394.285 }, { "epoch": 0.06539160166684475, "grad_norm": 4.690629005432129, "learning_rate": 1.8740899357601714e-05, "loss": 0.19219471514225006, "num_input_tokens_seen": 160804, "step": 153, "train_runtime": 407.1537, "train_tokens_per_second": 394.947 }, { "epoch": 0.06581899775617053, "grad_norm": 2.6074059009552, "learning_rate": 1.8732334047109208e-05, "loss": 0.11395706981420517, "num_input_tokens_seen": 161480, "step": 154, "train_runtime": 409.2642, "train_tokens_per_second": 394.562 }, { "epoch": 0.06624639384549631, "grad_norm": 2.2025363445281982, "learning_rate": 1.8723768736616705e-05, "loss": 0.13544486463069916, "num_input_tokens_seen": 162474, "step": 155, "train_runtime": 411.4637, "train_tokens_per_second": 394.868 }, { "epoch": 0.06667378993482209, "grad_norm": 2.196251153945923, "learning_rate": 1.8715203426124198e-05, "loss": 0.12494926899671555, "num_input_tokens_seen": 163560, "step": 156, "train_runtime": 413.7073, "train_tokens_per_second": 395.352 }, { "epoch": 0.06710118602414789, "grad_norm": 2.108823776245117, "learning_rate": 1.8706638115631692e-05, "loss": 0.1273869276046753, "num_input_tokens_seen": 164948, "step": 157, "train_runtime": 415.9336, "train_tokens_per_second": 396.573 }, { "epoch": 0.06752858211347366, "grad_norm": 3.1646013259887695, "learning_rate": 1.8698072805139185e-05, "loss": 0.16859130561351776, "num_input_tokens_seen": 166248, "step": 158, "train_runtime": 418.1513, "train_tokens_per_second": 397.579 }, { "epoch": 0.06795597820279944, "grad_norm": 2.6576366424560547, "learning_rate": 1.8689507494646682e-05, "loss": 0.15689724683761597, "num_input_tokens_seen": 167720, "step": 159, "train_runtime": 420.3928, "train_tokens_per_second": 398.96 }, { "epoch": 0.06838337429212522, "grad_norm": 2.3928253650665283, "learning_rate": 1.8680942184154176e-05, "loss": 0.12165988236665726, "num_input_tokens_seen": 168542, "step": 160, "train_runtime": 422.6093, "train_tokens_per_second": 398.813 }, { "epoch": 0.068810770381451, "grad_norm": 2.780294418334961, "learning_rate": 1.8672376873661673e-05, "loss": 0.16876442730426788, "num_input_tokens_seen": 169602, "step": 161, "train_runtime": 424.7908, "train_tokens_per_second": 399.26 }, { "epoch": 0.0692381664707768, "grad_norm": 2.7053773403167725, "learning_rate": 1.8663811563169167e-05, "loss": 0.18703073263168335, "num_input_tokens_seen": 170802, "step": 162, "train_runtime": 427.0142, "train_tokens_per_second": 399.991 }, { "epoch": 0.06966556256010258, "grad_norm": 3.031386375427246, "learning_rate": 1.8655246252676663e-05, "loss": 0.16896308958530426, "num_input_tokens_seen": 171650, "step": 163, "train_runtime": 429.2249, "train_tokens_per_second": 399.907 }, { "epoch": 0.07009295864942836, "grad_norm": 4.824985980987549, "learning_rate": 1.8646680942184157e-05, "loss": 0.136264830827713, "num_input_tokens_seen": 172970, "step": 164, "train_runtime": 431.4317, "train_tokens_per_second": 400.921 }, { "epoch": 0.07052035473875413, "grad_norm": 2.955947160720825, "learning_rate": 1.863811563169165e-05, "loss": 0.11156176030635834, "num_input_tokens_seen": 173750, "step": 165, "train_runtime": 433.6023, "train_tokens_per_second": 400.713 }, { "epoch": 0.07094775082807993, "grad_norm": 2.719355821609497, "learning_rate": 1.8629550321199144e-05, "loss": 0.10591128468513489, "num_input_tokens_seen": 174504, "step": 166, "train_runtime": 435.6779, "train_tokens_per_second": 400.534 }, { "epoch": 0.07137514691740571, "grad_norm": 2.1519153118133545, "learning_rate": 1.862098501070664e-05, "loss": 0.15222682058811188, "num_input_tokens_seen": 176096, "step": 167, "train_runtime": 437.9449, "train_tokens_per_second": 402.096 }, { "epoch": 0.07180254300673149, "grad_norm": 2.770578384399414, "learning_rate": 1.8612419700214135e-05, "loss": 0.06951254606246948, "num_input_tokens_seen": 176826, "step": 168, "train_runtime": 440.0755, "train_tokens_per_second": 401.808 }, { "epoch": 0.07222993909605727, "grad_norm": 4.301676273345947, "learning_rate": 1.860385438972163e-05, "loss": 0.16717997193336487, "num_input_tokens_seen": 177404, "step": 169, "train_runtime": 442.1217, "train_tokens_per_second": 401.256 }, { "epoch": 0.07265733518538306, "grad_norm": 2.3800697326660156, "learning_rate": 1.8595289079229125e-05, "loss": 0.16987770795822144, "num_input_tokens_seen": 179500, "step": 170, "train_runtime": 444.5247, "train_tokens_per_second": 403.802 }, { "epoch": 0.07308473127470884, "grad_norm": 2.3078956604003906, "learning_rate": 1.858672376873662e-05, "loss": 0.13644614815711975, "num_input_tokens_seen": 180552, "step": 171, "train_runtime": 446.6741, "train_tokens_per_second": 404.214 }, { "epoch": 0.07351212736403462, "grad_norm": 2.790173292160034, "learning_rate": 1.8578158458244112e-05, "loss": 0.13570502400398254, "num_input_tokens_seen": 181674, "step": 172, "train_runtime": 448.8487, "train_tokens_per_second": 404.756 }, { "epoch": 0.0739395234533604, "grad_norm": 1.8088078498840332, "learning_rate": 1.856959314775161e-05, "loss": 0.16932730376720428, "num_input_tokens_seen": 183070, "step": 173, "train_runtime": 451.0931, "train_tokens_per_second": 405.836 }, { "epoch": 0.07436691954268619, "grad_norm": 1.8960585594177246, "learning_rate": 1.8561027837259103e-05, "loss": 0.07350532710552216, "num_input_tokens_seen": 184102, "step": 174, "train_runtime": 453.2641, "train_tokens_per_second": 406.169 }, { "epoch": 0.07479431563201197, "grad_norm": 2.1732749938964844, "learning_rate": 1.8552462526766597e-05, "loss": 0.08764903247356415, "num_input_tokens_seen": 184738, "step": 175, "train_runtime": 455.408, "train_tokens_per_second": 405.654 }, { "epoch": 0.07522171172133775, "grad_norm": 2.697097063064575, "learning_rate": 1.854389721627409e-05, "loss": 0.14000815153121948, "num_input_tokens_seen": 185658, "step": 176, "train_runtime": 457.604, "train_tokens_per_second": 405.718 }, { "epoch": 0.07564910781066353, "grad_norm": 3.2530503273010254, "learning_rate": 1.8535331905781587e-05, "loss": 0.18933287262916565, "num_input_tokens_seen": 186548, "step": 177, "train_runtime": 459.7258, "train_tokens_per_second": 405.781 }, { "epoch": 0.07607650389998931, "grad_norm": 2.815422773361206, "learning_rate": 1.852676659528908e-05, "loss": 0.12568920850753784, "num_input_tokens_seen": 187216, "step": 178, "train_runtime": 461.8382, "train_tokens_per_second": 405.371 }, { "epoch": 0.0765038999893151, "grad_norm": 3.2178752422332764, "learning_rate": 1.8518201284796574e-05, "loss": 0.12453125417232513, "num_input_tokens_seen": 187852, "step": 179, "train_runtime": 463.8893, "train_tokens_per_second": 404.95 }, { "epoch": 0.07693129607864088, "grad_norm": 2.459148406982422, "learning_rate": 1.850963597430407e-05, "loss": 0.08641057461500168, "num_input_tokens_seen": 188776, "step": 180, "train_runtime": 466.0309, "train_tokens_per_second": 405.072 }, { "epoch": 0.07735869216796666, "grad_norm": 2.2573819160461426, "learning_rate": 1.8501070663811565e-05, "loss": 0.08526496589183807, "num_input_tokens_seen": 189660, "step": 181, "train_runtime": 480.9503, "train_tokens_per_second": 394.344 }, { "epoch": 0.07778608825729244, "grad_norm": 2.2413618564605713, "learning_rate": 1.849250535331906e-05, "loss": 0.14132985472679138, "num_input_tokens_seen": 190660, "step": 182, "train_runtime": 483.2366, "train_tokens_per_second": 394.548 }, { "epoch": 0.07821348434661823, "grad_norm": 3.891188383102417, "learning_rate": 1.8483940042826552e-05, "loss": 0.16914093494415283, "num_input_tokens_seen": 191388, "step": 183, "train_runtime": 485.3233, "train_tokens_per_second": 394.352 }, { "epoch": 0.07864088043594401, "grad_norm": 2.1474502086639404, "learning_rate": 1.847537473233405e-05, "loss": 0.15462908148765564, "num_input_tokens_seen": 192522, "step": 184, "train_runtime": 487.4924, "train_tokens_per_second": 394.923 }, { "epoch": 0.07906827652526979, "grad_norm": 2.069824457168579, "learning_rate": 1.8466809421841543e-05, "loss": 0.09241805225610733, "num_input_tokens_seen": 193656, "step": 185, "train_runtime": 489.6796, "train_tokens_per_second": 395.475 }, { "epoch": 0.07949567261459557, "grad_norm": 2.976578950881958, "learning_rate": 1.8458244111349036e-05, "loss": 0.1367039829492569, "num_input_tokens_seen": 194402, "step": 186, "train_runtime": 491.7699, "train_tokens_per_second": 395.311 }, { "epoch": 0.07992306870392137, "grad_norm": 2.552767038345337, "learning_rate": 1.8449678800856533e-05, "loss": 0.17709875106811523, "num_input_tokens_seen": 195820, "step": 187, "train_runtime": 494.0382, "train_tokens_per_second": 396.366 }, { "epoch": 0.08035046479324714, "grad_norm": 2.4601333141326904, "learning_rate": 1.8441113490364027e-05, "loss": 0.11731860041618347, "num_input_tokens_seen": 196646, "step": 188, "train_runtime": 496.1262, "train_tokens_per_second": 396.363 }, { "epoch": 0.08077786088257292, "grad_norm": 2.562448740005493, "learning_rate": 1.843254817987152e-05, "loss": 0.14701655507087708, "num_input_tokens_seen": 197934, "step": 189, "train_runtime": 498.3383, "train_tokens_per_second": 397.188 }, { "epoch": 0.0812052569718987, "grad_norm": 2.922214984893799, "learning_rate": 1.8423982869379017e-05, "loss": 0.14705628156661987, "num_input_tokens_seen": 198668, "step": 190, "train_runtime": 500.4192, "train_tokens_per_second": 397.003 }, { "epoch": 0.08163265306122448, "grad_norm": 2.3108713626861572, "learning_rate": 1.841541755888651e-05, "loss": 0.10518313199281693, "num_input_tokens_seen": 199602, "step": 191, "train_runtime": 502.5654, "train_tokens_per_second": 397.166 }, { "epoch": 0.08206004915055028, "grad_norm": 2.9117729663848877, "learning_rate": 1.8406852248394004e-05, "loss": 0.18447798490524292, "num_input_tokens_seen": 200542, "step": 192, "train_runtime": 505.0707, "train_tokens_per_second": 397.057 }, { "epoch": 0.08248744523987606, "grad_norm": 4.030701160430908, "learning_rate": 1.8398286937901498e-05, "loss": 0.1964586079120636, "num_input_tokens_seen": 201758, "step": 193, "train_runtime": 507.2919, "train_tokens_per_second": 397.716 }, { "epoch": 0.08291484132920184, "grad_norm": 3.2769336700439453, "learning_rate": 1.8389721627408995e-05, "loss": 0.16791115701198578, "num_input_tokens_seen": 203172, "step": 194, "train_runtime": 509.5303, "train_tokens_per_second": 398.744 }, { "epoch": 0.08334223741852761, "grad_norm": 3.20062255859375, "learning_rate": 1.8381156316916492e-05, "loss": 0.13727587461471558, "num_input_tokens_seen": 204078, "step": 195, "train_runtime": 511.6734, "train_tokens_per_second": 398.844 }, { "epoch": 0.08376963350785341, "grad_norm": 2.539637327194214, "learning_rate": 1.8372591006423986e-05, "loss": 0.1486874520778656, "num_input_tokens_seen": 204922, "step": 196, "train_runtime": 513.7872, "train_tokens_per_second": 398.846 }, { "epoch": 0.08419702959717919, "grad_norm": 2.175872802734375, "learning_rate": 1.836402569593148e-05, "loss": 0.09931616485118866, "num_input_tokens_seen": 206042, "step": 197, "train_runtime": 515.9622, "train_tokens_per_second": 399.335 }, { "epoch": 0.08462442568650497, "grad_norm": 1.9456276893615723, "learning_rate": 1.8355460385438976e-05, "loss": 0.07155643403530121, "num_input_tokens_seen": 207324, "step": 198, "train_runtime": 518.1694, "train_tokens_per_second": 400.109 }, { "epoch": 0.08505182177583075, "grad_norm": 9.172248840332031, "learning_rate": 1.834689507494647e-05, "loss": 0.300564169883728, "num_input_tokens_seen": 207952, "step": 199, "train_runtime": 520.2399, "train_tokens_per_second": 399.723 }, { "epoch": 0.08547921786515654, "grad_norm": 2.8427793979644775, "learning_rate": 1.8338329764453963e-05, "loss": 0.10430914163589478, "num_input_tokens_seen": 208652, "step": 200, "train_runtime": 522.3632, "train_tokens_per_second": 399.439 }, { "epoch": 0.08590661395448232, "grad_norm": 1.8212063312530518, "learning_rate": 1.8329764453961457e-05, "loss": 0.08782214671373367, "num_input_tokens_seen": 210218, "step": 201, "train_runtime": 524.763, "train_tokens_per_second": 400.596 }, { "epoch": 0.0863340100438081, "grad_norm": 3.479308605194092, "learning_rate": 1.8321199143468954e-05, "loss": 0.1703043282032013, "num_input_tokens_seen": 211226, "step": 202, "train_runtime": 526.8819, "train_tokens_per_second": 400.898 }, { "epoch": 0.08676140613313388, "grad_norm": 3.103154182434082, "learning_rate": 1.8312633832976447e-05, "loss": 0.24448205530643463, "num_input_tokens_seen": 212022, "step": 203, "train_runtime": 528.9638, "train_tokens_per_second": 400.825 }, { "epoch": 0.08718880222245966, "grad_norm": 3.6667208671569824, "learning_rate": 1.830406852248394e-05, "loss": 0.18636125326156616, "num_input_tokens_seen": 212970, "step": 204, "train_runtime": 531.0816, "train_tokens_per_second": 401.012 }, { "epoch": 0.08761619831178545, "grad_norm": 1.9753594398498535, "learning_rate": 1.8295503211991438e-05, "loss": 0.1380254477262497, "num_input_tokens_seen": 214772, "step": 205, "train_runtime": 533.4082, "train_tokens_per_second": 402.641 }, { "epoch": 0.08804359440111123, "grad_norm": 2.537839889526367, "learning_rate": 1.828693790149893e-05, "loss": 0.14635343849658966, "num_input_tokens_seen": 215602, "step": 206, "train_runtime": 535.4898, "train_tokens_per_second": 402.626 }, { "epoch": 0.08847099049043701, "grad_norm": 2.4614720344543457, "learning_rate": 1.8278372591006425e-05, "loss": 0.14110636711120605, "num_input_tokens_seen": 216490, "step": 207, "train_runtime": 537.598, "train_tokens_per_second": 402.699 }, { "epoch": 0.08889838657976279, "grad_norm": 2.7557902336120605, "learning_rate": 1.826980728051392e-05, "loss": 0.14107386767864227, "num_input_tokens_seen": 217204, "step": 208, "train_runtime": 539.7033, "train_tokens_per_second": 402.451 }, { "epoch": 0.08932578266908858, "grad_norm": 2.0920276641845703, "learning_rate": 1.8261241970021416e-05, "loss": 0.1339716911315918, "num_input_tokens_seen": 218624, "step": 209, "train_runtime": 541.9757, "train_tokens_per_second": 403.383 }, { "epoch": 0.08975317875841436, "grad_norm": 1.595695972442627, "learning_rate": 1.825267665952891e-05, "loss": 0.11375150084495544, "num_input_tokens_seen": 220324, "step": 210, "train_runtime": 544.3085, "train_tokens_per_second": 404.778 }, { "epoch": 0.09018057484774014, "grad_norm": 2.601152181625366, "learning_rate": 1.8244111349036403e-05, "loss": 0.16513817012310028, "num_input_tokens_seen": 221488, "step": 211, "train_runtime": 559.005, "train_tokens_per_second": 396.218 }, { "epoch": 0.09060797093706592, "grad_norm": 1.9013690948486328, "learning_rate": 1.82355460385439e-05, "loss": 0.08416628837585449, "num_input_tokens_seen": 222612, "step": 212, "train_runtime": 561.4614, "train_tokens_per_second": 396.487 }, { "epoch": 0.09103536702639171, "grad_norm": 3.1588644981384277, "learning_rate": 1.8226980728051393e-05, "loss": 0.1620885729789734, "num_input_tokens_seen": 223292, "step": 213, "train_runtime": 564.0587, "train_tokens_per_second": 395.867 }, { "epoch": 0.0914627631157175, "grad_norm": 2.1632750034332275, "learning_rate": 1.8218415417558887e-05, "loss": 0.13554327189922333, "num_input_tokens_seen": 224310, "step": 214, "train_runtime": 566.1726, "train_tokens_per_second": 396.187 }, { "epoch": 0.09189015920504327, "grad_norm": 3.0766916275024414, "learning_rate": 1.8209850107066384e-05, "loss": 0.24831382930278778, "num_input_tokens_seen": 225312, "step": 215, "train_runtime": 568.3236, "train_tokens_per_second": 396.45 }, { "epoch": 0.09231755529436905, "grad_norm": 2.6327812671661377, "learning_rate": 1.8201284796573878e-05, "loss": 0.20338904857635498, "num_input_tokens_seen": 226316, "step": 216, "train_runtime": 570.4649, "train_tokens_per_second": 396.722 }, { "epoch": 0.09274495138369485, "grad_norm": 2.084002733230591, "learning_rate": 1.819271948608137e-05, "loss": 0.13886387646198273, "num_input_tokens_seen": 227250, "step": 217, "train_runtime": 572.5815, "train_tokens_per_second": 396.887 }, { "epoch": 0.09317234747302063, "grad_norm": 3.710822343826294, "learning_rate": 1.8184154175588865e-05, "loss": 0.15294967591762543, "num_input_tokens_seen": 228122, "step": 218, "train_runtime": 574.7105, "train_tokens_per_second": 396.934 }, { "epoch": 0.0935997435623464, "grad_norm": 2.816504716873169, "learning_rate": 1.817558886509636e-05, "loss": 0.15463289618492126, "num_input_tokens_seen": 229052, "step": 219, "train_runtime": 576.8652, "train_tokens_per_second": 397.063 }, { "epoch": 0.09402713965167218, "grad_norm": 2.4213547706604004, "learning_rate": 1.8167023554603855e-05, "loss": 0.10694430768489838, "num_input_tokens_seen": 229902, "step": 220, "train_runtime": 578.9749, "train_tokens_per_second": 397.085 }, { "epoch": 0.09445453574099796, "grad_norm": 3.384366750717163, "learning_rate": 1.815845824411135e-05, "loss": 0.24293643236160278, "num_input_tokens_seen": 230608, "step": 221, "train_runtime": 581.0437, "train_tokens_per_second": 396.886 }, { "epoch": 0.09488193183032376, "grad_norm": 2.192532777786255, "learning_rate": 1.8149892933618846e-05, "loss": 0.12488202750682831, "num_input_tokens_seen": 231556, "step": 222, "train_runtime": 583.1659, "train_tokens_per_second": 397.067 }, { "epoch": 0.09530932791964954, "grad_norm": 2.5996503829956055, "learning_rate": 1.814132762312634e-05, "loss": 0.1616736352443695, "num_input_tokens_seen": 232788, "step": 223, "train_runtime": 585.3168, "train_tokens_per_second": 397.713 }, { "epoch": 0.09573672400897532, "grad_norm": 3.0567333698272705, "learning_rate": 1.8132762312633833e-05, "loss": 0.11727012693881989, "num_input_tokens_seen": 233850, "step": 224, "train_runtime": 587.5038, "train_tokens_per_second": 398.04 }, { "epoch": 0.0961641200983011, "grad_norm": 2.4953536987304688, "learning_rate": 1.812419700214133e-05, "loss": 0.15394356846809387, "num_input_tokens_seen": 234864, "step": 225, "train_runtime": 589.6543, "train_tokens_per_second": 398.308 }, { "epoch": 0.09659151618762689, "grad_norm": 3.021813154220581, "learning_rate": 1.8115631691648824e-05, "loss": 0.1111551821231842, "num_input_tokens_seen": 235708, "step": 226, "train_runtime": 591.7278, "train_tokens_per_second": 398.339 }, { "epoch": 0.09701891227695267, "grad_norm": 2.5380287170410156, "learning_rate": 1.8107066381156317e-05, "loss": 0.1878495067358017, "num_input_tokens_seen": 236636, "step": 227, "train_runtime": 593.8048, "train_tokens_per_second": 398.508 }, { "epoch": 0.09744630836627845, "grad_norm": 2.5771961212158203, "learning_rate": 1.809850107066381e-05, "loss": 0.09383850544691086, "num_input_tokens_seen": 237612, "step": 228, "train_runtime": 595.981, "train_tokens_per_second": 398.691 }, { "epoch": 0.09787370445560423, "grad_norm": 1.9830071926116943, "learning_rate": 1.8089935760171308e-05, "loss": 0.12542767822742462, "num_input_tokens_seen": 238602, "step": 229, "train_runtime": 598.1479, "train_tokens_per_second": 398.901 }, { "epoch": 0.09830110054493002, "grad_norm": 2.5134365558624268, "learning_rate": 1.8081370449678805e-05, "loss": 0.1433359980583191, "num_input_tokens_seen": 239698, "step": 230, "train_runtime": 600.2815, "train_tokens_per_second": 399.309 }, { "epoch": 0.0987284966342558, "grad_norm": 2.7335493564605713, "learning_rate": 1.8072805139186298e-05, "loss": 0.16575391590595245, "num_input_tokens_seen": 240628, "step": 231, "train_runtime": 602.3973, "train_tokens_per_second": 399.451 }, { "epoch": 0.09915589272358158, "grad_norm": 3.091836929321289, "learning_rate": 1.8064239828693792e-05, "loss": 0.1720246970653534, "num_input_tokens_seen": 241414, "step": 232, "train_runtime": 604.4874, "train_tokens_per_second": 399.37 }, { "epoch": 0.09958328881290736, "grad_norm": 3.3940083980560303, "learning_rate": 1.805567451820129e-05, "loss": 0.11671648919582367, "num_input_tokens_seen": 242032, "step": 233, "train_runtime": 606.5232, "train_tokens_per_second": 399.048 }, { "epoch": 0.10001068490223314, "grad_norm": 2.0419411659240723, "learning_rate": 1.8047109207708782e-05, "loss": 0.11255921423435211, "num_input_tokens_seen": 243242, "step": 234, "train_runtime": 608.7078, "train_tokens_per_second": 399.604 }, { "epoch": 0.10001068490223314, "eval_loss": 0.5460442900657654, "eval_runtime": 58.7026, "eval_samples_per_second": 17.001, "eval_steps_per_second": 8.5, "num_input_tokens_seen": 243242, "step": 234 }, { "epoch": 0.10043808099155893, "grad_norm": 2.1736838817596436, "learning_rate": 1.8038543897216276e-05, "loss": 0.13026940822601318, "num_input_tokens_seen": 244358, "step": 235, "train_runtime": 669.6541, "train_tokens_per_second": 364.902 }, { "epoch": 0.10086547708088471, "grad_norm": 3.106304168701172, "learning_rate": 1.802997858672377e-05, "loss": 0.10195129364728928, "num_input_tokens_seen": 245862, "step": 236, "train_runtime": 671.8926, "train_tokens_per_second": 365.925 }, { "epoch": 0.10129287317021049, "grad_norm": 2.8228931427001953, "learning_rate": 1.8021413276231267e-05, "loss": 0.1436556726694107, "num_input_tokens_seen": 246806, "step": 237, "train_runtime": 674.0182, "train_tokens_per_second": 366.171 }, { "epoch": 0.10172026925953627, "grad_norm": 2.6426894664764404, "learning_rate": 1.801284796573876e-05, "loss": 0.1319834440946579, "num_input_tokens_seen": 248106, "step": 238, "train_runtime": 676.2569, "train_tokens_per_second": 366.881 }, { "epoch": 0.10214766534886206, "grad_norm": 4.234355449676514, "learning_rate": 1.8004282655246254e-05, "loss": 0.181757390499115, "num_input_tokens_seen": 249094, "step": 239, "train_runtime": 678.4898, "train_tokens_per_second": 367.13 }, { "epoch": 0.10257506143818784, "grad_norm": 2.244966745376587, "learning_rate": 1.799571734475375e-05, "loss": 0.08931125700473785, "num_input_tokens_seen": 249848, "step": 240, "train_runtime": 680.5725, "train_tokens_per_second": 367.114 }, { "epoch": 0.10300245752751362, "grad_norm": 2.718444347381592, "learning_rate": 1.7987152034261244e-05, "loss": 0.11326509714126587, "num_input_tokens_seen": 250600, "step": 241, "train_runtime": 696.4525, "train_tokens_per_second": 359.824 }, { "epoch": 0.1034298536168394, "grad_norm": 2.602396249771118, "learning_rate": 1.7978586723768738e-05, "loss": 0.1372726708650589, "num_input_tokens_seen": 251420, "step": 242, "train_runtime": 698.6553, "train_tokens_per_second": 359.863 }, { "epoch": 0.1038572497061652, "grad_norm": 2.42930269241333, "learning_rate": 1.797002141327623e-05, "loss": 0.14384983479976654, "num_input_tokens_seen": 252652, "step": 243, "train_runtime": 700.8388, "train_tokens_per_second": 360.499 }, { "epoch": 0.10428464579549097, "grad_norm": 3.0484702587127686, "learning_rate": 1.796145610278373e-05, "loss": 0.13648635149002075, "num_input_tokens_seen": 253610, "step": 244, "train_runtime": 703.0223, "train_tokens_per_second": 360.742 }, { "epoch": 0.10471204188481675, "grad_norm": 2.5430545806884766, "learning_rate": 1.7952890792291222e-05, "loss": 0.12859664857387543, "num_input_tokens_seen": 254638, "step": 245, "train_runtime": 705.2587, "train_tokens_per_second": 361.056 }, { "epoch": 0.10513943797414253, "grad_norm": 3.431422472000122, "learning_rate": 1.7944325481798716e-05, "loss": 0.15991127490997314, "num_input_tokens_seen": 255274, "step": 246, "train_runtime": 707.3851, "train_tokens_per_second": 360.87 }, { "epoch": 0.10556683406346833, "grad_norm": 2.83520770072937, "learning_rate": 1.7935760171306212e-05, "loss": 0.1783464252948761, "num_input_tokens_seen": 256368, "step": 247, "train_runtime": 709.5336, "train_tokens_per_second": 361.319 }, { "epoch": 0.1059942301527941, "grad_norm": 3.489138603210449, "learning_rate": 1.7927194860813706e-05, "loss": 0.1545252799987793, "num_input_tokens_seen": 257026, "step": 248, "train_runtime": 711.6423, "train_tokens_per_second": 361.173 }, { "epoch": 0.10642162624211988, "grad_norm": 2.563042163848877, "learning_rate": 1.79186295503212e-05, "loss": 0.08376234769821167, "num_input_tokens_seen": 257790, "step": 249, "train_runtime": 713.7212, "train_tokens_per_second": 361.191 }, { "epoch": 0.10684902233144566, "grad_norm": 4.280882358551025, "learning_rate": 1.7910064239828697e-05, "loss": 0.151292622089386, "num_input_tokens_seen": 259262, "step": 250, "train_runtime": 715.9656, "train_tokens_per_second": 362.115 }, { "epoch": 0.10727641842077144, "grad_norm": 2.9446420669555664, "learning_rate": 1.790149892933619e-05, "loss": 0.143342062830925, "num_input_tokens_seen": 260110, "step": 251, "train_runtime": 718.2046, "train_tokens_per_second": 362.167 }, { "epoch": 0.10770381451009724, "grad_norm": 2.2392935752868652, "learning_rate": 1.7892933618843684e-05, "loss": 0.12866157293319702, "num_input_tokens_seen": 261606, "step": 252, "train_runtime": 720.5883, "train_tokens_per_second": 363.045 }, { "epoch": 0.10813121059942302, "grad_norm": 2.1731903553009033, "learning_rate": 1.7884368308351177e-05, "loss": 0.1116916686296463, "num_input_tokens_seen": 262526, "step": 253, "train_runtime": 722.6988, "train_tokens_per_second": 363.258 }, { "epoch": 0.1085586066887488, "grad_norm": 4.395053863525391, "learning_rate": 1.7875802997858674e-05, "loss": 0.15097469091415405, "num_input_tokens_seen": 263480, "step": 254, "train_runtime": 724.8382, "train_tokens_per_second": 363.502 }, { "epoch": 0.10898600277807458, "grad_norm": 3.175166130065918, "learning_rate": 1.7867237687366168e-05, "loss": 0.15582749247550964, "num_input_tokens_seen": 264340, "step": 255, "train_runtime": 726.9482, "train_tokens_per_second": 363.63 }, { "epoch": 0.10941339886740037, "grad_norm": 2.18265438079834, "learning_rate": 1.785867237687366e-05, "loss": 0.1588597595691681, "num_input_tokens_seen": 265376, "step": 256, "train_runtime": 729.0958, "train_tokens_per_second": 363.98 }, { "epoch": 0.10984079495672615, "grad_norm": 3.173163414001465, "learning_rate": 1.785010706638116e-05, "loss": 0.19581833481788635, "num_input_tokens_seen": 266354, "step": 257, "train_runtime": 731.2373, "train_tokens_per_second": 364.251 }, { "epoch": 0.11026819104605193, "grad_norm": 2.3444836139678955, "learning_rate": 1.7841541755888652e-05, "loss": 0.1477520614862442, "num_input_tokens_seen": 267484, "step": 258, "train_runtime": 733.4668, "train_tokens_per_second": 364.685 }, { "epoch": 0.11069558713537771, "grad_norm": 2.4513041973114014, "learning_rate": 1.7832976445396146e-05, "loss": 0.169121652841568, "num_input_tokens_seen": 268488, "step": 259, "train_runtime": 735.6543, "train_tokens_per_second": 364.965 }, { "epoch": 0.1111229832247035, "grad_norm": 2.247398853302002, "learning_rate": 1.782441113490364e-05, "loss": 0.14096848666667938, "num_input_tokens_seen": 269740, "step": 260, "train_runtime": 737.8668, "train_tokens_per_second": 365.567 }, { "epoch": 0.11155037931402928, "grad_norm": 2.104783058166504, "learning_rate": 1.7815845824411136e-05, "loss": 0.1397685408592224, "num_input_tokens_seen": 270722, "step": 261, "train_runtime": 740.0164, "train_tokens_per_second": 365.832 }, { "epoch": 0.11197777540335506, "grad_norm": 2.633096218109131, "learning_rate": 1.780728051391863e-05, "loss": 0.15674568712711334, "num_input_tokens_seen": 271516, "step": 262, "train_runtime": 742.099, "train_tokens_per_second": 365.876 }, { "epoch": 0.11240517149268084, "grad_norm": 3.091400384902954, "learning_rate": 1.7798715203426123e-05, "loss": 0.12970855832099915, "num_input_tokens_seen": 272224, "step": 263, "train_runtime": 744.1502, "train_tokens_per_second": 365.819 }, { "epoch": 0.11283256758200662, "grad_norm": 2.533055067062378, "learning_rate": 1.779014989293362e-05, "loss": 0.1559002697467804, "num_input_tokens_seen": 273658, "step": 264, "train_runtime": 746.3582, "train_tokens_per_second": 366.658 }, { "epoch": 0.11325996367133241, "grad_norm": 2.816351890563965, "learning_rate": 1.7781584582441117e-05, "loss": 0.1578320562839508, "num_input_tokens_seen": 274538, "step": 265, "train_runtime": 748.4778, "train_tokens_per_second": 366.795 }, { "epoch": 0.11368735976065819, "grad_norm": 3.1316685676574707, "learning_rate": 1.777301927194861e-05, "loss": 0.17508356273174286, "num_input_tokens_seen": 275238, "step": 266, "train_runtime": 750.5642, "train_tokens_per_second": 366.708 }, { "epoch": 0.11411475584998397, "grad_norm": 2.4046151638031006, "learning_rate": 1.7764453961456104e-05, "loss": 0.19063466787338257, "num_input_tokens_seen": 276596, "step": 267, "train_runtime": 752.7848, "train_tokens_per_second": 367.43 }, { "epoch": 0.11454215193930975, "grad_norm": 2.954357624053955, "learning_rate": 1.7755888650963598e-05, "loss": 0.13341747224330902, "num_input_tokens_seen": 277522, "step": 268, "train_runtime": 754.9005, "train_tokens_per_second": 367.627 }, { "epoch": 0.11496954802863554, "grad_norm": 3.105802059173584, "learning_rate": 1.7747323340471095e-05, "loss": 0.15308117866516113, "num_input_tokens_seen": 279086, "step": 269, "train_runtime": 757.1899, "train_tokens_per_second": 368.581 }, { "epoch": 0.11539694411796132, "grad_norm": 2.347745418548584, "learning_rate": 1.773875802997859e-05, "loss": 0.12355208396911621, "num_input_tokens_seen": 280000, "step": 270, "train_runtime": 759.3841, "train_tokens_per_second": 368.72 }, { "epoch": 0.1158243402072871, "grad_norm": 2.6124165058135986, "learning_rate": 1.7730192719486082e-05, "loss": 0.11659465730190277, "num_input_tokens_seen": 280854, "step": 271, "train_runtime": 774.768, "train_tokens_per_second": 362.501 }, { "epoch": 0.11625173629661288, "grad_norm": 2.646575689315796, "learning_rate": 1.772162740899358e-05, "loss": 0.14843402802944183, "num_input_tokens_seen": 281708, "step": 272, "train_runtime": 776.8624, "train_tokens_per_second": 362.623 }, { "epoch": 0.11667913238593867, "grad_norm": 1.9934483766555786, "learning_rate": 1.7713062098501073e-05, "loss": 0.11461179703474045, "num_input_tokens_seen": 283286, "step": 273, "train_runtime": 779.2415, "train_tokens_per_second": 363.541 }, { "epoch": 0.11710652847526445, "grad_norm": 3.048039197921753, "learning_rate": 1.7704496788008566e-05, "loss": 0.10470855236053467, "num_input_tokens_seen": 283902, "step": 274, "train_runtime": 781.377, "train_tokens_per_second": 363.335 }, { "epoch": 0.11753392456459023, "grad_norm": 2.832122802734375, "learning_rate": 1.7695931477516063e-05, "loss": 0.12394038587808609, "num_input_tokens_seen": 284622, "step": 275, "train_runtime": 783.4499, "train_tokens_per_second": 363.293 }, { "epoch": 0.11796132065391601, "grad_norm": 2.1014561653137207, "learning_rate": 1.7687366167023557e-05, "loss": 0.18216493725776672, "num_input_tokens_seen": 286416, "step": 276, "train_runtime": 785.7736, "train_tokens_per_second": 364.502 }, { "epoch": 0.11838871674324179, "grad_norm": 2.309156894683838, "learning_rate": 1.767880085653105e-05, "loss": 0.09812641143798828, "num_input_tokens_seen": 287294, "step": 277, "train_runtime": 787.8908, "train_tokens_per_second": 364.637 }, { "epoch": 0.11881611283256759, "grad_norm": 2.1988325119018555, "learning_rate": 1.7670235546038544e-05, "loss": 0.09043700248003006, "num_input_tokens_seen": 288488, "step": 278, "train_runtime": 790.0798, "train_tokens_per_second": 365.138 }, { "epoch": 0.11924350892189337, "grad_norm": 2.2506520748138428, "learning_rate": 1.766167023554604e-05, "loss": 0.1063460111618042, "num_input_tokens_seen": 289728, "step": 279, "train_runtime": 792.2868, "train_tokens_per_second": 365.686 }, { "epoch": 0.11967090501121914, "grad_norm": 3.2995102405548096, "learning_rate": 1.7653104925053535e-05, "loss": 0.12390337884426117, "num_input_tokens_seen": 290828, "step": 280, "train_runtime": 794.4362, "train_tokens_per_second": 366.081 }, { "epoch": 0.12009830110054492, "grad_norm": 1.905795931816101, "learning_rate": 1.7644539614561028e-05, "loss": 0.07884510606527328, "num_input_tokens_seen": 291796, "step": 281, "train_runtime": 796.5539, "train_tokens_per_second": 366.323 }, { "epoch": 0.12052569718987072, "grad_norm": 2.213050365447998, "learning_rate": 1.7635974304068525e-05, "loss": 0.12539790570735931, "num_input_tokens_seen": 292782, "step": 282, "train_runtime": 798.7022, "train_tokens_per_second": 366.572 }, { "epoch": 0.1209530932791965, "grad_norm": 4.263006687164307, "learning_rate": 1.762740899357602e-05, "loss": 0.10484211146831512, "num_input_tokens_seen": 294044, "step": 283, "train_runtime": 800.9192, "train_tokens_per_second": 367.133 }, { "epoch": 0.12138048936852228, "grad_norm": 3.1561226844787598, "learning_rate": 1.7618843683083512e-05, "loss": 0.14216279983520508, "num_input_tokens_seen": 295040, "step": 284, "train_runtime": 803.0984, "train_tokens_per_second": 367.377 }, { "epoch": 0.12180788545784806, "grad_norm": 2.0373404026031494, "learning_rate": 1.761027837259101e-05, "loss": 0.11023009568452835, "num_input_tokens_seen": 296080, "step": 285, "train_runtime": 805.2902, "train_tokens_per_second": 367.669 }, { "epoch": 0.12223528154717385, "grad_norm": 2.9239816665649414, "learning_rate": 1.7601713062098503e-05, "loss": 0.2894620895385742, "num_input_tokens_seen": 296966, "step": 286, "train_runtime": 807.4058, "train_tokens_per_second": 367.803 }, { "epoch": 0.12266267763649963, "grad_norm": 4.2024760246276855, "learning_rate": 1.7593147751605996e-05, "loss": 0.14657855033874512, "num_input_tokens_seen": 297852, "step": 287, "train_runtime": 809.5535, "train_tokens_per_second": 367.921 }, { "epoch": 0.12309007372582541, "grad_norm": 2.8517258167266846, "learning_rate": 1.758458244111349e-05, "loss": 0.19364164769649506, "num_input_tokens_seen": 298816, "step": 288, "train_runtime": 811.6752, "train_tokens_per_second": 368.147 }, { "epoch": 0.12351746981515119, "grad_norm": 2.9998342990875244, "learning_rate": 1.7576017130620987e-05, "loss": 0.15787193179130554, "num_input_tokens_seen": 299528, "step": 289, "train_runtime": 813.729, "train_tokens_per_second": 368.093 }, { "epoch": 0.12394486590447698, "grad_norm": 2.6897270679473877, "learning_rate": 1.756745182012848e-05, "loss": 0.179714635014534, "num_input_tokens_seen": 300536, "step": 290, "train_runtime": 815.9137, "train_tokens_per_second": 368.343 }, { "epoch": 0.12437226199380276, "grad_norm": 2.2788524627685547, "learning_rate": 1.7558886509635974e-05, "loss": 0.1147165596485138, "num_input_tokens_seen": 301440, "step": 291, "train_runtime": 818.0307, "train_tokens_per_second": 368.495 }, { "epoch": 0.12479965808312854, "grad_norm": 2.4706780910491943, "learning_rate": 1.755032119914347e-05, "loss": 0.1395479440689087, "num_input_tokens_seen": 302300, "step": 292, "train_runtime": 820.1939, "train_tokens_per_second": 368.571 }, { "epoch": 0.12522705417245433, "grad_norm": 2.3851404190063477, "learning_rate": 1.7541755888650965e-05, "loss": 0.14536121487617493, "num_input_tokens_seen": 303418, "step": 293, "train_runtime": 822.3458, "train_tokens_per_second": 368.966 }, { "epoch": 0.1256544502617801, "grad_norm": 2.1842844486236572, "learning_rate": 1.7533190578158458e-05, "loss": 0.1375734657049179, "num_input_tokens_seen": 304350, "step": 294, "train_runtime": 824.6257, "train_tokens_per_second": 369.077 }, { "epoch": 0.1260818463511059, "grad_norm": 1.994462013244629, "learning_rate": 1.7524625267665952e-05, "loss": 0.13084162771701813, "num_input_tokens_seen": 305476, "step": 295, "train_runtime": 826.8659, "train_tokens_per_second": 369.438 }, { "epoch": 0.12650924244043166, "grad_norm": 2.4618313312530518, "learning_rate": 1.751605995717345e-05, "loss": 0.14622284471988678, "num_input_tokens_seen": 306308, "step": 296, "train_runtime": 828.9845, "train_tokens_per_second": 369.498 }, { "epoch": 0.12693663852975745, "grad_norm": 1.887038230895996, "learning_rate": 1.7507494646680942e-05, "loss": 0.0890108048915863, "num_input_tokens_seen": 307260, "step": 297, "train_runtime": 831.1363, "train_tokens_per_second": 369.687 }, { "epoch": 0.12736403461908324, "grad_norm": 3.0748531818389893, "learning_rate": 1.749892933618844e-05, "loss": 0.15173892676830292, "num_input_tokens_seen": 307968, "step": 298, "train_runtime": 833.2195, "train_tokens_per_second": 369.612 }, { "epoch": 0.127791430708409, "grad_norm": 1.8806450366973877, "learning_rate": 1.7490364025695933e-05, "loss": 0.09086901694536209, "num_input_tokens_seen": 309040, "step": 299, "train_runtime": 835.4988, "train_tokens_per_second": 369.887 }, { "epoch": 0.1282188267977348, "grad_norm": 2.5331919193267822, "learning_rate": 1.748179871520343e-05, "loss": 0.16212350130081177, "num_input_tokens_seen": 310064, "step": 300, "train_runtime": 837.7224, "train_tokens_per_second": 370.127 }, { "epoch": 0.1286462228870606, "grad_norm": 2.6693081855773926, "learning_rate": 1.7473233404710924e-05, "loss": 0.1564721018075943, "num_input_tokens_seen": 311010, "step": 301, "train_runtime": 853.5044, "train_tokens_per_second": 364.392 }, { "epoch": 0.12907361897638636, "grad_norm": 1.731451153755188, "learning_rate": 1.7464668094218417e-05, "loss": 0.09542805701494217, "num_input_tokens_seen": 312498, "step": 302, "train_runtime": 855.8469, "train_tokens_per_second": 365.133 }, { "epoch": 0.12950101506571216, "grad_norm": 1.7048978805541992, "learning_rate": 1.745610278372591e-05, "loss": 0.11521374434232712, "num_input_tokens_seen": 313832, "step": 303, "train_runtime": 858.0815, "train_tokens_per_second": 365.737 }, { "epoch": 0.12992841115503792, "grad_norm": 2.9149906635284424, "learning_rate": 1.7447537473233408e-05, "loss": 0.1253424882888794, "num_input_tokens_seen": 314562, "step": 304, "train_runtime": 860.2229, "train_tokens_per_second": 365.675 }, { "epoch": 0.13035580724436371, "grad_norm": 2.8207590579986572, "learning_rate": 1.74389721627409e-05, "loss": 0.127387136220932, "num_input_tokens_seen": 315366, "step": 305, "train_runtime": 862.378, "train_tokens_per_second": 365.693 }, { "epoch": 0.1307832033336895, "grad_norm": 2.3153860569000244, "learning_rate": 1.7430406852248395e-05, "loss": 0.07615187019109726, "num_input_tokens_seen": 316344, "step": 306, "train_runtime": 864.5162, "train_tokens_per_second": 365.92 }, { "epoch": 0.13121059942301527, "grad_norm": 1.8810218572616577, "learning_rate": 1.7421841541755892e-05, "loss": 0.09668294340372086, "num_input_tokens_seen": 317502, "step": 307, "train_runtime": 866.7393, "train_tokens_per_second": 366.318 }, { "epoch": 0.13163799551234107, "grad_norm": 2.1955950260162354, "learning_rate": 1.7413276231263385e-05, "loss": 0.1333192139863968, "num_input_tokens_seen": 318744, "step": 308, "train_runtime": 869.0412, "train_tokens_per_second": 366.777 }, { "epoch": 0.13206539160166683, "grad_norm": 2.143160581588745, "learning_rate": 1.740471092077088e-05, "loss": 0.09647417068481445, "num_input_tokens_seen": 319662, "step": 309, "train_runtime": 871.1791, "train_tokens_per_second": 366.93 }, { "epoch": 0.13249278769099262, "grad_norm": 2.6915321350097656, "learning_rate": 1.7396145610278376e-05, "loss": 0.18075433373451233, "num_input_tokens_seen": 320918, "step": 310, "train_runtime": 873.4328, "train_tokens_per_second": 367.422 }, { "epoch": 0.13292018378031842, "grad_norm": 2.8213682174682617, "learning_rate": 1.738758029978587e-05, "loss": 0.10546336323022842, "num_input_tokens_seen": 321682, "step": 311, "train_runtime": 876.1245, "train_tokens_per_second": 367.165 }, { "epoch": 0.13334757986964418, "grad_norm": 2.9458816051483154, "learning_rate": 1.7379014989293363e-05, "loss": 0.18216489255428314, "num_input_tokens_seen": 322496, "step": 312, "train_runtime": 878.2305, "train_tokens_per_second": 367.211 }, { "epoch": 0.13377497595896998, "grad_norm": 2.7808685302734375, "learning_rate": 1.7370449678800857e-05, "loss": 0.179776132106781, "num_input_tokens_seen": 323340, "step": 313, "train_runtime": 880.3312, "train_tokens_per_second": 367.294 }, { "epoch": 0.13420237204829577, "grad_norm": 1.5709812641143799, "learning_rate": 1.7361884368308354e-05, "loss": 0.08623568713665009, "num_input_tokens_seen": 324558, "step": 314, "train_runtime": 882.5212, "train_tokens_per_second": 367.762 }, { "epoch": 0.13462976813762154, "grad_norm": 4.398742198944092, "learning_rate": 1.7353319057815847e-05, "loss": 0.19522878527641296, "num_input_tokens_seen": 325174, "step": 315, "train_runtime": 884.5702, "train_tokens_per_second": 367.607 }, { "epoch": 0.13505716422694733, "grad_norm": 3.6003987789154053, "learning_rate": 1.734475374732334e-05, "loss": 0.10071863979101181, "num_input_tokens_seen": 326062, "step": 316, "train_runtime": 886.7388, "train_tokens_per_second": 367.709 }, { "epoch": 0.1354845603162731, "grad_norm": 2.6192052364349365, "learning_rate": 1.7336188436830838e-05, "loss": 0.159763365983963, "num_input_tokens_seen": 326946, "step": 317, "train_runtime": 888.8532, "train_tokens_per_second": 367.829 }, { "epoch": 0.1359119564055989, "grad_norm": 2.826225757598877, "learning_rate": 1.732762312633833e-05, "loss": 0.07451944053173065, "num_input_tokens_seen": 327712, "step": 318, "train_runtime": 890.9057, "train_tokens_per_second": 367.841 }, { "epoch": 0.13633935249492468, "grad_norm": 2.4688735008239746, "learning_rate": 1.7319057815845825e-05, "loss": 0.24531584978103638, "num_input_tokens_seen": 329000, "step": 319, "train_runtime": 893.2119, "train_tokens_per_second": 368.334 }, { "epoch": 0.13676674858425045, "grad_norm": 2.5273513793945312, "learning_rate": 1.731049250535332e-05, "loss": 0.11082414537668228, "num_input_tokens_seen": 329852, "step": 320, "train_runtime": 895.318, "train_tokens_per_second": 368.419 }, { "epoch": 0.13719414467357624, "grad_norm": 1.9812712669372559, "learning_rate": 1.7301927194860816e-05, "loss": 0.08259004354476929, "num_input_tokens_seen": 330872, "step": 321, "train_runtime": 897.5869, "train_tokens_per_second": 368.624 }, { "epoch": 0.137621540762902, "grad_norm": 3.8385865688323975, "learning_rate": 1.729336188436831e-05, "loss": 0.08933961391448975, "num_input_tokens_seen": 331688, "step": 322, "train_runtime": 899.7637, "train_tokens_per_second": 368.639 }, { "epoch": 0.1380489368522278, "grad_norm": 3.434079885482788, "learning_rate": 1.7284796573875803e-05, "loss": 0.22022958099842072, "num_input_tokens_seen": 333338, "step": 323, "train_runtime": 902.0942, "train_tokens_per_second": 369.516 }, { "epoch": 0.1384763329415536, "grad_norm": 3.6233861446380615, "learning_rate": 1.72762312633833e-05, "loss": 0.24009671807289124, "num_input_tokens_seen": 334224, "step": 324, "train_runtime": 904.1812, "train_tokens_per_second": 369.643 }, { "epoch": 0.13890372903087936, "grad_norm": 1.9435126781463623, "learning_rate": 1.7267665952890793e-05, "loss": 0.09001989662647247, "num_input_tokens_seen": 335028, "step": 325, "train_runtime": 906.2597, "train_tokens_per_second": 369.682 }, { "epoch": 0.13933112512020515, "grad_norm": 2.826512336730957, "learning_rate": 1.7259100642398287e-05, "loss": 0.12890757620334625, "num_input_tokens_seen": 336004, "step": 326, "train_runtime": 908.3817, "train_tokens_per_second": 369.893 }, { "epoch": 0.13975852120953094, "grad_norm": 2.837244987487793, "learning_rate": 1.7250535331905784e-05, "loss": 0.11885890364646912, "num_input_tokens_seen": 336610, "step": 327, "train_runtime": 910.4452, "train_tokens_per_second": 369.72 }, { "epoch": 0.1401859172988567, "grad_norm": 2.2175140380859375, "learning_rate": 1.7241970021413277e-05, "loss": 0.06964915990829468, "num_input_tokens_seen": 337282, "step": 328, "train_runtime": 912.5036, "train_tokens_per_second": 369.623 }, { "epoch": 0.1406133133881825, "grad_norm": 2.021813154220581, "learning_rate": 1.723340471092077e-05, "loss": 0.12436268478631973, "num_input_tokens_seen": 338422, "step": 329, "train_runtime": 914.6854, "train_tokens_per_second": 369.987 }, { "epoch": 0.14104070947750827, "grad_norm": 2.7541916370391846, "learning_rate": 1.7224839400428265e-05, "loss": 0.17609360814094543, "num_input_tokens_seen": 339422, "step": 330, "train_runtime": 916.853, "train_tokens_per_second": 370.203 }, { "epoch": 0.14146810556683406, "grad_norm": 2.394658327102661, "learning_rate": 1.721627408993576e-05, "loss": 0.11716184765100479, "num_input_tokens_seen": 340936, "step": 331, "train_runtime": 931.6924, "train_tokens_per_second": 365.932 }, { "epoch": 0.14189550165615986, "grad_norm": 2.114901304244995, "learning_rate": 1.7207708779443255e-05, "loss": 0.10051403194665909, "num_input_tokens_seen": 341784, "step": 332, "train_runtime": 933.8063, "train_tokens_per_second": 366.012 }, { "epoch": 0.14232289774548562, "grad_norm": 2.624973773956299, "learning_rate": 1.7199143468950752e-05, "loss": 0.1103091835975647, "num_input_tokens_seen": 343004, "step": 333, "train_runtime": 936.0629, "train_tokens_per_second": 366.433 }, { "epoch": 0.14275029383481141, "grad_norm": 2.721280336380005, "learning_rate": 1.7190578158458246e-05, "loss": 0.2677321135997772, "num_input_tokens_seen": 345688, "step": 334, "train_runtime": 938.8453, "train_tokens_per_second": 368.205 }, { "epoch": 0.14317768992413718, "grad_norm": 1.50456702709198, "learning_rate": 1.7182012847965743e-05, "loss": 0.058263201266527176, "num_input_tokens_seen": 347148, "step": 335, "train_runtime": 941.1161, "train_tokens_per_second": 368.868 }, { "epoch": 0.14360508601346297, "grad_norm": 3.347944736480713, "learning_rate": 1.7173447537473236e-05, "loss": 0.1528206467628479, "num_input_tokens_seen": 348164, "step": 336, "train_runtime": 943.237, "train_tokens_per_second": 369.116 }, { "epoch": 0.14403248210278877, "grad_norm": 2.0157036781311035, "learning_rate": 1.716488222698073e-05, "loss": 0.13663557171821594, "num_input_tokens_seen": 349356, "step": 337, "train_runtime": 945.4468, "train_tokens_per_second": 369.514 }, { "epoch": 0.14445987819211453, "grad_norm": 2.7032551765441895, "learning_rate": 1.7156316916488223e-05, "loss": 0.16470125317573547, "num_input_tokens_seen": 350252, "step": 338, "train_runtime": 947.648, "train_tokens_per_second": 369.601 }, { "epoch": 0.14488727428144033, "grad_norm": 3.2049143314361572, "learning_rate": 1.714775160599572e-05, "loss": 0.19470034539699554, "num_input_tokens_seen": 350854, "step": 339, "train_runtime": 949.7293, "train_tokens_per_second": 369.425 }, { "epoch": 0.14531467037076612, "grad_norm": 1.857224464416504, "learning_rate": 1.7139186295503214e-05, "loss": 0.08987314999103546, "num_input_tokens_seen": 351776, "step": 340, "train_runtime": 951.8328, "train_tokens_per_second": 369.578 }, { "epoch": 0.14574206646009188, "grad_norm": 2.442211627960205, "learning_rate": 1.7130620985010707e-05, "loss": 0.21366232633590698, "num_input_tokens_seen": 352826, "step": 341, "train_runtime": 953.9986, "train_tokens_per_second": 369.839 }, { "epoch": 0.14616946254941768, "grad_norm": 2.319977283477783, "learning_rate": 1.7122055674518204e-05, "loss": 0.15562638640403748, "num_input_tokens_seen": 353882, "step": 342, "train_runtime": 956.1857, "train_tokens_per_second": 370.098 }, { "epoch": 0.14659685863874344, "grad_norm": 2.556077718734741, "learning_rate": 1.7113490364025698e-05, "loss": 0.16621138155460358, "num_input_tokens_seen": 354970, "step": 343, "train_runtime": 958.3647, "train_tokens_per_second": 370.391 }, { "epoch": 0.14702425472806924, "grad_norm": 2.5956978797912598, "learning_rate": 1.710492505353319e-05, "loss": 0.17115283012390137, "num_input_tokens_seen": 356082, "step": 344, "train_runtime": 960.5342, "train_tokens_per_second": 370.712 }, { "epoch": 0.14745165081739503, "grad_norm": 2.843019723892212, "learning_rate": 1.709635974304069e-05, "loss": 0.12683501839637756, "num_input_tokens_seen": 357028, "step": 345, "train_runtime": 962.6755, "train_tokens_per_second": 370.871 }, { "epoch": 0.1478790469067208, "grad_norm": 2.406247138977051, "learning_rate": 1.7087794432548182e-05, "loss": 0.18846774101257324, "num_input_tokens_seen": 358174, "step": 346, "train_runtime": 964.8523, "train_tokens_per_second": 371.222 }, { "epoch": 0.1483064429960466, "grad_norm": 2.706057071685791, "learning_rate": 1.7079229122055676e-05, "loss": 0.13083621859550476, "num_input_tokens_seen": 359022, "step": 347, "train_runtime": 967.0563, "train_tokens_per_second": 371.252 }, { "epoch": 0.14873383908537238, "grad_norm": 3.15480375289917, "learning_rate": 1.707066381156317e-05, "loss": 0.15986329317092896, "num_input_tokens_seen": 359836, "step": 348, "train_runtime": 969.1381, "train_tokens_per_second": 371.295 }, { "epoch": 0.14916123517469815, "grad_norm": 2.7063496112823486, "learning_rate": 1.7062098501070666e-05, "loss": 0.15175658464431763, "num_input_tokens_seen": 360908, "step": 349, "train_runtime": 971.3259, "train_tokens_per_second": 371.562 }, { "epoch": 0.14958863126402394, "grad_norm": 1.7199162244796753, "learning_rate": 1.705353319057816e-05, "loss": 0.09106869250535965, "num_input_tokens_seen": 361784, "step": 350, "train_runtime": 973.4459, "train_tokens_per_second": 371.653 }, { "epoch": 0.1500160273533497, "grad_norm": 2.5850725173950195, "learning_rate": 1.7044967880085653e-05, "loss": 0.14896491169929504, "num_input_tokens_seen": 362754, "step": 351, "train_runtime": 975.5594, "train_tokens_per_second": 371.842 }, { "epoch": 0.1504434234426755, "grad_norm": 2.769216537475586, "learning_rate": 1.703640256959315e-05, "loss": 0.17172960937023163, "num_input_tokens_seen": 363890, "step": 352, "train_runtime": 977.7693, "train_tokens_per_second": 372.163 }, { "epoch": 0.1508708195320013, "grad_norm": 2.2079951763153076, "learning_rate": 1.7027837259100644e-05, "loss": 0.1200181245803833, "num_input_tokens_seen": 365082, "step": 353, "train_runtime": 979.9852, "train_tokens_per_second": 372.538 }, { "epoch": 0.15129821562132706, "grad_norm": 2.190399408340454, "learning_rate": 1.7019271948608138e-05, "loss": 0.15325041115283966, "num_input_tokens_seen": 365994, "step": 354, "train_runtime": 982.1446, "train_tokens_per_second": 372.648 }, { "epoch": 0.15172561171065285, "grad_norm": 2.7263314723968506, "learning_rate": 1.701070663811563e-05, "loss": 0.14416253566741943, "num_input_tokens_seen": 366826, "step": 355, "train_runtime": 984.3156, "train_tokens_per_second": 372.671 }, { "epoch": 0.15215300779997862, "grad_norm": 3.734889030456543, "learning_rate": 1.7002141327623128e-05, "loss": 0.14761826395988464, "num_input_tokens_seen": 367598, "step": 356, "train_runtime": 986.3869, "train_tokens_per_second": 372.671 }, { "epoch": 0.1525804038893044, "grad_norm": 1.6911550760269165, "learning_rate": 1.6993576017130622e-05, "loss": 0.0787629708647728, "num_input_tokens_seen": 369124, "step": 357, "train_runtime": 988.7967, "train_tokens_per_second": 373.306 }, { "epoch": 0.1530077999786302, "grad_norm": 2.4877729415893555, "learning_rate": 1.6985010706638115e-05, "loss": 0.13544218242168427, "num_input_tokens_seen": 369900, "step": 358, "train_runtime": 990.8914, "train_tokens_per_second": 373.3 }, { "epoch": 0.15343519606795597, "grad_norm": 2.23376202583313, "learning_rate": 1.6976445396145612e-05, "loss": 0.09670616686344147, "num_input_tokens_seen": 371024, "step": 359, "train_runtime": 993.0666, "train_tokens_per_second": 373.614 }, { "epoch": 0.15386259215728176, "grad_norm": 3.240729808807373, "learning_rate": 1.6967880085653106e-05, "loss": 0.084111288189888, "num_input_tokens_seen": 372068, "step": 360, "train_runtime": 995.2213, "train_tokens_per_second": 373.855 }, { "epoch": 0.15428998824660756, "grad_norm": 2.244142532348633, "learning_rate": 1.69593147751606e-05, "loss": 0.10998359322547913, "num_input_tokens_seen": 372806, "step": 361, "train_runtime": 1011.2556, "train_tokens_per_second": 368.657 }, { "epoch": 0.15471738433593332, "grad_norm": 2.3793675899505615, "learning_rate": 1.6950749464668096e-05, "loss": 0.13240720331668854, "num_input_tokens_seen": 373880, "step": 362, "train_runtime": 1013.4298, "train_tokens_per_second": 368.925 }, { "epoch": 0.15514478042525912, "grad_norm": 2.0753800868988037, "learning_rate": 1.694218415417559e-05, "loss": 0.15693649649620056, "num_input_tokens_seen": 375686, "step": 363, "train_runtime": 1015.8122, "train_tokens_per_second": 369.838 }, { "epoch": 0.15557217651458488, "grad_norm": 1.6880438327789307, "learning_rate": 1.6933618843683084e-05, "loss": 0.10661282390356064, "num_input_tokens_seen": 377046, "step": 364, "train_runtime": 1018.0518, "train_tokens_per_second": 370.36 }, { "epoch": 0.15599957260391067, "grad_norm": 3.315276622772217, "learning_rate": 1.6925053533190577e-05, "loss": 0.24908918142318726, "num_input_tokens_seen": 377830, "step": 365, "train_runtime": 1020.2044, "train_tokens_per_second": 370.347 }, { "epoch": 0.15642696869323647, "grad_norm": 2.3675825595855713, "learning_rate": 1.6916488222698074e-05, "loss": 0.1515953689813614, "num_input_tokens_seen": 379008, "step": 366, "train_runtime": 1022.4297, "train_tokens_per_second": 370.693 }, { "epoch": 0.15685436478256223, "grad_norm": 2.8744585514068604, "learning_rate": 1.690792291220557e-05, "loss": 0.22178775072097778, "num_input_tokens_seen": 379960, "step": 367, "train_runtime": 1024.5824, "train_tokens_per_second": 370.844 }, { "epoch": 0.15728176087188803, "grad_norm": 2.148393154144287, "learning_rate": 1.6899357601713065e-05, "loss": 0.14279040694236755, "num_input_tokens_seen": 381224, "step": 368, "train_runtime": 1026.8449, "train_tokens_per_second": 371.258 }, { "epoch": 0.1577091569612138, "grad_norm": 1.769447684288025, "learning_rate": 1.6890792291220558e-05, "loss": 0.07874423265457153, "num_input_tokens_seen": 381954, "step": 369, "train_runtime": 1028.9727, "train_tokens_per_second": 371.199 }, { "epoch": 0.15813655305053959, "grad_norm": 2.392979860305786, "learning_rate": 1.6882226980728055e-05, "loss": 0.1373487412929535, "num_input_tokens_seen": 382930, "step": 370, "train_runtime": 1031.1022, "train_tokens_per_second": 371.379 }, { "epoch": 0.15856394913986538, "grad_norm": 2.0406606197357178, "learning_rate": 1.687366167023555e-05, "loss": 0.162137970328331, "num_input_tokens_seen": 384038, "step": 371, "train_runtime": 1033.2944, "train_tokens_per_second": 371.664 }, { "epoch": 0.15899134522919114, "grad_norm": 2.6472795009613037, "learning_rate": 1.6865096359743042e-05, "loss": 0.22002795338630676, "num_input_tokens_seen": 385318, "step": 372, "train_runtime": 1035.521, "train_tokens_per_second": 372.101 }, { "epoch": 0.15941874131851694, "grad_norm": 1.875220775604248, "learning_rate": 1.6856531049250536e-05, "loss": 0.11501770466566086, "num_input_tokens_seen": 386132, "step": 373, "train_runtime": 1037.6507, "train_tokens_per_second": 372.121 }, { "epoch": 0.15984613740784273, "grad_norm": 2.673085927963257, "learning_rate": 1.6847965738758033e-05, "loss": 0.11223889887332916, "num_input_tokens_seen": 386856, "step": 374, "train_runtime": 1039.7603, "train_tokens_per_second": 372.063 }, { "epoch": 0.1602735334971685, "grad_norm": 2.6425139904022217, "learning_rate": 1.6839400428265527e-05, "loss": 0.14778855443000793, "num_input_tokens_seen": 388868, "step": 375, "train_runtime": 1042.171, "train_tokens_per_second": 373.133 }, { "epoch": 0.1607009295864943, "grad_norm": 2.099555730819702, "learning_rate": 1.683083511777302e-05, "loss": 0.11406856775283813, "num_input_tokens_seen": 389734, "step": 376, "train_runtime": 1044.2989, "train_tokens_per_second": 373.202 }, { "epoch": 0.16112832567582006, "grad_norm": 1.9326131343841553, "learning_rate": 1.6822269807280517e-05, "loss": 0.1232220008969307, "num_input_tokens_seen": 391344, "step": 377, "train_runtime": 1046.5823, "train_tokens_per_second": 373.926 }, { "epoch": 0.16155572176514585, "grad_norm": 3.4754836559295654, "learning_rate": 1.681370449678801e-05, "loss": 0.11852972209453583, "num_input_tokens_seen": 392618, "step": 378, "train_runtime": 1048.8269, "train_tokens_per_second": 374.34 }, { "epoch": 0.16198311785447164, "grad_norm": 2.1071417331695557, "learning_rate": 1.6805139186295504e-05, "loss": 0.11256693303585052, "num_input_tokens_seen": 393650, "step": 379, "train_runtime": 1050.9793, "train_tokens_per_second": 374.555 }, { "epoch": 0.1624105139437974, "grad_norm": 2.711966037750244, "learning_rate": 1.6796573875802998e-05, "loss": 0.15541034936904907, "num_input_tokens_seen": 394766, "step": 380, "train_runtime": 1053.1638, "train_tokens_per_second": 374.838 }, { "epoch": 0.1628379100331232, "grad_norm": 3.433267831802368, "learning_rate": 1.6788008565310495e-05, "loss": 0.14420881867408752, "num_input_tokens_seen": 396408, "step": 381, "train_runtime": 1055.4668, "train_tokens_per_second": 375.576 }, { "epoch": 0.16326530612244897, "grad_norm": 3.8691890239715576, "learning_rate": 1.677944325481799e-05, "loss": 0.2489038109779358, "num_input_tokens_seen": 397408, "step": 382, "train_runtime": 1057.6301, "train_tokens_per_second": 375.753 }, { "epoch": 0.16369270221177476, "grad_norm": 1.9748858213424683, "learning_rate": 1.6770877944325482e-05, "loss": 0.15205879509449005, "num_input_tokens_seen": 398320, "step": 383, "train_runtime": 1059.767, "train_tokens_per_second": 375.856 }, { "epoch": 0.16412009830110055, "grad_norm": 2.9696810245513916, "learning_rate": 1.676231263383298e-05, "loss": 0.20505930483341217, "num_input_tokens_seen": 399114, "step": 384, "train_runtime": 1061.8344, "train_tokens_per_second": 375.872 }, { "epoch": 0.16454749439042632, "grad_norm": 2.7213387489318848, "learning_rate": 1.6753747323340473e-05, "loss": 0.17969396710395813, "num_input_tokens_seen": 400164, "step": 385, "train_runtime": 1063.9978, "train_tokens_per_second": 376.095 }, { "epoch": 0.1649748904797521, "grad_norm": 2.311955213546753, "learning_rate": 1.6745182012847966e-05, "loss": 0.10836541652679443, "num_input_tokens_seen": 401158, "step": 386, "train_runtime": 1066.1859, "train_tokens_per_second": 376.255 }, { "epoch": 0.1654022865690779, "grad_norm": 2.4982223510742188, "learning_rate": 1.6736616702355463e-05, "loss": 0.15085460245609283, "num_input_tokens_seen": 402288, "step": 387, "train_runtime": 1068.5118, "train_tokens_per_second": 376.494 }, { "epoch": 0.16582968265840367, "grad_norm": 2.6735992431640625, "learning_rate": 1.6728051391862957e-05, "loss": 0.18587106466293335, "num_input_tokens_seen": 403888, "step": 388, "train_runtime": 1070.8446, "train_tokens_per_second": 377.168 }, { "epoch": 0.16625707874772946, "grad_norm": 2.192577838897705, "learning_rate": 1.671948608137045e-05, "loss": 0.09636976569890976, "num_input_tokens_seen": 404850, "step": 389, "train_runtime": 1072.9908, "train_tokens_per_second": 377.31 }, { "epoch": 0.16668447483705523, "grad_norm": 2.3680543899536133, "learning_rate": 1.6710920770877944e-05, "loss": 0.13074041903018951, "num_input_tokens_seen": 405874, "step": 390, "train_runtime": 1075.2256, "train_tokens_per_second": 377.478 }, { "epoch": 0.16711187092638102, "grad_norm": 1.714113712310791, "learning_rate": 1.670235546038544e-05, "loss": 0.11863395571708679, "num_input_tokens_seen": 407232, "step": 391, "train_runtime": 1090.7623, "train_tokens_per_second": 373.346 }, { "epoch": 0.16753926701570682, "grad_norm": 2.9740312099456787, "learning_rate": 1.6693790149892934e-05, "loss": 0.20251265168190002, "num_input_tokens_seen": 408164, "step": 392, "train_runtime": 1092.9454, "train_tokens_per_second": 373.453 }, { "epoch": 0.16796666310503258, "grad_norm": 2.2991349697113037, "learning_rate": 1.6685224839400428e-05, "loss": 0.13541968166828156, "num_input_tokens_seen": 409462, "step": 393, "train_runtime": 1095.17, "train_tokens_per_second": 373.88 }, { "epoch": 0.16839405919435838, "grad_norm": 2.483513355255127, "learning_rate": 1.6676659528907925e-05, "loss": 0.11528028547763824, "num_input_tokens_seen": 410536, "step": 394, "train_runtime": 1097.3303, "train_tokens_per_second": 374.123 }, { "epoch": 0.16882145528368414, "grad_norm": 1.8675282001495361, "learning_rate": 1.666809421841542e-05, "loss": 0.06981010735034943, "num_input_tokens_seen": 411574, "step": 395, "train_runtime": 1099.4897, "train_tokens_per_second": 374.332 }, { "epoch": 0.16924885137300993, "grad_norm": 2.5383174419403076, "learning_rate": 1.6659528907922912e-05, "loss": 0.10572994500398636, "num_input_tokens_seen": 412522, "step": 396, "train_runtime": 1101.7629, "train_tokens_per_second": 374.42 }, { "epoch": 0.16967624746233573, "grad_norm": 2.21169376373291, "learning_rate": 1.6650963597430406e-05, "loss": 0.09584016352891922, "num_input_tokens_seen": 413270, "step": 397, "train_runtime": 1103.8672, "train_tokens_per_second": 374.384 }, { "epoch": 0.1701036435516615, "grad_norm": 2.2353615760803223, "learning_rate": 1.6642398286937903e-05, "loss": 0.14034780859947205, "num_input_tokens_seen": 414482, "step": 398, "train_runtime": 1106.066, "train_tokens_per_second": 374.735 }, { "epoch": 0.1705310396409873, "grad_norm": 2.762854814529419, "learning_rate": 1.6633832976445396e-05, "loss": 0.1473519206047058, "num_input_tokens_seen": 415424, "step": 399, "train_runtime": 1108.2143, "train_tokens_per_second": 374.859 }, { "epoch": 0.17095843573031308, "grad_norm": 2.3145453929901123, "learning_rate": 1.662526766595289e-05, "loss": 0.11077391356229782, "num_input_tokens_seen": 416154, "step": 400, "train_runtime": 1110.3093, "train_tokens_per_second": 374.809 }, { "epoch": 0.17138583181963885, "grad_norm": 2.5825376510620117, "learning_rate": 1.6616702355460387e-05, "loss": 0.17286396026611328, "num_input_tokens_seen": 417020, "step": 401, "train_runtime": 1112.4459, "train_tokens_per_second": 374.868 }, { "epoch": 0.17181322790896464, "grad_norm": 2.331242084503174, "learning_rate": 1.6608137044967884e-05, "loss": 0.12545637786388397, "num_input_tokens_seen": 418036, "step": 402, "train_runtime": 1114.6698, "train_tokens_per_second": 375.031 }, { "epoch": 0.1722406239982904, "grad_norm": 1.844581961631775, "learning_rate": 1.6599571734475377e-05, "loss": 0.10602794587612152, "num_input_tokens_seen": 419384, "step": 403, "train_runtime": 1116.8927, "train_tokens_per_second": 375.492 }, { "epoch": 0.1726680200876162, "grad_norm": 2.4596877098083496, "learning_rate": 1.659100642398287e-05, "loss": 0.17446285486221313, "num_input_tokens_seen": 420338, "step": 404, "train_runtime": 1119.0522, "train_tokens_per_second": 375.62 }, { "epoch": 0.173095416176942, "grad_norm": 2.457268238067627, "learning_rate": 1.6582441113490368e-05, "loss": 0.15112313628196716, "num_input_tokens_seen": 421290, "step": 405, "train_runtime": 1121.2044, "train_tokens_per_second": 375.748 }, { "epoch": 0.17352281226626776, "grad_norm": 2.921137809753418, "learning_rate": 1.657387580299786e-05, "loss": 0.18644827604293823, "num_input_tokens_seen": 422422, "step": 406, "train_runtime": 1123.5813, "train_tokens_per_second": 375.96 }, { "epoch": 0.17395020835559355, "grad_norm": 1.8381412029266357, "learning_rate": 1.6565310492505355e-05, "loss": 0.12325820326805115, "num_input_tokens_seen": 423902, "step": 407, "train_runtime": 1125.9323, "train_tokens_per_second": 376.49 }, { "epoch": 0.17437760444491932, "grad_norm": 2.721726655960083, "learning_rate": 1.655674518201285e-05, "loss": 0.141355961561203, "num_input_tokens_seen": 425214, "step": 408, "train_runtime": 1128.2028, "train_tokens_per_second": 376.895 }, { "epoch": 0.1748050005342451, "grad_norm": 1.8676183223724365, "learning_rate": 1.6548179871520346e-05, "loss": 0.07100579142570496, "num_input_tokens_seen": 426314, "step": 409, "train_runtime": 1130.3418, "train_tokens_per_second": 377.155 }, { "epoch": 0.1752323966235709, "grad_norm": 1.9449844360351562, "learning_rate": 1.653961456102784e-05, "loss": 0.13015475869178772, "num_input_tokens_seen": 427306, "step": 410, "train_runtime": 1132.4993, "train_tokens_per_second": 377.312 }, { "epoch": 0.17565979271289667, "grad_norm": 2.214311122894287, "learning_rate": 1.6531049250535333e-05, "loss": 0.11398934572935104, "num_input_tokens_seen": 428258, "step": 411, "train_runtime": 1134.6982, "train_tokens_per_second": 377.42 }, { "epoch": 0.17608718880222246, "grad_norm": 2.17134428024292, "learning_rate": 1.652248394004283e-05, "loss": 0.1376045197248459, "num_input_tokens_seen": 429488, "step": 412, "train_runtime": 1136.9354, "train_tokens_per_second": 377.759 }, { "epoch": 0.17651458489154825, "grad_norm": 2.7899832725524902, "learning_rate": 1.6513918629550323e-05, "loss": 0.19155895709991455, "num_input_tokens_seen": 430388, "step": 413, "train_runtime": 1139.0743, "train_tokens_per_second": 377.84 }, { "epoch": 0.17694198098087402, "grad_norm": 3.103749990463257, "learning_rate": 1.6505353319057817e-05, "loss": 0.2512103319168091, "num_input_tokens_seen": 431344, "step": 414, "train_runtime": 1141.2825, "train_tokens_per_second": 377.947 }, { "epoch": 0.1773693770701998, "grad_norm": 1.9968218803405762, "learning_rate": 1.649678800856531e-05, "loss": 0.1737058460712433, "num_input_tokens_seen": 432614, "step": 415, "train_runtime": 1143.4976, "train_tokens_per_second": 378.325 }, { "epoch": 0.17779677315952558, "grad_norm": 2.296706199645996, "learning_rate": 1.6488222698072807e-05, "loss": 0.1076778918504715, "num_input_tokens_seen": 433394, "step": 416, "train_runtime": 1145.6208, "train_tokens_per_second": 378.305 }, { "epoch": 0.17822416924885137, "grad_norm": 2.9021735191345215, "learning_rate": 1.64796573875803e-05, "loss": 0.19774946570396423, "num_input_tokens_seen": 434194, "step": 417, "train_runtime": 1147.8553, "train_tokens_per_second": 378.265 }, { "epoch": 0.17865156533817717, "grad_norm": 2.333594560623169, "learning_rate": 1.6471092077087795e-05, "loss": 0.17066164314746857, "num_input_tokens_seen": 435574, "step": 418, "train_runtime": 1150.0604, "train_tokens_per_second": 378.74 }, { "epoch": 0.17907896142750293, "grad_norm": 1.9304267168045044, "learning_rate": 1.646252676659529e-05, "loss": 0.09474833309650421, "num_input_tokens_seen": 436530, "step": 419, "train_runtime": 1152.1721, "train_tokens_per_second": 378.876 }, { "epoch": 0.17950635751682872, "grad_norm": 2.0851480960845947, "learning_rate": 1.6453961456102785e-05, "loss": 0.13132205605506897, "num_input_tokens_seen": 437646, "step": 420, "train_runtime": 1154.3789, "train_tokens_per_second": 379.118 }, { "epoch": 0.17993375360615452, "grad_norm": 1.7399849891662598, "learning_rate": 1.644539614561028e-05, "loss": 0.10575830191373825, "num_input_tokens_seen": 439542, "step": 421, "train_runtime": 1170.4494, "train_tokens_per_second": 375.533 }, { "epoch": 0.18036114969548028, "grad_norm": 2.2150840759277344, "learning_rate": 1.6436830835117776e-05, "loss": 0.10072614252567291, "num_input_tokens_seen": 440376, "step": 422, "train_runtime": 1172.6009, "train_tokens_per_second": 375.555 }, { "epoch": 0.18078854578480608, "grad_norm": 2.1866869926452637, "learning_rate": 1.642826552462527e-05, "loss": 0.1437472552061081, "num_input_tokens_seen": 441150, "step": 423, "train_runtime": 1174.6755, "train_tokens_per_second": 375.551 }, { "epoch": 0.18121594187413184, "grad_norm": 2.4555861949920654, "learning_rate": 1.6419700214132763e-05, "loss": 0.11350082606077194, "num_input_tokens_seen": 441932, "step": 424, "train_runtime": 1176.7756, "train_tokens_per_second": 375.545 }, { "epoch": 0.18164333796345764, "grad_norm": 1.7611117362976074, "learning_rate": 1.6411134903640256e-05, "loss": 0.08462654054164886, "num_input_tokens_seen": 442800, "step": 425, "train_runtime": 1178.9141, "train_tokens_per_second": 375.6 }, { "epoch": 0.18207073405278343, "grad_norm": 3.2058231830596924, "learning_rate": 1.6402569593147753e-05, "loss": 0.19276383519172668, "num_input_tokens_seen": 443690, "step": 426, "train_runtime": 1181.052, "train_tokens_per_second": 375.674 }, { "epoch": 0.1824981301421092, "grad_norm": 3.497465133666992, "learning_rate": 1.6394004282655247e-05, "loss": 0.16812632977962494, "num_input_tokens_seen": 445006, "step": 427, "train_runtime": 1183.296, "train_tokens_per_second": 376.073 }, { "epoch": 0.182925526231435, "grad_norm": 3.4818010330200195, "learning_rate": 1.638543897216274e-05, "loss": 0.22986409068107605, "num_input_tokens_seen": 445768, "step": 428, "train_runtime": 1185.3978, "train_tokens_per_second": 376.049 }, { "epoch": 0.18335292232076075, "grad_norm": 2.2981884479522705, "learning_rate": 1.6376873661670238e-05, "loss": 0.20823177695274353, "num_input_tokens_seen": 446872, "step": 429, "train_runtime": 1187.6032, "train_tokens_per_second": 376.281 }, { "epoch": 0.18378031841008655, "grad_norm": 2.7404096126556396, "learning_rate": 1.636830835117773e-05, "loss": 0.1857355833053589, "num_input_tokens_seen": 448346, "step": 430, "train_runtime": 1189.9017, "train_tokens_per_second": 376.792 }, { "epoch": 0.18420771449941234, "grad_norm": 3.5768654346466064, "learning_rate": 1.6359743040685225e-05, "loss": 0.2002859115600586, "num_input_tokens_seen": 449010, "step": 431, "train_runtime": 1191.9593, "train_tokens_per_second": 376.699 }, { "epoch": 0.1846351105887381, "grad_norm": 2.8632609844207764, "learning_rate": 1.635117773019272e-05, "loss": 0.13714022934436798, "num_input_tokens_seen": 449648, "step": 432, "train_runtime": 1194.0469, "train_tokens_per_second": 376.575 }, { "epoch": 0.1850625066780639, "grad_norm": 2.0654280185699463, "learning_rate": 1.6342612419700215e-05, "loss": 0.14014026522636414, "num_input_tokens_seen": 450730, "step": 433, "train_runtime": 1196.2296, "train_tokens_per_second": 376.792 }, { "epoch": 0.1854899027673897, "grad_norm": 2.564251661300659, "learning_rate": 1.633404710920771e-05, "loss": 0.14233601093292236, "num_input_tokens_seen": 451750, "step": 434, "train_runtime": 1198.3737, "train_tokens_per_second": 376.969 }, { "epoch": 0.18591729885671546, "grad_norm": 2.1986083984375, "learning_rate": 1.6325481798715202e-05, "loss": 0.1209622323513031, "num_input_tokens_seen": 452766, "step": 435, "train_runtime": 1200.5229, "train_tokens_per_second": 377.141 }, { "epoch": 0.18634469494604125, "grad_norm": 2.6068625450134277, "learning_rate": 1.63169164882227e-05, "loss": 0.09353704750537872, "num_input_tokens_seen": 453596, "step": 436, "train_runtime": 1202.6806, "train_tokens_per_second": 377.154 }, { "epoch": 0.18677209103536702, "grad_norm": 2.098538637161255, "learning_rate": 1.6308351177730196e-05, "loss": 0.17097875475883484, "num_input_tokens_seen": 454666, "step": 437, "train_runtime": 1204.8642, "train_tokens_per_second": 377.359 }, { "epoch": 0.1871994871246928, "grad_norm": 2.5986549854278564, "learning_rate": 1.629978586723769e-05, "loss": 0.1429862678050995, "num_input_tokens_seen": 455646, "step": 438, "train_runtime": 1207.0235, "train_tokens_per_second": 377.496 }, { "epoch": 0.1876268832140186, "grad_norm": 1.8210711479187012, "learning_rate": 1.6291220556745184e-05, "loss": 0.12008396536111832, "num_input_tokens_seen": 457336, "step": 439, "train_runtime": 1209.3288, "train_tokens_per_second": 378.173 }, { "epoch": 0.18805427930334437, "grad_norm": 2.347365617752075, "learning_rate": 1.6282655246252677e-05, "loss": 0.15392476320266724, "num_input_tokens_seen": 458736, "step": 440, "train_runtime": 1211.5722, "train_tokens_per_second": 378.629 }, { "epoch": 0.18848167539267016, "grad_norm": 2.3482296466827393, "learning_rate": 1.6274089935760174e-05, "loss": 0.11621996760368347, "num_input_tokens_seen": 459680, "step": 441, "train_runtime": 1213.7147, "train_tokens_per_second": 378.738 }, { "epoch": 0.18890907148199593, "grad_norm": 1.9932045936584473, "learning_rate": 1.6265524625267668e-05, "loss": 0.12326683104038239, "num_input_tokens_seen": 460690, "step": 442, "train_runtime": 1215.8646, "train_tokens_per_second": 378.899 }, { "epoch": 0.18933646757132172, "grad_norm": 1.4386119842529297, "learning_rate": 1.625695931477516e-05, "loss": 0.044399235397577286, "num_input_tokens_seen": 461756, "step": 443, "train_runtime": 1218.0943, "train_tokens_per_second": 379.081 }, { "epoch": 0.1897638636606475, "grad_norm": 1.9361941814422607, "learning_rate": 1.6248394004282658e-05, "loss": 0.09412224590778351, "num_input_tokens_seen": 462770, "step": 444, "train_runtime": 1220.3056, "train_tokens_per_second": 379.225 }, { "epoch": 0.19019125974997328, "grad_norm": 1.645391583442688, "learning_rate": 1.6239828693790152e-05, "loss": 0.07834768295288086, "num_input_tokens_seen": 463976, "step": 445, "train_runtime": 1222.6044, "train_tokens_per_second": 379.498 }, { "epoch": 0.19061865583929907, "grad_norm": 2.215719223022461, "learning_rate": 1.6231263383297645e-05, "loss": 0.1422099769115448, "num_input_tokens_seen": 464878, "step": 446, "train_runtime": 1224.7669, "train_tokens_per_second": 379.564 }, { "epoch": 0.19104605192862487, "grad_norm": 2.6253433227539062, "learning_rate": 1.6222698072805142e-05, "loss": 0.15090899169445038, "num_input_tokens_seen": 465974, "step": 447, "train_runtime": 1226.9853, "train_tokens_per_second": 379.771 }, { "epoch": 0.19147344801795063, "grad_norm": 2.275822639465332, "learning_rate": 1.6214132762312636e-05, "loss": 0.1707189381122589, "num_input_tokens_seen": 467186, "step": 448, "train_runtime": 1229.2106, "train_tokens_per_second": 380.07 }, { "epoch": 0.19190084410727642, "grad_norm": 2.0672998428344727, "learning_rate": 1.620556745182013e-05, "loss": 0.12443550676107407, "num_input_tokens_seen": 468308, "step": 449, "train_runtime": 1231.403, "train_tokens_per_second": 380.304 }, { "epoch": 0.1923282401966022, "grad_norm": 1.959238886833191, "learning_rate": 1.6197002141327623e-05, "loss": 0.11623205244541168, "num_input_tokens_seen": 469070, "step": 450, "train_runtime": 1233.4988, "train_tokens_per_second": 380.276 }, { "epoch": 0.19275563628592798, "grad_norm": 3.1793341636657715, "learning_rate": 1.618843683083512e-05, "loss": 0.16129718720912933, "num_input_tokens_seen": 469884, "step": 451, "train_runtime": 1248.8858, "train_tokens_per_second": 376.243 }, { "epoch": 0.19318303237525378, "grad_norm": 2.8345463275909424, "learning_rate": 1.6179871520342614e-05, "loss": 0.10066317766904831, "num_input_tokens_seen": 470606, "step": 452, "train_runtime": 1250.9653, "train_tokens_per_second": 376.194 }, { "epoch": 0.19361042846457954, "grad_norm": 2.61457896232605, "learning_rate": 1.6171306209850107e-05, "loss": 0.1653885543346405, "num_input_tokens_seen": 471720, "step": 453, "train_runtime": 1253.1161, "train_tokens_per_second": 376.438 }, { "epoch": 0.19403782455390534, "grad_norm": 2.6919150352478027, "learning_rate": 1.6162740899357604e-05, "loss": 0.14260752499103546, "num_input_tokens_seen": 472782, "step": 454, "train_runtime": 1255.3006, "train_tokens_per_second": 376.629 }, { "epoch": 0.1944652206432311, "grad_norm": 3.671886920928955, "learning_rate": 1.6154175588865098e-05, "loss": 0.18697695434093475, "num_input_tokens_seen": 473422, "step": 455, "train_runtime": 1257.3285, "train_tokens_per_second": 376.53 }, { "epoch": 0.1948926167325569, "grad_norm": 2.6549768447875977, "learning_rate": 1.614561027837259e-05, "loss": 0.15143200755119324, "num_input_tokens_seen": 474068, "step": 456, "train_runtime": 1259.3935, "train_tokens_per_second": 376.426 }, { "epoch": 0.1953200128218827, "grad_norm": 2.3907783031463623, "learning_rate": 1.6137044967880085e-05, "loss": 0.0999782383441925, "num_input_tokens_seen": 475158, "step": 457, "train_runtime": 1261.5771, "train_tokens_per_second": 376.638 }, { "epoch": 0.19574740891120845, "grad_norm": 2.603909730911255, "learning_rate": 1.6128479657387582e-05, "loss": 0.16652268171310425, "num_input_tokens_seen": 476750, "step": 458, "train_runtime": 1263.864, "train_tokens_per_second": 377.216 }, { "epoch": 0.19617480500053425, "grad_norm": 2.89782452583313, "learning_rate": 1.6119914346895076e-05, "loss": 0.1588645577430725, "num_input_tokens_seen": 477686, "step": 459, "train_runtime": 1265.9908, "train_tokens_per_second": 377.322 }, { "epoch": 0.19660220108986004, "grad_norm": 3.2478628158569336, "learning_rate": 1.611134903640257e-05, "loss": 0.13660337030887604, "num_input_tokens_seen": 478550, "step": 460, "train_runtime": 1268.0816, "train_tokens_per_second": 377.381 }, { "epoch": 0.1970295971791858, "grad_norm": 2.897303819656372, "learning_rate": 1.6102783725910066e-05, "loss": 0.2215740978717804, "num_input_tokens_seen": 479448, "step": 461, "train_runtime": 1270.2083, "train_tokens_per_second": 377.456 }, { "epoch": 0.1974569932685116, "grad_norm": 2.5118114948272705, "learning_rate": 1.609421841541756e-05, "loss": 0.12003548443317413, "num_input_tokens_seen": 480304, "step": 462, "train_runtime": 1272.4419, "train_tokens_per_second": 377.466 }, { "epoch": 0.19788438935783736, "grad_norm": 1.744229793548584, "learning_rate": 1.6085653104925053e-05, "loss": 0.1065872311592102, "num_input_tokens_seen": 481772, "step": 463, "train_runtime": 1274.7272, "train_tokens_per_second": 377.941 }, { "epoch": 0.19831178544716316, "grad_norm": 3.23005747795105, "learning_rate": 1.607708779443255e-05, "loss": 0.12318828701972961, "num_input_tokens_seen": 482828, "step": 464, "train_runtime": 1276.9316, "train_tokens_per_second": 378.116 }, { "epoch": 0.19873918153648895, "grad_norm": 2.553464651107788, "learning_rate": 1.6068522483940044e-05, "loss": 0.10046009719371796, "num_input_tokens_seen": 483550, "step": 465, "train_runtime": 1278.9852, "train_tokens_per_second": 378.073 }, { "epoch": 0.19916657762581472, "grad_norm": 2.9752719402313232, "learning_rate": 1.6059957173447537e-05, "loss": 0.16212669014930725, "num_input_tokens_seen": 484462, "step": 466, "train_runtime": 1281.1392, "train_tokens_per_second": 378.149 }, { "epoch": 0.1995939737151405, "grad_norm": 2.731992483139038, "learning_rate": 1.605139186295503e-05, "loss": 0.15849679708480835, "num_input_tokens_seen": 485672, "step": 467, "train_runtime": 1283.3548, "train_tokens_per_second": 378.439 }, { "epoch": 0.20002136980446628, "grad_norm": 1.613195538520813, "learning_rate": 1.6042826552462528e-05, "loss": 0.09022671729326248, "num_input_tokens_seen": 486932, "step": 468, "train_runtime": 1285.5648, "train_tokens_per_second": 378.769 }, { "epoch": 0.20002136980446628, "eval_loss": 0.5228654742240906, "eval_runtime": 58.1699, "eval_samples_per_second": 17.157, "eval_steps_per_second": 8.578, "num_input_tokens_seen": 486932, "step": 468 }, { "epoch": 0.20044876589379207, "grad_norm": 2.7253291606903076, "learning_rate": 1.603426124197002e-05, "loss": 0.23014238476753235, "num_input_tokens_seen": 487912, "step": 469, "train_runtime": 1345.8997, "train_tokens_per_second": 362.517 }, { "epoch": 0.20087616198311786, "grad_norm": 2.572406530380249, "learning_rate": 1.602569593147752e-05, "loss": 0.11572389304637909, "num_input_tokens_seen": 488624, "step": 470, "train_runtime": 1347.958, "train_tokens_per_second": 362.492 }, { "epoch": 0.20130355807244363, "grad_norm": 2.066358804702759, "learning_rate": 1.6017130620985012e-05, "loss": 0.12841399013996124, "num_input_tokens_seen": 489490, "step": 471, "train_runtime": 1350.133, "train_tokens_per_second": 362.549 }, { "epoch": 0.20173095416176942, "grad_norm": 2.618079423904419, "learning_rate": 1.600856531049251e-05, "loss": 0.17785006761550903, "num_input_tokens_seen": 490284, "step": 472, "train_runtime": 1352.1913, "train_tokens_per_second": 362.585 }, { "epoch": 0.20215835025109521, "grad_norm": 2.171987771987915, "learning_rate": 1.6000000000000003e-05, "loss": 0.11661925911903381, "num_input_tokens_seen": 491452, "step": 473, "train_runtime": 1354.4431, "train_tokens_per_second": 362.844 }, { "epoch": 0.20258574634042098, "grad_norm": 2.0648534297943115, "learning_rate": 1.5991434689507496e-05, "loss": 0.1089189425110817, "num_input_tokens_seen": 492384, "step": 474, "train_runtime": 1356.5623, "train_tokens_per_second": 362.965 }, { "epoch": 0.20301314242974677, "grad_norm": 1.4901224374771118, "learning_rate": 1.598286937901499e-05, "loss": 0.10635621845722198, "num_input_tokens_seen": 493588, "step": 475, "train_runtime": 1358.7887, "train_tokens_per_second": 363.256 }, { "epoch": 0.20344053851907254, "grad_norm": 1.9994614124298096, "learning_rate": 1.5974304068522487e-05, "loss": 0.13134728372097015, "num_input_tokens_seen": 495088, "step": 476, "train_runtime": 1361.0765, "train_tokens_per_second": 363.747 }, { "epoch": 0.20386793460839833, "grad_norm": 2.1291215419769287, "learning_rate": 1.596573875802998e-05, "loss": 0.16656774282455444, "num_input_tokens_seen": 496728, "step": 477, "train_runtime": 1363.4104, "train_tokens_per_second": 364.328 }, { "epoch": 0.20429533069772413, "grad_norm": 1.7206581830978394, "learning_rate": 1.5957173447537474e-05, "loss": 0.09397691488265991, "num_input_tokens_seen": 497664, "step": 478, "train_runtime": 1365.554, "train_tokens_per_second": 364.441 }, { "epoch": 0.2047227267870499, "grad_norm": 2.3613126277923584, "learning_rate": 1.594860813704497e-05, "loss": 0.12450061738491058, "num_input_tokens_seen": 498506, "step": 479, "train_runtime": 1367.6946, "train_tokens_per_second": 364.486 }, { "epoch": 0.20515012287637568, "grad_norm": 1.9107856750488281, "learning_rate": 1.5940042826552465e-05, "loss": 0.0831819698214531, "num_input_tokens_seen": 499478, "step": 480, "train_runtime": 1369.8658, "train_tokens_per_second": 364.618 }, { "epoch": 0.20557751896570145, "grad_norm": 2.1192493438720703, "learning_rate": 1.5931477516059958e-05, "loss": 0.12226656824350357, "num_input_tokens_seen": 500350, "step": 481, "train_runtime": 1385.3664, "train_tokens_per_second": 361.168 }, { "epoch": 0.20600491505502724, "grad_norm": 2.522186279296875, "learning_rate": 1.5922912205567455e-05, "loss": 0.16046814620494843, "num_input_tokens_seen": 501142, "step": 482, "train_runtime": 1387.5782, "train_tokens_per_second": 361.163 }, { "epoch": 0.20643231114435304, "grad_norm": 2.28838849067688, "learning_rate": 1.591434689507495e-05, "loss": 0.1571349799633026, "num_input_tokens_seen": 502198, "step": 483, "train_runtime": 1389.7598, "train_tokens_per_second": 361.356 }, { "epoch": 0.2068597072336788, "grad_norm": 2.136685609817505, "learning_rate": 1.5905781584582442e-05, "loss": 0.131611168384552, "num_input_tokens_seen": 503676, "step": 484, "train_runtime": 1391.9991, "train_tokens_per_second": 361.836 }, { "epoch": 0.2072871033230046, "grad_norm": 2.999263048171997, "learning_rate": 1.5897216274089936e-05, "loss": 0.2090913951396942, "num_input_tokens_seen": 504508, "step": 485, "train_runtime": 1394.0665, "train_tokens_per_second": 361.897 }, { "epoch": 0.2077144994123304, "grad_norm": 1.8556879758834839, "learning_rate": 1.5888650963597433e-05, "loss": 0.10524851083755493, "num_input_tokens_seen": 505448, "step": 486, "train_runtime": 1396.1995, "train_tokens_per_second": 362.017 }, { "epoch": 0.20814189550165615, "grad_norm": 3.578195095062256, "learning_rate": 1.5880085653104926e-05, "loss": 0.13232721388339996, "num_input_tokens_seen": 506284, "step": 487, "train_runtime": 1398.3699, "train_tokens_per_second": 362.053 }, { "epoch": 0.20856929159098195, "grad_norm": 2.8743364810943604, "learning_rate": 1.587152034261242e-05, "loss": 0.22635917365550995, "num_input_tokens_seen": 507260, "step": 488, "train_runtime": 1400.5432, "train_tokens_per_second": 362.188 }, { "epoch": 0.2089966876803077, "grad_norm": 2.805987596511841, "learning_rate": 1.5862955032119917e-05, "loss": 0.08352351933717728, "num_input_tokens_seen": 508176, "step": 489, "train_runtime": 1402.6622, "train_tokens_per_second": 362.294 }, { "epoch": 0.2094240837696335, "grad_norm": 1.606923222541809, "learning_rate": 1.585438972162741e-05, "loss": 0.1012442335486412, "num_input_tokens_seen": 509374, "step": 490, "train_runtime": 1404.8896, "train_tokens_per_second": 362.572 }, { "epoch": 0.2098514798589593, "grad_norm": 2.432309865951538, "learning_rate": 1.5845824411134904e-05, "loss": 0.15776558220386505, "num_input_tokens_seen": 510504, "step": 491, "train_runtime": 1407.222, "train_tokens_per_second": 362.774 }, { "epoch": 0.21027887594828507, "grad_norm": 2.092952251434326, "learning_rate": 1.5837259100642398e-05, "loss": 0.15795929729938507, "num_input_tokens_seen": 512370, "step": 492, "train_runtime": 1409.5689, "train_tokens_per_second": 363.494 }, { "epoch": 0.21070627203761086, "grad_norm": 2.1159043312072754, "learning_rate": 1.5828693790149895e-05, "loss": 0.14126335084438324, "num_input_tokens_seen": 513418, "step": 493, "train_runtime": 1411.8495, "train_tokens_per_second": 363.649 }, { "epoch": 0.21113366812693665, "grad_norm": 2.370260715484619, "learning_rate": 1.5820128479657388e-05, "loss": 0.08948801457881927, "num_input_tokens_seen": 514308, "step": 494, "train_runtime": 1414.0793, "train_tokens_per_second": 363.705 }, { "epoch": 0.21156106421626242, "grad_norm": 2.643071413040161, "learning_rate": 1.5811563169164882e-05, "loss": 0.08167178183794022, "num_input_tokens_seen": 515252, "step": 495, "train_runtime": 1416.2863, "train_tokens_per_second": 363.805 }, { "epoch": 0.2119884603055882, "grad_norm": 2.3257827758789062, "learning_rate": 1.580299785867238e-05, "loss": 0.13746702671051025, "num_input_tokens_seen": 516116, "step": 496, "train_runtime": 1418.4188, "train_tokens_per_second": 363.867 }, { "epoch": 0.21241585639491398, "grad_norm": 2.404764175415039, "learning_rate": 1.5794432548179872e-05, "loss": 0.22356030344963074, "num_input_tokens_seen": 517416, "step": 497, "train_runtime": 1420.7315, "train_tokens_per_second": 364.19 }, { "epoch": 0.21284325248423977, "grad_norm": 1.8176261186599731, "learning_rate": 1.5785867237687366e-05, "loss": 0.10514774918556213, "num_input_tokens_seen": 518206, "step": 498, "train_runtime": 1422.824, "train_tokens_per_second": 364.209 }, { "epoch": 0.21327064857356556, "grad_norm": 2.6928937435150146, "learning_rate": 1.5777301927194863e-05, "loss": 0.16498826444149017, "num_input_tokens_seen": 519112, "step": 499, "train_runtime": 1424.944, "train_tokens_per_second": 364.303 }, { "epoch": 0.21369804466289133, "grad_norm": 3.530243396759033, "learning_rate": 1.5768736616702356e-05, "loss": 0.15228629112243652, "num_input_tokens_seen": 520030, "step": 500, "train_runtime": 1427.1623, "train_tokens_per_second": 364.38 }, { "epoch": 0.21412544075221712, "grad_norm": 2.3968775272369385, "learning_rate": 1.576017130620985e-05, "loss": 0.1445412039756775, "num_input_tokens_seen": 521166, "step": 501, "train_runtime": 1429.4257, "train_tokens_per_second": 364.598 }, { "epoch": 0.2145528368415429, "grad_norm": 1.3246902227401733, "learning_rate": 1.5751605995717344e-05, "loss": 0.07449869066476822, "num_input_tokens_seen": 522844, "step": 502, "train_runtime": 1431.7055, "train_tokens_per_second": 365.19 }, { "epoch": 0.21498023293086868, "grad_norm": 3.094409942626953, "learning_rate": 1.574304068522484e-05, "loss": 0.1486973911523819, "num_input_tokens_seen": 523784, "step": 503, "train_runtime": 1433.8324, "train_tokens_per_second": 365.304 }, { "epoch": 0.21540762902019447, "grad_norm": 2.6681461334228516, "learning_rate": 1.5734475374732338e-05, "loss": 0.16639576852321625, "num_input_tokens_seen": 524676, "step": 504, "train_runtime": 1435.9518, "train_tokens_per_second": 365.386 }, { "epoch": 0.21583502510952024, "grad_norm": 1.740444302558899, "learning_rate": 1.572591006423983e-05, "loss": 0.09387188404798508, "num_input_tokens_seen": 525942, "step": 505, "train_runtime": 1438.2004, "train_tokens_per_second": 365.695 }, { "epoch": 0.21626242119884603, "grad_norm": 1.6638593673706055, "learning_rate": 1.5717344753747325e-05, "loss": 0.09179219603538513, "num_input_tokens_seen": 526914, "step": 506, "train_runtime": 1440.317, "train_tokens_per_second": 365.832 }, { "epoch": 0.21668981728817183, "grad_norm": 2.8334851264953613, "learning_rate": 1.5708779443254822e-05, "loss": 0.1521914005279541, "num_input_tokens_seen": 527780, "step": 507, "train_runtime": 1442.4452, "train_tokens_per_second": 365.893 }, { "epoch": 0.2171172133774976, "grad_norm": 2.0652244091033936, "learning_rate": 1.5700214132762315e-05, "loss": 0.10250615328550339, "num_input_tokens_seen": 529420, "step": 508, "train_runtime": 1444.7617, "train_tokens_per_second": 366.441 }, { "epoch": 0.21754460946682339, "grad_norm": 3.1617624759674072, "learning_rate": 1.569164882226981e-05, "loss": 0.17184650897979736, "num_input_tokens_seen": 530426, "step": 509, "train_runtime": 1446.8963, "train_tokens_per_second": 366.596 }, { "epoch": 0.21797200555614915, "grad_norm": 2.2681519985198975, "learning_rate": 1.5683083511777302e-05, "loss": 0.17457982897758484, "num_input_tokens_seen": 531432, "step": 510, "train_runtime": 1449.0906, "train_tokens_per_second": 366.735 }, { "epoch": 0.21839940164547494, "grad_norm": 2.165870428085327, "learning_rate": 1.56745182012848e-05, "loss": 0.10948702692985535, "num_input_tokens_seen": 532300, "step": 511, "train_runtime": 1464.7294, "train_tokens_per_second": 363.412 }, { "epoch": 0.21882679773480074, "grad_norm": 2.145991802215576, "learning_rate": 1.5665952890792293e-05, "loss": 0.138885498046875, "num_input_tokens_seen": 533464, "step": 512, "train_runtime": 1466.9261, "train_tokens_per_second": 363.661 }, { "epoch": 0.2192541938241265, "grad_norm": 1.6592544317245483, "learning_rate": 1.5657387580299787e-05, "loss": 0.1290833055973053, "num_input_tokens_seen": 534688, "step": 513, "train_runtime": 1469.1604, "train_tokens_per_second": 363.941 }, { "epoch": 0.2196815899134523, "grad_norm": 3.0241329669952393, "learning_rate": 1.5648822269807284e-05, "loss": 0.16119757294654846, "num_input_tokens_seen": 535718, "step": 514, "train_runtime": 1471.3153, "train_tokens_per_second": 364.108 }, { "epoch": 0.22010898600277806, "grad_norm": 2.77247953414917, "learning_rate": 1.5640256959314777e-05, "loss": 0.1776650995016098, "num_input_tokens_seen": 536774, "step": 515, "train_runtime": 1473.5648, "train_tokens_per_second": 364.269 }, { "epoch": 0.22053638209210386, "grad_norm": 3.0152673721313477, "learning_rate": 1.563169164882227e-05, "loss": 0.09958123415708542, "num_input_tokens_seen": 537520, "step": 516, "train_runtime": 1475.6796, "train_tokens_per_second": 364.253 }, { "epoch": 0.22096377818142965, "grad_norm": 2.4523041248321533, "learning_rate": 1.5623126338329764e-05, "loss": 0.13446536660194397, "num_input_tokens_seen": 538532, "step": 517, "train_runtime": 1477.8692, "train_tokens_per_second": 364.398 }, { "epoch": 0.22139117427075541, "grad_norm": 2.4473934173583984, "learning_rate": 1.561456102783726e-05, "loss": 0.1699734628200531, "num_input_tokens_seen": 539472, "step": 518, "train_runtime": 1479.9924, "train_tokens_per_second": 364.51 }, { "epoch": 0.2218185703600812, "grad_norm": 2.0424158573150635, "learning_rate": 1.5605995717344755e-05, "loss": 0.13223159313201904, "num_input_tokens_seen": 540582, "step": 519, "train_runtime": 1482.1723, "train_tokens_per_second": 364.723 }, { "epoch": 0.222245966449407, "grad_norm": 2.1409871578216553, "learning_rate": 1.559743040685225e-05, "loss": 0.139509379863739, "num_input_tokens_seen": 541854, "step": 520, "train_runtime": 1484.3802, "train_tokens_per_second": 365.037 }, { "epoch": 0.22267336253873277, "grad_norm": 2.0753836631774902, "learning_rate": 1.5588865096359745e-05, "loss": 0.14061060547828674, "num_input_tokens_seen": 543082, "step": 521, "train_runtime": 1486.5904, "train_tokens_per_second": 365.321 }, { "epoch": 0.22310075862805856, "grad_norm": 2.510342836380005, "learning_rate": 1.558029978586724e-05, "loss": 0.16124089062213898, "num_input_tokens_seen": 543988, "step": 522, "train_runtime": 1488.7106, "train_tokens_per_second": 365.409 }, { "epoch": 0.22352815471738433, "grad_norm": 2.1258161067962646, "learning_rate": 1.5571734475374733e-05, "loss": 0.1936700940132141, "num_input_tokens_seen": 545036, "step": 523, "train_runtime": 1490.9556, "train_tokens_per_second": 365.562 }, { "epoch": 0.22395555080671012, "grad_norm": 2.6125400066375732, "learning_rate": 1.556316916488223e-05, "loss": 0.15123610198497772, "num_input_tokens_seen": 545972, "step": 524, "train_runtime": 1493.1623, "train_tokens_per_second": 365.648 }, { "epoch": 0.2243829468960359, "grad_norm": 1.7003302574157715, "learning_rate": 1.5554603854389723e-05, "loss": 0.1328495740890503, "num_input_tokens_seen": 547502, "step": 525, "train_runtime": 1495.4609, "train_tokens_per_second": 366.109 }, { "epoch": 0.22481034298536168, "grad_norm": 2.637478828430176, "learning_rate": 1.5546038543897217e-05, "loss": 0.14079953730106354, "num_input_tokens_seen": 548188, "step": 526, "train_runtime": 1497.5308, "train_tokens_per_second": 366.061 }, { "epoch": 0.22523773907468747, "grad_norm": 2.351576566696167, "learning_rate": 1.553747323340471e-05, "loss": 0.15369859337806702, "num_input_tokens_seen": 549974, "step": 527, "train_runtime": 1499.8867, "train_tokens_per_second": 366.677 }, { "epoch": 0.22566513516401324, "grad_norm": 4.461513996124268, "learning_rate": 1.5528907922912207e-05, "loss": 0.24408143758773804, "num_input_tokens_seen": 550696, "step": 528, "train_runtime": 1502.0254, "train_tokens_per_second": 366.636 }, { "epoch": 0.22609253125333903, "grad_norm": 2.423560857772827, "learning_rate": 1.55203426124197e-05, "loss": 0.16323769092559814, "num_input_tokens_seen": 551666, "step": 529, "train_runtime": 1504.1836, "train_tokens_per_second": 366.754 }, { "epoch": 0.22651992734266482, "grad_norm": 1.9746719598770142, "learning_rate": 1.5511777301927194e-05, "loss": 0.07020363211631775, "num_input_tokens_seen": 552572, "step": 530, "train_runtime": 1506.3013, "train_tokens_per_second": 366.84 }, { "epoch": 0.2269473234319906, "grad_norm": 1.710885763168335, "learning_rate": 1.550321199143469e-05, "loss": 0.16125689446926117, "num_input_tokens_seen": 554080, "step": 531, "train_runtime": 1508.6089, "train_tokens_per_second": 367.279 }, { "epoch": 0.22737471952131638, "grad_norm": 1.777014970779419, "learning_rate": 1.5494646680942185e-05, "loss": 0.1350293755531311, "num_input_tokens_seen": 555458, "step": 532, "train_runtime": 1510.8603, "train_tokens_per_second": 367.644 }, { "epoch": 0.22780211561064218, "grad_norm": 2.4799766540527344, "learning_rate": 1.548608137044968e-05, "loss": 0.11196652799844742, "num_input_tokens_seen": 556286, "step": 533, "train_runtime": 1512.9716, "train_tokens_per_second": 367.678 }, { "epoch": 0.22822951169996794, "grad_norm": 2.4436168670654297, "learning_rate": 1.5477516059957176e-05, "loss": 0.12476056069135666, "num_input_tokens_seen": 557110, "step": 534, "train_runtime": 1515.0552, "train_tokens_per_second": 367.716 }, { "epoch": 0.22865690778929373, "grad_norm": 2.0891025066375732, "learning_rate": 1.546895074946467e-05, "loss": 0.14830750226974487, "num_input_tokens_seen": 558288, "step": 535, "train_runtime": 1517.2946, "train_tokens_per_second": 367.95 }, { "epoch": 0.2290843038786195, "grad_norm": 1.3756754398345947, "learning_rate": 1.5460385438972163e-05, "loss": 0.09467566013336182, "num_input_tokens_seen": 559406, "step": 536, "train_runtime": 1519.4747, "train_tokens_per_second": 368.157 }, { "epoch": 0.2295116999679453, "grad_norm": 2.0166375637054443, "learning_rate": 1.5451820128479656e-05, "loss": 0.11320997774600983, "num_input_tokens_seen": 560272, "step": 537, "train_runtime": 1521.5651, "train_tokens_per_second": 368.221 }, { "epoch": 0.2299390960572711, "grad_norm": 2.1064934730529785, "learning_rate": 1.5443254817987153e-05, "loss": 0.11865454912185669, "num_input_tokens_seen": 561538, "step": 538, "train_runtime": 1523.8207, "train_tokens_per_second": 368.507 }, { "epoch": 0.23036649214659685, "grad_norm": 2.8276851177215576, "learning_rate": 1.543468950749465e-05, "loss": 0.1871943175792694, "num_input_tokens_seen": 562386, "step": 539, "train_runtime": 1525.9483, "train_tokens_per_second": 368.549 }, { "epoch": 0.23079388823592265, "grad_norm": 2.6436808109283447, "learning_rate": 1.5426124197002144e-05, "loss": 0.1718994379043579, "num_input_tokens_seen": 563408, "step": 540, "train_runtime": 1528.1642, "train_tokens_per_second": 368.683 }, { "epoch": 0.2312212843252484, "grad_norm": 2.5760653018951416, "learning_rate": 1.5417558886509637e-05, "loss": 0.1660972386598587, "num_input_tokens_seen": 564254, "step": 541, "train_runtime": 1542.5505, "train_tokens_per_second": 365.793 }, { "epoch": 0.2316486804145742, "grad_norm": 2.107659101486206, "learning_rate": 1.5408993576017134e-05, "loss": 0.18583010137081146, "num_input_tokens_seen": 565498, "step": 542, "train_runtime": 1544.7652, "train_tokens_per_second": 366.074 }, { "epoch": 0.2320760765039, "grad_norm": 2.7439117431640625, "learning_rate": 1.5400428265524628e-05, "loss": 0.08493205159902573, "num_input_tokens_seen": 566718, "step": 543, "train_runtime": 1546.9665, "train_tokens_per_second": 366.341 }, { "epoch": 0.23250347259322576, "grad_norm": 2.3122153282165527, "learning_rate": 1.539186295503212e-05, "loss": 0.16841523349285126, "num_input_tokens_seen": 567764, "step": 544, "train_runtime": 1549.1632, "train_tokens_per_second": 366.497 }, { "epoch": 0.23293086868255156, "grad_norm": 1.9390462636947632, "learning_rate": 1.5383297644539615e-05, "loss": 0.1035780981183052, "num_input_tokens_seen": 568674, "step": 545, "train_runtime": 1551.3064, "train_tokens_per_second": 366.577 }, { "epoch": 0.23335826477187735, "grad_norm": 2.66786527633667, "learning_rate": 1.5374732334047112e-05, "loss": 0.13681650161743164, "num_input_tokens_seen": 569620, "step": 546, "train_runtime": 1553.4202, "train_tokens_per_second": 366.688 }, { "epoch": 0.23378566086120312, "grad_norm": 2.642683267593384, "learning_rate": 1.5366167023554606e-05, "loss": 0.17472638189792633, "num_input_tokens_seen": 570572, "step": 547, "train_runtime": 1555.5739, "train_tokens_per_second": 366.792 }, { "epoch": 0.2342130569505289, "grad_norm": 3.1677067279815674, "learning_rate": 1.53576017130621e-05, "loss": 0.1817154735326767, "num_input_tokens_seen": 571354, "step": 548, "train_runtime": 1557.6595, "train_tokens_per_second": 366.803 }, { "epoch": 0.23464045303985467, "grad_norm": 2.4259681701660156, "learning_rate": 1.5349036402569596e-05, "loss": 0.1345292031764984, "num_input_tokens_seen": 572478, "step": 549, "train_runtime": 1559.8404, "train_tokens_per_second": 367.011 }, { "epoch": 0.23506784912918047, "grad_norm": 2.276236057281494, "learning_rate": 1.534047109207709e-05, "loss": 0.09407582879066467, "num_input_tokens_seen": 573442, "step": 550, "train_runtime": 1561.9913, "train_tokens_per_second": 367.122 }, { "epoch": 0.23549524521850626, "grad_norm": 2.1500966548919678, "learning_rate": 1.5331905781584583e-05, "loss": 0.12902149558067322, "num_input_tokens_seen": 574304, "step": 551, "train_runtime": 1564.1363, "train_tokens_per_second": 367.17 }, { "epoch": 0.23592264130783203, "grad_norm": 2.4532110691070557, "learning_rate": 1.5323340471092077e-05, "loss": 0.14625193178653717, "num_input_tokens_seen": 575224, "step": 552, "train_runtime": 1566.239, "train_tokens_per_second": 367.265 }, { "epoch": 0.23635003739715782, "grad_norm": 2.008481025695801, "learning_rate": 1.5314775160599574e-05, "loss": 0.11644130945205688, "num_input_tokens_seen": 576216, "step": 553, "train_runtime": 1568.719, "train_tokens_per_second": 367.316 }, { "epoch": 0.23677743348648359, "grad_norm": 2.1232733726501465, "learning_rate": 1.5306209850107068e-05, "loss": 0.0997479185461998, "num_input_tokens_seen": 577130, "step": 554, "train_runtime": 1570.8363, "train_tokens_per_second": 367.403 }, { "epoch": 0.23720482957580938, "grad_norm": 2.1800730228424072, "learning_rate": 1.529764453961456e-05, "loss": 0.12549588084220886, "num_input_tokens_seen": 578188, "step": 555, "train_runtime": 1572.9819, "train_tokens_per_second": 367.574 }, { "epoch": 0.23763222566513517, "grad_norm": 2.4302923679351807, "learning_rate": 1.5289079229122058e-05, "loss": 0.11075545102357864, "num_input_tokens_seen": 579398, "step": 556, "train_runtime": 1575.1797, "train_tokens_per_second": 367.83 }, { "epoch": 0.23805962175446094, "grad_norm": 3.1985461711883545, "learning_rate": 1.528051391862955e-05, "loss": 0.12170572578907013, "num_input_tokens_seen": 581002, "step": 557, "train_runtime": 1577.4627, "train_tokens_per_second": 368.314 }, { "epoch": 0.23848701784378673, "grad_norm": 2.2686915397644043, "learning_rate": 1.5271948608137045e-05, "loss": 0.16669438779354095, "num_input_tokens_seen": 582120, "step": 558, "train_runtime": 1579.6284, "train_tokens_per_second": 368.517 }, { "epoch": 0.23891441393311252, "grad_norm": 3.0081892013549805, "learning_rate": 1.5263383297644542e-05, "loss": 0.1628597378730774, "num_input_tokens_seen": 582940, "step": 559, "train_runtime": 1581.7383, "train_tokens_per_second": 368.544 }, { "epoch": 0.2393418100224383, "grad_norm": 1.970823884010315, "learning_rate": 1.5254817987152036e-05, "loss": 0.1337084174156189, "num_input_tokens_seen": 583904, "step": 560, "train_runtime": 1583.8843, "train_tokens_per_second": 368.653 }, { "epoch": 0.23976920611176408, "grad_norm": 2.0613250732421875, "learning_rate": 1.524625267665953e-05, "loss": 0.16636675596237183, "num_input_tokens_seen": 585096, "step": 561, "train_runtime": 1586.0804, "train_tokens_per_second": 368.894 }, { "epoch": 0.24019660220108985, "grad_norm": 3.0194408893585205, "learning_rate": 1.5237687366167025e-05, "loss": 0.14587190747261047, "num_input_tokens_seen": 586010, "step": 562, "train_runtime": 1588.1587, "train_tokens_per_second": 368.987 }, { "epoch": 0.24062399829041564, "grad_norm": 1.7433415651321411, "learning_rate": 1.5229122055674518e-05, "loss": 0.06883656233549118, "num_input_tokens_seen": 587124, "step": 563, "train_runtime": 1590.3252, "train_tokens_per_second": 369.185 }, { "epoch": 0.24105139437974143, "grad_norm": 2.674011707305908, "learning_rate": 1.5220556745182014e-05, "loss": 0.19446563720703125, "num_input_tokens_seen": 588444, "step": 564, "train_runtime": 1592.5455, "train_tokens_per_second": 369.499 }, { "epoch": 0.2414787904690672, "grad_norm": 1.8672616481781006, "learning_rate": 1.5211991434689509e-05, "loss": 0.144138365983963, "num_input_tokens_seen": 589462, "step": 565, "train_runtime": 1594.6949, "train_tokens_per_second": 369.639 }, { "epoch": 0.241906186558393, "grad_norm": 2.232290506362915, "learning_rate": 1.5203426124197002e-05, "loss": 0.09555627405643463, "num_input_tokens_seen": 590564, "step": 566, "train_runtime": 1596.831, "train_tokens_per_second": 369.835 }, { "epoch": 0.2423335826477188, "grad_norm": 2.130337953567505, "learning_rate": 1.5194860813704498e-05, "loss": 0.16360598802566528, "num_input_tokens_seen": 591790, "step": 567, "train_runtime": 1599.0472, "train_tokens_per_second": 370.089 }, { "epoch": 0.24276097873704455, "grad_norm": 1.619037389755249, "learning_rate": 1.5186295503211991e-05, "loss": 0.11852429807186127, "num_input_tokens_seen": 592800, "step": 568, "train_runtime": 1601.1855, "train_tokens_per_second": 370.226 }, { "epoch": 0.24318837482637035, "grad_norm": 2.230518102645874, "learning_rate": 1.5177730192719487e-05, "loss": 0.1458892673254013, "num_input_tokens_seen": 593980, "step": 569, "train_runtime": 1603.395, "train_tokens_per_second": 370.451 }, { "epoch": 0.2436157709156961, "grad_norm": 1.8642629384994507, "learning_rate": 1.5169164882226982e-05, "loss": 0.12750224769115448, "num_input_tokens_seen": 595218, "step": 570, "train_runtime": 1605.6111, "train_tokens_per_second": 370.711 }, { "epoch": 0.2440431670050219, "grad_norm": 2.8837227821350098, "learning_rate": 1.5160599571734475e-05, "loss": 0.13859373331069946, "num_input_tokens_seen": 595882, "step": 571, "train_runtime": 1619.2751, "train_tokens_per_second": 367.993 }, { "epoch": 0.2444705630943477, "grad_norm": 1.8672165870666504, "learning_rate": 1.515203426124197e-05, "loss": 0.060058604925870895, "num_input_tokens_seen": 597056, "step": 572, "train_runtime": 1621.4925, "train_tokens_per_second": 368.214 }, { "epoch": 0.24489795918367346, "grad_norm": 2.315662384033203, "learning_rate": 1.5143468950749468e-05, "loss": 0.1080392599105835, "num_input_tokens_seen": 598454, "step": 573, "train_runtime": 1623.7473, "train_tokens_per_second": 368.564 }, { "epoch": 0.24532535527299926, "grad_norm": 2.41036057472229, "learning_rate": 1.5134903640256961e-05, "loss": 0.13520333170890808, "num_input_tokens_seen": 599250, "step": 574, "train_runtime": 1625.8445, "train_tokens_per_second": 368.578 }, { "epoch": 0.24575275136232502, "grad_norm": 1.8074324131011963, "learning_rate": 1.5126338329764456e-05, "loss": 0.0938856303691864, "num_input_tokens_seen": 600164, "step": 575, "train_runtime": 1627.969, "train_tokens_per_second": 368.658 }, { "epoch": 0.24618014745165082, "grad_norm": 2.911297082901001, "learning_rate": 1.511777301927195e-05, "loss": 0.10376982390880585, "num_input_tokens_seen": 600880, "step": 576, "train_runtime": 1630.057, "train_tokens_per_second": 368.625 }, { "epoch": 0.2466075435409766, "grad_norm": 1.6230921745300293, "learning_rate": 1.5109207708779445e-05, "loss": 0.09955968707799911, "num_input_tokens_seen": 602352, "step": 577, "train_runtime": 1632.3017, "train_tokens_per_second": 369.02 }, { "epoch": 0.24703493963030237, "grad_norm": 2.609530210494995, "learning_rate": 1.510064239828694e-05, "loss": 0.13412997126579285, "num_input_tokens_seen": 603496, "step": 578, "train_runtime": 1634.4749, "train_tokens_per_second": 369.229 }, { "epoch": 0.24746233571962817, "grad_norm": 2.2227115631103516, "learning_rate": 1.5092077087794434e-05, "loss": 0.16486811637878418, "num_input_tokens_seen": 604872, "step": 579, "train_runtime": 1636.7179, "train_tokens_per_second": 369.564 }, { "epoch": 0.24788973180895396, "grad_norm": 2.3095686435699463, "learning_rate": 1.508351177730193e-05, "loss": 0.12404029071331024, "num_input_tokens_seen": 605866, "step": 580, "train_runtime": 1638.8275, "train_tokens_per_second": 369.695 }, { "epoch": 0.24831712789827973, "grad_norm": 2.0123238563537598, "learning_rate": 1.5074946466809423e-05, "loss": 0.08304786682128906, "num_input_tokens_seen": 606936, "step": 581, "train_runtime": 1640.9866, "train_tokens_per_second": 369.86 }, { "epoch": 0.24874452398760552, "grad_norm": 2.6874747276306152, "learning_rate": 1.5066381156316918e-05, "loss": 0.20925870537757874, "num_input_tokens_seen": 607974, "step": 582, "train_runtime": 1643.3493, "train_tokens_per_second": 369.96 }, { "epoch": 0.24917192007693129, "grad_norm": 3.5932059288024902, "learning_rate": 1.5057815845824414e-05, "loss": 0.2375958114862442, "num_input_tokens_seen": 609022, "step": 583, "train_runtime": 1645.565, "train_tokens_per_second": 370.099 }, { "epoch": 0.24959931616625708, "grad_norm": 1.4646111726760864, "learning_rate": 1.5049250535331907e-05, "loss": 0.07569268345832825, "num_input_tokens_seen": 610356, "step": 584, "train_runtime": 1647.7924, "train_tokens_per_second": 370.408 }, { "epoch": 0.2500267122555829, "grad_norm": 3.407583236694336, "learning_rate": 1.5040685224839402e-05, "loss": 0.14567101001739502, "num_input_tokens_seen": 611014, "step": 585, "train_runtime": 1649.9535, "train_tokens_per_second": 370.322 }, { "epoch": 0.25045410834490867, "grad_norm": 2.5580594539642334, "learning_rate": 1.5032119914346896e-05, "loss": 0.17587047815322876, "num_input_tokens_seen": 611958, "step": 586, "train_runtime": 1652.0831, "train_tokens_per_second": 370.416 }, { "epoch": 0.2508815044342344, "grad_norm": 2.225137233734131, "learning_rate": 1.5023554603854391e-05, "loss": 0.14163464307785034, "num_input_tokens_seen": 613254, "step": 587, "train_runtime": 1654.3121, "train_tokens_per_second": 370.7 }, { "epoch": 0.2513089005235602, "grad_norm": 2.277710199356079, "learning_rate": 1.5014989293361885e-05, "loss": 0.18206238746643066, "num_input_tokens_seen": 614336, "step": 588, "train_runtime": 1656.5223, "train_tokens_per_second": 370.859 }, { "epoch": 0.251736296612886, "grad_norm": 2.002258777618408, "learning_rate": 1.500642398286938e-05, "loss": 0.1447502076625824, "num_input_tokens_seen": 615766, "step": 589, "train_runtime": 1658.8042, "train_tokens_per_second": 371.211 }, { "epoch": 0.2521636927022118, "grad_norm": 1.7282333374023438, "learning_rate": 1.4997858672376875e-05, "loss": 0.1233157217502594, "num_input_tokens_seen": 617264, "step": 590, "train_runtime": 1661.0949, "train_tokens_per_second": 371.601 }, { "epoch": 0.2525910887915376, "grad_norm": 2.3245608806610107, "learning_rate": 1.4989293361884369e-05, "loss": 0.14430296421051025, "num_input_tokens_seen": 618526, "step": 591, "train_runtime": 1663.326, "train_tokens_per_second": 371.861 }, { "epoch": 0.2530184848808633, "grad_norm": 1.7639458179473877, "learning_rate": 1.4980728051391864e-05, "loss": 0.14418625831604004, "num_input_tokens_seen": 620828, "step": 592, "train_runtime": 1665.8388, "train_tokens_per_second": 372.682 }, { "epoch": 0.2534458809701891, "grad_norm": 1.7470554113388062, "learning_rate": 1.4972162740899358e-05, "loss": 0.1562797874212265, "num_input_tokens_seen": 621908, "step": 593, "train_runtime": 1667.9948, "train_tokens_per_second": 372.848 }, { "epoch": 0.2538732770595149, "grad_norm": 2.1268813610076904, "learning_rate": 1.4963597430406853e-05, "loss": 0.13244813680648804, "num_input_tokens_seen": 623304, "step": 594, "train_runtime": 1670.332, "train_tokens_per_second": 373.162 }, { "epoch": 0.2543006731488407, "grad_norm": 1.9472156763076782, "learning_rate": 1.4955032119914348e-05, "loss": 0.10751897096633911, "num_input_tokens_seen": 624342, "step": 595, "train_runtime": 1672.5003, "train_tokens_per_second": 373.299 }, { "epoch": 0.2547280692381665, "grad_norm": 2.370417356491089, "learning_rate": 1.4946466809421842e-05, "loss": 0.2049310803413391, "num_input_tokens_seen": 625290, "step": 596, "train_runtime": 1674.6195, "train_tokens_per_second": 373.392 }, { "epoch": 0.2551554653274922, "grad_norm": 3.086700677871704, "learning_rate": 1.4937901498929337e-05, "loss": 0.12804263830184937, "num_input_tokens_seen": 626950, "step": 597, "train_runtime": 1676.9535, "train_tokens_per_second": 373.862 }, { "epoch": 0.255582861416818, "grad_norm": 1.9125748872756958, "learning_rate": 1.4929336188436831e-05, "loss": 0.17901611328125, "num_input_tokens_seen": 628778, "step": 598, "train_runtime": 1679.2616, "train_tokens_per_second": 374.437 }, { "epoch": 0.2560102575061438, "grad_norm": 2.6187164783477783, "learning_rate": 1.4920770877944326e-05, "loss": 0.21042247116565704, "num_input_tokens_seen": 629784, "step": 599, "train_runtime": 1681.3888, "train_tokens_per_second": 374.562 }, { "epoch": 0.2564376535954696, "grad_norm": 2.2882473468780518, "learning_rate": 1.4912205567451821e-05, "loss": 0.13214997947216034, "num_input_tokens_seen": 630786, "step": 600, "train_runtime": 1683.539, "train_tokens_per_second": 374.679 }, { "epoch": 0.2568650496847954, "grad_norm": 2.7067177295684814, "learning_rate": 1.4903640256959315e-05, "loss": 0.12402036786079407, "num_input_tokens_seen": 631604, "step": 601, "train_runtime": 1698.8541, "train_tokens_per_second": 371.782 }, { "epoch": 0.2572924457741212, "grad_norm": 2.4188687801361084, "learning_rate": 1.489507494646681e-05, "loss": 0.16838578879833221, "num_input_tokens_seen": 632476, "step": 602, "train_runtime": 1700.94, "train_tokens_per_second": 371.839 }, { "epoch": 0.25771984186344693, "grad_norm": 2.240884304046631, "learning_rate": 1.4886509635974304e-05, "loss": 0.10224397480487823, "num_input_tokens_seen": 633386, "step": 603, "train_runtime": 1703.0595, "train_tokens_per_second": 371.911 }, { "epoch": 0.2581472379527727, "grad_norm": 2.211941957473755, "learning_rate": 1.48779443254818e-05, "loss": 0.1301332712173462, "num_input_tokens_seen": 634266, "step": 604, "train_runtime": 1705.1783, "train_tokens_per_second": 371.965 }, { "epoch": 0.2585746340420985, "grad_norm": 2.600369930267334, "learning_rate": 1.4869379014989293e-05, "loss": 0.13147202134132385, "num_input_tokens_seen": 635158, "step": 605, "train_runtime": 1707.2964, "train_tokens_per_second": 372.026 }, { "epoch": 0.2590020301314243, "grad_norm": 1.8159915208816528, "learning_rate": 1.4860813704496788e-05, "loss": 0.11959327012300491, "num_input_tokens_seen": 636060, "step": 606, "train_runtime": 1709.4065, "train_tokens_per_second": 372.094 }, { "epoch": 0.2594294262207501, "grad_norm": 2.2972586154937744, "learning_rate": 1.4852248394004285e-05, "loss": 0.1352578103542328, "num_input_tokens_seen": 637656, "step": 607, "train_runtime": 1711.7053, "train_tokens_per_second": 372.527 }, { "epoch": 0.25985682231007584, "grad_norm": 1.8306388854980469, "learning_rate": 1.484368308351178e-05, "loss": 0.07780133187770844, "num_input_tokens_seen": 638622, "step": 608, "train_runtime": 1713.8153, "train_tokens_per_second": 372.632 }, { "epoch": 0.26028421839940163, "grad_norm": 2.4278531074523926, "learning_rate": 1.4835117773019274e-05, "loss": 0.1398286521434784, "num_input_tokens_seen": 639516, "step": 609, "train_runtime": 1715.9091, "train_tokens_per_second": 372.698 }, { "epoch": 0.26071161448872743, "grad_norm": 1.9774209260940552, "learning_rate": 1.4826552462526769e-05, "loss": 0.1397102177143097, "num_input_tokens_seen": 641198, "step": 610, "train_runtime": 1718.291, "train_tokens_per_second": 373.16 }, { "epoch": 0.2611390105780532, "grad_norm": 3.3630471229553223, "learning_rate": 1.4817987152034263e-05, "loss": 0.1562974452972412, "num_input_tokens_seen": 642066, "step": 611, "train_runtime": 1720.4123, "train_tokens_per_second": 373.205 }, { "epoch": 0.261566406667379, "grad_norm": 1.6679407358169556, "learning_rate": 1.4809421841541758e-05, "loss": 0.12732523679733276, "num_input_tokens_seen": 643672, "step": 612, "train_runtime": 1722.7337, "train_tokens_per_second": 373.634 }, { "epoch": 0.26199380275670475, "grad_norm": 1.9551758766174316, "learning_rate": 1.4800856531049253e-05, "loss": 0.16241273283958435, "num_input_tokens_seen": 644672, "step": 613, "train_runtime": 1724.8963, "train_tokens_per_second": 373.745 }, { "epoch": 0.26242119884603055, "grad_norm": 2.7418792247772217, "learning_rate": 1.4792291220556747e-05, "loss": 0.20132620632648468, "num_input_tokens_seen": 645518, "step": 614, "train_runtime": 1727.1499, "train_tokens_per_second": 373.748 }, { "epoch": 0.26284859493535634, "grad_norm": 2.3483219146728516, "learning_rate": 1.4783725910064242e-05, "loss": 0.10017156600952148, "num_input_tokens_seen": 646582, "step": 615, "train_runtime": 1729.3478, "train_tokens_per_second": 373.888 }, { "epoch": 0.26327599102468213, "grad_norm": 2.903587579727173, "learning_rate": 1.4775160599571736e-05, "loss": 0.16080167889595032, "num_input_tokens_seen": 647430, "step": 616, "train_runtime": 1731.5146, "train_tokens_per_second": 373.91 }, { "epoch": 0.2637033871140079, "grad_norm": 2.809605598449707, "learning_rate": 1.4766595289079231e-05, "loss": 0.13062329590320587, "num_input_tokens_seen": 648152, "step": 617, "train_runtime": 1733.6845, "train_tokens_per_second": 373.858 }, { "epoch": 0.26413078320333366, "grad_norm": 3.384843587875366, "learning_rate": 1.4758029978586725e-05, "loss": 0.16314518451690674, "num_input_tokens_seen": 648804, "step": 618, "train_runtime": 1735.7569, "train_tokens_per_second": 373.787 }, { "epoch": 0.26455817929265946, "grad_norm": 3.2259411811828613, "learning_rate": 1.474946466809422e-05, "loss": 0.18350113928318024, "num_input_tokens_seen": 650052, "step": 619, "train_runtime": 1737.9925, "train_tokens_per_second": 374.025 }, { "epoch": 0.26498557538198525, "grad_norm": 1.8685604333877563, "learning_rate": 1.4740899357601715e-05, "loss": 0.10585185885429382, "num_input_tokens_seen": 651060, "step": 620, "train_runtime": 1740.1966, "train_tokens_per_second": 374.13 }, { "epoch": 0.26541297147131104, "grad_norm": 2.313979148864746, "learning_rate": 1.4732334047109209e-05, "loss": 0.1605004370212555, "num_input_tokens_seen": 651978, "step": 621, "train_runtime": 1742.3659, "train_tokens_per_second": 374.191 }, { "epoch": 0.26584036756063684, "grad_norm": 6.554983139038086, "learning_rate": 1.4723768736616704e-05, "loss": 0.23819810152053833, "num_input_tokens_seen": 652776, "step": 622, "train_runtime": 1744.4811, "train_tokens_per_second": 374.195 }, { "epoch": 0.26626776364996263, "grad_norm": 1.9299674034118652, "learning_rate": 1.4715203426124198e-05, "loss": 0.125253364443779, "num_input_tokens_seen": 654328, "step": 623, "train_runtime": 1746.8029, "train_tokens_per_second": 374.586 }, { "epoch": 0.26669515973928837, "grad_norm": 3.4705519676208496, "learning_rate": 1.4706638115631693e-05, "loss": 0.2804924249649048, "num_input_tokens_seen": 655520, "step": 624, "train_runtime": 1749.0096, "train_tokens_per_second": 374.795 }, { "epoch": 0.26712255582861416, "grad_norm": 2.8094065189361572, "learning_rate": 1.4698072805139188e-05, "loss": 0.14450781047344208, "num_input_tokens_seen": 656314, "step": 625, "train_runtime": 1751.1381, "train_tokens_per_second": 374.793 }, { "epoch": 0.26754995191793995, "grad_norm": 2.3324849605560303, "learning_rate": 1.4689507494646682e-05, "loss": 0.1516658067703247, "num_input_tokens_seen": 657426, "step": 626, "train_runtime": 1753.3261, "train_tokens_per_second": 374.959 }, { "epoch": 0.26797734800726575, "grad_norm": 2.6098573207855225, "learning_rate": 1.4680942184154177e-05, "loss": 0.14121192693710327, "num_input_tokens_seen": 658524, "step": 627, "train_runtime": 1755.5409, "train_tokens_per_second": 375.112 }, { "epoch": 0.26840474409659154, "grad_norm": 2.85821533203125, "learning_rate": 1.467237687366167e-05, "loss": 0.09671340882778168, "num_input_tokens_seen": 659636, "step": 628, "train_runtime": 1757.732, "train_tokens_per_second": 375.277 }, { "epoch": 0.2688321401859173, "grad_norm": 1.9630221128463745, "learning_rate": 1.4663811563169166e-05, "loss": 0.1310899704694748, "num_input_tokens_seen": 660798, "step": 629, "train_runtime": 1759.9823, "train_tokens_per_second": 375.457 }, { "epoch": 0.26925953627524307, "grad_norm": 1.739284873008728, "learning_rate": 1.4655246252676661e-05, "loss": 0.10666526108980179, "num_input_tokens_seen": 662582, "step": 630, "train_runtime": 1762.343, "train_tokens_per_second": 375.967 }, { "epoch": 0.26968693236456887, "grad_norm": 2.0755605697631836, "learning_rate": 1.4646680942184155e-05, "loss": 0.1379154622554779, "num_input_tokens_seen": 663804, "step": 631, "train_runtime": 1777.95, "train_tokens_per_second": 373.354 }, { "epoch": 0.27011432845389466, "grad_norm": 2.186189651489258, "learning_rate": 1.463811563169165e-05, "loss": 0.11671717464923859, "num_input_tokens_seen": 664674, "step": 632, "train_runtime": 1780.1003, "train_tokens_per_second": 373.391 }, { "epoch": 0.27054172454322045, "grad_norm": 2.5961384773254395, "learning_rate": 1.4629550321199144e-05, "loss": 0.1427270919084549, "num_input_tokens_seen": 665636, "step": 633, "train_runtime": 1782.2739, "train_tokens_per_second": 373.476 }, { "epoch": 0.2709691206325462, "grad_norm": 2.0703091621398926, "learning_rate": 1.4620985010706639e-05, "loss": 0.10669196397066116, "num_input_tokens_seen": 666736, "step": 634, "train_runtime": 1784.4507, "train_tokens_per_second": 373.637 }, { "epoch": 0.271396516721872, "grad_norm": 1.9252040386199951, "learning_rate": 1.4612419700214132e-05, "loss": 0.10314284265041351, "num_input_tokens_seen": 668148, "step": 635, "train_runtime": 1786.7109, "train_tokens_per_second": 373.954 }, { "epoch": 0.2718239128111978, "grad_norm": 2.0868709087371826, "learning_rate": 1.4603854389721628e-05, "loss": 0.1109037846326828, "num_input_tokens_seen": 669176, "step": 636, "train_runtime": 1788.8378, "train_tokens_per_second": 374.084 }, { "epoch": 0.27225130890052357, "grad_norm": 2.150547742843628, "learning_rate": 1.4595289079229123e-05, "loss": 0.11692191660404205, "num_input_tokens_seen": 670002, "step": 637, "train_runtime": 1790.9635, "train_tokens_per_second": 374.101 }, { "epoch": 0.27267870498984936, "grad_norm": 1.5417817831039429, "learning_rate": 1.4586723768736617e-05, "loss": 0.1225898414850235, "num_input_tokens_seen": 671710, "step": 638, "train_runtime": 1793.316, "train_tokens_per_second": 374.563 }, { "epoch": 0.2731061010791751, "grad_norm": 2.2921831607818604, "learning_rate": 1.4578158458244112e-05, "loss": 0.13761989772319794, "num_input_tokens_seen": 672736, "step": 639, "train_runtime": 1795.4712, "train_tokens_per_second": 374.685 }, { "epoch": 0.2735334971685009, "grad_norm": 2.043858289718628, "learning_rate": 1.4569593147751605e-05, "loss": 0.1470688134431839, "num_input_tokens_seen": 673894, "step": 640, "train_runtime": 1797.664, "train_tokens_per_second": 374.872 }, { "epoch": 0.2739608932578267, "grad_norm": 2.1990044116973877, "learning_rate": 1.45610278372591e-05, "loss": 0.19008825719356537, "num_input_tokens_seen": 675060, "step": 641, "train_runtime": 1799.8386, "train_tokens_per_second": 375.067 }, { "epoch": 0.2743882893471525, "grad_norm": 2.5244386196136475, "learning_rate": 1.4552462526766598e-05, "loss": 0.17848122119903564, "num_input_tokens_seen": 676204, "step": 642, "train_runtime": 1801.9888, "train_tokens_per_second": 375.254 }, { "epoch": 0.2748156854364783, "grad_norm": 2.1407968997955322, "learning_rate": 1.4543897216274093e-05, "loss": 0.09873424470424652, "num_input_tokens_seen": 677100, "step": 643, "train_runtime": 1804.0803, "train_tokens_per_second": 375.316 }, { "epoch": 0.275243081525804, "grad_norm": 2.634310722351074, "learning_rate": 1.4535331905781587e-05, "loss": 0.13076536357402802, "num_input_tokens_seen": 678234, "step": 644, "train_runtime": 1806.2794, "train_tokens_per_second": 375.487 }, { "epoch": 0.2756704776151298, "grad_norm": 2.9757766723632812, "learning_rate": 1.4526766595289082e-05, "loss": 0.12197183072566986, "num_input_tokens_seen": 678926, "step": 645, "train_runtime": 1808.4195, "train_tokens_per_second": 375.425 }, { "epoch": 0.2760978737044556, "grad_norm": 1.983682632446289, "learning_rate": 1.4518201284796575e-05, "loss": 0.11559322476387024, "num_input_tokens_seen": 679898, "step": 646, "train_runtime": 1810.5739, "train_tokens_per_second": 375.515 }, { "epoch": 0.2765252697937814, "grad_norm": 1.9641001224517822, "learning_rate": 1.450963597430407e-05, "loss": 0.14868269860744476, "num_input_tokens_seen": 680990, "step": 647, "train_runtime": 1812.7621, "train_tokens_per_second": 375.664 }, { "epoch": 0.2769526658831072, "grad_norm": 1.8658320903778076, "learning_rate": 1.4501070663811564e-05, "loss": 0.1106535792350769, "num_input_tokens_seen": 682104, "step": 648, "train_runtime": 1814.973, "train_tokens_per_second": 375.82 }, { "epoch": 0.277380061972433, "grad_norm": 2.208958387374878, "learning_rate": 1.449250535331906e-05, "loss": 0.15505282580852509, "num_input_tokens_seen": 683204, "step": 649, "train_runtime": 1817.142, "train_tokens_per_second": 375.977 }, { "epoch": 0.2778074580617587, "grad_norm": 2.8805222511291504, "learning_rate": 1.4483940042826555e-05, "loss": 0.19088751077651978, "num_input_tokens_seen": 683966, "step": 650, "train_runtime": 1819.252, "train_tokens_per_second": 375.96 }, { "epoch": 0.2782348541510845, "grad_norm": 2.2402267456054688, "learning_rate": 1.4475374732334048e-05, "loss": 0.10395414382219315, "num_input_tokens_seen": 684992, "step": 651, "train_runtime": 1821.3883, "train_tokens_per_second": 376.082 }, { "epoch": 0.2786622502404103, "grad_norm": 2.177079916000366, "learning_rate": 1.4466809421841544e-05, "loss": 0.1784535050392151, "num_input_tokens_seen": 686164, "step": 652, "train_runtime": 1823.6148, "train_tokens_per_second": 376.266 }, { "epoch": 0.2790896463297361, "grad_norm": 1.5526562929153442, "learning_rate": 1.4458244111349037e-05, "loss": 0.13759081065654755, "num_input_tokens_seen": 687650, "step": 653, "train_runtime": 1825.8962, "train_tokens_per_second": 376.61 }, { "epoch": 0.2795170424190619, "grad_norm": 2.5718026161193848, "learning_rate": 1.4449678800856533e-05, "loss": 0.21604347229003906, "num_input_tokens_seen": 688598, "step": 654, "train_runtime": 1828.057, "train_tokens_per_second": 376.683 }, { "epoch": 0.2799444385083876, "grad_norm": 2.6486434936523438, "learning_rate": 1.4441113490364028e-05, "loss": 0.1431410014629364, "num_input_tokens_seen": 689498, "step": 655, "train_runtime": 1830.1921, "train_tokens_per_second": 376.735 }, { "epoch": 0.2803718345977134, "grad_norm": 2.255743980407715, "learning_rate": 1.4432548179871521e-05, "loss": 0.11979982256889343, "num_input_tokens_seen": 690404, "step": 656, "train_runtime": 1832.3088, "train_tokens_per_second": 376.795 }, { "epoch": 0.2807992306870392, "grad_norm": 1.7594857215881348, "learning_rate": 1.4423982869379017e-05, "loss": 0.11151863634586334, "num_input_tokens_seen": 692104, "step": 657, "train_runtime": 1834.6193, "train_tokens_per_second": 377.247 }, { "epoch": 0.281226626776365, "grad_norm": 2.4156394004821777, "learning_rate": 1.441541755888651e-05, "loss": 0.12841804325580597, "num_input_tokens_seen": 693036, "step": 658, "train_runtime": 1836.773, "train_tokens_per_second": 377.312 }, { "epoch": 0.2816540228656908, "grad_norm": 2.3588061332702637, "learning_rate": 1.4406852248394005e-05, "loss": 0.10891027003526688, "num_input_tokens_seen": 694052, "step": 659, "train_runtime": 1838.9409, "train_tokens_per_second": 377.419 }, { "epoch": 0.28208141895501654, "grad_norm": 2.0901601314544678, "learning_rate": 1.43982869379015e-05, "loss": 0.12020985782146454, "num_input_tokens_seen": 695124, "step": 660, "train_runtime": 1841.1038, "train_tokens_per_second": 377.558 }, { "epoch": 0.28250881504434233, "grad_norm": 2.724958658218384, "learning_rate": 1.4389721627408994e-05, "loss": 0.116816446185112, "num_input_tokens_seen": 696154, "step": 661, "train_runtime": 1857.3141, "train_tokens_per_second": 374.818 }, { "epoch": 0.2829362111336681, "grad_norm": 1.732968807220459, "learning_rate": 1.438115631691649e-05, "loss": 0.1253526657819748, "num_input_tokens_seen": 697178, "step": 662, "train_runtime": 1859.5003, "train_tokens_per_second": 374.928 }, { "epoch": 0.2833636072229939, "grad_norm": 3.5117788314819336, "learning_rate": 1.4372591006423983e-05, "loss": 0.15188395977020264, "num_input_tokens_seen": 697816, "step": 663, "train_runtime": 1861.5695, "train_tokens_per_second": 374.854 }, { "epoch": 0.2837910033123197, "grad_norm": 2.3651187419891357, "learning_rate": 1.4364025695931478e-05, "loss": 0.112892284989357, "num_input_tokens_seen": 698672, "step": 664, "train_runtime": 1863.7302, "train_tokens_per_second": 374.878 }, { "epoch": 0.28421839940164545, "grad_norm": 2.184657096862793, "learning_rate": 1.4355460385438972e-05, "loss": 0.17838981747627258, "num_input_tokens_seen": 699868, "step": 665, "train_runtime": 1865.9385, "train_tokens_per_second": 375.076 }, { "epoch": 0.28464579549097124, "grad_norm": 2.1275479793548584, "learning_rate": 1.4346895074946467e-05, "loss": 0.12411011010408401, "num_input_tokens_seen": 700964, "step": 666, "train_runtime": 1868.135, "train_tokens_per_second": 375.221 }, { "epoch": 0.28507319158029704, "grad_norm": 2.5148892402648926, "learning_rate": 1.4338329764453963e-05, "loss": 0.1568133533000946, "num_input_tokens_seen": 702766, "step": 667, "train_runtime": 1870.4581, "train_tokens_per_second": 375.719 }, { "epoch": 0.28550058766962283, "grad_norm": 2.366084575653076, "learning_rate": 1.4329764453961456e-05, "loss": 0.19036224484443665, "num_input_tokens_seen": 703934, "step": 668, "train_runtime": 1872.6909, "train_tokens_per_second": 375.894 }, { "epoch": 0.2859279837589486, "grad_norm": 2.3026533126831055, "learning_rate": 1.4321199143468951e-05, "loss": 0.09540949016809464, "num_input_tokens_seen": 704658, "step": 669, "train_runtime": 1874.7506, "train_tokens_per_second": 375.868 }, { "epoch": 0.28635537984827436, "grad_norm": 1.9528226852416992, "learning_rate": 1.4312633832976445e-05, "loss": 0.12443667650222778, "num_input_tokens_seen": 706188, "step": 670, "train_runtime": 1877.034, "train_tokens_per_second": 376.225 }, { "epoch": 0.28678277593760015, "grad_norm": 1.6549339294433594, "learning_rate": 1.430406852248394e-05, "loss": 0.10252031683921814, "num_input_tokens_seen": 707622, "step": 671, "train_runtime": 1879.2611, "train_tokens_per_second": 376.543 }, { "epoch": 0.28721017202692595, "grad_norm": 3.7874042987823486, "learning_rate": 1.4295503211991436e-05, "loss": 0.18935301899909973, "num_input_tokens_seen": 708358, "step": 672, "train_runtime": 1881.3531, "train_tokens_per_second": 376.515 }, { "epoch": 0.28763756811625174, "grad_norm": 1.6390641927719116, "learning_rate": 1.428693790149893e-05, "loss": 0.10724534094333649, "num_input_tokens_seen": 709372, "step": 673, "train_runtime": 1883.511, "train_tokens_per_second": 376.622 }, { "epoch": 0.28806496420557753, "grad_norm": 3.7022180557250977, "learning_rate": 1.4278372591006424e-05, "loss": 0.10025076568126678, "num_input_tokens_seen": 709858, "step": 674, "train_runtime": 1885.5114, "train_tokens_per_second": 376.48 }, { "epoch": 0.2884923602949033, "grad_norm": 2.573812961578369, "learning_rate": 1.4269807280513918e-05, "loss": 0.11544390767812729, "num_input_tokens_seen": 710642, "step": 675, "train_runtime": 1887.6045, "train_tokens_per_second": 376.478 }, { "epoch": 0.28891975638422907, "grad_norm": 1.8841919898986816, "learning_rate": 1.4261241970021415e-05, "loss": 0.13746702671051025, "num_input_tokens_seen": 711836, "step": 676, "train_runtime": 1889.7859, "train_tokens_per_second": 376.675 }, { "epoch": 0.28934715247355486, "grad_norm": 2.5100719928741455, "learning_rate": 1.425267665952891e-05, "loss": 0.14079850912094116, "num_input_tokens_seen": 712588, "step": 677, "train_runtime": 1891.8438, "train_tokens_per_second": 376.663 }, { "epoch": 0.28977454856288065, "grad_norm": 2.5519168376922607, "learning_rate": 1.4244111349036404e-05, "loss": 0.14881883561611176, "num_input_tokens_seen": 713650, "step": 678, "train_runtime": 1893.9969, "train_tokens_per_second": 376.796 }, { "epoch": 0.29020194465220644, "grad_norm": 3.0886623859405518, "learning_rate": 1.42355460385439e-05, "loss": 0.18498066067695618, "num_input_tokens_seen": 714694, "step": 679, "train_runtime": 1896.1599, "train_tokens_per_second": 376.917 }, { "epoch": 0.29062934074153224, "grad_norm": 1.4010649919509888, "learning_rate": 1.4226980728051394e-05, "loss": 0.07827949523925781, "num_input_tokens_seen": 715872, "step": 680, "train_runtime": 1898.3205, "train_tokens_per_second": 377.108 }, { "epoch": 0.291056736830858, "grad_norm": 2.8680427074432373, "learning_rate": 1.4218415417558888e-05, "loss": 0.18841995298862457, "num_input_tokens_seen": 716616, "step": 681, "train_runtime": 1900.4378, "train_tokens_per_second": 377.079 }, { "epoch": 0.29148413292018377, "grad_norm": 2.337132692337036, "learning_rate": 1.4209850107066383e-05, "loss": 0.14060130715370178, "num_input_tokens_seen": 717396, "step": 682, "train_runtime": 1902.5506, "train_tokens_per_second": 377.071 }, { "epoch": 0.29191152900950956, "grad_norm": 2.3525822162628174, "learning_rate": 1.4201284796573877e-05, "loss": 0.14918434619903564, "num_input_tokens_seen": 718324, "step": 683, "train_runtime": 1904.6647, "train_tokens_per_second": 377.139 }, { "epoch": 0.29233892509883536, "grad_norm": 4.944980621337891, "learning_rate": 1.4192719486081372e-05, "loss": 0.16028907895088196, "num_input_tokens_seen": 719262, "step": 684, "train_runtime": 1906.7883, "train_tokens_per_second": 377.211 }, { "epoch": 0.29276632118816115, "grad_norm": 2.611039876937866, "learning_rate": 1.4184154175588867e-05, "loss": 0.10495640337467194, "num_input_tokens_seen": 720384, "step": 685, "train_runtime": 1908.9745, "train_tokens_per_second": 377.367 }, { "epoch": 0.2931937172774869, "grad_norm": 2.5478999614715576, "learning_rate": 1.4175588865096361e-05, "loss": 0.1308320164680481, "num_input_tokens_seen": 721052, "step": 686, "train_runtime": 1910.9937, "train_tokens_per_second": 377.318 }, { "epoch": 0.2936211133668127, "grad_norm": 1.5950946807861328, "learning_rate": 1.4167023554603856e-05, "loss": 0.06269238889217377, "num_input_tokens_seen": 721936, "step": 687, "train_runtime": 1913.1088, "train_tokens_per_second": 377.363 }, { "epoch": 0.2940485094561385, "grad_norm": 2.833967447280884, "learning_rate": 1.415845824411135e-05, "loss": 0.2123396098613739, "num_input_tokens_seen": 722674, "step": 688, "train_runtime": 1915.1888, "train_tokens_per_second": 377.338 }, { "epoch": 0.29447590554546427, "grad_norm": 2.099252462387085, "learning_rate": 1.4149892933618845e-05, "loss": 0.1980723887681961, "num_input_tokens_seen": 723766, "step": 689, "train_runtime": 1917.366, "train_tokens_per_second": 377.479 }, { "epoch": 0.29490330163479006, "grad_norm": 1.4324655532836914, "learning_rate": 1.414132762312634e-05, "loss": 0.11713645607233047, "num_input_tokens_seen": 725872, "step": 690, "train_runtime": 1919.7768, "train_tokens_per_second": 378.102 }, { "epoch": 0.2953306977241158, "grad_norm": 1.695764183998108, "learning_rate": 1.4132762312633834e-05, "loss": 0.10431049764156342, "num_input_tokens_seen": 726914, "step": 691, "train_runtime": 1934.9105, "train_tokens_per_second": 375.684 }, { "epoch": 0.2957580938134416, "grad_norm": 2.0348596572875977, "learning_rate": 1.412419700214133e-05, "loss": 0.19648054242134094, "num_input_tokens_seen": 728272, "step": 692, "train_runtime": 1937.1537, "train_tokens_per_second": 375.95 }, { "epoch": 0.2961854899027674, "grad_norm": 2.2879536151885986, "learning_rate": 1.4115631691648823e-05, "loss": 0.11473573744297028, "num_input_tokens_seen": 729172, "step": 693, "train_runtime": 1939.325, "train_tokens_per_second": 375.993 }, { "epoch": 0.2966128859920932, "grad_norm": 2.5072267055511475, "learning_rate": 1.4107066381156318e-05, "loss": 0.15191859006881714, "num_input_tokens_seen": 730106, "step": 694, "train_runtime": 1941.4493, "train_tokens_per_second": 376.062 }, { "epoch": 0.29704028208141897, "grad_norm": 1.7680737972259521, "learning_rate": 1.4098501070663812e-05, "loss": 0.08820414543151855, "num_input_tokens_seen": 731538, "step": 695, "train_runtime": 1943.7077, "train_tokens_per_second": 376.362 }, { "epoch": 0.29746767817074476, "grad_norm": 1.741761326789856, "learning_rate": 1.4089935760171307e-05, "loss": 0.09984119981527328, "num_input_tokens_seen": 732798, "step": 696, "train_runtime": 1945.978, "train_tokens_per_second": 376.571 }, { "epoch": 0.2978950742600705, "grad_norm": 1.7765142917633057, "learning_rate": 1.4081370449678802e-05, "loss": 0.12116514891386032, "num_input_tokens_seen": 734214, "step": 697, "train_runtime": 1948.2195, "train_tokens_per_second": 376.864 }, { "epoch": 0.2983224703493963, "grad_norm": 3.0526561737060547, "learning_rate": 1.4072805139186296e-05, "loss": 0.20111225545406342, "num_input_tokens_seen": 735190, "step": 698, "train_runtime": 1950.3762, "train_tokens_per_second": 376.948 }, { "epoch": 0.2987498664387221, "grad_norm": 2.8217875957489014, "learning_rate": 1.4064239828693791e-05, "loss": 0.17018066346645355, "num_input_tokens_seen": 736072, "step": 699, "train_runtime": 1952.4619, "train_tokens_per_second": 376.997 }, { "epoch": 0.2991772625280479, "grad_norm": 1.7569355964660645, "learning_rate": 1.4055674518201285e-05, "loss": 0.10083118081092834, "num_input_tokens_seen": 737138, "step": 700, "train_runtime": 1954.6586, "train_tokens_per_second": 377.119 }, { "epoch": 0.2996046586173737, "grad_norm": 2.323338270187378, "learning_rate": 1.404710920770878e-05, "loss": 0.10599065572023392, "num_input_tokens_seen": 737838, "step": 701, "train_runtime": 1956.7468, "train_tokens_per_second": 377.074 }, { "epoch": 0.3000320547066994, "grad_norm": 2.171600103378296, "learning_rate": 1.4038543897216275e-05, "loss": 0.11985621601343155, "num_input_tokens_seen": 738804, "step": 702, "train_runtime": 1958.8846, "train_tokens_per_second": 377.155 }, { "epoch": 0.3000320547066994, "eval_loss": 0.510190486907959, "eval_runtime": 58.0123, "eval_samples_per_second": 17.203, "eval_steps_per_second": 8.602, "num_input_tokens_seen": 738804, "step": 702 }, { "epoch": 0.3004594507960252, "grad_norm": 2.1922428607940674, "learning_rate": 1.4029978586723769e-05, "loss": 0.16008763015270233, "num_input_tokens_seen": 740052, "step": 703, "train_runtime": 2019.1936, "train_tokens_per_second": 366.509 }, { "epoch": 0.300886846885351, "grad_norm": 2.2467708587646484, "learning_rate": 1.4021413276231264e-05, "loss": 0.15313953161239624, "num_input_tokens_seen": 741284, "step": 704, "train_runtime": 2021.4311, "train_tokens_per_second": 366.712 }, { "epoch": 0.3013142429746768, "grad_norm": 1.8962408304214478, "learning_rate": 1.4012847965738758e-05, "loss": 0.12336666882038116, "num_input_tokens_seen": 742224, "step": 705, "train_runtime": 2023.5746, "train_tokens_per_second": 366.789 }, { "epoch": 0.3017416390640026, "grad_norm": 3.211893320083618, "learning_rate": 1.4004282655246253e-05, "loss": 0.18593370914459229, "num_input_tokens_seen": 743002, "step": 706, "train_runtime": 2025.7584, "train_tokens_per_second": 366.777 }, { "epoch": 0.3021690351533283, "grad_norm": 1.7842845916748047, "learning_rate": 1.3995717344753748e-05, "loss": 0.11546893417835236, "num_input_tokens_seen": 744234, "step": 707, "train_runtime": 2027.96, "train_tokens_per_second": 366.987 }, { "epoch": 0.3025964312426541, "grad_norm": 1.9092752933502197, "learning_rate": 1.3987152034261242e-05, "loss": 0.07692892849445343, "num_input_tokens_seen": 744844, "step": 708, "train_runtime": 2030.0846, "train_tokens_per_second": 366.903 }, { "epoch": 0.3030238273319799, "grad_norm": 2.434123992919922, "learning_rate": 1.3978586723768737e-05, "loss": 0.1410711109638214, "num_input_tokens_seen": 745712, "step": 709, "train_runtime": 2032.1975, "train_tokens_per_second": 366.949 }, { "epoch": 0.3034512234213057, "grad_norm": 3.0329978466033936, "learning_rate": 1.3970021413276234e-05, "loss": 0.17612597346305847, "num_input_tokens_seen": 746854, "step": 710, "train_runtime": 2034.4066, "train_tokens_per_second": 367.111 }, { "epoch": 0.3038786195106315, "grad_norm": 2.7899532318115234, "learning_rate": 1.3961456102783728e-05, "loss": 0.16027897596359253, "num_input_tokens_seen": 747604, "step": 711, "train_runtime": 2036.5038, "train_tokens_per_second": 367.102 }, { "epoch": 0.30430601559995724, "grad_norm": 1.598313570022583, "learning_rate": 1.3952890792291223e-05, "loss": 0.0847926139831543, "num_input_tokens_seen": 748358, "step": 712, "train_runtime": 2038.5998, "train_tokens_per_second": 367.094 }, { "epoch": 0.30473341168928303, "grad_norm": 2.8482844829559326, "learning_rate": 1.3944325481798717e-05, "loss": 0.15793046355247498, "num_input_tokens_seen": 749440, "step": 713, "train_runtime": 2040.7582, "train_tokens_per_second": 367.236 }, { "epoch": 0.3051608077786088, "grad_norm": 2.943387985229492, "learning_rate": 1.3935760171306212e-05, "loss": 0.16277006268501282, "num_input_tokens_seen": 750418, "step": 714, "train_runtime": 2042.9125, "train_tokens_per_second": 367.328 }, { "epoch": 0.3055882038679346, "grad_norm": 1.8870313167572021, "learning_rate": 1.3927194860813707e-05, "loss": 0.1313779503107071, "num_input_tokens_seen": 751646, "step": 715, "train_runtime": 2045.0793, "train_tokens_per_second": 367.539 }, { "epoch": 0.3060155999572604, "grad_norm": 2.739898920059204, "learning_rate": 1.39186295503212e-05, "loss": 0.15471625328063965, "num_input_tokens_seen": 752600, "step": 716, "train_runtime": 2047.2288, "train_tokens_per_second": 367.619 }, { "epoch": 0.30644299604658615, "grad_norm": 3.446117877960205, "learning_rate": 1.3910064239828696e-05, "loss": 0.23055478930473328, "num_input_tokens_seen": 753414, "step": 717, "train_runtime": 2049.3513, "train_tokens_per_second": 367.635 }, { "epoch": 0.30687039213591194, "grad_norm": 2.8714966773986816, "learning_rate": 1.390149892933619e-05, "loss": 0.1466040313243866, "num_input_tokens_seen": 754518, "step": 718, "train_runtime": 2051.5013, "train_tokens_per_second": 367.788 }, { "epoch": 0.30729778822523773, "grad_norm": 1.8891358375549316, "learning_rate": 1.3892933618843685e-05, "loss": 0.11850430071353912, "num_input_tokens_seen": 755588, "step": 719, "train_runtime": 2053.6493, "train_tokens_per_second": 367.925 }, { "epoch": 0.3077251843145635, "grad_norm": 2.7600414752960205, "learning_rate": 1.388436830835118e-05, "loss": 0.09389976412057877, "num_input_tokens_seen": 756476, "step": 720, "train_runtime": 2055.7764, "train_tokens_per_second": 367.976 }, { "epoch": 0.3081525804038893, "grad_norm": 1.9070271253585815, "learning_rate": 1.3875802997858674e-05, "loss": 0.0801122635602951, "num_input_tokens_seen": 757168, "step": 721, "train_runtime": 2071.1339, "train_tokens_per_second": 365.581 }, { "epoch": 0.3085799764932151, "grad_norm": 2.241255044937134, "learning_rate": 1.3867237687366169e-05, "loss": 0.1453324407339096, "num_input_tokens_seen": 758160, "step": 722, "train_runtime": 2073.2885, "train_tokens_per_second": 365.68 }, { "epoch": 0.30900737258254085, "grad_norm": 2.7590410709381104, "learning_rate": 1.3858672376873663e-05, "loss": 0.11476199328899384, "num_input_tokens_seen": 758940, "step": 723, "train_runtime": 2075.3622, "train_tokens_per_second": 365.69 }, { "epoch": 0.30943476867186664, "grad_norm": 1.64671790599823, "learning_rate": 1.3850107066381158e-05, "loss": 0.11244902014732361, "num_input_tokens_seen": 760078, "step": 724, "train_runtime": 2077.5823, "train_tokens_per_second": 365.847 }, { "epoch": 0.30986216476119244, "grad_norm": 2.1604344844818115, "learning_rate": 1.3841541755888651e-05, "loss": 0.10852448642253876, "num_input_tokens_seen": 761064, "step": 725, "train_runtime": 2079.7598, "train_tokens_per_second": 365.938 }, { "epoch": 0.31028956085051823, "grad_norm": 1.809300422668457, "learning_rate": 1.3832976445396147e-05, "loss": 0.1228833794593811, "num_input_tokens_seen": 762414, "step": 726, "train_runtime": 2081.9733, "train_tokens_per_second": 366.198 }, { "epoch": 0.310716956939844, "grad_norm": 2.001737356185913, "learning_rate": 1.3824411134903642e-05, "loss": 0.16599349677562714, "num_input_tokens_seen": 763692, "step": 727, "train_runtime": 2084.1395, "train_tokens_per_second": 366.43 }, { "epoch": 0.31114435302916976, "grad_norm": 2.912590742111206, "learning_rate": 1.3815845824411136e-05, "loss": 0.16752870380878448, "num_input_tokens_seen": 764738, "step": 728, "train_runtime": 2086.2942, "train_tokens_per_second": 366.553 }, { "epoch": 0.31157174911849556, "grad_norm": 2.347052812576294, "learning_rate": 1.380728051391863e-05, "loss": 0.12379346787929535, "num_input_tokens_seen": 766040, "step": 729, "train_runtime": 2088.4893, "train_tokens_per_second": 366.791 }, { "epoch": 0.31199914520782135, "grad_norm": 4.7478485107421875, "learning_rate": 1.3798715203426124e-05, "loss": 0.1677762120962143, "num_input_tokens_seen": 766918, "step": 730, "train_runtime": 2090.6408, "train_tokens_per_second": 366.834 }, { "epoch": 0.31242654129714714, "grad_norm": 2.88657283782959, "learning_rate": 1.379014989293362e-05, "loss": 0.08801712095737457, "num_input_tokens_seen": 767498, "step": 731, "train_runtime": 2092.6821, "train_tokens_per_second": 366.753 }, { "epoch": 0.31285393738647294, "grad_norm": 1.9307842254638672, "learning_rate": 1.3781584582441115e-05, "loss": 0.11593140661716461, "num_input_tokens_seen": 768748, "step": 732, "train_runtime": 2095.0139, "train_tokens_per_second": 366.942 }, { "epoch": 0.3132813334757987, "grad_norm": 1.8953204154968262, "learning_rate": 1.3773019271948609e-05, "loss": 0.11940370500087738, "num_input_tokens_seen": 769808, "step": 733, "train_runtime": 2097.2549, "train_tokens_per_second": 367.055 }, { "epoch": 0.31370872956512447, "grad_norm": 2.5668833255767822, "learning_rate": 1.3764453961456104e-05, "loss": 0.14816610515117645, "num_input_tokens_seen": 770774, "step": 734, "train_runtime": 2099.3714, "train_tokens_per_second": 367.145 }, { "epoch": 0.31413612565445026, "grad_norm": 2.624237298965454, "learning_rate": 1.3755888650963597e-05, "loss": 0.12266150116920471, "num_input_tokens_seen": 771764, "step": 735, "train_runtime": 2101.5157, "train_tokens_per_second": 367.242 }, { "epoch": 0.31456352174377605, "grad_norm": 6.235272407531738, "learning_rate": 1.3747323340471093e-05, "loss": 0.14392046630382538, "num_input_tokens_seen": 773010, "step": 736, "train_runtime": 2103.7358, "train_tokens_per_second": 367.446 }, { "epoch": 0.31499091783310185, "grad_norm": 2.490058183670044, "learning_rate": 1.3738758029978588e-05, "loss": 0.13403531908988953, "num_input_tokens_seen": 773894, "step": 737, "train_runtime": 2105.8501, "train_tokens_per_second": 367.497 }, { "epoch": 0.3154183139224276, "grad_norm": 1.781411051750183, "learning_rate": 1.3730192719486082e-05, "loss": 0.1307726800441742, "num_input_tokens_seen": 775084, "step": 738, "train_runtime": 2108.0468, "train_tokens_per_second": 367.679 }, { "epoch": 0.3158457100117534, "grad_norm": 2.6963393688201904, "learning_rate": 1.3721627408993577e-05, "loss": 0.15336059033870697, "num_input_tokens_seen": 776132, "step": 739, "train_runtime": 2110.1949, "train_tokens_per_second": 367.801 }, { "epoch": 0.31627310610107917, "grad_norm": 3.1183509826660156, "learning_rate": 1.371306209850107e-05, "loss": 0.12298072129487991, "num_input_tokens_seen": 776914, "step": 740, "train_runtime": 2112.2721, "train_tokens_per_second": 367.81 }, { "epoch": 0.31670050219040496, "grad_norm": 2.0433759689331055, "learning_rate": 1.3704496788008566e-05, "loss": 0.09010043740272522, "num_input_tokens_seen": 777732, "step": 741, "train_runtime": 2114.3313, "train_tokens_per_second": 367.838 }, { "epoch": 0.31712789827973076, "grad_norm": 2.5038232803344727, "learning_rate": 1.3695931477516061e-05, "loss": 0.10021007061004639, "num_input_tokens_seen": 778950, "step": 742, "train_runtime": 2116.5243, "train_tokens_per_second": 368.033 }, { "epoch": 0.3175552943690565, "grad_norm": 2.5027756690979004, "learning_rate": 1.3687366167023555e-05, "loss": 0.18917903304100037, "num_input_tokens_seen": 780304, "step": 743, "train_runtime": 2118.8, "train_tokens_per_second": 368.276 }, { "epoch": 0.3179826904583823, "grad_norm": 2.948503017425537, "learning_rate": 1.367880085653105e-05, "loss": 0.20733138918876648, "num_input_tokens_seen": 781224, "step": 744, "train_runtime": 2120.9459, "train_tokens_per_second": 368.338 }, { "epoch": 0.3184100865477081, "grad_norm": 3.159881114959717, "learning_rate": 1.3670235546038547e-05, "loss": 0.1322723925113678, "num_input_tokens_seen": 782016, "step": 745, "train_runtime": 2123.083, "train_tokens_per_second": 368.34 }, { "epoch": 0.3188374826370339, "grad_norm": 1.7335364818572998, "learning_rate": 1.366167023554604e-05, "loss": 0.10835819691419601, "num_input_tokens_seen": 783148, "step": 746, "train_runtime": 2125.2787, "train_tokens_per_second": 368.492 }, { "epoch": 0.31926487872635967, "grad_norm": 2.2973098754882812, "learning_rate": 1.3653104925053536e-05, "loss": 0.09291332215070724, "num_input_tokens_seen": 784318, "step": 747, "train_runtime": 2127.5169, "train_tokens_per_second": 368.654 }, { "epoch": 0.31969227481568546, "grad_norm": 3.436255693435669, "learning_rate": 1.364453961456103e-05, "loss": 0.13755182921886444, "num_input_tokens_seen": 785114, "step": 748, "train_runtime": 2129.6393, "train_tokens_per_second": 368.661 }, { "epoch": 0.3201196709050112, "grad_norm": 2.3020994663238525, "learning_rate": 1.3635974304068524e-05, "loss": 0.12800580263137817, "num_input_tokens_seen": 786298, "step": 749, "train_runtime": 2131.8349, "train_tokens_per_second": 368.836 }, { "epoch": 0.320547066994337, "grad_norm": 1.9654093980789185, "learning_rate": 1.362740899357602e-05, "loss": 0.10919762402772903, "num_input_tokens_seen": 787154, "step": 750, "train_runtime": 2133.9312, "train_tokens_per_second": 368.875 }, { "epoch": 0.3209744630836628, "grad_norm": 2.134575843811035, "learning_rate": 1.3618843683083513e-05, "loss": 0.1596805453300476, "num_input_tokens_seen": 788344, "step": 751, "train_runtime": 2149.3428, "train_tokens_per_second": 366.784 }, { "epoch": 0.3214018591729886, "grad_norm": 3.264194965362549, "learning_rate": 1.3610278372591009e-05, "loss": 0.15986016392707825, "num_input_tokens_seen": 789102, "step": 752, "train_runtime": 2151.5157, "train_tokens_per_second": 366.766 }, { "epoch": 0.3218292552623144, "grad_norm": 1.9836798906326294, "learning_rate": 1.3601713062098502e-05, "loss": 0.1384914517402649, "num_input_tokens_seen": 789858, "step": 753, "train_runtime": 2153.651, "train_tokens_per_second": 366.753 }, { "epoch": 0.3222566513516401, "grad_norm": 2.872135639190674, "learning_rate": 1.3593147751605997e-05, "loss": 0.15193700790405273, "num_input_tokens_seen": 790640, "step": 754, "train_runtime": 2155.7256, "train_tokens_per_second": 366.763 }, { "epoch": 0.3226840474409659, "grad_norm": 1.6906919479370117, "learning_rate": 1.3584582441113491e-05, "loss": 0.13117428123950958, "num_input_tokens_seen": 792164, "step": 755, "train_runtime": 2158.0063, "train_tokens_per_second": 367.081 }, { "epoch": 0.3231114435302917, "grad_norm": 2.4095849990844727, "learning_rate": 1.3576017130620986e-05, "loss": 0.16868722438812256, "num_input_tokens_seen": 793302, "step": 756, "train_runtime": 2160.2492, "train_tokens_per_second": 367.227 }, { "epoch": 0.3235388396196175, "grad_norm": 1.966367244720459, "learning_rate": 1.3567451820128482e-05, "loss": 0.07120862603187561, "num_input_tokens_seen": 794362, "step": 757, "train_runtime": 2162.4076, "train_tokens_per_second": 367.351 }, { "epoch": 0.3239662357089433, "grad_norm": 2.536763906478882, "learning_rate": 1.3558886509635975e-05, "loss": 0.1624632477760315, "num_input_tokens_seen": 795272, "step": 758, "train_runtime": 2164.5541, "train_tokens_per_second": 367.407 }, { "epoch": 0.324393631798269, "grad_norm": 2.2039806842803955, "learning_rate": 1.355032119914347e-05, "loss": 0.10303384065628052, "num_input_tokens_seen": 796026, "step": 759, "train_runtime": 2166.6513, "train_tokens_per_second": 367.399 }, { "epoch": 0.3248210278875948, "grad_norm": 1.6758956909179688, "learning_rate": 1.3541755888650964e-05, "loss": 0.1323976069688797, "num_input_tokens_seen": 797736, "step": 760, "train_runtime": 2168.977, "train_tokens_per_second": 367.794 }, { "epoch": 0.3252484239769206, "grad_norm": 2.06227445602417, "learning_rate": 1.353319057815846e-05, "loss": 0.11057798564434052, "num_input_tokens_seen": 798690, "step": 761, "train_runtime": 2171.4022, "train_tokens_per_second": 367.822 }, { "epoch": 0.3256758200662464, "grad_norm": 2.2499444484710693, "learning_rate": 1.3524625267665955e-05, "loss": 0.19061864912509918, "num_input_tokens_seen": 799628, "step": 762, "train_runtime": 2173.7393, "train_tokens_per_second": 367.858 }, { "epoch": 0.3261032161555722, "grad_norm": 1.8146963119506836, "learning_rate": 1.3516059957173448e-05, "loss": 0.11951874196529388, "num_input_tokens_seen": 800854, "step": 763, "train_runtime": 2175.9453, "train_tokens_per_second": 368.049 }, { "epoch": 0.32653061224489793, "grad_norm": 2.1884496212005615, "learning_rate": 1.3507494646680943e-05, "loss": 0.11111605912446976, "num_input_tokens_seen": 801748, "step": 764, "train_runtime": 2178.0772, "train_tokens_per_second": 368.099 }, { "epoch": 0.3269580083342237, "grad_norm": 2.0636422634124756, "learning_rate": 1.3498929336188437e-05, "loss": 0.12108628451824188, "num_input_tokens_seen": 802744, "step": 765, "train_runtime": 2180.2348, "train_tokens_per_second": 368.192 }, { "epoch": 0.3273854044235495, "grad_norm": 1.8975743055343628, "learning_rate": 1.3490364025695932e-05, "loss": 0.0649486631155014, "num_input_tokens_seen": 803590, "step": 766, "train_runtime": 2182.3315, "train_tokens_per_second": 368.225 }, { "epoch": 0.3278128005128753, "grad_norm": 2.349619150161743, "learning_rate": 1.3481798715203428e-05, "loss": 0.11989253759384155, "num_input_tokens_seen": 804376, "step": 767, "train_runtime": 2184.4579, "train_tokens_per_second": 368.227 }, { "epoch": 0.3282401966022011, "grad_norm": 1.6214401721954346, "learning_rate": 1.3473233404710921e-05, "loss": 0.11933603882789612, "num_input_tokens_seen": 805452, "step": 768, "train_runtime": 2186.6449, "train_tokens_per_second": 368.351 }, { "epoch": 0.3286675926915269, "grad_norm": 2.1668083667755127, "learning_rate": 1.3464668094218416e-05, "loss": 0.180108442902565, "num_input_tokens_seen": 806856, "step": 769, "train_runtime": 2188.8941, "train_tokens_per_second": 368.614 }, { "epoch": 0.32909498878085264, "grad_norm": 2.6501636505126953, "learning_rate": 1.345610278372591e-05, "loss": 0.1509145051240921, "num_input_tokens_seen": 807632, "step": 770, "train_runtime": 2190.9876, "train_tokens_per_second": 368.616 }, { "epoch": 0.32952238487017843, "grad_norm": 2.1489310264587402, "learning_rate": 1.3447537473233405e-05, "loss": 0.11179110407829285, "num_input_tokens_seen": 809556, "step": 771, "train_runtime": 2193.3574, "train_tokens_per_second": 369.094 }, { "epoch": 0.3299497809595042, "grad_norm": 2.5121138095855713, "learning_rate": 1.34389721627409e-05, "loss": 0.13696178793907166, "num_input_tokens_seen": 810648, "step": 772, "train_runtime": 2195.5295, "train_tokens_per_second": 369.227 }, { "epoch": 0.33037717704883, "grad_norm": 2.18746018409729, "learning_rate": 1.3430406852248394e-05, "loss": 0.117298424243927, "num_input_tokens_seen": 811464, "step": 773, "train_runtime": 2197.631, "train_tokens_per_second": 369.245 }, { "epoch": 0.3308045731381558, "grad_norm": 2.4381191730499268, "learning_rate": 1.342184154175589e-05, "loss": 0.1251356452703476, "num_input_tokens_seen": 812348, "step": 774, "train_runtime": 2199.7416, "train_tokens_per_second": 369.292 }, { "epoch": 0.33123196922748155, "grad_norm": 1.8118752241134644, "learning_rate": 1.3413276231263383e-05, "loss": 0.10888133198022842, "num_input_tokens_seen": 813656, "step": 775, "train_runtime": 2202.0171, "train_tokens_per_second": 369.505 }, { "epoch": 0.33165936531680734, "grad_norm": 2.366809368133545, "learning_rate": 1.3404710920770878e-05, "loss": 0.14520832896232605, "num_input_tokens_seen": 814622, "step": 776, "train_runtime": 2204.1903, "train_tokens_per_second": 369.579 }, { "epoch": 0.33208676140613314, "grad_norm": 2.3347342014312744, "learning_rate": 1.3396145610278372e-05, "loss": 0.1669357419013977, "num_input_tokens_seen": 815802, "step": 777, "train_runtime": 2206.39, "train_tokens_per_second": 369.745 }, { "epoch": 0.33251415749545893, "grad_norm": 2.4885172843933105, "learning_rate": 1.3387580299785867e-05, "loss": 0.13153831660747528, "num_input_tokens_seen": 816674, "step": 778, "train_runtime": 2208.5061, "train_tokens_per_second": 369.786 }, { "epoch": 0.3329415535847847, "grad_norm": 1.6821556091308594, "learning_rate": 1.3379014989293364e-05, "loss": 0.12667052447795868, "num_input_tokens_seen": 817948, "step": 779, "train_runtime": 2210.7245, "train_tokens_per_second": 369.991 }, { "epoch": 0.33336894967411046, "grad_norm": 1.956593632698059, "learning_rate": 1.337044967880086e-05, "loss": 0.12548109889030457, "num_input_tokens_seen": 819274, "step": 780, "train_runtime": 2212.9082, "train_tokens_per_second": 370.225 }, { "epoch": 0.33379634576343625, "grad_norm": 2.7756547927856445, "learning_rate": 1.3361884368308353e-05, "loss": 0.14985978603363037, "num_input_tokens_seen": 820162, "step": 781, "train_runtime": 2229.122, "train_tokens_per_second": 367.931 }, { "epoch": 0.33422374185276205, "grad_norm": 3.177536964416504, "learning_rate": 1.3353319057815848e-05, "loss": 0.2057100236415863, "num_input_tokens_seen": 820874, "step": 782, "train_runtime": 2231.23, "train_tokens_per_second": 367.902 }, { "epoch": 0.33465113794208784, "grad_norm": 2.3017020225524902, "learning_rate": 1.3344753747323342e-05, "loss": 0.1477176547050476, "num_input_tokens_seen": 822422, "step": 783, "train_runtime": 2233.5232, "train_tokens_per_second": 368.217 }, { "epoch": 0.33507853403141363, "grad_norm": 1.2898216247558594, "learning_rate": 1.3336188436830837e-05, "loss": 0.06120645999908447, "num_input_tokens_seen": 824162, "step": 784, "train_runtime": 2235.9328, "train_tokens_per_second": 368.599 }, { "epoch": 0.33550593012073937, "grad_norm": 2.308602809906006, "learning_rate": 1.332762312633833e-05, "loss": 0.12190292775630951, "num_input_tokens_seen": 825056, "step": 785, "train_runtime": 2238.0858, "train_tokens_per_second": 368.644 }, { "epoch": 0.33593332621006516, "grad_norm": 2.5072407722473145, "learning_rate": 1.3319057815845826e-05, "loss": 0.17140378057956696, "num_input_tokens_seen": 826424, "step": 786, "train_runtime": 2240.3306, "train_tokens_per_second": 368.885 }, { "epoch": 0.33636072229939096, "grad_norm": 2.389327049255371, "learning_rate": 1.3310492505353321e-05, "loss": 0.12005665898323059, "num_input_tokens_seen": 827710, "step": 787, "train_runtime": 2242.5895, "train_tokens_per_second": 369.087 }, { "epoch": 0.33678811838871675, "grad_norm": 1.7238560914993286, "learning_rate": 1.3301927194860815e-05, "loss": 0.09626015275716782, "num_input_tokens_seen": 828636, "step": 788, "train_runtime": 2244.749, "train_tokens_per_second": 369.144 }, { "epoch": 0.33721551447804254, "grad_norm": 2.4804675579071045, "learning_rate": 1.329336188436831e-05, "loss": 0.1318286955356598, "num_input_tokens_seen": 829302, "step": 789, "train_runtime": 2246.8169, "train_tokens_per_second": 369.101 }, { "epoch": 0.3376429105673683, "grad_norm": 4.671977519989014, "learning_rate": 1.3284796573875804e-05, "loss": 0.1203911304473877, "num_input_tokens_seen": 829892, "step": 790, "train_runtime": 2248.9158, "train_tokens_per_second": 369.019 }, { "epoch": 0.3380703066566941, "grad_norm": 2.4786596298217773, "learning_rate": 1.3276231263383299e-05, "loss": 0.14200855791568756, "num_input_tokens_seen": 830962, "step": 791, "train_runtime": 2251.1883, "train_tokens_per_second": 369.122 }, { "epoch": 0.33849770274601987, "grad_norm": 1.7750545740127563, "learning_rate": 1.3267665952890794e-05, "loss": 0.09182557463645935, "num_input_tokens_seen": 831794, "step": 792, "train_runtime": 2253.3395, "train_tokens_per_second": 369.138 }, { "epoch": 0.33892509883534566, "grad_norm": 2.7021842002868652, "learning_rate": 1.3259100642398288e-05, "loss": 0.06427270174026489, "num_input_tokens_seen": 832656, "step": 793, "train_runtime": 2255.4249, "train_tokens_per_second": 369.179 }, { "epoch": 0.33935249492467146, "grad_norm": 1.5075496435165405, "learning_rate": 1.3250535331905783e-05, "loss": 0.09556608647108078, "num_input_tokens_seen": 834142, "step": 794, "train_runtime": 2257.6939, "train_tokens_per_second": 369.466 }, { "epoch": 0.33977989101399725, "grad_norm": 2.787081003189087, "learning_rate": 1.3241970021413277e-05, "loss": 0.16105836629867554, "num_input_tokens_seen": 834814, "step": 795, "train_runtime": 2259.742, "train_tokens_per_second": 369.429 }, { "epoch": 0.340207287103323, "grad_norm": 2.8966727256774902, "learning_rate": 1.3233404710920772e-05, "loss": 0.13476288318634033, "num_input_tokens_seen": 835578, "step": 796, "train_runtime": 2261.8383, "train_tokens_per_second": 369.424 }, { "epoch": 0.3406346831926488, "grad_norm": 2.376763343811035, "learning_rate": 1.3224839400428267e-05, "loss": 0.10697012394666672, "num_input_tokens_seen": 836666, "step": 797, "train_runtime": 2264.0251, "train_tokens_per_second": 369.548 }, { "epoch": 0.3410620792819746, "grad_norm": 1.684907078742981, "learning_rate": 1.321627408993576e-05, "loss": 0.12375549972057343, "num_input_tokens_seen": 837820, "step": 798, "train_runtime": 2266.1997, "train_tokens_per_second": 369.703 }, { "epoch": 0.34148947537130037, "grad_norm": 3.0372512340545654, "learning_rate": 1.3207708779443256e-05, "loss": 0.1351826936006546, "num_input_tokens_seen": 838552, "step": 799, "train_runtime": 2268.3223, "train_tokens_per_second": 369.679 }, { "epoch": 0.34191687146062616, "grad_norm": 2.712702512741089, "learning_rate": 1.319914346895075e-05, "loss": 0.1467861831188202, "num_input_tokens_seen": 839356, "step": 800, "train_runtime": 2270.4387, "train_tokens_per_second": 369.689 }, { "epoch": 0.3423442675499519, "grad_norm": 4.493462085723877, "learning_rate": 1.3190578158458245e-05, "loss": 0.1468145251274109, "num_input_tokens_seen": 839988, "step": 801, "train_runtime": 2272.4955, "train_tokens_per_second": 369.632 }, { "epoch": 0.3427716636392777, "grad_norm": 2.101985454559326, "learning_rate": 1.318201284796574e-05, "loss": 0.14003314077854156, "num_input_tokens_seen": 840830, "step": 802, "train_runtime": 2274.5722, "train_tokens_per_second": 369.665 }, { "epoch": 0.3431990597286035, "grad_norm": 2.5873258113861084, "learning_rate": 1.3173447537473234e-05, "loss": 0.13785353302955627, "num_input_tokens_seen": 841794, "step": 803, "train_runtime": 2276.7517, "train_tokens_per_second": 369.735 }, { "epoch": 0.3436264558179293, "grad_norm": 2.3825364112854004, "learning_rate": 1.3164882226980729e-05, "loss": 0.08509097993373871, "num_input_tokens_seen": 842524, "step": 804, "train_runtime": 2278.8313, "train_tokens_per_second": 369.718 }, { "epoch": 0.34405385190725507, "grad_norm": 2.2430174350738525, "learning_rate": 1.3156316916488223e-05, "loss": 0.21838538348674774, "num_input_tokens_seen": 844360, "step": 805, "train_runtime": 2281.1977, "train_tokens_per_second": 370.139 }, { "epoch": 0.3444812479965808, "grad_norm": 2.4562454223632812, "learning_rate": 1.3147751605995718e-05, "loss": 0.24757874011993408, "num_input_tokens_seen": 846190, "step": 806, "train_runtime": 2283.5375, "train_tokens_per_second": 370.561 }, { "epoch": 0.3449086440859066, "grad_norm": 2.5909478664398193, "learning_rate": 1.3139186295503212e-05, "loss": 0.1682937741279602, "num_input_tokens_seen": 847272, "step": 807, "train_runtime": 2285.7163, "train_tokens_per_second": 370.681 }, { "epoch": 0.3453360401752324, "grad_norm": 2.206904649734497, "learning_rate": 1.3130620985010707e-05, "loss": 0.08844608813524246, "num_input_tokens_seen": 848110, "step": 808, "train_runtime": 2287.8349, "train_tokens_per_second": 370.704 }, { "epoch": 0.3457634362645582, "grad_norm": 1.9793843030929565, "learning_rate": 1.3122055674518202e-05, "loss": 0.13883069157600403, "num_input_tokens_seen": 849084, "step": 809, "train_runtime": 2289.9524, "train_tokens_per_second": 370.787 }, { "epoch": 0.346190832353884, "grad_norm": 1.5459498167037964, "learning_rate": 1.3113490364025696e-05, "loss": 0.06009524688124657, "num_input_tokens_seen": 850498, "step": 810, "train_runtime": 2292.2369, "train_tokens_per_second": 371.034 }, { "epoch": 0.3466182284432097, "grad_norm": 2.364461898803711, "learning_rate": 1.3104925053533191e-05, "loss": 0.1430809646844864, "num_input_tokens_seen": 851400, "step": 811, "train_runtime": 2307.1808, "train_tokens_per_second": 369.022 }, { "epoch": 0.3470456245325355, "grad_norm": 2.2134151458740234, "learning_rate": 1.3096359743040685e-05, "loss": 0.16521531343460083, "num_input_tokens_seen": 853148, "step": 812, "train_runtime": 2309.5563, "train_tokens_per_second": 369.399 }, { "epoch": 0.3474730206218613, "grad_norm": 2.4093143939971924, "learning_rate": 1.3087794432548182e-05, "loss": 0.13387048244476318, "num_input_tokens_seen": 853884, "step": 813, "train_runtime": 2311.6315, "train_tokens_per_second": 369.386 }, { "epoch": 0.3479004167111871, "grad_norm": 1.807502269744873, "learning_rate": 1.3079229122055677e-05, "loss": 0.1432010978460312, "num_input_tokens_seen": 855732, "step": 814, "train_runtime": 2313.9832, "train_tokens_per_second": 369.809 }, { "epoch": 0.3483278128005129, "grad_norm": 2.284177780151367, "learning_rate": 1.307066381156317e-05, "loss": 0.11023642122745514, "num_input_tokens_seen": 856782, "step": 815, "train_runtime": 2316.1194, "train_tokens_per_second": 369.921 }, { "epoch": 0.34875520888983863, "grad_norm": 2.2972710132598877, "learning_rate": 1.3062098501070666e-05, "loss": 0.1349591463804245, "num_input_tokens_seen": 857708, "step": 816, "train_runtime": 2318.2633, "train_tokens_per_second": 369.979 }, { "epoch": 0.3491826049791644, "grad_norm": 3.549760580062866, "learning_rate": 1.3053533190578161e-05, "loss": 0.1933775544166565, "num_input_tokens_seen": 858566, "step": 817, "train_runtime": 2320.4118, "train_tokens_per_second": 370.006 }, { "epoch": 0.3496100010684902, "grad_norm": 1.7501996755599976, "learning_rate": 1.3044967880085655e-05, "loss": 0.09176300466060638, "num_input_tokens_seen": 859472, "step": 818, "train_runtime": 2322.5072, "train_tokens_per_second": 370.062 }, { "epoch": 0.350037397157816, "grad_norm": 2.8815555572509766, "learning_rate": 1.303640256959315e-05, "loss": 0.15270407497882843, "num_input_tokens_seen": 860164, "step": 819, "train_runtime": 2324.5928, "train_tokens_per_second": 370.028 }, { "epoch": 0.3504647932471418, "grad_norm": 2.577434539794922, "learning_rate": 1.3027837259100643e-05, "loss": 0.15686242282390594, "num_input_tokens_seen": 861046, "step": 820, "train_runtime": 2326.6783, "train_tokens_per_second": 370.075 }, { "epoch": 0.3508921893364676, "grad_norm": 1.9763771295547485, "learning_rate": 1.3019271948608139e-05, "loss": 0.1506127268075943, "num_input_tokens_seen": 862272, "step": 821, "train_runtime": 2328.8998, "train_tokens_per_second": 370.249 }, { "epoch": 0.35131958542579333, "grad_norm": 2.162661552429199, "learning_rate": 1.3010706638115634e-05, "loss": 0.07952255755662918, "num_input_tokens_seen": 862822, "step": 822, "train_runtime": 2330.9876, "train_tokens_per_second": 370.153 }, { "epoch": 0.35174698151511913, "grad_norm": 2.170814275741577, "learning_rate": 1.3002141327623127e-05, "loss": 0.1116003468632698, "num_input_tokens_seen": 863764, "step": 823, "train_runtime": 2333.2459, "train_tokens_per_second": 370.198 }, { "epoch": 0.3521743776044449, "grad_norm": 1.9348992109298706, "learning_rate": 1.2993576017130623e-05, "loss": 0.09650216996669769, "num_input_tokens_seen": 864614, "step": 824, "train_runtime": 2335.3669, "train_tokens_per_second": 370.226 }, { "epoch": 0.3526017736937707, "grad_norm": 2.208080291748047, "learning_rate": 1.2985010706638116e-05, "loss": 0.11872360855340958, "num_input_tokens_seen": 865604, "step": 825, "train_runtime": 2337.4798, "train_tokens_per_second": 370.315 }, { "epoch": 0.3530291697830965, "grad_norm": 2.548844814300537, "learning_rate": 1.2976445396145612e-05, "loss": 0.18330249190330505, "num_input_tokens_seen": 866716, "step": 826, "train_runtime": 2339.6348, "train_tokens_per_second": 370.449 }, { "epoch": 0.35345656587242225, "grad_norm": 1.9747850894927979, "learning_rate": 1.2967880085653107e-05, "loss": 0.16249194741249084, "num_input_tokens_seen": 868744, "step": 827, "train_runtime": 2342.0394, "train_tokens_per_second": 370.935 }, { "epoch": 0.35388396196174804, "grad_norm": 2.2463526725769043, "learning_rate": 1.29593147751606e-05, "loss": 0.11855243146419525, "num_input_tokens_seen": 869632, "step": 828, "train_runtime": 2344.1756, "train_tokens_per_second": 370.976 }, { "epoch": 0.35431135805107383, "grad_norm": 3.0636091232299805, "learning_rate": 1.2950749464668096e-05, "loss": 0.1560877561569214, "num_input_tokens_seen": 870562, "step": 829, "train_runtime": 2346.3134, "train_tokens_per_second": 371.034 }, { "epoch": 0.3547387541403996, "grad_norm": 2.7666077613830566, "learning_rate": 1.294218415417559e-05, "loss": 0.13841849565505981, "num_input_tokens_seen": 871682, "step": 830, "train_runtime": 2348.5052, "train_tokens_per_second": 371.165 }, { "epoch": 0.3551661502297254, "grad_norm": 3.7168400287628174, "learning_rate": 1.2933618843683085e-05, "loss": 0.13689354062080383, "num_input_tokens_seen": 872416, "step": 831, "train_runtime": 2350.5548, "train_tokens_per_second": 371.153 }, { "epoch": 0.35559354631905116, "grad_norm": 3.724029302597046, "learning_rate": 1.292505353319058e-05, "loss": 0.15330494940280914, "num_input_tokens_seen": 873606, "step": 832, "train_runtime": 2352.7303, "train_tokens_per_second": 371.316 }, { "epoch": 0.35602094240837695, "grad_norm": 2.799285650253296, "learning_rate": 1.2916488222698073e-05, "loss": 0.1891564428806305, "num_input_tokens_seen": 874724, "step": 833, "train_runtime": 2354.9017, "train_tokens_per_second": 371.448 }, { "epoch": 0.35644833849770274, "grad_norm": 2.5742807388305664, "learning_rate": 1.2907922912205569e-05, "loss": 0.10590503364801407, "num_input_tokens_seen": 875570, "step": 834, "train_runtime": 2357.0482, "train_tokens_per_second": 371.469 }, { "epoch": 0.35687573458702854, "grad_norm": 1.5430233478546143, "learning_rate": 1.2899357601713062e-05, "loss": 0.11114594340324402, "num_input_tokens_seen": 876702, "step": 835, "train_runtime": 2359.2054, "train_tokens_per_second": 371.609 }, { "epoch": 0.35730313067635433, "grad_norm": 2.3434317111968994, "learning_rate": 1.2890792291220558e-05, "loss": 0.10748954117298126, "num_input_tokens_seen": 877628, "step": 836, "train_runtime": 2361.3383, "train_tokens_per_second": 371.666 }, { "epoch": 0.35773052676568007, "grad_norm": 1.9241222143173218, "learning_rate": 1.2882226980728051e-05, "loss": 0.06413917988538742, "num_input_tokens_seen": 878390, "step": 837, "train_runtime": 2363.457, "train_tokens_per_second": 371.655 }, { "epoch": 0.35815792285500586, "grad_norm": 1.275365948677063, "learning_rate": 1.2873661670235546e-05, "loss": 0.07867828011512756, "num_input_tokens_seen": 880084, "step": 838, "train_runtime": 2365.7913, "train_tokens_per_second": 372.004 }, { "epoch": 0.35858531894433165, "grad_norm": 2.6556649208068848, "learning_rate": 1.2865096359743042e-05, "loss": 0.11712068319320679, "num_input_tokens_seen": 881128, "step": 839, "train_runtime": 2367.9188, "train_tokens_per_second": 372.111 }, { "epoch": 0.35901271503365745, "grad_norm": 3.0657029151916504, "learning_rate": 1.2856531049250535e-05, "loss": 0.20221734046936035, "num_input_tokens_seen": 881942, "step": 840, "train_runtime": 2370.0139, "train_tokens_per_second": 372.125 }, { "epoch": 0.35944011112298324, "grad_norm": 2.1402385234832764, "learning_rate": 1.284796573875803e-05, "loss": 0.10370795428752899, "num_input_tokens_seen": 882700, "step": 841, "train_runtime": 2385.2893, "train_tokens_per_second": 370.06 }, { "epoch": 0.35986750721230903, "grad_norm": 1.999263882637024, "learning_rate": 1.2839400428265524e-05, "loss": 0.14306849241256714, "num_input_tokens_seen": 883724, "step": 842, "train_runtime": 2387.4028, "train_tokens_per_second": 370.161 }, { "epoch": 0.3602949033016348, "grad_norm": 2.2319602966308594, "learning_rate": 1.283083511777302e-05, "loss": 0.13047417998313904, "num_input_tokens_seen": 884510, "step": 843, "train_runtime": 2389.5083, "train_tokens_per_second": 370.164 }, { "epoch": 0.36072229939096057, "grad_norm": 1.8456926345825195, "learning_rate": 1.2822269807280515e-05, "loss": 0.11278331279754639, "num_input_tokens_seen": 885522, "step": 844, "train_runtime": 2391.6712, "train_tokens_per_second": 370.252 }, { "epoch": 0.36114969548028636, "grad_norm": 1.9352658987045288, "learning_rate": 1.2813704496788008e-05, "loss": 0.10232369601726532, "num_input_tokens_seen": 886520, "step": 845, "train_runtime": 2393.78, "train_tokens_per_second": 370.343 }, { "epoch": 0.36157709156961215, "grad_norm": 1.9985121488571167, "learning_rate": 1.2805139186295504e-05, "loss": 0.12468145042657852, "num_input_tokens_seen": 887478, "step": 846, "train_runtime": 2395.9232, "train_tokens_per_second": 370.412 }, { "epoch": 0.36200448765893795, "grad_norm": 2.997879981994629, "learning_rate": 1.2796573875802997e-05, "loss": 0.10673297941684723, "num_input_tokens_seen": 888142, "step": 847, "train_runtime": 2397.9983, "train_tokens_per_second": 370.368 }, { "epoch": 0.3624318837482637, "grad_norm": 2.8348140716552734, "learning_rate": 1.2788008565310494e-05, "loss": 0.152587428689003, "num_input_tokens_seen": 889178, "step": 848, "train_runtime": 2400.1417, "train_tokens_per_second": 370.469 }, { "epoch": 0.3628592798375895, "grad_norm": 1.6546398401260376, "learning_rate": 1.277944325481799e-05, "loss": 0.12723231315612793, "num_input_tokens_seen": 890746, "step": 849, "train_runtime": 2402.4217, "train_tokens_per_second": 370.77 }, { "epoch": 0.36328667592691527, "grad_norm": 2.3017971515655518, "learning_rate": 1.2770877944325483e-05, "loss": 0.11856281757354736, "num_input_tokens_seen": 891694, "step": 850, "train_runtime": 2404.5416, "train_tokens_per_second": 370.837 }, { "epoch": 0.36371407201624106, "grad_norm": 2.0273659229278564, "learning_rate": 1.2762312633832978e-05, "loss": 0.17470906674861908, "num_input_tokens_seen": 892998, "step": 851, "train_runtime": 2406.7755, "train_tokens_per_second": 371.035 }, { "epoch": 0.36414146810556686, "grad_norm": 3.1824123859405518, "learning_rate": 1.2753747323340474e-05, "loss": 0.15598653256893158, "num_input_tokens_seen": 893882, "step": 852, "train_runtime": 2409.0877, "train_tokens_per_second": 371.046 }, { "epoch": 0.3645688641948926, "grad_norm": 1.8734511137008667, "learning_rate": 1.2745182012847967e-05, "loss": 0.11133860796689987, "num_input_tokens_seen": 894888, "step": 853, "train_runtime": 2411.2765, "train_tokens_per_second": 371.126 }, { "epoch": 0.3649962602842184, "grad_norm": 2.210627317428589, "learning_rate": 1.2736616702355462e-05, "loss": 0.20583584904670715, "num_input_tokens_seen": 896216, "step": 854, "train_runtime": 2413.4897, "train_tokens_per_second": 371.336 }, { "epoch": 0.3654236563735442, "grad_norm": 2.089354991912842, "learning_rate": 1.2728051391862956e-05, "loss": 0.09439928084611893, "num_input_tokens_seen": 897404, "step": 855, "train_runtime": 2415.6801, "train_tokens_per_second": 371.491 }, { "epoch": 0.36585105246287, "grad_norm": 2.5480873584747314, "learning_rate": 1.2719486081370451e-05, "loss": 0.15684294700622559, "num_input_tokens_seen": 898318, "step": 856, "train_runtime": 2417.8349, "train_tokens_per_second": 371.538 }, { "epoch": 0.36627844855219577, "grad_norm": 1.8332490921020508, "learning_rate": 1.2710920770877947e-05, "loss": 0.12645269930362701, "num_input_tokens_seen": 899926, "step": 857, "train_runtime": 2420.1588, "train_tokens_per_second": 371.846 }, { "epoch": 0.3667058446415215, "grad_norm": 2.9024620056152344, "learning_rate": 1.270235546038544e-05, "loss": 0.12869933247566223, "num_input_tokens_seen": 901122, "step": 858, "train_runtime": 2422.3849, "train_tokens_per_second": 371.998 }, { "epoch": 0.3671332407308473, "grad_norm": 1.7431743144989014, "learning_rate": 1.2693790149892935e-05, "loss": 0.07658876478672028, "num_input_tokens_seen": 902054, "step": 859, "train_runtime": 2424.5573, "train_tokens_per_second": 372.049 }, { "epoch": 0.3675606368201731, "grad_norm": 2.8482065200805664, "learning_rate": 1.2685224839400429e-05, "loss": 0.13861551880836487, "num_input_tokens_seen": 902682, "step": 860, "train_runtime": 2426.6309, "train_tokens_per_second": 371.99 }, { "epoch": 0.3679880329094989, "grad_norm": 2.4064478874206543, "learning_rate": 1.2676659528907924e-05, "loss": 0.18145975470542908, "num_input_tokens_seen": 903482, "step": 861, "train_runtime": 2428.6922, "train_tokens_per_second": 372.003 }, { "epoch": 0.3684154289988247, "grad_norm": 2.8364784717559814, "learning_rate": 1.266809421841542e-05, "loss": 0.13799196481704712, "num_input_tokens_seen": 904300, "step": 862, "train_runtime": 2430.7801, "train_tokens_per_second": 372.02 }, { "epoch": 0.3688428250881504, "grad_norm": 2.464657783508301, "learning_rate": 1.2659528907922913e-05, "loss": 0.1520114690065384, "num_input_tokens_seen": 905288, "step": 863, "train_runtime": 2432.8982, "train_tokens_per_second": 372.103 }, { "epoch": 0.3692702211774762, "grad_norm": 2.8625905513763428, "learning_rate": 1.2650963597430408e-05, "loss": 0.18288902938365936, "num_input_tokens_seen": 906054, "step": 864, "train_runtime": 2434.9779, "train_tokens_per_second": 372.099 }, { "epoch": 0.369697617266802, "grad_norm": 2.188767910003662, "learning_rate": 1.2642398286937902e-05, "loss": 0.09414643049240112, "num_input_tokens_seen": 907008, "step": 865, "train_runtime": 2437.1013, "train_tokens_per_second": 372.167 }, { "epoch": 0.3701250133561278, "grad_norm": 2.105830430984497, "learning_rate": 1.2633832976445397e-05, "loss": 0.12260585278272629, "num_input_tokens_seen": 908128, "step": 866, "train_runtime": 2439.2785, "train_tokens_per_second": 372.294 }, { "epoch": 0.3705524094454536, "grad_norm": 2.7027125358581543, "learning_rate": 1.2625267665952891e-05, "loss": 0.14837321639060974, "num_input_tokens_seen": 909008, "step": 867, "train_runtime": 2441.3686, "train_tokens_per_second": 372.335 }, { "epoch": 0.3709798055347794, "grad_norm": 2.140458345413208, "learning_rate": 1.2616702355460386e-05, "loss": 0.1417008936405182, "num_input_tokens_seen": 910658, "step": 868, "train_runtime": 2443.6472, "train_tokens_per_second": 372.663 }, { "epoch": 0.3714072016241051, "grad_norm": 3.9710843563079834, "learning_rate": 1.2608137044967881e-05, "loss": 0.1838308721780777, "num_input_tokens_seen": 911350, "step": 869, "train_runtime": 2445.7131, "train_tokens_per_second": 372.632 }, { "epoch": 0.3718345977134309, "grad_norm": 2.5963730812072754, "learning_rate": 1.2599571734475375e-05, "loss": 0.12967392802238464, "num_input_tokens_seen": 912134, "step": 870, "train_runtime": 2447.7973, "train_tokens_per_second": 372.635 }, { "epoch": 0.3722619938027567, "grad_norm": 2.5910768508911133, "learning_rate": 1.259100642398287e-05, "loss": 0.1894197314977646, "num_input_tokens_seen": 913428, "step": 871, "train_runtime": 2463.7444, "train_tokens_per_second": 370.748 }, { "epoch": 0.3726893898920825, "grad_norm": 1.9151437282562256, "learning_rate": 1.2582441113490364e-05, "loss": 0.10640452057123184, "num_input_tokens_seen": 914398, "step": 872, "train_runtime": 2465.8343, "train_tokens_per_second": 370.827 }, { "epoch": 0.3731167859814083, "grad_norm": 2.3632760047912598, "learning_rate": 1.2573875802997859e-05, "loss": 0.10356519371271133, "num_input_tokens_seen": 915234, "step": 873, "train_runtime": 2467.9278, "train_tokens_per_second": 370.851 }, { "epoch": 0.37354418207073403, "grad_norm": 2.1578476428985596, "learning_rate": 1.2565310492505354e-05, "loss": 0.13019436597824097, "num_input_tokens_seen": 916102, "step": 874, "train_runtime": 2470.0829, "train_tokens_per_second": 370.879 }, { "epoch": 0.3739715781600598, "grad_norm": 2.8030753135681152, "learning_rate": 1.2556745182012848e-05, "loss": 0.11686091125011444, "num_input_tokens_seen": 916690, "step": 875, "train_runtime": 2472.1112, "train_tokens_per_second": 370.813 }, { "epoch": 0.3743989742493856, "grad_norm": 1.841654658317566, "learning_rate": 1.2548179871520343e-05, "loss": 0.10576880723237991, "num_input_tokens_seen": 917832, "step": 876, "train_runtime": 2474.3223, "train_tokens_per_second": 370.943 }, { "epoch": 0.3748263703387114, "grad_norm": 2.1270804405212402, "learning_rate": 1.2539614561027837e-05, "loss": 0.1098417341709137, "num_input_tokens_seen": 919210, "step": 877, "train_runtime": 2476.5308, "train_tokens_per_second": 371.168 }, { "epoch": 0.3752537664280372, "grad_norm": 1.9743280410766602, "learning_rate": 1.2531049250535332e-05, "loss": 0.09473894536495209, "num_input_tokens_seen": 920192, "step": 878, "train_runtime": 2478.7013, "train_tokens_per_second": 371.24 }, { "epoch": 0.37568116251736294, "grad_norm": 1.8980886936187744, "learning_rate": 1.2522483940042827e-05, "loss": 0.08141298592090607, "num_input_tokens_seen": 920826, "step": 879, "train_runtime": 2480.8008, "train_tokens_per_second": 371.181 }, { "epoch": 0.37610855860668874, "grad_norm": 2.2440285682678223, "learning_rate": 1.2513918629550321e-05, "loss": 0.13725431263446808, "num_input_tokens_seen": 922070, "step": 880, "train_runtime": 2483.0133, "train_tokens_per_second": 371.351 }, { "epoch": 0.37653595469601453, "grad_norm": 2.90678071975708, "learning_rate": 1.2505353319057816e-05, "loss": 0.24618873000144958, "num_input_tokens_seen": 923318, "step": 881, "train_runtime": 2485.1903, "train_tokens_per_second": 371.528 }, { "epoch": 0.3769633507853403, "grad_norm": 2.637791633605957, "learning_rate": 1.2496788008565313e-05, "loss": 0.12510210275650024, "num_input_tokens_seen": 924142, "step": 882, "train_runtime": 2487.3057, "train_tokens_per_second": 371.543 }, { "epoch": 0.3773907468746661, "grad_norm": 2.2982451915740967, "learning_rate": 1.2488222698072807e-05, "loss": 0.14668899774551392, "num_input_tokens_seen": 925586, "step": 883, "train_runtime": 2489.6908, "train_tokens_per_second": 371.767 }, { "epoch": 0.37781814296399185, "grad_norm": 1.9811372756958008, "learning_rate": 1.2479657387580302e-05, "loss": 0.10304494947195053, "num_input_tokens_seen": 926742, "step": 884, "train_runtime": 2491.8893, "train_tokens_per_second": 371.903 }, { "epoch": 0.37824553905331765, "grad_norm": 1.759446144104004, "learning_rate": 1.2471092077087796e-05, "loss": 0.15061134099960327, "num_input_tokens_seen": 928106, "step": 885, "train_runtime": 2494.1395, "train_tokens_per_second": 372.115 }, { "epoch": 0.37867293514264344, "grad_norm": 2.814922571182251, "learning_rate": 1.2462526766595291e-05, "loss": 0.14834536612033844, "num_input_tokens_seen": 929166, "step": 886, "train_runtime": 2496.3253, "train_tokens_per_second": 372.214 }, { "epoch": 0.37910033123196923, "grad_norm": 1.7875823974609375, "learning_rate": 1.2453961456102786e-05, "loss": 0.0991504043340683, "num_input_tokens_seen": 930410, "step": 887, "train_runtime": 2498.5164, "train_tokens_per_second": 372.385 }, { "epoch": 0.379527727321295, "grad_norm": 1.9592251777648926, "learning_rate": 1.244539614561028e-05, "loss": 0.08987846225500107, "num_input_tokens_seen": 931220, "step": 888, "train_runtime": 2500.6411, "train_tokens_per_second": 372.393 }, { "epoch": 0.37995512341062077, "grad_norm": 1.9382516145706177, "learning_rate": 1.2436830835117775e-05, "loss": 0.0876319631934166, "num_input_tokens_seen": 932864, "step": 889, "train_runtime": 2502.9365, "train_tokens_per_second": 372.708 }, { "epoch": 0.38038251949994656, "grad_norm": 2.277622938156128, "learning_rate": 1.2428265524625269e-05, "loss": 0.15632492303848267, "num_input_tokens_seen": 934192, "step": 890, "train_runtime": 2505.1695, "train_tokens_per_second": 372.906 }, { "epoch": 0.38080991558927235, "grad_norm": 2.850247859954834, "learning_rate": 1.2419700214132764e-05, "loss": 0.18625666201114655, "num_input_tokens_seen": 935036, "step": 891, "train_runtime": 2507.2874, "train_tokens_per_second": 372.927 }, { "epoch": 0.38123731167859815, "grad_norm": 1.7833002805709839, "learning_rate": 1.241113490364026e-05, "loss": 0.14385469257831573, "num_input_tokens_seen": 936516, "step": 892, "train_runtime": 2509.5355, "train_tokens_per_second": 373.183 }, { "epoch": 0.38166470776792394, "grad_norm": 1.7687997817993164, "learning_rate": 1.2402569593147753e-05, "loss": 0.09808165580034256, "num_input_tokens_seen": 937898, "step": 893, "train_runtime": 2511.7499, "train_tokens_per_second": 373.404 }, { "epoch": 0.38209210385724973, "grad_norm": 2.0094871520996094, "learning_rate": 1.2394004282655248e-05, "loss": 0.0910576656460762, "num_input_tokens_seen": 938748, "step": 894, "train_runtime": 2513.8685, "train_tokens_per_second": 373.428 }, { "epoch": 0.38251949994657547, "grad_norm": 2.2136740684509277, "learning_rate": 1.2385438972162742e-05, "loss": 0.12504349648952484, "num_input_tokens_seen": 939548, "step": 895, "train_runtime": 2515.9843, "train_tokens_per_second": 373.432 }, { "epoch": 0.38294689603590126, "grad_norm": 2.3028340339660645, "learning_rate": 1.2376873661670237e-05, "loss": 0.11133719980716705, "num_input_tokens_seen": 940356, "step": 896, "train_runtime": 2518.0746, "train_tokens_per_second": 373.442 }, { "epoch": 0.38337429212522706, "grad_norm": 2.0204732418060303, "learning_rate": 1.236830835117773e-05, "loss": 0.11281103640794754, "num_input_tokens_seen": 941316, "step": 897, "train_runtime": 2520.2386, "train_tokens_per_second": 373.503 }, { "epoch": 0.38380168821455285, "grad_norm": 2.63671875, "learning_rate": 1.2359743040685226e-05, "loss": 0.18026074767112732, "num_input_tokens_seen": 942222, "step": 898, "train_runtime": 2522.4056, "train_tokens_per_second": 373.541 }, { "epoch": 0.38422908430387864, "grad_norm": 2.357625961303711, "learning_rate": 1.2351177730192721e-05, "loss": 0.15424025058746338, "num_input_tokens_seen": 943360, "step": 899, "train_runtime": 2524.5818, "train_tokens_per_second": 373.67 }, { "epoch": 0.3846564803932044, "grad_norm": 2.877103567123413, "learning_rate": 1.2342612419700215e-05, "loss": 0.15378624200820923, "num_input_tokens_seen": 944406, "step": 900, "train_runtime": 2526.735, "train_tokens_per_second": 373.765 }, { "epoch": 0.3850838764825302, "grad_norm": 1.8694554567337036, "learning_rate": 1.233404710920771e-05, "loss": 0.11242681741714478, "num_input_tokens_seen": 945882, "step": 901, "train_runtime": 2542.0712, "train_tokens_per_second": 372.091 }, { "epoch": 0.38551127257185597, "grad_norm": 3.171609878540039, "learning_rate": 1.2325481798715204e-05, "loss": 0.1754235029220581, "num_input_tokens_seen": 946730, "step": 902, "train_runtime": 2544.176, "train_tokens_per_second": 372.117 }, { "epoch": 0.38593866866118176, "grad_norm": 3.146733045578003, "learning_rate": 1.2316916488222699e-05, "loss": 0.18093152344226837, "num_input_tokens_seen": 947530, "step": 903, "train_runtime": 2546.2789, "train_tokens_per_second": 372.123 }, { "epoch": 0.38636606475050755, "grad_norm": 1.64303457736969, "learning_rate": 1.2308351177730194e-05, "loss": 0.07227301597595215, "num_input_tokens_seen": 948602, "step": 904, "train_runtime": 2548.464, "train_tokens_per_second": 372.225 }, { "epoch": 0.3867934608398333, "grad_norm": 2.133760690689087, "learning_rate": 1.2299785867237688e-05, "loss": 0.1293281763792038, "num_input_tokens_seen": 949498, "step": 905, "train_runtime": 2550.6327, "train_tokens_per_second": 372.26 }, { "epoch": 0.3872208569291591, "grad_norm": 2.5086610317230225, "learning_rate": 1.2291220556745183e-05, "loss": 0.1361384093761444, "num_input_tokens_seen": 950432, "step": 906, "train_runtime": 2552.7712, "train_tokens_per_second": 372.314 }, { "epoch": 0.3876482530184849, "grad_norm": 2.183943033218384, "learning_rate": 1.2282655246252677e-05, "loss": 0.10865439474582672, "num_input_tokens_seen": 951456, "step": 907, "train_runtime": 2554.8958, "train_tokens_per_second": 372.405 }, { "epoch": 0.38807564910781067, "grad_norm": 2.268624782562256, "learning_rate": 1.2274089935760172e-05, "loss": 0.0960884541273117, "num_input_tokens_seen": 952172, "step": 908, "train_runtime": 2556.9783, "train_tokens_per_second": 372.382 }, { "epoch": 0.38850304519713647, "grad_norm": 1.9919828176498413, "learning_rate": 1.2265524625267667e-05, "loss": 0.09584489464759827, "num_input_tokens_seen": 953040, "step": 909, "train_runtime": 2559.0543, "train_tokens_per_second": 372.419 }, { "epoch": 0.3889304412864622, "grad_norm": 1.9157767295837402, "learning_rate": 1.225695931477516e-05, "loss": 0.1075853705406189, "num_input_tokens_seen": 954068, "step": 910, "train_runtime": 2561.1658, "train_tokens_per_second": 372.513 }, { "epoch": 0.389357837375788, "grad_norm": 2.539428949356079, "learning_rate": 1.2248394004282656e-05, "loss": 0.19488340616226196, "num_input_tokens_seen": 954938, "step": 911, "train_runtime": 2563.2758, "train_tokens_per_second": 372.546 }, { "epoch": 0.3897852334651138, "grad_norm": 3.7040762901306152, "learning_rate": 1.223982869379015e-05, "loss": 0.12698619067668915, "num_input_tokens_seen": 955768, "step": 912, "train_runtime": 2565.574, "train_tokens_per_second": 372.536 }, { "epoch": 0.3902126295544396, "grad_norm": 2.5857393741607666, "learning_rate": 1.2231263383297645e-05, "loss": 0.18038934469223022, "num_input_tokens_seen": 956702, "step": 913, "train_runtime": 2567.7784, "train_tokens_per_second": 372.58 }, { "epoch": 0.3906400256437654, "grad_norm": 2.8253538608551025, "learning_rate": 1.2222698072805138e-05, "loss": 0.1287080943584442, "num_input_tokens_seen": 957424, "step": 914, "train_runtime": 2569.8643, "train_tokens_per_second": 372.558 }, { "epoch": 0.39106742173309117, "grad_norm": 2.561044692993164, "learning_rate": 1.2214132762312634e-05, "loss": 0.1095781922340393, "num_input_tokens_seen": 958388, "step": 915, "train_runtime": 2572.0406, "train_tokens_per_second": 372.618 }, { "epoch": 0.3914948178224169, "grad_norm": 2.4931867122650146, "learning_rate": 1.220556745182013e-05, "loss": 0.2136867791414261, "num_input_tokens_seen": 959302, "step": 916, "train_runtime": 2574.1744, "train_tokens_per_second": 372.664 }, { "epoch": 0.3919222139117427, "grad_norm": 2.552759885787964, "learning_rate": 1.2197002141327626e-05, "loss": 0.09269089996814728, "num_input_tokens_seen": 960216, "step": 917, "train_runtime": 2576.2938, "train_tokens_per_second": 372.712 }, { "epoch": 0.3923496100010685, "grad_norm": 2.0703036785125732, "learning_rate": 1.218843683083512e-05, "loss": 0.13947340846061707, "num_input_tokens_seen": 961178, "step": 918, "train_runtime": 2578.4371, "train_tokens_per_second": 372.775 }, { "epoch": 0.3927770060903943, "grad_norm": 2.9783589839935303, "learning_rate": 1.2179871520342615e-05, "loss": 0.16986806690692902, "num_input_tokens_seen": 961906, "step": 919, "train_runtime": 2580.5298, "train_tokens_per_second": 372.755 }, { "epoch": 0.3932044021797201, "grad_norm": 2.4051973819732666, "learning_rate": 1.2171306209850108e-05, "loss": 0.20057371258735657, "num_input_tokens_seen": 962894, "step": 920, "train_runtime": 2582.7168, "train_tokens_per_second": 372.822 }, { "epoch": 0.3936317982690458, "grad_norm": 1.5075480937957764, "learning_rate": 1.2162740899357604e-05, "loss": 0.0642538070678711, "num_input_tokens_seen": 963752, "step": 921, "train_runtime": 2584.8065, "train_tokens_per_second": 372.853 }, { "epoch": 0.3940591943583716, "grad_norm": 1.8970712423324585, "learning_rate": 1.2154175588865099e-05, "loss": 0.09261252731084824, "num_input_tokens_seen": 964612, "step": 922, "train_runtime": 2586.9306, "train_tokens_per_second": 372.879 }, { "epoch": 0.3944865904476974, "grad_norm": 2.6838278770446777, "learning_rate": 1.2145610278372592e-05, "loss": 0.15132789313793182, "num_input_tokens_seen": 965652, "step": 923, "train_runtime": 2589.088, "train_tokens_per_second": 372.97 }, { "epoch": 0.3949139865370232, "grad_norm": 2.776010036468506, "learning_rate": 1.2137044967880088e-05, "loss": 0.14002200961112976, "num_input_tokens_seen": 966668, "step": 924, "train_runtime": 2591.2393, "train_tokens_per_second": 373.052 }, { "epoch": 0.395341382626349, "grad_norm": 2.3199238777160645, "learning_rate": 1.2128479657387581e-05, "loss": 0.10614319145679474, "num_input_tokens_seen": 967584, "step": 925, "train_runtime": 2593.3688, "train_tokens_per_second": 373.099 }, { "epoch": 0.39576877871567473, "grad_norm": 1.9682304859161377, "learning_rate": 1.2119914346895077e-05, "loss": 0.16021975874900818, "num_input_tokens_seen": 968924, "step": 926, "train_runtime": 2595.5801, "train_tokens_per_second": 373.298 }, { "epoch": 0.3961961748050005, "grad_norm": 2.1558029651641846, "learning_rate": 1.211134903640257e-05, "loss": 0.12402009218931198, "num_input_tokens_seen": 970256, "step": 927, "train_runtime": 2597.7977, "train_tokens_per_second": 373.492 }, { "epoch": 0.3966235708943263, "grad_norm": 1.6738981008529663, "learning_rate": 1.2102783725910065e-05, "loss": 0.10111566632986069, "num_input_tokens_seen": 971508, "step": 928, "train_runtime": 2600.0463, "train_tokens_per_second": 373.65 }, { "epoch": 0.3970509669836521, "grad_norm": 2.4890623092651367, "learning_rate": 1.209421841541756e-05, "loss": 0.12960676848888397, "num_input_tokens_seen": 972496, "step": 929, "train_runtime": 2602.1651, "train_tokens_per_second": 373.726 }, { "epoch": 0.3974783630729779, "grad_norm": 2.40090012550354, "learning_rate": 1.2085653104925054e-05, "loss": 0.13657209277153015, "num_input_tokens_seen": 973502, "step": 930, "train_runtime": 2604.3414, "train_tokens_per_second": 373.8 }, { "epoch": 0.39790575916230364, "grad_norm": 1.800201654434204, "learning_rate": 1.207708779443255e-05, "loss": 0.08778995275497437, "num_input_tokens_seen": 974398, "step": 931, "train_runtime": 2620.4146, "train_tokens_per_second": 371.849 }, { "epoch": 0.39833315525162943, "grad_norm": 2.485584259033203, "learning_rate": 1.2068522483940043e-05, "loss": 0.1305716186761856, "num_input_tokens_seen": 975244, "step": 932, "train_runtime": 2622.5156, "train_tokens_per_second": 371.873 }, { "epoch": 0.3987605513409552, "grad_norm": 3.030352830886841, "learning_rate": 1.2059957173447538e-05, "loss": 0.1337234377861023, "num_input_tokens_seen": 976058, "step": 933, "train_runtime": 2624.6131, "train_tokens_per_second": 371.886 }, { "epoch": 0.399187947430281, "grad_norm": 2.5703330039978027, "learning_rate": 1.2051391862955034e-05, "loss": 0.1824536919593811, "num_input_tokens_seen": 976876, "step": 934, "train_runtime": 2626.7023, "train_tokens_per_second": 371.902 }, { "epoch": 0.3996153435196068, "grad_norm": 3.760235071182251, "learning_rate": 1.2042826552462527e-05, "loss": 0.23526248335838318, "num_input_tokens_seen": 977490, "step": 935, "train_runtime": 2628.776, "train_tokens_per_second": 371.842 }, { "epoch": 0.40004273960893255, "grad_norm": 3.0365898609161377, "learning_rate": 1.2034261241970023e-05, "loss": 0.0925004705786705, "num_input_tokens_seen": 978154, "step": 936, "train_runtime": 2630.8693, "train_tokens_per_second": 371.799 }, { "epoch": 0.40004273960893255, "eval_loss": 0.49531039595603943, "eval_runtime": 58.3154, "eval_samples_per_second": 17.114, "eval_steps_per_second": 8.557, "num_input_tokens_seen": 978154, "step": 936 }, { "epoch": 0.40047013569825834, "grad_norm": 2.3873255252838135, "learning_rate": 1.2025695931477516e-05, "loss": 0.0911688432097435, "num_input_tokens_seen": 978928, "step": 937, "train_runtime": 2691.33, "train_tokens_per_second": 363.734 }, { "epoch": 0.40089753178758414, "grad_norm": 2.060574531555176, "learning_rate": 1.2017130620985011e-05, "loss": 0.12122222781181335, "num_input_tokens_seen": 979884, "step": 938, "train_runtime": 2693.4475, "train_tokens_per_second": 363.803 }, { "epoch": 0.40132492787690993, "grad_norm": 2.926950454711914, "learning_rate": 1.2008565310492507e-05, "loss": 0.13500195741653442, "num_input_tokens_seen": 980664, "step": 939, "train_runtime": 2695.6273, "train_tokens_per_second": 363.798 }, { "epoch": 0.4017523239662357, "grad_norm": 3.1084179878234863, "learning_rate": 1.2e-05, "loss": 0.1328144073486328, "num_input_tokens_seen": 981276, "step": 940, "train_runtime": 2697.7463, "train_tokens_per_second": 363.739 }, { "epoch": 0.4021797200555615, "grad_norm": 2.009573221206665, "learning_rate": 1.1991434689507496e-05, "loss": 0.15397098660469055, "num_input_tokens_seen": 982846, "step": 941, "train_runtime": 2700.0404, "train_tokens_per_second": 364.012 }, { "epoch": 0.40260711614488726, "grad_norm": 2.4772355556488037, "learning_rate": 1.198286937901499e-05, "loss": 0.0811704769730568, "num_input_tokens_seen": 984040, "step": 942, "train_runtime": 2702.2218, "train_tokens_per_second": 364.16 }, { "epoch": 0.40303451223421305, "grad_norm": 2.2134244441986084, "learning_rate": 1.1974304068522484e-05, "loss": 0.10884946584701538, "num_input_tokens_seen": 984862, "step": 943, "train_runtime": 2704.3272, "train_tokens_per_second": 364.18 }, { "epoch": 0.40346190832353884, "grad_norm": 1.9158374071121216, "learning_rate": 1.1965738758029978e-05, "loss": 0.08385251462459564, "num_input_tokens_seen": 985594, "step": 944, "train_runtime": 2706.406, "train_tokens_per_second": 364.171 }, { "epoch": 0.40388930441286464, "grad_norm": 2.6209640502929688, "learning_rate": 1.1957173447537473e-05, "loss": 0.1714126169681549, "num_input_tokens_seen": 986356, "step": 945, "train_runtime": 2708.4962, "train_tokens_per_second": 364.171 }, { "epoch": 0.40431670050219043, "grad_norm": 2.614886999130249, "learning_rate": 1.1948608137044969e-05, "loss": 0.18205171823501587, "num_input_tokens_seen": 987016, "step": 946, "train_runtime": 2710.5441, "train_tokens_per_second": 364.139 }, { "epoch": 0.40474409659151617, "grad_norm": 2.492692470550537, "learning_rate": 1.1940042826552462e-05, "loss": 0.12335605174303055, "num_input_tokens_seen": 987838, "step": 947, "train_runtime": 2712.6428, "train_tokens_per_second": 364.161 }, { "epoch": 0.40517149268084196, "grad_norm": 2.9411168098449707, "learning_rate": 1.1931477516059957e-05, "loss": 0.12869834899902344, "num_input_tokens_seen": 988560, "step": 948, "train_runtime": 2714.6797, "train_tokens_per_second": 364.153 }, { "epoch": 0.40559888877016775, "grad_norm": 3.8990182876586914, "learning_rate": 1.1922912205567451e-05, "loss": 0.1914498656988144, "num_input_tokens_seen": 989722, "step": 949, "train_runtime": 2716.8473, "train_tokens_per_second": 364.291 }, { "epoch": 0.40602628485949355, "grad_norm": 1.982263207435608, "learning_rate": 1.1914346895074946e-05, "loss": 0.11047862470149994, "num_input_tokens_seen": 990588, "step": 950, "train_runtime": 2718.9843, "train_tokens_per_second": 364.323 }, { "epoch": 0.40645368094881934, "grad_norm": 1.8765393495559692, "learning_rate": 1.1905781584582443e-05, "loss": 0.13714712858200073, "num_input_tokens_seen": 991610, "step": 951, "train_runtime": 2721.1467, "train_tokens_per_second": 364.409 }, { "epoch": 0.4068810770381451, "grad_norm": 2.322723627090454, "learning_rate": 1.1897216274089939e-05, "loss": 0.1259048879146576, "num_input_tokens_seen": 993094, "step": 952, "train_runtime": 2723.4379, "train_tokens_per_second": 364.647 }, { "epoch": 0.40730847312747087, "grad_norm": 1.818282961845398, "learning_rate": 1.1888650963597432e-05, "loss": 0.13882559537887573, "num_input_tokens_seen": 994546, "step": 953, "train_runtime": 2725.7106, "train_tokens_per_second": 364.876 }, { "epoch": 0.40773586921679666, "grad_norm": 2.0054283142089844, "learning_rate": 1.1880085653104927e-05, "loss": 0.10679404437541962, "num_input_tokens_seen": 996130, "step": 954, "train_runtime": 2728.0013, "train_tokens_per_second": 365.15 }, { "epoch": 0.40816326530612246, "grad_norm": 1.6338130235671997, "learning_rate": 1.1871520342612421e-05, "loss": 0.07151520997285843, "num_input_tokens_seen": 996898, "step": 955, "train_runtime": 2730.0925, "train_tokens_per_second": 365.152 }, { "epoch": 0.40859066139544825, "grad_norm": 1.7243101596832275, "learning_rate": 1.1862955032119916e-05, "loss": 0.06756711006164551, "num_input_tokens_seen": 997846, "step": 956, "train_runtime": 2732.3103, "train_tokens_per_second": 365.202 }, { "epoch": 0.409018057484774, "grad_norm": 3.2189505100250244, "learning_rate": 1.185438972162741e-05, "loss": 0.09284111112356186, "num_input_tokens_seen": 998512, "step": 957, "train_runtime": 2734.3925, "train_tokens_per_second": 365.168 }, { "epoch": 0.4094454535740998, "grad_norm": 4.5584259033203125, "learning_rate": 1.1845824411134905e-05, "loss": 0.21210573613643646, "num_input_tokens_seen": 999580, "step": 958, "train_runtime": 2736.5454, "train_tokens_per_second": 365.271 }, { "epoch": 0.4098728496634256, "grad_norm": 1.6021218299865723, "learning_rate": 1.18372591006424e-05, "loss": 0.08847945928573608, "num_input_tokens_seen": 1000800, "step": 959, "train_runtime": 2738.756, "train_tokens_per_second": 365.421 }, { "epoch": 0.41030024575275137, "grad_norm": 1.860171914100647, "learning_rate": 1.1828693790149894e-05, "loss": 0.11484178900718689, "num_input_tokens_seen": 1002042, "step": 960, "train_runtime": 2740.9783, "train_tokens_per_second": 365.578 }, { "epoch": 0.41072764184207716, "grad_norm": 1.976267695426941, "learning_rate": 1.182012847965739e-05, "loss": 0.11644624173641205, "num_input_tokens_seen": 1003804, "step": 961, "train_runtime": 2757.2531, "train_tokens_per_second": 364.059 }, { "epoch": 0.4111550379314029, "grad_norm": 2.1563267707824707, "learning_rate": 1.1811563169164883e-05, "loss": 0.11923924088478088, "num_input_tokens_seen": 1005234, "step": 962, "train_runtime": 2759.5471, "train_tokens_per_second": 364.275 }, { "epoch": 0.4115824340207287, "grad_norm": 2.7617363929748535, "learning_rate": 1.1802997858672378e-05, "loss": 0.1798803210258484, "num_input_tokens_seen": 1006284, "step": 963, "train_runtime": 2761.7431, "train_tokens_per_second": 364.366 }, { "epoch": 0.4120098301100545, "grad_norm": 4.04373836517334, "learning_rate": 1.1794432548179873e-05, "loss": 0.11118249595165253, "num_input_tokens_seen": 1006842, "step": 964, "train_runtime": 2763.7807, "train_tokens_per_second": 364.299 }, { "epoch": 0.4124372261993803, "grad_norm": 2.6414828300476074, "learning_rate": 1.1785867237687367e-05, "loss": 0.1510341465473175, "num_input_tokens_seen": 1007780, "step": 965, "train_runtime": 2765.943, "train_tokens_per_second": 364.353 }, { "epoch": 0.4128646222887061, "grad_norm": 2.202540636062622, "learning_rate": 1.1777301927194862e-05, "loss": 0.10943156480789185, "num_input_tokens_seen": 1008514, "step": 966, "train_runtime": 2768.0416, "train_tokens_per_second": 364.342 }, { "epoch": 0.41329201837803187, "grad_norm": 2.0062096118927, "learning_rate": 1.1768736616702356e-05, "loss": 0.0947541743516922, "num_input_tokens_seen": 1009364, "step": 967, "train_runtime": 2770.1643, "train_tokens_per_second": 364.37 }, { "epoch": 0.4137194144673576, "grad_norm": 2.721343755722046, "learning_rate": 1.1760171306209851e-05, "loss": 0.12457822263240814, "num_input_tokens_seen": 1010180, "step": 968, "train_runtime": 2772.2171, "train_tokens_per_second": 364.394 }, { "epoch": 0.4141468105566834, "grad_norm": 2.299980640411377, "learning_rate": 1.1751605995717346e-05, "loss": 0.134385883808136, "num_input_tokens_seen": 1010894, "step": 969, "train_runtime": 2774.3033, "train_tokens_per_second": 364.378 }, { "epoch": 0.4145742066460092, "grad_norm": 2.4229962825775146, "learning_rate": 1.174304068522484e-05, "loss": 0.15707530081272125, "num_input_tokens_seen": 1011828, "step": 970, "train_runtime": 2776.4185, "train_tokens_per_second": 364.436 }, { "epoch": 0.415001602735335, "grad_norm": 2.3712334632873535, "learning_rate": 1.1734475374732335e-05, "loss": 0.10923910140991211, "num_input_tokens_seen": 1012502, "step": 971, "train_runtime": 2778.5108, "train_tokens_per_second": 364.405 }, { "epoch": 0.4154289988246608, "grad_norm": 4.302492618560791, "learning_rate": 1.1725910064239829e-05, "loss": 0.23842209577560425, "num_input_tokens_seen": 1012990, "step": 972, "train_runtime": 2780.5107, "train_tokens_per_second": 364.318 }, { "epoch": 0.4158563949139865, "grad_norm": 2.0874907970428467, "learning_rate": 1.1717344753747324e-05, "loss": 0.1560826450586319, "num_input_tokens_seen": 1014720, "step": 973, "train_runtime": 2782.8695, "train_tokens_per_second": 364.631 }, { "epoch": 0.4162837910033123, "grad_norm": 2.134237051010132, "learning_rate": 1.1708779443254818e-05, "loss": 0.15274594724178314, "num_input_tokens_seen": 1016746, "step": 974, "train_runtime": 2785.3131, "train_tokens_per_second": 365.038 }, { "epoch": 0.4167111870926381, "grad_norm": 2.5279417037963867, "learning_rate": 1.1700214132762313e-05, "loss": 0.10355942696332932, "num_input_tokens_seen": 1017582, "step": 975, "train_runtime": 2787.4275, "train_tokens_per_second": 365.061 }, { "epoch": 0.4171385831819639, "grad_norm": 1.848024606704712, "learning_rate": 1.1691648822269808e-05, "loss": 0.10375792533159256, "num_input_tokens_seen": 1018630, "step": 976, "train_runtime": 2789.6047, "train_tokens_per_second": 365.152 }, { "epoch": 0.4175659792712897, "grad_norm": 2.251873254776001, "learning_rate": 1.1683083511777302e-05, "loss": 0.09312009066343307, "num_input_tokens_seen": 1019318, "step": 977, "train_runtime": 2791.7042, "train_tokens_per_second": 365.124 }, { "epoch": 0.4179933753606154, "grad_norm": 2.276503801345825, "learning_rate": 1.1674518201284797e-05, "loss": 0.1360630840063095, "num_input_tokens_seen": 1020494, "step": 978, "train_runtime": 2793.9274, "train_tokens_per_second": 365.254 }, { "epoch": 0.4184207714499412, "grad_norm": 2.2060673236846924, "learning_rate": 1.166595289079229e-05, "loss": 0.13519413769245148, "num_input_tokens_seen": 1021976, "step": 979, "train_runtime": 2796.2334, "train_tokens_per_second": 365.483 }, { "epoch": 0.418848167539267, "grad_norm": 2.7974560260772705, "learning_rate": 1.1657387580299786e-05, "loss": 0.14611303806304932, "num_input_tokens_seen": 1022736, "step": 980, "train_runtime": 2798.3269, "train_tokens_per_second": 365.481 }, { "epoch": 0.4192755636285928, "grad_norm": 1.937928318977356, "learning_rate": 1.1648822269807281e-05, "loss": 0.11127322912216187, "num_input_tokens_seen": 1023696, "step": 981, "train_runtime": 2800.4491, "train_tokens_per_second": 365.547 }, { "epoch": 0.4197029597179186, "grad_norm": 2.6253833770751953, "learning_rate": 1.1640256959314775e-05, "loss": 0.16199615597724915, "num_input_tokens_seen": 1024560, "step": 982, "train_runtime": 2802.6032, "train_tokens_per_second": 365.574 }, { "epoch": 0.42013035580724434, "grad_norm": 1.643823266029358, "learning_rate": 1.163169164882227e-05, "loss": 0.08269336819648743, "num_input_tokens_seen": 1025730, "step": 983, "train_runtime": 2804.7773, "train_tokens_per_second": 365.708 }, { "epoch": 0.42055775189657013, "grad_norm": 3.6539435386657715, "learning_rate": 1.1623126338329764e-05, "loss": 0.17416368424892426, "num_input_tokens_seen": 1026550, "step": 984, "train_runtime": 2806.8549, "train_tokens_per_second": 365.73 }, { "epoch": 0.4209851479858959, "grad_norm": 2.2729201316833496, "learning_rate": 1.161456102783726e-05, "loss": 0.07793647050857544, "num_input_tokens_seen": 1027168, "step": 985, "train_runtime": 2808.8834, "train_tokens_per_second": 365.686 }, { "epoch": 0.4214125440752217, "grad_norm": 1.8531163930892944, "learning_rate": 1.1605995717344756e-05, "loss": 0.11568786203861237, "num_input_tokens_seen": 1028250, "step": 986, "train_runtime": 2811.1036, "train_tokens_per_second": 365.782 }, { "epoch": 0.4218399401645475, "grad_norm": 2.2515223026275635, "learning_rate": 1.159743040685225e-05, "loss": 0.08347593247890472, "num_input_tokens_seen": 1029064, "step": 987, "train_runtime": 2813.1983, "train_tokens_per_second": 365.799 }, { "epoch": 0.4222673362538733, "grad_norm": 2.4186718463897705, "learning_rate": 1.1588865096359745e-05, "loss": 0.14525270462036133, "num_input_tokens_seen": 1030018, "step": 988, "train_runtime": 2815.3527, "train_tokens_per_second": 365.858 }, { "epoch": 0.42269473234319904, "grad_norm": 2.28676700592041, "learning_rate": 1.158029978586724e-05, "loss": 0.11397407948970795, "num_input_tokens_seen": 1030886, "step": 989, "train_runtime": 2817.4938, "train_tokens_per_second": 365.888 }, { "epoch": 0.42312212843252484, "grad_norm": 2.185218572616577, "learning_rate": 1.1571734475374734e-05, "loss": 0.1133785992860794, "num_input_tokens_seen": 1032168, "step": 990, "train_runtime": 2819.6878, "train_tokens_per_second": 366.058 }, { "epoch": 0.42354952452185063, "grad_norm": 2.3733842372894287, "learning_rate": 1.1563169164882229e-05, "loss": 0.12109623849391937, "num_input_tokens_seen": 1032956, "step": 991, "train_runtime": 2835.4647, "train_tokens_per_second": 364.299 }, { "epoch": 0.4239769206111764, "grad_norm": 2.1615986824035645, "learning_rate": 1.1554603854389722e-05, "loss": 0.12668004631996155, "num_input_tokens_seen": 1033768, "step": 992, "train_runtime": 2837.5786, "train_tokens_per_second": 364.313 }, { "epoch": 0.4244043167005022, "grad_norm": 3.12859845161438, "learning_rate": 1.1546038543897218e-05, "loss": 0.12454401701688766, "num_input_tokens_seen": 1034492, "step": 993, "train_runtime": 2839.7374, "train_tokens_per_second": 364.291 }, { "epoch": 0.42483171278982795, "grad_norm": 1.8854997158050537, "learning_rate": 1.1537473233404713e-05, "loss": 0.09664224088191986, "num_input_tokens_seen": 1035644, "step": 994, "train_runtime": 2841.9714, "train_tokens_per_second": 364.41 }, { "epoch": 0.42525910887915375, "grad_norm": 1.9307321310043335, "learning_rate": 1.1528907922912207e-05, "loss": 0.103437140583992, "num_input_tokens_seen": 1037086, "step": 995, "train_runtime": 2844.2388, "train_tokens_per_second": 364.627 }, { "epoch": 0.42568650496847954, "grad_norm": 2.553837537765503, "learning_rate": 1.1520342612419702e-05, "loss": 0.06267597526311874, "num_input_tokens_seen": 1037730, "step": 996, "train_runtime": 2846.281, "train_tokens_per_second": 364.592 }, { "epoch": 0.42611390105780533, "grad_norm": 1.667264461517334, "learning_rate": 1.1511777301927195e-05, "loss": 0.0803246796131134, "num_input_tokens_seen": 1038528, "step": 997, "train_runtime": 2848.3779, "train_tokens_per_second": 364.603 }, { "epoch": 0.4265412971471311, "grad_norm": 1.9268029928207397, "learning_rate": 1.150321199143469e-05, "loss": 0.08455639332532883, "num_input_tokens_seen": 1039386, "step": 998, "train_runtime": 2850.5087, "train_tokens_per_second": 364.632 }, { "epoch": 0.42696869323645686, "grad_norm": 3.1712958812713623, "learning_rate": 1.1494646680942186e-05, "loss": 0.12818551063537598, "num_input_tokens_seen": 1040338, "step": 999, "train_runtime": 2852.6474, "train_tokens_per_second": 364.692 }, { "epoch": 0.42739608932578266, "grad_norm": 3.4448463916778564, "learning_rate": 1.148608137044968e-05, "loss": 0.20483914017677307, "num_input_tokens_seen": 1041176, "step": 1000, "train_runtime": 2854.7842, "train_tokens_per_second": 364.713 }, { "epoch": 0.42782348541510845, "grad_norm": 2.007951498031616, "learning_rate": 1.1477516059957175e-05, "loss": 0.11240419745445251, "num_input_tokens_seen": 1042066, "step": 1001, "train_runtime": 2856.9884, "train_tokens_per_second": 364.743 }, { "epoch": 0.42825088150443424, "grad_norm": 2.101724147796631, "learning_rate": 1.1468950749464668e-05, "loss": 0.19278055429458618, "num_input_tokens_seen": 1043372, "step": 1002, "train_runtime": 2859.2505, "train_tokens_per_second": 364.911 }, { "epoch": 0.42867827759376004, "grad_norm": 3.717116355895996, "learning_rate": 1.1460385438972164e-05, "loss": 0.16371259093284607, "num_input_tokens_seen": 1044332, "step": 1003, "train_runtime": 2861.3726, "train_tokens_per_second": 364.976 }, { "epoch": 0.4291056736830858, "grad_norm": 1.5768543481826782, "learning_rate": 1.1451820128479657e-05, "loss": 0.0704633817076683, "num_input_tokens_seen": 1045352, "step": 1004, "train_runtime": 2863.4887, "train_tokens_per_second": 365.062 }, { "epoch": 0.42953306977241157, "grad_norm": 2.1937477588653564, "learning_rate": 1.1443254817987153e-05, "loss": 0.16210992634296417, "num_input_tokens_seen": 1046092, "step": 1005, "train_runtime": 2865.5645, "train_tokens_per_second": 365.056 }, { "epoch": 0.42996046586173736, "grad_norm": 3.0632998943328857, "learning_rate": 1.1434689507494648e-05, "loss": 0.19956105947494507, "num_input_tokens_seen": 1046896, "step": 1006, "train_runtime": 2867.6866, "train_tokens_per_second": 365.066 }, { "epoch": 0.43038786195106316, "grad_norm": 3.1376841068267822, "learning_rate": 1.1426124197002141e-05, "loss": 0.16229747235774994, "num_input_tokens_seen": 1047566, "step": 1007, "train_runtime": 2869.7496, "train_tokens_per_second": 365.037 }, { "epoch": 0.43081525804038895, "grad_norm": 4.404557228088379, "learning_rate": 1.1417558886509637e-05, "loss": 0.11602835357189178, "num_input_tokens_seen": 1048180, "step": 1008, "train_runtime": 2871.8084, "train_tokens_per_second": 364.99 }, { "epoch": 0.4312426541297147, "grad_norm": 2.989595890045166, "learning_rate": 1.140899357601713e-05, "loss": 0.2091883420944214, "num_input_tokens_seen": 1049332, "step": 1009, "train_runtime": 2873.9932, "train_tokens_per_second": 365.113 }, { "epoch": 0.4316700502190405, "grad_norm": 3.529862642288208, "learning_rate": 1.1400428265524626e-05, "loss": 0.12193688750267029, "num_input_tokens_seen": 1049910, "step": 1010, "train_runtime": 2876.0147, "train_tokens_per_second": 365.057 }, { "epoch": 0.4320974463083663, "grad_norm": 2.3281264305114746, "learning_rate": 1.1391862955032121e-05, "loss": 0.14594826102256775, "num_input_tokens_seen": 1051190, "step": 1011, "train_runtime": 2878.2689, "train_tokens_per_second": 365.216 }, { "epoch": 0.43252484239769207, "grad_norm": 2.4456586837768555, "learning_rate": 1.1383297644539614e-05, "loss": 0.1984366774559021, "num_input_tokens_seen": 1052216, "step": 1012, "train_runtime": 2880.4547, "train_tokens_per_second": 365.295 }, { "epoch": 0.43295223848701786, "grad_norm": 2.46181321144104, "learning_rate": 1.137473233404711e-05, "loss": 0.13264615833759308, "num_input_tokens_seen": 1053108, "step": 1013, "train_runtime": 2882.5596, "train_tokens_per_second": 365.338 }, { "epoch": 0.43337963457634365, "grad_norm": 3.1830193996429443, "learning_rate": 1.1366167023554603e-05, "loss": 0.1790146380662918, "num_input_tokens_seen": 1053874, "step": 1014, "train_runtime": 2884.6708, "train_tokens_per_second": 365.336 }, { "epoch": 0.4338070306656694, "grad_norm": 1.321878433227539, "learning_rate": 1.1357601713062099e-05, "loss": 0.06271042674779892, "num_input_tokens_seen": 1055180, "step": 1015, "train_runtime": 2886.8794, "train_tokens_per_second": 365.509 }, { "epoch": 0.4342344267549952, "grad_norm": 2.5585038661956787, "learning_rate": 1.1349036402569594e-05, "loss": 0.09212590754032135, "num_input_tokens_seen": 1055904, "step": 1016, "train_runtime": 2888.9386, "train_tokens_per_second": 365.499 }, { "epoch": 0.434661822844321, "grad_norm": 2.3073716163635254, "learning_rate": 1.1340471092077087e-05, "loss": 0.14243914186954498, "num_input_tokens_seen": 1056978, "step": 1017, "train_runtime": 2891.1254, "train_tokens_per_second": 365.594 }, { "epoch": 0.43508921893364677, "grad_norm": 4.160744667053223, "learning_rate": 1.1331905781584583e-05, "loss": 0.17852286994457245, "num_input_tokens_seen": 1058052, "step": 1018, "train_runtime": 2893.2935, "train_tokens_per_second": 365.691 }, { "epoch": 0.43551661502297256, "grad_norm": 1.745357632637024, "learning_rate": 1.132334047109208e-05, "loss": 0.07179614156484604, "num_input_tokens_seen": 1058838, "step": 1019, "train_runtime": 2895.3654, "train_tokens_per_second": 365.701 }, { "epoch": 0.4359440111122983, "grad_norm": 2.5044443607330322, "learning_rate": 1.1314775160599573e-05, "loss": 0.08159780502319336, "num_input_tokens_seen": 1059646, "step": 1020, "train_runtime": 2897.4796, "train_tokens_per_second": 365.713 }, { "epoch": 0.4363714072016241, "grad_norm": 1.9943795204162598, "learning_rate": 1.1306209850107069e-05, "loss": 0.1532469242811203, "num_input_tokens_seen": 1060874, "step": 1021, "train_runtime": 2913.0868, "train_tokens_per_second": 364.175 }, { "epoch": 0.4367988032909499, "grad_norm": 4.59913444519043, "learning_rate": 1.1297644539614562e-05, "loss": 0.1994732767343521, "num_input_tokens_seen": 1061970, "step": 1022, "train_runtime": 2915.298, "train_tokens_per_second": 364.275 }, { "epoch": 0.4372261993802757, "grad_norm": 2.5817437171936035, "learning_rate": 1.1289079229122057e-05, "loss": 0.18294461071491241, "num_input_tokens_seen": 1063252, "step": 1023, "train_runtime": 2917.5125, "train_tokens_per_second": 364.438 }, { "epoch": 0.4376535954696015, "grad_norm": 2.9953930377960205, "learning_rate": 1.1280513918629553e-05, "loss": 0.15931539237499237, "num_input_tokens_seen": 1063910, "step": 1024, "train_runtime": 2919.5918, "train_tokens_per_second": 364.404 }, { "epoch": 0.4380809915589272, "grad_norm": 2.173919200897217, "learning_rate": 1.1271948608137046e-05, "loss": 0.09014363586902618, "num_input_tokens_seen": 1065248, "step": 1025, "train_runtime": 2921.8322, "train_tokens_per_second": 364.582 }, { "epoch": 0.438508387648253, "grad_norm": 2.3778066635131836, "learning_rate": 1.1263383297644542e-05, "loss": 0.10724397748708725, "num_input_tokens_seen": 1065962, "step": 1026, "train_runtime": 2923.9139, "train_tokens_per_second": 364.567 }, { "epoch": 0.4389357837375788, "grad_norm": 2.372450113296509, "learning_rate": 1.1254817987152035e-05, "loss": 0.15932433307170868, "num_input_tokens_seen": 1067372, "step": 1027, "train_runtime": 2926.1565, "train_tokens_per_second": 364.769 }, { "epoch": 0.4393631798269046, "grad_norm": 2.3470299243927, "learning_rate": 1.124625267665953e-05, "loss": 0.1394292265176773, "num_input_tokens_seen": 1068310, "step": 1028, "train_runtime": 2928.2728, "train_tokens_per_second": 364.826 }, { "epoch": 0.4397905759162304, "grad_norm": 1.7886719703674316, "learning_rate": 1.1237687366167026e-05, "loss": 0.1035194993019104, "num_input_tokens_seen": 1069292, "step": 1029, "train_runtime": 2930.4415, "train_tokens_per_second": 364.891 }, { "epoch": 0.4402179720055561, "grad_norm": 2.1555051803588867, "learning_rate": 1.122912205567452e-05, "loss": 0.0789809301495552, "num_input_tokens_seen": 1070098, "step": 1030, "train_runtime": 2932.5988, "train_tokens_per_second": 364.898 }, { "epoch": 0.4406453680948819, "grad_norm": 2.104384422302246, "learning_rate": 1.1220556745182015e-05, "loss": 0.12144552916288376, "num_input_tokens_seen": 1071068, "step": 1031, "train_runtime": 2934.8096, "train_tokens_per_second": 364.953 }, { "epoch": 0.4410727641842077, "grad_norm": 2.4359829425811768, "learning_rate": 1.1211991434689508e-05, "loss": 0.1290377676486969, "num_input_tokens_seen": 1072092, "step": 1032, "train_runtime": 2936.9753, "train_tokens_per_second": 365.033 }, { "epoch": 0.4415001602735335, "grad_norm": 2.328812837600708, "learning_rate": 1.1203426124197003e-05, "loss": 0.10095620155334473, "num_input_tokens_seen": 1072790, "step": 1033, "train_runtime": 2939.0612, "train_tokens_per_second": 365.011 }, { "epoch": 0.4419275563628593, "grad_norm": 2.474679708480835, "learning_rate": 1.1194860813704497e-05, "loss": 0.11916765570640564, "num_input_tokens_seen": 1073782, "step": 1034, "train_runtime": 2941.1466, "train_tokens_per_second": 365.09 }, { "epoch": 0.44235495245218504, "grad_norm": 2.29829740524292, "learning_rate": 1.1186295503211992e-05, "loss": 0.15321902930736542, "num_input_tokens_seen": 1074934, "step": 1035, "train_runtime": 2943.3069, "train_tokens_per_second": 365.213 }, { "epoch": 0.44278234854151083, "grad_norm": 2.1527915000915527, "learning_rate": 1.1177730192719488e-05, "loss": 0.1675380915403366, "num_input_tokens_seen": 1076546, "step": 1036, "train_runtime": 2945.5988, "train_tokens_per_second": 365.476 }, { "epoch": 0.4432097446308366, "grad_norm": 3.6376171112060547, "learning_rate": 1.1169164882226981e-05, "loss": 0.15351618826389313, "num_input_tokens_seen": 1077670, "step": 1037, "train_runtime": 2947.8307, "train_tokens_per_second": 365.581 }, { "epoch": 0.4436371407201624, "grad_norm": 1.8380637168884277, "learning_rate": 1.1160599571734476e-05, "loss": 0.10283884406089783, "num_input_tokens_seen": 1079310, "step": 1038, "train_runtime": 2950.1898, "train_tokens_per_second": 365.844 }, { "epoch": 0.4440645368094882, "grad_norm": 2.646578788757324, "learning_rate": 1.115203426124197e-05, "loss": 0.12246552854776382, "num_input_tokens_seen": 1080016, "step": 1039, "train_runtime": 2952.2349, "train_tokens_per_second": 365.83 }, { "epoch": 0.444491932898814, "grad_norm": 1.944064736366272, "learning_rate": 1.1143468950749465e-05, "loss": 0.11806921660900116, "num_input_tokens_seen": 1080900, "step": 1040, "train_runtime": 2954.3633, "train_tokens_per_second": 365.866 }, { "epoch": 0.44491932898813974, "grad_norm": 1.831027865409851, "learning_rate": 1.113490364025696e-05, "loss": 0.15034857392311096, "num_input_tokens_seen": 1082256, "step": 1041, "train_runtime": 2956.5899, "train_tokens_per_second": 366.049 }, { "epoch": 0.44534672507746553, "grad_norm": 1.867666244506836, "learning_rate": 1.1126338329764454e-05, "loss": 0.09922873973846436, "num_input_tokens_seen": 1083402, "step": 1042, "train_runtime": 2958.7383, "train_tokens_per_second": 366.17 }, { "epoch": 0.4457741211667913, "grad_norm": 2.910398483276367, "learning_rate": 1.111777301927195e-05, "loss": 0.1403721123933792, "num_input_tokens_seen": 1084648, "step": 1043, "train_runtime": 2960.921, "train_tokens_per_second": 366.321 }, { "epoch": 0.4462015172561171, "grad_norm": 2.1557788848876953, "learning_rate": 1.1109207708779443e-05, "loss": 0.15659849345684052, "num_input_tokens_seen": 1085474, "step": 1044, "train_runtime": 2963.0172, "train_tokens_per_second": 366.341 }, { "epoch": 0.4466289133454429, "grad_norm": 2.6440045833587646, "learning_rate": 1.1100642398286938e-05, "loss": 0.10428372025489807, "num_input_tokens_seen": 1086270, "step": 1045, "train_runtime": 2965.1173, "train_tokens_per_second": 366.35 }, { "epoch": 0.44705630943476865, "grad_norm": 2.734485626220703, "learning_rate": 1.1092077087794434e-05, "loss": 0.10328982025384903, "num_input_tokens_seen": 1086938, "step": 1046, "train_runtime": 2967.1437, "train_tokens_per_second": 366.325 }, { "epoch": 0.44748370552409444, "grad_norm": 3.2563228607177734, "learning_rate": 1.1083511777301927e-05, "loss": 0.17912891507148743, "num_input_tokens_seen": 1087992, "step": 1047, "train_runtime": 2969.2902, "train_tokens_per_second": 366.415 }, { "epoch": 0.44791110161342024, "grad_norm": 1.6207832098007202, "learning_rate": 1.1074946466809422e-05, "loss": 0.06897982954978943, "num_input_tokens_seen": 1088910, "step": 1048, "train_runtime": 2971.4223, "train_tokens_per_second": 366.461 }, { "epoch": 0.44833849770274603, "grad_norm": 1.9480711221694946, "learning_rate": 1.1066381156316916e-05, "loss": 0.09259622544050217, "num_input_tokens_seen": 1090138, "step": 1049, "train_runtime": 2973.6208, "train_tokens_per_second": 366.603 }, { "epoch": 0.4487658937920718, "grad_norm": 2.1772654056549072, "learning_rate": 1.1057815845824411e-05, "loss": 0.1047675758600235, "num_input_tokens_seen": 1091126, "step": 1050, "train_runtime": 2975.7483, "train_tokens_per_second": 366.673 }, { "epoch": 0.44919328988139756, "grad_norm": 2.8259315490722656, "learning_rate": 1.1049250535331907e-05, "loss": 0.19120723009109497, "num_input_tokens_seen": 1092242, "step": 1051, "train_runtime": 2990.9356, "train_tokens_per_second": 365.184 }, { "epoch": 0.44962068597072335, "grad_norm": 1.824228048324585, "learning_rate": 1.10406852248394e-05, "loss": 0.10952670872211456, "num_input_tokens_seen": 1093496, "step": 1052, "train_runtime": 2993.0929, "train_tokens_per_second": 365.34 }, { "epoch": 0.45004808206004915, "grad_norm": 2.141660451889038, "learning_rate": 1.1032119914346895e-05, "loss": 0.1616465002298355, "num_input_tokens_seen": 1094654, "step": 1053, "train_runtime": 2995.2837, "train_tokens_per_second": 365.459 }, { "epoch": 0.45047547814937494, "grad_norm": 1.8521132469177246, "learning_rate": 1.1023554603854392e-05, "loss": 0.09414944797754288, "num_input_tokens_seen": 1095680, "step": 1054, "train_runtime": 2997.4303, "train_tokens_per_second": 365.54 }, { "epoch": 0.45090287423870073, "grad_norm": 1.6091750860214233, "learning_rate": 1.1014989293361886e-05, "loss": 0.08558227866888046, "num_input_tokens_seen": 1097010, "step": 1055, "train_runtime": 2999.7884, "train_tokens_per_second": 365.696 }, { "epoch": 0.4513302703280265, "grad_norm": 2.276839017868042, "learning_rate": 1.1006423982869381e-05, "loss": 0.20166617631912231, "num_input_tokens_seen": 1098134, "step": 1056, "train_runtime": 3001.9255, "train_tokens_per_second": 365.81 }, { "epoch": 0.45175766641735227, "grad_norm": 1.6320018768310547, "learning_rate": 1.0997858672376875e-05, "loss": 0.1162157654762268, "num_input_tokens_seen": 1099590, "step": 1057, "train_runtime": 3004.1444, "train_tokens_per_second": 366.024 }, { "epoch": 0.45218506250667806, "grad_norm": 1.558932900428772, "learning_rate": 1.098929336188437e-05, "loss": 0.11004027724266052, "num_input_tokens_seen": 1100842, "step": 1058, "train_runtime": 3006.3288, "train_tokens_per_second": 366.175 }, { "epoch": 0.45261245859600385, "grad_norm": 2.182382345199585, "learning_rate": 1.0980728051391865e-05, "loss": 0.18455377221107483, "num_input_tokens_seen": 1102114, "step": 1059, "train_runtime": 3008.5152, "train_tokens_per_second": 366.332 }, { "epoch": 0.45303985468532965, "grad_norm": 2.592876434326172, "learning_rate": 1.0972162740899359e-05, "loss": 0.18765489757061005, "num_input_tokens_seen": 1103470, "step": 1060, "train_runtime": 3010.6979, "train_tokens_per_second": 366.516 }, { "epoch": 0.45346725077465544, "grad_norm": 1.8901042938232422, "learning_rate": 1.0963597430406854e-05, "loss": 0.12126240134239197, "num_input_tokens_seen": 1104796, "step": 1061, "train_runtime": 3012.9098, "train_tokens_per_second": 366.687 }, { "epoch": 0.4538946468639812, "grad_norm": 2.3836684226989746, "learning_rate": 1.0955032119914348e-05, "loss": 0.12577548623085022, "num_input_tokens_seen": 1105546, "step": 1062, "train_runtime": 3014.9733, "train_tokens_per_second": 366.685 }, { "epoch": 0.45432204295330697, "grad_norm": 1.5718857049942017, "learning_rate": 1.0946466809421843e-05, "loss": 0.08655619621276855, "num_input_tokens_seen": 1106758, "step": 1063, "train_runtime": 3017.1608, "train_tokens_per_second": 366.821 }, { "epoch": 0.45474943904263276, "grad_norm": 2.2731409072875977, "learning_rate": 1.0937901498929337e-05, "loss": 0.13003753125667572, "num_input_tokens_seen": 1107616, "step": 1064, "train_runtime": 3019.3935, "train_tokens_per_second": 366.834 }, { "epoch": 0.45517683513195856, "grad_norm": 3.5689444541931152, "learning_rate": 1.0929336188436832e-05, "loss": 0.09496916830539703, "num_input_tokens_seen": 1108174, "step": 1065, "train_runtime": 3021.3915, "train_tokens_per_second": 366.776 }, { "epoch": 0.45560423122128435, "grad_norm": 2.9368834495544434, "learning_rate": 1.0920770877944327e-05, "loss": 0.2679440677165985, "num_input_tokens_seen": 1109014, "step": 1066, "train_runtime": 3023.4792, "train_tokens_per_second": 366.801 }, { "epoch": 0.4560316273106101, "grad_norm": 2.8692476749420166, "learning_rate": 1.091220556745182e-05, "loss": 0.16424307227134705, "num_input_tokens_seen": 1110314, "step": 1067, "train_runtime": 3025.6513, "train_tokens_per_second": 366.967 }, { "epoch": 0.4564590233999359, "grad_norm": 2.4772162437438965, "learning_rate": 1.0903640256959316e-05, "loss": 0.12424961477518082, "num_input_tokens_seen": 1111590, "step": 1068, "train_runtime": 3027.8209, "train_tokens_per_second": 367.125 }, { "epoch": 0.4568864194892617, "grad_norm": 2.8363404273986816, "learning_rate": 1.089507494646681e-05, "loss": 0.12491759657859802, "num_input_tokens_seen": 1112282, "step": 1069, "train_runtime": 3029.8464, "train_tokens_per_second": 367.108 }, { "epoch": 0.45731381557858747, "grad_norm": 1.4680448770523071, "learning_rate": 1.0886509635974305e-05, "loss": 0.07281026244163513, "num_input_tokens_seen": 1113702, "step": 1070, "train_runtime": 3032.0177, "train_tokens_per_second": 367.314 }, { "epoch": 0.45774121166791326, "grad_norm": 1.8230019807815552, "learning_rate": 1.08779443254818e-05, "loss": 0.10621557384729385, "num_input_tokens_seen": 1114542, "step": 1071, "train_runtime": 3034.1174, "train_tokens_per_second": 367.336 }, { "epoch": 0.458168607757239, "grad_norm": 2.3857197761535645, "learning_rate": 1.0869379014989294e-05, "loss": 0.16738727688789368, "num_input_tokens_seen": 1115466, "step": 1072, "train_runtime": 3036.2895, "train_tokens_per_second": 367.378 }, { "epoch": 0.4585960038465648, "grad_norm": 4.6233720779418945, "learning_rate": 1.0860813704496789e-05, "loss": 0.11537289619445801, "num_input_tokens_seen": 1116862, "step": 1073, "train_runtime": 3038.5363, "train_tokens_per_second": 367.566 }, { "epoch": 0.4590233999358906, "grad_norm": 2.1452343463897705, "learning_rate": 1.0852248394004283e-05, "loss": 0.12661448121070862, "num_input_tokens_seen": 1117870, "step": 1074, "train_runtime": 3040.7798, "train_tokens_per_second": 367.626 }, { "epoch": 0.4594507960252164, "grad_norm": 3.0242512226104736, "learning_rate": 1.0843683083511778e-05, "loss": 0.16758795082569122, "num_input_tokens_seen": 1118678, "step": 1075, "train_runtime": 3042.9225, "train_tokens_per_second": 367.633 }, { "epoch": 0.4598781921145422, "grad_norm": 2.6538290977478027, "learning_rate": 1.0835117773019273e-05, "loss": 0.1627570390701294, "num_input_tokens_seen": 1119906, "step": 1076, "train_runtime": 3045.1219, "train_tokens_per_second": 367.771 }, { "epoch": 0.4603055882038679, "grad_norm": 2.2172136306762695, "learning_rate": 1.0826552462526767e-05, "loss": 0.12060604244470596, "num_input_tokens_seen": 1120874, "step": 1077, "train_runtime": 3047.2954, "train_tokens_per_second": 367.826 }, { "epoch": 0.4607329842931937, "grad_norm": 2.375690460205078, "learning_rate": 1.0817987152034262e-05, "loss": 0.1466825008392334, "num_input_tokens_seen": 1122506, "step": 1078, "train_runtime": 3049.59, "train_tokens_per_second": 368.084 }, { "epoch": 0.4611603803825195, "grad_norm": 2.18188738822937, "learning_rate": 1.0809421841541756e-05, "loss": 0.0772302970290184, "num_input_tokens_seen": 1123354, "step": 1079, "train_runtime": 3051.7196, "train_tokens_per_second": 368.105 }, { "epoch": 0.4615877764718453, "grad_norm": 1.4447216987609863, "learning_rate": 1.0800856531049251e-05, "loss": 0.08115194737911224, "num_input_tokens_seen": 1124486, "step": 1080, "train_runtime": 3053.9253, "train_tokens_per_second": 368.21 }, { "epoch": 0.4620151725611711, "grad_norm": 2.4211366176605225, "learning_rate": 1.0792291220556746e-05, "loss": 0.11334526538848877, "num_input_tokens_seen": 1125286, "step": 1081, "train_runtime": 3070.1898, "train_tokens_per_second": 366.52 }, { "epoch": 0.4624425686504968, "grad_norm": 2.6062674522399902, "learning_rate": 1.078372591006424e-05, "loss": 0.1145646870136261, "num_input_tokens_seen": 1126018, "step": 1082, "train_runtime": 3072.2748, "train_tokens_per_second": 366.51 }, { "epoch": 0.4628699647398226, "grad_norm": 1.9511116743087769, "learning_rate": 1.0775160599571735e-05, "loss": 0.10692603141069412, "num_input_tokens_seen": 1127760, "step": 1083, "train_runtime": 3074.6243, "train_tokens_per_second": 366.796 }, { "epoch": 0.4632973608291484, "grad_norm": 2.446035146713257, "learning_rate": 1.0766595289079229e-05, "loss": 0.11498267203569412, "num_input_tokens_seen": 1128962, "step": 1084, "train_runtime": 3076.8555, "train_tokens_per_second": 366.921 }, { "epoch": 0.4637247569184742, "grad_norm": 2.390343427658081, "learning_rate": 1.0758029978586724e-05, "loss": 0.13486668467521667, "num_input_tokens_seen": 1129876, "step": 1085, "train_runtime": 3078.9818, "train_tokens_per_second": 366.964 }, { "epoch": 0.4641521530078, "grad_norm": 1.583939552307129, "learning_rate": 1.0749464668094217e-05, "loss": 0.09260902553796768, "num_input_tokens_seen": 1130876, "step": 1086, "train_runtime": 3081.1323, "train_tokens_per_second": 367.033 }, { "epoch": 0.4645795490971258, "grad_norm": 2.4491169452667236, "learning_rate": 1.0740899357601713e-05, "loss": 0.16372451186180115, "num_input_tokens_seen": 1131882, "step": 1087, "train_runtime": 3083.2554, "train_tokens_per_second": 367.106 }, { "epoch": 0.4650069451864515, "grad_norm": 3.116499900817871, "learning_rate": 1.073233404710921e-05, "loss": 0.14371392130851746, "num_input_tokens_seen": 1132664, "step": 1088, "train_runtime": 3085.3704, "train_tokens_per_second": 367.108 }, { "epoch": 0.4654343412757773, "grad_norm": 2.468092918395996, "learning_rate": 1.0723768736616705e-05, "loss": 0.12379740178585052, "num_input_tokens_seen": 1133980, "step": 1089, "train_runtime": 3087.6302, "train_tokens_per_second": 367.265 }, { "epoch": 0.4658617373651031, "grad_norm": 1.451298475265503, "learning_rate": 1.0715203426124199e-05, "loss": 0.053941965103149414, "num_input_tokens_seen": 1134990, "step": 1090, "train_runtime": 3089.7509, "train_tokens_per_second": 367.34 }, { "epoch": 0.4662891334544289, "grad_norm": 1.9774813652038574, "learning_rate": 1.0706638115631694e-05, "loss": 0.10296866297721863, "num_input_tokens_seen": 1135714, "step": 1091, "train_runtime": 3091.8237, "train_tokens_per_second": 367.328 }, { "epoch": 0.4667165295437547, "grad_norm": 2.596663475036621, "learning_rate": 1.0698072805139187e-05, "loss": 0.13426145911216736, "num_input_tokens_seen": 1136538, "step": 1092, "train_runtime": 3093.928, "train_tokens_per_second": 367.345 }, { "epoch": 0.46714392563308044, "grad_norm": 2.1434266567230225, "learning_rate": 1.0689507494646683e-05, "loss": 0.12617084383964539, "num_input_tokens_seen": 1137472, "step": 1093, "train_runtime": 3096.061, "train_tokens_per_second": 367.393 }, { "epoch": 0.46757132172240623, "grad_norm": 3.238490581512451, "learning_rate": 1.0680942184154178e-05, "loss": 0.15265128016471863, "num_input_tokens_seen": 1138134, "step": 1094, "train_runtime": 3098.1577, "train_tokens_per_second": 367.358 }, { "epoch": 0.467998717811732, "grad_norm": 2.070523977279663, "learning_rate": 1.0672376873661672e-05, "loss": 0.14197435975074768, "num_input_tokens_seen": 1139682, "step": 1095, "train_runtime": 3100.4517, "train_tokens_per_second": 367.586 }, { "epoch": 0.4684261139010578, "grad_norm": 2.5459415912628174, "learning_rate": 1.0663811563169167e-05, "loss": 0.09419140964746475, "num_input_tokens_seen": 1140220, "step": 1096, "train_runtime": 3102.4968, "train_tokens_per_second": 367.517 }, { "epoch": 0.4688535099903836, "grad_norm": 2.419487953186035, "learning_rate": 1.065524625267666e-05, "loss": 0.19436462223529816, "num_input_tokens_seen": 1141284, "step": 1097, "train_runtime": 3104.689, "train_tokens_per_second": 367.6 }, { "epoch": 0.46928090607970935, "grad_norm": 1.9916590452194214, "learning_rate": 1.0646680942184156e-05, "loss": 0.13321715593338013, "num_input_tokens_seen": 1142276, "step": 1098, "train_runtime": 3106.8078, "train_tokens_per_second": 367.669 }, { "epoch": 0.46970830216903514, "grad_norm": 1.3479835987091064, "learning_rate": 1.063811563169165e-05, "loss": 0.09444232285022736, "num_input_tokens_seen": 1143250, "step": 1099, "train_runtime": 3108.97, "train_tokens_per_second": 367.726 }, { "epoch": 0.47013569825836093, "grad_norm": 1.55136239528656, "learning_rate": 1.0629550321199145e-05, "loss": 0.10088896751403809, "num_input_tokens_seen": 1144518, "step": 1100, "train_runtime": 3111.1929, "train_tokens_per_second": 367.871 }, { "epoch": 0.47056309434768673, "grad_norm": 4.632813453674316, "learning_rate": 1.062098501070664e-05, "loss": 0.10315786302089691, "num_input_tokens_seen": 1145362, "step": 1101, "train_runtime": 3113.3188, "train_tokens_per_second": 367.891 }, { "epoch": 0.4709904904370125, "grad_norm": 2.549478054046631, "learning_rate": 1.0612419700214133e-05, "loss": 0.12106387317180634, "num_input_tokens_seen": 1146036, "step": 1102, "train_runtime": 3115.4203, "train_tokens_per_second": 367.859 }, { "epoch": 0.47141788652633826, "grad_norm": 3.3118948936462402, "learning_rate": 1.0603854389721629e-05, "loss": 0.1757216453552246, "num_input_tokens_seen": 1146846, "step": 1103, "train_runtime": 3117.5255, "train_tokens_per_second": 367.871 }, { "epoch": 0.47184528261566405, "grad_norm": 1.837897539138794, "learning_rate": 1.0595289079229122e-05, "loss": 0.09451344609260559, "num_input_tokens_seen": 1147790, "step": 1104, "train_runtime": 3119.6523, "train_tokens_per_second": 367.922 }, { "epoch": 0.47227267870498985, "grad_norm": 3.738784074783325, "learning_rate": 1.0586723768736618e-05, "loss": 0.13079151511192322, "num_input_tokens_seen": 1148852, "step": 1105, "train_runtime": 3121.8775, "train_tokens_per_second": 368.0 }, { "epoch": 0.47270007479431564, "grad_norm": 2.2785274982452393, "learning_rate": 1.0578158458244113e-05, "loss": 0.12945371866226196, "num_input_tokens_seen": 1149814, "step": 1106, "train_runtime": 3124.0366, "train_tokens_per_second": 368.054 }, { "epoch": 0.47312747088364143, "grad_norm": 2.037738084793091, "learning_rate": 1.0569593147751606e-05, "loss": 0.16386261582374573, "num_input_tokens_seen": 1150958, "step": 1107, "train_runtime": 3126.2366, "train_tokens_per_second": 368.161 }, { "epoch": 0.47355486697296717, "grad_norm": 2.0729997158050537, "learning_rate": 1.0561027837259102e-05, "loss": 0.08901626616716385, "num_input_tokens_seen": 1152078, "step": 1108, "train_runtime": 3128.4068, "train_tokens_per_second": 368.263 }, { "epoch": 0.47398226306229296, "grad_norm": 2.2841851711273193, "learning_rate": 1.0552462526766595e-05, "loss": 0.11797398328781128, "num_input_tokens_seen": 1153404, "step": 1109, "train_runtime": 3130.6683, "train_tokens_per_second": 368.421 }, { "epoch": 0.47440965915161876, "grad_norm": 3.03964900970459, "learning_rate": 1.054389721627409e-05, "loss": 0.18599331378936768, "num_input_tokens_seen": 1154246, "step": 1110, "train_runtime": 3132.8076, "train_tokens_per_second": 368.438 }, { "epoch": 0.47483705524094455, "grad_norm": 3.625915050506592, "learning_rate": 1.0535331905781586e-05, "loss": 0.2271270602941513, "num_input_tokens_seen": 1155348, "step": 1111, "train_runtime": 3147.8775, "train_tokens_per_second": 367.024 }, { "epoch": 0.47526445133027034, "grad_norm": 3.42933988571167, "learning_rate": 1.052676659528908e-05, "loss": 0.09430833160877228, "num_input_tokens_seen": 1156148, "step": 1112, "train_runtime": 3149.9436, "train_tokens_per_second": 367.038 }, { "epoch": 0.47569184741959614, "grad_norm": 2.2719924449920654, "learning_rate": 1.0518201284796575e-05, "loss": 0.13242411613464355, "num_input_tokens_seen": 1156964, "step": 1113, "train_runtime": 3152.0398, "train_tokens_per_second": 367.052 }, { "epoch": 0.4761192435089219, "grad_norm": 1.6996687650680542, "learning_rate": 1.0509635974304068e-05, "loss": 0.08433227241039276, "num_input_tokens_seen": 1157788, "step": 1114, "train_runtime": 3154.1745, "train_tokens_per_second": 367.065 }, { "epoch": 0.47654663959824767, "grad_norm": 2.469897985458374, "learning_rate": 1.0501070663811564e-05, "loss": 0.09990245848894119, "num_input_tokens_seen": 1159104, "step": 1115, "train_runtime": 3156.4218, "train_tokens_per_second": 367.221 }, { "epoch": 0.47697403568757346, "grad_norm": 1.3250545263290405, "learning_rate": 1.0492505353319057e-05, "loss": 0.053221769630908966, "num_input_tokens_seen": 1160388, "step": 1116, "train_runtime": 3158.6599, "train_tokens_per_second": 367.367 }, { "epoch": 0.47740143177689925, "grad_norm": 3.156811237335205, "learning_rate": 1.0483940042826552e-05, "loss": 0.13681703805923462, "num_input_tokens_seen": 1161552, "step": 1117, "train_runtime": 3160.8441, "train_tokens_per_second": 367.482 }, { "epoch": 0.47782882786622505, "grad_norm": 3.4449303150177, "learning_rate": 1.0475374732334048e-05, "loss": 0.2021254450082779, "num_input_tokens_seen": 1162296, "step": 1118, "train_runtime": 3162.9156, "train_tokens_per_second": 367.476 }, { "epoch": 0.4782562239555508, "grad_norm": 1.5247373580932617, "learning_rate": 1.0466809421841541e-05, "loss": 0.06591279059648514, "num_input_tokens_seen": 1163414, "step": 1119, "train_runtime": 3165.0979, "train_tokens_per_second": 367.576 }, { "epoch": 0.4786836200448766, "grad_norm": 2.635410785675049, "learning_rate": 1.0458244111349037e-05, "loss": 0.12360203266143799, "num_input_tokens_seen": 1164268, "step": 1120, "train_runtime": 3167.1809, "train_tokens_per_second": 367.604 }, { "epoch": 0.47911101613420237, "grad_norm": 3.1594529151916504, "learning_rate": 1.044967880085653e-05, "loss": 0.13957934081554413, "num_input_tokens_seen": 1164864, "step": 1121, "train_runtime": 3169.239, "train_tokens_per_second": 367.553 }, { "epoch": 0.47953841222352817, "grad_norm": 1.9089677333831787, "learning_rate": 1.0441113490364027e-05, "loss": 0.11070516705513, "num_input_tokens_seen": 1165722, "step": 1122, "train_runtime": 3171.3625, "train_tokens_per_second": 367.578 }, { "epoch": 0.47996580831285396, "grad_norm": 2.39133620262146, "learning_rate": 1.0432548179871522e-05, "loss": 0.16337795555591583, "num_input_tokens_seen": 1166924, "step": 1123, "train_runtime": 3173.6169, "train_tokens_per_second": 367.695 }, { "epoch": 0.4803932044021797, "grad_norm": 1.8524043560028076, "learning_rate": 1.0423982869379018e-05, "loss": 0.08679244667291641, "num_input_tokens_seen": 1168254, "step": 1124, "train_runtime": 3175.8685, "train_tokens_per_second": 367.853 }, { "epoch": 0.4808206004915055, "grad_norm": 4.792642593383789, "learning_rate": 1.0415417558886511e-05, "loss": 0.1343933343887329, "num_input_tokens_seen": 1168950, "step": 1125, "train_runtime": 3177.965, "train_tokens_per_second": 367.83 }, { "epoch": 0.4812479965808313, "grad_norm": 1.6893730163574219, "learning_rate": 1.0406852248394007e-05, "loss": 0.07165629416704178, "num_input_tokens_seen": 1169718, "step": 1126, "train_runtime": 3180.0567, "train_tokens_per_second": 367.829 }, { "epoch": 0.4816753926701571, "grad_norm": 1.994897723197937, "learning_rate": 1.03982869379015e-05, "loss": 0.09306542575359344, "num_input_tokens_seen": 1171080, "step": 1127, "train_runtime": 3182.2775, "train_tokens_per_second": 368.001 }, { "epoch": 0.48210278875948287, "grad_norm": 2.575477361679077, "learning_rate": 1.0389721627408995e-05, "loss": 0.1872159242630005, "num_input_tokens_seen": 1171958, "step": 1128, "train_runtime": 3184.4013, "train_tokens_per_second": 368.031 }, { "epoch": 0.4825301848488086, "grad_norm": 2.260321617126465, "learning_rate": 1.0381156316916489e-05, "loss": 0.16318023204803467, "num_input_tokens_seen": 1173202, "step": 1129, "train_runtime": 3186.6203, "train_tokens_per_second": 368.165 }, { "epoch": 0.4829575809381344, "grad_norm": 2.7041776180267334, "learning_rate": 1.0372591006423984e-05, "loss": 0.19572733342647552, "num_input_tokens_seen": 1173970, "step": 1130, "train_runtime": 3188.719, "train_tokens_per_second": 368.164 }, { "epoch": 0.4833849770274602, "grad_norm": 1.9783432483673096, "learning_rate": 1.036402569593148e-05, "loss": 0.06867708265781403, "num_input_tokens_seen": 1174890, "step": 1131, "train_runtime": 3190.8409, "train_tokens_per_second": 368.207 }, { "epoch": 0.483812373116786, "grad_norm": 2.4956705570220947, "learning_rate": 1.0355460385438973e-05, "loss": 0.1676766276359558, "num_input_tokens_seen": 1175908, "step": 1132, "train_runtime": 3192.9713, "train_tokens_per_second": 368.28 }, { "epoch": 0.4842397692061118, "grad_norm": 2.4380836486816406, "learning_rate": 1.0346895074946468e-05, "loss": 0.130941241979599, "num_input_tokens_seen": 1176818, "step": 1133, "train_runtime": 3195.0573, "train_tokens_per_second": 368.325 }, { "epoch": 0.4846671652954376, "grad_norm": 1.692651629447937, "learning_rate": 1.0338329764453962e-05, "loss": 0.10316933691501617, "num_input_tokens_seen": 1178280, "step": 1134, "train_runtime": 3197.3389, "train_tokens_per_second": 368.519 }, { "epoch": 0.4850945613847633, "grad_norm": 2.2024552822113037, "learning_rate": 1.0329764453961457e-05, "loss": 0.12320204079151154, "num_input_tokens_seen": 1179326, "step": 1135, "train_runtime": 3199.5084, "train_tokens_per_second": 368.596 }, { "epoch": 0.4855219574740891, "grad_norm": 2.9768810272216797, "learning_rate": 1.0321199143468953e-05, "loss": 0.17908093333244324, "num_input_tokens_seen": 1180014, "step": 1136, "train_runtime": 3201.5969, "train_tokens_per_second": 368.57 }, { "epoch": 0.4859493535634149, "grad_norm": 2.0082342624664307, "learning_rate": 1.0312633832976446e-05, "loss": 0.11483009159564972, "num_input_tokens_seen": 1180960, "step": 1137, "train_runtime": 3203.7482, "train_tokens_per_second": 368.618 }, { "epoch": 0.4863767496527407, "grad_norm": 3.8423495292663574, "learning_rate": 1.0304068522483941e-05, "loss": 0.18052923679351807, "num_input_tokens_seen": 1182068, "step": 1138, "train_runtime": 3205.8882, "train_tokens_per_second": 368.718 }, { "epoch": 0.4868041457420665, "grad_norm": 2.5105783939361572, "learning_rate": 1.0295503211991435e-05, "loss": 0.1909502148628235, "num_input_tokens_seen": 1183120, "step": 1139, "train_runtime": 3208.0686, "train_tokens_per_second": 368.795 }, { "epoch": 0.4872315418313922, "grad_norm": 1.609243392944336, "learning_rate": 1.028693790149893e-05, "loss": 0.09171848744153976, "num_input_tokens_seen": 1183972, "step": 1140, "train_runtime": 3210.1499, "train_tokens_per_second": 368.821 }, { "epoch": 0.487658937920718, "grad_norm": 1.9343087673187256, "learning_rate": 1.0278372591006426e-05, "loss": 0.11184214800596237, "num_input_tokens_seen": 1185140, "step": 1141, "train_runtime": 3225.2393, "train_tokens_per_second": 367.458 }, { "epoch": 0.4880863340100438, "grad_norm": 3.0505564212799072, "learning_rate": 1.0269807280513919e-05, "loss": 0.16290581226348877, "num_input_tokens_seen": 1185734, "step": 1142, "train_runtime": 3227.3386, "train_tokens_per_second": 367.403 }, { "epoch": 0.4885137300993696, "grad_norm": 1.7151672840118408, "learning_rate": 1.0261241970021414e-05, "loss": 0.09398559480905533, "num_input_tokens_seen": 1186790, "step": 1143, "train_runtime": 3229.4989, "train_tokens_per_second": 367.484 }, { "epoch": 0.4889411261886954, "grad_norm": 2.7505619525909424, "learning_rate": 1.0252676659528908e-05, "loss": 0.10065597295761108, "num_input_tokens_seen": 1188504, "step": 1144, "train_runtime": 3231.8289, "train_tokens_per_second": 367.75 }, { "epoch": 0.48936852227802113, "grad_norm": 2.978128671646118, "learning_rate": 1.0244111349036403e-05, "loss": 0.14347213506698608, "num_input_tokens_seen": 1189264, "step": 1145, "train_runtime": 3234.0433, "train_tokens_per_second": 367.733 }, { "epoch": 0.4897959183673469, "grad_norm": 2.1196908950805664, "learning_rate": 1.0235546038543897e-05, "loss": 0.11893812566995621, "num_input_tokens_seen": 1190702, "step": 1146, "train_runtime": 3236.3048, "train_tokens_per_second": 367.92 }, { "epoch": 0.4902233144566727, "grad_norm": 1.6588690280914307, "learning_rate": 1.0226980728051392e-05, "loss": 0.07157114148139954, "num_input_tokens_seen": 1191380, "step": 1147, "train_runtime": 3238.3768, "train_tokens_per_second": 367.894 }, { "epoch": 0.4906507105459985, "grad_norm": 1.47933828830719, "learning_rate": 1.0218415417558887e-05, "loss": 0.0843658298254013, "num_input_tokens_seen": 1192598, "step": 1148, "train_runtime": 3240.5691, "train_tokens_per_second": 368.021 }, { "epoch": 0.4910781066353243, "grad_norm": 2.567176103591919, "learning_rate": 1.0209850107066381e-05, "loss": 0.1020476222038269, "num_input_tokens_seen": 1193422, "step": 1149, "train_runtime": 3242.6771, "train_tokens_per_second": 368.036 }, { "epoch": 0.49150550272465005, "grad_norm": 2.123541831970215, "learning_rate": 1.0201284796573876e-05, "loss": 0.11482197046279907, "num_input_tokens_seen": 1194250, "step": 1150, "train_runtime": 3244.767, "train_tokens_per_second": 368.054 }, { "epoch": 0.49193289881397584, "grad_norm": 1.6406511068344116, "learning_rate": 1.019271948608137e-05, "loss": 0.08300317823886871, "num_input_tokens_seen": 1195288, "step": 1151, "train_runtime": 3246.918, "train_tokens_per_second": 368.13 }, { "epoch": 0.49236029490330163, "grad_norm": 1.843297004699707, "learning_rate": 1.0184154175588865e-05, "loss": 0.11540532112121582, "num_input_tokens_seen": 1196658, "step": 1152, "train_runtime": 3249.1468, "train_tokens_per_second": 368.299 }, { "epoch": 0.4927876909926274, "grad_norm": 1.4604040384292603, "learning_rate": 1.017558886509636e-05, "loss": 0.11157391965389252, "num_input_tokens_seen": 1197858, "step": 1153, "train_runtime": 3251.5115, "train_tokens_per_second": 368.4 }, { "epoch": 0.4932150870819532, "grad_norm": 2.0555508136749268, "learning_rate": 1.0167023554603854e-05, "loss": 0.09021800756454468, "num_input_tokens_seen": 1198460, "step": 1154, "train_runtime": 3253.6023, "train_tokens_per_second": 368.349 }, { "epoch": 0.49364248317127896, "grad_norm": 1.7616798877716064, "learning_rate": 1.015845824411135e-05, "loss": 0.11220099031925201, "num_input_tokens_seen": 1199602, "step": 1155, "train_runtime": 3255.7906, "train_tokens_per_second": 368.452 }, { "epoch": 0.49406987926060475, "grad_norm": 2.16310453414917, "learning_rate": 1.0149892933618843e-05, "loss": 0.12045907229185104, "num_input_tokens_seen": 1200682, "step": 1156, "train_runtime": 3257.9517, "train_tokens_per_second": 368.539 }, { "epoch": 0.49449727534993054, "grad_norm": 2.101062536239624, "learning_rate": 1.014132762312634e-05, "loss": 0.1099109947681427, "num_input_tokens_seen": 1201562, "step": 1157, "train_runtime": 3260.0896, "train_tokens_per_second": 368.567 }, { "epoch": 0.49492467143925634, "grad_norm": 1.8282580375671387, "learning_rate": 1.0132762312633835e-05, "loss": 0.08041372150182724, "num_input_tokens_seen": 1202292, "step": 1158, "train_runtime": 3262.2198, "train_tokens_per_second": 368.55 }, { "epoch": 0.49535206752858213, "grad_norm": 2.9186627864837646, "learning_rate": 1.0124197002141329e-05, "loss": 0.22003036737442017, "num_input_tokens_seen": 1203078, "step": 1159, "train_runtime": 3264.3244, "train_tokens_per_second": 368.553 }, { "epoch": 0.4957794636179079, "grad_norm": 2.7521979808807373, "learning_rate": 1.0115631691648824e-05, "loss": 0.1638396978378296, "num_input_tokens_seen": 1204314, "step": 1160, "train_runtime": 3266.5097, "train_tokens_per_second": 368.685 }, { "epoch": 0.49620685970723366, "grad_norm": 1.867957592010498, "learning_rate": 1.010706638115632e-05, "loss": 0.12579822540283203, "num_input_tokens_seen": 1205414, "step": 1161, "train_runtime": 3268.6777, "train_tokens_per_second": 368.777 }, { "epoch": 0.49663425579655945, "grad_norm": 2.0077366828918457, "learning_rate": 1.0098501070663813e-05, "loss": 0.09778191149234772, "num_input_tokens_seen": 1206124, "step": 1162, "train_runtime": 3270.7816, "train_tokens_per_second": 368.757 }, { "epoch": 0.49706165188588525, "grad_norm": 2.3758699893951416, "learning_rate": 1.0089935760171308e-05, "loss": 0.18004055321216583, "num_input_tokens_seen": 1207038, "step": 1163, "train_runtime": 3272.9654, "train_tokens_per_second": 368.79 }, { "epoch": 0.49748904797521104, "grad_norm": 2.7922658920288086, "learning_rate": 1.0081370449678802e-05, "loss": 0.15281176567077637, "num_input_tokens_seen": 1207746, "step": 1164, "train_runtime": 3275.0377, "train_tokens_per_second": 368.773 }, { "epoch": 0.49791644406453683, "grad_norm": 2.1049084663391113, "learning_rate": 1.0072805139186297e-05, "loss": 0.12039857357740402, "num_input_tokens_seen": 1208784, "step": 1165, "train_runtime": 3277.1645, "train_tokens_per_second": 368.851 }, { "epoch": 0.49834384015386257, "grad_norm": 2.1592531204223633, "learning_rate": 1.0064239828693792e-05, "loss": 0.1376982480287552, "num_input_tokens_seen": 1209892, "step": 1166, "train_runtime": 3279.3199, "train_tokens_per_second": 368.946 }, { "epoch": 0.49877123624318837, "grad_norm": 1.9224379062652588, "learning_rate": 1.0055674518201286e-05, "loss": 0.10606247186660767, "num_input_tokens_seen": 1210896, "step": 1167, "train_runtime": 3281.4888, "train_tokens_per_second": 369.008 }, { "epoch": 0.49919863233251416, "grad_norm": 2.5508010387420654, "learning_rate": 1.0047109207708781e-05, "loss": 0.15957972407341003, "num_input_tokens_seen": 1211932, "step": 1168, "train_runtime": 3283.6383, "train_tokens_per_second": 369.082 }, { "epoch": 0.49962602842183995, "grad_norm": 1.4186806678771973, "learning_rate": 1.0038543897216275e-05, "loss": 0.08027073740959167, "num_input_tokens_seen": 1213072, "step": 1169, "train_runtime": 3285.8152, "train_tokens_per_second": 369.184 }, { "epoch": 0.5000534245111657, "grad_norm": 2.0232720375061035, "learning_rate": 1.002997858672377e-05, "loss": 0.10638853162527084, "num_input_tokens_seen": 1214044, "step": 1170, "train_runtime": 3287.9613, "train_tokens_per_second": 369.239 }, { "epoch": 0.5000534245111657, "eval_loss": 0.48118919134140015, "eval_runtime": 58.0838, "eval_samples_per_second": 17.182, "eval_steps_per_second": 8.591, "num_input_tokens_seen": 1214044, "step": 1170 }, { "epoch": 0.5004808206004915, "grad_norm": 1.5170239210128784, "learning_rate": 1.0021413276231265e-05, "loss": 0.08273788541555405, "num_input_tokens_seen": 1215246, "step": 1171, "train_runtime": 3361.4712, "train_tokens_per_second": 361.522 }, { "epoch": 0.5009082166898173, "grad_norm": 2.31028151512146, "learning_rate": 1.0012847965738759e-05, "loss": 0.18249736726284027, "num_input_tokens_seen": 1216162, "step": 1172, "train_runtime": 3363.609, "train_tokens_per_second": 361.565 }, { "epoch": 0.5013356127791431, "grad_norm": 1.6480261087417603, "learning_rate": 1.0004282655246254e-05, "loss": 0.08653301000595093, "num_input_tokens_seen": 1218486, "step": 1173, "train_runtime": 3366.1099, "train_tokens_per_second": 361.986 }, { "epoch": 0.5017630088684688, "grad_norm": 2.034839630126953, "learning_rate": 9.995717344753748e-06, "loss": 0.16095291078090668, "num_input_tokens_seen": 1219380, "step": 1174, "train_runtime": 3368.2384, "train_tokens_per_second": 362.023 }, { "epoch": 0.5021904049577947, "grad_norm": 3.8672940731048584, "learning_rate": 9.987152034261243e-06, "loss": 0.09606952220201492, "num_input_tokens_seen": 1219936, "step": 1175, "train_runtime": 3370.2717, "train_tokens_per_second": 361.97 }, { "epoch": 0.5026178010471204, "grad_norm": 3.137542963027954, "learning_rate": 9.978586723768736e-06, "loss": 0.19476166367530823, "num_input_tokens_seen": 1220910, "step": 1176, "train_runtime": 3372.4389, "train_tokens_per_second": 362.026 }, { "epoch": 0.5030451971364462, "grad_norm": 2.6571812629699707, "learning_rate": 9.970021413276232e-06, "loss": 0.1706370711326599, "num_input_tokens_seen": 1221952, "step": 1177, "train_runtime": 3374.6215, "train_tokens_per_second": 362.1 }, { "epoch": 0.503472593225772, "grad_norm": 2.6814627647399902, "learning_rate": 9.961456102783727e-06, "loss": 0.17683133482933044, "num_input_tokens_seen": 1222912, "step": 1178, "train_runtime": 3376.774, "train_tokens_per_second": 362.154 }, { "epoch": 0.5038999893150977, "grad_norm": 2.4631879329681396, "learning_rate": 9.95289079229122e-06, "loss": 0.19499963521957397, "num_input_tokens_seen": 1224156, "step": 1179, "train_runtime": 3378.9989, "train_tokens_per_second": 362.284 }, { "epoch": 0.5043273854044236, "grad_norm": 2.1227729320526123, "learning_rate": 9.944325481798716e-06, "loss": 0.1360645443201065, "num_input_tokens_seen": 1225652, "step": 1180, "train_runtime": 3381.4734, "train_tokens_per_second": 362.461 }, { "epoch": 0.5047547814937493, "grad_norm": 2.7035768032073975, "learning_rate": 9.93576017130621e-06, "loss": 0.06934560090303421, "num_input_tokens_seen": 1227204, "step": 1181, "train_runtime": 3383.804, "train_tokens_per_second": 362.67 }, { "epoch": 0.5051821775830752, "grad_norm": 2.2245774269104004, "learning_rate": 9.927194860813705e-06, "loss": 0.12962600588798523, "num_input_tokens_seen": 1228700, "step": 1182, "train_runtime": 3386.0877, "train_tokens_per_second": 362.867 }, { "epoch": 0.5056095736724009, "grad_norm": 1.8185889720916748, "learning_rate": 9.9186295503212e-06, "loss": 0.11246130615472794, "num_input_tokens_seen": 1229644, "step": 1183, "train_runtime": 3388.2374, "train_tokens_per_second": 362.916 }, { "epoch": 0.5060369697617266, "grad_norm": 4.234601020812988, "learning_rate": 9.910064239828695e-06, "loss": 0.16835813224315643, "num_input_tokens_seen": 1230508, "step": 1184, "train_runtime": 3390.3644, "train_tokens_per_second": 362.943 }, { "epoch": 0.5064643658510525, "grad_norm": 1.8631402254104614, "learning_rate": 9.901498929336189e-06, "loss": 0.09280159324407578, "num_input_tokens_seen": 1231260, "step": 1185, "train_runtime": 3392.491, "train_tokens_per_second": 362.937 }, { "epoch": 0.5068917619403782, "grad_norm": 2.7326459884643555, "learning_rate": 9.892933618843684e-06, "loss": 0.1309550255537033, "num_input_tokens_seen": 1232160, "step": 1186, "train_runtime": 3394.6144, "train_tokens_per_second": 362.975 }, { "epoch": 0.5073191580297041, "grad_norm": 2.118839979171753, "learning_rate": 9.88436830835118e-06, "loss": 0.0755138024687767, "num_input_tokens_seen": 1233090, "step": 1187, "train_runtime": 3396.7385, "train_tokens_per_second": 363.022 }, { "epoch": 0.5077465541190298, "grad_norm": 1.8691673278808594, "learning_rate": 9.875802997858673e-06, "loss": 0.13339178264141083, "num_input_tokens_seen": 1234300, "step": 1188, "train_runtime": 3398.9316, "train_tokens_per_second": 363.144 }, { "epoch": 0.5081739502083555, "grad_norm": 2.3717668056488037, "learning_rate": 9.867237687366168e-06, "loss": 0.11112445592880249, "num_input_tokens_seen": 1235186, "step": 1189, "train_runtime": 3401.0631, "train_tokens_per_second": 363.176 }, { "epoch": 0.5086013462976814, "grad_norm": 1.7401413917541504, "learning_rate": 9.858672376873662e-06, "loss": 0.099689781665802, "num_input_tokens_seen": 1236154, "step": 1190, "train_runtime": 3403.2328, "train_tokens_per_second": 363.229 }, { "epoch": 0.5090287423870071, "grad_norm": 2.3835678100585938, "learning_rate": 9.850107066381157e-06, "loss": 0.14031466841697693, "num_input_tokens_seen": 1237918, "step": 1191, "train_runtime": 3405.5809, "train_tokens_per_second": 363.497 }, { "epoch": 0.509456138476333, "grad_norm": 4.456737995147705, "learning_rate": 9.841541755888652e-06, "loss": 0.14086435735225677, "num_input_tokens_seen": 1238520, "step": 1192, "train_runtime": 3407.6646, "train_tokens_per_second": 363.451 }, { "epoch": 0.5098835345656587, "grad_norm": 3.505234479904175, "learning_rate": 9.832976445396146e-06, "loss": 0.13380852341651917, "num_input_tokens_seen": 1239132, "step": 1193, "train_runtime": 3409.7363, "train_tokens_per_second": 363.41 }, { "epoch": 0.5103109306549845, "grad_norm": 3.0331313610076904, "learning_rate": 9.824411134903641e-06, "loss": 0.20048747956752777, "num_input_tokens_seen": 1239858, "step": 1194, "train_runtime": 3411.8319, "train_tokens_per_second": 363.399 }, { "epoch": 0.5107383267443103, "grad_norm": 2.407073974609375, "learning_rate": 9.815845824411135e-06, "loss": 0.13325142860412598, "num_input_tokens_seen": 1240696, "step": 1195, "train_runtime": 3414.029, "train_tokens_per_second": 363.411 }, { "epoch": 0.511165722833636, "grad_norm": 1.8318616151809692, "learning_rate": 9.80728051391863e-06, "loss": 0.1460091769695282, "num_input_tokens_seen": 1242014, "step": 1196, "train_runtime": 3416.2495, "train_tokens_per_second": 363.561 }, { "epoch": 0.5115931189229619, "grad_norm": 2.2184696197509766, "learning_rate": 9.798715203426125e-06, "loss": 0.09027564525604248, "num_input_tokens_seen": 1242658, "step": 1197, "train_runtime": 3418.3176, "train_tokens_per_second": 363.529 }, { "epoch": 0.5120205150122876, "grad_norm": 1.6639877557754517, "learning_rate": 9.790149892933619e-06, "loss": 0.1325250267982483, "num_input_tokens_seen": 1244118, "step": 1198, "train_runtime": 3420.5878, "train_tokens_per_second": 363.715 }, { "epoch": 0.5124479111016135, "grad_norm": 2.9893813133239746, "learning_rate": 9.781584582441114e-06, "loss": 0.1728774458169937, "num_input_tokens_seen": 1244880, "step": 1199, "train_runtime": 3422.6853, "train_tokens_per_second": 363.714 }, { "epoch": 0.5128753071909392, "grad_norm": 3.066741704940796, "learning_rate": 9.77301927194861e-06, "loss": 0.18558862805366516, "num_input_tokens_seen": 1246146, "step": 1200, "train_runtime": 3424.8829, "train_tokens_per_second": 363.851 }, { "epoch": 0.513302703280265, "grad_norm": 2.065859317779541, "learning_rate": 9.764453961456105e-06, "loss": 0.1163623183965683, "num_input_tokens_seen": 1246980, "step": 1201, "train_runtime": 3440.2779, "train_tokens_per_second": 362.465 }, { "epoch": 0.5137300993695908, "grad_norm": 1.8905599117279053, "learning_rate": 9.755888650963598e-06, "loss": 0.10784266144037247, "num_input_tokens_seen": 1247924, "step": 1202, "train_runtime": 3442.399, "train_tokens_per_second": 362.516 }, { "epoch": 0.5141574954589165, "grad_norm": 1.7787706851959229, "learning_rate": 9.747323340471094e-06, "loss": 0.10549870133399963, "num_input_tokens_seen": 1248902, "step": 1203, "train_runtime": 3444.5089, "train_tokens_per_second": 362.578 }, { "epoch": 0.5145848915482424, "grad_norm": 2.5742433071136475, "learning_rate": 9.738758029978587e-06, "loss": 0.09015730768442154, "num_input_tokens_seen": 1249520, "step": 1204, "train_runtime": 3446.6034, "train_tokens_per_second": 362.537 }, { "epoch": 0.5150122876375681, "grad_norm": 1.609961986541748, "learning_rate": 9.730192719486083e-06, "loss": 0.11445249617099762, "num_input_tokens_seen": 1250896, "step": 1205, "train_runtime": 3448.9289, "train_tokens_per_second": 362.691 }, { "epoch": 0.5154396837268939, "grad_norm": 2.958165407180786, "learning_rate": 9.721627408993576e-06, "loss": 0.21736612915992737, "num_input_tokens_seen": 1252022, "step": 1206, "train_runtime": 3451.0866, "train_tokens_per_second": 362.791 }, { "epoch": 0.5158670798162197, "grad_norm": 2.1003317832946777, "learning_rate": 9.713062098501071e-06, "loss": 0.12407387793064117, "num_input_tokens_seen": 1253436, "step": 1207, "train_runtime": 3453.3539, "train_tokens_per_second": 362.962 }, { "epoch": 0.5162944759055454, "grad_norm": 1.9921725988388062, "learning_rate": 9.704496788008567e-06, "loss": 0.09868897497653961, "num_input_tokens_seen": 1254522, "step": 1208, "train_runtime": 3455.5203, "train_tokens_per_second": 363.049 }, { "epoch": 0.5167218719948713, "grad_norm": 1.5106102228164673, "learning_rate": 9.69593147751606e-06, "loss": 0.08805327862501144, "num_input_tokens_seen": 1256084, "step": 1209, "train_runtime": 3457.798, "train_tokens_per_second": 363.261 }, { "epoch": 0.517149268084197, "grad_norm": 2.3006861209869385, "learning_rate": 9.687366167023556e-06, "loss": 0.11188167333602905, "num_input_tokens_seen": 1257036, "step": 1210, "train_runtime": 3459.9239, "train_tokens_per_second": 363.313 }, { "epoch": 0.5175766641735228, "grad_norm": 2.1414601802825928, "learning_rate": 9.678800856531049e-06, "loss": 0.1338559091091156, "num_input_tokens_seen": 1257922, "step": 1211, "train_runtime": 3462.078, "train_tokens_per_second": 363.343 }, { "epoch": 0.5180040602628486, "grad_norm": 1.3698714971542358, "learning_rate": 9.670235546038544e-06, "loss": 0.06936321407556534, "num_input_tokens_seen": 1259290, "step": 1212, "train_runtime": 3464.3316, "train_tokens_per_second": 363.502 }, { "epoch": 0.5184314563521744, "grad_norm": 1.597274899482727, "learning_rate": 9.66167023554604e-06, "loss": 0.09593281149864197, "num_input_tokens_seen": 1260326, "step": 1213, "train_runtime": 3466.5702, "train_tokens_per_second": 363.566 }, { "epoch": 0.5188588524415002, "grad_norm": 3.404883623123169, "learning_rate": 9.653104925053533e-06, "loss": 0.11273635923862457, "num_input_tokens_seen": 1261044, "step": 1214, "train_runtime": 3468.7075, "train_tokens_per_second": 363.549 }, { "epoch": 0.519286248530826, "grad_norm": 1.7912863492965698, "learning_rate": 9.644539614561029e-06, "loss": 0.0925249308347702, "num_input_tokens_seen": 1262616, "step": 1215, "train_runtime": 3470.9765, "train_tokens_per_second": 363.764 }, { "epoch": 0.5197136446201517, "grad_norm": 3.5222458839416504, "learning_rate": 9.635974304068522e-06, "loss": 0.2118309736251831, "num_input_tokens_seen": 1263170, "step": 1216, "train_runtime": 3472.9818, "train_tokens_per_second": 363.713 }, { "epoch": 0.5201410407094775, "grad_norm": 2.2413337230682373, "learning_rate": 9.627408993576019e-06, "loss": 0.1166030615568161, "num_input_tokens_seen": 1264336, "step": 1217, "train_runtime": 3475.1598, "train_tokens_per_second": 363.821 }, { "epoch": 0.5205684367988033, "grad_norm": 1.8757281303405762, "learning_rate": 9.618843683083513e-06, "loss": 0.13037443161010742, "num_input_tokens_seen": 1265598, "step": 1218, "train_runtime": 3477.3579, "train_tokens_per_second": 363.954 }, { "epoch": 0.5209958328881291, "grad_norm": 2.1826701164245605, "learning_rate": 9.610278372591008e-06, "loss": 0.15989816188812256, "num_input_tokens_seen": 1266874, "step": 1219, "train_runtime": 3479.5522, "train_tokens_per_second": 364.091 }, { "epoch": 0.5214232289774549, "grad_norm": 2.7870330810546875, "learning_rate": 9.601713062098502e-06, "loss": 0.16210657358169556, "num_input_tokens_seen": 1267652, "step": 1220, "train_runtime": 3481.6253, "train_tokens_per_second": 364.098 }, { "epoch": 0.5218506250667806, "grad_norm": 1.4903841018676758, "learning_rate": 9.593147751605997e-06, "loss": 0.06741855293512344, "num_input_tokens_seen": 1269138, "step": 1221, "train_runtime": 3483.8928, "train_tokens_per_second": 364.287 }, { "epoch": 0.5222780211561064, "grad_norm": 2.038149118423462, "learning_rate": 9.584582441113492e-06, "loss": 0.09281060844659805, "num_input_tokens_seen": 1269886, "step": 1222, "train_runtime": 3485.9697, "train_tokens_per_second": 364.285 }, { "epoch": 0.5227054172454322, "grad_norm": 2.670989513397217, "learning_rate": 9.576017130620986e-06, "loss": 0.14042116701602936, "num_input_tokens_seen": 1270554, "step": 1223, "train_runtime": 3488.0105, "train_tokens_per_second": 364.263 }, { "epoch": 0.523132813334758, "grad_norm": 2.074495553970337, "learning_rate": 9.567451820128481e-06, "loss": 0.09043486416339874, "num_input_tokens_seen": 1271226, "step": 1224, "train_runtime": 3490.0519, "train_tokens_per_second": 364.243 }, { "epoch": 0.5235602094240838, "grad_norm": 2.4718987941741943, "learning_rate": 9.558886509635975e-06, "loss": 0.07171086966991425, "num_input_tokens_seen": 1272126, "step": 1225, "train_runtime": 3492.1689, "train_tokens_per_second": 364.28 }, { "epoch": 0.5239876055134095, "grad_norm": 0.7584564089775085, "learning_rate": 9.55032119914347e-06, "loss": 0.04889415204524994, "num_input_tokens_seen": 1275302, "step": 1226, "train_runtime": 3494.8841, "train_tokens_per_second": 364.905 }, { "epoch": 0.5244150016027354, "grad_norm": 2.5239851474761963, "learning_rate": 9.541755888650965e-06, "loss": 0.14348958432674408, "num_input_tokens_seen": 1276538, "step": 1227, "train_runtime": 3497.0855, "train_tokens_per_second": 365.029 }, { "epoch": 0.5248423976920611, "grad_norm": 2.036489725112915, "learning_rate": 9.533190578158459e-06, "loss": 0.13829120993614197, "num_input_tokens_seen": 1277534, "step": 1228, "train_runtime": 3499.2276, "train_tokens_per_second": 365.09 }, { "epoch": 0.5252697937813869, "grad_norm": 2.100877046585083, "learning_rate": 9.524625267665954e-06, "loss": 0.12332621961832047, "num_input_tokens_seen": 1278534, "step": 1229, "train_runtime": 3501.3718, "train_tokens_per_second": 365.152 }, { "epoch": 0.5256971898707127, "grad_norm": 2.741685628890991, "learning_rate": 9.516059957173448e-06, "loss": 0.17697112262248993, "num_input_tokens_seen": 1279530, "step": 1230, "train_runtime": 3503.5107, "train_tokens_per_second": 365.214 }, { "epoch": 0.5261245859600384, "grad_norm": 2.025456428527832, "learning_rate": 9.507494646680943e-06, "loss": 0.09883399307727814, "num_input_tokens_seen": 1280870, "step": 1231, "train_runtime": 3518.6695, "train_tokens_per_second": 364.021 }, { "epoch": 0.5265519820493643, "grad_norm": 1.5998183488845825, "learning_rate": 9.498929336188436e-06, "loss": 0.08645810931921005, "num_input_tokens_seen": 1282036, "step": 1232, "train_runtime": 3520.8479, "train_tokens_per_second": 364.127 }, { "epoch": 0.52697937813869, "grad_norm": 1.8249338865280151, "learning_rate": 9.490364025695932e-06, "loss": 0.08915052562952042, "num_input_tokens_seen": 1282954, "step": 1233, "train_runtime": 3522.9921, "train_tokens_per_second": 364.166 }, { "epoch": 0.5274067742280159, "grad_norm": 2.8365821838378906, "learning_rate": 9.481798715203427e-06, "loss": 0.17887720465660095, "num_input_tokens_seen": 1283920, "step": 1234, "train_runtime": 3525.1585, "train_tokens_per_second": 364.216 }, { "epoch": 0.5278341703173416, "grad_norm": 2.6319785118103027, "learning_rate": 9.473233404710922e-06, "loss": 0.13789516687393188, "num_input_tokens_seen": 1284836, "step": 1235, "train_runtime": 3527.2861, "train_tokens_per_second": 364.256 }, { "epoch": 0.5282615664066673, "grad_norm": 2.3702616691589355, "learning_rate": 9.464668094218416e-06, "loss": 0.1556377112865448, "num_input_tokens_seen": 1285940, "step": 1236, "train_runtime": 3529.4768, "train_tokens_per_second": 364.343 }, { "epoch": 0.5286889624959932, "grad_norm": 3.1765713691711426, "learning_rate": 9.456102783725911e-06, "loss": 0.22601580619812012, "num_input_tokens_seen": 1286944, "step": 1237, "train_runtime": 3531.6404, "train_tokens_per_second": 364.404 }, { "epoch": 0.5291163585853189, "grad_norm": 2.4900319576263428, "learning_rate": 9.447537473233406e-06, "loss": 0.0913250520825386, "num_input_tokens_seen": 1287744, "step": 1238, "train_runtime": 3533.7318, "train_tokens_per_second": 364.415 }, { "epoch": 0.5295437546746448, "grad_norm": 3.7495579719543457, "learning_rate": 9.4389721627409e-06, "loss": 0.20030948519706726, "num_input_tokens_seen": 1289008, "step": 1239, "train_runtime": 3535.9519, "train_tokens_per_second": 364.543 }, { "epoch": 0.5299711507639705, "grad_norm": 2.7258265018463135, "learning_rate": 9.430406852248395e-06, "loss": 0.13150939345359802, "num_input_tokens_seen": 1289992, "step": 1240, "train_runtime": 3538.1206, "train_tokens_per_second": 364.598 }, { "epoch": 0.5303985468532962, "grad_norm": 1.9053395986557007, "learning_rate": 9.421841541755889e-06, "loss": 0.10370547324419022, "num_input_tokens_seen": 1291310, "step": 1241, "train_runtime": 3540.351, "train_tokens_per_second": 364.741 }, { "epoch": 0.5308259429426221, "grad_norm": 2.556393623352051, "learning_rate": 9.413276231263384e-06, "loss": 0.13149718940258026, "num_input_tokens_seen": 1292422, "step": 1242, "train_runtime": 3542.7393, "train_tokens_per_second": 364.809 }, { "epoch": 0.5312533390319478, "grad_norm": 2.999880790710449, "learning_rate": 9.40471092077088e-06, "loss": 0.14596442878246307, "num_input_tokens_seen": 1293270, "step": 1243, "train_runtime": 3544.8678, "train_tokens_per_second": 364.829 }, { "epoch": 0.5316807351212737, "grad_norm": 2.2344367504119873, "learning_rate": 9.396145610278373e-06, "loss": 0.08628234267234802, "num_input_tokens_seen": 1293884, "step": 1244, "train_runtime": 3546.948, "train_tokens_per_second": 364.788 }, { "epoch": 0.5321081312105994, "grad_norm": 2.489434242248535, "learning_rate": 9.387580299785868e-06, "loss": 0.15407121181488037, "num_input_tokens_seen": 1294644, "step": 1245, "train_runtime": 3549.0603, "train_tokens_per_second": 364.785 }, { "epoch": 0.5325355272999253, "grad_norm": 3.557612180709839, "learning_rate": 9.379014989293362e-06, "loss": 0.1567760854959488, "num_input_tokens_seen": 1295360, "step": 1246, "train_runtime": 3551.1367, "train_tokens_per_second": 364.773 }, { "epoch": 0.532962923389251, "grad_norm": 2.3730432987213135, "learning_rate": 9.370449678800857e-06, "loss": 0.1668788641691208, "num_input_tokens_seen": 1296580, "step": 1247, "train_runtime": 3553.3615, "train_tokens_per_second": 364.888 }, { "epoch": 0.5333903194785767, "grad_norm": 2.1229710578918457, "learning_rate": 9.361884368308352e-06, "loss": 0.10964275896549225, "num_input_tokens_seen": 1297590, "step": 1248, "train_runtime": 3555.5063, "train_tokens_per_second": 364.952 }, { "epoch": 0.5338177155679026, "grad_norm": 1.8034108877182007, "learning_rate": 9.353319057815846e-06, "loss": 0.10276772081851959, "num_input_tokens_seen": 1298560, "step": 1249, "train_runtime": 3557.6959, "train_tokens_per_second": 365.0 }, { "epoch": 0.5342451116572283, "grad_norm": 2.4474294185638428, "learning_rate": 9.344753747323341e-06, "loss": 0.1718776971101761, "num_input_tokens_seen": 1299314, "step": 1250, "train_runtime": 3559.8205, "train_tokens_per_second": 364.994 }, { "epoch": 0.5346725077465542, "grad_norm": 2.3221609592437744, "learning_rate": 9.336188436830836e-06, "loss": 0.09346188604831696, "num_input_tokens_seen": 1300070, "step": 1251, "train_runtime": 3561.9873, "train_tokens_per_second": 364.984 }, { "epoch": 0.5350999038358799, "grad_norm": 3.941173553466797, "learning_rate": 9.327623126338332e-06, "loss": 0.15250864624977112, "num_input_tokens_seen": 1300824, "step": 1252, "train_runtime": 3564.0868, "train_tokens_per_second": 364.981 }, { "epoch": 0.5355272999252056, "grad_norm": 2.7000339031219482, "learning_rate": 9.319057815845825e-06, "loss": 0.17314130067825317, "num_input_tokens_seen": 1301600, "step": 1253, "train_runtime": 3566.2034, "train_tokens_per_second": 364.982 }, { "epoch": 0.5359546960145315, "grad_norm": 2.440690517425537, "learning_rate": 9.31049250535332e-06, "loss": 0.11099924147129059, "num_input_tokens_seen": 1302436, "step": 1254, "train_runtime": 3568.3639, "train_tokens_per_second": 364.995 }, { "epoch": 0.5363820921038572, "grad_norm": 2.016054630279541, "learning_rate": 9.301927194860814e-06, "loss": 0.12115071713924408, "num_input_tokens_seen": 1303460, "step": 1255, "train_runtime": 3570.5381, "train_tokens_per_second": 365.06 }, { "epoch": 0.5368094881931831, "grad_norm": 2.2618765830993652, "learning_rate": 9.29336188436831e-06, "loss": 0.10006249696016312, "num_input_tokens_seen": 1304480, "step": 1256, "train_runtime": 3572.7179, "train_tokens_per_second": 365.123 }, { "epoch": 0.5372368842825088, "grad_norm": 2.1425459384918213, "learning_rate": 9.284796573875805e-06, "loss": 0.17706933617591858, "num_input_tokens_seen": 1305782, "step": 1257, "train_runtime": 3574.9477, "train_tokens_per_second": 365.259 }, { "epoch": 0.5376642803718346, "grad_norm": 2.3888356685638428, "learning_rate": 9.276231263383298e-06, "loss": 0.15307390689849854, "num_input_tokens_seen": 1306524, "step": 1258, "train_runtime": 3577.0714, "train_tokens_per_second": 365.25 }, { "epoch": 0.5380916764611604, "grad_norm": 1.893916130065918, "learning_rate": 9.267665952890794e-06, "loss": 0.1650296151638031, "num_input_tokens_seen": 1307818, "step": 1259, "train_runtime": 3579.2733, "train_tokens_per_second": 365.386 }, { "epoch": 0.5385190725504861, "grad_norm": 1.372362494468689, "learning_rate": 9.259100642398287e-06, "loss": 0.11354769766330719, "num_input_tokens_seen": 1309754, "step": 1260, "train_runtime": 3581.6398, "train_tokens_per_second": 365.686 }, { "epoch": 0.538946468639812, "grad_norm": 2.5072848796844482, "learning_rate": 9.250535331905782e-06, "loss": 0.1607133150100708, "num_input_tokens_seen": 1310512, "step": 1261, "train_runtime": 3598.8327, "train_tokens_per_second": 364.149 }, { "epoch": 0.5393738647291377, "grad_norm": 2.4146971702575684, "learning_rate": 9.241970021413276e-06, "loss": 0.1071794256567955, "num_input_tokens_seen": 1311126, "step": 1262, "train_runtime": 3600.8648, "train_tokens_per_second": 364.114 }, { "epoch": 0.5398012608184635, "grad_norm": 2.24064564704895, "learning_rate": 9.233404710920771e-06, "loss": 0.15566112101078033, "num_input_tokens_seen": 1312054, "step": 1263, "train_runtime": 3603.0721, "train_tokens_per_second": 364.149 }, { "epoch": 0.5402286569077893, "grad_norm": 2.3328211307525635, "learning_rate": 9.224839400428267e-06, "loss": 0.13846774399280548, "num_input_tokens_seen": 1313044, "step": 1264, "train_runtime": 3605.2604, "train_tokens_per_second": 364.202 }, { "epoch": 0.540656052997115, "grad_norm": 3.052949905395508, "learning_rate": 9.21627408993576e-06, "loss": 0.12793810665607452, "num_input_tokens_seen": 1313798, "step": 1265, "train_runtime": 3607.3198, "train_tokens_per_second": 364.203 }, { "epoch": 0.5410834490864409, "grad_norm": 2.2812297344207764, "learning_rate": 9.207708779443255e-06, "loss": 0.23001760244369507, "num_input_tokens_seen": 1315170, "step": 1266, "train_runtime": 3609.5676, "train_tokens_per_second": 364.357 }, { "epoch": 0.5415108451757666, "grad_norm": 2.086668014526367, "learning_rate": 9.199143468950749e-06, "loss": 0.10874505341053009, "num_input_tokens_seen": 1316050, "step": 1267, "train_runtime": 3611.7348, "train_tokens_per_second": 364.382 }, { "epoch": 0.5419382412650924, "grad_norm": 1.557161808013916, "learning_rate": 9.190578158458246e-06, "loss": 0.05690646171569824, "num_input_tokens_seen": 1317004, "step": 1268, "train_runtime": 3613.8832, "train_tokens_per_second": 364.429 }, { "epoch": 0.5423656373544182, "grad_norm": 3.058598756790161, "learning_rate": 9.18201284796574e-06, "loss": 0.09717820584774017, "num_input_tokens_seen": 1318044, "step": 1269, "train_runtime": 3616.1513, "train_tokens_per_second": 364.488 }, { "epoch": 0.542793033443744, "grad_norm": 2.784557342529297, "learning_rate": 9.173447537473235e-06, "loss": 0.09876945614814758, "num_input_tokens_seen": 1318916, "step": 1270, "train_runtime": 3618.2986, "train_tokens_per_second": 364.513 }, { "epoch": 0.5432204295330698, "grad_norm": 2.4188225269317627, "learning_rate": 9.164882226980728e-06, "loss": 0.2313305288553238, "num_input_tokens_seen": 1320104, "step": 1271, "train_runtime": 3620.4801, "train_tokens_per_second": 364.621 }, { "epoch": 0.5436478256223956, "grad_norm": 2.9752988815307617, "learning_rate": 9.156316916488224e-06, "loss": 0.11963313817977905, "num_input_tokens_seen": 1320730, "step": 1272, "train_runtime": 3622.5832, "train_tokens_per_second": 364.582 }, { "epoch": 0.5440752217117213, "grad_norm": 2.1987855434417725, "learning_rate": 9.147751605995719e-06, "loss": 0.07606115937232971, "num_input_tokens_seen": 1321634, "step": 1273, "train_runtime": 3624.7428, "train_tokens_per_second": 364.615 }, { "epoch": 0.5445026178010471, "grad_norm": 1.9468597173690796, "learning_rate": 9.139186295503213e-06, "loss": 0.16524280607700348, "num_input_tokens_seen": 1322748, "step": 1274, "train_runtime": 3626.9266, "train_tokens_per_second": 364.702 }, { "epoch": 0.5449300138903729, "grad_norm": 2.0133373737335205, "learning_rate": 9.130620985010708e-06, "loss": 0.16552017629146576, "num_input_tokens_seen": 1323836, "step": 1275, "train_runtime": 3629.1903, "train_tokens_per_second": 364.774 }, { "epoch": 0.5453574099796987, "grad_norm": 1.6033636331558228, "learning_rate": 9.122055674518201e-06, "loss": 0.09933064877986908, "num_input_tokens_seen": 1325094, "step": 1276, "train_runtime": 3631.3798, "train_tokens_per_second": 364.901 }, { "epoch": 0.5457848060690245, "grad_norm": 2.1809206008911133, "learning_rate": 9.113490364025697e-06, "loss": 0.11724792420864105, "num_input_tokens_seen": 1326388, "step": 1277, "train_runtime": 3633.6312, "train_tokens_per_second": 365.031 }, { "epoch": 0.5462122021583502, "grad_norm": 2.150744676589966, "learning_rate": 9.104925053533192e-06, "loss": 0.10335658490657806, "num_input_tokens_seen": 1327346, "step": 1278, "train_runtime": 3635.7752, "train_tokens_per_second": 365.079 }, { "epoch": 0.546639598247676, "grad_norm": 2.424863338470459, "learning_rate": 9.096359743040686e-06, "loss": 0.14130404591560364, "num_input_tokens_seen": 1328328, "step": 1279, "train_runtime": 3637.9363, "train_tokens_per_second": 365.132 }, { "epoch": 0.5470669943370018, "grad_norm": 2.664900541305542, "learning_rate": 9.08779443254818e-06, "loss": 0.12476594746112823, "num_input_tokens_seen": 1329264, "step": 1280, "train_runtime": 3640.0299, "train_tokens_per_second": 365.179 }, { "epoch": 0.5474943904263276, "grad_norm": 2.7224602699279785, "learning_rate": 9.079229122055674e-06, "loss": 0.08061781525611877, "num_input_tokens_seen": 1330392, "step": 1281, "train_runtime": 3642.1885, "train_tokens_per_second": 365.273 }, { "epoch": 0.5479217865156534, "grad_norm": 1.72052001953125, "learning_rate": 9.07066381156317e-06, "loss": 0.09391103684902191, "num_input_tokens_seen": 1331500, "step": 1282, "train_runtime": 3644.3742, "train_tokens_per_second": 365.358 }, { "epoch": 0.5483491826049791, "grad_norm": 2.081308364868164, "learning_rate": 9.062098501070665e-06, "loss": 0.14099529385566711, "num_input_tokens_seen": 1332680, "step": 1283, "train_runtime": 3646.5567, "train_tokens_per_second": 365.463 }, { "epoch": 0.548776578694305, "grad_norm": 2.0109410285949707, "learning_rate": 9.053533190578159e-06, "loss": 0.1453423798084259, "num_input_tokens_seen": 1333844, "step": 1284, "train_runtime": 3648.7453, "train_tokens_per_second": 365.562 }, { "epoch": 0.5492039747836307, "grad_norm": 1.8232446908950806, "learning_rate": 9.044967880085654e-06, "loss": 0.11511348932981491, "num_input_tokens_seen": 1335014, "step": 1285, "train_runtime": 3650.9628, "train_tokens_per_second": 365.661 }, { "epoch": 0.5496313708729565, "grad_norm": 1.6541950702667236, "learning_rate": 9.036402569593149e-06, "loss": 0.11775043606758118, "num_input_tokens_seen": 1337410, "step": 1286, "train_runtime": 3653.445, "train_tokens_per_second": 366.068 }, { "epoch": 0.5500587669622823, "grad_norm": 2.5482306480407715, "learning_rate": 9.027837259100644e-06, "loss": 0.10782432556152344, "num_input_tokens_seen": 1338056, "step": 1287, "train_runtime": 3655.4679, "train_tokens_per_second": 366.042 }, { "epoch": 0.550486163051608, "grad_norm": 2.8341853618621826, "learning_rate": 9.019271948608138e-06, "loss": 0.11016719043254852, "num_input_tokens_seen": 1338814, "step": 1288, "train_runtime": 3657.5837, "train_tokens_per_second": 366.038 }, { "epoch": 0.5509135591409339, "grad_norm": 1.4266753196716309, "learning_rate": 9.010706638115633e-06, "loss": 0.0824209675192833, "num_input_tokens_seen": 1340582, "step": 1289, "train_runtime": 3659.9242, "train_tokens_per_second": 366.287 }, { "epoch": 0.5513409552302596, "grad_norm": 2.7410528659820557, "learning_rate": 9.002141327623127e-06, "loss": 0.06708842515945435, "num_input_tokens_seen": 1341116, "step": 1290, "train_runtime": 3661.9514, "train_tokens_per_second": 366.23 }, { "epoch": 0.5517683513195855, "grad_norm": 2.4072697162628174, "learning_rate": 8.993576017130622e-06, "loss": 0.1515701860189438, "num_input_tokens_seen": 1342370, "step": 1291, "train_runtime": 3676.9693, "train_tokens_per_second": 365.075 }, { "epoch": 0.5521957474089112, "grad_norm": 2.7921485900878906, "learning_rate": 8.985010706638116e-06, "loss": 0.20630823075771332, "num_input_tokens_seen": 1343356, "step": 1292, "train_runtime": 3679.1048, "train_tokens_per_second": 365.131 }, { "epoch": 0.552623143498237, "grad_norm": 1.708499550819397, "learning_rate": 8.976445396145611e-06, "loss": 0.08747657388448715, "num_input_tokens_seen": 1344480, "step": 1293, "train_runtime": 3681.2888, "train_tokens_per_second": 365.22 }, { "epoch": 0.5530505395875628, "grad_norm": 1.676386833190918, "learning_rate": 8.967880085653106e-06, "loss": 0.07825420051813126, "num_input_tokens_seen": 1345570, "step": 1294, "train_runtime": 3683.4792, "train_tokens_per_second": 365.299 }, { "epoch": 0.5534779356768885, "grad_norm": 2.337296962738037, "learning_rate": 8.9593147751606e-06, "loss": 0.10445433855056763, "num_input_tokens_seen": 1346498, "step": 1295, "train_runtime": 3685.6106, "train_tokens_per_second": 365.339 }, { "epoch": 0.5539053317662144, "grad_norm": 2.819326162338257, "learning_rate": 8.950749464668095e-06, "loss": 0.1458410620689392, "num_input_tokens_seen": 1347320, "step": 1296, "train_runtime": 3687.7463, "train_tokens_per_second": 365.351 }, { "epoch": 0.5543327278555401, "grad_norm": 2.037196636199951, "learning_rate": 8.942184154175589e-06, "loss": 0.12195777893066406, "num_input_tokens_seen": 1348416, "step": 1297, "train_runtime": 3689.9397, "train_tokens_per_second": 365.43 }, { "epoch": 0.554760123944866, "grad_norm": 2.4796946048736572, "learning_rate": 8.933618843683084e-06, "loss": 0.09496226906776428, "num_input_tokens_seen": 1349308, "step": 1298, "train_runtime": 3692.0987, "train_tokens_per_second": 365.458 }, { "epoch": 0.5551875200341917, "grad_norm": 2.0836925506591797, "learning_rate": 8.92505353319058e-06, "loss": 0.09805402904748917, "num_input_tokens_seen": 1350388, "step": 1299, "train_runtime": 3694.2489, "train_tokens_per_second": 365.538 }, { "epoch": 0.5556149161235174, "grad_norm": 1.8551748991012573, "learning_rate": 8.916488222698073e-06, "loss": 0.035007379949092865, "num_input_tokens_seen": 1350990, "step": 1300, "train_runtime": 3696.3067, "train_tokens_per_second": 365.497 }, { "epoch": 0.5560423122128433, "grad_norm": 3.933436393737793, "learning_rate": 8.907922912205568e-06, "loss": 0.2065715342760086, "num_input_tokens_seen": 1351776, "step": 1301, "train_runtime": 3698.3742, "train_tokens_per_second": 365.505 }, { "epoch": 0.556469708302169, "grad_norm": 5.46291971206665, "learning_rate": 8.899357601713062e-06, "loss": 0.16936299204826355, "num_input_tokens_seen": 1352406, "step": 1302, "train_runtime": 3700.4447, "train_tokens_per_second": 365.471 }, { "epoch": 0.5568971043914949, "grad_norm": 1.7055410146713257, "learning_rate": 8.890792291220559e-06, "loss": 0.09328168630599976, "num_input_tokens_seen": 1353458, "step": 1303, "train_runtime": 3702.6342, "train_tokens_per_second": 365.539 }, { "epoch": 0.5573245004808206, "grad_norm": 2.939397096633911, "learning_rate": 8.882226980728052e-06, "loss": 0.12232910096645355, "num_input_tokens_seen": 1354264, "step": 1304, "train_runtime": 3704.8735, "train_tokens_per_second": 365.536 }, { "epoch": 0.5577518965701463, "grad_norm": 2.024653911590576, "learning_rate": 8.873661670235548e-06, "loss": 0.14682631194591522, "num_input_tokens_seen": 1355288, "step": 1305, "train_runtime": 3707.0693, "train_tokens_per_second": 365.596 }, { "epoch": 0.5581792926594722, "grad_norm": 2.576078414916992, "learning_rate": 8.865096359743041e-06, "loss": 0.09955693781375885, "num_input_tokens_seen": 1356086, "step": 1306, "train_runtime": 3709.1659, "train_tokens_per_second": 365.604 }, { "epoch": 0.5586066887487979, "grad_norm": 1.7677081823349, "learning_rate": 8.856531049250536e-06, "loss": 0.12258029729127884, "num_input_tokens_seen": 1357528, "step": 1307, "train_runtime": 3711.4244, "train_tokens_per_second": 365.77 }, { "epoch": 0.5590340848381238, "grad_norm": 2.3473801612854004, "learning_rate": 8.847965738758032e-06, "loss": 0.19139671325683594, "num_input_tokens_seen": 1358710, "step": 1308, "train_runtime": 3713.6208, "train_tokens_per_second": 365.872 }, { "epoch": 0.5594614809274495, "grad_norm": 3.1198081970214844, "learning_rate": 8.839400428265525e-06, "loss": 0.13976724445819855, "num_input_tokens_seen": 1359730, "step": 1309, "train_runtime": 3715.7764, "train_tokens_per_second": 365.934 }, { "epoch": 0.5598888770167753, "grad_norm": 2.246872901916504, "learning_rate": 8.83083511777302e-06, "loss": 0.16256733238697052, "num_input_tokens_seen": 1360966, "step": 1310, "train_runtime": 3718.011, "train_tokens_per_second": 366.047 }, { "epoch": 0.5603162731061011, "grad_norm": 3.02571439743042, "learning_rate": 8.822269807280514e-06, "loss": 0.1526753008365631, "num_input_tokens_seen": 1361962, "step": 1311, "train_runtime": 3720.1745, "train_tokens_per_second": 366.102 }, { "epoch": 0.5607436691954268, "grad_norm": 2.409893035888672, "learning_rate": 8.81370449678801e-06, "loss": 0.1327308565378189, "num_input_tokens_seen": 1362752, "step": 1312, "train_runtime": 3722.2888, "train_tokens_per_second": 366.106 }, { "epoch": 0.5611710652847527, "grad_norm": 1.9398658275604248, "learning_rate": 8.805139186295505e-06, "loss": 0.12720715999603271, "num_input_tokens_seen": 1363708, "step": 1313, "train_runtime": 3724.4118, "train_tokens_per_second": 366.154 }, { "epoch": 0.5615984613740784, "grad_norm": 1.7961324453353882, "learning_rate": 8.796573875802998e-06, "loss": 0.10879611223936081, "num_input_tokens_seen": 1364932, "step": 1314, "train_runtime": 3726.6665, "train_tokens_per_second": 366.261 }, { "epoch": 0.5620258574634042, "grad_norm": 2.0721046924591064, "learning_rate": 8.788008565310493e-06, "loss": 0.13518467545509338, "num_input_tokens_seen": 1365832, "step": 1315, "train_runtime": 3728.8708, "train_tokens_per_second": 366.286 }, { "epoch": 0.56245325355273, "grad_norm": 1.8857738971710205, "learning_rate": 8.779443254817987e-06, "loss": 0.10568409413099289, "num_input_tokens_seen": 1367160, "step": 1316, "train_runtime": 3731.0543, "train_tokens_per_second": 366.427 }, { "epoch": 0.5628806496420558, "grad_norm": 2.482398271560669, "learning_rate": 8.770877944325482e-06, "loss": 0.20136266946792603, "num_input_tokens_seen": 1368060, "step": 1317, "train_runtime": 3733.1907, "train_tokens_per_second": 366.459 }, { "epoch": 0.5633080457313816, "grad_norm": 2.512507915496826, "learning_rate": 8.762312633832976e-06, "loss": 0.13439948856830597, "num_input_tokens_seen": 1368762, "step": 1318, "train_runtime": 3735.2814, "train_tokens_per_second": 366.441 }, { "epoch": 0.5637354418207073, "grad_norm": 2.088801622390747, "learning_rate": 8.753747323340471e-06, "loss": 0.1636715829372406, "num_input_tokens_seen": 1369696, "step": 1319, "train_runtime": 3737.4374, "train_tokens_per_second": 366.48 }, { "epoch": 0.5641628379100331, "grad_norm": 1.8344321250915527, "learning_rate": 8.745182012847966e-06, "loss": 0.0872441828250885, "num_input_tokens_seen": 1370364, "step": 1320, "train_runtime": 3739.4905, "train_tokens_per_second": 366.457 }, { "epoch": 0.5645902339993589, "grad_norm": 3.4391965866088867, "learning_rate": 8.736616702355462e-06, "loss": 0.17728997766971588, "num_input_tokens_seen": 1371314, "step": 1321, "train_runtime": 3755.5123, "train_tokens_per_second": 365.147 }, { "epoch": 0.5650176300886847, "grad_norm": 2.0546209812164307, "learning_rate": 8.728051391862955e-06, "loss": 0.12137656658887863, "num_input_tokens_seen": 1372200, "step": 1322, "train_runtime": 3757.5966, "train_tokens_per_second": 365.18 }, { "epoch": 0.5654450261780105, "grad_norm": 2.064497470855713, "learning_rate": 8.71948608137045e-06, "loss": 0.1498129665851593, "num_input_tokens_seen": 1373306, "step": 1323, "train_runtime": 3759.7638, "train_tokens_per_second": 365.264 }, { "epoch": 0.5658724222673363, "grad_norm": 2.0337252616882324, "learning_rate": 8.710920770877946e-06, "loss": 0.10053382813930511, "num_input_tokens_seen": 1374362, "step": 1324, "train_runtime": 3761.9406, "train_tokens_per_second": 365.333 }, { "epoch": 0.566299818356662, "grad_norm": 3.0742299556732178, "learning_rate": 8.70235546038544e-06, "loss": 0.14325988292694092, "num_input_tokens_seen": 1375172, "step": 1325, "train_runtime": 3764.0952, "train_tokens_per_second": 365.339 }, { "epoch": 0.5667272144459878, "grad_norm": 2.6519343852996826, "learning_rate": 8.693790149892935e-06, "loss": 0.14673161506652832, "num_input_tokens_seen": 1376126, "step": 1326, "train_runtime": 3766.2719, "train_tokens_per_second": 365.381 }, { "epoch": 0.5671546105353136, "grad_norm": 1.8149315118789673, "learning_rate": 8.685224839400428e-06, "loss": 0.1161532774567604, "num_input_tokens_seen": 1377132, "step": 1327, "train_runtime": 3768.5352, "train_tokens_per_second": 365.429 }, { "epoch": 0.5675820066246394, "grad_norm": 2.0530340671539307, "learning_rate": 8.676659528907924e-06, "loss": 0.11958092451095581, "num_input_tokens_seen": 1378052, "step": 1328, "train_runtime": 3770.7822, "train_tokens_per_second": 365.455 }, { "epoch": 0.5680094027139652, "grad_norm": 1.969596266746521, "learning_rate": 8.668094218415419e-06, "loss": 0.10424934327602386, "num_input_tokens_seen": 1379138, "step": 1329, "train_runtime": 3772.9874, "train_tokens_per_second": 365.529 }, { "epoch": 0.5684367988032909, "grad_norm": 1.5329201221466064, "learning_rate": 8.659528907922912e-06, "loss": 0.08686806261539459, "num_input_tokens_seen": 1380224, "step": 1330, "train_runtime": 3775.2438, "train_tokens_per_second": 365.599 }, { "epoch": 0.5688641948926167, "grad_norm": 1.7759238481521606, "learning_rate": 8.650963597430408e-06, "loss": 0.07366158813238144, "num_input_tokens_seen": 1380956, "step": 1331, "train_runtime": 3777.3214, "train_tokens_per_second": 365.591 }, { "epoch": 0.5692915909819425, "grad_norm": 2.401189088821411, "learning_rate": 8.642398286937901e-06, "loss": 0.08268105983734131, "num_input_tokens_seen": 1381664, "step": 1332, "train_runtime": 3779.3754, "train_tokens_per_second": 365.58 }, { "epoch": 0.5697189870712683, "grad_norm": 2.8488943576812744, "learning_rate": 8.633832976445397e-06, "loss": 0.16959163546562195, "num_input_tokens_seen": 1382478, "step": 1333, "train_runtime": 3781.4558, "train_tokens_per_second": 365.594 }, { "epoch": 0.5701463831605941, "grad_norm": 2.101639986038208, "learning_rate": 8.625267665952892e-06, "loss": 0.10440195351839066, "num_input_tokens_seen": 1383428, "step": 1334, "train_runtime": 3783.5597, "train_tokens_per_second": 365.642 }, { "epoch": 0.5705737792499198, "grad_norm": 2.3530216217041016, "learning_rate": 8.616702355460385e-06, "loss": 0.12260738015174866, "num_input_tokens_seen": 1384562, "step": 1335, "train_runtime": 3785.7018, "train_tokens_per_second": 365.735 }, { "epoch": 0.5710011753392457, "grad_norm": 2.685822010040283, "learning_rate": 8.60813704496788e-06, "loss": 0.10980217158794403, "num_input_tokens_seen": 1385582, "step": 1336, "train_runtime": 3787.8491, "train_tokens_per_second": 365.797 }, { "epoch": 0.5714285714285714, "grad_norm": 1.882284164428711, "learning_rate": 8.599571734475376e-06, "loss": 0.14082619547843933, "num_input_tokens_seen": 1387014, "step": 1337, "train_runtime": 3790.1305, "train_tokens_per_second": 365.954 }, { "epoch": 0.5718559675178972, "grad_norm": 1.9834223985671997, "learning_rate": 8.591006423982871e-06, "loss": 0.06217557564377785, "num_input_tokens_seen": 1387936, "step": 1338, "train_runtime": 3792.4668, "train_tokens_per_second": 365.972 }, { "epoch": 0.572283363607223, "grad_norm": 2.7914531230926514, "learning_rate": 8.582441113490365e-06, "loss": 0.10092886537313461, "num_input_tokens_seen": 1388608, "step": 1339, "train_runtime": 3794.576, "train_tokens_per_second": 365.945 }, { "epoch": 0.5727107596965487, "grad_norm": 2.843449831008911, "learning_rate": 8.57387580299786e-06, "loss": 0.14647872745990753, "num_input_tokens_seen": 1389596, "step": 1340, "train_runtime": 3796.7518, "train_tokens_per_second": 365.996 }, { "epoch": 0.5731381557858746, "grad_norm": 2.0625381469726562, "learning_rate": 8.565310492505354e-06, "loss": 0.10510212928056717, "num_input_tokens_seen": 1391016, "step": 1341, "train_runtime": 3799.0464, "train_tokens_per_second": 366.149 }, { "epoch": 0.5735655518752003, "grad_norm": 2.20666241645813, "learning_rate": 8.556745182012849e-06, "loss": 0.1052272766828537, "num_input_tokens_seen": 1392974, "step": 1342, "train_runtime": 3801.3918, "train_tokens_per_second": 366.438 }, { "epoch": 0.5739929479645262, "grad_norm": 2.268599033355713, "learning_rate": 8.548179871520344e-06, "loss": 0.1464858204126358, "num_input_tokens_seen": 1394476, "step": 1343, "train_runtime": 3803.6775, "train_tokens_per_second": 366.613 }, { "epoch": 0.5744203440538519, "grad_norm": 2.611967086791992, "learning_rate": 8.539614561027838e-06, "loss": 0.11977731436491013, "num_input_tokens_seen": 1395278, "step": 1344, "train_runtime": 3805.8458, "train_tokens_per_second": 366.614 }, { "epoch": 0.5748477401431777, "grad_norm": 2.4675326347351074, "learning_rate": 8.531049250535333e-06, "loss": 0.15264874696731567, "num_input_tokens_seen": 1396106, "step": 1345, "train_runtime": 3807.9405, "train_tokens_per_second": 366.63 }, { "epoch": 0.5752751362325035, "grad_norm": 2.1952896118164062, "learning_rate": 8.522483940042827e-06, "loss": 0.108975350856781, "num_input_tokens_seen": 1396912, "step": 1346, "train_runtime": 3810.0442, "train_tokens_per_second": 366.639 }, { "epoch": 0.5757025323218292, "grad_norm": 2.743725299835205, "learning_rate": 8.513918629550322e-06, "loss": 0.14834173023700714, "num_input_tokens_seen": 1397604, "step": 1347, "train_runtime": 3812.1519, "train_tokens_per_second": 366.618 }, { "epoch": 0.5761299284111551, "grad_norm": 2.344770908355713, "learning_rate": 8.505353319057816e-06, "loss": 0.1427122950553894, "num_input_tokens_seen": 1398700, "step": 1348, "train_runtime": 3814.3274, "train_tokens_per_second": 366.696 }, { "epoch": 0.5765573245004808, "grad_norm": 2.6061782836914062, "learning_rate": 8.496788008565311e-06, "loss": 0.1493956595659256, "num_input_tokens_seen": 1399822, "step": 1349, "train_runtime": 3816.5332, "train_tokens_per_second": 366.778 }, { "epoch": 0.5769847205898067, "grad_norm": 1.9854739904403687, "learning_rate": 8.488222698072806e-06, "loss": 0.10830888897180557, "num_input_tokens_seen": 1401042, "step": 1350, "train_runtime": 3818.7548, "train_tokens_per_second": 366.885 }, { "epoch": 0.5774121166791324, "grad_norm": 2.474076986312866, "learning_rate": 8.4796573875803e-06, "loss": 0.14037977159023285, "num_input_tokens_seen": 1401878, "step": 1351, "train_runtime": 3834.4673, "train_tokens_per_second": 365.599 }, { "epoch": 0.5778395127684581, "grad_norm": 1.5662596225738525, "learning_rate": 8.471092077087795e-06, "loss": 0.10657188296318054, "num_input_tokens_seen": 1402938, "step": 1352, "train_runtime": 3836.6308, "train_tokens_per_second": 365.669 }, { "epoch": 0.578266908857784, "grad_norm": 2.7052066326141357, "learning_rate": 8.462526766595289e-06, "loss": 0.11081593483686447, "num_input_tokens_seen": 1403754, "step": 1353, "train_runtime": 3838.7539, "train_tokens_per_second": 365.68 }, { "epoch": 0.5786943049471097, "grad_norm": 1.8116711378097534, "learning_rate": 8.453961456102786e-06, "loss": 0.11657560616731644, "num_input_tokens_seen": 1405168, "step": 1354, "train_runtime": 3841.0703, "train_tokens_per_second": 365.827 }, { "epoch": 0.5791217010364356, "grad_norm": 1.6957309246063232, "learning_rate": 8.445396145610279e-06, "loss": 0.14001968502998352, "num_input_tokens_seen": 1406528, "step": 1355, "train_runtime": 3843.3171, "train_tokens_per_second": 365.967 }, { "epoch": 0.5795490971257613, "grad_norm": 1.9877060651779175, "learning_rate": 8.436830835117774e-06, "loss": 0.16928093135356903, "num_input_tokens_seen": 1407702, "step": 1356, "train_runtime": 3845.534, "train_tokens_per_second": 366.062 }, { "epoch": 0.579976493215087, "grad_norm": 1.618666648864746, "learning_rate": 8.428265524625268e-06, "loss": 0.06174435093998909, "num_input_tokens_seen": 1409130, "step": 1357, "train_runtime": 3847.837, "train_tokens_per_second": 366.214 }, { "epoch": 0.5804038893044129, "grad_norm": 3.162889242172241, "learning_rate": 8.419700214132763e-06, "loss": 0.11345825344324112, "num_input_tokens_seen": 1410038, "step": 1358, "train_runtime": 3849.9652, "train_tokens_per_second": 366.247 }, { "epoch": 0.5808312853937386, "grad_norm": 1.9817333221435547, "learning_rate": 8.411134903640259e-06, "loss": 0.1322307139635086, "num_input_tokens_seen": 1410926, "step": 1359, "train_runtime": 3852.0985, "train_tokens_per_second": 366.275 }, { "epoch": 0.5812586814830645, "grad_norm": 2.8281631469726562, "learning_rate": 8.402569593147752e-06, "loss": 0.13017970323562622, "num_input_tokens_seen": 1411922, "step": 1360, "train_runtime": 3854.2663, "train_tokens_per_second": 366.327 }, { "epoch": 0.5816860775723902, "grad_norm": 2.161170482635498, "learning_rate": 8.394004282655247e-06, "loss": 0.13285818696022034, "num_input_tokens_seen": 1412952, "step": 1361, "train_runtime": 3856.3994, "train_tokens_per_second": 366.392 }, { "epoch": 0.582113473661716, "grad_norm": 3.507059335708618, "learning_rate": 8.385438972162741e-06, "loss": 0.17840546369552612, "num_input_tokens_seen": 1414016, "step": 1362, "train_runtime": 3858.5648, "train_tokens_per_second": 366.462 }, { "epoch": 0.5825408697510418, "grad_norm": 2.134746789932251, "learning_rate": 8.376873661670236e-06, "loss": 0.1294865608215332, "num_input_tokens_seen": 1415272, "step": 1363, "train_runtime": 3860.7568, "train_tokens_per_second": 366.579 }, { "epoch": 0.5829682658403675, "grad_norm": 1.676302433013916, "learning_rate": 8.368308351177732e-06, "loss": 0.06714770197868347, "num_input_tokens_seen": 1416104, "step": 1364, "train_runtime": 3862.8638, "train_tokens_per_second": 366.594 }, { "epoch": 0.5833956619296934, "grad_norm": 2.5522656440734863, "learning_rate": 8.359743040685225e-06, "loss": 0.10977812111377716, "num_input_tokens_seen": 1417086, "step": 1365, "train_runtime": 3865.0168, "train_tokens_per_second": 366.644 }, { "epoch": 0.5838230580190191, "grad_norm": 2.5480408668518066, "learning_rate": 8.35117773019272e-06, "loss": 0.1659277379512787, "num_input_tokens_seen": 1417778, "step": 1366, "train_runtime": 3867.0551, "train_tokens_per_second": 366.63 }, { "epoch": 0.5842504541083449, "grad_norm": 1.7382158041000366, "learning_rate": 8.342612419700214e-06, "loss": 0.09447047114372253, "num_input_tokens_seen": 1418892, "step": 1367, "train_runtime": 3869.281, "train_tokens_per_second": 366.707 }, { "epoch": 0.5846778501976707, "grad_norm": 1.8504555225372314, "learning_rate": 8.33404710920771e-06, "loss": 0.08478574454784393, "num_input_tokens_seen": 1419800, "step": 1368, "train_runtime": 3871.4213, "train_tokens_per_second": 366.739 }, { "epoch": 0.5851052462869964, "grad_norm": 2.2849228382110596, "learning_rate": 8.325481798715203e-06, "loss": 0.13287268579006195, "num_input_tokens_seen": 1420856, "step": 1369, "train_runtime": 3873.6403, "train_tokens_per_second": 366.801 }, { "epoch": 0.5855326423763223, "grad_norm": 1.7850430011749268, "learning_rate": 8.316916488222698e-06, "loss": 0.07814532518386841, "num_input_tokens_seen": 1421690, "step": 1370, "train_runtime": 3875.7701, "train_tokens_per_second": 366.815 }, { "epoch": 0.585960038465648, "grad_norm": 2.3672802448272705, "learning_rate": 8.308351177730193e-06, "loss": 0.16036587953567505, "num_input_tokens_seen": 1422638, "step": 1371, "train_runtime": 3877.9338, "train_tokens_per_second": 366.855 }, { "epoch": 0.5863874345549738, "grad_norm": 2.6111226081848145, "learning_rate": 8.299785867237689e-06, "loss": 0.13331586122512817, "num_input_tokens_seen": 1423712, "step": 1372, "train_runtime": 3880.0851, "train_tokens_per_second": 366.928 }, { "epoch": 0.5868148306442996, "grad_norm": 1.6689529418945312, "learning_rate": 8.291220556745184e-06, "loss": 0.09743912518024445, "num_input_tokens_seen": 1424810, "step": 1373, "train_runtime": 3882.2783, "train_tokens_per_second": 367.004 }, { "epoch": 0.5872422267336254, "grad_norm": 2.184544324874878, "learning_rate": 8.282655246252678e-06, "loss": 0.1430669128894806, "num_input_tokens_seen": 1425684, "step": 1374, "train_runtime": 3884.396, "train_tokens_per_second": 367.028 }, { "epoch": 0.5876696228229512, "grad_norm": 1.749814510345459, "learning_rate": 8.274089935760173e-06, "loss": 0.13397037982940674, "num_input_tokens_seen": 1427042, "step": 1375, "train_runtime": 3886.6138, "train_tokens_per_second": 367.168 }, { "epoch": 0.588097018912277, "grad_norm": 1.6981734037399292, "learning_rate": 8.265524625267666e-06, "loss": 0.12178187817335129, "num_input_tokens_seen": 1428144, "step": 1376, "train_runtime": 3888.8652, "train_tokens_per_second": 367.239 }, { "epoch": 0.5885244150016027, "grad_norm": 3.6601908206939697, "learning_rate": 8.256959314775162e-06, "loss": 0.1699635237455368, "num_input_tokens_seen": 1428934, "step": 1377, "train_runtime": 3891.0216, "train_tokens_per_second": 367.239 }, { "epoch": 0.5889518110909285, "grad_norm": 1.5891457796096802, "learning_rate": 8.248394004282655e-06, "loss": 0.10981012135744095, "num_input_tokens_seen": 1430552, "step": 1378, "train_runtime": 3893.3843, "train_tokens_per_second": 367.431 }, { "epoch": 0.5893792071802543, "grad_norm": 2.2618274688720703, "learning_rate": 8.23982869379015e-06, "loss": 0.11818771809339523, "num_input_tokens_seen": 1431452, "step": 1379, "train_runtime": 3895.5958, "train_tokens_per_second": 367.454 }, { "epoch": 0.5898066032695801, "grad_norm": 2.764841079711914, "learning_rate": 8.231263383297646e-06, "loss": 0.0918097198009491, "num_input_tokens_seen": 1432088, "step": 1380, "train_runtime": 3897.6579, "train_tokens_per_second": 367.423 }, { "epoch": 0.5902339993589059, "grad_norm": 1.4518064260482788, "learning_rate": 8.22269807280514e-06, "loss": 0.06419715285301208, "num_input_tokens_seen": 1433322, "step": 1381, "train_runtime": 3913.1128, "train_tokens_per_second": 366.287 }, { "epoch": 0.5906613954482316, "grad_norm": 2.7362771034240723, "learning_rate": 8.214132762312635e-06, "loss": 0.18493907153606415, "num_input_tokens_seen": 1434046, "step": 1382, "train_runtime": 3915.2862, "train_tokens_per_second": 366.269 }, { "epoch": 0.5910887915375574, "grad_norm": 2.793471336364746, "learning_rate": 8.205567451820128e-06, "loss": 0.14909465610980988, "num_input_tokens_seen": 1434882, "step": 1383, "train_runtime": 3917.4063, "train_tokens_per_second": 366.284 }, { "epoch": 0.5915161876268832, "grad_norm": 1.6709586381912231, "learning_rate": 8.197002141327624e-06, "loss": 0.12015888094902039, "num_input_tokens_seen": 1436088, "step": 1384, "train_runtime": 3919.5929, "train_tokens_per_second": 366.387 }, { "epoch": 0.591943583716209, "grad_norm": 2.0044360160827637, "learning_rate": 8.188436830835119e-06, "loss": 0.12347231805324554, "num_input_tokens_seen": 1437124, "step": 1385, "train_runtime": 3921.7429, "train_tokens_per_second": 366.45 }, { "epoch": 0.5923709798055348, "grad_norm": 1.6326919794082642, "learning_rate": 8.179871520342612e-06, "loss": 0.1159253865480423, "num_input_tokens_seen": 1438190, "step": 1386, "train_runtime": 3923.888, "train_tokens_per_second": 366.522 }, { "epoch": 0.5927983758948605, "grad_norm": 1.9021408557891846, "learning_rate": 8.171306209850108e-06, "loss": 0.11006900668144226, "num_input_tokens_seen": 1439252, "step": 1387, "train_runtime": 3926.0303, "train_tokens_per_second": 366.592 }, { "epoch": 0.5932257719841864, "grad_norm": 2.646395444869995, "learning_rate": 8.162740899357601e-06, "loss": 0.101168692111969, "num_input_tokens_seen": 1439840, "step": 1388, "train_runtime": 3928.0153, "train_tokens_per_second": 366.557 }, { "epoch": 0.5936531680735121, "grad_norm": 2.4265596866607666, "learning_rate": 8.154175588865098e-06, "loss": 0.1598915308713913, "num_input_tokens_seen": 1440750, "step": 1389, "train_runtime": 3930.1664, "train_tokens_per_second": 366.588 }, { "epoch": 0.5940805641628379, "grad_norm": 1.9568217992782593, "learning_rate": 8.145610278372592e-06, "loss": 0.11979921162128448, "num_input_tokens_seen": 1441662, "step": 1390, "train_runtime": 3932.3014, "train_tokens_per_second": 366.62 }, { "epoch": 0.5945079602521637, "grad_norm": 7.357199192047119, "learning_rate": 8.137044967880087e-06, "loss": 0.13000361621379852, "num_input_tokens_seen": 1442694, "step": 1391, "train_runtime": 3934.5113, "train_tokens_per_second": 366.677 }, { "epoch": 0.5949353563414895, "grad_norm": 1.5940834283828735, "learning_rate": 8.12847965738758e-06, "loss": 0.0894617959856987, "num_input_tokens_seen": 1443642, "step": 1392, "train_runtime": 3936.8303, "train_tokens_per_second": 366.702 }, { "epoch": 0.5953627524308153, "grad_norm": 3.110785484313965, "learning_rate": 8.119914346895076e-06, "loss": 0.12593917548656464, "num_input_tokens_seen": 1444738, "step": 1393, "train_runtime": 3939.1446, "train_tokens_per_second": 366.764 }, { "epoch": 0.595790148520141, "grad_norm": 3.2190911769866943, "learning_rate": 8.111349036402571e-06, "loss": 0.22693561017513275, "num_input_tokens_seen": 1445596, "step": 1394, "train_runtime": 3941.2728, "train_tokens_per_second": 366.784 }, { "epoch": 0.5962175446094669, "grad_norm": 2.578913450241089, "learning_rate": 8.102783725910065e-06, "loss": 0.15273822844028473, "num_input_tokens_seen": 1446378, "step": 1395, "train_runtime": 3943.3784, "train_tokens_per_second": 366.787 }, { "epoch": 0.5966449406987926, "grad_norm": 2.731638193130493, "learning_rate": 8.09421841541756e-06, "loss": 0.17036044597625732, "num_input_tokens_seen": 1447422, "step": 1396, "train_runtime": 3945.5416, "train_tokens_per_second": 366.85 }, { "epoch": 0.5970723367881184, "grad_norm": 2.767289876937866, "learning_rate": 8.085653104925054e-06, "loss": 0.232232004404068, "num_input_tokens_seen": 1449220, "step": 1397, "train_runtime": 3947.8662, "train_tokens_per_second": 367.089 }, { "epoch": 0.5974997328774442, "grad_norm": 2.646841526031494, "learning_rate": 8.077087794432549e-06, "loss": 0.21355631947517395, "num_input_tokens_seen": 1449952, "step": 1398, "train_runtime": 3949.9539, "train_tokens_per_second": 367.081 }, { "epoch": 0.5979271289667699, "grad_norm": 1.6529147624969482, "learning_rate": 8.068522483940043e-06, "loss": 0.044996753334999084, "num_input_tokens_seen": 1450596, "step": 1399, "train_runtime": 3951.994, "train_tokens_per_second": 367.054 }, { "epoch": 0.5983545250560958, "grad_norm": 1.8547234535217285, "learning_rate": 8.059957173447538e-06, "loss": 0.1041540578007698, "num_input_tokens_seen": 1451548, "step": 1400, "train_runtime": 3954.1423, "train_tokens_per_second": 367.096 }, { "epoch": 0.5987819211454215, "grad_norm": 1.8195332288742065, "learning_rate": 8.051391862955033e-06, "loss": 0.13584136962890625, "num_input_tokens_seen": 1452764, "step": 1401, "train_runtime": 3956.3541, "train_tokens_per_second": 367.198 }, { "epoch": 0.5992093172347474, "grad_norm": 1.8398702144622803, "learning_rate": 8.042826552462527e-06, "loss": 0.1024625152349472, "num_input_tokens_seen": 1453610, "step": 1402, "train_runtime": 3958.4789, "train_tokens_per_second": 367.214 }, { "epoch": 0.5996367133240731, "grad_norm": 1.859737753868103, "learning_rate": 8.034261241970022e-06, "loss": 0.09262381494045258, "num_input_tokens_seen": 1454470, "step": 1403, "train_runtime": 3960.6056, "train_tokens_per_second": 367.234 }, { "epoch": 0.6000641094133988, "grad_norm": 1.7873998880386353, "learning_rate": 8.025695931477516e-06, "loss": 0.11242175102233887, "num_input_tokens_seen": 1455998, "step": 1404, "train_runtime": 3962.9535, "train_tokens_per_second": 367.402 }, { "epoch": 0.6000641094133988, "eval_loss": 0.47081810235977173, "eval_runtime": 57.7352, "eval_samples_per_second": 17.286, "eval_steps_per_second": 8.643, "num_input_tokens_seen": 1455998, "step": 1404 }, { "epoch": 0.6004915055027247, "grad_norm": 2.3104519844055176, "learning_rate": 8.01713062098501e-06, "loss": 0.15767702460289001, "num_input_tokens_seen": 1456830, "step": 1405, "train_runtime": 4022.7978, "train_tokens_per_second": 362.143 }, { "epoch": 0.6009189015920504, "grad_norm": 2.4053452014923096, "learning_rate": 8.008565310492506e-06, "loss": 0.16222745180130005, "num_input_tokens_seen": 1457788, "step": 1406, "train_runtime": 4024.9364, "train_tokens_per_second": 362.189 }, { "epoch": 0.6013462976813763, "grad_norm": 2.3348591327667236, "learning_rate": 8.000000000000001e-06, "loss": 0.14439409971237183, "num_input_tokens_seen": 1458838, "step": 1407, "train_runtime": 4027.0936, "train_tokens_per_second": 362.256 }, { "epoch": 0.601773693770702, "grad_norm": 1.817209243774414, "learning_rate": 7.991434689507495e-06, "loss": 0.09775623679161072, "num_input_tokens_seen": 1459840, "step": 1408, "train_runtime": 4029.2095, "train_tokens_per_second": 362.314 }, { "epoch": 0.6022010898600277, "grad_norm": 2.439809799194336, "learning_rate": 7.98286937901499e-06, "loss": 0.1740535944700241, "num_input_tokens_seen": 1460590, "step": 1409, "train_runtime": 4031.296, "train_tokens_per_second": 362.313 }, { "epoch": 0.6026284859493536, "grad_norm": 1.7355129718780518, "learning_rate": 7.974304068522485e-06, "loss": 0.13921035826206207, "num_input_tokens_seen": 1462106, "step": 1410, "train_runtime": 4033.576, "train_tokens_per_second": 362.484 }, { "epoch": 0.6030558820386793, "grad_norm": 1.418506145477295, "learning_rate": 7.965738758029979e-06, "loss": 0.09766557067632675, "num_input_tokens_seen": 1463456, "step": 1411, "train_runtime": 4049.8581, "train_tokens_per_second": 361.36 }, { "epoch": 0.6034832781280052, "grad_norm": 1.7446205615997314, "learning_rate": 7.957173447537474e-06, "loss": 0.11944037675857544, "num_input_tokens_seen": 1464550, "step": 1412, "train_runtime": 4052.0314, "train_tokens_per_second": 361.436 }, { "epoch": 0.6039106742173309, "grad_norm": 2.5613455772399902, "learning_rate": 7.948608137044968e-06, "loss": 0.15170155465602875, "num_input_tokens_seen": 1465682, "step": 1413, "train_runtime": 4054.1869, "train_tokens_per_second": 361.523 }, { "epoch": 0.6043380703066566, "grad_norm": 1.9283398389816284, "learning_rate": 7.940042826552463e-06, "loss": 0.15324467420578003, "num_input_tokens_seen": 1466848, "step": 1414, "train_runtime": 4056.3957, "train_tokens_per_second": 361.614 }, { "epoch": 0.6047654663959825, "grad_norm": 1.6675468683242798, "learning_rate": 7.931477516059958e-06, "loss": 0.07195501029491425, "num_input_tokens_seen": 1467706, "step": 1415, "train_runtime": 4058.571, "train_tokens_per_second": 361.631 }, { "epoch": 0.6051928624853082, "grad_norm": 2.899714231491089, "learning_rate": 7.922912205567452e-06, "loss": 0.1979353129863739, "num_input_tokens_seen": 1468522, "step": 1416, "train_runtime": 4060.6543, "train_tokens_per_second": 361.647 }, { "epoch": 0.6056202585746341, "grad_norm": 2.040581703186035, "learning_rate": 7.914346895074947e-06, "loss": 0.10800875723361969, "num_input_tokens_seen": 1469476, "step": 1417, "train_runtime": 4062.8141, "train_tokens_per_second": 361.689 }, { "epoch": 0.6060476546639598, "grad_norm": 1.8093817234039307, "learning_rate": 7.905781584582441e-06, "loss": 0.11833525449037552, "num_input_tokens_seen": 1470466, "step": 1418, "train_runtime": 4064.9473, "train_tokens_per_second": 361.743 }, { "epoch": 0.6064750507532856, "grad_norm": 1.8102803230285645, "learning_rate": 7.897216274089936e-06, "loss": 0.08050483465194702, "num_input_tokens_seen": 1471740, "step": 1419, "train_runtime": 4067.1487, "train_tokens_per_second": 361.86 }, { "epoch": 0.6069024468426114, "grad_norm": 1.804361343383789, "learning_rate": 7.888650963597431e-06, "loss": 0.0876578614115715, "num_input_tokens_seen": 1472736, "step": 1420, "train_runtime": 4069.2982, "train_tokens_per_second": 361.914 }, { "epoch": 0.6073298429319371, "grad_norm": 2.8057749271392822, "learning_rate": 7.880085653104925e-06, "loss": 0.1516537219285965, "num_input_tokens_seen": 1473460, "step": 1421, "train_runtime": 4071.4015, "train_tokens_per_second": 361.905 }, { "epoch": 0.607757239021263, "grad_norm": 1.7483267784118652, "learning_rate": 7.87152034261242e-06, "loss": 0.07873252779245377, "num_input_tokens_seen": 1474266, "step": 1422, "train_runtime": 4073.5196, "train_tokens_per_second": 361.915 }, { "epoch": 0.6081846351105887, "grad_norm": 2.199683427810669, "learning_rate": 7.862955032119916e-06, "loss": 0.12082644551992416, "num_input_tokens_seen": 1475044, "step": 1423, "train_runtime": 4075.6227, "train_tokens_per_second": 361.919 }, { "epoch": 0.6086120311999145, "grad_norm": 3.2418212890625, "learning_rate": 7.854389721627411e-06, "loss": 0.138291597366333, "num_input_tokens_seen": 1475826, "step": 1424, "train_runtime": 4077.7247, "train_tokens_per_second": 361.924 }, { "epoch": 0.6090394272892403, "grad_norm": 2.404599189758301, "learning_rate": 7.845824411134904e-06, "loss": 0.11044611781835556, "num_input_tokens_seen": 1476594, "step": 1425, "train_runtime": 4079.8823, "train_tokens_per_second": 361.921 }, { "epoch": 0.6094668233785661, "grad_norm": 2.100550889968872, "learning_rate": 7.8372591006424e-06, "loss": 0.10274676978588104, "num_input_tokens_seen": 1477446, "step": 1426, "train_runtime": 4082.0051, "train_tokens_per_second": 361.941 }, { "epoch": 0.6098942194678919, "grad_norm": 2.7254180908203125, "learning_rate": 7.828693790149893e-06, "loss": 0.15266837179660797, "num_input_tokens_seen": 1478308, "step": 1427, "train_runtime": 4084.1587, "train_tokens_per_second": 361.961 }, { "epoch": 0.6103216155572176, "grad_norm": 2.171696186065674, "learning_rate": 7.820128479657389e-06, "loss": 0.08129426836967468, "num_input_tokens_seen": 1479076, "step": 1428, "train_runtime": 4086.2884, "train_tokens_per_second": 361.961 }, { "epoch": 0.6107490116465434, "grad_norm": 2.0329370498657227, "learning_rate": 7.811563169164882e-06, "loss": 0.07338335365056992, "num_input_tokens_seen": 1479708, "step": 1429, "train_runtime": 4088.3113, "train_tokens_per_second": 361.936 }, { "epoch": 0.6111764077358692, "grad_norm": 2.23579478263855, "learning_rate": 7.802997858672377e-06, "loss": 0.13259582221508026, "num_input_tokens_seen": 1480992, "step": 1430, "train_runtime": 4090.538, "train_tokens_per_second": 362.053 }, { "epoch": 0.611603803825195, "grad_norm": 2.13228440284729, "learning_rate": 7.794432548179873e-06, "loss": 0.10177969932556152, "num_input_tokens_seen": 1482360, "step": 1431, "train_runtime": 4092.7994, "train_tokens_per_second": 362.187 }, { "epoch": 0.6120311999145208, "grad_norm": 1.5976146459579468, "learning_rate": 7.785867237687366e-06, "loss": 0.0857323408126831, "num_input_tokens_seen": 1483492, "step": 1432, "train_runtime": 4094.9523, "train_tokens_per_second": 362.273 }, { "epoch": 0.6124585960038466, "grad_norm": 2.2590928077697754, "learning_rate": 7.777301927194862e-06, "loss": 0.15083687007427216, "num_input_tokens_seen": 1484432, "step": 1433, "train_runtime": 4097.0793, "train_tokens_per_second": 362.315 }, { "epoch": 0.6128859920931723, "grad_norm": 2.2661385536193848, "learning_rate": 7.768736616702355e-06, "loss": 0.15994848310947418, "num_input_tokens_seen": 1485592, "step": 1434, "train_runtime": 4099.2655, "train_tokens_per_second": 362.404 }, { "epoch": 0.6133133881824981, "grad_norm": 2.448089838027954, "learning_rate": 7.76017130620985e-06, "loss": 0.1597270965576172, "num_input_tokens_seen": 1486452, "step": 1435, "train_runtime": 4101.4177, "train_tokens_per_second": 362.424 }, { "epoch": 0.6137407842718239, "grad_norm": 2.755557060241699, "learning_rate": 7.751605995717346e-06, "loss": 0.15789887309074402, "num_input_tokens_seen": 1487382, "step": 1436, "train_runtime": 4103.57, "train_tokens_per_second": 362.46 }, { "epoch": 0.6141681803611497, "grad_norm": 2.5255467891693115, "learning_rate": 7.74304068522484e-06, "loss": 0.19847720861434937, "num_input_tokens_seen": 1488180, "step": 1437, "train_runtime": 4105.6764, "train_tokens_per_second": 362.469 }, { "epoch": 0.6145955764504755, "grad_norm": 1.8054429292678833, "learning_rate": 7.734475374732335e-06, "loss": 0.08471320569515228, "num_input_tokens_seen": 1489138, "step": 1438, "train_runtime": 4107.8362, "train_tokens_per_second": 362.512 }, { "epoch": 0.6150229725398013, "grad_norm": 2.6610374450683594, "learning_rate": 7.725910064239828e-06, "loss": 0.08155062794685364, "num_input_tokens_seen": 1490098, "step": 1439, "train_runtime": 4110.0394, "train_tokens_per_second": 362.551 }, { "epoch": 0.615450368629127, "grad_norm": 1.975503921508789, "learning_rate": 7.717344753747325e-06, "loss": 0.10573365539312363, "num_input_tokens_seen": 1490940, "step": 1440, "train_runtime": 4112.1313, "train_tokens_per_second": 362.571 }, { "epoch": 0.6158777647184528, "grad_norm": 2.788630723953247, "learning_rate": 7.708779443254819e-06, "loss": 0.06836487352848053, "num_input_tokens_seen": 1491526, "step": 1441, "train_runtime": 4129.3134, "train_tokens_per_second": 361.204 }, { "epoch": 0.6163051608077786, "grad_norm": 2.4164459705352783, "learning_rate": 7.700214132762314e-06, "loss": 0.148130401968956, "num_input_tokens_seen": 1492750, "step": 1442, "train_runtime": 4131.4973, "train_tokens_per_second": 361.31 }, { "epoch": 0.6167325568971044, "grad_norm": 2.46335768699646, "learning_rate": 7.691648822269808e-06, "loss": 0.10412309318780899, "num_input_tokens_seen": 1493648, "step": 1443, "train_runtime": 4133.6533, "train_tokens_per_second": 361.338 }, { "epoch": 0.6171599529864302, "grad_norm": 2.335508346557617, "learning_rate": 7.683083511777303e-06, "loss": 0.0902898907661438, "num_input_tokens_seen": 1494386, "step": 1444, "train_runtime": 4135.83, "train_tokens_per_second": 361.327 }, { "epoch": 0.617587349075756, "grad_norm": 2.1662323474884033, "learning_rate": 7.674518201284798e-06, "loss": 0.12006018310785294, "num_input_tokens_seen": 1495750, "step": 1445, "train_runtime": 4138.0632, "train_tokens_per_second": 361.461 }, { "epoch": 0.6180147451650817, "grad_norm": 3.977302074432373, "learning_rate": 7.665952890792292e-06, "loss": 0.19146135449409485, "num_input_tokens_seen": 1496632, "step": 1446, "train_runtime": 4140.2288, "train_tokens_per_second": 361.485 }, { "epoch": 0.6184421412544076, "grad_norm": 2.467905044555664, "learning_rate": 7.657387580299787e-06, "loss": 0.1189160943031311, "num_input_tokens_seen": 1497298, "step": 1447, "train_runtime": 4142.3264, "train_tokens_per_second": 361.463 }, { "epoch": 0.6188695373437333, "grad_norm": 3.2811837196350098, "learning_rate": 7.64882226980728e-06, "loss": 0.20138442516326904, "num_input_tokens_seen": 1497988, "step": 1448, "train_runtime": 4144.4699, "train_tokens_per_second": 361.443 }, { "epoch": 0.6192969334330591, "grad_norm": 1.574859857559204, "learning_rate": 7.640256959314776e-06, "loss": 0.07242729514837265, "num_input_tokens_seen": 1498954, "step": 1449, "train_runtime": 4146.6329, "train_tokens_per_second": 361.487 }, { "epoch": 0.6197243295223849, "grad_norm": 2.481360673904419, "learning_rate": 7.631691648822271e-06, "loss": 0.09188266843557358, "num_input_tokens_seen": 1499586, "step": 1450, "train_runtime": 4148.6602, "train_tokens_per_second": 361.463 }, { "epoch": 0.6201517256117106, "grad_norm": 2.070668935775757, "learning_rate": 7.623126338329765e-06, "loss": 0.1142788976430893, "num_input_tokens_seen": 1500474, "step": 1451, "train_runtime": 4150.791, "train_tokens_per_second": 361.491 }, { "epoch": 0.6205791217010365, "grad_norm": 2.3478009700775146, "learning_rate": 7.614561027837259e-06, "loss": 0.12936431169509888, "num_input_tokens_seen": 1501270, "step": 1452, "train_runtime": 4152.8455, "train_tokens_per_second": 361.504 }, { "epoch": 0.6210065177903622, "grad_norm": 2.4626338481903076, "learning_rate": 7.605995717344754e-06, "loss": 0.09926608204841614, "num_input_tokens_seen": 1502062, "step": 1453, "train_runtime": 4154.945, "train_tokens_per_second": 361.512 }, { "epoch": 0.621433913879688, "grad_norm": 2.2841718196868896, "learning_rate": 7.597430406852249e-06, "loss": 0.09891198575496674, "num_input_tokens_seen": 1502904, "step": 1454, "train_runtime": 4157.0367, "train_tokens_per_second": 361.533 }, { "epoch": 0.6218613099690138, "grad_norm": 3.0229642391204834, "learning_rate": 7.588865096359743e-06, "loss": 0.11280228197574615, "num_input_tokens_seen": 1503628, "step": 1455, "train_runtime": 4159.1279, "train_tokens_per_second": 361.525 }, { "epoch": 0.6222887060583395, "grad_norm": 3.1719369888305664, "learning_rate": 7.580299785867238e-06, "loss": 0.09361995756626129, "num_input_tokens_seen": 1504378, "step": 1456, "train_runtime": 4161.205, "train_tokens_per_second": 361.525 }, { "epoch": 0.6227161021476654, "grad_norm": 2.3258070945739746, "learning_rate": 7.571734475374734e-06, "loss": 0.14535577595233917, "num_input_tokens_seen": 1505316, "step": 1457, "train_runtime": 4163.3433, "train_tokens_per_second": 361.564 }, { "epoch": 0.6231434982369911, "grad_norm": 2.711185932159424, "learning_rate": 7.563169164882228e-06, "loss": 0.19543111324310303, "num_input_tokens_seen": 1506384, "step": 1458, "train_runtime": 4165.5143, "train_tokens_per_second": 361.632 }, { "epoch": 0.623570894326317, "grad_norm": 2.044725179672241, "learning_rate": 7.554603854389723e-06, "loss": 0.11587262153625488, "num_input_tokens_seen": 1507456, "step": 1459, "train_runtime": 4167.659, "train_tokens_per_second": 361.703 }, { "epoch": 0.6239982904156427, "grad_norm": 2.063974380493164, "learning_rate": 7.546038543897217e-06, "loss": 0.0817880630493164, "num_input_tokens_seen": 1508336, "step": 1460, "train_runtime": 4169.7766, "train_tokens_per_second": 361.731 }, { "epoch": 0.6244256865049684, "grad_norm": 2.3997654914855957, "learning_rate": 7.5374732334047115e-06, "loss": 0.14338666200637817, "num_input_tokens_seen": 1509728, "step": 1461, "train_runtime": 4172.0284, "train_tokens_per_second": 361.869 }, { "epoch": 0.6248530825942943, "grad_norm": 1.8984113931655884, "learning_rate": 7.528907922912207e-06, "loss": 0.09732633829116821, "num_input_tokens_seen": 1510484, "step": 1462, "train_runtime": 4174.1178, "train_tokens_per_second": 361.869 }, { "epoch": 0.62528047868362, "grad_norm": 2.3154830932617188, "learning_rate": 7.520342612419701e-06, "loss": 0.18469257652759552, "num_input_tokens_seen": 1511506, "step": 1463, "train_runtime": 4176.3308, "train_tokens_per_second": 361.922 }, { "epoch": 0.6257078747729459, "grad_norm": 2.2479748725891113, "learning_rate": 7.511777301927196e-06, "loss": 0.10611981153488159, "num_input_tokens_seen": 1512420, "step": 1464, "train_runtime": 4178.4473, "train_tokens_per_second": 361.957 }, { "epoch": 0.6261352708622716, "grad_norm": 1.5329359769821167, "learning_rate": 7.50321199143469e-06, "loss": 0.09093845635652542, "num_input_tokens_seen": 1513738, "step": 1465, "train_runtime": 4180.7018, "train_tokens_per_second": 362.077 }, { "epoch": 0.6265626669515973, "grad_norm": 2.9673044681549072, "learning_rate": 7.4946466809421845e-06, "loss": 0.1207410991191864, "num_input_tokens_seen": 1514442, "step": 1466, "train_runtime": 4182.792, "train_tokens_per_second": 362.065 }, { "epoch": 0.6269900630409232, "grad_norm": 3.5616681575775146, "learning_rate": 7.486081370449679e-06, "loss": 0.0960858017206192, "num_input_tokens_seen": 1515064, "step": 1467, "train_runtime": 4184.8166, "train_tokens_per_second": 362.038 }, { "epoch": 0.6274174591302489, "grad_norm": 6.080048561096191, "learning_rate": 7.477516059957174e-06, "loss": 0.17542141675949097, "num_input_tokens_seen": 1516422, "step": 1468, "train_runtime": 4187.0666, "train_tokens_per_second": 362.168 }, { "epoch": 0.6278448552195748, "grad_norm": 2.1161932945251465, "learning_rate": 7.468950749464669e-06, "loss": 0.12328416109085083, "num_input_tokens_seen": 1517430, "step": 1469, "train_runtime": 4189.2191, "train_tokens_per_second": 362.223 }, { "epoch": 0.6282722513089005, "grad_norm": 2.1375732421875, "learning_rate": 7.460385438972163e-06, "loss": 0.0849141776561737, "num_input_tokens_seen": 1518076, "step": 1470, "train_runtime": 4191.2785, "train_tokens_per_second": 362.199 }, { "epoch": 0.6286996473982263, "grad_norm": 2.348376989364624, "learning_rate": 7.4518201284796575e-06, "loss": 0.10368818044662476, "num_input_tokens_seen": 1519230, "step": 1471, "train_runtime": 4205.6248, "train_tokens_per_second": 361.238 }, { "epoch": 0.6291270434875521, "grad_norm": 2.236046552658081, "learning_rate": 7.443254817987152e-06, "loss": 0.08742250502109528, "num_input_tokens_seen": 1519822, "step": 1472, "train_runtime": 4207.6455, "train_tokens_per_second": 361.205 }, { "epoch": 0.6295544395768778, "grad_norm": 1.9247562885284424, "learning_rate": 7.434689507494646e-06, "loss": 0.05948425829410553, "num_input_tokens_seen": 1520542, "step": 1473, "train_runtime": 4209.7293, "train_tokens_per_second": 361.197 }, { "epoch": 0.6299818356662037, "grad_norm": 1.6708866357803345, "learning_rate": 7.4261241970021425e-06, "loss": 0.08919192850589752, "num_input_tokens_seen": 1521506, "step": 1474, "train_runtime": 4211.8398, "train_tokens_per_second": 361.245 }, { "epoch": 0.6304092317555294, "grad_norm": 2.101806163787842, "learning_rate": 7.417558886509637e-06, "loss": 0.08752292394638062, "num_input_tokens_seen": 1522358, "step": 1475, "train_runtime": 4213.9544, "train_tokens_per_second": 361.266 }, { "epoch": 0.6308366278448552, "grad_norm": 2.0418248176574707, "learning_rate": 7.408993576017131e-06, "loss": 0.11928815394639969, "num_input_tokens_seen": 1523224, "step": 1476, "train_runtime": 4216.0605, "train_tokens_per_second": 361.291 }, { "epoch": 0.631264023934181, "grad_norm": 3.2721803188323975, "learning_rate": 7.400428265524627e-06, "loss": 0.14328506588935852, "num_input_tokens_seen": 1524170, "step": 1477, "train_runtime": 4218.1714, "train_tokens_per_second": 361.334 }, { "epoch": 0.6316914200235068, "grad_norm": 2.308032274246216, "learning_rate": 7.391862955032121e-06, "loss": 0.08133391290903091, "num_input_tokens_seen": 1524894, "step": 1478, "train_runtime": 4220.2493, "train_tokens_per_second": 361.328 }, { "epoch": 0.6321188161128326, "grad_norm": 1.9015473127365112, "learning_rate": 7.3832976445396155e-06, "loss": 0.08786919713020325, "num_input_tokens_seen": 1525752, "step": 1479, "train_runtime": 4222.3635, "train_tokens_per_second": 361.35 }, { "epoch": 0.6325462122021583, "grad_norm": 1.8171110153198242, "learning_rate": 7.37473233404711e-06, "loss": 0.09292969852685928, "num_input_tokens_seen": 1526760, "step": 1480, "train_runtime": 4224.5633, "train_tokens_per_second": 361.401 }, { "epoch": 0.6329736082914841, "grad_norm": 2.274385690689087, "learning_rate": 7.366167023554604e-06, "loss": 0.10129518061876297, "num_input_tokens_seen": 1527564, "step": 1481, "train_runtime": 4226.6747, "train_tokens_per_second": 361.41 }, { "epoch": 0.6334010043808099, "grad_norm": 1.4336169958114624, "learning_rate": 7.357601713062099e-06, "loss": 0.08634652942419052, "num_input_tokens_seen": 1528844, "step": 1482, "train_runtime": 4229.0001, "train_tokens_per_second": 361.514 }, { "epoch": 0.6338284004701357, "grad_norm": 1.9699504375457764, "learning_rate": 7.349036402569594e-06, "loss": 0.12698976695537567, "num_input_tokens_seen": 1529794, "step": 1483, "train_runtime": 4231.1199, "train_tokens_per_second": 361.558 }, { "epoch": 0.6342557965594615, "grad_norm": 2.6824519634246826, "learning_rate": 7.3404710920770885e-06, "loss": 0.11977970600128174, "num_input_tokens_seen": 1530606, "step": 1484, "train_runtime": 4233.2098, "train_tokens_per_second": 361.571 }, { "epoch": 0.6346831926487873, "grad_norm": 1.777571678161621, "learning_rate": 7.331905781584583e-06, "loss": 0.10391326248645782, "num_input_tokens_seen": 1531714, "step": 1485, "train_runtime": 4235.3856, "train_tokens_per_second": 361.647 }, { "epoch": 0.635110588738113, "grad_norm": 2.8286495208740234, "learning_rate": 7.323340471092077e-06, "loss": 0.24658288061618805, "num_input_tokens_seen": 1532570, "step": 1486, "train_runtime": 4237.4597, "train_tokens_per_second": 361.672 }, { "epoch": 0.6355379848274388, "grad_norm": 2.292820453643799, "learning_rate": 7.314775160599572e-06, "loss": 0.15723267197608948, "num_input_tokens_seen": 1533636, "step": 1487, "train_runtime": 4239.5774, "train_tokens_per_second": 361.743 }, { "epoch": 0.6359653809167646, "grad_norm": 2.355534315109253, "learning_rate": 7.306209850107066e-06, "loss": 0.14795181155204773, "num_input_tokens_seen": 1534644, "step": 1488, "train_runtime": 4241.714, "train_tokens_per_second": 361.798 }, { "epoch": 0.6363927770060904, "grad_norm": 2.0955100059509277, "learning_rate": 7.2976445396145615e-06, "loss": 0.08944962173700333, "num_input_tokens_seen": 1535460, "step": 1489, "train_runtime": 4243.7884, "train_tokens_per_second": 361.814 }, { "epoch": 0.6368201730954162, "grad_norm": 2.4552884101867676, "learning_rate": 7.289079229122056e-06, "loss": 0.10170731693506241, "num_input_tokens_seen": 1536424, "step": 1490, "train_runtime": 4245.9291, "train_tokens_per_second": 361.858 }, { "epoch": 0.637247569184742, "grad_norm": 1.9159789085388184, "learning_rate": 7.28051391862955e-06, "loss": 0.16074612736701965, "num_input_tokens_seen": 1538244, "step": 1491, "train_runtime": 4248.2952, "train_tokens_per_second": 362.085 }, { "epoch": 0.6376749652740678, "grad_norm": 4.376994609832764, "learning_rate": 7.2719486081370465e-06, "loss": 0.17210756242275238, "num_input_tokens_seen": 1539572, "step": 1492, "train_runtime": 4250.4874, "train_tokens_per_second": 362.211 }, { "epoch": 0.6381023613633935, "grad_norm": 3.9393601417541504, "learning_rate": 7.263383297644541e-06, "loss": 0.14389149844646454, "num_input_tokens_seen": 1540412, "step": 1493, "train_runtime": 4252.5689, "train_tokens_per_second": 362.231 }, { "epoch": 0.6385297574527193, "grad_norm": 3.1448442935943604, "learning_rate": 7.254817987152035e-06, "loss": 0.10606074333190918, "num_input_tokens_seen": 1541012, "step": 1494, "train_runtime": 4254.5567, "train_tokens_per_second": 362.203 }, { "epoch": 0.6389571535420451, "grad_norm": 1.3708915710449219, "learning_rate": 7.24625267665953e-06, "loss": 0.06667020171880722, "num_input_tokens_seen": 1541764, "step": 1495, "train_runtime": 4256.6475, "train_tokens_per_second": 362.201 }, { "epoch": 0.6393845496313709, "grad_norm": 1.4790881872177124, "learning_rate": 7.237687366167024e-06, "loss": 0.06881444156169891, "num_input_tokens_seen": 1543226, "step": 1496, "train_runtime": 4258.8516, "train_tokens_per_second": 362.357 }, { "epoch": 0.6398119457206967, "grad_norm": 2.453960418701172, "learning_rate": 7.229122055674519e-06, "loss": 0.11519265919923782, "num_input_tokens_seen": 1543984, "step": 1497, "train_runtime": 4260.9601, "train_tokens_per_second": 362.356 }, { "epoch": 0.6402393418100224, "grad_norm": 2.6465978622436523, "learning_rate": 7.220556745182014e-06, "loss": 0.1643434464931488, "num_input_tokens_seen": 1545230, "step": 1498, "train_runtime": 4263.2199, "train_tokens_per_second": 362.456 }, { "epoch": 0.6406667378993482, "grad_norm": 1.84076988697052, "learning_rate": 7.211991434689508e-06, "loss": 0.10529544204473495, "num_input_tokens_seen": 1546236, "step": 1499, "train_runtime": 4265.4066, "train_tokens_per_second": 362.506 }, { "epoch": 0.641094133988674, "grad_norm": 2.474524974822998, "learning_rate": 7.203426124197003e-06, "loss": 0.09121278673410416, "num_input_tokens_seen": 1546874, "step": 1500, "train_runtime": 4267.4657, "train_tokens_per_second": 362.481 }, { "epoch": 0.6415215300779998, "grad_norm": 1.5902736186981201, "learning_rate": 7.194860813704497e-06, "loss": 0.09791211783885956, "num_input_tokens_seen": 1547780, "step": 1501, "train_runtime": 4282.8895, "train_tokens_per_second": 361.387 }, { "epoch": 0.6419489261673256, "grad_norm": 1.715878963470459, "learning_rate": 7.186295503211992e-06, "loss": 0.10918458551168442, "num_input_tokens_seen": 1548564, "step": 1502, "train_runtime": 4285.0524, "train_tokens_per_second": 361.387 }, { "epoch": 0.6423763222566513, "grad_norm": 3.815077066421509, "learning_rate": 7.177730192719486e-06, "loss": 0.1852296143770218, "num_input_tokens_seen": 1549224, "step": 1503, "train_runtime": 4287.1013, "train_tokens_per_second": 361.369 }, { "epoch": 0.6428037183459772, "grad_norm": 2.539187431335449, "learning_rate": 7.169164882226981e-06, "loss": 0.14823120832443237, "num_input_tokens_seen": 1550292, "step": 1504, "train_runtime": 4289.263, "train_tokens_per_second": 361.436 }, { "epoch": 0.6432311144353029, "grad_norm": 2.952749013900757, "learning_rate": 7.160599571734476e-06, "loss": 0.09099730849266052, "num_input_tokens_seen": 1551226, "step": 1505, "train_runtime": 4291.3919, "train_tokens_per_second": 361.474 }, { "epoch": 0.6436585105246287, "grad_norm": 2.3050148487091064, "learning_rate": 7.15203426124197e-06, "loss": 0.13551293313503265, "num_input_tokens_seen": 1552042, "step": 1506, "train_runtime": 4293.5184, "train_tokens_per_second": 361.485 }, { "epoch": 0.6440859066139545, "grad_norm": 1.643945574760437, "learning_rate": 7.143468950749465e-06, "loss": 0.08347903937101364, "num_input_tokens_seen": 1553214, "step": 1507, "train_runtime": 4295.695, "train_tokens_per_second": 361.575 }, { "epoch": 0.6445133027032802, "grad_norm": 2.3023900985717773, "learning_rate": 7.134903640256959e-06, "loss": 0.2171354591846466, "num_input_tokens_seen": 1554276, "step": 1508, "train_runtime": 4297.8435, "train_tokens_per_second": 361.641 }, { "epoch": 0.6449406987926061, "grad_norm": 1.9257196187973022, "learning_rate": 7.126338329764455e-06, "loss": 0.08590184897184372, "num_input_tokens_seen": 1554968, "step": 1509, "train_runtime": 4299.8965, "train_tokens_per_second": 361.629 }, { "epoch": 0.6453680948819318, "grad_norm": 2.213167905807495, "learning_rate": 7.11777301927195e-06, "loss": 0.12136133015155792, "num_input_tokens_seen": 1556068, "step": 1510, "train_runtime": 4302.1098, "train_tokens_per_second": 361.699 }, { "epoch": 0.6457954909712577, "grad_norm": 2.678363800048828, "learning_rate": 7.109207708779444e-06, "loss": 0.18482092022895813, "num_input_tokens_seen": 1556930, "step": 1511, "train_runtime": 4304.2231, "train_tokens_per_second": 361.721 }, { "epoch": 0.6462228870605834, "grad_norm": 1.9447524547576904, "learning_rate": 7.1006423982869384e-06, "loss": 0.10032150149345398, "num_input_tokens_seen": 1558272, "step": 1512, "train_runtime": 4306.5143, "train_tokens_per_second": 361.841 }, { "epoch": 0.6466502831499091, "grad_norm": 1.7493921518325806, "learning_rate": 7.092077087794434e-06, "loss": 0.07592130452394485, "num_input_tokens_seen": 1558930, "step": 1513, "train_runtime": 4308.57, "train_tokens_per_second": 361.821 }, { "epoch": 0.647077679239235, "grad_norm": 2.2475225925445557, "learning_rate": 7.083511777301928e-06, "loss": 0.07531867176294327, "num_input_tokens_seen": 1559754, "step": 1514, "train_runtime": 4310.7047, "train_tokens_per_second": 361.833 }, { "epoch": 0.6475050753285607, "grad_norm": 2.898300886154175, "learning_rate": 7.074946466809423e-06, "loss": 0.16273649036884308, "num_input_tokens_seen": 1560548, "step": 1515, "train_runtime": 4312.7861, "train_tokens_per_second": 361.842 }, { "epoch": 0.6479324714178866, "grad_norm": 1.9874814748764038, "learning_rate": 7.066381156316917e-06, "loss": 0.1185591071844101, "num_input_tokens_seen": 1561562, "step": 1516, "train_runtime": 4314.8982, "train_tokens_per_second": 361.9 }, { "epoch": 0.6483598675072123, "grad_norm": 2.628877639770508, "learning_rate": 7.0578158458244114e-06, "loss": 0.14291977882385254, "num_input_tokens_seen": 1562250, "step": 1517, "train_runtime": 4316.9465, "train_tokens_per_second": 361.888 }, { "epoch": 0.648787263596538, "grad_norm": 2.644549608230591, "learning_rate": 7.049250535331906e-06, "loss": 0.1770598441362381, "num_input_tokens_seen": 1563270, "step": 1518, "train_runtime": 4319.0763, "train_tokens_per_second": 361.945 }, { "epoch": 0.6492146596858639, "grad_norm": 2.3253750801086426, "learning_rate": 7.040685224839401e-06, "loss": 0.12818999588489532, "num_input_tokens_seen": 1564114, "step": 1519, "train_runtime": 4321.312, "train_tokens_per_second": 361.953 }, { "epoch": 0.6496420557751896, "grad_norm": 2.7343599796295166, "learning_rate": 7.0321199143468956e-06, "loss": 0.17155951261520386, "num_input_tokens_seen": 1565672, "step": 1520, "train_runtime": 4323.6379, "train_tokens_per_second": 362.119 }, { "epoch": 0.6500694518645155, "grad_norm": 2.1398792266845703, "learning_rate": 7.02355460385439e-06, "loss": 0.11565501242876053, "num_input_tokens_seen": 1566850, "step": 1521, "train_runtime": 4325.7921, "train_tokens_per_second": 362.211 }, { "epoch": 0.6504968479538412, "grad_norm": 3.598750114440918, "learning_rate": 7.0149892933618844e-06, "loss": 0.18757835030555725, "num_input_tokens_seen": 1567950, "step": 1522, "train_runtime": 4327.9375, "train_tokens_per_second": 362.286 }, { "epoch": 0.650924244043167, "grad_norm": 2.7037353515625, "learning_rate": 7.006423982869379e-06, "loss": 0.11965816468000412, "num_input_tokens_seen": 1568690, "step": 1523, "train_runtime": 4330.0573, "train_tokens_per_second": 362.279 }, { "epoch": 0.6513516401324928, "grad_norm": 2.5321145057678223, "learning_rate": 6.997858672376874e-06, "loss": 0.1891138106584549, "num_input_tokens_seen": 1569822, "step": 1524, "train_runtime": 4332.2039, "train_tokens_per_second": 362.361 }, { "epoch": 0.6517790362218185, "grad_norm": 2.8686320781707764, "learning_rate": 6.9892933618843686e-06, "loss": 0.13947579264640808, "num_input_tokens_seen": 1570408, "step": 1525, "train_runtime": 4334.2539, "train_tokens_per_second": 362.325 }, { "epoch": 0.6522064323111444, "grad_norm": 3.0487496852874756, "learning_rate": 6.980728051391864e-06, "loss": 0.16573135554790497, "num_input_tokens_seen": 1571396, "step": 1526, "train_runtime": 4336.3782, "train_tokens_per_second": 362.375 }, { "epoch": 0.6526338284004701, "grad_norm": 2.529710054397583, "learning_rate": 6.972162740899358e-06, "loss": 0.1373073011636734, "num_input_tokens_seen": 1572208, "step": 1527, "train_runtime": 4338.466, "train_tokens_per_second": 362.388 }, { "epoch": 0.6530612244897959, "grad_norm": 1.5418944358825684, "learning_rate": 6.9635974304068535e-06, "loss": 0.09944860637187958, "num_input_tokens_seen": 1573508, "step": 1528, "train_runtime": 4340.6818, "train_tokens_per_second": 362.502 }, { "epoch": 0.6534886205791217, "grad_norm": 1.5925794839859009, "learning_rate": 6.955032119914348e-06, "loss": 0.09501263499259949, "num_input_tokens_seen": 1574602, "step": 1529, "train_runtime": 4342.8784, "train_tokens_per_second": 362.571 }, { "epoch": 0.6539160166684475, "grad_norm": 2.933858633041382, "learning_rate": 6.946466809421842e-06, "loss": 0.1324387788772583, "num_input_tokens_seen": 1575186, "step": 1530, "train_runtime": 4344.9451, "train_tokens_per_second": 362.533 }, { "epoch": 0.6543434127577733, "grad_norm": 1.530726432800293, "learning_rate": 6.937901498929337e-06, "loss": 0.07870647311210632, "num_input_tokens_seen": 1576610, "step": 1531, "train_runtime": 4358.9778, "train_tokens_per_second": 361.693 }, { "epoch": 0.654770808847099, "grad_norm": 2.544651508331299, "learning_rate": 6.929336188436831e-06, "loss": 0.1344785988330841, "num_input_tokens_seen": 1577596, "step": 1532, "train_runtime": 4361.1074, "train_tokens_per_second": 361.742 }, { "epoch": 0.6551982049364248, "grad_norm": 2.3783624172210693, "learning_rate": 6.920770877944326e-06, "loss": 0.15800741314888, "num_input_tokens_seen": 1578504, "step": 1533, "train_runtime": 4363.2551, "train_tokens_per_second": 361.772 }, { "epoch": 0.6556256010257506, "grad_norm": 1.8461830615997314, "learning_rate": 6.912205567451821e-06, "loss": 0.11445880681276321, "num_input_tokens_seen": 1579710, "step": 1534, "train_runtime": 4365.5469, "train_tokens_per_second": 361.858 }, { "epoch": 0.6560529971150764, "grad_norm": 1.6855775117874146, "learning_rate": 6.903640256959315e-06, "loss": 0.08027687668800354, "num_input_tokens_seen": 1580692, "step": 1535, "train_runtime": 4367.6649, "train_tokens_per_second": 361.908 }, { "epoch": 0.6564803932044022, "grad_norm": 2.4377388954162598, "learning_rate": 6.89507494646681e-06, "loss": 0.1333707869052887, "num_input_tokens_seen": 1581530, "step": 1536, "train_runtime": 4369.746, "train_tokens_per_second": 361.927 }, { "epoch": 0.656907789293728, "grad_norm": 1.9163687229156494, "learning_rate": 6.886509635974304e-06, "loss": 0.1066640168428421, "num_input_tokens_seen": 1582596, "step": 1537, "train_runtime": 4371.9268, "train_tokens_per_second": 361.991 }, { "epoch": 0.6573351853830538, "grad_norm": 3.8590710163116455, "learning_rate": 6.877944325481799e-06, "loss": 0.12365378439426422, "num_input_tokens_seen": 1583350, "step": 1538, "train_runtime": 4374.0286, "train_tokens_per_second": 361.989 }, { "epoch": 0.6577625814723795, "grad_norm": 3.143906354904175, "learning_rate": 6.869379014989294e-06, "loss": 0.19161656498908997, "num_input_tokens_seen": 1584178, "step": 1539, "train_runtime": 4376.1242, "train_tokens_per_second": 362.005 }, { "epoch": 0.6581899775617053, "grad_norm": 2.1624810695648193, "learning_rate": 6.860813704496788e-06, "loss": 0.11744837462902069, "num_input_tokens_seen": 1585064, "step": 1540, "train_runtime": 4378.2523, "train_tokens_per_second": 362.031 }, { "epoch": 0.6586173736510311, "grad_norm": 2.6710524559020996, "learning_rate": 6.852248394004283e-06, "loss": 0.1383361518383026, "num_input_tokens_seen": 1585794, "step": 1541, "train_runtime": 4380.5114, "train_tokens_per_second": 362.011 }, { "epoch": 0.6590447697403569, "grad_norm": 4.175921440124512, "learning_rate": 6.843683083511777e-06, "loss": 0.17084673047065735, "num_input_tokens_seen": 1587408, "step": 1542, "train_runtime": 4382.9256, "train_tokens_per_second": 362.18 }, { "epoch": 0.6594721658296827, "grad_norm": 3.461261034011841, "learning_rate": 6.835117773019273e-06, "loss": 0.15707671642303467, "num_input_tokens_seen": 1588142, "step": 1543, "train_runtime": 4385.1189, "train_tokens_per_second": 362.166 }, { "epoch": 0.6598995619190084, "grad_norm": 3.4410555362701416, "learning_rate": 6.826552462526768e-06, "loss": 0.20985399186611176, "num_input_tokens_seen": 1588860, "step": 1544, "train_runtime": 4387.2377, "train_tokens_per_second": 362.155 }, { "epoch": 0.6603269580083342, "grad_norm": 3.796743869781494, "learning_rate": 6.817987152034262e-06, "loss": 0.12922640144824982, "num_input_tokens_seen": 1589590, "step": 1545, "train_runtime": 4389.3475, "train_tokens_per_second": 362.147 }, { "epoch": 0.66075435409766, "grad_norm": 1.6220176219940186, "learning_rate": 6.809421841541757e-06, "loss": 0.06964301317930222, "num_input_tokens_seen": 1590230, "step": 1546, "train_runtime": 4391.4107, "train_tokens_per_second": 362.123 }, { "epoch": 0.6611817501869858, "grad_norm": 2.4121203422546387, "learning_rate": 6.800856531049251e-06, "loss": 0.08981835842132568, "num_input_tokens_seen": 1591156, "step": 1547, "train_runtime": 4393.5067, "train_tokens_per_second": 362.161 }, { "epoch": 0.6616091462763116, "grad_norm": 1.717573881149292, "learning_rate": 6.7922912205567455e-06, "loss": 0.0663209781050682, "num_input_tokens_seen": 1592442, "step": 1548, "train_runtime": 4395.7361, "train_tokens_per_second": 362.27 }, { "epoch": 0.6620365423656374, "grad_norm": 1.7154979705810547, "learning_rate": 6.783725910064241e-06, "loss": 0.07388980686664581, "num_input_tokens_seen": 1593202, "step": 1549, "train_runtime": 4397.7862, "train_tokens_per_second": 362.274 }, { "epoch": 0.6624639384549631, "grad_norm": 1.9425795078277588, "learning_rate": 6.775160599571735e-06, "loss": 0.15316474437713623, "num_input_tokens_seen": 1594400, "step": 1550, "train_runtime": 4399.9993, "train_tokens_per_second": 362.364 }, { "epoch": 0.662891334544289, "grad_norm": 3.2887344360351562, "learning_rate": 6.76659528907923e-06, "loss": 0.07516457885503769, "num_input_tokens_seen": 1595116, "step": 1551, "train_runtime": 4402.066, "train_tokens_per_second": 362.356 }, { "epoch": 0.6633187306336147, "grad_norm": 1.8119767904281616, "learning_rate": 6.758029978586724e-06, "loss": 0.12956857681274414, "num_input_tokens_seen": 1596084, "step": 1552, "train_runtime": 4404.2145, "train_tokens_per_second": 362.399 }, { "epoch": 0.6637461267229405, "grad_norm": 1.6153640747070312, "learning_rate": 6.7494646680942185e-06, "loss": 0.12192563712596893, "num_input_tokens_seen": 1597872, "step": 1553, "train_runtime": 4406.5618, "train_tokens_per_second": 362.612 }, { "epoch": 0.6641735228122663, "grad_norm": 1.9397310018539429, "learning_rate": 6.740899357601714e-06, "loss": 0.0925486832857132, "num_input_tokens_seen": 1598962, "step": 1554, "train_runtime": 4408.7145, "train_tokens_per_second": 362.682 }, { "epoch": 0.664600918901592, "grad_norm": 2.0065720081329346, "learning_rate": 6.732334047109208e-06, "loss": 0.08990250527858734, "num_input_tokens_seen": 1599828, "step": 1555, "train_runtime": 4410.8485, "train_tokens_per_second": 362.703 }, { "epoch": 0.6650283149909179, "grad_norm": 2.2683143615722656, "learning_rate": 6.723768736616703e-06, "loss": 0.16291862726211548, "num_input_tokens_seen": 1600918, "step": 1556, "train_runtime": 4413.0483, "train_tokens_per_second": 362.769 }, { "epoch": 0.6654557110802436, "grad_norm": 2.6723618507385254, "learning_rate": 6.715203426124197e-06, "loss": 0.1854749172925949, "num_input_tokens_seen": 1601938, "step": 1557, "train_runtime": 4415.2345, "train_tokens_per_second": 362.821 }, { "epoch": 0.6658831071695694, "grad_norm": 2.308262348175049, "learning_rate": 6.7066381156316915e-06, "loss": 0.12215416878461838, "num_input_tokens_seen": 1602692, "step": 1558, "train_runtime": 4417.2919, "train_tokens_per_second": 362.822 }, { "epoch": 0.6663105032588952, "grad_norm": 2.0850255489349365, "learning_rate": 6.698072805139186e-06, "loss": 0.0813949704170227, "num_input_tokens_seen": 1603628, "step": 1559, "train_runtime": 4419.4208, "train_tokens_per_second": 362.859 }, { "epoch": 0.6667378993482209, "grad_norm": 1.8532297611236572, "learning_rate": 6.689507494646682e-06, "loss": 0.1323699951171875, "num_input_tokens_seen": 1604734, "step": 1560, "train_runtime": 4421.6115, "train_tokens_per_second": 362.93 }, { "epoch": 0.6671652954375468, "grad_norm": 3.041516065597534, "learning_rate": 6.6809421841541765e-06, "loss": 0.1537182778120041, "num_input_tokens_seen": 1605706, "step": 1561, "train_runtime": 4435.2906, "train_tokens_per_second": 362.029 }, { "epoch": 0.6675926915268725, "grad_norm": 1.949055790901184, "learning_rate": 6.672376873661671e-06, "loss": 0.12910784780979156, "num_input_tokens_seen": 1606732, "step": 1562, "train_runtime": 4437.5511, "train_tokens_per_second": 362.076 }, { "epoch": 0.6680200876161984, "grad_norm": 1.703078031539917, "learning_rate": 6.663811563169165e-06, "loss": 0.09869863092899323, "num_input_tokens_seen": 1607630, "step": 1563, "train_runtime": 4439.6744, "train_tokens_per_second": 362.105 }, { "epoch": 0.6684474837055241, "grad_norm": 1.8958134651184082, "learning_rate": 6.655246252676661e-06, "loss": 0.08466009050607681, "num_input_tokens_seen": 1608904, "step": 1564, "train_runtime": 4441.9032, "train_tokens_per_second": 362.211 }, { "epoch": 0.6688748797948498, "grad_norm": 2.3481266498565674, "learning_rate": 6.646680942184155e-06, "loss": 0.14592456817626953, "num_input_tokens_seen": 1609904, "step": 1565, "train_runtime": 4444.0591, "train_tokens_per_second": 362.26 }, { "epoch": 0.6693022758841757, "grad_norm": 3.0698764324188232, "learning_rate": 6.6381156316916495e-06, "loss": 0.13361139595508575, "num_input_tokens_seen": 1610686, "step": 1566, "train_runtime": 4446.1524, "train_tokens_per_second": 362.265 }, { "epoch": 0.6697296719735014, "grad_norm": 1.7037657499313354, "learning_rate": 6.629550321199144e-06, "loss": 0.07341272383928299, "num_input_tokens_seen": 1611608, "step": 1567, "train_runtime": 4448.2688, "train_tokens_per_second": 362.3 }, { "epoch": 0.6701570680628273, "grad_norm": 1.5428272485733032, "learning_rate": 6.620985010706638e-06, "loss": 0.06614117324352264, "num_input_tokens_seen": 1612824, "step": 1568, "train_runtime": 4450.5452, "train_tokens_per_second": 362.388 }, { "epoch": 0.670584464152153, "grad_norm": 2.226569414138794, "learning_rate": 6.612419700214134e-06, "loss": 0.11472350358963013, "num_input_tokens_seen": 1613618, "step": 1569, "train_runtime": 4452.6874, "train_tokens_per_second": 362.392 }, { "epoch": 0.6710118602414787, "grad_norm": 1.5729639530181885, "learning_rate": 6.603854389721628e-06, "loss": 0.11021829396486282, "num_input_tokens_seen": 1614690, "step": 1570, "train_runtime": 4454.8553, "train_tokens_per_second": 362.456 }, { "epoch": 0.6714392563308046, "grad_norm": 1.9640666246414185, "learning_rate": 6.5952890792291225e-06, "loss": 0.09737622737884521, "num_input_tokens_seen": 1615700, "step": 1571, "train_runtime": 4457.0223, "train_tokens_per_second": 362.507 }, { "epoch": 0.6718666524201303, "grad_norm": 2.142094373703003, "learning_rate": 6.586723768736617e-06, "loss": 0.13516435027122498, "num_input_tokens_seen": 1617158, "step": 1572, "train_runtime": 4459.3121, "train_tokens_per_second": 362.647 }, { "epoch": 0.6722940485094562, "grad_norm": 2.700592279434204, "learning_rate": 6.578158458244111e-06, "loss": 0.11396747827529907, "num_input_tokens_seen": 1617860, "step": 1573, "train_runtime": 4461.408, "train_tokens_per_second": 362.634 }, { "epoch": 0.6727214445987819, "grad_norm": 1.8810936212539673, "learning_rate": 6.569593147751606e-06, "loss": 0.10968844592571259, "num_input_tokens_seen": 1618652, "step": 1574, "train_runtime": 4463.4806, "train_tokens_per_second": 362.643 }, { "epoch": 0.6731488406881077, "grad_norm": 1.9356191158294678, "learning_rate": 6.561027837259101e-06, "loss": 0.13543295860290527, "num_input_tokens_seen": 1619922, "step": 1575, "train_runtime": 4465.6714, "train_tokens_per_second": 362.75 }, { "epoch": 0.6735762367774335, "grad_norm": 2.6811165809631348, "learning_rate": 6.5524625267665955e-06, "loss": 0.1540440022945404, "num_input_tokens_seen": 1620640, "step": 1576, "train_runtime": 4467.7377, "train_tokens_per_second": 362.743 }, { "epoch": 0.6740036328667592, "grad_norm": 2.1355113983154297, "learning_rate": 6.543897216274091e-06, "loss": 0.1317986100912094, "num_input_tokens_seen": 1621670, "step": 1577, "train_runtime": 4469.8659, "train_tokens_per_second": 362.801 }, { "epoch": 0.6744310289560851, "grad_norm": 2.2480995655059814, "learning_rate": 6.535331905781585e-06, "loss": 0.10376676172018051, "num_input_tokens_seen": 1622578, "step": 1578, "train_runtime": 4471.9927, "train_tokens_per_second": 362.831 }, { "epoch": 0.6748584250454108, "grad_norm": 2.7429425716400146, "learning_rate": 6.5267665952890805e-06, "loss": 0.17670083045959473, "num_input_tokens_seen": 1623332, "step": 1579, "train_runtime": 4474.0908, "train_tokens_per_second": 362.829 }, { "epoch": 0.6752858211347366, "grad_norm": 2.2503812313079834, "learning_rate": 6.518201284796575e-06, "loss": 0.16332024335861206, "num_input_tokens_seen": 1624418, "step": 1580, "train_runtime": 4476.2764, "train_tokens_per_second": 362.895 }, { "epoch": 0.6757132172240624, "grad_norm": 2.3562304973602295, "learning_rate": 6.509635974304069e-06, "loss": 0.08853507041931152, "num_input_tokens_seen": 1625200, "step": 1581, "train_runtime": 4478.3727, "train_tokens_per_second": 362.9 }, { "epoch": 0.6761406133133882, "grad_norm": 1.9377342462539673, "learning_rate": 6.501070663811564e-06, "loss": 0.12204766273498535, "num_input_tokens_seen": 1626426, "step": 1582, "train_runtime": 4480.5978, "train_tokens_per_second": 362.993 }, { "epoch": 0.676568009402714, "grad_norm": 2.319868564605713, "learning_rate": 6.492505353319058e-06, "loss": 0.20289123058319092, "num_input_tokens_seen": 1627304, "step": 1583, "train_runtime": 4482.787, "train_tokens_per_second": 363.012 }, { "epoch": 0.6769954054920397, "grad_norm": 2.271876335144043, "learning_rate": 6.4839400428265535e-06, "loss": 0.12651079893112183, "num_input_tokens_seen": 1628384, "step": 1584, "train_runtime": 4484.9213, "train_tokens_per_second": 363.08 }, { "epoch": 0.6774228015813656, "grad_norm": 2.054103374481201, "learning_rate": 6.475374732334048e-06, "loss": 0.13746072351932526, "num_input_tokens_seen": 1629448, "step": 1585, "train_runtime": 4487.0902, "train_tokens_per_second": 363.141 }, { "epoch": 0.6778501976706913, "grad_norm": 2.3925156593322754, "learning_rate": 6.466809421841542e-06, "loss": 0.1481277346611023, "num_input_tokens_seen": 1630412, "step": 1586, "train_runtime": 4489.1792, "train_tokens_per_second": 363.187 }, { "epoch": 0.6782775937600171, "grad_norm": 1.5451360940933228, "learning_rate": 6.458244111349037e-06, "loss": 0.1025330051779747, "num_input_tokens_seen": 1631754, "step": 1587, "train_runtime": 4491.448, "train_tokens_per_second": 363.302 }, { "epoch": 0.6787049898493429, "grad_norm": 1.8741570711135864, "learning_rate": 6.449678800856531e-06, "loss": 0.07674557715654373, "num_input_tokens_seen": 1633172, "step": 1588, "train_runtime": 4493.7015, "train_tokens_per_second": 363.436 }, { "epoch": 0.6791323859386686, "grad_norm": 2.0336880683898926, "learning_rate": 6.441113490364026e-06, "loss": 0.10372666269540787, "num_input_tokens_seen": 1634354, "step": 1589, "train_runtime": 4495.8855, "train_tokens_per_second": 363.522 }, { "epoch": 0.6795597820279945, "grad_norm": 2.966878890991211, "learning_rate": 6.432548179871521e-06, "loss": 0.14841686189174652, "num_input_tokens_seen": 1635210, "step": 1590, "train_runtime": 4498.0139, "train_tokens_per_second": 363.54 }, { "epoch": 0.6799871781173202, "grad_norm": 2.0769901275634766, "learning_rate": 6.423982869379015e-06, "loss": 0.1410973072052002, "num_input_tokens_seen": 1636860, "step": 1591, "train_runtime": 4512.2062, "train_tokens_per_second": 362.763 }, { "epoch": 0.680414574206646, "grad_norm": 2.3814852237701416, "learning_rate": 6.41541755888651e-06, "loss": 0.13119149208068848, "num_input_tokens_seen": 1637730, "step": 1592, "train_runtime": 4514.325, "train_tokens_per_second": 362.785 }, { "epoch": 0.6808419702959718, "grad_norm": 1.9937283992767334, "learning_rate": 6.406852248394004e-06, "loss": 0.1572273075580597, "num_input_tokens_seen": 1639292, "step": 1593, "train_runtime": 4516.5663, "train_tokens_per_second": 362.951 }, { "epoch": 0.6812693663852976, "grad_norm": 1.8679708242416382, "learning_rate": 6.398286937901499e-06, "loss": 0.09107799828052521, "num_input_tokens_seen": 1640188, "step": 1594, "train_runtime": 4518.6806, "train_tokens_per_second": 362.979 }, { "epoch": 0.6816967624746234, "grad_norm": 3.4475085735321045, "learning_rate": 6.389721627408995e-06, "loss": 0.18616309762001038, "num_input_tokens_seen": 1640806, "step": 1595, "train_runtime": 4520.7349, "train_tokens_per_second": 362.951 }, { "epoch": 0.6821241585639491, "grad_norm": 2.3456876277923584, "learning_rate": 6.381156316916489e-06, "loss": 0.10660184174776077, "num_input_tokens_seen": 1642176, "step": 1596, "train_runtime": 4522.9768, "train_tokens_per_second": 363.074 }, { "epoch": 0.6825515546532749, "grad_norm": 2.482680320739746, "learning_rate": 6.372591006423984e-06, "loss": 0.1661359667778015, "num_input_tokens_seen": 1643650, "step": 1597, "train_runtime": 4525.2515, "train_tokens_per_second": 363.217 }, { "epoch": 0.6829789507426007, "grad_norm": 2.421750783920288, "learning_rate": 6.364025695931478e-06, "loss": 0.10083428025245667, "num_input_tokens_seen": 1644390, "step": 1598, "train_runtime": 4527.3498, "train_tokens_per_second": 363.212 }, { "epoch": 0.6834063468319265, "grad_norm": 2.4274449348449707, "learning_rate": 6.355460385438973e-06, "loss": 0.166713148355484, "num_input_tokens_seen": 1645308, "step": 1599, "train_runtime": 4529.4753, "train_tokens_per_second": 363.245 }, { "epoch": 0.6838337429212523, "grad_norm": 2.417405366897583, "learning_rate": 6.346895074946468e-06, "loss": 0.15359529852867126, "num_input_tokens_seen": 1646310, "step": 1600, "train_runtime": 4531.6045, "train_tokens_per_second": 363.295 }, { "epoch": 0.6842611390105781, "grad_norm": 1.6212536096572876, "learning_rate": 6.338329764453962e-06, "loss": 0.07829247415065765, "num_input_tokens_seen": 1647374, "step": 1601, "train_runtime": 4533.7284, "train_tokens_per_second": 363.36 }, { "epoch": 0.6846885350999038, "grad_norm": 2.5603814125061035, "learning_rate": 6.3297644539614566e-06, "loss": 0.16584928333759308, "num_input_tokens_seen": 1648536, "step": 1602, "train_runtime": 4536.0802, "train_tokens_per_second": 363.427 }, { "epoch": 0.6851159311892296, "grad_norm": 2.598259925842285, "learning_rate": 6.321199143468951e-06, "loss": 0.1613016426563263, "num_input_tokens_seen": 1649318, "step": 1603, "train_runtime": 4538.2047, "train_tokens_per_second": 363.43 }, { "epoch": 0.6855433272785554, "grad_norm": 2.0908098220825195, "learning_rate": 6.3126338329764454e-06, "loss": 0.10887156426906586, "num_input_tokens_seen": 1650252, "step": 1604, "train_runtime": 4540.3561, "train_tokens_per_second": 363.463 }, { "epoch": 0.6859707233678812, "grad_norm": 1.267457365989685, "learning_rate": 6.304068522483941e-06, "loss": 0.06617289036512375, "num_input_tokens_seen": 1652300, "step": 1605, "train_runtime": 4542.7745, "train_tokens_per_second": 363.72 }, { "epoch": 0.686398119457207, "grad_norm": 2.587787628173828, "learning_rate": 6.295503211991435e-06, "loss": 0.14453619718551636, "num_input_tokens_seen": 1653100, "step": 1606, "train_runtime": 4544.8678, "train_tokens_per_second": 363.729 }, { "epoch": 0.6868255155465327, "grad_norm": 1.836341381072998, "learning_rate": 6.2869379014989296e-06, "loss": 0.10662239789962769, "num_input_tokens_seen": 1654178, "step": 1607, "train_runtime": 4547.0188, "train_tokens_per_second": 363.794 }, { "epoch": 0.6872529116358586, "grad_norm": 2.1913387775421143, "learning_rate": 6.278372591006424e-06, "loss": 0.11226958781480789, "num_input_tokens_seen": 1655230, "step": 1608, "train_runtime": 4549.1614, "train_tokens_per_second": 363.854 }, { "epoch": 0.6876803077251843, "grad_norm": 3.4004528522491455, "learning_rate": 6.2698072805139184e-06, "loss": 0.17808711528778076, "num_input_tokens_seen": 1657018, "step": 1609, "train_runtime": 4551.5275, "train_tokens_per_second": 364.058 }, { "epoch": 0.6881077038145101, "grad_norm": 2.7976081371307373, "learning_rate": 6.261241970021414e-06, "loss": 0.2421571910381317, "num_input_tokens_seen": 1657826, "step": 1610, "train_runtime": 4553.5832, "train_tokens_per_second": 364.071 }, { "epoch": 0.6885350999038359, "grad_norm": 1.2608722448349, "learning_rate": 6.252676659528908e-06, "loss": 0.07399376481771469, "num_input_tokens_seen": 1659216, "step": 1611, "train_runtime": 4555.8255, "train_tokens_per_second": 364.197 }, { "epoch": 0.6889624959931616, "grad_norm": 2.002980947494507, "learning_rate": 6.244111349036403e-06, "loss": 0.09594839066267014, "num_input_tokens_seen": 1660136, "step": 1612, "train_runtime": 4557.9616, "train_tokens_per_second": 364.228 }, { "epoch": 0.6893898920824875, "grad_norm": 1.9873377084732056, "learning_rate": 6.235546038543898e-06, "loss": 0.15380653738975525, "num_input_tokens_seen": 1661920, "step": 1613, "train_runtime": 4560.282, "train_tokens_per_second": 364.434 }, { "epoch": 0.6898172881718132, "grad_norm": 2.601666212081909, "learning_rate": 6.226980728051393e-06, "loss": 0.12249216437339783, "num_input_tokens_seen": 1662820, "step": 1614, "train_runtime": 4562.3998, "train_tokens_per_second": 364.462 }, { "epoch": 0.690244684261139, "grad_norm": 1.7057254314422607, "learning_rate": 6.2184154175588875e-06, "loss": 0.1005893349647522, "num_input_tokens_seen": 1664108, "step": 1615, "train_runtime": 4564.6054, "train_tokens_per_second": 364.568 }, { "epoch": 0.6906720803504648, "grad_norm": 2.296954393386841, "learning_rate": 6.209850107066382e-06, "loss": 0.1730366051197052, "num_input_tokens_seen": 1665014, "step": 1616, "train_runtime": 4566.7564, "train_tokens_per_second": 364.594 }, { "epoch": 0.6910994764397905, "grad_norm": 1.402052879333496, "learning_rate": 6.201284796573876e-06, "loss": 0.048176512122154236, "num_input_tokens_seen": 1666400, "step": 1617, "train_runtime": 4569.0038, "train_tokens_per_second": 364.718 }, { "epoch": 0.6915268725291164, "grad_norm": 1.855002760887146, "learning_rate": 6.192719486081371e-06, "loss": 0.1155838593840599, "num_input_tokens_seen": 1667142, "step": 1618, "train_runtime": 4571.0907, "train_tokens_per_second": 364.714 }, { "epoch": 0.6919542686184421, "grad_norm": 1.4894779920578003, "learning_rate": 6.184154175588865e-06, "loss": 0.07965515553951263, "num_input_tokens_seen": 1668150, "step": 1619, "train_runtime": 4573.2329, "train_tokens_per_second": 364.764 }, { "epoch": 0.692381664707768, "grad_norm": 2.2731051445007324, "learning_rate": 6.1755888650963605e-06, "loss": 0.12008822709321976, "num_input_tokens_seen": 1669652, "step": 1620, "train_runtime": 4575.5378, "train_tokens_per_second": 364.908 }, { "epoch": 0.6928090607970937, "grad_norm": 2.585569381713867, "learning_rate": 6.167023554603855e-06, "loss": 0.09032248705625534, "num_input_tokens_seen": 1670674, "step": 1621, "train_runtime": 4590.5761, "train_tokens_per_second": 363.936 }, { "epoch": 0.6932364568864194, "grad_norm": 2.401552200317383, "learning_rate": 6.158458244111349e-06, "loss": 0.12617796659469604, "num_input_tokens_seen": 1671534, "step": 1622, "train_runtime": 4592.6564, "train_tokens_per_second": 363.958 }, { "epoch": 0.6936638529757453, "grad_norm": 3.219254493713379, "learning_rate": 6.149892933618844e-06, "loss": 0.23800092935562134, "num_input_tokens_seen": 1672412, "step": 1623, "train_runtime": 4594.8153, "train_tokens_per_second": 363.978 }, { "epoch": 0.694091249065071, "grad_norm": 2.239248037338257, "learning_rate": 6.141327623126338e-06, "loss": 0.4660128057003021, "num_input_tokens_seen": 1673666, "step": 1624, "train_runtime": 4597.0203, "train_tokens_per_second": 364.076 }, { "epoch": 0.6945186451543969, "grad_norm": 2.1631221771240234, "learning_rate": 6.1327623126338335e-06, "loss": 0.10860832780599594, "num_input_tokens_seen": 1674652, "step": 1625, "train_runtime": 4599.2076, "train_tokens_per_second": 364.118 }, { "epoch": 0.6949460412437226, "grad_norm": 1.7249270677566528, "learning_rate": 6.124197002141328e-06, "loss": 0.09011699259281158, "num_input_tokens_seen": 1675698, "step": 1626, "train_runtime": 4601.4433, "train_tokens_per_second": 364.168 }, { "epoch": 0.6953734373330483, "grad_norm": 2.450115203857422, "learning_rate": 6.115631691648822e-06, "loss": 0.09784139692783356, "num_input_tokens_seen": 1676306, "step": 1627, "train_runtime": 4603.5993, "train_tokens_per_second": 364.129 }, { "epoch": 0.6958008334223742, "grad_norm": 1.5554367303848267, "learning_rate": 6.107066381156317e-06, "loss": 0.10767507553100586, "num_input_tokens_seen": 1677460, "step": 1628, "train_runtime": 4605.8078, "train_tokens_per_second": 364.205 }, { "epoch": 0.6962282295116999, "grad_norm": 2.50962495803833, "learning_rate": 6.098501070663813e-06, "loss": 0.08403193950653076, "num_input_tokens_seen": 1678144, "step": 1629, "train_runtime": 4607.9012, "train_tokens_per_second": 364.188 }, { "epoch": 0.6966556256010258, "grad_norm": 1.8076614141464233, "learning_rate": 6.089935760171307e-06, "loss": 0.11268124729394913, "num_input_tokens_seen": 1679080, "step": 1630, "train_runtime": 4610.061, "train_tokens_per_second": 364.221 }, { "epoch": 0.6970830216903515, "grad_norm": 1.6254327297210693, "learning_rate": 6.081370449678802e-06, "loss": 0.06718803942203522, "num_input_tokens_seen": 1680132, "step": 1631, "train_runtime": 4612.2188, "train_tokens_per_second": 364.278 }, { "epoch": 0.6975104177796773, "grad_norm": 2.299278497695923, "learning_rate": 6.072805139186296e-06, "loss": 0.08127452433109283, "num_input_tokens_seen": 1680726, "step": 1632, "train_runtime": 4614.3178, "train_tokens_per_second": 364.241 }, { "epoch": 0.6979378138690031, "grad_norm": 3.201241970062256, "learning_rate": 6.064239828693791e-06, "loss": 0.20240415632724762, "num_input_tokens_seen": 1681756, "step": 1633, "train_runtime": 4616.4696, "train_tokens_per_second": 364.295 }, { "epoch": 0.6983652099583288, "grad_norm": 2.2114617824554443, "learning_rate": 6.055674518201285e-06, "loss": 0.09983129799365997, "num_input_tokens_seen": 1682650, "step": 1634, "train_runtime": 4618.5649, "train_tokens_per_second": 364.323 }, { "epoch": 0.6987926060476547, "grad_norm": 2.3187384605407715, "learning_rate": 6.04710920770878e-06, "loss": 0.1907171756029129, "num_input_tokens_seen": 1684078, "step": 1635, "train_runtime": 4620.8028, "train_tokens_per_second": 364.456 }, { "epoch": 0.6992200021369804, "grad_norm": 2.008796453475952, "learning_rate": 6.038543897216275e-06, "loss": 0.13186600804328918, "num_input_tokens_seen": 1685224, "step": 1636, "train_runtime": 4623.0173, "train_tokens_per_second": 364.529 }, { "epoch": 0.6996473982263063, "grad_norm": 2.5543391704559326, "learning_rate": 6.029978586723769e-06, "loss": 0.15313224494457245, "num_input_tokens_seen": 1686050, "step": 1637, "train_runtime": 4625.1428, "train_tokens_per_second": 364.54 }, { "epoch": 0.700074794315632, "grad_norm": 2.069614887237549, "learning_rate": 6.021413276231264e-06, "loss": 0.07094985246658325, "num_input_tokens_seen": 1686956, "step": 1638, "train_runtime": 4627.2904, "train_tokens_per_second": 364.567 }, { "epoch": 0.700074794315632, "eval_loss": 0.4644208252429962, "eval_runtime": 57.7308, "eval_samples_per_second": 17.287, "eval_steps_per_second": 8.644, "num_input_tokens_seen": 1686956, "step": 1638 }, { "epoch": 0.7005021904049578, "grad_norm": 3.219636917114258, "learning_rate": 6.012847965738758e-06, "loss": 0.13574418425559998, "num_input_tokens_seen": 1687798, "step": 1639, "train_runtime": 4687.1407, "train_tokens_per_second": 360.091 }, { "epoch": 0.7009295864942836, "grad_norm": 1.5980966091156006, "learning_rate": 6.004282655246253e-06, "loss": 0.08837272226810455, "num_input_tokens_seen": 1689004, "step": 1640, "train_runtime": 4689.3809, "train_tokens_per_second": 360.176 }, { "epoch": 0.7013569825836093, "grad_norm": 2.2951228618621826, "learning_rate": 5.995717344753748e-06, "loss": 0.0942828357219696, "num_input_tokens_seen": 1689856, "step": 1641, "train_runtime": 4691.5124, "train_tokens_per_second": 360.194 }, { "epoch": 0.7017843786729352, "grad_norm": 1.5538647174835205, "learning_rate": 5.987152034261242e-06, "loss": 0.05763139948248863, "num_input_tokens_seen": 1690670, "step": 1642, "train_runtime": 4693.5971, "train_tokens_per_second": 360.208 }, { "epoch": 0.7022117747622609, "grad_norm": 2.632305860519409, "learning_rate": 5.978586723768737e-06, "loss": 0.12397623062133789, "num_input_tokens_seen": 1691480, "step": 1643, "train_runtime": 4695.6853, "train_tokens_per_second": 360.22 }, { "epoch": 0.7026391708515867, "grad_norm": 2.3829047679901123, "learning_rate": 5.970021413276231e-06, "loss": 0.08417462557554245, "num_input_tokens_seen": 1692250, "step": 1644, "train_runtime": 4697.7737, "train_tokens_per_second": 360.224 }, { "epoch": 0.7030665669409125, "grad_norm": 2.198765516281128, "learning_rate": 5.9614561027837255e-06, "loss": 0.168161541223526, "num_input_tokens_seen": 1693420, "step": 1645, "train_runtime": 4699.9956, "train_tokens_per_second": 360.302 }, { "epoch": 0.7034939630302383, "grad_norm": 3.7647759914398193, "learning_rate": 5.952890792291222e-06, "loss": 0.18240110576152802, "num_input_tokens_seen": 1694210, "step": 1646, "train_runtime": 4702.0905, "train_tokens_per_second": 360.31 }, { "epoch": 0.7039213591195641, "grad_norm": 2.1652207374572754, "learning_rate": 5.944325481798716e-06, "loss": 0.10134699195623398, "num_input_tokens_seen": 1695012, "step": 1647, "train_runtime": 4704.2134, "train_tokens_per_second": 360.318 }, { "epoch": 0.7043487552088898, "grad_norm": 2.243745803833008, "learning_rate": 5.9357601713062105e-06, "loss": 0.1376046985387802, "num_input_tokens_seen": 1696218, "step": 1648, "train_runtime": 4706.4299, "train_tokens_per_second": 360.404 }, { "epoch": 0.7047761512982156, "grad_norm": 1.9967803955078125, "learning_rate": 5.927194860813705e-06, "loss": 0.10707314312458038, "num_input_tokens_seen": 1697258, "step": 1649, "train_runtime": 4708.6117, "train_tokens_per_second": 360.458 }, { "epoch": 0.7052035473875414, "grad_norm": 2.091332197189331, "learning_rate": 5.9186295503212e-06, "loss": 0.08665335923433304, "num_input_tokens_seen": 1698094, "step": 1650, "train_runtime": 4710.7272, "train_tokens_per_second": 360.474 }, { "epoch": 0.7056309434768672, "grad_norm": 2.8967652320861816, "learning_rate": 5.910064239828695e-06, "loss": 0.10194618254899979, "num_input_tokens_seen": 1698594, "step": 1651, "train_runtime": 4728.1737, "train_tokens_per_second": 359.249 }, { "epoch": 0.706058339566193, "grad_norm": 2.6683316230773926, "learning_rate": 5.901498929336189e-06, "loss": 0.16606134176254272, "num_input_tokens_seen": 1699658, "step": 1652, "train_runtime": 4730.3307, "train_tokens_per_second": 359.311 }, { "epoch": 0.7064857356555188, "grad_norm": 1.8908686637878418, "learning_rate": 5.8929336188436835e-06, "loss": 0.11453081667423248, "num_input_tokens_seen": 1700770, "step": 1653, "train_runtime": 4732.5202, "train_tokens_per_second": 359.379 }, { "epoch": 0.7069131317448445, "grad_norm": 2.30198335647583, "learning_rate": 5.884368308351178e-06, "loss": 0.14984571933746338, "num_input_tokens_seen": 1701816, "step": 1654, "train_runtime": 4734.7224, "train_tokens_per_second": 359.433 }, { "epoch": 0.7073405278341703, "grad_norm": 2.539581060409546, "learning_rate": 5.875802997858673e-06, "loss": 0.17967048287391663, "num_input_tokens_seen": 1703090, "step": 1655, "train_runtime": 4736.9741, "train_tokens_per_second": 359.531 }, { "epoch": 0.7077679239234961, "grad_norm": 1.6067545413970947, "learning_rate": 5.867237687366168e-06, "loss": 0.0922904685139656, "num_input_tokens_seen": 1704284, "step": 1656, "train_runtime": 4739.1765, "train_tokens_per_second": 359.616 }, { "epoch": 0.7081953200128219, "grad_norm": 2.4805846214294434, "learning_rate": 5.858672376873662e-06, "loss": 0.15101802349090576, "num_input_tokens_seen": 1705218, "step": 1657, "train_runtime": 4741.2998, "train_tokens_per_second": 359.652 }, { "epoch": 0.7086227161021477, "grad_norm": 2.954930305480957, "learning_rate": 5.8501070663811565e-06, "loss": 0.14685797691345215, "num_input_tokens_seen": 1706048, "step": 1658, "train_runtime": 4743.4298, "train_tokens_per_second": 359.665 }, { "epoch": 0.7090501121914734, "grad_norm": 1.272079586982727, "learning_rate": 5.841541755888651e-06, "loss": 0.06490632891654968, "num_input_tokens_seen": 1707348, "step": 1659, "train_runtime": 4745.6461, "train_tokens_per_second": 359.771 }, { "epoch": 0.7094775082807993, "grad_norm": 2.1344242095947266, "learning_rate": 5.832976445396145e-06, "loss": 0.11305753886699677, "num_input_tokens_seen": 1708384, "step": 1660, "train_runtime": 4747.7648, "train_tokens_per_second": 359.829 }, { "epoch": 0.709904904370125, "grad_norm": 1.6343703269958496, "learning_rate": 5.824411134903641e-06, "loss": 0.0764722228050232, "num_input_tokens_seen": 1709360, "step": 1661, "train_runtime": 4749.8893, "train_tokens_per_second": 359.874 }, { "epoch": 0.7103323004594508, "grad_norm": 2.52177357673645, "learning_rate": 5.815845824411135e-06, "loss": 0.12074946612119675, "num_input_tokens_seen": 1710508, "step": 1662, "train_runtime": 4752.0773, "train_tokens_per_second": 359.95 }, { "epoch": 0.7107596965487766, "grad_norm": 2.8598716259002686, "learning_rate": 5.80728051391863e-06, "loss": 0.19634686410427094, "num_input_tokens_seen": 1712138, "step": 1663, "train_runtime": 4754.3561, "train_tokens_per_second": 360.12 }, { "epoch": 0.7111870926381023, "grad_norm": 2.793030023574829, "learning_rate": 5.798715203426125e-06, "loss": 0.18983489274978638, "num_input_tokens_seen": 1712860, "step": 1664, "train_runtime": 4756.4394, "train_tokens_per_second": 360.114 }, { "epoch": 0.7116144887274282, "grad_norm": 2.6077451705932617, "learning_rate": 5.79014989293362e-06, "loss": 0.10160862654447556, "num_input_tokens_seen": 1713704, "step": 1665, "train_runtime": 4758.5798, "train_tokens_per_second": 360.129 }, { "epoch": 0.7120418848167539, "grad_norm": 2.501498222351074, "learning_rate": 5.7815845824411145e-06, "loss": 0.15047523379325867, "num_input_tokens_seen": 1714516, "step": 1666, "train_runtime": 4760.7095, "train_tokens_per_second": 360.139 }, { "epoch": 0.7124692809060797, "grad_norm": 1.5240485668182373, "learning_rate": 5.773019271948609e-06, "loss": 0.1040622889995575, "num_input_tokens_seen": 1715660, "step": 1667, "train_runtime": 4762.8688, "train_tokens_per_second": 360.216 }, { "epoch": 0.7128966769954055, "grad_norm": 2.8323254585266113, "learning_rate": 5.764453961456103e-06, "loss": 0.1454036682844162, "num_input_tokens_seen": 1716730, "step": 1668, "train_runtime": 4765.0685, "train_tokens_per_second": 360.274 }, { "epoch": 0.7133240730847312, "grad_norm": 2.108504056930542, "learning_rate": 5.755888650963598e-06, "loss": 0.10528227686882019, "num_input_tokens_seen": 1717640, "step": 1669, "train_runtime": 4767.1967, "train_tokens_per_second": 360.304 }, { "epoch": 0.7137514691740571, "grad_norm": 3.772016763687134, "learning_rate": 5.747323340471093e-06, "loss": 0.17205625772476196, "num_input_tokens_seen": 1718460, "step": 1670, "train_runtime": 4769.3385, "train_tokens_per_second": 360.314 }, { "epoch": 0.7141788652633828, "grad_norm": 2.824571132659912, "learning_rate": 5.7387580299785874e-06, "loss": 0.12216833233833313, "num_input_tokens_seen": 1719306, "step": 1671, "train_runtime": 4771.4593, "train_tokens_per_second": 360.331 }, { "epoch": 0.7146062613527087, "grad_norm": 1.7227834463119507, "learning_rate": 5.730192719486082e-06, "loss": 0.11943650245666504, "num_input_tokens_seen": 1720296, "step": 1672, "train_runtime": 4773.616, "train_tokens_per_second": 360.376 }, { "epoch": 0.7150336574420344, "grad_norm": 3.471247673034668, "learning_rate": 5.721627408993576e-06, "loss": 0.14931151270866394, "num_input_tokens_seen": 1720946, "step": 1673, "train_runtime": 4775.6786, "train_tokens_per_second": 360.356 }, { "epoch": 0.7154610535313601, "grad_norm": 2.918505907058716, "learning_rate": 5.713062098501071e-06, "loss": 0.14648237824440002, "num_input_tokens_seen": 1722042, "step": 1674, "train_runtime": 4777.8223, "train_tokens_per_second": 360.424 }, { "epoch": 0.715888449620686, "grad_norm": 2.1645331382751465, "learning_rate": 5.704496788008565e-06, "loss": 0.12691345810890198, "num_input_tokens_seen": 1723140, "step": 1675, "train_runtime": 4780.0169, "train_tokens_per_second": 360.488 }, { "epoch": 0.7163158457100117, "grad_norm": 1.897057056427002, "learning_rate": 5.6959314775160604e-06, "loss": 0.07775653898715973, "num_input_tokens_seen": 1724224, "step": 1676, "train_runtime": 4782.2157, "train_tokens_per_second": 360.549 }, { "epoch": 0.7167432417993376, "grad_norm": 1.6002415418624878, "learning_rate": 5.687366167023555e-06, "loss": 0.07413661479949951, "num_input_tokens_seen": 1725548, "step": 1677, "train_runtime": 4784.4363, "train_tokens_per_second": 360.659 }, { "epoch": 0.7171706378886633, "grad_norm": 3.134046792984009, "learning_rate": 5.678800856531049e-06, "loss": 0.12984393537044525, "num_input_tokens_seen": 1726676, "step": 1678, "train_runtime": 4786.5931, "train_tokens_per_second": 360.732 }, { "epoch": 0.717598033977989, "grad_norm": 3.21637225151062, "learning_rate": 5.670235546038544e-06, "loss": 0.14277908205986023, "num_input_tokens_seen": 1727428, "step": 1679, "train_runtime": 4788.6672, "train_tokens_per_second": 360.733 }, { "epoch": 0.7180254300673149, "grad_norm": 2.0747151374816895, "learning_rate": 5.66167023554604e-06, "loss": 0.14743301272392273, "num_input_tokens_seen": 1728446, "step": 1680, "train_runtime": 4790.8343, "train_tokens_per_second": 360.782 }, { "epoch": 0.7184528261566406, "grad_norm": 2.426614284515381, "learning_rate": 5.653104925053534e-06, "loss": 0.08483467996120453, "num_input_tokens_seen": 1729056, "step": 1681, "train_runtime": 4806.4139, "train_tokens_per_second": 359.739 }, { "epoch": 0.7188802222459665, "grad_norm": 2.793328046798706, "learning_rate": 5.644539614561029e-06, "loss": 0.15332990884780884, "num_input_tokens_seen": 1730126, "step": 1682, "train_runtime": 4808.586, "train_tokens_per_second": 359.799 }, { "epoch": 0.7193076183352922, "grad_norm": 1.9192081689834595, "learning_rate": 5.635974304068523e-06, "loss": 0.09715915471315384, "num_input_tokens_seen": 1730996, "step": 1683, "train_runtime": 4810.792, "train_tokens_per_second": 359.815 }, { "epoch": 0.7197350144246181, "grad_norm": 2.6356565952301025, "learning_rate": 5.6274089935760176e-06, "loss": 0.13068704307079315, "num_input_tokens_seen": 1732152, "step": 1684, "train_runtime": 4813.0216, "train_tokens_per_second": 359.889 }, { "epoch": 0.7201624105139438, "grad_norm": 2.196972608566284, "learning_rate": 5.618843683083513e-06, "loss": 0.11215974390506744, "num_input_tokens_seen": 1733204, "step": 1685, "train_runtime": 4815.1812, "train_tokens_per_second": 359.946 }, { "epoch": 0.7205898066032695, "grad_norm": 1.7246198654174805, "learning_rate": 5.610278372591007e-06, "loss": 0.06989086419343948, "num_input_tokens_seen": 1734046, "step": 1686, "train_runtime": 4817.3118, "train_tokens_per_second": 359.961 }, { "epoch": 0.7210172026925954, "grad_norm": 2.7068393230438232, "learning_rate": 5.601713062098502e-06, "loss": 0.12449479103088379, "num_input_tokens_seen": 1735042, "step": 1687, "train_runtime": 4819.4961, "train_tokens_per_second": 360.005 }, { "epoch": 0.7214445987819211, "grad_norm": 2.3992509841918945, "learning_rate": 5.593147751605996e-06, "loss": 0.15011781454086304, "num_input_tokens_seen": 1736068, "step": 1688, "train_runtime": 4821.655, "train_tokens_per_second": 360.056 }, { "epoch": 0.721871994871247, "grad_norm": 2.043673038482666, "learning_rate": 5.5845824411134906e-06, "loss": 0.11534906923770905, "num_input_tokens_seen": 1737184, "step": 1689, "train_runtime": 4823.8549, "train_tokens_per_second": 360.124 }, { "epoch": 0.7222993909605727, "grad_norm": 2.742030382156372, "learning_rate": 5.576017130620985e-06, "loss": 0.18591052293777466, "num_input_tokens_seen": 1738208, "step": 1690, "train_runtime": 4825.9867, "train_tokens_per_second": 360.177 }, { "epoch": 0.7227267870498985, "grad_norm": 1.76872980594635, "learning_rate": 5.56745182012848e-06, "loss": 0.10890193283557892, "num_input_tokens_seen": 1739152, "step": 1691, "train_runtime": 4828.0859, "train_tokens_per_second": 360.216 }, { "epoch": 0.7231541831392243, "grad_norm": 2.0823118686676025, "learning_rate": 5.558886509635975e-06, "loss": 0.11015980690717697, "num_input_tokens_seen": 1740346, "step": 1692, "train_runtime": 4830.2839, "train_tokens_per_second": 360.299 }, { "epoch": 0.72358157922855, "grad_norm": 2.5794262886047363, "learning_rate": 5.550321199143469e-06, "loss": 0.20696821808815002, "num_input_tokens_seen": 1741248, "step": 1693, "train_runtime": 4832.4269, "train_tokens_per_second": 360.326 }, { "epoch": 0.7240089753178759, "grad_norm": 2.58174204826355, "learning_rate": 5.5417558886509636e-06, "loss": 0.12523779273033142, "num_input_tokens_seen": 1742122, "step": 1694, "train_runtime": 4834.5694, "train_tokens_per_second": 360.347 }, { "epoch": 0.7244363714072016, "grad_norm": 1.6804932355880737, "learning_rate": 5.533190578158458e-06, "loss": 0.10602365434169769, "num_input_tokens_seen": 1743328, "step": 1695, "train_runtime": 4836.8368, "train_tokens_per_second": 360.427 }, { "epoch": 0.7248637674965274, "grad_norm": 2.3279054164886475, "learning_rate": 5.524625267665953e-06, "loss": 0.14723874628543854, "num_input_tokens_seen": 1744486, "step": 1696, "train_runtime": 4839.0978, "train_tokens_per_second": 360.498 }, { "epoch": 0.7252911635858532, "grad_norm": 2.3080601692199707, "learning_rate": 5.516059957173448e-06, "loss": 0.1581530123949051, "num_input_tokens_seen": 1745474, "step": 1697, "train_runtime": 4841.2732, "train_tokens_per_second": 360.54 }, { "epoch": 0.725718559675179, "grad_norm": 2.790524959564209, "learning_rate": 5.507494646680943e-06, "loss": 0.162436842918396, "num_input_tokens_seen": 1746166, "step": 1698, "train_runtime": 4843.3015, "train_tokens_per_second": 360.532 }, { "epoch": 0.7261459557645048, "grad_norm": 2.400913953781128, "learning_rate": 5.498929336188437e-06, "loss": 0.18709856271743774, "num_input_tokens_seen": 1747250, "step": 1699, "train_runtime": 4845.4682, "train_tokens_per_second": 360.595 }, { "epoch": 0.7265733518538305, "grad_norm": 2.3663182258605957, "learning_rate": 5.490364025695933e-06, "loss": 0.09549424052238464, "num_input_tokens_seen": 1748350, "step": 1700, "train_runtime": 4847.627, "train_tokens_per_second": 360.661 }, { "epoch": 0.7270007479431563, "grad_norm": 2.2285592555999756, "learning_rate": 5.481798715203427e-06, "loss": 0.09639982134103775, "num_input_tokens_seen": 1749094, "step": 1701, "train_runtime": 4849.7368, "train_tokens_per_second": 360.658 }, { "epoch": 0.7274281440324821, "grad_norm": 2.3181865215301514, "learning_rate": 5.4732334047109215e-06, "loss": 0.11261068284511566, "num_input_tokens_seen": 1749952, "step": 1702, "train_runtime": 4851.9496, "train_tokens_per_second": 360.67 }, { "epoch": 0.7278555401218079, "grad_norm": 2.177008867263794, "learning_rate": 5.464668094218416e-06, "loss": 0.0887385755777359, "num_input_tokens_seen": 1750582, "step": 1703, "train_runtime": 4854.0042, "train_tokens_per_second": 360.647 }, { "epoch": 0.7282829362111337, "grad_norm": 2.890014886856079, "learning_rate": 5.45610278372591e-06, "loss": 0.10336367785930634, "num_input_tokens_seen": 1751290, "step": 1704, "train_runtime": 4856.0889, "train_tokens_per_second": 360.638 }, { "epoch": 0.7287103323004595, "grad_norm": 3.8933002948760986, "learning_rate": 5.447537473233405e-06, "loss": 0.2152257263660431, "num_input_tokens_seen": 1752338, "step": 1705, "train_runtime": 4858.2584, "train_tokens_per_second": 360.693 }, { "epoch": 0.7291377283897852, "grad_norm": 1.7483906745910645, "learning_rate": 5.4389721627409e-06, "loss": 0.08699686825275421, "num_input_tokens_seen": 1753384, "step": 1706, "train_runtime": 4860.4018, "train_tokens_per_second": 360.749 }, { "epoch": 0.729565124479111, "grad_norm": 2.5682764053344727, "learning_rate": 5.4304068522483945e-06, "loss": 0.16164517402648926, "num_input_tokens_seen": 1754138, "step": 1707, "train_runtime": 4862.4738, "train_tokens_per_second": 360.75 }, { "epoch": 0.7299925205684368, "grad_norm": 2.454434394836426, "learning_rate": 5.421841541755889e-06, "loss": 0.17905999720096588, "num_input_tokens_seen": 1755136, "step": 1708, "train_runtime": 4864.6238, "train_tokens_per_second": 360.796 }, { "epoch": 0.7304199166577626, "grad_norm": 2.6822142601013184, "learning_rate": 5.413276231263383e-06, "loss": 0.16729134321212769, "num_input_tokens_seen": 1756140, "step": 1709, "train_runtime": 4866.8023, "train_tokens_per_second": 360.841 }, { "epoch": 0.7308473127470884, "grad_norm": 2.301751136779785, "learning_rate": 5.404710920770878e-06, "loss": 0.12160074710845947, "num_input_tokens_seen": 1757116, "step": 1710, "train_runtime": 4868.9434, "train_tokens_per_second": 360.882 }, { "epoch": 0.7312747088364141, "grad_norm": 1.7962868213653564, "learning_rate": 5.396145610278373e-06, "loss": 0.051778871566057205, "num_input_tokens_seen": 1757922, "step": 1711, "train_runtime": 4884.0219, "train_tokens_per_second": 359.933 }, { "epoch": 0.73170210492574, "grad_norm": 1.967346429824829, "learning_rate": 5.3875802997858675e-06, "loss": 0.12240543216466904, "num_input_tokens_seen": 1759588, "step": 1712, "train_runtime": 4886.3333, "train_tokens_per_second": 360.104 }, { "epoch": 0.7321295010150657, "grad_norm": 2.5978519916534424, "learning_rate": 5.379014989293362e-06, "loss": 0.09371157735586166, "num_input_tokens_seen": 1760308, "step": 1713, "train_runtime": 4888.4075, "train_tokens_per_second": 360.098 }, { "epoch": 0.7325568971043915, "grad_norm": 2.319333553314209, "learning_rate": 5.370449678800856e-06, "loss": 0.20478688180446625, "num_input_tokens_seen": 1762078, "step": 1714, "train_runtime": 4890.7612, "train_tokens_per_second": 360.287 }, { "epoch": 0.7329842931937173, "grad_norm": 1.245335340499878, "learning_rate": 5.3618843683083525e-06, "loss": 0.08343061804771423, "num_input_tokens_seen": 1766162, "step": 1715, "train_runtime": 4893.6673, "train_tokens_per_second": 360.908 }, { "epoch": 0.733411689283043, "grad_norm": 2.084432363510132, "learning_rate": 5.353319057815847e-06, "loss": 0.07743018120527267, "num_input_tokens_seen": 1766872, "step": 1716, "train_runtime": 4895.7272, "train_tokens_per_second": 360.901 }, { "epoch": 0.7338390853723689, "grad_norm": 2.114238977432251, "learning_rate": 5.344753747323341e-06, "loss": 0.11940549314022064, "num_input_tokens_seen": 1767812, "step": 1717, "train_runtime": 4897.8848, "train_tokens_per_second": 360.934 }, { "epoch": 0.7342664814616946, "grad_norm": 2.5279343128204346, "learning_rate": 5.336188436830836e-06, "loss": 0.0997849553823471, "num_input_tokens_seen": 1768594, "step": 1718, "train_runtime": 4899.9657, "train_tokens_per_second": 360.94 }, { "epoch": 0.7346938775510204, "grad_norm": 2.5341482162475586, "learning_rate": 5.32762312633833e-06, "loss": 0.14740152657032013, "num_input_tokens_seen": 1769324, "step": 1719, "train_runtime": 4901.9986, "train_tokens_per_second": 360.939 }, { "epoch": 0.7351212736403462, "grad_norm": 3.104464054107666, "learning_rate": 5.319057815845825e-06, "loss": 0.12243078649044037, "num_input_tokens_seen": 1770244, "step": 1720, "train_runtime": 4904.2863, "train_tokens_per_second": 360.959 }, { "epoch": 0.7355486697296719, "grad_norm": 2.949453592300415, "learning_rate": 5.31049250535332e-06, "loss": 0.15506841242313385, "num_input_tokens_seen": 1771034, "step": 1721, "train_runtime": 4906.3379, "train_tokens_per_second": 360.969 }, { "epoch": 0.7359760658189978, "grad_norm": 2.606902837753296, "learning_rate": 5.301927194860814e-06, "loss": 0.10120886564254761, "num_input_tokens_seen": 1771848, "step": 1722, "train_runtime": 4908.4644, "train_tokens_per_second": 360.978 }, { "epoch": 0.7364034619083235, "grad_norm": 2.355135917663574, "learning_rate": 5.293361884368309e-06, "loss": 0.09580687433481216, "num_input_tokens_seen": 1772830, "step": 1723, "train_runtime": 4910.644, "train_tokens_per_second": 361.018 }, { "epoch": 0.7368308579976494, "grad_norm": 3.3114848136901855, "learning_rate": 5.284796573875803e-06, "loss": 0.1144857332110405, "num_input_tokens_seen": 1773516, "step": 1724, "train_runtime": 4912.7477, "train_tokens_per_second": 361.003 }, { "epoch": 0.7372582540869751, "grad_norm": 2.0524861812591553, "learning_rate": 5.276231263383298e-06, "loss": 0.10405785590410233, "num_input_tokens_seen": 1774302, "step": 1725, "train_runtime": 4914.8364, "train_tokens_per_second": 361.009 }, { "epoch": 0.7376856501763008, "grad_norm": 2.8031365871429443, "learning_rate": 5.267665952890793e-06, "loss": 0.17746911942958832, "num_input_tokens_seen": 1775332, "step": 1726, "train_runtime": 4916.9499, "train_tokens_per_second": 361.064 }, { "epoch": 0.7381130462656267, "grad_norm": 1.2895371913909912, "learning_rate": 5.259100642398287e-06, "loss": 0.08301758021116257, "num_input_tokens_seen": 1777012, "step": 1727, "train_runtime": 4919.2948, "train_tokens_per_second": 361.233 }, { "epoch": 0.7385404423549524, "grad_norm": 2.246673583984375, "learning_rate": 5.250535331905782e-06, "loss": 0.11134842038154602, "num_input_tokens_seen": 1778124, "step": 1728, "train_runtime": 4921.4548, "train_tokens_per_second": 361.3 }, { "epoch": 0.7389678384442783, "grad_norm": 2.3084068298339844, "learning_rate": 5.241970021413276e-06, "loss": 0.14449399709701538, "num_input_tokens_seen": 1778986, "step": 1729, "train_runtime": 4923.5779, "train_tokens_per_second": 361.32 }, { "epoch": 0.739395234533604, "grad_norm": 2.2981183528900146, "learning_rate": 5.233404710920771e-06, "loss": 0.14202140271663666, "num_input_tokens_seen": 1780028, "step": 1730, "train_runtime": 4925.7332, "train_tokens_per_second": 361.373 }, { "epoch": 0.7398226306229299, "grad_norm": 1.8037728071212769, "learning_rate": 5.224839400428265e-06, "loss": 0.0830642506480217, "num_input_tokens_seen": 1781036, "step": 1731, "train_runtime": 4927.8742, "train_tokens_per_second": 361.421 }, { "epoch": 0.7402500267122556, "grad_norm": 1.8055533170700073, "learning_rate": 5.216274089935761e-06, "loss": 0.09065364301204681, "num_input_tokens_seen": 1782164, "step": 1732, "train_runtime": 4930.0559, "train_tokens_per_second": 361.49 }, { "epoch": 0.7406774228015813, "grad_norm": 2.006284475326538, "learning_rate": 5.207708779443256e-06, "loss": 0.08791021257638931, "num_input_tokens_seen": 1783190, "step": 1733, "train_runtime": 4932.2141, "train_tokens_per_second": 361.539 }, { "epoch": 0.7411048188909072, "grad_norm": 1.884128451347351, "learning_rate": 5.19914346895075e-06, "loss": 0.13375459611415863, "num_input_tokens_seen": 1784506, "step": 1734, "train_runtime": 4934.4358, "train_tokens_per_second": 361.643 }, { "epoch": 0.7415322149802329, "grad_norm": 2.6705405712127686, "learning_rate": 5.1905781584582445e-06, "loss": 0.10275781154632568, "num_input_tokens_seen": 1785292, "step": 1735, "train_runtime": 4936.5609, "train_tokens_per_second": 361.647 }, { "epoch": 0.7419596110695588, "grad_norm": 2.2450931072235107, "learning_rate": 5.18201284796574e-06, "loss": 0.12784308195114136, "num_input_tokens_seen": 1786170, "step": 1736, "train_runtime": 4938.686, "train_tokens_per_second": 361.669 }, { "epoch": 0.7423870071588845, "grad_norm": 2.742281198501587, "learning_rate": 5.173447537473234e-06, "loss": 0.13632413744926453, "num_input_tokens_seen": 1786842, "step": 1737, "train_runtime": 4940.7336, "train_tokens_per_second": 361.655 }, { "epoch": 0.7428144032482102, "grad_norm": 2.174654722213745, "learning_rate": 5.164882226980729e-06, "loss": 0.15204423666000366, "num_input_tokens_seen": 1788128, "step": 1738, "train_runtime": 4942.9475, "train_tokens_per_second": 361.753 }, { "epoch": 0.7432417993375361, "grad_norm": 2.109191656112671, "learning_rate": 5.156316916488223e-06, "loss": 0.1222369372844696, "num_input_tokens_seen": 1789048, "step": 1739, "train_runtime": 4945.0669, "train_tokens_per_second": 361.784 }, { "epoch": 0.7436691954268618, "grad_norm": 2.59523606300354, "learning_rate": 5.1477516059957175e-06, "loss": 0.16759590804576874, "num_input_tokens_seen": 1790130, "step": 1740, "train_runtime": 4947.2487, "train_tokens_per_second": 361.844 }, { "epoch": 0.7440965915161877, "grad_norm": 2.0634920597076416, "learning_rate": 5.139186295503213e-06, "loss": 0.13964451849460602, "num_input_tokens_seen": 1791316, "step": 1741, "train_runtime": 4962.3175, "train_tokens_per_second": 360.984 }, { "epoch": 0.7445239876055134, "grad_norm": 3.337764263153076, "learning_rate": 5.130620985010707e-06, "loss": 0.07662618160247803, "num_input_tokens_seen": 1792168, "step": 1742, "train_runtime": 4964.4055, "train_tokens_per_second": 361.004 }, { "epoch": 0.7449513836948392, "grad_norm": 2.6240949630737305, "learning_rate": 5.122055674518202e-06, "loss": 0.08762823045253754, "num_input_tokens_seen": 1792770, "step": 1743, "train_runtime": 4966.468, "train_tokens_per_second": 360.975 }, { "epoch": 0.745378779784165, "grad_norm": 2.48095965385437, "learning_rate": 5.113490364025696e-06, "loss": 0.09734433144330978, "num_input_tokens_seen": 1793856, "step": 1744, "train_runtime": 4968.6718, "train_tokens_per_second": 361.033 }, { "epoch": 0.7458061758734907, "grad_norm": 2.2448716163635254, "learning_rate": 5.1049250535331905e-06, "loss": 0.1444011628627777, "num_input_tokens_seen": 1794662, "step": 1745, "train_runtime": 4970.7634, "train_tokens_per_second": 361.044 }, { "epoch": 0.7462335719628166, "grad_norm": 2.1753718852996826, "learning_rate": 5.096359743040685e-06, "loss": 0.08833227306604385, "num_input_tokens_seen": 1795566, "step": 1746, "train_runtime": 4972.9053, "train_tokens_per_second": 361.07 }, { "epoch": 0.7466609680521423, "grad_norm": 2.468184232711792, "learning_rate": 5.08779443254818e-06, "loss": 0.10683442652225494, "num_input_tokens_seen": 1796186, "step": 1747, "train_runtime": 4974.9249, "train_tokens_per_second": 361.048 }, { "epoch": 0.7470883641414681, "grad_norm": 2.383761405944824, "learning_rate": 5.079229122055675e-06, "loss": 0.15987126529216766, "num_input_tokens_seen": 1798050, "step": 1748, "train_runtime": 4977.2968, "train_tokens_per_second": 361.25 }, { "epoch": 0.7475157602307939, "grad_norm": 2.041799306869507, "learning_rate": 5.07066381156317e-06, "loss": 0.1062455028295517, "num_input_tokens_seen": 1799004, "step": 1749, "train_runtime": 4979.4533, "train_tokens_per_second": 361.285 }, { "epoch": 0.7479431563201197, "grad_norm": 2.9271047115325928, "learning_rate": 5.062098501070664e-06, "loss": 0.09416396170854568, "num_input_tokens_seen": 1799964, "step": 1750, "train_runtime": 4981.5995, "train_tokens_per_second": 361.323 }, { "epoch": 0.7483705524094455, "grad_norm": 1.8387802839279175, "learning_rate": 5.05353319057816e-06, "loss": 0.09066452085971832, "num_input_tokens_seen": 1800854, "step": 1751, "train_runtime": 4983.7704, "train_tokens_per_second": 361.344 }, { "epoch": 0.7487979484987712, "grad_norm": 2.1731786727905273, "learning_rate": 5.044967880085654e-06, "loss": 0.15073305368423462, "num_input_tokens_seen": 1801794, "step": 1752, "train_runtime": 4986.007, "train_tokens_per_second": 361.37 }, { "epoch": 0.749225344588097, "grad_norm": 2.4906811714172363, "learning_rate": 5.0364025695931484e-06, "loss": 0.09631376713514328, "num_input_tokens_seen": 1802644, "step": 1753, "train_runtime": 4988.2506, "train_tokens_per_second": 361.378 }, { "epoch": 0.7496527406774228, "grad_norm": 2.490089178085327, "learning_rate": 5.027837259100643e-06, "loss": 0.2221662849187851, "num_input_tokens_seen": 1803724, "step": 1754, "train_runtime": 4990.4096, "train_tokens_per_second": 361.438 }, { "epoch": 0.7500801367667486, "grad_norm": 2.221968412399292, "learning_rate": 5.019271948608137e-06, "loss": 0.1377941071987152, "num_input_tokens_seen": 1804638, "step": 1755, "train_runtime": 4992.531, "train_tokens_per_second": 361.468 }, { "epoch": 0.7505075328560744, "grad_norm": 2.5073354244232178, "learning_rate": 5.010706638115633e-06, "loss": 0.14367598295211792, "num_input_tokens_seen": 1805340, "step": 1756, "train_runtime": 4994.5972, "train_tokens_per_second": 361.459 }, { "epoch": 0.7509349289454001, "grad_norm": 2.0831339359283447, "learning_rate": 5.002141327623127e-06, "loss": 0.13118833303451538, "num_input_tokens_seen": 1806728, "step": 1757, "train_runtime": 4996.8626, "train_tokens_per_second": 361.572 }, { "epoch": 0.7513623250347259, "grad_norm": 2.693484306335449, "learning_rate": 4.9935760171306214e-06, "loss": 0.10646102577447891, "num_input_tokens_seen": 1807926, "step": 1758, "train_runtime": 4999.0126, "train_tokens_per_second": 361.657 }, { "epoch": 0.7517897211240517, "grad_norm": 2.6705830097198486, "learning_rate": 4.985010706638116e-06, "loss": 0.16977126896381378, "num_input_tokens_seen": 1808960, "step": 1759, "train_runtime": 5001.165, "train_tokens_per_second": 361.708 }, { "epoch": 0.7522171172133775, "grad_norm": 1.7905365228652954, "learning_rate": 4.97644539614561e-06, "loss": 0.10334272682666779, "num_input_tokens_seen": 1810242, "step": 1760, "train_runtime": 5003.3683, "train_tokens_per_second": 361.805 }, { "epoch": 0.7526445133027033, "grad_norm": 2.0694689750671387, "learning_rate": 4.967880085653105e-06, "loss": 0.13218551874160767, "num_input_tokens_seen": 1811086, "step": 1761, "train_runtime": 5005.4824, "train_tokens_per_second": 361.82 }, { "epoch": 0.7530719093920291, "grad_norm": 2.647510528564453, "learning_rate": 4.9593147751606e-06, "loss": 0.20446237921714783, "num_input_tokens_seen": 1812102, "step": 1762, "train_runtime": 5007.6619, "train_tokens_per_second": 361.866 }, { "epoch": 0.7534993054813548, "grad_norm": 2.8202621936798096, "learning_rate": 4.9507494646680944e-06, "loss": 0.15166407823562622, "num_input_tokens_seen": 1812822, "step": 1763, "train_runtime": 5009.7093, "train_tokens_per_second": 361.862 }, { "epoch": 0.7539267015706806, "grad_norm": 2.207237482070923, "learning_rate": 4.94218415417559e-06, "loss": 0.1600687950849533, "num_input_tokens_seen": 1813886, "step": 1764, "train_runtime": 5011.8518, "train_tokens_per_second": 361.919 }, { "epoch": 0.7543540976600064, "grad_norm": 2.0225484371185303, "learning_rate": 4.933618843683084e-06, "loss": 0.11253505200147629, "num_input_tokens_seen": 1815006, "step": 1765, "train_runtime": 5014.0197, "train_tokens_per_second": 361.986 }, { "epoch": 0.7547814937493322, "grad_norm": 1.6529148817062378, "learning_rate": 4.9250535331905786e-06, "loss": 0.09459485113620758, "num_input_tokens_seen": 1815906, "step": 1766, "train_runtime": 5016.1388, "train_tokens_per_second": 362.013 }, { "epoch": 0.755208889838658, "grad_norm": 1.4612174034118652, "learning_rate": 4.916488222698073e-06, "loss": 0.06439751386642456, "num_input_tokens_seen": 1816980, "step": 1767, "train_runtime": 5018.3082, "train_tokens_per_second": 362.07 }, { "epoch": 0.7556362859279837, "grad_norm": 1.751206398010254, "learning_rate": 4.9079229122055674e-06, "loss": 0.09944566339254379, "num_input_tokens_seen": 1817988, "step": 1768, "train_runtime": 5020.4363, "train_tokens_per_second": 362.118 }, { "epoch": 0.7560636820173096, "grad_norm": 1.9897797107696533, "learning_rate": 4.899357601713063e-06, "loss": 0.1456417739391327, "num_input_tokens_seen": 1819128, "step": 1769, "train_runtime": 5022.639, "train_tokens_per_second": 362.186 }, { "epoch": 0.7564910781066353, "grad_norm": 1.4492417573928833, "learning_rate": 4.890792291220557e-06, "loss": 0.07394880801439285, "num_input_tokens_seen": 1820096, "step": 1770, "train_runtime": 5024.7778, "train_tokens_per_second": 362.224 }, { "epoch": 0.7569184741959611, "grad_norm": 2.184596061706543, "learning_rate": 4.882226980728052e-06, "loss": 0.10925288498401642, "num_input_tokens_seen": 1820958, "step": 1771, "train_runtime": 5039.8012, "train_tokens_per_second": 361.315 }, { "epoch": 0.7573458702852869, "grad_norm": 3.1226325035095215, "learning_rate": 4.873661670235547e-06, "loss": 0.1586754471063614, "num_input_tokens_seen": 1821880, "step": 1772, "train_runtime": 5042.5892, "train_tokens_per_second": 361.299 }, { "epoch": 0.7577732663746126, "grad_norm": 2.022779941558838, "learning_rate": 4.865096359743041e-06, "loss": 0.1342182457447052, "num_input_tokens_seen": 1822866, "step": 1773, "train_runtime": 5044.8003, "train_tokens_per_second": 361.336 }, { "epoch": 0.7582006624639385, "grad_norm": 2.693209409713745, "learning_rate": 4.856531049250536e-06, "loss": 0.23240728676319122, "num_input_tokens_seen": 1823646, "step": 1774, "train_runtime": 5046.8943, "train_tokens_per_second": 361.34 }, { "epoch": 0.7586280585532642, "grad_norm": 1.7339637279510498, "learning_rate": 4.84796573875803e-06, "loss": 0.1240958422422409, "num_input_tokens_seen": 1825138, "step": 1775, "train_runtime": 5049.2126, "train_tokens_per_second": 361.47 }, { "epoch": 0.75905545464259, "grad_norm": 2.3785059452056885, "learning_rate": 4.8394004282655246e-06, "loss": 0.1522769182920456, "num_input_tokens_seen": 1825992, "step": 1776, "train_runtime": 5051.3397, "train_tokens_per_second": 361.487 }, { "epoch": 0.7594828507319158, "grad_norm": 1.264596700668335, "learning_rate": 4.83083511777302e-06, "loss": 0.06347937881946564, "num_input_tokens_seen": 1827504, "step": 1777, "train_runtime": 5053.6685, "train_tokens_per_second": 361.619 }, { "epoch": 0.7599102468212415, "grad_norm": 1.5487502813339233, "learning_rate": 4.822269807280514e-06, "loss": 0.07012402266263962, "num_input_tokens_seen": 1828998, "step": 1778, "train_runtime": 5055.9214, "train_tokens_per_second": 361.754 }, { "epoch": 0.7603376429105674, "grad_norm": 1.6670122146606445, "learning_rate": 4.8137044967880095e-06, "loss": 0.07347247749567032, "num_input_tokens_seen": 1829948, "step": 1779, "train_runtime": 5058.0862, "train_tokens_per_second": 361.787 }, { "epoch": 0.7607650389998931, "grad_norm": 3.5259151458740234, "learning_rate": 4.805139186295504e-06, "loss": 0.14109820127487183, "num_input_tokens_seen": 1831222, "step": 1780, "train_runtime": 5060.3129, "train_tokens_per_second": 361.879 }, { "epoch": 0.761192435089219, "grad_norm": 3.180718183517456, "learning_rate": 4.796573875802998e-06, "loss": 0.15151821076869965, "num_input_tokens_seen": 1832244, "step": 1781, "train_runtime": 5062.5126, "train_tokens_per_second": 361.924 }, { "epoch": 0.7616198311785447, "grad_norm": 1.370081901550293, "learning_rate": 4.788008565310493e-06, "loss": 0.07774853706359863, "num_input_tokens_seen": 1833752, "step": 1782, "train_runtime": 5064.8718, "train_tokens_per_second": 362.053 }, { "epoch": 0.7620472272678706, "grad_norm": 3.96315860748291, "learning_rate": 4.779443254817987e-06, "loss": 0.18797242641448975, "num_input_tokens_seen": 1834596, "step": 1783, "train_runtime": 5066.9988, "train_tokens_per_second": 362.068 }, { "epoch": 0.7624746233571963, "grad_norm": 2.029892921447754, "learning_rate": 4.7708779443254825e-06, "loss": 0.15799033641815186, "num_input_tokens_seen": 1835838, "step": 1784, "train_runtime": 5069.1867, "train_tokens_per_second": 362.156 }, { "epoch": 0.762902019446522, "grad_norm": 2.7727293968200684, "learning_rate": 4.762312633832977e-06, "loss": 0.10154961794614792, "num_input_tokens_seen": 1836712, "step": 1785, "train_runtime": 5071.327, "train_tokens_per_second": 362.176 }, { "epoch": 0.7633294155358479, "grad_norm": 3.1447322368621826, "learning_rate": 4.753747323340471e-06, "loss": 0.1865973174571991, "num_input_tokens_seen": 1837436, "step": 1786, "train_runtime": 5073.432, "train_tokens_per_second": 362.168 }, { "epoch": 0.7637568116251736, "grad_norm": 2.0704610347747803, "learning_rate": 4.745182012847966e-06, "loss": 0.09010666608810425, "num_input_tokens_seen": 1838206, "step": 1787, "train_runtime": 5075.5737, "train_tokens_per_second": 362.167 }, { "epoch": 0.7641842077144995, "grad_norm": 2.9957287311553955, "learning_rate": 4.736616702355461e-06, "loss": 0.12626878917217255, "num_input_tokens_seen": 1839590, "step": 1788, "train_runtime": 5077.7974, "train_tokens_per_second": 362.281 }, { "epoch": 0.7646116038038252, "grad_norm": 2.074080228805542, "learning_rate": 4.7280513918629555e-06, "loss": 0.08674152195453644, "num_input_tokens_seen": 1840380, "step": 1789, "train_runtime": 5079.864, "train_tokens_per_second": 362.289 }, { "epoch": 0.7650389998931509, "grad_norm": 2.0169169902801514, "learning_rate": 4.71948608137045e-06, "loss": 0.11346843838691711, "num_input_tokens_seen": 1841326, "step": 1790, "train_runtime": 5081.9815, "train_tokens_per_second": 362.324 }, { "epoch": 0.7654663959824768, "grad_norm": 2.252941608428955, "learning_rate": 4.710920770877944e-06, "loss": 0.10692466050386429, "num_input_tokens_seen": 1842096, "step": 1791, "train_runtime": 5084.0763, "train_tokens_per_second": 362.327 }, { "epoch": 0.7658937920718025, "grad_norm": 2.742074728012085, "learning_rate": 4.70235546038544e-06, "loss": 0.1425284445285797, "num_input_tokens_seen": 1842650, "step": 1792, "train_runtime": 5086.1114, "train_tokens_per_second": 362.291 }, { "epoch": 0.7663211881611284, "grad_norm": 2.311002254486084, "learning_rate": 4.693790149892934e-06, "loss": 0.1447705328464508, "num_input_tokens_seen": 1843962, "step": 1793, "train_runtime": 5088.3243, "train_tokens_per_second": 362.391 }, { "epoch": 0.7667485842504541, "grad_norm": 3.126150608062744, "learning_rate": 4.6852248394004285e-06, "loss": 0.21477144956588745, "num_input_tokens_seen": 1844878, "step": 1794, "train_runtime": 5090.4959, "train_tokens_per_second": 362.416 }, { "epoch": 0.7671759803397799, "grad_norm": 3.488682508468628, "learning_rate": 4.676659528907923e-06, "loss": 0.1394921839237213, "num_input_tokens_seen": 1845536, "step": 1795, "train_runtime": 5092.5953, "train_tokens_per_second": 362.396 }, { "epoch": 0.7676033764291057, "grad_norm": 1.9885671138763428, "learning_rate": 4.668094218415418e-06, "loss": 0.13407884538173676, "num_input_tokens_seen": 1846996, "step": 1796, "train_runtime": 5094.8763, "train_tokens_per_second": 362.52 }, { "epoch": 0.7680307725184314, "grad_norm": 2.4607231616973877, "learning_rate": 4.659528907922913e-06, "loss": 0.13201317191123962, "num_input_tokens_seen": 1848206, "step": 1797, "train_runtime": 5097.0959, "train_tokens_per_second": 362.6 }, { "epoch": 0.7684581686077573, "grad_norm": 2.704148530960083, "learning_rate": 4.650963597430407e-06, "loss": 0.14820332825183868, "num_input_tokens_seen": 1849206, "step": 1798, "train_runtime": 5099.25, "train_tokens_per_second": 362.643 }, { "epoch": 0.768885564697083, "grad_norm": 2.26305890083313, "learning_rate": 4.642398286937902e-06, "loss": 0.1085265576839447, "num_input_tokens_seen": 1849852, "step": 1799, "train_runtime": 5101.3099, "train_tokens_per_second": 362.623 }, { "epoch": 0.7693129607864088, "grad_norm": 2.4953997135162354, "learning_rate": 4.633832976445397e-06, "loss": 0.13118381798267365, "num_input_tokens_seen": 1851192, "step": 1800, "train_runtime": 5103.5249, "train_tokens_per_second": 362.728 }, { "epoch": 0.7697403568757346, "grad_norm": 2.278885841369629, "learning_rate": 4.625267665952891e-06, "loss": 0.09888924658298492, "num_input_tokens_seen": 1852074, "step": 1801, "train_runtime": 5119.4164, "train_tokens_per_second": 361.774 }, { "epoch": 0.7701677529650603, "grad_norm": 2.3381922245025635, "learning_rate": 4.616702355460386e-06, "loss": 0.16264069080352783, "num_input_tokens_seen": 1853086, "step": 1802, "train_runtime": 5121.6034, "train_tokens_per_second": 361.818 }, { "epoch": 0.7705951490543862, "grad_norm": 1.7255778312683105, "learning_rate": 4.60813704496788e-06, "loss": 0.11930899322032928, "num_input_tokens_seen": 1854112, "step": 1803, "train_runtime": 5123.8756, "train_tokens_per_second": 361.857 }, { "epoch": 0.7710225451437119, "grad_norm": 1.7517153024673462, "learning_rate": 4.5995717344753745e-06, "loss": 0.10708696395158768, "num_input_tokens_seen": 1855120, "step": 1804, "train_runtime": 5126.0418, "train_tokens_per_second": 361.901 }, { "epoch": 0.7714499412330377, "grad_norm": 2.6439056396484375, "learning_rate": 4.59100642398287e-06, "loss": 0.08341437578201294, "num_input_tokens_seen": 1855818, "step": 1805, "train_runtime": 5128.1142, "train_tokens_per_second": 361.891 }, { "epoch": 0.7718773373223635, "grad_norm": 2.328486204147339, "learning_rate": 4.582441113490364e-06, "loss": 0.09993680566549301, "num_input_tokens_seen": 1856408, "step": 1806, "train_runtime": 5130.1775, "train_tokens_per_second": 361.86 }, { "epoch": 0.7723047334116893, "grad_norm": 2.3189327716827393, "learning_rate": 4.5738758029978595e-06, "loss": 0.11844801902770996, "num_input_tokens_seen": 1857328, "step": 1807, "train_runtime": 5132.3389, "train_tokens_per_second": 361.887 }, { "epoch": 0.7727321295010151, "grad_norm": 2.1405961513519287, "learning_rate": 4.565310492505354e-06, "loss": 0.14549094438552856, "num_input_tokens_seen": 1858462, "step": 1808, "train_runtime": 5134.4945, "train_tokens_per_second": 361.956 }, { "epoch": 0.7731595255903408, "grad_norm": 1.8244071006774902, "learning_rate": 4.556745182012848e-06, "loss": 0.10341336578130722, "num_input_tokens_seen": 1859326, "step": 1809, "train_runtime": 5136.6723, "train_tokens_per_second": 361.971 }, { "epoch": 0.7735869216796666, "grad_norm": 2.110968589782715, "learning_rate": 4.548179871520343e-06, "loss": 0.11455903947353363, "num_input_tokens_seen": 1860078, "step": 1810, "train_runtime": 5138.8078, "train_tokens_per_second": 361.967 }, { "epoch": 0.7740143177689924, "grad_norm": 1.7827335596084595, "learning_rate": 4.539614561027837e-06, "loss": 0.10141510516405106, "num_input_tokens_seen": 1861088, "step": 1811, "train_runtime": 5140.945, "train_tokens_per_second": 362.013 }, { "epoch": 0.7744417138583182, "grad_norm": 2.4329521656036377, "learning_rate": 4.5310492505353325e-06, "loss": 0.11690457165241241, "num_input_tokens_seen": 1861916, "step": 1812, "train_runtime": 5143.0702, "train_tokens_per_second": 362.024 }, { "epoch": 0.774869109947644, "grad_norm": 2.1015193462371826, "learning_rate": 4.522483940042827e-06, "loss": 0.11495056748390198, "num_input_tokens_seen": 1862624, "step": 1813, "train_runtime": 5145.1293, "train_tokens_per_second": 362.017 }, { "epoch": 0.7752965060369698, "grad_norm": 2.322100877761841, "learning_rate": 4.513918629550322e-06, "loss": 0.10310870409011841, "num_input_tokens_seen": 1863660, "step": 1814, "train_runtime": 5147.2812, "train_tokens_per_second": 362.067 }, { "epoch": 0.7757239021262955, "grad_norm": 1.5570839643478394, "learning_rate": 4.505353319057817e-06, "loss": 0.09182693064212799, "num_input_tokens_seen": 1864714, "step": 1815, "train_runtime": 5149.4093, "train_tokens_per_second": 362.122 }, { "epoch": 0.7761512982156213, "grad_norm": 2.36293888092041, "learning_rate": 4.496788008565311e-06, "loss": 0.15710002183914185, "num_input_tokens_seen": 1865414, "step": 1816, "train_runtime": 5151.5034, "train_tokens_per_second": 362.111 }, { "epoch": 0.7765786943049471, "grad_norm": 2.5093367099761963, "learning_rate": 4.4882226980728055e-06, "loss": 0.15436488389968872, "num_input_tokens_seen": 1866346, "step": 1817, "train_runtime": 5153.6179, "train_tokens_per_second": 362.143 }, { "epoch": 0.7770060903942729, "grad_norm": 3.3405544757843018, "learning_rate": 4.4796573875803e-06, "loss": 0.21985983848571777, "num_input_tokens_seen": 1867286, "step": 1818, "train_runtime": 5155.7658, "train_tokens_per_second": 362.174 }, { "epoch": 0.7774334864835987, "grad_norm": 2.5819220542907715, "learning_rate": 4.471092077087794e-06, "loss": 0.12257808446884155, "num_input_tokens_seen": 1868052, "step": 1819, "train_runtime": 5157.8808, "train_tokens_per_second": 362.174 }, { "epoch": 0.7778608825729244, "grad_norm": 1.9124655723571777, "learning_rate": 4.46252676659529e-06, "loss": 0.11753346025943756, "num_input_tokens_seen": 1869264, "step": 1820, "train_runtime": 5160.0624, "train_tokens_per_second": 362.256 }, { "epoch": 0.7782882786622503, "grad_norm": 1.8850749731063843, "learning_rate": 4.453961456102784e-06, "loss": 0.11016516387462616, "num_input_tokens_seen": 1870456, "step": 1821, "train_runtime": 5162.289, "train_tokens_per_second": 362.331 }, { "epoch": 0.778715674751576, "grad_norm": 1.661813735961914, "learning_rate": 4.445396145610279e-06, "loss": 0.13455480337142944, "num_input_tokens_seen": 1871972, "step": 1822, "train_runtime": 5164.5417, "train_tokens_per_second": 362.466 }, { "epoch": 0.7791430708409018, "grad_norm": 3.2305221557617188, "learning_rate": 4.436830835117774e-06, "loss": 0.11921562254428864, "num_input_tokens_seen": 1872810, "step": 1823, "train_runtime": 5166.6415, "train_tokens_per_second": 362.481 }, { "epoch": 0.7795704669302276, "grad_norm": 2.1064887046813965, "learning_rate": 4.428265524625268e-06, "loss": 0.09975242614746094, "num_input_tokens_seen": 1873992, "step": 1824, "train_runtime": 5168.8276, "train_tokens_per_second": 362.556 }, { "epoch": 0.7799978630195533, "grad_norm": 2.426936388015747, "learning_rate": 4.419700214132763e-06, "loss": 0.16474170982837677, "num_input_tokens_seen": 1874830, "step": 1825, "train_runtime": 5170.9453, "train_tokens_per_second": 362.57 }, { "epoch": 0.7804252591088792, "grad_norm": 2.489961862564087, "learning_rate": 4.411134903640257e-06, "loss": 0.12089613080024719, "num_input_tokens_seen": 1875602, "step": 1826, "train_runtime": 5173.0837, "train_tokens_per_second": 362.569 }, { "epoch": 0.7808526551982049, "grad_norm": 2.6534628868103027, "learning_rate": 4.402569593147752e-06, "loss": 0.13732200860977173, "num_input_tokens_seen": 1876560, "step": 1827, "train_runtime": 5175.2509, "train_tokens_per_second": 362.603 }, { "epoch": 0.7812800512875308, "grad_norm": 1.9976394176483154, "learning_rate": 4.394004282655247e-06, "loss": 0.10832753777503967, "num_input_tokens_seen": 1877702, "step": 1828, "train_runtime": 5177.4241, "train_tokens_per_second": 362.671 }, { "epoch": 0.7817074473768565, "grad_norm": 2.093379497528076, "learning_rate": 4.385438972162741e-06, "loss": 0.2253294289112091, "num_input_tokens_seen": 1878878, "step": 1829, "train_runtime": 5179.6029, "train_tokens_per_second": 362.746 }, { "epoch": 0.7821348434661823, "grad_norm": 2.3307065963745117, "learning_rate": 4.376873661670236e-06, "loss": 0.07001787424087524, "num_input_tokens_seen": 1879378, "step": 1830, "train_runtime": 5181.6337, "train_tokens_per_second": 362.7 }, { "epoch": 0.7825622395555081, "grad_norm": 3.0533840656280518, "learning_rate": 4.368308351177731e-06, "loss": 0.17326922714710236, "num_input_tokens_seen": 1880362, "step": 1831, "train_runtime": 5197.437, "train_tokens_per_second": 361.786 }, { "epoch": 0.7829896356448338, "grad_norm": 6.68617582321167, "learning_rate": 4.359743040685225e-06, "loss": 0.21133653819561005, "num_input_tokens_seen": 1881118, "step": 1832, "train_runtime": 5199.5554, "train_tokens_per_second": 361.784 }, { "epoch": 0.7834170317341597, "grad_norm": 3.327510118484497, "learning_rate": 4.35117773019272e-06, "loss": 0.17654043436050415, "num_input_tokens_seen": 1882114, "step": 1833, "train_runtime": 5201.7041, "train_tokens_per_second": 361.826 }, { "epoch": 0.7838444278234854, "grad_norm": 1.9239948987960815, "learning_rate": 4.342612419700214e-06, "loss": 0.06743384897708893, "num_input_tokens_seen": 1883070, "step": 1834, "train_runtime": 5203.8629, "train_tokens_per_second": 361.86 }, { "epoch": 0.7842718239128113, "grad_norm": 2.5109810829162598, "learning_rate": 4.3340471092077094e-06, "loss": 0.14452077448368073, "num_input_tokens_seen": 1883892, "step": 1835, "train_runtime": 5206.0022, "train_tokens_per_second": 361.869 }, { "epoch": 0.784699220002137, "grad_norm": 1.2670587301254272, "learning_rate": 4.325481798715204e-06, "loss": 0.067506343126297, "num_input_tokens_seen": 1885090, "step": 1836, "train_runtime": 5208.2196, "train_tokens_per_second": 361.945 }, { "epoch": 0.7851266160914627, "grad_norm": 1.8930679559707642, "learning_rate": 4.316916488222698e-06, "loss": 0.1032271757721901, "num_input_tokens_seen": 1886034, "step": 1837, "train_runtime": 5210.3698, "train_tokens_per_second": 361.977 }, { "epoch": 0.7855540121807886, "grad_norm": 3.379704236984253, "learning_rate": 4.308351177730193e-06, "loss": 0.1684207320213318, "num_input_tokens_seen": 1887506, "step": 1838, "train_runtime": 5212.6169, "train_tokens_per_second": 362.103 }, { "epoch": 0.7859814082701143, "grad_norm": 1.447620153427124, "learning_rate": 4.299785867237688e-06, "loss": 0.11584776639938354, "num_input_tokens_seen": 1889108, "step": 1839, "train_runtime": 5214.9021, "train_tokens_per_second": 362.252 }, { "epoch": 0.7864088043594402, "grad_norm": 1.519661784172058, "learning_rate": 4.2912205567451824e-06, "loss": 0.10505079478025436, "num_input_tokens_seen": 1890818, "step": 1840, "train_runtime": 5217.1709, "train_tokens_per_second": 362.422 }, { "epoch": 0.7868362004487659, "grad_norm": 1.8158150911331177, "learning_rate": 4.282655246252677e-06, "loss": 0.07172860950231552, "num_input_tokens_seen": 1891494, "step": 1841, "train_runtime": 5219.3032, "train_tokens_per_second": 362.404 }, { "epoch": 0.7872635965380916, "grad_norm": 1.996261715888977, "learning_rate": 4.274089935760172e-06, "loss": 0.10932371020317078, "num_input_tokens_seen": 1892488, "step": 1842, "train_runtime": 5221.5844, "train_tokens_per_second": 362.436 }, { "epoch": 0.7876909926274175, "grad_norm": 1.4062652587890625, "learning_rate": 4.265524625267667e-06, "loss": 0.08581814169883728, "num_input_tokens_seen": 1893790, "step": 1843, "train_runtime": 5223.8744, "train_tokens_per_second": 362.526 }, { "epoch": 0.7881183887167432, "grad_norm": 2.0480849742889404, "learning_rate": 4.256959314775161e-06, "loss": 0.12999306619167328, "num_input_tokens_seen": 1894892, "step": 1844, "train_runtime": 5226.056, "train_tokens_per_second": 362.585 }, { "epoch": 0.7885457848060691, "grad_norm": 3.563359260559082, "learning_rate": 4.2483940042826554e-06, "loss": 0.16921770572662354, "num_input_tokens_seen": 1895542, "step": 1845, "train_runtime": 5228.1901, "train_tokens_per_second": 362.562 }, { "epoch": 0.7889731808953948, "grad_norm": 2.3567779064178467, "learning_rate": 4.23982869379015e-06, "loss": 0.19969452917575836, "num_input_tokens_seen": 1896596, "step": 1846, "train_runtime": 5230.3809, "train_tokens_per_second": 362.611 }, { "epoch": 0.7894005769847205, "grad_norm": 2.3927359580993652, "learning_rate": 4.231263383297644e-06, "loss": 0.17385578155517578, "num_input_tokens_seen": 1897578, "step": 1847, "train_runtime": 5232.4916, "train_tokens_per_second": 362.653 }, { "epoch": 0.7898279730740464, "grad_norm": 2.751912832260132, "learning_rate": 4.2226980728051396e-06, "loss": 0.18276765942573547, "num_input_tokens_seen": 1898646, "step": 1848, "train_runtime": 5234.638, "train_tokens_per_second": 362.708 }, { "epoch": 0.7902553691633721, "grad_norm": 1.5654270648956299, "learning_rate": 4.214132762312634e-06, "loss": 0.07883001118898392, "num_input_tokens_seen": 1899718, "step": 1849, "train_runtime": 5236.7814, "train_tokens_per_second": 362.764 }, { "epoch": 0.790682765252698, "grad_norm": 1.543398141860962, "learning_rate": 4.205567451820129e-06, "loss": 0.06869515776634216, "num_input_tokens_seen": 1900998, "step": 1850, "train_runtime": 5238.9893, "train_tokens_per_second": 362.856 }, { "epoch": 0.7911101613420237, "grad_norm": 1.5596097707748413, "learning_rate": 4.197002141327624e-06, "loss": 0.0821610540151596, "num_input_tokens_seen": 1901850, "step": 1851, "train_runtime": 5241.113, "train_tokens_per_second": 362.871 }, { "epoch": 0.7915375574313495, "grad_norm": 1.888803482055664, "learning_rate": 4.188436830835118e-06, "loss": 0.12986454367637634, "num_input_tokens_seen": 1902918, "step": 1852, "train_runtime": 5243.2539, "train_tokens_per_second": 362.927 }, { "epoch": 0.7919649535206753, "grad_norm": 2.469694137573242, "learning_rate": 4.1798715203426126e-06, "loss": 0.12588948011398315, "num_input_tokens_seen": 1903776, "step": 1853, "train_runtime": 5245.3403, "train_tokens_per_second": 362.946 }, { "epoch": 0.792392349610001, "grad_norm": 2.017801523208618, "learning_rate": 4.171306209850107e-06, "loss": 0.16612306237220764, "num_input_tokens_seen": 1904982, "step": 1854, "train_runtime": 5247.5139, "train_tokens_per_second": 363.026 }, { "epoch": 0.7928197456993269, "grad_norm": 3.377476453781128, "learning_rate": 4.1627408993576014e-06, "loss": 0.16846582293510437, "num_input_tokens_seen": 1905624, "step": 1855, "train_runtime": 5249.6113, "train_tokens_per_second": 363.003 }, { "epoch": 0.7932471417886526, "grad_norm": 3.5028700828552246, "learning_rate": 4.154175588865097e-06, "loss": 0.1279139369726181, "num_input_tokens_seen": 1906454, "step": 1856, "train_runtime": 5251.7204, "train_tokens_per_second": 363.015 }, { "epoch": 0.7936745378779784, "grad_norm": 2.013857364654541, "learning_rate": 4.145610278372592e-06, "loss": 0.09799247235059738, "num_input_tokens_seen": 1907816, "step": 1857, "train_runtime": 5253.9515, "train_tokens_per_second": 363.12 }, { "epoch": 0.7941019339673042, "grad_norm": 1.8402329683303833, "learning_rate": 4.137044967880086e-06, "loss": 0.09691372513771057, "num_input_tokens_seen": 1909478, "step": 1858, "train_runtime": 5256.2698, "train_tokens_per_second": 363.276 }, { "epoch": 0.79452933005663, "grad_norm": 1.8740602731704712, "learning_rate": 4.128479657387581e-06, "loss": 0.10537990927696228, "num_input_tokens_seen": 1910396, "step": 1859, "train_runtime": 5258.3812, "train_tokens_per_second": 363.305 }, { "epoch": 0.7949567261459558, "grad_norm": 2.030247211456299, "learning_rate": 4.119914346895075e-06, "loss": 0.07523954659700394, "num_input_tokens_seen": 1911126, "step": 1860, "train_runtime": 5260.4708, "train_tokens_per_second": 363.299 }, { "epoch": 0.7953841222352815, "grad_norm": 2.6722238063812256, "learning_rate": 4.11134903640257e-06, "loss": 0.10389907658100128, "num_input_tokens_seen": 1911846, "step": 1861, "train_runtime": 5275.7108, "train_tokens_per_second": 362.386 }, { "epoch": 0.7958115183246073, "grad_norm": 1.6098830699920654, "learning_rate": 4.102783725910064e-06, "loss": 0.09851120412349701, "num_input_tokens_seen": 1913048, "step": 1862, "train_runtime": 5277.8948, "train_tokens_per_second": 362.464 }, { "epoch": 0.7962389144139331, "grad_norm": 1.630492925643921, "learning_rate": 4.094218415417559e-06, "loss": 0.09191761910915375, "num_input_tokens_seen": 1914338, "step": 1863, "train_runtime": 5280.1464, "train_tokens_per_second": 362.554 }, { "epoch": 0.7966663105032589, "grad_norm": 3.0116360187530518, "learning_rate": 4.085653104925054e-06, "loss": 0.1657109558582306, "num_input_tokens_seen": 1915156, "step": 1864, "train_runtime": 5282.2726, "train_tokens_per_second": 362.563 }, { "epoch": 0.7970937065925847, "grad_norm": 2.0166096687316895, "learning_rate": 4.077087794432549e-06, "loss": 0.1979052871465683, "num_input_tokens_seen": 1916360, "step": 1865, "train_runtime": 5284.5024, "train_tokens_per_second": 362.638 }, { "epoch": 0.7975211026819105, "grad_norm": 1.8512609004974365, "learning_rate": 4.0685224839400435e-06, "loss": 0.13702967762947083, "num_input_tokens_seen": 1917328, "step": 1866, "train_runtime": 5286.6307, "train_tokens_per_second": 362.675 }, { "epoch": 0.7979484987712362, "grad_norm": 2.444591760635376, "learning_rate": 4.059957173447538e-06, "loss": 0.1925363689661026, "num_input_tokens_seen": 1918666, "step": 1867, "train_runtime": 5288.8454, "train_tokens_per_second": 362.776 }, { "epoch": 0.798375894860562, "grad_norm": 1.9154953956604004, "learning_rate": 4.051391862955032e-06, "loss": 0.15239262580871582, "num_input_tokens_seen": 1919910, "step": 1868, "train_runtime": 5291.1085, "train_tokens_per_second": 362.856 }, { "epoch": 0.7988032909498878, "grad_norm": 1.6387301683425903, "learning_rate": 4.042826552462527e-06, "loss": 0.1101214736700058, "num_input_tokens_seen": 1921020, "step": 1869, "train_runtime": 5293.2649, "train_tokens_per_second": 362.918 }, { "epoch": 0.7992306870392136, "grad_norm": 1.7504992485046387, "learning_rate": 4.034261241970021e-06, "loss": 0.0942070484161377, "num_input_tokens_seen": 1922298, "step": 1870, "train_runtime": 5295.6018, "train_tokens_per_second": 362.999 }, { "epoch": 0.7996580831285394, "grad_norm": 2.4301817417144775, "learning_rate": 4.0256959314775165e-06, "loss": 0.16983138024806976, "num_input_tokens_seen": 1923092, "step": 1871, "train_runtime": 5297.6959, "train_tokens_per_second": 363.005 }, { "epoch": 0.8000854792178651, "grad_norm": 2.7977640628814697, "learning_rate": 4.017130620985011e-06, "loss": 0.09143347293138504, "num_input_tokens_seen": 1923818, "step": 1872, "train_runtime": 5299.7722, "train_tokens_per_second": 363.0 }, { "epoch": 0.8000854792178651, "eval_loss": 0.4577138423919678, "eval_runtime": 58.0766, "eval_samples_per_second": 17.184, "eval_steps_per_second": 8.592, "num_input_tokens_seen": 1923818, "step": 1872 }, { "epoch": 0.800512875307191, "grad_norm": 1.8073036670684814, "learning_rate": 4.008565310492505e-06, "loss": 0.10531668365001678, "num_input_tokens_seen": 1924722, "step": 1873, "train_runtime": 5360.023, "train_tokens_per_second": 359.088 }, { "epoch": 0.8009402713965167, "grad_norm": 2.991727113723755, "learning_rate": 4.000000000000001e-06, "loss": 0.09558672457933426, "num_input_tokens_seen": 1925368, "step": 1874, "train_runtime": 5362.1103, "train_tokens_per_second": 359.069 }, { "epoch": 0.8013676674858425, "grad_norm": 3.7627313137054443, "learning_rate": 3.991434689507495e-06, "loss": 0.18142566084861755, "num_input_tokens_seen": 1925972, "step": 1875, "train_runtime": 5364.1913, "train_tokens_per_second": 359.042 }, { "epoch": 0.8017950635751683, "grad_norm": 1.7993855476379395, "learning_rate": 3.9828693790149895e-06, "loss": 0.09175600856542587, "num_input_tokens_seen": 1927012, "step": 1876, "train_runtime": 5366.3385, "train_tokens_per_second": 359.093 }, { "epoch": 0.8022224596644941, "grad_norm": 2.058553695678711, "learning_rate": 3.974304068522484e-06, "loss": 0.10975615680217743, "num_input_tokens_seen": 1928134, "step": 1877, "train_runtime": 5368.52, "train_tokens_per_second": 359.156 }, { "epoch": 0.8026498557538199, "grad_norm": 1.576220989227295, "learning_rate": 3.965738758029979e-06, "loss": 0.06837090849876404, "num_input_tokens_seen": 1928898, "step": 1878, "train_runtime": 5370.6173, "train_tokens_per_second": 359.158 }, { "epoch": 0.8030772518431456, "grad_norm": 1.130545735359192, "learning_rate": 3.957173447537474e-06, "loss": 0.049123615026474, "num_input_tokens_seen": 1930108, "step": 1879, "train_runtime": 5372.8182, "train_tokens_per_second": 359.236 }, { "epoch": 0.8035046479324714, "grad_norm": 1.6341276168823242, "learning_rate": 3.948608137044968e-06, "loss": 0.09082270413637161, "num_input_tokens_seen": 1931350, "step": 1880, "train_runtime": 5375.0433, "train_tokens_per_second": 359.318 }, { "epoch": 0.8039320440217972, "grad_norm": 1.8335726261138916, "learning_rate": 3.9400428265524625e-06, "loss": 0.06868286430835724, "num_input_tokens_seen": 1932190, "step": 1881, "train_runtime": 5377.1592, "train_tokens_per_second": 359.333 }, { "epoch": 0.804359440111123, "grad_norm": 2.3648762702941895, "learning_rate": 3.931477516059958e-06, "loss": 0.19874761998653412, "num_input_tokens_seen": 1933088, "step": 1882, "train_runtime": 5379.2778, "train_tokens_per_second": 359.358 }, { "epoch": 0.8047868362004488, "grad_norm": 1.859014630317688, "learning_rate": 3.922912205567452e-06, "loss": 0.2102784812450409, "num_input_tokens_seen": 1935796, "step": 1883, "train_runtime": 5381.8483, "train_tokens_per_second": 359.69 }, { "epoch": 0.8052142322897745, "grad_norm": 2.4291601181030273, "learning_rate": 3.914346895074947e-06, "loss": 0.1437801718711853, "num_input_tokens_seen": 1936758, "step": 1884, "train_runtime": 5384.0132, "train_tokens_per_second": 359.724 }, { "epoch": 0.8056416283791004, "grad_norm": 3.8971290588378906, "learning_rate": 3.905781584582441e-06, "loss": 0.15766066312789917, "num_input_tokens_seen": 1937432, "step": 1885, "train_runtime": 5386.0703, "train_tokens_per_second": 359.712 }, { "epoch": 0.8060690244684261, "grad_norm": 2.332448720932007, "learning_rate": 3.897216274089936e-06, "loss": 0.1089940220117569, "num_input_tokens_seen": 1938202, "step": 1886, "train_runtime": 5388.2062, "train_tokens_per_second": 359.712 }, { "epoch": 0.806496420557752, "grad_norm": 2.3610904216766357, "learning_rate": 3.888650963597431e-06, "loss": 0.11087067425251007, "num_input_tokens_seen": 1939054, "step": 1887, "train_runtime": 5390.2944, "train_tokens_per_second": 359.731 }, { "epoch": 0.8069238166470777, "grad_norm": 1.648154377937317, "learning_rate": 3.880085653104925e-06, "loss": 0.08698208630084991, "num_input_tokens_seen": 1940562, "step": 1888, "train_runtime": 5392.5742, "train_tokens_per_second": 359.858 }, { "epoch": 0.8073512127364034, "grad_norm": 1.6215620040893555, "learning_rate": 3.87152034261242e-06, "loss": 0.09862314164638519, "num_input_tokens_seen": 1941642, "step": 1889, "train_runtime": 5394.7575, "train_tokens_per_second": 359.913 }, { "epoch": 0.8077786088257293, "grad_norm": 1.7662047147750854, "learning_rate": 3.862955032119914e-06, "loss": 0.11273685097694397, "num_input_tokens_seen": 1942750, "step": 1890, "train_runtime": 5396.9141, "train_tokens_per_second": 359.974 }, { "epoch": 0.808206004915055, "grad_norm": 1.47037672996521, "learning_rate": 3.854389721627409e-06, "loss": 0.08050605654716492, "num_input_tokens_seen": 1943888, "step": 1891, "train_runtime": 5412.0437, "train_tokens_per_second": 359.178 }, { "epoch": 0.8086334010043809, "grad_norm": 2.382103443145752, "learning_rate": 3.845824411134904e-06, "loss": 0.08305542171001434, "num_input_tokens_seen": 1944556, "step": 1892, "train_runtime": 5414.1535, "train_tokens_per_second": 359.162 }, { "epoch": 0.8090607970937066, "grad_norm": 3.229339361190796, "learning_rate": 3.837259100642399e-06, "loss": 0.08750642091035843, "num_input_tokens_seen": 1945294, "step": 1893, "train_runtime": 5416.2359, "train_tokens_per_second": 359.16 }, { "epoch": 0.8094881931830323, "grad_norm": 2.682495355606079, "learning_rate": 3.8286937901498935e-06, "loss": 0.16248637437820435, "num_input_tokens_seen": 1946162, "step": 1894, "train_runtime": 5418.3903, "train_tokens_per_second": 359.177 }, { "epoch": 0.8099155892723582, "grad_norm": 2.433453321456909, "learning_rate": 3.820128479657388e-06, "loss": 0.12479268014431, "num_input_tokens_seen": 1946952, "step": 1895, "train_runtime": 5420.4558, "train_tokens_per_second": 359.186 }, { "epoch": 0.8103429853616839, "grad_norm": 1.9988194704055786, "learning_rate": 3.8115631691648823e-06, "loss": 0.1043507307767868, "num_input_tokens_seen": 1947842, "step": 1896, "train_runtime": 5422.5794, "train_tokens_per_second": 359.209 }, { "epoch": 0.8107703814510098, "grad_norm": 3.0528292655944824, "learning_rate": 3.802997858672377e-06, "loss": 0.21311679482460022, "num_input_tokens_seen": 1948972, "step": 1897, "train_runtime": 5424.764, "train_tokens_per_second": 359.273 }, { "epoch": 0.8111977775403355, "grad_norm": 2.026343822479248, "learning_rate": 3.7944325481798716e-06, "loss": 0.07802553474903107, "num_input_tokens_seen": 1949854, "step": 1898, "train_runtime": 5426.8848, "train_tokens_per_second": 359.295 }, { "epoch": 0.8116251736296612, "grad_norm": 2.479752540588379, "learning_rate": 3.785867237687367e-06, "loss": 0.14262475073337555, "num_input_tokens_seen": 1950624, "step": 1899, "train_runtime": 5429.0351, "train_tokens_per_second": 359.295 }, { "epoch": 0.8120525697189871, "grad_norm": 1.9532415866851807, "learning_rate": 3.7773019271948613e-06, "loss": 0.11800507456064224, "num_input_tokens_seen": 1951642, "step": 1900, "train_runtime": 5431.2031, "train_tokens_per_second": 359.339 }, { "epoch": 0.8124799658083128, "grad_norm": 1.5504400730133057, "learning_rate": 3.7687366167023558e-06, "loss": 0.07501030713319778, "num_input_tokens_seen": 1952558, "step": 1901, "train_runtime": 5433.3849, "train_tokens_per_second": 359.363 }, { "epoch": 0.8129073618976387, "grad_norm": 1.9876056909561157, "learning_rate": 3.7601713062098506e-06, "loss": 0.14619901776313782, "num_input_tokens_seen": 1953702, "step": 1902, "train_runtime": 5435.6817, "train_tokens_per_second": 359.422 }, { "epoch": 0.8133347579869644, "grad_norm": 2.68910551071167, "learning_rate": 3.751605995717345e-06, "loss": 0.0984867513179779, "num_input_tokens_seen": 1954534, "step": 1903, "train_runtime": 5437.8178, "train_tokens_per_second": 359.434 }, { "epoch": 0.8137621540762902, "grad_norm": 3.058347702026367, "learning_rate": 3.7430406852248395e-06, "loss": 0.0885990709066391, "num_input_tokens_seen": 1955774, "step": 1904, "train_runtime": 5440.0504, "train_tokens_per_second": 359.514 }, { "epoch": 0.814189550165616, "grad_norm": 1.8561577796936035, "learning_rate": 3.7344753747323343e-06, "loss": 0.09684539586305618, "num_input_tokens_seen": 1956976, "step": 1905, "train_runtime": 5442.2427, "train_tokens_per_second": 359.59 }, { "epoch": 0.8146169462549417, "grad_norm": 2.643442392349243, "learning_rate": 3.7259100642398288e-06, "loss": 0.1766364425420761, "num_input_tokens_seen": 1957994, "step": 1906, "train_runtime": 5444.4087, "train_tokens_per_second": 359.634 }, { "epoch": 0.8150443423442676, "grad_norm": 2.634895086288452, "learning_rate": 3.717344753747323e-06, "loss": 0.1421157717704773, "num_input_tokens_seen": 1958802, "step": 1907, "train_runtime": 5446.536, "train_tokens_per_second": 359.642 }, { "epoch": 0.8154717384335933, "grad_norm": 1.751813530921936, "learning_rate": 3.7087794432548185e-06, "loss": 0.09633848071098328, "num_input_tokens_seen": 1960204, "step": 1908, "train_runtime": 5448.8213, "train_tokens_per_second": 359.748 }, { "epoch": 0.8158991345229191, "grad_norm": 1.63231360912323, "learning_rate": 3.7002141327623133e-06, "loss": 0.13464833796024323, "num_input_tokens_seen": 1961966, "step": 1909, "train_runtime": 5451.1577, "train_tokens_per_second": 359.917 }, { "epoch": 0.8163265306122449, "grad_norm": 1.863640308380127, "learning_rate": 3.6916488222698077e-06, "loss": 0.11301255226135254, "num_input_tokens_seen": 1963052, "step": 1910, "train_runtime": 5453.4013, "train_tokens_per_second": 359.968 }, { "epoch": 0.8167539267015707, "grad_norm": 3.2735648155212402, "learning_rate": 3.683083511777302e-06, "loss": 0.22603464126586914, "num_input_tokens_seen": 1963950, "step": 1911, "train_runtime": 5455.5012, "train_tokens_per_second": 359.994 }, { "epoch": 0.8171813227908965, "grad_norm": 1.9915646314620972, "learning_rate": 3.674518201284797e-06, "loss": 0.10916484892368317, "num_input_tokens_seen": 1964986, "step": 1912, "train_runtime": 5457.6465, "train_tokens_per_second": 360.043 }, { "epoch": 0.8176087188802222, "grad_norm": 2.7903940677642822, "learning_rate": 3.6659528907922915e-06, "loss": 0.16169843077659607, "num_input_tokens_seen": 1966226, "step": 1913, "train_runtime": 5459.9433, "train_tokens_per_second": 360.118 }, { "epoch": 0.818036114969548, "grad_norm": 2.9514753818511963, "learning_rate": 3.657387580299786e-06, "loss": 0.17525459825992584, "num_input_tokens_seen": 1967028, "step": 1914, "train_runtime": 5462.0781, "train_tokens_per_second": 360.124 }, { "epoch": 0.8184635110588738, "grad_norm": 2.1054723262786865, "learning_rate": 3.6488222698072807e-06, "loss": 0.13563019037246704, "num_input_tokens_seen": 1967974, "step": 1915, "train_runtime": 5464.2255, "train_tokens_per_second": 360.156 }, { "epoch": 0.8188909071481996, "grad_norm": 2.5213427543640137, "learning_rate": 3.640256959314775e-06, "loss": 0.14794062077999115, "num_input_tokens_seen": 1968914, "step": 1916, "train_runtime": 5466.3833, "train_tokens_per_second": 360.186 }, { "epoch": 0.8193183032375254, "grad_norm": 2.4679834842681885, "learning_rate": 3.6316916488222704e-06, "loss": 0.12253215163946152, "num_input_tokens_seen": 1969620, "step": 1917, "train_runtime": 5468.4742, "train_tokens_per_second": 360.177 }, { "epoch": 0.8197456993268512, "grad_norm": 1.776869535446167, "learning_rate": 3.623126338329765e-06, "loss": 0.1365637481212616, "num_input_tokens_seen": 1970726, "step": 1918, "train_runtime": 5470.6382, "train_tokens_per_second": 360.237 }, { "epoch": 0.8201730954161769, "grad_norm": 2.0742247104644775, "learning_rate": 3.6145610278372593e-06, "loss": 0.0735405758023262, "num_input_tokens_seen": 1971684, "step": 1919, "train_runtime": 5472.7816, "train_tokens_per_second": 360.271 }, { "epoch": 0.8206004915055027, "grad_norm": 2.545654773712158, "learning_rate": 3.605995717344754e-06, "loss": 0.14871400594711304, "num_input_tokens_seen": 1972462, "step": 1920, "train_runtime": 5474.8597, "train_tokens_per_second": 360.276 }, { "epoch": 0.8210278875948285, "grad_norm": 2.4054129123687744, "learning_rate": 3.5974304068522486e-06, "loss": 0.12270691245794296, "num_input_tokens_seen": 1973296, "step": 1921, "train_runtime": 5490.2025, "train_tokens_per_second": 359.421 }, { "epoch": 0.8214552836841543, "grad_norm": 3.4451773166656494, "learning_rate": 3.588865096359743e-06, "loss": 0.18050611019134521, "num_input_tokens_seen": 1974076, "step": 1922, "train_runtime": 5492.3176, "train_tokens_per_second": 359.425 }, { "epoch": 0.8218826797734801, "grad_norm": 1.751175880432129, "learning_rate": 3.580299785867238e-06, "loss": 0.07729603350162506, "num_input_tokens_seen": 1975028, "step": 1923, "train_runtime": 5494.4326, "train_tokens_per_second": 359.46 }, { "epoch": 0.8223100758628058, "grad_norm": 2.5249335765838623, "learning_rate": 3.5717344753747323e-06, "loss": 0.1707269698381424, "num_input_tokens_seen": 1975864, "step": 1924, "train_runtime": 5496.5142, "train_tokens_per_second": 359.476 }, { "epoch": 0.8227374719521316, "grad_norm": 2.40442156791687, "learning_rate": 3.5631691648822276e-06, "loss": 0.11481206864118576, "num_input_tokens_seen": 1976524, "step": 1925, "train_runtime": 5498.5753, "train_tokens_per_second": 359.461 }, { "epoch": 0.8231648680414574, "grad_norm": 2.9006872177124023, "learning_rate": 3.554603854389722e-06, "loss": 0.17662584781646729, "num_input_tokens_seen": 1977354, "step": 1926, "train_runtime": 5500.6917, "train_tokens_per_second": 359.474 }, { "epoch": 0.8235922641307832, "grad_norm": 1.889539122581482, "learning_rate": 3.546038543897217e-06, "loss": 0.13440728187561035, "num_input_tokens_seen": 1978830, "step": 1927, "train_runtime": 5503.0822, "train_tokens_per_second": 359.586 }, { "epoch": 0.824019660220109, "grad_norm": 2.9623191356658936, "learning_rate": 3.5374732334047113e-06, "loss": 0.11516458541154861, "num_input_tokens_seen": 1979576, "step": 1928, "train_runtime": 5505.2449, "train_tokens_per_second": 359.58 }, { "epoch": 0.8244470563094348, "grad_norm": 1.811000943183899, "learning_rate": 3.5289079229122057e-06, "loss": 0.15179359912872314, "num_input_tokens_seen": 1980932, "step": 1929, "train_runtime": 5507.4519, "train_tokens_per_second": 359.682 }, { "epoch": 0.8248744523987606, "grad_norm": 1.5050638914108276, "learning_rate": 3.5203426124197006e-06, "loss": 0.08498916029930115, "num_input_tokens_seen": 1982492, "step": 1930, "train_runtime": 5509.7553, "train_tokens_per_second": 359.815 }, { "epoch": 0.8253018484880863, "grad_norm": 2.768526077270508, "learning_rate": 3.511777301927195e-06, "loss": 0.19065095484256744, "num_input_tokens_seen": 1983864, "step": 1931, "train_runtime": 5511.9986, "train_tokens_per_second": 359.917 }, { "epoch": 0.8257292445774121, "grad_norm": 1.8834972381591797, "learning_rate": 3.5032119914346894e-06, "loss": 0.1330108344554901, "num_input_tokens_seen": 1985584, "step": 1932, "train_runtime": 5514.3368, "train_tokens_per_second": 360.077 }, { "epoch": 0.8261566406667379, "grad_norm": 2.301549196243286, "learning_rate": 3.4946466809421843e-06, "loss": 0.1241963803768158, "num_input_tokens_seen": 1986526, "step": 1933, "train_runtime": 5516.5107, "train_tokens_per_second": 360.106 }, { "epoch": 0.8265840367560637, "grad_norm": 2.294839382171631, "learning_rate": 3.486081370449679e-06, "loss": 0.09651590138673782, "num_input_tokens_seen": 1987252, "step": 1934, "train_runtime": 5518.6179, "train_tokens_per_second": 360.1 }, { "epoch": 0.8270114328453895, "grad_norm": 1.1531141996383667, "learning_rate": 3.477516059957174e-06, "loss": 0.04034721478819847, "num_input_tokens_seen": 1988562, "step": 1935, "train_runtime": 5520.8389, "train_tokens_per_second": 360.192 }, { "epoch": 0.8274388289347152, "grad_norm": 2.2977030277252197, "learning_rate": 3.4689507494646684e-06, "loss": 0.19051678478717804, "num_input_tokens_seen": 1989806, "step": 1936, "train_runtime": 5523.0563, "train_tokens_per_second": 360.273 }, { "epoch": 0.8278662250240411, "grad_norm": 1.8183130025863647, "learning_rate": 3.460385438972163e-06, "loss": 0.09287313371896744, "num_input_tokens_seen": 1990762, "step": 1937, "train_runtime": 5525.1933, "train_tokens_per_second": 360.306 }, { "epoch": 0.8282936211133668, "grad_norm": 1.7915457487106323, "learning_rate": 3.4518201284796577e-06, "loss": 0.11767736822366714, "num_input_tokens_seen": 1991992, "step": 1938, "train_runtime": 5527.3953, "train_tokens_per_second": 360.385 }, { "epoch": 0.8287210172026926, "grad_norm": 3.786351442337036, "learning_rate": 3.443254817987152e-06, "loss": 0.17700961232185364, "num_input_tokens_seen": 1993564, "step": 1939, "train_runtime": 5529.68, "train_tokens_per_second": 360.521 }, { "epoch": 0.8291484132920184, "grad_norm": 2.642591714859009, "learning_rate": 3.434689507494647e-06, "loss": 0.1346561759710312, "num_input_tokens_seen": 1994270, "step": 1940, "train_runtime": 5531.8105, "train_tokens_per_second": 360.509 }, { "epoch": 0.8295758093813441, "grad_norm": 3.820016622543335, "learning_rate": 3.4261241970021414e-06, "loss": 0.1595134437084198, "num_input_tokens_seen": 1995102, "step": 1941, "train_runtime": 5533.9409, "train_tokens_per_second": 360.521 }, { "epoch": 0.83000320547067, "grad_norm": 1.5686699151992798, "learning_rate": 3.4175588865096367e-06, "loss": 0.05472077429294586, "num_input_tokens_seen": 1996254, "step": 1942, "train_runtime": 5536.179, "train_tokens_per_second": 360.583 }, { "epoch": 0.8304306015599957, "grad_norm": 2.135924816131592, "learning_rate": 3.408993576017131e-06, "loss": 0.1282147765159607, "num_input_tokens_seen": 1997454, "step": 1943, "train_runtime": 5538.3609, "train_tokens_per_second": 360.658 }, { "epoch": 0.8308579976493216, "grad_norm": 2.1747469902038574, "learning_rate": 3.4004282655246255e-06, "loss": 0.08299367874860764, "num_input_tokens_seen": 1998452, "step": 1944, "train_runtime": 5540.5055, "train_tokens_per_second": 360.698 }, { "epoch": 0.8312853937386473, "grad_norm": 1.5561304092407227, "learning_rate": 3.3918629550321204e-06, "loss": 0.1040833592414856, "num_input_tokens_seen": 1999622, "step": 1945, "train_runtime": 5542.6835, "train_tokens_per_second": 360.768 }, { "epoch": 0.831712789827973, "grad_norm": 2.59633207321167, "learning_rate": 3.383297644539615e-06, "loss": 0.12334547191858292, "num_input_tokens_seen": 2000404, "step": 1946, "train_runtime": 5544.7677, "train_tokens_per_second": 360.773 }, { "epoch": 0.8321401859172989, "grad_norm": 2.10723876953125, "learning_rate": 3.3747323340471093e-06, "loss": 0.1401161551475525, "num_input_tokens_seen": 2001258, "step": 1947, "train_runtime": 5546.8846, "train_tokens_per_second": 360.79 }, { "epoch": 0.8325675820066246, "grad_norm": 2.798142671585083, "learning_rate": 3.366167023554604e-06, "loss": 0.2505949139595032, "num_input_tokens_seen": 2002180, "step": 1948, "train_runtime": 5549.0155, "train_tokens_per_second": 360.817 }, { "epoch": 0.8329949780959505, "grad_norm": 1.9741570949554443, "learning_rate": 3.3576017130620985e-06, "loss": 0.13103649020195007, "num_input_tokens_seen": 2003156, "step": 1949, "train_runtime": 5551.1248, "train_tokens_per_second": 360.856 }, { "epoch": 0.8334223741852762, "grad_norm": 2.568838119506836, "learning_rate": 3.349036402569593e-06, "loss": 0.08399426937103271, "num_input_tokens_seen": 2003902, "step": 1950, "train_runtime": 5553.1775, "train_tokens_per_second": 360.857 }, { "epoch": 0.8338497702746019, "grad_norm": 1.6990511417388916, "learning_rate": 3.3404710920770882e-06, "loss": 0.08365393429994583, "num_input_tokens_seen": 2004806, "step": 1951, "train_runtime": 5568.9756, "train_tokens_per_second": 359.995 }, { "epoch": 0.8342771663639278, "grad_norm": 3.738248109817505, "learning_rate": 3.3319057815845827e-06, "loss": 0.15475615859031677, "num_input_tokens_seen": 2005616, "step": 1952, "train_runtime": 5571.0983, "train_tokens_per_second": 360.004 }, { "epoch": 0.8347045624532535, "grad_norm": 1.6488298177719116, "learning_rate": 3.3233404710920775e-06, "loss": 0.07455479353666306, "num_input_tokens_seen": 2006428, "step": 1953, "train_runtime": 5573.2152, "train_tokens_per_second": 360.013 }, { "epoch": 0.8351319585425794, "grad_norm": 1.582184910774231, "learning_rate": 3.314775160599572e-06, "loss": 0.09235035628080368, "num_input_tokens_seen": 2007744, "step": 1954, "train_runtime": 5575.4356, "train_tokens_per_second": 360.105 }, { "epoch": 0.8355593546319051, "grad_norm": 1.3333709239959717, "learning_rate": 3.306209850107067e-06, "loss": 0.07065054774284363, "num_input_tokens_seen": 2008740, "step": 1955, "train_runtime": 5577.5599, "train_tokens_per_second": 360.147 }, { "epoch": 0.8359867507212309, "grad_norm": 4.119487762451172, "learning_rate": 3.2976445396145612e-06, "loss": 0.2738707661628723, "num_input_tokens_seen": 2009954, "step": 1956, "train_runtime": 5579.756, "train_tokens_per_second": 360.223 }, { "epoch": 0.8364141468105567, "grad_norm": 2.1321792602539062, "learning_rate": 3.2890792291220557e-06, "loss": 0.12480825930833817, "num_input_tokens_seen": 2010976, "step": 1957, "train_runtime": 5581.8989, "train_tokens_per_second": 360.267 }, { "epoch": 0.8368415428998824, "grad_norm": 2.774042844772339, "learning_rate": 3.2805139186295505e-06, "loss": 0.1823635995388031, "num_input_tokens_seen": 2011758, "step": 1958, "train_runtime": 5583.9833, "train_tokens_per_second": 360.273 }, { "epoch": 0.8372689389892083, "grad_norm": 2.230194091796875, "learning_rate": 3.2719486081370454e-06, "loss": 0.12755286693572998, "num_input_tokens_seen": 2012714, "step": 1959, "train_runtime": 5586.1008, "train_tokens_per_second": 360.307 }, { "epoch": 0.837696335078534, "grad_norm": 3.305572271347046, "learning_rate": 3.2633832976445402e-06, "loss": 0.13548028469085693, "num_input_tokens_seen": 2013502, "step": 1960, "train_runtime": 5588.2134, "train_tokens_per_second": 360.312 }, { "epoch": 0.8381237311678598, "grad_norm": 4.4020233154296875, "learning_rate": 3.2548179871520347e-06, "loss": 0.25181007385253906, "num_input_tokens_seen": 2014448, "step": 1961, "train_runtime": 5590.3795, "train_tokens_per_second": 360.342 }, { "epoch": 0.8385511272571856, "grad_norm": 1.438114881515503, "learning_rate": 3.246252676659529e-06, "loss": 0.09947221726179123, "num_input_tokens_seen": 2016488, "step": 1962, "train_runtime": 5592.8357, "train_tokens_per_second": 360.548 }, { "epoch": 0.8389785233465114, "grad_norm": 2.17861270904541, "learning_rate": 3.237687366167024e-06, "loss": 0.14272168278694153, "num_input_tokens_seen": 2017248, "step": 1963, "train_runtime": 5594.9139, "train_tokens_per_second": 360.55 }, { "epoch": 0.8394059194358372, "grad_norm": 2.0156331062316895, "learning_rate": 3.2291220556745184e-06, "loss": 0.06648299098014832, "num_input_tokens_seen": 2018118, "step": 1964, "train_runtime": 5597.1167, "train_tokens_per_second": 360.564 }, { "epoch": 0.8398333155251629, "grad_norm": 1.8698487281799316, "learning_rate": 3.220556745182013e-06, "loss": 0.1292165368795395, "num_input_tokens_seen": 2019514, "step": 1965, "train_runtime": 5599.3435, "train_tokens_per_second": 360.67 }, { "epoch": 0.8402607116144887, "grad_norm": 2.215479850769043, "learning_rate": 3.2119914346895077e-06, "loss": 0.15700754523277283, "num_input_tokens_seen": 2020222, "step": 1966, "train_runtime": 5601.5094, "train_tokens_per_second": 360.657 }, { "epoch": 0.8406881077038145, "grad_norm": 2.4758799076080322, "learning_rate": 3.203426124197002e-06, "loss": 0.1802935004234314, "num_input_tokens_seen": 2021242, "step": 1967, "train_runtime": 5603.6754, "train_tokens_per_second": 360.699 }, { "epoch": 0.8411155037931403, "grad_norm": 1.9556485414505005, "learning_rate": 3.1948608137044974e-06, "loss": 0.15662522614002228, "num_input_tokens_seen": 2022708, "step": 1968, "train_runtime": 5605.9581, "train_tokens_per_second": 360.814 }, { "epoch": 0.8415428998824661, "grad_norm": 1.730168104171753, "learning_rate": 3.186295503211992e-06, "loss": 0.08212494105100632, "num_input_tokens_seen": 2023718, "step": 1969, "train_runtime": 5608.0682, "train_tokens_per_second": 360.858 }, { "epoch": 0.8419702959717918, "grad_norm": 1.631124496459961, "learning_rate": 3.1777301927194866e-06, "loss": 0.11376766860485077, "num_input_tokens_seen": 2025154, "step": 1970, "train_runtime": 5610.2783, "train_tokens_per_second": 360.972 }, { "epoch": 0.8423976920611176, "grad_norm": 1.3239309787750244, "learning_rate": 3.169164882226981e-06, "loss": 0.08785051107406616, "num_input_tokens_seen": 2026996, "step": 1971, "train_runtime": 5612.6482, "train_tokens_per_second": 361.148 }, { "epoch": 0.8428250881504434, "grad_norm": 2.9183361530303955, "learning_rate": 3.1605995717344755e-06, "loss": 0.135522723197937, "num_input_tokens_seen": 2027706, "step": 1972, "train_runtime": 5614.6946, "train_tokens_per_second": 361.143 }, { "epoch": 0.8432524842397692, "grad_norm": 1.8889797925949097, "learning_rate": 3.1520342612419704e-06, "loss": 0.12959235906600952, "num_input_tokens_seen": 2028652, "step": 1973, "train_runtime": 5616.8256, "train_tokens_per_second": 361.174 }, { "epoch": 0.843679880329095, "grad_norm": 2.1443357467651367, "learning_rate": 3.1434689507494648e-06, "loss": 0.11393402516841888, "num_input_tokens_seen": 2029382, "step": 1974, "train_runtime": 5618.9072, "train_tokens_per_second": 361.17 }, { "epoch": 0.8441072764184208, "grad_norm": 1.8804446458816528, "learning_rate": 3.1349036402569592e-06, "loss": 0.09005725383758545, "num_input_tokens_seen": 2030350, "step": 1975, "train_runtime": 5621.0122, "train_tokens_per_second": 361.207 }, { "epoch": 0.8445346725077466, "grad_norm": 2.9914989471435547, "learning_rate": 3.126338329764454e-06, "loss": 0.1515377312898636, "num_input_tokens_seen": 2031440, "step": 1976, "train_runtime": 5623.1773, "train_tokens_per_second": 361.262 }, { "epoch": 0.8449620685970723, "grad_norm": 1.6609055995941162, "learning_rate": 3.117773019271949e-06, "loss": 0.09417612105607986, "num_input_tokens_seen": 2032804, "step": 1977, "train_runtime": 5625.3772, "train_tokens_per_second": 361.363 }, { "epoch": 0.8453894646863981, "grad_norm": 1.6197657585144043, "learning_rate": 3.1092077087794438e-06, "loss": 0.07073154300451279, "num_input_tokens_seen": 2033780, "step": 1978, "train_runtime": 5627.4811, "train_tokens_per_second": 361.401 }, { "epoch": 0.8458168607757239, "grad_norm": 1.8534493446350098, "learning_rate": 3.100642398286938e-06, "loss": 0.09149038791656494, "num_input_tokens_seen": 2034834, "step": 1979, "train_runtime": 5629.617, "train_tokens_per_second": 361.452 }, { "epoch": 0.8462442568650497, "grad_norm": 1.1798967123031616, "learning_rate": 3.0920770877944326e-06, "loss": 0.07325664907693863, "num_input_tokens_seen": 2036680, "step": 1980, "train_runtime": 5631.995, "train_tokens_per_second": 361.627 }, { "epoch": 0.8466716529543755, "grad_norm": 1.6230262517929077, "learning_rate": 3.0835117773019275e-06, "loss": 0.08121328800916672, "num_input_tokens_seen": 2039644, "step": 1981, "train_runtime": 5648.0993, "train_tokens_per_second": 361.12 }, { "epoch": 0.8470990490437013, "grad_norm": 1.933571457862854, "learning_rate": 3.074946466809422e-06, "loss": 0.11390797793865204, "num_input_tokens_seen": 2040578, "step": 1982, "train_runtime": 5650.1997, "train_tokens_per_second": 361.151 }, { "epoch": 0.847526445133027, "grad_norm": 2.425217866897583, "learning_rate": 3.0663811563169168e-06, "loss": 0.185648113489151, "num_input_tokens_seen": 2041474, "step": 1983, "train_runtime": 5652.3387, "train_tokens_per_second": 361.173 }, { "epoch": 0.8479538412223528, "grad_norm": 2.0624728202819824, "learning_rate": 3.057815845824411e-06, "loss": 0.09377612173557281, "num_input_tokens_seen": 2042394, "step": 1984, "train_runtime": 5654.5102, "train_tokens_per_second": 361.197 }, { "epoch": 0.8483812373116786, "grad_norm": 1.5336378812789917, "learning_rate": 3.0492505353319065e-06, "loss": 0.06787379831075668, "num_input_tokens_seen": 2043502, "step": 1985, "train_runtime": 5656.6937, "train_tokens_per_second": 361.254 }, { "epoch": 0.8488086334010044, "grad_norm": 1.3267147541046143, "learning_rate": 3.040685224839401e-06, "loss": 0.0803186297416687, "num_input_tokens_seen": 2044812, "step": 1986, "train_runtime": 5658.8834, "train_tokens_per_second": 361.345 }, { "epoch": 0.8492360294903302, "grad_norm": 2.1181395053863525, "learning_rate": 3.0321199143468953e-06, "loss": 0.14673547446727753, "num_input_tokens_seen": 2046186, "step": 1987, "train_runtime": 5661.1104, "train_tokens_per_second": 361.446 }, { "epoch": 0.8496634255796559, "grad_norm": 1.649976372718811, "learning_rate": 3.02355460385439e-06, "loss": 0.0759081244468689, "num_input_tokens_seen": 2047098, "step": 1988, "train_runtime": 5663.2299, "train_tokens_per_second": 361.472 }, { "epoch": 0.8500908216689818, "grad_norm": 2.7502894401550293, "learning_rate": 3.0149892933618846e-06, "loss": 0.13762880861759186, "num_input_tokens_seen": 2047874, "step": 1989, "train_runtime": 5665.3097, "train_tokens_per_second": 361.476 }, { "epoch": 0.8505182177583075, "grad_norm": 2.585418462753296, "learning_rate": 3.006423982869379e-06, "loss": 0.12399157881736755, "num_input_tokens_seen": 2048806, "step": 1990, "train_runtime": 5667.4303, "train_tokens_per_second": 361.505 }, { "epoch": 0.8509456138476333, "grad_norm": 2.424391508102417, "learning_rate": 2.997858672376874e-06, "loss": 0.13105568289756775, "num_input_tokens_seen": 2049882, "step": 1991, "train_runtime": 5669.606, "train_tokens_per_second": 361.556 }, { "epoch": 0.8513730099369591, "grad_norm": 2.692779779434204, "learning_rate": 2.9892933618843683e-06, "loss": 0.1243579089641571, "num_input_tokens_seen": 2050772, "step": 1992, "train_runtime": 5671.7248, "train_tokens_per_second": 361.578 }, { "epoch": 0.8518004060262848, "grad_norm": 1.901049017906189, "learning_rate": 2.9807280513918628e-06, "loss": 0.10940186679363251, "num_input_tokens_seen": 2051666, "step": 1993, "train_runtime": 5673.9587, "train_tokens_per_second": 361.593 }, { "epoch": 0.8522278021156107, "grad_norm": 2.4834864139556885, "learning_rate": 2.972162740899358e-06, "loss": 0.09155414253473282, "num_input_tokens_seen": 2052266, "step": 1994, "train_runtime": 5676.0733, "train_tokens_per_second": 361.564 }, { "epoch": 0.8526551982049364, "grad_norm": 1.8906586170196533, "learning_rate": 2.9635974304068525e-06, "loss": 0.12932683527469635, "num_input_tokens_seen": 2053472, "step": 1995, "train_runtime": 5678.3053, "train_tokens_per_second": 361.635 }, { "epoch": 0.8530825942942623, "grad_norm": 2.9802510738372803, "learning_rate": 2.9550321199143473e-06, "loss": 0.1381813883781433, "num_input_tokens_seen": 2054212, "step": 1996, "train_runtime": 5680.3911, "train_tokens_per_second": 361.632 }, { "epoch": 0.853509990383588, "grad_norm": 2.6141984462738037, "learning_rate": 2.9464668094218417e-06, "loss": 0.1583455502986908, "num_input_tokens_seen": 2055748, "step": 1997, "train_runtime": 5682.7069, "train_tokens_per_second": 361.755 }, { "epoch": 0.8539373864729137, "grad_norm": 1.8345046043395996, "learning_rate": 2.9379014989293366e-06, "loss": 0.07994143664836884, "num_input_tokens_seen": 2056428, "step": 1998, "train_runtime": 5684.7894, "train_tokens_per_second": 361.742 }, { "epoch": 0.8543647825622396, "grad_norm": 2.0560882091522217, "learning_rate": 2.929336188436831e-06, "loss": 0.10118348151445389, "num_input_tokens_seen": 2057386, "step": 1999, "train_runtime": 5686.9235, "train_tokens_per_second": 361.775 }, { "epoch": 0.8547921786515653, "grad_norm": 1.4362705945968628, "learning_rate": 2.9207708779443255e-06, "loss": 0.07624168694019318, "num_input_tokens_seen": 2058680, "step": 2000, "train_runtime": 5689.1043, "train_tokens_per_second": 361.864 }, { "epoch": 0.8552195747408912, "grad_norm": 0.8738347887992859, "learning_rate": 2.9122055674518203e-06, "loss": 0.035955920815467834, "num_input_tokens_seen": 2060918, "step": 2001, "train_runtime": 5691.6211, "train_tokens_per_second": 362.097 }, { "epoch": 0.8556469708302169, "grad_norm": 1.7071946859359741, "learning_rate": 2.903640256959315e-06, "loss": 0.043835729360580444, "num_input_tokens_seen": 2061456, "step": 2002, "train_runtime": 5693.6349, "train_tokens_per_second": 362.063 }, { "epoch": 0.8560743669195426, "grad_norm": 2.7414908409118652, "learning_rate": 2.89507494646681e-06, "loss": 0.10991692543029785, "num_input_tokens_seen": 2062118, "step": 2003, "train_runtime": 5695.7114, "train_tokens_per_second": 362.047 }, { "epoch": 0.8565017630088685, "grad_norm": 2.1727988719940186, "learning_rate": 2.8865096359743044e-06, "loss": 0.17784272134304047, "num_input_tokens_seen": 2063172, "step": 2004, "train_runtime": 5697.8479, "train_tokens_per_second": 362.097 }, { "epoch": 0.8569291590981942, "grad_norm": 1.9930412769317627, "learning_rate": 2.877944325481799e-06, "loss": 0.09805138409137726, "num_input_tokens_seen": 2064226, "step": 2005, "train_runtime": 5700.0082, "train_tokens_per_second": 362.144 }, { "epoch": 0.8573565551875201, "grad_norm": 2.333526849746704, "learning_rate": 2.8693790149892937e-06, "loss": 0.09461706876754761, "num_input_tokens_seen": 2064842, "step": 2006, "train_runtime": 5702.0422, "train_tokens_per_second": 362.123 }, { "epoch": 0.8577839512768458, "grad_norm": 2.2634665966033936, "learning_rate": 2.860813704496788e-06, "loss": 0.12293541431427002, "num_input_tokens_seen": 2065954, "step": 2007, "train_runtime": 5704.2333, "train_tokens_per_second": 362.179 }, { "epoch": 0.8582113473661716, "grad_norm": 1.9334956407546997, "learning_rate": 2.8522483940042826e-06, "loss": 0.13911227881908417, "num_input_tokens_seen": 2067154, "step": 2008, "train_runtime": 5706.4313, "train_tokens_per_second": 362.25 }, { "epoch": 0.8586387434554974, "grad_norm": 2.7667911052703857, "learning_rate": 2.8436830835117774e-06, "loss": 0.13113465905189514, "num_input_tokens_seen": 2067810, "step": 2009, "train_runtime": 5708.4672, "train_tokens_per_second": 362.236 }, { "epoch": 0.8590661395448231, "grad_norm": 1.5218790769577026, "learning_rate": 2.835117773019272e-06, "loss": 0.08512908220291138, "num_input_tokens_seen": 2068922, "step": 2010, "train_runtime": 5710.6242, "train_tokens_per_second": 362.293 }, { "epoch": 0.859493535634149, "grad_norm": 2.288893938064575, "learning_rate": 2.826552462526767e-06, "loss": 0.10153042525053024, "num_input_tokens_seen": 2069696, "step": 2011, "train_runtime": 5725.5078, "train_tokens_per_second": 361.487 }, { "epoch": 0.8599209317234747, "grad_norm": 2.8751845359802246, "learning_rate": 2.8179871520342616e-06, "loss": 0.17081843316555023, "num_input_tokens_seen": 2070610, "step": 2012, "train_runtime": 5727.7185, "train_tokens_per_second": 361.507 }, { "epoch": 0.8603483278128005, "grad_norm": 1.7815607786178589, "learning_rate": 2.8094218415417564e-06, "loss": 0.09744273126125336, "num_input_tokens_seen": 2071972, "step": 2013, "train_runtime": 5730.1163, "train_tokens_per_second": 361.593 }, { "epoch": 0.8607757239021263, "grad_norm": 2.4561080932617188, "learning_rate": 2.800856531049251e-06, "loss": 0.16175368428230286, "num_input_tokens_seen": 2072962, "step": 2014, "train_runtime": 5732.3061, "train_tokens_per_second": 361.628 }, { "epoch": 0.861203119991452, "grad_norm": 3.9444172382354736, "learning_rate": 2.7922912205567453e-06, "loss": 0.10620345175266266, "num_input_tokens_seen": 2073506, "step": 2015, "train_runtime": 5734.3842, "train_tokens_per_second": 361.592 }, { "epoch": 0.8616305160807779, "grad_norm": 2.4148569107055664, "learning_rate": 2.78372591006424e-06, "loss": 0.09299345314502716, "num_input_tokens_seen": 2074234, "step": 2016, "train_runtime": 5736.4849, "train_tokens_per_second": 361.586 }, { "epoch": 0.8620579121701036, "grad_norm": 1.7600783109664917, "learning_rate": 2.7751605995717346e-06, "loss": 0.08529353886842728, "num_input_tokens_seen": 2075424, "step": 2017, "train_runtime": 5738.7305, "train_tokens_per_second": 361.652 }, { "epoch": 0.8624853082594294, "grad_norm": 2.098557233810425, "learning_rate": 2.766595289079229e-06, "loss": 0.21334445476531982, "num_input_tokens_seen": 2076470, "step": 2018, "train_runtime": 5740.9149, "train_tokens_per_second": 361.697 }, { "epoch": 0.8629127043487552, "grad_norm": 2.6756327152252197, "learning_rate": 2.758029978586724e-06, "loss": 0.17590031027793884, "num_input_tokens_seen": 2077754, "step": 2019, "train_runtime": 5743.1473, "train_tokens_per_second": 361.78 }, { "epoch": 0.863340100438081, "grad_norm": 2.2054638862609863, "learning_rate": 2.7494646680942187e-06, "loss": 0.07914389669895172, "num_input_tokens_seen": 2078574, "step": 2020, "train_runtime": 5745.2632, "train_tokens_per_second": 361.789 }, { "epoch": 0.8637674965274068, "grad_norm": 1.9902969598770142, "learning_rate": 2.7408993576017136e-06, "loss": 0.13987253606319427, "num_input_tokens_seen": 2079704, "step": 2021, "train_runtime": 5747.446, "train_tokens_per_second": 361.848 }, { "epoch": 0.8641948926167325, "grad_norm": 1.2502907514572144, "learning_rate": 2.732334047109208e-06, "loss": 0.09385128319263458, "num_input_tokens_seen": 2081392, "step": 2022, "train_runtime": 5749.8268, "train_tokens_per_second": 361.992 }, { "epoch": 0.8646222887060584, "grad_norm": 3.1436736583709717, "learning_rate": 2.7237687366167024e-06, "loss": 0.17186886072158813, "num_input_tokens_seen": 2082108, "step": 2023, "train_runtime": 5751.9793, "train_tokens_per_second": 361.981 }, { "epoch": 0.8650496847953841, "grad_norm": 2.1285715103149414, "learning_rate": 2.7152034261241973e-06, "loss": 0.17323139309883118, "num_input_tokens_seen": 2083052, "step": 2024, "train_runtime": 5754.1864, "train_tokens_per_second": 362.006 }, { "epoch": 0.8654770808847099, "grad_norm": 2.813476800918579, "learning_rate": 2.7066381156316917e-06, "loss": 0.17243844270706177, "num_input_tokens_seen": 2084296, "step": 2025, "train_runtime": 5756.3708, "train_tokens_per_second": 362.085 }, { "epoch": 0.8659044769740357, "grad_norm": 2.0731918811798096, "learning_rate": 2.6980728051391865e-06, "loss": 0.11207694560289383, "num_input_tokens_seen": 2085072, "step": 2026, "train_runtime": 5758.426, "train_tokens_per_second": 362.091 }, { "epoch": 0.8663318730633615, "grad_norm": 1.3874374628067017, "learning_rate": 2.689507494646681e-06, "loss": 0.07603321969509125, "num_input_tokens_seen": 2086082, "step": 2027, "train_runtime": 5760.5695, "train_tokens_per_second": 362.131 }, { "epoch": 0.8667592691526873, "grad_norm": 1.777469515800476, "learning_rate": 2.6809421841541763e-06, "loss": 0.11113659292459488, "num_input_tokens_seen": 2087164, "step": 2028, "train_runtime": 5762.7462, "train_tokens_per_second": 362.182 }, { "epoch": 0.867186665242013, "grad_norm": 2.2070701122283936, "learning_rate": 2.6723768736616707e-06, "loss": 0.12488459795713425, "num_input_tokens_seen": 2087896, "step": 2029, "train_runtime": 5764.905, "train_tokens_per_second": 362.174 }, { "epoch": 0.8676140613313388, "grad_norm": 2.194129228591919, "learning_rate": 2.663811563169165e-06, "loss": 0.11793061345815659, "num_input_tokens_seen": 2088562, "step": 2030, "train_runtime": 5766.9669, "train_tokens_per_second": 362.16 }, { "epoch": 0.8680414574206646, "grad_norm": 2.392115354537964, "learning_rate": 2.65524625267666e-06, "loss": 0.14523430168628693, "num_input_tokens_seen": 2089798, "step": 2031, "train_runtime": 5769.2263, "train_tokens_per_second": 362.232 }, { "epoch": 0.8684688535099904, "grad_norm": 2.2562978267669678, "learning_rate": 2.6466809421841544e-06, "loss": 0.18294145166873932, "num_input_tokens_seen": 2090866, "step": 2032, "train_runtime": 5771.3728, "train_tokens_per_second": 362.282 }, { "epoch": 0.8688962495993162, "grad_norm": 1.5348066091537476, "learning_rate": 2.638115631691649e-06, "loss": 0.09927107393741608, "num_input_tokens_seen": 2092152, "step": 2033, "train_runtime": 5773.5838, "train_tokens_per_second": 362.366 }, { "epoch": 0.869323645688642, "grad_norm": 2.6012370586395264, "learning_rate": 2.6295503211991437e-06, "loss": 0.08113822340965271, "num_input_tokens_seen": 2092912, "step": 2034, "train_runtime": 5775.7421, "train_tokens_per_second": 362.362 }, { "epoch": 0.8697510417779677, "grad_norm": 2.6684658527374268, "learning_rate": 2.620985010706638e-06, "loss": 0.15928147733211517, "num_input_tokens_seen": 2093722, "step": 2035, "train_runtime": 5777.8638, "train_tokens_per_second": 362.37 }, { "epoch": 0.8701784378672935, "grad_norm": 1.9016945362091064, "learning_rate": 2.6124197002141325e-06, "loss": 0.08974956721067429, "num_input_tokens_seen": 2094804, "step": 2036, "train_runtime": 5780.013, "train_tokens_per_second": 362.422 }, { "epoch": 0.8706058339566193, "grad_norm": 2.4460599422454834, "learning_rate": 2.603854389721628e-06, "loss": 0.09791088104248047, "num_input_tokens_seen": 2095692, "step": 2037, "train_runtime": 5782.1424, "train_tokens_per_second": 362.442 }, { "epoch": 0.8710332300459451, "grad_norm": 2.352628231048584, "learning_rate": 2.5952890792291222e-06, "loss": 0.12310855090618134, "num_input_tokens_seen": 2096448, "step": 2038, "train_runtime": 5784.1989, "train_tokens_per_second": 362.444 }, { "epoch": 0.8714606261352709, "grad_norm": 2.515416383743286, "learning_rate": 2.586723768736617e-06, "loss": 0.14864176511764526, "num_input_tokens_seen": 2097430, "step": 2039, "train_runtime": 5786.3468, "train_tokens_per_second": 362.479 }, { "epoch": 0.8718880222245966, "grad_norm": 2.097531795501709, "learning_rate": 2.5781584582441115e-06, "loss": 0.08857254683971405, "num_input_tokens_seen": 2098438, "step": 2040, "train_runtime": 5788.5147, "train_tokens_per_second": 362.518 }, { "epoch": 0.8723154183139225, "grad_norm": 2.4108428955078125, "learning_rate": 2.5695931477516064e-06, "loss": 0.1783050000667572, "num_input_tokens_seen": 2099334, "step": 2041, "train_runtime": 5805.1412, "train_tokens_per_second": 361.634 }, { "epoch": 0.8727428144032482, "grad_norm": 2.102546453475952, "learning_rate": 2.561027837259101e-06, "loss": 0.0952841117978096, "num_input_tokens_seen": 2100336, "step": 2042, "train_runtime": 5807.3273, "train_tokens_per_second": 361.67 }, { "epoch": 0.873170210492574, "grad_norm": 3.1656851768493652, "learning_rate": 2.5524625267665952e-06, "loss": 0.15218988060951233, "num_input_tokens_seen": 2101246, "step": 2043, "train_runtime": 5809.5756, "train_tokens_per_second": 361.687 }, { "epoch": 0.8735976065818998, "grad_norm": 1.9376498460769653, "learning_rate": 2.54389721627409e-06, "loss": 0.09833593666553497, "num_input_tokens_seen": 2102154, "step": 2044, "train_runtime": 5811.7293, "train_tokens_per_second": 361.709 }, { "epoch": 0.8740250026712255, "grad_norm": 1.7766053676605225, "learning_rate": 2.535331905781585e-06, "loss": 0.12094634771347046, "num_input_tokens_seen": 2103916, "step": 2045, "train_runtime": 5814.0721, "train_tokens_per_second": 361.866 }, { "epoch": 0.8744523987605514, "grad_norm": 2.2929627895355225, "learning_rate": 2.52676659528908e-06, "loss": 0.13895580172538757, "num_input_tokens_seen": 2104866, "step": 2046, "train_runtime": 5816.2095, "train_tokens_per_second": 361.897 }, { "epoch": 0.8748797948498771, "grad_norm": 2.165609121322632, "learning_rate": 2.5182012847965742e-06, "loss": 0.15516400337219238, "num_input_tokens_seen": 2106214, "step": 2047, "train_runtime": 5818.4255, "train_tokens_per_second": 361.99 }, { "epoch": 0.875307190939203, "grad_norm": 3.682527542114258, "learning_rate": 2.5096359743040687e-06, "loss": 0.15300746262073517, "num_input_tokens_seen": 2107024, "step": 2048, "train_runtime": 5820.513, "train_tokens_per_second": 362.0 }, { "epoch": 0.8757345870285287, "grad_norm": 2.0996010303497314, "learning_rate": 2.5010706638115635e-06, "loss": 0.07466349005699158, "num_input_tokens_seen": 2107916, "step": 2049, "train_runtime": 5822.622, "train_tokens_per_second": 362.022 }, { "epoch": 0.8761619831178544, "grad_norm": 2.101146697998047, "learning_rate": 2.492505353319058e-06, "loss": 0.13168010115623474, "num_input_tokens_seen": 2109138, "step": 2050, "train_runtime": 5824.8222, "train_tokens_per_second": 362.095 }, { "epoch": 0.8765893792071803, "grad_norm": 2.264698028564453, "learning_rate": 2.4839400428265524e-06, "loss": 0.15204904973506927, "num_input_tokens_seen": 2110444, "step": 2051, "train_runtime": 5827.0412, "train_tokens_per_second": 362.181 }, { "epoch": 0.877016775296506, "grad_norm": 2.748321771621704, "learning_rate": 2.4753747323340472e-06, "loss": 0.12910622358322144, "num_input_tokens_seen": 2111194, "step": 2052, "train_runtime": 5829.0923, "train_tokens_per_second": 362.182 }, { "epoch": 0.8774441713858319, "grad_norm": 1.9361207485198975, "learning_rate": 2.466809421841542e-06, "loss": 0.0930027961730957, "num_input_tokens_seen": 2112414, "step": 2053, "train_runtime": 5831.2642, "train_tokens_per_second": 362.257 }, { "epoch": 0.8778715674751576, "grad_norm": 2.0167324542999268, "learning_rate": 2.4582441113490365e-06, "loss": 0.1363641321659088, "num_input_tokens_seen": 2113914, "step": 2054, "train_runtime": 5833.5618, "train_tokens_per_second": 362.371 }, { "epoch": 0.8782989635644833, "grad_norm": 2.5238311290740967, "learning_rate": 2.4496788008565314e-06, "loss": 0.13148850202560425, "num_input_tokens_seen": 2114710, "step": 2055, "train_runtime": 5835.6175, "train_tokens_per_second": 362.38 }, { "epoch": 0.8787263596538092, "grad_norm": 1.7928324937820435, "learning_rate": 2.441113490364026e-06, "loss": 0.15593746304512024, "num_input_tokens_seen": 2116414, "step": 2056, "train_runtime": 5837.9575, "train_tokens_per_second": 362.526 }, { "epoch": 0.8791537557431349, "grad_norm": 2.9624431133270264, "learning_rate": 2.4325481798715206e-06, "loss": 0.12336647510528564, "num_input_tokens_seen": 2117190, "step": 2057, "train_runtime": 5840.0547, "train_tokens_per_second": 362.529 }, { "epoch": 0.8795811518324608, "grad_norm": 2.7855894565582275, "learning_rate": 2.423982869379015e-06, "loss": 0.1867242157459259, "num_input_tokens_seen": 2118212, "step": 2058, "train_runtime": 5842.2307, "train_tokens_per_second": 362.569 }, { "epoch": 0.8800085479217865, "grad_norm": 1.6632304191589355, "learning_rate": 2.41541755888651e-06, "loss": 0.09385678172111511, "num_input_tokens_seen": 2119170, "step": 2059, "train_runtime": 5844.4019, "train_tokens_per_second": 362.598 }, { "epoch": 0.8804359440111122, "grad_norm": 2.4510445594787598, "learning_rate": 2.4068522483940048e-06, "loss": 0.0982072502374649, "num_input_tokens_seen": 2120156, "step": 2060, "train_runtime": 5846.5668, "train_tokens_per_second": 362.633 }, { "epoch": 0.8808633401004381, "grad_norm": 1.8894962072372437, "learning_rate": 2.398286937901499e-06, "loss": 0.1276012659072876, "num_input_tokens_seen": 2121670, "step": 2061, "train_runtime": 5848.8425, "train_tokens_per_second": 362.75 }, { "epoch": 0.8812907361897638, "grad_norm": 2.5933008193969727, "learning_rate": 2.3897216274089936e-06, "loss": 0.13273373246192932, "num_input_tokens_seen": 2122614, "step": 2062, "train_runtime": 5851.0156, "train_tokens_per_second": 362.777 }, { "epoch": 0.8817181322790897, "grad_norm": 3.338468551635742, "learning_rate": 2.3811563169164885e-06, "loss": 0.13261613249778748, "num_input_tokens_seen": 2123342, "step": 2063, "train_runtime": 5853.1235, "train_tokens_per_second": 362.771 }, { "epoch": 0.8821455283684154, "grad_norm": 1.8080017566680908, "learning_rate": 2.372591006423983e-06, "loss": 0.07965312898159027, "num_input_tokens_seen": 2124194, "step": 2064, "train_runtime": 5855.2708, "train_tokens_per_second": 362.783 }, { "epoch": 0.8825729244577412, "grad_norm": 1.7073616981506348, "learning_rate": 2.3640256959314778e-06, "loss": 0.09075456857681274, "num_input_tokens_seen": 2125412, "step": 2065, "train_runtime": 5857.4879, "train_tokens_per_second": 362.854 }, { "epoch": 0.883000320547067, "grad_norm": 1.811286211013794, "learning_rate": 2.355460385438972e-06, "loss": 0.07494605332612991, "num_input_tokens_seen": 2126608, "step": 2066, "train_runtime": 5859.7053, "train_tokens_per_second": 362.921 }, { "epoch": 0.8834277166363927, "grad_norm": 2.4246816635131836, "learning_rate": 2.346895074946467e-06, "loss": 0.12078673392534256, "num_input_tokens_seen": 2127588, "step": 2067, "train_runtime": 5861.8689, "train_tokens_per_second": 362.954 }, { "epoch": 0.8838551127257186, "grad_norm": 1.7475295066833496, "learning_rate": 2.3383297644539615e-06, "loss": 0.06864313781261444, "num_input_tokens_seen": 2128614, "step": 2068, "train_runtime": 5864.0657, "train_tokens_per_second": 362.993 }, { "epoch": 0.8842825088150443, "grad_norm": 2.9458775520324707, "learning_rate": 2.3297644539614563e-06, "loss": 0.16838330030441284, "num_input_tokens_seen": 2129810, "step": 2069, "train_runtime": 5866.2185, "train_tokens_per_second": 363.064 }, { "epoch": 0.8847099049043701, "grad_norm": 3.3116567134857178, "learning_rate": 2.321199143468951e-06, "loss": 0.2246849536895752, "num_input_tokens_seen": 2130448, "step": 2070, "train_runtime": 5868.278, "train_tokens_per_second": 363.045 }, { "epoch": 0.8851373009936959, "grad_norm": 1.917832374572754, "learning_rate": 2.3126338329764456e-06, "loss": 0.137008935213089, "num_input_tokens_seen": 2131852, "step": 2071, "train_runtime": 5883.8972, "train_tokens_per_second": 362.32 }, { "epoch": 0.8855646970830217, "grad_norm": 2.764021635055542, "learning_rate": 2.30406852248394e-06, "loss": 0.13553404808044434, "num_input_tokens_seen": 2132686, "step": 2072, "train_runtime": 5886.0294, "train_tokens_per_second": 362.33 }, { "epoch": 0.8859920931723475, "grad_norm": 2.148662567138672, "learning_rate": 2.295503211991435e-06, "loss": 0.17894351482391357, "num_input_tokens_seen": 2133802, "step": 2073, "train_runtime": 5888.2197, "train_tokens_per_second": 362.385 }, { "epoch": 0.8864194892616732, "grad_norm": 2.056614398956299, "learning_rate": 2.2869379014989297e-06, "loss": 0.1461656391620636, "num_input_tokens_seen": 2134710, "step": 2074, "train_runtime": 5890.3437, "train_tokens_per_second": 362.408 }, { "epoch": 0.8868468853509991, "grad_norm": 2.1697099208831787, "learning_rate": 2.278372591006424e-06, "loss": 0.10381367802619934, "num_input_tokens_seen": 2135374, "step": 2075, "train_runtime": 5892.4158, "train_tokens_per_second": 362.394 }, { "epoch": 0.8872742814403248, "grad_norm": 3.0922961235046387, "learning_rate": 2.2698072805139186e-06, "loss": 0.2057275027036667, "num_input_tokens_seen": 2136620, "step": 2076, "train_runtime": 5894.651, "train_tokens_per_second": 362.468 }, { "epoch": 0.8877016775296506, "grad_norm": 3.033801317214966, "learning_rate": 2.2612419700214135e-06, "loss": 0.13413895666599274, "num_input_tokens_seen": 2137722, "step": 2077, "train_runtime": 5896.8024, "train_tokens_per_second": 362.522 }, { "epoch": 0.8881290736189764, "grad_norm": 2.1379237174987793, "learning_rate": 2.2526766595289083e-06, "loss": 0.12404193729162216, "num_input_tokens_seen": 2138862, "step": 2078, "train_runtime": 5898.9962, "train_tokens_per_second": 362.581 }, { "epoch": 0.8885564697083022, "grad_norm": 2.2025508880615234, "learning_rate": 2.2441113490364027e-06, "loss": 0.10359278321266174, "num_input_tokens_seen": 2139738, "step": 2079, "train_runtime": 5901.116, "train_tokens_per_second": 362.599 }, { "epoch": 0.888983865797628, "grad_norm": 3.182241439819336, "learning_rate": 2.235546038543897e-06, "loss": 0.13087734580039978, "num_input_tokens_seen": 2140384, "step": 2080, "train_runtime": 5903.2227, "train_tokens_per_second": 362.579 }, { "epoch": 0.8894112618869537, "grad_norm": 2.1732473373413086, "learning_rate": 2.226980728051392e-06, "loss": 0.12075134366750717, "num_input_tokens_seen": 2141186, "step": 2081, "train_runtime": 5905.3209, "train_tokens_per_second": 362.586 }, { "epoch": 0.8898386579762795, "grad_norm": 2.0428032875061035, "learning_rate": 2.218415417558887e-06, "loss": 0.12998268008232117, "num_input_tokens_seen": 2142272, "step": 2082, "train_runtime": 5907.5715, "train_tokens_per_second": 362.632 }, { "epoch": 0.8902660540656053, "grad_norm": 2.5222203731536865, "learning_rate": 2.2098501070663813e-06, "loss": 0.10774858295917511, "num_input_tokens_seen": 2143428, "step": 2083, "train_runtime": 5909.7688, "train_tokens_per_second": 362.692 }, { "epoch": 0.8906934501549311, "grad_norm": 1.582076072692871, "learning_rate": 2.201284796573876e-06, "loss": 0.08669944107532501, "num_input_tokens_seen": 2144534, "step": 2084, "train_runtime": 5911.9353, "train_tokens_per_second": 362.747 }, { "epoch": 0.8911208462442569, "grad_norm": 1.802765965461731, "learning_rate": 2.1927194860813706e-06, "loss": 0.13840240240097046, "num_input_tokens_seen": 2146040, "step": 2085, "train_runtime": 5914.2524, "train_tokens_per_second": 362.859 }, { "epoch": 0.8915482423335827, "grad_norm": 2.2215256690979004, "learning_rate": 2.1841541755888654e-06, "loss": 0.12045235186815262, "num_input_tokens_seen": 2147140, "step": 2086, "train_runtime": 5916.4577, "train_tokens_per_second": 362.91 }, { "epoch": 0.8919756384229084, "grad_norm": 2.0863659381866455, "learning_rate": 2.17558886509636e-06, "loss": 0.1052878201007843, "num_input_tokens_seen": 2148050, "step": 2087, "train_runtime": 5918.5695, "train_tokens_per_second": 362.934 }, { "epoch": 0.8924030345122342, "grad_norm": 3.3657069206237793, "learning_rate": 2.1670235546038547e-06, "loss": 0.0845300480723381, "num_input_tokens_seen": 2148750, "step": 2088, "train_runtime": 5920.6723, "train_tokens_per_second": 362.923 }, { "epoch": 0.89283043060156, "grad_norm": 2.5540568828582764, "learning_rate": 2.158458244111349e-06, "loss": 0.14328941702842712, "num_input_tokens_seen": 2149570, "step": 2089, "train_runtime": 5922.7744, "train_tokens_per_second": 362.933 }, { "epoch": 0.8932578266908858, "grad_norm": 2.2871949672698975, "learning_rate": 2.149892933618844e-06, "loss": 0.07893916964530945, "num_input_tokens_seen": 2150544, "step": 2090, "train_runtime": 5924.9563, "train_tokens_per_second": 362.964 }, { "epoch": 0.8936852227802116, "grad_norm": 2.2579426765441895, "learning_rate": 2.1413276231263384e-06, "loss": 0.12150919437408447, "num_input_tokens_seen": 2151614, "step": 2091, "train_runtime": 5927.1907, "train_tokens_per_second": 363.007 }, { "epoch": 0.8941126188695373, "grad_norm": 2.3674373626708984, "learning_rate": 2.1327623126338333e-06, "loss": 0.11609025299549103, "num_input_tokens_seen": 2152512, "step": 2092, "train_runtime": 5929.3064, "train_tokens_per_second": 363.029 }, { "epoch": 0.8945400149588631, "grad_norm": 2.686967134475708, "learning_rate": 2.1241970021413277e-06, "loss": 0.09624900668859482, "num_input_tokens_seen": 2153204, "step": 2093, "train_runtime": 5931.3569, "train_tokens_per_second": 363.02 }, { "epoch": 0.8949674110481889, "grad_norm": 1.1433016061782837, "learning_rate": 2.115631691648822e-06, "loss": 0.05403666943311691, "num_input_tokens_seen": 2154586, "step": 2094, "train_runtime": 5933.6018, "train_tokens_per_second": 363.116 }, { "epoch": 0.8953948071375147, "grad_norm": 2.1384119987487793, "learning_rate": 2.107066381156317e-06, "loss": 0.10524041950702667, "num_input_tokens_seen": 2155250, "step": 2095, "train_runtime": 5935.6558, "train_tokens_per_second": 363.102 }, { "epoch": 0.8958222032268405, "grad_norm": 1.5513935089111328, "learning_rate": 2.098501070663812e-06, "loss": 0.06729548424482346, "num_input_tokens_seen": 2156172, "step": 2096, "train_runtime": 5937.7748, "train_tokens_per_second": 363.128 }, { "epoch": 0.8962495993161662, "grad_norm": 1.9078114032745361, "learning_rate": 2.0899357601713063e-06, "loss": 0.09925670176744461, "num_input_tokens_seen": 2157060, "step": 2097, "train_runtime": 5939.9, "train_tokens_per_second": 363.148 }, { "epoch": 0.8966769954054921, "grad_norm": 1.716143012046814, "learning_rate": 2.0813704496788007e-06, "loss": 0.09362021088600159, "num_input_tokens_seen": 2157940, "step": 2098, "train_runtime": 5942.0626, "train_tokens_per_second": 363.163 }, { "epoch": 0.8971043914948178, "grad_norm": 2.579413890838623, "learning_rate": 2.072805139186296e-06, "loss": 0.089250847697258, "num_input_tokens_seen": 2158944, "step": 2099, "train_runtime": 5944.2504, "train_tokens_per_second": 363.199 }, { "epoch": 0.8975317875841436, "grad_norm": 2.7344658374786377, "learning_rate": 2.0642398286937904e-06, "loss": 0.1683403104543686, "num_input_tokens_seen": 2159674, "step": 2100, "train_runtime": 5946.315, "train_tokens_per_second": 363.195 }, { "epoch": 0.8979591836734694, "grad_norm": 3.1770620346069336, "learning_rate": 2.055674518201285e-06, "loss": 0.2300439029932022, "num_input_tokens_seen": 2160366, "step": 2101, "train_runtime": 5961.5898, "train_tokens_per_second": 362.381 }, { "epoch": 0.8983865797627951, "grad_norm": 2.193706750869751, "learning_rate": 2.0471092077087797e-06, "loss": 0.08801782131195068, "num_input_tokens_seen": 2161154, "step": 2102, "train_runtime": 5963.6563, "train_tokens_per_second": 362.387 }, { "epoch": 0.898813975852121, "grad_norm": 2.410318613052368, "learning_rate": 2.0385438972162746e-06, "loss": 0.10770563781261444, "num_input_tokens_seen": 2161938, "step": 2103, "train_runtime": 5965.7593, "train_tokens_per_second": 362.391 }, { "epoch": 0.8992413719414467, "grad_norm": 2.9301934242248535, "learning_rate": 2.029978586723769e-06, "loss": 0.16462868452072144, "num_input_tokens_seen": 2162960, "step": 2104, "train_runtime": 5967.9477, "train_tokens_per_second": 362.429 }, { "epoch": 0.8996687680307726, "grad_norm": 2.930838108062744, "learning_rate": 2.0214132762312634e-06, "loss": 0.16791778802871704, "num_input_tokens_seen": 2163668, "step": 2105, "train_runtime": 5970.0715, "train_tokens_per_second": 362.419 }, { "epoch": 0.9000961641200983, "grad_norm": 3.144822597503662, "learning_rate": 2.0128479657387583e-06, "loss": 0.0992625430226326, "num_input_tokens_seen": 2164382, "step": 2106, "train_runtime": 5972.1522, "train_tokens_per_second": 362.412 }, { "epoch": 0.9000961641200983, "eval_loss": 0.4553227424621582, "eval_runtime": 58.2737, "eval_samples_per_second": 17.126, "eval_steps_per_second": 8.563, "num_input_tokens_seen": 2164382, "step": 2106 }, { "epoch": 0.900523560209424, "grad_norm": 2.130829095840454, "learning_rate": 2.0042826552462527e-06, "loss": 0.10893520712852478, "num_input_tokens_seen": 2165384, "step": 2107, "train_runtime": 6032.6155, "train_tokens_per_second": 358.946 }, { "epoch": 0.9009509562987499, "grad_norm": 2.5909454822540283, "learning_rate": 1.9957173447537475e-06, "loss": 0.1649809628725052, "num_input_tokens_seen": 2166104, "step": 2108, "train_runtime": 6034.7337, "train_tokens_per_second": 358.939 }, { "epoch": 0.9013783523880756, "grad_norm": 2.4314017295837402, "learning_rate": 1.987152034261242e-06, "loss": 0.1623801440000534, "num_input_tokens_seen": 2166962, "step": 2109, "train_runtime": 6036.8498, "train_tokens_per_second": 358.956 }, { "epoch": 0.9018057484774015, "grad_norm": 2.035533905029297, "learning_rate": 1.978586723768737e-06, "loss": 0.056259140372276306, "num_input_tokens_seen": 2167504, "step": 2110, "train_runtime": 6038.9074, "train_tokens_per_second": 358.923 }, { "epoch": 0.9022331445667272, "grad_norm": 4.308773994445801, "learning_rate": 1.9700214132762313e-06, "loss": 0.22878707945346832, "num_input_tokens_seen": 2168670, "step": 2111, "train_runtime": 6041.0586, "train_tokens_per_second": 358.988 }, { "epoch": 0.902660540656053, "grad_norm": 1.7481560707092285, "learning_rate": 1.961456102783726e-06, "loss": 0.08038550615310669, "num_input_tokens_seen": 2169614, "step": 2112, "train_runtime": 6043.2106, "train_tokens_per_second": 359.017 }, { "epoch": 0.9030879367453788, "grad_norm": 1.556742548942566, "learning_rate": 1.9528907922912205e-06, "loss": 0.09323370456695557, "num_input_tokens_seen": 2170860, "step": 2113, "train_runtime": 6045.4279, "train_tokens_per_second": 359.091 }, { "epoch": 0.9035153328347045, "grad_norm": 1.9363806247711182, "learning_rate": 1.9443254817987154e-06, "loss": 0.13133233785629272, "num_input_tokens_seen": 2172150, "step": 2114, "train_runtime": 6047.6584, "train_tokens_per_second": 359.172 }, { "epoch": 0.9039427289240304, "grad_norm": 1.996583342552185, "learning_rate": 1.93576017130621e-06, "loss": 0.14076834917068481, "num_input_tokens_seen": 2173248, "step": 2115, "train_runtime": 6049.8127, "train_tokens_per_second": 359.226 }, { "epoch": 0.9043701250133561, "grad_norm": 1.9341224431991577, "learning_rate": 1.9271948608137047e-06, "loss": 0.10415120422840118, "num_input_tokens_seen": 2174380, "step": 2116, "train_runtime": 6052.0045, "train_tokens_per_second": 359.283 }, { "epoch": 0.9047975211026819, "grad_norm": 2.2955281734466553, "learning_rate": 1.9186295503211995e-06, "loss": 0.09734087437391281, "num_input_tokens_seen": 2175414, "step": 2117, "train_runtime": 6054.1626, "train_tokens_per_second": 359.325 }, { "epoch": 0.9052249171920077, "grad_norm": 2.2073757648468018, "learning_rate": 1.910064239828694e-06, "loss": 0.13069772720336914, "num_input_tokens_seen": 2176874, "step": 2118, "train_runtime": 6056.3945, "train_tokens_per_second": 359.434 }, { "epoch": 0.9056523132813334, "grad_norm": 2.6759731769561768, "learning_rate": 1.9014989293361886e-06, "loss": 0.14985017478466034, "num_input_tokens_seen": 2177804, "step": 2119, "train_runtime": 6058.5202, "train_tokens_per_second": 359.461 }, { "epoch": 0.9060797093706593, "grad_norm": 1.9756344556808472, "learning_rate": 1.8929336188436835e-06, "loss": 0.11807208508253098, "num_input_tokens_seen": 2179206, "step": 2120, "train_runtime": 6060.7569, "train_tokens_per_second": 359.56 }, { "epoch": 0.906507105459985, "grad_norm": 1.886093020439148, "learning_rate": 1.8843683083511779e-06, "loss": 0.06790851801633835, "num_input_tokens_seen": 2179886, "step": 2121, "train_runtime": 6062.8167, "train_tokens_per_second": 359.55 }, { "epoch": 0.9069345015493109, "grad_norm": 2.142716884613037, "learning_rate": 1.8758029978586725e-06, "loss": 0.11490422487258911, "num_input_tokens_seen": 2180698, "step": 2122, "train_runtime": 6064.9343, "train_tokens_per_second": 359.558 }, { "epoch": 0.9073618976386366, "grad_norm": 2.057957172393799, "learning_rate": 1.8672376873661672e-06, "loss": 0.14492949843406677, "num_input_tokens_seen": 2181852, "step": 2123, "train_runtime": 6067.1151, "train_tokens_per_second": 359.619 }, { "epoch": 0.9077892937279624, "grad_norm": 1.9728516340255737, "learning_rate": 1.8586723768736616e-06, "loss": 0.12060727924108505, "num_input_tokens_seen": 2182806, "step": 2124, "train_runtime": 6069.3308, "train_tokens_per_second": 359.645 }, { "epoch": 0.9082166898172882, "grad_norm": 2.384751796722412, "learning_rate": 1.8501070663811567e-06, "loss": 0.16312731802463531, "num_input_tokens_seen": 2183504, "step": 2125, "train_runtime": 6071.411, "train_tokens_per_second": 359.637 }, { "epoch": 0.9086440859066139, "grad_norm": 2.389244318008423, "learning_rate": 1.841541755888651e-06, "loss": 0.17604269087314606, "num_input_tokens_seen": 2184810, "step": 2126, "train_runtime": 6073.6717, "train_tokens_per_second": 359.718 }, { "epoch": 0.9090714819959398, "grad_norm": 2.322256326675415, "learning_rate": 1.8329764453961457e-06, "loss": 0.14901700615882874, "num_input_tokens_seen": 2185814, "step": 2127, "train_runtime": 6075.8113, "train_tokens_per_second": 359.757 }, { "epoch": 0.9094988780852655, "grad_norm": 2.590334177017212, "learning_rate": 1.8244111349036404e-06, "loss": 0.12600906193256378, "num_input_tokens_seen": 2186656, "step": 2128, "train_runtime": 6077.9388, "train_tokens_per_second": 359.769 }, { "epoch": 0.9099262741745913, "grad_norm": 1.2655421495437622, "learning_rate": 1.8158458244111352e-06, "loss": 0.05039399117231369, "num_input_tokens_seen": 2187694, "step": 2129, "train_runtime": 6080.0871, "train_tokens_per_second": 359.813 }, { "epoch": 0.9103536702639171, "grad_norm": 1.8549717664718628, "learning_rate": 1.8072805139186297e-06, "loss": 0.08745712041854858, "num_input_tokens_seen": 2188778, "step": 2130, "train_runtime": 6082.3165, "train_tokens_per_second": 359.859 }, { "epoch": 0.9107810663532429, "grad_norm": 2.1436004638671875, "learning_rate": 1.7987152034261243e-06, "loss": 0.1523379385471344, "num_input_tokens_seen": 2189862, "step": 2131, "train_runtime": 6097.191, "train_tokens_per_second": 359.159 }, { "epoch": 0.9112084624425687, "grad_norm": 3.1262474060058594, "learning_rate": 1.790149892933619e-06, "loss": 0.129807710647583, "num_input_tokens_seen": 2190950, "step": 2132, "train_runtime": 6099.3588, "train_tokens_per_second": 359.21 }, { "epoch": 0.9116358585318944, "grad_norm": 2.2749571800231934, "learning_rate": 1.7815845824411138e-06, "loss": 0.09306280314922333, "num_input_tokens_seen": 2191624, "step": 2133, "train_runtime": 6101.429, "train_tokens_per_second": 359.198 }, { "epoch": 0.9120632546212202, "grad_norm": 3.626248598098755, "learning_rate": 1.7730192719486084e-06, "loss": 0.24941939115524292, "num_input_tokens_seen": 2192338, "step": 2134, "train_runtime": 6103.5822, "train_tokens_per_second": 359.189 }, { "epoch": 0.912490650710546, "grad_norm": 3.0691635608673096, "learning_rate": 1.7644539614561029e-06, "loss": 0.10945655405521393, "num_input_tokens_seen": 2193204, "step": 2135, "train_runtime": 6105.785, "train_tokens_per_second": 359.201 }, { "epoch": 0.9129180467998718, "grad_norm": 2.296405553817749, "learning_rate": 1.7558886509635975e-06, "loss": 0.10002892464399338, "num_input_tokens_seen": 2193862, "step": 2136, "train_runtime": 6107.8743, "train_tokens_per_second": 359.186 }, { "epoch": 0.9133454428891976, "grad_norm": 2.27190899848938, "learning_rate": 1.7473233404710921e-06, "loss": 0.1897697150707245, "num_input_tokens_seen": 2195292, "step": 2137, "train_runtime": 6110.1783, "train_tokens_per_second": 359.284 }, { "epoch": 0.9137728389785233, "grad_norm": 1.681108832359314, "learning_rate": 1.738758029978587e-06, "loss": 0.07039877772331238, "num_input_tokens_seen": 2196192, "step": 2138, "train_runtime": 6112.25, "train_tokens_per_second": 359.31 }, { "epoch": 0.9142002350678491, "grad_norm": 3.9387195110321045, "learning_rate": 1.7301927194860814e-06, "loss": 0.08656158298254013, "num_input_tokens_seen": 2197194, "step": 2139, "train_runtime": 6114.3863, "train_tokens_per_second": 359.348 }, { "epoch": 0.9146276311571749, "grad_norm": 2.0285916328430176, "learning_rate": 1.721627408993576e-06, "loss": 0.11406892538070679, "num_input_tokens_seen": 2198406, "step": 2140, "train_runtime": 6116.6422, "train_tokens_per_second": 359.414 }, { "epoch": 0.9150550272465007, "grad_norm": 2.407357931137085, "learning_rate": 1.7130620985010707e-06, "loss": 0.09661931544542313, "num_input_tokens_seen": 2199216, "step": 2141, "train_runtime": 6118.7678, "train_tokens_per_second": 359.421 }, { "epoch": 0.9154824233358265, "grad_norm": 2.445122241973877, "learning_rate": 1.7044967880085656e-06, "loss": 0.17017090320587158, "num_input_tokens_seen": 2200286, "step": 2142, "train_runtime": 6120.9937, "train_tokens_per_second": 359.465 }, { "epoch": 0.9159098194251523, "grad_norm": 1.547048807144165, "learning_rate": 1.6959314775160602e-06, "loss": 0.09920593351125717, "num_input_tokens_seen": 2202008, "step": 2143, "train_runtime": 6123.3724, "train_tokens_per_second": 359.607 }, { "epoch": 0.916337215514478, "grad_norm": 1.617870807647705, "learning_rate": 1.6873661670235546e-06, "loss": 0.08339440822601318, "num_input_tokens_seen": 2203588, "step": 2144, "train_runtime": 6125.6363, "train_tokens_per_second": 359.732 }, { "epoch": 0.9167646116038038, "grad_norm": 1.7286889553070068, "learning_rate": 1.6788008565310493e-06, "loss": 0.11313310265541077, "num_input_tokens_seen": 2205476, "step": 2145, "train_runtime": 6127.9915, "train_tokens_per_second": 359.902 }, { "epoch": 0.9171920076931296, "grad_norm": 1.7525434494018555, "learning_rate": 1.6702355460385441e-06, "loss": 0.15014159679412842, "num_input_tokens_seen": 2206608, "step": 2146, "train_runtime": 6130.2288, "train_tokens_per_second": 359.955 }, { "epoch": 0.9176194037824554, "grad_norm": 2.0443313121795654, "learning_rate": 1.6616702355460388e-06, "loss": 0.13414694368839264, "num_input_tokens_seen": 2208032, "step": 2147, "train_runtime": 6132.4952, "train_tokens_per_second": 360.054 }, { "epoch": 0.9180467998717812, "grad_norm": 1.9635981321334839, "learning_rate": 1.6531049250535334e-06, "loss": 0.1255420595407486, "num_input_tokens_seen": 2209026, "step": 2148, "train_runtime": 6134.6571, "train_tokens_per_second": 360.09 }, { "epoch": 0.9184741959611069, "grad_norm": 2.0642201900482178, "learning_rate": 1.6445396145610278e-06, "loss": 0.09459918737411499, "num_input_tokens_seen": 2209972, "step": 2149, "train_runtime": 6136.8829, "train_tokens_per_second": 360.113 }, { "epoch": 0.9189015920504328, "grad_norm": 1.7372931241989136, "learning_rate": 1.6359743040685227e-06, "loss": 0.09736011922359467, "num_input_tokens_seen": 2210930, "step": 2150, "train_runtime": 6139.0381, "train_tokens_per_second": 360.143 }, { "epoch": 0.9193289881397585, "grad_norm": 1.4585939645767212, "learning_rate": 1.6274089935760173e-06, "loss": 0.09436579048633575, "num_input_tokens_seen": 2212194, "step": 2151, "train_runtime": 6141.2223, "train_tokens_per_second": 360.22 }, { "epoch": 0.9197563842290843, "grad_norm": 2.0459043979644775, "learning_rate": 1.618843683083512e-06, "loss": 0.0974874496459961, "num_input_tokens_seen": 2213710, "step": 2152, "train_runtime": 6143.4894, "train_tokens_per_second": 360.334 }, { "epoch": 0.9201837803184101, "grad_norm": 2.7059218883514404, "learning_rate": 1.6102783725910064e-06, "loss": 0.11218500137329102, "num_input_tokens_seen": 2214468, "step": 2153, "train_runtime": 6145.5759, "train_tokens_per_second": 360.335 }, { "epoch": 0.9206111764077358, "grad_norm": 2.692477226257324, "learning_rate": 1.601713062098501e-06, "loss": 0.10696820914745331, "num_input_tokens_seen": 2215134, "step": 2154, "train_runtime": 6147.6204, "train_tokens_per_second": 360.324 }, { "epoch": 0.9210385724970617, "grad_norm": 1.9609453678131104, "learning_rate": 1.593147751605996e-06, "loss": 0.1086597591638565, "num_input_tokens_seen": 2216198, "step": 2155, "train_runtime": 6149.814, "train_tokens_per_second": 360.368 }, { "epoch": 0.9214659685863874, "grad_norm": 3.656251907348633, "learning_rate": 1.5845824411134905e-06, "loss": 0.12264759838581085, "num_input_tokens_seen": 2216962, "step": 2156, "train_runtime": 6151.9033, "train_tokens_per_second": 360.37 }, { "epoch": 0.9218933646757133, "grad_norm": 1.8970943689346313, "learning_rate": 1.5760171306209852e-06, "loss": 0.12525427341461182, "num_input_tokens_seen": 2218354, "step": 2157, "train_runtime": 6154.1869, "train_tokens_per_second": 360.463 }, { "epoch": 0.922320760765039, "grad_norm": 2.1047725677490234, "learning_rate": 1.5674518201284796e-06, "loss": 0.09674183279275894, "num_input_tokens_seen": 2219428, "step": 2158, "train_runtime": 6156.3285, "train_tokens_per_second": 360.512 }, { "epoch": 0.9227481568543647, "grad_norm": 1.7949364185333252, "learning_rate": 1.5588865096359745e-06, "loss": 0.09363202750682831, "num_input_tokens_seen": 2220526, "step": 2159, "train_runtime": 6158.5291, "train_tokens_per_second": 360.561 }, { "epoch": 0.9231755529436906, "grad_norm": 1.2715867757797241, "learning_rate": 1.550321199143469e-06, "loss": 0.0401017963886261, "num_input_tokens_seen": 2222110, "step": 2160, "train_runtime": 6160.9097, "train_tokens_per_second": 360.679 }, { "epoch": 0.9236029490330163, "grad_norm": 1.5644985437393188, "learning_rate": 1.5417558886509637e-06, "loss": 0.10436052829027176, "num_input_tokens_seen": 2223346, "step": 2161, "train_runtime": 6175.9247, "train_tokens_per_second": 360.002 }, { "epoch": 0.9240303451223422, "grad_norm": 2.236356019973755, "learning_rate": 1.5331905781584584e-06, "loss": 0.14996878802776337, "num_input_tokens_seen": 2224226, "step": 2162, "train_runtime": 6178.0318, "train_tokens_per_second": 360.022 }, { "epoch": 0.9244577412116679, "grad_norm": 1.6058436632156372, "learning_rate": 1.5246252676659532e-06, "loss": 0.07376152276992798, "num_input_tokens_seen": 2225198, "step": 2163, "train_runtime": 6180.2216, "train_tokens_per_second": 360.051 }, { "epoch": 0.9248851373009936, "grad_norm": 2.117514133453369, "learning_rate": 1.5160599571734477e-06, "loss": 0.07375172525644302, "num_input_tokens_seen": 2225796, "step": 2164, "train_runtime": 6182.3325, "train_tokens_per_second": 360.025 }, { "epoch": 0.9253125333903195, "grad_norm": 2.6839256286621094, "learning_rate": 1.5074946466809423e-06, "loss": 0.09135778993368149, "num_input_tokens_seen": 2226544, "step": 2165, "train_runtime": 6184.42, "train_tokens_per_second": 360.025 }, { "epoch": 0.9257399294796452, "grad_norm": 2.778290033340454, "learning_rate": 1.498929336188437e-06, "loss": 0.20278890430927277, "num_input_tokens_seen": 2227448, "step": 2166, "train_runtime": 6186.5296, "train_tokens_per_second": 360.048 }, { "epoch": 0.9261673255689711, "grad_norm": 1.92152738571167, "learning_rate": 1.4903640256959314e-06, "loss": 0.12577614188194275, "num_input_tokens_seen": 2229306, "step": 2167, "train_runtime": 6188.8938, "train_tokens_per_second": 360.211 }, { "epoch": 0.9265947216582968, "grad_norm": 1.8579258918762207, "learning_rate": 1.4817987152034262e-06, "loss": 0.14533375203609467, "num_input_tokens_seen": 2230718, "step": 2168, "train_runtime": 6191.3743, "train_tokens_per_second": 360.294 }, { "epoch": 0.9270221177476226, "grad_norm": 2.4688186645507812, "learning_rate": 1.4732334047109209e-06, "loss": 0.11172845959663391, "num_input_tokens_seen": 2231422, "step": 2169, "train_runtime": 6193.5658, "train_tokens_per_second": 360.281 }, { "epoch": 0.9274495138369484, "grad_norm": 1.9544367790222168, "learning_rate": 1.4646680942184155e-06, "loss": 0.08545652776956558, "num_input_tokens_seen": 2232340, "step": 2170, "train_runtime": 6195.6838, "train_tokens_per_second": 360.306 }, { "epoch": 0.9278769099262741, "grad_norm": 6.441534042358398, "learning_rate": 1.4561027837259102e-06, "loss": 0.16141225397586823, "num_input_tokens_seen": 2233880, "step": 2171, "train_runtime": 6197.9482, "train_tokens_per_second": 360.423 }, { "epoch": 0.9283043060156, "grad_norm": 2.048644781112671, "learning_rate": 1.447537473233405e-06, "loss": 0.08380210399627686, "num_input_tokens_seen": 2234980, "step": 2172, "train_runtime": 6200.1062, "train_tokens_per_second": 360.474 }, { "epoch": 0.9287317021049257, "grad_norm": 3.115220546722412, "learning_rate": 1.4389721627408994e-06, "loss": 0.17994233965873718, "num_input_tokens_seen": 2235902, "step": 2173, "train_runtime": 6202.2245, "train_tokens_per_second": 360.5 }, { "epoch": 0.9291590981942516, "grad_norm": 2.5104150772094727, "learning_rate": 1.430406852248394e-06, "loss": 0.10323172807693481, "num_input_tokens_seen": 2236840, "step": 2174, "train_runtime": 6204.3468, "train_tokens_per_second": 360.528 }, { "epoch": 0.9295864942835773, "grad_norm": 1.7411397695541382, "learning_rate": 1.4218415417558887e-06, "loss": 0.11698125302791595, "num_input_tokens_seen": 2238150, "step": 2175, "train_runtime": 6206.5923, "train_tokens_per_second": 360.609 }, { "epoch": 0.930013890372903, "grad_norm": 1.410210132598877, "learning_rate": 1.4132762312633836e-06, "loss": 0.09587608277797699, "num_input_tokens_seen": 2239322, "step": 2176, "train_runtime": 6208.7995, "train_tokens_per_second": 360.669 }, { "epoch": 0.9304412864622289, "grad_norm": 2.0049214363098145, "learning_rate": 1.4047109207708782e-06, "loss": 0.09810708463191986, "num_input_tokens_seen": 2240178, "step": 2177, "train_runtime": 6210.9299, "train_tokens_per_second": 360.683 }, { "epoch": 0.9308686825515546, "grad_norm": 2.021122455596924, "learning_rate": 1.3961456102783726e-06, "loss": 0.11581074446439743, "num_input_tokens_seen": 2241096, "step": 2178, "train_runtime": 6213.0862, "train_tokens_per_second": 360.706 }, { "epoch": 0.9312960786408805, "grad_norm": 2.5388717651367188, "learning_rate": 1.3875802997858673e-06, "loss": 0.15827855467796326, "num_input_tokens_seen": 2241958, "step": 2179, "train_runtime": 6215.206, "train_tokens_per_second": 360.721 }, { "epoch": 0.9317234747302062, "grad_norm": 1.569270133972168, "learning_rate": 1.379014989293362e-06, "loss": 0.07853906601667404, "num_input_tokens_seen": 2242900, "step": 2180, "train_runtime": 6217.2912, "train_tokens_per_second": 360.752 }, { "epoch": 0.932150870819532, "grad_norm": 2.9345450401306152, "learning_rate": 1.3704496788008568e-06, "loss": 0.14149774610996246, "num_input_tokens_seen": 2243884, "step": 2181, "train_runtime": 6219.4374, "train_tokens_per_second": 360.786 }, { "epoch": 0.9325782669088578, "grad_norm": 2.526463747024536, "learning_rate": 1.3618843683083512e-06, "loss": 0.11557620763778687, "num_input_tokens_seen": 2244708, "step": 2182, "train_runtime": 6221.55, "train_tokens_per_second": 360.796 }, { "epoch": 0.9330056629981835, "grad_norm": 2.2611868381500244, "learning_rate": 1.3533190578158458e-06, "loss": 0.11411857604980469, "num_input_tokens_seen": 2245648, "step": 2183, "train_runtime": 6223.6939, "train_tokens_per_second": 360.822 }, { "epoch": 0.9334330590875094, "grad_norm": 2.3254916667938232, "learning_rate": 1.3447537473233405e-06, "loss": 0.09124652296304703, "num_input_tokens_seen": 2246654, "step": 2184, "train_runtime": 6225.8453, "train_tokens_per_second": 360.859 }, { "epoch": 0.9338604551768351, "grad_norm": 2.4564313888549805, "learning_rate": 1.3361884368308353e-06, "loss": 0.14401093125343323, "num_input_tokens_seen": 2247496, "step": 2185, "train_runtime": 6227.9585, "train_tokens_per_second": 360.872 }, { "epoch": 0.9342878512661609, "grad_norm": 1.7827298641204834, "learning_rate": 1.32762312633833e-06, "loss": 0.09509570896625519, "num_input_tokens_seen": 2248292, "step": 2186, "train_runtime": 6230.0387, "train_tokens_per_second": 360.879 }, { "epoch": 0.9347152473554867, "grad_norm": 2.291931629180908, "learning_rate": 1.3190578158458244e-06, "loss": 0.1711120903491974, "num_input_tokens_seen": 2249290, "step": 2187, "train_runtime": 6232.1855, "train_tokens_per_second": 360.915 }, { "epoch": 0.9351426434448125, "grad_norm": 2.614119529724121, "learning_rate": 1.310492505353319e-06, "loss": 0.13640403747558594, "num_input_tokens_seen": 2250184, "step": 2188, "train_runtime": 6234.3052, "train_tokens_per_second": 360.936 }, { "epoch": 0.9355700395341383, "grad_norm": 1.8803365230560303, "learning_rate": 1.301927194860814e-06, "loss": 0.14787006378173828, "num_input_tokens_seen": 2251370, "step": 2189, "train_runtime": 6236.4828, "train_tokens_per_second": 361.0 }, { "epoch": 0.935997435623464, "grad_norm": 1.5116528272628784, "learning_rate": 1.2933618843683085e-06, "loss": 0.08433793485164642, "num_input_tokens_seen": 2252332, "step": 2190, "train_runtime": 6238.5978, "train_tokens_per_second": 361.032 }, { "epoch": 0.9364248317127898, "grad_norm": 2.7714686393737793, "learning_rate": 1.2847965738758032e-06, "loss": 0.09387312084436417, "num_input_tokens_seen": 2252888, "step": 2191, "train_runtime": 6253.9568, "train_tokens_per_second": 360.234 }, { "epoch": 0.9368522278021156, "grad_norm": 2.0574734210968018, "learning_rate": 1.2762312633832976e-06, "loss": 0.07626340538263321, "num_input_tokens_seen": 2254060, "step": 2192, "train_runtime": 6256.1293, "train_tokens_per_second": 360.296 }, { "epoch": 0.9372796238914414, "grad_norm": 2.5031521320343018, "learning_rate": 1.2676659528907925e-06, "loss": 0.19402307271957397, "num_input_tokens_seen": 2255156, "step": 2193, "train_runtime": 6258.3375, "train_tokens_per_second": 360.344 }, { "epoch": 0.9377070199807672, "grad_norm": 2.2177932262420654, "learning_rate": 1.2591006423982871e-06, "loss": 0.09253498911857605, "num_input_tokens_seen": 2256090, "step": 2194, "train_runtime": 6260.4569, "train_tokens_per_second": 360.371 }, { "epoch": 0.938134416070093, "grad_norm": 1.9994310140609741, "learning_rate": 1.2505353319057818e-06, "loss": 0.07868780195713043, "num_input_tokens_seen": 2256706, "step": 2195, "train_runtime": 6262.5403, "train_tokens_per_second": 360.35 }, { "epoch": 0.9385618121594187, "grad_norm": 2.661285638809204, "learning_rate": 1.2419700214132762e-06, "loss": 0.2149825394153595, "num_input_tokens_seen": 2257434, "step": 2196, "train_runtime": 6264.6755, "train_tokens_per_second": 360.343 }, { "epoch": 0.9389892082487445, "grad_norm": 2.630244493484497, "learning_rate": 1.233404710920771e-06, "loss": 0.1728074997663498, "num_input_tokens_seen": 2258554, "step": 2197, "train_runtime": 6266.8603, "train_tokens_per_second": 360.396 }, { "epoch": 0.9394166043380703, "grad_norm": 2.7600960731506348, "learning_rate": 1.2248394004282657e-06, "loss": 0.11109723150730133, "num_input_tokens_seen": 2259392, "step": 2198, "train_runtime": 6268.9457, "train_tokens_per_second": 360.41 }, { "epoch": 0.9398440004273961, "grad_norm": 1.9871920347213745, "learning_rate": 1.2162740899357603e-06, "loss": 0.1423594057559967, "num_input_tokens_seen": 2260566, "step": 2199, "train_runtime": 6271.1231, "train_tokens_per_second": 360.472 }, { "epoch": 0.9402713965167219, "grad_norm": 1.2453151941299438, "learning_rate": 1.207708779443255e-06, "loss": 0.08043745905160904, "num_input_tokens_seen": 2262194, "step": 2200, "train_runtime": 6273.4187, "train_tokens_per_second": 360.6 }, { "epoch": 0.9406987926060476, "grad_norm": 1.9367234706878662, "learning_rate": 1.1991434689507496e-06, "loss": 0.14686185121536255, "num_input_tokens_seen": 2263188, "step": 2201, "train_runtime": 6275.5482, "train_tokens_per_second": 360.636 }, { "epoch": 0.9411261886953735, "grad_norm": 1.8235828876495361, "learning_rate": 1.1905781584582442e-06, "loss": 0.07379249483346939, "num_input_tokens_seen": 2263944, "step": 2202, "train_runtime": 6277.7278, "train_tokens_per_second": 360.631 }, { "epoch": 0.9415535847846992, "grad_norm": 3.4732439517974854, "learning_rate": 1.1820128479657389e-06, "loss": 0.17212432622909546, "num_input_tokens_seen": 2264748, "step": 2203, "train_runtime": 6279.8993, "train_tokens_per_second": 360.634 }, { "epoch": 0.941980980874025, "grad_norm": 1.7110310792922974, "learning_rate": 1.1734475374732335e-06, "loss": 0.06450486183166504, "num_input_tokens_seen": 2265692, "step": 2204, "train_runtime": 6282.0373, "train_tokens_per_second": 360.662 }, { "epoch": 0.9424083769633508, "grad_norm": 2.265634536743164, "learning_rate": 1.1648822269807282e-06, "loss": 0.14018739759922028, "num_input_tokens_seen": 2266638, "step": 2205, "train_runtime": 6284.1744, "train_tokens_per_second": 360.69 }, { "epoch": 0.9428357730526765, "grad_norm": 1.6523348093032837, "learning_rate": 1.1563169164882228e-06, "loss": 0.07057573646306992, "num_input_tokens_seen": 2267848, "step": 2206, "train_runtime": 6286.3788, "train_tokens_per_second": 360.756 }, { "epoch": 0.9432631691420024, "grad_norm": 2.683692455291748, "learning_rate": 1.1477516059957174e-06, "loss": 0.11395564675331116, "num_input_tokens_seen": 2268764, "step": 2207, "train_runtime": 6288.5082, "train_tokens_per_second": 360.779 }, { "epoch": 0.9436905652313281, "grad_norm": 2.452878713607788, "learning_rate": 1.139186295503212e-06, "loss": 0.11282587796449661, "num_input_tokens_seen": 2269744, "step": 2208, "train_runtime": 6290.7039, "train_tokens_per_second": 360.809 }, { "epoch": 0.944117961320654, "grad_norm": 1.4998728036880493, "learning_rate": 1.1306209850107067e-06, "loss": 0.07952351868152618, "num_input_tokens_seen": 2270726, "step": 2209, "train_runtime": 6292.8252, "train_tokens_per_second": 360.844 }, { "epoch": 0.9445453574099797, "grad_norm": 1.8244997262954712, "learning_rate": 1.1220556745182014e-06, "loss": 0.10631820559501648, "num_input_tokens_seen": 2271722, "step": 2210, "train_runtime": 6294.9451, "train_tokens_per_second": 360.88 }, { "epoch": 0.9449727534993054, "grad_norm": 2.2881040573120117, "learning_rate": 1.113490364025696e-06, "loss": 0.15813925862312317, "num_input_tokens_seen": 2272812, "step": 2211, "train_runtime": 6297.1243, "train_tokens_per_second": 360.929 }, { "epoch": 0.9454001495886313, "grad_norm": 1.7550806999206543, "learning_rate": 1.1049250535331907e-06, "loss": 0.148911714553833, "num_input_tokens_seen": 2274198, "step": 2212, "train_runtime": 6299.3493, "train_tokens_per_second": 361.021 }, { "epoch": 0.945827545677957, "grad_norm": 3.03024959564209, "learning_rate": 1.0963597430406853e-06, "loss": 0.15858499705791473, "num_input_tokens_seen": 2275008, "step": 2213, "train_runtime": 6301.4308, "train_tokens_per_second": 361.03 }, { "epoch": 0.9462549417672829, "grad_norm": 2.3329412937164307, "learning_rate": 1.08779443254818e-06, "loss": 0.1374865621328354, "num_input_tokens_seen": 2275952, "step": 2214, "train_runtime": 6303.5432, "train_tokens_per_second": 361.059 }, { "epoch": 0.9466823378566086, "grad_norm": 1.7251203060150146, "learning_rate": 1.0792291220556746e-06, "loss": 0.11180976778268814, "num_input_tokens_seen": 2277670, "step": 2215, "train_runtime": 6305.829, "train_tokens_per_second": 361.201 }, { "epoch": 0.9471097339459343, "grad_norm": 2.2906625270843506, "learning_rate": 1.0706638115631692e-06, "loss": 0.11002357304096222, "num_input_tokens_seen": 2278466, "step": 2216, "train_runtime": 6307.9257, "train_tokens_per_second": 361.207 }, { "epoch": 0.9475371300352602, "grad_norm": 1.9278420209884644, "learning_rate": 1.0620985010706639e-06, "loss": 0.12338389456272125, "num_input_tokens_seen": 2279650, "step": 2217, "train_runtime": 6310.0843, "train_tokens_per_second": 361.271 }, { "epoch": 0.9479645261245859, "grad_norm": 2.5601234436035156, "learning_rate": 1.0535331905781585e-06, "loss": 0.12740349769592285, "num_input_tokens_seen": 2280504, "step": 2218, "train_runtime": 6312.1943, "train_tokens_per_second": 361.285 }, { "epoch": 0.9483919222139118, "grad_norm": 2.1307919025421143, "learning_rate": 1.0449678800856531e-06, "loss": 0.11471974849700928, "num_input_tokens_seen": 2281424, "step": 2219, "train_runtime": 6314.31, "train_tokens_per_second": 361.31 }, { "epoch": 0.9488193183032375, "grad_norm": 2.013857126235962, "learning_rate": 1.036402569593148e-06, "loss": 0.07748252153396606, "num_input_tokens_seen": 2282100, "step": 2220, "train_runtime": 6316.3658, "train_tokens_per_second": 361.3 }, { "epoch": 0.9492467143925634, "grad_norm": 2.6721012592315674, "learning_rate": 1.0278372591006424e-06, "loss": 0.13700446486473083, "num_input_tokens_seen": 2283032, "step": 2221, "train_runtime": 6332.1333, "train_tokens_per_second": 360.547 }, { "epoch": 0.9496741104818891, "grad_norm": 1.6228680610656738, "learning_rate": 1.0192719486081373e-06, "loss": 0.07596968859434128, "num_input_tokens_seen": 2284202, "step": 2222, "train_runtime": 6334.3453, "train_tokens_per_second": 360.606 }, { "epoch": 0.9501015065712148, "grad_norm": 1.7751622200012207, "learning_rate": 1.0107066381156317e-06, "loss": 0.056691914796829224, "num_input_tokens_seen": 2285314, "step": 2223, "train_runtime": 6336.5258, "train_tokens_per_second": 360.657 }, { "epoch": 0.9505289026605407, "grad_norm": 2.450216054916382, "learning_rate": 1.0021413276231263e-06, "loss": 0.13718266785144806, "num_input_tokens_seen": 2286416, "step": 2224, "train_runtime": 6338.744, "train_tokens_per_second": 360.705 }, { "epoch": 0.9509562987498664, "grad_norm": 1.9348093271255493, "learning_rate": 9.93576017130621e-07, "loss": 0.11827270686626434, "num_input_tokens_seen": 2287386, "step": 2225, "train_runtime": 6340.8871, "train_tokens_per_second": 360.736 }, { "epoch": 0.9513836948391923, "grad_norm": 2.0023467540740967, "learning_rate": 9.850107066381156e-07, "loss": 0.11400140076875687, "num_input_tokens_seen": 2288430, "step": 2226, "train_runtime": 6343.1042, "train_tokens_per_second": 360.774 }, { "epoch": 0.951811090928518, "grad_norm": 2.965432643890381, "learning_rate": 9.764453961456103e-07, "loss": 0.19582927227020264, "num_input_tokens_seen": 2289104, "step": 2227, "train_runtime": 6345.1677, "train_tokens_per_second": 360.763 }, { "epoch": 0.9522384870178437, "grad_norm": 1.784056544303894, "learning_rate": 9.67880085653105e-07, "loss": 0.11103382706642151, "num_input_tokens_seen": 2290770, "step": 2228, "train_runtime": 6347.5155, "train_tokens_per_second": 360.892 }, { "epoch": 0.9526658831071696, "grad_norm": 1.949532389640808, "learning_rate": 9.593147751605998e-07, "loss": 0.10877189040184021, "num_input_tokens_seen": 2292226, "step": 2229, "train_runtime": 6349.7668, "train_tokens_per_second": 360.994 }, { "epoch": 0.9530932791964953, "grad_norm": 1.9729379415512085, "learning_rate": 9.507494646680943e-07, "loss": 0.11898594349622726, "num_input_tokens_seen": 2293084, "step": 2230, "train_runtime": 6351.897, "train_tokens_per_second": 361.008 }, { "epoch": 0.9535206752858212, "grad_norm": 1.3747807741165161, "learning_rate": 9.421841541755889e-07, "loss": 0.08915519714355469, "num_input_tokens_seen": 2294576, "step": 2231, "train_runtime": 6354.3369, "train_tokens_per_second": 361.104 }, { "epoch": 0.9539480713751469, "grad_norm": 2.2704765796661377, "learning_rate": 9.336188436830836e-07, "loss": 0.1116451770067215, "num_input_tokens_seen": 2295456, "step": 2232, "train_runtime": 6356.4698, "train_tokens_per_second": 361.121 }, { "epoch": 0.9543754674644727, "grad_norm": 2.8969857692718506, "learning_rate": 9.250535331905783e-07, "loss": 0.11565807461738586, "num_input_tokens_seen": 2296482, "step": 2233, "train_runtime": 6358.5973, "train_tokens_per_second": 361.162 }, { "epoch": 0.9548028635537985, "grad_norm": 2.5981929302215576, "learning_rate": 9.164882226980729e-07, "loss": 0.11579366028308868, "num_input_tokens_seen": 2297264, "step": 2234, "train_runtime": 6360.6838, "train_tokens_per_second": 361.166 }, { "epoch": 0.9552302596431242, "grad_norm": 2.0432050228118896, "learning_rate": 9.079229122055676e-07, "loss": 0.18046244978904724, "num_input_tokens_seen": 2298784, "step": 2235, "train_runtime": 6363.0184, "train_tokens_per_second": 361.273 }, { "epoch": 0.9556576557324501, "grad_norm": 1.764160394668579, "learning_rate": 8.993576017130621e-07, "loss": 0.07814285904169083, "num_input_tokens_seen": 2299798, "step": 2236, "train_runtime": 6365.1335, "train_tokens_per_second": 361.312 }, { "epoch": 0.9560850518217758, "grad_norm": 1.0686864852905273, "learning_rate": 8.907922912205569e-07, "loss": 0.04905345290899277, "num_input_tokens_seen": 2301808, "step": 2237, "train_runtime": 6367.5439, "train_tokens_per_second": 361.491 }, { "epoch": 0.9565124479111016, "grad_norm": 1.8639577627182007, "learning_rate": 8.822269807280514e-07, "loss": 0.07290835678577423, "num_input_tokens_seen": 2302694, "step": 2238, "train_runtime": 6369.6333, "train_tokens_per_second": 361.511 }, { "epoch": 0.9569398440004274, "grad_norm": 2.1470258235931396, "learning_rate": 8.736616702355461e-07, "loss": 0.16135422885417938, "num_input_tokens_seen": 2303744, "step": 2239, "train_runtime": 6371.7763, "train_tokens_per_second": 361.554 }, { "epoch": 0.9573672400897532, "grad_norm": 2.3782074451446533, "learning_rate": 8.650963597430407e-07, "loss": 0.1434607356786728, "num_input_tokens_seen": 2304580, "step": 2240, "train_runtime": 6374.0615, "train_tokens_per_second": 361.556 }, { "epoch": 0.957794636179079, "grad_norm": 2.3785908222198486, "learning_rate": 8.565310492505354e-07, "loss": 0.11133638024330139, "num_input_tokens_seen": 2305478, "step": 2241, "train_runtime": 6376.155, "train_tokens_per_second": 361.578 }, { "epoch": 0.9582220322684047, "grad_norm": 1.9879435300827026, "learning_rate": 8.479657387580301e-07, "loss": 0.09714030474424362, "num_input_tokens_seen": 2306700, "step": 2242, "train_runtime": 6378.3598, "train_tokens_per_second": 361.645 }, { "epoch": 0.9586494283577305, "grad_norm": 1.6205159425735474, "learning_rate": 8.394004282655246e-07, "loss": 0.10126176476478577, "num_input_tokens_seen": 2307916, "step": 2243, "train_runtime": 6380.6504, "train_tokens_per_second": 361.705 }, { "epoch": 0.9590768244470563, "grad_norm": 2.169267416000366, "learning_rate": 8.308351177730194e-07, "loss": 0.09987229853868484, "num_input_tokens_seen": 2308914, "step": 2244, "train_runtime": 6382.7974, "train_tokens_per_second": 361.74 }, { "epoch": 0.9595042205363821, "grad_norm": 2.731926918029785, "learning_rate": 8.222698072805139e-07, "loss": 0.14484712481498718, "num_input_tokens_seen": 2309942, "step": 2245, "train_runtime": 6385.0203, "train_tokens_per_second": 361.775 }, { "epoch": 0.9599316166257079, "grad_norm": 2.236884832382202, "learning_rate": 8.137044967880087e-07, "loss": 0.1355789750814438, "num_input_tokens_seen": 2311726, "step": 2246, "train_runtime": 6387.5251, "train_tokens_per_second": 361.913 }, { "epoch": 0.9603590127150337, "grad_norm": 1.772127628326416, "learning_rate": 8.051391862955032e-07, "loss": 0.13237515091896057, "num_input_tokens_seen": 2313058, "step": 2247, "train_runtime": 6389.7488, "train_tokens_per_second": 361.995 }, { "epoch": 0.9607864088043594, "grad_norm": 1.7337534427642822, "learning_rate": 7.96573875802998e-07, "loss": 0.0806911364197731, "num_input_tokens_seen": 2313840, "step": 2248, "train_runtime": 6391.8282, "train_tokens_per_second": 362.0 }, { "epoch": 0.9612138048936852, "grad_norm": 2.1230995655059814, "learning_rate": 7.880085653104926e-07, "loss": 0.07250198721885681, "num_input_tokens_seen": 2314458, "step": 2249, "train_runtime": 6393.8912, "train_tokens_per_second": 361.98 }, { "epoch": 0.961641200983011, "grad_norm": 2.5727736949920654, "learning_rate": 7.794432548179872e-07, "loss": 0.1578446328639984, "num_input_tokens_seen": 2315338, "step": 2250, "train_runtime": 6396.012, "train_tokens_per_second": 361.997 }, { "epoch": 0.9620685970723368, "grad_norm": 1.7777867317199707, "learning_rate": 7.708779443254819e-07, "loss": 0.08421089500188828, "num_input_tokens_seen": 2316192, "step": 2251, "train_runtime": 6411.3235, "train_tokens_per_second": 361.266 }, { "epoch": 0.9624959931616626, "grad_norm": 2.402330160140991, "learning_rate": 7.623126338329766e-07, "loss": 0.09016932547092438, "num_input_tokens_seen": 2316778, "step": 2252, "train_runtime": 6413.4176, "train_tokens_per_second": 361.239 }, { "epoch": 0.9629233892509883, "grad_norm": 2.3819189071655273, "learning_rate": 7.537473233404712e-07, "loss": 0.11348990350961685, "num_input_tokens_seen": 2317742, "step": 2253, "train_runtime": 6415.5698, "train_tokens_per_second": 361.268 }, { "epoch": 0.9633507853403142, "grad_norm": 1.623209834098816, "learning_rate": 7.451820128479657e-07, "loss": 0.08871584385633469, "num_input_tokens_seen": 2321922, "step": 2254, "train_runtime": 6418.6006, "train_tokens_per_second": 361.749 }, { "epoch": 0.9637781814296399, "grad_norm": 2.3695406913757324, "learning_rate": 7.366167023554604e-07, "loss": 0.13163965940475464, "num_input_tokens_seen": 2323026, "step": 2255, "train_runtime": 6420.8085, "train_tokens_per_second": 361.796 }, { "epoch": 0.9642055775189657, "grad_norm": 1.9549775123596191, "learning_rate": 7.280513918629551e-07, "loss": 0.07309918105602264, "num_input_tokens_seen": 2323952, "step": 2256, "train_runtime": 6422.9669, "train_tokens_per_second": 361.819 }, { "epoch": 0.9646329736082915, "grad_norm": 2.207444190979004, "learning_rate": 7.194860813704497e-07, "loss": 0.12332557886838913, "num_input_tokens_seen": 2324858, "step": 2257, "train_runtime": 6425.106, "train_tokens_per_second": 361.84 }, { "epoch": 0.9650603696976172, "grad_norm": 3.473109245300293, "learning_rate": 7.109207708779444e-07, "loss": 0.2562761902809143, "num_input_tokens_seen": 2325884, "step": 2258, "train_runtime": 6427.302, "train_tokens_per_second": 361.876 }, { "epoch": 0.9654877657869431, "grad_norm": 2.498882293701172, "learning_rate": 7.023554603854391e-07, "loss": 0.19789862632751465, "num_input_tokens_seen": 2326978, "step": 2259, "train_runtime": 6429.523, "train_tokens_per_second": 361.921 }, { "epoch": 0.9659151618762688, "grad_norm": 1.760019063949585, "learning_rate": 6.937901498929336e-07, "loss": 0.12633845210075378, "num_input_tokens_seen": 2328416, "step": 2260, "train_runtime": 6431.8336, "train_tokens_per_second": 362.014 }, { "epoch": 0.9663425579655947, "grad_norm": 1.3640952110290527, "learning_rate": 6.852248394004284e-07, "loss": 0.09452258795499802, "num_input_tokens_seen": 2329686, "step": 2261, "train_runtime": 6434.0507, "train_tokens_per_second": 362.087 }, { "epoch": 0.9667699540549204, "grad_norm": 1.9603149890899658, "learning_rate": 6.766595289079229e-07, "loss": 0.13206544518470764, "num_input_tokens_seen": 2330696, "step": 2262, "train_runtime": 6436.176, "train_tokens_per_second": 362.124 }, { "epoch": 0.9671973501442461, "grad_norm": 1.6893534660339355, "learning_rate": 6.680942184154177e-07, "loss": 0.10741037130355835, "num_input_tokens_seen": 2332482, "step": 2263, "train_runtime": 6438.6272, "train_tokens_per_second": 362.264 }, { "epoch": 0.967624746233572, "grad_norm": 3.0966036319732666, "learning_rate": 6.595289079229122e-07, "loss": 0.08812056481838226, "num_input_tokens_seen": 2333176, "step": 2264, "train_runtime": 6440.7211, "train_tokens_per_second": 362.254 }, { "epoch": 0.9680521423228977, "grad_norm": 2.3517308235168457, "learning_rate": 6.50963597430407e-07, "loss": 0.11002682149410248, "num_input_tokens_seen": 2333958, "step": 2265, "train_runtime": 6442.8236, "train_tokens_per_second": 362.257 }, { "epoch": 0.9684795384122236, "grad_norm": 1.4718528985977173, "learning_rate": 6.423982869379016e-07, "loss": 0.05557046830654144, "num_input_tokens_seen": 2334746, "step": 2266, "train_runtime": 6444.9207, "train_tokens_per_second": 362.261 }, { "epoch": 0.9689069345015493, "grad_norm": 2.590261459350586, "learning_rate": 6.338329764453962e-07, "loss": 0.1500324308872223, "num_input_tokens_seen": 2335400, "step": 2267, "train_runtime": 6446.9973, "train_tokens_per_second": 362.246 }, { "epoch": 0.9693343305908751, "grad_norm": 1.993656039237976, "learning_rate": 6.252676659528909e-07, "loss": 0.10073862969875336, "num_input_tokens_seen": 2336252, "step": 2268, "train_runtime": 6449.1216, "train_tokens_per_second": 362.259 }, { "epoch": 0.9697617266802009, "grad_norm": 1.485280990600586, "learning_rate": 6.167023554603855e-07, "loss": 0.07764092832803726, "num_input_tokens_seen": 2337326, "step": 2269, "train_runtime": 6451.2431, "train_tokens_per_second": 362.306 }, { "epoch": 0.9701891227695266, "grad_norm": 1.4382826089859009, "learning_rate": 6.081370449678802e-07, "loss": 0.07743801176548004, "num_input_tokens_seen": 2338610, "step": 2270, "train_runtime": 6453.5171, "train_tokens_per_second": 362.378 }, { "epoch": 0.9706165188588525, "grad_norm": 1.6957790851593018, "learning_rate": 5.995717344753748e-07, "loss": 0.10481047630310059, "num_input_tokens_seen": 2339596, "step": 2271, "train_runtime": 6455.6628, "train_tokens_per_second": 362.41 }, { "epoch": 0.9710439149481782, "grad_norm": 2.0110061168670654, "learning_rate": 5.910064239828694e-07, "loss": 0.09708850085735321, "num_input_tokens_seen": 2340366, "step": 2272, "train_runtime": 6457.7634, "train_tokens_per_second": 362.411 }, { "epoch": 0.9714713110375041, "grad_norm": 1.905444622039795, "learning_rate": 5.824411134903641e-07, "loss": 0.1202760860323906, "num_input_tokens_seen": 2341696, "step": 2273, "train_runtime": 6460.0193, "train_tokens_per_second": 362.491 }, { "epoch": 0.9718987071268298, "grad_norm": 1.7708470821380615, "learning_rate": 5.738758029978587e-07, "loss": 0.08399561792612076, "num_input_tokens_seen": 2342896, "step": 2274, "train_runtime": 6462.2003, "train_tokens_per_second": 362.554 }, { "epoch": 0.9723261032161555, "grad_norm": 2.622191905975342, "learning_rate": 5.653104925053534e-07, "loss": 0.15275554358959198, "num_input_tokens_seen": 2343656, "step": 2275, "train_runtime": 6464.3842, "train_tokens_per_second": 362.549 }, { "epoch": 0.9727534993054814, "grad_norm": 1.6968332529067993, "learning_rate": 5.56745182012848e-07, "loss": 0.0814053863286972, "num_input_tokens_seen": 2344640, "step": 2276, "train_runtime": 6466.5177, "train_tokens_per_second": 362.582 }, { "epoch": 0.9731808953948071, "grad_norm": 2.2818408012390137, "learning_rate": 5.481798715203426e-07, "loss": 0.11397511512041092, "num_input_tokens_seen": 2345396, "step": 2277, "train_runtime": 6468.6138, "train_tokens_per_second": 362.581 }, { "epoch": 0.973608291484133, "grad_norm": 2.438965082168579, "learning_rate": 5.396145610278373e-07, "loss": 0.08640653640031815, "num_input_tokens_seen": 2346082, "step": 2278, "train_runtime": 6470.7034, "train_tokens_per_second": 362.57 }, { "epoch": 0.9740356875734587, "grad_norm": 2.3783671855926514, "learning_rate": 5.310492505353319e-07, "loss": 0.09214045107364655, "num_input_tokens_seen": 2347168, "step": 2279, "train_runtime": 6472.8492, "train_tokens_per_second": 362.617 }, { "epoch": 0.9744630836627844, "grad_norm": 0.6727636456489563, "learning_rate": 5.224839400428266e-07, "loss": 0.032508477568626404, "num_input_tokens_seen": 2349502, "step": 2280, "train_runtime": 6475.3257, "train_tokens_per_second": 362.839 }, { "epoch": 0.9748904797521103, "grad_norm": 2.8930814266204834, "learning_rate": 5.139186295503212e-07, "loss": 0.21806089580059052, "num_input_tokens_seen": 2350714, "step": 2281, "train_runtime": 6490.4132, "train_tokens_per_second": 362.182 }, { "epoch": 0.975317875841436, "grad_norm": 2.5931508541107178, "learning_rate": 5.053533190578159e-07, "loss": 0.14860136806964874, "num_input_tokens_seen": 2351552, "step": 2282, "train_runtime": 6492.7312, "train_tokens_per_second": 362.182 }, { "epoch": 0.9757452719307619, "grad_norm": 3.401522397994995, "learning_rate": 4.967880085653105e-07, "loss": 0.10294843465089798, "num_input_tokens_seen": 2352132, "step": 2283, "train_runtime": 6494.8275, "train_tokens_per_second": 362.155 }, { "epoch": 0.9761726680200876, "grad_norm": 2.069591760635376, "learning_rate": 4.882226980728051e-07, "loss": 0.14203792810440063, "num_input_tokens_seen": 2353134, "step": 2284, "train_runtime": 6496.9418, "train_tokens_per_second": 362.191 }, { "epoch": 0.9766000641094134, "grad_norm": 2.228440999984741, "learning_rate": 4.796573875802999e-07, "loss": 0.1333804875612259, "num_input_tokens_seen": 2354438, "step": 2285, "train_runtime": 6499.1867, "train_tokens_per_second": 362.267 }, { "epoch": 0.9770274601987392, "grad_norm": 2.26059889793396, "learning_rate": 4.7109207708779447e-07, "loss": 0.11457064747810364, "num_input_tokens_seen": 2355542, "step": 2286, "train_runtime": 6501.369, "train_tokens_per_second": 362.315 }, { "epoch": 0.9774548562880649, "grad_norm": 2.384274482727051, "learning_rate": 4.6252676659528916e-07, "loss": 0.1596628576517105, "num_input_tokens_seen": 2356584, "step": 2287, "train_runtime": 6503.5301, "train_tokens_per_second": 362.355 }, { "epoch": 0.9778822523773908, "grad_norm": 1.4895464181900024, "learning_rate": 4.539614561027838e-07, "loss": 0.07566003501415253, "num_input_tokens_seen": 2357818, "step": 2288, "train_runtime": 6505.7251, "train_tokens_per_second": 362.422 }, { "epoch": 0.9783096484667165, "grad_norm": 2.15805983543396, "learning_rate": 4.4539614561027845e-07, "loss": 0.09752707928419113, "num_input_tokens_seen": 2358784, "step": 2289, "train_runtime": 6507.8805, "train_tokens_per_second": 362.45 }, { "epoch": 0.9787370445560423, "grad_norm": 2.4952399730682373, "learning_rate": 4.3683083511777304e-07, "loss": 0.13019385933876038, "num_input_tokens_seen": 2359760, "step": 2290, "train_runtime": 6509.9955, "train_tokens_per_second": 362.483 }, { "epoch": 0.9791644406453681, "grad_norm": 1.743445873260498, "learning_rate": 4.282655246252677e-07, "loss": 0.10978066921234131, "num_input_tokens_seen": 2361362, "step": 2291, "train_runtime": 6512.3155, "train_tokens_per_second": 362.599 }, { "epoch": 0.9795918367346939, "grad_norm": 1.9156111478805542, "learning_rate": 4.197002141327623e-07, "loss": 0.1504976600408554, "num_input_tokens_seen": 2362814, "step": 2292, "train_runtime": 6514.5633, "train_tokens_per_second": 362.697 }, { "epoch": 0.9800192328240197, "grad_norm": 2.2794599533081055, "learning_rate": 4.1113490364025696e-07, "loss": 0.1144682988524437, "num_input_tokens_seen": 2363820, "step": 2293, "train_runtime": 6516.7099, "train_tokens_per_second": 362.732 }, { "epoch": 0.9804466289133454, "grad_norm": 2.0237250328063965, "learning_rate": 4.025695931477516e-07, "loss": 0.08876486122608185, "num_input_tokens_seen": 2364828, "step": 2294, "train_runtime": 6518.9678, "train_tokens_per_second": 362.761 }, { "epoch": 0.9808740250026712, "grad_norm": 2.732961654663086, "learning_rate": 3.940042826552463e-07, "loss": 0.11550743132829666, "num_input_tokens_seen": 2365708, "step": 2295, "train_runtime": 6521.2268, "train_tokens_per_second": 362.77 }, { "epoch": 0.981301421091997, "grad_norm": 2.0385289192199707, "learning_rate": 3.8543897216274094e-07, "loss": 0.13856062293052673, "num_input_tokens_seen": 2367262, "step": 2296, "train_runtime": 6523.604, "train_tokens_per_second": 362.876 }, { "epoch": 0.9817288171813228, "grad_norm": 1.6851669549942017, "learning_rate": 3.768736616702356e-07, "loss": 0.07964836061000824, "num_input_tokens_seen": 2368474, "step": 2297, "train_runtime": 6525.8508, "train_tokens_per_second": 362.937 }, { "epoch": 0.9821562132706486, "grad_norm": 2.9046151638031006, "learning_rate": 3.683083511777302e-07, "loss": 0.14407159388065338, "num_input_tokens_seen": 2369186, "step": 2298, "train_runtime": 6527.9394, "train_tokens_per_second": 362.93 }, { "epoch": 0.9825836093599744, "grad_norm": 3.110792636871338, "learning_rate": 3.5974304068522486e-07, "loss": 0.16244590282440186, "num_input_tokens_seen": 2369774, "step": 2299, "train_runtime": 6530.0288, "train_tokens_per_second": 362.904 }, { "epoch": 0.9830110054493001, "grad_norm": 2.2708139419555664, "learning_rate": 3.5117773019271955e-07, "loss": 0.15077875554561615, "num_input_tokens_seen": 2370796, "step": 2300, "train_runtime": 6532.1866, "train_tokens_per_second": 362.941 }, { "epoch": 0.9834384015386259, "grad_norm": 2.3511099815368652, "learning_rate": 3.426124197002142e-07, "loss": 0.09174051880836487, "num_input_tokens_seen": 2371418, "step": 2301, "train_runtime": 6534.2714, "train_tokens_per_second": 362.92 }, { "epoch": 0.9838657976279517, "grad_norm": 2.583130359649658, "learning_rate": 3.3404710920770884e-07, "loss": 0.1318972408771515, "num_input_tokens_seen": 2372554, "step": 2302, "train_runtime": 6536.4675, "train_tokens_per_second": 362.972 }, { "epoch": 0.9842931937172775, "grad_norm": 2.371422052383423, "learning_rate": 3.254817987152035e-07, "loss": 0.09066414088010788, "num_input_tokens_seen": 2373208, "step": 2303, "train_runtime": 6538.5724, "train_tokens_per_second": 362.955 }, { "epoch": 0.9847205898066033, "grad_norm": 2.0554943084716797, "learning_rate": 3.169164882226981e-07, "loss": 0.15738482773303986, "num_input_tokens_seen": 2374430, "step": 2304, "train_runtime": 6540.8383, "train_tokens_per_second": 363.016 }, { "epoch": 0.985147985895929, "grad_norm": 1.8453145027160645, "learning_rate": 3.0835117773019276e-07, "loss": 0.07406944036483765, "num_input_tokens_seen": 2375258, "step": 2305, "train_runtime": 6542.9771, "train_tokens_per_second": 363.024 }, { "epoch": 0.9855753819852549, "grad_norm": 2.6142683029174805, "learning_rate": 2.997858672376874e-07, "loss": 0.14879421889781952, "num_input_tokens_seen": 2376102, "step": 2306, "train_runtime": 6545.0728, "train_tokens_per_second": 363.037 }, { "epoch": 0.9860027780745806, "grad_norm": 2.0397894382476807, "learning_rate": 2.9122055674518204e-07, "loss": 0.09611496329307556, "num_input_tokens_seen": 2376956, "step": 2307, "train_runtime": 6547.1743, "train_tokens_per_second": 363.051 }, { "epoch": 0.9864301741639064, "grad_norm": 1.4848425388336182, "learning_rate": 2.826552462526767e-07, "loss": 0.11446449160575867, "num_input_tokens_seen": 2378598, "step": 2308, "train_runtime": 6549.4904, "train_tokens_per_second": 363.173 }, { "epoch": 0.9868575702532322, "grad_norm": 1.0367766618728638, "learning_rate": 2.740899357601713e-07, "loss": 0.05775771662592888, "num_input_tokens_seen": 2380048, "step": 2309, "train_runtime": 6551.7641, "train_tokens_per_second": 363.268 }, { "epoch": 0.9872849663425579, "grad_norm": 4.0265374183654785, "learning_rate": 2.6552462526766596e-07, "loss": 0.10849352180957794, "num_input_tokens_seen": 2380694, "step": 2310, "train_runtime": 6553.8147, "train_tokens_per_second": 363.253 }, { "epoch": 0.9877123624318838, "grad_norm": 1.7938623428344727, "learning_rate": 2.569593147751606e-07, "loss": 0.10859374701976776, "num_input_tokens_seen": 2381864, "step": 2311, "train_runtime": 6569.2772, "train_tokens_per_second": 362.576 }, { "epoch": 0.9881397585212095, "grad_norm": 1.9426965713500977, "learning_rate": 2.4839400428265525e-07, "loss": 0.10978542268276215, "num_input_tokens_seen": 2382784, "step": 2312, "train_runtime": 6571.4029, "train_tokens_per_second": 362.599 }, { "epoch": 0.9885671546105353, "grad_norm": 2.9520535469055176, "learning_rate": 2.3982869379014994e-07, "loss": 0.23505353927612305, "num_input_tokens_seen": 2383892, "step": 2313, "train_runtime": 6573.5515, "train_tokens_per_second": 362.649 }, { "epoch": 0.9889945506998611, "grad_norm": 2.254528045654297, "learning_rate": 2.3126338329764458e-07, "loss": 0.11766743659973145, "num_input_tokens_seen": 2384586, "step": 2314, "train_runtime": 6575.6347, "train_tokens_per_second": 362.64 }, { "epoch": 0.9894219467891868, "grad_norm": 2.4925613403320312, "learning_rate": 2.2269807280513922e-07, "loss": 0.14578266441822052, "num_input_tokens_seen": 2385480, "step": 2315, "train_runtime": 6577.7542, "train_tokens_per_second": 362.659 }, { "epoch": 0.9898493428785127, "grad_norm": 2.9927830696105957, "learning_rate": 2.1413276231263384e-07, "loss": 0.14955651760101318, "num_input_tokens_seen": 2386470, "step": 2316, "train_runtime": 6579.9023, "train_tokens_per_second": 362.691 }, { "epoch": 0.9902767389678384, "grad_norm": 2.0396838188171387, "learning_rate": 2.0556745182012848e-07, "loss": 0.11650251597166061, "num_input_tokens_seen": 2387406, "step": 2317, "train_runtime": 6582.0668, "train_tokens_per_second": 362.714 }, { "epoch": 0.9907041350571643, "grad_norm": 2.4559547901153564, "learning_rate": 1.9700214132762315e-07, "loss": 0.1620512753725052, "num_input_tokens_seen": 2388554, "step": 2318, "train_runtime": 6584.319, "train_tokens_per_second": 362.764 }, { "epoch": 0.99113153114649, "grad_norm": 2.14836049079895, "learning_rate": 1.884368308351178e-07, "loss": 0.15904970467090607, "num_input_tokens_seen": 2389436, "step": 2319, "train_runtime": 6586.439, "train_tokens_per_second": 362.781 }, { "epoch": 0.9915589272358158, "grad_norm": 2.247936725616455, "learning_rate": 1.7987152034261243e-07, "loss": 0.12262392044067383, "num_input_tokens_seen": 2390262, "step": 2320, "train_runtime": 6588.5574, "train_tokens_per_second": 362.79 }, { "epoch": 0.9919863233251416, "grad_norm": 1.5306205749511719, "learning_rate": 1.713062098501071e-07, "loss": 0.1035427376627922, "num_input_tokens_seen": 2391706, "step": 2321, "train_runtime": 6590.9728, "train_tokens_per_second": 362.876 }, { "epoch": 0.9924137194144673, "grad_norm": 2.832209348678589, "learning_rate": 1.6274089935760174e-07, "loss": 0.18025535345077515, "num_input_tokens_seen": 2392578, "step": 2322, "train_runtime": 6593.2354, "train_tokens_per_second": 362.884 }, { "epoch": 0.9928411155037932, "grad_norm": 2.0135865211486816, "learning_rate": 1.5417558886509638e-07, "loss": 0.11366945505142212, "num_input_tokens_seen": 2393696, "step": 2323, "train_runtime": 6595.5785, "train_tokens_per_second": 362.924 }, { "epoch": 0.9932685115931189, "grad_norm": 2.466702461242676, "learning_rate": 1.4561027837259102e-07, "loss": 0.13891878724098206, "num_input_tokens_seen": 2394578, "step": 2324, "train_runtime": 6597.7488, "train_tokens_per_second": 362.939 }, { "epoch": 0.9936959076824448, "grad_norm": 2.7782323360443115, "learning_rate": 1.3704496788008566e-07, "loss": 0.15003295242786407, "num_input_tokens_seen": 2395308, "step": 2325, "train_runtime": 6599.895, "train_tokens_per_second": 362.931 }, { "epoch": 0.9941233037717705, "grad_norm": 1.5021390914916992, "learning_rate": 1.284796573875803e-07, "loss": 0.08431324362754822, "num_input_tokens_seen": 2396636, "step": 2326, "train_runtime": 6602.1647, "train_tokens_per_second": 363.008 }, { "epoch": 0.9945506998610962, "grad_norm": 2.4804224967956543, "learning_rate": 1.1991434689507497e-07, "loss": 0.11129743605852127, "num_input_tokens_seen": 2397360, "step": 2327, "train_runtime": 6604.2262, "train_tokens_per_second": 363.004 }, { "epoch": 0.9949780959504221, "grad_norm": 1.8190233707427979, "learning_rate": 1.1134903640256961e-07, "loss": 0.1168387234210968, "num_input_tokens_seen": 2398838, "step": 2328, "train_runtime": 6606.4729, "train_tokens_per_second": 363.104 }, { "epoch": 0.9954054920397478, "grad_norm": 2.213407039642334, "learning_rate": 1.0278372591006424e-07, "loss": 0.13902293145656586, "num_input_tokens_seen": 2399932, "step": 2329, "train_runtime": 6608.6542, "train_tokens_per_second": 363.15 }, { "epoch": 0.9958328881290737, "grad_norm": 2.4208712577819824, "learning_rate": 9.42184154175589e-08, "loss": 0.11716875433921814, "num_input_tokens_seen": 2400660, "step": 2330, "train_runtime": 6610.7324, "train_tokens_per_second": 363.146 }, { "epoch": 0.9962602842183994, "grad_norm": 2.3589935302734375, "learning_rate": 8.565310492505355e-08, "loss": 0.10183291137218475, "num_input_tokens_seen": 2401812, "step": 2331, "train_runtime": 6612.9065, "train_tokens_per_second": 363.201 }, { "epoch": 0.9966876803077251, "grad_norm": 1.3976114988327026, "learning_rate": 7.708779443254819e-08, "loss": 0.04813641682267189, "num_input_tokens_seen": 2402658, "step": 2332, "train_runtime": 6615.042, "train_tokens_per_second": 363.211 }, { "epoch": 0.997115076397051, "grad_norm": 2.2992851734161377, "learning_rate": 6.852248394004283e-08, "loss": 0.1089867651462555, "num_input_tokens_seen": 2403482, "step": 2333, "train_runtime": 6617.1546, "train_tokens_per_second": 363.22 }, { "epoch": 0.9975424724863767, "grad_norm": 2.0313122272491455, "learning_rate": 5.995717344753749e-08, "loss": 0.06835804879665375, "num_input_tokens_seen": 2404478, "step": 2334, "train_runtime": 6619.2695, "train_tokens_per_second": 363.254 }, { "epoch": 0.9979698685757026, "grad_norm": 2.4964895248413086, "learning_rate": 5.139186295503212e-08, "loss": 0.14085185527801514, "num_input_tokens_seen": 2405476, "step": 2335, "train_runtime": 6621.425, "train_tokens_per_second": 363.287 }, { "epoch": 0.9983972646650283, "grad_norm": 1.5793404579162598, "learning_rate": 4.2826552462526774e-08, "loss": 0.06665721535682678, "num_input_tokens_seen": 2406682, "step": 2336, "train_runtime": 6623.6426, "train_tokens_per_second": 363.347 }, { "epoch": 0.998824660754354, "grad_norm": 2.4025800228118896, "learning_rate": 3.4261241970021415e-08, "loss": 0.11019919812679291, "num_input_tokens_seen": 2407814, "step": 2337, "train_runtime": 6625.8362, "train_tokens_per_second": 363.398 }, { "epoch": 0.9992520568436799, "grad_norm": 1.987865686416626, "learning_rate": 2.569593147751606e-08, "loss": 0.07966522872447968, "num_input_tokens_seen": 2408526, "step": 2338, "train_runtime": 6627.9168, "train_tokens_per_second": 363.391 }, { "epoch": 0.9996794529330056, "grad_norm": 1.5755078792572021, "learning_rate": 1.7130620985010708e-08, "loss": 0.10967524349689484, "num_input_tokens_seen": 2409924, "step": 2339, "train_runtime": 6630.1673, "train_tokens_per_second": 363.479 }, { "epoch": 1.0, "grad_norm": 2.8271493911743164, "learning_rate": 8.565310492505354e-09, "loss": 0.15289795398712158, "num_input_tokens_seen": 2410678, "step": 2340, "train_runtime": 6631.8273, "train_tokens_per_second": 363.501 }, { "epoch": 1.0, "eval_loss": 0.45490217208862305, "eval_runtime": 58.3272, "eval_samples_per_second": 17.11, "eval_steps_per_second": 8.555, "num_input_tokens_seen": 2410678, "step": 2340 } ], "logging_steps": 1, "max_steps": 2340, "num_input_tokens_seen": 2410678, "num_train_epochs": 1, "save_steps": 30, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.4622515745676544e+16, "train_batch_size": 2, "trial_name": null, "trial_params": null }