{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0, "eval_steps": 468, "global_step": 4680, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0004273960893257827, "grad_norm": 9.625906944274902, "learning_rate": 0.0, "loss": 0.2226095199584961, "num_input_tokens_seen": 1154, "step": 1, "train_runtime": 7.7061, "train_tokens_per_second": 149.752 }, { "epoch": 0.0008547921786515654, "grad_norm": 15.64644718170166, "learning_rate": 4.000000000000001e-06, "loss": 0.37749505043029785, "num_input_tokens_seen": 1926, "step": 2, "train_runtime": 9.704, "train_tokens_per_second": 198.474 }, { "epoch": 0.001282188267977348, "grad_norm": 6.848448753356934, "learning_rate": 8.000000000000001e-06, "loss": 0.24094641208648682, "num_input_tokens_seen": 2966, "step": 3, "train_runtime": 11.7533, "train_tokens_per_second": 252.355 }, { "epoch": 0.0017095843573031308, "grad_norm": 4.784849643707275, "learning_rate": 1.2e-05, "loss": 0.19649389386177063, "num_input_tokens_seen": 3778, "step": 4, "train_runtime": 13.7348, "train_tokens_per_second": 275.069 }, { "epoch": 0.0021369804466289132, "grad_norm": 6.467296600341797, "learning_rate": 1.6000000000000003e-05, "loss": 0.20225900411605835, "num_input_tokens_seen": 4340, "step": 5, "train_runtime": 15.6871, "train_tokens_per_second": 276.66 }, { "epoch": 0.002564376535954696, "grad_norm": 4.957343578338623, "learning_rate": 2e-05, "loss": 0.26445555686950684, "num_input_tokens_seen": 5598, "step": 6, "train_runtime": 17.7764, "train_tokens_per_second": 314.912 }, { "epoch": 0.0029917726252804786, "grad_norm": 5.587215900421143, "learning_rate": 1.999572192513369e-05, "loss": 0.11980922520160675, "num_input_tokens_seen": 6630, "step": 7, "train_runtime": 19.843, "train_tokens_per_second": 334.124 }, { "epoch": 0.0034191687146062615, "grad_norm": 3.824303388595581, "learning_rate": 1.999144385026738e-05, "loss": 0.1420525759458542, "num_input_tokens_seen": 7824, "step": 8, "train_runtime": 21.9807, "train_tokens_per_second": 355.948 }, { "epoch": 0.003846564803932044, "grad_norm": 3.2600786685943604, "learning_rate": 1.9987165775401073e-05, "loss": 0.09598482400178909, "num_input_tokens_seen": 8920, "step": 9, "train_runtime": 24.064, "train_tokens_per_second": 370.678 }, { "epoch": 0.0042739608932578265, "grad_norm": 3.5554864406585693, "learning_rate": 1.998288770053476e-05, "loss": 0.18107062578201294, "num_input_tokens_seen": 10266, "step": 10, "train_runtime": 26.2377, "train_tokens_per_second": 391.269 }, { "epoch": 0.004701356982583609, "grad_norm": 3.7602057456970215, "learning_rate": 1.997860962566845e-05, "loss": 0.1214386597275734, "num_input_tokens_seen": 11024, "step": 11, "train_runtime": 28.1906, "train_tokens_per_second": 391.052 }, { "epoch": 0.005128753071909392, "grad_norm": 4.019107818603516, "learning_rate": 1.997433155080214e-05, "loss": 0.23680613934993744, "num_input_tokens_seen": 12374, "step": 12, "train_runtime": 30.3292, "train_tokens_per_second": 407.99 }, { "epoch": 0.005556149161235174, "grad_norm": 4.988264083862305, "learning_rate": 1.997005347593583e-05, "loss": 0.1975032091140747, "num_input_tokens_seen": 13532, "step": 13, "train_runtime": 32.4343, "train_tokens_per_second": 417.213 }, { "epoch": 0.005983545250560957, "grad_norm": 5.2693681716918945, "learning_rate": 1.996577540106952e-05, "loss": 0.14342525601387024, "num_input_tokens_seen": 14356, "step": 14, "train_runtime": 34.4337, "train_tokens_per_second": 416.917 }, { "epoch": 0.00641094133988674, "grad_norm": 4.687433242797852, "learning_rate": 1.996149732620321e-05, "loss": 0.20123495161533356, "num_input_tokens_seen": 15532, "step": 15, "train_runtime": 36.5139, "train_tokens_per_second": 425.373 }, { "epoch": 0.006838337429212523, "grad_norm": 3.9584639072418213, "learning_rate": 1.99572192513369e-05, "loss": 0.16135592758655548, "num_input_tokens_seen": 16276, "step": 16, "train_runtime": 38.4918, "train_tokens_per_second": 422.843 }, { "epoch": 0.007265733518538305, "grad_norm": 4.302605628967285, "learning_rate": 1.995294117647059e-05, "loss": 0.0981002077460289, "num_input_tokens_seen": 17076, "step": 17, "train_runtime": 40.501, "train_tokens_per_second": 421.619 }, { "epoch": 0.007693129607864088, "grad_norm": 3.010422706604004, "learning_rate": 1.994866310160428e-05, "loss": 0.09488782286643982, "num_input_tokens_seen": 18224, "step": 18, "train_runtime": 42.5906, "train_tokens_per_second": 427.888 }, { "epoch": 0.00812052569718987, "grad_norm": 3.195756435394287, "learning_rate": 1.9944385026737968e-05, "loss": 0.11447030305862427, "num_input_tokens_seen": 19792, "step": 19, "train_runtime": 44.7866, "train_tokens_per_second": 441.918 }, { "epoch": 0.008547921786515653, "grad_norm": 3.139535903930664, "learning_rate": 1.9940106951871657e-05, "loss": 0.13146063685417175, "num_input_tokens_seen": 20890, "step": 20, "train_runtime": 46.8964, "train_tokens_per_second": 445.45 }, { "epoch": 0.008975317875841436, "grad_norm": 4.932249069213867, "learning_rate": 1.993582887700535e-05, "loss": 0.1503104567527771, "num_input_tokens_seen": 21788, "step": 21, "train_runtime": 48.9228, "train_tokens_per_second": 445.354 }, { "epoch": 0.009402713965167219, "grad_norm": 4.747905254364014, "learning_rate": 1.993155080213904e-05, "loss": 0.1295323520898819, "num_input_tokens_seen": 22586, "step": 22, "train_runtime": 50.898, "train_tokens_per_second": 443.751 }, { "epoch": 0.009830110054493002, "grad_norm": 3.491011619567871, "learning_rate": 1.992727272727273e-05, "loss": 0.1252719759941101, "num_input_tokens_seen": 23474, "step": 23, "train_runtime": 52.9039, "train_tokens_per_second": 443.71 }, { "epoch": 0.010257506143818785, "grad_norm": 5.479099273681641, "learning_rate": 1.992299465240642e-05, "loss": 0.19048258662223816, "num_input_tokens_seen": 24318, "step": 24, "train_runtime": 54.9243, "train_tokens_per_second": 442.755 }, { "epoch": 0.010684902233144567, "grad_norm": 3.316023826599121, "learning_rate": 1.9918716577540108e-05, "loss": 0.19907110929489136, "num_input_tokens_seen": 25596, "step": 25, "train_runtime": 57.0225, "train_tokens_per_second": 448.875 }, { "epoch": 0.011112298322470349, "grad_norm": 3.3836982250213623, "learning_rate": 1.9914438502673797e-05, "loss": 0.10873676836490631, "num_input_tokens_seen": 27330, "step": 26, "train_runtime": 59.3028, "train_tokens_per_second": 460.855 }, { "epoch": 0.011539694411796132, "grad_norm": 4.329500198364258, "learning_rate": 1.9910160427807487e-05, "loss": 0.1561865508556366, "num_input_tokens_seen": 28246, "step": 27, "train_runtime": 61.28, "train_tokens_per_second": 460.934 }, { "epoch": 0.011967090501121914, "grad_norm": 4.218974590301514, "learning_rate": 1.9905882352941176e-05, "loss": 0.09617075324058533, "num_input_tokens_seen": 29652, "step": 28, "train_runtime": 63.4359, "train_tokens_per_second": 467.433 }, { "epoch": 0.012394486590447697, "grad_norm": 5.29585599899292, "learning_rate": 1.990160427807487e-05, "loss": 0.16989362239837646, "num_input_tokens_seen": 30714, "step": 29, "train_runtime": 65.5293, "train_tokens_per_second": 468.706 }, { "epoch": 0.01282188267977348, "grad_norm": 2.316746234893799, "learning_rate": 1.989732620320856e-05, "loss": 0.11536379158496857, "num_input_tokens_seen": 32788, "step": 30, "train_runtime": 67.8454, "train_tokens_per_second": 483.275 }, { "epoch": 0.013249278769099263, "grad_norm": 3.1590397357940674, "learning_rate": 1.9893048128342248e-05, "loss": 0.0931893065571785, "num_input_tokens_seen": 34168, "step": 31, "train_runtime": 77.2674, "train_tokens_per_second": 442.205 }, { "epoch": 0.013676674858425046, "grad_norm": 4.110548496246338, "learning_rate": 1.9888770053475937e-05, "loss": 0.138652965426445, "num_input_tokens_seen": 35112, "step": 32, "train_runtime": 79.3693, "train_tokens_per_second": 442.388 }, { "epoch": 0.014104070947750827, "grad_norm": 3.5470504760742188, "learning_rate": 1.9884491978609627e-05, "loss": 0.14397886395454407, "num_input_tokens_seen": 36280, "step": 33, "train_runtime": 81.4417, "train_tokens_per_second": 445.472 }, { "epoch": 0.01453146703707661, "grad_norm": 2.6868910789489746, "learning_rate": 1.9880213903743316e-05, "loss": 0.11197999119758606, "num_input_tokens_seen": 37392, "step": 34, "train_runtime": 83.5772, "train_tokens_per_second": 447.395 }, { "epoch": 0.014958863126402393, "grad_norm": 2.9456000328063965, "learning_rate": 1.9875935828877006e-05, "loss": 0.13160617649555206, "num_input_tokens_seen": 38426, "step": 35, "train_runtime": 85.6386, "train_tokens_per_second": 448.699 }, { "epoch": 0.015386259215728176, "grad_norm": 5.697889804840088, "learning_rate": 1.9871657754010695e-05, "loss": 0.19218449294567108, "num_input_tokens_seen": 39142, "step": 36, "train_runtime": 87.593, "train_tokens_per_second": 446.862 }, { "epoch": 0.015813655305053957, "grad_norm": 3.2537574768066406, "learning_rate": 1.9867379679144388e-05, "loss": 0.20149178802967072, "num_input_tokens_seen": 40582, "step": 37, "train_runtime": 89.7798, "train_tokens_per_second": 452.017 }, { "epoch": 0.01624105139437974, "grad_norm": 3.8951613903045654, "learning_rate": 1.9863101604278077e-05, "loss": 0.16156522929668427, "num_input_tokens_seen": 41558, "step": 38, "train_runtime": 91.8047, "train_tokens_per_second": 452.678 }, { "epoch": 0.016668447483705523, "grad_norm": 4.315296649932861, "learning_rate": 1.9858823529411767e-05, "loss": 0.14697720110416412, "num_input_tokens_seen": 43008, "step": 39, "train_runtime": 93.967, "train_tokens_per_second": 457.692 }, { "epoch": 0.017095843573031306, "grad_norm": 4.937653541564941, "learning_rate": 1.9854545454545456e-05, "loss": 0.1605147272348404, "num_input_tokens_seen": 43638, "step": 40, "train_runtime": 95.91, "train_tokens_per_second": 454.989 }, { "epoch": 0.01752323966235709, "grad_norm": 3.789418935775757, "learning_rate": 1.9850267379679146e-05, "loss": 0.1526976227760315, "num_input_tokens_seen": 44638, "step": 41, "train_runtime": 98.04, "train_tokens_per_second": 455.304 }, { "epoch": 0.01795063575168287, "grad_norm": 2.424595832824707, "learning_rate": 1.9845989304812835e-05, "loss": 0.064969502389431, "num_input_tokens_seen": 45956, "step": 42, "train_runtime": 100.1482, "train_tokens_per_second": 458.88 }, { "epoch": 0.018378031841008655, "grad_norm": 3.9266443252563477, "learning_rate": 1.9841711229946525e-05, "loss": 0.14873147010803223, "num_input_tokens_seen": 46938, "step": 43, "train_runtime": 102.2242, "train_tokens_per_second": 459.167 }, { "epoch": 0.018805427930334438, "grad_norm": 3.1564815044403076, "learning_rate": 1.9837433155080214e-05, "loss": 0.1474442481994629, "num_input_tokens_seen": 48790, "step": 44, "train_runtime": 104.4988, "train_tokens_per_second": 466.895 }, { "epoch": 0.01923282401966022, "grad_norm": 5.3332719802856445, "learning_rate": 1.9833155080213907e-05, "loss": 0.15616430342197418, "num_input_tokens_seen": 49788, "step": 45, "train_runtime": 106.5338, "train_tokens_per_second": 467.344 }, { "epoch": 0.019660220108986003, "grad_norm": 4.83596134185791, "learning_rate": 1.9828877005347596e-05, "loss": 0.14318448305130005, "num_input_tokens_seen": 50982, "step": 46, "train_runtime": 108.6462, "train_tokens_per_second": 469.248 }, { "epoch": 0.020087616198311786, "grad_norm": 4.82612943649292, "learning_rate": 1.9824598930481286e-05, "loss": 0.16587546467781067, "num_input_tokens_seen": 51774, "step": 47, "train_runtime": 110.6641, "train_tokens_per_second": 467.848 }, { "epoch": 0.02051501228763757, "grad_norm": 5.32522439956665, "learning_rate": 1.9820320855614975e-05, "loss": 0.1672104001045227, "num_input_tokens_seen": 52456, "step": 48, "train_runtime": 112.6502, "train_tokens_per_second": 465.654 }, { "epoch": 0.020942408376963352, "grad_norm": 4.326712608337402, "learning_rate": 1.9816042780748665e-05, "loss": 0.13658718764781952, "num_input_tokens_seen": 53518, "step": 49, "train_runtime": 114.762, "train_tokens_per_second": 466.339 }, { "epoch": 0.021369804466289135, "grad_norm": 3.391953945159912, "learning_rate": 1.9811764705882354e-05, "loss": 0.08182261884212494, "num_input_tokens_seen": 54192, "step": 50, "train_runtime": 116.7819, "train_tokens_per_second": 464.044 }, { "epoch": 0.021797200555614914, "grad_norm": 5.363497734069824, "learning_rate": 1.9807486631016044e-05, "loss": 0.18326592445373535, "num_input_tokens_seen": 55238, "step": 51, "train_runtime": 118.8673, "train_tokens_per_second": 464.703 }, { "epoch": 0.022224596644940697, "grad_norm": 4.2625732421875, "learning_rate": 1.9803208556149733e-05, "loss": 0.11891967803239822, "num_input_tokens_seen": 55944, "step": 52, "train_runtime": 120.8285, "train_tokens_per_second": 463.003 }, { "epoch": 0.02265199273426648, "grad_norm": 2.9568066596984863, "learning_rate": 1.9798930481283426e-05, "loss": 0.12739425897598267, "num_input_tokens_seen": 57432, "step": 53, "train_runtime": 123.0333, "train_tokens_per_second": 466.801 }, { "epoch": 0.023079388823592263, "grad_norm": 4.947142601013184, "learning_rate": 1.9794652406417115e-05, "loss": 0.11887576431035995, "num_input_tokens_seen": 58132, "step": 54, "train_runtime": 125.0444, "train_tokens_per_second": 464.891 }, { "epoch": 0.023506784912918046, "grad_norm": 4.3053202629089355, "learning_rate": 1.9790374331550805e-05, "loss": 0.2513520121574402, "num_input_tokens_seen": 59050, "step": 55, "train_runtime": 127.0689, "train_tokens_per_second": 464.708 }, { "epoch": 0.02393418100224383, "grad_norm": 3.2881264686584473, "learning_rate": 1.9786096256684494e-05, "loss": 0.14226624369621277, "num_input_tokens_seen": 60142, "step": 56, "train_runtime": 129.1144, "train_tokens_per_second": 465.804 }, { "epoch": 0.024361577091569612, "grad_norm": 4.641565799713135, "learning_rate": 1.9781818181818184e-05, "loss": 0.1254645586013794, "num_input_tokens_seen": 60816, "step": 57, "train_runtime": 131.0719, "train_tokens_per_second": 463.99 }, { "epoch": 0.024788973180895395, "grad_norm": 4.213507175445557, "learning_rate": 1.9777540106951873e-05, "loss": 0.20696590840816498, "num_input_tokens_seen": 61912, "step": 58, "train_runtime": 133.1641, "train_tokens_per_second": 464.93 }, { "epoch": 0.025216369270221178, "grad_norm": 3.822394609451294, "learning_rate": 1.9773262032085563e-05, "loss": 0.12147180736064911, "num_input_tokens_seen": 63102, "step": 59, "train_runtime": 135.3075, "train_tokens_per_second": 466.36 }, { "epoch": 0.02564376535954696, "grad_norm": 3.7647974491119385, "learning_rate": 1.9768983957219252e-05, "loss": 0.10511690378189087, "num_input_tokens_seen": 64178, "step": 60, "train_runtime": 137.4084, "train_tokens_per_second": 467.06 }, { "epoch": 0.026071161448872743, "grad_norm": 3.5489540100097656, "learning_rate": 1.9764705882352945e-05, "loss": 0.16315722465515137, "num_input_tokens_seen": 65130, "step": 61, "train_runtime": 145.9682, "train_tokens_per_second": 446.193 }, { "epoch": 0.026498557538198526, "grad_norm": 3.647955894470215, "learning_rate": 1.9760427807486634e-05, "loss": 0.15680347383022308, "num_input_tokens_seen": 66482, "step": 62, "train_runtime": 148.0724, "train_tokens_per_second": 448.983 }, { "epoch": 0.02692595362752431, "grad_norm": 5.077506065368652, "learning_rate": 1.9756149732620324e-05, "loss": 0.2151620090007782, "num_input_tokens_seen": 67294, "step": 63, "train_runtime": 150.1535, "train_tokens_per_second": 448.168 }, { "epoch": 0.027353349716850092, "grad_norm": 4.495523929595947, "learning_rate": 1.975187165775401e-05, "loss": 0.17818322777748108, "num_input_tokens_seen": 68030, "step": 64, "train_runtime": 152.131, "train_tokens_per_second": 447.18 }, { "epoch": 0.027780745806175875, "grad_norm": 2.6798179149627686, "learning_rate": 1.9747593582887703e-05, "loss": 0.11909501999616623, "num_input_tokens_seen": 69248, "step": 65, "train_runtime": 154.238, "train_tokens_per_second": 448.968 }, { "epoch": 0.028208141895501655, "grad_norm": 3.572542667388916, "learning_rate": 1.9743315508021392e-05, "loss": 0.13439372181892395, "num_input_tokens_seen": 70370, "step": 66, "train_runtime": 156.3623, "train_tokens_per_second": 450.044 }, { "epoch": 0.028635537984827437, "grad_norm": 4.2027082443237305, "learning_rate": 1.973903743315508e-05, "loss": 0.1301841139793396, "num_input_tokens_seen": 71626, "step": 67, "train_runtime": 158.4737, "train_tokens_per_second": 451.974 }, { "epoch": 0.02906293407415322, "grad_norm": 2.78859281539917, "learning_rate": 1.973475935828877e-05, "loss": 0.11929918080568314, "num_input_tokens_seen": 73088, "step": 68, "train_runtime": 160.6123, "train_tokens_per_second": 455.058 }, { "epoch": 0.029490330163479003, "grad_norm": 4.005275726318359, "learning_rate": 1.9730481283422464e-05, "loss": 0.11357735097408295, "num_input_tokens_seen": 73794, "step": 69, "train_runtime": 162.6037, "train_tokens_per_second": 453.827 }, { "epoch": 0.029917726252804786, "grad_norm": 5.254064559936523, "learning_rate": 1.9726203208556153e-05, "loss": 0.14673492312431335, "num_input_tokens_seen": 74550, "step": 70, "train_runtime": 164.6007, "train_tokens_per_second": 452.914 }, { "epoch": 0.03034512234213057, "grad_norm": 3.9961674213409424, "learning_rate": 1.972192513368984e-05, "loss": 0.217291459441185, "num_input_tokens_seen": 75664, "step": 71, "train_runtime": 166.7055, "train_tokens_per_second": 453.878 }, { "epoch": 0.030772518431456352, "grad_norm": 5.1501922607421875, "learning_rate": 1.971764705882353e-05, "loss": 0.1771675944328308, "num_input_tokens_seen": 76658, "step": 72, "train_runtime": 168.7704, "train_tokens_per_second": 454.215 }, { "epoch": 0.031199914520782135, "grad_norm": 4.168330192565918, "learning_rate": 1.971336898395722e-05, "loss": 0.1108478456735611, "num_input_tokens_seen": 77340, "step": 73, "train_runtime": 170.8413, "train_tokens_per_second": 452.701 }, { "epoch": 0.031627310610107914, "grad_norm": 3.990004777908325, "learning_rate": 1.970909090909091e-05, "loss": 0.22652441263198853, "num_input_tokens_seen": 78280, "step": 74, "train_runtime": 172.8849, "train_tokens_per_second": 452.787 }, { "epoch": 0.0320547066994337, "grad_norm": 6.247471332550049, "learning_rate": 1.97048128342246e-05, "loss": 0.2036120593547821, "num_input_tokens_seen": 79984, "step": 75, "train_runtime": 175.2028, "train_tokens_per_second": 456.523 }, { "epoch": 0.03248210278875948, "grad_norm": 3.5871591567993164, "learning_rate": 1.970053475935829e-05, "loss": 0.1707800179719925, "num_input_tokens_seen": 81050, "step": 76, "train_runtime": 177.2701, "train_tokens_per_second": 457.212 }, { "epoch": 0.032909498878085267, "grad_norm": 3.6746106147766113, "learning_rate": 1.9696256684491983e-05, "loss": 0.1824970841407776, "num_input_tokens_seen": 82148, "step": 77, "train_runtime": 179.3628, "train_tokens_per_second": 457.999 }, { "epoch": 0.033336894967411046, "grad_norm": 3.5396571159362793, "learning_rate": 1.969197860962567e-05, "loss": 0.17174741625785828, "num_input_tokens_seen": 83480, "step": 78, "train_runtime": 181.5274, "train_tokens_per_second": 459.875 }, { "epoch": 0.03376429105673683, "grad_norm": 4.849555015563965, "learning_rate": 1.9687700534759358e-05, "loss": 0.19618165493011475, "num_input_tokens_seen": 84510, "step": 79, "train_runtime": 183.6277, "train_tokens_per_second": 460.225 }, { "epoch": 0.03419168714606261, "grad_norm": 3.5431630611419678, "learning_rate": 1.9683422459893048e-05, "loss": 0.1181945949792862, "num_input_tokens_seen": 85856, "step": 80, "train_runtime": 185.743, "train_tokens_per_second": 462.23 }, { "epoch": 0.0346190832353884, "grad_norm": 3.853771686553955, "learning_rate": 1.967914438502674e-05, "loss": 0.11620461940765381, "num_input_tokens_seen": 86658, "step": 81, "train_runtime": 187.7391, "train_tokens_per_second": 461.587 }, { "epoch": 0.03504647932471418, "grad_norm": 3.4037678241729736, "learning_rate": 1.967486631016043e-05, "loss": 0.13744604587554932, "num_input_tokens_seen": 88316, "step": 82, "train_runtime": 189.9384, "train_tokens_per_second": 464.972 }, { "epoch": 0.035473875414039964, "grad_norm": 3.401839256286621, "learning_rate": 1.967058823529412e-05, "loss": 0.10648271441459656, "num_input_tokens_seen": 89176, "step": 83, "train_runtime": 191.9721, "train_tokens_per_second": 464.526 }, { "epoch": 0.03590127150336574, "grad_norm": 4.106384754180908, "learning_rate": 1.966631016042781e-05, "loss": 0.16465850174427032, "num_input_tokens_seen": 90190, "step": 84, "train_runtime": 194.0187, "train_tokens_per_second": 464.852 }, { "epoch": 0.03632866759269153, "grad_norm": 3.0353920459747314, "learning_rate": 1.96620320855615e-05, "loss": 0.12087035179138184, "num_input_tokens_seen": 91646, "step": 85, "train_runtime": 196.1609, "train_tokens_per_second": 467.198 }, { "epoch": 0.03675606368201731, "grad_norm": 4.285816192626953, "learning_rate": 1.9657754010695188e-05, "loss": 0.12293040752410889, "num_input_tokens_seen": 92540, "step": 86, "train_runtime": 198.1857, "train_tokens_per_second": 466.936 }, { "epoch": 0.037183459771343096, "grad_norm": 4.207911968231201, "learning_rate": 1.9653475935828877e-05, "loss": 0.18469344079494476, "num_input_tokens_seen": 93406, "step": 87, "train_runtime": 200.1647, "train_tokens_per_second": 466.646 }, { "epoch": 0.037610855860668875, "grad_norm": 4.45616340637207, "learning_rate": 1.9649197860962567e-05, "loss": 0.11300913989543915, "num_input_tokens_seen": 94042, "step": 88, "train_runtime": 202.1109, "train_tokens_per_second": 465.299 }, { "epoch": 0.038038251949994654, "grad_norm": 3.776406764984131, "learning_rate": 1.964491978609626e-05, "loss": 0.16000477969646454, "num_input_tokens_seen": 94768, "step": 89, "train_runtime": 204.0899, "train_tokens_per_second": 464.344 }, { "epoch": 0.03846564803932044, "grad_norm": 4.5214457511901855, "learning_rate": 1.964064171122995e-05, "loss": 0.14950791001319885, "num_input_tokens_seen": 95510, "step": 90, "train_runtime": 206.0628, "train_tokens_per_second": 463.5 }, { "epoch": 0.03889304412864622, "grad_norm": 3.776623010635376, "learning_rate": 1.963636363636364e-05, "loss": 0.1654057800769806, "num_input_tokens_seen": 96404, "step": 91, "train_runtime": 214.542, "train_tokens_per_second": 449.348 }, { "epoch": 0.03932044021797201, "grad_norm": 4.654515743255615, "learning_rate": 1.9632085561497328e-05, "loss": 0.30709636211395264, "num_input_tokens_seen": 97326, "step": 92, "train_runtime": 216.5679, "train_tokens_per_second": 449.402 }, { "epoch": 0.039747836307297786, "grad_norm": 3.743364095687866, "learning_rate": 1.9627807486631017e-05, "loss": 0.1282462775707245, "num_input_tokens_seen": 98670, "step": 93, "train_runtime": 218.7124, "train_tokens_per_second": 451.14 }, { "epoch": 0.04017523239662357, "grad_norm": 2.7732701301574707, "learning_rate": 1.9623529411764707e-05, "loss": 0.14717315137386322, "num_input_tokens_seen": 99802, "step": 94, "train_runtime": 220.7705, "train_tokens_per_second": 452.062 }, { "epoch": 0.04060262848594935, "grad_norm": 4.163231372833252, "learning_rate": 1.9619251336898396e-05, "loss": 0.13073277473449707, "num_input_tokens_seen": 100602, "step": 95, "train_runtime": 222.7312, "train_tokens_per_second": 451.675 }, { "epoch": 0.04103002457527514, "grad_norm": 4.084043979644775, "learning_rate": 1.9614973262032086e-05, "loss": 0.211775004863739, "num_input_tokens_seen": 101492, "step": 96, "train_runtime": 224.7527, "train_tokens_per_second": 451.572 }, { "epoch": 0.04145742066460092, "grad_norm": 2.473571538925171, "learning_rate": 1.961069518716578e-05, "loss": 0.11081207543611526, "num_input_tokens_seen": 102878, "step": 97, "train_runtime": 226.8868, "train_tokens_per_second": 453.433 }, { "epoch": 0.041884816753926704, "grad_norm": 3.7261149883270264, "learning_rate": 1.9606417112299468e-05, "loss": 0.13922911882400513, "num_input_tokens_seen": 103492, "step": 98, "train_runtime": 228.8324, "train_tokens_per_second": 452.261 }, { "epoch": 0.042312212843252484, "grad_norm": 3.1666626930236816, "learning_rate": 1.9602139037433157e-05, "loss": 0.1227794736623764, "num_input_tokens_seen": 104662, "step": 99, "train_runtime": 230.915, "train_tokens_per_second": 453.249 }, { "epoch": 0.04273960893257827, "grad_norm": 5.331000804901123, "learning_rate": 1.9597860962566847e-05, "loss": 0.2264232635498047, "num_input_tokens_seen": 105546, "step": 100, "train_runtime": 232.9534, "train_tokens_per_second": 453.078 }, { "epoch": 0.04316700502190405, "grad_norm": 3.614386558532715, "learning_rate": 1.9593582887700536e-05, "loss": 0.12469115853309631, "num_input_tokens_seen": 106606, "step": 101, "train_runtime": 235.0222, "train_tokens_per_second": 453.6 }, { "epoch": 0.04359440111122983, "grad_norm": 5.98403787612915, "learning_rate": 1.9589304812834226e-05, "loss": 0.13769271969795227, "num_input_tokens_seen": 107334, "step": 102, "train_runtime": 237.0603, "train_tokens_per_second": 452.771 }, { "epoch": 0.044021797200555615, "grad_norm": 3.6699941158294678, "learning_rate": 1.9585026737967915e-05, "loss": 0.13916221261024475, "num_input_tokens_seen": 108792, "step": 103, "train_runtime": 239.2198, "train_tokens_per_second": 454.779 }, { "epoch": 0.044449193289881395, "grad_norm": 4.686874866485596, "learning_rate": 1.9580748663101605e-05, "loss": 0.1531163901090622, "num_input_tokens_seen": 109786, "step": 104, "train_runtime": 241.2466, "train_tokens_per_second": 455.078 }, { "epoch": 0.04487658937920718, "grad_norm": 3.2465693950653076, "learning_rate": 1.9576470588235297e-05, "loss": 0.1527305245399475, "num_input_tokens_seen": 111036, "step": 105, "train_runtime": 243.3561, "train_tokens_per_second": 456.27 }, { "epoch": 0.04530398546853296, "grad_norm": 2.720834493637085, "learning_rate": 1.9572192513368987e-05, "loss": 0.09989616274833679, "num_input_tokens_seen": 112130, "step": 106, "train_runtime": 245.4039, "train_tokens_per_second": 456.92 }, { "epoch": 0.04573138155785875, "grad_norm": 4.310506820678711, "learning_rate": 1.9567914438502676e-05, "loss": 0.21421846747398376, "num_input_tokens_seen": 112996, "step": 107, "train_runtime": 247.4173, "train_tokens_per_second": 456.702 }, { "epoch": 0.046158777647184526, "grad_norm": 2.9606587886810303, "learning_rate": 1.9563636363636366e-05, "loss": 0.10993418842554092, "num_input_tokens_seen": 113962, "step": 108, "train_runtime": 249.4791, "train_tokens_per_second": 456.8 }, { "epoch": 0.04658617373651031, "grad_norm": 3.8038618564605713, "learning_rate": 1.9559358288770055e-05, "loss": 0.1932617723941803, "num_input_tokens_seen": 115666, "step": 109, "train_runtime": 251.7418, "train_tokens_per_second": 459.463 }, { "epoch": 0.04701356982583609, "grad_norm": 4.124566555023193, "learning_rate": 1.9555080213903745e-05, "loss": 0.1846320629119873, "num_input_tokens_seen": 116624, "step": 110, "train_runtime": 253.7975, "train_tokens_per_second": 459.516 }, { "epoch": 0.04744096591516188, "grad_norm": 3.0976104736328125, "learning_rate": 1.9550802139037434e-05, "loss": 0.09712183475494385, "num_input_tokens_seen": 117428, "step": 111, "train_runtime": 255.8459, "train_tokens_per_second": 458.979 }, { "epoch": 0.04786836200448766, "grad_norm": 2.8251500129699707, "learning_rate": 1.9546524064171124e-05, "loss": 0.11785268783569336, "num_input_tokens_seen": 118680, "step": 112, "train_runtime": 257.9633, "train_tokens_per_second": 460.065 }, { "epoch": 0.048295758093813444, "grad_norm": 2.817950487136841, "learning_rate": 1.9542245989304816e-05, "loss": 0.15405887365341187, "num_input_tokens_seen": 119692, "step": 113, "train_runtime": 260.0271, "train_tokens_per_second": 460.306 }, { "epoch": 0.048723154183139224, "grad_norm": 3.703707456588745, "learning_rate": 1.9537967914438506e-05, "loss": 0.13587014377117157, "num_input_tokens_seen": 120922, "step": 114, "train_runtime": 262.1133, "train_tokens_per_second": 461.335 }, { "epoch": 0.04915055027246501, "grad_norm": 4.744223594665527, "learning_rate": 1.9533689839572195e-05, "loss": 0.16133588552474976, "num_input_tokens_seen": 121918, "step": 115, "train_runtime": 264.1712, "train_tokens_per_second": 461.511 }, { "epoch": 0.04957794636179079, "grad_norm": 3.794447898864746, "learning_rate": 1.9529411764705885e-05, "loss": 0.2528957724571228, "num_input_tokens_seen": 122906, "step": 116, "train_runtime": 266.1873, "train_tokens_per_second": 461.727 }, { "epoch": 0.05000534245111657, "grad_norm": 3.831779718399048, "learning_rate": 1.9525133689839574e-05, "loss": 0.12381330132484436, "num_input_tokens_seen": 123910, "step": 117, "train_runtime": 268.2229, "train_tokens_per_second": 461.967 }, { "epoch": 0.050432738540442355, "grad_norm": 2.9667787551879883, "learning_rate": 1.9520855614973264e-05, "loss": 0.13823501765727997, "num_input_tokens_seen": 125102, "step": 118, "train_runtime": 270.3734, "train_tokens_per_second": 462.701 }, { "epoch": 0.050860134629768135, "grad_norm": 5.961679935455322, "learning_rate": 1.9516577540106953e-05, "loss": 0.25376904010772705, "num_input_tokens_seen": 126132, "step": 119, "train_runtime": 272.4895, "train_tokens_per_second": 462.888 }, { "epoch": 0.05128753071909392, "grad_norm": 5.949172019958496, "learning_rate": 1.9512299465240642e-05, "loss": 0.18413153290748596, "num_input_tokens_seen": 127110, "step": 120, "train_runtime": 274.5537, "train_tokens_per_second": 462.97 }, { "epoch": 0.0517149268084197, "grad_norm": 3.9526119232177734, "learning_rate": 1.9508021390374332e-05, "loss": 0.14880630373954773, "num_input_tokens_seen": 127798, "step": 121, "train_runtime": 283.068, "train_tokens_per_second": 451.475 }, { "epoch": 0.05214232289774549, "grad_norm": 4.685976505279541, "learning_rate": 1.9503743315508025e-05, "loss": 0.2541481852531433, "num_input_tokens_seen": 128626, "step": 122, "train_runtime": 285.0617, "train_tokens_per_second": 451.222 }, { "epoch": 0.052569718987071266, "grad_norm": 3.6252996921539307, "learning_rate": 1.9499465240641714e-05, "loss": 0.17328515648841858, "num_input_tokens_seen": 129792, "step": 123, "train_runtime": 287.1561, "train_tokens_per_second": 451.991 }, { "epoch": 0.05299711507639705, "grad_norm": 4.383351802825928, "learning_rate": 1.9495187165775404e-05, "loss": 0.17913982272148132, "num_input_tokens_seen": 131134, "step": 124, "train_runtime": 289.2781, "train_tokens_per_second": 453.315 }, { "epoch": 0.05342451116572283, "grad_norm": 4.613114833831787, "learning_rate": 1.9490909090909093e-05, "loss": 0.1824687123298645, "num_input_tokens_seen": 132050, "step": 125, "train_runtime": 291.3056, "train_tokens_per_second": 453.304 }, { "epoch": 0.05385190725504862, "grad_norm": 3.256249189376831, "learning_rate": 1.9486631016042783e-05, "loss": 0.12739244103431702, "num_input_tokens_seen": 133038, "step": 126, "train_runtime": 293.3833, "train_tokens_per_second": 453.461 }, { "epoch": 0.0542793033443744, "grad_norm": 4.473914623260498, "learning_rate": 1.9482352941176472e-05, "loss": 0.274713397026062, "num_input_tokens_seen": 134130, "step": 127, "train_runtime": 295.4583, "train_tokens_per_second": 453.973 }, { "epoch": 0.054706699433700184, "grad_norm": 3.998966693878174, "learning_rate": 1.947807486631016e-05, "loss": 0.1771961748600006, "num_input_tokens_seen": 134706, "step": 128, "train_runtime": 297.3794, "train_tokens_per_second": 452.977 }, { "epoch": 0.055134095523025964, "grad_norm": 2.9364333152770996, "learning_rate": 1.947379679144385e-05, "loss": 0.1560664176940918, "num_input_tokens_seen": 135978, "step": 129, "train_runtime": 299.5065, "train_tokens_per_second": 454.007 }, { "epoch": 0.05556149161235175, "grad_norm": 3.1906626224517822, "learning_rate": 1.9469518716577544e-05, "loss": 0.14533768594264984, "num_input_tokens_seen": 137126, "step": 130, "train_runtime": 301.6252, "train_tokens_per_second": 454.624 }, { "epoch": 0.05598888770167753, "grad_norm": 2.6740944385528564, "learning_rate": 1.9465240641711233e-05, "loss": 0.1516144573688507, "num_input_tokens_seen": 138358, "step": 131, "train_runtime": 303.7418, "train_tokens_per_second": 455.512 }, { "epoch": 0.05641628379100331, "grad_norm": 3.373631477355957, "learning_rate": 1.946096256684492e-05, "loss": 0.16386520862579346, "num_input_tokens_seen": 139642, "step": 132, "train_runtime": 305.8914, "train_tokens_per_second": 456.508 }, { "epoch": 0.056843679880329095, "grad_norm": 4.113182544708252, "learning_rate": 1.945668449197861e-05, "loss": 0.1717812865972519, "num_input_tokens_seen": 140602, "step": 133, "train_runtime": 308.0106, "train_tokens_per_second": 456.484 }, { "epoch": 0.057271075969654875, "grad_norm": 4.087924003601074, "learning_rate": 1.94524064171123e-05, "loss": 0.1626863032579422, "num_input_tokens_seen": 141428, "step": 134, "train_runtime": 310.0902, "train_tokens_per_second": 456.087 }, { "epoch": 0.05769847205898066, "grad_norm": 4.410618782043457, "learning_rate": 1.944812834224599e-05, "loss": 0.22780272364616394, "num_input_tokens_seen": 142422, "step": 135, "train_runtime": 312.1452, "train_tokens_per_second": 456.268 }, { "epoch": 0.05812586814830644, "grad_norm": 3.759174108505249, "learning_rate": 1.944385026737968e-05, "loss": 0.19898691773414612, "num_input_tokens_seen": 143346, "step": 136, "train_runtime": 314.2361, "train_tokens_per_second": 456.173 }, { "epoch": 0.05855326423763223, "grad_norm": 3.668994903564453, "learning_rate": 1.943957219251337e-05, "loss": 0.13790655136108398, "num_input_tokens_seen": 144322, "step": 137, "train_runtime": 316.297, "train_tokens_per_second": 456.286 }, { "epoch": 0.05898066032695801, "grad_norm": 2.9102942943573, "learning_rate": 1.9435294117647063e-05, "loss": 0.15275537967681885, "num_input_tokens_seen": 145602, "step": 138, "train_runtime": 318.4458, "train_tokens_per_second": 457.227 }, { "epoch": 0.05940805641628379, "grad_norm": 3.5204591751098633, "learning_rate": 1.943101604278075e-05, "loss": 0.15551750361919403, "num_input_tokens_seen": 146480, "step": 139, "train_runtime": 320.5139, "train_tokens_per_second": 457.016 }, { "epoch": 0.05983545250560957, "grad_norm": 3.573094129562378, "learning_rate": 1.9426737967914438e-05, "loss": 0.1385328769683838, "num_input_tokens_seen": 147280, "step": 140, "train_runtime": 322.5122, "train_tokens_per_second": 456.665 }, { "epoch": 0.06026284859493536, "grad_norm": 2.3515357971191406, "learning_rate": 1.9422459893048128e-05, "loss": 0.08091916143894196, "num_input_tokens_seen": 148260, "step": 141, "train_runtime": 324.5442, "train_tokens_per_second": 456.825 }, { "epoch": 0.06069024468426114, "grad_norm": 3.5823183059692383, "learning_rate": 1.941818181818182e-05, "loss": 0.2145853489637375, "num_input_tokens_seen": 149334, "step": 142, "train_runtime": 326.6077, "train_tokens_per_second": 457.227 }, { "epoch": 0.061117640773586925, "grad_norm": 3.408435344696045, "learning_rate": 1.941390374331551e-05, "loss": 0.18264466524124146, "num_input_tokens_seen": 150540, "step": 143, "train_runtime": 328.7099, "train_tokens_per_second": 457.972 }, { "epoch": 0.061545036862912704, "grad_norm": 4.721390724182129, "learning_rate": 1.94096256684492e-05, "loss": 0.1382511407136917, "num_input_tokens_seen": 151166, "step": 144, "train_runtime": 330.6693, "train_tokens_per_second": 457.152 }, { "epoch": 0.06197243295223849, "grad_norm": 3.0328853130340576, "learning_rate": 1.940534759358289e-05, "loss": 0.14752715826034546, "num_input_tokens_seen": 152380, "step": 145, "train_runtime": 332.7832, "train_tokens_per_second": 457.896 }, { "epoch": 0.06239982904156427, "grad_norm": 4.689001560211182, "learning_rate": 1.9401069518716578e-05, "loss": 0.25872471928596497, "num_input_tokens_seen": 153262, "step": 146, "train_runtime": 334.8068, "train_tokens_per_second": 457.763 }, { "epoch": 0.06282722513089005, "grad_norm": 4.3762078285217285, "learning_rate": 1.9396791443850268e-05, "loss": 0.25528281927108765, "num_input_tokens_seen": 154144, "step": 147, "train_runtime": 336.8297, "train_tokens_per_second": 457.632 }, { "epoch": 0.06325462122021583, "grad_norm": 4.54288911819458, "learning_rate": 1.9392513368983957e-05, "loss": 0.24058307707309723, "num_input_tokens_seen": 155234, "step": 148, "train_runtime": 338.9007, "train_tokens_per_second": 458.052 }, { "epoch": 0.06368201730954162, "grad_norm": 3.4448704719543457, "learning_rate": 1.9388235294117647e-05, "loss": 0.13716450333595276, "num_input_tokens_seen": 156324, "step": 149, "train_runtime": 341.0108, "train_tokens_per_second": 458.414 }, { "epoch": 0.0641094133988674, "grad_norm": 3.4153506755828857, "learning_rate": 1.938395721925134e-05, "loss": 0.12832224369049072, "num_input_tokens_seen": 157768, "step": 150, "train_runtime": 343.2138, "train_tokens_per_second": 459.678 }, { "epoch": 0.06453680948819318, "grad_norm": 5.297286033630371, "learning_rate": 1.937967914438503e-05, "loss": 0.1760442703962326, "num_input_tokens_seen": 158492, "step": 151, "train_runtime": 351.9666, "train_tokens_per_second": 450.304 }, { "epoch": 0.06496420557751896, "grad_norm": 3.6865053176879883, "learning_rate": 1.9375401069518718e-05, "loss": 0.15094995498657227, "num_input_tokens_seen": 159674, "step": 152, "train_runtime": 354.1275, "train_tokens_per_second": 450.894 }, { "epoch": 0.06539160166684475, "grad_norm": 6.42773962020874, "learning_rate": 1.9371122994652408e-05, "loss": 0.19943645596504211, "num_input_tokens_seen": 160804, "step": 153, "train_runtime": 356.214, "train_tokens_per_second": 451.425 }, { "epoch": 0.06581899775617053, "grad_norm": 3.904852867126465, "learning_rate": 1.9366844919786097e-05, "loss": 0.12334674596786499, "num_input_tokens_seen": 161480, "step": 154, "train_runtime": 358.2, "train_tokens_per_second": 450.81 }, { "epoch": 0.06624639384549631, "grad_norm": 2.9093892574310303, "learning_rate": 1.9362566844919787e-05, "loss": 0.14115239679813385, "num_input_tokens_seen": 162474, "step": 155, "train_runtime": 360.282, "train_tokens_per_second": 450.963 }, { "epoch": 0.06667378993482209, "grad_norm": 2.907697916030884, "learning_rate": 1.9358288770053476e-05, "loss": 0.13603979349136353, "num_input_tokens_seen": 163560, "step": 156, "train_runtime": 362.3778, "train_tokens_per_second": 451.352 }, { "epoch": 0.06710118602414789, "grad_norm": 3.3026914596557617, "learning_rate": 1.9354010695187166e-05, "loss": 0.14058558642864227, "num_input_tokens_seen": 164948, "step": 157, "train_runtime": 364.5367, "train_tokens_per_second": 452.487 }, { "epoch": 0.06752858211347366, "grad_norm": 4.028748989105225, "learning_rate": 1.934973262032086e-05, "loss": 0.18366575241088867, "num_input_tokens_seen": 166248, "step": 158, "train_runtime": 366.6538, "train_tokens_per_second": 453.42 }, { "epoch": 0.06795597820279944, "grad_norm": 3.1829679012298584, "learning_rate": 1.9345454545454548e-05, "loss": 0.17139247059822083, "num_input_tokens_seen": 167720, "step": 159, "train_runtime": 368.8367, "train_tokens_per_second": 454.727 }, { "epoch": 0.06838337429212522, "grad_norm": 3.4020562171936035, "learning_rate": 1.9341176470588237e-05, "loss": 0.14117524027824402, "num_input_tokens_seen": 168542, "step": 160, "train_runtime": 370.8654, "train_tokens_per_second": 454.456 }, { "epoch": 0.068810770381451, "grad_norm": 3.8880434036254883, "learning_rate": 1.9336898395721927e-05, "loss": 0.18208377063274384, "num_input_tokens_seen": 169602, "step": 161, "train_runtime": 372.959, "train_tokens_per_second": 454.747 }, { "epoch": 0.0692381664707768, "grad_norm": 3.70001220703125, "learning_rate": 1.9332620320855616e-05, "loss": 0.21020248532295227, "num_input_tokens_seen": 170802, "step": 162, "train_runtime": 375.2126, "train_tokens_per_second": 455.214 }, { "epoch": 0.06966556256010258, "grad_norm": 4.150683879852295, "learning_rate": 1.9328342245989306e-05, "loss": 0.19267253577709198, "num_input_tokens_seen": 171650, "step": 163, "train_runtime": 377.2294, "train_tokens_per_second": 455.028 }, { "epoch": 0.07009295864942836, "grad_norm": 4.252824783325195, "learning_rate": 1.9324064171122995e-05, "loss": 0.15652082860469818, "num_input_tokens_seen": 172970, "step": 164, "train_runtime": 379.3629, "train_tokens_per_second": 455.949 }, { "epoch": 0.07052035473875413, "grad_norm": 3.9441115856170654, "learning_rate": 1.9319786096256684e-05, "loss": 0.12914994359016418, "num_input_tokens_seen": 173750, "step": 165, "train_runtime": 381.3812, "train_tokens_per_second": 455.581 }, { "epoch": 0.07094775082807993, "grad_norm": 4.179220676422119, "learning_rate": 1.9315508021390377e-05, "loss": 0.12721984088420868, "num_input_tokens_seen": 174504, "step": 166, "train_runtime": 383.3764, "train_tokens_per_second": 455.177 }, { "epoch": 0.07137514691740571, "grad_norm": 2.911614418029785, "learning_rate": 1.9311229946524067e-05, "loss": 0.1691466122865677, "num_input_tokens_seen": 176096, "step": 167, "train_runtime": 385.5704, "train_tokens_per_second": 456.716 }, { "epoch": 0.07180254300673149, "grad_norm": 3.517160415649414, "learning_rate": 1.9306951871657756e-05, "loss": 0.08075811713933945, "num_input_tokens_seen": 176826, "step": 168, "train_runtime": 387.5449, "train_tokens_per_second": 456.272 }, { "epoch": 0.07222993909605727, "grad_norm": 5.577939510345459, "learning_rate": 1.9302673796791446e-05, "loss": 0.18033367395401, "num_input_tokens_seen": 177404, "step": 169, "train_runtime": 389.5037, "train_tokens_per_second": 455.462 }, { "epoch": 0.07265733518538306, "grad_norm": 2.962841749191284, "learning_rate": 1.9298395721925135e-05, "loss": 0.19206425547599792, "num_input_tokens_seen": 179500, "step": 170, "train_runtime": 391.8038, "train_tokens_per_second": 458.137 }, { "epoch": 0.07308473127470884, "grad_norm": 3.3081376552581787, "learning_rate": 1.9294117647058825e-05, "loss": 0.14741308987140656, "num_input_tokens_seen": 180552, "step": 171, "train_runtime": 393.8775, "train_tokens_per_second": 458.396 }, { "epoch": 0.07351212736403462, "grad_norm": 3.485266923904419, "learning_rate": 1.9289839572192514e-05, "loss": 0.1569867581129074, "num_input_tokens_seen": 181674, "step": 172, "train_runtime": 395.9655, "train_tokens_per_second": 458.813 }, { "epoch": 0.0739395234533604, "grad_norm": 2.7815213203430176, "learning_rate": 1.9285561497326203e-05, "loss": 0.19787417352199554, "num_input_tokens_seen": 183070, "step": 173, "train_runtime": 398.0846, "train_tokens_per_second": 459.877 }, { "epoch": 0.07436691954268619, "grad_norm": 2.8555409908294678, "learning_rate": 1.9281283422459896e-05, "loss": 0.08727098256349564, "num_input_tokens_seen": 184102, "step": 174, "train_runtime": 400.1283, "train_tokens_per_second": 460.107 }, { "epoch": 0.07479431563201197, "grad_norm": 3.37363338470459, "learning_rate": 1.9277005347593586e-05, "loss": 0.09344178438186646, "num_input_tokens_seen": 184738, "step": 175, "train_runtime": 402.0703, "train_tokens_per_second": 459.467 }, { "epoch": 0.07522171172133775, "grad_norm": 3.6110727787017822, "learning_rate": 1.9272727272727275e-05, "loss": 0.15122315287590027, "num_input_tokens_seen": 185658, "step": 176, "train_runtime": 404.0902, "train_tokens_per_second": 459.447 }, { "epoch": 0.07564910781066353, "grad_norm": 4.353687286376953, "learning_rate": 1.9268449197860965e-05, "loss": 0.20483148097991943, "num_input_tokens_seen": 186548, "step": 177, "train_runtime": 406.1061, "train_tokens_per_second": 459.358 }, { "epoch": 0.07607650389998931, "grad_norm": 3.902709484100342, "learning_rate": 1.9264171122994654e-05, "loss": 0.1338711380958557, "num_input_tokens_seen": 187216, "step": 178, "train_runtime": 408.055, "train_tokens_per_second": 458.801 }, { "epoch": 0.0765038999893151, "grad_norm": 4.904794692993164, "learning_rate": 1.9259893048128344e-05, "loss": 0.14415208995342255, "num_input_tokens_seen": 187852, "step": 179, "train_runtime": 409.9733, "train_tokens_per_second": 458.205 }, { "epoch": 0.07693129607864088, "grad_norm": 2.637103796005249, "learning_rate": 1.9255614973262033e-05, "loss": 0.09054088592529297, "num_input_tokens_seen": 188776, "step": 180, "train_runtime": 412.1239, "train_tokens_per_second": 458.056 }, { "epoch": 0.07735869216796666, "grad_norm": 3.8350894451141357, "learning_rate": 1.9251336898395722e-05, "loss": 0.1061239242553711, "num_input_tokens_seen": 189660, "step": 181, "train_runtime": 420.8459, "train_tokens_per_second": 450.664 }, { "epoch": 0.07778608825729244, "grad_norm": 3.1410531997680664, "learning_rate": 1.9247058823529415e-05, "loss": 0.1559763252735138, "num_input_tokens_seen": 190660, "step": 182, "train_runtime": 422.8953, "train_tokens_per_second": 450.844 }, { "epoch": 0.07821348434661823, "grad_norm": 4.812954425811768, "learning_rate": 1.9242780748663105e-05, "loss": 0.19170966744422913, "num_input_tokens_seen": 191388, "step": 183, "train_runtime": 424.8678, "train_tokens_per_second": 450.465 }, { "epoch": 0.07864088043594401, "grad_norm": 3.0507349967956543, "learning_rate": 1.9238502673796794e-05, "loss": 0.1721566766500473, "num_input_tokens_seen": 192522, "step": 184, "train_runtime": 426.9841, "train_tokens_per_second": 450.888 }, { "epoch": 0.07906827652526979, "grad_norm": 2.3724539279937744, "learning_rate": 1.9234224598930484e-05, "loss": 0.0992976725101471, "num_input_tokens_seen": 193656, "step": 185, "train_runtime": 429.0901, "train_tokens_per_second": 451.318 }, { "epoch": 0.07949567261459557, "grad_norm": 4.356204032897949, "learning_rate": 1.9229946524064173e-05, "loss": 0.17176751792430878, "num_input_tokens_seen": 194402, "step": 186, "train_runtime": 431.0928, "train_tokens_per_second": 450.952 }, { "epoch": 0.07992306870392137, "grad_norm": 3.711698055267334, "learning_rate": 1.9225668449197862e-05, "loss": 0.19728952646255493, "num_input_tokens_seen": 195820, "step": 187, "train_runtime": 433.2757, "train_tokens_per_second": 451.952 }, { "epoch": 0.08035046479324714, "grad_norm": 3.471689224243164, "learning_rate": 1.9221390374331552e-05, "loss": 0.12796440720558167, "num_input_tokens_seen": 196646, "step": 188, "train_runtime": 435.2937, "train_tokens_per_second": 451.755 }, { "epoch": 0.08077786088257292, "grad_norm": 5.114136219024658, "learning_rate": 1.921711229946524e-05, "loss": 0.16669723391532898, "num_input_tokens_seen": 197934, "step": 189, "train_runtime": 437.4352, "train_tokens_per_second": 452.488 }, { "epoch": 0.0812052569718987, "grad_norm": 4.230232238769531, "learning_rate": 1.9212834224598934e-05, "loss": 0.16396945714950562, "num_input_tokens_seen": 198668, "step": 190, "train_runtime": 439.4562, "train_tokens_per_second": 452.077 }, { "epoch": 0.08163265306122448, "grad_norm": 3.165710210800171, "learning_rate": 1.9208556149732624e-05, "loss": 0.12626244127750397, "num_input_tokens_seen": 199602, "step": 191, "train_runtime": 441.5322, "train_tokens_per_second": 452.067 }, { "epoch": 0.08206004915055028, "grad_norm": 3.7299795150756836, "learning_rate": 1.9204278074866313e-05, "loss": 0.20722240209579468, "num_input_tokens_seen": 200542, "step": 192, "train_runtime": 443.5588, "train_tokens_per_second": 452.12 }, { "epoch": 0.08248744523987606, "grad_norm": 4.410600662231445, "learning_rate": 1.9200000000000003e-05, "loss": 0.2075149416923523, "num_input_tokens_seen": 201758, "step": 193, "train_runtime": 445.6815, "train_tokens_per_second": 452.696 }, { "epoch": 0.08291484132920184, "grad_norm": 3.4818227291107178, "learning_rate": 1.9195721925133692e-05, "loss": 0.19731946289539337, "num_input_tokens_seen": 203172, "step": 194, "train_runtime": 447.8314, "train_tokens_per_second": 453.68 }, { "epoch": 0.08334223741852761, "grad_norm": 3.2609193325042725, "learning_rate": 1.919144385026738e-05, "loss": 0.1395885944366455, "num_input_tokens_seen": 204078, "step": 195, "train_runtime": 449.9033, "train_tokens_per_second": 453.604 }, { "epoch": 0.08376963350785341, "grad_norm": 3.4876768589019775, "learning_rate": 1.918716577540107e-05, "loss": 0.16306047141551971, "num_input_tokens_seen": 204922, "step": 196, "train_runtime": 451.9484, "train_tokens_per_second": 453.419 }, { "epoch": 0.08419702959717919, "grad_norm": 2.7984631061553955, "learning_rate": 1.918288770053476e-05, "loss": 0.11668877303600311, "num_input_tokens_seen": 206042, "step": 197, "train_runtime": 454.031, "train_tokens_per_second": 453.806 }, { "epoch": 0.08462442568650497, "grad_norm": 2.316157579421997, "learning_rate": 1.9178609625668453e-05, "loss": 0.07432881742715836, "num_input_tokens_seen": 207324, "step": 198, "train_runtime": 456.1505, "train_tokens_per_second": 454.508 }, { "epoch": 0.08505182177583075, "grad_norm": 5.142146110534668, "learning_rate": 1.9174331550802143e-05, "loss": 0.32583293318748474, "num_input_tokens_seen": 207952, "step": 199, "train_runtime": 458.116, "train_tokens_per_second": 453.929 }, { "epoch": 0.08547921786515654, "grad_norm": 4.039165496826172, "learning_rate": 1.917005347593583e-05, "loss": 0.12693336606025696, "num_input_tokens_seen": 208652, "step": 200, "train_runtime": 460.1111, "train_tokens_per_second": 453.482 }, { "epoch": 0.08590661395448232, "grad_norm": 2.3335464000701904, "learning_rate": 1.9165775401069518e-05, "loss": 0.0983176976442337, "num_input_tokens_seen": 210218, "step": 201, "train_runtime": 462.3251, "train_tokens_per_second": 454.697 }, { "epoch": 0.0863340100438081, "grad_norm": 4.560773849487305, "learning_rate": 1.916149732620321e-05, "loss": 0.18655210733413696, "num_input_tokens_seen": 211226, "step": 202, "train_runtime": 464.3615, "train_tokens_per_second": 454.874 }, { "epoch": 0.08676140613313388, "grad_norm": 4.267395973205566, "learning_rate": 1.91572192513369e-05, "loss": 0.2624877095222473, "num_input_tokens_seen": 212022, "step": 203, "train_runtime": 466.3547, "train_tokens_per_second": 454.637 }, { "epoch": 0.08718880222245966, "grad_norm": 4.703396320343018, "learning_rate": 1.915294117647059e-05, "loss": 0.21235334873199463, "num_input_tokens_seen": 212970, "step": 204, "train_runtime": 468.4126, "train_tokens_per_second": 454.663 }, { "epoch": 0.08761619831178545, "grad_norm": 2.8434624671936035, "learning_rate": 1.914866310160428e-05, "loss": 0.15252263844013214, "num_input_tokens_seen": 214772, "step": 205, "train_runtime": 470.6775, "train_tokens_per_second": 456.304 }, { "epoch": 0.08804359440111123, "grad_norm": 3.717108964920044, "learning_rate": 1.9144385026737972e-05, "loss": 0.17825952172279358, "num_input_tokens_seen": 215602, "step": 206, "train_runtime": 472.6784, "train_tokens_per_second": 456.128 }, { "epoch": 0.08847099049043701, "grad_norm": 2.9121856689453125, "learning_rate": 1.9140106951871658e-05, "loss": 0.15489216148853302, "num_input_tokens_seen": 216490, "step": 207, "train_runtime": 474.6974, "train_tokens_per_second": 456.059 }, { "epoch": 0.08889838657976279, "grad_norm": 3.9117062091827393, "learning_rate": 1.9135828877005348e-05, "loss": 0.1688605397939682, "num_input_tokens_seen": 217204, "step": 208, "train_runtime": 476.6486, "train_tokens_per_second": 455.69 }, { "epoch": 0.08932578266908858, "grad_norm": 3.487771987915039, "learning_rate": 1.9131550802139037e-05, "loss": 0.1434318572282791, "num_input_tokens_seen": 218624, "step": 209, "train_runtime": 478.8243, "train_tokens_per_second": 456.585 }, { "epoch": 0.08975317875841436, "grad_norm": 2.691993474960327, "learning_rate": 1.912727272727273e-05, "loss": 0.13809660077095032, "num_input_tokens_seen": 220324, "step": 210, "train_runtime": 481.061, "train_tokens_per_second": 457.996 }, { "epoch": 0.09018057484774014, "grad_norm": 3.8660988807678223, "learning_rate": 1.912299465240642e-05, "loss": 0.19372284412384033, "num_input_tokens_seen": 221488, "step": 211, "train_runtime": 489.7622, "train_tokens_per_second": 452.236 }, { "epoch": 0.09060797093706592, "grad_norm": 2.50512433052063, "learning_rate": 1.911871657754011e-05, "loss": 0.09720499813556671, "num_input_tokens_seen": 222612, "step": 212, "train_runtime": 491.8538, "train_tokens_per_second": 452.598 }, { "epoch": 0.09103536702639171, "grad_norm": 4.057933807373047, "learning_rate": 1.9114438502673798e-05, "loss": 0.16461125016212463, "num_input_tokens_seen": 223292, "step": 213, "train_runtime": 493.8672, "train_tokens_per_second": 452.13 }, { "epoch": 0.0914627631157175, "grad_norm": 2.801384449005127, "learning_rate": 1.9110160427807488e-05, "loss": 0.14904817938804626, "num_input_tokens_seen": 224310, "step": 214, "train_runtime": 495.8975, "train_tokens_per_second": 452.331 }, { "epoch": 0.09189015920504327, "grad_norm": 3.8825550079345703, "learning_rate": 1.9105882352941177e-05, "loss": 0.2628094255924225, "num_input_tokens_seen": 225312, "step": 215, "train_runtime": 497.9456, "train_tokens_per_second": 452.483 }, { "epoch": 0.09231755529436905, "grad_norm": 3.3652145862579346, "learning_rate": 1.9101604278074867e-05, "loss": 0.22525590658187866, "num_input_tokens_seen": 226316, "step": 216, "train_runtime": 500.0115, "train_tokens_per_second": 452.622 }, { "epoch": 0.09274495138369485, "grad_norm": 2.7347452640533447, "learning_rate": 1.9097326203208556e-05, "loss": 0.14280107617378235, "num_input_tokens_seen": 227250, "step": 217, "train_runtime": 502.106, "train_tokens_per_second": 452.594 }, { "epoch": 0.09317234747302063, "grad_norm": 5.178623676300049, "learning_rate": 1.909304812834225e-05, "loss": 0.17395099997520447, "num_input_tokens_seen": 228122, "step": 218, "train_runtime": 504.1438, "train_tokens_per_second": 452.494 }, { "epoch": 0.0935997435623464, "grad_norm": 3.997356414794922, "learning_rate": 1.9088770053475938e-05, "loss": 0.1781000792980194, "num_input_tokens_seen": 229052, "step": 219, "train_runtime": 506.2813, "train_tokens_per_second": 452.42 }, { "epoch": 0.09402713965167218, "grad_norm": 3.2037484645843506, "learning_rate": 1.9084491978609628e-05, "loss": 0.1139114573597908, "num_input_tokens_seen": 229902, "step": 220, "train_runtime": 508.2989, "train_tokens_per_second": 452.297 }, { "epoch": 0.09445453574099796, "grad_norm": 4.276766777038574, "learning_rate": 1.9080213903743317e-05, "loss": 0.27040156722068787, "num_input_tokens_seen": 230608, "step": 221, "train_runtime": 510.271, "train_tokens_per_second": 451.932 }, { "epoch": 0.09488193183032376, "grad_norm": 2.974623441696167, "learning_rate": 1.9075935828877007e-05, "loss": 0.14041531085968018, "num_input_tokens_seen": 231556, "step": 222, "train_runtime": 512.302, "train_tokens_per_second": 451.991 }, { "epoch": 0.09530932791964954, "grad_norm": 3.309757709503174, "learning_rate": 1.9071657754010696e-05, "loss": 0.17925582826137543, "num_input_tokens_seen": 232788, "step": 223, "train_runtime": 514.3899, "train_tokens_per_second": 452.552 }, { "epoch": 0.09573672400897532, "grad_norm": 4.808985233306885, "learning_rate": 1.9067379679144386e-05, "loss": 0.1371680200099945, "num_input_tokens_seen": 233850, "step": 224, "train_runtime": 516.4849, "train_tokens_per_second": 452.772 }, { "epoch": 0.0961641200983011, "grad_norm": 2.974057197570801, "learning_rate": 1.9063101604278075e-05, "loss": 0.1604079306125641, "num_input_tokens_seen": 234864, "step": 225, "train_runtime": 518.6088, "train_tokens_per_second": 452.873 }, { "epoch": 0.09659151618762689, "grad_norm": 3.4561188220977783, "learning_rate": 1.9058823529411764e-05, "loss": 0.1315935105085373, "num_input_tokens_seen": 235708, "step": 226, "train_runtime": 520.6123, "train_tokens_per_second": 452.751 }, { "epoch": 0.09701891227695267, "grad_norm": 3.487989902496338, "learning_rate": 1.9054545454545457e-05, "loss": 0.2212015688419342, "num_input_tokens_seen": 236636, "step": 227, "train_runtime": 522.6007, "train_tokens_per_second": 452.805 }, { "epoch": 0.09744630836627845, "grad_norm": 3.0441582202911377, "learning_rate": 1.9050267379679147e-05, "loss": 0.09992823004722595, "num_input_tokens_seen": 237612, "step": 228, "train_runtime": 524.6806, "train_tokens_per_second": 452.87 }, { "epoch": 0.09787370445560423, "grad_norm": 3.008308172225952, "learning_rate": 1.9045989304812836e-05, "loss": 0.1457144320011139, "num_input_tokens_seen": 238602, "step": 229, "train_runtime": 526.7311, "train_tokens_per_second": 452.986 }, { "epoch": 0.09830110054493002, "grad_norm": 3.072152853012085, "learning_rate": 1.9041711229946526e-05, "loss": 0.16858015954494476, "num_input_tokens_seen": 239698, "step": 230, "train_runtime": 528.7856, "train_tokens_per_second": 453.299 }, { "epoch": 0.0987284966342558, "grad_norm": 3.4098429679870605, "learning_rate": 1.9037433155080215e-05, "loss": 0.17184992134571075, "num_input_tokens_seen": 240628, "step": 231, "train_runtime": 530.8023, "train_tokens_per_second": 453.329 }, { "epoch": 0.09915589272358158, "grad_norm": 3.863887071609497, "learning_rate": 1.9033155080213904e-05, "loss": 0.17547230422496796, "num_input_tokens_seen": 241414, "step": 232, "train_runtime": 532.7911, "train_tokens_per_second": 453.112 }, { "epoch": 0.09958328881290736, "grad_norm": 4.293150424957275, "learning_rate": 1.9028877005347594e-05, "loss": 0.1179661750793457, "num_input_tokens_seen": 242032, "step": 233, "train_runtime": 534.7148, "train_tokens_per_second": 452.638 }, { "epoch": 0.10001068490223314, "grad_norm": 2.6410746574401855, "learning_rate": 1.9024598930481283e-05, "loss": 0.126165509223938, "num_input_tokens_seen": 243242, "step": 234, "train_runtime": 536.7878, "train_tokens_per_second": 453.144 }, { "epoch": 0.10043808099155893, "grad_norm": 3.003371477127075, "learning_rate": 1.9020320855614976e-05, "loss": 0.15211904048919678, "num_input_tokens_seen": 244358, "step": 235, "train_runtime": 538.8639, "train_tokens_per_second": 453.469 }, { "epoch": 0.10086547708088471, "grad_norm": 6.7676873207092285, "learning_rate": 1.9016042780748666e-05, "loss": 0.1265118569135666, "num_input_tokens_seen": 245862, "step": 236, "train_runtime": 541.0146, "train_tokens_per_second": 454.446 }, { "epoch": 0.10129287317021049, "grad_norm": 4.040054798126221, "learning_rate": 1.9011764705882355e-05, "loss": 0.1766088455915451, "num_input_tokens_seen": 246806, "step": 237, "train_runtime": 543.0326, "train_tokens_per_second": 454.496 }, { "epoch": 0.10172026925953627, "grad_norm": 3.4513156414031982, "learning_rate": 1.9007486631016045e-05, "loss": 0.15230941772460938, "num_input_tokens_seen": 248106, "step": 238, "train_runtime": 545.187, "train_tokens_per_second": 455.084 }, { "epoch": 0.10214766534886206, "grad_norm": 3.84849214553833, "learning_rate": 1.9003208556149734e-05, "loss": 0.1926119327545166, "num_input_tokens_seen": 249094, "step": 239, "train_runtime": 547.2525, "train_tokens_per_second": 455.172 }, { "epoch": 0.10257506143818784, "grad_norm": 3.4827184677124023, "learning_rate": 1.8998930481283423e-05, "loss": 0.10055464506149292, "num_input_tokens_seen": 249848, "step": 240, "train_runtime": 549.2401, "train_tokens_per_second": 454.898 }, { "epoch": 0.10300245752751362, "grad_norm": 3.3936355113983154, "learning_rate": 1.8994652406417113e-05, "loss": 0.1272302269935608, "num_input_tokens_seen": 250600, "step": 241, "train_runtime": 557.7911, "train_tokens_per_second": 449.272 }, { "epoch": 0.1034298536168394, "grad_norm": 3.431915760040283, "learning_rate": 1.8990374331550802e-05, "loss": 0.16067558526992798, "num_input_tokens_seen": 251420, "step": 242, "train_runtime": 559.8074, "train_tokens_per_second": 449.119 }, { "epoch": 0.1038572497061652, "grad_norm": 3.095625638961792, "learning_rate": 1.8986096256684495e-05, "loss": 0.16233760118484497, "num_input_tokens_seen": 252652, "step": 243, "train_runtime": 562.0576, "train_tokens_per_second": 449.513 }, { "epoch": 0.10428464579549097, "grad_norm": 4.025144100189209, "learning_rate": 1.8981818181818185e-05, "loss": 0.17672306299209595, "num_input_tokens_seen": 253610, "step": 244, "train_runtime": 564.1197, "train_tokens_per_second": 449.568 }, { "epoch": 0.10471204188481675, "grad_norm": 3.420201539993286, "learning_rate": 1.8977540106951874e-05, "loss": 0.1417708694934845, "num_input_tokens_seen": 254638, "step": 245, "train_runtime": 566.1637, "train_tokens_per_second": 449.76 }, { "epoch": 0.10513943797414253, "grad_norm": 4.7547383308410645, "learning_rate": 1.8973262032085563e-05, "loss": 0.1744721382856369, "num_input_tokens_seen": 255274, "step": 246, "train_runtime": 568.1083, "train_tokens_per_second": 449.34 }, { "epoch": 0.10556683406346833, "grad_norm": 3.470569610595703, "learning_rate": 1.8968983957219253e-05, "loss": 0.19191935658454895, "num_input_tokens_seen": 256368, "step": 247, "train_runtime": 570.161, "train_tokens_per_second": 449.641 }, { "epoch": 0.1059942301527941, "grad_norm": 4.300562381744385, "learning_rate": 1.8964705882352942e-05, "loss": 0.1759026050567627, "num_input_tokens_seen": 257026, "step": 248, "train_runtime": 572.1358, "train_tokens_per_second": 449.24 }, { "epoch": 0.10642162624211988, "grad_norm": 4.417792320251465, "learning_rate": 1.8960427807486632e-05, "loss": 0.10642141103744507, "num_input_tokens_seen": 257790, "step": 249, "train_runtime": 574.1049, "train_tokens_per_second": 449.029 }, { "epoch": 0.10684902233144566, "grad_norm": 3.709242820739746, "learning_rate": 1.895614973262032e-05, "loss": 0.16776417195796967, "num_input_tokens_seen": 259262, "step": 250, "train_runtime": 576.2591, "train_tokens_per_second": 449.905 }, { "epoch": 0.10727641842077144, "grad_norm": 3.8251121044158936, "learning_rate": 1.8951871657754014e-05, "loss": 0.15895061194896698, "num_input_tokens_seen": 260110, "step": 251, "train_runtime": 578.3145, "train_tokens_per_second": 449.773 }, { "epoch": 0.10770381451009724, "grad_norm": 3.2912485599517822, "learning_rate": 1.8947593582887704e-05, "loss": 0.14582106471061707, "num_input_tokens_seen": 261606, "step": 252, "train_runtime": 580.4902, "train_tokens_per_second": 450.664 }, { "epoch": 0.10813121059942302, "grad_norm": 2.9822049140930176, "learning_rate": 1.8943315508021393e-05, "loss": 0.1275487244129181, "num_input_tokens_seen": 262526, "step": 253, "train_runtime": 582.5099, "train_tokens_per_second": 450.681 }, { "epoch": 0.1085586066887488, "grad_norm": 4.629343032836914, "learning_rate": 1.8939037433155082e-05, "loss": 0.16082903742790222, "num_input_tokens_seen": 263480, "step": 254, "train_runtime": 584.55, "train_tokens_per_second": 450.74 }, { "epoch": 0.10898600277807458, "grad_norm": 4.594621658325195, "learning_rate": 1.8934759358288772e-05, "loss": 0.15713101625442505, "num_input_tokens_seen": 264340, "step": 255, "train_runtime": 586.5634, "train_tokens_per_second": 450.659 }, { "epoch": 0.10941339886740037, "grad_norm": 2.8088879585266113, "learning_rate": 1.893048128342246e-05, "loss": 0.17190785706043243, "num_input_tokens_seen": 265376, "step": 256, "train_runtime": 588.6112, "train_tokens_per_second": 450.851 }, { "epoch": 0.10984079495672615, "grad_norm": 4.621315956115723, "learning_rate": 1.892620320855615e-05, "loss": 0.21718566119670868, "num_input_tokens_seen": 266354, "step": 257, "train_runtime": 590.71, "train_tokens_per_second": 450.905 }, { "epoch": 0.11026819104605193, "grad_norm": 2.8214497566223145, "learning_rate": 1.892192513368984e-05, "loss": 0.15230679512023926, "num_input_tokens_seen": 267484, "step": 258, "train_runtime": 592.7989, "train_tokens_per_second": 451.222 }, { "epoch": 0.11069558713537771, "grad_norm": 3.5636396408081055, "learning_rate": 1.8917647058823533e-05, "loss": 0.18290041387081146, "num_input_tokens_seen": 268488, "step": 259, "train_runtime": 594.8901, "train_tokens_per_second": 451.324 }, { "epoch": 0.1111229832247035, "grad_norm": 3.2929975986480713, "learning_rate": 1.8913368983957222e-05, "loss": 0.16350272297859192, "num_input_tokens_seen": 269740, "step": 260, "train_runtime": 597.0846, "train_tokens_per_second": 451.762 }, { "epoch": 0.11155037931402928, "grad_norm": 2.861598014831543, "learning_rate": 1.8909090909090912e-05, "loss": 0.14524902403354645, "num_input_tokens_seen": 270722, "step": 261, "train_runtime": 599.15, "train_tokens_per_second": 451.843 }, { "epoch": 0.11197777540335506, "grad_norm": 3.105642795562744, "learning_rate": 1.8904812834224598e-05, "loss": 0.16657987236976624, "num_input_tokens_seen": 271516, "step": 262, "train_runtime": 601.1344, "train_tokens_per_second": 451.673 }, { "epoch": 0.11240517149268084, "grad_norm": 4.586379528045654, "learning_rate": 1.890053475935829e-05, "loss": 0.14546626806259155, "num_input_tokens_seen": 272224, "step": 263, "train_runtime": 603.1388, "train_tokens_per_second": 451.346 }, { "epoch": 0.11283256758200662, "grad_norm": 3.1321394443511963, "learning_rate": 1.889625668449198e-05, "loss": 0.1691616326570511, "num_input_tokens_seen": 273658, "step": 264, "train_runtime": 605.2636, "train_tokens_per_second": 452.13 }, { "epoch": 0.11325996367133241, "grad_norm": 4.213000774383545, "learning_rate": 1.889197860962567e-05, "loss": 0.17923316359519958, "num_input_tokens_seen": 274538, "step": 265, "train_runtime": 607.291, "train_tokens_per_second": 452.07 }, { "epoch": 0.11368735976065819, "grad_norm": 4.686862945556641, "learning_rate": 1.888770053475936e-05, "loss": 0.2047138214111328, "num_input_tokens_seen": 275238, "step": 266, "train_runtime": 609.2469, "train_tokens_per_second": 451.768 }, { "epoch": 0.11411475584998397, "grad_norm": 3.2828869819641113, "learning_rate": 1.8883422459893052e-05, "loss": 0.2003101110458374, "num_input_tokens_seen": 276596, "step": 267, "train_runtime": 611.3822, "train_tokens_per_second": 452.411 }, { "epoch": 0.11454215193930975, "grad_norm": 3.989023208618164, "learning_rate": 1.8879144385026738e-05, "loss": 0.14641880989074707, "num_input_tokens_seen": 277522, "step": 268, "train_runtime": 613.4081, "train_tokens_per_second": 452.426 }, { "epoch": 0.11496954802863554, "grad_norm": 3.4730944633483887, "learning_rate": 1.8874866310160427e-05, "loss": 0.20197799801826477, "num_input_tokens_seen": 279086, "step": 269, "train_runtime": 615.5842, "train_tokens_per_second": 453.368 }, { "epoch": 0.11539694411796132, "grad_norm": 3.5127711296081543, "learning_rate": 1.8870588235294117e-05, "loss": 0.1377829611301422, "num_input_tokens_seen": 280000, "step": 270, "train_runtime": 617.6133, "train_tokens_per_second": 453.358 }, { "epoch": 0.1158243402072871, "grad_norm": 3.486196756362915, "learning_rate": 1.886631016042781e-05, "loss": 0.12544484436511993, "num_input_tokens_seen": 280854, "step": 271, "train_runtime": 626.7152, "train_tokens_per_second": 448.137 }, { "epoch": 0.11625173629661288, "grad_norm": 4.045497417449951, "learning_rate": 1.88620320855615e-05, "loss": 0.1471298187971115, "num_input_tokens_seen": 281708, "step": 272, "train_runtime": 628.752, "train_tokens_per_second": 448.043 }, { "epoch": 0.11667913238593867, "grad_norm": 2.6336021423339844, "learning_rate": 1.885775401069519e-05, "loss": 0.1305892914533615, "num_input_tokens_seen": 283286, "step": 273, "train_runtime": 630.9488, "train_tokens_per_second": 448.984 }, { "epoch": 0.11710652847526445, "grad_norm": 3.9806833267211914, "learning_rate": 1.8853475935828878e-05, "loss": 0.1073172464966774, "num_input_tokens_seen": 283902, "step": 274, "train_runtime": 632.931, "train_tokens_per_second": 448.551 }, { "epoch": 0.11753392456459023, "grad_norm": 4.577077865600586, "learning_rate": 1.8849197860962568e-05, "loss": 0.13305075466632843, "num_input_tokens_seen": 284622, "step": 275, "train_runtime": 634.8798, "train_tokens_per_second": 448.309 }, { "epoch": 0.11796132065391601, "grad_norm": 2.967496395111084, "learning_rate": 1.8844919786096257e-05, "loss": 0.21203455328941345, "num_input_tokens_seen": 286416, "step": 276, "train_runtime": 637.0768, "train_tokens_per_second": 449.578 }, { "epoch": 0.11838871674324179, "grad_norm": 3.238326072692871, "learning_rate": 1.8840641711229946e-05, "loss": 0.11164429038763046, "num_input_tokens_seen": 287294, "step": 277, "train_runtime": 639.0896, "train_tokens_per_second": 449.536 }, { "epoch": 0.11881611283256759, "grad_norm": 3.6869401931762695, "learning_rate": 1.8836363636363636e-05, "loss": 0.10534940659999847, "num_input_tokens_seen": 288488, "step": 278, "train_runtime": 641.1629, "train_tokens_per_second": 449.945 }, { "epoch": 0.11924350892189337, "grad_norm": 3.2805209159851074, "learning_rate": 1.883208556149733e-05, "loss": 0.12838447093963623, "num_input_tokens_seen": 289728, "step": 279, "train_runtime": 643.2919, "train_tokens_per_second": 450.383 }, { "epoch": 0.11967090501121914, "grad_norm": 4.235654830932617, "learning_rate": 1.8827807486631018e-05, "loss": 0.13418586552143097, "num_input_tokens_seen": 290828, "step": 280, "train_runtime": 645.357, "train_tokens_per_second": 450.647 }, { "epoch": 0.12009830110054492, "grad_norm": 2.6712050437927246, "learning_rate": 1.8823529411764708e-05, "loss": 0.08912317454814911, "num_input_tokens_seen": 291796, "step": 281, "train_runtime": 647.3817, "train_tokens_per_second": 450.733 }, { "epoch": 0.12052569718987072, "grad_norm": 3.322579860687256, "learning_rate": 1.8819251336898397e-05, "loss": 0.14409010112285614, "num_input_tokens_seen": 292782, "step": 282, "train_runtime": 649.4428, "train_tokens_per_second": 450.82 }, { "epoch": 0.1209530932791965, "grad_norm": 6.024010181427002, "learning_rate": 1.8814973262032087e-05, "loss": 0.12049269676208496, "num_input_tokens_seen": 294044, "step": 283, "train_runtime": 651.5748, "train_tokens_per_second": 451.282 }, { "epoch": 0.12138048936852228, "grad_norm": 3.4060072898864746, "learning_rate": 1.8810695187165776e-05, "loss": 0.15825903415679932, "num_input_tokens_seen": 295040, "step": 284, "train_runtime": 653.6757, "train_tokens_per_second": 451.355 }, { "epoch": 0.12180788545784806, "grad_norm": 2.8432233333587646, "learning_rate": 1.8806417112299465e-05, "loss": 0.12002027779817581, "num_input_tokens_seen": 296080, "step": 285, "train_runtime": 655.7539, "train_tokens_per_second": 451.511 }, { "epoch": 0.12223528154717385, "grad_norm": 3.7648465633392334, "learning_rate": 1.8802139037433155e-05, "loss": 0.3100983202457428, "num_input_tokens_seen": 296966, "step": 286, "train_runtime": 657.7684, "train_tokens_per_second": 451.475 }, { "epoch": 0.12266267763649963, "grad_norm": 4.5041399002075195, "learning_rate": 1.8797860962566848e-05, "loss": 0.13915427029132843, "num_input_tokens_seen": 297852, "step": 287, "train_runtime": 659.8361, "train_tokens_per_second": 451.403 }, { "epoch": 0.12309007372582541, "grad_norm": 4.070438385009766, "learning_rate": 1.8793582887700537e-05, "loss": 0.221987783908844, "num_input_tokens_seen": 298816, "step": 288, "train_runtime": 661.8856, "train_tokens_per_second": 451.462 }, { "epoch": 0.12351746981515119, "grad_norm": 4.3437089920043945, "learning_rate": 1.8789304812834227e-05, "loss": 0.1698419451713562, "num_input_tokens_seen": 299528, "step": 289, "train_runtime": 663.8516, "train_tokens_per_second": 451.197 }, { "epoch": 0.12394486590447698, "grad_norm": 3.5586817264556885, "learning_rate": 1.8785026737967916e-05, "loss": 0.20045310258865356, "num_input_tokens_seen": 300536, "step": 290, "train_runtime": 665.9378, "train_tokens_per_second": 451.297 }, { "epoch": 0.12437226199380276, "grad_norm": 3.427109718322754, "learning_rate": 1.8780748663101605e-05, "loss": 0.1372043788433075, "num_input_tokens_seen": 301440, "step": 291, "train_runtime": 667.979, "train_tokens_per_second": 451.272 }, { "epoch": 0.12479965808312854, "grad_norm": 3.365877866744995, "learning_rate": 1.8776470588235295e-05, "loss": 0.15128262341022491, "num_input_tokens_seen": 302300, "step": 292, "train_runtime": 670.0594, "train_tokens_per_second": 451.154 }, { "epoch": 0.12522705417245433, "grad_norm": 3.641059398651123, "learning_rate": 1.8772192513368984e-05, "loss": 0.1684384047985077, "num_input_tokens_seen": 303418, "step": 293, "train_runtime": 672.15, "train_tokens_per_second": 451.414 }, { "epoch": 0.1256544502617801, "grad_norm": 3.037754535675049, "learning_rate": 1.8767914438502674e-05, "loss": 0.15381601452827454, "num_input_tokens_seen": 304350, "step": 294, "train_runtime": 674.2031, "train_tokens_per_second": 451.422 }, { "epoch": 0.1260818463511059, "grad_norm": 2.938688278198242, "learning_rate": 1.8763636363636367e-05, "loss": 0.15069277584552765, "num_input_tokens_seen": 305476, "step": 295, "train_runtime": 676.2531, "train_tokens_per_second": 451.718 }, { "epoch": 0.12650924244043166, "grad_norm": 3.0169084072113037, "learning_rate": 1.8759358288770056e-05, "loss": 0.14942556619644165, "num_input_tokens_seen": 306308, "step": 296, "train_runtime": 678.2757, "train_tokens_per_second": 451.598 }, { "epoch": 0.12693663852975745, "grad_norm": 2.7263107299804688, "learning_rate": 1.8755080213903746e-05, "loss": 0.09780525416135788, "num_input_tokens_seen": 307260, "step": 297, "train_runtime": 680.3243, "train_tokens_per_second": 451.638 }, { "epoch": 0.12736403461908324, "grad_norm": 4.067149639129639, "learning_rate": 1.8750802139037435e-05, "loss": 0.17667019367218018, "num_input_tokens_seen": 307968, "step": 298, "train_runtime": 682.2915, "train_tokens_per_second": 451.373 }, { "epoch": 0.127791430708409, "grad_norm": 2.900526523590088, "learning_rate": 1.8746524064171124e-05, "loss": 0.10331056267023087, "num_input_tokens_seen": 309040, "step": 299, "train_runtime": 684.3739, "train_tokens_per_second": 451.566 }, { "epoch": 0.1282188267977348, "grad_norm": 3.4931366443634033, "learning_rate": 1.8742245989304814e-05, "loss": 0.1742061972618103, "num_input_tokens_seen": 310064, "step": 300, "train_runtime": 686.432, "train_tokens_per_second": 451.704 }, { "epoch": 0.1286462228870606, "grad_norm": 3.780637741088867, "learning_rate": 1.8737967914438503e-05, "loss": 0.17963796854019165, "num_input_tokens_seen": 311010, "step": 301, "train_runtime": 695.3613, "train_tokens_per_second": 447.264 }, { "epoch": 0.12907361897638636, "grad_norm": 2.2857017517089844, "learning_rate": 1.8733689839572193e-05, "loss": 0.10262749344110489, "num_input_tokens_seen": 312498, "step": 302, "train_runtime": 697.5074, "train_tokens_per_second": 448.021 }, { "epoch": 0.12950101506571216, "grad_norm": 2.307969570159912, "learning_rate": 1.8729411764705886e-05, "loss": 0.12309729307889938, "num_input_tokens_seen": 313832, "step": 303, "train_runtime": 699.6924, "train_tokens_per_second": 448.529 }, { "epoch": 0.12992841115503792, "grad_norm": 4.083592414855957, "learning_rate": 1.8725133689839575e-05, "loss": 0.1447969675064087, "num_input_tokens_seen": 314562, "step": 304, "train_runtime": 701.6911, "train_tokens_per_second": 448.291 }, { "epoch": 0.13035580724436371, "grad_norm": 3.1060731410980225, "learning_rate": 1.8720855614973264e-05, "loss": 0.13127095997333527, "num_input_tokens_seen": 315366, "step": 305, "train_runtime": 703.7314, "train_tokens_per_second": 448.134 }, { "epoch": 0.1307832033336895, "grad_norm": 2.7246339321136475, "learning_rate": 1.8716577540106954e-05, "loss": 0.08170565962791443, "num_input_tokens_seen": 316344, "step": 306, "train_runtime": 705.8149, "train_tokens_per_second": 448.197 }, { "epoch": 0.13121059942301527, "grad_norm": 2.998915433883667, "learning_rate": 1.8712299465240643e-05, "loss": 0.12575949728488922, "num_input_tokens_seen": 317502, "step": 307, "train_runtime": 707.9242, "train_tokens_per_second": 448.497 }, { "epoch": 0.13163799551234107, "grad_norm": 3.3328864574432373, "learning_rate": 1.8708021390374333e-05, "loss": 0.1568697690963745, "num_input_tokens_seen": 318744, "step": 308, "train_runtime": 710.1045, "train_tokens_per_second": 448.869 }, { "epoch": 0.13206539160166683, "grad_norm": 3.177522897720337, "learning_rate": 1.8703743315508022e-05, "loss": 0.12127576023340225, "num_input_tokens_seen": 319662, "step": 309, "train_runtime": 712.1831, "train_tokens_per_second": 448.848 }, { "epoch": 0.13249278769099262, "grad_norm": 3.746555805206299, "learning_rate": 1.8699465240641712e-05, "loss": 0.20369161665439606, "num_input_tokens_seen": 320918, "step": 310, "train_runtime": 714.2756, "train_tokens_per_second": 449.292 }, { "epoch": 0.13292018378031842, "grad_norm": 3.511276960372925, "learning_rate": 1.8695187165775405e-05, "loss": 0.12065492570400238, "num_input_tokens_seen": 321682, "step": 311, "train_runtime": 716.2958, "train_tokens_per_second": 449.091 }, { "epoch": 0.13334757986964418, "grad_norm": 3.698040723800659, "learning_rate": 1.8690909090909094e-05, "loss": 0.1961260735988617, "num_input_tokens_seen": 322496, "step": 312, "train_runtime": 718.2899, "train_tokens_per_second": 448.978 }, { "epoch": 0.13377497595896998, "grad_norm": 3.9469563961029053, "learning_rate": 1.8686631016042783e-05, "loss": 0.201097771525383, "num_input_tokens_seen": 323340, "step": 313, "train_runtime": 720.3017, "train_tokens_per_second": 448.895 }, { "epoch": 0.13420237204829577, "grad_norm": 2.2532620429992676, "learning_rate": 1.8682352941176473e-05, "loss": 0.09061051160097122, "num_input_tokens_seen": 324558, "step": 314, "train_runtime": 722.4288, "train_tokens_per_second": 449.26 }, { "epoch": 0.13462976813762154, "grad_norm": 4.383615016937256, "learning_rate": 1.8678074866310162e-05, "loss": 0.18581202626228333, "num_input_tokens_seen": 325174, "step": 315, "train_runtime": 724.3555, "train_tokens_per_second": 448.915 }, { "epoch": 0.13505716422694733, "grad_norm": 7.402688026428223, "learning_rate": 1.8673796791443852e-05, "loss": 0.11511622369289398, "num_input_tokens_seen": 326062, "step": 316, "train_runtime": 726.3913, "train_tokens_per_second": 448.879 }, { "epoch": 0.1354845603162731, "grad_norm": 4.005338668823242, "learning_rate": 1.866951871657754e-05, "loss": 0.16818778216838837, "num_input_tokens_seen": 326946, "step": 317, "train_runtime": 728.4069, "train_tokens_per_second": 448.851 }, { "epoch": 0.1359119564055989, "grad_norm": 2.95188045501709, "learning_rate": 1.866524064171123e-05, "loss": 0.08211202919483185, "num_input_tokens_seen": 327712, "step": 318, "train_runtime": 730.3682, "train_tokens_per_second": 448.694 }, { "epoch": 0.13633935249492468, "grad_norm": 2.805638551712036, "learning_rate": 1.8660962566844923e-05, "loss": 0.2649306356906891, "num_input_tokens_seen": 329000, "step": 319, "train_runtime": 732.4667, "train_tokens_per_second": 449.167 }, { "epoch": 0.13676674858425045, "grad_norm": 3.8310837745666504, "learning_rate": 1.8656684491978613e-05, "loss": 0.13509626686573029, "num_input_tokens_seen": 329852, "step": 320, "train_runtime": 734.48, "train_tokens_per_second": 449.096 }, { "epoch": 0.13719414467357624, "grad_norm": 3.723883628845215, "learning_rate": 1.8652406417112302e-05, "loss": 0.08581741154193878, "num_input_tokens_seen": 330872, "step": 321, "train_runtime": 736.5671, "train_tokens_per_second": 449.208 }, { "epoch": 0.137621540762902, "grad_norm": 3.8647916316986084, "learning_rate": 1.8648128342245992e-05, "loss": 0.09364113956689835, "num_input_tokens_seen": 331688, "step": 322, "train_runtime": 738.5579, "train_tokens_per_second": 449.102 }, { "epoch": 0.1380489368522278, "grad_norm": 4.102155685424805, "learning_rate": 1.864385026737968e-05, "loss": 0.2538776993751526, "num_input_tokens_seen": 333338, "step": 323, "train_runtime": 740.7915, "train_tokens_per_second": 449.975 }, { "epoch": 0.1384763329415536, "grad_norm": 4.6270856857299805, "learning_rate": 1.863957219251337e-05, "loss": 0.2844879627227783, "num_input_tokens_seen": 334224, "step": 324, "train_runtime": 742.7862, "train_tokens_per_second": 449.96 }, { "epoch": 0.13890372903087936, "grad_norm": 2.7475757598876953, "learning_rate": 1.863529411764706e-05, "loss": 0.10463880002498627, "num_input_tokens_seen": 335028, "step": 325, "train_runtime": 744.7779, "train_tokens_per_second": 449.836 }, { "epoch": 0.13933112512020515, "grad_norm": 4.592890739440918, "learning_rate": 1.863101604278075e-05, "loss": 0.16257499158382416, "num_input_tokens_seen": 336004, "step": 326, "train_runtime": 746.7945, "train_tokens_per_second": 449.928 }, { "epoch": 0.13975852120953094, "grad_norm": 5.129707336425781, "learning_rate": 1.8626737967914442e-05, "loss": 0.13594549894332886, "num_input_tokens_seen": 336610, "step": 327, "train_runtime": 748.7692, "train_tokens_per_second": 449.551 }, { "epoch": 0.1401859172988567, "grad_norm": 3.1647987365722656, "learning_rate": 1.8622459893048132e-05, "loss": 0.08152987062931061, "num_input_tokens_seen": 337282, "step": 328, "train_runtime": 750.8125, "train_tokens_per_second": 449.223 }, { "epoch": 0.1406133133881825, "grad_norm": 2.9010794162750244, "learning_rate": 1.861818181818182e-05, "loss": 0.1412004679441452, "num_input_tokens_seen": 338422, "step": 329, "train_runtime": 752.8648, "train_tokens_per_second": 449.512 }, { "epoch": 0.14104070947750827, "grad_norm": 4.177113056182861, "learning_rate": 1.8613903743315507e-05, "loss": 0.19049745798110962, "num_input_tokens_seen": 339422, "step": 330, "train_runtime": 754.9166, "train_tokens_per_second": 449.615 }, { "epoch": 0.14146810556683406, "grad_norm": 2.712876081466675, "learning_rate": 1.86096256684492e-05, "loss": 0.1313464641571045, "num_input_tokens_seen": 340936, "step": 331, "train_runtime": 763.8042, "train_tokens_per_second": 446.366 }, { "epoch": 0.14189550165615986, "grad_norm": 2.798196315765381, "learning_rate": 1.860534759358289e-05, "loss": 0.11945220082998276, "num_input_tokens_seen": 341784, "step": 332, "train_runtime": 765.8969, "train_tokens_per_second": 446.253 }, { "epoch": 0.14232289774548562, "grad_norm": 3.371490955352783, "learning_rate": 1.860106951871658e-05, "loss": 0.11920512467622757, "num_input_tokens_seen": 343004, "step": 333, "train_runtime": 768.2008, "train_tokens_per_second": 446.503 }, { "epoch": 0.14275029383481141, "grad_norm": 2.9165289402008057, "learning_rate": 1.859679144385027e-05, "loss": 0.3008955419063568, "num_input_tokens_seen": 345688, "step": 334, "train_runtime": 770.7273, "train_tokens_per_second": 448.522 }, { "epoch": 0.14317768992413718, "grad_norm": 3.924025297164917, "learning_rate": 1.8592513368983958e-05, "loss": 0.07638221979141235, "num_input_tokens_seen": 347148, "step": 335, "train_runtime": 772.897, "train_tokens_per_second": 449.152 }, { "epoch": 0.14360508601346297, "grad_norm": 3.8307268619537354, "learning_rate": 1.8588235294117647e-05, "loss": 0.17071478068828583, "num_input_tokens_seen": 348164, "step": 336, "train_runtime": 774.927, "train_tokens_per_second": 449.286 }, { "epoch": 0.14403248210278877, "grad_norm": 2.630080223083496, "learning_rate": 1.8583957219251337e-05, "loss": 0.14733010530471802, "num_input_tokens_seen": 349356, "step": 337, "train_runtime": 777.0438, "train_tokens_per_second": 449.596 }, { "epoch": 0.14445987819211453, "grad_norm": 3.4713733196258545, "learning_rate": 1.8579679144385026e-05, "loss": 0.1895836889743805, "num_input_tokens_seen": 350252, "step": 338, "train_runtime": 779.1156, "train_tokens_per_second": 449.551 }, { "epoch": 0.14488727428144033, "grad_norm": 5.767294883728027, "learning_rate": 1.8575401069518716e-05, "loss": 0.21986524760723114, "num_input_tokens_seen": 350854, "step": 339, "train_runtime": 781.1106, "train_tokens_per_second": 449.173 }, { "epoch": 0.14531467037076612, "grad_norm": 2.541485071182251, "learning_rate": 1.857112299465241e-05, "loss": 0.09996365755796432, "num_input_tokens_seen": 351776, "step": 340, "train_runtime": 783.1609, "train_tokens_per_second": 449.175 }, { "epoch": 0.14574206646009188, "grad_norm": 3.624178886413574, "learning_rate": 1.8566844919786098e-05, "loss": 0.23689131438732147, "num_input_tokens_seen": 352826, "step": 341, "train_runtime": 785.25, "train_tokens_per_second": 449.317 }, { "epoch": 0.14616946254941768, "grad_norm": 3.0588555335998535, "learning_rate": 1.8562566844919788e-05, "loss": 0.17323711514472961, "num_input_tokens_seen": 353882, "step": 342, "train_runtime": 787.3151, "train_tokens_per_second": 449.48 }, { "epoch": 0.14659685863874344, "grad_norm": 3.714693546295166, "learning_rate": 1.8558288770053477e-05, "loss": 0.1840294450521469, "num_input_tokens_seen": 354970, "step": 343, "train_runtime": 789.4612, "train_tokens_per_second": 449.636 }, { "epoch": 0.14702425472806924, "grad_norm": 3.6947803497314453, "learning_rate": 1.8554010695187166e-05, "loss": 0.1884085237979889, "num_input_tokens_seen": 356082, "step": 344, "train_runtime": 791.5332, "train_tokens_per_second": 449.864 }, { "epoch": 0.14745165081739503, "grad_norm": 4.252649784088135, "learning_rate": 1.8549732620320856e-05, "loss": 0.13772591948509216, "num_input_tokens_seen": 357028, "step": 345, "train_runtime": 793.5993, "train_tokens_per_second": 449.884 }, { "epoch": 0.1478790469067208, "grad_norm": 3.3578357696533203, "learning_rate": 1.8545454545454545e-05, "loss": 0.2070823609828949, "num_input_tokens_seen": 358174, "step": 346, "train_runtime": 795.6966, "train_tokens_per_second": 450.139 }, { "epoch": 0.1483064429960466, "grad_norm": 4.760191917419434, "learning_rate": 1.8541176470588235e-05, "loss": 0.14720162749290466, "num_input_tokens_seen": 359022, "step": 347, "train_runtime": 797.7208, "train_tokens_per_second": 450.06 }, { "epoch": 0.14873383908537238, "grad_norm": 4.793249130249023, "learning_rate": 1.8536898395721928e-05, "loss": 0.17956335842609406, "num_input_tokens_seen": 359836, "step": 348, "train_runtime": 799.7329, "train_tokens_per_second": 449.945 }, { "epoch": 0.14916123517469815, "grad_norm": 3.8941121101379395, "learning_rate": 1.8532620320855617e-05, "loss": 0.16894230246543884, "num_input_tokens_seen": 360908, "step": 349, "train_runtime": 801.8407, "train_tokens_per_second": 450.099 }, { "epoch": 0.14958863126402394, "grad_norm": 2.622894525527954, "learning_rate": 1.8528342245989306e-05, "loss": 0.1034291535615921, "num_input_tokens_seen": 361784, "step": 350, "train_runtime": 803.9208, "train_tokens_per_second": 450.024 }, { "epoch": 0.1500160273533497, "grad_norm": 3.6771161556243896, "learning_rate": 1.8524064171122996e-05, "loss": 0.1609831303358078, "num_input_tokens_seen": 362754, "step": 351, "train_runtime": 805.9475, "train_tokens_per_second": 450.096 }, { "epoch": 0.1504434234426755, "grad_norm": 3.5313310623168945, "learning_rate": 1.8519786096256685e-05, "loss": 0.18430784344673157, "num_input_tokens_seen": 363890, "step": 352, "train_runtime": 808.0758, "train_tokens_per_second": 450.317 }, { "epoch": 0.1508708195320013, "grad_norm": 2.998183488845825, "learning_rate": 1.8515508021390375e-05, "loss": 0.13345034420490265, "num_input_tokens_seen": 365082, "step": 353, "train_runtime": 810.2033, "train_tokens_per_second": 450.605 }, { "epoch": 0.15129821562132706, "grad_norm": 3.4583919048309326, "learning_rate": 1.8511229946524064e-05, "loss": 0.1690501719713211, "num_input_tokens_seen": 365994, "step": 354, "train_runtime": 812.2927, "train_tokens_per_second": 450.569 }, { "epoch": 0.15172561171065285, "grad_norm": 3.4179177284240723, "learning_rate": 1.8506951871657754e-05, "loss": 0.15503522753715515, "num_input_tokens_seen": 366826, "step": 355, "train_runtime": 814.3792, "train_tokens_per_second": 450.436 }, { "epoch": 0.15215300779997862, "grad_norm": 4.092080116271973, "learning_rate": 1.8502673796791447e-05, "loss": 0.16115663945674896, "num_input_tokens_seen": 367598, "step": 356, "train_runtime": 816.3637, "train_tokens_per_second": 450.287 }, { "epoch": 0.1525804038893044, "grad_norm": 2.182504892349243, "learning_rate": 1.8498395721925136e-05, "loss": 0.08430016785860062, "num_input_tokens_seen": 369124, "step": 357, "train_runtime": 818.5705, "train_tokens_per_second": 450.937 }, { "epoch": 0.1530077999786302, "grad_norm": 3.81746244430542, "learning_rate": 1.8494117647058825e-05, "loss": 0.15793293714523315, "num_input_tokens_seen": 369900, "step": 358, "train_runtime": 820.5765, "train_tokens_per_second": 450.781 }, { "epoch": 0.15343519606795597, "grad_norm": 2.8908159732818604, "learning_rate": 1.8489839572192515e-05, "loss": 0.11062908172607422, "num_input_tokens_seen": 371024, "step": 359, "train_runtime": 822.6396, "train_tokens_per_second": 451.016 }, { "epoch": 0.15386259215728176, "grad_norm": 3.6751654148101807, "learning_rate": 1.8485561497326204e-05, "loss": 0.09459831565618515, "num_input_tokens_seen": 372068, "step": 360, "train_runtime": 824.72, "train_tokens_per_second": 451.145 }, { "epoch": 0.15428998824660756, "grad_norm": 2.9600813388824463, "learning_rate": 1.8481283422459894e-05, "loss": 0.11612650752067566, "num_input_tokens_seen": 372806, "step": 361, "train_runtime": 833.6043, "train_tokens_per_second": 447.222 }, { "epoch": 0.15471738433593332, "grad_norm": 3.6384379863739014, "learning_rate": 1.8477005347593583e-05, "loss": 0.16494277119636536, "num_input_tokens_seen": 373880, "step": 362, "train_runtime": 835.743, "train_tokens_per_second": 447.362 }, { "epoch": 0.15514478042525912, "grad_norm": 2.7391035556793213, "learning_rate": 1.8472727272727273e-05, "loss": 0.1711333692073822, "num_input_tokens_seen": 375686, "step": 363, "train_runtime": 838.0615, "train_tokens_per_second": 448.28 }, { "epoch": 0.15557217651458488, "grad_norm": 2.278661012649536, "learning_rate": 1.8468449197860965e-05, "loss": 0.12076908349990845, "num_input_tokens_seen": 377046, "step": 364, "train_runtime": 840.2695, "train_tokens_per_second": 448.72 }, { "epoch": 0.15599957260391067, "grad_norm": 4.426092624664307, "learning_rate": 1.8464171122994655e-05, "loss": 0.2757834792137146, "num_input_tokens_seen": 377830, "step": 365, "train_runtime": 842.2549, "train_tokens_per_second": 448.593 }, { "epoch": 0.15642696869323647, "grad_norm": 3.152621269226074, "learning_rate": 1.8459893048128344e-05, "loss": 0.16674590110778809, "num_input_tokens_seen": 379008, "step": 366, "train_runtime": 844.3522, "train_tokens_per_second": 448.874 }, { "epoch": 0.15685436478256223, "grad_norm": 3.77046275138855, "learning_rate": 1.8455614973262034e-05, "loss": 0.2336619347333908, "num_input_tokens_seen": 379960, "step": 367, "train_runtime": 846.3598, "train_tokens_per_second": 448.934 }, { "epoch": 0.15728176087188803, "grad_norm": 3.0744481086730957, "learning_rate": 1.8451336898395723e-05, "loss": 0.16401953995227814, "num_input_tokens_seen": 381224, "step": 368, "train_runtime": 848.4986, "train_tokens_per_second": 449.292 }, { "epoch": 0.1577091569612138, "grad_norm": 2.2774553298950195, "learning_rate": 1.8447058823529413e-05, "loss": 0.080047607421875, "num_input_tokens_seen": 381954, "step": 369, "train_runtime": 850.4565, "train_tokens_per_second": 449.116 }, { "epoch": 0.15813655305053959, "grad_norm": 3.4942691326141357, "learning_rate": 1.8442780748663102e-05, "loss": 0.16062352061271667, "num_input_tokens_seen": 382930, "step": 370, "train_runtime": 852.5438, "train_tokens_per_second": 449.162 }, { "epoch": 0.15856394913986538, "grad_norm": 3.2642838954925537, "learning_rate": 1.843850267379679e-05, "loss": 0.17898786067962646, "num_input_tokens_seen": 384038, "step": 371, "train_runtime": 854.6314, "train_tokens_per_second": 449.361 }, { "epoch": 0.15899134522919114, "grad_norm": 3.8704471588134766, "learning_rate": 1.8434224598930484e-05, "loss": 0.24493300914764404, "num_input_tokens_seen": 385318, "step": 372, "train_runtime": 856.7494, "train_tokens_per_second": 449.744 }, { "epoch": 0.15941874131851694, "grad_norm": 3.457505941390991, "learning_rate": 1.8429946524064174e-05, "loss": 0.1411478966474533, "num_input_tokens_seen": 386132, "step": 373, "train_runtime": 858.8073, "train_tokens_per_second": 449.614 }, { "epoch": 0.15984613740784273, "grad_norm": 3.7425549030303955, "learning_rate": 1.8425668449197863e-05, "loss": 0.125191792845726, "num_input_tokens_seen": 386856, "step": 374, "train_runtime": 860.8107, "train_tokens_per_second": 449.409 }, { "epoch": 0.1602735334971685, "grad_norm": 3.255617618560791, "learning_rate": 1.8421390374331553e-05, "loss": 0.17602336406707764, "num_input_tokens_seen": 388868, "step": 375, "train_runtime": 863.2429, "train_tokens_per_second": 450.473 }, { "epoch": 0.1607009295864943, "grad_norm": 3.0290393829345703, "learning_rate": 1.8417112299465242e-05, "loss": 0.12505877017974854, "num_input_tokens_seen": 389734, "step": 376, "train_runtime": 865.3651, "train_tokens_per_second": 450.369 }, { "epoch": 0.16112832567582006, "grad_norm": 2.4295220375061035, "learning_rate": 1.841283422459893e-05, "loss": 0.14126133918762207, "num_input_tokens_seen": 391344, "step": 377, "train_runtime": 867.5522, "train_tokens_per_second": 451.09 }, { "epoch": 0.16155572176514585, "grad_norm": 4.606272220611572, "learning_rate": 1.840855614973262e-05, "loss": 0.13228780031204224, "num_input_tokens_seen": 392618, "step": 378, "train_runtime": 869.6981, "train_tokens_per_second": 451.442 }, { "epoch": 0.16198311785447164, "grad_norm": 3.0182430744171143, "learning_rate": 1.840427807486631e-05, "loss": 0.12397598475217819, "num_input_tokens_seen": 393650, "step": 379, "train_runtime": 871.7806, "train_tokens_per_second": 451.547 }, { "epoch": 0.1624105139437974, "grad_norm": 3.784773349761963, "learning_rate": 1.8400000000000003e-05, "loss": 0.1671362966299057, "num_input_tokens_seen": 394766, "step": 380, "train_runtime": 873.8605, "train_tokens_per_second": 451.749 }, { "epoch": 0.1628379100331232, "grad_norm": 3.4677631855010986, "learning_rate": 1.8395721925133693e-05, "loss": 0.1889929324388504, "num_input_tokens_seen": 396408, "step": 381, "train_runtime": 876.0321, "train_tokens_per_second": 452.504 }, { "epoch": 0.16326530612244897, "grad_norm": 4.223570346832275, "learning_rate": 1.8391443850267382e-05, "loss": 0.279923677444458, "num_input_tokens_seen": 397408, "step": 382, "train_runtime": 878.089, "train_tokens_per_second": 452.583 }, { "epoch": 0.16369270221177476, "grad_norm": 2.817697763442993, "learning_rate": 1.8387165775401072e-05, "loss": 0.1628781259059906, "num_input_tokens_seen": 398320, "step": 383, "train_runtime": 880.123, "train_tokens_per_second": 452.573 }, { "epoch": 0.16412009830110055, "grad_norm": 3.717114210128784, "learning_rate": 1.838288770053476e-05, "loss": 0.22462254762649536, "num_input_tokens_seen": 399114, "step": 384, "train_runtime": 882.0883, "train_tokens_per_second": 452.465 }, { "epoch": 0.16454749439042632, "grad_norm": 3.7585573196411133, "learning_rate": 1.837860962566845e-05, "loss": 0.20147722959518433, "num_input_tokens_seen": 400164, "step": 385, "train_runtime": 884.1495, "train_tokens_per_second": 452.598 }, { "epoch": 0.1649748904797521, "grad_norm": 3.3615450859069824, "learning_rate": 1.837433155080214e-05, "loss": 0.1268632709980011, "num_input_tokens_seen": 401158, "step": 386, "train_runtime": 886.1683, "train_tokens_per_second": 452.688 }, { "epoch": 0.1654022865690779, "grad_norm": 2.9951412677764893, "learning_rate": 1.837005347593583e-05, "loss": 0.16406765580177307, "num_input_tokens_seen": 402288, "step": 387, "train_runtime": 888.2214, "train_tokens_per_second": 452.914 }, { "epoch": 0.16582968265840367, "grad_norm": 3.7813777923583984, "learning_rate": 1.8365775401069522e-05, "loss": 0.21073871850967407, "num_input_tokens_seen": 403888, "step": 388, "train_runtime": 890.4253, "train_tokens_per_second": 453.59 }, { "epoch": 0.16625707874772946, "grad_norm": 2.657719612121582, "learning_rate": 1.8361497326203212e-05, "loss": 0.10052626579999924, "num_input_tokens_seen": 404850, "step": 389, "train_runtime": 892.4732, "train_tokens_per_second": 453.627 }, { "epoch": 0.16668447483705523, "grad_norm": 3.0095977783203125, "learning_rate": 1.83572192513369e-05, "loss": 0.13588152825832367, "num_input_tokens_seen": 405874, "step": 390, "train_runtime": 894.5257, "train_tokens_per_second": 453.731 }, { "epoch": 0.16711187092638102, "grad_norm": 2.6088316440582275, "learning_rate": 1.8352941176470587e-05, "loss": 0.13496223092079163, "num_input_tokens_seen": 407232, "step": 391, "train_runtime": 903.2552, "train_tokens_per_second": 450.849 }, { "epoch": 0.16753926701570682, "grad_norm": 3.707267999649048, "learning_rate": 1.834866310160428e-05, "loss": 0.22445905208587646, "num_input_tokens_seen": 408164, "step": 392, "train_runtime": 905.2755, "train_tokens_per_second": 450.873 }, { "epoch": 0.16796666310503258, "grad_norm": 3.083017349243164, "learning_rate": 1.834438502673797e-05, "loss": 0.14702178537845612, "num_input_tokens_seen": 409462, "step": 393, "train_runtime": 907.4003, "train_tokens_per_second": 451.247 }, { "epoch": 0.16839405919435838, "grad_norm": 3.6747193336486816, "learning_rate": 1.834010695187166e-05, "loss": 0.13536429405212402, "num_input_tokens_seen": 410536, "step": 394, "train_runtime": 909.4546, "train_tokens_per_second": 451.409 }, { "epoch": 0.16882145528368414, "grad_norm": 3.5335593223571777, "learning_rate": 1.833582887700535e-05, "loss": 0.08958180993795395, "num_input_tokens_seen": 411574, "step": 395, "train_runtime": 911.5201, "train_tokens_per_second": 451.525 }, { "epoch": 0.16924885137300993, "grad_norm": 4.21598482131958, "learning_rate": 1.833155080213904e-05, "loss": 0.12426377832889557, "num_input_tokens_seen": 412522, "step": 396, "train_runtime": 913.5858, "train_tokens_per_second": 451.542 }, { "epoch": 0.16967624746233573, "grad_norm": 3.440768241882324, "learning_rate": 1.832727272727273e-05, "loss": 0.10499773174524307, "num_input_tokens_seen": 413270, "step": 397, "train_runtime": 915.595, "train_tokens_per_second": 451.368 }, { "epoch": 0.1701036435516615, "grad_norm": 3.2018141746520996, "learning_rate": 1.8322994652406417e-05, "loss": 0.15937253832817078, "num_input_tokens_seen": 414482, "step": 398, "train_runtime": 917.826, "train_tokens_per_second": 451.591 }, { "epoch": 0.1705310396409873, "grad_norm": 3.3081984519958496, "learning_rate": 1.8318716577540106e-05, "loss": 0.16216382384300232, "num_input_tokens_seen": 415424, "step": 399, "train_runtime": 919.8549, "train_tokens_per_second": 451.619 }, { "epoch": 0.17095843573031308, "grad_norm": 3.623704671859741, "learning_rate": 1.83144385026738e-05, "loss": 0.11215674877166748, "num_input_tokens_seen": 416154, "step": 400, "train_runtime": 921.8503, "train_tokens_per_second": 451.433 }, { "epoch": 0.17138583181963885, "grad_norm": 3.782424211502075, "learning_rate": 1.831016042780749e-05, "loss": 0.1894763559103012, "num_input_tokens_seen": 417020, "step": 401, "train_runtime": 923.871, "train_tokens_per_second": 451.383 }, { "epoch": 0.17181322790896464, "grad_norm": 3.312699794769287, "learning_rate": 1.8305882352941178e-05, "loss": 0.14521507918834686, "num_input_tokens_seen": 418036, "step": 402, "train_runtime": 925.8911, "train_tokens_per_second": 451.496 }, { "epoch": 0.1722406239982904, "grad_norm": 2.5472071170806885, "learning_rate": 1.8301604278074867e-05, "loss": 0.12104392051696777, "num_input_tokens_seen": 419384, "step": 403, "train_runtime": 927.9956, "train_tokens_per_second": 451.925 }, { "epoch": 0.1726680200876162, "grad_norm": 3.5174648761749268, "learning_rate": 1.8297326203208557e-05, "loss": 0.18970666825771332, "num_input_tokens_seen": 420338, "step": 404, "train_runtime": 930.0683, "train_tokens_per_second": 451.943 }, { "epoch": 0.173095416176942, "grad_norm": 3.4436521530151367, "learning_rate": 1.8293048128342246e-05, "loss": 0.17532992362976074, "num_input_tokens_seen": 421290, "step": 405, "train_runtime": 932.0969, "train_tokens_per_second": 451.981 }, { "epoch": 0.17352281226626776, "grad_norm": 3.6591150760650635, "learning_rate": 1.8288770053475936e-05, "loss": 0.20689848065376282, "num_input_tokens_seen": 422422, "step": 406, "train_runtime": 934.1993, "train_tokens_per_second": 452.175 }, { "epoch": 0.17395020835559355, "grad_norm": 2.3392040729522705, "learning_rate": 1.8284491978609625e-05, "loss": 0.13393135368824005, "num_input_tokens_seen": 423902, "step": 407, "train_runtime": 936.3749, "train_tokens_per_second": 452.705 }, { "epoch": 0.17437760444491932, "grad_norm": 3.121617555618286, "learning_rate": 1.8280213903743318e-05, "loss": 0.16588927805423737, "num_input_tokens_seen": 425214, "step": 408, "train_runtime": 938.4945, "train_tokens_per_second": 453.081 }, { "epoch": 0.1748050005342451, "grad_norm": 2.4870142936706543, "learning_rate": 1.8275935828877007e-05, "loss": 0.07691413909196854, "num_input_tokens_seen": 426314, "step": 409, "train_runtime": 940.5254, "train_tokens_per_second": 453.272 }, { "epoch": 0.1752323966235709, "grad_norm": 2.869314193725586, "learning_rate": 1.8271657754010697e-05, "loss": 0.1472451090812683, "num_input_tokens_seen": 427306, "step": 410, "train_runtime": 942.5554, "train_tokens_per_second": 453.348 }, { "epoch": 0.17565979271289667, "grad_norm": 2.8579304218292236, "learning_rate": 1.8267379679144386e-05, "loss": 0.12922635674476624, "num_input_tokens_seen": 428258, "step": 411, "train_runtime": 944.6391, "train_tokens_per_second": 453.356 }, { "epoch": 0.17608718880222246, "grad_norm": 2.791553020477295, "learning_rate": 1.8263101604278076e-05, "loss": 0.14650341868400574, "num_input_tokens_seen": 429488, "step": 412, "train_runtime": 946.7275, "train_tokens_per_second": 453.655 }, { "epoch": 0.17651458489154825, "grad_norm": 3.428823709487915, "learning_rate": 1.8258823529411765e-05, "loss": 0.20975293219089508, "num_input_tokens_seen": 430388, "step": 413, "train_runtime": 948.8014, "train_tokens_per_second": 453.612 }, { "epoch": 0.17694198098087402, "grad_norm": 4.322518825531006, "learning_rate": 1.8254545454545455e-05, "loss": 0.286907434463501, "num_input_tokens_seen": 431344, "step": 414, "train_runtime": 950.8826, "train_tokens_per_second": 453.625 }, { "epoch": 0.1773693770701998, "grad_norm": 2.7757461071014404, "learning_rate": 1.8250267379679144e-05, "loss": 0.19005164504051208, "num_input_tokens_seen": 432614, "step": 415, "train_runtime": 953.0084, "train_tokens_per_second": 453.946 }, { "epoch": 0.17779677315952558, "grad_norm": 3.2586443424224854, "learning_rate": 1.8245989304812837e-05, "loss": 0.11516334861516953, "num_input_tokens_seen": 433394, "step": 416, "train_runtime": 955.0325, "train_tokens_per_second": 453.8 }, { "epoch": 0.17822416924885137, "grad_norm": 3.8034894466400146, "learning_rate": 1.8241711229946526e-05, "loss": 0.23013776540756226, "num_input_tokens_seen": 434194, "step": 417, "train_runtime": 957.0669, "train_tokens_per_second": 453.672 }, { "epoch": 0.17865156533817717, "grad_norm": 3.1263651847839355, "learning_rate": 1.8237433155080216e-05, "loss": 0.19704614579677582, "num_input_tokens_seen": 435574, "step": 418, "train_runtime": 959.2001, "train_tokens_per_second": 454.101 }, { "epoch": 0.17907896142750293, "grad_norm": 2.3848934173583984, "learning_rate": 1.8233155080213905e-05, "loss": 0.10682269930839539, "num_input_tokens_seen": 436530, "step": 419, "train_runtime": 961.2195, "train_tokens_per_second": 454.142 }, { "epoch": 0.17950635751682872, "grad_norm": 2.6706292629241943, "learning_rate": 1.8228877005347595e-05, "loss": 0.13585788011550903, "num_input_tokens_seen": 437646, "step": 420, "train_runtime": 963.3213, "train_tokens_per_second": 454.309 }, { "epoch": 0.17993375360615452, "grad_norm": 2.38997745513916, "learning_rate": 1.8224598930481284e-05, "loss": 0.11742988228797913, "num_input_tokens_seen": 439542, "step": 421, "train_runtime": 972.385, "train_tokens_per_second": 452.025 }, { "epoch": 0.18036114969548028, "grad_norm": 3.0404889583587646, "learning_rate": 1.8220320855614974e-05, "loss": 0.12024495005607605, "num_input_tokens_seen": 440376, "step": 422, "train_runtime": 974.517, "train_tokens_per_second": 451.892 }, { "epoch": 0.18078854578480608, "grad_norm": 3.102108955383301, "learning_rate": 1.8216042780748663e-05, "loss": 0.16088958084583282, "num_input_tokens_seen": 441150, "step": 423, "train_runtime": 976.5189, "train_tokens_per_second": 451.758 }, { "epoch": 0.18121594187413184, "grad_norm": 2.958465337753296, "learning_rate": 1.8211764705882356e-05, "loss": 0.11718589812517166, "num_input_tokens_seen": 441932, "step": 424, "train_runtime": 978.5149, "train_tokens_per_second": 451.635 }, { "epoch": 0.18164333796345764, "grad_norm": 2.6293013095855713, "learning_rate": 1.8207486631016045e-05, "loss": 0.09669187664985657, "num_input_tokens_seen": 442800, "step": 425, "train_runtime": 980.5422, "train_tokens_per_second": 451.587 }, { "epoch": 0.18207073405278343, "grad_norm": 3.878410816192627, "learning_rate": 1.8203208556149735e-05, "loss": 0.21885468065738678, "num_input_tokens_seen": 443690, "step": 426, "train_runtime": 982.5882, "train_tokens_per_second": 451.552 }, { "epoch": 0.1824981301421092, "grad_norm": 3.7683587074279785, "learning_rate": 1.8198930481283424e-05, "loss": 0.19215959310531616, "num_input_tokens_seen": 445006, "step": 427, "train_runtime": 984.7498, "train_tokens_per_second": 451.898 }, { "epoch": 0.182925526231435, "grad_norm": 4.942471027374268, "learning_rate": 1.8194652406417114e-05, "loss": 0.250957190990448, "num_input_tokens_seen": 445768, "step": 428, "train_runtime": 986.7483, "train_tokens_per_second": 451.754 }, { "epoch": 0.18335292232076075, "grad_norm": 3.3123409748077393, "learning_rate": 1.8190374331550803e-05, "loss": 0.23503629863262177, "num_input_tokens_seen": 446872, "step": 429, "train_runtime": 988.8509, "train_tokens_per_second": 451.91 }, { "epoch": 0.18378031841008655, "grad_norm": 3.3676066398620605, "learning_rate": 1.8186096256684493e-05, "loss": 0.20039096474647522, "num_input_tokens_seen": 448346, "step": 430, "train_runtime": 991.0611, "train_tokens_per_second": 452.39 }, { "epoch": 0.18420771449941234, "grad_norm": 4.725825309753418, "learning_rate": 1.8181818181818182e-05, "loss": 0.22150349617004395, "num_input_tokens_seen": 449010, "step": 431, "train_runtime": 993.0153, "train_tokens_per_second": 452.168 }, { "epoch": 0.1846351105887381, "grad_norm": 3.901179790496826, "learning_rate": 1.8177540106951875e-05, "loss": 0.14798009395599365, "num_input_tokens_seen": 449648, "step": 432, "train_runtime": 994.9649, "train_tokens_per_second": 451.923 }, { "epoch": 0.1850625066780639, "grad_norm": 2.6945748329162598, "learning_rate": 1.8173262032085564e-05, "loss": 0.15738606452941895, "num_input_tokens_seen": 450730, "step": 433, "train_runtime": 997.1186, "train_tokens_per_second": 452.032 }, { "epoch": 0.1854899027673897, "grad_norm": 3.1521708965301514, "learning_rate": 1.8168983957219254e-05, "loss": 0.16670338809490204, "num_input_tokens_seen": 451750, "step": 434, "train_runtime": 999.2258, "train_tokens_per_second": 452.1 }, { "epoch": 0.18591729885671546, "grad_norm": 3.082484006881714, "learning_rate": 1.8164705882352943e-05, "loss": 0.13141794502735138, "num_input_tokens_seen": 452766, "step": 435, "train_runtime": 1001.2886, "train_tokens_per_second": 452.183 }, { "epoch": 0.18634469494604125, "grad_norm": 3.484811782836914, "learning_rate": 1.8160427807486633e-05, "loss": 0.11263776570558548, "num_input_tokens_seen": 453596, "step": 436, "train_runtime": 1003.2861, "train_tokens_per_second": 452.11 }, { "epoch": 0.18677209103536702, "grad_norm": 2.980639934539795, "learning_rate": 1.8156149732620322e-05, "loss": 0.19117361307144165, "num_input_tokens_seen": 454666, "step": 437, "train_runtime": 1005.3559, "train_tokens_per_second": 452.244 }, { "epoch": 0.1871994871246928, "grad_norm": 3.6414475440979004, "learning_rate": 1.815187165775401e-05, "loss": 0.16954579949378967, "num_input_tokens_seen": 455646, "step": 438, "train_runtime": 1007.4016, "train_tokens_per_second": 452.298 }, { "epoch": 0.1876268832140186, "grad_norm": 2.5613105297088623, "learning_rate": 1.81475935828877e-05, "loss": 0.1326548159122467, "num_input_tokens_seen": 457336, "step": 439, "train_runtime": 1009.6099, "train_tokens_per_second": 452.983 }, { "epoch": 0.18805427930334437, "grad_norm": 3.301633358001709, "learning_rate": 1.8143315508021394e-05, "loss": 0.173603817820549, "num_input_tokens_seen": 458736, "step": 440, "train_runtime": 1011.7589, "train_tokens_per_second": 453.404 }, { "epoch": 0.18848167539267016, "grad_norm": 2.6853365898132324, "learning_rate": 1.8139037433155083e-05, "loss": 0.12467221915721893, "num_input_tokens_seen": 459680, "step": 441, "train_runtime": 1013.8682, "train_tokens_per_second": 453.392 }, { "epoch": 0.18890907148199593, "grad_norm": 2.6115994453430176, "learning_rate": 1.8134759358288773e-05, "loss": 0.14297708868980408, "num_input_tokens_seen": 460690, "step": 442, "train_runtime": 1015.9842, "train_tokens_per_second": 453.442 }, { "epoch": 0.18933646757132172, "grad_norm": 1.9338431358337402, "learning_rate": 1.8130481283422462e-05, "loss": 0.05107812583446503, "num_input_tokens_seen": 461756, "step": 443, "train_runtime": 1018.1832, "train_tokens_per_second": 453.51 }, { "epoch": 0.1897638636606475, "grad_norm": 2.7567906379699707, "learning_rate": 1.812620320855615e-05, "loss": 0.105326347053051, "num_input_tokens_seen": 462770, "step": 444, "train_runtime": 1020.3097, "train_tokens_per_second": 453.558 }, { "epoch": 0.19019125974997328, "grad_norm": 2.0738582611083984, "learning_rate": 1.812192513368984e-05, "loss": 0.08425863832235336, "num_input_tokens_seen": 463976, "step": 445, "train_runtime": 1022.4078, "train_tokens_per_second": 453.807 }, { "epoch": 0.19061865583929907, "grad_norm": 3.048781156539917, "learning_rate": 1.811764705882353e-05, "loss": 0.15324826538562775, "num_input_tokens_seen": 464878, "step": 446, "train_runtime": 1024.4659, "train_tokens_per_second": 453.776 }, { "epoch": 0.19104605192862487, "grad_norm": 3.7193727493286133, "learning_rate": 1.811336898395722e-05, "loss": 0.16986773908138275, "num_input_tokens_seen": 465974, "step": 447, "train_runtime": 1026.5798, "train_tokens_per_second": 453.909 }, { "epoch": 0.19147344801795063, "grad_norm": 2.749384641647339, "learning_rate": 1.810909090909091e-05, "loss": 0.18088173866271973, "num_input_tokens_seen": 467186, "step": 448, "train_runtime": 1028.6981, "train_tokens_per_second": 454.153 }, { "epoch": 0.19190084410727642, "grad_norm": 2.837508201599121, "learning_rate": 1.8104812834224602e-05, "loss": 0.1461426317691803, "num_input_tokens_seen": 468308, "step": 449, "train_runtime": 1030.7883, "train_tokens_per_second": 454.32 }, { "epoch": 0.1923282401966022, "grad_norm": 2.9812381267547607, "learning_rate": 1.8100534759358292e-05, "loss": 0.13258974254131317, "num_input_tokens_seen": 469070, "step": 450, "train_runtime": 1032.8413, "train_tokens_per_second": 454.155 }, { "epoch": 0.19275563628592798, "grad_norm": 5.960050106048584, "learning_rate": 1.809625668449198e-05, "loss": 0.1815432608127594, "num_input_tokens_seen": 469884, "step": 451, "train_runtime": 1041.6011, "train_tokens_per_second": 451.117 }, { "epoch": 0.19318303237525378, "grad_norm": 3.958709716796875, "learning_rate": 1.8091978609625667e-05, "loss": 0.1256699413061142, "num_input_tokens_seen": 470606, "step": 452, "train_runtime": 1043.6271, "train_tokens_per_second": 450.933 }, { "epoch": 0.19361042846457954, "grad_norm": 3.3820741176605225, "learning_rate": 1.808770053475936e-05, "loss": 0.1685105860233307, "num_input_tokens_seen": 471720, "step": 453, "train_runtime": 1045.7944, "train_tokens_per_second": 451.064 }, { "epoch": 0.19403782455390534, "grad_norm": 4.036883354187012, "learning_rate": 1.808342245989305e-05, "loss": 0.16119134426116943, "num_input_tokens_seen": 472782, "step": 454, "train_runtime": 1047.8862, "train_tokens_per_second": 451.177 }, { "epoch": 0.1944652206432311, "grad_norm": 4.750235557556152, "learning_rate": 1.807914438502674e-05, "loss": 0.19967752695083618, "num_input_tokens_seen": 473422, "step": 455, "train_runtime": 1049.809, "train_tokens_per_second": 450.96 }, { "epoch": 0.1948926167325569, "grad_norm": 3.6832988262176514, "learning_rate": 1.807486631016043e-05, "loss": 0.16555368900299072, "num_input_tokens_seen": 474068, "step": 456, "train_runtime": 1051.8073, "train_tokens_per_second": 450.718 }, { "epoch": 0.1953200128218827, "grad_norm": 3.330173969268799, "learning_rate": 1.807058823529412e-05, "loss": 0.1114584356546402, "num_input_tokens_seen": 475158, "step": 457, "train_runtime": 1053.9072, "train_tokens_per_second": 450.854 }, { "epoch": 0.19574740891120845, "grad_norm": 3.2561466693878174, "learning_rate": 1.806631016042781e-05, "loss": 0.1865159571170807, "num_input_tokens_seen": 476750, "step": 458, "train_runtime": 1056.1027, "train_tokens_per_second": 451.424 }, { "epoch": 0.19617480500053425, "grad_norm": 3.319549083709717, "learning_rate": 1.8062032085561497e-05, "loss": 0.1691288948059082, "num_input_tokens_seen": 477686, "step": 459, "train_runtime": 1058.131, "train_tokens_per_second": 451.443 }, { "epoch": 0.19660220108986004, "grad_norm": 3.0110888481140137, "learning_rate": 1.8057754010695186e-05, "loss": 0.13728314638137817, "num_input_tokens_seen": 478550, "step": 460, "train_runtime": 1060.1336, "train_tokens_per_second": 451.405 }, { "epoch": 0.1970295971791858, "grad_norm": 3.8415775299072266, "learning_rate": 1.805347593582888e-05, "loss": 0.24058830738067627, "num_input_tokens_seen": 479448, "step": 461, "train_runtime": 1062.1543, "train_tokens_per_second": 451.392 }, { "epoch": 0.1974569932685116, "grad_norm": 3.1477935314178467, "learning_rate": 1.804919786096257e-05, "loss": 0.12435933202505112, "num_input_tokens_seen": 480304, "step": 462, "train_runtime": 1064.1871, "train_tokens_per_second": 451.334 }, { "epoch": 0.19788438935783736, "grad_norm": 2.164750337600708, "learning_rate": 1.8044919786096258e-05, "loss": 0.10824844241142273, "num_input_tokens_seen": 481772, "step": 463, "train_runtime": 1066.4032, "train_tokens_per_second": 451.773 }, { "epoch": 0.19831178544716316, "grad_norm": 4.262755393981934, "learning_rate": 1.8040641711229947e-05, "loss": 0.1483963429927826, "num_input_tokens_seen": 482828, "step": 464, "train_runtime": 1068.4999, "train_tokens_per_second": 451.875 }, { "epoch": 0.19873918153648895, "grad_norm": 3.3177640438079834, "learning_rate": 1.803636363636364e-05, "loss": 0.12290341407060623, "num_input_tokens_seen": 483550, "step": 465, "train_runtime": 1070.4703, "train_tokens_per_second": 451.717 }, { "epoch": 0.19916657762581472, "grad_norm": 4.042696952819824, "learning_rate": 1.8032085561497326e-05, "loss": 0.18432125449180603, "num_input_tokens_seen": 484462, "step": 466, "train_runtime": 1072.54, "train_tokens_per_second": 451.696 }, { "epoch": 0.1995939737151405, "grad_norm": 4.409545421600342, "learning_rate": 1.8027807486631016e-05, "loss": 0.18324634432792664, "num_input_tokens_seen": 485672, "step": 467, "train_runtime": 1074.6616, "train_tokens_per_second": 451.93 }, { "epoch": 0.20002136980446628, "grad_norm": 2.6798605918884277, "learning_rate": 1.8023529411764705e-05, "loss": 0.10559245944023132, "num_input_tokens_seen": 486932, "step": 468, "train_runtime": 1076.832, "train_tokens_per_second": 452.189 }, { "epoch": 0.20002136980446628, "eval_loss": 0.5899712443351746, "eval_runtime": 58.14, "eval_samples_per_second": 17.165, "eval_steps_per_second": 8.583, "num_input_tokens_seen": 486932, "step": 468 }, { "epoch": 0.20044876589379207, "grad_norm": 3.4593505859375, "learning_rate": 1.8019251336898398e-05, "loss": 0.2516295611858368, "num_input_tokens_seen": 487912, "step": 469, "train_runtime": 1137.0689, "train_tokens_per_second": 429.096 }, { "epoch": 0.20087616198311786, "grad_norm": 3.63491153717041, "learning_rate": 1.8014973262032087e-05, "loss": 0.13701091706752777, "num_input_tokens_seen": 488624, "step": 470, "train_runtime": 1139.046, "train_tokens_per_second": 428.977 }, { "epoch": 0.20130355807244363, "grad_norm": 3.00518798828125, "learning_rate": 1.8010695187165777e-05, "loss": 0.14881111681461334, "num_input_tokens_seen": 489490, "step": 471, "train_runtime": 1141.0921, "train_tokens_per_second": 428.966 }, { "epoch": 0.20173095416176942, "grad_norm": 3.599620819091797, "learning_rate": 1.8006417112299466e-05, "loss": 0.2012540102005005, "num_input_tokens_seen": 490284, "step": 472, "train_runtime": 1143.0646, "train_tokens_per_second": 428.921 }, { "epoch": 0.20215835025109521, "grad_norm": 3.7925641536712646, "learning_rate": 1.8002139037433156e-05, "loss": 0.13354450464248657, "num_input_tokens_seen": 491452, "step": 473, "train_runtime": 1145.1771, "train_tokens_per_second": 429.149 }, { "epoch": 0.20258574634042098, "grad_norm": 3.233987331390381, "learning_rate": 1.7997860962566845e-05, "loss": 0.13340525329113007, "num_input_tokens_seen": 492384, "step": 474, "train_runtime": 1147.2256, "train_tokens_per_second": 429.195 }, { "epoch": 0.20301314242974677, "grad_norm": 18.15591049194336, "learning_rate": 1.7993582887700535e-05, "loss": 0.16208212077617645, "num_input_tokens_seen": 493588, "step": 475, "train_runtime": 1149.3054, "train_tokens_per_second": 429.466 }, { "epoch": 0.20344053851907254, "grad_norm": 2.619872808456421, "learning_rate": 1.7989304812834224e-05, "loss": 0.14249897003173828, "num_input_tokens_seen": 495088, "step": 476, "train_runtime": 1151.4864, "train_tokens_per_second": 429.956 }, { "epoch": 0.20386793460839833, "grad_norm": 2.6133358478546143, "learning_rate": 1.7985026737967917e-05, "loss": 0.18429988622665405, "num_input_tokens_seen": 496728, "step": 477, "train_runtime": 1153.6992, "train_tokens_per_second": 430.552 }, { "epoch": 0.20429533069772413, "grad_norm": 2.314570426940918, "learning_rate": 1.7980748663101606e-05, "loss": 0.10642392188310623, "num_input_tokens_seen": 497664, "step": 478, "train_runtime": 1155.7282, "train_tokens_per_second": 430.606 }, { "epoch": 0.2047227267870499, "grad_norm": 2.7060182094573975, "learning_rate": 1.7976470588235296e-05, "loss": 0.13580118119716644, "num_input_tokens_seen": 498506, "step": 479, "train_runtime": 1157.7879, "train_tokens_per_second": 430.568 }, { "epoch": 0.20515012287637568, "grad_norm": 2.408872127532959, "learning_rate": 1.7972192513368985e-05, "loss": 0.09444678574800491, "num_input_tokens_seen": 499478, "step": 480, "train_runtime": 1159.8664, "train_tokens_per_second": 430.634 }, { "epoch": 0.20557751896570145, "grad_norm": 3.5546629428863525, "learning_rate": 1.7967914438502675e-05, "loss": 0.12948663532733917, "num_input_tokens_seen": 500350, "step": 481, "train_runtime": 1168.4237, "train_tokens_per_second": 428.227 }, { "epoch": 0.20600491505502724, "grad_norm": 3.448176145553589, "learning_rate": 1.7963636363636364e-05, "loss": 0.1861601024866104, "num_input_tokens_seen": 501142, "step": 482, "train_runtime": 1170.5777, "train_tokens_per_second": 428.115 }, { "epoch": 0.20643231114435304, "grad_norm": 3.6159188747406006, "learning_rate": 1.7959358288770054e-05, "loss": 0.1830386519432068, "num_input_tokens_seen": 502198, "step": 483, "train_runtime": 1172.7358, "train_tokens_per_second": 428.228 }, { "epoch": 0.2068597072336788, "grad_norm": 3.0487568378448486, "learning_rate": 1.7955080213903743e-05, "loss": 0.1396036595106125, "num_input_tokens_seen": 503676, "step": 484, "train_runtime": 1174.9427, "train_tokens_per_second": 428.681 }, { "epoch": 0.2072871033230046, "grad_norm": 4.191316604614258, "learning_rate": 1.7950802139037436e-05, "loss": 0.23336780071258545, "num_input_tokens_seen": 504508, "step": 485, "train_runtime": 1176.8983, "train_tokens_per_second": 428.676 }, { "epoch": 0.2077144994123304, "grad_norm": 2.661525011062622, "learning_rate": 1.7946524064171125e-05, "loss": 0.1197209283709526, "num_input_tokens_seen": 505448, "step": 486, "train_runtime": 1178.9343, "train_tokens_per_second": 428.733 }, { "epoch": 0.20814189550165615, "grad_norm": 5.443660259246826, "learning_rate": 1.7942245989304815e-05, "loss": 0.16842028498649597, "num_input_tokens_seen": 506284, "step": 487, "train_runtime": 1180.9598, "train_tokens_per_second": 428.706 }, { "epoch": 0.20856929159098195, "grad_norm": 3.885406732559204, "learning_rate": 1.7937967914438504e-05, "loss": 0.23998695611953735, "num_input_tokens_seen": 507260, "step": 488, "train_runtime": 1183.0058, "train_tokens_per_second": 428.789 }, { "epoch": 0.2089966876803077, "grad_norm": 3.6050217151641846, "learning_rate": 1.7933689839572194e-05, "loss": 0.10298469662666321, "num_input_tokens_seen": 508176, "step": 489, "train_runtime": 1185.0292, "train_tokens_per_second": 428.83 }, { "epoch": 0.2094240837696335, "grad_norm": 2.4668757915496826, "learning_rate": 1.7929411764705883e-05, "loss": 0.1151868999004364, "num_input_tokens_seen": 509374, "step": 490, "train_runtime": 1187.1425, "train_tokens_per_second": 429.076 }, { "epoch": 0.2098514798589593, "grad_norm": 3.3567590713500977, "learning_rate": 1.7925133689839573e-05, "loss": 0.18225990235805511, "num_input_tokens_seen": 510504, "step": 491, "train_runtime": 1189.2331, "train_tokens_per_second": 429.272 }, { "epoch": 0.21027887594828507, "grad_norm": 3.4371345043182373, "learning_rate": 1.7920855614973262e-05, "loss": 0.18509897589683533, "num_input_tokens_seen": 512370, "step": 492, "train_runtime": 1191.4364, "train_tokens_per_second": 430.044 }, { "epoch": 0.21070627203761086, "grad_norm": 3.046013832092285, "learning_rate": 1.7916577540106955e-05, "loss": 0.15275262296199799, "num_input_tokens_seen": 513418, "step": 493, "train_runtime": 1193.5018, "train_tokens_per_second": 430.178 }, { "epoch": 0.21113366812693665, "grad_norm": 3.2314887046813965, "learning_rate": 1.7912299465240644e-05, "loss": 0.09924692660570145, "num_input_tokens_seen": 514308, "step": 494, "train_runtime": 1195.5559, "train_tokens_per_second": 430.183 }, { "epoch": 0.21156106421626242, "grad_norm": 3.24064564704895, "learning_rate": 1.7908021390374334e-05, "loss": 0.08571077883243561, "num_input_tokens_seen": 515252, "step": 495, "train_runtime": 1197.6177, "train_tokens_per_second": 430.231 }, { "epoch": 0.2119884603055882, "grad_norm": 3.3843514919281006, "learning_rate": 1.7903743315508023e-05, "loss": 0.15649192035198212, "num_input_tokens_seen": 516116, "step": 496, "train_runtime": 1199.6125, "train_tokens_per_second": 430.236 }, { "epoch": 0.21241585639491398, "grad_norm": 3.2591617107391357, "learning_rate": 1.7899465240641713e-05, "loss": 0.24604164063930511, "num_input_tokens_seen": 517416, "step": 497, "train_runtime": 1201.7331, "train_tokens_per_second": 430.558 }, { "epoch": 0.21284325248423977, "grad_norm": 2.597635269165039, "learning_rate": 1.7895187165775402e-05, "loss": 0.11903823912143707, "num_input_tokens_seen": 518206, "step": 498, "train_runtime": 1203.7242, "train_tokens_per_second": 430.502 }, { "epoch": 0.21327064857356556, "grad_norm": 4.272196292877197, "learning_rate": 1.789090909090909e-05, "loss": 0.19234110414981842, "num_input_tokens_seen": 519112, "step": 499, "train_runtime": 1205.7309, "train_tokens_per_second": 430.537 }, { "epoch": 0.21369804466289133, "grad_norm": 4.057042121887207, "learning_rate": 1.788663101604278e-05, "loss": 0.16333362460136414, "num_input_tokens_seen": 520030, "step": 500, "train_runtime": 1207.7767, "train_tokens_per_second": 430.568 }, { "epoch": 0.21412544075221712, "grad_norm": 2.749988079071045, "learning_rate": 1.7882352941176474e-05, "loss": 0.15354587137699127, "num_input_tokens_seen": 521166, "step": 501, "train_runtime": 1209.9138, "train_tokens_per_second": 430.746 }, { "epoch": 0.2145528368415429, "grad_norm": 1.7050426006317139, "learning_rate": 1.7878074866310163e-05, "loss": 0.08256734907627106, "num_input_tokens_seen": 522844, "step": 502, "train_runtime": 1212.1243, "train_tokens_per_second": 431.345 }, { "epoch": 0.21498023293086868, "grad_norm": 3.860900402069092, "learning_rate": 1.7873796791443853e-05, "loss": 0.1697292923927307, "num_input_tokens_seen": 523784, "step": 503, "train_runtime": 1214.1465, "train_tokens_per_second": 431.401 }, { "epoch": 0.21540762902019447, "grad_norm": 3.3950910568237305, "learning_rate": 1.7869518716577542e-05, "loss": 0.19019439816474915, "num_input_tokens_seen": 524676, "step": 504, "train_runtime": 1216.2315, "train_tokens_per_second": 431.395 }, { "epoch": 0.21583502510952024, "grad_norm": 2.1655850410461426, "learning_rate": 1.786524064171123e-05, "loss": 0.10404959321022034, "num_input_tokens_seen": 525942, "step": 505, "train_runtime": 1218.3528, "train_tokens_per_second": 431.683 }, { "epoch": 0.21626242119884603, "grad_norm": 2.452092170715332, "learning_rate": 1.786096256684492e-05, "loss": 0.10681039094924927, "num_input_tokens_seen": 526914, "step": 506, "train_runtime": 1220.4178, "train_tokens_per_second": 431.749 }, { "epoch": 0.21668981728817183, "grad_norm": 3.558967113494873, "learning_rate": 1.785668449197861e-05, "loss": 0.1856197565793991, "num_input_tokens_seen": 527780, "step": 507, "train_runtime": 1222.4641, "train_tokens_per_second": 431.735 }, { "epoch": 0.2171172133774976, "grad_norm": 2.9209251403808594, "learning_rate": 1.78524064171123e-05, "loss": 0.11624643951654434, "num_input_tokens_seen": 529420, "step": 508, "train_runtime": 1224.6732, "train_tokens_per_second": 432.295 }, { "epoch": 0.21754460946682339, "grad_norm": 4.511392116546631, "learning_rate": 1.7848128342245993e-05, "loss": 0.19399908185005188, "num_input_tokens_seen": 530426, "step": 509, "train_runtime": 1226.7199, "train_tokens_per_second": 432.394 }, { "epoch": 0.21797200555614915, "grad_norm": 3.1867551803588867, "learning_rate": 1.7843850267379682e-05, "loss": 0.19393324851989746, "num_input_tokens_seen": 531432, "step": 510, "train_runtime": 1228.8197, "train_tokens_per_second": 432.474 }, { "epoch": 0.21839940164547494, "grad_norm": 3.1381099224090576, "learning_rate": 1.783957219251337e-05, "loss": 0.1334000676870346, "num_input_tokens_seen": 532300, "step": 511, "train_runtime": 1237.4063, "train_tokens_per_second": 430.174 }, { "epoch": 0.21882679773480074, "grad_norm": 2.9225268363952637, "learning_rate": 1.783529411764706e-05, "loss": 0.160324364900589, "num_input_tokens_seen": 533464, "step": 512, "train_runtime": 1239.5207, "train_tokens_per_second": 430.379 }, { "epoch": 0.2192541938241265, "grad_norm": 2.1712334156036377, "learning_rate": 1.783101604278075e-05, "loss": 0.14365139603614807, "num_input_tokens_seen": 534688, "step": 513, "train_runtime": 1241.8109, "train_tokens_per_second": 430.571 }, { "epoch": 0.2196815899134523, "grad_norm": 3.938077926635742, "learning_rate": 1.782673796791444e-05, "loss": 0.18016456067562103, "num_input_tokens_seen": 535718, "step": 514, "train_runtime": 1243.8776, "train_tokens_per_second": 430.684 }, { "epoch": 0.22010898600277806, "grad_norm": 3.6298506259918213, "learning_rate": 1.782245989304813e-05, "loss": 0.208083376288414, "num_input_tokens_seen": 536774, "step": 515, "train_runtime": 1245.9594, "train_tokens_per_second": 430.812 }, { "epoch": 0.22053638209210386, "grad_norm": 3.076723575592041, "learning_rate": 1.781818181818182e-05, "loss": 0.09675504267215729, "num_input_tokens_seen": 537520, "step": 516, "train_runtime": 1247.945, "train_tokens_per_second": 430.724 }, { "epoch": 0.22096377818142965, "grad_norm": 2.7116281986236572, "learning_rate": 1.781390374331551e-05, "loss": 0.14069856703281403, "num_input_tokens_seen": 538532, "step": 517, "train_runtime": 1250.0419, "train_tokens_per_second": 430.811 }, { "epoch": 0.22139117427075541, "grad_norm": 3.195251941680908, "learning_rate": 1.78096256684492e-05, "loss": 0.1874803602695465, "num_input_tokens_seen": 539472, "step": 518, "train_runtime": 1252.0806, "train_tokens_per_second": 430.86 }, { "epoch": 0.2218185703600812, "grad_norm": 2.814730644226074, "learning_rate": 1.780534759358289e-05, "loss": 0.15296101570129395, "num_input_tokens_seen": 540582, "step": 519, "train_runtime": 1254.1608, "train_tokens_per_second": 431.031 }, { "epoch": 0.222245966449407, "grad_norm": 3.212073802947998, "learning_rate": 1.7801069518716577e-05, "loss": 0.15851101279258728, "num_input_tokens_seen": 541854, "step": 520, "train_runtime": 1256.28, "train_tokens_per_second": 431.316 }, { "epoch": 0.22267336253873277, "grad_norm": 3.0334653854370117, "learning_rate": 1.779679144385027e-05, "loss": 0.15528877079486847, "num_input_tokens_seen": 543082, "step": 521, "train_runtime": 1258.3884, "train_tokens_per_second": 431.569 }, { "epoch": 0.22310075862805856, "grad_norm": 3.363664388656616, "learning_rate": 1.779251336898396e-05, "loss": 0.17860281467437744, "num_input_tokens_seen": 543988, "step": 522, "train_runtime": 1260.41, "train_tokens_per_second": 431.596 }, { "epoch": 0.22352815471738433, "grad_norm": 3.103485107421875, "learning_rate": 1.778823529411765e-05, "loss": 0.20006173849105835, "num_input_tokens_seen": 545036, "step": 523, "train_runtime": 1262.4745, "train_tokens_per_second": 431.72 }, { "epoch": 0.22395555080671012, "grad_norm": 3.38698673248291, "learning_rate": 1.7783957219251338e-05, "loss": 0.15314073860645294, "num_input_tokens_seen": 545972, "step": 524, "train_runtime": 1264.5436, "train_tokens_per_second": 431.754 }, { "epoch": 0.2243829468960359, "grad_norm": 2.5583505630493164, "learning_rate": 1.777967914438503e-05, "loss": 0.14785772562026978, "num_input_tokens_seen": 547502, "step": 525, "train_runtime": 1266.8216, "train_tokens_per_second": 432.186 }, { "epoch": 0.22481034298536168, "grad_norm": 4.153393745422363, "learning_rate": 1.777540106951872e-05, "loss": 0.15759462118148804, "num_input_tokens_seen": 548188, "step": 526, "train_runtime": 1268.8247, "train_tokens_per_second": 432.044 }, { "epoch": 0.22523773907468747, "grad_norm": 3.2607686519622803, "learning_rate": 1.7771122994652406e-05, "loss": 0.1772948056459427, "num_input_tokens_seen": 549974, "step": 527, "train_runtime": 1271.0825, "train_tokens_per_second": 432.682 }, { "epoch": 0.22566513516401324, "grad_norm": 5.678312301635742, "learning_rate": 1.7766844919786096e-05, "loss": 0.29141029715538025, "num_input_tokens_seen": 550696, "step": 528, "train_runtime": 1273.0966, "train_tokens_per_second": 432.564 }, { "epoch": 0.22609253125333903, "grad_norm": 3.297149181365967, "learning_rate": 1.776256684491979e-05, "loss": 0.17609791457653046, "num_input_tokens_seen": 551666, "step": 529, "train_runtime": 1275.1678, "train_tokens_per_second": 432.622 }, { "epoch": 0.22651992734266482, "grad_norm": 2.048459053039551, "learning_rate": 1.7758288770053478e-05, "loss": 0.07686586678028107, "num_input_tokens_seen": 552572, "step": 530, "train_runtime": 1277.1922, "train_tokens_per_second": 432.646 }, { "epoch": 0.2269473234319906, "grad_norm": 2.443927049636841, "learning_rate": 1.7754010695187167e-05, "loss": 0.17237553000450134, "num_input_tokens_seen": 554080, "step": 531, "train_runtime": 1279.3657, "train_tokens_per_second": 433.09 }, { "epoch": 0.22737471952131638, "grad_norm": 2.345522403717041, "learning_rate": 1.7749732620320857e-05, "loss": 0.15595164895057678, "num_input_tokens_seen": 555458, "step": 532, "train_runtime": 1281.6239, "train_tokens_per_second": 433.402 }, { "epoch": 0.22780211561064218, "grad_norm": 3.5701868534088135, "learning_rate": 1.774545454545455e-05, "loss": 0.1228233128786087, "num_input_tokens_seen": 556286, "step": 533, "train_runtime": 1283.6419, "train_tokens_per_second": 433.365 }, { "epoch": 0.22822951169996794, "grad_norm": 3.4031097888946533, "learning_rate": 1.7741176470588236e-05, "loss": 0.1412114053964615, "num_input_tokens_seen": 557110, "step": 534, "train_runtime": 1285.6336, "train_tokens_per_second": 433.335 }, { "epoch": 0.22865690778929373, "grad_norm": 2.7743172645568848, "learning_rate": 1.7736898395721925e-05, "loss": 0.17318317294120789, "num_input_tokens_seen": 558288, "step": 535, "train_runtime": 1287.7462, "train_tokens_per_second": 433.539 }, { "epoch": 0.2290843038786195, "grad_norm": 1.9242955446243286, "learning_rate": 1.7732620320855615e-05, "loss": 0.1027928814291954, "num_input_tokens_seen": 559406, "step": 536, "train_runtime": 1289.9349, "train_tokens_per_second": 433.67 }, { "epoch": 0.2295116999679453, "grad_norm": 2.708173990249634, "learning_rate": 1.7728342245989307e-05, "loss": 0.11816737055778503, "num_input_tokens_seen": 560272, "step": 537, "train_runtime": 1291.9337, "train_tokens_per_second": 433.669 }, { "epoch": 0.2299390960572711, "grad_norm": 3.260429620742798, "learning_rate": 1.7724064171122997e-05, "loss": 0.14136207103729248, "num_input_tokens_seen": 561538, "step": 538, "train_runtime": 1294.0379, "train_tokens_per_second": 433.942 }, { "epoch": 0.23036649214659685, "grad_norm": 4.084691524505615, "learning_rate": 1.7719786096256686e-05, "loss": 0.21478018164634705, "num_input_tokens_seen": 562386, "step": 539, "train_runtime": 1296.0728, "train_tokens_per_second": 433.915 }, { "epoch": 0.23079388823592265, "grad_norm": 4.207942008972168, "learning_rate": 1.7715508021390376e-05, "loss": 0.18661078810691833, "num_input_tokens_seen": 563408, "step": 540, "train_runtime": 1298.1743, "train_tokens_per_second": 434.0 }, { "epoch": 0.2312212843252484, "grad_norm": 3.6092209815979004, "learning_rate": 1.7711229946524065e-05, "loss": 0.17875447869300842, "num_input_tokens_seen": 564254, "step": 541, "train_runtime": 1307.0205, "train_tokens_per_second": 431.71 }, { "epoch": 0.2316486804145742, "grad_norm": 3.1494710445404053, "learning_rate": 1.7706951871657755e-05, "loss": 0.20335906744003296, "num_input_tokens_seen": 565498, "step": 542, "train_runtime": 1309.2062, "train_tokens_per_second": 431.94 }, { "epoch": 0.2320760765039, "grad_norm": 2.553554058074951, "learning_rate": 1.7702673796791444e-05, "loss": 0.11096488684415817, "num_input_tokens_seen": 566718, "step": 543, "train_runtime": 1311.3465, "train_tokens_per_second": 432.165 }, { "epoch": 0.23250347259322576, "grad_norm": 3.310425281524658, "learning_rate": 1.7698395721925133e-05, "loss": 0.17454029619693756, "num_input_tokens_seen": 567764, "step": 544, "train_runtime": 1313.4259, "train_tokens_per_second": 432.277 }, { "epoch": 0.23293086868255156, "grad_norm": 2.9846858978271484, "learning_rate": 1.7694117647058826e-05, "loss": 0.11867425590753555, "num_input_tokens_seen": 568674, "step": 545, "train_runtime": 1315.4473, "train_tokens_per_second": 432.305 }, { "epoch": 0.23335826477187735, "grad_norm": 3.943613290786743, "learning_rate": 1.7689839572192516e-05, "loss": 0.15576013922691345, "num_input_tokens_seen": 569620, "step": 546, "train_runtime": 1317.554, "train_tokens_per_second": 432.331 }, { "epoch": 0.23378566086120312, "grad_norm": 3.6025476455688477, "learning_rate": 1.7685561497326205e-05, "loss": 0.18531107902526855, "num_input_tokens_seen": 570572, "step": 547, "train_runtime": 1319.6007, "train_tokens_per_second": 432.382 }, { "epoch": 0.2342130569505289, "grad_norm": 4.696913719177246, "learning_rate": 1.7681283422459895e-05, "loss": 0.19636806845664978, "num_input_tokens_seen": 571354, "step": 548, "train_runtime": 1321.5975, "train_tokens_per_second": 432.321 }, { "epoch": 0.23464045303985467, "grad_norm": 3.6664090156555176, "learning_rate": 1.7677005347593584e-05, "loss": 0.15613016486167908, "num_input_tokens_seen": 572478, "step": 549, "train_runtime": 1323.6787, "train_tokens_per_second": 432.49 }, { "epoch": 0.23506784912918047, "grad_norm": 2.894364833831787, "learning_rate": 1.7672727272727274e-05, "loss": 0.09920540452003479, "num_input_tokens_seen": 573442, "step": 550, "train_runtime": 1325.7228, "train_tokens_per_second": 432.55 }, { "epoch": 0.23549524521850626, "grad_norm": 3.000265598297119, "learning_rate": 1.7668449197860963e-05, "loss": 0.14117231965065002, "num_input_tokens_seen": 574304, "step": 551, "train_runtime": 1327.7262, "train_tokens_per_second": 432.547 }, { "epoch": 0.23592264130783203, "grad_norm": 3.5130443572998047, "learning_rate": 1.7664171122994652e-05, "loss": 0.16135336458683014, "num_input_tokens_seen": 575224, "step": 552, "train_runtime": 1329.7215, "train_tokens_per_second": 432.59 }, { "epoch": 0.23635003739715782, "grad_norm": 3.135456085205078, "learning_rate": 1.7659893048128342e-05, "loss": 0.14004194736480713, "num_input_tokens_seen": 576216, "step": 553, "train_runtime": 1331.8927, "train_tokens_per_second": 432.629 }, { "epoch": 0.23677743348648359, "grad_norm": 2.7119812965393066, "learning_rate": 1.7655614973262035e-05, "loss": 0.1117730513215065, "num_input_tokens_seen": 577130, "step": 554, "train_runtime": 1334.0155, "train_tokens_per_second": 432.626 }, { "epoch": 0.23720482957580938, "grad_norm": 3.049938440322876, "learning_rate": 1.7651336898395724e-05, "loss": 0.13727469742298126, "num_input_tokens_seen": 578188, "step": 555, "train_runtime": 1336.0635, "train_tokens_per_second": 432.755 }, { "epoch": 0.23763222566513517, "grad_norm": 4.262728214263916, "learning_rate": 1.7647058823529414e-05, "loss": 0.12640132009983063, "num_input_tokens_seen": 579398, "step": 556, "train_runtime": 1338.1345, "train_tokens_per_second": 432.989 }, { "epoch": 0.23805962175446094, "grad_norm": 4.481271743774414, "learning_rate": 1.7642780748663103e-05, "loss": 0.14547674357891083, "num_input_tokens_seen": 581002, "step": 557, "train_runtime": 1340.3065, "train_tokens_per_second": 433.484 }, { "epoch": 0.23848701784378673, "grad_norm": 3.1068921089172363, "learning_rate": 1.7638502673796792e-05, "loss": 0.18444842100143433, "num_input_tokens_seen": 582120, "step": 558, "train_runtime": 1342.3854, "train_tokens_per_second": 433.646 }, { "epoch": 0.23891441393311252, "grad_norm": 4.638261318206787, "learning_rate": 1.7634224598930482e-05, "loss": 0.18371248245239258, "num_input_tokens_seen": 582940, "step": 559, "train_runtime": 1344.4098, "train_tokens_per_second": 433.603 }, { "epoch": 0.2393418100224383, "grad_norm": 2.936429738998413, "learning_rate": 1.762994652406417e-05, "loss": 0.15735919773578644, "num_input_tokens_seen": 583904, "step": 560, "train_runtime": 1346.4826, "train_tokens_per_second": 433.651 }, { "epoch": 0.23976920611176408, "grad_norm": 2.95801043510437, "learning_rate": 1.762566844919786e-05, "loss": 0.1881670504808426, "num_input_tokens_seen": 585096, "step": 561, "train_runtime": 1348.558, "train_tokens_per_second": 433.868 }, { "epoch": 0.24019660220108985, "grad_norm": 4.456726551055908, "learning_rate": 1.7621390374331554e-05, "loss": 0.15737006068229675, "num_input_tokens_seen": 586010, "step": 562, "train_runtime": 1350.5337, "train_tokens_per_second": 433.91 }, { "epoch": 0.24062399829041564, "grad_norm": 2.182157278060913, "learning_rate": 1.7617112299465243e-05, "loss": 0.08489621430635452, "num_input_tokens_seen": 587124, "step": 563, "train_runtime": 1352.6023, "train_tokens_per_second": 434.07 }, { "epoch": 0.24105139437974143, "grad_norm": 3.1126081943511963, "learning_rate": 1.7612834224598933e-05, "loss": 0.19863459467887878, "num_input_tokens_seen": 588444, "step": 564, "train_runtime": 1354.6708, "train_tokens_per_second": 434.382 }, { "epoch": 0.2414787904690672, "grad_norm": 2.538266181945801, "learning_rate": 1.7608556149732622e-05, "loss": 0.15238778293132782, "num_input_tokens_seen": 589462, "step": 565, "train_runtime": 1356.7107, "train_tokens_per_second": 434.479 }, { "epoch": 0.241906186558393, "grad_norm": 3.10831356048584, "learning_rate": 1.760427807486631e-05, "loss": 0.10415173321962357, "num_input_tokens_seen": 590564, "step": 566, "train_runtime": 1358.7672, "train_tokens_per_second": 434.632 }, { "epoch": 0.2423335826477188, "grad_norm": 2.7880208492279053, "learning_rate": 1.76e-05, "loss": 0.17961712181568146, "num_input_tokens_seen": 591790, "step": 567, "train_runtime": 1360.8769, "train_tokens_per_second": 434.859 }, { "epoch": 0.24276097873704455, "grad_norm": 2.3337337970733643, "learning_rate": 1.759572192513369e-05, "loss": 0.13482636213302612, "num_input_tokens_seen": 592800, "step": 568, "train_runtime": 1362.9172, "train_tokens_per_second": 434.949 }, { "epoch": 0.24318837482637035, "grad_norm": 2.6206247806549072, "learning_rate": 1.759144385026738e-05, "loss": 0.16304020583629608, "num_input_tokens_seen": 593980, "step": 569, "train_runtime": 1365.0253, "train_tokens_per_second": 435.142 }, { "epoch": 0.2436157709156961, "grad_norm": 2.3684146404266357, "learning_rate": 1.7587165775401073e-05, "loss": 0.13877791166305542, "num_input_tokens_seen": 595218, "step": 570, "train_runtime": 1367.1138, "train_tokens_per_second": 435.383 }, { "epoch": 0.2440431670050219, "grad_norm": 4.515527725219727, "learning_rate": 1.7582887700534762e-05, "loss": 0.16203367710113525, "num_input_tokens_seen": 595882, "step": 571, "train_runtime": 1375.6555, "train_tokens_per_second": 433.162 }, { "epoch": 0.2444705630943477, "grad_norm": 2.327942371368408, "learning_rate": 1.757860962566845e-05, "loss": 0.07233120501041412, "num_input_tokens_seen": 597056, "step": 572, "train_runtime": 1377.8128, "train_tokens_per_second": 433.336 }, { "epoch": 0.24489795918367346, "grad_norm": 3.114610195159912, "learning_rate": 1.757433155080214e-05, "loss": 0.13980111479759216, "num_input_tokens_seen": 598454, "step": 573, "train_runtime": 1379.9889, "train_tokens_per_second": 433.666 }, { "epoch": 0.24532535527299926, "grad_norm": 3.724837303161621, "learning_rate": 1.757005347593583e-05, "loss": 0.1479569375514984, "num_input_tokens_seen": 599250, "step": 574, "train_runtime": 1382.085, "train_tokens_per_second": 433.584 }, { "epoch": 0.24575275136232502, "grad_norm": 2.8897786140441895, "learning_rate": 1.756577540106952e-05, "loss": 0.1169058084487915, "num_input_tokens_seen": 600164, "step": 575, "train_runtime": 1384.1381, "train_tokens_per_second": 433.601 }, { "epoch": 0.24618014745165082, "grad_norm": 3.322599172592163, "learning_rate": 1.756149732620321e-05, "loss": 0.11802787333726883, "num_input_tokens_seen": 600880, "step": 576, "train_runtime": 1386.1272, "train_tokens_per_second": 433.496 }, { "epoch": 0.2466075435409766, "grad_norm": 2.489203929901123, "learning_rate": 1.75572192513369e-05, "loss": 0.1123126819729805, "num_input_tokens_seen": 602352, "step": 577, "train_runtime": 1388.2822, "train_tokens_per_second": 433.883 }, { "epoch": 0.24703493963030237, "grad_norm": 3.2752487659454346, "learning_rate": 1.755294117647059e-05, "loss": 0.1498231589794159, "num_input_tokens_seen": 603496, "step": 578, "train_runtime": 1390.3652, "train_tokens_per_second": 434.056 }, { "epoch": 0.24746233571962817, "grad_norm": 2.8954977989196777, "learning_rate": 1.754866310160428e-05, "loss": 0.18885569274425507, "num_input_tokens_seen": 604872, "step": 579, "train_runtime": 1392.485, "train_tokens_per_second": 434.383 }, { "epoch": 0.24788973180895396, "grad_norm": 3.355302333831787, "learning_rate": 1.754438502673797e-05, "loss": 0.1503232717514038, "num_input_tokens_seen": 605866, "step": 580, "train_runtime": 1394.5079, "train_tokens_per_second": 434.466 }, { "epoch": 0.24831712789827973, "grad_norm": 2.6362667083740234, "learning_rate": 1.754010695187166e-05, "loss": 0.08661763370037079, "num_input_tokens_seen": 606936, "step": 581, "train_runtime": 1396.5518, "train_tokens_per_second": 434.596 }, { "epoch": 0.24874452398760552, "grad_norm": 3.7280542850494385, "learning_rate": 1.753582887700535e-05, "loss": 0.2307671159505844, "num_input_tokens_seen": 607974, "step": 582, "train_runtime": 1398.6036, "train_tokens_per_second": 434.701 }, { "epoch": 0.24917192007693129, "grad_norm": 5.050597667694092, "learning_rate": 1.753155080213904e-05, "loss": 0.28117018938064575, "num_input_tokens_seen": 609022, "step": 583, "train_runtime": 1400.6804, "train_tokens_per_second": 434.804 }, { "epoch": 0.24959931616625708, "grad_norm": 2.0937132835388184, "learning_rate": 1.7527272727272728e-05, "loss": 0.09031204134225845, "num_input_tokens_seen": 610356, "step": 584, "train_runtime": 1402.7949, "train_tokens_per_second": 435.1 }, { "epoch": 0.2500267122555829, "grad_norm": 4.441471576690674, "learning_rate": 1.7522994652406418e-05, "loss": 0.15239763259887695, "num_input_tokens_seen": 611014, "step": 585, "train_runtime": 1404.7819, "train_tokens_per_second": 434.953 }, { "epoch": 0.25045410834490867, "grad_norm": 3.232152223587036, "learning_rate": 1.751871657754011e-05, "loss": 0.19042807817459106, "num_input_tokens_seen": 611958, "step": 586, "train_runtime": 1406.7982, "train_tokens_per_second": 435.001 }, { "epoch": 0.2508815044342344, "grad_norm": 3.8009955883026123, "learning_rate": 1.75144385026738e-05, "loss": 0.16365259885787964, "num_input_tokens_seen": 613254, "step": 587, "train_runtime": 1408.9415, "train_tokens_per_second": 435.259 }, { "epoch": 0.2513089005235602, "grad_norm": 2.9389092922210693, "learning_rate": 1.7510160427807486e-05, "loss": 0.204757422208786, "num_input_tokens_seen": 614336, "step": 588, "train_runtime": 1411.0397, "train_tokens_per_second": 435.378 }, { "epoch": 0.251736296612886, "grad_norm": 3.7831485271453857, "learning_rate": 1.7505882352941175e-05, "loss": 0.15953440964221954, "num_input_tokens_seen": 615766, "step": 589, "train_runtime": 1413.2612, "train_tokens_per_second": 435.706 }, { "epoch": 0.2521636927022118, "grad_norm": 2.512909173965454, "learning_rate": 1.750160427807487e-05, "loss": 0.1422572284936905, "num_input_tokens_seen": 617264, "step": 590, "train_runtime": 1415.4185, "train_tokens_per_second": 436.1 }, { "epoch": 0.2525910887915376, "grad_norm": 3.1766417026519775, "learning_rate": 1.7497326203208558e-05, "loss": 0.1679745465517044, "num_input_tokens_seen": 618526, "step": 591, "train_runtime": 1417.5736, "train_tokens_per_second": 436.327 }, { "epoch": 0.2530184848808633, "grad_norm": 2.4790332317352295, "learning_rate": 1.7493048128342247e-05, "loss": 0.16574200987815857, "num_input_tokens_seen": 620828, "step": 592, "train_runtime": 1419.9065, "train_tokens_per_second": 437.232 }, { "epoch": 0.2534458809701891, "grad_norm": 2.5413501262664795, "learning_rate": 1.7488770053475937e-05, "loss": 0.17381271719932556, "num_input_tokens_seen": 621908, "step": 593, "train_runtime": 1421.9728, "train_tokens_per_second": 437.356 }, { "epoch": 0.2538732770595149, "grad_norm": 3.3934741020202637, "learning_rate": 1.748449197860963e-05, "loss": 0.14800743758678436, "num_input_tokens_seen": 623304, "step": 594, "train_runtime": 1424.131, "train_tokens_per_second": 437.673 }, { "epoch": 0.2543006731488407, "grad_norm": 2.9373390674591064, "learning_rate": 1.7480213903743316e-05, "loss": 0.1242058053612709, "num_input_tokens_seen": 624342, "step": 595, "train_runtime": 1426.2062, "train_tokens_per_second": 437.764 }, { "epoch": 0.2547280692381665, "grad_norm": 2.9254722595214844, "learning_rate": 1.7475935828877005e-05, "loss": 0.22464588284492493, "num_input_tokens_seen": 625290, "step": 596, "train_runtime": 1428.226, "train_tokens_per_second": 437.809 }, { "epoch": 0.2551554653274922, "grad_norm": 4.2407307624816895, "learning_rate": 1.7471657754010694e-05, "loss": 0.15919914841651917, "num_input_tokens_seen": 626950, "step": 597, "train_runtime": 1430.4349, "train_tokens_per_second": 438.293 }, { "epoch": 0.255582861416818, "grad_norm": 2.609807252883911, "learning_rate": 1.7467379679144387e-05, "loss": 0.19275696575641632, "num_input_tokens_seen": 628778, "step": 598, "train_runtime": 1432.7002, "train_tokens_per_second": 438.876 }, { "epoch": 0.2560102575061438, "grad_norm": 3.7087695598602295, "learning_rate": 1.7463101604278077e-05, "loss": 0.23309898376464844, "num_input_tokens_seen": 629784, "step": 599, "train_runtime": 1434.7557, "train_tokens_per_second": 438.949 }, { "epoch": 0.2564376535954696, "grad_norm": 2.742621660232544, "learning_rate": 1.7458823529411766e-05, "loss": 0.13614144921302795, "num_input_tokens_seen": 630786, "step": 600, "train_runtime": 1436.8607, "train_tokens_per_second": 439.003 }, { "epoch": 0.2568650496847954, "grad_norm": 3.2122294902801514, "learning_rate": 1.7454545454545456e-05, "loss": 0.13549478352069855, "num_input_tokens_seen": 631604, "step": 601, "train_runtime": 1445.2476, "train_tokens_per_second": 437.021 }, { "epoch": 0.2572924457741212, "grad_norm": 3.1866111755371094, "learning_rate": 1.7450267379679145e-05, "loss": 0.1817619800567627, "num_input_tokens_seen": 632476, "step": 602, "train_runtime": 1447.3105, "train_tokens_per_second": 437.001 }, { "epoch": 0.25771984186344693, "grad_norm": 4.4216203689575195, "learning_rate": 1.7445989304812834e-05, "loss": 0.12546993792057037, "num_input_tokens_seen": 633386, "step": 603, "train_runtime": 1449.3432, "train_tokens_per_second": 437.016 }, { "epoch": 0.2581472379527727, "grad_norm": 2.9314122200012207, "learning_rate": 1.7441711229946524e-05, "loss": 0.1516924649477005, "num_input_tokens_seen": 634266, "step": 604, "train_runtime": 1451.3951, "train_tokens_per_second": 437.004 }, { "epoch": 0.2585746340420985, "grad_norm": 3.23160719871521, "learning_rate": 1.7437433155080213e-05, "loss": 0.1365823894739151, "num_input_tokens_seen": 635158, "step": 605, "train_runtime": 1453.4169, "train_tokens_per_second": 437.01 }, { "epoch": 0.2590020301314243, "grad_norm": 2.3937151432037354, "learning_rate": 1.7433155080213906e-05, "loss": 0.1260988414287567, "num_input_tokens_seen": 636060, "step": 606, "train_runtime": 1455.5372, "train_tokens_per_second": 436.993 }, { "epoch": 0.2594294262207501, "grad_norm": 2.9081015586853027, "learning_rate": 1.7428877005347596e-05, "loss": 0.1591911017894745, "num_input_tokens_seen": 637656, "step": 607, "train_runtime": 1457.7674, "train_tokens_per_second": 437.42 }, { "epoch": 0.25985682231007584, "grad_norm": 2.369614601135254, "learning_rate": 1.7424598930481285e-05, "loss": 0.08819835633039474, "num_input_tokens_seen": 638622, "step": 608, "train_runtime": 1459.7932, "train_tokens_per_second": 437.474 }, { "epoch": 0.26028421839940163, "grad_norm": 3.0980114936828613, "learning_rate": 1.7420320855614975e-05, "loss": 0.16393521428108215, "num_input_tokens_seen": 639516, "step": 609, "train_runtime": 1461.7836, "train_tokens_per_second": 437.49 }, { "epoch": 0.26071161448872743, "grad_norm": 2.485929012298584, "learning_rate": 1.7416042780748664e-05, "loss": 0.1554461121559143, "num_input_tokens_seen": 641198, "step": 610, "train_runtime": 1464.0289, "train_tokens_per_second": 437.968 }, { "epoch": 0.2611390105780532, "grad_norm": 4.0961012840271, "learning_rate": 1.7411764705882353e-05, "loss": 0.1821095049381256, "num_input_tokens_seen": 642066, "step": 611, "train_runtime": 1466.0505, "train_tokens_per_second": 437.956 }, { "epoch": 0.261566406667379, "grad_norm": 2.3384289741516113, "learning_rate": 1.7407486631016043e-05, "loss": 0.13961754739284515, "num_input_tokens_seen": 643672, "step": 612, "train_runtime": 1468.3779, "train_tokens_per_second": 438.356 }, { "epoch": 0.26199380275670475, "grad_norm": 2.7055482864379883, "learning_rate": 1.7403208556149732e-05, "loss": 0.1763858199119568, "num_input_tokens_seen": 644672, "step": 613, "train_runtime": 1470.4545, "train_tokens_per_second": 438.417 }, { "epoch": 0.26242119884603055, "grad_norm": 3.583223819732666, "learning_rate": 1.7398930481283425e-05, "loss": 0.21828489005565643, "num_input_tokens_seen": 645518, "step": 614, "train_runtime": 1472.4824, "train_tokens_per_second": 438.388 }, { "epoch": 0.26284859493535634, "grad_norm": 2.7754290103912354, "learning_rate": 1.7394652406417115e-05, "loss": 0.114726223051548, "num_input_tokens_seen": 646582, "step": 615, "train_runtime": 1474.5747, "train_tokens_per_second": 438.487 }, { "epoch": 0.26327599102468213, "grad_norm": 4.047714710235596, "learning_rate": 1.7390374331550804e-05, "loss": 0.18886765837669373, "num_input_tokens_seen": 647430, "step": 616, "train_runtime": 1476.6078, "train_tokens_per_second": 438.458 }, { "epoch": 0.2637033871140079, "grad_norm": 5.156888961791992, "learning_rate": 1.7386096256684494e-05, "loss": 0.1598343849182129, "num_input_tokens_seen": 648152, "step": 617, "train_runtime": 1478.6533, "train_tokens_per_second": 438.339 }, { "epoch": 0.26413078320333366, "grad_norm": 4.466670036315918, "learning_rate": 1.7381818181818183e-05, "loss": 0.19553837180137634, "num_input_tokens_seen": 648804, "step": 618, "train_runtime": 1480.6539, "train_tokens_per_second": 438.187 }, { "epoch": 0.26455817929265946, "grad_norm": 3.7706260681152344, "learning_rate": 1.7377540106951872e-05, "loss": 0.20222875475883484, "num_input_tokens_seen": 650052, "step": 619, "train_runtime": 1482.8124, "train_tokens_per_second": 438.391 }, { "epoch": 0.26498557538198525, "grad_norm": 2.714515209197998, "learning_rate": 1.7373262032085562e-05, "loss": 0.12274238467216492, "num_input_tokens_seen": 651060, "step": 620, "train_runtime": 1484.8986, "train_tokens_per_second": 438.454 }, { "epoch": 0.26541297147131104, "grad_norm": 3.983781099319458, "learning_rate": 1.736898395721925e-05, "loss": 0.17818422615528107, "num_input_tokens_seen": 651978, "step": 621, "train_runtime": 1486.946, "train_tokens_per_second": 438.468 }, { "epoch": 0.26584036756063684, "grad_norm": 8.49150562286377, "learning_rate": 1.7364705882352944e-05, "loss": 0.2724238336086273, "num_input_tokens_seen": 652776, "step": 622, "train_runtime": 1488.9792, "train_tokens_per_second": 438.405 }, { "epoch": 0.26626776364996263, "grad_norm": 2.6343836784362793, "learning_rate": 1.7360427807486634e-05, "loss": 0.13595706224441528, "num_input_tokens_seen": 654328, "step": 623, "train_runtime": 1491.1695, "train_tokens_per_second": 438.802 }, { "epoch": 0.26669515973928837, "grad_norm": 5.991724491119385, "learning_rate": 1.7356149732620323e-05, "loss": 0.3250628411769867, "num_input_tokens_seen": 655520, "step": 624, "train_runtime": 1493.2362, "train_tokens_per_second": 438.993 }, { "epoch": 0.26712255582861416, "grad_norm": 3.857046127319336, "learning_rate": 1.7351871657754012e-05, "loss": 0.1667994111776352, "num_input_tokens_seen": 656314, "step": 625, "train_runtime": 1495.2358, "train_tokens_per_second": 438.937 }, { "epoch": 0.26754995191793995, "grad_norm": 3.1027472019195557, "learning_rate": 1.7347593582887702e-05, "loss": 0.17843560874462128, "num_input_tokens_seen": 657426, "step": 626, "train_runtime": 1497.3008, "train_tokens_per_second": 439.074 }, { "epoch": 0.26797734800726575, "grad_norm": 3.7872979640960693, "learning_rate": 1.734331550802139e-05, "loss": 0.16721181571483612, "num_input_tokens_seen": 658524, "step": 627, "train_runtime": 1499.414, "train_tokens_per_second": 439.188 }, { "epoch": 0.26840474409659154, "grad_norm": 3.251497745513916, "learning_rate": 1.733903743315508e-05, "loss": 0.11725930869579315, "num_input_tokens_seen": 659636, "step": 628, "train_runtime": 1501.4782, "train_tokens_per_second": 439.324 }, { "epoch": 0.2688321401859173, "grad_norm": 2.6759772300720215, "learning_rate": 1.733475935828877e-05, "loss": 0.1434108167886734, "num_input_tokens_seen": 660798, "step": 629, "train_runtime": 1503.5833, "train_tokens_per_second": 439.482 }, { "epoch": 0.26925953627524307, "grad_norm": 2.004434585571289, "learning_rate": 1.7330481283422463e-05, "loss": 0.11522868275642395, "num_input_tokens_seen": 662582, "step": 630, "train_runtime": 1505.8284, "train_tokens_per_second": 440.012 }, { "epoch": 0.26968693236456887, "grad_norm": 2.673767566680908, "learning_rate": 1.7326203208556153e-05, "loss": 0.15051482617855072, "num_input_tokens_seen": 663804, "step": 631, "train_runtime": 1514.1449, "train_tokens_per_second": 438.402 }, { "epoch": 0.27011432845389466, "grad_norm": 2.9031167030334473, "learning_rate": 1.7321925133689842e-05, "loss": 0.1311330795288086, "num_input_tokens_seen": 664674, "step": 632, "train_runtime": 1516.172, "train_tokens_per_second": 438.39 }, { "epoch": 0.27054172454322045, "grad_norm": 3.364966869354248, "learning_rate": 1.731764705882353e-05, "loss": 0.15498673915863037, "num_input_tokens_seen": 665636, "step": 633, "train_runtime": 1518.283, "train_tokens_per_second": 438.414 }, { "epoch": 0.2709691206325462, "grad_norm": 2.531022787094116, "learning_rate": 1.731336898395722e-05, "loss": 0.11715377122163773, "num_input_tokens_seen": 666736, "step": 634, "train_runtime": 1520.35, "train_tokens_per_second": 438.541 }, { "epoch": 0.271396516721872, "grad_norm": 2.71030592918396, "learning_rate": 1.730909090909091e-05, "loss": 0.12561234831809998, "num_input_tokens_seen": 668148, "step": 635, "train_runtime": 1522.4985, "train_tokens_per_second": 438.85 }, { "epoch": 0.2718239128111978, "grad_norm": 2.7606797218322754, "learning_rate": 1.73048128342246e-05, "loss": 0.1251692771911621, "num_input_tokens_seen": 669176, "step": 636, "train_runtime": 1524.5212, "train_tokens_per_second": 438.942 }, { "epoch": 0.27225130890052357, "grad_norm": 2.743720293045044, "learning_rate": 1.730053475935829e-05, "loss": 0.12467562407255173, "num_input_tokens_seen": 670002, "step": 637, "train_runtime": 1526.5528, "train_tokens_per_second": 438.899 }, { "epoch": 0.27267870498984936, "grad_norm": 2.1312413215637207, "learning_rate": 1.7296256684491982e-05, "loss": 0.13293921947479248, "num_input_tokens_seen": 671710, "step": 638, "train_runtime": 1528.7995, "train_tokens_per_second": 439.371 }, { "epoch": 0.2731061010791751, "grad_norm": 3.113715887069702, "learning_rate": 1.729197860962567e-05, "loss": 0.1551579385995865, "num_input_tokens_seen": 672736, "step": 639, "train_runtime": 1530.8652, "train_tokens_per_second": 439.448 }, { "epoch": 0.2735334971685009, "grad_norm": 2.57463002204895, "learning_rate": 1.728770053475936e-05, "loss": 0.15595224499702454, "num_input_tokens_seen": 673894, "step": 640, "train_runtime": 1532.981, "train_tokens_per_second": 439.597 }, { "epoch": 0.2739608932578267, "grad_norm": 3.000229597091675, "learning_rate": 1.728342245989305e-05, "loss": 0.2024955004453659, "num_input_tokens_seen": 675060, "step": 641, "train_runtime": 1535.1013, "train_tokens_per_second": 439.749 }, { "epoch": 0.2743882893471525, "grad_norm": 3.2893600463867188, "learning_rate": 1.727914438502674e-05, "loss": 0.18899883329868317, "num_input_tokens_seen": 676204, "step": 642, "train_runtime": 1537.1613, "train_tokens_per_second": 439.904 }, { "epoch": 0.2748156854364783, "grad_norm": 2.9903957843780518, "learning_rate": 1.727486631016043e-05, "loss": 0.11259229481220245, "num_input_tokens_seen": 677100, "step": 643, "train_runtime": 1539.1614, "train_tokens_per_second": 439.915 }, { "epoch": 0.275243081525804, "grad_norm": 3.6501784324645996, "learning_rate": 1.727058823529412e-05, "loss": 0.14545176923274994, "num_input_tokens_seen": 678234, "step": 644, "train_runtime": 1541.2244, "train_tokens_per_second": 440.062 }, { "epoch": 0.2756704776151298, "grad_norm": 3.6744797229766846, "learning_rate": 1.7266310160427808e-05, "loss": 0.1335563063621521, "num_input_tokens_seen": 678926, "step": 645, "train_runtime": 1543.2733, "train_tokens_per_second": 439.926 }, { "epoch": 0.2760978737044556, "grad_norm": 2.7332375049591064, "learning_rate": 1.72620320855615e-05, "loss": 0.1322796642780304, "num_input_tokens_seen": 679898, "step": 646, "train_runtime": 1545.2938, "train_tokens_per_second": 439.98 }, { "epoch": 0.2765252697937814, "grad_norm": 2.5545904636383057, "learning_rate": 1.725775401069519e-05, "loss": 0.15949004888534546, "num_input_tokens_seen": 680990, "step": 647, "train_runtime": 1547.3526, "train_tokens_per_second": 440.1 }, { "epoch": 0.2769526658831072, "grad_norm": 2.9079134464263916, "learning_rate": 1.725347593582888e-05, "loss": 0.12913838028907776, "num_input_tokens_seen": 682104, "step": 648, "train_runtime": 1549.4315, "train_tokens_per_second": 440.229 }, { "epoch": 0.277380061972433, "grad_norm": 2.6565921306610107, "learning_rate": 1.724919786096257e-05, "loss": 0.17941144108772278, "num_input_tokens_seen": 683204, "step": 649, "train_runtime": 1551.504, "train_tokens_per_second": 440.349 }, { "epoch": 0.2778074580617587, "grad_norm": 3.9844510555267334, "learning_rate": 1.724491978609626e-05, "loss": 0.22910510003566742, "num_input_tokens_seen": 683966, "step": 650, "train_runtime": 1553.4987, "train_tokens_per_second": 440.275 }, { "epoch": 0.2782348541510845, "grad_norm": 3.6703052520751953, "learning_rate": 1.7240641711229948e-05, "loss": 0.11243750900030136, "num_input_tokens_seen": 684992, "step": 651, "train_runtime": 1555.5168, "train_tokens_per_second": 440.363 }, { "epoch": 0.2786622502404103, "grad_norm": 2.7850770950317383, "learning_rate": 1.7236363636363638e-05, "loss": 0.18875238299369812, "num_input_tokens_seen": 686164, "step": 652, "train_runtime": 1557.6351, "train_tokens_per_second": 440.517 }, { "epoch": 0.2790896463297361, "grad_norm": 2.373117208480835, "learning_rate": 1.7232085561497327e-05, "loss": 0.14671288430690765, "num_input_tokens_seen": 687650, "step": 653, "train_runtime": 1559.8517, "train_tokens_per_second": 440.843 }, { "epoch": 0.2795170424190619, "grad_norm": 3.4782025814056396, "learning_rate": 1.722780748663102e-05, "loss": 0.23798540234565735, "num_input_tokens_seen": 688598, "step": 654, "train_runtime": 1561.9064, "train_tokens_per_second": 440.87 }, { "epoch": 0.2799444385083876, "grad_norm": 4.702680587768555, "learning_rate": 1.722352941176471e-05, "loss": 0.1546967476606369, "num_input_tokens_seen": 689498, "step": 655, "train_runtime": 1563.9556, "train_tokens_per_second": 440.868 }, { "epoch": 0.2803718345977134, "grad_norm": 3.1064441204071045, "learning_rate": 1.7219251336898395e-05, "loss": 0.12857335805892944, "num_input_tokens_seen": 690404, "step": 656, "train_runtime": 1565.993, "train_tokens_per_second": 440.873 }, { "epoch": 0.2807992306870392, "grad_norm": 2.365166187286377, "learning_rate": 1.7214973262032085e-05, "loss": 0.12610051035881042, "num_input_tokens_seen": 692104, "step": 657, "train_runtime": 1568.275, "train_tokens_per_second": 441.315 }, { "epoch": 0.281226626776365, "grad_norm": 3.49941086769104, "learning_rate": 1.7210695187165778e-05, "loss": 0.14522790908813477, "num_input_tokens_seen": 693036, "step": 658, "train_runtime": 1570.2917, "train_tokens_per_second": 441.342 }, { "epoch": 0.2816540228656908, "grad_norm": 3.1161298751831055, "learning_rate": 1.7206417112299467e-05, "loss": 0.1213645339012146, "num_input_tokens_seen": 694052, "step": 659, "train_runtime": 1572.3719, "train_tokens_per_second": 441.404 }, { "epoch": 0.28208141895501654, "grad_norm": 3.147714138031006, "learning_rate": 1.7202139037433157e-05, "loss": 0.13667607307434082, "num_input_tokens_seen": 695124, "step": 660, "train_runtime": 1574.4334, "train_tokens_per_second": 441.507 }, { "epoch": 0.28250881504434233, "grad_norm": 4.764846324920654, "learning_rate": 1.7197860962566846e-05, "loss": 0.1356460452079773, "num_input_tokens_seen": 696154, "step": 661, "train_runtime": 1583.007, "train_tokens_per_second": 439.767 }, { "epoch": 0.2829362111336681, "grad_norm": 2.6429355144500732, "learning_rate": 1.7193582887700536e-05, "loss": 0.13607126474380493, "num_input_tokens_seen": 697178, "step": 662, "train_runtime": 1585.1046, "train_tokens_per_second": 439.831 }, { "epoch": 0.2833636072229939, "grad_norm": 4.223821640014648, "learning_rate": 1.7189304812834225e-05, "loss": 0.19682806730270386, "num_input_tokens_seen": 697816, "step": 663, "train_runtime": 1587.0357, "train_tokens_per_second": 439.698 }, { "epoch": 0.2837910033123197, "grad_norm": 3.172499179840088, "learning_rate": 1.7185026737967914e-05, "loss": 0.13376055657863617, "num_input_tokens_seen": 698672, "step": 664, "train_runtime": 1589.1194, "train_tokens_per_second": 439.66 }, { "epoch": 0.28421839940164545, "grad_norm": 3.1004250049591064, "learning_rate": 1.7180748663101604e-05, "loss": 0.19494307041168213, "num_input_tokens_seen": 699868, "step": 665, "train_runtime": 1591.2378, "train_tokens_per_second": 439.826 }, { "epoch": 0.28464579549097124, "grad_norm": 2.8081493377685547, "learning_rate": 1.7176470588235293e-05, "loss": 0.12997466325759888, "num_input_tokens_seen": 700964, "step": 666, "train_runtime": 1593.3424, "train_tokens_per_second": 439.933 }, { "epoch": 0.28507319158029704, "grad_norm": 2.8225746154785156, "learning_rate": 1.7172192513368986e-05, "loss": 0.18104994297027588, "num_input_tokens_seen": 702766, "step": 667, "train_runtime": 1595.5428, "train_tokens_per_second": 440.456 }, { "epoch": 0.28550058766962283, "grad_norm": 3.4809491634368896, "learning_rate": 1.7167914438502676e-05, "loss": 0.22088421881198883, "num_input_tokens_seen": 703934, "step": 668, "train_runtime": 1597.6296, "train_tokens_per_second": 440.612 }, { "epoch": 0.2859279837589486, "grad_norm": 3.1476643085479736, "learning_rate": 1.7163636363636365e-05, "loss": 0.10465161502361298, "num_input_tokens_seen": 704658, "step": 669, "train_runtime": 1599.6027, "train_tokens_per_second": 440.521 }, { "epoch": 0.28635537984827436, "grad_norm": 3.01611328125, "learning_rate": 1.7159358288770054e-05, "loss": 0.14153167605400085, "num_input_tokens_seen": 706188, "step": 670, "train_runtime": 1601.782, "train_tokens_per_second": 440.876 }, { "epoch": 0.28678277593760015, "grad_norm": 1.938707947731018, "learning_rate": 1.7155080213903744e-05, "loss": 0.10746683180332184, "num_input_tokens_seen": 707622, "step": 671, "train_runtime": 1603.9052, "train_tokens_per_second": 441.187 }, { "epoch": 0.28721017202692595, "grad_norm": 5.22975492477417, "learning_rate": 1.7150802139037433e-05, "loss": 0.20209376513957977, "num_input_tokens_seen": 708358, "step": 672, "train_runtime": 1605.9684, "train_tokens_per_second": 441.078 }, { "epoch": 0.28763756811625174, "grad_norm": 2.241725206375122, "learning_rate": 1.7146524064171123e-05, "loss": 0.10788868367671967, "num_input_tokens_seen": 709372, "step": 673, "train_runtime": 1608.0325, "train_tokens_per_second": 441.143 }, { "epoch": 0.28806496420557753, "grad_norm": 4.1165642738342285, "learning_rate": 1.7142245989304812e-05, "loss": 0.10829375684261322, "num_input_tokens_seen": 709858, "step": 674, "train_runtime": 1609.9182, "train_tokens_per_second": 440.928 }, { "epoch": 0.2884923602949033, "grad_norm": 2.7129435539245605, "learning_rate": 1.7137967914438505e-05, "loss": 0.11378169059753418, "num_input_tokens_seen": 710642, "step": 675, "train_runtime": 1611.9211, "train_tokens_per_second": 440.866 }, { "epoch": 0.28891975638422907, "grad_norm": 2.3255112171173096, "learning_rate": 1.7133689839572195e-05, "loss": 0.1456914097070694, "num_input_tokens_seen": 711836, "step": 676, "train_runtime": 1614.1808, "train_tokens_per_second": 440.989 }, { "epoch": 0.28934715247355486, "grad_norm": 3.522317409515381, "learning_rate": 1.7129411764705884e-05, "loss": 0.151935875415802, "num_input_tokens_seen": 712588, "step": 677, "train_runtime": 1616.1754, "train_tokens_per_second": 440.91 }, { "epoch": 0.28977454856288065, "grad_norm": 3.6937501430511475, "learning_rate": 1.7125133689839573e-05, "loss": 0.16675081849098206, "num_input_tokens_seen": 713650, "step": 678, "train_runtime": 1618.24, "train_tokens_per_second": 441.004 }, { "epoch": 0.29020194465220644, "grad_norm": 4.128882884979248, "learning_rate": 1.7120855614973263e-05, "loss": 0.20945796370506287, "num_input_tokens_seen": 714694, "step": 679, "train_runtime": 1620.3033, "train_tokens_per_second": 441.087 }, { "epoch": 0.29062934074153224, "grad_norm": 1.9825953245162964, "learning_rate": 1.7116577540106952e-05, "loss": 0.084213986992836, "num_input_tokens_seen": 715872, "step": 680, "train_runtime": 1622.3853, "train_tokens_per_second": 441.247 }, { "epoch": 0.291056736830858, "grad_norm": 3.867910146713257, "learning_rate": 1.7112299465240642e-05, "loss": 0.20786266028881073, "num_input_tokens_seen": 716616, "step": 681, "train_runtime": 1624.4679, "train_tokens_per_second": 441.139 }, { "epoch": 0.29148413292018377, "grad_norm": 3.203005790710449, "learning_rate": 1.710802139037433e-05, "loss": 0.15088096261024475, "num_input_tokens_seen": 717396, "step": 682, "train_runtime": 1626.5048, "train_tokens_per_second": 441.066 }, { "epoch": 0.29191152900950956, "grad_norm": 3.3211700916290283, "learning_rate": 1.7103743315508024e-05, "loss": 0.15841370820999146, "num_input_tokens_seen": 718324, "step": 683, "train_runtime": 1628.5301, "train_tokens_per_second": 441.087 }, { "epoch": 0.29233892509883536, "grad_norm": 4.750456809997559, "learning_rate": 1.7099465240641713e-05, "loss": 0.1749861091375351, "num_input_tokens_seen": 719262, "step": 684, "train_runtime": 1630.5793, "train_tokens_per_second": 441.108 }, { "epoch": 0.29276632118816115, "grad_norm": 3.024815320968628, "learning_rate": 1.7095187165775403e-05, "loss": 0.12039594352245331, "num_input_tokens_seen": 720384, "step": 685, "train_runtime": 1632.6689, "train_tokens_per_second": 441.231 }, { "epoch": 0.2931937172774869, "grad_norm": 3.736140012741089, "learning_rate": 1.7090909090909092e-05, "loss": 0.15887826681137085, "num_input_tokens_seen": 721052, "step": 686, "train_runtime": 1634.6096, "train_tokens_per_second": 441.116 }, { "epoch": 0.2936211133668127, "grad_norm": 2.7646737098693848, "learning_rate": 1.7086631016042782e-05, "loss": 0.07137889415025711, "num_input_tokens_seen": 721936, "step": 687, "train_runtime": 1636.6613, "train_tokens_per_second": 441.103 }, { "epoch": 0.2940485094561385, "grad_norm": 3.6937055587768555, "learning_rate": 1.708235294117647e-05, "loss": 0.22509972751140594, "num_input_tokens_seen": 722674, "step": 688, "train_runtime": 1638.6715, "train_tokens_per_second": 441.012 }, { "epoch": 0.29447590554546427, "grad_norm": 2.640775680541992, "learning_rate": 1.707807486631016e-05, "loss": 0.2119310200214386, "num_input_tokens_seen": 723766, "step": 689, "train_runtime": 1640.7739, "train_tokens_per_second": 441.113 }, { "epoch": 0.29490330163479006, "grad_norm": 1.934248447418213, "learning_rate": 1.707379679144385e-05, "loss": 0.1286829710006714, "num_input_tokens_seen": 725872, "step": 690, "train_runtime": 1643.0905, "train_tokens_per_second": 441.772 }, { "epoch": 0.2953306977241158, "grad_norm": 2.6751089096069336, "learning_rate": 1.7069518716577543e-05, "loss": 0.12910306453704834, "num_input_tokens_seen": 726914, "step": 691, "train_runtime": 1651.9994, "train_tokens_per_second": 440.021 }, { "epoch": 0.2957580938134416, "grad_norm": 2.5396509170532227, "learning_rate": 1.7065240641711232e-05, "loss": 0.21183884143829346, "num_input_tokens_seen": 728272, "step": 692, "train_runtime": 1654.156, "train_tokens_per_second": 440.268 }, { "epoch": 0.2961854899027674, "grad_norm": 3.9704675674438477, "learning_rate": 1.7060962566844922e-05, "loss": 0.13218924403190613, "num_input_tokens_seen": 729172, "step": 693, "train_runtime": 1656.184, "train_tokens_per_second": 440.272 }, { "epoch": 0.2966128859920932, "grad_norm": 3.2691850662231445, "learning_rate": 1.705668449197861e-05, "loss": 0.17206302285194397, "num_input_tokens_seen": 730106, "step": 694, "train_runtime": 1658.2171, "train_tokens_per_second": 440.296 }, { "epoch": 0.29704028208141897, "grad_norm": 2.426727771759033, "learning_rate": 1.70524064171123e-05, "loss": 0.09853766113519669, "num_input_tokens_seen": 731538, "step": 695, "train_runtime": 1660.3802, "train_tokens_per_second": 440.585 }, { "epoch": 0.29746767817074476, "grad_norm": 2.596492290496826, "learning_rate": 1.704812834224599e-05, "loss": 0.10594348609447479, "num_input_tokens_seen": 732798, "step": 696, "train_runtime": 1662.533, "train_tokens_per_second": 440.772 }, { "epoch": 0.2978950742600705, "grad_norm": 2.4652998447418213, "learning_rate": 1.704385026737968e-05, "loss": 0.13944201171398163, "num_input_tokens_seen": 734214, "step": 697, "train_runtime": 1664.7198, "train_tokens_per_second": 441.044 }, { "epoch": 0.2983224703493963, "grad_norm": 4.074872970581055, "learning_rate": 1.703957219251337e-05, "loss": 0.2254430651664734, "num_input_tokens_seen": 735190, "step": 698, "train_runtime": 1666.7638, "train_tokens_per_second": 441.088 }, { "epoch": 0.2987498664387221, "grad_norm": 4.0392351150512695, "learning_rate": 1.7035294117647062e-05, "loss": 0.1986958384513855, "num_input_tokens_seen": 736072, "step": 699, "train_runtime": 1668.7559, "train_tokens_per_second": 441.09 }, { "epoch": 0.2991772625280479, "grad_norm": 2.5483055114746094, "learning_rate": 1.703101604278075e-05, "loss": 0.12155450880527496, "num_input_tokens_seen": 737138, "step": 700, "train_runtime": 1670.8187, "train_tokens_per_second": 441.184 }, { "epoch": 0.2996046586173737, "grad_norm": 3.423879861831665, "learning_rate": 1.702673796791444e-05, "loss": 0.12087435275316238, "num_input_tokens_seen": 737838, "step": 701, "train_runtime": 1672.8099, "train_tokens_per_second": 441.077 }, { "epoch": 0.3000320547066994, "grad_norm": 3.225769281387329, "learning_rate": 1.702245989304813e-05, "loss": 0.14212779700756073, "num_input_tokens_seen": 738804, "step": 702, "train_runtime": 1674.8949, "train_tokens_per_second": 441.105 }, { "epoch": 0.3004594507960252, "grad_norm": 2.860381603240967, "learning_rate": 1.701818181818182e-05, "loss": 0.17546290159225464, "num_input_tokens_seen": 740052, "step": 703, "train_runtime": 1677.0548, "train_tokens_per_second": 441.281 }, { "epoch": 0.300886846885351, "grad_norm": 3.222641944885254, "learning_rate": 1.701390374331551e-05, "loss": 0.1763782501220703, "num_input_tokens_seen": 741284, "step": 704, "train_runtime": 1679.1425, "train_tokens_per_second": 441.466 }, { "epoch": 0.3013142429746768, "grad_norm": 2.3681511878967285, "learning_rate": 1.70096256684492e-05, "loss": 0.13529324531555176, "num_input_tokens_seen": 742224, "step": 705, "train_runtime": 1681.2782, "train_tokens_per_second": 441.464 }, { "epoch": 0.3017416390640026, "grad_norm": 3.322913646697998, "learning_rate": 1.7005347593582888e-05, "loss": 0.1992805451154709, "num_input_tokens_seen": 743002, "step": 706, "train_runtime": 1683.3098, "train_tokens_per_second": 441.393 }, { "epoch": 0.3021690351533283, "grad_norm": 2.673914909362793, "learning_rate": 1.700106951871658e-05, "loss": 0.13492314517498016, "num_input_tokens_seen": 744234, "step": 707, "train_runtime": 1685.3949, "train_tokens_per_second": 441.578 }, { "epoch": 0.3025964312426541, "grad_norm": 2.9854207038879395, "learning_rate": 1.699679144385027e-05, "loss": 0.08190875500440598, "num_input_tokens_seen": 744844, "step": 708, "train_runtime": 1687.3481, "train_tokens_per_second": 441.429 }, { "epoch": 0.3030238273319799, "grad_norm": 3.064990758895874, "learning_rate": 1.699251336898396e-05, "loss": 0.1609775424003601, "num_input_tokens_seen": 745712, "step": 709, "train_runtime": 1689.4292, "train_tokens_per_second": 441.399 }, { "epoch": 0.3034512234213057, "grad_norm": 4.355386257171631, "learning_rate": 1.698823529411765e-05, "loss": 0.20793989300727844, "num_input_tokens_seen": 746854, "step": 710, "train_runtime": 1691.5474, "train_tokens_per_second": 441.521 }, { "epoch": 0.3038786195106315, "grad_norm": 3.515242338180542, "learning_rate": 1.698395721925134e-05, "loss": 0.17526139318943024, "num_input_tokens_seen": 747604, "step": 711, "train_runtime": 1693.5558, "train_tokens_per_second": 441.44 }, { "epoch": 0.30430601559995724, "grad_norm": 2.7136337757110596, "learning_rate": 1.6979679144385028e-05, "loss": 0.10106546431779861, "num_input_tokens_seen": 748358, "step": 712, "train_runtime": 1695.5992, "train_tokens_per_second": 441.353 }, { "epoch": 0.30473341168928303, "grad_norm": 3.5016796588897705, "learning_rate": 1.6975401069518718e-05, "loss": 0.1796518713235855, "num_input_tokens_seen": 749440, "step": 713, "train_runtime": 1697.6806, "train_tokens_per_second": 441.449 }, { "epoch": 0.3051608077786088, "grad_norm": 3.995384693145752, "learning_rate": 1.6971122994652407e-05, "loss": 0.17982743680477142, "num_input_tokens_seen": 750418, "step": 714, "train_runtime": 1699.751, "train_tokens_per_second": 441.487 }, { "epoch": 0.3055882038679346, "grad_norm": 2.906602382659912, "learning_rate": 1.69668449197861e-05, "loss": 0.15344633162021637, "num_input_tokens_seen": 751646, "step": 715, "train_runtime": 1701.8386, "train_tokens_per_second": 441.667 }, { "epoch": 0.3060155999572604, "grad_norm": 4.614682197570801, "learning_rate": 1.696256684491979e-05, "loss": 0.18905337154865265, "num_input_tokens_seen": 752600, "step": 716, "train_runtime": 1703.9577, "train_tokens_per_second": 441.678 }, { "epoch": 0.30644299604658615, "grad_norm": 4.919049263000488, "learning_rate": 1.695828877005348e-05, "loss": 0.2674981355667114, "num_input_tokens_seen": 753414, "step": 717, "train_runtime": 1705.999, "train_tokens_per_second": 441.626 }, { "epoch": 0.30687039213591194, "grad_norm": 3.67826771736145, "learning_rate": 1.6954010695187165e-05, "loss": 0.16822344064712524, "num_input_tokens_seen": 754518, "step": 718, "train_runtime": 1708.0614, "train_tokens_per_second": 441.739 }, { "epoch": 0.30729778822523773, "grad_norm": 2.349168300628662, "learning_rate": 1.6949732620320858e-05, "loss": 0.1278461217880249, "num_input_tokens_seen": 755588, "step": 719, "train_runtime": 1710.1309, "train_tokens_per_second": 441.831 }, { "epoch": 0.3077251843145635, "grad_norm": 4.480087757110596, "learning_rate": 1.6945454545454547e-05, "loss": 0.11029095202684402, "num_input_tokens_seen": 756476, "step": 720, "train_runtime": 1712.166, "train_tokens_per_second": 441.824 }, { "epoch": 0.3081525804038893, "grad_norm": 2.819782257080078, "learning_rate": 1.6941176470588237e-05, "loss": 0.09692086279392242, "num_input_tokens_seen": 757168, "step": 721, "train_runtime": 1721.001, "train_tokens_per_second": 439.958 }, { "epoch": 0.3085799764932151, "grad_norm": 2.976001262664795, "learning_rate": 1.6936898395721926e-05, "loss": 0.16137419641017914, "num_input_tokens_seen": 758160, "step": 722, "train_runtime": 1723.127, "train_tokens_per_second": 439.991 }, { "epoch": 0.30900737258254085, "grad_norm": 3.4080145359039307, "learning_rate": 1.693262032085562e-05, "loss": 0.1251823902130127, "num_input_tokens_seen": 758940, "step": 723, "train_runtime": 1725.1264, "train_tokens_per_second": 439.933 }, { "epoch": 0.30943476867186664, "grad_norm": 2.275359630584717, "learning_rate": 1.6928342245989305e-05, "loss": 0.1225162148475647, "num_input_tokens_seen": 760078, "step": 724, "train_runtime": 1727.2558, "train_tokens_per_second": 440.049 }, { "epoch": 0.30986216476119244, "grad_norm": 3.0035042762756348, "learning_rate": 1.6924064171122994e-05, "loss": 0.12130562961101532, "num_input_tokens_seen": 761064, "step": 725, "train_runtime": 1729.3499, "train_tokens_per_second": 440.087 }, { "epoch": 0.31028956085051823, "grad_norm": 2.424938917160034, "learning_rate": 1.6919786096256684e-05, "loss": 0.13783925771713257, "num_input_tokens_seen": 762414, "step": 726, "train_runtime": 1731.4569, "train_tokens_per_second": 440.331 }, { "epoch": 0.310716956939844, "grad_norm": 2.9705116748809814, "learning_rate": 1.6915508021390377e-05, "loss": 0.1928931176662445, "num_input_tokens_seen": 763692, "step": 727, "train_runtime": 1733.5347, "train_tokens_per_second": 440.54 }, { "epoch": 0.31114435302916976, "grad_norm": 3.2809789180755615, "learning_rate": 1.6911229946524066e-05, "loss": 0.18057897686958313, "num_input_tokens_seen": 764738, "step": 728, "train_runtime": 1735.5868, "train_tokens_per_second": 440.622 }, { "epoch": 0.31157174911849556, "grad_norm": 3.0725319385528564, "learning_rate": 1.6906951871657755e-05, "loss": 0.13870379328727722, "num_input_tokens_seen": 766040, "step": 729, "train_runtime": 1737.7003, "train_tokens_per_second": 440.836 }, { "epoch": 0.31199914520782135, "grad_norm": 3.658844232559204, "learning_rate": 1.6902673796791445e-05, "loss": 0.18355195224285126, "num_input_tokens_seen": 766918, "step": 730, "train_runtime": 1739.7138, "train_tokens_per_second": 440.83 }, { "epoch": 0.31242654129714714, "grad_norm": 4.367164611816406, "learning_rate": 1.6898395721925134e-05, "loss": 0.11822845041751862, "num_input_tokens_seen": 767498, "step": 731, "train_runtime": 1741.6718, "train_tokens_per_second": 440.667 }, { "epoch": 0.31285393738647294, "grad_norm": 2.4613184928894043, "learning_rate": 1.6894117647058824e-05, "loss": 0.12785813212394714, "num_input_tokens_seen": 768748, "step": 732, "train_runtime": 1743.887, "train_tokens_per_second": 440.824 }, { "epoch": 0.3132813334757987, "grad_norm": 2.3444745540618896, "learning_rate": 1.6889839572192513e-05, "loss": 0.12883754074573517, "num_input_tokens_seen": 769808, "step": 733, "train_runtime": 1745.9426, "train_tokens_per_second": 440.913 }, { "epoch": 0.31370872956512447, "grad_norm": 3.0968801975250244, "learning_rate": 1.6885561497326203e-05, "loss": 0.17797592282295227, "num_input_tokens_seen": 770774, "step": 734, "train_runtime": 1747.9777, "train_tokens_per_second": 440.952 }, { "epoch": 0.31413612565445026, "grad_norm": 3.5281708240509033, "learning_rate": 1.6881283422459896e-05, "loss": 0.13884249329566956, "num_input_tokens_seen": 771764, "step": 735, "train_runtime": 1750.0652, "train_tokens_per_second": 440.992 }, { "epoch": 0.31456352174377605, "grad_norm": 7.061663627624512, "learning_rate": 1.6877005347593585e-05, "loss": 0.16773094236850739, "num_input_tokens_seen": 773010, "step": 736, "train_runtime": 1752.191, "train_tokens_per_second": 441.168 }, { "epoch": 0.31499091783310185, "grad_norm": 2.613240957260132, "learning_rate": 1.6872727272727274e-05, "loss": 0.13964132964611053, "num_input_tokens_seen": 773894, "step": 737, "train_runtime": 1754.2167, "train_tokens_per_second": 441.162 }, { "epoch": 0.3154183139224276, "grad_norm": 2.094176769256592, "learning_rate": 1.6868449197860964e-05, "loss": 0.1435990333557129, "num_input_tokens_seen": 775084, "step": 738, "train_runtime": 1756.3029, "train_tokens_per_second": 441.316 }, { "epoch": 0.3158457100117534, "grad_norm": 3.6297993659973145, "learning_rate": 1.6864171122994653e-05, "loss": 0.1722583919763565, "num_input_tokens_seen": 776132, "step": 739, "train_runtime": 1758.3479, "train_tokens_per_second": 441.398 }, { "epoch": 0.31627310610107917, "grad_norm": 4.502858638763428, "learning_rate": 1.6859893048128343e-05, "loss": 0.1423422396183014, "num_input_tokens_seen": 776914, "step": 740, "train_runtime": 1760.3029, "train_tokens_per_second": 441.352 }, { "epoch": 0.31670050219040496, "grad_norm": 2.884168863296509, "learning_rate": 1.6855614973262032e-05, "loss": 0.09878357499837875, "num_input_tokens_seen": 777732, "step": 741, "train_runtime": 1762.2569, "train_tokens_per_second": 441.327 }, { "epoch": 0.31712789827973076, "grad_norm": 2.4770572185516357, "learning_rate": 1.685133689839572e-05, "loss": 0.1018742173910141, "num_input_tokens_seen": 778950, "step": 742, "train_runtime": 1764.3422, "train_tokens_per_second": 441.496 }, { "epoch": 0.3175552943690565, "grad_norm": 3.128291606903076, "learning_rate": 1.6847058823529414e-05, "loss": 0.20683753490447998, "num_input_tokens_seen": 780304, "step": 743, "train_runtime": 1766.4888, "train_tokens_per_second": 441.726 }, { "epoch": 0.3179826904583823, "grad_norm": 3.732107162475586, "learning_rate": 1.6842780748663104e-05, "loss": 0.23228523135185242, "num_input_tokens_seen": 781224, "step": 744, "train_runtime": 1768.5073, "train_tokens_per_second": 441.742 }, { "epoch": 0.3184100865477081, "grad_norm": 3.751624345779419, "learning_rate": 1.6838502673796793e-05, "loss": 0.14719495177268982, "num_input_tokens_seen": 782016, "step": 745, "train_runtime": 1770.531, "train_tokens_per_second": 441.684 }, { "epoch": 0.3188374826370339, "grad_norm": 2.419607639312744, "learning_rate": 1.6834224598930483e-05, "loss": 0.11479254812002182, "num_input_tokens_seen": 783148, "step": 746, "train_runtime": 1772.6168, "train_tokens_per_second": 441.803 }, { "epoch": 0.31926487872635967, "grad_norm": 3.030592918395996, "learning_rate": 1.6829946524064172e-05, "loss": 0.10850606858730316, "num_input_tokens_seen": 784318, "step": 747, "train_runtime": 1774.7043, "train_tokens_per_second": 441.943 }, { "epoch": 0.31969227481568546, "grad_norm": 4.8611955642700195, "learning_rate": 1.6825668449197862e-05, "loss": 0.15850195288658142, "num_input_tokens_seen": 785114, "step": 748, "train_runtime": 1776.6957, "train_tokens_per_second": 441.896 }, { "epoch": 0.3201196709050112, "grad_norm": 3.4313971996307373, "learning_rate": 1.682139037433155e-05, "loss": 0.14053592085838318, "num_input_tokens_seen": 786298, "step": 749, "train_runtime": 1778.7778, "train_tokens_per_second": 442.044 }, { "epoch": 0.320547066994337, "grad_norm": 3.6184823513031006, "learning_rate": 1.681711229946524e-05, "loss": 0.1352541148662567, "num_input_tokens_seen": 787154, "step": 750, "train_runtime": 1780.7809, "train_tokens_per_second": 442.027 }, { "epoch": 0.3209744630836628, "grad_norm": 3.11987566947937, "learning_rate": 1.6812834224598933e-05, "loss": 0.18279433250427246, "num_input_tokens_seen": 788344, "step": 751, "train_runtime": 1789.2084, "train_tokens_per_second": 440.61 }, { "epoch": 0.3214018591729886, "grad_norm": 4.212590217590332, "learning_rate": 1.6808556149732623e-05, "loss": 0.17546242475509644, "num_input_tokens_seen": 789102, "step": 752, "train_runtime": 1791.1829, "train_tokens_per_second": 440.548 }, { "epoch": 0.3218292552623144, "grad_norm": 2.880328416824341, "learning_rate": 1.6804278074866312e-05, "loss": 0.15373101830482483, "num_input_tokens_seen": 789858, "step": 753, "train_runtime": 1793.159, "train_tokens_per_second": 440.484 }, { "epoch": 0.3222566513516401, "grad_norm": 3.7703986167907715, "learning_rate": 1.6800000000000002e-05, "loss": 0.17377933859825134, "num_input_tokens_seen": 790640, "step": 754, "train_runtime": 1795.177, "train_tokens_per_second": 440.425 }, { "epoch": 0.3226840474409659, "grad_norm": 2.64025616645813, "learning_rate": 1.679572192513369e-05, "loss": 0.1529747098684311, "num_input_tokens_seen": 792164, "step": 755, "train_runtime": 1797.3855, "train_tokens_per_second": 440.731 }, { "epoch": 0.3231114435302917, "grad_norm": 3.908766269683838, "learning_rate": 1.679144385026738e-05, "loss": 0.19651946425437927, "num_input_tokens_seen": 793302, "step": 756, "train_runtime": 1799.5136, "train_tokens_per_second": 440.842 }, { "epoch": 0.3235388396196175, "grad_norm": 2.4419639110565186, "learning_rate": 1.678716577540107e-05, "loss": 0.08055537939071655, "num_input_tokens_seen": 794362, "step": 757, "train_runtime": 1801.6083, "train_tokens_per_second": 440.918 }, { "epoch": 0.3239662357089433, "grad_norm": 4.166549205780029, "learning_rate": 1.678288770053476e-05, "loss": 0.18417219817638397, "num_input_tokens_seen": 795272, "step": 758, "train_runtime": 1803.6547, "train_tokens_per_second": 440.923 }, { "epoch": 0.324393631798269, "grad_norm": 3.282649517059326, "learning_rate": 1.6778609625668452e-05, "loss": 0.12055408209562302, "num_input_tokens_seen": 796026, "step": 759, "train_runtime": 1805.6579, "train_tokens_per_second": 440.851 }, { "epoch": 0.3248210278875948, "grad_norm": 2.189688205718994, "learning_rate": 1.6774331550802142e-05, "loss": 0.14737199246883392, "num_input_tokens_seen": 797736, "step": 760, "train_runtime": 1807.8678, "train_tokens_per_second": 441.258 }, { "epoch": 0.3252484239769206, "grad_norm": 3.0677638053894043, "learning_rate": 1.677005347593583e-05, "loss": 0.11574704945087433, "num_input_tokens_seen": 798690, "step": 761, "train_runtime": 1809.908, "train_tokens_per_second": 441.288 }, { "epoch": 0.3256758200662464, "grad_norm": 3.0081984996795654, "learning_rate": 1.676577540106952e-05, "loss": 0.21783174574375153, "num_input_tokens_seen": 799628, "step": 762, "train_runtime": 1811.9379, "train_tokens_per_second": 441.311 }, { "epoch": 0.3261032161555722, "grad_norm": 2.4546148777008057, "learning_rate": 1.676149732620321e-05, "loss": 0.14510956406593323, "num_input_tokens_seen": 800854, "step": 763, "train_runtime": 1814.0349, "train_tokens_per_second": 441.477 }, { "epoch": 0.32653061224489793, "grad_norm": 3.125731945037842, "learning_rate": 1.67572192513369e-05, "loss": 0.11249782145023346, "num_input_tokens_seen": 801748, "step": 764, "train_runtime": 1816.1485, "train_tokens_per_second": 441.455 }, { "epoch": 0.3269580083342237, "grad_norm": 2.754300355911255, "learning_rate": 1.675294117647059e-05, "loss": 0.13277259469032288, "num_input_tokens_seen": 802744, "step": 765, "train_runtime": 1818.2273, "train_tokens_per_second": 441.498 }, { "epoch": 0.3273854044235495, "grad_norm": 2.4079010486602783, "learning_rate": 1.674866310160428e-05, "loss": 0.07246275991201401, "num_input_tokens_seen": 803590, "step": 766, "train_runtime": 1820.2412, "train_tokens_per_second": 441.474 }, { "epoch": 0.3278128005128753, "grad_norm": 3.0190322399139404, "learning_rate": 1.674438502673797e-05, "loss": 0.1391064077615738, "num_input_tokens_seen": 804376, "step": 767, "train_runtime": 1822.3268, "train_tokens_per_second": 441.401 }, { "epoch": 0.3282401966022011, "grad_norm": 2.4388716220855713, "learning_rate": 1.674010695187166e-05, "loss": 0.13550874590873718, "num_input_tokens_seen": 805452, "step": 768, "train_runtime": 1824.448, "train_tokens_per_second": 441.477 }, { "epoch": 0.3286675926915269, "grad_norm": 3.1067779064178467, "learning_rate": 1.673582887700535e-05, "loss": 0.20665422081947327, "num_input_tokens_seen": 806856, "step": 769, "train_runtime": 1826.6087, "train_tokens_per_second": 441.723 }, { "epoch": 0.32909498878085264, "grad_norm": 3.392644166946411, "learning_rate": 1.673155080213904e-05, "loss": 0.16381341218948364, "num_input_tokens_seen": 807632, "step": 770, "train_runtime": 1828.6333, "train_tokens_per_second": 441.659 }, { "epoch": 0.32952238487017843, "grad_norm": 3.523287057876587, "learning_rate": 1.672727272727273e-05, "loss": 0.13788162171840668, "num_input_tokens_seen": 809556, "step": 771, "train_runtime": 1830.9039, "train_tokens_per_second": 442.162 }, { "epoch": 0.3299497809595042, "grad_norm": 5.4983720779418945, "learning_rate": 1.672299465240642e-05, "loss": 0.1619395762681961, "num_input_tokens_seen": 810648, "step": 772, "train_runtime": 1832.9782, "train_tokens_per_second": 442.257 }, { "epoch": 0.33037717704883, "grad_norm": 2.9557442665100098, "learning_rate": 1.6718716577540108e-05, "loss": 0.13064926862716675, "num_input_tokens_seen": 811464, "step": 773, "train_runtime": 1834.9918, "train_tokens_per_second": 442.217 }, { "epoch": 0.3308045731381558, "grad_norm": 3.253335952758789, "learning_rate": 1.6714438502673797e-05, "loss": 0.14006176590919495, "num_input_tokens_seen": 812348, "step": 774, "train_runtime": 1837.0877, "train_tokens_per_second": 442.193 }, { "epoch": 0.33123196922748155, "grad_norm": 2.5818698406219482, "learning_rate": 1.6710160427807487e-05, "loss": 0.12496156990528107, "num_input_tokens_seen": 813656, "step": 775, "train_runtime": 1839.2479, "train_tokens_per_second": 442.385 }, { "epoch": 0.33165936531680734, "grad_norm": 3.6411750316619873, "learning_rate": 1.670588235294118e-05, "loss": 0.1782451868057251, "num_input_tokens_seen": 814622, "step": 776, "train_runtime": 1841.3332, "train_tokens_per_second": 442.409 }, { "epoch": 0.33208676140613314, "grad_norm": 3.092738389968872, "learning_rate": 1.670160427807487e-05, "loss": 0.1875651329755783, "num_input_tokens_seen": 815802, "step": 777, "train_runtime": 1843.4295, "train_tokens_per_second": 442.546 }, { "epoch": 0.33251415749545893, "grad_norm": 3.4639575481414795, "learning_rate": 1.669732620320856e-05, "loss": 0.15780915319919586, "num_input_tokens_seen": 816674, "step": 778, "train_runtime": 1845.5042, "train_tokens_per_second": 442.521 }, { "epoch": 0.3329415535847847, "grad_norm": 2.5314581394195557, "learning_rate": 1.6693048128342245e-05, "loss": 0.15358608961105347, "num_input_tokens_seen": 817948, "step": 779, "train_runtime": 1847.6382, "train_tokens_per_second": 442.699 }, { "epoch": 0.33336894967411046, "grad_norm": 2.615727424621582, "learning_rate": 1.6688770053475938e-05, "loss": 0.1357804834842682, "num_input_tokens_seen": 819274, "step": 780, "train_runtime": 1849.7877, "train_tokens_per_second": 442.902 }, { "epoch": 0.33379634576343625, "grad_norm": 3.8525586128234863, "learning_rate": 1.6684491978609627e-05, "loss": 0.17240309715270996, "num_input_tokens_seen": 820162, "step": 781, "train_runtime": 1858.3713, "train_tokens_per_second": 441.334 }, { "epoch": 0.33422374185276205, "grad_norm": 4.191407203674316, "learning_rate": 1.6680213903743316e-05, "loss": 0.23687896132469177, "num_input_tokens_seen": 820874, "step": 782, "train_runtime": 1860.4096, "train_tokens_per_second": 441.233 }, { "epoch": 0.33465113794208784, "grad_norm": 2.6943485736846924, "learning_rate": 1.6675935828877006e-05, "loss": 0.16705572605133057, "num_input_tokens_seen": 822422, "step": 783, "train_runtime": 1862.6224, "train_tokens_per_second": 441.54 }, { "epoch": 0.33507853403141363, "grad_norm": 1.860338807106018, "learning_rate": 1.66716577540107e-05, "loss": 0.07211625576019287, "num_input_tokens_seen": 824162, "step": 784, "train_runtime": 1864.8986, "train_tokens_per_second": 441.934 }, { "epoch": 0.33550593012073937, "grad_norm": 2.996925115585327, "learning_rate": 1.6667379679144388e-05, "loss": 0.13057556748390198, "num_input_tokens_seen": 825056, "step": 785, "train_runtime": 1866.9345, "train_tokens_per_second": 441.931 }, { "epoch": 0.33593332621006516, "grad_norm": 3.4369115829467773, "learning_rate": 1.6663101604278074e-05, "loss": 0.19953583180904388, "num_input_tokens_seen": 826424, "step": 786, "train_runtime": 1869.11, "train_tokens_per_second": 442.148 }, { "epoch": 0.33636072229939096, "grad_norm": 2.488295793533325, "learning_rate": 1.6658823529411764e-05, "loss": 0.1348193883895874, "num_input_tokens_seen": 827710, "step": 787, "train_runtime": 1871.2625, "train_tokens_per_second": 442.327 }, { "epoch": 0.33678811838871675, "grad_norm": 2.3568084239959717, "learning_rate": 1.6654545454545456e-05, "loss": 0.11009471118450165, "num_input_tokens_seen": 828636, "step": 788, "train_runtime": 1873.3483, "train_tokens_per_second": 442.329 }, { "epoch": 0.33721551447804254, "grad_norm": 3.801801919937134, "learning_rate": 1.6650267379679146e-05, "loss": 0.14569516479969025, "num_input_tokens_seen": 829302, "step": 789, "train_runtime": 1875.3026, "train_tokens_per_second": 442.223 }, { "epoch": 0.3376429105673683, "grad_norm": 5.081080913543701, "learning_rate": 1.6645989304812835e-05, "loss": 0.12997569143772125, "num_input_tokens_seen": 829892, "step": 790, "train_runtime": 1877.2649, "train_tokens_per_second": 442.075 }, { "epoch": 0.3380703066566941, "grad_norm": 3.5495529174804688, "learning_rate": 1.6641711229946525e-05, "loss": 0.16700680553913116, "num_input_tokens_seen": 830962, "step": 791, "train_runtime": 1879.3438, "train_tokens_per_second": 442.155 }, { "epoch": 0.33849770274601987, "grad_norm": 2.476435661315918, "learning_rate": 1.6637433155080214e-05, "loss": 0.09858560562133789, "num_input_tokens_seen": 831794, "step": 792, "train_runtime": 1881.4071, "train_tokens_per_second": 442.113 }, { "epoch": 0.33892509883534566, "grad_norm": 3.570925712585449, "learning_rate": 1.6633155080213904e-05, "loss": 0.08923085033893585, "num_input_tokens_seen": 832656, "step": 793, "train_runtime": 1883.3909, "train_tokens_per_second": 442.105 }, { "epoch": 0.33935249492467146, "grad_norm": 2.364238977432251, "learning_rate": 1.6628877005347593e-05, "loss": 0.11550764739513397, "num_input_tokens_seen": 834142, "step": 794, "train_runtime": 1885.815, "train_tokens_per_second": 442.324 }, { "epoch": 0.33977989101399725, "grad_norm": 3.608776807785034, "learning_rate": 1.6624598930481283e-05, "loss": 0.18349257111549377, "num_input_tokens_seen": 834814, "step": 795, "train_runtime": 1887.7806, "train_tokens_per_second": 442.22 }, { "epoch": 0.340207287103323, "grad_norm": 4.224783420562744, "learning_rate": 1.6620320855614975e-05, "loss": 0.15702037513256073, "num_input_tokens_seen": 835578, "step": 796, "train_runtime": 1889.8057, "train_tokens_per_second": 442.15 }, { "epoch": 0.3406346831926488, "grad_norm": 2.4544620513916016, "learning_rate": 1.6616042780748665e-05, "loss": 0.11303136497735977, "num_input_tokens_seen": 836666, "step": 797, "train_runtime": 1891.9705, "train_tokens_per_second": 442.219 }, { "epoch": 0.3410620792819746, "grad_norm": 2.1436290740966797, "learning_rate": 1.6611764705882354e-05, "loss": 0.13750866055488586, "num_input_tokens_seen": 837820, "step": 798, "train_runtime": 1894.1037, "train_tokens_per_second": 442.331 }, { "epoch": 0.34148947537130037, "grad_norm": 3.9511640071868896, "learning_rate": 1.6607486631016044e-05, "loss": 0.16122567653656006, "num_input_tokens_seen": 838552, "step": 799, "train_runtime": 1896.1225, "train_tokens_per_second": 442.246 }, { "epoch": 0.34191687146062616, "grad_norm": 3.582397937774658, "learning_rate": 1.6603208556149733e-05, "loss": 0.1547728180885315, "num_input_tokens_seen": 839356, "step": 800, "train_runtime": 1898.1443, "train_tokens_per_second": 442.198 }, { "epoch": 0.3423442675499519, "grad_norm": 5.425139427185059, "learning_rate": 1.6598930481283423e-05, "loss": 0.1871921718120575, "num_input_tokens_seen": 839988, "step": 801, "train_runtime": 1900.1262, "train_tokens_per_second": 442.07 }, { "epoch": 0.3427716636392777, "grad_norm": 2.7834746837615967, "learning_rate": 1.6594652406417112e-05, "loss": 0.15691137313842773, "num_input_tokens_seen": 840830, "step": 802, "train_runtime": 1902.1987, "train_tokens_per_second": 442.031 }, { "epoch": 0.3431990597286035, "grad_norm": 3.048058271408081, "learning_rate": 1.65903743315508e-05, "loss": 0.14582957327365875, "num_input_tokens_seen": 841794, "step": 803, "train_runtime": 1904.2632, "train_tokens_per_second": 442.058 }, { "epoch": 0.3436264558179293, "grad_norm": 3.980039596557617, "learning_rate": 1.6586096256684494e-05, "loss": 0.0996789038181305, "num_input_tokens_seen": 842524, "step": 804, "train_runtime": 1906.26, "train_tokens_per_second": 441.977 }, { "epoch": 0.34405385190725507, "grad_norm": 2.8752737045288086, "learning_rate": 1.6581818181818184e-05, "loss": 0.24773788452148438, "num_input_tokens_seen": 844360, "step": 805, "train_runtime": 1908.5343, "train_tokens_per_second": 442.413 }, { "epoch": 0.3444812479965808, "grad_norm": 3.2004787921905518, "learning_rate": 1.6577540106951873e-05, "loss": 0.2751487195491791, "num_input_tokens_seen": 846190, "step": 806, "train_runtime": 1910.7811, "train_tokens_per_second": 442.85 }, { "epoch": 0.3449086440859066, "grad_norm": 3.3579134941101074, "learning_rate": 1.6573262032085563e-05, "loss": 0.18909302353858948, "num_input_tokens_seen": 847272, "step": 807, "train_runtime": 1912.8623, "train_tokens_per_second": 442.934 }, { "epoch": 0.3453360401752324, "grad_norm": 2.9090867042541504, "learning_rate": 1.6568983957219252e-05, "loss": 0.10554330050945282, "num_input_tokens_seen": 848110, "step": 808, "train_runtime": 1914.9074, "train_tokens_per_second": 442.899 }, { "epoch": 0.3457634362645582, "grad_norm": 2.701162576675415, "learning_rate": 1.656470588235294e-05, "loss": 0.1586577296257019, "num_input_tokens_seen": 849084, "step": 809, "train_runtime": 1916.9359, "train_tokens_per_second": 442.938 }, { "epoch": 0.346190832353884, "grad_norm": 1.7255891561508179, "learning_rate": 1.656042780748663e-05, "loss": 0.0649508461356163, "num_input_tokens_seen": 850498, "step": 810, "train_runtime": 1919.0832, "train_tokens_per_second": 443.179 }, { "epoch": 0.3466182284432097, "grad_norm": 3.123565912246704, "learning_rate": 1.655614973262032e-05, "loss": 0.1544187217950821, "num_input_tokens_seen": 851400, "step": 811, "train_runtime": 1927.6204, "train_tokens_per_second": 441.684 }, { "epoch": 0.3470456245325355, "grad_norm": 3.224686861038208, "learning_rate": 1.6551871657754013e-05, "loss": 0.18803249299526215, "num_input_tokens_seen": 853148, "step": 812, "train_runtime": 1929.8742, "train_tokens_per_second": 442.074 }, { "epoch": 0.3474730206218613, "grad_norm": 3.279426097869873, "learning_rate": 1.6547593582887703e-05, "loss": 0.14644157886505127, "num_input_tokens_seen": 853884, "step": 813, "train_runtime": 1931.8241, "train_tokens_per_second": 442.009 }, { "epoch": 0.3479004167111871, "grad_norm": 2.5244524478912354, "learning_rate": 1.6543315508021392e-05, "loss": 0.1774372160434723, "num_input_tokens_seen": 855732, "step": 814, "train_runtime": 1934.0499, "train_tokens_per_second": 442.456 }, { "epoch": 0.3483278128005129, "grad_norm": 2.610222816467285, "learning_rate": 1.653903743315508e-05, "loss": 0.13001713156700134, "num_input_tokens_seen": 856782, "step": 815, "train_runtime": 1936.049, "train_tokens_per_second": 442.541 }, { "epoch": 0.34875520888983863, "grad_norm": 2.8688743114471436, "learning_rate": 1.653475935828877e-05, "loss": 0.1396550089120865, "num_input_tokens_seen": 857708, "step": 816, "train_runtime": 1938.091, "train_tokens_per_second": 442.553 }, { "epoch": 0.3491826049791644, "grad_norm": 4.757078647613525, "learning_rate": 1.653048128342246e-05, "loss": 0.23061591386795044, "num_input_tokens_seen": 858566, "step": 817, "train_runtime": 1940.1444, "train_tokens_per_second": 442.527 }, { "epoch": 0.3496100010684902, "grad_norm": 2.236754894256592, "learning_rate": 1.652620320855615e-05, "loss": 0.10535576194524765, "num_input_tokens_seen": 859472, "step": 818, "train_runtime": 1942.148, "train_tokens_per_second": 442.537 }, { "epoch": 0.350037397157816, "grad_norm": 3.769700288772583, "learning_rate": 1.652192513368984e-05, "loss": 0.1694517880678177, "num_input_tokens_seen": 860164, "step": 819, "train_runtime": 1944.1443, "train_tokens_per_second": 442.438 }, { "epoch": 0.3504647932471418, "grad_norm": 3.2518036365509033, "learning_rate": 1.6517647058823532e-05, "loss": 0.17297501862049103, "num_input_tokens_seen": 861046, "step": 820, "train_runtime": 1946.1328, "train_tokens_per_second": 442.439 }, { "epoch": 0.3508921893364676, "grad_norm": 2.8238017559051514, "learning_rate": 1.6513368983957222e-05, "loss": 0.1672133207321167, "num_input_tokens_seen": 862272, "step": 821, "train_runtime": 1948.2436, "train_tokens_per_second": 442.589 }, { "epoch": 0.35131958542579333, "grad_norm": 3.0380592346191406, "learning_rate": 1.650909090909091e-05, "loss": 0.08867887407541275, "num_input_tokens_seen": 862822, "step": 822, "train_runtime": 1950.1842, "train_tokens_per_second": 442.431 }, { "epoch": 0.35174698151511913, "grad_norm": 2.7388217449188232, "learning_rate": 1.65048128342246e-05, "loss": 0.13384008407592773, "num_input_tokens_seen": 863764, "step": 823, "train_runtime": 1952.2342, "train_tokens_per_second": 442.449 }, { "epoch": 0.3521743776044449, "grad_norm": 3.4671761989593506, "learning_rate": 1.650053475935829e-05, "loss": 0.1287350356578827, "num_input_tokens_seen": 864614, "step": 824, "train_runtime": 1954.3744, "train_tokens_per_second": 442.399 }, { "epoch": 0.3526017736937707, "grad_norm": 2.7498767375946045, "learning_rate": 1.649625668449198e-05, "loss": 0.13570083677768707, "num_input_tokens_seen": 865604, "step": 825, "train_runtime": 1956.4799, "train_tokens_per_second": 442.429 }, { "epoch": 0.3530291697830965, "grad_norm": 2.897430896759033, "learning_rate": 1.649197860962567e-05, "loss": 0.19579720497131348, "num_input_tokens_seen": 866716, "step": 826, "train_runtime": 1958.5376, "train_tokens_per_second": 442.532 }, { "epoch": 0.35345656587242225, "grad_norm": 2.8864974975585938, "learning_rate": 1.648770053475936e-05, "loss": 0.19011685252189636, "num_input_tokens_seen": 868744, "step": 827, "train_runtime": 1960.8749, "train_tokens_per_second": 443.039 }, { "epoch": 0.35388396196174804, "grad_norm": 3.6182870864868164, "learning_rate": 1.648342245989305e-05, "loss": 0.12158944457769394, "num_input_tokens_seen": 869632, "step": 828, "train_runtime": 1962.9246, "train_tokens_per_second": 443.029 }, { "epoch": 0.35431135805107383, "grad_norm": 4.422471046447754, "learning_rate": 1.647914438502674e-05, "loss": 0.18166618049144745, "num_input_tokens_seen": 870562, "step": 829, "train_runtime": 1964.9757, "train_tokens_per_second": 443.04 }, { "epoch": 0.3547387541403996, "grad_norm": 3.618467092514038, "learning_rate": 1.647486631016043e-05, "loss": 0.1652064025402069, "num_input_tokens_seen": 871682, "step": 830, "train_runtime": 1967.0706, "train_tokens_per_second": 443.137 }, { "epoch": 0.3551661502297254, "grad_norm": 4.541975498199463, "learning_rate": 1.647058823529412e-05, "loss": 0.16861656308174133, "num_input_tokens_seen": 872416, "step": 831, "train_runtime": 1969.025, "train_tokens_per_second": 443.07 }, { "epoch": 0.35559354631905116, "grad_norm": 3.375227928161621, "learning_rate": 1.646631016042781e-05, "loss": 0.18978804349899292, "num_input_tokens_seen": 873606, "step": 832, "train_runtime": 1971.1167, "train_tokens_per_second": 443.204 }, { "epoch": 0.35602094240837695, "grad_norm": 3.7770273685455322, "learning_rate": 1.64620320855615e-05, "loss": 0.2243930995464325, "num_input_tokens_seen": 874724, "step": 833, "train_runtime": 1973.1972, "train_tokens_per_second": 443.303 }, { "epoch": 0.35644833849770274, "grad_norm": 4.624592304229736, "learning_rate": 1.6457754010695188e-05, "loss": 0.1322430819272995, "num_input_tokens_seen": 875570, "step": 834, "train_runtime": 1975.2638, "train_tokens_per_second": 443.267 }, { "epoch": 0.35687573458702854, "grad_norm": 2.136991262435913, "learning_rate": 1.6453475935828877e-05, "loss": 0.12605592608451843, "num_input_tokens_seen": 876702, "step": 835, "train_runtime": 1977.3183, "train_tokens_per_second": 443.379 }, { "epoch": 0.35730313067635433, "grad_norm": 3.0726447105407715, "learning_rate": 1.644919786096257e-05, "loss": 0.11882643401622772, "num_input_tokens_seen": 877628, "step": 836, "train_runtime": 1979.3446, "train_tokens_per_second": 443.393 }, { "epoch": 0.35773052676568007, "grad_norm": 2.1071488857269287, "learning_rate": 1.644491978609626e-05, "loss": 0.05799455940723419, "num_input_tokens_seen": 878390, "step": 837, "train_runtime": 1981.3652, "train_tokens_per_second": 443.326 }, { "epoch": 0.35815792285500586, "grad_norm": 1.6122456789016724, "learning_rate": 1.644064171122995e-05, "loss": 0.08234067261219025, "num_input_tokens_seen": 880084, "step": 838, "train_runtime": 1983.5782, "train_tokens_per_second": 443.685 }, { "epoch": 0.35858531894433165, "grad_norm": 4.1051812171936035, "learning_rate": 1.643636363636364e-05, "loss": 0.13144336640834808, "num_input_tokens_seen": 881128, "step": 839, "train_runtime": 1985.5973, "train_tokens_per_second": 443.76 }, { "epoch": 0.35901271503365745, "grad_norm": 3.988614082336426, "learning_rate": 1.6432085561497328e-05, "loss": 0.23451296985149384, "num_input_tokens_seen": 881942, "step": 840, "train_runtime": 1987.591, "train_tokens_per_second": 443.724 }, { "epoch": 0.35944011112298324, "grad_norm": 3.1022684574127197, "learning_rate": 1.6427807486631017e-05, "loss": 0.11788983643054962, "num_input_tokens_seen": 882700, "step": 841, "train_runtime": 1996.1137, "train_tokens_per_second": 442.209 }, { "epoch": 0.35986750721230903, "grad_norm": 2.941065549850464, "learning_rate": 1.6423529411764707e-05, "loss": 0.16564802825450897, "num_input_tokens_seen": 883724, "step": 842, "train_runtime": 1998.1362, "train_tokens_per_second": 442.274 }, { "epoch": 0.3602949033016348, "grad_norm": 3.216688632965088, "learning_rate": 1.6419251336898396e-05, "loss": 0.1497475951910019, "num_input_tokens_seen": 884510, "step": 843, "train_runtime": 2000.1572, "train_tokens_per_second": 442.22 }, { "epoch": 0.36072229939096057, "grad_norm": 2.5600903034210205, "learning_rate": 1.641497326203209e-05, "loss": 0.12463045120239258, "num_input_tokens_seen": 885522, "step": 844, "train_runtime": 2002.2305, "train_tokens_per_second": 442.268 }, { "epoch": 0.36114969548028636, "grad_norm": 2.9868717193603516, "learning_rate": 1.641069518716578e-05, "loss": 0.12309199571609497, "num_input_tokens_seen": 886520, "step": 845, "train_runtime": 2004.2629, "train_tokens_per_second": 442.317 }, { "epoch": 0.36157709156961215, "grad_norm": 2.599369525909424, "learning_rate": 1.6406417112299468e-05, "loss": 0.1329491287469864, "num_input_tokens_seen": 887478, "step": 846, "train_runtime": 2006.3683, "train_tokens_per_second": 442.331 }, { "epoch": 0.36200448765893795, "grad_norm": 4.006803035736084, "learning_rate": 1.6402139037433154e-05, "loss": 0.12610451877117157, "num_input_tokens_seen": 888142, "step": 847, "train_runtime": 2008.3612, "train_tokens_per_second": 442.222 }, { "epoch": 0.3624318837482637, "grad_norm": 3.9792346954345703, "learning_rate": 1.6397860962566847e-05, "loss": 0.17190277576446533, "num_input_tokens_seen": 889178, "step": 848, "train_runtime": 2010.5036, "train_tokens_per_second": 442.266 }, { "epoch": 0.3628592798375895, "grad_norm": 2.634158134460449, "learning_rate": 1.6393582887700536e-05, "loss": 0.1466003656387329, "num_input_tokens_seen": 890746, "step": 849, "train_runtime": 2012.6883, "train_tokens_per_second": 442.565 }, { "epoch": 0.36328667592691527, "grad_norm": 3.4565250873565674, "learning_rate": 1.6389304812834226e-05, "loss": 0.13625645637512207, "num_input_tokens_seen": 891694, "step": 850, "train_runtime": 2014.7349, "train_tokens_per_second": 442.586 }, { "epoch": 0.36371407201624106, "grad_norm": 2.904454231262207, "learning_rate": 1.6385026737967915e-05, "loss": 0.21185842156410217, "num_input_tokens_seen": 892998, "step": 851, "train_runtime": 2016.8572, "train_tokens_per_second": 442.767 }, { "epoch": 0.36414146810556686, "grad_norm": 3.2865755558013916, "learning_rate": 1.6380748663101608e-05, "loss": 0.17540650069713593, "num_input_tokens_seen": 893882, "step": 852, "train_runtime": 2018.8885, "train_tokens_per_second": 442.759 }, { "epoch": 0.3645688641948926, "grad_norm": 2.5559585094451904, "learning_rate": 1.6376470588235298e-05, "loss": 0.11230617761611938, "num_input_tokens_seen": 894888, "step": 853, "train_runtime": 2021.0596, "train_tokens_per_second": 442.782 }, { "epoch": 0.3649962602842184, "grad_norm": 3.1157190799713135, "learning_rate": 1.6372192513368984e-05, "loss": 0.2301216870546341, "num_input_tokens_seen": 896216, "step": 854, "train_runtime": 2023.2594, "train_tokens_per_second": 442.957 }, { "epoch": 0.3654236563735442, "grad_norm": 2.973968505859375, "learning_rate": 1.6367914438502673e-05, "loss": 0.11380991339683533, "num_input_tokens_seen": 897404, "step": 855, "train_runtime": 2025.3996, "train_tokens_per_second": 443.075 }, { "epoch": 0.36585105246287, "grad_norm": 3.152690887451172, "learning_rate": 1.6363636363636366e-05, "loss": 0.1799992322921753, "num_input_tokens_seen": 898318, "step": 856, "train_runtime": 2027.424, "train_tokens_per_second": 443.083 }, { "epoch": 0.36627844855219577, "grad_norm": 2.545757532119751, "learning_rate": 1.6359358288770055e-05, "loss": 0.1458369791507721, "num_input_tokens_seen": 899926, "step": 857, "train_runtime": 2029.6251, "train_tokens_per_second": 443.395 }, { "epoch": 0.3667058446415215, "grad_norm": 3.038119077682495, "learning_rate": 1.6355080213903745e-05, "loss": 0.1422380805015564, "num_input_tokens_seen": 901122, "step": 858, "train_runtime": 2031.741, "train_tokens_per_second": 443.522 }, { "epoch": 0.3671332407308473, "grad_norm": 2.1880640983581543, "learning_rate": 1.6350802139037434e-05, "loss": 0.0793108344078064, "num_input_tokens_seen": 902054, "step": 859, "train_runtime": 2033.8212, "train_tokens_per_second": 443.527 }, { "epoch": 0.3675606368201731, "grad_norm": 3.888615608215332, "learning_rate": 1.6346524064171124e-05, "loss": 0.15858900547027588, "num_input_tokens_seen": 902682, "step": 860, "train_runtime": 2035.784, "train_tokens_per_second": 443.408 }, { "epoch": 0.3679880329094989, "grad_norm": 3.678223133087158, "learning_rate": 1.6342245989304813e-05, "loss": 0.2031177282333374, "num_input_tokens_seen": 903482, "step": 861, "train_runtime": 2037.7453, "train_tokens_per_second": 443.373 }, { "epoch": 0.3684154289988247, "grad_norm": 5.0188517570495605, "learning_rate": 1.6337967914438503e-05, "loss": 0.16376955807209015, "num_input_tokens_seen": 904300, "step": 862, "train_runtime": 2039.749, "train_tokens_per_second": 443.339 }, { "epoch": 0.3688428250881504, "grad_norm": 3.451781749725342, "learning_rate": 1.6333689839572192e-05, "loss": 0.17166760563850403, "num_input_tokens_seen": 905288, "step": 863, "train_runtime": 2041.7884, "train_tokens_per_second": 443.38 }, { "epoch": 0.3692702211774762, "grad_norm": 3.7770071029663086, "learning_rate": 1.6329411764705885e-05, "loss": 0.20119602978229523, "num_input_tokens_seen": 906054, "step": 864, "train_runtime": 2043.7914, "train_tokens_per_second": 443.32 }, { "epoch": 0.369697617266802, "grad_norm": 2.81948184967041, "learning_rate": 1.6325133689839574e-05, "loss": 0.1101490929722786, "num_input_tokens_seen": 907008, "step": 865, "train_runtime": 2045.8559, "train_tokens_per_second": 443.339 }, { "epoch": 0.3701250133561278, "grad_norm": 2.6873080730438232, "learning_rate": 1.6320855614973264e-05, "loss": 0.13334931433200836, "num_input_tokens_seen": 908128, "step": 866, "train_runtime": 2048.0003, "train_tokens_per_second": 443.422 }, { "epoch": 0.3705524094454536, "grad_norm": 3.717231273651123, "learning_rate": 1.6316577540106953e-05, "loss": 0.17222562432289124, "num_input_tokens_seen": 909008, "step": 867, "train_runtime": 2049.9971, "train_tokens_per_second": 443.419 }, { "epoch": 0.3709798055347794, "grad_norm": 2.938831329345703, "learning_rate": 1.6312299465240643e-05, "loss": 0.17824360728263855, "num_input_tokens_seen": 910658, "step": 868, "train_runtime": 2052.1588, "train_tokens_per_second": 443.756 }, { "epoch": 0.3714072016241051, "grad_norm": 5.017563343048096, "learning_rate": 1.6308021390374332e-05, "loss": 0.19953244924545288, "num_input_tokens_seen": 911350, "step": 869, "train_runtime": 2054.1031, "train_tokens_per_second": 443.673 }, { "epoch": 0.3718345977134309, "grad_norm": 3.751927137374878, "learning_rate": 1.630374331550802e-05, "loss": 0.16339567303657532, "num_input_tokens_seen": 912134, "step": 870, "train_runtime": 2056.0838, "train_tokens_per_second": 443.627 }, { "epoch": 0.3722619938027567, "grad_norm": 2.96889591217041, "learning_rate": 1.629946524064171e-05, "loss": 0.20123767852783203, "num_input_tokens_seen": 913428, "step": 871, "train_runtime": 2064.7675, "train_tokens_per_second": 442.388 }, { "epoch": 0.3726893898920825, "grad_norm": 2.8208200931549072, "learning_rate": 1.6295187165775404e-05, "loss": 0.12837810814380646, "num_input_tokens_seen": 914398, "step": 872, "train_runtime": 2066.7625, "train_tokens_per_second": 442.43 }, { "epoch": 0.3731167859814083, "grad_norm": 3.2568740844726562, "learning_rate": 1.6290909090909093e-05, "loss": 0.12384645640850067, "num_input_tokens_seen": 915234, "step": 873, "train_runtime": 2068.7583, "train_tokens_per_second": 442.407 }, { "epoch": 0.37354418207073403, "grad_norm": 2.983619451522827, "learning_rate": 1.6286631016042783e-05, "loss": 0.1463351845741272, "num_input_tokens_seen": 916102, "step": 874, "train_runtime": 2070.7753, "train_tokens_per_second": 442.396 }, { "epoch": 0.3739715781600598, "grad_norm": 3.2139527797698975, "learning_rate": 1.6282352941176472e-05, "loss": 0.12374912947416306, "num_input_tokens_seen": 916690, "step": 875, "train_runtime": 2072.7004, "train_tokens_per_second": 442.268 }, { "epoch": 0.3743989742493856, "grad_norm": 2.230070114135742, "learning_rate": 1.627807486631016e-05, "loss": 0.10868636518716812, "num_input_tokens_seen": 917832, "step": 876, "train_runtime": 2074.8174, "train_tokens_per_second": 442.368 }, { "epoch": 0.3748263703387114, "grad_norm": 2.75704288482666, "learning_rate": 1.627379679144385e-05, "loss": 0.13413727283477783, "num_input_tokens_seen": 919210, "step": 877, "train_runtime": 2076.9287, "train_tokens_per_second": 442.581 }, { "epoch": 0.3752537664280372, "grad_norm": 2.8754377365112305, "learning_rate": 1.626951871657754e-05, "loss": 0.10905253887176514, "num_input_tokens_seen": 920192, "step": 878, "train_runtime": 2078.9864, "train_tokens_per_second": 442.616 }, { "epoch": 0.37568116251736294, "grad_norm": 2.77583646774292, "learning_rate": 1.626524064171123e-05, "loss": 0.0867101177573204, "num_input_tokens_seen": 920826, "step": 879, "train_runtime": 2080.9473, "train_tokens_per_second": 442.503 }, { "epoch": 0.37610855860668874, "grad_norm": 3.4160633087158203, "learning_rate": 1.626096256684492e-05, "loss": 0.16699495911598206, "num_input_tokens_seen": 922070, "step": 880, "train_runtime": 2083.0732, "train_tokens_per_second": 442.649 }, { "epoch": 0.37653595469601453, "grad_norm": 3.6048743724823, "learning_rate": 1.6256684491978612e-05, "loss": 0.28260552883148193, "num_input_tokens_seen": 923318, "step": 881, "train_runtime": 2085.1799, "train_tokens_per_second": 442.8 }, { "epoch": 0.3769633507853403, "grad_norm": 3.290318012237549, "learning_rate": 1.62524064171123e-05, "loss": 0.13404695689678192, "num_input_tokens_seen": 924142, "step": 882, "train_runtime": 2087.2232, "train_tokens_per_second": 442.761 }, { "epoch": 0.3773907468746661, "grad_norm": 3.361940860748291, "learning_rate": 1.624812834224599e-05, "loss": 0.17885807156562805, "num_input_tokens_seen": 925586, "step": 883, "train_runtime": 2089.5069, "train_tokens_per_second": 442.969 }, { "epoch": 0.37781814296399185, "grad_norm": 2.3778014183044434, "learning_rate": 1.624385026737968e-05, "loss": 0.10743165761232376, "num_input_tokens_seen": 926742, "step": 884, "train_runtime": 2091.6867, "train_tokens_per_second": 443.06 }, { "epoch": 0.37824553905331765, "grad_norm": 2.6063477993011475, "learning_rate": 1.623957219251337e-05, "loss": 0.17332960665225983, "num_input_tokens_seen": 928106, "step": 885, "train_runtime": 2093.8662, "train_tokens_per_second": 443.25 }, { "epoch": 0.37867293514264344, "grad_norm": 4.0899505615234375, "learning_rate": 1.623529411764706e-05, "loss": 0.19288423657417297, "num_input_tokens_seen": 929166, "step": 886, "train_runtime": 2095.9856, "train_tokens_per_second": 443.307 }, { "epoch": 0.37910033123196923, "grad_norm": 2.5437886714935303, "learning_rate": 1.623101604278075e-05, "loss": 0.11767511814832687, "num_input_tokens_seen": 930410, "step": 887, "train_runtime": 2098.1375, "train_tokens_per_second": 443.446 }, { "epoch": 0.379527727321295, "grad_norm": 3.331578493118286, "learning_rate": 1.622673796791444e-05, "loss": 0.1090846061706543, "num_input_tokens_seen": 931220, "step": 888, "train_runtime": 2100.2103, "train_tokens_per_second": 443.394 }, { "epoch": 0.37995512341062077, "grad_norm": 3.095195770263672, "learning_rate": 1.622245989304813e-05, "loss": 0.10828014463186264, "num_input_tokens_seen": 932864, "step": 889, "train_runtime": 2102.4118, "train_tokens_per_second": 443.711 }, { "epoch": 0.38038251949994656, "grad_norm": 3.322017192840576, "learning_rate": 1.621818181818182e-05, "loss": 0.17956194281578064, "num_input_tokens_seen": 934192, "step": 890, "train_runtime": 2104.544, "train_tokens_per_second": 443.893 }, { "epoch": 0.38080991558927235, "grad_norm": 4.183267116546631, "learning_rate": 1.621390374331551e-05, "loss": 0.20426103472709656, "num_input_tokens_seen": 935036, "step": 891, "train_runtime": 2106.5351, "train_tokens_per_second": 443.874 }, { "epoch": 0.38123731167859815, "grad_norm": 2.649113893508911, "learning_rate": 1.62096256684492e-05, "loss": 0.17787085473537445, "num_input_tokens_seen": 936516, "step": 892, "train_runtime": 2108.6962, "train_tokens_per_second": 444.121 }, { "epoch": 0.38166470776792394, "grad_norm": 2.7996020317077637, "learning_rate": 1.620534759358289e-05, "loss": 0.11850351840257645, "num_input_tokens_seen": 937898, "step": 893, "train_runtime": 2110.816, "train_tokens_per_second": 444.33 }, { "epoch": 0.38209210385724973, "grad_norm": 3.758162498474121, "learning_rate": 1.620106951871658e-05, "loss": 0.10957302898168564, "num_input_tokens_seen": 938748, "step": 894, "train_runtime": 2112.8862, "train_tokens_per_second": 444.297 }, { "epoch": 0.38251949994657547, "grad_norm": 2.9185712337493896, "learning_rate": 1.6196791443850268e-05, "loss": 0.13005822896957397, "num_input_tokens_seen": 939548, "step": 895, "train_runtime": 2114.9377, "train_tokens_per_second": 444.244 }, { "epoch": 0.38294689603590126, "grad_norm": 2.704132318496704, "learning_rate": 1.6192513368983957e-05, "loss": 0.11967745423316956, "num_input_tokens_seen": 940356, "step": 896, "train_runtime": 2116.9273, "train_tokens_per_second": 444.208 }, { "epoch": 0.38337429212522706, "grad_norm": 3.0454626083374023, "learning_rate": 1.618823529411765e-05, "loss": 0.14856570959091187, "num_input_tokens_seen": 941316, "step": 897, "train_runtime": 2119.003, "train_tokens_per_second": 444.226 }, { "epoch": 0.38380168821455285, "grad_norm": 3.2519073486328125, "learning_rate": 1.618395721925134e-05, "loss": 0.19943198561668396, "num_input_tokens_seen": 942222, "step": 898, "train_runtime": 2121.0845, "train_tokens_per_second": 444.217 }, { "epoch": 0.38422908430387864, "grad_norm": 2.854214668273926, "learning_rate": 1.617967914438503e-05, "loss": 0.15924370288848877, "num_input_tokens_seen": 943360, "step": 899, "train_runtime": 2123.1721, "train_tokens_per_second": 444.316 }, { "epoch": 0.3846564803932044, "grad_norm": 3.443159580230713, "learning_rate": 1.617540106951872e-05, "loss": 0.1765565574169159, "num_input_tokens_seen": 944406, "step": 900, "train_runtime": 2125.2337, "train_tokens_per_second": 444.377 }, { "epoch": 0.3850838764825302, "grad_norm": 2.476480484008789, "learning_rate": 1.6171122994652408e-05, "loss": 0.1342540979385376, "num_input_tokens_seen": 945882, "step": 901, "train_runtime": 2133.894, "train_tokens_per_second": 443.266 }, { "epoch": 0.38551127257185597, "grad_norm": 3.512960195541382, "learning_rate": 1.6166844919786097e-05, "loss": 0.18861031532287598, "num_input_tokens_seen": 946730, "step": 902, "train_runtime": 2135.888, "train_tokens_per_second": 443.249 }, { "epoch": 0.38593866866118176, "grad_norm": 4.3065643310546875, "learning_rate": 1.6162566844919787e-05, "loss": 0.22209052741527557, "num_input_tokens_seen": 947530, "step": 903, "train_runtime": 2137.8852, "train_tokens_per_second": 443.209 }, { "epoch": 0.38636606475050755, "grad_norm": 2.3028688430786133, "learning_rate": 1.6158288770053476e-05, "loss": 0.08168645203113556, "num_input_tokens_seen": 948602, "step": 904, "train_runtime": 2139.9571, "train_tokens_per_second": 443.281 }, { "epoch": 0.3867934608398333, "grad_norm": 2.892332077026367, "learning_rate": 1.615401069518717e-05, "loss": 0.14299827814102173, "num_input_tokens_seen": 949498, "step": 905, "train_runtime": 2142.0689, "train_tokens_per_second": 443.262 }, { "epoch": 0.3872208569291591, "grad_norm": 3.6618220806121826, "learning_rate": 1.614973262032086e-05, "loss": 0.1568375527858734, "num_input_tokens_seen": 950432, "step": 906, "train_runtime": 2144.0982, "train_tokens_per_second": 443.278 }, { "epoch": 0.3876482530184849, "grad_norm": 2.7025883197784424, "learning_rate": 1.6145454545454548e-05, "loss": 0.1164485439658165, "num_input_tokens_seen": 951456, "step": 907, "train_runtime": 2146.138, "train_tokens_per_second": 443.334 }, { "epoch": 0.38807564910781067, "grad_norm": 3.104348659515381, "learning_rate": 1.6141176470588234e-05, "loss": 0.10492739826440811, "num_input_tokens_seen": 952172, "step": 908, "train_runtime": 2148.1463, "train_tokens_per_second": 443.253 }, { "epoch": 0.38850304519713647, "grad_norm": 2.747732162475586, "learning_rate": 1.6136898395721927e-05, "loss": 0.11487283557653427, "num_input_tokens_seen": 953040, "step": 909, "train_runtime": 2150.1372, "train_tokens_per_second": 443.246 }, { "epoch": 0.3889304412864622, "grad_norm": 2.6833279132843018, "learning_rate": 1.6132620320855616e-05, "loss": 0.12157800048589706, "num_input_tokens_seen": 954068, "step": 910, "train_runtime": 2152.1638, "train_tokens_per_second": 443.306 }, { "epoch": 0.389357837375788, "grad_norm": 3.4484288692474365, "learning_rate": 1.6128342245989306e-05, "loss": 0.226801797747612, "num_input_tokens_seen": 954938, "step": 911, "train_runtime": 2154.196, "train_tokens_per_second": 443.292 }, { "epoch": 0.3897852334651138, "grad_norm": 3.9453911781311035, "learning_rate": 1.6124064171122995e-05, "loss": 0.14873573184013367, "num_input_tokens_seen": 955768, "step": 912, "train_runtime": 2156.2191, "train_tokens_per_second": 443.261 }, { "epoch": 0.3902126295544396, "grad_norm": 3.6305999755859375, "learning_rate": 1.6119786096256688e-05, "loss": 0.21297237277030945, "num_input_tokens_seen": 956702, "step": 913, "train_runtime": 2158.2875, "train_tokens_per_second": 443.269 }, { "epoch": 0.3906400256437654, "grad_norm": 3.201023817062378, "learning_rate": 1.6115508021390377e-05, "loss": 0.138827845454216, "num_input_tokens_seen": 957424, "step": 914, "train_runtime": 2160.3069, "train_tokens_per_second": 443.189 }, { "epoch": 0.39106742173309117, "grad_norm": 2.8727478981018066, "learning_rate": 1.6111229946524064e-05, "loss": 0.11612001806497574, "num_input_tokens_seen": 958388, "step": 915, "train_runtime": 2162.3579, "train_tokens_per_second": 443.214 }, { "epoch": 0.3914948178224169, "grad_norm": 3.085972785949707, "learning_rate": 1.6106951871657753e-05, "loss": 0.2506169080734253, "num_input_tokens_seen": 959302, "step": 916, "train_runtime": 2164.388, "train_tokens_per_second": 443.221 }, { "epoch": 0.3919222139117427, "grad_norm": 3.15606689453125, "learning_rate": 1.6102673796791446e-05, "loss": 0.10323436558246613, "num_input_tokens_seen": 960216, "step": 917, "train_runtime": 2166.4106, "train_tokens_per_second": 443.229 }, { "epoch": 0.3923496100010685, "grad_norm": 3.7641422748565674, "learning_rate": 1.6098395721925135e-05, "loss": 0.15620802342891693, "num_input_tokens_seen": 961178, "step": 918, "train_runtime": 2168.4328, "train_tokens_per_second": 443.259 }, { "epoch": 0.3927770060903943, "grad_norm": 3.679429531097412, "learning_rate": 1.6094117647058825e-05, "loss": 0.17789867520332336, "num_input_tokens_seen": 961906, "step": 919, "train_runtime": 2170.4274, "train_tokens_per_second": 443.187 }, { "epoch": 0.3932044021797201, "grad_norm": 3.106301784515381, "learning_rate": 1.6089839572192514e-05, "loss": 0.21292844414710999, "num_input_tokens_seen": 962894, "step": 920, "train_runtime": 2172.508, "train_tokens_per_second": 443.218 }, { "epoch": 0.3936317982690458, "grad_norm": 2.34635329246521, "learning_rate": 1.6085561497326207e-05, "loss": 0.0811031237244606, "num_input_tokens_seen": 963752, "step": 921, "train_runtime": 2174.4984, "train_tokens_per_second": 443.207 }, { "epoch": 0.3940591943583716, "grad_norm": 2.3631465435028076, "learning_rate": 1.6081283422459893e-05, "loss": 0.10404130071401596, "num_input_tokens_seen": 964612, "step": 922, "train_runtime": 2176.5207, "train_tokens_per_second": 443.19 }, { "epoch": 0.3944865904476974, "grad_norm": 3.8228330612182617, "learning_rate": 1.6077005347593582e-05, "loss": 0.173420250415802, "num_input_tokens_seen": 965652, "step": 923, "train_runtime": 2178.5605, "train_tokens_per_second": 443.252 }, { "epoch": 0.3949139865370232, "grad_norm": 3.662015914916992, "learning_rate": 1.6072727272727272e-05, "loss": 0.15936538577079773, "num_input_tokens_seen": 966668, "step": 924, "train_runtime": 2180.59, "train_tokens_per_second": 443.306 }, { "epoch": 0.395341382626349, "grad_norm": 2.7576632499694824, "learning_rate": 1.6068449197860965e-05, "loss": 0.11928541958332062, "num_input_tokens_seen": 967584, "step": 925, "train_runtime": 2182.5933, "train_tokens_per_second": 443.319 }, { "epoch": 0.39576877871567473, "grad_norm": 2.92537784576416, "learning_rate": 1.6064171122994654e-05, "loss": 0.18931931257247925, "num_input_tokens_seen": 968924, "step": 926, "train_runtime": 2184.6909, "train_tokens_per_second": 443.506 }, { "epoch": 0.3961961748050005, "grad_norm": 2.3758535385131836, "learning_rate": 1.6059893048128344e-05, "loss": 0.1301591694355011, "num_input_tokens_seen": 970256, "step": 927, "train_runtime": 2186.8044, "train_tokens_per_second": 443.687 }, { "epoch": 0.3966235708943263, "grad_norm": 2.2258036136627197, "learning_rate": 1.6055614973262033e-05, "loss": 0.11166122555732727, "num_input_tokens_seen": 971508, "step": 928, "train_runtime": 2188.9467, "train_tokens_per_second": 443.824 }, { "epoch": 0.3970509669836521, "grad_norm": 3.133446216583252, "learning_rate": 1.6051336898395723e-05, "loss": 0.14364859461784363, "num_input_tokens_seen": 972496, "step": 929, "train_runtime": 2190.9939, "train_tokens_per_second": 443.861 }, { "epoch": 0.3974783630729779, "grad_norm": 3.3615312576293945, "learning_rate": 1.6047058823529412e-05, "loss": 0.1700805425643921, "num_input_tokens_seen": 973502, "step": 930, "train_runtime": 2193.0685, "train_tokens_per_second": 443.899 }, { "epoch": 0.39790575916230364, "grad_norm": 2.510171413421631, "learning_rate": 1.60427807486631e-05, "loss": 0.09587380290031433, "num_input_tokens_seen": 974398, "step": 931, "train_runtime": 2201.6722, "train_tokens_per_second": 442.572 }, { "epoch": 0.39833315525162943, "grad_norm": 3.8139679431915283, "learning_rate": 1.603850267379679e-05, "loss": 0.15770947933197021, "num_input_tokens_seen": 975244, "step": 932, "train_runtime": 2203.6645, "train_tokens_per_second": 442.556 }, { "epoch": 0.3987605513409552, "grad_norm": 3.882706880569458, "learning_rate": 1.6034224598930484e-05, "loss": 0.1570173054933548, "num_input_tokens_seen": 976058, "step": 933, "train_runtime": 2205.654, "train_tokens_per_second": 442.525 }, { "epoch": 0.399187947430281, "grad_norm": 3.7372584342956543, "learning_rate": 1.6029946524064173e-05, "loss": 0.20967872440814972, "num_input_tokens_seen": 976876, "step": 934, "train_runtime": 2207.6456, "train_tokens_per_second": 442.497 }, { "epoch": 0.3996153435196068, "grad_norm": 5.46579647064209, "learning_rate": 1.6025668449197863e-05, "loss": 0.26738402247428894, "num_input_tokens_seen": 977490, "step": 935, "train_runtime": 2209.5962, "train_tokens_per_second": 442.384 }, { "epoch": 0.40004273960893255, "grad_norm": 3.54427433013916, "learning_rate": 1.6021390374331552e-05, "loss": 0.11531199514865875, "num_input_tokens_seen": 978154, "step": 936, "train_runtime": 2211.5918, "train_tokens_per_second": 442.285 }, { "epoch": 0.40004273960893255, "eval_loss": 0.5698503851890564, "eval_runtime": 57.953, "eval_samples_per_second": 17.221, "eval_steps_per_second": 8.61, "num_input_tokens_seen": 978154, "step": 936 }, { "epoch": 0.40047013569825834, "grad_norm": 3.129371404647827, "learning_rate": 1.601711229946524e-05, "loss": 0.1033656895160675, "num_input_tokens_seen": 978928, "step": 937, "train_runtime": 2271.6265, "train_tokens_per_second": 430.937 }, { "epoch": 0.40089753178758414, "grad_norm": 2.525700569152832, "learning_rate": 1.601283422459893e-05, "loss": 0.13463933765888214, "num_input_tokens_seen": 979884, "step": 938, "train_runtime": 2273.7054, "train_tokens_per_second": 430.963 }, { "epoch": 0.40132492787690993, "grad_norm": 3.946357011795044, "learning_rate": 1.600855614973262e-05, "loss": 0.15102031826972961, "num_input_tokens_seen": 980664, "step": 939, "train_runtime": 2275.765, "train_tokens_per_second": 430.916 }, { "epoch": 0.4017523239662357, "grad_norm": 4.099009037017822, "learning_rate": 1.600427807486631e-05, "loss": 0.14986948668956757, "num_input_tokens_seen": 981276, "step": 940, "train_runtime": 2277.8068, "train_tokens_per_second": 430.799 }, { "epoch": 0.4021797200555615, "grad_norm": 2.5861546993255615, "learning_rate": 1.6000000000000003e-05, "loss": 0.17913028597831726, "num_input_tokens_seen": 982846, "step": 941, "train_runtime": 2280.1165, "train_tokens_per_second": 431.051 }, { "epoch": 0.40260711614488726, "grad_norm": 2.740493059158325, "learning_rate": 1.5995721925133692e-05, "loss": 0.09153739362955093, "num_input_tokens_seen": 984040, "step": 942, "train_runtime": 2282.2425, "train_tokens_per_second": 431.172 }, { "epoch": 0.40303451223421305, "grad_norm": 3.864326000213623, "learning_rate": 1.599144385026738e-05, "loss": 0.13687407970428467, "num_input_tokens_seen": 984862, "step": 943, "train_runtime": 2284.3261, "train_tokens_per_second": 431.139 }, { "epoch": 0.40346190832353884, "grad_norm": 2.4913134574890137, "learning_rate": 1.598716577540107e-05, "loss": 0.0964777022600174, "num_input_tokens_seen": 985594, "step": 944, "train_runtime": 2286.3824, "train_tokens_per_second": 431.071 }, { "epoch": 0.40388930441286464, "grad_norm": 4.006031036376953, "learning_rate": 1.598288770053476e-05, "loss": 0.1856725662946701, "num_input_tokens_seen": 986356, "step": 945, "train_runtime": 2288.4538, "train_tokens_per_second": 431.014 }, { "epoch": 0.40431670050219043, "grad_norm": 3.6885268688201904, "learning_rate": 1.597860962566845e-05, "loss": 0.20293888449668884, "num_input_tokens_seen": 987016, "step": 946, "train_runtime": 2290.4571, "train_tokens_per_second": 430.925 }, { "epoch": 0.40474409659151617, "grad_norm": 3.0161800384521484, "learning_rate": 1.597433155080214e-05, "loss": 0.13541850447654724, "num_input_tokens_seen": 987838, "step": 947, "train_runtime": 2292.6011, "train_tokens_per_second": 430.881 }, { "epoch": 0.40517149268084196, "grad_norm": 3.6430602073669434, "learning_rate": 1.597005347593583e-05, "loss": 0.13437046110630035, "num_input_tokens_seen": 988560, "step": 948, "train_runtime": 2294.6169, "train_tokens_per_second": 430.817 }, { "epoch": 0.40559888877016775, "grad_norm": 5.142971992492676, "learning_rate": 1.596577540106952e-05, "loss": 0.23744851350784302, "num_input_tokens_seen": 989722, "step": 949, "train_runtime": 2296.7552, "train_tokens_per_second": 430.922 }, { "epoch": 0.40602628485949355, "grad_norm": 3.0357255935668945, "learning_rate": 1.596149732620321e-05, "loss": 0.12808263301849365, "num_input_tokens_seen": 990588, "step": 950, "train_runtime": 2298.8303, "train_tokens_per_second": 430.91 }, { "epoch": 0.40645368094881934, "grad_norm": 3.43465518951416, "learning_rate": 1.59572192513369e-05, "loss": 0.15328100323677063, "num_input_tokens_seen": 991610, "step": 951, "train_runtime": 2300.9723, "train_tokens_per_second": 430.953 }, { "epoch": 0.4068810770381451, "grad_norm": 3.0474939346313477, "learning_rate": 1.595294117647059e-05, "loss": 0.1505572497844696, "num_input_tokens_seen": 993094, "step": 952, "train_runtime": 2303.2522, "train_tokens_per_second": 431.17 }, { "epoch": 0.40730847312747087, "grad_norm": 2.5601046085357666, "learning_rate": 1.594866310160428e-05, "loss": 0.15914660692214966, "num_input_tokens_seen": 994546, "step": 953, "train_runtime": 2305.4935, "train_tokens_per_second": 431.381 }, { "epoch": 0.40773586921679666, "grad_norm": 2.198195457458496, "learning_rate": 1.594438502673797e-05, "loss": 0.11577246338129044, "num_input_tokens_seen": 996130, "step": 954, "train_runtime": 2307.7314, "train_tokens_per_second": 431.649 }, { "epoch": 0.40816326530612246, "grad_norm": 2.4809536933898926, "learning_rate": 1.5940106951871658e-05, "loss": 0.08430467545986176, "num_input_tokens_seen": 996898, "step": 955, "train_runtime": 2309.7864, "train_tokens_per_second": 431.597 }, { "epoch": 0.40859066139544825, "grad_norm": 2.530029773712158, "learning_rate": 1.5935828877005348e-05, "loss": 0.08219069242477417, "num_input_tokens_seen": 997846, "step": 956, "train_runtime": 2311.8748, "train_tokens_per_second": 431.618 }, { "epoch": 0.409018057484774, "grad_norm": 6.292982578277588, "learning_rate": 1.593155080213904e-05, "loss": 0.1308143585920334, "num_input_tokens_seen": 998512, "step": 957, "train_runtime": 2313.8816, "train_tokens_per_second": 431.531 }, { "epoch": 0.4094454535740998, "grad_norm": 4.810624599456787, "learning_rate": 1.592727272727273e-05, "loss": 0.2354581654071808, "num_input_tokens_seen": 999580, "step": 958, "train_runtime": 2315.9758, "train_tokens_per_second": 431.602 }, { "epoch": 0.4098728496634256, "grad_norm": 2.160900115966797, "learning_rate": 1.592299465240642e-05, "loss": 0.0986616387963295, "num_input_tokens_seen": 1000800, "step": 959, "train_runtime": 2318.1097, "train_tokens_per_second": 431.731 }, { "epoch": 0.41030024575275137, "grad_norm": 2.5913217067718506, "learning_rate": 1.591871657754011e-05, "loss": 0.13993312418460846, "num_input_tokens_seen": 1002042, "step": 960, "train_runtime": 2320.2796, "train_tokens_per_second": 431.863 }, { "epoch": 0.41072764184207716, "grad_norm": 2.4269092082977295, "learning_rate": 1.59144385026738e-05, "loss": 0.13695529103279114, "num_input_tokens_seen": 1003804, "step": 961, "train_runtime": 2329.1783, "train_tokens_per_second": 430.969 }, { "epoch": 0.4111550379314029, "grad_norm": 3.1382129192352295, "learning_rate": 1.5910160427807488e-05, "loss": 0.1408788561820984, "num_input_tokens_seen": 1005234, "step": 962, "train_runtime": 2331.3922, "train_tokens_per_second": 431.173 }, { "epoch": 0.4115824340207287, "grad_norm": 3.420305013656616, "learning_rate": 1.5905882352941177e-05, "loss": 0.19164885580539703, "num_input_tokens_seen": 1006284, "step": 963, "train_runtime": 2333.5462, "train_tokens_per_second": 431.225 }, { "epoch": 0.4120098301100545, "grad_norm": 4.329071998596191, "learning_rate": 1.5901604278074867e-05, "loss": 0.11083001643419266, "num_input_tokens_seen": 1006842, "step": 964, "train_runtime": 2335.5041, "train_tokens_per_second": 431.103 }, { "epoch": 0.4124372261993803, "grad_norm": 3.0661702156066895, "learning_rate": 1.589732620320856e-05, "loss": 0.1629539281129837, "num_input_tokens_seen": 1007780, "step": 965, "train_runtime": 2337.6084, "train_tokens_per_second": 431.116 }, { "epoch": 0.4128646222887061, "grad_norm": 3.1654844284057617, "learning_rate": 1.589304812834225e-05, "loss": 0.12572845816612244, "num_input_tokens_seen": 1008514, "step": 966, "train_runtime": 2339.6499, "train_tokens_per_second": 431.053 }, { "epoch": 0.41329201837803187, "grad_norm": 2.6483960151672363, "learning_rate": 1.588877005347594e-05, "loss": 0.10801530629396439, "num_input_tokens_seen": 1009364, "step": 967, "train_runtime": 2341.7333, "train_tokens_per_second": 431.033 }, { "epoch": 0.4137194144673576, "grad_norm": 3.36672306060791, "learning_rate": 1.5884491978609628e-05, "loss": 0.14181117713451385, "num_input_tokens_seen": 1010180, "step": 968, "train_runtime": 2343.7267, "train_tokens_per_second": 431.014 }, { "epoch": 0.4141468105566834, "grad_norm": 2.8620762825012207, "learning_rate": 1.5880213903743317e-05, "loss": 0.15125736594200134, "num_input_tokens_seen": 1010894, "step": 969, "train_runtime": 2345.7105, "train_tokens_per_second": 430.954 }, { "epoch": 0.4145742066460092, "grad_norm": 2.9136648178100586, "learning_rate": 1.5875935828877007e-05, "loss": 0.18435488641262054, "num_input_tokens_seen": 1011828, "step": 970, "train_runtime": 2347.7602, "train_tokens_per_second": 430.976 }, { "epoch": 0.415001602735335, "grad_norm": 3.272649049758911, "learning_rate": 1.5871657754010696e-05, "loss": 0.12939196825027466, "num_input_tokens_seen": 1012502, "step": 971, "train_runtime": 2349.792, "train_tokens_per_second": 430.89 }, { "epoch": 0.4154289988246608, "grad_norm": 5.475400447845459, "learning_rate": 1.5867379679144386e-05, "loss": 0.28860902786254883, "num_input_tokens_seen": 1012990, "step": 972, "train_runtime": 2351.7461, "train_tokens_per_second": 430.74 }, { "epoch": 0.4158563949139865, "grad_norm": 2.724729537963867, "learning_rate": 1.586310160427808e-05, "loss": 0.18167336285114288, "num_input_tokens_seen": 1014720, "step": 973, "train_runtime": 2354.0773, "train_tokens_per_second": 431.048 }, { "epoch": 0.4162837910033123, "grad_norm": 3.133634090423584, "learning_rate": 1.5858823529411768e-05, "loss": 0.17339462041854858, "num_input_tokens_seen": 1016746, "step": 974, "train_runtime": 2356.4361, "train_tokens_per_second": 431.476 }, { "epoch": 0.4167111870926381, "grad_norm": 2.6663413047790527, "learning_rate": 1.5854545454545457e-05, "loss": 0.1064106747508049, "num_input_tokens_seen": 1017582, "step": 975, "train_runtime": 2358.4943, "train_tokens_per_second": 431.454 }, { "epoch": 0.4171385831819639, "grad_norm": 2.532240152359009, "learning_rate": 1.5850267379679143e-05, "loss": 0.11097608506679535, "num_input_tokens_seen": 1018630, "step": 976, "train_runtime": 2360.6278, "train_tokens_per_second": 431.508 }, { "epoch": 0.4175659792712897, "grad_norm": 3.13242769241333, "learning_rate": 1.5845989304812836e-05, "loss": 0.10106104612350464, "num_input_tokens_seen": 1019318, "step": 977, "train_runtime": 2362.6476, "train_tokens_per_second": 431.43 }, { "epoch": 0.4179933753606154, "grad_norm": 3.1643269062042236, "learning_rate": 1.5841711229946526e-05, "loss": 0.15163138508796692, "num_input_tokens_seen": 1020494, "step": 978, "train_runtime": 2364.833, "train_tokens_per_second": 431.529 }, { "epoch": 0.4184207714499412, "grad_norm": 2.685286045074463, "learning_rate": 1.5837433155080215e-05, "loss": 0.14863711595535278, "num_input_tokens_seen": 1021976, "step": 979, "train_runtime": 2367.0527, "train_tokens_per_second": 431.75 }, { "epoch": 0.418848167539267, "grad_norm": 3.5907371044158936, "learning_rate": 1.5833155080213905e-05, "loss": 0.17044982314109802, "num_input_tokens_seen": 1022736, "step": 980, "train_runtime": 2369.1184, "train_tokens_per_second": 431.695 }, { "epoch": 0.4192755636285928, "grad_norm": 4.0167236328125, "learning_rate": 1.5828877005347597e-05, "loss": 0.13640011847019196, "num_input_tokens_seen": 1023696, "step": 981, "train_runtime": 2371.1763, "train_tokens_per_second": 431.725 }, { "epoch": 0.4197029597179186, "grad_norm": 2.88775897026062, "learning_rate": 1.5824598930481287e-05, "loss": 0.17530319094657898, "num_input_tokens_seen": 1024560, "step": 982, "train_runtime": 2373.2234, "train_tokens_per_second": 431.717 }, { "epoch": 0.42013035580724434, "grad_norm": 2.3002512454986572, "learning_rate": 1.5820320855614973e-05, "loss": 0.09414497017860413, "num_input_tokens_seen": 1025730, "step": 983, "train_runtime": 2375.3405, "train_tokens_per_second": 431.824 }, { "epoch": 0.42055775189657013, "grad_norm": 5.44786262512207, "learning_rate": 1.5816042780748662e-05, "loss": 0.2069467455148697, "num_input_tokens_seen": 1026550, "step": 984, "train_runtime": 2377.3645, "train_tokens_per_second": 431.802 }, { "epoch": 0.4209851479858959, "grad_norm": 4.028661727905273, "learning_rate": 1.5811764705882352e-05, "loss": 0.09830475598573685, "num_input_tokens_seen": 1027168, "step": 985, "train_runtime": 2379.3332, "train_tokens_per_second": 431.704 }, { "epoch": 0.4214125440752217, "grad_norm": 2.412536382675171, "learning_rate": 1.5807486631016045e-05, "loss": 0.1301649808883667, "num_input_tokens_seen": 1028250, "step": 986, "train_runtime": 2381.4668, "train_tokens_per_second": 431.772 }, { "epoch": 0.4218399401645475, "grad_norm": 2.8748650550842285, "learning_rate": 1.5803208556149734e-05, "loss": 0.10201525688171387, "num_input_tokens_seen": 1029064, "step": 987, "train_runtime": 2383.4946, "train_tokens_per_second": 431.746 }, { "epoch": 0.4222673362538733, "grad_norm": 3.6433022022247314, "learning_rate": 1.5798930481283424e-05, "loss": 0.1748078465461731, "num_input_tokens_seen": 1030018, "step": 988, "train_runtime": 2385.6021, "train_tokens_per_second": 431.764 }, { "epoch": 0.42269473234319904, "grad_norm": 3.15360164642334, "learning_rate": 1.5794652406417113e-05, "loss": 0.11847887933254242, "num_input_tokens_seen": 1030886, "step": 989, "train_runtime": 2387.6681, "train_tokens_per_second": 431.754 }, { "epoch": 0.42312212843252484, "grad_norm": 2.9097654819488525, "learning_rate": 1.5790374331550802e-05, "loss": 0.15133161842823029, "num_input_tokens_seen": 1032168, "step": 990, "train_runtime": 2389.7963, "train_tokens_per_second": 431.906 }, { "epoch": 0.42354952452185063, "grad_norm": 3.6200013160705566, "learning_rate": 1.5786096256684492e-05, "loss": 0.14536435902118683, "num_input_tokens_seen": 1032956, "step": 991, "train_runtime": 2398.4351, "train_tokens_per_second": 430.679 }, { "epoch": 0.4239769206111764, "grad_norm": 2.526433229446411, "learning_rate": 1.578181818181818e-05, "loss": 0.13084016740322113, "num_input_tokens_seen": 1033768, "step": 992, "train_runtime": 2400.4557, "train_tokens_per_second": 430.655 }, { "epoch": 0.4244043167005022, "grad_norm": 3.6554641723632812, "learning_rate": 1.577754010695187e-05, "loss": 0.14103198051452637, "num_input_tokens_seen": 1034492, "step": 993, "train_runtime": 2402.4641, "train_tokens_per_second": 430.596 }, { "epoch": 0.42483171278982795, "grad_norm": 3.3080387115478516, "learning_rate": 1.5773262032085564e-05, "loss": 0.12623611092567444, "num_input_tokens_seen": 1035644, "step": 994, "train_runtime": 2404.5783, "train_tokens_per_second": 430.697 }, { "epoch": 0.42525910887915375, "grad_norm": 2.4104950428009033, "learning_rate": 1.5768983957219253e-05, "loss": 0.11813364177942276, "num_input_tokens_seen": 1037086, "step": 995, "train_runtime": 2406.7565, "train_tokens_per_second": 430.906 }, { "epoch": 0.42568650496847954, "grad_norm": 3.64646053314209, "learning_rate": 1.5764705882352943e-05, "loss": 0.0654887780547142, "num_input_tokens_seen": 1037730, "step": 996, "train_runtime": 2408.705, "train_tokens_per_second": 430.825 }, { "epoch": 0.42611390105780533, "grad_norm": 2.640672206878662, "learning_rate": 1.5760427807486632e-05, "loss": 0.09134610742330551, "num_input_tokens_seen": 1038528, "step": 997, "train_runtime": 2410.7094, "train_tokens_per_second": 430.798 }, { "epoch": 0.4265412971471311, "grad_norm": 2.6327028274536133, "learning_rate": 1.575614973262032e-05, "loss": 0.11012723296880722, "num_input_tokens_seen": 1039386, "step": 998, "train_runtime": 2412.7598, "train_tokens_per_second": 430.787 }, { "epoch": 0.42696869323645686, "grad_norm": 3.207695722579956, "learning_rate": 1.575187165775401e-05, "loss": 0.1508389264345169, "num_input_tokens_seen": 1040338, "step": 999, "train_runtime": 2414.8065, "train_tokens_per_second": 430.816 }, { "epoch": 0.42739608932578266, "grad_norm": 4.508682727813721, "learning_rate": 1.57475935828877e-05, "loss": 0.24495993554592133, "num_input_tokens_seen": 1041176, "step": 1000, "train_runtime": 2416.8504, "train_tokens_per_second": 430.799 }, { "epoch": 0.42782348541510845, "grad_norm": 2.4895706176757812, "learning_rate": 1.574331550802139e-05, "loss": 0.11581746488809586, "num_input_tokens_seen": 1042066, "step": 1001, "train_runtime": 2418.9551, "train_tokens_per_second": 430.792 }, { "epoch": 0.42825088150443424, "grad_norm": 2.77655029296875, "learning_rate": 1.5739037433155083e-05, "loss": 0.21308037638664246, "num_input_tokens_seen": 1043372, "step": 1002, "train_runtime": 2421.1268, "train_tokens_per_second": 430.945 }, { "epoch": 0.42867827759376004, "grad_norm": 5.7979326248168945, "learning_rate": 1.5734759358288772e-05, "loss": 0.222947359085083, "num_input_tokens_seen": 1044332, "step": 1003, "train_runtime": 2423.17, "train_tokens_per_second": 430.978 }, { "epoch": 0.4291056736830858, "grad_norm": 2.3011908531188965, "learning_rate": 1.573048128342246e-05, "loss": 0.08945601433515549, "num_input_tokens_seen": 1045352, "step": 1004, "train_runtime": 2425.2196, "train_tokens_per_second": 431.034 }, { "epoch": 0.42953306977241157, "grad_norm": 3.217158794403076, "learning_rate": 1.572620320855615e-05, "loss": 0.18294289708137512, "num_input_tokens_seen": 1046092, "step": 1005, "train_runtime": 2427.3962, "train_tokens_per_second": 430.952 }, { "epoch": 0.42996046586173736, "grad_norm": 4.006203651428223, "learning_rate": 1.572192513368984e-05, "loss": 0.22173276543617249, "num_input_tokens_seen": 1046896, "step": 1006, "train_runtime": 2429.4375, "train_tokens_per_second": 430.921 }, { "epoch": 0.43038786195106316, "grad_norm": 3.962876319885254, "learning_rate": 1.571764705882353e-05, "loss": 0.18439872562885284, "num_input_tokens_seen": 1047566, "step": 1007, "train_runtime": 2431.4412, "train_tokens_per_second": 430.842 }, { "epoch": 0.43081525804038895, "grad_norm": 4.599574565887451, "learning_rate": 1.571336898395722e-05, "loss": 0.14483045041561127, "num_input_tokens_seen": 1048180, "step": 1008, "train_runtime": 2433.4211, "train_tokens_per_second": 430.743 }, { "epoch": 0.4312426541297147, "grad_norm": 4.2527570724487305, "learning_rate": 1.570909090909091e-05, "loss": 0.24055345356464386, "num_input_tokens_seen": 1049332, "step": 1009, "train_runtime": 2435.5341, "train_tokens_per_second": 430.843 }, { "epoch": 0.4316700502190405, "grad_norm": 4.76500129699707, "learning_rate": 1.57048128342246e-05, "loss": 0.13520678877830505, "num_input_tokens_seen": 1049910, "step": 1010, "train_runtime": 2437.4816, "train_tokens_per_second": 430.736 }, { "epoch": 0.4320974463083663, "grad_norm": 3.4047281742095947, "learning_rate": 1.570053475935829e-05, "loss": 0.1783725619316101, "num_input_tokens_seen": 1051190, "step": 1011, "train_runtime": 2439.6085, "train_tokens_per_second": 430.885 }, { "epoch": 0.43252484239769207, "grad_norm": 3.4894444942474365, "learning_rate": 1.569625668449198e-05, "loss": 0.22947156429290771, "num_input_tokens_seen": 1052216, "step": 1012, "train_runtime": 2441.7337, "train_tokens_per_second": 430.93 }, { "epoch": 0.43295223848701786, "grad_norm": 3.4204695224761963, "learning_rate": 1.569197860962567e-05, "loss": 0.15205669403076172, "num_input_tokens_seen": 1053108, "step": 1013, "train_runtime": 2443.7524, "train_tokens_per_second": 430.939 }, { "epoch": 0.43337963457634365, "grad_norm": 4.279384136199951, "learning_rate": 1.568770053475936e-05, "loss": 0.22293099761009216, "num_input_tokens_seen": 1053874, "step": 1014, "train_runtime": 2445.7765, "train_tokens_per_second": 430.895 }, { "epoch": 0.4338070306656694, "grad_norm": 1.7959322929382324, "learning_rate": 1.568342245989305e-05, "loss": 0.07155629992485046, "num_input_tokens_seen": 1055180, "step": 1015, "train_runtime": 2447.9586, "train_tokens_per_second": 431.045 }, { "epoch": 0.4342344267549952, "grad_norm": 3.1679439544677734, "learning_rate": 1.5679144385026738e-05, "loss": 0.10849887132644653, "num_input_tokens_seen": 1055904, "step": 1016, "train_runtime": 2449.9532, "train_tokens_per_second": 430.989 }, { "epoch": 0.434661822844321, "grad_norm": 2.921274423599243, "learning_rate": 1.5674866310160428e-05, "loss": 0.15974636375904083, "num_input_tokens_seen": 1056978, "step": 1017, "train_runtime": 2452.0714, "train_tokens_per_second": 431.055 }, { "epoch": 0.43508921893364677, "grad_norm": 4.978099346160889, "learning_rate": 1.567058823529412e-05, "loss": 0.21475082635879517, "num_input_tokens_seen": 1058052, "step": 1018, "train_runtime": 2454.1392, "train_tokens_per_second": 431.13 }, { "epoch": 0.43551661502297256, "grad_norm": 2.737354040145874, "learning_rate": 1.566631016042781e-05, "loss": 0.09027975797653198, "num_input_tokens_seen": 1058838, "step": 1019, "train_runtime": 2456.1161, "train_tokens_per_second": 431.103 }, { "epoch": 0.4359440111122983, "grad_norm": 3.2369279861450195, "learning_rate": 1.56620320855615e-05, "loss": 0.10335059463977814, "num_input_tokens_seen": 1059646, "step": 1020, "train_runtime": 2458.1705, "train_tokens_per_second": 431.071 }, { "epoch": 0.4363714072016241, "grad_norm": 2.6113617420196533, "learning_rate": 1.565775401069519e-05, "loss": 0.17476630210876465, "num_input_tokens_seen": 1060874, "step": 1021, "train_runtime": 2466.8843, "train_tokens_per_second": 430.046 }, { "epoch": 0.4367988032909499, "grad_norm": 6.517242908477783, "learning_rate": 1.5653475935828878e-05, "loss": 0.27782416343688965, "num_input_tokens_seen": 1061970, "step": 1022, "train_runtime": 2469.0171, "train_tokens_per_second": 430.119 }, { "epoch": 0.4372261993802757, "grad_norm": 2.8367512226104736, "learning_rate": 1.5649197860962568e-05, "loss": 0.2036033272743225, "num_input_tokens_seen": 1063252, "step": 1023, "train_runtime": 2471.1951, "train_tokens_per_second": 430.258 }, { "epoch": 0.4376535954696015, "grad_norm": 4.166869640350342, "learning_rate": 1.5644919786096257e-05, "loss": 0.1926107108592987, "num_input_tokens_seen": 1063910, "step": 1024, "train_runtime": 2473.1854, "train_tokens_per_second": 430.178 }, { "epoch": 0.4380809915589272, "grad_norm": 2.81599497795105, "learning_rate": 1.5640641711229947e-05, "loss": 0.11440451443195343, "num_input_tokens_seen": 1065248, "step": 1025, "train_runtime": 2475.3945, "train_tokens_per_second": 430.335 }, { "epoch": 0.438508387648253, "grad_norm": 2.8661296367645264, "learning_rate": 1.563636363636364e-05, "loss": 0.10879606008529663, "num_input_tokens_seen": 1065962, "step": 1026, "train_runtime": 2477.4197, "train_tokens_per_second": 430.271 }, { "epoch": 0.4389357837375788, "grad_norm": 2.863218069076538, "learning_rate": 1.563208556149733e-05, "loss": 0.1990147829055786, "num_input_tokens_seen": 1067372, "step": 1027, "train_runtime": 2479.6154, "train_tokens_per_second": 430.459 }, { "epoch": 0.4393631798269046, "grad_norm": 3.031972885131836, "learning_rate": 1.562780748663102e-05, "loss": 0.14785142242908478, "num_input_tokens_seen": 1068310, "step": 1028, "train_runtime": 2481.6769, "train_tokens_per_second": 430.479 }, { "epoch": 0.4397905759162304, "grad_norm": 2.5645766258239746, "learning_rate": 1.5623529411764708e-05, "loss": 0.11684894561767578, "num_input_tokens_seen": 1069292, "step": 1029, "train_runtime": 2483.8156, "train_tokens_per_second": 430.504 }, { "epoch": 0.4402179720055561, "grad_norm": 2.743408441543579, "learning_rate": 1.5619251336898397e-05, "loss": 0.09588809311389923, "num_input_tokens_seen": 1070098, "step": 1030, "train_runtime": 2485.8608, "train_tokens_per_second": 430.474 }, { "epoch": 0.4406453680948819, "grad_norm": 3.146395683288574, "learning_rate": 1.5614973262032087e-05, "loss": 0.15148451924324036, "num_input_tokens_seen": 1071068, "step": 1031, "train_runtime": 2487.9986, "train_tokens_per_second": 430.494 }, { "epoch": 0.4410727641842077, "grad_norm": 3.2485437393188477, "learning_rate": 1.5610695187165776e-05, "loss": 0.1452752947807312, "num_input_tokens_seen": 1072092, "step": 1032, "train_runtime": 2490.0908, "train_tokens_per_second": 430.543 }, { "epoch": 0.4415001602735335, "grad_norm": 3.1901021003723145, "learning_rate": 1.5606417112299466e-05, "loss": 0.11025238782167435, "num_input_tokens_seen": 1072790, "step": 1033, "train_runtime": 2492.1486, "train_tokens_per_second": 430.468 }, { "epoch": 0.4419275563628593, "grad_norm": 3.3421692848205566, "learning_rate": 1.560213903743316e-05, "loss": 0.14787673950195312, "num_input_tokens_seen": 1073782, "step": 1034, "train_runtime": 2494.2112, "train_tokens_per_second": 430.51 }, { "epoch": 0.44235495245218504, "grad_norm": 2.9150612354278564, "learning_rate": 1.5597860962566848e-05, "loss": 0.175185427069664, "num_input_tokens_seen": 1074934, "step": 1035, "train_runtime": 2496.3646, "train_tokens_per_second": 430.6 }, { "epoch": 0.44278234854151083, "grad_norm": 2.544585943222046, "learning_rate": 1.5593582887700537e-05, "loss": 0.1855897307395935, "num_input_tokens_seen": 1076546, "step": 1036, "train_runtime": 2498.6453, "train_tokens_per_second": 430.852 }, { "epoch": 0.4432097446308366, "grad_norm": 5.125703811645508, "learning_rate": 1.5589304812834227e-05, "loss": 0.18655644357204437, "num_input_tokens_seen": 1077670, "step": 1037, "train_runtime": 2500.7785, "train_tokens_per_second": 430.934 }, { "epoch": 0.4436371407201624, "grad_norm": 2.39841628074646, "learning_rate": 1.5585026737967916e-05, "loss": 0.11417564749717712, "num_input_tokens_seen": 1079310, "step": 1038, "train_runtime": 2503.0452, "train_tokens_per_second": 431.199 }, { "epoch": 0.4440645368094882, "grad_norm": 3.2729265689849854, "learning_rate": 1.5580748663101606e-05, "loss": 0.13362637162208557, "num_input_tokens_seen": 1080016, "step": 1039, "train_runtime": 2504.9995, "train_tokens_per_second": 431.144 }, { "epoch": 0.444491932898814, "grad_norm": 2.726480007171631, "learning_rate": 1.5576470588235295e-05, "loss": 0.14196565747261047, "num_input_tokens_seen": 1080900, "step": 1040, "train_runtime": 2507.0937, "train_tokens_per_second": 431.137 }, { "epoch": 0.44491932898813974, "grad_norm": 3.0665643215179443, "learning_rate": 1.5572192513368985e-05, "loss": 0.1690657138824463, "num_input_tokens_seen": 1082256, "step": 1041, "train_runtime": 2509.2713, "train_tokens_per_second": 431.303 }, { "epoch": 0.44534672507746553, "grad_norm": 2.6255617141723633, "learning_rate": 1.5567914438502677e-05, "loss": 0.11941884458065033, "num_input_tokens_seen": 1083402, "step": 1042, "train_runtime": 2511.3705, "train_tokens_per_second": 431.399 }, { "epoch": 0.4457741211667913, "grad_norm": 4.067086219787598, "learning_rate": 1.5563636363636367e-05, "loss": 0.1705426424741745, "num_input_tokens_seen": 1084648, "step": 1043, "train_runtime": 2513.4912, "train_tokens_per_second": 431.53 }, { "epoch": 0.4462015172561171, "grad_norm": 2.9490678310394287, "learning_rate": 1.5559358288770053e-05, "loss": 0.17178130149841309, "num_input_tokens_seen": 1085474, "step": 1044, "train_runtime": 2515.536, "train_tokens_per_second": 431.508 }, { "epoch": 0.4466289133454429, "grad_norm": 3.8613905906677246, "learning_rate": 1.5555080213903742e-05, "loss": 0.12446797639131546, "num_input_tokens_seen": 1086270, "step": 1045, "train_runtime": 2517.5803, "train_tokens_per_second": 431.474 }, { "epoch": 0.44705630943476865, "grad_norm": 3.081756830215454, "learning_rate": 1.5550802139037435e-05, "loss": 0.11352714896202087, "num_input_tokens_seen": 1086938, "step": 1046, "train_runtime": 2519.5362, "train_tokens_per_second": 431.404 }, { "epoch": 0.44748370552409444, "grad_norm": 5.03386926651001, "learning_rate": 1.5546524064171125e-05, "loss": 0.19863486289978027, "num_input_tokens_seen": 1087992, "step": 1047, "train_runtime": 2521.6272, "train_tokens_per_second": 431.464 }, { "epoch": 0.44791110161342024, "grad_norm": 2.281496286392212, "learning_rate": 1.5542245989304814e-05, "loss": 0.07257408648729324, "num_input_tokens_seen": 1088910, "step": 1048, "train_runtime": 2523.7002, "train_tokens_per_second": 431.474 }, { "epoch": 0.44833849770274603, "grad_norm": 2.7421557903289795, "learning_rate": 1.5537967914438503e-05, "loss": 0.11143845319747925, "num_input_tokens_seen": 1090138, "step": 1049, "train_runtime": 2525.8293, "train_tokens_per_second": 431.596 }, { "epoch": 0.4487658937920718, "grad_norm": 3.2605109214782715, "learning_rate": 1.5533689839572196e-05, "loss": 0.1240977793931961, "num_input_tokens_seen": 1091126, "step": 1050, "train_runtime": 2527.8936, "train_tokens_per_second": 431.634 }, { "epoch": 0.44919328988139756, "grad_norm": 4.209699630737305, "learning_rate": 1.5529411764705882e-05, "loss": 0.21886172890663147, "num_input_tokens_seen": 1092242, "step": 1051, "train_runtime": 2536.5567, "train_tokens_per_second": 430.6 }, { "epoch": 0.44962068597072335, "grad_norm": 2.4231152534484863, "learning_rate": 1.5525133689839572e-05, "loss": 0.12536178529262543, "num_input_tokens_seen": 1093496, "step": 1052, "train_runtime": 2538.6946, "train_tokens_per_second": 430.732 }, { "epoch": 0.45004808206004915, "grad_norm": 2.6356184482574463, "learning_rate": 1.552085561497326e-05, "loss": 0.1799614429473877, "num_input_tokens_seen": 1094654, "step": 1053, "train_runtime": 2540.8711, "train_tokens_per_second": 430.818 }, { "epoch": 0.45047547814937494, "grad_norm": 2.4675352573394775, "learning_rate": 1.5516577540106954e-05, "loss": 0.10288633406162262, "num_input_tokens_seen": 1095680, "step": 1054, "train_runtime": 2542.961, "train_tokens_per_second": 430.868 }, { "epoch": 0.45090287423870073, "grad_norm": 2.2310800552368164, "learning_rate": 1.5512299465240644e-05, "loss": 0.1007671132683754, "num_input_tokens_seen": 1097010, "step": 1055, "train_runtime": 2545.1425, "train_tokens_per_second": 431.021 }, { "epoch": 0.4513302703280265, "grad_norm": 3.2314248085021973, "learning_rate": 1.5508021390374333e-05, "loss": 0.2237885594367981, "num_input_tokens_seen": 1098134, "step": 1056, "train_runtime": 2547.2799, "train_tokens_per_second": 431.101 }, { "epoch": 0.45175766641735227, "grad_norm": 2.0864264965057373, "learning_rate": 1.5503743315508022e-05, "loss": 0.1292007714509964, "num_input_tokens_seen": 1099590, "step": 1057, "train_runtime": 2549.4666, "train_tokens_per_second": 431.302 }, { "epoch": 0.45218506250667806, "grad_norm": 1.9484848976135254, "learning_rate": 1.5499465240641712e-05, "loss": 0.11468847841024399, "num_input_tokens_seen": 1100842, "step": 1058, "train_runtime": 2551.6175, "train_tokens_per_second": 431.429 }, { "epoch": 0.45261245859600385, "grad_norm": 2.9358811378479004, "learning_rate": 1.54951871657754e-05, "loss": 0.2071388214826584, "num_input_tokens_seen": 1102114, "step": 1059, "train_runtime": 2553.7753, "train_tokens_per_second": 431.563 }, { "epoch": 0.45303985468532965, "grad_norm": 3.30251145362854, "learning_rate": 1.549090909090909e-05, "loss": 0.20812180638313293, "num_input_tokens_seen": 1103470, "step": 1060, "train_runtime": 2555.9323, "train_tokens_per_second": 431.729 }, { "epoch": 0.45346725077465544, "grad_norm": 2.4831864833831787, "learning_rate": 1.548663101604278e-05, "loss": 0.14195820689201355, "num_input_tokens_seen": 1104796, "step": 1061, "train_runtime": 2558.1064, "train_tokens_per_second": 431.88 }, { "epoch": 0.4538946468639812, "grad_norm": 3.6319377422332764, "learning_rate": 1.5482352941176473e-05, "loss": 0.13811862468719482, "num_input_tokens_seen": 1105546, "step": 1062, "train_runtime": 2560.0693, "train_tokens_per_second": 431.842 }, { "epoch": 0.45432204295330697, "grad_norm": 2.107161283493042, "learning_rate": 1.5478074866310162e-05, "loss": 0.10408823937177658, "num_input_tokens_seen": 1106758, "step": 1063, "train_runtime": 2562.2012, "train_tokens_per_second": 431.956 }, { "epoch": 0.45474943904263276, "grad_norm": 3.1638989448547363, "learning_rate": 1.5473796791443852e-05, "loss": 0.15363234281539917, "num_input_tokens_seen": 1107616, "step": 1064, "train_runtime": 2564.2235, "train_tokens_per_second": 431.95 }, { "epoch": 0.45517683513195856, "grad_norm": 7.830322265625, "learning_rate": 1.546951871657754e-05, "loss": 0.1365651786327362, "num_input_tokens_seen": 1108174, "step": 1065, "train_runtime": 2566.1901, "train_tokens_per_second": 431.836 }, { "epoch": 0.45560423122128435, "grad_norm": 3.503216505050659, "learning_rate": 1.546524064171123e-05, "loss": 0.2846662402153015, "num_input_tokens_seen": 1109014, "step": 1066, "train_runtime": 2568.2761, "train_tokens_per_second": 431.813 }, { "epoch": 0.4560316273106101, "grad_norm": 3.514633893966675, "learning_rate": 1.546096256684492e-05, "loss": 0.19525128602981567, "num_input_tokens_seen": 1110314, "step": 1067, "train_runtime": 2570.4397, "train_tokens_per_second": 431.955 }, { "epoch": 0.4564590233999359, "grad_norm": 2.669102191925049, "learning_rate": 1.545668449197861e-05, "loss": 0.14375221729278564, "num_input_tokens_seen": 1111590, "step": 1068, "train_runtime": 2572.591, "train_tokens_per_second": 432.09 }, { "epoch": 0.4568864194892617, "grad_norm": 3.464954137802124, "learning_rate": 1.54524064171123e-05, "loss": 0.13595668971538544, "num_input_tokens_seen": 1112282, "step": 1069, "train_runtime": 2574.593, "train_tokens_per_second": 432.022 }, { "epoch": 0.45731381557858747, "grad_norm": 1.8810628652572632, "learning_rate": 1.5448128342245992e-05, "loss": 0.08300885558128357, "num_input_tokens_seen": 1113702, "step": 1070, "train_runtime": 2576.7576, "train_tokens_per_second": 432.211 }, { "epoch": 0.45774121166791326, "grad_norm": 2.5656237602233887, "learning_rate": 1.544385026737968e-05, "loss": 0.11466950923204422, "num_input_tokens_seen": 1114542, "step": 1071, "train_runtime": 2578.8251, "train_tokens_per_second": 432.19 }, { "epoch": 0.458168607757239, "grad_norm": 3.370588779449463, "learning_rate": 1.543957219251337e-05, "loss": 0.18732677400112152, "num_input_tokens_seen": 1115466, "step": 1072, "train_runtime": 2580.9135, "train_tokens_per_second": 432.198 }, { "epoch": 0.4585960038465648, "grad_norm": 3.3462183475494385, "learning_rate": 1.543529411764706e-05, "loss": 0.14999401569366455, "num_input_tokens_seen": 1116862, "step": 1073, "train_runtime": 2583.0996, "train_tokens_per_second": 432.373 }, { "epoch": 0.4590233999358906, "grad_norm": 2.879754066467285, "learning_rate": 1.543101604278075e-05, "loss": 0.13676685094833374, "num_input_tokens_seen": 1117870, "step": 1074, "train_runtime": 2585.1904, "train_tokens_per_second": 432.413 }, { "epoch": 0.4594507960252164, "grad_norm": 3.713593006134033, "learning_rate": 1.542673796791444e-05, "loss": 0.18806308507919312, "num_input_tokens_seen": 1118678, "step": 1075, "train_runtime": 2587.2352, "train_tokens_per_second": 432.384 }, { "epoch": 0.4598781921145422, "grad_norm": 3.257934093475342, "learning_rate": 1.542245989304813e-05, "loss": 0.17128415405750275, "num_input_tokens_seen": 1119906, "step": 1076, "train_runtime": 2589.3376, "train_tokens_per_second": 432.507 }, { "epoch": 0.4603055882038679, "grad_norm": 2.9704718589782715, "learning_rate": 1.5418181818181818e-05, "loss": 0.1316772848367691, "num_input_tokens_seen": 1120874, "step": 1077, "train_runtime": 2591.4121, "train_tokens_per_second": 432.534 }, { "epoch": 0.4607329842931937, "grad_norm": 3.433804750442505, "learning_rate": 1.541390374331551e-05, "loss": 0.17128492891788483, "num_input_tokens_seen": 1122506, "step": 1078, "train_runtime": 2593.6091, "train_tokens_per_second": 432.797 }, { "epoch": 0.4611603803825195, "grad_norm": 2.7072598934173584, "learning_rate": 1.54096256684492e-05, "loss": 0.08850735425949097, "num_input_tokens_seen": 1123354, "step": 1079, "train_runtime": 2595.6782, "train_tokens_per_second": 432.779 }, { "epoch": 0.4615877764718453, "grad_norm": 2.266479253768921, "learning_rate": 1.540534759358289e-05, "loss": 0.10116958618164062, "num_input_tokens_seen": 1124486, "step": 1080, "train_runtime": 2597.7872, "train_tokens_per_second": 432.863 }, { "epoch": 0.4620151725611711, "grad_norm": 3.3960344791412354, "learning_rate": 1.540106951871658e-05, "loss": 0.1324056088924408, "num_input_tokens_seen": 1125286, "step": 1081, "train_runtime": 2606.5205, "train_tokens_per_second": 431.72 }, { "epoch": 0.4624425686504968, "grad_norm": 3.4813549518585205, "learning_rate": 1.539679144385027e-05, "loss": 0.13071005046367645, "num_input_tokens_seen": 1126018, "step": 1082, "train_runtime": 2608.5292, "train_tokens_per_second": 431.668 }, { "epoch": 0.4628699647398226, "grad_norm": 2.5402848720550537, "learning_rate": 1.5392513368983958e-05, "loss": 0.11979816854000092, "num_input_tokens_seen": 1127760, "step": 1083, "train_runtime": 2610.7841, "train_tokens_per_second": 431.962 }, { "epoch": 0.4632973608291484, "grad_norm": 3.59625244140625, "learning_rate": 1.5388235294117648e-05, "loss": 0.1375684142112732, "num_input_tokens_seen": 1128962, "step": 1084, "train_runtime": 2612.9241, "train_tokens_per_second": 432.068 }, { "epoch": 0.4637247569184742, "grad_norm": 3.143054246902466, "learning_rate": 1.5383957219251337e-05, "loss": 0.15120042860507965, "num_input_tokens_seen": 1129876, "step": 1085, "train_runtime": 2614.9657, "train_tokens_per_second": 432.081 }, { "epoch": 0.4641521530078, "grad_norm": 2.635488510131836, "learning_rate": 1.537967914438503e-05, "loss": 0.10741516947746277, "num_input_tokens_seen": 1130876, "step": 1086, "train_runtime": 2617.0489, "train_tokens_per_second": 432.119 }, { "epoch": 0.4645795490971258, "grad_norm": 3.1969196796417236, "learning_rate": 1.537540106951872e-05, "loss": 0.17901310324668884, "num_input_tokens_seen": 1131882, "step": 1087, "train_runtime": 2619.0932, "train_tokens_per_second": 432.166 }, { "epoch": 0.4650069451864515, "grad_norm": 4.070721626281738, "learning_rate": 1.537112299465241e-05, "loss": 0.16284756362438202, "num_input_tokens_seen": 1132664, "step": 1088, "train_runtime": 2621.146, "train_tokens_per_second": 432.125 }, { "epoch": 0.4654343412757773, "grad_norm": 2.8047432899475098, "learning_rate": 1.5366844919786098e-05, "loss": 0.1308150589466095, "num_input_tokens_seen": 1133980, "step": 1089, "train_runtime": 2623.3297, "train_tokens_per_second": 432.267 }, { "epoch": 0.4658617373651031, "grad_norm": 2.700371742248535, "learning_rate": 1.5362566844919788e-05, "loss": 0.060718096792697906, "num_input_tokens_seen": 1134990, "step": 1090, "train_runtime": 2625.3968, "train_tokens_per_second": 432.312 }, { "epoch": 0.4662891334544289, "grad_norm": 2.8845772743225098, "learning_rate": 1.5358288770053477e-05, "loss": 0.1135871410369873, "num_input_tokens_seen": 1135714, "step": 1091, "train_runtime": 2627.3711, "train_tokens_per_second": 432.263 }, { "epoch": 0.4667165295437547, "grad_norm": 3.114514112472534, "learning_rate": 1.5354010695187167e-05, "loss": 0.1570318341255188, "num_input_tokens_seen": 1136538, "step": 1092, "train_runtime": 2629.3806, "train_tokens_per_second": 432.246 }, { "epoch": 0.46714392563308044, "grad_norm": 3.0474343299865723, "learning_rate": 1.5349732620320856e-05, "loss": 0.147725448012352, "num_input_tokens_seen": 1137472, "step": 1093, "train_runtime": 2631.5313, "train_tokens_per_second": 432.247 }, { "epoch": 0.46757132172240623, "grad_norm": 4.396843910217285, "learning_rate": 1.5345454545454545e-05, "loss": 0.17232832312583923, "num_input_tokens_seen": 1138134, "step": 1094, "train_runtime": 2633.5612, "train_tokens_per_second": 432.165 }, { "epoch": 0.467998717811732, "grad_norm": 2.4748077392578125, "learning_rate": 1.5341176470588238e-05, "loss": 0.15381349623203278, "num_input_tokens_seen": 1139682, "step": 1095, "train_runtime": 2635.8125, "train_tokens_per_second": 432.384 }, { "epoch": 0.4684261139010578, "grad_norm": 3.068317413330078, "learning_rate": 1.5336898395721928e-05, "loss": 0.10474956035614014, "num_input_tokens_seen": 1140220, "step": 1096, "train_runtime": 2637.7737, "train_tokens_per_second": 432.266 }, { "epoch": 0.4688535099903836, "grad_norm": 3.164912223815918, "learning_rate": 1.5332620320855617e-05, "loss": 0.20970091223716736, "num_input_tokens_seen": 1141284, "step": 1097, "train_runtime": 2639.8805, "train_tokens_per_second": 432.324 }, { "epoch": 0.46928090607970935, "grad_norm": 2.8378591537475586, "learning_rate": 1.5328342245989307e-05, "loss": 0.16146932542324066, "num_input_tokens_seen": 1142276, "step": 1098, "train_runtime": 2641.9333, "train_tokens_per_second": 432.364 }, { "epoch": 0.46970830216903514, "grad_norm": 1.890136957168579, "learning_rate": 1.5324064171122996e-05, "loss": 0.1063518226146698, "num_input_tokens_seen": 1143250, "step": 1099, "train_runtime": 2644.0071, "train_tokens_per_second": 432.393 }, { "epoch": 0.47013569825836093, "grad_norm": 2.5111641883850098, "learning_rate": 1.5319786096256686e-05, "loss": 0.130143940448761, "num_input_tokens_seen": 1144518, "step": 1100, "train_runtime": 2646.1267, "train_tokens_per_second": 432.526 }, { "epoch": 0.47056309434768673, "grad_norm": 5.517326831817627, "learning_rate": 1.5315508021390375e-05, "loss": 0.1228143498301506, "num_input_tokens_seen": 1145362, "step": 1101, "train_runtime": 2648.1678, "train_tokens_per_second": 432.511 }, { "epoch": 0.4709904904370125, "grad_norm": 3.1789982318878174, "learning_rate": 1.5311229946524064e-05, "loss": 0.14044930040836334, "num_input_tokens_seen": 1146036, "step": 1102, "train_runtime": 2650.1478, "train_tokens_per_second": 432.442 }, { "epoch": 0.47141788652633826, "grad_norm": 3.9956135749816895, "learning_rate": 1.5306951871657757e-05, "loss": 0.20187225937843323, "num_input_tokens_seen": 1146846, "step": 1103, "train_runtime": 2652.1751, "train_tokens_per_second": 432.417 }, { "epoch": 0.47184528261566405, "grad_norm": 2.8002490997314453, "learning_rate": 1.5302673796791447e-05, "loss": 0.10556461662054062, "num_input_tokens_seen": 1147790, "step": 1104, "train_runtime": 2654.2198, "train_tokens_per_second": 432.44 }, { "epoch": 0.47227267870498985, "grad_norm": 4.445836067199707, "learning_rate": 1.5298395721925136e-05, "loss": 0.17272546887397766, "num_input_tokens_seen": 1148852, "step": 1105, "train_runtime": 2656.2914, "train_tokens_per_second": 432.502 }, { "epoch": 0.47270007479431564, "grad_norm": 2.8741371631622314, "learning_rate": 1.5294117647058822e-05, "loss": 0.1411958634853363, "num_input_tokens_seen": 1149814, "step": 1106, "train_runtime": 2658.3826, "train_tokens_per_second": 432.524 }, { "epoch": 0.47312747088364143, "grad_norm": 2.783771276473999, "learning_rate": 1.5289839572192515e-05, "loss": 0.18507781624794006, "num_input_tokens_seen": 1150958, "step": 1107, "train_runtime": 2660.5235, "train_tokens_per_second": 432.606 }, { "epoch": 0.47355486697296717, "grad_norm": 3.2462594509124756, "learning_rate": 1.5285561497326204e-05, "loss": 0.11716610938310623, "num_input_tokens_seen": 1152078, "step": 1108, "train_runtime": 2662.6088, "train_tokens_per_second": 432.688 }, { "epoch": 0.47398226306229296, "grad_norm": 3.969907283782959, "learning_rate": 1.5281283422459894e-05, "loss": 0.1353527307510376, "num_input_tokens_seen": 1153404, "step": 1109, "train_runtime": 2664.7814, "train_tokens_per_second": 432.832 }, { "epoch": 0.47440965915161876, "grad_norm": 3.9630134105682373, "learning_rate": 1.5277005347593583e-05, "loss": 0.2100336104631424, "num_input_tokens_seen": 1154246, "step": 1110, "train_runtime": 2666.823, "train_tokens_per_second": 432.817 }, { "epoch": 0.47483705524094455, "grad_norm": 4.457049369812012, "learning_rate": 1.5272727272727276e-05, "loss": 0.24514269828796387, "num_input_tokens_seen": 1155348, "step": 1111, "train_runtime": 2675.5169, "train_tokens_per_second": 431.822 }, { "epoch": 0.47526445133027034, "grad_norm": 2.624235153198242, "learning_rate": 1.5268449197860962e-05, "loss": 0.10719535499811172, "num_input_tokens_seen": 1156148, "step": 1112, "train_runtime": 2677.5034, "train_tokens_per_second": 431.801 }, { "epoch": 0.47569184741959614, "grad_norm": 3.359612226486206, "learning_rate": 1.5264171122994652e-05, "loss": 0.15921300649642944, "num_input_tokens_seen": 1156964, "step": 1113, "train_runtime": 2679.5169, "train_tokens_per_second": 431.781 }, { "epoch": 0.4761192435089219, "grad_norm": 2.3543784618377686, "learning_rate": 1.525989304812834e-05, "loss": 0.09240389615297318, "num_input_tokens_seen": 1157788, "step": 1114, "train_runtime": 2681.5775, "train_tokens_per_second": 431.756 }, { "epoch": 0.47654663959824767, "grad_norm": 2.728663206100464, "learning_rate": 1.5255614973262034e-05, "loss": 0.10826657712459564, "num_input_tokens_seen": 1159104, "step": 1115, "train_runtime": 2683.7424, "train_tokens_per_second": 431.898 }, { "epoch": 0.47697403568757346, "grad_norm": 2.6188294887542725, "learning_rate": 1.5251336898395723e-05, "loss": 0.0742989256978035, "num_input_tokens_seen": 1160388, "step": 1116, "train_runtime": 2685.9199, "train_tokens_per_second": 432.026 }, { "epoch": 0.47740143177689925, "grad_norm": 3.8709871768951416, "learning_rate": 1.5247058823529413e-05, "loss": 0.16443318128585815, "num_input_tokens_seen": 1161552, "step": 1117, "train_runtime": 2688.0382, "train_tokens_per_second": 432.119 }, { "epoch": 0.47782882786622505, "grad_norm": 4.712742328643799, "learning_rate": 1.5242780748663102e-05, "loss": 0.24033494293689728, "num_input_tokens_seen": 1162296, "step": 1118, "train_runtime": 2690.0499, "train_tokens_per_second": 432.072 }, { "epoch": 0.4782562239555508, "grad_norm": 2.0754475593566895, "learning_rate": 1.5238502673796793e-05, "loss": 0.07046375423669815, "num_input_tokens_seen": 1163414, "step": 1119, "train_runtime": 2692.1436, "train_tokens_per_second": 432.152 }, { "epoch": 0.4786836200448766, "grad_norm": 3.374993324279785, "learning_rate": 1.5234224598930483e-05, "loss": 0.1427287757396698, "num_input_tokens_seen": 1164268, "step": 1120, "train_runtime": 2694.1787, "train_tokens_per_second": 432.142 }, { "epoch": 0.47911101613420237, "grad_norm": 4.995404243469238, "learning_rate": 1.5229946524064172e-05, "loss": 0.1521342247724533, "num_input_tokens_seen": 1164864, "step": 1121, "train_runtime": 2696.1585, "train_tokens_per_second": 432.046 }, { "epoch": 0.47953841222352817, "grad_norm": 2.663304328918457, "learning_rate": 1.5225668449197862e-05, "loss": 0.12766656279563904, "num_input_tokens_seen": 1165722, "step": 1122, "train_runtime": 2698.2046, "train_tokens_per_second": 432.036 }, { "epoch": 0.47996580831285396, "grad_norm": 3.3409948348999023, "learning_rate": 1.5221390374331553e-05, "loss": 0.18630322813987732, "num_input_tokens_seen": 1166924, "step": 1123, "train_runtime": 2700.3715, "train_tokens_per_second": 432.135 }, { "epoch": 0.4803932044021797, "grad_norm": 3.103919267654419, "learning_rate": 1.5217112299465242e-05, "loss": 0.10242228955030441, "num_input_tokens_seen": 1168254, "step": 1124, "train_runtime": 2702.5499, "train_tokens_per_second": 432.278 }, { "epoch": 0.4808206004915055, "grad_norm": 4.313792705535889, "learning_rate": 1.5212834224598932e-05, "loss": 0.15389426052570343, "num_input_tokens_seen": 1168950, "step": 1125, "train_runtime": 2704.5885, "train_tokens_per_second": 432.21 }, { "epoch": 0.4812479965808313, "grad_norm": 2.292739152908325, "learning_rate": 1.5208556149732621e-05, "loss": 0.08169770240783691, "num_input_tokens_seen": 1169718, "step": 1126, "train_runtime": 2706.5988, "train_tokens_per_second": 432.173 }, { "epoch": 0.4816753926701571, "grad_norm": 2.8973989486694336, "learning_rate": 1.5204278074866312e-05, "loss": 0.10626824200153351, "num_input_tokens_seen": 1171080, "step": 1127, "train_runtime": 2708.7664, "train_tokens_per_second": 432.33 }, { "epoch": 0.48210278875948287, "grad_norm": 3.474763870239258, "learning_rate": 1.5200000000000002e-05, "loss": 0.2161523699760437, "num_input_tokens_seen": 1171958, "step": 1128, "train_runtime": 2710.8134, "train_tokens_per_second": 432.327 }, { "epoch": 0.4825301848488086, "grad_norm": 3.202106475830078, "learning_rate": 1.5195721925133691e-05, "loss": 0.1991758793592453, "num_input_tokens_seen": 1173202, "step": 1129, "train_runtime": 2712.9734, "train_tokens_per_second": 432.441 }, { "epoch": 0.4829575809381344, "grad_norm": 4.2022809982299805, "learning_rate": 1.519144385026738e-05, "loss": 0.2232508510351181, "num_input_tokens_seen": 1173970, "step": 1130, "train_runtime": 2715.0167, "train_tokens_per_second": 432.399 }, { "epoch": 0.4833849770274602, "grad_norm": 2.7030551433563232, "learning_rate": 1.5187165775401072e-05, "loss": 0.08495761454105377, "num_input_tokens_seen": 1174890, "step": 1131, "train_runtime": 2717.114, "train_tokens_per_second": 432.404 }, { "epoch": 0.483812373116786, "grad_norm": 3.4785704612731934, "learning_rate": 1.5182887700534761e-05, "loss": 0.1914873868227005, "num_input_tokens_seen": 1175908, "step": 1132, "train_runtime": 2719.2131, "train_tokens_per_second": 432.444 }, { "epoch": 0.4842397692061118, "grad_norm": 3.721217632293701, "learning_rate": 1.517860962566845e-05, "loss": 0.16007255017757416, "num_input_tokens_seen": 1176818, "step": 1133, "train_runtime": 2721.2342, "train_tokens_per_second": 432.457 }, { "epoch": 0.4846671652954376, "grad_norm": 2.4107444286346436, "learning_rate": 1.517433155080214e-05, "loss": 0.12073090672492981, "num_input_tokens_seen": 1178280, "step": 1134, "train_runtime": 2723.4186, "train_tokens_per_second": 432.647 }, { "epoch": 0.4850945613847633, "grad_norm": 3.2907817363739014, "learning_rate": 1.5170053475935831e-05, "loss": 0.13351722061634064, "num_input_tokens_seen": 1179326, "step": 1135, "train_runtime": 2725.4962, "train_tokens_per_second": 432.701 }, { "epoch": 0.4855219574740891, "grad_norm": 3.914668560028076, "learning_rate": 1.516577540106952e-05, "loss": 0.1750204861164093, "num_input_tokens_seen": 1180014, "step": 1136, "train_runtime": 2727.4869, "train_tokens_per_second": 432.638 }, { "epoch": 0.4859493535634149, "grad_norm": 2.2116777896881104, "learning_rate": 1.516149732620321e-05, "loss": 0.12250398099422455, "num_input_tokens_seen": 1180960, "step": 1137, "train_runtime": 2729.5648, "train_tokens_per_second": 432.655 }, { "epoch": 0.4863767496527407, "grad_norm": 4.321115970611572, "learning_rate": 1.5157219251336898e-05, "loss": 0.21933779120445251, "num_input_tokens_seen": 1182068, "step": 1138, "train_runtime": 2731.6408, "train_tokens_per_second": 432.732 }, { "epoch": 0.4868041457420665, "grad_norm": 3.981973171234131, "learning_rate": 1.515294117647059e-05, "loss": 0.217737078666687, "num_input_tokens_seen": 1183120, "step": 1139, "train_runtime": 2733.7497, "train_tokens_per_second": 432.783 }, { "epoch": 0.4872315418313922, "grad_norm": 2.112104892730713, "learning_rate": 1.514866310160428e-05, "loss": 0.10334925353527069, "num_input_tokens_seen": 1183972, "step": 1140, "train_runtime": 2735.774, "train_tokens_per_second": 432.774 }, { "epoch": 0.487658937920718, "grad_norm": 2.6317176818847656, "learning_rate": 1.5144385026737968e-05, "loss": 0.13040843605995178, "num_input_tokens_seen": 1185140, "step": 1141, "train_runtime": 2744.1302, "train_tokens_per_second": 431.882 }, { "epoch": 0.4880863340100438, "grad_norm": 3.8773531913757324, "learning_rate": 1.5140106951871657e-05, "loss": 0.19817647337913513, "num_input_tokens_seen": 1185734, "step": 1142, "train_runtime": 2746.1518, "train_tokens_per_second": 431.78 }, { "epoch": 0.4885137300993696, "grad_norm": 2.8795385360717773, "learning_rate": 1.513582887700535e-05, "loss": 0.11026828736066818, "num_input_tokens_seen": 1186790, "step": 1143, "train_runtime": 2748.2465, "train_tokens_per_second": 431.835 }, { "epoch": 0.4889411261886954, "grad_norm": 3.0057780742645264, "learning_rate": 1.513155080213904e-05, "loss": 0.14564253389835358, "num_input_tokens_seen": 1188504, "step": 1144, "train_runtime": 2750.4822, "train_tokens_per_second": 432.107 }, { "epoch": 0.48936852227802113, "grad_norm": 3.8096261024475098, "learning_rate": 1.5127272727272728e-05, "loss": 0.1662902534008026, "num_input_tokens_seen": 1189264, "step": 1145, "train_runtime": 2752.5067, "train_tokens_per_second": 432.066 }, { "epoch": 0.4897959183673469, "grad_norm": 2.5535879135131836, "learning_rate": 1.5122994652406417e-05, "loss": 0.1270386278629303, "num_input_tokens_seen": 1190702, "step": 1146, "train_runtime": 2754.7312, "train_tokens_per_second": 432.239 }, { "epoch": 0.4902233144566727, "grad_norm": 2.360358238220215, "learning_rate": 1.511871657754011e-05, "loss": 0.08077384531497955, "num_input_tokens_seen": 1191380, "step": 1147, "train_runtime": 2756.7204, "train_tokens_per_second": 432.173 }, { "epoch": 0.4906507105459985, "grad_norm": 2.111539363861084, "learning_rate": 1.5114438502673798e-05, "loss": 0.09322850406169891, "num_input_tokens_seen": 1192598, "step": 1148, "train_runtime": 2758.8433, "train_tokens_per_second": 432.282 }, { "epoch": 0.4910781066353243, "grad_norm": 3.5963425636291504, "learning_rate": 1.5110160427807487e-05, "loss": 0.12126210331916809, "num_input_tokens_seen": 1193422, "step": 1149, "train_runtime": 2760.9023, "train_tokens_per_second": 432.258 }, { "epoch": 0.49150550272465005, "grad_norm": 2.635592222213745, "learning_rate": 1.5105882352941176e-05, "loss": 0.1305210292339325, "num_input_tokens_seen": 1194250, "step": 1150, "train_runtime": 2762.925, "train_tokens_per_second": 432.241 }, { "epoch": 0.49193289881397584, "grad_norm": 2.4423794746398926, "learning_rate": 1.5101604278074868e-05, "loss": 0.09712070971727371, "num_input_tokens_seen": 1195288, "step": 1151, "train_runtime": 2765.0006, "train_tokens_per_second": 432.292 }, { "epoch": 0.49236029490330163, "grad_norm": 2.4243600368499756, "learning_rate": 1.5097326203208557e-05, "loss": 0.13342250883579254, "num_input_tokens_seen": 1196658, "step": 1152, "train_runtime": 2767.1455, "train_tokens_per_second": 432.452 }, { "epoch": 0.4927876909926274, "grad_norm": 2.272446870803833, "learning_rate": 1.5093048128342246e-05, "loss": 0.1295868456363678, "num_input_tokens_seen": 1197858, "step": 1153, "train_runtime": 2769.2727, "train_tokens_per_second": 432.553 }, { "epoch": 0.4932150870819532, "grad_norm": 3.037247896194458, "learning_rate": 1.5088770053475936e-05, "loss": 0.10061538964509964, "num_input_tokens_seen": 1198460, "step": 1154, "train_runtime": 2771.4284, "train_tokens_per_second": 432.434 }, { "epoch": 0.49364248317127896, "grad_norm": 2.932354211807251, "learning_rate": 1.5084491978609627e-05, "loss": 0.14099803566932678, "num_input_tokens_seen": 1199602, "step": 1155, "train_runtime": 2773.5479, "train_tokens_per_second": 432.515 }, { "epoch": 0.49406987926060475, "grad_norm": 3.6686477661132812, "learning_rate": 1.5080213903743316e-05, "loss": 0.13770988583564758, "num_input_tokens_seen": 1200682, "step": 1156, "train_runtime": 2775.6376, "train_tokens_per_second": 432.579 }, { "epoch": 0.49449727534993054, "grad_norm": 2.9927093982696533, "learning_rate": 1.5075935828877006e-05, "loss": 0.1364351361989975, "num_input_tokens_seen": 1201562, "step": 1157, "train_runtime": 2777.6922, "train_tokens_per_second": 432.576 }, { "epoch": 0.49492467143925634, "grad_norm": 2.8519723415374756, "learning_rate": 1.5071657754010695e-05, "loss": 0.09951236099004745, "num_input_tokens_seen": 1202292, "step": 1158, "train_runtime": 2779.7434, "train_tokens_per_second": 432.519 }, { "epoch": 0.49535206752858213, "grad_norm": 4.1219964027404785, "learning_rate": 1.5067379679144387e-05, "loss": 0.24936291575431824, "num_input_tokens_seen": 1203078, "step": 1159, "train_runtime": 2781.7782, "train_tokens_per_second": 432.485 }, { "epoch": 0.4957794636179079, "grad_norm": 3.9951977729797363, "learning_rate": 1.5063101604278076e-05, "loss": 0.20271098613739014, "num_input_tokens_seen": 1204314, "step": 1160, "train_runtime": 2783.9284, "train_tokens_per_second": 432.595 }, { "epoch": 0.49620685970723366, "grad_norm": 2.3672826290130615, "learning_rate": 1.5058823529411765e-05, "loss": 0.14124973118305206, "num_input_tokens_seen": 1205414, "step": 1161, "train_runtime": 2786.0063, "train_tokens_per_second": 432.667 }, { "epoch": 0.49663425579655945, "grad_norm": 2.570695638656616, "learning_rate": 1.5054545454545455e-05, "loss": 0.10842475295066833, "num_input_tokens_seen": 1206124, "step": 1162, "train_runtime": 2788.0188, "train_tokens_per_second": 432.61 }, { "epoch": 0.49706165188588525, "grad_norm": 3.4628758430480957, "learning_rate": 1.5050267379679146e-05, "loss": 0.20646989345550537, "num_input_tokens_seen": 1207038, "step": 1163, "train_runtime": 2790.1003, "train_tokens_per_second": 432.615 }, { "epoch": 0.49748904797521104, "grad_norm": 3.9845736026763916, "learning_rate": 1.5045989304812835e-05, "loss": 0.18305808305740356, "num_input_tokens_seen": 1207746, "step": 1164, "train_runtime": 2792.079, "train_tokens_per_second": 432.562 }, { "epoch": 0.49791644406453683, "grad_norm": 2.352217197418213, "learning_rate": 1.5041711229946525e-05, "loss": 0.12100671231746674, "num_input_tokens_seen": 1208784, "step": 1165, "train_runtime": 2794.1257, "train_tokens_per_second": 432.616 }, { "epoch": 0.49834384015386257, "grad_norm": 2.5519676208496094, "learning_rate": 1.5037433155080214e-05, "loss": 0.1499929428100586, "num_input_tokens_seen": 1209892, "step": 1166, "train_runtime": 2796.2164, "train_tokens_per_second": 432.689 }, { "epoch": 0.49877123624318837, "grad_norm": 2.3918063640594482, "learning_rate": 1.5033155080213905e-05, "loss": 0.1183585524559021, "num_input_tokens_seen": 1210896, "step": 1167, "train_runtime": 2798.3089, "train_tokens_per_second": 432.724 }, { "epoch": 0.49919863233251416, "grad_norm": 3.267407178878784, "learning_rate": 1.5028877005347595e-05, "loss": 0.18828095495700836, "num_input_tokens_seen": 1211932, "step": 1168, "train_runtime": 2800.3926, "train_tokens_per_second": 432.772 }, { "epoch": 0.49962602842183995, "grad_norm": 1.88737952709198, "learning_rate": 1.5024598930481284e-05, "loss": 0.08741053938865662, "num_input_tokens_seen": 1213072, "step": 1169, "train_runtime": 2802.5118, "train_tokens_per_second": 432.852 }, { "epoch": 0.5000534245111657, "grad_norm": 2.6835086345672607, "learning_rate": 1.5020320855614974e-05, "loss": 0.12560200691223145, "num_input_tokens_seen": 1214044, "step": 1170, "train_runtime": 2804.6022, "train_tokens_per_second": 432.876 }, { "epoch": 0.5004808206004915, "grad_norm": 2.1941637992858887, "learning_rate": 1.5016042780748665e-05, "loss": 0.1008794829249382, "num_input_tokens_seen": 1215246, "step": 1171, "train_runtime": 2813.3537, "train_tokens_per_second": 431.956 }, { "epoch": 0.5009082166898173, "grad_norm": 3.1997156143188477, "learning_rate": 1.5011764705882354e-05, "loss": 0.20159912109375, "num_input_tokens_seen": 1216162, "step": 1172, "train_runtime": 2815.4394, "train_tokens_per_second": 431.962 }, { "epoch": 0.5013356127791431, "grad_norm": 2.143730640411377, "learning_rate": 1.5007486631016044e-05, "loss": 0.10188774019479752, "num_input_tokens_seen": 1218486, "step": 1173, "train_runtime": 2817.8827, "train_tokens_per_second": 432.412 }, { "epoch": 0.5017630088684688, "grad_norm": 2.7107653617858887, "learning_rate": 1.5003208556149733e-05, "loss": 0.17050811648368835, "num_input_tokens_seen": 1219380, "step": 1174, "train_runtime": 2819.9317, "train_tokens_per_second": 432.415 }, { "epoch": 0.5021904049577947, "grad_norm": 2.7906951904296875, "learning_rate": 1.4998930481283424e-05, "loss": 0.09755326062440872, "num_input_tokens_seen": 1219936, "step": 1175, "train_runtime": 2821.876, "train_tokens_per_second": 432.314 }, { "epoch": 0.5026178010471204, "grad_norm": 5.099658966064453, "learning_rate": 1.4994652406417114e-05, "loss": 0.24060800671577454, "num_input_tokens_seen": 1220910, "step": 1176, "train_runtime": 2823.9513, "train_tokens_per_second": 432.341 }, { "epoch": 0.5030451971364462, "grad_norm": 3.3546831607818604, "learning_rate": 1.4990374331550803e-05, "loss": 0.1906435191631317, "num_input_tokens_seen": 1221952, "step": 1177, "train_runtime": 2826.0428, "train_tokens_per_second": 432.39 }, { "epoch": 0.503472593225772, "grad_norm": 3.424024820327759, "learning_rate": 1.4986096256684493e-05, "loss": 0.2020358443260193, "num_input_tokens_seen": 1222912, "step": 1178, "train_runtime": 2828.1283, "train_tokens_per_second": 432.41 }, { "epoch": 0.5038999893150977, "grad_norm": 3.646613836288452, "learning_rate": 1.4981818181818184e-05, "loss": 0.2279026210308075, "num_input_tokens_seen": 1224156, "step": 1179, "train_runtime": 2830.2702, "train_tokens_per_second": 432.523 }, { "epoch": 0.5043273854044236, "grad_norm": 2.5153822898864746, "learning_rate": 1.4977540106951873e-05, "loss": 0.15767836570739746, "num_input_tokens_seen": 1225652, "step": 1180, "train_runtime": 2832.4461, "train_tokens_per_second": 432.719 }, { "epoch": 0.5047547814937493, "grad_norm": 4.689395427703857, "learning_rate": 1.4973262032085563e-05, "loss": 0.09848980605602264, "num_input_tokens_seen": 1227204, "step": 1181, "train_runtime": 2834.6759, "train_tokens_per_second": 432.926 }, { "epoch": 0.5051821775830752, "grad_norm": 2.905390977859497, "learning_rate": 1.4968983957219252e-05, "loss": 0.14566992223262787, "num_input_tokens_seen": 1228700, "step": 1182, "train_runtime": 2836.8944, "train_tokens_per_second": 433.114 }, { "epoch": 0.5056095736724009, "grad_norm": 2.8243939876556396, "learning_rate": 1.4964705882352943e-05, "loss": 0.12898750603199005, "num_input_tokens_seen": 1229644, "step": 1183, "train_runtime": 2838.9925, "train_tokens_per_second": 433.127 }, { "epoch": 0.5060369697617266, "grad_norm": 5.052365303039551, "learning_rate": 1.4960427807486633e-05, "loss": 0.22005364298820496, "num_input_tokens_seen": 1230508, "step": 1184, "train_runtime": 2841.046, "train_tokens_per_second": 433.118 }, { "epoch": 0.5064643658510525, "grad_norm": 2.562453269958496, "learning_rate": 1.4956149732620322e-05, "loss": 0.09847698360681534, "num_input_tokens_seen": 1231260, "step": 1185, "train_runtime": 2843.1161, "train_tokens_per_second": 433.067 }, { "epoch": 0.5068917619403782, "grad_norm": 3.255903720855713, "learning_rate": 1.4951871657754012e-05, "loss": 0.13542407751083374, "num_input_tokens_seen": 1232160, "step": 1186, "train_runtime": 2845.1369, "train_tokens_per_second": 433.076 }, { "epoch": 0.5073191580297041, "grad_norm": 3.189725875854492, "learning_rate": 1.4947593582887703e-05, "loss": 0.09219875186681747, "num_input_tokens_seen": 1233090, "step": 1187, "train_runtime": 2847.2089, "train_tokens_per_second": 433.087 }, { "epoch": 0.5077465541190298, "grad_norm": 2.5523719787597656, "learning_rate": 1.4943315508021392e-05, "loss": 0.1534418761730194, "num_input_tokens_seen": 1234300, "step": 1188, "train_runtime": 2849.3436, "train_tokens_per_second": 433.187 }, { "epoch": 0.5081739502083555, "grad_norm": 3.37165904045105, "learning_rate": 1.4939037433155082e-05, "loss": 0.12875303626060486, "num_input_tokens_seen": 1235186, "step": 1189, "train_runtime": 2851.397, "train_tokens_per_second": 433.186 }, { "epoch": 0.5086013462976814, "grad_norm": 2.39281964302063, "learning_rate": 1.4934759358288771e-05, "loss": 0.10504047572612762, "num_input_tokens_seen": 1236154, "step": 1190, "train_runtime": 2853.548, "train_tokens_per_second": 433.199 }, { "epoch": 0.5090287423870071, "grad_norm": 2.805588722229004, "learning_rate": 1.4930481283422462e-05, "loss": 0.16197718679904938, "num_input_tokens_seen": 1237918, "step": 1191, "train_runtime": 2855.8138, "train_tokens_per_second": 433.473 }, { "epoch": 0.509456138476333, "grad_norm": 4.094025611877441, "learning_rate": 1.4926203208556152e-05, "loss": 0.17036931216716766, "num_input_tokens_seen": 1238520, "step": 1192, "train_runtime": 2857.7931, "train_tokens_per_second": 433.383 }, { "epoch": 0.5098835345656587, "grad_norm": 4.176519870758057, "learning_rate": 1.4921925133689841e-05, "loss": 0.14350777864456177, "num_input_tokens_seen": 1239132, "step": 1193, "train_runtime": 2859.7843, "train_tokens_per_second": 433.296 }, { "epoch": 0.5103109306549845, "grad_norm": 5.641793727874756, "learning_rate": 1.491764705882353e-05, "loss": 0.24869948625564575, "num_input_tokens_seen": 1239858, "step": 1194, "train_runtime": 2861.8105, "train_tokens_per_second": 433.243 }, { "epoch": 0.5107383267443103, "grad_norm": 3.246270179748535, "learning_rate": 1.4913368983957222e-05, "loss": 0.14501456916332245, "num_input_tokens_seen": 1240696, "step": 1195, "train_runtime": 2863.8971, "train_tokens_per_second": 433.219 }, { "epoch": 0.511165722833636, "grad_norm": 2.838711738586426, "learning_rate": 1.4909090909090911e-05, "loss": 0.17654375731945038, "num_input_tokens_seen": 1242014, "step": 1196, "train_runtime": 2866.0444, "train_tokens_per_second": 433.355 }, { "epoch": 0.5115931189229619, "grad_norm": 2.7171852588653564, "learning_rate": 1.49048128342246e-05, "loss": 0.09624326229095459, "num_input_tokens_seen": 1242658, "step": 1197, "train_runtime": 2868.034, "train_tokens_per_second": 433.279 }, { "epoch": 0.5120205150122876, "grad_norm": 2.2829556465148926, "learning_rate": 1.490053475935829e-05, "loss": 0.14937518537044525, "num_input_tokens_seen": 1244118, "step": 1198, "train_runtime": 2870.2146, "train_tokens_per_second": 433.458 }, { "epoch": 0.5124479111016135, "grad_norm": 3.8092312812805176, "learning_rate": 1.4896256684491981e-05, "loss": 0.18598896265029907, "num_input_tokens_seen": 1244880, "step": 1199, "train_runtime": 2872.2545, "train_tokens_per_second": 433.416 }, { "epoch": 0.5128753071909392, "grad_norm": 4.290783405303955, "learning_rate": 1.489197860962567e-05, "loss": 0.2228667140007019, "num_input_tokens_seen": 1246146, "step": 1200, "train_runtime": 2874.378, "train_tokens_per_second": 433.536 }, { "epoch": 0.513302703280265, "grad_norm": 3.054795980453491, "learning_rate": 1.488770053475936e-05, "loss": 0.1417790800333023, "num_input_tokens_seen": 1246980, "step": 1201, "train_runtime": 2882.8688, "train_tokens_per_second": 432.548 }, { "epoch": 0.5137300993695908, "grad_norm": 2.4083077907562256, "learning_rate": 1.488342245989305e-05, "loss": 0.11850110441446304, "num_input_tokens_seen": 1247924, "step": 1202, "train_runtime": 2885.0891, "train_tokens_per_second": 432.543 }, { "epoch": 0.5141574954589165, "grad_norm": 2.284047842025757, "learning_rate": 1.4879144385026737e-05, "loss": 0.1140502467751503, "num_input_tokens_seen": 1248902, "step": 1203, "train_runtime": 2887.1313, "train_tokens_per_second": 432.575 }, { "epoch": 0.5145848915482424, "grad_norm": 4.041154861450195, "learning_rate": 1.487486631016043e-05, "loss": 0.11437393724918365, "num_input_tokens_seen": 1249520, "step": 1204, "train_runtime": 2889.1697, "train_tokens_per_second": 432.484 }, { "epoch": 0.5150122876375681, "grad_norm": 2.480656147003174, "learning_rate": 1.487058823529412e-05, "loss": 0.14181768894195557, "num_input_tokens_seen": 1250896, "step": 1205, "train_runtime": 2891.3688, "train_tokens_per_second": 432.631 }, { "epoch": 0.5154396837268939, "grad_norm": 4.123666286468506, "learning_rate": 1.4866310160427807e-05, "loss": 0.2572101652622223, "num_input_tokens_seen": 1252022, "step": 1206, "train_runtime": 2893.5111, "train_tokens_per_second": 432.7 }, { "epoch": 0.5158670798162197, "grad_norm": 2.35606050491333, "learning_rate": 1.4862032085561497e-05, "loss": 0.13891059160232544, "num_input_tokens_seen": 1253436, "step": 1207, "train_runtime": 2895.7185, "train_tokens_per_second": 432.858 }, { "epoch": 0.5162944759055454, "grad_norm": 2.973144292831421, "learning_rate": 1.485775401069519e-05, "loss": 0.1084960475564003, "num_input_tokens_seen": 1254522, "step": 1208, "train_runtime": 2897.8911, "train_tokens_per_second": 432.909 }, { "epoch": 0.5167218719948713, "grad_norm": 2.1476330757141113, "learning_rate": 1.4853475935828877e-05, "loss": 0.09674285352230072, "num_input_tokens_seen": 1256084, "step": 1209, "train_runtime": 2900.1252, "train_tokens_per_second": 433.114 }, { "epoch": 0.517149268084197, "grad_norm": 3.6345908641815186, "learning_rate": 1.4849197860962567e-05, "loss": 0.13477930426597595, "num_input_tokens_seen": 1257036, "step": 1210, "train_runtime": 2902.1925, "train_tokens_per_second": 433.133 }, { "epoch": 0.5175766641735228, "grad_norm": 3.2305147647857666, "learning_rate": 1.4844919786096256e-05, "loss": 0.1655772626399994, "num_input_tokens_seen": 1257922, "step": 1211, "train_runtime": 2904.2798, "train_tokens_per_second": 433.127 }, { "epoch": 0.5180040602628486, "grad_norm": 1.967262625694275, "learning_rate": 1.484064171122995e-05, "loss": 0.0806393250823021, "num_input_tokens_seen": 1259290, "step": 1212, "train_runtime": 2906.4589, "train_tokens_per_second": 433.273 }, { "epoch": 0.5184314563521744, "grad_norm": 2.1603286266326904, "learning_rate": 1.4836363636363637e-05, "loss": 0.1084219217300415, "num_input_tokens_seen": 1260326, "step": 1213, "train_runtime": 2908.5513, "train_tokens_per_second": 433.317 }, { "epoch": 0.5188588524415002, "grad_norm": 3.709182024002075, "learning_rate": 1.4832085561497326e-05, "loss": 0.13470333814620972, "num_input_tokens_seen": 1261044, "step": 1214, "train_runtime": 2910.5172, "train_tokens_per_second": 433.271 }, { "epoch": 0.519286248530826, "grad_norm": 2.3523428440093994, "learning_rate": 1.4827807486631016e-05, "loss": 0.10855934023857117, "num_input_tokens_seen": 1262616, "step": 1215, "train_runtime": 2912.7449, "train_tokens_per_second": 433.48 }, { "epoch": 0.5197136446201517, "grad_norm": 4.7110724449157715, "learning_rate": 1.4823529411764707e-05, "loss": 0.22755569219589233, "num_input_tokens_seen": 1263170, "step": 1216, "train_runtime": 2914.7034, "train_tokens_per_second": 433.379 }, { "epoch": 0.5201410407094775, "grad_norm": 2.7887420654296875, "learning_rate": 1.4819251336898396e-05, "loss": 0.12684106826782227, "num_input_tokens_seen": 1264336, "step": 1217, "train_runtime": 2916.8437, "train_tokens_per_second": 433.46 }, { "epoch": 0.5205684367988033, "grad_norm": 2.5725595951080322, "learning_rate": 1.4814973262032086e-05, "loss": 0.15530602633953094, "num_input_tokens_seen": 1265598, "step": 1218, "train_runtime": 2918.9847, "train_tokens_per_second": 433.575 }, { "epoch": 0.5209958328881291, "grad_norm": 2.8241114616394043, "learning_rate": 1.4810695187165775e-05, "loss": 0.18477758765220642, "num_input_tokens_seen": 1266874, "step": 1219, "train_runtime": 2921.1907, "train_tokens_per_second": 433.684 }, { "epoch": 0.5214232289774549, "grad_norm": 4.6259870529174805, "learning_rate": 1.4806417112299466e-05, "loss": 0.185531347990036, "num_input_tokens_seen": 1267652, "step": 1220, "train_runtime": 2923.2287, "train_tokens_per_second": 433.648 }, { "epoch": 0.5218506250667806, "grad_norm": 2.4858689308166504, "learning_rate": 1.4802139037433156e-05, "loss": 0.08196789026260376, "num_input_tokens_seen": 1269138, "step": 1221, "train_runtime": 2925.4713, "train_tokens_per_second": 433.823 }, { "epoch": 0.5222780211561064, "grad_norm": 2.866215467453003, "learning_rate": 1.4797860962566845e-05, "loss": 0.11320745944976807, "num_input_tokens_seen": 1269886, "step": 1222, "train_runtime": 2927.5289, "train_tokens_per_second": 433.774 }, { "epoch": 0.5227054172454322, "grad_norm": 3.460625648498535, "learning_rate": 1.4793582887700535e-05, "loss": 0.14805959165096283, "num_input_tokens_seen": 1270554, "step": 1223, "train_runtime": 2929.5692, "train_tokens_per_second": 433.7 }, { "epoch": 0.523132813334758, "grad_norm": 3.169494390487671, "learning_rate": 1.4789304812834226e-05, "loss": 0.11480510979890823, "num_input_tokens_seen": 1271226, "step": 1224, "train_runtime": 2931.596, "train_tokens_per_second": 433.629 }, { "epoch": 0.5235602094240838, "grad_norm": 3.1488611698150635, "learning_rate": 1.4785026737967915e-05, "loss": 0.08535999804735184, "num_input_tokens_seen": 1272126, "step": 1225, "train_runtime": 2933.6436, "train_tokens_per_second": 433.633 }, { "epoch": 0.5239876055134095, "grad_norm": 1.1961338520050049, "learning_rate": 1.4780748663101605e-05, "loss": 0.062140218913555145, "num_input_tokens_seen": 1275302, "step": 1226, "train_runtime": 2936.2875, "train_tokens_per_second": 434.325 }, { "epoch": 0.5244150016027354, "grad_norm": 3.8686330318450928, "learning_rate": 1.4776470588235294e-05, "loss": 0.1642768383026123, "num_input_tokens_seen": 1276538, "step": 1227, "train_runtime": 2938.4278, "train_tokens_per_second": 434.429 }, { "epoch": 0.5248423976920611, "grad_norm": 2.709268093109131, "learning_rate": 1.4772192513368985e-05, "loss": 0.15790528059005737, "num_input_tokens_seen": 1277534, "step": 1228, "train_runtime": 2940.5046, "train_tokens_per_second": 434.461 }, { "epoch": 0.5252697937813869, "grad_norm": 3.1894426345825195, "learning_rate": 1.4767914438502675e-05, "loss": 0.14597229659557343, "num_input_tokens_seen": 1278534, "step": 1229, "train_runtime": 2942.5887, "train_tokens_per_second": 434.493 }, { "epoch": 0.5256971898707127, "grad_norm": 3.300455331802368, "learning_rate": 1.4763636363636364e-05, "loss": 0.19414545595645905, "num_input_tokens_seen": 1279530, "step": 1230, "train_runtime": 2944.6592, "train_tokens_per_second": 434.526 }, { "epoch": 0.5261245859600384, "grad_norm": 2.5099072456359863, "learning_rate": 1.4759358288770054e-05, "loss": 0.10873032361268997, "num_input_tokens_seen": 1280870, "step": 1231, "train_runtime": 2953.638, "train_tokens_per_second": 433.658 }, { "epoch": 0.5265519820493643, "grad_norm": 2.3596484661102295, "learning_rate": 1.4755080213903745e-05, "loss": 0.10290868580341339, "num_input_tokens_seen": 1282036, "step": 1232, "train_runtime": 2955.7866, "train_tokens_per_second": 433.738 }, { "epoch": 0.52697937813869, "grad_norm": 2.6016011238098145, "learning_rate": 1.4750802139037434e-05, "loss": 0.09967711567878723, "num_input_tokens_seen": 1282954, "step": 1233, "train_runtime": 2957.8801, "train_tokens_per_second": 433.741 }, { "epoch": 0.5274067742280159, "grad_norm": 4.108160018920898, "learning_rate": 1.4746524064171124e-05, "loss": 0.2169618308544159, "num_input_tokens_seen": 1283920, "step": 1234, "train_runtime": 2959.9763, "train_tokens_per_second": 433.76 }, { "epoch": 0.5278341703173416, "grad_norm": 3.0595760345458984, "learning_rate": 1.4742245989304813e-05, "loss": 0.15109138190746307, "num_input_tokens_seen": 1284836, "step": 1235, "train_runtime": 2962.0189, "train_tokens_per_second": 433.77 }, { "epoch": 0.5282615664066673, "grad_norm": 2.926755666732788, "learning_rate": 1.4737967914438504e-05, "loss": 0.16534759104251862, "num_input_tokens_seen": 1285940, "step": 1236, "train_runtime": 2964.1334, "train_tokens_per_second": 433.833 }, { "epoch": 0.5286889624959932, "grad_norm": 3.5862061977386475, "learning_rate": 1.4733689839572194e-05, "loss": 0.24955226480960846, "num_input_tokens_seen": 1286944, "step": 1237, "train_runtime": 2966.2328, "train_tokens_per_second": 433.865 }, { "epoch": 0.5291163585853189, "grad_norm": 3.403506278991699, "learning_rate": 1.4729411764705883e-05, "loss": 0.10444283485412598, "num_input_tokens_seen": 1287744, "step": 1238, "train_runtime": 2968.2536, "train_tokens_per_second": 433.839 }, { "epoch": 0.5295437546746448, "grad_norm": 3.841616153717041, "learning_rate": 1.4725133689839573e-05, "loss": 0.21578004956245422, "num_input_tokens_seen": 1289008, "step": 1239, "train_runtime": 2970.4004, "train_tokens_per_second": 433.951 }, { "epoch": 0.5299711507639705, "grad_norm": 3.752838611602783, "learning_rate": 1.4720855614973264e-05, "loss": 0.16529375314712524, "num_input_tokens_seen": 1289992, "step": 1240, "train_runtime": 2972.4899, "train_tokens_per_second": 433.977 }, { "epoch": 0.5303985468532962, "grad_norm": 2.8671066761016846, "learning_rate": 1.4716577540106953e-05, "loss": 0.12689585983753204, "num_input_tokens_seen": 1291310, "step": 1241, "train_runtime": 2974.6648, "train_tokens_per_second": 434.103 }, { "epoch": 0.5308259429426221, "grad_norm": 3.026271343231201, "learning_rate": 1.4712299465240643e-05, "loss": 0.15771925449371338, "num_input_tokens_seen": 1292422, "step": 1242, "train_runtime": 2976.7651, "train_tokens_per_second": 434.17 }, { "epoch": 0.5312533390319478, "grad_norm": 4.134592056274414, "learning_rate": 1.4708021390374332e-05, "loss": 0.16895480453968048, "num_input_tokens_seen": 1293270, "step": 1243, "train_runtime": 2978.8477, "train_tokens_per_second": 434.151 }, { "epoch": 0.5316807351212737, "grad_norm": 3.4088222980499268, "learning_rate": 1.4703743315508023e-05, "loss": 0.10249975323677063, "num_input_tokens_seen": 1293884, "step": 1244, "train_runtime": 2980.9077, "train_tokens_per_second": 434.057 }, { "epoch": 0.5321081312105994, "grad_norm": 4.0659027099609375, "learning_rate": 1.4699465240641713e-05, "loss": 0.18310728669166565, "num_input_tokens_seen": 1294644, "step": 1245, "train_runtime": 2982.9946, "train_tokens_per_second": 434.008 }, { "epoch": 0.5325355272999253, "grad_norm": 4.350315570831299, "learning_rate": 1.4695187165775402e-05, "loss": 0.1722957342863083, "num_input_tokens_seen": 1295360, "step": 1246, "train_runtime": 2984.9821, "train_tokens_per_second": 433.959 }, { "epoch": 0.532962923389251, "grad_norm": 3.4019153118133545, "learning_rate": 1.4690909090909092e-05, "loss": 0.19986552000045776, "num_input_tokens_seen": 1296580, "step": 1247, "train_runtime": 2987.1504, "train_tokens_per_second": 434.052 }, { "epoch": 0.5333903194785767, "grad_norm": 3.4604334831237793, "learning_rate": 1.4686631016042783e-05, "loss": 0.13814860582351685, "num_input_tokens_seen": 1297590, "step": 1248, "train_runtime": 2989.2033, "train_tokens_per_second": 434.092 }, { "epoch": 0.5338177155679026, "grad_norm": 2.296515941619873, "learning_rate": 1.4682352941176472e-05, "loss": 0.1151202991604805, "num_input_tokens_seen": 1298560, "step": 1249, "train_runtime": 2991.2654, "train_tokens_per_second": 434.117 }, { "epoch": 0.5342451116572283, "grad_norm": 3.181269884109497, "learning_rate": 1.4678074866310162e-05, "loss": 0.19524168968200684, "num_input_tokens_seen": 1299314, "step": 1250, "train_runtime": 2993.3266, "train_tokens_per_second": 434.07 }, { "epoch": 0.5346725077465542, "grad_norm": 3.111470937728882, "learning_rate": 1.4673796791443851e-05, "loss": 0.09875819087028503, "num_input_tokens_seen": 1300070, "step": 1251, "train_runtime": 2995.423, "train_tokens_per_second": 434.019 }, { "epoch": 0.5350999038358799, "grad_norm": 5.305385589599609, "learning_rate": 1.4669518716577542e-05, "loss": 0.18836107850074768, "num_input_tokens_seen": 1300824, "step": 1252, "train_runtime": 2997.4636, "train_tokens_per_second": 433.975 }, { "epoch": 0.5355272999252056, "grad_norm": 3.39542555809021, "learning_rate": 1.4665240641711232e-05, "loss": 0.1877380907535553, "num_input_tokens_seen": 1301600, "step": 1253, "train_runtime": 2999.4933, "train_tokens_per_second": 433.94 }, { "epoch": 0.5359546960145315, "grad_norm": 2.797130584716797, "learning_rate": 1.4660962566844921e-05, "loss": 0.12603871524333954, "num_input_tokens_seen": 1302436, "step": 1254, "train_runtime": 3001.5592, "train_tokens_per_second": 433.92 }, { "epoch": 0.5363820921038572, "grad_norm": 2.6841440200805664, "learning_rate": 1.465668449197861e-05, "loss": 0.13795852661132812, "num_input_tokens_seen": 1303460, "step": 1255, "train_runtime": 3003.6618, "train_tokens_per_second": 433.957 }, { "epoch": 0.5368094881931831, "grad_norm": 3.3998546600341797, "learning_rate": 1.4652406417112302e-05, "loss": 0.12445757538080215, "num_input_tokens_seen": 1304480, "step": 1256, "train_runtime": 3005.7477, "train_tokens_per_second": 433.995 }, { "epoch": 0.5372368842825088, "grad_norm": 2.7438855171203613, "learning_rate": 1.4648128342245991e-05, "loss": 0.18717393279075623, "num_input_tokens_seen": 1305782, "step": 1257, "train_runtime": 3007.9045, "train_tokens_per_second": 434.117 }, { "epoch": 0.5376642803718346, "grad_norm": 3.3281304836273193, "learning_rate": 1.464385026737968e-05, "loss": 0.17011483013629913, "num_input_tokens_seen": 1306524, "step": 1258, "train_runtime": 3009.9567, "train_tokens_per_second": 434.067 }, { "epoch": 0.5380916764611604, "grad_norm": 2.7448432445526123, "learning_rate": 1.463957219251337e-05, "loss": 0.19452330470085144, "num_input_tokens_seen": 1307818, "step": 1259, "train_runtime": 3012.0997, "train_tokens_per_second": 434.188 }, { "epoch": 0.5385190725504861, "grad_norm": 2.0388052463531494, "learning_rate": 1.4635294117647061e-05, "loss": 0.1313883513212204, "num_input_tokens_seen": 1309754, "step": 1260, "train_runtime": 3014.404, "train_tokens_per_second": 434.498 }, { "epoch": 0.538946468639812, "grad_norm": 3.47153639793396, "learning_rate": 1.463101604278075e-05, "loss": 0.18669819831848145, "num_input_tokens_seen": 1310512, "step": 1261, "train_runtime": 3022.9912, "train_tokens_per_second": 433.515 }, { "epoch": 0.5393738647291377, "grad_norm": 3.1900274753570557, "learning_rate": 1.462673796791444e-05, "loss": 0.13144513964653015, "num_input_tokens_seen": 1311126, "step": 1262, "train_runtime": 3024.9515, "train_tokens_per_second": 433.437 }, { "epoch": 0.5398012608184635, "grad_norm": 3.0377893447875977, "learning_rate": 1.462245989304813e-05, "loss": 0.16956773400306702, "num_input_tokens_seen": 1312054, "step": 1263, "train_runtime": 3027.1519, "train_tokens_per_second": 433.429 }, { "epoch": 0.5402286569077893, "grad_norm": 3.7872700691223145, "learning_rate": 1.461818181818182e-05, "loss": 0.17255957424640656, "num_input_tokens_seen": 1313044, "step": 1264, "train_runtime": 3029.2521, "train_tokens_per_second": 433.455 }, { "epoch": 0.540656052997115, "grad_norm": 4.534908771514893, "learning_rate": 1.461390374331551e-05, "loss": 0.1506447196006775, "num_input_tokens_seen": 1313798, "step": 1265, "train_runtime": 3031.2379, "train_tokens_per_second": 433.42 }, { "epoch": 0.5410834490864409, "grad_norm": 4.061362266540527, "learning_rate": 1.46096256684492e-05, "loss": 0.2508237659931183, "num_input_tokens_seen": 1315170, "step": 1266, "train_runtime": 3033.4115, "train_tokens_per_second": 433.561 }, { "epoch": 0.5415108451757666, "grad_norm": 3.1945958137512207, "learning_rate": 1.4605347593582887e-05, "loss": 0.122700996696949, "num_input_tokens_seen": 1316050, "step": 1267, "train_runtime": 3035.5316, "train_tokens_per_second": 433.548 }, { "epoch": 0.5419382412650924, "grad_norm": 2.2648088932037354, "learning_rate": 1.460106951871658e-05, "loss": 0.07432137429714203, "num_input_tokens_seen": 1317004, "step": 1268, "train_runtime": 3037.6613, "train_tokens_per_second": 433.559 }, { "epoch": 0.5423656373544182, "grad_norm": 3.122262954711914, "learning_rate": 1.459679144385027e-05, "loss": 0.11405198276042938, "num_input_tokens_seen": 1318044, "step": 1269, "train_runtime": 3039.7727, "train_tokens_per_second": 433.6 }, { "epoch": 0.542793033443744, "grad_norm": 3.263747453689575, "learning_rate": 1.4592513368983959e-05, "loss": 0.12836995720863342, "num_input_tokens_seen": 1318916, "step": 1270, "train_runtime": 3041.8447, "train_tokens_per_second": 433.591 }, { "epoch": 0.5432204295330698, "grad_norm": 3.0479540824890137, "learning_rate": 1.4588235294117647e-05, "loss": 0.26140522956848145, "num_input_tokens_seen": 1320104, "step": 1271, "train_runtime": 3043.962, "train_tokens_per_second": 433.68 }, { "epoch": 0.5436478256223956, "grad_norm": 4.577423095703125, "learning_rate": 1.458395721925134e-05, "loss": 0.14573048055171967, "num_input_tokens_seen": 1320730, "step": 1272, "train_runtime": 3045.9948, "train_tokens_per_second": 433.596 }, { "epoch": 0.5440752217117213, "grad_norm": 3.4006383419036865, "learning_rate": 1.4579679144385029e-05, "loss": 0.10004554688930511, "num_input_tokens_seen": 1321634, "step": 1273, "train_runtime": 3048.075, "train_tokens_per_second": 433.596 }, { "epoch": 0.5445026178010471, "grad_norm": 2.7472174167633057, "learning_rate": 1.4575401069518717e-05, "loss": 0.18967130780220032, "num_input_tokens_seen": 1322748, "step": 1274, "train_runtime": 3050.199, "train_tokens_per_second": 433.66 }, { "epoch": 0.5449300138903729, "grad_norm": 2.7711236476898193, "learning_rate": 1.4571122994652406e-05, "loss": 0.187877357006073, "num_input_tokens_seen": 1323836, "step": 1275, "train_runtime": 3052.3368, "train_tokens_per_second": 433.712 }, { "epoch": 0.5453574099796987, "grad_norm": 1.9772099256515503, "learning_rate": 1.4566844919786099e-05, "loss": 0.10886204242706299, "num_input_tokens_seen": 1325094, "step": 1276, "train_runtime": 3054.5087, "train_tokens_per_second": 433.816 }, { "epoch": 0.5457848060690245, "grad_norm": 3.4452152252197266, "learning_rate": 1.4562566844919787e-05, "loss": 0.12986767292022705, "num_input_tokens_seen": 1326388, "step": 1277, "train_runtime": 3056.6539, "train_tokens_per_second": 433.935 }, { "epoch": 0.5462122021583502, "grad_norm": 3.2720425128936768, "learning_rate": 1.4558288770053476e-05, "loss": 0.1310553252696991, "num_input_tokens_seen": 1327346, "step": 1278, "train_runtime": 3058.7511, "train_tokens_per_second": 433.95 }, { "epoch": 0.546639598247676, "grad_norm": 3.2607574462890625, "learning_rate": 1.4554010695187166e-05, "loss": 0.17354868352413177, "num_input_tokens_seen": 1328328, "step": 1279, "train_runtime": 3060.8379, "train_tokens_per_second": 433.975 }, { "epoch": 0.5470669943370018, "grad_norm": 3.38954758644104, "learning_rate": 1.4549732620320859e-05, "loss": 0.15475034713745117, "num_input_tokens_seen": 1329264, "step": 1280, "train_runtime": 3062.8619, "train_tokens_per_second": 433.994 }, { "epoch": 0.5474943904263276, "grad_norm": 3.611175537109375, "learning_rate": 1.4545454545454546e-05, "loss": 0.09882596880197525, "num_input_tokens_seen": 1330392, "step": 1281, "train_runtime": 3064.9539, "train_tokens_per_second": 434.066 }, { "epoch": 0.5479217865156534, "grad_norm": 2.675280809402466, "learning_rate": 1.4541176470588236e-05, "loss": 0.11324083060026169, "num_input_tokens_seen": 1331500, "step": 1282, "train_runtime": 3067.0639, "train_tokens_per_second": 434.129 }, { "epoch": 0.5483491826049791, "grad_norm": 3.086268424987793, "learning_rate": 1.4536898395721925e-05, "loss": 0.1743987500667572, "num_input_tokens_seen": 1332680, "step": 1283, "train_runtime": 3069.1876, "train_tokens_per_second": 434.213 }, { "epoch": 0.548776578694305, "grad_norm": 2.768984794616699, "learning_rate": 1.4532620320855616e-05, "loss": 0.16291919350624084, "num_input_tokens_seen": 1333844, "step": 1284, "train_runtime": 3071.2953, "train_tokens_per_second": 434.294 }, { "epoch": 0.5492039747836307, "grad_norm": 2.387202501296997, "learning_rate": 1.4528342245989306e-05, "loss": 0.1337834596633911, "num_input_tokens_seen": 1335014, "step": 1285, "train_runtime": 3073.4412, "train_tokens_per_second": 434.371 }, { "epoch": 0.5496313708729565, "grad_norm": 2.024073839187622, "learning_rate": 1.4524064171122995e-05, "loss": 0.13841214776039124, "num_input_tokens_seen": 1337410, "step": 1286, "train_runtime": 3075.8339, "train_tokens_per_second": 434.812 }, { "epoch": 0.5500587669622823, "grad_norm": 3.5594098567962646, "learning_rate": 1.4519786096256685e-05, "loss": 0.13000838458538055, "num_input_tokens_seen": 1338056, "step": 1287, "train_runtime": 3077.7845, "train_tokens_per_second": 434.746 }, { "epoch": 0.550486163051608, "grad_norm": 4.240809917449951, "learning_rate": 1.4515508021390376e-05, "loss": 0.12927718460559845, "num_input_tokens_seen": 1338814, "step": 1288, "train_runtime": 3079.8386, "train_tokens_per_second": 434.703 }, { "epoch": 0.5509135591409339, "grad_norm": 1.9870355129241943, "learning_rate": 1.4511229946524065e-05, "loss": 0.09284672141075134, "num_input_tokens_seen": 1340582, "step": 1289, "train_runtime": 3082.2007, "train_tokens_per_second": 434.943 }, { "epoch": 0.5513409552302596, "grad_norm": 4.011283874511719, "learning_rate": 1.4506951871657755e-05, "loss": 0.08587135374546051, "num_input_tokens_seen": 1341116, "step": 1290, "train_runtime": 3084.1558, "train_tokens_per_second": 434.841 }, { "epoch": 0.5517683513195855, "grad_norm": 2.6522579193115234, "learning_rate": 1.4502673796791444e-05, "loss": 0.1723092496395111, "num_input_tokens_seen": 1342370, "step": 1291, "train_runtime": 3092.9473, "train_tokens_per_second": 434.01 }, { "epoch": 0.5521957474089112, "grad_norm": 3.418346881866455, "learning_rate": 1.4498395721925135e-05, "loss": 0.22418902814388275, "num_input_tokens_seen": 1343356, "step": 1292, "train_runtime": 3095.0061, "train_tokens_per_second": 434.04 }, { "epoch": 0.552623143498237, "grad_norm": 2.2360384464263916, "learning_rate": 1.4494117647058825e-05, "loss": 0.09782730042934418, "num_input_tokens_seen": 1344480, "step": 1293, "train_runtime": 3097.3633, "train_tokens_per_second": 434.072 }, { "epoch": 0.5530505395875628, "grad_norm": 2.2155373096466064, "learning_rate": 1.4489839572192514e-05, "loss": 0.09152060002088547, "num_input_tokens_seen": 1345570, "step": 1294, "train_runtime": 3099.5012, "train_tokens_per_second": 434.125 }, { "epoch": 0.5534779356768885, "grad_norm": 2.8570311069488525, "learning_rate": 1.4485561497326204e-05, "loss": 0.12493006885051727, "num_input_tokens_seen": 1346498, "step": 1295, "train_runtime": 3101.5673, "train_tokens_per_second": 434.135 }, { "epoch": 0.5539053317662144, "grad_norm": 3.504819869995117, "learning_rate": 1.4481283422459895e-05, "loss": 0.15750575065612793, "num_input_tokens_seen": 1347320, "step": 1296, "train_runtime": 3103.621, "train_tokens_per_second": 434.112 }, { "epoch": 0.5543327278555401, "grad_norm": 2.975438117980957, "learning_rate": 1.4477005347593584e-05, "loss": 0.15112178027629852, "num_input_tokens_seen": 1348416, "step": 1297, "train_runtime": 3105.7492, "train_tokens_per_second": 434.168 }, { "epoch": 0.554760123944866, "grad_norm": 2.8611741065979004, "learning_rate": 1.4472727272727274e-05, "loss": 0.08872049301862717, "num_input_tokens_seen": 1349308, "step": 1298, "train_runtime": 3107.833, "train_tokens_per_second": 434.164 }, { "epoch": 0.5551875200341917, "grad_norm": 2.685610294342041, "learning_rate": 1.4468449197860963e-05, "loss": 0.11205846071243286, "num_input_tokens_seen": 1350388, "step": 1299, "train_runtime": 3109.9127, "train_tokens_per_second": 434.221 }, { "epoch": 0.5556149161235174, "grad_norm": 2.436103105545044, "learning_rate": 1.4464171122994654e-05, "loss": 0.04306722432374954, "num_input_tokens_seen": 1350990, "step": 1300, "train_runtime": 3111.9037, "train_tokens_per_second": 434.136 }, { "epoch": 0.5560423122128433, "grad_norm": 5.107798099517822, "learning_rate": 1.4459893048128344e-05, "loss": 0.2502478063106537, "num_input_tokens_seen": 1351776, "step": 1301, "train_runtime": 3113.8952, "train_tokens_per_second": 434.111 }, { "epoch": 0.556469708302169, "grad_norm": 5.479470252990723, "learning_rate": 1.4455614973262033e-05, "loss": 0.19407883286476135, "num_input_tokens_seen": 1352406, "step": 1302, "train_runtime": 3115.8991, "train_tokens_per_second": 434.034 }, { "epoch": 0.5568971043914949, "grad_norm": 2.941948413848877, "learning_rate": 1.4451336898395723e-05, "loss": 0.10889407992362976, "num_input_tokens_seen": 1353458, "step": 1303, "train_runtime": 3118.0275, "train_tokens_per_second": 434.075 }, { "epoch": 0.5573245004808206, "grad_norm": 4.489953994750977, "learning_rate": 1.4447058823529414e-05, "loss": 0.15718862414360046, "num_input_tokens_seen": 1354264, "step": 1304, "train_runtime": 3120.0442, "train_tokens_per_second": 434.053 }, { "epoch": 0.5577518965701463, "grad_norm": 2.7625503540039062, "learning_rate": 1.4442780748663103e-05, "loss": 0.16560781002044678, "num_input_tokens_seen": 1355288, "step": 1305, "train_runtime": 3122.1, "train_tokens_per_second": 434.095 }, { "epoch": 0.5581792926594722, "grad_norm": 3.410099506378174, "learning_rate": 1.4438502673796793e-05, "loss": 0.1142624020576477, "num_input_tokens_seen": 1356086, "step": 1306, "train_runtime": 3124.1233, "train_tokens_per_second": 434.069 }, { "epoch": 0.5586066887487979, "grad_norm": 2.389314889907837, "learning_rate": 1.4434224598930482e-05, "loss": 0.14941425621509552, "num_input_tokens_seen": 1357528, "step": 1307, "train_runtime": 3126.3436, "train_tokens_per_second": 434.222 }, { "epoch": 0.5590340848381238, "grad_norm": 2.9370124340057373, "learning_rate": 1.4429946524064173e-05, "loss": 0.20251935720443726, "num_input_tokens_seen": 1358710, "step": 1308, "train_runtime": 3128.4627, "train_tokens_per_second": 434.306 }, { "epoch": 0.5594614809274495, "grad_norm": 5.125398635864258, "learning_rate": 1.4425668449197863e-05, "loss": 0.1502501219511032, "num_input_tokens_seen": 1359730, "step": 1309, "train_runtime": 3130.5562, "train_tokens_per_second": 434.341 }, { "epoch": 0.5598888770167753, "grad_norm": 2.7636914253234863, "learning_rate": 1.4421390374331552e-05, "loss": 0.17712441086769104, "num_input_tokens_seen": 1360966, "step": 1310, "train_runtime": 3132.7133, "train_tokens_per_second": 434.437 }, { "epoch": 0.5603162731061011, "grad_norm": 4.530420780181885, "learning_rate": 1.4417112299465242e-05, "loss": 0.18464383482933044, "num_input_tokens_seen": 1361962, "step": 1311, "train_runtime": 3134.8087, "train_tokens_per_second": 434.464 }, { "epoch": 0.5607436691954268, "grad_norm": 3.288115978240967, "learning_rate": 1.4412834224598931e-05, "loss": 0.15711161494255066, "num_input_tokens_seen": 1362752, "step": 1312, "train_runtime": 3136.8402, "train_tokens_per_second": 434.435 }, { "epoch": 0.5611710652847527, "grad_norm": 2.5233519077301025, "learning_rate": 1.4408556149732622e-05, "loss": 0.14466112852096558, "num_input_tokens_seen": 1363708, "step": 1313, "train_runtime": 3138.9263, "train_tokens_per_second": 434.45 }, { "epoch": 0.5615984613740784, "grad_norm": 2.770968198776245, "learning_rate": 1.4404278074866312e-05, "loss": 0.1307995617389679, "num_input_tokens_seen": 1364932, "step": 1314, "train_runtime": 3141.0926, "train_tokens_per_second": 434.541 }, { "epoch": 0.5620258574634042, "grad_norm": 2.6532740592956543, "learning_rate": 1.4400000000000001e-05, "loss": 0.15271973609924316, "num_input_tokens_seen": 1365832, "step": 1315, "train_runtime": 3143.2687, "train_tokens_per_second": 434.526 }, { "epoch": 0.56245325355273, "grad_norm": 2.3266897201538086, "learning_rate": 1.439572192513369e-05, "loss": 0.11991928517818451, "num_input_tokens_seen": 1367160, "step": 1316, "train_runtime": 3145.3845, "train_tokens_per_second": 434.656 }, { "epoch": 0.5628806496420558, "grad_norm": 3.4439101219177246, "learning_rate": 1.4391443850267382e-05, "loss": 0.23416438698768616, "num_input_tokens_seen": 1368060, "step": 1317, "train_runtime": 3147.4299, "train_tokens_per_second": 434.659 }, { "epoch": 0.5633080457313816, "grad_norm": 3.6046524047851562, "learning_rate": 1.4387165775401071e-05, "loss": 0.1598702222108841, "num_input_tokens_seen": 1368762, "step": 1318, "train_runtime": 3149.4738, "train_tokens_per_second": 434.6 }, { "epoch": 0.5637354418207073, "grad_norm": 2.938603401184082, "learning_rate": 1.438288770053476e-05, "loss": 0.1904858946800232, "num_input_tokens_seen": 1369696, "step": 1319, "train_runtime": 3151.5342, "train_tokens_per_second": 434.612 }, { "epoch": 0.5641628379100331, "grad_norm": 2.813359260559082, "learning_rate": 1.437860962566845e-05, "loss": 0.10506963729858398, "num_input_tokens_seen": 1370364, "step": 1320, "train_runtime": 3153.514, "train_tokens_per_second": 434.551 }, { "epoch": 0.5645902339993589, "grad_norm": 4.190011024475098, "learning_rate": 1.4374331550802141e-05, "loss": 0.1983892172574997, "num_input_tokens_seen": 1371314, "step": 1321, "train_runtime": 3162.523, "train_tokens_per_second": 433.614 }, { "epoch": 0.5650176300886847, "grad_norm": 2.8000965118408203, "learning_rate": 1.437005347593583e-05, "loss": 0.13952013850212097, "num_input_tokens_seen": 1372200, "step": 1322, "train_runtime": 3164.5991, "train_tokens_per_second": 433.609 }, { "epoch": 0.5654450261780105, "grad_norm": 2.927912950515747, "learning_rate": 1.436577540106952e-05, "loss": 0.16799136996269226, "num_input_tokens_seen": 1373306, "step": 1323, "train_runtime": 3166.7036, "train_tokens_per_second": 433.671 }, { "epoch": 0.5658724222673363, "grad_norm": 2.517874002456665, "learning_rate": 1.436149732620321e-05, "loss": 0.11278734356164932, "num_input_tokens_seen": 1374362, "step": 1324, "train_runtime": 3168.783, "train_tokens_per_second": 433.719 }, { "epoch": 0.566299818356662, "grad_norm": 3.439088821411133, "learning_rate": 1.43572192513369e-05, "loss": 0.16937866806983948, "num_input_tokens_seen": 1375172, "step": 1325, "train_runtime": 3170.8002, "train_tokens_per_second": 433.699 }, { "epoch": 0.5667272144459878, "grad_norm": 3.08162522315979, "learning_rate": 1.435294117647059e-05, "loss": 0.1832624077796936, "num_input_tokens_seen": 1376126, "step": 1326, "train_runtime": 3172.8748, "train_tokens_per_second": 433.716 }, { "epoch": 0.5671546105353136, "grad_norm": 2.31919002532959, "learning_rate": 1.434866310160428e-05, "loss": 0.12628880143165588, "num_input_tokens_seen": 1377132, "step": 1327, "train_runtime": 3174.9454, "train_tokens_per_second": 433.75 }, { "epoch": 0.5675820066246394, "grad_norm": 2.693835735321045, "learning_rate": 1.4344385026737967e-05, "loss": 0.13304206728935242, "num_input_tokens_seen": 1378052, "step": 1328, "train_runtime": 3176.987, "train_tokens_per_second": 433.761 }, { "epoch": 0.5680094027139652, "grad_norm": 2.582542657852173, "learning_rate": 1.434010695187166e-05, "loss": 0.12485780566930771, "num_input_tokens_seen": 1379138, "step": 1329, "train_runtime": 3179.0924, "train_tokens_per_second": 433.815 }, { "epoch": 0.5684367988032909, "grad_norm": 2.1392982006073, "learning_rate": 1.433582887700535e-05, "loss": 0.09820333868265152, "num_input_tokens_seen": 1380224, "step": 1330, "train_runtime": 3181.1739, "train_tokens_per_second": 433.873 }, { "epoch": 0.5688641948926167, "grad_norm": 2.1656980514526367, "learning_rate": 1.4331550802139039e-05, "loss": 0.08080549538135529, "num_input_tokens_seen": 1380956, "step": 1331, "train_runtime": 3183.1887, "train_tokens_per_second": 433.828 }, { "epoch": 0.5692915909819425, "grad_norm": 3.219681978225708, "learning_rate": 1.4327272727272727e-05, "loss": 0.0961499810218811, "num_input_tokens_seen": 1381664, "step": 1332, "train_runtime": 3185.1647, "train_tokens_per_second": 433.781 }, { "epoch": 0.5697189870712683, "grad_norm": 3.8177578449249268, "learning_rate": 1.432299465240642e-05, "loss": 0.2069641500711441, "num_input_tokens_seen": 1382478, "step": 1333, "train_runtime": 3187.1867, "train_tokens_per_second": 433.761 }, { "epoch": 0.5701463831605941, "grad_norm": 2.5426411628723145, "learning_rate": 1.4318716577540109e-05, "loss": 0.1197671890258789, "num_input_tokens_seen": 1383428, "step": 1334, "train_runtime": 3189.3526, "train_tokens_per_second": 433.765 }, { "epoch": 0.5705737792499198, "grad_norm": 3.00923752784729, "learning_rate": 1.4314438502673797e-05, "loss": 0.14582058787345886, "num_input_tokens_seen": 1384562, "step": 1335, "train_runtime": 3191.4769, "train_tokens_per_second": 433.831 }, { "epoch": 0.5710011753392457, "grad_norm": 3.2409698963165283, "learning_rate": 1.4310160427807486e-05, "loss": 0.1074337512254715, "num_input_tokens_seen": 1385582, "step": 1336, "train_runtime": 3193.6214, "train_tokens_per_second": 433.859 }, { "epoch": 0.5714285714285714, "grad_norm": 2.674619674682617, "learning_rate": 1.4305882352941179e-05, "loss": 0.17064478993415833, "num_input_tokens_seen": 1387014, "step": 1337, "train_runtime": 3195.7833, "train_tokens_per_second": 434.014 }, { "epoch": 0.5718559675178972, "grad_norm": 2.36714768409729, "learning_rate": 1.4301604278074868e-05, "loss": 0.07887314260005951, "num_input_tokens_seen": 1387936, "step": 1338, "train_runtime": 3197.8804, "train_tokens_per_second": 434.017 }, { "epoch": 0.572283363607223, "grad_norm": 3.2736432552337646, "learning_rate": 1.4297326203208556e-05, "loss": 0.11346343904733658, "num_input_tokens_seen": 1388608, "step": 1339, "train_runtime": 3199.8956, "train_tokens_per_second": 433.954 }, { "epoch": 0.5727107596965487, "grad_norm": 4.206210136413574, "learning_rate": 1.4293048128342246e-05, "loss": 0.18226617574691772, "num_input_tokens_seen": 1389596, "step": 1340, "train_runtime": 3201.9641, "train_tokens_per_second": 433.982 }, { "epoch": 0.5731381557858746, "grad_norm": 2.84797739982605, "learning_rate": 1.4288770053475938e-05, "loss": 0.12390857934951782, "num_input_tokens_seen": 1391016, "step": 1341, "train_runtime": 3204.1733, "train_tokens_per_second": 434.126 }, { "epoch": 0.5735655518752003, "grad_norm": 3.604992151260376, "learning_rate": 1.4284491978609626e-05, "loss": 0.1389472484588623, "num_input_tokens_seen": 1392974, "step": 1342, "train_runtime": 3206.4591, "train_tokens_per_second": 434.428 }, { "epoch": 0.5739929479645262, "grad_norm": 3.0878748893737793, "learning_rate": 1.4280213903743316e-05, "loss": 0.1665935218334198, "num_input_tokens_seen": 1394476, "step": 1343, "train_runtime": 3208.7286, "train_tokens_per_second": 434.588 }, { "epoch": 0.5744203440538519, "grad_norm": 3.2702009677886963, "learning_rate": 1.4275935828877005e-05, "loss": 0.1423080712556839, "num_input_tokens_seen": 1395278, "step": 1344, "train_runtime": 3210.7495, "train_tokens_per_second": 434.565 }, { "epoch": 0.5748477401431777, "grad_norm": 3.2000083923339844, "learning_rate": 1.4271657754010696e-05, "loss": 0.17459425330162048, "num_input_tokens_seen": 1396106, "step": 1345, "train_runtime": 3212.7956, "train_tokens_per_second": 434.546 }, { "epoch": 0.5752751362325035, "grad_norm": 3.0125555992126465, "learning_rate": 1.4267379679144386e-05, "loss": 0.1326783001422882, "num_input_tokens_seen": 1396912, "step": 1346, "train_runtime": 3214.8143, "train_tokens_per_second": 434.523 }, { "epoch": 0.5757025323218292, "grad_norm": 3.782444715499878, "learning_rate": 1.4263101604278075e-05, "loss": 0.17368285357952118, "num_input_tokens_seen": 1397604, "step": 1347, "train_runtime": 3216.8295, "train_tokens_per_second": 434.466 }, { "epoch": 0.5761299284111551, "grad_norm": 2.9148635864257812, "learning_rate": 1.4258823529411765e-05, "loss": 0.16578298807144165, "num_input_tokens_seen": 1398700, "step": 1348, "train_runtime": 3218.9106, "train_tokens_per_second": 434.526 }, { "epoch": 0.5765573245004808, "grad_norm": 2.904982805252075, "learning_rate": 1.4254545454545456e-05, "loss": 0.17295828461647034, "num_input_tokens_seen": 1399822, "step": 1349, "train_runtime": 3221.0225, "train_tokens_per_second": 434.589 }, { "epoch": 0.5769847205898067, "grad_norm": 2.682614803314209, "learning_rate": 1.4250267379679145e-05, "loss": 0.12830506265163422, "num_input_tokens_seen": 1401042, "step": 1350, "train_runtime": 3223.1815, "train_tokens_per_second": 434.677 }, { "epoch": 0.5774121166791324, "grad_norm": 3.2086193561553955, "learning_rate": 1.4245989304812835e-05, "loss": 0.15853194892406464, "num_input_tokens_seen": 1401878, "step": 1351, "train_runtime": 3231.5951, "train_tokens_per_second": 433.804 }, { "epoch": 0.5778395127684581, "grad_norm": 2.0538580417633057, "learning_rate": 1.4241711229946524e-05, "loss": 0.12270934134721756, "num_input_tokens_seen": 1402938, "step": 1352, "train_runtime": 3233.6739, "train_tokens_per_second": 433.853 }, { "epoch": 0.578266908857784, "grad_norm": 3.130448579788208, "learning_rate": 1.4237433155080215e-05, "loss": 0.12257538735866547, "num_input_tokens_seen": 1403754, "step": 1353, "train_runtime": 3235.6999, "train_tokens_per_second": 433.833 }, { "epoch": 0.5786943049471097, "grad_norm": 2.407013416290283, "learning_rate": 1.4233155080213905e-05, "loss": 0.12908770143985748, "num_input_tokens_seen": 1405168, "step": 1354, "train_runtime": 3237.9098, "train_tokens_per_second": 433.974 }, { "epoch": 0.5791217010364356, "grad_norm": 2.1559484004974365, "learning_rate": 1.4228877005347594e-05, "loss": 0.1556459665298462, "num_input_tokens_seen": 1406528, "step": 1355, "train_runtime": 3240.0631, "train_tokens_per_second": 434.105 }, { "epoch": 0.5795490971257613, "grad_norm": 2.7706427574157715, "learning_rate": 1.4224598930481284e-05, "loss": 0.19304051995277405, "num_input_tokens_seen": 1407702, "step": 1356, "train_runtime": 3242.1866, "train_tokens_per_second": 434.183 }, { "epoch": 0.579976493215087, "grad_norm": 1.9366533756256104, "learning_rate": 1.4220320855614975e-05, "loss": 0.07077852636575699, "num_input_tokens_seen": 1409130, "step": 1357, "train_runtime": 3244.3929, "train_tokens_per_second": 434.328 }, { "epoch": 0.5804038893044129, "grad_norm": 4.998035430908203, "learning_rate": 1.4216042780748664e-05, "loss": 0.13400226831436157, "num_input_tokens_seen": 1410038, "step": 1358, "train_runtime": 3246.436, "train_tokens_per_second": 434.334 }, { "epoch": 0.5808312853937386, "grad_norm": 2.978074789047241, "learning_rate": 1.4211764705882354e-05, "loss": 0.15089115500450134, "num_input_tokens_seen": 1410926, "step": 1359, "train_runtime": 3248.4758, "train_tokens_per_second": 434.335 }, { "epoch": 0.5812586814830645, "grad_norm": 3.8650741577148438, "learning_rate": 1.4207486631016043e-05, "loss": 0.14304523169994354, "num_input_tokens_seen": 1411922, "step": 1360, "train_runtime": 3250.587, "train_tokens_per_second": 434.359 }, { "epoch": 0.5816860775723902, "grad_norm": 2.8047916889190674, "learning_rate": 1.4203208556149734e-05, "loss": 0.14779841899871826, "num_input_tokens_seen": 1412952, "step": 1361, "train_runtime": 3252.6364, "train_tokens_per_second": 434.402 }, { "epoch": 0.582113473661716, "grad_norm": 3.7442920207977295, "learning_rate": 1.4198930481283424e-05, "loss": 0.19863316416740417, "num_input_tokens_seen": 1414016, "step": 1362, "train_runtime": 3254.7119, "train_tokens_per_second": 434.452 }, { "epoch": 0.5825408697510418, "grad_norm": 2.6118645668029785, "learning_rate": 1.4194652406417113e-05, "loss": 0.1354249268770218, "num_input_tokens_seen": 1415272, "step": 1363, "train_runtime": 3256.816, "train_tokens_per_second": 434.557 }, { "epoch": 0.5829682658403675, "grad_norm": 2.1527950763702393, "learning_rate": 1.4190374331550803e-05, "loss": 0.07591502368450165, "num_input_tokens_seen": 1416104, "step": 1364, "train_runtime": 3258.9519, "train_tokens_per_second": 434.527 }, { "epoch": 0.5833956619296934, "grad_norm": 3.659360647201538, "learning_rate": 1.4186096256684494e-05, "loss": 0.14368534088134766, "num_input_tokens_seen": 1417086, "step": 1365, "train_runtime": 3261.026, "train_tokens_per_second": 434.552 }, { "epoch": 0.5838230580190191, "grad_norm": 3.592390298843384, "learning_rate": 1.4181818181818183e-05, "loss": 0.18800120055675507, "num_input_tokens_seen": 1417778, "step": 1366, "train_runtime": 3262.9897, "train_tokens_per_second": 434.503 }, { "epoch": 0.5842504541083449, "grad_norm": 2.112363576889038, "learning_rate": 1.4177540106951873e-05, "loss": 0.10255702584981918, "num_input_tokens_seen": 1418892, "step": 1367, "train_runtime": 3265.1122, "train_tokens_per_second": 434.561 }, { "epoch": 0.5846778501976707, "grad_norm": 2.676422119140625, "learning_rate": 1.4173262032085562e-05, "loss": 0.10220567137002945, "num_input_tokens_seen": 1419800, "step": 1368, "train_runtime": 3267.1567, "train_tokens_per_second": 434.567 }, { "epoch": 0.5851052462869964, "grad_norm": 2.871175527572632, "learning_rate": 1.4168983957219253e-05, "loss": 0.14551648497581482, "num_input_tokens_seen": 1420856, "step": 1369, "train_runtime": 3269.2633, "train_tokens_per_second": 434.61 }, { "epoch": 0.5855326423763223, "grad_norm": 2.1074609756469727, "learning_rate": 1.4164705882352943e-05, "loss": 0.0820218026638031, "num_input_tokens_seen": 1421690, "step": 1370, "train_runtime": 3271.3095, "train_tokens_per_second": 434.594 }, { "epoch": 0.585960038465648, "grad_norm": 3.1287553310394287, "learning_rate": 1.4160427807486632e-05, "loss": 0.16858786344528198, "num_input_tokens_seen": 1422638, "step": 1371, "train_runtime": 3273.3897, "train_tokens_per_second": 434.607 }, { "epoch": 0.5863874345549738, "grad_norm": 3.2365715503692627, "learning_rate": 1.4156149732620321e-05, "loss": 0.15625795722007751, "num_input_tokens_seen": 1423712, "step": 1372, "train_runtime": 3275.462, "train_tokens_per_second": 434.66 }, { "epoch": 0.5868148306442996, "grad_norm": 2.434537649154663, "learning_rate": 1.4151871657754013e-05, "loss": 0.12010855227708817, "num_input_tokens_seen": 1424810, "step": 1373, "train_runtime": 3277.6151, "train_tokens_per_second": 434.709 }, { "epoch": 0.5872422267336254, "grad_norm": 2.9297800064086914, "learning_rate": 1.4147593582887702e-05, "loss": 0.15987205505371094, "num_input_tokens_seen": 1425684, "step": 1374, "train_runtime": 3279.6771, "train_tokens_per_second": 434.703 }, { "epoch": 0.5876696228229512, "grad_norm": 2.5956802368164062, "learning_rate": 1.4143315508021392e-05, "loss": 0.14205943048000336, "num_input_tokens_seen": 1427042, "step": 1375, "train_runtime": 3281.8156, "train_tokens_per_second": 434.833 }, { "epoch": 0.588097018912277, "grad_norm": 2.2184929847717285, "learning_rate": 1.4139037433155081e-05, "loss": 0.13644662499427795, "num_input_tokens_seen": 1428144, "step": 1376, "train_runtime": 3283.9122, "train_tokens_per_second": 434.891 }, { "epoch": 0.5885244150016027, "grad_norm": 4.882390022277832, "learning_rate": 1.4134759358288772e-05, "loss": 0.20036539435386658, "num_input_tokens_seen": 1428934, "step": 1377, "train_runtime": 3285.9482, "train_tokens_per_second": 434.862 }, { "epoch": 0.5889518110909285, "grad_norm": 2.24263858795166, "learning_rate": 1.4130481283422462e-05, "loss": 0.12761899828910828, "num_input_tokens_seen": 1430552, "step": 1378, "train_runtime": 3288.1843, "train_tokens_per_second": 435.058 }, { "epoch": 0.5893792071802543, "grad_norm": 2.6268224716186523, "learning_rate": 1.4126203208556151e-05, "loss": 0.13226649165153503, "num_input_tokens_seen": 1431452, "step": 1379, "train_runtime": 3290.2762, "train_tokens_per_second": 435.055 }, { "epoch": 0.5898066032695801, "grad_norm": 4.0447678565979, "learning_rate": 1.412192513368984e-05, "loss": 0.11312992870807648, "num_input_tokens_seen": 1432088, "step": 1380, "train_runtime": 3292.2512, "train_tokens_per_second": 434.987 }, { "epoch": 0.5902339993589059, "grad_norm": 2.023045778274536, "learning_rate": 1.4117647058823532e-05, "loss": 0.07444490492343903, "num_input_tokens_seen": 1433322, "step": 1381, "train_runtime": 3301.1164, "train_tokens_per_second": 434.193 }, { "epoch": 0.5906613954482316, "grad_norm": 3.653201103210449, "learning_rate": 1.4113368983957221e-05, "loss": 0.20476751029491425, "num_input_tokens_seen": 1434046, "step": 1382, "train_runtime": 3303.1286, "train_tokens_per_second": 434.148 }, { "epoch": 0.5910887915375574, "grad_norm": 3.6361706256866455, "learning_rate": 1.410909090909091e-05, "loss": 0.16467516124248505, "num_input_tokens_seen": 1434882, "step": 1383, "train_runtime": 3305.316, "train_tokens_per_second": 434.113 }, { "epoch": 0.5915161876268832, "grad_norm": 2.283289909362793, "learning_rate": 1.41048128342246e-05, "loss": 0.14137494564056396, "num_input_tokens_seen": 1436088, "step": 1384, "train_runtime": 3307.6527, "train_tokens_per_second": 434.171 }, { "epoch": 0.591943583716209, "grad_norm": 2.8381502628326416, "learning_rate": 1.4100534759358291e-05, "loss": 0.14940938353538513, "num_input_tokens_seen": 1437124, "step": 1385, "train_runtime": 3309.7282, "train_tokens_per_second": 434.212 }, { "epoch": 0.5923709798055348, "grad_norm": 2.9985997676849365, "learning_rate": 1.409625668449198e-05, "loss": 0.1341642588376999, "num_input_tokens_seen": 1438190, "step": 1386, "train_runtime": 3311.8006, "train_tokens_per_second": 434.262 }, { "epoch": 0.5927983758948605, "grad_norm": 2.535414218902588, "learning_rate": 1.409197860962567e-05, "loss": 0.13133931159973145, "num_input_tokens_seen": 1439252, "step": 1387, "train_runtime": 3313.8776, "train_tokens_per_second": 434.311 }, { "epoch": 0.5932257719841864, "grad_norm": 3.5592312812805176, "learning_rate": 1.408770053475936e-05, "loss": 0.10969515144824982, "num_input_tokens_seen": 1439840, "step": 1388, "train_runtime": 3315.8, "train_tokens_per_second": 434.236 }, { "epoch": 0.5936531680735121, "grad_norm": 3.807300329208374, "learning_rate": 1.408342245989305e-05, "loss": 0.19459311664104462, "num_input_tokens_seen": 1440750, "step": 1389, "train_runtime": 3317.8803, "train_tokens_per_second": 434.238 }, { "epoch": 0.5940805641628379, "grad_norm": 2.7336909770965576, "learning_rate": 1.407914438502674e-05, "loss": 0.14076997339725494, "num_input_tokens_seen": 1441662, "step": 1390, "train_runtime": 3319.9232, "train_tokens_per_second": 434.246 }, { "epoch": 0.5945079602521637, "grad_norm": 3.067060947418213, "learning_rate": 1.407486631016043e-05, "loss": 0.17666979134082794, "num_input_tokens_seen": 1442694, "step": 1391, "train_runtime": 3322.0132, "train_tokens_per_second": 434.283 }, { "epoch": 0.5949353563414895, "grad_norm": 2.2158451080322266, "learning_rate": 1.4070588235294119e-05, "loss": 0.1015886515378952, "num_input_tokens_seen": 1443642, "step": 1392, "train_runtime": 3324.0748, "train_tokens_per_second": 434.299 }, { "epoch": 0.5953627524308153, "grad_norm": 4.7660746574401855, "learning_rate": 1.406631016042781e-05, "loss": 0.16630813479423523, "num_input_tokens_seen": 1444738, "step": 1393, "train_runtime": 3326.2039, "train_tokens_per_second": 434.35 }, { "epoch": 0.595790148520141, "grad_norm": 4.274450778961182, "learning_rate": 1.40620320855615e-05, "loss": 0.25991204380989075, "num_input_tokens_seen": 1445596, "step": 1394, "train_runtime": 3328.251, "train_tokens_per_second": 434.341 }, { "epoch": 0.5962175446094669, "grad_norm": 3.8187432289123535, "learning_rate": 1.4057754010695189e-05, "loss": 0.17650507390499115, "num_input_tokens_seen": 1446378, "step": 1395, "train_runtime": 3330.2601, "train_tokens_per_second": 434.314 }, { "epoch": 0.5966449406987926, "grad_norm": 3.882115364074707, "learning_rate": 1.4053475935828877e-05, "loss": 0.20205016434192657, "num_input_tokens_seen": 1447422, "step": 1396, "train_runtime": 3332.3464, "train_tokens_per_second": 434.355 }, { "epoch": 0.5970723367881184, "grad_norm": 3.42087721824646, "learning_rate": 1.404919786096257e-05, "loss": 0.2658466398715973, "num_input_tokens_seen": 1449220, "step": 1397, "train_runtime": 3334.5762, "train_tokens_per_second": 434.604 }, { "epoch": 0.5974997328774442, "grad_norm": 3.7142629623413086, "learning_rate": 1.4044919786096259e-05, "loss": 0.23548118770122528, "num_input_tokens_seen": 1449952, "step": 1398, "train_runtime": 3336.5859, "train_tokens_per_second": 434.562 }, { "epoch": 0.5979271289667699, "grad_norm": 2.3331501483917236, "learning_rate": 1.4040641711229948e-05, "loss": 0.05423790216445923, "num_input_tokens_seen": 1450596, "step": 1399, "train_runtime": 3338.5411, "train_tokens_per_second": 434.5 }, { "epoch": 0.5983545250560958, "grad_norm": 2.72188401222229, "learning_rate": 1.4036363636363636e-05, "loss": 0.12585221230983734, "num_input_tokens_seen": 1451548, "step": 1400, "train_runtime": 3340.6263, "train_tokens_per_second": 434.514 }, { "epoch": 0.5987819211454215, "grad_norm": 2.5179193019866943, "learning_rate": 1.4032085561497329e-05, "loss": 0.15464454889297485, "num_input_tokens_seen": 1452764, "step": 1401, "train_runtime": 3342.7816, "train_tokens_per_second": 434.597 }, { "epoch": 0.5992093172347474, "grad_norm": 2.6366610527038574, "learning_rate": 1.4027807486631018e-05, "loss": 0.11611218750476837, "num_input_tokens_seen": 1453610, "step": 1402, "train_runtime": 3344.8676, "train_tokens_per_second": 434.579 }, { "epoch": 0.5996367133240731, "grad_norm": 2.4527528285980225, "learning_rate": 1.4023529411764706e-05, "loss": 0.10760036110877991, "num_input_tokens_seen": 1454470, "step": 1403, "train_runtime": 3346.9549, "train_tokens_per_second": 434.565 }, { "epoch": 0.6000641094133988, "grad_norm": 3.5098700523376465, "learning_rate": 1.4019251336898396e-05, "loss": 0.12446847558021545, "num_input_tokens_seen": 1455998, "step": 1404, "train_runtime": 3349.2072, "train_tokens_per_second": 434.729 }, { "epoch": 0.6000641094133988, "eval_loss": 0.5446999669075012, "eval_runtime": 58.011, "eval_samples_per_second": 17.204, "eval_steps_per_second": 8.602, "num_input_tokens_seen": 1455998, "step": 1404 }, { "epoch": 0.6004915055027247, "grad_norm": 3.699281692504883, "learning_rate": 1.4014973262032088e-05, "loss": 0.19538527727127075, "num_input_tokens_seen": 1456830, "step": 1405, "train_runtime": 3409.262, "train_tokens_per_second": 427.315 }, { "epoch": 0.6009189015920504, "grad_norm": 3.037367105484009, "learning_rate": 1.4010695187165778e-05, "loss": 0.19640500843524933, "num_input_tokens_seen": 1457788, "step": 1406, "train_runtime": 3411.3672, "train_tokens_per_second": 427.332 }, { "epoch": 0.6013462976813763, "grad_norm": 3.306971788406372, "learning_rate": 1.4006417112299466e-05, "loss": 0.18082109093666077, "num_input_tokens_seen": 1458838, "step": 1407, "train_runtime": 3413.4472, "train_tokens_per_second": 427.38 }, { "epoch": 0.601773693770702, "grad_norm": 2.507986545562744, "learning_rate": 1.4002139037433155e-05, "loss": 0.11207126826047897, "num_input_tokens_seen": 1459840, "step": 1408, "train_runtime": 3415.5138, "train_tokens_per_second": 427.414 }, { "epoch": 0.6022010898600277, "grad_norm": 2.9219322204589844, "learning_rate": 1.3997860962566848e-05, "loss": 0.19506515562534332, "num_input_tokens_seen": 1460590, "step": 1409, "train_runtime": 3417.5371, "train_tokens_per_second": 427.381 }, { "epoch": 0.6026284859493536, "grad_norm": 2.4391496181488037, "learning_rate": 1.3993582887700536e-05, "loss": 0.15730175375938416, "num_input_tokens_seen": 1462106, "step": 1410, "train_runtime": 3419.7508, "train_tokens_per_second": 427.548 }, { "epoch": 0.6030558820386793, "grad_norm": 2.110074996948242, "learning_rate": 1.3989304812834225e-05, "loss": 0.10840006917715073, "num_input_tokens_seen": 1463456, "step": 1411, "train_runtime": 3428.6259, "train_tokens_per_second": 426.835 }, { "epoch": 0.6034832781280052, "grad_norm": 2.5467004776000977, "learning_rate": 1.3985026737967915e-05, "loss": 0.13251107931137085, "num_input_tokens_seen": 1464550, "step": 1412, "train_runtime": 3430.7299, "train_tokens_per_second": 426.892 }, { "epoch": 0.6039106742173309, "grad_norm": 3.6813597679138184, "learning_rate": 1.3980748663101606e-05, "loss": 0.17481614649295807, "num_input_tokens_seen": 1465682, "step": 1413, "train_runtime": 3433.2347, "train_tokens_per_second": 426.91 }, { "epoch": 0.6043380703066566, "grad_norm": 2.6558637619018555, "learning_rate": 1.3976470588235295e-05, "loss": 0.17672036588191986, "num_input_tokens_seen": 1466848, "step": 1414, "train_runtime": 3435.4078, "train_tokens_per_second": 426.979 }, { "epoch": 0.6047654663959825, "grad_norm": 2.469191789627075, "learning_rate": 1.3972192513368985e-05, "loss": 0.08628380298614502, "num_input_tokens_seen": 1467706, "step": 1415, "train_runtime": 3437.4489, "train_tokens_per_second": 426.975 }, { "epoch": 0.6051928624853082, "grad_norm": 3.496084690093994, "learning_rate": 1.3967914438502674e-05, "loss": 0.22254379093647003, "num_input_tokens_seen": 1468522, "step": 1416, "train_runtime": 3439.4674, "train_tokens_per_second": 426.962 }, { "epoch": 0.6056202585746341, "grad_norm": 2.5808959007263184, "learning_rate": 1.3963636363636365e-05, "loss": 0.12229837477207184, "num_input_tokens_seen": 1469476, "step": 1417, "train_runtime": 3441.5663, "train_tokens_per_second": 426.979 }, { "epoch": 0.6060476546639598, "grad_norm": 2.2333199977874756, "learning_rate": 1.3959358288770055e-05, "loss": 0.1297299712896347, "num_input_tokens_seen": 1470466, "step": 1418, "train_runtime": 3443.6979, "train_tokens_per_second": 427.002 }, { "epoch": 0.6064750507532856, "grad_norm": 2.1581215858459473, "learning_rate": 1.3955080213903744e-05, "loss": 0.08850215375423431, "num_input_tokens_seen": 1471740, "step": 1419, "train_runtime": 3445.8413, "train_tokens_per_second": 427.106 }, { "epoch": 0.6069024468426114, "grad_norm": 2.688570976257324, "learning_rate": 1.3950802139037433e-05, "loss": 0.10546266287565231, "num_input_tokens_seen": 1472736, "step": 1420, "train_runtime": 3447.9303, "train_tokens_per_second": 427.136 }, { "epoch": 0.6073298429319371, "grad_norm": 3.4864931106567383, "learning_rate": 1.3946524064171123e-05, "loss": 0.17743486166000366, "num_input_tokens_seen": 1473460, "step": 1421, "train_runtime": 3449.9209, "train_tokens_per_second": 427.1 }, { "epoch": 0.607757239021263, "grad_norm": 2.444497585296631, "learning_rate": 1.3942245989304814e-05, "loss": 0.09064759314060211, "num_input_tokens_seen": 1474266, "step": 1422, "train_runtime": 3451.9487, "train_tokens_per_second": 427.082 }, { "epoch": 0.6081846351105887, "grad_norm": 4.110256195068359, "learning_rate": 1.3937967914438504e-05, "loss": 0.1383572667837143, "num_input_tokens_seen": 1475044, "step": 1423, "train_runtime": 3453.9683, "train_tokens_per_second": 427.058 }, { "epoch": 0.6086120311999145, "grad_norm": 4.379847049713135, "learning_rate": 1.3933689839572193e-05, "loss": 0.16037997603416443, "num_input_tokens_seen": 1475826, "step": 1424, "train_runtime": 3455.9833, "train_tokens_per_second": 427.035 }, { "epoch": 0.6090394272892403, "grad_norm": 3.4214606285095215, "learning_rate": 1.3929411764705882e-05, "loss": 0.14068466424942017, "num_input_tokens_seen": 1476594, "step": 1425, "train_runtime": 3458.0036, "train_tokens_per_second": 427.008 }, { "epoch": 0.6094668233785661, "grad_norm": 2.551879644393921, "learning_rate": 1.3925133689839574e-05, "loss": 0.10875682532787323, "num_input_tokens_seen": 1477446, "step": 1426, "train_runtime": 3460.0547, "train_tokens_per_second": 427.001 }, { "epoch": 0.6098942194678919, "grad_norm": 3.4368040561676025, "learning_rate": 1.3920855614973263e-05, "loss": 0.18043841421604156, "num_input_tokens_seen": 1478308, "step": 1427, "train_runtime": 3462.1006, "train_tokens_per_second": 426.997 }, { "epoch": 0.6103216155572176, "grad_norm": 3.0184576511383057, "learning_rate": 1.3916577540106952e-05, "loss": 0.09612550586462021, "num_input_tokens_seen": 1479076, "step": 1428, "train_runtime": 3464.142, "train_tokens_per_second": 426.967 }, { "epoch": 0.6107490116465434, "grad_norm": 2.936882734298706, "learning_rate": 1.3912299465240642e-05, "loss": 0.08449357748031616, "num_input_tokens_seen": 1479708, "step": 1429, "train_runtime": 3466.0802, "train_tokens_per_second": 426.911 }, { "epoch": 0.6111764077358692, "grad_norm": 2.52876615524292, "learning_rate": 1.3908021390374333e-05, "loss": 0.16039231419563293, "num_input_tokens_seen": 1480992, "step": 1430, "train_runtime": 3468.2199, "train_tokens_per_second": 427.018 }, { "epoch": 0.611603803825195, "grad_norm": 3.0217013359069824, "learning_rate": 1.3903743315508022e-05, "loss": 0.11687301099300385, "num_input_tokens_seen": 1482360, "step": 1431, "train_runtime": 3470.3997, "train_tokens_per_second": 427.144 }, { "epoch": 0.6120311999145208, "grad_norm": 2.031693696975708, "learning_rate": 1.3899465240641712e-05, "loss": 0.09202948212623596, "num_input_tokens_seen": 1483492, "step": 1432, "train_runtime": 3472.4846, "train_tokens_per_second": 427.213 }, { "epoch": 0.6124585960038466, "grad_norm": 2.821016788482666, "learning_rate": 1.3895187165775401e-05, "loss": 0.17000722885131836, "num_input_tokens_seen": 1484432, "step": 1433, "train_runtime": 3474.5355, "train_tokens_per_second": 427.232 }, { "epoch": 0.6128859920931723, "grad_norm": 2.8982903957366943, "learning_rate": 1.3890909090909093e-05, "loss": 0.17944198846817017, "num_input_tokens_seen": 1485592, "step": 1434, "train_runtime": 3476.654, "train_tokens_per_second": 427.305 }, { "epoch": 0.6133133881824981, "grad_norm": 3.3795251846313477, "learning_rate": 1.3886631016042782e-05, "loss": 0.178505539894104, "num_input_tokens_seen": 1486452, "step": 1435, "train_runtime": 3478.7327, "train_tokens_per_second": 427.297 }, { "epoch": 0.6137407842718239, "grad_norm": 3.649630546569824, "learning_rate": 1.3882352941176471e-05, "loss": 0.17836499214172363, "num_input_tokens_seen": 1487382, "step": 1436, "train_runtime": 3480.8015, "train_tokens_per_second": 427.31 }, { "epoch": 0.6141681803611497, "grad_norm": 3.3058955669403076, "learning_rate": 1.3878074866310161e-05, "loss": 0.22165974974632263, "num_input_tokens_seen": 1488180, "step": 1437, "train_runtime": 3482.8414, "train_tokens_per_second": 427.289 }, { "epoch": 0.6145955764504755, "grad_norm": 2.4731411933898926, "learning_rate": 1.3873796791443852e-05, "loss": 0.09999997913837433, "num_input_tokens_seen": 1489138, "step": 1438, "train_runtime": 3484.9521, "train_tokens_per_second": 427.305 }, { "epoch": 0.6150229725398013, "grad_norm": 3.4230947494506836, "learning_rate": 1.3869518716577541e-05, "loss": 0.0926116406917572, "num_input_tokens_seen": 1490098, "step": 1439, "train_runtime": 3487.0557, "train_tokens_per_second": 427.323 }, { "epoch": 0.615450368629127, "grad_norm": 2.837399959564209, "learning_rate": 1.3865240641711231e-05, "loss": 0.13646970689296722, "num_input_tokens_seen": 1490940, "step": 1440, "train_runtime": 3489.0748, "train_tokens_per_second": 427.317 }, { "epoch": 0.6158777647184528, "grad_norm": 5.884909152984619, "learning_rate": 1.386096256684492e-05, "loss": 0.11018891632556915, "num_input_tokens_seen": 1491526, "step": 1441, "train_runtime": 3498.0344, "train_tokens_per_second": 426.39 }, { "epoch": 0.6163051608077786, "grad_norm": 3.2749173641204834, "learning_rate": 1.3856684491978611e-05, "loss": 0.16875940561294556, "num_input_tokens_seen": 1492750, "step": 1442, "train_runtime": 3500.1556, "train_tokens_per_second": 426.481 }, { "epoch": 0.6167325568971044, "grad_norm": 2.897189140319824, "learning_rate": 1.3852406417112301e-05, "loss": 0.11121410876512527, "num_input_tokens_seen": 1493648, "step": 1443, "train_runtime": 3502.2555, "train_tokens_per_second": 426.482 }, { "epoch": 0.6171599529864302, "grad_norm": 3.547976493835449, "learning_rate": 1.384812834224599e-05, "loss": 0.1049327403306961, "num_input_tokens_seen": 1494386, "step": 1444, "train_runtime": 3504.2846, "train_tokens_per_second": 426.445 }, { "epoch": 0.617587349075756, "grad_norm": 2.83156156539917, "learning_rate": 1.384385026737968e-05, "loss": 0.13763849437236786, "num_input_tokens_seen": 1495750, "step": 1445, "train_runtime": 3506.4312, "train_tokens_per_second": 426.573 }, { "epoch": 0.6180147451650817, "grad_norm": 3.80690336227417, "learning_rate": 1.3839572192513371e-05, "loss": 0.21457195281982422, "num_input_tokens_seen": 1496632, "step": 1446, "train_runtime": 3508.4691, "train_tokens_per_second": 426.577 }, { "epoch": 0.6184421412544076, "grad_norm": 3.0698084831237793, "learning_rate": 1.383529411764706e-05, "loss": 0.13854141533374786, "num_input_tokens_seen": 1497298, "step": 1447, "train_runtime": 3510.4857, "train_tokens_per_second": 426.522 }, { "epoch": 0.6188695373437333, "grad_norm": 3.7672619819641113, "learning_rate": 1.383101604278075e-05, "loss": 0.21939069032669067, "num_input_tokens_seen": 1497988, "step": 1448, "train_runtime": 3512.4619, "train_tokens_per_second": 426.478 }, { "epoch": 0.6192969334330591, "grad_norm": 2.3915205001831055, "learning_rate": 1.382673796791444e-05, "loss": 0.08274801075458527, "num_input_tokens_seen": 1498954, "step": 1449, "train_runtime": 3514.5473, "train_tokens_per_second": 426.5 }, { "epoch": 0.6197243295223849, "grad_norm": 2.8864173889160156, "learning_rate": 1.382245989304813e-05, "loss": 0.09981369227170944, "num_input_tokens_seen": 1499586, "step": 1450, "train_runtime": 3516.4958, "train_tokens_per_second": 426.443 }, { "epoch": 0.6201517256117106, "grad_norm": 3.0598063468933105, "learning_rate": 1.381818181818182e-05, "loss": 0.14454570412635803, "num_input_tokens_seen": 1500474, "step": 1451, "train_runtime": 3518.5357, "train_tokens_per_second": 426.448 }, { "epoch": 0.6205791217010365, "grad_norm": 2.9035451412200928, "learning_rate": 1.381390374331551e-05, "loss": 0.1534239947795868, "num_input_tokens_seen": 1501270, "step": 1452, "train_runtime": 3520.6057, "train_tokens_per_second": 426.424 }, { "epoch": 0.6210065177903622, "grad_norm": 3.257843255996704, "learning_rate": 1.3809625668449199e-05, "loss": 0.11779599636793137, "num_input_tokens_seen": 1502062, "step": 1453, "train_runtime": 3522.6247, "train_tokens_per_second": 426.404 }, { "epoch": 0.621433913879688, "grad_norm": 2.6349258422851562, "learning_rate": 1.380534759358289e-05, "loss": 0.10472257435321808, "num_input_tokens_seen": 1502904, "step": 1454, "train_runtime": 3524.6418, "train_tokens_per_second": 426.399 }, { "epoch": 0.6218613099690138, "grad_norm": 3.440901756286621, "learning_rate": 1.380106951871658e-05, "loss": 0.12523989379405975, "num_input_tokens_seen": 1503628, "step": 1455, "train_runtime": 3526.6536, "train_tokens_per_second": 426.361 }, { "epoch": 0.6222887060583395, "grad_norm": 4.631787300109863, "learning_rate": 1.3796791443850269e-05, "loss": 0.14164529740810394, "num_input_tokens_seen": 1504378, "step": 1456, "train_runtime": 3528.7365, "train_tokens_per_second": 426.322 }, { "epoch": 0.6227161021476654, "grad_norm": 3.1214423179626465, "learning_rate": 1.3792513368983958e-05, "loss": 0.16745080053806305, "num_input_tokens_seen": 1505316, "step": 1457, "train_runtime": 3530.809, "train_tokens_per_second": 426.337 }, { "epoch": 0.6231434982369911, "grad_norm": 3.417099952697754, "learning_rate": 1.378823529411765e-05, "loss": 0.22412510216236115, "num_input_tokens_seen": 1506384, "step": 1458, "train_runtime": 3532.9084, "train_tokens_per_second": 426.386 }, { "epoch": 0.623570894326317, "grad_norm": 2.4870553016662598, "learning_rate": 1.3783957219251339e-05, "loss": 0.12703093886375427, "num_input_tokens_seen": 1507456, "step": 1459, "train_runtime": 3534.9855, "train_tokens_per_second": 426.439 }, { "epoch": 0.6239982904156427, "grad_norm": 3.1759095191955566, "learning_rate": 1.3779679144385028e-05, "loss": 0.11046059429645538, "num_input_tokens_seen": 1508336, "step": 1460, "train_runtime": 3537.0315, "train_tokens_per_second": 426.441 }, { "epoch": 0.6244256865049684, "grad_norm": 2.964648485183716, "learning_rate": 1.3775401069518716e-05, "loss": 0.1784340739250183, "num_input_tokens_seen": 1509728, "step": 1461, "train_runtime": 3539.1928, "train_tokens_per_second": 426.574 }, { "epoch": 0.6248530825942943, "grad_norm": 2.6775224208831787, "learning_rate": 1.3771122994652409e-05, "loss": 0.11438018828630447, "num_input_tokens_seen": 1510484, "step": 1462, "train_runtime": 3541.1968, "train_tokens_per_second": 426.546 }, { "epoch": 0.62528047868362, "grad_norm": 3.12679386138916, "learning_rate": 1.3766844919786098e-05, "loss": 0.21539583802223206, "num_input_tokens_seen": 1511506, "step": 1463, "train_runtime": 3543.2609, "train_tokens_per_second": 426.586 }, { "epoch": 0.6257078747729459, "grad_norm": 2.8939411640167236, "learning_rate": 1.3762566844919786e-05, "loss": 0.12157222628593445, "num_input_tokens_seen": 1512420, "step": 1464, "train_runtime": 3545.2975, "train_tokens_per_second": 426.599 }, { "epoch": 0.6261352708622716, "grad_norm": 2.128225564956665, "learning_rate": 1.3758288770053475e-05, "loss": 0.10394015908241272, "num_input_tokens_seen": 1513738, "step": 1465, "train_runtime": 3547.4778, "train_tokens_per_second": 426.708 }, { "epoch": 0.6265626669515973, "grad_norm": 4.000294208526611, "learning_rate": 1.3754010695187168e-05, "loss": 0.1444389969110489, "num_input_tokens_seen": 1514442, "step": 1466, "train_runtime": 3549.4848, "train_tokens_per_second": 426.665 }, { "epoch": 0.6269900630409232, "grad_norm": 4.2455291748046875, "learning_rate": 1.3749732620320858e-05, "loss": 0.1115453839302063, "num_input_tokens_seen": 1515064, "step": 1467, "train_runtime": 3551.4289, "train_tokens_per_second": 426.607 }, { "epoch": 0.6274174591302489, "grad_norm": 9.257857322692871, "learning_rate": 1.3745454545454546e-05, "loss": 0.22937318682670593, "num_input_tokens_seen": 1516422, "step": 1468, "train_runtime": 3553.5886, "train_tokens_per_second": 426.73 }, { "epoch": 0.6278448552195748, "grad_norm": 2.7044317722320557, "learning_rate": 1.3741176470588235e-05, "loss": 0.13837867975234985, "num_input_tokens_seen": 1517430, "step": 1469, "train_runtime": 3555.6592, "train_tokens_per_second": 426.765 }, { "epoch": 0.6282722513089005, "grad_norm": 3.1235721111297607, "learning_rate": 1.3736898395721928e-05, "loss": 0.09635145962238312, "num_input_tokens_seen": 1518076, "step": 1470, "train_runtime": 3557.63, "train_tokens_per_second": 426.71 }, { "epoch": 0.6286996473982263, "grad_norm": 2.6795527935028076, "learning_rate": 1.3732620320855616e-05, "loss": 0.11742737144231796, "num_input_tokens_seen": 1519230, "step": 1471, "train_runtime": 3566.3589, "train_tokens_per_second": 425.989 }, { "epoch": 0.6291270434875521, "grad_norm": 2.943836212158203, "learning_rate": 1.3728342245989305e-05, "loss": 0.09473095834255219, "num_input_tokens_seen": 1519822, "step": 1472, "train_runtime": 3568.3578, "train_tokens_per_second": 425.916 }, { "epoch": 0.6295544395768778, "grad_norm": 2.960627317428589, "learning_rate": 1.3724064171122994e-05, "loss": 0.08305860310792923, "num_input_tokens_seen": 1520542, "step": 1473, "train_runtime": 3570.4332, "train_tokens_per_second": 425.87 }, { "epoch": 0.6299818356662037, "grad_norm": 2.246575355529785, "learning_rate": 1.3719786096256687e-05, "loss": 0.10312852263450623, "num_input_tokens_seen": 1521506, "step": 1474, "train_runtime": 3572.588, "train_tokens_per_second": 425.883 }, { "epoch": 0.6304092317555294, "grad_norm": 2.5485050678253174, "learning_rate": 1.3715508021390375e-05, "loss": 0.09694022685289383, "num_input_tokens_seen": 1522358, "step": 1475, "train_runtime": 3574.6459, "train_tokens_per_second": 425.877 }, { "epoch": 0.6308366278448552, "grad_norm": 2.582261085510254, "learning_rate": 1.3711229946524064e-05, "loss": 0.13314642012119293, "num_input_tokens_seen": 1523224, "step": 1476, "train_runtime": 3576.8789, "train_tokens_per_second": 425.853 }, { "epoch": 0.631264023934181, "grad_norm": 3.18725323677063, "learning_rate": 1.3706951871657754e-05, "loss": 0.14739792048931122, "num_input_tokens_seen": 1524170, "step": 1477, "train_runtime": 3578.9434, "train_tokens_per_second": 425.872 }, { "epoch": 0.6316914200235068, "grad_norm": 3.830138683319092, "learning_rate": 1.3702673796791445e-05, "loss": 0.10739552974700928, "num_input_tokens_seen": 1524894, "step": 1478, "train_runtime": 3580.9907, "train_tokens_per_second": 425.83 }, { "epoch": 0.6321188161128326, "grad_norm": 2.9134812355041504, "learning_rate": 1.3698395721925135e-05, "loss": 0.10831707715988159, "num_input_tokens_seen": 1525752, "step": 1479, "train_runtime": 3583.0466, "train_tokens_per_second": 425.825 }, { "epoch": 0.6325462122021583, "grad_norm": 2.2162744998931885, "learning_rate": 1.3694117647058824e-05, "loss": 0.10464231669902802, "num_input_tokens_seen": 1526760, "step": 1480, "train_runtime": 3585.1445, "train_tokens_per_second": 425.857 }, { "epoch": 0.6329736082914841, "grad_norm": 3.623624324798584, "learning_rate": 1.3689839572192513e-05, "loss": 0.13597632944583893, "num_input_tokens_seen": 1527564, "step": 1481, "train_runtime": 3587.1526, "train_tokens_per_second": 425.843 }, { "epoch": 0.6334010043808099, "grad_norm": 1.9764485359191895, "learning_rate": 1.3685561497326205e-05, "loss": 0.09632347524166107, "num_input_tokens_seen": 1528844, "step": 1482, "train_runtime": 3589.335, "train_tokens_per_second": 425.941 }, { "epoch": 0.6338284004701357, "grad_norm": 2.834679126739502, "learning_rate": 1.3681283422459894e-05, "loss": 0.14813737571239471, "num_input_tokens_seen": 1529794, "step": 1483, "train_runtime": 3591.4052, "train_tokens_per_second": 425.96 }, { "epoch": 0.6342557965594615, "grad_norm": 3.9278035163879395, "learning_rate": 1.3677005347593583e-05, "loss": 0.14398543536663055, "num_input_tokens_seen": 1530606, "step": 1484, "train_runtime": 3593.4261, "train_tokens_per_second": 425.946 }, { "epoch": 0.6346831926487873, "grad_norm": 2.2874929904937744, "learning_rate": 1.3672727272727273e-05, "loss": 0.11771330237388611, "num_input_tokens_seen": 1531714, "step": 1485, "train_runtime": 3595.5683, "train_tokens_per_second": 426.001 }, { "epoch": 0.635110588738113, "grad_norm": 3.821604013442993, "learning_rate": 1.3668449197860964e-05, "loss": 0.2711103856563568, "num_input_tokens_seen": 1532570, "step": 1486, "train_runtime": 3597.6115, "train_tokens_per_second": 425.997 }, { "epoch": 0.6355379848274388, "grad_norm": 3.055563449859619, "learning_rate": 1.3664171122994653e-05, "loss": 0.1839410960674286, "num_input_tokens_seen": 1533636, "step": 1487, "train_runtime": 3599.6752, "train_tokens_per_second": 426.048 }, { "epoch": 0.6359653809167646, "grad_norm": 3.095349073410034, "learning_rate": 1.3659893048128343e-05, "loss": 0.17613187432289124, "num_input_tokens_seen": 1534644, "step": 1488, "train_runtime": 3601.7773, "train_tokens_per_second": 426.08 }, { "epoch": 0.6363927770060904, "grad_norm": 2.953834295272827, "learning_rate": 1.3655614973262032e-05, "loss": 0.11626684665679932, "num_input_tokens_seen": 1535460, "step": 1489, "train_runtime": 3603.8341, "train_tokens_per_second": 426.063 }, { "epoch": 0.6368201730954162, "grad_norm": 2.8666796684265137, "learning_rate": 1.3651336898395723e-05, "loss": 0.11040861159563065, "num_input_tokens_seen": 1536424, "step": 1490, "train_runtime": 3605.9671, "train_tokens_per_second": 426.078 }, { "epoch": 0.637247569184742, "grad_norm": 2.5996861457824707, "learning_rate": 1.3647058823529413e-05, "loss": 0.18704327940940857, "num_input_tokens_seen": 1538244, "step": 1491, "train_runtime": 3608.2906, "train_tokens_per_second": 426.308 }, { "epoch": 0.6376749652740678, "grad_norm": 2.9655489921569824, "learning_rate": 1.3642780748663102e-05, "loss": 0.2014021873474121, "num_input_tokens_seen": 1539572, "step": 1492, "train_runtime": 3610.4583, "train_tokens_per_second": 426.42 }, { "epoch": 0.6381023613633935, "grad_norm": 4.0340142250061035, "learning_rate": 1.3638502673796792e-05, "loss": 0.18054339289665222, "num_input_tokens_seen": 1540412, "step": 1493, "train_runtime": 3612.4996, "train_tokens_per_second": 426.412 }, { "epoch": 0.6385297574527193, "grad_norm": 4.150583744049072, "learning_rate": 1.3634224598930483e-05, "loss": 0.11605513095855713, "num_input_tokens_seen": 1541012, "step": 1494, "train_runtime": 3614.4356, "train_tokens_per_second": 426.349 }, { "epoch": 0.6389571535420451, "grad_norm": 1.9334378242492676, "learning_rate": 1.3629946524064172e-05, "loss": 0.08048471808433533, "num_input_tokens_seen": 1541764, "step": 1495, "train_runtime": 3616.4707, "train_tokens_per_second": 426.317 }, { "epoch": 0.6393845496313709, "grad_norm": 2.171452045440674, "learning_rate": 1.3625668449197862e-05, "loss": 0.08667883276939392, "num_input_tokens_seen": 1543226, "step": 1496, "train_runtime": 3618.6214, "train_tokens_per_second": 426.468 }, { "epoch": 0.6398119457206967, "grad_norm": 3.2747793197631836, "learning_rate": 1.3621390374331551e-05, "loss": 0.13285577297210693, "num_input_tokens_seen": 1543984, "step": 1497, "train_runtime": 3620.6189, "train_tokens_per_second": 426.442 }, { "epoch": 0.6402393418100224, "grad_norm": 2.9296987056732178, "learning_rate": 1.3617112299465242e-05, "loss": 0.18483984470367432, "num_input_tokens_seen": 1545230, "step": 1498, "train_runtime": 3622.7598, "train_tokens_per_second": 426.534 }, { "epoch": 0.6406667378993482, "grad_norm": 2.39042592048645, "learning_rate": 1.3612834224598932e-05, "loss": 0.11871865391731262, "num_input_tokens_seen": 1546236, "step": 1499, "train_runtime": 3624.8432, "train_tokens_per_second": 426.566 }, { "epoch": 0.641094133988674, "grad_norm": 3.414876937866211, "learning_rate": 1.3608556149732621e-05, "loss": 0.11641217768192291, "num_input_tokens_seen": 1546874, "step": 1500, "train_runtime": 3626.8248, "train_tokens_per_second": 426.509 }, { "epoch": 0.6415215300779998, "grad_norm": 2.3719992637634277, "learning_rate": 1.360427807486631e-05, "loss": 0.10685586929321289, "num_input_tokens_seen": 1547780, "step": 1501, "train_runtime": 3635.5739, "train_tokens_per_second": 425.732 }, { "epoch": 0.6419489261673256, "grad_norm": 2.7630510330200195, "learning_rate": 1.3600000000000002e-05, "loss": 0.11462070047855377, "num_input_tokens_seen": 1548564, "step": 1502, "train_runtime": 3637.6234, "train_tokens_per_second": 425.708 }, { "epoch": 0.6423763222566513, "grad_norm": 4.8656744956970215, "learning_rate": 1.3595721925133691e-05, "loss": 0.212483748793602, "num_input_tokens_seen": 1549224, "step": 1503, "train_runtime": 3639.7043, "train_tokens_per_second": 425.646 }, { "epoch": 0.6428037183459772, "grad_norm": 3.504530668258667, "learning_rate": 1.359144385026738e-05, "loss": 0.1726633906364441, "num_input_tokens_seen": 1550292, "step": 1504, "train_runtime": 3641.8245, "train_tokens_per_second": 425.691 }, { "epoch": 0.6432311144353029, "grad_norm": 3.975522518157959, "learning_rate": 1.358716577540107e-05, "loss": 0.11641143262386322, "num_input_tokens_seen": 1551226, "step": 1505, "train_runtime": 3643.8712, "train_tokens_per_second": 425.708 }, { "epoch": 0.6436585105246287, "grad_norm": 3.188652276992798, "learning_rate": 1.3582887700534761e-05, "loss": 0.1587495058774948, "num_input_tokens_seen": 1552042, "step": 1506, "train_runtime": 3645.967, "train_tokens_per_second": 425.687 }, { "epoch": 0.6440859066139545, "grad_norm": 2.3829288482666016, "learning_rate": 1.3578609625668451e-05, "loss": 0.10228777676820755, "num_input_tokens_seen": 1553214, "step": 1507, "train_runtime": 3648.0782, "train_tokens_per_second": 425.762 }, { "epoch": 0.6445133027032802, "grad_norm": 3.0020737648010254, "learning_rate": 1.357433155080214e-05, "loss": 0.24458348751068115, "num_input_tokens_seen": 1554276, "step": 1508, "train_runtime": 3650.1715, "train_tokens_per_second": 425.809 }, { "epoch": 0.6449406987926061, "grad_norm": 2.494694232940674, "learning_rate": 1.357005347593583e-05, "loss": 0.09424354135990143, "num_input_tokens_seen": 1554968, "step": 1509, "train_runtime": 3652.1636, "train_tokens_per_second": 425.766 }, { "epoch": 0.6453680948819318, "grad_norm": 2.695605754852295, "learning_rate": 1.3565775401069521e-05, "loss": 0.12960883975028992, "num_input_tokens_seen": 1556068, "step": 1510, "train_runtime": 3654.2804, "train_tokens_per_second": 425.821 }, { "epoch": 0.6457954909712577, "grad_norm": 3.6422171592712402, "learning_rate": 1.356149732620321e-05, "loss": 0.22197654843330383, "num_input_tokens_seen": 1556930, "step": 1511, "train_runtime": 3656.3265, "train_tokens_per_second": 425.818 }, { "epoch": 0.6462228870605834, "grad_norm": 2.917511463165283, "learning_rate": 1.35572192513369e-05, "loss": 0.11555804312229156, "num_input_tokens_seen": 1558272, "step": 1512, "train_runtime": 3658.5094, "train_tokens_per_second": 425.931 }, { "epoch": 0.6466502831499091, "grad_norm": 3.0762832164764404, "learning_rate": 1.355294117647059e-05, "loss": 0.09562921524047852, "num_input_tokens_seen": 1558930, "step": 1513, "train_runtime": 3660.4957, "train_tokens_per_second": 425.879 }, { "epoch": 0.647077679239235, "grad_norm": 2.5248517990112305, "learning_rate": 1.354866310160428e-05, "loss": 0.08613090217113495, "num_input_tokens_seen": 1559754, "step": 1514, "train_runtime": 3662.5137, "train_tokens_per_second": 425.87 }, { "epoch": 0.6475050753285607, "grad_norm": 3.964998960494995, "learning_rate": 1.354438502673797e-05, "loss": 0.204328715801239, "num_input_tokens_seen": 1560548, "step": 1515, "train_runtime": 3664.5412, "train_tokens_per_second": 425.851 }, { "epoch": 0.6479324714178866, "grad_norm": 2.447803258895874, "learning_rate": 1.354010695187166e-05, "loss": 0.14509670436382294, "num_input_tokens_seen": 1561562, "step": 1516, "train_runtime": 3666.5968, "train_tokens_per_second": 425.889 }, { "epoch": 0.6483598675072123, "grad_norm": 3.774406909942627, "learning_rate": 1.3535828877005349e-05, "loss": 0.15953212976455688, "num_input_tokens_seen": 1562250, "step": 1517, "train_runtime": 3668.572, "train_tokens_per_second": 425.847 }, { "epoch": 0.648787263596538, "grad_norm": 3.978740930557251, "learning_rate": 1.353155080213904e-05, "loss": 0.2058103382587433, "num_input_tokens_seen": 1563270, "step": 1518, "train_runtime": 3670.6249, "train_tokens_per_second": 425.887 }, { "epoch": 0.6492146596858639, "grad_norm": 3.0934062004089355, "learning_rate": 1.352727272727273e-05, "loss": 0.14622631669044495, "num_input_tokens_seen": 1564114, "step": 1519, "train_runtime": 3672.7534, "train_tokens_per_second": 425.87 }, { "epoch": 0.6496420557751896, "grad_norm": 3.5222365856170654, "learning_rate": 1.3522994652406419e-05, "loss": 0.21718433499336243, "num_input_tokens_seen": 1565672, "step": 1520, "train_runtime": 3674.9575, "train_tokens_per_second": 426.038 }, { "epoch": 0.6500694518645155, "grad_norm": 3.4182534217834473, "learning_rate": 1.3518716577540108e-05, "loss": 0.13513398170471191, "num_input_tokens_seen": 1566850, "step": 1521, "train_runtime": 3677.0353, "train_tokens_per_second": 426.118 }, { "epoch": 0.6504968479538412, "grad_norm": 5.0255842208862305, "learning_rate": 1.35144385026738e-05, "loss": 0.21971845626831055, "num_input_tokens_seen": 1567950, "step": 1522, "train_runtime": 3679.1193, "train_tokens_per_second": 426.175 }, { "epoch": 0.650924244043167, "grad_norm": 3.1422319412231445, "learning_rate": 1.3510160427807489e-05, "loss": 0.13466057181358337, "num_input_tokens_seen": 1568690, "step": 1523, "train_runtime": 3681.1443, "train_tokens_per_second": 426.142 }, { "epoch": 0.6513516401324928, "grad_norm": 3.234555959701538, "learning_rate": 1.3505882352941178e-05, "loss": 0.2144131064414978, "num_input_tokens_seen": 1569822, "step": 1524, "train_runtime": 3683.2819, "train_tokens_per_second": 426.202 }, { "epoch": 0.6517790362218185, "grad_norm": 3.9785099029541016, "learning_rate": 1.3501604278074868e-05, "loss": 0.15267924964427948, "num_input_tokens_seen": 1570408, "step": 1525, "train_runtime": 3685.3198, "train_tokens_per_second": 426.125 }, { "epoch": 0.6522064323111444, "grad_norm": 3.465639591217041, "learning_rate": 1.3497326203208559e-05, "loss": 0.19032518565654755, "num_input_tokens_seen": 1571396, "step": 1526, "train_runtime": 3687.3866, "train_tokens_per_second": 426.154 }, { "epoch": 0.6526338284004701, "grad_norm": 2.8069920539855957, "learning_rate": 1.3493048128342248e-05, "loss": 0.14490953087806702, "num_input_tokens_seen": 1572208, "step": 1527, "train_runtime": 3689.4538, "train_tokens_per_second": 426.136 }, { "epoch": 0.6530612244897959, "grad_norm": 2.129127264022827, "learning_rate": 1.3488770053475938e-05, "loss": 0.11624617874622345, "num_input_tokens_seen": 1573508, "step": 1528, "train_runtime": 3691.6414, "train_tokens_per_second": 426.235 }, { "epoch": 0.6534886205791217, "grad_norm": 1.8786301612854004, "learning_rate": 1.3484491978609625e-05, "loss": 0.10244782269001007, "num_input_tokens_seen": 1574602, "step": 1529, "train_runtime": 3693.8163, "train_tokens_per_second": 426.281 }, { "epoch": 0.6539160166684475, "grad_norm": 4.182097911834717, "learning_rate": 1.3480213903743315e-05, "loss": 0.17187145352363586, "num_input_tokens_seen": 1575186, "step": 1530, "train_runtime": 3695.8232, "train_tokens_per_second": 426.207 }, { "epoch": 0.6543434127577733, "grad_norm": 1.8183155059814453, "learning_rate": 1.3475935828877008e-05, "loss": 0.0856410339474678, "num_input_tokens_seen": 1576610, "step": 1531, "train_runtime": 3704.6141, "train_tokens_per_second": 425.58 }, { "epoch": 0.654770808847099, "grad_norm": 2.8884012699127197, "learning_rate": 1.3471657754010697e-05, "loss": 0.14600466191768646, "num_input_tokens_seen": 1577596, "step": 1532, "train_runtime": 3706.6629, "train_tokens_per_second": 425.611 }, { "epoch": 0.6551982049364248, "grad_norm": 3.003814458847046, "learning_rate": 1.3467379679144385e-05, "loss": 0.1828392744064331, "num_input_tokens_seen": 1578504, "step": 1533, "train_runtime": 3708.9029, "train_tokens_per_second": 425.599 }, { "epoch": 0.6556256010257506, "grad_norm": 2.1931958198547363, "learning_rate": 1.3463101604278074e-05, "loss": 0.13615339994430542, "num_input_tokens_seen": 1579710, "step": 1534, "train_runtime": 3711.0566, "train_tokens_per_second": 425.677 }, { "epoch": 0.6560529971150764, "grad_norm": 2.2456908226013184, "learning_rate": 1.3458823529411767e-05, "loss": 0.08627387136220932, "num_input_tokens_seen": 1580692, "step": 1535, "train_runtime": 3713.1495, "train_tokens_per_second": 425.701 }, { "epoch": 0.6564803932044022, "grad_norm": 3.724116563796997, "learning_rate": 1.3454545454545455e-05, "loss": 0.15534056723117828, "num_input_tokens_seen": 1581530, "step": 1536, "train_runtime": 3715.1728, "train_tokens_per_second": 425.695 }, { "epoch": 0.656907789293728, "grad_norm": 2.5453593730926514, "learning_rate": 1.3450267379679144e-05, "loss": 0.12748880684375763, "num_input_tokens_seen": 1582596, "step": 1537, "train_runtime": 3717.2833, "train_tokens_per_second": 425.74 }, { "epoch": 0.6573351853830538, "grad_norm": 5.269556999206543, "learning_rate": 1.3445989304812834e-05, "loss": 0.14962272346019745, "num_input_tokens_seen": 1583350, "step": 1538, "train_runtime": 3719.3436, "train_tokens_per_second": 425.707 }, { "epoch": 0.6577625814723795, "grad_norm": 4.323054313659668, "learning_rate": 1.3441711229946525e-05, "loss": 0.21885833144187927, "num_input_tokens_seen": 1584178, "step": 1539, "train_runtime": 3721.4368, "train_tokens_per_second": 425.69 }, { "epoch": 0.6581899775617053, "grad_norm": 2.9094793796539307, "learning_rate": 1.3437433155080214e-05, "loss": 0.13586312532424927, "num_input_tokens_seen": 1585064, "step": 1540, "train_runtime": 3723.4866, "train_tokens_per_second": 425.693 }, { "epoch": 0.6586173736510311, "grad_norm": 3.597817897796631, "learning_rate": 1.3433155080213904e-05, "loss": 0.14414404332637787, "num_input_tokens_seen": 1585794, "step": 1541, "train_runtime": 3725.5101, "train_tokens_per_second": 425.658 }, { "epoch": 0.6590447697403569, "grad_norm": 4.029960632324219, "learning_rate": 1.3428877005347593e-05, "loss": 0.2180078774690628, "num_input_tokens_seen": 1587408, "step": 1542, "train_runtime": 3727.7169, "train_tokens_per_second": 425.839 }, { "epoch": 0.6594721658296827, "grad_norm": 4.100533962249756, "learning_rate": 1.3424598930481284e-05, "loss": 0.17998196184635162, "num_input_tokens_seen": 1588142, "step": 1543, "train_runtime": 3729.7397, "train_tokens_per_second": 425.805 }, { "epoch": 0.6598995619190084, "grad_norm": 4.7648515701293945, "learning_rate": 1.3420320855614974e-05, "loss": 0.23594880104064941, "num_input_tokens_seen": 1588860, "step": 1544, "train_runtime": 3731.7605, "train_tokens_per_second": 425.767 }, { "epoch": 0.6603269580083342, "grad_norm": 4.623931884765625, "learning_rate": 1.3416042780748663e-05, "loss": 0.14606264233589172, "num_input_tokens_seen": 1589590, "step": 1545, "train_runtime": 3733.7727, "train_tokens_per_second": 425.733 }, { "epoch": 0.66075435409766, "grad_norm": 2.120661973953247, "learning_rate": 1.3411764705882353e-05, "loss": 0.07236392796039581, "num_input_tokens_seen": 1590230, "step": 1546, "train_runtime": 3735.7574, "train_tokens_per_second": 425.678 }, { "epoch": 0.6611817501869858, "grad_norm": 2.899981737136841, "learning_rate": 1.3407486631016044e-05, "loss": 0.09665043652057648, "num_input_tokens_seen": 1591156, "step": 1547, "train_runtime": 3737.7945, "train_tokens_per_second": 425.694 }, { "epoch": 0.6616091462763116, "grad_norm": 2.396935224533081, "learning_rate": 1.3403208556149733e-05, "loss": 0.07971307635307312, "num_input_tokens_seen": 1592442, "step": 1548, "train_runtime": 3740.0039, "train_tokens_per_second": 425.786 }, { "epoch": 0.6620365423656374, "grad_norm": 5.512351036071777, "learning_rate": 1.3398930481283423e-05, "loss": 0.08992433547973633, "num_input_tokens_seen": 1593202, "step": 1549, "train_runtime": 3742.0402, "train_tokens_per_second": 425.758 }, { "epoch": 0.6624639384549631, "grad_norm": 2.763360023498535, "learning_rate": 1.3394652406417112e-05, "loss": 0.17814138531684875, "num_input_tokens_seen": 1594400, "step": 1550, "train_runtime": 3744.2789, "train_tokens_per_second": 425.823 }, { "epoch": 0.662891334544289, "grad_norm": 3.826706886291504, "learning_rate": 1.3390374331550803e-05, "loss": 0.09510751068592072, "num_input_tokens_seen": 1595116, "step": 1551, "train_runtime": 3746.299, "train_tokens_per_second": 425.784 }, { "epoch": 0.6633187306336147, "grad_norm": 2.5190634727478027, "learning_rate": 1.3386096256684493e-05, "loss": 0.14573213458061218, "num_input_tokens_seen": 1596084, "step": 1552, "train_runtime": 3748.3903, "train_tokens_per_second": 425.805 }, { "epoch": 0.6637461267229405, "grad_norm": 2.3098104000091553, "learning_rate": 1.3381818181818182e-05, "loss": 0.1424594223499298, "num_input_tokens_seen": 1597872, "step": 1553, "train_runtime": 3750.6652, "train_tokens_per_second": 426.024 }, { "epoch": 0.6641735228122663, "grad_norm": 2.7591264247894287, "learning_rate": 1.3377540106951872e-05, "loss": 0.11576004326343536, "num_input_tokens_seen": 1598962, "step": 1554, "train_runtime": 3752.7653, "train_tokens_per_second": 426.076 }, { "epoch": 0.664600918901592, "grad_norm": 2.9065213203430176, "learning_rate": 1.3373262032085563e-05, "loss": 0.1090204119682312, "num_input_tokens_seen": 1599828, "step": 1555, "train_runtime": 3754.8307, "train_tokens_per_second": 426.072 }, { "epoch": 0.6650283149909179, "grad_norm": 2.754087209701538, "learning_rate": 1.3368983957219252e-05, "loss": 0.17998015880584717, "num_input_tokens_seen": 1600918, "step": 1556, "train_runtime": 3756.9799, "train_tokens_per_second": 426.118 }, { "epoch": 0.6654557110802436, "grad_norm": 3.2658700942993164, "learning_rate": 1.3364705882352942e-05, "loss": 0.19984865188598633, "num_input_tokens_seen": 1601938, "step": 1557, "train_runtime": 3759.1082, "train_tokens_per_second": 426.148 }, { "epoch": 0.6658831071695694, "grad_norm": 3.116774082183838, "learning_rate": 1.3360427807486631e-05, "loss": 0.13655301928520203, "num_input_tokens_seen": 1602692, "step": 1558, "train_runtime": 3761.0848, "train_tokens_per_second": 426.125 }, { "epoch": 0.6663105032588952, "grad_norm": 3.1976685523986816, "learning_rate": 1.3356149732620322e-05, "loss": 0.10624785721302032, "num_input_tokens_seen": 1603628, "step": 1559, "train_runtime": 3763.1232, "train_tokens_per_second": 426.143 }, { "epoch": 0.6667378993482209, "grad_norm": 2.3742599487304688, "learning_rate": 1.3351871657754012e-05, "loss": 0.1465083211660385, "num_input_tokens_seen": 1604734, "step": 1560, "train_runtime": 3765.2301, "train_tokens_per_second": 426.198 }, { "epoch": 0.6671652954375468, "grad_norm": 3.4235386848449707, "learning_rate": 1.3347593582887701e-05, "loss": 0.18542777001857758, "num_input_tokens_seen": 1605706, "step": 1561, "train_runtime": 3773.9514, "train_tokens_per_second": 425.471 }, { "epoch": 0.6675926915268725, "grad_norm": 2.669586181640625, "learning_rate": 1.334331550802139e-05, "loss": 0.1491749882698059, "num_input_tokens_seen": 1606732, "step": 1562, "train_runtime": 3776.0445, "train_tokens_per_second": 425.507 }, { "epoch": 0.6680200876161984, "grad_norm": 2.283149242401123, "learning_rate": 1.3339037433155082e-05, "loss": 0.11235065758228302, "num_input_tokens_seen": 1607630, "step": 1563, "train_runtime": 3778.1366, "train_tokens_per_second": 425.509 }, { "epoch": 0.6684474837055241, "grad_norm": 2.0375988483428955, "learning_rate": 1.3334759358288771e-05, "loss": 0.09467926621437073, "num_input_tokens_seen": 1608904, "step": 1564, "train_runtime": 3780.2712, "train_tokens_per_second": 425.605 }, { "epoch": 0.6688748797948498, "grad_norm": 3.068815231323242, "learning_rate": 1.333048128342246e-05, "loss": 0.16510456800460815, "num_input_tokens_seen": 1609904, "step": 1565, "train_runtime": 3782.349, "train_tokens_per_second": 425.636 }, { "epoch": 0.6693022758841757, "grad_norm": 2.582709789276123, "learning_rate": 1.332620320855615e-05, "loss": 0.14242790639400482, "num_input_tokens_seen": 1610686, "step": 1566, "train_runtime": 3784.3429, "train_tokens_per_second": 425.618 }, { "epoch": 0.6697296719735014, "grad_norm": 2.302830457687378, "learning_rate": 1.3321925133689841e-05, "loss": 0.08061867207288742, "num_input_tokens_seen": 1611608, "step": 1567, "train_runtime": 3786.3874, "train_tokens_per_second": 425.632 }, { "epoch": 0.6701570680628273, "grad_norm": 2.428049087524414, "learning_rate": 1.331764705882353e-05, "loss": 0.08166418969631195, "num_input_tokens_seen": 1612824, "step": 1568, "train_runtime": 3788.5362, "train_tokens_per_second": 425.712 }, { "epoch": 0.670584464152153, "grad_norm": 3.02074933052063, "learning_rate": 1.331336898395722e-05, "loss": 0.13414841890335083, "num_input_tokens_seen": 1613618, "step": 1569, "train_runtime": 3790.6202, "train_tokens_per_second": 425.687 }, { "epoch": 0.6710118602414787, "grad_norm": 2.169861316680908, "learning_rate": 1.330909090909091e-05, "loss": 0.12823854386806488, "num_input_tokens_seen": 1614690, "step": 1570, "train_runtime": 3792.7021, "train_tokens_per_second": 425.736 }, { "epoch": 0.6714392563308046, "grad_norm": 2.4305543899536133, "learning_rate": 1.33048128342246e-05, "loss": 0.11599336564540863, "num_input_tokens_seen": 1615700, "step": 1571, "train_runtime": 3794.7872, "train_tokens_per_second": 425.768 }, { "epoch": 0.6718666524201303, "grad_norm": 2.0328714847564697, "learning_rate": 1.330053475935829e-05, "loss": 0.16121914982795715, "num_input_tokens_seen": 1617158, "step": 1572, "train_runtime": 3796.9905, "train_tokens_per_second": 425.905 }, { "epoch": 0.6722940485094562, "grad_norm": 3.055515766143799, "learning_rate": 1.329625668449198e-05, "loss": 0.12334509193897247, "num_input_tokens_seen": 1617860, "step": 1573, "train_runtime": 3799.0205, "train_tokens_per_second": 425.862 }, { "epoch": 0.6727214445987819, "grad_norm": 2.4867000579833984, "learning_rate": 1.3291978609625669e-05, "loss": 0.11558125168085098, "num_input_tokens_seen": 1618652, "step": 1574, "train_runtime": 3801.0557, "train_tokens_per_second": 425.843 }, { "epoch": 0.6731488406881077, "grad_norm": 2.851879119873047, "learning_rate": 1.328770053475936e-05, "loss": 0.14694936573505402, "num_input_tokens_seen": 1619922, "step": 1575, "train_runtime": 3803.224, "train_tokens_per_second": 425.934 }, { "epoch": 0.6735762367774335, "grad_norm": 3.393662691116333, "learning_rate": 1.328342245989305e-05, "loss": 0.17909544706344604, "num_input_tokens_seen": 1620640, "step": 1576, "train_runtime": 3805.2492, "train_tokens_per_second": 425.896 }, { "epoch": 0.6740036328667592, "grad_norm": 2.5993282794952393, "learning_rate": 1.3279144385026739e-05, "loss": 0.1457187980413437, "num_input_tokens_seen": 1621670, "step": 1577, "train_runtime": 3807.4052, "train_tokens_per_second": 425.925 }, { "epoch": 0.6744310289560851, "grad_norm": 2.9386048316955566, "learning_rate": 1.3274866310160429e-05, "loss": 0.11855722963809967, "num_input_tokens_seen": 1622578, "step": 1578, "train_runtime": 3809.4534, "train_tokens_per_second": 425.935 }, { "epoch": 0.6748584250454108, "grad_norm": 3.5167593955993652, "learning_rate": 1.327058823529412e-05, "loss": 0.20887939631938934, "num_input_tokens_seen": 1623332, "step": 1579, "train_runtime": 3811.4953, "train_tokens_per_second": 425.904 }, { "epoch": 0.6752858211347366, "grad_norm": 3.0010759830474854, "learning_rate": 1.326631016042781e-05, "loss": 0.18665343523025513, "num_input_tokens_seen": 1624418, "step": 1580, "train_runtime": 3813.6063, "train_tokens_per_second": 425.953 }, { "epoch": 0.6757132172240624, "grad_norm": 3.057358980178833, "learning_rate": 1.3262032085561499e-05, "loss": 0.10085485875606537, "num_input_tokens_seen": 1625200, "step": 1581, "train_runtime": 3815.6262, "train_tokens_per_second": 425.933 }, { "epoch": 0.6761406133133882, "grad_norm": 2.774298667907715, "learning_rate": 1.3257754010695188e-05, "loss": 0.14732888340950012, "num_input_tokens_seen": 1626426, "step": 1582, "train_runtime": 3817.7774, "train_tokens_per_second": 426.014 }, { "epoch": 0.676568009402714, "grad_norm": 2.9863998889923096, "learning_rate": 1.325347593582888e-05, "loss": 0.22564369440078735, "num_input_tokens_seen": 1627304, "step": 1583, "train_runtime": 3819.8628, "train_tokens_per_second": 426.011 }, { "epoch": 0.6769954054920397, "grad_norm": 3.1854777336120605, "learning_rate": 1.3249197860962569e-05, "loss": 0.15117281675338745, "num_input_tokens_seen": 1628384, "step": 1584, "train_runtime": 3821.9792, "train_tokens_per_second": 426.058 }, { "epoch": 0.6774228015813656, "grad_norm": 2.56819748878479, "learning_rate": 1.3244919786096258e-05, "loss": 0.15319907665252686, "num_input_tokens_seen": 1629448, "step": 1585, "train_runtime": 3824.0864, "train_tokens_per_second": 426.101 }, { "epoch": 0.6778501976706913, "grad_norm": 3.392935276031494, "learning_rate": 1.3240641711229948e-05, "loss": 0.15829937160015106, "num_input_tokens_seen": 1630412, "step": 1586, "train_runtime": 3826.0936, "train_tokens_per_second": 426.13 }, { "epoch": 0.6782775937600171, "grad_norm": 2.1995556354522705, "learning_rate": 1.3236363636363639e-05, "loss": 0.12209456413984299, "num_input_tokens_seen": 1631754, "step": 1587, "train_runtime": 3828.2619, "train_tokens_per_second": 426.239 }, { "epoch": 0.6787049898493429, "grad_norm": 2.5163869857788086, "learning_rate": 1.3232085561497328e-05, "loss": 0.09759660065174103, "num_input_tokens_seen": 1633172, "step": 1588, "train_runtime": 3830.4421, "train_tokens_per_second": 426.366 }, { "epoch": 0.6791323859386686, "grad_norm": 2.2898318767547607, "learning_rate": 1.3227807486631018e-05, "loss": 0.11964927613735199, "num_input_tokens_seen": 1634354, "step": 1589, "train_runtime": 3832.6316, "train_tokens_per_second": 426.431 }, { "epoch": 0.6795597820279945, "grad_norm": 4.861701488494873, "learning_rate": 1.3223529411764705e-05, "loss": 0.1981499046087265, "num_input_tokens_seen": 1635210, "step": 1590, "train_runtime": 3834.6696, "train_tokens_per_second": 426.428 }, { "epoch": 0.6799871781173202, "grad_norm": 2.4189250469207764, "learning_rate": 1.3219251336898398e-05, "loss": 0.16792207956314087, "num_input_tokens_seen": 1636860, "step": 1591, "train_runtime": 3843.5762, "train_tokens_per_second": 425.869 }, { "epoch": 0.680414574206646, "grad_norm": 3.1255605220794678, "learning_rate": 1.3214973262032088e-05, "loss": 0.14919006824493408, "num_input_tokens_seen": 1637730, "step": 1592, "train_runtime": 3845.7644, "train_tokens_per_second": 425.853 }, { "epoch": 0.6808419702959718, "grad_norm": 2.6487908363342285, "learning_rate": 1.3210695187165777e-05, "loss": 0.19162176549434662, "num_input_tokens_seen": 1639292, "step": 1593, "train_runtime": 3847.9444, "train_tokens_per_second": 426.018 }, { "epoch": 0.6812693663852976, "grad_norm": 2.6720197200775146, "learning_rate": 1.3206417112299465e-05, "loss": 0.11653536558151245, "num_input_tokens_seen": 1640188, "step": 1594, "train_runtime": 3850.0154, "train_tokens_per_second": 426.021 }, { "epoch": 0.6816967624746234, "grad_norm": 4.183128833770752, "learning_rate": 1.3202139037433158e-05, "loss": 0.20200294256210327, "num_input_tokens_seen": 1640806, "step": 1595, "train_runtime": 3852.0142, "train_tokens_per_second": 425.961 }, { "epoch": 0.6821241585639491, "grad_norm": 3.8790345191955566, "learning_rate": 1.3197860962566847e-05, "loss": 0.14347238838672638, "num_input_tokens_seen": 1642176, "step": 1596, "train_runtime": 3854.2747, "train_tokens_per_second": 426.066 }, { "epoch": 0.6825515546532749, "grad_norm": 2.6697440147399902, "learning_rate": 1.3193582887700535e-05, "loss": 0.20666377246379852, "num_input_tokens_seen": 1643650, "step": 1597, "train_runtime": 3856.4888, "train_tokens_per_second": 426.204 }, { "epoch": 0.6829789507426007, "grad_norm": 3.147174835205078, "learning_rate": 1.3189304812834224e-05, "loss": 0.10880240052938461, "num_input_tokens_seen": 1644390, "step": 1598, "train_runtime": 3858.5296, "train_tokens_per_second": 426.17 }, { "epoch": 0.6834063468319265, "grad_norm": 3.357785224914551, "learning_rate": 1.3185026737967917e-05, "loss": 0.19138175249099731, "num_input_tokens_seen": 1645308, "step": 1599, "train_runtime": 3860.612, "train_tokens_per_second": 426.178 }, { "epoch": 0.6838337429212523, "grad_norm": 3.105679988861084, "learning_rate": 1.3180748663101607e-05, "loss": 0.18142981827259064, "num_input_tokens_seen": 1646310, "step": 1600, "train_runtime": 3862.651, "train_tokens_per_second": 426.212 }, { "epoch": 0.6842611390105781, "grad_norm": 1.9695712327957153, "learning_rate": 1.3176470588235294e-05, "loss": 0.0836038589477539, "num_input_tokens_seen": 1647374, "step": 1601, "train_runtime": 3864.685, "train_tokens_per_second": 426.263 }, { "epoch": 0.6846885350999038, "grad_norm": 3.3684911727905273, "learning_rate": 1.3172192513368984e-05, "loss": 0.18620504438877106, "num_input_tokens_seen": 1648536, "step": 1602, "train_runtime": 3866.7931, "train_tokens_per_second": 426.332 }, { "epoch": 0.6851159311892296, "grad_norm": 3.576066493988037, "learning_rate": 1.3167914438502677e-05, "loss": 0.18863776326179504, "num_input_tokens_seen": 1649318, "step": 1603, "train_runtime": 3868.8053, "train_tokens_per_second": 426.312 }, { "epoch": 0.6855433272785554, "grad_norm": 3.392570972442627, "learning_rate": 1.3163636363636364e-05, "loss": 0.13371005654335022, "num_input_tokens_seen": 1650252, "step": 1604, "train_runtime": 3870.8864, "train_tokens_per_second": 426.324 }, { "epoch": 0.6859707233678812, "grad_norm": 1.8862580060958862, "learning_rate": 1.3159358288770054e-05, "loss": 0.07925024628639221, "num_input_tokens_seen": 1652300, "step": 1605, "train_runtime": 3873.2108, "train_tokens_per_second": 426.597 }, { "epoch": 0.686398119457207, "grad_norm": 3.5801241397857666, "learning_rate": 1.3155080213903743e-05, "loss": 0.16683319211006165, "num_input_tokens_seen": 1653100, "step": 1606, "train_runtime": 3875.2585, "train_tokens_per_second": 426.578 }, { "epoch": 0.6868255155465327, "grad_norm": 2.4567997455596924, "learning_rate": 1.3150802139037434e-05, "loss": 0.12541936337947845, "num_input_tokens_seen": 1654178, "step": 1607, "train_runtime": 3877.3414, "train_tokens_per_second": 426.627 }, { "epoch": 0.6872529116358586, "grad_norm": 2.737053394317627, "learning_rate": 1.3146524064171124e-05, "loss": 0.12982957065105438, "num_input_tokens_seen": 1655230, "step": 1608, "train_runtime": 3879.4203, "train_tokens_per_second": 426.669 }, { "epoch": 0.6876803077251843, "grad_norm": 3.2906999588012695, "learning_rate": 1.3142245989304813e-05, "loss": 0.24963447451591492, "num_input_tokens_seen": 1657018, "step": 1609, "train_runtime": 3881.7743, "train_tokens_per_second": 426.871 }, { "epoch": 0.6881077038145101, "grad_norm": 3.597764253616333, "learning_rate": 1.3137967914438503e-05, "loss": 0.2881978154182434, "num_input_tokens_seen": 1657826, "step": 1610, "train_runtime": 3883.7548, "train_tokens_per_second": 426.862 }, { "epoch": 0.6885350999038359, "grad_norm": 2.057811737060547, "learning_rate": 1.3133689839572194e-05, "loss": 0.08862215280532837, "num_input_tokens_seen": 1659216, "step": 1611, "train_runtime": 3885.9402, "train_tokens_per_second": 426.979 }, { "epoch": 0.6889624959931616, "grad_norm": 2.7082576751708984, "learning_rate": 1.3129411764705883e-05, "loss": 0.09579111635684967, "num_input_tokens_seen": 1660136, "step": 1612, "train_runtime": 3887.9689, "train_tokens_per_second": 426.993 }, { "epoch": 0.6893898920824875, "grad_norm": 2.8410701751708984, "learning_rate": 1.3125133689839573e-05, "loss": 0.18607118725776672, "num_input_tokens_seen": 1661920, "step": 1613, "train_runtime": 3890.1898, "train_tokens_per_second": 427.208 }, { "epoch": 0.6898172881718132, "grad_norm": 2.691599130630493, "learning_rate": 1.3120855614973262e-05, "loss": 0.1239597424864769, "num_input_tokens_seen": 1662820, "step": 1614, "train_runtime": 3892.2341, "train_tokens_per_second": 427.215 }, { "epoch": 0.690244684261139, "grad_norm": 2.18497633934021, "learning_rate": 1.3116577540106953e-05, "loss": 0.11108903586864471, "num_input_tokens_seen": 1664108, "step": 1615, "train_runtime": 3894.3359, "train_tokens_per_second": 427.315 }, { "epoch": 0.6906720803504648, "grad_norm": 2.9395556449890137, "learning_rate": 1.3112299465240643e-05, "loss": 0.18891631066799164, "num_input_tokens_seen": 1665014, "step": 1616, "train_runtime": 3896.4118, "train_tokens_per_second": 427.32 }, { "epoch": 0.6910994764397905, "grad_norm": 2.8265609741210938, "learning_rate": 1.3108021390374332e-05, "loss": 0.0613570436835289, "num_input_tokens_seen": 1666400, "step": 1617, "train_runtime": 3898.5977, "train_tokens_per_second": 427.436 }, { "epoch": 0.6915268725291164, "grad_norm": 2.4524476528167725, "learning_rate": 1.3103743315508022e-05, "loss": 0.1273629367351532, "num_input_tokens_seen": 1667142, "step": 1618, "train_runtime": 3900.6362, "train_tokens_per_second": 427.403 }, { "epoch": 0.6919542686184421, "grad_norm": 2.3937675952911377, "learning_rate": 1.3099465240641713e-05, "loss": 0.09456370770931244, "num_input_tokens_seen": 1668150, "step": 1619, "train_runtime": 3902.7099, "train_tokens_per_second": 427.434 }, { "epoch": 0.692381664707768, "grad_norm": 2.7047691345214844, "learning_rate": 1.3095187165775402e-05, "loss": 0.13802814483642578, "num_input_tokens_seen": 1669652, "step": 1620, "train_runtime": 3904.9061, "train_tokens_per_second": 427.578 }, { "epoch": 0.6928090607970937, "grad_norm": 3.2640371322631836, "learning_rate": 1.3090909090909092e-05, "loss": 0.11681882292032242, "num_input_tokens_seen": 1670674, "step": 1621, "train_runtime": 3913.2306, "train_tokens_per_second": 426.93 }, { "epoch": 0.6932364568864194, "grad_norm": 3.0372519493103027, "learning_rate": 1.3086631016042781e-05, "loss": 0.14249123632907867, "num_input_tokens_seen": 1671534, "step": 1622, "train_runtime": 3915.2407, "train_tokens_per_second": 426.93 }, { "epoch": 0.6936638529757453, "grad_norm": 4.135215759277344, "learning_rate": 1.3082352941176472e-05, "loss": 0.2676665782928467, "num_input_tokens_seen": 1672412, "step": 1623, "train_runtime": 3917.3077, "train_tokens_per_second": 426.929 }, { "epoch": 0.694091249065071, "grad_norm": 3.9823038578033447, "learning_rate": 1.3078074866310162e-05, "loss": 0.4981217682361603, "num_input_tokens_seen": 1673666, "step": 1624, "train_runtime": 3919.4495, "train_tokens_per_second": 427.016 }, { "epoch": 0.6945186451543969, "grad_norm": 2.845492124557495, "learning_rate": 1.3073796791443851e-05, "loss": 0.12419921159744263, "num_input_tokens_seen": 1674652, "step": 1625, "train_runtime": 3921.495, "train_tokens_per_second": 427.044 }, { "epoch": 0.6949460412437226, "grad_norm": 2.095703601837158, "learning_rate": 1.306951871657754e-05, "loss": 0.09531547129154205, "num_input_tokens_seen": 1675698, "step": 1626, "train_runtime": 3923.579, "train_tokens_per_second": 427.084 }, { "epoch": 0.6953734373330483, "grad_norm": 2.989895820617676, "learning_rate": 1.3065240641711232e-05, "loss": 0.09823733568191528, "num_input_tokens_seen": 1676306, "step": 1627, "train_runtime": 3925.5613, "train_tokens_per_second": 427.023 }, { "epoch": 0.6958008334223742, "grad_norm": 2.459953546524048, "learning_rate": 1.3060962566844921e-05, "loss": 0.1193925142288208, "num_input_tokens_seen": 1677460, "step": 1628, "train_runtime": 3927.7076, "train_tokens_per_second": 427.084 }, { "epoch": 0.6962282295116999, "grad_norm": 3.317596197128296, "learning_rate": 1.305668449197861e-05, "loss": 0.0970437079668045, "num_input_tokens_seen": 1678144, "step": 1629, "train_runtime": 3929.7129, "train_tokens_per_second": 427.04 }, { "epoch": 0.6966556256010258, "grad_norm": 2.53511118888855, "learning_rate": 1.30524064171123e-05, "loss": 0.12688416242599487, "num_input_tokens_seen": 1679080, "step": 1630, "train_runtime": 3931.7921, "train_tokens_per_second": 427.052 }, { "epoch": 0.6970830216903515, "grad_norm": 2.4305365085601807, "learning_rate": 1.3048128342245991e-05, "loss": 0.07128015160560608, "num_input_tokens_seen": 1680132, "step": 1631, "train_runtime": 3933.9185, "train_tokens_per_second": 427.089 }, { "epoch": 0.6975104177796773, "grad_norm": 3.819319248199463, "learning_rate": 1.304385026737968e-05, "loss": 0.09876695275306702, "num_input_tokens_seen": 1680726, "step": 1632, "train_runtime": 3935.9616, "train_tokens_per_second": 427.018 }, { "epoch": 0.6979378138690031, "grad_norm": 3.7172605991363525, "learning_rate": 1.303957219251337e-05, "loss": 0.22836706042289734, "num_input_tokens_seen": 1681756, "step": 1633, "train_runtime": 3938.1041, "train_tokens_per_second": 427.047 }, { "epoch": 0.6983652099583288, "grad_norm": 3.323859930038452, "learning_rate": 1.303529411764706e-05, "loss": 0.1308099925518036, "num_input_tokens_seen": 1682650, "step": 1634, "train_runtime": 3940.3052, "train_tokens_per_second": 427.035 }, { "epoch": 0.6987926060476547, "grad_norm": 3.0783824920654297, "learning_rate": 1.303101604278075e-05, "loss": 0.21143673360347748, "num_input_tokens_seen": 1684078, "step": 1635, "train_runtime": 3942.473, "train_tokens_per_second": 427.163 }, { "epoch": 0.6992200021369804, "grad_norm": 2.3745343685150146, "learning_rate": 1.302673796791444e-05, "loss": 0.14765599370002747, "num_input_tokens_seen": 1685224, "step": 1636, "train_runtime": 3944.5702, "train_tokens_per_second": 427.226 }, { "epoch": 0.6996473982263063, "grad_norm": 3.0867974758148193, "learning_rate": 1.302245989304813e-05, "loss": 0.1804279088973999, "num_input_tokens_seen": 1686050, "step": 1637, "train_runtime": 3946.6139, "train_tokens_per_second": 427.214 }, { "epoch": 0.700074794315632, "grad_norm": 2.6826188564300537, "learning_rate": 1.3018181818181819e-05, "loss": 0.08859211206436157, "num_input_tokens_seen": 1686956, "step": 1638, "train_runtime": 3948.6891, "train_tokens_per_second": 427.219 }, { "epoch": 0.7005021904049578, "grad_norm": 3.395402669906616, "learning_rate": 1.3013903743315509e-05, "loss": 0.15626779198646545, "num_input_tokens_seen": 1687798, "step": 1639, "train_runtime": 3950.6905, "train_tokens_per_second": 427.216 }, { "epoch": 0.7009295864942836, "grad_norm": 2.332399368286133, "learning_rate": 1.30096256684492e-05, "loss": 0.10119998455047607, "num_input_tokens_seen": 1689004, "step": 1640, "train_runtime": 3952.7852, "train_tokens_per_second": 427.295 }, { "epoch": 0.7013569825836093, "grad_norm": 3.0781655311584473, "learning_rate": 1.3005347593582889e-05, "loss": 0.10670844465494156, "num_input_tokens_seen": 1689856, "step": 1641, "train_runtime": 3954.8167, "train_tokens_per_second": 427.291 }, { "epoch": 0.7017843786729352, "grad_norm": 2.5547902584075928, "learning_rate": 1.3001069518716579e-05, "loss": 0.06811079382896423, "num_input_tokens_seen": 1690670, "step": 1642, "train_runtime": 3956.8163, "train_tokens_per_second": 427.28 }, { "epoch": 0.7022117747622609, "grad_norm": 3.101245164871216, "learning_rate": 1.2996791443850268e-05, "loss": 0.1471184641122818, "num_input_tokens_seen": 1691480, "step": 1643, "train_runtime": 3958.8592, "train_tokens_per_second": 427.264 }, { "epoch": 0.7026391708515867, "grad_norm": 3.2463717460632324, "learning_rate": 1.2992513368983959e-05, "loss": 0.10457038879394531, "num_input_tokens_seen": 1692250, "step": 1644, "train_runtime": 3960.8557, "train_tokens_per_second": 427.244 }, { "epoch": 0.7030665669409125, "grad_norm": 2.880979537963867, "learning_rate": 1.2988235294117649e-05, "loss": 0.1903861165046692, "num_input_tokens_seen": 1693420, "step": 1645, "train_runtime": 3962.9732, "train_tokens_per_second": 427.31 }, { "epoch": 0.7034939630302383, "grad_norm": 4.939394950866699, "learning_rate": 1.2983957219251338e-05, "loss": 0.20906499028205872, "num_input_tokens_seen": 1694210, "step": 1646, "train_runtime": 3964.9752, "train_tokens_per_second": 427.294 }, { "epoch": 0.7039213591195641, "grad_norm": 2.6525001525878906, "learning_rate": 1.2979679144385027e-05, "loss": 0.11395084112882614, "num_input_tokens_seen": 1695012, "step": 1647, "train_runtime": 3967.0044, "train_tokens_per_second": 427.278 }, { "epoch": 0.7043487552088898, "grad_norm": 2.86409854888916, "learning_rate": 1.2975401069518719e-05, "loss": 0.1560884714126587, "num_input_tokens_seen": 1696218, "step": 1648, "train_runtime": 3969.1362, "train_tokens_per_second": 427.352 }, { "epoch": 0.7047761512982156, "grad_norm": 2.9886152744293213, "learning_rate": 1.2971122994652408e-05, "loss": 0.12156147509813309, "num_input_tokens_seen": 1697258, "step": 1649, "train_runtime": 3971.2053, "train_tokens_per_second": 427.391 }, { "epoch": 0.7052035473875414, "grad_norm": 3.0794358253479004, "learning_rate": 1.2966844919786097e-05, "loss": 0.10936135798692703, "num_input_tokens_seen": 1698094, "step": 1650, "train_runtime": 3973.2434, "train_tokens_per_second": 427.382 }, { "epoch": 0.7056309434768672, "grad_norm": 3.7119407653808594, "learning_rate": 1.2962566844919787e-05, "loss": 0.11862250417470932, "num_input_tokens_seen": 1698594, "step": 1651, "train_runtime": 3981.421, "train_tokens_per_second": 426.63 }, { "epoch": 0.706058339566193, "grad_norm": 3.069287061691284, "learning_rate": 1.2958288770053478e-05, "loss": 0.18450075387954712, "num_input_tokens_seen": 1699658, "step": 1652, "train_runtime": 3983.501, "train_tokens_per_second": 426.674 }, { "epoch": 0.7064857356555188, "grad_norm": 2.3116512298583984, "learning_rate": 1.2954010695187168e-05, "loss": 0.13053485751152039, "num_input_tokens_seen": 1700770, "step": 1653, "train_runtime": 3985.6066, "train_tokens_per_second": 426.728 }, { "epoch": 0.7069131317448445, "grad_norm": 2.779745101928711, "learning_rate": 1.2949732620320857e-05, "loss": 0.16588063538074493, "num_input_tokens_seen": 1701816, "step": 1654, "train_runtime": 3987.6714, "train_tokens_per_second": 426.769 }, { "epoch": 0.7073405278341703, "grad_norm": 2.9462406635284424, "learning_rate": 1.2945454545454545e-05, "loss": 0.20384477078914642, "num_input_tokens_seen": 1703090, "step": 1655, "train_runtime": 3989.7657, "train_tokens_per_second": 426.865 }, { "epoch": 0.7077679239234961, "grad_norm": 2.217874526977539, "learning_rate": 1.2941176470588238e-05, "loss": 0.10553063452243805, "num_input_tokens_seen": 1704284, "step": 1656, "train_runtime": 3991.8634, "train_tokens_per_second": 426.939 }, { "epoch": 0.7081953200128219, "grad_norm": 3.3472745418548584, "learning_rate": 1.2936898395721927e-05, "loss": 0.17429442703723907, "num_input_tokens_seen": 1705218, "step": 1657, "train_runtime": 3993.9054, "train_tokens_per_second": 426.955 }, { "epoch": 0.7086227161021477, "grad_norm": 3.8400657176971436, "learning_rate": 1.2932620320855615e-05, "loss": 0.1665058434009552, "num_input_tokens_seen": 1706048, "step": 1658, "train_runtime": 3995.9538, "train_tokens_per_second": 426.944 }, { "epoch": 0.7090501121914734, "grad_norm": 2.0666720867156982, "learning_rate": 1.2928342245989304e-05, "loss": 0.0790431946516037, "num_input_tokens_seen": 1707348, "step": 1659, "train_runtime": 3998.0856, "train_tokens_per_second": 427.041 }, { "epoch": 0.7094775082807993, "grad_norm": 2.7541933059692383, "learning_rate": 1.2924064171122997e-05, "loss": 0.12006007879972458, "num_input_tokens_seen": 1708384, "step": 1660, "train_runtime": 4000.1165, "train_tokens_per_second": 427.084 }, { "epoch": 0.709904904370125, "grad_norm": 2.458078145980835, "learning_rate": 1.2919786096256686e-05, "loss": 0.09136639535427094, "num_input_tokens_seen": 1709360, "step": 1661, "train_runtime": 4002.1602, "train_tokens_per_second": 427.109 }, { "epoch": 0.7103323004594508, "grad_norm": 2.8389453887939453, "learning_rate": 1.2915508021390374e-05, "loss": 0.16383452713489532, "num_input_tokens_seen": 1710508, "step": 1662, "train_runtime": 4004.2777, "train_tokens_per_second": 427.17 }, { "epoch": 0.7107596965487766, "grad_norm": 3.5363619327545166, "learning_rate": 1.2911229946524064e-05, "loss": 0.22730599343776703, "num_input_tokens_seen": 1712138, "step": 1663, "train_runtime": 4006.6545, "train_tokens_per_second": 427.324 }, { "epoch": 0.7111870926381023, "grad_norm": 3.8893401622772217, "learning_rate": 1.2906951871657757e-05, "loss": 0.19639477133750916, "num_input_tokens_seen": 1712860, "step": 1664, "train_runtime": 4008.7035, "train_tokens_per_second": 427.285 }, { "epoch": 0.7116144887274282, "grad_norm": 3.728217124938965, "learning_rate": 1.2902673796791444e-05, "loss": 0.11914101988077164, "num_input_tokens_seen": 1713704, "step": 1665, "train_runtime": 4010.7475, "train_tokens_per_second": 427.278 }, { "epoch": 0.7120418848167539, "grad_norm": 3.5283544063568115, "learning_rate": 1.2898395721925134e-05, "loss": 0.1672677844762802, "num_input_tokens_seen": 1714516, "step": 1666, "train_runtime": 4012.7993, "train_tokens_per_second": 427.262 }, { "epoch": 0.7124692809060797, "grad_norm": 2.4075896739959717, "learning_rate": 1.2894117647058823e-05, "loss": 0.12488129734992981, "num_input_tokens_seen": 1715660, "step": 1667, "train_runtime": 4014.8872, "train_tokens_per_second": 427.325 }, { "epoch": 0.7128966769954055, "grad_norm": 3.5406494140625, "learning_rate": 1.2889839572192516e-05, "loss": 0.1721637099981308, "num_input_tokens_seen": 1716730, "step": 1668, "train_runtime": 4016.9938, "train_tokens_per_second": 427.367 }, { "epoch": 0.7133240730847312, "grad_norm": 2.7573654651641846, "learning_rate": 1.2885561497326204e-05, "loss": 0.11639227718114853, "num_input_tokens_seen": 1717640, "step": 1669, "train_runtime": 4019.0426, "train_tokens_per_second": 427.375 }, { "epoch": 0.7137514691740571, "grad_norm": 4.804013729095459, "learning_rate": 1.2881283422459893e-05, "loss": 0.21367575228214264, "num_input_tokens_seen": 1718460, "step": 1670, "train_runtime": 4021.0944, "train_tokens_per_second": 427.361 }, { "epoch": 0.7141788652633828, "grad_norm": 3.78324294090271, "learning_rate": 1.2877005347593583e-05, "loss": 0.14412060379981995, "num_input_tokens_seen": 1719306, "step": 1671, "train_runtime": 4023.1503, "train_tokens_per_second": 427.353 }, { "epoch": 0.7146062613527087, "grad_norm": 2.279505968093872, "learning_rate": 1.2872727272727274e-05, "loss": 0.12978610396385193, "num_input_tokens_seen": 1720296, "step": 1672, "train_runtime": 4025.2769, "train_tokens_per_second": 427.373 }, { "epoch": 0.7150336574420344, "grad_norm": 4.358551979064941, "learning_rate": 1.2868449197860963e-05, "loss": 0.1565861701965332, "num_input_tokens_seen": 1720946, "step": 1673, "train_runtime": 4027.2598, "train_tokens_per_second": 427.324 }, { "epoch": 0.7154610535313601, "grad_norm": 3.662733316421509, "learning_rate": 1.2864171122994653e-05, "loss": 0.18193666636943817, "num_input_tokens_seen": 1722042, "step": 1674, "train_runtime": 4029.393, "train_tokens_per_second": 427.37 }, { "epoch": 0.715888449620686, "grad_norm": 2.6407856941223145, "learning_rate": 1.2859893048128342e-05, "loss": 0.13663464784622192, "num_input_tokens_seen": 1723140, "step": 1675, "train_runtime": 4031.4938, "train_tokens_per_second": 427.42 }, { "epoch": 0.7163158457100117, "grad_norm": 2.2533209323883057, "learning_rate": 1.2855614973262033e-05, "loss": 0.09304480999708176, "num_input_tokens_seen": 1724224, "step": 1676, "train_runtime": 4033.6004, "train_tokens_per_second": 427.465 }, { "epoch": 0.7167432417993376, "grad_norm": 2.527470111846924, "learning_rate": 1.2851336898395723e-05, "loss": 0.09156791120767593, "num_input_tokens_seen": 1725548, "step": 1677, "train_runtime": 4035.7495, "train_tokens_per_second": 427.566 }, { "epoch": 0.7171706378886633, "grad_norm": 3.8725194931030273, "learning_rate": 1.2847058823529412e-05, "loss": 0.13674314320087433, "num_input_tokens_seen": 1726676, "step": 1678, "train_runtime": 4037.8574, "train_tokens_per_second": 427.622 }, { "epoch": 0.717598033977989, "grad_norm": 3.6760237216949463, "learning_rate": 1.2842780748663102e-05, "loss": 0.17109842598438263, "num_input_tokens_seen": 1727428, "step": 1679, "train_runtime": 4039.8438, "train_tokens_per_second": 427.598 }, { "epoch": 0.7180254300673149, "grad_norm": 2.799755334854126, "learning_rate": 1.2838502673796793e-05, "loss": 0.16299965977668762, "num_input_tokens_seen": 1728446, "step": 1680, "train_runtime": 4041.9223, "train_tokens_per_second": 427.63 }, { "epoch": 0.7184528261566406, "grad_norm": 3.8620645999908447, "learning_rate": 1.2834224598930482e-05, "loss": 0.10270003974437714, "num_input_tokens_seen": 1729056, "step": 1681, "train_runtime": 4050.3046, "train_tokens_per_second": 426.895 }, { "epoch": 0.7188802222459665, "grad_norm": 3.610529899597168, "learning_rate": 1.2829946524064172e-05, "loss": 0.18845506012439728, "num_input_tokens_seen": 1730126, "step": 1682, "train_runtime": 4052.3803, "train_tokens_per_second": 426.941 }, { "epoch": 0.7193076183352922, "grad_norm": 3.0155282020568848, "learning_rate": 1.2825668449197861e-05, "loss": 0.11069008708000183, "num_input_tokens_seen": 1730996, "step": 1683, "train_runtime": 4054.4851, "train_tokens_per_second": 426.934 }, { "epoch": 0.7197350144246181, "grad_norm": 3.03389310836792, "learning_rate": 1.2821390374331552e-05, "loss": 0.16556021571159363, "num_input_tokens_seen": 1732152, "step": 1684, "train_runtime": 4056.5803, "train_tokens_per_second": 426.998 }, { "epoch": 0.7201624105139438, "grad_norm": 2.5943901538848877, "learning_rate": 1.2817112299465242e-05, "loss": 0.12813101708889008, "num_input_tokens_seen": 1733204, "step": 1685, "train_runtime": 4058.6533, "train_tokens_per_second": 427.039 }, { "epoch": 0.7205898066032695, "grad_norm": 2.7205615043640137, "learning_rate": 1.2812834224598931e-05, "loss": 0.07578977197408676, "num_input_tokens_seen": 1734046, "step": 1686, "train_runtime": 4060.6929, "train_tokens_per_second": 427.032 }, { "epoch": 0.7210172026925954, "grad_norm": 2.8328237533569336, "learning_rate": 1.280855614973262e-05, "loss": 0.1297164112329483, "num_input_tokens_seen": 1735042, "step": 1687, "train_runtime": 4062.8256, "train_tokens_per_second": 427.053 }, { "epoch": 0.7214445987819211, "grad_norm": 3.1164746284484863, "learning_rate": 1.2804278074866312e-05, "loss": 0.168115496635437, "num_input_tokens_seen": 1736068, "step": 1688, "train_runtime": 4064.9025, "train_tokens_per_second": 427.087 }, { "epoch": 0.721871994871247, "grad_norm": 3.218972682952881, "learning_rate": 1.2800000000000001e-05, "loss": 0.1437757909297943, "num_input_tokens_seen": 1737184, "step": 1689, "train_runtime": 4067.0197, "train_tokens_per_second": 427.139 }, { "epoch": 0.7222993909605727, "grad_norm": 3.383817195892334, "learning_rate": 1.279572192513369e-05, "loss": 0.20265325903892517, "num_input_tokens_seen": 1738208, "step": 1690, "train_runtime": 4069.0634, "train_tokens_per_second": 427.176 }, { "epoch": 0.7227267870498985, "grad_norm": 2.3254318237304688, "learning_rate": 1.279144385026738e-05, "loss": 0.12910565733909607, "num_input_tokens_seen": 1739152, "step": 1691, "train_runtime": 4071.1144, "train_tokens_per_second": 427.193 }, { "epoch": 0.7231541831392243, "grad_norm": 3.0438852310180664, "learning_rate": 1.2787165775401071e-05, "loss": 0.12765420973300934, "num_input_tokens_seen": 1740346, "step": 1692, "train_runtime": 4073.2656, "train_tokens_per_second": 427.261 }, { "epoch": 0.72358157922855, "grad_norm": 3.4133188724517822, "learning_rate": 1.278288770053476e-05, "loss": 0.2313060462474823, "num_input_tokens_seen": 1741248, "step": 1693, "train_runtime": 4075.469, "train_tokens_per_second": 427.251 }, { "epoch": 0.7240089753178759, "grad_norm": 3.4037530422210693, "learning_rate": 1.277860962566845e-05, "loss": 0.15263766050338745, "num_input_tokens_seen": 1742122, "step": 1694, "train_runtime": 4077.5272, "train_tokens_per_second": 427.25 }, { "epoch": 0.7244363714072016, "grad_norm": 2.177854299545288, "learning_rate": 1.277433155080214e-05, "loss": 0.11862416565418243, "num_input_tokens_seen": 1743328, "step": 1695, "train_runtime": 4079.6776, "train_tokens_per_second": 427.32 }, { "epoch": 0.7248637674965274, "grad_norm": 3.185788869857788, "learning_rate": 1.277005347593583e-05, "loss": 0.1639426201581955, "num_input_tokens_seen": 1744486, "step": 1696, "train_runtime": 4081.8278, "train_tokens_per_second": 427.379 }, { "epoch": 0.7252911635858532, "grad_norm": 3.2895989418029785, "learning_rate": 1.276577540106952e-05, "loss": 0.1792648732662201, "num_input_tokens_seen": 1745474, "step": 1697, "train_runtime": 4083.9907, "train_tokens_per_second": 427.394 }, { "epoch": 0.725718559675179, "grad_norm": 4.185188293457031, "learning_rate": 1.276149732620321e-05, "loss": 0.17716136574745178, "num_input_tokens_seen": 1746166, "step": 1698, "train_runtime": 4085.9399, "train_tokens_per_second": 427.36 }, { "epoch": 0.7261459557645048, "grad_norm": 3.3039119243621826, "learning_rate": 1.2757219251336899e-05, "loss": 0.20853915810585022, "num_input_tokens_seen": 1747250, "step": 1699, "train_runtime": 4088.011, "train_tokens_per_second": 427.408 }, { "epoch": 0.7265733518538305, "grad_norm": 2.205228090286255, "learning_rate": 1.275294117647059e-05, "loss": 0.11350136995315552, "num_input_tokens_seen": 1748350, "step": 1700, "train_runtime": 4090.125, "train_tokens_per_second": 427.456 }, { "epoch": 0.7270007479431563, "grad_norm": 3.152604341506958, "learning_rate": 1.274866310160428e-05, "loss": 0.1099860817193985, "num_input_tokens_seen": 1749094, "step": 1701, "train_runtime": 4092.1684, "train_tokens_per_second": 427.425 }, { "epoch": 0.7274281440324821, "grad_norm": 3.303657054901123, "learning_rate": 1.2744385026737969e-05, "loss": 0.1371927261352539, "num_input_tokens_seen": 1749952, "step": 1702, "train_runtime": 4094.2086, "train_tokens_per_second": 427.421 }, { "epoch": 0.7278555401218079, "grad_norm": 2.9780490398406982, "learning_rate": 1.2740106951871658e-05, "loss": 0.1036418080329895, "num_input_tokens_seen": 1750582, "step": 1703, "train_runtime": 4096.195, "train_tokens_per_second": 427.368 }, { "epoch": 0.7282829362111337, "grad_norm": 3.7338707447052, "learning_rate": 1.273582887700535e-05, "loss": 0.11675436794757843, "num_input_tokens_seen": 1751290, "step": 1704, "train_runtime": 4098.1705, "train_tokens_per_second": 427.335 }, { "epoch": 0.7287103323004595, "grad_norm": 4.176034450531006, "learning_rate": 1.2731550802139039e-05, "loss": 0.23184752464294434, "num_input_tokens_seen": 1752338, "step": 1705, "train_runtime": 4100.2506, "train_tokens_per_second": 427.373 }, { "epoch": 0.7291377283897852, "grad_norm": 2.412473201751709, "learning_rate": 1.2727272727272728e-05, "loss": 0.10220357030630112, "num_input_tokens_seen": 1753384, "step": 1706, "train_runtime": 4102.3417, "train_tokens_per_second": 427.411 }, { "epoch": 0.729565124479111, "grad_norm": 3.10713267326355, "learning_rate": 1.2722994652406418e-05, "loss": 0.1686929315328598, "num_input_tokens_seen": 1754138, "step": 1707, "train_runtime": 4104.3655, "train_tokens_per_second": 427.383 }, { "epoch": 0.7299925205684368, "grad_norm": 3.179652214050293, "learning_rate": 1.2718716577540109e-05, "loss": 0.19970983266830444, "num_input_tokens_seen": 1755136, "step": 1708, "train_runtime": 4106.4543, "train_tokens_per_second": 427.409 }, { "epoch": 0.7304199166577626, "grad_norm": 3.3354885578155518, "learning_rate": 1.2714438502673798e-05, "loss": 0.18996183574199677, "num_input_tokens_seen": 1756140, "step": 1709, "train_runtime": 4108.5043, "train_tokens_per_second": 427.44 }, { "epoch": 0.7308473127470884, "grad_norm": 2.7286245822906494, "learning_rate": 1.2710160427807488e-05, "loss": 0.12833094596862793, "num_input_tokens_seen": 1757116, "step": 1710, "train_runtime": 4110.5429, "train_tokens_per_second": 427.466 }, { "epoch": 0.7312747088364141, "grad_norm": 2.2786917686462402, "learning_rate": 1.2705882352941177e-05, "loss": 0.05347301810979843, "num_input_tokens_seen": 1757922, "step": 1711, "train_runtime": 4118.8575, "train_tokens_per_second": 426.798 }, { "epoch": 0.73170210492574, "grad_norm": 2.3057162761688232, "learning_rate": 1.2701604278074869e-05, "loss": 0.13636146485805511, "num_input_tokens_seen": 1759588, "step": 1712, "train_runtime": 4121.0813, "train_tokens_per_second": 426.972 }, { "epoch": 0.7321295010150657, "grad_norm": 3.88169264793396, "learning_rate": 1.2697326203208558e-05, "loss": 0.11356302350759506, "num_input_tokens_seen": 1760308, "step": 1713, "train_runtime": 4123.1221, "train_tokens_per_second": 426.936 }, { "epoch": 0.7325568971043915, "grad_norm": 3.0245745182037354, "learning_rate": 1.2693048128342247e-05, "loss": 0.23742002248764038, "num_input_tokens_seen": 1762078, "step": 1714, "train_runtime": 4125.3936, "train_tokens_per_second": 427.13 }, { "epoch": 0.7329842931937173, "grad_norm": 1.959012508392334, "learning_rate": 1.2688770053475937e-05, "loss": 0.0950913280248642, "num_input_tokens_seen": 1766162, "step": 1715, "train_runtime": 4128.1949, "train_tokens_per_second": 427.829 }, { "epoch": 0.733411689283043, "grad_norm": 3.113219738006592, "learning_rate": 1.2684491978609628e-05, "loss": 0.08972372114658356, "num_input_tokens_seen": 1766872, "step": 1716, "train_runtime": 4130.1733, "train_tokens_per_second": 427.796 }, { "epoch": 0.7338390853723689, "grad_norm": 2.6438539028167725, "learning_rate": 1.2680213903743317e-05, "loss": 0.13002948462963104, "num_input_tokens_seen": 1767812, "step": 1717, "train_runtime": 4132.2657, "train_tokens_per_second": 427.807 }, { "epoch": 0.7342664814616946, "grad_norm": 3.5801172256469727, "learning_rate": 1.2675935828877007e-05, "loss": 0.12898202240467072, "num_input_tokens_seen": 1768594, "step": 1718, "train_runtime": 4134.2679, "train_tokens_per_second": 427.789 }, { "epoch": 0.7346938775510204, "grad_norm": 3.45713472366333, "learning_rate": 1.2671657754010696e-05, "loss": 0.16828308999538422, "num_input_tokens_seen": 1769324, "step": 1719, "train_runtime": 4136.2092, "train_tokens_per_second": 427.765 }, { "epoch": 0.7351212736403462, "grad_norm": 4.62410306930542, "learning_rate": 1.2667379679144387e-05, "loss": 0.1622631996870041, "num_input_tokens_seen": 1770244, "step": 1720, "train_runtime": 4138.3029, "train_tokens_per_second": 427.771 }, { "epoch": 0.7355486697296719, "grad_norm": 3.0335936546325684, "learning_rate": 1.2663101604278077e-05, "loss": 0.16483764350414276, "num_input_tokens_seen": 1771034, "step": 1721, "train_runtime": 4140.2914, "train_tokens_per_second": 427.756 }, { "epoch": 0.7359760658189978, "grad_norm": 3.9681930541992188, "learning_rate": 1.2658823529411766e-05, "loss": 0.11987143754959106, "num_input_tokens_seen": 1771848, "step": 1722, "train_runtime": 4142.422, "train_tokens_per_second": 427.732 }, { "epoch": 0.7364034619083235, "grad_norm": 3.1155405044555664, "learning_rate": 1.2654545454545454e-05, "loss": 0.10921688377857208, "num_input_tokens_seen": 1772830, "step": 1723, "train_runtime": 4144.4785, "train_tokens_per_second": 427.757 }, { "epoch": 0.7368308579976494, "grad_norm": 4.516935348510742, "learning_rate": 1.2650267379679147e-05, "loss": 0.14564579725265503, "num_input_tokens_seen": 1773516, "step": 1724, "train_runtime": 4146.4903, "train_tokens_per_second": 427.715 }, { "epoch": 0.7372582540869751, "grad_norm": 3.113145351409912, "learning_rate": 1.2645989304812836e-05, "loss": 0.12443186342716217, "num_input_tokens_seen": 1774302, "step": 1725, "train_runtime": 4148.6709, "train_tokens_per_second": 427.68 }, { "epoch": 0.7376856501763008, "grad_norm": 3.4054698944091797, "learning_rate": 1.2641711229946524e-05, "loss": 0.19764456152915955, "num_input_tokens_seen": 1775332, "step": 1726, "train_runtime": 4150.708, "train_tokens_per_second": 427.718 }, { "epoch": 0.7381130462656267, "grad_norm": 1.7858580350875854, "learning_rate": 1.2637433155080214e-05, "loss": 0.0921870619058609, "num_input_tokens_seen": 1777012, "step": 1727, "train_runtime": 4152.9714, "train_tokens_per_second": 427.889 }, { "epoch": 0.7385404423549524, "grad_norm": 2.897024631500244, "learning_rate": 1.2633155080213906e-05, "loss": 0.1305638700723648, "num_input_tokens_seen": 1778124, "step": 1728, "train_runtime": 4155.1162, "train_tokens_per_second": 427.936 }, { "epoch": 0.7389678384442783, "grad_norm": 2.877156972885132, "learning_rate": 1.2628877005347596e-05, "loss": 0.15893763303756714, "num_input_tokens_seen": 1778986, "step": 1729, "train_runtime": 4157.1675, "train_tokens_per_second": 427.932 }, { "epoch": 0.739395234533604, "grad_norm": 2.7703163623809814, "learning_rate": 1.2624598930481284e-05, "loss": 0.16486668586730957, "num_input_tokens_seen": 1780028, "step": 1730, "train_runtime": 4159.2708, "train_tokens_per_second": 427.966 }, { "epoch": 0.7398226306229299, "grad_norm": 2.6259467601776123, "learning_rate": 1.2620320855614973e-05, "loss": 0.0976109430193901, "num_input_tokens_seen": 1781036, "step": 1731, "train_runtime": 4161.3548, "train_tokens_per_second": 427.994 }, { "epoch": 0.7402500267122556, "grad_norm": 2.6563796997070312, "learning_rate": 1.2616042780748666e-05, "loss": 0.10229581594467163, "num_input_tokens_seen": 1782164, "step": 1732, "train_runtime": 4163.4706, "train_tokens_per_second": 428.048 }, { "epoch": 0.7406774228015813, "grad_norm": 2.7999024391174316, "learning_rate": 1.2611764705882354e-05, "loss": 0.10329177975654602, "num_input_tokens_seen": 1783190, "step": 1733, "train_runtime": 4165.5409, "train_tokens_per_second": 428.081 }, { "epoch": 0.7411048188909072, "grad_norm": 2.784428119659424, "learning_rate": 1.2607486631016043e-05, "loss": 0.15808075666427612, "num_input_tokens_seen": 1784506, "step": 1734, "train_runtime": 4167.7083, "train_tokens_per_second": 428.174 }, { "epoch": 0.7415322149802329, "grad_norm": 3.747777223587036, "learning_rate": 1.2603208556149733e-05, "loss": 0.12574762105941772, "num_input_tokens_seen": 1785292, "step": 1735, "train_runtime": 4169.7539, "train_tokens_per_second": 428.153 }, { "epoch": 0.7419596110695588, "grad_norm": 3.335115432739258, "learning_rate": 1.2598930481283425e-05, "loss": 0.14596965909004211, "num_input_tokens_seen": 1786170, "step": 1736, "train_runtime": 4171.8037, "train_tokens_per_second": 428.153 }, { "epoch": 0.7423870071588845, "grad_norm": 5.01472806930542, "learning_rate": 1.2594652406417113e-05, "loss": 0.16974447667598724, "num_input_tokens_seen": 1786842, "step": 1737, "train_runtime": 4173.7808, "train_tokens_per_second": 428.111 }, { "epoch": 0.7428144032482102, "grad_norm": 3.320187568664551, "learning_rate": 1.2590374331550803e-05, "loss": 0.17597053945064545, "num_input_tokens_seen": 1788128, "step": 1738, "train_runtime": 4175.944, "train_tokens_per_second": 428.197 }, { "epoch": 0.7432417993375361, "grad_norm": 3.2284138202667236, "learning_rate": 1.2586096256684492e-05, "loss": 0.15552473068237305, "num_input_tokens_seen": 1789048, "step": 1739, "train_runtime": 4178.02, "train_tokens_per_second": 428.205 }, { "epoch": 0.7436691954268618, "grad_norm": 3.238884687423706, "learning_rate": 1.2581818181818183e-05, "loss": 0.18473714590072632, "num_input_tokens_seen": 1790130, "step": 1740, "train_runtime": 4180.1213, "train_tokens_per_second": 428.248 }, { "epoch": 0.7440965915161877, "grad_norm": 2.707418918609619, "learning_rate": 1.2577540106951873e-05, "loss": 0.1684379130601883, "num_input_tokens_seen": 1791316, "step": 1741, "train_runtime": 4188.4932, "train_tokens_per_second": 427.676 }, { "epoch": 0.7445239876055134, "grad_norm": 3.8198659420013428, "learning_rate": 1.2573262032085562e-05, "loss": 0.10199625045061111, "num_input_tokens_seen": 1792168, "step": 1742, "train_runtime": 4190.4965, "train_tokens_per_second": 427.674 }, { "epoch": 0.7449513836948392, "grad_norm": 4.6382012367248535, "learning_rate": 1.2568983957219252e-05, "loss": 0.10959888249635696, "num_input_tokens_seen": 1792770, "step": 1743, "train_runtime": 4192.4783, "train_tokens_per_second": 427.616 }, { "epoch": 0.745378779784165, "grad_norm": 2.788638114929199, "learning_rate": 1.2564705882352943e-05, "loss": 0.1129089891910553, "num_input_tokens_seen": 1793856, "step": 1744, "train_runtime": 4194.5809, "train_tokens_per_second": 427.66 }, { "epoch": 0.7458061758734907, "grad_norm": 2.915764570236206, "learning_rate": 1.2560427807486632e-05, "loss": 0.16279761493206024, "num_input_tokens_seen": 1794662, "step": 1745, "train_runtime": 4196.5897, "train_tokens_per_second": 427.648 }, { "epoch": 0.7462335719628166, "grad_norm": 2.4101195335388184, "learning_rate": 1.2556149732620322e-05, "loss": 0.10009346902370453, "num_input_tokens_seen": 1795566, "step": 1746, "train_runtime": 4198.6187, "train_tokens_per_second": 427.656 }, { "epoch": 0.7466609680521423, "grad_norm": 3.4743504524230957, "learning_rate": 1.2551871657754011e-05, "loss": 0.12854984402656555, "num_input_tokens_seen": 1796186, "step": 1747, "train_runtime": 4200.561, "train_tokens_per_second": 427.606 }, { "epoch": 0.7470883641414681, "grad_norm": 2.804262638092041, "learning_rate": 1.25475935828877e-05, "loss": 0.18147476017475128, "num_input_tokens_seen": 1798050, "step": 1748, "train_runtime": 4202.8551, "train_tokens_per_second": 427.816 }, { "epoch": 0.7475157602307939, "grad_norm": 2.84769344329834, "learning_rate": 1.2543315508021392e-05, "loss": 0.1201382502913475, "num_input_tokens_seen": 1799004, "step": 1749, "train_runtime": 4204.9327, "train_tokens_per_second": 427.832 }, { "epoch": 0.7479431563201197, "grad_norm": 3.483933448791504, "learning_rate": 1.2539037433155081e-05, "loss": 0.10916777700185776, "num_input_tokens_seen": 1799964, "step": 1750, "train_runtime": 4207.006, "train_tokens_per_second": 427.849 }, { "epoch": 0.7483705524094455, "grad_norm": 3.2232701778411865, "learning_rate": 1.253475935828877e-05, "loss": 0.12337847799062729, "num_input_tokens_seen": 1800854, "step": 1751, "train_runtime": 4209.0698, "train_tokens_per_second": 427.851 }, { "epoch": 0.7487979484987712, "grad_norm": 2.846959352493286, "learning_rate": 1.253048128342246e-05, "loss": 0.16990630328655243, "num_input_tokens_seen": 1801794, "step": 1752, "train_runtime": 4211.1746, "train_tokens_per_second": 427.86 }, { "epoch": 0.749225344588097, "grad_norm": 2.67598032951355, "learning_rate": 1.2526203208556151e-05, "loss": 0.10821860283613205, "num_input_tokens_seen": 1802644, "step": 1753, "train_runtime": 4213.2295, "train_tokens_per_second": 427.853 }, { "epoch": 0.7496527406774228, "grad_norm": 3.1944963932037354, "learning_rate": 1.252192513368984e-05, "loss": 0.24526366591453552, "num_input_tokens_seen": 1803724, "step": 1754, "train_runtime": 4215.3604, "train_tokens_per_second": 427.893 }, { "epoch": 0.7500801367667486, "grad_norm": 2.943840742111206, "learning_rate": 1.251764705882353e-05, "loss": 0.15970027446746826, "num_input_tokens_seen": 1804638, "step": 1755, "train_runtime": 4217.5597, "train_tokens_per_second": 427.887 }, { "epoch": 0.7505075328560744, "grad_norm": 3.1619248390197754, "learning_rate": 1.251336898395722e-05, "loss": 0.16502642631530762, "num_input_tokens_seen": 1805340, "step": 1756, "train_runtime": 4219.538, "train_tokens_per_second": 427.853 }, { "epoch": 0.7509349289454001, "grad_norm": 3.274695634841919, "learning_rate": 1.250909090909091e-05, "loss": 0.15791615843772888, "num_input_tokens_seen": 1806728, "step": 1757, "train_runtime": 4221.7075, "train_tokens_per_second": 427.961 }, { "epoch": 0.7513623250347259, "grad_norm": 2.935295581817627, "learning_rate": 1.25048128342246e-05, "loss": 0.13088148832321167, "num_input_tokens_seen": 1807926, "step": 1758, "train_runtime": 4223.7775, "train_tokens_per_second": 428.035 }, { "epoch": 0.7517897211240517, "grad_norm": 3.229001045227051, "learning_rate": 1.250053475935829e-05, "loss": 0.19611865282058716, "num_input_tokens_seen": 1808960, "step": 1759, "train_runtime": 4225.852, "train_tokens_per_second": 428.07 }, { "epoch": 0.7522171172133775, "grad_norm": 2.4109506607055664, "learning_rate": 1.2496256684491979e-05, "loss": 0.11808124929666519, "num_input_tokens_seen": 1810242, "step": 1760, "train_runtime": 4227.9918, "train_tokens_per_second": 428.156 }, { "epoch": 0.7526445133027033, "grad_norm": 2.914564371109009, "learning_rate": 1.249197860962567e-05, "loss": 0.14882615208625793, "num_input_tokens_seen": 1811086, "step": 1761, "train_runtime": 4230.042, "train_tokens_per_second": 428.148 }, { "epoch": 0.7530719093920291, "grad_norm": 2.611783742904663, "learning_rate": 1.248770053475936e-05, "loss": 0.2134699523448944, "num_input_tokens_seen": 1812102, "step": 1762, "train_runtime": 4232.173, "train_tokens_per_second": 428.173 }, { "epoch": 0.7534993054813548, "grad_norm": 3.4775607585906982, "learning_rate": 1.2483422459893049e-05, "loss": 0.17539821565151215, "num_input_tokens_seen": 1812822, "step": 1763, "train_runtime": 4234.1844, "train_tokens_per_second": 428.14 }, { "epoch": 0.7539267015706806, "grad_norm": 3.1305854320526123, "learning_rate": 1.2479144385026738e-05, "loss": 0.18104904890060425, "num_input_tokens_seen": 1813886, "step": 1764, "train_runtime": 4236.2635, "train_tokens_per_second": 428.181 }, { "epoch": 0.7543540976600064, "grad_norm": 2.763216257095337, "learning_rate": 1.247486631016043e-05, "loss": 0.12206174433231354, "num_input_tokens_seen": 1815006, "step": 1765, "train_runtime": 4238.3948, "train_tokens_per_second": 428.23 }, { "epoch": 0.7547814937493322, "grad_norm": 2.1365344524383545, "learning_rate": 1.2470588235294119e-05, "loss": 0.10479989647865295, "num_input_tokens_seen": 1815906, "step": 1766, "train_runtime": 4240.4826, "train_tokens_per_second": 428.231 }, { "epoch": 0.755208889838658, "grad_norm": 2.2437663078308105, "learning_rate": 1.2466310160427808e-05, "loss": 0.07789380103349686, "num_input_tokens_seen": 1816980, "step": 1767, "train_runtime": 4242.5519, "train_tokens_per_second": 428.275 }, { "epoch": 0.7556362859279837, "grad_norm": 2.27329158782959, "learning_rate": 1.2462032085561498e-05, "loss": 0.11260631680488586, "num_input_tokens_seen": 1817988, "step": 1768, "train_runtime": 4244.591, "train_tokens_per_second": 428.307 }, { "epoch": 0.7560636820173096, "grad_norm": 2.837125778198242, "learning_rate": 1.2457754010695189e-05, "loss": 0.16431836783885956, "num_input_tokens_seen": 1819128, "step": 1769, "train_runtime": 4246.6892, "train_tokens_per_second": 428.364 }, { "epoch": 0.7564910781066353, "grad_norm": 1.7793630361557007, "learning_rate": 1.2453475935828878e-05, "loss": 0.08038732409477234, "num_input_tokens_seen": 1820096, "step": 1770, "train_runtime": 4248.7316, "train_tokens_per_second": 428.386 }, { "epoch": 0.7569184741959611, "grad_norm": 2.8599798679351807, "learning_rate": 1.2449197860962568e-05, "loss": 0.1291077733039856, "num_input_tokens_seen": 1820958, "step": 1771, "train_runtime": 4257.3071, "train_tokens_per_second": 427.725 }, { "epoch": 0.7573458702852869, "grad_norm": 3.425774335861206, "learning_rate": 1.2444919786096257e-05, "loss": 0.1876506507396698, "num_input_tokens_seen": 1821880, "step": 1772, "train_runtime": 4259.3967, "train_tokens_per_second": 427.732 }, { "epoch": 0.7577732663746126, "grad_norm": 2.5635290145874023, "learning_rate": 1.2440641711229948e-05, "loss": 0.14740212261676788, "num_input_tokens_seen": 1822866, "step": 1773, "train_runtime": 4261.4621, "train_tokens_per_second": 427.756 }, { "epoch": 0.7582006624639385, "grad_norm": 3.358508825302124, "learning_rate": 1.2436363636363638e-05, "loss": 0.2512654662132263, "num_input_tokens_seen": 1823646, "step": 1774, "train_runtime": 4263.4883, "train_tokens_per_second": 427.736 }, { "epoch": 0.7586280585532642, "grad_norm": 2.407524347305298, "learning_rate": 1.2432085561497327e-05, "loss": 0.14994464814662933, "num_input_tokens_seen": 1825138, "step": 1775, "train_runtime": 4265.7137, "train_tokens_per_second": 427.862 }, { "epoch": 0.75905545464259, "grad_norm": 2.9009687900543213, "learning_rate": 1.2427807486631017e-05, "loss": 0.1654253900051117, "num_input_tokens_seen": 1825992, "step": 1776, "train_runtime": 4267.7444, "train_tokens_per_second": 427.859 }, { "epoch": 0.7594828507319158, "grad_norm": 1.869413137435913, "learning_rate": 1.2423529411764708e-05, "loss": 0.0809844508767128, "num_input_tokens_seen": 1827504, "step": 1777, "train_runtime": 4269.96, "train_tokens_per_second": 427.991 }, { "epoch": 0.7599102468212415, "grad_norm": 1.9973881244659424, "learning_rate": 1.2419251336898397e-05, "loss": 0.07713896036148071, "num_input_tokens_seen": 1828998, "step": 1778, "train_runtime": 4272.1232, "train_tokens_per_second": 428.124 }, { "epoch": 0.7603376429105674, "grad_norm": 2.606424331665039, "learning_rate": 1.2414973262032087e-05, "loss": 0.09174610674381256, "num_input_tokens_seen": 1829948, "step": 1779, "train_runtime": 4274.2064, "train_tokens_per_second": 428.137 }, { "epoch": 0.7607650389998931, "grad_norm": 3.9461727142333984, "learning_rate": 1.2410695187165776e-05, "loss": 0.1827625185251236, "num_input_tokens_seen": 1831222, "step": 1780, "train_runtime": 4276.3501, "train_tokens_per_second": 428.221 }, { "epoch": 0.761192435089219, "grad_norm": 3.3259847164154053, "learning_rate": 1.2406417112299467e-05, "loss": 0.17484451830387115, "num_input_tokens_seen": 1832244, "step": 1781, "train_runtime": 4278.4585, "train_tokens_per_second": 428.249 }, { "epoch": 0.7616198311785447, "grad_norm": 1.900813341140747, "learning_rate": 1.2402139037433157e-05, "loss": 0.08792635053396225, "num_input_tokens_seen": 1833752, "step": 1782, "train_runtime": 4280.6523, "train_tokens_per_second": 428.381 }, { "epoch": 0.7620472272678706, "grad_norm": 3.819176435470581, "learning_rate": 1.2397860962566846e-05, "loss": 0.2154502421617508, "num_input_tokens_seen": 1834596, "step": 1783, "train_runtime": 4282.6576, "train_tokens_per_second": 428.378 }, { "epoch": 0.7624746233571963, "grad_norm": 2.9362082481384277, "learning_rate": 1.2393582887700534e-05, "loss": 0.18833956122398376, "num_input_tokens_seen": 1835838, "step": 1784, "train_runtime": 4284.8036, "train_tokens_per_second": 428.453 }, { "epoch": 0.762902019446522, "grad_norm": 4.101992607116699, "learning_rate": 1.2389304812834227e-05, "loss": 0.1190357506275177, "num_input_tokens_seen": 1836712, "step": 1785, "train_runtime": 4286.8422, "train_tokens_per_second": 428.453 }, { "epoch": 0.7633294155358479, "grad_norm": 4.283321380615234, "learning_rate": 1.2385026737967916e-05, "loss": 0.2087101936340332, "num_input_tokens_seen": 1837436, "step": 1786, "train_runtime": 4288.8695, "train_tokens_per_second": 428.42 }, { "epoch": 0.7637568116251736, "grad_norm": 2.6511285305023193, "learning_rate": 1.2380748663101606e-05, "loss": 0.09836596250534058, "num_input_tokens_seen": 1838206, "step": 1787, "train_runtime": 4290.9125, "train_tokens_per_second": 428.395 }, { "epoch": 0.7641842077144995, "grad_norm": 4.136745452880859, "learning_rate": 1.2376470588235294e-05, "loss": 0.1616525650024414, "num_input_tokens_seen": 1839590, "step": 1788, "train_runtime": 4293.0719, "train_tokens_per_second": 428.502 }, { "epoch": 0.7646116038038252, "grad_norm": 2.8372857570648193, "learning_rate": 1.2372192513368986e-05, "loss": 0.09618731588125229, "num_input_tokens_seen": 1840380, "step": 1789, "train_runtime": 4295.0617, "train_tokens_per_second": 428.487 }, { "epoch": 0.7650389998931509, "grad_norm": 2.310497283935547, "learning_rate": 1.2367914438502676e-05, "loss": 0.12419398128986359, "num_input_tokens_seen": 1841326, "step": 1790, "train_runtime": 4297.1207, "train_tokens_per_second": 428.502 }, { "epoch": 0.7654663959824768, "grad_norm": 3.164872884750366, "learning_rate": 1.2363636363636364e-05, "loss": 0.11873511970043182, "num_input_tokens_seen": 1842096, "step": 1791, "train_runtime": 4299.1351, "train_tokens_per_second": 428.481 }, { "epoch": 0.7658937920718025, "grad_norm": 3.534221887588501, "learning_rate": 1.2359358288770053e-05, "loss": 0.15829111635684967, "num_input_tokens_seen": 1842650, "step": 1792, "train_runtime": 4301.0667, "train_tokens_per_second": 428.417 }, { "epoch": 0.7663211881611284, "grad_norm": 2.8869614601135254, "learning_rate": 1.2355080213903746e-05, "loss": 0.16093742847442627, "num_input_tokens_seen": 1843962, "step": 1793, "train_runtime": 4303.2007, "train_tokens_per_second": 428.509 }, { "epoch": 0.7667485842504541, "grad_norm": 4.311562538146973, "learning_rate": 1.2350802139037434e-05, "loss": 0.2588258981704712, "num_input_tokens_seen": 1844878, "step": 1794, "train_runtime": 4305.2642, "train_tokens_per_second": 428.517 }, { "epoch": 0.7671759803397799, "grad_norm": 4.153341293334961, "learning_rate": 1.2346524064171123e-05, "loss": 0.14938843250274658, "num_input_tokens_seen": 1845536, "step": 1795, "train_runtime": 4307.2342, "train_tokens_per_second": 428.474 }, { "epoch": 0.7676033764291057, "grad_norm": 2.732607126235962, "learning_rate": 1.2342245989304812e-05, "loss": 0.15332266688346863, "num_input_tokens_seen": 1846996, "step": 1796, "train_runtime": 4309.4255, "train_tokens_per_second": 428.594 }, { "epoch": 0.7680307725184314, "grad_norm": 3.60335111618042, "learning_rate": 1.2337967914438505e-05, "loss": 0.15083912014961243, "num_input_tokens_seen": 1848206, "step": 1797, "train_runtime": 4311.5582, "train_tokens_per_second": 428.663 }, { "epoch": 0.7684581686077573, "grad_norm": 3.4597063064575195, "learning_rate": 1.2333689839572193e-05, "loss": 0.17319080233573914, "num_input_tokens_seen": 1849206, "step": 1798, "train_runtime": 4313.6339, "train_tokens_per_second": 428.689 }, { "epoch": 0.768885564697083, "grad_norm": 2.7628331184387207, "learning_rate": 1.2329411764705882e-05, "loss": 0.11759724467992783, "num_input_tokens_seen": 1849852, "step": 1799, "train_runtime": 4315.6069, "train_tokens_per_second": 428.642 }, { "epoch": 0.7693129607864088, "grad_norm": 3.115293502807617, "learning_rate": 1.2325133689839572e-05, "loss": 0.14337000250816345, "num_input_tokens_seen": 1851192, "step": 1800, "train_runtime": 4317.738, "train_tokens_per_second": 428.741 }, { "epoch": 0.7697403568757346, "grad_norm": 3.182490587234497, "learning_rate": 1.2320855614973263e-05, "loss": 0.1292513906955719, "num_input_tokens_seen": 1852074, "step": 1801, "train_runtime": 4326.4491, "train_tokens_per_second": 428.082 }, { "epoch": 0.7701677529650603, "grad_norm": 2.756492853164673, "learning_rate": 1.2316577540106953e-05, "loss": 0.16810327768325806, "num_input_tokens_seen": 1853086, "step": 1802, "train_runtime": 4328.5524, "train_tokens_per_second": 428.108 }, { "epoch": 0.7705951490543862, "grad_norm": 2.266127109527588, "learning_rate": 1.2312299465240642e-05, "loss": 0.134847030043602, "num_input_tokens_seen": 1854112, "step": 1803, "train_runtime": 4330.6585, "train_tokens_per_second": 428.136 }, { "epoch": 0.7710225451437119, "grad_norm": 3.6650660037994385, "learning_rate": 1.2308021390374331e-05, "loss": 0.12369846552610397, "num_input_tokens_seen": 1855120, "step": 1804, "train_runtime": 4332.7248, "train_tokens_per_second": 428.165 }, { "epoch": 0.7714499412330377, "grad_norm": 2.8042409420013428, "learning_rate": 1.2303743315508023e-05, "loss": 0.09973473846912384, "num_input_tokens_seen": 1855818, "step": 1805, "train_runtime": 4334.7173, "train_tokens_per_second": 428.129 }, { "epoch": 0.7718773373223635, "grad_norm": 2.951108932495117, "learning_rate": 1.2299465240641712e-05, "loss": 0.110304094851017, "num_input_tokens_seen": 1856408, "step": 1806, "train_runtime": 4336.6975, "train_tokens_per_second": 428.07 }, { "epoch": 0.7723047334116893, "grad_norm": 3.008371353149414, "learning_rate": 1.2295187165775401e-05, "loss": 0.1220649927854538, "num_input_tokens_seen": 1857328, "step": 1807, "train_runtime": 4338.8552, "train_tokens_per_second": 428.069 }, { "epoch": 0.7727321295010151, "grad_norm": 3.2356770038604736, "learning_rate": 1.2290909090909091e-05, "loss": 0.17200100421905518, "num_input_tokens_seen": 1858462, "step": 1808, "train_runtime": 4340.9454, "train_tokens_per_second": 428.124 }, { "epoch": 0.7731595255903408, "grad_norm": 3.228485584259033, "learning_rate": 1.2286631016042782e-05, "loss": 0.1288929283618927, "num_input_tokens_seen": 1859326, "step": 1809, "train_runtime": 4343.0364, "train_tokens_per_second": 428.117 }, { "epoch": 0.7735869216796666, "grad_norm": 2.7139246463775635, "learning_rate": 1.2282352941176471e-05, "loss": 0.12399152666330338, "num_input_tokens_seen": 1860078, "step": 1810, "train_runtime": 4345.2019, "train_tokens_per_second": 428.076 }, { "epoch": 0.7740143177689924, "grad_norm": 2.4700589179992676, "learning_rate": 1.2278074866310161e-05, "loss": 0.12367812544107437, "num_input_tokens_seen": 1861088, "step": 1811, "train_runtime": 4347.3237, "train_tokens_per_second": 428.1 }, { "epoch": 0.7744417138583182, "grad_norm": 3.568169355392456, "learning_rate": 1.227379679144385e-05, "loss": 0.13981027901172638, "num_input_tokens_seen": 1861916, "step": 1812, "train_runtime": 4349.4386, "train_tokens_per_second": 428.082 }, { "epoch": 0.774869109947644, "grad_norm": 2.8587687015533447, "learning_rate": 1.2269518716577542e-05, "loss": 0.12921200692653656, "num_input_tokens_seen": 1862624, "step": 1813, "train_runtime": 4351.5854, "train_tokens_per_second": 428.033 }, { "epoch": 0.7752965060369698, "grad_norm": 3.8217129707336426, "learning_rate": 1.2265240641711231e-05, "loss": 0.13139057159423828, "num_input_tokens_seen": 1863660, "step": 1814, "train_runtime": 4353.731, "train_tokens_per_second": 428.06 }, { "epoch": 0.7757239021262955, "grad_norm": 2.0437350273132324, "learning_rate": 1.226096256684492e-05, "loss": 0.10422183573246002, "num_input_tokens_seen": 1864714, "step": 1815, "train_runtime": 4355.8017, "train_tokens_per_second": 428.099 }, { "epoch": 0.7761512982156213, "grad_norm": 2.9613823890686035, "learning_rate": 1.225668449197861e-05, "loss": 0.16858945786952972, "num_input_tokens_seen": 1865414, "step": 1816, "train_runtime": 4357.8182, "train_tokens_per_second": 428.061 }, { "epoch": 0.7765786943049471, "grad_norm": 3.295197010040283, "learning_rate": 1.2252406417112301e-05, "loss": 0.17331922054290771, "num_input_tokens_seen": 1866346, "step": 1817, "train_runtime": 4359.8926, "train_tokens_per_second": 428.072 }, { "epoch": 0.7770060903942729, "grad_norm": 5.003626823425293, "learning_rate": 1.224812834224599e-05, "loss": 0.2478761374950409, "num_input_tokens_seen": 1867286, "step": 1818, "train_runtime": 4361.9827, "train_tokens_per_second": 428.082 }, { "epoch": 0.7774334864835987, "grad_norm": 3.4966726303100586, "learning_rate": 1.224385026737968e-05, "loss": 0.14820632338523865, "num_input_tokens_seen": 1868052, "step": 1819, "train_runtime": 4364.0258, "train_tokens_per_second": 428.057 }, { "epoch": 0.7778608825729244, "grad_norm": 2.869807720184326, "learning_rate": 1.223957219251337e-05, "loss": 0.1422082781791687, "num_input_tokens_seen": 1869264, "step": 1820, "train_runtime": 4366.1735, "train_tokens_per_second": 428.124 }, { "epoch": 0.7782882786622503, "grad_norm": 2.4492299556732178, "learning_rate": 1.223529411764706e-05, "loss": 0.12338537722826004, "num_input_tokens_seen": 1870456, "step": 1821, "train_runtime": 4368.3101, "train_tokens_per_second": 428.188 }, { "epoch": 0.778715674751576, "grad_norm": 2.3549654483795166, "learning_rate": 1.223101604278075e-05, "loss": 0.15092220902442932, "num_input_tokens_seen": 1871972, "step": 1822, "train_runtime": 4370.5129, "train_tokens_per_second": 428.319 }, { "epoch": 0.7791430708409018, "grad_norm": 4.360873222351074, "learning_rate": 1.222673796791444e-05, "loss": 0.13382264971733093, "num_input_tokens_seen": 1872810, "step": 1823, "train_runtime": 4372.5505, "train_tokens_per_second": 428.311 }, { "epoch": 0.7795704669302276, "grad_norm": 2.985707998275757, "learning_rate": 1.2222459893048129e-05, "loss": 0.11476238071918488, "num_input_tokens_seen": 1873992, "step": 1824, "train_runtime": 4374.6884, "train_tokens_per_second": 428.372 }, { "epoch": 0.7799978630195533, "grad_norm": 3.015141487121582, "learning_rate": 1.221818181818182e-05, "loss": 0.18612177670001984, "num_input_tokens_seen": 1874830, "step": 1825, "train_runtime": 4376.7349, "train_tokens_per_second": 428.363 }, { "epoch": 0.7804252591088792, "grad_norm": 3.2259037494659424, "learning_rate": 1.221390374331551e-05, "loss": 0.14476238191127777, "num_input_tokens_seen": 1875602, "step": 1826, "train_runtime": 4378.7863, "train_tokens_per_second": 428.338 }, { "epoch": 0.7808526551982049, "grad_norm": 2.8509538173675537, "learning_rate": 1.2209625668449199e-05, "loss": 0.1654292196035385, "num_input_tokens_seen": 1876560, "step": 1827, "train_runtime": 4380.9107, "train_tokens_per_second": 428.349 }, { "epoch": 0.7812800512875308, "grad_norm": 2.0071630477905273, "learning_rate": 1.2205347593582888e-05, "loss": 0.12034884095191956, "num_input_tokens_seen": 1877702, "step": 1828, "train_runtime": 4383.028, "train_tokens_per_second": 428.403 }, { "epoch": 0.7817074473768565, "grad_norm": 2.5182299613952637, "learning_rate": 1.220106951871658e-05, "loss": 0.24549561738967896, "num_input_tokens_seen": 1878878, "step": 1829, "train_runtime": 4385.1451, "train_tokens_per_second": 428.464 }, { "epoch": 0.7821348434661823, "grad_norm": 4.174243927001953, "learning_rate": 1.2196791443850269e-05, "loss": 0.08729416131973267, "num_input_tokens_seen": 1879378, "step": 1830, "train_runtime": 4387.095, "train_tokens_per_second": 428.388 }, { "epoch": 0.7825622395555081, "grad_norm": 3.676351308822632, "learning_rate": 1.2192513368983958e-05, "loss": 0.19944506883621216, "num_input_tokens_seen": 1880362, "step": 1831, "train_runtime": 4395.8122, "train_tokens_per_second": 427.762 }, { "epoch": 0.7829896356448338, "grad_norm": 5.0852766036987305, "learning_rate": 1.2188235294117648e-05, "loss": 0.26022642850875854, "num_input_tokens_seen": 1881118, "step": 1832, "train_runtime": 4397.8645, "train_tokens_per_second": 427.734 }, { "epoch": 0.7834170317341597, "grad_norm": 3.649362564086914, "learning_rate": 1.2183957219251339e-05, "loss": 0.1976720690727234, "num_input_tokens_seen": 1882114, "step": 1833, "train_runtime": 4400.0081, "train_tokens_per_second": 427.752 }, { "epoch": 0.7838444278234854, "grad_norm": 2.1792664527893066, "learning_rate": 1.2179679144385028e-05, "loss": 0.07211606204509735, "num_input_tokens_seen": 1883070, "step": 1834, "train_runtime": 4402.0918, "train_tokens_per_second": 427.767 }, { "epoch": 0.7842718239128113, "grad_norm": 3.1566128730773926, "learning_rate": 1.2175401069518718e-05, "loss": 0.16733992099761963, "num_input_tokens_seen": 1883892, "step": 1835, "train_runtime": 4404.1334, "train_tokens_per_second": 427.755 }, { "epoch": 0.784699220002137, "grad_norm": 1.6701500415802002, "learning_rate": 1.2171122994652407e-05, "loss": 0.07423573732376099, "num_input_tokens_seen": 1885090, "step": 1836, "train_runtime": 4406.2833, "train_tokens_per_second": 427.819 }, { "epoch": 0.7851266160914627, "grad_norm": 2.973598003387451, "learning_rate": 1.2166844919786098e-05, "loss": 0.1275968849658966, "num_input_tokens_seen": 1886034, "step": 1837, "train_runtime": 4408.3542, "train_tokens_per_second": 427.832 }, { "epoch": 0.7855540121807886, "grad_norm": 3.8972911834716797, "learning_rate": 1.2162566844919788e-05, "loss": 0.2016734480857849, "num_input_tokens_seen": 1887506, "step": 1838, "train_runtime": 4410.5179, "train_tokens_per_second": 427.956 }, { "epoch": 0.7859814082701143, "grad_norm": 2.3188345432281494, "learning_rate": 1.2158288770053477e-05, "loss": 0.1339975893497467, "num_input_tokens_seen": 1889108, "step": 1839, "train_runtime": 4412.7334, "train_tokens_per_second": 428.104 }, { "epoch": 0.7864088043594402, "grad_norm": 1.981019377708435, "learning_rate": 1.2154010695187167e-05, "loss": 0.11797478049993515, "num_input_tokens_seen": 1890818, "step": 1840, "train_runtime": 4414.9385, "train_tokens_per_second": 428.277 }, { "epoch": 0.7868362004487659, "grad_norm": 2.261542558670044, "learning_rate": 1.2149732620320858e-05, "loss": 0.07785042375326157, "num_input_tokens_seen": 1891494, "step": 1841, "train_runtime": 4416.9177, "train_tokens_per_second": 428.238 }, { "epoch": 0.7872635965380916, "grad_norm": 2.9760546684265137, "learning_rate": 1.2145454545454547e-05, "loss": 0.12564532458782196, "num_input_tokens_seen": 1892488, "step": 1842, "train_runtime": 4419.0074, "train_tokens_per_second": 428.261 }, { "epoch": 0.7876909926274175, "grad_norm": 1.758131504058838, "learning_rate": 1.2141176470588237e-05, "loss": 0.0910901129245758, "num_input_tokens_seen": 1893790, "step": 1843, "train_runtime": 4421.2268, "train_tokens_per_second": 428.34 }, { "epoch": 0.7881183887167432, "grad_norm": 2.690927505493164, "learning_rate": 1.2136898395721926e-05, "loss": 0.14538080990314484, "num_input_tokens_seen": 1894892, "step": 1844, "train_runtime": 4423.3054, "train_tokens_per_second": 428.388 }, { "epoch": 0.7885457848060691, "grad_norm": 4.087973117828369, "learning_rate": 1.2132620320855617e-05, "loss": 0.19727779924869537, "num_input_tokens_seen": 1895542, "step": 1845, "train_runtime": 4425.5222, "train_tokens_per_second": 428.321 }, { "epoch": 0.7889731808953948, "grad_norm": 3.1194968223571777, "learning_rate": 1.2128342245989307e-05, "loss": 0.2249072641134262, "num_input_tokens_seen": 1896596, "step": 1846, "train_runtime": 4427.576, "train_tokens_per_second": 428.36 }, { "epoch": 0.7894005769847205, "grad_norm": 3.3519327640533447, "learning_rate": 1.2124064171122996e-05, "loss": 0.1892613023519516, "num_input_tokens_seen": 1897578, "step": 1847, "train_runtime": 4429.6196, "train_tokens_per_second": 428.384 }, { "epoch": 0.7898279730740464, "grad_norm": 4.134048938751221, "learning_rate": 1.2119786096256686e-05, "loss": 0.21346129477024078, "num_input_tokens_seen": 1898646, "step": 1848, "train_runtime": 4431.6929, "train_tokens_per_second": 428.425 }, { "epoch": 0.7902553691633721, "grad_norm": 2.2150657176971436, "learning_rate": 1.2115508021390377e-05, "loss": 0.0927320048213005, "num_input_tokens_seen": 1899718, "step": 1849, "train_runtime": 4433.7996, "train_tokens_per_second": 428.463 }, { "epoch": 0.790682765252698, "grad_norm": 1.9254262447357178, "learning_rate": 1.2111229946524066e-05, "loss": 0.0757264494895935, "num_input_tokens_seen": 1900998, "step": 1850, "train_runtime": 4435.9456, "train_tokens_per_second": 428.544 }, { "epoch": 0.7911101613420237, "grad_norm": 2.189628839492798, "learning_rate": 1.2106951871657756e-05, "loss": 0.09491493552923203, "num_input_tokens_seen": 1901850, "step": 1851, "train_runtime": 4437.9879, "train_tokens_per_second": 428.539 }, { "epoch": 0.7915375574313495, "grad_norm": 2.282789468765259, "learning_rate": 1.2102673796791443e-05, "loss": 0.13587215542793274, "num_input_tokens_seen": 1902918, "step": 1852, "train_runtime": 4440.0609, "train_tokens_per_second": 428.579 }, { "epoch": 0.7919649535206753, "grad_norm": 3.310476541519165, "learning_rate": 1.2098395721925136e-05, "loss": 0.14387257397174835, "num_input_tokens_seen": 1903776, "step": 1853, "train_runtime": 4442.0678, "train_tokens_per_second": 428.579 }, { "epoch": 0.792392349610001, "grad_norm": 3.180478811264038, "learning_rate": 1.2094117647058826e-05, "loss": 0.19241297245025635, "num_input_tokens_seen": 1904982, "step": 1854, "train_runtime": 4444.1946, "train_tokens_per_second": 428.645 }, { "epoch": 0.7928197456993269, "grad_norm": 4.283200740814209, "learning_rate": 1.2089839572192515e-05, "loss": 0.18826483190059662, "num_input_tokens_seen": 1905624, "step": 1855, "train_runtime": 4446.2009, "train_tokens_per_second": 428.596 }, { "epoch": 0.7932471417886526, "grad_norm": 4.868692874908447, "learning_rate": 1.2085561497326203e-05, "loss": 0.1696545034646988, "num_input_tokens_seen": 1906454, "step": 1856, "train_runtime": 4448.2548, "train_tokens_per_second": 428.585 }, { "epoch": 0.7936745378779784, "grad_norm": 2.9834084510803223, "learning_rate": 1.2081283422459892e-05, "loss": 0.1212657168507576, "num_input_tokens_seen": 1907816, "step": 1857, "train_runtime": 4450.3991, "train_tokens_per_second": 428.684 }, { "epoch": 0.7941019339673042, "grad_norm": 2.3191118240356445, "learning_rate": 1.2077005347593585e-05, "loss": 0.10848109424114227, "num_input_tokens_seen": 1909478, "step": 1858, "train_runtime": 4452.6289, "train_tokens_per_second": 428.843 }, { "epoch": 0.79452933005663, "grad_norm": 3.261073350906372, "learning_rate": 1.2072727272727273e-05, "loss": 0.122526153922081, "num_input_tokens_seen": 1910396, "step": 1859, "train_runtime": 4454.6878, "train_tokens_per_second": 428.851 }, { "epoch": 0.7949567261459558, "grad_norm": 2.9008889198303223, "learning_rate": 1.2068449197860962e-05, "loss": 0.08777370303869247, "num_input_tokens_seen": 1911126, "step": 1860, "train_runtime": 4456.7003, "train_tokens_per_second": 428.821 }, { "epoch": 0.7953841222352815, "grad_norm": 3.3785629272460938, "learning_rate": 1.2064171122994652e-05, "loss": 0.10935518145561218, "num_input_tokens_seen": 1911846, "step": 1861, "train_runtime": 4465.2868, "train_tokens_per_second": 428.157 }, { "epoch": 0.7958115183246073, "grad_norm": 2.525773763656616, "learning_rate": 1.2059893048128343e-05, "loss": 0.12208137661218643, "num_input_tokens_seen": 1913048, "step": 1862, "train_runtime": 4467.4048, "train_tokens_per_second": 428.224 }, { "epoch": 0.7962389144139331, "grad_norm": 2.3992831707000732, "learning_rate": 1.2055614973262032e-05, "loss": 0.10732989013195038, "num_input_tokens_seen": 1914338, "step": 1863, "train_runtime": 4469.5447, "train_tokens_per_second": 428.307 }, { "epoch": 0.7966663105032589, "grad_norm": 3.6788501739501953, "learning_rate": 1.2051336898395722e-05, "loss": 0.18382295966148376, "num_input_tokens_seen": 1915156, "step": 1864, "train_runtime": 4471.5983, "train_tokens_per_second": 428.293 }, { "epoch": 0.7970937065925847, "grad_norm": 2.580742120742798, "learning_rate": 1.2047058823529411e-05, "loss": 0.2171119600534439, "num_input_tokens_seen": 1916360, "step": 1865, "train_runtime": 4473.714, "train_tokens_per_second": 428.36 }, { "epoch": 0.7975211026819105, "grad_norm": 2.459043502807617, "learning_rate": 1.2042780748663102e-05, "loss": 0.14649857580661774, "num_input_tokens_seen": 1917328, "step": 1866, "train_runtime": 4475.7737, "train_tokens_per_second": 428.379 }, { "epoch": 0.7979484987712362, "grad_norm": 2.722545862197876, "learning_rate": 1.2038502673796792e-05, "loss": 0.19640393555164337, "num_input_tokens_seen": 1918666, "step": 1867, "train_runtime": 4477.9542, "train_tokens_per_second": 428.469 }, { "epoch": 0.798375894860562, "grad_norm": 2.932243824005127, "learning_rate": 1.2034224598930481e-05, "loss": 0.17902055382728577, "num_input_tokens_seen": 1919910, "step": 1868, "train_runtime": 4480.0987, "train_tokens_per_second": 428.542 }, { "epoch": 0.7988032909498878, "grad_norm": 2.163515567779541, "learning_rate": 1.202994652406417e-05, "loss": 0.12526603043079376, "num_input_tokens_seen": 1921020, "step": 1869, "train_runtime": 4482.1928, "train_tokens_per_second": 428.589 }, { "epoch": 0.7992306870392136, "grad_norm": 2.9243991374969482, "learning_rate": 1.2025668449197862e-05, "loss": 0.12168437987565994, "num_input_tokens_seen": 1922298, "step": 1870, "train_runtime": 4484.3249, "train_tokens_per_second": 428.671 }, { "epoch": 0.7996580831285394, "grad_norm": 3.3715198040008545, "learning_rate": 1.2021390374331551e-05, "loss": 0.19191522896289825, "num_input_tokens_seen": 1923092, "step": 1871, "train_runtime": 4486.3351, "train_tokens_per_second": 428.655 }, { "epoch": 0.8000854792178651, "grad_norm": 4.176147937774658, "learning_rate": 1.201711229946524e-05, "loss": 0.10397354513406754, "num_input_tokens_seen": 1923818, "step": 1872, "train_runtime": 4488.3279, "train_tokens_per_second": 428.627 }, { "epoch": 0.8000854792178651, "eval_loss": 0.5246274471282959, "eval_runtime": 58.6395, "eval_samples_per_second": 17.019, "eval_steps_per_second": 8.51, "num_input_tokens_seen": 1923818, "step": 1872 }, { "epoch": 0.800512875307191, "grad_norm": 2.4083259105682373, "learning_rate": 1.201283422459893e-05, "loss": 0.11328636109828949, "num_input_tokens_seen": 1924722, "step": 1873, "train_runtime": 4549.0126, "train_tokens_per_second": 423.108 }, { "epoch": 0.8009402713965167, "grad_norm": 3.093846559524536, "learning_rate": 1.2008556149732621e-05, "loss": 0.11408796906471252, "num_input_tokens_seen": 1925368, "step": 1874, "train_runtime": 4551.0795, "train_tokens_per_second": 423.057 }, { "epoch": 0.8013676674858425, "grad_norm": 4.824093818664551, "learning_rate": 1.2004278074866311e-05, "loss": 0.20181873440742493, "num_input_tokens_seen": 1925972, "step": 1875, "train_runtime": 4553.0886, "train_tokens_per_second": 423.003 }, { "epoch": 0.8017950635751683, "grad_norm": 2.236607789993286, "learning_rate": 1.2e-05, "loss": 0.09922008216381073, "num_input_tokens_seen": 1927012, "step": 1876, "train_runtime": 4555.1625, "train_tokens_per_second": 423.039 }, { "epoch": 0.8022224596644941, "grad_norm": 2.522822618484497, "learning_rate": 1.199572192513369e-05, "loss": 0.1273057609796524, "num_input_tokens_seen": 1928134, "step": 1877, "train_runtime": 4557.2659, "train_tokens_per_second": 423.09 }, { "epoch": 0.8026498557538199, "grad_norm": 2.0603935718536377, "learning_rate": 1.1991443850267381e-05, "loss": 0.08036594837903976, "num_input_tokens_seen": 1928898, "step": 1878, "train_runtime": 4559.277, "train_tokens_per_second": 423.071 }, { "epoch": 0.8030772518431456, "grad_norm": 1.789493203163147, "learning_rate": 1.198716577540107e-05, "loss": 0.05749205872416496, "num_input_tokens_seen": 1930108, "step": 1879, "train_runtime": 4561.3809, "train_tokens_per_second": 423.141 }, { "epoch": 0.8035046479324714, "grad_norm": 2.3337302207946777, "learning_rate": 1.198288770053476e-05, "loss": 0.10587199032306671, "num_input_tokens_seen": 1931350, "step": 1880, "train_runtime": 4563.5158, "train_tokens_per_second": 423.215 }, { "epoch": 0.8039320440217972, "grad_norm": 2.002426862716675, "learning_rate": 1.197860962566845e-05, "loss": 0.0680728554725647, "num_input_tokens_seen": 1932190, "step": 1881, "train_runtime": 4565.5545, "train_tokens_per_second": 423.21 }, { "epoch": 0.804359440111123, "grad_norm": 3.0435385704040527, "learning_rate": 1.197433155080214e-05, "loss": 0.2086118906736374, "num_input_tokens_seen": 1933088, "step": 1882, "train_runtime": 4567.6067, "train_tokens_per_second": 423.217 }, { "epoch": 0.8047868362004488, "grad_norm": 2.4492571353912354, "learning_rate": 1.197005347593583e-05, "loss": 0.2437245100736618, "num_input_tokens_seen": 1935796, "step": 1883, "train_runtime": 4570.0887, "train_tokens_per_second": 423.58 }, { "epoch": 0.8052142322897745, "grad_norm": 3.086801767349243, "learning_rate": 1.196577540106952e-05, "loss": 0.15454979240894318, "num_input_tokens_seen": 1936758, "step": 1884, "train_runtime": 4572.1648, "train_tokens_per_second": 423.598 }, { "epoch": 0.8056416283791004, "grad_norm": 5.520110607147217, "learning_rate": 1.1961497326203209e-05, "loss": 0.206394761800766, "num_input_tokens_seen": 1937432, "step": 1885, "train_runtime": 4574.1513, "train_tokens_per_second": 423.561 }, { "epoch": 0.8060690244684261, "grad_norm": 3.722134590148926, "learning_rate": 1.19572192513369e-05, "loss": 0.1293383240699768, "num_input_tokens_seen": 1938202, "step": 1886, "train_runtime": 4576.1935, "train_tokens_per_second": 423.54 }, { "epoch": 0.806496420557752, "grad_norm": 2.78294038772583, "learning_rate": 1.195294117647059e-05, "loss": 0.12537311017513275, "num_input_tokens_seen": 1939054, "step": 1887, "train_runtime": 4578.2133, "train_tokens_per_second": 423.539 }, { "epoch": 0.8069238166470777, "grad_norm": 2.07055926322937, "learning_rate": 1.1948663101604279e-05, "loss": 0.10585374385118484, "num_input_tokens_seen": 1940562, "step": 1888, "train_runtime": 4580.4274, "train_tokens_per_second": 423.664 }, { "epoch": 0.8073512127364034, "grad_norm": 2.1547939777374268, "learning_rate": 1.1944385026737968e-05, "loss": 0.10604503750801086, "num_input_tokens_seen": 1941642, "step": 1889, "train_runtime": 4582.5527, "train_tokens_per_second": 423.703 }, { "epoch": 0.8077786088257293, "grad_norm": 2.444694757461548, "learning_rate": 1.194010695187166e-05, "loss": 0.12567241489887238, "num_input_tokens_seen": 1942750, "step": 1890, "train_runtime": 4584.6356, "train_tokens_per_second": 423.752 }, { "epoch": 0.808206004915055, "grad_norm": 2.3113696575164795, "learning_rate": 1.1935828877005349e-05, "loss": 0.09493012726306915, "num_input_tokens_seen": 1943888, "step": 1891, "train_runtime": 4593.283, "train_tokens_per_second": 423.202 }, { "epoch": 0.8086334010043809, "grad_norm": 3.0792691707611084, "learning_rate": 1.1931550802139038e-05, "loss": 0.09735411405563354, "num_input_tokens_seen": 1944556, "step": 1892, "train_runtime": 4595.3465, "train_tokens_per_second": 423.158 }, { "epoch": 0.8090607970937066, "grad_norm": 4.6262993812561035, "learning_rate": 1.1927272727272728e-05, "loss": 0.11058700829744339, "num_input_tokens_seen": 1945294, "step": 1893, "train_runtime": 4597.3755, "train_tokens_per_second": 423.131 }, { "epoch": 0.8094881931830323, "grad_norm": 3.428767442703247, "learning_rate": 1.1922994652406419e-05, "loss": 0.18326550722122192, "num_input_tokens_seen": 1946162, "step": 1894, "train_runtime": 4599.4886, "train_tokens_per_second": 423.126 }, { "epoch": 0.8099155892723582, "grad_norm": 3.5264241695404053, "learning_rate": 1.1918716577540108e-05, "loss": 0.1430865377187729, "num_input_tokens_seen": 1946952, "step": 1895, "train_runtime": 4601.5438, "train_tokens_per_second": 423.108 }, { "epoch": 0.8103429853616839, "grad_norm": 2.65175199508667, "learning_rate": 1.1914438502673798e-05, "loss": 0.11213567852973938, "num_input_tokens_seen": 1947842, "step": 1896, "train_runtime": 4603.6595, "train_tokens_per_second": 423.107 }, { "epoch": 0.8107703814510098, "grad_norm": 4.137303829193115, "learning_rate": 1.1910160427807487e-05, "loss": 0.2591896951198578, "num_input_tokens_seen": 1948972, "step": 1897, "train_runtime": 4605.8265, "train_tokens_per_second": 423.154 }, { "epoch": 0.8111977775403355, "grad_norm": 3.0623655319213867, "learning_rate": 1.1905882352941178e-05, "loss": 0.09301309287548065, "num_input_tokens_seen": 1949854, "step": 1898, "train_runtime": 4607.8824, "train_tokens_per_second": 423.156 }, { "epoch": 0.8116251736296612, "grad_norm": 3.4153971672058105, "learning_rate": 1.1901604278074868e-05, "loss": 0.15868785977363586, "num_input_tokens_seen": 1950624, "step": 1899, "train_runtime": 4609.9038, "train_tokens_per_second": 423.138 }, { "epoch": 0.8120525697189871, "grad_norm": 2.8564441204071045, "learning_rate": 1.1897326203208557e-05, "loss": 0.13919787108898163, "num_input_tokens_seen": 1951642, "step": 1900, "train_runtime": 4612.017, "train_tokens_per_second": 423.165 }, { "epoch": 0.8124799658083128, "grad_norm": 2.3190674781799316, "learning_rate": 1.1893048128342247e-05, "loss": 0.08593349158763885, "num_input_tokens_seen": 1952558, "step": 1901, "train_runtime": 4614.1222, "train_tokens_per_second": 423.17 }, { "epoch": 0.8129073618976387, "grad_norm": 2.6398873329162598, "learning_rate": 1.1888770053475938e-05, "loss": 0.16586089134216309, "num_input_tokens_seen": 1953702, "step": 1902, "train_runtime": 4616.3225, "train_tokens_per_second": 423.216 }, { "epoch": 0.8133347579869644, "grad_norm": 4.039870738983154, "learning_rate": 1.1884491978609627e-05, "loss": 0.11316657066345215, "num_input_tokens_seen": 1954534, "step": 1903, "train_runtime": 4618.3678, "train_tokens_per_second": 423.209 }, { "epoch": 0.8137621540762902, "grad_norm": 4.335970401763916, "learning_rate": 1.1880213903743317e-05, "loss": 0.11746223270893097, "num_input_tokens_seen": 1955774, "step": 1904, "train_runtime": 4620.5094, "train_tokens_per_second": 423.281 }, { "epoch": 0.814189550165616, "grad_norm": 2.930342674255371, "learning_rate": 1.1875935828877006e-05, "loss": 0.11023575812578201, "num_input_tokens_seen": 1956976, "step": 1905, "train_runtime": 4622.6954, "train_tokens_per_second": 423.341 }, { "epoch": 0.8146169462549417, "grad_norm": 3.6363377571105957, "learning_rate": 1.1871657754010697e-05, "loss": 0.1983751803636551, "num_input_tokens_seen": 1957994, "step": 1906, "train_runtime": 4624.7768, "train_tokens_per_second": 423.37 }, { "epoch": 0.8150443423442676, "grad_norm": 3.64961314201355, "learning_rate": 1.1867379679144387e-05, "loss": 0.17176346480846405, "num_input_tokens_seen": 1958802, "step": 1907, "train_runtime": 4626.8284, "train_tokens_per_second": 423.357 }, { "epoch": 0.8154717384335933, "grad_norm": 2.234658718109131, "learning_rate": 1.1863101604278076e-05, "loss": 0.10892599821090698, "num_input_tokens_seen": 1960204, "step": 1908, "train_runtime": 4629.0211, "train_tokens_per_second": 423.46 }, { "epoch": 0.8158991345229191, "grad_norm": 2.126518487930298, "learning_rate": 1.1858823529411766e-05, "loss": 0.15093612670898438, "num_input_tokens_seen": 1961966, "step": 1909, "train_runtime": 4631.2558, "train_tokens_per_second": 423.636 }, { "epoch": 0.8163265306122449, "grad_norm": 2.4514105319976807, "learning_rate": 1.1854545454545457e-05, "loss": 0.1282510757446289, "num_input_tokens_seen": 1963052, "step": 1910, "train_runtime": 4633.373, "train_tokens_per_second": 423.677 }, { "epoch": 0.8167539267015707, "grad_norm": 4.3745646476745605, "learning_rate": 1.1850267379679146e-05, "loss": 0.2642311751842499, "num_input_tokens_seen": 1963950, "step": 1911, "train_runtime": 4635.4425, "train_tokens_per_second": 423.681 }, { "epoch": 0.8171813227908965, "grad_norm": 2.5366644859313965, "learning_rate": 1.1845989304812836e-05, "loss": 0.11905498802661896, "num_input_tokens_seen": 1964986, "step": 1912, "train_runtime": 4637.5606, "train_tokens_per_second": 423.711 }, { "epoch": 0.8176087188802222, "grad_norm": 3.320986032485962, "learning_rate": 1.1841711229946525e-05, "loss": 0.1812538504600525, "num_input_tokens_seen": 1966226, "step": 1913, "train_runtime": 4639.718, "train_tokens_per_second": 423.781 }, { "epoch": 0.818036114969548, "grad_norm": 4.496185302734375, "learning_rate": 1.1837433155080216e-05, "loss": 0.21242013573646545, "num_input_tokens_seen": 1967028, "step": 1914, "train_runtime": 4641.7069, "train_tokens_per_second": 423.773 }, { "epoch": 0.8184635110588738, "grad_norm": 3.0694077014923096, "learning_rate": 1.1833155080213906e-05, "loss": 0.15557079017162323, "num_input_tokens_seen": 1967974, "step": 1915, "train_runtime": 4643.8124, "train_tokens_per_second": 423.784 }, { "epoch": 0.8188909071481996, "grad_norm": 4.743383407592773, "learning_rate": 1.1828877005347595e-05, "loss": 0.18137595057487488, "num_input_tokens_seen": 1968914, "step": 1916, "train_runtime": 4645.8921, "train_tokens_per_second": 423.797 }, { "epoch": 0.8193183032375254, "grad_norm": 3.5697715282440186, "learning_rate": 1.1824598930481283e-05, "loss": 0.14916926622390747, "num_input_tokens_seen": 1969620, "step": 1917, "train_runtime": 4647.8906, "train_tokens_per_second": 423.766 }, { "epoch": 0.8197456993268512, "grad_norm": 2.30627703666687, "learning_rate": 1.1820320855614976e-05, "loss": 0.14872755110263824, "num_input_tokens_seen": 1970726, "step": 1918, "train_runtime": 4650.0242, "train_tokens_per_second": 423.81 }, { "epoch": 0.8201730954161769, "grad_norm": 2.686779022216797, "learning_rate": 1.1816042780748665e-05, "loss": 0.08790980279445648, "num_input_tokens_seen": 1971684, "step": 1919, "train_runtime": 4652.1086, "train_tokens_per_second": 423.826 }, { "epoch": 0.8206004915055027, "grad_norm": 2.892587423324585, "learning_rate": 1.1811764705882353e-05, "loss": 0.15730991959571838, "num_input_tokens_seen": 1972462, "step": 1920, "train_runtime": 4654.1287, "train_tokens_per_second": 423.809 }, { "epoch": 0.8210278875948285, "grad_norm": 3.127499580383301, "learning_rate": 1.1807486631016042e-05, "loss": 0.13750679790973663, "num_input_tokens_seen": 1973296, "step": 1921, "train_runtime": 4662.8092, "train_tokens_per_second": 423.199 }, { "epoch": 0.8214552836841543, "grad_norm": 4.397209167480469, "learning_rate": 1.1803208556149735e-05, "loss": 0.2044524848461151, "num_input_tokens_seen": 1974076, "step": 1922, "train_runtime": 4665.0253, "train_tokens_per_second": 423.165 }, { "epoch": 0.8218826797734801, "grad_norm": 2.791097640991211, "learning_rate": 1.1798930481283425e-05, "loss": 0.09547609090805054, "num_input_tokens_seen": 1975028, "step": 1923, "train_runtime": 4667.0743, "train_tokens_per_second": 423.183 }, { "epoch": 0.8223100758628058, "grad_norm": 3.1614551544189453, "learning_rate": 1.1794652406417112e-05, "loss": 0.18947777152061462, "num_input_tokens_seen": 1975864, "step": 1924, "train_runtime": 4669.1105, "train_tokens_per_second": 423.178 }, { "epoch": 0.8227374719521316, "grad_norm": 3.162884473800659, "learning_rate": 1.1790374331550802e-05, "loss": 0.13253599405288696, "num_input_tokens_seen": 1976524, "step": 1925, "train_runtime": 4671.1638, "train_tokens_per_second": 423.133 }, { "epoch": 0.8231648680414574, "grad_norm": 4.1589884757995605, "learning_rate": 1.1786096256684495e-05, "loss": 0.22754980623722076, "num_input_tokens_seen": 1977354, "step": 1926, "train_runtime": 4673.3025, "train_tokens_per_second": 423.117 }, { "epoch": 0.8235922641307832, "grad_norm": 2.2708146572113037, "learning_rate": 1.1781818181818182e-05, "loss": 0.14771157503128052, "num_input_tokens_seen": 1978830, "step": 1927, "train_runtime": 4675.5408, "train_tokens_per_second": 423.23 }, { "epoch": 0.824019660220109, "grad_norm": 3.8743412494659424, "learning_rate": 1.1777540106951872e-05, "loss": 0.12557849287986755, "num_input_tokens_seen": 1979576, "step": 1928, "train_runtime": 4677.563, "train_tokens_per_second": 423.207 }, { "epoch": 0.8244470563094348, "grad_norm": 2.3909263610839844, "learning_rate": 1.1773262032085561e-05, "loss": 0.16569218039512634, "num_input_tokens_seen": 1980932, "step": 1929, "train_runtime": 4679.7242, "train_tokens_per_second": 423.301 }, { "epoch": 0.8248744523987606, "grad_norm": 1.8543733358383179, "learning_rate": 1.1768983957219254e-05, "loss": 0.10120807588100433, "num_input_tokens_seen": 1982492, "step": 1930, "train_runtime": 4681.9595, "train_tokens_per_second": 423.432 }, { "epoch": 0.8253018484880863, "grad_norm": 3.636075258255005, "learning_rate": 1.1764705882352942e-05, "loss": 0.22500087320804596, "num_input_tokens_seen": 1983864, "step": 1931, "train_runtime": 4684.1361, "train_tokens_per_second": 423.528 }, { "epoch": 0.8257292445774121, "grad_norm": 2.86460018157959, "learning_rate": 1.1760427807486631e-05, "loss": 0.157918319106102, "num_input_tokens_seen": 1985584, "step": 1932, "train_runtime": 4686.3985, "train_tokens_per_second": 423.691 }, { "epoch": 0.8261566406667379, "grad_norm": 3.078482151031494, "learning_rate": 1.175614973262032e-05, "loss": 0.15079180896282196, "num_input_tokens_seen": 1986526, "step": 1933, "train_runtime": 4688.447, "train_tokens_per_second": 423.707 }, { "epoch": 0.8265840367560637, "grad_norm": 2.689268112182617, "learning_rate": 1.1751871657754012e-05, "loss": 0.10432767122983932, "num_input_tokens_seen": 1987252, "step": 1934, "train_runtime": 4690.445, "train_tokens_per_second": 423.681 }, { "epoch": 0.8270114328453895, "grad_norm": 1.8064614534378052, "learning_rate": 1.1747593582887701e-05, "loss": 0.04677347093820572, "num_input_tokens_seen": 1988562, "step": 1935, "train_runtime": 4692.5866, "train_tokens_per_second": 423.767 }, { "epoch": 0.8274388289347152, "grad_norm": 3.0575437545776367, "learning_rate": 1.174331550802139e-05, "loss": 0.21622297167778015, "num_input_tokens_seen": 1989806, "step": 1936, "train_runtime": 4694.7407, "train_tokens_per_second": 423.837 }, { "epoch": 0.8278662250240411, "grad_norm": 2.43487811088562, "learning_rate": 1.173903743315508e-05, "loss": 0.10695505142211914, "num_input_tokens_seen": 1990762, "step": 1937, "train_runtime": 4696.8247, "train_tokens_per_second": 423.853 }, { "epoch": 0.8282936211133668, "grad_norm": 2.327991247177124, "learning_rate": 1.1734759358288771e-05, "loss": 0.13072600960731506, "num_input_tokens_seen": 1991992, "step": 1938, "train_runtime": 4698.9745, "train_tokens_per_second": 423.921 }, { "epoch": 0.8287210172026926, "grad_norm": 3.2440786361694336, "learning_rate": 1.173048128342246e-05, "loss": 0.2048959732055664, "num_input_tokens_seen": 1993564, "step": 1939, "train_runtime": 4701.183, "train_tokens_per_second": 424.056 }, { "epoch": 0.8291484132920184, "grad_norm": 3.3145008087158203, "learning_rate": 1.172620320855615e-05, "loss": 0.1536371111869812, "num_input_tokens_seen": 1994270, "step": 1940, "train_runtime": 4703.1762, "train_tokens_per_second": 424.026 }, { "epoch": 0.8295758093813441, "grad_norm": 4.623020648956299, "learning_rate": 1.172192513368984e-05, "loss": 0.19404183328151703, "num_input_tokens_seen": 1995102, "step": 1941, "train_runtime": 4705.2492, "train_tokens_per_second": 424.016 }, { "epoch": 0.83000320547067, "grad_norm": 2.123108148574829, "learning_rate": 1.171764705882353e-05, "loss": 0.06709779798984528, "num_input_tokens_seen": 1996254, "step": 1942, "train_runtime": 4707.3668, "train_tokens_per_second": 424.07 }, { "epoch": 0.8304306015599957, "grad_norm": 3.1344902515411377, "learning_rate": 1.171336898395722e-05, "loss": 0.15405476093292236, "num_input_tokens_seen": 1997454, "step": 1943, "train_runtime": 4709.4949, "train_tokens_per_second": 424.133 }, { "epoch": 0.8308579976493216, "grad_norm": 2.6773366928100586, "learning_rate": 1.170909090909091e-05, "loss": 0.08066906034946442, "num_input_tokens_seen": 1998452, "step": 1944, "train_runtime": 4711.595, "train_tokens_per_second": 424.156 }, { "epoch": 0.8312853937386473, "grad_norm": 2.34963059425354, "learning_rate": 1.17048128342246e-05, "loss": 0.11968742311000824, "num_input_tokens_seen": 1999622, "step": 1945, "train_runtime": 4713.7296, "train_tokens_per_second": 424.212 }, { "epoch": 0.831712789827973, "grad_norm": 3.0777735710144043, "learning_rate": 1.170053475935829e-05, "loss": 0.13329118490219116, "num_input_tokens_seen": 2000404, "step": 1946, "train_runtime": 4715.748, "train_tokens_per_second": 424.197 }, { "epoch": 0.8321401859172989, "grad_norm": 2.622476100921631, "learning_rate": 1.169625668449198e-05, "loss": 0.14818327128887177, "num_input_tokens_seen": 2001258, "step": 1947, "train_runtime": 4717.8392, "train_tokens_per_second": 424.19 }, { "epoch": 0.8325675820066246, "grad_norm": 3.720508098602295, "learning_rate": 1.169197860962567e-05, "loss": 0.273777037858963, "num_input_tokens_seen": 2002180, "step": 1948, "train_runtime": 4719.8883, "train_tokens_per_second": 424.201 }, { "epoch": 0.8329949780959505, "grad_norm": 2.41963529586792, "learning_rate": 1.1687700534759359e-05, "loss": 0.13610133528709412, "num_input_tokens_seen": 2003156, "step": 1949, "train_runtime": 4721.9779, "train_tokens_per_second": 424.22 }, { "epoch": 0.8334223741852762, "grad_norm": 3.142697334289551, "learning_rate": 1.168342245989305e-05, "loss": 0.09877709299325943, "num_input_tokens_seen": 2003902, "step": 1950, "train_runtime": 4723.9611, "train_tokens_per_second": 424.2 }, { "epoch": 0.8338497702746019, "grad_norm": 2.2059855461120605, "learning_rate": 1.167914438502674e-05, "loss": 0.09511911869049072, "num_input_tokens_seen": 2004806, "step": 1951, "train_runtime": 4732.2731, "train_tokens_per_second": 423.645 }, { "epoch": 0.8342771663639278, "grad_norm": 3.3337655067443848, "learning_rate": 1.1674866310160429e-05, "loss": 0.16686686873435974, "num_input_tokens_seen": 2005616, "step": 1952, "train_runtime": 4734.3338, "train_tokens_per_second": 423.632 }, { "epoch": 0.8347045624532535, "grad_norm": 2.2215652465820312, "learning_rate": 1.1670588235294118e-05, "loss": 0.08955597877502441, "num_input_tokens_seen": 2006428, "step": 1953, "train_runtime": 4736.5735, "train_tokens_per_second": 423.603 }, { "epoch": 0.8351319585425794, "grad_norm": 2.384791135787964, "learning_rate": 1.166631016042781e-05, "loss": 0.11258506029844284, "num_input_tokens_seen": 2007744, "step": 1954, "train_runtime": 4738.7149, "train_tokens_per_second": 423.69 }, { "epoch": 0.8355593546319051, "grad_norm": 2.0092225074768066, "learning_rate": 1.1662032085561499e-05, "loss": 0.07927387207746506, "num_input_tokens_seen": 2008740, "step": 1955, "train_runtime": 4740.7597, "train_tokens_per_second": 423.717 }, { "epoch": 0.8359867507212309, "grad_norm": 4.950786113739014, "learning_rate": 1.1657754010695188e-05, "loss": 0.32466092705726624, "num_input_tokens_seen": 2009954, "step": 1956, "train_runtime": 4742.8656, "train_tokens_per_second": 423.785 }, { "epoch": 0.8364141468105567, "grad_norm": 2.8864147663116455, "learning_rate": 1.1653475935828878e-05, "loss": 0.12924933433532715, "num_input_tokens_seen": 2010976, "step": 1957, "train_runtime": 4744.9719, "train_tokens_per_second": 423.812 }, { "epoch": 0.8368415428998824, "grad_norm": 3.988420248031616, "learning_rate": 1.1649197860962569e-05, "loss": 0.21299467980861664, "num_input_tokens_seen": 2011758, "step": 1958, "train_runtime": 4746.9923, "train_tokens_per_second": 423.796 }, { "epoch": 0.8372689389892083, "grad_norm": 2.931626558303833, "learning_rate": 1.1644919786096258e-05, "loss": 0.14606085419654846, "num_input_tokens_seen": 2012714, "step": 1959, "train_runtime": 4749.0372, "train_tokens_per_second": 423.815 }, { "epoch": 0.837696335078534, "grad_norm": 2.99975323677063, "learning_rate": 1.1640641711229948e-05, "loss": 0.15143752098083496, "num_input_tokens_seen": 2013502, "step": 1960, "train_runtime": 4751.1021, "train_tokens_per_second": 423.797 }, { "epoch": 0.8381237311678598, "grad_norm": 5.287333965301514, "learning_rate": 1.1636363636363637e-05, "loss": 0.26975440979003906, "num_input_tokens_seen": 2014448, "step": 1961, "train_runtime": 4753.2108, "train_tokens_per_second": 423.808 }, { "epoch": 0.8385511272571856, "grad_norm": 1.9712953567504883, "learning_rate": 1.1632085561497328e-05, "loss": 0.11496014893054962, "num_input_tokens_seen": 2016488, "step": 1962, "train_runtime": 4755.568, "train_tokens_per_second": 424.027 }, { "epoch": 0.8389785233465114, "grad_norm": 2.6900217533111572, "learning_rate": 1.1627807486631018e-05, "loss": 0.1549610048532486, "num_input_tokens_seen": 2017248, "step": 1963, "train_runtime": 4757.6226, "train_tokens_per_second": 424.003 }, { "epoch": 0.8394059194358372, "grad_norm": 3.142636299133301, "learning_rate": 1.1623529411764707e-05, "loss": 0.07481295615434647, "num_input_tokens_seen": 2018118, "step": 1964, "train_runtime": 4759.6754, "train_tokens_per_second": 424.003 }, { "epoch": 0.8398333155251629, "grad_norm": 3.3055038452148438, "learning_rate": 1.1619251336898397e-05, "loss": 0.14716248214244843, "num_input_tokens_seen": 2019514, "step": 1965, "train_runtime": 4761.8196, "train_tokens_per_second": 424.106 }, { "epoch": 0.8402607116144887, "grad_norm": 2.9134085178375244, "learning_rate": 1.1614973262032086e-05, "loss": 0.1696421504020691, "num_input_tokens_seen": 2020222, "step": 1966, "train_runtime": 4763.8251, "train_tokens_per_second": 424.076 }, { "epoch": 0.8406881077038145, "grad_norm": 3.4489259719848633, "learning_rate": 1.1610695187165777e-05, "loss": 0.20588867366313934, "num_input_tokens_seen": 2021242, "step": 1967, "train_runtime": 4765.9112, "train_tokens_per_second": 424.104 }, { "epoch": 0.8411155037931403, "grad_norm": 2.7396275997161865, "learning_rate": 1.1606417112299467e-05, "loss": 0.1684694141149521, "num_input_tokens_seen": 2022708, "step": 1968, "train_runtime": 4768.1883, "train_tokens_per_second": 424.209 }, { "epoch": 0.8415428998824661, "grad_norm": 2.6376407146453857, "learning_rate": 1.1602139037433156e-05, "loss": 0.09553737938404083, "num_input_tokens_seen": 2023718, "step": 1969, "train_runtime": 4770.3403, "train_tokens_per_second": 424.229 }, { "epoch": 0.8419702959717918, "grad_norm": 2.150681257247925, "learning_rate": 1.1597860962566845e-05, "loss": 0.1336728185415268, "num_input_tokens_seen": 2025154, "step": 1970, "train_runtime": 4772.5238, "train_tokens_per_second": 424.336 }, { "epoch": 0.8423976920611176, "grad_norm": 1.6997156143188477, "learning_rate": 1.1593582887700537e-05, "loss": 0.1043979823589325, "num_input_tokens_seen": 2026996, "step": 1971, "train_runtime": 4774.8418, "train_tokens_per_second": 424.516 }, { "epoch": 0.8428250881504434, "grad_norm": 3.709462881088257, "learning_rate": 1.1589304812834226e-05, "loss": 0.14273390173912048, "num_input_tokens_seen": 2027706, "step": 1972, "train_runtime": 4776.8233, "train_tokens_per_second": 424.488 }, { "epoch": 0.8432524842397692, "grad_norm": 2.8449738025665283, "learning_rate": 1.1585026737967915e-05, "loss": 0.1415601223707199, "num_input_tokens_seen": 2028652, "step": 1973, "train_runtime": 4778.9036, "train_tokens_per_second": 424.502 }, { "epoch": 0.843679880329095, "grad_norm": 2.695927619934082, "learning_rate": 1.1580748663101605e-05, "loss": 0.12807713449001312, "num_input_tokens_seen": 2029382, "step": 1974, "train_runtime": 4780.9296, "train_tokens_per_second": 424.474 }, { "epoch": 0.8441072764184208, "grad_norm": 3.0551578998565674, "learning_rate": 1.1576470588235296e-05, "loss": 0.11282316595315933, "num_input_tokens_seen": 2030350, "step": 1975, "train_runtime": 4783.0003, "train_tokens_per_second": 424.493 }, { "epoch": 0.8445346725077466, "grad_norm": 3.949636697769165, "learning_rate": 1.1572192513368986e-05, "loss": 0.19138802587985992, "num_input_tokens_seen": 2031440, "step": 1976, "train_runtime": 4785.1854, "train_tokens_per_second": 424.527 }, { "epoch": 0.8449620685970723, "grad_norm": 2.253563642501831, "learning_rate": 1.1567914438502675e-05, "loss": 0.10519030690193176, "num_input_tokens_seen": 2032804, "step": 1977, "train_runtime": 4787.339, "train_tokens_per_second": 424.621 }, { "epoch": 0.8453894646863981, "grad_norm": 2.4796438217163086, "learning_rate": 1.1563636363636363e-05, "loss": 0.07710590213537216, "num_input_tokens_seen": 2033780, "step": 1978, "train_runtime": 4789.4032, "train_tokens_per_second": 424.642 }, { "epoch": 0.8458168607757239, "grad_norm": 2.4658453464508057, "learning_rate": 1.1559358288770056e-05, "loss": 0.10524742305278778, "num_input_tokens_seen": 2034834, "step": 1979, "train_runtime": 4791.4836, "train_tokens_per_second": 424.677 }, { "epoch": 0.8462442568650497, "grad_norm": 1.6197055578231812, "learning_rate": 1.1555080213903745e-05, "loss": 0.08397623896598816, "num_input_tokens_seen": 2036680, "step": 1980, "train_runtime": 4793.7819, "train_tokens_per_second": 424.859 }, { "epoch": 0.8466716529543755, "grad_norm": 1.9097598791122437, "learning_rate": 1.1550802139037434e-05, "loss": 0.10334040224552155, "num_input_tokens_seen": 2039644, "step": 1981, "train_runtime": 4802.9741, "train_tokens_per_second": 424.663 }, { "epoch": 0.8470990490437013, "grad_norm": 2.65543794631958, "learning_rate": 1.1546524064171122e-05, "loss": 0.12254716455936432, "num_input_tokens_seen": 2040578, "step": 1982, "train_runtime": 4805.2388, "train_tokens_per_second": 424.657 }, { "epoch": 0.847526445133027, "grad_norm": 3.56805682182312, "learning_rate": 1.1542245989304815e-05, "loss": 0.21757085621356964, "num_input_tokens_seen": 2041474, "step": 1983, "train_runtime": 4807.4609, "train_tokens_per_second": 424.647 }, { "epoch": 0.8479538412223528, "grad_norm": 2.963594913482666, "learning_rate": 1.1537967914438504e-05, "loss": 0.10216448456048965, "num_input_tokens_seen": 2042394, "step": 1984, "train_runtime": 4809.5267, "train_tokens_per_second": 424.656 }, { "epoch": 0.8483812373116786, "grad_norm": 2.03479266166687, "learning_rate": 1.1533689839572192e-05, "loss": 0.07313203811645508, "num_input_tokens_seen": 2043502, "step": 1985, "train_runtime": 4811.6572, "train_tokens_per_second": 424.698 }, { "epoch": 0.8488086334010044, "grad_norm": 1.762342929840088, "learning_rate": 1.1529411764705882e-05, "loss": 0.0892074853181839, "num_input_tokens_seen": 2044812, "step": 1986, "train_runtime": 4813.7836, "train_tokens_per_second": 424.783 }, { "epoch": 0.8492360294903302, "grad_norm": 2.834467887878418, "learning_rate": 1.1525133689839575e-05, "loss": 0.1746521145105362, "num_input_tokens_seen": 2046186, "step": 1987, "train_runtime": 4816.0122, "train_tokens_per_second": 424.871 }, { "epoch": 0.8496634255796559, "grad_norm": 2.2896041870117188, "learning_rate": 1.1520855614973262e-05, "loss": 0.08996517211198807, "num_input_tokens_seen": 2047098, "step": 1988, "train_runtime": 4818.0914, "train_tokens_per_second": 424.877 }, { "epoch": 0.8500908216689818, "grad_norm": 3.9072623252868652, "learning_rate": 1.1516577540106952e-05, "loss": 0.15439929068088531, "num_input_tokens_seen": 2047874, "step": 1989, "train_runtime": 4820.1573, "train_tokens_per_second": 424.856 }, { "epoch": 0.8505182177583075, "grad_norm": 3.1842758655548096, "learning_rate": 1.1512299465240641e-05, "loss": 0.1472446620464325, "num_input_tokens_seen": 2048806, "step": 1990, "train_runtime": 4822.2376, "train_tokens_per_second": 424.866 }, { "epoch": 0.8509456138476333, "grad_norm": 3.044966697692871, "learning_rate": 1.1508021390374334e-05, "loss": 0.15248648822307587, "num_input_tokens_seen": 2049882, "step": 1991, "train_runtime": 4824.3746, "train_tokens_per_second": 424.901 }, { "epoch": 0.8513730099369591, "grad_norm": 4.340991497039795, "learning_rate": 1.1503743315508022e-05, "loss": 0.13964655995368958, "num_input_tokens_seen": 2050772, "step": 1992, "train_runtime": 4826.4903, "train_tokens_per_second": 424.899 }, { "epoch": 0.8518004060262848, "grad_norm": 2.7062253952026367, "learning_rate": 1.1499465240641711e-05, "loss": 0.13101620972156525, "num_input_tokens_seen": 2051666, "step": 1993, "train_runtime": 4828.5504, "train_tokens_per_second": 424.903 }, { "epoch": 0.8522278021156107, "grad_norm": 3.3317129611968994, "learning_rate": 1.14951871657754e-05, "loss": 0.09891689568758011, "num_input_tokens_seen": 2052266, "step": 1994, "train_runtime": 4830.5044, "train_tokens_per_second": 424.855 }, { "epoch": 0.8526551982049364, "grad_norm": 2.544534921646118, "learning_rate": 1.1490909090909092e-05, "loss": 0.14052549004554749, "num_input_tokens_seen": 2053472, "step": 1995, "train_runtime": 4832.6697, "train_tokens_per_second": 424.915 }, { "epoch": 0.8530825942942623, "grad_norm": 3.747269630432129, "learning_rate": 1.1486631016042781e-05, "loss": 0.16506534814834595, "num_input_tokens_seen": 2054212, "step": 1996, "train_runtime": 4834.7681, "train_tokens_per_second": 424.883 }, { "epoch": 0.853509990383588, "grad_norm": 3.537022113800049, "learning_rate": 1.148235294117647e-05, "loss": 0.19596555829048157, "num_input_tokens_seen": 2055748, "step": 1997, "train_runtime": 4837.0151, "train_tokens_per_second": 425.003 }, { "epoch": 0.8539373864729137, "grad_norm": 2.9901909828186035, "learning_rate": 1.147807486631016e-05, "loss": 0.10402274876832962, "num_input_tokens_seen": 2056428, "step": 1998, "train_runtime": 4839.0355, "train_tokens_per_second": 424.967 }, { "epoch": 0.8543647825622396, "grad_norm": 3.015026092529297, "learning_rate": 1.1473796791443851e-05, "loss": 0.12196237593889236, "num_input_tokens_seen": 2057386, "step": 1999, "train_runtime": 4841.1324, "train_tokens_per_second": 424.98 }, { "epoch": 0.8547921786515653, "grad_norm": 1.937814712524414, "learning_rate": 1.146951871657754e-05, "loss": 0.09265303611755371, "num_input_tokens_seen": 2058680, "step": 2000, "train_runtime": 4843.2601, "train_tokens_per_second": 425.061 }, { "epoch": 0.8552195747408912, "grad_norm": 1.2096171379089355, "learning_rate": 1.146524064171123e-05, "loss": 0.04078340530395508, "num_input_tokens_seen": 2060918, "step": 2001, "train_runtime": 4845.7047, "train_tokens_per_second": 425.308 }, { "epoch": 0.8556469708302169, "grad_norm": 2.6704554557800293, "learning_rate": 1.146096256684492e-05, "loss": 0.049375370144844055, "num_input_tokens_seen": 2061456, "step": 2002, "train_runtime": 4847.6653, "train_tokens_per_second": 425.247 }, { "epoch": 0.8560743669195426, "grad_norm": 3.931211233139038, "learning_rate": 1.145668449197861e-05, "loss": 0.13609907031059265, "num_input_tokens_seen": 2062118, "step": 2003, "train_runtime": 4849.6926, "train_tokens_per_second": 425.206 }, { "epoch": 0.8565017630088685, "grad_norm": 2.8013854026794434, "learning_rate": 1.14524064171123e-05, "loss": 0.19170740246772766, "num_input_tokens_seen": 2063172, "step": 2004, "train_runtime": 4851.7945, "train_tokens_per_second": 425.239 }, { "epoch": 0.8569291590981942, "grad_norm": 2.5239267349243164, "learning_rate": 1.144812834224599e-05, "loss": 0.10953666269779205, "num_input_tokens_seen": 2064226, "step": 2005, "train_runtime": 4853.9267, "train_tokens_per_second": 425.269 }, { "epoch": 0.8573565551875201, "grad_norm": 2.671372652053833, "learning_rate": 1.1443850267379679e-05, "loss": 0.09042859822511673, "num_input_tokens_seen": 2064842, "step": 2006, "train_runtime": 4855.9363, "train_tokens_per_second": 425.22 }, { "epoch": 0.8577839512768458, "grad_norm": 2.8296258449554443, "learning_rate": 1.143957219251337e-05, "loss": 0.13653765618801117, "num_input_tokens_seen": 2065954, "step": 2007, "train_runtime": 4858.1143, "train_tokens_per_second": 425.258 }, { "epoch": 0.8582113473661716, "grad_norm": 2.457226037979126, "learning_rate": 1.143529411764706e-05, "loss": 0.14975999295711517, "num_input_tokens_seen": 2067154, "step": 2008, "train_runtime": 4860.2742, "train_tokens_per_second": 425.316 }, { "epoch": 0.8586387434554974, "grad_norm": 3.6422884464263916, "learning_rate": 1.1431016042780749e-05, "loss": 0.15724913775920868, "num_input_tokens_seen": 2067810, "step": 2009, "train_runtime": 4862.3395, "train_tokens_per_second": 425.271 }, { "epoch": 0.8590661395448231, "grad_norm": 2.1221868991851807, "learning_rate": 1.1426737967914439e-05, "loss": 0.09180396795272827, "num_input_tokens_seen": 2068922, "step": 2010, "train_runtime": 4864.4736, "train_tokens_per_second": 425.313 }, { "epoch": 0.859493535634149, "grad_norm": 3.1511943340301514, "learning_rate": 1.142245989304813e-05, "loss": 0.11383674293756485, "num_input_tokens_seen": 2069696, "step": 2011, "train_runtime": 4873.1578, "train_tokens_per_second": 424.714 }, { "epoch": 0.8599209317234747, "grad_norm": 3.0906403064727783, "learning_rate": 1.1418181818181819e-05, "loss": 0.18607240915298462, "num_input_tokens_seen": 2070610, "step": 2012, "train_runtime": 4875.4026, "train_tokens_per_second": 424.705 }, { "epoch": 0.8603483278128005, "grad_norm": 2.714343547821045, "learning_rate": 1.1413903743315509e-05, "loss": 0.10701340436935425, "num_input_tokens_seen": 2071972, "step": 2013, "train_runtime": 4877.601, "train_tokens_per_second": 424.793 }, { "epoch": 0.8607757239021263, "grad_norm": 3.5791478157043457, "learning_rate": 1.1409625668449198e-05, "loss": 0.18957960605621338, "num_input_tokens_seen": 2072962, "step": 2014, "train_runtime": 4879.8113, "train_tokens_per_second": 424.804 }, { "epoch": 0.861203119991452, "grad_norm": 5.472559928894043, "learning_rate": 1.140534759358289e-05, "loss": 0.14212319254875183, "num_input_tokens_seen": 2073506, "step": 2015, "train_runtime": 4881.8228, "train_tokens_per_second": 424.74 }, { "epoch": 0.8616305160807779, "grad_norm": 3.226473331451416, "learning_rate": 1.1401069518716579e-05, "loss": 0.10729537904262543, "num_input_tokens_seen": 2074234, "step": 2016, "train_runtime": 4883.8674, "train_tokens_per_second": 424.711 }, { "epoch": 0.8620579121701036, "grad_norm": 2.1194236278533936, "learning_rate": 1.1396791443850268e-05, "loss": 0.09174731373786926, "num_input_tokens_seen": 2075424, "step": 2017, "train_runtime": 4886.0529, "train_tokens_per_second": 424.765 }, { "epoch": 0.8624853082594294, "grad_norm": 2.6893062591552734, "learning_rate": 1.1392513368983957e-05, "loss": 0.23518908023834229, "num_input_tokens_seen": 2076470, "step": 2018, "train_runtime": 4888.147, "train_tokens_per_second": 424.797 }, { "epoch": 0.8629127043487552, "grad_norm": 3.5554754734039307, "learning_rate": 1.1388235294117649e-05, "loss": 0.21239030361175537, "num_input_tokens_seen": 2077754, "step": 2019, "train_runtime": 4890.3025, "train_tokens_per_second": 424.872 }, { "epoch": 0.863340100438081, "grad_norm": 2.337817668914795, "learning_rate": 1.1383957219251338e-05, "loss": 0.07666034251451492, "num_input_tokens_seen": 2078574, "step": 2020, "train_runtime": 4892.3816, "train_tokens_per_second": 424.859 }, { "epoch": 0.8637674965274068, "grad_norm": 3.9617319107055664, "learning_rate": 1.1379679144385028e-05, "loss": 0.1682778149843216, "num_input_tokens_seen": 2079704, "step": 2021, "train_runtime": 4894.527, "train_tokens_per_second": 424.904 }, { "epoch": 0.8641948926167325, "grad_norm": 2.1049556732177734, "learning_rate": 1.1375401069518717e-05, "loss": 0.1025129109621048, "num_input_tokens_seen": 2081392, "step": 2022, "train_runtime": 4896.813, "train_tokens_per_second": 425.05 }, { "epoch": 0.8646222887060584, "grad_norm": 3.863140821456909, "learning_rate": 1.1371122994652408e-05, "loss": 0.19519008696079254, "num_input_tokens_seen": 2082108, "step": 2023, "train_runtime": 4898.8537, "train_tokens_per_second": 425.019 }, { "epoch": 0.8650496847953841, "grad_norm": 2.683444023132324, "learning_rate": 1.1366844919786098e-05, "loss": 0.19205322861671448, "num_input_tokens_seen": 2083052, "step": 2024, "train_runtime": 4900.9514, "train_tokens_per_second": 425.03 }, { "epoch": 0.8654770808847099, "grad_norm": 2.886895179748535, "learning_rate": 1.1362566844919787e-05, "loss": 0.20484893023967743, "num_input_tokens_seen": 2084296, "step": 2025, "train_runtime": 4903.1165, "train_tokens_per_second": 425.096 }, { "epoch": 0.8659044769740357, "grad_norm": 2.769684314727783, "learning_rate": 1.1358288770053476e-05, "loss": 0.12484301626682281, "num_input_tokens_seen": 2085072, "step": 2026, "train_runtime": 4905.1531, "train_tokens_per_second": 425.078 }, { "epoch": 0.8663318730633615, "grad_norm": 1.8872156143188477, "learning_rate": 1.1354010695187168e-05, "loss": 0.0790603756904602, "num_input_tokens_seen": 2086082, "step": 2027, "train_runtime": 4907.2669, "train_tokens_per_second": 425.101 }, { "epoch": 0.8667592691526873, "grad_norm": 2.3702504634857178, "learning_rate": 1.1349732620320857e-05, "loss": 0.12505261600017548, "num_input_tokens_seen": 2087164, "step": 2028, "train_runtime": 4909.4236, "train_tokens_per_second": 425.134 }, { "epoch": 0.867186665242013, "grad_norm": 3.0951671600341797, "learning_rate": 1.1345454545454546e-05, "loss": 0.140278160572052, "num_input_tokens_seen": 2087896, "step": 2029, "train_runtime": 4911.4723, "train_tokens_per_second": 425.106 }, { "epoch": 0.8676140613313388, "grad_norm": 3.121394634246826, "learning_rate": 1.1341176470588236e-05, "loss": 0.13748930394649506, "num_input_tokens_seen": 2088562, "step": 2030, "train_runtime": 4913.4898, "train_tokens_per_second": 425.067 }, { "epoch": 0.8680414574206646, "grad_norm": 3.702622890472412, "learning_rate": 1.1336898395721927e-05, "loss": 0.1778581738471985, "num_input_tokens_seen": 2089798, "step": 2031, "train_runtime": 4915.6616, "train_tokens_per_second": 425.131 }, { "epoch": 0.8684688535099904, "grad_norm": 3.2283809185028076, "learning_rate": 1.1332620320855617e-05, "loss": 0.20485949516296387, "num_input_tokens_seen": 2090866, "step": 2032, "train_runtime": 4917.7714, "train_tokens_per_second": 425.165 }, { "epoch": 0.8688962495993162, "grad_norm": 2.1973516941070557, "learning_rate": 1.1328342245989306e-05, "loss": 0.11748316138982773, "num_input_tokens_seen": 2092152, "step": 2033, "train_runtime": 4919.9254, "train_tokens_per_second": 425.241 }, { "epoch": 0.869323645688642, "grad_norm": 4.244319915771484, "learning_rate": 1.1324064171122995e-05, "loss": 0.08979244530200958, "num_input_tokens_seen": 2092912, "step": 2034, "train_runtime": 4922.0096, "train_tokens_per_second": 425.215 }, { "epoch": 0.8697510417779677, "grad_norm": 3.4045071601867676, "learning_rate": 1.1319786096256687e-05, "loss": 0.17678019404411316, "num_input_tokens_seen": 2093722, "step": 2035, "train_runtime": 4924.0688, "train_tokens_per_second": 425.202 }, { "epoch": 0.8701784378672935, "grad_norm": 2.3533201217651367, "learning_rate": 1.1315508021390376e-05, "loss": 0.10691918432712555, "num_input_tokens_seen": 2094804, "step": 2036, "train_runtime": 4926.1652, "train_tokens_per_second": 425.24 }, { "epoch": 0.8706058339566193, "grad_norm": 3.7705631256103516, "learning_rate": 1.1311229946524065e-05, "loss": 0.12243242561817169, "num_input_tokens_seen": 2095692, "step": 2037, "train_runtime": 4928.2301, "train_tokens_per_second": 425.242 }, { "epoch": 0.8710332300459451, "grad_norm": 3.048866033554077, "learning_rate": 1.1306951871657755e-05, "loss": 0.1400669664144516, "num_input_tokens_seen": 2096448, "step": 2038, "train_runtime": 4930.2566, "train_tokens_per_second": 425.221 }, { "epoch": 0.8714606261352709, "grad_norm": 2.9495797157287598, "learning_rate": 1.1302673796791446e-05, "loss": 0.1668057143688202, "num_input_tokens_seen": 2097430, "step": 2039, "train_runtime": 4932.3492, "train_tokens_per_second": 425.24 }, { "epoch": 0.8718880222245966, "grad_norm": 2.709987163543701, "learning_rate": 1.1298395721925135e-05, "loss": 0.09622637927532196, "num_input_tokens_seen": 2098438, "step": 2040, "train_runtime": 4934.4223, "train_tokens_per_second": 425.265 }, { "epoch": 0.8723154183139225, "grad_norm": 3.0652785301208496, "learning_rate": 1.1294117647058825e-05, "loss": 0.20651371777057648, "num_input_tokens_seen": 2099334, "step": 2041, "train_runtime": 4943.1704, "train_tokens_per_second": 424.694 }, { "epoch": 0.8727428144032482, "grad_norm": 2.630715847015381, "learning_rate": 1.1289839572192514e-05, "loss": 0.11181443184614182, "num_input_tokens_seen": 2100336, "step": 2042, "train_runtime": 4945.2355, "train_tokens_per_second": 424.719 }, { "epoch": 0.873170210492574, "grad_norm": 3.4142298698425293, "learning_rate": 1.1285561497326205e-05, "loss": 0.1708744764328003, "num_input_tokens_seen": 2101246, "step": 2043, "train_runtime": 4947.2835, "train_tokens_per_second": 424.727 }, { "epoch": 0.8735976065818998, "grad_norm": 2.5575437545776367, "learning_rate": 1.1281283422459895e-05, "loss": 0.11476299911737442, "num_input_tokens_seen": 2102154, "step": 2044, "train_runtime": 4949.3579, "train_tokens_per_second": 424.733 }, { "epoch": 0.8740250026712255, "grad_norm": 2.3537535667419434, "learning_rate": 1.1277005347593584e-05, "loss": 0.14269980788230896, "num_input_tokens_seen": 2103916, "step": 2045, "train_runtime": 4951.622, "train_tokens_per_second": 424.894 }, { "epoch": 0.8744523987605514, "grad_norm": 2.941002130508423, "learning_rate": 1.1272727272727272e-05, "loss": 0.15500710904598236, "num_input_tokens_seen": 2104866, "step": 2046, "train_runtime": 4953.6685, "train_tokens_per_second": 424.911 }, { "epoch": 0.8748797948498771, "grad_norm": 2.7163405418395996, "learning_rate": 1.1268449197860965e-05, "loss": 0.17654132843017578, "num_input_tokens_seen": 2106214, "step": 2047, "train_runtime": 4955.8101, "train_tokens_per_second": 424.999 }, { "epoch": 0.875307190939203, "grad_norm": 4.698025703430176, "learning_rate": 1.1264171122994654e-05, "loss": 0.1784188598394394, "num_input_tokens_seen": 2107024, "step": 2048, "train_runtime": 4957.8575, "train_tokens_per_second": 424.987 }, { "epoch": 0.8757345870285287, "grad_norm": 2.271402359008789, "learning_rate": 1.1259893048128344e-05, "loss": 0.07826799154281616, "num_input_tokens_seen": 2107916, "step": 2049, "train_runtime": 4959.9411, "train_tokens_per_second": 424.988 }, { "epoch": 0.8761619831178544, "grad_norm": 2.663201093673706, "learning_rate": 1.1255614973262032e-05, "loss": 0.15355853736400604, "num_input_tokens_seen": 2109138, "step": 2050, "train_runtime": 4962.0428, "train_tokens_per_second": 425.054 }, { "epoch": 0.8765893792071803, "grad_norm": 2.6469366550445557, "learning_rate": 1.1251336898395724e-05, "loss": 0.16244632005691528, "num_input_tokens_seen": 2110444, "step": 2051, "train_runtime": 4964.1769, "train_tokens_per_second": 425.135 }, { "epoch": 0.877016775296506, "grad_norm": 3.0999233722686768, "learning_rate": 1.1247058823529414e-05, "loss": 0.1348665952682495, "num_input_tokens_seen": 2111194, "step": 2052, "train_runtime": 4966.1547, "train_tokens_per_second": 425.116 }, { "epoch": 0.8774441713858319, "grad_norm": 2.589658737182617, "learning_rate": 1.1242780748663102e-05, "loss": 0.11222142726182938, "num_input_tokens_seen": 2112414, "step": 2053, "train_runtime": 4968.2804, "train_tokens_per_second": 425.18 }, { "epoch": 0.8778715674751576, "grad_norm": 2.7313668727874756, "learning_rate": 1.1238502673796791e-05, "loss": 0.16139838099479675, "num_input_tokens_seen": 2113914, "step": 2054, "train_runtime": 4970.6352, "train_tokens_per_second": 425.28 }, { "epoch": 0.8782989635644833, "grad_norm": 3.9004340171813965, "learning_rate": 1.1234224598930484e-05, "loss": 0.1549561470746994, "num_input_tokens_seen": 2114710, "step": 2055, "train_runtime": 4972.6224, "train_tokens_per_second": 425.271 }, { "epoch": 0.8787263596538092, "grad_norm": 2.565876007080078, "learning_rate": 1.1229946524064172e-05, "loss": 0.17598728835582733, "num_input_tokens_seen": 2116414, "step": 2056, "train_runtime": 4974.9039, "train_tokens_per_second": 425.418 }, { "epoch": 0.8791537557431349, "grad_norm": 4.031659126281738, "learning_rate": 1.1225668449197861e-05, "loss": 0.1332961618900299, "num_input_tokens_seen": 2117190, "step": 2057, "train_runtime": 4976.9204, "train_tokens_per_second": 425.402 }, { "epoch": 0.8795811518324608, "grad_norm": 3.3271517753601074, "learning_rate": 1.122139037433155e-05, "loss": 0.19120244681835175, "num_input_tokens_seen": 2118212, "step": 2058, "train_runtime": 4979.0201, "train_tokens_per_second": 425.427 }, { "epoch": 0.8800085479217865, "grad_norm": 2.249606132507324, "learning_rate": 1.1217112299465243e-05, "loss": 0.10734176635742188, "num_input_tokens_seen": 2119170, "step": 2059, "train_runtime": 4981.1166, "train_tokens_per_second": 425.441 }, { "epoch": 0.8804359440111122, "grad_norm": 3.041447401046753, "learning_rate": 1.1212834224598931e-05, "loss": 0.10975335538387299, "num_input_tokens_seen": 2120156, "step": 2060, "train_runtime": 4983.1986, "train_tokens_per_second": 425.461 }, { "epoch": 0.8808633401004381, "grad_norm": 2.3502914905548096, "learning_rate": 1.120855614973262e-05, "loss": 0.15373003482818604, "num_input_tokens_seen": 2121670, "step": 2061, "train_runtime": 4985.4009, "train_tokens_per_second": 425.577 }, { "epoch": 0.8812907361897638, "grad_norm": 2.9987335205078125, "learning_rate": 1.120427807486631e-05, "loss": 0.14460055530071259, "num_input_tokens_seen": 2122614, "step": 2062, "train_runtime": 4987.49, "train_tokens_per_second": 425.588 }, { "epoch": 0.8817181322790897, "grad_norm": 3.730349540710449, "learning_rate": 1.1200000000000001e-05, "loss": 0.1504986733198166, "num_input_tokens_seen": 2123342, "step": 2063, "train_runtime": 4989.5179, "train_tokens_per_second": 425.561 }, { "epoch": 0.8821455283684154, "grad_norm": 2.5371320247650146, "learning_rate": 1.119572192513369e-05, "loss": 0.09918291866779327, "num_input_tokens_seen": 2124194, "step": 2064, "train_runtime": 4991.5727, "train_tokens_per_second": 425.556 }, { "epoch": 0.8825729244577412, "grad_norm": 2.3514387607574463, "learning_rate": 1.119144385026738e-05, "loss": 0.10322583466768265, "num_input_tokens_seen": 2125412, "step": 2065, "train_runtime": 4993.7244, "train_tokens_per_second": 425.617 }, { "epoch": 0.883000320547067, "grad_norm": 2.3750336170196533, "learning_rate": 1.118716577540107e-05, "loss": 0.089006207883358, "num_input_tokens_seen": 2126608, "step": 2066, "train_runtime": 4995.8808, "train_tokens_per_second": 425.672 }, { "epoch": 0.8834277166363927, "grad_norm": 2.6898694038391113, "learning_rate": 1.118288770053476e-05, "loss": 0.14123940467834473, "num_input_tokens_seen": 2127588, "step": 2067, "train_runtime": 4997.9769, "train_tokens_per_second": 425.69 }, { "epoch": 0.8838551127257186, "grad_norm": 2.272538900375366, "learning_rate": 1.117860962566845e-05, "loss": 0.08137433975934982, "num_input_tokens_seen": 2128614, "step": 2068, "train_runtime": 5000.0668, "train_tokens_per_second": 425.717 }, { "epoch": 0.8842825088150443, "grad_norm": 3.188025712966919, "learning_rate": 1.117433155080214e-05, "loss": 0.1871384084224701, "num_input_tokens_seen": 2129810, "step": 2069, "train_runtime": 5002.1446, "train_tokens_per_second": 425.779 }, { "epoch": 0.8847099049043701, "grad_norm": 4.658123970031738, "learning_rate": 1.1170053475935829e-05, "loss": 0.25402939319610596, "num_input_tokens_seen": 2130448, "step": 2070, "train_runtime": 5004.1452, "train_tokens_per_second": 425.737 }, { "epoch": 0.8851373009936959, "grad_norm": 2.4507479667663574, "learning_rate": 1.116577540106952e-05, "loss": 0.15162120759487152, "num_input_tokens_seen": 2131852, "step": 2071, "train_runtime": 5012.9418, "train_tokens_per_second": 425.27 }, { "epoch": 0.8855646970830217, "grad_norm": 3.2056353092193604, "learning_rate": 1.116149732620321e-05, "loss": 0.14779843389987946, "num_input_tokens_seen": 2132686, "step": 2072, "train_runtime": 5015.0195, "train_tokens_per_second": 425.26 }, { "epoch": 0.8859920931723475, "grad_norm": 2.6292271614074707, "learning_rate": 1.1157219251336899e-05, "loss": 0.2042260468006134, "num_input_tokens_seen": 2133802, "step": 2073, "train_runtime": 5017.252, "train_tokens_per_second": 425.293 }, { "epoch": 0.8864194892616732, "grad_norm": 2.4773292541503906, "learning_rate": 1.1152941176470588e-05, "loss": 0.15483739972114563, "num_input_tokens_seen": 2134710, "step": 2074, "train_runtime": 5019.3906, "train_tokens_per_second": 425.293 }, { "epoch": 0.8868468853509991, "grad_norm": 3.203991413116455, "learning_rate": 1.1148663101604278e-05, "loss": 0.1202445775270462, "num_input_tokens_seen": 2135374, "step": 2075, "train_runtime": 5021.3773, "train_tokens_per_second": 425.257 }, { "epoch": 0.8872742814403248, "grad_norm": 3.6493308544158936, "learning_rate": 1.1144385026737969e-05, "loss": 0.24358196556568146, "num_input_tokens_seen": 2136620, "step": 2076, "train_runtime": 5023.5545, "train_tokens_per_second": 425.32 }, { "epoch": 0.8877016775296506, "grad_norm": 3.6222965717315674, "learning_rate": 1.1140106951871659e-05, "loss": 0.15311744809150696, "num_input_tokens_seen": 2137722, "step": 2077, "train_runtime": 5025.655, "train_tokens_per_second": 425.362 }, { "epoch": 0.8881290736189764, "grad_norm": 3.0898115634918213, "learning_rate": 1.1135828877005348e-05, "loss": 0.1271706521511078, "num_input_tokens_seen": 2138862, "step": 2078, "train_runtime": 5027.7725, "train_tokens_per_second": 425.409 }, { "epoch": 0.8885564697083022, "grad_norm": 3.015130043029785, "learning_rate": 1.1131550802139037e-05, "loss": 0.12016475200653076, "num_input_tokens_seen": 2139738, "step": 2079, "train_runtime": 5029.8225, "train_tokens_per_second": 425.41 }, { "epoch": 0.888983865797628, "grad_norm": 4.087200164794922, "learning_rate": 1.1127272727272729e-05, "loss": 0.15748974680900574, "num_input_tokens_seen": 2140384, "step": 2080, "train_runtime": 5031.8443, "train_tokens_per_second": 425.368 }, { "epoch": 0.8894112618869537, "grad_norm": 2.887399911880493, "learning_rate": 1.1122994652406418e-05, "loss": 0.13596299290657043, "num_input_tokens_seen": 2141186, "step": 2081, "train_runtime": 5033.8677, "train_tokens_per_second": 425.356 }, { "epoch": 0.8898386579762795, "grad_norm": 2.561500072479248, "learning_rate": 1.1118716577540107e-05, "loss": 0.14200156927108765, "num_input_tokens_seen": 2142272, "step": 2082, "train_runtime": 5035.9674, "train_tokens_per_second": 425.394 }, { "epoch": 0.8902660540656053, "grad_norm": 3.6333630084991455, "learning_rate": 1.1114438502673797e-05, "loss": 0.13719424605369568, "num_input_tokens_seen": 2143428, "step": 2083, "train_runtime": 5038.1033, "train_tokens_per_second": 425.443 }, { "epoch": 0.8906934501549311, "grad_norm": 2.1444313526153564, "learning_rate": 1.1110160427807488e-05, "loss": 0.09731752425432205, "num_input_tokens_seen": 2144534, "step": 2084, "train_runtime": 5040.1816, "train_tokens_per_second": 425.487 }, { "epoch": 0.8911208462442569, "grad_norm": 2.602187395095825, "learning_rate": 1.1105882352941177e-05, "loss": 0.1659667044878006, "num_input_tokens_seen": 2146040, "step": 2085, "train_runtime": 5042.4325, "train_tokens_per_second": 425.596 }, { "epoch": 0.8915482423335827, "grad_norm": 2.782085657119751, "learning_rate": 1.1101604278074867e-05, "loss": 0.13991759717464447, "num_input_tokens_seen": 2147140, "step": 2086, "train_runtime": 5044.5511, "train_tokens_per_second": 425.635 }, { "epoch": 0.8919756384229084, "grad_norm": 2.631455183029175, "learning_rate": 1.1097326203208556e-05, "loss": 0.11562193930149078, "num_input_tokens_seen": 2148050, "step": 2087, "train_runtime": 5046.6211, "train_tokens_per_second": 425.641 }, { "epoch": 0.8924030345122342, "grad_norm": 6.182000160217285, "learning_rate": 1.1093048128342247e-05, "loss": 0.09962183982133865, "num_input_tokens_seen": 2148750, "step": 2088, "train_runtime": 5048.6466, "train_tokens_per_second": 425.609 }, { "epoch": 0.89283043060156, "grad_norm": 3.3724265098571777, "learning_rate": 1.1088770053475937e-05, "loss": 0.16166161000728607, "num_input_tokens_seen": 2149570, "step": 2089, "train_runtime": 5050.7075, "train_tokens_per_second": 425.598 }, { "epoch": 0.8932578266908858, "grad_norm": 2.070803165435791, "learning_rate": 1.1084491978609626e-05, "loss": 0.09638729691505432, "num_input_tokens_seen": 2150544, "step": 2090, "train_runtime": 5052.818, "train_tokens_per_second": 425.613 }, { "epoch": 0.8936852227802116, "grad_norm": 2.8039610385894775, "learning_rate": 1.1080213903743316e-05, "loss": 0.13526132702827454, "num_input_tokens_seen": 2151614, "step": 2091, "train_runtime": 5054.9068, "train_tokens_per_second": 425.649 }, { "epoch": 0.8941126188695373, "grad_norm": 2.854904890060425, "learning_rate": 1.1075935828877007e-05, "loss": 0.13203227519989014, "num_input_tokens_seen": 2152512, "step": 2092, "train_runtime": 5056.9533, "train_tokens_per_second": 425.654 }, { "epoch": 0.8945400149588631, "grad_norm": 2.8414394855499268, "learning_rate": 1.1071657754010696e-05, "loss": 0.1113419458270073, "num_input_tokens_seen": 2153204, "step": 2093, "train_runtime": 5058.9412, "train_tokens_per_second": 425.623 }, { "epoch": 0.8949674110481889, "grad_norm": 2.2244601249694824, "learning_rate": 1.1067379679144386e-05, "loss": 0.06751777976751328, "num_input_tokens_seen": 2154586, "step": 2094, "train_runtime": 5061.1303, "train_tokens_per_second": 425.712 }, { "epoch": 0.8953948071375147, "grad_norm": 2.958847761154175, "learning_rate": 1.1063101604278075e-05, "loss": 0.12220863252878189, "num_input_tokens_seen": 2155250, "step": 2095, "train_runtime": 5063.1218, "train_tokens_per_second": 425.676 }, { "epoch": 0.8958222032268405, "grad_norm": 1.9352847337722778, "learning_rate": 1.1058823529411766e-05, "loss": 0.07753197103738785, "num_input_tokens_seen": 2156172, "step": 2096, "train_runtime": 5065.1721, "train_tokens_per_second": 425.686 }, { "epoch": 0.8962495993161662, "grad_norm": 2.2991068363189697, "learning_rate": 1.1054545454545456e-05, "loss": 0.10877975821495056, "num_input_tokens_seen": 2157060, "step": 2097, "train_runtime": 5067.2263, "train_tokens_per_second": 425.689 }, { "epoch": 0.8966769954054921, "grad_norm": 2.3581900596618652, "learning_rate": 1.1050267379679145e-05, "loss": 0.1087910458445549, "num_input_tokens_seen": 2157940, "step": 2098, "train_runtime": 5069.3112, "train_tokens_per_second": 425.687 }, { "epoch": 0.8971043914948178, "grad_norm": 3.809530258178711, "learning_rate": 1.1045989304812835e-05, "loss": 0.12143318355083466, "num_input_tokens_seen": 2158944, "step": 2099, "train_runtime": 5071.4229, "train_tokens_per_second": 425.708 }, { "epoch": 0.8975317875841436, "grad_norm": 3.5151312351226807, "learning_rate": 1.1041711229946526e-05, "loss": 0.18043813109397888, "num_input_tokens_seen": 2159674, "step": 2100, "train_runtime": 5073.4066, "train_tokens_per_second": 425.685 }, { "epoch": 0.8979591836734694, "grad_norm": 3.954275608062744, "learning_rate": 1.1037433155080215e-05, "loss": 0.2579469084739685, "num_input_tokens_seen": 2160366, "step": 2101, "train_runtime": 5081.7292, "train_tokens_per_second": 425.124 }, { "epoch": 0.8983865797627951, "grad_norm": 2.8379507064819336, "learning_rate": 1.1033155080213905e-05, "loss": 0.10394646227359772, "num_input_tokens_seen": 2161154, "step": 2102, "train_runtime": 5083.7792, "train_tokens_per_second": 425.108 }, { "epoch": 0.898813975852121, "grad_norm": 3.489959478378296, "learning_rate": 1.1028877005347594e-05, "loss": 0.12316275388002396, "num_input_tokens_seen": 2161938, "step": 2103, "train_runtime": 5085.921, "train_tokens_per_second": 425.083 }, { "epoch": 0.8992413719414467, "grad_norm": 3.760416269302368, "learning_rate": 1.1024598930481285e-05, "loss": 0.19151145219802856, "num_input_tokens_seen": 2162960, "step": 2104, "train_runtime": 5088.0086, "train_tokens_per_second": 425.109 }, { "epoch": 0.8996687680307726, "grad_norm": 4.122915267944336, "learning_rate": 1.1020320855614975e-05, "loss": 0.2019379436969757, "num_input_tokens_seen": 2163668, "step": 2105, "train_runtime": 5090.0663, "train_tokens_per_second": 425.077 }, { "epoch": 0.9000961641200983, "grad_norm": 2.8671376705169678, "learning_rate": 1.1016042780748664e-05, "loss": 0.12641726434230804, "num_input_tokens_seen": 2164382, "step": 2106, "train_runtime": 5092.0951, "train_tokens_per_second": 425.047 }, { "epoch": 0.900523560209424, "grad_norm": 2.865556478500366, "learning_rate": 1.1011764705882354e-05, "loss": 0.12395767122507095, "num_input_tokens_seen": 2165384, "step": 2107, "train_runtime": 5094.1834, "train_tokens_per_second": 425.07 }, { "epoch": 0.9009509562987499, "grad_norm": 3.565251588821411, "learning_rate": 1.1007486631016045e-05, "loss": 0.19681403040885925, "num_input_tokens_seen": 2166104, "step": 2108, "train_runtime": 5096.2358, "train_tokens_per_second": 425.04 }, { "epoch": 0.9013783523880756, "grad_norm": 3.232603073120117, "learning_rate": 1.1003208556149734e-05, "loss": 0.181961789727211, "num_input_tokens_seen": 2166962, "step": 2109, "train_runtime": 5098.3168, "train_tokens_per_second": 425.035 }, { "epoch": 0.9018057484774015, "grad_norm": 2.5656421184539795, "learning_rate": 1.0998930481283424e-05, "loss": 0.056980133056640625, "num_input_tokens_seen": 2167504, "step": 2110, "train_runtime": 5100.3102, "train_tokens_per_second": 424.975 }, { "epoch": 0.9022331445667272, "grad_norm": 4.643036365509033, "learning_rate": 1.0994652406417112e-05, "loss": 0.2640537917613983, "num_input_tokens_seen": 2168670, "step": 2111, "train_runtime": 5102.4295, "train_tokens_per_second": 425.027 }, { "epoch": 0.902660540656053, "grad_norm": 2.278615951538086, "learning_rate": 1.0990374331550804e-05, "loss": 0.08019732683897018, "num_input_tokens_seen": 2169614, "step": 2112, "train_runtime": 5104.5133, "train_tokens_per_second": 425.038 }, { "epoch": 0.9030879367453788, "grad_norm": 1.9510892629623413, "learning_rate": 1.0986096256684494e-05, "loss": 0.10955323278903961, "num_input_tokens_seen": 2170860, "step": 2113, "train_runtime": 5106.6642, "train_tokens_per_second": 425.103 }, { "epoch": 0.9035153328347045, "grad_norm": 2.72688364982605, "learning_rate": 1.0981818181818182e-05, "loss": 0.16085560619831085, "num_input_tokens_seen": 2172150, "step": 2114, "train_runtime": 5108.822, "train_tokens_per_second": 425.176 }, { "epoch": 0.9039427289240304, "grad_norm": 2.535994529724121, "learning_rate": 1.0977540106951871e-05, "loss": 0.15517297387123108, "num_input_tokens_seen": 2173248, "step": 2115, "train_runtime": 5110.9596, "train_tokens_per_second": 425.213 }, { "epoch": 0.9043701250133561, "grad_norm": 2.9148645401000977, "learning_rate": 1.0973262032085564e-05, "loss": 0.12632083892822266, "num_input_tokens_seen": 2174380, "step": 2116, "train_runtime": 5113.0915, "train_tokens_per_second": 425.257 }, { "epoch": 0.9047975211026819, "grad_norm": 2.3214263916015625, "learning_rate": 1.0968983957219253e-05, "loss": 0.10537756234407425, "num_input_tokens_seen": 2175414, "step": 2117, "train_runtime": 5115.1783, "train_tokens_per_second": 425.286 }, { "epoch": 0.9052249171920077, "grad_norm": 2.6031312942504883, "learning_rate": 1.0964705882352941e-05, "loss": 0.1510811448097229, "num_input_tokens_seen": 2176874, "step": 2118, "train_runtime": 5117.3654, "train_tokens_per_second": 425.39 }, { "epoch": 0.9056523132813334, "grad_norm": 3.532231330871582, "learning_rate": 1.096042780748663e-05, "loss": 0.1757303923368454, "num_input_tokens_seen": 2177804, "step": 2119, "train_runtime": 5119.4193, "train_tokens_per_second": 425.401 }, { "epoch": 0.9060797093706593, "grad_norm": 2.547057628631592, "learning_rate": 1.0956149732620323e-05, "loss": 0.13407796621322632, "num_input_tokens_seen": 2179206, "step": 2120, "train_runtime": 5121.6275, "train_tokens_per_second": 425.491 }, { "epoch": 0.906507105459985, "grad_norm": 2.5464515686035156, "learning_rate": 1.0951871657754011e-05, "loss": 0.08509576320648193, "num_input_tokens_seen": 2179886, "step": 2121, "train_runtime": 5123.6067, "train_tokens_per_second": 425.459 }, { "epoch": 0.9069345015493109, "grad_norm": 3.354395627975464, "learning_rate": 1.09475935828877e-05, "loss": 0.13675421476364136, "num_input_tokens_seen": 2180698, "step": 2122, "train_runtime": 5125.6763, "train_tokens_per_second": 425.446 }, { "epoch": 0.9073618976386366, "grad_norm": 2.4906198978424072, "learning_rate": 1.094331550802139e-05, "loss": 0.15708817541599274, "num_input_tokens_seen": 2181852, "step": 2123, "train_runtime": 5127.7616, "train_tokens_per_second": 425.498 }, { "epoch": 0.9077892937279624, "grad_norm": 2.5018856525421143, "learning_rate": 1.0939037433155081e-05, "loss": 0.13699057698249817, "num_input_tokens_seen": 2182806, "step": 2124, "train_runtime": 5129.8563, "train_tokens_per_second": 425.51 }, { "epoch": 0.9082166898172882, "grad_norm": 3.0618326663970947, "learning_rate": 1.093475935828877e-05, "loss": 0.18096017837524414, "num_input_tokens_seen": 2183504, "step": 2125, "train_runtime": 5131.878, "train_tokens_per_second": 425.479 }, { "epoch": 0.9086440859066139, "grad_norm": 2.9401183128356934, "learning_rate": 1.093048128342246e-05, "loss": 0.20621538162231445, "num_input_tokens_seen": 2184810, "step": 2126, "train_runtime": 5134.0563, "train_tokens_per_second": 425.552 }, { "epoch": 0.9090714819959398, "grad_norm": 3.2026705741882324, "learning_rate": 1.092620320855615e-05, "loss": 0.17546185851097107, "num_input_tokens_seen": 2185814, "step": 2127, "train_runtime": 5136.131, "train_tokens_per_second": 425.576 }, { "epoch": 0.9094988780852655, "grad_norm": 3.712503433227539, "learning_rate": 1.092192513368984e-05, "loss": 0.14737451076507568, "num_input_tokens_seen": 2186656, "step": 2128, "train_runtime": 5138.2015, "train_tokens_per_second": 425.568 }, { "epoch": 0.9099262741745913, "grad_norm": 1.7033201456069946, "learning_rate": 1.091764705882353e-05, "loss": 0.05501745641231537, "num_input_tokens_seen": 2187694, "step": 2129, "train_runtime": 5140.3011, "train_tokens_per_second": 425.596 }, { "epoch": 0.9103536702639171, "grad_norm": 2.63810658454895, "learning_rate": 1.091336898395722e-05, "loss": 0.09936663508415222, "num_input_tokens_seen": 2188778, "step": 2130, "train_runtime": 5142.5206, "train_tokens_per_second": 425.624 }, { "epoch": 0.9107810663532429, "grad_norm": 2.8543202877044678, "learning_rate": 1.0909090909090909e-05, "loss": 0.17764246463775635, "num_input_tokens_seen": 2189862, "step": 2131, "train_runtime": 5151.1029, "train_tokens_per_second": 425.125 }, { "epoch": 0.9112084624425687, "grad_norm": 3.8218626976013184, "learning_rate": 1.09048128342246e-05, "loss": 0.15334482491016388, "num_input_tokens_seen": 2190950, "step": 2132, "train_runtime": 5153.1851, "train_tokens_per_second": 425.164 }, { "epoch": 0.9116358585318944, "grad_norm": 2.9003210067749023, "learning_rate": 1.090053475935829e-05, "loss": 0.1193888783454895, "num_input_tokens_seen": 2191624, "step": 2133, "train_runtime": 5155.2046, "train_tokens_per_second": 425.128 }, { "epoch": 0.9120632546212202, "grad_norm": 4.106865406036377, "learning_rate": 1.0896256684491979e-05, "loss": 0.2729776203632355, "num_input_tokens_seen": 2192338, "step": 2134, "train_runtime": 5157.2343, "train_tokens_per_second": 425.1 }, { "epoch": 0.912490650710546, "grad_norm": 4.397752285003662, "learning_rate": 1.0891978609625668e-05, "loss": 0.13377909362316132, "num_input_tokens_seen": 2193204, "step": 2135, "train_runtime": 5159.2765, "train_tokens_per_second": 425.099 }, { "epoch": 0.9129180467998718, "grad_norm": 3.121751070022583, "learning_rate": 1.088770053475936e-05, "loss": 0.1185264140367508, "num_input_tokens_seen": 2193862, "step": 2136, "train_runtime": 5161.3207, "train_tokens_per_second": 425.058 }, { "epoch": 0.9133454428891976, "grad_norm": 2.8448967933654785, "learning_rate": 1.0883422459893049e-05, "loss": 0.20869427919387817, "num_input_tokens_seen": 2195292, "step": 2137, "train_runtime": 5163.4919, "train_tokens_per_second": 425.156 }, { "epoch": 0.9137728389785233, "grad_norm": 2.3537094593048096, "learning_rate": 1.0879144385026738e-05, "loss": 0.07945031672716141, "num_input_tokens_seen": 2196192, "step": 2138, "train_runtime": 5165.5209, "train_tokens_per_second": 425.164 }, { "epoch": 0.9142002350678491, "grad_norm": 2.047752618789673, "learning_rate": 1.0874866310160428e-05, "loss": 0.09320962429046631, "num_input_tokens_seen": 2197194, "step": 2139, "train_runtime": 5167.6052, "train_tokens_per_second": 425.186 }, { "epoch": 0.9146276311571749, "grad_norm": 2.3615562915802, "learning_rate": 1.0870588235294119e-05, "loss": 0.1290973722934723, "num_input_tokens_seen": 2198406, "step": 2140, "train_runtime": 5169.7525, "train_tokens_per_second": 425.244 }, { "epoch": 0.9150550272465007, "grad_norm": 3.5751733779907227, "learning_rate": 1.0866310160427808e-05, "loss": 0.11524638533592224, "num_input_tokens_seen": 2199216, "step": 2141, "train_runtime": 5171.7611, "train_tokens_per_second": 425.235 }, { "epoch": 0.9154824233358265, "grad_norm": 3.339257001876831, "learning_rate": 1.0862032085561498e-05, "loss": 0.1953415423631668, "num_input_tokens_seen": 2200286, "step": 2142, "train_runtime": 5173.8046, "train_tokens_per_second": 425.274 }, { "epoch": 0.9159098194251523, "grad_norm": 1.957407832145691, "learning_rate": 1.0857754010695187e-05, "loss": 0.10389889776706696, "num_input_tokens_seen": 2202008, "step": 2143, "train_runtime": 5176.0957, "train_tokens_per_second": 425.419 }, { "epoch": 0.916337215514478, "grad_norm": 2.46386981010437, "learning_rate": 1.0853475935828878e-05, "loss": 0.09721916913986206, "num_input_tokens_seen": 2203588, "step": 2144, "train_runtime": 5178.4696, "train_tokens_per_second": 425.529 }, { "epoch": 0.9167646116038038, "grad_norm": 2.506495714187622, "learning_rate": 1.0849197860962568e-05, "loss": 0.12483134865760803, "num_input_tokens_seen": 2205476, "step": 2145, "train_runtime": 5180.7638, "train_tokens_per_second": 425.705 }, { "epoch": 0.9171920076931296, "grad_norm": 2.2939774990081787, "learning_rate": 1.0844919786096257e-05, "loss": 0.16094037890434265, "num_input_tokens_seen": 2206608, "step": 2146, "train_runtime": 5182.8999, "train_tokens_per_second": 425.748 }, { "epoch": 0.9176194037824554, "grad_norm": 2.6393582820892334, "learning_rate": 1.0840641711229947e-05, "loss": 0.15815824270248413, "num_input_tokens_seen": 2208032, "step": 2147, "train_runtime": 5185.0775, "train_tokens_per_second": 425.844 }, { "epoch": 0.9180467998717812, "grad_norm": 2.7265353202819824, "learning_rate": 1.0836363636363638e-05, "loss": 0.13773269951343536, "num_input_tokens_seen": 2209026, "step": 2148, "train_runtime": 5187.1668, "train_tokens_per_second": 425.864 }, { "epoch": 0.9184741959611069, "grad_norm": 2.727649688720703, "learning_rate": 1.0832085561497327e-05, "loss": 0.10120885074138641, "num_input_tokens_seen": 2209972, "step": 2149, "train_runtime": 5189.267, "train_tokens_per_second": 425.874 }, { "epoch": 0.9189015920504328, "grad_norm": 2.123680830001831, "learning_rate": 1.0827807486631017e-05, "loss": 0.11646150052547455, "num_input_tokens_seen": 2210930, "step": 2150, "train_runtime": 5191.3743, "train_tokens_per_second": 425.885 }, { "epoch": 0.9193289881397585, "grad_norm": 1.778903841972351, "learning_rate": 1.0823529411764706e-05, "loss": 0.1022472232580185, "num_input_tokens_seen": 2212194, "step": 2151, "train_runtime": 5193.485, "train_tokens_per_second": 425.956 }, { "epoch": 0.9197563842290843, "grad_norm": 3.146822452545166, "learning_rate": 1.0819251336898397e-05, "loss": 0.1293303668498993, "num_input_tokens_seen": 2213710, "step": 2152, "train_runtime": 5195.7125, "train_tokens_per_second": 426.065 }, { "epoch": 0.9201837803184101, "grad_norm": 3.0693538188934326, "learning_rate": 1.0814973262032087e-05, "loss": 0.11907608807086945, "num_input_tokens_seen": 2214468, "step": 2153, "train_runtime": 5197.7152, "train_tokens_per_second": 426.046 }, { "epoch": 0.9206111764077358, "grad_norm": 4.317978382110596, "learning_rate": 1.0810695187165776e-05, "loss": 0.1422056257724762, "num_input_tokens_seen": 2215134, "step": 2154, "train_runtime": 5199.7024, "train_tokens_per_second": 426.012 }, { "epoch": 0.9210385724970617, "grad_norm": 3.077620506286621, "learning_rate": 1.0806417112299466e-05, "loss": 0.13248398900032043, "num_input_tokens_seen": 2216198, "step": 2155, "train_runtime": 5201.7808, "train_tokens_per_second": 426.046 }, { "epoch": 0.9214659685863874, "grad_norm": 2.8807480335235596, "learning_rate": 1.0802139037433157e-05, "loss": 0.13581492006778717, "num_input_tokens_seen": 2216962, "step": 2156, "train_runtime": 5204.0215, "train_tokens_per_second": 426.009 }, { "epoch": 0.9218933646757133, "grad_norm": 2.3715343475341797, "learning_rate": 1.0797860962566846e-05, "loss": 0.14173632860183716, "num_input_tokens_seen": 2218354, "step": 2157, "train_runtime": 5206.2581, "train_tokens_per_second": 426.094 }, { "epoch": 0.922320760765039, "grad_norm": 2.6752946376800537, "learning_rate": 1.0793582887700536e-05, "loss": 0.109413743019104, "num_input_tokens_seen": 2219428, "step": 2158, "train_runtime": 5208.3697, "train_tokens_per_second": 426.127 }, { "epoch": 0.9227481568543647, "grad_norm": 2.5701966285705566, "learning_rate": 1.0789304812834225e-05, "loss": 0.10824789851903915, "num_input_tokens_seen": 2220526, "step": 2159, "train_runtime": 5210.5067, "train_tokens_per_second": 426.163 }, { "epoch": 0.9231755529436906, "grad_norm": 1.5209977626800537, "learning_rate": 1.0785026737967916e-05, "loss": 0.05084332451224327, "num_input_tokens_seen": 2222110, "step": 2160, "train_runtime": 5212.7347, "train_tokens_per_second": 426.285 }, { "epoch": 0.9236029490330163, "grad_norm": 2.1654891967773438, "learning_rate": 1.0780748663101606e-05, "loss": 0.1114838719367981, "num_input_tokens_seen": 2223346, "step": 2161, "train_runtime": 5221.2387, "train_tokens_per_second": 425.827 }, { "epoch": 0.9240303451223422, "grad_norm": 2.767596483230591, "learning_rate": 1.0776470588235295e-05, "loss": 0.16918615996837616, "num_input_tokens_seen": 2224226, "step": 2162, "train_runtime": 5223.3193, "train_tokens_per_second": 425.826 }, { "epoch": 0.9244577412116679, "grad_norm": 2.738677978515625, "learning_rate": 1.0772192513368985e-05, "loss": 0.08162784576416016, "num_input_tokens_seen": 2225198, "step": 2163, "train_runtime": 5225.3974, "train_tokens_per_second": 425.843 }, { "epoch": 0.9248851373009936, "grad_norm": 2.7296721935272217, "learning_rate": 1.0767914438502676e-05, "loss": 0.08721458911895752, "num_input_tokens_seen": 2225796, "step": 2164, "train_runtime": 5227.4585, "train_tokens_per_second": 425.789 }, { "epoch": 0.9253125333903195, "grad_norm": 4.145293235778809, "learning_rate": 1.0763636363636365e-05, "loss": 0.11372827738523483, "num_input_tokens_seen": 2226544, "step": 2165, "train_runtime": 5229.5087, "train_tokens_per_second": 425.765 }, { "epoch": 0.9257399294796452, "grad_norm": 3.3616368770599365, "learning_rate": 1.0759358288770055e-05, "loss": 0.21249844133853912, "num_input_tokens_seen": 2227448, "step": 2166, "train_runtime": 5231.6021, "train_tokens_per_second": 425.768 }, { "epoch": 0.9261673255689711, "grad_norm": 2.7214016914367676, "learning_rate": 1.0755080213903744e-05, "loss": 0.14507797360420227, "num_input_tokens_seen": 2229306, "step": 2167, "train_runtime": 5233.8521, "train_tokens_per_second": 425.94 }, { "epoch": 0.9265947216582968, "grad_norm": 2.3175292015075684, "learning_rate": 1.0750802139037435e-05, "loss": 0.15931209921836853, "num_input_tokens_seen": 2230718, "step": 2168, "train_runtime": 5236.0199, "train_tokens_per_second": 426.033 }, { "epoch": 0.9270221177476226, "grad_norm": 3.5114946365356445, "learning_rate": 1.0746524064171125e-05, "loss": 0.13204370439052582, "num_input_tokens_seen": 2231422, "step": 2169, "train_runtime": 5238.0654, "train_tokens_per_second": 426.001 }, { "epoch": 0.9274495138369484, "grad_norm": 2.4863505363464355, "learning_rate": 1.0742245989304814e-05, "loss": 0.09473159909248352, "num_input_tokens_seen": 2232340, "step": 2170, "train_runtime": 5240.1543, "train_tokens_per_second": 426.007 }, { "epoch": 0.9278769099262741, "grad_norm": 9.001498222351074, "learning_rate": 1.0737967914438504e-05, "loss": 0.22720074653625488, "num_input_tokens_seen": 2233880, "step": 2171, "train_runtime": 5242.3674, "train_tokens_per_second": 426.12 }, { "epoch": 0.9283043060156, "grad_norm": 2.9662041664123535, "learning_rate": 1.0733689839572195e-05, "loss": 0.10152985155582428, "num_input_tokens_seen": 2234980, "step": 2172, "train_runtime": 5244.443, "train_tokens_per_second": 426.162 }, { "epoch": 0.9287317021049257, "grad_norm": 4.028475761413574, "learning_rate": 1.0729411764705884e-05, "loss": 0.21238811314105988, "num_input_tokens_seen": 2235902, "step": 2173, "train_runtime": 5246.5465, "train_tokens_per_second": 426.166 }, { "epoch": 0.9291590981942516, "grad_norm": 3.0487616062164307, "learning_rate": 1.0725133689839574e-05, "loss": 0.11749480664730072, "num_input_tokens_seen": 2236840, "step": 2174, "train_runtime": 5248.6, "train_tokens_per_second": 426.178 }, { "epoch": 0.9295864942835773, "grad_norm": 2.740997552871704, "learning_rate": 1.0720855614973263e-05, "loss": 0.1353542059659958, "num_input_tokens_seen": 2238150, "step": 2175, "train_runtime": 5250.8079, "train_tokens_per_second": 426.249 }, { "epoch": 0.930013890372903, "grad_norm": 2.0356626510620117, "learning_rate": 1.0716577540106954e-05, "loss": 0.11324270814657211, "num_input_tokens_seen": 2239322, "step": 2176, "train_runtime": 5252.979, "train_tokens_per_second": 426.296 }, { "epoch": 0.9304412864622289, "grad_norm": 2.3686628341674805, "learning_rate": 1.0712299465240644e-05, "loss": 0.09979484975337982, "num_input_tokens_seen": 2240178, "step": 2177, "train_runtime": 5255.0701, "train_tokens_per_second": 426.289 }, { "epoch": 0.9308686825515546, "grad_norm": 3.0573229789733887, "learning_rate": 1.0708021390374333e-05, "loss": 0.12711331248283386, "num_input_tokens_seen": 2241096, "step": 2178, "train_runtime": 5257.2102, "train_tokens_per_second": 426.29 }, { "epoch": 0.9312960786408805, "grad_norm": 3.210937261581421, "learning_rate": 1.0703743315508021e-05, "loss": 0.17777645587921143, "num_input_tokens_seen": 2241958, "step": 2179, "train_runtime": 5259.2869, "train_tokens_per_second": 426.286 }, { "epoch": 0.9317234747302062, "grad_norm": 2.386139392852783, "learning_rate": 1.0699465240641714e-05, "loss": 0.09151815623044968, "num_input_tokens_seen": 2242900, "step": 2180, "train_runtime": 5261.3169, "train_tokens_per_second": 426.3 }, { "epoch": 0.932150870819532, "grad_norm": 3.4541666507720947, "learning_rate": 1.0695187165775403e-05, "loss": 0.15929041802883148, "num_input_tokens_seen": 2243884, "step": 2181, "train_runtime": 5263.3934, "train_tokens_per_second": 426.319 }, { "epoch": 0.9325782669088578, "grad_norm": 3.3218729496002197, "learning_rate": 1.0690909090909091e-05, "loss": 0.12920552492141724, "num_input_tokens_seen": 2244708, "step": 2182, "train_runtime": 5265.4525, "train_tokens_per_second": 426.309 }, { "epoch": 0.9330056629981835, "grad_norm": 3.177752733230591, "learning_rate": 1.068663101604278e-05, "loss": 0.13437598943710327, "num_input_tokens_seen": 2245648, "step": 2183, "train_runtime": 5267.5631, "train_tokens_per_second": 426.316 }, { "epoch": 0.9334330590875094, "grad_norm": 2.9457602500915527, "learning_rate": 1.068235294117647e-05, "loss": 0.11178413778543472, "num_input_tokens_seen": 2246654, "step": 2184, "train_runtime": 5269.6641, "train_tokens_per_second": 426.337 }, { "epoch": 0.9338604551768351, "grad_norm": 3.3846898078918457, "learning_rate": 1.0678074866310163e-05, "loss": 0.15206705033779144, "num_input_tokens_seen": 2247496, "step": 2185, "train_runtime": 5271.7147, "train_tokens_per_second": 426.331 }, { "epoch": 0.9342878512661609, "grad_norm": 2.4759533405303955, "learning_rate": 1.067379679144385e-05, "loss": 0.09942358732223511, "num_input_tokens_seen": 2248292, "step": 2186, "train_runtime": 5273.7229, "train_tokens_per_second": 426.32 }, { "epoch": 0.9347152473554867, "grad_norm": 2.98865008354187, "learning_rate": 1.066951871657754e-05, "loss": 0.1888924539089203, "num_input_tokens_seen": 2249290, "step": 2187, "train_runtime": 5275.8049, "train_tokens_per_second": 426.341 }, { "epoch": 0.9351426434448125, "grad_norm": 3.50740909576416, "learning_rate": 1.066524064171123e-05, "loss": 0.15311260521411896, "num_input_tokens_seen": 2250184, "step": 2188, "train_runtime": 5277.9192, "train_tokens_per_second": 426.339 }, { "epoch": 0.9355700395341383, "grad_norm": 2.490849733352661, "learning_rate": 1.066096256684492e-05, "loss": 0.16449710726737976, "num_input_tokens_seen": 2251370, "step": 2189, "train_runtime": 5280.0296, "train_tokens_per_second": 426.393 }, { "epoch": 0.935997435623464, "grad_norm": 1.8838605880737305, "learning_rate": 1.065668449197861e-05, "loss": 0.08945582807064056, "num_input_tokens_seen": 2252332, "step": 2190, "train_runtime": 5282.0869, "train_tokens_per_second": 426.409 }, { "epoch": 0.9364248317127898, "grad_norm": 4.332616806030273, "learning_rate": 1.06524064171123e-05, "loss": 0.12057185173034668, "num_input_tokens_seen": 2252888, "step": 2191, "train_runtime": 5290.5661, "train_tokens_per_second": 425.831 }, { "epoch": 0.9368522278021156, "grad_norm": 2.9275875091552734, "learning_rate": 1.0648128342245989e-05, "loss": 0.09116809815168381, "num_input_tokens_seen": 2254060, "step": 2192, "train_runtime": 5292.7509, "train_tokens_per_second": 425.877 }, { "epoch": 0.9372796238914414, "grad_norm": 3.4034175872802734, "learning_rate": 1.064385026737968e-05, "loss": 0.22489213943481445, "num_input_tokens_seen": 2255156, "step": 2193, "train_runtime": 5294.8636, "train_tokens_per_second": 425.914 }, { "epoch": 0.9377070199807672, "grad_norm": 2.499889850616455, "learning_rate": 1.063957219251337e-05, "loss": 0.10469234734773636, "num_input_tokens_seen": 2256090, "step": 2194, "train_runtime": 5296.9134, "train_tokens_per_second": 425.925 }, { "epoch": 0.938134416070093, "grad_norm": 2.683138370513916, "learning_rate": 1.0635294117647059e-05, "loss": 0.08835846185684204, "num_input_tokens_seen": 2256706, "step": 2195, "train_runtime": 5298.9077, "train_tokens_per_second": 425.881 }, { "epoch": 0.9385618121594187, "grad_norm": 3.7897140979766846, "learning_rate": 1.0631016042780748e-05, "loss": 0.24589768052101135, "num_input_tokens_seen": 2257434, "step": 2196, "train_runtime": 5300.9293, "train_tokens_per_second": 425.856 }, { "epoch": 0.9389892082487445, "grad_norm": 3.4630603790283203, "learning_rate": 1.062673796791444e-05, "loss": 0.196588933467865, "num_input_tokens_seen": 2258554, "step": 2197, "train_runtime": 5303.0446, "train_tokens_per_second": 425.898 }, { "epoch": 0.9394166043380703, "grad_norm": 2.983121395111084, "learning_rate": 1.0622459893048129e-05, "loss": 0.12487363815307617, "num_input_tokens_seen": 2259392, "step": 2198, "train_runtime": 5305.0673, "train_tokens_per_second": 425.893 }, { "epoch": 0.9398440004273961, "grad_norm": 2.822087287902832, "learning_rate": 1.0618181818181818e-05, "loss": 0.16200515627861023, "num_input_tokens_seen": 2260566, "step": 2199, "train_runtime": 5307.2085, "train_tokens_per_second": 425.943 }, { "epoch": 0.9402713965167219, "grad_norm": 1.8860913515090942, "learning_rate": 1.0613903743315508e-05, "loss": 0.09443388879299164, "num_input_tokens_seen": 2262194, "step": 2200, "train_runtime": 5309.4582, "train_tokens_per_second": 426.069 }, { "epoch": 0.9406987926060476, "grad_norm": 3.1899352073669434, "learning_rate": 1.0609625668449199e-05, "loss": 0.1756967306137085, "num_input_tokens_seen": 2263188, "step": 2201, "train_runtime": 5311.5175, "train_tokens_per_second": 426.091 }, { "epoch": 0.9411261886953735, "grad_norm": 2.7726073265075684, "learning_rate": 1.0605347593582888e-05, "loss": 0.0826355516910553, "num_input_tokens_seen": 2263944, "step": 2202, "train_runtime": 5313.5107, "train_tokens_per_second": 426.073 }, { "epoch": 0.9415535847846992, "grad_norm": 4.586921691894531, "learning_rate": 1.0601069518716578e-05, "loss": 0.20692268013954163, "num_input_tokens_seen": 2264748, "step": 2203, "train_runtime": 5315.5709, "train_tokens_per_second": 426.059 }, { "epoch": 0.941980980874025, "grad_norm": 2.3063955307006836, "learning_rate": 1.0596791443850267e-05, "loss": 0.07637247443199158, "num_input_tokens_seen": 2265692, "step": 2204, "train_runtime": 5317.664, "train_tokens_per_second": 426.069 }, { "epoch": 0.9424083769633508, "grad_norm": 3.097294569015503, "learning_rate": 1.0592513368983958e-05, "loss": 0.1618078649044037, "num_input_tokens_seen": 2266638, "step": 2205, "train_runtime": 5319.723, "train_tokens_per_second": 426.082 }, { "epoch": 0.9428357730526765, "grad_norm": 2.5151431560516357, "learning_rate": 1.0588235294117648e-05, "loss": 0.08781378716230392, "num_input_tokens_seen": 2267848, "step": 2206, "train_runtime": 5321.8432, "train_tokens_per_second": 426.14 }, { "epoch": 0.9432631691420024, "grad_norm": 3.21832013130188, "learning_rate": 1.0583957219251337e-05, "loss": 0.1308228224515915, "num_input_tokens_seen": 2268764, "step": 2207, "train_runtime": 5323.9406, "train_tokens_per_second": 426.144 }, { "epoch": 0.9436905652313281, "grad_norm": 2.765855550765991, "learning_rate": 1.0579679144385027e-05, "loss": 0.11980103701353073, "num_input_tokens_seen": 2269744, "step": 2208, "train_runtime": 5326.0657, "train_tokens_per_second": 426.158 }, { "epoch": 0.944117961320654, "grad_norm": 2.2999863624572754, "learning_rate": 1.0575401069518718e-05, "loss": 0.10366262495517731, "num_input_tokens_seen": 2270726, "step": 2209, "train_runtime": 5328.1526, "train_tokens_per_second": 426.175 }, { "epoch": 0.9445453574099797, "grad_norm": 2.7298548221588135, "learning_rate": 1.0571122994652407e-05, "loss": 0.11786146461963654, "num_input_tokens_seen": 2271722, "step": 2210, "train_runtime": 5330.2559, "train_tokens_per_second": 426.194 }, { "epoch": 0.9449727534993054, "grad_norm": 2.8209102153778076, "learning_rate": 1.0566844919786097e-05, "loss": 0.17704381048679352, "num_input_tokens_seen": 2272812, "step": 2211, "train_runtime": 5332.3726, "train_tokens_per_second": 426.229 }, { "epoch": 0.9454001495886313, "grad_norm": 2.208386182785034, "learning_rate": 1.0562566844919786e-05, "loss": 0.16215816140174866, "num_input_tokens_seen": 2274198, "step": 2212, "train_runtime": 5334.5523, "train_tokens_per_second": 426.315 }, { "epoch": 0.945827545677957, "grad_norm": 3.8417880535125732, "learning_rate": 1.0558288770053477e-05, "loss": 0.18061214685440063, "num_input_tokens_seen": 2275008, "step": 2213, "train_runtime": 5336.5768, "train_tokens_per_second": 426.305 }, { "epoch": 0.9462549417672829, "grad_norm": 2.4419734477996826, "learning_rate": 1.0554010695187167e-05, "loss": 0.14664049446582794, "num_input_tokens_seen": 2275952, "step": 2214, "train_runtime": 5338.621, "train_tokens_per_second": 426.318 }, { "epoch": 0.9466823378566086, "grad_norm": 1.8086351156234741, "learning_rate": 1.0549732620320856e-05, "loss": 0.12906458973884583, "num_input_tokens_seen": 2277670, "step": 2215, "train_runtime": 5340.8503, "train_tokens_per_second": 426.462 }, { "epoch": 0.9471097339459343, "grad_norm": 2.719177722930908, "learning_rate": 1.0545454545454546e-05, "loss": 0.11620186269283295, "num_input_tokens_seen": 2278466, "step": 2216, "train_runtime": 5342.8901, "train_tokens_per_second": 426.448 }, { "epoch": 0.9475371300352602, "grad_norm": 2.628976345062256, "learning_rate": 1.0541176470588237e-05, "loss": 0.14144361019134521, "num_input_tokens_seen": 2279650, "step": 2217, "train_runtime": 5345.0009, "train_tokens_per_second": 426.501 }, { "epoch": 0.9479645261245859, "grad_norm": 3.304093599319458, "learning_rate": 1.0536898395721926e-05, "loss": 0.1491798311471939, "num_input_tokens_seen": 2280504, "step": 2218, "train_runtime": 5347.059, "train_tokens_per_second": 426.497 }, { "epoch": 0.9483919222139118, "grad_norm": 2.8636415004730225, "learning_rate": 1.0532620320855616e-05, "loss": 0.13599589467048645, "num_input_tokens_seen": 2281424, "step": 2219, "train_runtime": 5349.1083, "train_tokens_per_second": 426.505 }, { "epoch": 0.9488193183032375, "grad_norm": 2.402021646499634, "learning_rate": 1.0528342245989305e-05, "loss": 0.08079744130373001, "num_input_tokens_seen": 2282100, "step": 2220, "train_runtime": 5351.1099, "train_tokens_per_second": 426.472 }, { "epoch": 0.9492467143925634, "grad_norm": 3.220078945159912, "learning_rate": 1.0524064171122996e-05, "loss": 0.15267720818519592, "num_input_tokens_seen": 2283032, "step": 2221, "train_runtime": 5359.8284, "train_tokens_per_second": 425.952 }, { "epoch": 0.9496741104818891, "grad_norm": 2.245920181274414, "learning_rate": 1.0519786096256686e-05, "loss": 0.08796598762273788, "num_input_tokens_seen": 2284202, "step": 2222, "train_runtime": 5361.9319, "train_tokens_per_second": 426.004 }, { "epoch": 0.9501015065712148, "grad_norm": 2.347975015640259, "learning_rate": 1.0515508021390375e-05, "loss": 0.06638360023498535, "num_input_tokens_seen": 2285314, "step": 2223, "train_runtime": 5364.1799, "train_tokens_per_second": 426.032 }, { "epoch": 0.9505289026605407, "grad_norm": 3.0309362411499023, "learning_rate": 1.0511229946524065e-05, "loss": 0.1558932512998581, "num_input_tokens_seen": 2286416, "step": 2224, "train_runtime": 5366.4275, "train_tokens_per_second": 426.059 }, { "epoch": 0.9509562987498664, "grad_norm": 2.6483371257781982, "learning_rate": 1.0506951871657756e-05, "loss": 0.1320035755634308, "num_input_tokens_seen": 2287386, "step": 2225, "train_runtime": 5368.505, "train_tokens_per_second": 426.075 }, { "epoch": 0.9513836948391923, "grad_norm": 2.654061794281006, "learning_rate": 1.0502673796791445e-05, "loss": 0.13254696130752563, "num_input_tokens_seen": 2288430, "step": 2226, "train_runtime": 5370.6191, "train_tokens_per_second": 426.102 }, { "epoch": 0.951811090928518, "grad_norm": 3.8444437980651855, "learning_rate": 1.0498395721925135e-05, "loss": 0.20998886227607727, "num_input_tokens_seen": 2289104, "step": 2227, "train_runtime": 5372.5913, "train_tokens_per_second": 426.071 }, { "epoch": 0.9522384870178437, "grad_norm": 2.013779878616333, "learning_rate": 1.0494117647058824e-05, "loss": 0.12033921480178833, "num_input_tokens_seen": 2290770, "step": 2228, "train_runtime": 5374.8506, "train_tokens_per_second": 426.202 }, { "epoch": 0.9526658831071696, "grad_norm": 2.6551356315612793, "learning_rate": 1.0489839572192515e-05, "loss": 0.11887505650520325, "num_input_tokens_seen": 2292226, "step": 2229, "train_runtime": 5377.0349, "train_tokens_per_second": 426.299 }, { "epoch": 0.9530932791964953, "grad_norm": 2.649827003479004, "learning_rate": 1.0485561497326205e-05, "loss": 0.12751273810863495, "num_input_tokens_seen": 2293084, "step": 2230, "train_runtime": 5379.0791, "train_tokens_per_second": 426.297 }, { "epoch": 0.9535206752858212, "grad_norm": 1.9154528379440308, "learning_rate": 1.0481283422459894e-05, "loss": 0.10436928272247314, "num_input_tokens_seen": 2294576, "step": 2231, "train_runtime": 5381.2582, "train_tokens_per_second": 426.401 }, { "epoch": 0.9539480713751469, "grad_norm": 2.9512860774993896, "learning_rate": 1.0477005347593584e-05, "loss": 0.1171833872795105, "num_input_tokens_seen": 2295456, "step": 2232, "train_runtime": 5383.3118, "train_tokens_per_second": 426.402 }, { "epoch": 0.9543754674644727, "grad_norm": 2.9378502368927, "learning_rate": 1.0472727272727275e-05, "loss": 0.12822403013706207, "num_input_tokens_seen": 2296482, "step": 2233, "train_runtime": 5385.3564, "train_tokens_per_second": 426.431 }, { "epoch": 0.9548028635537985, "grad_norm": 3.5034008026123047, "learning_rate": 1.0468449197860964e-05, "loss": 0.1279274970293045, "num_input_tokens_seen": 2297264, "step": 2234, "train_runtime": 5387.3694, "train_tokens_per_second": 426.417 }, { "epoch": 0.9552302596431242, "grad_norm": 2.428328275680542, "learning_rate": 1.0464171122994654e-05, "loss": 0.2062709480524063, "num_input_tokens_seen": 2298784, "step": 2235, "train_runtime": 5389.5736, "train_tokens_per_second": 426.524 }, { "epoch": 0.9556576557324501, "grad_norm": 2.7964532375335693, "learning_rate": 1.0459893048128343e-05, "loss": 0.08819354325532913, "num_input_tokens_seen": 2299798, "step": 2236, "train_runtime": 5391.6384, "train_tokens_per_second": 426.549 }, { "epoch": 0.9560850518217758, "grad_norm": 1.3275729417800903, "learning_rate": 1.0455614973262034e-05, "loss": 0.0548393651843071, "num_input_tokens_seen": 2301808, "step": 2237, "train_runtime": 5393.9812, "train_tokens_per_second": 426.736 }, { "epoch": 0.9565124479111016, "grad_norm": 2.5672008991241455, "learning_rate": 1.0451336898395724e-05, "loss": 0.08960367739200592, "num_input_tokens_seen": 2302694, "step": 2238, "train_runtime": 5396.0196, "train_tokens_per_second": 426.739 }, { "epoch": 0.9569398440004274, "grad_norm": 2.848595380783081, "learning_rate": 1.0447058823529413e-05, "loss": 0.179183691740036, "num_input_tokens_seen": 2303744, "step": 2239, "train_runtime": 5398.123, "train_tokens_per_second": 426.768 }, { "epoch": 0.9573672400897532, "grad_norm": 3.3253800868988037, "learning_rate": 1.04427807486631e-05, "loss": 0.16926611959934235, "num_input_tokens_seen": 2304580, "step": 2240, "train_runtime": 5400.1769, "train_tokens_per_second": 426.76 }, { "epoch": 0.957794636179079, "grad_norm": 3.1977779865264893, "learning_rate": 1.0438502673796794e-05, "loss": 0.13291694223880768, "num_input_tokens_seen": 2305478, "step": 2241, "train_runtime": 5402.2191, "train_tokens_per_second": 426.765 }, { "epoch": 0.9582220322684047, "grad_norm": 2.222672939300537, "learning_rate": 1.0434224598930483e-05, "loss": 0.10854735970497131, "num_input_tokens_seen": 2306700, "step": 2242, "train_runtime": 5404.3714, "train_tokens_per_second": 426.821 }, { "epoch": 0.9586494283577305, "grad_norm": 1.9616283178329468, "learning_rate": 1.0429946524064173e-05, "loss": 0.1156691312789917, "num_input_tokens_seen": 2307916, "step": 2243, "train_runtime": 5406.5203, "train_tokens_per_second": 426.876 }, { "epoch": 0.9590768244470563, "grad_norm": 2.538754463195801, "learning_rate": 1.042566844919786e-05, "loss": 0.11380726844072342, "num_input_tokens_seen": 2308914, "step": 2244, "train_runtime": 5408.6003, "train_tokens_per_second": 426.897 }, { "epoch": 0.9595042205363821, "grad_norm": 3.4854772090911865, "learning_rate": 1.0421390374331553e-05, "loss": 0.15792405605316162, "num_input_tokens_seen": 2309942, "step": 2245, "train_runtime": 5410.7427, "train_tokens_per_second": 426.918 }, { "epoch": 0.9599316166257079, "grad_norm": 3.3573896884918213, "learning_rate": 1.0417112299465243e-05, "loss": 0.1561889946460724, "num_input_tokens_seen": 2311726, "step": 2246, "train_runtime": 5413.0602, "train_tokens_per_second": 427.065 }, { "epoch": 0.9603590127150337, "grad_norm": 2.3635971546173096, "learning_rate": 1.041283422459893e-05, "loss": 0.14996930956840515, "num_input_tokens_seen": 2313058, "step": 2247, "train_runtime": 5415.2033, "train_tokens_per_second": 427.141 }, { "epoch": 0.9607864088043594, "grad_norm": 2.4530446529388428, "learning_rate": 1.040855614973262e-05, "loss": 0.09206946194171906, "num_input_tokens_seen": 2313840, "step": 2248, "train_runtime": 5417.2257, "train_tokens_per_second": 427.126 }, { "epoch": 0.9612138048936852, "grad_norm": 2.651663303375244, "learning_rate": 1.0404278074866313e-05, "loss": 0.08442568778991699, "num_input_tokens_seen": 2314458, "step": 2249, "train_runtime": 5419.2172, "train_tokens_per_second": 427.083 }, { "epoch": 0.961641200983011, "grad_norm": 3.452334403991699, "learning_rate": 1.04e-05, "loss": 0.16761603951454163, "num_input_tokens_seen": 2315338, "step": 2250, "train_runtime": 5421.2615, "train_tokens_per_second": 427.085 }, { "epoch": 0.9620685970723368, "grad_norm": 3.322423219680786, "learning_rate": 1.039572192513369e-05, "loss": 0.09940492361783981, "num_input_tokens_seen": 2316192, "step": 2251, "train_runtime": 5430.1713, "train_tokens_per_second": 426.541 }, { "epoch": 0.9624959931616626, "grad_norm": 4.1046929359436035, "learning_rate": 1.039144385026738e-05, "loss": 0.11258722096681595, "num_input_tokens_seen": 2316778, "step": 2252, "train_runtime": 5432.4252, "train_tokens_per_second": 426.472 }, { "epoch": 0.9629233892509883, "grad_norm": 2.8597140312194824, "learning_rate": 1.0387165775401072e-05, "loss": 0.12939955294132233, "num_input_tokens_seen": 2317742, "step": 2253, "train_runtime": 5434.5044, "train_tokens_per_second": 426.486 }, { "epoch": 0.9633507853403142, "grad_norm": 1.3937209844589233, "learning_rate": 1.038288770053476e-05, "loss": 0.10120612382888794, "num_input_tokens_seen": 2321922, "step": 2254, "train_runtime": 5437.4019, "train_tokens_per_second": 427.028 }, { "epoch": 0.9637781814296399, "grad_norm": 2.872166156768799, "learning_rate": 1.037860962566845e-05, "loss": 0.15230093896389008, "num_input_tokens_seen": 2323026, "step": 2255, "train_runtime": 5439.5505, "train_tokens_per_second": 427.062 }, { "epoch": 0.9642055775189657, "grad_norm": 2.6004855632781982, "learning_rate": 1.0374331550802139e-05, "loss": 0.08310409635305405, "num_input_tokens_seen": 2323952, "step": 2256, "train_runtime": 5441.6664, "train_tokens_per_second": 427.066 }, { "epoch": 0.9646329736082915, "grad_norm": 2.575425386428833, "learning_rate": 1.037005347593583e-05, "loss": 0.1307641565799713, "num_input_tokens_seen": 2324858, "step": 2257, "train_runtime": 5443.784, "train_tokens_per_second": 427.067 }, { "epoch": 0.9650603696976172, "grad_norm": 4.051435470581055, "learning_rate": 1.036577540106952e-05, "loss": 0.2844654619693756, "num_input_tokens_seen": 2325884, "step": 2258, "train_runtime": 5445.9245, "train_tokens_per_second": 427.087 }, { "epoch": 0.9654877657869431, "grad_norm": 3.0446956157684326, "learning_rate": 1.0361497326203209e-05, "loss": 0.22520825266838074, "num_input_tokens_seen": 2326978, "step": 2259, "train_runtime": 5448.0278, "train_tokens_per_second": 427.123 }, { "epoch": 0.9659151618762688, "grad_norm": 2.1535825729370117, "learning_rate": 1.0357219251336898e-05, "loss": 0.14550763368606567, "num_input_tokens_seen": 2328416, "step": 2260, "train_runtime": 5450.2343, "train_tokens_per_second": 427.214 }, { "epoch": 0.9663425579655947, "grad_norm": 1.7815985679626465, "learning_rate": 1.035294117647059e-05, "loss": 0.1046629548072815, "num_input_tokens_seen": 2329686, "step": 2261, "train_runtime": 5452.484, "train_tokens_per_second": 427.271 }, { "epoch": 0.9667699540549204, "grad_norm": 2.6957361698150635, "learning_rate": 1.0348663101604279e-05, "loss": 0.15473268926143646, "num_input_tokens_seen": 2330696, "step": 2262, "train_runtime": 5454.5584, "train_tokens_per_second": 427.293 }, { "epoch": 0.9671973501442461, "grad_norm": 2.146594285964966, "learning_rate": 1.0344385026737968e-05, "loss": 0.12918353080749512, "num_input_tokens_seen": 2332482, "step": 2263, "train_runtime": 5456.8453, "train_tokens_per_second": 427.441 }, { "epoch": 0.967624746233572, "grad_norm": 3.9054689407348633, "learning_rate": 1.0340106951871658e-05, "loss": 0.09738944470882416, "num_input_tokens_seen": 2333176, "step": 2264, "train_runtime": 5458.8675, "train_tokens_per_second": 427.41 }, { "epoch": 0.9680521423228977, "grad_norm": 2.7858171463012695, "learning_rate": 1.0335828877005349e-05, "loss": 0.12292246520519257, "num_input_tokens_seen": 2333958, "step": 2265, "train_runtime": 5460.8811, "train_tokens_per_second": 427.396 }, { "epoch": 0.9684795384122236, "grad_norm": 2.3060765266418457, "learning_rate": 1.0331550802139038e-05, "loss": 0.06947749853134155, "num_input_tokens_seen": 2334746, "step": 2266, "train_runtime": 5462.9097, "train_tokens_per_second": 427.381 }, { "epoch": 0.9689069345015493, "grad_norm": 3.6497702598571777, "learning_rate": 1.0327272727272728e-05, "loss": 0.18004286289215088, "num_input_tokens_seen": 2335400, "step": 2267, "train_runtime": 5464.9113, "train_tokens_per_second": 427.345 }, { "epoch": 0.9693343305908751, "grad_norm": 2.7571423053741455, "learning_rate": 1.0322994652406417e-05, "loss": 0.11387020349502563, "num_input_tokens_seen": 2336252, "step": 2268, "train_runtime": 5466.9622, "train_tokens_per_second": 427.34 }, { "epoch": 0.9697617266802009, "grad_norm": 2.0217416286468506, "learning_rate": 1.0318716577540108e-05, "loss": 0.08127065002918243, "num_input_tokens_seen": 2337326, "step": 2269, "train_runtime": 5469.0231, "train_tokens_per_second": 427.375 }, { "epoch": 0.9701891227695266, "grad_norm": 1.7019882202148438, "learning_rate": 1.0314438502673798e-05, "loss": 0.08605479449033737, "num_input_tokens_seen": 2338610, "step": 2270, "train_runtime": 5471.2288, "train_tokens_per_second": 427.438 }, { "epoch": 0.9706165188588525, "grad_norm": 2.190519094467163, "learning_rate": 1.0310160427807487e-05, "loss": 0.11524763703346252, "num_input_tokens_seen": 2339596, "step": 2271, "train_runtime": 5473.3058, "train_tokens_per_second": 427.456 }, { "epoch": 0.9710439149481782, "grad_norm": 2.6079463958740234, "learning_rate": 1.0305882352941177e-05, "loss": 0.10180608928203583, "num_input_tokens_seen": 2340366, "step": 2272, "train_runtime": 5475.3481, "train_tokens_per_second": 427.437 }, { "epoch": 0.9714713110375041, "grad_norm": 2.7155380249023438, "learning_rate": 1.0301604278074868e-05, "loss": 0.14282962679862976, "num_input_tokens_seen": 2341696, "step": 2273, "train_runtime": 5477.5329, "train_tokens_per_second": 427.509 }, { "epoch": 0.9718987071268298, "grad_norm": 2.5958855152130127, "learning_rate": 1.0297326203208557e-05, "loss": 0.0968252569437027, "num_input_tokens_seen": 2342896, "step": 2274, "train_runtime": 5479.6661, "train_tokens_per_second": 427.562 }, { "epoch": 0.9723261032161555, "grad_norm": 3.645071268081665, "learning_rate": 1.0293048128342247e-05, "loss": 0.18518459796905518, "num_input_tokens_seen": 2343656, "step": 2275, "train_runtime": 5481.7199, "train_tokens_per_second": 427.54 }, { "epoch": 0.9727534993054814, "grad_norm": 3.1911346912384033, "learning_rate": 1.0288770053475936e-05, "loss": 0.09797079861164093, "num_input_tokens_seen": 2344640, "step": 2276, "train_runtime": 5483.7652, "train_tokens_per_second": 427.56 }, { "epoch": 0.9731808953948071, "grad_norm": 3.199688196182251, "learning_rate": 1.0284491978609627e-05, "loss": 0.13134604692459106, "num_input_tokens_seen": 2345396, "step": 2277, "train_runtime": 5485.7867, "train_tokens_per_second": 427.54 }, { "epoch": 0.973608291484133, "grad_norm": 3.5392403602600098, "learning_rate": 1.0280213903743317e-05, "loss": 0.10100971907377243, "num_input_tokens_seen": 2346082, "step": 2278, "train_runtime": 5487.795, "train_tokens_per_second": 427.509 }, { "epoch": 0.9740356875734587, "grad_norm": 2.7689268589019775, "learning_rate": 1.0275935828877006e-05, "loss": 0.10392604768276215, "num_input_tokens_seen": 2347168, "step": 2279, "train_runtime": 5489.876, "train_tokens_per_second": 427.545 }, { "epoch": 0.9744630836627844, "grad_norm": 0.8841018080711365, "learning_rate": 1.0271657754010696e-05, "loss": 0.03436458110809326, "num_input_tokens_seen": 2349502, "step": 2280, "train_runtime": 5492.268, "train_tokens_per_second": 427.784 }, { "epoch": 0.9748904797521103, "grad_norm": 3.811055898666382, "learning_rate": 1.0267379679144387e-05, "loss": 0.23737823963165283, "num_input_tokens_seen": 2350714, "step": 2281, "train_runtime": 5500.9949, "train_tokens_per_second": 427.325 }, { "epoch": 0.975317875841436, "grad_norm": 3.6392815113067627, "learning_rate": 1.0263101604278076e-05, "loss": 0.16858138144016266, "num_input_tokens_seen": 2351552, "step": 2282, "train_runtime": 5503.1836, "train_tokens_per_second": 427.308 }, { "epoch": 0.9757452719307619, "grad_norm": 3.2982568740844727, "learning_rate": 1.0258823529411766e-05, "loss": 0.10996103286743164, "num_input_tokens_seen": 2352132, "step": 2283, "train_runtime": 5505.1415, "train_tokens_per_second": 427.261 }, { "epoch": 0.9761726680200876, "grad_norm": 2.979600429534912, "learning_rate": 1.0254545454545455e-05, "loss": 0.1532599776983261, "num_input_tokens_seen": 2353134, "step": 2284, "train_runtime": 5507.2381, "train_tokens_per_second": 427.28 }, { "epoch": 0.9766000641094134, "grad_norm": 3.2876968383789062, "learning_rate": 1.0250267379679146e-05, "loss": 0.15251268446445465, "num_input_tokens_seen": 2354438, "step": 2285, "train_runtime": 5509.4438, "train_tokens_per_second": 427.346 }, { "epoch": 0.9770274601987392, "grad_norm": 3.4809560775756836, "learning_rate": 1.0245989304812836e-05, "loss": 0.1291067898273468, "num_input_tokens_seen": 2355542, "step": 2286, "train_runtime": 5511.5623, "train_tokens_per_second": 427.382 }, { "epoch": 0.9774548562880649, "grad_norm": 3.3865761756896973, "learning_rate": 1.0241711229946525e-05, "loss": 0.1919110119342804, "num_input_tokens_seen": 2356584, "step": 2287, "train_runtime": 5513.6323, "train_tokens_per_second": 427.41 }, { "epoch": 0.9778822523773908, "grad_norm": 1.9207488298416138, "learning_rate": 1.0237433155080215e-05, "loss": 0.08086986839771271, "num_input_tokens_seen": 2357818, "step": 2288, "train_runtime": 5515.8052, "train_tokens_per_second": 427.466 }, { "epoch": 0.9783096484667165, "grad_norm": 2.593085765838623, "learning_rate": 1.0233155080213906e-05, "loss": 0.1042538434267044, "num_input_tokens_seen": 2358784, "step": 2289, "train_runtime": 5517.8907, "train_tokens_per_second": 427.479 }, { "epoch": 0.9787370445560423, "grad_norm": 3.9618942737579346, "learning_rate": 1.0228877005347595e-05, "loss": 0.15336662530899048, "num_input_tokens_seen": 2359760, "step": 2290, "train_runtime": 5519.9742, "train_tokens_per_second": 427.495 }, { "epoch": 0.9791644406453681, "grad_norm": 2.0823564529418945, "learning_rate": 1.0224598930481285e-05, "loss": 0.12162894755601883, "num_input_tokens_seen": 2361362, "step": 2291, "train_runtime": 5522.2566, "train_tokens_per_second": 427.608 }, { "epoch": 0.9795918367346939, "grad_norm": 2.362786054611206, "learning_rate": 1.0220320855614974e-05, "loss": 0.16087386012077332, "num_input_tokens_seen": 2362814, "step": 2292, "train_runtime": 5524.4503, "train_tokens_per_second": 427.701 }, { "epoch": 0.9800192328240197, "grad_norm": 2.899754285812378, "learning_rate": 1.0216042780748663e-05, "loss": 0.12003335356712341, "num_input_tokens_seen": 2363820, "step": 2293, "train_runtime": 5526.5585, "train_tokens_per_second": 427.72 }, { "epoch": 0.9804466289133454, "grad_norm": 2.4319729804992676, "learning_rate": 1.0211764705882355e-05, "loss": 0.11342653632164001, "num_input_tokens_seen": 2364828, "step": 2294, "train_runtime": 5528.6451, "train_tokens_per_second": 427.741 }, { "epoch": 0.9808740250026712, "grad_norm": 2.9359421730041504, "learning_rate": 1.0207486631016044e-05, "loss": 0.1248394101858139, "num_input_tokens_seen": 2365708, "step": 2295, "train_runtime": 5530.6919, "train_tokens_per_second": 427.742 }, { "epoch": 0.981301421091997, "grad_norm": 3.2101783752441406, "learning_rate": 1.0203208556149734e-05, "loss": 0.16110453009605408, "num_input_tokens_seen": 2367262, "step": 2296, "train_runtime": 5532.9717, "train_tokens_per_second": 427.846 }, { "epoch": 0.9817288171813228, "grad_norm": 2.193382740020752, "learning_rate": 1.0198930481283423e-05, "loss": 0.08950398117303848, "num_input_tokens_seen": 2368474, "step": 2297, "train_runtime": 5535.1533, "train_tokens_per_second": 427.897 }, { "epoch": 0.9821562132706486, "grad_norm": 4.416612148284912, "learning_rate": 1.0194652406417114e-05, "loss": 0.1765228509902954, "num_input_tokens_seen": 2369186, "step": 2298, "train_runtime": 5537.1679, "train_tokens_per_second": 427.87 }, { "epoch": 0.9825836093599744, "grad_norm": 4.482437610626221, "learning_rate": 1.0190374331550804e-05, "loss": 0.1840195655822754, "num_input_tokens_seen": 2369774, "step": 2299, "train_runtime": 5539.1493, "train_tokens_per_second": 427.823 }, { "epoch": 0.9830110054493001, "grad_norm": 2.900217056274414, "learning_rate": 1.0186096256684493e-05, "loss": 0.1668633222579956, "num_input_tokens_seen": 2370796, "step": 2300, "train_runtime": 5541.2375, "train_tokens_per_second": 427.846 }, { "epoch": 0.9834384015386259, "grad_norm": 2.4736578464508057, "learning_rate": 1.0181818181818182e-05, "loss": 0.09531894326210022, "num_input_tokens_seen": 2371418, "step": 2301, "train_runtime": 5543.2438, "train_tokens_per_second": 427.803 }, { "epoch": 0.9838657976279517, "grad_norm": 2.863168954849243, "learning_rate": 1.0177540106951874e-05, "loss": 0.14712025225162506, "num_input_tokens_seen": 2372554, "step": 2302, "train_runtime": 5545.4163, "train_tokens_per_second": 427.841 }, { "epoch": 0.9842931937172775, "grad_norm": 2.756906747817993, "learning_rate": 1.0173262032085563e-05, "loss": 0.08874457329511642, "num_input_tokens_seen": 2373208, "step": 2303, "train_runtime": 5547.4066, "train_tokens_per_second": 427.805 }, { "epoch": 0.9847205898066033, "grad_norm": 2.8874385356903076, "learning_rate": 1.0168983957219252e-05, "loss": 0.17877505719661713, "num_input_tokens_seen": 2374430, "step": 2304, "train_runtime": 5549.5587, "train_tokens_per_second": 427.859 }, { "epoch": 0.985147985895929, "grad_norm": 2.769883632659912, "learning_rate": 1.016470588235294e-05, "loss": 0.08705952763557434, "num_input_tokens_seen": 2375258, "step": 2305, "train_runtime": 5551.6048, "train_tokens_per_second": 427.851 }, { "epoch": 0.9855753819852549, "grad_norm": 3.491914987564087, "learning_rate": 1.0160427807486633e-05, "loss": 0.17664125561714172, "num_input_tokens_seen": 2376102, "step": 2306, "train_runtime": 5553.6291, "train_tokens_per_second": 427.847 }, { "epoch": 0.9860027780745806, "grad_norm": 3.1204919815063477, "learning_rate": 1.0156149732620322e-05, "loss": 0.10803135484457016, "num_input_tokens_seen": 2376956, "step": 2307, "train_runtime": 5555.7173, "train_tokens_per_second": 427.84 }, { "epoch": 0.9864301741639064, "grad_norm": 1.9673091173171997, "learning_rate": 1.015187165775401e-05, "loss": 0.13556765019893646, "num_input_tokens_seen": 2378598, "step": 2308, "train_runtime": 5557.9534, "train_tokens_per_second": 427.963 }, { "epoch": 0.9868575702532322, "grad_norm": 1.5314304828643799, "learning_rate": 1.01475935828877e-05, "loss": 0.06075898930430412, "num_input_tokens_seen": 2380048, "step": 2309, "train_runtime": 5560.1551, "train_tokens_per_second": 428.054 }, { "epoch": 0.9872849663425579, "grad_norm": 3.44759202003479, "learning_rate": 1.0143315508021393e-05, "loss": 0.1153748631477356, "num_input_tokens_seen": 2380694, "step": 2310, "train_runtime": 5562.1571, "train_tokens_per_second": 428.016 }, { "epoch": 0.9877123624318838, "grad_norm": 2.410386323928833, "learning_rate": 1.0139037433155082e-05, "loss": 0.12743216753005981, "num_input_tokens_seen": 2381864, "step": 2311, "train_runtime": 5571.2401, "train_tokens_per_second": 427.529 }, { "epoch": 0.9881397585212095, "grad_norm": 2.447937488555908, "learning_rate": 1.013475935828877e-05, "loss": 0.11452856659889221, "num_input_tokens_seen": 2382784, "step": 2312, "train_runtime": 5573.2989, "train_tokens_per_second": 427.536 }, { "epoch": 0.9885671546105353, "grad_norm": 3.982205867767334, "learning_rate": 1.013048128342246e-05, "loss": 0.2600610554218292, "num_input_tokens_seen": 2383892, "step": 2313, "train_runtime": 5575.3681, "train_tokens_per_second": 427.576 }, { "epoch": 0.9889945506998611, "grad_norm": 3.205493927001953, "learning_rate": 1.0126203208556152e-05, "loss": 0.14277592301368713, "num_input_tokens_seen": 2384586, "step": 2314, "train_runtime": 5577.4022, "train_tokens_per_second": 427.544 }, { "epoch": 0.9894219467891868, "grad_norm": 3.331968069076538, "learning_rate": 1.012192513368984e-05, "loss": 0.15675318241119385, "num_input_tokens_seen": 2385480, "step": 2315, "train_runtime": 5579.4646, "train_tokens_per_second": 427.546 }, { "epoch": 0.9898493428785127, "grad_norm": 3.521432638168335, "learning_rate": 1.011764705882353e-05, "loss": 0.17289461195468903, "num_input_tokens_seen": 2386470, "step": 2316, "train_runtime": 5581.54, "train_tokens_per_second": 427.565 }, { "epoch": 0.9902767389678384, "grad_norm": 2.799103021621704, "learning_rate": 1.0113368983957219e-05, "loss": 0.13407383859157562, "num_input_tokens_seen": 2387406, "step": 2317, "train_runtime": 5583.6535, "train_tokens_per_second": 427.571 }, { "epoch": 0.9907041350571643, "grad_norm": 2.995525598526001, "learning_rate": 1.010909090909091e-05, "loss": 0.17694485187530518, "num_input_tokens_seen": 2388554, "step": 2318, "train_runtime": 5585.769, "train_tokens_per_second": 427.614 }, { "epoch": 0.99113153114649, "grad_norm": 2.79598069190979, "learning_rate": 1.01048128342246e-05, "loss": 0.178671196103096, "num_input_tokens_seen": 2389436, "step": 2319, "train_runtime": 5587.8149, "train_tokens_per_second": 427.615 }, { "epoch": 0.9915589272358158, "grad_norm": 2.9074149131774902, "learning_rate": 1.0100534759358289e-05, "loss": 0.12709584832191467, "num_input_tokens_seen": 2390262, "step": 2320, "train_runtime": 5589.8508, "train_tokens_per_second": 427.607 }, { "epoch": 0.9919863233251416, "grad_norm": 2.007220983505249, "learning_rate": 1.0096256684491978e-05, "loss": 0.11949099600315094, "num_input_tokens_seen": 2391706, "step": 2321, "train_runtime": 5592.0403, "train_tokens_per_second": 427.698 }, { "epoch": 0.9924137194144673, "grad_norm": 3.6360058784484863, "learning_rate": 1.009197860962567e-05, "loss": 0.20659798383712769, "num_input_tokens_seen": 2392578, "step": 2322, "train_runtime": 5594.2029, "train_tokens_per_second": 427.689 }, { "epoch": 0.9928411155037932, "grad_norm": 2.549527406692505, "learning_rate": 1.0087700534759359e-05, "loss": 0.12216900289058685, "num_input_tokens_seen": 2393696, "step": 2323, "train_runtime": 5596.3349, "train_tokens_per_second": 427.726 }, { "epoch": 0.9932685115931189, "grad_norm": 3.211176633834839, "learning_rate": 1.0083422459893048e-05, "loss": 0.1540602445602417, "num_input_tokens_seen": 2394578, "step": 2324, "train_runtime": 5598.3838, "train_tokens_per_second": 427.727 }, { "epoch": 0.9936959076824448, "grad_norm": 3.5962655544281006, "learning_rate": 1.0079144385026738e-05, "loss": 0.16790716350078583, "num_input_tokens_seen": 2395308, "step": 2325, "train_runtime": 5600.4532, "train_tokens_per_second": 427.699 }, { "epoch": 0.9941233037717705, "grad_norm": 1.883987545967102, "learning_rate": 1.0074866310160429e-05, "loss": 0.08721403777599335, "num_input_tokens_seen": 2396636, "step": 2326, "train_runtime": 5602.6203, "train_tokens_per_second": 427.771 }, { "epoch": 0.9945506998610962, "grad_norm": 3.5228617191314697, "learning_rate": 1.0070588235294118e-05, "loss": 0.1339649111032486, "num_input_tokens_seen": 2397360, "step": 2327, "train_runtime": 5604.5983, "train_tokens_per_second": 427.749 }, { "epoch": 0.9949780959504221, "grad_norm": 2.3463289737701416, "learning_rate": 1.0066310160427808e-05, "loss": 0.13015425205230713, "num_input_tokens_seen": 2398838, "step": 2328, "train_runtime": 5606.764, "train_tokens_per_second": 427.847 }, { "epoch": 0.9954054920397478, "grad_norm": 3.0615673065185547, "learning_rate": 1.0062032085561497e-05, "loss": 0.1618393212556839, "num_input_tokens_seen": 2399932, "step": 2329, "train_runtime": 5608.9576, "train_tokens_per_second": 427.875 }, { "epoch": 0.9958328881290737, "grad_norm": 3.1222710609436035, "learning_rate": 1.0057754010695188e-05, "loss": 0.12976691126823425, "num_input_tokens_seen": 2400660, "step": 2330, "train_runtime": 5611.0058, "train_tokens_per_second": 427.848 }, { "epoch": 0.9962602842183994, "grad_norm": 2.752530813217163, "learning_rate": 1.0053475935828878e-05, "loss": 0.11259917914867401, "num_input_tokens_seen": 2401812, "step": 2331, "train_runtime": 5613.1447, "train_tokens_per_second": 427.891 }, { "epoch": 0.9966876803077251, "grad_norm": 1.9524004459381104, "learning_rate": 1.0049197860962567e-05, "loss": 0.05901399254798889, "num_input_tokens_seen": 2402658, "step": 2332, "train_runtime": 5615.1875, "train_tokens_per_second": 427.886 }, { "epoch": 0.997115076397051, "grad_norm": 2.7556662559509277, "learning_rate": 1.0044919786096257e-05, "loss": 0.11250441521406174, "num_input_tokens_seen": 2403482, "step": 2333, "train_runtime": 5617.2401, "train_tokens_per_second": 427.876 }, { "epoch": 0.9975424724863767, "grad_norm": 2.751969575881958, "learning_rate": 1.0040641711229948e-05, "loss": 0.07619868963956833, "num_input_tokens_seen": 2404478, "step": 2334, "train_runtime": 5619.2862, "train_tokens_per_second": 427.897 }, { "epoch": 0.9979698685757026, "grad_norm": 3.0440139770507812, "learning_rate": 1.0036363636363637e-05, "loss": 0.16193558275699615, "num_input_tokens_seen": 2405476, "step": 2335, "train_runtime": 5621.3662, "train_tokens_per_second": 427.917 }, { "epoch": 0.9983972646650283, "grad_norm": 2.1244683265686035, "learning_rate": 1.0032085561497327e-05, "loss": 0.07868650555610657, "num_input_tokens_seen": 2406682, "step": 2336, "train_runtime": 5623.5257, "train_tokens_per_second": 427.967 }, { "epoch": 0.998824660754354, "grad_norm": 3.3333520889282227, "learning_rate": 1.0027807486631016e-05, "loss": 0.12665465474128723, "num_input_tokens_seen": 2407814, "step": 2337, "train_runtime": 5625.6818, "train_tokens_per_second": 428.004 }, { "epoch": 0.9992520568436799, "grad_norm": 2.7739481925964355, "learning_rate": 1.0023529411764707e-05, "loss": 0.08598623424768448, "num_input_tokens_seen": 2408526, "step": 2338, "train_runtime": 5627.7474, "train_tokens_per_second": 427.973 }, { "epoch": 0.9996794529330056, "grad_norm": 2.04556941986084, "learning_rate": 1.0019251336898397e-05, "loss": 0.12641248106956482, "num_input_tokens_seen": 2409924, "step": 2339, "train_runtime": 5630.0213, "train_tokens_per_second": 428.049 }, { "epoch": 1.0, "grad_norm": 3.795429229736328, "learning_rate": 1.0014973262032086e-05, "loss": 0.1748589426279068, "num_input_tokens_seen": 2410678, "step": 2340, "train_runtime": 5631.6409, "train_tokens_per_second": 428.06 }, { "epoch": 1.0, "eval_loss": 0.5088925957679749, "eval_runtime": 58.6107, "eval_samples_per_second": 17.028, "eval_steps_per_second": 8.514, "num_input_tokens_seen": 2410678, "step": 2340 }, { "epoch": 1.0004273960893257, "grad_norm": 2.1877224445343018, "learning_rate": 1.0010695187165776e-05, "loss": 0.11428679525852203, "num_input_tokens_seen": 2411554, "step": 2341, "train_runtime": 5698.88, "train_tokens_per_second": 423.163 }, { "epoch": 1.0008547921786515, "grad_norm": 2.252779722213745, "learning_rate": 1.0006417112299467e-05, "loss": 0.08792650699615479, "num_input_tokens_seen": 2412244, "step": 2342, "train_runtime": 5700.8869, "train_tokens_per_second": 423.135 }, { "epoch": 1.0012821882679774, "grad_norm": 2.2379162311553955, "learning_rate": 1.0002139037433156e-05, "loss": 0.07997279614210129, "num_input_tokens_seen": 2412912, "step": 2343, "train_runtime": 5703.0527, "train_tokens_per_second": 423.091 }, { "epoch": 1.0017095843573032, "grad_norm": 1.4324240684509277, "learning_rate": 9.997860962566846e-06, "loss": 0.052942901849746704, "num_input_tokens_seen": 2414128, "step": 2344, "train_runtime": 5705.216, "train_tokens_per_second": 423.144 }, { "epoch": 1.002136980446629, "grad_norm": 2.3981478214263916, "learning_rate": 9.993582887700537e-06, "loss": 0.10901179909706116, "num_input_tokens_seen": 2414992, "step": 2345, "train_runtime": 5707.3644, "train_tokens_per_second": 423.136 }, { "epoch": 1.0025643765359546, "grad_norm": 1.996822714805603, "learning_rate": 9.989304812834224e-06, "loss": 0.07881154119968414, "num_input_tokens_seen": 2415892, "step": 2346, "train_runtime": 5709.4381, "train_tokens_per_second": 423.14 }, { "epoch": 1.0029917726252804, "grad_norm": 3.199432373046875, "learning_rate": 9.985026737967916e-06, "loss": 0.11375774443149567, "num_input_tokens_seen": 2416648, "step": 2347, "train_runtime": 5711.4828, "train_tokens_per_second": 423.121 }, { "epoch": 1.0034191687146063, "grad_norm": 2.537538528442383, "learning_rate": 9.980748663101605e-06, "loss": 0.09518872201442719, "num_input_tokens_seen": 2417946, "step": 2348, "train_runtime": 5713.6377, "train_tokens_per_second": 423.189 }, { "epoch": 1.003846564803932, "grad_norm": 2.334536075592041, "learning_rate": 9.976470588235294e-06, "loss": 0.11627691984176636, "num_input_tokens_seen": 2418850, "step": 2349, "train_runtime": 5715.7312, "train_tokens_per_second": 423.192 }, { "epoch": 1.0042739608932578, "grad_norm": 1.5330848693847656, "learning_rate": 9.972192513368984e-06, "loss": 0.06604886054992676, "num_input_tokens_seen": 2420322, "step": 2350, "train_runtime": 5717.9435, "train_tokens_per_second": 423.285 }, { "epoch": 1.0047013569825836, "grad_norm": 2.3374691009521484, "learning_rate": 9.967914438502675e-06, "loss": 0.09379670768976212, "num_input_tokens_seen": 2421218, "step": 2351, "train_runtime": 5719.9863, "train_tokens_per_second": 423.291 }, { "epoch": 1.0051287530719093, "grad_norm": 1.9925848245620728, "learning_rate": 9.963636363636364e-06, "loss": 0.05323585867881775, "num_input_tokens_seen": 2422046, "step": 2352, "train_runtime": 5722.0163, "train_tokens_per_second": 423.285 }, { "epoch": 1.0055561491612353, "grad_norm": 2.109513759613037, "learning_rate": 9.959358288770054e-06, "loss": 0.08169494569301605, "num_input_tokens_seen": 2422850, "step": 2353, "train_runtime": 5724.0233, "train_tokens_per_second": 423.277 }, { "epoch": 1.005983545250561, "grad_norm": 2.082674026489258, "learning_rate": 9.955080213903743e-06, "loss": 0.09728004783391953, "num_input_tokens_seen": 2424202, "step": 2354, "train_runtime": 5726.2123, "train_tokens_per_second": 423.352 }, { "epoch": 1.0064109413398867, "grad_norm": 2.515268325805664, "learning_rate": 9.950802139037435e-06, "loss": 0.14416220784187317, "num_input_tokens_seen": 2425838, "step": 2355, "train_runtime": 5728.4172, "train_tokens_per_second": 423.474 }, { "epoch": 1.0068383374292125, "grad_norm": 1.7195887565612793, "learning_rate": 9.946524064171124e-06, "loss": 0.06306891143321991, "num_input_tokens_seen": 2427190, "step": 2356, "train_runtime": 5730.5851, "train_tokens_per_second": 423.55 }, { "epoch": 1.0072657335185382, "grad_norm": 2.108156681060791, "learning_rate": 9.942245989304813e-06, "loss": 0.06050962209701538, "num_input_tokens_seen": 2428018, "step": 2357, "train_runtime": 5732.5968, "train_tokens_per_second": 423.546 }, { "epoch": 1.0076931296078642, "grad_norm": 2.2040021419525146, "learning_rate": 9.937967914438503e-06, "loss": 0.07632505148649216, "num_input_tokens_seen": 2428934, "step": 2358, "train_runtime": 5734.6776, "train_tokens_per_second": 423.552 }, { "epoch": 1.00812052569719, "grad_norm": 2.3135409355163574, "learning_rate": 9.933689839572194e-06, "loss": 0.10747627913951874, "num_input_tokens_seen": 2430044, "step": 2359, "train_runtime": 5736.7963, "train_tokens_per_second": 423.589 }, { "epoch": 1.0085479217865156, "grad_norm": 1.6670664548873901, "learning_rate": 9.929411764705883e-06, "loss": 0.061402734369039536, "num_input_tokens_seen": 2431436, "step": 2360, "train_runtime": 5738.9901, "train_tokens_per_second": 423.67 }, { "epoch": 1.0089753178758414, "grad_norm": 4.037785053253174, "learning_rate": 9.925133689839573e-06, "loss": 0.09310992062091827, "num_input_tokens_seen": 2432314, "step": 2361, "train_runtime": 5741.0622, "train_tokens_per_second": 423.67 }, { "epoch": 1.0094027139651671, "grad_norm": 2.36489200592041, "learning_rate": 9.920855614973262e-06, "loss": 0.07615480571985245, "num_input_tokens_seen": 2433344, "step": 2362, "train_runtime": 5743.1475, "train_tokens_per_second": 423.695 }, { "epoch": 1.009830110054493, "grad_norm": 2.688366413116455, "learning_rate": 9.916577540106953e-06, "loss": 0.08781511336565018, "num_input_tokens_seen": 2433966, "step": 2363, "train_runtime": 5745.1266, "train_tokens_per_second": 423.658 }, { "epoch": 1.0102575061438188, "grad_norm": 3.5392396450042725, "learning_rate": 9.912299465240643e-06, "loss": 0.13966228067874908, "num_input_tokens_seen": 2434700, "step": 2364, "train_runtime": 5747.1283, "train_tokens_per_second": 423.638 }, { "epoch": 1.0106849022331446, "grad_norm": 2.560177803039551, "learning_rate": 9.908021390374332e-06, "loss": 0.10608979314565659, "num_input_tokens_seen": 2435642, "step": 2365, "train_runtime": 5749.1867, "train_tokens_per_second": 423.65 }, { "epoch": 1.0111122983224703, "grad_norm": 3.171119213104248, "learning_rate": 9.903743315508022e-06, "loss": 0.1690225601196289, "num_input_tokens_seen": 2436440, "step": 2366, "train_runtime": 5751.2266, "train_tokens_per_second": 423.638 }, { "epoch": 1.011539694411796, "grad_norm": 1.8448641300201416, "learning_rate": 9.899465240641713e-06, "loss": 0.07290095090866089, "num_input_tokens_seen": 2438008, "step": 2367, "train_runtime": 5753.4694, "train_tokens_per_second": 423.746 }, { "epoch": 1.011967090501122, "grad_norm": 2.8242595195770264, "learning_rate": 9.895187165775402e-06, "loss": 0.08168548345565796, "num_input_tokens_seen": 2439072, "step": 2368, "train_runtime": 5755.5855, "train_tokens_per_second": 423.775 }, { "epoch": 1.0123944865904477, "grad_norm": 3.596143960952759, "learning_rate": 9.890909090909092e-06, "loss": 0.09376522898674011, "num_input_tokens_seen": 2439756, "step": 2369, "train_runtime": 5757.6088, "train_tokens_per_second": 423.745 }, { "epoch": 1.0128218826797735, "grad_norm": 2.2868266105651855, "learning_rate": 9.886631016042781e-06, "loss": 0.07253953069448471, "num_input_tokens_seen": 2440878, "step": 2370, "train_runtime": 5759.7145, "train_tokens_per_second": 423.785 }, { "epoch": 1.0132492787690992, "grad_norm": 2.50429368019104, "learning_rate": 9.882352941176472e-06, "loss": 0.09240512549877167, "num_input_tokens_seen": 2441626, "step": 2371, "train_runtime": 5768.1651, "train_tokens_per_second": 423.293 }, { "epoch": 1.013676674858425, "grad_norm": 2.1327872276306152, "learning_rate": 9.878074866310162e-06, "loss": 0.0722540020942688, "num_input_tokens_seen": 2442828, "step": 2372, "train_runtime": 5770.2456, "train_tokens_per_second": 423.349 }, { "epoch": 1.014104070947751, "grad_norm": 5.153519630432129, "learning_rate": 9.873796791443851e-06, "loss": 0.10753324627876282, "num_input_tokens_seen": 2443432, "step": 2373, "train_runtime": 5772.232, "train_tokens_per_second": 423.308 }, { "epoch": 1.0145314670370766, "grad_norm": 2.1998326778411865, "learning_rate": 9.86951871657754e-06, "loss": 0.0521269217133522, "num_input_tokens_seen": 2444114, "step": 2374, "train_runtime": 5774.2551, "train_tokens_per_second": 423.278 }, { "epoch": 1.0149588631264024, "grad_norm": 3.409623384475708, "learning_rate": 9.865240641711232e-06, "loss": 0.09624180942773819, "num_input_tokens_seen": 2444886, "step": 2375, "train_runtime": 5776.3564, "train_tokens_per_second": 423.257 }, { "epoch": 1.0153862592157281, "grad_norm": 1.9307880401611328, "learning_rate": 9.86096256684492e-06, "loss": 0.07020677626132965, "num_input_tokens_seen": 2445884, "step": 2376, "train_runtime": 5778.4406, "train_tokens_per_second": 423.278 }, { "epoch": 1.0158136553050539, "grad_norm": 3.074058771133423, "learning_rate": 9.85668449197861e-06, "loss": 0.08908405900001526, "num_input_tokens_seen": 2446610, "step": 2377, "train_runtime": 5780.4578, "train_tokens_per_second": 423.255 }, { "epoch": 1.0162410513943798, "grad_norm": 2.320885181427002, "learning_rate": 9.8524064171123e-06, "loss": 0.062562495470047, "num_input_tokens_seen": 2447354, "step": 2378, "train_runtime": 5782.5004, "train_tokens_per_second": 423.235 }, { "epoch": 1.0166684474837056, "grad_norm": 1.7606289386749268, "learning_rate": 9.848128342245991e-06, "loss": 0.06884843111038208, "num_input_tokens_seen": 2448558, "step": 2379, "train_runtime": 5784.6251, "train_tokens_per_second": 423.287 }, { "epoch": 1.0170958435730313, "grad_norm": 2.665041446685791, "learning_rate": 9.843850267379679e-06, "loss": 0.08236092329025269, "num_input_tokens_seen": 2449682, "step": 2380, "train_runtime": 5786.7874, "train_tokens_per_second": 423.323 }, { "epoch": 1.017523239662357, "grad_norm": 2.5332484245300293, "learning_rate": 9.83957219251337e-06, "loss": 0.15148237347602844, "num_input_tokens_seen": 2450798, "step": 2381, "train_runtime": 5788.8815, "train_tokens_per_second": 423.363 }, { "epoch": 1.0179506357516828, "grad_norm": 2.1304662227630615, "learning_rate": 9.83529411764706e-06, "loss": 0.058790091425180435, "num_input_tokens_seen": 2452052, "step": 2382, "train_runtime": 5790.9899, "train_tokens_per_second": 423.425 }, { "epoch": 1.0183780318410087, "grad_norm": 2.6087403297424316, "learning_rate": 9.83101604278075e-06, "loss": 0.11724931001663208, "num_input_tokens_seen": 2452918, "step": 2383, "train_runtime": 5793.1437, "train_tokens_per_second": 423.417 }, { "epoch": 1.0188054279303345, "grad_norm": 2.31596302986145, "learning_rate": 9.826737967914439e-06, "loss": 0.0885908454656601, "num_input_tokens_seen": 2453968, "step": 2384, "train_runtime": 5795.2763, "train_tokens_per_second": 423.443 }, { "epoch": 1.0192328240196602, "grad_norm": 2.6740293502807617, "learning_rate": 9.82245989304813e-06, "loss": 0.10855322331190109, "num_input_tokens_seen": 2455208, "step": 2385, "train_runtime": 5797.4427, "train_tokens_per_second": 423.498 }, { "epoch": 1.019660220108986, "grad_norm": 2.1240456104278564, "learning_rate": 9.81818181818182e-06, "loss": 0.10678456723690033, "num_input_tokens_seen": 2456240, "step": 2386, "train_runtime": 5799.5525, "train_tokens_per_second": 423.522 }, { "epoch": 1.0200876161983117, "grad_norm": 1.8659801483154297, "learning_rate": 9.813903743315509e-06, "loss": 0.06166736036539078, "num_input_tokens_seen": 2457874, "step": 2387, "train_runtime": 5801.7903, "train_tokens_per_second": 423.641 }, { "epoch": 1.0205150122876376, "grad_norm": 3.5077083110809326, "learning_rate": 9.809625668449198e-06, "loss": 0.11333203315734863, "num_input_tokens_seen": 2458576, "step": 2388, "train_runtime": 5803.8339, "train_tokens_per_second": 423.612 }, { "epoch": 1.0209424083769634, "grad_norm": 2.2801342010498047, "learning_rate": 9.80534759358289e-06, "loss": 0.09696577489376068, "num_input_tokens_seen": 2460134, "step": 2389, "train_runtime": 5806.0416, "train_tokens_per_second": 423.72 }, { "epoch": 1.021369804466289, "grad_norm": 1.9509514570236206, "learning_rate": 9.801069518716579e-06, "loss": 0.05764611065387726, "num_input_tokens_seen": 2461020, "step": 2390, "train_runtime": 5808.0591, "train_tokens_per_second": 423.725 }, { "epoch": 1.0217972005556148, "grad_norm": 2.473060131072998, "learning_rate": 9.796791443850268e-06, "loss": 0.09615634381771088, "num_input_tokens_seen": 2461950, "step": 2391, "train_runtime": 5810.0817, "train_tokens_per_second": 423.738 }, { "epoch": 1.0222245966449406, "grad_norm": 2.5004258155822754, "learning_rate": 9.792513368983958e-06, "loss": 0.07503095269203186, "num_input_tokens_seen": 2462652, "step": 2392, "train_runtime": 5812.1233, "train_tokens_per_second": 423.71 }, { "epoch": 1.0226519927342665, "grad_norm": 2.369931936264038, "learning_rate": 9.788235294117649e-06, "loss": 0.09896805137395859, "num_input_tokens_seen": 2463670, "step": 2393, "train_runtime": 5814.2217, "train_tokens_per_second": 423.732 }, { "epoch": 1.0230793888235923, "grad_norm": 2.575596809387207, "learning_rate": 9.783957219251338e-06, "loss": 0.06674186140298843, "num_input_tokens_seen": 2464664, "step": 2394, "train_runtime": 5816.3233, "train_tokens_per_second": 423.749 }, { "epoch": 1.023506784912918, "grad_norm": 2.3105413913726807, "learning_rate": 9.779679144385028e-06, "loss": 0.10718658566474915, "num_input_tokens_seen": 2465854, "step": 2395, "train_runtime": 5818.5034, "train_tokens_per_second": 423.795 }, { "epoch": 1.0239341810022438, "grad_norm": 3.1299490928649902, "learning_rate": 9.775401069518717e-06, "loss": 0.13996629416942596, "num_input_tokens_seen": 2466900, "step": 2396, "train_runtime": 5820.6144, "train_tokens_per_second": 423.821 }, { "epoch": 1.0243615770915697, "grad_norm": 2.248750686645508, "learning_rate": 9.771122994652408e-06, "loss": 0.08786091953516006, "num_input_tokens_seen": 2467850, "step": 2397, "train_runtime": 5822.7239, "train_tokens_per_second": 423.831 }, { "epoch": 1.0247889731808955, "grad_norm": 1.6931318044662476, "learning_rate": 9.766844919786098e-06, "loss": 0.05408065766096115, "num_input_tokens_seen": 2469824, "step": 2398, "train_runtime": 5825.0862, "train_tokens_per_second": 423.998 }, { "epoch": 1.0252163692702212, "grad_norm": 2.5773775577545166, "learning_rate": 9.762566844919787e-06, "loss": 0.08918404579162598, "num_input_tokens_seen": 2470964, "step": 2399, "train_runtime": 5827.2095, "train_tokens_per_second": 424.039 }, { "epoch": 1.025643765359547, "grad_norm": 2.606586456298828, "learning_rate": 9.758288770053477e-06, "loss": 0.06853730231523514, "num_input_tokens_seen": 2471930, "step": 2400, "train_runtime": 5829.2953, "train_tokens_per_second": 424.053 }, { "epoch": 1.0260711614488727, "grad_norm": 3.5813770294189453, "learning_rate": 9.754010695187166e-06, "loss": 0.1254851520061493, "num_input_tokens_seen": 2472672, "step": 2401, "train_runtime": 5837.9546, "train_tokens_per_second": 423.551 }, { "epoch": 1.0264985575381986, "grad_norm": 2.3840043544769287, "learning_rate": 9.749732620320857e-06, "loss": 0.08803518116474152, "num_input_tokens_seen": 2473766, "step": 2402, "train_runtime": 5840.1267, "train_tokens_per_second": 423.581 }, { "epoch": 1.0269259536275244, "grad_norm": 3.179842472076416, "learning_rate": 9.745454545454547e-06, "loss": 0.088936448097229, "num_input_tokens_seen": 2474594, "step": 2403, "train_runtime": 5842.3443, "train_tokens_per_second": 423.562 }, { "epoch": 1.02735334971685, "grad_norm": 2.0070273876190186, "learning_rate": 9.741176470588236e-06, "loss": 0.08375103771686554, "num_input_tokens_seen": 2475734, "step": 2404, "train_runtime": 5844.4822, "train_tokens_per_second": 423.602 }, { "epoch": 1.0277807458061758, "grad_norm": 2.1431782245635986, "learning_rate": 9.736898395721925e-06, "loss": 0.08421497046947479, "num_input_tokens_seen": 2476656, "step": 2405, "train_runtime": 5846.5521, "train_tokens_per_second": 423.61 }, { "epoch": 1.0282081418955016, "grad_norm": 1.6754003763198853, "learning_rate": 9.732620320855617e-06, "loss": 0.05906269699335098, "num_input_tokens_seen": 2477932, "step": 2406, "train_runtime": 5848.7585, "train_tokens_per_second": 423.668 }, { "epoch": 1.0286355379848275, "grad_norm": 3.263932466506958, "learning_rate": 9.728342245989304e-06, "loss": 0.10111347585916519, "num_input_tokens_seen": 2478918, "step": 2407, "train_runtime": 5850.8848, "train_tokens_per_second": 423.683 }, { "epoch": 1.0290629340741533, "grad_norm": 1.8592978715896606, "learning_rate": 9.724064171122995e-06, "loss": 0.06808263808488846, "num_input_tokens_seen": 2480044, "step": 2408, "train_runtime": 5853.0546, "train_tokens_per_second": 423.718 }, { "epoch": 1.029490330163479, "grad_norm": 2.580446481704712, "learning_rate": 9.719786096256685e-06, "loss": 0.08375926315784454, "num_input_tokens_seen": 2480716, "step": 2409, "train_runtime": 5855.0791, "train_tokens_per_second": 423.686 }, { "epoch": 1.0299177262528048, "grad_norm": 1.9191920757293701, "learning_rate": 9.715508021390374e-06, "loss": 0.08534429222345352, "num_input_tokens_seen": 2481940, "step": 2410, "train_runtime": 5857.2097, "train_tokens_per_second": 423.741 }, { "epoch": 1.0303451223421305, "grad_norm": 2.676165819168091, "learning_rate": 9.711229946524064e-06, "loss": 0.10068483650684357, "num_input_tokens_seen": 2482946, "step": 2411, "train_runtime": 5859.3242, "train_tokens_per_second": 423.76 }, { "epoch": 1.0307725184314565, "grad_norm": 2.6462061405181885, "learning_rate": 9.706951871657755e-06, "loss": 0.06492633372545242, "num_input_tokens_seen": 2483664, "step": 2412, "train_runtime": 5861.3688, "train_tokens_per_second": 423.734 }, { "epoch": 1.0311999145207822, "grad_norm": 2.6537258625030518, "learning_rate": 9.702673796791444e-06, "loss": 0.12299549579620361, "num_input_tokens_seen": 2484784, "step": 2413, "train_runtime": 5863.5452, "train_tokens_per_second": 423.768 }, { "epoch": 1.031627310610108, "grad_norm": 2.679187297821045, "learning_rate": 9.698395721925134e-06, "loss": 0.10967110842466354, "num_input_tokens_seen": 2485826, "step": 2414, "train_runtime": 5865.6388, "train_tokens_per_second": 423.795 }, { "epoch": 1.0320547066994337, "grad_norm": 2.666874408721924, "learning_rate": 9.694117647058823e-06, "loss": 0.07112434506416321, "num_input_tokens_seen": 2486594, "step": 2415, "train_runtime": 5867.6634, "train_tokens_per_second": 423.779 }, { "epoch": 1.0324821027887594, "grad_norm": 2.3183915615081787, "learning_rate": 9.689839572192514e-06, "loss": 0.10955458134412766, "num_input_tokens_seen": 2487680, "step": 2416, "train_runtime": 5869.7816, "train_tokens_per_second": 423.811 }, { "epoch": 1.0329094988780854, "grad_norm": 3.4333391189575195, "learning_rate": 9.685561497326204e-06, "loss": 0.12376445531845093, "num_input_tokens_seen": 2488640, "step": 2417, "train_runtime": 5871.8615, "train_tokens_per_second": 423.825 }, { "epoch": 1.033336894967411, "grad_norm": 2.136274814605713, "learning_rate": 9.681283422459893e-06, "loss": 0.07355600595474243, "num_input_tokens_seen": 2489554, "step": 2418, "train_runtime": 5873.8866, "train_tokens_per_second": 423.834 }, { "epoch": 1.0337642910567368, "grad_norm": 2.222489833831787, "learning_rate": 9.677005347593583e-06, "loss": 0.056361593306064606, "num_input_tokens_seen": 2490240, "step": 2419, "train_runtime": 5875.8747, "train_tokens_per_second": 423.808 }, { "epoch": 1.0341916871460626, "grad_norm": 2.6595888137817383, "learning_rate": 9.672727272727274e-06, "loss": 0.09777716547250748, "num_input_tokens_seen": 2491280, "step": 2420, "train_runtime": 5877.942, "train_tokens_per_second": 423.835 }, { "epoch": 1.0346190832353883, "grad_norm": 1.7243646383285522, "learning_rate": 9.668449197860963e-06, "loss": 0.06710144877433777, "num_input_tokens_seen": 2492480, "step": 2421, "train_runtime": 5880.0711, "train_tokens_per_second": 423.886 }, { "epoch": 1.0350464793247143, "grad_norm": 3.274920701980591, "learning_rate": 9.664171122994653e-06, "loss": 0.08725401759147644, "num_input_tokens_seen": 2493698, "step": 2422, "train_runtime": 5882.1957, "train_tokens_per_second": 423.94 }, { "epoch": 1.03547387541404, "grad_norm": 2.6410112380981445, "learning_rate": 9.659893048128342e-06, "loss": 0.11823771893978119, "num_input_tokens_seen": 2494918, "step": 2423, "train_runtime": 5884.3442, "train_tokens_per_second": 423.993 }, { "epoch": 1.0359012715033658, "grad_norm": 2.5878045558929443, "learning_rate": 9.655614973262033e-06, "loss": 0.14652089774608612, "num_input_tokens_seen": 2496230, "step": 2424, "train_runtime": 5886.4966, "train_tokens_per_second": 424.06 }, { "epoch": 1.0363286675926915, "grad_norm": 3.307190179824829, "learning_rate": 9.651336898395723e-06, "loss": 0.11303628236055374, "num_input_tokens_seen": 2497182, "step": 2425, "train_runtime": 5888.6198, "train_tokens_per_second": 424.069 }, { "epoch": 1.0367560636820172, "grad_norm": 4.737715721130371, "learning_rate": 9.647058823529412e-06, "loss": 0.09600888192653656, "num_input_tokens_seen": 2498966, "step": 2426, "train_runtime": 5890.9168, "train_tokens_per_second": 424.207 }, { "epoch": 1.0371834597713432, "grad_norm": 2.3335535526275635, "learning_rate": 9.642780748663102e-06, "loss": 0.08316425234079361, "num_input_tokens_seen": 2500034, "step": 2427, "train_runtime": 5893.0329, "train_tokens_per_second": 424.236 }, { "epoch": 1.037610855860669, "grad_norm": 2.93424916267395, "learning_rate": 9.638502673796793e-06, "loss": 0.14708073437213898, "num_input_tokens_seen": 2501340, "step": 2428, "train_runtime": 5895.1912, "train_tokens_per_second": 424.302 }, { "epoch": 1.0380382519499947, "grad_norm": 2.623976469039917, "learning_rate": 9.634224598930482e-06, "loss": 0.11698875576257706, "num_input_tokens_seen": 2502776, "step": 2429, "train_runtime": 5897.4093, "train_tokens_per_second": 424.386 }, { "epoch": 1.0384656480393204, "grad_norm": 2.0000336170196533, "learning_rate": 9.629946524064172e-06, "loss": 0.08833160251379013, "num_input_tokens_seen": 2504208, "step": 2430, "train_runtime": 5899.5838, "train_tokens_per_second": 424.472 }, { "epoch": 1.0388930441286461, "grad_norm": 2.978618621826172, "learning_rate": 9.625668449197861e-06, "loss": 0.16571927070617676, "num_input_tokens_seen": 2505128, "step": 2431, "train_runtime": 5908.3322, "train_tokens_per_second": 423.999 }, { "epoch": 1.039320440217972, "grad_norm": 2.23797345161438, "learning_rate": 9.621390374331552e-06, "loss": 0.07004649937152863, "num_input_tokens_seen": 2506210, "step": 2432, "train_runtime": 5910.5186, "train_tokens_per_second": 424.025 }, { "epoch": 1.0397478363072978, "grad_norm": 2.0627944469451904, "learning_rate": 9.617112299465242e-06, "loss": 0.07753212004899979, "num_input_tokens_seen": 2507078, "step": 2433, "train_runtime": 5912.6883, "train_tokens_per_second": 424.017 }, { "epoch": 1.0401752323966236, "grad_norm": 2.0055627822875977, "learning_rate": 9.612834224598931e-06, "loss": 0.05498732626438141, "num_input_tokens_seen": 2508452, "step": 2434, "train_runtime": 5914.9208, "train_tokens_per_second": 424.089 }, { "epoch": 1.0406026284859493, "grad_norm": 2.9423599243164062, "learning_rate": 9.60855614973262e-06, "loss": 0.11010020971298218, "num_input_tokens_seen": 2509270, "step": 2435, "train_runtime": 5917.0854, "train_tokens_per_second": 424.072 }, { "epoch": 1.041030024575275, "grad_norm": 2.5060904026031494, "learning_rate": 9.604278074866312e-06, "loss": 0.11796065419912338, "num_input_tokens_seen": 2510782, "step": 2436, "train_runtime": 5919.3991, "train_tokens_per_second": 424.162 }, { "epoch": 1.041457420664601, "grad_norm": 2.8321478366851807, "learning_rate": 9.600000000000001e-06, "loss": 0.10900522768497467, "num_input_tokens_seen": 2511628, "step": 2437, "train_runtime": 5921.5572, "train_tokens_per_second": 424.15 }, { "epoch": 1.0418848167539267, "grad_norm": 3.812952995300293, "learning_rate": 9.59572192513369e-06, "loss": 0.10735161602497101, "num_input_tokens_seen": 2512272, "step": 2438, "train_runtime": 5923.5719, "train_tokens_per_second": 424.114 }, { "epoch": 1.0423122128432525, "grad_norm": 1.6792380809783936, "learning_rate": 9.59144385026738e-06, "loss": 0.0646650418639183, "num_input_tokens_seen": 2513438, "step": 2439, "train_runtime": 5925.7319, "train_tokens_per_second": 424.157 }, { "epoch": 1.0427396089325782, "grad_norm": 1.7132817506790161, "learning_rate": 9.587165775401071e-06, "loss": 0.05259291082620621, "num_input_tokens_seen": 2514356, "step": 2440, "train_runtime": 5927.7946, "train_tokens_per_second": 424.164 }, { "epoch": 1.043167005021904, "grad_norm": 2.3549015522003174, "learning_rate": 9.582887700534759e-06, "loss": 0.08349432051181793, "num_input_tokens_seen": 2515292, "step": 2441, "train_runtime": 5929.8538, "train_tokens_per_second": 424.174 }, { "epoch": 1.04359440111123, "grad_norm": 2.3505473136901855, "learning_rate": 9.57860962566845e-06, "loss": 0.08466736972332001, "num_input_tokens_seen": 2516546, "step": 2442, "train_runtime": 5932.0128, "train_tokens_per_second": 424.231 }, { "epoch": 1.0440217972005557, "grad_norm": 2.7773830890655518, "learning_rate": 9.57433155080214e-06, "loss": 0.07543611526489258, "num_input_tokens_seen": 2517208, "step": 2443, "train_runtime": 5934.0376, "train_tokens_per_second": 424.198 }, { "epoch": 1.0444491932898814, "grad_norm": 4.043386459350586, "learning_rate": 9.570053475935829e-06, "loss": 0.08522055298089981, "num_input_tokens_seen": 2518212, "step": 2444, "train_runtime": 5936.1282, "train_tokens_per_second": 424.218 }, { "epoch": 1.0448765893792071, "grad_norm": 6.0522637367248535, "learning_rate": 9.565775401069519e-06, "loss": 0.09105490148067474, "num_input_tokens_seen": 2519080, "step": 2445, "train_runtime": 5938.1846, "train_tokens_per_second": 424.217 }, { "epoch": 1.0453039854685329, "grad_norm": 2.9145095348358154, "learning_rate": 9.56149732620321e-06, "loss": 0.10026349127292633, "num_input_tokens_seen": 2519976, "step": 2446, "train_runtime": 5940.248, "train_tokens_per_second": 424.221 }, { "epoch": 1.0457313815578588, "grad_norm": 2.9680044651031494, "learning_rate": 9.557219251336899e-06, "loss": 0.10473820567131042, "num_input_tokens_seen": 2520712, "step": 2447, "train_runtime": 5942.2754, "train_tokens_per_second": 424.2 }, { "epoch": 1.0461587776471846, "grad_norm": 2.586383819580078, "learning_rate": 9.552941176470589e-06, "loss": 0.08061813563108444, "num_input_tokens_seen": 2521502, "step": 2448, "train_runtime": 5944.254, "train_tokens_per_second": 424.191 }, { "epoch": 1.0465861737365103, "grad_norm": 1.7993922233581543, "learning_rate": 9.548663101604278e-06, "loss": 0.05731932073831558, "num_input_tokens_seen": 2523934, "step": 2449, "train_runtime": 5946.6725, "train_tokens_per_second": 424.428 }, { "epoch": 1.047013569825836, "grad_norm": 2.498886823654175, "learning_rate": 9.544385026737969e-06, "loss": 0.09137125313282013, "num_input_tokens_seen": 2525038, "step": 2450, "train_runtime": 5948.7968, "train_tokens_per_second": 424.462 }, { "epoch": 1.0474409659151618, "grad_norm": 2.282993793487549, "learning_rate": 9.540106951871659e-06, "loss": 0.08812248706817627, "num_input_tokens_seen": 2526428, "step": 2451, "train_runtime": 5950.9498, "train_tokens_per_second": 424.542 }, { "epoch": 1.0478683620044877, "grad_norm": 2.5882728099823, "learning_rate": 9.535828877005348e-06, "loss": 0.09415605664253235, "num_input_tokens_seen": 2527440, "step": 2452, "train_runtime": 5953.0363, "train_tokens_per_second": 424.563 }, { "epoch": 1.0482957580938135, "grad_norm": 4.275142669677734, "learning_rate": 9.531550802139037e-06, "loss": 0.0687527284026146, "num_input_tokens_seen": 2528204, "step": 2453, "train_runtime": 5955.2151, "train_tokens_per_second": 424.536 }, { "epoch": 1.0487231541831392, "grad_norm": 3.256615400314331, "learning_rate": 9.527272727272729e-06, "loss": 0.06413855403661728, "num_input_tokens_seen": 2528862, "step": 2454, "train_runtime": 5957.1844, "train_tokens_per_second": 424.506 }, { "epoch": 1.049150550272465, "grad_norm": 3.384748935699463, "learning_rate": 9.522994652406418e-06, "loss": 0.0843663364648819, "num_input_tokens_seen": 2529634, "step": 2455, "train_runtime": 5959.1832, "train_tokens_per_second": 424.493 }, { "epoch": 1.0495779463617907, "grad_norm": 1.8081471920013428, "learning_rate": 9.518716577540108e-06, "loss": 0.07914873957633972, "num_input_tokens_seen": 2531450, "step": 2456, "train_runtime": 5961.4858, "train_tokens_per_second": 424.634 }, { "epoch": 1.0500053424511167, "grad_norm": 1.9101433753967285, "learning_rate": 9.514438502673797e-06, "loss": 0.04463515803217888, "num_input_tokens_seen": 2532710, "step": 2457, "train_runtime": 5963.624, "train_tokens_per_second": 424.693 }, { "epoch": 1.0504327385404424, "grad_norm": 3.349461793899536, "learning_rate": 9.510160427807488e-06, "loss": 0.08655493706464767, "num_input_tokens_seen": 2533830, "step": 2458, "train_runtime": 5965.7393, "train_tokens_per_second": 424.73 }, { "epoch": 1.0508601346297681, "grad_norm": 1.8900494575500488, "learning_rate": 9.505882352941178e-06, "loss": 0.07853373140096664, "num_input_tokens_seen": 2534960, "step": 2459, "train_runtime": 5967.8869, "train_tokens_per_second": 424.767 }, { "epoch": 1.0512875307190939, "grad_norm": 1.8290657997131348, "learning_rate": 9.501604278074867e-06, "loss": 0.049846798181533813, "num_input_tokens_seen": 2536098, "step": 2460, "train_runtime": 5970.0001, "train_tokens_per_second": 424.807 }, { "epoch": 1.0517149268084196, "grad_norm": 3.573796033859253, "learning_rate": 9.497326203208556e-06, "loss": 0.08434971421957016, "num_input_tokens_seen": 2536888, "step": 2461, "train_runtime": 5978.5897, "train_tokens_per_second": 424.329 }, { "epoch": 1.0521423228977456, "grad_norm": 2.914522647857666, "learning_rate": 9.493048128342248e-06, "loss": 0.09317946434020996, "num_input_tokens_seen": 2538444, "step": 2462, "train_runtime": 5980.9276, "train_tokens_per_second": 424.423 }, { "epoch": 1.0525697189870713, "grad_norm": 3.257650136947632, "learning_rate": 9.488770053475937e-06, "loss": 0.09556391835212708, "num_input_tokens_seen": 2539318, "step": 2463, "train_runtime": 5983.0496, "train_tokens_per_second": 424.419 }, { "epoch": 1.052997115076397, "grad_norm": 3.7569570541381836, "learning_rate": 9.484491978609626e-06, "loss": 0.10677316784858704, "num_input_tokens_seen": 2540082, "step": 2464, "train_runtime": 5985.1147, "train_tokens_per_second": 424.4 }, { "epoch": 1.0534245111657228, "grad_norm": 2.6633358001708984, "learning_rate": 9.480213903743316e-06, "loss": 0.10806825757026672, "num_input_tokens_seen": 2541396, "step": 2465, "train_runtime": 5987.4232, "train_tokens_per_second": 424.456 }, { "epoch": 1.0538519072550485, "grad_norm": 2.504791498184204, "learning_rate": 9.475935828877007e-06, "loss": 0.08049499988555908, "num_input_tokens_seen": 2542234, "step": 2466, "train_runtime": 5989.5275, "train_tokens_per_second": 424.447 }, { "epoch": 1.0542793033443745, "grad_norm": 1.8010330200195312, "learning_rate": 9.471657754010696e-06, "loss": 0.07656461000442505, "num_input_tokens_seen": 2543276, "step": 2467, "train_runtime": 5991.6933, "train_tokens_per_second": 424.467 }, { "epoch": 1.0547066994337002, "grad_norm": 3.153151750564575, "learning_rate": 9.467379679144386e-06, "loss": 0.08555097132921219, "num_input_tokens_seen": 2544130, "step": 2468, "train_runtime": 5993.8528, "train_tokens_per_second": 424.457 }, { "epoch": 1.055134095523026, "grad_norm": 3.303352117538452, "learning_rate": 9.463101604278075e-06, "loss": 0.1573292762041092, "num_input_tokens_seen": 2545116, "step": 2469, "train_runtime": 5996.0568, "train_tokens_per_second": 424.465 }, { "epoch": 1.0555614916123517, "grad_norm": 3.2898359298706055, "learning_rate": 9.458823529411767e-06, "loss": 0.084254689514637, "num_input_tokens_seen": 2546268, "step": 2470, "train_runtime": 5998.2705, "train_tokens_per_second": 424.5 }, { "epoch": 1.0559888877016774, "grad_norm": 2.7838451862335205, "learning_rate": 9.454545454545456e-06, "loss": 0.08452479541301727, "num_input_tokens_seen": 2547384, "step": 2471, "train_runtime": 6000.4856, "train_tokens_per_second": 424.53 }, { "epoch": 1.0564162837910034, "grad_norm": 2.2581820487976074, "learning_rate": 9.450267379679145e-06, "loss": 0.07131518423557281, "num_input_tokens_seen": 2548482, "step": 2472, "train_runtime": 6002.6194, "train_tokens_per_second": 424.562 }, { "epoch": 1.0568436798803291, "grad_norm": 2.164290428161621, "learning_rate": 9.445989304812835e-06, "loss": 0.05863840878009796, "num_input_tokens_seen": 2549352, "step": 2473, "train_runtime": 6004.7653, "train_tokens_per_second": 424.555 }, { "epoch": 1.0572710759696549, "grad_norm": 1.770673394203186, "learning_rate": 9.441711229946526e-06, "loss": 0.06265389919281006, "num_input_tokens_seen": 2550902, "step": 2474, "train_runtime": 6007.0724, "train_tokens_per_second": 424.65 }, { "epoch": 1.0576984720589806, "grad_norm": 3.089261054992676, "learning_rate": 9.437433155080214e-06, "loss": 0.13192465901374817, "num_input_tokens_seen": 2551878, "step": 2475, "train_runtime": 6009.1704, "train_tokens_per_second": 424.664 }, { "epoch": 1.0581258681483063, "grad_norm": 5.253305912017822, "learning_rate": 9.433155080213905e-06, "loss": 0.12144365906715393, "num_input_tokens_seen": 2553294, "step": 2476, "train_runtime": 6011.4069, "train_tokens_per_second": 424.742 }, { "epoch": 1.0585532642376323, "grad_norm": 2.399216413497925, "learning_rate": 9.428877005347594e-06, "loss": 0.08546847105026245, "num_input_tokens_seen": 2554620, "step": 2477, "train_runtime": 6013.6494, "train_tokens_per_second": 424.804 }, { "epoch": 1.058980660326958, "grad_norm": 2.4415104389190674, "learning_rate": 9.424598930481284e-06, "loss": 0.08338084816932678, "num_input_tokens_seen": 2555690, "step": 2478, "train_runtime": 6015.8048, "train_tokens_per_second": 424.829 }, { "epoch": 1.0594080564162838, "grad_norm": 4.050954818725586, "learning_rate": 9.420320855614973e-06, "loss": 0.08639764785766602, "num_input_tokens_seen": 2556760, "step": 2479, "train_runtime": 6017.9178, "train_tokens_per_second": 424.858 }, { "epoch": 1.0598354525056095, "grad_norm": 3.0661141872406006, "learning_rate": 9.416042780748664e-06, "loss": 0.13239911198616028, "num_input_tokens_seen": 2557776, "step": 2480, "train_runtime": 6019.974, "train_tokens_per_second": 424.882 }, { "epoch": 1.0602628485949355, "grad_norm": 2.315734624862671, "learning_rate": 9.411764705882354e-06, "loss": 0.0881490483880043, "num_input_tokens_seen": 2559014, "step": 2481, "train_runtime": 6022.2008, "train_tokens_per_second": 424.93 }, { "epoch": 1.0606902446842612, "grad_norm": 2.5126805305480957, "learning_rate": 9.407486631016043e-06, "loss": 0.0491979606449604, "num_input_tokens_seen": 2560306, "step": 2482, "train_runtime": 6024.3702, "train_tokens_per_second": 424.991 }, { "epoch": 1.061117640773587, "grad_norm": 3.510737419128418, "learning_rate": 9.403208556149733e-06, "loss": 0.0917619988322258, "num_input_tokens_seen": 2561080, "step": 2483, "train_runtime": 6026.4542, "train_tokens_per_second": 424.973 }, { "epoch": 1.0615450368629127, "grad_norm": 2.9285781383514404, "learning_rate": 9.398930481283424e-06, "loss": 0.12614470720291138, "num_input_tokens_seen": 2561938, "step": 2484, "train_runtime": 6028.5376, "train_tokens_per_second": 424.968 }, { "epoch": 1.0619724329522384, "grad_norm": 2.4121227264404297, "learning_rate": 9.394652406417113e-06, "loss": 0.12636646628379822, "num_input_tokens_seen": 2562944, "step": 2485, "train_runtime": 6030.5866, "train_tokens_per_second": 424.991 }, { "epoch": 1.0623998290415644, "grad_norm": 2.5880560874938965, "learning_rate": 9.390374331550803e-06, "loss": 0.0730423554778099, "num_input_tokens_seen": 2563880, "step": 2486, "train_runtime": 6032.6585, "train_tokens_per_second": 425.0 }, { "epoch": 1.0628272251308901, "grad_norm": 2.2725648880004883, "learning_rate": 9.386096256684492e-06, "loss": 0.05836467817425728, "num_input_tokens_seen": 2564908, "step": 2487, "train_runtime": 6034.7434, "train_tokens_per_second": 425.024 }, { "epoch": 1.0632546212202159, "grad_norm": 2.2882461547851562, "learning_rate": 9.381818181818183e-06, "loss": 0.1003018170595169, "num_input_tokens_seen": 2565964, "step": 2488, "train_runtime": 6036.8279, "train_tokens_per_second": 425.052 }, { "epoch": 1.0636820173095416, "grad_norm": 2.6683990955352783, "learning_rate": 9.377540106951873e-06, "loss": 0.12827488780021667, "num_input_tokens_seen": 2567030, "step": 2489, "train_runtime": 6038.9136, "train_tokens_per_second": 425.081 }, { "epoch": 1.0641094133988673, "grad_norm": 2.0335280895233154, "learning_rate": 9.373262032085562e-06, "loss": 0.05924580246210098, "num_input_tokens_seen": 2567976, "step": 2490, "train_runtime": 6041.0089, "train_tokens_per_second": 425.091 }, { "epoch": 1.0645368094881933, "grad_norm": 2.5157742500305176, "learning_rate": 9.368983957219252e-06, "loss": 0.0915893092751503, "num_input_tokens_seen": 2568936, "step": 2491, "train_runtime": 6049.6806, "train_tokens_per_second": 424.64 }, { "epoch": 1.064964205577519, "grad_norm": 3.596317768096924, "learning_rate": 9.364705882352943e-06, "loss": 0.1080373078584671, "num_input_tokens_seen": 2569600, "step": 2492, "train_runtime": 6051.6588, "train_tokens_per_second": 424.611 }, { "epoch": 1.0653916016668448, "grad_norm": 2.10650897026062, "learning_rate": 9.360427807486632e-06, "loss": 0.08839220553636551, "num_input_tokens_seen": 2570716, "step": 2493, "train_runtime": 6053.8066, "train_tokens_per_second": 424.645 }, { "epoch": 1.0658189977561705, "grad_norm": 3.5884060859680176, "learning_rate": 9.356149732620322e-06, "loss": 0.14576679468154907, "num_input_tokens_seen": 2571516, "step": 2494, "train_runtime": 6055.9329, "train_tokens_per_second": 424.628 }, { "epoch": 1.0662463938454962, "grad_norm": 3.5533761978149414, "learning_rate": 9.351871657754011e-06, "loss": 0.11463622003793716, "num_input_tokens_seen": 2572310, "step": 2495, "train_runtime": 6057.98, "train_tokens_per_second": 424.615 }, { "epoch": 1.0666737899348222, "grad_norm": 16.307538986206055, "learning_rate": 9.347593582887702e-06, "loss": 0.2264968901872635, "num_input_tokens_seen": 2573646, "step": 2496, "train_runtime": 6060.1514, "train_tokens_per_second": 424.683 }, { "epoch": 1.067101186024148, "grad_norm": 2.061206102371216, "learning_rate": 9.343315508021392e-06, "loss": 0.06639231741428375, "num_input_tokens_seen": 2574818, "step": 2497, "train_runtime": 6062.2967, "train_tokens_per_second": 424.726 }, { "epoch": 1.0675285821134737, "grad_norm": 1.770450472831726, "learning_rate": 9.339037433155081e-06, "loss": 0.07189320772886276, "num_input_tokens_seen": 2576078, "step": 2498, "train_runtime": 6064.4925, "train_tokens_per_second": 424.78 }, { "epoch": 1.0679559782027994, "grad_norm": 3.03733229637146, "learning_rate": 9.33475935828877e-06, "loss": 0.10361220687627792, "num_input_tokens_seen": 2577046, "step": 2499, "train_runtime": 6066.5911, "train_tokens_per_second": 424.793 }, { "epoch": 1.0683833742921252, "grad_norm": 2.5225203037261963, "learning_rate": 9.330481283422462e-06, "loss": 0.08256438374519348, "num_input_tokens_seen": 2577862, "step": 2500, "train_runtime": 6068.6362, "train_tokens_per_second": 424.784 }, { "epoch": 1.0688107703814511, "grad_norm": 2.4388086795806885, "learning_rate": 9.326203208556151e-06, "loss": 0.06906373053789139, "num_input_tokens_seen": 2578680, "step": 2501, "train_runtime": 6070.738, "train_tokens_per_second": 424.772 }, { "epoch": 1.0692381664707769, "grad_norm": 4.451180458068848, "learning_rate": 9.32192513368984e-06, "loss": 0.15288393199443817, "num_input_tokens_seen": 2579326, "step": 2502, "train_runtime": 6072.7696, "train_tokens_per_second": 424.736 }, { "epoch": 1.0696655625601026, "grad_norm": 1.10209059715271, "learning_rate": 9.31764705882353e-06, "loss": 0.03241486847400665, "num_input_tokens_seen": 2581586, "step": 2503, "train_runtime": 6075.1518, "train_tokens_per_second": 424.942 }, { "epoch": 1.0700929586494283, "grad_norm": 2.449856996536255, "learning_rate": 9.313368983957221e-06, "loss": 0.07203330844640732, "num_input_tokens_seen": 2582338, "step": 2504, "train_runtime": 6077.1794, "train_tokens_per_second": 424.924 }, { "epoch": 1.070520354738754, "grad_norm": 3.4753663539886475, "learning_rate": 9.30909090909091e-06, "loss": 0.08703330159187317, "num_input_tokens_seen": 2583168, "step": 2505, "train_runtime": 6079.2198, "train_tokens_per_second": 424.918 }, { "epoch": 1.07094775082808, "grad_norm": 1.6387132406234741, "learning_rate": 9.3048128342246e-06, "loss": 0.04702633246779442, "num_input_tokens_seen": 2584428, "step": 2506, "train_runtime": 6081.3422, "train_tokens_per_second": 424.977 }, { "epoch": 1.0713751469174058, "grad_norm": 2.637098789215088, "learning_rate": 9.30053475935829e-06, "loss": 0.09241136163473129, "num_input_tokens_seen": 2585258, "step": 2507, "train_runtime": 6083.384, "train_tokens_per_second": 424.97 }, { "epoch": 1.0718025430067315, "grad_norm": 2.5830302238464355, "learning_rate": 9.296256684491979e-06, "loss": 0.08075625449419022, "num_input_tokens_seen": 2586070, "step": 2508, "train_runtime": 6085.4607, "train_tokens_per_second": 424.959 }, { "epoch": 1.0722299390960572, "grad_norm": 1.774401068687439, "learning_rate": 9.291978609625668e-06, "loss": 0.06211743503808975, "num_input_tokens_seen": 2587484, "step": 2509, "train_runtime": 6087.6296, "train_tokens_per_second": 425.04 }, { "epoch": 1.072657335185383, "grad_norm": 3.4107000827789307, "learning_rate": 9.287700534759358e-06, "loss": 0.12342812120914459, "num_input_tokens_seen": 2588392, "step": 2510, "train_runtime": 6089.704, "train_tokens_per_second": 425.044 }, { "epoch": 1.073084731274709, "grad_norm": 1.8665857315063477, "learning_rate": 9.283422459893049e-06, "loss": 0.05985205993056297, "num_input_tokens_seen": 2589488, "step": 2511, "train_runtime": 6091.8471, "train_tokens_per_second": 425.074 }, { "epoch": 1.0735121273640347, "grad_norm": 2.3740785121917725, "learning_rate": 9.279144385026738e-06, "loss": 0.08959895372390747, "num_input_tokens_seen": 2590612, "step": 2512, "train_runtime": 6093.9455, "train_tokens_per_second": 425.112 }, { "epoch": 1.0739395234533604, "grad_norm": 4.132309913635254, "learning_rate": 9.274866310160428e-06, "loss": 0.13241590559482574, "num_input_tokens_seen": 2591500, "step": 2513, "train_runtime": 6096.016, "train_tokens_per_second": 425.114 }, { "epoch": 1.0743669195426861, "grad_norm": 2.7073099613189697, "learning_rate": 9.270588235294117e-06, "loss": 0.10110922157764435, "num_input_tokens_seen": 2592246, "step": 2514, "train_runtime": 6098.084, "train_tokens_per_second": 425.092 }, { "epoch": 1.0747943156320119, "grad_norm": 1.4636536836624146, "learning_rate": 9.266310160427809e-06, "loss": 0.05031413957476616, "num_input_tokens_seen": 2593324, "step": 2515, "train_runtime": 6100.3301, "train_tokens_per_second": 425.112 }, { "epoch": 1.0752217117213378, "grad_norm": 3.164484977722168, "learning_rate": 9.262032085561498e-06, "loss": 0.12404800951480865, "num_input_tokens_seen": 2594402, "step": 2516, "train_runtime": 6102.418, "train_tokens_per_second": 425.143 }, { "epoch": 1.0756491078106636, "grad_norm": 2.224860429763794, "learning_rate": 9.257754010695187e-06, "loss": 0.0686841830611229, "num_input_tokens_seen": 2595594, "step": 2517, "train_runtime": 6104.5673, "train_tokens_per_second": 425.189 }, { "epoch": 1.0760765038999893, "grad_norm": 1.763987421989441, "learning_rate": 9.253475935828877e-06, "loss": 0.044779419898986816, "num_input_tokens_seen": 2597202, "step": 2518, "train_runtime": 6106.8098, "train_tokens_per_second": 425.296 }, { "epoch": 1.076503899989315, "grad_norm": 3.291356325149536, "learning_rate": 9.249197860962568e-06, "loss": 0.1659565269947052, "num_input_tokens_seen": 2598682, "step": 2519, "train_runtime": 6109.0019, "train_tokens_per_second": 425.386 }, { "epoch": 1.0769312960786408, "grad_norm": 4.187049388885498, "learning_rate": 9.244919786096257e-06, "loss": 0.1263025999069214, "num_input_tokens_seen": 2599290, "step": 2520, "train_runtime": 6111.0717, "train_tokens_per_second": 425.341 }, { "epoch": 1.0773586921679668, "grad_norm": 2.4789187908172607, "learning_rate": 9.240641711229947e-06, "loss": 0.05840917304158211, "num_input_tokens_seen": 2600320, "step": 2521, "train_runtime": 6119.8304, "train_tokens_per_second": 424.901 }, { "epoch": 1.0777860882572925, "grad_norm": 3.5480587482452393, "learning_rate": 9.236363636363636e-06, "loss": 0.09059934318065643, "num_input_tokens_seen": 2600998, "step": 2522, "train_runtime": 6121.8122, "train_tokens_per_second": 424.874 }, { "epoch": 1.0782134843466182, "grad_norm": 2.734523296356201, "learning_rate": 9.232085561497327e-06, "loss": 0.10375450551509857, "num_input_tokens_seen": 2602492, "step": 2523, "train_runtime": 6123.99, "train_tokens_per_second": 424.967 }, { "epoch": 1.078640880435944, "grad_norm": 3.074808359146118, "learning_rate": 9.227807486631017e-06, "loss": 0.10524008423089981, "num_input_tokens_seen": 2603270, "step": 2524, "train_runtime": 6126.0093, "train_tokens_per_second": 424.954 }, { "epoch": 1.0790682765252697, "grad_norm": 2.966073751449585, "learning_rate": 9.223529411764706e-06, "loss": 0.06798302382230759, "num_input_tokens_seen": 2604098, "step": 2525, "train_runtime": 6128.0312, "train_tokens_per_second": 424.949 }, { "epoch": 1.0794956726145957, "grad_norm": 2.8142268657684326, "learning_rate": 9.219251336898396e-06, "loss": 0.07415980845689774, "num_input_tokens_seen": 2604942, "step": 2526, "train_runtime": 6130.0892, "train_tokens_per_second": 424.944 }, { "epoch": 1.0799230687039214, "grad_norm": 2.471247673034668, "learning_rate": 9.214973262032087e-06, "loss": 0.08812225610017776, "num_input_tokens_seen": 2605822, "step": 2527, "train_runtime": 6132.1456, "train_tokens_per_second": 424.945 }, { "epoch": 1.0803504647932471, "grad_norm": 1.8501207828521729, "learning_rate": 9.210695187165776e-06, "loss": 0.07012195885181427, "num_input_tokens_seen": 2607138, "step": 2528, "train_runtime": 6134.3808, "train_tokens_per_second": 425.004 }, { "epoch": 1.0807778608825729, "grad_norm": 2.5294954776763916, "learning_rate": 9.206417112299466e-06, "loss": 0.08150813728570938, "num_input_tokens_seen": 2608474, "step": 2529, "train_runtime": 6136.7142, "train_tokens_per_second": 425.06 }, { "epoch": 1.0812052569718986, "grad_norm": 3.708526134490967, "learning_rate": 9.202139037433155e-06, "loss": 0.10302053391933441, "num_input_tokens_seen": 2609352, "step": 2530, "train_runtime": 6138.7855, "train_tokens_per_second": 425.06 }, { "epoch": 1.0816326530612246, "grad_norm": 2.5818028450012207, "learning_rate": 9.197860962566846e-06, "loss": 0.08561830222606659, "num_input_tokens_seen": 2610372, "step": 2531, "train_runtime": 6140.8695, "train_tokens_per_second": 425.082 }, { "epoch": 1.0820600491505503, "grad_norm": 2.5761454105377197, "learning_rate": 9.193582887700536e-06, "loss": 0.10527003556489944, "num_input_tokens_seen": 2611530, "step": 2532, "train_runtime": 6143.0239, "train_tokens_per_second": 425.121 }, { "epoch": 1.082487445239876, "grad_norm": 2.6809802055358887, "learning_rate": 9.189304812834225e-06, "loss": 0.09583239257335663, "num_input_tokens_seen": 2612686, "step": 2533, "train_runtime": 6145.1391, "train_tokens_per_second": 425.163 }, { "epoch": 1.0829148413292018, "grad_norm": 2.889986515045166, "learning_rate": 9.185026737967915e-06, "loss": 0.09865818917751312, "num_input_tokens_seen": 2613378, "step": 2534, "train_runtime": 6147.2692, "train_tokens_per_second": 425.128 }, { "epoch": 1.0833422374185275, "grad_norm": 2.403228282928467, "learning_rate": 9.180748663101606e-06, "loss": 0.09622926265001297, "num_input_tokens_seen": 2614408, "step": 2535, "train_runtime": 6149.3603, "train_tokens_per_second": 425.151 }, { "epoch": 1.0837696335078535, "grad_norm": 3.137573480606079, "learning_rate": 9.176470588235294e-06, "loss": 0.09262220561504364, "num_input_tokens_seen": 2615476, "step": 2536, "train_runtime": 6151.476, "train_tokens_per_second": 425.179 }, { "epoch": 1.0841970295971792, "grad_norm": 3.5582549571990967, "learning_rate": 9.172192513368985e-06, "loss": 0.1597282439470291, "num_input_tokens_seen": 2616314, "step": 2537, "train_runtime": 6153.5418, "train_tokens_per_second": 425.172 }, { "epoch": 1.084624425686505, "grad_norm": 2.795961380004883, "learning_rate": 9.167914438502674e-06, "loss": 0.08986320346593857, "num_input_tokens_seen": 2617246, "step": 2538, "train_runtime": 6155.6361, "train_tokens_per_second": 425.179 }, { "epoch": 1.0850518217758307, "grad_norm": 2.2350223064422607, "learning_rate": 9.163636363636365e-06, "loss": 0.09304250031709671, "num_input_tokens_seen": 2618258, "step": 2539, "train_runtime": 6157.7157, "train_tokens_per_second": 425.2 }, { "epoch": 1.0854792178651564, "grad_norm": 5.303435802459717, "learning_rate": 9.159358288770053e-06, "loss": 0.08296370506286621, "num_input_tokens_seen": 2619166, "step": 2540, "train_runtime": 6159.7577, "train_tokens_per_second": 425.206 }, { "epoch": 1.0859066139544824, "grad_norm": 2.2618508338928223, "learning_rate": 9.155080213903744e-06, "loss": 0.07552073150873184, "num_input_tokens_seen": 2620126, "step": 2541, "train_runtime": 6161.8391, "train_tokens_per_second": 425.218 }, { "epoch": 1.0863340100438081, "grad_norm": 1.762229561805725, "learning_rate": 9.150802139037434e-06, "loss": 0.06286679208278656, "num_input_tokens_seen": 2621470, "step": 2542, "train_runtime": 6163.9897, "train_tokens_per_second": 425.288 }, { "epoch": 1.0867614061331339, "grad_norm": 1.8647757768630981, "learning_rate": 9.146524064171123e-06, "loss": 0.07455813139677048, "num_input_tokens_seen": 2623956, "step": 2543, "train_runtime": 6166.4564, "train_tokens_per_second": 425.521 }, { "epoch": 1.0871888022224596, "grad_norm": 2.485333204269409, "learning_rate": 9.142245989304813e-06, "loss": 0.10116797685623169, "num_input_tokens_seen": 2624926, "step": 2544, "train_runtime": 6168.545, "train_tokens_per_second": 425.534 }, { "epoch": 1.0876161983117854, "grad_norm": 1.6954323053359985, "learning_rate": 9.137967914438504e-06, "loss": 0.0423913411796093, "num_input_tokens_seen": 2626152, "step": 2545, "train_runtime": 6170.6919, "train_tokens_per_second": 425.585 }, { "epoch": 1.0880435944011113, "grad_norm": 3.0797646045684814, "learning_rate": 9.133689839572193e-06, "loss": 0.1578473448753357, "num_input_tokens_seen": 2627016, "step": 2546, "train_runtime": 6172.7449, "train_tokens_per_second": 425.583 }, { "epoch": 1.088470990490437, "grad_norm": 3.5497829914093018, "learning_rate": 9.129411764705883e-06, "loss": 0.12611296772956848, "num_input_tokens_seen": 2627798, "step": 2547, "train_runtime": 6174.7335, "train_tokens_per_second": 425.573 }, { "epoch": 1.0888983865797628, "grad_norm": 2.7811191082000732, "learning_rate": 9.125133689839572e-06, "loss": 0.10591692477464676, "num_input_tokens_seen": 2629092, "step": 2548, "train_runtime": 6176.8832, "train_tokens_per_second": 425.634 }, { "epoch": 1.0893257826690885, "grad_norm": 1.9196721315383911, "learning_rate": 9.120855614973263e-06, "loss": 0.07511201500892639, "num_input_tokens_seen": 2630236, "step": 2549, "train_runtime": 6178.9982, "train_tokens_per_second": 425.674 }, { "epoch": 1.0897531787584143, "grad_norm": 3.5732882022857666, "learning_rate": 9.116577540106953e-06, "loss": 0.1789730340242386, "num_input_tokens_seen": 2631200, "step": 2550, "train_runtime": 6181.0568, "train_tokens_per_second": 425.688 }, { "epoch": 1.0901805748477402, "grad_norm": 2.2895474433898926, "learning_rate": 9.112299465240642e-06, "loss": 0.07485906779766083, "num_input_tokens_seen": 2632364, "step": 2551, "train_runtime": 6189.8056, "train_tokens_per_second": 425.274 }, { "epoch": 1.090607970937066, "grad_norm": 2.6540567874908447, "learning_rate": 9.108021390374332e-06, "loss": 0.054442599415779114, "num_input_tokens_seen": 2633204, "step": 2552, "train_runtime": 6191.8229, "train_tokens_per_second": 425.271 }, { "epoch": 1.0910353670263917, "grad_norm": 2.39176869392395, "learning_rate": 9.103743315508023e-06, "loss": 0.078837551176548, "num_input_tokens_seen": 2634234, "step": 2553, "train_runtime": 6194.0669, "train_tokens_per_second": 425.283 }, { "epoch": 1.0914627631157174, "grad_norm": 2.3524105548858643, "learning_rate": 9.099465240641712e-06, "loss": 0.09189550578594208, "num_input_tokens_seen": 2635198, "step": 2554, "train_runtime": 6196.1704, "train_tokens_per_second": 425.295 }, { "epoch": 1.0918901592050432, "grad_norm": 2.4514803886413574, "learning_rate": 9.095187165775402e-06, "loss": 0.08409885317087173, "num_input_tokens_seen": 2635956, "step": 2555, "train_runtime": 6198.1886, "train_tokens_per_second": 425.278 }, { "epoch": 1.0923175552943691, "grad_norm": 2.3649215698242188, "learning_rate": 9.090909090909091e-06, "loss": 0.06314463913440704, "num_input_tokens_seen": 2636606, "step": 2556, "train_runtime": 6200.1454, "train_tokens_per_second": 425.249 }, { "epoch": 1.0927449513836949, "grad_norm": 2.2242050170898438, "learning_rate": 9.086631016042782e-06, "loss": 0.07727743685245514, "num_input_tokens_seen": 2637850, "step": 2557, "train_runtime": 6202.2622, "train_tokens_per_second": 425.304 }, { "epoch": 1.0931723474730206, "grad_norm": 2.1953177452087402, "learning_rate": 9.082352941176472e-06, "loss": 0.09806112945079803, "num_input_tokens_seen": 2639198, "step": 2558, "train_runtime": 6204.4201, "train_tokens_per_second": 425.374 }, { "epoch": 1.0935997435623463, "grad_norm": 2.17103910446167, "learning_rate": 9.078074866310161e-06, "loss": 0.06100569665431976, "num_input_tokens_seen": 2640076, "step": 2559, "train_runtime": 6206.5183, "train_tokens_per_second": 425.371 }, { "epoch": 1.094027139651672, "grad_norm": 3.6131880283355713, "learning_rate": 9.07379679144385e-06, "loss": 0.0696096196770668, "num_input_tokens_seen": 2640912, "step": 2560, "train_runtime": 6208.5815, "train_tokens_per_second": 425.365 }, { "epoch": 1.094454535740998, "grad_norm": 3.7856390476226807, "learning_rate": 9.069518716577542e-06, "loss": 0.11277409642934799, "num_input_tokens_seen": 2642292, "step": 2561, "train_runtime": 6210.766, "train_tokens_per_second": 425.437 }, { "epoch": 1.0948819318303238, "grad_norm": 2.5144784450531006, "learning_rate": 9.065240641711231e-06, "loss": 0.08400897681713104, "num_input_tokens_seen": 2643486, "step": 2562, "train_runtime": 6212.8907, "train_tokens_per_second": 425.484 }, { "epoch": 1.0953093279196495, "grad_norm": 2.886179208755493, "learning_rate": 9.06096256684492e-06, "loss": 0.11095649003982544, "num_input_tokens_seen": 2644560, "step": 2563, "train_runtime": 6215.0488, "train_tokens_per_second": 425.509 }, { "epoch": 1.0957367240089753, "grad_norm": 2.416893720626831, "learning_rate": 9.05668449197861e-06, "loss": 0.0961887538433075, "num_input_tokens_seen": 2645550, "step": 2564, "train_runtime": 6217.1088, "train_tokens_per_second": 425.527 }, { "epoch": 1.096164120098301, "grad_norm": 2.321659803390503, "learning_rate": 9.052406417112301e-06, "loss": 0.060192909091711044, "num_input_tokens_seen": 2646420, "step": 2565, "train_runtime": 6219.1648, "train_tokens_per_second": 425.527 }, { "epoch": 1.096591516187627, "grad_norm": 1.7480592727661133, "learning_rate": 9.04812834224599e-06, "loss": 0.07109661400318146, "num_input_tokens_seen": 2647648, "step": 2566, "train_runtime": 6221.2835, "train_tokens_per_second": 425.579 }, { "epoch": 1.0970189122769527, "grad_norm": 2.828977108001709, "learning_rate": 9.04385026737968e-06, "loss": 0.07299567759037018, "num_input_tokens_seen": 2648570, "step": 2567, "train_runtime": 6223.3506, "train_tokens_per_second": 425.586 }, { "epoch": 1.0974463083662784, "grad_norm": 3.1151654720306396, "learning_rate": 9.03957219251337e-06, "loss": 0.10197779536247253, "num_input_tokens_seen": 2649326, "step": 2568, "train_runtime": 6225.3967, "train_tokens_per_second": 425.567 }, { "epoch": 1.0978737044556042, "grad_norm": 4.076137065887451, "learning_rate": 9.03529411764706e-06, "loss": 0.11928398907184601, "num_input_tokens_seen": 2650346, "step": 2569, "train_runtime": 6227.4496, "train_tokens_per_second": 425.591 }, { "epoch": 1.09830110054493, "grad_norm": 1.9719167947769165, "learning_rate": 9.031016042780748e-06, "loss": 0.05208585411310196, "num_input_tokens_seen": 2651832, "step": 2570, "train_runtime": 6229.6632, "train_tokens_per_second": 425.678 }, { "epoch": 1.0987284966342559, "grad_norm": 3.1587843894958496, "learning_rate": 9.02673796791444e-06, "loss": 0.10116727650165558, "num_input_tokens_seen": 2652696, "step": 2571, "train_runtime": 6231.7094, "train_tokens_per_second": 425.677 }, { "epoch": 1.0991558927235816, "grad_norm": 1.8884376287460327, "learning_rate": 9.022459893048129e-06, "loss": 0.08448435366153717, "num_input_tokens_seen": 2654062, "step": 2572, "train_runtime": 6233.8896, "train_tokens_per_second": 425.747 }, { "epoch": 1.0995832888129073, "grad_norm": 1.7889384031295776, "learning_rate": 9.01818181818182e-06, "loss": 0.0389912873506546, "num_input_tokens_seen": 2655048, "step": 2573, "train_runtime": 6235.9564, "train_tokens_per_second": 425.764 }, { "epoch": 1.100010684902233, "grad_norm": 2.9972827434539795, "learning_rate": 9.013903743315508e-06, "loss": 0.07092035561800003, "num_input_tokens_seen": 2656032, "step": 2574, "train_runtime": 6238.0401, "train_tokens_per_second": 425.78 }, { "epoch": 1.1004380809915588, "grad_norm": 2.1166203022003174, "learning_rate": 9.009625668449199e-06, "loss": 0.06895717233419418, "num_input_tokens_seen": 2657772, "step": 2575, "train_runtime": 6240.3216, "train_tokens_per_second": 425.903 }, { "epoch": 1.1008654770808848, "grad_norm": 2.402984142303467, "learning_rate": 9.005347593582888e-06, "loss": 0.07706868648529053, "num_input_tokens_seen": 2658732, "step": 2576, "train_runtime": 6242.3975, "train_tokens_per_second": 425.915 }, { "epoch": 1.1012928731702105, "grad_norm": 2.4520437717437744, "learning_rate": 9.001069518716578e-06, "loss": 0.08827337622642517, "num_input_tokens_seen": 2659752, "step": 2577, "train_runtime": 6244.4653, "train_tokens_per_second": 425.938 }, { "epoch": 1.1017202692595363, "grad_norm": 3.3706552982330322, "learning_rate": 8.996791443850267e-06, "loss": 0.08362919092178345, "num_input_tokens_seen": 2660538, "step": 2578, "train_runtime": 6246.477, "train_tokens_per_second": 425.926 }, { "epoch": 1.102147665348862, "grad_norm": 3.8421828746795654, "learning_rate": 8.992513368983958e-06, "loss": 0.14808999001979828, "num_input_tokens_seen": 2661354, "step": 2579, "train_runtime": 6248.5049, "train_tokens_per_second": 425.919 }, { "epoch": 1.1025750614381877, "grad_norm": 2.08762264251709, "learning_rate": 8.988235294117648e-06, "loss": 0.06539730727672577, "num_input_tokens_seen": 2662054, "step": 2580, "train_runtime": 6250.5004, "train_tokens_per_second": 425.895 }, { "epoch": 1.1030024575275137, "grad_norm": 5.158356189727783, "learning_rate": 8.983957219251337e-06, "loss": 0.11088553816080093, "num_input_tokens_seen": 2662830, "step": 2581, "train_runtime": 6259.1583, "train_tokens_per_second": 425.429 }, { "epoch": 1.1034298536168394, "grad_norm": 2.46724534034729, "learning_rate": 8.979679144385027e-06, "loss": 0.07529918104410172, "num_input_tokens_seen": 2663718, "step": 2582, "train_runtime": 6261.2312, "train_tokens_per_second": 425.43 }, { "epoch": 1.1038572497061652, "grad_norm": 4.171766757965088, "learning_rate": 8.975401069518718e-06, "loss": 0.11726517230272293, "num_input_tokens_seen": 2665074, "step": 2583, "train_runtime": 6263.4133, "train_tokens_per_second": 425.499 }, { "epoch": 1.104284645795491, "grad_norm": 5.988823890686035, "learning_rate": 8.971122994652407e-06, "loss": 0.12138627469539642, "num_input_tokens_seen": 2665798, "step": 2584, "train_runtime": 6265.4908, "train_tokens_per_second": 425.473 }, { "epoch": 1.1047120418848166, "grad_norm": 4.671169281005859, "learning_rate": 8.966844919786097e-06, "loss": 0.10450796037912369, "num_input_tokens_seen": 2666380, "step": 2585, "train_runtime": 6267.514, "train_tokens_per_second": 425.429 }, { "epoch": 1.1051394379741426, "grad_norm": 3.142690896987915, "learning_rate": 8.962566844919786e-06, "loss": 0.09894594550132751, "num_input_tokens_seen": 2667178, "step": 2586, "train_runtime": 6269.5349, "train_tokens_per_second": 425.419 }, { "epoch": 1.1055668340634683, "grad_norm": 2.8497908115386963, "learning_rate": 8.958288770053477e-06, "loss": 0.1103810966014862, "num_input_tokens_seen": 2668086, "step": 2587, "train_runtime": 6271.6029, "train_tokens_per_second": 425.423 }, { "epoch": 1.105994230152794, "grad_norm": 2.5532639026641846, "learning_rate": 8.954010695187167e-06, "loss": 0.09244312345981598, "num_input_tokens_seen": 2668928, "step": 2588, "train_runtime": 6273.6795, "train_tokens_per_second": 425.417 }, { "epoch": 1.1064216262421198, "grad_norm": 2.962883234024048, "learning_rate": 8.949732620320856e-06, "loss": 0.10032179951667786, "num_input_tokens_seen": 2670242, "step": 2589, "train_runtime": 6275.8322, "train_tokens_per_second": 425.48 }, { "epoch": 1.1068490223314456, "grad_norm": 2.0307984352111816, "learning_rate": 8.945454545454546e-06, "loss": 0.06244519725441933, "num_input_tokens_seen": 2671122, "step": 2590, "train_runtime": 6277.8623, "train_tokens_per_second": 425.483 }, { "epoch": 1.1072764184207715, "grad_norm": 2.161024570465088, "learning_rate": 8.941176470588237e-06, "loss": 0.08688432723283768, "num_input_tokens_seen": 2672340, "step": 2591, "train_runtime": 6280.0155, "train_tokens_per_second": 425.531 }, { "epoch": 1.1077038145100973, "grad_norm": 2.793954849243164, "learning_rate": 8.936898395721926e-06, "loss": 0.07023809105157852, "num_input_tokens_seen": 2673234, "step": 2592, "train_runtime": 6282.1453, "train_tokens_per_second": 425.529 }, { "epoch": 1.108131210599423, "grad_norm": 2.716843843460083, "learning_rate": 8.932620320855616e-06, "loss": 0.10120771825313568, "num_input_tokens_seen": 2674702, "step": 2593, "train_runtime": 6284.4485, "train_tokens_per_second": 425.606 }, { "epoch": 1.1085586066887487, "grad_norm": 2.413733720779419, "learning_rate": 8.928342245989305e-06, "loss": 0.07094432413578033, "num_input_tokens_seen": 2675602, "step": 2594, "train_runtime": 6286.6914, "train_tokens_per_second": 425.598 }, { "epoch": 1.1089860027780745, "grad_norm": 2.8126838207244873, "learning_rate": 8.924064171122996e-06, "loss": 0.08973577618598938, "num_input_tokens_seen": 2676792, "step": 2595, "train_runtime": 6288.8056, "train_tokens_per_second": 425.644 }, { "epoch": 1.1094133988674004, "grad_norm": 1.8998647928237915, "learning_rate": 8.919786096256686e-06, "loss": 0.06264329701662064, "num_input_tokens_seen": 2677698, "step": 2596, "train_runtime": 6290.8786, "train_tokens_per_second": 425.648 }, { "epoch": 1.1098407949567262, "grad_norm": 2.1570041179656982, "learning_rate": 8.915508021390375e-06, "loss": 0.07515907287597656, "num_input_tokens_seen": 2678702, "step": 2597, "train_runtime": 6292.9884, "train_tokens_per_second": 425.665 }, { "epoch": 1.110268191046052, "grad_norm": 2.8820595741271973, "learning_rate": 8.911229946524065e-06, "loss": 0.08067453652620316, "num_input_tokens_seen": 2679418, "step": 2598, "train_runtime": 6295.0155, "train_tokens_per_second": 425.641 }, { "epoch": 1.1106955871353776, "grad_norm": 3.3006863594055176, "learning_rate": 8.906951871657756e-06, "loss": 0.10144171118736267, "num_input_tokens_seen": 2681012, "step": 2599, "train_runtime": 6297.218, "train_tokens_per_second": 425.745 }, { "epoch": 1.1111229832247036, "grad_norm": 2.3386714458465576, "learning_rate": 8.902673796791445e-06, "loss": 0.07165563106536865, "num_input_tokens_seen": 2682632, "step": 2600, "train_runtime": 6299.4293, "train_tokens_per_second": 425.853 }, { "epoch": 1.1115503793140293, "grad_norm": 3.2718570232391357, "learning_rate": 8.898395721925135e-06, "loss": 0.0888989195227623, "num_input_tokens_seen": 2683340, "step": 2601, "train_runtime": 6301.4961, "train_tokens_per_second": 425.826 }, { "epoch": 1.111977775403355, "grad_norm": 2.0718796253204346, "learning_rate": 8.894117647058824e-06, "loss": 0.08921791613101959, "num_input_tokens_seen": 2684648, "step": 2602, "train_runtime": 6303.6537, "train_tokens_per_second": 425.888 }, { "epoch": 1.1124051714926808, "grad_norm": 1.9214931726455688, "learning_rate": 8.889839572192515e-06, "loss": 0.04138598591089249, "num_input_tokens_seen": 2685516, "step": 2603, "train_runtime": 6305.696, "train_tokens_per_second": 425.887 }, { "epoch": 1.1128325675820065, "grad_norm": 3.3434629440307617, "learning_rate": 8.885561497326203e-06, "loss": 0.10868586599826813, "num_input_tokens_seen": 2686648, "step": 2604, "train_runtime": 6307.9632, "train_tokens_per_second": 425.914 }, { "epoch": 1.1132599636713325, "grad_norm": 2.715587615966797, "learning_rate": 8.881283422459894e-06, "loss": 0.08680950105190277, "num_input_tokens_seen": 2687476, "step": 2605, "train_runtime": 6310.0101, "train_tokens_per_second": 425.907 }, { "epoch": 1.1136873597606582, "grad_norm": 3.1198415756225586, "learning_rate": 8.877005347593584e-06, "loss": 0.1386384665966034, "num_input_tokens_seen": 2688386, "step": 2606, "train_runtime": 6312.0721, "train_tokens_per_second": 425.912 }, { "epoch": 1.114114755849984, "grad_norm": 3.0754501819610596, "learning_rate": 8.872727272727275e-06, "loss": 0.07827456295490265, "num_input_tokens_seen": 2689104, "step": 2607, "train_runtime": 6314.0712, "train_tokens_per_second": 425.891 }, { "epoch": 1.1145421519393097, "grad_norm": 2.766815662384033, "learning_rate": 8.868449197860963e-06, "loss": 0.06242305040359497, "num_input_tokens_seen": 2689726, "step": 2608, "train_runtime": 6316.1329, "train_tokens_per_second": 425.85 }, { "epoch": 1.1149695480286355, "grad_norm": 2.9260456562042236, "learning_rate": 8.864171122994654e-06, "loss": 0.06722096353769302, "num_input_tokens_seen": 2690360, "step": 2609, "train_runtime": 6318.0746, "train_tokens_per_second": 425.82 }, { "epoch": 1.1153969441179614, "grad_norm": 2.6466591358184814, "learning_rate": 8.859893048128343e-06, "loss": 0.08745411783456802, "num_input_tokens_seen": 2691242, "step": 2610, "train_runtime": 6320.1518, "train_tokens_per_second": 425.819 }, { "epoch": 1.1158243402072872, "grad_norm": 2.320122718811035, "learning_rate": 8.855614973262033e-06, "loss": 0.04856119304895401, "num_input_tokens_seen": 2691864, "step": 2611, "train_runtime": 6328.8607, "train_tokens_per_second": 425.332 }, { "epoch": 1.116251736296613, "grad_norm": 3.1276562213897705, "learning_rate": 8.851336898395722e-06, "loss": 0.12471344321966171, "num_input_tokens_seen": 2692834, "step": 2612, "train_runtime": 6330.9446, "train_tokens_per_second": 425.345 }, { "epoch": 1.1166791323859386, "grad_norm": 3.37678861618042, "learning_rate": 8.847058823529413e-06, "loss": 0.060979779809713364, "num_input_tokens_seen": 2693766, "step": 2613, "train_runtime": 6333.0852, "train_tokens_per_second": 425.348 }, { "epoch": 1.1171065284752644, "grad_norm": 3.7843270301818848, "learning_rate": 8.842780748663103e-06, "loss": 0.09330800175666809, "num_input_tokens_seen": 2694898, "step": 2614, "train_runtime": 6335.2651, "train_tokens_per_second": 425.38 }, { "epoch": 1.1175339245645903, "grad_norm": 4.6900715827941895, "learning_rate": 8.838502673796792e-06, "loss": 0.13932695984840393, "num_input_tokens_seen": 2695682, "step": 2615, "train_runtime": 6337.2889, "train_tokens_per_second": 425.368 }, { "epoch": 1.117961320653916, "grad_norm": 2.6678571701049805, "learning_rate": 8.834224598930481e-06, "loss": 0.10771764814853668, "num_input_tokens_seen": 2696650, "step": 2616, "train_runtime": 6339.3926, "train_tokens_per_second": 425.38 }, { "epoch": 1.1183887167432418, "grad_norm": 2.3856754302978516, "learning_rate": 8.829946524064171e-06, "loss": 0.06541471183300018, "num_input_tokens_seen": 2697664, "step": 2617, "train_runtime": 6341.512, "train_tokens_per_second": 425.398 }, { "epoch": 1.1188161128325675, "grad_norm": 2.3845884799957275, "learning_rate": 8.825668449197862e-06, "loss": 0.08822523057460785, "num_input_tokens_seen": 2698754, "step": 2618, "train_runtime": 6343.6211, "train_tokens_per_second": 425.428 }, { "epoch": 1.1192435089218933, "grad_norm": 3.557136058807373, "learning_rate": 8.821390374331552e-06, "loss": 0.08408638834953308, "num_input_tokens_seen": 2699628, "step": 2619, "train_runtime": 6345.6715, "train_tokens_per_second": 425.428 }, { "epoch": 1.1196709050112192, "grad_norm": 2.9850730895996094, "learning_rate": 8.817112299465241e-06, "loss": 0.048864059150218964, "num_input_tokens_seen": 2700306, "step": 2620, "train_runtime": 6347.6755, "train_tokens_per_second": 425.401 }, { "epoch": 1.120098301100545, "grad_norm": 2.5716195106506348, "learning_rate": 8.81283422459893e-06, "loss": 0.06911540031433105, "num_input_tokens_seen": 2701082, "step": 2621, "train_runtime": 6349.7376, "train_tokens_per_second": 425.385 }, { "epoch": 1.1205256971898707, "grad_norm": 2.721938371658325, "learning_rate": 8.808556149732622e-06, "loss": 0.08100318908691406, "num_input_tokens_seen": 2701912, "step": 2622, "train_runtime": 6351.8767, "train_tokens_per_second": 425.372 }, { "epoch": 1.1209530932791965, "grad_norm": 2.389178991317749, "learning_rate": 8.804278074866311e-06, "loss": 0.11711670458316803, "num_input_tokens_seen": 2703786, "step": 2623, "train_runtime": 6354.3501, "train_tokens_per_second": 425.502 }, { "epoch": 1.1213804893685222, "grad_norm": 2.9732987880706787, "learning_rate": 8.8e-06, "loss": 0.1260043829679489, "num_input_tokens_seen": 2705028, "step": 2624, "train_runtime": 6356.497, "train_tokens_per_second": 425.553 }, { "epoch": 1.1218078854578482, "grad_norm": 2.8061492443084717, "learning_rate": 8.79572192513369e-06, "loss": 0.0765015110373497, "num_input_tokens_seen": 2706344, "step": 2625, "train_runtime": 6358.6317, "train_tokens_per_second": 425.617 }, { "epoch": 1.122235281547174, "grad_norm": 3.7093279361724854, "learning_rate": 8.791443850267381e-06, "loss": 0.09670396894216537, "num_input_tokens_seen": 2707206, "step": 2626, "train_runtime": 6360.6675, "train_tokens_per_second": 425.617 }, { "epoch": 1.1226626776364996, "grad_norm": 2.739389657974243, "learning_rate": 8.78716577540107e-06, "loss": 0.08371162414550781, "num_input_tokens_seen": 2708152, "step": 2627, "train_runtime": 6362.8322, "train_tokens_per_second": 425.621 }, { "epoch": 1.1230900737258254, "grad_norm": 2.908888816833496, "learning_rate": 8.78288770053476e-06, "loss": 0.11477210372686386, "num_input_tokens_seen": 2708942, "step": 2628, "train_runtime": 6364.8749, "train_tokens_per_second": 425.608 }, { "epoch": 1.123517469815151, "grad_norm": 3.44331955909729, "learning_rate": 8.77860962566845e-06, "loss": 0.1313876211643219, "num_input_tokens_seen": 2709744, "step": 2629, "train_runtime": 6366.9287, "train_tokens_per_second": 425.597 }, { "epoch": 1.123944865904477, "grad_norm": 2.745544672012329, "learning_rate": 8.77433155080214e-06, "loss": 0.04821210727095604, "num_input_tokens_seen": 2710754, "step": 2630, "train_runtime": 6369.0665, "train_tokens_per_second": 425.612 }, { "epoch": 1.1243722619938028, "grad_norm": 2.3741164207458496, "learning_rate": 8.77005347593583e-06, "loss": 0.05976215377449989, "num_input_tokens_seen": 2711878, "step": 2631, "train_runtime": 6371.2411, "train_tokens_per_second": 425.644 }, { "epoch": 1.1247996580831285, "grad_norm": 1.262378454208374, "learning_rate": 8.76577540106952e-06, "loss": 0.037514060735702515, "num_input_tokens_seen": 2713688, "step": 2632, "train_runtime": 6373.538, "train_tokens_per_second": 425.774 }, { "epoch": 1.1252270541724543, "grad_norm": 2.302104949951172, "learning_rate": 8.761497326203209e-06, "loss": 0.058407776057720184, "num_input_tokens_seen": 2714632, "step": 2633, "train_runtime": 6375.6249, "train_tokens_per_second": 425.783 }, { "epoch": 1.12565445026178, "grad_norm": 2.742218017578125, "learning_rate": 8.7572192513369e-06, "loss": 0.08033092319965363, "num_input_tokens_seen": 2715508, "step": 2634, "train_runtime": 6377.6985, "train_tokens_per_second": 425.782 }, { "epoch": 1.126081846351106, "grad_norm": 1.60816490650177, "learning_rate": 8.752941176470588e-06, "loss": 0.06637120246887207, "num_input_tokens_seen": 2717434, "step": 2635, "train_runtime": 6379.9872, "train_tokens_per_second": 425.931 }, { "epoch": 1.1265092424404317, "grad_norm": 2.022418975830078, "learning_rate": 8.748663101604279e-06, "loss": 0.039730578660964966, "num_input_tokens_seen": 2718092, "step": 2636, "train_runtime": 6381.9735, "train_tokens_per_second": 425.901 }, { "epoch": 1.1269366385297575, "grad_norm": 2.5975489616394043, "learning_rate": 8.744385026737968e-06, "loss": 0.11269330978393555, "num_input_tokens_seen": 2718962, "step": 2637, "train_runtime": 6384.0256, "train_tokens_per_second": 425.901 }, { "epoch": 1.1273640346190832, "grad_norm": 2.9667372703552246, "learning_rate": 8.740106951871658e-06, "loss": 0.09536286443471909, "num_input_tokens_seen": 2719680, "step": 2638, "train_runtime": 6386.0096, "train_tokens_per_second": 425.881 }, { "epoch": 1.127791430708409, "grad_norm": 2.3580756187438965, "learning_rate": 8.735828877005347e-06, "loss": 0.08065667003393173, "num_input_tokens_seen": 2720836, "step": 2639, "train_runtime": 6388.1295, "train_tokens_per_second": 425.921 }, { "epoch": 1.1282188267977349, "grad_norm": 3.448974609375, "learning_rate": 8.731550802139038e-06, "loss": 0.07800039649009705, "num_input_tokens_seen": 2722444, "step": 2640, "train_runtime": 6390.368, "train_tokens_per_second": 426.023 }, { "epoch": 1.1286462228870606, "grad_norm": 2.6232998371124268, "learning_rate": 8.727272727272728e-06, "loss": 0.10187067091464996, "num_input_tokens_seen": 2723656, "step": 2641, "train_runtime": 6398.7207, "train_tokens_per_second": 425.656 }, { "epoch": 1.1290736189763864, "grad_norm": 2.688281774520874, "learning_rate": 8.722994652406417e-06, "loss": 0.08508885651826859, "num_input_tokens_seen": 2724486, "step": 2642, "train_runtime": 6400.768, "train_tokens_per_second": 425.65 }, { "epoch": 1.129501015065712, "grad_norm": 2.871506690979004, "learning_rate": 8.718716577540107e-06, "loss": 0.09198738634586334, "num_input_tokens_seen": 2725294, "step": 2643, "train_runtime": 6402.9862, "train_tokens_per_second": 425.629 }, { "epoch": 1.1299284111550378, "grad_norm": 1.865782618522644, "learning_rate": 8.714438502673798e-06, "loss": 0.06879622489213943, "num_input_tokens_seen": 2726300, "step": 2644, "train_runtime": 6405.1109, "train_tokens_per_second": 425.644 }, { "epoch": 1.1303558072443638, "grad_norm": 2.213736057281494, "learning_rate": 8.710160427807487e-06, "loss": 0.04665439948439598, "num_input_tokens_seen": 2727268, "step": 2645, "train_runtime": 6407.1835, "train_tokens_per_second": 425.658 }, { "epoch": 1.1307832033336895, "grad_norm": 2.2345521450042725, "learning_rate": 8.705882352941177e-06, "loss": 0.06750096380710602, "num_input_tokens_seen": 2728296, "step": 2646, "train_runtime": 6409.2622, "train_tokens_per_second": 425.68 }, { "epoch": 1.1312105994230153, "grad_norm": 2.2993998527526855, "learning_rate": 8.701604278074866e-06, "loss": 0.0574868842959404, "num_input_tokens_seen": 2729002, "step": 2647, "train_runtime": 6411.2395, "train_tokens_per_second": 425.659 }, { "epoch": 1.131637995512341, "grad_norm": 2.5204601287841797, "learning_rate": 8.697326203208557e-06, "loss": 0.0829242691397667, "num_input_tokens_seen": 2730002, "step": 2648, "train_runtime": 6413.2911, "train_tokens_per_second": 425.679 }, { "epoch": 1.1320653916016667, "grad_norm": 2.1150095462799072, "learning_rate": 8.693048128342247e-06, "loss": 0.053915947675704956, "num_input_tokens_seen": 2730738, "step": 2649, "train_runtime": 6415.3685, "train_tokens_per_second": 425.656 }, { "epoch": 1.1324927876909927, "grad_norm": 2.3570218086242676, "learning_rate": 8.688770053475936e-06, "loss": 0.0937032625079155, "num_input_tokens_seen": 2731792, "step": 2650, "train_runtime": 6417.4365, "train_tokens_per_second": 425.683 }, { "epoch": 1.1329201837803184, "grad_norm": 2.1232759952545166, "learning_rate": 8.684491978609626e-06, "loss": 0.0683131068944931, "num_input_tokens_seen": 2732846, "step": 2651, "train_runtime": 6419.5167, "train_tokens_per_second": 425.709 }, { "epoch": 1.1333475798696442, "grad_norm": 3.5161032676696777, "learning_rate": 8.680213903743317e-06, "loss": 0.10581836104393005, "num_input_tokens_seen": 2733504, "step": 2652, "train_runtime": 6421.5291, "train_tokens_per_second": 425.678 }, { "epoch": 1.13377497595897, "grad_norm": 2.6642963886260986, "learning_rate": 8.675935828877006e-06, "loss": 0.11502748727798462, "num_input_tokens_seen": 2734658, "step": 2653, "train_runtime": 6423.637, "train_tokens_per_second": 425.718 }, { "epoch": 1.1342023720482959, "grad_norm": 3.2872936725616455, "learning_rate": 8.671657754010696e-06, "loss": 0.07190796732902527, "num_input_tokens_seen": 2735978, "step": 2654, "train_runtime": 6425.7813, "train_tokens_per_second": 425.781 }, { "epoch": 1.1346297681376216, "grad_norm": 2.496293544769287, "learning_rate": 8.667379679144385e-06, "loss": 0.07971389591693878, "num_input_tokens_seen": 2736868, "step": 2655, "train_runtime": 6427.8901, "train_tokens_per_second": 425.78 }, { "epoch": 1.1350571642269474, "grad_norm": 1.905638575553894, "learning_rate": 8.663101604278076e-06, "loss": 0.06217019259929657, "num_input_tokens_seen": 2737854, "step": 2656, "train_runtime": 6429.9512, "train_tokens_per_second": 425.797 }, { "epoch": 1.135484560316273, "grad_norm": 2.026752233505249, "learning_rate": 8.658823529411766e-06, "loss": 0.05629231780767441, "num_input_tokens_seen": 2738880, "step": 2657, "train_runtime": 6432.0445, "train_tokens_per_second": 425.818 }, { "epoch": 1.1359119564055988, "grad_norm": 2.248422622680664, "learning_rate": 8.654545454545455e-06, "loss": 0.07973220199346542, "num_input_tokens_seen": 2740298, "step": 2658, "train_runtime": 6434.1799, "train_tokens_per_second": 425.897 }, { "epoch": 1.1363393524949248, "grad_norm": 2.402320146560669, "learning_rate": 8.650267379679145e-06, "loss": 0.07679715007543564, "num_input_tokens_seen": 2741316, "step": 2659, "train_runtime": 6436.2256, "train_tokens_per_second": 425.92 }, { "epoch": 1.1367667485842505, "grad_norm": 1.8567861318588257, "learning_rate": 8.645989304812836e-06, "loss": 0.06722358614206314, "num_input_tokens_seen": 2742708, "step": 2660, "train_runtime": 6438.3815, "train_tokens_per_second": 425.993 }, { "epoch": 1.1371941446735763, "grad_norm": 1.8689320087432861, "learning_rate": 8.641711229946525e-06, "loss": 0.08618605881929398, "num_input_tokens_seen": 2744336, "step": 2661, "train_runtime": 6440.624, "train_tokens_per_second": 426.098 }, { "epoch": 1.137621540762902, "grad_norm": 3.4328114986419678, "learning_rate": 8.637433155080215e-06, "loss": 0.09289912134408951, "num_input_tokens_seen": 2745066, "step": 2662, "train_runtime": 6442.6775, "train_tokens_per_second": 426.075 }, { "epoch": 1.1380489368522277, "grad_norm": 3.1104848384857178, "learning_rate": 8.633155080213904e-06, "loss": 0.06772873550653458, "num_input_tokens_seen": 2745924, "step": 2663, "train_runtime": 6444.7059, "train_tokens_per_second": 426.074 }, { "epoch": 1.1384763329415537, "grad_norm": 2.6316936016082764, "learning_rate": 8.628877005347595e-06, "loss": 0.08098454028367996, "num_input_tokens_seen": 2746630, "step": 2664, "train_runtime": 6446.725, "train_tokens_per_second": 426.05 }, { "epoch": 1.1389037290308794, "grad_norm": 3.3403708934783936, "learning_rate": 8.624598930481285e-06, "loss": 0.10924291610717773, "num_input_tokens_seen": 2747370, "step": 2665, "train_runtime": 6448.749, "train_tokens_per_second": 426.031 }, { "epoch": 1.1393311251202052, "grad_norm": 2.9772796630859375, "learning_rate": 8.620320855614974e-06, "loss": 0.07570470869541168, "num_input_tokens_seen": 2748102, "step": 2666, "train_runtime": 6450.7652, "train_tokens_per_second": 426.012 }, { "epoch": 1.139758521209531, "grad_norm": 2.6464850902557373, "learning_rate": 8.616042780748664e-06, "loss": 0.09072837978601456, "num_input_tokens_seen": 2749400, "step": 2667, "train_runtime": 6452.8782, "train_tokens_per_second": 426.073 }, { "epoch": 1.1401859172988567, "grad_norm": 5.082932949066162, "learning_rate": 8.611764705882355e-06, "loss": 0.0968312919139862, "num_input_tokens_seen": 2750084, "step": 2668, "train_runtime": 6454.8914, "train_tokens_per_second": 426.047 }, { "epoch": 1.1406133133881826, "grad_norm": 3.5218236446380615, "learning_rate": 8.607486631016042e-06, "loss": 0.15223868191242218, "num_input_tokens_seen": 2750886, "step": 2669, "train_runtime": 6456.8996, "train_tokens_per_second": 426.038 }, { "epoch": 1.1410407094775084, "grad_norm": 2.667015790939331, "learning_rate": 8.603208556149734e-06, "loss": 0.0598151721060276, "num_input_tokens_seen": 2751730, "step": 2670, "train_runtime": 6458.9227, "train_tokens_per_second": 426.035 }, { "epoch": 1.141468105566834, "grad_norm": 3.0027811527252197, "learning_rate": 8.598930481283423e-06, "loss": 0.08696714788675308, "num_input_tokens_seen": 2752498, "step": 2671, "train_runtime": 6467.1559, "train_tokens_per_second": 425.612 }, { "epoch": 1.1418955016561598, "grad_norm": 3.6396684646606445, "learning_rate": 8.594652406417112e-06, "loss": 0.11685916781425476, "num_input_tokens_seen": 2753408, "step": 2672, "train_runtime": 6469.4547, "train_tokens_per_second": 425.601 }, { "epoch": 1.1423228977454856, "grad_norm": 2.986107110977173, "learning_rate": 8.590374331550802e-06, "loss": 0.07806456089019775, "num_input_tokens_seen": 2754882, "step": 2673, "train_runtime": 6471.6667, "train_tokens_per_second": 425.684 }, { "epoch": 1.1427502938348115, "grad_norm": 3.2590105533599854, "learning_rate": 8.586096256684493e-06, "loss": 0.10785083472728729, "num_input_tokens_seen": 2755630, "step": 2674, "train_runtime": 6473.6897, "train_tokens_per_second": 425.666 }, { "epoch": 1.1431776899241373, "grad_norm": 1.9124603271484375, "learning_rate": 8.581818181818183e-06, "loss": 0.05577567219734192, "num_input_tokens_seen": 2756786, "step": 2675, "train_runtime": 6475.801, "train_tokens_per_second": 425.706 }, { "epoch": 1.143605086013463, "grad_norm": 3.6917645931243896, "learning_rate": 8.577540106951872e-06, "loss": 0.1246538758277893, "num_input_tokens_seen": 2757538, "step": 2676, "train_runtime": 6477.7772, "train_tokens_per_second": 425.692 }, { "epoch": 1.1440324821027887, "grad_norm": 3.3652679920196533, "learning_rate": 8.573262032085561e-06, "loss": 0.08964797854423523, "num_input_tokens_seen": 2758364, "step": 2677, "train_runtime": 6479.8357, "train_tokens_per_second": 425.684 }, { "epoch": 1.1444598781921145, "grad_norm": 2.346606731414795, "learning_rate": 8.568983957219253e-06, "loss": 0.09359855949878693, "num_input_tokens_seen": 2759700, "step": 2678, "train_runtime": 6482.0281, "train_tokens_per_second": 425.746 }, { "epoch": 1.1448872742814404, "grad_norm": 2.363062620162964, "learning_rate": 8.564705882352942e-06, "loss": 0.08591769635677338, "num_input_tokens_seen": 2760600, "step": 2679, "train_runtime": 6484.0813, "train_tokens_per_second": 425.75 }, { "epoch": 1.1453146703707662, "grad_norm": 2.9432427883148193, "learning_rate": 8.560427807486631e-06, "loss": 0.06521814316511154, "num_input_tokens_seen": 2761468, "step": 2680, "train_runtime": 6486.1346, "train_tokens_per_second": 425.749 }, { "epoch": 1.145742066460092, "grad_norm": 2.3472490310668945, "learning_rate": 8.556149732620321e-06, "loss": 0.10987380892038345, "num_input_tokens_seen": 2762912, "step": 2681, "train_runtime": 6488.2761, "train_tokens_per_second": 425.831 }, { "epoch": 1.1461694625494177, "grad_norm": 2.527367353439331, "learning_rate": 8.551871657754012e-06, "loss": 0.11642409861087799, "num_input_tokens_seen": 2764704, "step": 2682, "train_runtime": 6490.5527, "train_tokens_per_second": 425.958 }, { "epoch": 1.1465968586387434, "grad_norm": 3.351578712463379, "learning_rate": 8.547593582887701e-06, "loss": 0.06724368780851364, "num_input_tokens_seen": 2765410, "step": 2683, "train_runtime": 6492.5737, "train_tokens_per_second": 425.934 }, { "epoch": 1.1470242547280693, "grad_norm": 5.102705001831055, "learning_rate": 8.543315508021391e-06, "loss": 0.1004955917596817, "num_input_tokens_seen": 2766048, "step": 2684, "train_runtime": 6494.5157, "train_tokens_per_second": 425.905 }, { "epoch": 1.147451650817395, "grad_norm": 2.7378604412078857, "learning_rate": 8.53903743315508e-06, "loss": 0.09332038462162018, "num_input_tokens_seen": 2766806, "step": 2685, "train_runtime": 6496.5741, "train_tokens_per_second": 425.887 }, { "epoch": 1.1478790469067208, "grad_norm": 3.1623332500457764, "learning_rate": 8.534759358288771e-06, "loss": 0.09608341753482819, "num_input_tokens_seen": 2767648, "step": 2686, "train_runtime": 6498.6526, "train_tokens_per_second": 425.88 }, { "epoch": 1.1483064429960466, "grad_norm": 2.330491781234741, "learning_rate": 8.530481283422461e-06, "loss": 0.07984799146652222, "num_input_tokens_seen": 2768678, "step": 2687, "train_runtime": 6500.7332, "train_tokens_per_second": 425.902 }, { "epoch": 1.1487338390853723, "grad_norm": 3.4615375995635986, "learning_rate": 8.52620320855615e-06, "loss": 0.09428500384092331, "num_input_tokens_seen": 2769744, "step": 2688, "train_runtime": 6502.8183, "train_tokens_per_second": 425.93 }, { "epoch": 1.1491612351746983, "grad_norm": 3.1374282836914062, "learning_rate": 8.52192513368984e-06, "loss": 0.08604272454977036, "num_input_tokens_seen": 2770574, "step": 2689, "train_runtime": 6504.8799, "train_tokens_per_second": 425.922 }, { "epoch": 1.149588631264024, "grad_norm": 3.0454697608947754, "learning_rate": 8.517647058823531e-06, "loss": 0.10294269770383835, "num_input_tokens_seen": 2771448, "step": 2690, "train_runtime": 6506.9302, "train_tokens_per_second": 425.923 }, { "epoch": 1.1500160273533497, "grad_norm": 2.3497512340545654, "learning_rate": 8.51336898395722e-06, "loss": 0.09156949073076248, "num_input_tokens_seen": 2772622, "step": 2691, "train_runtime": 6509.0753, "train_tokens_per_second": 425.963 }, { "epoch": 1.1504434234426755, "grad_norm": 2.533618688583374, "learning_rate": 8.50909090909091e-06, "loss": 0.11029275506734848, "num_input_tokens_seen": 2774894, "step": 2692, "train_runtime": 6511.4194, "train_tokens_per_second": 426.158 }, { "epoch": 1.1508708195320012, "grad_norm": 2.0940487384796143, "learning_rate": 8.5048128342246e-06, "loss": 0.07361536473035812, "num_input_tokens_seen": 2776040, "step": 2693, "train_runtime": 6513.5352, "train_tokens_per_second": 426.196 }, { "epoch": 1.1512982156213272, "grad_norm": 4.621926784515381, "learning_rate": 8.50053475935829e-06, "loss": 0.07593721151351929, "num_input_tokens_seen": 2777018, "step": 2694, "train_runtime": 6515.6224, "train_tokens_per_second": 426.209 }, { "epoch": 1.151725611710653, "grad_norm": 2.662271022796631, "learning_rate": 8.49625668449198e-06, "loss": 0.09287705272436142, "num_input_tokens_seen": 2778176, "step": 2695, "train_runtime": 6517.7711, "train_tokens_per_second": 426.246 }, { "epoch": 1.1521530077999786, "grad_norm": 2.8439338207244873, "learning_rate": 8.49197860962567e-06, "loss": 0.09059453010559082, "num_input_tokens_seen": 2778874, "step": 2696, "train_runtime": 6519.7935, "train_tokens_per_second": 426.221 }, { "epoch": 1.1525804038893044, "grad_norm": 2.749525785446167, "learning_rate": 8.487700534759359e-06, "loss": 0.09504384547472, "num_input_tokens_seen": 2780042, "step": 2697, "train_runtime": 6521.9089, "train_tokens_per_second": 426.262 }, { "epoch": 1.1530077999786301, "grad_norm": 5.511195182800293, "learning_rate": 8.48342245989305e-06, "loss": 0.0819120928645134, "num_input_tokens_seen": 2780980, "step": 2698, "train_runtime": 6523.9635, "train_tokens_per_second": 426.272 }, { "epoch": 1.153435196067956, "grad_norm": 3.184375286102295, "learning_rate": 8.47914438502674e-06, "loss": 0.11371450126171112, "num_input_tokens_seen": 2782024, "step": 2699, "train_runtime": 6526.0107, "train_tokens_per_second": 426.298 }, { "epoch": 1.1538625921572818, "grad_norm": 2.064286947250366, "learning_rate": 8.474866310160429e-06, "loss": 0.06332354247570038, "num_input_tokens_seen": 2782990, "step": 2700, "train_runtime": 6528.0638, "train_tokens_per_second": 426.312 }, { "epoch": 1.1542899882466076, "grad_norm": 2.1286580562591553, "learning_rate": 8.470588235294118e-06, "loss": 0.09445683658123016, "num_input_tokens_seen": 2784464, "step": 2701, "train_runtime": 6536.4883, "train_tokens_per_second": 425.988 }, { "epoch": 1.1547173843359333, "grad_norm": 2.6281023025512695, "learning_rate": 8.46631016042781e-06, "loss": 0.06909255683422089, "num_input_tokens_seen": 2785448, "step": 2702, "train_runtime": 6538.6702, "train_tokens_per_second": 425.996 }, { "epoch": 1.155144780425259, "grad_norm": 2.761331558227539, "learning_rate": 8.462032085561497e-06, "loss": 0.09310590475797653, "num_input_tokens_seen": 2786576, "step": 2703, "train_runtime": 6540.8249, "train_tokens_per_second": 426.028 }, { "epoch": 1.155572176514585, "grad_norm": 2.4722471237182617, "learning_rate": 8.457754010695188e-06, "loss": 0.06891348212957382, "num_input_tokens_seen": 2787722, "step": 2704, "train_runtime": 6542.9836, "train_tokens_per_second": 426.063 }, { "epoch": 1.1559995726039107, "grad_norm": 2.4333081245422363, "learning_rate": 8.453475935828878e-06, "loss": 0.043512776494026184, "num_input_tokens_seen": 2788436, "step": 2705, "train_runtime": 6544.995, "train_tokens_per_second": 426.041 }, { "epoch": 1.1564269686932365, "grad_norm": 2.408217191696167, "learning_rate": 8.449197860962567e-06, "loss": 0.06118273735046387, "num_input_tokens_seen": 2789302, "step": 2706, "train_runtime": 6547.1309, "train_tokens_per_second": 426.034 }, { "epoch": 1.1568543647825622, "grad_norm": 2.1128132343292236, "learning_rate": 8.444919786096257e-06, "loss": 0.06444979459047318, "num_input_tokens_seen": 2790432, "step": 2707, "train_runtime": 6549.2783, "train_tokens_per_second": 426.067 }, { "epoch": 1.157281760871888, "grad_norm": 2.234581470489502, "learning_rate": 8.440641711229948e-06, "loss": 0.11141036450862885, "num_input_tokens_seen": 2791456, "step": 2708, "train_runtime": 6551.3717, "train_tokens_per_second": 426.087 }, { "epoch": 1.157709156961214, "grad_norm": 2.561875820159912, "learning_rate": 8.436363636363637e-06, "loss": 0.061126306653022766, "num_input_tokens_seen": 2792190, "step": 2709, "train_runtime": 6553.3761, "train_tokens_per_second": 426.069 }, { "epoch": 1.1581365530505396, "grad_norm": 2.9232470989227295, "learning_rate": 8.432085561497327e-06, "loss": 0.09107153117656708, "num_input_tokens_seen": 2793306, "step": 2710, "train_runtime": 6555.4848, "train_tokens_per_second": 426.102 }, { "epoch": 1.1585639491398654, "grad_norm": 2.189206600189209, "learning_rate": 8.427807486631016e-06, "loss": 0.06996691226959229, "num_input_tokens_seen": 2794326, "step": 2711, "train_runtime": 6557.5283, "train_tokens_per_second": 426.125 }, { "epoch": 1.1589913452291911, "grad_norm": 2.8513875007629395, "learning_rate": 8.423529411764707e-06, "loss": 0.08728228509426117, "num_input_tokens_seen": 2795218, "step": 2712, "train_runtime": 6559.5893, "train_tokens_per_second": 426.127 }, { "epoch": 1.1594187413185169, "grad_norm": 2.322314977645874, "learning_rate": 8.419251336898397e-06, "loss": 0.07986120879650116, "num_input_tokens_seen": 2796216, "step": 2713, "train_runtime": 6561.6983, "train_tokens_per_second": 426.142 }, { "epoch": 1.1598461374078428, "grad_norm": 2.479872465133667, "learning_rate": 8.414973262032086e-06, "loss": 0.06391402333974838, "num_input_tokens_seen": 2797098, "step": 2714, "train_runtime": 6563.7934, "train_tokens_per_second": 426.14 }, { "epoch": 1.1602735334971686, "grad_norm": 3.55705189704895, "learning_rate": 8.410695187165776e-06, "loss": 0.11364055424928665, "num_input_tokens_seen": 2797876, "step": 2715, "train_runtime": 6565.8271, "train_tokens_per_second": 426.127 }, { "epoch": 1.1607009295864943, "grad_norm": 2.6096415519714355, "learning_rate": 8.406417112299467e-06, "loss": 0.13401907682418823, "num_input_tokens_seen": 2798910, "step": 2716, "train_runtime": 6567.9125, "train_tokens_per_second": 426.149 }, { "epoch": 1.16112832567582, "grad_norm": 2.2043533325195312, "learning_rate": 8.402139037433156e-06, "loss": 0.09973882883787155, "num_input_tokens_seen": 2800148, "step": 2717, "train_runtime": 6570.0633, "train_tokens_per_second": 426.198 }, { "epoch": 1.1615557217651458, "grad_norm": 2.470081090927124, "learning_rate": 8.397860962566846e-06, "loss": 0.06988176703453064, "num_input_tokens_seen": 2800906, "step": 2718, "train_runtime": 6572.0754, "train_tokens_per_second": 426.183 }, { "epoch": 1.1619831178544717, "grad_norm": 3.067796230316162, "learning_rate": 8.393582887700535e-06, "loss": 0.0811307430267334, "num_input_tokens_seen": 2801718, "step": 2719, "train_runtime": 6574.0925, "train_tokens_per_second": 426.176 }, { "epoch": 1.1624105139437975, "grad_norm": 3.2505218982696533, "learning_rate": 8.389304812834226e-06, "loss": 0.08843886107206345, "num_input_tokens_seen": 2802420, "step": 2720, "train_runtime": 6576.1063, "train_tokens_per_second": 426.152 }, { "epoch": 1.1628379100331232, "grad_norm": 3.2225327491760254, "learning_rate": 8.385026737967916e-06, "loss": 0.06277766078710556, "num_input_tokens_seen": 2803038, "step": 2721, "train_runtime": 6578.0854, "train_tokens_per_second": 426.118 }, { "epoch": 1.163265306122449, "grad_norm": 2.3188552856445312, "learning_rate": 8.380748663101605e-06, "loss": 0.0782141387462616, "num_input_tokens_seen": 2804258, "step": 2722, "train_runtime": 6580.2041, "train_tokens_per_second": 426.166 }, { "epoch": 1.1636927022117747, "grad_norm": 3.044053316116333, "learning_rate": 8.376470588235295e-06, "loss": 0.07955057919025421, "num_input_tokens_seen": 2805078, "step": 2723, "train_runtime": 6582.2212, "train_tokens_per_second": 426.16 }, { "epoch": 1.1641200983011006, "grad_norm": 2.7747609615325928, "learning_rate": 8.372192513368986e-06, "loss": 0.09291289746761322, "num_input_tokens_seen": 2806074, "step": 2724, "train_runtime": 6584.3475, "train_tokens_per_second": 426.173 }, { "epoch": 1.1645474943904264, "grad_norm": 2.7635974884033203, "learning_rate": 8.367914438502675e-06, "loss": 0.11294674873352051, "num_input_tokens_seen": 2807284, "step": 2725, "train_runtime": 6586.4746, "train_tokens_per_second": 426.22 }, { "epoch": 1.1649748904797521, "grad_norm": 2.405041217803955, "learning_rate": 8.363636363636365e-06, "loss": 0.10040175169706345, "num_input_tokens_seen": 2808648, "step": 2726, "train_runtime": 6588.6336, "train_tokens_per_second": 426.287 }, { "epoch": 1.1654022865690778, "grad_norm": 2.0028679370880127, "learning_rate": 8.359358288770054e-06, "loss": 0.06233786419034004, "num_input_tokens_seen": 2809474, "step": 2727, "train_runtime": 6590.7363, "train_tokens_per_second": 426.276 }, { "epoch": 1.1658296826584036, "grad_norm": 2.261458396911621, "learning_rate": 8.355080213903743e-06, "loss": 0.07772679626941681, "num_input_tokens_seen": 2810370, "step": 2728, "train_runtime": 6592.7501, "train_tokens_per_second": 426.282 }, { "epoch": 1.1662570787477295, "grad_norm": 2.2100696563720703, "learning_rate": 8.350802139037435e-06, "loss": 0.058071255683898926, "num_input_tokens_seen": 2810972, "step": 2729, "train_runtime": 6594.7267, "train_tokens_per_second": 426.245 }, { "epoch": 1.1666844748370553, "grad_norm": 3.5097203254699707, "learning_rate": 8.346524064171122e-06, "loss": 0.1302880048751831, "num_input_tokens_seen": 2811980, "step": 2730, "train_runtime": 6596.8005, "train_tokens_per_second": 426.264 }, { "epoch": 1.167111870926381, "grad_norm": 2.097170352935791, "learning_rate": 8.342245989304813e-06, "loss": 0.07355550676584244, "num_input_tokens_seen": 2813264, "step": 2731, "train_runtime": 6605.1943, "train_tokens_per_second": 425.917 }, { "epoch": 1.1675392670157068, "grad_norm": 2.2746753692626953, "learning_rate": 8.337967914438503e-06, "loss": 0.12391360849142075, "num_input_tokens_seen": 2814760, "step": 2732, "train_runtime": 6607.3828, "train_tokens_per_second": 426.002 }, { "epoch": 1.1679666631050325, "grad_norm": 2.543454885482788, "learning_rate": 8.333689839572194e-06, "loss": 0.11102259904146194, "num_input_tokens_seen": 2815868, "step": 2733, "train_runtime": 6609.5243, "train_tokens_per_second": 426.032 }, { "epoch": 1.1683940591943585, "grad_norm": 1.7932102680206299, "learning_rate": 8.329411764705882e-06, "loss": 0.05068099498748779, "num_input_tokens_seen": 2816890, "step": 2734, "train_runtime": 6611.6147, "train_tokens_per_second": 426.052 }, { "epoch": 1.1688214552836842, "grad_norm": 2.764402151107788, "learning_rate": 8.325133689839573e-06, "loss": 0.10678049921989441, "num_input_tokens_seen": 2818174, "step": 2735, "train_runtime": 6613.8046, "train_tokens_per_second": 426.105 }, { "epoch": 1.16924885137301, "grad_norm": 2.8847622871398926, "learning_rate": 8.320855614973262e-06, "loss": 0.08096059411764145, "num_input_tokens_seen": 2819028, "step": 2736, "train_runtime": 6615.8217, "train_tokens_per_second": 426.104 }, { "epoch": 1.1696762474623357, "grad_norm": 3.2103450298309326, "learning_rate": 8.316577540106952e-06, "loss": 0.07069586962461472, "num_input_tokens_seen": 2819830, "step": 2737, "train_runtime": 6617.8693, "train_tokens_per_second": 426.093 }, { "epoch": 1.1701036435516614, "grad_norm": 3.4605236053466797, "learning_rate": 8.312299465240641e-06, "loss": 0.061676450073719025, "num_input_tokens_seen": 2820718, "step": 2738, "train_runtime": 6619.8791, "train_tokens_per_second": 426.098 }, { "epoch": 1.1705310396409874, "grad_norm": 2.972053289413452, "learning_rate": 8.308021390374332e-06, "loss": 0.07029437273740768, "num_input_tokens_seen": 2821584, "step": 2739, "train_runtime": 6621.9286, "train_tokens_per_second": 426.097 }, { "epoch": 1.170958435730313, "grad_norm": 1.8746734857559204, "learning_rate": 8.303743315508022e-06, "loss": 0.08134539425373077, "num_input_tokens_seen": 2822630, "step": 2740, "train_runtime": 6624.0504, "train_tokens_per_second": 426.118 }, { "epoch": 1.1713858318196388, "grad_norm": 2.3372225761413574, "learning_rate": 8.299465240641711e-06, "loss": 0.06283244490623474, "num_input_tokens_seen": 2823352, "step": 2741, "train_runtime": 6626.0721, "train_tokens_per_second": 426.097 }, { "epoch": 1.1718132279089646, "grad_norm": 2.5646891593933105, "learning_rate": 8.2951871657754e-06, "loss": 0.09890198707580566, "num_input_tokens_seen": 2824122, "step": 2742, "train_runtime": 6628.1503, "train_tokens_per_second": 426.08 }, { "epoch": 1.1722406239982903, "grad_norm": 2.6180989742279053, "learning_rate": 8.290909090909092e-06, "loss": 0.08496618270874023, "num_input_tokens_seen": 2825188, "step": 2743, "train_runtime": 6630.2503, "train_tokens_per_second": 426.106 }, { "epoch": 1.1726680200876163, "grad_norm": 2.235213279724121, "learning_rate": 8.286631016042781e-06, "loss": 0.07360003888607025, "num_input_tokens_seen": 2826222, "step": 2744, "train_runtime": 6632.357, "train_tokens_per_second": 426.126 }, { "epoch": 1.173095416176942, "grad_norm": 3.605175018310547, "learning_rate": 8.28235294117647e-06, "loss": 0.19582922756671906, "num_input_tokens_seen": 2827374, "step": 2745, "train_runtime": 6634.5316, "train_tokens_per_second": 426.16 }, { "epoch": 1.1735228122662678, "grad_norm": 1.8830177783966064, "learning_rate": 8.27807486631016e-06, "loss": 0.06456751376390457, "num_input_tokens_seen": 2828634, "step": 2746, "train_runtime": 6636.6692, "train_tokens_per_second": 426.213 }, { "epoch": 1.1739502083555935, "grad_norm": 2.407860040664673, "learning_rate": 8.273796791443851e-06, "loss": 0.07727548480033875, "num_input_tokens_seen": 2829646, "step": 2747, "train_runtime": 6638.745, "train_tokens_per_second": 426.232 }, { "epoch": 1.1743776044449192, "grad_norm": 2.4663100242614746, "learning_rate": 8.26951871657754e-06, "loss": 0.06858322024345398, "num_input_tokens_seen": 2830524, "step": 2748, "train_runtime": 6640.7949, "train_tokens_per_second": 426.233 }, { "epoch": 1.1748050005342452, "grad_norm": 2.6654489040374756, "learning_rate": 8.26524064171123e-06, "loss": 0.0849633663892746, "num_input_tokens_seen": 2831626, "step": 2749, "train_runtime": 6642.9837, "train_tokens_per_second": 426.258 }, { "epoch": 1.175232396623571, "grad_norm": 2.5251452922821045, "learning_rate": 8.26096256684492e-06, "loss": 0.07822896540164948, "num_input_tokens_seen": 2832630, "step": 2750, "train_runtime": 6645.1044, "train_tokens_per_second": 426.273 }, { "epoch": 1.1756597927128967, "grad_norm": 2.760608673095703, "learning_rate": 8.256684491978611e-06, "loss": 0.07572463154792786, "num_input_tokens_seen": 2833528, "step": 2751, "train_runtime": 6647.2435, "train_tokens_per_second": 426.271 }, { "epoch": 1.1760871888022224, "grad_norm": 4.295748710632324, "learning_rate": 8.2524064171123e-06, "loss": 0.19411985576152802, "num_input_tokens_seen": 2834838, "step": 2752, "train_runtime": 6649.4147, "train_tokens_per_second": 426.329 }, { "epoch": 1.1765145848915481, "grad_norm": 4.636139392852783, "learning_rate": 8.24812834224599e-06, "loss": 0.10699424892663956, "num_input_tokens_seen": 2835364, "step": 2753, "train_runtime": 6651.3976, "train_tokens_per_second": 426.281 }, { "epoch": 1.176941980980874, "grad_norm": 4.5621256828308105, "learning_rate": 8.24385026737968e-06, "loss": 0.07216803729534149, "num_input_tokens_seen": 2836190, "step": 2754, "train_runtime": 6653.4387, "train_tokens_per_second": 426.274 }, { "epoch": 1.1773693770701998, "grad_norm": 3.5223195552825928, "learning_rate": 8.23957219251337e-06, "loss": 0.11959582567214966, "num_input_tokens_seen": 2837530, "step": 2755, "train_runtime": 6655.6158, "train_tokens_per_second": 426.336 }, { "epoch": 1.1777967731595256, "grad_norm": 1.3998544216156006, "learning_rate": 8.23529411764706e-06, "loss": 0.0321936309337616, "num_input_tokens_seen": 2838744, "step": 2756, "train_runtime": 6657.7584, "train_tokens_per_second": 426.381 }, { "epoch": 1.1782241692488513, "grad_norm": 2.2441916465759277, "learning_rate": 8.23101604278075e-06, "loss": 0.07243187725543976, "num_input_tokens_seen": 2840084, "step": 2757, "train_runtime": 6659.9321, "train_tokens_per_second": 426.443 }, { "epoch": 1.178651565338177, "grad_norm": 2.9381752014160156, "learning_rate": 8.226737967914439e-06, "loss": 0.0765104591846466, "num_input_tokens_seen": 2840836, "step": 2758, "train_runtime": 6661.9433, "train_tokens_per_second": 426.428 }, { "epoch": 1.179078961427503, "grad_norm": 3.729572296142578, "learning_rate": 8.22245989304813e-06, "loss": 0.11705591529607773, "num_input_tokens_seen": 2841568, "step": 2759, "train_runtime": 6663.9319, "train_tokens_per_second": 426.41 }, { "epoch": 1.1795063575168288, "grad_norm": 2.775517702102661, "learning_rate": 8.21818181818182e-06, "loss": 0.10254961997270584, "num_input_tokens_seen": 2842698, "step": 2760, "train_runtime": 6666.0617, "train_tokens_per_second": 426.443 }, { "epoch": 1.1799337536061545, "grad_norm": 2.1451797485351562, "learning_rate": 8.213903743315509e-06, "loss": 0.048349082469940186, "num_input_tokens_seen": 2843516, "step": 2761, "train_runtime": 6674.7708, "train_tokens_per_second": 426.01 }, { "epoch": 1.1803611496954802, "grad_norm": 2.3256468772888184, "learning_rate": 8.209625668449198e-06, "loss": 0.06722051650285721, "num_input_tokens_seen": 2844970, "step": 2762, "train_runtime": 6677.0156, "train_tokens_per_second": 426.084 }, { "epoch": 1.180788545784806, "grad_norm": 2.4873950481414795, "learning_rate": 8.20534759358289e-06, "loss": 0.09393316507339478, "num_input_tokens_seen": 2846506, "step": 2763, "train_runtime": 6679.5456, "train_tokens_per_second": 426.153 }, { "epoch": 1.181215941874132, "grad_norm": 1.5685741901397705, "learning_rate": 8.201069518716577e-06, "loss": 0.04840708151459694, "num_input_tokens_seen": 2847884, "step": 2764, "train_runtime": 6681.6985, "train_tokens_per_second": 426.222 }, { "epoch": 1.1816433379634577, "grad_norm": 1.8305567502975464, "learning_rate": 8.196791443850268e-06, "loss": 0.046777788549661636, "num_input_tokens_seen": 2848890, "step": 2765, "train_runtime": 6683.8516, "train_tokens_per_second": 426.235 }, { "epoch": 1.1820707340527834, "grad_norm": 4.451944828033447, "learning_rate": 8.192513368983958e-06, "loss": 0.07781849801540375, "num_input_tokens_seen": 2850104, "step": 2766, "train_runtime": 6685.9593, "train_tokens_per_second": 426.282 }, { "epoch": 1.1824981301421091, "grad_norm": 3.108126401901245, "learning_rate": 8.188235294117649e-06, "loss": 0.09696676582098007, "num_input_tokens_seen": 2850980, "step": 2767, "train_runtime": 6688.04, "train_tokens_per_second": 426.28 }, { "epoch": 1.1829255262314349, "grad_norm": 3.0373806953430176, "learning_rate": 8.183957219251337e-06, "loss": 0.10651018470525742, "num_input_tokens_seen": 2851792, "step": 2768, "train_runtime": 6690.1046, "train_tokens_per_second": 426.27 }, { "epoch": 1.1833529223207608, "grad_norm": 3.0271189212799072, "learning_rate": 8.179679144385028e-06, "loss": 0.09459219872951508, "num_input_tokens_seen": 2852826, "step": 2769, "train_runtime": 6692.1904, "train_tokens_per_second": 426.292 }, { "epoch": 1.1837803184100866, "grad_norm": 2.09867262840271, "learning_rate": 8.175401069518717e-06, "loss": 0.0506097674369812, "num_input_tokens_seen": 2853612, "step": 2770, "train_runtime": 6694.2298, "train_tokens_per_second": 426.279 }, { "epoch": 1.1842077144994123, "grad_norm": 2.456977128982544, "learning_rate": 8.171122994652407e-06, "loss": 0.07622379064559937, "num_input_tokens_seen": 2855204, "step": 2771, "train_runtime": 6696.4379, "train_tokens_per_second": 426.377 }, { "epoch": 1.184635110588738, "grad_norm": 3.1064202785491943, "learning_rate": 8.166844919786096e-06, "loss": 0.0980147272348404, "num_input_tokens_seen": 2855986, "step": 2772, "train_runtime": 6698.5034, "train_tokens_per_second": 426.362 }, { "epoch": 1.1850625066780638, "grad_norm": 2.19614315032959, "learning_rate": 8.162566844919787e-06, "loss": 0.08231724798679352, "num_input_tokens_seen": 2857284, "step": 2773, "train_runtime": 6700.6889, "train_tokens_per_second": 426.416 }, { "epoch": 1.1854899027673897, "grad_norm": 2.7485785484313965, "learning_rate": 8.158288770053477e-06, "loss": 0.1170513853430748, "num_input_tokens_seen": 2858210, "step": 2774, "train_runtime": 6702.7348, "train_tokens_per_second": 426.424 }, { "epoch": 1.1859172988567155, "grad_norm": 2.576573371887207, "learning_rate": 8.154010695187166e-06, "loss": 0.06007217988371849, "num_input_tokens_seen": 2859000, "step": 2775, "train_runtime": 6704.7635, "train_tokens_per_second": 426.413 }, { "epoch": 1.1863446949460412, "grad_norm": 1.3909211158752441, "learning_rate": 8.149732620320855e-06, "loss": 0.060951970517635345, "num_input_tokens_seen": 2860828, "step": 2776, "train_runtime": 6707.0578, "train_tokens_per_second": 426.54 }, { "epoch": 1.186772091035367, "grad_norm": 1.9755957126617432, "learning_rate": 8.145454545454547e-06, "loss": 0.0752592608332634, "num_input_tokens_seen": 2862266, "step": 2777, "train_runtime": 6709.1942, "train_tokens_per_second": 426.618 }, { "epoch": 1.1871994871246927, "grad_norm": 2.978173017501831, "learning_rate": 8.141176470588236e-06, "loss": 0.08630026876926422, "num_input_tokens_seen": 2863318, "step": 2778, "train_runtime": 6711.2836, "train_tokens_per_second": 426.642 }, { "epoch": 1.1876268832140187, "grad_norm": 2.4868850708007812, "learning_rate": 8.136898395721926e-06, "loss": 0.07803753018379211, "num_input_tokens_seen": 2864534, "step": 2779, "train_runtime": 6713.3894, "train_tokens_per_second": 426.69 }, { "epoch": 1.1880542793033444, "grad_norm": 3.0123798847198486, "learning_rate": 8.132620320855615e-06, "loss": 0.09397991001605988, "num_input_tokens_seen": 2865628, "step": 2780, "train_runtime": 6715.5591, "train_tokens_per_second": 426.715 }, { "epoch": 1.1884816753926701, "grad_norm": 3.6068315505981445, "learning_rate": 8.128342245989306e-06, "loss": 0.08335354924201965, "num_input_tokens_seen": 2866434, "step": 2781, "train_runtime": 6717.62, "train_tokens_per_second": 426.704 }, { "epoch": 1.1889090714819959, "grad_norm": 2.3114826679229736, "learning_rate": 8.124064171122996e-06, "loss": 0.08412733674049377, "num_input_tokens_seen": 2867234, "step": 2782, "train_runtime": 6719.6404, "train_tokens_per_second": 426.695 }, { "epoch": 1.1893364675713216, "grad_norm": 1.8738144636154175, "learning_rate": 8.119786096256685e-06, "loss": 0.05668673291802406, "num_input_tokens_seen": 2868502, "step": 2783, "train_runtime": 6721.806, "train_tokens_per_second": 426.746 }, { "epoch": 1.1897638636606476, "grad_norm": 2.184523344039917, "learning_rate": 8.115508021390374e-06, "loss": 0.05665953829884529, "num_input_tokens_seen": 2869556, "step": 2784, "train_runtime": 6723.9139, "train_tokens_per_second": 426.769 }, { "epoch": 1.1901912597499733, "grad_norm": 11.423437118530273, "learning_rate": 8.111229946524066e-06, "loss": 0.15224233269691467, "num_input_tokens_seen": 2870234, "step": 2785, "train_runtime": 6725.9318, "train_tokens_per_second": 426.741 }, { "epoch": 1.190618655839299, "grad_norm": 4.016899585723877, "learning_rate": 8.106951871657755e-06, "loss": 0.12967631220817566, "num_input_tokens_seen": 2871520, "step": 2786, "train_runtime": 6728.0859, "train_tokens_per_second": 426.796 }, { "epoch": 1.1910460519286248, "grad_norm": 4.365553855895996, "learning_rate": 8.102673796791444e-06, "loss": 0.07771287113428116, "num_input_tokens_seen": 2872640, "step": 2787, "train_runtime": 6730.183, "train_tokens_per_second": 426.829 }, { "epoch": 1.1914734480179505, "grad_norm": 3.417193651199341, "learning_rate": 8.098395721925134e-06, "loss": 0.1463349163532257, "num_input_tokens_seen": 2873480, "step": 2788, "train_runtime": 6732.2374, "train_tokens_per_second": 426.824 }, { "epoch": 1.1919008441072765, "grad_norm": 2.8998706340789795, "learning_rate": 8.094117647058825e-06, "loss": 0.07339631766080856, "num_input_tokens_seen": 2874280, "step": 2789, "train_runtime": 6734.331, "train_tokens_per_second": 426.81 }, { "epoch": 1.1923282401966022, "grad_norm": 2.5318920612335205, "learning_rate": 8.089839572192515e-06, "loss": 0.08839103579521179, "num_input_tokens_seen": 2875268, "step": 2790, "train_runtime": 6736.4202, "train_tokens_per_second": 426.824 }, { "epoch": 1.192755636285928, "grad_norm": 2.553860902786255, "learning_rate": 8.085561497326204e-06, "loss": 0.058411236852407455, "num_input_tokens_seen": 2876370, "step": 2791, "train_runtime": 6745.2, "train_tokens_per_second": 426.432 }, { "epoch": 1.1931830323752537, "grad_norm": 3.8284435272216797, "learning_rate": 8.081283422459893e-06, "loss": 0.07421354204416275, "num_input_tokens_seen": 2877096, "step": 2792, "train_runtime": 6747.3774, "train_tokens_per_second": 426.402 }, { "epoch": 1.1936104284645794, "grad_norm": 2.812725305557251, "learning_rate": 8.077005347593585e-06, "loss": 0.0479869470000267, "num_input_tokens_seen": 2877996, "step": 2793, "train_runtime": 6749.4223, "train_tokens_per_second": 426.406 }, { "epoch": 1.1940378245539054, "grad_norm": 2.277679443359375, "learning_rate": 8.072727272727274e-06, "loss": 0.11525529623031616, "num_input_tokens_seen": 2880212, "step": 2794, "train_runtime": 6751.7729, "train_tokens_per_second": 426.586 }, { "epoch": 1.1944652206432311, "grad_norm": 2.6919076442718506, "learning_rate": 8.068449197860963e-06, "loss": 0.08185943961143494, "num_input_tokens_seen": 2881484, "step": 2795, "train_runtime": 6753.9589, "train_tokens_per_second": 426.636 }, { "epoch": 1.1948926167325569, "grad_norm": 2.5328187942504883, "learning_rate": 8.064171122994653e-06, "loss": 0.060951486229896545, "num_input_tokens_seen": 2882278, "step": 2796, "train_runtime": 6755.9624, "train_tokens_per_second": 426.627 }, { "epoch": 1.1953200128218826, "grad_norm": 2.5691261291503906, "learning_rate": 8.059893048128344e-06, "loss": 0.06906014680862427, "num_input_tokens_seen": 2883062, "step": 2797, "train_runtime": 6757.9392, "train_tokens_per_second": 426.619 }, { "epoch": 1.1957474089112083, "grad_norm": 2.6108224391937256, "learning_rate": 8.055614973262032e-06, "loss": 0.09330528974533081, "num_input_tokens_seen": 2883984, "step": 2798, "train_runtime": 6759.9875, "train_tokens_per_second": 426.626 }, { "epoch": 1.1961748050005343, "grad_norm": 1.9042527675628662, "learning_rate": 8.051336898395723e-06, "loss": 0.08516990393400192, "num_input_tokens_seen": 2885184, "step": 2799, "train_runtime": 6762.1257, "train_tokens_per_second": 426.668 }, { "epoch": 1.19660220108986, "grad_norm": 2.8938372135162354, "learning_rate": 8.047058823529412e-06, "loss": 0.08211921155452728, "num_input_tokens_seen": 2885868, "step": 2800, "train_runtime": 6764.1456, "train_tokens_per_second": 426.642 }, { "epoch": 1.1970295971791858, "grad_norm": 3.3418660163879395, "learning_rate": 8.042780748663103e-06, "loss": 0.1417672038078308, "num_input_tokens_seen": 2886680, "step": 2801, "train_runtime": 6766.1981, "train_tokens_per_second": 426.632 }, { "epoch": 1.1974569932685115, "grad_norm": 2.593707799911499, "learning_rate": 8.038502673796791e-06, "loss": 0.09683042019605637, "num_input_tokens_seen": 2887896, "step": 2802, "train_runtime": 6768.3142, "train_tokens_per_second": 426.679 }, { "epoch": 1.1978843893578373, "grad_norm": 3.104003667831421, "learning_rate": 8.034224598930482e-06, "loss": 0.07965659350156784, "num_input_tokens_seen": 2888794, "step": 2803, "train_runtime": 6770.3633, "train_tokens_per_second": 426.682 }, { "epoch": 1.1983117854471632, "grad_norm": 2.3621914386749268, "learning_rate": 8.029946524064172e-06, "loss": 0.08068880438804626, "num_input_tokens_seen": 2889590, "step": 2804, "train_runtime": 6772.3857, "train_tokens_per_second": 426.672 }, { "epoch": 1.198739181536489, "grad_norm": 2.863574504852295, "learning_rate": 8.025668449197861e-06, "loss": 0.08370157331228256, "num_input_tokens_seen": 2890482, "step": 2805, "train_runtime": 6774.5894, "train_tokens_per_second": 426.665 }, { "epoch": 1.1991665776258147, "grad_norm": 2.817122459411621, "learning_rate": 8.02139037433155e-06, "loss": 0.0956934466958046, "num_input_tokens_seen": 2891630, "step": 2806, "train_runtime": 6776.7469, "train_tokens_per_second": 426.699 }, { "epoch": 1.1995939737151404, "grad_norm": 3.1060221195220947, "learning_rate": 8.017112299465242e-06, "loss": 0.08639883249998093, "num_input_tokens_seen": 2892254, "step": 2807, "train_runtime": 6778.7606, "train_tokens_per_second": 426.664 }, { "epoch": 1.2000213698044662, "grad_norm": 2.6774814128875732, "learning_rate": 8.012834224598931e-06, "loss": 0.08912783861160278, "num_input_tokens_seen": 2893330, "step": 2808, "train_runtime": 6780.8837, "train_tokens_per_second": 426.689 }, { "epoch": 1.2000213698044662, "eval_loss": 0.5259655117988586, "eval_runtime": 57.9652, "eval_samples_per_second": 17.217, "eval_steps_per_second": 8.609, "num_input_tokens_seen": 2893330, "step": 2808 }, { "epoch": 1.2004487658937921, "grad_norm": 2.932251214981079, "learning_rate": 8.00855614973262e-06, "loss": 0.09680595993995667, "num_input_tokens_seen": 2894236, "step": 2809, "train_runtime": 6840.9917, "train_tokens_per_second": 423.073 }, { "epoch": 1.2008761619831179, "grad_norm": 2.613478422164917, "learning_rate": 8.00427807486631e-06, "loss": 0.08638087660074234, "num_input_tokens_seen": 2894932, "step": 2810, "train_runtime": 6843.0378, "train_tokens_per_second": 423.048 }, { "epoch": 1.2013035580724436, "grad_norm": 2.7075607776641846, "learning_rate": 8.000000000000001e-06, "loss": 0.07337787002325058, "num_input_tokens_seen": 2895814, "step": 2811, "train_runtime": 6845.0763, "train_tokens_per_second": 423.051 }, { "epoch": 1.2017309541617693, "grad_norm": 2.2449817657470703, "learning_rate": 7.99572192513369e-06, "loss": 0.04989093169569969, "num_input_tokens_seen": 2896538, "step": 2812, "train_runtime": 6847.1325, "train_tokens_per_second": 423.029 }, { "epoch": 1.2021583502510953, "grad_norm": 2.069969654083252, "learning_rate": 7.99144385026738e-06, "loss": 0.0585918165743351, "num_input_tokens_seen": 2897914, "step": 2813, "train_runtime": 6849.3239, "train_tokens_per_second": 423.095 }, { "epoch": 1.202585746340421, "grad_norm": 1.98743736743927, "learning_rate": 7.98716577540107e-06, "loss": 0.07523835450410843, "num_input_tokens_seen": 2899346, "step": 2814, "train_runtime": 6851.576, "train_tokens_per_second": 423.165 }, { "epoch": 1.2030131424297468, "grad_norm": 1.943057656288147, "learning_rate": 7.98288770053476e-06, "loss": 0.08707548677921295, "num_input_tokens_seen": 2900616, "step": 2815, "train_runtime": 6853.7493, "train_tokens_per_second": 423.216 }, { "epoch": 1.2034405385190725, "grad_norm": 2.1865179538726807, "learning_rate": 7.97860962566845e-06, "loss": 0.06938644498586655, "num_input_tokens_seen": 2901618, "step": 2816, "train_runtime": 6855.8715, "train_tokens_per_second": 423.231 }, { "epoch": 1.2038679346083982, "grad_norm": 2.6555259227752686, "learning_rate": 7.97433155080214e-06, "loss": 0.12925024330615997, "num_input_tokens_seen": 2902946, "step": 2817, "train_runtime": 6858.0646, "train_tokens_per_second": 423.289 }, { "epoch": 1.2042953306977242, "grad_norm": 3.136338472366333, "learning_rate": 7.970053475935829e-06, "loss": 0.11719761788845062, "num_input_tokens_seen": 2903788, "step": 2818, "train_runtime": 6860.1263, "train_tokens_per_second": 423.285 }, { "epoch": 1.20472272678705, "grad_norm": 3.271803379058838, "learning_rate": 7.96577540106952e-06, "loss": 0.12141872942447662, "num_input_tokens_seen": 2904648, "step": 2819, "train_runtime": 6862.2059, "train_tokens_per_second": 423.282 }, { "epoch": 1.2051501228763757, "grad_norm": 2.9585413932800293, "learning_rate": 7.96149732620321e-06, "loss": 0.08449549973011017, "num_input_tokens_seen": 2905460, "step": 2820, "train_runtime": 6864.2939, "train_tokens_per_second": 423.272 }, { "epoch": 1.2055775189657014, "grad_norm": 1.9990448951721191, "learning_rate": 7.9572192513369e-06, "loss": 0.03481731936335564, "num_input_tokens_seen": 2906738, "step": 2821, "train_runtime": 6873.0478, "train_tokens_per_second": 422.918 }, { "epoch": 1.2060049150550272, "grad_norm": 4.325561046600342, "learning_rate": 7.952941176470589e-06, "loss": 0.14037759602069855, "num_input_tokens_seen": 2907406, "step": 2822, "train_runtime": 6875.1591, "train_tokens_per_second": 422.886 }, { "epoch": 1.2064323111443531, "grad_norm": 3.248270034790039, "learning_rate": 7.94866310160428e-06, "loss": 0.1077517569065094, "num_input_tokens_seen": 2908332, "step": 2823, "train_runtime": 6877.2179, "train_tokens_per_second": 422.894 }, { "epoch": 1.2068597072336789, "grad_norm": 2.6697635650634766, "learning_rate": 7.94438502673797e-06, "loss": 0.070683054625988, "num_input_tokens_seen": 2909240, "step": 2824, "train_runtime": 6879.3102, "train_tokens_per_second": 422.897 }, { "epoch": 1.2072871033230046, "grad_norm": 6.151632785797119, "learning_rate": 7.940106951871659e-06, "loss": 0.10860487073659897, "num_input_tokens_seen": 2910630, "step": 2825, "train_runtime": 6881.5246, "train_tokens_per_second": 422.963 }, { "epoch": 1.2077144994123303, "grad_norm": 3.145603656768799, "learning_rate": 7.935828877005348e-06, "loss": 0.10445728152990341, "num_input_tokens_seen": 2911612, "step": 2826, "train_runtime": 6883.5792, "train_tokens_per_second": 422.979 }, { "epoch": 1.208141895501656, "grad_norm": 2.151937961578369, "learning_rate": 7.93155080213904e-06, "loss": 0.07243939489126205, "num_input_tokens_seen": 2912474, "step": 2827, "train_runtime": 6885.6675, "train_tokens_per_second": 422.976 }, { "epoch": 1.208569291590982, "grad_norm": 3.458822727203369, "learning_rate": 7.927272727272729e-06, "loss": 0.08526347577571869, "num_input_tokens_seen": 2913060, "step": 2828, "train_runtime": 6887.6348, "train_tokens_per_second": 422.941 }, { "epoch": 1.2089966876803078, "grad_norm": 1.8537195920944214, "learning_rate": 7.922994652406418e-06, "loss": 0.06046935170888901, "num_input_tokens_seen": 2914260, "step": 2829, "train_runtime": 6889.8436, "train_tokens_per_second": 422.979 }, { "epoch": 1.2094240837696335, "grad_norm": 2.420975923538208, "learning_rate": 7.918716577540108e-06, "loss": 0.06824178993701935, "num_input_tokens_seen": 2915114, "step": 2830, "train_runtime": 6891.9053, "train_tokens_per_second": 422.977 }, { "epoch": 1.2098514798589592, "grad_norm": 3.2608516216278076, "learning_rate": 7.914438502673799e-06, "loss": 0.11864794790744781, "num_input_tokens_seen": 2916100, "step": 2831, "train_runtime": 6893.9993, "train_tokens_per_second": 422.991 }, { "epoch": 1.210278875948285, "grad_norm": 2.302849054336548, "learning_rate": 7.910160427807486e-06, "loss": 0.05560072138905525, "num_input_tokens_seen": 2916866, "step": 2832, "train_runtime": 6896.0238, "train_tokens_per_second": 422.978 }, { "epoch": 1.210706272037611, "grad_norm": 2.91860294342041, "learning_rate": 7.905882352941176e-06, "loss": 0.09280073642730713, "num_input_tokens_seen": 2917742, "step": 2833, "train_runtime": 6898.0845, "train_tokens_per_second": 422.979 }, { "epoch": 1.2111336681269367, "grad_norm": 2.227351427078247, "learning_rate": 7.901604278074867e-06, "loss": 0.06476104259490967, "num_input_tokens_seen": 2918604, "step": 2834, "train_runtime": 6900.1122, "train_tokens_per_second": 422.979 }, { "epoch": 1.2115610642162624, "grad_norm": 2.196326732635498, "learning_rate": 7.897326203208556e-06, "loss": 0.06640642881393433, "num_input_tokens_seen": 2920110, "step": 2835, "train_runtime": 6902.3675, "train_tokens_per_second": 423.059 }, { "epoch": 1.2119884603055882, "grad_norm": 2.8386425971984863, "learning_rate": 7.893048128342246e-06, "loss": 0.07271026074886322, "num_input_tokens_seen": 2921072, "step": 2836, "train_runtime": 6904.445, "train_tokens_per_second": 423.071 }, { "epoch": 1.212415856394914, "grad_norm": 1.9981520175933838, "learning_rate": 7.888770053475935e-06, "loss": 0.06900268793106079, "num_input_tokens_seen": 2921936, "step": 2837, "train_runtime": 6906.5864, "train_tokens_per_second": 423.065 }, { "epoch": 1.2128432524842399, "grad_norm": 3.183472156524658, "learning_rate": 7.884491978609627e-06, "loss": 0.11748578399419785, "num_input_tokens_seen": 2922878, "step": 2838, "train_runtime": 6908.652, "train_tokens_per_second": 423.075 }, { "epoch": 1.2132706485735656, "grad_norm": 2.30401349067688, "learning_rate": 7.880213903743316e-06, "loss": 0.06798192858695984, "num_input_tokens_seen": 2923898, "step": 2839, "train_runtime": 6910.7447, "train_tokens_per_second": 423.094 }, { "epoch": 1.2136980446628913, "grad_norm": 2.8173458576202393, "learning_rate": 7.875935828877005e-06, "loss": 0.09715848416090012, "num_input_tokens_seen": 2924956, "step": 2840, "train_runtime": 6912.8286, "train_tokens_per_second": 423.12 }, { "epoch": 1.214125440752217, "grad_norm": 3.090378522872925, "learning_rate": 7.871657754010695e-06, "loss": 0.0925881564617157, "num_input_tokens_seen": 2925980, "step": 2841, "train_runtime": 6914.9945, "train_tokens_per_second": 423.136 }, { "epoch": 1.2145528368415428, "grad_norm": 1.9239747524261475, "learning_rate": 7.867379679144386e-06, "loss": 0.05939649045467377, "num_input_tokens_seen": 2926850, "step": 2842, "train_runtime": 6917.0602, "train_tokens_per_second": 423.135 }, { "epoch": 1.2149802329308688, "grad_norm": 2.0961647033691406, "learning_rate": 7.863101604278075e-06, "loss": 0.06744793057441711, "num_input_tokens_seen": 2927960, "step": 2843, "train_runtime": 6919.1564, "train_tokens_per_second": 423.167 }, { "epoch": 1.2154076290201945, "grad_norm": 1.948562502861023, "learning_rate": 7.858823529411765e-06, "loss": 0.06887713819742203, "num_input_tokens_seen": 2928870, "step": 2844, "train_runtime": 6921.2287, "train_tokens_per_second": 423.172 }, { "epoch": 1.2158350251095202, "grad_norm": 3.3425185680389404, "learning_rate": 7.854545454545454e-06, "loss": 0.09248197078704834, "num_input_tokens_seen": 2929656, "step": 2845, "train_runtime": 6923.2579, "train_tokens_per_second": 423.161 }, { "epoch": 1.216262421198846, "grad_norm": 2.802161455154419, "learning_rate": 7.850267379679145e-06, "loss": 0.08666430413722992, "num_input_tokens_seen": 2930468, "step": 2846, "train_runtime": 6925.34, "train_tokens_per_second": 423.151 }, { "epoch": 1.216689817288172, "grad_norm": 2.7891452312469482, "learning_rate": 7.845989304812835e-06, "loss": 0.09340118616819382, "num_input_tokens_seen": 2931556, "step": 2847, "train_runtime": 6927.428, "train_tokens_per_second": 423.181 }, { "epoch": 1.2171172133774977, "grad_norm": 3.0174384117126465, "learning_rate": 7.841711229946524e-06, "loss": 0.112044557929039, "num_input_tokens_seen": 2933032, "step": 2848, "train_runtime": 6929.655, "train_tokens_per_second": 423.258 }, { "epoch": 1.2175446094668234, "grad_norm": 1.6146427392959595, "learning_rate": 7.837433155080214e-06, "loss": 0.054093532264232635, "num_input_tokens_seen": 2934706, "step": 2849, "train_runtime": 6931.905, "train_tokens_per_second": 423.362 }, { "epoch": 1.2179720055561492, "grad_norm": 3.355799674987793, "learning_rate": 7.833155080213905e-06, "loss": 0.08320631086826324, "num_input_tokens_seen": 2935460, "step": 2850, "train_runtime": 6934.0113, "train_tokens_per_second": 423.342 }, { "epoch": 1.2183994016454749, "grad_norm": 3.227617025375366, "learning_rate": 7.828877005347594e-06, "loss": 0.09887047111988068, "num_input_tokens_seen": 2936298, "step": 2851, "train_runtime": 6942.6121, "train_tokens_per_second": 422.939 }, { "epoch": 1.2188267977348008, "grad_norm": 2.6629343032836914, "learning_rate": 7.824598930481284e-06, "loss": 0.09485273063182831, "num_input_tokens_seen": 2937282, "step": 2852, "train_runtime": 6944.7066, "train_tokens_per_second": 422.953 }, { "epoch": 1.2192541938241266, "grad_norm": 2.874451160430908, "learning_rate": 7.820320855614973e-06, "loss": 0.12541738152503967, "num_input_tokens_seen": 2938228, "step": 2853, "train_runtime": 6946.9853, "train_tokens_per_second": 422.95 }, { "epoch": 1.2196815899134523, "grad_norm": 2.3367838859558105, "learning_rate": 7.816042780748664e-06, "loss": 0.08747762441635132, "num_input_tokens_seen": 2939198, "step": 2854, "train_runtime": 6949.081, "train_tokens_per_second": 422.962 }, { "epoch": 1.220108986002778, "grad_norm": 2.5057122707366943, "learning_rate": 7.811764705882354e-06, "loss": 0.1256774663925171, "num_input_tokens_seen": 2940528, "step": 2855, "train_runtime": 6951.2715, "train_tokens_per_second": 423.02 }, { "epoch": 1.2205363820921038, "grad_norm": 1.9073731899261475, "learning_rate": 7.807486631016043e-06, "loss": 0.07260522991418839, "num_input_tokens_seen": 2942088, "step": 2856, "train_runtime": 6953.5375, "train_tokens_per_second": 423.107 }, { "epoch": 1.2209637781814298, "grad_norm": 2.3790485858917236, "learning_rate": 7.803208556149733e-06, "loss": 0.07577663660049438, "num_input_tokens_seen": 2943210, "step": 2857, "train_runtime": 6955.7918, "train_tokens_per_second": 423.131 }, { "epoch": 1.2213911742707555, "grad_norm": 2.46437406539917, "learning_rate": 7.798930481283424e-06, "loss": 0.0929187759757042, "num_input_tokens_seen": 2944140, "step": 2858, "train_runtime": 6957.9205, "train_tokens_per_second": 423.135 }, { "epoch": 1.2218185703600812, "grad_norm": 2.299267530441284, "learning_rate": 7.794652406417113e-06, "loss": 0.08529412746429443, "num_input_tokens_seen": 2945410, "step": 2859, "train_runtime": 6960.1128, "train_tokens_per_second": 423.184 }, { "epoch": 1.222245966449407, "grad_norm": 2.9004669189453125, "learning_rate": 7.790374331550803e-06, "loss": 0.0760367214679718, "num_input_tokens_seen": 2946102, "step": 2860, "train_runtime": 6962.1379, "train_tokens_per_second": 423.161 }, { "epoch": 1.2226733625387327, "grad_norm": 3.453859806060791, "learning_rate": 7.786096256684492e-06, "loss": 0.12871377170085907, "num_input_tokens_seen": 2946862, "step": 2861, "train_runtime": 6964.1342, "train_tokens_per_second": 423.148 }, { "epoch": 1.2231007586280587, "grad_norm": 2.486342430114746, "learning_rate": 7.781818181818183e-06, "loss": 0.10306844115257263, "num_input_tokens_seen": 2947706, "step": 2862, "train_runtime": 6966.2394, "train_tokens_per_second": 423.142 }, { "epoch": 1.2235281547173844, "grad_norm": 2.272264242172241, "learning_rate": 7.777540106951871e-06, "loss": 0.06444300711154938, "num_input_tokens_seen": 2948354, "step": 2863, "train_runtime": 6968.2818, "train_tokens_per_second": 423.111 }, { "epoch": 1.2239555508067101, "grad_norm": 2.3583831787109375, "learning_rate": 7.773262032085562e-06, "loss": 0.10618904232978821, "num_input_tokens_seen": 2949502, "step": 2864, "train_runtime": 6970.4429, "train_tokens_per_second": 423.144 }, { "epoch": 1.2243829468960359, "grad_norm": 2.199553966522217, "learning_rate": 7.768983957219252e-06, "loss": 0.06423413008451462, "num_input_tokens_seen": 2950512, "step": 2865, "train_runtime": 6972.5889, "train_tokens_per_second": 423.159 }, { "epoch": 1.2248103429853616, "grad_norm": 2.9690518379211426, "learning_rate": 7.764705882352941e-06, "loss": 0.0922478660941124, "num_input_tokens_seen": 2951136, "step": 2866, "train_runtime": 6974.6498, "train_tokens_per_second": 423.123 }, { "epoch": 1.2252377390746876, "grad_norm": 3.334764242172241, "learning_rate": 7.76042780748663e-06, "loss": 0.09897273033857346, "num_input_tokens_seen": 2952080, "step": 2867, "train_runtime": 6976.7405, "train_tokens_per_second": 423.132 }, { "epoch": 1.2256651351640133, "grad_norm": 3.082503080368042, "learning_rate": 7.756149732620322e-06, "loss": 0.10666782408952713, "num_input_tokens_seen": 2952916, "step": 2868, "train_runtime": 6978.811, "train_tokens_per_second": 423.126 }, { "epoch": 1.226092531253339, "grad_norm": 2.020904302597046, "learning_rate": 7.751871657754011e-06, "loss": 0.06418243050575256, "num_input_tokens_seen": 2953968, "step": 2869, "train_runtime": 6980.9706, "train_tokens_per_second": 423.146 }, { "epoch": 1.2265199273426648, "grad_norm": 1.7023288011550903, "learning_rate": 7.7475935828877e-06, "loss": 0.056084923446178436, "num_input_tokens_seen": 2955176, "step": 2870, "train_runtime": 6983.1604, "train_tokens_per_second": 423.186 }, { "epoch": 1.2269473234319905, "grad_norm": 2.5139248371124268, "learning_rate": 7.74331550802139e-06, "loss": 0.06824924796819687, "num_input_tokens_seen": 2956064, "step": 2871, "train_runtime": 6985.2952, "train_tokens_per_second": 423.184 }, { "epoch": 1.2273747195213165, "grad_norm": 2.359225034713745, "learning_rate": 7.739037433155081e-06, "loss": 0.11948101222515106, "num_input_tokens_seen": 2957632, "step": 2872, "train_runtime": 6987.5877, "train_tokens_per_second": 423.269 }, { "epoch": 1.2278021156106422, "grad_norm": 2.837101697921753, "learning_rate": 7.73475935828877e-06, "loss": 0.08400681614875793, "num_input_tokens_seen": 2958758, "step": 2873, "train_runtime": 6989.7942, "train_tokens_per_second": 423.297 }, { "epoch": 1.228229511699968, "grad_norm": 2.9417858123779297, "learning_rate": 7.73048128342246e-06, "loss": 0.08431512117385864, "num_input_tokens_seen": 2959658, "step": 2874, "train_runtime": 6992.1147, "train_tokens_per_second": 423.285 }, { "epoch": 1.2286569077892937, "grad_norm": 3.3938148021698, "learning_rate": 7.72620320855615e-06, "loss": 0.08296189457178116, "num_input_tokens_seen": 2960430, "step": 2875, "train_runtime": 6994.1423, "train_tokens_per_second": 423.273 }, { "epoch": 1.2290843038786194, "grad_norm": 2.680143356323242, "learning_rate": 7.72192513368984e-06, "loss": 0.08281657844781876, "num_input_tokens_seen": 2961544, "step": 2876, "train_runtime": 6996.2808, "train_tokens_per_second": 423.303 }, { "epoch": 1.2295116999679454, "grad_norm": 2.1526296138763428, "learning_rate": 7.71764705882353e-06, "loss": 0.0546220988035202, "num_input_tokens_seen": 2962492, "step": 2877, "train_runtime": 6998.3972, "train_tokens_per_second": 423.31 }, { "epoch": 1.2299390960572711, "grad_norm": 2.072197198867798, "learning_rate": 7.71336898395722e-06, "loss": 0.06942172348499298, "num_input_tokens_seen": 2964176, "step": 2878, "train_runtime": 7000.6483, "train_tokens_per_second": 423.415 }, { "epoch": 1.2303664921465969, "grad_norm": 4.803370475769043, "learning_rate": 7.709090909090909e-06, "loss": 0.13560105860233307, "num_input_tokens_seen": 2965500, "step": 2879, "train_runtime": 7002.8382, "train_tokens_per_second": 423.471 }, { "epoch": 1.2307938882359226, "grad_norm": 2.1142685413360596, "learning_rate": 7.7048128342246e-06, "loss": 0.07338854670524597, "num_input_tokens_seen": 2966462, "step": 2880, "train_runtime": 7004.9031, "train_tokens_per_second": 423.484 }, { "epoch": 1.2312212843252484, "grad_norm": 3.6128134727478027, "learning_rate": 7.70053475935829e-06, "loss": 0.13694776594638824, "num_input_tokens_seen": 2967170, "step": 2881, "train_runtime": 7013.7915, "train_tokens_per_second": 423.048 }, { "epoch": 1.2316486804145743, "grad_norm": 2.647808790206909, "learning_rate": 7.696256684491979e-06, "loss": 0.09182015806436539, "num_input_tokens_seen": 2968046, "step": 2882, "train_runtime": 7015.8816, "train_tokens_per_second": 423.047 }, { "epoch": 1.2320760765039, "grad_norm": 4.8416595458984375, "learning_rate": 7.691978609625669e-06, "loss": 0.10868735611438751, "num_input_tokens_seen": 2969132, "step": 2883, "train_runtime": 7017.9996, "train_tokens_per_second": 423.074 }, { "epoch": 1.2325034725932258, "grad_norm": 1.730046272277832, "learning_rate": 7.68770053475936e-06, "loss": 0.03846367076039314, "num_input_tokens_seen": 2969934, "step": 2884, "train_runtime": 7020.031, "train_tokens_per_second": 423.066 }, { "epoch": 1.2329308686825515, "grad_norm": 2.80712890625, "learning_rate": 7.683422459893049e-06, "loss": 0.10911154747009277, "num_input_tokens_seen": 2970916, "step": 2885, "train_runtime": 7022.1315, "train_tokens_per_second": 423.079 }, { "epoch": 1.2333582647718773, "grad_norm": 2.480966806411743, "learning_rate": 7.679144385026739e-06, "loss": 0.04873647540807724, "num_input_tokens_seen": 2971388, "step": 2886, "train_runtime": 7024.0936, "train_tokens_per_second": 423.028 }, { "epoch": 1.2337856608612032, "grad_norm": 2.168053388595581, "learning_rate": 7.674866310160428e-06, "loss": 0.06658559292554855, "num_input_tokens_seen": 2972326, "step": 2887, "train_runtime": 7026.2106, "train_tokens_per_second": 423.034 }, { "epoch": 1.234213056950529, "grad_norm": 2.040863037109375, "learning_rate": 7.670588235294119e-06, "loss": 0.06779739260673523, "num_input_tokens_seen": 2973542, "step": 2888, "train_runtime": 7028.3737, "train_tokens_per_second": 423.077 }, { "epoch": 1.2346404530398547, "grad_norm": 3.933476448059082, "learning_rate": 7.666310160427809e-06, "loss": 0.10543353110551834, "num_input_tokens_seen": 2974400, "step": 2889, "train_runtime": 7030.4384, "train_tokens_per_second": 423.075 }, { "epoch": 1.2350678491291804, "grad_norm": 2.114612102508545, "learning_rate": 7.662032085561498e-06, "loss": 0.08414778858423233, "num_input_tokens_seen": 2975368, "step": 2890, "train_runtime": 7032.5349, "train_tokens_per_second": 423.086 }, { "epoch": 1.2354952452185062, "grad_norm": 3.2001802921295166, "learning_rate": 7.657754010695187e-06, "loss": 0.10490871965885162, "num_input_tokens_seen": 2976270, "step": 2891, "train_runtime": 7034.6215, "train_tokens_per_second": 423.089 }, { "epoch": 1.2359226413078321, "grad_norm": 3.1953108310699463, "learning_rate": 7.653475935828879e-06, "loss": 0.1332489401102066, "num_input_tokens_seen": 2977472, "step": 2892, "train_runtime": 7036.7692, "train_tokens_per_second": 423.131 }, { "epoch": 1.2363500373971579, "grad_norm": 2.920745372772217, "learning_rate": 7.649197860962568e-06, "loss": 0.0834018886089325, "num_input_tokens_seen": 2978222, "step": 2893, "train_runtime": 7038.8256, "train_tokens_per_second": 423.113 }, { "epoch": 1.2367774334864836, "grad_norm": 3.159118175506592, "learning_rate": 7.644919786096258e-06, "loss": 0.1104327142238617, "num_input_tokens_seen": 2979364, "step": 2894, "train_runtime": 7041.0972, "train_tokens_per_second": 423.139 }, { "epoch": 1.2372048295758094, "grad_norm": 4.007479190826416, "learning_rate": 7.640641711229947e-06, "loss": 0.2195119857788086, "num_input_tokens_seen": 2981078, "step": 2895, "train_runtime": 7043.418, "train_tokens_per_second": 423.243 }, { "epoch": 1.237632225665135, "grad_norm": 2.6207010746002197, "learning_rate": 7.636363636363638e-06, "loss": 0.06317804753780365, "num_input_tokens_seen": 2982150, "step": 2896, "train_runtime": 7045.539, "train_tokens_per_second": 423.268 }, { "epoch": 1.238059621754461, "grad_norm": 3.7198662757873535, "learning_rate": 7.632085561497326e-06, "loss": 0.1306927502155304, "num_input_tokens_seen": 2983030, "step": 2897, "train_runtime": 7047.5661, "train_tokens_per_second": 423.271 }, { "epoch": 1.2384870178437868, "grad_norm": 2.76037335395813, "learning_rate": 7.627807486631017e-06, "loss": 0.07866663485765457, "num_input_tokens_seen": 2983862, "step": 2898, "train_runtime": 7049.6245, "train_tokens_per_second": 423.265 }, { "epoch": 1.2389144139331125, "grad_norm": 2.6788196563720703, "learning_rate": 7.6235294117647064e-06, "loss": 0.08830566704273224, "num_input_tokens_seen": 2984688, "step": 2899, "train_runtime": 7051.7151, "train_tokens_per_second": 423.257 }, { "epoch": 1.2393418100224383, "grad_norm": 1.965596079826355, "learning_rate": 7.619251336898397e-06, "loss": 0.061684973537921906, "num_input_tokens_seen": 2985636, "step": 2900, "train_runtime": 7053.8301, "train_tokens_per_second": 423.265 }, { "epoch": 1.239769206111764, "grad_norm": 2.6278157234191895, "learning_rate": 7.614973262032086e-06, "loss": 0.09667761623859406, "num_input_tokens_seen": 2986676, "step": 2901, "train_runtime": 7055.9581, "train_tokens_per_second": 423.284 }, { "epoch": 1.24019660220109, "grad_norm": 3.1461708545684814, "learning_rate": 7.6106951871657765e-06, "loss": 0.06883089989423752, "num_input_tokens_seen": 2987500, "step": 2902, "train_runtime": 7058.024, "train_tokens_per_second": 423.277 }, { "epoch": 1.2406239982904157, "grad_norm": 3.065751552581787, "learning_rate": 7.606417112299466e-06, "loss": 0.09321364760398865, "num_input_tokens_seen": 2988562, "step": 2903, "train_runtime": 7060.0915, "train_tokens_per_second": 423.304 }, { "epoch": 1.2410513943797414, "grad_norm": 2.419569253921509, "learning_rate": 7.602139037433156e-06, "loss": 0.0910138189792633, "num_input_tokens_seen": 2989574, "step": 2904, "train_runtime": 7062.1784, "train_tokens_per_second": 423.322 }, { "epoch": 1.2414787904690672, "grad_norm": 2.703366279602051, "learning_rate": 7.597860962566846e-06, "loss": 0.08345609903335571, "num_input_tokens_seen": 2990368, "step": 2905, "train_runtime": 7064.2697, "train_tokens_per_second": 423.309 }, { "epoch": 1.241906186558393, "grad_norm": 2.8962366580963135, "learning_rate": 7.593582887700536e-06, "loss": 0.07367713749408722, "num_input_tokens_seen": 2991064, "step": 2906, "train_runtime": 7066.3487, "train_tokens_per_second": 423.283 }, { "epoch": 1.2423335826477189, "grad_norm": 3.0173261165618896, "learning_rate": 7.589304812834225e-06, "loss": 0.10552377998828888, "num_input_tokens_seen": 2991910, "step": 2907, "train_runtime": 7068.4292, "train_tokens_per_second": 423.278 }, { "epoch": 1.2427609787370446, "grad_norm": 2.7481191158294678, "learning_rate": 7.585026737967916e-06, "loss": 0.07555650174617767, "num_input_tokens_seen": 2992988, "step": 2908, "train_runtime": 7070.5554, "train_tokens_per_second": 423.303 }, { "epoch": 1.2431883748263703, "grad_norm": 3.0668375492095947, "learning_rate": 7.580748663101605e-06, "loss": 0.09716898202896118, "num_input_tokens_seen": 2993678, "step": 2909, "train_runtime": 7072.6108, "train_tokens_per_second": 423.278 }, { "epoch": 1.243615770915696, "grad_norm": 2.2745583057403564, "learning_rate": 7.576470588235295e-06, "loss": 0.09371167421340942, "num_input_tokens_seen": 2994882, "step": 2910, "train_runtime": 7074.7554, "train_tokens_per_second": 423.32 }, { "epoch": 1.2440431670050218, "grad_norm": 4.9229278564453125, "learning_rate": 7.572192513368984e-06, "loss": 0.08085934817790985, "num_input_tokens_seen": 2996036, "step": 2911, "train_runtime": 7083.6298, "train_tokens_per_second": 422.952 }, { "epoch": 1.2444705630943478, "grad_norm": 2.279939651489258, "learning_rate": 7.567914438502675e-06, "loss": 0.075149305164814, "num_input_tokens_seen": 2997060, "step": 2912, "train_runtime": 7085.8125, "train_tokens_per_second": 422.966 }, { "epoch": 1.2448979591836735, "grad_norm": 2.938504934310913, "learning_rate": 7.563636363636364e-06, "loss": 0.081467404961586, "num_input_tokens_seen": 2997792, "step": 2913, "train_runtime": 7088.2248, "train_tokens_per_second": 422.926 }, { "epoch": 1.2453253552729993, "grad_norm": 3.6294662952423096, "learning_rate": 7.559358288770055e-06, "loss": 0.10107357800006866, "num_input_tokens_seen": 2998780, "step": 2914, "train_runtime": 7090.346, "train_tokens_per_second": 422.938 }, { "epoch": 1.245752751362325, "grad_norm": 3.192488431930542, "learning_rate": 7.5550802139037435e-06, "loss": 0.12392017245292664, "num_input_tokens_seen": 2999772, "step": 2915, "train_runtime": 7092.5126, "train_tokens_per_second": 422.949 }, { "epoch": 1.2461801474516507, "grad_norm": 1.8792623281478882, "learning_rate": 7.550802139037434e-06, "loss": 0.05888255313038826, "num_input_tokens_seen": 3000612, "step": 2916, "train_runtime": 7094.5412, "train_tokens_per_second": 422.947 }, { "epoch": 1.2466075435409767, "grad_norm": 1.5301157236099243, "learning_rate": 7.546524064171123e-06, "loss": 0.0554562583565712, "num_input_tokens_seen": 3002066, "step": 2917, "train_runtime": 7096.7792, "train_tokens_per_second": 423.018 }, { "epoch": 1.2470349396303024, "grad_norm": 2.954228162765503, "learning_rate": 7.5422459893048135e-06, "loss": 0.07843967527151108, "num_input_tokens_seen": 3002924, "step": 2918, "train_runtime": 7098.8704, "train_tokens_per_second": 423.014 }, { "epoch": 1.2474623357196282, "grad_norm": 2.620840072631836, "learning_rate": 7.537967914438503e-06, "loss": 0.0982760339975357, "num_input_tokens_seen": 3004388, "step": 2919, "train_runtime": 7101.1239, "train_tokens_per_second": 423.086 }, { "epoch": 1.247889731808954, "grad_norm": 3.532559394836426, "learning_rate": 7.533689839572193e-06, "loss": 0.0948241576552391, "num_input_tokens_seen": 3005252, "step": 2920, "train_runtime": 7103.2083, "train_tokens_per_second": 423.084 }, { "epoch": 1.2483171278982796, "grad_norm": 3.34596586227417, "learning_rate": 7.529411764705883e-06, "loss": 0.12633314728736877, "num_input_tokens_seen": 3006376, "step": 2921, "train_runtime": 7105.3749, "train_tokens_per_second": 423.113 }, { "epoch": 1.2487445239876056, "grad_norm": 2.737436532974243, "learning_rate": 7.525133689839573e-06, "loss": 0.10718074440956116, "num_input_tokens_seen": 3007246, "step": 2922, "train_runtime": 7107.4403, "train_tokens_per_second": 423.112 }, { "epoch": 1.2491719200769313, "grad_norm": 2.073531150817871, "learning_rate": 7.5208556149732624e-06, "loss": 0.06771333515644073, "num_input_tokens_seen": 3008410, "step": 2923, "train_runtime": 7109.6154, "train_tokens_per_second": 423.147 }, { "epoch": 1.249599316166257, "grad_norm": 1.9747004508972168, "learning_rate": 7.516577540106953e-06, "loss": 0.04575204849243164, "num_input_tokens_seen": 3009346, "step": 2924, "train_runtime": 7111.6846, "train_tokens_per_second": 423.155 }, { "epoch": 1.2500267122555828, "grad_norm": 2.353694200515747, "learning_rate": 7.512299465240642e-06, "loss": 0.05825520679354668, "num_input_tokens_seen": 3010114, "step": 2925, "train_runtime": 7113.7438, "train_tokens_per_second": 423.141 }, { "epoch": 1.2504541083449086, "grad_norm": 4.099815845489502, "learning_rate": 7.5080213903743325e-06, "loss": 0.14841587841510773, "num_input_tokens_seen": 3011484, "step": 2926, "train_runtime": 7115.9249, "train_tokens_per_second": 423.203 }, { "epoch": 1.2508815044342345, "grad_norm": 2.272240400314331, "learning_rate": 7.503743315508022e-06, "loss": 0.08497324585914612, "num_input_tokens_seen": 3012460, "step": 2927, "train_runtime": 7118.0136, "train_tokens_per_second": 423.216 }, { "epoch": 1.2513089005235603, "grad_norm": 2.8117141723632812, "learning_rate": 7.499465240641712e-06, "loss": 0.12227321416139603, "num_input_tokens_seen": 3014190, "step": 2928, "train_runtime": 7120.292, "train_tokens_per_second": 423.324 }, { "epoch": 1.251736296612886, "grad_norm": 2.3796160221099854, "learning_rate": 7.495187165775402e-06, "loss": 0.04914858564734459, "num_input_tokens_seen": 3014772, "step": 2929, "train_runtime": 7122.287, "train_tokens_per_second": 423.287 }, { "epoch": 1.2521636927022117, "grad_norm": 1.7777422666549683, "learning_rate": 7.490909090909092e-06, "loss": 0.06682610511779785, "num_input_tokens_seen": 3016042, "step": 2930, "train_runtime": 7124.4403, "train_tokens_per_second": 423.337 }, { "epoch": 1.2525910887915375, "grad_norm": 3.665255069732666, "learning_rate": 7.486631016042781e-06, "loss": 0.06342610716819763, "num_input_tokens_seen": 3016976, "step": 2931, "train_runtime": 7126.5124, "train_tokens_per_second": 423.345 }, { "epoch": 1.2530184848808634, "grad_norm": 2.206355333328247, "learning_rate": 7.482352941176472e-06, "loss": 0.06764993816614151, "num_input_tokens_seen": 3017772, "step": 2932, "train_runtime": 7128.6174, "train_tokens_per_second": 423.332 }, { "epoch": 1.2534458809701892, "grad_norm": 3.052387237548828, "learning_rate": 7.478074866310161e-06, "loss": 0.07701212912797928, "num_input_tokens_seen": 3018610, "step": 2933, "train_runtime": 7130.6591, "train_tokens_per_second": 423.328 }, { "epoch": 1.253873277059515, "grad_norm": 2.3182268142700195, "learning_rate": 7.4737967914438514e-06, "loss": 0.1297970414161682, "num_input_tokens_seen": 3020178, "step": 2934, "train_runtime": 7132.8806, "train_tokens_per_second": 423.416 }, { "epoch": 1.2543006731488406, "grad_norm": 3.0166118144989014, "learning_rate": 7.469518716577541e-06, "loss": 0.08625024557113647, "num_input_tokens_seen": 3021060, "step": 2935, "train_runtime": 7134.9574, "train_tokens_per_second": 423.417 }, { "epoch": 1.2547280692381664, "grad_norm": 2.9842517375946045, "learning_rate": 7.465240641711231e-06, "loss": 0.11167801171541214, "num_input_tokens_seen": 3022448, "step": 2936, "train_runtime": 7137.1427, "train_tokens_per_second": 423.482 }, { "epoch": 1.2551554653274923, "grad_norm": 2.7223544120788574, "learning_rate": 7.460962566844921e-06, "loss": 0.04725995659828186, "num_input_tokens_seen": 3022992, "step": 2937, "train_runtime": 7139.0569, "train_tokens_per_second": 423.444 }, { "epoch": 1.255582861416818, "grad_norm": 3.089219808578491, "learning_rate": 7.456684491978611e-06, "loss": 0.10635600984096527, "num_input_tokens_seen": 3023878, "step": 2938, "train_runtime": 7141.1219, "train_tokens_per_second": 423.446 }, { "epoch": 1.2560102575061438, "grad_norm": 2.7573907375335693, "learning_rate": 7.4524064171123e-06, "loss": 0.13875748217105865, "num_input_tokens_seen": 3025130, "step": 2939, "train_runtime": 7143.2857, "train_tokens_per_second": 423.493 }, { "epoch": 1.2564376535954696, "grad_norm": 2.022953748703003, "learning_rate": 7.448128342245991e-06, "loss": 0.08140638470649719, "num_input_tokens_seen": 3026354, "step": 2940, "train_runtime": 7145.4656, "train_tokens_per_second": 423.535 }, { "epoch": 1.2568650496847953, "grad_norm": 3.272393226623535, "learning_rate": 7.44385026737968e-06, "loss": 0.13083159923553467, "num_input_tokens_seen": 3027380, "step": 2941, "train_runtime": 7154.2628, "train_tokens_per_second": 423.158 }, { "epoch": 1.2572924457741212, "grad_norm": 1.982572317123413, "learning_rate": 7.439572192513369e-06, "loss": 0.0995146706700325, "num_input_tokens_seen": 3029802, "step": 2942, "train_runtime": 7156.742, "train_tokens_per_second": 423.349 }, { "epoch": 1.257719841863447, "grad_norm": 3.10163950920105, "learning_rate": 7.43529411764706e-06, "loss": 0.09574081748723984, "num_input_tokens_seen": 3030454, "step": 2943, "train_runtime": 7158.7744, "train_tokens_per_second": 423.32 }, { "epoch": 1.2581472379527727, "grad_norm": 3.0127134323120117, "learning_rate": 7.4310160427807484e-06, "loss": 0.0781400054693222, "num_input_tokens_seen": 3031326, "step": 2944, "train_runtime": 7160.8464, "train_tokens_per_second": 423.32 }, { "epoch": 1.2585746340420985, "grad_norm": 1.9683183431625366, "learning_rate": 7.426737967914439e-06, "loss": 0.07526128739118576, "num_input_tokens_seen": 3032784, "step": 2945, "train_runtime": 7163.0844, "train_tokens_per_second": 423.391 }, { "epoch": 1.2590020301314242, "grad_norm": 2.7265121936798096, "learning_rate": 7.422459893048128e-06, "loss": 0.08381232619285583, "num_input_tokens_seen": 3033762, "step": 2946, "train_runtime": 7165.1435, "train_tokens_per_second": 423.406 }, { "epoch": 1.2594294262207502, "grad_norm": 2.7708404064178467, "learning_rate": 7.4181818181818185e-06, "loss": 0.10159067064523697, "num_input_tokens_seen": 3034694, "step": 2947, "train_runtime": 7167.2784, "train_tokens_per_second": 423.41 }, { "epoch": 1.259856822310076, "grad_norm": 2.539111852645874, "learning_rate": 7.413903743315508e-06, "loss": 0.10891447961330414, "num_input_tokens_seen": 3035730, "step": 2948, "train_runtime": 7169.4713, "train_tokens_per_second": 423.425 }, { "epoch": 1.2602842183994016, "grad_norm": 2.6784067153930664, "learning_rate": 7.409625668449198e-06, "loss": 0.10003319382667542, "num_input_tokens_seen": 3036538, "step": 2949, "train_runtime": 7171.6233, "train_tokens_per_second": 423.41 }, { "epoch": 1.2607116144887274, "grad_norm": 2.4050145149230957, "learning_rate": 7.405347593582888e-06, "loss": 0.08705523610115051, "num_input_tokens_seen": 3037786, "step": 2950, "train_runtime": 7173.8423, "train_tokens_per_second": 423.453 }, { "epoch": 1.261139010578053, "grad_norm": 3.7022290229797363, "learning_rate": 7.401069518716578e-06, "loss": 0.09694761782884598, "num_input_tokens_seen": 3038500, "step": 2951, "train_runtime": 7175.9263, "train_tokens_per_second": 423.43 }, { "epoch": 1.261566406667379, "grad_norm": 2.862175226211548, "learning_rate": 7.396791443850267e-06, "loss": 0.10729025304317474, "num_input_tokens_seen": 3039416, "step": 2952, "train_runtime": 7177.9955, "train_tokens_per_second": 423.435 }, { "epoch": 1.2619938027567048, "grad_norm": 2.244023561477661, "learning_rate": 7.392513368983958e-06, "loss": 0.05060585215687752, "num_input_tokens_seen": 3040176, "step": 2953, "train_runtime": 7180.1855, "train_tokens_per_second": 423.412 }, { "epoch": 1.2624211988460305, "grad_norm": 2.366894006729126, "learning_rate": 7.388235294117647e-06, "loss": 0.05431223660707474, "num_input_tokens_seen": 3041154, "step": 2954, "train_runtime": 7182.2722, "train_tokens_per_second": 423.425 }, { "epoch": 1.2628485949353563, "grad_norm": 3.590388536453247, "learning_rate": 7.383957219251337e-06, "loss": 0.10859466344118118, "num_input_tokens_seen": 3041974, "step": 2955, "train_runtime": 7184.3743, "train_tokens_per_second": 423.415 }, { "epoch": 1.263275991024682, "grad_norm": 2.237165927886963, "learning_rate": 7.379679144385027e-06, "loss": 0.07725930958986282, "num_input_tokens_seen": 3043170, "step": 2956, "train_runtime": 7186.5322, "train_tokens_per_second": 423.455 }, { "epoch": 1.263703387114008, "grad_norm": 2.8432765007019043, "learning_rate": 7.375401069518717e-06, "loss": 0.09574152529239655, "num_input_tokens_seen": 3044402, "step": 2957, "train_runtime": 7188.6796, "train_tokens_per_second": 423.499 }, { "epoch": 1.2641307832033337, "grad_norm": 2.175550699234009, "learning_rate": 7.371122994652407e-06, "loss": 0.06777040660381317, "num_input_tokens_seen": 3045510, "step": 2958, "train_runtime": 7190.8261, "train_tokens_per_second": 423.527 }, { "epoch": 1.2645581792926595, "grad_norm": 2.986528158187866, "learning_rate": 7.366844919786097e-06, "loss": 0.15197508037090302, "num_input_tokens_seen": 3046528, "step": 2959, "train_runtime": 7192.908, "train_tokens_per_second": 423.546 }, { "epoch": 1.2649855753819852, "grad_norm": 2.2462847232818604, "learning_rate": 7.362566844919786e-06, "loss": 0.07876642793416977, "num_input_tokens_seen": 3048014, "step": 2960, "train_runtime": 7195.1337, "train_tokens_per_second": 423.622 }, { "epoch": 1.265412971471311, "grad_norm": 2.8731985092163086, "learning_rate": 7.358288770053477e-06, "loss": 0.071068674325943, "num_input_tokens_seen": 3049246, "step": 2961, "train_runtime": 7197.2982, "train_tokens_per_second": 423.665 }, { "epoch": 1.265840367560637, "grad_norm": 3.0250935554504395, "learning_rate": 7.354010695187166e-06, "loss": 0.10351283103227615, "num_input_tokens_seen": 3050088, "step": 2962, "train_runtime": 7199.4573, "train_tokens_per_second": 423.655 }, { "epoch": 1.2662677636499626, "grad_norm": 2.763643264770508, "learning_rate": 7.349732620320856e-06, "loss": 0.07316923886537552, "num_input_tokens_seen": 3050988, "step": 2963, "train_runtime": 7201.552, "train_tokens_per_second": 423.657 }, { "epoch": 1.2666951597392884, "grad_norm": 2.818345785140991, "learning_rate": 7.345454545454546e-06, "loss": 0.08374558389186859, "num_input_tokens_seen": 3052072, "step": 2964, "train_runtime": 7203.67, "train_tokens_per_second": 423.683 }, { "epoch": 1.267122555828614, "grad_norm": 2.974126100540161, "learning_rate": 7.341176470588236e-06, "loss": 0.1368192881345749, "num_input_tokens_seen": 3052984, "step": 2965, "train_runtime": 7205.7308, "train_tokens_per_second": 423.688 }, { "epoch": 1.2675499519179398, "grad_norm": 2.4413678646087646, "learning_rate": 7.3368983957219256e-06, "loss": 0.062972292304039, "num_input_tokens_seen": 3053904, "step": 2966, "train_runtime": 7207.7925, "train_tokens_per_second": 423.695 }, { "epoch": 1.2679773480072658, "grad_norm": 2.8165433406829834, "learning_rate": 7.332620320855616e-06, "loss": 0.09501127898693085, "num_input_tokens_seen": 3054740, "step": 2967, "train_runtime": 7209.814, "train_tokens_per_second": 423.692 }, { "epoch": 1.2684047440965915, "grad_norm": 2.9385902881622314, "learning_rate": 7.328342245989305e-06, "loss": 0.10646688938140869, "num_input_tokens_seen": 3056286, "step": 2968, "train_runtime": 7212.0179, "train_tokens_per_second": 423.777 }, { "epoch": 1.2688321401859173, "grad_norm": 3.7117159366607666, "learning_rate": 7.324064171122996e-06, "loss": 0.09627954661846161, "num_input_tokens_seen": 3057050, "step": 2969, "train_runtime": 7214.0406, "train_tokens_per_second": 423.764 }, { "epoch": 1.269259536275243, "grad_norm": 1.66433846950531, "learning_rate": 7.319786096256685e-06, "loss": 0.06451142579317093, "num_input_tokens_seen": 3058172, "step": 2970, "train_runtime": 7216.1612, "train_tokens_per_second": 423.795 }, { "epoch": 1.2696869323645688, "grad_norm": 2.7369394302368164, "learning_rate": 7.315508021390375e-06, "loss": 0.08050864934921265, "num_input_tokens_seen": 3059114, "step": 2971, "train_runtime": 7225.0413, "train_tokens_per_second": 423.404 }, { "epoch": 1.2701143284538947, "grad_norm": 2.4905636310577393, "learning_rate": 7.311229946524065e-06, "loss": 0.06311958283185959, "num_input_tokens_seen": 3060174, "step": 2972, "train_runtime": 7227.11, "train_tokens_per_second": 423.43 }, { "epoch": 1.2705417245432205, "grad_norm": 2.404844284057617, "learning_rate": 7.306951871657755e-06, "loss": 0.05939580500125885, "num_input_tokens_seen": 3061080, "step": 2973, "train_runtime": 7229.3493, "train_tokens_per_second": 423.424 }, { "epoch": 1.2709691206325462, "grad_norm": 2.6710987091064453, "learning_rate": 7.302673796791444e-06, "loss": 0.13894209265708923, "num_input_tokens_seen": 3062558, "step": 2974, "train_runtime": 7231.5213, "train_tokens_per_second": 423.501 }, { "epoch": 1.271396516721872, "grad_norm": 2.849973201751709, "learning_rate": 7.298395721925135e-06, "loss": 0.11251353472471237, "num_input_tokens_seen": 3063870, "step": 2975, "train_runtime": 7233.708, "train_tokens_per_second": 423.555 }, { "epoch": 1.2718239128111977, "grad_norm": 2.4804179668426514, "learning_rate": 7.294117647058823e-06, "loss": 0.10212527215480804, "num_input_tokens_seen": 3064920, "step": 2976, "train_runtime": 7235.8292, "train_tokens_per_second": 423.576 }, { "epoch": 1.2722513089005236, "grad_norm": 3.3878254890441895, "learning_rate": 7.2898395721925145e-06, "loss": 0.20068228244781494, "num_input_tokens_seen": 3065972, "step": 2977, "train_runtime": 7237.9569, "train_tokens_per_second": 423.596 }, { "epoch": 1.2726787049898494, "grad_norm": 3.1920878887176514, "learning_rate": 7.285561497326203e-06, "loss": 0.11708036065101624, "num_input_tokens_seen": 3066740, "step": 2978, "train_runtime": 7239.973, "train_tokens_per_second": 423.584 }, { "epoch": 1.273106101079175, "grad_norm": 2.858785390853882, "learning_rate": 7.2812834224598934e-06, "loss": 0.11348709464073181, "num_input_tokens_seen": 3067800, "step": 2979, "train_runtime": 7242.1248, "train_tokens_per_second": 423.605 }, { "epoch": 1.2735334971685008, "grad_norm": 3.5289299488067627, "learning_rate": 7.277005347593583e-06, "loss": 0.11311467736959457, "num_input_tokens_seen": 3068474, "step": 2980, "train_runtime": 7244.1318, "train_tokens_per_second": 423.581 }, { "epoch": 1.2739608932578266, "grad_norm": 2.6099350452423096, "learning_rate": 7.272727272727273e-06, "loss": 0.08651623129844666, "num_input_tokens_seen": 3069356, "step": 2981, "train_runtime": 7246.255, "train_tokens_per_second": 423.578 }, { "epoch": 1.2743882893471525, "grad_norm": 2.4583418369293213, "learning_rate": 7.268449197860963e-06, "loss": 0.09893359988927841, "num_input_tokens_seen": 3070462, "step": 2982, "train_runtime": 7248.367, "train_tokens_per_second": 423.607 }, { "epoch": 1.2748156854364783, "grad_norm": 2.880175828933716, "learning_rate": 7.264171122994653e-06, "loss": 0.1534269005060196, "num_input_tokens_seen": 3071384, "step": 2983, "train_runtime": 7250.3815, "train_tokens_per_second": 423.617 }, { "epoch": 1.275243081525804, "grad_norm": 3.4426698684692383, "learning_rate": 7.259893048128342e-06, "loss": 0.0703113004565239, "num_input_tokens_seen": 3072138, "step": 2984, "train_runtime": 7252.3964, "train_tokens_per_second": 423.603 }, { "epoch": 1.2756704776151297, "grad_norm": 3.566863775253296, "learning_rate": 7.255614973262033e-06, "loss": 0.120570108294487, "num_input_tokens_seen": 3073342, "step": 2985, "train_runtime": 7254.5062, "train_tokens_per_second": 423.646 }, { "epoch": 1.2760978737044555, "grad_norm": 2.0629470348358154, "learning_rate": 7.251336898395722e-06, "loss": 0.050238534808158875, "num_input_tokens_seen": 3074396, "step": 2986, "train_runtime": 7256.5934, "train_tokens_per_second": 423.669 }, { "epoch": 1.2765252697937814, "grad_norm": 3.396526575088501, "learning_rate": 7.247058823529412e-06, "loss": 0.09168101102113724, "num_input_tokens_seen": 3075092, "step": 2987, "train_runtime": 7258.6006, "train_tokens_per_second": 423.648 }, { "epoch": 1.2769526658831072, "grad_norm": 2.337019443511963, "learning_rate": 7.242780748663102e-06, "loss": 0.07134734094142914, "num_input_tokens_seen": 3075776, "step": 2988, "train_runtime": 7260.6084, "train_tokens_per_second": 423.625 }, { "epoch": 1.277380061972433, "grad_norm": 2.160491704940796, "learning_rate": 7.238502673796792e-06, "loss": 0.10964909195899963, "num_input_tokens_seen": 3077336, "step": 2989, "train_runtime": 7262.8133, "train_tokens_per_second": 423.711 }, { "epoch": 1.2778074580617587, "grad_norm": 2.9258317947387695, "learning_rate": 7.2342245989304816e-06, "loss": 0.11585892736911774, "num_input_tokens_seen": 3078078, "step": 2990, "train_runtime": 7264.8889, "train_tokens_per_second": 423.692 }, { "epoch": 1.2782348541510844, "grad_norm": 2.223729133605957, "learning_rate": 7.229946524064172e-06, "loss": 0.054368749260902405, "num_input_tokens_seen": 3078888, "step": 2991, "train_runtime": 7266.8982, "train_tokens_per_second": 423.687 }, { "epoch": 1.2786622502404104, "grad_norm": 2.646707534790039, "learning_rate": 7.225668449197861e-06, "loss": 0.06866642832756042, "num_input_tokens_seen": 3079550, "step": 2992, "train_runtime": 7268.9418, "train_tokens_per_second": 423.659 }, { "epoch": 1.279089646329736, "grad_norm": 1.551003098487854, "learning_rate": 7.221390374331552e-06, "loss": 0.06737552583217621, "num_input_tokens_seen": 3081252, "step": 2993, "train_runtime": 7271.1833, "train_tokens_per_second": 423.762 }, { "epoch": 1.2795170424190618, "grad_norm": 4.425068378448486, "learning_rate": 7.217112299465241e-06, "loss": 0.18755845725536346, "num_input_tokens_seen": 3082642, "step": 2994, "train_runtime": 7273.4332, "train_tokens_per_second": 423.822 }, { "epoch": 1.2799444385083876, "grad_norm": 2.225693941116333, "learning_rate": 7.212834224598931e-06, "loss": 0.09273100644350052, "num_input_tokens_seen": 3083644, "step": 2995, "train_runtime": 7275.5686, "train_tokens_per_second": 423.835 }, { "epoch": 1.2803718345977133, "grad_norm": 2.2131972312927246, "learning_rate": 7.208556149732621e-06, "loss": 0.09236171841621399, "num_input_tokens_seen": 3085096, "step": 2996, "train_runtime": 7277.8116, "train_tokens_per_second": 423.904 }, { "epoch": 1.2807992306870393, "grad_norm": 2.118729591369629, "learning_rate": 7.204278074866311e-06, "loss": 0.0640028715133667, "num_input_tokens_seen": 3086270, "step": 2997, "train_runtime": 7279.9187, "train_tokens_per_second": 423.943 }, { "epoch": 1.281226626776365, "grad_norm": 2.5736396312713623, "learning_rate": 7.2000000000000005e-06, "loss": 0.07748084515333176, "num_input_tokens_seen": 3087164, "step": 2998, "train_runtime": 7281.9759, "train_tokens_per_second": 423.946 }, { "epoch": 1.2816540228656907, "grad_norm": 2.87827205657959, "learning_rate": 7.195721925133691e-06, "loss": 0.08067092299461365, "num_input_tokens_seen": 3087900, "step": 2999, "train_runtime": 7283.9746, "train_tokens_per_second": 423.931 }, { "epoch": 1.2820814189550165, "grad_norm": 2.8396527767181396, "learning_rate": 7.19144385026738e-06, "loss": 0.08095599710941315, "num_input_tokens_seen": 3088772, "step": 3000, "train_runtime": 7286.0723, "train_tokens_per_second": 423.928 }, { "epoch": 1.2825088150443422, "grad_norm": 2.690825939178467, "learning_rate": 7.1871657754010706e-06, "loss": 0.1062483862042427, "num_input_tokens_seen": 3089816, "step": 3001, "train_runtime": 7294.792, "train_tokens_per_second": 423.565 }, { "epoch": 1.2829362111336682, "grad_norm": 2.9456281661987305, "learning_rate": 7.18288770053476e-06, "loss": 0.11716188490390778, "num_input_tokens_seen": 3090760, "step": 3002, "train_runtime": 7296.8825, "train_tokens_per_second": 423.573 }, { "epoch": 1.283363607222994, "grad_norm": 2.6339001655578613, "learning_rate": 7.17860962566845e-06, "loss": 0.08602765947580338, "num_input_tokens_seen": 3091570, "step": 3003, "train_runtime": 7299.1123, "train_tokens_per_second": 423.554 }, { "epoch": 1.2837910033123197, "grad_norm": 3.105644941329956, "learning_rate": 7.17433155080214e-06, "loss": 0.08951435983181, "num_input_tokens_seen": 3092560, "step": 3004, "train_runtime": 7301.1614, "train_tokens_per_second": 423.571 }, { "epoch": 1.2842183994016454, "grad_norm": 1.7576477527618408, "learning_rate": 7.17005347593583e-06, "loss": 0.052186835557222366, "num_input_tokens_seen": 3094294, "step": 3005, "train_runtime": 7303.4429, "train_tokens_per_second": 423.676 }, { "epoch": 1.2846457954909711, "grad_norm": 2.681201696395874, "learning_rate": 7.1657754010695195e-06, "loss": 0.059617698192596436, "num_input_tokens_seen": 3095138, "step": 3006, "train_runtime": 7305.5214, "train_tokens_per_second": 423.671 }, { "epoch": 1.285073191580297, "grad_norm": 4.363328456878662, "learning_rate": 7.16149732620321e-06, "loss": 0.14670848846435547, "num_input_tokens_seen": 3095786, "step": 3007, "train_runtime": 7307.5178, "train_tokens_per_second": 423.644 }, { "epoch": 1.2855005876696228, "grad_norm": 2.1391069889068604, "learning_rate": 7.157219251336898e-06, "loss": 0.10724630951881409, "num_input_tokens_seen": 3097300, "step": 3008, "train_runtime": 7309.7184, "train_tokens_per_second": 423.724 }, { "epoch": 1.2859279837589486, "grad_norm": 3.1217257976531982, "learning_rate": 7.1529411764705895e-06, "loss": 0.09327880293130875, "num_input_tokens_seen": 3098856, "step": 3009, "train_runtime": 7311.9635, "train_tokens_per_second": 423.806 }, { "epoch": 1.2863553798482743, "grad_norm": 2.1741437911987305, "learning_rate": 7.148663101604278e-06, "loss": 0.05772768333554268, "num_input_tokens_seen": 3099682, "step": 3010, "train_runtime": 7314.0006, "train_tokens_per_second": 423.801 }, { "epoch": 1.2867827759376, "grad_norm": 2.7755205631256104, "learning_rate": 7.144385026737969e-06, "loss": 0.11665832996368408, "num_input_tokens_seen": 3100658, "step": 3011, "train_runtime": 7316.0977, "train_tokens_per_second": 423.813 }, { "epoch": 1.287210172026926, "grad_norm": 2.30713152885437, "learning_rate": 7.140106951871658e-06, "loss": 0.07408469170331955, "num_input_tokens_seen": 3101772, "step": 3012, "train_runtime": 7318.1514, "train_tokens_per_second": 423.846 }, { "epoch": 1.2876375681162517, "grad_norm": 2.4536685943603516, "learning_rate": 7.135828877005348e-06, "loss": 0.08536134660243988, "num_input_tokens_seen": 3102906, "step": 3013, "train_runtime": 7320.2379, "train_tokens_per_second": 423.88 }, { "epoch": 1.2880649642055775, "grad_norm": 3.521406412124634, "learning_rate": 7.131550802139038e-06, "loss": 0.10339319705963135, "num_input_tokens_seen": 3103976, "step": 3014, "train_runtime": 7322.3341, "train_tokens_per_second": 423.905 }, { "epoch": 1.2884923602949034, "grad_norm": 2.5345664024353027, "learning_rate": 7.127272727272728e-06, "loss": 0.10013153403997421, "num_input_tokens_seen": 3104932, "step": 3015, "train_runtime": 7324.401, "train_tokens_per_second": 423.916 }, { "epoch": 1.288919756384229, "grad_norm": 2.035928249359131, "learning_rate": 7.122994652406417e-06, "loss": 0.08597824722528458, "num_input_tokens_seen": 3105924, "step": 3016, "train_runtime": 7326.4888, "train_tokens_per_second": 423.931 }, { "epoch": 1.289347152473555, "grad_norm": 3.1361629962921143, "learning_rate": 7.118716577540108e-06, "loss": 0.11318005621433258, "num_input_tokens_seen": 3106784, "step": 3017, "train_runtime": 7328.5533, "train_tokens_per_second": 423.929 }, { "epoch": 1.2897745485628807, "grad_norm": 2.8527190685272217, "learning_rate": 7.114438502673797e-06, "loss": 0.09566424041986465, "num_input_tokens_seen": 3107672, "step": 3018, "train_runtime": 7330.6137, "train_tokens_per_second": 423.931 }, { "epoch": 1.2902019446522064, "grad_norm": 2.5158822536468506, "learning_rate": 7.110160427807487e-06, "loss": 0.07096898555755615, "num_input_tokens_seen": 3108620, "step": 3019, "train_runtime": 7332.6776, "train_tokens_per_second": 423.941 }, { "epoch": 1.2906293407415323, "grad_norm": 2.812882661819458, "learning_rate": 7.105882352941177e-06, "loss": 0.10749098658561707, "num_input_tokens_seen": 3109912, "step": 3020, "train_runtime": 7334.821, "train_tokens_per_second": 423.993 }, { "epoch": 1.2910567368308579, "grad_norm": 2.430882692337036, "learning_rate": 7.101604278074867e-06, "loss": 0.07211394608020782, "num_input_tokens_seen": 3110904, "step": 3021, "train_runtime": 7336.8693, "train_tokens_per_second": 424.01 }, { "epoch": 1.2914841329201838, "grad_norm": 2.4072933197021484, "learning_rate": 7.0973262032085565e-06, "loss": 0.08512874692678452, "num_input_tokens_seen": 3111826, "step": 3022, "train_runtime": 7338.9381, "train_tokens_per_second": 424.016 }, { "epoch": 1.2919115290095096, "grad_norm": 2.674919366836548, "learning_rate": 7.093048128342247e-06, "loss": 0.06882139295339584, "num_input_tokens_seen": 3112546, "step": 3023, "train_runtime": 7340.9654, "train_tokens_per_second": 423.997 }, { "epoch": 1.2923389250988353, "grad_norm": 2.1940455436706543, "learning_rate": 7.088770053475936e-06, "loss": 0.053770191967487335, "num_input_tokens_seen": 3113880, "step": 3024, "train_runtime": 7343.1515, "train_tokens_per_second": 424.052 }, { "epoch": 1.2927663211881613, "grad_norm": 2.0841023921966553, "learning_rate": 7.0844919786096266e-06, "loss": 0.06542058289051056, "num_input_tokens_seen": 3115018, "step": 3025, "train_runtime": 7345.3787, "train_tokens_per_second": 424.079 }, { "epoch": 1.2931937172774868, "grad_norm": 1.4411394596099854, "learning_rate": 7.080213903743316e-06, "loss": 0.044625215232372284, "num_input_tokens_seen": 3116772, "step": 3026, "train_runtime": 7347.7206, "train_tokens_per_second": 424.182 }, { "epoch": 1.2936211133668127, "grad_norm": 2.1820149421691895, "learning_rate": 7.075935828877006e-06, "loss": 0.06833451241254807, "num_input_tokens_seen": 3117590, "step": 3027, "train_runtime": 7349.7332, "train_tokens_per_second": 424.177 }, { "epoch": 1.2940485094561385, "grad_norm": 2.389446258544922, "learning_rate": 7.071657754010696e-06, "loss": 0.10026880353689194, "num_input_tokens_seen": 3118734, "step": 3028, "train_runtime": 7351.8677, "train_tokens_per_second": 424.21 }, { "epoch": 1.2944759055454642, "grad_norm": 2.3412301540374756, "learning_rate": 7.067379679144386e-06, "loss": 0.07555332779884338, "num_input_tokens_seen": 3119610, "step": 3029, "train_runtime": 7353.9259, "train_tokens_per_second": 424.21 }, { "epoch": 1.2949033016347902, "grad_norm": 2.6127512454986572, "learning_rate": 7.0631016042780755e-06, "loss": 0.0979684367775917, "num_input_tokens_seen": 3120986, "step": 3030, "train_runtime": 7356.1024, "train_tokens_per_second": 424.272 }, { "epoch": 1.2953306977241157, "grad_norm": 1.8076595067977905, "learning_rate": 7.058823529411766e-06, "loss": 0.05226100981235504, "num_input_tokens_seen": 3122304, "step": 3031, "train_runtime": 7364.9665, "train_tokens_per_second": 423.94 }, { "epoch": 1.2957580938134416, "grad_norm": 2.1378977298736572, "learning_rate": 7.054545454545455e-06, "loss": 0.0676194578409195, "num_input_tokens_seen": 3123400, "step": 3032, "train_runtime": 7367.1523, "train_tokens_per_second": 423.963 }, { "epoch": 1.2961854899027674, "grad_norm": 2.258054256439209, "learning_rate": 7.0502673796791455e-06, "loss": 0.07752581685781479, "num_input_tokens_seen": 3124474, "step": 3033, "train_runtime": 7369.3583, "train_tokens_per_second": 423.982 }, { "epoch": 1.2966128859920931, "grad_norm": 2.367128849029541, "learning_rate": 7.045989304812835e-06, "loss": 0.07573604583740234, "num_input_tokens_seen": 3125546, "step": 3034, "train_runtime": 7371.4422, "train_tokens_per_second": 424.007 }, { "epoch": 1.297040282081419, "grad_norm": 2.9613142013549805, "learning_rate": 7.041711229946525e-06, "loss": 0.09954195469617844, "num_input_tokens_seen": 3126568, "step": 3035, "train_runtime": 7373.524, "train_tokens_per_second": 424.026 }, { "epoch": 1.2974676781707448, "grad_norm": 3.532851219177246, "learning_rate": 7.037433155080215e-06, "loss": 0.09093168377876282, "num_input_tokens_seen": 3127474, "step": 3036, "train_runtime": 7375.6051, "train_tokens_per_second": 424.029 }, { "epoch": 1.2978950742600706, "grad_norm": 3.328404426574707, "learning_rate": 7.033155080213905e-06, "loss": 0.1490725725889206, "num_input_tokens_seen": 3128286, "step": 3037, "train_runtime": 7377.6712, "train_tokens_per_second": 424.021 }, { "epoch": 1.2983224703493963, "grad_norm": 1.9930859804153442, "learning_rate": 7.0288770053475944e-06, "loss": 0.071568563580513, "num_input_tokens_seen": 3129562, "step": 3038, "train_runtime": 7379.8758, "train_tokens_per_second": 424.067 }, { "epoch": 1.298749866438722, "grad_norm": 3.499483108520508, "learning_rate": 7.024598930481285e-06, "loss": 0.08723960816860199, "num_input_tokens_seen": 3130352, "step": 3039, "train_runtime": 7381.9143, "train_tokens_per_second": 424.057 }, { "epoch": 1.299177262528048, "grad_norm": 2.7622833251953125, "learning_rate": 7.020320855614974e-06, "loss": 0.09654998034238815, "num_input_tokens_seen": 3131122, "step": 3040, "train_runtime": 7383.9449, "train_tokens_per_second": 424.045 }, { "epoch": 1.2996046586173737, "grad_norm": 2.9033401012420654, "learning_rate": 7.0160427807486645e-06, "loss": 0.09674963355064392, "num_input_tokens_seen": 3132330, "step": 3041, "train_runtime": 7386.1516, "train_tokens_per_second": 424.081 }, { "epoch": 1.3000320547066995, "grad_norm": 2.604142189025879, "learning_rate": 7.011764705882353e-06, "loss": 0.09368482977151871, "num_input_tokens_seen": 3133322, "step": 3042, "train_runtime": 7388.2946, "train_tokens_per_second": 424.093 }, { "epoch": 1.3004594507960252, "grad_norm": 2.385263681411743, "learning_rate": 7.007486631016044e-06, "loss": 0.10400746017694473, "num_input_tokens_seen": 3134570, "step": 3043, "train_runtime": 7390.4408, "train_tokens_per_second": 424.138 }, { "epoch": 1.300886846885351, "grad_norm": 2.639981508255005, "learning_rate": 7.003208556149733e-06, "loss": 0.13504458963871002, "num_input_tokens_seen": 3135918, "step": 3044, "train_runtime": 7392.6324, "train_tokens_per_second": 424.195 }, { "epoch": 1.301314242974677, "grad_norm": 2.1733832359313965, "learning_rate": 6.998930481283424e-06, "loss": 0.06582202762365341, "num_input_tokens_seen": 3137060, "step": 3045, "train_runtime": 7394.7576, "train_tokens_per_second": 424.228 }, { "epoch": 1.3017416390640026, "grad_norm": 3.159576416015625, "learning_rate": 6.9946524064171125e-06, "loss": 0.07929767668247223, "num_input_tokens_seen": 3137722, "step": 3046, "train_runtime": 7396.8436, "train_tokens_per_second": 424.197 }, { "epoch": 1.3021690351533284, "grad_norm": 1.9610964059829712, "learning_rate": 6.990374331550803e-06, "loss": 0.0629386231303215, "num_input_tokens_seen": 3138922, "step": 3047, "train_runtime": 7398.9644, "train_tokens_per_second": 424.238 }, { "epoch": 1.3025964312426541, "grad_norm": 2.345449209213257, "learning_rate": 6.986096256684492e-06, "loss": 0.07290294021368027, "num_input_tokens_seen": 3139788, "step": 3048, "train_runtime": 7401.0418, "train_tokens_per_second": 424.236 }, { "epoch": 1.3030238273319799, "grad_norm": 2.531792640686035, "learning_rate": 6.981818181818183e-06, "loss": 0.05829806998372078, "num_input_tokens_seen": 3140678, "step": 3049, "train_runtime": 7403.1163, "train_tokens_per_second": 424.237 }, { "epoch": 1.3034512234213058, "grad_norm": 1.87013840675354, "learning_rate": 6.977540106951872e-06, "loss": 0.0795431062579155, "num_input_tokens_seen": 3142044, "step": 3050, "train_runtime": 7405.2994, "train_tokens_per_second": 424.297 }, { "epoch": 1.3038786195106316, "grad_norm": 2.370725393295288, "learning_rate": 6.9732620320855615e-06, "loss": 0.0632067620754242, "num_input_tokens_seen": 3143798, "step": 3051, "train_runtime": 7407.5542, "train_tokens_per_second": 424.404 }, { "epoch": 1.3043060155999573, "grad_norm": 2.9113504886627197, "learning_rate": 6.968983957219252e-06, "loss": 0.042246293276548386, "num_input_tokens_seen": 3144388, "step": 3052, "train_runtime": 7409.5774, "train_tokens_per_second": 424.368 }, { "epoch": 1.304733411689283, "grad_norm": 4.423725605010986, "learning_rate": 6.964705882352941e-06, "loss": 0.06097486615180969, "num_input_tokens_seen": 3145058, "step": 3053, "train_runtime": 7411.5962, "train_tokens_per_second": 424.343 }, { "epoch": 1.3051608077786088, "grad_norm": 2.5406594276428223, "learning_rate": 6.9604278074866315e-06, "loss": 0.07264570146799088, "num_input_tokens_seen": 3146128, "step": 3054, "train_runtime": 7413.6958, "train_tokens_per_second": 424.367 }, { "epoch": 1.3055882038679347, "grad_norm": 2.289741039276123, "learning_rate": 6.956149732620321e-06, "loss": 0.05240107327699661, "num_input_tokens_seen": 3146998, "step": 3055, "train_runtime": 7415.719, "train_tokens_per_second": 424.369 }, { "epoch": 1.3060155999572605, "grad_norm": 1.955268383026123, "learning_rate": 6.951871657754011e-06, "loss": 0.06604617834091187, "num_input_tokens_seen": 3148164, "step": 3056, "train_runtime": 7417.8684, "train_tokens_per_second": 424.403 }, { "epoch": 1.3064429960465862, "grad_norm": 2.243042469024658, "learning_rate": 6.947593582887701e-06, "loss": 0.08481141924858093, "num_input_tokens_seen": 3149206, "step": 3057, "train_runtime": 7419.9563, "train_tokens_per_second": 424.424 }, { "epoch": 1.306870392135912, "grad_norm": 2.78591251373291, "learning_rate": 6.943315508021391e-06, "loss": 0.10786169767379761, "num_input_tokens_seen": 3150110, "step": 3058, "train_runtime": 7422.011, "train_tokens_per_second": 424.428 }, { "epoch": 1.3072977882252377, "grad_norm": 2.2791383266448975, "learning_rate": 6.9390374331550804e-06, "loss": 0.08200730383396149, "num_input_tokens_seen": 3151468, "step": 3059, "train_runtime": 7424.1611, "train_tokens_per_second": 424.488 }, { "epoch": 1.3077251843145636, "grad_norm": 2.2670657634735107, "learning_rate": 6.934759358288771e-06, "loss": 0.07363367825746536, "num_input_tokens_seen": 3152410, "step": 3060, "train_runtime": 7426.2034, "train_tokens_per_second": 424.498 }, { "epoch": 1.3081525804038894, "grad_norm": 2.2953970432281494, "learning_rate": 6.93048128342246e-06, "loss": 0.04841242730617523, "num_input_tokens_seen": 3153580, "step": 3061, "train_runtime": 7435.0197, "train_tokens_per_second": 424.152 }, { "epoch": 1.3085799764932151, "grad_norm": 2.86474347114563, "learning_rate": 6.9262032085561505e-06, "loss": 0.049897633492946625, "num_input_tokens_seen": 3154504, "step": 3062, "train_runtime": 7437.2679, "train_tokens_per_second": 424.148 }, { "epoch": 1.3090073725825409, "grad_norm": 2.233349084854126, "learning_rate": 6.92192513368984e-06, "loss": 0.11106890439987183, "num_input_tokens_seen": 3156300, "step": 3063, "train_runtime": 7439.5169, "train_tokens_per_second": 424.261 }, { "epoch": 1.3094347686718666, "grad_norm": 3.18144154548645, "learning_rate": 6.91764705882353e-06, "loss": 0.0804712176322937, "num_input_tokens_seen": 3157306, "step": 3064, "train_runtime": 7441.6268, "train_tokens_per_second": 424.276 }, { "epoch": 1.3098621647611925, "grad_norm": 2.4771389961242676, "learning_rate": 6.91336898395722e-06, "loss": 0.05247760936617851, "num_input_tokens_seen": 3157980, "step": 3065, "train_runtime": 7443.6084, "train_tokens_per_second": 424.254 }, { "epoch": 1.3102895608505183, "grad_norm": 2.279043197631836, "learning_rate": 6.90909090909091e-06, "loss": 0.04659748449921608, "num_input_tokens_seen": 3158662, "step": 3066, "train_runtime": 7445.6018, "train_tokens_per_second": 424.232 }, { "epoch": 1.310716956939844, "grad_norm": 2.101201057434082, "learning_rate": 6.904812834224599e-06, "loss": 0.06005648523569107, "num_input_tokens_seen": 3159780, "step": 3067, "train_runtime": 7447.7474, "train_tokens_per_second": 424.26 }, { "epoch": 1.3111443530291698, "grad_norm": 3.5098633766174316, "learning_rate": 6.90053475935829e-06, "loss": 0.12493811547756195, "num_input_tokens_seen": 3160762, "step": 3068, "train_runtime": 7449.8496, "train_tokens_per_second": 424.272 }, { "epoch": 1.3115717491184955, "grad_norm": 2.609753370285034, "learning_rate": 6.896256684491979e-06, "loss": 0.10243531316518784, "num_input_tokens_seen": 3161672, "step": 3069, "train_runtime": 7451.8958, "train_tokens_per_second": 424.278 }, { "epoch": 1.3119991452078215, "grad_norm": 2.270583152770996, "learning_rate": 6.891978609625669e-06, "loss": 0.11233691871166229, "num_input_tokens_seen": 3163168, "step": 3070, "train_runtime": 7454.0997, "train_tokens_per_second": 424.353 }, { "epoch": 1.3124265412971472, "grad_norm": 2.7746379375457764, "learning_rate": 6.887700534759358e-06, "loss": 0.11023058742284775, "num_input_tokens_seen": 3164030, "step": 3071, "train_runtime": 7456.1817, "train_tokens_per_second": 424.35 }, { "epoch": 1.312853937386473, "grad_norm": 2.94696044921875, "learning_rate": 6.883422459893049e-06, "loss": 0.1009884849190712, "num_input_tokens_seen": 3164998, "step": 3072, "train_runtime": 7458.2548, "train_tokens_per_second": 424.362 }, { "epoch": 1.3132813334757987, "grad_norm": 4.1987810134887695, "learning_rate": 6.879144385026738e-06, "loss": 0.08677253127098083, "num_input_tokens_seen": 3165648, "step": 3073, "train_runtime": 7460.3047, "train_tokens_per_second": 424.332 }, { "epoch": 1.3137087295651244, "grad_norm": 2.8691184520721436, "learning_rate": 6.874866310160429e-06, "loss": 0.10081765055656433, "num_input_tokens_seen": 3166990, "step": 3074, "train_runtime": 7462.46, "train_tokens_per_second": 424.39 }, { "epoch": 1.3141361256544504, "grad_norm": 2.11684513092041, "learning_rate": 6.8705882352941175e-06, "loss": 0.07259511947631836, "num_input_tokens_seen": 3168236, "step": 3075, "train_runtime": 7464.6439, "train_tokens_per_second": 424.432 }, { "epoch": 1.314563521743776, "grad_norm": 2.465240955352783, "learning_rate": 6.866310160427808e-06, "loss": 0.06386428326368332, "num_input_tokens_seen": 3168898, "step": 3076, "train_runtime": 7466.714, "train_tokens_per_second": 424.403 }, { "epoch": 1.3149909178331018, "grad_norm": 2.7865781784057617, "learning_rate": 6.862032085561497e-06, "loss": 0.05655631050467491, "num_input_tokens_seen": 3169736, "step": 3077, "train_runtime": 7468.7832, "train_tokens_per_second": 424.398 }, { "epoch": 1.3154183139224276, "grad_norm": 3.729416608810425, "learning_rate": 6.8577540106951875e-06, "loss": 0.09011790156364441, "num_input_tokens_seen": 3170618, "step": 3078, "train_runtime": 7470.8087, "train_tokens_per_second": 424.401 }, { "epoch": 1.3158457100117533, "grad_norm": 3.140462636947632, "learning_rate": 6.853475935828877e-06, "loss": 0.1120164692401886, "num_input_tokens_seen": 3171422, "step": 3079, "train_runtime": 7472.884, "train_tokens_per_second": 424.391 }, { "epoch": 1.3162731061010793, "grad_norm": 2.1219489574432373, "learning_rate": 6.849197860962567e-06, "loss": 0.06099581718444824, "num_input_tokens_seen": 3172372, "step": 3080, "train_runtime": 7474.9819, "train_tokens_per_second": 424.399 }, { "epoch": 1.316700502190405, "grad_norm": 2.388225555419922, "learning_rate": 6.844919786096257e-06, "loss": 0.07526946067810059, "num_input_tokens_seen": 3173228, "step": 3081, "train_runtime": 7477.0284, "train_tokens_per_second": 424.397 }, { "epoch": 1.3171278982797308, "grad_norm": 2.454058885574341, "learning_rate": 6.840641711229947e-06, "loss": 0.0884820967912674, "num_input_tokens_seen": 3174322, "step": 3082, "train_runtime": 7479.1303, "train_tokens_per_second": 424.424 }, { "epoch": 1.3175552943690565, "grad_norm": 3.4711782932281494, "learning_rate": 6.8363636363636364e-06, "loss": 0.06224628910422325, "num_input_tokens_seen": 3175220, "step": 3083, "train_runtime": 7481.2066, "train_tokens_per_second": 424.426 }, { "epoch": 1.3179826904583822, "grad_norm": 4.044619083404541, "learning_rate": 6.832085561497327e-06, "loss": 0.13691066205501556, "num_input_tokens_seen": 3176010, "step": 3084, "train_runtime": 7483.3093, "train_tokens_per_second": 424.412 }, { "epoch": 1.3184100865477082, "grad_norm": 2.34553861618042, "learning_rate": 6.827807486631016e-06, "loss": 0.07405084371566772, "num_input_tokens_seen": 3176834, "step": 3085, "train_runtime": 7485.3985, "train_tokens_per_second": 424.404 }, { "epoch": 1.318837482637034, "grad_norm": 2.4816157817840576, "learning_rate": 6.8235294117647065e-06, "loss": 0.052815310657024384, "num_input_tokens_seen": 3177836, "step": 3086, "train_runtime": 7487.4831, "train_tokens_per_second": 424.42 }, { "epoch": 1.3192648787263597, "grad_norm": 2.9102537631988525, "learning_rate": 6.819251336898396e-06, "loss": 0.10762530565261841, "num_input_tokens_seen": 3178868, "step": 3087, "train_runtime": 7489.5586, "train_tokens_per_second": 424.44 }, { "epoch": 1.3196922748156854, "grad_norm": 3.6969783306121826, "learning_rate": 6.814973262032086e-06, "loss": 0.13340641558170319, "num_input_tokens_seen": 3179948, "step": 3088, "train_runtime": 7491.6729, "train_tokens_per_second": 424.464 }, { "epoch": 1.3201196709050111, "grad_norm": 2.1342952251434326, "learning_rate": 6.810695187165776e-06, "loss": 0.062183134257793427, "num_input_tokens_seen": 3180812, "step": 3089, "train_runtime": 7493.688, "train_tokens_per_second": 424.465 }, { "epoch": 1.320547066994337, "grad_norm": 6.565427303314209, "learning_rate": 6.806417112299466e-06, "loss": 0.12299738824367523, "num_input_tokens_seen": 3181614, "step": 3090, "train_runtime": 7495.7337, "train_tokens_per_second": 424.457 }, { "epoch": 1.3209744630836628, "grad_norm": 1.5610580444335938, "learning_rate": 6.802139037433155e-06, "loss": 0.047917917370796204, "num_input_tokens_seen": 3183208, "step": 3091, "train_runtime": 7504.6671, "train_tokens_per_second": 424.164 }, { "epoch": 1.3214018591729886, "grad_norm": 2.8131675720214844, "learning_rate": 6.797860962566846e-06, "loss": 0.07366964966058731, "num_input_tokens_seen": 3184086, "step": 3092, "train_runtime": 7506.9263, "train_tokens_per_second": 424.153 }, { "epoch": 1.3218292552623143, "grad_norm": 2.299919843673706, "learning_rate": 6.793582887700535e-06, "loss": 0.07928738743066788, "num_input_tokens_seen": 3184846, "step": 3093, "train_runtime": 7508.9698, "train_tokens_per_second": 424.139 }, { "epoch": 1.32225665135164, "grad_norm": 2.5078322887420654, "learning_rate": 6.7893048128342254e-06, "loss": 0.08887529373168945, "num_input_tokens_seen": 3186240, "step": 3094, "train_runtime": 7511.2524, "train_tokens_per_second": 424.196 }, { "epoch": 1.322684047440966, "grad_norm": 1.9447228908538818, "learning_rate": 6.785026737967915e-06, "loss": 0.08179621398448944, "num_input_tokens_seen": 3187796, "step": 3095, "train_runtime": 7513.474, "train_tokens_per_second": 424.277 }, { "epoch": 1.3231114435302918, "grad_norm": 3.1969754695892334, "learning_rate": 6.780748663101605e-06, "loss": 0.08298946917057037, "num_input_tokens_seen": 3189332, "step": 3096, "train_runtime": 7515.7048, "train_tokens_per_second": 424.356 }, { "epoch": 1.3235388396196175, "grad_norm": 2.5398192405700684, "learning_rate": 6.776470588235295e-06, "loss": 0.09162995219230652, "num_input_tokens_seen": 3190378, "step": 3097, "train_runtime": 7517.8576, "train_tokens_per_second": 424.373 }, { "epoch": 1.3239662357089432, "grad_norm": 2.6871464252471924, "learning_rate": 6.772192513368985e-06, "loss": 0.05782339349389076, "num_input_tokens_seen": 3191108, "step": 3098, "train_runtime": 7519.887, "train_tokens_per_second": 424.356 }, { "epoch": 1.324393631798269, "grad_norm": 2.4937820434570312, "learning_rate": 6.767914438502674e-06, "loss": 0.09907757490873337, "num_input_tokens_seen": 3192432, "step": 3099, "train_runtime": 7522.0524, "train_tokens_per_second": 424.41 }, { "epoch": 1.324821027887595, "grad_norm": 3.5931575298309326, "learning_rate": 6.763636363636365e-06, "loss": 0.1524689793586731, "num_input_tokens_seen": 3193192, "step": 3100, "train_runtime": 7524.106, "train_tokens_per_second": 424.395 }, { "epoch": 1.3252484239769207, "grad_norm": 3.1266043186187744, "learning_rate": 6.759358288770054e-06, "loss": 0.06912095844745636, "num_input_tokens_seen": 3193864, "step": 3101, "train_runtime": 7526.1934, "train_tokens_per_second": 424.366 }, { "epoch": 1.3256758200662464, "grad_norm": 1.976914405822754, "learning_rate": 6.755080213903744e-06, "loss": 0.07313459366559982, "num_input_tokens_seen": 3195204, "step": 3102, "train_runtime": 7528.4074, "train_tokens_per_second": 424.42 }, { "epoch": 1.3261032161555721, "grad_norm": 3.273916482925415, "learning_rate": 6.750802139037434e-06, "loss": 0.09610220789909363, "num_input_tokens_seen": 3196008, "step": 3103, "train_runtime": 7530.4705, "train_tokens_per_second": 424.41 }, { "epoch": 1.3265306122448979, "grad_norm": 2.6544153690338135, "learning_rate": 6.746524064171124e-06, "loss": 0.06252476572990417, "num_input_tokens_seen": 3197224, "step": 3104, "train_runtime": 7532.6532, "train_tokens_per_second": 424.449 }, { "epoch": 1.3269580083342238, "grad_norm": 2.23612642288208, "learning_rate": 6.742245989304813e-06, "loss": 0.050831139087677, "num_input_tokens_seen": 3198530, "step": 3105, "train_runtime": 7534.8636, "train_tokens_per_second": 424.497 }, { "epoch": 1.3273854044235496, "grad_norm": 2.608036994934082, "learning_rate": 6.737967914438504e-06, "loss": 0.07467533648014069, "num_input_tokens_seen": 3199426, "step": 3106, "train_runtime": 7536.9543, "train_tokens_per_second": 424.499 }, { "epoch": 1.3278128005128753, "grad_norm": 2.664032459259033, "learning_rate": 6.7336898395721925e-06, "loss": 0.08931900560855865, "num_input_tokens_seen": 3200508, "step": 3107, "train_runtime": 7539.0648, "train_tokens_per_second": 424.523 }, { "epoch": 1.328240196602201, "grad_norm": 2.920459747314453, "learning_rate": 6.729411764705884e-06, "loss": 0.12720629572868347, "num_input_tokens_seen": 3201420, "step": 3108, "train_runtime": 7541.1838, "train_tokens_per_second": 424.525 }, { "epoch": 1.3286675926915268, "grad_norm": 2.4971139430999756, "learning_rate": 6.725133689839572e-06, "loss": 0.06938755512237549, "num_input_tokens_seen": 3202332, "step": 3109, "train_runtime": 7543.326, "train_tokens_per_second": 424.525 }, { "epoch": 1.3290949887808527, "grad_norm": 2.570857048034668, "learning_rate": 6.7208556149732625e-06, "loss": 0.09026563167572021, "num_input_tokens_seen": 3203396, "step": 3110, "train_runtime": 7545.4445, "train_tokens_per_second": 424.547 }, { "epoch": 1.3295223848701785, "grad_norm": 3.0758118629455566, "learning_rate": 6.716577540106952e-06, "loss": 0.10461202263832092, "num_input_tokens_seen": 3204304, "step": 3111, "train_runtime": 7547.632, "train_tokens_per_second": 424.544 }, { "epoch": 1.3299497809595042, "grad_norm": 4.081035137176514, "learning_rate": 6.712299465240642e-06, "loss": 0.12959963083267212, "num_input_tokens_seen": 3205074, "step": 3112, "train_runtime": 7549.6602, "train_tokens_per_second": 424.532 }, { "epoch": 1.33037717704883, "grad_norm": 3.0498290061950684, "learning_rate": 6.708021390374332e-06, "loss": 0.0922926515340805, "num_input_tokens_seen": 3206216, "step": 3113, "train_runtime": 7551.8489, "train_tokens_per_second": 424.56 }, { "epoch": 1.3308045731381557, "grad_norm": 3.1709518432617188, "learning_rate": 6.703743315508022e-06, "loss": 0.11085475236177444, "num_input_tokens_seen": 3207130, "step": 3114, "train_runtime": 7553.9126, "train_tokens_per_second": 424.565 }, { "epoch": 1.3312319692274817, "grad_norm": 3.0828921794891357, "learning_rate": 6.699465240641711e-06, "loss": 0.08031412959098816, "num_input_tokens_seen": 3207922, "step": 3115, "train_runtime": 7555.9127, "train_tokens_per_second": 424.558 }, { "epoch": 1.3316593653168074, "grad_norm": 6.81247091293335, "learning_rate": 6.695187165775402e-06, "loss": 0.07905543595552444, "num_input_tokens_seen": 3209014, "step": 3116, "train_runtime": 7558.0246, "train_tokens_per_second": 424.584 }, { "epoch": 1.3320867614061331, "grad_norm": 4.130695343017578, "learning_rate": 6.690909090909091e-06, "loss": 0.1136293113231659, "num_input_tokens_seen": 3210022, "step": 3117, "train_runtime": 7560.1119, "train_tokens_per_second": 424.6 }, { "epoch": 1.3325141574954589, "grad_norm": 2.7064762115478516, "learning_rate": 6.6866310160427814e-06, "loss": 0.0745459794998169, "num_input_tokens_seen": 3210888, "step": 3118, "train_runtime": 7562.2223, "train_tokens_per_second": 424.596 }, { "epoch": 1.3329415535847846, "grad_norm": 2.6442806720733643, "learning_rate": 6.682352941176471e-06, "loss": 0.08416484296321869, "num_input_tokens_seen": 3211746, "step": 3119, "train_runtime": 7564.2535, "train_tokens_per_second": 424.595 }, { "epoch": 1.3333689496741106, "grad_norm": 1.8397011756896973, "learning_rate": 6.678074866310161e-06, "loss": 0.06384040415287018, "num_input_tokens_seen": 3213106, "step": 3120, "train_runtime": 7566.5208, "train_tokens_per_second": 424.648 }, { "epoch": 1.3337963457634363, "grad_norm": 2.006704092025757, "learning_rate": 6.673796791443851e-06, "loss": 0.062374405562877655, "num_input_tokens_seen": 3214000, "step": 3121, "train_runtime": 7575.7411, "train_tokens_per_second": 424.249 }, { "epoch": 1.334223741852762, "grad_norm": 2.6489882469177246, "learning_rate": 6.669518716577541e-06, "loss": 0.10289392620325089, "num_input_tokens_seen": 3215234, "step": 3122, "train_runtime": 7577.9407, "train_tokens_per_second": 424.289 }, { "epoch": 1.3346511379420878, "grad_norm": 3.345651626586914, "learning_rate": 6.66524064171123e-06, "loss": 0.102023646235466, "num_input_tokens_seen": 3215954, "step": 3123, "train_runtime": 7579.9753, "train_tokens_per_second": 424.27 }, { "epoch": 1.3350785340314135, "grad_norm": 2.2507457733154297, "learning_rate": 6.660962566844921e-06, "loss": 0.1047191321849823, "num_input_tokens_seen": 3217424, "step": 3124, "train_runtime": 7582.1733, "train_tokens_per_second": 424.341 }, { "epoch": 1.3355059301207395, "grad_norm": 2.5344626903533936, "learning_rate": 6.65668449197861e-06, "loss": 0.07828375697135925, "num_input_tokens_seen": 3218498, "step": 3125, "train_runtime": 7584.2663, "train_tokens_per_second": 424.365 }, { "epoch": 1.3359333262100652, "grad_norm": 2.8161840438842773, "learning_rate": 6.6524064171123e-06, "loss": 0.08589472621679306, "num_input_tokens_seen": 3219368, "step": 3126, "train_runtime": 7586.3759, "train_tokens_per_second": 424.362 }, { "epoch": 1.336360722299391, "grad_norm": 4.029890537261963, "learning_rate": 6.64812834224599e-06, "loss": 0.21060766279697418, "num_input_tokens_seen": 3220682, "step": 3127, "train_runtime": 7588.5272, "train_tokens_per_second": 424.415 }, { "epoch": 1.3367881183887167, "grad_norm": 3.2842509746551514, "learning_rate": 6.64385026737968e-06, "loss": 0.11375979334115982, "num_input_tokens_seen": 3221522, "step": 3128, "train_runtime": 7590.651, "train_tokens_per_second": 424.407 }, { "epoch": 1.3372155144780424, "grad_norm": 2.2260725498199463, "learning_rate": 6.6395721925133696e-06, "loss": 0.04220890253782272, "num_input_tokens_seen": 3222400, "step": 3129, "train_runtime": 7592.7594, "train_tokens_per_second": 424.404 }, { "epoch": 1.3376429105673684, "grad_norm": 2.689847230911255, "learning_rate": 6.63529411764706e-06, "loss": 0.07509066164493561, "num_input_tokens_seen": 3223306, "step": 3130, "train_runtime": 7594.8283, "train_tokens_per_second": 424.408 }, { "epoch": 1.3380703066566941, "grad_norm": 3.381842613220215, "learning_rate": 6.631016042780749e-06, "loss": 0.11579402536153793, "num_input_tokens_seen": 3224116, "step": 3131, "train_runtime": 7596.8708, "train_tokens_per_second": 424.401 }, { "epoch": 1.3384977027460199, "grad_norm": 2.8190507888793945, "learning_rate": 6.62673796791444e-06, "loss": 0.07199320942163467, "num_input_tokens_seen": 3224880, "step": 3132, "train_runtime": 7598.8906, "train_tokens_per_second": 424.388 }, { "epoch": 1.3389250988353456, "grad_norm": 2.4699301719665527, "learning_rate": 6.622459893048129e-06, "loss": 0.0774102583527565, "num_input_tokens_seen": 3226060, "step": 3133, "train_runtime": 7601.0476, "train_tokens_per_second": 424.423 }, { "epoch": 1.3393524949246713, "grad_norm": 1.870215654373169, "learning_rate": 6.618181818181819e-06, "loss": 0.06685984134674072, "num_input_tokens_seen": 3227376, "step": 3134, "train_runtime": 7603.3535, "train_tokens_per_second": 424.467 }, { "epoch": 1.3397798910139973, "grad_norm": 2.2541487216949463, "learning_rate": 6.613903743315509e-06, "loss": 0.05152186378836632, "num_input_tokens_seen": 3228192, "step": 3135, "train_runtime": 7605.4052, "train_tokens_per_second": 424.46 }, { "epoch": 1.340207287103323, "grad_norm": 3.4293160438537598, "learning_rate": 6.609625668449199e-06, "loss": 0.09395182132720947, "num_input_tokens_seen": 3229324, "step": 3136, "train_runtime": 7607.5531, "train_tokens_per_second": 424.489 }, { "epoch": 1.3406346831926488, "grad_norm": 2.1196675300598145, "learning_rate": 6.6053475935828885e-06, "loss": 0.049595557153224945, "num_input_tokens_seen": 3230240, "step": 3137, "train_runtime": 7609.6069, "train_tokens_per_second": 424.495 }, { "epoch": 1.3410620792819745, "grad_norm": 2.0202667713165283, "learning_rate": 6.601069518716579e-06, "loss": 0.07142960280179977, "num_input_tokens_seen": 3231114, "step": 3138, "train_runtime": 7611.6673, "train_tokens_per_second": 424.495 }, { "epoch": 1.3414894753713003, "grad_norm": 1.9164057970046997, "learning_rate": 6.596791443850267e-06, "loss": 0.06770211458206177, "num_input_tokens_seen": 3232778, "step": 3139, "train_runtime": 7613.9101, "train_tokens_per_second": 424.588 }, { "epoch": 1.3419168714606262, "grad_norm": 2.2521464824676514, "learning_rate": 6.5925133689839586e-06, "loss": 0.0636894628405571, "num_input_tokens_seen": 3233844, "step": 3140, "train_runtime": 7615.9939, "train_tokens_per_second": 424.612 }, { "epoch": 1.342344267549952, "grad_norm": 2.4593846797943115, "learning_rate": 6.588235294117647e-06, "loss": 0.07364197075366974, "num_input_tokens_seen": 3234692, "step": 3141, "train_runtime": 7618.0169, "train_tokens_per_second": 424.611 }, { "epoch": 1.3427716636392777, "grad_norm": 3.288740396499634, "learning_rate": 6.583957219251338e-06, "loss": 0.09747792035341263, "num_input_tokens_seen": 3235608, "step": 3142, "train_runtime": 7620.1, "train_tokens_per_second": 424.615 }, { "epoch": 1.3431990597286034, "grad_norm": 2.2910284996032715, "learning_rate": 6.579679144385027e-06, "loss": 0.07498076558113098, "num_input_tokens_seen": 3236522, "step": 3143, "train_runtime": 7622.1882, "train_tokens_per_second": 424.618 }, { "epoch": 1.3436264558179292, "grad_norm": 2.2119545936584473, "learning_rate": 6.575401069518717e-06, "loss": 0.06378357112407684, "num_input_tokens_seen": 3237140, "step": 3144, "train_runtime": 7624.18, "train_tokens_per_second": 424.589 }, { "epoch": 1.3440538519072551, "grad_norm": 3.214130163192749, "learning_rate": 6.571122994652407e-06, "loss": 0.08002831786870956, "num_input_tokens_seen": 3237814, "step": 3145, "train_runtime": 7626.2812, "train_tokens_per_second": 424.56 }, { "epoch": 1.3444812479965809, "grad_norm": 3.826883316040039, "learning_rate": 6.566844919786097e-06, "loss": 0.12311968207359314, "num_input_tokens_seen": 3238762, "step": 3146, "train_runtime": 7628.3517, "train_tokens_per_second": 424.569 }, { "epoch": 1.3449086440859066, "grad_norm": 4.192801475524902, "learning_rate": 6.562566844919786e-06, "loss": 0.10599485039710999, "num_input_tokens_seen": 3239436, "step": 3147, "train_runtime": 7630.3393, "train_tokens_per_second": 424.547 }, { "epoch": 1.3453360401752323, "grad_norm": 2.884986639022827, "learning_rate": 6.558288770053477e-06, "loss": 0.08564812690019608, "num_input_tokens_seen": 3240318, "step": 3148, "train_runtime": 7632.3879, "train_tokens_per_second": 424.548 }, { "epoch": 1.345763436264558, "grad_norm": 1.9095141887664795, "learning_rate": 6.554010695187166e-06, "loss": 0.05019308254122734, "num_input_tokens_seen": 3241032, "step": 3149, "train_runtime": 7634.3811, "train_tokens_per_second": 424.531 }, { "epoch": 1.346190832353884, "grad_norm": 2.0331380367279053, "learning_rate": 6.549732620320856e-06, "loss": 0.05688313767313957, "num_input_tokens_seen": 3242110, "step": 3150, "train_runtime": 7636.4823, "train_tokens_per_second": 424.555 }, { "epoch": 1.3466182284432098, "grad_norm": 3.029564380645752, "learning_rate": 6.545454545454546e-06, "loss": 0.10305293649435043, "num_input_tokens_seen": 3243518, "step": 3151, "train_runtime": 7645.2682, "train_tokens_per_second": 424.252 }, { "epoch": 1.3470456245325355, "grad_norm": 2.2749345302581787, "learning_rate": 6.541176470588236e-06, "loss": 0.09431841969490051, "num_input_tokens_seen": 3245382, "step": 3152, "train_runtime": 7647.559, "train_tokens_per_second": 424.368 }, { "epoch": 1.3474730206218613, "grad_norm": 2.6047770977020264, "learning_rate": 6.536898395721926e-06, "loss": 0.09861025214195251, "num_input_tokens_seen": 3246666, "step": 3153, "train_runtime": 7649.7573, "train_tokens_per_second": 424.414 }, { "epoch": 1.347900416711187, "grad_norm": 2.601649284362793, "learning_rate": 6.532620320855616e-06, "loss": 0.07444708049297333, "num_input_tokens_seen": 3247776, "step": 3154, "train_runtime": 7651.9825, "train_tokens_per_second": 424.436 }, { "epoch": 1.348327812800513, "grad_norm": 2.5074522495269775, "learning_rate": 6.528342245989305e-06, "loss": 0.08883404731750488, "num_input_tokens_seen": 3248536, "step": 3155, "train_runtime": 7653.9973, "train_tokens_per_second": 424.423 }, { "epoch": 1.3487552088898387, "grad_norm": 1.6762393712997437, "learning_rate": 6.524064171122996e-06, "loss": 0.04432428628206253, "num_input_tokens_seen": 3249608, "step": 3156, "train_runtime": 7656.1165, "train_tokens_per_second": 424.446 }, { "epoch": 1.3491826049791644, "grad_norm": 3.06726336479187, "learning_rate": 6.519786096256685e-06, "loss": 0.11071242392063141, "num_input_tokens_seen": 3250512, "step": 3157, "train_runtime": 7658.1751, "train_tokens_per_second": 424.45 }, { "epoch": 1.3496100010684902, "grad_norm": 2.862823963165283, "learning_rate": 6.515508021390375e-06, "loss": 0.1063152328133583, "num_input_tokens_seen": 3251470, "step": 3158, "train_runtime": 7660.2353, "train_tokens_per_second": 424.461 }, { "epoch": 1.350037397157816, "grad_norm": 3.865882396697998, "learning_rate": 6.511229946524065e-06, "loss": 0.11060947179794312, "num_input_tokens_seen": 3252774, "step": 3159, "train_runtime": 7662.3633, "train_tokens_per_second": 424.513 }, { "epoch": 1.3504647932471419, "grad_norm": 3.1284728050231934, "learning_rate": 6.506951871657754e-06, "loss": 0.11533777415752411, "num_input_tokens_seen": 3253910, "step": 3160, "train_runtime": 7664.4706, "train_tokens_per_second": 424.545 }, { "epoch": 1.3508921893364676, "grad_norm": 2.9496543407440186, "learning_rate": 6.5026737967914445e-06, "loss": 0.06632790714502335, "num_input_tokens_seen": 3254644, "step": 3161, "train_runtime": 7666.5196, "train_tokens_per_second": 424.527 }, { "epoch": 1.3513195854257933, "grad_norm": 2.239867925643921, "learning_rate": 6.498395721925134e-06, "loss": 0.0695294663310051, "num_input_tokens_seen": 3255744, "step": 3162, "train_runtime": 7668.6331, "train_tokens_per_second": 424.553 }, { "epoch": 1.351746981515119, "grad_norm": 3.2851932048797607, "learning_rate": 6.494117647058824e-06, "loss": 0.09921103715896606, "num_input_tokens_seen": 3257164, "step": 3163, "train_runtime": 7670.8119, "train_tokens_per_second": 424.618 }, { "epoch": 1.3521743776044448, "grad_norm": 3.820545196533203, "learning_rate": 6.489839572192514e-06, "loss": 0.1404322385787964, "num_input_tokens_seen": 3258186, "step": 3164, "train_runtime": 7672.8864, "train_tokens_per_second": 424.636 }, { "epoch": 1.3526017736937708, "grad_norm": 2.379157781600952, "learning_rate": 6.485561497326204e-06, "loss": 0.06789929419755936, "num_input_tokens_seen": 3259484, "step": 3165, "train_runtime": 7675.0344, "train_tokens_per_second": 424.687 }, { "epoch": 1.3530291697830965, "grad_norm": 2.4860281944274902, "learning_rate": 6.4812834224598935e-06, "loss": 0.07726884633302689, "num_input_tokens_seen": 3260464, "step": 3166, "train_runtime": 7677.1108, "train_tokens_per_second": 424.699 }, { "epoch": 1.3534565658724222, "grad_norm": 3.3024070262908936, "learning_rate": 6.477005347593584e-06, "loss": 0.1286133974790573, "num_input_tokens_seen": 3261152, "step": 3167, "train_runtime": 7679.153, "train_tokens_per_second": 424.676 }, { "epoch": 1.353883961961748, "grad_norm": 2.6740643978118896, "learning_rate": 6.472727272727272e-06, "loss": 0.08236388862133026, "num_input_tokens_seen": 3262730, "step": 3168, "train_runtime": 7681.3795, "train_tokens_per_second": 424.758 }, { "epoch": 1.3543113580510737, "grad_norm": 2.360847234725952, "learning_rate": 6.4684491978609635e-06, "loss": 0.10281451791524887, "num_input_tokens_seen": 3263640, "step": 3169, "train_runtime": 7683.3981, "train_tokens_per_second": 424.765 }, { "epoch": 1.3547387541403997, "grad_norm": 2.7765560150146484, "learning_rate": 6.464171122994652e-06, "loss": 0.10607416927814484, "num_input_tokens_seen": 3264980, "step": 3170, "train_runtime": 7685.6401, "train_tokens_per_second": 424.816 }, { "epoch": 1.3551661502297254, "grad_norm": 2.682161569595337, "learning_rate": 6.459893048128343e-06, "loss": 0.09889735281467438, "num_input_tokens_seen": 3265910, "step": 3171, "train_runtime": 7687.6968, "train_tokens_per_second": 424.823 }, { "epoch": 1.3555935463190512, "grad_norm": 1.7430683374404907, "learning_rate": 6.455614973262032e-06, "loss": 0.06315062195062637, "num_input_tokens_seen": 3266904, "step": 3172, "train_runtime": 7689.7756, "train_tokens_per_second": 424.837 }, { "epoch": 1.356020942408377, "grad_norm": 2.373918294906616, "learning_rate": 6.451336898395722e-06, "loss": 0.0726034939289093, "num_input_tokens_seen": 3267664, "step": 3173, "train_runtime": 7691.7623, "train_tokens_per_second": 424.826 }, { "epoch": 1.3564483384977026, "grad_norm": 3.0013420581817627, "learning_rate": 6.4470588235294116e-06, "loss": 0.11568459868431091, "num_input_tokens_seen": 3268618, "step": 3174, "train_runtime": 7693.8173, "train_tokens_per_second": 424.837 }, { "epoch": 1.3568757345870286, "grad_norm": 2.996323823928833, "learning_rate": 6.442780748663102e-06, "loss": 0.1038421168923378, "num_input_tokens_seen": 3269598, "step": 3175, "train_runtime": 7695.9036, "train_tokens_per_second": 424.849 }, { "epoch": 1.3573031306763543, "grad_norm": 2.336603879928589, "learning_rate": 6.438502673796791e-06, "loss": 0.07186711579561234, "num_input_tokens_seen": 3270622, "step": 3176, "train_runtime": 7698.0293, "train_tokens_per_second": 424.865 }, { "epoch": 1.35773052676568, "grad_norm": 1.8723411560058594, "learning_rate": 6.434224598930482e-06, "loss": 0.06434863060712814, "num_input_tokens_seen": 3272038, "step": 3177, "train_runtime": 7700.2273, "train_tokens_per_second": 424.927 }, { "epoch": 1.3581579228550058, "grad_norm": 2.6882195472717285, "learning_rate": 6.429946524064171e-06, "loss": 0.1429688185453415, "num_input_tokens_seen": 3273066, "step": 3178, "train_runtime": 7702.3331, "train_tokens_per_second": 424.945 }, { "epoch": 1.3585853189443315, "grad_norm": 2.995041847229004, "learning_rate": 6.425668449197861e-06, "loss": 0.09537284076213837, "num_input_tokens_seen": 3273844, "step": 3179, "train_runtime": 7704.3742, "train_tokens_per_second": 424.933 }, { "epoch": 1.3590127150336575, "grad_norm": 2.7519783973693848, "learning_rate": 6.421390374331551e-06, "loss": 0.09719207882881165, "num_input_tokens_seen": 3274778, "step": 3180, "train_runtime": 7706.4238, "train_tokens_per_second": 424.941 }, { "epoch": 1.3594401111229832, "grad_norm": 2.245267868041992, "learning_rate": 6.417112299465241e-06, "loss": 0.08162558078765869, "num_input_tokens_seen": 3275972, "step": 3181, "train_runtime": 7714.8184, "train_tokens_per_second": 424.634 }, { "epoch": 1.359867507212309, "grad_norm": 3.112441062927246, "learning_rate": 6.4128342245989305e-06, "loss": 0.10832598060369492, "num_input_tokens_seen": 3276938, "step": 3182, "train_runtime": 7716.9322, "train_tokens_per_second": 424.643 }, { "epoch": 1.3602949033016347, "grad_norm": 1.7854994535446167, "learning_rate": 6.408556149732621e-06, "loss": 0.03599024564027786, "num_input_tokens_seen": 3278072, "step": 3183, "train_runtime": 7719.1001, "train_tokens_per_second": 424.67 }, { "epoch": 1.3607222993909605, "grad_norm": 3.4036924839019775, "learning_rate": 6.40427807486631e-06, "loss": 0.06701241433620453, "num_input_tokens_seen": 3278774, "step": 3184, "train_runtime": 7721.1234, "train_tokens_per_second": 424.65 }, { "epoch": 1.3611496954802864, "grad_norm": 2.578629970550537, "learning_rate": 6.4000000000000006e-06, "loss": 0.10280337929725647, "num_input_tokens_seen": 3280296, "step": 3185, "train_runtime": 7723.3386, "train_tokens_per_second": 424.725 }, { "epoch": 1.3615770915696122, "grad_norm": 3.8966360092163086, "learning_rate": 6.39572192513369e-06, "loss": 0.14626756310462952, "num_input_tokens_seen": 3281082, "step": 3186, "train_runtime": 7725.3846, "train_tokens_per_second": 424.714 }, { "epoch": 1.362004487658938, "grad_norm": 4.28747034072876, "learning_rate": 6.39144385026738e-06, "loss": 0.12739111483097076, "num_input_tokens_seen": 3282362, "step": 3187, "train_runtime": 7727.556, "train_tokens_per_second": 424.761 }, { "epoch": 1.3624318837482636, "grad_norm": 3.4851841926574707, "learning_rate": 6.38716577540107e-06, "loss": 0.07526595890522003, "num_input_tokens_seen": 3283254, "step": 3188, "train_runtime": 7729.6648, "train_tokens_per_second": 424.76 }, { "epoch": 1.3628592798375894, "grad_norm": 3.4750003814697266, "learning_rate": 6.38288770053476e-06, "loss": 0.09182319045066833, "num_input_tokens_seen": 3284418, "step": 3189, "train_runtime": 7731.8394, "train_tokens_per_second": 424.791 }, { "epoch": 1.3632866759269153, "grad_norm": 3.5623397827148438, "learning_rate": 6.3786096256684495e-06, "loss": 0.1354844570159912, "num_input_tokens_seen": 3285346, "step": 3190, "train_runtime": 7733.8771, "train_tokens_per_second": 424.799 }, { "epoch": 1.363714072016241, "grad_norm": 3.087920904159546, "learning_rate": 6.37433155080214e-06, "loss": 0.10777562856674194, "num_input_tokens_seen": 3286140, "step": 3191, "train_runtime": 7735.8946, "train_tokens_per_second": 424.791 }, { "epoch": 1.3641414681055668, "grad_norm": 2.4586117267608643, "learning_rate": 6.370053475935829e-06, "loss": 0.11487673223018646, "num_input_tokens_seen": 3287342, "step": 3192, "train_runtime": 7738.0136, "train_tokens_per_second": 424.83 }, { "epoch": 1.3645688641948925, "grad_norm": 2.5379438400268555, "learning_rate": 6.3657754010695195e-06, "loss": 0.08158126473426819, "num_input_tokens_seen": 3288068, "step": 3193, "train_runtime": 7740.0271, "train_tokens_per_second": 424.813 }, { "epoch": 1.3649962602842183, "grad_norm": 2.3742177486419678, "learning_rate": 6.361497326203209e-06, "loss": 0.09661485999822617, "num_input_tokens_seen": 3289172, "step": 3194, "train_runtime": 7742.141, "train_tokens_per_second": 424.84 }, { "epoch": 1.3654236563735442, "grad_norm": 2.754796266555786, "learning_rate": 6.357219251336899e-06, "loss": 0.11201435327529907, "num_input_tokens_seen": 3290482, "step": 3195, "train_runtime": 7744.3333, "train_tokens_per_second": 424.889 }, { "epoch": 1.36585105246287, "grad_norm": 3.072242498397827, "learning_rate": 6.352941176470589e-06, "loss": 0.09425794333219528, "num_input_tokens_seen": 3291380, "step": 3196, "train_runtime": 7746.3824, "train_tokens_per_second": 424.893 }, { "epoch": 1.3662784485521957, "grad_norm": 2.5668187141418457, "learning_rate": 6.348663101604279e-06, "loss": 0.09268469363451004, "num_input_tokens_seen": 3292146, "step": 3197, "train_runtime": 7748.3807, "train_tokens_per_second": 424.882 }, { "epoch": 1.3667058446415215, "grad_norm": 3.569673538208008, "learning_rate": 6.3443850267379684e-06, "loss": 0.11805763840675354, "num_input_tokens_seen": 3292906, "step": 3198, "train_runtime": 7750.4117, "train_tokens_per_second": 424.869 }, { "epoch": 1.3671332407308472, "grad_norm": 2.6122937202453613, "learning_rate": 6.340106951871659e-06, "loss": 0.08259596675634384, "num_input_tokens_seen": 3293944, "step": 3199, "train_runtime": 7752.5446, "train_tokens_per_second": 424.886 }, { "epoch": 1.3675606368201731, "grad_norm": 2.524951934814453, "learning_rate": 6.335828877005348e-06, "loss": 0.09323089569807053, "num_input_tokens_seen": 3294696, "step": 3200, "train_runtime": 7754.5906, "train_tokens_per_second": 424.87 }, { "epoch": 1.3679880329094989, "grad_norm": 2.4553985595703125, "learning_rate": 6.3315508021390385e-06, "loss": 0.11925337463617325, "num_input_tokens_seen": 3296142, "step": 3201, "train_runtime": 7756.7619, "train_tokens_per_second": 424.938 }, { "epoch": 1.3684154289988246, "grad_norm": 3.1260263919830322, "learning_rate": 6.327272727272727e-06, "loss": 0.09206196665763855, "num_input_tokens_seen": 3297164, "step": 3202, "train_runtime": 7758.8571, "train_tokens_per_second": 424.955 }, { "epoch": 1.3688428250881504, "grad_norm": 2.3616137504577637, "learning_rate": 6.322994652406418e-06, "loss": 0.08467519283294678, "num_input_tokens_seen": 3298542, "step": 3203, "train_runtime": 7761.0347, "train_tokens_per_second": 425.013 }, { "epoch": 1.369270221177476, "grad_norm": 2.5820698738098145, "learning_rate": 6.318716577540107e-06, "loss": 0.0881558209657669, "num_input_tokens_seen": 3299500, "step": 3204, "train_runtime": 7763.1263, "train_tokens_per_second": 425.022 }, { "epoch": 1.369697617266802, "grad_norm": 3.3584587574005127, "learning_rate": 6.314438502673798e-06, "loss": 0.13167576491832733, "num_input_tokens_seen": 3300406, "step": 3205, "train_runtime": 7765.1786, "train_tokens_per_second": 425.026 }, { "epoch": 1.3701250133561278, "grad_norm": 3.0288429260253906, "learning_rate": 6.3101604278074865e-06, "loss": 0.08793671429157257, "num_input_tokens_seen": 3301086, "step": 3206, "train_runtime": 7767.1598, "train_tokens_per_second": 425.006 }, { "epoch": 1.3705524094454535, "grad_norm": 1.759108543395996, "learning_rate": 6.305882352941177e-06, "loss": 0.06125544011592865, "num_input_tokens_seen": 3302922, "step": 3207, "train_runtime": 7769.4243, "train_tokens_per_second": 425.118 }, { "epoch": 1.3709798055347795, "grad_norm": 3.0307743549346924, "learning_rate": 6.301604278074866e-06, "loss": 0.12302170693874359, "num_input_tokens_seen": 3304154, "step": 3208, "train_runtime": 7771.5456, "train_tokens_per_second": 425.16 }, { "epoch": 1.371407201624105, "grad_norm": 2.2818562984466553, "learning_rate": 6.2973262032085566e-06, "loss": 0.056075967848300934, "num_input_tokens_seen": 3305124, "step": 3209, "train_runtime": 7773.6444, "train_tokens_per_second": 425.17 }, { "epoch": 1.371834597713431, "grad_norm": 2.10774827003479, "learning_rate": 6.293048128342246e-06, "loss": 0.06893950700759888, "num_input_tokens_seen": 3306108, "step": 3210, "train_runtime": 7775.7067, "train_tokens_per_second": 425.184 }, { "epoch": 1.3722619938027567, "grad_norm": 2.7141215801239014, "learning_rate": 6.288770053475936e-06, "loss": 0.10845555365085602, "num_input_tokens_seen": 3307284, "step": 3211, "train_runtime": 7784.0884, "train_tokens_per_second": 424.877 }, { "epoch": 1.3726893898920824, "grad_norm": 2.9843757152557373, "learning_rate": 6.284491978609626e-06, "loss": 0.1299024522304535, "num_input_tokens_seen": 3308394, "step": 3212, "train_runtime": 7786.2149, "train_tokens_per_second": 424.904 }, { "epoch": 1.3731167859814084, "grad_norm": 2.4188318252563477, "learning_rate": 6.280213903743316e-06, "loss": 0.07884763181209564, "num_input_tokens_seen": 3309298, "step": 3213, "train_runtime": 7788.5997, "train_tokens_per_second": 424.89 }, { "epoch": 1.373544182070734, "grad_norm": 2.6896750926971436, "learning_rate": 6.2759358288770055e-06, "loss": 0.10796432197093964, "num_input_tokens_seen": 3310758, "step": 3214, "train_runtime": 7790.7413, "train_tokens_per_second": 424.961 }, { "epoch": 1.3739715781600599, "grad_norm": 2.2479846477508545, "learning_rate": 6.271657754010696e-06, "loss": 0.07536740601062775, "num_input_tokens_seen": 3312158, "step": 3215, "train_runtime": 7792.9437, "train_tokens_per_second": 425.02 }, { "epoch": 1.3743989742493856, "grad_norm": 2.9850735664367676, "learning_rate": 6.267379679144385e-06, "loss": 0.09404246509075165, "num_input_tokens_seen": 3313224, "step": 3216, "train_runtime": 7795.0619, "train_tokens_per_second": 425.041 }, { "epoch": 1.3748263703387114, "grad_norm": 2.559086322784424, "learning_rate": 6.2631016042780755e-06, "loss": 0.1048872321844101, "num_input_tokens_seen": 3314132, "step": 3217, "train_runtime": 7797.1175, "train_tokens_per_second": 425.046 }, { "epoch": 1.3752537664280373, "grad_norm": 2.6748650074005127, "learning_rate": 6.258823529411765e-06, "loss": 0.11120984703302383, "num_input_tokens_seen": 3315556, "step": 3218, "train_runtime": 7799.2893, "train_tokens_per_second": 425.11 }, { "epoch": 1.3756811625173628, "grad_norm": 4.306665420532227, "learning_rate": 6.254545454545455e-06, "loss": 0.10187392681837082, "num_input_tokens_seen": 3316754, "step": 3219, "train_runtime": 7801.399, "train_tokens_per_second": 425.149 }, { "epoch": 1.3761085586066888, "grad_norm": 1.6322040557861328, "learning_rate": 6.250267379679145e-06, "loss": 0.07576320320367813, "num_input_tokens_seen": 3319018, "step": 3220, "train_runtime": 7803.795, "train_tokens_per_second": 425.308 }, { "epoch": 1.3765359546960145, "grad_norm": 3.8274483680725098, "learning_rate": 6.245989304812835e-06, "loss": 0.09648226946592331, "num_input_tokens_seen": 3319694, "step": 3221, "train_runtime": 7805.8143, "train_tokens_per_second": 425.285 }, { "epoch": 1.3769633507853403, "grad_norm": 2.8847217559814453, "learning_rate": 6.2417112299465244e-06, "loss": 0.07623672485351562, "num_input_tokens_seen": 3320444, "step": 3222, "train_runtime": 7807.83, "train_tokens_per_second": 425.271 }, { "epoch": 1.3773907468746662, "grad_norm": 2.2220189571380615, "learning_rate": 6.237433155080215e-06, "loss": 0.0994056910276413, "num_input_tokens_seen": 3322766, "step": 3223, "train_runtime": 7810.2513, "train_tokens_per_second": 425.437 }, { "epoch": 1.3778181429639917, "grad_norm": 2.475769519805908, "learning_rate": 6.233155080213904e-06, "loss": 0.07649150490760803, "num_input_tokens_seen": 3323868, "step": 3224, "train_runtime": 7812.4277, "train_tokens_per_second": 425.459 }, { "epoch": 1.3782455390533177, "grad_norm": 2.271890163421631, "learning_rate": 6.2288770053475945e-06, "loss": 0.10229285806417465, "num_input_tokens_seen": 3325204, "step": 3225, "train_runtime": 7814.5906, "train_tokens_per_second": 425.512 }, { "epoch": 1.3786729351426434, "grad_norm": 3.6042072772979736, "learning_rate": 6.224598930481284e-06, "loss": 0.17576083540916443, "num_input_tokens_seen": 3326244, "step": 3226, "train_runtime": 7816.7153, "train_tokens_per_second": 425.53 }, { "epoch": 1.3791003312319692, "grad_norm": 4.114015579223633, "learning_rate": 6.220320855614974e-06, "loss": 0.13761650025844574, "num_input_tokens_seen": 3327552, "step": 3227, "train_runtime": 7818.9416, "train_tokens_per_second": 425.576 }, { "epoch": 1.3795277273212951, "grad_norm": 3.441895008087158, "learning_rate": 6.216042780748664e-06, "loss": 0.09298841655254364, "num_input_tokens_seen": 3328282, "step": 3228, "train_runtime": 7820.9631, "train_tokens_per_second": 425.559 }, { "epoch": 1.3799551234106207, "grad_norm": 2.1415321826934814, "learning_rate": 6.211764705882354e-06, "loss": 0.05958282947540283, "num_input_tokens_seen": 3329422, "step": 3229, "train_runtime": 7823.0754, "train_tokens_per_second": 425.59 }, { "epoch": 1.3803825194999466, "grad_norm": 2.828928232192993, "learning_rate": 6.207486631016043e-06, "loss": 0.10203618556261063, "num_input_tokens_seen": 3330476, "step": 3230, "train_runtime": 7825.1545, "train_tokens_per_second": 425.612 }, { "epoch": 1.3808099155892724, "grad_norm": 4.01011323928833, "learning_rate": 6.203208556149734e-06, "loss": 0.1174144297838211, "num_input_tokens_seen": 3331124, "step": 3231, "train_runtime": 7827.1648, "train_tokens_per_second": 425.585 }, { "epoch": 1.381237311678598, "grad_norm": 2.849505662918091, "learning_rate": 6.198930481283423e-06, "loss": 0.08645319193601608, "num_input_tokens_seen": 3331968, "step": 3232, "train_runtime": 7829.2195, "train_tokens_per_second": 425.581 }, { "epoch": 1.381664707767924, "grad_norm": 2.091911554336548, "learning_rate": 6.1946524064171134e-06, "loss": 0.061108991503715515, "num_input_tokens_seen": 3333166, "step": 3233, "train_runtime": 7831.3448, "train_tokens_per_second": 425.619 }, { "epoch": 1.3820921038572498, "grad_norm": 3.3379859924316406, "learning_rate": 6.190374331550803e-06, "loss": 0.11296980082988739, "num_input_tokens_seen": 3333980, "step": 3234, "train_runtime": 7833.3626, "train_tokens_per_second": 425.613 }, { "epoch": 1.3825194999465755, "grad_norm": 2.765662908554077, "learning_rate": 6.186096256684493e-06, "loss": 0.07650604844093323, "num_input_tokens_seen": 3335564, "step": 3235, "train_runtime": 7835.5906, "train_tokens_per_second": 425.694 }, { "epoch": 1.3829468960359013, "grad_norm": 2.891916275024414, "learning_rate": 6.181818181818182e-06, "loss": 0.06541066616773605, "num_input_tokens_seen": 3336810, "step": 3236, "train_runtime": 7837.764, "train_tokens_per_second": 425.735 }, { "epoch": 1.383374292125227, "grad_norm": 2.093151807785034, "learning_rate": 6.177540106951873e-06, "loss": 0.07020801305770874, "num_input_tokens_seen": 3337786, "step": 3237, "train_runtime": 7839.8166, "train_tokens_per_second": 425.748 }, { "epoch": 1.383801688214553, "grad_norm": 2.0807228088378906, "learning_rate": 6.1732620320855615e-06, "loss": 0.09419591724872589, "num_input_tokens_seen": 3338878, "step": 3238, "train_runtime": 7841.9428, "train_tokens_per_second": 425.772 }, { "epoch": 1.3842290843038787, "grad_norm": 3.4361512660980225, "learning_rate": 6.168983957219253e-06, "loss": 0.11589787900447845, "num_input_tokens_seen": 3339822, "step": 3239, "train_runtime": 7844.0139, "train_tokens_per_second": 425.78 }, { "epoch": 1.3846564803932044, "grad_norm": 2.43046236038208, "learning_rate": 6.164705882352941e-06, "loss": 0.06651141494512558, "num_input_tokens_seen": 3340934, "step": 3240, "train_runtime": 7846.1423, "train_tokens_per_second": 425.806 }, { "epoch": 1.3850838764825302, "grad_norm": 3.2076175212860107, "learning_rate": 6.1604278074866315e-06, "loss": 0.1519242823123932, "num_input_tokens_seen": 3342036, "step": 3241, "train_runtime": 7854.9541, "train_tokens_per_second": 425.469 }, { "epoch": 1.385511272571856, "grad_norm": 2.9235315322875977, "learning_rate": 6.156149732620321e-06, "loss": 0.08675135672092438, "num_input_tokens_seen": 3342836, "step": 3242, "train_runtime": 7857.0448, "train_tokens_per_second": 425.457 }, { "epoch": 1.3859386686611819, "grad_norm": 3.4454190731048584, "learning_rate": 6.151871657754011e-06, "loss": 0.0739680826663971, "num_input_tokens_seen": 3343546, "step": 3243, "train_runtime": 7859.2758, "train_tokens_per_second": 425.427 }, { "epoch": 1.3863660647505076, "grad_norm": 3.0161163806915283, "learning_rate": 6.147593582887701e-06, "loss": 0.055188506841659546, "num_input_tokens_seen": 3344216, "step": 3244, "train_runtime": 7861.324, "train_tokens_per_second": 425.401 }, { "epoch": 1.3867934608398333, "grad_norm": 3.4926955699920654, "learning_rate": 6.143315508021391e-06, "loss": 0.11531645059585571, "num_input_tokens_seen": 3344990, "step": 3245, "train_runtime": 7863.3465, "train_tokens_per_second": 425.39 }, { "epoch": 1.387220856929159, "grad_norm": 2.739166021347046, "learning_rate": 6.1390374331550805e-06, "loss": 0.07723821699619293, "num_input_tokens_seen": 3345798, "step": 3246, "train_runtime": 7865.3728, "train_tokens_per_second": 425.383 }, { "epoch": 1.3876482530184848, "grad_norm": 2.535468339920044, "learning_rate": 6.134759358288771e-06, "loss": 0.09975472092628479, "num_input_tokens_seen": 3346956, "step": 3247, "train_runtime": 7867.5149, "train_tokens_per_second": 425.415 }, { "epoch": 1.3880756491078108, "grad_norm": 2.196161985397339, "learning_rate": 6.13048128342246e-06, "loss": 0.08604616671800613, "num_input_tokens_seen": 3348918, "step": 3248, "train_runtime": 7869.8792, "train_tokens_per_second": 425.536 }, { "epoch": 1.3885030451971365, "grad_norm": 2.617840051651001, "learning_rate": 6.1262032085561505e-06, "loss": 0.09151151776313782, "num_input_tokens_seen": 3349608, "step": 3249, "train_runtime": 7871.9382, "train_tokens_per_second": 425.512 }, { "epoch": 1.3889304412864623, "grad_norm": 2.439768075942993, "learning_rate": 6.12192513368984e-06, "loss": 0.098683200776577, "num_input_tokens_seen": 3351060, "step": 3250, "train_runtime": 7874.2035, "train_tokens_per_second": 425.574 }, { "epoch": 1.389357837375788, "grad_norm": 1.9714925289154053, "learning_rate": 6.11764705882353e-06, "loss": 0.06090874969959259, "num_input_tokens_seen": 3351784, "step": 3251, "train_runtime": 7876.2825, "train_tokens_per_second": 425.554 }, { "epoch": 1.3897852334651137, "grad_norm": 3.021029233932495, "learning_rate": 6.11336898395722e-06, "loss": 0.1005382388830185, "num_input_tokens_seen": 3352838, "step": 3252, "train_runtime": 7878.4455, "train_tokens_per_second": 425.571 }, { "epoch": 1.3902126295544397, "grad_norm": 2.7178242206573486, "learning_rate": 6.10909090909091e-06, "loss": 0.13861191272735596, "num_input_tokens_seen": 3354390, "step": 3253, "train_runtime": 7880.6542, "train_tokens_per_second": 425.649 }, { "epoch": 1.3906400256437654, "grad_norm": 4.7103447914123535, "learning_rate": 6.104812834224599e-06, "loss": 0.10404442250728607, "num_input_tokens_seen": 3355422, "step": 3254, "train_runtime": 7882.7686, "train_tokens_per_second": 425.665 }, { "epoch": 1.3910674217330912, "grad_norm": 2.4716503620147705, "learning_rate": 6.10053475935829e-06, "loss": 0.06483546644449234, "num_input_tokens_seen": 3356166, "step": 3255, "train_runtime": 7884.8226, "train_tokens_per_second": 425.649 }, { "epoch": 1.391494817822417, "grad_norm": 2.449089288711548, "learning_rate": 6.096256684491979e-06, "loss": 0.0674515962600708, "num_input_tokens_seen": 3357178, "step": 3256, "train_runtime": 7886.964, "train_tokens_per_second": 425.662 }, { "epoch": 1.3919222139117426, "grad_norm": 2.07804799079895, "learning_rate": 6.0919786096256694e-06, "loss": 0.07267894595861435, "num_input_tokens_seen": 3358174, "step": 3257, "train_runtime": 7889.0536, "train_tokens_per_second": 425.675 }, { "epoch": 1.3923496100010686, "grad_norm": 2.101487159729004, "learning_rate": 6.087700534759359e-06, "loss": 0.0976356789469719, "num_input_tokens_seen": 3359174, "step": 3258, "train_runtime": 7891.2149, "train_tokens_per_second": 425.685 }, { "epoch": 1.3927770060903943, "grad_norm": 2.7273178100585938, "learning_rate": 6.083422459893049e-06, "loss": 0.11177102476358414, "num_input_tokens_seen": 3360114, "step": 3259, "train_runtime": 7893.2804, "train_tokens_per_second": 425.693 }, { "epoch": 1.39320440217972, "grad_norm": 1.8124136924743652, "learning_rate": 6.079144385026739e-06, "loss": 0.06550105661153793, "num_input_tokens_seen": 3361138, "step": 3260, "train_runtime": 7895.365, "train_tokens_per_second": 425.71 }, { "epoch": 1.3936317982690458, "grad_norm": 2.7312512397766113, "learning_rate": 6.074866310160429e-06, "loss": 0.06788568198680878, "num_input_tokens_seen": 3361994, "step": 3261, "train_runtime": 7897.3823, "train_tokens_per_second": 425.71 }, { "epoch": 1.3940591943583716, "grad_norm": 2.6394524574279785, "learning_rate": 6.070588235294118e-06, "loss": 0.09610903263092041, "num_input_tokens_seen": 3362964, "step": 3262, "train_runtime": 7899.4652, "train_tokens_per_second": 425.72 }, { "epoch": 1.3944865904476975, "grad_norm": 2.760646104812622, "learning_rate": 6.066310160427809e-06, "loss": 0.06169695779681206, "num_input_tokens_seen": 3363918, "step": 3263, "train_runtime": 7901.6277, "train_tokens_per_second": 425.725 }, { "epoch": 1.3949139865370233, "grad_norm": 2.8675825595855713, "learning_rate": 6.062032085561498e-06, "loss": 0.08873794972896576, "num_input_tokens_seen": 3364968, "step": 3264, "train_runtime": 7903.7118, "train_tokens_per_second": 425.745 }, { "epoch": 1.395341382626349, "grad_norm": 2.1839499473571777, "learning_rate": 6.057754010695188e-06, "loss": 0.07397759705781937, "num_input_tokens_seen": 3365880, "step": 3265, "train_runtime": 7905.7644, "train_tokens_per_second": 425.75 }, { "epoch": 1.3957687787156747, "grad_norm": 2.5855510234832764, "learning_rate": 6.053475935828878e-06, "loss": 0.05796331912279129, "num_input_tokens_seen": 3366844, "step": 3266, "train_runtime": 7907.9275, "train_tokens_per_second": 425.756 }, { "epoch": 1.3961961748050005, "grad_norm": 2.515497922897339, "learning_rate": 6.049197860962568e-06, "loss": 0.09895144402980804, "num_input_tokens_seen": 3368118, "step": 3267, "train_runtime": 7910.1973, "train_tokens_per_second": 425.794 }, { "epoch": 1.3966235708943264, "grad_norm": 3.038151502609253, "learning_rate": 6.044919786096258e-06, "loss": 0.08927208185195923, "num_input_tokens_seen": 3368890, "step": 3268, "train_runtime": 7912.2153, "train_tokens_per_second": 425.783 }, { "epoch": 1.3970509669836522, "grad_norm": 1.5889421701431274, "learning_rate": 6.040641711229946e-06, "loss": 0.04282796382904053, "num_input_tokens_seen": 3370000, "step": 3269, "train_runtime": 7914.3488, "train_tokens_per_second": 425.809 }, { "epoch": 1.397478363072978, "grad_norm": 3.962462902069092, "learning_rate": 6.0363636363636365e-06, "loss": 0.11668793857097626, "num_input_tokens_seen": 3370638, "step": 3270, "train_runtime": 7916.3317, "train_tokens_per_second": 425.783 }, { "epoch": 1.3979057591623036, "grad_norm": 2.4602210521698, "learning_rate": 6.032085561497326e-06, "loss": 0.12678514420986176, "num_input_tokens_seen": 3372222, "step": 3271, "train_runtime": 7925.236, "train_tokens_per_second": 425.504 }, { "epoch": 1.3983331552516294, "grad_norm": 3.434453248977661, "learning_rate": 6.027807486631016e-06, "loss": 0.1236409917473793, "num_input_tokens_seen": 3373236, "step": 3272, "train_runtime": 7927.4754, "train_tokens_per_second": 425.512 }, { "epoch": 1.3987605513409553, "grad_norm": 2.778341293334961, "learning_rate": 6.023529411764706e-06, "loss": 0.159600168466568, "num_input_tokens_seen": 3374566, "step": 3273, "train_runtime": 7929.6698, "train_tokens_per_second": 425.562 }, { "epoch": 1.399187947430281, "grad_norm": 3.214672803878784, "learning_rate": 6.019251336898396e-06, "loss": 0.07167714834213257, "num_input_tokens_seen": 3375176, "step": 3274, "train_runtime": 7931.7042, "train_tokens_per_second": 425.53 }, { "epoch": 1.3996153435196068, "grad_norm": 3.492658853530884, "learning_rate": 6.014973262032085e-06, "loss": 0.07649270445108414, "num_input_tokens_seen": 3375926, "step": 3275, "train_runtime": 7933.7272, "train_tokens_per_second": 425.516 }, { "epoch": 1.4000427396089326, "grad_norm": 2.721825361251831, "learning_rate": 6.010695187165776e-06, "loss": 0.05536902695894241, "num_input_tokens_seen": 3376746, "step": 3276, "train_runtime": 7935.7973, "train_tokens_per_second": 425.508 }, { "epoch": 1.4000427396089326, "eval_loss": 0.5228173136711121, "eval_runtime": 58.4858, "eval_samples_per_second": 17.064, "eval_steps_per_second": 8.532, "num_input_tokens_seen": 3376746, "step": 3276 }, { "epoch": 1.4004701356982583, "grad_norm": 2.9269371032714844, "learning_rate": 6.006417112299465e-06, "loss": 0.11548300087451935, "num_input_tokens_seen": 3377638, "step": 3277, "train_runtime": 7996.4036, "train_tokens_per_second": 422.395 }, { "epoch": 1.4008975317875842, "grad_norm": 4.1711883544921875, "learning_rate": 6.0021390374331554e-06, "loss": 0.10242607444524765, "num_input_tokens_seen": 3378530, "step": 3278, "train_runtime": 7998.452, "train_tokens_per_second": 422.398 }, { "epoch": 1.40132492787691, "grad_norm": 2.544394016265869, "learning_rate": 5.997860962566845e-06, "loss": 0.08933587372303009, "num_input_tokens_seen": 3379626, "step": 3279, "train_runtime": 8000.5639, "train_tokens_per_second": 422.423 }, { "epoch": 1.4017523239662357, "grad_norm": 1.9375145435333252, "learning_rate": 5.993582887700535e-06, "loss": 0.055566221475601196, "num_input_tokens_seen": 3380814, "step": 3280, "train_runtime": 8002.713, "train_tokens_per_second": 422.458 }, { "epoch": 1.4021797200555615, "grad_norm": 2.98313307762146, "learning_rate": 5.989304812834225e-06, "loss": 0.053592294454574585, "num_input_tokens_seen": 3381844, "step": 3281, "train_runtime": 8004.8024, "train_tokens_per_second": 422.477 }, { "epoch": 1.4026071161448872, "grad_norm": 2.6182615756988525, "learning_rate": 5.985026737967915e-06, "loss": 0.07741963863372803, "num_input_tokens_seen": 3382824, "step": 3282, "train_runtime": 8007.0197, "train_tokens_per_second": 422.482 }, { "epoch": 1.4030345122342132, "grad_norm": 3.2741074562072754, "learning_rate": 5.980748663101604e-06, "loss": 0.09766849130392075, "num_input_tokens_seen": 3383700, "step": 3283, "train_runtime": 8009.1251, "train_tokens_per_second": 422.481 }, { "epoch": 1.403461908323539, "grad_norm": 2.3035178184509277, "learning_rate": 5.976470588235295e-06, "loss": 0.09213754534721375, "num_input_tokens_seen": 3384786, "step": 3284, "train_runtime": 8011.2104, "train_tokens_per_second": 422.506 }, { "epoch": 1.4038893044128646, "grad_norm": 2.2309117317199707, "learning_rate": 5.972192513368984e-06, "loss": 0.07901042699813843, "num_input_tokens_seen": 3385842, "step": 3285, "train_runtime": 8013.3411, "train_tokens_per_second": 422.526 }, { "epoch": 1.4043167005021904, "grad_norm": 2.4701178073883057, "learning_rate": 5.967914438502674e-06, "loss": 0.083577960729599, "num_input_tokens_seen": 3386646, "step": 3286, "train_runtime": 8015.3636, "train_tokens_per_second": 422.519 }, { "epoch": 1.4047440965915161, "grad_norm": 3.515695810317993, "learning_rate": 5.963636363636364e-06, "loss": 0.06064355745911598, "num_input_tokens_seen": 3387208, "step": 3287, "train_runtime": 8017.3234, "train_tokens_per_second": 422.486 }, { "epoch": 1.405171492680842, "grad_norm": 1.9999638795852661, "learning_rate": 5.959358288770054e-06, "loss": 0.05568959563970566, "num_input_tokens_seen": 3388584, "step": 3288, "train_runtime": 8019.5323, "train_tokens_per_second": 422.541 }, { "epoch": 1.4055988887701678, "grad_norm": 3.764004707336426, "learning_rate": 5.9550802139037436e-06, "loss": 0.08620937168598175, "num_input_tokens_seen": 3389254, "step": 3289, "train_runtime": 8021.5274, "train_tokens_per_second": 422.52 }, { "epoch": 1.4060262848594935, "grad_norm": 3.606846809387207, "learning_rate": 5.950802139037434e-06, "loss": 0.10050512850284576, "num_input_tokens_seen": 3389826, "step": 3290, "train_runtime": 8023.5298, "train_tokens_per_second": 422.486 }, { "epoch": 1.4064536809488193, "grad_norm": 1.91462242603302, "learning_rate": 5.946524064171123e-06, "loss": 0.07654330134391785, "num_input_tokens_seen": 3392164, "step": 3291, "train_runtime": 8025.9654, "train_tokens_per_second": 422.649 }, { "epoch": 1.406881077038145, "grad_norm": 2.7579917907714844, "learning_rate": 5.942245989304814e-06, "loss": 0.05657302588224411, "num_input_tokens_seen": 3392902, "step": 3292, "train_runtime": 8028.0984, "train_tokens_per_second": 422.628 }, { "epoch": 1.407308473127471, "grad_norm": 2.145709753036499, "learning_rate": 5.937967914438503e-06, "loss": 0.0642455592751503, "num_input_tokens_seen": 3393572, "step": 3293, "train_runtime": 8030.1262, "train_tokens_per_second": 422.605 }, { "epoch": 1.4077358692167967, "grad_norm": 2.3519108295440674, "learning_rate": 5.933689839572193e-06, "loss": 0.08043119311332703, "num_input_tokens_seen": 3394936, "step": 3294, "train_runtime": 8032.3303, "train_tokens_per_second": 422.659 }, { "epoch": 1.4081632653061225, "grad_norm": 2.605780601501465, "learning_rate": 5.929411764705883e-06, "loss": 0.08094091713428497, "num_input_tokens_seen": 3395768, "step": 3295, "train_runtime": 8034.3804, "train_tokens_per_second": 422.655 }, { "epoch": 1.4085906613954482, "grad_norm": 2.5442302227020264, "learning_rate": 5.925133689839573e-06, "loss": 0.10728247463703156, "num_input_tokens_seen": 3397042, "step": 3296, "train_runtime": 8036.5455, "train_tokens_per_second": 422.699 }, { "epoch": 1.409018057484774, "grad_norm": 3.6697146892547607, "learning_rate": 5.9208556149732625e-06, "loss": 0.0980713739991188, "num_input_tokens_seen": 3397924, "step": 3297, "train_runtime": 8038.6002, "train_tokens_per_second": 422.701 }, { "epoch": 1.4094454535741, "grad_norm": 3.2714905738830566, "learning_rate": 5.916577540106953e-06, "loss": 0.08470352739095688, "num_input_tokens_seen": 3398894, "step": 3298, "train_runtime": 8040.6876, "train_tokens_per_second": 422.712 }, { "epoch": 1.4098728496634256, "grad_norm": 2.5557289123535156, "learning_rate": 5.912299465240641e-06, "loss": 0.06353791803121567, "num_input_tokens_seen": 3399736, "step": 3299, "train_runtime": 8042.7452, "train_tokens_per_second": 422.708 }, { "epoch": 1.4103002457527514, "grad_norm": 3.2656362056732178, "learning_rate": 5.9080213903743326e-06, "loss": 0.1370503306388855, "num_input_tokens_seen": 3400642, "step": 3300, "train_runtime": 8044.8074, "train_tokens_per_second": 422.713 }, { "epoch": 1.410727641842077, "grad_norm": 1.4520354270935059, "learning_rate": 5.903743315508021e-06, "loss": 0.03744306415319443, "num_input_tokens_seen": 3401634, "step": 3301, "train_runtime": 8053.4928, "train_tokens_per_second": 422.38 }, { "epoch": 1.4111550379314028, "grad_norm": 2.6194164752960205, "learning_rate": 5.899465240641712e-06, "loss": 0.06881201267242432, "num_input_tokens_seen": 3402664, "step": 3302, "train_runtime": 8055.5522, "train_tokens_per_second": 422.4 }, { "epoch": 1.4115824340207288, "grad_norm": 2.7365314960479736, "learning_rate": 5.895187165775401e-06, "loss": 0.11222471296787262, "num_input_tokens_seen": 3404336, "step": 3303, "train_runtime": 8058.0261, "train_tokens_per_second": 422.478 }, { "epoch": 1.4120098301100545, "grad_norm": 2.707691192626953, "learning_rate": 5.890909090909091e-06, "loss": 0.10020206868648529, "num_input_tokens_seen": 3405616, "step": 3304, "train_runtime": 8060.2164, "train_tokens_per_second": 422.522 }, { "epoch": 1.4124372261993803, "grad_norm": 2.190894842147827, "learning_rate": 5.886631016042781e-06, "loss": 0.08316968381404877, "num_input_tokens_seen": 3407272, "step": 3305, "train_runtime": 8062.4888, "train_tokens_per_second": 422.608 }, { "epoch": 1.412864622288706, "grad_norm": 2.6829841136932373, "learning_rate": 5.882352941176471e-06, "loss": 0.08554250001907349, "num_input_tokens_seen": 3407982, "step": 3306, "train_runtime": 8064.5385, "train_tokens_per_second": 422.589 }, { "epoch": 1.4132920183780318, "grad_norm": 4.562150001525879, "learning_rate": 5.87807486631016e-06, "loss": 0.0754498690366745, "num_input_tokens_seen": 3409010, "step": 3307, "train_runtime": 8066.6763, "train_tokens_per_second": 422.604 }, { "epoch": 1.4137194144673577, "grad_norm": 2.3213205337524414, "learning_rate": 5.873796791443851e-06, "loss": 0.0716032087802887, "num_input_tokens_seen": 3410246, "step": 3308, "train_runtime": 8068.8521, "train_tokens_per_second": 422.643 }, { "epoch": 1.4141468105566835, "grad_norm": 2.7951669692993164, "learning_rate": 5.86951871657754e-06, "loss": 0.0717962235212326, "num_input_tokens_seen": 3410970, "step": 3309, "train_runtime": 8070.8783, "train_tokens_per_second": 422.627 }, { "epoch": 1.4145742066460092, "grad_norm": 2.3975892066955566, "learning_rate": 5.86524064171123e-06, "loss": 0.10723154246807098, "num_input_tokens_seen": 3411910, "step": 3310, "train_runtime": 8072.9585, "train_tokens_per_second": 422.634 }, { "epoch": 1.415001602735335, "grad_norm": 2.0501773357391357, "learning_rate": 5.86096256684492e-06, "loss": 0.06581204384565353, "num_input_tokens_seen": 3412864, "step": 3311, "train_runtime": 8075.0418, "train_tokens_per_second": 422.644 }, { "epoch": 1.4154289988246607, "grad_norm": 3.418687343597412, "learning_rate": 5.85668449197861e-06, "loss": 0.09550642967224121, "num_input_tokens_seen": 3413604, "step": 3312, "train_runtime": 8077.0561, "train_tokens_per_second": 422.63 }, { "epoch": 1.4158563949139866, "grad_norm": 2.386291265487671, "learning_rate": 5.8524064171123e-06, "loss": 0.076219841837883, "num_input_tokens_seen": 3414552, "step": 3313, "train_runtime": 8079.124, "train_tokens_per_second": 422.639 }, { "epoch": 1.4162837910033124, "grad_norm": 2.824305534362793, "learning_rate": 5.84812834224599e-06, "loss": 0.09948301315307617, "num_input_tokens_seen": 3415394, "step": 3314, "train_runtime": 8081.2181, "train_tokens_per_second": 422.634 }, { "epoch": 1.416711187092638, "grad_norm": 3.9405288696289062, "learning_rate": 5.843850267379679e-06, "loss": 0.07686260342597961, "num_input_tokens_seen": 3416112, "step": 3315, "train_runtime": 8083.3316, "train_tokens_per_second": 422.612 }, { "epoch": 1.4171385831819638, "grad_norm": 2.819261312484741, "learning_rate": 5.83957219251337e-06, "loss": 0.11186288297176361, "num_input_tokens_seen": 3417374, "step": 3316, "train_runtime": 8085.5186, "train_tokens_per_second": 422.654 }, { "epoch": 1.4175659792712896, "grad_norm": 2.714190721511841, "learning_rate": 5.835294117647059e-06, "loss": 0.06278377026319504, "num_input_tokens_seen": 3418006, "step": 3317, "train_runtime": 8087.548, "train_tokens_per_second": 422.626 }, { "epoch": 1.4179933753606155, "grad_norm": 2.5089035034179688, "learning_rate": 5.831016042780749e-06, "loss": 0.0700489729642868, "num_input_tokens_seen": 3418738, "step": 3318, "train_runtime": 8089.6899, "train_tokens_per_second": 422.604 }, { "epoch": 1.4184207714499413, "grad_norm": 2.058255434036255, "learning_rate": 5.826737967914439e-06, "loss": 0.07212214171886444, "num_input_tokens_seen": 3420098, "step": 3319, "train_runtime": 8091.915, "train_tokens_per_second": 422.656 }, { "epoch": 1.418848167539267, "grad_norm": 2.40096378326416, "learning_rate": 5.822459893048129e-06, "loss": 0.07313577085733414, "num_input_tokens_seen": 3420958, "step": 3320, "train_runtime": 8094.0063, "train_tokens_per_second": 422.653 }, { "epoch": 1.4192755636285928, "grad_norm": 2.945573568344116, "learning_rate": 5.8181818181818185e-06, "loss": 0.10425429046154022, "num_input_tokens_seen": 3421848, "step": 3321, "train_runtime": 8096.0691, "train_tokens_per_second": 422.655 }, { "epoch": 1.4197029597179185, "grad_norm": 4.813085079193115, "learning_rate": 5.813903743315509e-06, "loss": 0.10666569322347641, "num_input_tokens_seen": 3422528, "step": 3322, "train_runtime": 8098.147, "train_tokens_per_second": 422.631 }, { "epoch": 1.4201303558072444, "grad_norm": 2.222306251525879, "learning_rate": 5.809625668449198e-06, "loss": 0.07510511577129364, "num_input_tokens_seen": 3423812, "step": 3323, "train_runtime": 8100.2616, "train_tokens_per_second": 422.679 }, { "epoch": 1.4205577518965702, "grad_norm": 2.2628870010375977, "learning_rate": 5.8053475935828886e-06, "loss": 0.06365840882062912, "num_input_tokens_seen": 3424664, "step": 3324, "train_runtime": 8102.2914, "train_tokens_per_second": 422.678 }, { "epoch": 1.420985147985896, "grad_norm": 3.2907354831695557, "learning_rate": 5.801069518716578e-06, "loss": 0.09870798885822296, "num_input_tokens_seen": 3425506, "step": 3325, "train_runtime": 8104.3527, "train_tokens_per_second": 422.675 }, { "epoch": 1.4214125440752217, "grad_norm": 3.198361396789551, "learning_rate": 5.796791443850268e-06, "loss": 0.09451224654912949, "num_input_tokens_seen": 3426584, "step": 3326, "train_runtime": 8106.4991, "train_tokens_per_second": 422.696 }, { "epoch": 1.4218399401645474, "grad_norm": 3.202866554260254, "learning_rate": 5.792513368983958e-06, "loss": 0.08676502853631973, "num_input_tokens_seen": 3427396, "step": 3327, "train_runtime": 8108.5508, "train_tokens_per_second": 422.689 }, { "epoch": 1.4222673362538734, "grad_norm": 5.930995464324951, "learning_rate": 5.788235294117648e-06, "loss": 0.09072207659482956, "num_input_tokens_seen": 3428824, "step": 3328, "train_runtime": 8110.7922, "train_tokens_per_second": 422.748 }, { "epoch": 1.422694732343199, "grad_norm": 3.1066980361938477, "learning_rate": 5.7839572192513375e-06, "loss": 0.10657098889350891, "num_input_tokens_seen": 3429514, "step": 3329, "train_runtime": 8112.7824, "train_tokens_per_second": 422.73 }, { "epoch": 1.4231221284325248, "grad_norm": 1.743547797203064, "learning_rate": 5.779679144385028e-06, "loss": 0.05457301437854767, "num_input_tokens_seen": 3430646, "step": 3330, "train_runtime": 8115.0892, "train_tokens_per_second": 422.749 }, { "epoch": 1.4235495245218506, "grad_norm": 2.8788514137268066, "learning_rate": 5.775401069518717e-06, "loss": 0.11445778608322144, "num_input_tokens_seen": 3432116, "step": 3331, "train_runtime": 8124.0387, "train_tokens_per_second": 422.464 }, { "epoch": 1.4239769206111763, "grad_norm": 3.868516206741333, "learning_rate": 5.7711229946524075e-06, "loss": 0.09987609088420868, "num_input_tokens_seen": 3432712, "step": 3332, "train_runtime": 8126.0717, "train_tokens_per_second": 422.432 }, { "epoch": 1.4244043167005023, "grad_norm": 1.805632472038269, "learning_rate": 5.766844919786096e-06, "loss": 0.07219941914081573, "num_input_tokens_seen": 3434014, "step": 3333, "train_runtime": 8128.2483, "train_tokens_per_second": 422.479 }, { "epoch": 1.424831712789828, "grad_norm": 2.495518684387207, "learning_rate": 5.762566844919787e-06, "loss": 0.08428099751472473, "num_input_tokens_seen": 3434822, "step": 3334, "train_runtime": 8130.3134, "train_tokens_per_second": 422.471 }, { "epoch": 1.4252591088791537, "grad_norm": 2.4579107761383057, "learning_rate": 5.758288770053476e-06, "loss": 0.09721948206424713, "num_input_tokens_seen": 3436342, "step": 3335, "train_runtime": 8132.637, "train_tokens_per_second": 422.537 }, { "epoch": 1.4256865049684795, "grad_norm": 4.116396903991699, "learning_rate": 5.754010695187167e-06, "loss": 0.12898507714271545, "num_input_tokens_seen": 3437160, "step": 3336, "train_runtime": 8134.7023, "train_tokens_per_second": 422.531 }, { "epoch": 1.4261139010578052, "grad_norm": 2.652043581008911, "learning_rate": 5.749732620320856e-06, "loss": 0.06861100345849991, "num_input_tokens_seen": 3437986, "step": 3337, "train_runtime": 8136.7504, "train_tokens_per_second": 422.526 }, { "epoch": 1.4265412971471312, "grad_norm": 3.158684492111206, "learning_rate": 5.745454545454546e-06, "loss": 0.07517271488904953, "num_input_tokens_seen": 3438746, "step": 3338, "train_runtime": 8138.7835, "train_tokens_per_second": 422.514 }, { "epoch": 1.426968693236457, "grad_norm": 2.2263336181640625, "learning_rate": 5.741176470588235e-06, "loss": 0.062450092285871506, "num_input_tokens_seen": 3439710, "step": 3339, "train_runtime": 8140.8374, "train_tokens_per_second": 422.525 }, { "epoch": 1.4273960893257827, "grad_norm": 3.6909103393554688, "learning_rate": 5.736898395721926e-06, "loss": 0.11271899938583374, "num_input_tokens_seen": 3440330, "step": 3340, "train_runtime": 8142.8141, "train_tokens_per_second": 422.499 }, { "epoch": 1.4278234854151084, "grad_norm": 1.6725077629089355, "learning_rate": 5.732620320855615e-06, "loss": 0.0480821318924427, "num_input_tokens_seen": 3441264, "step": 3341, "train_runtime": 8144.9915, "train_tokens_per_second": 422.501 }, { "epoch": 1.4282508815044341, "grad_norm": 3.02956485748291, "learning_rate": 5.728342245989305e-06, "loss": 0.10927972197532654, "num_input_tokens_seen": 3442282, "step": 3342, "train_runtime": 8147.1691, "train_tokens_per_second": 422.513 }, { "epoch": 1.42867827759376, "grad_norm": 2.569598913192749, "learning_rate": 5.724064171122995e-06, "loss": 0.04497809708118439, "num_input_tokens_seen": 3443004, "step": 3343, "train_runtime": 8149.2002, "train_tokens_per_second": 422.496 }, { "epoch": 1.4291056736830858, "grad_norm": 1.9206790924072266, "learning_rate": 5.719786096256685e-06, "loss": 0.07463937252759933, "num_input_tokens_seen": 3444348, "step": 3344, "train_runtime": 8151.4019, "train_tokens_per_second": 422.547 }, { "epoch": 1.4295330697724116, "grad_norm": 3.100486993789673, "learning_rate": 5.7155080213903745e-06, "loss": 0.07265537232160568, "num_input_tokens_seen": 3445336, "step": 3345, "train_runtime": 8153.5082, "train_tokens_per_second": 422.559 }, { "epoch": 1.4299604658617373, "grad_norm": 2.538771867752075, "learning_rate": 5.711229946524065e-06, "loss": 0.101160928606987, "num_input_tokens_seen": 3446364, "step": 3346, "train_runtime": 8155.7078, "train_tokens_per_second": 422.571 }, { "epoch": 1.430387861951063, "grad_norm": 2.903012752532959, "learning_rate": 5.706951871657754e-06, "loss": 0.09906446933746338, "num_input_tokens_seen": 3447158, "step": 3347, "train_runtime": 8157.7787, "train_tokens_per_second": 422.561 }, { "epoch": 1.430815258040389, "grad_norm": 3.4784984588623047, "learning_rate": 5.702673796791445e-06, "loss": 0.12654723227024078, "num_input_tokens_seen": 3448074, "step": 3348, "train_runtime": 8159.9385, "train_tokens_per_second": 422.561 }, { "epoch": 1.4312426541297147, "grad_norm": 2.8888609409332275, "learning_rate": 5.698395721925134e-06, "loss": 0.08391845226287842, "num_input_tokens_seen": 3449190, "step": 3349, "train_runtime": 8162.0231, "train_tokens_per_second": 422.59 }, { "epoch": 1.4316700502190405, "grad_norm": 2.6996712684631348, "learning_rate": 5.694117647058824e-06, "loss": 0.10848686099052429, "num_input_tokens_seen": 3450114, "step": 3350, "train_runtime": 8164.1669, "train_tokens_per_second": 422.592 }, { "epoch": 1.4320974463083662, "grad_norm": 2.638010025024414, "learning_rate": 5.689839572192514e-06, "loss": 0.06812462210655212, "num_input_tokens_seen": 3450882, "step": 3351, "train_runtime": 8166.2183, "train_tokens_per_second": 422.58 }, { "epoch": 1.432524842397692, "grad_norm": 1.608130693435669, "learning_rate": 5.685561497326204e-06, "loss": 0.06419845670461655, "num_input_tokens_seen": 3452208, "step": 3352, "train_runtime": 8168.4642, "train_tokens_per_second": 422.626 }, { "epoch": 1.432952238487018, "grad_norm": 2.9062299728393555, "learning_rate": 5.6812834224598935e-06, "loss": 0.07693544030189514, "num_input_tokens_seen": 3453014, "step": 3353, "train_runtime": 8170.5475, "train_tokens_per_second": 422.617 }, { "epoch": 1.4333796345763437, "grad_norm": 1.127708911895752, "learning_rate": 5.677005347593584e-06, "loss": 0.03639684244990349, "num_input_tokens_seen": 3454954, "step": 3354, "train_runtime": 8172.8804, "train_tokens_per_second": 422.734 }, { "epoch": 1.4338070306656694, "grad_norm": 2.1426429748535156, "learning_rate": 5.672727272727273e-06, "loss": 0.06263867020606995, "num_input_tokens_seen": 3456072, "step": 3355, "train_runtime": 8174.9586, "train_tokens_per_second": 422.763 }, { "epoch": 1.4342344267549951, "grad_norm": 2.771253824234009, "learning_rate": 5.6684491978609635e-06, "loss": 0.08619582653045654, "num_input_tokens_seen": 3457078, "step": 3356, "train_runtime": 8177.0134, "train_tokens_per_second": 422.78 }, { "epoch": 1.4346618228443209, "grad_norm": 2.44169545173645, "learning_rate": 5.664171122994653e-06, "loss": 0.06517580896615982, "num_input_tokens_seen": 3457792, "step": 3357, "train_runtime": 8179.0374, "train_tokens_per_second": 422.763 }, { "epoch": 1.4350892189336468, "grad_norm": 3.2420051097869873, "learning_rate": 5.659893048128343e-06, "loss": 0.09686869382858276, "num_input_tokens_seen": 3458602, "step": 3358, "train_runtime": 8181.0818, "train_tokens_per_second": 422.756 }, { "epoch": 1.4355166150229726, "grad_norm": 3.132455825805664, "learning_rate": 5.655614973262033e-06, "loss": 0.08758358657360077, "num_input_tokens_seen": 3459278, "step": 3359, "train_runtime": 8183.0658, "train_tokens_per_second": 422.736 }, { "epoch": 1.4359440111122983, "grad_norm": 2.7000677585601807, "learning_rate": 5.651336898395723e-06, "loss": 0.07843629270792007, "num_input_tokens_seen": 3460328, "step": 3360, "train_runtime": 8185.1773, "train_tokens_per_second": 422.755 }, { "epoch": 1.436371407201624, "grad_norm": 2.8171896934509277, "learning_rate": 5.6470588235294125e-06, "loss": 0.0721723884344101, "num_input_tokens_seen": 3461146, "step": 3361, "train_runtime": 8194.0761, "train_tokens_per_second": 422.396 }, { "epoch": 1.4367988032909498, "grad_norm": 2.8880884647369385, "learning_rate": 5.642780748663103e-06, "loss": 0.05921054631471634, "num_input_tokens_seen": 3461900, "step": 3362, "train_runtime": 8196.1972, "train_tokens_per_second": 422.379 }, { "epoch": 1.4372261993802757, "grad_norm": 3.226677179336548, "learning_rate": 5.638502673796792e-06, "loss": 0.11903731524944305, "num_input_tokens_seen": 3463580, "step": 3363, "train_runtime": 8198.5634, "train_tokens_per_second": 422.462 }, { "epoch": 1.4376535954696015, "grad_norm": 1.6061899662017822, "learning_rate": 5.6342245989304825e-06, "loss": 0.04425713047385216, "num_input_tokens_seen": 3464586, "step": 3364, "train_runtime": 8200.8167, "train_tokens_per_second": 422.468 }, { "epoch": 1.4380809915589272, "grad_norm": 2.3322904109954834, "learning_rate": 5.629946524064172e-06, "loss": 0.06715641915798187, "num_input_tokens_seen": 3465548, "step": 3365, "train_runtime": 8203.1201, "train_tokens_per_second": 422.467 }, { "epoch": 1.438508387648253, "grad_norm": 2.8087809085845947, "learning_rate": 5.625668449197862e-06, "loss": 0.06320177018642426, "num_input_tokens_seen": 3466286, "step": 3366, "train_runtime": 8205.1548, "train_tokens_per_second": 422.452 }, { "epoch": 1.4389357837375787, "grad_norm": 3.234147787094116, "learning_rate": 5.621390374331551e-06, "loss": 0.07897357642650604, "num_input_tokens_seen": 3467024, "step": 3367, "train_runtime": 8207.2212, "train_tokens_per_second": 422.436 }, { "epoch": 1.4393631798269046, "grad_norm": 2.737189769744873, "learning_rate": 5.617112299465242e-06, "loss": 0.08145792037248611, "num_input_tokens_seen": 3467804, "step": 3368, "train_runtime": 8209.2396, "train_tokens_per_second": 422.427 }, { "epoch": 1.4397905759162304, "grad_norm": 2.7741196155548096, "learning_rate": 5.6128342245989306e-06, "loss": 0.1259549856185913, "num_input_tokens_seen": 3469114, "step": 3369, "train_runtime": 8211.3905, "train_tokens_per_second": 422.476 }, { "epoch": 1.4402179720055561, "grad_norm": 2.974273204803467, "learning_rate": 5.608556149732622e-06, "loss": 0.07337890565395355, "num_input_tokens_seen": 3469832, "step": 3370, "train_runtime": 8213.473, "train_tokens_per_second": 422.456 }, { "epoch": 1.4406453680948819, "grad_norm": 3.4330101013183594, "learning_rate": 5.60427807486631e-06, "loss": 0.09360972046852112, "num_input_tokens_seen": 3470740, "step": 3371, "train_runtime": 8215.6387, "train_tokens_per_second": 422.455 }, { "epoch": 1.4410727641842076, "grad_norm": 2.310922861099243, "learning_rate": 5.600000000000001e-06, "loss": 0.0742092877626419, "num_input_tokens_seen": 3471684, "step": 3372, "train_runtime": 8217.7899, "train_tokens_per_second": 422.46 }, { "epoch": 1.4415001602735336, "grad_norm": 3.569305419921875, "learning_rate": 5.59572192513369e-06, "loss": 0.10085339844226837, "num_input_tokens_seen": 3472384, "step": 3373, "train_runtime": 8219.8268, "train_tokens_per_second": 422.44 }, { "epoch": 1.4419275563628593, "grad_norm": 3.0879979133605957, "learning_rate": 5.59144385026738e-06, "loss": 0.06029132753610611, "num_input_tokens_seen": 3473258, "step": 3374, "train_runtime": 8221.89, "train_tokens_per_second": 422.44 }, { "epoch": 1.442354952452185, "grad_norm": 2.059502124786377, "learning_rate": 5.58716577540107e-06, "loss": 0.03092336282134056, "num_input_tokens_seen": 3474226, "step": 3375, "train_runtime": 8223.9475, "train_tokens_per_second": 422.452 }, { "epoch": 1.4427823485415108, "grad_norm": 2.2955570220947266, "learning_rate": 5.58288770053476e-06, "loss": 0.048130616545677185, "num_input_tokens_seen": 3475244, "step": 3376, "train_runtime": 8226.0419, "train_tokens_per_second": 422.469 }, { "epoch": 1.4432097446308365, "grad_norm": 2.7250657081604004, "learning_rate": 5.5786096256684495e-06, "loss": 0.08422693610191345, "num_input_tokens_seen": 3475994, "step": 3377, "train_runtime": 8228.0659, "train_tokens_per_second": 422.456 }, { "epoch": 1.4436371407201625, "grad_norm": 2.998913288116455, "learning_rate": 5.574331550802139e-06, "loss": 0.08139088749885559, "num_input_tokens_seen": 3477770, "step": 3378, "train_runtime": 8230.3395, "train_tokens_per_second": 422.555 }, { "epoch": 1.4440645368094882, "grad_norm": 2.543578624725342, "learning_rate": 5.570053475935829e-06, "loss": 0.12946677207946777, "num_input_tokens_seen": 3479482, "step": 3379, "train_runtime": 8232.6176, "train_tokens_per_second": 422.646 }, { "epoch": 1.444491932898814, "grad_norm": 2.661632537841797, "learning_rate": 5.565775401069519e-06, "loss": 0.07993008941411972, "num_input_tokens_seen": 3480278, "step": 3380, "train_runtime": 8234.6443, "train_tokens_per_second": 422.639 }, { "epoch": 1.4449193289881397, "grad_norm": 3.101353645324707, "learning_rate": 5.561497326203209e-06, "loss": 0.15083709359169006, "num_input_tokens_seen": 3481240, "step": 3381, "train_runtime": 8236.7788, "train_tokens_per_second": 422.646 }, { "epoch": 1.4453467250774654, "grad_norm": 2.812164783477783, "learning_rate": 5.5572192513368984e-06, "loss": 0.09883914887905121, "num_input_tokens_seen": 3482460, "step": 3382, "train_runtime": 8238.9317, "train_tokens_per_second": 422.683 }, { "epoch": 1.4457741211667914, "grad_norm": 2.372804880142212, "learning_rate": 5.552941176470589e-06, "loss": 0.08400600403547287, "num_input_tokens_seen": 3483718, "step": 3383, "train_runtime": 8241.051, "train_tokens_per_second": 422.727 }, { "epoch": 1.4462015172561171, "grad_norm": 3.749724864959717, "learning_rate": 5.548663101604278e-06, "loss": 0.1743989884853363, "num_input_tokens_seen": 3484536, "step": 3384, "train_runtime": 8243.0736, "train_tokens_per_second": 422.723 }, { "epoch": 1.4466289133454429, "grad_norm": 3.051945209503174, "learning_rate": 5.5443850267379685e-06, "loss": 0.13166695833206177, "num_input_tokens_seen": 3485586, "step": 3385, "train_runtime": 8245.1255, "train_tokens_per_second": 422.745 }, { "epoch": 1.4470563094347686, "grad_norm": 1.5855789184570312, "learning_rate": 5.540106951871658e-06, "loss": 0.0466139018535614, "num_input_tokens_seen": 3486818, "step": 3386, "train_runtime": 8247.2447, "train_tokens_per_second": 422.786 }, { "epoch": 1.4474837055240943, "grad_norm": 2.6617164611816406, "learning_rate": 5.535828877005348e-06, "loss": 0.10417041927576065, "num_input_tokens_seen": 3487750, "step": 3387, "train_runtime": 8249.3002, "train_tokens_per_second": 422.793 }, { "epoch": 1.4479111016134203, "grad_norm": 3.13396954536438, "learning_rate": 5.531550802139038e-06, "loss": 0.06696020066738129, "num_input_tokens_seen": 3488566, "step": 3388, "train_runtime": 8251.3547, "train_tokens_per_second": 422.787 }, { "epoch": 1.448338497702746, "grad_norm": 2.83705735206604, "learning_rate": 5.527272727272728e-06, "loss": 0.0697670727968216, "num_input_tokens_seen": 3489408, "step": 3389, "train_runtime": 8253.4078, "train_tokens_per_second": 422.784 }, { "epoch": 1.4487658937920718, "grad_norm": 3.204883575439453, "learning_rate": 5.522994652406417e-06, "loss": 0.13399052619934082, "num_input_tokens_seen": 3490594, "step": 3390, "train_runtime": 8255.583, "train_tokens_per_second": 422.816 }, { "epoch": 1.4491932898813975, "grad_norm": 2.9109880924224854, "learning_rate": 5.518716577540108e-06, "loss": 0.09673532843589783, "num_input_tokens_seen": 3491528, "step": 3391, "train_runtime": 8264.3021, "train_tokens_per_second": 422.483 }, { "epoch": 1.4496206859707232, "grad_norm": 3.5054914951324463, "learning_rate": 5.514438502673797e-06, "loss": 0.10953780263662338, "num_input_tokens_seen": 3492236, "step": 3392, "train_runtime": 8266.2936, "train_tokens_per_second": 422.467 }, { "epoch": 1.4500480820600492, "grad_norm": 1.947727918624878, "learning_rate": 5.510160427807487e-06, "loss": 0.09512528032064438, "num_input_tokens_seen": 3494042, "step": 3393, "train_runtime": 8268.6239, "train_tokens_per_second": 422.566 }, { "epoch": 1.450475478149375, "grad_norm": 2.8469960689544678, "learning_rate": 5.505882352941177e-06, "loss": 0.07383649051189423, "num_input_tokens_seen": 3494992, "step": 3394, "train_runtime": 8270.7068, "train_tokens_per_second": 422.575 }, { "epoch": 1.4509028742387007, "grad_norm": 3.785738945007324, "learning_rate": 5.501604278074867e-06, "loss": 0.10403358936309814, "num_input_tokens_seen": 3495698, "step": 3395, "train_runtime": 8272.7259, "train_tokens_per_second": 422.557 }, { "epoch": 1.4513302703280264, "grad_norm": 2.586132526397705, "learning_rate": 5.497326203208556e-06, "loss": 0.07209435105323792, "num_input_tokens_seen": 3497202, "step": 3396, "train_runtime": 8274.9042, "train_tokens_per_second": 422.627 }, { "epoch": 1.4517576664173522, "grad_norm": 2.6013777256011963, "learning_rate": 5.493048128342247e-06, "loss": 0.07098311930894852, "num_input_tokens_seen": 3498130, "step": 3397, "train_runtime": 8276.9821, "train_tokens_per_second": 422.634 }, { "epoch": 1.4521850625066781, "grad_norm": 1.5699478387832642, "learning_rate": 5.4887700534759355e-06, "loss": 0.06787033379077911, "num_input_tokens_seen": 3499556, "step": 3398, "train_runtime": 8279.19, "train_tokens_per_second": 422.693 }, { "epoch": 1.4526124585960039, "grad_norm": 3.692495822906494, "learning_rate": 5.484491978609627e-06, "loss": 0.13066597282886505, "num_input_tokens_seen": 3500258, "step": 3399, "train_runtime": 8281.2447, "train_tokens_per_second": 422.673 }, { "epoch": 1.4530398546853296, "grad_norm": 4.033546447753906, "learning_rate": 5.480213903743315e-06, "loss": 0.09929617494344711, "num_input_tokens_seen": 3500900, "step": 3400, "train_runtime": 8283.2973, "train_tokens_per_second": 422.646 }, { "epoch": 1.4534672507746556, "grad_norm": 1.5992916822433472, "learning_rate": 5.4759358288770055e-06, "loss": 0.05435958504676819, "num_input_tokens_seen": 3502164, "step": 3401, "train_runtime": 8285.4583, "train_tokens_per_second": 422.688 }, { "epoch": 1.453894646863981, "grad_norm": 2.5853278636932373, "learning_rate": 5.471657754010695e-06, "loss": 0.0704997181892395, "num_input_tokens_seen": 3503062, "step": 3402, "train_runtime": 8287.527, "train_tokens_per_second": 422.691 }, { "epoch": 1.454322042953307, "grad_norm": 2.21325945854187, "learning_rate": 5.467379679144385e-06, "loss": 0.06303384155035019, "num_input_tokens_seen": 3503800, "step": 3403, "train_runtime": 8289.6252, "train_tokens_per_second": 422.673 }, { "epoch": 1.4547494390426328, "grad_norm": 3.524198532104492, "learning_rate": 5.463101604278075e-06, "loss": 0.09854979813098907, "num_input_tokens_seen": 3504602, "step": 3404, "train_runtime": 8291.6786, "train_tokens_per_second": 422.665 }, { "epoch": 1.4551768351319585, "grad_norm": 3.52382755279541, "learning_rate": 5.458823529411765e-06, "loss": 0.06434839218854904, "num_input_tokens_seen": 3505770, "step": 3405, "train_runtime": 8293.8228, "train_tokens_per_second": 422.697 }, { "epoch": 1.4556042312212845, "grad_norm": 2.3930070400238037, "learning_rate": 5.4545454545454545e-06, "loss": 0.0762820616364479, "num_input_tokens_seen": 3506734, "step": 3406, "train_runtime": 8295.901, "train_tokens_per_second": 422.707 }, { "epoch": 1.45603162731061, "grad_norm": 2.7942795753479004, "learning_rate": 5.450267379679145e-06, "loss": 0.09349891543388367, "num_input_tokens_seen": 3507646, "step": 3407, "train_runtime": 8297.9914, "train_tokens_per_second": 422.71 }, { "epoch": 1.456459023399936, "grad_norm": 3.1380910873413086, "learning_rate": 5.445989304812834e-06, "loss": 0.09565715491771698, "num_input_tokens_seen": 3509150, "step": 3408, "train_runtime": 8300.1985, "train_tokens_per_second": 422.779 }, { "epoch": 1.4568864194892617, "grad_norm": 2.1942691802978516, "learning_rate": 5.4417112299465245e-06, "loss": 0.054045066237449646, "num_input_tokens_seen": 3509874, "step": 3409, "train_runtime": 8302.2423, "train_tokens_per_second": 422.762 }, { "epoch": 1.4573138155785874, "grad_norm": 3.4737846851348877, "learning_rate": 5.437433155080214e-06, "loss": 0.1164722889661789, "num_input_tokens_seen": 3510676, "step": 3410, "train_runtime": 8304.3026, "train_tokens_per_second": 422.754 }, { "epoch": 1.4577412116679134, "grad_norm": 2.253200054168701, "learning_rate": 5.433155080213904e-06, "loss": 0.11444836854934692, "num_input_tokens_seen": 3511926, "step": 3411, "train_runtime": 8306.4713, "train_tokens_per_second": 422.794 }, { "epoch": 1.4581686077572389, "grad_norm": 2.9953954219818115, "learning_rate": 5.428877005347594e-06, "loss": 0.13085690140724182, "num_input_tokens_seen": 3512958, "step": 3412, "train_runtime": 8308.5339, "train_tokens_per_second": 422.813 }, { "epoch": 1.4585960038465648, "grad_norm": 2.8434152603149414, "learning_rate": 5.424598930481284e-06, "loss": 0.09413914382457733, "num_input_tokens_seen": 3513898, "step": 3413, "train_runtime": 8310.6039, "train_tokens_per_second": 422.821 }, { "epoch": 1.4590233999358906, "grad_norm": 2.961225748062134, "learning_rate": 5.420320855614973e-06, "loss": 0.11663661152124405, "num_input_tokens_seen": 3514840, "step": 3414, "train_runtime": 8312.7508, "train_tokens_per_second": 422.825 }, { "epoch": 1.4594507960252163, "grad_norm": 2.2813780307769775, "learning_rate": 5.416042780748664e-06, "loss": 0.08790498971939087, "num_input_tokens_seen": 3516314, "step": 3415, "train_runtime": 8315.0166, "train_tokens_per_second": 422.887 }, { "epoch": 1.4598781921145423, "grad_norm": 2.6718039512634277, "learning_rate": 5.411764705882353e-06, "loss": 0.0762622207403183, "num_input_tokens_seen": 3517254, "step": 3416, "train_runtime": 8317.1149, "train_tokens_per_second": 422.894 }, { "epoch": 1.4603055882038678, "grad_norm": 3.686269760131836, "learning_rate": 5.4074866310160434e-06, "loss": 0.08884076774120331, "num_input_tokens_seen": 3518342, "step": 3417, "train_runtime": 8319.2992, "train_tokens_per_second": 422.913 }, { "epoch": 1.4607329842931938, "grad_norm": 2.682656764984131, "learning_rate": 5.403208556149733e-06, "loss": 0.13189348578453064, "num_input_tokens_seen": 3519606, "step": 3418, "train_runtime": 8321.5507, "train_tokens_per_second": 422.951 }, { "epoch": 1.4611603803825195, "grad_norm": 7.003383636474609, "learning_rate": 5.398930481283423e-06, "loss": 0.04883841052651405, "num_input_tokens_seen": 3520424, "step": 3419, "train_runtime": 8323.6568, "train_tokens_per_second": 422.942 }, { "epoch": 1.4615877764718452, "grad_norm": 3.0600647926330566, "learning_rate": 5.394652406417113e-06, "loss": 0.11123605072498322, "num_input_tokens_seen": 3521612, "step": 3420, "train_runtime": 8325.8075, "train_tokens_per_second": 422.975 }, { "epoch": 1.4620151725611712, "grad_norm": 2.620290756225586, "learning_rate": 5.390374331550803e-06, "loss": 0.09981417655944824, "num_input_tokens_seen": 3522782, "step": 3421, "train_runtime": 8334.5692, "train_tokens_per_second": 422.671 }, { "epoch": 1.4624425686504967, "grad_norm": 1.8304671049118042, "learning_rate": 5.386096256684492e-06, "loss": 0.06130238622426987, "num_input_tokens_seen": 3524114, "step": 3422, "train_runtime": 8336.8198, "train_tokens_per_second": 422.717 }, { "epoch": 1.4628699647398227, "grad_norm": 3.1707441806793213, "learning_rate": 5.381818181818183e-06, "loss": 0.1021229550242424, "num_input_tokens_seen": 3525058, "step": 3423, "train_runtime": 8338.9186, "train_tokens_per_second": 422.724 }, { "epoch": 1.4632973608291484, "grad_norm": 2.6195712089538574, "learning_rate": 5.377540106951872e-06, "loss": 0.12342748790979385, "num_input_tokens_seen": 3526074, "step": 3424, "train_runtime": 8341.0818, "train_tokens_per_second": 422.736 }, { "epoch": 1.4637247569184741, "grad_norm": 3.001678228378296, "learning_rate": 5.373262032085562e-06, "loss": 0.08639542758464813, "num_input_tokens_seen": 3526878, "step": 3425, "train_runtime": 8343.1503, "train_tokens_per_second": 422.727 }, { "epoch": 1.4641521530078, "grad_norm": 2.942387104034424, "learning_rate": 5.368983957219252e-06, "loss": 0.11888884007930756, "num_input_tokens_seen": 3527834, "step": 3426, "train_runtime": 8345.329, "train_tokens_per_second": 422.732 }, { "epoch": 1.4645795490971258, "grad_norm": 3.7468812465667725, "learning_rate": 5.364705882352942e-06, "loss": 0.10000333935022354, "num_input_tokens_seen": 3528562, "step": 3427, "train_runtime": 8347.3307, "train_tokens_per_second": 422.717 }, { "epoch": 1.4650069451864516, "grad_norm": 2.5948994159698486, "learning_rate": 5.3604278074866316e-06, "loss": 0.10086463391780853, "num_input_tokens_seen": 3529832, "step": 3428, "train_runtime": 8349.5017, "train_tokens_per_second": 422.76 }, { "epoch": 1.4654343412757773, "grad_norm": 2.230076789855957, "learning_rate": 5.356149732620322e-06, "loss": 0.09517347067594528, "num_input_tokens_seen": 3531034, "step": 3429, "train_runtime": 8351.6207, "train_tokens_per_second": 422.796 }, { "epoch": 1.465861737365103, "grad_norm": 2.726621627807617, "learning_rate": 5.3518716577540105e-06, "loss": 0.10943930596113205, "num_input_tokens_seen": 3532090, "step": 3430, "train_runtime": 8353.7035, "train_tokens_per_second": 422.817 }, { "epoch": 1.466289133454429, "grad_norm": 3.3502588272094727, "learning_rate": 5.347593582887702e-06, "loss": 0.1161169558763504, "num_input_tokens_seen": 3533044, "step": 3431, "train_runtime": 8355.7607, "train_tokens_per_second": 422.827 }, { "epoch": 1.4667165295437548, "grad_norm": 2.2125492095947266, "learning_rate": 5.34331550802139e-06, "loss": 0.060301244258880615, "num_input_tokens_seen": 3533864, "step": 3432, "train_runtime": 8357.8302, "train_tokens_per_second": 422.821 }, { "epoch": 1.4671439256330805, "grad_norm": 2.5336380004882812, "learning_rate": 5.339037433155081e-06, "loss": 0.13681688904762268, "num_input_tokens_seen": 3535292, "step": 3433, "train_runtime": 8360.0613, "train_tokens_per_second": 422.879 }, { "epoch": 1.4675713217224062, "grad_norm": 2.2956624031066895, "learning_rate": 5.33475935828877e-06, "loss": 0.05246267467737198, "num_input_tokens_seen": 3536248, "step": 3434, "train_runtime": 8362.1942, "train_tokens_per_second": 422.885 }, { "epoch": 1.467998717811732, "grad_norm": 2.4161217212677, "learning_rate": 5.33048128342246e-06, "loss": 0.09199666976928711, "num_input_tokens_seen": 3537698, "step": 3435, "train_runtime": 8364.4485, "train_tokens_per_second": 422.945 }, { "epoch": 1.468426113901058, "grad_norm": 2.7502171993255615, "learning_rate": 5.32620320855615e-06, "loss": 0.11626212298870087, "num_input_tokens_seen": 3538998, "step": 3436, "train_runtime": 8366.6264, "train_tokens_per_second": 422.99 }, { "epoch": 1.4688535099903837, "grad_norm": 3.2480013370513916, "learning_rate": 5.32192513368984e-06, "loss": 0.08362399786710739, "num_input_tokens_seen": 3539902, "step": 3437, "train_runtime": 8368.9535, "train_tokens_per_second": 422.98 }, { "epoch": 1.4692809060797094, "grad_norm": 2.008153200149536, "learning_rate": 5.317647058823529e-06, "loss": 0.1897895783185959, "num_input_tokens_seen": 3541228, "step": 3438, "train_runtime": 8371.178, "train_tokens_per_second": 423.026 }, { "epoch": 1.4697083021690351, "grad_norm": 2.816376209259033, "learning_rate": 5.31336898395722e-06, "loss": 0.11472421884536743, "num_input_tokens_seen": 3542404, "step": 3439, "train_runtime": 8373.3475, "train_tokens_per_second": 423.057 }, { "epoch": 1.4701356982583609, "grad_norm": 2.9486799240112305, "learning_rate": 5.309090909090909e-06, "loss": 0.06911687552928925, "num_input_tokens_seen": 3543462, "step": 3440, "train_runtime": 8375.4062, "train_tokens_per_second": 423.079 }, { "epoch": 1.4705630943476868, "grad_norm": 2.5832102298736572, "learning_rate": 5.3048128342245995e-06, "loss": 0.1230064183473587, "num_input_tokens_seen": 3544484, "step": 3441, "train_runtime": 8377.4918, "train_tokens_per_second": 423.096 }, { "epoch": 1.4709904904370126, "grad_norm": 2.9772675037384033, "learning_rate": 5.300534759358289e-06, "loss": 0.16411425173282623, "num_input_tokens_seen": 3545460, "step": 3442, "train_runtime": 8379.6544, "train_tokens_per_second": 423.103 }, { "epoch": 1.4714178865263383, "grad_norm": 3.372304677963257, "learning_rate": 5.296256684491979e-06, "loss": 0.15941262245178223, "num_input_tokens_seen": 3546342, "step": 3443, "train_runtime": 8381.7183, "train_tokens_per_second": 423.104 }, { "epoch": 1.471845282615664, "grad_norm": 1.5999884605407715, "learning_rate": 5.291978609625669e-06, "loss": 0.07250265777111053, "num_input_tokens_seen": 3547926, "step": 3444, "train_runtime": 8383.9563, "train_tokens_per_second": 423.18 }, { "epoch": 1.4722726787049898, "grad_norm": 2.5111491680145264, "learning_rate": 5.287700534759359e-06, "loss": 0.073473259806633, "num_input_tokens_seen": 3548690, "step": 3445, "train_runtime": 8385.9834, "train_tokens_per_second": 423.169 }, { "epoch": 1.4727000747943157, "grad_norm": 1.8669384717941284, "learning_rate": 5.283422459893048e-06, "loss": 0.07209983468055725, "num_input_tokens_seen": 3550136, "step": 3446, "train_runtime": 8388.1591, "train_tokens_per_second": 423.232 }, { "epoch": 1.4731274708836415, "grad_norm": 2.1105058193206787, "learning_rate": 5.279144385026739e-06, "loss": 0.07174131274223328, "num_input_tokens_seen": 3551504, "step": 3447, "train_runtime": 8390.3067, "train_tokens_per_second": 423.287 }, { "epoch": 1.4735548669729672, "grad_norm": 2.0642714500427246, "learning_rate": 5.274866310160428e-06, "loss": 0.06614141166210175, "num_input_tokens_seen": 3552516, "step": 3448, "train_runtime": 8392.4425, "train_tokens_per_second": 423.299 }, { "epoch": 1.473982263062293, "grad_norm": 3.1498465538024902, "learning_rate": 5.270588235294118e-06, "loss": 0.09876853972673416, "num_input_tokens_seen": 3553364, "step": 3449, "train_runtime": 8394.5008, "train_tokens_per_second": 423.297 }, { "epoch": 1.4744096591516187, "grad_norm": 1.7724378108978271, "learning_rate": 5.266310160427808e-06, "loss": 0.03674537315964699, "num_input_tokens_seen": 3553950, "step": 3450, "train_runtime": 8396.5029, "train_tokens_per_second": 423.266 }, { "epoch": 1.4748370552409447, "grad_norm": 2.847510576248169, "learning_rate": 5.262032085561498e-06, "loss": 0.10168350487947464, "num_input_tokens_seen": 3555214, "step": 3451, "train_runtime": 8405.2848, "train_tokens_per_second": 422.974 }, { "epoch": 1.4752644513302704, "grad_norm": 2.6584270000457764, "learning_rate": 5.257754010695188e-06, "loss": 0.16335546970367432, "num_input_tokens_seen": 3556016, "step": 3452, "train_runtime": 8407.3966, "train_tokens_per_second": 422.963 }, { "epoch": 1.4756918474195961, "grad_norm": 3.1546804904937744, "learning_rate": 5.253475935828878e-06, "loss": 0.10889051109552383, "num_input_tokens_seen": 3556974, "step": 3453, "train_runtime": 8409.4877, "train_tokens_per_second": 422.972 }, { "epoch": 1.4761192435089219, "grad_norm": 3.6013145446777344, "learning_rate": 5.249197860962567e-06, "loss": 0.09238863736391068, "num_input_tokens_seen": 3557656, "step": 3454, "train_runtime": 8411.5329, "train_tokens_per_second": 422.95 }, { "epoch": 1.4765466395982476, "grad_norm": 2.0311074256896973, "learning_rate": 5.244919786096258e-06, "loss": 0.05239570140838623, "num_input_tokens_seen": 3558732, "step": 3455, "train_runtime": 8413.6426, "train_tokens_per_second": 422.972 }, { "epoch": 1.4769740356875736, "grad_norm": 3.5176239013671875, "learning_rate": 5.240641711229947e-06, "loss": 0.0817013829946518, "num_input_tokens_seen": 3559394, "step": 3456, "train_runtime": 8415.6328, "train_tokens_per_second": 422.95 }, { "epoch": 1.4774014317768993, "grad_norm": 2.136615037918091, "learning_rate": 5.236363636363637e-06, "loss": 0.08257411420345306, "num_input_tokens_seen": 3560308, "step": 3457, "train_runtime": 8417.7218, "train_tokens_per_second": 422.954 }, { "epoch": 1.477828827866225, "grad_norm": 2.2736639976501465, "learning_rate": 5.232085561497327e-06, "loss": 0.08371192961931229, "num_input_tokens_seen": 3561506, "step": 3458, "train_runtime": 8419.8506, "train_tokens_per_second": 422.989 }, { "epoch": 1.4782562239555508, "grad_norm": 1.6897475719451904, "learning_rate": 5.227807486631017e-06, "loss": 0.04890358820557594, "num_input_tokens_seen": 3562716, "step": 3459, "train_runtime": 8422.0198, "train_tokens_per_second": 423.024 }, { "epoch": 1.4786836200448765, "grad_norm": 2.692368745803833, "learning_rate": 5.2235294117647065e-06, "loss": 0.07973666489124298, "num_input_tokens_seen": 3563588, "step": 3460, "train_runtime": 8424.0966, "train_tokens_per_second": 423.023 }, { "epoch": 1.4791110161342025, "grad_norm": 2.952913761138916, "learning_rate": 5.219251336898397e-06, "loss": 0.11168647557497025, "num_input_tokens_seen": 3564550, "step": 3461, "train_runtime": 8426.1744, "train_tokens_per_second": 423.033 }, { "epoch": 1.4795384122235282, "grad_norm": 3.4418411254882812, "learning_rate": 5.214973262032086e-06, "loss": 0.08286750316619873, "num_input_tokens_seen": 3565530, "step": 3462, "train_runtime": 8428.2967, "train_tokens_per_second": 423.043 }, { "epoch": 1.479965808312854, "grad_norm": 3.002765417098999, "learning_rate": 5.2106951871657766e-06, "loss": 0.10810767114162445, "num_input_tokens_seen": 3566486, "step": 3463, "train_runtime": 8430.4465, "train_tokens_per_second": 423.048 }, { "epoch": 1.4803932044021797, "grad_norm": 2.9465012550354004, "learning_rate": 5.206417112299465e-06, "loss": 0.12109486758708954, "num_input_tokens_seen": 3567464, "step": 3464, "train_runtime": 8432.5307, "train_tokens_per_second": 423.06 }, { "epoch": 1.4808206004915054, "grad_norm": 2.2203128337860107, "learning_rate": 5.202139037433156e-06, "loss": 0.06570500880479813, "num_input_tokens_seen": 3568406, "step": 3465, "train_runtime": 8434.6323, "train_tokens_per_second": 423.066 }, { "epoch": 1.4812479965808314, "grad_norm": 2.604599952697754, "learning_rate": 5.197860962566845e-06, "loss": 0.07831765711307526, "num_input_tokens_seen": 3569380, "step": 3466, "train_runtime": 8436.6886, "train_tokens_per_second": 423.078 }, { "epoch": 1.4816753926701571, "grad_norm": 2.78183650970459, "learning_rate": 5.193582887700536e-06, "loss": 0.10326939821243286, "num_input_tokens_seen": 3570578, "step": 3467, "train_runtime": 8438.8033, "train_tokens_per_second": 423.114 }, { "epoch": 1.4821027887594829, "grad_norm": 2.882122278213501, "learning_rate": 5.189304812834225e-06, "loss": 0.09420980513095856, "num_input_tokens_seen": 3571538, "step": 3468, "train_runtime": 8440.8535, "train_tokens_per_second": 423.125 }, { "epoch": 1.4825301848488086, "grad_norm": 2.774277448654175, "learning_rate": 5.185026737967915e-06, "loss": 0.10477755963802338, "num_input_tokens_seen": 3572466, "step": 3469, "train_runtime": 8442.9331, "train_tokens_per_second": 423.131 }, { "epoch": 1.4829575809381343, "grad_norm": 2.6454672813415527, "learning_rate": 5.180748663101604e-06, "loss": 0.08873839676380157, "num_input_tokens_seen": 3573842, "step": 3470, "train_runtime": 8445.1457, "train_tokens_per_second": 423.183 }, { "epoch": 1.4833849770274603, "grad_norm": 3.13795804977417, "learning_rate": 5.176470588235295e-06, "loss": 0.08118026703596115, "num_input_tokens_seen": 3574652, "step": 3471, "train_runtime": 8447.2139, "train_tokens_per_second": 423.175 }, { "epoch": 1.483812373116786, "grad_norm": 1.8243160247802734, "learning_rate": 5.172192513368984e-06, "loss": 0.05078557878732681, "num_input_tokens_seen": 3576118, "step": 3472, "train_runtime": 8449.408, "train_tokens_per_second": 423.239 }, { "epoch": 1.4842397692061118, "grad_norm": 2.634284019470215, "learning_rate": 5.167914438502674e-06, "loss": 0.0728183388710022, "num_input_tokens_seen": 3576850, "step": 3473, "train_runtime": 8451.461, "train_tokens_per_second": 423.223 }, { "epoch": 1.4846671652954375, "grad_norm": 2.5489344596862793, "learning_rate": 5.163636363636364e-06, "loss": 0.08887887001037598, "num_input_tokens_seen": 3577670, "step": 3474, "train_runtime": 8453.4868, "train_tokens_per_second": 423.218 }, { "epoch": 1.4850945613847633, "grad_norm": 3.1579835414886475, "learning_rate": 5.159358288770054e-06, "loss": 0.07928609102964401, "num_input_tokens_seen": 3578458, "step": 3475, "train_runtime": 8455.5255, "train_tokens_per_second": 423.209 }, { "epoch": 1.4855219574740892, "grad_norm": 2.656999111175537, "learning_rate": 5.155080213903744e-06, "loss": 0.11406660825014114, "num_input_tokens_seen": 3579212, "step": 3476, "train_runtime": 8457.6903, "train_tokens_per_second": 423.19 }, { "epoch": 1.485949353563415, "grad_norm": 4.294614315032959, "learning_rate": 5.150802139037434e-06, "loss": 0.1402263641357422, "num_input_tokens_seen": 3580500, "step": 3477, "train_runtime": 8459.8512, "train_tokens_per_second": 423.234 }, { "epoch": 1.4863767496527407, "grad_norm": 3.577075719833374, "learning_rate": 5.146524064171123e-06, "loss": 0.1078961193561554, "num_input_tokens_seen": 3581280, "step": 3478, "train_runtime": 8461.975, "train_tokens_per_second": 423.22 }, { "epoch": 1.4868041457420664, "grad_norm": 2.1636970043182373, "learning_rate": 5.142245989304814e-06, "loss": 0.09547430276870728, "num_input_tokens_seen": 3583034, "step": 3479, "train_runtime": 8464.2985, "train_tokens_per_second": 423.311 }, { "epoch": 1.4872315418313922, "grad_norm": 2.7201411724090576, "learning_rate": 5.137967914438503e-06, "loss": 0.09909026324748993, "num_input_tokens_seen": 3583846, "step": 3480, "train_runtime": 8466.3273, "train_tokens_per_second": 423.306 }, { "epoch": 1.4876589379207181, "grad_norm": 3.4193906784057617, "learning_rate": 5.133689839572193e-06, "loss": 0.05734444037079811, "num_input_tokens_seen": 3584650, "step": 3481, "train_runtime": 8475.0719, "train_tokens_per_second": 422.964 }, { "epoch": 1.4880863340100439, "grad_norm": 2.037862539291382, "learning_rate": 5.129411764705883e-06, "loss": 0.05727183073759079, "num_input_tokens_seen": 3585896, "step": 3482, "train_runtime": 8477.2564, "train_tokens_per_second": 423.002 }, { "epoch": 1.4885137300993696, "grad_norm": 3.5194313526153564, "learning_rate": 5.125133689839573e-06, "loss": 0.1218360960483551, "num_input_tokens_seen": 3586630, "step": 3483, "train_runtime": 8479.3229, "train_tokens_per_second": 422.985 }, { "epoch": 1.4889411261886953, "grad_norm": 2.0693070888519287, "learning_rate": 5.1208556149732626e-06, "loss": 0.08063124865293503, "num_input_tokens_seen": 3587772, "step": 3484, "train_runtime": 8481.4351, "train_tokens_per_second": 423.015 }, { "epoch": 1.489368522278021, "grad_norm": 3.8299968242645264, "learning_rate": 5.116577540106953e-06, "loss": 0.10842914879322052, "num_input_tokens_seen": 3589070, "step": 3485, "train_runtime": 8483.5976, "train_tokens_per_second": 423.06 }, { "epoch": 1.489795918367347, "grad_norm": 2.5851049423217773, "learning_rate": 5.112299465240642e-06, "loss": 0.0744856745004654, "num_input_tokens_seen": 3589990, "step": 3486, "train_runtime": 8485.6504, "train_tokens_per_second": 423.066 }, { "epoch": 1.4902233144566728, "grad_norm": 2.627002239227295, "learning_rate": 5.108021390374332e-06, "loss": 0.08011586219072342, "num_input_tokens_seen": 3590824, "step": 3487, "train_runtime": 8487.7026, "train_tokens_per_second": 423.062 }, { "epoch": 1.4906507105459985, "grad_norm": 2.822197437286377, "learning_rate": 5.103743315508022e-06, "loss": 0.1270557940006256, "num_input_tokens_seen": 3592014, "step": 3488, "train_runtime": 8489.8198, "train_tokens_per_second": 423.097 }, { "epoch": 1.4910781066353243, "grad_norm": 2.8751938343048096, "learning_rate": 5.0994652406417115e-06, "loss": 0.12426812201738358, "num_input_tokens_seen": 3593174, "step": 3489, "train_runtime": 8491.9395, "train_tokens_per_second": 423.128 }, { "epoch": 1.49150550272465, "grad_norm": 2.637859344482422, "learning_rate": 5.095187165775402e-06, "loss": 0.08521677553653717, "num_input_tokens_seen": 3594054, "step": 3490, "train_runtime": 8493.9965, "train_tokens_per_second": 423.129 }, { "epoch": 1.491932898813976, "grad_norm": 2.4682505130767822, "learning_rate": 5.090909090909091e-06, "loss": 0.06862461566925049, "num_input_tokens_seen": 3594820, "step": 3491, "train_runtime": 8496.0327, "train_tokens_per_second": 423.117 }, { "epoch": 1.4923602949033017, "grad_norm": 3.118116617202759, "learning_rate": 5.0866310160427815e-06, "loss": 0.1124785989522934, "num_input_tokens_seen": 3595562, "step": 3492, "train_runtime": 8498.1151, "train_tokens_per_second": 423.101 }, { "epoch": 1.4927876909926274, "grad_norm": 1.9591572284698486, "learning_rate": 5.08235294117647e-06, "loss": 0.09464672207832336, "num_input_tokens_seen": 3597142, "step": 3493, "train_runtime": 8500.372, "train_tokens_per_second": 423.175 }, { "epoch": 1.4932150870819532, "grad_norm": 4.782775402069092, "learning_rate": 5.078074866310161e-06, "loss": 0.1299022138118744, "num_input_tokens_seen": 3598654, "step": 3494, "train_runtime": 8502.6312, "train_tokens_per_second": 423.24 }, { "epoch": 1.493642483171279, "grad_norm": 2.768278121948242, "learning_rate": 5.07379679144385e-06, "loss": 0.10148009657859802, "num_input_tokens_seen": 3599626, "step": 3495, "train_runtime": 8504.7155, "train_tokens_per_second": 423.251 }, { "epoch": 1.4940698792606049, "grad_norm": 2.4285728931427, "learning_rate": 5.069518716577541e-06, "loss": 0.08303365856409073, "num_input_tokens_seen": 3600584, "step": 3496, "train_runtime": 8506.8138, "train_tokens_per_second": 423.259 }, { "epoch": 1.4944972753499306, "grad_norm": 2.906404972076416, "learning_rate": 5.06524064171123e-06, "loss": 0.07900217175483704, "num_input_tokens_seen": 3601320, "step": 3497, "train_runtime": 8508.811, "train_tokens_per_second": 423.246 }, { "epoch": 1.4949246714392563, "grad_norm": 2.8383841514587402, "learning_rate": 5.06096256684492e-06, "loss": 0.08480820804834366, "num_input_tokens_seen": 3602104, "step": 3498, "train_runtime": 8510.8449, "train_tokens_per_second": 423.237 }, { "epoch": 1.495352067528582, "grad_norm": 1.7837657928466797, "learning_rate": 5.056684491978609e-06, "loss": 0.04530474543571472, "num_input_tokens_seen": 3603074, "step": 3499, "train_runtime": 8512.91, "train_tokens_per_second": 423.248 }, { "epoch": 1.4957794636179078, "grad_norm": 1.8503044843673706, "learning_rate": 5.0524064171123e-06, "loss": 0.045571133494377136, "num_input_tokens_seen": 3603946, "step": 3500, "train_runtime": 8514.9644, "train_tokens_per_second": 423.249 }, { "epoch": 1.4962068597072338, "grad_norm": 3.4572830200195312, "learning_rate": 5.048128342245989e-06, "loss": 0.10345087945461273, "num_input_tokens_seen": 3604912, "step": 3501, "train_runtime": 8517.1063, "train_tokens_per_second": 423.255 }, { "epoch": 1.4966342557965595, "grad_norm": 2.5880701541900635, "learning_rate": 5.043850267379679e-06, "loss": 0.08722706139087677, "num_input_tokens_seen": 3605644, "step": 3502, "train_runtime": 8519.1514, "train_tokens_per_second": 423.24 }, { "epoch": 1.4970616518858852, "grad_norm": 2.522632122039795, "learning_rate": 5.039572192513369e-06, "loss": 0.11368047446012497, "num_input_tokens_seen": 3606748, "step": 3503, "train_runtime": 8521.2704, "train_tokens_per_second": 423.264 }, { "epoch": 1.497489047975211, "grad_norm": 5.514909744262695, "learning_rate": 5.035294117647059e-06, "loss": 0.1331629753112793, "num_input_tokens_seen": 3607682, "step": 3504, "train_runtime": 8523.4109, "train_tokens_per_second": 423.267 }, { "epoch": 1.4979164440645367, "grad_norm": 2.5853452682495117, "learning_rate": 5.0310160427807485e-06, "loss": 0.055814750492572784, "num_input_tokens_seen": 3608966, "step": 3505, "train_runtime": 8525.5599, "train_tokens_per_second": 423.311 }, { "epoch": 1.4983438401538627, "grad_norm": 3.2321200370788574, "learning_rate": 5.026737967914439e-06, "loss": 0.13172556459903717, "num_input_tokens_seen": 3609806, "step": 3506, "train_runtime": 8527.6203, "train_tokens_per_second": 423.308 }, { "epoch": 1.4987712362431884, "grad_norm": 3.129863739013672, "learning_rate": 5.022459893048128e-06, "loss": 0.0940563827753067, "num_input_tokens_seen": 3610544, "step": 3507, "train_runtime": 8529.6387, "train_tokens_per_second": 423.294 }, { "epoch": 1.4991986323325142, "grad_norm": 2.606651782989502, "learning_rate": 5.0181818181818186e-06, "loss": 0.11145033687353134, "num_input_tokens_seen": 3611986, "step": 3508, "train_runtime": 8531.8424, "train_tokens_per_second": 423.354 }, { "epoch": 1.49962602842184, "grad_norm": 2.441556692123413, "learning_rate": 5.013903743315508e-06, "loss": 0.06653917580842972, "num_input_tokens_seen": 3612900, "step": 3509, "train_runtime": 8533.9113, "train_tokens_per_second": 423.358 }, { "epoch": 1.5000534245111656, "grad_norm": 5.1997222900390625, "learning_rate": 5.009625668449198e-06, "loss": 0.10496173053979874, "num_input_tokens_seen": 3613656, "step": 3510, "train_runtime": 8535.97, "train_tokens_per_second": 423.345 }, { "epoch": 1.5004808206004916, "grad_norm": 3.1247751712799072, "learning_rate": 5.005347593582888e-06, "loss": 0.10358445346355438, "num_input_tokens_seen": 3614490, "step": 3511, "train_runtime": 8544.3174, "train_tokens_per_second": 423.029 }, { "epoch": 1.5009082166898173, "grad_norm": 2.868659019470215, "learning_rate": 5.001069518716578e-06, "loss": 0.08242306113243103, "num_input_tokens_seen": 3615200, "step": 3512, "train_runtime": 8546.3694, "train_tokens_per_second": 423.01 }, { "epoch": 1.501335612779143, "grad_norm": 3.333298444747925, "learning_rate": 4.996791443850268e-06, "loss": 0.07817995548248291, "num_input_tokens_seen": 3616154, "step": 3513, "train_runtime": 8548.5881, "train_tokens_per_second": 423.012 }, { "epoch": 1.5017630088684688, "grad_norm": 3.1215336322784424, "learning_rate": 4.992513368983958e-06, "loss": 0.12454163283109665, "num_input_tokens_seen": 3617242, "step": 3514, "train_runtime": 8550.7275, "train_tokens_per_second": 423.033 }, { "epoch": 1.5021904049577945, "grad_norm": 2.46378231048584, "learning_rate": 4.988235294117647e-06, "loss": 0.05583369731903076, "num_input_tokens_seen": 3617946, "step": 3515, "train_runtime": 8552.7518, "train_tokens_per_second": 423.015 }, { "epoch": 1.5026178010471205, "grad_norm": 2.6294753551483154, "learning_rate": 4.9839572192513375e-06, "loss": 0.07819390296936035, "num_input_tokens_seen": 3619108, "step": 3516, "train_runtime": 8554.9581, "train_tokens_per_second": 423.042 }, { "epoch": 1.5030451971364462, "grad_norm": 2.5538837909698486, "learning_rate": 4.979679144385027e-06, "loss": 0.07925939559936523, "num_input_tokens_seen": 3619834, "step": 3517, "train_runtime": 8557.0006, "train_tokens_per_second": 423.026 }, { "epoch": 1.503472593225772, "grad_norm": 3.946864366531372, "learning_rate": 4.975401069518717e-06, "loss": 0.18219003081321716, "num_input_tokens_seen": 3620758, "step": 3518, "train_runtime": 8559.0578, "train_tokens_per_second": 423.032 }, { "epoch": 1.5038999893150977, "grad_norm": 2.776991128921509, "learning_rate": 4.971122994652407e-06, "loss": 0.09152452647686005, "num_input_tokens_seen": 3621780, "step": 3519, "train_runtime": 8561.1408, "train_tokens_per_second": 423.049 }, { "epoch": 1.5043273854044235, "grad_norm": 3.3464083671569824, "learning_rate": 4.966844919786097e-06, "loss": 0.07054004073143005, "num_input_tokens_seen": 3622286, "step": 3520, "train_runtime": 8563.0991, "train_tokens_per_second": 423.011 }, { "epoch": 1.5047547814937494, "grad_norm": 2.448549270629883, "learning_rate": 4.9625668449197864e-06, "loss": 0.07452575117349625, "num_input_tokens_seen": 3623258, "step": 3521, "train_runtime": 8565.1991, "train_tokens_per_second": 423.021 }, { "epoch": 1.5051821775830752, "grad_norm": 2.4839916229248047, "learning_rate": 4.958288770053477e-06, "loss": 0.0875958651304245, "num_input_tokens_seen": 3624150, "step": 3522, "train_runtime": 8567.2523, "train_tokens_per_second": 423.024 }, { "epoch": 1.505609573672401, "grad_norm": 2.109748125076294, "learning_rate": 4.954010695187166e-06, "loss": 0.06728150695562363, "num_input_tokens_seen": 3625330, "step": 3523, "train_runtime": 8569.3318, "train_tokens_per_second": 423.059 }, { "epoch": 1.5060369697617266, "grad_norm": 2.2448651790618896, "learning_rate": 4.9497326203208565e-06, "loss": 0.07205653190612793, "num_input_tokens_seen": 3626370, "step": 3524, "train_runtime": 8571.4497, "train_tokens_per_second": 423.075 }, { "epoch": 1.5064643658510524, "grad_norm": 2.5308432579040527, "learning_rate": 4.945454545454546e-06, "loss": 0.09219775348901749, "num_input_tokens_seen": 3627456, "step": 3525, "train_runtime": 8573.5777, "train_tokens_per_second": 423.097 }, { "epoch": 1.5068917619403783, "grad_norm": 3.1706414222717285, "learning_rate": 4.941176470588236e-06, "loss": 0.061785317957401276, "num_input_tokens_seen": 3628396, "step": 3526, "train_runtime": 8575.6669, "train_tokens_per_second": 423.104 }, { "epoch": 1.507319158029704, "grad_norm": 2.0880186557769775, "learning_rate": 4.936898395721926e-06, "loss": 0.085757315158844, "num_input_tokens_seen": 3629646, "step": 3527, "train_runtime": 8577.8162, "train_tokens_per_second": 423.143 }, { "epoch": 1.5077465541190298, "grad_norm": 2.876124620437622, "learning_rate": 4.932620320855616e-06, "loss": 0.09343293309211731, "num_input_tokens_seen": 3630838, "step": 3528, "train_runtime": 8579.9545, "train_tokens_per_second": 423.177 }, { "epoch": 1.5081739502083555, "grad_norm": 3.6000235080718994, "learning_rate": 4.928342245989305e-06, "loss": 0.08634567260742188, "num_input_tokens_seen": 3631472, "step": 3529, "train_runtime": 8581.9436, "train_tokens_per_second": 423.153 }, { "epoch": 1.5086013462976813, "grad_norm": 2.11653733253479, "learning_rate": 4.924064171122996e-06, "loss": 0.07055184245109558, "num_input_tokens_seen": 3632704, "step": 3530, "train_runtime": 8584.1136, "train_tokens_per_second": 423.189 }, { "epoch": 1.5090287423870072, "grad_norm": 2.221297264099121, "learning_rate": 4.919786096256685e-06, "loss": 0.07774901390075684, "num_input_tokens_seen": 3633946, "step": 3531, "train_runtime": 8586.2955, "train_tokens_per_second": 423.226 }, { "epoch": 1.509456138476333, "grad_norm": 2.4940123558044434, "learning_rate": 4.915508021390375e-06, "loss": 0.09609182924032211, "num_input_tokens_seen": 3634958, "step": 3532, "train_runtime": 8588.4219, "train_tokens_per_second": 423.239 }, { "epoch": 1.5098835345656587, "grad_norm": 3.6815807819366455, "learning_rate": 4.911229946524065e-06, "loss": 0.07095140218734741, "num_input_tokens_seen": 3635952, "step": 3533, "train_runtime": 8590.4839, "train_tokens_per_second": 423.253 }, { "epoch": 1.5103109306549845, "grad_norm": 2.821209192276001, "learning_rate": 4.906951871657754e-06, "loss": 0.06957799196243286, "num_input_tokens_seen": 3636766, "step": 3534, "train_runtime": 8592.5461, "train_tokens_per_second": 423.247 }, { "epoch": 1.5107383267443102, "grad_norm": 2.082606077194214, "learning_rate": 4.902673796791445e-06, "loss": 0.06596414744853973, "num_input_tokens_seen": 3637806, "step": 3535, "train_runtime": 8594.6247, "train_tokens_per_second": 423.265 }, { "epoch": 1.5111657228336361, "grad_norm": 2.1967203617095947, "learning_rate": 4.898395721925134e-06, "loss": 0.06473173201084137, "num_input_tokens_seen": 3638872, "step": 3536, "train_runtime": 8596.7642, "train_tokens_per_second": 423.284 }, { "epoch": 1.5115931189229619, "grad_norm": 2.4574005603790283, "learning_rate": 4.894117647058824e-06, "loss": 0.12428296357393265, "num_input_tokens_seen": 3640364, "step": 3537, "train_runtime": 8598.9708, "train_tokens_per_second": 423.349 }, { "epoch": 1.5120205150122876, "grad_norm": 2.1085562705993652, "learning_rate": 4.889839572192514e-06, "loss": 0.06412091106176376, "num_input_tokens_seen": 3641484, "step": 3538, "train_runtime": 8601.0831, "train_tokens_per_second": 423.375 }, { "epoch": 1.5124479111016136, "grad_norm": 2.595482349395752, "learning_rate": 4.885561497326204e-06, "loss": 0.06665106117725372, "num_input_tokens_seen": 3642326, "step": 3539, "train_runtime": 8603.1389, "train_tokens_per_second": 423.372 }, { "epoch": 1.512875307190939, "grad_norm": 2.2363498210906982, "learning_rate": 4.8812834224598935e-06, "loss": 0.06344731152057648, "num_input_tokens_seen": 3643502, "step": 3540, "train_runtime": 8605.2634, "train_tokens_per_second": 423.404 }, { "epoch": 1.513302703280265, "grad_norm": 2.690617799758911, "learning_rate": 4.877005347593583e-06, "loss": 0.1108677089214325, "num_input_tokens_seen": 3644406, "step": 3541, "train_runtime": 8613.6948, "train_tokens_per_second": 423.094 }, { "epoch": 1.5137300993695908, "grad_norm": 3.1423168182373047, "learning_rate": 4.872727272727273e-06, "loss": 0.09781505167484283, "num_input_tokens_seen": 3645192, "step": 3542, "train_runtime": 8615.7386, "train_tokens_per_second": 423.085 }, { "epoch": 1.5141574954589165, "grad_norm": 2.874504327774048, "learning_rate": 4.868449197860963e-06, "loss": 0.11589546501636505, "num_input_tokens_seen": 3646134, "step": 3543, "train_runtime": 8617.8246, "train_tokens_per_second": 423.092 }, { "epoch": 1.5145848915482425, "grad_norm": 2.688213586807251, "learning_rate": 4.864171122994652e-06, "loss": 0.07865557074546814, "num_input_tokens_seen": 3647116, "step": 3544, "train_runtime": 8619.9233, "train_tokens_per_second": 423.103 }, { "epoch": 1.515012287637568, "grad_norm": 2.785665988922119, "learning_rate": 4.8598930481283425e-06, "loss": 0.13384030759334564, "num_input_tokens_seen": 3648542, "step": 3545, "train_runtime": 8622.1125, "train_tokens_per_second": 423.161 }, { "epoch": 1.515439683726894, "grad_norm": 2.1130268573760986, "learning_rate": 4.855614973262032e-06, "loss": 0.04683662950992584, "num_input_tokens_seen": 3649582, "step": 3546, "train_runtime": 8624.2186, "train_tokens_per_second": 423.178 }, { "epoch": 1.5158670798162197, "grad_norm": 3.0648772716522217, "learning_rate": 4.851336898395722e-06, "loss": 0.1367878019809723, "num_input_tokens_seen": 3650584, "step": 3547, "train_runtime": 8626.3315, "train_tokens_per_second": 423.191 }, { "epoch": 1.5162944759055454, "grad_norm": 4.038280487060547, "learning_rate": 4.847058823529412e-06, "loss": 0.10116203129291534, "num_input_tokens_seen": 3651216, "step": 3548, "train_runtime": 8628.3617, "train_tokens_per_second": 423.164 }, { "epoch": 1.5167218719948714, "grad_norm": 4.316404342651367, "learning_rate": 4.842780748663102e-06, "loss": 0.08583742380142212, "num_input_tokens_seen": 3652058, "step": 3549, "train_runtime": 8630.4695, "train_tokens_per_second": 423.159 }, { "epoch": 1.517149268084197, "grad_norm": 2.402935028076172, "learning_rate": 4.838502673796791e-06, "loss": 0.08893301337957382, "num_input_tokens_seen": 3653200, "step": 3550, "train_runtime": 8632.6056, "train_tokens_per_second": 423.186 }, { "epoch": 1.5175766641735229, "grad_norm": 2.695525884628296, "learning_rate": 4.834224598930482e-06, "loss": 0.08129577338695526, "num_input_tokens_seen": 3653862, "step": 3551, "train_runtime": 8634.6028, "train_tokens_per_second": 423.165 }, { "epoch": 1.5180040602628486, "grad_norm": 2.369659662246704, "learning_rate": 4.829946524064171e-06, "loss": 0.08968549966812134, "num_input_tokens_seen": 3654836, "step": 3552, "train_runtime": 8636.6773, "train_tokens_per_second": 423.176 }, { "epoch": 1.5184314563521744, "grad_norm": 4.375683307647705, "learning_rate": 4.825668449197861e-06, "loss": 0.10574985295534134, "num_input_tokens_seen": 3655676, "step": 3553, "train_runtime": 8638.7415, "train_tokens_per_second": 423.172 }, { "epoch": 1.5188588524415003, "grad_norm": 2.773441791534424, "learning_rate": 4.821390374331551e-06, "loss": 0.09314025938510895, "num_input_tokens_seen": 3657138, "step": 3554, "train_runtime": 8641.0978, "train_tokens_per_second": 423.226 }, { "epoch": 1.5192862485308258, "grad_norm": 3.531966209411621, "learning_rate": 4.817112299465241e-06, "loss": 0.06882999837398529, "num_input_tokens_seen": 3658066, "step": 3555, "train_runtime": 8643.1606, "train_tokens_per_second": 423.232 }, { "epoch": 1.5197136446201518, "grad_norm": 2.7457752227783203, "learning_rate": 4.812834224598931e-06, "loss": 0.11129777878522873, "num_input_tokens_seen": 3658884, "step": 3556, "train_runtime": 8645.1887, "train_tokens_per_second": 423.228 }, { "epoch": 1.5201410407094775, "grad_norm": 2.219132900238037, "learning_rate": 4.808556149732621e-06, "loss": 0.04661089926958084, "num_input_tokens_seen": 3659718, "step": 3557, "train_runtime": 8647.2586, "train_tokens_per_second": 423.223 }, { "epoch": 1.5205684367988033, "grad_norm": 2.838327646255493, "learning_rate": 4.80427807486631e-06, "loss": 0.11034586280584335, "num_input_tokens_seen": 3660798, "step": 3558, "train_runtime": 8649.3516, "train_tokens_per_second": 423.245 }, { "epoch": 1.5209958328881292, "grad_norm": 2.868974447250366, "learning_rate": 4.800000000000001e-06, "loss": 0.09107831865549088, "num_input_tokens_seen": 3662264, "step": 3559, "train_runtime": 8651.5353, "train_tokens_per_second": 423.308 }, { "epoch": 1.5214232289774547, "grad_norm": 2.219090223312378, "learning_rate": 4.79572192513369e-06, "loss": 0.05881549045443535, "num_input_tokens_seen": 3663284, "step": 3560, "train_runtime": 8653.6207, "train_tokens_per_second": 423.324 }, { "epoch": 1.5218506250667807, "grad_norm": 2.2947075366973877, "learning_rate": 4.7914438502673795e-06, "loss": 0.09609011560678482, "num_input_tokens_seen": 3664528, "step": 3561, "train_runtime": 8655.7772, "train_tokens_per_second": 423.362 }, { "epoch": 1.5222780211561064, "grad_norm": 2.6582374572753906, "learning_rate": 4.78716577540107e-06, "loss": 0.0881572738289833, "num_input_tokens_seen": 3665326, "step": 3562, "train_runtime": 8657.7944, "train_tokens_per_second": 423.356 }, { "epoch": 1.5227054172454322, "grad_norm": 2.1353437900543213, "learning_rate": 4.782887700534759e-06, "loss": 0.08960959315299988, "num_input_tokens_seen": 3666748, "step": 3563, "train_runtime": 8660.0053, "train_tokens_per_second": 423.412 }, { "epoch": 1.5231328133347581, "grad_norm": 3.5151259899139404, "learning_rate": 4.7786096256684496e-06, "loss": 0.08680078387260437, "num_input_tokens_seen": 3667402, "step": 3564, "train_runtime": 8661.9914, "train_tokens_per_second": 423.39 }, { "epoch": 1.5235602094240837, "grad_norm": 3.3296053409576416, "learning_rate": 4.774331550802139e-06, "loss": 0.09696043282747269, "num_input_tokens_seen": 3668078, "step": 3565, "train_runtime": 8664.0232, "train_tokens_per_second": 423.369 }, { "epoch": 1.5239876055134096, "grad_norm": 2.413674831390381, "learning_rate": 4.770053475935829e-06, "loss": 0.08138687163591385, "num_input_tokens_seen": 3669300, "step": 3566, "train_runtime": 8666.157, "train_tokens_per_second": 423.406 }, { "epoch": 1.5244150016027354, "grad_norm": 2.5076205730438232, "learning_rate": 4.765775401069519e-06, "loss": 0.06423820555210114, "num_input_tokens_seen": 3670048, "step": 3567, "train_runtime": 8668.2095, "train_tokens_per_second": 423.392 }, { "epoch": 1.524842397692061, "grad_norm": 2.161332607269287, "learning_rate": 4.761497326203209e-06, "loss": 0.06576938927173615, "num_input_tokens_seen": 3671052, "step": 3568, "train_runtime": 8670.3015, "train_tokens_per_second": 423.405 }, { "epoch": 1.525269793781387, "grad_norm": 2.467561960220337, "learning_rate": 4.7572192513368985e-06, "loss": 0.057123128324747086, "num_input_tokens_seen": 3672232, "step": 3569, "train_runtime": 8672.4405, "train_tokens_per_second": 423.437 }, { "epoch": 1.5256971898707126, "grad_norm": 2.314906358718872, "learning_rate": 4.752941176470589e-06, "loss": 0.09102455526590347, "num_input_tokens_seen": 3673146, "step": 3570, "train_runtime": 8674.4993, "train_tokens_per_second": 423.442 }, { "epoch": 1.5261245859600385, "grad_norm": 3.9919824600219727, "learning_rate": 4.748663101604278e-06, "loss": 0.13130563497543335, "num_input_tokens_seen": 3674052, "step": 3571, "train_runtime": 8683.0978, "train_tokens_per_second": 423.127 }, { "epoch": 1.5265519820493643, "grad_norm": 3.405505657196045, "learning_rate": 4.7443850267379685e-06, "loss": 0.10028623044490814, "num_input_tokens_seen": 3675134, "step": 3572, "train_runtime": 8685.2214, "train_tokens_per_second": 423.148 }, { "epoch": 1.52697937813869, "grad_norm": 2.2997593879699707, "learning_rate": 4.740106951871658e-06, "loss": 0.0854053944349289, "num_input_tokens_seen": 3676550, "step": 3573, "train_runtime": 8687.4943, "train_tokens_per_second": 423.2 }, { "epoch": 1.527406774228016, "grad_norm": 3.0073964595794678, "learning_rate": 4.735828877005348e-06, "loss": 0.05891802906990051, "num_input_tokens_seen": 3677318, "step": 3574, "train_runtime": 8689.5116, "train_tokens_per_second": 423.19 }, { "epoch": 1.5278341703173415, "grad_norm": 3.070615530014038, "learning_rate": 4.731550802139038e-06, "loss": 0.11514905095100403, "num_input_tokens_seen": 3678310, "step": 3575, "train_runtime": 8691.602, "train_tokens_per_second": 423.203 }, { "epoch": 1.5282615664066674, "grad_norm": 2.3874621391296387, "learning_rate": 4.727272727272728e-06, "loss": 0.08202254772186279, "num_input_tokens_seen": 3679302, "step": 3576, "train_runtime": 8693.7024, "train_tokens_per_second": 423.215 }, { "epoch": 1.5286889624959932, "grad_norm": 2.8542189598083496, "learning_rate": 4.7229946524064174e-06, "loss": 0.2057594358921051, "num_input_tokens_seen": 3682632, "step": 3577, "train_runtime": 8696.3469, "train_tokens_per_second": 423.469 }, { "epoch": 1.529116358585319, "grad_norm": 3.4465928077697754, "learning_rate": 4.718716577540107e-06, "loss": 0.06976252794265747, "num_input_tokens_seen": 3683404, "step": 3578, "train_runtime": 8698.4066, "train_tokens_per_second": 423.457 }, { "epoch": 1.5295437546746449, "grad_norm": 3.1718413829803467, "learning_rate": 4.714438502673797e-06, "loss": 0.08370421081781387, "num_input_tokens_seen": 3684402, "step": 3579, "train_runtime": 8700.481, "train_tokens_per_second": 423.471 }, { "epoch": 1.5299711507639704, "grad_norm": 3.515944004058838, "learning_rate": 4.710160427807487e-06, "loss": 0.1102132722735405, "num_input_tokens_seen": 3685524, "step": 3580, "train_runtime": 8702.6006, "train_tokens_per_second": 423.497 }, { "epoch": 1.5303985468532963, "grad_norm": 2.4737038612365723, "learning_rate": 4.705882352941177e-06, "loss": 0.08640070259571075, "num_input_tokens_seen": 3686692, "step": 3581, "train_runtime": 8704.7422, "train_tokens_per_second": 423.527 }, { "epoch": 1.530825942942622, "grad_norm": 3.1986310482025146, "learning_rate": 4.701604278074866e-06, "loss": 0.13651110231876373, "num_input_tokens_seen": 3687594, "step": 3582, "train_runtime": 8706.7929, "train_tokens_per_second": 423.531 }, { "epoch": 1.5312533390319478, "grad_norm": 3.6478352546691895, "learning_rate": 4.697326203208557e-06, "loss": 0.10898452252149582, "num_input_tokens_seen": 3688340, "step": 3583, "train_runtime": 8708.8134, "train_tokens_per_second": 423.518 }, { "epoch": 1.5316807351212738, "grad_norm": 2.9175631999969482, "learning_rate": 4.693048128342246e-06, "loss": 0.07430899143218994, "num_input_tokens_seen": 3689224, "step": 3584, "train_runtime": 8710.8741, "train_tokens_per_second": 423.519 }, { "epoch": 1.5321081312105993, "grad_norm": 2.845033884048462, "learning_rate": 4.688770053475936e-06, "loss": 0.08749985694885254, "num_input_tokens_seen": 3690152, "step": 3585, "train_runtime": 8712.9521, "train_tokens_per_second": 423.525 }, { "epoch": 1.5325355272999253, "grad_norm": 3.592252731323242, "learning_rate": 4.684491978609626e-06, "loss": 0.13111191987991333, "num_input_tokens_seen": 3690984, "step": 3586, "train_runtime": 8714.9906, "train_tokens_per_second": 423.521 }, { "epoch": 1.532962923389251, "grad_norm": 2.714939832687378, "learning_rate": 4.680213903743316e-06, "loss": 0.10098357498645782, "num_input_tokens_seen": 3692010, "step": 3587, "train_runtime": 8717.1166, "train_tokens_per_second": 423.536 }, { "epoch": 1.5333903194785767, "grad_norm": 2.8202216625213623, "learning_rate": 4.6759358288770056e-06, "loss": 0.08065255731344223, "num_input_tokens_seen": 3693006, "step": 3588, "train_runtime": 8719.1684, "train_tokens_per_second": 423.55 }, { "epoch": 1.5338177155679027, "grad_norm": 2.5369462966918945, "learning_rate": 4.671657754010696e-06, "loss": 0.07120746374130249, "num_input_tokens_seen": 3694132, "step": 3589, "train_runtime": 8721.2802, "train_tokens_per_second": 423.577 }, { "epoch": 1.5342451116572282, "grad_norm": 2.47664737701416, "learning_rate": 4.667379679144385e-06, "loss": 0.0982205867767334, "num_input_tokens_seen": 3695768, "step": 3590, "train_runtime": 8723.6191, "train_tokens_per_second": 423.651 }, { "epoch": 1.5346725077465542, "grad_norm": 1.9944649934768677, "learning_rate": 4.663101604278076e-06, "loss": 0.04601496085524559, "num_input_tokens_seen": 3696788, "step": 3591, "train_runtime": 8725.6879, "train_tokens_per_second": 423.667 }, { "epoch": 1.53509990383588, "grad_norm": 2.4604697227478027, "learning_rate": 4.658823529411765e-06, "loss": 0.06514716148376465, "num_input_tokens_seen": 3697840, "step": 3592, "train_runtime": 8727.8502, "train_tokens_per_second": 423.683 }, { "epoch": 1.5355272999252056, "grad_norm": 2.6117424964904785, "learning_rate": 4.654545454545455e-06, "loss": 0.11933612823486328, "num_input_tokens_seen": 3699010, "step": 3593, "train_runtime": 8730.0155, "train_tokens_per_second": 423.712 }, { "epoch": 1.5359546960145316, "grad_norm": 2.248175621032715, "learning_rate": 4.650267379679145e-06, "loss": 0.08991917222738266, "num_input_tokens_seen": 3700278, "step": 3594, "train_runtime": 8732.1409, "train_tokens_per_second": 423.754 }, { "epoch": 1.5363820921038571, "grad_norm": 2.2596352100372314, "learning_rate": 4.645989304812834e-06, "loss": 0.09629835933446884, "num_input_tokens_seen": 3701786, "step": 3595, "train_runtime": 8734.3549, "train_tokens_per_second": 423.819 }, { "epoch": 1.536809488193183, "grad_norm": 3.0452094078063965, "learning_rate": 4.6417112299465245e-06, "loss": 0.09905613213777542, "num_input_tokens_seen": 3703044, "step": 3596, "train_runtime": 8736.4708, "train_tokens_per_second": 423.86 }, { "epoch": 1.5372368842825088, "grad_norm": 2.5404555797576904, "learning_rate": 4.637433155080214e-06, "loss": 0.10123807191848755, "num_input_tokens_seen": 3704752, "step": 3597, "train_runtime": 8738.7777, "train_tokens_per_second": 423.944 }, { "epoch": 1.5376642803718346, "grad_norm": 2.348659038543701, "learning_rate": 4.633155080213904e-06, "loss": 0.07921864092350006, "num_input_tokens_seen": 3705828, "step": 3598, "train_runtime": 8740.8639, "train_tokens_per_second": 423.966 }, { "epoch": 1.5380916764611605, "grad_norm": 2.0623555183410645, "learning_rate": 4.628877005347594e-06, "loss": 0.07594524323940277, "num_input_tokens_seen": 3707008, "step": 3599, "train_runtime": 8742.9778, "train_tokens_per_second": 423.998 }, { "epoch": 1.538519072550486, "grad_norm": 2.5412261486053467, "learning_rate": 4.624598930481284e-06, "loss": 0.0630202367901802, "num_input_tokens_seen": 3707884, "step": 3600, "train_runtime": 8745.0101, "train_tokens_per_second": 424.0 }, { "epoch": 1.538946468639812, "grad_norm": 1.9494917392730713, "learning_rate": 4.6203208556149734e-06, "loss": 0.09244862198829651, "num_input_tokens_seen": 3709478, "step": 3601, "train_runtime": 8753.5997, "train_tokens_per_second": 423.766 }, { "epoch": 1.5393738647291377, "grad_norm": 2.3527469635009766, "learning_rate": 4.616042780748664e-06, "loss": 0.057154253125190735, "num_input_tokens_seen": 3710488, "step": 3602, "train_runtime": 8755.7033, "train_tokens_per_second": 423.78 }, { "epoch": 1.5398012608184635, "grad_norm": 2.1083223819732666, "learning_rate": 4.611764705882353e-06, "loss": 0.08045226335525513, "num_input_tokens_seen": 3711738, "step": 3603, "train_runtime": 8757.9543, "train_tokens_per_second": 423.813 }, { "epoch": 1.5402286569077894, "grad_norm": 1.5975210666656494, "learning_rate": 4.6074866310160435e-06, "loss": 0.06320622563362122, "num_input_tokens_seen": 3713178, "step": 3604, "train_runtime": 8760.1007, "train_tokens_per_second": 423.874 }, { "epoch": 1.540656052997115, "grad_norm": 6.253113269805908, "learning_rate": 4.603208556149733e-06, "loss": 0.10745090991258621, "num_input_tokens_seen": 3713862, "step": 3605, "train_runtime": 8762.0925, "train_tokens_per_second": 423.856 }, { "epoch": 1.541083449086441, "grad_norm": 4.463780403137207, "learning_rate": 4.598930481283423e-06, "loss": 0.16097380220890045, "num_input_tokens_seen": 3715496, "step": 3606, "train_runtime": 8764.3336, "train_tokens_per_second": 423.934 }, { "epoch": 1.5415108451757666, "grad_norm": 2.8171584606170654, "learning_rate": 4.594652406417113e-06, "loss": 0.11639207601547241, "num_input_tokens_seen": 3716606, "step": 3607, "train_runtime": 8766.4123, "train_tokens_per_second": 423.96 }, { "epoch": 1.5419382412650924, "grad_norm": 3.250713348388672, "learning_rate": 4.590374331550803e-06, "loss": 0.08768874406814575, "num_input_tokens_seen": 3717358, "step": 3608, "train_runtime": 8768.4207, "train_tokens_per_second": 423.948 }, { "epoch": 1.5423656373544183, "grad_norm": 2.8987226486206055, "learning_rate": 4.586096256684492e-06, "loss": 0.08865876495838165, "num_input_tokens_seen": 3718354, "step": 3609, "train_runtime": 8770.4911, "train_tokens_per_second": 423.962 }, { "epoch": 1.5427930334437439, "grad_norm": 2.9552831649780273, "learning_rate": 4.581818181818183e-06, "loss": 0.11212590336799622, "num_input_tokens_seen": 3719314, "step": 3610, "train_runtime": 8772.5412, "train_tokens_per_second": 423.972 }, { "epoch": 1.5432204295330698, "grad_norm": 1.9415446519851685, "learning_rate": 4.577540106951872e-06, "loss": 0.08809635043144226, "num_input_tokens_seen": 3720748, "step": 3611, "train_runtime": 8774.7312, "train_tokens_per_second": 424.03 }, { "epoch": 1.5436478256223956, "grad_norm": 2.2836174964904785, "learning_rate": 4.573262032085562e-06, "loss": 0.09118485450744629, "num_input_tokens_seen": 3722006, "step": 3612, "train_runtime": 8776.8862, "train_tokens_per_second": 424.069 }, { "epoch": 1.5440752217117213, "grad_norm": 2.4618706703186035, "learning_rate": 4.568983957219252e-06, "loss": 0.07965587824583054, "num_input_tokens_seen": 3723140, "step": 3613, "train_runtime": 8779.0024, "train_tokens_per_second": 424.096 }, { "epoch": 1.5445026178010473, "grad_norm": 1.9284067153930664, "learning_rate": 4.564705882352941e-06, "loss": 0.06568905711174011, "num_input_tokens_seen": 3724454, "step": 3614, "train_runtime": 8781.1449, "train_tokens_per_second": 424.142 }, { "epoch": 1.5449300138903728, "grad_norm": 2.652906656265259, "learning_rate": 4.560427807486632e-06, "loss": 0.07547233253717422, "num_input_tokens_seen": 3725486, "step": 3615, "train_runtime": 8783.261, "train_tokens_per_second": 424.157 }, { "epoch": 1.5453574099796987, "grad_norm": 2.633727788925171, "learning_rate": 4.556149732620321e-06, "loss": 0.07704445719718933, "num_input_tokens_seen": 3726512, "step": 3616, "train_runtime": 8785.3309, "train_tokens_per_second": 424.174 }, { "epoch": 1.5457848060690245, "grad_norm": 2.2409443855285645, "learning_rate": 4.551871657754011e-06, "loss": 0.08279399573802948, "num_input_tokens_seen": 3727586, "step": 3617, "train_runtime": 8787.4152, "train_tokens_per_second": 424.196 }, { "epoch": 1.5462122021583502, "grad_norm": 1.0659631490707397, "learning_rate": 4.547593582887701e-06, "loss": 0.025751378387212753, "num_input_tokens_seen": 3730588, "step": 3618, "train_runtime": 8789.9953, "train_tokens_per_second": 424.413 }, { "epoch": 1.5466395982476762, "grad_norm": 2.6087591648101807, "learning_rate": 4.543315508021391e-06, "loss": 0.08426611125469208, "num_input_tokens_seen": 3731650, "step": 3619, "train_runtime": 8792.0707, "train_tokens_per_second": 424.434 }, { "epoch": 1.5470669943370017, "grad_norm": 2.809187173843384, "learning_rate": 4.5390374331550805e-06, "loss": 0.09342777729034424, "num_input_tokens_seen": 3732664, "step": 3620, "train_runtime": 8794.1764, "train_tokens_per_second": 424.447 }, { "epoch": 1.5474943904263276, "grad_norm": 2.9087748527526855, "learning_rate": 4.534759358288771e-06, "loss": 0.07650496810674667, "num_input_tokens_seen": 3733644, "step": 3621, "train_runtime": 8796.2817, "train_tokens_per_second": 424.457 }, { "epoch": 1.5479217865156534, "grad_norm": 1.5646504163742065, "learning_rate": 4.53048128342246e-06, "loss": 0.06139673292636871, "num_input_tokens_seen": 3735232, "step": 3622, "train_runtime": 8798.5094, "train_tokens_per_second": 424.53 }, { "epoch": 1.5483491826049791, "grad_norm": 2.5629093647003174, "learning_rate": 4.5262032085561506e-06, "loss": 0.09025517106056213, "num_input_tokens_seen": 3736016, "step": 3623, "train_runtime": 8800.5451, "train_tokens_per_second": 424.521 }, { "epoch": 1.548776578694305, "grad_norm": 2.0147087574005127, "learning_rate": 4.52192513368984e-06, "loss": 0.07959703356027603, "num_input_tokens_seen": 3737764, "step": 3624, "train_runtime": 8802.8712, "train_tokens_per_second": 424.607 }, { "epoch": 1.5492039747836306, "grad_norm": 2.742891550064087, "learning_rate": 4.51764705882353e-06, "loss": 0.07095218449831009, "num_input_tokens_seen": 3738586, "step": 3625, "train_runtime": 8804.915, "train_tokens_per_second": 424.602 }, { "epoch": 1.5496313708729565, "grad_norm": 1.4911378622055054, "learning_rate": 4.51336898395722e-06, "loss": 0.05005992203950882, "num_input_tokens_seen": 3739918, "step": 3626, "train_runtime": 8807.0623, "train_tokens_per_second": 424.65 }, { "epoch": 1.5500587669622823, "grad_norm": 2.6787283420562744, "learning_rate": 4.50909090909091e-06, "loss": 0.07647174596786499, "num_input_tokens_seen": 3740700, "step": 3627, "train_runtime": 8809.0578, "train_tokens_per_second": 424.642 }, { "epoch": 1.550486163051608, "grad_norm": 2.4261646270751953, "learning_rate": 4.5048128342245995e-06, "loss": 0.06149151921272278, "num_input_tokens_seen": 3741490, "step": 3628, "train_runtime": 8811.0905, "train_tokens_per_second": 424.634 }, { "epoch": 1.550913559140934, "grad_norm": 2.779052734375, "learning_rate": 4.500534759358289e-06, "loss": 0.08920960873365402, "num_input_tokens_seen": 3742304, "step": 3629, "train_runtime": 8813.1086, "train_tokens_per_second": 424.629 }, { "epoch": 1.5513409552302595, "grad_norm": 2.4222524166107178, "learning_rate": 4.496256684491979e-06, "loss": 0.11216238886117935, "num_input_tokens_seen": 3743304, "step": 3630, "train_runtime": 8815.1887, "train_tokens_per_second": 424.643 }, { "epoch": 1.5517683513195855, "grad_norm": 3.995540142059326, "learning_rate": 4.491978609625669e-06, "loss": 0.08351875841617584, "num_input_tokens_seen": 3743772, "step": 3631, "train_runtime": 8823.8094, "train_tokens_per_second": 424.281 }, { "epoch": 1.5521957474089112, "grad_norm": 2.49881911277771, "learning_rate": 4.487700534759359e-06, "loss": 0.07293374836444855, "num_input_tokens_seen": 3744968, "step": 3632, "train_runtime": 8825.9527, "train_tokens_per_second": 424.313 }, { "epoch": 1.552623143498237, "grad_norm": 2.3901586532592773, "learning_rate": 4.483422459893048e-06, "loss": 0.08552029728889465, "num_input_tokens_seen": 3746094, "step": 3633, "train_runtime": 8828.2474, "train_tokens_per_second": 424.33 }, { "epoch": 1.553050539587563, "grad_norm": 2.1088755130767822, "learning_rate": 4.479144385026739e-06, "loss": 0.08151990175247192, "num_input_tokens_seen": 3747156, "step": 3634, "train_runtime": 8830.3601, "train_tokens_per_second": 424.349 }, { "epoch": 1.5534779356768884, "grad_norm": 2.7339720726013184, "learning_rate": 4.474866310160428e-06, "loss": 0.09420132637023926, "num_input_tokens_seen": 3748070, "step": 3635, "train_runtime": 8832.4166, "train_tokens_per_second": 424.354 }, { "epoch": 1.5539053317662144, "grad_norm": 3.7338931560516357, "learning_rate": 4.4705882352941184e-06, "loss": 0.13226300477981567, "num_input_tokens_seen": 3748842, "step": 3636, "train_runtime": 8834.4293, "train_tokens_per_second": 424.345 }, { "epoch": 1.55433272785554, "grad_norm": 3.0476105213165283, "learning_rate": 4.466310160427808e-06, "loss": 0.06818005442619324, "num_input_tokens_seen": 3750710, "step": 3637, "train_runtime": 8836.7178, "train_tokens_per_second": 424.446 }, { "epoch": 1.5547601239448658, "grad_norm": 2.1895222663879395, "learning_rate": 4.462032085561498e-06, "loss": 0.09431041777133942, "num_input_tokens_seen": 3751582, "step": 3638, "train_runtime": 8838.7576, "train_tokens_per_second": 424.447 }, { "epoch": 1.5551875200341918, "grad_norm": 2.80151629447937, "learning_rate": 4.457754010695188e-06, "loss": 0.11778023093938828, "num_input_tokens_seen": 3752406, "step": 3639, "train_runtime": 8840.7865, "train_tokens_per_second": 424.443 }, { "epoch": 1.5556149161235173, "grad_norm": 2.352405071258545, "learning_rate": 4.453475935828878e-06, "loss": 0.06863915920257568, "num_input_tokens_seen": 3753206, "step": 3640, "train_runtime": 8842.8709, "train_tokens_per_second": 424.433 }, { "epoch": 1.5560423122128433, "grad_norm": 2.1238908767700195, "learning_rate": 4.449197860962567e-06, "loss": 0.056637659668922424, "num_input_tokens_seen": 3754258, "step": 3641, "train_runtime": 8844.9687, "train_tokens_per_second": 424.451 }, { "epoch": 1.556469708302169, "grad_norm": 2.046593189239502, "learning_rate": 4.444919786096258e-06, "loss": 0.037819236516952515, "num_input_tokens_seen": 3754878, "step": 3642, "train_runtime": 8846.9281, "train_tokens_per_second": 424.427 }, { "epoch": 1.5568971043914948, "grad_norm": 3.086535692214966, "learning_rate": 4.440641711229947e-06, "loss": 0.09567147493362427, "num_input_tokens_seen": 3755606, "step": 3643, "train_runtime": 8848.9613, "train_tokens_per_second": 424.412 }, { "epoch": 1.5573245004808207, "grad_norm": 3.7156472206115723, "learning_rate": 4.436363636363637e-06, "loss": 0.1002168282866478, "num_input_tokens_seen": 3756278, "step": 3644, "train_runtime": 8850.909, "train_tokens_per_second": 424.395 }, { "epoch": 1.5577518965701462, "grad_norm": 3.008974552154541, "learning_rate": 4.432085561497327e-06, "loss": 0.09877640008926392, "num_input_tokens_seen": 3757170, "step": 3645, "train_runtime": 8852.9649, "train_tokens_per_second": 424.397 }, { "epoch": 1.5581792926594722, "grad_norm": 1.9847075939178467, "learning_rate": 4.427807486631016e-06, "loss": 0.07963381707668304, "num_input_tokens_seen": 3758686, "step": 3646, "train_runtime": 8855.1669, "train_tokens_per_second": 424.462 }, { "epoch": 1.558606688748798, "grad_norm": 2.562413215637207, "learning_rate": 4.423529411764707e-06, "loss": 0.07942426949739456, "num_input_tokens_seen": 3759634, "step": 3647, "train_runtime": 8857.2409, "train_tokens_per_second": 424.47 }, { "epoch": 1.5590340848381237, "grad_norm": 2.991321325302124, "learning_rate": 4.419251336898396e-06, "loss": 0.05702042579650879, "num_input_tokens_seen": 3760228, "step": 3648, "train_runtime": 8859.2119, "train_tokens_per_second": 424.443 }, { "epoch": 1.5594614809274496, "grad_norm": 1.9916613101959229, "learning_rate": 4.4149732620320855e-06, "loss": 0.07082544267177582, "num_input_tokens_seen": 3761596, "step": 3649, "train_runtime": 8861.3961, "train_tokens_per_second": 424.492 }, { "epoch": 1.5598888770167751, "grad_norm": 3.1427340507507324, "learning_rate": 4.410695187165776e-06, "loss": 0.08179493993520737, "num_input_tokens_seen": 3762408, "step": 3650, "train_runtime": 8863.4362, "train_tokens_per_second": 424.486 }, { "epoch": 1.560316273106101, "grad_norm": 5.308429718017578, "learning_rate": 4.406417112299465e-06, "loss": 0.08196905255317688, "num_input_tokens_seen": 3764016, "step": 3651, "train_runtime": 8865.6432, "train_tokens_per_second": 424.562 }, { "epoch": 1.5607436691954268, "grad_norm": 2.4211533069610596, "learning_rate": 4.4021390374331555e-06, "loss": 0.0805337131023407, "num_input_tokens_seen": 3765242, "step": 3652, "train_runtime": 8867.8062, "train_tokens_per_second": 424.597 }, { "epoch": 1.5611710652847526, "grad_norm": 2.5551466941833496, "learning_rate": 4.397860962566845e-06, "loss": 0.0831645280122757, "num_input_tokens_seen": 3766200, "step": 3653, "train_runtime": 8869.8818, "train_tokens_per_second": 424.605 }, { "epoch": 1.5615984613740785, "grad_norm": 1.8627734184265137, "learning_rate": 4.393582887700535e-06, "loss": 0.06860567629337311, "num_input_tokens_seen": 3767436, "step": 3654, "train_runtime": 8872.0258, "train_tokens_per_second": 424.642 }, { "epoch": 1.562025857463404, "grad_norm": 3.857524871826172, "learning_rate": 4.389304812834225e-06, "loss": 0.09804932773113251, "num_input_tokens_seen": 3768572, "step": 3655, "train_runtime": 8874.1348, "train_tokens_per_second": 424.669 }, { "epoch": 1.56245325355273, "grad_norm": 2.945697546005249, "learning_rate": 4.385026737967915e-06, "loss": 0.0862235277891159, "num_input_tokens_seen": 3769582, "step": 3656, "train_runtime": 8876.2154, "train_tokens_per_second": 424.683 }, { "epoch": 1.5628806496420558, "grad_norm": 2.284696102142334, "learning_rate": 4.3807486631016044e-06, "loss": 0.05801151692867279, "num_input_tokens_seen": 3770462, "step": 3657, "train_runtime": 8878.2637, "train_tokens_per_second": 424.685 }, { "epoch": 1.5633080457313815, "grad_norm": 2.2022407054901123, "learning_rate": 4.376470588235294e-06, "loss": 0.06683167815208435, "num_input_tokens_seen": 3771968, "step": 3658, "train_runtime": 8880.4685, "train_tokens_per_second": 424.749 }, { "epoch": 1.5637354418207075, "grad_norm": 3.813249349594116, "learning_rate": 4.372192513368984e-06, "loss": 0.14138197898864746, "num_input_tokens_seen": 3773654, "step": 3659, "train_runtime": 8882.7502, "train_tokens_per_second": 424.829 }, { "epoch": 1.564162837910033, "grad_norm": 3.5508217811584473, "learning_rate": 4.367914438502674e-06, "loss": 0.07752018421888351, "num_input_tokens_seen": 3774502, "step": 3660, "train_runtime": 8884.8096, "train_tokens_per_second": 424.826 }, { "epoch": 1.564590233999359, "grad_norm": 1.9456413984298706, "learning_rate": 4.363636363636364e-06, "loss": 0.07442499697208405, "num_input_tokens_seen": 3775572, "step": 3661, "train_runtime": 8893.6147, "train_tokens_per_second": 424.526 }, { "epoch": 1.5650176300886847, "grad_norm": 2.7564380168914795, "learning_rate": 4.359358288770053e-06, "loss": 0.0837429016828537, "num_input_tokens_seen": 3776356, "step": 3662, "train_runtime": 8895.6281, "train_tokens_per_second": 424.518 }, { "epoch": 1.5654450261780104, "grad_norm": 2.5858020782470703, "learning_rate": 4.355080213903744e-06, "loss": 0.07261614501476288, "num_input_tokens_seen": 3777482, "step": 3663, "train_runtime": 8897.8883, "train_tokens_per_second": 424.537 }, { "epoch": 1.5658724222673364, "grad_norm": 2.613537311553955, "learning_rate": 4.350802139037433e-06, "loss": 0.0808013379573822, "num_input_tokens_seen": 3778390, "step": 3664, "train_runtime": 8899.9412, "train_tokens_per_second": 424.541 }, { "epoch": 1.5662998183566619, "grad_norm": 3.2757058143615723, "learning_rate": 4.346524064171123e-06, "loss": 0.059987809509038925, "num_input_tokens_seen": 3779034, "step": 3665, "train_runtime": 8901.9297, "train_tokens_per_second": 424.519 }, { "epoch": 1.5667272144459878, "grad_norm": 2.049184799194336, "learning_rate": 4.342245989304813e-06, "loss": 0.08657336235046387, "num_input_tokens_seen": 3781032, "step": 3666, "train_runtime": 8904.2584, "train_tokens_per_second": 424.632 }, { "epoch": 1.5671546105353136, "grad_norm": 3.0423758029937744, "learning_rate": 4.337967914438503e-06, "loss": 0.08478708565235138, "num_input_tokens_seen": 3781806, "step": 3667, "train_runtime": 8906.2786, "train_tokens_per_second": 424.622 }, { "epoch": 1.5675820066246393, "grad_norm": 1.600178599357605, "learning_rate": 4.3336898395721926e-06, "loss": 0.058786340057849884, "num_input_tokens_seen": 3782970, "step": 3668, "train_runtime": 8908.3911, "train_tokens_per_second": 424.652 }, { "epoch": 1.5680094027139653, "grad_norm": 2.5816683769226074, "learning_rate": 4.329411764705883e-06, "loss": 0.09872876852750778, "num_input_tokens_seen": 3784280, "step": 3669, "train_runtime": 8910.5328, "train_tokens_per_second": 424.697 }, { "epoch": 1.5684367988032908, "grad_norm": 4.025772571563721, "learning_rate": 4.325133689839572e-06, "loss": 0.09428335726261139, "num_input_tokens_seen": 3785344, "step": 3670, "train_runtime": 8912.6218, "train_tokens_per_second": 424.717 }, { "epoch": 1.5688641948926167, "grad_norm": 3.1545445919036865, "learning_rate": 4.320855614973263e-06, "loss": 0.04300302267074585, "num_input_tokens_seen": 3786258, "step": 3671, "train_runtime": 8914.7065, "train_tokens_per_second": 424.72 }, { "epoch": 1.5692915909819425, "grad_norm": 2.8887295722961426, "learning_rate": 4.316577540106952e-06, "loss": 0.07493719458580017, "num_input_tokens_seen": 3787092, "step": 3672, "train_runtime": 8916.7252, "train_tokens_per_second": 424.718 }, { "epoch": 1.5697189870712682, "grad_norm": 2.8340725898742676, "learning_rate": 4.312299465240642e-06, "loss": 0.12625624239444733, "num_input_tokens_seen": 3788700, "step": 3673, "train_runtime": 8918.955, "train_tokens_per_second": 424.792 }, { "epoch": 1.5701463831605942, "grad_norm": 4.254677772521973, "learning_rate": 4.308021390374332e-06, "loss": 0.10435140877962112, "num_input_tokens_seen": 3789418, "step": 3674, "train_runtime": 8920.9457, "train_tokens_per_second": 424.778 }, { "epoch": 1.5705737792499197, "grad_norm": 2.665790557861328, "learning_rate": 4.303743315508021e-06, "loss": 0.08641651272773743, "num_input_tokens_seen": 3790558, "step": 3675, "train_runtime": 8923.0677, "train_tokens_per_second": 424.804 }, { "epoch": 1.5710011753392457, "grad_norm": 2.5489273071289062, "learning_rate": 4.2994652406417115e-06, "loss": 0.08997465670108795, "num_input_tokens_seen": 3791676, "step": 3676, "train_runtime": 8925.2325, "train_tokens_per_second": 424.827 }, { "epoch": 1.5714285714285714, "grad_norm": 1.9713928699493408, "learning_rate": 4.295187165775401e-06, "loss": 0.04911072179675102, "num_input_tokens_seen": 3792800, "step": 3677, "train_runtime": 8927.3362, "train_tokens_per_second": 424.852 }, { "epoch": 1.5718559675178971, "grad_norm": 3.2004568576812744, "learning_rate": 4.290909090909091e-06, "loss": 0.09403054416179657, "num_input_tokens_seen": 3793720, "step": 3678, "train_runtime": 8929.4043, "train_tokens_per_second": 424.857 }, { "epoch": 1.572283363607223, "grad_norm": 2.9870142936706543, "learning_rate": 4.286631016042781e-06, "loss": 0.09138641506433487, "num_input_tokens_seen": 3794584, "step": 3679, "train_runtime": 8931.4467, "train_tokens_per_second": 424.857 }, { "epoch": 1.5727107596965486, "grad_norm": 3.7452101707458496, "learning_rate": 4.282352941176471e-06, "loss": 0.10864057391881943, "num_input_tokens_seen": 3795204, "step": 3680, "train_runtime": 8933.4038, "train_tokens_per_second": 424.833 }, { "epoch": 1.5731381557858746, "grad_norm": 3.3195242881774902, "learning_rate": 4.2780748663101604e-06, "loss": 0.10429537296295166, "num_input_tokens_seen": 3796192, "step": 3681, "train_runtime": 8935.4692, "train_tokens_per_second": 424.845 }, { "epoch": 1.5735655518752003, "grad_norm": 3.5783767700195312, "learning_rate": 4.273796791443851e-06, "loss": 0.07717061042785645, "num_input_tokens_seen": 3797124, "step": 3682, "train_runtime": 8937.6051, "train_tokens_per_second": 424.848 }, { "epoch": 1.573992947964526, "grad_norm": 2.7084686756134033, "learning_rate": 4.26951871657754e-06, "loss": 0.041866425424814224, "num_input_tokens_seen": 3798046, "step": 3683, "train_runtime": 8939.6566, "train_tokens_per_second": 424.854 }, { "epoch": 1.574420344053852, "grad_norm": 3.7582314014434814, "learning_rate": 4.2652406417112305e-06, "loss": 0.12114076316356659, "num_input_tokens_seen": 3798868, "step": 3684, "train_runtime": 8941.7319, "train_tokens_per_second": 424.847 }, { "epoch": 1.5748477401431777, "grad_norm": 3.613131284713745, "learning_rate": 4.26096256684492e-06, "loss": 0.11577745527029037, "num_input_tokens_seen": 3799782, "step": 3685, "train_runtime": 8943.7806, "train_tokens_per_second": 424.852 }, { "epoch": 1.5752751362325035, "grad_norm": 3.2609291076660156, "learning_rate": 4.25668449197861e-06, "loss": 0.09055764973163605, "num_input_tokens_seen": 3800706, "step": 3686, "train_runtime": 8945.8687, "train_tokens_per_second": 424.856 }, { "epoch": 1.5757025323218292, "grad_norm": 2.4341588020324707, "learning_rate": 4.2524064171123e-06, "loss": 0.09768286347389221, "num_input_tokens_seen": 3802162, "step": 3687, "train_runtime": 8948.0931, "train_tokens_per_second": 424.913 }, { "epoch": 1.576129928411155, "grad_norm": 5.3986310958862305, "learning_rate": 4.24812834224599e-06, "loss": 0.1518974006175995, "num_input_tokens_seen": 3802846, "step": 3688, "train_runtime": 8950.1198, "train_tokens_per_second": 424.893 }, { "epoch": 1.576557324500481, "grad_norm": 4.272782325744629, "learning_rate": 4.243850267379679e-06, "loss": 0.13275907933712006, "num_input_tokens_seen": 3803772, "step": 3689, "train_runtime": 8952.2132, "train_tokens_per_second": 424.897 }, { "epoch": 1.5769847205898067, "grad_norm": 3.8578505516052246, "learning_rate": 4.23957219251337e-06, "loss": 0.10831649601459503, "num_input_tokens_seen": 3804470, "step": 3690, "train_runtime": 8954.2021, "train_tokens_per_second": 424.881 }, { "epoch": 1.5774121166791324, "grad_norm": 2.5252091884613037, "learning_rate": 4.235294117647059e-06, "loss": 0.08624790608882904, "num_input_tokens_seen": 3805542, "step": 3691, "train_runtime": 8963.0058, "train_tokens_per_second": 424.583 }, { "epoch": 1.5778395127684581, "grad_norm": 4.458561420440674, "learning_rate": 4.2310160427807486e-06, "loss": 0.09071683883666992, "num_input_tokens_seen": 3806542, "step": 3692, "train_runtime": 8965.0813, "train_tokens_per_second": 424.596 }, { "epoch": 1.5782669088577839, "grad_norm": 2.5220489501953125, "learning_rate": 4.226737967914439e-06, "loss": 0.06447817385196686, "num_input_tokens_seen": 3807480, "step": 3693, "train_runtime": 8967.2602, "train_tokens_per_second": 424.598 }, { "epoch": 1.5786943049471098, "grad_norm": 2.5552539825439453, "learning_rate": 4.222459893048128e-06, "loss": 0.07284650206565857, "num_input_tokens_seen": 3808214, "step": 3694, "train_runtime": 8969.2391, "train_tokens_per_second": 424.586 }, { "epoch": 1.5791217010364356, "grad_norm": 3.8874473571777344, "learning_rate": 4.218181818181819e-06, "loss": 0.12044481933116913, "num_input_tokens_seen": 3809128, "step": 3695, "train_runtime": 8971.261, "train_tokens_per_second": 424.592 }, { "epoch": 1.5795490971257613, "grad_norm": 3.700584888458252, "learning_rate": 4.213903743315508e-06, "loss": 0.14837245643138885, "num_input_tokens_seen": 3810170, "step": 3696, "train_runtime": 8973.3507, "train_tokens_per_second": 424.61 }, { "epoch": 1.579976493215087, "grad_norm": 4.415613651275635, "learning_rate": 4.209625668449198e-06, "loss": 0.07102113962173462, "num_input_tokens_seen": 3811010, "step": 3697, "train_runtime": 8975.3639, "train_tokens_per_second": 424.608 }, { "epoch": 1.5804038893044128, "grad_norm": 3.488647222518921, "learning_rate": 4.205347593582888e-06, "loss": 0.08090274035930634, "num_input_tokens_seen": 3811872, "step": 3698, "train_runtime": 8977.4098, "train_tokens_per_second": 424.607 }, { "epoch": 1.5808312853937387, "grad_norm": 3.9039835929870605, "learning_rate": 4.201069518716578e-06, "loss": 0.1370634138584137, "num_input_tokens_seen": 3812694, "step": 3699, "train_runtime": 8979.4541, "train_tokens_per_second": 424.602 }, { "epoch": 1.5812586814830645, "grad_norm": 2.6942129135131836, "learning_rate": 4.1967914438502675e-06, "loss": 0.0807517021894455, "num_input_tokens_seen": 3813498, "step": 3700, "train_runtime": 8981.5098, "train_tokens_per_second": 424.594 }, { "epoch": 1.5816860775723902, "grad_norm": 3.715888500213623, "learning_rate": 4.192513368983958e-06, "loss": 0.09637901186943054, "num_input_tokens_seen": 3814154, "step": 3701, "train_runtime": 8983.4601, "train_tokens_per_second": 424.575 }, { "epoch": 1.582113473661716, "grad_norm": 2.2719504833221436, "learning_rate": 4.188235294117647e-06, "loss": 0.06177634745836258, "num_input_tokens_seen": 3815062, "step": 3702, "train_runtime": 8985.5133, "train_tokens_per_second": 424.579 }, { "epoch": 1.5825408697510417, "grad_norm": 1.869610071182251, "learning_rate": 4.1839572192513376e-06, "loss": 0.050009824335575104, "num_input_tokens_seen": 3815922, "step": 3703, "train_runtime": 8987.5679, "train_tokens_per_second": 424.578 }, { "epoch": 1.5829682658403676, "grad_norm": 2.434877872467041, "learning_rate": 4.179679144385027e-06, "loss": 0.0797390341758728, "num_input_tokens_seen": 3817030, "step": 3704, "train_runtime": 8989.652, "train_tokens_per_second": 424.603 }, { "epoch": 1.5833956619296934, "grad_norm": 3.3488621711730957, "learning_rate": 4.175401069518717e-06, "loss": 0.13556364178657532, "num_input_tokens_seen": 3818414, "step": 3705, "train_runtime": 8991.8179, "train_tokens_per_second": 424.654 }, { "epoch": 1.5838230580190191, "grad_norm": 2.044520139694214, "learning_rate": 4.171122994652407e-06, "loss": 0.052254632115364075, "num_input_tokens_seen": 3819386, "step": 3706, "train_runtime": 8993.9044, "train_tokens_per_second": 424.664 }, { "epoch": 1.5842504541083449, "grad_norm": 2.247068166732788, "learning_rate": 4.166844919786097e-06, "loss": 0.0556839257478714, "num_input_tokens_seen": 3820526, "step": 3707, "train_runtime": 8995.9863, "train_tokens_per_second": 424.692 }, { "epoch": 1.5846778501976706, "grad_norm": 2.208731174468994, "learning_rate": 4.1625668449197865e-06, "loss": 0.046598006039857864, "num_input_tokens_seen": 3821544, "step": 3708, "train_runtime": 8998.075, "train_tokens_per_second": 424.707 }, { "epoch": 1.5851052462869966, "grad_norm": 3.909510850906372, "learning_rate": 4.158288770053476e-06, "loss": 0.09692294895648956, "num_input_tokens_seen": 3822324, "step": 3709, "train_runtime": 9000.1669, "train_tokens_per_second": 424.695 }, { "epoch": 1.5855326423763223, "grad_norm": 3.59633207321167, "learning_rate": 4.154010695187166e-06, "loss": 0.08196096122264862, "num_input_tokens_seen": 3823002, "step": 3710, "train_runtime": 9002.2302, "train_tokens_per_second": 424.673 }, { "epoch": 1.585960038465648, "grad_norm": 2.2421886920928955, "learning_rate": 4.149732620320856e-06, "loss": 0.06167696416378021, "num_input_tokens_seen": 3824460, "step": 3711, "train_runtime": 9004.4585, "train_tokens_per_second": 424.73 }, { "epoch": 1.5863874345549738, "grad_norm": 3.3259613513946533, "learning_rate": 4.145454545454546e-06, "loss": 0.06698131561279297, "num_input_tokens_seen": 3825000, "step": 3712, "train_runtime": 9006.442, "train_tokens_per_second": 424.696 }, { "epoch": 1.5868148306442995, "grad_norm": 3.280956506729126, "learning_rate": 4.141176470588235e-06, "loss": 0.09087018668651581, "num_input_tokens_seen": 3825930, "step": 3713, "train_runtime": 9008.5348, "train_tokens_per_second": 424.701 }, { "epoch": 1.5872422267336255, "grad_norm": 2.3354268074035645, "learning_rate": 4.136898395721926e-06, "loss": 0.06623318046331406, "num_input_tokens_seen": 3826662, "step": 3714, "train_runtime": 9010.5644, "train_tokens_per_second": 424.686 }, { "epoch": 1.5876696228229512, "grad_norm": 2.9654526710510254, "learning_rate": 4.132620320855615e-06, "loss": 0.08049989491701126, "num_input_tokens_seen": 3827460, "step": 3715, "train_runtime": 9012.6368, "train_tokens_per_second": 424.677 }, { "epoch": 1.588097018912277, "grad_norm": 2.074169397354126, "learning_rate": 4.1283422459893054e-06, "loss": 0.07111380249261856, "num_input_tokens_seen": 3828690, "step": 3716, "train_runtime": 9014.7895, "train_tokens_per_second": 424.712 }, { "epoch": 1.5885244150016027, "grad_norm": 2.4505534172058105, "learning_rate": 4.124064171122995e-06, "loss": 0.14879193902015686, "num_input_tokens_seen": 3830326, "step": 3717, "train_runtime": 9017.0117, "train_tokens_per_second": 424.789 }, { "epoch": 1.5889518110909284, "grad_norm": 2.8902440071105957, "learning_rate": 4.119786096256685e-06, "loss": 0.07940120249986649, "num_input_tokens_seen": 3831206, "step": 3718, "train_runtime": 9019.068, "train_tokens_per_second": 424.79 }, { "epoch": 1.5893792071802544, "grad_norm": 2.028463125228882, "learning_rate": 4.115508021390375e-06, "loss": 0.08170454949140549, "num_input_tokens_seen": 3832776, "step": 3719, "train_runtime": 9021.2821, "train_tokens_per_second": 424.859 }, { "epoch": 1.5898066032695801, "grad_norm": 2.5394840240478516, "learning_rate": 4.111229946524065e-06, "loss": 0.0726839005947113, "num_input_tokens_seen": 3833746, "step": 3720, "train_runtime": 9023.3669, "train_tokens_per_second": 424.869 }, { "epoch": 1.5902339993589059, "grad_norm": 3.7162156105041504, "learning_rate": 4.106951871657754e-06, "loss": 0.10076382011175156, "num_input_tokens_seen": 3834408, "step": 3721, "train_runtime": 9032.3392, "train_tokens_per_second": 424.52 }, { "epoch": 1.5906613954482316, "grad_norm": 2.5366437435150146, "learning_rate": 4.102673796791445e-06, "loss": 0.06175778806209564, "num_input_tokens_seen": 3835440, "step": 3722, "train_runtime": 9034.4244, "train_tokens_per_second": 424.536 }, { "epoch": 1.5910887915375573, "grad_norm": 2.22567081451416, "learning_rate": 4.098395721925134e-06, "loss": 0.07033620774745941, "num_input_tokens_seen": 3836378, "step": 3723, "train_runtime": 9036.478, "train_tokens_per_second": 424.543 }, { "epoch": 1.5915161876268833, "grad_norm": 2.504664182662964, "learning_rate": 4.094117647058824e-06, "loss": 0.10971106588840485, "num_input_tokens_seen": 3837578, "step": 3724, "train_runtime": 9038.5976, "train_tokens_per_second": 424.577 }, { "epoch": 1.591943583716209, "grad_norm": 2.3840789794921875, "learning_rate": 4.089839572192514e-06, "loss": 0.04765675961971283, "num_input_tokens_seen": 3838334, "step": 3725, "train_runtime": 9040.6102, "train_tokens_per_second": 424.566 }, { "epoch": 1.5923709798055348, "grad_norm": 2.7244410514831543, "learning_rate": 4.085561497326203e-06, "loss": 0.06524491310119629, "num_input_tokens_seen": 3839094, "step": 3726, "train_runtime": 9042.657, "train_tokens_per_second": 424.554 }, { "epoch": 1.5927983758948605, "grad_norm": 1.513750672340393, "learning_rate": 4.0812834224598936e-06, "loss": 0.06865884363651276, "num_input_tokens_seen": 3841032, "step": 3727, "train_runtime": 9045.0115, "train_tokens_per_second": 424.658 }, { "epoch": 1.5932257719841862, "grad_norm": 2.969418525695801, "learning_rate": 4.077005347593583e-06, "loss": 0.11490297317504883, "num_input_tokens_seen": 3841950, "step": 3728, "train_runtime": 9047.0601, "train_tokens_per_second": 424.663 }, { "epoch": 1.5936531680735122, "grad_norm": 1.9831045866012573, "learning_rate": 4.072727272727273e-06, "loss": 0.07737528532743454, "num_input_tokens_seen": 3842908, "step": 3729, "train_runtime": 9049.1077, "train_tokens_per_second": 424.673 }, { "epoch": 1.594080564162838, "grad_norm": 5.0819244384765625, "learning_rate": 4.068449197860963e-06, "loss": 0.08889011293649673, "num_input_tokens_seen": 3843884, "step": 3730, "train_runtime": 9051.1787, "train_tokens_per_second": 424.683 }, { "epoch": 1.5945079602521637, "grad_norm": 3.0215320587158203, "learning_rate": 4.064171122994653e-06, "loss": 0.12201597541570663, "num_input_tokens_seen": 3845104, "step": 3731, "train_runtime": 9053.2866, "train_tokens_per_second": 424.719 }, { "epoch": 1.5949353563414896, "grad_norm": 2.506110429763794, "learning_rate": 4.0598930481283425e-06, "loss": 0.08594998717308044, "num_input_tokens_seen": 3846304, "step": 3732, "train_runtime": 9055.4129, "train_tokens_per_second": 424.752 }, { "epoch": 1.5953627524308152, "grad_norm": 1.9650622606277466, "learning_rate": 4.055614973262033e-06, "loss": 0.06502595543861389, "num_input_tokens_seen": 3847416, "step": 3733, "train_runtime": 9057.5348, "train_tokens_per_second": 424.775 }, { "epoch": 1.5957901485201411, "grad_norm": 2.4348790645599365, "learning_rate": 4.051336898395722e-06, "loss": 0.07998715341091156, "num_input_tokens_seen": 3848636, "step": 3734, "train_runtime": 9059.6656, "train_tokens_per_second": 424.81 }, { "epoch": 1.5962175446094669, "grad_norm": 2.49920916557312, "learning_rate": 4.0470588235294125e-06, "loss": 0.10642632842063904, "num_input_tokens_seen": 3849552, "step": 3735, "train_runtime": 9061.7681, "train_tokens_per_second": 424.812 }, { "epoch": 1.5966449406987926, "grad_norm": 3.0594053268432617, "learning_rate": 4.042780748663102e-06, "loss": 0.14961659908294678, "num_input_tokens_seen": 3850674, "step": 3736, "train_runtime": 9063.8531, "train_tokens_per_second": 424.839 }, { "epoch": 1.5970723367881186, "grad_norm": 2.573340654373169, "learning_rate": 4.038502673796792e-06, "loss": 0.12499786913394928, "num_input_tokens_seen": 3851800, "step": 3737, "train_runtime": 9065.9695, "train_tokens_per_second": 424.864 }, { "epoch": 1.597499732877444, "grad_norm": 2.895692825317383, "learning_rate": 4.034224598930482e-06, "loss": 0.10141438245773315, "num_input_tokens_seen": 3852764, "step": 3738, "train_runtime": 9068.0689, "train_tokens_per_second": 424.871 }, { "epoch": 1.59792712896677, "grad_norm": 3.7980387210845947, "learning_rate": 4.029946524064172e-06, "loss": 0.06430226564407349, "num_input_tokens_seen": 3854140, "step": 3739, "train_runtime": 9070.3188, "train_tokens_per_second": 424.918 }, { "epoch": 1.5983545250560958, "grad_norm": 3.8682467937469482, "learning_rate": 4.0256684491978615e-06, "loss": 0.13706448674201965, "num_input_tokens_seen": 3854878, "step": 3740, "train_runtime": 9072.4271, "train_tokens_per_second": 424.9 }, { "epoch": 1.5987819211454215, "grad_norm": 3.0760552883148193, "learning_rate": 4.021390374331552e-06, "loss": 0.09270555526018143, "num_input_tokens_seen": 3855818, "step": 3741, "train_runtime": 9074.5254, "train_tokens_per_second": 424.906 }, { "epoch": 1.5992093172347475, "grad_norm": 2.4270148277282715, "learning_rate": 4.017112299465241e-06, "loss": 0.06725089997053146, "num_input_tokens_seen": 3856612, "step": 3742, "train_runtime": 9076.5248, "train_tokens_per_second": 424.9 }, { "epoch": 1.599636713324073, "grad_norm": 2.623974084854126, "learning_rate": 4.012834224598931e-06, "loss": 0.0497199185192585, "num_input_tokens_seen": 3857720, "step": 3743, "train_runtime": 9078.6626, "train_tokens_per_second": 424.922 }, { "epoch": 1.600064109413399, "grad_norm": 2.8311891555786133, "learning_rate": 4.008556149732621e-06, "loss": 0.049882713705301285, "num_input_tokens_seen": 3858448, "step": 3744, "train_runtime": 9080.6811, "train_tokens_per_second": 424.907 }, { "epoch": 1.600064109413399, "eval_loss": 0.517479419708252, "eval_runtime": 58.6866, "eval_samples_per_second": 17.006, "eval_steps_per_second": 8.503, "num_input_tokens_seen": 3858448, "step": 3744 }, { "epoch": 1.6004915055027247, "grad_norm": 4.240959644317627, "learning_rate": 4.00427807486631e-06, "loss": 0.11625102907419205, "num_input_tokens_seen": 3859404, "step": 3745, "train_runtime": 9141.4725, "train_tokens_per_second": 422.186 }, { "epoch": 1.6009189015920504, "grad_norm": 3.350600004196167, "learning_rate": 4.000000000000001e-06, "loss": 0.08775855600833893, "num_input_tokens_seen": 3860244, "step": 3746, "train_runtime": 9143.5216, "train_tokens_per_second": 422.184 }, { "epoch": 1.6013462976813764, "grad_norm": 2.823941946029663, "learning_rate": 3.99572192513369e-06, "loss": 0.06984219700098038, "num_input_tokens_seen": 3860866, "step": 3747, "train_runtime": 9145.5095, "train_tokens_per_second": 422.16 }, { "epoch": 1.601773693770702, "grad_norm": 2.7791175842285156, "learning_rate": 3.99144385026738e-06, "loss": 0.07626688480377197, "num_input_tokens_seen": 3861616, "step": 3748, "train_runtime": 9147.5389, "train_tokens_per_second": 422.148 }, { "epoch": 1.6022010898600278, "grad_norm": 2.3565356731414795, "learning_rate": 3.98716577540107e-06, "loss": 0.05657782033085823, "num_input_tokens_seen": 3862584, "step": 3749, "train_runtime": 9149.6331, "train_tokens_per_second": 422.157 }, { "epoch": 1.6026284859493536, "grad_norm": 3.3911795616149902, "learning_rate": 3.98288770053476e-06, "loss": 0.07750269770622253, "num_input_tokens_seen": 3863506, "step": 3750, "train_runtime": 9151.6572, "train_tokens_per_second": 422.165 }, { "epoch": 1.6030558820386793, "grad_norm": 3.270345687866211, "learning_rate": 3.97860962566845e-06, "loss": 0.1226666122674942, "num_input_tokens_seen": 3864410, "step": 3751, "train_runtime": 9160.0275, "train_tokens_per_second": 421.878 }, { "epoch": 1.6034832781280053, "grad_norm": 2.3923633098602295, "learning_rate": 3.97433155080214e-06, "loss": 0.10201317071914673, "num_input_tokens_seen": 3866090, "step": 3752, "train_runtime": 9162.372, "train_tokens_per_second": 421.953 }, { "epoch": 1.6039106742173308, "grad_norm": 2.7062480449676514, "learning_rate": 3.970053475935829e-06, "loss": 0.08417996764183044, "num_input_tokens_seen": 3866970, "step": 3753, "train_runtime": 9164.4497, "train_tokens_per_second": 421.953 }, { "epoch": 1.6043380703066568, "grad_norm": 2.8350048065185547, "learning_rate": 3.96577540106952e-06, "loss": 0.1121244728565216, "num_input_tokens_seen": 3867962, "step": 3754, "train_runtime": 9166.6119, "train_tokens_per_second": 421.962 }, { "epoch": 1.6047654663959825, "grad_norm": 2.6301677227020264, "learning_rate": 3.961497326203209e-06, "loss": 0.10396680235862732, "num_input_tokens_seen": 3869128, "step": 3755, "train_runtime": 9168.7954, "train_tokens_per_second": 421.989 }, { "epoch": 1.6051928624853082, "grad_norm": 1.734845757484436, "learning_rate": 3.957219251336899e-06, "loss": 0.05011291056871414, "num_input_tokens_seen": 3870210, "step": 3756, "train_runtime": 9170.9345, "train_tokens_per_second": 422.008 }, { "epoch": 1.6056202585746342, "grad_norm": 2.648728847503662, "learning_rate": 3.952941176470588e-06, "loss": 0.06750747561454773, "num_input_tokens_seen": 3871488, "step": 3757, "train_runtime": 9173.104, "train_tokens_per_second": 422.048 }, { "epoch": 1.6060476546639597, "grad_norm": 3.227602243423462, "learning_rate": 3.948663101604278e-06, "loss": 0.11042815446853638, "num_input_tokens_seen": 3872288, "step": 3758, "train_runtime": 9175.1457, "train_tokens_per_second": 422.041 }, { "epoch": 1.6064750507532857, "grad_norm": 2.364561080932617, "learning_rate": 3.944385026737968e-06, "loss": 0.09016823768615723, "num_input_tokens_seen": 3873428, "step": 3759, "train_runtime": 9177.2862, "train_tokens_per_second": 422.067 }, { "epoch": 1.6069024468426114, "grad_norm": 2.5763111114501953, "learning_rate": 3.940106951871658e-06, "loss": 0.08186131715774536, "num_input_tokens_seen": 3874464, "step": 3760, "train_runtime": 9179.4236, "train_tokens_per_second": 422.081 }, { "epoch": 1.6073298429319371, "grad_norm": 2.8868651390075684, "learning_rate": 3.9358288770053474e-06, "loss": 0.08451898396015167, "num_input_tokens_seen": 3875212, "step": 3761, "train_runtime": 9181.4308, "train_tokens_per_second": 422.071 }, { "epoch": 1.607757239021263, "grad_norm": 1.959585189819336, "learning_rate": 3.931550802139038e-06, "loss": 0.052592284977436066, "num_input_tokens_seen": 3876400, "step": 3762, "train_runtime": 9183.6352, "train_tokens_per_second": 422.099 }, { "epoch": 1.6081846351105886, "grad_norm": 2.130774736404419, "learning_rate": 3.927272727272727e-06, "loss": 0.07161024212837219, "num_input_tokens_seen": 3877194, "step": 3763, "train_runtime": 9185.7425, "train_tokens_per_second": 422.088 }, { "epoch": 1.6086120311999146, "grad_norm": 3.273538827896118, "learning_rate": 3.9229946524064175e-06, "loss": 0.12302075326442719, "num_input_tokens_seen": 3878108, "step": 3764, "train_runtime": 9187.8694, "train_tokens_per_second": 422.09 }, { "epoch": 1.6090394272892403, "grad_norm": 2.040372848510742, "learning_rate": 3.918716577540107e-06, "loss": 0.06533894687891006, "num_input_tokens_seen": 3879234, "step": 3765, "train_runtime": 9190.0345, "train_tokens_per_second": 422.113 }, { "epoch": 1.609466823378566, "grad_norm": 1.4654204845428467, "learning_rate": 3.914438502673797e-06, "loss": 0.04753059893846512, "num_input_tokens_seen": 3880760, "step": 3766, "train_runtime": 9192.2409, "train_tokens_per_second": 422.178 }, { "epoch": 1.609894219467892, "grad_norm": 4.03511381149292, "learning_rate": 3.910160427807487e-06, "loss": 0.12839317321777344, "num_input_tokens_seen": 3881520, "step": 3767, "train_runtime": 9194.4097, "train_tokens_per_second": 422.161 }, { "epoch": 1.6103216155572175, "grad_norm": 2.9209985733032227, "learning_rate": 3.905882352941177e-06, "loss": 0.08649216592311859, "num_input_tokens_seen": 3882328, "step": 3768, "train_runtime": 9196.4816, "train_tokens_per_second": 422.154 }, { "epoch": 1.6107490116465435, "grad_norm": 2.055192708969116, "learning_rate": 3.901604278074866e-06, "loss": 0.054767996072769165, "num_input_tokens_seen": 3883454, "step": 3769, "train_runtime": 9198.6342, "train_tokens_per_second": 422.177 }, { "epoch": 1.6111764077358692, "grad_norm": 2.3946480751037598, "learning_rate": 3.897326203208557e-06, "loss": 0.0828293189406395, "num_input_tokens_seen": 3884428, "step": 3770, "train_runtime": 9200.7745, "train_tokens_per_second": 422.185 }, { "epoch": 1.611603803825195, "grad_norm": 3.2324209213256836, "learning_rate": 3.893048128342246e-06, "loss": 0.12190607190132141, "num_input_tokens_seen": 3885276, "step": 3771, "train_runtime": 9202.8031, "train_tokens_per_second": 422.184 }, { "epoch": 1.612031199914521, "grad_norm": 1.7467137575149536, "learning_rate": 3.8887700534759356e-06, "loss": 0.06836704909801483, "num_input_tokens_seen": 3886900, "step": 3772, "train_runtime": 9205.0265, "train_tokens_per_second": 422.258 }, { "epoch": 1.6124585960038464, "grad_norm": 2.7596757411956787, "learning_rate": 3.884491978609626e-06, "loss": 0.09314170479774475, "num_input_tokens_seen": 3887704, "step": 3773, "train_runtime": 9207.1557, "train_tokens_per_second": 422.248 }, { "epoch": 1.6128859920931724, "grad_norm": 2.2847583293914795, "learning_rate": 3.880213903743315e-06, "loss": 0.07095928490161896, "num_input_tokens_seen": 3888992, "step": 3774, "train_runtime": 9209.3902, "train_tokens_per_second": 422.286 }, { "epoch": 1.6133133881824981, "grad_norm": 4.996047019958496, "learning_rate": 3.875935828877006e-06, "loss": 0.09208285063505173, "num_input_tokens_seen": 3889556, "step": 3775, "train_runtime": 9211.341, "train_tokens_per_second": 422.257 }, { "epoch": 1.6137407842718239, "grad_norm": 2.8608434200286865, "learning_rate": 3.871657754010695e-06, "loss": 0.09016422182321548, "num_input_tokens_seen": 3890232, "step": 3776, "train_runtime": 9213.3581, "train_tokens_per_second": 422.238 }, { "epoch": 1.6141681803611498, "grad_norm": 2.8595383167266846, "learning_rate": 3.867379679144385e-06, "loss": 0.10831150412559509, "num_input_tokens_seen": 3891114, "step": 3777, "train_runtime": 9215.4275, "train_tokens_per_second": 422.239 }, { "epoch": 1.6145955764504754, "grad_norm": 2.205232620239258, "learning_rate": 3.863101604278075e-06, "loss": 0.078994981944561, "num_input_tokens_seen": 3892374, "step": 3778, "train_runtime": 9217.5667, "train_tokens_per_second": 422.278 }, { "epoch": 1.6150229725398013, "grad_norm": 3.1447365283966064, "learning_rate": 3.858823529411765e-06, "loss": 0.10400420427322388, "num_input_tokens_seen": 3893156, "step": 3779, "train_runtime": 9219.5824, "train_tokens_per_second": 422.27 }, { "epoch": 1.615450368629127, "grad_norm": 2.9837634563446045, "learning_rate": 3.8545454545454545e-06, "loss": 0.08216331899166107, "num_input_tokens_seen": 3893842, "step": 3780, "train_runtime": 9221.5822, "train_tokens_per_second": 422.253 }, { "epoch": 1.6158777647184528, "grad_norm": 3.201504707336426, "learning_rate": 3.850267379679145e-06, "loss": 0.12073357403278351, "num_input_tokens_seen": 3895158, "step": 3781, "train_runtime": 9230.5231, "train_tokens_per_second": 421.987 }, { "epoch": 1.6163051608077788, "grad_norm": 3.6015512943267822, "learning_rate": 3.845989304812834e-06, "loss": 0.17771466076374054, "num_input_tokens_seen": 3895982, "step": 3782, "train_runtime": 9232.5762, "train_tokens_per_second": 421.982 }, { "epoch": 1.6167325568971043, "grad_norm": 2.3061437606811523, "learning_rate": 3.8417112299465246e-06, "loss": 0.05693131685256958, "num_input_tokens_seen": 3897070, "step": 3783, "train_runtime": 9234.7581, "train_tokens_per_second": 422.0 }, { "epoch": 1.6171599529864302, "grad_norm": 2.9554741382598877, "learning_rate": 3.837433155080214e-06, "loss": 0.06877665221691132, "num_input_tokens_seen": 3897768, "step": 3784, "train_runtime": 9236.7563, "train_tokens_per_second": 421.985 }, { "epoch": 1.617587349075756, "grad_norm": 2.4159669876098633, "learning_rate": 3.833155080213904e-06, "loss": 0.061106663197278976, "num_input_tokens_seen": 3898448, "step": 3785, "train_runtime": 9238.7432, "train_tokens_per_second": 421.967 }, { "epoch": 1.6180147451650817, "grad_norm": 2.943751811981201, "learning_rate": 3.828877005347594e-06, "loss": 0.10160140693187714, "num_input_tokens_seen": 3899374, "step": 3786, "train_runtime": 9240.7927, "train_tokens_per_second": 421.974 }, { "epoch": 1.6184421412544077, "grad_norm": 7.840415000915527, "learning_rate": 3.824598930481284e-06, "loss": 0.09496290981769562, "num_input_tokens_seen": 3900192, "step": 3787, "train_runtime": 9242.8317, "train_tokens_per_second": 421.969 }, { "epoch": 1.6188695373437332, "grad_norm": 2.1866769790649414, "learning_rate": 3.8203208556149735e-06, "loss": 0.07331788539886475, "num_input_tokens_seen": 3901284, "step": 3788, "train_runtime": 9244.9524, "train_tokens_per_second": 421.991 }, { "epoch": 1.6192969334330591, "grad_norm": 1.3312314748764038, "learning_rate": 3.816042780748663e-06, "loss": 0.03846209868788719, "num_input_tokens_seen": 3902938, "step": 3789, "train_runtime": 9247.207, "train_tokens_per_second": 422.067 }, { "epoch": 1.6197243295223849, "grad_norm": 2.169729709625244, "learning_rate": 3.8117647058823532e-06, "loss": 0.06322111934423447, "num_input_tokens_seen": 3904240, "step": 3790, "train_runtime": 9249.36, "train_tokens_per_second": 422.109 }, { "epoch": 1.6201517256117106, "grad_norm": 3.729789972305298, "learning_rate": 3.807486631016043e-06, "loss": 0.11125414073467255, "num_input_tokens_seen": 3905256, "step": 3791, "train_runtime": 9251.4417, "train_tokens_per_second": 422.124 }, { "epoch": 1.6205791217010366, "grad_norm": 2.740403652191162, "learning_rate": 3.803208556149733e-06, "loss": 0.07378280907869339, "num_input_tokens_seen": 3906224, "step": 3792, "train_runtime": 9253.5522, "train_tokens_per_second": 422.132 }, { "epoch": 1.621006517790362, "grad_norm": 2.981154680252075, "learning_rate": 3.798930481283423e-06, "loss": 0.0933285653591156, "num_input_tokens_seen": 3907026, "step": 3793, "train_runtime": 9255.6233, "train_tokens_per_second": 422.125 }, { "epoch": 1.621433913879688, "grad_norm": 3.3326971530914307, "learning_rate": 3.7946524064171127e-06, "loss": 0.0761868953704834, "num_input_tokens_seen": 3907864, "step": 3794, "train_runtime": 9257.6446, "train_tokens_per_second": 422.123 }, { "epoch": 1.6218613099690138, "grad_norm": 2.3957982063293457, "learning_rate": 3.7903743315508026e-06, "loss": 0.08792637288570404, "num_input_tokens_seen": 3908778, "step": 3795, "train_runtime": 9259.7343, "train_tokens_per_second": 422.126 }, { "epoch": 1.6222887060583395, "grad_norm": 2.007890462875366, "learning_rate": 3.786096256684492e-06, "loss": 0.047754231840372086, "num_input_tokens_seen": 3909858, "step": 3796, "train_runtime": 9261.826, "train_tokens_per_second": 422.148 }, { "epoch": 1.6227161021476655, "grad_norm": 2.265428066253662, "learning_rate": 3.781818181818182e-06, "loss": 0.09990980476140976, "num_input_tokens_seen": 3911210, "step": 3797, "train_runtime": 9263.9918, "train_tokens_per_second": 422.195 }, { "epoch": 1.623143498236991, "grad_norm": 3.427783727645874, "learning_rate": 3.7775401069518717e-06, "loss": 0.08219851553440094, "num_input_tokens_seen": 3912022, "step": 3798, "train_runtime": 9266.0385, "train_tokens_per_second": 422.189 }, { "epoch": 1.623570894326317, "grad_norm": 2.6531877517700195, "learning_rate": 3.7732620320855616e-06, "loss": 0.08049793541431427, "num_input_tokens_seen": 3912882, "step": 3799, "train_runtime": 9268.1143, "train_tokens_per_second": 422.188 }, { "epoch": 1.6239982904156427, "grad_norm": 2.0714240074157715, "learning_rate": 3.7689839572192515e-06, "loss": 0.05675522983074188, "num_input_tokens_seen": 3913696, "step": 3800, "train_runtime": 9270.1768, "train_tokens_per_second": 422.181 }, { "epoch": 1.6244256865049684, "grad_norm": 4.28741979598999, "learning_rate": 3.7647058823529414e-06, "loss": 0.1655556857585907, "num_input_tokens_seen": 3914330, "step": 3801, "train_runtime": 9272.1305, "train_tokens_per_second": 422.161 }, { "epoch": 1.6248530825942944, "grad_norm": 2.941786527633667, "learning_rate": 3.7604278074866312e-06, "loss": 0.11906811594963074, "num_input_tokens_seen": 3915224, "step": 3802, "train_runtime": 9274.1983, "train_tokens_per_second": 422.163 }, { "epoch": 1.62528047868362, "grad_norm": 2.862887382507324, "learning_rate": 3.756149732620321e-06, "loss": 0.1298823058605194, "num_input_tokens_seen": 3916146, "step": 3803, "train_runtime": 9276.2965, "train_tokens_per_second": 422.167 }, { "epoch": 1.6257078747729459, "grad_norm": 2.588500499725342, "learning_rate": 3.751871657754011e-06, "loss": 0.08678627014160156, "num_input_tokens_seen": 3917484, "step": 3804, "train_runtime": 9278.5016, "train_tokens_per_second": 422.211 }, { "epoch": 1.6261352708622716, "grad_norm": 2.484102964401245, "learning_rate": 3.747593582887701e-06, "loss": 0.05286800488829613, "num_input_tokens_seen": 3918170, "step": 3805, "train_runtime": 9280.5288, "train_tokens_per_second": 422.193 }, { "epoch": 1.6265626669515973, "grad_norm": 2.187727212905884, "learning_rate": 3.7433155080213907e-06, "loss": 0.04978157579898834, "num_input_tokens_seen": 3919176, "step": 3806, "train_runtime": 9282.6062, "train_tokens_per_second": 422.206 }, { "epoch": 1.6269900630409233, "grad_norm": 2.7776381969451904, "learning_rate": 3.7390374331550806e-06, "loss": 0.11812900006771088, "num_input_tokens_seen": 3920398, "step": 3807, "train_runtime": 9284.7168, "train_tokens_per_second": 422.242 }, { "epoch": 1.6274174591302488, "grad_norm": 2.3930728435516357, "learning_rate": 3.7347593582887704e-06, "loss": 0.06416870653629303, "num_input_tokens_seen": 3921688, "step": 3808, "train_runtime": 9286.8595, "train_tokens_per_second": 422.284 }, { "epoch": 1.6278448552195748, "grad_norm": 2.4727258682250977, "learning_rate": 3.7304812834224603e-06, "loss": 0.07441408932209015, "num_input_tokens_seen": 3922974, "step": 3809, "train_runtime": 9289.0377, "train_tokens_per_second": 422.323 }, { "epoch": 1.6282722513089005, "grad_norm": 2.7147507667541504, "learning_rate": 3.72620320855615e-06, "loss": 0.09374475479125977, "num_input_tokens_seen": 3924210, "step": 3810, "train_runtime": 9291.154, "train_tokens_per_second": 422.36 }, { "epoch": 1.6286996473982263, "grad_norm": 1.9957373142242432, "learning_rate": 3.72192513368984e-06, "loss": 0.07390939444303513, "num_input_tokens_seen": 3925420, "step": 3811, "train_runtime": 9299.9155, "train_tokens_per_second": 422.092 }, { "epoch": 1.6291270434875522, "grad_norm": 2.818439483642578, "learning_rate": 3.71764705882353e-06, "loss": 0.11875130981206894, "num_input_tokens_seen": 3926212, "step": 3812, "train_runtime": 9302.1506, "train_tokens_per_second": 422.076 }, { "epoch": 1.6295544395768777, "grad_norm": 3.648037910461426, "learning_rate": 3.7133689839572194e-06, "loss": 0.07872645556926727, "num_input_tokens_seen": 3926954, "step": 3813, "train_runtime": 9304.2217, "train_tokens_per_second": 422.062 }, { "epoch": 1.6299818356662037, "grad_norm": 2.7222659587860107, "learning_rate": 3.7090909090909092e-06, "loss": 0.09119494259357452, "num_input_tokens_seen": 3928138, "step": 3814, "train_runtime": 9306.3209, "train_tokens_per_second": 422.094 }, { "epoch": 1.6304092317555294, "grad_norm": 3.381635904312134, "learning_rate": 3.704812834224599e-06, "loss": 0.10700887441635132, "num_input_tokens_seen": 3928964, "step": 3815, "train_runtime": 9308.3676, "train_tokens_per_second": 422.089 }, { "epoch": 1.6308366278448552, "grad_norm": 2.8057944774627686, "learning_rate": 3.700534759358289e-06, "loss": 0.07540324330329895, "num_input_tokens_seen": 3929570, "step": 3816, "train_runtime": 9310.4234, "train_tokens_per_second": 422.061 }, { "epoch": 1.6312640239341811, "grad_norm": 2.2457990646362305, "learning_rate": 3.696256684491979e-06, "loss": 0.05795879662036896, "num_input_tokens_seen": 3930356, "step": 3817, "train_runtime": 9312.4598, "train_tokens_per_second": 422.053 }, { "epoch": 1.6316914200235066, "grad_norm": 2.695540428161621, "learning_rate": 3.6919786096256687e-06, "loss": 0.0756165012717247, "num_input_tokens_seen": 3931126, "step": 3818, "train_runtime": 9314.5677, "train_tokens_per_second": 422.041 }, { "epoch": 1.6321188161128326, "grad_norm": 1.3752598762512207, "learning_rate": 3.6877005347593586e-06, "loss": 0.03707321360707283, "num_input_tokens_seen": 3932444, "step": 3819, "train_runtime": 9316.7983, "train_tokens_per_second": 422.081 }, { "epoch": 1.6325462122021583, "grad_norm": 3.4551901817321777, "learning_rate": 3.6834224598930484e-06, "loss": 0.08787956088781357, "num_input_tokens_seen": 3933232, "step": 3820, "train_runtime": 9318.8443, "train_tokens_per_second": 422.073 }, { "epoch": 1.632973608291484, "grad_norm": 2.727776527404785, "learning_rate": 3.6791443850267383e-06, "loss": 0.06859318912029266, "num_input_tokens_seen": 3934056, "step": 3821, "train_runtime": 9320.9431, "train_tokens_per_second": 422.066 }, { "epoch": 1.63340100438081, "grad_norm": 2.485582113265991, "learning_rate": 3.674866310160428e-06, "loss": 0.037512075155973434, "num_input_tokens_seen": 3935558, "step": 3822, "train_runtime": 9323.1473, "train_tokens_per_second": 422.128 }, { "epoch": 1.6338284004701356, "grad_norm": 1.8260453939437866, "learning_rate": 3.670588235294118e-06, "loss": 0.050654858350753784, "num_input_tokens_seen": 3936478, "step": 3823, "train_runtime": 9325.231, "train_tokens_per_second": 422.132 }, { "epoch": 1.6342557965594615, "grad_norm": 2.0404367446899414, "learning_rate": 3.666310160427808e-06, "loss": 0.05600399896502495, "num_input_tokens_seen": 3937860, "step": 3824, "train_runtime": 9327.4199, "train_tokens_per_second": 422.181 }, { "epoch": 1.6346831926487873, "grad_norm": 2.534850597381592, "learning_rate": 3.662032085561498e-06, "loss": 0.06724943220615387, "num_input_tokens_seen": 3938830, "step": 3825, "train_runtime": 9329.5297, "train_tokens_per_second": 422.19 }, { "epoch": 1.635110588738113, "grad_norm": 2.302006483078003, "learning_rate": 3.6577540106951877e-06, "loss": 0.06737169623374939, "num_input_tokens_seen": 3939720, "step": 3826, "train_runtime": 9331.594, "train_tokens_per_second": 422.192 }, { "epoch": 1.635537984827439, "grad_norm": 3.1940219402313232, "learning_rate": 3.6534759358288775e-06, "loss": 0.1040285974740982, "num_input_tokens_seen": 3940486, "step": 3827, "train_runtime": 9333.6203, "train_tokens_per_second": 422.182 }, { "epoch": 1.6359653809167645, "grad_norm": 2.526012420654297, "learning_rate": 3.6491978609625674e-06, "loss": 0.07651612162590027, "num_input_tokens_seen": 3941660, "step": 3828, "train_runtime": 9335.7398, "train_tokens_per_second": 422.212 }, { "epoch": 1.6363927770060904, "grad_norm": 2.366029977798462, "learning_rate": 3.6449197860962573e-06, "loss": 0.0706888735294342, "num_input_tokens_seen": 3943052, "step": 3829, "train_runtime": 9337.8894, "train_tokens_per_second": 422.264 }, { "epoch": 1.6368201730954162, "grad_norm": 2.3156192302703857, "learning_rate": 3.6406417112299467e-06, "loss": 0.0577034093439579, "num_input_tokens_seen": 3943916, "step": 3830, "train_runtime": 9339.9091, "train_tokens_per_second": 422.265 }, { "epoch": 1.637247569184742, "grad_norm": 2.212792158126831, "learning_rate": 3.6363636363636366e-06, "loss": 0.08519941568374634, "num_input_tokens_seen": 3945110, "step": 3831, "train_runtime": 9342.1525, "train_tokens_per_second": 422.291 }, { "epoch": 1.6376749652740679, "grad_norm": 2.078310966491699, "learning_rate": 3.6320855614973265e-06, "loss": 0.06478863209486008, "num_input_tokens_seen": 3946710, "step": 3832, "train_runtime": 9344.3677, "train_tokens_per_second": 422.362 }, { "epoch": 1.6381023613633934, "grad_norm": 2.1961634159088135, "learning_rate": 3.6278074866310163e-06, "loss": 0.06385508924722672, "num_input_tokens_seen": 3947828, "step": 3833, "train_runtime": 9346.5086, "train_tokens_per_second": 422.385 }, { "epoch": 1.6385297574527193, "grad_norm": 2.614858627319336, "learning_rate": 3.623529411764706e-06, "loss": 0.0813913345336914, "num_input_tokens_seen": 3948988, "step": 3834, "train_runtime": 9348.6265, "train_tokens_per_second": 422.414 }, { "epoch": 1.638957153542045, "grad_norm": 2.4961130619049072, "learning_rate": 3.619251336898396e-06, "loss": 0.10427355766296387, "num_input_tokens_seen": 3950054, "step": 3835, "train_runtime": 9350.7429, "train_tokens_per_second": 422.432 }, { "epoch": 1.6393845496313708, "grad_norm": 2.771165609359741, "learning_rate": 3.614973262032086e-06, "loss": 0.09379483759403229, "num_input_tokens_seen": 3951030, "step": 3836, "train_runtime": 9352.8233, "train_tokens_per_second": 422.442 }, { "epoch": 1.6398119457206968, "grad_norm": 3.9687018394470215, "learning_rate": 3.610695187165776e-06, "loss": 0.1353222280740738, "num_input_tokens_seen": 3951794, "step": 3837, "train_runtime": 9354.9149, "train_tokens_per_second": 422.43 }, { "epoch": 1.6402393418100223, "grad_norm": 2.26641845703125, "learning_rate": 3.6064171122994657e-06, "loss": 0.1118968054652214, "num_input_tokens_seen": 3953628, "step": 3838, "train_runtime": 9357.1466, "train_tokens_per_second": 422.525 }, { "epoch": 1.6406667378993482, "grad_norm": 2.1277108192443848, "learning_rate": 3.6021390374331555e-06, "loss": 0.07533089816570282, "num_input_tokens_seen": 3954764, "step": 3839, "train_runtime": 9359.2582, "train_tokens_per_second": 422.551 }, { "epoch": 1.641094133988674, "grad_norm": 2.857541799545288, "learning_rate": 3.5978609625668454e-06, "loss": 0.06564372032880783, "num_input_tokens_seen": 3955520, "step": 3840, "train_runtime": 9361.3426, "train_tokens_per_second": 422.538 }, { "epoch": 1.6415215300779997, "grad_norm": 3.0206141471862793, "learning_rate": 3.5935828877005353e-06, "loss": 0.06101146712899208, "num_input_tokens_seen": 3956468, "step": 3841, "train_runtime": 9369.7666, "train_tokens_per_second": 422.259 }, { "epoch": 1.6419489261673257, "grad_norm": 2.0980420112609863, "learning_rate": 3.589304812834225e-06, "loss": 0.06332190334796906, "num_input_tokens_seen": 3957428, "step": 3842, "train_runtime": 9372.0176, "train_tokens_per_second": 422.26 }, { "epoch": 1.6423763222566512, "grad_norm": 2.499056816101074, "learning_rate": 3.585026737967915e-06, "loss": 0.0762253999710083, "num_input_tokens_seen": 3958224, "step": 3843, "train_runtime": 9374.0415, "train_tokens_per_second": 422.254 }, { "epoch": 1.6428037183459772, "grad_norm": 2.2681729793548584, "learning_rate": 3.580748663101605e-06, "loss": 0.09278064966201782, "num_input_tokens_seen": 3959436, "step": 3844, "train_runtime": 9376.1714, "train_tokens_per_second": 422.287 }, { "epoch": 1.643231114435303, "grad_norm": 2.438596248626709, "learning_rate": 3.5764705882352948e-06, "loss": 0.0931018516421318, "num_input_tokens_seen": 3960980, "step": 3845, "train_runtime": 9378.3748, "train_tokens_per_second": 422.352 }, { "epoch": 1.6436585105246286, "grad_norm": 3.4079055786132812, "learning_rate": 3.5721925133689846e-06, "loss": 0.07901705801486969, "num_input_tokens_seen": 3961616, "step": 3846, "train_runtime": 9380.3306, "train_tokens_per_second": 422.332 }, { "epoch": 1.6440859066139546, "grad_norm": 3.087803840637207, "learning_rate": 3.567914438502674e-06, "loss": 0.08285107463598251, "num_input_tokens_seen": 3962210, "step": 3847, "train_runtime": 9382.3689, "train_tokens_per_second": 422.304 }, { "epoch": 1.64451330270328, "grad_norm": 5.08903694152832, "learning_rate": 3.563636363636364e-06, "loss": 0.19842743873596191, "num_input_tokens_seen": 3962874, "step": 3848, "train_runtime": 9384.3722, "train_tokens_per_second": 422.284 }, { "epoch": 1.644940698792606, "grad_norm": 2.4564247131347656, "learning_rate": 3.559358288770054e-06, "loss": 0.08586368709802628, "num_input_tokens_seen": 3964076, "step": 3849, "train_runtime": 9386.5119, "train_tokens_per_second": 422.316 }, { "epoch": 1.6453680948819318, "grad_norm": 2.7422685623168945, "learning_rate": 3.5550802139037437e-06, "loss": 0.08317172527313232, "num_input_tokens_seen": 3964994, "step": 3850, "train_runtime": 9388.5794, "train_tokens_per_second": 422.321 }, { "epoch": 1.6457954909712575, "grad_norm": 3.1364614963531494, "learning_rate": 3.5508021390374335e-06, "loss": 0.0996050089597702, "num_input_tokens_seen": 3965706, "step": 3851, "train_runtime": 9390.6329, "train_tokens_per_second": 422.304 }, { "epoch": 1.6462228870605835, "grad_norm": 3.0305800437927246, "learning_rate": 3.5465240641711234e-06, "loss": 0.09627687186002731, "num_input_tokens_seen": 3966730, "step": 3852, "train_runtime": 9392.7439, "train_tokens_per_second": 422.319 }, { "epoch": 1.646650283149909, "grad_norm": 6.179396152496338, "learning_rate": 3.5422459893048133e-06, "loss": 0.1773504763841629, "num_input_tokens_seen": 3967484, "step": 3853, "train_runtime": 9394.8014, "train_tokens_per_second": 422.306 }, { "epoch": 1.647077679239235, "grad_norm": 2.3203563690185547, "learning_rate": 3.537967914438503e-06, "loss": 0.06952811032533646, "num_input_tokens_seen": 3968286, "step": 3854, "train_runtime": 9396.8495, "train_tokens_per_second": 422.3 }, { "epoch": 1.6475050753285607, "grad_norm": 1.3361934423446655, "learning_rate": 3.533689839572193e-06, "loss": 0.040817659348249435, "num_input_tokens_seen": 3969460, "step": 3855, "train_runtime": 9399.0104, "train_tokens_per_second": 422.327 }, { "epoch": 1.6479324714178865, "grad_norm": 3.130977153778076, "learning_rate": 3.529411764705883e-06, "loss": 0.10362480580806732, "num_input_tokens_seen": 3970320, "step": 3856, "train_runtime": 9401.0974, "train_tokens_per_second": 422.325 }, { "epoch": 1.6483598675072124, "grad_norm": 3.7352306842803955, "learning_rate": 3.5251336898395728e-06, "loss": 0.09946735203266144, "num_input_tokens_seen": 3971452, "step": 3857, "train_runtime": 9403.2532, "train_tokens_per_second": 422.349 }, { "epoch": 1.648787263596538, "grad_norm": 3.034006357192993, "learning_rate": 3.5208556149732626e-06, "loss": 0.08022941648960114, "num_input_tokens_seen": 3972478, "step": 3858, "train_runtime": 9405.3417, "train_tokens_per_second": 422.364 }, { "epoch": 1.649214659685864, "grad_norm": 1.989176869392395, "learning_rate": 3.5165775401069525e-06, "loss": 0.061091914772987366, "num_input_tokens_seen": 3974132, "step": 3859, "train_runtime": 9407.5469, "train_tokens_per_second": 422.441 }, { "epoch": 1.6496420557751896, "grad_norm": 1.645033359527588, "learning_rate": 3.5122994652406424e-06, "loss": 0.06796301901340485, "num_input_tokens_seen": 3976418, "step": 3860, "train_runtime": 9409.9224, "train_tokens_per_second": 422.577 }, { "epoch": 1.6500694518645154, "grad_norm": 2.3346548080444336, "learning_rate": 3.5080213903743322e-06, "loss": 0.08713055402040482, "num_input_tokens_seen": 3977504, "step": 3861, "train_runtime": 9412.0056, "train_tokens_per_second": 422.599 }, { "epoch": 1.6504968479538413, "grad_norm": 2.195277214050293, "learning_rate": 3.503743315508022e-06, "loss": 0.08690610527992249, "num_input_tokens_seen": 3978616, "step": 3862, "train_runtime": 9414.1236, "train_tokens_per_second": 422.622 }, { "epoch": 1.6509242440431668, "grad_norm": 3.190110921859741, "learning_rate": 3.499465240641712e-06, "loss": 0.11969200521707535, "num_input_tokens_seen": 3980158, "step": 3863, "train_runtime": 9416.3379, "train_tokens_per_second": 422.686 }, { "epoch": 1.6513516401324928, "grad_norm": 1.7407569885253906, "learning_rate": 3.4951871657754014e-06, "loss": 0.047627974301576614, "num_input_tokens_seen": 3981222, "step": 3864, "train_runtime": 9418.4499, "train_tokens_per_second": 422.705 }, { "epoch": 1.6517790362218185, "grad_norm": 2.4229302406311035, "learning_rate": 3.4909090909090913e-06, "loss": 0.08861653506755829, "num_input_tokens_seen": 3982374, "step": 3865, "train_runtime": 9420.6102, "train_tokens_per_second": 422.73 }, { "epoch": 1.6522064323111443, "grad_norm": 3.022742748260498, "learning_rate": 3.4866310160427807e-06, "loss": 0.047502826899290085, "num_input_tokens_seen": 3983082, "step": 3866, "train_runtime": 9422.5942, "train_tokens_per_second": 422.716 }, { "epoch": 1.6526338284004702, "grad_norm": 2.184997320175171, "learning_rate": 3.4823529411764706e-06, "loss": 0.060119304805994034, "num_input_tokens_seen": 3983902, "step": 3867, "train_runtime": 9424.6176, "train_tokens_per_second": 422.712 }, { "epoch": 1.6530612244897958, "grad_norm": 2.841846466064453, "learning_rate": 3.4780748663101605e-06, "loss": 0.10163979232311249, "num_input_tokens_seen": 3984910, "step": 3868, "train_runtime": 9426.6969, "train_tokens_per_second": 422.726 }, { "epoch": 1.6534886205791217, "grad_norm": 2.3429675102233887, "learning_rate": 3.4737967914438503e-06, "loss": 0.08151362091302872, "num_input_tokens_seen": 3985990, "step": 3869, "train_runtime": 9428.8232, "train_tokens_per_second": 422.745 }, { "epoch": 1.6539160166684475, "grad_norm": 2.0391833782196045, "learning_rate": 3.4695187165775402e-06, "loss": 0.057615701109170914, "num_input_tokens_seen": 3986918, "step": 3870, "train_runtime": 9430.9021, "train_tokens_per_second": 422.75 }, { "epoch": 1.6543434127577732, "grad_norm": 5.234706401824951, "learning_rate": 3.46524064171123e-06, "loss": 0.1124400794506073, "num_input_tokens_seen": 3987850, "step": 3871, "train_runtime": 9439.2646, "train_tokens_per_second": 422.475 }, { "epoch": 1.6547708088470992, "grad_norm": 2.6989946365356445, "learning_rate": 3.46096256684492e-06, "loss": 0.07818295806646347, "num_input_tokens_seen": 3988636, "step": 3872, "train_runtime": 9441.5559, "train_tokens_per_second": 422.455 }, { "epoch": 1.6551982049364247, "grad_norm": 2.322971820831299, "learning_rate": 3.45668449197861e-06, "loss": 0.11293534934520721, "num_input_tokens_seen": 3989990, "step": 3873, "train_runtime": 9443.7434, "train_tokens_per_second": 422.501 }, { "epoch": 1.6556256010257506, "grad_norm": 2.0886080265045166, "learning_rate": 3.4524064171122997e-06, "loss": 0.08082932233810425, "num_input_tokens_seen": 3991730, "step": 3874, "train_runtime": 9445.9753, "train_tokens_per_second": 422.585 }, { "epoch": 1.6560529971150764, "grad_norm": 2.9542224407196045, "learning_rate": 3.4481283422459896e-06, "loss": 0.08495029807090759, "num_input_tokens_seen": 3992506, "step": 3875, "train_runtime": 9447.9935, "train_tokens_per_second": 422.577 }, { "epoch": 1.656480393204402, "grad_norm": 3.852024793624878, "learning_rate": 3.443850267379679e-06, "loss": 0.22289283573627472, "num_input_tokens_seen": 3993852, "step": 3876, "train_runtime": 9450.1436, "train_tokens_per_second": 422.623 }, { "epoch": 1.656907789293728, "grad_norm": 3.585113525390625, "learning_rate": 3.439572192513369e-06, "loss": 0.08865998685359955, "num_input_tokens_seen": 3994440, "step": 3877, "train_runtime": 9452.1129, "train_tokens_per_second": 422.598 }, { "epoch": 1.6573351853830538, "grad_norm": 1.6091406345367432, "learning_rate": 3.4352941176470587e-06, "loss": 0.04141169413924217, "num_input_tokens_seen": 3995628, "step": 3878, "train_runtime": 9454.2378, "train_tokens_per_second": 422.628 }, { "epoch": 1.6577625814723795, "grad_norm": 2.2071664333343506, "learning_rate": 3.4310160427807486e-06, "loss": 0.08118504285812378, "num_input_tokens_seen": 3996608, "step": 3879, "train_runtime": 9456.2928, "train_tokens_per_second": 422.64 }, { "epoch": 1.6581899775617053, "grad_norm": 1.9391080141067505, "learning_rate": 3.4267379679144385e-06, "loss": 0.06162365898489952, "num_input_tokens_seen": 3997976, "step": 3880, "train_runtime": 9458.4804, "train_tokens_per_second": 422.687 }, { "epoch": 1.658617373651031, "grad_norm": 2.198991060256958, "learning_rate": 3.4224598930481284e-06, "loss": 0.060698941349983215, "num_input_tokens_seen": 3998876, "step": 3881, "train_runtime": 9460.5308, "train_tokens_per_second": 422.69 }, { "epoch": 1.659044769740357, "grad_norm": 2.4187495708465576, "learning_rate": 3.4181818181818182e-06, "loss": 0.09793850034475327, "num_input_tokens_seen": 3999920, "step": 3882, "train_runtime": 9462.5981, "train_tokens_per_second": 422.708 }, { "epoch": 1.6594721658296827, "grad_norm": 2.856333017349243, "learning_rate": 3.413903743315508e-06, "loss": 0.10958988219499588, "num_input_tokens_seen": 4000978, "step": 3883, "train_runtime": 9464.7062, "train_tokens_per_second": 422.726 }, { "epoch": 1.6598995619190084, "grad_norm": 2.926781177520752, "learning_rate": 3.409625668449198e-06, "loss": 0.07951489090919495, "num_input_tokens_seen": 4001788, "step": 3884, "train_runtime": 9466.7278, "train_tokens_per_second": 422.721 }, { "epoch": 1.6603269580083342, "grad_norm": 3.138127326965332, "learning_rate": 3.405347593582888e-06, "loss": 0.08947142958641052, "num_input_tokens_seen": 4002938, "step": 3885, "train_runtime": 9468.8485, "train_tokens_per_second": 422.748 }, { "epoch": 1.66075435409766, "grad_norm": 2.6909360885620117, "learning_rate": 3.4010695187165777e-06, "loss": 0.05339973419904709, "num_input_tokens_seen": 4003722, "step": 3886, "train_runtime": 9470.857, "train_tokens_per_second": 422.741 }, { "epoch": 1.6611817501869859, "grad_norm": 2.3834474086761475, "learning_rate": 3.3967914438502676e-06, "loss": 0.07068030536174774, "num_input_tokens_seen": 4004650, "step": 3887, "train_runtime": 9472.9129, "train_tokens_per_second": 422.747 }, { "epoch": 1.6616091462763116, "grad_norm": 3.6201040744781494, "learning_rate": 3.3925133689839574e-06, "loss": 0.09548976272344589, "num_input_tokens_seen": 4005424, "step": 3888, "train_runtime": 9474.9266, "train_tokens_per_second": 422.739 }, { "epoch": 1.6620365423656374, "grad_norm": 1.813190221786499, "learning_rate": 3.3882352941176473e-06, "loss": 0.07808499783277512, "num_input_tokens_seen": 4007066, "step": 3889, "train_runtime": 9477.132, "train_tokens_per_second": 422.814 }, { "epoch": 1.662463938454963, "grad_norm": 2.406506061553955, "learning_rate": 3.383957219251337e-06, "loss": 0.08500394970178604, "num_input_tokens_seen": 4008118, "step": 3890, "train_runtime": 9479.213, "train_tokens_per_second": 422.832 }, { "epoch": 1.6628913345442888, "grad_norm": 2.3753819465637207, "learning_rate": 3.379679144385027e-06, "loss": 0.09549464285373688, "num_input_tokens_seen": 4009344, "step": 3891, "train_runtime": 9481.3281, "train_tokens_per_second": 422.867 }, { "epoch": 1.6633187306336148, "grad_norm": 2.403844118118286, "learning_rate": 3.375401069518717e-06, "loss": 0.09369378536939621, "num_input_tokens_seen": 4010440, "step": 3892, "train_runtime": 9483.4402, "train_tokens_per_second": 422.889 }, { "epoch": 1.6637461267229405, "grad_norm": 2.5501019954681396, "learning_rate": 3.3711229946524064e-06, "loss": 0.09688855707645416, "num_input_tokens_seen": 4011538, "step": 3893, "train_runtime": 9485.5187, "train_tokens_per_second": 422.912 }, { "epoch": 1.6641735228122663, "grad_norm": 2.1859939098358154, "learning_rate": 3.3668449197860962e-06, "loss": 0.07070517539978027, "num_input_tokens_seen": 4012526, "step": 3894, "train_runtime": 9487.5658, "train_tokens_per_second": 422.925 }, { "epoch": 1.664600918901592, "grad_norm": 2.451632261276245, "learning_rate": 3.362566844919786e-06, "loss": 0.0956571102142334, "num_input_tokens_seen": 4013830, "step": 3895, "train_runtime": 9489.701, "train_tokens_per_second": 422.967 }, { "epoch": 1.6650283149909177, "grad_norm": 2.183400869369507, "learning_rate": 3.358288770053476e-06, "loss": 0.04365847259759903, "num_input_tokens_seen": 4014632, "step": 3896, "train_runtime": 9491.7222, "train_tokens_per_second": 422.961 }, { "epoch": 1.6654557110802437, "grad_norm": 3.0625202655792236, "learning_rate": 3.354010695187166e-06, "loss": 0.0726744532585144, "num_input_tokens_seen": 4015684, "step": 3897, "train_runtime": 9493.7724, "train_tokens_per_second": 422.981 }, { "epoch": 1.6658831071695694, "grad_norm": 2.8540406227111816, "learning_rate": 3.3497326203208557e-06, "loss": 0.11057975888252258, "num_input_tokens_seen": 4016792, "step": 3898, "train_runtime": 9495.8371, "train_tokens_per_second": 423.006 }, { "epoch": 1.6663105032588952, "grad_norm": 2.8264729976654053, "learning_rate": 3.3454545454545456e-06, "loss": 0.08364143967628479, "num_input_tokens_seen": 4017808, "step": 3899, "train_runtime": 9497.8866, "train_tokens_per_second": 423.021 }, { "epoch": 1.666737899348221, "grad_norm": 3.502856969833374, "learning_rate": 3.3411764705882354e-06, "loss": 0.12757033109664917, "num_input_tokens_seen": 4018772, "step": 3900, "train_runtime": 9499.9886, "train_tokens_per_second": 423.029 }, { "epoch": 1.6671652954375467, "grad_norm": 3.1576054096221924, "learning_rate": 3.3368983957219253e-06, "loss": 0.11345172673463821, "num_input_tokens_seen": 4019542, "step": 3901, "train_runtime": 9508.2656, "train_tokens_per_second": 422.742 }, { "epoch": 1.6675926915268726, "grad_norm": 3.2169222831726074, "learning_rate": 3.332620320855615e-06, "loss": 0.13035550713539124, "num_input_tokens_seen": 4020464, "step": 3902, "train_runtime": 9510.4508, "train_tokens_per_second": 422.742 }, { "epoch": 1.6680200876161984, "grad_norm": 2.6613028049468994, "learning_rate": 3.328342245989305e-06, "loss": 0.1079365611076355, "num_input_tokens_seen": 4021362, "step": 3903, "train_runtime": 9512.5313, "train_tokens_per_second": 422.744 }, { "epoch": 1.668447483705524, "grad_norm": 4.194794178009033, "learning_rate": 3.324064171122995e-06, "loss": 0.10679323971271515, "num_input_tokens_seen": 4022122, "step": 3904, "train_runtime": 9514.5357, "train_tokens_per_second": 422.734 }, { "epoch": 1.6688748797948498, "grad_norm": 2.76346492767334, "learning_rate": 3.3197860962566848e-06, "loss": 0.0850372239947319, "num_input_tokens_seen": 4023172, "step": 3905, "train_runtime": 9516.6246, "train_tokens_per_second": 422.752 }, { "epoch": 1.6693022758841756, "grad_norm": 3.2526650428771973, "learning_rate": 3.3155080213903747e-06, "loss": 0.10961224138736725, "num_input_tokens_seen": 4024086, "step": 3906, "train_runtime": 9518.6463, "train_tokens_per_second": 422.758 }, { "epoch": 1.6697296719735015, "grad_norm": 2.1977479457855225, "learning_rate": 3.3112299465240645e-06, "loss": 0.08637858927249908, "num_input_tokens_seen": 4025244, "step": 3907, "train_runtime": 9520.7575, "train_tokens_per_second": 422.786 }, { "epoch": 1.6701570680628273, "grad_norm": 2.0698485374450684, "learning_rate": 3.3069518716577544e-06, "loss": 0.07969550043344498, "num_input_tokens_seen": 4026348, "step": 3908, "train_runtime": 9522.8813, "train_tokens_per_second": 422.808 }, { "epoch": 1.670584464152153, "grad_norm": 1.8329750299453735, "learning_rate": 3.3026737967914443e-06, "loss": 0.06806891411542892, "num_input_tokens_seen": 4027878, "step": 3909, "train_runtime": 9525.0916, "train_tokens_per_second": 422.87 }, { "epoch": 1.6710118602414787, "grad_norm": 4.586109638214111, "learning_rate": 3.2983957219251337e-06, "loss": 0.10857181251049042, "num_input_tokens_seen": 4028804, "step": 3910, "train_runtime": 9527.1473, "train_tokens_per_second": 422.876 }, { "epoch": 1.6714392563308045, "grad_norm": 3.550147533416748, "learning_rate": 3.2941176470588236e-06, "loss": 0.06560402363538742, "num_input_tokens_seen": 4029564, "step": 3911, "train_runtime": 9529.1975, "train_tokens_per_second": 422.865 }, { "epoch": 1.6718666524201304, "grad_norm": 2.4432454109191895, "learning_rate": 3.2898395721925134e-06, "loss": 0.08360602706670761, "num_input_tokens_seen": 4030592, "step": 3912, "train_runtime": 9531.3195, "train_tokens_per_second": 422.879 }, { "epoch": 1.6722940485094562, "grad_norm": 3.205657482147217, "learning_rate": 3.2855614973262033e-06, "loss": 0.08480235189199448, "num_input_tokens_seen": 4031420, "step": 3913, "train_runtime": 9533.3925, "train_tokens_per_second": 422.874 }, { "epoch": 1.672721444598782, "grad_norm": 2.0331385135650635, "learning_rate": 3.281283422459893e-06, "loss": 0.06084195151925087, "num_input_tokens_seen": 4032730, "step": 3914, "train_runtime": 9535.5692, "train_tokens_per_second": 422.914 }, { "epoch": 1.6731488406881077, "grad_norm": 2.2410805225372314, "learning_rate": 3.277005347593583e-06, "loss": 0.050346631556749344, "num_input_tokens_seen": 4033404, "step": 3915, "train_runtime": 9537.5651, "train_tokens_per_second": 422.897 }, { "epoch": 1.6735762367774334, "grad_norm": 3.286407947540283, "learning_rate": 3.272727272727273e-06, "loss": 0.10637320578098297, "num_input_tokens_seen": 4034256, "step": 3916, "train_runtime": 9539.609, "train_tokens_per_second": 422.895 }, { "epoch": 1.6740036328667594, "grad_norm": 2.611971139907837, "learning_rate": 3.268449197860963e-06, "loss": 0.0768347978591919, "num_input_tokens_seen": 4035476, "step": 3917, "train_runtime": 9541.717, "train_tokens_per_second": 422.93 }, { "epoch": 1.674431028956085, "grad_norm": 3.220508098602295, "learning_rate": 3.2641711229946527e-06, "loss": 0.15087278187274933, "num_input_tokens_seen": 4036622, "step": 3918, "train_runtime": 9543.824, "train_tokens_per_second": 422.956 }, { "epoch": 1.6748584250454108, "grad_norm": 1.945664644241333, "learning_rate": 3.2598930481283425e-06, "loss": 0.0812452957034111, "num_input_tokens_seen": 4038000, "step": 3919, "train_runtime": 9545.9916, "train_tokens_per_second": 423.005 }, { "epoch": 1.6752858211347366, "grad_norm": 4.469132423400879, "learning_rate": 3.2556149732620324e-06, "loss": 0.08381488174200058, "num_input_tokens_seen": 4038942, "step": 3920, "train_runtime": 9548.0248, "train_tokens_per_second": 423.013 }, { "epoch": 1.6757132172240623, "grad_norm": 2.264404535293579, "learning_rate": 3.2513368983957223e-06, "loss": 0.0824776217341423, "num_input_tokens_seen": 4040338, "step": 3921, "train_runtime": 9550.2363, "train_tokens_per_second": 423.062 }, { "epoch": 1.6761406133133883, "grad_norm": 2.3763954639434814, "learning_rate": 3.247058823529412e-06, "loss": 0.07568852603435516, "num_input_tokens_seen": 4041320, "step": 3922, "train_runtime": 9552.3108, "train_tokens_per_second": 423.073 }, { "epoch": 1.676568009402714, "grad_norm": 3.5757901668548584, "learning_rate": 3.242780748663102e-06, "loss": 0.10268846154212952, "num_input_tokens_seen": 4042142, "step": 3923, "train_runtime": 9554.4141, "train_tokens_per_second": 423.065 }, { "epoch": 1.6769954054920397, "grad_norm": 2.101426362991333, "learning_rate": 3.238502673796792e-06, "loss": 0.07353068143129349, "num_input_tokens_seen": 4043096, "step": 3924, "train_runtime": 9556.4642, "train_tokens_per_second": 423.074 }, { "epoch": 1.6774228015813657, "grad_norm": 2.1029913425445557, "learning_rate": 3.2342245989304817e-06, "loss": 0.04573386535048485, "num_input_tokens_seen": 4043896, "step": 3925, "train_runtime": 9558.4895, "train_tokens_per_second": 423.069 }, { "epoch": 1.6778501976706912, "grad_norm": 2.0387256145477295, "learning_rate": 3.2299465240641716e-06, "loss": 0.08806627243757248, "num_input_tokens_seen": 4045420, "step": 3926, "train_runtime": 9560.7051, "train_tokens_per_second": 423.13 }, { "epoch": 1.6782775937600172, "grad_norm": 2.8606925010681152, "learning_rate": 3.225668449197861e-06, "loss": 0.08300386369228363, "num_input_tokens_seen": 4046308, "step": 3927, "train_runtime": 9562.7845, "train_tokens_per_second": 423.131 }, { "epoch": 1.678704989849343, "grad_norm": 3.4991629123687744, "learning_rate": 3.221390374331551e-06, "loss": 0.1041450947523117, "num_input_tokens_seen": 4047052, "step": 3928, "train_runtime": 9564.775, "train_tokens_per_second": 423.12 }, { "epoch": 1.6791323859386686, "grad_norm": 2.403409719467163, "learning_rate": 3.217112299465241e-06, "loss": 0.10034950077533722, "num_input_tokens_seen": 4048534, "step": 3929, "train_runtime": 9566.9845, "train_tokens_per_second": 423.178 }, { "epoch": 1.6795597820279946, "grad_norm": 3.0966920852661133, "learning_rate": 3.2128342245989307e-06, "loss": 0.09005638211965561, "num_input_tokens_seen": 4049546, "step": 3930, "train_runtime": 9569.0847, "train_tokens_per_second": 423.191 }, { "epoch": 1.6799871781173201, "grad_norm": 3.459977388381958, "learning_rate": 3.2085561497326205e-06, "loss": 0.08567871153354645, "num_input_tokens_seen": 4050164, "step": 3931, "train_runtime": 9577.3862, "train_tokens_per_second": 422.888 }, { "epoch": 1.680414574206646, "grad_norm": 4.240540504455566, "learning_rate": 3.2042780748663104e-06, "loss": 0.07416868209838867, "num_input_tokens_seen": 4050780, "step": 3932, "train_runtime": 9579.61, "train_tokens_per_second": 422.854 }, { "epoch": 1.6808419702959718, "grad_norm": 5.221320152282715, "learning_rate": 3.2000000000000003e-06, "loss": 0.09833960980176926, "num_input_tokens_seen": 4051324, "step": 3933, "train_runtime": 9581.5589, "train_tokens_per_second": 422.825 }, { "epoch": 1.6812693663852976, "grad_norm": 2.3435938358306885, "learning_rate": 3.19572192513369e-06, "loss": 0.06912118196487427, "num_input_tokens_seen": 4052426, "step": 3934, "train_runtime": 9583.677, "train_tokens_per_second": 422.847 }, { "epoch": 1.6816967624746235, "grad_norm": 3.06503963470459, "learning_rate": 3.19144385026738e-06, "loss": 0.0881384015083313, "num_input_tokens_seen": 4053116, "step": 3935, "train_runtime": 9585.6684, "train_tokens_per_second": 422.831 }, { "epoch": 1.682124158563949, "grad_norm": 2.6347336769104004, "learning_rate": 3.18716577540107e-06, "loss": 0.0930546373128891, "num_input_tokens_seen": 4053920, "step": 3936, "train_runtime": 9587.7536, "train_tokens_per_second": 422.823 }, { "epoch": 1.682551554653275, "grad_norm": 2.6467833518981934, "learning_rate": 3.1828877005347598e-06, "loss": 0.09518023580312729, "num_input_tokens_seen": 4054992, "step": 3937, "train_runtime": 9589.9079, "train_tokens_per_second": 422.84 }, { "epoch": 1.6829789507426007, "grad_norm": 3.57283616065979, "learning_rate": 3.1786096256684496e-06, "loss": 0.11834046989679337, "num_input_tokens_seen": 4056168, "step": 3938, "train_runtime": 9592.0435, "train_tokens_per_second": 422.868 }, { "epoch": 1.6834063468319265, "grad_norm": 4.581844806671143, "learning_rate": 3.1743315508021395e-06, "loss": 0.06580094993114471, "num_input_tokens_seen": 4057272, "step": 3939, "train_runtime": 9594.1864, "train_tokens_per_second": 422.889 }, { "epoch": 1.6838337429212524, "grad_norm": 2.258781909942627, "learning_rate": 3.1700534759358294e-06, "loss": 0.06576640158891678, "num_input_tokens_seen": 4058336, "step": 3940, "train_runtime": 9596.2976, "train_tokens_per_second": 422.906 }, { "epoch": 1.684261139010578, "grad_norm": 2.5151267051696777, "learning_rate": 3.1657754010695192e-06, "loss": 0.08555591106414795, "num_input_tokens_seen": 4059686, "step": 3941, "train_runtime": 9598.5049, "train_tokens_per_second": 422.95 }, { "epoch": 1.684688535099904, "grad_norm": 4.483311653137207, "learning_rate": 3.161497326203209e-06, "loss": 0.12450273334980011, "num_input_tokens_seen": 4060796, "step": 3942, "train_runtime": 9600.5856, "train_tokens_per_second": 422.974 }, { "epoch": 1.6851159311892296, "grad_norm": 2.560617208480835, "learning_rate": 3.157219251336899e-06, "loss": 0.10108768939971924, "num_input_tokens_seen": 4063020, "step": 3943, "train_runtime": 9602.947, "train_tokens_per_second": 423.101 }, { "epoch": 1.6855433272785554, "grad_norm": 2.902137041091919, "learning_rate": 3.1529411764705884e-06, "loss": 0.13017889857292175, "num_input_tokens_seen": 4064374, "step": 3944, "train_runtime": 9605.1315, "train_tokens_per_second": 423.146 }, { "epoch": 1.6859707233678813, "grad_norm": 3.8050923347473145, "learning_rate": 3.1486631016042783e-06, "loss": 0.12200959026813507, "num_input_tokens_seen": 4065068, "step": 3945, "train_runtime": 9607.1552, "train_tokens_per_second": 423.129 }, { "epoch": 1.6863981194572069, "grad_norm": 4.64519739151001, "learning_rate": 3.144385026737968e-06, "loss": 0.10243044048547745, "num_input_tokens_seen": 4065668, "step": 3946, "train_runtime": 9609.1522, "train_tokens_per_second": 423.104 }, { "epoch": 1.6868255155465328, "grad_norm": 2.8470051288604736, "learning_rate": 3.140106951871658e-06, "loss": 0.08725105226039886, "num_input_tokens_seen": 4067100, "step": 3947, "train_runtime": 9611.3598, "train_tokens_per_second": 423.156 }, { "epoch": 1.6872529116358586, "grad_norm": 2.402822971343994, "learning_rate": 3.135828877005348e-06, "loss": 0.0632270872592926, "num_input_tokens_seen": 4068514, "step": 3948, "train_runtime": 9613.602, "train_tokens_per_second": 423.204 }, { "epoch": 1.6876803077251843, "grad_norm": 1.928742527961731, "learning_rate": 3.1315508021390378e-06, "loss": 0.06809768080711365, "num_input_tokens_seen": 4070026, "step": 3949, "train_runtime": 9615.8046, "train_tokens_per_second": 423.264 }, { "epoch": 1.6881077038145103, "grad_norm": 3.191988229751587, "learning_rate": 3.1272727272727276e-06, "loss": 0.09078343212604523, "num_input_tokens_seen": 4070880, "step": 3950, "train_runtime": 9617.8258, "train_tokens_per_second": 423.264 }, { "epoch": 1.6885350999038358, "grad_norm": 2.2731947898864746, "learning_rate": 3.1229946524064175e-06, "loss": 0.11136038601398468, "num_input_tokens_seen": 4071986, "step": 3951, "train_runtime": 9620.0628, "train_tokens_per_second": 423.281 }, { "epoch": 1.6889624959931617, "grad_norm": 2.486530065536499, "learning_rate": 3.1187165775401074e-06, "loss": 0.11815786361694336, "num_input_tokens_seen": 4072958, "step": 3952, "train_runtime": 9622.2029, "train_tokens_per_second": 423.287 }, { "epoch": 1.6893898920824875, "grad_norm": 2.8962604999542236, "learning_rate": 3.1144385026737972e-06, "loss": 0.0618472546339035, "num_input_tokens_seen": 4073892, "step": 3953, "train_runtime": 9624.2551, "train_tokens_per_second": 423.294 }, { "epoch": 1.6898172881718132, "grad_norm": 1.9911576509475708, "learning_rate": 3.110160427807487e-06, "loss": 0.06889242678880692, "num_input_tokens_seen": 4075672, "step": 3954, "train_runtime": 9626.4886, "train_tokens_per_second": 423.381 }, { "epoch": 1.6902446842611392, "grad_norm": 2.7848258018493652, "learning_rate": 3.105882352941177e-06, "loss": 0.07982391119003296, "num_input_tokens_seen": 4076562, "step": 3955, "train_runtime": 9628.5727, "train_tokens_per_second": 423.382 }, { "epoch": 1.6906720803504647, "grad_norm": 1.9461215734481812, "learning_rate": 3.101604278074867e-06, "loss": 0.04318079352378845, "num_input_tokens_seen": 4077580, "step": 3956, "train_runtime": 9630.6988, "train_tokens_per_second": 423.394 }, { "epoch": 1.6910994764397906, "grad_norm": 3.0274593830108643, "learning_rate": 3.0973262032085567e-06, "loss": 0.09338752180337906, "num_input_tokens_seen": 4078396, "step": 3957, "train_runtime": 9632.7391, "train_tokens_per_second": 423.389 }, { "epoch": 1.6915268725291164, "grad_norm": 3.2393455505371094, "learning_rate": 3.0930481283422466e-06, "loss": 0.10761010646820068, "num_input_tokens_seen": 4079208, "step": 3958, "train_runtime": 9634.7703, "train_tokens_per_second": 423.384 }, { "epoch": 1.6919542686184421, "grad_norm": 3.275947332382202, "learning_rate": 3.0887700534759365e-06, "loss": 0.07251361012458801, "num_input_tokens_seen": 4080156, "step": 3959, "train_runtime": 9636.8124, "train_tokens_per_second": 423.393 }, { "epoch": 1.692381664707768, "grad_norm": 2.4812443256378174, "learning_rate": 3.0844919786096263e-06, "loss": 0.08334419876337051, "num_input_tokens_seen": 4081332, "step": 3960, "train_runtime": 9638.9275, "train_tokens_per_second": 423.422 }, { "epoch": 1.6928090607970936, "grad_norm": 2.866668224334717, "learning_rate": 3.0802139037433158e-06, "loss": 0.08983352035284042, "num_input_tokens_seen": 4082194, "step": 3961, "train_runtime": 9647.5402, "train_tokens_per_second": 423.133 }, { "epoch": 1.6932364568864195, "grad_norm": 3.889932155609131, "learning_rate": 3.0759358288770056e-06, "loss": 0.10154541581869125, "num_input_tokens_seen": 4082842, "step": 3962, "train_runtime": 9649.5679, "train_tokens_per_second": 423.111 }, { "epoch": 1.6936638529757453, "grad_norm": 3.7758491039276123, "learning_rate": 3.0716577540106955e-06, "loss": 0.10542549937963486, "num_input_tokens_seen": 4083728, "step": 3963, "train_runtime": 9651.6686, "train_tokens_per_second": 423.111 }, { "epoch": 1.694091249065071, "grad_norm": 2.9250810146331787, "learning_rate": 3.0673796791443854e-06, "loss": 0.08727927505970001, "num_input_tokens_seen": 4084996, "step": 3964, "train_runtime": 9653.8209, "train_tokens_per_second": 423.148 }, { "epoch": 1.694518645154397, "grad_norm": 2.0858898162841797, "learning_rate": 3.0631016042780752e-06, "loss": 0.04901638999581337, "num_input_tokens_seen": 4085760, "step": 3965, "train_runtime": 9655.8755, "train_tokens_per_second": 423.137 }, { "epoch": 1.6949460412437225, "grad_norm": 2.70337176322937, "learning_rate": 3.058823529411765e-06, "loss": 0.12117543816566467, "num_input_tokens_seen": 4087108, "step": 3966, "train_runtime": 9658.0868, "train_tokens_per_second": 423.18 }, { "epoch": 1.6953734373330485, "grad_norm": 1.875209093093872, "learning_rate": 3.054545454545455e-06, "loss": 0.12659204006195068, "num_input_tokens_seen": 4088596, "step": 3967, "train_runtime": 9660.3092, "train_tokens_per_second": 423.237 }, { "epoch": 1.6958008334223742, "grad_norm": 2.988813877105713, "learning_rate": 3.050267379679145e-06, "loss": 0.0948270633816719, "num_input_tokens_seen": 4089646, "step": 3968, "train_runtime": 9662.3869, "train_tokens_per_second": 423.254 }, { "epoch": 1.6962282295117, "grad_norm": 1.7588655948638916, "learning_rate": 3.0459893048128347e-06, "loss": 0.05924312770366669, "num_input_tokens_seen": 4090980, "step": 3969, "train_runtime": 9664.5602, "train_tokens_per_second": 423.297 }, { "epoch": 1.696655625601026, "grad_norm": 3.538276433944702, "learning_rate": 3.0417112299465246e-06, "loss": 0.10084767639636993, "num_input_tokens_seen": 4091836, "step": 3970, "train_runtime": 9666.6342, "train_tokens_per_second": 423.295 }, { "epoch": 1.6970830216903514, "grad_norm": 2.048569440841675, "learning_rate": 3.0374331550802145e-06, "loss": 0.052659835666418076, "num_input_tokens_seen": 4092640, "step": 3971, "train_runtime": 9668.6578, "train_tokens_per_second": 423.289 }, { "epoch": 1.6975104177796774, "grad_norm": 1.0084600448608398, "learning_rate": 3.0331550802139043e-06, "loss": 0.03439614176750183, "num_input_tokens_seen": 4095382, "step": 3972, "train_runtime": 9671.2308, "train_tokens_per_second": 423.46 }, { "epoch": 1.697937813869003, "grad_norm": 2.9055423736572266, "learning_rate": 3.028877005347594e-06, "loss": 0.13083118200302124, "num_input_tokens_seen": 4096476, "step": 3973, "train_runtime": 9673.4149, "train_tokens_per_second": 423.478 }, { "epoch": 1.6983652099583288, "grad_norm": 3.072705030441284, "learning_rate": 3.024598930481284e-06, "loss": 0.09290516376495361, "num_input_tokens_seen": 4097310, "step": 3974, "train_runtime": 9675.4882, "train_tokens_per_second": 423.473 }, { "epoch": 1.6987926060476548, "grad_norm": 3.6360573768615723, "learning_rate": 3.020320855614973e-06, "loss": 0.09591491520404816, "num_input_tokens_seen": 4098298, "step": 3975, "train_runtime": 9677.5762, "train_tokens_per_second": 423.484 }, { "epoch": 1.6992200021369803, "grad_norm": 3.1038193702697754, "learning_rate": 3.016042780748663e-06, "loss": 0.0824640691280365, "num_input_tokens_seen": 4098958, "step": 3976, "train_runtime": 9679.5993, "train_tokens_per_second": 423.464 }, { "epoch": 1.6996473982263063, "grad_norm": 2.79768705368042, "learning_rate": 3.011764705882353e-06, "loss": 0.1095389574766159, "num_input_tokens_seen": 4100004, "step": 3977, "train_runtime": 9681.7467, "train_tokens_per_second": 423.478 }, { "epoch": 1.700074794315632, "grad_norm": 2.7529211044311523, "learning_rate": 3.0074866310160427e-06, "loss": 0.08126137405633926, "num_input_tokens_seen": 4101046, "step": 3978, "train_runtime": 9683.8381, "train_tokens_per_second": 423.494 }, { "epoch": 1.7005021904049578, "grad_norm": 3.107191562652588, "learning_rate": 3.0032085561497326e-06, "loss": 0.08961816877126694, "num_input_tokens_seen": 4101994, "step": 3979, "train_runtime": 9685.9528, "train_tokens_per_second": 423.499 }, { "epoch": 1.7009295864942837, "grad_norm": 1.573712944984436, "learning_rate": 2.9989304812834224e-06, "loss": 0.04550402611494064, "num_input_tokens_seen": 4102996, "step": 3980, "train_runtime": 9688.0116, "train_tokens_per_second": 423.513 }, { "epoch": 1.7013569825836092, "grad_norm": 2.7542884349823, "learning_rate": 2.9946524064171123e-06, "loss": 0.0688285231590271, "num_input_tokens_seen": 4103766, "step": 3981, "train_runtime": 9690.0265, "train_tokens_per_second": 423.504 }, { "epoch": 1.7017843786729352, "grad_norm": 2.8290889263153076, "learning_rate": 2.990374331550802e-06, "loss": 0.05508919060230255, "num_input_tokens_seen": 4104614, "step": 3982, "train_runtime": 9692.0843, "train_tokens_per_second": 423.502 }, { "epoch": 1.702211774762261, "grad_norm": 2.792149543762207, "learning_rate": 2.986096256684492e-06, "loss": 0.10512325167655945, "num_input_tokens_seen": 4105492, "step": 3983, "train_runtime": 9694.1483, "train_tokens_per_second": 423.502 }, { "epoch": 1.7026391708515867, "grad_norm": 2.788059711456299, "learning_rate": 2.981818181818182e-06, "loss": 0.08885282278060913, "num_input_tokens_seen": 4106256, "step": 3984, "train_runtime": 9696.2024, "train_tokens_per_second": 423.491 }, { "epoch": 1.7030665669409126, "grad_norm": 1.0589274168014526, "learning_rate": 2.9775401069518718e-06, "loss": 0.02877618744969368, "num_input_tokens_seen": 4108050, "step": 3985, "train_runtime": 9698.5075, "train_tokens_per_second": 423.575 }, { "epoch": 1.7034939630302381, "grad_norm": 4.479930400848389, "learning_rate": 2.9732620320855617e-06, "loss": 0.08620975911617279, "num_input_tokens_seen": 4109066, "step": 3986, "train_runtime": 9700.6266, "train_tokens_per_second": 423.588 }, { "epoch": 1.703921359119564, "grad_norm": 2.665229082107544, "learning_rate": 2.9689839572192515e-06, "loss": 0.07935021817684174, "num_input_tokens_seen": 4110052, "step": 3987, "train_runtime": 9702.7107, "train_tokens_per_second": 423.598 }, { "epoch": 1.7043487552088898, "grad_norm": 2.5171425342559814, "learning_rate": 2.9647058823529414e-06, "loss": 0.06944979727268219, "num_input_tokens_seen": 4110898, "step": 3988, "train_runtime": 9704.7687, "train_tokens_per_second": 423.596 }, { "epoch": 1.7047761512982156, "grad_norm": 2.9781835079193115, "learning_rate": 2.9604278074866313e-06, "loss": 0.08037969470024109, "num_input_tokens_seen": 4111684, "step": 3989, "train_runtime": 9706.8175, "train_tokens_per_second": 423.587 }, { "epoch": 1.7052035473875415, "grad_norm": 2.7700400352478027, "learning_rate": 2.9561497326203207e-06, "loss": 0.08722593635320663, "num_input_tokens_seen": 4112802, "step": 3990, "train_runtime": 9708.9326, "train_tokens_per_second": 423.61 }, { "epoch": 1.705630943476867, "grad_norm": 3.2015161514282227, "learning_rate": 2.9518716577540106e-06, "loss": 0.11456476897001266, "num_input_tokens_seen": 4113660, "step": 3991, "train_runtime": 9717.1854, "train_tokens_per_second": 423.339 }, { "epoch": 1.706058339566193, "grad_norm": 2.407200336456299, "learning_rate": 2.9475935828877004e-06, "loss": 0.06708672642707825, "num_input_tokens_seen": 4114290, "step": 3992, "train_runtime": 9719.3327, "train_tokens_per_second": 423.31 }, { "epoch": 1.7064857356555188, "grad_norm": 4.023921012878418, "learning_rate": 2.9433155080213903e-06, "loss": 0.09772603958845139, "num_input_tokens_seen": 4115178, "step": 3993, "train_runtime": 9721.3956, "train_tokens_per_second": 423.311 }, { "epoch": 1.7069131317448445, "grad_norm": 3.6249475479125977, "learning_rate": 2.93903743315508e-06, "loss": 0.11192765086889267, "num_input_tokens_seen": 4116076, "step": 3994, "train_runtime": 9723.4429, "train_tokens_per_second": 423.315 }, { "epoch": 1.7073405278341705, "grad_norm": 2.1237800121307373, "learning_rate": 2.93475935828877e-06, "loss": 0.06910011917352676, "num_input_tokens_seen": 4117060, "step": 3995, "train_runtime": 9725.5291, "train_tokens_per_second": 423.325 }, { "epoch": 1.707767923923496, "grad_norm": 2.8688395023345947, "learning_rate": 2.93048128342246e-06, "loss": 0.09212521463632584, "num_input_tokens_seen": 4118136, "step": 3996, "train_runtime": 9727.6572, "train_tokens_per_second": 423.343 }, { "epoch": 1.708195320012822, "grad_norm": 3.399718761444092, "learning_rate": 2.92620320855615e-06, "loss": 0.04382210224866867, "num_input_tokens_seen": 4118922, "step": 3997, "train_runtime": 9729.6833, "train_tokens_per_second": 423.336 }, { "epoch": 1.7086227161021477, "grad_norm": 2.887514114379883, "learning_rate": 2.9219251336898397e-06, "loss": 0.12157633900642395, "num_input_tokens_seen": 4119792, "step": 3998, "train_runtime": 9731.7647, "train_tokens_per_second": 423.335 }, { "epoch": 1.7090501121914734, "grad_norm": 2.347560167312622, "learning_rate": 2.9176470588235295e-06, "loss": 0.12193876504898071, "num_input_tokens_seen": 4121640, "step": 3999, "train_runtime": 9734.0305, "train_tokens_per_second": 423.426 }, { "epoch": 1.7094775082807994, "grad_norm": 2.65649151802063, "learning_rate": 2.9133689839572194e-06, "loss": 0.08729573339223862, "num_input_tokens_seen": 4122298, "step": 4000, "train_runtime": 9735.9806, "train_tokens_per_second": 423.409 }, { "epoch": 1.7099049043701249, "grad_norm": 2.8900082111358643, "learning_rate": 2.9090909090909093e-06, "loss": 0.05193738639354706, "num_input_tokens_seen": 4123308, "step": 4001, "train_runtime": 9738.1461, "train_tokens_per_second": 423.418 }, { "epoch": 1.7103323004594508, "grad_norm": 3.2903778553009033, "learning_rate": 2.904812834224599e-06, "loss": 0.09346148371696472, "num_input_tokens_seen": 4124276, "step": 4002, "train_runtime": 9740.209, "train_tokens_per_second": 423.428 }, { "epoch": 1.7107596965487766, "grad_norm": 2.147174596786499, "learning_rate": 2.900534759358289e-06, "loss": 0.04343915730714798, "num_input_tokens_seen": 4125396, "step": 4003, "train_runtime": 9742.3233, "train_tokens_per_second": 423.451 }, { "epoch": 1.7111870926381023, "grad_norm": 2.4331154823303223, "learning_rate": 2.896256684491979e-06, "loss": 0.0731518566608429, "num_input_tokens_seen": 4126362, "step": 4004, "train_runtime": 9744.3706, "train_tokens_per_second": 423.461 }, { "epoch": 1.7116144887274283, "grad_norm": 2.9176928997039795, "learning_rate": 2.8919786096256687e-06, "loss": 0.08682416379451752, "num_input_tokens_seen": 4127178, "step": 4005, "train_runtime": 9746.4738, "train_tokens_per_second": 423.453 }, { "epoch": 1.7120418848167538, "grad_norm": 2.6199653148651123, "learning_rate": 2.8877005347593586e-06, "loss": 0.07903584092855453, "num_input_tokens_seen": 4128614, "step": 4006, "train_runtime": 9748.6771, "train_tokens_per_second": 423.505 }, { "epoch": 1.7124692809060797, "grad_norm": 1.868880271911621, "learning_rate": 2.883422459893048e-06, "loss": 0.052999626845121384, "num_input_tokens_seen": 4130058, "step": 4007, "train_runtime": 9750.844, "train_tokens_per_second": 423.559 }, { "epoch": 1.7128966769954055, "grad_norm": 1.91898775100708, "learning_rate": 2.879144385026738e-06, "loss": 0.0487280897796154, "num_input_tokens_seen": 4131012, "step": 4008, "train_runtime": 9752.9262, "train_tokens_per_second": 423.566 }, { "epoch": 1.7133240730847312, "grad_norm": 2.636772871017456, "learning_rate": 2.874866310160428e-06, "loss": 0.10910525172948837, "num_input_tokens_seen": 4132170, "step": 4009, "train_runtime": 9755.077, "train_tokens_per_second": 423.592 }, { "epoch": 1.7137514691740572, "grad_norm": 2.091592311859131, "learning_rate": 2.8705882352941177e-06, "loss": 0.06968137621879578, "num_input_tokens_seen": 4133064, "step": 4010, "train_runtime": 9757.1401, "train_tokens_per_second": 423.594 }, { "epoch": 1.7141788652633827, "grad_norm": 2.232311964035034, "learning_rate": 2.8663101604278075e-06, "loss": 0.08474753051996231, "num_input_tokens_seen": 4134600, "step": 4011, "train_runtime": 9759.3764, "train_tokens_per_second": 423.654 }, { "epoch": 1.7146062613527087, "grad_norm": 2.4938127994537354, "learning_rate": 2.8620320855614974e-06, "loss": 0.08659147471189499, "num_input_tokens_seen": 4135694, "step": 4012, "train_runtime": 9761.4945, "train_tokens_per_second": 423.674 }, { "epoch": 1.7150336574420344, "grad_norm": 1.7887046337127686, "learning_rate": 2.8577540106951873e-06, "loss": 0.057201042771339417, "num_input_tokens_seen": 4136848, "step": 4013, "train_runtime": 9763.6143, "train_tokens_per_second": 423.7 }, { "epoch": 1.7154610535313601, "grad_norm": 2.444875717163086, "learning_rate": 2.853475935828877e-06, "loss": 0.08035197108983994, "num_input_tokens_seen": 4137904, "step": 4014, "train_runtime": 9765.7148, "train_tokens_per_second": 423.717 }, { "epoch": 1.715888449620686, "grad_norm": 2.9307851791381836, "learning_rate": 2.849197860962567e-06, "loss": 0.08804693073034286, "num_input_tokens_seen": 4138772, "step": 4015, "train_runtime": 9767.7923, "train_tokens_per_second": 423.716 }, { "epoch": 1.7163158457100116, "grad_norm": 2.4342997074127197, "learning_rate": 2.844919786096257e-06, "loss": 0.07923261821269989, "num_input_tokens_seen": 4139926, "step": 4016, "train_runtime": 9769.9015, "train_tokens_per_second": 423.743 }, { "epoch": 1.7167432417993376, "grad_norm": 3.785456895828247, "learning_rate": 2.8406417112299468e-06, "loss": 0.07858654856681824, "num_input_tokens_seen": 4140438, "step": 4017, "train_runtime": 9771.8454, "train_tokens_per_second": 423.711 }, { "epoch": 1.7171706378886633, "grad_norm": 3.5055201053619385, "learning_rate": 2.8363636363636366e-06, "loss": 0.08689583837985992, "num_input_tokens_seen": 4141286, "step": 4018, "train_runtime": 9773.8673, "train_tokens_per_second": 423.71 }, { "epoch": 1.717598033977989, "grad_norm": 1.9284234046936035, "learning_rate": 2.8320855614973265e-06, "loss": 0.04013746604323387, "num_input_tokens_seen": 4142434, "step": 4019, "train_runtime": 9776.0056, "train_tokens_per_second": 423.735 }, { "epoch": 1.718025430067315, "grad_norm": 3.628349781036377, "learning_rate": 2.8278074866310164e-06, "loss": 0.09199301898479462, "num_input_tokens_seen": 4143234, "step": 4020, "train_runtime": 9778.0259, "train_tokens_per_second": 423.729 }, { "epoch": 1.7184528261566405, "grad_norm": 2.8210036754608154, "learning_rate": 2.8235294117647062e-06, "loss": 0.12050800025463104, "num_input_tokens_seen": 4144272, "step": 4021, "train_runtime": 9786.8242, "train_tokens_per_second": 423.454 }, { "epoch": 1.7188802222459665, "grad_norm": 6.9073638916015625, "learning_rate": 2.819251336898396e-06, "loss": 0.10918869078159332, "num_input_tokens_seen": 4145398, "step": 4022, "train_runtime": 9788.9841, "train_tokens_per_second": 423.476 }, { "epoch": 1.7193076183352922, "grad_norm": 3.853930950164795, "learning_rate": 2.814973262032086e-06, "loss": 0.1149483472108841, "num_input_tokens_seen": 4147038, "step": 4023, "train_runtime": 9791.2494, "train_tokens_per_second": 423.545 }, { "epoch": 1.719735014424618, "grad_norm": 2.2328014373779297, "learning_rate": 2.8106951871657754e-06, "loss": 0.06822262704372406, "num_input_tokens_seen": 4147982, "step": 4024, "train_runtime": 9793.3018, "train_tokens_per_second": 423.553 }, { "epoch": 1.720162410513944, "grad_norm": 2.3204293251037598, "learning_rate": 2.8064171122994653e-06, "loss": 0.08057768642902374, "num_input_tokens_seen": 4149004, "step": 4025, "train_runtime": 9795.391, "train_tokens_per_second": 423.567 }, { "epoch": 1.7205898066032694, "grad_norm": 2.331454038619995, "learning_rate": 2.802139037433155e-06, "loss": 0.045126643031835556, "num_input_tokens_seen": 4149740, "step": 4026, "train_runtime": 9797.3776, "train_tokens_per_second": 423.556 }, { "epoch": 1.7210172026925954, "grad_norm": 3.34110951423645, "learning_rate": 2.797860962566845e-06, "loss": 0.11113997548818588, "num_input_tokens_seen": 4150614, "step": 4027, "train_runtime": 9799.4323, "train_tokens_per_second": 423.557 }, { "epoch": 1.7214445987819211, "grad_norm": 2.157827615737915, "learning_rate": 2.793582887700535e-06, "loss": 0.07617693394422531, "num_input_tokens_seen": 4152094, "step": 4028, "train_runtime": 9801.6244, "train_tokens_per_second": 423.613 }, { "epoch": 1.7218719948712469, "grad_norm": 2.674255609512329, "learning_rate": 2.7893048128342248e-06, "loss": 0.05856155976653099, "num_input_tokens_seen": 4152830, "step": 4029, "train_runtime": 9803.6454, "train_tokens_per_second": 423.601 }, { "epoch": 1.7222993909605728, "grad_norm": 2.7371299266815186, "learning_rate": 2.7850267379679146e-06, "loss": 0.09654857218265533, "num_input_tokens_seen": 4154218, "step": 4030, "train_runtime": 9805.842, "train_tokens_per_second": 423.647 }, { "epoch": 1.7227267870498983, "grad_norm": 2.5340161323547363, "learning_rate": 2.7807486631016045e-06, "loss": 0.10056625306606293, "num_input_tokens_seen": 4155316, "step": 4031, "train_runtime": 9808.0092, "train_tokens_per_second": 423.666 }, { "epoch": 1.7231541831392243, "grad_norm": 3.9756827354431152, "learning_rate": 2.7764705882352944e-06, "loss": 0.12368873506784439, "num_input_tokens_seen": 4156016, "step": 4032, "train_runtime": 9810.0293, "train_tokens_per_second": 423.65 }, { "epoch": 1.72358157922855, "grad_norm": 2.6393966674804688, "learning_rate": 2.7721925133689842e-06, "loss": 0.09346798062324524, "num_input_tokens_seen": 4157556, "step": 4033, "train_runtime": 9812.2483, "train_tokens_per_second": 423.711 }, { "epoch": 1.7240089753178758, "grad_norm": 2.4262278079986572, "learning_rate": 2.767914438502674e-06, "loss": 0.08767855167388916, "num_input_tokens_seen": 4158576, "step": 4034, "train_runtime": 9814.4968, "train_tokens_per_second": 423.718 }, { "epoch": 1.7244363714072017, "grad_norm": 2.7044572830200195, "learning_rate": 2.763636363636364e-06, "loss": 0.0657733678817749, "num_input_tokens_seen": 4159834, "step": 4035, "train_runtime": 9816.7045, "train_tokens_per_second": 423.751 }, { "epoch": 1.7248637674965273, "grad_norm": 2.0652520656585693, "learning_rate": 2.759358288770054e-06, "loss": 0.10201188176870346, "num_input_tokens_seen": 4161608, "step": 4036, "train_runtime": 9819.0163, "train_tokens_per_second": 423.831 }, { "epoch": 1.7252911635858532, "grad_norm": 2.7821693420410156, "learning_rate": 2.7550802139037437e-06, "loss": 0.09517615288496017, "num_input_tokens_seen": 4162850, "step": 4037, "train_runtime": 9821.1744, "train_tokens_per_second": 423.865 }, { "epoch": 1.725718559675179, "grad_norm": 1.9511961936950684, "learning_rate": 2.7508021390374336e-06, "loss": 0.07643108069896698, "num_input_tokens_seen": 4164050, "step": 4038, "train_runtime": 9823.3822, "train_tokens_per_second": 423.892 }, { "epoch": 1.7261459557645047, "grad_norm": 2.4407958984375, "learning_rate": 2.7465240641711235e-06, "loss": 0.07977095991373062, "num_input_tokens_seen": 4165072, "step": 4039, "train_runtime": 9825.4732, "train_tokens_per_second": 423.905 }, { "epoch": 1.7265733518538307, "grad_norm": 3.0610175132751465, "learning_rate": 2.7422459893048133e-06, "loss": 0.06689866632223129, "num_input_tokens_seen": 4165922, "step": 4040, "train_runtime": 9827.5314, "train_tokens_per_second": 423.903 }, { "epoch": 1.7270007479431562, "grad_norm": 5.814146518707275, "learning_rate": 2.7379679144385028e-06, "loss": 0.09602482616901398, "num_input_tokens_seen": 4166786, "step": 4041, "train_runtime": 9829.5902, "train_tokens_per_second": 423.902 }, { "epoch": 1.7274281440324821, "grad_norm": 3.5886621475219727, "learning_rate": 2.7336898395721926e-06, "loss": 0.1257716715335846, "num_input_tokens_seen": 4167642, "step": 4042, "train_runtime": 9831.6772, "train_tokens_per_second": 423.899 }, { "epoch": 1.7278555401218079, "grad_norm": 2.48893141746521, "learning_rate": 2.7294117647058825e-06, "loss": 0.1100153923034668, "num_input_tokens_seen": 4168700, "step": 4043, "train_runtime": 9833.7552, "train_tokens_per_second": 423.917 }, { "epoch": 1.7282829362111336, "grad_norm": 2.379669427871704, "learning_rate": 2.7251336898395724e-06, "loss": 0.05183770880103111, "num_input_tokens_seen": 4169840, "step": 4044, "train_runtime": 9835.9603, "train_tokens_per_second": 423.938 }, { "epoch": 1.7287103323004596, "grad_norm": 3.1207971572875977, "learning_rate": 2.7208556149732622e-06, "loss": 0.06831379234790802, "num_input_tokens_seen": 4170512, "step": 4045, "train_runtime": 9837.9654, "train_tokens_per_second": 423.92 }, { "epoch": 1.729137728389785, "grad_norm": 2.1130356788635254, "learning_rate": 2.716577540106952e-06, "loss": 0.058660343289375305, "num_input_tokens_seen": 4171454, "step": 4046, "train_runtime": 9840.0345, "train_tokens_per_second": 423.927 }, { "epoch": 1.729565124479111, "grad_norm": 4.324986457824707, "learning_rate": 2.712299465240642e-06, "loss": 0.10213802009820938, "num_input_tokens_seen": 4172116, "step": 4047, "train_runtime": 9842.1705, "train_tokens_per_second": 423.902 }, { "epoch": 1.7299925205684368, "grad_norm": 2.6436688899993896, "learning_rate": 2.708021390374332e-06, "loss": 0.05921069532632828, "num_input_tokens_seen": 4173226, "step": 4048, "train_runtime": 9844.397, "train_tokens_per_second": 423.919 }, { "epoch": 1.7304199166577625, "grad_norm": 2.5965993404388428, "learning_rate": 2.7037433155080217e-06, "loss": 0.08830476552248001, "num_input_tokens_seen": 4174102, "step": 4049, "train_runtime": 9846.622, "train_tokens_per_second": 423.912 }, { "epoch": 1.7308473127470885, "grad_norm": 1.9387271404266357, "learning_rate": 2.6994652406417116e-06, "loss": 0.04834958165884018, "num_input_tokens_seen": 4174824, "step": 4050, "train_runtime": 9848.6166, "train_tokens_per_second": 423.9 }, { "epoch": 1.731274708836414, "grad_norm": 2.625678777694702, "learning_rate": 2.6951871657754015e-06, "loss": 0.06536933034658432, "num_input_tokens_seen": 4176128, "step": 4051, "train_runtime": 9857.4035, "train_tokens_per_second": 423.654 }, { "epoch": 1.73170210492574, "grad_norm": 2.0632362365722656, "learning_rate": 2.6909090909090913e-06, "loss": 0.07165873795747757, "num_input_tokens_seen": 4177458, "step": 4052, "train_runtime": 9859.5531, "train_tokens_per_second": 423.696 }, { "epoch": 1.7321295010150657, "grad_norm": 2.3923587799072266, "learning_rate": 2.686631016042781e-06, "loss": 0.08612820506095886, "num_input_tokens_seen": 4178516, "step": 4053, "train_runtime": 9861.7402, "train_tokens_per_second": 423.71 }, { "epoch": 1.7325568971043914, "grad_norm": 2.4570765495300293, "learning_rate": 2.682352941176471e-06, "loss": 0.07350552082061768, "num_input_tokens_seen": 4179284, "step": 4054, "train_runtime": 9863.7989, "train_tokens_per_second": 423.699 }, { "epoch": 1.7329842931937174, "grad_norm": 3.116313934326172, "learning_rate": 2.678074866310161e-06, "loss": 0.09485094994306564, "num_input_tokens_seen": 4180324, "step": 4055, "train_runtime": 9865.838, "train_tokens_per_second": 423.717 }, { "epoch": 1.733411689283043, "grad_norm": 2.48117995262146, "learning_rate": 2.673796791443851e-06, "loss": 0.06896473467350006, "num_input_tokens_seen": 4181230, "step": 4056, "train_runtime": 9867.8973, "train_tokens_per_second": 423.72 }, { "epoch": 1.7338390853723689, "grad_norm": 2.2488813400268555, "learning_rate": 2.6695187165775407e-06, "loss": 0.06654829531908035, "num_input_tokens_seen": 4182154, "step": 4057, "train_runtime": 9869.9419, "train_tokens_per_second": 423.726 }, { "epoch": 1.7342664814616946, "grad_norm": 2.7358016967773438, "learning_rate": 2.66524064171123e-06, "loss": 0.08781205117702484, "num_input_tokens_seen": 4183822, "step": 4058, "train_runtime": 9872.1928, "train_tokens_per_second": 423.799 }, { "epoch": 1.7346938775510203, "grad_norm": 2.7917540073394775, "learning_rate": 2.66096256684492e-06, "loss": 0.0921274721622467, "num_input_tokens_seen": 4184720, "step": 4059, "train_runtime": 9874.2316, "train_tokens_per_second": 423.802 }, { "epoch": 1.7351212736403463, "grad_norm": 2.315652370452881, "learning_rate": 2.65668449197861e-06, "loss": 0.07591191679239273, "num_input_tokens_seen": 4185892, "step": 4060, "train_runtime": 9876.3306, "train_tokens_per_second": 423.831 }, { "epoch": 1.7355486697296718, "grad_norm": 2.635467290878296, "learning_rate": 2.6524064171122997e-06, "loss": 0.10073072463274002, "num_input_tokens_seen": 4186882, "step": 4061, "train_runtime": 9878.4004, "train_tokens_per_second": 423.842 }, { "epoch": 1.7359760658189978, "grad_norm": 4.159154891967773, "learning_rate": 2.6481283422459896e-06, "loss": 0.081559918820858, "num_input_tokens_seen": 4187578, "step": 4062, "train_runtime": 9880.3781, "train_tokens_per_second": 423.828 }, { "epoch": 1.7364034619083235, "grad_norm": 3.1609933376312256, "learning_rate": 2.6438502673796795e-06, "loss": 0.09514006227254868, "num_input_tokens_seen": 4188628, "step": 4063, "train_runtime": 9882.4607, "train_tokens_per_second": 423.845 }, { "epoch": 1.7368308579976492, "grad_norm": 2.9850661754608154, "learning_rate": 2.6395721925133693e-06, "loss": 0.09671429544687271, "num_input_tokens_seen": 4189492, "step": 4064, "train_runtime": 9884.4971, "train_tokens_per_second": 423.845 }, { "epoch": 1.7372582540869752, "grad_norm": 1.6393934488296509, "learning_rate": 2.635294117647059e-06, "loss": 0.041917793452739716, "num_input_tokens_seen": 4190846, "step": 4065, "train_runtime": 9886.677, "train_tokens_per_second": 423.888 }, { "epoch": 1.7376856501763007, "grad_norm": 2.439072847366333, "learning_rate": 2.631016042780749e-06, "loss": 0.07730145752429962, "num_input_tokens_seen": 4191792, "step": 4066, "train_runtime": 9888.7218, "train_tokens_per_second": 423.896 }, { "epoch": 1.7381130462656267, "grad_norm": 1.4326391220092773, "learning_rate": 2.626737967914439e-06, "loss": 0.05624020844697952, "num_input_tokens_seen": 4193618, "step": 4067, "train_runtime": 9891.0096, "train_tokens_per_second": 423.983 }, { "epoch": 1.7385404423549524, "grad_norm": 2.28743052482605, "learning_rate": 2.622459893048129e-06, "loss": 0.07754433900117874, "num_input_tokens_seen": 4194466, "step": 4068, "train_runtime": 9893.0257, "train_tokens_per_second": 423.982 }, { "epoch": 1.7389678384442782, "grad_norm": 2.206310510635376, "learning_rate": 2.6181818181818187e-06, "loss": 0.03837336227297783, "num_input_tokens_seen": 4195320, "step": 4069, "train_runtime": 9895.0384, "train_tokens_per_second": 423.982 }, { "epoch": 1.7393952345336041, "grad_norm": 2.664803981781006, "learning_rate": 2.6139037433155085e-06, "loss": 0.11692618578672409, "num_input_tokens_seen": 4197270, "step": 4070, "train_runtime": 9897.3749, "train_tokens_per_second": 424.079 }, { "epoch": 1.7398226306229299, "grad_norm": 3.1426937580108643, "learning_rate": 2.6096256684491984e-06, "loss": 0.09302536398172379, "num_input_tokens_seen": 4198056, "step": 4071, "train_runtime": 9899.4233, "train_tokens_per_second": 424.071 }, { "epoch": 1.7402500267122556, "grad_norm": 2.822409152984619, "learning_rate": 2.6053475935828883e-06, "loss": 0.09082210063934326, "num_input_tokens_seen": 4198842, "step": 4072, "train_runtime": 9901.4388, "train_tokens_per_second": 424.064 }, { "epoch": 1.7406774228015813, "grad_norm": 2.297144651412964, "learning_rate": 2.601069518716578e-06, "loss": 0.10644955188035965, "num_input_tokens_seen": 4200016, "step": 4073, "train_runtime": 9903.5532, "train_tokens_per_second": 424.092 }, { "epoch": 1.741104818890907, "grad_norm": 2.7085657119750977, "learning_rate": 2.596791443850268e-06, "loss": 0.07879453152418137, "num_input_tokens_seen": 4200926, "step": 4074, "train_runtime": 9905.6307, "train_tokens_per_second": 424.095 }, { "epoch": 1.741532214980233, "grad_norm": 3.2154722213745117, "learning_rate": 2.5925133689839575e-06, "loss": 0.10776600986719131, "num_input_tokens_seen": 4201996, "step": 4075, "train_runtime": 9907.7143, "train_tokens_per_second": 424.114 }, { "epoch": 1.7419596110695588, "grad_norm": 2.3599696159362793, "learning_rate": 2.5882352941176473e-06, "loss": 0.08735352754592896, "num_input_tokens_seen": 4203100, "step": 4076, "train_runtime": 9909.8243, "train_tokens_per_second": 424.135 }, { "epoch": 1.7423870071588845, "grad_norm": 2.141378879547119, "learning_rate": 2.583957219251337e-06, "loss": 0.044425349682569504, "num_input_tokens_seen": 4204022, "step": 4077, "train_runtime": 9911.9223, "train_tokens_per_second": 424.138 }, { "epoch": 1.7428144032482102, "grad_norm": 3.5553226470947266, "learning_rate": 2.579679144385027e-06, "loss": 0.16258250176906586, "num_input_tokens_seen": 4205362, "step": 4078, "train_runtime": 9914.0957, "train_tokens_per_second": 424.18 }, { "epoch": 1.743241799337536, "grad_norm": 2.341912031173706, "learning_rate": 2.575401069518717e-06, "loss": 0.08952471613883972, "num_input_tokens_seen": 4206674, "step": 4079, "train_runtime": 9916.2411, "train_tokens_per_second": 424.221 }, { "epoch": 1.743669195426862, "grad_norm": 3.0861172676086426, "learning_rate": 2.571122994652407e-06, "loss": 0.102879099547863, "num_input_tokens_seen": 4207948, "step": 4080, "train_runtime": 9918.3916, "train_tokens_per_second": 424.257 }, { "epoch": 1.7440965915161877, "grad_norm": 2.2038893699645996, "learning_rate": 2.5668449197860967e-06, "loss": 0.0634625032544136, "num_input_tokens_seen": 4208712, "step": 4081, "train_runtime": 9927.2476, "train_tokens_per_second": 423.956 }, { "epoch": 1.7445239876055134, "grad_norm": 2.1982100009918213, "learning_rate": 2.5625668449197866e-06, "loss": 0.05916162207722664, "num_input_tokens_seen": 4209686, "step": 4082, "train_runtime": 9929.3268, "train_tokens_per_second": 423.965 }, { "epoch": 1.7449513836948392, "grad_norm": 2.9628520011901855, "learning_rate": 2.5582887700534764e-06, "loss": 0.1246619001030922, "num_input_tokens_seen": 4210652, "step": 4083, "train_runtime": 9931.4104, "train_tokens_per_second": 423.973 }, { "epoch": 1.745378779784165, "grad_norm": 2.510510206222534, "learning_rate": 2.554010695187166e-06, "loss": 0.08361392468214035, "num_input_tokens_seen": 4211788, "step": 4084, "train_runtime": 9933.5228, "train_tokens_per_second": 423.997 }, { "epoch": 1.7458061758734909, "grad_norm": 1.9237068891525269, "learning_rate": 2.5497326203208557e-06, "loss": 0.06083056330680847, "num_input_tokens_seen": 4213396, "step": 4085, "train_runtime": 9935.7512, "train_tokens_per_second": 424.064 }, { "epoch": 1.7462335719628166, "grad_norm": 2.109754800796509, "learning_rate": 2.5454545454545456e-06, "loss": 0.06658701598644257, "num_input_tokens_seen": 4214486, "step": 4086, "train_runtime": 9937.8984, "train_tokens_per_second": 424.082 }, { "epoch": 1.7466609680521423, "grad_norm": 3.3641178607940674, "learning_rate": 2.541176470588235e-06, "loss": 0.10231752693653107, "num_input_tokens_seen": 4215466, "step": 4087, "train_runtime": 9939.9721, "train_tokens_per_second": 424.092 }, { "epoch": 1.747088364141468, "grad_norm": 1.9562214612960815, "learning_rate": 2.536898395721925e-06, "loss": 0.06954551488161087, "num_input_tokens_seen": 4216694, "step": 4088, "train_runtime": 9942.0867, "train_tokens_per_second": 424.126 }, { "epoch": 1.7475157602307938, "grad_norm": 4.043095111846924, "learning_rate": 2.532620320855615e-06, "loss": 0.08843319118022919, "num_input_tokens_seen": 4217480, "step": 4089, "train_runtime": 9944.131, "train_tokens_per_second": 424.118 }, { "epoch": 1.7479431563201198, "grad_norm": 2.893369197845459, "learning_rate": 2.5283422459893047e-06, "loss": 0.10958456993103027, "num_input_tokens_seen": 4218646, "step": 4090, "train_runtime": 9946.2599, "train_tokens_per_second": 424.144 }, { "epoch": 1.7483705524094455, "grad_norm": 2.7690653800964355, "learning_rate": 2.5240641711229945e-06, "loss": 0.06869184970855713, "num_input_tokens_seen": 4219358, "step": 4091, "train_runtime": 9948.2462, "train_tokens_per_second": 424.131 }, { "epoch": 1.7487979484987712, "grad_norm": 2.2930610179901123, "learning_rate": 2.5197860962566844e-06, "loss": 0.04717502370476723, "num_input_tokens_seen": 4220032, "step": 4092, "train_runtime": 9950.2352, "train_tokens_per_second": 424.114 }, { "epoch": 1.749225344588097, "grad_norm": 3.5082364082336426, "learning_rate": 2.5155080213903743e-06, "loss": 0.08688130974769592, "num_input_tokens_seen": 4220818, "step": 4093, "train_runtime": 9952.4075, "train_tokens_per_second": 424.1 }, { "epoch": 1.7496527406774227, "grad_norm": 2.0089828968048096, "learning_rate": 2.511229946524064e-06, "loss": 0.07756157964468002, "num_input_tokens_seen": 4221936, "step": 4094, "train_runtime": 9954.5544, "train_tokens_per_second": 424.121 }, { "epoch": 1.7500801367667487, "grad_norm": 2.7302162647247314, "learning_rate": 2.506951871657754e-06, "loss": 0.08377182483673096, "num_input_tokens_seen": 4223002, "step": 4095, "train_runtime": 9956.704, "train_tokens_per_second": 424.137 }, { "epoch": 1.7505075328560744, "grad_norm": 2.079789638519287, "learning_rate": 2.502673796791444e-06, "loss": 0.09523649513721466, "num_input_tokens_seen": 4224186, "step": 4096, "train_runtime": 9958.7805, "train_tokens_per_second": 424.167 }, { "epoch": 1.7509349289454001, "grad_norm": 2.611577272415161, "learning_rate": 2.498395721925134e-06, "loss": 0.06579362601041794, "num_input_tokens_seen": 4225136, "step": 4097, "train_runtime": 9960.8575, "train_tokens_per_second": 424.174 }, { "epoch": 1.7513623250347259, "grad_norm": 2.561326026916504, "learning_rate": 2.4941176470588236e-06, "loss": 0.06817270815372467, "num_input_tokens_seen": 4226086, "step": 4098, "train_runtime": 9962.9875, "train_tokens_per_second": 424.179 }, { "epoch": 1.7517897211240516, "grad_norm": 2.205995559692383, "learning_rate": 2.4898395721925135e-06, "loss": 0.08090948313474655, "num_input_tokens_seen": 4227154, "step": 4099, "train_runtime": 9965.069, "train_tokens_per_second": 424.197 }, { "epoch": 1.7522171172133776, "grad_norm": 2.5278356075286865, "learning_rate": 2.4855614973262034e-06, "loss": 0.06919476389884949, "num_input_tokens_seen": 4228074, "step": 4100, "train_runtime": 9967.1196, "train_tokens_per_second": 424.202 }, { "epoch": 1.7526445133027033, "grad_norm": 1.5690151453018188, "learning_rate": 2.4812834224598932e-06, "loss": 0.05812923237681389, "num_input_tokens_seen": 4229166, "step": 4101, "train_runtime": 9969.2039, "train_tokens_per_second": 424.223 }, { "epoch": 1.753071909392029, "grad_norm": 2.4146010875701904, "learning_rate": 2.477005347593583e-06, "loss": 0.09066355973482132, "num_input_tokens_seen": 4230220, "step": 4102, "train_runtime": 9971.328, "train_tokens_per_second": 424.238 }, { "epoch": 1.7534993054813548, "grad_norm": 2.908135175704956, "learning_rate": 2.472727272727273e-06, "loss": 0.0990167185664177, "num_input_tokens_seen": 4231336, "step": 4103, "train_runtime": 9973.4088, "train_tokens_per_second": 424.262 }, { "epoch": 1.7539267015706805, "grad_norm": 2.9105708599090576, "learning_rate": 2.468449197860963e-06, "loss": 0.07659521698951721, "num_input_tokens_seen": 4232484, "step": 4104, "train_runtime": 9975.561, "train_tokens_per_second": 424.285 }, { "epoch": 1.7543540976600065, "grad_norm": 0.8447878360748291, "learning_rate": 2.4641711229946527e-06, "loss": 0.023198440670967102, "num_input_tokens_seen": 4235772, "step": 4105, "train_runtime": 9978.1995, "train_tokens_per_second": 424.503 }, { "epoch": 1.7547814937493322, "grad_norm": 1.9445749521255493, "learning_rate": 2.4598930481283426e-06, "loss": 0.07758910208940506, "num_input_tokens_seen": 4237104, "step": 4106, "train_runtime": 9980.36, "train_tokens_per_second": 424.544 }, { "epoch": 1.755208889838658, "grad_norm": 2.8601250648498535, "learning_rate": 2.4556149732620324e-06, "loss": 0.1165383830666542, "num_input_tokens_seen": 4238502, "step": 4107, "train_runtime": 9982.5433, "train_tokens_per_second": 424.591 }, { "epoch": 1.7556362859279837, "grad_norm": 2.2085225582122803, "learning_rate": 2.4513368983957223e-06, "loss": 0.07841064035892487, "num_input_tokens_seen": 4239390, "step": 4108, "train_runtime": 9984.6094, "train_tokens_per_second": 424.592 }, { "epoch": 1.7560636820173094, "grad_norm": 2.3799362182617188, "learning_rate": 2.447058823529412e-06, "loss": 0.05659405514597893, "num_input_tokens_seen": 4240352, "step": 4109, "train_runtime": 9986.7061, "train_tokens_per_second": 424.6 }, { "epoch": 1.7564910781066354, "grad_norm": 3.6929924488067627, "learning_rate": 2.442780748663102e-06, "loss": 0.11274654418230057, "num_input_tokens_seen": 4241222, "step": 4110, "train_runtime": 9988.7818, "train_tokens_per_second": 424.599 }, { "epoch": 1.7569184741959611, "grad_norm": 2.2679834365844727, "learning_rate": 2.4385026737967915e-06, "loss": 0.059855926781892776, "num_input_tokens_seen": 4241998, "step": 4111, "train_runtime": 9997.4047, "train_tokens_per_second": 424.31 }, { "epoch": 1.7573458702852869, "grad_norm": 1.7819002866744995, "learning_rate": 2.4342245989304814e-06, "loss": 0.06576694548130035, "num_input_tokens_seen": 4243686, "step": 4112, "train_runtime": 9999.723, "train_tokens_per_second": 424.38 }, { "epoch": 1.7577732663746126, "grad_norm": 1.7435522079467773, "learning_rate": 2.4299465240641712e-06, "loss": 0.07108808308839798, "num_input_tokens_seen": 4245760, "step": 4113, "train_runtime": 10002.1461, "train_tokens_per_second": 424.485 }, { "epoch": 1.7582006624639384, "grad_norm": 4.905389785766602, "learning_rate": 2.425668449197861e-06, "loss": 0.13813750445842743, "num_input_tokens_seen": 4246502, "step": 4114, "train_runtime": 10004.1666, "train_tokens_per_second": 424.473 }, { "epoch": 1.7586280585532643, "grad_norm": 2.568931818008423, "learning_rate": 2.421390374331551e-06, "loss": 0.10430927574634552, "num_input_tokens_seen": 4247572, "step": 4115, "train_runtime": 10006.2875, "train_tokens_per_second": 424.49 }, { "epoch": 1.75905545464259, "grad_norm": 3.5114471912384033, "learning_rate": 2.417112299465241e-06, "loss": 0.11384786665439606, "num_input_tokens_seen": 4248364, "step": 4116, "train_runtime": 10008.3559, "train_tokens_per_second": 424.482 }, { "epoch": 1.7594828507319158, "grad_norm": 3.654829502105713, "learning_rate": 2.4128342245989307e-06, "loss": 0.08320469409227371, "num_input_tokens_seen": 4249160, "step": 4117, "train_runtime": 10010.4983, "train_tokens_per_second": 424.47 }, { "epoch": 1.7599102468212415, "grad_norm": 2.2291922569274902, "learning_rate": 2.4085561497326206e-06, "loss": 0.0989278107881546, "num_input_tokens_seen": 4250340, "step": 4118, "train_runtime": 10012.6239, "train_tokens_per_second": 424.498 }, { "epoch": 1.7603376429105673, "grad_norm": 3.1687824726104736, "learning_rate": 2.4042780748663104e-06, "loss": 0.09292609989643097, "num_input_tokens_seen": 4250860, "step": 4119, "train_runtime": 10014.6076, "train_tokens_per_second": 424.466 }, { "epoch": 1.7607650389998932, "grad_norm": 4.733868598937988, "learning_rate": 2.4000000000000003e-06, "loss": 0.09295797348022461, "num_input_tokens_seen": 4251376, "step": 4120, "train_runtime": 10016.6047, "train_tokens_per_second": 424.433 }, { "epoch": 1.761192435089219, "grad_norm": 2.754350185394287, "learning_rate": 2.3957219251336898e-06, "loss": 0.10203735530376434, "num_input_tokens_seen": 4252416, "step": 4121, "train_runtime": 10018.7618, "train_tokens_per_second": 424.445 }, { "epoch": 1.7616198311785447, "grad_norm": 3.1365554332733154, "learning_rate": 2.3914438502673796e-06, "loss": 0.08412344753742218, "num_input_tokens_seen": 4253334, "step": 4122, "train_runtime": 10020.8355, "train_tokens_per_second": 424.449 }, { "epoch": 1.7620472272678707, "grad_norm": 2.3730523586273193, "learning_rate": 2.3871657754010695e-06, "loss": 0.09628761559724808, "num_input_tokens_seen": 4254330, "step": 4123, "train_runtime": 10022.9015, "train_tokens_per_second": 424.461 }, { "epoch": 1.7624746233571962, "grad_norm": 2.632103443145752, "learning_rate": 2.3828877005347594e-06, "loss": 0.06915301084518433, "num_input_tokens_seen": 4255110, "step": 4124, "train_runtime": 10024.9271, "train_tokens_per_second": 424.453 }, { "epoch": 1.7629020194465221, "grad_norm": 2.8245201110839844, "learning_rate": 2.3786096256684492e-06, "loss": 0.11383970081806183, "num_input_tokens_seen": 4256130, "step": 4125, "train_runtime": 10026.9951, "train_tokens_per_second": 424.467 }, { "epoch": 1.7633294155358479, "grad_norm": 1.8119213581085205, "learning_rate": 2.374331550802139e-06, "loss": 0.06335105001926422, "num_input_tokens_seen": 4257098, "step": 4126, "train_runtime": 10029.1057, "train_tokens_per_second": 424.474 }, { "epoch": 1.7637568116251736, "grad_norm": 2.3820314407348633, "learning_rate": 2.370053475935829e-06, "loss": 0.05974426120519638, "num_input_tokens_seen": 4258012, "step": 4127, "train_runtime": 10031.149, "train_tokens_per_second": 424.479 }, { "epoch": 1.7641842077144996, "grad_norm": 2.4769506454467773, "learning_rate": 2.365775401069519e-06, "loss": 0.0872613787651062, "num_input_tokens_seen": 4259294, "step": 4128, "train_runtime": 10033.33, "train_tokens_per_second": 424.514 }, { "epoch": 1.764611603803825, "grad_norm": 3.7077057361602783, "learning_rate": 2.3614973262032087e-06, "loss": 0.09083158522844315, "num_input_tokens_seen": 4259914, "step": 4129, "train_runtime": 10035.3922, "train_tokens_per_second": 424.489 }, { "epoch": 1.765038999893151, "grad_norm": 2.7601659297943115, "learning_rate": 2.3572192513368986e-06, "loss": 0.09662850201129913, "num_input_tokens_seen": 4261544, "step": 4130, "train_runtime": 10037.5959, "train_tokens_per_second": 424.558 }, { "epoch": 1.7654663959824768, "grad_norm": 2.9929752349853516, "learning_rate": 2.3529411764705885e-06, "loss": 0.11560578644275665, "num_input_tokens_seen": 4262430, "step": 4131, "train_runtime": 10039.6551, "train_tokens_per_second": 424.559 }, { "epoch": 1.7658937920718025, "grad_norm": 2.1190741062164307, "learning_rate": 2.3486631016042783e-06, "loss": 0.07116225361824036, "num_input_tokens_seen": 4263670, "step": 4132, "train_runtime": 10041.8177, "train_tokens_per_second": 424.591 }, { "epoch": 1.7663211881611285, "grad_norm": 3.2644152641296387, "learning_rate": 2.344385026737968e-06, "loss": 0.07705575227737427, "num_input_tokens_seen": 4264428, "step": 4133, "train_runtime": 10043.804, "train_tokens_per_second": 424.583 }, { "epoch": 1.766748584250454, "grad_norm": 2.477987766265869, "learning_rate": 2.340106951871658e-06, "loss": 0.09856512397527695, "num_input_tokens_seen": 4265356, "step": 4134, "train_runtime": 10045.8467, "train_tokens_per_second": 424.589 }, { "epoch": 1.76717598033978, "grad_norm": 3.3949313163757324, "learning_rate": 2.335828877005348e-06, "loss": 0.06697557866573334, "num_input_tokens_seen": 4266166, "step": 4135, "train_runtime": 10047.9783, "train_tokens_per_second": 424.58 }, { "epoch": 1.7676033764291057, "grad_norm": 1.8965554237365723, "learning_rate": 2.331550802139038e-06, "loss": 0.05955762788653374, "num_input_tokens_seen": 4267620, "step": 4136, "train_runtime": 10050.1818, "train_tokens_per_second": 424.631 }, { "epoch": 1.7680307725184314, "grad_norm": 2.752488613128662, "learning_rate": 2.3272727272727277e-06, "loss": 0.11746864020824432, "num_input_tokens_seen": 4268660, "step": 4137, "train_runtime": 10052.2944, "train_tokens_per_second": 424.645 }, { "epoch": 1.7684581686077574, "grad_norm": 2.6332907676696777, "learning_rate": 2.322994652406417e-06, "loss": 0.12384096533060074, "num_input_tokens_seen": 4269578, "step": 4138, "train_runtime": 10054.3228, "train_tokens_per_second": 424.651 }, { "epoch": 1.768885564697083, "grad_norm": 3.09279203414917, "learning_rate": 2.318716577540107e-06, "loss": 0.13293305039405823, "num_input_tokens_seen": 4270384, "step": 4139, "train_runtime": 10056.4416, "train_tokens_per_second": 424.642 }, { "epoch": 1.7693129607864089, "grad_norm": 2.9126484394073486, "learning_rate": 2.314438502673797e-06, "loss": 0.08366966992616653, "num_input_tokens_seen": 4271052, "step": 4140, "train_runtime": 10058.496, "train_tokens_per_second": 424.621 }, { "epoch": 1.7697403568757346, "grad_norm": 2.05039119720459, "learning_rate": 2.3101604278074867e-06, "loss": 0.06966466456651688, "num_input_tokens_seen": 4272154, "step": 4141, "train_runtime": 10067.2058, "train_tokens_per_second": 424.363 }, { "epoch": 1.7701677529650603, "grad_norm": 6.64882230758667, "learning_rate": 2.3058823529411766e-06, "loss": 0.1252056360244751, "num_input_tokens_seen": 4273542, "step": 4142, "train_runtime": 10069.4974, "train_tokens_per_second": 424.405 }, { "epoch": 1.7705951490543863, "grad_norm": 2.516887903213501, "learning_rate": 2.3016042780748665e-06, "loss": 0.08751989901065826, "num_input_tokens_seen": 4274804, "step": 4143, "train_runtime": 10071.6472, "train_tokens_per_second": 424.439 }, { "epoch": 1.7710225451437118, "grad_norm": 2.1285414695739746, "learning_rate": 2.2973262032085563e-06, "loss": 0.053270213305950165, "num_input_tokens_seen": 4275670, "step": 4144, "train_runtime": 10073.7397, "train_tokens_per_second": 424.437 }, { "epoch": 1.7714499412330378, "grad_norm": 2.652456760406494, "learning_rate": 2.293048128342246e-06, "loss": 0.1015603318810463, "num_input_tokens_seen": 4276688, "step": 4145, "train_runtime": 10075.9339, "train_tokens_per_second": 424.446 }, { "epoch": 1.7718773373223635, "grad_norm": 3.2553443908691406, "learning_rate": 2.288770053475936e-06, "loss": 0.045736778527498245, "num_input_tokens_seen": 4277754, "step": 4146, "train_runtime": 10078.0324, "train_tokens_per_second": 424.463 }, { "epoch": 1.7723047334116893, "grad_norm": 1.8532472848892212, "learning_rate": 2.284491978609626e-06, "loss": 0.05074065551161766, "num_input_tokens_seen": 4279168, "step": 4147, "train_runtime": 10080.2279, "train_tokens_per_second": 424.511 }, { "epoch": 1.7727321295010152, "grad_norm": 4.018914222717285, "learning_rate": 2.280213903743316e-06, "loss": 0.09143203496932983, "num_input_tokens_seen": 4280070, "step": 4148, "train_runtime": 10082.3833, "train_tokens_per_second": 424.51 }, { "epoch": 1.7731595255903407, "grad_norm": 2.661940336227417, "learning_rate": 2.2759358288770057e-06, "loss": 0.06518501043319702, "num_input_tokens_seen": 4280832, "step": 4149, "train_runtime": 10084.4795, "train_tokens_per_second": 424.497 }, { "epoch": 1.7735869216796667, "grad_norm": 2.9754836559295654, "learning_rate": 2.2716577540106955e-06, "loss": 0.10202857851982117, "num_input_tokens_seen": 4281788, "step": 4150, "train_runtime": 10086.6366, "train_tokens_per_second": 424.501 }, { "epoch": 1.7740143177689924, "grad_norm": 2.1830055713653564, "learning_rate": 2.2673796791443854e-06, "loss": 0.09176403284072876, "num_input_tokens_seen": 4282852, "step": 4151, "train_runtime": 10088.7505, "train_tokens_per_second": 424.518 }, { "epoch": 1.7744417138583182, "grad_norm": 2.747210741043091, "learning_rate": 2.2631016042780753e-06, "loss": 0.0665617287158966, "num_input_tokens_seen": 4283954, "step": 4152, "train_runtime": 10090.8863, "train_tokens_per_second": 424.537 }, { "epoch": 1.7748691099476441, "grad_norm": 2.524003267288208, "learning_rate": 2.258823529411765e-06, "loss": 0.06814989447593689, "num_input_tokens_seen": 4284948, "step": 4153, "train_runtime": 10092.9774, "train_tokens_per_second": 424.547 }, { "epoch": 1.7752965060369696, "grad_norm": 2.7492380142211914, "learning_rate": 2.254545454545455e-06, "loss": 0.05960290879011154, "num_input_tokens_seen": 4285532, "step": 4154, "train_runtime": 10094.9334, "train_tokens_per_second": 424.523 }, { "epoch": 1.7757239021262956, "grad_norm": 3.7199904918670654, "learning_rate": 2.2502673796791445e-06, "loss": 0.07417763769626617, "num_input_tokens_seen": 4286168, "step": 4155, "train_runtime": 10096.9256, "train_tokens_per_second": 424.502 }, { "epoch": 1.7761512982156213, "grad_norm": 3.869108200073242, "learning_rate": 2.2459893048128343e-06, "loss": 0.11099082976579666, "num_input_tokens_seen": 4287070, "step": 4156, "train_runtime": 10099.0213, "train_tokens_per_second": 424.504 }, { "epoch": 1.776578694304947, "grad_norm": 1.6349960565567017, "learning_rate": 2.241711229946524e-06, "loss": 0.06269954890012741, "num_input_tokens_seen": 4288172, "step": 4157, "train_runtime": 10101.1429, "train_tokens_per_second": 424.523 }, { "epoch": 1.777006090394273, "grad_norm": 3.589787244796753, "learning_rate": 2.237433155080214e-06, "loss": 0.11880078166723251, "num_input_tokens_seen": 4289372, "step": 4158, "train_runtime": 10103.2914, "train_tokens_per_second": 424.552 }, { "epoch": 1.7774334864835986, "grad_norm": 2.6562845706939697, "learning_rate": 2.233155080213904e-06, "loss": 0.08049595355987549, "num_input_tokens_seen": 4290176, "step": 4159, "train_runtime": 10105.3247, "train_tokens_per_second": 424.546 }, { "epoch": 1.7778608825729245, "grad_norm": 2.513578176498413, "learning_rate": 2.228877005347594e-06, "loss": 0.07048610597848892, "num_input_tokens_seen": 4291510, "step": 4160, "train_runtime": 10107.5173, "train_tokens_per_second": 424.586 }, { "epoch": 1.7782882786622503, "grad_norm": 2.304647922515869, "learning_rate": 2.2245989304812837e-06, "loss": 0.08331170678138733, "num_input_tokens_seen": 4293014, "step": 4161, "train_runtime": 10109.7267, "train_tokens_per_second": 424.642 }, { "epoch": 1.778715674751576, "grad_norm": 2.37117075920105, "learning_rate": 2.2203208556149736e-06, "loss": 0.07144568860530853, "num_input_tokens_seen": 4294276, "step": 4162, "train_runtime": 10111.8785, "train_tokens_per_second": 424.676 }, { "epoch": 1.779143070840902, "grad_norm": 1.9806787967681885, "learning_rate": 2.2160427807486634e-06, "loss": 0.09877417981624603, "num_input_tokens_seen": 4296278, "step": 4163, "train_runtime": 10114.2189, "train_tokens_per_second": 424.776 }, { "epoch": 1.7795704669302275, "grad_norm": 3.70646071434021, "learning_rate": 2.2117647058823533e-06, "loss": 0.12689195573329926, "num_input_tokens_seen": 4297462, "step": 4164, "train_runtime": 10116.3629, "train_tokens_per_second": 424.803 }, { "epoch": 1.7799978630195534, "grad_norm": 3.1241819858551025, "learning_rate": 2.2074866310160427e-06, "loss": 0.13027304410934448, "num_input_tokens_seen": 4298580, "step": 4165, "train_runtime": 10118.5039, "train_tokens_per_second": 424.824 }, { "epoch": 1.7804252591088792, "grad_norm": 3.3830180168151855, "learning_rate": 2.2032085561497326e-06, "loss": 0.05383117496967316, "num_input_tokens_seen": 4299384, "step": 4166, "train_runtime": 10120.5879, "train_tokens_per_second": 424.816 }, { "epoch": 1.780852655198205, "grad_norm": 2.9454708099365234, "learning_rate": 2.1989304812834225e-06, "loss": 0.10949993133544922, "num_input_tokens_seen": 4300460, "step": 4167, "train_runtime": 10122.6941, "train_tokens_per_second": 424.834 }, { "epoch": 1.7812800512875309, "grad_norm": 2.278724193572998, "learning_rate": 2.1946524064171123e-06, "loss": 0.05804029852151871, "num_input_tokens_seen": 4301430, "step": 4168, "train_runtime": 10124.7782, "train_tokens_per_second": 424.842 }, { "epoch": 1.7817074473768564, "grad_norm": 3.620959520339966, "learning_rate": 2.1903743315508022e-06, "loss": 0.09964598715305328, "num_input_tokens_seen": 4302226, "step": 4169, "train_runtime": 10126.8278, "train_tokens_per_second": 424.835 }, { "epoch": 1.7821348434661823, "grad_norm": 2.205592155456543, "learning_rate": 2.186096256684492e-06, "loss": 0.06786753237247467, "num_input_tokens_seen": 4303312, "step": 4170, "train_runtime": 10128.9207, "train_tokens_per_second": 424.854 }, { "epoch": 1.782562239555508, "grad_norm": 2.3895227909088135, "learning_rate": 2.181818181818182e-06, "loss": 0.0730641633272171, "num_input_tokens_seen": 4304234, "step": 4171, "train_runtime": 10137.7764, "train_tokens_per_second": 424.574 }, { "epoch": 1.7829896356448338, "grad_norm": 2.5390784740448, "learning_rate": 2.177540106951872e-06, "loss": 0.09327578544616699, "num_input_tokens_seen": 4305306, "step": 4172, "train_runtime": 10139.8546, "train_tokens_per_second": 424.592 }, { "epoch": 1.7834170317341598, "grad_norm": 2.7873785495758057, "learning_rate": 2.1732620320855617e-06, "loss": 0.09051096439361572, "num_input_tokens_seen": 4306410, "step": 4173, "train_runtime": 10142.0027, "train_tokens_per_second": 424.611 }, { "epoch": 1.7838444278234853, "grad_norm": 3.297451972961426, "learning_rate": 2.1689839572192516e-06, "loss": 0.09052055329084396, "num_input_tokens_seen": 4307580, "step": 4174, "train_runtime": 10144.1521, "train_tokens_per_second": 424.637 }, { "epoch": 1.7842718239128113, "grad_norm": 2.5635032653808594, "learning_rate": 2.1647058823529414e-06, "loss": 0.09134936332702637, "num_input_tokens_seen": 4308534, "step": 4175, "train_runtime": 10146.2869, "train_tokens_per_second": 424.641 }, { "epoch": 1.784699220002137, "grad_norm": 2.7687714099884033, "learning_rate": 2.1604278074866313e-06, "loss": 0.06639499962329865, "num_input_tokens_seen": 4309642, "step": 4176, "train_runtime": 10148.471, "train_tokens_per_second": 424.659 }, { "epoch": 1.7851266160914627, "grad_norm": 1.0155085325241089, "learning_rate": 2.156149732620321e-06, "loss": 0.02201678417623043, "num_input_tokens_seen": 4311094, "step": 4177, "train_runtime": 10150.726, "train_tokens_per_second": 424.708 }, { "epoch": 1.7855540121807887, "grad_norm": 3.3319475650787354, "learning_rate": 2.1518716577540106e-06, "loss": 0.08600349724292755, "num_input_tokens_seen": 4312188, "step": 4178, "train_runtime": 10152.8724, "train_tokens_per_second": 424.726 }, { "epoch": 1.7859814082701142, "grad_norm": 2.815528154373169, "learning_rate": 2.1475935828877005e-06, "loss": 0.10754726827144623, "num_input_tokens_seen": 4313186, "step": 4179, "train_runtime": 10155.0108, "train_tokens_per_second": 424.735 }, { "epoch": 1.7864088043594402, "grad_norm": 2.539433479309082, "learning_rate": 2.1433155080213903e-06, "loss": 0.05385895073413849, "num_input_tokens_seen": 4314234, "step": 4180, "train_runtime": 10157.1143, "train_tokens_per_second": 424.75 }, { "epoch": 1.786836200448766, "grad_norm": 2.4351701736450195, "learning_rate": 2.1390374331550802e-06, "loss": 0.06828010082244873, "num_input_tokens_seen": 4315652, "step": 4181, "train_runtime": 10159.2915, "train_tokens_per_second": 424.799 }, { "epoch": 1.7872635965380916, "grad_norm": 2.82084584236145, "learning_rate": 2.13475935828877e-06, "loss": 0.1077570989727974, "num_input_tokens_seen": 4316662, "step": 4182, "train_runtime": 10161.3753, "train_tokens_per_second": 424.811 }, { "epoch": 1.7876909926274176, "grad_norm": 2.325443983078003, "learning_rate": 2.13048128342246e-06, "loss": 0.060035690665245056, "num_input_tokens_seen": 4317734, "step": 4183, "train_runtime": 10163.751, "train_tokens_per_second": 424.817 }, { "epoch": 1.7881183887167431, "grad_norm": 2.2599000930786133, "learning_rate": 2.12620320855615e-06, "loss": 0.07673176378011703, "num_input_tokens_seen": 4318806, "step": 4184, "train_runtime": 10165.9375, "train_tokens_per_second": 424.831 }, { "epoch": 1.788545784806069, "grad_norm": 3.37270450592041, "learning_rate": 2.1219251336898397e-06, "loss": 0.0735541582107544, "num_input_tokens_seen": 4319504, "step": 4185, "train_runtime": 10167.9206, "train_tokens_per_second": 424.817 }, { "epoch": 1.7889731808953948, "grad_norm": 2.5903313159942627, "learning_rate": 2.1176470588235296e-06, "loss": 0.06701052188873291, "num_input_tokens_seen": 4320308, "step": 4186, "train_runtime": 10169.9027, "train_tokens_per_second": 424.813 }, { "epoch": 1.7894005769847205, "grad_norm": 2.4194836616516113, "learning_rate": 2.1133689839572194e-06, "loss": 0.06429250538349152, "num_input_tokens_seen": 4321020, "step": 4187, "train_runtime": 10171.926, "train_tokens_per_second": 424.799 }, { "epoch": 1.7898279730740465, "grad_norm": 3.2498037815093994, "learning_rate": 2.1090909090909093e-06, "loss": 0.0883617103099823, "num_input_tokens_seen": 4321884, "step": 4188, "train_runtime": 10173.9571, "train_tokens_per_second": 424.799 }, { "epoch": 1.790255369163372, "grad_norm": 2.4744582176208496, "learning_rate": 2.104812834224599e-06, "loss": 0.08810482174158096, "num_input_tokens_seen": 4323212, "step": 4189, "train_runtime": 10176.1393, "train_tokens_per_second": 424.838 }, { "epoch": 1.790682765252698, "grad_norm": 2.7591638565063477, "learning_rate": 2.100534759358289e-06, "loss": 0.10325776785612106, "num_input_tokens_seen": 4324356, "step": 4190, "train_runtime": 10178.289, "train_tokens_per_second": 424.861 }, { "epoch": 1.7911101613420237, "grad_norm": 2.6523334980010986, "learning_rate": 2.096256684491979e-06, "loss": 0.06592361629009247, "num_input_tokens_seen": 4325268, "step": 4191, "train_runtime": 10180.3928, "train_tokens_per_second": 424.863 }, { "epoch": 1.7915375574313495, "grad_norm": 2.4090828895568848, "learning_rate": 2.0919786096256688e-06, "loss": 0.056853655725717545, "num_input_tokens_seen": 4326220, "step": 4192, "train_runtime": 10182.5222, "train_tokens_per_second": 424.867 }, { "epoch": 1.7919649535206754, "grad_norm": 2.418062448501587, "learning_rate": 2.0877005347593586e-06, "loss": 0.05139508843421936, "num_input_tokens_seen": 4327088, "step": 4193, "train_runtime": 10184.5981, "train_tokens_per_second": 424.866 }, { "epoch": 1.792392349610001, "grad_norm": 2.09745454788208, "learning_rate": 2.0834224598930485e-06, "loss": 0.05079510807991028, "num_input_tokens_seen": 4327884, "step": 4194, "train_runtime": 10186.6784, "train_tokens_per_second": 424.857 }, { "epoch": 1.792819745699327, "grad_norm": 4.581893444061279, "learning_rate": 2.079144385026738e-06, "loss": 0.08980727195739746, "num_input_tokens_seen": 4328774, "step": 4195, "train_runtime": 10188.7502, "train_tokens_per_second": 424.858 }, { "epoch": 1.7932471417886526, "grad_norm": 2.814441680908203, "learning_rate": 2.074866310160428e-06, "loss": 0.09988869726657867, "num_input_tokens_seen": 4329770, "step": 4196, "train_runtime": 10190.9104, "train_tokens_per_second": 424.866 }, { "epoch": 1.7936745378779784, "grad_norm": 4.073714733123779, "learning_rate": 2.0705882352941177e-06, "loss": 0.08503936231136322, "num_input_tokens_seen": 4330684, "step": 4197, "train_runtime": 10192.9942, "train_tokens_per_second": 424.869 }, { "epoch": 1.7941019339673043, "grad_norm": 3.4864861965179443, "learning_rate": 2.0663101604278076e-06, "loss": 0.10185601562261581, "num_input_tokens_seen": 4331352, "step": 4198, "train_runtime": 10195.0279, "train_tokens_per_second": 424.849 }, { "epoch": 1.7945293300566298, "grad_norm": 1.7800720930099487, "learning_rate": 2.0620320855614974e-06, "loss": 0.06571541726589203, "num_input_tokens_seen": 4332626, "step": 4199, "train_runtime": 10197.1716, "train_tokens_per_second": 424.885 }, { "epoch": 1.7949567261459558, "grad_norm": 2.510011672973633, "learning_rate": 2.0577540106951873e-06, "loss": 0.06940654665231705, "num_input_tokens_seen": 4333764, "step": 4200, "train_runtime": 10199.2971, "train_tokens_per_second": 424.908 }, { "epoch": 1.7953841222352815, "grad_norm": 3.0646040439605713, "learning_rate": 2.053475935828877e-06, "loss": 0.10401661694049835, "num_input_tokens_seen": 4334726, "step": 4201, "train_runtime": 10207.5723, "train_tokens_per_second": 424.658 }, { "epoch": 1.7958115183246073, "grad_norm": 1.9562426805496216, "learning_rate": 2.049197860962567e-06, "loss": 0.0695512443780899, "num_input_tokens_seen": 4335492, "step": 4202, "train_runtime": 10209.6111, "train_tokens_per_second": 424.648 }, { "epoch": 1.7962389144139332, "grad_norm": 2.9338138103485107, "learning_rate": 2.044919786096257e-06, "loss": 0.10441028326749802, "num_input_tokens_seen": 4336322, "step": 4203, "train_runtime": 10211.7639, "train_tokens_per_second": 424.64 }, { "epoch": 1.7966663105032588, "grad_norm": 4.342402458190918, "learning_rate": 2.0406417112299468e-06, "loss": 0.13860847055912018, "num_input_tokens_seen": 4337018, "step": 4204, "train_runtime": 10213.7773, "train_tokens_per_second": 424.624 }, { "epoch": 1.7970937065925847, "grad_norm": 2.9212000370025635, "learning_rate": 2.0363636363636367e-06, "loss": 0.125177264213562, "num_input_tokens_seen": 4338166, "step": 4205, "train_runtime": 10215.8773, "train_tokens_per_second": 424.649 }, { "epoch": 1.7975211026819105, "grad_norm": 2.952876329421997, "learning_rate": 2.0320855614973265e-06, "loss": 0.06996580213308334, "num_input_tokens_seen": 4338910, "step": 4206, "train_runtime": 10217.8616, "train_tokens_per_second": 424.64 }, { "epoch": 1.7979484987712362, "grad_norm": 2.904758930206299, "learning_rate": 2.0278074866310164e-06, "loss": 0.08176860958337784, "num_input_tokens_seen": 4339978, "step": 4207, "train_runtime": 10219.9939, "train_tokens_per_second": 424.656 }, { "epoch": 1.7983758948605622, "grad_norm": 2.9267780780792236, "learning_rate": 2.0235294117647063e-06, "loss": 0.09859760850667953, "num_input_tokens_seen": 4340940, "step": 4208, "train_runtime": 10222.0483, "train_tokens_per_second": 424.664 }, { "epoch": 1.7988032909498877, "grad_norm": 1.7343788146972656, "learning_rate": 2.019251336898396e-06, "loss": 0.07872038334608078, "num_input_tokens_seen": 4342710, "step": 4209, "train_runtime": 10224.2927, "train_tokens_per_second": 424.744 }, { "epoch": 1.7992306870392136, "grad_norm": 2.0737686157226562, "learning_rate": 2.014973262032086e-06, "loss": 0.0616140216588974, "num_input_tokens_seen": 4343668, "step": 4210, "train_runtime": 10226.4916, "train_tokens_per_second": 424.747 }, { "epoch": 1.7996580831285394, "grad_norm": 2.372847557067871, "learning_rate": 2.010695187165776e-06, "loss": 0.06419747322797775, "num_input_tokens_seen": 4344736, "step": 4211, "train_runtime": 10228.587, "train_tokens_per_second": 424.764 }, { "epoch": 1.800085479217865, "grad_norm": 3.0257482528686523, "learning_rate": 2.0064171122994653e-06, "loss": 0.0916258916258812, "num_input_tokens_seen": 4345612, "step": 4212, "train_runtime": 10230.7065, "train_tokens_per_second": 424.762 }, { "epoch": 1.800085479217865, "eval_loss": 0.516430139541626, "eval_runtime": 58.8158, "eval_samples_per_second": 16.968, "eval_steps_per_second": 8.484, "num_input_tokens_seen": 4345612, "step": 4212 }, { "epoch": 1.800512875307191, "grad_norm": 2.602503538131714, "learning_rate": 2.002139037433155e-06, "loss": 0.07492129504680634, "num_input_tokens_seen": 4346522, "step": 4213, "train_runtime": 10291.6688, "train_tokens_per_second": 422.334 }, { "epoch": 1.8009402713965166, "grad_norm": 2.025399923324585, "learning_rate": 1.997860962566845e-06, "loss": 0.0645725354552269, "num_input_tokens_seen": 4347472, "step": 4214, "train_runtime": 10293.7741, "train_tokens_per_second": 422.34 }, { "epoch": 1.8013676674858425, "grad_norm": 2.352571487426758, "learning_rate": 1.993582887700535e-06, "loss": 0.06522589921951294, "num_input_tokens_seen": 4348344, "step": 4215, "train_runtime": 10295.8063, "train_tokens_per_second": 422.341 }, { "epoch": 1.8017950635751683, "grad_norm": 2.581906318664551, "learning_rate": 1.989304812834225e-06, "loss": 0.08330638706684113, "num_input_tokens_seen": 4349248, "step": 4216, "train_runtime": 10297.8939, "train_tokens_per_second": 422.343 }, { "epoch": 1.802222459664494, "grad_norm": 2.9776909351348877, "learning_rate": 1.9850267379679147e-06, "loss": 0.08715388178825378, "num_input_tokens_seen": 4350126, "step": 4217, "train_runtime": 10300.0, "train_tokens_per_second": 422.342 }, { "epoch": 1.80264985575382, "grad_norm": 3.07016921043396, "learning_rate": 1.9807486631016045e-06, "loss": 0.08147434890270233, "num_input_tokens_seen": 4351160, "step": 4218, "train_runtime": 10302.1379, "train_tokens_per_second": 422.355 }, { "epoch": 1.8030772518431455, "grad_norm": 3.6859567165374756, "learning_rate": 1.976470588235294e-06, "loss": 0.10586757957935333, "num_input_tokens_seen": 4352062, "step": 4219, "train_runtime": 10304.2467, "train_tokens_per_second": 422.356 }, { "epoch": 1.8035046479324714, "grad_norm": 3.480611562728882, "learning_rate": 1.972192513368984e-06, "loss": 0.10214269161224365, "num_input_tokens_seen": 4352884, "step": 4220, "train_runtime": 10306.3509, "train_tokens_per_second": 422.35 }, { "epoch": 1.8039320440217972, "grad_norm": 1.4777809381484985, "learning_rate": 1.9679144385026737e-06, "loss": 0.03467395901679993, "num_input_tokens_seen": 4353774, "step": 4221, "train_runtime": 10308.5142, "train_tokens_per_second": 422.347 }, { "epoch": 1.804359440111123, "grad_norm": 3.580695867538452, "learning_rate": 1.9636363636363636e-06, "loss": 0.15541917085647583, "num_input_tokens_seen": 4354676, "step": 4222, "train_runtime": 10310.6271, "train_tokens_per_second": 422.348 }, { "epoch": 1.8047868362004489, "grad_norm": 3.125870704650879, "learning_rate": 1.9593582887700535e-06, "loss": 0.12012460827827454, "num_input_tokens_seen": 4355650, "step": 4223, "train_runtime": 10312.6946, "train_tokens_per_second": 422.358 }, { "epoch": 1.8052142322897744, "grad_norm": 2.353468418121338, "learning_rate": 1.9550802139037433e-06, "loss": 0.06727476418018341, "num_input_tokens_seen": 4356400, "step": 4224, "train_runtime": 10314.7224, "train_tokens_per_second": 422.348 }, { "epoch": 1.8056416283791004, "grad_norm": 2.358220338821411, "learning_rate": 1.950802139037433e-06, "loss": 0.058052562177181244, "num_input_tokens_seen": 4357492, "step": 4225, "train_runtime": 10316.874, "train_tokens_per_second": 422.366 }, { "epoch": 1.806069024468426, "grad_norm": 2.201442003250122, "learning_rate": 1.946524064171123e-06, "loss": 0.06703916192054749, "num_input_tokens_seen": 4358234, "step": 4226, "train_runtime": 10318.9588, "train_tokens_per_second": 422.352 }, { "epoch": 1.8064964205577518, "grad_norm": 3.906421661376953, "learning_rate": 1.942245989304813e-06, "loss": 0.10453782230615616, "num_input_tokens_seen": 4358950, "step": 4227, "train_runtime": 10320.9959, "train_tokens_per_second": 422.338 }, { "epoch": 1.8069238166470778, "grad_norm": 2.7399024963378906, "learning_rate": 1.937967914438503e-06, "loss": 0.08963947743177414, "num_input_tokens_seen": 4360108, "step": 4228, "train_runtime": 10323.1325, "train_tokens_per_second": 422.363 }, { "epoch": 1.8073512127364033, "grad_norm": 2.3357512950897217, "learning_rate": 1.9336898395721927e-06, "loss": 0.05593331530690193, "num_input_tokens_seen": 4361226, "step": 4229, "train_runtime": 10325.2355, "train_tokens_per_second": 422.385 }, { "epoch": 1.8077786088257293, "grad_norm": 2.3317689895629883, "learning_rate": 1.9294117647058825e-06, "loss": 0.05253561586141586, "num_input_tokens_seen": 4361912, "step": 4230, "train_runtime": 10327.3185, "train_tokens_per_second": 422.366 }, { "epoch": 1.808206004915055, "grad_norm": 2.3263156414031982, "learning_rate": 1.9251336898395724e-06, "loss": 0.07395733892917633, "num_input_tokens_seen": 4362986, "step": 4231, "train_runtime": 10336.0993, "train_tokens_per_second": 422.111 }, { "epoch": 1.8086334010043807, "grad_norm": 2.877946376800537, "learning_rate": 1.9208556149732623e-06, "loss": 0.0581427700817585, "num_input_tokens_seen": 4363844, "step": 4232, "train_runtime": 10338.265, "train_tokens_per_second": 422.106 }, { "epoch": 1.8090607970937067, "grad_norm": 2.5502960681915283, "learning_rate": 1.916577540106952e-06, "loss": 0.06419610232114792, "num_input_tokens_seen": 4364784, "step": 4233, "train_runtime": 10340.4309, "train_tokens_per_second": 422.109 }, { "epoch": 1.8094881931830322, "grad_norm": 1.6813851594924927, "learning_rate": 1.912299465240642e-06, "loss": 0.04561107978224754, "num_input_tokens_seen": 4366032, "step": 4234, "train_runtime": 10342.6218, "train_tokens_per_second": 422.14 }, { "epoch": 1.8099155892723582, "grad_norm": 2.87347412109375, "learning_rate": 1.9080213903743315e-06, "loss": 0.09780064225196838, "num_input_tokens_seen": 4366842, "step": 4235, "train_runtime": 10344.6807, "train_tokens_per_second": 422.134 }, { "epoch": 1.810342985361684, "grad_norm": 1.9329286813735962, "learning_rate": 1.9037433155080215e-06, "loss": 0.09178803861141205, "num_input_tokens_seen": 4368430, "step": 4236, "train_runtime": 10346.8945, "train_tokens_per_second": 422.197 }, { "epoch": 1.8107703814510097, "grad_norm": 3.1183297634124756, "learning_rate": 1.8994652406417114e-06, "loss": 0.11012288928031921, "num_input_tokens_seen": 4369198, "step": 4237, "train_runtime": 10348.9344, "train_tokens_per_second": 422.188 }, { "epoch": 1.8111977775403356, "grad_norm": 2.854477882385254, "learning_rate": 1.8951871657754013e-06, "loss": 0.1509762853384018, "num_input_tokens_seen": 4370292, "step": 4238, "train_runtime": 10351.1221, "train_tokens_per_second": 422.205 }, { "epoch": 1.8116251736296611, "grad_norm": 4.804562091827393, "learning_rate": 1.890909090909091e-06, "loss": 0.1389392614364624, "num_input_tokens_seen": 4371172, "step": 4239, "train_runtime": 10353.2507, "train_tokens_per_second": 422.203 }, { "epoch": 1.812052569718987, "grad_norm": 3.8928635120391846, "learning_rate": 1.8866310160427808e-06, "loss": 0.16309262812137604, "num_input_tokens_seen": 4372046, "step": 4240, "train_runtime": 10355.3311, "train_tokens_per_second": 422.202 }, { "epoch": 1.8124799658083128, "grad_norm": 2.530460834503174, "learning_rate": 1.8823529411764707e-06, "loss": 0.1013408824801445, "num_input_tokens_seen": 4373522, "step": 4241, "train_runtime": 10357.6184, "train_tokens_per_second": 422.252 }, { "epoch": 1.8129073618976386, "grad_norm": 4.975642681121826, "learning_rate": 1.8780748663101605e-06, "loss": 0.09836843609809875, "num_input_tokens_seen": 4374056, "step": 4242, "train_runtime": 10359.6117, "train_tokens_per_second": 422.222 }, { "epoch": 1.8133347579869645, "grad_norm": 2.4946558475494385, "learning_rate": 1.8737967914438504e-06, "loss": 0.11575710773468018, "num_input_tokens_seen": 4375190, "step": 4243, "train_runtime": 10361.7861, "train_tokens_per_second": 422.243 }, { "epoch": 1.81376215407629, "grad_norm": 2.6444196701049805, "learning_rate": 1.8695187165775403e-06, "loss": 0.08153674751520157, "num_input_tokens_seen": 4376356, "step": 4244, "train_runtime": 10363.941, "train_tokens_per_second": 422.268 }, { "epoch": 1.814189550165616, "grad_norm": 2.999821662902832, "learning_rate": 1.8652406417112302e-06, "loss": 0.10564687848091125, "num_input_tokens_seen": 4377348, "step": 4245, "train_runtime": 10366.0595, "train_tokens_per_second": 422.277 }, { "epoch": 1.8146169462549417, "grad_norm": 3.17754864692688, "learning_rate": 1.86096256684492e-06, "loss": 0.061029963195323944, "num_input_tokens_seen": 4378734, "step": 4246, "train_runtime": 10368.2285, "train_tokens_per_second": 422.322 }, { "epoch": 1.8150443423442675, "grad_norm": 3.561413526535034, "learning_rate": 1.8566844919786097e-06, "loss": 0.1227944865822792, "num_input_tokens_seen": 4379538, "step": 4247, "train_runtime": 10370.2522, "train_tokens_per_second": 422.317 }, { "epoch": 1.8154717384335934, "grad_norm": 2.7332143783569336, "learning_rate": 1.8524064171122996e-06, "loss": 0.0694960504770279, "num_input_tokens_seen": 4380430, "step": 4248, "train_runtime": 10372.3526, "train_tokens_per_second": 422.318 }, { "epoch": 1.815899134522919, "grad_norm": 2.859757423400879, "learning_rate": 1.8481283422459894e-06, "loss": 0.10604922473430634, "num_input_tokens_seen": 4381210, "step": 4249, "train_runtime": 10374.3817, "train_tokens_per_second": 422.31 }, { "epoch": 1.816326530612245, "grad_norm": 2.461272954940796, "learning_rate": 1.8438502673796793e-06, "loss": 0.07684335857629776, "num_input_tokens_seen": 4382310, "step": 4250, "train_runtime": 10376.5265, "train_tokens_per_second": 422.329 }, { "epoch": 1.8167539267015707, "grad_norm": 1.9117848873138428, "learning_rate": 1.8395721925133692e-06, "loss": 0.0697866678237915, "num_input_tokens_seen": 4383716, "step": 4251, "train_runtime": 10378.8133, "train_tokens_per_second": 422.372 }, { "epoch": 1.8171813227908964, "grad_norm": 3.1455063819885254, "learning_rate": 1.835294117647059e-06, "loss": 0.10792747884988785, "num_input_tokens_seen": 4384510, "step": 4252, "train_runtime": 10380.8954, "train_tokens_per_second": 422.363 }, { "epoch": 1.8176087188802224, "grad_norm": 2.955990791320801, "learning_rate": 1.831016042780749e-06, "loss": 0.08685193210840225, "num_input_tokens_seen": 4385582, "step": 4253, "train_runtime": 10382.9834, "train_tokens_per_second": 422.382 }, { "epoch": 1.8180361149695479, "grad_norm": 1.9731003046035767, "learning_rate": 1.8267379679144388e-06, "loss": 0.03776971623301506, "num_input_tokens_seen": 4386470, "step": 4254, "train_runtime": 10385.0175, "train_tokens_per_second": 422.384 }, { "epoch": 1.8184635110588738, "grad_norm": 3.050600290298462, "learning_rate": 1.8224598930481286e-06, "loss": 0.07909286022186279, "num_input_tokens_seen": 4387808, "step": 4255, "train_runtime": 10387.2764, "train_tokens_per_second": 422.421 }, { "epoch": 1.8188909071481996, "grad_norm": 3.54374098777771, "learning_rate": 1.8181818181818183e-06, "loss": 0.14706793427467346, "num_input_tokens_seen": 4388772, "step": 4256, "train_runtime": 10389.3306, "train_tokens_per_second": 422.431 }, { "epoch": 1.8193183032375253, "grad_norm": 4.551452159881592, "learning_rate": 1.8139037433155082e-06, "loss": 0.14810840785503387, "num_input_tokens_seen": 4389770, "step": 4257, "train_runtime": 10391.4106, "train_tokens_per_second": 422.442 }, { "epoch": 1.8197456993268513, "grad_norm": 1.8535094261169434, "learning_rate": 1.809625668449198e-06, "loss": 0.07118307054042816, "num_input_tokens_seen": 4391710, "step": 4258, "train_runtime": 10393.7937, "train_tokens_per_second": 422.532 }, { "epoch": 1.8201730954161768, "grad_norm": 2.338582992553711, "learning_rate": 1.805347593582888e-06, "loss": 0.07584503293037415, "num_input_tokens_seen": 4392796, "step": 4259, "train_runtime": 10395.8823, "train_tokens_per_second": 422.552 }, { "epoch": 1.8206004915055027, "grad_norm": 2.635974884033203, "learning_rate": 1.8010695187165778e-06, "loss": 0.10110776126384735, "num_input_tokens_seen": 4393772, "step": 4260, "train_runtime": 10397.965, "train_tokens_per_second": 422.561 }, { "epoch": 1.8210278875948285, "grad_norm": 1.8251999616622925, "learning_rate": 1.7967914438502676e-06, "loss": 0.07249141484498978, "num_input_tokens_seen": 4394920, "step": 4261, "train_runtime": 10406.9865, "train_tokens_per_second": 422.305 }, { "epoch": 1.8214552836841542, "grad_norm": 3.029616594314575, "learning_rate": 1.7925133689839575e-06, "loss": 0.0901215523481369, "num_input_tokens_seen": 4395602, "step": 4262, "train_runtime": 10409.0475, "train_tokens_per_second": 422.287 }, { "epoch": 1.8218826797734802, "grad_norm": 2.4523026943206787, "learning_rate": 1.7882352941176474e-06, "loss": 0.08679521083831787, "num_input_tokens_seen": 4396914, "step": 4263, "train_runtime": 10411.2343, "train_tokens_per_second": 422.324 }, { "epoch": 1.8223100758628057, "grad_norm": 2.0859696865081787, "learning_rate": 1.783957219251337e-06, "loss": 0.06534142047166824, "num_input_tokens_seen": 4397776, "step": 4264, "train_runtime": 10413.3228, "train_tokens_per_second": 422.322 }, { "epoch": 1.8227374719521316, "grad_norm": 3.7017807960510254, "learning_rate": 1.779679144385027e-06, "loss": 0.09009534120559692, "num_input_tokens_seen": 4398380, "step": 4265, "train_runtime": 10415.3332, "train_tokens_per_second": 422.299 }, { "epoch": 1.8231648680414574, "grad_norm": 2.9533321857452393, "learning_rate": 1.7754010695187168e-06, "loss": 0.046583231538534164, "num_input_tokens_seen": 4399132, "step": 4266, "train_runtime": 10417.3494, "train_tokens_per_second": 422.289 }, { "epoch": 1.8235922641307831, "grad_norm": 2.7662792205810547, "learning_rate": 1.7711229946524066e-06, "loss": 0.12788061797618866, "num_input_tokens_seen": 4400352, "step": 4267, "train_runtime": 10419.4929, "train_tokens_per_second": 422.319 }, { "epoch": 1.824019660220109, "grad_norm": 7.752589225769043, "learning_rate": 1.7668449197860965e-06, "loss": 0.0736791118979454, "num_input_tokens_seen": 4400790, "step": 4268, "train_runtime": 10421.4936, "train_tokens_per_second": 422.28 }, { "epoch": 1.8244470563094348, "grad_norm": 2.8798141479492188, "learning_rate": 1.7625668449197864e-06, "loss": 0.09692294895648956, "num_input_tokens_seen": 4402984, "step": 4269, "train_runtime": 10423.8453, "train_tokens_per_second": 422.395 }, { "epoch": 1.8248744523987606, "grad_norm": 2.372035026550293, "learning_rate": 1.7582887700534762e-06, "loss": 0.09091182053089142, "num_input_tokens_seen": 4403918, "step": 4270, "train_runtime": 10425.9855, "train_tokens_per_second": 422.398 }, { "epoch": 1.8253018484880863, "grad_norm": 2.7524266242980957, "learning_rate": 1.7540106951871661e-06, "loss": 0.08351872861385345, "num_input_tokens_seen": 4404562, "step": 4271, "train_runtime": 10427.9969, "train_tokens_per_second": 422.379 }, { "epoch": 1.825729244577412, "grad_norm": 3.4992871284484863, "learning_rate": 1.749732620320856e-06, "loss": 0.08081549406051636, "num_input_tokens_seen": 4405300, "step": 4272, "train_runtime": 10430.0207, "train_tokens_per_second": 422.367 }, { "epoch": 1.826156640666738, "grad_norm": 1.985395073890686, "learning_rate": 1.7454545454545456e-06, "loss": 0.0659557580947876, "num_input_tokens_seen": 4406460, "step": 4273, "train_runtime": 10432.1349, "train_tokens_per_second": 422.393 }, { "epoch": 1.8265840367560637, "grad_norm": 3.024962902069092, "learning_rate": 1.7411764705882353e-06, "loss": 0.09400507062673569, "num_input_tokens_seen": 4407304, "step": 4274, "train_runtime": 10434.1859, "train_tokens_per_second": 422.391 }, { "epoch": 1.8270114328453895, "grad_norm": 3.3022570610046387, "learning_rate": 1.7368983957219252e-06, "loss": 0.06011106073856354, "num_input_tokens_seen": 4407968, "step": 4275, "train_runtime": 10436.1393, "train_tokens_per_second": 422.375 }, { "epoch": 1.8274388289347152, "grad_norm": 3.109867572784424, "learning_rate": 1.732620320855615e-06, "loss": 0.10541640222072601, "num_input_tokens_seen": 4408710, "step": 4276, "train_runtime": 10438.2918, "train_tokens_per_second": 422.359 }, { "epoch": 1.827866225024041, "grad_norm": 2.8406429290771484, "learning_rate": 1.728342245989305e-06, "loss": 0.07821729779243469, "num_input_tokens_seen": 4409334, "step": 4277, "train_runtime": 10440.2443, "train_tokens_per_second": 422.34 }, { "epoch": 1.828293621113367, "grad_norm": 2.863986015319824, "learning_rate": 1.7240641711229948e-06, "loss": 0.08144165575504303, "num_input_tokens_seen": 4409972, "step": 4278, "train_runtime": 10442.2551, "train_tokens_per_second": 422.32 }, { "epoch": 1.8287210172026926, "grad_norm": 3.59318470954895, "learning_rate": 1.7197860962566844e-06, "loss": 0.12389001995325089, "num_input_tokens_seen": 4410774, "step": 4279, "train_runtime": 10444.2749, "train_tokens_per_second": 422.315 }, { "epoch": 1.8291484132920184, "grad_norm": 2.7863714694976807, "learning_rate": 1.7155080213903743e-06, "loss": 0.07351061701774597, "num_input_tokens_seen": 4411776, "step": 4280, "train_runtime": 10446.3828, "train_tokens_per_second": 422.326 }, { "epoch": 1.8295758093813441, "grad_norm": 4.017768383026123, "learning_rate": 1.7112299465240642e-06, "loss": 0.12098449468612671, "num_input_tokens_seen": 4412588, "step": 4281, "train_runtime": 10448.4174, "train_tokens_per_second": 422.321 }, { "epoch": 1.8300032054706699, "grad_norm": 2.2940378189086914, "learning_rate": 1.706951871657754e-06, "loss": 0.11267227679491043, "num_input_tokens_seen": 4414188, "step": 4282, "train_runtime": 10450.6548, "train_tokens_per_second": 422.384 }, { "epoch": 1.8304306015599958, "grad_norm": 3.3319027423858643, "learning_rate": 1.702673796791444e-06, "loss": 0.13140606880187988, "num_input_tokens_seen": 4415524, "step": 4283, "train_runtime": 10452.9381, "train_tokens_per_second": 422.419 }, { "epoch": 1.8308579976493216, "grad_norm": 2.408099889755249, "learning_rate": 1.6983957219251338e-06, "loss": 0.06313641369342804, "num_input_tokens_seen": 4416266, "step": 4284, "train_runtime": 10454.9555, "train_tokens_per_second": 422.409 }, { "epoch": 1.8312853937386473, "grad_norm": 2.946627378463745, "learning_rate": 1.6941176470588237e-06, "loss": 0.11229752004146576, "num_input_tokens_seen": 4417246, "step": 4285, "train_runtime": 10457.0493, "train_tokens_per_second": 422.418 }, { "epoch": 1.831712789827973, "grad_norm": 2.989027261734009, "learning_rate": 1.6898395721925135e-06, "loss": 0.10097094625234604, "num_input_tokens_seen": 4418610, "step": 4286, "train_runtime": 10459.203, "train_tokens_per_second": 422.461 }, { "epoch": 1.8321401859172988, "grad_norm": 3.1083507537841797, "learning_rate": 1.6855614973262032e-06, "loss": 0.11725413054227829, "num_input_tokens_seen": 4419720, "step": 4287, "train_runtime": 10461.3121, "train_tokens_per_second": 422.482 }, { "epoch": 1.8325675820066247, "grad_norm": 3.168668031692505, "learning_rate": 1.681283422459893e-06, "loss": 0.11754212528467178, "num_input_tokens_seen": 4420598, "step": 4288, "train_runtime": 10463.3595, "train_tokens_per_second": 422.484 }, { "epoch": 1.8329949780959505, "grad_norm": 1.998199224472046, "learning_rate": 1.677005347593583e-06, "loss": 0.06733019649982452, "num_input_tokens_seen": 4421472, "step": 4289, "train_runtime": 10465.4135, "train_tokens_per_second": 422.484 }, { "epoch": 1.8334223741852762, "grad_norm": 2.714137554168701, "learning_rate": 1.6727272727272728e-06, "loss": 0.08577898889780045, "num_input_tokens_seen": 4422534, "step": 4290, "train_runtime": 10467.4972, "train_tokens_per_second": 422.502 }, { "epoch": 1.833849770274602, "grad_norm": 2.0508828163146973, "learning_rate": 1.6684491978609627e-06, "loss": 0.08140479028224945, "num_input_tokens_seen": 4423746, "step": 4291, "train_runtime": 10476.3197, "train_tokens_per_second": 422.261 }, { "epoch": 1.8342771663639277, "grad_norm": 2.8936431407928467, "learning_rate": 1.6641711229946525e-06, "loss": 0.096943199634552, "num_input_tokens_seen": 4424922, "step": 4292, "train_runtime": 10478.4289, "train_tokens_per_second": 422.289 }, { "epoch": 1.8347045624532536, "grad_norm": 2.8280794620513916, "learning_rate": 1.6598930481283424e-06, "loss": 0.48929840326309204, "num_input_tokens_seen": 4425968, "step": 4293, "train_runtime": 10480.5523, "train_tokens_per_second": 422.303 }, { "epoch": 1.8351319585425794, "grad_norm": 2.151390790939331, "learning_rate": 1.6556149732620323e-06, "loss": 0.05391788110136986, "num_input_tokens_seen": 4426724, "step": 4294, "train_runtime": 10482.5623, "train_tokens_per_second": 422.294 }, { "epoch": 1.8355593546319051, "grad_norm": 2.100212335586548, "learning_rate": 1.6513368983957221e-06, "loss": 0.04820049926638603, "num_input_tokens_seen": 4427966, "step": 4295, "train_runtime": 10484.7147, "train_tokens_per_second": 422.326 }, { "epoch": 1.8359867507212309, "grad_norm": 2.6540989875793457, "learning_rate": 1.6470588235294118e-06, "loss": 0.10814224928617477, "num_input_tokens_seen": 4429260, "step": 4296, "train_runtime": 10486.9974, "train_tokens_per_second": 422.357 }, { "epoch": 1.8364141468105566, "grad_norm": 2.664121627807617, "learning_rate": 1.6427807486631017e-06, "loss": 0.11041717231273651, "num_input_tokens_seen": 4430404, "step": 4297, "train_runtime": 10489.1851, "train_tokens_per_second": 422.378 }, { "epoch": 1.8368415428998826, "grad_norm": 2.82047700881958, "learning_rate": 1.6385026737967915e-06, "loss": 0.07266925275325775, "num_input_tokens_seen": 4431086, "step": 4298, "train_runtime": 10491.2078, "train_tokens_per_second": 422.362 }, { "epoch": 1.8372689389892083, "grad_norm": 2.561530113220215, "learning_rate": 1.6342245989304814e-06, "loss": 0.11371771991252899, "num_input_tokens_seen": 4432236, "step": 4299, "train_runtime": 10493.3212, "train_tokens_per_second": 422.386 }, { "epoch": 1.837696335078534, "grad_norm": 2.803687572479248, "learning_rate": 1.6299465240641713e-06, "loss": 0.08940490335226059, "num_input_tokens_seen": 4433384, "step": 4300, "train_runtime": 10495.4313, "train_tokens_per_second": 422.411 }, { "epoch": 1.8381237311678598, "grad_norm": 8.537519454956055, "learning_rate": 1.6256684491978611e-06, "loss": 0.09031785279512405, "num_input_tokens_seen": 4434216, "step": 4301, "train_runtime": 10497.4884, "train_tokens_per_second": 422.407 }, { "epoch": 1.8385511272571855, "grad_norm": 2.049527406692505, "learning_rate": 1.621390374331551e-06, "loss": 0.05839116871356964, "num_input_tokens_seen": 4435168, "step": 4302, "train_runtime": 10499.5612, "train_tokens_per_second": 422.415 }, { "epoch": 1.8389785233465115, "grad_norm": 2.960066080093384, "learning_rate": 1.6171122994652409e-06, "loss": 0.07042038440704346, "num_input_tokens_seen": 4435940, "step": 4303, "train_runtime": 10501.5346, "train_tokens_per_second": 422.409 }, { "epoch": 1.8394059194358372, "grad_norm": 3.0962154865264893, "learning_rate": 1.6128342245989305e-06, "loss": 0.06472747772932053, "num_input_tokens_seen": 4436516, "step": 4304, "train_runtime": 10503.5832, "train_tokens_per_second": 422.381 }, { "epoch": 1.839833315525163, "grad_norm": 3.809420108795166, "learning_rate": 1.6085561497326204e-06, "loss": 0.11174661666154861, "num_input_tokens_seen": 4437518, "step": 4305, "train_runtime": 10505.7084, "train_tokens_per_second": 422.391 }, { "epoch": 1.8402607116144887, "grad_norm": 2.252808094024658, "learning_rate": 1.6042780748663103e-06, "loss": 0.0617913156747818, "num_input_tokens_seen": 4438934, "step": 4306, "train_runtime": 10507.8727, "train_tokens_per_second": 422.439 }, { "epoch": 1.8406881077038144, "grad_norm": 2.2713890075683594, "learning_rate": 1.6000000000000001e-06, "loss": 0.06388448178768158, "num_input_tokens_seen": 4440076, "step": 4307, "train_runtime": 10509.9813, "train_tokens_per_second": 422.463 }, { "epoch": 1.8411155037931404, "grad_norm": 2.956070899963379, "learning_rate": 1.59572192513369e-06, "loss": 0.05821391940116882, "num_input_tokens_seen": 4441162, "step": 4308, "train_runtime": 10512.0933, "train_tokens_per_second": 422.481 }, { "epoch": 1.8415428998824661, "grad_norm": 2.3430144786834717, "learning_rate": 1.5914438502673799e-06, "loss": 0.07610011100769043, "num_input_tokens_seen": 4442044, "step": 4309, "train_runtime": 10514.131, "train_tokens_per_second": 422.483 }, { "epoch": 1.8419702959717918, "grad_norm": 2.7692441940307617, "learning_rate": 1.5871657754010697e-06, "loss": 0.08628099411725998, "num_input_tokens_seen": 4443036, "step": 4310, "train_runtime": 10516.2088, "train_tokens_per_second": 422.494 }, { "epoch": 1.8423976920611176, "grad_norm": 2.8638477325439453, "learning_rate": 1.5828877005347596e-06, "loss": 0.10645891726016998, "num_input_tokens_seen": 4444144, "step": 4311, "train_runtime": 10518.3899, "train_tokens_per_second": 422.512 }, { "epoch": 1.8428250881504433, "grad_norm": 2.6326377391815186, "learning_rate": 1.5786096256684495e-06, "loss": 0.12054909765720367, "num_input_tokens_seen": 4445752, "step": 4312, "train_runtime": 10520.6662, "train_tokens_per_second": 422.573 }, { "epoch": 1.8432524842397693, "grad_norm": 1.775302767753601, "learning_rate": 1.5743315508021391e-06, "loss": 0.0615677684545517, "num_input_tokens_seen": 4446976, "step": 4313, "train_runtime": 10522.8574, "train_tokens_per_second": 422.602 }, { "epoch": 1.843679880329095, "grad_norm": 3.1319146156311035, "learning_rate": 1.570053475935829e-06, "loss": 0.0874544009566307, "num_input_tokens_seen": 4448810, "step": 4314, "train_runtime": 10525.1773, "train_tokens_per_second": 422.683 }, { "epoch": 1.8441072764184208, "grad_norm": 2.8558413982391357, "learning_rate": 1.5657754010695189e-06, "loss": 0.06850621849298477, "num_input_tokens_seen": 4449890, "step": 4315, "train_runtime": 10527.3344, "train_tokens_per_second": 422.699 }, { "epoch": 1.8445346725077467, "grad_norm": 2.847791910171509, "learning_rate": 1.5614973262032088e-06, "loss": 0.10569768399000168, "num_input_tokens_seen": 4451000, "step": 4316, "train_runtime": 10529.4156, "train_tokens_per_second": 422.721 }, { "epoch": 1.8449620685970722, "grad_norm": 3.652818441390991, "learning_rate": 1.5572192513368986e-06, "loss": 0.10822293162345886, "num_input_tokens_seen": 4451860, "step": 4317, "train_runtime": 10531.4709, "train_tokens_per_second": 422.72 }, { "epoch": 1.8453894646863982, "grad_norm": 4.450644493103027, "learning_rate": 1.5529411764705885e-06, "loss": 0.11765066534280777, "num_input_tokens_seen": 4452892, "step": 4318, "train_runtime": 10533.5389, "train_tokens_per_second": 422.735 }, { "epoch": 1.845816860775724, "grad_norm": 2.8366498947143555, "learning_rate": 1.5486631016042784e-06, "loss": 0.06710223853588104, "num_input_tokens_seen": 4453788, "step": 4319, "train_runtime": 10535.5966, "train_tokens_per_second": 422.737 }, { "epoch": 1.8462442568650497, "grad_norm": 2.1052331924438477, "learning_rate": 1.5443850267379682e-06, "loss": 0.06824570894241333, "num_input_tokens_seen": 4454894, "step": 4320, "train_runtime": 10537.7057, "train_tokens_per_second": 422.757 }, { "epoch": 1.8466716529543756, "grad_norm": 2.4886536598205566, "learning_rate": 1.5401069518716579e-06, "loss": 0.07624855637550354, "num_input_tokens_seen": 4455648, "step": 4321, "train_runtime": 10546.3669, "train_tokens_per_second": 422.482 }, { "epoch": 1.8470990490437011, "grad_norm": 3.070173740386963, "learning_rate": 1.5358288770053478e-06, "loss": 0.1102333813905716, "num_input_tokens_seen": 4456670, "step": 4322, "train_runtime": 10548.4485, "train_tokens_per_second": 422.495 }, { "epoch": 1.847526445133027, "grad_norm": 2.2976720333099365, "learning_rate": 1.5315508021390376e-06, "loss": 0.10118222236633301, "num_input_tokens_seen": 4457902, "step": 4323, "train_runtime": 10550.6793, "train_tokens_per_second": 422.523 }, { "epoch": 1.8479538412223528, "grad_norm": 2.7383384704589844, "learning_rate": 1.5272727272727275e-06, "loss": 0.09638936072587967, "num_input_tokens_seen": 4458784, "step": 4324, "train_runtime": 10552.725, "train_tokens_per_second": 422.524 }, { "epoch": 1.8483812373116786, "grad_norm": 2.781740427017212, "learning_rate": 1.5229946524064174e-06, "loss": 0.07415790110826492, "num_input_tokens_seen": 4459534, "step": 4325, "train_runtime": 10554.7012, "train_tokens_per_second": 422.516 }, { "epoch": 1.8488086334010045, "grad_norm": 2.8392863273620605, "learning_rate": 1.5187165775401072e-06, "loss": 0.11271148920059204, "num_input_tokens_seen": 4460384, "step": 4326, "train_runtime": 10556.7123, "train_tokens_per_second": 422.516 }, { "epoch": 1.84923602949033, "grad_norm": 2.6092700958251953, "learning_rate": 1.514438502673797e-06, "loss": 0.09560420364141464, "num_input_tokens_seen": 4461714, "step": 4327, "train_runtime": 10558.8505, "train_tokens_per_second": 422.557 }, { "epoch": 1.849663425579656, "grad_norm": 1.8497010469436646, "learning_rate": 1.5101604278074865e-06, "loss": 0.06900746375322342, "num_input_tokens_seen": 4462744, "step": 4328, "train_runtime": 10560.914, "train_tokens_per_second": 422.572 }, { "epoch": 1.8500908216689818, "grad_norm": 3.0495924949645996, "learning_rate": 1.5058823529411764e-06, "loss": 0.07236421853303909, "num_input_tokens_seen": 4463348, "step": 4329, "train_runtime": 10562.9353, "train_tokens_per_second": 422.548 }, { "epoch": 1.8505182177583075, "grad_norm": 2.3355634212493896, "learning_rate": 1.5016042780748663e-06, "loss": 0.0714600533246994, "num_input_tokens_seen": 4464520, "step": 4330, "train_runtime": 10565.0512, "train_tokens_per_second": 422.574 }, { "epoch": 1.8509456138476335, "grad_norm": 2.9161360263824463, "learning_rate": 1.4973262032085562e-06, "loss": 0.10887053608894348, "num_input_tokens_seen": 4465774, "step": 4331, "train_runtime": 10567.1926, "train_tokens_per_second": 422.607 }, { "epoch": 1.851373009936959, "grad_norm": 2.344881772994995, "learning_rate": 1.493048128342246e-06, "loss": 0.06462246924638748, "num_input_tokens_seen": 4466628, "step": 4332, "train_runtime": 10569.2426, "train_tokens_per_second": 422.606 }, { "epoch": 1.851800406026285, "grad_norm": 3.3946645259857178, "learning_rate": 1.4887700534759359e-06, "loss": 0.0972798764705658, "num_input_tokens_seen": 4467690, "step": 4333, "train_runtime": 10571.3796, "train_tokens_per_second": 422.621 }, { "epoch": 1.8522278021156107, "grad_norm": 1.9606319665908813, "learning_rate": 1.4844919786096258e-06, "loss": 0.07310633361339569, "num_input_tokens_seen": 4468960, "step": 4334, "train_runtime": 10573.5779, "train_tokens_per_second": 422.654 }, { "epoch": 1.8526551982049364, "grad_norm": 5.3527607917785645, "learning_rate": 1.4802139037433156e-06, "loss": 0.05969268083572388, "num_input_tokens_seen": 4470686, "step": 4335, "train_runtime": 10575.8618, "train_tokens_per_second": 422.725 }, { "epoch": 1.8530825942942624, "grad_norm": 3.571293830871582, "learning_rate": 1.4759358288770053e-06, "loss": 0.13271893560886383, "num_input_tokens_seen": 4471520, "step": 4336, "train_runtime": 10577.9635, "train_tokens_per_second": 422.72 }, { "epoch": 1.8535099903835879, "grad_norm": 2.6792490482330322, "learning_rate": 1.4716577540106952e-06, "loss": 0.10143477469682693, "num_input_tokens_seen": 4472562, "step": 4337, "train_runtime": 10580.1519, "train_tokens_per_second": 422.731 }, { "epoch": 1.8539373864729138, "grad_norm": 2.69933819770813, "learning_rate": 1.467379679144385e-06, "loss": 0.11955171078443527, "num_input_tokens_seen": 4474002, "step": 4338, "train_runtime": 10582.3446, "train_tokens_per_second": 422.78 }, { "epoch": 1.8543647825622396, "grad_norm": 2.683866262435913, "learning_rate": 1.463101604278075e-06, "loss": 0.08492610603570938, "num_input_tokens_seen": 4474968, "step": 4339, "train_runtime": 10584.428, "train_tokens_per_second": 422.788 }, { "epoch": 1.8547921786515653, "grad_norm": 3.1592612266540527, "learning_rate": 1.4588235294117648e-06, "loss": 0.08892189711332321, "num_input_tokens_seen": 4475710, "step": 4340, "train_runtime": 10586.5231, "train_tokens_per_second": 422.774 }, { "epoch": 1.8552195747408913, "grad_norm": 2.559145927429199, "learning_rate": 1.4545454545454546e-06, "loss": 0.061502836644649506, "num_input_tokens_seen": 4476448, "step": 4341, "train_runtime": 10588.513, "train_tokens_per_second": 422.765 }, { "epoch": 1.8556469708302168, "grad_norm": 1.2657779455184937, "learning_rate": 1.4502673796791445e-06, "loss": 0.04046618938446045, "num_input_tokens_seen": 4477612, "step": 4342, "train_runtime": 10590.643, "train_tokens_per_second": 422.789 }, { "epoch": 1.8560743669195428, "grad_norm": 2.166637659072876, "learning_rate": 1.4459893048128344e-06, "loss": 0.09101991355419159, "num_input_tokens_seen": 4479194, "step": 4343, "train_runtime": 10592.8551, "train_tokens_per_second": 422.85 }, { "epoch": 1.8565017630088685, "grad_norm": 3.1321773529052734, "learning_rate": 1.441711229946524e-06, "loss": 0.13200543820858002, "num_input_tokens_seen": 4480316, "step": 4344, "train_runtime": 10594.9903, "train_tokens_per_second": 422.871 }, { "epoch": 1.8569291590981942, "grad_norm": 2.6689770221710205, "learning_rate": 1.437433155080214e-06, "loss": 0.08172488212585449, "num_input_tokens_seen": 4481212, "step": 4345, "train_runtime": 10597.1197, "train_tokens_per_second": 422.871 }, { "epoch": 1.8573565551875202, "grad_norm": 3.37274169921875, "learning_rate": 1.4331550802139038e-06, "loss": 0.07329642027616501, "num_input_tokens_seen": 4481994, "step": 4346, "train_runtime": 10599.2061, "train_tokens_per_second": 422.861 }, { "epoch": 1.8577839512768457, "grad_norm": 2.6092402935028076, "learning_rate": 1.4288770053475936e-06, "loss": 0.06723662465810776, "num_input_tokens_seen": 4482730, "step": 4347, "train_runtime": 10601.2119, "train_tokens_per_second": 422.851 }, { "epoch": 1.8582113473661717, "grad_norm": 2.500474214553833, "learning_rate": 1.4245989304812835e-06, "loss": 0.08050408214330673, "num_input_tokens_seen": 4484006, "step": 4348, "train_runtime": 10603.3625, "train_tokens_per_second": 422.885 }, { "epoch": 1.8586387434554974, "grad_norm": 1.4394289255142212, "learning_rate": 1.4203208556149734e-06, "loss": 0.038653984665870667, "num_input_tokens_seen": 4485072, "step": 4349, "train_runtime": 10605.48, "train_tokens_per_second": 422.901 }, { "epoch": 1.8590661395448231, "grad_norm": 4.310345649719238, "learning_rate": 1.4160427807486632e-06, "loss": 0.15394708514213562, "num_input_tokens_seen": 4485804, "step": 4350, "train_runtime": 10607.5204, "train_tokens_per_second": 422.889 }, { "epoch": 1.859493535634149, "grad_norm": 2.608119487762451, "learning_rate": 1.4117647058823531e-06, "loss": 0.07096138596534729, "num_input_tokens_seen": 4486530, "step": 4351, "train_runtime": 10616.3137, "train_tokens_per_second": 422.607 }, { "epoch": 1.8599209317234746, "grad_norm": 3.7449843883514404, "learning_rate": 1.407486631016043e-06, "loss": 0.1345628947019577, "num_input_tokens_seen": 4487486, "step": 4352, "train_runtime": 10618.5143, "train_tokens_per_second": 422.61 }, { "epoch": 1.8603483278128006, "grad_norm": 1.9537577629089355, "learning_rate": 1.4032085561497326e-06, "loss": 0.048172689974308014, "num_input_tokens_seen": 4488192, "step": 4353, "train_runtime": 10620.5475, "train_tokens_per_second": 422.595 }, { "epoch": 1.8607757239021263, "grad_norm": 3.1509320735931396, "learning_rate": 1.3989304812834225e-06, "loss": 0.1188560426235199, "num_input_tokens_seen": 4489022, "step": 4354, "train_runtime": 10622.624, "train_tokens_per_second": 422.591 }, { "epoch": 1.861203119991452, "grad_norm": 3.9425694942474365, "learning_rate": 1.3946524064171124e-06, "loss": 0.06568313390016556, "num_input_tokens_seen": 4490022, "step": 4355, "train_runtime": 10624.7362, "train_tokens_per_second": 422.601 }, { "epoch": 1.861630516080778, "grad_norm": 3.821216106414795, "learning_rate": 1.3903743315508022e-06, "loss": 0.11505335569381714, "num_input_tokens_seen": 4490836, "step": 4356, "train_runtime": 10626.8472, "train_tokens_per_second": 422.593 }, { "epoch": 1.8620579121701035, "grad_norm": 2.295562744140625, "learning_rate": 1.3860962566844921e-06, "loss": 0.08005987107753754, "num_input_tokens_seen": 4491726, "step": 4357, "train_runtime": 10628.9199, "train_tokens_per_second": 422.595 }, { "epoch": 1.8624853082594295, "grad_norm": 3.63199520111084, "learning_rate": 1.381818181818182e-06, "loss": 0.07291054725646973, "num_input_tokens_seen": 4492214, "step": 4358, "train_runtime": 10630.9016, "train_tokens_per_second": 422.562 }, { "epoch": 1.8629127043487552, "grad_norm": 2.9629008769989014, "learning_rate": 1.3775401069518719e-06, "loss": 0.10023405402898788, "num_input_tokens_seen": 4493662, "step": 4359, "train_runtime": 10633.1476, "train_tokens_per_second": 422.609 }, { "epoch": 1.863340100438081, "grad_norm": 3.88024640083313, "learning_rate": 1.3732620320855617e-06, "loss": 0.2093977928161621, "num_input_tokens_seen": 4494776, "step": 4360, "train_runtime": 10635.2791, "train_tokens_per_second": 422.629 }, { "epoch": 1.863767496527407, "grad_norm": 3.2887840270996094, "learning_rate": 1.3689839572192514e-06, "loss": 0.08741550147533417, "num_input_tokens_seen": 4495796, "step": 4361, "train_runtime": 10637.3795, "train_tokens_per_second": 422.641 }, { "epoch": 1.8641948926167324, "grad_norm": 1.6183552742004395, "learning_rate": 1.3647058823529413e-06, "loss": 0.04639342054724693, "num_input_tokens_seen": 4496968, "step": 4362, "train_runtime": 10639.4666, "train_tokens_per_second": 422.669 }, { "epoch": 1.8646222887060584, "grad_norm": 4.033382415771484, "learning_rate": 1.3604278074866311e-06, "loss": 0.13132628798484802, "num_input_tokens_seen": 4497670, "step": 4363, "train_runtime": 10641.4283, "train_tokens_per_second": 422.657 }, { "epoch": 1.8650496847953841, "grad_norm": 2.9869933128356934, "learning_rate": 1.356149732620321e-06, "loss": 0.1131114587187767, "num_input_tokens_seen": 4498990, "step": 4364, "train_runtime": 10643.6028, "train_tokens_per_second": 422.694 }, { "epoch": 1.8654770808847099, "grad_norm": 2.285688638687134, "learning_rate": 1.3518716577540109e-06, "loss": 0.0976904034614563, "num_input_tokens_seen": 4500326, "step": 4365, "train_runtime": 10645.7592, "train_tokens_per_second": 422.734 }, { "epoch": 1.8659044769740358, "grad_norm": 1.824602484703064, "learning_rate": 1.3475935828877007e-06, "loss": 0.07388639450073242, "num_input_tokens_seen": 4501718, "step": 4366, "train_runtime": 10647.9763, "train_tokens_per_second": 422.777 }, { "epoch": 1.8663318730633613, "grad_norm": 2.9529054164886475, "learning_rate": 1.3433155080213906e-06, "loss": 0.10623446851968765, "num_input_tokens_seen": 4502426, "step": 4367, "train_runtime": 10650.0093, "train_tokens_per_second": 422.763 }, { "epoch": 1.8667592691526873, "grad_norm": 3.275920867919922, "learning_rate": 1.3390374331550805e-06, "loss": 0.10680332034826279, "num_input_tokens_seen": 4503306, "step": 4368, "train_runtime": 10652.0661, "train_tokens_per_second": 422.764 }, { "epoch": 1.867186665242013, "grad_norm": 2.381131649017334, "learning_rate": 1.3347593582887703e-06, "loss": 0.06296646595001221, "num_input_tokens_seen": 4504004, "step": 4369, "train_runtime": 10654.0506, "train_tokens_per_second": 422.75 }, { "epoch": 1.8676140613313388, "grad_norm": 3.7544305324554443, "learning_rate": 1.33048128342246e-06, "loss": 0.10901312530040741, "num_input_tokens_seen": 4504794, "step": 4370, "train_runtime": 10656.0375, "train_tokens_per_second": 422.746 }, { "epoch": 1.8680414574206647, "grad_norm": 2.922407388687134, "learning_rate": 1.3262032085561499e-06, "loss": 0.09354592859745026, "num_input_tokens_seen": 4505616, "step": 4371, "train_runtime": 10658.0775, "train_tokens_per_second": 422.742 }, { "epoch": 1.8684688535099903, "grad_norm": 2.0420522689819336, "learning_rate": 1.3219251336898397e-06, "loss": 0.0932607352733612, "num_input_tokens_seen": 4507234, "step": 4372, "train_runtime": 10660.2814, "train_tokens_per_second": 422.806 }, { "epoch": 1.8688962495993162, "grad_norm": 4.0056352615356445, "learning_rate": 1.3176470588235296e-06, "loss": 0.1315418779850006, "num_input_tokens_seen": 4507854, "step": 4373, "train_runtime": 10662.343, "train_tokens_per_second": 422.783 }, { "epoch": 1.869323645688642, "grad_norm": 1.9559130668640137, "learning_rate": 1.3133689839572195e-06, "loss": 0.06093786284327507, "num_input_tokens_seen": 4509030, "step": 4374, "train_runtime": 10664.4636, "train_tokens_per_second": 422.809 }, { "epoch": 1.8697510417779677, "grad_norm": 2.9313979148864746, "learning_rate": 1.3090909090909093e-06, "loss": 0.07974699139595032, "num_input_tokens_seen": 4509846, "step": 4375, "train_runtime": 10666.5232, "train_tokens_per_second": 422.804 }, { "epoch": 1.8701784378672937, "grad_norm": 1.9762990474700928, "learning_rate": 1.3048128342245992e-06, "loss": 0.05429758131504059, "num_input_tokens_seen": 4510804, "step": 4376, "train_runtime": 10668.615, "train_tokens_per_second": 422.811 }, { "epoch": 1.8706058339566192, "grad_norm": 3.1730618476867676, "learning_rate": 1.300534759358289e-06, "loss": 0.10123877972364426, "num_input_tokens_seen": 4511634, "step": 4377, "train_runtime": 10670.6401, "train_tokens_per_second": 422.808 }, { "epoch": 1.8710332300459451, "grad_norm": 3.3578994274139404, "learning_rate": 1.2962566844919787e-06, "loss": 0.14225836098194122, "num_input_tokens_seen": 4512422, "step": 4378, "train_runtime": 10672.6903, "train_tokens_per_second": 422.801 }, { "epoch": 1.8714606261352709, "grad_norm": 3.607334852218628, "learning_rate": 1.2919786096256686e-06, "loss": 0.06675422191619873, "num_input_tokens_seen": 4513500, "step": 4379, "train_runtime": 10674.8012, "train_tokens_per_second": 422.818 }, { "epoch": 1.8718880222245966, "grad_norm": 2.0418055057525635, "learning_rate": 1.2877005347593585e-06, "loss": 0.04083488881587982, "num_input_tokens_seen": 4514482, "step": 4380, "train_runtime": 10676.8746, "train_tokens_per_second": 422.828 }, { "epoch": 1.8723154183139226, "grad_norm": 3.2652392387390137, "learning_rate": 1.2834224598930483e-06, "loss": 0.12526695430278778, "num_input_tokens_seen": 4515452, "step": 4381, "train_runtime": 10685.7048, "train_tokens_per_second": 422.569 }, { "epoch": 1.872742814403248, "grad_norm": 1.8685311079025269, "learning_rate": 1.2791443850267382e-06, "loss": 0.07261121273040771, "num_input_tokens_seen": 4516876, "step": 4382, "train_runtime": 10687.9702, "train_tokens_per_second": 422.613 }, { "epoch": 1.873170210492574, "grad_norm": 3.854722261428833, "learning_rate": 1.2748663101604279e-06, "loss": 0.08022146672010422, "num_input_tokens_seen": 4517666, "step": 4383, "train_runtime": 10689.9878, "train_tokens_per_second": 422.607 }, { "epoch": 1.8735976065818998, "grad_norm": 2.6227288246154785, "learning_rate": 1.2705882352941175e-06, "loss": 0.0638502910733223, "num_input_tokens_seen": 4518722, "step": 4384, "train_runtime": 10692.0697, "train_tokens_per_second": 422.624 }, { "epoch": 1.8740250026712255, "grad_norm": 3.1898860931396484, "learning_rate": 1.2663101604278074e-06, "loss": 0.1073106899857521, "num_input_tokens_seen": 4519492, "step": 4385, "train_runtime": 10694.2268, "train_tokens_per_second": 422.61 }, { "epoch": 1.8744523987605515, "grad_norm": 2.8214521408081055, "learning_rate": 1.2620320855614973e-06, "loss": 0.07853256165981293, "num_input_tokens_seen": 4520456, "step": 4386, "train_runtime": 10696.3485, "train_tokens_per_second": 422.617 }, { "epoch": 1.874879794849877, "grad_norm": 3.138838052749634, "learning_rate": 1.2577540106951871e-06, "loss": 0.08534351736307144, "num_input_tokens_seen": 4521422, "step": 4387, "train_runtime": 10698.4595, "train_tokens_per_second": 422.624 }, { "epoch": 1.875307190939203, "grad_norm": 2.3921470642089844, "learning_rate": 1.253475935828877e-06, "loss": 0.08733788877725601, "num_input_tokens_seen": 4522500, "step": 4388, "train_runtime": 10700.6864, "train_tokens_per_second": 422.636 }, { "epoch": 1.8757345870285287, "grad_norm": 3.278231620788574, "learning_rate": 1.249197860962567e-06, "loss": 0.11372203379869461, "num_input_tokens_seen": 4523376, "step": 4389, "train_runtime": 10702.7555, "train_tokens_per_second": 422.637 }, { "epoch": 1.8761619831178544, "grad_norm": 2.3801357746124268, "learning_rate": 1.2449197860962567e-06, "loss": 0.09953523427248001, "num_input_tokens_seen": 4524336, "step": 4390, "train_runtime": 10704.8707, "train_tokens_per_second": 422.643 }, { "epoch": 1.8765893792071804, "grad_norm": 2.160125494003296, "learning_rate": 1.2406417112299466e-06, "loss": 0.056954726576805115, "num_input_tokens_seen": 4525574, "step": 4391, "train_runtime": 10707.0061, "train_tokens_per_second": 422.674 }, { "epoch": 1.877016775296506, "grad_norm": 2.3410894870758057, "learning_rate": 1.2363636363636365e-06, "loss": 0.10060116648674011, "num_input_tokens_seen": 4527230, "step": 4392, "train_runtime": 10709.2375, "train_tokens_per_second": 422.741 }, { "epoch": 1.8774441713858319, "grad_norm": 2.1308250427246094, "learning_rate": 1.2320855614973264e-06, "loss": 0.07481782138347626, "num_input_tokens_seen": 4528518, "step": 4393, "train_runtime": 10711.4082, "train_tokens_per_second": 422.775 }, { "epoch": 1.8778715674751576, "grad_norm": 2.6850128173828125, "learning_rate": 1.2278074866310162e-06, "loss": 0.10995124280452728, "num_input_tokens_seen": 4529556, "step": 4394, "train_runtime": 10713.4923, "train_tokens_per_second": 422.79 }, { "epoch": 1.8782989635644833, "grad_norm": 3.214914321899414, "learning_rate": 1.223529411764706e-06, "loss": 0.1323504000902176, "num_input_tokens_seen": 4530672, "step": 4395, "train_runtime": 10715.7274, "train_tokens_per_second": 422.806 }, { "epoch": 1.8787263596538093, "grad_norm": 4.051766395568848, "learning_rate": 1.2192513368983957e-06, "loss": 0.0795101523399353, "num_input_tokens_seen": 4531306, "step": 4396, "train_runtime": 10717.7311, "train_tokens_per_second": 422.786 }, { "epoch": 1.8791537557431348, "grad_norm": 3.7544493675231934, "learning_rate": 1.2149732620320856e-06, "loss": 0.08741353452205658, "num_input_tokens_seen": 4532100, "step": 4397, "train_runtime": 10719.749, "train_tokens_per_second": 422.78 }, { "epoch": 1.8795811518324608, "grad_norm": 3.9056150913238525, "learning_rate": 1.2106951871657755e-06, "loss": 0.06964719295501709, "num_input_tokens_seen": 4532796, "step": 4398, "train_runtime": 10721.702, "train_tokens_per_second": 422.768 }, { "epoch": 1.8800085479217865, "grad_norm": 3.321131944656372, "learning_rate": 1.2064171122994654e-06, "loss": 0.08768081665039062, "num_input_tokens_seen": 4533546, "step": 4399, "train_runtime": 10723.7294, "train_tokens_per_second": 422.758 }, { "epoch": 1.8804359440111122, "grad_norm": 2.617940664291382, "learning_rate": 1.2021390374331552e-06, "loss": 0.06624089181423187, "num_input_tokens_seen": 4534492, "step": 4400, "train_runtime": 10725.8838, "train_tokens_per_second": 422.762 }, { "epoch": 1.8808633401004382, "grad_norm": 2.9240293502807617, "learning_rate": 1.1978609625668449e-06, "loss": 0.0696309357881546, "num_input_tokens_seen": 4535452, "step": 4401, "train_runtime": 10728.0324, "train_tokens_per_second": 422.766 }, { "epoch": 1.8812907361897637, "grad_norm": 3.9306929111480713, "learning_rate": 1.1935828877005347e-06, "loss": 0.08337032794952393, "num_input_tokens_seen": 4536142, "step": 4402, "train_runtime": 10730.039, "train_tokens_per_second": 422.752 }, { "epoch": 1.8817181322790897, "grad_norm": 2.114269733428955, "learning_rate": 1.1893048128342246e-06, "loss": 0.08273835480213165, "num_input_tokens_seen": 4537242, "step": 4403, "train_runtime": 10732.1557, "train_tokens_per_second": 422.771 }, { "epoch": 1.8821455283684154, "grad_norm": 3.333991289138794, "learning_rate": 1.1850267379679145e-06, "loss": 0.09323263168334961, "num_input_tokens_seen": 4538114, "step": 4404, "train_runtime": 10734.3056, "train_tokens_per_second": 422.767 }, { "epoch": 1.8825729244577412, "grad_norm": 3.232525110244751, "learning_rate": 1.1807486631016044e-06, "loss": 0.09853234887123108, "num_input_tokens_seen": 4539570, "step": 4405, "train_runtime": 10736.5325, "train_tokens_per_second": 422.815 }, { "epoch": 1.8830003205470671, "grad_norm": 3.4045495986938477, "learning_rate": 1.1764705882352942e-06, "loss": 0.12907451391220093, "num_input_tokens_seen": 4540454, "step": 4406, "train_runtime": 10738.602, "train_tokens_per_second": 422.816 }, { "epoch": 1.8834277166363926, "grad_norm": 3.7330353260040283, "learning_rate": 1.172192513368984e-06, "loss": 0.07779146730899811, "num_input_tokens_seen": 4541300, "step": 4407, "train_runtime": 10740.6747, "train_tokens_per_second": 422.813 }, { "epoch": 1.8838551127257186, "grad_norm": 2.8425981998443604, "learning_rate": 1.167914438502674e-06, "loss": 0.10518702119588852, "num_input_tokens_seen": 4542642, "step": 4408, "train_runtime": 10742.827, "train_tokens_per_second": 422.854 }, { "epoch": 1.8842825088150443, "grad_norm": 2.3275437355041504, "learning_rate": 1.1636363636363638e-06, "loss": 0.059425994753837585, "num_input_tokens_seen": 4543694, "step": 4409, "train_runtime": 10744.9118, "train_tokens_per_second": 422.869 }, { "epoch": 1.88470990490437, "grad_norm": 4.658697128295898, "learning_rate": 1.1593582887700535e-06, "loss": 0.13761216402053833, "num_input_tokens_seen": 4544400, "step": 4410, "train_runtime": 10746.899, "train_tokens_per_second": 422.857 }, { "epoch": 1.885137300993696, "grad_norm": 1.957148790359497, "learning_rate": 1.1550802139037434e-06, "loss": 0.06264439970254898, "num_input_tokens_seen": 4545664, "step": 4411, "train_runtime": 10755.5374, "train_tokens_per_second": 422.635 }, { "epoch": 1.8855646970830215, "grad_norm": 1.3168405294418335, "learning_rate": 1.1508021390374332e-06, "loss": 0.037496551871299744, "num_input_tokens_seen": 4546994, "step": 4412, "train_runtime": 10757.8631, "train_tokens_per_second": 422.667 }, { "epoch": 1.8859920931723475, "grad_norm": 2.067268133163452, "learning_rate": 1.146524064171123e-06, "loss": 0.0679556205868721, "num_input_tokens_seen": 4548262, "step": 4413, "train_runtime": 10760.0364, "train_tokens_per_second": 422.7 }, { "epoch": 1.8864194892616732, "grad_norm": 2.7608087062835693, "learning_rate": 1.142245989304813e-06, "loss": 0.0793260931968689, "num_input_tokens_seen": 4549078, "step": 4414, "train_runtime": 10762.0967, "train_tokens_per_second": 422.694 }, { "epoch": 1.886846885350999, "grad_norm": 1.7697131633758545, "learning_rate": 1.1379679144385028e-06, "loss": 0.04217218607664108, "num_input_tokens_seen": 4549992, "step": 4415, "train_runtime": 10764.1932, "train_tokens_per_second": 422.697 }, { "epoch": 1.887274281440325, "grad_norm": 2.289616584777832, "learning_rate": 1.1336898395721927e-06, "loss": 0.08312086015939713, "num_input_tokens_seen": 4550968, "step": 4416, "train_runtime": 10766.2911, "train_tokens_per_second": 422.705 }, { "epoch": 1.8877016775296505, "grad_norm": 2.1274046897888184, "learning_rate": 1.1294117647058826e-06, "loss": 0.061488281935453415, "num_input_tokens_seen": 4551618, "step": 4417, "train_runtime": 10768.3105, "train_tokens_per_second": 422.686 }, { "epoch": 1.8881290736189764, "grad_norm": 2.6610591411590576, "learning_rate": 1.1251336898395722e-06, "loss": 0.125120609998703, "num_input_tokens_seen": 4552488, "step": 4418, "train_runtime": 10770.3327, "train_tokens_per_second": 422.688 }, { "epoch": 1.8885564697083022, "grad_norm": 2.289487838745117, "learning_rate": 1.120855614973262e-06, "loss": 0.06735081225633621, "num_input_tokens_seen": 4553512, "step": 4419, "train_runtime": 10772.4039, "train_tokens_per_second": 422.702 }, { "epoch": 1.888983865797628, "grad_norm": 2.808692455291748, "learning_rate": 1.116577540106952e-06, "loss": 0.10418041050434113, "num_input_tokens_seen": 4554500, "step": 4420, "train_runtime": 10774.4607, "train_tokens_per_second": 422.713 }, { "epoch": 1.8894112618869539, "grad_norm": 2.686461925506592, "learning_rate": 1.1122994652406418e-06, "loss": 0.08092980831861496, "num_input_tokens_seen": 4555870, "step": 4421, "train_runtime": 10776.645, "train_tokens_per_second": 422.754 }, { "epoch": 1.8898386579762794, "grad_norm": 2.5925116539001465, "learning_rate": 1.1080213903743317e-06, "loss": 0.0827026292681694, "num_input_tokens_seen": 4556762, "step": 4422, "train_runtime": 10778.7093, "train_tokens_per_second": 422.756 }, { "epoch": 1.8902660540656053, "grad_norm": 3.3147714138031006, "learning_rate": 1.1037433155080214e-06, "loss": 0.06726095825433731, "num_input_tokens_seen": 4557706, "step": 4423, "train_runtime": 10780.791, "train_tokens_per_second": 422.762 }, { "epoch": 1.890693450154931, "grad_norm": 3.3284411430358887, "learning_rate": 1.0994652406417112e-06, "loss": 0.08040409535169601, "num_input_tokens_seen": 4558820, "step": 4424, "train_runtime": 10782.9131, "train_tokens_per_second": 422.782 }, { "epoch": 1.8911208462442568, "grad_norm": 2.8569467067718506, "learning_rate": 1.0951871657754011e-06, "loss": 0.1341744065284729, "num_input_tokens_seen": 4560012, "step": 4425, "train_runtime": 10785.1304, "train_tokens_per_second": 422.805 }, { "epoch": 1.8915482423335828, "grad_norm": 3.35448956489563, "learning_rate": 1.090909090909091e-06, "loss": 0.11207510530948639, "num_input_tokens_seen": 4560762, "step": 4426, "train_runtime": 10787.1654, "train_tokens_per_second": 422.795 }, { "epoch": 1.8919756384229083, "grad_norm": 2.942560911178589, "learning_rate": 1.0866310160427808e-06, "loss": 0.09185966104269028, "num_input_tokens_seen": 4561562, "step": 4427, "train_runtime": 10789.2369, "train_tokens_per_second": 422.788 }, { "epoch": 1.8924030345122342, "grad_norm": 3.7005763053894043, "learning_rate": 1.0823529411764707e-06, "loss": 0.08973820507526398, "num_input_tokens_seen": 4562314, "step": 4428, "train_runtime": 10791.2643, "train_tokens_per_second": 422.778 }, { "epoch": 1.89283043060156, "grad_norm": 2.077177047729492, "learning_rate": 1.0780748663101606e-06, "loss": 0.05421359837055206, "num_input_tokens_seen": 4563396, "step": 4429, "train_runtime": 10793.382, "train_tokens_per_second": 422.796 }, { "epoch": 1.8932578266908857, "grad_norm": 2.066877841949463, "learning_rate": 1.0737967914438502e-06, "loss": 0.0701863244175911, "num_input_tokens_seen": 4565338, "step": 4430, "train_runtime": 10795.6819, "train_tokens_per_second": 422.886 }, { "epoch": 1.8936852227802117, "grad_norm": 3.4514458179473877, "learning_rate": 1.0695187165775401e-06, "loss": 0.08999794721603394, "num_input_tokens_seen": 4566132, "step": 4431, "train_runtime": 10797.7186, "train_tokens_per_second": 422.879 }, { "epoch": 1.8941126188695372, "grad_norm": 2.5464253425598145, "learning_rate": 1.06524064171123e-06, "loss": 0.08568716049194336, "num_input_tokens_seen": 4567134, "step": 4432, "train_runtime": 10799.8723, "train_tokens_per_second": 422.888 }, { "epoch": 1.8945400149588631, "grad_norm": 2.3488171100616455, "learning_rate": 1.0609625668449198e-06, "loss": 0.05926796421408653, "num_input_tokens_seen": 4568326, "step": 4433, "train_runtime": 10802.1148, "train_tokens_per_second": 422.91 }, { "epoch": 1.8949674110481889, "grad_norm": 1.9476948976516724, "learning_rate": 1.0566844919786097e-06, "loss": 0.0564112663269043, "num_input_tokens_seen": 4569418, "step": 4434, "train_runtime": 10804.227, "train_tokens_per_second": 422.929 }, { "epoch": 1.8953948071375146, "grad_norm": 3.591588020324707, "learning_rate": 1.0524064171122996e-06, "loss": 0.09620843827724457, "num_input_tokens_seen": 4570096, "step": 4435, "train_runtime": 10806.2607, "train_tokens_per_second": 422.912 }, { "epoch": 1.8958222032268406, "grad_norm": 3.2518348693847656, "learning_rate": 1.0481283422459895e-06, "loss": 0.07996368408203125, "num_input_tokens_seen": 4570922, "step": 4436, "train_runtime": 10808.3043, "train_tokens_per_second": 422.908 }, { "epoch": 1.896249599316166, "grad_norm": 5.111767768859863, "learning_rate": 1.0438502673796793e-06, "loss": 0.09326605498790741, "num_input_tokens_seen": 4571552, "step": 4437, "train_runtime": 10810.358, "train_tokens_per_second": 422.886 }, { "epoch": 1.896676995405492, "grad_norm": 2.164259672164917, "learning_rate": 1.039572192513369e-06, "loss": 0.05288808420300484, "num_input_tokens_seen": 4572550, "step": 4438, "train_runtime": 10812.442, "train_tokens_per_second": 422.897 }, { "epoch": 1.8971043914948178, "grad_norm": 4.1734185218811035, "learning_rate": 1.0352941176470589e-06, "loss": 0.08563899993896484, "num_input_tokens_seen": 4573476, "step": 4439, "train_runtime": 10814.5183, "train_tokens_per_second": 422.901 }, { "epoch": 1.8975317875841435, "grad_norm": 2.8799474239349365, "learning_rate": 1.0310160427807487e-06, "loss": 0.10343010723590851, "num_input_tokens_seen": 4575040, "step": 4440, "train_runtime": 10816.7109, "train_tokens_per_second": 422.96 }, { "epoch": 1.8979591836734695, "grad_norm": 2.5237553119659424, "learning_rate": 1.0267379679144386e-06, "loss": 0.10083038359880447, "num_input_tokens_seen": 4575960, "step": 4441, "train_runtime": 10825.6237, "train_tokens_per_second": 422.697 }, { "epoch": 1.898386579762795, "grad_norm": 2.4181230068206787, "learning_rate": 1.0224598930481285e-06, "loss": 0.0894622653722763, "num_input_tokens_seen": 4576970, "step": 4442, "train_runtime": 10827.6891, "train_tokens_per_second": 422.71 }, { "epoch": 1.898813975852121, "grad_norm": 2.875009059906006, "learning_rate": 1.0181818181818183e-06, "loss": 0.09652965515851974, "num_input_tokens_seen": 4577880, "step": 4443, "train_runtime": 10829.7334, "train_tokens_per_second": 422.714 }, { "epoch": 1.8992413719414467, "grad_norm": 2.7091493606567383, "learning_rate": 1.0139037433155082e-06, "loss": 0.08103708177804947, "num_input_tokens_seen": 4578642, "step": 4444, "train_runtime": 10831.7101, "train_tokens_per_second": 422.707 }, { "epoch": 1.8996687680307724, "grad_norm": 2.3246288299560547, "learning_rate": 1.009625668449198e-06, "loss": 0.06236422806978226, "num_input_tokens_seen": 4579556, "step": 4445, "train_runtime": 10833.7538, "train_tokens_per_second": 422.712 }, { "epoch": 1.9000961641200984, "grad_norm": 2.6732337474823, "learning_rate": 1.005347593582888e-06, "loss": 0.09596578776836395, "num_input_tokens_seen": 4580622, "step": 4446, "train_runtime": 10835.8395, "train_tokens_per_second": 422.729 }, { "epoch": 1.900523560209424, "grad_norm": 2.9142520427703857, "learning_rate": 1.0010695187165776e-06, "loss": 0.11763831973075867, "num_input_tokens_seen": 4581960, "step": 4447, "train_runtime": 10838.0044, "train_tokens_per_second": 422.768 }, { "epoch": 1.9009509562987499, "grad_norm": 2.628542423248291, "learning_rate": 9.967914438502675e-07, "loss": 0.11464789509773254, "num_input_tokens_seen": 4582736, "step": 4448, "train_runtime": 10840.0139, "train_tokens_per_second": 422.761 }, { "epoch": 1.9013783523880756, "grad_norm": 1.5382531881332397, "learning_rate": 9.925133689839573e-07, "loss": 0.03625532239675522, "num_input_tokens_seen": 4584306, "step": 4449, "train_runtime": 10842.2167, "train_tokens_per_second": 422.82 }, { "epoch": 1.9018057484774014, "grad_norm": 2.1141552925109863, "learning_rate": 9.88235294117647e-07, "loss": 0.06490832567214966, "num_input_tokens_seen": 4585572, "step": 4450, "train_runtime": 10844.3597, "train_tokens_per_second": 422.853 }, { "epoch": 1.9022331445667273, "grad_norm": 3.873093366622925, "learning_rate": 9.839572192513369e-07, "loss": 0.0809621512889862, "num_input_tokens_seen": 4586200, "step": 4451, "train_runtime": 10846.5735, "train_tokens_per_second": 422.825 }, { "epoch": 1.9026605406560528, "grad_norm": 2.6607279777526855, "learning_rate": 9.796791443850267e-07, "loss": 0.10808295756578445, "num_input_tokens_seen": 4587598, "step": 4452, "train_runtime": 10848.7433, "train_tokens_per_second": 422.869 }, { "epoch": 1.9030879367453788, "grad_norm": 3.1878325939178467, "learning_rate": 9.754010695187166e-07, "loss": 0.07286867499351501, "num_input_tokens_seen": 4588940, "step": 4453, "train_runtime": 10850.9056, "train_tokens_per_second": 422.908 }, { "epoch": 1.9035153328347045, "grad_norm": 2.5134034156799316, "learning_rate": 9.711229946524065e-07, "loss": 0.10439202189445496, "num_input_tokens_seen": 4590366, "step": 4454, "train_runtime": 10853.0824, "train_tokens_per_second": 422.955 }, { "epoch": 1.9039427289240303, "grad_norm": 2.1706836223602295, "learning_rate": 9.668449197860963e-07, "loss": 0.07070669531822205, "num_input_tokens_seen": 4591482, "step": 4455, "train_runtime": 10855.1709, "train_tokens_per_second": 422.976 }, { "epoch": 1.9043701250133562, "grad_norm": 2.883697748184204, "learning_rate": 9.625668449197862e-07, "loss": 0.09853550791740417, "num_input_tokens_seen": 4592686, "step": 4456, "train_runtime": 10857.3112, "train_tokens_per_second": 423.004 }, { "epoch": 1.9047975211026817, "grad_norm": 2.686236619949341, "learning_rate": 9.58288770053476e-07, "loss": 0.07270325720310211, "num_input_tokens_seen": 4593824, "step": 4457, "train_runtime": 10859.4302, "train_tokens_per_second": 423.026 }, { "epoch": 1.9052249171920077, "grad_norm": 3.183248281478882, "learning_rate": 9.540106951871657e-07, "loss": 0.1145283430814743, "num_input_tokens_seen": 4594684, "step": 4458, "train_runtime": 10861.4795, "train_tokens_per_second": 423.026 }, { "epoch": 1.9056523132813334, "grad_norm": 2.770751953125, "learning_rate": 9.497326203208557e-07, "loss": 0.12366009503602982, "num_input_tokens_seen": 4596346, "step": 4459, "train_runtime": 10863.7589, "train_tokens_per_second": 423.09 }, { "epoch": 1.9060797093706592, "grad_norm": 2.6289772987365723, "learning_rate": 9.454545454545455e-07, "loss": 0.08646272122859955, "num_input_tokens_seen": 4597426, "step": 4460, "train_runtime": 10865.8989, "train_tokens_per_second": 423.106 }, { "epoch": 1.9065071054599851, "grad_norm": 2.8655219078063965, "learning_rate": 9.411764705882353e-07, "loss": 0.055573564022779465, "num_input_tokens_seen": 4598430, "step": 4461, "train_runtime": 10868.0067, "train_tokens_per_second": 423.116 }, { "epoch": 1.9069345015493109, "grad_norm": 3.240882158279419, "learning_rate": 9.368983957219252e-07, "loss": 0.11798454821109772, "num_input_tokens_seen": 4599202, "step": 4462, "train_runtime": 10870.0356, "train_tokens_per_second": 423.108 }, { "epoch": 1.9073618976386366, "grad_norm": 2.6404199600219727, "learning_rate": 9.326203208556151e-07, "loss": 0.07360601425170898, "num_input_tokens_seen": 4600228, "step": 4463, "train_runtime": 10872.1629, "train_tokens_per_second": 423.12 }, { "epoch": 1.9077892937279624, "grad_norm": 3.494415760040283, "learning_rate": 9.283422459893048e-07, "loss": 0.1317797601222992, "num_input_tokens_seen": 4601364, "step": 4464, "train_runtime": 10874.3183, "train_tokens_per_second": 423.14 }, { "epoch": 1.908216689817288, "grad_norm": 2.309741735458374, "learning_rate": 9.240641711229947e-07, "loss": 0.0942305326461792, "num_input_tokens_seen": 4602804, "step": 4465, "train_runtime": 10876.5232, "train_tokens_per_second": 423.187 }, { "epoch": 1.908644085906614, "grad_norm": 2.820481538772583, "learning_rate": 9.197860962566846e-07, "loss": 0.08808265626430511, "num_input_tokens_seen": 4603844, "step": 4466, "train_runtime": 10878.6275, "train_tokens_per_second": 423.201 }, { "epoch": 1.9090714819959398, "grad_norm": 3.6186227798461914, "learning_rate": 9.155080213903744e-07, "loss": 0.08472894877195358, "num_input_tokens_seen": 4604468, "step": 4467, "train_runtime": 10880.61, "train_tokens_per_second": 423.181 }, { "epoch": 1.9094988780852655, "grad_norm": 2.3990604877471924, "learning_rate": 9.112299465240643e-07, "loss": 0.04658800736069679, "num_input_tokens_seen": 4605274, "step": 4468, "train_runtime": 10882.6271, "train_tokens_per_second": 423.177 }, { "epoch": 1.9099262741745913, "grad_norm": 2.6029651165008545, "learning_rate": 9.069518716577541e-07, "loss": 0.0794363021850586, "num_input_tokens_seen": 4606284, "step": 4469, "train_runtime": 10884.7805, "train_tokens_per_second": 423.186 }, { "epoch": 1.910353670263917, "grad_norm": 3.233903169631958, "learning_rate": 9.02673796791444e-07, "loss": 0.09564993530511856, "num_input_tokens_seen": 4607106, "step": 4470, "train_runtime": 10886.8279, "train_tokens_per_second": 423.182 }, { "epoch": 1.910781066353243, "grad_norm": 2.8722848892211914, "learning_rate": 8.983957219251338e-07, "loss": 0.10308776795864105, "num_input_tokens_seen": 4608026, "step": 4471, "train_runtime": 10895.2446, "train_tokens_per_second": 422.939 }, { "epoch": 1.9112084624425687, "grad_norm": 2.3191356658935547, "learning_rate": 8.941176470588237e-07, "loss": 0.06808208674192429, "num_input_tokens_seen": 4609326, "step": 4472, "train_runtime": 10897.509, "train_tokens_per_second": 422.971 }, { "epoch": 1.9116358585318944, "grad_norm": 3.15012788772583, "learning_rate": 8.898395721925135e-07, "loss": 0.07747022807598114, "num_input_tokens_seen": 4610034, "step": 4473, "train_runtime": 10899.4937, "train_tokens_per_second": 422.959 }, { "epoch": 1.9120632546212202, "grad_norm": 2.6855080127716064, "learning_rate": 8.855614973262033e-07, "loss": 0.08258849382400513, "num_input_tokens_seen": 4610946, "step": 4474, "train_runtime": 10901.5584, "train_tokens_per_second": 422.962 }, { "epoch": 1.912490650710546, "grad_norm": 3.6249570846557617, "learning_rate": 8.812834224598932e-07, "loss": 0.15937760472297668, "num_input_tokens_seen": 4611904, "step": 4475, "train_runtime": 10903.7979, "train_tokens_per_second": 422.963 }, { "epoch": 1.9129180467998719, "grad_norm": 3.302855968475342, "learning_rate": 8.770053475935831e-07, "loss": 0.09469449520111084, "num_input_tokens_seen": 4612972, "step": 4476, "train_runtime": 10905.8861, "train_tokens_per_second": 422.98 }, { "epoch": 1.9133454428891976, "grad_norm": 3.47115421295166, "learning_rate": 8.727272727272728e-07, "loss": 0.12235187739133835, "num_input_tokens_seen": 4614188, "step": 4477, "train_runtime": 10908.0371, "train_tokens_per_second": 423.008 }, { "epoch": 1.9137728389785233, "grad_norm": 2.299360752105713, "learning_rate": 8.684491978609626e-07, "loss": 0.0771092027425766, "num_input_tokens_seen": 4615162, "step": 4478, "train_runtime": 10910.0839, "train_tokens_per_second": 423.018 }, { "epoch": 1.914200235067849, "grad_norm": 2.522913932800293, "learning_rate": 8.641711229946525e-07, "loss": 0.0717511847615242, "num_input_tokens_seen": 4616256, "step": 4479, "train_runtime": 10912.2003, "train_tokens_per_second": 423.036 }, { "epoch": 1.9146276311571748, "grad_norm": 2.7510159015655518, "learning_rate": 8.598930481283422e-07, "loss": 0.1033727303147316, "num_input_tokens_seen": 4617298, "step": 4480, "train_runtime": 10914.3292, "train_tokens_per_second": 423.049 }, { "epoch": 1.9150550272465008, "grad_norm": 2.4151244163513184, "learning_rate": 8.556149732620321e-07, "loss": 0.08595739305019379, "num_input_tokens_seen": 4618388, "step": 4481, "train_runtime": 10916.4773, "train_tokens_per_second": 423.066 }, { "epoch": 1.9154824233358265, "grad_norm": 2.7252376079559326, "learning_rate": 8.51336898395722e-07, "loss": 0.07521509379148483, "num_input_tokens_seen": 4619430, "step": 4482, "train_runtime": 10918.6822, "train_tokens_per_second": 423.076 }, { "epoch": 1.9159098194251523, "grad_norm": 2.6735124588012695, "learning_rate": 8.470588235294118e-07, "loss": 0.10662515461444855, "num_input_tokens_seen": 4620298, "step": 4483, "train_runtime": 10920.7703, "train_tokens_per_second": 423.074 }, { "epoch": 1.916337215514478, "grad_norm": 3.219670057296753, "learning_rate": 8.427807486631016e-07, "loss": 0.07701162248849869, "num_input_tokens_seen": 4621030, "step": 4484, "train_runtime": 10922.8223, "train_tokens_per_second": 423.062 }, { "epoch": 1.9167646116038037, "grad_norm": 2.793849468231201, "learning_rate": 8.385026737967915e-07, "loss": 0.12319433689117432, "num_input_tokens_seen": 4622124, "step": 4485, "train_runtime": 10924.9377, "train_tokens_per_second": 423.08 }, { "epoch": 1.9171920076931297, "grad_norm": 2.798619031906128, "learning_rate": 8.342245989304813e-07, "loss": 0.086573027074337, "num_input_tokens_seen": 4622936, "step": 4486, "train_runtime": 10926.9813, "train_tokens_per_second": 423.075 }, { "epoch": 1.9176194037824554, "grad_norm": 4.573685169219971, "learning_rate": 8.299465240641712e-07, "loss": 0.09519963711500168, "num_input_tokens_seen": 4623452, "step": 4487, "train_runtime": 10928.9411, "train_tokens_per_second": 423.047 }, { "epoch": 1.9180467998717812, "grad_norm": 2.2354068756103516, "learning_rate": 8.256684491978611e-07, "loss": 0.08667831122875214, "num_input_tokens_seen": 4624626, "step": 4488, "train_runtime": 10931.0923, "train_tokens_per_second": 423.071 }, { "epoch": 1.918474195961107, "grad_norm": 3.781447172164917, "learning_rate": 8.213903743315508e-07, "loss": 0.12547264993190765, "num_input_tokens_seen": 4625440, "step": 4489, "train_runtime": 10933.1179, "train_tokens_per_second": 423.067 }, { "epoch": 1.9189015920504326, "grad_norm": 2.7677695751190186, "learning_rate": 8.171122994652407e-07, "loss": 0.0763927474617958, "num_input_tokens_seen": 4626682, "step": 4490, "train_runtime": 10935.3543, "train_tokens_per_second": 423.094 }, { "epoch": 1.9193289881397586, "grad_norm": 1.879095435142517, "learning_rate": 8.128342245989306e-07, "loss": 0.06771612912416458, "num_input_tokens_seen": 4628188, "step": 4491, "train_runtime": 10937.6508, "train_tokens_per_second": 423.143 }, { "epoch": 1.9197563842290843, "grad_norm": 4.258627891540527, "learning_rate": 8.085561497326204e-07, "loss": 0.10876234620809555, "num_input_tokens_seen": 4629086, "step": 4492, "train_runtime": 10939.669, "train_tokens_per_second": 423.147 }, { "epoch": 1.92018378031841, "grad_norm": 2.422433614730835, "learning_rate": 8.042780748663102e-07, "loss": 0.09476907551288605, "num_input_tokens_seen": 4630218, "step": 4493, "train_runtime": 10941.7847, "train_tokens_per_second": 423.168 }, { "epoch": 1.9206111764077358, "grad_norm": 2.429797410964966, "learning_rate": 8.000000000000001e-07, "loss": 0.07689294964075089, "num_input_tokens_seen": 4631222, "step": 4494, "train_runtime": 10943.8672, "train_tokens_per_second": 423.18 }, { "epoch": 1.9210385724970616, "grad_norm": 2.0165908336639404, "learning_rate": 7.957219251336899e-07, "loss": 0.05318460613489151, "num_input_tokens_seen": 4632586, "step": 4495, "train_runtime": 10946.084, "train_tokens_per_second": 423.219 }, { "epoch": 1.9214659685863875, "grad_norm": 4.20761775970459, "learning_rate": 7.914438502673798e-07, "loss": 0.07873548567295074, "num_input_tokens_seen": 4633310, "step": 4496, "train_runtime": 10948.1285, "train_tokens_per_second": 423.206 }, { "epoch": 1.9218933646757133, "grad_norm": 2.5924205780029297, "learning_rate": 7.871657754010696e-07, "loss": 0.10081905126571655, "num_input_tokens_seen": 4634730, "step": 4497, "train_runtime": 10950.3803, "train_tokens_per_second": 423.248 }, { "epoch": 1.922320760765039, "grad_norm": 3.6822032928466797, "learning_rate": 7.828877005347594e-07, "loss": 0.09389260411262512, "num_input_tokens_seen": 4635824, "step": 4498, "train_runtime": 10952.5498, "train_tokens_per_second": 423.264 }, { "epoch": 1.9227481568543647, "grad_norm": 3.908029079437256, "learning_rate": 7.786096256684493e-07, "loss": 0.11471231281757355, "num_input_tokens_seen": 4636548, "step": 4499, "train_runtime": 10954.5924, "train_tokens_per_second": 423.252 }, { "epoch": 1.9231755529436905, "grad_norm": 2.634157657623291, "learning_rate": 7.743315508021392e-07, "loss": 0.08247380703687668, "num_input_tokens_seen": 4637418, "step": 4500, "train_runtime": 10956.639, "train_tokens_per_second": 423.252 }, { "epoch": 1.9236029490330164, "grad_norm": 2.4601261615753174, "learning_rate": 7.700534759358289e-07, "loss": 0.08436372131109238, "num_input_tokens_seen": 4638588, "step": 4501, "train_runtime": 10965.4772, "train_tokens_per_second": 423.017 }, { "epoch": 1.9240303451223422, "grad_norm": 3.006995677947998, "learning_rate": 7.657754010695188e-07, "loss": 0.07325327396392822, "num_input_tokens_seen": 4639484, "step": 4502, "train_runtime": 10967.5304, "train_tokens_per_second": 423.02 }, { "epoch": 1.924457741211668, "grad_norm": 2.252163887023926, "learning_rate": 7.614973262032087e-07, "loss": 0.06350468844175339, "num_input_tokens_seen": 4640650, "step": 4503, "train_runtime": 10969.7577, "train_tokens_per_second": 423.04 }, { "epoch": 1.9248851373009936, "grad_norm": 4.078907489776611, "learning_rate": 7.572192513368986e-07, "loss": 0.12562359869480133, "num_input_tokens_seen": 4641402, "step": 4504, "train_runtime": 10971.7872, "train_tokens_per_second": 423.031 }, { "epoch": 1.9253125333903194, "grad_norm": 2.573749542236328, "learning_rate": 7.529411764705882e-07, "loss": 0.09105457365512848, "num_input_tokens_seen": 4642344, "step": 4505, "train_runtime": 10973.9928, "train_tokens_per_second": 423.031 }, { "epoch": 1.9257399294796453, "grad_norm": 2.4820497035980225, "learning_rate": 7.486631016042781e-07, "loss": 0.05052736774086952, "num_input_tokens_seen": 4643312, "step": 4506, "train_runtime": 10976.0944, "train_tokens_per_second": 423.039 }, { "epoch": 1.926167325568971, "grad_norm": 2.8915936946868896, "learning_rate": 7.443850267379679e-07, "loss": 0.12244762480258942, "num_input_tokens_seen": 4644386, "step": 4507, "train_runtime": 10978.178, "train_tokens_per_second": 423.056 }, { "epoch": 1.9265947216582968, "grad_norm": 2.169282913208008, "learning_rate": 7.401069518716578e-07, "loss": 0.05559958890080452, "num_input_tokens_seen": 4645144, "step": 4508, "train_runtime": 10980.181, "train_tokens_per_second": 423.048 }, { "epoch": 1.9270221177476226, "grad_norm": 2.6740500926971436, "learning_rate": 7.358288770053476e-07, "loss": 0.09286932647228241, "num_input_tokens_seen": 4646072, "step": 4509, "train_runtime": 10982.2293, "train_tokens_per_second": 423.054 }, { "epoch": 1.9274495138369483, "grad_norm": 6.0752973556518555, "learning_rate": 7.315508021390374e-07, "loss": 0.06717438995838165, "num_input_tokens_seen": 4646864, "step": 4510, "train_runtime": 10984.2682, "train_tokens_per_second": 423.047 }, { "epoch": 1.9278769099262743, "grad_norm": 3.03288197517395, "learning_rate": 7.272727272727273e-07, "loss": 0.11324767023324966, "num_input_tokens_seen": 4647758, "step": 4511, "train_runtime": 10986.3413, "train_tokens_per_second": 423.049 }, { "epoch": 1.9283043060156, "grad_norm": 1.8207811117172241, "learning_rate": 7.229946524064172e-07, "loss": 0.06085740774869919, "num_input_tokens_seen": 4649322, "step": 4512, "train_runtime": 10988.5814, "train_tokens_per_second": 423.105 }, { "epoch": 1.9287317021049257, "grad_norm": 2.4698426723480225, "learning_rate": 7.18716577540107e-07, "loss": 0.07891259342432022, "num_input_tokens_seen": 4650230, "step": 4513, "train_runtime": 10990.7563, "train_tokens_per_second": 423.104 }, { "epoch": 1.9291590981942517, "grad_norm": 3.377413511276245, "learning_rate": 7.144385026737968e-07, "loss": 0.13608857989311218, "num_input_tokens_seen": 4651312, "step": 4514, "train_runtime": 10992.8335, "train_tokens_per_second": 423.122 }, { "epoch": 1.9295864942835772, "grad_norm": 2.521959066390991, "learning_rate": 7.101604278074867e-07, "loss": 0.08363817632198334, "num_input_tokens_seen": 4652318, "step": 4515, "train_runtime": 10994.9245, "train_tokens_per_second": 423.133 }, { "epoch": 1.9300138903729032, "grad_norm": 3.3962671756744385, "learning_rate": 7.058823529411766e-07, "loss": 0.06874531507492065, "num_input_tokens_seen": 4653000, "step": 4516, "train_runtime": 10996.9724, "train_tokens_per_second": 423.116 }, { "epoch": 1.930441286462229, "grad_norm": 2.5928187370300293, "learning_rate": 7.016042780748663e-07, "loss": 0.067188560962677, "num_input_tokens_seen": 4653932, "step": 4517, "train_runtime": 10999.097, "train_tokens_per_second": 423.119 }, { "epoch": 1.9308686825515546, "grad_norm": 2.1606643199920654, "learning_rate": 6.973262032085562e-07, "loss": 0.05929163843393326, "num_input_tokens_seen": 4654536, "step": 4518, "train_runtime": 11001.1042, "train_tokens_per_second": 423.097 }, { "epoch": 1.9312960786408806, "grad_norm": 2.681345224380493, "learning_rate": 6.930481283422461e-07, "loss": 0.0747632309794426, "num_input_tokens_seen": 4655626, "step": 4519, "train_runtime": 11003.2926, "train_tokens_per_second": 423.112 }, { "epoch": 1.9317234747302061, "grad_norm": 3.167240858078003, "learning_rate": 6.887700534759359e-07, "loss": 0.17355136573314667, "num_input_tokens_seen": 4656594, "step": 4520, "train_runtime": 11005.4029, "train_tokens_per_second": 423.119 }, { "epoch": 1.932150870819532, "grad_norm": 2.812575578689575, "learning_rate": 6.844919786096257e-07, "loss": 0.06282568722963333, "num_input_tokens_seen": 4657184, "step": 4521, "train_runtime": 11007.4516, "train_tokens_per_second": 423.094 }, { "epoch": 1.9325782669088578, "grad_norm": 2.9438235759735107, "learning_rate": 6.802139037433156e-07, "loss": 0.09269047528505325, "num_input_tokens_seen": 4658188, "step": 4522, "train_runtime": 11009.6054, "train_tokens_per_second": 423.102 }, { "epoch": 1.9330056629981835, "grad_norm": 3.1238341331481934, "learning_rate": 6.759358288770054e-07, "loss": 0.09006265550851822, "num_input_tokens_seen": 4659012, "step": 4523, "train_runtime": 11011.675, "train_tokens_per_second": 423.097 }, { "epoch": 1.9334330590875095, "grad_norm": 2.5435688495635986, "learning_rate": 6.716577540106953e-07, "loss": 0.06652931123971939, "num_input_tokens_seen": 4659986, "step": 4524, "train_runtime": 11013.7559, "train_tokens_per_second": 423.106 }, { "epoch": 1.933860455176835, "grad_norm": 2.0927414894104004, "learning_rate": 6.673796791443852e-07, "loss": 0.04113670065999031, "num_input_tokens_seen": 4660692, "step": 4525, "train_runtime": 11015.8221, "train_tokens_per_second": 423.091 }, { "epoch": 1.934287851266161, "grad_norm": 2.7394750118255615, "learning_rate": 6.631016042780749e-07, "loss": 0.08025995641946793, "num_input_tokens_seen": 4661526, "step": 4526, "train_runtime": 11017.8843, "train_tokens_per_second": 423.087 }, { "epoch": 1.9347152473554867, "grad_norm": 2.9899301528930664, "learning_rate": 6.588235294117648e-07, "loss": 0.12163376063108444, "num_input_tokens_seen": 4663384, "step": 4527, "train_runtime": 11020.181, "train_tokens_per_second": 423.168 }, { "epoch": 1.9351426434448125, "grad_norm": 2.172370672225952, "learning_rate": 6.545454545454547e-07, "loss": 0.10206068307161331, "num_input_tokens_seen": 4664762, "step": 4528, "train_runtime": 11022.3904, "train_tokens_per_second": 423.208 }, { "epoch": 1.9355700395341384, "grad_norm": 3.474428176879883, "learning_rate": 6.502673796791445e-07, "loss": 0.11561005562543869, "num_input_tokens_seen": 4665776, "step": 4529, "train_runtime": 11024.5592, "train_tokens_per_second": 423.217 }, { "epoch": 1.935997435623464, "grad_norm": 2.96338152885437, "learning_rate": 6.459893048128343e-07, "loss": 0.07063794136047363, "num_input_tokens_seen": 4666948, "step": 4530, "train_runtime": 11026.7072, "train_tokens_per_second": 423.24 }, { "epoch": 1.93642483171279, "grad_norm": 2.158540725708008, "learning_rate": 6.417112299465242e-07, "loss": 0.05454091727733612, "num_input_tokens_seen": 4668144, "step": 4531, "train_runtime": 11035.5306, "train_tokens_per_second": 423.01 }, { "epoch": 1.9368522278021156, "grad_norm": 2.188514232635498, "learning_rate": 6.374331550802139e-07, "loss": 0.05827419459819794, "num_input_tokens_seen": 4669384, "step": 4532, "train_runtime": 11037.6899, "train_tokens_per_second": 423.04 }, { "epoch": 1.9372796238914414, "grad_norm": 2.954690933227539, "learning_rate": 6.331550802139037e-07, "loss": 0.07166343927383423, "num_input_tokens_seen": 4670094, "step": 4533, "train_runtime": 11039.9946, "train_tokens_per_second": 423.016 }, { "epoch": 1.9377070199807673, "grad_norm": 2.2040185928344727, "learning_rate": 6.288770053475936e-07, "loss": 0.07868187129497528, "num_input_tokens_seen": 4671402, "step": 4534, "train_runtime": 11042.1638, "train_tokens_per_second": 423.051 }, { "epoch": 1.9381344160700928, "grad_norm": 2.6908469200134277, "learning_rate": 6.245989304812835e-07, "loss": 0.08612082898616791, "num_input_tokens_seen": 4672470, "step": 4535, "train_runtime": 11044.2612, "train_tokens_per_second": 423.068 }, { "epoch": 1.9385618121594188, "grad_norm": 3.2068042755126953, "learning_rate": 6.203208556149733e-07, "loss": 0.09664101898670197, "num_input_tokens_seen": 4673342, "step": 4536, "train_runtime": 11046.3287, "train_tokens_per_second": 423.067 }, { "epoch": 1.9389892082487445, "grad_norm": 2.803537368774414, "learning_rate": 6.160427807486632e-07, "loss": 0.10462618619203568, "num_input_tokens_seen": 4674028, "step": 4537, "train_runtime": 11048.3268, "train_tokens_per_second": 423.053 }, { "epoch": 1.9394166043380703, "grad_norm": 3.147202730178833, "learning_rate": 6.11764705882353e-07, "loss": 0.08873769640922546, "num_input_tokens_seen": 4674756, "step": 4538, "train_runtime": 11050.3684, "train_tokens_per_second": 423.041 }, { "epoch": 1.9398440004273962, "grad_norm": 3.1199429035186768, "learning_rate": 6.074866310160428e-07, "loss": 0.09317778795957565, "num_input_tokens_seen": 4675534, "step": 4539, "train_runtime": 11052.4004, "train_tokens_per_second": 423.033 }, { "epoch": 1.9402713965167218, "grad_norm": 4.304396629333496, "learning_rate": 6.032085561497327e-07, "loss": 0.09714939445257187, "num_input_tokens_seen": 4676648, "step": 4540, "train_runtime": 11054.4922, "train_tokens_per_second": 423.054 }, { "epoch": 1.9406987926060477, "grad_norm": 2.638195276260376, "learning_rate": 5.989304812834224e-07, "loss": 0.08140614628791809, "num_input_tokens_seen": 4677624, "step": 4541, "train_runtime": 11056.6009, "train_tokens_per_second": 423.062 }, { "epoch": 1.9411261886953735, "grad_norm": 2.2924797534942627, "learning_rate": 5.946524064171123e-07, "loss": 0.05866424739360809, "num_input_tokens_seen": 4678680, "step": 4542, "train_runtime": 11058.6855, "train_tokens_per_second": 423.077 }, { "epoch": 1.9415535847846992, "grad_norm": 3.5593459606170654, "learning_rate": 5.903743315508022e-07, "loss": 0.11644919216632843, "num_input_tokens_seen": 4679828, "step": 4543, "train_runtime": 11060.7981, "train_tokens_per_second": 423.1 }, { "epoch": 1.9419809808740252, "grad_norm": 3.889326810836792, "learning_rate": 5.86096256684492e-07, "loss": 0.07622142136096954, "num_input_tokens_seen": 4680696, "step": 4544, "train_runtime": 11062.8541, "train_tokens_per_second": 423.1 }, { "epoch": 1.9424083769633507, "grad_norm": 3.3499138355255127, "learning_rate": 5.818181818181819e-07, "loss": 0.08571440726518631, "num_input_tokens_seen": 4681318, "step": 4545, "train_runtime": 11064.8713, "train_tokens_per_second": 423.079 }, { "epoch": 1.9428357730526766, "grad_norm": 3.379067897796631, "learning_rate": 5.775401069518717e-07, "loss": 0.06637506186962128, "num_input_tokens_seen": 4682014, "step": 4546, "train_runtime": 11066.8914, "train_tokens_per_second": 423.065 }, { "epoch": 1.9432631691420024, "grad_norm": 2.3626327514648438, "learning_rate": 5.732620320855615e-07, "loss": 0.07608707249164581, "num_input_tokens_seen": 4683086, "step": 4547, "train_runtime": 11069.0062, "train_tokens_per_second": 423.081 }, { "epoch": 1.943690565231328, "grad_norm": 2.6304876804351807, "learning_rate": 5.689839572192514e-07, "loss": 0.0915163904428482, "num_input_tokens_seen": 4684090, "step": 4548, "train_runtime": 11071.0628, "train_tokens_per_second": 423.093 }, { "epoch": 1.944117961320654, "grad_norm": 2.315802574157715, "learning_rate": 5.647058823529413e-07, "loss": 0.05967039614915848, "num_input_tokens_seen": 4685268, "step": 4549, "train_runtime": 11073.1943, "train_tokens_per_second": 423.118 }, { "epoch": 1.9445453574099796, "grad_norm": 3.4916250705718994, "learning_rate": 5.60427807486631e-07, "loss": 0.07737503945827484, "num_input_tokens_seen": 4686228, "step": 4550, "train_runtime": 11075.251, "train_tokens_per_second": 423.126 }, { "epoch": 1.9449727534993055, "grad_norm": 2.7871346473693848, "learning_rate": 5.561497326203209e-07, "loss": 0.08479427546262741, "num_input_tokens_seen": 4687436, "step": 4551, "train_runtime": 11077.426, "train_tokens_per_second": 423.152 }, { "epoch": 1.9454001495886313, "grad_norm": 2.6285719871520996, "learning_rate": 5.518716577540107e-07, "loss": 0.09612537920475006, "num_input_tokens_seen": 4689176, "step": 4552, "train_runtime": 11079.6737, "train_tokens_per_second": 423.223 }, { "epoch": 1.945827545677957, "grad_norm": 3.9141738414764404, "learning_rate": 5.475935828877006e-07, "loss": 0.08281700313091278, "num_input_tokens_seen": 4689724, "step": 4553, "train_runtime": 11081.7164, "train_tokens_per_second": 423.195 }, { "epoch": 1.946254941767283, "grad_norm": 2.7731518745422363, "learning_rate": 5.433155080213904e-07, "loss": 0.08834431320428848, "num_input_tokens_seen": 4690788, "step": 4554, "train_runtime": 11083.8132, "train_tokens_per_second": 423.211 }, { "epoch": 1.9466823378566085, "grad_norm": 3.006840229034424, "learning_rate": 5.390374331550803e-07, "loss": 0.1024986058473587, "num_input_tokens_seen": 4691868, "step": 4555, "train_runtime": 11085.9127, "train_tokens_per_second": 423.228 }, { "epoch": 1.9471097339459345, "grad_norm": 2.871394157409668, "learning_rate": 5.347593582887701e-07, "loss": 0.08783483505249023, "num_input_tokens_seen": 4692568, "step": 4556, "train_runtime": 11088.0213, "train_tokens_per_second": 423.211 }, { "epoch": 1.9475371300352602, "grad_norm": 2.776301383972168, "learning_rate": 5.304812834224599e-07, "loss": 0.10947674512863159, "num_input_tokens_seen": 4693474, "step": 4557, "train_runtime": 11090.1009, "train_tokens_per_second": 423.213 }, { "epoch": 1.947964526124586, "grad_norm": 2.1903395652770996, "learning_rate": 5.262032085561498e-07, "loss": 0.07248228788375854, "num_input_tokens_seen": 4694508, "step": 4558, "train_runtime": 11092.3078, "train_tokens_per_second": 423.222 }, { "epoch": 1.9483919222139119, "grad_norm": 4.3749918937683105, "learning_rate": 5.219251336898397e-07, "loss": 0.11831034719944, "num_input_tokens_seen": 4695362, "step": 4559, "train_runtime": 11094.3765, "train_tokens_per_second": 423.22 }, { "epoch": 1.9488193183032374, "grad_norm": 2.441965103149414, "learning_rate": 5.176470588235294e-07, "loss": 0.0629957839846611, "num_input_tokens_seen": 4696272, "step": 4560, "train_runtime": 11096.4713, "train_tokens_per_second": 423.222 }, { "epoch": 1.9492467143925634, "grad_norm": 4.911445617675781, "learning_rate": 5.133689839572193e-07, "loss": 0.1619553565979004, "num_input_tokens_seen": 4697098, "step": 4561, "train_runtime": 11104.9215, "train_tokens_per_second": 422.974 }, { "epoch": 1.949674110481889, "grad_norm": 2.728515863418579, "learning_rate": 5.090909090909092e-07, "loss": 0.09682068973779678, "num_input_tokens_seen": 4698066, "step": 4562, "train_runtime": 11107.187, "train_tokens_per_second": 422.975 }, { "epoch": 1.9501015065712148, "grad_norm": 1.9767149686813354, "learning_rate": 5.04812834224599e-07, "loss": 0.05832261964678764, "num_input_tokens_seen": 4699038, "step": 4563, "train_runtime": 11109.3487, "train_tokens_per_second": 422.981 }, { "epoch": 1.9505289026605408, "grad_norm": 3.2443628311157227, "learning_rate": 5.005347593582888e-07, "loss": 0.13833874464035034, "num_input_tokens_seen": 4699864, "step": 4564, "train_runtime": 11111.4391, "train_tokens_per_second": 422.975 }, { "epoch": 1.9509562987498663, "grad_norm": 2.99072265625, "learning_rate": 4.962566844919787e-07, "loss": 0.08302243053913116, "num_input_tokens_seen": 4700840, "step": 4565, "train_runtime": 11113.6501, "train_tokens_per_second": 422.979 }, { "epoch": 1.9513836948391923, "grad_norm": 3.036231517791748, "learning_rate": 4.919786096256684e-07, "loss": 0.09491357952356339, "num_input_tokens_seen": 4701826, "step": 4566, "train_runtime": 11115.8221, "train_tokens_per_second": 422.985 }, { "epoch": 1.951811090928518, "grad_norm": 2.312161684036255, "learning_rate": 4.877005347593583e-07, "loss": 0.08124493062496185, "num_input_tokens_seen": 4703148, "step": 4567, "train_runtime": 11118.0297, "train_tokens_per_second": 423.02 }, { "epoch": 1.9522384870178437, "grad_norm": 2.8678829669952393, "learning_rate": 4.834224598930482e-07, "loss": 0.12963111698627472, "num_input_tokens_seen": 4704396, "step": 4568, "train_runtime": 11120.1772, "train_tokens_per_second": 423.05 }, { "epoch": 1.9526658831071697, "grad_norm": 2.644441604614258, "learning_rate": 4.79144385026738e-07, "loss": 0.10339433699846268, "num_input_tokens_seen": 4705448, "step": 4569, "train_runtime": 11122.3089, "train_tokens_per_second": 423.064 }, { "epoch": 1.9530932791964952, "grad_norm": 2.629354476928711, "learning_rate": 4.7486631016042785e-07, "loss": 0.0813981220126152, "num_input_tokens_seen": 4706630, "step": 4570, "train_runtime": 11124.4823, "train_tokens_per_second": 423.088 }, { "epoch": 1.9535206752858212, "grad_norm": 2.3001961708068848, "learning_rate": 4.7058823529411767e-07, "loss": 0.06940969079732895, "num_input_tokens_seen": 4707594, "step": 4571, "train_runtime": 11126.5829, "train_tokens_per_second": 423.094 }, { "epoch": 1.953948071375147, "grad_norm": 3.281641960144043, "learning_rate": 4.6631016042780754e-07, "loss": 0.14235064387321472, "num_input_tokens_seen": 4708502, "step": 4572, "train_runtime": 11128.7139, "train_tokens_per_second": 423.095 }, { "epoch": 1.9543754674644727, "grad_norm": 2.15511155128479, "learning_rate": 4.6203208556149735e-07, "loss": 0.08907820284366608, "num_input_tokens_seen": 4709928, "step": 4573, "train_runtime": 11130.8898, "train_tokens_per_second": 423.14 }, { "epoch": 1.9548028635537986, "grad_norm": 2.717864513397217, "learning_rate": 4.577540106951872e-07, "loss": 0.08128479868173599, "num_input_tokens_seen": 4711620, "step": 4574, "train_runtime": 11133.1898, "train_tokens_per_second": 423.205 }, { "epoch": 1.9552302596431241, "grad_norm": 3.2088775634765625, "learning_rate": 4.5347593582887704e-07, "loss": 0.10385055840015411, "num_input_tokens_seen": 4712450, "step": 4575, "train_runtime": 11135.2174, "train_tokens_per_second": 423.202 }, { "epoch": 1.95565765573245, "grad_norm": 3.097871780395508, "learning_rate": 4.491978609625669e-07, "loss": 0.06359519809484482, "num_input_tokens_seen": 4713134, "step": 4576, "train_runtime": 11137.2401, "train_tokens_per_second": 423.187 }, { "epoch": 1.9560850518217758, "grad_norm": 2.547149896621704, "learning_rate": 4.449197860962567e-07, "loss": 0.08061902970075607, "num_input_tokens_seen": 4714564, "step": 4577, "train_runtime": 11139.4441, "train_tokens_per_second": 423.232 }, { "epoch": 1.9565124479111016, "grad_norm": 1.7962956428527832, "learning_rate": 4.406417112299466e-07, "loss": 0.0759037435054779, "num_input_tokens_seen": 4716236, "step": 4578, "train_runtime": 11141.7643, "train_tokens_per_second": 423.293 }, { "epoch": 1.9569398440004275, "grad_norm": 3.3110880851745605, "learning_rate": 4.363636363636364e-07, "loss": 0.07120725512504578, "num_input_tokens_seen": 4717074, "step": 4579, "train_runtime": 11143.8633, "train_tokens_per_second": 423.289 }, { "epoch": 1.957367240089753, "grad_norm": 2.2016069889068604, "learning_rate": 4.3208556149732623e-07, "loss": 0.06737089902162552, "num_input_tokens_seen": 4717898, "step": 4580, "train_runtime": 11145.9655, "train_tokens_per_second": 423.283 }, { "epoch": 1.957794636179079, "grad_norm": 3.2486517429351807, "learning_rate": 4.2780748663101604e-07, "loss": 0.1407386064529419, "num_input_tokens_seen": 4718616, "step": 4581, "train_runtime": 11148.0762, "train_tokens_per_second": 423.267 }, { "epoch": 1.9582220322684047, "grad_norm": 4.887596130371094, "learning_rate": 4.235294117647059e-07, "loss": 0.12462133169174194, "num_input_tokens_seen": 4719342, "step": 4582, "train_runtime": 11150.1627, "train_tokens_per_second": 423.253 }, { "epoch": 1.9586494283577305, "grad_norm": 10.160305976867676, "learning_rate": 4.1925133689839573e-07, "loss": 0.1265372633934021, "num_input_tokens_seen": 4720046, "step": 4583, "train_runtime": 11152.2086, "train_tokens_per_second": 423.239 }, { "epoch": 1.9590768244470564, "grad_norm": 2.3367831707000732, "learning_rate": 4.149732620320856e-07, "loss": 0.10565128922462463, "num_input_tokens_seen": 4721688, "step": 4584, "train_runtime": 11154.4968, "train_tokens_per_second": 423.299 }, { "epoch": 1.959504220536382, "grad_norm": 2.0345544815063477, "learning_rate": 4.106951871657754e-07, "loss": 0.0666138231754303, "num_input_tokens_seen": 4722754, "step": 4585, "train_runtime": 11156.6723, "train_tokens_per_second": 423.312 }, { "epoch": 1.959931616625708, "grad_norm": 2.5558927059173584, "learning_rate": 4.064171122994653e-07, "loss": 0.07684600353240967, "num_input_tokens_seen": 4723672, "step": 4586, "train_runtime": 11158.7778, "train_tokens_per_second": 423.314 }, { "epoch": 1.9603590127150337, "grad_norm": 2.3063933849334717, "learning_rate": 4.021390374331551e-07, "loss": 0.11385758966207504, "num_input_tokens_seen": 4724836, "step": 4587, "train_runtime": 11160.9366, "train_tokens_per_second": 423.337 }, { "epoch": 1.9607864088043594, "grad_norm": 2.47609281539917, "learning_rate": 3.9786096256684497e-07, "loss": 0.05028097331523895, "num_input_tokens_seen": 4725606, "step": 4588, "train_runtime": 11163.0262, "train_tokens_per_second": 423.327 }, { "epoch": 1.9612138048936854, "grad_norm": 3.7131035327911377, "learning_rate": 3.935828877005348e-07, "loss": 0.08615584671497345, "num_input_tokens_seen": 4726378, "step": 4589, "train_runtime": 11165.0942, "train_tokens_per_second": 423.317 }, { "epoch": 1.9616412009830109, "grad_norm": 2.3089146614074707, "learning_rate": 3.8930481283422465e-07, "loss": 0.07162284851074219, "num_input_tokens_seen": 4727362, "step": 4590, "train_runtime": 11167.1902, "train_tokens_per_second": 423.326 }, { "epoch": 1.9620685970723368, "grad_norm": 2.313880443572998, "learning_rate": 3.8502673796791447e-07, "loss": 0.06751394271850586, "num_input_tokens_seen": 4728912, "step": 4591, "train_runtime": 11175.7638, "train_tokens_per_second": 423.14 }, { "epoch": 1.9624959931616626, "grad_norm": 2.4609978199005127, "learning_rate": 3.8074866310160434e-07, "loss": 0.08920436352491379, "num_input_tokens_seen": 4729916, "step": 4592, "train_runtime": 11177.919, "train_tokens_per_second": 423.148 }, { "epoch": 1.9629233892509883, "grad_norm": 3.2225425243377686, "learning_rate": 3.764705882352941e-07, "loss": 0.11080729961395264, "num_input_tokens_seen": 4730828, "step": 4593, "train_runtime": 11180.0022, "train_tokens_per_second": 423.151 }, { "epoch": 1.9633507853403143, "grad_norm": 2.332368850708008, "learning_rate": 3.7219251336898397e-07, "loss": 0.09047398716211319, "num_input_tokens_seen": 4731948, "step": 4594, "train_runtime": 11182.1291, "train_tokens_per_second": 423.171 }, { "epoch": 1.9637781814296398, "grad_norm": 3.1621766090393066, "learning_rate": 3.679144385026738e-07, "loss": 0.054371293634176254, "num_input_tokens_seen": 4732806, "step": 4595, "train_runtime": 11184.2209, "train_tokens_per_second": 423.168 }, { "epoch": 1.9642055775189657, "grad_norm": 2.657390594482422, "learning_rate": 3.6363636363636366e-07, "loss": 0.10414905101060867, "num_input_tokens_seen": 4733966, "step": 4596, "train_runtime": 11186.3025, "train_tokens_per_second": 423.193 }, { "epoch": 1.9646329736082915, "grad_norm": 1.9876104593276978, "learning_rate": 3.593582887700535e-07, "loss": 0.05372269079089165, "num_input_tokens_seen": 4734720, "step": 4597, "train_runtime": 11188.3079, "train_tokens_per_second": 423.185 }, { "epoch": 1.9650603696976172, "grad_norm": 1.8673558235168457, "learning_rate": 3.5508021390374334e-07, "loss": 0.0764034241437912, "num_input_tokens_seen": 4736286, "step": 4598, "train_runtime": 11190.5909, "train_tokens_per_second": 423.238 }, { "epoch": 1.9654877657869432, "grad_norm": 4.007637023925781, "learning_rate": 3.5080213903743316e-07, "loss": 0.08312540501356125, "num_input_tokens_seen": 4737088, "step": 4599, "train_runtime": 11192.6458, "train_tokens_per_second": 423.232 }, { "epoch": 1.9659151618762687, "grad_norm": 2.573748826980591, "learning_rate": 3.4652406417112303e-07, "loss": 0.11682626605033875, "num_input_tokens_seen": 4738756, "step": 4600, "train_runtime": 11194.8981, "train_tokens_per_second": 423.296 }, { "epoch": 1.9663425579655947, "grad_norm": 2.9857099056243896, "learning_rate": 3.4224598930481285e-07, "loss": 0.09980595111846924, "num_input_tokens_seen": 4739616, "step": 4601, "train_runtime": 11196.9875, "train_tokens_per_second": 423.294 }, { "epoch": 1.9667699540549204, "grad_norm": 2.898076295852661, "learning_rate": 3.379679144385027e-07, "loss": 0.10526564717292786, "num_input_tokens_seen": 4740538, "step": 4602, "train_runtime": 11199.1576, "train_tokens_per_second": 423.294 }, { "epoch": 1.9671973501442461, "grad_norm": 2.2916786670684814, "learning_rate": 3.336898395721926e-07, "loss": 0.04620625823736191, "num_input_tokens_seen": 4741346, "step": 4603, "train_runtime": 11201.1387, "train_tokens_per_second": 423.291 }, { "epoch": 1.967624746233572, "grad_norm": 4.059272289276123, "learning_rate": 3.294117647058824e-07, "loss": 0.12072921544313431, "num_input_tokens_seen": 4742578, "step": 4604, "train_runtime": 11203.2772, "train_tokens_per_second": 423.321 }, { "epoch": 1.9680521423228976, "grad_norm": 2.514986038208008, "learning_rate": 3.2513368983957227e-07, "loss": 0.0733695849776268, "num_input_tokens_seen": 4743362, "step": 4605, "train_runtime": 11205.3568, "train_tokens_per_second": 423.312 }, { "epoch": 1.9684795384122236, "grad_norm": 1.5780837535858154, "learning_rate": 3.208556149732621e-07, "loss": 0.03916705772280693, "num_input_tokens_seen": 4744378, "step": 4606, "train_runtime": 11207.4514, "train_tokens_per_second": 423.324 }, { "epoch": 1.9689069345015493, "grad_norm": 2.7726175785064697, "learning_rate": 3.1657754010695185e-07, "loss": 0.0669010579586029, "num_input_tokens_seen": 4744958, "step": 4607, "train_runtime": 11209.445, "train_tokens_per_second": 423.3 }, { "epoch": 1.969334330590875, "grad_norm": 3.0967917442321777, "learning_rate": 3.1229946524064177e-07, "loss": 0.06793845444917679, "num_input_tokens_seen": 4745776, "step": 4608, "train_runtime": 11211.5288, "train_tokens_per_second": 423.294 }, { "epoch": 1.969761726680201, "grad_norm": 2.4741933345794678, "learning_rate": 3.080213903743316e-07, "loss": 0.07393999397754669, "num_input_tokens_seen": 4746654, "step": 4609, "train_runtime": 11213.6426, "train_tokens_per_second": 423.293 }, { "epoch": 1.9701891227695265, "grad_norm": 2.536719560623169, "learning_rate": 3.037433155080214e-07, "loss": 0.08613823354244232, "num_input_tokens_seen": 4747758, "step": 4610, "train_runtime": 11215.7791, "train_tokens_per_second": 423.311 }, { "epoch": 1.9706165188588525, "grad_norm": 6.438047885894775, "learning_rate": 2.994652406417112e-07, "loss": 0.10467591881752014, "num_input_tokens_seen": 4748890, "step": 4611, "train_runtime": 11217.9143, "train_tokens_per_second": 423.331 }, { "epoch": 1.9710439149481782, "grad_norm": 2.42236590385437, "learning_rate": 2.951871657754011e-07, "loss": 0.07271308451890945, "num_input_tokens_seen": 4749970, "step": 4612, "train_runtime": 11220.1451, "train_tokens_per_second": 423.343 }, { "epoch": 1.971471311037504, "grad_norm": 2.6034903526306152, "learning_rate": 2.9090909090909096e-07, "loss": 0.06916365027427673, "num_input_tokens_seen": 4750858, "step": 4613, "train_runtime": 11222.1985, "train_tokens_per_second": 423.345 }, { "epoch": 1.97189870712683, "grad_norm": 2.8886992931365967, "learning_rate": 2.866310160427808e-07, "loss": 0.09915220737457275, "num_input_tokens_seen": 4752256, "step": 4614, "train_runtime": 11224.4925, "train_tokens_per_second": 423.383 }, { "epoch": 1.9723261032161554, "grad_norm": 2.10439395904541, "learning_rate": 2.8235294117647064e-07, "loss": 0.06319509446620941, "num_input_tokens_seen": 4753160, "step": 4615, "train_runtime": 11226.5423, "train_tokens_per_second": 423.386 }, { "epoch": 1.9727534993054814, "grad_norm": 2.8660531044006348, "learning_rate": 2.7807486631016046e-07, "loss": 0.11509943753480911, "num_input_tokens_seen": 4754174, "step": 4616, "train_runtime": 11228.6311, "train_tokens_per_second": 423.397 }, { "epoch": 1.9731808953948071, "grad_norm": 2.3386032581329346, "learning_rate": 2.737967914438503e-07, "loss": 0.09830325841903687, "num_input_tokens_seen": 4755330, "step": 4617, "train_runtime": 11230.7667, "train_tokens_per_second": 423.42 }, { "epoch": 1.9736082914841329, "grad_norm": 3.7125515937805176, "learning_rate": 2.6951871657754015e-07, "loss": 0.13523618876934052, "num_input_tokens_seen": 4756462, "step": 4618, "train_runtime": 11232.8546, "train_tokens_per_second": 423.442 }, { "epoch": 1.9740356875734588, "grad_norm": 3.787569046020508, "learning_rate": 2.6524064171122996e-07, "loss": 0.08793338388204575, "num_input_tokens_seen": 4757774, "step": 4619, "train_runtime": 11235.0325, "train_tokens_per_second": 423.477 }, { "epoch": 1.9744630836627843, "grad_norm": 2.661362648010254, "learning_rate": 2.6096256684491983e-07, "loss": 0.08164241909980774, "num_input_tokens_seen": 4758754, "step": 4620, "train_runtime": 11237.1489, "train_tokens_per_second": 423.484 }, { "epoch": 1.9748904797521103, "grad_norm": 2.86749005317688, "learning_rate": 2.5668449197860965e-07, "loss": 0.08064473420381546, "num_input_tokens_seen": 4759750, "step": 4621, "train_runtime": 11245.6235, "train_tokens_per_second": 423.254 }, { "epoch": 1.975317875841436, "grad_norm": 2.74626088142395, "learning_rate": 2.524064171122995e-07, "loss": 0.08887047320604324, "num_input_tokens_seen": 4760638, "step": 4622, "train_runtime": 11247.6435, "train_tokens_per_second": 423.256 }, { "epoch": 1.9757452719307618, "grad_norm": 2.620147466659546, "learning_rate": 2.4812834224598933e-07, "loss": 0.062282875180244446, "num_input_tokens_seen": 4761450, "step": 4623, "train_runtime": 11249.7593, "train_tokens_per_second": 423.249 }, { "epoch": 1.9761726680200877, "grad_norm": 2.8994674682617188, "learning_rate": 2.4385026737967915e-07, "loss": 0.08498292416334152, "num_input_tokens_seen": 4762392, "step": 4624, "train_runtime": 11251.8125, "train_tokens_per_second": 423.256 }, { "epoch": 1.9766000641094132, "grad_norm": 3.430529832839966, "learning_rate": 2.39572192513369e-07, "loss": 0.0841522216796875, "num_input_tokens_seen": 4763160, "step": 4625, "train_runtime": 11253.8374, "train_tokens_per_second": 423.248 }, { "epoch": 1.9770274601987392, "grad_norm": 3.1292967796325684, "learning_rate": 2.3529411764705883e-07, "loss": 0.08050095289945602, "num_input_tokens_seen": 4763968, "step": 4626, "train_runtime": 11255.887, "train_tokens_per_second": 423.242 }, { "epoch": 1.977454856288065, "grad_norm": 1.4452532529830933, "learning_rate": 2.3101604278074868e-07, "loss": 0.08450129628181458, "num_input_tokens_seen": 4768176, "step": 4627, "train_runtime": 11258.714, "train_tokens_per_second": 423.51 }, { "epoch": 1.9778822523773907, "grad_norm": 3.6390323638916016, "learning_rate": 2.2673796791443852e-07, "loss": 0.09862130135297775, "num_input_tokens_seen": 4768886, "step": 4628, "train_runtime": 11260.8063, "train_tokens_per_second": 423.494 }, { "epoch": 1.9783096484667166, "grad_norm": 2.7303106784820557, "learning_rate": 2.2245989304812836e-07, "loss": 0.09639957547187805, "num_input_tokens_seen": 4769916, "step": 4629, "train_runtime": 11262.8929, "train_tokens_per_second": 423.507 }, { "epoch": 1.9787370445560422, "grad_norm": 3.2974090576171875, "learning_rate": 2.181818181818182e-07, "loss": 0.12696050107479095, "num_input_tokens_seen": 4771206, "step": 4630, "train_runtime": 11265.0248, "train_tokens_per_second": 423.542 }, { "epoch": 1.9791644406453681, "grad_norm": 4.019373416900635, "learning_rate": 2.1390374331550802e-07, "loss": 0.0799451470375061, "num_input_tokens_seen": 4771916, "step": 4631, "train_runtime": 11267.0052, "train_tokens_per_second": 423.53 }, { "epoch": 1.9795918367346939, "grad_norm": 2.434537887573242, "learning_rate": 2.0962566844919786e-07, "loss": 0.09077548235654831, "num_input_tokens_seen": 4772878, "step": 4632, "train_runtime": 11269.1042, "train_tokens_per_second": 423.537 }, { "epoch": 1.9800192328240196, "grad_norm": 3.5770862102508545, "learning_rate": 2.053475935828877e-07, "loss": 0.08833125978708267, "num_input_tokens_seen": 4773954, "step": 4633, "train_runtime": 11271.3764, "train_tokens_per_second": 423.547 }, { "epoch": 1.9804466289133456, "grad_norm": 2.696756362915039, "learning_rate": 2.0106951871657755e-07, "loss": 0.0912579596042633, "num_input_tokens_seen": 4775096, "step": 4634, "train_runtime": 11273.5026, "train_tokens_per_second": 423.568 }, { "epoch": 1.980874025002671, "grad_norm": 2.3793985843658447, "learning_rate": 1.967914438502674e-07, "loss": 0.05683675408363342, "num_input_tokens_seen": 4775964, "step": 4635, "train_runtime": 11275.5612, "train_tokens_per_second": 423.568 }, { "epoch": 1.981301421091997, "grad_norm": 3.1771419048309326, "learning_rate": 1.9251336898395724e-07, "loss": 0.07348252832889557, "num_input_tokens_seen": 4776628, "step": 4636, "train_runtime": 11277.5758, "train_tokens_per_second": 423.551 }, { "epoch": 1.9817288171813228, "grad_norm": 2.751821756362915, "learning_rate": 1.8823529411764705e-07, "loss": 0.088255375623703, "num_input_tokens_seen": 4777696, "step": 4637, "train_runtime": 11279.6514, "train_tokens_per_second": 423.568 }, { "epoch": 1.9821562132706485, "grad_norm": 4.200915813446045, "learning_rate": 1.839572192513369e-07, "loss": 0.10017291456460953, "num_input_tokens_seen": 4778442, "step": 4638, "train_runtime": 11281.6723, "train_tokens_per_second": 423.558 }, { "epoch": 1.9825836093599745, "grad_norm": 2.176443338394165, "learning_rate": 1.7967914438502674e-07, "loss": 0.08208013325929642, "num_input_tokens_seen": 4779564, "step": 4639, "train_runtime": 11283.7863, "train_tokens_per_second": 423.578 }, { "epoch": 1.9830110054493, "grad_norm": 2.890488386154175, "learning_rate": 1.7540106951871658e-07, "loss": 0.08005963265895844, "num_input_tokens_seen": 4780338, "step": 4640, "train_runtime": 11285.8429, "train_tokens_per_second": 423.569 }, { "epoch": 1.983438401538626, "grad_norm": 1.91335928440094, "learning_rate": 1.7112299465240642e-07, "loss": 0.05428942292928696, "num_input_tokens_seen": 4781518, "step": 4641, "train_runtime": 11287.9535, "train_tokens_per_second": 423.595 }, { "epoch": 1.9838657976279517, "grad_norm": 3.2447330951690674, "learning_rate": 1.668449197860963e-07, "loss": 0.06744910031557083, "num_input_tokens_seen": 4782254, "step": 4642, "train_runtime": 11289.9807, "train_tokens_per_second": 423.584 }, { "epoch": 1.9842931937172774, "grad_norm": 2.5188162326812744, "learning_rate": 1.6256684491978613e-07, "loss": 0.0847804918885231, "num_input_tokens_seen": 4783670, "step": 4643, "train_runtime": 11292.1256, "train_tokens_per_second": 423.629 }, { "epoch": 1.9847205898066034, "grad_norm": 2.0365638732910156, "learning_rate": 1.5828877005347592e-07, "loss": 0.06964364647865295, "num_input_tokens_seen": 4784632, "step": 4644, "train_runtime": 11294.1707, "train_tokens_per_second": 423.637 }, { "epoch": 1.985147985895929, "grad_norm": 3.07765531539917, "learning_rate": 1.540106951871658e-07, "loss": 0.10357463359832764, "num_input_tokens_seen": 4785592, "step": 4645, "train_runtime": 11296.2335, "train_tokens_per_second": 423.645 }, { "epoch": 1.9855753819852549, "grad_norm": 2.394017219543457, "learning_rate": 1.497326203208556e-07, "loss": 0.10176961123943329, "num_input_tokens_seen": 4786746, "step": 4646, "train_runtime": 11298.385, "train_tokens_per_second": 423.666 }, { "epoch": 1.9860027780745806, "grad_norm": 2.5691380500793457, "learning_rate": 1.4545454545454548e-07, "loss": 0.08107537776231766, "num_input_tokens_seen": 4788126, "step": 4647, "train_runtime": 11300.5954, "train_tokens_per_second": 423.706 }, { "epoch": 1.9864301741639063, "grad_norm": 2.3721048831939697, "learning_rate": 1.4117647058823532e-07, "loss": 0.0785323977470398, "num_input_tokens_seen": 4789054, "step": 4648, "train_runtime": 11302.6587, "train_tokens_per_second": 423.71 }, { "epoch": 1.9868575702532323, "grad_norm": 2.7213387489318848, "learning_rate": 1.3689839572192514e-07, "loss": 0.10906079411506653, "num_input_tokens_seen": 4791240, "step": 4649, "train_runtime": 11305.0102, "train_tokens_per_second": 423.816 }, { "epoch": 1.9872849663425578, "grad_norm": 2.8754923343658447, "learning_rate": 1.3262032085561498e-07, "loss": 0.1952277421951294, "num_input_tokens_seen": 4793680, "step": 4650, "train_runtime": 11307.4275, "train_tokens_per_second": 423.941 }, { "epoch": 1.9877123624318838, "grad_norm": 1.8187204599380493, "learning_rate": 1.2834224598930482e-07, "loss": 0.05892852321267128, "num_input_tokens_seen": 4795112, "step": 4651, "train_runtime": 11316.3663, "train_tokens_per_second": 423.732 }, { "epoch": 1.9881397585212095, "grad_norm": 2.653684616088867, "learning_rate": 1.2406417112299467e-07, "loss": 0.0778639018535614, "num_input_tokens_seen": 4796182, "step": 4652, "train_runtime": 11318.4426, "train_tokens_per_second": 423.749 }, { "epoch": 1.9885671546105352, "grad_norm": 2.993579626083374, "learning_rate": 1.197860962566845e-07, "loss": 0.09557916224002838, "num_input_tokens_seen": 4797170, "step": 4653, "train_runtime": 11320.6146, "train_tokens_per_second": 423.755 }, { "epoch": 1.9889945506998612, "grad_norm": 2.8111162185668945, "learning_rate": 1.1550802139037434e-07, "loss": 0.1099545881152153, "num_input_tokens_seen": 4798674, "step": 4654, "train_runtime": 11322.8392, "train_tokens_per_second": 423.805 }, { "epoch": 1.9894219467891867, "grad_norm": 3.348360300064087, "learning_rate": 1.1122994652406418e-07, "loss": 0.07052014768123627, "num_input_tokens_seen": 4799370, "step": 4655, "train_runtime": 11324.8486, "train_tokens_per_second": 423.791 }, { "epoch": 1.9898493428785127, "grad_norm": 2.28330659866333, "learning_rate": 1.0695187165775401e-07, "loss": 0.07211253046989441, "num_input_tokens_seen": 4800314, "step": 4656, "train_runtime": 11326.9589, "train_tokens_per_second": 423.795 }, { "epoch": 1.9902767389678384, "grad_norm": 5.864428997039795, "learning_rate": 1.0267379679144385e-07, "loss": 0.051632001996040344, "num_input_tokens_seen": 4801288, "step": 4657, "train_runtime": 11329.0195, "train_tokens_per_second": 423.804 }, { "epoch": 1.9907041350571641, "grad_norm": 1.5526164770126343, "learning_rate": 9.83957219251337e-08, "loss": 0.07412509620189667, "num_input_tokens_seen": 4802798, "step": 4658, "train_runtime": 11331.2324, "train_tokens_per_second": 423.855 }, { "epoch": 1.99113153114649, "grad_norm": 4.0224785804748535, "learning_rate": 9.411764705882353e-08, "loss": 0.1350272297859192, "num_input_tokens_seen": 4803440, "step": 4659, "train_runtime": 11333.2069, "train_tokens_per_second": 423.838 }, { "epoch": 1.9915589272358158, "grad_norm": 2.5184638500213623, "learning_rate": 8.983957219251337e-08, "loss": 0.06275865435600281, "num_input_tokens_seen": 4804572, "step": 4660, "train_runtime": 11335.3584, "train_tokens_per_second": 423.857 }, { "epoch": 1.9919863233251416, "grad_norm": 2.1118130683898926, "learning_rate": 8.556149732620321e-08, "loss": 0.08507050573825836, "num_input_tokens_seen": 4806040, "step": 4661, "train_runtime": 11337.5289, "train_tokens_per_second": 423.905 }, { "epoch": 1.9924137194144673, "grad_norm": 2.8188984394073486, "learning_rate": 8.128342245989307e-08, "loss": 0.053010810166597366, "num_input_tokens_seen": 4806868, "step": 4662, "train_runtime": 11339.5499, "train_tokens_per_second": 423.903 }, { "epoch": 1.992841115503793, "grad_norm": 4.274598121643066, "learning_rate": 7.70053475935829e-08, "loss": 0.1370730996131897, "num_input_tokens_seen": 4808028, "step": 4663, "train_runtime": 11341.7035, "train_tokens_per_second": 423.925 }, { "epoch": 1.993268511593119, "grad_norm": 3.228985071182251, "learning_rate": 7.272727272727274e-08, "loss": 0.07455558329820633, "num_input_tokens_seen": 4808608, "step": 4664, "train_runtime": 11343.7136, "train_tokens_per_second": 423.901 }, { "epoch": 1.9936959076824448, "grad_norm": 3.326261281967163, "learning_rate": 6.844919786096257e-08, "loss": 0.11473308503627777, "num_input_tokens_seen": 4809524, "step": 4665, "train_runtime": 11345.7453, "train_tokens_per_second": 423.906 }, { "epoch": 1.9941233037717705, "grad_norm": 2.3843088150024414, "learning_rate": 6.417112299465241e-08, "loss": 0.09405253827571869, "num_input_tokens_seen": 4810664, "step": 4666, "train_runtime": 11347.8896, "train_tokens_per_second": 423.926 }, { "epoch": 1.9945506998610962, "grad_norm": 2.6884829998016357, "learning_rate": 5.989304812834225e-08, "loss": 0.09168808907270432, "num_input_tokens_seen": 4811590, "step": 4667, "train_runtime": 11349.9908, "train_tokens_per_second": 423.929 }, { "epoch": 1.994978095950422, "grad_norm": 3.2621068954467773, "learning_rate": 5.561497326203209e-08, "loss": 0.10863994807004929, "num_input_tokens_seen": 4812744, "step": 4668, "train_runtime": 11352.1075, "train_tokens_per_second": 423.952 }, { "epoch": 1.995405492039748, "grad_norm": 3.2397677898406982, "learning_rate": 5.133689839572193e-08, "loss": 0.08679312467575073, "num_input_tokens_seen": 4813772, "step": 4669, "train_runtime": 11354.214, "train_tokens_per_second": 423.963 }, { "epoch": 1.9958328881290737, "grad_norm": 2.595773458480835, "learning_rate": 4.705882352941176e-08, "loss": 0.06904657185077667, "num_input_tokens_seen": 4814570, "step": 4670, "train_runtime": 11356.275, "train_tokens_per_second": 423.957 }, { "epoch": 1.9962602842183994, "grad_norm": 2.263497829437256, "learning_rate": 4.2780748663101606e-08, "loss": 0.06095545366406441, "num_input_tokens_seen": 4815478, "step": 4671, "train_runtime": 11358.3398, "train_tokens_per_second": 423.96 }, { "epoch": 1.9966876803077251, "grad_norm": 3.5418701171875, "learning_rate": 3.850267379679145e-08, "loss": 0.10343067348003387, "num_input_tokens_seen": 4816704, "step": 4672, "train_runtime": 11360.544, "train_tokens_per_second": 423.985 }, { "epoch": 1.9971150763970509, "grad_norm": 2.61396861076355, "learning_rate": 3.4224598930481285e-08, "loss": 0.07814645022153854, "num_input_tokens_seen": 4817578, "step": 4673, "train_runtime": 11362.7083, "train_tokens_per_second": 423.981 }, { "epoch": 1.9975424724863768, "grad_norm": 2.797137975692749, "learning_rate": 2.994652406417113e-08, "loss": 0.07945340126752853, "num_input_tokens_seen": 4818504, "step": 4674, "train_runtime": 11364.7756, "train_tokens_per_second": 423.986 }, { "epoch": 1.9979698685757026, "grad_norm": 1.979058027267456, "learning_rate": 2.5668449197860963e-08, "loss": 0.07385670393705368, "num_input_tokens_seen": 4819624, "step": 4675, "train_runtime": 11366.89, "train_tokens_per_second": 424.006 }, { "epoch": 1.9983972646650283, "grad_norm": 2.5515716075897217, "learning_rate": 2.1390374331550803e-08, "loss": 0.07762759178876877, "num_input_tokens_seen": 4820900, "step": 4676, "train_runtime": 11369.0116, "train_tokens_per_second": 424.039 }, { "epoch": 1.998824660754354, "grad_norm": 3.5036349296569824, "learning_rate": 1.7112299465240642e-08, "loss": 0.1370440274477005, "num_input_tokens_seen": 4822008, "step": 4677, "train_runtime": 11371.0541, "train_tokens_per_second": 424.06 }, { "epoch": 1.9992520568436798, "grad_norm": 2.773545503616333, "learning_rate": 1.2834224598930482e-08, "loss": 0.10351832956075668, "num_input_tokens_seen": 4823118, "step": 4678, "train_runtime": 11373.1772, "train_tokens_per_second": 424.078 }, { "epoch": 1.9996794529330058, "grad_norm": 2.52895450592041, "learning_rate": 8.556149732620321e-09, "loss": 0.0622512549161911, "num_input_tokens_seen": 4823998, "step": 4679, "train_runtime": 11375.2703, "train_tokens_per_second": 424.078 }, { "epoch": 2.0, "grad_norm": 2.6760764122009277, "learning_rate": 4.2780748663101606e-09, "loss": 0.08774103969335556, "num_input_tokens_seen": 4824912, "step": 4680, "train_runtime": 11376.8826, "train_tokens_per_second": 424.098 }, { "epoch": 2.0, "eval_loss": 0.5158717632293701, "eval_runtime": 58.6594, "eval_samples_per_second": 17.013, "eval_steps_per_second": 8.507, "num_input_tokens_seen": 4824912, "step": 4680 } ], "logging_steps": 1, "max_steps": 4680, "num_input_tokens_seen": 4824912, "num_train_epochs": 2, "save_steps": 30, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.7281004250986496e+16, "train_batch_size": 2, "trial_name": null, "trial_params": null }