{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0, "eval_steps": 500, "global_step": 29704, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.00033665499596014, "grad_norm": 1.7158506568336664, "learning_rate": 9.999999552565099e-06, "loss": 0.8321187973022461, "num_input_tokens_seen": 213976, "step": 5, "train_runtime": 48.5386, "train_tokens_per_second": 4408.369 }, { "epoch": 0.00067330999192028, "grad_norm": 1.4989508496023307, "learning_rate": 9.999997734860948e-06, "loss": 0.6714894294738769, "num_input_tokens_seen": 418192, "step": 10, "train_runtime": 79.1759, "train_tokens_per_second": 5281.811 }, { "epoch": 0.0010099649878804202, "grad_norm": 1.3987943897146944, "learning_rate": 9.999994518923374e-06, "loss": 0.6414656162261962, "num_input_tokens_seen": 631760, "step": 15, "train_runtime": 116.8887, "train_tokens_per_second": 5404.799 }, { "epoch": 0.00134661998384056, "grad_norm": 1.3594234171992137, "learning_rate": 9.999989904753278e-06, "loss": 0.6119038105010987, "num_input_tokens_seen": 847240, "step": 20, "train_runtime": 160.5101, "train_tokens_per_second": 5278.422 }, { "epoch": 0.0016832749798007002, "grad_norm": 1.1837151081821848, "learning_rate": 9.999983892351947e-06, "loss": 0.5918544292449951, "num_input_tokens_seen": 1067560, "step": 25, "train_runtime": 197.4905, "train_tokens_per_second": 5405.628 }, { "epoch": 0.0020199299757608404, "grad_norm": 1.1504621450496095, "learning_rate": 9.999976481721066e-06, "loss": 0.5148830890655518, "num_input_tokens_seen": 1288760, "step": 30, "train_runtime": 231.3357, "train_tokens_per_second": 5570.951 }, { "epoch": 0.0023565849717209803, "grad_norm": 1.0663060499576293, "learning_rate": 9.999967672862704e-06, "loss": 0.554470157623291, "num_input_tokens_seen": 1501896, "step": 35, "train_runtime": 271.9258, "train_tokens_per_second": 5523.183 }, { "epoch": 0.00269323996768112, "grad_norm": 1.1179858029742544, "learning_rate": 9.999957465779326e-06, "loss": 0.5239121437072753, "num_input_tokens_seen": 1716792, "step": 40, "train_runtime": 319.9491, "train_tokens_per_second": 5365.829 }, { "epoch": 0.0030298949636412605, "grad_norm": 1.1555971967505698, "learning_rate": 9.999945860473788e-06, "loss": 0.5400435924530029, "num_input_tokens_seen": 1920760, "step": 45, "train_runtime": 364.1591, "train_tokens_per_second": 5274.507 }, { "epoch": 0.0033665499596014004, "grad_norm": 0.9321994843580264, "learning_rate": 9.999932856949333e-06, "loss": 0.5238595008850098, "num_input_tokens_seen": 2140344, "step": 50, "train_runtime": 402.577, "train_tokens_per_second": 5316.608 }, { "epoch": 0.0037032049555615404, "grad_norm": 1.1572766450172172, "learning_rate": 9.999918455209599e-06, "loss": 0.5059286117553711, "num_input_tokens_seen": 2368296, "step": 55, "train_runtime": 438.0431, "train_tokens_per_second": 5406.536 }, { "epoch": 0.004039859951521681, "grad_norm": 1.1277411399750283, "learning_rate": 9.99990265525861e-06, "loss": 0.5235630989074707, "num_input_tokens_seen": 2589544, "step": 60, "train_runtime": 475.1915, "train_tokens_per_second": 5449.474 }, { "epoch": 0.004376514947481821, "grad_norm": 1.233348290191874, "learning_rate": 9.999885457100789e-06, "loss": 0.5595571517944335, "num_input_tokens_seen": 2809432, "step": 65, "train_runtime": 503.8866, "train_tokens_per_second": 5575.524 }, { "epoch": 0.0047131699434419605, "grad_norm": 1.2298135105742523, "learning_rate": 9.999866860740943e-06, "loss": 0.5092310428619384, "num_input_tokens_seen": 3020248, "step": 70, "train_runtime": 543.5456, "train_tokens_per_second": 5556.568 }, { "epoch": 0.005049824939402101, "grad_norm": 0.9679470345624956, "learning_rate": 9.999846866184274e-06, "loss": 0.5114652633666992, "num_input_tokens_seen": 3249600, "step": 75, "train_runtime": 585.283, "train_tokens_per_second": 5552.186 }, { "epoch": 0.00538647993536224, "grad_norm": 0.979469640417179, "learning_rate": 9.99982547343637e-06, "loss": 0.5040130615234375, "num_input_tokens_seen": 3443864, "step": 80, "train_runtime": 626.1684, "train_tokens_per_second": 5499.901 }, { "epoch": 0.005723134931322381, "grad_norm": 1.078786163056917, "learning_rate": 9.999802682503217e-06, "loss": 0.4742586612701416, "num_input_tokens_seen": 3661032, "step": 85, "train_runtime": 663.7311, "train_tokens_per_second": 5515.836 }, { "epoch": 0.006059789927282521, "grad_norm": 0.9113383787124433, "learning_rate": 9.999778493391186e-06, "loss": 0.5044189453125, "num_input_tokens_seen": 3888680, "step": 90, "train_runtime": 707.589, "train_tokens_per_second": 5495.676 }, { "epoch": 0.0063964449232426605, "grad_norm": 1.0192977781689194, "learning_rate": 9.999752906107043e-06, "loss": 0.5348274230957031, "num_input_tokens_seen": 4114248, "step": 95, "train_runtime": 744.4001, "train_tokens_per_second": 5526.931 }, { "epoch": 0.006733099919202801, "grad_norm": 1.046539367979976, "learning_rate": 9.999725920657944e-06, "loss": 0.5229468822479248, "num_input_tokens_seen": 4329256, "step": 100, "train_runtime": 790.5278, "train_tokens_per_second": 5476.412 }, { "epoch": 0.007069754915162941, "grad_norm": 1.0823101637799084, "learning_rate": 9.999697537051432e-06, "loss": 0.4990852355957031, "num_input_tokens_seen": 4533832, "step": 105, "train_runtime": 828.8033, "train_tokens_per_second": 5470.335 }, { "epoch": 0.007406409911123081, "grad_norm": 1.0579674272002448, "learning_rate": 9.999667755295449e-06, "loss": 0.48107209205627444, "num_input_tokens_seen": 4749088, "step": 110, "train_runtime": 864.874, "train_tokens_per_second": 5491.075 }, { "epoch": 0.007743064907083221, "grad_norm": 1.2773224732968154, "learning_rate": 9.999636575398319e-06, "loss": 0.4919854164123535, "num_input_tokens_seen": 4960752, "step": 115, "train_runtime": 904.8595, "train_tokens_per_second": 5482.345 }, { "epoch": 0.008079719903043361, "grad_norm": 1.0488778079229073, "learning_rate": 9.999603997368766e-06, "loss": 0.4375304222106934, "num_input_tokens_seen": 5167864, "step": 120, "train_runtime": 939.3678, "train_tokens_per_second": 5501.428 }, { "epoch": 0.008416374899003501, "grad_norm": 1.1229102076855217, "learning_rate": 9.999570021215895e-06, "loss": 0.4794501304626465, "num_input_tokens_seen": 5384648, "step": 125, "train_runtime": 973.7305, "train_tokens_per_second": 5529.916 }, { "epoch": 0.008753029894963642, "grad_norm": 1.0387093548265027, "learning_rate": 9.99953464694921e-06, "loss": 0.5004319667816162, "num_input_tokens_seen": 5590392, "step": 130, "train_runtime": 1013.6767, "train_tokens_per_second": 5514.965 }, { "epoch": 0.009089684890923782, "grad_norm": 1.0508132347808834, "learning_rate": 9.999497874578606e-06, "loss": 0.495189905166626, "num_input_tokens_seen": 5819224, "step": 135, "train_runtime": 1052.6891, "train_tokens_per_second": 5527.961 }, { "epoch": 0.009426339886883921, "grad_norm": 1.0896002910221911, "learning_rate": 9.999459704114361e-06, "loss": 0.5080117225646973, "num_input_tokens_seen": 6037808, "step": 140, "train_runtime": 1094.5671, "train_tokens_per_second": 5516.161 }, { "epoch": 0.00976299488284406, "grad_norm": 1.034914657869065, "learning_rate": 9.999420135567153e-06, "loss": 0.526894474029541, "num_input_tokens_seen": 6252752, "step": 145, "train_runtime": 1135.4311, "train_tokens_per_second": 5506.941 }, { "epoch": 0.010099649878804202, "grad_norm": 1.164626155534281, "learning_rate": 9.999379168948047e-06, "loss": 0.5105450630187989, "num_input_tokens_seen": 6476720, "step": 150, "train_runtime": 1172.7989, "train_tokens_per_second": 5522.447 }, { "epoch": 0.010436304874764341, "grad_norm": 1.2400950788317526, "learning_rate": 9.999336804268496e-06, "loss": 0.47139749526977537, "num_input_tokens_seen": 6698024, "step": 155, "train_runtime": 1217.419, "train_tokens_per_second": 5501.823 }, { "epoch": 0.01077295987072448, "grad_norm": 1.0587023212526414, "learning_rate": 9.999293041540351e-06, "loss": 0.5010284900665283, "num_input_tokens_seen": 6910784, "step": 160, "train_runtime": 1258.4852, "train_tokens_per_second": 5491.351 }, { "epoch": 0.011109614866684622, "grad_norm": 1.0126894215000632, "learning_rate": 9.999247880775849e-06, "loss": 0.49982900619506837, "num_input_tokens_seen": 7115568, "step": 165, "train_runtime": 1295.6174, "train_tokens_per_second": 5492.029 }, { "epoch": 0.011446269862644761, "grad_norm": 1.198929638798561, "learning_rate": 9.999201321987617e-06, "loss": 0.46059427261352537, "num_input_tokens_seen": 7329488, "step": 170, "train_runtime": 1337.1094, "train_tokens_per_second": 5481.592 }, { "epoch": 0.011782924858604901, "grad_norm": 1.0114658976479987, "learning_rate": 9.999153365188676e-06, "loss": 0.5039016723632812, "num_input_tokens_seen": 7547880, "step": 175, "train_runtime": 1383.6734, "train_tokens_per_second": 5454.958 }, { "epoch": 0.012119579854565042, "grad_norm": 1.0579154349493107, "learning_rate": 9.99910401039244e-06, "loss": 0.4546662330627441, "num_input_tokens_seen": 7757728, "step": 180, "train_runtime": 1424.6608, "train_tokens_per_second": 5445.316 }, { "epoch": 0.012456234850525182, "grad_norm": 1.1327328565153654, "learning_rate": 9.999053257612708e-06, "loss": 0.464589786529541, "num_input_tokens_seen": 7984416, "step": 185, "train_runtime": 1468.0361, "train_tokens_per_second": 5438.842 }, { "epoch": 0.012792889846485321, "grad_norm": 1.0695885705791155, "learning_rate": 9.999001106863672e-06, "loss": 0.5309792518615722, "num_input_tokens_seen": 8204976, "step": 190, "train_runtime": 1506.2271, "train_tokens_per_second": 5447.37 }, { "epoch": 0.013129544842445462, "grad_norm": 1.129268767285916, "learning_rate": 9.998947558159916e-06, "loss": 0.4964266300201416, "num_input_tokens_seen": 8428800, "step": 195, "train_runtime": 1546.2799, "train_tokens_per_second": 5451.018 }, { "epoch": 0.013466199838405602, "grad_norm": 1.0645176443218387, "learning_rate": 9.99889261151642e-06, "loss": 0.44077634811401367, "num_input_tokens_seen": 8642192, "step": 200, "train_runtime": 1586.0871, "train_tokens_per_second": 5448.75 }, { "epoch": 0.013802854834365741, "grad_norm": 1.0273158071004191, "learning_rate": 9.998836266948542e-06, "loss": 0.47046546936035155, "num_input_tokens_seen": 8852840, "step": 205, "train_runtime": 1618.9934, "train_tokens_per_second": 5468.114 }, { "epoch": 0.014139509830325882, "grad_norm": 1.2260591863245542, "learning_rate": 9.998778524472043e-06, "loss": 0.4429631233215332, "num_input_tokens_seen": 9059368, "step": 210, "train_runtime": 1658.2941, "train_tokens_per_second": 5463.065 }, { "epoch": 0.014476164826286022, "grad_norm": 1.1035215533216065, "learning_rate": 9.99871938410307e-06, "loss": 0.46187715530395507, "num_input_tokens_seen": 9273936, "step": 215, "train_runtime": 1690.8398, "train_tokens_per_second": 5484.811 }, { "epoch": 0.014812819822246161, "grad_norm": 1.500582938758766, "learning_rate": 9.99865884585816e-06, "loss": 0.5123334407806397, "num_input_tokens_seen": 9489816, "step": 220, "train_runtime": 1724.7509, "train_tokens_per_second": 5502.137 }, { "epoch": 0.015149474818206303, "grad_norm": 1.1104716846300207, "learning_rate": 9.998596909754245e-06, "loss": 0.4839674949645996, "num_input_tokens_seen": 9710720, "step": 225, "train_runtime": 1769.0601, "train_tokens_per_second": 5489.197 }, { "epoch": 0.015486129814166442, "grad_norm": 1.1763018457719354, "learning_rate": 9.998533575808642e-06, "loss": 0.455305290222168, "num_input_tokens_seen": 9922160, "step": 230, "train_runtime": 1804.4173, "train_tokens_per_second": 5498.817 }, { "epoch": 0.015822784810126583, "grad_norm": 0.9508268973242634, "learning_rate": 9.998468844039064e-06, "loss": 0.4588268280029297, "num_input_tokens_seen": 10132480, "step": 235, "train_runtime": 1843.1618, "train_tokens_per_second": 5497.336 }, { "epoch": 0.016159439806086723, "grad_norm": 0.982580320370019, "learning_rate": 9.998402714463613e-06, "loss": 0.49381322860717775, "num_input_tokens_seen": 10356032, "step": 240, "train_runtime": 1886.9781, "train_tokens_per_second": 5488.157 }, { "epoch": 0.016496094802046862, "grad_norm": 0.9967583322638394, "learning_rate": 9.998335187100782e-06, "loss": 0.4929532051086426, "num_input_tokens_seen": 10571688, "step": 245, "train_runtime": 1931.0773, "train_tokens_per_second": 5474.503 }, { "epoch": 0.016832749798007002, "grad_norm": 1.0005940352447382, "learning_rate": 9.998266261969453e-06, "loss": 0.488722038269043, "num_input_tokens_seen": 10787736, "step": 250, "train_runtime": 1967.3657, "train_tokens_per_second": 5483.341 }, { "epoch": 0.01716940479396714, "grad_norm": 0.9740927827374989, "learning_rate": 9.998195939088905e-06, "loss": 0.46301860809326173, "num_input_tokens_seen": 11014240, "step": 255, "train_runtime": 1995.3214, "train_tokens_per_second": 5520.033 }, { "epoch": 0.017506059789927284, "grad_norm": 1.0005631289772583, "learning_rate": 9.998124218478797e-06, "loss": 0.4852250099182129, "num_input_tokens_seen": 11227928, "step": 260, "train_runtime": 2040.8305, "train_tokens_per_second": 5501.646 }, { "epoch": 0.017842714785887424, "grad_norm": 3.2898314540824733, "learning_rate": 9.998051100159192e-06, "loss": 0.4806126594543457, "num_input_tokens_seen": 11457336, "step": 265, "train_runtime": 2073.3223, "train_tokens_per_second": 5526.076 }, { "epoch": 0.018179369781847563, "grad_norm": 1.0137684438609407, "learning_rate": 9.997976584150533e-06, "loss": 0.4908778667449951, "num_input_tokens_seen": 11669408, "step": 270, "train_runtime": 2105.6176, "train_tokens_per_second": 5542.036 }, { "epoch": 0.018516024777807703, "grad_norm": 0.882254713488144, "learning_rate": 9.997900670473662e-06, "loss": 0.4400303840637207, "num_input_tokens_seen": 11900376, "step": 275, "train_runtime": 2145.8648, "train_tokens_per_second": 5545.725 }, { "epoch": 0.018852679773767842, "grad_norm": 1.0103112069849245, "learning_rate": 9.997823359149804e-06, "loss": 0.47128896713256835, "num_input_tokens_seen": 12115296, "step": 280, "train_runtime": 2180.0754, "train_tokens_per_second": 5557.283 }, { "epoch": 0.01918933476972798, "grad_norm": 2.383562470887594, "learning_rate": 9.997744650200579e-06, "loss": 0.5039300441741943, "num_input_tokens_seen": 12335296, "step": 285, "train_runtime": 2224.7672, "train_tokens_per_second": 5544.533 }, { "epoch": 0.01952598976568812, "grad_norm": 1.012511096525962, "learning_rate": 9.997664543648e-06, "loss": 0.47290778160095215, "num_input_tokens_seen": 12550016, "step": 290, "train_runtime": 2269.2912, "train_tokens_per_second": 5530.368 }, { "epoch": 0.019862644761648264, "grad_norm": 0.9200150844694661, "learning_rate": 9.997583039514469e-06, "loss": 0.47549943923950194, "num_input_tokens_seen": 12769944, "step": 295, "train_runtime": 2310.0213, "train_tokens_per_second": 5528.063 }, { "epoch": 0.020199299757608404, "grad_norm": 1.0603122997620704, "learning_rate": 9.997500137822776e-06, "loss": 0.48865842819213867, "num_input_tokens_seen": 12994152, "step": 300, "train_runtime": 2347.3612, "train_tokens_per_second": 5535.642 }, { "epoch": 0.020535954753568543, "grad_norm": 1.1560224095031963, "learning_rate": 9.997415838596106e-06, "loss": 0.46552267074584963, "num_input_tokens_seen": 13206104, "step": 305, "train_runtime": 2390.8704, "train_tokens_per_second": 5523.555 }, { "epoch": 0.020872609749528682, "grad_norm": 0.9496962272740035, "learning_rate": 9.997330141858032e-06, "loss": 0.4945693492889404, "num_input_tokens_seen": 13423544, "step": 310, "train_runtime": 2429.9223, "train_tokens_per_second": 5524.269 }, { "epoch": 0.021209264745488822, "grad_norm": 1.1164280869632712, "learning_rate": 9.997243047632519e-06, "loss": 0.47294368743896487, "num_input_tokens_seen": 13640584, "step": 315, "train_runtime": 2463.856, "train_tokens_per_second": 5536.275 }, { "epoch": 0.02154591974144896, "grad_norm": 0.9211260067991657, "learning_rate": 9.997154555943923e-06, "loss": 0.43665332794189454, "num_input_tokens_seen": 13858888, "step": 320, "train_runtime": 2506.1, "train_tokens_per_second": 5530.062 }, { "epoch": 0.021882574737409104, "grad_norm": 1.0719268322873283, "learning_rate": 9.997064666816992e-06, "loss": 0.4625236034393311, "num_input_tokens_seen": 14076648, "step": 325, "train_runtime": 2544.8417, "train_tokens_per_second": 5531.443 }, { "epoch": 0.022219229733369244, "grad_norm": 1.146001730574971, "learning_rate": 9.996973380276858e-06, "loss": 0.5440494060516358, "num_input_tokens_seen": 14299864, "step": 330, "train_runtime": 2575.9234, "train_tokens_per_second": 5551.355 }, { "epoch": 0.022555884729329383, "grad_norm": 1.1489261273369993, "learning_rate": 9.996880696349053e-06, "loss": 0.45033721923828124, "num_input_tokens_seen": 14522560, "step": 335, "train_runtime": 2614.1655, "train_tokens_per_second": 5555.333 }, { "epoch": 0.022892539725289523, "grad_norm": 1.0606322220744733, "learning_rate": 9.996786615059497e-06, "loss": 0.5329171180725097, "num_input_tokens_seen": 14746648, "step": 340, "train_runtime": 2655.6018, "train_tokens_per_second": 5553.034 }, { "epoch": 0.023229194721249662, "grad_norm": 0.9692502297767218, "learning_rate": 9.996691136434498e-06, "loss": 0.4342483997344971, "num_input_tokens_seen": 14969080, "step": 345, "train_runtime": 2690.8338, "train_tokens_per_second": 5562.989 }, { "epoch": 0.023565849717209802, "grad_norm": 0.8994912857959015, "learning_rate": 9.996594260500753e-06, "loss": 0.507387924194336, "num_input_tokens_seen": 15193912, "step": 350, "train_runtime": 2729.4748, "train_tokens_per_second": 5566.606 }, { "epoch": 0.023902504713169945, "grad_norm": 0.9930018613669586, "learning_rate": 9.996495987285358e-06, "loss": 0.4612261772155762, "num_input_tokens_seen": 15411408, "step": 355, "train_runtime": 2773.0354, "train_tokens_per_second": 5557.595 }, { "epoch": 0.024239159709130084, "grad_norm": 1.0882060582433957, "learning_rate": 9.996396316815793e-06, "loss": 0.4673755645751953, "num_input_tokens_seen": 15630480, "step": 360, "train_runtime": 2815.6019, "train_tokens_per_second": 5551.381 }, { "epoch": 0.024575814705090224, "grad_norm": 1.1223066651934839, "learning_rate": 9.99629524911993e-06, "loss": 0.4566653251647949, "num_input_tokens_seen": 15847552, "step": 365, "train_runtime": 2852.9783, "train_tokens_per_second": 5554.74 }, { "epoch": 0.024912469701050363, "grad_norm": 1.0964642711464192, "learning_rate": 9.996192784226033e-06, "loss": 0.440608549118042, "num_input_tokens_seen": 16049488, "step": 370, "train_runtime": 2887.3093, "train_tokens_per_second": 5558.631 }, { "epoch": 0.025249124697010503, "grad_norm": 0.9458333109972462, "learning_rate": 9.996088922162755e-06, "loss": 0.4601402759552002, "num_input_tokens_seen": 16283544, "step": 375, "train_runtime": 2920.1965, "train_tokens_per_second": 5576.181 }, { "epoch": 0.025585779692970642, "grad_norm": 0.9639187009881571, "learning_rate": 9.995983662959141e-06, "loss": 0.4678368091583252, "num_input_tokens_seen": 16507176, "step": 380, "train_runtime": 2959.819, "train_tokens_per_second": 5577.09 }, { "epoch": 0.025922434688930785, "grad_norm": 0.9786802993443171, "learning_rate": 9.995877006644627e-06, "loss": 0.4893208026885986, "num_input_tokens_seen": 16739664, "step": 385, "train_runtime": 3003.5655, "train_tokens_per_second": 5573.264 }, { "epoch": 0.026259089684890925, "grad_norm": 0.9983372688388842, "learning_rate": 9.995768953249038e-06, "loss": 0.4782050132751465, "num_input_tokens_seen": 16966112, "step": 390, "train_runtime": 3042.5667, "train_tokens_per_second": 5576.25 }, { "epoch": 0.026595744680851064, "grad_norm": 0.9763900936703368, "learning_rate": 9.995659502802594e-06, "loss": 0.4591067314147949, "num_input_tokens_seen": 17184144, "step": 395, "train_runtime": 3081.608, "train_tokens_per_second": 5576.356 }, { "epoch": 0.026932399676811204, "grad_norm": 1.1889179128899698, "learning_rate": 9.995548655335899e-06, "loss": 0.4847611427307129, "num_input_tokens_seen": 17393504, "step": 400, "train_runtime": 3119.919, "train_tokens_per_second": 5574.986 }, { "epoch": 0.027269054672771343, "grad_norm": 1.0385231933952215, "learning_rate": 9.995436410879951e-06, "loss": 0.5011202812194824, "num_input_tokens_seen": 17618352, "step": 405, "train_runtime": 3158.5186, "train_tokens_per_second": 5578.043 }, { "epoch": 0.027605709668731482, "grad_norm": 1.0315411320040826, "learning_rate": 9.99532276946614e-06, "loss": 0.4390664577484131, "num_input_tokens_seen": 17833504, "step": 410, "train_runtime": 3197.1139, "train_tokens_per_second": 5578.001 }, { "epoch": 0.027942364664691625, "grad_norm": 0.9798271051589648, "learning_rate": 9.995207731126246e-06, "loss": 0.48116722106933596, "num_input_tokens_seen": 18060040, "step": 415, "train_runtime": 3233.4074, "train_tokens_per_second": 5585.451 }, { "epoch": 0.028279019660651765, "grad_norm": 0.9349852018887401, "learning_rate": 9.99509129589244e-06, "loss": 0.4614968776702881, "num_input_tokens_seen": 18273536, "step": 420, "train_runtime": 3276.2797, "train_tokens_per_second": 5577.526 }, { "epoch": 0.028615674656611904, "grad_norm": 1.1608131463568248, "learning_rate": 9.994973463797279e-06, "loss": 0.4571842193603516, "num_input_tokens_seen": 18501288, "step": 425, "train_runtime": 3312.0947, "train_tokens_per_second": 5585.978 }, { "epoch": 0.028952329652572044, "grad_norm": 0.9117559518264567, "learning_rate": 9.99485423487372e-06, "loss": 0.42873506546020507, "num_input_tokens_seen": 18713400, "step": 430, "train_runtime": 3354.8456, "train_tokens_per_second": 5578.021 }, { "epoch": 0.029288984648532183, "grad_norm": 1.0351008634262573, "learning_rate": 9.994733609155097e-06, "loss": 0.46686439514160155, "num_input_tokens_seen": 18927424, "step": 435, "train_runtime": 3390.8404, "train_tokens_per_second": 5581.927 }, { "epoch": 0.029625639644492323, "grad_norm": 0.9515109413699648, "learning_rate": 9.994611586675149e-06, "loss": 0.4384657382965088, "num_input_tokens_seen": 19153848, "step": 440, "train_runtime": 3427.1383, "train_tokens_per_second": 5588.875 }, { "epoch": 0.029962294640452466, "grad_norm": 2.170654371130382, "learning_rate": 9.994488167468e-06, "loss": 0.457914924621582, "num_input_tokens_seen": 19367752, "step": 445, "train_runtime": 3463.4205, "train_tokens_per_second": 5592.088 }, { "epoch": 0.030298949636412605, "grad_norm": 0.9213402764770521, "learning_rate": 9.994363351568158e-06, "loss": 0.49051642417907715, "num_input_tokens_seen": 19581376, "step": 450, "train_runtime": 3507.0672, "train_tokens_per_second": 5583.405 }, { "epoch": 0.030635604632372745, "grad_norm": 1.0129019967889514, "learning_rate": 9.994237139010532e-06, "loss": 0.4277812480926514, "num_input_tokens_seen": 19787728, "step": 455, "train_runtime": 3546.6942, "train_tokens_per_second": 5579.203 }, { "epoch": 0.030972259628332884, "grad_norm": 0.9251976717430972, "learning_rate": 9.994109529830414e-06, "loss": 0.4721639633178711, "num_input_tokens_seen": 20024672, "step": 460, "train_runtime": 3585.3338, "train_tokens_per_second": 5585.163 }, { "epoch": 0.03130891462429303, "grad_norm": 0.8419132637197803, "learning_rate": 9.993980524063494e-06, "loss": 0.44678316116333006, "num_input_tokens_seen": 20247816, "step": 465, "train_runtime": 3622.8878, "train_tokens_per_second": 5588.861 }, { "epoch": 0.03164556962025317, "grad_norm": 0.8727373261991417, "learning_rate": 9.993850121745842e-06, "loss": 0.448548698425293, "num_input_tokens_seen": 20469008, "step": 470, "train_runtime": 3663.8929, "train_tokens_per_second": 5586.683 }, { "epoch": 0.031982224616213306, "grad_norm": 0.9661829335825901, "learning_rate": 9.99371832291393e-06, "loss": 0.44652185440063474, "num_input_tokens_seen": 20684368, "step": 475, "train_runtime": 3702.3594, "train_tokens_per_second": 5586.807 }, { "epoch": 0.032318879612173446, "grad_norm": 1.052144245514416, "learning_rate": 9.993585127604612e-06, "loss": 0.4458156108856201, "num_input_tokens_seen": 20888824, "step": 480, "train_runtime": 3737.8839, "train_tokens_per_second": 5588.409 }, { "epoch": 0.032655534608133585, "grad_norm": 0.8727464499212149, "learning_rate": 9.993450535855136e-06, "loss": 0.4528946876525879, "num_input_tokens_seen": 21093776, "step": 485, "train_runtime": 3771.0576, "train_tokens_per_second": 5593.597 }, { "epoch": 0.032992189604093725, "grad_norm": 1.4490470715769006, "learning_rate": 9.993314547703142e-06, "loss": 0.43402805328369143, "num_input_tokens_seen": 21314528, "step": 490, "train_runtime": 3810.8049, "train_tokens_per_second": 5593.183 }, { "epoch": 0.033328844600053864, "grad_norm": 0.913157610231942, "learning_rate": 9.993177163186655e-06, "loss": 0.44025378227233886, "num_input_tokens_seen": 21529648, "step": 495, "train_runtime": 3846.3087, "train_tokens_per_second": 5597.483 }, { "epoch": 0.033665499596014004, "grad_norm": 1.0732207036056458, "learning_rate": 9.993038382344097e-06, "loss": 0.43718814849853516, "num_input_tokens_seen": 21744008, "step": 500, "train_runtime": 3886.9027, "train_tokens_per_second": 5594.174 }, { "epoch": 0.03400215459197414, "grad_norm": 0.9385843989678325, "learning_rate": 9.992898205214279e-06, "loss": 0.44336519241333006, "num_input_tokens_seen": 21963168, "step": 505, "train_runtime": 3919.9586, "train_tokens_per_second": 5602.908 }, { "epoch": 0.03433880958793428, "grad_norm": 0.9966215411858433, "learning_rate": 9.992756631836397e-06, "loss": 0.4398432731628418, "num_input_tokens_seen": 22181088, "step": 510, "train_runtime": 3967.3085, "train_tokens_per_second": 5590.966 }, { "epoch": 0.03467546458389442, "grad_norm": 0.8920648260369749, "learning_rate": 9.992613662250044e-06, "loss": 0.4598443031311035, "num_input_tokens_seen": 22402688, "step": 515, "train_runtime": 4007.4675, "train_tokens_per_second": 5590.236 }, { "epoch": 0.03501211957985457, "grad_norm": 0.9290820640509749, "learning_rate": 9.992469296495201e-06, "loss": 0.4575651168823242, "num_input_tokens_seen": 22628840, "step": 520, "train_runtime": 4042.7584, "train_tokens_per_second": 5597.376 }, { "epoch": 0.03534877457581471, "grad_norm": 0.9109745499097042, "learning_rate": 9.992323534612238e-06, "loss": 0.414502477645874, "num_input_tokens_seen": 22848504, "step": 525, "train_runtime": 4082.2649, "train_tokens_per_second": 5597.017 }, { "epoch": 0.03568542957177485, "grad_norm": 1.1344769076017303, "learning_rate": 9.99217637664192e-06, "loss": 0.45860743522644043, "num_input_tokens_seen": 23072192, "step": 530, "train_runtime": 4119.8107, "train_tokens_per_second": 5600.304 }, { "epoch": 0.03602208456773499, "grad_norm": 0.940449394205852, "learning_rate": 9.992027822625397e-06, "loss": 0.45654983520507814, "num_input_tokens_seen": 23281952, "step": 535, "train_runtime": 4161.0794, "train_tokens_per_second": 5595.171 }, { "epoch": 0.036358739563695126, "grad_norm": 1.0036660879417987, "learning_rate": 9.99187787260421e-06, "loss": 0.46324939727783204, "num_input_tokens_seen": 23492592, "step": 540, "train_runtime": 4199.7934, "train_tokens_per_second": 5593.749 }, { "epoch": 0.036695394559655266, "grad_norm": 0.9529512682682689, "learning_rate": 9.991726526620294e-06, "loss": 0.4310856819152832, "num_input_tokens_seen": 23724784, "step": 545, "train_runtime": 4235.651, "train_tokens_per_second": 5601.213 }, { "epoch": 0.037032049555615405, "grad_norm": 1.0092720255970657, "learning_rate": 9.991573784715973e-06, "loss": 0.4721970081329346, "num_input_tokens_seen": 23941816, "step": 550, "train_runtime": 4278.956, "train_tokens_per_second": 5595.247 }, { "epoch": 0.037368704551575545, "grad_norm": 1.0108753586712804, "learning_rate": 9.99141964693396e-06, "loss": 0.48006014823913573, "num_input_tokens_seen": 24165232, "step": 555, "train_runtime": 4315.3047, "train_tokens_per_second": 5599.89 }, { "epoch": 0.037705359547535684, "grad_norm": 1.0343909095504493, "learning_rate": 9.99126411331736e-06, "loss": 0.4417973518371582, "num_input_tokens_seen": 24389896, "step": 560, "train_runtime": 4359.1735, "train_tokens_per_second": 5595.074 }, { "epoch": 0.038042014543495824, "grad_norm": 1.0113397276422895, "learning_rate": 9.991107183909665e-06, "loss": 0.4680752754211426, "num_input_tokens_seen": 24614992, "step": 565, "train_runtime": 4391.4505, "train_tokens_per_second": 5605.208 }, { "epoch": 0.03837866953945596, "grad_norm": 0.9954842488566088, "learning_rate": 9.990948858754763e-06, "loss": 0.4640792369842529, "num_input_tokens_seen": 24823080, "step": 570, "train_runtime": 4434.0745, "train_tokens_per_second": 5598.255 }, { "epoch": 0.0387153245354161, "grad_norm": 0.9153320849806976, "learning_rate": 9.990789137896927e-06, "loss": 0.4609560966491699, "num_input_tokens_seen": 25044784, "step": 575, "train_runtime": 4471.0247, "train_tokens_per_second": 5601.576 }, { "epoch": 0.03905197953137624, "grad_norm": 0.9718791869837801, "learning_rate": 9.990628021380823e-06, "loss": 0.47663059234619143, "num_input_tokens_seen": 25262200, "step": 580, "train_runtime": 4509.6496, "train_tokens_per_second": 5601.81 }, { "epoch": 0.03938863452733639, "grad_norm": 1.218415508866825, "learning_rate": 9.990465509251508e-06, "loss": 0.46056556701660156, "num_input_tokens_seen": 25473136, "step": 585, "train_runtime": 4541.7073, "train_tokens_per_second": 5608.714 }, { "epoch": 0.03972528952329653, "grad_norm": 1.0200294193913204, "learning_rate": 9.990301601554425e-06, "loss": 0.48001799583435056, "num_input_tokens_seen": 25671088, "step": 590, "train_runtime": 4581.4528, "train_tokens_per_second": 5603.264 }, { "epoch": 0.04006194451925667, "grad_norm": 1.0450169479009095, "learning_rate": 9.990136298335414e-06, "loss": 0.40839109420776365, "num_input_tokens_seen": 25887472, "step": 595, "train_runtime": 4618.2668, "train_tokens_per_second": 5605.452 }, { "epoch": 0.04039859951521681, "grad_norm": 0.9533941163271269, "learning_rate": 9.989969599640698e-06, "loss": 0.4223615646362305, "num_input_tokens_seen": 26117456, "step": 600, "train_runtime": 4650.9664, "train_tokens_per_second": 5615.49 }, { "epoch": 0.040735254511176947, "grad_norm": 0.9258754840147914, "learning_rate": 9.989801505516895e-06, "loss": 0.505678129196167, "num_input_tokens_seen": 26348056, "step": 605, "train_runtime": 4690.0532, "train_tokens_per_second": 5617.859 }, { "epoch": 0.041071909507137086, "grad_norm": 0.9866589002080994, "learning_rate": 9.989632016011012e-06, "loss": 0.47707581520080566, "num_input_tokens_seen": 26572040, "step": 610, "train_runtime": 4721.6631, "train_tokens_per_second": 5627.687 }, { "epoch": 0.041408564503097225, "grad_norm": 1.0374837134071888, "learning_rate": 9.989461131170448e-06, "loss": 0.4833499908447266, "num_input_tokens_seen": 26769320, "step": 615, "train_runtime": 4762.2337, "train_tokens_per_second": 5621.169 }, { "epoch": 0.041745219499057365, "grad_norm": 0.8823212064118572, "learning_rate": 9.98928885104299e-06, "loss": 0.4514059543609619, "num_input_tokens_seen": 26988024, "step": 620, "train_runtime": 4795.3541, "train_tokens_per_second": 5627.952 }, { "epoch": 0.042081874495017504, "grad_norm": 0.8780469782436839, "learning_rate": 9.989115175676812e-06, "loss": 0.4226998329162598, "num_input_tokens_seen": 27212624, "step": 625, "train_runtime": 4834.4544, "train_tokens_per_second": 5628.892 }, { "epoch": 0.042418529490977644, "grad_norm": 0.9554506078310793, "learning_rate": 9.988940105120483e-06, "loss": 0.47803831100463867, "num_input_tokens_seen": 27422208, "step": 630, "train_runtime": 4877.5946, "train_tokens_per_second": 5622.076 }, { "epoch": 0.04275518448693778, "grad_norm": 0.93348166885423, "learning_rate": 9.988763639422965e-06, "loss": 0.4802694797515869, "num_input_tokens_seen": 27650384, "step": 635, "train_runtime": 4915.966, "train_tokens_per_second": 5624.608 }, { "epoch": 0.04309183948289792, "grad_norm": 0.9769454728471132, "learning_rate": 9.988585778633604e-06, "loss": 0.4367190361022949, "num_input_tokens_seen": 27851424, "step": 640, "train_runtime": 4948.8643, "train_tokens_per_second": 5627.841 }, { "epoch": 0.04342849447885807, "grad_norm": 0.9848655689806975, "learning_rate": 9.988406522802134e-06, "loss": 0.45001683235168455, "num_input_tokens_seen": 28060088, "step": 645, "train_runtime": 4991.2246, "train_tokens_per_second": 5621.884 }, { "epoch": 0.04376514947481821, "grad_norm": 0.9626370029590127, "learning_rate": 9.98822587197869e-06, "loss": 0.41652770042419435, "num_input_tokens_seen": 28274912, "step": 650, "train_runtime": 5025.7373, "train_tokens_per_second": 5626.023 }, { "epoch": 0.04410180447077835, "grad_norm": 0.9983674144400133, "learning_rate": 9.988043826213785e-06, "loss": 0.4282545566558838, "num_input_tokens_seen": 28481968, "step": 655, "train_runtime": 5062.1603, "train_tokens_per_second": 5626.445 }, { "epoch": 0.04443845946673849, "grad_norm": 2.4559661675719884, "learning_rate": 9.98786038555833e-06, "loss": 0.4085527420043945, "num_input_tokens_seen": 28702472, "step": 660, "train_runtime": 5099.8424, "train_tokens_per_second": 5628.11 }, { "epoch": 0.04477511446269863, "grad_norm": 0.8332845163143295, "learning_rate": 9.987675550063625e-06, "loss": 0.44841432571411133, "num_input_tokens_seen": 28932512, "step": 665, "train_runtime": 5135.2428, "train_tokens_per_second": 5634.108 }, { "epoch": 0.04511176945865877, "grad_norm": 1.0017265357539382, "learning_rate": 9.987489319781355e-06, "loss": 0.4431906223297119, "num_input_tokens_seen": 29153640, "step": 670, "train_runtime": 5165.908, "train_tokens_per_second": 5643.469 }, { "epoch": 0.045448424454618906, "grad_norm": 0.8381101119904498, "learning_rate": 9.987301694763602e-06, "loss": 0.4798222541809082, "num_input_tokens_seen": 29368992, "step": 675, "train_runtime": 5201.341, "train_tokens_per_second": 5646.427 }, { "epoch": 0.045785079450579046, "grad_norm": 0.9739030010713555, "learning_rate": 9.987112675062834e-06, "loss": 0.4200302600860596, "num_input_tokens_seen": 29582872, "step": 680, "train_runtime": 5240.8223, "train_tokens_per_second": 5644.7 }, { "epoch": 0.046121734446539185, "grad_norm": 0.9923641076223235, "learning_rate": 9.986922260731908e-06, "loss": 0.42931652069091797, "num_input_tokens_seen": 29791056, "step": 685, "train_runtime": 5280.43, "train_tokens_per_second": 5641.786 }, { "epoch": 0.046458389442499325, "grad_norm": 0.8786561915980274, "learning_rate": 9.986730451824073e-06, "loss": 0.4656373977661133, "num_input_tokens_seen": 30001648, "step": 690, "train_runtime": 5325.5768, "train_tokens_per_second": 5633.502 }, { "epoch": 0.046795044438459464, "grad_norm": 0.9155252116619295, "learning_rate": 9.986537248392969e-06, "loss": 0.4756736755371094, "num_input_tokens_seen": 30223896, "step": 695, "train_runtime": 5365.8859, "train_tokens_per_second": 5632.601 }, { "epoch": 0.047131699434419604, "grad_norm": 1.0345486643678798, "learning_rate": 9.986342650492626e-06, "loss": 0.4506352424621582, "num_input_tokens_seen": 30445352, "step": 700, "train_runtime": 5399.4485, "train_tokens_per_second": 5638.604 }, { "epoch": 0.04746835443037975, "grad_norm": 0.919553088389443, "learning_rate": 9.98614665817746e-06, "loss": 0.42203187942504883, "num_input_tokens_seen": 30642128, "step": 705, "train_runtime": 5439.3583, "train_tokens_per_second": 5633.409 }, { "epoch": 0.04780500942633989, "grad_norm": 0.9271703985798777, "learning_rate": 9.98594927150228e-06, "loss": 0.427701473236084, "num_input_tokens_seen": 30873224, "step": 710, "train_runtime": 5478.7451, "train_tokens_per_second": 5635.09 }, { "epoch": 0.04814166442230003, "grad_norm": 0.9508538400970585, "learning_rate": 9.985750490522286e-06, "loss": 0.39564857482910154, "num_input_tokens_seen": 31087512, "step": 715, "train_runtime": 5521.2724, "train_tokens_per_second": 5630.498 }, { "epoch": 0.04847831941826017, "grad_norm": 0.9372110505017411, "learning_rate": 9.985550315293066e-06, "loss": 0.4636754035949707, "num_input_tokens_seen": 31318912, "step": 720, "train_runtime": 5557.4337, "train_tokens_per_second": 5635.499 }, { "epoch": 0.04881497441422031, "grad_norm": 0.9970520932843633, "learning_rate": 9.985348745870598e-06, "loss": 0.4597306728363037, "num_input_tokens_seen": 31546096, "step": 725, "train_runtime": 5592.8911, "train_tokens_per_second": 5640.392 }, { "epoch": 0.04915162941018045, "grad_norm": 0.8271247348731543, "learning_rate": 9.98514578231125e-06, "loss": 0.4194610595703125, "num_input_tokens_seen": 31774968, "step": 730, "train_runtime": 5630.8722, "train_tokens_per_second": 5642.992 }, { "epoch": 0.04948828440614059, "grad_norm": 0.9452005671897916, "learning_rate": 9.984941424671781e-06, "loss": 0.4705995559692383, "num_input_tokens_seen": 31991384, "step": 735, "train_runtime": 5672.8388, "train_tokens_per_second": 5639.396 }, { "epoch": 0.049824939402100726, "grad_norm": 0.9711026791829106, "learning_rate": 9.984735673009337e-06, "loss": 0.43364248275756834, "num_input_tokens_seen": 32211232, "step": 740, "train_runtime": 5717.5318, "train_tokens_per_second": 5633.765 }, { "epoch": 0.050161594398060866, "grad_norm": 0.8583208108971163, "learning_rate": 9.984528527381458e-06, "loss": 0.4496613502502441, "num_input_tokens_seen": 32432504, "step": 745, "train_runtime": 5758.1136, "train_tokens_per_second": 5632.488 }, { "epoch": 0.050498249394021005, "grad_norm": 1.0983008551303333, "learning_rate": 9.984319987846072e-06, "loss": 0.4476910591125488, "num_input_tokens_seen": 32644184, "step": 750, "train_runtime": 5795.8989, "train_tokens_per_second": 5632.29 }, { "epoch": 0.050834904389981145, "grad_norm": 0.9341698177556362, "learning_rate": 9.984110054461495e-06, "loss": 0.4494589328765869, "num_input_tokens_seen": 32883080, "step": 755, "train_runtime": 5831.2135, "train_tokens_per_second": 5639.149 }, { "epoch": 0.051171559385941284, "grad_norm": 2.9705690058280205, "learning_rate": 9.983898727286435e-06, "loss": 0.44231281280517576, "num_input_tokens_seen": 33102688, "step": 760, "train_runtime": 5864.3725, "train_tokens_per_second": 5644.711 }, { "epoch": 0.05150821438190143, "grad_norm": 0.9183883314753698, "learning_rate": 9.983686006379985e-06, "loss": 0.45505475997924805, "num_input_tokens_seen": 33319336, "step": 765, "train_runtime": 5901.491, "train_tokens_per_second": 5645.918 }, { "epoch": 0.05184486937786157, "grad_norm": 0.9313957301525887, "learning_rate": 9.983471891801638e-06, "loss": 0.437741756439209, "num_input_tokens_seen": 33545192, "step": 770, "train_runtime": 5938.7864, "train_tokens_per_second": 5648.493 }, { "epoch": 0.05218152437382171, "grad_norm": 0.8973015582826919, "learning_rate": 9.983256383611267e-06, "loss": 0.441961669921875, "num_input_tokens_seen": 33767136, "step": 775, "train_runtime": 5974.9184, "train_tokens_per_second": 5651.481 }, { "epoch": 0.05251817936978185, "grad_norm": 1.380873298582274, "learning_rate": 9.983039481869138e-06, "loss": 0.42367143630981446, "num_input_tokens_seen": 33985712, "step": 780, "train_runtime": 6009.8556, "train_tokens_per_second": 5654.996 }, { "epoch": 0.05285483436574199, "grad_norm": 0.9605495456782687, "learning_rate": 9.98282118663591e-06, "loss": 0.4347693920135498, "num_input_tokens_seen": 34208000, "step": 785, "train_runtime": 6046.7667, "train_tokens_per_second": 5657.238 }, { "epoch": 0.05319148936170213, "grad_norm": 0.9570184798319451, "learning_rate": 9.982601497972624e-06, "loss": 0.4524986267089844, "num_input_tokens_seen": 34425040, "step": 790, "train_runtime": 6085.7762, "train_tokens_per_second": 5656.639 }, { "epoch": 0.05352814435766227, "grad_norm": 1.293632659414026, "learning_rate": 9.982380415940717e-06, "loss": 0.4259688377380371, "num_input_tokens_seen": 34634712, "step": 795, "train_runtime": 6120.1944, "train_tokens_per_second": 5659.087 }, { "epoch": 0.05386479935362241, "grad_norm": 0.9262120217395047, "learning_rate": 9.982157940602015e-06, "loss": 0.46526622772216797, "num_input_tokens_seen": 34865376, "step": 800, "train_runtime": 6156.1798, "train_tokens_per_second": 5663.476 }, { "epoch": 0.05420145434958255, "grad_norm": 0.892992639712076, "learning_rate": 9.981934072018732e-06, "loss": 0.44102907180786133, "num_input_tokens_seen": 35098448, "step": 805, "train_runtime": 6189.6138, "train_tokens_per_second": 5670.539 }, { "epoch": 0.054538109345542686, "grad_norm": 0.8797013169732244, "learning_rate": 9.981708810253472e-06, "loss": 0.4654733657836914, "num_input_tokens_seen": 35317184, "step": 810, "train_runtime": 6223.9712, "train_tokens_per_second": 5674.381 }, { "epoch": 0.054874764341502826, "grad_norm": 1.1385550766773516, "learning_rate": 9.981482155369229e-06, "loss": 0.4581299781799316, "num_input_tokens_seen": 35543024, "step": 815, "train_runtime": 6264.1777, "train_tokens_per_second": 5674.013 }, { "epoch": 0.055211419337462965, "grad_norm": 1.0108160361368144, "learning_rate": 9.981254107429385e-06, "loss": 0.4073037147521973, "num_input_tokens_seen": 35752976, "step": 820, "train_runtime": 6301.9605, "train_tokens_per_second": 5673.31 }, { "epoch": 0.05554807433342311, "grad_norm": 0.8271492373593813, "learning_rate": 9.981024666497716e-06, "loss": 0.4087496757507324, "num_input_tokens_seen": 35970808, "step": 825, "train_runtime": 6336.9136, "train_tokens_per_second": 5676.392 }, { "epoch": 0.05588472932938325, "grad_norm": 1.2448406201928153, "learning_rate": 9.98079383263838e-06, "loss": 0.451265811920166, "num_input_tokens_seen": 36175264, "step": 830, "train_runtime": 6372.1661, "train_tokens_per_second": 5677.075 }, { "epoch": 0.05622138432534339, "grad_norm": 1.0960090803895477, "learning_rate": 9.980561605915932e-06, "loss": 0.43454971313476565, "num_input_tokens_seen": 36399968, "step": 835, "train_runtime": 6409.522, "train_tokens_per_second": 5679.046 }, { "epoch": 0.05655803932130353, "grad_norm": 0.865350004624438, "learning_rate": 9.980327986395316e-06, "loss": 0.44866161346435546, "num_input_tokens_seen": 36614352, "step": 840, "train_runtime": 6450.8502, "train_tokens_per_second": 5675.896 }, { "epoch": 0.05689469431726367, "grad_norm": 0.9132401043618537, "learning_rate": 9.980092974141855e-06, "loss": 0.43543548583984376, "num_input_tokens_seen": 36842440, "step": 845, "train_runtime": 6489.8829, "train_tokens_per_second": 5676.904 }, { "epoch": 0.05723134931322381, "grad_norm": 0.9515826536482608, "learning_rate": 9.979856569221276e-06, "loss": 0.434114933013916, "num_input_tokens_seen": 37064928, "step": 850, "train_runtime": 6535.3585, "train_tokens_per_second": 5671.445 }, { "epoch": 0.05756800430918395, "grad_norm": 0.905243476379667, "learning_rate": 9.979618771699688e-06, "loss": 0.47480268478393556, "num_input_tokens_seen": 37286696, "step": 855, "train_runtime": 6571.3163, "train_tokens_per_second": 5674.159 }, { "epoch": 0.05790465930514409, "grad_norm": 0.9973188371129253, "learning_rate": 9.979379581643588e-06, "loss": 0.4271403312683105, "num_input_tokens_seen": 37505104, "step": 860, "train_runtime": 6612.0758, "train_tokens_per_second": 5672.213 }, { "epoch": 0.05824131430110423, "grad_norm": 0.891663822548588, "learning_rate": 9.979138999119866e-06, "loss": 0.46260747909545896, "num_input_tokens_seen": 37721104, "step": 865, "train_runtime": 6657.2054, "train_tokens_per_second": 5666.207 }, { "epoch": 0.05857796929706437, "grad_norm": 0.8193884764682856, "learning_rate": 9.978897024195801e-06, "loss": 0.43666720390319824, "num_input_tokens_seen": 37959848, "step": 870, "train_runtime": 6692.9435, "train_tokens_per_second": 5671.622 }, { "epoch": 0.058914624293024506, "grad_norm": 1.1669037394876847, "learning_rate": 9.978653656939058e-06, "loss": 0.4272760391235352, "num_input_tokens_seen": 38179560, "step": 875, "train_runtime": 6736.655, "train_tokens_per_second": 5667.436 }, { "epoch": 0.059251279288984646, "grad_norm": 1.0468766117182693, "learning_rate": 9.978408897417699e-06, "loss": 0.4613694190979004, "num_input_tokens_seen": 38405040, "step": 880, "train_runtime": 6776.3735, "train_tokens_per_second": 5667.492 }, { "epoch": 0.059587934284944785, "grad_norm": 0.8352176899590911, "learning_rate": 9.978162745700165e-06, "loss": 0.4417067527770996, "num_input_tokens_seen": 38631232, "step": 885, "train_runtime": 6814.8051, "train_tokens_per_second": 5668.721 }, { "epoch": 0.05992458928090493, "grad_norm": 1.0696188249598721, "learning_rate": 9.977915201855293e-06, "loss": 0.42413697242736814, "num_input_tokens_seen": 38849712, "step": 890, "train_runtime": 6850.9387, "train_tokens_per_second": 5670.714 }, { "epoch": 0.06026124427686507, "grad_norm": 0.9281445460422576, "learning_rate": 9.977666265952309e-06, "loss": 0.4329718589782715, "num_input_tokens_seen": 39067416, "step": 895, "train_runtime": 6890.6802, "train_tokens_per_second": 5669.602 }, { "epoch": 0.06059789927282521, "grad_norm": 0.8685965904886482, "learning_rate": 9.977415938060823e-06, "loss": 0.4434166431427002, "num_input_tokens_seen": 39288624, "step": 900, "train_runtime": 6926.1271, "train_tokens_per_second": 5672.524 }, { "epoch": 0.06093455426878535, "grad_norm": 0.9417641978342199, "learning_rate": 9.977164218250846e-06, "loss": 0.444110107421875, "num_input_tokens_seen": 39505328, "step": 905, "train_runtime": 6968.8615, "train_tokens_per_second": 5668.835 }, { "epoch": 0.06127120926474549, "grad_norm": 0.8557175345597763, "learning_rate": 9.976911106592765e-06, "loss": 0.4071072578430176, "num_input_tokens_seen": 39717144, "step": 910, "train_runtime": 7009.1269, "train_tokens_per_second": 5666.49 }, { "epoch": 0.06160786426070563, "grad_norm": 1.1399112064858985, "learning_rate": 9.976656603157363e-06, "loss": 0.4384052276611328, "num_input_tokens_seen": 39933000, "step": 915, "train_runtime": 7045.7591, "train_tokens_per_second": 5667.665 }, { "epoch": 0.06194451925666577, "grad_norm": 0.9115769460735773, "learning_rate": 9.976400708015811e-06, "loss": 0.42393884658813474, "num_input_tokens_seen": 40145168, "step": 920, "train_runtime": 7079.4173, "train_tokens_per_second": 5670.688 }, { "epoch": 0.06228117425262591, "grad_norm": 0.8414795692849011, "learning_rate": 9.97614342123967e-06, "loss": 0.4269254684448242, "num_input_tokens_seen": 40379264, "step": 925, "train_runtime": 7111.1373, "train_tokens_per_second": 5678.313 }, { "epoch": 0.06261782924858605, "grad_norm": 0.9352365482641929, "learning_rate": 9.97588474290089e-06, "loss": 0.4331661224365234, "num_input_tokens_seen": 40594944, "step": 930, "train_runtime": 7152.76, "train_tokens_per_second": 5675.424 }, { "epoch": 0.0629544842445462, "grad_norm": 1.0614310774414917, "learning_rate": 9.975624673071806e-06, "loss": 0.4371979236602783, "num_input_tokens_seen": 40808856, "step": 935, "train_runtime": 7197.718, "train_tokens_per_second": 5669.694 }, { "epoch": 0.06329113924050633, "grad_norm": 1.0079121416060646, "learning_rate": 9.97536321182515e-06, "loss": 0.4044677734375, "num_input_tokens_seen": 41018224, "step": 940, "train_runtime": 7227.9115, "train_tokens_per_second": 5674.976 }, { "epoch": 0.06362779423646647, "grad_norm": 0.9987688379119654, "learning_rate": 9.975100359234037e-06, "loss": 0.4564094066619873, "num_input_tokens_seen": 41239392, "step": 945, "train_runtime": 7265.9862, "train_tokens_per_second": 5675.677 }, { "epoch": 0.06396444923242661, "grad_norm": 0.9165255721069369, "learning_rate": 9.974836115371972e-06, "loss": 0.46511135101318357, "num_input_tokens_seen": 41454352, "step": 950, "train_runtime": 7304.5238, "train_tokens_per_second": 5675.161 }, { "epoch": 0.06430110422838675, "grad_norm": 0.9087923038014859, "learning_rate": 9.974570480312852e-06, "loss": 0.40421581268310547, "num_input_tokens_seen": 41680576, "step": 955, "train_runtime": 7346.7849, "train_tokens_per_second": 5673.308 }, { "epoch": 0.06463775922434689, "grad_norm": 1.0231903244202105, "learning_rate": 9.974303454130962e-06, "loss": 0.4464391231536865, "num_input_tokens_seen": 41882360, "step": 960, "train_runtime": 7380.8428, "train_tokens_per_second": 5674.469 }, { "epoch": 0.06497441422030703, "grad_norm": 0.8595399990273458, "learning_rate": 9.97403503690097e-06, "loss": 0.42637953758239744, "num_input_tokens_seen": 42103128, "step": 965, "train_runtime": 7415.439, "train_tokens_per_second": 5677.766 }, { "epoch": 0.06531106921626717, "grad_norm": 0.8422231085957664, "learning_rate": 9.973765228697942e-06, "loss": 0.39764556884765623, "num_input_tokens_seen": 42328192, "step": 970, "train_runtime": 7453.2347, "train_tokens_per_second": 5679.171 }, { "epoch": 0.06564772421222731, "grad_norm": 0.9247166172844082, "learning_rate": 9.973494029597327e-06, "loss": 0.43375320434570314, "num_input_tokens_seen": 42531664, "step": 975, "train_runtime": 7487.6836, "train_tokens_per_second": 5680.217 }, { "epoch": 0.06598437920818745, "grad_norm": 1.0151970555059149, "learning_rate": 9.973221439674968e-06, "loss": 0.4309089660644531, "num_input_tokens_seen": 42740856, "step": 980, "train_runtime": 7527.1188, "train_tokens_per_second": 5678.249 }, { "epoch": 0.06632103420414759, "grad_norm": 0.882649641197766, "learning_rate": 9.972947459007089e-06, "loss": 0.45548033714294434, "num_input_tokens_seen": 42956288, "step": 985, "train_runtime": 7562.7131, "train_tokens_per_second": 5680.01 }, { "epoch": 0.06665768920010773, "grad_norm": 0.9104741890803707, "learning_rate": 9.972672087670313e-06, "loss": 0.4385095119476318, "num_input_tokens_seen": 43177272, "step": 990, "train_runtime": 7599.4941, "train_tokens_per_second": 5681.598 }, { "epoch": 0.06699434419606787, "grad_norm": 0.8108451361340878, "learning_rate": 9.972395325741644e-06, "loss": 0.413985538482666, "num_input_tokens_seen": 43400152, "step": 995, "train_runtime": 7640.1047, "train_tokens_per_second": 5680.57 }, { "epoch": 0.06733099919202801, "grad_norm": 0.9025973522517067, "learning_rate": 9.972117173298476e-06, "loss": 0.38621523380279543, "num_input_tokens_seen": 43614968, "step": 1000, "train_runtime": 7674.2806, "train_tokens_per_second": 5683.265 }, { "epoch": 0.06766765418798815, "grad_norm": 0.971243318554936, "learning_rate": 9.971837630418597e-06, "loss": 0.42676420211791993, "num_input_tokens_seen": 43835904, "step": 1005, "train_runtime": 7717.1168, "train_tokens_per_second": 5680.347 }, { "epoch": 0.06800430918394829, "grad_norm": 0.9278937330533324, "learning_rate": 9.971556697180179e-06, "loss": 0.44001970291137693, "num_input_tokens_seen": 44048512, "step": 1010, "train_runtime": 7756.4813, "train_tokens_per_second": 5678.93 }, { "epoch": 0.06834096417990843, "grad_norm": 0.9429692040194982, "learning_rate": 9.971274373661784e-06, "loss": 0.4194046974182129, "num_input_tokens_seen": 44271000, "step": 1015, "train_runtime": 7787.4236, "train_tokens_per_second": 5684.935 }, { "epoch": 0.06867761917586857, "grad_norm": 1.111228553028809, "learning_rate": 9.97099065994236e-06, "loss": 0.39097912311553956, "num_input_tokens_seen": 44499576, "step": 1020, "train_runtime": 7822.0558, "train_tokens_per_second": 5688.987 }, { "epoch": 0.0690142741718287, "grad_norm": 1.0049309947436895, "learning_rate": 9.970705556101253e-06, "loss": 0.43691391944885255, "num_input_tokens_seen": 44702000, "step": 1025, "train_runtime": 7857.7887, "train_tokens_per_second": 5688.878 }, { "epoch": 0.06935092916778884, "grad_norm": 0.8982051488791603, "learning_rate": 9.970419062218186e-06, "loss": 0.45786590576171876, "num_input_tokens_seen": 44936832, "step": 1030, "train_runtime": 7899.821, "train_tokens_per_second": 5688.336 }, { "epoch": 0.06968758416374898, "grad_norm": 0.9779591960140872, "learning_rate": 9.970131178373276e-06, "loss": 0.4594112396240234, "num_input_tokens_seen": 45166720, "step": 1035, "train_runtime": 7937.6344, "train_tokens_per_second": 5690.199 }, { "epoch": 0.07002423915970914, "grad_norm": 0.9403137936019832, "learning_rate": 9.969841904647033e-06, "loss": 0.48036918640136717, "num_input_tokens_seen": 45386112, "step": 1040, "train_runtime": 7975.3873, "train_tokens_per_second": 5690.772 }, { "epoch": 0.07036089415566928, "grad_norm": 0.9489869208797291, "learning_rate": 9.969551241120349e-06, "loss": 0.4358417510986328, "num_input_tokens_seen": 45615968, "step": 1045, "train_runtime": 8008.3857, "train_tokens_per_second": 5696.025 }, { "epoch": 0.07069754915162942, "grad_norm": 0.8565455428368292, "learning_rate": 9.969259187874507e-06, "loss": 0.40404400825500486, "num_input_tokens_seen": 45846704, "step": 1050, "train_runtime": 8044.3345, "train_tokens_per_second": 5699.254 }, { "epoch": 0.07103420414758956, "grad_norm": 0.9631616045121916, "learning_rate": 9.968965744991178e-06, "loss": 0.43367910385131836, "num_input_tokens_seen": 46069384, "step": 1055, "train_runtime": 8075.3735, "train_tokens_per_second": 5704.923 }, { "epoch": 0.0713708591435497, "grad_norm": 0.923891258768515, "learning_rate": 9.968670912552422e-06, "loss": 0.41605100631713865, "num_input_tokens_seen": 46289280, "step": 1060, "train_runtime": 8110.2287, "train_tokens_per_second": 5707.518 }, { "epoch": 0.07170751413950983, "grad_norm": 0.9199449654930428, "learning_rate": 9.968374690640692e-06, "loss": 0.4259674072265625, "num_input_tokens_seen": 46513832, "step": 1065, "train_runtime": 8149.1273, "train_tokens_per_second": 5707.83 }, { "epoch": 0.07204416913546997, "grad_norm": 0.9349037827416551, "learning_rate": 9.968077079338822e-06, "loss": 0.44624719619750974, "num_input_tokens_seen": 46732528, "step": 1070, "train_runtime": 8183.763, "train_tokens_per_second": 5710.396 }, { "epoch": 0.07238082413143011, "grad_norm": 0.9411351171686876, "learning_rate": 9.967778078730038e-06, "loss": 0.4426886558532715, "num_input_tokens_seen": 46948464, "step": 1075, "train_runtime": 8220.2593, "train_tokens_per_second": 5711.312 }, { "epoch": 0.07271747912739025, "grad_norm": 0.9433124357981822, "learning_rate": 9.967477688897957e-06, "loss": 0.44336910247802735, "num_input_tokens_seen": 47171032, "step": 1080, "train_runtime": 8259.7389, "train_tokens_per_second": 5710.959 }, { "epoch": 0.07305413412335039, "grad_norm": 0.8570101786695654, "learning_rate": 9.967175909926578e-06, "loss": 0.46260600090026854, "num_input_tokens_seen": 47402968, "step": 1085, "train_runtime": 8293.6887, "train_tokens_per_second": 5715.547 }, { "epoch": 0.07339078911931053, "grad_norm": 0.967581695257143, "learning_rate": 9.966872741900296e-06, "loss": 0.4760030746459961, "num_input_tokens_seen": 47634040, "step": 1090, "train_runtime": 8342.26, "train_tokens_per_second": 5709.968 }, { "epoch": 0.07372744411527067, "grad_norm": 1.3602823694752813, "learning_rate": 9.96656818490389e-06, "loss": 0.4523357391357422, "num_input_tokens_seen": 47849424, "step": 1095, "train_runtime": 8378.4116, "train_tokens_per_second": 5711.038 }, { "epoch": 0.07406409911123081, "grad_norm": 0.8798163617081339, "learning_rate": 9.966262239022529e-06, "loss": 0.48172898292541505, "num_input_tokens_seen": 48074544, "step": 1100, "train_runtime": 8414.2774, "train_tokens_per_second": 5713.449 }, { "epoch": 0.07440075410719095, "grad_norm": 0.8689729621566785, "learning_rate": 9.965954904341768e-06, "loss": 0.4594748497009277, "num_input_tokens_seen": 48294808, "step": 1105, "train_runtime": 8453.2631, "train_tokens_per_second": 5713.156 }, { "epoch": 0.07473740910315109, "grad_norm": 0.9298500312875317, "learning_rate": 9.965646180947555e-06, "loss": 0.44074625968933107, "num_input_tokens_seen": 48509312, "step": 1110, "train_runtime": 8496.7093, "train_tokens_per_second": 5709.188 }, { "epoch": 0.07507406409911123, "grad_norm": 0.9049700587066084, "learning_rate": 9.96533606892622e-06, "loss": 0.42275848388671877, "num_input_tokens_seen": 48715504, "step": 1115, "train_runtime": 8533.5132, "train_tokens_per_second": 5708.728 }, { "epoch": 0.07541071909507137, "grad_norm": 0.882919522521347, "learning_rate": 9.965024568364487e-06, "loss": 0.4448400497436523, "num_input_tokens_seen": 48944392, "step": 1120, "train_runtime": 8571.3237, "train_tokens_per_second": 5710.249 }, { "epoch": 0.07574737409103151, "grad_norm": 0.9374688066893563, "learning_rate": 9.964711679349467e-06, "loss": 0.41461782455444335, "num_input_tokens_seen": 49155824, "step": 1125, "train_runtime": 8611.0892, "train_tokens_per_second": 5708.433 }, { "epoch": 0.07608402908699165, "grad_norm": 0.7995128542211772, "learning_rate": 9.964397401968656e-06, "loss": 0.46135854721069336, "num_input_tokens_seen": 49380912, "step": 1130, "train_runtime": 8650.8346, "train_tokens_per_second": 5708.225 }, { "epoch": 0.07642068408295179, "grad_norm": 0.8607214899503258, "learning_rate": 9.964081736309942e-06, "loss": 0.41400885581970215, "num_input_tokens_seen": 49617456, "step": 1135, "train_runtime": 8688.4749, "train_tokens_per_second": 5710.721 }, { "epoch": 0.07675733907891193, "grad_norm": 0.8715957366665356, "learning_rate": 9.963764682461599e-06, "loss": 0.4346445083618164, "num_input_tokens_seen": 49848584, "step": 1140, "train_runtime": 8722.1234, "train_tokens_per_second": 5715.189 }, { "epoch": 0.07709399407487207, "grad_norm": 0.8561235152822287, "learning_rate": 9.96344624051229e-06, "loss": 0.4340538501739502, "num_input_tokens_seen": 50065696, "step": 1145, "train_runtime": 8762.0281, "train_tokens_per_second": 5713.939 }, { "epoch": 0.0774306490708322, "grad_norm": 0.929804620150381, "learning_rate": 9.96312641055107e-06, "loss": 0.4169576644897461, "num_input_tokens_seen": 50283968, "step": 1150, "train_runtime": 8801.5092, "train_tokens_per_second": 5713.107 }, { "epoch": 0.07776730406679234, "grad_norm": 0.752419655730966, "learning_rate": 9.962805192667375e-06, "loss": 0.41555070877075195, "num_input_tokens_seen": 50500904, "step": 1155, "train_runtime": 8848.2982, "train_tokens_per_second": 5707.414 }, { "epoch": 0.07810395906275248, "grad_norm": 1.0612801529163063, "learning_rate": 9.962482586951033e-06, "loss": 0.4202773094177246, "num_input_tokens_seen": 50733408, "step": 1160, "train_runtime": 8889.0849, "train_tokens_per_second": 5707.383 }, { "epoch": 0.07844061405871264, "grad_norm": 0.9990837210097588, "learning_rate": 9.962158593492258e-06, "loss": 0.442533016204834, "num_input_tokens_seen": 50939416, "step": 1165, "train_runtime": 8930.0327, "train_tokens_per_second": 5704.281 }, { "epoch": 0.07877726905467278, "grad_norm": 0.8491329656110541, "learning_rate": 9.961833212381657e-06, "loss": 0.4386699676513672, "num_input_tokens_seen": 51160880, "step": 1170, "train_runtime": 8967.7862, "train_tokens_per_second": 5704.962 }, { "epoch": 0.07911392405063292, "grad_norm": 0.8233317233024117, "learning_rate": 9.961506443710221e-06, "loss": 0.4202608108520508, "num_input_tokens_seen": 51382192, "step": 1175, "train_runtime": 9009.4779, "train_tokens_per_second": 5703.126 }, { "epoch": 0.07945057904659306, "grad_norm": 1.1740908151711091, "learning_rate": 9.961178287569326e-06, "loss": 0.4113266944885254, "num_input_tokens_seen": 51610400, "step": 1180, "train_runtime": 9043.5038, "train_tokens_per_second": 5706.903 }, { "epoch": 0.0797872340425532, "grad_norm": 0.9683671789990694, "learning_rate": 9.960848744050747e-06, "loss": 0.44871106147766116, "num_input_tokens_seen": 51828672, "step": 1185, "train_runtime": 9085.7121, "train_tokens_per_second": 5704.415 }, { "epoch": 0.08012388903851334, "grad_norm": 0.7384402440175095, "learning_rate": 9.960517813246633e-06, "loss": 0.44126176834106445, "num_input_tokens_seen": 52038752, "step": 1190, "train_runtime": 9126.3974, "train_tokens_per_second": 5702.004 }, { "epoch": 0.08046054403447347, "grad_norm": 0.9518446142368773, "learning_rate": 9.96018549524953e-06, "loss": 0.4168846607208252, "num_input_tokens_seen": 52257272, "step": 1195, "train_runtime": 9165.705, "train_tokens_per_second": 5701.391 }, { "epoch": 0.08079719903043361, "grad_norm": 0.9426346640072512, "learning_rate": 9.959851790152371e-06, "loss": 0.41556696891784667, "num_input_tokens_seen": 52478032, "step": 1200, "train_runtime": 9204.8312, "train_tokens_per_second": 5701.14 }, { "epoch": 0.08113385402639375, "grad_norm": 0.8462737285766736, "learning_rate": 9.959516698048475e-06, "loss": 0.3835282325744629, "num_input_tokens_seen": 52684592, "step": 1205, "train_runtime": 9245.4602, "train_tokens_per_second": 5698.428 }, { "epoch": 0.08147050902235389, "grad_norm": 0.8765077742279136, "learning_rate": 9.959180219031551e-06, "loss": 0.4106024742126465, "num_input_tokens_seen": 52895048, "step": 1210, "train_runtime": 9284.6342, "train_tokens_per_second": 5697.052 }, { "epoch": 0.08180716401831403, "grad_norm": 0.8799539327811132, "learning_rate": 9.958842353195688e-06, "loss": 0.4241660118103027, "num_input_tokens_seen": 53122496, "step": 1215, "train_runtime": 9323.4499, "train_tokens_per_second": 5697.73 }, { "epoch": 0.08214381901427417, "grad_norm": 0.8851017529748658, "learning_rate": 9.958503100635377e-06, "loss": 0.43586392402648927, "num_input_tokens_seen": 53331344, "step": 1220, "train_runtime": 9359.4211, "train_tokens_per_second": 5698.146 }, { "epoch": 0.08248047401023431, "grad_norm": 0.9611985454606802, "learning_rate": 9.958162461445484e-06, "loss": 0.4607269287109375, "num_input_tokens_seen": 53560160, "step": 1225, "train_runtime": 9398.2675, "train_tokens_per_second": 5698.94 }, { "epoch": 0.08281712900619445, "grad_norm": 0.9067497311826802, "learning_rate": 9.957820435721271e-06, "loss": 0.4349203586578369, "num_input_tokens_seen": 53775560, "step": 1230, "train_runtime": 9435.4003, "train_tokens_per_second": 5699.341 }, { "epoch": 0.08315378400215459, "grad_norm": 0.963108721688269, "learning_rate": 9.95747702355838e-06, "loss": 0.45670351982116697, "num_input_tokens_seen": 54000808, "step": 1235, "train_runtime": 9470.0321, "train_tokens_per_second": 5702.284 }, { "epoch": 0.08349043899811473, "grad_norm": 0.8513390607173822, "learning_rate": 9.957132225052848e-06, "loss": 0.4656820297241211, "num_input_tokens_seen": 54218336, "step": 1240, "train_runtime": 9509.4298, "train_tokens_per_second": 5701.534 }, { "epoch": 0.08382709399407487, "grad_norm": 0.8033639657062732, "learning_rate": 9.956786040301098e-06, "loss": 0.407243537902832, "num_input_tokens_seen": 54435576, "step": 1245, "train_runtime": 9549.0218, "train_tokens_per_second": 5700.644 }, { "epoch": 0.08416374899003501, "grad_norm": 0.9112338258739832, "learning_rate": 9.956438469399936e-06, "loss": 0.42780628204345705, "num_input_tokens_seen": 54646448, "step": 1250, "train_runtime": 9584.5449, "train_tokens_per_second": 5701.517 }, { "epoch": 0.08450040398599515, "grad_norm": 0.898524764750954, "learning_rate": 9.956089512446562e-06, "loss": 0.4281005859375, "num_input_tokens_seen": 54849384, "step": 1255, "train_runtime": 9624.8869, "train_tokens_per_second": 5698.704 }, { "epoch": 0.08483705898195529, "grad_norm": 0.9393978257221618, "learning_rate": 9.955739169538559e-06, "loss": 0.43431816101074217, "num_input_tokens_seen": 55062944, "step": 1260, "train_runtime": 9664.3501, "train_tokens_per_second": 5697.532 }, { "epoch": 0.08517371397791543, "grad_norm": 0.9086736133443781, "learning_rate": 9.955387440773902e-06, "loss": 0.4328322887420654, "num_input_tokens_seen": 55267032, "step": 1265, "train_runtime": 9704.5196, "train_tokens_per_second": 5694.979 }, { "epoch": 0.08551036897387557, "grad_norm": 1.1824810596928264, "learning_rate": 9.955034326250947e-06, "loss": 0.42726478576660154, "num_input_tokens_seen": 55485176, "step": 1270, "train_runtime": 9740.2982, "train_tokens_per_second": 5696.456 }, { "epoch": 0.0858470239698357, "grad_norm": 0.981019269531651, "learning_rate": 9.954679826068444e-06, "loss": 0.431905460357666, "num_input_tokens_seen": 55697472, "step": 1275, "train_runtime": 9778.2861, "train_tokens_per_second": 5696.036 }, { "epoch": 0.08618367896579585, "grad_norm": 0.9167947068742166, "learning_rate": 9.954323940325526e-06, "loss": 0.4367355823516846, "num_input_tokens_seen": 55909208, "step": 1280, "train_runtime": 9815.8422, "train_tokens_per_second": 5695.814 }, { "epoch": 0.086520333961756, "grad_norm": 0.8284962122347568, "learning_rate": 9.953966669121715e-06, "loss": 0.4562966346740723, "num_input_tokens_seen": 56144336, "step": 1285, "train_runtime": 9855.4694, "train_tokens_per_second": 5696.769 }, { "epoch": 0.08685698895771614, "grad_norm": 0.9908373153090002, "learning_rate": 9.953608012556924e-06, "loss": 0.4428553581237793, "num_input_tokens_seen": 56370632, "step": 1290, "train_runtime": 9900.5066, "train_tokens_per_second": 5693.712 }, { "epoch": 0.08719364395367628, "grad_norm": 0.8603920936193332, "learning_rate": 9.953247970731449e-06, "loss": 0.4518705368041992, "num_input_tokens_seen": 56581824, "step": 1295, "train_runtime": 9941.9268, "train_tokens_per_second": 5691.233 }, { "epoch": 0.08753029894963642, "grad_norm": 1.0065353834353872, "learning_rate": 9.952886543745973e-06, "loss": 0.45711684226989746, "num_input_tokens_seen": 56797912, "step": 1300, "train_runtime": 9983.8473, "train_tokens_per_second": 5688.98 }, { "epoch": 0.08786695394559656, "grad_norm": 0.9704989049669684, "learning_rate": 9.952523731701566e-06, "loss": 0.43997964859008787, "num_input_tokens_seen": 57028400, "step": 1305, "train_runtime": 10023.0235, "train_tokens_per_second": 5689.74 }, { "epoch": 0.0882036089415567, "grad_norm": 0.7746848672115061, "learning_rate": 9.952159534699693e-06, "loss": 0.39839365482330324, "num_input_tokens_seen": 57239112, "step": 1310, "train_runtime": 10060.0427, "train_tokens_per_second": 5689.748 }, { "epoch": 0.08854026393751684, "grad_norm": 0.8703667437003134, "learning_rate": 9.951793952842197e-06, "loss": 0.46162776947021483, "num_input_tokens_seen": 57451840, "step": 1315, "train_runtime": 10090.9799, "train_tokens_per_second": 5693.386 }, { "epoch": 0.08887691893347698, "grad_norm": 0.9970523155610451, "learning_rate": 9.95142698623131e-06, "loss": 0.4125502109527588, "num_input_tokens_seen": 57649616, "step": 1320, "train_runtime": 10134.3943, "train_tokens_per_second": 5688.511 }, { "epoch": 0.08921357392943711, "grad_norm": 0.8982754367798736, "learning_rate": 9.951058634969657e-06, "loss": 0.4594625473022461, "num_input_tokens_seen": 57859504, "step": 1325, "train_runtime": 10173.3422, "train_tokens_per_second": 5687.364 }, { "epoch": 0.08955022892539725, "grad_norm": 0.8441984007212928, "learning_rate": 9.950688899160244e-06, "loss": 0.42917823791503906, "num_input_tokens_seen": 58092104, "step": 1330, "train_runtime": 10208.5539, "train_tokens_per_second": 5690.532 }, { "epoch": 0.0898868839213574, "grad_norm": 0.8326739767212783, "learning_rate": 9.950317778906469e-06, "loss": 0.4345374584197998, "num_input_tokens_seen": 58319256, "step": 1335, "train_runtime": 10249.3358, "train_tokens_per_second": 5690.052 }, { "epoch": 0.09022353891731753, "grad_norm": 0.8294890352349942, "learning_rate": 9.949945274312109e-06, "loss": 0.40816512107849123, "num_input_tokens_seen": 58540424, "step": 1340, "train_runtime": 10287.6498, "train_tokens_per_second": 5690.359 }, { "epoch": 0.09056019391327767, "grad_norm": 0.968521031703479, "learning_rate": 9.94957138548134e-06, "loss": 0.4445356369018555, "num_input_tokens_seen": 58736800, "step": 1345, "train_runtime": 10326.024, "train_tokens_per_second": 5688.23 }, { "epoch": 0.09089684890923781, "grad_norm": 1.007040150938243, "learning_rate": 9.949196112518715e-06, "loss": 0.41266183853149413, "num_input_tokens_seen": 58963840, "step": 1350, "train_runtime": 10361.3193, "train_tokens_per_second": 5690.766 }, { "epoch": 0.09123350390519795, "grad_norm": 0.8518178617284553, "learning_rate": 9.94881945552918e-06, "loss": 0.43543500900268556, "num_input_tokens_seen": 59186072, "step": 1355, "train_runtime": 10406.6964, "train_tokens_per_second": 5687.307 }, { "epoch": 0.09157015890115809, "grad_norm": 0.9351761092832128, "learning_rate": 9.948441414618064e-06, "loss": 0.45530238151550295, "num_input_tokens_seen": 59396096, "step": 1360, "train_runtime": 10448.5625, "train_tokens_per_second": 5684.619 }, { "epoch": 0.09190681389711823, "grad_norm": 0.976556409327906, "learning_rate": 9.948061989891085e-06, "loss": 0.41725835800170896, "num_input_tokens_seen": 59621960, "step": 1365, "train_runtime": 10484.4296, "train_tokens_per_second": 5686.715 }, { "epoch": 0.09224346889307837, "grad_norm": 0.9413072947091584, "learning_rate": 9.94768118145435e-06, "loss": 0.4238771438598633, "num_input_tokens_seen": 59834688, "step": 1370, "train_runtime": 10521.7898, "train_tokens_per_second": 5686.74 }, { "epoch": 0.09258012388903851, "grad_norm": 0.8072753824687519, "learning_rate": 9.947298989414349e-06, "loss": 0.4197520732879639, "num_input_tokens_seen": 60061512, "step": 1375, "train_runtime": 10562.6863, "train_tokens_per_second": 5686.197 }, { "epoch": 0.09291677888499865, "grad_norm": 0.8243851964827824, "learning_rate": 9.946915413877963e-06, "loss": 0.4294243812561035, "num_input_tokens_seen": 60289152, "step": 1380, "train_runtime": 10608.7449, "train_tokens_per_second": 5682.967 }, { "epoch": 0.09325343388095879, "grad_norm": 0.8639433441786879, "learning_rate": 9.946530454952454e-06, "loss": 0.44629898071289065, "num_input_tokens_seen": 60516576, "step": 1385, "train_runtime": 10649.4064, "train_tokens_per_second": 5682.624 }, { "epoch": 0.09359008887691893, "grad_norm": 0.9381874141159465, "learning_rate": 9.946144112745477e-06, "loss": 0.4549723625183105, "num_input_tokens_seen": 60744096, "step": 1390, "train_runtime": 10690.6621, "train_tokens_per_second": 5681.977 }, { "epoch": 0.09392674387287907, "grad_norm": 0.9598970905259178, "learning_rate": 9.94575638736507e-06, "loss": 0.4265571594238281, "num_input_tokens_seen": 60970464, "step": 1395, "train_runtime": 10730.6636, "train_tokens_per_second": 5681.891 }, { "epoch": 0.09426339886883921, "grad_norm": 0.8882564184072146, "learning_rate": 9.945367278919662e-06, "loss": 0.469175910949707, "num_input_tokens_seen": 61195536, "step": 1400, "train_runtime": 10771.6796, "train_tokens_per_second": 5681.151 }, { "epoch": 0.09460005386479936, "grad_norm": 0.8345645071811238, "learning_rate": 9.944976787518064e-06, "loss": 0.43855986595153806, "num_input_tokens_seen": 61415400, "step": 1405, "train_runtime": 10804.9607, "train_tokens_per_second": 5684.0 }, { "epoch": 0.0949367088607595, "grad_norm": 1.0139184695279284, "learning_rate": 9.944584913269474e-06, "loss": 0.43834495544433594, "num_input_tokens_seen": 61645440, "step": 1410, "train_runtime": 10846.1692, "train_tokens_per_second": 5683.614 }, { "epoch": 0.09527336385671964, "grad_norm": 0.8171057323619708, "learning_rate": 9.944191656283481e-06, "loss": 0.41381168365478516, "num_input_tokens_seen": 61868952, "step": 1415, "train_runtime": 10885.6156, "train_tokens_per_second": 5683.551 }, { "epoch": 0.09561001885267978, "grad_norm": 0.8671727475302144, "learning_rate": 9.943797016670059e-06, "loss": 0.41778225898742677, "num_input_tokens_seen": 62081744, "step": 1420, "train_runtime": 10924.1913, "train_tokens_per_second": 5682.96 }, { "epoch": 0.09594667384863992, "grad_norm": 0.9139643587899275, "learning_rate": 9.943400994539565e-06, "loss": 0.41177783012390134, "num_input_tokens_seen": 62299552, "step": 1425, "train_runtime": 10963.2034, "train_tokens_per_second": 5682.605 }, { "epoch": 0.09628332884460006, "grad_norm": 0.8942790678032806, "learning_rate": 9.943003590002744e-06, "loss": 0.4324612617492676, "num_input_tokens_seen": 62524424, "step": 1430, "train_runtime": 11003.5976, "train_tokens_per_second": 5682.18 }, { "epoch": 0.0966199838405602, "grad_norm": 0.9134672447344226, "learning_rate": 9.942604803170733e-06, "loss": 0.4207320690155029, "num_input_tokens_seen": 62736736, "step": 1435, "train_runtime": 11041.0071, "train_tokens_per_second": 5682.157 }, { "epoch": 0.09695663883652034, "grad_norm": 1.078284335277287, "learning_rate": 9.94220463415505e-06, "loss": 0.4587702751159668, "num_input_tokens_seen": 62950552, "step": 1440, "train_runtime": 11082.5134, "train_tokens_per_second": 5680.169 }, { "epoch": 0.09729329383248048, "grad_norm": 0.8211105532018887, "learning_rate": 9.9418030830676e-06, "loss": 0.4369199752807617, "num_input_tokens_seen": 63173304, "step": 1445, "train_runtime": 11119.7396, "train_tokens_per_second": 5681.186 }, { "epoch": 0.09762994882844062, "grad_norm": 0.9975227482376734, "learning_rate": 9.941400150020676e-06, "loss": 0.45250940322875977, "num_input_tokens_seen": 63376456, "step": 1450, "train_runtime": 11153.3434, "train_tokens_per_second": 5682.283 }, { "epoch": 0.09796660382440076, "grad_norm": 0.875023853319168, "learning_rate": 9.940995835126957e-06, "loss": 0.4510367393493652, "num_input_tokens_seen": 63598704, "step": 1455, "train_runtime": 11190.4484, "train_tokens_per_second": 5683.303 }, { "epoch": 0.0983032588203609, "grad_norm": 0.7795257917882069, "learning_rate": 9.940590138499508e-06, "loss": 0.4070897102355957, "num_input_tokens_seen": 63824984, "step": 1460, "train_runtime": 11228.0323, "train_tokens_per_second": 5684.432 }, { "epoch": 0.09863991381632103, "grad_norm": 0.9802634486624268, "learning_rate": 9.940183060251783e-06, "loss": 0.424533748626709, "num_input_tokens_seen": 64020440, "step": 1465, "train_runtime": 11269.0538, "train_tokens_per_second": 5681.084 }, { "epoch": 0.09897656881228117, "grad_norm": 0.8129225031494536, "learning_rate": 9.939774600497616e-06, "loss": 0.3772727489471436, "num_input_tokens_seen": 64237912, "step": 1470, "train_runtime": 11305.1846, "train_tokens_per_second": 5682.164 }, { "epoch": 0.09931322380824131, "grad_norm": 0.876095085095231, "learning_rate": 9.939364759351236e-06, "loss": 0.43614888191223145, "num_input_tokens_seen": 64452808, "step": 1475, "train_runtime": 11342.3271, "train_tokens_per_second": 5682.503 }, { "epoch": 0.09964987880420145, "grad_norm": 0.8249502349163025, "learning_rate": 9.938953536927249e-06, "loss": 0.4052250862121582, "num_input_tokens_seen": 64679536, "step": 1480, "train_runtime": 11380.8832, "train_tokens_per_second": 5683.174 }, { "epoch": 0.09998653380016159, "grad_norm": 0.8004037055954487, "learning_rate": 9.938540933340657e-06, "loss": 0.43981304168701174, "num_input_tokens_seen": 64907672, "step": 1485, "train_runtime": 11414.3496, "train_tokens_per_second": 5686.498 }, { "epoch": 0.10032318879612173, "grad_norm": 0.7556539983829699, "learning_rate": 9.938126948706839e-06, "loss": 0.4235081195831299, "num_input_tokens_seen": 65134656, "step": 1490, "train_runtime": 11451.1493, "train_tokens_per_second": 5688.045 }, { "epoch": 0.10065984379208187, "grad_norm": 0.7974202081471553, "learning_rate": 9.937711583141567e-06, "loss": 0.41340045928955077, "num_input_tokens_seen": 65353344, "step": 1495, "train_runtime": 11488.8753, "train_tokens_per_second": 5688.402 }, { "epoch": 0.10099649878804201, "grad_norm": 0.9113055103223531, "learning_rate": 9.937294836760995e-06, "loss": 0.43211612701416013, "num_input_tokens_seen": 65570904, "step": 1500, "train_runtime": 11525.754, "train_tokens_per_second": 5689.077 }, { "epoch": 0.10133315378400215, "grad_norm": 0.9362482868425025, "learning_rate": 9.936876709681668e-06, "loss": 0.4765140533447266, "num_input_tokens_seen": 65784200, "step": 1505, "train_runtime": 11567.0824, "train_tokens_per_second": 5687.19 }, { "epoch": 0.10166980877996229, "grad_norm": 0.7345279591609306, "learning_rate": 9.93645720202051e-06, "loss": 0.3693789005279541, "num_input_tokens_seen": 66002240, "step": 1510, "train_runtime": 11603.3588, "train_tokens_per_second": 5688.201 }, { "epoch": 0.10200646377592243, "grad_norm": 0.8440448421494396, "learning_rate": 9.936036313894836e-06, "loss": 0.46529722213745117, "num_input_tokens_seen": 66217160, "step": 1515, "train_runtime": 11637.8846, "train_tokens_per_second": 5689.793 }, { "epoch": 0.10234311877188257, "grad_norm": 0.9288537021329782, "learning_rate": 9.935614045422349e-06, "loss": 0.4474299907684326, "num_input_tokens_seen": 66437216, "step": 1520, "train_runtime": 11674.3858, "train_tokens_per_second": 5690.853 }, { "epoch": 0.10267977376784271, "grad_norm": 0.7816250239377797, "learning_rate": 9.935190396721132e-06, "loss": 0.4093039035797119, "num_input_tokens_seen": 66659632, "step": 1525, "train_runtime": 11714.7321, "train_tokens_per_second": 5690.24 }, { "epoch": 0.10301642876380286, "grad_norm": 0.868350723790852, "learning_rate": 9.934765367909658e-06, "loss": 0.442030143737793, "num_input_tokens_seen": 66874200, "step": 1530, "train_runtime": 11751.0775, "train_tokens_per_second": 5690.899 }, { "epoch": 0.103353083759763, "grad_norm": 0.9654553160320544, "learning_rate": 9.934338959106783e-06, "loss": 0.4125958442687988, "num_input_tokens_seen": 67096584, "step": 1535, "train_runtime": 11787.6988, "train_tokens_per_second": 5692.085 }, { "epoch": 0.10368973875572314, "grad_norm": 1.0001250180683936, "learning_rate": 9.933911170431753e-06, "loss": 0.45245895385742185, "num_input_tokens_seen": 67300344, "step": 1540, "train_runtime": 11825.444, "train_tokens_per_second": 5691.147 }, { "epoch": 0.10402639375168328, "grad_norm": 0.9480950052674862, "learning_rate": 9.933482002004198e-06, "loss": 0.4369757652282715, "num_input_tokens_seen": 67528208, "step": 1545, "train_runtime": 11868.3124, "train_tokens_per_second": 5689.79 }, { "epoch": 0.10436304874764342, "grad_norm": 1.049191818835591, "learning_rate": 9.933051453944134e-06, "loss": 0.47658519744873046, "num_input_tokens_seen": 67752368, "step": 1550, "train_runtime": 11899.3433, "train_tokens_per_second": 5693.791 }, { "epoch": 0.10469970374360356, "grad_norm": 0.8519840991796084, "learning_rate": 9.932619526371958e-06, "loss": 0.4100327014923096, "num_input_tokens_seen": 67972272, "step": 1555, "train_runtime": 11933.0537, "train_tokens_per_second": 5696.134 }, { "epoch": 0.1050363587395637, "grad_norm": 0.8587262694316211, "learning_rate": 9.932186219408463e-06, "loss": 0.40094866752624514, "num_input_tokens_seen": 68182312, "step": 1560, "train_runtime": 11973.5123, "train_tokens_per_second": 5694.429 }, { "epoch": 0.10537301373552384, "grad_norm": 0.9397299864907294, "learning_rate": 9.931751533174819e-06, "loss": 0.44454145431518555, "num_input_tokens_seen": 68389480, "step": 1565, "train_runtime": 12014.0801, "train_tokens_per_second": 5692.444 }, { "epoch": 0.10570966873148398, "grad_norm": 0.9745376383539546, "learning_rate": 9.931315467792584e-06, "loss": 0.45273237228393554, "num_input_tokens_seen": 68625472, "step": 1570, "train_runtime": 12045.9213, "train_tokens_per_second": 5696.988 }, { "epoch": 0.10604632372744412, "grad_norm": 0.796989168878711, "learning_rate": 9.930878023383705e-06, "loss": 0.4475082874298096, "num_input_tokens_seen": 68842256, "step": 1575, "train_runtime": 12081.8379, "train_tokens_per_second": 5697.995 }, { "epoch": 0.10638297872340426, "grad_norm": 0.7777899346165759, "learning_rate": 9.93043920007051e-06, "loss": 0.39358346462249755, "num_input_tokens_seen": 69063336, "step": 1580, "train_runtime": 12120.9279, "train_tokens_per_second": 5697.859 }, { "epoch": 0.1067196337193644, "grad_norm": 0.856296656865995, "learning_rate": 9.929998997975712e-06, "loss": 0.40912957191467286, "num_input_tokens_seen": 69297392, "step": 1585, "train_runtime": 12157.5274, "train_tokens_per_second": 5699.958 }, { "epoch": 0.10705628871532454, "grad_norm": 0.8406798760366443, "learning_rate": 9.929557417222417e-06, "loss": 0.4154947280883789, "num_input_tokens_seen": 69502272, "step": 1590, "train_runtime": 12195.0467, "train_tokens_per_second": 5699.221 }, { "epoch": 0.10739294371128467, "grad_norm": 0.8506547801105618, "learning_rate": 9.929114457934109e-06, "loss": 0.433414888381958, "num_input_tokens_seen": 69718712, "step": 1595, "train_runtime": 12235.8524, "train_tokens_per_second": 5697.904 }, { "epoch": 0.10772959870724481, "grad_norm": 0.8306444786085215, "learning_rate": 9.92867012023466e-06, "loss": 0.429976749420166, "num_input_tokens_seen": 69942920, "step": 1600, "train_runtime": 12275.1053, "train_tokens_per_second": 5697.949 }, { "epoch": 0.10806625370320495, "grad_norm": 0.8083632874129185, "learning_rate": 9.92822440424833e-06, "loss": 0.465771484375, "num_input_tokens_seen": 70167408, "step": 1605, "train_runtime": 12311.856, "train_tokens_per_second": 5699.174 }, { "epoch": 0.1084029086991651, "grad_norm": 0.8623025104703945, "learning_rate": 9.927777310099759e-06, "loss": 0.4795114040374756, "num_input_tokens_seen": 70398096, "step": 1610, "train_runtime": 12355.4012, "train_tokens_per_second": 5697.759 }, { "epoch": 0.10873956369512523, "grad_norm": 0.8734280942811361, "learning_rate": 9.927328837913976e-06, "loss": 0.42298336029052735, "num_input_tokens_seen": 70621368, "step": 1615, "train_runtime": 12392.0717, "train_tokens_per_second": 5698.915 }, { "epoch": 0.10907621869108537, "grad_norm": 0.8755533500883431, "learning_rate": 9.926878987816397e-06, "loss": 0.4128897666931152, "num_input_tokens_seen": 70850496, "step": 1620, "train_runtime": 12432.0003, "train_tokens_per_second": 5699.042 }, { "epoch": 0.10941287368704551, "grad_norm": 0.7849562344468639, "learning_rate": 9.92642775993282e-06, "loss": 0.40384368896484374, "num_input_tokens_seen": 71078912, "step": 1625, "train_runtime": 12472.6839, "train_tokens_per_second": 5698.766 }, { "epoch": 0.10974952868300565, "grad_norm": 0.8314524460612794, "learning_rate": 9.925975154389428e-06, "loss": 0.39646482467651367, "num_input_tokens_seen": 71291944, "step": 1630, "train_runtime": 12512.7857, "train_tokens_per_second": 5697.528 }, { "epoch": 0.11008618367896579, "grad_norm": 0.8397438217714046, "learning_rate": 9.925521171312792e-06, "loss": 0.41344375610351564, "num_input_tokens_seen": 71513056, "step": 1635, "train_runtime": 12552.1031, "train_tokens_per_second": 5697.297 }, { "epoch": 0.11042283867492593, "grad_norm": 0.8717786503893655, "learning_rate": 9.925065810829868e-06, "loss": 0.43964757919311526, "num_input_tokens_seen": 71712776, "step": 1640, "train_runtime": 12592.8232, "train_tokens_per_second": 5694.734 }, { "epoch": 0.11075949367088607, "grad_norm": 0.8466265387114118, "learning_rate": 9.924609073067994e-06, "loss": 0.45009913444519045, "num_input_tokens_seen": 71918888, "step": 1645, "train_runtime": 12637.095, "train_tokens_per_second": 5691.093 }, { "epoch": 0.11109614866684622, "grad_norm": 0.8202088060176734, "learning_rate": 9.924150958154897e-06, "loss": 0.43289871215820314, "num_input_tokens_seen": 72144880, "step": 1650, "train_runtime": 12679.4137, "train_tokens_per_second": 5689.922 }, { "epoch": 0.11143280366280636, "grad_norm": 0.8241473767552461, "learning_rate": 9.923691466218686e-06, "loss": 0.4033914566040039, "num_input_tokens_seen": 72368424, "step": 1655, "train_runtime": 12722.761, "train_tokens_per_second": 5688.107 }, { "epoch": 0.1117694586587665, "grad_norm": 0.9179601239629808, "learning_rate": 9.923230597387856e-06, "loss": 0.4340330123901367, "num_input_tokens_seen": 72604440, "step": 1660, "train_runtime": 12760.3543, "train_tokens_per_second": 5689.845 }, { "epoch": 0.11210611365472664, "grad_norm": 0.9667829858136964, "learning_rate": 9.922768351791289e-06, "loss": 0.45328373908996583, "num_input_tokens_seen": 72822440, "step": 1665, "train_runtime": 12804.6293, "train_tokens_per_second": 5687.196 }, { "epoch": 0.11244276865068678, "grad_norm": 0.9239911563296863, "learning_rate": 9.92230472955825e-06, "loss": 0.41826558113098145, "num_input_tokens_seen": 73042800, "step": 1670, "train_runtime": 12838.5402, "train_tokens_per_second": 5689.338 }, { "epoch": 0.11277942364664692, "grad_norm": 0.8636254640310012, "learning_rate": 9.92183973081839e-06, "loss": 0.3946269750595093, "num_input_tokens_seen": 73268056, "step": 1675, "train_runtime": 12882.6482, "train_tokens_per_second": 5687.344 }, { "epoch": 0.11311607864260706, "grad_norm": 0.7861261803530913, "learning_rate": 9.921373355701743e-06, "loss": 0.46369400024414065, "num_input_tokens_seen": 73499832, "step": 1680, "train_runtime": 12924.32, "train_tokens_per_second": 5686.94 }, { "epoch": 0.1134527336385672, "grad_norm": 0.8384955151965564, "learning_rate": 9.920905604338732e-06, "loss": 0.45543785095214845, "num_input_tokens_seen": 73720264, "step": 1685, "train_runtime": 12963.3961, "train_tokens_per_second": 5686.802 }, { "epoch": 0.11378938863452734, "grad_norm": 1.0833650625320947, "learning_rate": 9.920436476860158e-06, "loss": 0.38962454795837403, "num_input_tokens_seen": 73931824, "step": 1690, "train_runtime": 13004.1451, "train_tokens_per_second": 5685.251 }, { "epoch": 0.11412604363048748, "grad_norm": 0.8250025055357804, "learning_rate": 9.919965973397214e-06, "loss": 0.40491409301757814, "num_input_tokens_seen": 74150736, "step": 1695, "train_runtime": 13037.0352, "train_tokens_per_second": 5687.699 }, { "epoch": 0.11446269862644762, "grad_norm": 0.841239081826391, "learning_rate": 9.919494094081475e-06, "loss": 0.45804147720336913, "num_input_tokens_seen": 74352136, "step": 1700, "train_runtime": 13073.6778, "train_tokens_per_second": 5687.163 }, { "epoch": 0.11479935362240776, "grad_norm": 0.9629476764947537, "learning_rate": 9.919020839044899e-06, "loss": 0.4247718334197998, "num_input_tokens_seen": 74588328, "step": 1705, "train_runtime": 13108.3031, "train_tokens_per_second": 5690.159 }, { "epoch": 0.1151360086183679, "grad_norm": 0.8166202703347624, "learning_rate": 9.918546208419832e-06, "loss": 0.4040073394775391, "num_input_tokens_seen": 74810232, "step": 1710, "train_runtime": 13152.6429, "train_tokens_per_second": 5687.848 }, { "epoch": 0.11547266361432804, "grad_norm": 0.9143911353222378, "learning_rate": 9.918070202339e-06, "loss": 0.41643967628479006, "num_input_tokens_seen": 75038248, "step": 1715, "train_runtime": 13188.009, "train_tokens_per_second": 5689.885 }, { "epoch": 0.11580931861028818, "grad_norm": 0.854163675009985, "learning_rate": 9.91759282093552e-06, "loss": 0.4160469532012939, "num_input_tokens_seen": 75259984, "step": 1720, "train_runtime": 13221.5917, "train_tokens_per_second": 5692.203 }, { "epoch": 0.11614597360624832, "grad_norm": 0.9111231961657891, "learning_rate": 9.917114064342888e-06, "loss": 0.38855648040771484, "num_input_tokens_seen": 75468520, "step": 1725, "train_runtime": 13264.901, "train_tokens_per_second": 5689.339 }, { "epoch": 0.11648262860220845, "grad_norm": 0.8667773958295081, "learning_rate": 9.916633932694988e-06, "loss": 0.3962873458862305, "num_input_tokens_seen": 75690392, "step": 1730, "train_runtime": 13301.6754, "train_tokens_per_second": 5690.29 }, { "epoch": 0.1168192835981686, "grad_norm": 0.8572351568987933, "learning_rate": 9.916152426126086e-06, "loss": 0.3940844774246216, "num_input_tokens_seen": 75908632, "step": 1735, "train_runtime": 13340.3356, "train_tokens_per_second": 5690.159 }, { "epoch": 0.11715593859412873, "grad_norm": 0.8920380227031728, "learning_rate": 9.915669544770837e-06, "loss": 0.41963586807250974, "num_input_tokens_seen": 76143760, "step": 1740, "train_runtime": 13373.7492, "train_tokens_per_second": 5693.524 }, { "epoch": 0.11749259359008887, "grad_norm": 0.8151573693579499, "learning_rate": 9.915185288764272e-06, "loss": 0.4006998062133789, "num_input_tokens_seen": 76381464, "step": 1745, "train_runtime": 13411.6709, "train_tokens_per_second": 5695.149 }, { "epoch": 0.11782924858604901, "grad_norm": 0.7823689731999574, "learning_rate": 9.914699658241815e-06, "loss": 0.39071149826049806, "num_input_tokens_seen": 76607736, "step": 1750, "train_runtime": 13455.8214, "train_tokens_per_second": 5693.278 }, { "epoch": 0.11816590358200915, "grad_norm": 0.9650032542802038, "learning_rate": 9.91421265333927e-06, "loss": 0.44945535659790037, "num_input_tokens_seen": 76836152, "step": 1755, "train_runtime": 13495.7655, "train_tokens_per_second": 5693.353 }, { "epoch": 0.11850255857796929, "grad_norm": 0.8293434376681832, "learning_rate": 9.913724274192829e-06, "loss": 0.4147852897644043, "num_input_tokens_seen": 77069784, "step": 1760, "train_runtime": 13537.8959, "train_tokens_per_second": 5692.892 }, { "epoch": 0.11883921357392943, "grad_norm": 0.9258862128909312, "learning_rate": 9.91323452093906e-06, "loss": 0.41230435371398927, "num_input_tokens_seen": 77288624, "step": 1765, "train_runtime": 13574.917, "train_tokens_per_second": 5693.488 }, { "epoch": 0.11917586856988957, "grad_norm": 0.848930776896082, "learning_rate": 9.912743393714927e-06, "loss": 0.3945260286331177, "num_input_tokens_seen": 77519384, "step": 1770, "train_runtime": 13605.814, "train_tokens_per_second": 5697.519 }, { "epoch": 0.11951252356584972, "grad_norm": 0.8278888004348279, "learning_rate": 9.912250892657769e-06, "loss": 0.40961732864379885, "num_input_tokens_seen": 77735336, "step": 1775, "train_runtime": 13644.1096, "train_tokens_per_second": 5697.355 }, { "epoch": 0.11984917856180986, "grad_norm": 0.9501953857186206, "learning_rate": 9.911757017905312e-06, "loss": 0.41979494094848635, "num_input_tokens_seen": 77943944, "step": 1780, "train_runtime": 13675.7254, "train_tokens_per_second": 5699.438 }, { "epoch": 0.12018583355777, "grad_norm": 0.8175400797161728, "learning_rate": 9.911261769595668e-06, "loss": 0.4165688991546631, "num_input_tokens_seen": 78176688, "step": 1785, "train_runtime": 13720.1102, "train_tokens_per_second": 5697.964 }, { "epoch": 0.12052248855373014, "grad_norm": 0.9695481492778111, "learning_rate": 9.910765147867332e-06, "loss": 0.4288275718688965, "num_input_tokens_seen": 78398920, "step": 1790, "train_runtime": 13754.606, "train_tokens_per_second": 5699.83 }, { "epoch": 0.12085914354969028, "grad_norm": 0.9043853969674001, "learning_rate": 9.91026715285918e-06, "loss": 0.42678542137145997, "num_input_tokens_seen": 78617400, "step": 1795, "train_runtime": 13795.7712, "train_tokens_per_second": 5698.659 }, { "epoch": 0.12119579854565042, "grad_norm": 0.9643745725188065, "learning_rate": 9.909767784710476e-06, "loss": 0.4547886371612549, "num_input_tokens_seen": 78858720, "step": 1800, "train_runtime": 13832.1459, "train_tokens_per_second": 5701.12 }, { "epoch": 0.12153245354161056, "grad_norm": 0.8832616111060988, "learning_rate": 9.909267043560868e-06, "loss": 0.4295345783233643, "num_input_tokens_seen": 79081264, "step": 1805, "train_runtime": 13867.5931, "train_tokens_per_second": 5702.595 }, { "epoch": 0.1218691085375707, "grad_norm": 0.8001666467072275, "learning_rate": 9.908764929550388e-06, "loss": 0.4215728759765625, "num_input_tokens_seen": 79301792, "step": 1810, "train_runtime": 13907.1584, "train_tokens_per_second": 5702.228 }, { "epoch": 0.12220576353353084, "grad_norm": 0.9182690866647383, "learning_rate": 9.908261442819444e-06, "loss": 0.4215451717376709, "num_input_tokens_seen": 79503840, "step": 1815, "train_runtime": 13955.1411, "train_tokens_per_second": 5697.1 }, { "epoch": 0.12254241852949098, "grad_norm": 0.7856797264096972, "learning_rate": 9.907756583508842e-06, "loss": 0.3922400951385498, "num_input_tokens_seen": 79740056, "step": 1820, "train_runtime": 13995.629, "train_tokens_per_second": 5697.497 }, { "epoch": 0.12287907352545112, "grad_norm": 0.791802883681199, "learning_rate": 9.907250351759761e-06, "loss": 0.40973472595214844, "num_input_tokens_seen": 79961848, "step": 1825, "train_runtime": 14035.6538, "train_tokens_per_second": 5697.052 }, { "epoch": 0.12321572852141126, "grad_norm": 1.0344260725436623, "learning_rate": 9.906742747713766e-06, "loss": 0.4293796539306641, "num_input_tokens_seen": 80180448, "step": 1830, "train_runtime": 14071.4195, "train_tokens_per_second": 5698.107 }, { "epoch": 0.1235523835173714, "grad_norm": 1.0115683734845813, "learning_rate": 9.906233771512808e-06, "loss": 0.4379068374633789, "num_input_tokens_seen": 80391288, "step": 1835, "train_runtime": 14108.8045, "train_tokens_per_second": 5697.952 }, { "epoch": 0.12388903851333154, "grad_norm": 0.9113985281993394, "learning_rate": 9.905723423299222e-06, "loss": 0.44842100143432617, "num_input_tokens_seen": 80619704, "step": 1840, "train_runtime": 14148.1364, "train_tokens_per_second": 5698.256 }, { "epoch": 0.12422569350929168, "grad_norm": 0.8655689498703674, "learning_rate": 9.905211703215723e-06, "loss": 0.402877140045166, "num_input_tokens_seen": 80832568, "step": 1845, "train_runtime": 14183.917, "train_tokens_per_second": 5698.889 }, { "epoch": 0.12456234850525182, "grad_norm": 0.8753972943680609, "learning_rate": 9.904698611405412e-06, "loss": 0.4264510631561279, "num_input_tokens_seen": 81058296, "step": 1850, "train_runtime": 14223.3173, "train_tokens_per_second": 5698.973 }, { "epoch": 0.12489900350121196, "grad_norm": 0.7688694545812488, "learning_rate": 9.904184148011774e-06, "loss": 0.438901424407959, "num_input_tokens_seen": 81274840, "step": 1855, "train_runtime": 14263.055, "train_tokens_per_second": 5698.277 }, { "epoch": 0.1252356584971721, "grad_norm": 0.9233391292188109, "learning_rate": 9.903668313178681e-06, "loss": 0.44609222412109373, "num_input_tokens_seen": 81500576, "step": 1860, "train_runtime": 14299.671, "train_tokens_per_second": 5699.472 }, { "epoch": 0.12557231349313225, "grad_norm": 1.0943906900012805, "learning_rate": 9.903151107050377e-06, "loss": 0.396915864944458, "num_input_tokens_seen": 81707648, "step": 1865, "train_runtime": 14337.8178, "train_tokens_per_second": 5698.751 }, { "epoch": 0.1259089684890924, "grad_norm": 0.7168785500619042, "learning_rate": 9.902632529771502e-06, "loss": 0.42331228256225584, "num_input_tokens_seen": 81926600, "step": 1870, "train_runtime": 14376.4633, "train_tokens_per_second": 5698.662 }, { "epoch": 0.12624562348505253, "grad_norm": 1.0835704108533986, "learning_rate": 9.902112581487074e-06, "loss": 0.42675061225891114, "num_input_tokens_seen": 82148216, "step": 1875, "train_runtime": 14416.4946, "train_tokens_per_second": 5698.21 }, { "epoch": 0.12658227848101267, "grad_norm": 0.9867817197311566, "learning_rate": 9.901591262342494e-06, "loss": 0.4384635925292969, "num_input_tokens_seen": 82358848, "step": 1880, "train_runtime": 14459.8702, "train_tokens_per_second": 5695.684 }, { "epoch": 0.1269189334769728, "grad_norm": 0.9106268020914177, "learning_rate": 9.901068572483548e-06, "loss": 0.4060489654541016, "num_input_tokens_seen": 82576440, "step": 1885, "train_runtime": 14497.7161, "train_tokens_per_second": 5695.824 }, { "epoch": 0.12725558847293295, "grad_norm": 0.9009980190191491, "learning_rate": 9.900544512056402e-06, "loss": 0.47153472900390625, "num_input_tokens_seen": 82807688, "step": 1890, "train_runtime": 14534.4393, "train_tokens_per_second": 5697.343 }, { "epoch": 0.12759224346889309, "grad_norm": 0.8549638938689581, "learning_rate": 9.900019081207612e-06, "loss": 0.4209029197692871, "num_input_tokens_seen": 83038168, "step": 1895, "train_runtime": 14569.2093, "train_tokens_per_second": 5699.566 }, { "epoch": 0.12792889846485322, "grad_norm": 0.8968781974119465, "learning_rate": 9.89949228008411e-06, "loss": 0.42281227111816405, "num_input_tokens_seen": 83267720, "step": 1900, "train_runtime": 14606.2305, "train_tokens_per_second": 5700.836 }, { "epoch": 0.12826555346081336, "grad_norm": 0.8595709799025085, "learning_rate": 9.898964108833216e-06, "loss": 0.42650370597839354, "num_input_tokens_seen": 83492616, "step": 1905, "train_runtime": 14646.7617, "train_tokens_per_second": 5700.415 }, { "epoch": 0.1286022084567735, "grad_norm": 0.8815455063429253, "learning_rate": 9.898434567602629e-06, "loss": 0.4016720771789551, "num_input_tokens_seen": 83715840, "step": 1910, "train_runtime": 14686.2575, "train_tokens_per_second": 5700.284 }, { "epoch": 0.12893886345273364, "grad_norm": 0.9694766961124608, "learning_rate": 9.897903656540437e-06, "loss": 0.4289149284362793, "num_input_tokens_seen": 83934184, "step": 1915, "train_runtime": 14724.9891, "train_tokens_per_second": 5700.119 }, { "epoch": 0.12927551844869378, "grad_norm": 0.9823894967580632, "learning_rate": 9.897371375795103e-06, "loss": 0.43784418106079104, "num_input_tokens_seen": 84150312, "step": 1920, "train_runtime": 14759.5087, "train_tokens_per_second": 5701.43 }, { "epoch": 0.12961217344465392, "grad_norm": 0.8194539046535433, "learning_rate": 9.896837725515484e-06, "loss": 0.44328908920288085, "num_input_tokens_seen": 84361600, "step": 1925, "train_runtime": 14805.8899, "train_tokens_per_second": 5697.841 }, { "epoch": 0.12994882844061406, "grad_norm": 0.7081955649991436, "learning_rate": 9.89630270585081e-06, "loss": 0.39231128692626954, "num_input_tokens_seen": 84577168, "step": 1930, "train_runtime": 14842.2012, "train_tokens_per_second": 5698.425 }, { "epoch": 0.1302854834365742, "grad_norm": 0.8873554761311145, "learning_rate": 9.895766316950694e-06, "loss": 0.4394209384918213, "num_input_tokens_seen": 84796464, "step": 1935, "train_runtime": 14876.8277, "train_tokens_per_second": 5699.902 }, { "epoch": 0.13062213843253434, "grad_norm": 0.8262969710012915, "learning_rate": 9.89522855896514e-06, "loss": 0.41849603652954104, "num_input_tokens_seen": 85025304, "step": 1940, "train_runtime": 14919.7496, "train_tokens_per_second": 5698.843 }, { "epoch": 0.13095879342849448, "grad_norm": 0.9120986383703955, "learning_rate": 9.89468943204453e-06, "loss": 0.4164949893951416, "num_input_tokens_seen": 85239728, "step": 1945, "train_runtime": 14964.5159, "train_tokens_per_second": 5696.123 }, { "epoch": 0.13129544842445462, "grad_norm": 1.0478669869240167, "learning_rate": 9.89414893633963e-06, "loss": 0.41168971061706544, "num_input_tokens_seen": 85451488, "step": 1950, "train_runtime": 14998.4779, "train_tokens_per_second": 5697.344 }, { "epoch": 0.13163210342041476, "grad_norm": 0.8072074904847002, "learning_rate": 9.893607072001584e-06, "loss": 0.42524333000183107, "num_input_tokens_seen": 85681416, "step": 1955, "train_runtime": 15045.5899, "train_tokens_per_second": 5694.786 }, { "epoch": 0.1319687584163749, "grad_norm": 0.7884630260384243, "learning_rate": 9.893063839181925e-06, "loss": 0.41834263801574706, "num_input_tokens_seen": 85897864, "step": 1960, "train_runtime": 15086.3562, "train_tokens_per_second": 5693.745 }, { "epoch": 0.13230541341233504, "grad_norm": 0.8242479851716092, "learning_rate": 9.892519238032566e-06, "loss": 0.4272817611694336, "num_input_tokens_seen": 86126184, "step": 1965, "train_runtime": 15130.1067, "train_tokens_per_second": 5692.371 }, { "epoch": 0.13264206840829518, "grad_norm": 0.8883896038795247, "learning_rate": 9.891973268705804e-06, "loss": 0.45201525688171384, "num_input_tokens_seen": 86340160, "step": 1970, "train_runtime": 15166.855, "train_tokens_per_second": 5692.687 }, { "epoch": 0.13297872340425532, "grad_norm": 0.7899276150283895, "learning_rate": 9.891425931354316e-06, "loss": 0.4250628471374512, "num_input_tokens_seen": 86565168, "step": 1975, "train_runtime": 15203.4839, "train_tokens_per_second": 5693.772 }, { "epoch": 0.13331537840021546, "grad_norm": 0.8879719340880936, "learning_rate": 9.890877226131165e-06, "loss": 0.41506524085998536, "num_input_tokens_seen": 86796552, "step": 1980, "train_runtime": 15247.3097, "train_tokens_per_second": 5692.581 }, { "epoch": 0.1336520333961756, "grad_norm": 0.916769222493085, "learning_rate": 9.890327153189793e-06, "loss": 0.4300036907196045, "num_input_tokens_seen": 87016968, "step": 1985, "train_runtime": 15292.8026, "train_tokens_per_second": 5690.06 }, { "epoch": 0.13398868839213574, "grad_norm": 0.9050174324296295, "learning_rate": 9.889775712684026e-06, "loss": 0.4278897285461426, "num_input_tokens_seen": 87240744, "step": 1990, "train_runtime": 15335.4097, "train_tokens_per_second": 5688.843 }, { "epoch": 0.13432534338809587, "grad_norm": 0.8780717724520911, "learning_rate": 9.889222904768074e-06, "loss": 0.42691898345947266, "num_input_tokens_seen": 87458888, "step": 1995, "train_runtime": 15375.168, "train_tokens_per_second": 5688.321 }, { "epoch": 0.13466199838405601, "grad_norm": 0.8749943321506966, "learning_rate": 9.888668729596528e-06, "loss": 0.41673784255981444, "num_input_tokens_seen": 87661224, "step": 2000, "train_runtime": 15417.6729, "train_tokens_per_second": 5685.762 }, { "epoch": 0.13499865338001615, "grad_norm": 0.9429761954235121, "learning_rate": 9.88811318732436e-06, "loss": 0.4196599006652832, "num_input_tokens_seen": 87871224, "step": 2005, "train_runtime": 15454.7159, "train_tokens_per_second": 5685.722 }, { "epoch": 0.1353353083759763, "grad_norm": 0.8303836661224822, "learning_rate": 9.887556278106927e-06, "loss": 0.43319454193115237, "num_input_tokens_seen": 88101424, "step": 2010, "train_runtime": 15492.7733, "train_tokens_per_second": 5686.614 }, { "epoch": 0.13567196337193643, "grad_norm": 1.2988017888943026, "learning_rate": 9.886998002099964e-06, "loss": 0.42733011245727537, "num_input_tokens_seen": 88331320, "step": 2015, "train_runtime": 15533.3637, "train_tokens_per_second": 5686.555 }, { "epoch": 0.13600861836789657, "grad_norm": 0.926333904941965, "learning_rate": 9.886438359459595e-06, "loss": 0.4501063346862793, "num_input_tokens_seen": 88546592, "step": 2020, "train_runtime": 15572.5905, "train_tokens_per_second": 5686.054 }, { "epoch": 0.1363452733638567, "grad_norm": 0.8812830943715737, "learning_rate": 9.885877350342319e-06, "loss": 0.3861879587173462, "num_input_tokens_seen": 88774480, "step": 2025, "train_runtime": 15611.197, "train_tokens_per_second": 5686.59 }, { "epoch": 0.13668192835981685, "grad_norm": 0.8007094863514034, "learning_rate": 9.885314974905024e-06, "loss": 0.3875585556030273, "num_input_tokens_seen": 89011576, "step": 2030, "train_runtime": 15652.3238, "train_tokens_per_second": 5686.796 }, { "epoch": 0.137018583355777, "grad_norm": 0.9125014304117678, "learning_rate": 9.884751233304973e-06, "loss": 0.39730267524719237, "num_input_tokens_seen": 89217520, "step": 2035, "train_runtime": 15686.075, "train_tokens_per_second": 5687.689 }, { "epoch": 0.13735523835173713, "grad_norm": 0.8474671445937998, "learning_rate": 9.884186125699816e-06, "loss": 0.42992243766784666, "num_input_tokens_seen": 89431816, "step": 2040, "train_runtime": 15726.6605, "train_tokens_per_second": 5686.637 }, { "epoch": 0.13769189334769727, "grad_norm": 0.9102001150203423, "learning_rate": 9.883619652247584e-06, "loss": 0.4123133659362793, "num_input_tokens_seen": 89651968, "step": 2045, "train_runtime": 15768.4222, "train_tokens_per_second": 5685.538 }, { "epoch": 0.1380285483436574, "grad_norm": 0.6804193522827889, "learning_rate": 9.883051813106687e-06, "loss": 0.3782381296157837, "num_input_tokens_seen": 89874624, "step": 2050, "train_runtime": 15813.3958, "train_tokens_per_second": 5683.449 }, { "epoch": 0.13836520333961755, "grad_norm": 0.8989541162037309, "learning_rate": 9.882482608435924e-06, "loss": 0.43795013427734375, "num_input_tokens_seen": 90097216, "step": 2055, "train_runtime": 15851.8211, "train_tokens_per_second": 5683.714 }, { "epoch": 0.1387018583355777, "grad_norm": 0.8434117541493056, "learning_rate": 9.881912038394468e-06, "loss": 0.42223529815673827, "num_input_tokens_seen": 90317784, "step": 2060, "train_runtime": 15897.2071, "train_tokens_per_second": 5681.362 }, { "epoch": 0.13903851333153783, "grad_norm": 0.7960282493279416, "learning_rate": 9.881340103141878e-06, "loss": 0.4242293357849121, "num_input_tokens_seen": 90546968, "step": 2065, "train_runtime": 15940.8703, "train_tokens_per_second": 5680.177 }, { "epoch": 0.13937516832749797, "grad_norm": 0.8413026941754382, "learning_rate": 9.880766802838092e-06, "loss": 0.4057013511657715, "num_input_tokens_seen": 90762816, "step": 2070, "train_runtime": 15983.7133, "train_tokens_per_second": 5678.456 }, { "epoch": 0.1397118233234581, "grad_norm": 0.7350898878720474, "learning_rate": 9.880192137643434e-06, "loss": 0.4075471878051758, "num_input_tokens_seen": 90979408, "step": 2075, "train_runtime": 16017.6972, "train_tokens_per_second": 5679.931 }, { "epoch": 0.14004847831941827, "grad_norm": 0.9141607370838677, "learning_rate": 9.879616107718608e-06, "loss": 0.4198787689208984, "num_input_tokens_seen": 91197560, "step": 2080, "train_runtime": 16051.0779, "train_tokens_per_second": 5681.709 }, { "epoch": 0.1403851333153784, "grad_norm": 0.7897438400002121, "learning_rate": 9.879038713224695e-06, "loss": 0.4208370685577393, "num_input_tokens_seen": 91421872, "step": 2085, "train_runtime": 16093.9488, "train_tokens_per_second": 5680.512 }, { "epoch": 0.14072178831133855, "grad_norm": 0.8205504842451986, "learning_rate": 9.878459954323165e-06, "loss": 0.4030628204345703, "num_input_tokens_seen": 91647112, "step": 2090, "train_runtime": 16126.4411, "train_tokens_per_second": 5683.034 }, { "epoch": 0.1410584433072987, "grad_norm": 0.8325253458879384, "learning_rate": 9.877879831175865e-06, "loss": 0.39506003856658933, "num_input_tokens_seen": 91871896, "step": 2095, "train_runtime": 16160.6707, "train_tokens_per_second": 5684.906 }, { "epoch": 0.14139509830325883, "grad_norm": 0.821317865316409, "learning_rate": 9.877298343945025e-06, "loss": 0.41777982711791994, "num_input_tokens_seen": 92094456, "step": 2100, "train_runtime": 16203.3038, "train_tokens_per_second": 5683.684 }, { "epoch": 0.14173175329921897, "grad_norm": 0.7872012950426368, "learning_rate": 9.876715492793256e-06, "loss": 0.41480426788330077, "num_input_tokens_seen": 92315440, "step": 2105, "train_runtime": 16242.0831, "train_tokens_per_second": 5683.719 }, { "epoch": 0.1420684082951791, "grad_norm": 0.8092561101034788, "learning_rate": 9.87613127788355e-06, "loss": 0.389608097076416, "num_input_tokens_seen": 92527368, "step": 2110, "train_runtime": 16278.4874, "train_tokens_per_second": 5684.027 }, { "epoch": 0.14240506329113925, "grad_norm": 0.8850860821410723, "learning_rate": 9.87554569937928e-06, "loss": 0.4558421611785889, "num_input_tokens_seen": 92759672, "step": 2115, "train_runtime": 16314.9617, "train_tokens_per_second": 5685.559 }, { "epoch": 0.1427417182870994, "grad_norm": 0.8891822985539864, "learning_rate": 9.874958757444203e-06, "loss": 0.45552263259887693, "num_input_tokens_seen": 92995096, "step": 2120, "train_runtime": 16350.6171, "train_tokens_per_second": 5687.559 }, { "epoch": 0.14307837328305953, "grad_norm": 0.8780645983704002, "learning_rate": 9.874370452242454e-06, "loss": 0.43328495025634767, "num_input_tokens_seen": 93229944, "step": 2125, "train_runtime": 16384.0995, "train_tokens_per_second": 5690.27 }, { "epoch": 0.14341502827901967, "grad_norm": 0.9402959761478824, "learning_rate": 9.873780783938553e-06, "loss": 0.4462221622467041, "num_input_tokens_seen": 93450480, "step": 2130, "train_runtime": 16417.1629, "train_tokens_per_second": 5692.243 }, { "epoch": 0.1437516832749798, "grad_norm": 0.8574770635812221, "learning_rate": 9.873189752697396e-06, "loss": 0.3947939395904541, "num_input_tokens_seen": 93670472, "step": 2135, "train_runtime": 16459.3253, "train_tokens_per_second": 5691.027 }, { "epoch": 0.14408833827093995, "grad_norm": 0.8947319210921507, "learning_rate": 9.872597358684265e-06, "loss": 0.458558464050293, "num_input_tokens_seen": 93883544, "step": 2140, "train_runtime": 16489.5195, "train_tokens_per_second": 5693.528 }, { "epoch": 0.1444249932669001, "grad_norm": 0.8538177526814695, "learning_rate": 9.872003602064816e-06, "loss": 0.4299613475799561, "num_input_tokens_seen": 94116824, "step": 2145, "train_runtime": 16523.1274, "train_tokens_per_second": 5696.066 }, { "epoch": 0.14476164826286023, "grad_norm": 0.7471306795366713, "learning_rate": 9.8714084830051e-06, "loss": 0.4079564571380615, "num_input_tokens_seen": 94349480, "step": 2150, "train_runtime": 16564.7452, "train_tokens_per_second": 5695.8 }, { "epoch": 0.14509830325882037, "grad_norm": 0.8218664635099376, "learning_rate": 9.870812001671533e-06, "loss": 0.40776524543762205, "num_input_tokens_seen": 94577624, "step": 2155, "train_runtime": 16600.9249, "train_tokens_per_second": 5697.13 }, { "epoch": 0.1454349582547805, "grad_norm": 1.0737295934493194, "learning_rate": 9.870214158230922e-06, "loss": 0.4177376747131348, "num_input_tokens_seen": 94804128, "step": 2160, "train_runtime": 16635.1905, "train_tokens_per_second": 5699.011 }, { "epoch": 0.14577161325074064, "grad_norm": 0.786781014793927, "learning_rate": 9.869614952850454e-06, "loss": 0.40900435447692873, "num_input_tokens_seen": 95026192, "step": 2165, "train_runtime": 16669.2594, "train_tokens_per_second": 5700.685 }, { "epoch": 0.14610826824670078, "grad_norm": 0.8360055927785602, "learning_rate": 9.86901438569769e-06, "loss": 0.42821083068847654, "num_input_tokens_seen": 95254672, "step": 2170, "train_runtime": 16706.7948, "train_tokens_per_second": 5701.553 }, { "epoch": 0.14644492324266092, "grad_norm": 0.8933164074109287, "learning_rate": 9.86841245694058e-06, "loss": 0.425125789642334, "num_input_tokens_seen": 95450280, "step": 2175, "train_runtime": 16746.2086, "train_tokens_per_second": 5699.814 }, { "epoch": 0.14678157823862106, "grad_norm": 0.8906147805897214, "learning_rate": 9.86780916674745e-06, "loss": 0.45731253623962403, "num_input_tokens_seen": 95651304, "step": 2180, "train_runtime": 16783.8632, "train_tokens_per_second": 5699.004 }, { "epoch": 0.1471182332345812, "grad_norm": 1.0525327714019657, "learning_rate": 9.86720451528701e-06, "loss": 0.40560040473937986, "num_input_tokens_seen": 95859952, "step": 2185, "train_runtime": 16822.6242, "train_tokens_per_second": 5698.276 }, { "epoch": 0.14745488823054134, "grad_norm": 0.816498968853468, "learning_rate": 9.866598502728348e-06, "loss": 0.43126611709594725, "num_input_tokens_seen": 96069168, "step": 2190, "train_runtime": 16862.6901, "train_tokens_per_second": 5697.144 }, { "epoch": 0.14779154322650148, "grad_norm": 0.841739118951704, "learning_rate": 9.865991129240931e-06, "loss": 0.41145782470703124, "num_input_tokens_seen": 96283672, "step": 2195, "train_runtime": 16896.2709, "train_tokens_per_second": 5698.516 }, { "epoch": 0.14812819822246162, "grad_norm": 0.878868960575425, "learning_rate": 9.865382394994614e-06, "loss": 0.40999040603637693, "num_input_tokens_seen": 96502528, "step": 2200, "train_runtime": 16939.3291, "train_tokens_per_second": 5696.951 }, { "epoch": 0.14846485321842176, "grad_norm": 0.6967776248464405, "learning_rate": 9.864772300159622e-06, "loss": 0.3990957021713257, "num_input_tokens_seen": 96720064, "step": 2205, "train_runtime": 16973.4551, "train_tokens_per_second": 5698.313 }, { "epoch": 0.1488015082143819, "grad_norm": 0.9032740614218077, "learning_rate": 9.864160844906571e-06, "loss": 0.43683781623840334, "num_input_tokens_seen": 96941160, "step": 2210, "train_runtime": 17009.3974, "train_tokens_per_second": 5699.271 }, { "epoch": 0.14913816321034204, "grad_norm": 0.8444434220131386, "learning_rate": 9.863548029406449e-06, "loss": 0.419160795211792, "num_input_tokens_seen": 97161584, "step": 2215, "train_runtime": 17050.6002, "train_tokens_per_second": 5698.426 }, { "epoch": 0.14947481820630218, "grad_norm": 0.7872642768120427, "learning_rate": 9.86293385383063e-06, "loss": 0.3916934490203857, "num_input_tokens_seen": 97372312, "step": 2220, "train_runtime": 17095.7206, "train_tokens_per_second": 5695.713 }, { "epoch": 0.14981147320226232, "grad_norm": 0.9092720440628393, "learning_rate": 9.862318318350865e-06, "loss": 0.4371610641479492, "num_input_tokens_seen": 97594144, "step": 2225, "train_runtime": 17132.445, "train_tokens_per_second": 5696.452 }, { "epoch": 0.15014812819822246, "grad_norm": 0.7914448222714119, "learning_rate": 9.861701423139287e-06, "loss": 0.39911181926727296, "num_input_tokens_seen": 97820888, "step": 2230, "train_runtime": 17165.9269, "train_tokens_per_second": 5698.55 }, { "epoch": 0.1504847831941826, "grad_norm": 0.8316284130963478, "learning_rate": 9.861083168368411e-06, "loss": 0.41806850433349607, "num_input_tokens_seen": 98045776, "step": 2235, "train_runtime": 17204.7719, "train_tokens_per_second": 5698.755 }, { "epoch": 0.15082143819014274, "grad_norm": 0.9088287061584689, "learning_rate": 9.860463554211125e-06, "loss": 0.3891399383544922, "num_input_tokens_seen": 98268344, "step": 2240, "train_runtime": 17246.0796, "train_tokens_per_second": 5698.011 }, { "epoch": 0.15115809318610288, "grad_norm": 0.9381951784290052, "learning_rate": 9.859842580840706e-06, "loss": 0.4640520095825195, "num_input_tokens_seen": 98493000, "step": 2245, "train_runtime": 17289.4391, "train_tokens_per_second": 5696.715 }, { "epoch": 0.15149474818206302, "grad_norm": 0.7432535531903158, "learning_rate": 9.859220248430806e-06, "loss": 0.41865386962890627, "num_input_tokens_seen": 98731240, "step": 2250, "train_runtime": 17329.2789, "train_tokens_per_second": 5697.366 }, { "epoch": 0.15183140317802316, "grad_norm": 0.7752690728179633, "learning_rate": 9.85859655715546e-06, "loss": 0.39298291206359864, "num_input_tokens_seen": 98953224, "step": 2255, "train_runtime": 17375.0272, "train_tokens_per_second": 5695.141 }, { "epoch": 0.1521680581739833, "grad_norm": 0.8610212435397341, "learning_rate": 9.857971507189077e-06, "loss": 0.41016359329223634, "num_input_tokens_seen": 99171512, "step": 2260, "train_runtime": 17414.0463, "train_tokens_per_second": 5694.915 }, { "epoch": 0.15250471316994343, "grad_norm": 0.8902354817859172, "learning_rate": 9.857345098706455e-06, "loss": 0.4255502700805664, "num_input_tokens_seen": 99402080, "step": 2265, "train_runtime": 17451.574, "train_tokens_per_second": 5695.88 }, { "epoch": 0.15284136816590357, "grad_norm": 0.9086587862733272, "learning_rate": 9.856717331882765e-06, "loss": 0.4265317440032959, "num_input_tokens_seen": 99607944, "step": 2270, "train_runtime": 17486.7082, "train_tokens_per_second": 5696.209 }, { "epoch": 0.1531780231618637, "grad_norm": 0.9432280136780563, "learning_rate": 9.85608820689356e-06, "loss": 0.39440102577209474, "num_input_tokens_seen": 99830656, "step": 2275, "train_runtime": 17528.0918, "train_tokens_per_second": 5695.466 }, { "epoch": 0.15351467815782385, "grad_norm": 0.84487279707662, "learning_rate": 9.855457723914772e-06, "loss": 0.4084943771362305, "num_input_tokens_seen": 100050880, "step": 2280, "train_runtime": 17562.2543, "train_tokens_per_second": 5696.927 }, { "epoch": 0.153851333153784, "grad_norm": 0.9062843980819959, "learning_rate": 9.854825883122713e-06, "loss": 0.4020846366882324, "num_input_tokens_seen": 100260608, "step": 2285, "train_runtime": 17602.1432, "train_tokens_per_second": 5695.932 }, { "epoch": 0.15418798814974413, "grad_norm": 0.765345818981944, "learning_rate": 9.85419268469408e-06, "loss": 0.39870567321777345, "num_input_tokens_seen": 100466752, "step": 2290, "train_runtime": 17638.1952, "train_tokens_per_second": 5695.977 }, { "epoch": 0.15452464314570427, "grad_norm": 0.8051620604928534, "learning_rate": 9.85355812880594e-06, "loss": 0.3938899517059326, "num_input_tokens_seen": 100686544, "step": 2295, "train_runtime": 17677.5734, "train_tokens_per_second": 5695.722 }, { "epoch": 0.1548612981416644, "grad_norm": 0.7457579703786071, "learning_rate": 9.852922215635747e-06, "loss": 0.37209017276763917, "num_input_tokens_seen": 100908792, "step": 2300, "train_runtime": 17719.4452, "train_tokens_per_second": 5694.805 }, { "epoch": 0.15519795313762455, "grad_norm": 0.8179184151627187, "learning_rate": 9.85228494536133e-06, "loss": 0.4363281726837158, "num_input_tokens_seen": 101132472, "step": 2305, "train_runtime": 17753.0155, "train_tokens_per_second": 5696.636 }, { "epoch": 0.1555346081335847, "grad_norm": 0.8389619253246731, "learning_rate": 9.851646318160901e-06, "loss": 0.41831111907958984, "num_input_tokens_seen": 101349024, "step": 2310, "train_runtime": 17793.8083, "train_tokens_per_second": 5695.747 }, { "epoch": 0.15587126312954483, "grad_norm": 0.7507564820666337, "learning_rate": 9.85100633421305e-06, "loss": 0.39124910831451415, "num_input_tokens_seen": 101558936, "step": 2315, "train_runtime": 17835.905, "train_tokens_per_second": 5694.072 }, { "epoch": 0.15620791812550497, "grad_norm": 0.8895097039801884, "learning_rate": 9.850364993696749e-06, "loss": 0.42600722312927247, "num_input_tokens_seen": 101772184, "step": 2320, "train_runtime": 17875.446, "train_tokens_per_second": 5693.407 }, { "epoch": 0.15654457312146514, "grad_norm": 0.9520687878700897, "learning_rate": 9.849722296791339e-06, "loss": 0.4083821773529053, "num_input_tokens_seen": 101982520, "step": 2325, "train_runtime": 17909.3087, "train_tokens_per_second": 5694.386 }, { "epoch": 0.15688122811742528, "grad_norm": 0.9282345518369051, "learning_rate": 9.849078243676558e-06, "loss": 0.4323273658752441, "num_input_tokens_seen": 102196704, "step": 2330, "train_runtime": 17950.3047, "train_tokens_per_second": 5693.313 }, { "epoch": 0.15721788311338541, "grad_norm": 0.7571706215220008, "learning_rate": 9.848432834532506e-06, "loss": 0.3904409885406494, "num_input_tokens_seen": 102413872, "step": 2335, "train_runtime": 17990.1951, "train_tokens_per_second": 5692.76 }, { "epoch": 0.15755453810934555, "grad_norm": 0.7812435917007698, "learning_rate": 9.847786069539673e-06, "loss": 0.42157392501831054, "num_input_tokens_seen": 102636848, "step": 2340, "train_runtime": 18027.5652, "train_tokens_per_second": 5693.328 }, { "epoch": 0.1578911931053057, "grad_norm": 0.8268032160233915, "learning_rate": 9.847137948878926e-06, "loss": 0.4385071277618408, "num_input_tokens_seen": 102861544, "step": 2345, "train_runtime": 18065.377, "train_tokens_per_second": 5693.85 }, { "epoch": 0.15822784810126583, "grad_norm": 0.9872902684937591, "learning_rate": 9.846488472731505e-06, "loss": 0.46036734580993655, "num_input_tokens_seen": 103092600, "step": 2350, "train_runtime": 18100.6003, "train_tokens_per_second": 5695.535 }, { "epoch": 0.15856450309722597, "grad_norm": 0.8069383596278824, "learning_rate": 9.845837641279038e-06, "loss": 0.4151791572570801, "num_input_tokens_seen": 103323896, "step": 2355, "train_runtime": 18131.0861, "train_tokens_per_second": 5698.715 }, { "epoch": 0.1589011580931861, "grad_norm": 0.918784982161899, "learning_rate": 9.845185454703528e-06, "loss": 0.42508544921875, "num_input_tokens_seen": 103541848, "step": 2360, "train_runtime": 18171.0294, "train_tokens_per_second": 5698.183 }, { "epoch": 0.15923781308914625, "grad_norm": 0.817441107070197, "learning_rate": 9.844531913187356e-06, "loss": 0.3977517604827881, "num_input_tokens_seen": 103759048, "step": 2365, "train_runtime": 18209.2359, "train_tokens_per_second": 5698.155 }, { "epoch": 0.1595744680851064, "grad_norm": 0.8849599843025514, "learning_rate": 9.84387701691328e-06, "loss": 0.41399388313293456, "num_input_tokens_seen": 103958648, "step": 2370, "train_runtime": 18252.5289, "train_tokens_per_second": 5695.575 }, { "epoch": 0.15991112308106653, "grad_norm": 0.9775050084644975, "learning_rate": 9.843220766064443e-06, "loss": 0.4396827697753906, "num_input_tokens_seen": 104164280, "step": 2375, "train_runtime": 18287.1992, "train_tokens_per_second": 5696.022 }, { "epoch": 0.16024777807702667, "grad_norm": 1.026818097492493, "learning_rate": 9.842563160824364e-06, "loss": 0.4241004943847656, "num_input_tokens_seen": 104376504, "step": 2380, "train_runtime": 18322.4835, "train_tokens_per_second": 5696.635 }, { "epoch": 0.1605844330729868, "grad_norm": 0.8310388237023464, "learning_rate": 9.841904201376939e-06, "loss": 0.44525814056396484, "num_input_tokens_seen": 104607616, "step": 2385, "train_runtime": 18361.4521, "train_tokens_per_second": 5697.132 }, { "epoch": 0.16092108806894695, "grad_norm": 0.8107352807912601, "learning_rate": 9.841243887906443e-06, "loss": 0.3924037218093872, "num_input_tokens_seen": 104827648, "step": 2390, "train_runtime": 18397.6205, "train_tokens_per_second": 5697.892 }, { "epoch": 0.1612577430649071, "grad_norm": 0.8255737690801053, "learning_rate": 9.840582220597532e-06, "loss": 0.38776795864105223, "num_input_tokens_seen": 105048616, "step": 2395, "train_runtime": 18437.9099, "train_tokens_per_second": 5697.425 }, { "epoch": 0.16159439806086723, "grad_norm": 1.0393091287356393, "learning_rate": 9.839919199635238e-06, "loss": 0.44150123596191404, "num_input_tokens_seen": 105271480, "step": 2400, "train_runtime": 18481.0333, "train_tokens_per_second": 5696.19 }, { "epoch": 0.16193105305682737, "grad_norm": 1.778936138437422, "learning_rate": 9.839254825204973e-06, "loss": 0.4216805934906006, "num_input_tokens_seen": 105497528, "step": 2405, "train_runtime": 18522.7039, "train_tokens_per_second": 5695.579 }, { "epoch": 0.1622677080527875, "grad_norm": 0.8730955239731051, "learning_rate": 9.838589097492527e-06, "loss": 0.4195371627807617, "num_input_tokens_seen": 105713952, "step": 2410, "train_runtime": 18562.2885, "train_tokens_per_second": 5695.093 }, { "epoch": 0.16260436304874765, "grad_norm": 1.003318291974337, "learning_rate": 9.83792201668407e-06, "loss": 0.4166804313659668, "num_input_tokens_seen": 105940976, "step": 2415, "train_runtime": 18598.4307, "train_tokens_per_second": 5696.232 }, { "epoch": 0.16294101804470779, "grad_norm": 0.9882562378903975, "learning_rate": 9.837253582966146e-06, "loss": 0.4339381217956543, "num_input_tokens_seen": 106165352, "step": 2420, "train_runtime": 18633.1302, "train_tokens_per_second": 5697.666 }, { "epoch": 0.16327767304066793, "grad_norm": 0.8141828153275021, "learning_rate": 9.836583796525686e-06, "loss": 0.3936171531677246, "num_input_tokens_seen": 106364536, "step": 2425, "train_runtime": 18675.1796, "train_tokens_per_second": 5695.503 }, { "epoch": 0.16361432803662807, "grad_norm": 0.861811860528164, "learning_rate": 9.835912657549986e-06, "loss": 0.4514013290405273, "num_input_tokens_seen": 106587560, "step": 2430, "train_runtime": 18717.8406, "train_tokens_per_second": 5694.437 }, { "epoch": 0.1639509830325882, "grad_norm": 0.8811857541516364, "learning_rate": 9.835240166226734e-06, "loss": 0.39427995681762695, "num_input_tokens_seen": 106799528, "step": 2435, "train_runtime": 18761.1279, "train_tokens_per_second": 5692.596 }, { "epoch": 0.16428763802854834, "grad_norm": 0.8015505121470864, "learning_rate": 9.834566322743987e-06, "loss": 0.43557186126708985, "num_input_tokens_seen": 107012480, "step": 2440, "train_runtime": 18795.981, "train_tokens_per_second": 5693.37 }, { "epoch": 0.16462429302450848, "grad_norm": 0.8088311122015132, "learning_rate": 9.833891127290186e-06, "loss": 0.4289062976837158, "num_input_tokens_seen": 107250496, "step": 2445, "train_runtime": 18827.4248, "train_tokens_per_second": 5696.504 }, { "epoch": 0.16496094802046862, "grad_norm": 0.7483438381257065, "learning_rate": 9.833214580054145e-06, "loss": 0.3959768295288086, "num_input_tokens_seen": 107469136, "step": 2450, "train_runtime": 18863.1469, "train_tokens_per_second": 5697.307 }, { "epoch": 0.16529760301642876, "grad_norm": 0.8277673951140269, "learning_rate": 9.832536681225058e-06, "loss": 0.44450016021728517, "num_input_tokens_seen": 107691864, "step": 2455, "train_runtime": 18898.3354, "train_tokens_per_second": 5698.484 }, { "epoch": 0.1656342580123889, "grad_norm": 0.8054080794016197, "learning_rate": 9.831857430992497e-06, "loss": 0.3906950235366821, "num_input_tokens_seen": 107905928, "step": 2460, "train_runtime": 18933.5537, "train_tokens_per_second": 5699.19 }, { "epoch": 0.16597091300834904, "grad_norm": 0.8380957144167158, "learning_rate": 9.831176829546416e-06, "loss": 0.41658635139465333, "num_input_tokens_seen": 108126176, "step": 2465, "train_runtime": 18970.3816, "train_tokens_per_second": 5699.736 }, { "epoch": 0.16630756800430918, "grad_norm": 0.9452365824285418, "learning_rate": 9.830494877077137e-06, "loss": 0.46334171295166016, "num_input_tokens_seen": 108358872, "step": 2470, "train_runtime": 19004.9571, "train_tokens_per_second": 5701.611 }, { "epoch": 0.16664422300026932, "grad_norm": 1.1889597050506375, "learning_rate": 9.82981157377537e-06, "loss": 0.4094019889831543, "num_input_tokens_seen": 108572432, "step": 2475, "train_runtime": 19047.273, "train_tokens_per_second": 5700.156 }, { "epoch": 0.16698087799622946, "grad_norm": 0.8308872657286545, "learning_rate": 9.829126919832198e-06, "loss": 0.3822948455810547, "num_input_tokens_seen": 108789616, "step": 2480, "train_runtime": 19086.2476, "train_tokens_per_second": 5699.895 }, { "epoch": 0.1673175329921896, "grad_norm": 0.7290133116509023, "learning_rate": 9.82844091543908e-06, "loss": 0.4369968414306641, "num_input_tokens_seen": 109023616, "step": 2485, "train_runtime": 19125.718, "train_tokens_per_second": 5700.367 }, { "epoch": 0.16765418798814974, "grad_norm": 0.7990719470039959, "learning_rate": 9.82775356078786e-06, "loss": 0.4084890842437744, "num_input_tokens_seen": 109238536, "step": 2490, "train_runtime": 19167.2805, "train_tokens_per_second": 5699.219 }, { "epoch": 0.16799084298410988, "grad_norm": 0.7393931696314984, "learning_rate": 9.82706485607075e-06, "loss": 0.3479023456573486, "num_input_tokens_seen": 109448064, "step": 2495, "train_runtime": 19202.9034, "train_tokens_per_second": 5699.558 }, { "epoch": 0.16832749798007002, "grad_norm": 0.8223012662270877, "learning_rate": 9.826374801480346e-06, "loss": 0.4044170379638672, "num_input_tokens_seen": 109654600, "step": 2500, "train_runtime": 19240.4274, "train_tokens_per_second": 5699.177 }, { "epoch": 0.16866415297603016, "grad_norm": 0.7578035444329189, "learning_rate": 9.825683397209617e-06, "loss": 0.4128159999847412, "num_input_tokens_seen": 109844880, "step": 2505, "train_runtime": 19277.0081, "train_tokens_per_second": 5698.233 }, { "epoch": 0.1690008079719903, "grad_norm": 0.7754496384426975, "learning_rate": 9.824990643451915e-06, "loss": 0.40271682739257814, "num_input_tokens_seen": 110072368, "step": 2510, "train_runtime": 19317.0275, "train_tokens_per_second": 5698.204 }, { "epoch": 0.16933746296795044, "grad_norm": 0.7630225519369642, "learning_rate": 9.824296540400965e-06, "loss": 0.4032273769378662, "num_input_tokens_seen": 110306168, "step": 2515, "train_runtime": 19359.4719, "train_tokens_per_second": 5697.788 }, { "epoch": 0.16967411796391058, "grad_norm": 0.9445770110284926, "learning_rate": 9.823601088250872e-06, "loss": 0.43148112297058105, "num_input_tokens_seen": 110517392, "step": 2520, "train_runtime": 19399.6091, "train_tokens_per_second": 5696.888 }, { "epoch": 0.17001077295987072, "grad_norm": 0.8318843666554462, "learning_rate": 9.822904287196114e-06, "loss": 0.4280102729797363, "num_input_tokens_seen": 110729000, "step": 2525, "train_runtime": 19437.1917, "train_tokens_per_second": 5696.759 }, { "epoch": 0.17034742795583085, "grad_norm": 0.8164720266895754, "learning_rate": 9.822206137431553e-06, "loss": 0.4008312702178955, "num_input_tokens_seen": 110951576, "step": 2530, "train_runtime": 19473.1465, "train_tokens_per_second": 5697.671 }, { "epoch": 0.170684082951791, "grad_norm": 0.7906437056018215, "learning_rate": 9.821506639152421e-06, "loss": 0.42267236709594724, "num_input_tokens_seen": 111165912, "step": 2535, "train_runtime": 19511.9498, "train_tokens_per_second": 5697.325 }, { "epoch": 0.17102073794775113, "grad_norm": 0.8027232200064034, "learning_rate": 9.820805792554334e-06, "loss": 0.3978217124938965, "num_input_tokens_seen": 111390648, "step": 2540, "train_runtime": 19548.9277, "train_tokens_per_second": 5698.044 }, { "epoch": 0.17135739294371127, "grad_norm": 0.9732933783691021, "learning_rate": 9.820103597833278e-06, "loss": 0.40553808212280273, "num_input_tokens_seen": 111613680, "step": 2545, "train_runtime": 19588.8813, "train_tokens_per_second": 5697.808 }, { "epoch": 0.1716940479396714, "grad_norm": 0.82729851843596, "learning_rate": 9.819400055185622e-06, "loss": 0.3968106031417847, "num_input_tokens_seen": 111830672, "step": 2550, "train_runtime": 19624.1494, "train_tokens_per_second": 5698.625 }, { "epoch": 0.17203070293563155, "grad_norm": 0.8468905353541687, "learning_rate": 9.818695164808108e-06, "loss": 0.40885286331176757, "num_input_tokens_seen": 112047832, "step": 2555, "train_runtime": 19668.7374, "train_tokens_per_second": 5696.748 }, { "epoch": 0.1723673579315917, "grad_norm": 0.7939112227025558, "learning_rate": 9.817988926897856e-06, "loss": 0.39391307830810546, "num_input_tokens_seen": 112267160, "step": 2560, "train_runtime": 19710.9584, "train_tokens_per_second": 5695.672 }, { "epoch": 0.17270401292755186, "grad_norm": 0.8639441951747879, "learning_rate": 9.817281341652367e-06, "loss": 0.4082347869873047, "num_input_tokens_seen": 112491800, "step": 2565, "train_runtime": 19749.2522, "train_tokens_per_second": 5696.003 }, { "epoch": 0.173040667923512, "grad_norm": 0.716613288966692, "learning_rate": 9.816572409269508e-06, "loss": 0.3824393033981323, "num_input_tokens_seen": 112719560, "step": 2570, "train_runtime": 19784.3744, "train_tokens_per_second": 5697.403 }, { "epoch": 0.17337732291947214, "grad_norm": 0.7563163756690298, "learning_rate": 9.815862129947537e-06, "loss": 0.4002216339111328, "num_input_tokens_seen": 112940512, "step": 2575, "train_runtime": 19821.7603, "train_tokens_per_second": 5697.804 }, { "epoch": 0.17371397791543228, "grad_norm": 0.8087466973345561, "learning_rate": 9.815150503885078e-06, "loss": 0.37178959846496584, "num_input_tokens_seen": 113165624, "step": 2580, "train_runtime": 19858.1999, "train_tokens_per_second": 5698.685 }, { "epoch": 0.17405063291139242, "grad_norm": 0.8994912714777122, "learning_rate": 9.814437531281133e-06, "loss": 0.40114603042602537, "num_input_tokens_seen": 113386744, "step": 2585, "train_runtime": 19903.4827, "train_tokens_per_second": 5696.829 }, { "epoch": 0.17438728790735256, "grad_norm": 0.9269225867551159, "learning_rate": 9.813723212335085e-06, "loss": 0.43936843872070314, "num_input_tokens_seen": 113593688, "step": 2590, "train_runtime": 19940.3903, "train_tokens_per_second": 5696.663 }, { "epoch": 0.1747239429033127, "grad_norm": 0.8457918670255721, "learning_rate": 9.813007547246691e-06, "loss": 0.39149506092071534, "num_input_tokens_seen": 113810536, "step": 2595, "train_runtime": 19976.29, "train_tokens_per_second": 5697.281 }, { "epoch": 0.17506059789927284, "grad_norm": 0.8422559964504273, "learning_rate": 9.812290536216083e-06, "loss": 0.4519649982452393, "num_input_tokens_seen": 114012584, "step": 2600, "train_runtime": 20014.4208, "train_tokens_per_second": 5696.522 }, { "epoch": 0.17539725289523297, "grad_norm": 0.7614963966994434, "learning_rate": 9.811572179443773e-06, "loss": 0.3978102445602417, "num_input_tokens_seen": 114240040, "step": 2605, "train_runtime": 20049.8879, "train_tokens_per_second": 5697.789 }, { "epoch": 0.17573390789119311, "grad_norm": 0.7655048641611386, "learning_rate": 9.810852477130645e-06, "loss": 0.40557031631469725, "num_input_tokens_seen": 114449696, "step": 2610, "train_runtime": 20089.5257, "train_tokens_per_second": 5696.983 }, { "epoch": 0.17607056288715325, "grad_norm": 0.8093163549967093, "learning_rate": 9.810131429477964e-06, "loss": 0.38374016284942625, "num_input_tokens_seen": 114677776, "step": 2615, "train_runtime": 20121.5227, "train_tokens_per_second": 5699.259 }, { "epoch": 0.1764072178831134, "grad_norm": 0.8258310946925135, "learning_rate": 9.809409036687364e-06, "loss": 0.396789026260376, "num_input_tokens_seen": 114896336, "step": 2620, "train_runtime": 20158.9581, "train_tokens_per_second": 5699.518 }, { "epoch": 0.17674387287907353, "grad_norm": 0.7382001307664883, "learning_rate": 9.808685298960867e-06, "loss": 0.4137075424194336, "num_input_tokens_seen": 115125264, "step": 2625, "train_runtime": 20201.5972, "train_tokens_per_second": 5698.82 }, { "epoch": 0.17708052787503367, "grad_norm": 0.7663556283529158, "learning_rate": 9.807960216500858e-06, "loss": 0.4165202617645264, "num_input_tokens_seen": 115343304, "step": 2630, "train_runtime": 20236.3656, "train_tokens_per_second": 5699.803 }, { "epoch": 0.1774171828709938, "grad_norm": 0.7884797087616878, "learning_rate": 9.807233789510106e-06, "loss": 0.38329482078552246, "num_input_tokens_seen": 115555208, "step": 2635, "train_runtime": 20279.8657, "train_tokens_per_second": 5698.026 }, { "epoch": 0.17775383786695395, "grad_norm": 0.7323486746827084, "learning_rate": 9.806506018191754e-06, "loss": 0.39183108806610106, "num_input_tokens_seen": 115777312, "step": 2640, "train_runtime": 20317.1207, "train_tokens_per_second": 5698.51 }, { "epoch": 0.1780904928629141, "grad_norm": 0.8712184035601627, "learning_rate": 9.80577690274932e-06, "loss": 0.39883904457092284, "num_input_tokens_seen": 116000320, "step": 2645, "train_runtime": 20353.9248, "train_tokens_per_second": 5699.162 }, { "epoch": 0.17842714785887423, "grad_norm": 0.6517931345598202, "learning_rate": 9.8050464433867e-06, "loss": 0.3788264751434326, "num_input_tokens_seen": 116228264, "step": 2650, "train_runtime": 20388.2032, "train_tokens_per_second": 5700.761 }, { "epoch": 0.17876380285483437, "grad_norm": 0.8947080972086597, "learning_rate": 9.804314640308165e-06, "loss": 0.43610692024230957, "num_input_tokens_seen": 116459784, "step": 2655, "train_runtime": 20433.6777, "train_tokens_per_second": 5699.404 }, { "epoch": 0.1791004578507945, "grad_norm": 0.8316768119557644, "learning_rate": 9.803581493718361e-06, "loss": 0.4152191162109375, "num_input_tokens_seen": 116677976, "step": 2660, "train_runtime": 20471.066, "train_tokens_per_second": 5699.653 }, { "epoch": 0.17943711284675465, "grad_norm": 0.7694745863442054, "learning_rate": 9.80284700382231e-06, "loss": 0.4158869743347168, "num_input_tokens_seen": 116913096, "step": 2665, "train_runtime": 20513.9974, "train_tokens_per_second": 5699.186 }, { "epoch": 0.1797737678427148, "grad_norm": 0.7759018142960451, "learning_rate": 9.802111170825408e-06, "loss": 0.40905094146728516, "num_input_tokens_seen": 117139040, "step": 2670, "train_runtime": 20555.3803, "train_tokens_per_second": 5698.705 }, { "epoch": 0.18011042283867493, "grad_norm": 0.7209579007108823, "learning_rate": 9.80137399493343e-06, "loss": 0.4070711135864258, "num_input_tokens_seen": 117354016, "step": 2675, "train_runtime": 20594.1226, "train_tokens_per_second": 5698.423 }, { "epoch": 0.18044707783463507, "grad_norm": 0.7855863516525835, "learning_rate": 9.800635476352525e-06, "loss": 0.39305026531219484, "num_input_tokens_seen": 117552920, "step": 2680, "train_runtime": 20636.4809, "train_tokens_per_second": 5696.365 }, { "epoch": 0.1807837328305952, "grad_norm": 0.8011882919088659, "learning_rate": 9.799895615289218e-06, "loss": 0.38626153469085694, "num_input_tokens_seen": 117762232, "step": 2685, "train_runtime": 20677.4885, "train_tokens_per_second": 5695.19 }, { "epoch": 0.18112038782655535, "grad_norm": 0.7959442838200258, "learning_rate": 9.799154411950407e-06, "loss": 0.44461402893066404, "num_input_tokens_seen": 117998240, "step": 2690, "train_runtime": 20716.7034, "train_tokens_per_second": 5695.802 }, { "epoch": 0.18145704282251549, "grad_norm": 0.7750011575792003, "learning_rate": 9.79841186654337e-06, "loss": 0.4056252479553223, "num_input_tokens_seen": 118211832, "step": 2695, "train_runtime": 20752.9555, "train_tokens_per_second": 5696.144 }, { "epoch": 0.18179369781847562, "grad_norm": 0.8899930605283304, "learning_rate": 9.797667979275752e-06, "loss": 0.43903465270996095, "num_input_tokens_seen": 118421416, "step": 2700, "train_runtime": 20785.8453, "train_tokens_per_second": 5697.214 }, { "epoch": 0.18213035281443576, "grad_norm": 0.7964676861353408, "learning_rate": 9.796922750355584e-06, "loss": 0.3816461801528931, "num_input_tokens_seen": 118635408, "step": 2705, "train_runtime": 20823.8564, "train_tokens_per_second": 5697.091 }, { "epoch": 0.1824670078103959, "grad_norm": 0.8627424628290897, "learning_rate": 9.796176179991266e-06, "loss": 0.4243772029876709, "num_input_tokens_seen": 118853520, "step": 2710, "train_runtime": 20861.0922, "train_tokens_per_second": 5697.378 }, { "epoch": 0.18280366280635604, "grad_norm": 0.8313804598527397, "learning_rate": 9.795428268391572e-06, "loss": 0.39929049015045165, "num_input_tokens_seen": 119057464, "step": 2715, "train_runtime": 20899.2219, "train_tokens_per_second": 5696.741 }, { "epoch": 0.18314031780231618, "grad_norm": 0.9224656362131587, "learning_rate": 9.794679015765655e-06, "loss": 0.4025382995605469, "num_input_tokens_seen": 119270504, "step": 2720, "train_runtime": 20936.4359, "train_tokens_per_second": 5696.791 }, { "epoch": 0.18347697279827632, "grad_norm": 0.8830106782970203, "learning_rate": 9.793928422323041e-06, "loss": 0.40293426513671876, "num_input_tokens_seen": 119494864, "step": 2725, "train_runtime": 20982.2238, "train_tokens_per_second": 5695.052 }, { "epoch": 0.18381362779423646, "grad_norm": 0.9585116874337107, "learning_rate": 9.793176488273629e-06, "loss": 0.40497751235961915, "num_input_tokens_seen": 119700000, "step": 2730, "train_runtime": 21018.3132, "train_tokens_per_second": 5695.034 }, { "epoch": 0.1841502827901966, "grad_norm": 0.9047740005031505, "learning_rate": 9.792423213827697e-06, "loss": 0.3891148567199707, "num_input_tokens_seen": 119916696, "step": 2735, "train_runtime": 21057.8627, "train_tokens_per_second": 5694.628 }, { "epoch": 0.18448693778615674, "grad_norm": 0.8310766014320071, "learning_rate": 9.791668599195897e-06, "loss": 0.3831428289413452, "num_input_tokens_seen": 120142080, "step": 2740, "train_runtime": 21101.6665, "train_tokens_per_second": 5693.488 }, { "epoch": 0.18482359278211688, "grad_norm": 0.7855666850049595, "learning_rate": 9.790912644589248e-06, "loss": 0.42138309478759767, "num_input_tokens_seen": 120348496, "step": 2745, "train_runtime": 21146.0201, "train_tokens_per_second": 5691.307 }, { "epoch": 0.18516024777807702, "grad_norm": 0.7620864321495552, "learning_rate": 9.790155350219159e-06, "loss": 0.3965245246887207, "num_input_tokens_seen": 120570160, "step": 2750, "train_runtime": 21186.6351, "train_tokens_per_second": 5690.859 }, { "epoch": 0.18549690277403716, "grad_norm": 0.7543478062618101, "learning_rate": 9.789396716297399e-06, "loss": 0.4091955661773682, "num_input_tokens_seen": 120800688, "step": 2755, "train_runtime": 21220.0669, "train_tokens_per_second": 5692.757 }, { "epoch": 0.1858335577699973, "grad_norm": 0.8640772187026432, "learning_rate": 9.788636743036122e-06, "loss": 0.38339416980743407, "num_input_tokens_seen": 121012328, "step": 2760, "train_runtime": 21257.8451, "train_tokens_per_second": 5692.596 }, { "epoch": 0.18617021276595744, "grad_norm": 0.7868554451548372, "learning_rate": 9.787875430647847e-06, "loss": 0.3950460195541382, "num_input_tokens_seen": 121232032, "step": 2765, "train_runtime": 21294.5091, "train_tokens_per_second": 5693.112 }, { "epoch": 0.18650686776191758, "grad_norm": 0.8537247075271003, "learning_rate": 9.787112779345477e-06, "loss": 0.39361560344696045, "num_input_tokens_seen": 121436200, "step": 2770, "train_runtime": 21331.5416, "train_tokens_per_second": 5692.8 }, { "epoch": 0.18684352275787772, "grad_norm": 0.8358704371476329, "learning_rate": 9.786348789342283e-06, "loss": 0.4345618724822998, "num_input_tokens_seen": 121656544, "step": 2775, "train_runtime": 21370.3261, "train_tokens_per_second": 5692.779 }, { "epoch": 0.18718017775383786, "grad_norm": 0.7754752799232651, "learning_rate": 9.785583460851912e-06, "loss": 0.39746851921081544, "num_input_tokens_seen": 121881368, "step": 2780, "train_runtime": 21412.528, "train_tokens_per_second": 5692.059 }, { "epoch": 0.187516832749798, "grad_norm": 0.7537619511207324, "learning_rate": 9.784816794088386e-06, "loss": 0.4182771682739258, "num_input_tokens_seen": 122116272, "step": 2785, "train_runtime": 21450.3054, "train_tokens_per_second": 5692.985 }, { "epoch": 0.18785348774575814, "grad_norm": 0.86793765719075, "learning_rate": 9.784048789266101e-06, "loss": 0.4000124931335449, "num_input_tokens_seen": 122324024, "step": 2790, "train_runtime": 21493.8907, "train_tokens_per_second": 5691.107 }, { "epoch": 0.18819014274171827, "grad_norm": 0.7757014341183018, "learning_rate": 9.78327944659983e-06, "loss": 0.411564302444458, "num_input_tokens_seen": 122539808, "step": 2795, "train_runtime": 21541.5867, "train_tokens_per_second": 5688.523 }, { "epoch": 0.18852679773767841, "grad_norm": 0.8345683649256179, "learning_rate": 9.78250876630471e-06, "loss": 0.40423192977905276, "num_input_tokens_seen": 122747320, "step": 2800, "train_runtime": 21579.8161, "train_tokens_per_second": 5688.061 }, { "epoch": 0.18886345273363855, "grad_norm": 0.8512506107699013, "learning_rate": 9.781736748596267e-06, "loss": 0.39595718383789064, "num_input_tokens_seen": 122957984, "step": 2805, "train_runtime": 21616.5661, "train_tokens_per_second": 5688.137 }, { "epoch": 0.18920010772959872, "grad_norm": 0.8124112022835439, "learning_rate": 9.78096339369039e-06, "loss": 0.3889493942260742, "num_input_tokens_seen": 123167712, "step": 2810, "train_runtime": 21651.6405, "train_tokens_per_second": 5688.609 }, { "epoch": 0.18953676272555886, "grad_norm": 0.7367215294516509, "learning_rate": 9.780188701803345e-06, "loss": 0.42559328079223635, "num_input_tokens_seen": 123386632, "step": 2815, "train_runtime": 21694.1793, "train_tokens_per_second": 5687.546 }, { "epoch": 0.189873417721519, "grad_norm": 0.7954578075141111, "learning_rate": 9.779412673151772e-06, "loss": 0.40504965782165525, "num_input_tokens_seen": 123614712, "step": 2820, "train_runtime": 21735.5555, "train_tokens_per_second": 5687.212 }, { "epoch": 0.19021007271747914, "grad_norm": 0.7248412230311774, "learning_rate": 9.778635307952686e-06, "loss": 0.4043741703033447, "num_input_tokens_seen": 123839728, "step": 2825, "train_runtime": 21777.9441, "train_tokens_per_second": 5686.475 }, { "epoch": 0.19054672771343928, "grad_norm": 0.9358958553909015, "learning_rate": 9.777856606423472e-06, "loss": 0.403910493850708, "num_input_tokens_seen": 124065288, "step": 2830, "train_runtime": 21817.8593, "train_tokens_per_second": 5686.41 }, { "epoch": 0.19088338270939942, "grad_norm": 0.8463489849936312, "learning_rate": 9.777076568781897e-06, "loss": 0.43606057167053225, "num_input_tokens_seen": 124264360, "step": 2835, "train_runtime": 21855.3285, "train_tokens_per_second": 5685.769 }, { "epoch": 0.19122003770535956, "grad_norm": 0.9165712627873297, "learning_rate": 9.77629519524609e-06, "loss": 0.3660429954528809, "num_input_tokens_seen": 124479288, "step": 2840, "train_runtime": 21894.9089, "train_tokens_per_second": 5685.307 }, { "epoch": 0.1915566927013197, "grad_norm": 0.7656937544219163, "learning_rate": 9.775512486034564e-06, "loss": 0.4081143379211426, "num_input_tokens_seen": 124692848, "step": 2845, "train_runtime": 21938.4076, "train_tokens_per_second": 5683.769 }, { "epoch": 0.19189334769727984, "grad_norm": 0.867416455867072, "learning_rate": 9.774728441366197e-06, "loss": 0.4261101245880127, "num_input_tokens_seen": 124899520, "step": 2850, "train_runtime": 21975.3012, "train_tokens_per_second": 5683.632 }, { "epoch": 0.19223000269323998, "grad_norm": 0.760427761575941, "learning_rate": 9.773943061460249e-06, "loss": 0.39615979194641116, "num_input_tokens_seen": 125109776, "step": 2855, "train_runtime": 22015.122, "train_tokens_per_second": 5682.902 }, { "epoch": 0.19256665768920012, "grad_norm": 0.8768768754679016, "learning_rate": 9.773156346536345e-06, "loss": 0.42858476638793946, "num_input_tokens_seen": 125326624, "step": 2860, "train_runtime": 22054.6435, "train_tokens_per_second": 5682.55 }, { "epoch": 0.19290331268516026, "grad_norm": 0.7656261692386461, "learning_rate": 9.772368296814489e-06, "loss": 0.3920739650726318, "num_input_tokens_seen": 125545392, "step": 2865, "train_runtime": 22088.3487, "train_tokens_per_second": 5683.784 }, { "epoch": 0.1932399676811204, "grad_norm": 0.7687451750642236, "learning_rate": 9.771578912515058e-06, "loss": 0.439731502532959, "num_input_tokens_seen": 125763512, "step": 2870, "train_runtime": 22123.8551, "train_tokens_per_second": 5684.521 }, { "epoch": 0.19357662267708053, "grad_norm": 3.7881124274468654, "learning_rate": 9.7707881938588e-06, "loss": 0.3899986743927002, "num_input_tokens_seen": 125983312, "step": 2875, "train_runtime": 22166.3825, "train_tokens_per_second": 5683.531 }, { "epoch": 0.19391327767304067, "grad_norm": 0.7637738370885714, "learning_rate": 9.769996141066836e-06, "loss": 0.4218841552734375, "num_input_tokens_seen": 126221208, "step": 2880, "train_runtime": 22196.5764, "train_tokens_per_second": 5686.517 }, { "epoch": 0.1942499326690008, "grad_norm": 0.7196684362616566, "learning_rate": 9.76920275436066e-06, "loss": 0.41857566833496096, "num_input_tokens_seen": 126460024, "step": 2885, "train_runtime": 22232.6411, "train_tokens_per_second": 5688.034 }, { "epoch": 0.19458658766496095, "grad_norm": 0.7681501572608938, "learning_rate": 9.768408033962145e-06, "loss": 0.4293510437011719, "num_input_tokens_seen": 126682488, "step": 2890, "train_runtime": 22274.9037, "train_tokens_per_second": 5687.229 }, { "epoch": 0.1949232426609211, "grad_norm": 0.7776932982886595, "learning_rate": 9.767611980093525e-06, "loss": 0.40836372375488283, "num_input_tokens_seen": 126903552, "step": 2895, "train_runtime": 22315.0672, "train_tokens_per_second": 5686.9 }, { "epoch": 0.19525989765688123, "grad_norm": 0.7725164291944147, "learning_rate": 9.76681459297742e-06, "loss": 0.41483469009399415, "num_input_tokens_seen": 127124488, "step": 2900, "train_runtime": 22361.1218, "train_tokens_per_second": 5685.068 }, { "epoch": 0.19559655265284137, "grad_norm": 1.0523171028632952, "learning_rate": 9.766015872836814e-06, "loss": 0.4586020469665527, "num_input_tokens_seen": 127351272, "step": 2905, "train_runtime": 22403.7587, "train_tokens_per_second": 5684.371 }, { "epoch": 0.1959332076488015, "grad_norm": 0.981785930598382, "learning_rate": 9.765215819895066e-06, "loss": 0.4265925407409668, "num_input_tokens_seen": 127584848, "step": 2910, "train_runtime": 22435.5709, "train_tokens_per_second": 5686.722 }, { "epoch": 0.19626986264476165, "grad_norm": 0.7598810830140263, "learning_rate": 9.76441443437591e-06, "loss": 0.3775201320648193, "num_input_tokens_seen": 127815392, "step": 2915, "train_runtime": 22468.3308, "train_tokens_per_second": 5688.691 }, { "epoch": 0.1966065176407218, "grad_norm": 0.8036869153351719, "learning_rate": 9.76361171650345e-06, "loss": 0.4249995708465576, "num_input_tokens_seen": 128025072, "step": 2920, "train_runtime": 22508.1392, "train_tokens_per_second": 5687.946 }, { "epoch": 0.19694317263668193, "grad_norm": 0.8854228803465163, "learning_rate": 9.762807666502164e-06, "loss": 0.41265301704406737, "num_input_tokens_seen": 128236720, "step": 2925, "train_runtime": 22548.1044, "train_tokens_per_second": 5687.251 }, { "epoch": 0.19727982763264207, "grad_norm": 1.302088487080232, "learning_rate": 9.762002284596898e-06, "loss": 0.4183157444000244, "num_input_tokens_seen": 128448432, "step": 2930, "train_runtime": 22591.5125, "train_tokens_per_second": 5685.694 }, { "epoch": 0.1976164826286022, "grad_norm": 0.8232254317537885, "learning_rate": 9.761195571012882e-06, "loss": 0.4257832050323486, "num_input_tokens_seen": 128657896, "step": 2935, "train_runtime": 22629.0733, "train_tokens_per_second": 5685.513 }, { "epoch": 0.19795313762456235, "grad_norm": 0.8172096711574582, "learning_rate": 9.760387525975705e-06, "loss": 0.395475172996521, "num_input_tokens_seen": 128883360, "step": 2940, "train_runtime": 22662.7742, "train_tokens_per_second": 5687.007 }, { "epoch": 0.1982897926205225, "grad_norm": 0.7517384205877706, "learning_rate": 9.759578149711337e-06, "loss": 0.35533039569854735, "num_input_tokens_seen": 129112664, "step": 2945, "train_runtime": 22703.1966, "train_tokens_per_second": 5686.982 }, { "epoch": 0.19862644761648263, "grad_norm": 0.7164265548546924, "learning_rate": 9.758767442446117e-06, "loss": 0.38588006496429444, "num_input_tokens_seen": 129342864, "step": 2950, "train_runtime": 22748.3032, "train_tokens_per_second": 5685.825 }, { "epoch": 0.19896310261244277, "grad_norm": 0.733779366224309, "learning_rate": 9.757955404406755e-06, "loss": 0.38382346630096437, "num_input_tokens_seen": 129566032, "step": 2955, "train_runtime": 22786.3627, "train_tokens_per_second": 5686.122 }, { "epoch": 0.1992997576084029, "grad_norm": 0.9448244412990339, "learning_rate": 9.757142035820337e-06, "loss": 0.3917106628417969, "num_input_tokens_seen": 129766056, "step": 2960, "train_runtime": 22824.9574, "train_tokens_per_second": 5685.27 }, { "epoch": 0.19963641260436304, "grad_norm": 0.9552752355322248, "learning_rate": 9.756327336914318e-06, "loss": 0.4134823322296143, "num_input_tokens_seen": 129977048, "step": 2965, "train_runtime": 22868.2844, "train_tokens_per_second": 5683.725 }, { "epoch": 0.19997306760032318, "grad_norm": 1.0910385569978054, "learning_rate": 9.755511307916526e-06, "loss": 0.4055294990539551, "num_input_tokens_seen": 130194224, "step": 2970, "train_runtime": 22901.3701, "train_tokens_per_second": 5684.997 }, { "epoch": 0.20030972259628332, "grad_norm": 0.8363361731098393, "learning_rate": 9.754693949055161e-06, "loss": 0.4119466781616211, "num_input_tokens_seen": 130423144, "step": 2975, "train_runtime": 22941.2287, "train_tokens_per_second": 5685.098 }, { "epoch": 0.20064637759224346, "grad_norm": 0.8509098752743555, "learning_rate": 9.753875260558795e-06, "loss": 0.43303780555725097, "num_input_tokens_seen": 130623168, "step": 2980, "train_runtime": 22977.1333, "train_tokens_per_second": 5684.92 }, { "epoch": 0.2009830325882036, "grad_norm": 0.7851629802721982, "learning_rate": 9.75305524265637e-06, "loss": 0.39323015213012696, "num_input_tokens_seen": 130853536, "step": 2985, "train_runtime": 23010.865, "train_tokens_per_second": 5686.598 }, { "epoch": 0.20131968758416374, "grad_norm": 0.8423251979034995, "learning_rate": 9.752233895577205e-06, "loss": 0.4042644023895264, "num_input_tokens_seen": 131059592, "step": 2990, "train_runtime": 23047.2444, "train_tokens_per_second": 5686.562 }, { "epoch": 0.20165634258012388, "grad_norm": 0.7311264203424918, "learning_rate": 9.751411219550984e-06, "loss": 0.40361328125, "num_input_tokens_seen": 131276760, "step": 2995, "train_runtime": 23082.7777, "train_tokens_per_second": 5687.217 }, { "epoch": 0.20199299757608402, "grad_norm": 0.9307523548267392, "learning_rate": 9.750587214807766e-06, "loss": 0.39671123027801514, "num_input_tokens_seen": 131486248, "step": 3000, "train_runtime": 23124.9978, "train_tokens_per_second": 5685.892 }, { "epoch": 0.20232965257204416, "grad_norm": 0.8339744148987415, "learning_rate": 9.749761881577981e-06, "loss": 0.42069306373596194, "num_input_tokens_seen": 131716280, "step": 3005, "train_runtime": 23166.3136, "train_tokens_per_second": 5685.681 }, { "epoch": 0.2026663075680043, "grad_norm": 0.7849226835237555, "learning_rate": 9.748935220092434e-06, "loss": 0.39777138233184817, "num_input_tokens_seen": 131935832, "step": 3010, "train_runtime": 23202.4925, "train_tokens_per_second": 5686.278 }, { "epoch": 0.20300296256396444, "grad_norm": 0.8473889903914309, "learning_rate": 9.748107230582295e-06, "loss": 0.39002056121826173, "num_input_tokens_seen": 132140024, "step": 3015, "train_runtime": 23239.8205, "train_tokens_per_second": 5685.931 }, { "epoch": 0.20333961755992458, "grad_norm": 0.7565501165020906, "learning_rate": 9.747277913279109e-06, "loss": 0.4608659267425537, "num_input_tokens_seen": 132358504, "step": 3020, "train_runtime": 23285.5396, "train_tokens_per_second": 5684.15 }, { "epoch": 0.20367627255588472, "grad_norm": 0.71921389289753, "learning_rate": 9.746447268414794e-06, "loss": 0.44081912040710447, "num_input_tokens_seen": 132589576, "step": 3025, "train_runtime": 23324.3416, "train_tokens_per_second": 5684.601 }, { "epoch": 0.20401292755184486, "grad_norm": 0.8592739422898477, "learning_rate": 9.745615296221635e-06, "loss": 0.40747461318969724, "num_input_tokens_seen": 132819496, "step": 3030, "train_runtime": 23358.8471, "train_tokens_per_second": 5686.047 }, { "epoch": 0.204349582547805, "grad_norm": 0.7375243033673482, "learning_rate": 9.74478199693229e-06, "loss": 0.42429242134094236, "num_input_tokens_seen": 133045880, "step": 3035, "train_runtime": 23401.9716, "train_tokens_per_second": 5685.242 }, { "epoch": 0.20468623754376514, "grad_norm": 0.7984195828599883, "learning_rate": 9.743947370779791e-06, "loss": 0.4262086391448975, "num_input_tokens_seen": 133273848, "step": 3040, "train_runtime": 23442.6366, "train_tokens_per_second": 5685.105 }, { "epoch": 0.20502289253972528, "grad_norm": 0.7817233028800991, "learning_rate": 9.743111417997536e-06, "loss": 0.41955132484436036, "num_input_tokens_seen": 133500640, "step": 3045, "train_runtime": 23481.7864, "train_tokens_per_second": 5685.285 }, { "epoch": 0.20535954753568542, "grad_norm": 0.8413661304916547, "learning_rate": 9.742274138819298e-06, "loss": 0.416639518737793, "num_input_tokens_seen": 133719848, "step": 3050, "train_runtime": 23518.5528, "train_tokens_per_second": 5685.718 }, { "epoch": 0.20569620253164558, "grad_norm": 0.8835193289624108, "learning_rate": 9.74143553347922e-06, "loss": 0.45115389823913576, "num_input_tokens_seen": 133944240, "step": 3055, "train_runtime": 23558.0231, "train_tokens_per_second": 5685.716 }, { "epoch": 0.20603285752760572, "grad_norm": 0.7584811920041505, "learning_rate": 9.740595602211814e-06, "loss": 0.395220947265625, "num_input_tokens_seen": 134166880, "step": 3060, "train_runtime": 23594.0834, "train_tokens_per_second": 5686.463 }, { "epoch": 0.20636951252356586, "grad_norm": 0.779533118470965, "learning_rate": 9.739754345251963e-06, "loss": 0.3915586471557617, "num_input_tokens_seen": 134373184, "step": 3065, "train_runtime": 23633.4149, "train_tokens_per_second": 5685.729 }, { "epoch": 0.206706167519526, "grad_norm": 0.752085146799199, "learning_rate": 9.738911762834924e-06, "loss": 0.36250555515289307, "num_input_tokens_seen": 134594840, "step": 3070, "train_runtime": 23669.854, "train_tokens_per_second": 5686.34 }, { "epoch": 0.20704282251548614, "grad_norm": 0.9101615257113173, "learning_rate": 9.738067855196323e-06, "loss": 0.40388903617858884, "num_input_tokens_seen": 134814144, "step": 3075, "train_runtime": 23702.4871, "train_tokens_per_second": 5687.764 }, { "epoch": 0.20737947751144628, "grad_norm": 0.937886524311701, "learning_rate": 9.737222622572153e-06, "loss": 0.4489736557006836, "num_input_tokens_seen": 135025088, "step": 3080, "train_runtime": 23747.5708, "train_tokens_per_second": 5685.848 }, { "epoch": 0.20771613250740642, "grad_norm": 0.939422935382809, "learning_rate": 9.736376065198784e-06, "loss": 0.4101541519165039, "num_input_tokens_seen": 135253064, "step": 3085, "train_runtime": 23786.6187, "train_tokens_per_second": 5686.099 }, { "epoch": 0.20805278750336656, "grad_norm": 0.8449440163538374, "learning_rate": 9.735528183312951e-06, "loss": 0.39399616718292235, "num_input_tokens_seen": 135486752, "step": 3090, "train_runtime": 23827.8882, "train_tokens_per_second": 5686.058 }, { "epoch": 0.2083894424993267, "grad_norm": 0.7846090848755455, "learning_rate": 9.734678977151762e-06, "loss": 0.3820789098739624, "num_input_tokens_seen": 135702632, "step": 3095, "train_runtime": 23868.8149, "train_tokens_per_second": 5685.353 }, { "epoch": 0.20872609749528684, "grad_norm": 0.7998350921308711, "learning_rate": 9.733828446952696e-06, "loss": 0.40059328079223633, "num_input_tokens_seen": 135925976, "step": 3100, "train_runtime": 23904.8211, "train_tokens_per_second": 5686.132 }, { "epoch": 0.20906275249124698, "grad_norm": 0.7794995917456119, "learning_rate": 9.732976592953598e-06, "loss": 0.3992907524108887, "num_input_tokens_seen": 136155256, "step": 3105, "train_runtime": 23947.0473, "train_tokens_per_second": 5685.68 }, { "epoch": 0.20939940748720712, "grad_norm": 0.8028611006413868, "learning_rate": 9.73212341539269e-06, "loss": 0.40617761611938474, "num_input_tokens_seen": 136377968, "step": 3110, "train_runtime": 23995.829, "train_tokens_per_second": 5683.403 }, { "epoch": 0.20973606248316726, "grad_norm": 0.7679301554806387, "learning_rate": 9.731268914508556e-06, "loss": 0.39726805686950684, "num_input_tokens_seen": 136595144, "step": 3115, "train_runtime": 24037.8732, "train_tokens_per_second": 5682.497 }, { "epoch": 0.2100727174791274, "grad_norm": 0.7757940100269232, "learning_rate": 9.730413090540158e-06, "loss": 0.3819112777709961, "num_input_tokens_seen": 136818256, "step": 3120, "train_runtime": 24075.9596, "train_tokens_per_second": 5682.775 }, { "epoch": 0.21040937247508754, "grad_norm": 0.7507007143030089, "learning_rate": 9.729555943726825e-06, "loss": 0.40000243186950685, "num_input_tokens_seen": 137031872, "step": 3125, "train_runtime": 24120.3223, "train_tokens_per_second": 5681.179 }, { "epoch": 0.21074602747104768, "grad_norm": 0.8053852599963457, "learning_rate": 9.728697474308253e-06, "loss": 0.40857748985290526, "num_input_tokens_seen": 137246200, "step": 3130, "train_runtime": 24159.6984, "train_tokens_per_second": 5680.791 }, { "epoch": 0.21108268246700782, "grad_norm": 0.8178855876896101, "learning_rate": 9.72783768252451e-06, "loss": 0.38510382175445557, "num_input_tokens_seen": 137454056, "step": 3135, "train_runtime": 24197.6049, "train_tokens_per_second": 5680.482 }, { "epoch": 0.21141933746296795, "grad_norm": 0.7840878331434453, "learning_rate": 9.726976568616036e-06, "loss": 0.40147695541381834, "num_input_tokens_seen": 137663648, "step": 3140, "train_runtime": 24241.393, "train_tokens_per_second": 5678.867 }, { "epoch": 0.2117559924589281, "grad_norm": 0.9228616942450966, "learning_rate": 9.726114132823638e-06, "loss": 0.389466381072998, "num_input_tokens_seen": 137882432, "step": 3145, "train_runtime": 24280.2706, "train_tokens_per_second": 5678.785 }, { "epoch": 0.21209264745488823, "grad_norm": 0.6934203083016008, "learning_rate": 9.725250375388493e-06, "loss": 0.4213107109069824, "num_input_tokens_seen": 138093344, "step": 3150, "train_runtime": 24320.3928, "train_tokens_per_second": 5678.089 }, { "epoch": 0.21242930245084837, "grad_norm": 0.8669084820101542, "learning_rate": 9.724385296552147e-06, "loss": 0.43596372604370115, "num_input_tokens_seen": 138316336, "step": 3155, "train_runtime": 24362.0648, "train_tokens_per_second": 5677.529 }, { "epoch": 0.2127659574468085, "grad_norm": 0.9337337457982863, "learning_rate": 9.72351889655652e-06, "loss": 0.4109373092651367, "num_input_tokens_seen": 138541888, "step": 3160, "train_runtime": 24397.2747, "train_tokens_per_second": 5678.58 }, { "epoch": 0.21310261244276865, "grad_norm": 0.8342554979170712, "learning_rate": 9.722651175643895e-06, "loss": 0.40399460792541503, "num_input_tokens_seen": 138760928, "step": 3165, "train_runtime": 24436.674, "train_tokens_per_second": 5678.388 }, { "epoch": 0.2134392674387288, "grad_norm": 0.7886653586812639, "learning_rate": 9.721782134056928e-06, "loss": 0.36252574920654296, "num_input_tokens_seen": 138982088, "step": 3170, "train_runtime": 24480.3769, "train_tokens_per_second": 5677.285 }, { "epoch": 0.21377592243468893, "grad_norm": 0.7172325919553721, "learning_rate": 9.720911772038645e-06, "loss": 0.4204305648803711, "num_input_tokens_seen": 139208968, "step": 3175, "train_runtime": 24514.7644, "train_tokens_per_second": 5678.577 }, { "epoch": 0.21411257743064907, "grad_norm": 0.8184330706813875, "learning_rate": 9.720040089832436e-06, "loss": 0.4118339538574219, "num_input_tokens_seen": 139404296, "step": 3180, "train_runtime": 24555.2547, "train_tokens_per_second": 5677.168 }, { "epoch": 0.2144492324266092, "grad_norm": 0.7810238480356294, "learning_rate": 9.719167087682069e-06, "loss": 0.38251235485076907, "num_input_tokens_seen": 139626528, "step": 3185, "train_runtime": 24596.095, "train_tokens_per_second": 5676.776 }, { "epoch": 0.21478588742256935, "grad_norm": 0.8237949114328076, "learning_rate": 9.718292765831673e-06, "loss": 0.39778890609741213, "num_input_tokens_seen": 139852040, "step": 3190, "train_runtime": 24636.5885, "train_tokens_per_second": 5676.599 }, { "epoch": 0.2151225424185295, "grad_norm": 0.823181949661376, "learning_rate": 9.71741712452575e-06, "loss": 0.4149151802062988, "num_input_tokens_seen": 140074344, "step": 3195, "train_runtime": 24669.1536, "train_tokens_per_second": 5678.117 }, { "epoch": 0.21545919741448963, "grad_norm": 0.7987011374780209, "learning_rate": 9.716540164009174e-06, "loss": 0.3865767478942871, "num_input_tokens_seen": 140277680, "step": 3200, "train_runtime": 24707.2868, "train_tokens_per_second": 5677.583 }, { "epoch": 0.21579585241044977, "grad_norm": 0.9131858261391301, "learning_rate": 9.715661884527178e-06, "loss": 0.4173252582550049, "num_input_tokens_seen": 140503936, "step": 3205, "train_runtime": 24750.0835, "train_tokens_per_second": 5676.908 }, { "epoch": 0.2161325074064099, "grad_norm": 0.9283199650974979, "learning_rate": 9.714782286325374e-06, "loss": 0.4102613925933838, "num_input_tokens_seen": 140723000, "step": 3210, "train_runtime": 24793.1175, "train_tokens_per_second": 5675.89 }, { "epoch": 0.21646916240237005, "grad_norm": 0.9449783149453059, "learning_rate": 9.713901369649738e-06, "loss": 0.3924571990966797, "num_input_tokens_seen": 140943200, "step": 3215, "train_runtime": 24831.5013, "train_tokens_per_second": 5675.984 }, { "epoch": 0.2168058173983302, "grad_norm": 0.7571957619819966, "learning_rate": 9.713019134746618e-06, "loss": 0.38917341232299807, "num_input_tokens_seen": 141178808, "step": 3220, "train_runtime": 24867.52, "train_tokens_per_second": 5677.237 }, { "epoch": 0.21714247239429033, "grad_norm": 0.8569813128796843, "learning_rate": 9.712135581862722e-06, "loss": 0.39778847694396974, "num_input_tokens_seen": 141410600, "step": 3225, "train_runtime": 24909.1487, "train_tokens_per_second": 5677.055 }, { "epoch": 0.21747912739025047, "grad_norm": 0.7957771696921552, "learning_rate": 9.711250711245139e-06, "loss": 0.41150903701782227, "num_input_tokens_seen": 141622744, "step": 3230, "train_runtime": 24947.3479, "train_tokens_per_second": 5676.866 }, { "epoch": 0.2178157823862106, "grad_norm": 0.7674615378265653, "learning_rate": 9.710364523141317e-06, "loss": 0.4173532009124756, "num_input_tokens_seen": 141845232, "step": 3235, "train_runtime": 24990.9712, "train_tokens_per_second": 5675.859 }, { "epoch": 0.21815243738217074, "grad_norm": 0.881520768069259, "learning_rate": 9.709477017799076e-06, "loss": 0.4302227973937988, "num_input_tokens_seen": 142068920, "step": 3240, "train_runtime": 25022.7411, "train_tokens_per_second": 5677.592 }, { "epoch": 0.21848909237813088, "grad_norm": 0.9412217646326109, "learning_rate": 9.708588195466604e-06, "loss": 0.4126433849334717, "num_input_tokens_seen": 142289600, "step": 3245, "train_runtime": 25054.9859, "train_tokens_per_second": 5679.093 }, { "epoch": 0.21882574737409102, "grad_norm": 0.7430440131191046, "learning_rate": 9.707698056392458e-06, "loss": 0.4167231559753418, "num_input_tokens_seen": 142506920, "step": 3250, "train_runtime": 25090.3796, "train_tokens_per_second": 5679.743 }, { "epoch": 0.21916240237005116, "grad_norm": 0.8971811831202605, "learning_rate": 9.706806600825562e-06, "loss": 0.4131289005279541, "num_input_tokens_seen": 142719992, "step": 3255, "train_runtime": 25133.8043, "train_tokens_per_second": 5678.408 }, { "epoch": 0.2194990573660113, "grad_norm": 0.9964244321532095, "learning_rate": 9.70591382901521e-06, "loss": 0.42434329986572267, "num_input_tokens_seen": 142935376, "step": 3260, "train_runtime": 25170.1091, "train_tokens_per_second": 5678.775 }, { "epoch": 0.21983571236197144, "grad_norm": 0.7540863225432197, "learning_rate": 9.705019741211061e-06, "loss": 0.39461374282836914, "num_input_tokens_seen": 143155712, "step": 3265, "train_runtime": 25208.8229, "train_tokens_per_second": 5678.794 }, { "epoch": 0.22017236735793158, "grad_norm": 0.8596938023198728, "learning_rate": 9.704124337663145e-06, "loss": 0.38963048458099364, "num_input_tokens_seen": 143381832, "step": 3270, "train_runtime": 25243.421, "train_tokens_per_second": 5679.968 }, { "epoch": 0.22050902235389172, "grad_norm": 0.8540309395774371, "learning_rate": 9.703227618621859e-06, "loss": 0.4044978618621826, "num_input_tokens_seen": 143607328, "step": 3275, "train_runtime": 25284.0238, "train_tokens_per_second": 5679.766 }, { "epoch": 0.22084567734985186, "grad_norm": 0.8072539756195105, "learning_rate": 9.702329584337965e-06, "loss": 0.41426868438720704, "num_input_tokens_seen": 143809000, "step": 3280, "train_runtime": 25326.637, "train_tokens_per_second": 5678.172 }, { "epoch": 0.221182332345812, "grad_norm": 0.9295650810498607, "learning_rate": 9.701430235062599e-06, "loss": 0.43207788467407227, "num_input_tokens_seen": 144023696, "step": 3285, "train_runtime": 25366.0897, "train_tokens_per_second": 5677.804 }, { "epoch": 0.22151898734177214, "grad_norm": 0.9183012776415354, "learning_rate": 9.700529571047259e-06, "loss": 0.4370114803314209, "num_input_tokens_seen": 144236616, "step": 3290, "train_runtime": 25403.6973, "train_tokens_per_second": 5677.78 }, { "epoch": 0.22185564233773228, "grad_norm": 0.8676275172270271, "learning_rate": 9.699627592543814e-06, "loss": 0.3935758829116821, "num_input_tokens_seen": 144451272, "step": 3295, "train_runtime": 25449.4742, "train_tokens_per_second": 5676.002 }, { "epoch": 0.22219229733369245, "grad_norm": 0.7791903636055438, "learning_rate": 9.698724299804498e-06, "loss": 0.41451497077941896, "num_input_tokens_seen": 144675240, "step": 3300, "train_runtime": 25489.8713, "train_tokens_per_second": 5675.793 }, { "epoch": 0.22252895232965259, "grad_norm": 0.8026534486815711, "learning_rate": 9.697819693081915e-06, "loss": 0.40555124282836913, "num_input_tokens_seen": 144894992, "step": 3305, "train_runtime": 25526.7574, "train_tokens_per_second": 5676.2 }, { "epoch": 0.22286560732561272, "grad_norm": 0.7189128013140877, "learning_rate": 9.696913772629034e-06, "loss": 0.38943185806274416, "num_input_tokens_seen": 145119152, "step": 3310, "train_runtime": 25563.6911, "train_tokens_per_second": 5676.768 }, { "epoch": 0.22320226232157286, "grad_norm": 0.788476880680751, "learning_rate": 9.696006538699195e-06, "loss": 0.42933268547058107, "num_input_tokens_seen": 145340576, "step": 3315, "train_runtime": 25595.5361, "train_tokens_per_second": 5678.356 }, { "epoch": 0.223538917317533, "grad_norm": 0.9173858981265539, "learning_rate": 9.695097991546102e-06, "loss": 0.41726884841918943, "num_input_tokens_seen": 145536392, "step": 3320, "train_runtime": 25635.2268, "train_tokens_per_second": 5677.203 }, { "epoch": 0.22387557231349314, "grad_norm": 0.85644319812075, "learning_rate": 9.694188131423828e-06, "loss": 0.38661761283874513, "num_input_tokens_seen": 145752592, "step": 3325, "train_runtime": 25675.7087, "train_tokens_per_second": 5676.673 }, { "epoch": 0.22421222730945328, "grad_norm": 0.8283061394820891, "learning_rate": 9.693276958586809e-06, "loss": 0.4395936965942383, "num_input_tokens_seen": 145975632, "step": 3330, "train_runtime": 25717.6903, "train_tokens_per_second": 5676.079 }, { "epoch": 0.22454888230541342, "grad_norm": 1.107175434088717, "learning_rate": 9.692364473289856e-06, "loss": 0.37718255519866944, "num_input_tokens_seen": 146190016, "step": 3335, "train_runtime": 25758.607, "train_tokens_per_second": 5675.385 }, { "epoch": 0.22488553730137356, "grad_norm": 0.8144408251561523, "learning_rate": 9.69145067578814e-06, "loss": 0.38504073619842527, "num_input_tokens_seen": 146415880, "step": 3340, "train_runtime": 25799.3872, "train_tokens_per_second": 5675.169 }, { "epoch": 0.2252221922973337, "grad_norm": 0.7888334595920984, "learning_rate": 9.690535566337205e-06, "loss": 0.44390153884887695, "num_input_tokens_seen": 146637056, "step": 3345, "train_runtime": 25841.4558, "train_tokens_per_second": 5674.489 }, { "epoch": 0.22555884729329384, "grad_norm": 0.8121918469969017, "learning_rate": 9.689619145192955e-06, "loss": 0.4186522960662842, "num_input_tokens_seen": 146858960, "step": 3350, "train_runtime": 25884.465, "train_tokens_per_second": 5673.633 }, { "epoch": 0.22589550228925398, "grad_norm": 0.7357528337250359, "learning_rate": 9.688701412611663e-06, "loss": 0.39981067180633545, "num_input_tokens_seen": 147088760, "step": 3355, "train_runtime": 25924.1782, "train_tokens_per_second": 5673.806 }, { "epoch": 0.22623215728521412, "grad_norm": 0.8039258104050244, "learning_rate": 9.687782368849973e-06, "loss": 0.40915794372558595, "num_input_tokens_seen": 147306920, "step": 3360, "train_runtime": 25967.0787, "train_tokens_per_second": 5672.834 }, { "epoch": 0.22656881228117426, "grad_norm": 0.8366828009872761, "learning_rate": 9.686862014164893e-06, "loss": 0.3879998207092285, "num_input_tokens_seen": 147534144, "step": 3365, "train_runtime": 26004.3358, "train_tokens_per_second": 5673.444 }, { "epoch": 0.2269054672771344, "grad_norm": 0.8583728877321222, "learning_rate": 9.685940348813795e-06, "loss": 0.3802268266677856, "num_input_tokens_seen": 147751544, "step": 3370, "train_runtime": 26042.4838, "train_tokens_per_second": 5673.481 }, { "epoch": 0.22724212227309454, "grad_norm": 0.8211994293131717, "learning_rate": 9.685017373054421e-06, "loss": 0.39569883346557616, "num_input_tokens_seen": 147971208, "step": 3375, "train_runtime": 26081.1089, "train_tokens_per_second": 5673.501 }, { "epoch": 0.22757877726905468, "grad_norm": 0.7908688808511072, "learning_rate": 9.68409308714488e-06, "loss": 0.3963681697845459, "num_input_tokens_seen": 148186648, "step": 3380, "train_runtime": 26119.5816, "train_tokens_per_second": 5673.393 }, { "epoch": 0.22791543226501482, "grad_norm": 0.7696519906828798, "learning_rate": 9.68316749134364e-06, "loss": 0.4038090705871582, "num_input_tokens_seen": 148417752, "step": 3385, "train_runtime": 26162.0325, "train_tokens_per_second": 5673.021 }, { "epoch": 0.22825208726097496, "grad_norm": 0.7784468571247383, "learning_rate": 9.682240585909545e-06, "loss": 0.38401403427124026, "num_input_tokens_seen": 148628520, "step": 3390, "train_runtime": 26201.9074, "train_tokens_per_second": 5672.431 }, { "epoch": 0.2285887422569351, "grad_norm": 0.7682945918583601, "learning_rate": 9.681312371101803e-06, "loss": 0.36235072612762453, "num_input_tokens_seen": 148860120, "step": 3395, "train_runtime": 26235.4949, "train_tokens_per_second": 5673.997 }, { "epoch": 0.22892539725289524, "grad_norm": 0.7562252932302131, "learning_rate": 9.680382847179984e-06, "loss": 0.4153308868408203, "num_input_tokens_seen": 149075360, "step": 3400, "train_runtime": 26279.0336, "train_tokens_per_second": 5672.787 }, { "epoch": 0.22926205224885537, "grad_norm": 0.8026900227545827, "learning_rate": 9.679452014404025e-06, "loss": 0.39875361919403074, "num_input_tokens_seen": 149283904, "step": 3405, "train_runtime": 26318.8542, "train_tokens_per_second": 5672.128 }, { "epoch": 0.22959870724481551, "grad_norm": 0.8571181299293755, "learning_rate": 9.678519873034234e-06, "loss": 0.435106086730957, "num_input_tokens_seen": 149511344, "step": 3410, "train_runtime": 26357.0843, "train_tokens_per_second": 5672.53 }, { "epoch": 0.22993536224077565, "grad_norm": 0.9132428672371381, "learning_rate": 9.677586423331277e-06, "loss": 0.42625818252563474, "num_input_tokens_seen": 149734672, "step": 3415, "train_runtime": 26396.1327, "train_tokens_per_second": 5672.599 }, { "epoch": 0.2302720172367358, "grad_norm": 0.7227848772197648, "learning_rate": 9.676651665556194e-06, "loss": 0.3853285312652588, "num_input_tokens_seen": 149966984, "step": 3420, "train_runtime": 26437.1674, "train_tokens_per_second": 5672.581 }, { "epoch": 0.23060867223269593, "grad_norm": 0.9758464763691787, "learning_rate": 9.675715599970383e-06, "loss": 0.39388408660888674, "num_input_tokens_seen": 150173312, "step": 3425, "train_runtime": 26476.8347, "train_tokens_per_second": 5671.876 }, { "epoch": 0.23094532722865607, "grad_norm": 0.8789640499008409, "learning_rate": 9.674778226835617e-06, "loss": 0.43226184844970705, "num_input_tokens_seen": 150378728, "step": 3430, "train_runtime": 26514.5982, "train_tokens_per_second": 5671.545 }, { "epoch": 0.2312819822246162, "grad_norm": 0.8223781330799458, "learning_rate": 9.673839546414026e-06, "loss": 0.4151242733001709, "num_input_tokens_seen": 150589928, "step": 3435, "train_runtime": 26555.5388, "train_tokens_per_second": 5670.754 }, { "epoch": 0.23161863722057635, "grad_norm": 0.6819707841325117, "learning_rate": 9.672899558968107e-06, "loss": 0.39006340503692627, "num_input_tokens_seen": 150802664, "step": 3440, "train_runtime": 26599.7743, "train_tokens_per_second": 5669.321 }, { "epoch": 0.2319552922165365, "grad_norm": 0.8192017234463131, "learning_rate": 9.67195826476073e-06, "loss": 0.44136791229248046, "num_input_tokens_seen": 151027880, "step": 3445, "train_runtime": 26637.6563, "train_tokens_per_second": 5669.714 }, { "epoch": 0.23229194721249663, "grad_norm": 0.8137299353827566, "learning_rate": 9.671015664055122e-06, "loss": 0.3967195749282837, "num_input_tokens_seen": 151239928, "step": 3450, "train_runtime": 26671.0692, "train_tokens_per_second": 5670.561 }, { "epoch": 0.23262860220845677, "grad_norm": 0.819274273484707, "learning_rate": 9.670071757114877e-06, "loss": 0.4030034065246582, "num_input_tokens_seen": 151459832, "step": 3455, "train_runtime": 26710.598, "train_tokens_per_second": 5670.402 }, { "epoch": 0.2329652572044169, "grad_norm": 0.8052967688256787, "learning_rate": 9.669126544203957e-06, "loss": 0.38636322021484376, "num_input_tokens_seen": 151667896, "step": 3460, "train_runtime": 26749.1234, "train_tokens_per_second": 5670.014 }, { "epoch": 0.23330191220037705, "grad_norm": 0.8630240510385624, "learning_rate": 9.668180025586689e-06, "loss": 0.4077507972717285, "num_input_tokens_seen": 151902352, "step": 3465, "train_runtime": 26791.3212, "train_tokens_per_second": 5669.834 }, { "epoch": 0.2336385671963372, "grad_norm": 0.7786921906276983, "learning_rate": 9.667232201527761e-06, "loss": 0.3916687250137329, "num_input_tokens_seen": 152102680, "step": 3470, "train_runtime": 26827.5433, "train_tokens_per_second": 5669.646 }, { "epoch": 0.23397522219229733, "grad_norm": 0.8593939179148706, "learning_rate": 9.666283072292234e-06, "loss": 0.41549954414367674, "num_input_tokens_seen": 152303592, "step": 3475, "train_runtime": 26864.7416, "train_tokens_per_second": 5669.274 }, { "epoch": 0.23431187718825747, "grad_norm": 0.7173015967840941, "learning_rate": 9.665332638145522e-06, "loss": 0.40798091888427734, "num_input_tokens_seen": 152526320, "step": 3480, "train_runtime": 26904.6608, "train_tokens_per_second": 5669.141 }, { "epoch": 0.2346485321842176, "grad_norm": 0.7787780767474121, "learning_rate": 9.664380899353414e-06, "loss": 0.44217610359191895, "num_input_tokens_seen": 152747800, "step": 3485, "train_runtime": 26938.7633, "train_tokens_per_second": 5670.186 }, { "epoch": 0.23498518718017775, "grad_norm": 0.875181117161752, "learning_rate": 9.663427856182062e-06, "loss": 0.418949556350708, "num_input_tokens_seen": 152978904, "step": 3490, "train_runtime": 26976.7683, "train_tokens_per_second": 5670.765 }, { "epoch": 0.23532184217613789, "grad_norm": 0.8234151432189463, "learning_rate": 9.662473508897981e-06, "loss": 0.41005191802978513, "num_input_tokens_seen": 153200600, "step": 3495, "train_runtime": 27021.1553, "train_tokens_per_second": 5669.654 }, { "epoch": 0.23565849717209802, "grad_norm": 0.9381121440419455, "learning_rate": 9.661517857768052e-06, "loss": 0.43746633529663087, "num_input_tokens_seen": 153413320, "step": 3500, "train_runtime": 27058.2447, "train_tokens_per_second": 5669.744 }, { "epoch": 0.23599515216805816, "grad_norm": 0.9159040524887876, "learning_rate": 9.660560903059517e-06, "loss": 0.4074262619018555, "num_input_tokens_seen": 153619928, "step": 3505, "train_runtime": 27099.4693, "train_tokens_per_second": 5668.743 }, { "epoch": 0.2363318071640183, "grad_norm": 0.7088057637221193, "learning_rate": 9.659602645039988e-06, "loss": 0.4169961929321289, "num_input_tokens_seen": 153844808, "step": 3510, "train_runtime": 27137.4232, "train_tokens_per_second": 5669.102 }, { "epoch": 0.23666846215997844, "grad_norm": 0.7425326417567343, "learning_rate": 9.658643083977435e-06, "loss": 0.37222681045532224, "num_input_tokens_seen": 154057008, "step": 3515, "train_runtime": 27172.217, "train_tokens_per_second": 5669.652 }, { "epoch": 0.23700511715593858, "grad_norm": 0.7835915209475461, "learning_rate": 9.657682220140202e-06, "loss": 0.3870618104934692, "num_input_tokens_seen": 154257952, "step": 3520, "train_runtime": 27216.0159, "train_tokens_per_second": 5667.911 }, { "epoch": 0.23734177215189872, "grad_norm": 0.944898207115128, "learning_rate": 9.656720053796987e-06, "loss": 0.4269230365753174, "num_input_tokens_seen": 154468968, "step": 3525, "train_runtime": 27253.774, "train_tokens_per_second": 5667.801 }, { "epoch": 0.23767842714785886, "grad_norm": 0.964924059220392, "learning_rate": 9.655756585216859e-06, "loss": 0.39426770210266116, "num_input_tokens_seen": 154679920, "step": 3530, "train_runtime": 27297.8899, "train_tokens_per_second": 5666.369 }, { "epoch": 0.238015082143819, "grad_norm": 0.8389859916982031, "learning_rate": 9.654791814669246e-06, "loss": 0.41727919578552247, "num_input_tokens_seen": 154894088, "step": 3535, "train_runtime": 27338.9009, "train_tokens_per_second": 5665.703 }, { "epoch": 0.23835173713977914, "grad_norm": 0.7799448759874524, "learning_rate": 9.653825742423949e-06, "loss": 0.36776251792907716, "num_input_tokens_seen": 155118416, "step": 3540, "train_runtime": 27380.1523, "train_tokens_per_second": 5665.36 }, { "epoch": 0.2386883921357393, "grad_norm": 0.7611172988563449, "learning_rate": 9.652858368751118e-06, "loss": 0.38267481327056885, "num_input_tokens_seen": 155325944, "step": 3545, "train_runtime": 27419.2328, "train_tokens_per_second": 5664.854 }, { "epoch": 0.23902504713169945, "grad_norm": 0.849616732171608, "learning_rate": 9.651889693921284e-06, "loss": 0.39499473571777344, "num_input_tokens_seen": 155553936, "step": 3550, "train_runtime": 27453.0014, "train_tokens_per_second": 5666.191 }, { "epoch": 0.2393617021276596, "grad_norm": 0.8290842696777342, "learning_rate": 9.650919718205331e-06, "loss": 0.46364564895629884, "num_input_tokens_seen": 155767440, "step": 3555, "train_runtime": 27489.7425, "train_tokens_per_second": 5666.384 }, { "epoch": 0.23969835712361973, "grad_norm": 0.6972330732061462, "learning_rate": 9.649948441874509e-06, "loss": 0.41176652908325195, "num_input_tokens_seen": 155991432, "step": 3560, "train_runtime": 27533.7281, "train_tokens_per_second": 5665.467 }, { "epoch": 0.24003501211957987, "grad_norm": 0.8232987599322095, "learning_rate": 9.648975865200434e-06, "loss": 0.3719303607940674, "num_input_tokens_seen": 156200840, "step": 3565, "train_runtime": 27572.2717, "train_tokens_per_second": 5665.142 }, { "epoch": 0.24037166711554, "grad_norm": 0.7784058710951964, "learning_rate": 9.648001988455082e-06, "loss": 0.42696056365966795, "num_input_tokens_seen": 156423232, "step": 3570, "train_runtime": 27611.0095, "train_tokens_per_second": 5665.249 }, { "epoch": 0.24070832211150014, "grad_norm": 0.8101799377558996, "learning_rate": 9.647026811910794e-06, "loss": 0.42109375, "num_input_tokens_seen": 156638144, "step": 3575, "train_runtime": 27652.042, "train_tokens_per_second": 5664.614 }, { "epoch": 0.24104497710746028, "grad_norm": 0.7776435744711748, "learning_rate": 9.646050335840279e-06, "loss": 0.440277624130249, "num_input_tokens_seen": 156867440, "step": 3580, "train_runtime": 27693.6123, "train_tokens_per_second": 5664.391 }, { "epoch": 0.24138163210342042, "grad_norm": 0.8251722449916711, "learning_rate": 9.6450725605166e-06, "loss": 0.4013186454772949, "num_input_tokens_seen": 157079728, "step": 3585, "train_runtime": 27726.0789, "train_tokens_per_second": 5665.414 }, { "epoch": 0.24171828709938056, "grad_norm": 0.8433224749813183, "learning_rate": 9.644093486213192e-06, "loss": 0.4329217910766602, "num_input_tokens_seen": 157312856, "step": 3590, "train_runtime": 27767.0627, "train_tokens_per_second": 5665.448 }, { "epoch": 0.2420549420953407, "grad_norm": 0.8662917363975451, "learning_rate": 9.64311311320385e-06, "loss": 0.4125063896179199, "num_input_tokens_seen": 157536824, "step": 3595, "train_runtime": 27801.6779, "train_tokens_per_second": 5666.45 }, { "epoch": 0.24239159709130084, "grad_norm": 0.8971134461583352, "learning_rate": 9.642131441762732e-06, "loss": 0.39645483493804934, "num_input_tokens_seen": 157744672, "step": 3600, "train_runtime": 27838.8811, "train_tokens_per_second": 5666.344 }, { "epoch": 0.24272825208726098, "grad_norm": 0.8431994851395936, "learning_rate": 9.641148472164359e-06, "loss": 0.3727452516555786, "num_input_tokens_seen": 157957176, "step": 3605, "train_runtime": 27875.6937, "train_tokens_per_second": 5666.484 }, { "epoch": 0.24306490708322112, "grad_norm": 0.8088195809393041, "learning_rate": 9.640164204683616e-06, "loss": 0.39656991958618165, "num_input_tokens_seen": 158185920, "step": 3610, "train_runtime": 27916.062, "train_tokens_per_second": 5666.484 }, { "epoch": 0.24340156207918126, "grad_norm": 0.8326446982063453, "learning_rate": 9.639178639595748e-06, "loss": 0.43434457778930663, "num_input_tokens_seen": 158410048, "step": 3615, "train_runtime": 27944.4625, "train_tokens_per_second": 5668.746 }, { "epoch": 0.2437382170751414, "grad_norm": 0.7829852555366933, "learning_rate": 9.638191777176367e-06, "loss": 0.40036301612854003, "num_input_tokens_seen": 158632248, "step": 3620, "train_runtime": 27978.7949, "train_tokens_per_second": 5669.731 }, { "epoch": 0.24407487207110154, "grad_norm": 0.7554602216351339, "learning_rate": 9.637203617701446e-06, "loss": 0.41867575645446775, "num_input_tokens_seen": 158861832, "step": 3625, "train_runtime": 28021.0376, "train_tokens_per_second": 5669.377 }, { "epoch": 0.24441152706706168, "grad_norm": 0.7700724836949714, "learning_rate": 9.63621416144732e-06, "loss": 0.3974162578582764, "num_input_tokens_seen": 159076104, "step": 3630, "train_runtime": 28057.1542, "train_tokens_per_second": 5669.716 }, { "epoch": 0.24474818206302182, "grad_norm": 0.819901947145382, "learning_rate": 9.635223408690688e-06, "loss": 0.39289240837097167, "num_input_tokens_seen": 159275688, "step": 3635, "train_runtime": 28092.5481, "train_tokens_per_second": 5669.678 }, { "epoch": 0.24508483705898196, "grad_norm": 0.74792422760683, "learning_rate": 9.63423135970861e-06, "loss": 0.4178638935089111, "num_input_tokens_seen": 159506232, "step": 3640, "train_runtime": 28131.9808, "train_tokens_per_second": 5669.925 }, { "epoch": 0.2454214920549421, "grad_norm": 0.8690926777352274, "learning_rate": 9.633238014778511e-06, "loss": 0.4228395462036133, "num_input_tokens_seen": 159735712, "step": 3645, "train_runtime": 28164.6263, "train_tokens_per_second": 5671.501 }, { "epoch": 0.24575814705090224, "grad_norm": 0.8408876506004788, "learning_rate": 9.632243374178173e-06, "loss": 0.3977930784225464, "num_input_tokens_seen": 159959000, "step": 3650, "train_runtime": 28206.3804, "train_tokens_per_second": 5671.022 }, { "epoch": 0.24609480204686238, "grad_norm": 0.8178577594154023, "learning_rate": 9.63124743818575e-06, "loss": 0.42597079277038574, "num_input_tokens_seen": 160183304, "step": 3655, "train_runtime": 28242.8523, "train_tokens_per_second": 5671.64 }, { "epoch": 0.24643145704282252, "grad_norm": 0.7174819842350753, "learning_rate": 9.630250207079745e-06, "loss": 0.385437536239624, "num_input_tokens_seen": 160396208, "step": 3660, "train_runtime": 28279.1927, "train_tokens_per_second": 5671.881 }, { "epoch": 0.24676811203878266, "grad_norm": 0.9558291181876568, "learning_rate": 9.629251681139038e-06, "loss": 0.41692662239074707, "num_input_tokens_seen": 160619648, "step": 3665, "train_runtime": 28315.8408, "train_tokens_per_second": 5672.431 }, { "epoch": 0.2471047670347428, "grad_norm": 0.7393493036785912, "learning_rate": 9.628251860642857e-06, "loss": 0.40501389503479, "num_input_tokens_seen": 160832936, "step": 3670, "train_runtime": 28358.3536, "train_tokens_per_second": 5671.448 }, { "epoch": 0.24744142203070293, "grad_norm": 1.3913304565406266, "learning_rate": 9.627250745870805e-06, "loss": 0.4110020637512207, "num_input_tokens_seen": 161045560, "step": 3675, "train_runtime": 28395.0175, "train_tokens_per_second": 5671.613 }, { "epoch": 0.24777807702666307, "grad_norm": 0.7989443375204172, "learning_rate": 9.626248337102834e-06, "loss": 0.4464590072631836, "num_input_tokens_seen": 161267264, "step": 3680, "train_runtime": 28433.9863, "train_tokens_per_second": 5671.638 }, { "epoch": 0.2481147320226232, "grad_norm": 0.8100743623465356, "learning_rate": 9.625244634619269e-06, "loss": 0.42216014862060547, "num_input_tokens_seen": 161484928, "step": 3685, "train_runtime": 28470.6875, "train_tokens_per_second": 5671.971 }, { "epoch": 0.24845138701858335, "grad_norm": 0.8140092686493631, "learning_rate": 9.62423963870079e-06, "loss": 0.4016411781311035, "num_input_tokens_seen": 161695760, "step": 3690, "train_runtime": 28513.9311, "train_tokens_per_second": 5670.764 }, { "epoch": 0.2487880420145435, "grad_norm": 0.7547948701222302, "learning_rate": 9.623233349628441e-06, "loss": 0.36588501930236816, "num_input_tokens_seen": 161906344, "step": 3695, "train_runtime": 28554.4813, "train_tokens_per_second": 5670.085 }, { "epoch": 0.24912469701050363, "grad_norm": 0.7855444375692547, "learning_rate": 9.62222576768363e-06, "loss": 0.37874155044555663, "num_input_tokens_seen": 162121952, "step": 3700, "train_runtime": 28593.7113, "train_tokens_per_second": 5669.846 }, { "epoch": 0.24946135200646377, "grad_norm": 0.8013508326751752, "learning_rate": 9.62121689314812e-06, "loss": 0.4508801460266113, "num_input_tokens_seen": 162339592, "step": 3705, "train_runtime": 28637.9282, "train_tokens_per_second": 5668.692 }, { "epoch": 0.2497980070024239, "grad_norm": 0.8341179639748463, "learning_rate": 9.620206726304045e-06, "loss": 0.4121876239776611, "num_input_tokens_seen": 162551488, "step": 3710, "train_runtime": 28677.3311, "train_tokens_per_second": 5668.292 }, { "epoch": 0.2501346619983841, "grad_norm": 0.7606955484077755, "learning_rate": 9.61919526743389e-06, "loss": 0.4007285118103027, "num_input_tokens_seen": 162775296, "step": 3715, "train_runtime": 28717.1122, "train_tokens_per_second": 5668.233 }, { "epoch": 0.2504713169943442, "grad_norm": 0.7586767868766064, "learning_rate": 9.618182516820507e-06, "loss": 0.4169614315032959, "num_input_tokens_seen": 163004008, "step": 3720, "train_runtime": 28752.7905, "train_tokens_per_second": 5669.154 }, { "epoch": 0.25080797199030436, "grad_norm": 0.7958372407148936, "learning_rate": 9.61716847474711e-06, "loss": 0.38545975685119627, "num_input_tokens_seen": 163216408, "step": 3725, "train_runtime": 28788.1056, "train_tokens_per_second": 5669.578 }, { "epoch": 0.2511446269862645, "grad_norm": 0.7821165797023588, "learning_rate": 9.616153141497273e-06, "loss": 0.41805257797241213, "num_input_tokens_seen": 163430088, "step": 3730, "train_runtime": 28827.4553, "train_tokens_per_second": 5669.251 }, { "epoch": 0.25148128198222464, "grad_norm": 0.8340007896342425, "learning_rate": 9.61513651735493e-06, "loss": 0.37319297790527345, "num_input_tokens_seen": 163642328, "step": 3735, "train_runtime": 28865.8432, "train_tokens_per_second": 5669.065 }, { "epoch": 0.2518179369781848, "grad_norm": 0.8830424913719485, "learning_rate": 9.614118602604376e-06, "loss": 0.3945745944976807, "num_input_tokens_seen": 163838104, "step": 3740, "train_runtime": 28903.991, "train_tokens_per_second": 5668.356 }, { "epoch": 0.2521545919741449, "grad_norm": 0.8052297510787393, "learning_rate": 9.613099397530267e-06, "loss": 0.3722787380218506, "num_input_tokens_seen": 164064200, "step": 3745, "train_runtime": 28947.9133, "train_tokens_per_second": 5667.566 }, { "epoch": 0.25249124697010505, "grad_norm": 0.7862742185087508, "learning_rate": 9.612078902417623e-06, "loss": 0.4092113018035889, "num_input_tokens_seen": 164293832, "step": 3750, "train_runtime": 28984.6022, "train_tokens_per_second": 5668.314 }, { "epoch": 0.2528279019660652, "grad_norm": 0.917777159281807, "learning_rate": 9.611057117551821e-06, "loss": 0.4049520492553711, "num_input_tokens_seen": 164494120, "step": 3755, "train_runtime": 29022.09, "train_tokens_per_second": 5667.894 }, { "epoch": 0.25316455696202533, "grad_norm": 0.7487164986896401, "learning_rate": 9.610034043218598e-06, "loss": 0.41929073333740235, "num_input_tokens_seen": 164721320, "step": 3760, "train_runtime": 29064.6791, "train_tokens_per_second": 5667.405 }, { "epoch": 0.2535012119579855, "grad_norm": 0.8821854609765899, "learning_rate": 9.609009679704057e-06, "loss": 0.4089076995849609, "num_input_tokens_seen": 164941328, "step": 3765, "train_runtime": 29100.0265, "train_tokens_per_second": 5668.082 }, { "epoch": 0.2538378669539456, "grad_norm": 0.8451569510904378, "learning_rate": 9.607984027294654e-06, "loss": 0.4017925262451172, "num_input_tokens_seen": 165148144, "step": 3770, "train_runtime": 29142.825, "train_tokens_per_second": 5666.854 }, { "epoch": 0.25417452194990575, "grad_norm": 0.7139702054990582, "learning_rate": 9.606957086277213e-06, "loss": 0.4037941455841064, "num_input_tokens_seen": 165372064, "step": 3775, "train_runtime": 29183.2104, "train_tokens_per_second": 5666.685 }, { "epoch": 0.2545111769458659, "grad_norm": 0.8399965732594856, "learning_rate": 9.605928856938913e-06, "loss": 0.4064283847808838, "num_input_tokens_seen": 165589000, "step": 3780, "train_runtime": 29221.4526, "train_tokens_per_second": 5666.693 }, { "epoch": 0.25484783194182603, "grad_norm": 0.7840999876703054, "learning_rate": 9.604899339567298e-06, "loss": 0.3694040060043335, "num_input_tokens_seen": 165806496, "step": 3785, "train_runtime": 29262.2531, "train_tokens_per_second": 5666.225 }, { "epoch": 0.25518448693778617, "grad_norm": 0.8254996088572744, "learning_rate": 9.603868534450263e-06, "loss": 0.370687198638916, "num_input_tokens_seen": 166040152, "step": 3790, "train_runtime": 29297.3995, "train_tokens_per_second": 5667.402 }, { "epoch": 0.2555211419337463, "grad_norm": 0.8205302355074221, "learning_rate": 9.602836441876074e-06, "loss": 0.3572968006134033, "num_input_tokens_seen": 166264712, "step": 3795, "train_runtime": 29337.7818, "train_tokens_per_second": 5667.256 }, { "epoch": 0.25585779692970645, "grad_norm": 0.9811797993807015, "learning_rate": 9.601803062133353e-06, "loss": 0.3995164394378662, "num_input_tokens_seen": 166486544, "step": 3800, "train_runtime": 29381.5758, "train_tokens_per_second": 5666.359 }, { "epoch": 0.2561944519256666, "grad_norm": 0.7702336235429141, "learning_rate": 9.600768395511078e-06, "loss": 0.3709728717803955, "num_input_tokens_seen": 166705432, "step": 3805, "train_runtime": 29417.1853, "train_tokens_per_second": 5666.94 }, { "epoch": 0.25653110692162673, "grad_norm": 0.8067121262918427, "learning_rate": 9.599732442298592e-06, "loss": 0.39358603954315186, "num_input_tokens_seen": 166928072, "step": 3810, "train_runtime": 29453.7851, "train_tokens_per_second": 5667.457 }, { "epoch": 0.25686776191758687, "grad_norm": 0.8388091751069785, "learning_rate": 9.598695202785596e-06, "loss": 0.3980567216873169, "num_input_tokens_seen": 167135336, "step": 3815, "train_runtime": 29489.9025, "train_tokens_per_second": 5667.545 }, { "epoch": 0.257204416913547, "grad_norm": 0.7655332462464155, "learning_rate": 9.59765667726215e-06, "loss": 0.3841102600097656, "num_input_tokens_seen": 167356664, "step": 3820, "train_runtime": 29526.6684, "train_tokens_per_second": 5667.983 }, { "epoch": 0.25754107190950715, "grad_norm": 0.8418059528589851, "learning_rate": 9.596616866018677e-06, "loss": 0.46039524078369143, "num_input_tokens_seen": 167568600, "step": 3825, "train_runtime": 29568.9722, "train_tokens_per_second": 5667.042 }, { "epoch": 0.2578777269054673, "grad_norm": 0.87917393714771, "learning_rate": 9.595575769345955e-06, "loss": 0.3880587100982666, "num_input_tokens_seen": 167766736, "step": 3830, "train_runtime": 29608.4677, "train_tokens_per_second": 5666.174 }, { "epoch": 0.2582143819014274, "grad_norm": 0.7766137760871757, "learning_rate": 9.594533387535122e-06, "loss": 0.41129217147827146, "num_input_tokens_seen": 167995600, "step": 3835, "train_runtime": 29647.1244, "train_tokens_per_second": 5666.506 }, { "epoch": 0.25855103689738757, "grad_norm": 0.7405296564338093, "learning_rate": 9.593489720877678e-06, "loss": 0.4008028984069824, "num_input_tokens_seen": 168214488, "step": 3840, "train_runtime": 29683.6625, "train_tokens_per_second": 5666.905 }, { "epoch": 0.2588876918933477, "grad_norm": 0.8634330150776178, "learning_rate": 9.592444769665482e-06, "loss": 0.37677698135375975, "num_input_tokens_seen": 168446672, "step": 3845, "train_runtime": 29726.006, "train_tokens_per_second": 5666.643 }, { "epoch": 0.25922434688930784, "grad_norm": 0.967218365398896, "learning_rate": 9.59139853419075e-06, "loss": 0.3776779413223267, "num_input_tokens_seen": 168649368, "step": 3850, "train_runtime": 29767.8639, "train_tokens_per_second": 5665.484 }, { "epoch": 0.259561001885268, "grad_norm": 0.7776571735726057, "learning_rate": 9.590351014746059e-06, "loss": 0.40406084060668945, "num_input_tokens_seen": 168875024, "step": 3855, "train_runtime": 29804.1223, "train_tokens_per_second": 5666.163 }, { "epoch": 0.2598976568812281, "grad_norm": 1.1756300159580646, "learning_rate": 9.589302211624343e-06, "loss": 0.39687304496765136, "num_input_tokens_seen": 169090984, "step": 3860, "train_runtime": 29840.2711, "train_tokens_per_second": 5666.536 }, { "epoch": 0.26023431187718826, "grad_norm": 0.819456740850995, "learning_rate": 9.5882521251189e-06, "loss": 0.3968550682067871, "num_input_tokens_seen": 169310120, "step": 3865, "train_runtime": 29877.9357, "train_tokens_per_second": 5666.728 }, { "epoch": 0.2605709668731484, "grad_norm": 0.8515658291218985, "learning_rate": 9.58720075552338e-06, "loss": 0.42056074142456057, "num_input_tokens_seen": 169524504, "step": 3870, "train_runtime": 29909.434, "train_tokens_per_second": 5667.928 }, { "epoch": 0.26090762186910854, "grad_norm": 0.8783050270072679, "learning_rate": 9.586148103131797e-06, "loss": 0.40169625282287597, "num_input_tokens_seen": 169733248, "step": 3875, "train_runtime": 29944.6725, "train_tokens_per_second": 5668.229 }, { "epoch": 0.2612442768650687, "grad_norm": 0.857473518999431, "learning_rate": 9.585094168238518e-06, "loss": 0.4272635459899902, "num_input_tokens_seen": 169943480, "step": 3880, "train_runtime": 29983.9133, "train_tokens_per_second": 5667.822 }, { "epoch": 0.2615809318610288, "grad_norm": 0.8162084475991911, "learning_rate": 9.58403895113828e-06, "loss": 0.39615912437438966, "num_input_tokens_seen": 170164936, "step": 3885, "train_runtime": 30023.2923, "train_tokens_per_second": 5667.764 }, { "epoch": 0.26191758685698896, "grad_norm": 0.773095299777449, "learning_rate": 9.582982452126164e-06, "loss": 0.380422306060791, "num_input_tokens_seen": 170380728, "step": 3890, "train_runtime": 30061.2728, "train_tokens_per_second": 5667.782 }, { "epoch": 0.2622542418529491, "grad_norm": 0.7250445142657057, "learning_rate": 9.58192467149762e-06, "loss": 0.3720268726348877, "num_input_tokens_seen": 170591568, "step": 3895, "train_runtime": 30102.8751, "train_tokens_per_second": 5666.953 }, { "epoch": 0.26259089684890924, "grad_norm": 0.8455822434092976, "learning_rate": 9.580865609548452e-06, "loss": 0.4109041213989258, "num_input_tokens_seen": 170793416, "step": 3900, "train_runtime": 30139.1143, "train_tokens_per_second": 5666.836 }, { "epoch": 0.2629275518448694, "grad_norm": 0.669931714570705, "learning_rate": 9.579805266574824e-06, "loss": 0.3842399835586548, "num_input_tokens_seen": 171006328, "step": 3905, "train_runtime": 30178.5838, "train_tokens_per_second": 5666.48 }, { "epoch": 0.2632642068408295, "grad_norm": 0.6870277390309487, "learning_rate": 9.578743642873258e-06, "loss": 0.40047216415405273, "num_input_tokens_seen": 171209880, "step": 3910, "train_runtime": 30217.8046, "train_tokens_per_second": 5665.861 }, { "epoch": 0.26360086183678966, "grad_norm": 0.7479204866431858, "learning_rate": 9.57768073874063e-06, "loss": 0.40533103942871096, "num_input_tokens_seen": 171434584, "step": 3915, "train_runtime": 30250.4257, "train_tokens_per_second": 5667.179 }, { "epoch": 0.2639375168327498, "grad_norm": 0.822857586143697, "learning_rate": 9.576616554474182e-06, "loss": 0.41611337661743164, "num_input_tokens_seen": 171637768, "step": 3920, "train_runtime": 30287.808, "train_tokens_per_second": 5666.893 }, { "epoch": 0.26427417182870994, "grad_norm": 0.7335208763069258, "learning_rate": 9.575551090371512e-06, "loss": 0.39514660835266113, "num_input_tokens_seen": 171845072, "step": 3925, "train_runtime": 30328.6771, "train_tokens_per_second": 5666.092 }, { "epoch": 0.2646108268246701, "grad_norm": 0.7927281370222846, "learning_rate": 9.574484346730564e-06, "loss": 0.4031528472900391, "num_input_tokens_seen": 172066528, "step": 3930, "train_runtime": 30370.1573, "train_tokens_per_second": 5665.645 }, { "epoch": 0.2649474818206302, "grad_norm": 0.7830404478638062, "learning_rate": 9.573416323849658e-06, "loss": 0.4126886367797852, "num_input_tokens_seen": 172285504, "step": 3935, "train_runtime": 30411.2446, "train_tokens_per_second": 5665.191 }, { "epoch": 0.26528413681659035, "grad_norm": 0.7639494210600385, "learning_rate": 9.572347022027461e-06, "loss": 0.3947685718536377, "num_input_tokens_seen": 172512448, "step": 3940, "train_runtime": 30452.9824, "train_tokens_per_second": 5664.879 }, { "epoch": 0.2656207918125505, "grad_norm": 0.7465504294757535, "learning_rate": 9.571276441563e-06, "loss": 0.40018043518066404, "num_input_tokens_seen": 172712640, "step": 3945, "train_runtime": 30484.642, "train_tokens_per_second": 5665.562 }, { "epoch": 0.26595744680851063, "grad_norm": 0.79021748664721, "learning_rate": 9.570204582755659e-06, "loss": 0.38366117477416994, "num_input_tokens_seen": 172934512, "step": 3950, "train_runtime": 30524.2614, "train_tokens_per_second": 5665.477 }, { "epoch": 0.2662941018044708, "grad_norm": 0.9006277156621565, "learning_rate": 9.569131445905178e-06, "loss": 0.4079860210418701, "num_input_tokens_seen": 173148536, "step": 3955, "train_runtime": 30557.4244, "train_tokens_per_second": 5666.333 }, { "epoch": 0.2666307568004309, "grad_norm": 0.8299161339057768, "learning_rate": 9.568057031311659e-06, "loss": 0.41454520225524905, "num_input_tokens_seen": 173357456, "step": 3960, "train_runtime": 30592.1621, "train_tokens_per_second": 5666.728 }, { "epoch": 0.26696741179639105, "grad_norm": 0.9401299888719756, "learning_rate": 9.566981339275557e-06, "loss": 0.43401298522949217, "num_input_tokens_seen": 173565960, "step": 3965, "train_runtime": 30636.8629, "train_tokens_per_second": 5665.265 }, { "epoch": 0.2673040667923512, "grad_norm": 0.7744089765372347, "learning_rate": 9.565904370097687e-06, "loss": 0.4027921199798584, "num_input_tokens_seen": 173765184, "step": 3970, "train_runtime": 30675.2756, "train_tokens_per_second": 5664.666 }, { "epoch": 0.26764072178831133, "grad_norm": 1.1387875256699147, "learning_rate": 9.564826124079219e-06, "loss": 0.3860454082489014, "num_input_tokens_seen": 173982664, "step": 3975, "train_runtime": 30722.6571, "train_tokens_per_second": 5663.008 }, { "epoch": 0.26797737678427147, "grad_norm": 0.7717245266267511, "learning_rate": 9.563746601521681e-06, "loss": 0.37142066955566405, "num_input_tokens_seen": 174207720, "step": 3980, "train_runtime": 30764.4205, "train_tokens_per_second": 5662.636 }, { "epoch": 0.2683140317802316, "grad_norm": 0.8633313009939835, "learning_rate": 9.562665802726961e-06, "loss": 0.39812779426574707, "num_input_tokens_seen": 174437200, "step": 3985, "train_runtime": 30809.6747, "train_tokens_per_second": 5661.767 }, { "epoch": 0.26865068677619175, "grad_norm": 0.79235769535237, "learning_rate": 9.561583727997297e-06, "loss": 0.3973848819732666, "num_input_tokens_seen": 174649000, "step": 3990, "train_runtime": 30852.8543, "train_tokens_per_second": 5660.708 }, { "epoch": 0.2689873417721519, "grad_norm": 0.866887420036326, "learning_rate": 9.560500377635288e-06, "loss": 0.4132582664489746, "num_input_tokens_seen": 174869968, "step": 3995, "train_runtime": 30894.8991, "train_tokens_per_second": 5660.157 }, { "epoch": 0.26932399676811203, "grad_norm": 0.8490880534158571, "learning_rate": 9.559415751943893e-06, "loss": 0.4121055603027344, "num_input_tokens_seen": 175087088, "step": 4000, "train_runtime": 30928.2656, "train_tokens_per_second": 5661.07 }, { "epoch": 0.26966065176407217, "grad_norm": 0.7247750937341004, "learning_rate": 9.558329851226422e-06, "loss": 0.3906848430633545, "num_input_tokens_seen": 175314216, "step": 4005, "train_runtime": 30967.3219, "train_tokens_per_second": 5661.265 }, { "epoch": 0.2699973067600323, "grad_norm": 0.8575764814098764, "learning_rate": 9.557242675786542e-06, "loss": 0.4193889141082764, "num_input_tokens_seen": 175541064, "step": 4010, "train_runtime": 31013.366, "train_tokens_per_second": 5660.175 }, { "epoch": 0.27033396175599245, "grad_norm": 0.7331252032970815, "learning_rate": 9.55615422592828e-06, "loss": 0.4430998802185059, "num_input_tokens_seen": 175770592, "step": 4015, "train_runtime": 31053.1239, "train_tokens_per_second": 5660.319 }, { "epoch": 0.2706706167519526, "grad_norm": 0.8233208505066181, "learning_rate": 9.555064501956018e-06, "loss": 0.4185193061828613, "num_input_tokens_seen": 175988096, "step": 4020, "train_runtime": 31090.813, "train_tokens_per_second": 5660.453 }, { "epoch": 0.2710072717479127, "grad_norm": 0.7929784850811431, "learning_rate": 9.553973504174493e-06, "loss": 0.3700920581817627, "num_input_tokens_seen": 176213488, "step": 4025, "train_runtime": 31131.4846, "train_tokens_per_second": 5660.298 }, { "epoch": 0.27134392674387287, "grad_norm": 0.8802925347262501, "learning_rate": 9.5528812328888e-06, "loss": 0.41269850730895996, "num_input_tokens_seen": 176420144, "step": 4030, "train_runtime": 31173.5245, "train_tokens_per_second": 5659.294 }, { "epoch": 0.271680581739833, "grad_norm": 0.7894741861959437, "learning_rate": 9.551787688404386e-06, "loss": 0.3877572536468506, "num_input_tokens_seen": 176635200, "step": 4035, "train_runtime": 31218.475, "train_tokens_per_second": 5658.034 }, { "epoch": 0.27201723673579314, "grad_norm": 0.7609981119661086, "learning_rate": 9.550692871027061e-06, "loss": 0.3883471727371216, "num_input_tokens_seen": 176856552, "step": 4040, "train_runtime": 31261.3151, "train_tokens_per_second": 5657.361 }, { "epoch": 0.2723538917317533, "grad_norm": 0.7842118778601046, "learning_rate": 9.549596781062984e-06, "loss": 0.37834415435791013, "num_input_tokens_seen": 177085864, "step": 4045, "train_runtime": 31299.8686, "train_tokens_per_second": 5657.719 }, { "epoch": 0.2726905467277134, "grad_norm": 0.8324923888304009, "learning_rate": 9.548499418818677e-06, "loss": 0.3912312984466553, "num_input_tokens_seen": 177292800, "step": 4050, "train_runtime": 31343.6672, "train_tokens_per_second": 5656.415 }, { "epoch": 0.27302720172367356, "grad_norm": 0.886343399880937, "learning_rate": 9.547400784601011e-06, "loss": 0.448984956741333, "num_input_tokens_seen": 177509120, "step": 4055, "train_runtime": 31388.1483, "train_tokens_per_second": 5655.291 }, { "epoch": 0.2733638567196337, "grad_norm": 0.7611731029617864, "learning_rate": 9.546300878717216e-06, "loss": 0.41724767684936526, "num_input_tokens_seen": 177737192, "step": 4060, "train_runtime": 31419.4811, "train_tokens_per_second": 5656.91 }, { "epoch": 0.27370051171559384, "grad_norm": 0.7391294054271582, "learning_rate": 9.545199701474877e-06, "loss": 0.3876931667327881, "num_input_tokens_seen": 177955528, "step": 4065, "train_runtime": 31460.3252, "train_tokens_per_second": 5656.506 }, { "epoch": 0.274037166711554, "grad_norm": 0.8122534322473342, "learning_rate": 9.544097253181935e-06, "loss": 0.37918825149536134, "num_input_tokens_seen": 178168688, "step": 4070, "train_runtime": 31501.2931, "train_tokens_per_second": 5655.917 }, { "epoch": 0.2743738217075141, "grad_norm": 0.7594531409775707, "learning_rate": 9.542993534146687e-06, "loss": 0.41271028518676756, "num_input_tokens_seen": 178382216, "step": 4075, "train_runtime": 31548.6623, "train_tokens_per_second": 5654.193 }, { "epoch": 0.27471047670347426, "grad_norm": 0.813877169259893, "learning_rate": 9.541888544677784e-06, "loss": 0.4018410682678223, "num_input_tokens_seen": 178601400, "step": 4080, "train_runtime": 31583.5769, "train_tokens_per_second": 5654.882 }, { "epoch": 0.2750471316994344, "grad_norm": 0.8060293108187504, "learning_rate": 9.540782285084232e-06, "loss": 0.36272602081298827, "num_input_tokens_seen": 178815704, "step": 4085, "train_runtime": 31624.6421, "train_tokens_per_second": 5654.316 }, { "epoch": 0.27538378669539454, "grad_norm": 0.7676915231843366, "learning_rate": 9.539674755675392e-06, "loss": 0.39566807746887206, "num_input_tokens_seen": 179033752, "step": 4090, "train_runtime": 31667.4816, "train_tokens_per_second": 5653.552 }, { "epoch": 0.2757204416913547, "grad_norm": 0.6913331471393089, "learning_rate": 9.538565956760983e-06, "loss": 0.35824832916259763, "num_input_tokens_seen": 179269312, "step": 4095, "train_runtime": 31701.6169, "train_tokens_per_second": 5654.895 }, { "epoch": 0.2760570966873148, "grad_norm": 0.7630923484514573, "learning_rate": 9.537455888651078e-06, "loss": 0.3908623933792114, "num_input_tokens_seen": 179500456, "step": 4100, "train_runtime": 31737.6882, "train_tokens_per_second": 5655.751 }, { "epoch": 0.27639375168327496, "grad_norm": 0.8057751017404143, "learning_rate": 9.536344551656103e-06, "loss": 0.4113442420959473, "num_input_tokens_seen": 179727568, "step": 4105, "train_runtime": 31778.3965, "train_tokens_per_second": 5655.653 }, { "epoch": 0.2767304066792351, "grad_norm": 0.7452483379248684, "learning_rate": 9.535231946086838e-06, "loss": 0.392077112197876, "num_input_tokens_seen": 179947920, "step": 4110, "train_runtime": 31810.5777, "train_tokens_per_second": 5656.858 }, { "epoch": 0.27706706167519524, "grad_norm": 0.7935004896667632, "learning_rate": 9.534118072254421e-06, "loss": 0.41229848861694335, "num_input_tokens_seen": 180172368, "step": 4115, "train_runtime": 31849.5051, "train_tokens_per_second": 5656.991 }, { "epoch": 0.2774037166711554, "grad_norm": 0.782426266760514, "learning_rate": 9.533002930470345e-06, "loss": 0.38343167304992676, "num_input_tokens_seen": 180392712, "step": 4120, "train_runtime": 31893.6268, "train_tokens_per_second": 5656.074 }, { "epoch": 0.2777403716671155, "grad_norm": 0.6585746266135624, "learning_rate": 9.531886521046452e-06, "loss": 0.38598432540893557, "num_input_tokens_seen": 180594944, "step": 4125, "train_runtime": 31934.9141, "train_tokens_per_second": 5655.094 }, { "epoch": 0.27807702666307565, "grad_norm": 0.8150349479481921, "learning_rate": 9.530768844294947e-06, "loss": 0.41448087692260743, "num_input_tokens_seen": 180816024, "step": 4130, "train_runtime": 31975.4857, "train_tokens_per_second": 5654.833 }, { "epoch": 0.2784136816590358, "grad_norm": 0.8985901076929287, "learning_rate": 9.52964990052838e-06, "loss": 0.41909160614013674, "num_input_tokens_seen": 181035024, "step": 4135, "train_runtime": 32014.2767, "train_tokens_per_second": 5654.822 }, { "epoch": 0.27875033665499593, "grad_norm": 0.7912879897563827, "learning_rate": 9.528529690059663e-06, "loss": 0.3741894245147705, "num_input_tokens_seen": 181258672, "step": 4140, "train_runtime": 32055.2042, "train_tokens_per_second": 5654.579 }, { "epoch": 0.2790869916509561, "grad_norm": 0.9153777980141117, "learning_rate": 9.52740821320206e-06, "loss": 0.4044219970703125, "num_input_tokens_seen": 181475056, "step": 4145, "train_runtime": 32086.7668, "train_tokens_per_second": 5655.76 }, { "epoch": 0.2794236466469162, "grad_norm": 0.7181310809160721, "learning_rate": 9.526285470269185e-06, "loss": 0.4395021915435791, "num_input_tokens_seen": 181701504, "step": 4150, "train_runtime": 32121.2174, "train_tokens_per_second": 5656.744 }, { "epoch": 0.2797603016428764, "grad_norm": 0.833451101611962, "learning_rate": 9.525161461575012e-06, "loss": 0.4143718719482422, "num_input_tokens_seen": 181905448, "step": 4155, "train_runtime": 32162.0174, "train_tokens_per_second": 5655.909 }, { "epoch": 0.28009695663883655, "grad_norm": 0.9347376730252263, "learning_rate": 9.524036187433867e-06, "loss": 0.38724517822265625, "num_input_tokens_seen": 182111832, "step": 4160, "train_runtime": 32199.5756, "train_tokens_per_second": 5655.722 }, { "epoch": 0.2804336116347967, "grad_norm": 0.7395436682357247, "learning_rate": 9.522909648160427e-06, "loss": 0.38469388484954836, "num_input_tokens_seen": 182331456, "step": 4165, "train_runtime": 32237.7321, "train_tokens_per_second": 5655.84 }, { "epoch": 0.2807702666307568, "grad_norm": 0.9082810498252065, "learning_rate": 9.521781844069727e-06, "loss": 0.4097011566162109, "num_input_tokens_seen": 182555536, "step": 4170, "train_runtime": 32282.4632, "train_tokens_per_second": 5654.944 }, { "epoch": 0.28110692162671697, "grad_norm": 0.8211424225834406, "learning_rate": 9.520652775477154e-06, "loss": 0.38606297969818115, "num_input_tokens_seen": 182776104, "step": 4175, "train_runtime": 32324.1374, "train_tokens_per_second": 5654.477 }, { "epoch": 0.2814435766226771, "grad_norm": 0.6834380753616917, "learning_rate": 9.519522442698447e-06, "loss": 0.36697864532470703, "num_input_tokens_seen": 182986640, "step": 4180, "train_runtime": 32354.2522, "train_tokens_per_second": 5655.722 }, { "epoch": 0.28178023161863724, "grad_norm": 0.8351889375982321, "learning_rate": 9.518390846049699e-06, "loss": 0.4045860290527344, "num_input_tokens_seen": 183200160, "step": 4185, "train_runtime": 32398.1959, "train_tokens_per_second": 5654.641 }, { "epoch": 0.2821168866145974, "grad_norm": 0.7607561247725104, "learning_rate": 9.517257985847361e-06, "loss": 0.42084197998046874, "num_input_tokens_seen": 183411672, "step": 4190, "train_runtime": 32441.1387, "train_tokens_per_second": 5653.676 }, { "epoch": 0.2824535416105575, "grad_norm": 0.7318149860850908, "learning_rate": 9.516123862408232e-06, "loss": 0.4293764591217041, "num_input_tokens_seen": 183636784, "step": 4195, "train_runtime": 32485.1985, "train_tokens_per_second": 5652.937 }, { "epoch": 0.28279019660651766, "grad_norm": 1.0902481858366875, "learning_rate": 9.514988476049466e-06, "loss": 0.3744691848754883, "num_input_tokens_seen": 183850024, "step": 4200, "train_runtime": 32521.0388, "train_tokens_per_second": 5653.264 }, { "epoch": 0.2831268516024778, "grad_norm": 0.7196863893637454, "learning_rate": 9.513851827088567e-06, "loss": 0.39441556930541993, "num_input_tokens_seen": 184055312, "step": 4205, "train_runtime": 32558.0875, "train_tokens_per_second": 5653.136 }, { "epoch": 0.28346350659843794, "grad_norm": 0.901667167722795, "learning_rate": 9.512713915843402e-06, "loss": 0.399395227432251, "num_input_tokens_seen": 184280840, "step": 4210, "train_runtime": 32591.1094, "train_tokens_per_second": 5654.329 }, { "epoch": 0.2838001615943981, "grad_norm": 0.7871649191207917, "learning_rate": 9.511574742632177e-06, "loss": 0.38000011444091797, "num_input_tokens_seen": 184499800, "step": 4215, "train_runtime": 32635.0953, "train_tokens_per_second": 5653.417 }, { "epoch": 0.2841368165903582, "grad_norm": 0.7805206391000944, "learning_rate": 9.510434307773464e-06, "loss": 0.45735921859741213, "num_input_tokens_seen": 184725080, "step": 4220, "train_runtime": 32673.8214, "train_tokens_per_second": 5653.611 }, { "epoch": 0.28447347158631836, "grad_norm": 0.6332223820184592, "learning_rate": 9.509292611586179e-06, "loss": 0.35365097522735595, "num_input_tokens_seen": 184912768, "step": 4225, "train_runtime": 32714.0896, "train_tokens_per_second": 5652.389 }, { "epoch": 0.2848101265822785, "grad_norm": 0.8305072132980625, "learning_rate": 9.508149654389592e-06, "loss": 0.40491819381713867, "num_input_tokens_seen": 185136408, "step": 4230, "train_runtime": 32755.4509, "train_tokens_per_second": 5652.079 }, { "epoch": 0.28514678157823864, "grad_norm": 0.6650135309711892, "learning_rate": 9.507005436503331e-06, "loss": 0.3746334552764893, "num_input_tokens_seen": 185367152, "step": 4235, "train_runtime": 32798.7805, "train_tokens_per_second": 5651.648 }, { "epoch": 0.2854834365741988, "grad_norm": 0.8834317004719436, "learning_rate": 9.505859958247373e-06, "loss": 0.4024499893188477, "num_input_tokens_seen": 185580528, "step": 4240, "train_runtime": 32837.3509, "train_tokens_per_second": 5651.507 }, { "epoch": 0.2858200915701589, "grad_norm": 0.703931424320413, "learning_rate": 9.504713219942045e-06, "loss": 0.3693699359893799, "num_input_tokens_seen": 185800152, "step": 4245, "train_runtime": 32873.2494, "train_tokens_per_second": 5652.017 }, { "epoch": 0.28615674656611906, "grad_norm": 0.7673763574951983, "learning_rate": 9.503565221908029e-06, "loss": 0.3989689350128174, "num_input_tokens_seen": 186023072, "step": 4250, "train_runtime": 32908.5929, "train_tokens_per_second": 5652.72 }, { "epoch": 0.2864934015620792, "grad_norm": 0.7942180767418593, "learning_rate": 9.50241596446636e-06, "loss": 0.41822104454040526, "num_input_tokens_seen": 186251344, "step": 4255, "train_runtime": 32948.6784, "train_tokens_per_second": 5652.771 }, { "epoch": 0.28683005655803934, "grad_norm": 0.8790228905730333, "learning_rate": 9.501265447938423e-06, "loss": 0.40343165397644043, "num_input_tokens_seen": 186459392, "step": 4260, "train_runtime": 32985.9245, "train_tokens_per_second": 5652.696 }, { "epoch": 0.2871667115539995, "grad_norm": 0.8360538773951802, "learning_rate": 9.500113672645958e-06, "loss": 0.41559224128723143, "num_input_tokens_seen": 186674536, "step": 4265, "train_runtime": 33020.78, "train_tokens_per_second": 5653.244 }, { "epoch": 0.2875033665499596, "grad_norm": 0.8611168073988301, "learning_rate": 9.498960638911054e-06, "loss": 0.3698106288909912, "num_input_tokens_seen": 186883568, "step": 4270, "train_runtime": 33066.6343, "train_tokens_per_second": 5651.726 }, { "epoch": 0.28784002154591976, "grad_norm": 0.7947411629350094, "learning_rate": 9.497806347056153e-06, "loss": 0.394811749458313, "num_input_tokens_seen": 187101448, "step": 4275, "train_runtime": 33108.0971, "train_tokens_per_second": 5651.229 }, { "epoch": 0.2881766765418799, "grad_norm": 0.8271288744866215, "learning_rate": 9.49665079740405e-06, "loss": 0.41505231857299807, "num_input_tokens_seen": 187323568, "step": 4280, "train_runtime": 33144.1133, "train_tokens_per_second": 5651.79 }, { "epoch": 0.28851333153784003, "grad_norm": 0.8870087883370243, "learning_rate": 9.495493990277889e-06, "loss": 0.41215314865112307, "num_input_tokens_seen": 187536768, "step": 4285, "train_runtime": 33177.0201, "train_tokens_per_second": 5652.61 }, { "epoch": 0.2888499865338002, "grad_norm": 0.7416815526876334, "learning_rate": 9.49433592600117e-06, "loss": 0.39543790817260743, "num_input_tokens_seen": 187761936, "step": 4290, "train_runtime": 33218.3652, "train_tokens_per_second": 5652.353 }, { "epoch": 0.2891866415297603, "grad_norm": 0.8456820374140082, "learning_rate": 9.49317660489774e-06, "loss": 0.38694300651550295, "num_input_tokens_seen": 187989768, "step": 4295, "train_runtime": 33254.7613, "train_tokens_per_second": 5653.018 }, { "epoch": 0.28952329652572045, "grad_norm": 0.7340597270803788, "learning_rate": 9.4920160272918e-06, "loss": 0.39570274353027346, "num_input_tokens_seen": 188221328, "step": 4300, "train_runtime": 33292.1232, "train_tokens_per_second": 5653.629 }, { "epoch": 0.2898599515216806, "grad_norm": 0.9417045729052645, "learning_rate": 9.490854193507904e-06, "loss": 0.40100975036621095, "num_input_tokens_seen": 188436984, "step": 4305, "train_runtime": 33333.4329, "train_tokens_per_second": 5653.093 }, { "epoch": 0.29019660651764073, "grad_norm": 0.8307091778797395, "learning_rate": 9.489691103870951e-06, "loss": 0.4165069580078125, "num_input_tokens_seen": 188666800, "step": 4310, "train_runtime": 33370.0506, "train_tokens_per_second": 5653.776 }, { "epoch": 0.29053326151360087, "grad_norm": 0.6898420962550031, "learning_rate": 9.488526758706198e-06, "loss": 0.3968646764755249, "num_input_tokens_seen": 188890864, "step": 4315, "train_runtime": 33408.9132, "train_tokens_per_second": 5653.906 }, { "epoch": 0.290869916509561, "grad_norm": 0.9744166501910104, "learning_rate": 9.48736115833925e-06, "loss": 0.42871532440185545, "num_input_tokens_seen": 189097152, "step": 4320, "train_runtime": 33444.6308, "train_tokens_per_second": 5654.036 }, { "epoch": 0.29120657150552115, "grad_norm": 0.7709225593851357, "learning_rate": 9.486194303096062e-06, "loss": 0.388767147064209, "num_input_tokens_seen": 189319032, "step": 4325, "train_runtime": 33480.301, "train_tokens_per_second": 5654.639 }, { "epoch": 0.2915432265014813, "grad_norm": 0.6810949642678763, "learning_rate": 9.485026193302945e-06, "loss": 0.37795631885528563, "num_input_tokens_seen": 189540056, "step": 4330, "train_runtime": 33515.0635, "train_tokens_per_second": 5655.369 }, { "epoch": 0.29187988149744143, "grad_norm": 0.6374851744198567, "learning_rate": 9.483856829286552e-06, "loss": 0.43641042709350586, "num_input_tokens_seen": 189765816, "step": 4335, "train_runtime": 33556.7326, "train_tokens_per_second": 5655.074 }, { "epoch": 0.29221653649340157, "grad_norm": 0.8345515619506504, "learning_rate": 9.482686211373896e-06, "loss": 0.4038511276245117, "num_input_tokens_seen": 189992032, "step": 4340, "train_runtime": 33597.0529, "train_tokens_per_second": 5655.021 }, { "epoch": 0.2925531914893617, "grad_norm": 0.8775359668232541, "learning_rate": 9.481514339892335e-06, "loss": 0.4172847747802734, "num_input_tokens_seen": 190224704, "step": 4345, "train_runtime": 33633.3907, "train_tokens_per_second": 5655.829 }, { "epoch": 0.29288984648532185, "grad_norm": 0.7728830127459773, "learning_rate": 9.48034121516958e-06, "loss": 0.41391868591308595, "num_input_tokens_seen": 190437840, "step": 4350, "train_runtime": 33671.0816, "train_tokens_per_second": 5655.828 }, { "epoch": 0.293226501481282, "grad_norm": 0.7347575506312092, "learning_rate": 9.47916683753369e-06, "loss": 0.38980252742767335, "num_input_tokens_seen": 190656112, "step": 4355, "train_runtime": 33713.543, "train_tokens_per_second": 5655.179 }, { "epoch": 0.2935631564772421, "grad_norm": 0.7225462237696316, "learning_rate": 9.477991207313077e-06, "loss": 0.4024055480957031, "num_input_tokens_seen": 190883776, "step": 4360, "train_runtime": 33754.4757, "train_tokens_per_second": 5655.066 }, { "epoch": 0.29389981147320227, "grad_norm": 0.7312109916350326, "learning_rate": 9.476814324836504e-06, "loss": 0.38675341606140134, "num_input_tokens_seen": 191111960, "step": 4365, "train_runtime": 33789.2531, "train_tokens_per_second": 5655.998 }, { "epoch": 0.2942364664691624, "grad_norm": 0.7752639421468126, "learning_rate": 9.475636190433078e-06, "loss": 0.44519591331481934, "num_input_tokens_seen": 191343016, "step": 4370, "train_runtime": 33827.4824, "train_tokens_per_second": 5656.437 }, { "epoch": 0.29457312146512254, "grad_norm": 0.7480674780381356, "learning_rate": 9.474456804432264e-06, "loss": 0.3989989995956421, "num_input_tokens_seen": 191572600, "step": 4375, "train_runtime": 33864.2914, "train_tokens_per_second": 5657.068 }, { "epoch": 0.2949097764610827, "grad_norm": 0.7492609939786371, "learning_rate": 9.473276167163872e-06, "loss": 0.41669330596923826, "num_input_tokens_seen": 191802056, "step": 4380, "train_runtime": 33903.6008, "train_tokens_per_second": 5657.277 }, { "epoch": 0.2952464314570428, "grad_norm": 0.7254851965917017, "learning_rate": 9.472094278958066e-06, "loss": 0.41675920486450196, "num_input_tokens_seen": 192033856, "step": 4385, "train_runtime": 33947.504, "train_tokens_per_second": 5656.789 }, { "epoch": 0.29558308645300296, "grad_norm": 0.7301224106455536, "learning_rate": 9.470911140145353e-06, "loss": 0.3885148763656616, "num_input_tokens_seen": 192244376, "step": 4390, "train_runtime": 33990.9485, "train_tokens_per_second": 5655.752 }, { "epoch": 0.2959197414489631, "grad_norm": 0.8599934571941987, "learning_rate": 9.469726751056599e-06, "loss": 0.3994889736175537, "num_input_tokens_seen": 192466432, "step": 4395, "train_runtime": 34031.0021, "train_tokens_per_second": 5655.62 }, { "epoch": 0.29625639644492324, "grad_norm": 0.8672385958944913, "learning_rate": 9.468541112023009e-06, "loss": 0.42194247245788574, "num_input_tokens_seen": 192676720, "step": 4400, "train_runtime": 34068.9438, "train_tokens_per_second": 5655.494 }, { "epoch": 0.2965930514408834, "grad_norm": 0.8654785396115573, "learning_rate": 9.467354223376149e-06, "loss": 0.4138471603393555, "num_input_tokens_seen": 192867824, "step": 4405, "train_runtime": 34101.5758, "train_tokens_per_second": 5655.687 }, { "epoch": 0.2969297064368435, "grad_norm": 0.7586880855501626, "learning_rate": 9.466166085447923e-06, "loss": 0.4040337562561035, "num_input_tokens_seen": 193079552, "step": 4410, "train_runtime": 34144.2523, "train_tokens_per_second": 5654.819 }, { "epoch": 0.29726636143280366, "grad_norm": 0.8413204922562729, "learning_rate": 9.464976698570595e-06, "loss": 0.3852673053741455, "num_input_tokens_seen": 193274704, "step": 4415, "train_runtime": 34179.0678, "train_tokens_per_second": 5654.768 }, { "epoch": 0.2976030164287638, "grad_norm": 0.8227530497102407, "learning_rate": 9.463786063076769e-06, "loss": 0.42119736671447755, "num_input_tokens_seen": 193494016, "step": 4420, "train_runtime": 34217.4917, "train_tokens_per_second": 5654.828 }, { "epoch": 0.29793967142472394, "grad_norm": 0.8498857055875949, "learning_rate": 9.462594179299408e-06, "loss": 0.34813380241394043, "num_input_tokens_seen": 193708944, "step": 4425, "train_runtime": 34255.6112, "train_tokens_per_second": 5654.809 }, { "epoch": 0.2982763264206841, "grad_norm": 0.7591384035910306, "learning_rate": 9.461401047571811e-06, "loss": 0.39094252586364747, "num_input_tokens_seen": 193940712, "step": 4430, "train_runtime": 34291.0594, "train_tokens_per_second": 5655.722 }, { "epoch": 0.2986129814166442, "grad_norm": 0.8057409790041082, "learning_rate": 9.460206668227639e-06, "loss": 0.4155745983123779, "num_input_tokens_seen": 194168936, "step": 4435, "train_runtime": 34330.974, "train_tokens_per_second": 5655.795 }, { "epoch": 0.29894963641260436, "grad_norm": 0.7522439279097726, "learning_rate": 9.459011041600895e-06, "loss": 0.39428043365478516, "num_input_tokens_seen": 194397872, "step": 4440, "train_runtime": 34371.2051, "train_tokens_per_second": 5655.835 }, { "epoch": 0.2992862914085645, "grad_norm": 0.8885125640048409, "learning_rate": 9.457814168025932e-06, "loss": 0.3819078207015991, "num_input_tokens_seen": 194618856, "step": 4445, "train_runtime": 34409.2545, "train_tokens_per_second": 5656.003 }, { "epoch": 0.29962294640452464, "grad_norm": 0.8798594554422206, "learning_rate": 9.456616047837452e-06, "loss": 0.4244089603424072, "num_input_tokens_seen": 194815632, "step": 4450, "train_runtime": 34451.3067, "train_tokens_per_second": 5654.811 }, { "epoch": 0.2999596014004848, "grad_norm": 0.7140830042785486, "learning_rate": 9.455416681370506e-06, "loss": 0.43105688095092776, "num_input_tokens_seen": 195043320, "step": 4455, "train_runtime": 34491.908, "train_tokens_per_second": 5654.756 }, { "epoch": 0.3002962563964449, "grad_norm": 0.7933555904953391, "learning_rate": 9.45421606896049e-06, "loss": 0.4107870101928711, "num_input_tokens_seen": 195273800, "step": 4460, "train_runtime": 34532.6899, "train_tokens_per_second": 5654.752 }, { "epoch": 0.30063291139240506, "grad_norm": 0.7656195298280324, "learning_rate": 9.453014210943155e-06, "loss": 0.39834353923797605, "num_input_tokens_seen": 195492912, "step": 4465, "train_runtime": 34574.8621, "train_tokens_per_second": 5654.192 }, { "epoch": 0.3009695663883652, "grad_norm": 0.7817448952040295, "learning_rate": 9.451811107654596e-06, "loss": 0.39757986068725587, "num_input_tokens_seen": 195716896, "step": 4470, "train_runtime": 34621.7737, "train_tokens_per_second": 5653.0 }, { "epoch": 0.30130622138432533, "grad_norm": 0.7841726368249392, "learning_rate": 9.450606759431255e-06, "loss": 0.40091800689697266, "num_input_tokens_seen": 195945064, "step": 4475, "train_runtime": 34656.1692, "train_tokens_per_second": 5653.974 }, { "epoch": 0.3016428763802855, "grad_norm": 0.8817669510853672, "learning_rate": 9.449401166609928e-06, "loss": 0.42542014122009275, "num_input_tokens_seen": 196155296, "step": 4480, "train_runtime": 34691.0919, "train_tokens_per_second": 5654.342 }, { "epoch": 0.3019795313762456, "grad_norm": 0.958339871121062, "learning_rate": 9.448194329527752e-06, "loss": 0.40885372161865235, "num_input_tokens_seen": 196367168, "step": 4485, "train_runtime": 34725.1749, "train_tokens_per_second": 5654.894 }, { "epoch": 0.30231618637220575, "grad_norm": 0.7219539133285781, "learning_rate": 9.446986248522216e-06, "loss": 0.38100175857543944, "num_input_tokens_seen": 196585760, "step": 4490, "train_runtime": 34763.5979, "train_tokens_per_second": 5654.931 }, { "epoch": 0.3026528413681659, "grad_norm": 0.7623511745984738, "learning_rate": 9.445776923931157e-06, "loss": 0.3696560859680176, "num_input_tokens_seen": 196799296, "step": 4495, "train_runtime": 34801.3851, "train_tokens_per_second": 5654.927 }, { "epoch": 0.30298949636412603, "grad_norm": 0.7900772624336759, "learning_rate": 9.444566356092754e-06, "loss": 0.3985780715942383, "num_input_tokens_seen": 197027464, "step": 4500, "train_runtime": 34835.2173, "train_tokens_per_second": 5655.985 }, { "epoch": 0.30332615136008617, "grad_norm": 0.8352145795658186, "learning_rate": 9.443354545345545e-06, "loss": 0.36351020336151124, "num_input_tokens_seen": 197246488, "step": 4505, "train_runtime": 34872.1679, "train_tokens_per_second": 5656.273 }, { "epoch": 0.3036628063560463, "grad_norm": 0.7235873259829829, "learning_rate": 9.442141492028406e-06, "loss": 0.3931256294250488, "num_input_tokens_seen": 197464240, "step": 4510, "train_runtime": 34916.8698, "train_tokens_per_second": 5655.268 }, { "epoch": 0.30399946135200645, "grad_norm": 0.7287455155410504, "learning_rate": 9.440927196480563e-06, "loss": 0.3859192609786987, "num_input_tokens_seen": 197693416, "step": 4515, "train_runtime": 34952.6701, "train_tokens_per_second": 5656.032 }, { "epoch": 0.3043361163479666, "grad_norm": 0.7124742821058738, "learning_rate": 9.439711659041593e-06, "loss": 0.3971871376037598, "num_input_tokens_seen": 197908880, "step": 4520, "train_runtime": 34995.5331, "train_tokens_per_second": 5655.261 }, { "epoch": 0.30467277134392673, "grad_norm": 0.8049967305897996, "learning_rate": 9.438494880051413e-06, "loss": 0.4050449371337891, "num_input_tokens_seen": 198130240, "step": 4525, "train_runtime": 35031.404, "train_tokens_per_second": 5655.789 }, { "epoch": 0.30500942633988687, "grad_norm": 0.8167232313014808, "learning_rate": 9.437276859850293e-06, "loss": 0.39906351566314696, "num_input_tokens_seen": 198354624, "step": 4530, "train_runtime": 35070.2405, "train_tokens_per_second": 5655.924 }, { "epoch": 0.305346081335847, "grad_norm": 0.8219257479433354, "learning_rate": 9.436057598778848e-06, "loss": 0.41982173919677734, "num_input_tokens_seen": 198569592, "step": 4535, "train_runtime": 35103.488, "train_tokens_per_second": 5656.691 }, { "epoch": 0.30568273633180715, "grad_norm": 0.8373417043715061, "learning_rate": 9.434837097178043e-06, "loss": 0.44964447021484377, "num_input_tokens_seen": 198790848, "step": 4540, "train_runtime": 35136.0232, "train_tokens_per_second": 5657.75 }, { "epoch": 0.3060193913277673, "grad_norm": 0.8551654564560078, "learning_rate": 9.433615355389183e-06, "loss": 0.4145000457763672, "num_input_tokens_seen": 198995864, "step": 4545, "train_runtime": 35171.0896, "train_tokens_per_second": 5657.939 }, { "epoch": 0.3063560463237274, "grad_norm": 0.8539775390580207, "learning_rate": 9.432392373753926e-06, "loss": 0.38867299556732177, "num_input_tokens_seen": 199228112, "step": 4550, "train_runtime": 35204.7853, "train_tokens_per_second": 5659.12 }, { "epoch": 0.30669270131968757, "grad_norm": 0.7417346548045687, "learning_rate": 9.431168152614278e-06, "loss": 0.398314380645752, "num_input_tokens_seen": 199444448, "step": 4555, "train_runtime": 35246.8496, "train_tokens_per_second": 5658.504 }, { "epoch": 0.3070293563156477, "grad_norm": 0.7867984496679544, "learning_rate": 9.429942692312585e-06, "loss": 0.36063923835754397, "num_input_tokens_seen": 199665776, "step": 4560, "train_runtime": 35277.6142, "train_tokens_per_second": 5659.844 }, { "epoch": 0.30736601131160785, "grad_norm": 0.6064626251289161, "learning_rate": 9.428715993191546e-06, "loss": 0.38531041145324707, "num_input_tokens_seen": 199888952, "step": 4565, "train_runtime": 35318.7352, "train_tokens_per_second": 5659.573 }, { "epoch": 0.307702666307568, "grad_norm": 0.7823320659003977, "learning_rate": 9.427488055594199e-06, "loss": 0.4015589714050293, "num_input_tokens_seen": 200094448, "step": 4570, "train_runtime": 35356.6905, "train_tokens_per_second": 5659.309 }, { "epoch": 0.3080393213035281, "grad_norm": 0.7797326812244397, "learning_rate": 9.426258879863937e-06, "loss": 0.40995278358459475, "num_input_tokens_seen": 200330936, "step": 4575, "train_runtime": 35388.9695, "train_tokens_per_second": 5660.83 }, { "epoch": 0.30837597629948826, "grad_norm": 0.6558180029153803, "learning_rate": 9.425028466344494e-06, "loss": 0.35400965213775637, "num_input_tokens_seen": 200550336, "step": 4580, "train_runtime": 35423.4598, "train_tokens_per_second": 5661.512 }, { "epoch": 0.3087126312954484, "grad_norm": 0.9357449426999332, "learning_rate": 9.42379681537995e-06, "loss": 0.40514564514160156, "num_input_tokens_seen": 200767584, "step": 4585, "train_runtime": 35466.8621, "train_tokens_per_second": 5660.709 }, { "epoch": 0.30904928629140854, "grad_norm": 1.1029634658189478, "learning_rate": 9.422563927314732e-06, "loss": 0.39676432609558104, "num_input_tokens_seen": 200990368, "step": 4590, "train_runtime": 35503.267, "train_tokens_per_second": 5661.18 }, { "epoch": 0.3093859412873687, "grad_norm": 0.7960058470606449, "learning_rate": 9.421329802493615e-06, "loss": 0.3798659801483154, "num_input_tokens_seen": 201213136, "step": 4595, "train_runtime": 35545.6953, "train_tokens_per_second": 5660.689 }, { "epoch": 0.3097225962833288, "grad_norm": 0.7764466461774601, "learning_rate": 9.420094441261717e-06, "loss": 0.4128886222839355, "num_input_tokens_seen": 201436008, "step": 4600, "train_runtime": 35591.0272, "train_tokens_per_second": 5659.741 }, { "epoch": 0.31005925127928896, "grad_norm": 0.8514809314658448, "learning_rate": 9.418857843964506e-06, "loss": 0.3874027252197266, "num_input_tokens_seen": 201651024, "step": 4605, "train_runtime": 35633.1312, "train_tokens_per_second": 5659.088 }, { "epoch": 0.3103959062752491, "grad_norm": 0.791242525351627, "learning_rate": 9.417620010947786e-06, "loss": 0.41231350898742675, "num_input_tokens_seen": 201862568, "step": 4610, "train_runtime": 35672.8097, "train_tokens_per_second": 5658.724 }, { "epoch": 0.31073256127120924, "grad_norm": 0.8196831043483923, "learning_rate": 9.416380942557719e-06, "loss": 0.3759624719619751, "num_input_tokens_seen": 202081848, "step": 4615, "train_runtime": 35711.7461, "train_tokens_per_second": 5658.694 }, { "epoch": 0.3110692162671694, "grad_norm": 0.814113401127112, "learning_rate": 9.415140639140803e-06, "loss": 0.40959873199462893, "num_input_tokens_seen": 202288416, "step": 4620, "train_runtime": 35748.2065, "train_tokens_per_second": 5658.701 }, { "epoch": 0.3114058712631295, "grad_norm": 0.6867352095609621, "learning_rate": 9.413899101043887e-06, "loss": 0.4299426555633545, "num_input_tokens_seen": 202507280, "step": 4625, "train_runtime": 35787.2021, "train_tokens_per_second": 5658.651 }, { "epoch": 0.31174252625908966, "grad_norm": 0.9127540749426457, "learning_rate": 9.412656328614162e-06, "loss": 0.4051331043243408, "num_input_tokens_seen": 202708520, "step": 4630, "train_runtime": 35826.4689, "train_tokens_per_second": 5658.066 }, { "epoch": 0.3120791812550498, "grad_norm": 0.7769819809945303, "learning_rate": 9.411412322199165e-06, "loss": 0.40700321197509765, "num_input_tokens_seen": 202938288, "step": 4635, "train_runtime": 35860.2769, "train_tokens_per_second": 5659.139 }, { "epoch": 0.31241583625100994, "grad_norm": 0.7763840440333488, "learning_rate": 9.41016708214678e-06, "loss": 0.397929310798645, "num_input_tokens_seen": 203140768, "step": 4640, "train_runtime": 35900.8969, "train_tokens_per_second": 5658.376 }, { "epoch": 0.31275249124697013, "grad_norm": 0.838793433476314, "learning_rate": 9.408920608805233e-06, "loss": 0.3729093074798584, "num_input_tokens_seen": 203353200, "step": 4645, "train_runtime": 35943.6665, "train_tokens_per_second": 5657.553 }, { "epoch": 0.31308914624293027, "grad_norm": 0.759403553618091, "learning_rate": 9.407672902523097e-06, "loss": 0.42061967849731446, "num_input_tokens_seen": 203576960, "step": 4650, "train_runtime": 35989.9311, "train_tokens_per_second": 5656.498 }, { "epoch": 0.3134258012388904, "grad_norm": 0.8516208752301061, "learning_rate": 9.406423963649287e-06, "loss": 0.39535982608795167, "num_input_tokens_seen": 203780664, "step": 4655, "train_runtime": 36033.4005, "train_tokens_per_second": 5655.327 }, { "epoch": 0.31376245623485055, "grad_norm": 0.6661646334234551, "learning_rate": 9.405173792533069e-06, "loss": 0.3896958827972412, "num_input_tokens_seen": 204002504, "step": 4660, "train_runtime": 36071.9272, "train_tokens_per_second": 5655.437 }, { "epoch": 0.3140991112308107, "grad_norm": 0.802128758388854, "learning_rate": 9.403922389524045e-06, "loss": 0.383258056640625, "num_input_tokens_seen": 204219216, "step": 4665, "train_runtime": 36107.3083, "train_tokens_per_second": 5655.897 }, { "epoch": 0.31443576622677083, "grad_norm": 0.8311848290104593, "learning_rate": 9.40266975497217e-06, "loss": 0.41370835304260256, "num_input_tokens_seen": 204435080, "step": 4670, "train_runtime": 36146.1312, "train_tokens_per_second": 5655.794 }, { "epoch": 0.31477242122273097, "grad_norm": 0.7524391894573029, "learning_rate": 9.401415889227736e-06, "loss": 0.4065183162689209, "num_input_tokens_seen": 204665984, "step": 4675, "train_runtime": 36189.9551, "train_tokens_per_second": 5655.326 }, { "epoch": 0.3151090762186911, "grad_norm": 0.6516968499884368, "learning_rate": 9.400160792641385e-06, "loss": 0.40553603172302244, "num_input_tokens_seen": 204900584, "step": 4680, "train_runtime": 36230.3148, "train_tokens_per_second": 5655.501 }, { "epoch": 0.31544573121465125, "grad_norm": 0.713149562707507, "learning_rate": 9.398904465564097e-06, "loss": 0.3963156700134277, "num_input_tokens_seen": 205121896, "step": 4685, "train_runtime": 36261.5038, "train_tokens_per_second": 5656.74 }, { "epoch": 0.3157823862106114, "grad_norm": 0.7445101762458055, "learning_rate": 9.397646908347203e-06, "loss": 0.3701439142227173, "num_input_tokens_seen": 205337424, "step": 4690, "train_runtime": 36299.7979, "train_tokens_per_second": 5656.71 }, { "epoch": 0.3161190412065715, "grad_norm": 0.7876242336850148, "learning_rate": 9.396388121342375e-06, "loss": 0.37079999446868894, "num_input_tokens_seen": 205566880, "step": 4695, "train_runtime": 36337.2628, "train_tokens_per_second": 5657.192 }, { "epoch": 0.31645569620253167, "grad_norm": 0.8752489859691854, "learning_rate": 9.395128104901628e-06, "loss": 0.382697606086731, "num_input_tokens_seen": 205780336, "step": 4700, "train_runtime": 36373.0101, "train_tokens_per_second": 5657.501 }, { "epoch": 0.3167923511984918, "grad_norm": 0.6981702689866264, "learning_rate": 9.393866859377321e-06, "loss": 0.4276883125305176, "num_input_tokens_seen": 206004992, "step": 4705, "train_runtime": 36409.7995, "train_tokens_per_second": 5657.955 }, { "epoch": 0.31712900619445195, "grad_norm": 0.7289408984257015, "learning_rate": 9.392604385122157e-06, "loss": 0.39430766105651854, "num_input_tokens_seen": 206237344, "step": 4710, "train_runtime": 36441.1815, "train_tokens_per_second": 5659.458 }, { "epoch": 0.3174656611904121, "grad_norm": 0.7707325345782555, "learning_rate": 9.391340682489185e-06, "loss": 0.3808866024017334, "num_input_tokens_seen": 206449496, "step": 4715, "train_runtime": 36480.1405, "train_tokens_per_second": 5659.23 }, { "epoch": 0.3178023161863722, "grad_norm": 0.8379775589672267, "learning_rate": 9.390075751831794e-06, "loss": 0.39603471755981445, "num_input_tokens_seen": 206677304, "step": 4720, "train_runtime": 36513.5133, "train_tokens_per_second": 5660.296 }, { "epoch": 0.31813897118233236, "grad_norm": 1.1929541297616924, "learning_rate": 9.388809593503718e-06, "loss": 0.41028714179992676, "num_input_tokens_seen": 206901904, "step": 4725, "train_runtime": 36554.4289, "train_tokens_per_second": 5660.105 }, { "epoch": 0.3184756261782925, "grad_norm": 0.8413335424516502, "learning_rate": 9.387542207859034e-06, "loss": 0.428537654876709, "num_input_tokens_seen": 207122320, "step": 4730, "train_runtime": 36584.6009, "train_tokens_per_second": 5661.462 }, { "epoch": 0.31881228117425264, "grad_norm": 0.7898247112897376, "learning_rate": 9.386273595252161e-06, "loss": 0.41155662536621096, "num_input_tokens_seen": 207352296, "step": 4735, "train_runtime": 36620.4486, "train_tokens_per_second": 5662.2 }, { "epoch": 0.3191489361702128, "grad_norm": 0.8389868484209729, "learning_rate": 9.385003756037865e-06, "loss": 0.4223154067993164, "num_input_tokens_seen": 207575072, "step": 4740, "train_runtime": 36662.9004, "train_tokens_per_second": 5661.72 }, { "epoch": 0.3194855911661729, "grad_norm": 0.827214827358242, "learning_rate": 9.383732690571253e-06, "loss": 0.40798358917236327, "num_input_tokens_seen": 207817360, "step": 4745, "train_runtime": 36697.2613, "train_tokens_per_second": 5663.021 }, { "epoch": 0.31982224616213306, "grad_norm": 0.8033752581626638, "learning_rate": 9.382460399207769e-06, "loss": 0.40032100677490234, "num_input_tokens_seen": 208045464, "step": 4750, "train_runtime": 36739.6396, "train_tokens_per_second": 5662.697 }, { "epoch": 0.3201589011580932, "grad_norm": 0.7745249893682031, "learning_rate": 9.381186882303212e-06, "loss": 0.3821758985519409, "num_input_tokens_seen": 208245512, "step": 4755, "train_runtime": 36775.3408, "train_tokens_per_second": 5662.64 }, { "epoch": 0.32049555615405334, "grad_norm": 0.7835752828676862, "learning_rate": 9.379912140213713e-06, "loss": 0.38662168979644773, "num_input_tokens_seen": 208458376, "step": 4760, "train_runtime": 36810.474, "train_tokens_per_second": 5663.018 }, { "epoch": 0.3208322111500135, "grad_norm": 0.7427789671372642, "learning_rate": 9.37863617329575e-06, "loss": 0.37845721244812014, "num_input_tokens_seen": 208662464, "step": 4765, "train_runtime": 36848.709, "train_tokens_per_second": 5662.68 }, { "epoch": 0.3211688661459736, "grad_norm": 0.7906549867893844, "learning_rate": 9.377358981906145e-06, "loss": 0.3855098485946655, "num_input_tokens_seen": 208883752, "step": 4770, "train_runtime": 36885.8469, "train_tokens_per_second": 5662.978 }, { "epoch": 0.32150552114193376, "grad_norm": 0.7000304206526682, "learning_rate": 9.376080566402059e-06, "loss": 0.41453986167907714, "num_input_tokens_seen": 209114544, "step": 4775, "train_runtime": 36923.9104, "train_tokens_per_second": 5663.391 }, { "epoch": 0.3218421761378939, "grad_norm": 0.7569304220647727, "learning_rate": 9.374800927140994e-06, "loss": 0.33689126968383787, "num_input_tokens_seen": 209342880, "step": 4780, "train_runtime": 36959.0708, "train_tokens_per_second": 5664.181 }, { "epoch": 0.32217883113385404, "grad_norm": 0.7693618085921944, "learning_rate": 9.373520064480804e-06, "loss": 0.3944025278091431, "num_input_tokens_seen": 209567016, "step": 4785, "train_runtime": 36999.5953, "train_tokens_per_second": 5664.035 }, { "epoch": 0.3225154861298142, "grad_norm": 0.7545108220793344, "learning_rate": 9.372237978779672e-06, "loss": 0.3935252666473389, "num_input_tokens_seen": 209798224, "step": 4790, "train_runtime": 37035.8347, "train_tokens_per_second": 5664.736 }, { "epoch": 0.3228521411257743, "grad_norm": 0.7487128271214056, "learning_rate": 9.37095467039613e-06, "loss": 0.3892039775848389, "num_input_tokens_seen": 209998416, "step": 4795, "train_runtime": 37074.0037, "train_tokens_per_second": 5664.304 }, { "epoch": 0.32318879612173446, "grad_norm": 0.7480661049890698, "learning_rate": 9.369670139689056e-06, "loss": 0.3860762119293213, "num_input_tokens_seen": 210212136, "step": 4800, "train_runtime": 37113.4829, "train_tokens_per_second": 5664.037 }, { "epoch": 0.3235254511176946, "grad_norm": 0.7846044101372698, "learning_rate": 9.368384387017659e-06, "loss": 0.377323055267334, "num_input_tokens_seen": 210412912, "step": 4805, "train_runtime": 37150.0136, "train_tokens_per_second": 5663.872 }, { "epoch": 0.32386210611365474, "grad_norm": 0.77183510086721, "learning_rate": 9.367097412741497e-06, "loss": 0.3832876443862915, "num_input_tokens_seen": 210626632, "step": 4810, "train_runtime": 37185.5052, "train_tokens_per_second": 5664.213 }, { "epoch": 0.3241987611096149, "grad_norm": 0.9148498149260199, "learning_rate": 9.36580921722047e-06, "loss": 0.41832733154296875, "num_input_tokens_seen": 210847304, "step": 4815, "train_runtime": 37226.3372, "train_tokens_per_second": 5663.928 }, { "epoch": 0.324535416105575, "grad_norm": 0.6839164180369833, "learning_rate": 9.364519800814818e-06, "loss": 0.3626012563705444, "num_input_tokens_seen": 211071840, "step": 4820, "train_runtime": 37269.7466, "train_tokens_per_second": 5663.356 }, { "epoch": 0.32487207110153515, "grad_norm": 0.6658908418064057, "learning_rate": 9.36322916388512e-06, "loss": 0.3882687330245972, "num_input_tokens_seen": 211297288, "step": 4825, "train_runtime": 37311.4159, "train_tokens_per_second": 5663.073 }, { "epoch": 0.3252087260974953, "grad_norm": 0.7420928499905488, "learning_rate": 9.3619373067923e-06, "loss": 0.3612262487411499, "num_input_tokens_seen": 211529896, "step": 4830, "train_runtime": 37348.4533, "train_tokens_per_second": 5663.686 }, { "epoch": 0.32554538109345543, "grad_norm": 0.7491528413015758, "learning_rate": 9.360644229897622e-06, "loss": 0.39133119583129883, "num_input_tokens_seen": 211744104, "step": 4835, "train_runtime": 37390.6137, "train_tokens_per_second": 5663.028 }, { "epoch": 0.32588203608941557, "grad_norm": 0.8362580597115173, "learning_rate": 9.35934993356269e-06, "loss": 0.4070117950439453, "num_input_tokens_seen": 211960664, "step": 4840, "train_runtime": 37434.3008, "train_tokens_per_second": 5662.204 }, { "epoch": 0.3262186910853757, "grad_norm": 0.8872020316370295, "learning_rate": 9.35805441814945e-06, "loss": 0.37361793518066405, "num_input_tokens_seen": 212184888, "step": 4845, "train_runtime": 37481.2897, "train_tokens_per_second": 5661.088 }, { "epoch": 0.32655534608133585, "grad_norm": 0.7655564350170675, "learning_rate": 9.356757684020188e-06, "loss": 0.40865292549133303, "num_input_tokens_seen": 212387000, "step": 4850, "train_runtime": 37521.1842, "train_tokens_per_second": 5660.456 }, { "epoch": 0.326892001077296, "grad_norm": 0.9840119081755966, "learning_rate": 9.355459731537533e-06, "loss": 0.37503221035003664, "num_input_tokens_seen": 212602240, "step": 4855, "train_runtime": 37563.6776, "train_tokens_per_second": 5659.782 }, { "epoch": 0.32722865607325613, "grad_norm": 0.8416963207567933, "learning_rate": 9.354160561064451e-06, "loss": 0.4150728225708008, "num_input_tokens_seen": 212829424, "step": 4860, "train_runtime": 37600.8083, "train_tokens_per_second": 5660.235 }, { "epoch": 0.32756531106921627, "grad_norm": 0.6549002669311522, "learning_rate": 9.352860172964254e-06, "loss": 0.41104774475097655, "num_input_tokens_seen": 213059616, "step": 4865, "train_runtime": 37639.635, "train_tokens_per_second": 5660.512 }, { "epoch": 0.3279019660651764, "grad_norm": 0.7662647212420475, "learning_rate": 9.35155856760059e-06, "loss": 0.37230610847473145, "num_input_tokens_seen": 213291344, "step": 4870, "train_runtime": 37683.6107, "train_tokens_per_second": 5660.056 }, { "epoch": 0.32823862106113655, "grad_norm": 0.8032964428930659, "learning_rate": 9.35025574533745e-06, "loss": 0.4028165817260742, "num_input_tokens_seen": 213518768, "step": 4875, "train_runtime": 37716.795, "train_tokens_per_second": 5661.106 }, { "epoch": 0.3285752760570967, "grad_norm": 0.709809886638744, "learning_rate": 9.34895170653916e-06, "loss": 0.37210307121276853, "num_input_tokens_seen": 213742008, "step": 4880, "train_runtime": 37761.13, "train_tokens_per_second": 5660.371 }, { "epoch": 0.3289119310530568, "grad_norm": 1.0245077977220034, "learning_rate": 9.347646451570394e-06, "loss": 0.3780977725982666, "num_input_tokens_seen": 213967120, "step": 4885, "train_runtime": 37795.7217, "train_tokens_per_second": 5661.147 }, { "epoch": 0.32924858604901697, "grad_norm": 0.7783625701111361, "learning_rate": 9.346339980796162e-06, "loss": 0.44457039833068845, "num_input_tokens_seen": 214204152, "step": 4890, "train_runtime": 37830.001, "train_tokens_per_second": 5662.282 }, { "epoch": 0.3295852410449771, "grad_norm": 0.7619788379384177, "learning_rate": 9.345032294581813e-06, "loss": 0.3991098403930664, "num_input_tokens_seen": 214426328, "step": 4895, "train_runtime": 37861.0229, "train_tokens_per_second": 5663.511 }, { "epoch": 0.32992189604093725, "grad_norm": 0.7063552896906414, "learning_rate": 9.343723393293038e-06, "loss": 0.37960023880004884, "num_input_tokens_seen": 214641400, "step": 4900, "train_runtime": 37900.5478, "train_tokens_per_second": 5663.28 }, { "epoch": 0.3302585510368974, "grad_norm": 0.9300418965561537, "learning_rate": 9.342413277295869e-06, "loss": 0.3947901725769043, "num_input_tokens_seen": 214865368, "step": 4905, "train_runtime": 37941.8194, "train_tokens_per_second": 5663.022 }, { "epoch": 0.3305952060328575, "grad_norm": 0.660978808262332, "learning_rate": 9.341101946956672e-06, "loss": 0.39415407180786133, "num_input_tokens_seen": 215077016, "step": 4910, "train_runtime": 37976.1785, "train_tokens_per_second": 5663.472 }, { "epoch": 0.33093186102881766, "grad_norm": 0.7480448807625937, "learning_rate": 9.33978940264216e-06, "loss": 0.4069984436035156, "num_input_tokens_seen": 215281168, "step": 4915, "train_runtime": 38020.9215, "train_tokens_per_second": 5662.176 }, { "epoch": 0.3312685160247778, "grad_norm": 0.9363661586418124, "learning_rate": 9.338475644719377e-06, "loss": 0.396682071685791, "num_input_tokens_seen": 215508928, "step": 4920, "train_runtime": 38060.6534, "train_tokens_per_second": 5662.25 }, { "epoch": 0.33160517102073794, "grad_norm": 0.7522573238030015, "learning_rate": 9.337160673555719e-06, "loss": 0.3950789451599121, "num_input_tokens_seen": 215730176, "step": 4925, "train_runtime": 38096.6721, "train_tokens_per_second": 5662.704 }, { "epoch": 0.3319418260166981, "grad_norm": 0.7866963830157505, "learning_rate": 9.335844489518905e-06, "loss": 0.3960768222808838, "num_input_tokens_seen": 215941544, "step": 4930, "train_runtime": 38135.6021, "train_tokens_per_second": 5662.466 }, { "epoch": 0.3322784810126582, "grad_norm": 0.7771252275599534, "learning_rate": 9.334527092977008e-06, "loss": 0.3927053928375244, "num_input_tokens_seen": 216139784, "step": 4935, "train_runtime": 38172.7334, "train_tokens_per_second": 5662.151 }, { "epoch": 0.33261513600861836, "grad_norm": 0.7031312284914388, "learning_rate": 9.33320848429843e-06, "loss": 0.3905383825302124, "num_input_tokens_seen": 216376872, "step": 4940, "train_runtime": 38213.8052, "train_tokens_per_second": 5662.27 }, { "epoch": 0.3329517910045785, "grad_norm": 0.7992397342780773, "learning_rate": 9.331888663851917e-06, "loss": 0.41385631561279296, "num_input_tokens_seen": 216602432, "step": 4945, "train_runtime": 38247.7905, "train_tokens_per_second": 5663.136 }, { "epoch": 0.33328844600053864, "grad_norm": 0.8325843513269255, "learning_rate": 9.330567632006552e-06, "loss": 0.402661657333374, "num_input_tokens_seen": 216820040, "step": 4950, "train_runtime": 38282.5886, "train_tokens_per_second": 5663.672 }, { "epoch": 0.3336251009964988, "grad_norm": 0.8157610005939018, "learning_rate": 9.329245389131759e-06, "loss": 0.4041293144226074, "num_input_tokens_seen": 217040648, "step": 4955, "train_runtime": 38321.0859, "train_tokens_per_second": 5663.74 }, { "epoch": 0.3339617559924589, "grad_norm": 0.7514981142846812, "learning_rate": 9.327921935597298e-06, "loss": 0.373291015625, "num_input_tokens_seen": 217253544, "step": 4960, "train_runtime": 38362.9141, "train_tokens_per_second": 5663.114 }, { "epoch": 0.33429841098841906, "grad_norm": 0.9584412932125773, "learning_rate": 9.326597271773267e-06, "loss": 0.39936108589172364, "num_input_tokens_seen": 217452896, "step": 4965, "train_runtime": 38404.9607, "train_tokens_per_second": 5662.104 }, { "epoch": 0.3346350659843792, "grad_norm": 0.7914463925442367, "learning_rate": 9.325271398030107e-06, "loss": 0.3928532600402832, "num_input_tokens_seen": 217666152, "step": 4970, "train_runtime": 38441.97, "train_tokens_per_second": 5662.201 }, { "epoch": 0.33497172098033934, "grad_norm": 0.8843279935185989, "learning_rate": 9.323944314738591e-06, "loss": 0.40926666259765626, "num_input_tokens_seen": 217886336, "step": 4975, "train_runtime": 38486.6001, "train_tokens_per_second": 5661.356 }, { "epoch": 0.3353083759762995, "grad_norm": 0.7413319586045699, "learning_rate": 9.322616022269838e-06, "loss": 0.3675239562988281, "num_input_tokens_seen": 218092776, "step": 4980, "train_runtime": 38523.0427, "train_tokens_per_second": 5661.359 }, { "epoch": 0.3356450309722596, "grad_norm": 0.8050536335877444, "learning_rate": 9.321286520995297e-06, "loss": 0.40448784828186035, "num_input_tokens_seen": 218303136, "step": 4985, "train_runtime": 38563.0671, "train_tokens_per_second": 5660.938 }, { "epoch": 0.33598168596821976, "grad_norm": 0.8220117119004713, "learning_rate": 9.319955811286758e-06, "loss": 0.38973236083984375, "num_input_tokens_seen": 218521848, "step": 4990, "train_runtime": 38606.842, "train_tokens_per_second": 5660.184 }, { "epoch": 0.3363183409641799, "grad_norm": 0.724656690749584, "learning_rate": 9.318623893516354e-06, "loss": 0.38318960666656493, "num_input_tokens_seen": 218733712, "step": 4995, "train_runtime": 38643.6596, "train_tokens_per_second": 5660.274 }, { "epoch": 0.33665499596014004, "grad_norm": 0.777455286936359, "learning_rate": 9.317290768056548e-06, "loss": 0.3933337450027466, "num_input_tokens_seen": 218942384, "step": 5000, "train_runtime": 38685.6918, "train_tokens_per_second": 5659.518 }, { "epoch": 0.3369916509561002, "grad_norm": 0.7933540714498255, "learning_rate": 9.315956435280147e-06, "loss": 0.40426931381225584, "num_input_tokens_seen": 219148584, "step": 5005, "train_runtime": 38726.8749, "train_tokens_per_second": 5658.824 }, { "epoch": 0.3373283059520603, "grad_norm": 0.7310653600558, "learning_rate": 9.314620895560292e-06, "loss": 0.3823359251022339, "num_input_tokens_seen": 219366640, "step": 5010, "train_runtime": 38759.9606, "train_tokens_per_second": 5659.62 }, { "epoch": 0.33766496094802045, "grad_norm": 0.8607865029821252, "learning_rate": 9.313284149270459e-06, "loss": 0.4273562431335449, "num_input_tokens_seen": 219580136, "step": 5015, "train_runtime": 38797.085, "train_tokens_per_second": 5659.707 }, { "epoch": 0.3380016159439806, "grad_norm": 0.8291229922855889, "learning_rate": 9.311946196784469e-06, "loss": 0.396860933303833, "num_input_tokens_seen": 219795256, "step": 5020, "train_runtime": 38838.6299, "train_tokens_per_second": 5659.192 }, { "epoch": 0.33833827093994073, "grad_norm": 0.746756264356882, "learning_rate": 9.310607038476476e-06, "loss": 0.40080647468566893, "num_input_tokens_seen": 220007056, "step": 5025, "train_runtime": 38882.3681, "train_tokens_per_second": 5658.273 }, { "epoch": 0.3386749259359009, "grad_norm": 0.7715704037440936, "learning_rate": 9.30926667472097e-06, "loss": 0.3821887016296387, "num_input_tokens_seen": 220230040, "step": 5030, "train_runtime": 38929.962, "train_tokens_per_second": 5657.083 }, { "epoch": 0.339011580931861, "grad_norm": 0.695121253798547, "learning_rate": 9.307925105892779e-06, "loss": 0.4106111526489258, "num_input_tokens_seen": 220463304, "step": 5035, "train_runtime": 38964.7555, "train_tokens_per_second": 5658.018 }, { "epoch": 0.33934823592782115, "grad_norm": 0.7852274341067195, "learning_rate": 9.30658233236707e-06, "loss": 0.38834619522094727, "num_input_tokens_seen": 220695456, "step": 5040, "train_runtime": 39007.1954, "train_tokens_per_second": 5657.814 }, { "epoch": 0.3396848909237813, "grad_norm": 0.759484699190671, "learning_rate": 9.30523835451934e-06, "loss": 0.3923861265182495, "num_input_tokens_seen": 220915344, "step": 5045, "train_runtime": 39053.4813, "train_tokens_per_second": 5656.739 }, { "epoch": 0.34002154591974143, "grad_norm": 0.7964278768577083, "learning_rate": 9.303893172725437e-06, "loss": 0.4306797981262207, "num_input_tokens_seen": 221146072, "step": 5050, "train_runtime": 39091.2343, "train_tokens_per_second": 5657.178 }, { "epoch": 0.34035820091570157, "grad_norm": 0.7340454424901695, "learning_rate": 9.302546787361533e-06, "loss": 0.38288087844848634, "num_input_tokens_seen": 221371344, "step": 5055, "train_runtime": 39133.7258, "train_tokens_per_second": 5656.792 }, { "epoch": 0.3406948559116617, "grad_norm": 0.7383658204672374, "learning_rate": 9.301199198804139e-06, "loss": 0.37805628776550293, "num_input_tokens_seen": 221583280, "step": 5060, "train_runtime": 39172.7195, "train_tokens_per_second": 5656.571 }, { "epoch": 0.34103151090762185, "grad_norm": 0.8155446108957558, "learning_rate": 9.299850407430102e-06, "loss": 0.4092425346374512, "num_input_tokens_seen": 221808808, "step": 5065, "train_runtime": 39215.053, "train_tokens_per_second": 5656.216 }, { "epoch": 0.341368165903582, "grad_norm": 0.8253751293294798, "learning_rate": 9.298500413616613e-06, "loss": 0.3920405864715576, "num_input_tokens_seen": 222029984, "step": 5070, "train_runtime": 39251.0729, "train_tokens_per_second": 5656.66 }, { "epoch": 0.3417048208995421, "grad_norm": 0.7618503900471122, "learning_rate": 9.297149217741188e-06, "loss": 0.3707792043685913, "num_input_tokens_seen": 222251080, "step": 5075, "train_runtime": 39288.8528, "train_tokens_per_second": 5656.848 }, { "epoch": 0.34204147589550227, "grad_norm": 0.7834580864284257, "learning_rate": 9.295796820181688e-06, "loss": 0.4238715171813965, "num_input_tokens_seen": 222475224, "step": 5080, "train_runtime": 39326.0211, "train_tokens_per_second": 5657.201 }, { "epoch": 0.3423781308914624, "grad_norm": 0.7875688230457064, "learning_rate": 9.294443221316305e-06, "loss": 0.3979609727859497, "num_input_tokens_seen": 222689712, "step": 5085, "train_runtime": 39362.9107, "train_tokens_per_second": 5657.349 }, { "epoch": 0.34271478588742255, "grad_norm": 0.6945475678075447, "learning_rate": 9.293088421523569e-06, "loss": 0.41632776260375975, "num_input_tokens_seen": 222903112, "step": 5090, "train_runtime": 39399.1126, "train_tokens_per_second": 5657.567 }, { "epoch": 0.3430514408833827, "grad_norm": 0.8727362030270556, "learning_rate": 9.291732421182346e-06, "loss": 0.3804980754852295, "num_input_tokens_seen": 223116536, "step": 5095, "train_runtime": 39444.3485, "train_tokens_per_second": 5656.489 }, { "epoch": 0.3433880958793428, "grad_norm": 0.7868108132642002, "learning_rate": 9.290375220671837e-06, "loss": 0.3959723949432373, "num_input_tokens_seen": 223331328, "step": 5100, "train_runtime": 39483.2714, "train_tokens_per_second": 5656.353 }, { "epoch": 0.34372475087530296, "grad_norm": 0.8977037421010565, "learning_rate": 9.28901682037158e-06, "loss": 0.3575240135192871, "num_input_tokens_seen": 223545784, "step": 5105, "train_runtime": 39520.4864, "train_tokens_per_second": 5656.453 }, { "epoch": 0.3440614058712631, "grad_norm": 0.724529969116944, "learning_rate": 9.287657220661442e-06, "loss": 0.41797566413879395, "num_input_tokens_seen": 223772168, "step": 5110, "train_runtime": 39556.4135, "train_tokens_per_second": 5657.039 }, { "epoch": 0.34439806086722324, "grad_norm": 0.8314015078496961, "learning_rate": 9.286296421921636e-06, "loss": 0.3681803703308105, "num_input_tokens_seen": 223987880, "step": 5115, "train_runtime": 39597.3882, "train_tokens_per_second": 5656.633 }, { "epoch": 0.3447347158631834, "grad_norm": 0.8879862781401929, "learning_rate": 9.284934424532706e-06, "loss": 0.4501188278198242, "num_input_tokens_seen": 224197912, "step": 5120, "train_runtime": 39637.597, "train_tokens_per_second": 5656.193 }, { "epoch": 0.3450713708591435, "grad_norm": 0.7067262341475377, "learning_rate": 9.283571228875525e-06, "loss": 0.35322113037109376, "num_input_tokens_seen": 224398888, "step": 5125, "train_runtime": 39676.3313, "train_tokens_per_second": 5655.737 }, { "epoch": 0.3454080258551037, "grad_norm": 0.7651046532838097, "learning_rate": 9.282206835331311e-06, "loss": 0.4238561153411865, "num_input_tokens_seen": 224624840, "step": 5130, "train_runtime": 39714.5021, "train_tokens_per_second": 5655.99 }, { "epoch": 0.34574468085106386, "grad_norm": 1.0540025361763135, "learning_rate": 9.28084124428161e-06, "loss": 0.3581863880157471, "num_input_tokens_seen": 224840616, "step": 5135, "train_runtime": 39760.1229, "train_tokens_per_second": 5654.928 }, { "epoch": 0.346081335847024, "grad_norm": 0.712972521802771, "learning_rate": 9.279474456108305e-06, "loss": 0.37324137687683107, "num_input_tokens_seen": 225076296, "step": 5140, "train_runtime": 39795.5671, "train_tokens_per_second": 5655.813 }, { "epoch": 0.34641799084298414, "grad_norm": 0.7436296711193636, "learning_rate": 9.278106471193615e-06, "loss": 0.36896820068359376, "num_input_tokens_seen": 225294528, "step": 5145, "train_runtime": 39833.6798, "train_tokens_per_second": 5655.88 }, { "epoch": 0.3467546458389443, "grad_norm": 0.7808819136322714, "learning_rate": 9.276737289920093e-06, "loss": 0.4088866710662842, "num_input_tokens_seen": 225512648, "step": 5150, "train_runtime": 39875.84, "train_tokens_per_second": 5655.37 }, { "epoch": 0.3470913008349044, "grad_norm": 0.74354681758287, "learning_rate": 9.275366912670624e-06, "loss": 0.4070155143737793, "num_input_tokens_seen": 225724000, "step": 5155, "train_runtime": 39910.7695, "train_tokens_per_second": 5655.717 }, { "epoch": 0.34742795583086455, "grad_norm": 0.7443700356039168, "learning_rate": 9.273995339828432e-06, "loss": 0.3892085075378418, "num_input_tokens_seen": 225939192, "step": 5160, "train_runtime": 39950.0434, "train_tokens_per_second": 5655.543 }, { "epoch": 0.3477646108268247, "grad_norm": 0.8699331338781421, "learning_rate": 9.272622571777072e-06, "loss": 0.42869272232055666, "num_input_tokens_seen": 226161472, "step": 5165, "train_runtime": 39986.0253, "train_tokens_per_second": 5656.013 }, { "epoch": 0.34810126582278483, "grad_norm": 0.7946248476997148, "learning_rate": 9.271248608900434e-06, "loss": 0.3663766860961914, "num_input_tokens_seen": 226388672, "step": 5170, "train_runtime": 40022.8625, "train_tokens_per_second": 5656.484 }, { "epoch": 0.348437920818745, "grad_norm": 0.820181936155836, "learning_rate": 9.269873451582741e-06, "loss": 0.3990020275115967, "num_input_tokens_seen": 226604448, "step": 5175, "train_runtime": 40065.8484, "train_tokens_per_second": 5655.801 }, { "epoch": 0.3487745758147051, "grad_norm": 0.7865052705818104, "learning_rate": 9.268497100208556e-06, "loss": 0.40553035736083987, "num_input_tokens_seen": 226814192, "step": 5180, "train_runtime": 40108.7169, "train_tokens_per_second": 5654.985 }, { "epoch": 0.34911123081066525, "grad_norm": 0.8597790154802004, "learning_rate": 9.267119555162765e-06, "loss": 0.40463762283325194, "num_input_tokens_seen": 227044824, "step": 5185, "train_runtime": 40148.6974, "train_tokens_per_second": 5655.098 }, { "epoch": 0.3494478858066254, "grad_norm": 0.7383395894951612, "learning_rate": 9.2657408168306e-06, "loss": 0.3876547336578369, "num_input_tokens_seen": 227264048, "step": 5190, "train_runtime": 40181.6708, "train_tokens_per_second": 5655.913 }, { "epoch": 0.34978454080258553, "grad_norm": 0.8478101930950076, "learning_rate": 9.264360885597617e-06, "loss": 0.3948791027069092, "num_input_tokens_seen": 227482568, "step": 5195, "train_runtime": 40224.9641, "train_tokens_per_second": 5655.258 }, { "epoch": 0.35012119579854567, "grad_norm": 0.8312712862431509, "learning_rate": 9.262979761849709e-06, "loss": 0.3999017238616943, "num_input_tokens_seen": 227701672, "step": 5200, "train_runtime": 40265.2495, "train_tokens_per_second": 5655.042 }, { "epoch": 0.3504578507945058, "grad_norm": 0.8047649086754547, "learning_rate": 9.261597445973106e-06, "loss": 0.40303988456726075, "num_input_tokens_seen": 227930736, "step": 5205, "train_runtime": 40300.5889, "train_tokens_per_second": 5655.767 }, { "epoch": 0.35079450579046595, "grad_norm": 0.7279256779386029, "learning_rate": 9.260213938354365e-06, "loss": 0.38801677227020265, "num_input_tokens_seen": 228142248, "step": 5210, "train_runtime": 40339.465, "train_tokens_per_second": 5655.56 }, { "epoch": 0.3511311607864261, "grad_norm": 0.703365188592268, "learning_rate": 9.25882923938038e-06, "loss": 0.40598435401916505, "num_input_tokens_seen": 228355000, "step": 5215, "train_runtime": 40382.8232, "train_tokens_per_second": 5654.756 }, { "epoch": 0.35146781578238623, "grad_norm": 0.8641270145143162, "learning_rate": 9.257443349438382e-06, "loss": 0.42745413780212405, "num_input_tokens_seen": 228579256, "step": 5220, "train_runtime": 40419.0219, "train_tokens_per_second": 5655.24 }, { "epoch": 0.35180447077834637, "grad_norm": 0.8147972074351507, "learning_rate": 9.256056268915924e-06, "loss": 0.40657625198364256, "num_input_tokens_seen": 228801840, "step": 5225, "train_runtime": 40461.4517, "train_tokens_per_second": 5654.81 }, { "epoch": 0.3521411257743065, "grad_norm": 0.7053549338628146, "learning_rate": 9.254667998200906e-06, "loss": 0.4108288764953613, "num_input_tokens_seen": 229023432, "step": 5230, "train_runtime": 40502.8889, "train_tokens_per_second": 5654.496 }, { "epoch": 0.35247778077026665, "grad_norm": 0.8352493252466918, "learning_rate": 9.253278537681548e-06, "loss": 0.4314168930053711, "num_input_tokens_seen": 229259792, "step": 5235, "train_runtime": 40538.046, "train_tokens_per_second": 5655.423 }, { "epoch": 0.3528144357662268, "grad_norm": 0.7807713230559138, "learning_rate": 9.251887887746407e-06, "loss": 0.3931559085845947, "num_input_tokens_seen": 229485656, "step": 5240, "train_runtime": 40577.5224, "train_tokens_per_second": 5655.487 }, { "epoch": 0.3531510907621869, "grad_norm": 0.8636190729399873, "learning_rate": 9.25049604878438e-06, "loss": 0.38311750888824464, "num_input_tokens_seen": 229704840, "step": 5245, "train_runtime": 40615.5331, "train_tokens_per_second": 5655.591 }, { "epoch": 0.35348774575814707, "grad_norm": 0.8592849372799231, "learning_rate": 9.249103021184684e-06, "loss": 0.3960615634918213, "num_input_tokens_seen": 229920256, "step": 5250, "train_runtime": 40653.9984, "train_tokens_per_second": 5655.539 }, { "epoch": 0.3538244007541072, "grad_norm": 0.7502281989758054, "learning_rate": 9.24770880533688e-06, "loss": 0.4205930709838867, "num_input_tokens_seen": 230150768, "step": 5255, "train_runtime": 40691.9738, "train_tokens_per_second": 5655.925 }, { "epoch": 0.35416105575006734, "grad_norm": 0.9736374450794365, "learning_rate": 9.24631340163085e-06, "loss": 0.41542859077453614, "num_input_tokens_seen": 230338192, "step": 5260, "train_runtime": 40727.6217, "train_tokens_per_second": 5655.577 }, { "epoch": 0.3544977107460275, "grad_norm": 0.7629428550659803, "learning_rate": 9.244916810456822e-06, "loss": 0.3574668884277344, "num_input_tokens_seen": 230568472, "step": 5265, "train_runtime": 40758.3906, "train_tokens_per_second": 5656.957 }, { "epoch": 0.3548343657419876, "grad_norm": 0.7107248914856642, "learning_rate": 9.24351903220534e-06, "loss": 0.40234909057617185, "num_input_tokens_seen": 230793504, "step": 5270, "train_runtime": 40798.996, "train_tokens_per_second": 5656.843 }, { "epoch": 0.35517102073794776, "grad_norm": 0.8468122239159248, "learning_rate": 9.242120067267295e-06, "loss": 0.3589898347854614, "num_input_tokens_seen": 231011256, "step": 5275, "train_runtime": 40837.4422, "train_tokens_per_second": 5656.849 }, { "epoch": 0.3555076757339079, "grad_norm": 0.8384350564515061, "learning_rate": 9.2407199160339e-06, "loss": 0.3916470050811768, "num_input_tokens_seen": 231224304, "step": 5280, "train_runtime": 40879.0573, "train_tokens_per_second": 5656.302 }, { "epoch": 0.35584433072986804, "grad_norm": 0.7878128731634584, "learning_rate": 9.239318578896701e-06, "loss": 0.3869880199432373, "num_input_tokens_seen": 231440576, "step": 5285, "train_runtime": 40917.8128, "train_tokens_per_second": 5656.23 }, { "epoch": 0.3561809857258282, "grad_norm": 0.9404923069120379, "learning_rate": 9.237916056247583e-06, "loss": 0.40935673713684084, "num_input_tokens_seen": 231653280, "step": 5290, "train_runtime": 40955.4085, "train_tokens_per_second": 5656.232 }, { "epoch": 0.3565176407217883, "grad_norm": 0.790253055764951, "learning_rate": 9.23651234847875e-06, "loss": 0.4153427600860596, "num_input_tokens_seen": 231867296, "step": 5295, "train_runtime": 40993.5671, "train_tokens_per_second": 5656.187 }, { "epoch": 0.35685429571774846, "grad_norm": 0.8209369098367891, "learning_rate": 9.23510745598275e-06, "loss": 0.3877981185913086, "num_input_tokens_seen": 232073536, "step": 5300, "train_runtime": 41032.3162, "train_tokens_per_second": 5655.872 }, { "epoch": 0.3571909507137086, "grad_norm": 0.6660402351658175, "learning_rate": 9.233701379152456e-06, "loss": 0.3829216957092285, "num_input_tokens_seen": 232295728, "step": 5305, "train_runtime": 41070.6587, "train_tokens_per_second": 5656.002 }, { "epoch": 0.35752760570966874, "grad_norm": 0.7635535443595722, "learning_rate": 9.232294118381069e-06, "loss": 0.41249933242797854, "num_input_tokens_seen": 232520456, "step": 5310, "train_runtime": 41107.4158, "train_tokens_per_second": 5656.411 }, { "epoch": 0.3578642607056289, "grad_norm": 0.7665309192538949, "learning_rate": 9.230885674062129e-06, "loss": 0.3704015493392944, "num_input_tokens_seen": 232740384, "step": 5315, "train_runtime": 41146.5227, "train_tokens_per_second": 5656.38 }, { "epoch": 0.358200915701589, "grad_norm": 0.805325429526549, "learning_rate": 9.2294760465895e-06, "loss": 0.4049508094787598, "num_input_tokens_seen": 232969144, "step": 5320, "train_runtime": 41180.0542, "train_tokens_per_second": 5657.33 }, { "epoch": 0.35853757069754916, "grad_norm": 0.8309484529457033, "learning_rate": 9.228065236357383e-06, "loss": 0.39788720607757566, "num_input_tokens_seen": 233196464, "step": 5325, "train_runtime": 41217.3194, "train_tokens_per_second": 5657.73 }, { "epoch": 0.3588742256935093, "grad_norm": 0.7008865285408351, "learning_rate": 9.226653243760304e-06, "loss": 0.3763267993927002, "num_input_tokens_seen": 233413024, "step": 5330, "train_runtime": 41251.2257, "train_tokens_per_second": 5658.329 }, { "epoch": 0.35921088068946944, "grad_norm": 0.7229398353747315, "learning_rate": 9.225240069193124e-06, "loss": 0.4120461463928223, "num_input_tokens_seen": 233629584, "step": 5335, "train_runtime": 41295.9805, "train_tokens_per_second": 5657.441 }, { "epoch": 0.3595475356854296, "grad_norm": 0.854235630422482, "learning_rate": 9.223825713051034e-06, "loss": 0.4018904685974121, "num_input_tokens_seen": 233844536, "step": 5340, "train_runtime": 41326.7978, "train_tokens_per_second": 5658.424 }, { "epoch": 0.3598841906813897, "grad_norm": 0.8244749095839433, "learning_rate": 9.222410175729549e-06, "loss": 0.38492045402526853, "num_input_tokens_seen": 234063096, "step": 5345, "train_runtime": 41367.4954, "train_tokens_per_second": 5658.14 }, { "epoch": 0.36022084567734985, "grad_norm": 0.7424522527415252, "learning_rate": 9.220993457624523e-06, "loss": 0.3723012924194336, "num_input_tokens_seen": 234279256, "step": 5350, "train_runtime": 41414.7783, "train_tokens_per_second": 5656.9 }, { "epoch": 0.36055750067331, "grad_norm": 0.8296218729091308, "learning_rate": 9.219575559132136e-06, "loss": 0.4064267635345459, "num_input_tokens_seen": 234496160, "step": 5355, "train_runtime": 41454.7573, "train_tokens_per_second": 5656.677 }, { "epoch": 0.36089415566927013, "grad_norm": 0.8270954179905022, "learning_rate": 9.2181564806489e-06, "loss": 0.3711550235748291, "num_input_tokens_seen": 234705872, "step": 5360, "train_runtime": 41488.3956, "train_tokens_per_second": 5657.145 }, { "epoch": 0.3612308106652303, "grad_norm": 0.7010804881835582, "learning_rate": 9.216736222571655e-06, "loss": 0.36968867778778075, "num_input_tokens_seen": 234928056, "step": 5365, "train_runtime": 41528.5306, "train_tokens_per_second": 5657.028 }, { "epoch": 0.3615674656611904, "grad_norm": 0.7909884318309988, "learning_rate": 9.215314785297572e-06, "loss": 0.4384300708770752, "num_input_tokens_seen": 235127224, "step": 5370, "train_runtime": 41566.5449, "train_tokens_per_second": 5656.646 }, { "epoch": 0.36190412065715055, "grad_norm": 0.7730294782111428, "learning_rate": 9.21389216922415e-06, "loss": 0.3896491527557373, "num_input_tokens_seen": 235350232, "step": 5375, "train_runtime": 41604.4719, "train_tokens_per_second": 5656.849 }, { "epoch": 0.3622407756531107, "grad_norm": 1.5247558034207205, "learning_rate": 9.212468374749222e-06, "loss": 0.4335320949554443, "num_input_tokens_seen": 235570704, "step": 5380, "train_runtime": 41642.8804, "train_tokens_per_second": 5656.926 }, { "epoch": 0.36257743064907083, "grad_norm": 0.7761987245970543, "learning_rate": 9.211043402270942e-06, "loss": 0.39116473197937013, "num_input_tokens_seen": 235785280, "step": 5385, "train_runtime": 41679.7538, "train_tokens_per_second": 5657.07 }, { "epoch": 0.36291408564503097, "grad_norm": 0.7417904936648765, "learning_rate": 9.209617252187806e-06, "loss": 0.3792844533920288, "num_input_tokens_seen": 235999696, "step": 5390, "train_runtime": 41717.5624, "train_tokens_per_second": 5657.083 }, { "epoch": 0.3632507406409911, "grad_norm": 0.8168071916778651, "learning_rate": 9.208189924898627e-06, "loss": 0.3464975833892822, "num_input_tokens_seen": 236210480, "step": 5395, "train_runtime": 41760.5338, "train_tokens_per_second": 5656.309 }, { "epoch": 0.36358739563695125, "grad_norm": 0.7857550769816507, "learning_rate": 9.206761420802554e-06, "loss": 0.4210227966308594, "num_input_tokens_seen": 236432304, "step": 5400, "train_runtime": 41802.7339, "train_tokens_per_second": 5655.905 }, { "epoch": 0.3639240506329114, "grad_norm": 0.724781136378123, "learning_rate": 9.205331740299065e-06, "loss": 0.3803566932678223, "num_input_tokens_seen": 236642552, "step": 5405, "train_runtime": 41844.665, "train_tokens_per_second": 5655.262 }, { "epoch": 0.36426070562887153, "grad_norm": 0.7382233662482024, "learning_rate": 9.203900883787967e-06, "loss": 0.4222862243652344, "num_input_tokens_seen": 236866080, "step": 5410, "train_runtime": 41880.1302, "train_tokens_per_second": 5655.811 }, { "epoch": 0.36459736062483167, "grad_norm": 0.7707623946075276, "learning_rate": 9.202468851669388e-06, "loss": 0.42064590454101564, "num_input_tokens_seen": 237084656, "step": 5415, "train_runtime": 41922.4674, "train_tokens_per_second": 5655.313 }, { "epoch": 0.3649340156207918, "grad_norm": 0.7505014032426987, "learning_rate": 9.201035644343797e-06, "loss": 0.40491809844970705, "num_input_tokens_seen": 237299088, "step": 5420, "train_runtime": 41963.0407, "train_tokens_per_second": 5654.955 }, { "epoch": 0.36527067061675195, "grad_norm": 0.8419562349359976, "learning_rate": 9.199601262211985e-06, "loss": 0.3938578128814697, "num_input_tokens_seen": 237505024, "step": 5425, "train_runtime": 41999.6624, "train_tokens_per_second": 5654.927 }, { "epoch": 0.3656073256127121, "grad_norm": 0.7844116167185397, "learning_rate": 9.19816570567507e-06, "loss": 0.4014750480651855, "num_input_tokens_seen": 237729312, "step": 5430, "train_runtime": 42038.7844, "train_tokens_per_second": 5655.0 }, { "epoch": 0.3659439806086722, "grad_norm": 0.8709777369310681, "learning_rate": 9.196728975134503e-06, "loss": 0.41324663162231445, "num_input_tokens_seen": 237937544, "step": 5435, "train_runtime": 42082.2656, "train_tokens_per_second": 5654.105 }, { "epoch": 0.36628063560463237, "grad_norm": 0.943067660878324, "learning_rate": 9.195291070992061e-06, "loss": 0.39972093105316164, "num_input_tokens_seen": 238144328, "step": 5440, "train_runtime": 42119.7987, "train_tokens_per_second": 5653.976 }, { "epoch": 0.3666172906005925, "grad_norm": 0.7866408242613544, "learning_rate": 9.193851993649849e-06, "loss": 0.36598644256591795, "num_input_tokens_seen": 238371752, "step": 5445, "train_runtime": 42157.0955, "train_tokens_per_second": 5654.368 }, { "epoch": 0.36695394559655264, "grad_norm": 0.7572508667451172, "learning_rate": 9.1924117435103e-06, "loss": 0.3939794063568115, "num_input_tokens_seen": 238586128, "step": 5450, "train_runtime": 42198.1981, "train_tokens_per_second": 5653.941 }, { "epoch": 0.3672906005925128, "grad_norm": 0.885004223430614, "learning_rate": 9.190970320976176e-06, "loss": 0.3719717264175415, "num_input_tokens_seen": 238811344, "step": 5455, "train_runtime": 42232.691, "train_tokens_per_second": 5654.656 }, { "epoch": 0.3676272555884729, "grad_norm": 0.8940362227103387, "learning_rate": 9.189527726450565e-06, "loss": 0.4350133895874023, "num_input_tokens_seen": 239003208, "step": 5460, "train_runtime": 42266.5178, "train_tokens_per_second": 5654.67 }, { "epoch": 0.36796391058443306, "grad_norm": 0.6837019733666716, "learning_rate": 9.188083960336885e-06, "loss": 0.3788605213165283, "num_input_tokens_seen": 239225040, "step": 5465, "train_runtime": 42305.7631, "train_tokens_per_second": 5654.668 }, { "epoch": 0.3683005655803932, "grad_norm": 0.7278725929539929, "learning_rate": 9.186639023038879e-06, "loss": 0.4101285934448242, "num_input_tokens_seen": 239445688, "step": 5470, "train_runtime": 42345.9353, "train_tokens_per_second": 5654.514 }, { "epoch": 0.36863722057635334, "grad_norm": 0.8240745816268156, "learning_rate": 9.185192914960622e-06, "loss": 0.43002777099609374, "num_input_tokens_seen": 239660856, "step": 5475, "train_runtime": 42383.8589, "train_tokens_per_second": 5654.531 }, { "epoch": 0.3689738755723135, "grad_norm": 0.7561111927294512, "learning_rate": 9.183745636506511e-06, "loss": 0.400468635559082, "num_input_tokens_seen": 239863160, "step": 5480, "train_runtime": 42415.6347, "train_tokens_per_second": 5655.065 }, { "epoch": 0.3693105305682736, "grad_norm": 0.6657976994723397, "learning_rate": 9.182297188081274e-06, "loss": 0.39147305488586426, "num_input_tokens_seen": 240088504, "step": 5485, "train_runtime": 42445.5983, "train_tokens_per_second": 5656.382 }, { "epoch": 0.36964718556423376, "grad_norm": 0.7438674827381799, "learning_rate": 9.180847570089964e-06, "loss": 0.38025264739990233, "num_input_tokens_seen": 240285080, "step": 5490, "train_runtime": 42487.4443, "train_tokens_per_second": 5655.437 }, { "epoch": 0.3699838405601939, "grad_norm": 0.7687571314606845, "learning_rate": 9.179396782937965e-06, "loss": 0.4285304546356201, "num_input_tokens_seen": 240518464, "step": 5495, "train_runtime": 42522.1167, "train_tokens_per_second": 5656.314 }, { "epoch": 0.37032049555615404, "grad_norm": 0.8258932109796826, "learning_rate": 9.17794482703098e-06, "loss": 0.41852726936340334, "num_input_tokens_seen": 240737112, "step": 5500, "train_runtime": 42561.0578, "train_tokens_per_second": 5656.277 }, { "epoch": 0.3706571505521142, "grad_norm": 0.7712097331858169, "learning_rate": 9.176491702775049e-06, "loss": 0.4076284408569336, "num_input_tokens_seen": 240940632, "step": 5505, "train_runtime": 42605.8265, "train_tokens_per_second": 5655.11 }, { "epoch": 0.3709938055480743, "grad_norm": 0.7293507629162065, "learning_rate": 9.17503741057653e-06, "loss": 0.42336077690124513, "num_input_tokens_seen": 241163512, "step": 5510, "train_runtime": 42641.1976, "train_tokens_per_second": 5655.646 }, { "epoch": 0.37133046054403446, "grad_norm": 0.7873802897373652, "learning_rate": 9.173581950842111e-06, "loss": 0.3858926773071289, "num_input_tokens_seen": 241380280, "step": 5515, "train_runtime": 42677.1161, "train_tokens_per_second": 5655.965 }, { "epoch": 0.3716671155399946, "grad_norm": 0.833898462602849, "learning_rate": 9.172125323978811e-06, "loss": 0.39653089046478274, "num_input_tokens_seen": 241601112, "step": 5520, "train_runtime": 42713.21, "train_tokens_per_second": 5656.356 }, { "epoch": 0.37200377053595474, "grad_norm": 0.7933645694043111, "learning_rate": 9.170667530393966e-06, "loss": 0.4098936080932617, "num_input_tokens_seen": 241828432, "step": 5525, "train_runtime": 42747.8553, "train_tokens_per_second": 5657.089 }, { "epoch": 0.3723404255319149, "grad_norm": 0.724581396473804, "learning_rate": 9.169208570495247e-06, "loss": 0.3672953605651855, "num_input_tokens_seen": 242051344, "step": 5530, "train_runtime": 42787.8177, "train_tokens_per_second": 5657.015 }, { "epoch": 0.372677080527875, "grad_norm": 0.720329801926469, "learning_rate": 9.167748444690646e-06, "loss": 0.3897575855255127, "num_input_tokens_seen": 242250584, "step": 5535, "train_runtime": 42826.4052, "train_tokens_per_second": 5656.571 }, { "epoch": 0.37301373552383515, "grad_norm": 0.7934647008536321, "learning_rate": 9.16628715338848e-06, "loss": 0.3871308326721191, "num_input_tokens_seen": 242459936, "step": 5540, "train_runtime": 42859.1014, "train_tokens_per_second": 5657.14 }, { "epoch": 0.3733503905197953, "grad_norm": 0.7931279904448103, "learning_rate": 9.164824696997398e-06, "loss": 0.37985944747924805, "num_input_tokens_seen": 242665952, "step": 5545, "train_runtime": 42896.1293, "train_tokens_per_second": 5657.059 }, { "epoch": 0.37368704551575543, "grad_norm": 0.7548635507515563, "learning_rate": 9.163361075926371e-06, "loss": 0.4154071807861328, "num_input_tokens_seen": 242885960, "step": 5550, "train_runtime": 42932.7348, "train_tokens_per_second": 5657.361 }, { "epoch": 0.3740237005117156, "grad_norm": 0.824128032145257, "learning_rate": 9.161896290584695e-06, "loss": 0.37793383598327634, "num_input_tokens_seen": 243108432, "step": 5555, "train_runtime": 42974.4088, "train_tokens_per_second": 5657.051 }, { "epoch": 0.3743603555076757, "grad_norm": 0.755788883617862, "learning_rate": 9.160430341381991e-06, "loss": 0.3929650545120239, "num_input_tokens_seen": 243321200, "step": 5560, "train_runtime": 43020.7871, "train_tokens_per_second": 5655.898 }, { "epoch": 0.37469701050363585, "grad_norm": 0.8046945349779168, "learning_rate": 9.15896322872821e-06, "loss": 0.39426612854003906, "num_input_tokens_seen": 243541160, "step": 5565, "train_runtime": 43065.6274, "train_tokens_per_second": 5655.117 }, { "epoch": 0.375033665499596, "grad_norm": 0.8408220299669169, "learning_rate": 9.157494953033625e-06, "loss": 0.4226834297180176, "num_input_tokens_seen": 243766296, "step": 5570, "train_runtime": 43100.4977, "train_tokens_per_second": 5655.765 }, { "epoch": 0.37537032049555613, "grad_norm": 0.7701423462069609, "learning_rate": 9.156025514708832e-06, "loss": 0.40192432403564454, "num_input_tokens_seen": 244002616, "step": 5575, "train_runtime": 43146.2968, "train_tokens_per_second": 5655.239 }, { "epoch": 0.37570697549151627, "grad_norm": 0.7773289349591549, "learning_rate": 9.154554914164757e-06, "loss": 0.38442695140838623, "num_input_tokens_seen": 244237240, "step": 5580, "train_runtime": 43188.3958, "train_tokens_per_second": 5655.159 }, { "epoch": 0.3760436304874764, "grad_norm": 0.6847338403952183, "learning_rate": 9.153083151812649e-06, "loss": 0.377176308631897, "num_input_tokens_seen": 244463576, "step": 5585, "train_runtime": 43225.3626, "train_tokens_per_second": 5655.559 }, { "epoch": 0.37638028548343655, "grad_norm": 0.780657947894897, "learning_rate": 9.151610228064078e-06, "loss": 0.40382232666015627, "num_input_tokens_seen": 244685816, "step": 5590, "train_runtime": 43264.9573, "train_tokens_per_second": 5655.52 }, { "epoch": 0.3767169404793967, "grad_norm": 0.7617598851673253, "learning_rate": 9.150136143330949e-06, "loss": 0.42247867584228516, "num_input_tokens_seen": 244901992, "step": 5595, "train_runtime": 43305.9839, "train_tokens_per_second": 5655.154 }, { "epoch": 0.37705359547535683, "grad_norm": 0.6965545191686713, "learning_rate": 9.14866089802548e-06, "loss": 0.3760505676269531, "num_input_tokens_seen": 245127560, "step": 5600, "train_runtime": 43348.427, "train_tokens_per_second": 5654.82 }, { "epoch": 0.37739025047131697, "grad_norm": 0.8578077401564244, "learning_rate": 9.147184492560219e-06, "loss": 0.3698588848114014, "num_input_tokens_seen": 245339952, "step": 5605, "train_runtime": 43388.8794, "train_tokens_per_second": 5654.443 }, { "epoch": 0.3777269054672771, "grad_norm": 1.0507318076347205, "learning_rate": 9.14570692734804e-06, "loss": 0.3787434816360474, "num_input_tokens_seen": 245565672, "step": 5610, "train_runtime": 43425.1962, "train_tokens_per_second": 5654.912 }, { "epoch": 0.37806356046323725, "grad_norm": 0.8234417174719115, "learning_rate": 9.144228202802137e-06, "loss": 0.41345486640930174, "num_input_tokens_seen": 245793416, "step": 5615, "train_runtime": 43457.0254, "train_tokens_per_second": 5656.011 }, { "epoch": 0.37840021545919744, "grad_norm": 0.8147806646148233, "learning_rate": 9.142748319336033e-06, "loss": 0.39602549076080323, "num_input_tokens_seen": 246014600, "step": 5620, "train_runtime": 43495.3144, "train_tokens_per_second": 5656.117 }, { "epoch": 0.3787368704551576, "grad_norm": 0.8294007935657565, "learning_rate": 9.141267277363573e-06, "loss": 0.3865189552307129, "num_input_tokens_seen": 246209040, "step": 5625, "train_runtime": 43530.2862, "train_tokens_per_second": 5656.04 }, { "epoch": 0.3790735254511177, "grad_norm": 0.8057103649691175, "learning_rate": 9.139785077298921e-06, "loss": 0.3669655084609985, "num_input_tokens_seen": 246435304, "step": 5630, "train_runtime": 43570.2665, "train_tokens_per_second": 5656.043 }, { "epoch": 0.37941018044707786, "grad_norm": 0.7570731119383132, "learning_rate": 9.138301719556577e-06, "loss": 0.3826982736587524, "num_input_tokens_seen": 246652712, "step": 5635, "train_runtime": 43609.2254, "train_tokens_per_second": 5655.976 }, { "epoch": 0.379746835443038, "grad_norm": 0.7474769926348979, "learning_rate": 9.136817204551352e-06, "loss": 0.386492919921875, "num_input_tokens_seen": 246882568, "step": 5640, "train_runtime": 43646.3585, "train_tokens_per_second": 5656.43 }, { "epoch": 0.38008349043899814, "grad_norm": 0.7350249063601988, "learning_rate": 9.135331532698385e-06, "loss": 0.3880929470062256, "num_input_tokens_seen": 247094472, "step": 5645, "train_runtime": 43685.4708, "train_tokens_per_second": 5656.216 }, { "epoch": 0.3804201454349583, "grad_norm": 0.7440003142918237, "learning_rate": 9.133844704413144e-06, "loss": 0.37475876808166503, "num_input_tokens_seen": 247305056, "step": 5650, "train_runtime": 43724.0377, "train_tokens_per_second": 5656.043 }, { "epoch": 0.3807568004309184, "grad_norm": 0.829580642455565, "learning_rate": 9.132356720111413e-06, "loss": 0.40270652770996096, "num_input_tokens_seen": 247521856, "step": 5655, "train_runtime": 43766.9087, "train_tokens_per_second": 5655.457 }, { "epoch": 0.38109345542687856, "grad_norm": 0.7890155830011499, "learning_rate": 9.1308675802093e-06, "loss": 0.3874132394790649, "num_input_tokens_seen": 247735120, "step": 5660, "train_runtime": 43801.888, "train_tokens_per_second": 5655.809 }, { "epoch": 0.3814301104228387, "grad_norm": 0.7482568242628747, "learning_rate": 9.129377285123241e-06, "loss": 0.3984661102294922, "num_input_tokens_seen": 247949328, "step": 5665, "train_runtime": 43845.4472, "train_tokens_per_second": 5655.076 }, { "epoch": 0.38176676541879884, "grad_norm": 0.7947458109924397, "learning_rate": 9.127885835269996e-06, "loss": 0.4090867519378662, "num_input_tokens_seen": 248174032, "step": 5670, "train_runtime": 43879.3187, "train_tokens_per_second": 5655.831 }, { "epoch": 0.382103420414759, "grad_norm": 0.726446478217637, "learning_rate": 9.126393231066636e-06, "loss": 0.3848613977432251, "num_input_tokens_seen": 248384368, "step": 5675, "train_runtime": 43917.9285, "train_tokens_per_second": 5655.649 }, { "epoch": 0.3824400754107191, "grad_norm": 0.7750970581531168, "learning_rate": 9.124899472930568e-06, "loss": 0.4047283172607422, "num_input_tokens_seen": 248607600, "step": 5680, "train_runtime": 43961.6528, "train_tokens_per_second": 5655.101 }, { "epoch": 0.38277673040667926, "grad_norm": 1.9536806017675672, "learning_rate": 9.123404561279517e-06, "loss": 0.41053128242492676, "num_input_tokens_seen": 248811928, "step": 5685, "train_runtime": 44006.8302, "train_tokens_per_second": 5653.939 }, { "epoch": 0.3831133854026394, "grad_norm": 0.7123153967912388, "learning_rate": 9.121908496531527e-06, "loss": 0.3802008867263794, "num_input_tokens_seen": 249035424, "step": 5690, "train_runtime": 44040.1743, "train_tokens_per_second": 5654.733 }, { "epoch": 0.38345004039859953, "grad_norm": 0.7190654994858774, "learning_rate": 9.120411279104971e-06, "loss": 0.3904706954956055, "num_input_tokens_seen": 249254456, "step": 5695, "train_runtime": 44083.466, "train_tokens_per_second": 5654.148 }, { "epoch": 0.3837866953945597, "grad_norm": 0.9187897813904784, "learning_rate": 9.118912909418538e-06, "loss": 0.39504170417785645, "num_input_tokens_seen": 249477272, "step": 5700, "train_runtime": 44127.086, "train_tokens_per_second": 5653.609 }, { "epoch": 0.3841233503905198, "grad_norm": 0.7651587963325609, "learning_rate": 9.117413387891246e-06, "loss": 0.4095571041107178, "num_input_tokens_seen": 249693520, "step": 5705, "train_runtime": 44170.6884, "train_tokens_per_second": 5652.923 }, { "epoch": 0.38446000538647995, "grad_norm": 0.7879046146044965, "learning_rate": 9.11591271494243e-06, "loss": 0.39027183055877684, "num_input_tokens_seen": 249909984, "step": 5710, "train_runtime": 44209.3015, "train_tokens_per_second": 5652.882 }, { "epoch": 0.3847966603824401, "grad_norm": 0.7861690179999627, "learning_rate": 9.114410890991748e-06, "loss": 0.40212602615356446, "num_input_tokens_seen": 250124664, "step": 5715, "train_runtime": 44250.9806, "train_tokens_per_second": 5652.41 }, { "epoch": 0.38513331537840023, "grad_norm": 0.7798159280525913, "learning_rate": 9.112907916459177e-06, "loss": 0.37251665592193606, "num_input_tokens_seen": 250317264, "step": 5720, "train_runtime": 44293.6615, "train_tokens_per_second": 5651.311 }, { "epoch": 0.38546997037436037, "grad_norm": 0.7886435715633883, "learning_rate": 9.111403791765025e-06, "loss": 0.38798794746398924, "num_input_tokens_seen": 250544576, "step": 5725, "train_runtime": 44329.9756, "train_tokens_per_second": 5651.809 }, { "epoch": 0.3858066253703205, "grad_norm": 0.7210916045331931, "learning_rate": 9.109898517329914e-06, "loss": 0.3711621046066284, "num_input_tokens_seen": 250774080, "step": 5730, "train_runtime": 44362.0555, "train_tokens_per_second": 5652.896 }, { "epoch": 0.38614328036628065, "grad_norm": 0.757278528605975, "learning_rate": 9.108392093574785e-06, "loss": 0.3934319972991943, "num_input_tokens_seen": 250992112, "step": 5735, "train_runtime": 44396.0233, "train_tokens_per_second": 5653.482 }, { "epoch": 0.3864799353622408, "grad_norm": 0.7725316475525575, "learning_rate": 9.10688452092091e-06, "loss": 0.36261420249938964, "num_input_tokens_seen": 251210912, "step": 5740, "train_runtime": 44426.4194, "train_tokens_per_second": 5654.539 }, { "epoch": 0.38681659035820093, "grad_norm": 0.8668597404685281, "learning_rate": 9.105375799789874e-06, "loss": 0.39951817989349364, "num_input_tokens_seen": 251426584, "step": 5745, "train_runtime": 44475.8422, "train_tokens_per_second": 5653.105 }, { "epoch": 0.38715324535416107, "grad_norm": 0.8168129882131703, "learning_rate": 9.103865930603586e-06, "loss": 0.3850820064544678, "num_input_tokens_seen": 251633720, "step": 5750, "train_runtime": 44516.691, "train_tokens_per_second": 5652.57 }, { "epoch": 0.3874899003501212, "grad_norm": 0.7659015613854286, "learning_rate": 9.102354913784279e-06, "loss": 0.3853774070739746, "num_input_tokens_seen": 251855296, "step": 5755, "train_runtime": 44559.5986, "train_tokens_per_second": 5652.1 }, { "epoch": 0.38782655534608135, "grad_norm": 0.7966891158323898, "learning_rate": 9.100842749754499e-06, "loss": 0.3578346252441406, "num_input_tokens_seen": 252080400, "step": 5760, "train_runtime": 44605.3404, "train_tokens_per_second": 5651.35 }, { "epoch": 0.3881632103420415, "grad_norm": 1.3427031718401212, "learning_rate": 9.099329438937122e-06, "loss": 0.40854997634887696, "num_input_tokens_seen": 252296312, "step": 5765, "train_runtime": 44649.458, "train_tokens_per_second": 5650.602 }, { "epoch": 0.3884998653380016, "grad_norm": 0.6230050104908084, "learning_rate": 9.09781498175534e-06, "loss": 0.3587602138519287, "num_input_tokens_seen": 252509656, "step": 5770, "train_runtime": 44685.4879, "train_tokens_per_second": 5650.82 }, { "epoch": 0.38883652033396177, "grad_norm": 0.6750080511665485, "learning_rate": 9.096299378632666e-06, "loss": 0.37611684799194334, "num_input_tokens_seen": 252740072, "step": 5775, "train_runtime": 44727.054, "train_tokens_per_second": 5650.72 }, { "epoch": 0.3891731753299219, "grad_norm": 0.7734243231158888, "learning_rate": 9.09478262999293e-06, "loss": 0.4280585289001465, "num_input_tokens_seen": 252973392, "step": 5780, "train_runtime": 44771.0866, "train_tokens_per_second": 5650.374 }, { "epoch": 0.38950983032588204, "grad_norm": 0.8173587277273618, "learning_rate": 9.09326473626029e-06, "loss": 0.38141813278198244, "num_input_tokens_seen": 253184320, "step": 5785, "train_runtime": 44809.6538, "train_tokens_per_second": 5650.218 }, { "epoch": 0.3898464853218422, "grad_norm": 0.7487752402423106, "learning_rate": 9.091745697859218e-06, "loss": 0.41326370239257815, "num_input_tokens_seen": 253411776, "step": 5790, "train_runtime": 44845.5045, "train_tokens_per_second": 5650.773 }, { "epoch": 0.3901831403178023, "grad_norm": 0.8197406274404395, "learning_rate": 9.090225515214512e-06, "loss": 0.4117950439453125, "num_input_tokens_seen": 253627512, "step": 5795, "train_runtime": 44885.8047, "train_tokens_per_second": 5650.506 }, { "epoch": 0.39051979531376246, "grad_norm": 0.8857575262398083, "learning_rate": 9.088704188751281e-06, "loss": 0.4129201889038086, "num_input_tokens_seen": 253840400, "step": 5800, "train_runtime": 44924.1283, "train_tokens_per_second": 5650.425 }, { "epoch": 0.3908564503097226, "grad_norm": 0.85730454063038, "learning_rate": 9.087181718894963e-06, "loss": 0.39529869556427, "num_input_tokens_seen": 254064096, "step": 5805, "train_runtime": 44968.4154, "train_tokens_per_second": 5649.834 }, { "epoch": 0.39119310530568274, "grad_norm": 0.7118238052198951, "learning_rate": 9.085658106071309e-06, "loss": 0.39313058853149413, "num_input_tokens_seen": 254281632, "step": 5810, "train_runtime": 45005.0615, "train_tokens_per_second": 5650.067 }, { "epoch": 0.3915297603016429, "grad_norm": 0.7349746949660144, "learning_rate": 9.084133350706394e-06, "loss": 0.3712653398513794, "num_input_tokens_seen": 254493944, "step": 5815, "train_runtime": 45042.1578, "train_tokens_per_second": 5650.128 }, { "epoch": 0.391866415297603, "grad_norm": 0.7166943198737387, "learning_rate": 9.082607453226613e-06, "loss": 0.38478312492370603, "num_input_tokens_seen": 254715712, "step": 5820, "train_runtime": 45077.3472, "train_tokens_per_second": 5650.637 }, { "epoch": 0.39220307029356316, "grad_norm": 0.7543487043231831, "learning_rate": 9.081080414058674e-06, "loss": 0.3994553565979004, "num_input_tokens_seen": 254927592, "step": 5825, "train_runtime": 45113.9999, "train_tokens_per_second": 5650.742 }, { "epoch": 0.3925397252895233, "grad_norm": 0.7896679447300116, "learning_rate": 9.079552233629612e-06, "loss": 0.3710631847381592, "num_input_tokens_seen": 255138464, "step": 5830, "train_runtime": 45152.0089, "train_tokens_per_second": 5650.656 }, { "epoch": 0.39287638028548344, "grad_norm": 0.815361722369787, "learning_rate": 9.078022912366776e-06, "loss": 0.3914163827896118, "num_input_tokens_seen": 255367048, "step": 5835, "train_runtime": 45192.1775, "train_tokens_per_second": 5650.691 }, { "epoch": 0.3932130352814436, "grad_norm": 0.8005773109782048, "learning_rate": 9.076492450697835e-06, "loss": 0.40029544830322267, "num_input_tokens_seen": 255598184, "step": 5840, "train_runtime": 45232.9765, "train_tokens_per_second": 5650.704 }, { "epoch": 0.3935496902774037, "grad_norm": 0.849726633762188, "learning_rate": 9.074960849050782e-06, "loss": 0.3852508068084717, "num_input_tokens_seen": 255819944, "step": 5845, "train_runtime": 45272.8634, "train_tokens_per_second": 5650.624 }, { "epoch": 0.39388634527336386, "grad_norm": 0.7762826196998844, "learning_rate": 9.07342810785392e-06, "loss": 0.37957100868225097, "num_input_tokens_seen": 256019616, "step": 5850, "train_runtime": 45311.4802, "train_tokens_per_second": 5650.215 }, { "epoch": 0.394223000269324, "grad_norm": 0.7731972533551551, "learning_rate": 9.071894227535878e-06, "loss": 0.38977823257446287, "num_input_tokens_seen": 256237256, "step": 5855, "train_runtime": 45352.5452, "train_tokens_per_second": 5649.898 }, { "epoch": 0.39455965526528414, "grad_norm": 0.8423525268519388, "learning_rate": 9.070359208525598e-06, "loss": 0.406312084197998, "num_input_tokens_seen": 256464368, "step": 5860, "train_runtime": 45388.423, "train_tokens_per_second": 5650.436 }, { "epoch": 0.3948963102612443, "grad_norm": 0.8527879610056384, "learning_rate": 9.068823051252346e-06, "loss": 0.3981436491012573, "num_input_tokens_seen": 256688032, "step": 5865, "train_runtime": 45429.2415, "train_tokens_per_second": 5650.282 }, { "epoch": 0.3952329652572044, "grad_norm": 0.8385538303650153, "learning_rate": 9.067285756145702e-06, "loss": 0.3921481132507324, "num_input_tokens_seen": 256917840, "step": 5870, "train_runtime": 45462.4848, "train_tokens_per_second": 5651.205 }, { "epoch": 0.39556962025316456, "grad_norm": 0.8390456887457934, "learning_rate": 9.065747323635565e-06, "loss": 0.3327157020568848, "num_input_tokens_seen": 257101736, "step": 5875, "train_runtime": 45501.4164, "train_tokens_per_second": 5650.412 }, { "epoch": 0.3959062752491247, "grad_norm": 0.7851013810213687, "learning_rate": 9.064207754152154e-06, "loss": 0.3997276782989502, "num_input_tokens_seen": 257317696, "step": 5880, "train_runtime": 45545.2236, "train_tokens_per_second": 5649.719 }, { "epoch": 0.39624293024508483, "grad_norm": 0.7365128564544189, "learning_rate": 9.062667048126005e-06, "loss": 0.3864887714385986, "num_input_tokens_seen": 257547392, "step": 5885, "train_runtime": 45589.9837, "train_tokens_per_second": 5649.21 }, { "epoch": 0.396579585241045, "grad_norm": 0.8935927015959244, "learning_rate": 9.061125205987971e-06, "loss": 0.4157553672790527, "num_input_tokens_seen": 257761408, "step": 5890, "train_runtime": 45630.8437, "train_tokens_per_second": 5648.842 }, { "epoch": 0.3969162402370051, "grad_norm": 0.7876564044642139, "learning_rate": 9.059582228169222e-06, "loss": 0.37337889671325686, "num_input_tokens_seen": 257963800, "step": 5895, "train_runtime": 45664.7, "train_tokens_per_second": 5649.086 }, { "epoch": 0.39725289523296525, "grad_norm": 0.7288959690931758, "learning_rate": 9.058038115101248e-06, "loss": 0.4037358283996582, "num_input_tokens_seen": 258195648, "step": 5900, "train_runtime": 45702.5616, "train_tokens_per_second": 5649.479 }, { "epoch": 0.3975895502289254, "grad_norm": 0.7904683688779008, "learning_rate": 9.056492867215857e-06, "loss": 0.3476010084152222, "num_input_tokens_seen": 258400784, "step": 5905, "train_runtime": 45748.63, "train_tokens_per_second": 5648.274 }, { "epoch": 0.39792620522488553, "grad_norm": 0.6759275337501953, "learning_rate": 9.05494648494517e-06, "loss": 0.3933530330657959, "num_input_tokens_seen": 258606968, "step": 5910, "train_runtime": 45786.7698, "train_tokens_per_second": 5648.072 }, { "epoch": 0.39826286022084567, "grad_norm": 0.6825204404349337, "learning_rate": 9.053398968721629e-06, "loss": 0.37357821464538576, "num_input_tokens_seen": 258832840, "step": 5915, "train_runtime": 45827.0425, "train_tokens_per_second": 5648.037 }, { "epoch": 0.3985995152168058, "grad_norm": 0.7549266235464368, "learning_rate": 9.05185031897799e-06, "loss": 0.4264666080474854, "num_input_tokens_seen": 259049920, "step": 5920, "train_runtime": 45860.4564, "train_tokens_per_second": 5648.656 }, { "epoch": 0.39893617021276595, "grad_norm": 0.8046151442540065, "learning_rate": 9.050300536147331e-06, "loss": 0.42224712371826173, "num_input_tokens_seen": 259285872, "step": 5925, "train_runtime": 45898.8286, "train_tokens_per_second": 5649.074 }, { "epoch": 0.3992728252087261, "grad_norm": 0.8013279899857307, "learning_rate": 9.048749620663044e-06, "loss": 0.36397323608398435, "num_input_tokens_seen": 259520536, "step": 5930, "train_runtime": 45935.2903, "train_tokens_per_second": 5649.698 }, { "epoch": 0.39960948020468623, "grad_norm": 0.7188029194424288, "learning_rate": 9.047197572958834e-06, "loss": 0.37349615097045896, "num_input_tokens_seen": 259742248, "step": 5935, "train_runtime": 45973.4138, "train_tokens_per_second": 5649.836 }, { "epoch": 0.39994613520064637, "grad_norm": 0.8120677037958034, "learning_rate": 9.04564439346873e-06, "loss": 0.3917673110961914, "num_input_tokens_seen": 259952080, "step": 5940, "train_runtime": 46008.964, "train_tokens_per_second": 5650.031 }, { "epoch": 0.4002827901966065, "grad_norm": 0.8737926960149425, "learning_rate": 9.044090082627071e-06, "loss": 0.39895708560943605, "num_input_tokens_seen": 260160320, "step": 5945, "train_runtime": 46045.9436, "train_tokens_per_second": 5650.016 }, { "epoch": 0.40061944519256665, "grad_norm": 0.7302283729471113, "learning_rate": 9.042534640868514e-06, "loss": 0.4021873950958252, "num_input_tokens_seen": 260368008, "step": 5950, "train_runtime": 46081.9071, "train_tokens_per_second": 5650.114 }, { "epoch": 0.4009561001885268, "grad_norm": 0.749168823407156, "learning_rate": 9.04097806862804e-06, "loss": 0.40214033126831056, "num_input_tokens_seen": 260592824, "step": 5955, "train_runtime": 46117.1368, "train_tokens_per_second": 5650.672 }, { "epoch": 0.4012927551844869, "grad_norm": 0.723288812952783, "learning_rate": 9.03942036634093e-06, "loss": 0.4055626392364502, "num_input_tokens_seen": 260810288, "step": 5960, "train_runtime": 46156.4921, "train_tokens_per_second": 5650.566 }, { "epoch": 0.40162941018044707, "grad_norm": 0.7518699289987396, "learning_rate": 9.037861534442797e-06, "loss": 0.3734895706176758, "num_input_tokens_seen": 261038312, "step": 5965, "train_runtime": 46198.2126, "train_tokens_per_second": 5650.399 }, { "epoch": 0.4019660651764072, "grad_norm": 1.0026827049870985, "learning_rate": 9.036301573369563e-06, "loss": 0.40189208984375, "num_input_tokens_seen": 261266152, "step": 5970, "train_runtime": 46239.4807, "train_tokens_per_second": 5650.283 }, { "epoch": 0.40230272017236735, "grad_norm": 0.8605436747902855, "learning_rate": 9.034740483557465e-06, "loss": 0.3900024175643921, "num_input_tokens_seen": 261483152, "step": 5975, "train_runtime": 46274.8434, "train_tokens_per_second": 5650.655 }, { "epoch": 0.4026393751683275, "grad_norm": 0.7213971067668634, "learning_rate": 9.033178265443055e-06, "loss": 0.38559999465942385, "num_input_tokens_seen": 261703416, "step": 5980, "train_runtime": 46306.9931, "train_tokens_per_second": 5651.488 }, { "epoch": 0.4029760301642876, "grad_norm": 0.7467717729146578, "learning_rate": 9.031614919463206e-06, "loss": 0.3772167682647705, "num_input_tokens_seen": 261926896, "step": 5985, "train_runtime": 46342.877, "train_tokens_per_second": 5651.934 }, { "epoch": 0.40331268516024776, "grad_norm": 0.8052956550974576, "learning_rate": 9.030050446055099e-06, "loss": 0.3684276342391968, "num_input_tokens_seen": 262143080, "step": 5990, "train_runtime": 46380.2479, "train_tokens_per_second": 5652.041 }, { "epoch": 0.4036493401562079, "grad_norm": 0.6725874955047775, "learning_rate": 9.028484845656235e-06, "loss": 0.3965585231781006, "num_input_tokens_seen": 262378952, "step": 5995, "train_runtime": 46413.7998, "train_tokens_per_second": 5653.038 }, { "epoch": 0.40398599515216804, "grad_norm": 0.8065835959924061, "learning_rate": 9.026918118704431e-06, "loss": 0.42124166488647463, "num_input_tokens_seen": 262599696, "step": 6000, "train_runtime": 46454.2053, "train_tokens_per_second": 5652.872 }, { "epoch": 0.4043226501481282, "grad_norm": 0.6374762319564959, "learning_rate": 9.025350265637816e-06, "loss": 0.3700655221939087, "num_input_tokens_seen": 262830992, "step": 6005, "train_runtime": 46490.7965, "train_tokens_per_second": 5653.398 }, { "epoch": 0.4046593051440883, "grad_norm": 0.7573194160968504, "learning_rate": 9.023781286894834e-06, "loss": 0.38486456871032715, "num_input_tokens_seen": 263044288, "step": 6010, "train_runtime": 46526.3581, "train_tokens_per_second": 5653.662 }, { "epoch": 0.40499596014004846, "grad_norm": 0.8562717514351039, "learning_rate": 9.022211182914247e-06, "loss": 0.3843253135681152, "num_input_tokens_seen": 263264800, "step": 6015, "train_runtime": 46564.9415, "train_tokens_per_second": 5653.713 }, { "epoch": 0.4053326151360086, "grad_norm": 0.7322028797978756, "learning_rate": 9.020639954135128e-06, "loss": 0.3804231405258179, "num_input_tokens_seen": 263476880, "step": 6020, "train_runtime": 46608.1754, "train_tokens_per_second": 5653.019 }, { "epoch": 0.40566927013196874, "grad_norm": 0.7924756161102612, "learning_rate": 9.019067600996867e-06, "loss": 0.32609758377075193, "num_input_tokens_seen": 263676440, "step": 6025, "train_runtime": 46647.9449, "train_tokens_per_second": 5652.477 }, { "epoch": 0.4060059251279289, "grad_norm": 0.7406207884260587, "learning_rate": 9.017494123939169e-06, "loss": 0.3878431558609009, "num_input_tokens_seen": 263891832, "step": 6030, "train_runtime": 46686.4579, "train_tokens_per_second": 5652.428 }, { "epoch": 0.406342580123889, "grad_norm": 0.6859816815928503, "learning_rate": 9.015919523402048e-06, "loss": 0.38746066093444825, "num_input_tokens_seen": 264108024, "step": 6035, "train_runtime": 46723.9959, "train_tokens_per_second": 5652.514 }, { "epoch": 0.40667923511984916, "grad_norm": 1.0398516753802722, "learning_rate": 9.014343799825838e-06, "loss": 0.3903219699859619, "num_input_tokens_seen": 264311560, "step": 6040, "train_runtime": 46758.4333, "train_tokens_per_second": 5652.704 }, { "epoch": 0.4070158901158093, "grad_norm": 0.6954397754211817, "learning_rate": 9.012766953651186e-06, "loss": 0.42699203491210935, "num_input_tokens_seen": 264536928, "step": 6045, "train_runtime": 46800.6106, "train_tokens_per_second": 5652.425 }, { "epoch": 0.40735254511176944, "grad_norm": 0.6848650266078808, "learning_rate": 9.01118898531905e-06, "loss": 0.4040683746337891, "num_input_tokens_seen": 264744560, "step": 6050, "train_runtime": 46841.7035, "train_tokens_per_second": 5651.899 }, { "epoch": 0.4076892001077296, "grad_norm": 0.7157357093690987, "learning_rate": 9.009609895270708e-06, "loss": 0.3655755043029785, "num_input_tokens_seen": 264973096, "step": 6055, "train_runtime": 46881.3659, "train_tokens_per_second": 5651.992 }, { "epoch": 0.4080258551036897, "grad_norm": 0.8098322622781278, "learning_rate": 9.008029683947743e-06, "loss": 0.42575840950012206, "num_input_tokens_seen": 265197544, "step": 6060, "train_runtime": 46917.7458, "train_tokens_per_second": 5652.393 }, { "epoch": 0.40836251009964986, "grad_norm": 0.7104130729995994, "learning_rate": 9.006448351792057e-06, "loss": 0.3974879741668701, "num_input_tokens_seen": 265418944, "step": 6065, "train_runtime": 46962.89, "train_tokens_per_second": 5651.674 }, { "epoch": 0.40869916509561, "grad_norm": 0.6632525596263023, "learning_rate": 9.004865899245864e-06, "loss": 0.38395133018493655, "num_input_tokens_seen": 265636776, "step": 6070, "train_runtime": 46999.967, "train_tokens_per_second": 5651.85 }, { "epoch": 0.40903582009157013, "grad_norm": 0.7043912136666165, "learning_rate": 9.003282326751694e-06, "loss": 0.4008152961730957, "num_input_tokens_seen": 265857800, "step": 6075, "train_runtime": 47039.3368, "train_tokens_per_second": 5651.819 }, { "epoch": 0.4093724750875303, "grad_norm": 0.9655541200247993, "learning_rate": 9.001697634752387e-06, "loss": 0.40933728218078613, "num_input_tokens_seen": 266070448, "step": 6080, "train_runtime": 47074.6096, "train_tokens_per_second": 5652.101 }, { "epoch": 0.4097091300834904, "grad_norm": 0.683185307022826, "learning_rate": 9.000111823691097e-06, "loss": 0.37639498710632324, "num_input_tokens_seen": 266291816, "step": 6085, "train_runtime": 47112.3669, "train_tokens_per_second": 5652.27 }, { "epoch": 0.41004578507945055, "grad_norm": 0.8219233379550768, "learning_rate": 8.99852489401129e-06, "loss": 0.40433249473571775, "num_input_tokens_seen": 266517904, "step": 6090, "train_runtime": 47148.2501, "train_tokens_per_second": 5652.763 }, { "epoch": 0.4103824400754107, "grad_norm": 0.7423675573693415, "learning_rate": 8.996936846156748e-06, "loss": 0.3635870456695557, "num_input_tokens_seen": 266736992, "step": 6095, "train_runtime": 47183.3361, "train_tokens_per_second": 5653.203 }, { "epoch": 0.41071909507137083, "grad_norm": 0.8008363109798308, "learning_rate": 8.995347680571563e-06, "loss": 0.41033496856689455, "num_input_tokens_seen": 266959272, "step": 6100, "train_runtime": 47217.625, "train_tokens_per_second": 5653.806 }, { "epoch": 0.41105575006733097, "grad_norm": 0.6633014625775752, "learning_rate": 8.993757397700137e-06, "loss": 0.38593282699584963, "num_input_tokens_seen": 267178696, "step": 6105, "train_runtime": 47254.1693, "train_tokens_per_second": 5654.077 }, { "epoch": 0.41139240506329117, "grad_norm": 0.7915805562051228, "learning_rate": 8.99216599798719e-06, "loss": 0.42214293479919435, "num_input_tokens_seen": 267415152, "step": 6110, "train_runtime": 47290.6934, "train_tokens_per_second": 5654.71 }, { "epoch": 0.4117290600592513, "grad_norm": 0.7917765167657784, "learning_rate": 8.990573481877753e-06, "loss": 0.3639373779296875, "num_input_tokens_seen": 267618552, "step": 6115, "train_runtime": 47325.6204, "train_tokens_per_second": 5654.835 }, { "epoch": 0.41206571505521145, "grad_norm": 0.694124505400035, "learning_rate": 8.988979849817167e-06, "loss": 0.36659536361694334, "num_input_tokens_seen": 267814904, "step": 6120, "train_runtime": 47366.4119, "train_tokens_per_second": 5654.11 }, { "epoch": 0.4124023700511716, "grad_norm": 0.8642974554518021, "learning_rate": 8.987385102251085e-06, "loss": 0.3810924291610718, "num_input_tokens_seen": 268015432, "step": 6125, "train_runtime": 47405.0635, "train_tokens_per_second": 5653.73 }, { "epoch": 0.4127390250471317, "grad_norm": 0.7416982400357927, "learning_rate": 8.985789239625475e-06, "loss": 0.3897581100463867, "num_input_tokens_seen": 268235696, "step": 6130, "train_runtime": 47449.5896, "train_tokens_per_second": 5653.067 }, { "epoch": 0.41307568004309186, "grad_norm": 0.7586989342588731, "learning_rate": 8.984192262386613e-06, "loss": 0.36377105712890623, "num_input_tokens_seen": 268454176, "step": 6135, "train_runtime": 47483.2101, "train_tokens_per_second": 5653.665 }, { "epoch": 0.413412335039052, "grad_norm": 0.7553176125857815, "learning_rate": 8.98259417098109e-06, "loss": 0.3994285583496094, "num_input_tokens_seen": 268685424, "step": 6140, "train_runtime": 47523.5954, "train_tokens_per_second": 5653.727 }, { "epoch": 0.41374899003501214, "grad_norm": 0.7619380388493862, "learning_rate": 8.980994965855808e-06, "loss": 0.39436161518096924, "num_input_tokens_seen": 268906160, "step": 6145, "train_runtime": 47557.2625, "train_tokens_per_second": 5654.366 }, { "epoch": 0.4140856450309723, "grad_norm": 0.7194190068295008, "learning_rate": 8.979394647457976e-06, "loss": 0.3927819490432739, "num_input_tokens_seen": 269128016, "step": 6150, "train_runtime": 47600.5297, "train_tokens_per_second": 5653.887 }, { "epoch": 0.4144223000269324, "grad_norm": 0.741178107175373, "learning_rate": 8.97779321623512e-06, "loss": 0.35940072536468504, "num_input_tokens_seen": 269333048, "step": 6155, "train_runtime": 47638.7497, "train_tokens_per_second": 5653.655 }, { "epoch": 0.41475895502289256, "grad_norm": 0.7334172734354966, "learning_rate": 8.976190672635077e-06, "loss": 0.400145435333252, "num_input_tokens_seen": 269557248, "step": 6160, "train_runtime": 47679.304, "train_tokens_per_second": 5653.548 }, { "epoch": 0.4150956100188527, "grad_norm": 0.7612088304227586, "learning_rate": 8.974587017105991e-06, "loss": 0.41222319602966306, "num_input_tokens_seen": 269768408, "step": 6165, "train_runtime": 47713.1048, "train_tokens_per_second": 5653.969 }, { "epoch": 0.41543226501481284, "grad_norm": 0.7344591815245108, "learning_rate": 8.97298225009632e-06, "loss": 0.3931986570358276, "num_input_tokens_seen": 269990368, "step": 6170, "train_runtime": 47754.3241, "train_tokens_per_second": 5653.737 }, { "epoch": 0.415768920010773, "grad_norm": 0.7575071698285096, "learning_rate": 8.971376372054829e-06, "loss": 0.3943799495697021, "num_input_tokens_seen": 270208056, "step": 6175, "train_runtime": 47794.7334, "train_tokens_per_second": 5653.511 }, { "epoch": 0.4161055750067331, "grad_norm": 0.6823047182780082, "learning_rate": 8.969769383430602e-06, "loss": 0.3858570337295532, "num_input_tokens_seen": 270432152, "step": 6180, "train_runtime": 47829.7321, "train_tokens_per_second": 5654.06 }, { "epoch": 0.41644223000269326, "grad_norm": 0.7476934311068052, "learning_rate": 8.968161284673027e-06, "loss": 0.37152729034423826, "num_input_tokens_seen": 270661216, "step": 6185, "train_runtime": 47868.2088, "train_tokens_per_second": 5654.3 }, { "epoch": 0.4167788849986534, "grad_norm": 0.7528325409155248, "learning_rate": 8.9665520762318e-06, "loss": 0.37863969802856445, "num_input_tokens_seen": 270875256, "step": 6190, "train_runtime": 47904.4792, "train_tokens_per_second": 5654.487 }, { "epoch": 0.41711553999461354, "grad_norm": 0.7282239751820792, "learning_rate": 8.964941758556934e-06, "loss": 0.3976884126663208, "num_input_tokens_seen": 271088288, "step": 6195, "train_runtime": 47948.7488, "train_tokens_per_second": 5653.709 }, { "epoch": 0.4174521949905737, "grad_norm": 0.755222562109598, "learning_rate": 8.963330332098747e-06, "loss": 0.3814378261566162, "num_input_tokens_seen": 271296528, "step": 6200, "train_runtime": 47985.6256, "train_tokens_per_second": 5653.704 }, { "epoch": 0.4177888499865338, "grad_norm": 0.7830273045211564, "learning_rate": 8.961717797307872e-06, "loss": 0.37258970737457275, "num_input_tokens_seen": 271515568, "step": 6205, "train_runtime": 48019.4934, "train_tokens_per_second": 5654.278 }, { "epoch": 0.41812550498249396, "grad_norm": 0.7683395292659414, "learning_rate": 8.960104154635248e-06, "loss": 0.4039943695068359, "num_input_tokens_seen": 271733704, "step": 6210, "train_runtime": 48057.6768, "train_tokens_per_second": 5654.325 }, { "epoch": 0.4184621599784541, "grad_norm": 0.7964266950242961, "learning_rate": 8.958489404532125e-06, "loss": 0.4006314277648926, "num_input_tokens_seen": 271941040, "step": 6215, "train_runtime": 48094.9785, "train_tokens_per_second": 5654.25 }, { "epoch": 0.41879881497441424, "grad_norm": 0.7229961706218653, "learning_rate": 8.956873547450062e-06, "loss": 0.3996126651763916, "num_input_tokens_seen": 272155560, "step": 6220, "train_runtime": 48135.1561, "train_tokens_per_second": 5653.987 }, { "epoch": 0.4191354699703744, "grad_norm": 0.8692942989729212, "learning_rate": 8.95525658384093e-06, "loss": 0.4290035247802734, "num_input_tokens_seen": 272369192, "step": 6225, "train_runtime": 48171.8576, "train_tokens_per_second": 5654.114 }, { "epoch": 0.4194721249663345, "grad_norm": 0.7600990815023999, "learning_rate": 8.953638514156908e-06, "loss": 0.3810266494750977, "num_input_tokens_seen": 272591248, "step": 6230, "train_runtime": 48208.9238, "train_tokens_per_second": 5654.373 }, { "epoch": 0.41980877996229465, "grad_norm": 0.7355727181513495, "learning_rate": 8.952019338850481e-06, "loss": 0.3950758695602417, "num_input_tokens_seen": 272810616, "step": 6235, "train_runtime": 48248.4869, "train_tokens_per_second": 5654.283 }, { "epoch": 0.4201454349582548, "grad_norm": 0.7644200111226909, "learning_rate": 8.950399058374447e-06, "loss": 0.377358603477478, "num_input_tokens_seen": 273036976, "step": 6240, "train_runtime": 48285.7901, "train_tokens_per_second": 5654.603 }, { "epoch": 0.42048208995421493, "grad_norm": 0.7918087336685585, "learning_rate": 8.948777673181913e-06, "loss": 0.389499831199646, "num_input_tokens_seen": 273260832, "step": 6245, "train_runtime": 48322.4015, "train_tokens_per_second": 5654.951 }, { "epoch": 0.42081874495017507, "grad_norm": 0.7765030452628453, "learning_rate": 8.947155183726296e-06, "loss": 0.35937402248382566, "num_input_tokens_seen": 273488360, "step": 6250, "train_runtime": 48361.4271, "train_tokens_per_second": 5655.093 }, { "epoch": 0.4211553999461352, "grad_norm": 0.7014097499994082, "learning_rate": 8.94553159046132e-06, "loss": 0.3715068817138672, "num_input_tokens_seen": 273707472, "step": 6255, "train_runtime": 48401.1614, "train_tokens_per_second": 5654.977 }, { "epoch": 0.42149205494209535, "grad_norm": 0.6408398788945804, "learning_rate": 8.943906893841015e-06, "loss": 0.36748714447021485, "num_input_tokens_seen": 273928544, "step": 6260, "train_runtime": 48433.3616, "train_tokens_per_second": 5655.782 }, { "epoch": 0.4218287099380555, "grad_norm": 0.754509294899034, "learning_rate": 8.942281094319721e-06, "loss": 0.4157464027404785, "num_input_tokens_seen": 274141592, "step": 6265, "train_runtime": 48468.7848, "train_tokens_per_second": 5656.044 }, { "epoch": 0.42216536493401563, "grad_norm": 0.7840590763768849, "learning_rate": 8.940654192352092e-06, "loss": 0.40111403465270995, "num_input_tokens_seen": 274349792, "step": 6270, "train_runtime": 48510.3168, "train_tokens_per_second": 5655.494 }, { "epoch": 0.42250201992997577, "grad_norm": 0.8213882192132025, "learning_rate": 8.939026188393083e-06, "loss": 0.3853888034820557, "num_input_tokens_seen": 274569104, "step": 6275, "train_runtime": 48556.531, "train_tokens_per_second": 5654.628 }, { "epoch": 0.4228386749259359, "grad_norm": 0.8791839426260795, "learning_rate": 8.937397082897963e-06, "loss": 0.40306596755981444, "num_input_tokens_seen": 274796616, "step": 6280, "train_runtime": 48596.7026, "train_tokens_per_second": 5654.635 }, { "epoch": 0.42317532992189605, "grad_norm": 0.7843983011163462, "learning_rate": 8.935766876322303e-06, "loss": 0.4140591621398926, "num_input_tokens_seen": 275015624, "step": 6285, "train_runtime": 48635.2618, "train_tokens_per_second": 5654.655 }, { "epoch": 0.4235119849178562, "grad_norm": 0.7007974546940894, "learning_rate": 8.934135569121985e-06, "loss": 0.3959988832473755, "num_input_tokens_seen": 275242840, "step": 6290, "train_runtime": 48673.0052, "train_tokens_per_second": 5654.938 }, { "epoch": 0.4238486399138163, "grad_norm": 0.7078146309363205, "learning_rate": 8.932503161753202e-06, "loss": 0.38456072807312014, "num_input_tokens_seen": 275462504, "step": 6295, "train_runtime": 48709.4026, "train_tokens_per_second": 5655.222 }, { "epoch": 0.42418529490977647, "grad_norm": 1.0351275568049705, "learning_rate": 8.930869654672449e-06, "loss": 0.38416409492492676, "num_input_tokens_seen": 275681808, "step": 6300, "train_runtime": 48747.6893, "train_tokens_per_second": 5655.279 }, { "epoch": 0.4245219499057366, "grad_norm": 0.8236989821133165, "learning_rate": 8.929235048336531e-06, "loss": 0.37823896408081054, "num_input_tokens_seen": 275903576, "step": 6305, "train_runtime": 48788.5888, "train_tokens_per_second": 5655.084 }, { "epoch": 0.42485860490169675, "grad_norm": 0.8519274837856372, "learning_rate": 8.927599343202563e-06, "loss": 0.4197996139526367, "num_input_tokens_seen": 276132792, "step": 6310, "train_runtime": 48821.7451, "train_tokens_per_second": 5655.939 }, { "epoch": 0.4251952598976569, "grad_norm": 0.7601906981584227, "learning_rate": 8.92596253972796e-06, "loss": 0.39647321701049804, "num_input_tokens_seen": 276373576, "step": 6315, "train_runtime": 48856.0141, "train_tokens_per_second": 5656.9 }, { "epoch": 0.425531914893617, "grad_norm": 0.7436129276391935, "learning_rate": 8.924324638370454e-06, "loss": 0.4159084320068359, "num_input_tokens_seen": 276601344, "step": 6320, "train_runtime": 48892.2285, "train_tokens_per_second": 5657.368 }, { "epoch": 0.42586856988957716, "grad_norm": 0.619825666948129, "learning_rate": 8.922685639588076e-06, "loss": 0.3394161701202393, "num_input_tokens_seen": 276801216, "step": 6325, "train_runtime": 48929.4586, "train_tokens_per_second": 5657.149 }, { "epoch": 0.4262052248855373, "grad_norm": 0.7566990752584487, "learning_rate": 8.921045543839167e-06, "loss": 0.412354850769043, "num_input_tokens_seen": 277025984, "step": 6330, "train_runtime": 48964.4429, "train_tokens_per_second": 5657.697 }, { "epoch": 0.42654187988149744, "grad_norm": 0.7706529692481164, "learning_rate": 8.919404351582376e-06, "loss": 0.37722196578979494, "num_input_tokens_seen": 277234256, "step": 6335, "train_runtime": 49000.4277, "train_tokens_per_second": 5657.793 }, { "epoch": 0.4268785348774576, "grad_norm": 0.7056105235159689, "learning_rate": 8.917762063276657e-06, "loss": 0.38721909523010256, "num_input_tokens_seen": 277448936, "step": 6340, "train_runtime": 49039.3589, "train_tokens_per_second": 5657.679 }, { "epoch": 0.4272151898734177, "grad_norm": 0.7187047540510013, "learning_rate": 8.916118679381268e-06, "loss": 0.3728447198867798, "num_input_tokens_seen": 277667920, "step": 6345, "train_runtime": 49076.9224, "train_tokens_per_second": 5657.81 }, { "epoch": 0.42755184486937786, "grad_norm": 0.8958354766388671, "learning_rate": 8.914474200355777e-06, "loss": 0.39159350395202636, "num_input_tokens_seen": 277885288, "step": 6350, "train_runtime": 49121.5781, "train_tokens_per_second": 5657.092 }, { "epoch": 0.427888499865338, "grad_norm": 0.8411282788940809, "learning_rate": 8.912828626660059e-06, "loss": 0.4010343074798584, "num_input_tokens_seen": 278112192, "step": 6355, "train_runtime": 49161.2354, "train_tokens_per_second": 5657.144 }, { "epoch": 0.42822515486129814, "grad_norm": 0.7895834565221768, "learning_rate": 8.911181958754294e-06, "loss": 0.4207916259765625, "num_input_tokens_seen": 278332088, "step": 6360, "train_runtime": 49198.4506, "train_tokens_per_second": 5657.334 }, { "epoch": 0.4285618098572583, "grad_norm": 0.6974429090218124, "learning_rate": 8.909534197098966e-06, "loss": 0.4089661121368408, "num_input_tokens_seen": 278560320, "step": 6365, "train_runtime": 49240.3447, "train_tokens_per_second": 5657.156 }, { "epoch": 0.4288984648532184, "grad_norm": 0.7879065723514492, "learning_rate": 8.907885342154865e-06, "loss": 0.3871757507324219, "num_input_tokens_seen": 278780408, "step": 6370, "train_runtime": 49273.5524, "train_tokens_per_second": 5657.81 }, { "epoch": 0.42923511984917856, "grad_norm": 0.809098238394157, "learning_rate": 8.906235394383089e-06, "loss": 0.3723259925842285, "num_input_tokens_seen": 278977576, "step": 6375, "train_runtime": 49314.5399, "train_tokens_per_second": 5657.106 }, { "epoch": 0.4295717748451387, "grad_norm": 0.7788656469697295, "learning_rate": 8.904584354245042e-06, "loss": 0.38217949867248535, "num_input_tokens_seen": 279198056, "step": 6380, "train_runtime": 49349.1158, "train_tokens_per_second": 5657.61 }, { "epoch": 0.42990842984109884, "grad_norm": 0.7480156005511179, "learning_rate": 8.902932222202433e-06, "loss": 0.39810030460357665, "num_input_tokens_seen": 279431128, "step": 6385, "train_runtime": 49390.7865, "train_tokens_per_second": 5657.556 }, { "epoch": 0.430245084837059, "grad_norm": 0.7111926102410158, "learning_rate": 8.901278998717272e-06, "loss": 0.37800168991088867, "num_input_tokens_seen": 279655568, "step": 6390, "train_runtime": 49420.9322, "train_tokens_per_second": 5658.646 }, { "epoch": 0.4305817398330191, "grad_norm": 0.8127379256774018, "learning_rate": 8.899624684251878e-06, "loss": 0.38466432094573977, "num_input_tokens_seen": 279872920, "step": 6395, "train_runtime": 49461.0295, "train_tokens_per_second": 5658.453 }, { "epoch": 0.43091839482897926, "grad_norm": 0.7440397221517976, "learning_rate": 8.897969279268877e-06, "loss": 0.37961535453796386, "num_input_tokens_seen": 280093688, "step": 6400, "train_runtime": 49494.6401, "train_tokens_per_second": 5659.071 }, { "epoch": 0.4312550498249394, "grad_norm": 0.7095617451331785, "learning_rate": 8.896312784231196e-06, "loss": 0.3712193012237549, "num_input_tokens_seen": 280305104, "step": 6405, "train_runtime": 49529.3102, "train_tokens_per_second": 5659.378 }, { "epoch": 0.43159170482089954, "grad_norm": 0.8249055107614544, "learning_rate": 8.89465519960207e-06, "loss": 0.42307000160217284, "num_input_tokens_seen": 280534896, "step": 6410, "train_runtime": 49562.7367, "train_tokens_per_second": 5660.198 }, { "epoch": 0.4319283598168597, "grad_norm": 0.7044078667504021, "learning_rate": 8.892996525845037e-06, "loss": 0.39340283870697024, "num_input_tokens_seen": 280760536, "step": 6415, "train_runtime": 49609.124, "train_tokens_per_second": 5659.454 }, { "epoch": 0.4322650148128198, "grad_norm": 0.8758617954616612, "learning_rate": 8.89133676342394e-06, "loss": 0.4034512996673584, "num_input_tokens_seen": 280959600, "step": 6420, "train_runtime": 49647.7511, "train_tokens_per_second": 5659.06 }, { "epoch": 0.43260166980877995, "grad_norm": 0.7612824097484856, "learning_rate": 8.889675912802923e-06, "loss": 0.38754520416259763, "num_input_tokens_seen": 281173760, "step": 6425, "train_runtime": 49684.4958, "train_tokens_per_second": 5659.185 }, { "epoch": 0.4329383248047401, "grad_norm": 0.8243557630186539, "learning_rate": 8.888013974446443e-06, "loss": 0.4189424514770508, "num_input_tokens_seen": 281395808, "step": 6430, "train_runtime": 49725.5827, "train_tokens_per_second": 5658.975 }, { "epoch": 0.43327497980070023, "grad_norm": 0.8439524750777101, "learning_rate": 8.886350948819253e-06, "loss": 0.38129727840423583, "num_input_tokens_seen": 281606072, "step": 6435, "train_runtime": 49758.4427, "train_tokens_per_second": 5659.463 }, { "epoch": 0.4336116347966604, "grad_norm": 0.8007298009088516, "learning_rate": 8.884686836386412e-06, "loss": 0.38291594982147215, "num_input_tokens_seen": 281822424, "step": 6440, "train_runtime": 49799.792, "train_tokens_per_second": 5659.108 }, { "epoch": 0.4339482897926205, "grad_norm": 0.7881388654599728, "learning_rate": 8.883021637613286e-06, "loss": 0.4050453662872314, "num_input_tokens_seen": 282049648, "step": 6445, "train_runtime": 49835.0256, "train_tokens_per_second": 5659.667 }, { "epoch": 0.43428494478858065, "grad_norm": 0.6887341883009596, "learning_rate": 8.881355352965537e-06, "loss": 0.38397510051727296, "num_input_tokens_seen": 282264512, "step": 6450, "train_runtime": 49867.6041, "train_tokens_per_second": 5660.278 }, { "epoch": 0.4346215997845408, "grad_norm": 0.672101432469643, "learning_rate": 8.879687982909145e-06, "loss": 0.3574419736862183, "num_input_tokens_seen": 282465912, "step": 6455, "train_runtime": 49905.6117, "train_tokens_per_second": 5660.003 }, { "epoch": 0.43495825478050093, "grad_norm": 0.8916903644937464, "learning_rate": 8.878019527910378e-06, "loss": 0.41092991828918457, "num_input_tokens_seen": 282670240, "step": 6460, "train_runtime": 49945.0146, "train_tokens_per_second": 5659.629 }, { "epoch": 0.43529490977646107, "grad_norm": 0.8298316229675538, "learning_rate": 8.876349988435815e-06, "loss": 0.44412593841552733, "num_input_tokens_seen": 282887856, "step": 6465, "train_runtime": 49983.0629, "train_tokens_per_second": 5659.674 }, { "epoch": 0.4356315647724212, "grad_norm": 0.6431274180779993, "learning_rate": 8.874679364952339e-06, "loss": 0.38706722259521487, "num_input_tokens_seen": 283127040, "step": 6470, "train_runtime": 50021.3951, "train_tokens_per_second": 5660.119 }, { "epoch": 0.43596821976838135, "grad_norm": 0.7656387607672229, "learning_rate": 8.873007657927135e-06, "loss": 0.3893885135650635, "num_input_tokens_seen": 283357232, "step": 6475, "train_runtime": 50062.5333, "train_tokens_per_second": 5660.066 }, { "epoch": 0.4363048747643415, "grad_norm": 0.7096570879969786, "learning_rate": 8.87133486782769e-06, "loss": 0.35058715343475344, "num_input_tokens_seen": 283558232, "step": 6480, "train_runtime": 50096.5148, "train_tokens_per_second": 5660.239 }, { "epoch": 0.4366415297603016, "grad_norm": 0.8761505694419173, "learning_rate": 8.869660995121792e-06, "loss": 0.3999923229217529, "num_input_tokens_seen": 283777800, "step": 6485, "train_runtime": 50131.8591, "train_tokens_per_second": 5660.628 }, { "epoch": 0.43697818475626177, "grad_norm": 0.7555798070151492, "learning_rate": 8.867986040277537e-06, "loss": 0.4016421318054199, "num_input_tokens_seen": 283985824, "step": 6490, "train_runtime": 50172.9, "train_tokens_per_second": 5660.144 }, { "epoch": 0.4373148397522219, "grad_norm": 0.7001554230524034, "learning_rate": 8.86631000376332e-06, "loss": 0.4068891525268555, "num_input_tokens_seen": 284193496, "step": 6495, "train_runtime": 50210.1755, "train_tokens_per_second": 5660.078 }, { "epoch": 0.43765149474818205, "grad_norm": 0.809001796546686, "learning_rate": 8.864632886047841e-06, "loss": 0.3719168186187744, "num_input_tokens_seen": 284406672, "step": 6500, "train_runtime": 50246.2209, "train_tokens_per_second": 5660.26 }, { "epoch": 0.4379881497441422, "grad_norm": 0.8525357252115519, "learning_rate": 8.862954687600097e-06, "loss": 0.4161073684692383, "num_input_tokens_seen": 284620064, "step": 6505, "train_runtime": 50283.9357, "train_tokens_per_second": 5660.258 }, { "epoch": 0.4383248047401023, "grad_norm": 0.818348330515836, "learning_rate": 8.861275408889393e-06, "loss": 0.4044035911560059, "num_input_tokens_seen": 284827680, "step": 6510, "train_runtime": 50319.756, "train_tokens_per_second": 5660.355 }, { "epoch": 0.43866145973606246, "grad_norm": 0.8194841529764723, "learning_rate": 8.859595050385332e-06, "loss": 0.40093269348144533, "num_input_tokens_seen": 285050288, "step": 6515, "train_runtime": 50356.7378, "train_tokens_per_second": 5660.619 }, { "epoch": 0.4389981147320226, "grad_norm": 0.7603950111901223, "learning_rate": 8.857913612557825e-06, "loss": 0.39177913665771485, "num_input_tokens_seen": 285275776, "step": 6520, "train_runtime": 50399.864, "train_tokens_per_second": 5660.249 }, { "epoch": 0.43933476972798274, "grad_norm": 0.9171110192985658, "learning_rate": 8.856231095877077e-06, "loss": 0.37299246788024903, "num_input_tokens_seen": 285483840, "step": 6525, "train_runtime": 50437.6759, "train_tokens_per_second": 5660.131 }, { "epoch": 0.4396714247239429, "grad_norm": 0.6722265713323919, "learning_rate": 8.8545475008136e-06, "loss": 0.3728148937225342, "num_input_tokens_seen": 285708616, "step": 6530, "train_runtime": 50478.218, "train_tokens_per_second": 5660.038 }, { "epoch": 0.440008079719903, "grad_norm": 0.8225035496811262, "learning_rate": 8.852862827838207e-06, "loss": 0.37645254135131834, "num_input_tokens_seen": 285914952, "step": 6535, "train_runtime": 50513.9654, "train_tokens_per_second": 5660.117 }, { "epoch": 0.44034473471586316, "grad_norm": 0.672139181444301, "learning_rate": 8.851177077422008e-06, "loss": 0.4013407230377197, "num_input_tokens_seen": 286146336, "step": 6540, "train_runtime": 50553.4611, "train_tokens_per_second": 5660.272 }, { "epoch": 0.4406813897118233, "grad_norm": 0.7644327948595142, "learning_rate": 8.849490250036421e-06, "loss": 0.4249086380004883, "num_input_tokens_seen": 286362088, "step": 6545, "train_runtime": 50590.1862, "train_tokens_per_second": 5660.428 }, { "epoch": 0.44101804470778344, "grad_norm": 0.8087430911202192, "learning_rate": 8.847802346153159e-06, "loss": 0.3778714895248413, "num_input_tokens_seen": 286576504, "step": 6550, "train_runtime": 50623.1732, "train_tokens_per_second": 5660.975 }, { "epoch": 0.4413546997037436, "grad_norm": 0.822277412759685, "learning_rate": 8.846113366244241e-06, "loss": 0.40006532669067385, "num_input_tokens_seen": 286802512, "step": 6555, "train_runtime": 50653.7568, "train_tokens_per_second": 5662.019 }, { "epoch": 0.4416913546997037, "grad_norm": 0.7788883116407057, "learning_rate": 8.844423310781986e-06, "loss": 0.3659277677536011, "num_input_tokens_seen": 287019968, "step": 6560, "train_runtime": 50693.4968, "train_tokens_per_second": 5661.87 }, { "epoch": 0.44202800969566386, "grad_norm": 0.8189856612851919, "learning_rate": 8.842732180239011e-06, "loss": 0.417068338394165, "num_input_tokens_seen": 287233880, "step": 6565, "train_runtime": 50732.9626, "train_tokens_per_second": 5661.682 }, { "epoch": 0.442364664691624, "grad_norm": 0.7955988955008321, "learning_rate": 8.841039975088234e-06, "loss": 0.37861127853393556, "num_input_tokens_seen": 287450920, "step": 6570, "train_runtime": 50770.9895, "train_tokens_per_second": 5661.716 }, { "epoch": 0.44270131968758414, "grad_norm": 0.7673850184930923, "learning_rate": 8.839346695802878e-06, "loss": 0.44512476921081545, "num_input_tokens_seen": 287680008, "step": 6575, "train_runtime": 50808.7713, "train_tokens_per_second": 5662.015 }, { "epoch": 0.4430379746835443, "grad_norm": 0.707236454889657, "learning_rate": 8.837652342856459e-06, "loss": 0.4026740550994873, "num_input_tokens_seen": 287904440, "step": 6580, "train_runtime": 50842.5258, "train_tokens_per_second": 5662.67 }, { "epoch": 0.4433746296795044, "grad_norm": 0.7131491003211293, "learning_rate": 8.835956916722803e-06, "loss": 0.37171001434326173, "num_input_tokens_seen": 288123072, "step": 6585, "train_runtime": 50884.3886, "train_tokens_per_second": 5662.308 }, { "epoch": 0.44371128467546456, "grad_norm": 0.7279859643678576, "learning_rate": 8.834260417876024e-06, "loss": 0.39625725746154783, "num_input_tokens_seen": 288337792, "step": 6590, "train_runtime": 50922.6708, "train_tokens_per_second": 5662.268 }, { "epoch": 0.4440479396714247, "grad_norm": 0.6822187993121582, "learning_rate": 8.832562846790549e-06, "loss": 0.4032885074615479, "num_input_tokens_seen": 288562504, "step": 6595, "train_runtime": 50958.16, "train_tokens_per_second": 5662.734 }, { "epoch": 0.4443845946673849, "grad_norm": 0.7696796062355198, "learning_rate": 8.830864203941092e-06, "loss": 0.4127056121826172, "num_input_tokens_seen": 288783304, "step": 6600, "train_runtime": 50994.9294, "train_tokens_per_second": 5662.981 }, { "epoch": 0.44472124966334503, "grad_norm": 0.796046357490389, "learning_rate": 8.829164489802677e-06, "loss": 0.37214198112487795, "num_input_tokens_seen": 288995032, "step": 6605, "train_runtime": 51030.6262, "train_tokens_per_second": 5663.168 }, { "epoch": 0.44505790465930517, "grad_norm": 0.8194054840462127, "learning_rate": 8.827463704850622e-06, "loss": 0.3779730796813965, "num_input_tokens_seen": 289211784, "step": 6610, "train_runtime": 51065.1791, "train_tokens_per_second": 5663.581 }, { "epoch": 0.4453945596552653, "grad_norm": 0.853917923414557, "learning_rate": 8.825761849560547e-06, "loss": 0.3779446125030518, "num_input_tokens_seen": 289426496, "step": 6615, "train_runtime": 51104.5336, "train_tokens_per_second": 5663.421 }, { "epoch": 0.44573121465122545, "grad_norm": 0.8243805829529494, "learning_rate": 8.824058924408371e-06, "loss": 0.3913204431533813, "num_input_tokens_seen": 289642104, "step": 6620, "train_runtime": 51148.3439, "train_tokens_per_second": 5662.786 }, { "epoch": 0.4460678696471856, "grad_norm": 0.6977791985037581, "learning_rate": 8.822354929870311e-06, "loss": 0.3713568687438965, "num_input_tokens_seen": 289855080, "step": 6625, "train_runtime": 51186.4829, "train_tokens_per_second": 5662.727 }, { "epoch": 0.44640452464314573, "grad_norm": 0.6544439461875585, "learning_rate": 8.820649866422884e-06, "loss": 0.3891900539398193, "num_input_tokens_seen": 290080272, "step": 6630, "train_runtime": 51221.0131, "train_tokens_per_second": 5663.306 }, { "epoch": 0.44674117963910587, "grad_norm": 0.7628155627258327, "learning_rate": 8.818943734542905e-06, "loss": 0.38543388843536375, "num_input_tokens_seen": 290310296, "step": 6635, "train_runtime": 51260.636, "train_tokens_per_second": 5663.416 }, { "epoch": 0.447077834635066, "grad_norm": 0.7154748015782274, "learning_rate": 8.817236534707486e-06, "loss": 0.38082070350646974, "num_input_tokens_seen": 290530408, "step": 6640, "train_runtime": 51298.209, "train_tokens_per_second": 5663.559 }, { "epoch": 0.44741448963102615, "grad_norm": 0.719435209044012, "learning_rate": 8.815528267394045e-06, "loss": 0.38055622577667236, "num_input_tokens_seen": 290752096, "step": 6645, "train_runtime": 51339.4277, "train_tokens_per_second": 5663.33 }, { "epoch": 0.4477511446269863, "grad_norm": 0.8130810621777962, "learning_rate": 8.81381893308029e-06, "loss": 0.42238750457763674, "num_input_tokens_seen": 290976696, "step": 6650, "train_runtime": 51376.6803, "train_tokens_per_second": 5663.595 }, { "epoch": 0.4480877996229464, "grad_norm": 0.6802969800260558, "learning_rate": 8.81210853224423e-06, "loss": 0.397933292388916, "num_input_tokens_seen": 291195128, "step": 6655, "train_runtime": 51416.0644, "train_tokens_per_second": 5663.505 }, { "epoch": 0.44842445461890656, "grad_norm": 0.7683337052075077, "learning_rate": 8.810397065364177e-06, "loss": 0.3660165309906006, "num_input_tokens_seen": 291397432, "step": 6660, "train_runtime": 51460.1895, "train_tokens_per_second": 5662.58 }, { "epoch": 0.4487611096148667, "grad_norm": 0.7385595517387719, "learning_rate": 8.808684532918735e-06, "loss": 0.4035042762756348, "num_input_tokens_seen": 291611984, "step": 6665, "train_runtime": 51497.2825, "train_tokens_per_second": 5662.667 }, { "epoch": 0.44909776461082684, "grad_norm": 0.8670076691450054, "learning_rate": 8.806970935386807e-06, "loss": 0.37046058177948, "num_input_tokens_seen": 291817952, "step": 6670, "train_runtime": 51539.7964, "train_tokens_per_second": 5661.993 }, { "epoch": 0.449434419606787, "grad_norm": 0.845351499495225, "learning_rate": 8.805256273247597e-06, "loss": 0.3828955411911011, "num_input_tokens_seen": 292030296, "step": 6675, "train_runtime": 51585.7162, "train_tokens_per_second": 5661.069 }, { "epoch": 0.4497710746027471, "grad_norm": 0.7558486825710268, "learning_rate": 8.803540546980605e-06, "loss": 0.3911006450653076, "num_input_tokens_seen": 292240392, "step": 6680, "train_runtime": 51625.5292, "train_tokens_per_second": 5660.773 }, { "epoch": 0.45010772959870726, "grad_norm": 0.7143473072799023, "learning_rate": 8.801823757065628e-06, "loss": 0.39244418144226073, "num_input_tokens_seen": 292456784, "step": 6685, "train_runtime": 51661.3439, "train_tokens_per_second": 5661.037 }, { "epoch": 0.4504443845946674, "grad_norm": 0.7046306873714272, "learning_rate": 8.800105903982758e-06, "loss": 0.37194869518280027, "num_input_tokens_seen": 292669672, "step": 6690, "train_runtime": 51695.7982, "train_tokens_per_second": 5661.382 }, { "epoch": 0.45078103959062754, "grad_norm": 0.9038260012464076, "learning_rate": 8.798386988212393e-06, "loss": 0.36289196014404296, "num_input_tokens_seen": 292866896, "step": 6695, "train_runtime": 51737.8021, "train_tokens_per_second": 5660.598 }, { "epoch": 0.4511176945865877, "grad_norm": 0.7097725989673881, "learning_rate": 8.796667010235216e-06, "loss": 0.4039313793182373, "num_input_tokens_seen": 293088104, "step": 6700, "train_runtime": 51775.0194, "train_tokens_per_second": 5660.801 }, { "epoch": 0.4514543495825478, "grad_norm": 0.6983233354591538, "learning_rate": 8.794945970532219e-06, "loss": 0.38548543453216555, "num_input_tokens_seen": 293312720, "step": 6705, "train_runtime": 51819.136, "train_tokens_per_second": 5660.317 }, { "epoch": 0.45179100457850796, "grad_norm": 0.7715442099717464, "learning_rate": 8.79322386958468e-06, "loss": 0.42191410064697266, "num_input_tokens_seen": 293540040, "step": 6710, "train_runtime": 51850.4773, "train_tokens_per_second": 5661.279 }, { "epoch": 0.4521276595744681, "grad_norm": 0.8667322084375894, "learning_rate": 8.791500707874183e-06, "loss": 0.3590597152709961, "num_input_tokens_seen": 293753504, "step": 6715, "train_runtime": 51887.9851, "train_tokens_per_second": 5661.301 }, { "epoch": 0.45246431457042824, "grad_norm": 0.7001275719009605, "learning_rate": 8.789776485882601e-06, "loss": 0.40479679107666017, "num_input_tokens_seen": 293980328, "step": 6720, "train_runtime": 51930.6229, "train_tokens_per_second": 5661.021 }, { "epoch": 0.4528009695663884, "grad_norm": 0.7486619231659534, "learning_rate": 8.788051204092112e-06, "loss": 0.380597448348999, "num_input_tokens_seen": 294201288, "step": 6725, "train_runtime": 51969.1487, "train_tokens_per_second": 5661.076 }, { "epoch": 0.4531376245623485, "grad_norm": 0.837803412390275, "learning_rate": 8.786324862985183e-06, "loss": 0.39116497039794923, "num_input_tokens_seen": 294414792, "step": 6730, "train_runtime": 52007.4528, "train_tokens_per_second": 5661.012 }, { "epoch": 0.45347427955830866, "grad_norm": 0.7989569302827977, "learning_rate": 8.78459746304458e-06, "loss": 0.37044734954833985, "num_input_tokens_seen": 294593136, "step": 6735, "train_runtime": 52048.2566, "train_tokens_per_second": 5660.0 }, { "epoch": 0.4538109345542688, "grad_norm": 0.7910699073925987, "learning_rate": 8.782869004753363e-06, "loss": 0.40142025947570803, "num_input_tokens_seen": 294808392, "step": 6740, "train_runtime": 52084.1003, "train_tokens_per_second": 5660.238 }, { "epoch": 0.45414758955022894, "grad_norm": 0.7578062648097129, "learning_rate": 8.781139488594892e-06, "loss": 0.39638261795043944, "num_input_tokens_seen": 295032712, "step": 6745, "train_runtime": 52116.6196, "train_tokens_per_second": 5661.01 }, { "epoch": 0.4544842445461891, "grad_norm": 0.7479401557774803, "learning_rate": 8.779408915052821e-06, "loss": 0.3619338274002075, "num_input_tokens_seen": 295250848, "step": 6750, "train_runtime": 52158.5344, "train_tokens_per_second": 5660.643 }, { "epoch": 0.4548208995421492, "grad_norm": 0.7929634941210536, "learning_rate": 8.777677284611096e-06, "loss": 0.36865906715393065, "num_input_tokens_seen": 295444808, "step": 6755, "train_runtime": 52194.881, "train_tokens_per_second": 5660.417 }, { "epoch": 0.45515755453810935, "grad_norm": 0.7977612087147963, "learning_rate": 8.775944597753969e-06, "loss": 0.3817254304885864, "num_input_tokens_seen": 295651640, "step": 6760, "train_runtime": 52235.5188, "train_tokens_per_second": 5659.973 }, { "epoch": 0.4554942095340695, "grad_norm": 0.7276333392461809, "learning_rate": 8.774210854965972e-06, "loss": 0.4110917568206787, "num_input_tokens_seen": 295872600, "step": 6765, "train_runtime": 52282.5363, "train_tokens_per_second": 5659.11 }, { "epoch": 0.45583086453002963, "grad_norm": 0.7743347789370404, "learning_rate": 8.772476056731946e-06, "loss": 0.3540276050567627, "num_input_tokens_seen": 296100760, "step": 6770, "train_runtime": 52321.5826, "train_tokens_per_second": 5659.247 }, { "epoch": 0.4561675195259898, "grad_norm": 0.8417565391365261, "learning_rate": 8.77074020353702e-06, "loss": 0.37112271785736084, "num_input_tokens_seen": 296310112, "step": 6775, "train_runtime": 52364.5089, "train_tokens_per_second": 5658.606 }, { "epoch": 0.4565041745219499, "grad_norm": 0.8971045549426276, "learning_rate": 8.76900329586662e-06, "loss": 0.416597318649292, "num_input_tokens_seen": 296529072, "step": 6780, "train_runtime": 52408.4219, "train_tokens_per_second": 5658.042 }, { "epoch": 0.45684082951791005, "grad_norm": 0.7289171592528997, "learning_rate": 8.767265334206467e-06, "loss": 0.38317620754241943, "num_input_tokens_seen": 296750896, "step": 6785, "train_runtime": 52453.3014, "train_tokens_per_second": 5657.43 }, { "epoch": 0.4571774845138702, "grad_norm": 0.742990584892427, "learning_rate": 8.765526319042577e-06, "loss": 0.38066811561584474, "num_input_tokens_seen": 296973576, "step": 6790, "train_runtime": 52484.833, "train_tokens_per_second": 5658.274 }, { "epoch": 0.45751413950983033, "grad_norm": 0.7941387596625845, "learning_rate": 8.763786250861258e-06, "loss": 0.35711822509765623, "num_input_tokens_seen": 297198488, "step": 6795, "train_runtime": 52525.9579, "train_tokens_per_second": 5658.126 }, { "epoch": 0.45785079450579047, "grad_norm": 0.7637071617244607, "learning_rate": 8.762045130149114e-06, "loss": 0.37547504901885986, "num_input_tokens_seen": 297424408, "step": 6800, "train_runtime": 52568.1627, "train_tokens_per_second": 5657.881 }, { "epoch": 0.4581874495017506, "grad_norm": 0.7114371063573226, "learning_rate": 8.76030295739305e-06, "loss": 0.391666579246521, "num_input_tokens_seen": 297652664, "step": 6805, "train_runtime": 52605.904, "train_tokens_per_second": 5658.161 }, { "epoch": 0.45852410449771075, "grad_norm": 0.7263315072433297, "learning_rate": 8.758559733080252e-06, "loss": 0.4111741065979004, "num_input_tokens_seen": 297874936, "step": 6810, "train_runtime": 52637.0942, "train_tokens_per_second": 5659.031 }, { "epoch": 0.4588607594936709, "grad_norm": 0.7359316103796298, "learning_rate": 8.75681545769821e-06, "loss": 0.38690164089202883, "num_input_tokens_seen": 298107584, "step": 6815, "train_runtime": 52669.678, "train_tokens_per_second": 5659.947 }, { "epoch": 0.45919741448963103, "grad_norm": 0.8032263081480874, "learning_rate": 8.755070131734706e-06, "loss": 0.3867367744445801, "num_input_tokens_seen": 298320208, "step": 6820, "train_runtime": 52707.8474, "train_tokens_per_second": 5659.882 }, { "epoch": 0.45953406948559117, "grad_norm": 0.7833333891541101, "learning_rate": 8.753323755677812e-06, "loss": 0.4013802528381348, "num_input_tokens_seen": 298533552, "step": 6825, "train_runtime": 52749.6034, "train_tokens_per_second": 5659.446 }, { "epoch": 0.4598707244815513, "grad_norm": 0.7609318114113853, "learning_rate": 8.7515763300159e-06, "loss": 0.3463205575942993, "num_input_tokens_seen": 298746696, "step": 6830, "train_runtime": 52789.3591, "train_tokens_per_second": 5659.222 }, { "epoch": 0.46020737947751145, "grad_norm": 0.6930204184723102, "learning_rate": 8.74982785523763e-06, "loss": 0.40210418701171874, "num_input_tokens_seen": 298972384, "step": 6835, "train_runtime": 52827.2223, "train_tokens_per_second": 5659.438 }, { "epoch": 0.4605440344734716, "grad_norm": 0.7026299121313064, "learning_rate": 8.748078331831957e-06, "loss": 0.3934351682662964, "num_input_tokens_seen": 299200112, "step": 6840, "train_runtime": 52862.9542, "train_tokens_per_second": 5659.92 }, { "epoch": 0.4608806894694317, "grad_norm": 0.7019416941915204, "learning_rate": 8.746327760288129e-06, "loss": 0.3836989164352417, "num_input_tokens_seen": 299437024, "step": 6845, "train_runtime": 52894.4779, "train_tokens_per_second": 5661.026 }, { "epoch": 0.46121734446539187, "grad_norm": 0.8234006493355744, "learning_rate": 8.744576141095691e-06, "loss": 0.39553108215332033, "num_input_tokens_seen": 299641752, "step": 6850, "train_runtime": 52932.8412, "train_tokens_per_second": 5660.791 }, { "epoch": 0.461553999461352, "grad_norm": 0.846531534553998, "learning_rate": 8.742823474744476e-06, "loss": 0.39920735359191895, "num_input_tokens_seen": 299852504, "step": 6855, "train_runtime": 52970.3403, "train_tokens_per_second": 5660.762 }, { "epoch": 0.46189065445731214, "grad_norm": 0.7339872597188516, "learning_rate": 8.74106976172461e-06, "loss": 0.40232462882995607, "num_input_tokens_seen": 300073192, "step": 6860, "train_runtime": 53013.6318, "train_tokens_per_second": 5660.302 }, { "epoch": 0.4622273094532723, "grad_norm": 0.8137834490765111, "learning_rate": 8.739315002526513e-06, "loss": 0.40238103866577146, "num_input_tokens_seen": 300287552, "step": 6865, "train_runtime": 53055.019, "train_tokens_per_second": 5659.927 }, { "epoch": 0.4625639644492324, "grad_norm": 0.7042015061046794, "learning_rate": 8.737559197640902e-06, "loss": 0.3717548131942749, "num_input_tokens_seen": 300496376, "step": 6870, "train_runtime": 53091.6564, "train_tokens_per_second": 5659.955 }, { "epoch": 0.46290061944519256, "grad_norm": 0.7325334644495457, "learning_rate": 8.735802347558778e-06, "loss": 0.4027840614318848, "num_input_tokens_seen": 300709416, "step": 6875, "train_runtime": 53135.1809, "train_tokens_per_second": 5659.328 }, { "epoch": 0.4632372744411527, "grad_norm": 0.7655214239764673, "learning_rate": 8.734044452771442e-06, "loss": 0.38804852962493896, "num_input_tokens_seen": 300918752, "step": 6880, "train_runtime": 53179.1079, "train_tokens_per_second": 5658.59 }, { "epoch": 0.46357392943711284, "grad_norm": 0.8904799503928702, "learning_rate": 8.73228551377048e-06, "loss": 0.40845584869384766, "num_input_tokens_seen": 301139720, "step": 6885, "train_runtime": 53208.9509, "train_tokens_per_second": 5659.569 }, { "epoch": 0.463910584433073, "grad_norm": 0.6748289632604044, "learning_rate": 8.730525531047776e-06, "loss": 0.4137433052062988, "num_input_tokens_seen": 301362752, "step": 6890, "train_runtime": 53254.1898, "train_tokens_per_second": 5658.949 }, { "epoch": 0.4642472394290331, "grad_norm": 0.7035224245591345, "learning_rate": 8.728764505095503e-06, "loss": 0.4120682716369629, "num_input_tokens_seen": 301587944, "step": 6895, "train_runtime": 53291.4984, "train_tokens_per_second": 5659.213 }, { "epoch": 0.46458389442499326, "grad_norm": 0.6435345300249111, "learning_rate": 8.727002436406126e-06, "loss": 0.3724491834640503, "num_input_tokens_seen": 301823392, "step": 6900, "train_runtime": 53331.8202, "train_tokens_per_second": 5659.349 }, { "epoch": 0.4649205494209534, "grad_norm": 0.7100192481355228, "learning_rate": 8.725239325472404e-06, "loss": 0.4057363510131836, "num_input_tokens_seen": 302046392, "step": 6905, "train_runtime": 53370.503, "train_tokens_per_second": 5659.426 }, { "epoch": 0.46525720441691354, "grad_norm": 0.7998034880411997, "learning_rate": 8.723475172787381e-06, "loss": 0.3984755277633667, "num_input_tokens_seen": 302270848, "step": 6910, "train_runtime": 53413.2206, "train_tokens_per_second": 5659.102 }, { "epoch": 0.4655938594128737, "grad_norm": 0.9282661770223051, "learning_rate": 8.7217099788444e-06, "loss": 0.38761351108551023, "num_input_tokens_seen": 302484424, "step": 6915, "train_runtime": 53452.6504, "train_tokens_per_second": 5658.923 }, { "epoch": 0.4659305144088338, "grad_norm": 0.6829252086088465, "learning_rate": 8.719943744137091e-06, "loss": 0.3843079566955566, "num_input_tokens_seen": 302706608, "step": 6920, "train_runtime": 53494.2752, "train_tokens_per_second": 5658.673 }, { "epoch": 0.46626716940479396, "grad_norm": 0.7370197158639645, "learning_rate": 8.718176469159378e-06, "loss": 0.40040907859802244, "num_input_tokens_seen": 302946080, "step": 6925, "train_runtime": 53527.8006, "train_tokens_per_second": 5659.603 }, { "epoch": 0.4666038244007541, "grad_norm": 0.7744303086322805, "learning_rate": 8.716408154405469e-06, "loss": 0.370440411567688, "num_input_tokens_seen": 303172472, "step": 6930, "train_runtime": 53558.5862, "train_tokens_per_second": 5660.576 }, { "epoch": 0.46694047939671424, "grad_norm": 0.9149869901290688, "learning_rate": 8.714638800369872e-06, "loss": 0.4163699150085449, "num_input_tokens_seen": 303374536, "step": 6935, "train_runtime": 53596.9127, "train_tokens_per_second": 5660.299 }, { "epoch": 0.4672771343926744, "grad_norm": 0.6478644031670531, "learning_rate": 8.712868407547378e-06, "loss": 0.41262283325195315, "num_input_tokens_seen": 303604704, "step": 6940, "train_runtime": 53634.4097, "train_tokens_per_second": 5660.633 }, { "epoch": 0.4676137893886345, "grad_norm": 0.8540394960614904, "learning_rate": 8.711096976433076e-06, "loss": 0.40007991790771485, "num_input_tokens_seen": 303830584, "step": 6945, "train_runtime": 53675.8336, "train_tokens_per_second": 5660.473 }, { "epoch": 0.46795044438459465, "grad_norm": 0.6854573080771246, "learning_rate": 8.709324507522337e-06, "loss": 0.3609914779663086, "num_input_tokens_seen": 304051832, "step": 6950, "train_runtime": 53710.0276, "train_tokens_per_second": 5660.988 }, { "epoch": 0.4682870993805548, "grad_norm": 0.74529061138361, "learning_rate": 8.707551001310828e-06, "loss": 0.3842365264892578, "num_input_tokens_seen": 304279352, "step": 6955, "train_runtime": 53749.8544, "train_tokens_per_second": 5661.027 }, { "epoch": 0.46862375437651493, "grad_norm": 0.7026982064246363, "learning_rate": 8.705776458294503e-06, "loss": 0.387627911567688, "num_input_tokens_seen": 304487200, "step": 6960, "train_runtime": 53785.1129, "train_tokens_per_second": 5661.18 }, { "epoch": 0.4689604093724751, "grad_norm": 0.7214247021583069, "learning_rate": 8.704000878969608e-06, "loss": 0.37026023864746094, "num_input_tokens_seen": 304693840, "step": 6965, "train_runtime": 53822.9634, "train_tokens_per_second": 5661.038 }, { "epoch": 0.4692970643684352, "grad_norm": 0.6979359178232242, "learning_rate": 8.702224263832679e-06, "loss": 0.3628101825714111, "num_input_tokens_seen": 304921392, "step": 6970, "train_runtime": 53861.4766, "train_tokens_per_second": 5661.215 }, { "epoch": 0.46963371936439535, "grad_norm": 0.7813572135644429, "learning_rate": 8.700446613380542e-06, "loss": 0.4275547504425049, "num_input_tokens_seen": 305149136, "step": 6975, "train_runtime": 53899.1275, "train_tokens_per_second": 5661.486 }, { "epoch": 0.4699703743603555, "grad_norm": 0.800833875206026, "learning_rate": 8.698667928110307e-06, "loss": 0.373789119720459, "num_input_tokens_seen": 305369336, "step": 6980, "train_runtime": 53936.8451, "train_tokens_per_second": 5661.609 }, { "epoch": 0.47030702935631563, "grad_norm": 0.8980829202572613, "learning_rate": 8.696888208519381e-06, "loss": 0.3973226070404053, "num_input_tokens_seen": 305581504, "step": 6985, "train_runtime": 53973.4435, "train_tokens_per_second": 5661.701 }, { "epoch": 0.47064368435227577, "grad_norm": 0.7351189903914839, "learning_rate": 8.695107455105454e-06, "loss": 0.34683785438537595, "num_input_tokens_seen": 305790632, "step": 6990, "train_runtime": 54006.1459, "train_tokens_per_second": 5662.145 }, { "epoch": 0.4709803393482359, "grad_norm": 0.7928821233878864, "learning_rate": 8.693325668366513e-06, "loss": 0.39075660705566406, "num_input_tokens_seen": 306004232, "step": 6995, "train_runtime": 54042.3536, "train_tokens_per_second": 5662.304 }, { "epoch": 0.47131699434419605, "grad_norm": 0.8527776847132168, "learning_rate": 8.691542848800825e-06, "loss": 0.39600386619567873, "num_input_tokens_seen": 306212208, "step": 7000, "train_runtime": 54084.5742, "train_tokens_per_second": 5661.729 }, { "epoch": 0.4716536493401562, "grad_norm": 0.8808374134194763, "learning_rate": 8.68975899690695e-06, "loss": 0.38110928535461425, "num_input_tokens_seen": 306437744, "step": 7005, "train_runtime": 54125.0428, "train_tokens_per_second": 5661.663 }, { "epoch": 0.47199030433611633, "grad_norm": 0.7423709319863485, "learning_rate": 8.687974113183738e-06, "loss": 0.37776660919189453, "num_input_tokens_seen": 306667400, "step": 7010, "train_runtime": 54160.5555, "train_tokens_per_second": 5662.191 }, { "epoch": 0.47232695933207647, "grad_norm": 0.8031207862343954, "learning_rate": 8.686188198130326e-06, "loss": 0.3893289089202881, "num_input_tokens_seen": 306891232, "step": 7015, "train_runtime": 54195.218, "train_tokens_per_second": 5662.699 }, { "epoch": 0.4726636143280366, "grad_norm": 0.716418279114708, "learning_rate": 8.684401252246138e-06, "loss": 0.3991250038146973, "num_input_tokens_seen": 307116336, "step": 7020, "train_runtime": 54233.7853, "train_tokens_per_second": 5662.823 }, { "epoch": 0.47300026932399675, "grad_norm": 0.7731462314856246, "learning_rate": 8.68261327603089e-06, "loss": 0.42037010192871094, "num_input_tokens_seen": 307328112, "step": 7025, "train_runtime": 54273.3793, "train_tokens_per_second": 5662.594 }, { "epoch": 0.4733369243199569, "grad_norm": 0.7619151144650879, "learning_rate": 8.68082426998458e-06, "loss": 0.42117109298706057, "num_input_tokens_seen": 307558384, "step": 7030, "train_runtime": 54315.1352, "train_tokens_per_second": 5662.48 }, { "epoch": 0.473673579315917, "grad_norm": 0.8366328207039446, "learning_rate": 8.6790342346075e-06, "loss": 0.355437707901001, "num_input_tokens_seen": 307757832, "step": 7035, "train_runtime": 54355.0453, "train_tokens_per_second": 5661.992 }, { "epoch": 0.47401023431187717, "grad_norm": 0.694627660462694, "learning_rate": 8.677243170400228e-06, "loss": 0.3744319438934326, "num_input_tokens_seen": 307964848, "step": 7040, "train_runtime": 54392.4804, "train_tokens_per_second": 5661.901 }, { "epoch": 0.4743468893078373, "grad_norm": 0.7593548972261533, "learning_rate": 8.675451077863632e-06, "loss": 0.40117859840393066, "num_input_tokens_seen": 308180176, "step": 7045, "train_runtime": 54429.867, "train_tokens_per_second": 5661.968 }, { "epoch": 0.47468354430379744, "grad_norm": 0.7788878005901869, "learning_rate": 8.67365795749886e-06, "loss": 0.37619283199310305, "num_input_tokens_seen": 308393256, "step": 7050, "train_runtime": 54475.6142, "train_tokens_per_second": 5661.125 }, { "epoch": 0.4750201992997576, "grad_norm": 0.6935999303413757, "learning_rate": 8.671863809807355e-06, "loss": 0.36246466636657715, "num_input_tokens_seen": 308598120, "step": 7055, "train_runtime": 54512.6696, "train_tokens_per_second": 5661.035 }, { "epoch": 0.4753568542957177, "grad_norm": 0.7796482197914519, "learning_rate": 8.670068635290844e-06, "loss": 0.3815620899200439, "num_input_tokens_seen": 308814312, "step": 7060, "train_runtime": 54553.6102, "train_tokens_per_second": 5660.749 }, { "epoch": 0.47569350929167786, "grad_norm": 0.6394547128504924, "learning_rate": 8.668272434451343e-06, "loss": 0.3547971725463867, "num_input_tokens_seen": 309036648, "step": 7065, "train_runtime": 54589.1907, "train_tokens_per_second": 5661.133 }, { "epoch": 0.476030164287638, "grad_norm": 0.8424232555426785, "learning_rate": 8.666475207791154e-06, "loss": 0.3938549518585205, "num_input_tokens_seen": 309237312, "step": 7070, "train_runtime": 54626.0249, "train_tokens_per_second": 5660.989 }, { "epoch": 0.47636681928359814, "grad_norm": 0.7156676868042459, "learning_rate": 8.664676955812863e-06, "loss": 0.3805175065994263, "num_input_tokens_seen": 309461072, "step": 7075, "train_runtime": 54665.5373, "train_tokens_per_second": 5660.99 }, { "epoch": 0.4767034742795583, "grad_norm": 0.7803230987384645, "learning_rate": 8.662877679019348e-06, "loss": 0.38736543655395506, "num_input_tokens_seen": 309676264, "step": 7080, "train_runtime": 54702.5852, "train_tokens_per_second": 5661.09 }, { "epoch": 0.4770401292755185, "grad_norm": 0.811046251111573, "learning_rate": 8.66107737791377e-06, "loss": 0.40035252571105956, "num_input_tokens_seen": 309908584, "step": 7085, "train_runtime": 54739.8422, "train_tokens_per_second": 5661.481 }, { "epoch": 0.4773767842714786, "grad_norm": 0.8088100128547995, "learning_rate": 8.659276052999574e-06, "loss": 0.37158200740814207, "num_input_tokens_seen": 310109536, "step": 7090, "train_runtime": 54784.3231, "train_tokens_per_second": 5660.552 }, { "epoch": 0.47771343926743876, "grad_norm": 0.6607865351139958, "learning_rate": 8.657473704780504e-06, "loss": 0.3958035707473755, "num_input_tokens_seen": 310316416, "step": 7095, "train_runtime": 54823.0111, "train_tokens_per_second": 5660.331 }, { "epoch": 0.4780500942633989, "grad_norm": 0.7508776157927014, "learning_rate": 8.65567033376057e-06, "loss": 0.3861806392669678, "num_input_tokens_seen": 310543280, "step": 7100, "train_runtime": 54858.1842, "train_tokens_per_second": 5660.838 }, { "epoch": 0.47838674925935903, "grad_norm": 0.6796527894531441, "learning_rate": 8.65386594044409e-06, "loss": 0.38321571350097655, "num_input_tokens_seen": 310767656, "step": 7105, "train_runtime": 54899.3833, "train_tokens_per_second": 5660.677 }, { "epoch": 0.4787234042553192, "grad_norm": 0.7839875292722721, "learning_rate": 8.652060525335647e-06, "loss": 0.35958447456359866, "num_input_tokens_seen": 310977648, "step": 7110, "train_runtime": 54935.0727, "train_tokens_per_second": 5660.822 }, { "epoch": 0.4790600592512793, "grad_norm": 0.6805039530532168, "learning_rate": 8.650254088940125e-06, "loss": 0.37933621406555174, "num_input_tokens_seen": 311184472, "step": 7115, "train_runtime": 54970.8187, "train_tokens_per_second": 5660.903 }, { "epoch": 0.47939671424723945, "grad_norm": 0.8690524861477827, "learning_rate": 8.648446631762686e-06, "loss": 0.3870699882507324, "num_input_tokens_seen": 311386608, "step": 7120, "train_runtime": 55007.3848, "train_tokens_per_second": 5660.815 }, { "epoch": 0.4797333692431996, "grad_norm": 0.7834933561721031, "learning_rate": 8.646638154308781e-06, "loss": 0.3672234296798706, "num_input_tokens_seen": 311600392, "step": 7125, "train_runtime": 55045.8437, "train_tokens_per_second": 5660.743 }, { "epoch": 0.48007002423915973, "grad_norm": 0.6821280974528945, "learning_rate": 8.644828657084144e-06, "loss": 0.3536520004272461, "num_input_tokens_seen": 311826176, "step": 7130, "train_runtime": 55086.3186, "train_tokens_per_second": 5660.683 }, { "epoch": 0.48040667923511987, "grad_norm": 0.7090523007119766, "learning_rate": 8.643018140594797e-06, "loss": 0.35062260627746583, "num_input_tokens_seen": 312040616, "step": 7135, "train_runtime": 55118.7948, "train_tokens_per_second": 5661.238 }, { "epoch": 0.48074333423108, "grad_norm": 0.7694829828758608, "learning_rate": 8.641206605347042e-06, "loss": 0.3680727958679199, "num_input_tokens_seen": 312250776, "step": 7140, "train_runtime": 55154.654, "train_tokens_per_second": 5661.368 }, { "epoch": 0.48107998922704015, "grad_norm": 0.7834141310420747, "learning_rate": 8.639394051847472e-06, "loss": 0.3820206642150879, "num_input_tokens_seen": 312469768, "step": 7145, "train_runtime": 55194.213, "train_tokens_per_second": 5661.278 }, { "epoch": 0.4814166442230003, "grad_norm": 0.8086494042960466, "learning_rate": 8.63758048060296e-06, "loss": 0.3749295473098755, "num_input_tokens_seen": 312686816, "step": 7150, "train_runtime": 55234.7643, "train_tokens_per_second": 5661.051 }, { "epoch": 0.48175329921896043, "grad_norm": 1.146252827120329, "learning_rate": 8.635765892120666e-06, "loss": 0.35863730907440183, "num_input_tokens_seen": 312928240, "step": 7155, "train_runtime": 55276.3406, "train_tokens_per_second": 5661.161 }, { "epoch": 0.48208995421492057, "grad_norm": 0.6322723599846541, "learning_rate": 8.633950286908032e-06, "loss": 0.3957623243331909, "num_input_tokens_seen": 313146400, "step": 7160, "train_runtime": 55318.9273, "train_tokens_per_second": 5660.746 }, { "epoch": 0.4824266092108807, "grad_norm": 0.8242447392294052, "learning_rate": 8.63213366547279e-06, "loss": 0.41290960311889646, "num_input_tokens_seen": 313353080, "step": 7165, "train_runtime": 55354.3316, "train_tokens_per_second": 5660.859 }, { "epoch": 0.48276326420684085, "grad_norm": 0.8189218668862145, "learning_rate": 8.630316028322952e-06, "loss": 0.3599478960037231, "num_input_tokens_seen": 313556520, "step": 7170, "train_runtime": 55393.1558, "train_tokens_per_second": 5660.564 }, { "epoch": 0.483099919202801, "grad_norm": 0.8049613617878884, "learning_rate": 8.628497375966811e-06, "loss": 0.3688513278961182, "num_input_tokens_seen": 313791304, "step": 7175, "train_runtime": 55433.9631, "train_tokens_per_second": 5660.633 }, { "epoch": 0.4834365741987611, "grad_norm": 0.7403145334116261, "learning_rate": 8.62667770891295e-06, "loss": 0.4179924488067627, "num_input_tokens_seen": 314025432, "step": 7180, "train_runtime": 55479.2927, "train_tokens_per_second": 5660.228 }, { "epoch": 0.48377322919472127, "grad_norm": 0.6161204381365467, "learning_rate": 8.624857027670232e-06, "loss": 0.3718327522277832, "num_input_tokens_seen": 314253744, "step": 7185, "train_runtime": 55518.1876, "train_tokens_per_second": 5660.375 }, { "epoch": 0.4841098841906814, "grad_norm": 0.6673541170021607, "learning_rate": 8.623035332747804e-06, "loss": 0.4232837677001953, "num_input_tokens_seen": 314457360, "step": 7190, "train_runtime": 55555.7684, "train_tokens_per_second": 5660.211 }, { "epoch": 0.48444653918664154, "grad_norm": 0.8639989632411573, "learning_rate": 8.6212126246551e-06, "loss": 0.35295858383178713, "num_input_tokens_seen": 314659296, "step": 7195, "train_runtime": 55590.9252, "train_tokens_per_second": 5660.264 }, { "epoch": 0.4847831941826017, "grad_norm": 0.7194371682580046, "learning_rate": 8.619388903901833e-06, "loss": 0.397071385383606, "num_input_tokens_seen": 314886400, "step": 7200, "train_runtime": 55632.7504, "train_tokens_per_second": 5660.09 }, { "epoch": 0.4851198491785618, "grad_norm": 0.7895653948671645, "learning_rate": 8.617564170997998e-06, "loss": 0.393186354637146, "num_input_tokens_seen": 315113560, "step": 7205, "train_runtime": 55665.6693, "train_tokens_per_second": 5660.824 }, { "epoch": 0.48545650417452196, "grad_norm": 0.6916492568995722, "learning_rate": 8.61573842645388e-06, "loss": 0.38975393772125244, "num_input_tokens_seen": 315339760, "step": 7210, "train_runtime": 55701.6461, "train_tokens_per_second": 5661.229 }, { "epoch": 0.4857931591704821, "grad_norm": 0.7125114232933183, "learning_rate": 8.61391167078004e-06, "loss": 0.3773904085159302, "num_input_tokens_seen": 315564560, "step": 7215, "train_runtime": 55739.932, "train_tokens_per_second": 5661.373 }, { "epoch": 0.48612981416644224, "grad_norm": 0.7816578333674177, "learning_rate": 8.612083904487324e-06, "loss": 0.4223905563354492, "num_input_tokens_seen": 315780664, "step": 7220, "train_runtime": 55782.1816, "train_tokens_per_second": 5660.959 }, { "epoch": 0.4864664691624024, "grad_norm": 0.8225392117617899, "learning_rate": 8.610255128086867e-06, "loss": 0.39981255531311033, "num_input_tokens_seen": 315985224, "step": 7225, "train_runtime": 55817.5809, "train_tokens_per_second": 5661.034 }, { "epoch": 0.4868031241583625, "grad_norm": 0.7192041520493799, "learning_rate": 8.60842534209007e-06, "loss": 0.35159389972686766, "num_input_tokens_seen": 316206120, "step": 7230, "train_runtime": 55856.1823, "train_tokens_per_second": 5661.076 }, { "epoch": 0.48713977915432266, "grad_norm": 0.7538381499748801, "learning_rate": 8.606594547008636e-06, "loss": 0.33089404106140136, "num_input_tokens_seen": 316428112, "step": 7235, "train_runtime": 55889.528, "train_tokens_per_second": 5661.671 }, { "epoch": 0.4874764341502828, "grad_norm": 0.7734857420248509, "learning_rate": 8.604762743354536e-06, "loss": 0.39783239364624023, "num_input_tokens_seen": 316666376, "step": 7240, "train_runtime": 55922.8766, "train_tokens_per_second": 5662.555 }, { "epoch": 0.48781308914624294, "grad_norm": 0.7475280321551805, "learning_rate": 8.602929931640029e-06, "loss": 0.3995728254318237, "num_input_tokens_seen": 316868832, "step": 7245, "train_runtime": 55959.5907, "train_tokens_per_second": 5662.458 }, { "epoch": 0.4881497441422031, "grad_norm": 0.8349680082803242, "learning_rate": 8.601096112377659e-06, "loss": 0.4125559329986572, "num_input_tokens_seen": 317082248, "step": 7250, "train_runtime": 56002.6917, "train_tokens_per_second": 5661.911 }, { "epoch": 0.4884863991381632, "grad_norm": 0.6943776304621931, "learning_rate": 8.59926128608024e-06, "loss": 0.3738250255584717, "num_input_tokens_seen": 317303120, "step": 7255, "train_runtime": 56039.6874, "train_tokens_per_second": 5662.114 }, { "epoch": 0.48882305413412336, "grad_norm": 0.7789443419004642, "learning_rate": 8.597425453260881e-06, "loss": 0.3914709806442261, "num_input_tokens_seen": 317515672, "step": 7260, "train_runtime": 56082.3268, "train_tokens_per_second": 5661.599 }, { "epoch": 0.4891597091300835, "grad_norm": 0.8422191416131971, "learning_rate": 8.595588614432967e-06, "loss": 0.3669420719146729, "num_input_tokens_seen": 317720352, "step": 7265, "train_runtime": 56128.1181, "train_tokens_per_second": 5660.627 }, { "epoch": 0.48949636412604364, "grad_norm": 0.7163712412405564, "learning_rate": 8.59375077011016e-06, "loss": 0.36806163787841795, "num_input_tokens_seen": 317948384, "step": 7270, "train_runtime": 56167.6356, "train_tokens_per_second": 5660.704 }, { "epoch": 0.4898330191220038, "grad_norm": 0.8174970324207671, "learning_rate": 8.591911920806412e-06, "loss": 0.39014444351196287, "num_input_tokens_seen": 318179072, "step": 7275, "train_runtime": 56213.9579, "train_tokens_per_second": 5660.144 }, { "epoch": 0.4901696741179639, "grad_norm": 0.6974694369606549, "learning_rate": 8.590072067035947e-06, "loss": 0.38969347476959226, "num_input_tokens_seen": 318410480, "step": 7280, "train_runtime": 56255.4338, "train_tokens_per_second": 5660.084 }, { "epoch": 0.49050632911392406, "grad_norm": 0.6692328837890084, "learning_rate": 8.588231209313278e-06, "loss": 0.37391541004180906, "num_input_tokens_seen": 318654632, "step": 7285, "train_runtime": 56291.6831, "train_tokens_per_second": 5660.776 }, { "epoch": 0.4908429841098842, "grad_norm": 0.7608072412958533, "learning_rate": 8.586389348153192e-06, "loss": 0.3896606206893921, "num_input_tokens_seen": 318874824, "step": 7290, "train_runtime": 56326.4539, "train_tokens_per_second": 5661.191 }, { "epoch": 0.49117963910584433, "grad_norm": 0.7736109340706484, "learning_rate": 8.584546484070762e-06, "loss": 0.40265254974365233, "num_input_tokens_seen": 319084200, "step": 7295, "train_runtime": 56365.3177, "train_tokens_per_second": 5661.002 }, { "epoch": 0.4915162941018045, "grad_norm": 0.7875873984707813, "learning_rate": 8.582702617581338e-06, "loss": 0.37858309745788576, "num_input_tokens_seen": 319307784, "step": 7300, "train_runtime": 56403.5288, "train_tokens_per_second": 5661.131 }, { "epoch": 0.4918529490977646, "grad_norm": 0.7183058860492505, "learning_rate": 8.58085774920055e-06, "loss": 0.38918490409851075, "num_input_tokens_seen": 319513304, "step": 7305, "train_runtime": 56438.5945, "train_tokens_per_second": 5661.256 }, { "epoch": 0.49218960409372475, "grad_norm": 0.7356534041270457, "learning_rate": 8.579011879444313e-06, "loss": 0.414321231842041, "num_input_tokens_seen": 319743560, "step": 7310, "train_runtime": 56483.4424, "train_tokens_per_second": 5660.837 }, { "epoch": 0.4925262590896849, "grad_norm": 0.6584093897897996, "learning_rate": 8.577165008828817e-06, "loss": 0.34825422763824465, "num_input_tokens_seen": 319947112, "step": 7315, "train_runtime": 56521.6053, "train_tokens_per_second": 5660.616 }, { "epoch": 0.49286291408564503, "grad_norm": 0.7722746099858304, "learning_rate": 8.57531713787053e-06, "loss": 0.3858429193496704, "num_input_tokens_seen": 320155920, "step": 7320, "train_runtime": 56558.1587, "train_tokens_per_second": 5660.65 }, { "epoch": 0.49319956908160517, "grad_norm": 0.8389191394295502, "learning_rate": 8.573468267086208e-06, "loss": 0.40245862007141114, "num_input_tokens_seen": 320372792, "step": 7325, "train_runtime": 56592.9849, "train_tokens_per_second": 5660.998 }, { "epoch": 0.4935362240775653, "grad_norm": 0.7633923302039957, "learning_rate": 8.57161839699288e-06, "loss": 0.36266283988952636, "num_input_tokens_seen": 320592160, "step": 7330, "train_runtime": 56631.6072, "train_tokens_per_second": 5661.011 }, { "epoch": 0.49387287907352545, "grad_norm": 0.8780389979845686, "learning_rate": 8.569767528107857e-06, "loss": 0.3856183052062988, "num_input_tokens_seen": 320807512, "step": 7335, "train_runtime": 56669.1815, "train_tokens_per_second": 5661.058 }, { "epoch": 0.4942095340694856, "grad_norm": 0.6800471334043537, "learning_rate": 8.567915660948727e-06, "loss": 0.3747032880783081, "num_input_tokens_seen": 321031440, "step": 7340, "train_runtime": 56709.5179, "train_tokens_per_second": 5660.98 }, { "epoch": 0.49454618906544573, "grad_norm": 0.8334581237618652, "learning_rate": 8.566062796033358e-06, "loss": 0.4063011646270752, "num_input_tokens_seen": 321244008, "step": 7345, "train_runtime": 56746.898, "train_tokens_per_second": 5660.997 }, { "epoch": 0.49488284406140587, "grad_norm": 0.7667199760691221, "learning_rate": 8.564208933879903e-06, "loss": 0.37364883422851564, "num_input_tokens_seen": 321456992, "step": 7350, "train_runtime": 56787.18, "train_tokens_per_second": 5660.732 }, { "epoch": 0.495219499057366, "grad_norm": 0.7580149996088524, "learning_rate": 8.562354075006782e-06, "loss": 0.3439052104949951, "num_input_tokens_seen": 321675512, "step": 7355, "train_runtime": 56825.1931, "train_tokens_per_second": 5660.79 }, { "epoch": 0.49555615405332615, "grad_norm": 0.6724287776480686, "learning_rate": 8.560498219932706e-06, "loss": 0.4257340431213379, "num_input_tokens_seen": 321898448, "step": 7360, "train_runtime": 56859.2761, "train_tokens_per_second": 5661.318 }, { "epoch": 0.4958928090492863, "grad_norm": 0.735779732523222, "learning_rate": 8.558641369176654e-06, "loss": 0.33791351318359375, "num_input_tokens_seen": 322099904, "step": 7365, "train_runtime": 56892.2085, "train_tokens_per_second": 5661.582 }, { "epoch": 0.4962294640452464, "grad_norm": 0.7979574200557189, "learning_rate": 8.556783523257892e-06, "loss": 0.3972716569900513, "num_input_tokens_seen": 322310456, "step": 7370, "train_runtime": 56935.1565, "train_tokens_per_second": 5661.009 }, { "epoch": 0.49656611904120657, "grad_norm": 0.7637866611420476, "learning_rate": 8.554924682695959e-06, "loss": 0.3530308246612549, "num_input_tokens_seen": 322518744, "step": 7375, "train_runtime": 56971.9645, "train_tokens_per_second": 5661.008 }, { "epoch": 0.4969027740371667, "grad_norm": 0.7640709256586813, "learning_rate": 8.553064848010677e-06, "loss": 0.3955545902252197, "num_input_tokens_seen": 322725520, "step": 7380, "train_runtime": 57007.6953, "train_tokens_per_second": 5661.087 }, { "epoch": 0.49723942903312685, "grad_norm": 0.8082539381866035, "learning_rate": 8.551204019722137e-06, "loss": 0.37126519680023196, "num_input_tokens_seen": 322938184, "step": 7385, "train_runtime": 57046.2643, "train_tokens_per_second": 5660.987 }, { "epoch": 0.497576084029087, "grad_norm": 0.7610367285948725, "learning_rate": 8.549342198350718e-06, "loss": 0.40738329887390134, "num_input_tokens_seen": 323160704, "step": 7390, "train_runtime": 57086.0056, "train_tokens_per_second": 5660.944 }, { "epoch": 0.4979127390250471, "grad_norm": 0.7004854714973048, "learning_rate": 8.54747938441707e-06, "loss": 0.36683225631713867, "num_input_tokens_seen": 323382024, "step": 7395, "train_runtime": 57128.4646, "train_tokens_per_second": 5660.611 }, { "epoch": 0.49824939402100726, "grad_norm": 0.6981945654130406, "learning_rate": 8.545615578442126e-06, "loss": 0.35772018432617186, "num_input_tokens_seen": 323601056, "step": 7400, "train_runtime": 57166.4275, "train_tokens_per_second": 5660.684 }, { "epoch": 0.4985860490169674, "grad_norm": 0.8538725530295028, "learning_rate": 8.54375078094709e-06, "loss": 0.3746786117553711, "num_input_tokens_seen": 323824464, "step": 7405, "train_runtime": 57216.1649, "train_tokens_per_second": 5659.667 }, { "epoch": 0.49892270401292754, "grad_norm": 0.6772326544260556, "learning_rate": 8.541884992453449e-06, "loss": 0.3711742401123047, "num_input_tokens_seen": 324047472, "step": 7410, "train_runtime": 57254.2655, "train_tokens_per_second": 5659.796 }, { "epoch": 0.4992593590088877, "grad_norm": 0.6789887270206421, "learning_rate": 8.540018213482966e-06, "loss": 0.37660138607025145, "num_input_tokens_seen": 324280688, "step": 7415, "train_runtime": 57294.4005, "train_tokens_per_second": 5659.902 }, { "epoch": 0.4995960140048478, "grad_norm": 0.7605591952463279, "learning_rate": 8.538150444557676e-06, "loss": 0.3920082330703735, "num_input_tokens_seen": 324488104, "step": 7420, "train_runtime": 57333.8655, "train_tokens_per_second": 5659.624 }, { "epoch": 0.49993266900080796, "grad_norm": 0.826315107413246, "learning_rate": 8.536281686199896e-06, "loss": 0.385677433013916, "num_input_tokens_seen": 324711216, "step": 7425, "train_runtime": 57366.6278, "train_tokens_per_second": 5660.281 }, { "epoch": 0.5002693239967682, "grad_norm": 0.6877893318576644, "learning_rate": 8.534411938932218e-06, "loss": 0.3787369728088379, "num_input_tokens_seen": 324939096, "step": 7430, "train_runtime": 57400.8374, "train_tokens_per_second": 5660.877 }, { "epoch": 0.5006059789927283, "grad_norm": 0.7206196203304496, "learning_rate": 8.532541203277515e-06, "loss": 0.3697648525238037, "num_input_tokens_seen": 325163640, "step": 7435, "train_runtime": 57437.2769, "train_tokens_per_second": 5661.195 }, { "epoch": 0.5009426339886884, "grad_norm": 0.8219400190681228, "learning_rate": 8.530669479758926e-06, "loss": 0.37598912715911864, "num_input_tokens_seen": 325383192, "step": 7440, "train_runtime": 57475.956, "train_tokens_per_second": 5661.205 }, { "epoch": 0.5012792889846486, "grad_norm": 0.8185284831231338, "learning_rate": 8.528796768899878e-06, "loss": 0.39255619049072266, "num_input_tokens_seen": 325585216, "step": 7445, "train_runtime": 57516.4354, "train_tokens_per_second": 5660.734 }, { "epoch": 0.5016159439806087, "grad_norm": 0.748875770223375, "learning_rate": 8.526923071224064e-06, "loss": 0.39842636585235597, "num_input_tokens_seen": 325810472, "step": 7450, "train_runtime": 57549.4748, "train_tokens_per_second": 5661.398 }, { "epoch": 0.5019525989765689, "grad_norm": 0.7148185230181737, "learning_rate": 8.525048387255461e-06, "loss": 0.3887434482574463, "num_input_tokens_seen": 326034504, "step": 7455, "train_runtime": 57590.0671, "train_tokens_per_second": 5661.298 }, { "epoch": 0.502289253972529, "grad_norm": 0.7229968516896057, "learning_rate": 8.523172717518315e-06, "loss": 0.3696585178375244, "num_input_tokens_seen": 326245696, "step": 7460, "train_runtime": 57627.1988, "train_tokens_per_second": 5661.314 }, { "epoch": 0.5026259089684891, "grad_norm": 0.7305037275102111, "learning_rate": 8.521296062537156e-06, "loss": 0.37876601219177247, "num_input_tokens_seen": 326460104, "step": 7465, "train_runtime": 57664.9318, "train_tokens_per_second": 5661.328 }, { "epoch": 0.5029625639644493, "grad_norm": 0.7847466467811594, "learning_rate": 8.51941842283678e-06, "loss": 0.36045174598693847, "num_input_tokens_seen": 326673104, "step": 7470, "train_runtime": 57704.8246, "train_tokens_per_second": 5661.106 }, { "epoch": 0.5032992189604094, "grad_norm": 0.991284631688998, "learning_rate": 8.517539798942265e-06, "loss": 0.3735339641571045, "num_input_tokens_seen": 326906960, "step": 7475, "train_runtime": 57737.7344, "train_tokens_per_second": 5661.929 }, { "epoch": 0.5036358739563696, "grad_norm": 0.6872665714663292, "learning_rate": 8.515660191378962e-06, "loss": 0.39676947593688966, "num_input_tokens_seen": 327128416, "step": 7480, "train_runtime": 57776.877, "train_tokens_per_second": 5661.926 }, { "epoch": 0.5039725289523297, "grad_norm": 0.6751937767879514, "learning_rate": 8.513779600672495e-06, "loss": 0.3535287380218506, "num_input_tokens_seen": 327364152, "step": 7485, "train_runtime": 57811.2991, "train_tokens_per_second": 5662.633 }, { "epoch": 0.5043091839482898, "grad_norm": 0.7000671921171517, "learning_rate": 8.511898027348771e-06, "loss": 0.37773268222808837, "num_input_tokens_seen": 327568048, "step": 7490, "train_runtime": 57853.1955, "train_tokens_per_second": 5662.056 }, { "epoch": 0.50464583894425, "grad_norm": 0.6936107754040254, "learning_rate": 8.51001547193396e-06, "loss": 0.3704256296157837, "num_input_tokens_seen": 327792152, "step": 7495, "train_runtime": 57893.3414, "train_tokens_per_second": 5662.001 }, { "epoch": 0.5049824939402101, "grad_norm": 0.7889020414532445, "learning_rate": 8.508131934954515e-06, "loss": 0.36852757930755614, "num_input_tokens_seen": 327994400, "step": 7500, "train_runtime": 57932.8569, "train_tokens_per_second": 5661.63 }, { "epoch": 0.5053191489361702, "grad_norm": 0.715078307452266, "learning_rate": 8.50624741693716e-06, "loss": 0.3951726913452148, "num_input_tokens_seen": 328200448, "step": 7505, "train_runtime": 57971.7531, "train_tokens_per_second": 5661.386 }, { "epoch": 0.5056558039321304, "grad_norm": 1.068005291058121, "learning_rate": 8.5043619184089e-06, "loss": 0.4119250297546387, "num_input_tokens_seen": 328421224, "step": 7510, "train_runtime": 58005.869, "train_tokens_per_second": 5661.862 }, { "epoch": 0.5059924589280905, "grad_norm": 1.638455940254133, "learning_rate": 8.502475439897e-06, "loss": 0.4078369140625, "num_input_tokens_seen": 328646192, "step": 7515, "train_runtime": 58043.9094, "train_tokens_per_second": 5662.027 }, { "epoch": 0.5063291139240507, "grad_norm": 0.7358398144623932, "learning_rate": 8.500587981929013e-06, "loss": 0.3898489475250244, "num_input_tokens_seen": 328867064, "step": 7520, "train_runtime": 58088.0612, "train_tokens_per_second": 5661.526 }, { "epoch": 0.5066657689200108, "grad_norm": 0.7487957564819914, "learning_rate": 8.498699545032758e-06, "loss": 0.38454551696777345, "num_input_tokens_seen": 329103168, "step": 7525, "train_runtime": 58124.1106, "train_tokens_per_second": 5662.077 }, { "epoch": 0.507002423915971, "grad_norm": 0.7172633060502269, "learning_rate": 8.496810129736334e-06, "loss": 0.3850215435028076, "num_input_tokens_seen": 329322920, "step": 7530, "train_runtime": 58166.9838, "train_tokens_per_second": 5661.681 }, { "epoch": 0.5073390789119311, "grad_norm": 0.7747557646585903, "learning_rate": 8.494919736568105e-06, "loss": 0.3788848638534546, "num_input_tokens_seen": 329533896, "step": 7535, "train_runtime": 58210.0232, "train_tokens_per_second": 5661.119 }, { "epoch": 0.5076757339078912, "grad_norm": 0.7933496638959117, "learning_rate": 8.49302836605672e-06, "loss": 0.37194099426269533, "num_input_tokens_seen": 329760624, "step": 7540, "train_runtime": 58246.3752, "train_tokens_per_second": 5661.479 }, { "epoch": 0.5080123889038514, "grad_norm": 0.7365707403857205, "learning_rate": 8.491136018731088e-06, "loss": 0.3646608114242554, "num_input_tokens_seen": 329984728, "step": 7545, "train_runtime": 58287.6488, "train_tokens_per_second": 5661.315 }, { "epoch": 0.5083490438998115, "grad_norm": 0.8956737633683735, "learning_rate": 8.4892426951204e-06, "loss": 0.3987517118453979, "num_input_tokens_seen": 330206096, "step": 7550, "train_runtime": 58316.2366, "train_tokens_per_second": 5662.335 }, { "epoch": 0.5086856988957716, "grad_norm": 0.7170163461314129, "learning_rate": 8.48734839575412e-06, "loss": 0.3717711687088013, "num_input_tokens_seen": 330437336, "step": 7555, "train_runtime": 58351.3409, "train_tokens_per_second": 5662.892 }, { "epoch": 0.5090223538917318, "grad_norm": 0.6630558999546488, "learning_rate": 8.485453121161983e-06, "loss": 0.37380030155181887, "num_input_tokens_seen": 330653616, "step": 7560, "train_runtime": 58392.093, "train_tokens_per_second": 5662.644 }, { "epoch": 0.5093590088876919, "grad_norm": 0.7845896930720607, "learning_rate": 8.483556871873993e-06, "loss": 0.42113819122314455, "num_input_tokens_seen": 330875672, "step": 7565, "train_runtime": 58433.2419, "train_tokens_per_second": 5662.456 }, { "epoch": 0.5096956638836521, "grad_norm": 0.760051472590646, "learning_rate": 8.481659648420433e-06, "loss": 0.3786670207977295, "num_input_tokens_seen": 331096488, "step": 7570, "train_runtime": 58475.0649, "train_tokens_per_second": 5662.182 }, { "epoch": 0.5100323188796122, "grad_norm": 0.8835596263525625, "learning_rate": 8.479761451331855e-06, "loss": 0.3809337615966797, "num_input_tokens_seen": 331285184, "step": 7575, "train_runtime": 58515.9798, "train_tokens_per_second": 5661.448 }, { "epoch": 0.5103689738755723, "grad_norm": 0.9301429501501213, "learning_rate": 8.477862281139082e-06, "loss": 0.3540458917617798, "num_input_tokens_seen": 331501760, "step": 7580, "train_runtime": 58558.4957, "train_tokens_per_second": 5661.036 }, { "epoch": 0.5107056288715325, "grad_norm": 0.7609757852463125, "learning_rate": 8.475962138373212e-06, "loss": 0.3986123323440552, "num_input_tokens_seen": 331702152, "step": 7585, "train_runtime": 58591.7614, "train_tokens_per_second": 5661.242 }, { "epoch": 0.5110422838674926, "grad_norm": 0.6930333171792868, "learning_rate": 8.474061023565614e-06, "loss": 0.3940688371658325, "num_input_tokens_seen": 331929992, "step": 7590, "train_runtime": 58631.4664, "train_tokens_per_second": 5661.294 }, { "epoch": 0.5113789388634528, "grad_norm": 0.7801001592101691, "learning_rate": 8.472158937247931e-06, "loss": 0.40605816841125486, "num_input_tokens_seen": 332148472, "step": 7595, "train_runtime": 58666.3698, "train_tokens_per_second": 5661.65 }, { "epoch": 0.5117155938594129, "grad_norm": 0.7185541728168203, "learning_rate": 8.47025587995207e-06, "loss": 0.38570313453674315, "num_input_tokens_seen": 332362728, "step": 7600, "train_runtime": 58704.4102, "train_tokens_per_second": 5661.631 }, { "epoch": 0.512052248855373, "grad_norm": 0.7887783994842774, "learning_rate": 8.46835185221022e-06, "loss": 0.39829018115997317, "num_input_tokens_seen": 332569544, "step": 7605, "train_runtime": 58743.9844, "train_tokens_per_second": 5661.338 }, { "epoch": 0.5123889038513332, "grad_norm": 0.8602264236155862, "learning_rate": 8.466446854554835e-06, "loss": 0.3549684762954712, "num_input_tokens_seen": 332778920, "step": 7610, "train_runtime": 58780.8818, "train_tokens_per_second": 5661.346 }, { "epoch": 0.5127255588472933, "grad_norm": 0.7228150824538518, "learning_rate": 8.464540887518638e-06, "loss": 0.37906813621520996, "num_input_tokens_seen": 332984080, "step": 7615, "train_runtime": 58823.2164, "train_tokens_per_second": 5660.759 }, { "epoch": 0.5130622138432535, "grad_norm": 0.7996970703617401, "learning_rate": 8.462633951634631e-06, "loss": 0.3685762405395508, "num_input_tokens_seen": 333202640, "step": 7620, "train_runtime": 58868.3048, "train_tokens_per_second": 5660.136 }, { "epoch": 0.5133988688392136, "grad_norm": 0.6901634902422549, "learning_rate": 8.46072604743608e-06, "loss": 0.35547614097595215, "num_input_tokens_seen": 333413904, "step": 7625, "train_runtime": 58905.0124, "train_tokens_per_second": 5660.196 }, { "epoch": 0.5137355238351737, "grad_norm": 0.9033857052689097, "learning_rate": 8.458817175456528e-06, "loss": 0.3930670261383057, "num_input_tokens_seen": 333630616, "step": 7630, "train_runtime": 58947.1829, "train_tokens_per_second": 5659.823 }, { "epoch": 0.5140721788311339, "grad_norm": 0.7781771666334231, "learning_rate": 8.45690733622978e-06, "loss": 0.35927329063415525, "num_input_tokens_seen": 333854600, "step": 7635, "train_runtime": 58986.6913, "train_tokens_per_second": 5659.829 }, { "epoch": 0.514408833827094, "grad_norm": 0.8455368762157274, "learning_rate": 8.45499653028992e-06, "loss": 0.36787919998168944, "num_input_tokens_seen": 334071192, "step": 7640, "train_runtime": 59022.2041, "train_tokens_per_second": 5660.093 }, { "epoch": 0.5147454888230542, "grad_norm": 0.7586644939540588, "learning_rate": 8.453084758171297e-06, "loss": 0.37957746982574464, "num_input_tokens_seen": 334291888, "step": 7645, "train_runtime": 59067.1738, "train_tokens_per_second": 5659.521 }, { "epoch": 0.5150821438190143, "grad_norm": 0.7524816129003911, "learning_rate": 8.451172020408532e-06, "loss": 0.38945965766906737, "num_input_tokens_seen": 334516424, "step": 7650, "train_runtime": 59101.459, "train_tokens_per_second": 5660.037 }, { "epoch": 0.5154187988149744, "grad_norm": 0.7137520182282876, "learning_rate": 8.449258317536517e-06, "loss": 0.35926315784454343, "num_input_tokens_seen": 334732808, "step": 7655, "train_runtime": 59134.7468, "train_tokens_per_second": 5660.51 }, { "epoch": 0.5157554538109346, "grad_norm": 0.7129464795573726, "learning_rate": 8.447343650090412e-06, "loss": 0.35725347995758056, "num_input_tokens_seen": 334954280, "step": 7660, "train_runtime": 59172.9555, "train_tokens_per_second": 5660.597 }, { "epoch": 0.5160921088068947, "grad_norm": 0.7272448686794939, "learning_rate": 8.445428018605647e-06, "loss": 0.406490421295166, "num_input_tokens_seen": 335178568, "step": 7665, "train_runtime": 59210.2513, "train_tokens_per_second": 5660.82 }, { "epoch": 0.5164287638028549, "grad_norm": 0.6593329295977397, "learning_rate": 8.443511423617924e-06, "loss": 0.34410724639892576, "num_input_tokens_seen": 335398608, "step": 7670, "train_runtime": 59246.6136, "train_tokens_per_second": 5661.06 }, { "epoch": 0.516765418798815, "grad_norm": 0.7054753575271266, "learning_rate": 8.441593865663213e-06, "loss": 0.39874303340911865, "num_input_tokens_seen": 335621696, "step": 7675, "train_runtime": 59285.0684, "train_tokens_per_second": 5661.151 }, { "epoch": 0.5171020737947751, "grad_norm": 0.7429064696844442, "learning_rate": 8.439675345277751e-06, "loss": 0.40140485763549805, "num_input_tokens_seen": 335839504, "step": 7680, "train_runtime": 59327.3379, "train_tokens_per_second": 5660.788 }, { "epoch": 0.5174387287907353, "grad_norm": 0.6392657750321254, "learning_rate": 8.437755862998047e-06, "loss": 0.3619039297103882, "num_input_tokens_seen": 336062080, "step": 7685, "train_runtime": 59362.2516, "train_tokens_per_second": 5661.208 }, { "epoch": 0.5177753837866954, "grad_norm": 0.6333778064119364, "learning_rate": 8.435835419360878e-06, "loss": 0.3882591247558594, "num_input_tokens_seen": 336299944, "step": 7690, "train_runtime": 59398.7224, "train_tokens_per_second": 5661.737 }, { "epoch": 0.5181120387826555, "grad_norm": 0.7397126752113882, "learning_rate": 8.433914014903291e-06, "loss": 0.42388019561767576, "num_input_tokens_seen": 336514968, "step": 7695, "train_runtime": 59437.773, "train_tokens_per_second": 5661.635 }, { "epoch": 0.5184486937786157, "grad_norm": 0.6888095905405301, "learning_rate": 8.431991650162599e-06, "loss": 0.37606000900268555, "num_input_tokens_seen": 336732600, "step": 7700, "train_runtime": 59483.4411, "train_tokens_per_second": 5660.947 }, { "epoch": 0.5187853487745758, "grad_norm": 0.6980617402046243, "learning_rate": 8.430068325676386e-06, "loss": 0.39625885486602785, "num_input_tokens_seen": 336948776, "step": 7705, "train_runtime": 59521.0447, "train_tokens_per_second": 5661.002 }, { "epoch": 0.519122003770536, "grad_norm": 0.732968462897192, "learning_rate": 8.428144041982502e-06, "loss": 0.39479496479034426, "num_input_tokens_seen": 337163520, "step": 7710, "train_runtime": 59556.4, "train_tokens_per_second": 5661.247 }, { "epoch": 0.5194586587664961, "grad_norm": 0.6401198443952045, "learning_rate": 8.42621879961907e-06, "loss": 0.38160171508789065, "num_input_tokens_seen": 337382992, "step": 7715, "train_runtime": 59597.2808, "train_tokens_per_second": 5661.047 }, { "epoch": 0.5197953137624562, "grad_norm": 0.7011673418789361, "learning_rate": 8.424292599124476e-06, "loss": 0.3532627820968628, "num_input_tokens_seen": 337609304, "step": 7720, "train_runtime": 59636.4965, "train_tokens_per_second": 5661.119 }, { "epoch": 0.5201319687584164, "grad_norm": 0.7609717187854771, "learning_rate": 8.422365441037374e-06, "loss": 0.39478967189788816, "num_input_tokens_seen": 337838072, "step": 7725, "train_runtime": 59669.1056, "train_tokens_per_second": 5661.859 }, { "epoch": 0.5204686237543765, "grad_norm": 0.743645872276741, "learning_rate": 8.420437325896692e-06, "loss": 0.3906223297119141, "num_input_tokens_seen": 338067512, "step": 7730, "train_runtime": 59705.1498, "train_tokens_per_second": 5662.284 }, { "epoch": 0.5208052787503367, "grad_norm": 0.7586775310938808, "learning_rate": 8.418508254241617e-06, "loss": 0.3925325870513916, "num_input_tokens_seen": 338284504, "step": 7735, "train_runtime": 59748.0729, "train_tokens_per_second": 5661.848 }, { "epoch": 0.5211419337462968, "grad_norm": 0.8223238925961407, "learning_rate": 8.416578226611612e-06, "loss": 0.35642185211181643, "num_input_tokens_seen": 338495440, "step": 7740, "train_runtime": 59783.2802, "train_tokens_per_second": 5662.042 }, { "epoch": 0.5214785887422569, "grad_norm": 0.8532576047124709, "learning_rate": 8.414647243546398e-06, "loss": 0.38446238040924074, "num_input_tokens_seen": 338717192, "step": 7745, "train_runtime": 59821.3869, "train_tokens_per_second": 5662.142 }, { "epoch": 0.5218152437382171, "grad_norm": 0.6899241307861492, "learning_rate": 8.412715305585973e-06, "loss": 0.367059588432312, "num_input_tokens_seen": 338946888, "step": 7750, "train_runtime": 59859.9792, "train_tokens_per_second": 5662.329 }, { "epoch": 0.5221518987341772, "grad_norm": 0.7311441327867719, "learning_rate": 8.410782413270594e-06, "loss": 0.3799006462097168, "num_input_tokens_seen": 339172224, "step": 7755, "train_runtime": 59900.1807, "train_tokens_per_second": 5662.29 }, { "epoch": 0.5224885537301374, "grad_norm": 0.9420308727064326, "learning_rate": 8.408848567140787e-06, "loss": 0.37287948131561277, "num_input_tokens_seen": 339364672, "step": 7760, "train_runtime": 59941.0763, "train_tokens_per_second": 5661.638 }, { "epoch": 0.5228252087260975, "grad_norm": 0.7245874800766633, "learning_rate": 8.406913767737353e-06, "loss": 0.37642457485198977, "num_input_tokens_seen": 339579064, "step": 7765, "train_runtime": 59982.2891, "train_tokens_per_second": 5661.322 }, { "epoch": 0.5231618637220576, "grad_norm": 0.7199997285512201, "learning_rate": 8.404978015601344e-06, "loss": 0.3964075565338135, "num_input_tokens_seen": 339801840, "step": 7770, "train_runtime": 60029.6628, "train_tokens_per_second": 5660.566 }, { "epoch": 0.5234985187180178, "grad_norm": 0.697918705663631, "learning_rate": 8.403041311274091e-06, "loss": 0.39160215854644775, "num_input_tokens_seen": 340025832, "step": 7775, "train_runtime": 60071.2747, "train_tokens_per_second": 5660.373 }, { "epoch": 0.5238351737139779, "grad_norm": 0.8157700767931442, "learning_rate": 8.401103655297188e-06, "loss": 0.3895624876022339, "num_input_tokens_seen": 340239616, "step": 7780, "train_runtime": 60105.9113, "train_tokens_per_second": 5660.668 }, { "epoch": 0.5241718287099381, "grad_norm": 0.838923642880136, "learning_rate": 8.399165048212494e-06, "loss": 0.3589164257049561, "num_input_tokens_seen": 340454984, "step": 7785, "train_runtime": 60145.3789, "train_tokens_per_second": 5660.534 }, { "epoch": 0.5245084837058982, "grad_norm": 0.7246920315479125, "learning_rate": 8.397225490562131e-06, "loss": 0.4032485008239746, "num_input_tokens_seen": 340684288, "step": 7790, "train_runtime": 60180.0663, "train_tokens_per_second": 5661.082 }, { "epoch": 0.5248451387018583, "grad_norm": 0.7826576263190983, "learning_rate": 8.395284982888494e-06, "loss": 0.3588679313659668, "num_input_tokens_seen": 340904512, "step": 7795, "train_runtime": 60216.628, "train_tokens_per_second": 5661.302 }, { "epoch": 0.5251817936978185, "grad_norm": 0.7381573756482819, "learning_rate": 8.393343525734239e-06, "loss": 0.39098711013793946, "num_input_tokens_seen": 341128688, "step": 7800, "train_runtime": 60254.8697, "train_tokens_per_second": 5661.429 }, { "epoch": 0.5255184486937786, "grad_norm": 0.9510438503863269, "learning_rate": 8.391401119642286e-06, "loss": 0.39932818412780763, "num_input_tokens_seen": 341326256, "step": 7805, "train_runtime": 60302.5843, "train_tokens_per_second": 5660.226 }, { "epoch": 0.5258551036897388, "grad_norm": 0.7551888581389101, "learning_rate": 8.389457765155824e-06, "loss": 0.40273380279541016, "num_input_tokens_seen": 341526840, "step": 7810, "train_runtime": 60347.108, "train_tokens_per_second": 5659.374 }, { "epoch": 0.5261917586856989, "grad_norm": 0.7817537228902953, "learning_rate": 8.387513462818309e-06, "loss": 0.36842942237854004, "num_input_tokens_seen": 341747720, "step": 7815, "train_runtime": 60388.0509, "train_tokens_per_second": 5659.194 }, { "epoch": 0.526528413681659, "grad_norm": 0.76396158135225, "learning_rate": 8.385568213173453e-06, "loss": 0.3687218427658081, "num_input_tokens_seen": 341961736, "step": 7820, "train_runtime": 60430.695, "train_tokens_per_second": 5658.742 }, { "epoch": 0.5268650686776192, "grad_norm": 1.0538784566401151, "learning_rate": 8.383622016765242e-06, "loss": 0.3595340013504028, "num_input_tokens_seen": 342180688, "step": 7825, "train_runtime": 60474.2774, "train_tokens_per_second": 5658.285 }, { "epoch": 0.5272017236735793, "grad_norm": 0.7683842178996437, "learning_rate": 8.381674874137926e-06, "loss": 0.4014129638671875, "num_input_tokens_seen": 342390504, "step": 7830, "train_runtime": 60507.7742, "train_tokens_per_second": 5658.62 }, { "epoch": 0.5275383786695395, "grad_norm": 0.7767541075637882, "learning_rate": 8.379726785836013e-06, "loss": 0.3654167652130127, "num_input_tokens_seen": 342602080, "step": 7835, "train_runtime": 60550.4658, "train_tokens_per_second": 5658.125 }, { "epoch": 0.5278750336654996, "grad_norm": 0.6734458895156976, "learning_rate": 8.377777752404283e-06, "loss": 0.36977086067199705, "num_input_tokens_seen": 342831800, "step": 7840, "train_runtime": 60591.1256, "train_tokens_per_second": 5658.119 }, { "epoch": 0.5282116886614597, "grad_norm": 0.8168160522078569, "learning_rate": 8.375827774387774e-06, "loss": 0.34728164672851564, "num_input_tokens_seen": 343029568, "step": 7845, "train_runtime": 60633.6042, "train_tokens_per_second": 5657.417 }, { "epoch": 0.5285483436574199, "grad_norm": 0.6622532156086101, "learning_rate": 8.373876852331793e-06, "loss": 0.3438518762588501, "num_input_tokens_seen": 343254472, "step": 7850, "train_runtime": 60671.9643, "train_tokens_per_second": 5657.547 }, { "epoch": 0.52888499865338, "grad_norm": 0.7502437558347258, "learning_rate": 8.371924986781909e-06, "loss": 0.38301682472229004, "num_input_tokens_seen": 343470008, "step": 7855, "train_runtime": 60709.3414, "train_tokens_per_second": 5657.614 }, { "epoch": 0.5292216536493402, "grad_norm": 0.7587114327145728, "learning_rate": 8.369972178283955e-06, "loss": 0.36738762855529783, "num_input_tokens_seen": 343698072, "step": 7860, "train_runtime": 60747.59, "train_tokens_per_second": 5657.806 }, { "epoch": 0.5295583086453003, "grad_norm": 0.6881092460250557, "learning_rate": 8.368018427384027e-06, "loss": 0.38115482330322265, "num_input_tokens_seen": 343919960, "step": 7865, "train_runtime": 60791.0097, "train_tokens_per_second": 5657.415 }, { "epoch": 0.5298949636412604, "grad_norm": 0.8355237541845086, "learning_rate": 8.366063734628485e-06, "loss": 0.38156135082244874, "num_input_tokens_seen": 344123568, "step": 7870, "train_runtime": 60827.6415, "train_tokens_per_second": 5657.355 }, { "epoch": 0.5302316186372206, "grad_norm": 0.8303838221096392, "learning_rate": 8.364108100563955e-06, "loss": 0.4007874011993408, "num_input_tokens_seen": 344341784, "step": 7875, "train_runtime": 60864.4296, "train_tokens_per_second": 5657.521 }, { "epoch": 0.5305682736331807, "grad_norm": 0.7925795609225155, "learning_rate": 8.362151525737321e-06, "loss": 0.4212652206420898, "num_input_tokens_seen": 344562552, "step": 7880, "train_runtime": 60901.6398, "train_tokens_per_second": 5657.689 }, { "epoch": 0.5309049286291408, "grad_norm": 0.7468959848481416, "learning_rate": 8.360194010695733e-06, "loss": 0.3570136547088623, "num_input_tokens_seen": 344782336, "step": 7885, "train_runtime": 60942.4135, "train_tokens_per_second": 5657.51 }, { "epoch": 0.531241583625101, "grad_norm": 0.7105479533553207, "learning_rate": 8.358235555986607e-06, "loss": 0.39661598205566406, "num_input_tokens_seen": 345008672, "step": 7890, "train_runtime": 60976.8653, "train_tokens_per_second": 5658.026 }, { "epoch": 0.5315782386210611, "grad_norm": 0.768825896681359, "learning_rate": 8.356276162157613e-06, "loss": 0.3597188234329224, "num_input_tokens_seen": 345216360, "step": 7895, "train_runtime": 61021.9355, "train_tokens_per_second": 5657.25 }, { "epoch": 0.5319148936170213, "grad_norm": 0.711887791776799, "learning_rate": 8.354315829756696e-06, "loss": 0.37782256603240966, "num_input_tokens_seen": 345442968, "step": 7900, "train_runtime": 61056.926, "train_tokens_per_second": 5657.72 }, { "epoch": 0.5322515486129814, "grad_norm": 0.7271488313267995, "learning_rate": 8.352354559332053e-06, "loss": 0.36695542335510256, "num_input_tokens_seen": 345663248, "step": 7905, "train_runtime": 61093.5998, "train_tokens_per_second": 5657.929 }, { "epoch": 0.5325882036089415, "grad_norm": 0.7790624119649752, "learning_rate": 8.350392351432146e-06, "loss": 0.3877138376235962, "num_input_tokens_seen": 345877640, "step": 7910, "train_runtime": 61125.7433, "train_tokens_per_second": 5658.461 }, { "epoch": 0.5329248586049017, "grad_norm": 0.652480198172122, "learning_rate": 8.348429206605702e-06, "loss": 0.3623414754867554, "num_input_tokens_seen": 346113080, "step": 7915, "train_runtime": 61170.1897, "train_tokens_per_second": 5658.199 }, { "epoch": 0.5332615136008618, "grad_norm": 0.8166602948279773, "learning_rate": 8.346465125401706e-06, "loss": 0.41824941635131835, "num_input_tokens_seen": 346331632, "step": 7920, "train_runtime": 61213.7632, "train_tokens_per_second": 5657.741 }, { "epoch": 0.533598168596822, "grad_norm": 0.7338720699869766, "learning_rate": 8.344500108369412e-06, "loss": 0.3689335107803345, "num_input_tokens_seen": 346540104, "step": 7925, "train_runtime": 61254.7218, "train_tokens_per_second": 5657.361 }, { "epoch": 0.5339348235927821, "grad_norm": 0.7241659753104186, "learning_rate": 8.342534156058326e-06, "loss": 0.3848552942276001, "num_input_tokens_seen": 346759048, "step": 7930, "train_runtime": 61293.0183, "train_tokens_per_second": 5657.399 }, { "epoch": 0.5342714785887422, "grad_norm": 0.7284900345851684, "learning_rate": 8.34056726901822e-06, "loss": 0.39329664707183837, "num_input_tokens_seen": 346971992, "step": 7935, "train_runtime": 61333.9961, "train_tokens_per_second": 5657.091 }, { "epoch": 0.5346081335847024, "grad_norm": 0.9343840115025148, "learning_rate": 8.338599447799132e-06, "loss": 0.37961349487304685, "num_input_tokens_seen": 347176784, "step": 7940, "train_runtime": 61367.1004, "train_tokens_per_second": 5657.376 }, { "epoch": 0.5349447885806625, "grad_norm": 0.7650504516817562, "learning_rate": 8.336630692951353e-06, "loss": 0.3706023931503296, "num_input_tokens_seen": 347396336, "step": 7945, "train_runtime": 61405.4086, "train_tokens_per_second": 5657.422 }, { "epoch": 0.5352814435766227, "grad_norm": 0.7809182592661493, "learning_rate": 8.334661005025441e-06, "loss": 0.3996375560760498, "num_input_tokens_seen": 347612392, "step": 7950, "train_runtime": 61443.353, "train_tokens_per_second": 5657.445 }, { "epoch": 0.5356180985725828, "grad_norm": 1.0173782664960012, "learning_rate": 8.332690384572213e-06, "loss": 0.4039102077484131, "num_input_tokens_seen": 347827352, "step": 7955, "train_runtime": 61481.7721, "train_tokens_per_second": 5657.406 }, { "epoch": 0.5359547535685429, "grad_norm": 0.7319934278286511, "learning_rate": 8.330718832142746e-06, "loss": 0.3981315612792969, "num_input_tokens_seen": 348060432, "step": 7960, "train_runtime": 61520.2514, "train_tokens_per_second": 5657.656 }, { "epoch": 0.5362914085645031, "grad_norm": 0.6935185521555359, "learning_rate": 8.328746348288379e-06, "loss": 0.3804043769836426, "num_input_tokens_seen": 348266616, "step": 7965, "train_runtime": 61562.5177, "train_tokens_per_second": 5657.121 }, { "epoch": 0.5366280635604632, "grad_norm": 0.7663090177174399, "learning_rate": 8.32677293356071e-06, "loss": 0.42568235397338866, "num_input_tokens_seen": 348498272, "step": 7970, "train_runtime": 61598.1572, "train_tokens_per_second": 5657.609 }, { "epoch": 0.5369647185564234, "grad_norm": 0.8375018048980476, "learning_rate": 8.324798588511598e-06, "loss": 0.3702836275100708, "num_input_tokens_seen": 348696416, "step": 7975, "train_runtime": 61635.4226, "train_tokens_per_second": 5657.403 }, { "epoch": 0.5373013735523835, "grad_norm": 0.8187637529093583, "learning_rate": 8.322823313693162e-06, "loss": 0.38841800689697265, "num_input_tokens_seen": 348910592, "step": 7980, "train_runtime": 61671.4891, "train_tokens_per_second": 5657.567 }, { "epoch": 0.5376380285483436, "grad_norm": 0.7918621668094143, "learning_rate": 8.320847109657782e-06, "loss": 0.3783905506134033, "num_input_tokens_seen": 349120256, "step": 7985, "train_runtime": 61712.9559, "train_tokens_per_second": 5657.163 }, { "epoch": 0.5379746835443038, "grad_norm": 0.7362861473446518, "learning_rate": 8.318869976958099e-06, "loss": 0.3449576377868652, "num_input_tokens_seen": 349340688, "step": 7990, "train_runtime": 61755.9567, "train_tokens_per_second": 5656.793 }, { "epoch": 0.5383113385402639, "grad_norm": 0.7351144206496397, "learning_rate": 8.316891916147007e-06, "loss": 0.40518803596496583, "num_input_tokens_seen": 349557408, "step": 7995, "train_runtime": 61795.1163, "train_tokens_per_second": 5656.716 }, { "epoch": 0.5386479935362241, "grad_norm": 0.8155814621488839, "learning_rate": 8.314912927777671e-06, "loss": 0.3914914608001709, "num_input_tokens_seen": 349776936, "step": 8000, "train_runtime": 61829.5854, "train_tokens_per_second": 5657.113 }, { "epoch": 0.5389846485321842, "grad_norm": 0.7399640627157749, "learning_rate": 8.312933012403503e-06, "loss": 0.3830781698226929, "num_input_tokens_seen": 349981944, "step": 8005, "train_runtime": 61870.1471, "train_tokens_per_second": 5656.718 }, { "epoch": 0.5393213035281443, "grad_norm": 0.6837705266722391, "learning_rate": 8.310952170578184e-06, "loss": 0.3917949676513672, "num_input_tokens_seen": 350196560, "step": 8010, "train_runtime": 61910.9608, "train_tokens_per_second": 5656.455 }, { "epoch": 0.5396579585241045, "grad_norm": 0.8108035687999815, "learning_rate": 8.308970402855647e-06, "loss": 0.35423126220703127, "num_input_tokens_seen": 350407320, "step": 8015, "train_runtime": 61942.9362, "train_tokens_per_second": 5656.938 }, { "epoch": 0.5399946135200646, "grad_norm": 0.7391585249859578, "learning_rate": 8.306987709790087e-06, "loss": 0.36304192543029784, "num_input_tokens_seen": 350621920, "step": 8020, "train_runtime": 61974.5184, "train_tokens_per_second": 5657.517 }, { "epoch": 0.5403312685160248, "grad_norm": 0.8297400381885977, "learning_rate": 8.305004091935962e-06, "loss": 0.3827538013458252, "num_input_tokens_seen": 350840936, "step": 8025, "train_runtime": 62010.6476, "train_tokens_per_second": 5657.753 }, { "epoch": 0.5406679235119849, "grad_norm": 0.8790917583658322, "learning_rate": 8.303019549847979e-06, "loss": 0.40552120208740233, "num_input_tokens_seen": 351057864, "step": 8030, "train_runtime": 62051.8481, "train_tokens_per_second": 5657.492 }, { "epoch": 0.541004578507945, "grad_norm": 0.7794541942972262, "learning_rate": 8.301034084081114e-06, "loss": 0.38002500534057615, "num_input_tokens_seen": 351285720, "step": 8035, "train_runtime": 62090.6336, "train_tokens_per_second": 5657.628 }, { "epoch": 0.5413412335039052, "grad_norm": 0.8524170296510677, "learning_rate": 8.299047695190592e-06, "loss": 0.408983850479126, "num_input_tokens_seen": 351491576, "step": 8040, "train_runtime": 62127.0664, "train_tokens_per_second": 5657.624 }, { "epoch": 0.5416778884998653, "grad_norm": 0.8835316549178089, "learning_rate": 8.297060383731903e-06, "loss": 0.38953261375427245, "num_input_tokens_seen": 351706376, "step": 8045, "train_runtime": 62162.9599, "train_tokens_per_second": 5657.813 }, { "epoch": 0.5420145434958255, "grad_norm": 0.8130215721187897, "learning_rate": 8.29507215026079e-06, "loss": 0.3989473819732666, "num_input_tokens_seen": 351925296, "step": 8050, "train_runtime": 62194.3013, "train_tokens_per_second": 5658.481 }, { "epoch": 0.5423511984917856, "grad_norm": 0.7698865553206388, "learning_rate": 8.293082995333257e-06, "loss": 0.3805055618286133, "num_input_tokens_seen": 352152728, "step": 8055, "train_runtime": 62235.2959, "train_tokens_per_second": 5658.409 }, { "epoch": 0.5426878534877457, "grad_norm": 0.7925089143300325, "learning_rate": 8.291092919505568e-06, "loss": 0.359727144241333, "num_input_tokens_seen": 352368040, "step": 8060, "train_runtime": 62272.5239, "train_tokens_per_second": 5658.483 }, { "epoch": 0.5430245084837059, "grad_norm": 0.7473619474168591, "learning_rate": 8.289101923334237e-06, "loss": 0.3927903175354004, "num_input_tokens_seen": 352592456, "step": 8065, "train_runtime": 62314.1115, "train_tokens_per_second": 5658.308 }, { "epoch": 0.543361163479666, "grad_norm": 0.8359023777365873, "learning_rate": 8.28711000737604e-06, "loss": 0.37551441192626955, "num_input_tokens_seen": 352801680, "step": 8070, "train_runtime": 62352.2218, "train_tokens_per_second": 5658.205 }, { "epoch": 0.5436978184756261, "grad_norm": 0.8077808908921092, "learning_rate": 8.285117172188013e-06, "loss": 0.3938951253890991, "num_input_tokens_seen": 353025760, "step": 8075, "train_runtime": 62386.0037, "train_tokens_per_second": 5658.733 }, { "epoch": 0.5440344734715863, "grad_norm": 0.8228182913825491, "learning_rate": 8.283123418327443e-06, "loss": 0.4004195213317871, "num_input_tokens_seen": 353244352, "step": 8080, "train_runtime": 62419.1441, "train_tokens_per_second": 5659.231 }, { "epoch": 0.5443711284675464, "grad_norm": 0.693682105218099, "learning_rate": 8.281128746351878e-06, "loss": 0.3595161437988281, "num_input_tokens_seen": 353475168, "step": 8085, "train_runtime": 62453.3189, "train_tokens_per_second": 5659.83 }, { "epoch": 0.5447077834635066, "grad_norm": 0.7187659246186631, "learning_rate": 8.279133156819123e-06, "loss": 0.40300402641296384, "num_input_tokens_seen": 353691088, "step": 8090, "train_runtime": 62496.7209, "train_tokens_per_second": 5659.354 }, { "epoch": 0.5450444384594667, "grad_norm": 0.725512834705303, "learning_rate": 8.277136650287237e-06, "loss": 0.3694662570953369, "num_input_tokens_seen": 353917984, "step": 8095, "train_runtime": 62536.3526, "train_tokens_per_second": 5659.396 }, { "epoch": 0.5453810934554268, "grad_norm": 0.8301428582075541, "learning_rate": 8.275139227314537e-06, "loss": 0.3757363557815552, "num_input_tokens_seen": 354125952, "step": 8100, "train_runtime": 62575.4142, "train_tokens_per_second": 5659.187 }, { "epoch": 0.545717748451387, "grad_norm": 0.7999915594881919, "learning_rate": 8.273140888459594e-06, "loss": 0.4242837905883789, "num_input_tokens_seen": 354358280, "step": 8105, "train_runtime": 62606.4679, "train_tokens_per_second": 5660.091 }, { "epoch": 0.5460544034473471, "grad_norm": 0.9175431453565677, "learning_rate": 8.27114163428124e-06, "loss": 0.3934792518615723, "num_input_tokens_seen": 354575664, "step": 8110, "train_runtime": 62642.1464, "train_tokens_per_second": 5660.337 }, { "epoch": 0.5463910584433073, "grad_norm": 0.7408300214764466, "learning_rate": 8.26914146533856e-06, "loss": 0.38090806007385253, "num_input_tokens_seen": 354808384, "step": 8115, "train_runtime": 62681.8186, "train_tokens_per_second": 5660.467 }, { "epoch": 0.5467277134392674, "grad_norm": 0.7033405910036602, "learning_rate": 8.267140382190892e-06, "loss": 0.3828258037567139, "num_input_tokens_seen": 355026976, "step": 8120, "train_runtime": 62720.5013, "train_tokens_per_second": 5660.461 }, { "epoch": 0.5470643684352275, "grad_norm": 0.6635248689946966, "learning_rate": 8.265138385397835e-06, "loss": 0.3777566432952881, "num_input_tokens_seen": 355244064, "step": 8125, "train_runtime": 62758.0924, "train_tokens_per_second": 5660.53 }, { "epoch": 0.5474010234311877, "grad_norm": 0.6184317548675163, "learning_rate": 8.263135475519241e-06, "loss": 0.34886605739593507, "num_input_tokens_seen": 355483272, "step": 8130, "train_runtime": 62794.3565, "train_tokens_per_second": 5661.07 }, { "epoch": 0.5477376784271478, "grad_norm": 0.7287895081916465, "learning_rate": 8.261131653115216e-06, "loss": 0.42696261405944824, "num_input_tokens_seen": 355711240, "step": 8135, "train_runtime": 62834.333, "train_tokens_per_second": 5661.097 }, { "epoch": 0.548074333423108, "grad_norm": 0.7794435545394348, "learning_rate": 8.259126918746122e-06, "loss": 0.36356501579284667, "num_input_tokens_seen": 355930576, "step": 8140, "train_runtime": 62868.698, "train_tokens_per_second": 5661.491 }, { "epoch": 0.5484109884190681, "grad_norm": 0.6736849599162793, "learning_rate": 8.25712127297258e-06, "loss": 0.3778836250305176, "num_input_tokens_seen": 356150816, "step": 8145, "train_runtime": 62904.5449, "train_tokens_per_second": 5661.766 }, { "epoch": 0.5487476434150282, "grad_norm": 0.7082862793695406, "learning_rate": 8.255114716355459e-06, "loss": 0.4094264507293701, "num_input_tokens_seen": 356382088, "step": 8150, "train_runtime": 62942.0397, "train_tokens_per_second": 5662.068 }, { "epoch": 0.5490842984109884, "grad_norm": 0.6051005207909932, "learning_rate": 8.253107249455887e-06, "loss": 0.3917287826538086, "num_input_tokens_seen": 356602352, "step": 8155, "train_runtime": 62975.3252, "train_tokens_per_second": 5662.573 }, { "epoch": 0.5494209534069485, "grad_norm": 0.7713641151309204, "learning_rate": 8.251098872835247e-06, "loss": 0.39372997283935546, "num_input_tokens_seen": 356825280, "step": 8160, "train_runtime": 63017.9451, "train_tokens_per_second": 5662.28 }, { "epoch": 0.5497576084029087, "grad_norm": 0.6787537110984104, "learning_rate": 8.249089587055175e-06, "loss": 0.3526461601257324, "num_input_tokens_seen": 357037664, "step": 8165, "train_runtime": 63059.5973, "train_tokens_per_second": 5661.908 }, { "epoch": 0.5500942633988688, "grad_norm": 0.6748882087262432, "learning_rate": 8.247079392677558e-06, "loss": 0.3740200996398926, "num_input_tokens_seen": 357257424, "step": 8170, "train_runtime": 63101.2168, "train_tokens_per_second": 5661.657 }, { "epoch": 0.5504309183948289, "grad_norm": 0.7274044025423265, "learning_rate": 8.245068290264544e-06, "loss": 0.3697060108184814, "num_input_tokens_seen": 357480144, "step": 8175, "train_runtime": 63140.8867, "train_tokens_per_second": 5661.627 }, { "epoch": 0.5507675733907891, "grad_norm": 0.7084601443387462, "learning_rate": 8.243056280378531e-06, "loss": 0.37436251640319823, "num_input_tokens_seen": 357699472, "step": 8180, "train_runtime": 63181.8065, "train_tokens_per_second": 5661.432 }, { "epoch": 0.5511042283867492, "grad_norm": 0.7481357333059493, "learning_rate": 8.241043363582171e-06, "loss": 0.36437788009643557, "num_input_tokens_seen": 357926808, "step": 8185, "train_runtime": 63218.2393, "train_tokens_per_second": 5661.765 }, { "epoch": 0.5514408833827094, "grad_norm": 1.0989196799559033, "learning_rate": 8.239029540438369e-06, "loss": 0.3505790948867798, "num_input_tokens_seen": 358145064, "step": 8190, "train_runtime": 63257.3639, "train_tokens_per_second": 5661.713 }, { "epoch": 0.5517775383786695, "grad_norm": 0.7305407817056846, "learning_rate": 8.237014811510284e-06, "loss": 0.3656752109527588, "num_input_tokens_seen": 358369824, "step": 8195, "train_runtime": 63304.7711, "train_tokens_per_second": 5661.024 }, { "epoch": 0.5521141933746296, "grad_norm": 0.6472079948654392, "learning_rate": 8.234999177361329e-06, "loss": 0.3714550018310547, "num_input_tokens_seen": 358596784, "step": 8200, "train_runtime": 63340.7687, "train_tokens_per_second": 5661.39 }, { "epoch": 0.5524508483705898, "grad_norm": 0.7398046092203671, "learning_rate": 8.232982638555169e-06, "loss": 0.40174274444580077, "num_input_tokens_seen": 358820312, "step": 8205, "train_runtime": 63372.9424, "train_tokens_per_second": 5662.043 }, { "epoch": 0.5527875033665499, "grad_norm": 0.7062238114257713, "learning_rate": 8.230965195655724e-06, "loss": 0.39043726921081545, "num_input_tokens_seen": 359055496, "step": 8210, "train_runtime": 63412.4919, "train_tokens_per_second": 5662.22 }, { "epoch": 0.55312415836251, "grad_norm": 0.8164987537109517, "learning_rate": 8.228946849227167e-06, "loss": 0.3990142345428467, "num_input_tokens_seen": 359287376, "step": 8215, "train_runtime": 63449.3085, "train_tokens_per_second": 5662.589 }, { "epoch": 0.5534608133584702, "grad_norm": 0.6938755136640083, "learning_rate": 8.226927599833916e-06, "loss": 0.386507511138916, "num_input_tokens_seen": 359514576, "step": 8220, "train_runtime": 63481.4052, "train_tokens_per_second": 5663.305 }, { "epoch": 0.5537974683544303, "grad_norm": 0.6819170611796698, "learning_rate": 8.224907448040655e-06, "loss": 0.37993340492248534, "num_input_tokens_seen": 359745160, "step": 8225, "train_runtime": 63513.0016, "train_tokens_per_second": 5664.118 }, { "epoch": 0.5541341233503905, "grad_norm": 0.7464665475450891, "learning_rate": 8.222886394412309e-06, "loss": 0.4058523178100586, "num_input_tokens_seen": 359965008, "step": 8230, "train_runtime": 63553.6566, "train_tokens_per_second": 5663.954 }, { "epoch": 0.5544707783463506, "grad_norm": 0.6722302273522195, "learning_rate": 8.220864439514057e-06, "loss": 0.384306526184082, "num_input_tokens_seen": 360194040, "step": 8235, "train_runtime": 63592.1988, "train_tokens_per_second": 5664.123 }, { "epoch": 0.5548074333423108, "grad_norm": 0.6641141478245969, "learning_rate": 8.218841583911338e-06, "loss": 0.3680997848510742, "num_input_tokens_seen": 360409248, "step": 8240, "train_runtime": 63634.667, "train_tokens_per_second": 5663.725 }, { "epoch": 0.5551440883382709, "grad_norm": 0.7528778151335748, "learning_rate": 8.216817828169834e-06, "loss": 0.413088321685791, "num_input_tokens_seen": 360624480, "step": 8245, "train_runtime": 63670.5285, "train_tokens_per_second": 5663.915 }, { "epoch": 0.555480743334231, "grad_norm": 0.8364309542706772, "learning_rate": 8.214793172855481e-06, "loss": 0.36465370655059814, "num_input_tokens_seen": 360837048, "step": 8250, "train_runtime": 63711.1159, "train_tokens_per_second": 5663.644 }, { "epoch": 0.5558173983301912, "grad_norm": 0.6793083765205596, "learning_rate": 8.21276761853447e-06, "loss": 0.36249728202819825, "num_input_tokens_seen": 361060272, "step": 8255, "train_runtime": 63754.6776, "train_tokens_per_second": 5663.275 }, { "epoch": 0.5561540533261513, "grad_norm": 0.8280046723618791, "learning_rate": 8.210741165773238e-06, "loss": 0.39040985107421877, "num_input_tokens_seen": 361294192, "step": 8260, "train_runtime": 63785.4799, "train_tokens_per_second": 5664.207 }, { "epoch": 0.5564907083221114, "grad_norm": 0.7577410939409384, "learning_rate": 8.208713815138476e-06, "loss": 0.36567642688751223, "num_input_tokens_seen": 361524240, "step": 8265, "train_runtime": 63826.3741, "train_tokens_per_second": 5664.183 }, { "epoch": 0.5568273633180716, "grad_norm": 0.6700074247940968, "learning_rate": 8.20668556719713e-06, "loss": 0.35714569091796877, "num_input_tokens_seen": 361732392, "step": 8270, "train_runtime": 63860.1654, "train_tokens_per_second": 5664.445 }, { "epoch": 0.5571640183140317, "grad_norm": 0.7602580503776288, "learning_rate": 8.204656422516388e-06, "loss": 0.3372737646102905, "num_input_tokens_seen": 361946008, "step": 8275, "train_runtime": 63901.2504, "train_tokens_per_second": 5664.146 }, { "epoch": 0.5575006733099919, "grad_norm": 0.8510184000147942, "learning_rate": 8.2026263816637e-06, "loss": 0.38366384506225587, "num_input_tokens_seen": 362152248, "step": 8280, "train_runtime": 63938.3717, "train_tokens_per_second": 5664.083 }, { "epoch": 0.557837328305952, "grad_norm": 0.7613111925807169, "learning_rate": 8.200595445206753e-06, "loss": 0.37342875003814696, "num_input_tokens_seen": 362371096, "step": 8285, "train_runtime": 63979.792, "train_tokens_per_second": 5663.837 }, { "epoch": 0.5581739833019121, "grad_norm": 1.256734854809266, "learning_rate": 8.198563613713497e-06, "loss": 0.37401297092437746, "num_input_tokens_seen": 362579576, "step": 8290, "train_runtime": 64020.2056, "train_tokens_per_second": 5663.518 }, { "epoch": 0.5585106382978723, "grad_norm": 0.7385210193529426, "learning_rate": 8.196530887752127e-06, "loss": 0.3654287338256836, "num_input_tokens_seen": 362803720, "step": 8295, "train_runtime": 64054.0322, "train_tokens_per_second": 5664.026 }, { "epoch": 0.5588472932938324, "grad_norm": 0.8102882370091832, "learning_rate": 8.194497267891086e-06, "loss": 0.37125024795532224, "num_input_tokens_seen": 363027432, "step": 8300, "train_runtime": 64092.3585, "train_tokens_per_second": 5664.13 }, { "epoch": 0.5591839482897926, "grad_norm": 0.7432402409233543, "learning_rate": 8.19246275469907e-06, "loss": 0.3796513795852661, "num_input_tokens_seen": 363254432, "step": 8305, "train_runtime": 64136.3098, "train_tokens_per_second": 5663.788 }, { "epoch": 0.5595206032857528, "grad_norm": 0.6849455308836975, "learning_rate": 8.190427348745027e-06, "loss": 0.36992511749267576, "num_input_tokens_seen": 363479976, "step": 8310, "train_runtime": 64171.4185, "train_tokens_per_second": 5664.204 }, { "epoch": 0.559857258281713, "grad_norm": 0.6998379838638995, "learning_rate": 8.188391050598146e-06, "loss": 0.3632178544998169, "num_input_tokens_seen": 363712504, "step": 8315, "train_runtime": 64216.5044, "train_tokens_per_second": 5663.848 }, { "epoch": 0.5601939132776731, "grad_norm": 0.7737605990707936, "learning_rate": 8.186353860827878e-06, "loss": 0.37043955326080324, "num_input_tokens_seen": 363919784, "step": 8320, "train_runtime": 64256.872, "train_tokens_per_second": 5663.515 }, { "epoch": 0.5605305682736332, "grad_norm": 0.6957700417795362, "learning_rate": 8.184315780003911e-06, "loss": 0.3709959745407104, "num_input_tokens_seen": 364140736, "step": 8325, "train_runtime": 64302.6454, "train_tokens_per_second": 5662.92 }, { "epoch": 0.5608672232695934, "grad_norm": 0.64141155335251, "learning_rate": 8.182276808696193e-06, "loss": 0.40601282119750975, "num_input_tokens_seen": 364348280, "step": 8330, "train_runtime": 64347.1042, "train_tokens_per_second": 5662.233 }, { "epoch": 0.5612038782655535, "grad_norm": 0.6158998839242338, "learning_rate": 8.18023694747491e-06, "loss": 0.3827899694442749, "num_input_tokens_seen": 364574968, "step": 8335, "train_runtime": 64381.872, "train_tokens_per_second": 5662.696 }, { "epoch": 0.5615405332615137, "grad_norm": 0.7883261214385181, "learning_rate": 8.178196196910508e-06, "loss": 0.3656409740447998, "num_input_tokens_seen": 364803736, "step": 8340, "train_runtime": 64421.7397, "train_tokens_per_second": 5662.743 }, { "epoch": 0.5618771882574738, "grad_norm": 0.7366395620437122, "learning_rate": 8.176154557573672e-06, "loss": 0.4000543594360352, "num_input_tokens_seen": 365037240, "step": 8345, "train_runtime": 64459.3416, "train_tokens_per_second": 5663.062 }, { "epoch": 0.5622138432534339, "grad_norm": 0.6985009938577207, "learning_rate": 8.174112030035344e-06, "loss": 0.3629467010498047, "num_input_tokens_seen": 365268200, "step": 8350, "train_runtime": 64493.078, "train_tokens_per_second": 5663.681 }, { "epoch": 0.5625504982493941, "grad_norm": 0.7274783538197038, "learning_rate": 8.172068614866707e-06, "loss": 0.36340205669403075, "num_input_tokens_seen": 365477184, "step": 8355, "train_runtime": 64531.8006, "train_tokens_per_second": 5663.521 }, { "epoch": 0.5628871532453542, "grad_norm": 0.7368665647506253, "learning_rate": 8.170024312639197e-06, "loss": 0.39545679092407227, "num_input_tokens_seen": 365707680, "step": 8360, "train_runtime": 64570.9604, "train_tokens_per_second": 5663.656 }, { "epoch": 0.5632238082413143, "grad_norm": 0.7340645583889084, "learning_rate": 8.167979123924496e-06, "loss": 0.3859426498413086, "num_input_tokens_seen": 365930048, "step": 8365, "train_runtime": 64604.6699, "train_tokens_per_second": 5664.142 }, { "epoch": 0.5635604632372745, "grad_norm": 0.7462104536621238, "learning_rate": 8.165933049294537e-06, "loss": 0.4087996482849121, "num_input_tokens_seen": 366147352, "step": 8370, "train_runtime": 64646.3443, "train_tokens_per_second": 5663.852 }, { "epoch": 0.5638971182332346, "grad_norm": 0.7582565637830365, "learning_rate": 8.163886089321493e-06, "loss": 0.37345223426818847, "num_input_tokens_seen": 366377160, "step": 8375, "train_runtime": 64688.6158, "train_tokens_per_second": 5663.704 }, { "epoch": 0.5642337732291948, "grad_norm": 0.6581884199846296, "learning_rate": 8.161838244577795e-06, "loss": 0.3573953151702881, "num_input_tokens_seen": 366596264, "step": 8380, "train_runtime": 64726.1749, "train_tokens_per_second": 5663.802 }, { "epoch": 0.5645704282251549, "grad_norm": 0.7540331450420041, "learning_rate": 8.159789515636114e-06, "loss": 0.3621669769287109, "num_input_tokens_seen": 366814672, "step": 8385, "train_runtime": 64768.6142, "train_tokens_per_second": 5663.463 }, { "epoch": 0.564907083221115, "grad_norm": 0.7846236965599341, "learning_rate": 8.15773990306937e-06, "loss": 0.39387807846069334, "num_input_tokens_seen": 367010840, "step": 8390, "train_runtime": 64803.6605, "train_tokens_per_second": 5663.428 }, { "epoch": 0.5652437382170752, "grad_norm": 0.8105957793723372, "learning_rate": 8.155689407450732e-06, "loss": 0.37447366714477537, "num_input_tokens_seen": 367235664, "step": 8395, "train_runtime": 64840.3814, "train_tokens_per_second": 5663.688 }, { "epoch": 0.5655803932130353, "grad_norm": 0.7593251086886306, "learning_rate": 8.153638029353615e-06, "loss": 0.3721097707748413, "num_input_tokens_seen": 367439472, "step": 8400, "train_runtime": 64880.3333, "train_tokens_per_second": 5663.341 }, { "epoch": 0.5659170482089955, "grad_norm": 0.7080065499934168, "learning_rate": 8.151585769351678e-06, "loss": 0.416213321685791, "num_input_tokens_seen": 367665000, "step": 8405, "train_runtime": 64915.8566, "train_tokens_per_second": 5663.716 }, { "epoch": 0.5662537032049556, "grad_norm": 0.8290526825274906, "learning_rate": 8.149532628018833e-06, "loss": 0.3906120538711548, "num_input_tokens_seen": 367873544, "step": 8410, "train_runtime": 64954.7801, "train_tokens_per_second": 5663.533 }, { "epoch": 0.5665903582009157, "grad_norm": 0.7887226131302195, "learning_rate": 8.147478605929228e-06, "loss": 0.36734464168548586, "num_input_tokens_seen": 368106424, "step": 8415, "train_runtime": 64988.7811, "train_tokens_per_second": 5664.153 }, { "epoch": 0.5669270131968759, "grad_norm": 0.7105615187211392, "learning_rate": 8.145423703657269e-06, "loss": 0.3696259021759033, "num_input_tokens_seen": 368329816, "step": 8420, "train_runtime": 65035.2437, "train_tokens_per_second": 5663.542 }, { "epoch": 0.567263668192836, "grad_norm": 0.7106675383557719, "learning_rate": 8.143367921777601e-06, "loss": 0.3901944637298584, "num_input_tokens_seen": 368556080, "step": 8425, "train_runtime": 65073.1284, "train_tokens_per_second": 5663.722 }, { "epoch": 0.5676003231887962, "grad_norm": 0.7158037922920018, "learning_rate": 8.141311260865117e-06, "loss": 0.42763843536376955, "num_input_tokens_seen": 368786216, "step": 8430, "train_runtime": 65107.0411, "train_tokens_per_second": 5664.306 }, { "epoch": 0.5679369781847563, "grad_norm": 0.7147505710629092, "learning_rate": 8.139253721494956e-06, "loss": 0.4124480724334717, "num_input_tokens_seen": 368998320, "step": 8435, "train_runtime": 65143.6774, "train_tokens_per_second": 5664.377 }, { "epoch": 0.5682736331807164, "grad_norm": 0.690454346302624, "learning_rate": 8.137195304242502e-06, "loss": 0.3694611549377441, "num_input_tokens_seen": 369221808, "step": 8440, "train_runtime": 65180.1258, "train_tokens_per_second": 5664.638 }, { "epoch": 0.5686102881766766, "grad_norm": 0.6647768706585024, "learning_rate": 8.135136009683387e-06, "loss": 0.3659370899200439, "num_input_tokens_seen": 369439952, "step": 8445, "train_runtime": 65214.1207, "train_tokens_per_second": 5665.03 }, { "epoch": 0.5689469431726367, "grad_norm": 0.7123577020124194, "learning_rate": 8.13307583839348e-06, "loss": 0.37821600437164304, "num_input_tokens_seen": 369665384, "step": 8450, "train_runtime": 65253.9634, "train_tokens_per_second": 5665.026 }, { "epoch": 0.5692835981685969, "grad_norm": 0.7080847091486382, "learning_rate": 8.131014790948908e-06, "loss": 0.3932258367538452, "num_input_tokens_seen": 369885352, "step": 8455, "train_runtime": 65292.5756, "train_tokens_per_second": 5665.045 }, { "epoch": 0.569620253164557, "grad_norm": 0.8175401785926597, "learning_rate": 8.128952867926035e-06, "loss": 0.42728986740112307, "num_input_tokens_seen": 370102168, "step": 8460, "train_runtime": 65326.5467, "train_tokens_per_second": 5665.418 }, { "epoch": 0.5699569081605171, "grad_norm": 0.7636022480938197, "learning_rate": 8.126890069901468e-06, "loss": 0.3966690540313721, "num_input_tokens_seen": 370323328, "step": 8465, "train_runtime": 65365.5452, "train_tokens_per_second": 5665.421 }, { "epoch": 0.5702935631564773, "grad_norm": 0.8306888968108936, "learning_rate": 8.124826397452064e-06, "loss": 0.3729779005050659, "num_input_tokens_seen": 370551792, "step": 8470, "train_runtime": 65403.3941, "train_tokens_per_second": 5665.636 }, { "epoch": 0.5706302181524374, "grad_norm": 0.6975418197600278, "learning_rate": 8.122761851154923e-06, "loss": 0.37224202156066893, "num_input_tokens_seen": 370769584, "step": 8475, "train_runtime": 65437.1957, "train_tokens_per_second": 5666.037 }, { "epoch": 0.5709668731483976, "grad_norm": 0.7691847068239698, "learning_rate": 8.120696431587387e-06, "loss": 0.3793643474578857, "num_input_tokens_seen": 370986856, "step": 8480, "train_runtime": 65477.4237, "train_tokens_per_second": 5665.874 }, { "epoch": 0.5713035281443577, "grad_norm": 0.653136501814857, "learning_rate": 8.118630139327046e-06, "loss": 0.36144418716430665, "num_input_tokens_seen": 371203736, "step": 8485, "train_runtime": 65520.6447, "train_tokens_per_second": 5665.447 }, { "epoch": 0.5716401831403178, "grad_norm": 0.6688068417437787, "learning_rate": 8.116562974951731e-06, "loss": 0.3969851016998291, "num_input_tokens_seen": 371433168, "step": 8490, "train_runtime": 65562.0835, "train_tokens_per_second": 5665.366 }, { "epoch": 0.571976838136278, "grad_norm": 0.6693856135821081, "learning_rate": 8.11449493903952e-06, "loss": 0.37904407978057864, "num_input_tokens_seen": 371661928, "step": 8495, "train_runtime": 65600.9804, "train_tokens_per_second": 5665.494 }, { "epoch": 0.5723134931322381, "grad_norm": 0.6989787293355911, "learning_rate": 8.112426032168727e-06, "loss": 0.39436898231506345, "num_input_tokens_seen": 371877904, "step": 8500, "train_runtime": 65639.9628, "train_tokens_per_second": 5665.419 }, { "epoch": 0.5726501481281983, "grad_norm": 0.6921966447452655, "learning_rate": 8.11035625491792e-06, "loss": 0.35653374195098875, "num_input_tokens_seen": 372083344, "step": 8505, "train_runtime": 65673.4132, "train_tokens_per_second": 5665.662 }, { "epoch": 0.5729868031241584, "grad_norm": 0.7863535213377899, "learning_rate": 8.108285607865907e-06, "loss": 0.3748607158660889, "num_input_tokens_seen": 372296008, "step": 8510, "train_runtime": 65709.8413, "train_tokens_per_second": 5665.757 }, { "epoch": 0.5733234581201185, "grad_norm": 0.7103469377120155, "learning_rate": 8.106214091591731e-06, "loss": 0.36768136024475095, "num_input_tokens_seen": 372517376, "step": 8515, "train_runtime": 65747.0301, "train_tokens_per_second": 5665.919 }, { "epoch": 0.5736601131160787, "grad_norm": 0.8043097859632866, "learning_rate": 8.104141706674693e-06, "loss": 0.3505872249603271, "num_input_tokens_seen": 372744072, "step": 8520, "train_runtime": 65786.4844, "train_tokens_per_second": 5665.967 }, { "epoch": 0.5739967681120388, "grad_norm": 0.7899542715564848, "learning_rate": 8.102068453694324e-06, "loss": 0.39815869331359866, "num_input_tokens_seen": 372965496, "step": 8525, "train_runtime": 65827.1156, "train_tokens_per_second": 5665.834 }, { "epoch": 0.574333423107999, "grad_norm": 0.7007321773126729, "learning_rate": 8.099994333230404e-06, "loss": 0.39165263175964354, "num_input_tokens_seen": 373176000, "step": 8530, "train_runtime": 65869.8446, "train_tokens_per_second": 5665.354 }, { "epoch": 0.5746700781039591, "grad_norm": 0.8059453918533225, "learning_rate": 8.097919345862952e-06, "loss": 0.387595534324646, "num_input_tokens_seen": 373375616, "step": 8535, "train_runtime": 65901.6062, "train_tokens_per_second": 5665.653 }, { "epoch": 0.5750067330999192, "grad_norm": 0.7748964359890478, "learning_rate": 8.095843492172235e-06, "loss": 0.3876967906951904, "num_input_tokens_seen": 373591328, "step": 8540, "train_runtime": 65941.7008, "train_tokens_per_second": 5665.479 }, { "epoch": 0.5753433880958794, "grad_norm": 0.773534060871464, "learning_rate": 8.093766772738758e-06, "loss": 0.3301082611083984, "num_input_tokens_seen": 373805712, "step": 8545, "train_runtime": 65984.3171, "train_tokens_per_second": 5665.069 }, { "epoch": 0.5756800430918395, "grad_norm": 0.7746351168910522, "learning_rate": 8.091689188143267e-06, "loss": 0.3910914659500122, "num_input_tokens_seen": 374017824, "step": 8550, "train_runtime": 66030.3105, "train_tokens_per_second": 5664.335 }, { "epoch": 0.5760166980877997, "grad_norm": 0.7771670247365485, "learning_rate": 8.089610738966754e-06, "loss": 0.3839992046356201, "num_input_tokens_seen": 374221088, "step": 8555, "train_runtime": 66067.2485, "train_tokens_per_second": 5664.245 }, { "epoch": 0.5763533530837598, "grad_norm": 0.8314883209793272, "learning_rate": 8.08753142579045e-06, "loss": 0.41312179565429685, "num_input_tokens_seen": 374438784, "step": 8560, "train_runtime": 66103.0863, "train_tokens_per_second": 5664.468 }, { "epoch": 0.5766900080797199, "grad_norm": 0.7070329659969831, "learning_rate": 8.085451249195828e-06, "loss": 0.369646692276001, "num_input_tokens_seen": 374674400, "step": 8565, "train_runtime": 66144.5198, "train_tokens_per_second": 5664.481 }, { "epoch": 0.5770266630756801, "grad_norm": 0.728101829102978, "learning_rate": 8.083370209764603e-06, "loss": 0.38304858207702636, "num_input_tokens_seen": 374895048, "step": 8570, "train_runtime": 66187.4516, "train_tokens_per_second": 5664.141 }, { "epoch": 0.5773633180716402, "grad_norm": 0.7613212980235913, "learning_rate": 8.081288308078731e-06, "loss": 0.39395363330841066, "num_input_tokens_seen": 375130432, "step": 8575, "train_runtime": 66220.5986, "train_tokens_per_second": 5664.86 }, { "epoch": 0.5776999730676003, "grad_norm": 0.6846318822730251, "learning_rate": 8.07920554472041e-06, "loss": 0.35710582733154295, "num_input_tokens_seen": 375356416, "step": 8580, "train_runtime": 66266.8733, "train_tokens_per_second": 5664.315 }, { "epoch": 0.5780366280635605, "grad_norm": 0.791144672174043, "learning_rate": 8.077121920272075e-06, "loss": 0.3807799816131592, "num_input_tokens_seen": 375586768, "step": 8585, "train_runtime": 66303.4383, "train_tokens_per_second": 5664.665 }, { "epoch": 0.5783732830595206, "grad_norm": 0.6749521518269885, "learning_rate": 8.07503743531641e-06, "loss": 0.3493949890136719, "num_input_tokens_seen": 375796816, "step": 8590, "train_runtime": 66347.6746, "train_tokens_per_second": 5664.054 }, { "epoch": 0.5787099380554808, "grad_norm": 0.7233256642537537, "learning_rate": 8.072952090436328e-06, "loss": 0.34188032150268555, "num_input_tokens_seen": 376025856, "step": 8595, "train_runtime": 66379.0077, "train_tokens_per_second": 5664.831 }, { "epoch": 0.5790465930514409, "grad_norm": 0.8183957573318358, "learning_rate": 8.070865886214996e-06, "loss": 0.378603458404541, "num_input_tokens_seen": 376248416, "step": 8600, "train_runtime": 66412.9945, "train_tokens_per_second": 5665.283 }, { "epoch": 0.579383248047401, "grad_norm": 0.8303736324901154, "learning_rate": 8.06877882323581e-06, "loss": 0.3776103496551514, "num_input_tokens_seen": 376468952, "step": 8605, "train_runtime": 66445.0637, "train_tokens_per_second": 5665.868 }, { "epoch": 0.5797199030433612, "grad_norm": 0.6628257697173621, "learning_rate": 8.066690902082413e-06, "loss": 0.35461578369140623, "num_input_tokens_seen": 376690720, "step": 8610, "train_runtime": 66482.3424, "train_tokens_per_second": 5666.027 }, { "epoch": 0.5800565580393213, "grad_norm": 0.6914119662414026, "learning_rate": 8.064602123338683e-06, "loss": 0.4189821720123291, "num_input_tokens_seen": 376926952, "step": 8615, "train_runtime": 66523.5883, "train_tokens_per_second": 5666.065 }, { "epoch": 0.5803932130352815, "grad_norm": 0.7255952843828343, "learning_rate": 8.06251248758874e-06, "loss": 0.3706305980682373, "num_input_tokens_seen": 377137424, "step": 8620, "train_runtime": 66560.9464, "train_tokens_per_second": 5666.047 }, { "epoch": 0.5807298680312416, "grad_norm": 0.7888860114164491, "learning_rate": 8.060421995416949e-06, "loss": 0.4162487030029297, "num_input_tokens_seen": 377341792, "step": 8625, "train_runtime": 66601.9228, "train_tokens_per_second": 5665.629 }, { "epoch": 0.5810665230272017, "grad_norm": 0.8097744521376653, "learning_rate": 8.058330647407904e-06, "loss": 0.3742199420928955, "num_input_tokens_seen": 377553480, "step": 8630, "train_runtime": 66640.7232, "train_tokens_per_second": 5665.507 }, { "epoch": 0.5814031780231619, "grad_norm": 0.9311380768738048, "learning_rate": 8.056238444146445e-06, "loss": 0.4032620429992676, "num_input_tokens_seen": 377768576, "step": 8635, "train_runtime": 66676.5105, "train_tokens_per_second": 5665.692 }, { "epoch": 0.581739833019122, "grad_norm": 0.7908376307807878, "learning_rate": 8.054145386217652e-06, "loss": 0.35233349800109864, "num_input_tokens_seen": 377990912, "step": 8640, "train_runtime": 66709.357, "train_tokens_per_second": 5666.235 }, { "epoch": 0.5820764880150822, "grad_norm": 0.7544609324314604, "learning_rate": 8.05205147420684e-06, "loss": 0.36639404296875, "num_input_tokens_seen": 378205832, "step": 8645, "train_runtime": 66742.4566, "train_tokens_per_second": 5666.645 }, { "epoch": 0.5824131430110423, "grad_norm": 0.8852523330609511, "learning_rate": 8.049956708699567e-06, "loss": 0.41215500831604, "num_input_tokens_seen": 378422632, "step": 8650, "train_runtime": 66779.3643, "train_tokens_per_second": 5666.76 }, { "epoch": 0.5827497980070024, "grad_norm": 0.7748134898838014, "learning_rate": 8.047861090281623e-06, "loss": 0.4017993450164795, "num_input_tokens_seen": 378636312, "step": 8655, "train_runtime": 66817.0207, "train_tokens_per_second": 5666.764 }, { "epoch": 0.5830864530029626, "grad_norm": 0.7174936151093502, "learning_rate": 8.045764619539047e-06, "loss": 0.36281633377075195, "num_input_tokens_seen": 378862480, "step": 8660, "train_runtime": 66859.5287, "train_tokens_per_second": 5666.544 }, { "epoch": 0.5834231079989227, "grad_norm": 0.7177129776779663, "learning_rate": 8.043667297058106e-06, "loss": 0.3568310022354126, "num_input_tokens_seen": 379073648, "step": 8665, "train_runtime": 66894.7683, "train_tokens_per_second": 5666.716 }, { "epoch": 0.5837597629948829, "grad_norm": 0.671557492383721, "learning_rate": 8.04156912342531e-06, "loss": 0.3924489259719849, "num_input_tokens_seen": 379296048, "step": 8670, "train_runtime": 66930.6354, "train_tokens_per_second": 5667.002 }, { "epoch": 0.584096417990843, "grad_norm": 0.8338696138817213, "learning_rate": 8.03947009922741e-06, "loss": 0.3730125904083252, "num_input_tokens_seen": 379514216, "step": 8675, "train_runtime": 66971.0506, "train_tokens_per_second": 5666.84 }, { "epoch": 0.5844330729868031, "grad_norm": 0.8046977070640711, "learning_rate": 8.037370225051387e-06, "loss": 0.4212483406066895, "num_input_tokens_seen": 379726496, "step": 8680, "train_runtime": 67011.5775, "train_tokens_per_second": 5666.58 }, { "epoch": 0.5847697279827633, "grad_norm": 0.747137316814288, "learning_rate": 8.035269501484467e-06, "loss": 0.3820772886276245, "num_input_tokens_seen": 379952664, "step": 8685, "train_runtime": 67045.976, "train_tokens_per_second": 5667.047 }, { "epoch": 0.5851063829787234, "grad_norm": 0.7779439978184742, "learning_rate": 8.03316792911411e-06, "loss": 0.41135897636413576, "num_input_tokens_seen": 380168720, "step": 8690, "train_runtime": 67086.3352, "train_tokens_per_second": 5666.858 }, { "epoch": 0.5854430379746836, "grad_norm": 0.6815474179189787, "learning_rate": 8.031065508528011e-06, "loss": 0.35835254192352295, "num_input_tokens_seen": 380396160, "step": 8695, "train_runtime": 67124.515, "train_tokens_per_second": 5667.023 }, { "epoch": 0.5857796929706437, "grad_norm": 0.7133086557979279, "learning_rate": 8.028962240314111e-06, "loss": 0.3686984539031982, "num_input_tokens_seen": 380620472, "step": 8700, "train_runtime": 67161.6095, "train_tokens_per_second": 5667.233 }, { "epoch": 0.5861163479666038, "grad_norm": 0.7088226284029326, "learning_rate": 8.026858125060577e-06, "loss": 0.3879531383514404, "num_input_tokens_seen": 380837592, "step": 8705, "train_runtime": 67201.0534, "train_tokens_per_second": 5667.137 }, { "epoch": 0.586453002962564, "grad_norm": 0.7612804968151702, "learning_rate": 8.024753163355821e-06, "loss": 0.4247321128845215, "num_input_tokens_seen": 381061216, "step": 8710, "train_runtime": 67242.9084, "train_tokens_per_second": 5666.935 }, { "epoch": 0.5867896579585241, "grad_norm": 0.7005358220776335, "learning_rate": 8.022647355788489e-06, "loss": 0.3679481029510498, "num_input_tokens_seen": 381280288, "step": 8715, "train_runtime": 67281.4067, "train_tokens_per_second": 5666.949 }, { "epoch": 0.5871263129544843, "grad_norm": 0.728044784671465, "learning_rate": 8.02054070294746e-06, "loss": 0.40247626304626466, "num_input_tokens_seen": 381496992, "step": 8720, "train_runtime": 67319.4589, "train_tokens_per_second": 5666.965 }, { "epoch": 0.5874629679504444, "grad_norm": 0.7052792472604399, "learning_rate": 8.018433205421859e-06, "loss": 0.36869523525238035, "num_input_tokens_seen": 381727008, "step": 8725, "train_runtime": 67359.8794, "train_tokens_per_second": 5666.979 }, { "epoch": 0.5877996229464045, "grad_norm": 0.8148613184034657, "learning_rate": 8.016324863801036e-06, "loss": 0.3896385669708252, "num_input_tokens_seen": 381950608, "step": 8730, "train_runtime": 67395.2795, "train_tokens_per_second": 5667.32 }, { "epoch": 0.5881362779423647, "grad_norm": 0.7008873936428064, "learning_rate": 8.014215678674581e-06, "loss": 0.397304368019104, "num_input_tokens_seen": 382173664, "step": 8735, "train_runtime": 67436.6612, "train_tokens_per_second": 5667.15 }, { "epoch": 0.5884729329383248, "grad_norm": 0.6667026328000061, "learning_rate": 8.012105650632325e-06, "loss": 0.37210235595703123, "num_input_tokens_seen": 382388568, "step": 8740, "train_runtime": 67476.723, "train_tokens_per_second": 5666.97 }, { "epoch": 0.588809587934285, "grad_norm": 0.7893753618716253, "learning_rate": 8.009994780264328e-06, "loss": 0.38750429153442384, "num_input_tokens_seen": 382584944, "step": 8745, "train_runtime": 67517.8366, "train_tokens_per_second": 5666.428 }, { "epoch": 0.5891462429302451, "grad_norm": 0.7520095638811525, "learning_rate": 8.00788306816089e-06, "loss": 0.38128883838653566, "num_input_tokens_seen": 382801808, "step": 8750, "train_runtime": 67554.4917, "train_tokens_per_second": 5666.563 }, { "epoch": 0.5894828979262052, "grad_norm": 0.7841152997217926, "learning_rate": 8.005770514912543e-06, "loss": 0.39379191398620605, "num_input_tokens_seen": 383025832, "step": 8755, "train_runtime": 67593.0084, "train_tokens_per_second": 5666.649 }, { "epoch": 0.5898195529221654, "grad_norm": 0.728445499817985, "learning_rate": 8.003657121110055e-06, "loss": 0.3845071792602539, "num_input_tokens_seen": 383260728, "step": 8760, "train_runtime": 67628.415, "train_tokens_per_second": 5667.155 }, { "epoch": 0.5901562079181255, "grad_norm": 0.7109388567699519, "learning_rate": 8.001542887344432e-06, "loss": 0.36870722770690917, "num_input_tokens_seen": 383481016, "step": 8765, "train_runtime": 67663.424, "train_tokens_per_second": 5667.479 }, { "epoch": 0.5904928629140856, "grad_norm": 0.7379119456141738, "learning_rate": 7.999427814206911e-06, "loss": 0.38972065448760984, "num_input_tokens_seen": 383699928, "step": 8770, "train_runtime": 67698.1314, "train_tokens_per_second": 5667.807 }, { "epoch": 0.5908295179100458, "grad_norm": 0.7977299068456677, "learning_rate": 7.997311902288968e-06, "loss": 0.3479362964630127, "num_input_tokens_seen": 383923208, "step": 8775, "train_runtime": 67735.622, "train_tokens_per_second": 5667.966 }, { "epoch": 0.5911661729060059, "grad_norm": 0.6927052461533478, "learning_rate": 7.995195152182307e-06, "loss": 0.35241219997406004, "num_input_tokens_seen": 384124912, "step": 8780, "train_runtime": 67775.1001, "train_tokens_per_second": 5667.641 }, { "epoch": 0.5915028279019661, "grad_norm": 1.8520827992951523, "learning_rate": 7.993077564478875e-06, "loss": 0.367362380027771, "num_input_tokens_seen": 384352936, "step": 8785, "train_runtime": 67813.9355, "train_tokens_per_second": 5667.757 }, { "epoch": 0.5918394828979262, "grad_norm": 0.8136091755899332, "learning_rate": 7.990959139770844e-06, "loss": 0.3980868339538574, "num_input_tokens_seen": 384586952, "step": 8790, "train_runtime": 67855.5637, "train_tokens_per_second": 5667.729 }, { "epoch": 0.5921761378938863, "grad_norm": 0.7689488310801835, "learning_rate": 7.988839878650628e-06, "loss": 0.3829834461212158, "num_input_tokens_seen": 384813912, "step": 8795, "train_runtime": 67899.407, "train_tokens_per_second": 5667.412 }, { "epoch": 0.5925127928898465, "grad_norm": 0.7981067639524714, "learning_rate": 7.986719781710872e-06, "loss": 0.3936153411865234, "num_input_tokens_seen": 385040600, "step": 8800, "train_runtime": 67941.2356, "train_tokens_per_second": 5667.259 }, { "epoch": 0.5928494478858066, "grad_norm": 0.7888638773984543, "learning_rate": 7.984598849544452e-06, "loss": 0.37601919174194337, "num_input_tokens_seen": 385256736, "step": 8805, "train_runtime": 67980.1555, "train_tokens_per_second": 5667.194 }, { "epoch": 0.5931861028817668, "grad_norm": 0.8141275660860262, "learning_rate": 7.98247708274448e-06, "loss": 0.3897037744522095, "num_input_tokens_seen": 385471192, "step": 8810, "train_runtime": 68015.2704, "train_tokens_per_second": 5667.421 }, { "epoch": 0.5935227578777269, "grad_norm": 0.7312305067797448, "learning_rate": 7.980354481904303e-06, "loss": 0.4111155033111572, "num_input_tokens_seen": 385695968, "step": 8815, "train_runtime": 68053.7353, "train_tokens_per_second": 5667.521 }, { "epoch": 0.593859412873687, "grad_norm": 0.8597141063820571, "learning_rate": 7.978231047617498e-06, "loss": 0.41021156311035156, "num_input_tokens_seen": 385910576, "step": 8820, "train_runtime": 68091.813, "train_tokens_per_second": 5667.503 }, { "epoch": 0.5941960678696472, "grad_norm": 0.7977576371807428, "learning_rate": 7.976106780477878e-06, "loss": 0.4051943778991699, "num_input_tokens_seen": 386135568, "step": 8825, "train_runtime": 68134.8361, "train_tokens_per_second": 5667.227 }, { "epoch": 0.5945327228656073, "grad_norm": 0.7369358873224232, "learning_rate": 7.973981681079487e-06, "loss": 0.3718585729598999, "num_input_tokens_seen": 386344944, "step": 8830, "train_runtime": 68175.9892, "train_tokens_per_second": 5666.877 }, { "epoch": 0.5948693778615675, "grad_norm": 0.7361018680183479, "learning_rate": 7.971855750016603e-06, "loss": 0.37234504222869874, "num_input_tokens_seen": 386561056, "step": 8835, "train_runtime": 68210.534, "train_tokens_per_second": 5667.175 }, { "epoch": 0.5952060328575276, "grad_norm": 0.7646438523333068, "learning_rate": 7.969728987883734e-06, "loss": 0.386487340927124, "num_input_tokens_seen": 386782376, "step": 8840, "train_runtime": 68250.0947, "train_tokens_per_second": 5667.133 }, { "epoch": 0.5955426878534877, "grad_norm": 0.8191747882763178, "learning_rate": 7.967601395275624e-06, "loss": 0.38187594413757325, "num_input_tokens_seen": 386999696, "step": 8845, "train_runtime": 68291.3193, "train_tokens_per_second": 5666.894 }, { "epoch": 0.5958793428494479, "grad_norm": 0.6459146656871505, "learning_rate": 7.965472972787247e-06, "loss": 0.35875325202941893, "num_input_tokens_seen": 387220408, "step": 8850, "train_runtime": 68328.0647, "train_tokens_per_second": 5667.077 }, { "epoch": 0.596215997845408, "grad_norm": 0.7549464702278598, "learning_rate": 7.963343721013808e-06, "loss": 0.3718303680419922, "num_input_tokens_seen": 387455840, "step": 8855, "train_runtime": 68366.913, "train_tokens_per_second": 5667.3 }, { "epoch": 0.5965526528413682, "grad_norm": 0.7558527061932778, "learning_rate": 7.961213640550748e-06, "loss": 0.3902780771255493, "num_input_tokens_seen": 387678720, "step": 8860, "train_runtime": 68410.3443, "train_tokens_per_second": 5666.961 }, { "epoch": 0.5968893078373283, "grad_norm": 0.7082248157089, "learning_rate": 7.959082731993736e-06, "loss": 0.3638461589813232, "num_input_tokens_seen": 387897464, "step": 8865, "train_runtime": 68443.0142, "train_tokens_per_second": 5667.452 }, { "epoch": 0.5972259628332884, "grad_norm": 0.9079660049109616, "learning_rate": 7.956950995938673e-06, "loss": 0.3705005168914795, "num_input_tokens_seen": 388107624, "step": 8870, "train_runtime": 68486.4151, "train_tokens_per_second": 5666.929 }, { "epoch": 0.5975626178292486, "grad_norm": 0.7984526639513112, "learning_rate": 7.954818432981694e-06, "loss": 0.3910086631774902, "num_input_tokens_seen": 388310680, "step": 8875, "train_runtime": 68525.481, "train_tokens_per_second": 5666.661 }, { "epoch": 0.5978992728252087, "grad_norm": 0.7147181194308313, "learning_rate": 7.952685043719162e-06, "loss": 0.3656719923019409, "num_input_tokens_seen": 388533832, "step": 8880, "train_runtime": 68568.5855, "train_tokens_per_second": 5666.353 }, { "epoch": 0.5982359278211689, "grad_norm": 0.7782537183487828, "learning_rate": 7.950550828747672e-06, "loss": 0.37486002445220945, "num_input_tokens_seen": 388754728, "step": 8885, "train_runtime": 68608.906, "train_tokens_per_second": 5666.243 }, { "epoch": 0.598572582817129, "grad_norm": 0.6958894420319796, "learning_rate": 7.948415788664052e-06, "loss": 0.40519165992736816, "num_input_tokens_seen": 388977056, "step": 8890, "train_runtime": 68641.9616, "train_tokens_per_second": 5666.753 }, { "epoch": 0.5989092378130891, "grad_norm": 0.8244159660705994, "learning_rate": 7.946279924065359e-06, "loss": 0.3696116924285889, "num_input_tokens_seen": 389195368, "step": 8895, "train_runtime": 68676.2104, "train_tokens_per_second": 5667.106 }, { "epoch": 0.5992458928090493, "grad_norm": 0.7624772559058, "learning_rate": 7.94414323554888e-06, "loss": 0.3721637725830078, "num_input_tokens_seen": 389424256, "step": 8900, "train_runtime": 68707.9383, "train_tokens_per_second": 5667.82 }, { "epoch": 0.5995825478050094, "grad_norm": 0.7421871285525378, "learning_rate": 7.942005723712135e-06, "loss": 0.3689994812011719, "num_input_tokens_seen": 389659456, "step": 8905, "train_runtime": 68742.7631, "train_tokens_per_second": 5668.371 }, { "epoch": 0.5999192028009696, "grad_norm": 0.7598715011111157, "learning_rate": 7.939867389152868e-06, "loss": 0.36181044578552246, "num_input_tokens_seen": 389878008, "step": 8910, "train_runtime": 68782.9286, "train_tokens_per_second": 5668.238 }, { "epoch": 0.6002558577969297, "grad_norm": 0.7642969305957489, "learning_rate": 7.937728232469062e-06, "loss": 0.3904815435409546, "num_input_tokens_seen": 390090680, "step": 8915, "train_runtime": 68823.5271, "train_tokens_per_second": 5667.984 }, { "epoch": 0.6005925127928898, "grad_norm": 0.7743252489033806, "learning_rate": 7.935588254258921e-06, "loss": 0.407269811630249, "num_input_tokens_seen": 390298200, "step": 8920, "train_runtime": 68859.6954, "train_tokens_per_second": 5668.021 }, { "epoch": 0.60092916778885, "grad_norm": 0.7626396676106256, "learning_rate": 7.933447455120889e-06, "loss": 0.3707296848297119, "num_input_tokens_seen": 390513112, "step": 8925, "train_runtime": 68906.8163, "train_tokens_per_second": 5667.264 }, { "epoch": 0.6012658227848101, "grad_norm": 0.9270450940086636, "learning_rate": 7.931305835653629e-06, "loss": 0.34468765258789064, "num_input_tokens_seen": 390741944, "step": 8930, "train_runtime": 68945.5046, "train_tokens_per_second": 5667.403 }, { "epoch": 0.6016024777807703, "grad_norm": 0.7523711200271979, "learning_rate": 7.929163396456038e-06, "loss": 0.39664325714111326, "num_input_tokens_seen": 390950400, "step": 8935, "train_runtime": 68982.333, "train_tokens_per_second": 5667.399 }, { "epoch": 0.6019391327767304, "grad_norm": 0.7743378155770866, "learning_rate": 7.927020138127245e-06, "loss": 0.369353199005127, "num_input_tokens_seen": 391172832, "step": 8940, "train_runtime": 69022.2251, "train_tokens_per_second": 5667.346 }, { "epoch": 0.6022757877726905, "grad_norm": 0.6649737691389936, "learning_rate": 7.924876061266603e-06, "loss": 0.3477231502532959, "num_input_tokens_seen": 391403392, "step": 8945, "train_runtime": 69060.7271, "train_tokens_per_second": 5667.525 }, { "epoch": 0.6026124427686507, "grad_norm": 0.8428633382608517, "learning_rate": 7.922731166473698e-06, "loss": 0.40044050216674804, "num_input_tokens_seen": 391619536, "step": 8950, "train_runtime": 69095.3564, "train_tokens_per_second": 5667.813 }, { "epoch": 0.6029490977646108, "grad_norm": 0.7797139187172423, "learning_rate": 7.920585454348341e-06, "loss": 0.35779447555541993, "num_input_tokens_seen": 391832424, "step": 8955, "train_runtime": 69130.8816, "train_tokens_per_second": 5667.98 }, { "epoch": 0.603285752760571, "grad_norm": 0.6454426330600102, "learning_rate": 7.918438925490578e-06, "loss": 0.35099799633026124, "num_input_tokens_seen": 392057736, "step": 8960, "train_runtime": 69168.5952, "train_tokens_per_second": 5668.147 }, { "epoch": 0.6036224077565311, "grad_norm": 0.9240196513971288, "learning_rate": 7.916291580500672e-06, "loss": 0.37104010581970215, "num_input_tokens_seen": 392274152, "step": 8965, "train_runtime": 69209.1039, "train_tokens_per_second": 5667.956 }, { "epoch": 0.6039590627524912, "grad_norm": 0.753245828305525, "learning_rate": 7.914143419979127e-06, "loss": 0.36745285987854004, "num_input_tokens_seen": 392499120, "step": 8970, "train_runtime": 69247.1372, "train_tokens_per_second": 5668.092 }, { "epoch": 0.6042957177484514, "grad_norm": 0.6569111554819693, "learning_rate": 7.911994444526667e-06, "loss": 0.34250531196594236, "num_input_tokens_seen": 392720016, "step": 8975, "train_runtime": 69281.6006, "train_tokens_per_second": 5668.46 }, { "epoch": 0.6046323727444115, "grad_norm": 0.6710386941472357, "learning_rate": 7.909844654744246e-06, "loss": 0.3526078939437866, "num_input_tokens_seen": 392945160, "step": 8980, "train_runtime": 69318.5011, "train_tokens_per_second": 5668.691 }, { "epoch": 0.6049690277403716, "grad_norm": 0.7627659966441698, "learning_rate": 7.907694051233044e-06, "loss": 0.38707795143127444, "num_input_tokens_seen": 393164952, "step": 8985, "train_runtime": 69355.9491, "train_tokens_per_second": 5668.799 }, { "epoch": 0.6053056827363318, "grad_norm": 0.6996994069888867, "learning_rate": 7.905542634594476e-06, "loss": 0.3759605884552002, "num_input_tokens_seen": 393392000, "step": 8990, "train_runtime": 69403.0227, "train_tokens_per_second": 5668.226 }, { "epoch": 0.6056423377322919, "grad_norm": 0.7505686616004086, "learning_rate": 7.903390405430174e-06, "loss": 0.36977381706237794, "num_input_tokens_seen": 393611632, "step": 8995, "train_runtime": 69443.7718, "train_tokens_per_second": 5668.062 }, { "epoch": 0.6059789927282521, "grad_norm": 0.7461690774426525, "learning_rate": 7.901237364342003e-06, "loss": 0.3545074939727783, "num_input_tokens_seen": 393813184, "step": 9000, "train_runtime": 69478.2997, "train_tokens_per_second": 5668.147 }, { "epoch": 0.6063156477242122, "grad_norm": 0.692733389183626, "learning_rate": 7.899083511932053e-06, "loss": 0.3470455646514893, "num_input_tokens_seen": 394027272, "step": 9005, "train_runtime": 69518.7288, "train_tokens_per_second": 5667.93 }, { "epoch": 0.6066523027201723, "grad_norm": 0.7055838759339507, "learning_rate": 7.896928848802645e-06, "loss": 0.372318959236145, "num_input_tokens_seen": 394252480, "step": 9010, "train_runtime": 69553.6455, "train_tokens_per_second": 5668.322 }, { "epoch": 0.6069889577161325, "grad_norm": 0.7576301760274441, "learning_rate": 7.894773375556322e-06, "loss": 0.39665966033935546, "num_input_tokens_seen": 394449024, "step": 9015, "train_runtime": 69593.8001, "train_tokens_per_second": 5667.876 }, { "epoch": 0.6073256127120926, "grad_norm": 0.8095166727188953, "learning_rate": 7.892617092795855e-06, "loss": 0.38990225791931155, "num_input_tokens_seen": 394672680, "step": 9020, "train_runtime": 69632.6302, "train_tokens_per_second": 5667.927 }, { "epoch": 0.6076622677080528, "grad_norm": 0.6966710594837849, "learning_rate": 7.890460001124242e-06, "loss": 0.3693479061126709, "num_input_tokens_seen": 394882720, "step": 9025, "train_runtime": 69668.2129, "train_tokens_per_second": 5668.047 }, { "epoch": 0.6079989227040129, "grad_norm": 0.7467966463857733, "learning_rate": 7.888302101144707e-06, "loss": 0.3727553367614746, "num_input_tokens_seen": 395096336, "step": 9030, "train_runtime": 69710.5053, "train_tokens_per_second": 5667.673 }, { "epoch": 0.608335577699973, "grad_norm": 0.7033388740227385, "learning_rate": 7.886143393460699e-06, "loss": 0.38645596504211427, "num_input_tokens_seen": 395327104, "step": 9035, "train_runtime": 69746.6807, "train_tokens_per_second": 5668.042 }, { "epoch": 0.6086722326959332, "grad_norm": 0.717725417977876, "learning_rate": 7.883983878675895e-06, "loss": 0.3641960620880127, "num_input_tokens_seen": 395561000, "step": 9040, "train_runtime": 69794.3801, "train_tokens_per_second": 5667.519 }, { "epoch": 0.6090088876918933, "grad_norm": 0.737338173324883, "learning_rate": 7.881823557394194e-06, "loss": 0.3701021194458008, "num_input_tokens_seen": 395790544, "step": 9045, "train_runtime": 69832.741, "train_tokens_per_second": 5667.693 }, { "epoch": 0.6093455426878535, "grad_norm": 0.7527693128608011, "learning_rate": 7.879662430219728e-06, "loss": 0.35156404972076416, "num_input_tokens_seen": 395987680, "step": 9050, "train_runtime": 69873.2033, "train_tokens_per_second": 5667.232 }, { "epoch": 0.6096821976838136, "grad_norm": 0.8175940814840023, "learning_rate": 7.877500497756843e-06, "loss": 0.4006368637084961, "num_input_tokens_seen": 396207224, "step": 9055, "train_runtime": 69914.8014, "train_tokens_per_second": 5667.001 }, { "epoch": 0.6100188526797737, "grad_norm": 1.0466330679614098, "learning_rate": 7.87533776061012e-06, "loss": 0.3919075012207031, "num_input_tokens_seen": 396431144, "step": 9060, "train_runtime": 69954.8331, "train_tokens_per_second": 5666.959 }, { "epoch": 0.6103555076757339, "grad_norm": 0.7304596174173837, "learning_rate": 7.873174219384362e-06, "loss": 0.3918348789215088, "num_input_tokens_seen": 396647760, "step": 9065, "train_runtime": 69996.3796, "train_tokens_per_second": 5666.69 }, { "epoch": 0.610692162671694, "grad_norm": 0.7556787705072924, "learning_rate": 7.871009874684595e-06, "loss": 0.3941289186477661, "num_input_tokens_seen": 396880640, "step": 9070, "train_runtime": 70028.8034, "train_tokens_per_second": 5667.391 }, { "epoch": 0.6110288176676542, "grad_norm": 0.8397284206623034, "learning_rate": 7.868844727116072e-06, "loss": 0.3926485300064087, "num_input_tokens_seen": 397103976, "step": 9075, "train_runtime": 70068.2945, "train_tokens_per_second": 5667.385 }, { "epoch": 0.6113654726636143, "grad_norm": 0.6869244210168536, "learning_rate": 7.866678777284267e-06, "loss": 0.3840303897857666, "num_input_tokens_seen": 397331160, "step": 9080, "train_runtime": 70102.9706, "train_tokens_per_second": 5667.822 }, { "epoch": 0.6117021276595744, "grad_norm": 0.6366270970878026, "learning_rate": 7.864512025794886e-06, "loss": 0.3659891843795776, "num_input_tokens_seen": 397555992, "step": 9085, "train_runtime": 70142.9573, "train_tokens_per_second": 5667.796 }, { "epoch": 0.6120387826555346, "grad_norm": 0.7702173454778595, "learning_rate": 7.86234447325385e-06, "loss": 0.36196537017822267, "num_input_tokens_seen": 397769720, "step": 9090, "train_runtime": 70185.3981, "train_tokens_per_second": 5667.414 }, { "epoch": 0.6123754376514947, "grad_norm": 0.6638241416823153, "learning_rate": 7.860176120267309e-06, "loss": 0.4144433498382568, "num_input_tokens_seen": 398006352, "step": 9095, "train_runtime": 70227.0746, "train_tokens_per_second": 5667.42 }, { "epoch": 0.6127120926474549, "grad_norm": 0.7106604037911711, "learning_rate": 7.858006967441637e-06, "loss": 0.3602044105529785, "num_input_tokens_seen": 398216992, "step": 9100, "train_runtime": 70268.2952, "train_tokens_per_second": 5667.093 }, { "epoch": 0.613048747643415, "grad_norm": 0.8013079858059877, "learning_rate": 7.85583701538343e-06, "loss": 0.40687074661254885, "num_input_tokens_seen": 398447240, "step": 9105, "train_runtime": 70313.64, "train_tokens_per_second": 5666.713 }, { "epoch": 0.6133854026393751, "grad_norm": 0.8363243678158666, "learning_rate": 7.853666264699506e-06, "loss": 0.3638491153717041, "num_input_tokens_seen": 398656928, "step": 9110, "train_runtime": 70355.8426, "train_tokens_per_second": 5666.295 }, { "epoch": 0.6137220576353353, "grad_norm": 0.6855947504133412, "learning_rate": 7.851494715996914e-06, "loss": 0.41129069328308104, "num_input_tokens_seen": 398870368, "step": 9115, "train_runtime": 70395.581, "train_tokens_per_second": 5666.128 }, { "epoch": 0.6140587126312954, "grad_norm": 0.7613022857869545, "learning_rate": 7.849322369882915e-06, "loss": 0.3685478687286377, "num_input_tokens_seen": 399088536, "step": 9120, "train_runtime": 70444.8636, "train_tokens_per_second": 5665.261 }, { "epoch": 0.6143953676272556, "grad_norm": 0.6988300008519205, "learning_rate": 7.847149226965003e-06, "loss": 0.34872984886169434, "num_input_tokens_seen": 399301232, "step": 9125, "train_runtime": 70485.0506, "train_tokens_per_second": 5665.049 }, { "epoch": 0.6147320226232157, "grad_norm": 0.8477724491109673, "learning_rate": 7.844975287850886e-06, "loss": 0.35025968551635744, "num_input_tokens_seen": 399523504, "step": 9130, "train_runtime": 70522.5255, "train_tokens_per_second": 5665.19 }, { "epoch": 0.6150686776191758, "grad_norm": 0.7692634619323344, "learning_rate": 7.842800553148506e-06, "loss": 0.3998849630355835, "num_input_tokens_seen": 399735256, "step": 9135, "train_runtime": 70558.7444, "train_tokens_per_second": 5665.283 }, { "epoch": 0.615405332615136, "grad_norm": 0.7313920740237436, "learning_rate": 7.840625023466014e-06, "loss": 0.3812243938446045, "num_input_tokens_seen": 399958824, "step": 9140, "train_runtime": 70598.2086, "train_tokens_per_second": 5665.283 }, { "epoch": 0.6157419876110961, "grad_norm": 0.7274387978674163, "learning_rate": 7.838448699411792e-06, "loss": 0.3413673400878906, "num_input_tokens_seen": 400181528, "step": 9145, "train_runtime": 70641.2437, "train_tokens_per_second": 5664.984 }, { "epoch": 0.6160786426070562, "grad_norm": 0.7006449570449917, "learning_rate": 7.836271581594442e-06, "loss": 0.4210306167602539, "num_input_tokens_seen": 400404728, "step": 9150, "train_runtime": 70677.6291, "train_tokens_per_second": 5665.226 }, { "epoch": 0.6164152976030164, "grad_norm": 0.8552267430665972, "learning_rate": 7.834093670622789e-06, "loss": 0.3944708824157715, "num_input_tokens_seen": 400620128, "step": 9155, "train_runtime": 70718.8549, "train_tokens_per_second": 5664.969 }, { "epoch": 0.6167519525989765, "grad_norm": 0.7631479691553084, "learning_rate": 7.831914967105878e-06, "loss": 0.4071969985961914, "num_input_tokens_seen": 400851832, "step": 9160, "train_runtime": 70759.3063, "train_tokens_per_second": 5665.005 }, { "epoch": 0.6170886075949367, "grad_norm": 0.6980894707116475, "learning_rate": 7.829735471652978e-06, "loss": 0.3579000234603882, "num_input_tokens_seen": 401070744, "step": 9165, "train_runtime": 70799.3413, "train_tokens_per_second": 5664.894 }, { "epoch": 0.6174252625908968, "grad_norm": 0.8778577602385942, "learning_rate": 7.827555184873575e-06, "loss": 0.38968710899353026, "num_input_tokens_seen": 401294816, "step": 9170, "train_runtime": 70831.4898, "train_tokens_per_second": 5665.486 }, { "epoch": 0.617761917586857, "grad_norm": 0.6780563561113029, "learning_rate": 7.825374107377381e-06, "loss": 0.35830237865448, "num_input_tokens_seen": 401509200, "step": 9175, "train_runtime": 70873.5987, "train_tokens_per_second": 5665.145 }, { "epoch": 0.6180985725828171, "grad_norm": 0.7956649065370722, "learning_rate": 7.823192239774327e-06, "loss": 0.3784201145172119, "num_input_tokens_seen": 401720584, "step": 9180, "train_runtime": 70913.365, "train_tokens_per_second": 5664.949 }, { "epoch": 0.6184352275787772, "grad_norm": 0.689595538429294, "learning_rate": 7.821009582674567e-06, "loss": 0.3932128667831421, "num_input_tokens_seen": 401937000, "step": 9185, "train_runtime": 70950.5951, "train_tokens_per_second": 5665.026 }, { "epoch": 0.6187718825747374, "grad_norm": 0.7661957206566802, "learning_rate": 7.818826136688473e-06, "loss": 0.41967573165893557, "num_input_tokens_seen": 402163016, "step": 9190, "train_runtime": 70988.3051, "train_tokens_per_second": 5665.201 }, { "epoch": 0.6191085375706975, "grad_norm": 1.24632241828128, "learning_rate": 7.816641902426638e-06, "loss": 0.3871551513671875, "num_input_tokens_seen": 402390608, "step": 9195, "train_runtime": 71026.2689, "train_tokens_per_second": 5665.377 }, { "epoch": 0.6194451925666576, "grad_norm": 0.7754009003596685, "learning_rate": 7.814456880499877e-06, "loss": 0.39989705085754396, "num_input_tokens_seen": 402608440, "step": 9200, "train_runtime": 71059.0686, "train_tokens_per_second": 5665.828 }, { "epoch": 0.6197818475626178, "grad_norm": 0.8050073203615641, "learning_rate": 7.812271071519222e-06, "loss": 0.40456953048706057, "num_input_tokens_seen": 402830072, "step": 9205, "train_runtime": 71092.5653, "train_tokens_per_second": 5666.276 }, { "epoch": 0.6201185025585779, "grad_norm": 0.636871155540424, "learning_rate": 7.810084476095932e-06, "loss": 0.3537304401397705, "num_input_tokens_seen": 403051544, "step": 9210, "train_runtime": 71132.4539, "train_tokens_per_second": 5666.212 }, { "epoch": 0.6204551575545381, "grad_norm": 0.7771337802144807, "learning_rate": 7.807897094841476e-06, "loss": 0.3726407527923584, "num_input_tokens_seen": 403260152, "step": 9215, "train_runtime": 71171.5092, "train_tokens_per_second": 5666.033 }, { "epoch": 0.6207918125504982, "grad_norm": 0.8018367108579978, "learning_rate": 7.805708928367555e-06, "loss": 0.3734896183013916, "num_input_tokens_seen": 403468824, "step": 9220, "train_runtime": 71211.2179, "train_tokens_per_second": 5665.804 }, { "epoch": 0.6211284675464583, "grad_norm": 0.7409189256900955, "learning_rate": 7.803519977286075e-06, "loss": 0.4021895885467529, "num_input_tokens_seen": 403677704, "step": 9225, "train_runtime": 71249.4495, "train_tokens_per_second": 5665.696 }, { "epoch": 0.6214651225424185, "grad_norm": 0.7435590926911755, "learning_rate": 7.801330242209176e-06, "loss": 0.38091113567352297, "num_input_tokens_seen": 403883200, "step": 9230, "train_runtime": 71290.1392, "train_tokens_per_second": 5665.345 }, { "epoch": 0.6218017775383786, "grad_norm": 0.7623979983718003, "learning_rate": 7.799139723749207e-06, "loss": 0.3860699415206909, "num_input_tokens_seen": 404093128, "step": 9235, "train_runtime": 71328.4839, "train_tokens_per_second": 5665.242 }, { "epoch": 0.6221384325343388, "grad_norm": 0.752221691602039, "learning_rate": 7.79694842251874e-06, "loss": 0.3864139080047607, "num_input_tokens_seen": 404319728, "step": 9240, "train_runtime": 71368.1022, "train_tokens_per_second": 5665.272 }, { "epoch": 0.6224750875302989, "grad_norm": 0.669956786900923, "learning_rate": 7.794756339130565e-06, "loss": 0.3734030485153198, "num_input_tokens_seen": 404541968, "step": 9245, "train_runtime": 71411.2121, "train_tokens_per_second": 5664.964 }, { "epoch": 0.622811742526259, "grad_norm": 0.6983661416716165, "learning_rate": 7.792563474197692e-06, "loss": 0.3814718008041382, "num_input_tokens_seen": 404754312, "step": 9250, "train_runtime": 71448.6745, "train_tokens_per_second": 5664.966 }, { "epoch": 0.6231483975222192, "grad_norm": 0.7124131828610318, "learning_rate": 7.79036982833335e-06, "loss": 0.4030300617218018, "num_input_tokens_seen": 404985704, "step": 9255, "train_runtime": 71479.1768, "train_tokens_per_second": 5665.786 }, { "epoch": 0.6234850525181793, "grad_norm": 0.7886397068317147, "learning_rate": 7.78817540215098e-06, "loss": 0.3688653469085693, "num_input_tokens_seen": 405208848, "step": 9260, "train_runtime": 71523.5445, "train_tokens_per_second": 5665.391 }, { "epoch": 0.6238217075141395, "grad_norm": 0.7219385997208987, "learning_rate": 7.78598019626425e-06, "loss": 0.37583611011505125, "num_input_tokens_seen": 405447552, "step": 9265, "train_runtime": 71555.7936, "train_tokens_per_second": 5666.174 }, { "epoch": 0.6241583625100996, "grad_norm": 0.7695265603997767, "learning_rate": 7.783784211287044e-06, "loss": 0.4006516456604004, "num_input_tokens_seen": 405651112, "step": 9270, "train_runtime": 71597.6416, "train_tokens_per_second": 5665.705 }, { "epoch": 0.6244950175060597, "grad_norm": 0.9194045285642082, "learning_rate": 7.78158744783346e-06, "loss": 0.408467960357666, "num_input_tokens_seen": 405873152, "step": 9275, "train_runtime": 71636.7797, "train_tokens_per_second": 5665.709 }, { "epoch": 0.6248316725020199, "grad_norm": 0.7515447419413074, "learning_rate": 7.779389906517813e-06, "loss": 0.35638930797576907, "num_input_tokens_seen": 406086632, "step": 9280, "train_runtime": 71670.2143, "train_tokens_per_second": 5666.045 }, { "epoch": 0.6251683274979801, "grad_norm": 0.7184945703842209, "learning_rate": 7.777191587954645e-06, "loss": 0.3749531745910645, "num_input_tokens_seen": 406298704, "step": 9285, "train_runtime": 71712.7407, "train_tokens_per_second": 5665.642 }, { "epoch": 0.6255049824939403, "grad_norm": 0.8027326683853181, "learning_rate": 7.774992492758704e-06, "loss": 0.36041698455810545, "num_input_tokens_seen": 406502360, "step": 9290, "train_runtime": 71750.3732, "train_tokens_per_second": 5665.509 }, { "epoch": 0.6258416374899004, "grad_norm": 0.7186651340067036, "learning_rate": 7.77279262154496e-06, "loss": 0.38366947174072263, "num_input_tokens_seen": 406727224, "step": 9295, "train_runtime": 71789.6701, "train_tokens_per_second": 5665.54 }, { "epoch": 0.6261782924858605, "grad_norm": 0.8295991455328212, "learning_rate": 7.770591974928604e-06, "loss": 0.3997042655944824, "num_input_tokens_seen": 406958480, "step": 9300, "train_runtime": 71824.8324, "train_tokens_per_second": 5665.986 }, { "epoch": 0.6265149474818207, "grad_norm": 0.7658676057217327, "learning_rate": 7.768390553525034e-06, "loss": 0.3705620527267456, "num_input_tokens_seen": 407186440, "step": 9305, "train_runtime": 71865.0099, "train_tokens_per_second": 5665.99 }, { "epoch": 0.6268516024777808, "grad_norm": 0.7085619378845062, "learning_rate": 7.766188357949875e-06, "loss": 0.3714077711105347, "num_input_tokens_seen": 407407560, "step": 9310, "train_runtime": 71909.2798, "train_tokens_per_second": 5665.577 }, { "epoch": 0.627188257473741, "grad_norm": 0.8341480094252892, "learning_rate": 7.763985388818963e-06, "loss": 0.36980538368225097, "num_input_tokens_seen": 407628232, "step": 9315, "train_runtime": 71949.141, "train_tokens_per_second": 5665.505 }, { "epoch": 0.6275249124697011, "grad_norm": 0.8636262815852889, "learning_rate": 7.76178164674835e-06, "loss": 0.3548977613449097, "num_input_tokens_seen": 407838184, "step": 9320, "train_runtime": 71979.0743, "train_tokens_per_second": 5666.066 }, { "epoch": 0.6278615674656612, "grad_norm": 0.7192127713238392, "learning_rate": 7.759577132354305e-06, "loss": 0.3763836622238159, "num_input_tokens_seen": 408065528, "step": 9325, "train_runtime": 72013.1228, "train_tokens_per_second": 5666.544 }, { "epoch": 0.6281982224616214, "grad_norm": 0.7987348676964026, "learning_rate": 7.757371846253315e-06, "loss": 0.3501241683959961, "num_input_tokens_seen": 408275816, "step": 9330, "train_runtime": 72052.1024, "train_tokens_per_second": 5666.397 }, { "epoch": 0.6285348774575815, "grad_norm": 0.7470954183186648, "learning_rate": 7.755165789062083e-06, "loss": 0.4022618293762207, "num_input_tokens_seen": 408498408, "step": 9335, "train_runtime": 72090.7302, "train_tokens_per_second": 5666.448 }, { "epoch": 0.6288715324535417, "grad_norm": 0.7151603552727446, "learning_rate": 7.752958961397522e-06, "loss": 0.3877957105636597, "num_input_tokens_seen": 408733352, "step": 9340, "train_runtime": 72120.5104, "train_tokens_per_second": 5667.366 }, { "epoch": 0.6292081874495018, "grad_norm": 0.7351213604942984, "learning_rate": 7.750751363876765e-06, "loss": 0.39035401344299314, "num_input_tokens_seen": 408941920, "step": 9345, "train_runtime": 72164.8249, "train_tokens_per_second": 5666.776 }, { "epoch": 0.6295448424454619, "grad_norm": 0.8453874832584365, "learning_rate": 7.748542997117162e-06, "loss": 0.3737621307373047, "num_input_tokens_seen": 409162768, "step": 9350, "train_runtime": 72196.2605, "train_tokens_per_second": 5667.368 }, { "epoch": 0.6298814974414221, "grad_norm": 0.7429854652224369, "learning_rate": 7.746333861736275e-06, "loss": 0.37030327320098877, "num_input_tokens_seen": 409372800, "step": 9355, "train_runtime": 72230.736, "train_tokens_per_second": 5667.571 }, { "epoch": 0.6302181524373822, "grad_norm": 0.8081848245845143, "learning_rate": 7.74412395835188e-06, "loss": 0.3631394386291504, "num_input_tokens_seen": 409583128, "step": 9360, "train_runtime": 72272.2265, "train_tokens_per_second": 5667.227 }, { "epoch": 0.6305548074333424, "grad_norm": 0.6576701373107874, "learning_rate": 7.74191328758197e-06, "loss": 0.37232241630554197, "num_input_tokens_seen": 409794192, "step": 9365, "train_runtime": 72313.6306, "train_tokens_per_second": 5666.901 }, { "epoch": 0.6308914624293025, "grad_norm": 0.735743623178803, "learning_rate": 7.739701850044752e-06, "loss": 0.4075340270996094, "num_input_tokens_seen": 410020536, "step": 9370, "train_runtime": 72350.0803, "train_tokens_per_second": 5667.175 }, { "epoch": 0.6312281174252626, "grad_norm": 0.8241305453975977, "learning_rate": 7.73748964635865e-06, "loss": 0.3718372583389282, "num_input_tokens_seen": 410241072, "step": 9375, "train_runtime": 72387.3064, "train_tokens_per_second": 5667.307 }, { "epoch": 0.6315647724212228, "grad_norm": 0.6824612940355289, "learning_rate": 7.735276677142297e-06, "loss": 0.35228054523468016, "num_input_tokens_seen": 410443760, "step": 9380, "train_runtime": 72423.3738, "train_tokens_per_second": 5667.283 }, { "epoch": 0.6319014274171829, "grad_norm": 0.7420817513182338, "learning_rate": 7.733062943014542e-06, "loss": 0.3992206573486328, "num_input_tokens_seen": 410670656, "step": 9385, "train_runtime": 72463.1943, "train_tokens_per_second": 5667.3 }, { "epoch": 0.632238082413143, "grad_norm": 0.7090881615954795, "learning_rate": 7.730848444594452e-06, "loss": 0.3573267698287964, "num_input_tokens_seen": 410903448, "step": 9390, "train_runtime": 72497.2497, "train_tokens_per_second": 5667.849 }, { "epoch": 0.6325747374091032, "grad_norm": 0.7269251761731511, "learning_rate": 7.7286331825013e-06, "loss": 0.37146763801574706, "num_input_tokens_seen": 411126128, "step": 9395, "train_runtime": 72531.5005, "train_tokens_per_second": 5668.242 }, { "epoch": 0.6329113924050633, "grad_norm": 0.8641784035147556, "learning_rate": 7.72641715735458e-06, "loss": 0.3655902624130249, "num_input_tokens_seen": 411336720, "step": 9400, "train_runtime": 72578.3797, "train_tokens_per_second": 5667.483 }, { "epoch": 0.6332480474010235, "grad_norm": 0.7283249670371048, "learning_rate": 7.724200369773998e-06, "loss": 0.38719449043273924, "num_input_tokens_seen": 411563872, "step": 9405, "train_runtime": 72618.0679, "train_tokens_per_second": 5667.513 }, { "epoch": 0.6335847023969836, "grad_norm": 0.6863677356579423, "learning_rate": 7.721982820379467e-06, "loss": 0.37484476566314695, "num_input_tokens_seen": 411787952, "step": 9410, "train_runtime": 72652.1342, "train_tokens_per_second": 5667.94 }, { "epoch": 0.6339213573929438, "grad_norm": 0.7975234970060876, "learning_rate": 7.719764509791123e-06, "loss": 0.3741923332214355, "num_input_tokens_seen": 411975928, "step": 9415, "train_runtime": 72685.292, "train_tokens_per_second": 5667.941 }, { "epoch": 0.6342580123889039, "grad_norm": 0.735648228811728, "learning_rate": 7.717545438629303e-06, "loss": 0.43533172607421877, "num_input_tokens_seen": 412214368, "step": 9420, "train_runtime": 72721.9474, "train_tokens_per_second": 5668.363 }, { "epoch": 0.634594667384864, "grad_norm": 0.6852408582111305, "learning_rate": 7.71532560751457e-06, "loss": 0.3732184410095215, "num_input_tokens_seen": 412434712, "step": 9425, "train_runtime": 72757.9756, "train_tokens_per_second": 5668.584 }, { "epoch": 0.6349313223808242, "grad_norm": 0.7315681955128508, "learning_rate": 7.713105017067686e-06, "loss": 0.38740081787109376, "num_input_tokens_seen": 412668752, "step": 9430, "train_runtime": 72791.6587, "train_tokens_per_second": 5669.176 }, { "epoch": 0.6352679773767843, "grad_norm": 0.840365118006204, "learning_rate": 7.710883667909639e-06, "loss": 0.37178239822387693, "num_input_tokens_seen": 412886888, "step": 9435, "train_runtime": 72827.5502, "train_tokens_per_second": 5669.378 }, { "epoch": 0.6356046323727444, "grad_norm": 0.7096620735032497, "learning_rate": 7.708661560661617e-06, "loss": 0.3967950105667114, "num_input_tokens_seen": 413111704, "step": 9440, "train_runtime": 72863.4631, "train_tokens_per_second": 5669.669 }, { "epoch": 0.6359412873687046, "grad_norm": 0.7646005775520524, "learning_rate": 7.706438695945026e-06, "loss": 0.39545307159423826, "num_input_tokens_seen": 413330656, "step": 9445, "train_runtime": 72901.529, "train_tokens_per_second": 5669.712 }, { "epoch": 0.6362779423646647, "grad_norm": 0.7774443776922321, "learning_rate": 7.704215074381484e-06, "loss": 0.3966789960861206, "num_input_tokens_seen": 413537792, "step": 9450, "train_runtime": 72937.8522, "train_tokens_per_second": 5669.728 }, { "epoch": 0.6366145973606249, "grad_norm": 0.7509437079381308, "learning_rate": 7.70199069659282e-06, "loss": 0.38933987617492677, "num_input_tokens_seen": 413751760, "step": 9455, "train_runtime": 72973.609, "train_tokens_per_second": 5669.882 }, { "epoch": 0.636951252356585, "grad_norm": 0.7325824670692431, "learning_rate": 7.699765563201075e-06, "loss": 0.3942718982696533, "num_input_tokens_seen": 413978016, "step": 9460, "train_runtime": 73003.9087, "train_tokens_per_second": 5670.628 }, { "epoch": 0.6372879073525451, "grad_norm": 1.211650286474132, "learning_rate": 7.697539674828498e-06, "loss": 0.36391506195068357, "num_input_tokens_seen": 414211120, "step": 9465, "train_runtime": 73043.0392, "train_tokens_per_second": 5670.782 }, { "epoch": 0.6376245623485053, "grad_norm": 0.7046659464816453, "learning_rate": 7.695313032097554e-06, "loss": 0.35442147254943845, "num_input_tokens_seen": 414430048, "step": 9470, "train_runtime": 73079.8991, "train_tokens_per_second": 5670.917 }, { "epoch": 0.6379612173444654, "grad_norm": 0.6947182191976057, "learning_rate": 7.693085635630913e-06, "loss": 0.37603862285614015, "num_input_tokens_seen": 414632320, "step": 9475, "train_runtime": 73126.3077, "train_tokens_per_second": 5670.084 }, { "epoch": 0.6382978723404256, "grad_norm": 0.7520528416471214, "learning_rate": 7.690857486051463e-06, "loss": 0.3694300174713135, "num_input_tokens_seen": 414859816, "step": 9480, "train_runtime": 73166.4344, "train_tokens_per_second": 5670.084 }, { "epoch": 0.6386345273363857, "grad_norm": 0.7317534743877758, "learning_rate": 7.688628583982298e-06, "loss": 0.3734642267227173, "num_input_tokens_seen": 415071856, "step": 9485, "train_runtime": 73208.2652, "train_tokens_per_second": 5669.74 }, { "epoch": 0.6389711823323458, "grad_norm": 0.7042485073751668, "learning_rate": 7.68639893004672e-06, "loss": 0.3597568035125732, "num_input_tokens_seen": 415294888, "step": 9490, "train_runtime": 73249.0074, "train_tokens_per_second": 5669.632 }, { "epoch": 0.639307837328306, "grad_norm": 0.7092737777153273, "learning_rate": 7.684168524868253e-06, "loss": 0.3566474437713623, "num_input_tokens_seen": 415526408, "step": 9495, "train_runtime": 73288.7331, "train_tokens_per_second": 5669.717 }, { "epoch": 0.6396444923242661, "grad_norm": 0.788876930336864, "learning_rate": 7.681937369070612e-06, "loss": 0.37108328342437746, "num_input_tokens_seen": 415741912, "step": 9500, "train_runtime": 73321.3834, "train_tokens_per_second": 5670.132 }, { "epoch": 0.6399811473202263, "grad_norm": 0.7482496645801756, "learning_rate": 7.67970546327774e-06, "loss": 0.3800150156021118, "num_input_tokens_seen": 415962440, "step": 9505, "train_runtime": 73359.2213, "train_tokens_per_second": 5670.213 }, { "epoch": 0.6403178023161864, "grad_norm": 0.7003781550580643, "learning_rate": 7.67747280811378e-06, "loss": 0.3659864902496338, "num_input_tokens_seen": 416179208, "step": 9510, "train_runtime": 73399.2881, "train_tokens_per_second": 5670.071 }, { "epoch": 0.6406544573121465, "grad_norm": 0.6823118163683989, "learning_rate": 7.675239404203088e-06, "loss": 0.35662126541137695, "num_input_tokens_seen": 416394640, "step": 9515, "train_runtime": 73439.5055, "train_tokens_per_second": 5669.9 }, { "epoch": 0.6409911123081067, "grad_norm": 0.7167030632794295, "learning_rate": 7.673005252170226e-06, "loss": 0.3727959156036377, "num_input_tokens_seen": 416620784, "step": 9520, "train_runtime": 73484.0265, "train_tokens_per_second": 5669.542 }, { "epoch": 0.6413277673040668, "grad_norm": 0.7593758397546905, "learning_rate": 7.670770352639968e-06, "loss": 0.3673388957977295, "num_input_tokens_seen": 416826168, "step": 9525, "train_runtime": 73525.2289, "train_tokens_per_second": 5669.158 }, { "epoch": 0.641664422300027, "grad_norm": 0.7362340230809692, "learning_rate": 7.668534706237299e-06, "loss": 0.37580122947692873, "num_input_tokens_seen": 417047480, "step": 9530, "train_runtime": 73556.9783, "train_tokens_per_second": 5669.72 }, { "epoch": 0.6420010772959871, "grad_norm": 0.7543938330712561, "learning_rate": 7.666298313587409e-06, "loss": 0.4170052528381348, "num_input_tokens_seen": 417268504, "step": 9535, "train_runtime": 73597.5716, "train_tokens_per_second": 5669.596 }, { "epoch": 0.6423377322919472, "grad_norm": 0.8008472981307811, "learning_rate": 7.664061175315696e-06, "loss": 0.3715662956237793, "num_input_tokens_seen": 417464000, "step": 9540, "train_runtime": 73631.8047, "train_tokens_per_second": 5669.615 }, { "epoch": 0.6426743872879074, "grad_norm": 0.7188017157103265, "learning_rate": 7.661823292047771e-06, "loss": 0.3764479160308838, "num_input_tokens_seen": 417683920, "step": 9545, "train_runtime": 73672.7623, "train_tokens_per_second": 5669.448 }, { "epoch": 0.6430110422838675, "grad_norm": 0.8895228408009356, "learning_rate": 7.659584664409452e-06, "loss": 0.3806633949279785, "num_input_tokens_seen": 417910080, "step": 9550, "train_runtime": 73714.3818, "train_tokens_per_second": 5669.315 }, { "epoch": 0.6433476972798277, "grad_norm": 0.7813418710468062, "learning_rate": 7.65734529302676e-06, "loss": 0.33327679634094237, "num_input_tokens_seen": 418114864, "step": 9555, "train_runtime": 73751.4559, "train_tokens_per_second": 5669.242 }, { "epoch": 0.6436843522757878, "grad_norm": 0.7440032604844485, "learning_rate": 7.655105178525932e-06, "loss": 0.36725008487701416, "num_input_tokens_seen": 418331608, "step": 9560, "train_runtime": 73789.4942, "train_tokens_per_second": 5669.257 }, { "epoch": 0.6440210072717479, "grad_norm": 0.7428051543591697, "learning_rate": 7.652864321533406e-06, "loss": 0.37874999046325686, "num_input_tokens_seen": 418542736, "step": 9565, "train_runtime": 73827.1886, "train_tokens_per_second": 5669.222 }, { "epoch": 0.6443576622677081, "grad_norm": 0.6906490664289745, "learning_rate": 7.650622722675833e-06, "loss": 0.39217414855957033, "num_input_tokens_seen": 418769104, "step": 9570, "train_runtime": 73869.6555, "train_tokens_per_second": 5669.027 }, { "epoch": 0.6446943172636682, "grad_norm": 0.7836457733135137, "learning_rate": 7.648380382580067e-06, "loss": 0.3911130428314209, "num_input_tokens_seen": 418983272, "step": 9575, "train_runtime": 73911.9877, "train_tokens_per_second": 5668.678 }, { "epoch": 0.6450309722596284, "grad_norm": 0.7191438751807192, "learning_rate": 7.646137301873173e-06, "loss": 0.3877583026885986, "num_input_tokens_seen": 419193152, "step": 9580, "train_runtime": 73952.718, "train_tokens_per_second": 5668.394 }, { "epoch": 0.6453676272555885, "grad_norm": 0.8722963532886264, "learning_rate": 7.643893481182421e-06, "loss": 0.35512332916259765, "num_input_tokens_seen": 419415144, "step": 9585, "train_runtime": 73990.0513, "train_tokens_per_second": 5668.534 }, { "epoch": 0.6457042822515486, "grad_norm": 0.7893095386452317, "learning_rate": 7.641648921135287e-06, "loss": 0.4030734062194824, "num_input_tokens_seen": 419642840, "step": 9590, "train_runtime": 74032.6519, "train_tokens_per_second": 5668.348 }, { "epoch": 0.6460409372475088, "grad_norm": 0.8691991766270082, "learning_rate": 7.639403622359455e-06, "loss": 0.38401873111724855, "num_input_tokens_seen": 419851960, "step": 9595, "train_runtime": 74068.9663, "train_tokens_per_second": 5668.392 }, { "epoch": 0.6463775922434689, "grad_norm": 0.7669041161649485, "learning_rate": 7.637157585482817e-06, "loss": 0.3698650598526001, "num_input_tokens_seen": 420069368, "step": 9600, "train_runtime": 74113.2241, "train_tokens_per_second": 5667.941 }, { "epoch": 0.646714247239429, "grad_norm": 0.6764016385660067, "learning_rate": 7.63491081113347e-06, "loss": 0.3979948043823242, "num_input_tokens_seen": 420301264, "step": 9605, "train_runtime": 74149.7053, "train_tokens_per_second": 5668.28 }, { "epoch": 0.6470509022353892, "grad_norm": 0.7632828915951216, "learning_rate": 7.632663299939718e-06, "loss": 0.4009084701538086, "num_input_tokens_seen": 420528480, "step": 9610, "train_runtime": 74191.7204, "train_tokens_per_second": 5668.132 }, { "epoch": 0.6473875572313493, "grad_norm": 0.7759849429505897, "learning_rate": 7.630415052530066e-06, "loss": 0.37017059326171875, "num_input_tokens_seen": 420744352, "step": 9615, "train_runtime": 74228.9204, "train_tokens_per_second": 5668.2 }, { "epoch": 0.6477242122273095, "grad_norm": 0.7521586068543743, "learning_rate": 7.628166069533235e-06, "loss": 0.3800983905792236, "num_input_tokens_seen": 420951552, "step": 9620, "train_runtime": 74264.9231, "train_tokens_per_second": 5668.242 }, { "epoch": 0.6480608672232696, "grad_norm": 0.8746614520646498, "learning_rate": 7.625916351578141e-06, "loss": 0.4101721286773682, "num_input_tokens_seen": 421168904, "step": 9625, "train_runtime": 74302.0251, "train_tokens_per_second": 5668.337 }, { "epoch": 0.6483975222192297, "grad_norm": 0.645310594782184, "learning_rate": 7.623665899293914e-06, "loss": 0.35078365802764894, "num_input_tokens_seen": 421386640, "step": 9630, "train_runtime": 74343.6656, "train_tokens_per_second": 5668.091 }, { "epoch": 0.6487341772151899, "grad_norm": 0.709824008157462, "learning_rate": 7.621414713309885e-06, "loss": 0.3464890241622925, "num_input_tokens_seen": 421604504, "step": 9635, "train_runtime": 74380.7993, "train_tokens_per_second": 5668.19 }, { "epoch": 0.64907083221115, "grad_norm": 0.6987475287759364, "learning_rate": 7.61916279425559e-06, "loss": 0.38260612487792967, "num_input_tokens_seen": 421833672, "step": 9640, "train_runtime": 74422.4312, "train_tokens_per_second": 5668.099 }, { "epoch": 0.6494074872071102, "grad_norm": 0.727875668145333, "learning_rate": 7.6169101427607716e-06, "loss": 0.38509573936462405, "num_input_tokens_seen": 422067496, "step": 9645, "train_runtime": 74456.6368, "train_tokens_per_second": 5668.635 }, { "epoch": 0.6497441422030703, "grad_norm": 0.7549567194100304, "learning_rate": 7.614656759455375e-06, "loss": 0.38222179412841795, "num_input_tokens_seen": 422289144, "step": 9650, "train_runtime": 74495.8893, "train_tokens_per_second": 5668.623 }, { "epoch": 0.6500807971990304, "grad_norm": 0.8363753913347584, "learning_rate": 7.612402644969555e-06, "loss": 0.38720729351043703, "num_input_tokens_seen": 422500848, "step": 9655, "train_runtime": 74537.09, "train_tokens_per_second": 5668.33 }, { "epoch": 0.6504174521949906, "grad_norm": 0.718216642211442, "learning_rate": 7.6101477999336646e-06, "loss": 0.37707133293151857, "num_input_tokens_seen": 422718672, "step": 9660, "train_runtime": 74584.7849, "train_tokens_per_second": 5667.626 }, { "epoch": 0.6507541071909507, "grad_norm": 0.8872821374211818, "learning_rate": 7.607892224978266e-06, "loss": 0.3739673376083374, "num_input_tokens_seen": 422929480, "step": 9665, "train_runtime": 74620.552, "train_tokens_per_second": 5667.735 }, { "epoch": 0.6510907621869109, "grad_norm": 0.691277480453269, "learning_rate": 7.605635920734122e-06, "loss": 0.3418617010116577, "num_input_tokens_seen": 423142128, "step": 9670, "train_runtime": 74655.9636, "train_tokens_per_second": 5667.895 }, { "epoch": 0.651427417182871, "grad_norm": 0.9025153211455825, "learning_rate": 7.603378887832202e-06, "loss": 0.3855189561843872, "num_input_tokens_seen": 423349056, "step": 9675, "train_runtime": 74695.4667, "train_tokens_per_second": 5667.667 }, { "epoch": 0.6517640721788311, "grad_norm": 0.7073570329177757, "learning_rate": 7.601121126903676e-06, "loss": 0.3803261280059814, "num_input_tokens_seen": 423573240, "step": 9680, "train_runtime": 74738.2061, "train_tokens_per_second": 5667.426 }, { "epoch": 0.6521007271747913, "grad_norm": 0.7609618594052814, "learning_rate": 7.598862638579922e-06, "loss": 0.3738381385803223, "num_input_tokens_seen": 423809440, "step": 9685, "train_runtime": 74781.8146, "train_tokens_per_second": 5667.279 }, { "epoch": 0.6524373821707514, "grad_norm": 0.6698743309851123, "learning_rate": 7.5966034234925205e-06, "loss": 0.3761345624923706, "num_input_tokens_seen": 424041528, "step": 9690, "train_runtime": 74821.3132, "train_tokens_per_second": 5667.39 }, { "epoch": 0.6527740371667116, "grad_norm": 0.7414693193437045, "learning_rate": 7.59434348227325e-06, "loss": 0.43105735778808596, "num_input_tokens_seen": 424268184, "step": 9695, "train_runtime": 74855.3245, "train_tokens_per_second": 5667.842 }, { "epoch": 0.6531106921626717, "grad_norm": 0.8237582570303243, "learning_rate": 7.592082815554098e-06, "loss": 0.40675368309021, "num_input_tokens_seen": 424492616, "step": 9700, "train_runtime": 74894.094, "train_tokens_per_second": 5667.905 }, { "epoch": 0.6534473471586318, "grad_norm": 0.9212376319324829, "learning_rate": 7.58982142396725e-06, "loss": 0.419390869140625, "num_input_tokens_seen": 424686848, "step": 9705, "train_runtime": 74939.3759, "train_tokens_per_second": 5667.072 }, { "epoch": 0.653784002154592, "grad_norm": 0.7691414977900423, "learning_rate": 7.5875593081451e-06, "loss": 0.3695266008377075, "num_input_tokens_seen": 424913632, "step": 9710, "train_runtime": 74985.8205, "train_tokens_per_second": 5666.586 }, { "epoch": 0.6541206571505521, "grad_norm": 0.7263975698689714, "learning_rate": 7.585296468720243e-06, "loss": 0.3619475126266479, "num_input_tokens_seen": 425139040, "step": 9715, "train_runtime": 75026.5575, "train_tokens_per_second": 5666.514 }, { "epoch": 0.6544573121465123, "grad_norm": 0.712706963298683, "learning_rate": 7.5830329063254705e-06, "loss": 0.38277277946472166, "num_input_tokens_seen": 425352824, "step": 9720, "train_runtime": 75065.2226, "train_tokens_per_second": 5666.443 }, { "epoch": 0.6547939671424724, "grad_norm": 0.6764513937336157, "learning_rate": 7.5807686215937835e-06, "loss": 0.38765199184417726, "num_input_tokens_seen": 425565784, "step": 9725, "train_runtime": 75105.3744, "train_tokens_per_second": 5666.249 }, { "epoch": 0.6551306221384325, "grad_norm": 0.7196173883927505, "learning_rate": 7.578503615158379e-06, "loss": 0.3398409366607666, "num_input_tokens_seen": 425778128, "step": 9730, "train_runtime": 75149.2065, "train_tokens_per_second": 5665.77 }, { "epoch": 0.6554672771343927, "grad_norm": 0.646960134820036, "learning_rate": 7.576237887652662e-06, "loss": 0.38698830604553225, "num_input_tokens_seen": 426007040, "step": 9735, "train_runtime": 75188.2698, "train_tokens_per_second": 5665.871 }, { "epoch": 0.6558039321303528, "grad_norm": 0.8063318146524463, "learning_rate": 7.573971439710235e-06, "loss": 0.34668645858764646, "num_input_tokens_seen": 426223488, "step": 9740, "train_runtime": 75225.1526, "train_tokens_per_second": 5665.97 }, { "epoch": 0.656140587126313, "grad_norm": 0.8258091202754753, "learning_rate": 7.571704271964902e-06, "loss": 0.3675506591796875, "num_input_tokens_seen": 426433528, "step": 9745, "train_runtime": 75260.6499, "train_tokens_per_second": 5666.089 }, { "epoch": 0.6564772421222731, "grad_norm": 0.8027675726296949, "learning_rate": 7.56943638505067e-06, "loss": 0.3636334419250488, "num_input_tokens_seen": 426658696, "step": 9750, "train_runtime": 75296.5611, "train_tokens_per_second": 5666.377 }, { "epoch": 0.6568138971182332, "grad_norm": 0.7190477185688757, "learning_rate": 7.567167779601746e-06, "loss": 0.39123508930206297, "num_input_tokens_seen": 426886792, "step": 9755, "train_runtime": 75338.0495, "train_tokens_per_second": 5666.284 }, { "epoch": 0.6571505521141934, "grad_norm": 0.7906692823017727, "learning_rate": 7.56489845625254e-06, "loss": 0.413257360458374, "num_input_tokens_seen": 427104192, "step": 9760, "train_runtime": 75386.2254, "train_tokens_per_second": 5665.547 }, { "epoch": 0.6574872071101535, "grad_norm": 0.7301115269654299, "learning_rate": 7.562628415637659e-06, "loss": 0.369996976852417, "num_input_tokens_seen": 427312504, "step": 9765, "train_runtime": 75426.5577, "train_tokens_per_second": 5665.279 }, { "epoch": 0.6578238621061137, "grad_norm": 0.7224806256488935, "learning_rate": 7.560357658391913e-06, "loss": 0.4071043491363525, "num_input_tokens_seen": 427533792, "step": 9770, "train_runtime": 75465.4869, "train_tokens_per_second": 5665.289 }, { "epoch": 0.6581605171020738, "grad_norm": 0.7268098674561758, "learning_rate": 7.558086185150311e-06, "loss": 0.3804465770721436, "num_input_tokens_seen": 427747608, "step": 9775, "train_runtime": 75507.0805, "train_tokens_per_second": 5665.0 }, { "epoch": 0.6584971720980339, "grad_norm": 0.7850729912855515, "learning_rate": 7.555813996548065e-06, "loss": 0.40397090911865235, "num_input_tokens_seen": 427972008, "step": 9780, "train_runtime": 75543.708, "train_tokens_per_second": 5665.224 }, { "epoch": 0.6588338270939941, "grad_norm": 0.7662329566093665, "learning_rate": 7.553541093220586e-06, "loss": 0.3842537641525269, "num_input_tokens_seen": 428186312, "step": 9785, "train_runtime": 75579.4178, "train_tokens_per_second": 5665.383 }, { "epoch": 0.6591704820899542, "grad_norm": 0.70627363493871, "learning_rate": 7.551267475803481e-06, "loss": 0.37559702396392824, "num_input_tokens_seen": 428413952, "step": 9790, "train_runtime": 75619.0124, "train_tokens_per_second": 5665.426 }, { "epoch": 0.6595071370859144, "grad_norm": 0.7354101668176468, "learning_rate": 7.5489931449325635e-06, "loss": 0.3736457347869873, "num_input_tokens_seen": 428630728, "step": 9795, "train_runtime": 75658.6215, "train_tokens_per_second": 5665.326 }, { "epoch": 0.6598437920818745, "grad_norm": 0.7892531883838505, "learning_rate": 7.546718101243842e-06, "loss": 0.39138045310974123, "num_input_tokens_seen": 428842760, "step": 9800, "train_runtime": 75693.8787, "train_tokens_per_second": 5665.488 }, { "epoch": 0.6601804470778346, "grad_norm": 0.8775677410278766, "learning_rate": 7.544442345373522e-06, "loss": 0.3698113918304443, "num_input_tokens_seen": 429051072, "step": 9805, "train_runtime": 75734.5916, "train_tokens_per_second": 5665.193 }, { "epoch": 0.6605171020737948, "grad_norm": 0.6944135512445987, "learning_rate": 7.542165877958014e-06, "loss": 0.3717064380645752, "num_input_tokens_seen": 429266232, "step": 9810, "train_runtime": 75771.7628, "train_tokens_per_second": 5665.253 }, { "epoch": 0.6608537570697549, "grad_norm": 0.7361334690779209, "learning_rate": 7.539888699633926e-06, "loss": 0.38160529136657717, "num_input_tokens_seen": 429495032, "step": 9815, "train_runtime": 75808.8176, "train_tokens_per_second": 5665.502 }, { "epoch": 0.661190412065715, "grad_norm": 0.8126000202476551, "learning_rate": 7.5376108110380606e-06, "loss": 0.34899187088012695, "num_input_tokens_seen": 429723384, "step": 9820, "train_runtime": 75847.4225, "train_tokens_per_second": 5665.629 }, { "epoch": 0.6615270670616752, "grad_norm": 0.6957748548678448, "learning_rate": 7.535332212807426e-06, "loss": 0.3428369998931885, "num_input_tokens_seen": 429924744, "step": 9825, "train_runtime": 75886.3897, "train_tokens_per_second": 5665.374 }, { "epoch": 0.6618637220576353, "grad_norm": 0.7233083648231398, "learning_rate": 7.53305290557922e-06, "loss": 0.39725618362426757, "num_input_tokens_seen": 430154928, "step": 9830, "train_runtime": 75925.3068, "train_tokens_per_second": 5665.501 }, { "epoch": 0.6622003770535955, "grad_norm": 0.7049996354735961, "learning_rate": 7.530772889990848e-06, "loss": 0.3740149974822998, "num_input_tokens_seen": 430386800, "step": 9835, "train_runtime": 75959.5503, "train_tokens_per_second": 5666.0 }, { "epoch": 0.6625370320495556, "grad_norm": 0.6720383481048683, "learning_rate": 7.528492166679907e-06, "loss": 0.35007429122924805, "num_input_tokens_seen": 430616592, "step": 9840, "train_runtime": 76001.567, "train_tokens_per_second": 5665.891 }, { "epoch": 0.6628736870455157, "grad_norm": 0.6809307882652357, "learning_rate": 7.526210736284194e-06, "loss": 0.38547792434692385, "num_input_tokens_seen": 430820368, "step": 9845, "train_runtime": 76036.0252, "train_tokens_per_second": 5666.003 }, { "epoch": 0.6632103420414759, "grad_norm": 0.7241468747622457, "learning_rate": 7.523928599441706e-06, "loss": 0.3851293087005615, "num_input_tokens_seen": 431045232, "step": 9850, "train_runtime": 76076.642, "train_tokens_per_second": 5665.934 }, { "epoch": 0.663546997037436, "grad_norm": 0.8065697031009399, "learning_rate": 7.5216457567906295e-06, "loss": 0.3921393632888794, "num_input_tokens_seen": 431272728, "step": 9855, "train_runtime": 76119.1303, "train_tokens_per_second": 5665.76 }, { "epoch": 0.6638836520333962, "grad_norm": 0.7363581812525671, "learning_rate": 7.519362208969362e-06, "loss": 0.3589025974273682, "num_input_tokens_seen": 431497576, "step": 9860, "train_runtime": 76164.9303, "train_tokens_per_second": 5665.305 }, { "epoch": 0.6642203070293563, "grad_norm": 0.7028175355387544, "learning_rate": 7.5170779566164855e-06, "loss": 0.39649462699890137, "num_input_tokens_seen": 431716768, "step": 9865, "train_runtime": 76207.7038, "train_tokens_per_second": 5665.002 }, { "epoch": 0.6645569620253164, "grad_norm": 0.8083377822452007, "learning_rate": 7.514793000370783e-06, "loss": 0.39783761501312254, "num_input_tokens_seen": 431927680, "step": 9870, "train_runtime": 76252.3393, "train_tokens_per_second": 5664.452 }, { "epoch": 0.6648936170212766, "grad_norm": 0.7361462900334614, "learning_rate": 7.512507340871239e-06, "loss": 0.3664602756500244, "num_input_tokens_seen": 432144784, "step": 9875, "train_runtime": 76293.2197, "train_tokens_per_second": 5664.262 }, { "epoch": 0.6652302720172367, "grad_norm": 0.7771322596278541, "learning_rate": 7.510220978757028e-06, "loss": 0.39647390842437746, "num_input_tokens_seen": 432361504, "step": 9880, "train_runtime": 76335.1474, "train_tokens_per_second": 5663.99 }, { "epoch": 0.6655669270131969, "grad_norm": 0.9351257512839886, "learning_rate": 7.507933914667524e-06, "loss": 0.4201164722442627, "num_input_tokens_seen": 432586992, "step": 9885, "train_runtime": 76375.8314, "train_tokens_per_second": 5663.925 }, { "epoch": 0.665903582009157, "grad_norm": 0.7531976870702812, "learning_rate": 7.505646149242299e-06, "loss": 0.37460851669311523, "num_input_tokens_seen": 432809080, "step": 9890, "train_runtime": 76415.9118, "train_tokens_per_second": 5663.861 }, { "epoch": 0.6662402370051171, "grad_norm": 0.719734237163997, "learning_rate": 7.503357683121119e-06, "loss": 0.34871246814727785, "num_input_tokens_seen": 433035120, "step": 9895, "train_runtime": 76462.7297, "train_tokens_per_second": 5663.349 }, { "epoch": 0.6665768920010773, "grad_norm": 0.7130561120719486, "learning_rate": 7.501068516943944e-06, "loss": 0.3231820583343506, "num_input_tokens_seen": 433248272, "step": 9900, "train_runtime": 76502.2615, "train_tokens_per_second": 5663.209 }, { "epoch": 0.6669135469970374, "grad_norm": 0.6874890275442226, "learning_rate": 7.498778651350934e-06, "loss": 0.3865694284439087, "num_input_tokens_seen": 433472920, "step": 9905, "train_runtime": 76539.0929, "train_tokens_per_second": 5663.419 }, { "epoch": 0.6672502019929976, "grad_norm": 0.6837593508656135, "learning_rate": 7.496488086982443e-06, "loss": 0.3751338720321655, "num_input_tokens_seen": 433694440, "step": 9910, "train_runtime": 76582.0454, "train_tokens_per_second": 5663.135 }, { "epoch": 0.6675868569889577, "grad_norm": 0.834960347653905, "learning_rate": 7.494196824479019e-06, "loss": 0.37354316711425783, "num_input_tokens_seen": 433909064, "step": 9915, "train_runtime": 76619.6521, "train_tokens_per_second": 5663.156 }, { "epoch": 0.6679235119849178, "grad_norm": 0.6905943083082271, "learning_rate": 7.491904864481406e-06, "loss": 0.3818557024002075, "num_input_tokens_seen": 434122768, "step": 9920, "train_runtime": 76661.7307, "train_tokens_per_second": 5662.835 }, { "epoch": 0.668260166980878, "grad_norm": 0.6608540738794552, "learning_rate": 7.489612207630543e-06, "loss": 0.34175124168396, "num_input_tokens_seen": 434354528, "step": 9925, "train_runtime": 76695.5171, "train_tokens_per_second": 5663.363 }, { "epoch": 0.6685968219768381, "grad_norm": 0.747448764956391, "learning_rate": 7.487318854567566e-06, "loss": 0.37988905906677245, "num_input_tokens_seen": 434564096, "step": 9930, "train_runtime": 76729.4177, "train_tokens_per_second": 5663.592 }, { "epoch": 0.6689334769727983, "grad_norm": 0.7551042289550628, "learning_rate": 7.485024805933803e-06, "loss": 0.3599559307098389, "num_input_tokens_seen": 434767584, "step": 9935, "train_runtime": 76765.8819, "train_tokens_per_second": 5663.552 }, { "epoch": 0.6692701319687584, "grad_norm": 0.6631253047912142, "learning_rate": 7.482730062370776e-06, "loss": 0.3699958086013794, "num_input_tokens_seen": 434981392, "step": 9940, "train_runtime": 76810.3453, "train_tokens_per_second": 5663.057 }, { "epoch": 0.6696067869647185, "grad_norm": 0.7419282684235264, "learning_rate": 7.480434624520205e-06, "loss": 0.3593663215637207, "num_input_tokens_seen": 435217648, "step": 9945, "train_runtime": 76843.0552, "train_tokens_per_second": 5663.721 }, { "epoch": 0.6699434419606787, "grad_norm": 0.7057608866633803, "learning_rate": 7.478138493024001e-06, "loss": 0.3879536151885986, "num_input_tokens_seen": 435444608, "step": 9950, "train_runtime": 76882.5546, "train_tokens_per_second": 5663.764 }, { "epoch": 0.6702800969566388, "grad_norm": 0.740329239724491, "learning_rate": 7.475841668524268e-06, "loss": 0.34809188842773436, "num_input_tokens_seen": 435656280, "step": 9955, "train_runtime": 76923.9627, "train_tokens_per_second": 5663.466 }, { "epoch": 0.670616751952599, "grad_norm": 0.8121045332443452, "learning_rate": 7.473544151663309e-06, "loss": 0.4048673152923584, "num_input_tokens_seen": 435875456, "step": 9960, "train_runtime": 76958.8069, "train_tokens_per_second": 5663.75 }, { "epoch": 0.6709534069485591, "grad_norm": 0.8149107981141157, "learning_rate": 7.471245943083615e-06, "loss": 0.3677277326583862, "num_input_tokens_seen": 436097568, "step": 9965, "train_runtime": 76998.2656, "train_tokens_per_second": 5663.732 }, { "epoch": 0.6712900619445192, "grad_norm": 0.7104981842358721, "learning_rate": 7.468947043427873e-06, "loss": 0.3423744201660156, "num_input_tokens_seen": 436314872, "step": 9970, "train_runtime": 77032.0267, "train_tokens_per_second": 5664.071 }, { "epoch": 0.6716267169404794, "grad_norm": 0.8060621663622469, "learning_rate": 7.466647453338965e-06, "loss": 0.38165833950042727, "num_input_tokens_seen": 436524088, "step": 9975, "train_runtime": 77070.1105, "train_tokens_per_second": 5663.987 }, { "epoch": 0.6719633719364395, "grad_norm": 0.6817255880743095, "learning_rate": 7.464347173459958e-06, "loss": 0.3900636911392212, "num_input_tokens_seen": 436763792, "step": 9980, "train_runtime": 77108.4939, "train_tokens_per_second": 5664.276 }, { "epoch": 0.6723000269323997, "grad_norm": 0.5849966120883113, "learning_rate": 7.462046204434126e-06, "loss": 0.35174126625061036, "num_input_tokens_seen": 437001592, "step": 9985, "train_runtime": 77143.495, "train_tokens_per_second": 5664.789 }, { "epoch": 0.6726366819283598, "grad_norm": 0.819711833914903, "learning_rate": 7.459744546904922e-06, "loss": 0.37253947257995607, "num_input_tokens_seen": 437217472, "step": 9990, "train_runtime": 77177.4484, "train_tokens_per_second": 5665.094 }, { "epoch": 0.6729733369243199, "grad_norm": 0.7103670160362342, "learning_rate": 7.457442201516001e-06, "loss": 0.34635467529296876, "num_input_tokens_seen": 437432256, "step": 9995, "train_runtime": 77222.7561, "train_tokens_per_second": 5664.551 }, { "epoch": 0.6733099919202801, "grad_norm": 0.7772791959365979, "learning_rate": 7.455139168911203e-06, "loss": 0.3714813232421875, "num_input_tokens_seen": 437632184, "step": 10000, "train_runtime": 77259.692, "train_tokens_per_second": 5664.431 }, { "epoch": 0.6736466469162402, "grad_norm": 0.8663644820452563, "learning_rate": 7.452835449734564e-06, "loss": 0.37085671424865724, "num_input_tokens_seen": 437852448, "step": 10005, "train_runtime": 77297.557, "train_tokens_per_second": 5664.506 }, { "epoch": 0.6739833019122003, "grad_norm": 0.6628154115799231, "learning_rate": 7.450531044630315e-06, "loss": 0.35476658344268797, "num_input_tokens_seen": 438072720, "step": 10010, "train_runtime": 77330.8077, "train_tokens_per_second": 5664.918 }, { "epoch": 0.6743199569081605, "grad_norm": 0.7435766802454172, "learning_rate": 7.448225954242874e-06, "loss": 0.3909281253814697, "num_input_tokens_seen": 438300752, "step": 10015, "train_runtime": 77372.9883, "train_tokens_per_second": 5664.777 }, { "epoch": 0.6746566119041206, "grad_norm": 0.7076966807661021, "learning_rate": 7.44592017921685e-06, "loss": 0.37700977325439455, "num_input_tokens_seen": 438521952, "step": 10020, "train_runtime": 77408.1985, "train_tokens_per_second": 5665.058 }, { "epoch": 0.6749932669000808, "grad_norm": 0.7283120289124543, "learning_rate": 7.443613720197048e-06, "loss": 0.39572868347167967, "num_input_tokens_seen": 438742144, "step": 10025, "train_runtime": 77451.6366, "train_tokens_per_second": 5664.724 }, { "epoch": 0.6753299218960409, "grad_norm": 0.8184114176248545, "learning_rate": 7.44130657782846e-06, "loss": 0.35796802043914794, "num_input_tokens_seen": 438946944, "step": 10030, "train_runtime": 77487.5196, "train_tokens_per_second": 5664.744 }, { "epoch": 0.675666576892001, "grad_norm": 0.7168914852518904, "learning_rate": 7.438998752756274e-06, "loss": 0.3807486057281494, "num_input_tokens_seen": 439164968, "step": 10035, "train_runtime": 77530.1548, "train_tokens_per_second": 5664.441 }, { "epoch": 0.6760032318879612, "grad_norm": 0.7003642669524813, "learning_rate": 7.436690245625864e-06, "loss": 0.36953206062316896, "num_input_tokens_seen": 439382032, "step": 10040, "train_runtime": 77568.57, "train_tokens_per_second": 5664.434 }, { "epoch": 0.6763398868839213, "grad_norm": 0.8332693301417188, "learning_rate": 7.434381057082797e-06, "loss": 0.369028639793396, "num_input_tokens_seen": 439590072, "step": 10045, "train_runtime": 77608.9784, "train_tokens_per_second": 5664.165 }, { "epoch": 0.6766765418798815, "grad_norm": 0.7659413901414965, "learning_rate": 7.4320711877728305e-06, "loss": 0.3970766067504883, "num_input_tokens_seen": 439814224, "step": 10050, "train_runtime": 77655.5893, "train_tokens_per_second": 5663.652 }, { "epoch": 0.6770131968758416, "grad_norm": 0.7616766803709787, "learning_rate": 7.429760638341909e-06, "loss": 0.34726481437683104, "num_input_tokens_seen": 440013360, "step": 10055, "train_runtime": 77694.3971, "train_tokens_per_second": 5663.386 }, { "epoch": 0.6773498518718017, "grad_norm": 0.7214303745868783, "learning_rate": 7.427449409436176e-06, "loss": 0.42118000984191895, "num_input_tokens_seen": 440232216, "step": 10060, "train_runtime": 77735.8693, "train_tokens_per_second": 5663.18 }, { "epoch": 0.6776865068677619, "grad_norm": 0.6480309395843215, "learning_rate": 7.425137501701955e-06, "loss": 0.35333929061889646, "num_input_tokens_seen": 440465120, "step": 10065, "train_runtime": 77778.1439, "train_tokens_per_second": 5663.096 }, { "epoch": 0.678023161863722, "grad_norm": 0.8425975984479226, "learning_rate": 7.422824915785765e-06, "loss": 0.3732592582702637, "num_input_tokens_seen": 440684520, "step": 10070, "train_runtime": 77813.6788, "train_tokens_per_second": 5663.33 }, { "epoch": 0.6783598168596822, "grad_norm": 0.7751732244738783, "learning_rate": 7.420511652334313e-06, "loss": 0.3922509431838989, "num_input_tokens_seen": 440888096, "step": 10075, "train_runtime": 77856.5574, "train_tokens_per_second": 5662.825 }, { "epoch": 0.6786964718556423, "grad_norm": 0.746917656110605, "learning_rate": 7.418197711994495e-06, "loss": 0.3609792947769165, "num_input_tokens_seen": 441099168, "step": 10080, "train_runtime": 77896.5389, "train_tokens_per_second": 5662.629 }, { "epoch": 0.6790331268516024, "grad_norm": 0.7979148491415948, "learning_rate": 7.4158830954133984e-06, "loss": 0.37356295585632326, "num_input_tokens_seen": 441329664, "step": 10085, "train_runtime": 77936.3536, "train_tokens_per_second": 5662.693 }, { "epoch": 0.6793697818475626, "grad_norm": 0.7047169214626602, "learning_rate": 7.413567803238298e-06, "loss": 0.36446294784545896, "num_input_tokens_seen": 441545160, "step": 10090, "train_runtime": 77973.8265, "train_tokens_per_second": 5662.736 }, { "epoch": 0.6797064368435227, "grad_norm": 0.6385696916431561, "learning_rate": 7.411251836116658e-06, "loss": 0.3654582977294922, "num_input_tokens_seen": 441770600, "step": 10095, "train_runtime": 78021.2974, "train_tokens_per_second": 5662.18 }, { "epoch": 0.6800430918394829, "grad_norm": 0.675501708680357, "learning_rate": 7.408935194696132e-06, "loss": 0.38489809036254885, "num_input_tokens_seen": 441989608, "step": 10100, "train_runtime": 78062.7748, "train_tokens_per_second": 5661.977 }, { "epoch": 0.680379746835443, "grad_norm": 0.6976086448861777, "learning_rate": 7.406617879624558e-06, "loss": 0.39519965648651123, "num_input_tokens_seen": 442219464, "step": 10105, "train_runtime": 78104.0438, "train_tokens_per_second": 5661.928 }, { "epoch": 0.6807164018314031, "grad_norm": 0.6737767286617782, "learning_rate": 7.40429989154997e-06, "loss": 0.35456171035766604, "num_input_tokens_seen": 442434504, "step": 10110, "train_runtime": 78146.9907, "train_tokens_per_second": 5661.568 }, { "epoch": 0.6810530568273633, "grad_norm": 0.6824592254845565, "learning_rate": 7.4019812311205826e-06, "loss": 0.396740984916687, "num_input_tokens_seen": 442663960, "step": 10115, "train_runtime": 78186.9172, "train_tokens_per_second": 5661.612 }, { "epoch": 0.6813897118233234, "grad_norm": 0.6995329567504307, "learning_rate": 7.399661898984805e-06, "loss": 0.39820547103881837, "num_input_tokens_seen": 442904544, "step": 10120, "train_runtime": 78228.9374, "train_tokens_per_second": 5661.646 }, { "epoch": 0.6817263668192836, "grad_norm": 0.7146974067721376, "learning_rate": 7.397341895791228e-06, "loss": 0.3785873889923096, "num_input_tokens_seen": 443119656, "step": 10125, "train_runtime": 78271.2656, "train_tokens_per_second": 5661.332 }, { "epoch": 0.6820630218152437, "grad_norm": 0.7979315787216683, "learning_rate": 7.395021222188634e-06, "loss": 0.37588326930999755, "num_input_tokens_seen": 443345048, "step": 10130, "train_runtime": 78307.7048, "train_tokens_per_second": 5661.576 }, { "epoch": 0.6823996768112038, "grad_norm": 0.8569372783831029, "learning_rate": 7.392699878825993e-06, "loss": 0.4026289939880371, "num_input_tokens_seen": 443550416, "step": 10135, "train_runtime": 78348.8182, "train_tokens_per_second": 5661.227 }, { "epoch": 0.682736331807164, "grad_norm": 0.6799351048003278, "learning_rate": 7.390377866352462e-06, "loss": 0.3739679574966431, "num_input_tokens_seen": 443760728, "step": 10140, "train_runtime": 78391.1203, "train_tokens_per_second": 5660.855 }, { "epoch": 0.6830729868031241, "grad_norm": 0.7679162845866374, "learning_rate": 7.388055185417382e-06, "loss": 0.36473128795623777, "num_input_tokens_seen": 443986040, "step": 10145, "train_runtime": 78429.781, "train_tokens_per_second": 5660.937 }, { "epoch": 0.6834096417990843, "grad_norm": 0.7045812738235366, "learning_rate": 7.3857318366702844e-06, "loss": 0.35809712409973143, "num_input_tokens_seen": 444206480, "step": 10150, "train_runtime": 78472.8507, "train_tokens_per_second": 5660.639 }, { "epoch": 0.6837462967950444, "grad_norm": 0.7004993125342208, "learning_rate": 7.383407820760885e-06, "loss": 0.3713981151580811, "num_input_tokens_seen": 444432096, "step": 10155, "train_runtime": 78515.6453, "train_tokens_per_second": 5660.427 }, { "epoch": 0.6840829517910045, "grad_norm": 0.7774580479484972, "learning_rate": 7.381083138339089e-06, "loss": 0.38779325485229493, "num_input_tokens_seen": 444643008, "step": 10160, "train_runtime": 78555.8979, "train_tokens_per_second": 5660.212 }, { "epoch": 0.6844196067869647, "grad_norm": 0.7163976333149118, "learning_rate": 7.378757790054988e-06, "loss": 0.39658608436584475, "num_input_tokens_seen": 444875528, "step": 10165, "train_runtime": 78592.4434, "train_tokens_per_second": 5660.538 }, { "epoch": 0.6847562617829248, "grad_norm": 0.7470536381083663, "learning_rate": 7.376431776558855e-06, "loss": 0.3956130504608154, "num_input_tokens_seen": 445097312, "step": 10170, "train_runtime": 78630.7483, "train_tokens_per_second": 5660.601 }, { "epoch": 0.685092916778885, "grad_norm": 0.7408806601027974, "learning_rate": 7.3741050985011546e-06, "loss": 0.3585235118865967, "num_input_tokens_seen": 445319152, "step": 10175, "train_runtime": 78670.4341, "train_tokens_per_second": 5660.566 }, { "epoch": 0.6854295717748451, "grad_norm": 0.7086975222942481, "learning_rate": 7.371777756532531e-06, "loss": 0.34885153770446775, "num_input_tokens_seen": 445544848, "step": 10180, "train_runtime": 78704.6359, "train_tokens_per_second": 5660.973 }, { "epoch": 0.6857662267708052, "grad_norm": 0.7956956482990667, "learning_rate": 7.369449751303823e-06, "loss": 0.3933322191238403, "num_input_tokens_seen": 445764768, "step": 10185, "train_runtime": 78741.4834, "train_tokens_per_second": 5661.117 }, { "epoch": 0.6861028817667654, "grad_norm": 0.5998016401864463, "learning_rate": 7.367121083466048e-06, "loss": 0.3657109498977661, "num_input_tokens_seen": 445988536, "step": 10190, "train_runtime": 78776.8049, "train_tokens_per_second": 5661.419 }, { "epoch": 0.6864395367627255, "grad_norm": 0.8579022323586973, "learning_rate": 7.364791753670409e-06, "loss": 0.3847865104675293, "num_input_tokens_seen": 446213600, "step": 10195, "train_runtime": 78810.0378, "train_tokens_per_second": 5661.888 }, { "epoch": 0.6867761917586857, "grad_norm": 0.729478615131132, "learning_rate": 7.362461762568298e-06, "loss": 0.372448205947876, "num_input_tokens_seen": 446432912, "step": 10200, "train_runtime": 78848.3501, "train_tokens_per_second": 5661.918 }, { "epoch": 0.6871128467546458, "grad_norm": 0.67715047966365, "learning_rate": 7.360131110811287e-06, "loss": 0.3532183408737183, "num_input_tokens_seen": 446656416, "step": 10205, "train_runtime": 78888.3323, "train_tokens_per_second": 5661.882 }, { "epoch": 0.6874495017506059, "grad_norm": 0.7095724500319497, "learning_rate": 7.357799799051138e-06, "loss": 0.3632460355758667, "num_input_tokens_seen": 446871712, "step": 10210, "train_runtime": 78927.4603, "train_tokens_per_second": 5661.803 }, { "epoch": 0.6877861567465661, "grad_norm": 0.9476488222825441, "learning_rate": 7.355467827939794e-06, "loss": 0.38349783420562744, "num_input_tokens_seen": 447082192, "step": 10215, "train_runtime": 78967.9316, "train_tokens_per_second": 5661.566 }, { "epoch": 0.6881228117425262, "grad_norm": 0.7980347922355381, "learning_rate": 7.353135198129382e-06, "loss": 0.3912900686264038, "num_input_tokens_seen": 447291168, "step": 10220, "train_runtime": 79002.7871, "train_tokens_per_second": 5661.714 }, { "epoch": 0.6884594667384863, "grad_norm": 0.796413758238857, "learning_rate": 7.350801910272216e-06, "loss": 0.38165950775146484, "num_input_tokens_seen": 447512392, "step": 10225, "train_runtime": 79046.6142, "train_tokens_per_second": 5661.373 }, { "epoch": 0.6887961217344465, "grad_norm": 0.7746118196960639, "learning_rate": 7.348467965020791e-06, "loss": 0.34427103996276853, "num_input_tokens_seen": 447731304, "step": 10230, "train_runtime": 79082.2762, "train_tokens_per_second": 5661.588 }, { "epoch": 0.6891327767304066, "grad_norm": 0.8166556060856294, "learning_rate": 7.3461333630277885e-06, "loss": 0.3613192081451416, "num_input_tokens_seen": 447922416, "step": 10235, "train_runtime": 79117.4476, "train_tokens_per_second": 5661.487 }, { "epoch": 0.6894694317263668, "grad_norm": 0.6976640506234788, "learning_rate": 7.343798104946074e-06, "loss": 0.3512859344482422, "num_input_tokens_seen": 448148520, "step": 10240, "train_runtime": 79156.1315, "train_tokens_per_second": 5661.577 }, { "epoch": 0.6898060867223269, "grad_norm": 0.74195160383717, "learning_rate": 7.341462191428692e-06, "loss": 0.381636905670166, "num_input_tokens_seen": 448364664, "step": 10245, "train_runtime": 79199.1829, "train_tokens_per_second": 5661.228 }, { "epoch": 0.690142741718287, "grad_norm": 0.7527010867181296, "learning_rate": 7.339125623128874e-06, "loss": 0.3913971662521362, "num_input_tokens_seen": 448587016, "step": 10250, "train_runtime": 79248.9634, "train_tokens_per_second": 5660.478 }, { "epoch": 0.6904793967142472, "grad_norm": 0.7210165301469443, "learning_rate": 7.336788400700035e-06, "loss": 0.36610395908355714, "num_input_tokens_seen": 448798728, "step": 10255, "train_runtime": 79292.6113, "train_tokens_per_second": 5660.032 }, { "epoch": 0.6908160517102074, "grad_norm": 0.9096784607094398, "learning_rate": 7.334450524795771e-06, "loss": 0.408566951751709, "num_input_tokens_seen": 449023728, "step": 10260, "train_runtime": 79333.8153, "train_tokens_per_second": 5659.929 }, { "epoch": 0.6911527067061676, "grad_norm": 0.6784070074683265, "learning_rate": 7.332111996069863e-06, "loss": 0.3746421575546265, "num_input_tokens_seen": 449245560, "step": 10265, "train_runtime": 79370.4334, "train_tokens_per_second": 5660.112 }, { "epoch": 0.6914893617021277, "grad_norm": 0.8780985630278836, "learning_rate": 7.32977281517627e-06, "loss": 0.39997851848602295, "num_input_tokens_seen": 449446632, "step": 10270, "train_runtime": 79406.7923, "train_tokens_per_second": 5660.053 }, { "epoch": 0.6918260166980879, "grad_norm": 0.7238138438393178, "learning_rate": 7.3274329827691406e-06, "loss": 0.3859497308731079, "num_input_tokens_seen": 449659944, "step": 10275, "train_runtime": 79449.7577, "train_tokens_per_second": 5659.677 }, { "epoch": 0.692162671694048, "grad_norm": 0.6417831874350313, "learning_rate": 7.325092499502796e-06, "loss": 0.35598082542419435, "num_input_tokens_seen": 449892656, "step": 10280, "train_runtime": 79489.514, "train_tokens_per_second": 5659.774 }, { "epoch": 0.6924993266900081, "grad_norm": 0.6886975793380838, "learning_rate": 7.322751366031751e-06, "loss": 0.3739547967910767, "num_input_tokens_seen": 450115160, "step": 10285, "train_runtime": 79528.7582, "train_tokens_per_second": 5659.779 }, { "epoch": 0.6928359816859683, "grad_norm": 0.8067129855431404, "learning_rate": 7.320409583010691e-06, "loss": 0.3593981027603149, "num_input_tokens_seen": 450339952, "step": 10290, "train_runtime": 79567.7249, "train_tokens_per_second": 5659.832 }, { "epoch": 0.6931726366819284, "grad_norm": 0.720222949795357, "learning_rate": 7.318067151094493e-06, "loss": 0.4208518981933594, "num_input_tokens_seen": 450562568, "step": 10295, "train_runtime": 79603.3438, "train_tokens_per_second": 5660.096 }, { "epoch": 0.6935092916778886, "grad_norm": 0.6662609649687479, "learning_rate": 7.3157240709382046e-06, "loss": 0.3863611936569214, "num_input_tokens_seen": 450794024, "step": 10300, "train_runtime": 79634.484, "train_tokens_per_second": 5660.789 }, { "epoch": 0.6938459466738487, "grad_norm": 0.7343868155686462, "learning_rate": 7.313380343197066e-06, "loss": 0.3639280080795288, "num_input_tokens_seen": 451027856, "step": 10305, "train_runtime": 79674.0903, "train_tokens_per_second": 5660.91 }, { "epoch": 0.6941826016698088, "grad_norm": 0.7926474138155267, "learning_rate": 7.311035968526492e-06, "loss": 0.3794968605041504, "num_input_tokens_seen": 451247432, "step": 10310, "train_runtime": 79715.3108, "train_tokens_per_second": 5660.737 }, { "epoch": 0.694519256665769, "grad_norm": 0.8428213530948624, "learning_rate": 7.308690947582078e-06, "loss": 0.38078649044036866, "num_input_tokens_seen": 451456696, "step": 10315, "train_runtime": 79750.434, "train_tokens_per_second": 5660.868 }, { "epoch": 0.6948559116617291, "grad_norm": 0.7185545573840266, "learning_rate": 7.306345281019602e-06, "loss": 0.37413511276245115, "num_input_tokens_seen": 451677704, "step": 10320, "train_runtime": 79790.1325, "train_tokens_per_second": 5660.822 }, { "epoch": 0.6951925666576892, "grad_norm": 0.7678020136994413, "learning_rate": 7.303998969495023e-06, "loss": 0.40517454147338866, "num_input_tokens_seen": 451892384, "step": 10325, "train_runtime": 79832.0377, "train_tokens_per_second": 5660.539 }, { "epoch": 0.6955292216536494, "grad_norm": 0.7116247415151229, "learning_rate": 7.301652013664479e-06, "loss": 0.39863314628601076, "num_input_tokens_seen": 452118752, "step": 10330, "train_runtime": 79868.7262, "train_tokens_per_second": 5660.773 }, { "epoch": 0.6958658766496095, "grad_norm": 0.7656084452706404, "learning_rate": 7.299304414184288e-06, "loss": 0.40618147850036623, "num_input_tokens_seen": 452338552, "step": 10335, "train_runtime": 79909.7465, "train_tokens_per_second": 5660.618 }, { "epoch": 0.6962025316455697, "grad_norm": 0.6668364749984544, "learning_rate": 7.296956171710951e-06, "loss": 0.3879892587661743, "num_input_tokens_seen": 452573592, "step": 10340, "train_runtime": 79946.2615, "train_tokens_per_second": 5660.973 }, { "epoch": 0.6965391866415298, "grad_norm": 0.8038854323996706, "learning_rate": 7.294607286901146e-06, "loss": 0.3926121711730957, "num_input_tokens_seen": 452795696, "step": 10345, "train_runtime": 79987.6707, "train_tokens_per_second": 5660.819 }, { "epoch": 0.69687584163749, "grad_norm": 0.7769622893093939, "learning_rate": 7.292257760411726e-06, "loss": 0.3886493444442749, "num_input_tokens_seen": 453009328, "step": 10350, "train_runtime": 80023.6895, "train_tokens_per_second": 5660.94 }, { "epoch": 0.6972124966334501, "grad_norm": 0.7478012896643832, "learning_rate": 7.289907592899737e-06, "loss": 0.37845487594604493, "num_input_tokens_seen": 453214464, "step": 10355, "train_runtime": 80062.9601, "train_tokens_per_second": 5660.726 }, { "epoch": 0.6975491516294102, "grad_norm": 0.7047299342802962, "learning_rate": 7.287556785022389e-06, "loss": 0.3894767761230469, "num_input_tokens_seen": 453437368, "step": 10360, "train_runtime": 80102.9256, "train_tokens_per_second": 5660.684 }, { "epoch": 0.6978858066253704, "grad_norm": 0.7604979984461925, "learning_rate": 7.285205337437082e-06, "loss": 0.3892651557922363, "num_input_tokens_seen": 453647680, "step": 10365, "train_runtime": 80141.1595, "train_tokens_per_second": 5660.608 }, { "epoch": 0.6982224616213305, "grad_norm": 0.7970440490683166, "learning_rate": 7.2828532508013895e-06, "loss": 0.399712347984314, "num_input_tokens_seen": 453867592, "step": 10370, "train_runtime": 80178.1608, "train_tokens_per_second": 5660.738 }, { "epoch": 0.6985591166172906, "grad_norm": 0.7584286596844286, "learning_rate": 7.2805005257730625e-06, "loss": 0.3772284030914307, "num_input_tokens_seen": 454087008, "step": 10375, "train_runtime": 80211.2544, "train_tokens_per_second": 5661.138 }, { "epoch": 0.6988957716132508, "grad_norm": 0.6810825697097003, "learning_rate": 7.278147163010037e-06, "loss": 0.36341052055358886, "num_input_tokens_seen": 454313224, "step": 10380, "train_runtime": 80250.7125, "train_tokens_per_second": 5661.174 }, { "epoch": 0.6992324266092109, "grad_norm": 0.7849426670217893, "learning_rate": 7.275793163170423e-06, "loss": 0.36755235195159913, "num_input_tokens_seen": 454539992, "step": 10385, "train_runtime": 80288.0816, "train_tokens_per_second": 5661.363 }, { "epoch": 0.6995690816051711, "grad_norm": 0.7022327990344984, "learning_rate": 7.273438526912506e-06, "loss": 0.3956979990005493, "num_input_tokens_seen": 454748824, "step": 10390, "train_runtime": 80325.0195, "train_tokens_per_second": 5661.36 }, { "epoch": 0.6999057366011312, "grad_norm": 0.7244301627454164, "learning_rate": 7.271083254894757e-06, "loss": 0.36125593185424804, "num_input_tokens_seen": 454962456, "step": 10395, "train_runtime": 80364.6433, "train_tokens_per_second": 5661.227 }, { "epoch": 0.7002423915970913, "grad_norm": 0.7856991901608305, "learning_rate": 7.268727347775815e-06, "loss": 0.3766735076904297, "num_input_tokens_seen": 455189544, "step": 10400, "train_runtime": 80398.3718, "train_tokens_per_second": 5661.676 }, { "epoch": 0.7005790465930515, "grad_norm": 0.7076340782949039, "learning_rate": 7.266370806214506e-06, "loss": 0.32742795944213865, "num_input_tokens_seen": 455409928, "step": 10405, "train_runtime": 80446.5155, "train_tokens_per_second": 5661.027 }, { "epoch": 0.7009157015890116, "grad_norm": 0.6900523877236565, "learning_rate": 7.264013630869827e-06, "loss": 0.37685844898223875, "num_input_tokens_seen": 455626104, "step": 10410, "train_runtime": 80491.2258, "train_tokens_per_second": 5660.569 }, { "epoch": 0.7012523565849718, "grad_norm": 0.6710950318779684, "learning_rate": 7.261655822400957e-06, "loss": 0.39275636672973635, "num_input_tokens_seen": 455857232, "step": 10415, "train_runtime": 80526.04, "train_tokens_per_second": 5660.992 }, { "epoch": 0.7015890115809319, "grad_norm": 0.7198657361358307, "learning_rate": 7.259297381467248e-06, "loss": 0.38013458251953125, "num_input_tokens_seen": 456077832, "step": 10420, "train_runtime": 80569.4365, "train_tokens_per_second": 5660.68 }, { "epoch": 0.701925666576892, "grad_norm": 0.7005819646574629, "learning_rate": 7.2569383087282285e-06, "loss": 0.34854826927185056, "num_input_tokens_seen": 456272960, "step": 10425, "train_runtime": 80611.1139, "train_tokens_per_second": 5660.174 }, { "epoch": 0.7022623215728522, "grad_norm": 0.7072800232396435, "learning_rate": 7.25457860484361e-06, "loss": 0.39771556854248047, "num_input_tokens_seen": 456493600, "step": 10430, "train_runtime": 80651.8402, "train_tokens_per_second": 5660.052 }, { "epoch": 0.7025989765688123, "grad_norm": 0.7445696785976343, "learning_rate": 7.252218270473274e-06, "loss": 0.3760495662689209, "num_input_tokens_seen": 456704912, "step": 10435, "train_runtime": 80692.0569, "train_tokens_per_second": 5659.85 }, { "epoch": 0.7029356315647725, "grad_norm": 0.7457222056984448, "learning_rate": 7.249857306277279e-06, "loss": 0.369310188293457, "num_input_tokens_seen": 456921864, "step": 10440, "train_runtime": 80726.6828, "train_tokens_per_second": 5660.109 }, { "epoch": 0.7032722865607326, "grad_norm": 0.9221604408221112, "learning_rate": 7.247495712915864e-06, "loss": 0.35996944904327394, "num_input_tokens_seen": 457143032, "step": 10445, "train_runtime": 80760.6102, "train_tokens_per_second": 5660.47 }, { "epoch": 0.7036089415566927, "grad_norm": 0.6862985079879047, "learning_rate": 7.245133491049439e-06, "loss": 0.3736717939376831, "num_input_tokens_seen": 457363400, "step": 10450, "train_runtime": 80799.8061, "train_tokens_per_second": 5660.452 }, { "epoch": 0.7039455965526529, "grad_norm": 0.6935497313758425, "learning_rate": 7.242770641338592e-06, "loss": 0.4129630088806152, "num_input_tokens_seen": 457584008, "step": 10455, "train_runtime": 80841.1453, "train_tokens_per_second": 5660.286 }, { "epoch": 0.704282251548613, "grad_norm": 0.7202390162158359, "learning_rate": 7.240407164444088e-06, "loss": 0.36982312202453616, "num_input_tokens_seen": 457798528, "step": 10460, "train_runtime": 80879.602, "train_tokens_per_second": 5660.247 }, { "epoch": 0.7046189065445732, "grad_norm": 0.7863736874260931, "learning_rate": 7.238043061026862e-06, "loss": 0.34938392639160154, "num_input_tokens_seen": 458006080, "step": 10465, "train_runtime": 80921.1996, "train_tokens_per_second": 5659.902 }, { "epoch": 0.7049555615405333, "grad_norm": 0.7013473236004093, "learning_rate": 7.235678331748034e-06, "loss": 0.3546873092651367, "num_input_tokens_seen": 458203208, "step": 10470, "train_runtime": 80956.6805, "train_tokens_per_second": 5659.857 }, { "epoch": 0.7052922165364934, "grad_norm": 0.7707435582118967, "learning_rate": 7.233312977268887e-06, "loss": 0.40183773040771487, "num_input_tokens_seen": 458427952, "step": 10475, "train_runtime": 80993.4895, "train_tokens_per_second": 5660.059 }, { "epoch": 0.7056288715324536, "grad_norm": 0.7366337541289394, "learning_rate": 7.230946998250889e-06, "loss": 0.36978516578674314, "num_input_tokens_seen": 458631504, "step": 10480, "train_runtime": 81028.6939, "train_tokens_per_second": 5660.112 }, { "epoch": 0.7059655265284137, "grad_norm": 0.7121052684917011, "learning_rate": 7.228580395355676e-06, "loss": 0.34577772617340086, "num_input_tokens_seen": 458845056, "step": 10485, "train_runtime": 81072.1146, "train_tokens_per_second": 5659.715 }, { "epoch": 0.7063021815243739, "grad_norm": 0.7741334918584597, "learning_rate": 7.226213169245062e-06, "loss": 0.38037862777709963, "num_input_tokens_seen": 459063872, "step": 10490, "train_runtime": 81113.0274, "train_tokens_per_second": 5659.558 }, { "epoch": 0.706638836520334, "grad_norm": 0.7871663193272351, "learning_rate": 7.223845320581035e-06, "loss": 0.3649828672409058, "num_input_tokens_seen": 459276768, "step": 10495, "train_runtime": 81158.0461, "train_tokens_per_second": 5659.042 }, { "epoch": 0.7069754915162941, "grad_norm": 0.8550643751341503, "learning_rate": 7.221476850025754e-06, "loss": 0.3691579818725586, "num_input_tokens_seen": 459504320, "step": 10500, "train_runtime": 81197.4298, "train_tokens_per_second": 5659.099 }, { "epoch": 0.7073121465122543, "grad_norm": 0.6802216728098077, "learning_rate": 7.219107758241557e-06, "loss": 0.381423807144165, "num_input_tokens_seen": 459726544, "step": 10505, "train_runtime": 81239.3131, "train_tokens_per_second": 5658.917 }, { "epoch": 0.7076488015082144, "grad_norm": 0.7476015422415041, "learning_rate": 7.2167380458909505e-06, "loss": 0.3745572090148926, "num_input_tokens_seen": 459949656, "step": 10510, "train_runtime": 81274.379, "train_tokens_per_second": 5659.221 }, { "epoch": 0.7079854565041745, "grad_norm": 0.6742333237089346, "learning_rate": 7.214367713636619e-06, "loss": 0.375703763961792, "num_input_tokens_seen": 460172128, "step": 10515, "train_runtime": 81312.8461, "train_tokens_per_second": 5659.28 }, { "epoch": 0.7083221115001347, "grad_norm": 0.6954522791161296, "learning_rate": 7.211996762141418e-06, "loss": 0.37557039260864256, "num_input_tokens_seen": 460390848, "step": 10520, "train_runtime": 81345.9866, "train_tokens_per_second": 5659.663 }, { "epoch": 0.7086587664960948, "grad_norm": 0.7339967212433919, "learning_rate": 7.209625192068374e-06, "loss": 0.4028931617736816, "num_input_tokens_seen": 460611832, "step": 10525, "train_runtime": 81379.8389, "train_tokens_per_second": 5660.024 }, { "epoch": 0.708995421492055, "grad_norm": 0.701987120656059, "learning_rate": 7.207253004080692e-06, "loss": 0.37696285247802735, "num_input_tokens_seen": 460844344, "step": 10530, "train_runtime": 81418.5196, "train_tokens_per_second": 5660.191 }, { "epoch": 0.7093320764880151, "grad_norm": 0.7755594445584074, "learning_rate": 7.204880198841746e-06, "loss": 0.34694790840148926, "num_input_tokens_seen": 461058504, "step": 10535, "train_runtime": 81453.7678, "train_tokens_per_second": 5660.37 }, { "epoch": 0.7096687314839752, "grad_norm": 0.8426741622679441, "learning_rate": 7.2025067770150835e-06, "loss": 0.4015054225921631, "num_input_tokens_seen": 461286472, "step": 10540, "train_runtime": 81493.9088, "train_tokens_per_second": 5660.38 }, { "epoch": 0.7100053864799354, "grad_norm": 0.7557428415974053, "learning_rate": 7.2001327392644235e-06, "loss": 0.3497929573059082, "num_input_tokens_seen": 461515496, "step": 10545, "train_runtime": 81528.2463, "train_tokens_per_second": 5660.805 }, { "epoch": 0.7103420414758955, "grad_norm": 0.7845759323690452, "learning_rate": 7.197758086253659e-06, "loss": 0.39971365928649905, "num_input_tokens_seen": 461738504, "step": 10550, "train_runtime": 81568.9369, "train_tokens_per_second": 5660.715 }, { "epoch": 0.7106786964718557, "grad_norm": 0.7112358056324952, "learning_rate": 7.195382818646854e-06, "loss": 0.39182677268981936, "num_input_tokens_seen": 461947016, "step": 10555, "train_runtime": 81608.3983, "train_tokens_per_second": 5660.533 }, { "epoch": 0.7110153514678158, "grad_norm": 0.772603293296723, "learning_rate": 7.1930069371082445e-06, "loss": 0.36522927284240725, "num_input_tokens_seen": 462152784, "step": 10560, "train_runtime": 81652.6367, "train_tokens_per_second": 5659.986 }, { "epoch": 0.7113520064637759, "grad_norm": 0.7156871566744746, "learning_rate": 7.190630442302238e-06, "loss": 0.3833275079727173, "num_input_tokens_seen": 462379128, "step": 10565, "train_runtime": 81694.2563, "train_tokens_per_second": 5659.873 }, { "epoch": 0.7116886614597361, "grad_norm": 0.7033879162554953, "learning_rate": 7.188253334893414e-06, "loss": 0.3999313831329346, "num_input_tokens_seen": 462598648, "step": 10570, "train_runtime": 81730.3714, "train_tokens_per_second": 5660.058 }, { "epoch": 0.7120253164556962, "grad_norm": 0.8834420627247958, "learning_rate": 7.18587561554652e-06, "loss": 0.3910887956619263, "num_input_tokens_seen": 462807208, "step": 10575, "train_runtime": 81771.4349, "train_tokens_per_second": 5659.766 }, { "epoch": 0.7123619714516564, "grad_norm": 0.6918016219416666, "learning_rate": 7.183497284926483e-06, "loss": 0.36777448654174805, "num_input_tokens_seen": 463042928, "step": 10580, "train_runtime": 81807.4141, "train_tokens_per_second": 5660.158 }, { "epoch": 0.7126986264476165, "grad_norm": 0.7599277759479904, "learning_rate": 7.181118343698392e-06, "loss": 0.36260690689086916, "num_input_tokens_seen": 463252424, "step": 10585, "train_runtime": 81851.2205, "train_tokens_per_second": 5659.689 }, { "epoch": 0.7130352814435766, "grad_norm": 0.7224431307545425, "learning_rate": 7.178738792527512e-06, "loss": 0.39423255920410155, "num_input_tokens_seen": 463469984, "step": 10590, "train_runtime": 81891.039, "train_tokens_per_second": 5659.593 }, { "epoch": 0.7133719364395368, "grad_norm": 0.7536526351492208, "learning_rate": 7.176358632079277e-06, "loss": 0.37251434326171873, "num_input_tokens_seen": 463682208, "step": 10595, "train_runtime": 81929.5391, "train_tokens_per_second": 5659.524 }, { "epoch": 0.7137085914354969, "grad_norm": 0.6793493050362683, "learning_rate": 7.173977863019288e-06, "loss": 0.37181549072265624, "num_input_tokens_seen": 463907464, "step": 10600, "train_runtime": 81970.1484, "train_tokens_per_second": 5659.468 }, { "epoch": 0.7140452464314571, "grad_norm": 0.6822436534253042, "learning_rate": 7.171596486013323e-06, "loss": 0.34790878295898436, "num_input_tokens_seen": 464138256, "step": 10605, "train_runtime": 82007.4481, "train_tokens_per_second": 5659.709 }, { "epoch": 0.7143819014274172, "grad_norm": 0.8051213804159209, "learning_rate": 7.169214501727326e-06, "loss": 0.37795867919921877, "num_input_tokens_seen": 464338936, "step": 10610, "train_runtime": 82043.2488, "train_tokens_per_second": 5659.685 }, { "epoch": 0.7147185564233773, "grad_norm": 0.686749483511892, "learning_rate": 7.16683191082741e-06, "loss": 0.36943345069885253, "num_input_tokens_seen": 464560144, "step": 10615, "train_runtime": 82079.0859, "train_tokens_per_second": 5659.909 }, { "epoch": 0.7150552114193375, "grad_norm": 0.8746419009334871, "learning_rate": 7.16444871397986e-06, "loss": 0.368468713760376, "num_input_tokens_seen": 464765496, "step": 10620, "train_runtime": 82117.3295, "train_tokens_per_second": 5659.774 }, { "epoch": 0.7153918664152976, "grad_norm": 1.042013296164164, "learning_rate": 7.162064911851129e-06, "loss": 0.36743860244750975, "num_input_tokens_seen": 464978408, "step": 10625, "train_runtime": 82160.6887, "train_tokens_per_second": 5659.378 }, { "epoch": 0.7157285214112578, "grad_norm": 0.7321276232893942, "learning_rate": 7.15968050510784e-06, "loss": 0.40234060287475587, "num_input_tokens_seen": 465192704, "step": 10630, "train_runtime": 82198.1606, "train_tokens_per_second": 5659.405 }, { "epoch": 0.7160651764072179, "grad_norm": 0.8428920187826066, "learning_rate": 7.1572954944167834e-06, "loss": 0.3755232810974121, "num_input_tokens_seen": 465408616, "step": 10635, "train_runtime": 82239.586, "train_tokens_per_second": 5659.18 }, { "epoch": 0.716401831403178, "grad_norm": 0.679996578354662, "learning_rate": 7.154909880444922e-06, "loss": 0.3969583988189697, "num_input_tokens_seen": 465633232, "step": 10640, "train_runtime": 82282.7769, "train_tokens_per_second": 5658.939 }, { "epoch": 0.7167384863991382, "grad_norm": 1.5740350922344166, "learning_rate": 7.152523663859384e-06, "loss": 0.37885403633117676, "num_input_tokens_seen": 465845256, "step": 10645, "train_runtime": 82324.9766, "train_tokens_per_second": 5658.614 }, { "epoch": 0.7170751413950983, "grad_norm": 0.8328362306471117, "learning_rate": 7.150136845327466e-06, "loss": 0.3639181613922119, "num_input_tokens_seen": 466056584, "step": 10650, "train_runtime": 82369.823, "train_tokens_per_second": 5658.099 }, { "epoch": 0.7174117963910585, "grad_norm": 0.737238654335971, "learning_rate": 7.147749425516637e-06, "loss": 0.3720954418182373, "num_input_tokens_seen": 466287992, "step": 10655, "train_runtime": 82407.102, "train_tokens_per_second": 5658.347 }, { "epoch": 0.7177484513870186, "grad_norm": 0.7078523897720794, "learning_rate": 7.145361405094529e-06, "loss": 0.3578562021255493, "num_input_tokens_seen": 466523176, "step": 10660, "train_runtime": 82439.2799, "train_tokens_per_second": 5658.991 }, { "epoch": 0.7180851063829787, "grad_norm": 0.7362901383213949, "learning_rate": 7.142972784728945e-06, "loss": 0.3409886360168457, "num_input_tokens_seen": 466734112, "step": 10665, "train_runtime": 82483.0478, "train_tokens_per_second": 5658.546 }, { "epoch": 0.7184217613789389, "grad_norm": 0.8146924235270421, "learning_rate": 7.140583565087856e-06, "loss": 0.35494747161865237, "num_input_tokens_seen": 466952312, "step": 10670, "train_runtime": 82519.1924, "train_tokens_per_second": 5658.712 }, { "epoch": 0.718758416374899, "grad_norm": 0.7593849226158301, "learning_rate": 7.138193746839399e-06, "loss": 0.3933510065078735, "num_input_tokens_seen": 467185248, "step": 10675, "train_runtime": 82565.1418, "train_tokens_per_second": 5658.384 }, { "epoch": 0.7190950713708592, "grad_norm": 0.7169033125551184, "learning_rate": 7.135803330651878e-06, "loss": 0.37902536392211916, "num_input_tokens_seen": 467421448, "step": 10680, "train_runtime": 82599.409, "train_tokens_per_second": 5658.896 }, { "epoch": 0.7194317263668193, "grad_norm": 0.6927480355842544, "learning_rate": 7.133412317193766e-06, "loss": 0.3649748802185059, "num_input_tokens_seen": 467648088, "step": 10685, "train_runtime": 82647.9029, "train_tokens_per_second": 5658.318 }, { "epoch": 0.7197683813627794, "grad_norm": 0.8368737935217295, "learning_rate": 7.131020707133703e-06, "loss": 0.39012324810028076, "num_input_tokens_seen": 467852784, "step": 10690, "train_runtime": 82685.2143, "train_tokens_per_second": 5658.24 }, { "epoch": 0.7201050363587396, "grad_norm": 0.7246874489536738, "learning_rate": 7.128628501140495e-06, "loss": 0.3994007587432861, "num_input_tokens_seen": 468062360, "step": 10695, "train_runtime": 82719.4298, "train_tokens_per_second": 5658.433 }, { "epoch": 0.7204416913546997, "grad_norm": 0.7034507707765917, "learning_rate": 7.126235699883115e-06, "loss": 0.3543556213378906, "num_input_tokens_seen": 468260752, "step": 10700, "train_runtime": 82762.0259, "train_tokens_per_second": 5657.918 }, { "epoch": 0.7207783463506598, "grad_norm": 0.6713729985803661, "learning_rate": 7.1238423040306995e-06, "loss": 0.3659778594970703, "num_input_tokens_seen": 468480296, "step": 10705, "train_runtime": 82807.3194, "train_tokens_per_second": 5657.474 }, { "epoch": 0.72111500134662, "grad_norm": 0.6714547248755331, "learning_rate": 7.121448314252557e-06, "loss": 0.33471217155456545, "num_input_tokens_seen": 468714640, "step": 10710, "train_runtime": 82849.0161, "train_tokens_per_second": 5657.456 }, { "epoch": 0.7214516563425801, "grad_norm": 0.7542079623814812, "learning_rate": 7.1190537312181586e-06, "loss": 0.3590662479400635, "num_input_tokens_seen": 468920200, "step": 10715, "train_runtime": 82883.6718, "train_tokens_per_second": 5657.57 }, { "epoch": 0.7217883113385403, "grad_norm": 0.788689096156777, "learning_rate": 7.116658555597141e-06, "loss": 0.35546276569366453, "num_input_tokens_seen": 469105088, "step": 10720, "train_runtime": 82920.6765, "train_tokens_per_second": 5657.275 }, { "epoch": 0.7221249663345004, "grad_norm": 0.7720777482295464, "learning_rate": 7.114262788059308e-06, "loss": 0.36028232574462893, "num_input_tokens_seen": 469316144, "step": 10725, "train_runtime": 82956.2558, "train_tokens_per_second": 5657.393 }, { "epoch": 0.7224616213304605, "grad_norm": 0.7595426301739953, "learning_rate": 7.111866429274627e-06, "loss": 0.3734895706176758, "num_input_tokens_seen": 469533344, "step": 10730, "train_runtime": 82995.9693, "train_tokens_per_second": 5657.303 }, { "epoch": 0.7227982763264207, "grad_norm": 0.7895201856991956, "learning_rate": 7.1094694799132356e-06, "loss": 0.38394627571105955, "num_input_tokens_seen": 469757776, "step": 10735, "train_runtime": 83039.5254, "train_tokens_per_second": 5657.038 }, { "epoch": 0.7231349313223808, "grad_norm": 0.7170404350301777, "learning_rate": 7.10707194064543e-06, "loss": 0.355570125579834, "num_input_tokens_seen": 469973048, "step": 10740, "train_runtime": 83082.4999, "train_tokens_per_second": 5656.703 }, { "epoch": 0.723471586318341, "grad_norm": 0.751527765717788, "learning_rate": 7.104673812141676e-06, "loss": 0.4048286437988281, "num_input_tokens_seen": 470200352, "step": 10745, "train_runtime": 83123.5825, "train_tokens_per_second": 5656.642 }, { "epoch": 0.7238082413143011, "grad_norm": 0.7209513181054711, "learning_rate": 7.102275095072601e-06, "loss": 0.3921640157699585, "num_input_tokens_seen": 470434416, "step": 10750, "train_runtime": 83170.1972, "train_tokens_per_second": 5656.286 }, { "epoch": 0.7241448963102612, "grad_norm": 0.7141189337990387, "learning_rate": 7.099875790108998e-06, "loss": 0.36566712856292727, "num_input_tokens_seen": 470662208, "step": 10755, "train_runtime": 83219.7805, "train_tokens_per_second": 5655.653 }, { "epoch": 0.7244815513062214, "grad_norm": 0.6677452072067016, "learning_rate": 7.097475897921827e-06, "loss": 0.37137765884399415, "num_input_tokens_seen": 470876192, "step": 10760, "train_runtime": 83259.577, "train_tokens_per_second": 5655.52 }, { "epoch": 0.7248182063021815, "grad_norm": 0.8654836254283663, "learning_rate": 7.09507541918221e-06, "loss": 0.3979093790054321, "num_input_tokens_seen": 471091920, "step": 10765, "train_runtime": 83298.0964, "train_tokens_per_second": 5655.494 }, { "epoch": 0.7251548612981417, "grad_norm": 0.6072122160998616, "learning_rate": 7.092674354561433e-06, "loss": 0.3879514217376709, "num_input_tokens_seen": 471316336, "step": 10770, "train_runtime": 83339.0663, "train_tokens_per_second": 5655.407 }, { "epoch": 0.7254915162941018, "grad_norm": 0.753636374019264, "learning_rate": 7.090272704730945e-06, "loss": 0.3511503219604492, "num_input_tokens_seen": 471518800, "step": 10775, "train_runtime": 83375.4431, "train_tokens_per_second": 5655.368 }, { "epoch": 0.7258281712900619, "grad_norm": 0.7575044992088539, "learning_rate": 7.08787047036236e-06, "loss": 0.35472354888916013, "num_input_tokens_seen": 471754616, "step": 10780, "train_runtime": 83418.0251, "train_tokens_per_second": 5655.308 }, { "epoch": 0.7261648262860221, "grad_norm": 0.822516802699336, "learning_rate": 7.085467652127457e-06, "loss": 0.3795314788818359, "num_input_tokens_seen": 471981872, "step": 10785, "train_runtime": 83450.133, "train_tokens_per_second": 5655.855 }, { "epoch": 0.7265014812819822, "grad_norm": 0.6385132066085284, "learning_rate": 7.083064250698175e-06, "loss": 0.3529500961303711, "num_input_tokens_seen": 472213144, "step": 10790, "train_runtime": 83491.9091, "train_tokens_per_second": 5655.795 }, { "epoch": 0.7268381362779424, "grad_norm": 0.6595130665327932, "learning_rate": 7.0806602667466175e-06, "loss": 0.37914767265319826, "num_input_tokens_seen": 472443584, "step": 10795, "train_runtime": 83534.7223, "train_tokens_per_second": 5655.655 }, { "epoch": 0.7271747912739025, "grad_norm": 0.6988131699183094, "learning_rate": 7.078255700945051e-06, "loss": 0.38105590343475343, "num_input_tokens_seen": 472655528, "step": 10800, "train_runtime": 83566.9737, "train_tokens_per_second": 5656.009 }, { "epoch": 0.7275114462698626, "grad_norm": 0.7284700984007974, "learning_rate": 7.075850553965904e-06, "loss": 0.366654634475708, "num_input_tokens_seen": 472863848, "step": 10805, "train_runtime": 83605.9871, "train_tokens_per_second": 5655.861 }, { "epoch": 0.7278481012658228, "grad_norm": 0.7093309792405998, "learning_rate": 7.07344482648177e-06, "loss": 0.3818976879119873, "num_input_tokens_seen": 473087584, "step": 10810, "train_runtime": 83637.9528, "train_tokens_per_second": 5656.375 }, { "epoch": 0.7281847562617829, "grad_norm": 0.7655242160543194, "learning_rate": 7.071038519165402e-06, "loss": 0.3804640293121338, "num_input_tokens_seen": 473302440, "step": 10815, "train_runtime": 83680.6746, "train_tokens_per_second": 5656.054 }, { "epoch": 0.7285214112577431, "grad_norm": 0.7319764295438455, "learning_rate": 7.068631632689716e-06, "loss": 0.3819848299026489, "num_input_tokens_seen": 473528888, "step": 10820, "train_runtime": 83719.4607, "train_tokens_per_second": 5656.139 }, { "epoch": 0.7288580662537032, "grad_norm": 9.329714081971986, "learning_rate": 7.066224167727791e-06, "loss": 0.3868781566619873, "num_input_tokens_seen": 473749232, "step": 10825, "train_runtime": 83753.7938, "train_tokens_per_second": 5656.451 }, { "epoch": 0.7291947212496633, "grad_norm": 0.841160080727543, "learning_rate": 7.063816124952865e-06, "loss": 0.36863956451416013, "num_input_tokens_seen": 473966688, "step": 10830, "train_runtime": 83791.8425, "train_tokens_per_second": 5656.478 }, { "epoch": 0.7295313762456235, "grad_norm": 0.6549972032651611, "learning_rate": 7.061407505038341e-06, "loss": 0.3608518362045288, "num_input_tokens_seen": 474183856, "step": 10835, "train_runtime": 83830.8355, "train_tokens_per_second": 5656.437 }, { "epoch": 0.7298680312415836, "grad_norm": 0.6949899381534901, "learning_rate": 7.058998308657782e-06, "loss": 0.3866151809692383, "num_input_tokens_seen": 474414672, "step": 10840, "train_runtime": 83863.1172, "train_tokens_per_second": 5657.012 }, { "epoch": 0.7302046862375438, "grad_norm": 0.6794084004266899, "learning_rate": 7.056588536484912e-06, "loss": 0.35731284618377684, "num_input_tokens_seen": 474622840, "step": 10845, "train_runtime": 83892.8777, "train_tokens_per_second": 5657.487 }, { "epoch": 0.7305413412335039, "grad_norm": 1.3762092654034057, "learning_rate": 7.0541781891936145e-06, "loss": 0.35231194496154783, "num_input_tokens_seen": 474842808, "step": 10850, "train_runtime": 83931.0911, "train_tokens_per_second": 5657.532 }, { "epoch": 0.730877996229464, "grad_norm": 0.8182830044909798, "learning_rate": 7.0517672674579364e-06, "loss": 0.3739452838897705, "num_input_tokens_seen": 475060040, "step": 10855, "train_runtime": 83971.3377, "train_tokens_per_second": 5657.407 }, { "epoch": 0.7312146512254242, "grad_norm": 0.7405063263799381, "learning_rate": 7.049355771952087e-06, "loss": 0.367911171913147, "num_input_tokens_seen": 475270960, "step": 10860, "train_runtime": 84012.5713, "train_tokens_per_second": 5657.141 }, { "epoch": 0.7315513062213843, "grad_norm": 0.743519981806223, "learning_rate": 7.046943703350429e-06, "loss": 0.3706895112991333, "num_input_tokens_seen": 475496232, "step": 10865, "train_runtime": 84056.0111, "train_tokens_per_second": 5656.897 }, { "epoch": 0.7318879612173445, "grad_norm": 0.6596197156889615, "learning_rate": 7.044531062327492e-06, "loss": 0.356654691696167, "num_input_tokens_seen": 475709832, "step": 10870, "train_runtime": 84089.5859, "train_tokens_per_second": 5657.179 }, { "epoch": 0.7322246162133046, "grad_norm": 0.6526147436786898, "learning_rate": 7.042117849557963e-06, "loss": 0.3708888053894043, "num_input_tokens_seen": 475932072, "step": 10875, "train_runtime": 84133.6504, "train_tokens_per_second": 5656.858 }, { "epoch": 0.7325612712092647, "grad_norm": 0.744802883666199, "learning_rate": 7.0397040657166885e-06, "loss": 0.36887059211730955, "num_input_tokens_seen": 476162776, "step": 10880, "train_runtime": 84169.2025, "train_tokens_per_second": 5657.209 }, { "epoch": 0.7328979262052249, "grad_norm": 0.7068220775813847, "learning_rate": 7.037289711478676e-06, "loss": 0.34908170700073243, "num_input_tokens_seen": 476376384, "step": 10885, "train_runtime": 84204.347, "train_tokens_per_second": 5657.385 }, { "epoch": 0.733234581201185, "grad_norm": 0.7211408903358524, "learning_rate": 7.034874787519095e-06, "loss": 0.3759069204330444, "num_input_tokens_seen": 476599400, "step": 10890, "train_runtime": 84242.2013, "train_tokens_per_second": 5657.49 }, { "epoch": 0.7335712361971451, "grad_norm": 0.6965350386219624, "learning_rate": 7.0324592945132655e-06, "loss": 0.4069540023803711, "num_input_tokens_seen": 476821304, "step": 10895, "train_runtime": 84276.594, "train_tokens_per_second": 5657.814 }, { "epoch": 0.7339078911931053, "grad_norm": 0.7259339581846704, "learning_rate": 7.0300432331366764e-06, "loss": 0.3802814245223999, "num_input_tokens_seen": 477036424, "step": 10900, "train_runtime": 84309.7162, "train_tokens_per_second": 5658.143 }, { "epoch": 0.7342445461890654, "grad_norm": 0.726630192334144, "learning_rate": 7.02762660406497e-06, "loss": 0.3741856813430786, "num_input_tokens_seen": 477257288, "step": 10905, "train_runtime": 84348.0236, "train_tokens_per_second": 5658.192 }, { "epoch": 0.7345812011850256, "grad_norm": 0.6353064783947603, "learning_rate": 7.02520940797395e-06, "loss": 0.3721340179443359, "num_input_tokens_seen": 477464672, "step": 10910, "train_runtime": 84385.7451, "train_tokens_per_second": 5658.12 }, { "epoch": 0.7349178561809857, "grad_norm": 0.6280488461396918, "learning_rate": 7.022791645539576e-06, "loss": 0.37077898979187013, "num_input_tokens_seen": 477670600, "step": 10915, "train_runtime": 84423.4019, "train_tokens_per_second": 5658.035 }, { "epoch": 0.7352545111769458, "grad_norm": 0.7582582970874048, "learning_rate": 7.02037331743797e-06, "loss": 0.4068927764892578, "num_input_tokens_seen": 477891112, "step": 10920, "train_runtime": 84461.3924, "train_tokens_per_second": 5658.101 }, { "epoch": 0.735591166172906, "grad_norm": 0.6908837097564919, "learning_rate": 7.0179544243454076e-06, "loss": 0.3525757551193237, "num_input_tokens_seen": 478120960, "step": 10925, "train_runtime": 84493.3059, "train_tokens_per_second": 5658.684 }, { "epoch": 0.7359278211688661, "grad_norm": 0.8025906131360969, "learning_rate": 7.0155349669383245e-06, "loss": 0.36997184753417967, "num_input_tokens_seen": 478344240, "step": 10930, "train_runtime": 84534.5442, "train_tokens_per_second": 5658.565 }, { "epoch": 0.7362644761648263, "grad_norm": 0.691884724659927, "learning_rate": 7.013114945893316e-06, "loss": 0.36500933170318606, "num_input_tokens_seen": 478567880, "step": 10935, "train_runtime": 84579.7591, "train_tokens_per_second": 5658.184 }, { "epoch": 0.7366011311607864, "grad_norm": 0.7278702815389843, "learning_rate": 7.010694361887131e-06, "loss": 0.3656963109970093, "num_input_tokens_seen": 478795792, "step": 10940, "train_runtime": 84624.1001, "train_tokens_per_second": 5657.913 }, { "epoch": 0.7369377861567465, "grad_norm": 0.6970616747051929, "learning_rate": 7.008273215596681e-06, "loss": 0.3773782253265381, "num_input_tokens_seen": 479014424, "step": 10945, "train_runtime": 84661.672, "train_tokens_per_second": 5657.984 }, { "epoch": 0.7372744411527067, "grad_norm": 0.7390738693319422, "learning_rate": 7.005851507699029e-06, "loss": 0.3759654760360718, "num_input_tokens_seen": 479243632, "step": 10950, "train_runtime": 84694.665, "train_tokens_per_second": 5658.487 }, { "epoch": 0.7376110961486668, "grad_norm": 0.6808946119767743, "learning_rate": 7.003429238871399e-06, "loss": 0.3657572031021118, "num_input_tokens_seen": 479473192, "step": 10955, "train_runtime": 84738.238, "train_tokens_per_second": 5658.286 }, { "epoch": 0.737947751144627, "grad_norm": 0.7178504014412501, "learning_rate": 7.001006409791171e-06, "loss": 0.40654420852661133, "num_input_tokens_seen": 479687920, "step": 10960, "train_runtime": 84776.0398, "train_tokens_per_second": 5658.296 }, { "epoch": 0.7382844061405871, "grad_norm": 0.7628213758613887, "learning_rate": 6.998583021135882e-06, "loss": 0.3780509948730469, "num_input_tokens_seen": 479906096, "step": 10965, "train_runtime": 84815.2532, "train_tokens_per_second": 5658.252 }, { "epoch": 0.7386210611365472, "grad_norm": 0.8356715268382896, "learning_rate": 6.996159073583224e-06, "loss": 0.36737675666809083, "num_input_tokens_seen": 480125696, "step": 10970, "train_runtime": 84852.9815, "train_tokens_per_second": 5658.324 }, { "epoch": 0.7389577161325074, "grad_norm": 0.8055302742937802, "learning_rate": 6.993734567811046e-06, "loss": 0.34843399524688723, "num_input_tokens_seen": 480343296, "step": 10975, "train_runtime": 84896.1427, "train_tokens_per_second": 5658.011 }, { "epoch": 0.7392943711284675, "grad_norm": 0.6594571098967035, "learning_rate": 6.991309504497352e-06, "loss": 0.37664797306060793, "num_input_tokens_seen": 480566544, "step": 10980, "train_runtime": 84934.0218, "train_tokens_per_second": 5658.116 }, { "epoch": 0.7396310261244277, "grad_norm": 0.7694992058673898, "learning_rate": 6.988883884320307e-06, "loss": 0.3457742214202881, "num_input_tokens_seen": 480774232, "step": 10985, "train_runtime": 84970.4518, "train_tokens_per_second": 5658.134 }, { "epoch": 0.7399676811203878, "grad_norm": 0.7402878857378402, "learning_rate": 6.9864577079582254e-06, "loss": 0.39705471992492675, "num_input_tokens_seen": 481000200, "step": 10990, "train_runtime": 85008.5973, "train_tokens_per_second": 5658.254 }, { "epoch": 0.7403043361163479, "grad_norm": 0.8393816654846036, "learning_rate": 6.984030976089581e-06, "loss": 0.3594042301177979, "num_input_tokens_seen": 481219544, "step": 10995, "train_runtime": 85043.9927, "train_tokens_per_second": 5658.478 }, { "epoch": 0.7406409911123081, "grad_norm": 0.7035982175377999, "learning_rate": 6.981603689392999e-06, "loss": 0.3729727745056152, "num_input_tokens_seen": 481433184, "step": 11000, "train_runtime": 85091.999, "train_tokens_per_second": 5657.796 }, { "epoch": 0.7409776461082682, "grad_norm": 0.7063885505049592, "learning_rate": 6.979175848547263e-06, "loss": 0.3587386131286621, "num_input_tokens_seen": 481648384, "step": 11005, "train_runtime": 85133.4023, "train_tokens_per_second": 5657.572 }, { "epoch": 0.7413143011042284, "grad_norm": 0.818479059925005, "learning_rate": 6.976747454231316e-06, "loss": 0.36256041526794436, "num_input_tokens_seen": 481853600, "step": 11010, "train_runtime": 85175.3796, "train_tokens_per_second": 5657.193 }, { "epoch": 0.7416509561001885, "grad_norm": 0.7213537892974411, "learning_rate": 6.974318507124245e-06, "loss": 0.37796127796173096, "num_input_tokens_seen": 482067848, "step": 11015, "train_runtime": 85211.3126, "train_tokens_per_second": 5657.322 }, { "epoch": 0.7419876110961486, "grad_norm": 0.9553094338809663, "learning_rate": 6.971889007905299e-06, "loss": 0.38568458557128904, "num_input_tokens_seen": 482272608, "step": 11020, "train_runtime": 85242.7243, "train_tokens_per_second": 5657.64 }, { "epoch": 0.7423242660921088, "grad_norm": 0.6954588658200586, "learning_rate": 6.9694589572538795e-06, "loss": 0.4131626605987549, "num_input_tokens_seen": 482500568, "step": 11025, "train_runtime": 85279.0869, "train_tokens_per_second": 5657.9 }, { "epoch": 0.7426609210880689, "grad_norm": 0.6724190701417789, "learning_rate": 6.9670283558495436e-06, "loss": 0.3677205085754395, "num_input_tokens_seen": 482727520, "step": 11030, "train_runtime": 85315.8408, "train_tokens_per_second": 5658.123 }, { "epoch": 0.742997576084029, "grad_norm": 0.7736013776309341, "learning_rate": 6.964597204371999e-06, "loss": 0.3734050035476685, "num_input_tokens_seen": 482943600, "step": 11035, "train_runtime": 85349.9838, "train_tokens_per_second": 5658.391 }, { "epoch": 0.7433342310799892, "grad_norm": 0.7557593534274823, "learning_rate": 6.962165503501111e-06, "loss": 0.3419958591461182, "num_input_tokens_seen": 483163040, "step": 11040, "train_runtime": 85392.7525, "train_tokens_per_second": 5658.127 }, { "epoch": 0.7436708860759493, "grad_norm": 0.786614283633, "learning_rate": 6.959733253916899e-06, "loss": 0.39629015922546384, "num_input_tokens_seen": 483387400, "step": 11045, "train_runtime": 85430.316, "train_tokens_per_second": 5658.265 }, { "epoch": 0.7440075410719095, "grad_norm": 0.7118679551230915, "learning_rate": 6.95730045629953e-06, "loss": 0.3637987613677979, "num_input_tokens_seen": 483586168, "step": 11050, "train_runtime": 85469.2598, "train_tokens_per_second": 5658.013 }, { "epoch": 0.7443441960678696, "grad_norm": 0.775880823500199, "learning_rate": 6.954867111329329e-06, "loss": 0.3997496604919434, "num_input_tokens_seen": 483812040, "step": 11055, "train_runtime": 85501.004, "train_tokens_per_second": 5658.554 }, { "epoch": 0.7446808510638298, "grad_norm": 0.8104111912789507, "learning_rate": 6.952433219686775e-06, "loss": 0.36485040187835693, "num_input_tokens_seen": 484033200, "step": 11060, "train_runtime": 85544.4427, "train_tokens_per_second": 5658.266 }, { "epoch": 0.7450175060597899, "grad_norm": 0.745606714965393, "learning_rate": 6.949998782052497e-06, "loss": 0.38755149841308595, "num_input_tokens_seen": 484251832, "step": 11065, "train_runtime": 85584.405, "train_tokens_per_second": 5658.178 }, { "epoch": 0.74535416105575, "grad_norm": 0.7941311038883269, "learning_rate": 6.947563799107277e-06, "loss": 0.36263265609741213, "num_input_tokens_seen": 484460952, "step": 11070, "train_runtime": 85617.994, "train_tokens_per_second": 5658.401 }, { "epoch": 0.7456908160517102, "grad_norm": 0.795109174361431, "learning_rate": 6.945128271532052e-06, "loss": 0.37139124870300294, "num_input_tokens_seen": 484696168, "step": 11075, "train_runtime": 85658.1904, "train_tokens_per_second": 5658.492 }, { "epoch": 0.7460274710476703, "grad_norm": 0.7555629636652617, "learning_rate": 6.942692200007908e-06, "loss": 0.37421250343322754, "num_input_tokens_seen": 484914304, "step": 11080, "train_runtime": 85693.7663, "train_tokens_per_second": 5658.688 }, { "epoch": 0.7463641260436304, "grad_norm": 0.7710680161258006, "learning_rate": 6.9402555852160845e-06, "loss": 0.3868663787841797, "num_input_tokens_seen": 485140952, "step": 11085, "train_runtime": 85733.9493, "train_tokens_per_second": 5658.68 }, { "epoch": 0.7467007810395906, "grad_norm": 0.6618662744692935, "learning_rate": 6.937818427837975e-06, "loss": 0.35773367881774903, "num_input_tokens_seen": 485364088, "step": 11090, "train_runtime": 85775.7043, "train_tokens_per_second": 5658.526 }, { "epoch": 0.7470374360355507, "grad_norm": 0.8138674839150098, "learning_rate": 6.93538072855512e-06, "loss": 0.40668773651123047, "num_input_tokens_seen": 485585456, "step": 11095, "train_runtime": 85811.2509, "train_tokens_per_second": 5658.762 }, { "epoch": 0.7473740910315109, "grad_norm": 0.7237738810724516, "learning_rate": 6.932942488049217e-06, "loss": 0.3412586212158203, "num_input_tokens_seen": 485799760, "step": 11100, "train_runtime": 85848.9089, "train_tokens_per_second": 5658.776 }, { "epoch": 0.747710746027471, "grad_norm": 0.7192380582338419, "learning_rate": 6.930503707002108e-06, "loss": 0.39055523872375486, "num_input_tokens_seen": 486017000, "step": 11105, "train_runtime": 85893.6142, "train_tokens_per_second": 5658.36 }, { "epoch": 0.7480474010234311, "grad_norm": 0.7129551106844463, "learning_rate": 6.928064386095796e-06, "loss": 0.3696824789047241, "num_input_tokens_seen": 486243416, "step": 11110, "train_runtime": 85934.5192, "train_tokens_per_second": 5658.301 }, { "epoch": 0.7483840560193913, "grad_norm": 0.8296106328518675, "learning_rate": 6.9256245260124264e-06, "loss": 0.369446325302124, "num_input_tokens_seen": 486469728, "step": 11115, "train_runtime": 85966.8967, "train_tokens_per_second": 5658.803 }, { "epoch": 0.7487207110153514, "grad_norm": 0.8112267099332857, "learning_rate": 6.923184127434298e-06, "loss": 0.3864800453186035, "num_input_tokens_seen": 486670960, "step": 11120, "train_runtime": 86001.8182, "train_tokens_per_second": 5658.845 }, { "epoch": 0.7490573660113116, "grad_norm": 0.8933045922508607, "learning_rate": 6.920743191043861e-06, "loss": 0.35923840999603274, "num_input_tokens_seen": 486881136, "step": 11125, "train_runtime": 86039.0507, "train_tokens_per_second": 5658.839 }, { "epoch": 0.7493940210072717, "grad_norm": 0.6534193785965624, "learning_rate": 6.918301717523714e-06, "loss": 0.3482653617858887, "num_input_tokens_seen": 487095072, "step": 11130, "train_runtime": 86077.5734, "train_tokens_per_second": 5658.792 }, { "epoch": 0.7497306760032318, "grad_norm": 0.7160660990648459, "learning_rate": 6.915859707556611e-06, "loss": 0.3809635639190674, "num_input_tokens_seen": 487312640, "step": 11135, "train_runtime": 86112.0956, "train_tokens_per_second": 5659.05 }, { "epoch": 0.750067330999192, "grad_norm": 0.7880329367953478, "learning_rate": 6.913417161825449e-06, "loss": 0.40050134658813474, "num_input_tokens_seen": 487525824, "step": 11140, "train_runtime": 86145.5605, "train_tokens_per_second": 5659.326 }, { "epoch": 0.7504039859951521, "grad_norm": 0.7445156362898442, "learning_rate": 6.91097408101328e-06, "loss": 0.3789609432220459, "num_input_tokens_seen": 487742328, "step": 11145, "train_runtime": 86186.4755, "train_tokens_per_second": 5659.152 }, { "epoch": 0.7507406409911123, "grad_norm": 0.8940165351109152, "learning_rate": 6.908530465803302e-06, "loss": 0.370347785949707, "num_input_tokens_seen": 487949632, "step": 11150, "train_runtime": 86217.4676, "train_tokens_per_second": 5659.522 }, { "epoch": 0.7510772959870724, "grad_norm": 0.8568185419619945, "learning_rate": 6.906086316878865e-06, "loss": 0.3664633989334106, "num_input_tokens_seen": 488152136, "step": 11155, "train_runtime": 86258.4672, "train_tokens_per_second": 5659.179 }, { "epoch": 0.7514139509830325, "grad_norm": 0.6561053217546615, "learning_rate": 6.903641634923468e-06, "loss": 0.3477164268493652, "num_input_tokens_seen": 488367048, "step": 11160, "train_runtime": 86297.7659, "train_tokens_per_second": 5659.093 }, { "epoch": 0.7517506059789927, "grad_norm": 0.7394466907995108, "learning_rate": 6.9011964206207585e-06, "loss": 0.3994622230529785, "num_input_tokens_seen": 488567560, "step": 11165, "train_runtime": 86330.4394, "train_tokens_per_second": 5659.273 }, { "epoch": 0.7520872609749528, "grad_norm": 0.7890852129954726, "learning_rate": 6.898750674654531e-06, "loss": 0.36271369457244873, "num_input_tokens_seen": 488788328, "step": 11170, "train_runtime": 86369.9487, "train_tokens_per_second": 5659.241 }, { "epoch": 0.752423915970913, "grad_norm": 0.6327317994824692, "learning_rate": 6.896304397708733e-06, "loss": 0.35087008476257325, "num_input_tokens_seen": 488995192, "step": 11175, "train_runtime": 86408.8053, "train_tokens_per_second": 5659.09 }, { "epoch": 0.7527605709668731, "grad_norm": 0.7895910131617881, "learning_rate": 6.893857590467456e-06, "loss": 0.3524162292480469, "num_input_tokens_seen": 489213016, "step": 11180, "train_runtime": 86445.1307, "train_tokens_per_second": 5659.232 }, { "epoch": 0.7530972259628332, "grad_norm": 0.7380392223605537, "learning_rate": 6.891410253614944e-06, "loss": 0.34860227108001707, "num_input_tokens_seen": 489418272, "step": 11185, "train_runtime": 86484.3079, "train_tokens_per_second": 5659.041 }, { "epoch": 0.7534338809587934, "grad_norm": 0.702987221857376, "learning_rate": 6.888962387835586e-06, "loss": 0.384684419631958, "num_input_tokens_seen": 489652568, "step": 11190, "train_runtime": 86517.2831, "train_tokens_per_second": 5659.593 }, { "epoch": 0.7537705359547535, "grad_norm": 0.7485124246366612, "learning_rate": 6.886513993813919e-06, "loss": 0.38306422233581544, "num_input_tokens_seen": 489864096, "step": 11195, "train_runtime": 86557.4583, "train_tokens_per_second": 5659.409 }, { "epoch": 0.7541071909507137, "grad_norm": 0.7067279867145273, "learning_rate": 6.88406507223463e-06, "loss": 0.36569690704345703, "num_input_tokens_seen": 490092880, "step": 11200, "train_runtime": 86594.5272, "train_tokens_per_second": 5659.629 }, { "epoch": 0.7544438459466738, "grad_norm": 0.7595465228382173, "learning_rate": 6.881615623782551e-06, "loss": 0.35335478782653806, "num_input_tokens_seen": 490301440, "step": 11205, "train_runtime": 86631.5997, "train_tokens_per_second": 5659.614 }, { "epoch": 0.7547805009426339, "grad_norm": 0.7480898301661179, "learning_rate": 6.879165649142663e-06, "loss": 0.3659096956253052, "num_input_tokens_seen": 490500792, "step": 11210, "train_runtime": 86669.1193, "train_tokens_per_second": 5659.464 }, { "epoch": 0.7551171559385941, "grad_norm": 0.6467936248180215, "learning_rate": 6.876715149000093e-06, "loss": 0.36233794689178467, "num_input_tokens_seen": 490705136, "step": 11215, "train_runtime": 86708.2047, "train_tokens_per_second": 5659.27 }, { "epoch": 0.7554538109345542, "grad_norm": 0.7242780017786447, "learning_rate": 6.874264124040117e-06, "loss": 0.3791798114776611, "num_input_tokens_seen": 490930904, "step": 11220, "train_runtime": 86744.2352, "train_tokens_per_second": 5659.522 }, { "epoch": 0.7557904659305144, "grad_norm": 0.7534511874997005, "learning_rate": 6.871812574948154e-06, "loss": 0.394960880279541, "num_input_tokens_seen": 491158544, "step": 11225, "train_runtime": 86777.1348, "train_tokens_per_second": 5660.0 }, { "epoch": 0.7561271209264745, "grad_norm": 0.7151778561469025, "learning_rate": 6.869360502409773e-06, "loss": 0.3845766544342041, "num_input_tokens_seen": 491385232, "step": 11230, "train_runtime": 86814.8579, "train_tokens_per_second": 5660.151 }, { "epoch": 0.7564637759224346, "grad_norm": 0.7179238868789197, "learning_rate": 6.866907907110689e-06, "loss": 0.351468563079834, "num_input_tokens_seen": 491593976, "step": 11235, "train_runtime": 86852.7406, "train_tokens_per_second": 5660.086 }, { "epoch": 0.7568004309183949, "grad_norm": 0.6534240517661798, "learning_rate": 6.864454789736763e-06, "loss": 0.3472340822219849, "num_input_tokens_seen": 491827504, "step": 11240, "train_runtime": 86890.0801, "train_tokens_per_second": 5660.341 }, { "epoch": 0.757137085914355, "grad_norm": 0.6984388211704616, "learning_rate": 6.8620011509740005e-06, "loss": 0.3707188844680786, "num_input_tokens_seen": 492042264, "step": 11245, "train_runtime": 86929.2774, "train_tokens_per_second": 5660.259 }, { "epoch": 0.7574737409103152, "grad_norm": 0.8438964758084152, "learning_rate": 6.859546991508552e-06, "loss": 0.3541130542755127, "num_input_tokens_seen": 492261592, "step": 11250, "train_runtime": 86971.6043, "train_tokens_per_second": 5660.027 }, { "epoch": 0.7578103959062753, "grad_norm": 0.6972841594933251, "learning_rate": 6.857092312026716e-06, "loss": 0.3816833972930908, "num_input_tokens_seen": 492495240, "step": 11255, "train_runtime": 87006.7607, "train_tokens_per_second": 5660.425 }, { "epoch": 0.7581470509022354, "grad_norm": 0.7161736954331712, "learning_rate": 6.8546371132149395e-06, "loss": 0.39476380348205564, "num_input_tokens_seen": 492712328, "step": 11260, "train_runtime": 87046.3192, "train_tokens_per_second": 5660.346 }, { "epoch": 0.7584837058981956, "grad_norm": 0.7348844948766989, "learning_rate": 6.852181395759807e-06, "loss": 0.39330875873565674, "num_input_tokens_seen": 492943248, "step": 11265, "train_runtime": 87087.1631, "train_tokens_per_second": 5660.343 }, { "epoch": 0.7588203608941557, "grad_norm": 0.5683273529508269, "learning_rate": 6.849725160348054e-06, "loss": 0.3455686330795288, "num_input_tokens_seen": 493152344, "step": 11270, "train_runtime": 87127.3625, "train_tokens_per_second": 5660.132 }, { "epoch": 0.7591570158901159, "grad_norm": 0.7258002012386351, "learning_rate": 6.847268407666557e-06, "loss": 0.35138664245605467, "num_input_tokens_seen": 493375584, "step": 11275, "train_runtime": 87171.3314, "train_tokens_per_second": 5659.838 }, { "epoch": 0.759493670886076, "grad_norm": 0.7379175392341268, "learning_rate": 6.844811138402341e-06, "loss": 0.37623722553253175, "num_input_tokens_seen": 493594016, "step": 11280, "train_runtime": 87212.4908, "train_tokens_per_second": 5659.671 }, { "epoch": 0.7598303258820361, "grad_norm": 0.7131462906095328, "learning_rate": 6.842353353242574e-06, "loss": 0.36553401947021485, "num_input_tokens_seen": 493803080, "step": 11285, "train_runtime": 87254.8113, "train_tokens_per_second": 5659.322 }, { "epoch": 0.7601669808779963, "grad_norm": 0.7404989121841616, "learning_rate": 6.839895052874565e-06, "loss": 0.3759953737258911, "num_input_tokens_seen": 494027672, "step": 11290, "train_runtime": 87290.4517, "train_tokens_per_second": 5659.584 }, { "epoch": 0.7605036358739564, "grad_norm": 0.6838203757609232, "learning_rate": 6.837436237985772e-06, "loss": 0.3641194343566895, "num_input_tokens_seen": 494238208, "step": 11295, "train_runtime": 87333.9419, "train_tokens_per_second": 5659.177 }, { "epoch": 0.7608402908699166, "grad_norm": 0.850634796737577, "learning_rate": 6.834976909263794e-06, "loss": 0.37904021739959715, "num_input_tokens_seen": 494450104, "step": 11300, "train_runtime": 87372.8846, "train_tokens_per_second": 5659.08 }, { "epoch": 0.7611769458658767, "grad_norm": 0.7504214621662669, "learning_rate": 6.832517067396374e-06, "loss": 0.3586588859558105, "num_input_tokens_seen": 494683264, "step": 11305, "train_runtime": 87416.6251, "train_tokens_per_second": 5658.915 }, { "epoch": 0.7615136008618368, "grad_norm": 0.7181780717405477, "learning_rate": 6.8300567130714e-06, "loss": 0.39732561111450193, "num_input_tokens_seen": 494912080, "step": 11310, "train_runtime": 87455.7279, "train_tokens_per_second": 5659.001 }, { "epoch": 0.761850255857797, "grad_norm": 0.8326466499790485, "learning_rate": 6.8275958469769035e-06, "loss": 0.38528354167938234, "num_input_tokens_seen": 495143768, "step": 11315, "train_runtime": 87496.2946, "train_tokens_per_second": 5659.026 }, { "epoch": 0.7621869108537571, "grad_norm": 0.8043440720773757, "learning_rate": 6.825134469801055e-06, "loss": 0.3580173969268799, "num_input_tokens_seen": 495373776, "step": 11320, "train_runtime": 87536.7056, "train_tokens_per_second": 5659.041 }, { "epoch": 0.7625235658497173, "grad_norm": 0.7612366109464449, "learning_rate": 6.8226725822321715e-06, "loss": 0.4001301765441895, "num_input_tokens_seen": 495581360, "step": 11325, "train_runtime": 87574.6303, "train_tokens_per_second": 5658.96 }, { "epoch": 0.7628602208456774, "grad_norm": 0.7254035816528333, "learning_rate": 6.820210184958712e-06, "loss": 0.38148252964019774, "num_input_tokens_seen": 495805664, "step": 11330, "train_runtime": 87611.2812, "train_tokens_per_second": 5659.153 }, { "epoch": 0.7631968758416375, "grad_norm": 0.7816370531432046, "learning_rate": 6.81774727866928e-06, "loss": 0.38228158950805663, "num_input_tokens_seen": 496015888, "step": 11335, "train_runtime": 87647.9698, "train_tokens_per_second": 5659.183 }, { "epoch": 0.7635335308375977, "grad_norm": 0.9719681651052307, "learning_rate": 6.815283864052617e-06, "loss": 0.3840935468673706, "num_input_tokens_seen": 496237176, "step": 11340, "train_runtime": 87687.7469, "train_tokens_per_second": 5659.139 }, { "epoch": 0.7638701858335578, "grad_norm": 0.7821628809832356, "learning_rate": 6.812819941797611e-06, "loss": 0.38556504249572754, "num_input_tokens_seen": 496442520, "step": 11345, "train_runtime": 87730.1254, "train_tokens_per_second": 5658.746 }, { "epoch": 0.764206840829518, "grad_norm": 0.7793739338464833, "learning_rate": 6.810355512593288e-06, "loss": 0.3861824035644531, "num_input_tokens_seen": 496669864, "step": 11350, "train_runtime": 87767.0891, "train_tokens_per_second": 5658.953 }, { "epoch": 0.7645434958254781, "grad_norm": 0.7769049083652588, "learning_rate": 6.807890577128817e-06, "loss": 0.33897886276245115, "num_input_tokens_seen": 496892112, "step": 11355, "train_runtime": 87813.3112, "train_tokens_per_second": 5658.506 }, { "epoch": 0.7648801508214382, "grad_norm": 0.8235786764795517, "learning_rate": 6.805425136093513e-06, "loss": 0.3582730531692505, "num_input_tokens_seen": 497111304, "step": 11360, "train_runtime": 87847.6951, "train_tokens_per_second": 5658.786 }, { "epoch": 0.7652168058173984, "grad_norm": 0.825724303695909, "learning_rate": 6.802959190176827e-06, "loss": 0.38888885974884035, "num_input_tokens_seen": 497318752, "step": 11365, "train_runtime": 87886.6126, "train_tokens_per_second": 5658.641 }, { "epoch": 0.7655534608133585, "grad_norm": 0.7692237966789585, "learning_rate": 6.800492740068352e-06, "loss": 0.3655484676361084, "num_input_tokens_seen": 497523256, "step": 11370, "train_runtime": 87923.25, "train_tokens_per_second": 5658.609 }, { "epoch": 0.7658901158093187, "grad_norm": 0.8501602672533506, "learning_rate": 6.798025786457825e-06, "loss": 0.35955286026000977, "num_input_tokens_seen": 497749392, "step": 11375, "train_runtime": 87963.9631, "train_tokens_per_second": 5658.56 }, { "epoch": 0.7662267708052788, "grad_norm": 0.6654629734284263, "learning_rate": 6.795558330035118e-06, "loss": 0.3689566612243652, "num_input_tokens_seen": 497978632, "step": 11380, "train_runtime": 88010.5357, "train_tokens_per_second": 5658.171 }, { "epoch": 0.7665634258012389, "grad_norm": 0.571714653501898, "learning_rate": 6.793090371490251e-06, "loss": 0.37029447555541994, "num_input_tokens_seen": 498211416, "step": 11385, "train_runtime": 88043.3102, "train_tokens_per_second": 5658.708 }, { "epoch": 0.7669000807971991, "grad_norm": 0.6562894791866329, "learning_rate": 6.790621911513378e-06, "loss": 0.36082067489624026, "num_input_tokens_seen": 498430376, "step": 11390, "train_runtime": 88076.9318, "train_tokens_per_second": 5659.034 }, { "epoch": 0.7672367357931592, "grad_norm": 0.6830456569016362, "learning_rate": 6.788152950794799e-06, "loss": 0.3912408113479614, "num_input_tokens_seen": 498646776, "step": 11395, "train_runtime": 88113.1004, "train_tokens_per_second": 5659.167 }, { "epoch": 0.7675733907891193, "grad_norm": 0.8063375531181857, "learning_rate": 6.7856834900249495e-06, "loss": 0.3919992208480835, "num_input_tokens_seen": 498865144, "step": 11400, "train_runtime": 88157.9923, "train_tokens_per_second": 5658.763 }, { "epoch": 0.7679100457850795, "grad_norm": 0.7488462821998634, "learning_rate": 6.783213529894405e-06, "loss": 0.3473628044128418, "num_input_tokens_seen": 499082328, "step": 11405, "train_runtime": 88202.6214, "train_tokens_per_second": 5658.362 }, { "epoch": 0.7682467007810396, "grad_norm": 0.7845757383023176, "learning_rate": 6.780743071093883e-06, "loss": 0.35947589874267577, "num_input_tokens_seen": 499306216, "step": 11410, "train_runtime": 88242.1656, "train_tokens_per_second": 5658.363 }, { "epoch": 0.7685833557769998, "grad_norm": 1.4808480239457869, "learning_rate": 6.77827211431424e-06, "loss": 0.36936905384063723, "num_input_tokens_seen": 499532072, "step": 11415, "train_runtime": 88280.0767, "train_tokens_per_second": 5658.492 }, { "epoch": 0.7689200107729599, "grad_norm": 0.7193580497484903, "learning_rate": 6.775800660246471e-06, "loss": 0.36505095958709716, "num_input_tokens_seen": 499732272, "step": 11420, "train_runtime": 88316.7765, "train_tokens_per_second": 5658.407 }, { "epoch": 0.76925666576892, "grad_norm": 0.7225028793880158, "learning_rate": 6.77332870958171e-06, "loss": 0.3719770908355713, "num_input_tokens_seen": 499963848, "step": 11425, "train_runtime": 88361.2969, "train_tokens_per_second": 5658.177 }, { "epoch": 0.7695933207648802, "grad_norm": 0.7310175751597672, "learning_rate": 6.770856263011229e-06, "loss": 0.3673600196838379, "num_input_tokens_seen": 500175216, "step": 11430, "train_runtime": 88394.2396, "train_tokens_per_second": 5658.459 }, { "epoch": 0.7699299757608403, "grad_norm": 0.8011531340232532, "learning_rate": 6.768383321226442e-06, "loss": 0.38931114673614503, "num_input_tokens_seen": 500380304, "step": 11435, "train_runtime": 88432.6121, "train_tokens_per_second": 5658.323 }, { "epoch": 0.7702666307568005, "grad_norm": 1.540406850238615, "learning_rate": 6.765909884918898e-06, "loss": 0.3583209753036499, "num_input_tokens_seen": 500590256, "step": 11440, "train_runtime": 88469.3611, "train_tokens_per_second": 5658.346 }, { "epoch": 0.7706032857527606, "grad_norm": 0.6645503979893219, "learning_rate": 6.763435954780286e-06, "loss": 0.3920794725418091, "num_input_tokens_seen": 500810896, "step": 11445, "train_runtime": 88504.9842, "train_tokens_per_second": 5658.561 }, { "epoch": 0.7709399407487207, "grad_norm": 0.7669134143397409, "learning_rate": 6.7609615315024325e-06, "loss": 0.37000212669372556, "num_input_tokens_seen": 501027440, "step": 11450, "train_runtime": 88543.2243, "train_tokens_per_second": 5658.563 }, { "epoch": 0.7712765957446809, "grad_norm": 0.7415266590401455, "learning_rate": 6.758486615777301e-06, "loss": 0.37416849136352537, "num_input_tokens_seen": 501241576, "step": 11455, "train_runtime": 88583.8287, "train_tokens_per_second": 5658.387 }, { "epoch": 0.771613250740641, "grad_norm": 0.8407214839390016, "learning_rate": 6.756011208296995e-06, "loss": 0.3626854419708252, "num_input_tokens_seen": 501454696, "step": 11460, "train_runtime": 88621.4278, "train_tokens_per_second": 5658.391 }, { "epoch": 0.7719499057366012, "grad_norm": 0.7461388799032196, "learning_rate": 6.753535309753755e-06, "loss": 0.35544500350952146, "num_input_tokens_seen": 501658528, "step": 11465, "train_runtime": 88662.546, "train_tokens_per_second": 5658.066 }, { "epoch": 0.7722865607325613, "grad_norm": 0.6919457018289741, "learning_rate": 6.7510589208399565e-06, "loss": 0.3747244119644165, "num_input_tokens_seen": 501877728, "step": 11470, "train_runtime": 88703.6872, "train_tokens_per_second": 5657.913 }, { "epoch": 0.7726232157285214, "grad_norm": 0.7585317880232398, "learning_rate": 6.748582042248115e-06, "loss": 0.35962686538696287, "num_input_tokens_seen": 502089032, "step": 11475, "train_runtime": 88740.6334, "train_tokens_per_second": 5657.938 }, { "epoch": 0.7729598707244816, "grad_norm": 0.7198688949375671, "learning_rate": 6.746104674670882e-06, "loss": 0.38360817432403566, "num_input_tokens_seen": 502313408, "step": 11480, "train_runtime": 88777.3916, "train_tokens_per_second": 5658.123 }, { "epoch": 0.7732965257204417, "grad_norm": 0.6976205058667109, "learning_rate": 6.743626818801042e-06, "loss": 0.39516823291778563, "num_input_tokens_seen": 502534360, "step": 11485, "train_runtime": 88818.4462, "train_tokens_per_second": 5657.995 }, { "epoch": 0.7736331807164019, "grad_norm": 0.6984390114365983, "learning_rate": 6.741148475331525e-06, "loss": 0.37048795223236086, "num_input_tokens_seen": 502757200, "step": 11490, "train_runtime": 88854.2343, "train_tokens_per_second": 5658.224 }, { "epoch": 0.773969835712362, "grad_norm": 0.6953225919926989, "learning_rate": 6.738669644955388e-06, "loss": 0.3468164443969727, "num_input_tokens_seen": 502970848, "step": 11495, "train_runtime": 88897.1339, "train_tokens_per_second": 5657.897 }, { "epoch": 0.7743064907083221, "grad_norm": 0.7656686554212365, "learning_rate": 6.736190328365828e-06, "loss": 0.3672001838684082, "num_input_tokens_seen": 503195432, "step": 11500, "train_runtime": 88938.4411, "train_tokens_per_second": 5657.795 }, { "epoch": 0.7746431457042823, "grad_norm": 0.743345653178439, "learning_rate": 6.73371052625618e-06, "loss": 0.37738971710205077, "num_input_tokens_seen": 503417816, "step": 11505, "train_runtime": 88979.7242, "train_tokens_per_second": 5657.669 }, { "epoch": 0.7749798007002424, "grad_norm": 0.7491341805650183, "learning_rate": 6.731230239319912e-06, "loss": 0.37387096881866455, "num_input_tokens_seen": 503642040, "step": 11510, "train_runtime": 89021.4956, "train_tokens_per_second": 5657.533 }, { "epoch": 0.7753164556962026, "grad_norm": 0.6256746258505268, "learning_rate": 6.728749468250627e-06, "loss": 0.38176569938659666, "num_input_tokens_seen": 503870440, "step": 11515, "train_runtime": 89058.3538, "train_tokens_per_second": 5657.756 }, { "epoch": 0.7756531106921627, "grad_norm": 0.8527701221713213, "learning_rate": 6.726268213742066e-06, "loss": 0.375903582572937, "num_input_tokens_seen": 504076280, "step": 11520, "train_runtime": 89100.0272, "train_tokens_per_second": 5657.42 }, { "epoch": 0.7759897656881228, "grad_norm": 0.7746670396544606, "learning_rate": 6.723786476488105e-06, "loss": 0.38536639213562013, "num_input_tokens_seen": 504303624, "step": 11525, "train_runtime": 89134.096, "train_tokens_per_second": 5657.808 }, { "epoch": 0.776326420684083, "grad_norm": 0.6906699278173198, "learning_rate": 6.72130425718275e-06, "loss": 0.3504000186920166, "num_input_tokens_seen": 504511120, "step": 11530, "train_runtime": 89170.4494, "train_tokens_per_second": 5657.829 }, { "epoch": 0.7766630756800431, "grad_norm": 0.7640134079354167, "learning_rate": 6.718821556520151e-06, "loss": 0.3902331829071045, "num_input_tokens_seen": 504720744, "step": 11535, "train_runtime": 89203.783, "train_tokens_per_second": 5658.064 }, { "epoch": 0.7769997306760033, "grad_norm": 0.676852860064436, "learning_rate": 6.716338375194583e-06, "loss": 0.3558895826339722, "num_input_tokens_seen": 504945672, "step": 11540, "train_runtime": 89239.0086, "train_tokens_per_second": 5658.351 }, { "epoch": 0.7773363856719634, "grad_norm": 0.7081316231079949, "learning_rate": 6.713854713900463e-06, "loss": 0.39481263160705565, "num_input_tokens_seen": 505168112, "step": 11545, "train_runtime": 89280.0653, "train_tokens_per_second": 5658.241 }, { "epoch": 0.7776730406679235, "grad_norm": 0.7771142918437934, "learning_rate": 6.7113705733323365e-06, "loss": 0.3915176153182983, "num_input_tokens_seen": 505373904, "step": 11550, "train_runtime": 89321.9305, "train_tokens_per_second": 5657.893 }, { "epoch": 0.7780096956638837, "grad_norm": 0.7862100764061776, "learning_rate": 6.708885954184885e-06, "loss": 0.36997599601745607, "num_input_tokens_seen": 505592960, "step": 11555, "train_runtime": 89362.1395, "train_tokens_per_second": 5657.798 }, { "epoch": 0.7783463506598438, "grad_norm": 0.8044048640519208, "learning_rate": 6.7064008571529275e-06, "loss": 0.3574796199798584, "num_input_tokens_seen": 505815992, "step": 11560, "train_runtime": 89407.5364, "train_tokens_per_second": 5657.42 }, { "epoch": 0.778683005655804, "grad_norm": 0.63451019489799, "learning_rate": 6.703915282931411e-06, "loss": 0.37357444763183595, "num_input_tokens_seen": 506041792, "step": 11565, "train_runtime": 89452.1107, "train_tokens_per_second": 5657.125 }, { "epoch": 0.7790196606517641, "grad_norm": 0.7400296332193441, "learning_rate": 6.701429232215418e-06, "loss": 0.3822374105453491, "num_input_tokens_seen": 506244224, "step": 11570, "train_runtime": 89491.3476, "train_tokens_per_second": 5656.907 }, { "epoch": 0.7793563156477242, "grad_norm": 0.8414435559233742, "learning_rate": 6.6989427057001665e-06, "loss": 0.3804741144180298, "num_input_tokens_seen": 506470096, "step": 11575, "train_runtime": 89532.7906, "train_tokens_per_second": 5656.811 }, { "epoch": 0.7796929706436844, "grad_norm": 0.6787888680159854, "learning_rate": 6.696455704081006e-06, "loss": 0.3787699699401855, "num_input_tokens_seen": 506688376, "step": 11580, "train_runtime": 89574.3736, "train_tokens_per_second": 5656.622 }, { "epoch": 0.7800296256396445, "grad_norm": 0.711221275891421, "learning_rate": 6.693968228053416e-06, "loss": 0.38877334594726565, "num_input_tokens_seen": 506908432, "step": 11585, "train_runtime": 89609.8238, "train_tokens_per_second": 5656.84 }, { "epoch": 0.7803662806356046, "grad_norm": 0.7045284132631514, "learning_rate": 6.691480278313013e-06, "loss": 0.37210679054260254, "num_input_tokens_seen": 507123272, "step": 11590, "train_runtime": 89650.9072, "train_tokens_per_second": 5656.644 }, { "epoch": 0.7807029356315648, "grad_norm": 0.718080559096589, "learning_rate": 6.688991855555545e-06, "loss": 0.35350847244262695, "num_input_tokens_seen": 507339456, "step": 11595, "train_runtime": 89694.1289, "train_tokens_per_second": 5656.328 }, { "epoch": 0.7810395906275249, "grad_norm": 0.692068019249801, "learning_rate": 6.686502960476888e-06, "loss": 0.3558246612548828, "num_input_tokens_seen": 507577136, "step": 11600, "train_runtime": 89731.2991, "train_tokens_per_second": 5656.634 }, { "epoch": 0.7813762456234851, "grad_norm": 0.7053421542399363, "learning_rate": 6.684013593773058e-06, "loss": 0.3307861089706421, "num_input_tokens_seen": 507811288, "step": 11605, "train_runtime": 89766.4366, "train_tokens_per_second": 5657.028 }, { "epoch": 0.7817129006194452, "grad_norm": 0.7619528494233906, "learning_rate": 6.6815237561401955e-06, "loss": 0.33051750659942625, "num_input_tokens_seen": 508006304, "step": 11610, "train_runtime": 89802.2646, "train_tokens_per_second": 5656.943 }, { "epoch": 0.7820495556154053, "grad_norm": 0.8056101436691785, "learning_rate": 6.679033448274577e-06, "loss": 0.35503997802734377, "num_input_tokens_seen": 508223832, "step": 11615, "train_runtime": 89850.1477, "train_tokens_per_second": 5656.349 }, { "epoch": 0.7823862106113655, "grad_norm": 0.6611022339527542, "learning_rate": 6.676542670872609e-06, "loss": 0.3701477527618408, "num_input_tokens_seen": 508440024, "step": 11620, "train_runtime": 89890.5249, "train_tokens_per_second": 5656.214 }, { "epoch": 0.7827228656073256, "grad_norm": 0.6851834640607047, "learning_rate": 6.674051424630829e-06, "loss": 0.36185245513916015, "num_input_tokens_seen": 508666440, "step": 11625, "train_runtime": 89924.4436, "train_tokens_per_second": 5656.598 }, { "epoch": 0.7830595206032858, "grad_norm": 0.7081381172789725, "learning_rate": 6.671559710245905e-06, "loss": 0.36898825168609617, "num_input_tokens_seen": 508892304, "step": 11630, "train_runtime": 89970.0326, "train_tokens_per_second": 5656.242 }, { "epoch": 0.7833961755992459, "grad_norm": 0.7864088827874502, "learning_rate": 6.669067528414639e-06, "loss": 0.36539783477783205, "num_input_tokens_seen": 509118040, "step": 11635, "train_runtime": 90012.286, "train_tokens_per_second": 5656.095 }, { "epoch": 0.783732830595206, "grad_norm": 0.7072947789302337, "learning_rate": 6.6665748798339606e-06, "loss": 0.39262051582336427, "num_input_tokens_seen": 509346248, "step": 11640, "train_runtime": 90050.1585, "train_tokens_per_second": 5656.25 }, { "epoch": 0.7840694855911662, "grad_norm": 0.7696238239442139, "learning_rate": 6.664081765200932e-06, "loss": 0.38922972679138185, "num_input_tokens_seen": 509547192, "step": 11645, "train_runtime": 90082.5361, "train_tokens_per_second": 5656.448 }, { "epoch": 0.7844061405871263, "grad_norm": 0.9564255408577432, "learning_rate": 6.661588185212745e-06, "loss": 0.38661224842071534, "num_input_tokens_seen": 509767456, "step": 11650, "train_runtime": 90124.0819, "train_tokens_per_second": 5656.285 }, { "epoch": 0.7847427955830865, "grad_norm": 0.6920498506689123, "learning_rate": 6.65909414056672e-06, "loss": 0.37398757934570315, "num_input_tokens_seen": 509978544, "step": 11655, "train_runtime": 90162.88, "train_tokens_per_second": 5656.192 }, { "epoch": 0.7850794505790466, "grad_norm": 0.7983355414544516, "learning_rate": 6.6565996319603075e-06, "loss": 0.36649136543273925, "num_input_tokens_seen": 510194488, "step": 11660, "train_runtime": 90205.1793, "train_tokens_per_second": 5655.933 }, { "epoch": 0.7854161055750067, "grad_norm": 0.705582165882806, "learning_rate": 6.6541046600910915e-06, "loss": 0.35945792198181153, "num_input_tokens_seen": 510408368, "step": 11665, "train_runtime": 90242.6397, "train_tokens_per_second": 5655.956 }, { "epoch": 0.7857527605709669, "grad_norm": 0.7659229146292734, "learning_rate": 6.6516092256567824e-06, "loss": 0.36875619888305666, "num_input_tokens_seen": 510635536, "step": 11670, "train_runtime": 90279.7373, "train_tokens_per_second": 5656.148 }, { "epoch": 0.786089415566927, "grad_norm": 0.8578375495363305, "learning_rate": 6.64911332935522e-06, "loss": 0.39651241302490237, "num_input_tokens_seen": 510860904, "step": 11675, "train_runtime": 90320.5501, "train_tokens_per_second": 5656.087 }, { "epoch": 0.7864260705628872, "grad_norm": 0.7134409162325845, "learning_rate": 6.646616971884373e-06, "loss": 0.3647106885910034, "num_input_tokens_seen": 511085760, "step": 11680, "train_runtime": 90359.7652, "train_tokens_per_second": 5656.121 }, { "epoch": 0.7867627255588473, "grad_norm": 0.6706622363930574, "learning_rate": 6.64412015394234e-06, "loss": 0.35194456577301025, "num_input_tokens_seen": 511285624, "step": 11685, "train_runtime": 90397.4925, "train_tokens_per_second": 5655.971 }, { "epoch": 0.7870993805548074, "grad_norm": 0.8444783042140578, "learning_rate": 6.641622876227349e-06, "loss": 0.3812446594238281, "num_input_tokens_seen": 511491128, "step": 11690, "train_runtime": 90439.6501, "train_tokens_per_second": 5655.607 }, { "epoch": 0.7874360355507676, "grad_norm": 0.7494745665567035, "learning_rate": 6.639125139437756e-06, "loss": 0.3623605012893677, "num_input_tokens_seen": 511707944, "step": 11695, "train_runtime": 90482.4407, "train_tokens_per_second": 5655.329 }, { "epoch": 0.7877726905467277, "grad_norm": 0.7902023749862866, "learning_rate": 6.6366269442720446e-06, "loss": 0.36579647064208987, "num_input_tokens_seen": 511918704, "step": 11700, "train_runtime": 90522.6671, "train_tokens_per_second": 5655.144 }, { "epoch": 0.7881093455426879, "grad_norm": 0.7084908330150312, "learning_rate": 6.634128291428827e-06, "loss": 0.4204265594482422, "num_input_tokens_seen": 512130360, "step": 11705, "train_runtime": 90561.121, "train_tokens_per_second": 5655.08 }, { "epoch": 0.788446000538648, "grad_norm": 0.7463863432263244, "learning_rate": 6.631629181606842e-06, "loss": 0.37847514152526857, "num_input_tokens_seen": 512353072, "step": 11710, "train_runtime": 90604.8421, "train_tokens_per_second": 5654.809 }, { "epoch": 0.7887826555346081, "grad_norm": 0.7252447688219217, "learning_rate": 6.629129615504961e-06, "loss": 0.3778711795806885, "num_input_tokens_seen": 512578040, "step": 11715, "train_runtime": 90644.5653, "train_tokens_per_second": 5654.813 }, { "epoch": 0.7891193105305683, "grad_norm": 0.6877935716049668, "learning_rate": 6.626629593822178e-06, "loss": 0.349456787109375, "num_input_tokens_seen": 512795568, "step": 11720, "train_runtime": 90683.8764, "train_tokens_per_second": 5654.76 }, { "epoch": 0.7894559655265284, "grad_norm": 0.7159875503391986, "learning_rate": 6.624129117257616e-06, "loss": 0.3877539157867432, "num_input_tokens_seen": 513020704, "step": 11725, "train_runtime": 90721.6257, "train_tokens_per_second": 5654.889 }, { "epoch": 0.7897926205224886, "grad_norm": 0.8198647095115159, "learning_rate": 6.621628186510524e-06, "loss": 0.37906270027160643, "num_input_tokens_seen": 513238728, "step": 11730, "train_runtime": 90763.6807, "train_tokens_per_second": 5654.671 }, { "epoch": 0.7901292755184487, "grad_norm": 0.6710230144644209, "learning_rate": 6.619126802280281e-06, "loss": 0.35970292091369627, "num_input_tokens_seen": 513454240, "step": 11735, "train_runtime": 90806.8266, "train_tokens_per_second": 5654.357 }, { "epoch": 0.7904659305144088, "grad_norm": 0.6839883499284557, "learning_rate": 6.616624965266392e-06, "loss": 0.3722025632858276, "num_input_tokens_seen": 513674120, "step": 11740, "train_runtime": 90845.0403, "train_tokens_per_second": 5654.399 }, { "epoch": 0.790802585510369, "grad_norm": 0.7422766392719585, "learning_rate": 6.614122676168486e-06, "loss": 0.39596946239471437, "num_input_tokens_seen": 513889520, "step": 11745, "train_runtime": 90889.19, "train_tokens_per_second": 5654.022 }, { "epoch": 0.7911392405063291, "grad_norm": 0.8574462720949246, "learning_rate": 6.611619935686321e-06, "loss": 0.34925665855407717, "num_input_tokens_seen": 514094568, "step": 11750, "train_runtime": 90923.7862, "train_tokens_per_second": 5654.126 }, { "epoch": 0.7914758955022893, "grad_norm": 0.7396446955629874, "learning_rate": 6.609116744519779e-06, "loss": 0.3882757663726807, "num_input_tokens_seen": 514319376, "step": 11755, "train_runtime": 90961.7449, "train_tokens_per_second": 5654.238 }, { "epoch": 0.7918125504982494, "grad_norm": 0.8047711473168563, "learning_rate": 6.60661310336887e-06, "loss": 0.3384627103805542, "num_input_tokens_seen": 514527584, "step": 11760, "train_runtime": 91008.8104, "train_tokens_per_second": 5653.602 }, { "epoch": 0.7921492054942095, "grad_norm": 0.7981581690317775, "learning_rate": 6.604109012933732e-06, "loss": 0.37465848922729494, "num_input_tokens_seen": 514729464, "step": 11765, "train_runtime": 91040.9107, "train_tokens_per_second": 5653.826 }, { "epoch": 0.7924858604901697, "grad_norm": 0.7333032087882904, "learning_rate": 6.601604473914622e-06, "loss": 0.39129223823547366, "num_input_tokens_seen": 514948712, "step": 11770, "train_runtime": 91080.7609, "train_tokens_per_second": 5653.759 }, { "epoch": 0.7928225154861298, "grad_norm": 0.8203529810583842, "learning_rate": 6.599099487011928e-06, "loss": 0.3703568458557129, "num_input_tokens_seen": 515174152, "step": 11775, "train_runtime": 91123.7113, "train_tokens_per_second": 5653.569 }, { "epoch": 0.79315917048209, "grad_norm": 0.7692920757506985, "learning_rate": 6.596594052926163e-06, "loss": 0.37824716567993166, "num_input_tokens_seen": 515398616, "step": 11780, "train_runtime": 91161.9049, "train_tokens_per_second": 5653.662 }, { "epoch": 0.7934958254780501, "grad_norm": 0.6620821907912957, "learning_rate": 6.5940881723579595e-06, "loss": 0.36647372245788573, "num_input_tokens_seen": 515618208, "step": 11785, "train_runtime": 91199.6136, "train_tokens_per_second": 5653.732 }, { "epoch": 0.7938324804740102, "grad_norm": 0.7308558763801775, "learning_rate": 6.591581846008085e-06, "loss": 0.34111249446868896, "num_input_tokens_seen": 515838000, "step": 11790, "train_runtime": 91242.8853, "train_tokens_per_second": 5653.46 }, { "epoch": 0.7941691354699704, "grad_norm": 0.7510405382733509, "learning_rate": 6.589075074577421e-06, "loss": 0.3614863634109497, "num_input_tokens_seen": 516058872, "step": 11795, "train_runtime": 91288.1701, "train_tokens_per_second": 5653.075 }, { "epoch": 0.7945057904659305, "grad_norm": 0.682167345785408, "learning_rate": 6.5865678587669805e-06, "loss": 0.35341219902038573, "num_input_tokens_seen": 516288480, "step": 11800, "train_runtime": 91324.6105, "train_tokens_per_second": 5653.334 }, { "epoch": 0.7948424454618906, "grad_norm": 0.8727392399581251, "learning_rate": 6.584060199277897e-06, "loss": 0.3922135829925537, "num_input_tokens_seen": 516500456, "step": 11805, "train_runtime": 91356.4687, "train_tokens_per_second": 5653.682 }, { "epoch": 0.7951791004578508, "grad_norm": 0.7263526124399556, "learning_rate": 6.581552096811428e-06, "loss": 0.3736285209655762, "num_input_tokens_seen": 516717184, "step": 11810, "train_runtime": 91391.2945, "train_tokens_per_second": 5653.899 }, { "epoch": 0.7955157554538109, "grad_norm": 0.7483107004591556, "learning_rate": 6.57904355206896e-06, "loss": 0.3753064632415771, "num_input_tokens_seen": 516937256, "step": 11815, "train_runtime": 91433.3951, "train_tokens_per_second": 5653.703 }, { "epoch": 0.7958524104497711, "grad_norm": 0.741351883349472, "learning_rate": 6.576534565751997e-06, "loss": 0.35328757762908936, "num_input_tokens_seen": 517155784, "step": 11820, "train_runtime": 91472.4934, "train_tokens_per_second": 5653.675 }, { "epoch": 0.7961890654457312, "grad_norm": 0.7392430177231608, "learning_rate": 6.574025138562172e-06, "loss": 0.3843714475631714, "num_input_tokens_seen": 517361632, "step": 11825, "train_runtime": 91507.0999, "train_tokens_per_second": 5653.787 }, { "epoch": 0.7965257204416913, "grad_norm": 0.6186336035373811, "learning_rate": 6.571515271201234e-06, "loss": 0.3463775634765625, "num_input_tokens_seen": 517585680, "step": 11830, "train_runtime": 91547.5139, "train_tokens_per_second": 5653.738 }, { "epoch": 0.7968623754376515, "grad_norm": 0.6495706347541744, "learning_rate": 6.569004964371062e-06, "loss": 0.3861451864242554, "num_input_tokens_seen": 517810808, "step": 11835, "train_runtime": 91580.6678, "train_tokens_per_second": 5654.15 }, { "epoch": 0.7971990304336116, "grad_norm": 0.7143293886304013, "learning_rate": 6.566494218773656e-06, "loss": 0.3636291265487671, "num_input_tokens_seen": 518036944, "step": 11840, "train_runtime": 91623.7035, "train_tokens_per_second": 5653.962 }, { "epoch": 0.7975356854295718, "grad_norm": 0.7702610503844717, "learning_rate": 6.563983035111136e-06, "loss": 0.376003098487854, "num_input_tokens_seen": 518266216, "step": 11845, "train_runtime": 91660.207, "train_tokens_per_second": 5654.212 }, { "epoch": 0.7978723404255319, "grad_norm": 0.7600176188341217, "learning_rate": 6.561471414085748e-06, "loss": 0.36989893913269045, "num_input_tokens_seen": 518477336, "step": 11850, "train_runtime": 91696.4011, "train_tokens_per_second": 5654.282 }, { "epoch": 0.798208995421492, "grad_norm": 0.7119305326521156, "learning_rate": 6.558959356399859e-06, "loss": 0.3683455944061279, "num_input_tokens_seen": 518691120, "step": 11855, "train_runtime": 91735.153, "train_tokens_per_second": 5654.224 }, { "epoch": 0.7985456504174522, "grad_norm": 0.6724381741463443, "learning_rate": 6.5564468627559544e-06, "loss": 0.3579908609390259, "num_input_tokens_seen": 518897696, "step": 11860, "train_runtime": 91775.8953, "train_tokens_per_second": 5653.965 }, { "epoch": 0.7988823054134123, "grad_norm": 0.7387321689727897, "learning_rate": 6.5539339338566495e-06, "loss": 0.38613746166229246, "num_input_tokens_seen": 519112712, "step": 11865, "train_runtime": 91816.066, "train_tokens_per_second": 5653.833 }, { "epoch": 0.7992189604093725, "grad_norm": 0.8155036594396956, "learning_rate": 6.5514205704046754e-06, "loss": 0.34462246894836424, "num_input_tokens_seen": 519326360, "step": 11870, "train_runtime": 91857.9272, "train_tokens_per_second": 5653.582 }, { "epoch": 0.7995556154053326, "grad_norm": 0.7554873227873684, "learning_rate": 6.548906773102886e-06, "loss": 0.34732234477996826, "num_input_tokens_seen": 519538040, "step": 11875, "train_runtime": 91892.7088, "train_tokens_per_second": 5653.746 }, { "epoch": 0.7998922704012927, "grad_norm": 0.6865110717768457, "learning_rate": 6.546392542654257e-06, "loss": 0.3555797576904297, "num_input_tokens_seen": 519754440, "step": 11880, "train_runtime": 91931.8443, "train_tokens_per_second": 5653.693 }, { "epoch": 0.8002289253972529, "grad_norm": 0.7775168324740175, "learning_rate": 6.543877879761882e-06, "loss": 0.39305408000946046, "num_input_tokens_seen": 519971256, "step": 11885, "train_runtime": 91972.3549, "train_tokens_per_second": 5653.56 }, { "epoch": 0.800565580393213, "grad_norm": 0.6425158999557459, "learning_rate": 6.5413627851289825e-06, "loss": 0.3501169681549072, "num_input_tokens_seen": 520197464, "step": 11890, "train_runtime": 92010.0574, "train_tokens_per_second": 5653.702 }, { "epoch": 0.8009022353891732, "grad_norm": 0.7227536117889709, "learning_rate": 6.538847259458896e-06, "loss": 0.3551483631134033, "num_input_tokens_seen": 520422616, "step": 11895, "train_runtime": 92042.9843, "train_tokens_per_second": 5654.126 }, { "epoch": 0.8012388903851333, "grad_norm": 0.7042669271875746, "learning_rate": 6.5363313034550805e-06, "loss": 0.34134459495544434, "num_input_tokens_seen": 520633392, "step": 11900, "train_runtime": 92087.6293, "train_tokens_per_second": 5653.674 }, { "epoch": 0.8015755453810934, "grad_norm": 0.739311915732445, "learning_rate": 6.533814917821114e-06, "loss": 0.3754891395568848, "num_input_tokens_seen": 520855784, "step": 11905, "train_runtime": 92127.8168, "train_tokens_per_second": 5653.621 }, { "epoch": 0.8019122003770536, "grad_norm": 0.6302684231473084, "learning_rate": 6.531298103260696e-06, "loss": 0.3585964202880859, "num_input_tokens_seen": 521066736, "step": 11910, "train_runtime": 92163.5443, "train_tokens_per_second": 5653.719 }, { "epoch": 0.8022488553730137, "grad_norm": 0.7417671721607515, "learning_rate": 6.528780860477648e-06, "loss": 0.3797733783721924, "num_input_tokens_seen": 521300416, "step": 11915, "train_runtime": 92200.3318, "train_tokens_per_second": 5653.997 }, { "epoch": 0.8025855103689739, "grad_norm": 0.6890068438400968, "learning_rate": 6.526263190175907e-06, "loss": 0.3375946044921875, "num_input_tokens_seen": 521532280, "step": 11920, "train_runtime": 92234.4047, "train_tokens_per_second": 5654.422 }, { "epoch": 0.802922165364934, "grad_norm": 0.6823445253166819, "learning_rate": 6.523745093059531e-06, "loss": 0.3637096643447876, "num_input_tokens_seen": 521751944, "step": 11925, "train_runtime": 92276.588, "train_tokens_per_second": 5654.218 }, { "epoch": 0.8032588203608941, "grad_norm": 0.8198308621507191, "learning_rate": 6.521226569832699e-06, "loss": 0.3677360057830811, "num_input_tokens_seen": 521974016, "step": 11930, "train_runtime": 92311.2607, "train_tokens_per_second": 5654.5 }, { "epoch": 0.8035954753568543, "grad_norm": 0.7478623966170844, "learning_rate": 6.518707621199707e-06, "loss": 0.355226993560791, "num_input_tokens_seen": 522190040, "step": 11935, "train_runtime": 92353.1434, "train_tokens_per_second": 5654.275 }, { "epoch": 0.8039321303528144, "grad_norm": 0.7995961908090801, "learning_rate": 6.516188247864972e-06, "loss": 0.3752752304077148, "num_input_tokens_seen": 522418072, "step": 11940, "train_runtime": 92392.9504, "train_tokens_per_second": 5654.307 }, { "epoch": 0.8042687853487746, "grad_norm": 0.8084497458000778, "learning_rate": 6.513668450533028e-06, "loss": 0.3633857250213623, "num_input_tokens_seen": 522645296, "step": 11945, "train_runtime": 92428.2209, "train_tokens_per_second": 5654.607 }, { "epoch": 0.8046054403447347, "grad_norm": 0.7480700245413793, "learning_rate": 6.511148229908531e-06, "loss": 0.39172661304473877, "num_input_tokens_seen": 522868752, "step": 11950, "train_runtime": 92461.7106, "train_tokens_per_second": 5654.976 }, { "epoch": 0.8049420953406948, "grad_norm": 0.8708977640452219, "learning_rate": 6.508627586696248e-06, "loss": 0.3619298696517944, "num_input_tokens_seen": 523082504, "step": 11955, "train_runtime": 92499.8318, "train_tokens_per_second": 5654.956 }, { "epoch": 0.805278750336655, "grad_norm": 0.7261115677502934, "learning_rate": 6.5061065216010695e-06, "loss": 0.3667879581451416, "num_input_tokens_seen": 523299872, "step": 11960, "train_runtime": 92542.5023, "train_tokens_per_second": 5654.698 }, { "epoch": 0.8056154053326151, "grad_norm": 0.7422593678216647, "learning_rate": 6.5035850353280075e-06, "loss": 0.3360764503479004, "num_input_tokens_seen": 523516992, "step": 11965, "train_runtime": 92581.276, "train_tokens_per_second": 5654.675 }, { "epoch": 0.8059520603285752, "grad_norm": 0.7763633318074254, "learning_rate": 6.501063128582183e-06, "loss": 0.35983996391296386, "num_input_tokens_seen": 523724536, "step": 11970, "train_runtime": 92615.6401, "train_tokens_per_second": 5654.817 }, { "epoch": 0.8062887153245354, "grad_norm": 0.8599327424362851, "learning_rate": 6.498540802068843e-06, "loss": 0.36988580226898193, "num_input_tokens_seen": 523941648, "step": 11975, "train_runtime": 92650.751, "train_tokens_per_second": 5655.018 }, { "epoch": 0.8066253703204955, "grad_norm": 0.7313407988142705, "learning_rate": 6.4960180564933454e-06, "loss": 0.3595852851867676, "num_input_tokens_seen": 524162560, "step": 11980, "train_runtime": 92691.1408, "train_tokens_per_second": 5654.937 }, { "epoch": 0.8069620253164557, "grad_norm": 0.7521095206194225, "learning_rate": 6.493494892561167e-06, "loss": 0.3594093084335327, "num_input_tokens_seen": 524374312, "step": 11985, "train_runtime": 92728.3173, "train_tokens_per_second": 5654.953 }, { "epoch": 0.8072986803124158, "grad_norm": 0.8430159653893533, "learning_rate": 6.490971310977907e-06, "loss": 0.3831813812255859, "num_input_tokens_seen": 524596088, "step": 11990, "train_runtime": 92765.8417, "train_tokens_per_second": 5655.057 }, { "epoch": 0.807635335308376, "grad_norm": 0.7203196408716581, "learning_rate": 6.488447312449273e-06, "loss": 0.384428596496582, "num_input_tokens_seen": 524821680, "step": 11995, "train_runtime": 92796.5099, "train_tokens_per_second": 5655.619 }, { "epoch": 0.8079719903043361, "grad_norm": 0.7501646695656614, "learning_rate": 6.485922897681095e-06, "loss": 0.3725404739379883, "num_input_tokens_seen": 525045696, "step": 12000, "train_runtime": 92832.3227, "train_tokens_per_second": 5655.85 }, { "epoch": 0.8083086453002962, "grad_norm": 0.6490994037223768, "learning_rate": 6.483398067379316e-06, "loss": 0.4056462287902832, "num_input_tokens_seen": 525279952, "step": 12005, "train_runtime": 92862.4479, "train_tokens_per_second": 5656.538 }, { "epoch": 0.8086453002962564, "grad_norm": 0.719666275525647, "learning_rate": 6.480872822249998e-06, "loss": 0.3556082248687744, "num_input_tokens_seen": 525506864, "step": 12010, "train_runtime": 92904.5673, "train_tokens_per_second": 5656.416 }, { "epoch": 0.8089819552922165, "grad_norm": 0.764344635124093, "learning_rate": 6.478347162999318e-06, "loss": 0.3839968919754028, "num_input_tokens_seen": 525719016, "step": 12015, "train_runtime": 92947.2954, "train_tokens_per_second": 5656.098 }, { "epoch": 0.8093186102881766, "grad_norm": 0.6701860780093635, "learning_rate": 6.475821090333568e-06, "loss": 0.3664535999298096, "num_input_tokens_seen": 525939808, "step": 12020, "train_runtime": 92994.8165, "train_tokens_per_second": 5655.582 }, { "epoch": 0.8096552652841368, "grad_norm": 0.7604615691324128, "learning_rate": 6.473294604959156e-06, "loss": 0.38412063121795653, "num_input_tokens_seen": 526150200, "step": 12025, "train_runtime": 93031.4012, "train_tokens_per_second": 5655.619 }, { "epoch": 0.8099919202800969, "grad_norm": 0.7314264087625333, "learning_rate": 6.470767707582605e-06, "loss": 0.3502906322479248, "num_input_tokens_seen": 526371776, "step": 12030, "train_runtime": 93073.7526, "train_tokens_per_second": 5655.427 }, { "epoch": 0.8103285752760571, "grad_norm": 0.8031066646434316, "learning_rate": 6.468240398910555e-06, "loss": 0.36304702758789065, "num_input_tokens_seen": 526566912, "step": 12035, "train_runtime": 93113.568, "train_tokens_per_second": 5655.104 }, { "epoch": 0.8106652302720172, "grad_norm": 0.7056043206827206, "learning_rate": 6.4657126796497595e-06, "loss": 0.3545745849609375, "num_input_tokens_seen": 526798856, "step": 12040, "train_runtime": 93156.2331, "train_tokens_per_second": 5655.004 }, { "epoch": 0.8110018852679773, "grad_norm": 0.8107764954705456, "learning_rate": 6.463184550507087e-06, "loss": 0.37404961585998536, "num_input_tokens_seen": 527012296, "step": 12045, "train_runtime": 93201.4479, "train_tokens_per_second": 5654.551 }, { "epoch": 0.8113385402639375, "grad_norm": 0.6987203165103377, "learning_rate": 6.46065601218952e-06, "loss": 0.34106624126434326, "num_input_tokens_seen": 527230672, "step": 12050, "train_runtime": 93238.6997, "train_tokens_per_second": 5654.633 }, { "epoch": 0.8116751952598976, "grad_norm": 0.6797008656627719, "learning_rate": 6.458127065404156e-06, "loss": 0.3812570095062256, "num_input_tokens_seen": 527453272, "step": 12055, "train_runtime": 93278.2031, "train_tokens_per_second": 5654.625 }, { "epoch": 0.8120118502558578, "grad_norm": 0.6832021023137033, "learning_rate": 6.45559771085821e-06, "loss": 0.35934345722198485, "num_input_tokens_seen": 527679752, "step": 12060, "train_runtime": 93316.0381, "train_tokens_per_second": 5654.759 }, { "epoch": 0.8123485052518179, "grad_norm": 0.7280405860607188, "learning_rate": 6.453067949259005e-06, "loss": 0.35833373069763186, "num_input_tokens_seen": 527905280, "step": 12065, "train_runtime": 93350.8689, "train_tokens_per_second": 5655.066 }, { "epoch": 0.812685160247778, "grad_norm": 0.7042450928577643, "learning_rate": 6.450537781313982e-06, "loss": 0.33934841156005857, "num_input_tokens_seen": 528118504, "step": 12070, "train_runtime": 93398.5502, "train_tokens_per_second": 5654.461 }, { "epoch": 0.8130218152437382, "grad_norm": 0.8291985738023927, "learning_rate": 6.448007207730693e-06, "loss": 0.3756300926208496, "num_input_tokens_seen": 528340504, "step": 12075, "train_runtime": 93436.5515, "train_tokens_per_second": 5654.538 }, { "epoch": 0.8133584702396983, "grad_norm": 0.7204057314942438, "learning_rate": 6.445476229216805e-06, "loss": 0.35174586772918703, "num_input_tokens_seen": 528575776, "step": 12080, "train_runtime": 93474.5152, "train_tokens_per_second": 5654.758 }, { "epoch": 0.8136951252356585, "grad_norm": 0.7511444963498415, "learning_rate": 6.442944846480099e-06, "loss": 0.39254226684570315, "num_input_tokens_seen": 528786904, "step": 12085, "train_runtime": 93515.4145, "train_tokens_per_second": 5654.543 }, { "epoch": 0.8140317802316186, "grad_norm": 0.7816657648101096, "learning_rate": 6.44041306022847e-06, "loss": 0.39618897438049316, "num_input_tokens_seen": 529015944, "step": 12090, "train_runtime": 93554.4561, "train_tokens_per_second": 5654.631 }, { "epoch": 0.8143684352275787, "grad_norm": 0.8141588683065977, "learning_rate": 6.43788087116992e-06, "loss": 0.39859035015106203, "num_input_tokens_seen": 529246224, "step": 12095, "train_runtime": 93595.1858, "train_tokens_per_second": 5654.631 }, { "epoch": 0.8147050902235389, "grad_norm": 0.7932908932160116, "learning_rate": 6.43534828001257e-06, "loss": 0.3658564567565918, "num_input_tokens_seen": 529476248, "step": 12100, "train_runtime": 93626.3021, "train_tokens_per_second": 5655.208 }, { "epoch": 0.815041745219499, "grad_norm": 0.79019755327484, "learning_rate": 6.43281528746465e-06, "loss": 0.372475266456604, "num_input_tokens_seen": 529683080, "step": 12105, "train_runtime": 93660.6895, "train_tokens_per_second": 5655.34 }, { "epoch": 0.8153784002154592, "grad_norm": 0.6339454129210152, "learning_rate": 6.430281894234504e-06, "loss": 0.36925411224365234, "num_input_tokens_seen": 529906632, "step": 12110, "train_runtime": 93709.4206, "train_tokens_per_second": 5654.785 }, { "epoch": 0.8157150552114193, "grad_norm": 0.8085146313091093, "learning_rate": 6.427748101030587e-06, "loss": 0.3794065237045288, "num_input_tokens_seen": 530122608, "step": 12115, "train_runtime": 93746.5407, "train_tokens_per_second": 5654.85 }, { "epoch": 0.8160517102073794, "grad_norm": 0.7189030374735652, "learning_rate": 6.425213908561468e-06, "loss": 0.3644280433654785, "num_input_tokens_seen": 530344760, "step": 12120, "train_runtime": 93782.6096, "train_tokens_per_second": 5655.044 }, { "epoch": 0.8163883652033396, "grad_norm": 0.7379513095206941, "learning_rate": 6.422679317535823e-06, "loss": 0.3801795721054077, "num_input_tokens_seen": 530554320, "step": 12125, "train_runtime": 93818.6237, "train_tokens_per_second": 5655.107 }, { "epoch": 0.8167250201992997, "grad_norm": 0.7361384056056562, "learning_rate": 6.420144328662441e-06, "loss": 0.4110711097717285, "num_input_tokens_seen": 530784216, "step": 12130, "train_runtime": 93858.9763, "train_tokens_per_second": 5655.125 }, { "epoch": 0.8170616751952599, "grad_norm": 0.6984222353139848, "learning_rate": 6.417608942650229e-06, "loss": 0.36923315525054934, "num_input_tokens_seen": 530985400, "step": 12135, "train_runtime": 93900.3001, "train_tokens_per_second": 5654.779 }, { "epoch": 0.81739833019122, "grad_norm": 0.7696394382831785, "learning_rate": 6.415073160208196e-06, "loss": 0.368359637260437, "num_input_tokens_seen": 531219992, "step": 12140, "train_runtime": 93938.5272, "train_tokens_per_second": 5654.975 }, { "epoch": 0.8177349851871801, "grad_norm": 0.8778188370382649, "learning_rate": 6.412536982045465e-06, "loss": 0.38031327724456787, "num_input_tokens_seen": 531416856, "step": 12145, "train_runtime": 93975.0195, "train_tokens_per_second": 5654.874 }, { "epoch": 0.8180716401831403, "grad_norm": 0.7668958438378366, "learning_rate": 6.410000408871273e-06, "loss": 0.3821054458618164, "num_input_tokens_seen": 531631960, "step": 12150, "train_runtime": 94010.159, "train_tokens_per_second": 5655.048 }, { "epoch": 0.8184082951791004, "grad_norm": 0.7888864971284683, "learning_rate": 6.407463441394961e-06, "loss": 0.37601168155670167, "num_input_tokens_seen": 531859288, "step": 12155, "train_runtime": 94046.1948, "train_tokens_per_second": 5655.298 }, { "epoch": 0.8187449501750605, "grad_norm": 0.8191097049266588, "learning_rate": 6.4049260803259874e-06, "loss": 0.38929071426391604, "num_input_tokens_seen": 532082152, "step": 12160, "train_runtime": 94088.2586, "train_tokens_per_second": 5655.139 }, { "epoch": 0.8190816051710207, "grad_norm": 0.8221152177897472, "learning_rate": 6.402388326373914e-06, "loss": 0.3606018304824829, "num_input_tokens_seen": 532304432, "step": 12165, "train_runtime": 94128.8133, "train_tokens_per_second": 5655.064 }, { "epoch": 0.8194182601669808, "grad_norm": 0.6644138882185266, "learning_rate": 6.399850180248418e-06, "loss": 0.4054881572723389, "num_input_tokens_seen": 532538000, "step": 12170, "train_runtime": 94167.2148, "train_tokens_per_second": 5655.238 }, { "epoch": 0.819754915162941, "grad_norm": 0.7674282579500541, "learning_rate": 6.397311642659283e-06, "loss": 0.3806436538696289, "num_input_tokens_seen": 532749856, "step": 12175, "train_runtime": 94203.2208, "train_tokens_per_second": 5655.325 }, { "epoch": 0.8200915701589011, "grad_norm": 0.7532047074504019, "learning_rate": 6.394772714316402e-06, "loss": 0.3875831842422485, "num_input_tokens_seen": 532981096, "step": 12180, "train_runtime": 94238.5397, "train_tokens_per_second": 5655.66 }, { "epoch": 0.8204282251548612, "grad_norm": 0.691733853853237, "learning_rate": 6.392233395929779e-06, "loss": 0.34835638999938967, "num_input_tokens_seen": 533193808, "step": 12185, "train_runtime": 94267.7706, "train_tokens_per_second": 5656.162 }, { "epoch": 0.8207648801508214, "grad_norm": 0.6752837485492823, "learning_rate": 6.389693688209526e-06, "loss": 0.362264609336853, "num_input_tokens_seen": 533413896, "step": 12190, "train_runtime": 94307.5026, "train_tokens_per_second": 5656.113 }, { "epoch": 0.8211015351467815, "grad_norm": 0.6640861040569711, "learning_rate": 6.387153591865867e-06, "loss": 0.3703956604003906, "num_input_tokens_seen": 533642648, "step": 12195, "train_runtime": 94351.3757, "train_tokens_per_second": 5655.907 }, { "epoch": 0.8214381901427417, "grad_norm": 0.8639133957294087, "learning_rate": 6.384613107609127e-06, "loss": 0.38781538009643557, "num_input_tokens_seen": 533855672, "step": 12200, "train_runtime": 94388.037, "train_tokens_per_second": 5655.968 }, { "epoch": 0.8217748451387018, "grad_norm": 0.6461164084347707, "learning_rate": 6.382072236149747e-06, "loss": 0.3636336326599121, "num_input_tokens_seen": 534086688, "step": 12205, "train_runtime": 94418.101, "train_tokens_per_second": 5656.613 }, { "epoch": 0.8221115001346619, "grad_norm": 1.259849346653607, "learning_rate": 6.379530978198273e-06, "loss": 0.33962430953979494, "num_input_tokens_seen": 534295064, "step": 12210, "train_runtime": 94452.6928, "train_tokens_per_second": 5656.748 }, { "epoch": 0.8224481551306222, "grad_norm": 0.6840892751944132, "learning_rate": 6.376989334465361e-06, "loss": 0.34957318305969237, "num_input_tokens_seen": 534518376, "step": 12215, "train_runtime": 94487.4762, "train_tokens_per_second": 5657.029 }, { "epoch": 0.8227848101265823, "grad_norm": 0.7080671395957931, "learning_rate": 6.374447305661772e-06, "loss": 0.359330415725708, "num_input_tokens_seen": 534753352, "step": 12220, "train_runtime": 94526.7452, "train_tokens_per_second": 5657.165 }, { "epoch": 0.8231214651225425, "grad_norm": 0.7000813266501178, "learning_rate": 6.3719048924983776e-06, "loss": 0.3536032199859619, "num_input_tokens_seen": 534959200, "step": 12225, "train_runtime": 94565.9434, "train_tokens_per_second": 5656.996 }, { "epoch": 0.8234581201185026, "grad_norm": 0.7684419131244044, "learning_rate": 6.369362095686152e-06, "loss": 0.3803597688674927, "num_input_tokens_seen": 535175808, "step": 12230, "train_runtime": 94601.305, "train_tokens_per_second": 5657.172 }, { "epoch": 0.8237947751144628, "grad_norm": 0.6924107525351223, "learning_rate": 6.366818915936185e-06, "loss": 0.34799120426177976, "num_input_tokens_seen": 535394008, "step": 12235, "train_runtime": 94637.8962, "train_tokens_per_second": 5657.29 }, { "epoch": 0.8241314301104229, "grad_norm": 0.7585078799576096, "learning_rate": 6.364275353959667e-06, "loss": 0.3779747486114502, "num_input_tokens_seen": 535603560, "step": 12240, "train_runtime": 94679.4987, "train_tokens_per_second": 5657.017 }, { "epoch": 0.824468085106383, "grad_norm": 0.7685591544772424, "learning_rate": 6.3617314104678966e-06, "loss": 0.36225066184997556, "num_input_tokens_seen": 535838080, "step": 12245, "train_runtime": 94720.1071, "train_tokens_per_second": 5657.068 }, { "epoch": 0.8248047401023432, "grad_norm": 0.76161666147799, "learning_rate": 6.359187086172278e-06, "loss": 0.3977229118347168, "num_input_tokens_seen": 536041408, "step": 12250, "train_runtime": 94755.4024, "train_tokens_per_second": 5657.107 }, { "epoch": 0.8251413950983033, "grad_norm": 0.6732965305210872, "learning_rate": 6.356642381784326e-06, "loss": 0.3828271389007568, "num_input_tokens_seen": 536255712, "step": 12255, "train_runtime": 94789.5374, "train_tokens_per_second": 5657.33 }, { "epoch": 0.8254780500942634, "grad_norm": 0.9216909752320883, "learning_rate": 6.354097298015658e-06, "loss": 0.3526939392089844, "num_input_tokens_seen": 536450456, "step": 12260, "train_runtime": 94828.1952, "train_tokens_per_second": 5657.078 }, { "epoch": 0.8258147050902236, "grad_norm": 0.7392662084519794, "learning_rate": 6.3515518355779985e-06, "loss": 0.3932209014892578, "num_input_tokens_seen": 536655032, "step": 12265, "train_runtime": 94865.9619, "train_tokens_per_second": 5656.982 }, { "epoch": 0.8261513600861837, "grad_norm": 0.630920453324516, "learning_rate": 6.349005995183177e-06, "loss": 0.3485422134399414, "num_input_tokens_seen": 536883576, "step": 12270, "train_runtime": 94899.668, "train_tokens_per_second": 5657.381 }, { "epoch": 0.8264880150821439, "grad_norm": 0.6584126043910694, "learning_rate": 6.346459777543131e-06, "loss": 0.3577850341796875, "num_input_tokens_seen": 537102112, "step": 12275, "train_runtime": 94933.4199, "train_tokens_per_second": 5657.672 }, { "epoch": 0.826824670078104, "grad_norm": 0.69670427508635, "learning_rate": 6.343913183369902e-06, "loss": 0.3586315155029297, "num_input_tokens_seen": 537306360, "step": 12280, "train_runtime": 94970.6969, "train_tokens_per_second": 5657.602 }, { "epoch": 0.8271613250740641, "grad_norm": 0.6795435309811332, "learning_rate": 6.341366213375637e-06, "loss": 0.3537776231765747, "num_input_tokens_seen": 537534592, "step": 12285, "train_runtime": 95003.3121, "train_tokens_per_second": 5658.062 }, { "epoch": 0.8274979800700243, "grad_norm": 0.7334092343426839, "learning_rate": 6.338818868272587e-06, "loss": 0.3713988780975342, "num_input_tokens_seen": 537747240, "step": 12290, "train_runtime": 95041.1213, "train_tokens_per_second": 5658.048 }, { "epoch": 0.8278346350659844, "grad_norm": 0.7029457386112722, "learning_rate": 6.336271148773111e-06, "loss": 0.3642918109893799, "num_input_tokens_seen": 537982080, "step": 12295, "train_runtime": 95085.5253, "train_tokens_per_second": 5657.876 }, { "epoch": 0.8281712900619446, "grad_norm": 0.664085080042037, "learning_rate": 6.333723055589669e-06, "loss": 0.4124462127685547, "num_input_tokens_seen": 538202248, "step": 12300, "train_runtime": 95123.8409, "train_tokens_per_second": 5657.911 }, { "epoch": 0.8285079450579047, "grad_norm": 0.7689236487654127, "learning_rate": 6.331174589434826e-06, "loss": 0.3763313293457031, "num_input_tokens_seen": 538420056, "step": 12305, "train_runtime": 95170.7251, "train_tokens_per_second": 5657.413 }, { "epoch": 0.8288446000538648, "grad_norm": 0.7341729953622874, "learning_rate": 6.328625751021254e-06, "loss": 0.35441150665283205, "num_input_tokens_seen": 538627360, "step": 12310, "train_runtime": 95214.1667, "train_tokens_per_second": 5657.009 }, { "epoch": 0.829181255049825, "grad_norm": 0.7056989368636907, "learning_rate": 6.326076541061729e-06, "loss": 0.334460711479187, "num_input_tokens_seen": 538844328, "step": 12315, "train_runtime": 95255.2861, "train_tokens_per_second": 5656.844 }, { "epoch": 0.8295179100457851, "grad_norm": 0.7430926488416755, "learning_rate": 6.323526960269127e-06, "loss": 0.3949697971343994, "num_input_tokens_seen": 539054992, "step": 12320, "train_runtime": 95291.3412, "train_tokens_per_second": 5656.915 }, { "epoch": 0.8298545650417453, "grad_norm": 0.7296769222033309, "learning_rate": 6.3209770093564315e-06, "loss": 0.3561330556869507, "num_input_tokens_seen": 539280216, "step": 12325, "train_runtime": 95332.3002, "train_tokens_per_second": 5656.847 }, { "epoch": 0.8301912200377054, "grad_norm": 0.8506709358501154, "learning_rate": 6.318426689036727e-06, "loss": 0.3534719705581665, "num_input_tokens_seen": 539494040, "step": 12330, "train_runtime": 95376.0518, "train_tokens_per_second": 5656.494 }, { "epoch": 0.8305278750336655, "grad_norm": 0.7341499431044767, "learning_rate": 6.315876000023202e-06, "loss": 0.37946810722351076, "num_input_tokens_seen": 539706008, "step": 12335, "train_runtime": 95416.5574, "train_tokens_per_second": 5656.314 }, { "epoch": 0.8308645300296257, "grad_norm": 3.744199811122827, "learning_rate": 6.313324943029151e-06, "loss": 0.3778734922409058, "num_input_tokens_seen": 539917272, "step": 12340, "train_runtime": 95460.2877, "train_tokens_per_second": 5655.936 }, { "epoch": 0.8312011850255858, "grad_norm": 0.742412638594704, "learning_rate": 6.310773518767967e-06, "loss": 0.35590362548828125, "num_input_tokens_seen": 540130136, "step": 12345, "train_runtime": 95493.567, "train_tokens_per_second": 5656.194 }, { "epoch": 0.831537840021546, "grad_norm": 0.702835896250019, "learning_rate": 6.30822172795315e-06, "loss": 0.36078743934631347, "num_input_tokens_seen": 540336200, "step": 12350, "train_runtime": 95528.2473, "train_tokens_per_second": 5656.298 }, { "epoch": 0.8318744950175061, "grad_norm": 0.7843017900068701, "learning_rate": 6.3056695712982965e-06, "loss": 0.4154792785644531, "num_input_tokens_seen": 540561200, "step": 12355, "train_runtime": 95559.8481, "train_tokens_per_second": 5656.782 }, { "epoch": 0.8322111500134662, "grad_norm": 0.6757106331074613, "learning_rate": 6.303117049517111e-06, "loss": 0.3399226427078247, "num_input_tokens_seen": 540776592, "step": 12360, "train_runtime": 95600.3642, "train_tokens_per_second": 5656.637 }, { "epoch": 0.8325478050094264, "grad_norm": 0.7135184795154971, "learning_rate": 6.300564163323398e-06, "loss": 0.35541400909423826, "num_input_tokens_seen": 540989568, "step": 12365, "train_runtime": 95640.6371, "train_tokens_per_second": 5656.482 }, { "epoch": 0.8328844600053865, "grad_norm": 0.7511263678823955, "learning_rate": 6.298010913431065e-06, "loss": 0.36992754936218264, "num_input_tokens_seen": 541205456, "step": 12370, "train_runtime": 95679.064, "train_tokens_per_second": 5656.467 }, { "epoch": 0.8332211150013467, "grad_norm": 0.735359416996797, "learning_rate": 6.295457300554119e-06, "loss": 0.3586021184921265, "num_input_tokens_seen": 541434640, "step": 12375, "train_runtime": 95717.4462, "train_tokens_per_second": 5656.593 }, { "epoch": 0.8335577699973068, "grad_norm": 0.8567636961499998, "learning_rate": 6.292903325406668e-06, "loss": 0.38977057933807374, "num_input_tokens_seen": 541635304, "step": 12380, "train_runtime": 95751.5012, "train_tokens_per_second": 5656.677 }, { "epoch": 0.8338944249932669, "grad_norm": 0.7502505399469903, "learning_rate": 6.2903489887029255e-06, "loss": 0.34544246196746825, "num_input_tokens_seen": 541858656, "step": 12385, "train_runtime": 95786.9128, "train_tokens_per_second": 5656.917 }, { "epoch": 0.8342310799892271, "grad_norm": 0.6987916307726929, "learning_rate": 6.287794291157204e-06, "loss": 0.36299178600311277, "num_input_tokens_seen": 542076592, "step": 12390, "train_runtime": 95820.7633, "train_tokens_per_second": 5657.193 }, { "epoch": 0.8345677349851872, "grad_norm": 0.8150952905885787, "learning_rate": 6.285239233483915e-06, "loss": 0.36720116138458253, "num_input_tokens_seen": 542309048, "step": 12395, "train_runtime": 95859.9652, "train_tokens_per_second": 5657.305 }, { "epoch": 0.8349043899811474, "grad_norm": 0.683112485827057, "learning_rate": 6.2826838163975724e-06, "loss": 0.3783855438232422, "num_input_tokens_seen": 542526280, "step": 12400, "train_runtime": 95898.4045, "train_tokens_per_second": 5657.302 }, { "epoch": 0.8352410449771075, "grad_norm": 0.8138279320478745, "learning_rate": 6.2801280406127905e-06, "loss": 0.35349900722503663, "num_input_tokens_seen": 542750064, "step": 12405, "train_runtime": 95934.8168, "train_tokens_per_second": 5657.488 }, { "epoch": 0.8355776999730676, "grad_norm": 0.7615550252521133, "learning_rate": 6.2775719068442845e-06, "loss": 0.36704421043395996, "num_input_tokens_seen": 542968240, "step": 12410, "train_runtime": 95972.339, "train_tokens_per_second": 5657.549 }, { "epoch": 0.8359143549690278, "grad_norm": 0.7219105847794507, "learning_rate": 6.275015415806869e-06, "loss": 0.3532416343688965, "num_input_tokens_seen": 543175408, "step": 12415, "train_runtime": 96016.4623, "train_tokens_per_second": 5657.107 }, { "epoch": 0.8362510099649879, "grad_norm": 0.6790545597022978, "learning_rate": 6.272458568215458e-06, "loss": 0.3773714303970337, "num_input_tokens_seen": 543389992, "step": 12420, "train_runtime": 96057.0753, "train_tokens_per_second": 5656.949 }, { "epoch": 0.836587664960948, "grad_norm": 0.758978760003948, "learning_rate": 6.269901364785066e-06, "loss": 0.37525081634521484, "num_input_tokens_seen": 543616944, "step": 12425, "train_runtime": 96095.6171, "train_tokens_per_second": 5657.042 }, { "epoch": 0.8369243199569082, "grad_norm": 0.6823393482935673, "learning_rate": 6.2673438062308055e-06, "loss": 0.37595961093902586, "num_input_tokens_seen": 543859984, "step": 12430, "train_runtime": 96131.3734, "train_tokens_per_second": 5657.466 }, { "epoch": 0.8372609749528683, "grad_norm": 0.9689604562670696, "learning_rate": 6.264785893267892e-06, "loss": 0.3472005367279053, "num_input_tokens_seen": 544063976, "step": 12435, "train_runtime": 96162.9294, "train_tokens_per_second": 5657.731 }, { "epoch": 0.8375976299488285, "grad_norm": 0.7213840812199924, "learning_rate": 6.2622276266116366e-06, "loss": 0.36200590133666993, "num_input_tokens_seen": 544288640, "step": 12440, "train_runtime": 96199.7795, "train_tokens_per_second": 5657.899 }, { "epoch": 0.8379342849447886, "grad_norm": 0.6737267934047665, "learning_rate": 6.25966900697745e-06, "loss": 0.37799394130706787, "num_input_tokens_seen": 544514152, "step": 12445, "train_runtime": 96237.3914, "train_tokens_per_second": 5658.031 }, { "epoch": 0.8382709399407487, "grad_norm": 0.6929403643911132, "learning_rate": 6.257110035080843e-06, "loss": 0.3491935729980469, "num_input_tokens_seen": 544741824, "step": 12450, "train_runtime": 96274.7948, "train_tokens_per_second": 5658.198 }, { "epoch": 0.8386075949367089, "grad_norm": 0.6942505611698238, "learning_rate": 6.254550711637422e-06, "loss": 0.40814781188964844, "num_input_tokens_seen": 544950448, "step": 12455, "train_runtime": 96314.5199, "train_tokens_per_second": 5658.03 }, { "epoch": 0.838944249932669, "grad_norm": 0.7575909904692931, "learning_rate": 6.251991037362897e-06, "loss": 0.38295414447784426, "num_input_tokens_seen": 545159072, "step": 12460, "train_runtime": 96349.3253, "train_tokens_per_second": 5658.151 }, { "epoch": 0.8392809049286292, "grad_norm": 0.7581123803912536, "learning_rate": 6.249431012973068e-06, "loss": 0.37713871002197263, "num_input_tokens_seen": 545367120, "step": 12465, "train_runtime": 96388.6672, "train_tokens_per_second": 5658.0 }, { "epoch": 0.8396175599245893, "grad_norm": 0.7683081862438146, "learning_rate": 6.246870639183843e-06, "loss": 0.37398107051849366, "num_input_tokens_seen": 545578664, "step": 12470, "train_runtime": 96426.5472, "train_tokens_per_second": 5657.972 }, { "epoch": 0.8399542149205494, "grad_norm": 0.8223266832633437, "learning_rate": 6.2443099167112185e-06, "loss": 0.39701476097106936, "num_input_tokens_seen": 545803912, "step": 12475, "train_runtime": 96462.5666, "train_tokens_per_second": 5658.194 }, { "epoch": 0.8402908699165096, "grad_norm": 0.6969953488947742, "learning_rate": 6.241748846271293e-06, "loss": 0.3778507709503174, "num_input_tokens_seen": 546030536, "step": 12480, "train_runtime": 96496.5077, "train_tokens_per_second": 5658.552 }, { "epoch": 0.8406275249124697, "grad_norm": 0.7778677325039889, "learning_rate": 6.239187428580263e-06, "loss": 0.37636547088623046, "num_input_tokens_seen": 546236768, "step": 12485, "train_runtime": 96538.6051, "train_tokens_per_second": 5658.221 }, { "epoch": 0.8409641799084299, "grad_norm": 0.8059997970084556, "learning_rate": 6.236625664354421e-06, "loss": 0.3784951686859131, "num_input_tokens_seen": 546462096, "step": 12490, "train_runtime": 96574.6617, "train_tokens_per_second": 5658.442 }, { "epoch": 0.84130083490439, "grad_norm": 0.8520532583827878, "learning_rate": 6.2340635543101545e-06, "loss": 0.3676713466644287, "num_input_tokens_seen": 546657168, "step": 12495, "train_runtime": 96614.4259, "train_tokens_per_second": 5658.132 }, { "epoch": 0.8416374899003501, "grad_norm": 0.6539078891022843, "learning_rate": 6.23150109916395e-06, "loss": 0.33987085819244384, "num_input_tokens_seen": 546881208, "step": 12500, "train_runtime": 96655.3189, "train_tokens_per_second": 5658.056 }, { "epoch": 0.8419741448963103, "grad_norm": 0.6624040098906347, "learning_rate": 6.22893829963239e-06, "loss": 0.3859384059906006, "num_input_tokens_seen": 547092816, "step": 12505, "train_runtime": 96691.3494, "train_tokens_per_second": 5658.136 }, { "epoch": 0.8423107998922704, "grad_norm": 0.7298942090178581, "learning_rate": 6.226375156432153e-06, "loss": 0.357137393951416, "num_input_tokens_seen": 547322656, "step": 12510, "train_runtime": 96731.546, "train_tokens_per_second": 5658.161 }, { "epoch": 0.8426474548882306, "grad_norm": 0.7316486599091492, "learning_rate": 6.2238116702800145e-06, "loss": 0.3710299491882324, "num_input_tokens_seen": 547537944, "step": 12515, "train_runtime": 96762.4833, "train_tokens_per_second": 5658.577 }, { "epoch": 0.8429841098841907, "grad_norm": 0.7998109937320629, "learning_rate": 6.221247841892846e-06, "loss": 0.3879734992980957, "num_input_tokens_seen": 547746624, "step": 12520, "train_runtime": 96805.6441, "train_tokens_per_second": 5658.21 }, { "epoch": 0.8433207648801508, "grad_norm": 0.7307238083679223, "learning_rate": 6.218683671987611e-06, "loss": 0.3691586971282959, "num_input_tokens_seen": 547983928, "step": 12525, "train_runtime": 96840.3547, "train_tokens_per_second": 5658.632 }, { "epoch": 0.843657419876111, "grad_norm": 0.7271187490915773, "learning_rate": 6.216119161281373e-06, "loss": 0.37589943408966064, "num_input_tokens_seen": 548209600, "step": 12530, "train_runtime": 96879.0798, "train_tokens_per_second": 5658.699 }, { "epoch": 0.8439940748720711, "grad_norm": 0.7311632772691732, "learning_rate": 6.213554310491291e-06, "loss": 0.3672966003417969, "num_input_tokens_seen": 548421688, "step": 12535, "train_runtime": 96928.6015, "train_tokens_per_second": 5657.996 }, { "epoch": 0.8443307298680313, "grad_norm": 0.7450184498891292, "learning_rate": 6.210989120334616e-06, "loss": 0.362609338760376, "num_input_tokens_seen": 548644072, "step": 12540, "train_runtime": 96971.5458, "train_tokens_per_second": 5657.784 }, { "epoch": 0.8446673848639914, "grad_norm": 0.7758427572495085, "learning_rate": 6.208423591528694e-06, "loss": 0.38643317222595214, "num_input_tokens_seen": 548854336, "step": 12545, "train_runtime": 97009.7887, "train_tokens_per_second": 5657.721 }, { "epoch": 0.8450040398599515, "grad_norm": 0.688742133220875, "learning_rate": 6.205857724790969e-06, "loss": 0.3612468481063843, "num_input_tokens_seen": 549072600, "step": 12550, "train_runtime": 97048.5889, "train_tokens_per_second": 5657.708 }, { "epoch": 0.8453406948559117, "grad_norm": 0.7926232068697935, "learning_rate": 6.203291520838974e-06, "loss": 0.409790563583374, "num_input_tokens_seen": 549303984, "step": 12555, "train_runtime": 97086.2605, "train_tokens_per_second": 5657.896 }, { "epoch": 0.8456773498518718, "grad_norm": 0.7041401739211672, "learning_rate": 6.200724980390344e-06, "loss": 0.34305951595306394, "num_input_tokens_seen": 549497696, "step": 12560, "train_runtime": 97125.3875, "train_tokens_per_second": 5657.611 }, { "epoch": 0.846014004847832, "grad_norm": 0.6959581809215943, "learning_rate": 6.198158104162804e-06, "loss": 0.3178701400756836, "num_input_tokens_seen": 549713600, "step": 12565, "train_runtime": 97158.9336, "train_tokens_per_second": 5657.88 }, { "epoch": 0.8463506598437921, "grad_norm": 0.6766745725154476, "learning_rate": 6.1955908928741685e-06, "loss": 0.37602977752685546, "num_input_tokens_seen": 549953184, "step": 12570, "train_runtime": 97195.8557, "train_tokens_per_second": 5658.196 }, { "epoch": 0.8466873148397522, "grad_norm": 0.6881093744203187, "learning_rate": 6.193023347242353e-06, "loss": 0.38083457946777344, "num_input_tokens_seen": 550184352, "step": 12575, "train_runtime": 97232.314, "train_tokens_per_second": 5658.452 }, { "epoch": 0.8470239698357124, "grad_norm": 0.741931440728507, "learning_rate": 6.190455467985361e-06, "loss": 0.3633177042007446, "num_input_tokens_seen": 550405552, "step": 12580, "train_runtime": 97272.8862, "train_tokens_per_second": 5658.366 }, { "epoch": 0.8473606248316725, "grad_norm": 0.7792859259983645, "learning_rate": 6.187887255821295e-06, "loss": 0.3954836368560791, "num_input_tokens_seen": 550625896, "step": 12585, "train_runtime": 97305.8601, "train_tokens_per_second": 5658.713 }, { "epoch": 0.8476972798276327, "grad_norm": 0.7394004400669401, "learning_rate": 6.185318711468345e-06, "loss": 0.3501850128173828, "num_input_tokens_seen": 550827088, "step": 12590, "train_runtime": 97346.1248, "train_tokens_per_second": 5658.439 }, { "epoch": 0.8480339348235928, "grad_norm": 0.7906419360212633, "learning_rate": 6.182749835644799e-06, "loss": 0.3587897777557373, "num_input_tokens_seen": 551036712, "step": 12595, "train_runtime": 97378.9075, "train_tokens_per_second": 5658.687 }, { "epoch": 0.8483705898195529, "grad_norm": 0.6720676543784547, "learning_rate": 6.180180629069031e-06, "loss": 0.3534966468811035, "num_input_tokens_seen": 551269008, "step": 12600, "train_runtime": 97416.9713, "train_tokens_per_second": 5658.86 }, { "epoch": 0.8487072448155131, "grad_norm": 1.0844161686609408, "learning_rate": 6.177611092459514e-06, "loss": 0.3404214859008789, "num_input_tokens_seen": 551486584, "step": 12605, "train_runtime": 97454.9229, "train_tokens_per_second": 5658.889 }, { "epoch": 0.8490438998114732, "grad_norm": 0.8339846261840644, "learning_rate": 6.175041226534809e-06, "loss": 0.3584805965423584, "num_input_tokens_seen": 551707952, "step": 12610, "train_runtime": 97487.377, "train_tokens_per_second": 5659.276 }, { "epoch": 0.8493805548074334, "grad_norm": 0.688269893800755, "learning_rate": 6.172471032013574e-06, "loss": 0.327656888961792, "num_input_tokens_seen": 551932560, "step": 12615, "train_runtime": 97526.9729, "train_tokens_per_second": 5659.281 }, { "epoch": 0.8497172098033935, "grad_norm": 0.6595384550469138, "learning_rate": 6.169900509614553e-06, "loss": 0.3601629972457886, "num_input_tokens_seen": 552163800, "step": 12620, "train_runtime": 97577.6237, "train_tokens_per_second": 5658.713 }, { "epoch": 0.8500538647993536, "grad_norm": 0.8030731667400421, "learning_rate": 6.167329660056585e-06, "loss": 0.36720144748687744, "num_input_tokens_seen": 552375472, "step": 12625, "train_runtime": 97617.7309, "train_tokens_per_second": 5658.557 }, { "epoch": 0.8503905197953138, "grad_norm": 0.6580730799233167, "learning_rate": 6.1647584840586e-06, "loss": 0.36503446102142334, "num_input_tokens_seen": 552599576, "step": 12630, "train_runtime": 97665.6991, "train_tokens_per_second": 5658.072 }, { "epoch": 0.8507271747912739, "grad_norm": 0.7006154386468065, "learning_rate": 6.1621869823396175e-06, "loss": 0.37128496170043945, "num_input_tokens_seen": 552832696, "step": 12635, "train_runtime": 97703.9353, "train_tokens_per_second": 5658.244 }, { "epoch": 0.851063829787234, "grad_norm": 0.7225238597915238, "learning_rate": 6.159615155618752e-06, "loss": 0.37408173084259033, "num_input_tokens_seen": 553059920, "step": 12640, "train_runtime": 97737.0325, "train_tokens_per_second": 5658.653 }, { "epoch": 0.8514004847831942, "grad_norm": 0.8136467242343185, "learning_rate": 6.157043004615207e-06, "loss": 0.38596835136413576, "num_input_tokens_seen": 553300640, "step": 12645, "train_runtime": 97780.3263, "train_tokens_per_second": 5658.609 }, { "epoch": 0.8517371397791543, "grad_norm": 0.7939080541143891, "learning_rate": 6.1544705300482755e-06, "loss": 0.3616677761077881, "num_input_tokens_seen": 553532032, "step": 12650, "train_runtime": 97820.9636, "train_tokens_per_second": 5658.624 }, { "epoch": 0.8520737947751145, "grad_norm": 0.6610977560801387, "learning_rate": 6.151897732637341e-06, "loss": 0.3330955982208252, "num_input_tokens_seen": 553739416, "step": 12655, "train_runtime": 97857.6515, "train_tokens_per_second": 5658.622 }, { "epoch": 0.8524104497710746, "grad_norm": 0.8508497854348367, "learning_rate": 6.149324613101877e-06, "loss": 0.37527806758880616, "num_input_tokens_seen": 553959976, "step": 12660, "train_runtime": 97897.0387, "train_tokens_per_second": 5658.598 }, { "epoch": 0.8527471047670347, "grad_norm": 0.6193562313644957, "learning_rate": 6.146751172161453e-06, "loss": 0.33863201141357424, "num_input_tokens_seen": 554189776, "step": 12665, "train_runtime": 97940.3461, "train_tokens_per_second": 5658.442 }, { "epoch": 0.8530837597629949, "grad_norm": 0.7796518940843955, "learning_rate": 6.144177410535719e-06, "loss": 0.3652313470840454, "num_input_tokens_seen": 554414232, "step": 12670, "train_runtime": 97979.2461, "train_tokens_per_second": 5658.486 }, { "epoch": 0.853420414758955, "grad_norm": 0.7186651171193743, "learning_rate": 6.14160332894442e-06, "loss": 0.3651700973510742, "num_input_tokens_seen": 554625192, "step": 12675, "train_runtime": 98015.4768, "train_tokens_per_second": 5658.547 }, { "epoch": 0.8537570697549152, "grad_norm": 0.724709697937217, "learning_rate": 6.139028928107391e-06, "loss": 0.36736459732055665, "num_input_tokens_seen": 554842240, "step": 12680, "train_runtime": 98056.2763, "train_tokens_per_second": 5658.406 }, { "epoch": 0.8540937247508753, "grad_norm": 0.7018554477013618, "learning_rate": 6.136454208744553e-06, "loss": 0.3479247808456421, "num_input_tokens_seen": 555060144, "step": 12685, "train_runtime": 98097.7581, "train_tokens_per_second": 5658.235 }, { "epoch": 0.8544303797468354, "grad_norm": 0.7210589341441987, "learning_rate": 6.133879171575921e-06, "loss": 0.3790309906005859, "num_input_tokens_seen": 555276648, "step": 12690, "train_runtime": 98135.4374, "train_tokens_per_second": 5658.268 }, { "epoch": 0.8547670347427956, "grad_norm": 0.8012051731436295, "learning_rate": 6.131303817321595e-06, "loss": 0.3976943254470825, "num_input_tokens_seen": 555506600, "step": 12695, "train_runtime": 98173.0099, "train_tokens_per_second": 5658.445 }, { "epoch": 0.8551036897387557, "grad_norm": 0.6686702415410488, "learning_rate": 6.128728146701763e-06, "loss": 0.3907043933868408, "num_input_tokens_seen": 555735640, "step": 12700, "train_runtime": 98208.5683, "train_tokens_per_second": 5658.729 }, { "epoch": 0.8554403447347159, "grad_norm": 0.6745127609405563, "learning_rate": 6.126152160436705e-06, "loss": 0.3401200294494629, "num_input_tokens_seen": 555954936, "step": 12705, "train_runtime": 98247.4191, "train_tokens_per_second": 5658.723 }, { "epoch": 0.855776999730676, "grad_norm": 0.9952487891058109, "learning_rate": 6.123575859246784e-06, "loss": 0.3820429801940918, "num_input_tokens_seen": 556162568, "step": 12710, "train_runtime": 98285.6421, "train_tokens_per_second": 5658.635 }, { "epoch": 0.8561136547266361, "grad_norm": 0.7343846388254841, "learning_rate": 6.120999243852459e-06, "loss": 0.3488877773284912, "num_input_tokens_seen": 556374088, "step": 12715, "train_runtime": 98325.3673, "train_tokens_per_second": 5658.5 }, { "epoch": 0.8564503097225963, "grad_norm": 0.8403978577775663, "learning_rate": 6.118422314974269e-06, "loss": 0.3801596164703369, "num_input_tokens_seen": 556596000, "step": 12720, "train_runtime": 98368.0103, "train_tokens_per_second": 5658.303 }, { "epoch": 0.8567869647185564, "grad_norm": 0.7544062671681226, "learning_rate": 6.115845073332845e-06, "loss": 0.36686029434204104, "num_input_tokens_seen": 556828456, "step": 12725, "train_runtime": 98413.3452, "train_tokens_per_second": 5658.058 }, { "epoch": 0.8571236197145166, "grad_norm": 0.8566960890477198, "learning_rate": 6.113267519648905e-06, "loss": 0.39199421405792234, "num_input_tokens_seen": 557067040, "step": 12730, "train_runtime": 98457.4483, "train_tokens_per_second": 5657.947 }, { "epoch": 0.8574602747104767, "grad_norm": 0.6753240704632734, "learning_rate": 6.110689654643253e-06, "loss": 0.36382412910461426, "num_input_tokens_seen": 557274264, "step": 12735, "train_runtime": 98497.8079, "train_tokens_per_second": 5657.733 }, { "epoch": 0.8577969297064368, "grad_norm": 0.7623447924884228, "learning_rate": 6.1081114790367805e-06, "loss": 0.37306723594665525, "num_input_tokens_seen": 557484064, "step": 12740, "train_runtime": 98531.9864, "train_tokens_per_second": 5657.899 }, { "epoch": 0.858133584702397, "grad_norm": 0.7690727585148884, "learning_rate": 6.105532993550467e-06, "loss": 0.37079343795776365, "num_input_tokens_seen": 557707168, "step": 12745, "train_runtime": 98570.6779, "train_tokens_per_second": 5657.942 }, { "epoch": 0.8584702396983571, "grad_norm": 0.7227829734774792, "learning_rate": 6.1029541989053765e-06, "loss": 0.3675063610076904, "num_input_tokens_seen": 557923328, "step": 12750, "train_runtime": 98611.8723, "train_tokens_per_second": 5657.77 }, { "epoch": 0.8588068946943173, "grad_norm": 0.6216338336006675, "learning_rate": 6.100375095822661e-06, "loss": 0.3660135746002197, "num_input_tokens_seen": 558141912, "step": 12755, "train_runtime": 98653.6004, "train_tokens_per_second": 5657.593 }, { "epoch": 0.8591435496902774, "grad_norm": 0.7752180098632147, "learning_rate": 6.097795685023558e-06, "loss": 0.3654344081878662, "num_input_tokens_seen": 558363664, "step": 12760, "train_runtime": 98689.3362, "train_tokens_per_second": 5657.791 }, { "epoch": 0.8594802046862375, "grad_norm": 0.7139656897700937, "learning_rate": 6.095215967229396e-06, "loss": 0.3468952655792236, "num_input_tokens_seen": 558569128, "step": 12765, "train_runtime": 98726.8939, "train_tokens_per_second": 5657.72 }, { "epoch": 0.8598168596821977, "grad_norm": 0.6751611340302733, "learning_rate": 6.092635943161578e-06, "loss": 0.37009525299072266, "num_input_tokens_seen": 558798144, "step": 12770, "train_runtime": 98770.45, "train_tokens_per_second": 5657.544 }, { "epoch": 0.8601535146781578, "grad_norm": 0.7202350000001299, "learning_rate": 6.090055613541603e-06, "loss": 0.34846246242523193, "num_input_tokens_seen": 559026000, "step": 12775, "train_runtime": 98813.4858, "train_tokens_per_second": 5657.386 }, { "epoch": 0.860490169674118, "grad_norm": 0.7513541698981121, "learning_rate": 6.087474979091052e-06, "loss": 0.3586388111114502, "num_input_tokens_seen": 559233040, "step": 12780, "train_runtime": 98860.409, "train_tokens_per_second": 5656.795 }, { "epoch": 0.8608268246700781, "grad_norm": 0.7207910613458428, "learning_rate": 6.084894040531591e-06, "loss": 0.3598465919494629, "num_input_tokens_seen": 559456240, "step": 12785, "train_runtime": 98903.5566, "train_tokens_per_second": 5656.584 }, { "epoch": 0.8611634796660382, "grad_norm": 0.7450858357428686, "learning_rate": 6.0823127985849705e-06, "loss": 0.35327887535095215, "num_input_tokens_seen": 559662696, "step": 12790, "train_runtime": 98942.3562, "train_tokens_per_second": 5656.452 }, { "epoch": 0.8615001346619984, "grad_norm": 0.7413157970110851, "learning_rate": 6.079731253973028e-06, "loss": 0.3576143741607666, "num_input_tokens_seen": 559886624, "step": 12795, "train_runtime": 98988.6398, "train_tokens_per_second": 5656.069 }, { "epoch": 0.8618367896579585, "grad_norm": 0.7990871684605166, "learning_rate": 6.077149407417683e-06, "loss": 0.36043851375579833, "num_input_tokens_seen": 560101432, "step": 12800, "train_runtime": 99024.1718, "train_tokens_per_second": 5656.209 }, { "epoch": 0.8621734446539187, "grad_norm": 0.7364962437233615, "learning_rate": 6.07456725964094e-06, "loss": 0.3793959617614746, "num_input_tokens_seen": 560309472, "step": 12805, "train_runtime": 99059.299, "train_tokens_per_second": 5656.304 }, { "epoch": 0.8625100996498788, "grad_norm": 0.680598341183089, "learning_rate": 6.07198481136489e-06, "loss": 0.3436178684234619, "num_input_tokens_seen": 560520408, "step": 12810, "train_runtime": 99092.681, "train_tokens_per_second": 5656.527 }, { "epoch": 0.8628467546458389, "grad_norm": 0.765274818340009, "learning_rate": 6.069402063311706e-06, "loss": 0.3549325704574585, "num_input_tokens_seen": 560731064, "step": 12815, "train_runtime": 99135.7209, "train_tokens_per_second": 5656.196 }, { "epoch": 0.8631834096417991, "grad_norm": 0.8395744171280569, "learning_rate": 6.066819016203646e-06, "loss": 0.36306018829345704, "num_input_tokens_seen": 560944360, "step": 12820, "train_runtime": 99173.0123, "train_tokens_per_second": 5656.22 }, { "epoch": 0.8635200646377592, "grad_norm": 0.7436029507337527, "learning_rate": 6.064235670763048e-06, "loss": 0.36905884742736816, "num_input_tokens_seen": 561164928, "step": 12825, "train_runtime": 99209.242, "train_tokens_per_second": 5656.378 }, { "epoch": 0.8638567196337193, "grad_norm": 0.6763369772275482, "learning_rate": 6.06165202771234e-06, "loss": 0.3765472412109375, "num_input_tokens_seen": 561394056, "step": 12830, "train_runtime": 99250.4089, "train_tokens_per_second": 5656.34 }, { "epoch": 0.8641933746296795, "grad_norm": 0.6931570065850123, "learning_rate": 6.059068087774026e-06, "loss": 0.34474341869354247, "num_input_tokens_seen": 561593424, "step": 12835, "train_runtime": 99291.1127, "train_tokens_per_second": 5656.029 }, { "epoch": 0.8645300296256396, "grad_norm": 0.7306127243942253, "learning_rate": 6.0564838516707005e-06, "loss": 0.38959674835205077, "num_input_tokens_seen": 561821784, "step": 12840, "train_runtime": 99328.0768, "train_tokens_per_second": 5656.223 }, { "epoch": 0.8648666846215998, "grad_norm": 0.6692585369253214, "learning_rate": 6.053899320125033e-06, "loss": 0.34748311042785646, "num_input_tokens_seen": 562042168, "step": 12845, "train_runtime": 99368.2816, "train_tokens_per_second": 5656.153 }, { "epoch": 0.8652033396175599, "grad_norm": 0.731387810949299, "learning_rate": 6.051314493859782e-06, "loss": 0.37701342105865476, "num_input_tokens_seen": 562268616, "step": 12850, "train_runtime": 99405.5774, "train_tokens_per_second": 5656.309 }, { "epoch": 0.86553999461352, "grad_norm": 0.744983156104233, "learning_rate": 6.048729373597786e-06, "loss": 0.36400351524353025, "num_input_tokens_seen": 562488728, "step": 12855, "train_runtime": 99441.1097, "train_tokens_per_second": 5656.501 }, { "epoch": 0.8658766496094802, "grad_norm": 0.7052968569468162, "learning_rate": 6.046143960061963e-06, "loss": 0.38647964000701907, "num_input_tokens_seen": 562715632, "step": 12860, "train_runtime": 99479.679, "train_tokens_per_second": 5656.589 }, { "epoch": 0.8662133046054403, "grad_norm": 0.8490020320396742, "learning_rate": 6.043558253975319e-06, "loss": 0.3893282413482666, "num_input_tokens_seen": 562949544, "step": 12865, "train_runtime": 99522.1085, "train_tokens_per_second": 5656.528 }, { "epoch": 0.8665499596014005, "grad_norm": 0.7443300106386931, "learning_rate": 6.040972256060936e-06, "loss": 0.35498225688934326, "num_input_tokens_seen": 563161168, "step": 12870, "train_runtime": 99567.3086, "train_tokens_per_second": 5656.085 }, { "epoch": 0.8668866145973606, "grad_norm": 0.6849806622056446, "learning_rate": 6.038385967041982e-06, "loss": 0.3538069248199463, "num_input_tokens_seen": 563369656, "step": 12875, "train_runtime": 99613.8289, "train_tokens_per_second": 5655.537 }, { "epoch": 0.8672232695933207, "grad_norm": 0.6384169452977918, "learning_rate": 6.035799387641703e-06, "loss": 0.36878552436828616, "num_input_tokens_seen": 563594552, "step": 12880, "train_runtime": 99655.4177, "train_tokens_per_second": 5655.433 }, { "epoch": 0.8675599245892809, "grad_norm": 0.7636357717419208, "learning_rate": 6.033212518583427e-06, "loss": 0.3786178112030029, "num_input_tokens_seen": 563803512, "step": 12885, "train_runtime": 99695.3116, "train_tokens_per_second": 5655.266 }, { "epoch": 0.867896579585241, "grad_norm": 0.8323239828663773, "learning_rate": 6.030625360590567e-06, "loss": 0.35876643657684326, "num_input_tokens_seen": 564030520, "step": 12890, "train_runtime": 99734.3991, "train_tokens_per_second": 5655.326 }, { "epoch": 0.8682332345812012, "grad_norm": 0.7006071245579706, "learning_rate": 6.028037914386609e-06, "loss": 0.3620233297348022, "num_input_tokens_seen": 564252688, "step": 12895, "train_runtime": 99773.9473, "train_tokens_per_second": 5655.311 }, { "epoch": 0.8685698895771613, "grad_norm": 0.7617834642572114, "learning_rate": 6.025450180695128e-06, "loss": 0.38210210800170896, "num_input_tokens_seen": 564471472, "step": 12900, "train_runtime": 99808.9271, "train_tokens_per_second": 5655.521 }, { "epoch": 0.8689065445731214, "grad_norm": 0.8560111437943349, "learning_rate": 6.022862160239774e-06, "loss": 0.3630260467529297, "num_input_tokens_seen": 564683208, "step": 12905, "train_runtime": 99850.9033, "train_tokens_per_second": 5655.264 }, { "epoch": 0.8692431995690816, "grad_norm": 0.6306746195476955, "learning_rate": 6.020273853744277e-06, "loss": 0.3535295009613037, "num_input_tokens_seen": 564903760, "step": 12910, "train_runtime": 99888.6442, "train_tokens_per_second": 5655.335 }, { "epoch": 0.8695798545650417, "grad_norm": 0.6756821029513189, "learning_rate": 6.017685261932452e-06, "loss": 0.35518722534179686, "num_input_tokens_seen": 565105760, "step": 12915, "train_runtime": 99923.6252, "train_tokens_per_second": 5655.377 }, { "epoch": 0.8699165095610019, "grad_norm": 0.75004570307814, "learning_rate": 6.015096385528189e-06, "loss": 0.37440195083618166, "num_input_tokens_seen": 565318768, "step": 12920, "train_runtime": 99960.4635, "train_tokens_per_second": 5655.424 }, { "epoch": 0.870253164556962, "grad_norm": 0.725287349099034, "learning_rate": 6.012507225255457e-06, "loss": 0.3945824146270752, "num_input_tokens_seen": 565515560, "step": 12925, "train_runtime": 99995.6077, "train_tokens_per_second": 5655.404 }, { "epoch": 0.8705898195529221, "grad_norm": 0.6923174837526764, "learning_rate": 6.009917781838309e-06, "loss": 0.3706216812133789, "num_input_tokens_seen": 565736648, "step": 12930, "train_runtime": 100027.8477, "train_tokens_per_second": 5655.791 }, { "epoch": 0.8709264745488823, "grad_norm": 0.6934584410887805, "learning_rate": 6.007328056000873e-06, "loss": 0.37667386531829833, "num_input_tokens_seen": 565960800, "step": 12935, "train_runtime": 100063.8699, "train_tokens_per_second": 5655.996 }, { "epoch": 0.8712631295448424, "grad_norm": 0.7940274414990574, "learning_rate": 6.004738048467359e-06, "loss": 0.379984712600708, "num_input_tokens_seen": 566180672, "step": 12940, "train_runtime": 100101.3217, "train_tokens_per_second": 5656.076 }, { "epoch": 0.8715997845408026, "grad_norm": 0.7344390394871104, "learning_rate": 6.002147759962054e-06, "loss": 0.37138075828552247, "num_input_tokens_seen": 566401496, "step": 12945, "train_runtime": 100139.2781, "train_tokens_per_second": 5656.137 }, { "epoch": 0.8719364395367627, "grad_norm": 0.7421475803173249, "learning_rate": 5.999557191209323e-06, "loss": 0.39212737083435056, "num_input_tokens_seen": 566630216, "step": 12950, "train_runtime": 100175.2546, "train_tokens_per_second": 5656.389 }, { "epoch": 0.8722730945327228, "grad_norm": 0.8003491943698586, "learning_rate": 5.996966342933611e-06, "loss": 0.33372251987457274, "num_input_tokens_seen": 566848176, "step": 12955, "train_runtime": 100212.8634, "train_tokens_per_second": 5656.441 }, { "epoch": 0.872609749528683, "grad_norm": 0.7450010892993638, "learning_rate": 5.99437521585944e-06, "loss": 0.37457475662231443, "num_input_tokens_seen": 567056408, "step": 12960, "train_runtime": 100250.1105, "train_tokens_per_second": 5656.417 }, { "epoch": 0.8729464045246431, "grad_norm": 0.7217432409540151, "learning_rate": 5.99178381071141e-06, "loss": 0.3829956531524658, "num_input_tokens_seen": 567275168, "step": 12965, "train_runtime": 100287.1326, "train_tokens_per_second": 5656.51 }, { "epoch": 0.8732830595206033, "grad_norm": 0.8055483175054227, "learning_rate": 5.989192128214201e-06, "loss": 0.36388020515441893, "num_input_tokens_seen": 567493544, "step": 12970, "train_runtime": 100327.3129, "train_tokens_per_second": 5656.421 }, { "epoch": 0.8736197145165634, "grad_norm": 0.7033510804995021, "learning_rate": 5.986600169092568e-06, "loss": 0.350065803527832, "num_input_tokens_seen": 567708176, "step": 12975, "train_runtime": 100364.1125, "train_tokens_per_second": 5656.486 }, { "epoch": 0.8739563695125235, "grad_norm": 0.7167335785321889, "learning_rate": 5.984007934071343e-06, "loss": 0.3742049217224121, "num_input_tokens_seen": 567941160, "step": 12980, "train_runtime": 100407.0573, "train_tokens_per_second": 5656.387 }, { "epoch": 0.8742930245084837, "grad_norm": 0.7554361554619513, "learning_rate": 5.981415423875436e-06, "loss": 0.36548290252685545, "num_input_tokens_seen": 568166040, "step": 12985, "train_runtime": 100442.582, "train_tokens_per_second": 5656.625 }, { "epoch": 0.8746296795044438, "grad_norm": 0.9815756056409435, "learning_rate": 5.978822639229836e-06, "loss": 0.3484132528305054, "num_input_tokens_seen": 568367984, "step": 12990, "train_runtime": 100479.4893, "train_tokens_per_second": 5656.557 }, { "epoch": 0.874966334500404, "grad_norm": 0.6864898867694621, "learning_rate": 5.976229580859607e-06, "loss": 0.36139798164367676, "num_input_tokens_seen": 568596000, "step": 12995, "train_runtime": 100516.4986, "train_tokens_per_second": 5656.743 }, { "epoch": 0.8753029894963641, "grad_norm": 0.7186739597846133, "learning_rate": 5.9736362494898895e-06, "loss": 0.3539880275726318, "num_input_tokens_seen": 568814440, "step": 13000, "train_runtime": 100555.0904, "train_tokens_per_second": 5656.744 }, { "epoch": 0.8756396444923242, "grad_norm": 0.6506103454572264, "learning_rate": 5.971042645845897e-06, "loss": 0.3666597843170166, "num_input_tokens_seen": 569029824, "step": 13005, "train_runtime": 100595.3102, "train_tokens_per_second": 5656.624 }, { "epoch": 0.8759762994882844, "grad_norm": 0.7706124062857171, "learning_rate": 5.968448770652926e-06, "loss": 0.36510615348815917, "num_input_tokens_seen": 569265096, "step": 13010, "train_runtime": 100627.6528, "train_tokens_per_second": 5657.144 }, { "epoch": 0.8763129544842445, "grad_norm": 0.7419816582789281, "learning_rate": 5.965854624636345e-06, "loss": 0.3825402736663818, "num_input_tokens_seen": 569479936, "step": 13015, "train_runtime": 100669.5038, "train_tokens_per_second": 5656.926 }, { "epoch": 0.8766496094802047, "grad_norm": 0.7717112571968371, "learning_rate": 5.963260208521598e-06, "loss": 0.3698084354400635, "num_input_tokens_seen": 569691888, "step": 13020, "train_runtime": 100708.4391, "train_tokens_per_second": 5656.844 }, { "epoch": 0.8769862644761648, "grad_norm": 0.6761324100161831, "learning_rate": 5.960665523034205e-06, "loss": 0.38090927600860597, "num_input_tokens_seen": 569901576, "step": 13025, "train_runtime": 100749.3523, "train_tokens_per_second": 5656.628 }, { "epoch": 0.8773229194721249, "grad_norm": 0.7359973742678347, "learning_rate": 5.958070568899762e-06, "loss": 0.33312511444091797, "num_input_tokens_seen": 570123424, "step": 13030, "train_runtime": 100790.5444, "train_tokens_per_second": 5656.517 }, { "epoch": 0.8776595744680851, "grad_norm": 1.2136155199409513, "learning_rate": 5.955475346843939e-06, "loss": 0.3555187225341797, "num_input_tokens_seen": 570337248, "step": 13035, "train_runtime": 100824.0572, "train_tokens_per_second": 5656.758 }, { "epoch": 0.8779962294640452, "grad_norm": 0.6546063737811157, "learning_rate": 5.952879857592482e-06, "loss": 0.3440871000289917, "num_input_tokens_seen": 570549824, "step": 13040, "train_runtime": 100867.9537, "train_tokens_per_second": 5656.403 }, { "epoch": 0.8783328844600053, "grad_norm": 0.6844892975959102, "learning_rate": 5.950284101871212e-06, "loss": 0.38202319145202634, "num_input_tokens_seen": 570757152, "step": 13045, "train_runtime": 100906.3146, "train_tokens_per_second": 5656.308 }, { "epoch": 0.8786695394559655, "grad_norm": 0.747172974034045, "learning_rate": 5.947688080406023e-06, "loss": 0.3463796615600586, "num_input_tokens_seen": 570960928, "step": 13050, "train_runtime": 100940.5074, "train_tokens_per_second": 5656.41 }, { "epoch": 0.8790061944519256, "grad_norm": 0.7561590864609555, "learning_rate": 5.945091793922885e-06, "loss": 0.3679834842681885, "num_input_tokens_seen": 571177360, "step": 13055, "train_runtime": 100974.1104, "train_tokens_per_second": 5656.671 }, { "epoch": 0.8793428494478858, "grad_norm": 0.6782284385723677, "learning_rate": 5.942495243147839e-06, "loss": 0.3929899215698242, "num_input_tokens_seen": 571399192, "step": 13060, "train_runtime": 101005.759, "train_tokens_per_second": 5657.095 }, { "epoch": 0.8796795044438459, "grad_norm": 0.7143338491446609, "learning_rate": 5.939898428807004e-06, "loss": 0.3815101146697998, "num_input_tokens_seen": 571612808, "step": 13065, "train_runtime": 101043.3454, "train_tokens_per_second": 5657.105 }, { "epoch": 0.880016159439806, "grad_norm": 0.8449030830666151, "learning_rate": 5.937301351626571e-06, "loss": 0.379590368270874, "num_input_tokens_seen": 571824200, "step": 13070, "train_runtime": 101081.8232, "train_tokens_per_second": 5657.043 }, { "epoch": 0.8803528144357662, "grad_norm": 0.6830378970909649, "learning_rate": 5.934704012332803e-06, "loss": 0.35865001678466796, "num_input_tokens_seen": 572052552, "step": 13075, "train_runtime": 101122.8991, "train_tokens_per_second": 5657.003 }, { "epoch": 0.8806894694317263, "grad_norm": 0.8010624909706995, "learning_rate": 5.93210641165204e-06, "loss": 0.4059410095214844, "num_input_tokens_seen": 572274280, "step": 13080, "train_runtime": 101165.6483, "train_tokens_per_second": 5656.804 }, { "epoch": 0.8810261244276865, "grad_norm": 0.7989521029331256, "learning_rate": 5.92950855031069e-06, "loss": 0.36967930793762205, "num_input_tokens_seen": 572493808, "step": 13085, "train_runtime": 101202.3764, "train_tokens_per_second": 5656.921 }, { "epoch": 0.8813627794236466, "grad_norm": 0.8258054867788488, "learning_rate": 5.926910429035239e-06, "loss": 0.36150131225585935, "num_input_tokens_seen": 572706072, "step": 13090, "train_runtime": 101239.3964, "train_tokens_per_second": 5656.949 }, { "epoch": 0.8816994344196067, "grad_norm": 0.7636365729370889, "learning_rate": 5.924312048552241e-06, "loss": 0.3525059223175049, "num_input_tokens_seen": 572932096, "step": 13095, "train_runtime": 101273.4837, "train_tokens_per_second": 5657.276 }, { "epoch": 0.8820360894155669, "grad_norm": 0.7191821908315644, "learning_rate": 5.9217134095883265e-06, "loss": 0.3641670227050781, "num_input_tokens_seen": 573150384, "step": 13100, "train_runtime": 101314.4917, "train_tokens_per_second": 5657.141 }, { "epoch": 0.882372744411527, "grad_norm": 0.7363436743411855, "learning_rate": 5.919114512870197e-06, "loss": 0.3603955268859863, "num_input_tokens_seen": 573381144, "step": 13105, "train_runtime": 101359.314, "train_tokens_per_second": 5656.916 }, { "epoch": 0.8827093994074872, "grad_norm": 0.7568233135879606, "learning_rate": 5.916515359124623e-06, "loss": 0.3425842046737671, "num_input_tokens_seen": 573581832, "step": 13110, "train_runtime": 101399.4218, "train_tokens_per_second": 5656.658 }, { "epoch": 0.8830460544034473, "grad_norm": 0.7215795683330004, "learning_rate": 5.913915949078453e-06, "loss": 0.36979331970214846, "num_input_tokens_seen": 573801512, "step": 13115, "train_runtime": 101438.6834, "train_tokens_per_second": 5656.634 }, { "epoch": 0.8833827093994074, "grad_norm": 0.7764516396496984, "learning_rate": 5.911316283458601e-06, "loss": 0.3616600513458252, "num_input_tokens_seen": 574007544, "step": 13120, "train_runtime": 101478.4371, "train_tokens_per_second": 5656.448 }, { "epoch": 0.8837193643953676, "grad_norm": 0.7391044514688772, "learning_rate": 5.908716362992057e-06, "loss": 0.36803760528564455, "num_input_tokens_seen": 574215752, "step": 13125, "train_runtime": 101514.9279, "train_tokens_per_second": 5656.466 }, { "epoch": 0.8840560193913277, "grad_norm": 0.6863603049824145, "learning_rate": 5.90611618840588e-06, "loss": 0.379679536819458, "num_input_tokens_seen": 574434272, "step": 13130, "train_runtime": 101554.971, "train_tokens_per_second": 5656.388 }, { "epoch": 0.8843926743872879, "grad_norm": 0.9353489354148398, "learning_rate": 5.903515760427198e-06, "loss": 0.4000962257385254, "num_input_tokens_seen": 574653864, "step": 13135, "train_runtime": 101588.2234, "train_tokens_per_second": 5656.698 }, { "epoch": 0.884729329383248, "grad_norm": 0.732273202002582, "learning_rate": 5.900915079783218e-06, "loss": 0.3558906316757202, "num_input_tokens_seen": 574887384, "step": 13140, "train_runtime": 101622.3485, "train_tokens_per_second": 5657.096 }, { "epoch": 0.8850659843792081, "grad_norm": 0.7460917342917756, "learning_rate": 5.898314147201207e-06, "loss": 0.3416097640991211, "num_input_tokens_seen": 575101544, "step": 13145, "train_runtime": 101664.6483, "train_tokens_per_second": 5656.849 }, { "epoch": 0.8854026393751683, "grad_norm": 1.0430878064810838, "learning_rate": 5.895712963408511e-06, "loss": 0.3921904325485229, "num_input_tokens_seen": 575309032, "step": 13150, "train_runtime": 101704.7114, "train_tokens_per_second": 5656.661 }, { "epoch": 0.8857392943711284, "grad_norm": 0.7135808350871835, "learning_rate": 5.893111529132539e-06, "loss": 0.38542513847351073, "num_input_tokens_seen": 575518184, "step": 13155, "train_runtime": 101742.2738, "train_tokens_per_second": 5656.628 }, { "epoch": 0.8860759493670886, "grad_norm": 0.7661970012022706, "learning_rate": 5.8905098451007755e-06, "loss": 0.37914443016052246, "num_input_tokens_seen": 575721848, "step": 13160, "train_runtime": 101781.9439, "train_tokens_per_second": 5656.424 }, { "epoch": 0.8864126043630487, "grad_norm": 0.7203329040983677, "learning_rate": 5.887907912040774e-06, "loss": 0.3751526355743408, "num_input_tokens_seen": 575946104, "step": 13165, "train_runtime": 101814.7009, "train_tokens_per_second": 5656.807 }, { "epoch": 0.8867492593590088, "grad_norm": 0.7424424433197104, "learning_rate": 5.885305730680158e-06, "loss": 0.3788419723510742, "num_input_tokens_seen": 576173784, "step": 13170, "train_runtime": 101847.3914, "train_tokens_per_second": 5657.227 }, { "epoch": 0.887085914354969, "grad_norm": 0.7289665105864628, "learning_rate": 5.882703301746616e-06, "loss": 0.36290099620819094, "num_input_tokens_seen": 576389120, "step": 13175, "train_runtime": 101889.8836, "train_tokens_per_second": 5656.981 }, { "epoch": 0.8874225693509291, "grad_norm": 0.7262294984371385, "learning_rate": 5.88010062596791e-06, "loss": 0.35980806350708006, "num_input_tokens_seen": 576598016, "step": 13180, "train_runtime": 101930.8807, "train_tokens_per_second": 5656.755 }, { "epoch": 0.8877592243468893, "grad_norm": 0.601051210488872, "learning_rate": 5.877497704071871e-06, "loss": 0.3475220203399658, "num_input_tokens_seen": 576831392, "step": 13185, "train_runtime": 101969.0556, "train_tokens_per_second": 5656.926 }, { "epoch": 0.8880958793428494, "grad_norm": 0.7662456138801742, "learning_rate": 5.874894536786396e-06, "loss": 0.3340578079223633, "num_input_tokens_seen": 577044568, "step": 13190, "train_runtime": 102009.2868, "train_tokens_per_second": 5656.785 }, { "epoch": 0.8884325343388096, "grad_norm": 0.7991035565617537, "learning_rate": 5.8722911248394555e-06, "loss": 0.33777599334716796, "num_input_tokens_seen": 577243936, "step": 13195, "train_runtime": 102050.722, "train_tokens_per_second": 5656.441 }, { "epoch": 0.8887691893347698, "grad_norm": 0.7706395477682242, "learning_rate": 5.8696874689590824e-06, "loss": 0.3437623977661133, "num_input_tokens_seen": 577453888, "step": 13200, "train_runtime": 102083.4149, "train_tokens_per_second": 5656.687 }, { "epoch": 0.8891058443307299, "grad_norm": 0.8134775525528564, "learning_rate": 5.867083569873383e-06, "loss": 0.3634350776672363, "num_input_tokens_seen": 577679688, "step": 13205, "train_runtime": 102117.5448, "train_tokens_per_second": 5657.007 }, { "epoch": 0.8894424993266901, "grad_norm": 0.7673260905685215, "learning_rate": 5.8644794283105255e-06, "loss": 0.36774277687072754, "num_input_tokens_seen": 577900960, "step": 13210, "train_runtime": 102155.9766, "train_tokens_per_second": 5657.045 }, { "epoch": 0.8897791543226502, "grad_norm": 0.7882719202387701, "learning_rate": 5.861875044998755e-06, "loss": 0.40239391326904295, "num_input_tokens_seen": 578125704, "step": 13215, "train_runtime": 102190.4444, "train_tokens_per_second": 5657.336 }, { "epoch": 0.8901158093186103, "grad_norm": 0.7563037927913291, "learning_rate": 5.859270420666377e-06, "loss": 0.36860146522521975, "num_input_tokens_seen": 578343816, "step": 13220, "train_runtime": 102228.533, "train_tokens_per_second": 5657.362 }, { "epoch": 0.8904524643145705, "grad_norm": 0.7756762347173053, "learning_rate": 5.856665556041764e-06, "loss": 0.3481595993041992, "num_input_tokens_seen": 578548144, "step": 13225, "train_runtime": 102265.8667, "train_tokens_per_second": 5657.295 }, { "epoch": 0.8907891193105306, "grad_norm": 0.7183886665375777, "learning_rate": 5.8540604518533605e-06, "loss": 0.3859154224395752, "num_input_tokens_seen": 578772776, "step": 13230, "train_runtime": 102299.6045, "train_tokens_per_second": 5657.625 }, { "epoch": 0.8911257743064908, "grad_norm": 1.4271805656006054, "learning_rate": 5.851455108829675e-06, "loss": 0.34519567489624026, "num_input_tokens_seen": 578981024, "step": 13235, "train_runtime": 102340.8563, "train_tokens_per_second": 5657.379 }, { "epoch": 0.8914624293024509, "grad_norm": 0.6789149460339803, "learning_rate": 5.848849527699283e-06, "loss": 0.3698782205581665, "num_input_tokens_seen": 579201768, "step": 13240, "train_runtime": 102379.4065, "train_tokens_per_second": 5657.405 }, { "epoch": 0.891799084298411, "grad_norm": 0.7639170132777864, "learning_rate": 5.846243709190827e-06, "loss": 0.35757324695587156, "num_input_tokens_seen": 579419880, "step": 13245, "train_runtime": 102417.7033, "train_tokens_per_second": 5657.419 }, { "epoch": 0.8921357392943712, "grad_norm": 0.8837562529973417, "learning_rate": 5.843637654033019e-06, "loss": 0.37553791999816893, "num_input_tokens_seen": 579620760, "step": 13250, "train_runtime": 102459.8571, "train_tokens_per_second": 5657.052 }, { "epoch": 0.8924723942903313, "grad_norm": 0.676305723344451, "learning_rate": 5.841031362954629e-06, "loss": 0.39575533866882323, "num_input_tokens_seen": 579849048, "step": 13255, "train_runtime": 102495.0631, "train_tokens_per_second": 5657.336 }, { "epoch": 0.8928090492862915, "grad_norm": 0.6628658100615732, "learning_rate": 5.8384248366845e-06, "loss": 0.37047085762023924, "num_input_tokens_seen": 580077352, "step": 13260, "train_runtime": 102540.1881, "train_tokens_per_second": 5657.073 }, { "epoch": 0.8931457042822516, "grad_norm": 0.6825809402512039, "learning_rate": 5.8358180759515396e-06, "loss": 0.37846667766571046, "num_input_tokens_seen": 580288200, "step": 13265, "train_runtime": 102577.1371, "train_tokens_per_second": 5657.091 }, { "epoch": 0.8934823592782117, "grad_norm": 0.7471824938587698, "learning_rate": 5.833211081484719e-06, "loss": 0.37510037422180176, "num_input_tokens_seen": 580506904, "step": 13270, "train_runtime": 102618.782, "train_tokens_per_second": 5656.926 }, { "epoch": 0.8938190142741719, "grad_norm": 0.641717053888179, "learning_rate": 5.830603854013077e-06, "loss": 0.3673901081085205, "num_input_tokens_seen": 580723408, "step": 13275, "train_runtime": 102660.3376, "train_tokens_per_second": 5656.746 }, { "epoch": 0.894155669270132, "grad_norm": 0.8523312033525736, "learning_rate": 5.827996394265716e-06, "loss": 0.35067110061645507, "num_input_tokens_seen": 580935112, "step": 13280, "train_runtime": 102701.6639, "train_tokens_per_second": 5656.531 }, { "epoch": 0.8944923242660922, "grad_norm": 0.7794670905441262, "learning_rate": 5.825388702971802e-06, "loss": 0.35003342628479006, "num_input_tokens_seen": 581151304, "step": 13285, "train_runtime": 102733.2999, "train_tokens_per_second": 5656.893 }, { "epoch": 0.8948289792620523, "grad_norm": 0.7697508084044369, "learning_rate": 5.822780780860571e-06, "loss": 0.36042060852050783, "num_input_tokens_seen": 581367952, "step": 13290, "train_runtime": 102770.8878, "train_tokens_per_second": 5656.932 }, { "epoch": 0.8951656342580124, "grad_norm": 0.7094962387963322, "learning_rate": 5.820172628661317e-06, "loss": 0.3688685178756714, "num_input_tokens_seen": 581603552, "step": 13295, "train_runtime": 102804.4905, "train_tokens_per_second": 5657.375 }, { "epoch": 0.8955022892539726, "grad_norm": 0.7277970714037896, "learning_rate": 5.8175642471034045e-06, "loss": 0.34978251457214354, "num_input_tokens_seen": 581823928, "step": 13300, "train_runtime": 102838.1084, "train_tokens_per_second": 5657.669 }, { "epoch": 0.8958389442499327, "grad_norm": 0.7417598590201532, "learning_rate": 5.8149556369162565e-06, "loss": 0.3728696346282959, "num_input_tokens_seen": 582031800, "step": 13305, "train_runtime": 102877.0099, "train_tokens_per_second": 5657.55 }, { "epoch": 0.8961755992458929, "grad_norm": 0.7192634087406454, "learning_rate": 5.812346798829361e-06, "loss": 0.37227132320404055, "num_input_tokens_seen": 582257072, "step": 13310, "train_runtime": 102918.7234, "train_tokens_per_second": 5657.446 }, { "epoch": 0.896512254241853, "grad_norm": 0.7396821495476227, "learning_rate": 5.809737733572276e-06, "loss": 0.35695157051086424, "num_input_tokens_seen": 582470280, "step": 13315, "train_runtime": 102957.1094, "train_tokens_per_second": 5657.407 }, { "epoch": 0.8968489092378131, "grad_norm": 0.8286698107403867, "learning_rate": 5.8071284418746166e-06, "loss": 0.3608556747436523, "num_input_tokens_seen": 582689968, "step": 13320, "train_runtime": 102997.8183, "train_tokens_per_second": 5657.304 }, { "epoch": 0.8971855642337733, "grad_norm": 0.7429942677291922, "learning_rate": 5.80451892446606e-06, "loss": 0.38565864562988283, "num_input_tokens_seen": 582917944, "step": 13325, "train_runtime": 103036.6727, "train_tokens_per_second": 5657.383 }, { "epoch": 0.8975222192297334, "grad_norm": 0.6807484219365846, "learning_rate": 5.801909182076354e-06, "loss": 0.3657494068145752, "num_input_tokens_seen": 583143528, "step": 13330, "train_runtime": 103071.4117, "train_tokens_per_second": 5657.665 }, { "epoch": 0.8978588742256935, "grad_norm": 0.7911812244430602, "learning_rate": 5.7992992154353e-06, "loss": 0.3965157985687256, "num_input_tokens_seen": 583360120, "step": 13335, "train_runtime": 103106.3833, "train_tokens_per_second": 5657.847 }, { "epoch": 0.8981955292216537, "grad_norm": 0.7134344977635636, "learning_rate": 5.79668902527277e-06, "loss": 0.3728632926940918, "num_input_tokens_seen": 583576392, "step": 13340, "train_runtime": 103143.3779, "train_tokens_per_second": 5657.914 }, { "epoch": 0.8985321842176138, "grad_norm": 0.7068010881578768, "learning_rate": 5.794078612318695e-06, "loss": 0.36152513027191163, "num_input_tokens_seen": 583793888, "step": 13345, "train_runtime": 103187.6757, "train_tokens_per_second": 5657.593 }, { "epoch": 0.898868839213574, "grad_norm": 1.018985024468395, "learning_rate": 5.791467977303068e-06, "loss": 0.3539185285568237, "num_input_tokens_seen": 584007880, "step": 13350, "train_runtime": 103221.6694, "train_tokens_per_second": 5657.803 }, { "epoch": 0.8992054942095341, "grad_norm": 0.8787085802082749, "learning_rate": 5.788857120955945e-06, "loss": 0.3753284692764282, "num_input_tokens_seen": 584222720, "step": 13355, "train_runtime": 103259.3517, "train_tokens_per_second": 5657.819 }, { "epoch": 0.8995421492054942, "grad_norm": 0.7526792175486189, "learning_rate": 5.786246044007443e-06, "loss": 0.3408811092376709, "num_input_tokens_seen": 584430032, "step": 13360, "train_runtime": 103303.2518, "train_tokens_per_second": 5657.421 }, { "epoch": 0.8998788042014544, "grad_norm": 0.7042471293534047, "learning_rate": 5.783634747187743e-06, "loss": 0.38433132171630857, "num_input_tokens_seen": 584657272, "step": 13365, "train_runtime": 103336.5354, "train_tokens_per_second": 5657.798 }, { "epoch": 0.9002154591974145, "grad_norm": 0.7283278180613847, "learning_rate": 5.781023231227084e-06, "loss": 0.3663713693618774, "num_input_tokens_seen": 584873064, "step": 13370, "train_runtime": 103383.5959, "train_tokens_per_second": 5657.31 }, { "epoch": 0.9005521141933747, "grad_norm": 0.6987374788445736, "learning_rate": 5.778411496855769e-06, "loss": 0.3779282093048096, "num_input_tokens_seen": 585095664, "step": 13375, "train_runtime": 103422.1497, "train_tokens_per_second": 5657.354 }, { "epoch": 0.9008887691893348, "grad_norm": 0.7973255027303662, "learning_rate": 5.775799544804161e-06, "loss": 0.3911623477935791, "num_input_tokens_seen": 585323224, "step": 13380, "train_runtime": 103458.2471, "train_tokens_per_second": 5657.579 }, { "epoch": 0.9012254241852949, "grad_norm": 0.7376867678943736, "learning_rate": 5.7731873758026845e-06, "loss": 0.3567417860031128, "num_input_tokens_seen": 585539800, "step": 13385, "train_runtime": 103499.6202, "train_tokens_per_second": 5657.41 }, { "epoch": 0.9015620791812551, "grad_norm": 0.8164983344754712, "learning_rate": 5.770574990581823e-06, "loss": 0.3617391109466553, "num_input_tokens_seen": 585756160, "step": 13390, "train_runtime": 103538.5541, "train_tokens_per_second": 5657.372 }, { "epoch": 0.9018987341772152, "grad_norm": 0.7386008524112068, "learning_rate": 5.767962389872124e-06, "loss": 0.34462101459503175, "num_input_tokens_seen": 585972312, "step": 13395, "train_runtime": 103578.7054, "train_tokens_per_second": 5657.266 }, { "epoch": 0.9022353891731754, "grad_norm": 0.7749458765170661, "learning_rate": 5.765349574404191e-06, "loss": 0.3628375053405762, "num_input_tokens_seen": 586175624, "step": 13400, "train_runtime": 103611.757, "train_tokens_per_second": 5657.424 }, { "epoch": 0.9025720441691355, "grad_norm": 0.7292901746189114, "learning_rate": 5.7627365449086905e-06, "loss": 0.364549446105957, "num_input_tokens_seen": 586370072, "step": 13405, "train_runtime": 103645.7307, "train_tokens_per_second": 5657.445 }, { "epoch": 0.9029086991650956, "grad_norm": 0.7620757507465177, "learning_rate": 5.760123302116345e-06, "loss": 0.3901118040084839, "num_input_tokens_seen": 586593560, "step": 13410, "train_runtime": 103677.957, "train_tokens_per_second": 5657.843 }, { "epoch": 0.9032453541610558, "grad_norm": 0.7598225601483857, "learning_rate": 5.757509846757945e-06, "loss": 0.36999359130859377, "num_input_tokens_seen": 586819408, "step": 13415, "train_runtime": 103716.3963, "train_tokens_per_second": 5657.923 }, { "epoch": 0.9035820091570159, "grad_norm": 1.147309642657896, "learning_rate": 5.75489617956433e-06, "loss": 0.3971453428268433, "num_input_tokens_seen": 587040712, "step": 13420, "train_runtime": 103762.395, "train_tokens_per_second": 5657.548 }, { "epoch": 0.9039186641529761, "grad_norm": 0.6772540219988885, "learning_rate": 5.752282301266406e-06, "loss": 0.37274601459503176, "num_input_tokens_seen": 587260024, "step": 13425, "train_runtime": 103799.3896, "train_tokens_per_second": 5657.644 }, { "epoch": 0.9042553191489362, "grad_norm": 0.6865687048122345, "learning_rate": 5.749668212595136e-06, "loss": 0.36958420276641846, "num_input_tokens_seen": 587475152, "step": 13430, "train_runtime": 103838.2234, "train_tokens_per_second": 5657.6 }, { "epoch": 0.9045919741448963, "grad_norm": 0.7480660958831125, "learning_rate": 5.747053914281539e-06, "loss": 0.36184403896331785, "num_input_tokens_seen": 587679656, "step": 13435, "train_runtime": 103881.14, "train_tokens_per_second": 5657.231 }, { "epoch": 0.9049286291408565, "grad_norm": 0.7323661070573674, "learning_rate": 5.744439407056699e-06, "loss": 0.3511162757873535, "num_input_tokens_seen": 587888648, "step": 13440, "train_runtime": 103918.9245, "train_tokens_per_second": 5657.186 }, { "epoch": 0.9052652841368166, "grad_norm": 0.6204712137626076, "learning_rate": 5.741824691651752e-06, "loss": 0.3408759832382202, "num_input_tokens_seen": 588114264, "step": 13445, "train_runtime": 103954.7773, "train_tokens_per_second": 5657.405 }, { "epoch": 0.9056019391327768, "grad_norm": 0.8116090187953918, "learning_rate": 5.739209768797896e-06, "loss": 0.36322770118713377, "num_input_tokens_seen": 588322904, "step": 13450, "train_runtime": 103991.6356, "train_tokens_per_second": 5657.406 }, { "epoch": 0.9059385941287369, "grad_norm": 0.7146086921110422, "learning_rate": 5.736594639226385e-06, "loss": 0.32691378593444825, "num_input_tokens_seen": 588542624, "step": 13455, "train_runtime": 104026.9412, "train_tokens_per_second": 5657.598 }, { "epoch": 0.906275249124697, "grad_norm": 0.6758364668603787, "learning_rate": 5.7339793036685306e-06, "loss": 0.3772242546081543, "num_input_tokens_seen": 588766448, "step": 13460, "train_runtime": 104068.0394, "train_tokens_per_second": 5657.515 }, { "epoch": 0.9066119041206572, "grad_norm": 0.7332497573577879, "learning_rate": 5.731363762855706e-06, "loss": 0.3471216678619385, "num_input_tokens_seen": 588981896, "step": 13465, "train_runtime": 104109.0854, "train_tokens_per_second": 5657.353 }, { "epoch": 0.9069485591166173, "grad_norm": 0.8052750996260324, "learning_rate": 5.728748017519337e-06, "loss": 0.3998070001602173, "num_input_tokens_seen": 589199016, "step": 13470, "train_runtime": 104146.4665, "train_tokens_per_second": 5657.408 }, { "epoch": 0.9072852141125775, "grad_norm": 0.7072206601280142, "learning_rate": 5.726132068390908e-06, "loss": 0.3687425136566162, "num_input_tokens_seen": 589402952, "step": 13475, "train_runtime": 104180.5112, "train_tokens_per_second": 5657.516 }, { "epoch": 0.9076218691085376, "grad_norm": 0.7386177069645364, "learning_rate": 5.723515916201962e-06, "loss": 0.4100666046142578, "num_input_tokens_seen": 589630440, "step": 13480, "train_runtime": 104218.7952, "train_tokens_per_second": 5657.621 }, { "epoch": 0.9079585241044977, "grad_norm": 0.6255645042824444, "learning_rate": 5.720899561684098e-06, "loss": 0.3434640645980835, "num_input_tokens_seen": 589849368, "step": 13485, "train_runtime": 104262.0828, "train_tokens_per_second": 5657.372 }, { "epoch": 0.9082951791004579, "grad_norm": 0.7488072842696437, "learning_rate": 5.71828300556897e-06, "loss": 0.36190190315246584, "num_input_tokens_seen": 590075552, "step": 13490, "train_runtime": 104304.1746, "train_tokens_per_second": 5657.257 }, { "epoch": 0.908631834096418, "grad_norm": 0.595597879983287, "learning_rate": 5.715666248588289e-06, "loss": 0.3661900520324707, "num_input_tokens_seen": 590300848, "step": 13495, "train_runtime": 104350.0273, "train_tokens_per_second": 5656.93 }, { "epoch": 0.9089684890923782, "grad_norm": 0.7843852676552852, "learning_rate": 5.713049291473825e-06, "loss": 0.39053096771240237, "num_input_tokens_seen": 590529208, "step": 13500, "train_runtime": 104390.3684, "train_tokens_per_second": 5656.932 }, { "epoch": 0.9093051440883383, "grad_norm": 0.7754635800602863, "learning_rate": 5.710432134957399e-06, "loss": 0.3421627998352051, "num_input_tokens_seen": 590729424, "step": 13505, "train_runtime": 104437.8595, "train_tokens_per_second": 5656.277 }, { "epoch": 0.9096417990842984, "grad_norm": 0.7329858480957279, "learning_rate": 5.707814779770892e-06, "loss": 0.34261083602905273, "num_input_tokens_seen": 590940928, "step": 13510, "train_runtime": 104484.5885, "train_tokens_per_second": 5655.771 }, { "epoch": 0.9099784540802586, "grad_norm": 0.7345589839622834, "learning_rate": 5.7051972266462395e-06, "loss": 0.35787391662597656, "num_input_tokens_seen": 591158192, "step": 13515, "train_runtime": 104521.8258, "train_tokens_per_second": 5655.835 }, { "epoch": 0.9103151090762187, "grad_norm": 0.8008449716401149, "learning_rate": 5.702579476315431e-06, "loss": 0.3310979127883911, "num_input_tokens_seen": 591376656, "step": 13520, "train_runtime": 104566.7223, "train_tokens_per_second": 5655.496 }, { "epoch": 0.9106517640721788, "grad_norm": 0.7423340401003228, "learning_rate": 5.699961529510513e-06, "loss": 0.3578958988189697, "num_input_tokens_seen": 591581336, "step": 13525, "train_runtime": 104607.1051, "train_tokens_per_second": 5655.269 }, { "epoch": 0.910988419068139, "grad_norm": 0.7857402111034575, "learning_rate": 5.697343386963586e-06, "loss": 0.3766601800918579, "num_input_tokens_seen": 591797696, "step": 13530, "train_runtime": 104651.9901, "train_tokens_per_second": 5654.911 }, { "epoch": 0.9113250740640991, "grad_norm": 0.6657292352842593, "learning_rate": 5.694725049406801e-06, "loss": 0.3710474967956543, "num_input_tokens_seen": 592014888, "step": 13535, "train_runtime": 104697.3063, "train_tokens_per_second": 5654.538 }, { "epoch": 0.9116617290600593, "grad_norm": 0.6966081276914712, "learning_rate": 5.692106517572373e-06, "loss": 0.38451037406921384, "num_input_tokens_seen": 592229672, "step": 13540, "train_runtime": 104731.9456, "train_tokens_per_second": 5654.719 }, { "epoch": 0.9119983840560194, "grad_norm": 0.7724805146942423, "learning_rate": 5.689487792192566e-06, "loss": 0.3990262746810913, "num_input_tokens_seen": 592451696, "step": 13545, "train_runtime": 104773.5682, "train_tokens_per_second": 5654.591 }, { "epoch": 0.9123350390519795, "grad_norm": 0.7342026376072939, "learning_rate": 5.686868873999696e-06, "loss": 0.3797611236572266, "num_input_tokens_seen": 592668960, "step": 13550, "train_runtime": 104816.4545, "train_tokens_per_second": 5654.35 }, { "epoch": 0.9126716940479397, "grad_norm": 0.666648695750785, "learning_rate": 5.684249763726135e-06, "loss": 0.3764026641845703, "num_input_tokens_seen": 592890144, "step": 13555, "train_runtime": 104853.017, "train_tokens_per_second": 5654.488 }, { "epoch": 0.9130083490438998, "grad_norm": 0.796183302090131, "learning_rate": 5.681630462104308e-06, "loss": 0.3508880615234375, "num_input_tokens_seen": 593092200, "step": 13560, "train_runtime": 104890.6314, "train_tokens_per_second": 5654.387 }, { "epoch": 0.91334500403986, "grad_norm": 0.6941135923026022, "learning_rate": 5.679010969866697e-06, "loss": 0.3628666877746582, "num_input_tokens_seen": 593304400, "step": 13565, "train_runtime": 104927.8794, "train_tokens_per_second": 5654.402 }, { "epoch": 0.9136816590358201, "grad_norm": 0.7543532537354826, "learning_rate": 5.676391287745835e-06, "loss": 0.35071396827697754, "num_input_tokens_seen": 593537816, "step": 13570, "train_runtime": 104959.059, "train_tokens_per_second": 5654.946 }, { "epoch": 0.9140183140317802, "grad_norm": 0.6731321122510332, "learning_rate": 5.673771416474305e-06, "loss": 0.3439845085144043, "num_input_tokens_seen": 593761520, "step": 13575, "train_runtime": 104997.0967, "train_tokens_per_second": 5655.028 }, { "epoch": 0.9143549690277404, "grad_norm": 0.7587431284561748, "learning_rate": 5.671151356784747e-06, "loss": 0.3460673809051514, "num_input_tokens_seen": 593970768, "step": 13580, "train_runtime": 105034.4592, "train_tokens_per_second": 5655.009 }, { "epoch": 0.9146916240237005, "grad_norm": 0.6614026194133914, "learning_rate": 5.668531109409851e-06, "loss": 0.3715926170349121, "num_input_tokens_seen": 594193064, "step": 13585, "train_runtime": 105071.7331, "train_tokens_per_second": 5655.118 }, { "epoch": 0.9150282790196607, "grad_norm": 0.7852840297073502, "learning_rate": 5.665910675082362e-06, "loss": 0.36374545097351074, "num_input_tokens_seen": 594409288, "step": 13590, "train_runtime": 105109.8348, "train_tokens_per_second": 5655.125 }, { "epoch": 0.9153649340156208, "grad_norm": 0.7103415655589641, "learning_rate": 5.663290054535078e-06, "loss": 0.34845700263977053, "num_input_tokens_seen": 594620336, "step": 13595, "train_runtime": 105150.7645, "train_tokens_per_second": 5654.931 }, { "epoch": 0.9157015890115809, "grad_norm": 0.8295807713349123, "learning_rate": 5.660669248500846e-06, "loss": 0.39510331153869627, "num_input_tokens_seen": 594838312, "step": 13600, "train_runtime": 105189.0392, "train_tokens_per_second": 5654.946 }, { "epoch": 0.9160382440075411, "grad_norm": 0.7158029671235298, "learning_rate": 5.658048257712563e-06, "loss": 0.3466895818710327, "num_input_tokens_seen": 595060816, "step": 13605, "train_runtime": 105234.3634, "train_tokens_per_second": 5654.625 }, { "epoch": 0.9163748990035012, "grad_norm": 0.7282803359887597, "learning_rate": 5.655427082903184e-06, "loss": 0.3633090019226074, "num_input_tokens_seen": 595279584, "step": 13610, "train_runtime": 105277.1838, "train_tokens_per_second": 5654.403 }, { "epoch": 0.9167115539994614, "grad_norm": 0.6738750845313296, "learning_rate": 5.652805724805711e-06, "loss": 0.35727887153625487, "num_input_tokens_seen": 595499192, "step": 13615, "train_runtime": 105314.5327, "train_tokens_per_second": 5654.483 }, { "epoch": 0.9170482089954215, "grad_norm": 0.8264756955958018, "learning_rate": 5.650184184153199e-06, "loss": 0.3687946319580078, "num_input_tokens_seen": 595723264, "step": 13620, "train_runtime": 105352.1128, "train_tokens_per_second": 5654.592 }, { "epoch": 0.9173848639913816, "grad_norm": 0.7363635027786596, "learning_rate": 5.647562461678754e-06, "loss": 0.39588251113891604, "num_input_tokens_seen": 595947688, "step": 13625, "train_runtime": 105388.882, "train_tokens_per_second": 5654.749 }, { "epoch": 0.9177215189873418, "grad_norm": 0.7671112595712233, "learning_rate": 5.64494055811553e-06, "loss": 0.35439510345458985, "num_input_tokens_seen": 596167280, "step": 13630, "train_runtime": 105432.2515, "train_tokens_per_second": 5654.506 }, { "epoch": 0.9180581739833019, "grad_norm": 0.7391097804364258, "learning_rate": 5.642318474196737e-06, "loss": 0.3450098991394043, "num_input_tokens_seen": 596389280, "step": 13635, "train_runtime": 105470.2709, "train_tokens_per_second": 5654.572 }, { "epoch": 0.9183948289792621, "grad_norm": 0.7394314350713648, "learning_rate": 5.63969621065563e-06, "loss": 0.36347208023071287, "num_input_tokens_seen": 596603992, "step": 13640, "train_runtime": 105510.1258, "train_tokens_per_second": 5654.471 }, { "epoch": 0.9187314839752222, "grad_norm": 0.6523195737553367, "learning_rate": 5.637073768225517e-06, "loss": 0.3404127836227417, "num_input_tokens_seen": 596814560, "step": 13645, "train_runtime": 105555.5698, "train_tokens_per_second": 5654.032 }, { "epoch": 0.9190681389711823, "grad_norm": 0.7286950960994242, "learning_rate": 5.634451147639758e-06, "loss": 0.3368164300918579, "num_input_tokens_seen": 597016352, "step": 13650, "train_runtime": 105596.0923, "train_tokens_per_second": 5653.773 }, { "epoch": 0.9194047939671425, "grad_norm": 0.7381840389633337, "learning_rate": 5.631828349631757e-06, "loss": 0.34926304817199705, "num_input_tokens_seen": 597241424, "step": 13655, "train_runtime": 105633.1844, "train_tokens_per_second": 5653.919 }, { "epoch": 0.9197414489631026, "grad_norm": 0.7377168394438081, "learning_rate": 5.629205374934974e-06, "loss": 0.3418566703796387, "num_input_tokens_seen": 597449976, "step": 13660, "train_runtime": 105670.7222, "train_tokens_per_second": 5653.884 }, { "epoch": 0.9200781039590628, "grad_norm": 0.7062836493823704, "learning_rate": 5.626582224282913e-06, "loss": 0.36661295890808104, "num_input_tokens_seen": 597675264, "step": 13665, "train_runtime": 105714.0467, "train_tokens_per_second": 5653.698 }, { "epoch": 0.9204147589550229, "grad_norm": 0.7520494279886026, "learning_rate": 5.623958898409132e-06, "loss": 0.39702858924865725, "num_input_tokens_seen": 597900752, "step": 13670, "train_runtime": 105743.9982, "train_tokens_per_second": 5654.229 }, { "epoch": 0.920751413950983, "grad_norm": 0.6987426458318066, "learning_rate": 5.621335398047234e-06, "loss": 0.3848641157150269, "num_input_tokens_seen": 598115680, "step": 13675, "train_runtime": 105787.0252, "train_tokens_per_second": 5653.961 }, { "epoch": 0.9210880689469432, "grad_norm": 0.7307345712178913, "learning_rate": 5.618711723930874e-06, "loss": 0.36865854263305664, "num_input_tokens_seen": 598333664, "step": 13680, "train_runtime": 105817.9321, "train_tokens_per_second": 5654.369 }, { "epoch": 0.9214247239429033, "grad_norm": 0.7963356189127992, "learning_rate": 5.616087876793753e-06, "loss": 0.3818777561187744, "num_input_tokens_seen": 598560984, "step": 13685, "train_runtime": 105853.2283, "train_tokens_per_second": 5654.631 }, { "epoch": 0.9217613789388635, "grad_norm": 0.6658404353690085, "learning_rate": 5.613463857369621e-06, "loss": 0.3648639678955078, "num_input_tokens_seen": 598784192, "step": 13690, "train_runtime": 105895.3239, "train_tokens_per_second": 5654.491 }, { "epoch": 0.9220980339348236, "grad_norm": 0.7245035749434348, "learning_rate": 5.610839666392278e-06, "loss": 0.35527966022491453, "num_input_tokens_seen": 599005456, "step": 13695, "train_runtime": 105941.0406, "train_tokens_per_second": 5654.14 }, { "epoch": 0.9224346889307837, "grad_norm": 0.7564271755937382, "learning_rate": 5.608215304595571e-06, "loss": 0.3818879842758179, "num_input_tokens_seen": 599222856, "step": 13700, "train_runtime": 105987.7905, "train_tokens_per_second": 5653.697 }, { "epoch": 0.9227713439267439, "grad_norm": 0.71469916144582, "learning_rate": 5.605590772713393e-06, "loss": 0.35137481689453126, "num_input_tokens_seen": 599421784, "step": 13705, "train_runtime": 106025.2333, "train_tokens_per_second": 5653.577 }, { "epoch": 0.923107998922704, "grad_norm": 0.8680683000673615, "learning_rate": 5.602966071479687e-06, "loss": 0.3719889402389526, "num_input_tokens_seen": 599626912, "step": 13710, "train_runtime": 106057.3995, "train_tokens_per_second": 5653.796 }, { "epoch": 0.9234446539186641, "grad_norm": 0.7763025193380707, "learning_rate": 5.600341201628439e-06, "loss": 0.37358889579772947, "num_input_tokens_seen": 599854192, "step": 13715, "train_runtime": 106090.67, "train_tokens_per_second": 5654.165 }, { "epoch": 0.9237813089146243, "grad_norm": 0.6656080663010198, "learning_rate": 5.597716163893692e-06, "loss": 0.31069388389587405, "num_input_tokens_seen": 600085080, "step": 13720, "train_runtime": 106134.8208, "train_tokens_per_second": 5653.989 }, { "epoch": 0.9241179639105844, "grad_norm": 0.7327001774115326, "learning_rate": 5.595090959009525e-06, "loss": 0.34327847957611085, "num_input_tokens_seen": 600310096, "step": 13725, "train_runtime": 106180.1722, "train_tokens_per_second": 5653.693 }, { "epoch": 0.9244546189065446, "grad_norm": 0.6125120195863898, "learning_rate": 5.592465587710068e-06, "loss": 0.34142630100250243, "num_input_tokens_seen": 600545032, "step": 13730, "train_runtime": 106218.5007, "train_tokens_per_second": 5653.865 }, { "epoch": 0.9247912739025047, "grad_norm": 0.6167159170504363, "learning_rate": 5.589840050729498e-06, "loss": 0.3286783218383789, "num_input_tokens_seen": 600768064, "step": 13735, "train_runtime": 106258.0895, "train_tokens_per_second": 5653.857 }, { "epoch": 0.9251279288984648, "grad_norm": 0.7881839614694872, "learning_rate": 5.587214348802039e-06, "loss": 0.3909108638763428, "num_input_tokens_seen": 600980632, "step": 13740, "train_runtime": 106298.4773, "train_tokens_per_second": 5653.709 }, { "epoch": 0.925464583894425, "grad_norm": 0.7022898228386897, "learning_rate": 5.5845884826619615e-06, "loss": 0.36343495845794677, "num_input_tokens_seen": 601207448, "step": 13745, "train_runtime": 106333.7277, "train_tokens_per_second": 5653.968 }, { "epoch": 0.9258012388903851, "grad_norm": 0.6378832684361027, "learning_rate": 5.5819624530435775e-06, "loss": 0.3585641622543335, "num_input_tokens_seen": 601419704, "step": 13750, "train_runtime": 106373.8251, "train_tokens_per_second": 5653.832 }, { "epoch": 0.9261378938863453, "grad_norm": 0.7242428710010252, "learning_rate": 5.57933626068125e-06, "loss": 0.3933718681335449, "num_input_tokens_seen": 601639824, "step": 13755, "train_runtime": 106414.6703, "train_tokens_per_second": 5653.73 }, { "epoch": 0.9264745488823054, "grad_norm": 0.7473031695779977, "learning_rate": 5.5767099063093835e-06, "loss": 0.3709197998046875, "num_input_tokens_seen": 601868536, "step": 13760, "train_runtime": 106452.2637, "train_tokens_per_second": 5653.882 }, { "epoch": 0.9268112038782655, "grad_norm": 0.803164002917514, "learning_rate": 5.574083390662431e-06, "loss": 0.373383617401123, "num_input_tokens_seen": 602098696, "step": 13765, "train_runtime": 106489.0364, "train_tokens_per_second": 5654.091 }, { "epoch": 0.9271478588742257, "grad_norm": 0.7108278884261701, "learning_rate": 5.57145671447489e-06, "loss": 0.3655261993408203, "num_input_tokens_seen": 602302480, "step": 13770, "train_runtime": 106525.8625, "train_tokens_per_second": 5654.049 }, { "epoch": 0.9274845138701858, "grad_norm": 0.7613900230491544, "learning_rate": 5.5688298784813e-06, "loss": 0.3984712600708008, "num_input_tokens_seen": 602522208, "step": 13775, "train_runtime": 106564.2964, "train_tokens_per_second": 5654.072 }, { "epoch": 0.927821168866146, "grad_norm": 0.6708141182451115, "learning_rate": 5.566202883416249e-06, "loss": 0.3970597743988037, "num_input_tokens_seen": 602750424, "step": 13780, "train_runtime": 106606.7053, "train_tokens_per_second": 5653.964 }, { "epoch": 0.9281578238621061, "grad_norm": 0.7821647487746413, "learning_rate": 5.563575730014366e-06, "loss": 0.39171276092529295, "num_input_tokens_seen": 602965320, "step": 13785, "train_runtime": 106643.4726, "train_tokens_per_second": 5654.029 }, { "epoch": 0.9284944788580662, "grad_norm": 0.7438040498615117, "learning_rate": 5.560948419010328e-06, "loss": 0.3737471342086792, "num_input_tokens_seen": 603186136, "step": 13790, "train_runtime": 106681.291, "train_tokens_per_second": 5654.095 }, { "epoch": 0.9288311338540264, "grad_norm": 0.7446914306967766, "learning_rate": 5.558320951138853e-06, "loss": 0.34050416946411133, "num_input_tokens_seen": 603397288, "step": 13795, "train_runtime": 106722.5651, "train_tokens_per_second": 5653.887 }, { "epoch": 0.9291677888499865, "grad_norm": 0.7759821070900785, "learning_rate": 5.5556933271347046e-06, "loss": 0.3723226308822632, "num_input_tokens_seen": 603606088, "step": 13800, "train_runtime": 106763.5139, "train_tokens_per_second": 5653.674 }, { "epoch": 0.9295044438459467, "grad_norm": 0.7098216673132232, "learning_rate": 5.55306554773269e-06, "loss": 0.3821061611175537, "num_input_tokens_seen": 603816144, "step": 13805, "train_runtime": 106805.761, "train_tokens_per_second": 5653.404 }, { "epoch": 0.9298410988419068, "grad_norm": 0.9275669407149835, "learning_rate": 5.550437613667658e-06, "loss": 0.3593113660812378, "num_input_tokens_seen": 604004552, "step": 13810, "train_runtime": 106836.865, "train_tokens_per_second": 5653.522 }, { "epoch": 0.9301777538378669, "grad_norm": 0.6896177858346889, "learning_rate": 5.547809525674501e-06, "loss": 0.35454933643341063, "num_input_tokens_seen": 604212440, "step": 13815, "train_runtime": 106875.1406, "train_tokens_per_second": 5653.442 }, { "epoch": 0.9305144088338271, "grad_norm": 0.7927279590495904, "learning_rate": 5.545181284488159e-06, "loss": 0.38926100730895996, "num_input_tokens_seen": 604439792, "step": 13820, "train_runtime": 106917.4476, "train_tokens_per_second": 5653.332 }, { "epoch": 0.9308510638297872, "grad_norm": 0.8386569241979678, "learning_rate": 5.5425528908436085e-06, "loss": 0.35577256679534913, "num_input_tokens_seen": 604643600, "step": 13825, "train_runtime": 106953.2903, "train_tokens_per_second": 5653.343 }, { "epoch": 0.9311877188257474, "grad_norm": 0.7592336539171605, "learning_rate": 5.539924345475873e-06, "loss": 0.3907893180847168, "num_input_tokens_seen": 604839736, "step": 13830, "train_runtime": 106988.9857, "train_tokens_per_second": 5653.29 }, { "epoch": 0.9315243738217075, "grad_norm": 0.8126152719075438, "learning_rate": 5.5372956491200145e-06, "loss": 0.37813870906829833, "num_input_tokens_seen": 605051728, "step": 13835, "train_runtime": 107025.6706, "train_tokens_per_second": 5653.333 }, { "epoch": 0.9318610288176676, "grad_norm": 0.7879475237888696, "learning_rate": 5.534666802511143e-06, "loss": 0.36364994049072263, "num_input_tokens_seen": 605251488, "step": 13840, "train_runtime": 107062.9642, "train_tokens_per_second": 5653.229 }, { "epoch": 0.9321976838136278, "grad_norm": 0.6977984667014386, "learning_rate": 5.532037806384404e-06, "loss": 0.372878885269165, "num_input_tokens_seen": 605478256, "step": 13845, "train_runtime": 107101.7476, "train_tokens_per_second": 5653.299 }, { "epoch": 0.9325343388095879, "grad_norm": 0.7377782721135303, "learning_rate": 5.529408661474989e-06, "loss": 0.33782191276550294, "num_input_tokens_seen": 605678152, "step": 13850, "train_runtime": 107140.4741, "train_tokens_per_second": 5653.122 }, { "epoch": 0.932870993805548, "grad_norm": 0.7120793619791788, "learning_rate": 5.526779368518129e-06, "loss": 0.3900485038757324, "num_input_tokens_seen": 605902976, "step": 13855, "train_runtime": 107174.2345, "train_tokens_per_second": 5653.439 }, { "epoch": 0.9332076488015082, "grad_norm": 0.7800631196768846, "learning_rate": 5.5241499282491e-06, "loss": 0.35591723918914797, "num_input_tokens_seen": 606103560, "step": 13860, "train_runtime": 107212.7655, "train_tokens_per_second": 5653.278 }, { "epoch": 0.9335443037974683, "grad_norm": 0.6995200522098299, "learning_rate": 5.5215203414032135e-06, "loss": 0.3359647274017334, "num_input_tokens_seen": 606332784, "step": 13865, "train_runtime": 107261.2791, "train_tokens_per_second": 5652.858 }, { "epoch": 0.9338809587934285, "grad_norm": 0.7315710239059265, "learning_rate": 5.518890608715828e-06, "loss": 0.3636192798614502, "num_input_tokens_seen": 606549080, "step": 13870, "train_runtime": 107306.9882, "train_tokens_per_second": 5652.466 }, { "epoch": 0.9342176137893886, "grad_norm": 0.8443286259971129, "learning_rate": 5.516260730922337e-06, "loss": 0.3732717275619507, "num_input_tokens_seen": 606754664, "step": 13875, "train_runtime": 107344.4184, "train_tokens_per_second": 5652.41 }, { "epoch": 0.9345542687853488, "grad_norm": 0.7163150661251769, "learning_rate": 5.51363070875818e-06, "loss": 0.3665364503860474, "num_input_tokens_seen": 606971336, "step": 13880, "train_runtime": 107380.8754, "train_tokens_per_second": 5652.509 }, { "epoch": 0.9348909237813089, "grad_norm": 0.7826404929432437, "learning_rate": 5.511000542958832e-06, "loss": 0.3829598903656006, "num_input_tokens_seen": 607182888, "step": 13885, "train_runtime": 107425.4489, "train_tokens_per_second": 5652.133 }, { "epoch": 0.935227578777269, "grad_norm": 0.7974161880488172, "learning_rate": 5.508370234259812e-06, "loss": 0.3617416858673096, "num_input_tokens_seen": 607395376, "step": 13890, "train_runtime": 107467.1083, "train_tokens_per_second": 5651.919 }, { "epoch": 0.9355642337732292, "grad_norm": 0.7468198908899866, "learning_rate": 5.505739783396678e-06, "loss": 0.4197434425354004, "num_input_tokens_seen": 607606560, "step": 13895, "train_runtime": 107501.3365, "train_tokens_per_second": 5652.084 }, { "epoch": 0.9359008887691893, "grad_norm": 0.8018465922168921, "learning_rate": 5.503109191105026e-06, "loss": 0.368869423866272, "num_input_tokens_seen": 607818184, "step": 13900, "train_runtime": 107542.256, "train_tokens_per_second": 5651.901 }, { "epoch": 0.9362375437651494, "grad_norm": 0.6896918447153622, "learning_rate": 5.500478458120493e-06, "loss": 0.3878501892089844, "num_input_tokens_seen": 608046144, "step": 13905, "train_runtime": 107578.9863, "train_tokens_per_second": 5652.09 }, { "epoch": 0.9365741987611096, "grad_norm": 0.6502629376388114, "learning_rate": 5.497847585178754e-06, "loss": 0.37720532417297364, "num_input_tokens_seen": 608274496, "step": 13910, "train_runtime": 107614.2489, "train_tokens_per_second": 5652.36 }, { "epoch": 0.9369108537570697, "grad_norm": 0.671150617120138, "learning_rate": 5.495216573015526e-06, "loss": 0.34202401638031005, "num_input_tokens_seen": 608487072, "step": 13915, "train_runtime": 107649.7272, "train_tokens_per_second": 5652.472 }, { "epoch": 0.9372475087530299, "grad_norm": 0.7302905322159697, "learning_rate": 5.492585422366562e-06, "loss": 0.3395219802856445, "num_input_tokens_seen": 608702136, "step": 13920, "train_runtime": 107690.4313, "train_tokens_per_second": 5652.333 }, { "epoch": 0.93758416374899, "grad_norm": 0.7232012493162839, "learning_rate": 5.489954133967657e-06, "loss": 0.3353360652923584, "num_input_tokens_seen": 608907648, "step": 13925, "train_runtime": 107730.6462, "train_tokens_per_second": 5652.13 }, { "epoch": 0.9379208187449501, "grad_norm": 0.6700324546008681, "learning_rate": 5.48732270855464e-06, "loss": 0.3447211027145386, "num_input_tokens_seen": 609137704, "step": 13930, "train_runtime": 107770.2254, "train_tokens_per_second": 5652.189 }, { "epoch": 0.9382574737409103, "grad_norm": 0.744553222908747, "learning_rate": 5.48469114686338e-06, "loss": 0.36331336498260497, "num_input_tokens_seen": 609342520, "step": 13935, "train_runtime": 107808.8795, "train_tokens_per_second": 5652.062 }, { "epoch": 0.9385941287368704, "grad_norm": 0.7229277790841906, "learning_rate": 5.482059449629788e-06, "loss": 0.3539914131164551, "num_input_tokens_seen": 609571440, "step": 13940, "train_runtime": 107847.7103, "train_tokens_per_second": 5652.15 }, { "epoch": 0.9389307837328306, "grad_norm": 0.7003088104586751, "learning_rate": 5.479427617589808e-06, "loss": 0.3414954662322998, "num_input_tokens_seen": 609787136, "step": 13945, "train_runtime": 107885.5574, "train_tokens_per_second": 5652.167 }, { "epoch": 0.9392674387287907, "grad_norm": 0.6891150838884817, "learning_rate": 5.4767956514794226e-06, "loss": 0.3689284801483154, "num_input_tokens_seen": 610015912, "step": 13950, "train_runtime": 107918.1469, "train_tokens_per_second": 5652.58 }, { "epoch": 0.9396040937247508, "grad_norm": 0.8843526225142938, "learning_rate": 5.474163552034655e-06, "loss": 0.3568282127380371, "num_input_tokens_seen": 610224872, "step": 13955, "train_runtime": 107958.8593, "train_tokens_per_second": 5652.383 }, { "epoch": 0.939940748720711, "grad_norm": 0.7953669523701649, "learning_rate": 5.4715313199915595e-06, "loss": 0.33748788833618165, "num_input_tokens_seen": 610433896, "step": 13960, "train_runtime": 107998.8796, "train_tokens_per_second": 5652.224 }, { "epoch": 0.9402774037166711, "grad_norm": 0.8436524922865566, "learning_rate": 5.468898956086236e-06, "loss": 0.36934537887573243, "num_input_tokens_seen": 610657928, "step": 13965, "train_runtime": 108037.0093, "train_tokens_per_second": 5652.303 }, { "epoch": 0.9406140587126313, "grad_norm": 0.7062142551000551, "learning_rate": 5.466266461054815e-06, "loss": 0.3693251132965088, "num_input_tokens_seen": 610879072, "step": 13970, "train_runtime": 108078.9259, "train_tokens_per_second": 5652.157 }, { "epoch": 0.9409507137085914, "grad_norm": 0.7405368560790437, "learning_rate": 5.463633835633464e-06, "loss": 0.38323063850402833, "num_input_tokens_seen": 611111488, "step": 13975, "train_runtime": 108116.6852, "train_tokens_per_second": 5652.333 }, { "epoch": 0.9412873687045515, "grad_norm": 0.6906471137787829, "learning_rate": 5.46100108055839e-06, "loss": 0.37401399612426756, "num_input_tokens_seen": 611338984, "step": 13980, "train_runtime": 108153.7009, "train_tokens_per_second": 5652.502 }, { "epoch": 0.9416240237005117, "grad_norm": 0.699157303658586, "learning_rate": 5.458368196565833e-06, "loss": 0.34747042655944826, "num_input_tokens_seen": 611557384, "step": 13985, "train_runtime": 108187.4002, "train_tokens_per_second": 5652.76 }, { "epoch": 0.9419606786964718, "grad_norm": 0.6950434602213443, "learning_rate": 5.455735184392073e-06, "loss": 0.39068779945373533, "num_input_tokens_seen": 611785288, "step": 13990, "train_runtime": 108222.1017, "train_tokens_per_second": 5653.053 }, { "epoch": 0.942297333692432, "grad_norm": 0.8222775495837801, "learning_rate": 5.4531020447734204e-06, "loss": 0.3776577949523926, "num_input_tokens_seen": 611999096, "step": 13995, "train_runtime": 108255.2451, "train_tokens_per_second": 5653.297 }, { "epoch": 0.9426339886883921, "grad_norm": 0.6942977966354065, "learning_rate": 5.450468778446226e-06, "loss": 0.38014535903930663, "num_input_tokens_seen": 612229616, "step": 14000, "train_runtime": 108302.2562, "train_tokens_per_second": 5652.972 }, { "epoch": 0.9429706436843522, "grad_norm": 0.8181331571770365, "learning_rate": 5.447835386146875e-06, "loss": 0.3620244264602661, "num_input_tokens_seen": 612457288, "step": 14005, "train_runtime": 108339.7787, "train_tokens_per_second": 5653.116 }, { "epoch": 0.9433072986803124, "grad_norm": 0.7249133494502058, "learning_rate": 5.445201868611784e-06, "loss": 0.4034558296203613, "num_input_tokens_seen": 612668352, "step": 14010, "train_runtime": 108376.897, "train_tokens_per_second": 5653.127 }, { "epoch": 0.9436439536762725, "grad_norm": 0.7004943272407984, "learning_rate": 5.442568226577413e-06, "loss": 0.37315356731414795, "num_input_tokens_seen": 612885272, "step": 14015, "train_runtime": 108415.5424, "train_tokens_per_second": 5653.113 }, { "epoch": 0.9439806086722327, "grad_norm": 0.6490441295997635, "learning_rate": 5.439934460780247e-06, "loss": 0.3591346740722656, "num_input_tokens_seen": 613107944, "step": 14020, "train_runtime": 108453.9122, "train_tokens_per_second": 5653.166 }, { "epoch": 0.9443172636681928, "grad_norm": 0.6918392163792407, "learning_rate": 5.437300571956813e-06, "loss": 0.3745762586593628, "num_input_tokens_seen": 613308168, "step": 14025, "train_runtime": 108489.5473, "train_tokens_per_second": 5653.154 }, { "epoch": 0.9446539186641529, "grad_norm": 0.654742109915237, "learning_rate": 5.434666560843667e-06, "loss": 0.3551823616027832, "num_input_tokens_seen": 613516376, "step": 14030, "train_runtime": 108525.2798, "train_tokens_per_second": 5653.212 }, { "epoch": 0.9449905736601131, "grad_norm": 0.7025947454416406, "learning_rate": 5.432032428177405e-06, "loss": 0.3733973979949951, "num_input_tokens_seen": 613743992, "step": 14035, "train_runtime": 108565.1399, "train_tokens_per_second": 5653.233 }, { "epoch": 0.9453272286560732, "grad_norm": 0.7446809227599923, "learning_rate": 5.429398174694651e-06, "loss": 0.35695390701293944, "num_input_tokens_seen": 613975032, "step": 14040, "train_runtime": 108600.6982, "train_tokens_per_second": 5653.509 }, { "epoch": 0.9456638836520334, "grad_norm": 0.6898581042276205, "learning_rate": 5.426763801132067e-06, "loss": 0.3617269039154053, "num_input_tokens_seen": 614162568, "step": 14045, "train_runtime": 108637.4509, "train_tokens_per_second": 5653.323 }, { "epoch": 0.9460005386479935, "grad_norm": 0.7678862695446375, "learning_rate": 5.424129308226347e-06, "loss": 0.3843861103057861, "num_input_tokens_seen": 614370656, "step": 14050, "train_runtime": 108675.5655, "train_tokens_per_second": 5653.255 }, { "epoch": 0.9463371936439536, "grad_norm": 0.7654766109095031, "learning_rate": 5.421494696714219e-06, "loss": 0.3902265548706055, "num_input_tokens_seen": 614608864, "step": 14055, "train_runtime": 108715.2383, "train_tokens_per_second": 5653.383 }, { "epoch": 0.9466738486399138, "grad_norm": 0.7609882464523344, "learning_rate": 5.418859967332442e-06, "loss": 0.3707080841064453, "num_input_tokens_seen": 614836608, "step": 14060, "train_runtime": 108755.1102, "train_tokens_per_second": 5653.404 }, { "epoch": 0.9470105036358739, "grad_norm": 0.9394544427990754, "learning_rate": 5.416225120817811e-06, "loss": 0.3681238412857056, "num_input_tokens_seen": 615027064, "step": 14065, "train_runtime": 108790.9955, "train_tokens_per_second": 5653.29 }, { "epoch": 0.947347158631834, "grad_norm": 0.6539346876126566, "learning_rate": 5.413590157907153e-06, "loss": 0.3346075534820557, "num_input_tokens_seen": 615270632, "step": 14070, "train_runtime": 108826.6066, "train_tokens_per_second": 5653.678 }, { "epoch": 0.9476838136277942, "grad_norm": 0.7338889594818504, "learning_rate": 5.4109550793373255e-06, "loss": 0.355800724029541, "num_input_tokens_seen": 615493608, "step": 14075, "train_runtime": 108868.2257, "train_tokens_per_second": 5653.565 }, { "epoch": 0.9480204686237543, "grad_norm": 0.7464991259586956, "learning_rate": 5.40831988584522e-06, "loss": 0.38836262226104734, "num_input_tokens_seen": 615719216, "step": 14080, "train_runtime": 108904.0303, "train_tokens_per_second": 5653.778 }, { "epoch": 0.9483571236197145, "grad_norm": 0.7069248942260824, "learning_rate": 5.40568457816776e-06, "loss": 0.37587385177612304, "num_input_tokens_seen": 615951848, "step": 14085, "train_runtime": 108947.057, "train_tokens_per_second": 5653.68 }, { "epoch": 0.9486937786156746, "grad_norm": 0.6655009611716466, "learning_rate": 5.403049157041903e-06, "loss": 0.35560946464538573, "num_input_tokens_seen": 616172928, "step": 14090, "train_runtime": 108984.6239, "train_tokens_per_second": 5653.76 }, { "epoch": 0.9490304336116347, "grad_norm": 0.7730572202934075, "learning_rate": 5.400413623204635e-06, "loss": 0.35712380409240724, "num_input_tokens_seen": 616390224, "step": 14095, "train_runtime": 109023.2559, "train_tokens_per_second": 5653.75 }, { "epoch": 0.9493670886075949, "grad_norm": 0.7946160574063879, "learning_rate": 5.397777977392973e-06, "loss": 0.39092726707458497, "num_input_tokens_seen": 616612064, "step": 14100, "train_runtime": 109071.1955, "train_tokens_per_second": 5653.299 }, { "epoch": 0.949703743603555, "grad_norm": 0.7261331777714058, "learning_rate": 5.395142220343967e-06, "loss": 0.37581348419189453, "num_input_tokens_seen": 616835560, "step": 14105, "train_runtime": 109114.6463, "train_tokens_per_second": 5653.096 }, { "epoch": 0.9500403985995152, "grad_norm": 0.7685617426175168, "learning_rate": 5.3925063527947e-06, "loss": 0.34862990379333497, "num_input_tokens_seen": 617051200, "step": 14110, "train_runtime": 109161.8492, "train_tokens_per_second": 5652.627 }, { "epoch": 0.9503770535954753, "grad_norm": 0.771130071661086, "learning_rate": 5.389870375482283e-06, "loss": 0.37904350757598876, "num_input_tokens_seen": 617248976, "step": 14115, "train_runtime": 109194.634, "train_tokens_per_second": 5652.741 }, { "epoch": 0.9507137085914354, "grad_norm": 0.7205683359655156, "learning_rate": 5.387234289143859e-06, "loss": 0.331813383102417, "num_input_tokens_seen": 617469104, "step": 14120, "train_runtime": 109226.9679, "train_tokens_per_second": 5653.083 }, { "epoch": 0.9510503635873956, "grad_norm": 0.7693964177160706, "learning_rate": 5.384598094516601e-06, "loss": 0.3729023218154907, "num_input_tokens_seen": 617692328, "step": 14125, "train_runtime": 109271.6235, "train_tokens_per_second": 5652.816 }, { "epoch": 0.9513870185833557, "grad_norm": 0.6640672951882179, "learning_rate": 5.381961792337712e-06, "loss": 0.3759523153305054, "num_input_tokens_seen": 617921872, "step": 14130, "train_runtime": 109307.5627, "train_tokens_per_second": 5653.057 }, { "epoch": 0.9517236735793159, "grad_norm": 0.6678437973528463, "learning_rate": 5.3793253833444245e-06, "loss": 0.3401124715805054, "num_input_tokens_seen": 618147624, "step": 14135, "train_runtime": 109342.9092, "train_tokens_per_second": 5653.294 }, { "epoch": 0.952060328575276, "grad_norm": 0.6761734645912748, "learning_rate": 5.3766888682740045e-06, "loss": 0.3542716264724731, "num_input_tokens_seen": 618375336, "step": 14140, "train_runtime": 109378.6235, "train_tokens_per_second": 5653.53 }, { "epoch": 0.9523969835712361, "grad_norm": 0.7917338745636189, "learning_rate": 5.374052247863745e-06, "loss": 0.3719951152801514, "num_input_tokens_seen": 618588568, "step": 14145, "train_runtime": 109412.8524, "train_tokens_per_second": 5653.71 }, { "epoch": 0.9527336385671963, "grad_norm": 0.7643089958554735, "learning_rate": 5.371415522850966e-06, "loss": 0.34739990234375, "num_input_tokens_seen": 618807136, "step": 14150, "train_runtime": 109455.6515, "train_tokens_per_second": 5653.496 }, { "epoch": 0.9530702935631564, "grad_norm": 0.7334076755125779, "learning_rate": 5.368778693973019e-06, "loss": 0.35079226493835447, "num_input_tokens_seen": 619020192, "step": 14155, "train_runtime": 109497.2351, "train_tokens_per_second": 5653.295 }, { "epoch": 0.9534069485591166, "grad_norm": 0.6518007663729203, "learning_rate": 5.366141761967287e-06, "loss": 0.3731173753738403, "num_input_tokens_seen": 619234312, "step": 14160, "train_runtime": 109535.8084, "train_tokens_per_second": 5653.259 }, { "epoch": 0.9537436035550767, "grad_norm": 0.884684695372941, "learning_rate": 5.363504727571179e-06, "loss": 0.38480224609375, "num_input_tokens_seen": 619455112, "step": 14165, "train_runtime": 109574.3358, "train_tokens_per_second": 5653.286 }, { "epoch": 0.954080258551037, "grad_norm": 0.7444612393985186, "learning_rate": 5.360867591522133e-06, "loss": 0.4258725166320801, "num_input_tokens_seen": 619686368, "step": 14170, "train_runtime": 109614.4844, "train_tokens_per_second": 5653.326 }, { "epoch": 0.9544169135469971, "grad_norm": 0.766088989031395, "learning_rate": 5.358230354557617e-06, "loss": 0.34602572917938235, "num_input_tokens_seen": 619912184, "step": 14175, "train_runtime": 109647.5189, "train_tokens_per_second": 5653.682 }, { "epoch": 0.9547535685429572, "grad_norm": 0.8426997667284004, "learning_rate": 5.355593017415123e-06, "loss": 0.39844369888305664, "num_input_tokens_seen": 620138400, "step": 14180, "train_runtime": 109681.0251, "train_tokens_per_second": 5654.017 }, { "epoch": 0.9550902235389174, "grad_norm": 0.6855456694998082, "learning_rate": 5.352955580832176e-06, "loss": 0.36531069278717043, "num_input_tokens_seen": 620363336, "step": 14185, "train_runtime": 109720.9773, "train_tokens_per_second": 5654.008 }, { "epoch": 0.9554268785348775, "grad_norm": 0.6489568473620863, "learning_rate": 5.350318045546326e-06, "loss": 0.378409218788147, "num_input_tokens_seen": 620586608, "step": 14190, "train_runtime": 109762.864, "train_tokens_per_second": 5653.885 }, { "epoch": 0.9557635335308377, "grad_norm": 0.690203133783407, "learning_rate": 5.347680412295152e-06, "loss": 0.3777376413345337, "num_input_tokens_seen": 620803016, "step": 14195, "train_runtime": 109803.0202, "train_tokens_per_second": 5653.788 }, { "epoch": 0.9561001885267978, "grad_norm": 0.8763898868581147, "learning_rate": 5.34504268181626e-06, "loss": 0.37516131401062014, "num_input_tokens_seen": 621009712, "step": 14200, "train_runtime": 109842.1757, "train_tokens_per_second": 5653.655 }, { "epoch": 0.9564368435227579, "grad_norm": 0.8351648882525854, "learning_rate": 5.342404854847282e-06, "loss": 0.36751456260681153, "num_input_tokens_seen": 621209912, "step": 14205, "train_runtime": 109878.6528, "train_tokens_per_second": 5653.6 }, { "epoch": 0.9567734985187181, "grad_norm": 0.695513608466477, "learning_rate": 5.3397669321258776e-06, "loss": 0.3533796310424805, "num_input_tokens_seen": 621439136, "step": 14210, "train_runtime": 109913.5419, "train_tokens_per_second": 5653.891 }, { "epoch": 0.9571101535146782, "grad_norm": 0.7212650216714175, "learning_rate": 5.337128914389734e-06, "loss": 0.3940083980560303, "num_input_tokens_seen": 621670256, "step": 14215, "train_runtime": 109948.6255, "train_tokens_per_second": 5654.189 }, { "epoch": 0.9574468085106383, "grad_norm": 0.7045386935112185, "learning_rate": 5.334490802376565e-06, "loss": 0.3630239009857178, "num_input_tokens_seen": 621896344, "step": 14220, "train_runtime": 109992.4071, "train_tokens_per_second": 5653.993 }, { "epoch": 0.9577834635065985, "grad_norm": 1.0648426671565956, "learning_rate": 5.33185259682411e-06, "loss": 0.38904123306274413, "num_input_tokens_seen": 622111488, "step": 14225, "train_runtime": 110028.3421, "train_tokens_per_second": 5654.102 }, { "epoch": 0.9581201185025586, "grad_norm": 0.6854092676166333, "learning_rate": 5.329214298470134e-06, "loss": 0.3952740907669067, "num_input_tokens_seen": 622335752, "step": 14230, "train_runtime": 110067.3201, "train_tokens_per_second": 5654.137 }, { "epoch": 0.9584567734985188, "grad_norm": 0.6504683472772627, "learning_rate": 5.326575908052428e-06, "loss": 0.34938879013061525, "num_input_tokens_seen": 622563512, "step": 14235, "train_runtime": 110103.0055, "train_tokens_per_second": 5654.373 }, { "epoch": 0.9587934284944789, "grad_norm": 0.8743571550942602, "learning_rate": 5.323937426308813e-06, "loss": 0.4064329147338867, "num_input_tokens_seen": 622789680, "step": 14240, "train_runtime": 110140.2833, "train_tokens_per_second": 5654.513 }, { "epoch": 0.959130083490439, "grad_norm": 0.7364135099684984, "learning_rate": 5.321298853977128e-06, "loss": 0.3482068538665771, "num_input_tokens_seen": 623030288, "step": 14245, "train_runtime": 110172.6755, "train_tokens_per_second": 5655.035 }, { "epoch": 0.9594667384863992, "grad_norm": 1.04514521012973, "learning_rate": 5.318660191795244e-06, "loss": 0.35120339393615724, "num_input_tokens_seen": 623250248, "step": 14250, "train_runtime": 110210.2613, "train_tokens_per_second": 5655.102 }, { "epoch": 0.9598033934823593, "grad_norm": 0.6859815669971231, "learning_rate": 5.316021440501053e-06, "loss": 0.32753448486328124, "num_input_tokens_seen": 623468032, "step": 14255, "train_runtime": 110254.6316, "train_tokens_per_second": 5654.801 }, { "epoch": 0.9601400484783195, "grad_norm": 0.6696719492054304, "learning_rate": 5.313382600832474e-06, "loss": 0.32216849327087405, "num_input_tokens_seen": 623687536, "step": 14260, "train_runtime": 110295.1281, "train_tokens_per_second": 5654.715 }, { "epoch": 0.9604767034742796, "grad_norm": 0.6796334454419847, "learning_rate": 5.310743673527451e-06, "loss": 0.3820059776306152, "num_input_tokens_seen": 623916888, "step": 14265, "train_runtime": 110337.4663, "train_tokens_per_second": 5654.624 }, { "epoch": 0.9608133584702397, "grad_norm": 0.7257174247083755, "learning_rate": 5.3081046593239496e-06, "loss": 0.38223018646240237, "num_input_tokens_seen": 624136416, "step": 14270, "train_runtime": 110378.6302, "train_tokens_per_second": 5654.504 }, { "epoch": 0.9611500134661999, "grad_norm": 0.7285256715224561, "learning_rate": 5.305465558959964e-06, "loss": 0.366811728477478, "num_input_tokens_seen": 624349152, "step": 14275, "train_runtime": 110421.354, "train_tokens_per_second": 5654.243 }, { "epoch": 0.96148666846216, "grad_norm": 0.7064345566990189, "learning_rate": 5.302826373173506e-06, "loss": 0.3593759536743164, "num_input_tokens_seen": 624577352, "step": 14280, "train_runtime": 110460.1396, "train_tokens_per_second": 5654.323 }, { "epoch": 0.9618233234581202, "grad_norm": 0.7256414932456383, "learning_rate": 5.3001871027026194e-06, "loss": 0.3493657112121582, "num_input_tokens_seen": 624788664, "step": 14285, "train_runtime": 110502.0095, "train_tokens_per_second": 5654.093 }, { "epoch": 0.9621599784540803, "grad_norm": 0.7017567146140217, "learning_rate": 5.2975477482853685e-06, "loss": 0.3475620746612549, "num_input_tokens_seen": 625013976, "step": 14290, "train_runtime": 110543.2223, "train_tokens_per_second": 5654.023 }, { "epoch": 0.9624966334500404, "grad_norm": 0.8025787225363398, "learning_rate": 5.294908310659838e-06, "loss": 0.3636843204498291, "num_input_tokens_seen": 625243416, "step": 14295, "train_runtime": 110579.9936, "train_tokens_per_second": 5654.218 }, { "epoch": 0.9628332884460006, "grad_norm": 0.796752899535943, "learning_rate": 5.292268790564138e-06, "loss": 0.3458188772201538, "num_input_tokens_seen": 625456472, "step": 14300, "train_runtime": 110621.9221, "train_tokens_per_second": 5654.001 }, { "epoch": 0.9631699434419607, "grad_norm": 0.7622734681695542, "learning_rate": 5.289629188736403e-06, "loss": 0.39026923179626466, "num_input_tokens_seen": 625676128, "step": 14305, "train_runtime": 110667.8056, "train_tokens_per_second": 5653.642 }, { "epoch": 0.9635065984379209, "grad_norm": 0.973852297067902, "learning_rate": 5.286989505914788e-06, "loss": 0.38088412284851075, "num_input_tokens_seen": 625904384, "step": 14310, "train_runtime": 110702.6608, "train_tokens_per_second": 5653.924 }, { "epoch": 0.963843253433881, "grad_norm": 0.8147025206812348, "learning_rate": 5.284349742837475e-06, "loss": 0.3758919954299927, "num_input_tokens_seen": 626134784, "step": 14315, "train_runtime": 110744.3819, "train_tokens_per_second": 5653.874 }, { "epoch": 0.9641799084298411, "grad_norm": 0.8865610211887707, "learning_rate": 5.281709900242662e-06, "loss": 0.35522916316986086, "num_input_tokens_seen": 626357296, "step": 14320, "train_runtime": 110789.1337, "train_tokens_per_second": 5653.599 }, { "epoch": 0.9645165634258013, "grad_norm": 0.7685303095133553, "learning_rate": 5.279069978868574e-06, "loss": 0.3454322099685669, "num_input_tokens_seen": 626576680, "step": 14325, "train_runtime": 110823.2787, "train_tokens_per_second": 5653.836 }, { "epoch": 0.9648532184217614, "grad_norm": 0.7582279578264484, "learning_rate": 5.276429979453455e-06, "loss": 0.36722531318664553, "num_input_tokens_seen": 626795800, "step": 14330, "train_runtime": 110855.2605, "train_tokens_per_second": 5654.182 }, { "epoch": 0.9651898734177216, "grad_norm": 0.6609643186180265, "learning_rate": 5.273789902735575e-06, "loss": 0.36404809951782224, "num_input_tokens_seen": 627011600, "step": 14335, "train_runtime": 110890.1684, "train_tokens_per_second": 5654.348 }, { "epoch": 0.9655265284136817, "grad_norm": 0.7160660322102089, "learning_rate": 5.27114974945322e-06, "loss": 0.33545889854431155, "num_input_tokens_seen": 627226888, "step": 14340, "train_runtime": 110937.4224, "train_tokens_per_second": 5653.88 }, { "epoch": 0.9658631834096418, "grad_norm": 0.7371545286431122, "learning_rate": 5.2685095203447046e-06, "loss": 0.3596933841705322, "num_input_tokens_seen": 627453768, "step": 14345, "train_runtime": 110976.5578, "train_tokens_per_second": 5653.931 }, { "epoch": 0.966199838405602, "grad_norm": 0.6944067783154944, "learning_rate": 5.265869216148357e-06, "loss": 0.352811861038208, "num_input_tokens_seen": 627673216, "step": 14350, "train_runtime": 111014.9066, "train_tokens_per_second": 5653.954 }, { "epoch": 0.9665364934015621, "grad_norm": 0.7335669224993876, "learning_rate": 5.263228837602532e-06, "loss": 0.42299542427062986, "num_input_tokens_seen": 627887552, "step": 14355, "train_runtime": 111050.8572, "train_tokens_per_second": 5654.054 }, { "epoch": 0.9668731483975223, "grad_norm": 0.83794134450925, "learning_rate": 5.2605883854456e-06, "loss": 0.3737421989440918, "num_input_tokens_seen": 628108328, "step": 14360, "train_runtime": 111089.5086, "train_tokens_per_second": 5654.074 }, { "epoch": 0.9672098033934824, "grad_norm": 0.6342873275404923, "learning_rate": 5.257947860415957e-06, "loss": 0.3357997894287109, "num_input_tokens_seen": 628335808, "step": 14365, "train_runtime": 111122.6788, "train_tokens_per_second": 5654.434 }, { "epoch": 0.9675464583894425, "grad_norm": 0.8822334071658794, "learning_rate": 5.255307263252019e-06, "loss": 0.3541123867034912, "num_input_tokens_seen": 628566792, "step": 14370, "train_runtime": 111156.9119, "train_tokens_per_second": 5654.77 }, { "epoch": 0.9678831133854027, "grad_norm": 0.674709973682241, "learning_rate": 5.2526665946922185e-06, "loss": 0.3823538303375244, "num_input_tokens_seen": 628784336, "step": 14375, "train_runtime": 111196.5312, "train_tokens_per_second": 5654.712 }, { "epoch": 0.9682197683813628, "grad_norm": 0.658823173011451, "learning_rate": 5.25002585547501e-06, "loss": 0.35442066192626953, "num_input_tokens_seen": 629008320, "step": 14380, "train_runtime": 111234.2162, "train_tokens_per_second": 5654.81 }, { "epoch": 0.968556423377323, "grad_norm": 0.723111666266317, "learning_rate": 5.2473850463388675e-06, "loss": 0.3943564176559448, "num_input_tokens_seen": 629232256, "step": 14385, "train_runtime": 111274.7039, "train_tokens_per_second": 5654.765 }, { "epoch": 0.9688930783732831, "grad_norm": 0.6809256630686321, "learning_rate": 5.244744168022288e-06, "loss": 0.3620326995849609, "num_input_tokens_seen": 629455456, "step": 14390, "train_runtime": 111314.9521, "train_tokens_per_second": 5654.725 }, { "epoch": 0.9692297333692432, "grad_norm": 0.6956920321641313, "learning_rate": 5.24210322126378e-06, "loss": 0.36865873336791993, "num_input_tokens_seen": 629691848, "step": 14395, "train_runtime": 111353.3824, "train_tokens_per_second": 5654.896 }, { "epoch": 0.9695663883652034, "grad_norm": 0.7152647788363251, "learning_rate": 5.23946220680188e-06, "loss": 0.3680101871490479, "num_input_tokens_seen": 629928368, "step": 14400, "train_runtime": 111391.3207, "train_tokens_per_second": 5655.094 }, { "epoch": 0.9699030433611635, "grad_norm": 0.7371345942960084, "learning_rate": 5.236821125375136e-06, "loss": 0.3584733486175537, "num_input_tokens_seen": 630150304, "step": 14405, "train_runtime": 111429.6066, "train_tokens_per_second": 5655.142 }, { "epoch": 0.9702396983571236, "grad_norm": 0.6525643955944114, "learning_rate": 5.234179977722119e-06, "loss": 0.31973896026611326, "num_input_tokens_seen": 630389640, "step": 14410, "train_runtime": 111465.3624, "train_tokens_per_second": 5655.476 }, { "epoch": 0.9705763533530838, "grad_norm": 0.6728032683654267, "learning_rate": 5.23153876458142e-06, "loss": 0.36993358135223386, "num_input_tokens_seen": 630599464, "step": 14415, "train_runtime": 111509.2822, "train_tokens_per_second": 5655.13 }, { "epoch": 0.9709130083490439, "grad_norm": 0.7435706382156235, "learning_rate": 5.2288974866916435e-06, "loss": 0.36161553859710693, "num_input_tokens_seen": 630794912, "step": 14420, "train_runtime": 111547.8849, "train_tokens_per_second": 5654.925 }, { "epoch": 0.9712496633450041, "grad_norm": 0.702712902975055, "learning_rate": 5.226256144791414e-06, "loss": 0.36026706695556643, "num_input_tokens_seen": 631000992, "step": 14425, "train_runtime": 111582.5203, "train_tokens_per_second": 5655.016 }, { "epoch": 0.9715863183409642, "grad_norm": 0.7340375348827854, "learning_rate": 5.223614739619375e-06, "loss": 0.37513973712921145, "num_input_tokens_seen": 631202192, "step": 14430, "train_runtime": 111620.6231, "train_tokens_per_second": 5654.889 }, { "epoch": 0.9719229733369243, "grad_norm": 0.6505020134915022, "learning_rate": 5.2209732719141855e-06, "loss": 0.33454012870788574, "num_input_tokens_seen": 631411712, "step": 14435, "train_runtime": 111660.3902, "train_tokens_per_second": 5654.751 }, { "epoch": 0.9722596283328845, "grad_norm": 0.6834948719980648, "learning_rate": 5.218331742414528e-06, "loss": 0.3455739736557007, "num_input_tokens_seen": 631641904, "step": 14440, "train_runtime": 111694.5696, "train_tokens_per_second": 5655.082 }, { "epoch": 0.9725962833288446, "grad_norm": 0.7031614396342304, "learning_rate": 5.215690151859094e-06, "loss": 0.3380829572677612, "num_input_tokens_seen": 631848056, "step": 14445, "train_runtime": 111733.8193, "train_tokens_per_second": 5654.94 }, { "epoch": 0.9729329383248048, "grad_norm": 0.737272924329504, "learning_rate": 5.213048500986597e-06, "loss": 0.3667490243911743, "num_input_tokens_seen": 632068664, "step": 14450, "train_runtime": 111782.1877, "train_tokens_per_second": 5654.467 }, { "epoch": 0.9732695933207649, "grad_norm": 0.8384823634165054, "learning_rate": 5.210406790535766e-06, "loss": 0.3663896083831787, "num_input_tokens_seen": 632279544, "step": 14455, "train_runtime": 111817.1549, "train_tokens_per_second": 5654.584 }, { "epoch": 0.973606248316725, "grad_norm": 0.7339723372461647, "learning_rate": 5.207765021245346e-06, "loss": 0.3660223722457886, "num_input_tokens_seen": 632492984, "step": 14460, "train_runtime": 111858.5212, "train_tokens_per_second": 5654.401 }, { "epoch": 0.9739429033126852, "grad_norm": 0.7329956341586107, "learning_rate": 5.2051231938541015e-06, "loss": 0.3708993911743164, "num_input_tokens_seen": 632694568, "step": 14465, "train_runtime": 111894.0881, "train_tokens_per_second": 5654.406 }, { "epoch": 0.9742795583086453, "grad_norm": 0.7751460530884079, "learning_rate": 5.202481309100808e-06, "loss": 0.3687734127044678, "num_input_tokens_seen": 632904360, "step": 14470, "train_runtime": 111935.2636, "train_tokens_per_second": 5654.2 }, { "epoch": 0.9746162133046055, "grad_norm": 0.6898579692907033, "learning_rate": 5.199839367724266e-06, "loss": 0.3596921920776367, "num_input_tokens_seen": 633132800, "step": 14475, "train_runtime": 111976.0175, "train_tokens_per_second": 5654.182 }, { "epoch": 0.9749528683005656, "grad_norm": 0.7400137611963173, "learning_rate": 5.197197370463278e-06, "loss": 0.343227481842041, "num_input_tokens_seen": 633370648, "step": 14480, "train_runtime": 112017.4444, "train_tokens_per_second": 5654.214 }, { "epoch": 0.9752895232965257, "grad_norm": 0.6958590027819616, "learning_rate": 5.194555318056675e-06, "loss": 0.39154577255249023, "num_input_tokens_seen": 633605816, "step": 14485, "train_runtime": 112050.1996, "train_tokens_per_second": 5654.66 }, { "epoch": 0.9756261782924859, "grad_norm": 0.9461003642017359, "learning_rate": 5.191913211243299e-06, "loss": 0.37716875076293943, "num_input_tokens_seen": 633832456, "step": 14490, "train_runtime": 112095.5877, "train_tokens_per_second": 5654.393 }, { "epoch": 0.975962833288446, "grad_norm": 0.7296195050735405, "learning_rate": 5.1892710507620055e-06, "loss": 0.36735081672668457, "num_input_tokens_seen": 634052208, "step": 14495, "train_runtime": 112132.123, "train_tokens_per_second": 5654.51 }, { "epoch": 0.9762994882844062, "grad_norm": 0.713237266588106, "learning_rate": 5.186628837351666e-06, "loss": 0.3544626235961914, "num_input_tokens_seen": 634282120, "step": 14500, "train_runtime": 112168.6707, "train_tokens_per_second": 5654.717 }, { "epoch": 0.9766361432803663, "grad_norm": 0.7152784729674379, "learning_rate": 5.183986571751167e-06, "loss": 0.3681643962860107, "num_input_tokens_seen": 634503040, "step": 14505, "train_runtime": 112208.6433, "train_tokens_per_second": 5654.672 }, { "epoch": 0.9769727982763264, "grad_norm": 0.7143902821508025, "learning_rate": 5.181344254699408e-06, "loss": 0.384121036529541, "num_input_tokens_seen": 634718224, "step": 14510, "train_runtime": 112246.9754, "train_tokens_per_second": 5654.658 }, { "epoch": 0.9773094532722866, "grad_norm": 0.7563338962960594, "learning_rate": 5.178701886935309e-06, "loss": 0.3466785907745361, "num_input_tokens_seen": 634926976, "step": 14515, "train_runtime": 112283.3188, "train_tokens_per_second": 5654.687 }, { "epoch": 0.9776461082682467, "grad_norm": 0.6709897911941165, "learning_rate": 5.176059469197796e-06, "loss": 0.3563254356384277, "num_input_tokens_seen": 635147104, "step": 14520, "train_runtime": 112318.4084, "train_tokens_per_second": 5654.88 }, { "epoch": 0.9779827632642069, "grad_norm": 0.84998527536875, "learning_rate": 5.173417002225815e-06, "loss": 0.3569037914276123, "num_input_tokens_seen": 635366792, "step": 14525, "train_runtime": 112357.718, "train_tokens_per_second": 5654.857 }, { "epoch": 0.978319418260167, "grad_norm": 0.7892134632795219, "learning_rate": 5.170774486758322e-06, "loss": 0.36590094566345216, "num_input_tokens_seen": 635560568, "step": 14530, "train_runtime": 112393.8137, "train_tokens_per_second": 5654.765 }, { "epoch": 0.9786560732561271, "grad_norm": 0.6842756660337252, "learning_rate": 5.168131923534287e-06, "loss": 0.38362579345703124, "num_input_tokens_seen": 635787144, "step": 14535, "train_runtime": 112428.7709, "train_tokens_per_second": 5655.022 }, { "epoch": 0.9789927282520873, "grad_norm": 0.6691518942357926, "learning_rate": 5.165489313292696e-06, "loss": 0.35508084297180176, "num_input_tokens_seen": 636000120, "step": 14540, "train_runtime": 112469.9454, "train_tokens_per_second": 5654.845 }, { "epoch": 0.9793293832480474, "grad_norm": 0.7564357234909826, "learning_rate": 5.162846656772548e-06, "loss": 0.35072224140167235, "num_input_tokens_seen": 636214280, "step": 14545, "train_runtime": 112512.921, "train_tokens_per_second": 5654.589 }, { "epoch": 0.9796660382440076, "grad_norm": 0.7450101360653049, "learning_rate": 5.16020395471285e-06, "loss": 0.3438509464263916, "num_input_tokens_seen": 636435816, "step": 14550, "train_runtime": 112554.2979, "train_tokens_per_second": 5654.478 }, { "epoch": 0.9800026932399677, "grad_norm": 0.8137120525286944, "learning_rate": 5.157561207852628e-06, "loss": 0.3831623077392578, "num_input_tokens_seen": 636640224, "step": 14555, "train_runtime": 112591.2086, "train_tokens_per_second": 5654.44 }, { "epoch": 0.9803393482359278, "grad_norm": 0.7297592438951429, "learning_rate": 5.154918416930915e-06, "loss": 0.3411484479904175, "num_input_tokens_seen": 636858520, "step": 14560, "train_runtime": 112629.598, "train_tokens_per_second": 5654.451 }, { "epoch": 0.980676003231888, "grad_norm": 0.760019959304734, "learning_rate": 5.152275582686761e-06, "loss": 0.3839298486709595, "num_input_tokens_seen": 637073856, "step": 14565, "train_runtime": 112666.3482, "train_tokens_per_second": 5654.518 }, { "epoch": 0.9810126582278481, "grad_norm": 0.6959300895402221, "learning_rate": 5.149632705859227e-06, "loss": 0.36935174465179443, "num_input_tokens_seen": 637299440, "step": 14570, "train_runtime": 112707.9899, "train_tokens_per_second": 5654.43 }, { "epoch": 0.9813493132238083, "grad_norm": 0.7586977280516466, "learning_rate": 5.146989787187383e-06, "loss": 0.37570605278015134, "num_input_tokens_seen": 637529440, "step": 14575, "train_runtime": 112743.4679, "train_tokens_per_second": 5654.691 }, { "epoch": 0.9816859682197684, "grad_norm": 0.6825264977223254, "learning_rate": 5.144346827410314e-06, "loss": 0.3703890562057495, "num_input_tokens_seen": 637754408, "step": 14580, "train_runtime": 112773.1649, "train_tokens_per_second": 5655.197 }, { "epoch": 0.9820226232157285, "grad_norm": 0.826290290377258, "learning_rate": 5.141703827267117e-06, "loss": 0.3702056646347046, "num_input_tokens_seen": 637982336, "step": 14585, "train_runtime": 112804.5446, "train_tokens_per_second": 5655.644 }, { "epoch": 0.9823592782116887, "grad_norm": 0.7212214874544945, "learning_rate": 5.139060787496893e-06, "loss": 0.3754692077636719, "num_input_tokens_seen": 638203872, "step": 14590, "train_runtime": 112841.7495, "train_tokens_per_second": 5655.742 }, { "epoch": 0.9826959332076488, "grad_norm": 0.6942239873292527, "learning_rate": 5.136417708838766e-06, "loss": 0.3775701284408569, "num_input_tokens_seen": 638407968, "step": 14595, "train_runtime": 112885.1355, "train_tokens_per_second": 5655.377 }, { "epoch": 0.983032588203609, "grad_norm": 0.7575191844718635, "learning_rate": 5.13377459203186e-06, "loss": 0.3628222465515137, "num_input_tokens_seen": 638616040, "step": 14600, "train_runtime": 112923.0341, "train_tokens_per_second": 5655.321 }, { "epoch": 0.9833692431995691, "grad_norm": 0.7100885514863359, "learning_rate": 5.131131437815318e-06, "loss": 0.3371574401855469, "num_input_tokens_seen": 638837176, "step": 14605, "train_runtime": 112963.1632, "train_tokens_per_second": 5655.27 }, { "epoch": 0.9837058981955292, "grad_norm": 0.7208738472250812, "learning_rate": 5.128488246928287e-06, "loss": 0.36636881828308104, "num_input_tokens_seen": 639065552, "step": 14610, "train_runtime": 113000.1458, "train_tokens_per_second": 5655.44 }, { "epoch": 0.9840425531914894, "grad_norm": 0.7630145727500303, "learning_rate": 5.125845020109925e-06, "loss": 0.37039480209350584, "num_input_tokens_seen": 639285272, "step": 14615, "train_runtime": 113047.3523, "train_tokens_per_second": 5655.022 }, { "epoch": 0.9843792081874495, "grad_norm": 0.7720868800544706, "learning_rate": 5.123201758099406e-06, "loss": 0.36545164585113527, "num_input_tokens_seen": 639499208, "step": 14620, "train_runtime": 113085.6686, "train_tokens_per_second": 5654.998 }, { "epoch": 0.9847158631834096, "grad_norm": 0.7035125490360992, "learning_rate": 5.12055846163591e-06, "loss": 0.37010979652404785, "num_input_tokens_seen": 639714312, "step": 14625, "train_runtime": 113123.7227, "train_tokens_per_second": 5654.997 }, { "epoch": 0.9850525181793698, "grad_norm": 0.6519589735545973, "learning_rate": 5.117915131458623e-06, "loss": 0.3291551828384399, "num_input_tokens_seen": 639938488, "step": 14630, "train_runtime": 113162.111, "train_tokens_per_second": 5655.06 }, { "epoch": 0.9853891731753299, "grad_norm": 0.8145405370454951, "learning_rate": 5.115271768306745e-06, "loss": 0.36716470718383787, "num_input_tokens_seen": 640152840, "step": 14635, "train_runtime": 113199.5845, "train_tokens_per_second": 5655.081 }, { "epoch": 0.9857258281712901, "grad_norm": 0.790933823693933, "learning_rate": 5.112628372919485e-06, "loss": 0.3815732717514038, "num_input_tokens_seen": 640369952, "step": 14640, "train_runtime": 113234.1823, "train_tokens_per_second": 5655.271 }, { "epoch": 0.9860624831672502, "grad_norm": 0.9699782510514777, "learning_rate": 5.1099849460360595e-06, "loss": 0.34613332748413084, "num_input_tokens_seen": 640567240, "step": 14645, "train_runtime": 113271.7361, "train_tokens_per_second": 5655.137 }, { "epoch": 0.9863991381632103, "grad_norm": 0.6723948378020855, "learning_rate": 5.107341488395695e-06, "loss": 0.3379997730255127, "num_input_tokens_seen": 640788384, "step": 14650, "train_runtime": 113310.4257, "train_tokens_per_second": 5655.158 }, { "epoch": 0.9867357931591705, "grad_norm": 0.7000157996530737, "learning_rate": 5.104698000737626e-06, "loss": 0.37780165672302246, "num_input_tokens_seen": 641011792, "step": 14655, "train_runtime": 113351.4983, "train_tokens_per_second": 5655.08 }, { "epoch": 0.9870724481551306, "grad_norm": 0.7543705648632995, "learning_rate": 5.102054483801094e-06, "loss": 0.38533506393432615, "num_input_tokens_seen": 641239984, "step": 14660, "train_runtime": 113390.3486, "train_tokens_per_second": 5655.155 }, { "epoch": 0.9874091031510908, "grad_norm": 0.7193117605335543, "learning_rate": 5.099410938325351e-06, "loss": 0.3746023178100586, "num_input_tokens_seen": 641468200, "step": 14665, "train_runtime": 113424.7218, "train_tokens_per_second": 5655.453 }, { "epoch": 0.9877457581470509, "grad_norm": 0.8146622438199124, "learning_rate": 5.096767365049657e-06, "loss": 0.3502329111099243, "num_input_tokens_seen": 641672792, "step": 14670, "train_runtime": 113464.964, "train_tokens_per_second": 5655.25 }, { "epoch": 0.988082413143011, "grad_norm": 0.6875126263724606, "learning_rate": 5.094123764713277e-06, "loss": 0.3421436309814453, "num_input_tokens_seen": 641904736, "step": 14675, "train_runtime": 113500.904, "train_tokens_per_second": 5655.503 }, { "epoch": 0.9884190681389712, "grad_norm": 0.7258139194348168, "learning_rate": 5.091480138055487e-06, "loss": 0.36416258811950686, "num_input_tokens_seen": 642136592, "step": 14680, "train_runtime": 113531.8425, "train_tokens_per_second": 5656.004 }, { "epoch": 0.9887557231349313, "grad_norm": 0.7250476516557031, "learning_rate": 5.088836485815568e-06, "loss": 0.35428576469421386, "num_input_tokens_seen": 642334648, "step": 14685, "train_runtime": 113566.8784, "train_tokens_per_second": 5656.003 }, { "epoch": 0.9890923781308915, "grad_norm": 0.7385563837095339, "learning_rate": 5.086192808732809e-06, "loss": 0.35656602382659913, "num_input_tokens_seen": 642538480, "step": 14690, "train_runtime": 113608.5759, "train_tokens_per_second": 5655.722 }, { "epoch": 0.9894290331268516, "grad_norm": 0.7946980704838973, "learning_rate": 5.083549107546505e-06, "loss": 0.36766040325164795, "num_input_tokens_seen": 642744792, "step": 14695, "train_runtime": 113647.6019, "train_tokens_per_second": 5655.595 }, { "epoch": 0.9897656881228117, "grad_norm": 0.771038431226611, "learning_rate": 5.080905382995961e-06, "loss": 0.38895292282104493, "num_input_tokens_seen": 642974608, "step": 14700, "train_runtime": 113683.9469, "train_tokens_per_second": 5655.808 }, { "epoch": 0.9901023431187719, "grad_norm": 0.7343676499490034, "learning_rate": 5.0782616358204835e-06, "loss": 0.37378993034362795, "num_input_tokens_seen": 643191928, "step": 14705, "train_runtime": 113723.5317, "train_tokens_per_second": 5655.751 }, { "epoch": 0.990438998114732, "grad_norm": 0.8524692289540274, "learning_rate": 5.075617866759389e-06, "loss": 0.33492867946624755, "num_input_tokens_seen": 643403376, "step": 14710, "train_runtime": 113766.092, "train_tokens_per_second": 5655.493 }, { "epoch": 0.9907756531106922, "grad_norm": 0.7901150595595263, "learning_rate": 5.0729740765519995e-06, "loss": 0.4053798675537109, "num_input_tokens_seen": 643617760, "step": 14715, "train_runtime": 113802.6369, "train_tokens_per_second": 5655.561 }, { "epoch": 0.9911123081066523, "grad_norm": 0.7850703195564729, "learning_rate": 5.070330265937643e-06, "loss": 0.3686873435974121, "num_input_tokens_seen": 643827376, "step": 14720, "train_runtime": 113838.4716, "train_tokens_per_second": 5655.622 }, { "epoch": 0.9914489631026124, "grad_norm": 0.7339072075707702, "learning_rate": 5.067686435655651e-06, "loss": 0.3935819625854492, "num_input_tokens_seen": 644051992, "step": 14725, "train_runtime": 113875.0085, "train_tokens_per_second": 5655.78 }, { "epoch": 0.9917856180985726, "grad_norm": 0.7717913369926017, "learning_rate": 5.065042586445363e-06, "loss": 0.39838461875915526, "num_input_tokens_seen": 644255512, "step": 14730, "train_runtime": 113907.4094, "train_tokens_per_second": 5655.958 }, { "epoch": 0.9921222730945327, "grad_norm": 0.7852173126276834, "learning_rate": 5.0623987190461245e-06, "loss": 0.30464193820953367, "num_input_tokens_seen": 644460824, "step": 14735, "train_runtime": 113944.9392, "train_tokens_per_second": 5655.897 }, { "epoch": 0.9924589280904929, "grad_norm": 0.7913343599249734, "learning_rate": 5.059754834197281e-06, "loss": 0.3790989875793457, "num_input_tokens_seen": 644675152, "step": 14740, "train_runtime": 113988.6481, "train_tokens_per_second": 5655.608 }, { "epoch": 0.992795583086453, "grad_norm": 0.6313018834314664, "learning_rate": 5.05711093263819e-06, "loss": 0.32619643211364746, "num_input_tokens_seen": 644890856, "step": 14745, "train_runtime": 114026.2898, "train_tokens_per_second": 5655.633 }, { "epoch": 0.9931322380824131, "grad_norm": 0.7700737076224284, "learning_rate": 5.054467015108208e-06, "loss": 0.37743263244628905, "num_input_tokens_seen": 645124328, "step": 14750, "train_runtime": 114061.9307, "train_tokens_per_second": 5655.913 }, { "epoch": 0.9934688930783733, "grad_norm": 0.8548358470170475, "learning_rate": 5.051823082346701e-06, "loss": 0.37684605121612547, "num_input_tokens_seen": 645342896, "step": 14755, "train_runtime": 114095.225, "train_tokens_per_second": 5656.178 }, { "epoch": 0.9938055480743334, "grad_norm": 0.7487000463516748, "learning_rate": 5.049179135093033e-06, "loss": 0.3667085409164429, "num_input_tokens_seen": 645572616, "step": 14760, "train_runtime": 114128.9739, "train_tokens_per_second": 5656.518 }, { "epoch": 0.9941422030702936, "grad_norm": 0.7554586359729867, "learning_rate": 5.046535174086575e-06, "loss": 0.37410502433776854, "num_input_tokens_seen": 645784112, "step": 14765, "train_runtime": 114171.4105, "train_tokens_per_second": 5656.268 }, { "epoch": 0.9944788580662537, "grad_norm": 0.806201449115856, "learning_rate": 5.043891200066706e-06, "loss": 0.35855536460876464, "num_input_tokens_seen": 646000480, "step": 14770, "train_runtime": 114211.5644, "train_tokens_per_second": 5656.174 }, { "epoch": 0.9948155130622138, "grad_norm": 0.7970070550101245, "learning_rate": 5.041247213772802e-06, "loss": 0.3647798538208008, "num_input_tokens_seen": 646228928, "step": 14775, "train_runtime": 114248.8453, "train_tokens_per_second": 5656.328 }, { "epoch": 0.995152168058174, "grad_norm": 0.9274665922453337, "learning_rate": 5.038603215944247e-06, "loss": 0.3697342872619629, "num_input_tokens_seen": 646427096, "step": 14780, "train_runtime": 114283.9377, "train_tokens_per_second": 5656.325 }, { "epoch": 0.9954888230541341, "grad_norm": 0.7200893083392556, "learning_rate": 5.0359592073204254e-06, "loss": 0.34227933883666994, "num_input_tokens_seen": 646643272, "step": 14785, "train_runtime": 114327.3802, "train_tokens_per_second": 5656.067 }, { "epoch": 0.9958254780500942, "grad_norm": 1.0261926014877596, "learning_rate": 5.033315188640725e-06, "loss": 0.3627659797668457, "num_input_tokens_seen": 646872200, "step": 14790, "train_runtime": 114366.7864, "train_tokens_per_second": 5656.119 }, { "epoch": 0.9961621330460544, "grad_norm": 0.6681278213263397, "learning_rate": 5.03067116064454e-06, "loss": 0.3450484752655029, "num_input_tokens_seen": 647094832, "step": 14795, "train_runtime": 114408.9697, "train_tokens_per_second": 5655.98 }, { "epoch": 0.9964987880420145, "grad_norm": 0.6613774299958016, "learning_rate": 5.028027124071262e-06, "loss": 0.36185712814331056, "num_input_tokens_seen": 647301568, "step": 14800, "train_runtime": 114449.8831, "train_tokens_per_second": 5655.764 }, { "epoch": 0.9968354430379747, "grad_norm": 0.7005897120089515, "learning_rate": 5.025383079660289e-06, "loss": 0.3468491554260254, "num_input_tokens_seen": 647531264, "step": 14805, "train_runtime": 114488.5353, "train_tokens_per_second": 5655.861 }, { "epoch": 0.9971720980339348, "grad_norm": 0.7061938748348358, "learning_rate": 5.0227390281510166e-06, "loss": 0.3663314342498779, "num_input_tokens_seen": 647753976, "step": 14810, "train_runtime": 114526.0357, "train_tokens_per_second": 5655.954 }, { "epoch": 0.997508753029895, "grad_norm": 0.7212945140660744, "learning_rate": 5.020094970282849e-06, "loss": 0.3663675308227539, "num_input_tokens_seen": 647955768, "step": 14815, "train_runtime": 114566.6744, "train_tokens_per_second": 5655.709 }, { "epoch": 0.9978454080258551, "grad_norm": 0.7579147457391882, "learning_rate": 5.017450906795187e-06, "loss": 0.36784412860870364, "num_input_tokens_seen": 648181384, "step": 14820, "train_runtime": 114601.4001, "train_tokens_per_second": 5655.964 }, { "epoch": 0.9981820630218152, "grad_norm": 0.7496488759479608, "learning_rate": 5.014806838427434e-06, "loss": 0.36796035766601565, "num_input_tokens_seen": 648382672, "step": 14825, "train_runtime": 114646.9011, "train_tokens_per_second": 5655.475 }, { "epoch": 0.9985187180177754, "grad_norm": 0.6851905965880742, "learning_rate": 5.0121627659189964e-06, "loss": 0.3591431140899658, "num_input_tokens_seen": 648612168, "step": 14830, "train_runtime": 114682.2822, "train_tokens_per_second": 5655.731 }, { "epoch": 0.9988553730137355, "grad_norm": 0.6696970669236173, "learning_rate": 5.009518690009281e-06, "loss": 0.3566739082336426, "num_input_tokens_seen": 648821208, "step": 14835, "train_runtime": 114724.3707, "train_tokens_per_second": 5655.478 }, { "epoch": 0.9991920280096956, "grad_norm": 0.7614065048649256, "learning_rate": 5.006874611437692e-06, "loss": 0.3776280879974365, "num_input_tokens_seen": 649046288, "step": 14840, "train_runtime": 114764.8122, "train_tokens_per_second": 5655.447 }, { "epoch": 0.9995286830056558, "grad_norm": 0.6492499944472357, "learning_rate": 5.004230530943641e-06, "loss": 0.35755281448364257, "num_input_tokens_seen": 649262232, "step": 14845, "train_runtime": 114804.5614, "train_tokens_per_second": 5655.37 }, { "epoch": 0.9998653380016159, "grad_norm": 0.7184203567667401, "learning_rate": 5.001586449266536e-06, "loss": 0.3260646343231201, "num_input_tokens_seen": 649487024, "step": 14850, "train_runtime": 114845.5757, "train_tokens_per_second": 5655.307 }, { "epoch": 1.000201992997576, "grad_norm": 0.6358891287683051, "learning_rate": 4.998942367145787e-06, "loss": 0.35132179260253904, "num_input_tokens_seen": 649706888, "step": 14855, "train_runtime": 114929.2136, "train_tokens_per_second": 5653.105 }, { "epoch": 1.0005386479935363, "grad_norm": 0.7034269548859629, "learning_rate": 4.996298285320798e-06, "loss": 0.30704555511474607, "num_input_tokens_seen": 649911248, "step": 14860, "train_runtime": 114965.2665, "train_tokens_per_second": 5653.11 }, { "epoch": 1.0008753029894963, "grad_norm": 0.7771207057358878, "learning_rate": 4.993654204530983e-06, "loss": 0.2908186435699463, "num_input_tokens_seen": 650136336, "step": 14865, "train_runtime": 115009.0891, "train_tokens_per_second": 5652.913 }, { "epoch": 1.0012119579854566, "grad_norm": 0.7800505661917783, "learning_rate": 4.99101012551575e-06, "loss": 0.3061246633529663, "num_input_tokens_seen": 650324944, "step": 14870, "train_runtime": 115047.7835, "train_tokens_per_second": 5652.651 }, { "epoch": 1.0015486129814166, "grad_norm": 0.7451144290465576, "learning_rate": 4.9883660490145075e-06, "loss": 0.31706483364105226, "num_input_tokens_seen": 650556192, "step": 14875, "train_runtime": 115083.1511, "train_tokens_per_second": 5652.923 }, { "epoch": 1.0018852679773769, "grad_norm": 0.6924866106934799, "learning_rate": 4.985721975766661e-06, "loss": 0.32414817810058594, "num_input_tokens_seen": 650775960, "step": 14880, "train_runtime": 115118.3264, "train_tokens_per_second": 5653.105 }, { "epoch": 1.002221922973337, "grad_norm": 1.0051470668362659, "learning_rate": 4.983077906511619e-06, "loss": 0.32347331047058103, "num_input_tokens_seen": 650983240, "step": 14885, "train_runtime": 115161.3444, "train_tokens_per_second": 5652.793 }, { "epoch": 1.0025585779692971, "grad_norm": 0.7329517809959321, "learning_rate": 4.980433841988786e-06, "loss": 0.30762290954589844, "num_input_tokens_seen": 651204568, "step": 14890, "train_runtime": 115197.7799, "train_tokens_per_second": 5652.926 }, { "epoch": 1.0028952329652572, "grad_norm": 0.7126218012313592, "learning_rate": 4.977789782937568e-06, "loss": 0.3130316257476807, "num_input_tokens_seen": 651431064, "step": 14895, "train_runtime": 115231.9768, "train_tokens_per_second": 5653.214 }, { "epoch": 1.0032318879612174, "grad_norm": 0.7709912103285202, "learning_rate": 4.975145730097364e-06, "loss": 0.3236842155456543, "num_input_tokens_seen": 651636984, "step": 14900, "train_runtime": 115269.0999, "train_tokens_per_second": 5653.18 }, { "epoch": 1.0035685429571775, "grad_norm": 0.6705219562784165, "learning_rate": 4.97250168420758e-06, "loss": 0.3103510618209839, "num_input_tokens_seen": 651849816, "step": 14905, "train_runtime": 115304.0536, "train_tokens_per_second": 5653.312 }, { "epoch": 1.0039051979531377, "grad_norm": 0.737858641027806, "learning_rate": 4.96985764600761e-06, "loss": 0.3144733428955078, "num_input_tokens_seen": 652078544, "step": 14910, "train_runtime": 115343.8311, "train_tokens_per_second": 5653.346 }, { "epoch": 1.0042418529490977, "grad_norm": 0.7152864263979617, "learning_rate": 4.967213616236855e-06, "loss": 0.32990431785583496, "num_input_tokens_seen": 652288816, "step": 14915, "train_runtime": 115379.8129, "train_tokens_per_second": 5653.405 }, { "epoch": 1.004578507945058, "grad_norm": 0.750830922325084, "learning_rate": 4.964569595634706e-06, "loss": 0.3154884338378906, "num_input_tokens_seen": 652509832, "step": 14920, "train_runtime": 115422.4071, "train_tokens_per_second": 5653.234 }, { "epoch": 1.004915162941018, "grad_norm": 0.7045131043182794, "learning_rate": 4.961925584940559e-06, "loss": 0.3344886779785156, "num_input_tokens_seen": 652737176, "step": 14925, "train_runtime": 115469.7957, "train_tokens_per_second": 5652.882 }, { "epoch": 1.0052518179369783, "grad_norm": 0.7769156856429779, "learning_rate": 4.959281584893799e-06, "loss": 0.28301913738250734, "num_input_tokens_seen": 652949264, "step": 14930, "train_runtime": 115507.9351, "train_tokens_per_second": 5652.852 }, { "epoch": 1.0055884729329383, "grad_norm": 0.7698614993301071, "learning_rate": 4.956637596233814e-06, "loss": 0.3222982883453369, "num_input_tokens_seen": 653149432, "step": 14935, "train_runtime": 115542.574, "train_tokens_per_second": 5652.89 }, { "epoch": 1.0059251279288985, "grad_norm": 0.7927923790873723, "learning_rate": 4.953993619699986e-06, "loss": 0.29294121265411377, "num_input_tokens_seen": 653371256, "step": 14940, "train_runtime": 115587.1554, "train_tokens_per_second": 5652.629 }, { "epoch": 1.0062617829248586, "grad_norm": 0.7524347822729336, "learning_rate": 4.951349656031698e-06, "loss": 0.30971436500549315, "num_input_tokens_seen": 653582728, "step": 14945, "train_runtime": 115628.4503, "train_tokens_per_second": 5652.439 }, { "epoch": 1.0065984379208188, "grad_norm": 0.7572597064872421, "learning_rate": 4.948705705968322e-06, "loss": 0.3157053470611572, "num_input_tokens_seen": 653808728, "step": 14950, "train_runtime": 115667.4033, "train_tokens_per_second": 5652.489 }, { "epoch": 1.0069350929167789, "grad_norm": 0.7025308350419313, "learning_rate": 4.946061770249233e-06, "loss": 0.31903715133666993, "num_input_tokens_seen": 654028536, "step": 14955, "train_runtime": 115709.3504, "train_tokens_per_second": 5652.34 }, { "epoch": 1.007271747912739, "grad_norm": 0.746389149349819, "learning_rate": 4.9434178496137955e-06, "loss": 0.3309792518615723, "num_input_tokens_seen": 654245296, "step": 14960, "train_runtime": 115746.6069, "train_tokens_per_second": 5652.393 }, { "epoch": 1.0076084029086991, "grad_norm": 0.6143946299920816, "learning_rate": 4.940773944801378e-06, "loss": 0.31335494518280027, "num_input_tokens_seen": 654464232, "step": 14965, "train_runtime": 115779.8261, "train_tokens_per_second": 5652.662 }, { "epoch": 1.0079450579046594, "grad_norm": 0.8846423078456821, "learning_rate": 4.938130056551337e-06, "loss": 0.3319870948791504, "num_input_tokens_seen": 654675824, "step": 14970, "train_runtime": 115819.5601, "train_tokens_per_second": 5652.55 }, { "epoch": 1.0082817129006194, "grad_norm": 0.7105076447650682, "learning_rate": 4.9354861856030305e-06, "loss": 0.3344868183135986, "num_input_tokens_seen": 654897216, "step": 14975, "train_runtime": 115859.9373, "train_tokens_per_second": 5652.491 }, { "epoch": 1.0086183678965797, "grad_norm": 0.7528024963191167, "learning_rate": 4.932842332695803e-06, "loss": 0.28916707038879397, "num_input_tokens_seen": 655099488, "step": 14980, "train_runtime": 115894.1166, "train_tokens_per_second": 5652.569 }, { "epoch": 1.0089550228925397, "grad_norm": 0.6760065554104225, "learning_rate": 4.9301984985690055e-06, "loss": 0.31049747467041017, "num_input_tokens_seen": 655334416, "step": 14985, "train_runtime": 115935.8108, "train_tokens_per_second": 5652.562 }, { "epoch": 1.0092916778885, "grad_norm": 0.8434100907552518, "learning_rate": 4.927554683961974e-06, "loss": 0.3354443073272705, "num_input_tokens_seen": 655543112, "step": 14990, "train_runtime": 115970.966, "train_tokens_per_second": 5652.649 }, { "epoch": 1.00962833288446, "grad_norm": 0.7283088356363585, "learning_rate": 4.924910889614046e-06, "loss": 0.3087354898452759, "num_input_tokens_seen": 655763808, "step": 14995, "train_runtime": 116009.5582, "train_tokens_per_second": 5652.671 }, { "epoch": 1.0099649878804202, "grad_norm": 0.7618425432790579, "learning_rate": 4.922267116264546e-06, "loss": 0.33311076164245607, "num_input_tokens_seen": 655973824, "step": 15000, "train_runtime": 116046.9467, "train_tokens_per_second": 5652.659 }, { "epoch": 1.0103016428763802, "grad_norm": 0.8482961991460483, "learning_rate": 4.919623364652801e-06, "loss": 0.3059119462966919, "num_input_tokens_seen": 656189544, "step": 15005, "train_runtime": 116087.885, "train_tokens_per_second": 5652.524 }, { "epoch": 1.0106382978723405, "grad_norm": 0.7996774528917011, "learning_rate": 4.916979635518124e-06, "loss": 0.31961765289306643, "num_input_tokens_seen": 656393600, "step": 15010, "train_runtime": 116127.8068, "train_tokens_per_second": 5652.338 }, { "epoch": 1.0109749528683005, "grad_norm": 0.7485929128993108, "learning_rate": 4.914335929599828e-06, "loss": 0.3200997829437256, "num_input_tokens_seen": 656618032, "step": 15015, "train_runtime": 116165.2315, "train_tokens_per_second": 5652.449 }, { "epoch": 1.0113116078642608, "grad_norm": 0.8695129879078439, "learning_rate": 4.9116922476372155e-06, "loss": 0.32773504257202146, "num_input_tokens_seen": 656838496, "step": 15020, "train_runtime": 116207.5873, "train_tokens_per_second": 5652.286 }, { "epoch": 1.0116482628602208, "grad_norm": 0.8589619543857242, "learning_rate": 4.909048590369586e-06, "loss": 0.31574647426605223, "num_input_tokens_seen": 657057672, "step": 15025, "train_runtime": 116240.7138, "train_tokens_per_second": 5652.561 }, { "epoch": 1.011984917856181, "grad_norm": 0.7207841320471391, "learning_rate": 4.906404958536227e-06, "loss": 0.3148768901824951, "num_input_tokens_seen": 657282040, "step": 15030, "train_runtime": 116286.0079, "train_tokens_per_second": 5652.288 }, { "epoch": 1.012321572852141, "grad_norm": 0.7575770351222048, "learning_rate": 4.903761352876422e-06, "loss": 0.31647629737854005, "num_input_tokens_seen": 657477448, "step": 15035, "train_runtime": 116329.5257, "train_tokens_per_second": 5651.854 }, { "epoch": 1.0126582278481013, "grad_norm": 0.8492818928373452, "learning_rate": 4.9011177741294485e-06, "loss": 0.3354557275772095, "num_input_tokens_seen": 657686648, "step": 15040, "train_runtime": 116368.5371, "train_tokens_per_second": 5651.757 }, { "epoch": 1.0129948828440614, "grad_norm": 0.6899675763130493, "learning_rate": 4.898474223034576e-06, "loss": 0.3180086612701416, "num_input_tokens_seen": 657917808, "step": 15045, "train_runtime": 116410.5268, "train_tokens_per_second": 5651.704 }, { "epoch": 1.0133315378400216, "grad_norm": 0.7682260059994229, "learning_rate": 4.895830700331061e-06, "loss": 0.31407153606414795, "num_input_tokens_seen": 658124800, "step": 15050, "train_runtime": 116451.6904, "train_tokens_per_second": 5651.483 }, { "epoch": 1.0136681928359816, "grad_norm": 0.7119767891756066, "learning_rate": 4.893187206758158e-06, "loss": 0.3087860822677612, "num_input_tokens_seen": 658352392, "step": 15055, "train_runtime": 116484.7713, "train_tokens_per_second": 5651.832 }, { "epoch": 1.014004847831942, "grad_norm": 0.7727900894930202, "learning_rate": 4.890543743055115e-06, "loss": 0.3047621250152588, "num_input_tokens_seen": 658570240, "step": 15060, "train_runtime": 116523.7373, "train_tokens_per_second": 5651.812 }, { "epoch": 1.014341502827902, "grad_norm": 0.7153606277605876, "learning_rate": 4.887900309961163e-06, "loss": 0.310034441947937, "num_input_tokens_seen": 658791472, "step": 15065, "train_runtime": 116562.1854, "train_tokens_per_second": 5651.846 }, { "epoch": 1.0146781578238622, "grad_norm": 0.7071012991080629, "learning_rate": 4.885256908215532e-06, "loss": 0.32690412998199464, "num_input_tokens_seen": 659014128, "step": 15070, "train_runtime": 116590.8598, "train_tokens_per_second": 5652.365 }, { "epoch": 1.0150148128198222, "grad_norm": 0.7712968829018512, "learning_rate": 4.88261353855744e-06, "loss": 0.3006293296813965, "num_input_tokens_seen": 659239712, "step": 15075, "train_runtime": 116632.4209, "train_tokens_per_second": 5652.285 }, { "epoch": 1.0153514678157824, "grad_norm": 0.6949970194408363, "learning_rate": 4.8799702017261e-06, "loss": 0.28703746795654295, "num_input_tokens_seen": 659455440, "step": 15080, "train_runtime": 116668.3446, "train_tokens_per_second": 5652.394 }, { "epoch": 1.0156881228117425, "grad_norm": 0.7902536702292094, "learning_rate": 4.877326898460709e-06, "loss": 0.31946167945861814, "num_input_tokens_seen": 659666248, "step": 15085, "train_runtime": 116710.1355, "train_tokens_per_second": 5652.176 }, { "epoch": 1.0160247778077027, "grad_norm": 0.705619839622007, "learning_rate": 4.87468362950046e-06, "loss": 0.28933143615722656, "num_input_tokens_seen": 659891120, "step": 15090, "train_runtime": 116756.1991, "train_tokens_per_second": 5651.872 }, { "epoch": 1.0163614328036628, "grad_norm": 0.7513443644619009, "learning_rate": 4.872040395584533e-06, "loss": 0.3063974380493164, "num_input_tokens_seen": 660099960, "step": 15095, "train_runtime": 116792.0331, "train_tokens_per_second": 5651.926 }, { "epoch": 1.016698087799623, "grad_norm": 0.7643641805946824, "learning_rate": 4.869397197452104e-06, "loss": 0.2840407848358154, "num_input_tokens_seen": 660319352, "step": 15100, "train_runtime": 116827.7471, "train_tokens_per_second": 5652.076 }, { "epoch": 1.017034742795583, "grad_norm": 0.8009081378183989, "learning_rate": 4.866754035842329e-06, "loss": 0.3019397258758545, "num_input_tokens_seen": 660540440, "step": 15105, "train_runtime": 116864.8835, "train_tokens_per_second": 5652.172 }, { "epoch": 1.0173713977915433, "grad_norm": 0.7774094479500263, "learning_rate": 4.8641109114943666e-06, "loss": 0.30378923416137693, "num_input_tokens_seen": 660755584, "step": 15110, "train_runtime": 116900.7001, "train_tokens_per_second": 5652.281 }, { "epoch": 1.0177080527875033, "grad_norm": 0.6851052748232287, "learning_rate": 4.861467825147352e-06, "loss": 0.3153241157531738, "num_input_tokens_seen": 660976736, "step": 15115, "train_runtime": 116933.8046, "train_tokens_per_second": 5652.572 }, { "epoch": 1.0180447077834636, "grad_norm": 0.7308126890818304, "learning_rate": 4.858824777540419e-06, "loss": 0.3002683401107788, "num_input_tokens_seen": 661194120, "step": 15120, "train_runtime": 116976.4465, "train_tokens_per_second": 5652.37 }, { "epoch": 1.0183813627794236, "grad_norm": 0.7320711876294524, "learning_rate": 4.856181769412686e-06, "loss": 0.3039540767669678, "num_input_tokens_seen": 661406256, "step": 15125, "train_runtime": 117021.2899, "train_tokens_per_second": 5652.016 }, { "epoch": 1.0187180177753838, "grad_norm": 0.8338813052362888, "learning_rate": 4.8535388015032644e-06, "loss": 0.30543341636657717, "num_input_tokens_seen": 661615064, "step": 15130, "train_runtime": 117059.1584, "train_tokens_per_second": 5651.972 }, { "epoch": 1.0190546727713439, "grad_norm": 0.6951071164752909, "learning_rate": 4.850895874551248e-06, "loss": 0.32107832431793215, "num_input_tokens_seen": 661843768, "step": 15135, "train_runtime": 117098.7017, "train_tokens_per_second": 5652.016 }, { "epoch": 1.0193913277673041, "grad_norm": 0.6999606429191154, "learning_rate": 4.848252989295726e-06, "loss": 0.3267232894897461, "num_input_tokens_seen": 662043496, "step": 15140, "train_runtime": 117135.0098, "train_tokens_per_second": 5651.969 }, { "epoch": 1.0197279827632642, "grad_norm": 0.7298299606738377, "learning_rate": 4.845610146475771e-06, "loss": 0.2995804786682129, "num_input_tokens_seen": 662264176, "step": 15145, "train_runtime": 117169.4311, "train_tokens_per_second": 5652.192 }, { "epoch": 1.0200646377592244, "grad_norm": 0.7687173415714617, "learning_rate": 4.842967346830447e-06, "loss": 0.2979107141494751, "num_input_tokens_seen": 662484464, "step": 15150, "train_runtime": 117205.462, "train_tokens_per_second": 5652.334 }, { "epoch": 1.0204012927551844, "grad_norm": 0.8483763855881413, "learning_rate": 4.840324591098803e-06, "loss": 0.3103074073791504, "num_input_tokens_seen": 662691688, "step": 15155, "train_runtime": 117245.4475, "train_tokens_per_second": 5652.174 }, { "epoch": 1.0207379477511447, "grad_norm": 0.8319667788025759, "learning_rate": 4.83768188001988e-06, "loss": 0.3106090068817139, "num_input_tokens_seen": 662895200, "step": 15160, "train_runtime": 117290.7287, "train_tokens_per_second": 5651.727 }, { "epoch": 1.0210746027471047, "grad_norm": 0.7991516150174239, "learning_rate": 4.835039214332699e-06, "loss": 0.30320937633514405, "num_input_tokens_seen": 663097200, "step": 15165, "train_runtime": 117331.5062, "train_tokens_per_second": 5651.485 }, { "epoch": 1.021411257743065, "grad_norm": 0.7494866477414706, "learning_rate": 4.832396594776277e-06, "loss": 0.3088703155517578, "num_input_tokens_seen": 663319712, "step": 15170, "train_runtime": 117375.1688, "train_tokens_per_second": 5651.278 }, { "epoch": 1.021747912739025, "grad_norm": 0.7704595139249664, "learning_rate": 4.82975402208961e-06, "loss": 0.2921560764312744, "num_input_tokens_seen": 663537384, "step": 15175, "train_runtime": 117413.8519, "train_tokens_per_second": 5651.27 }, { "epoch": 1.0220845677349852, "grad_norm": 0.7282417186604674, "learning_rate": 4.827111497011692e-06, "loss": 0.284089994430542, "num_input_tokens_seen": 663777040, "step": 15180, "train_runtime": 117452.9484, "train_tokens_per_second": 5651.429 }, { "epoch": 1.0224212227309453, "grad_norm": 0.9566982948749372, "learning_rate": 4.82446902028149e-06, "loss": 0.3103042125701904, "num_input_tokens_seen": 663998952, "step": 15185, "train_runtime": 117490.5025, "train_tokens_per_second": 5651.512 }, { "epoch": 1.0227578777269055, "grad_norm": 0.8002891674482239, "learning_rate": 4.821826592637968e-06, "loss": 0.3256609201431274, "num_input_tokens_seen": 664216976, "step": 15190, "train_runtime": 117525.3723, "train_tokens_per_second": 5651.69 }, { "epoch": 1.0230945327228655, "grad_norm": 0.6734170041621031, "learning_rate": 4.8191842148200694e-06, "loss": 0.30333666801452636, "num_input_tokens_seen": 664447704, "step": 15195, "train_runtime": 117563.4341, "train_tokens_per_second": 5651.823 }, { "epoch": 1.0234311877188258, "grad_norm": 0.7333137152011099, "learning_rate": 4.8165418875667315e-06, "loss": 0.3009442090988159, "num_input_tokens_seen": 664678616, "step": 15200, "train_runtime": 117609.1613, "train_tokens_per_second": 5651.589 }, { "epoch": 1.0237678427147858, "grad_norm": 0.7015384084375479, "learning_rate": 4.813899611616867e-06, "loss": 0.3210268020629883, "num_input_tokens_seen": 664897488, "step": 15205, "train_runtime": 117645.0557, "train_tokens_per_second": 5651.725 }, { "epoch": 1.024104497710746, "grad_norm": 1.4380458993791456, "learning_rate": 4.8112573877093855e-06, "loss": 0.3092465400695801, "num_input_tokens_seen": 665131288, "step": 15210, "train_runtime": 117686.9545, "train_tokens_per_second": 5651.699 }, { "epoch": 1.024441152706706, "grad_norm": 0.7003471237764793, "learning_rate": 4.808615216583171e-06, "loss": 0.3192662000656128, "num_input_tokens_seen": 665344872, "step": 15215, "train_runtime": 117720.8851, "train_tokens_per_second": 5651.885 }, { "epoch": 1.0247778077026664, "grad_norm": 0.8436628825159369, "learning_rate": 4.805973098977102e-06, "loss": 0.32068495750427245, "num_input_tokens_seen": 665556568, "step": 15220, "train_runtime": 117755.2974, "train_tokens_per_second": 5652.031 }, { "epoch": 1.0251144626986264, "grad_norm": 0.7109267791884789, "learning_rate": 4.803331035630037e-06, "loss": 0.32355175018310545, "num_input_tokens_seen": 665786432, "step": 15225, "train_runtime": 117788.2016, "train_tokens_per_second": 5652.403 }, { "epoch": 1.0254511176945866, "grad_norm": 0.6877005988993926, "learning_rate": 4.800689027280822e-06, "loss": 0.29448685646057127, "num_input_tokens_seen": 666001856, "step": 15230, "train_runtime": 117828.4813, "train_tokens_per_second": 5652.299 }, { "epoch": 1.0257877726905467, "grad_norm": 0.7724290603372872, "learning_rate": 4.798047074668283e-06, "loss": 0.2994450330734253, "num_input_tokens_seen": 666220128, "step": 15235, "train_runtime": 117866.0261, "train_tokens_per_second": 5652.351 }, { "epoch": 1.026124427686507, "grad_norm": 0.6832618434512723, "learning_rate": 4.795405178531236e-06, "loss": 0.29120640754699706, "num_input_tokens_seen": 666430824, "step": 15240, "train_runtime": 117899.98, "train_tokens_per_second": 5652.51 }, { "epoch": 1.026461082682467, "grad_norm": 0.7900874797047402, "learning_rate": 4.792763339608478e-06, "loss": 0.31427597999572754, "num_input_tokens_seen": 666637408, "step": 15245, "train_runtime": 117941.2447, "train_tokens_per_second": 5652.284 }, { "epoch": 1.0267977376784272, "grad_norm": 0.830479588475876, "learning_rate": 4.790121558638793e-06, "loss": 0.2697123050689697, "num_input_tokens_seen": 666856712, "step": 15250, "train_runtime": 117983.2012, "train_tokens_per_second": 5652.133 }, { "epoch": 1.0271343926743872, "grad_norm": 0.702781552620645, "learning_rate": 4.787479836360944e-06, "loss": 0.33616783618927004, "num_input_tokens_seen": 667072880, "step": 15255, "train_runtime": 118015.753, "train_tokens_per_second": 5652.405 }, { "epoch": 1.0274710476703475, "grad_norm": 0.752937484002602, "learning_rate": 4.784838173513682e-06, "loss": 0.308072566986084, "num_input_tokens_seen": 667290960, "step": 15260, "train_runtime": 118055.7427, "train_tokens_per_second": 5652.338 }, { "epoch": 1.0278077026663075, "grad_norm": 0.8169678756972052, "learning_rate": 4.782196570835737e-06, "loss": 0.3036174297332764, "num_input_tokens_seen": 667517912, "step": 15265, "train_runtime": 118092.0571, "train_tokens_per_second": 5652.522 }, { "epoch": 1.0281443576622677, "grad_norm": 0.8398308050050739, "learning_rate": 4.779555029065827e-06, "loss": 0.29191629886627196, "num_input_tokens_seen": 667717400, "step": 15270, "train_runtime": 118131.9033, "train_tokens_per_second": 5652.304 }, { "epoch": 1.0284810126582278, "grad_norm": 0.7571501727231587, "learning_rate": 4.776913548942649e-06, "loss": 0.31882758140563966, "num_input_tokens_seen": 667943704, "step": 15275, "train_runtime": 118171.6607, "train_tokens_per_second": 5652.317 }, { "epoch": 1.028817667654188, "grad_norm": 0.7323168837010766, "learning_rate": 4.774272131204889e-06, "loss": 0.31909172534942626, "num_input_tokens_seen": 668171240, "step": 15280, "train_runtime": 118214.9165, "train_tokens_per_second": 5652.174 }, { "epoch": 1.029154322650148, "grad_norm": 0.8168602912557673, "learning_rate": 4.7716307765912045e-06, "loss": 0.3175906419754028, "num_input_tokens_seen": 668389056, "step": 15285, "train_runtime": 118259.4761, "train_tokens_per_second": 5651.886 }, { "epoch": 1.0294909776461083, "grad_norm": 0.686585468117989, "learning_rate": 4.768989485840246e-06, "loss": 0.3248094081878662, "num_input_tokens_seen": 668619360, "step": 15290, "train_runtime": 118295.1221, "train_tokens_per_second": 5652.13 }, { "epoch": 1.0298276326420683, "grad_norm": 0.7842217672393594, "learning_rate": 4.766348259690641e-06, "loss": 0.2917296886444092, "num_input_tokens_seen": 668845224, "step": 15295, "train_runtime": 118327.5434, "train_tokens_per_second": 5652.49 }, { "epoch": 1.0301642876380286, "grad_norm": 0.8697416761883611, "learning_rate": 4.763707098881002e-06, "loss": 0.3045883893966675, "num_input_tokens_seen": 669059584, "step": 15300, "train_runtime": 118366.6141, "train_tokens_per_second": 5652.435 }, { "epoch": 1.0305009426339886, "grad_norm": 0.8048541483957821, "learning_rate": 4.761066004149917e-06, "loss": 0.3286751270294189, "num_input_tokens_seen": 669264992, "step": 15305, "train_runtime": 118405.4204, "train_tokens_per_second": 5652.317 }, { "epoch": 1.0308375976299489, "grad_norm": 0.7590289473967594, "learning_rate": 4.758424976235964e-06, "loss": 0.3184011936187744, "num_input_tokens_seen": 669485880, "step": 15310, "train_runtime": 118445.1028, "train_tokens_per_second": 5652.288 }, { "epoch": 1.031174252625909, "grad_norm": 0.8012934218342038, "learning_rate": 4.755784015877694e-06, "loss": 0.33234100341796874, "num_input_tokens_seen": 669718792, "step": 15315, "train_runtime": 118479.6014, "train_tokens_per_second": 5652.608 }, { "epoch": 1.0315109076218691, "grad_norm": 0.7664598006252185, "learning_rate": 4.753143123813646e-06, "loss": 0.3180215358734131, "num_input_tokens_seen": 669934720, "step": 15320, "train_runtime": 118516.7599, "train_tokens_per_second": 5652.658 }, { "epoch": 1.0318475626178292, "grad_norm": 0.7487344131067605, "learning_rate": 4.7505023007823365e-06, "loss": 0.3165398597717285, "num_input_tokens_seen": 670156656, "step": 15325, "train_runtime": 118558.1181, "train_tokens_per_second": 5652.558 }, { "epoch": 1.0321842176137894, "grad_norm": 0.6711552412916334, "learning_rate": 4.747861547522264e-06, "loss": 0.28763623237609864, "num_input_tokens_seen": 670377432, "step": 15330, "train_runtime": 118592.5418, "train_tokens_per_second": 5652.779 }, { "epoch": 1.0325208726097495, "grad_norm": 0.7093961443291146, "learning_rate": 4.745220864771904e-06, "loss": 0.29185004234313966, "num_input_tokens_seen": 670582320, "step": 15335, "train_runtime": 118635.1864, "train_tokens_per_second": 5652.474 }, { "epoch": 1.0328575276057097, "grad_norm": 0.685756160543914, "learning_rate": 4.742580253269718e-06, "loss": 0.31283178329467776, "num_input_tokens_seen": 670787368, "step": 15340, "train_runtime": 118672.7657, "train_tokens_per_second": 5652.412 }, { "epoch": 1.0331941826016697, "grad_norm": 0.8426009554601754, "learning_rate": 4.739939713754141e-06, "loss": 0.28745934963226316, "num_input_tokens_seen": 670998288, "step": 15345, "train_runtime": 118718.3964, "train_tokens_per_second": 5652.016 }, { "epoch": 1.03353083759763, "grad_norm": 0.7932262204171826, "learning_rate": 4.737299246963597e-06, "loss": 0.3006887912750244, "num_input_tokens_seen": 671207256, "step": 15350, "train_runtime": 118756.3685, "train_tokens_per_second": 5651.969 }, { "epoch": 1.03386749259359, "grad_norm": 0.6568880971934117, "learning_rate": 4.734658853636479e-06, "loss": 0.3070893526077271, "num_input_tokens_seen": 671429312, "step": 15355, "train_runtime": 118793.5087, "train_tokens_per_second": 5652.071 }, { "epoch": 1.0342041475895503, "grad_norm": 0.8138534659581989, "learning_rate": 4.732018534511167e-06, "loss": 0.3325775146484375, "num_input_tokens_seen": 671648736, "step": 15360, "train_runtime": 118828.7625, "train_tokens_per_second": 5652.24 }, { "epoch": 1.0345408025855103, "grad_norm": 1.1941290710370875, "learning_rate": 4.729378290326017e-06, "loss": 0.2876759052276611, "num_input_tokens_seen": 671854064, "step": 15365, "train_runtime": 118861.8808, "train_tokens_per_second": 5652.393 }, { "epoch": 1.0348774575814705, "grad_norm": 0.6797186656709692, "learning_rate": 4.726738121819365e-06, "loss": 0.3200536727905273, "num_input_tokens_seen": 672072384, "step": 15370, "train_runtime": 118895.929, "train_tokens_per_second": 5652.611 }, { "epoch": 1.0352141125774306, "grad_norm": 0.8461920537238418, "learning_rate": 4.7240980297295255e-06, "loss": 0.2775277137756348, "num_input_tokens_seen": 672283880, "step": 15375, "train_runtime": 118932.7251, "train_tokens_per_second": 5652.64 }, { "epoch": 1.0355507675733908, "grad_norm": 0.6169331576620465, "learning_rate": 4.721458014794795e-06, "loss": 0.30312108993530273, "num_input_tokens_seen": 672508584, "step": 15380, "train_runtime": 118965.3642, "train_tokens_per_second": 5652.978 }, { "epoch": 1.0358874225693508, "grad_norm": 0.830035914264151, "learning_rate": 4.718818077753439e-06, "loss": 0.32550725936889646, "num_input_tokens_seen": 672737840, "step": 15385, "train_runtime": 119001.6804, "train_tokens_per_second": 5653.179 }, { "epoch": 1.036224077565311, "grad_norm": 0.7363851453554499, "learning_rate": 4.716178219343712e-06, "loss": 0.310680890083313, "num_input_tokens_seen": 672951456, "step": 15390, "train_runtime": 119037.6094, "train_tokens_per_second": 5653.268 }, { "epoch": 1.0365607325612711, "grad_norm": 0.9510291073057959, "learning_rate": 4.713538440303841e-06, "loss": 0.3095111846923828, "num_input_tokens_seen": 673143664, "step": 15395, "train_runtime": 119069.9192, "train_tokens_per_second": 5653.348 }, { "epoch": 1.0368973875572314, "grad_norm": 0.7829230030914317, "learning_rate": 4.7108987413720335e-06, "loss": 0.3282665491104126, "num_input_tokens_seen": 673355776, "step": 15400, "train_runtime": 119108.1422, "train_tokens_per_second": 5653.314 }, { "epoch": 1.0372340425531914, "grad_norm": 0.9090900544664394, "learning_rate": 4.708259123286469e-06, "loss": 0.31505331993103025, "num_input_tokens_seen": 673568088, "step": 15405, "train_runtime": 119152.501, "train_tokens_per_second": 5652.992 }, { "epoch": 1.0375706975491517, "grad_norm": 0.7723625134036335, "learning_rate": 4.7056195867853105e-06, "loss": 0.30636959075927733, "num_input_tokens_seen": 673795064, "step": 15410, "train_runtime": 119195.1556, "train_tokens_per_second": 5652.873 }, { "epoch": 1.0379073525451117, "grad_norm": 0.7552569039187913, "learning_rate": 4.702980132606696e-06, "loss": 0.2860846996307373, "num_input_tokens_seen": 674021712, "step": 15415, "train_runtime": 119229.7446, "train_tokens_per_second": 5653.134 }, { "epoch": 1.038244007541072, "grad_norm": 0.7757156949433505, "learning_rate": 4.700340761488741e-06, "loss": 0.297334623336792, "num_input_tokens_seen": 674242240, "step": 15420, "train_runtime": 119259.447, "train_tokens_per_second": 5653.575 }, { "epoch": 1.038580662537032, "grad_norm": 0.845930651529408, "learning_rate": 4.6977014741695345e-06, "loss": 0.3014695167541504, "num_input_tokens_seen": 674464624, "step": 15425, "train_runtime": 119301.6217, "train_tokens_per_second": 5653.441 }, { "epoch": 1.0389173175329922, "grad_norm": 0.6863209085436818, "learning_rate": 4.69506227138715e-06, "loss": 0.31081855297088623, "num_input_tokens_seen": 674697456, "step": 15430, "train_runtime": 119344.807, "train_tokens_per_second": 5653.346 }, { "epoch": 1.0392539725289522, "grad_norm": 0.8027138711324319, "learning_rate": 4.6924231538796265e-06, "loss": 0.3378600120544434, "num_input_tokens_seen": 674921088, "step": 15435, "train_runtime": 119379.2034, "train_tokens_per_second": 5653.59 }, { "epoch": 1.0395906275249125, "grad_norm": 0.7714672936432438, "learning_rate": 4.6897841223849885e-06, "loss": 0.3055275917053223, "num_input_tokens_seen": 675136400, "step": 15440, "train_runtime": 119423.2981, "train_tokens_per_second": 5653.306 }, { "epoch": 1.0399272825208725, "grad_norm": 0.7820475842478094, "learning_rate": 4.68714517764123e-06, "loss": 0.2911995887756348, "num_input_tokens_seen": 675354608, "step": 15445, "train_runtime": 119463.4783, "train_tokens_per_second": 5653.231 }, { "epoch": 1.0402639375168328, "grad_norm": 0.6960997029967657, "learning_rate": 4.684506320386327e-06, "loss": 0.2882180690765381, "num_input_tokens_seen": 675560352, "step": 15450, "train_runtime": 119502.7651, "train_tokens_per_second": 5653.094 }, { "epoch": 1.0406005925127928, "grad_norm": 0.7240646804471922, "learning_rate": 4.6818675513582235e-06, "loss": 0.2950881481170654, "num_input_tokens_seen": 675780176, "step": 15455, "train_runtime": 119549.6104, "train_tokens_per_second": 5652.718 }, { "epoch": 1.040937247508753, "grad_norm": 0.7871482559840214, "learning_rate": 4.679228871294846e-06, "loss": 0.2878568649291992, "num_input_tokens_seen": 676001504, "step": 15460, "train_runtime": 119590.0384, "train_tokens_per_second": 5652.657 }, { "epoch": 1.041273902504713, "grad_norm": 0.7023040971791071, "learning_rate": 4.67659028093409e-06, "loss": 0.31134207248687745, "num_input_tokens_seen": 676224760, "step": 15465, "train_runtime": 119626.8329, "train_tokens_per_second": 5652.785 }, { "epoch": 1.0416105575006733, "grad_norm": 0.7287009704666462, "learning_rate": 4.673951781013834e-06, "loss": 0.3257226228713989, "num_input_tokens_seen": 676437448, "step": 15470, "train_runtime": 119663.8355, "train_tokens_per_second": 5652.814 }, { "epoch": 1.0419472124966334, "grad_norm": 0.694252013991942, "learning_rate": 4.67131337227192e-06, "loss": 0.32440500259399413, "num_input_tokens_seen": 676661152, "step": 15475, "train_runtime": 119696.4836, "train_tokens_per_second": 5653.141 }, { "epoch": 1.0422838674925936, "grad_norm": 0.742357464257659, "learning_rate": 4.668675055446175e-06, "loss": 0.3229750394821167, "num_input_tokens_seen": 676878032, "step": 15480, "train_runtime": 119731.4831, "train_tokens_per_second": 5653.3 }, { "epoch": 1.0426205224885536, "grad_norm": 0.8706983479448045, "learning_rate": 4.666036831274392e-06, "loss": 0.27671065330505373, "num_input_tokens_seen": 677092008, "step": 15485, "train_runtime": 119767.1182, "train_tokens_per_second": 5653.405 }, { "epoch": 1.0429571774845139, "grad_norm": 0.7127829768191473, "learning_rate": 4.663398700494346e-06, "loss": 0.30718288421630857, "num_input_tokens_seen": 677302040, "step": 15490, "train_runtime": 119808.142, "train_tokens_per_second": 5653.222 }, { "epoch": 1.043293832480474, "grad_norm": 0.7433197799578122, "learning_rate": 4.66076066384378e-06, "loss": 0.3258528232574463, "num_input_tokens_seen": 677525784, "step": 15495, "train_runtime": 119841.1792, "train_tokens_per_second": 5653.531 }, { "epoch": 1.0436304874764342, "grad_norm": 0.6844094807815899, "learning_rate": 4.658122722060413e-06, "loss": 0.3136504888534546, "num_input_tokens_seen": 677745832, "step": 15500, "train_runtime": 119873.5793, "train_tokens_per_second": 5653.838 }, { "epoch": 1.0439671424723942, "grad_norm": 0.7516388636804747, "learning_rate": 4.655484875881935e-06, "loss": 0.3184205055236816, "num_input_tokens_seen": 677956888, "step": 15505, "train_runtime": 119919.1449, "train_tokens_per_second": 5653.45 }, { "epoch": 1.0443037974683544, "grad_norm": 0.7798917548462908, "learning_rate": 4.652847126046014e-06, "loss": 0.335153865814209, "num_input_tokens_seen": 678150664, "step": 15510, "train_runtime": 119955.6333, "train_tokens_per_second": 5653.346 }, { "epoch": 1.0446404524643145, "grad_norm": 0.7432288033280057, "learning_rate": 4.650209473290286e-06, "loss": 0.33000261783599855, "num_input_tokens_seen": 678377032, "step": 15515, "train_runtime": 119990.1304, "train_tokens_per_second": 5653.607 }, { "epoch": 1.0449771074602747, "grad_norm": 0.7736787887096265, "learning_rate": 4.647571918352366e-06, "loss": 0.31568212509155275, "num_input_tokens_seen": 678595080, "step": 15520, "train_runtime": 120030.7386, "train_tokens_per_second": 5653.511 }, { "epoch": 1.0453137624562348, "grad_norm": 0.8603539995040905, "learning_rate": 4.644934461969833e-06, "loss": 0.305867600440979, "num_input_tokens_seen": 678818928, "step": 15525, "train_runtime": 120078.8018, "train_tokens_per_second": 5653.112 }, { "epoch": 1.045650417452195, "grad_norm": 0.802437774953463, "learning_rate": 4.642297104880247e-06, "loss": 0.2917011260986328, "num_input_tokens_seen": 679044840, "step": 15530, "train_runtime": 120117.9302, "train_tokens_per_second": 5653.151 }, { "epoch": 1.045987072448155, "grad_norm": 0.8097716033620479, "learning_rate": 4.639659847821133e-06, "loss": 0.29921350479125974, "num_input_tokens_seen": 679260504, "step": 15535, "train_runtime": 120155.5327, "train_tokens_per_second": 5653.177 }, { "epoch": 1.0463237274441153, "grad_norm": 0.7081626022799157, "learning_rate": 4.6370226915299945e-06, "loss": 0.2979047060012817, "num_input_tokens_seen": 679478208, "step": 15540, "train_runtime": 120188.8745, "train_tokens_per_second": 5653.42 }, { "epoch": 1.0466603824400753, "grad_norm": 0.6768088643103284, "learning_rate": 4.634385636744302e-06, "loss": 0.3120341539382935, "num_input_tokens_seen": 679708344, "step": 15545, "train_runtime": 120226.4885, "train_tokens_per_second": 5653.566 }, { "epoch": 1.0469970374360356, "grad_norm": 1.008615167669033, "learning_rate": 4.631748684201503e-06, "loss": 0.3280055522918701, "num_input_tokens_seen": 679937752, "step": 15550, "train_runtime": 120267.2677, "train_tokens_per_second": 5653.556 }, { "epoch": 1.0473336924319956, "grad_norm": 0.7693743879402827, "learning_rate": 4.629111834639008e-06, "loss": 0.3046785593032837, "num_input_tokens_seen": 680165064, "step": 15555, "train_runtime": 120305.2426, "train_tokens_per_second": 5653.661 }, { "epoch": 1.0476703474279558, "grad_norm": 0.7036312918875381, "learning_rate": 4.626475088794206e-06, "loss": 0.3018321990966797, "num_input_tokens_seen": 680389272, "step": 15560, "train_runtime": 120342.4244, "train_tokens_per_second": 5653.777 }, { "epoch": 1.0480070024239159, "grad_norm": 0.7427333305833319, "learning_rate": 4.623838447404454e-06, "loss": 0.3129916191101074, "num_input_tokens_seen": 680620144, "step": 15565, "train_runtime": 120385.4131, "train_tokens_per_second": 5653.676 }, { "epoch": 1.0483436574198761, "grad_norm": 0.6803553069904376, "learning_rate": 4.621201911207082e-06, "loss": 0.29700002670288084, "num_input_tokens_seen": 680832464, "step": 15570, "train_runtime": 120420.9855, "train_tokens_per_second": 5653.769 }, { "epoch": 1.0486803124158361, "grad_norm": 0.6877375090372397, "learning_rate": 4.618565480939387e-06, "loss": 0.3175528526306152, "num_input_tokens_seen": 681059856, "step": 15575, "train_runtime": 120454.7328, "train_tokens_per_second": 5654.073 }, { "epoch": 1.0490169674117964, "grad_norm": 0.8334120115163696, "learning_rate": 4.6159291573386395e-06, "loss": 0.3175390958786011, "num_input_tokens_seen": 681279128, "step": 15580, "train_runtime": 120491.4228, "train_tokens_per_second": 5654.171 }, { "epoch": 1.0493536224077564, "grad_norm": 0.7481436859437062, "learning_rate": 4.613292941142077e-06, "loss": 0.30297222137451174, "num_input_tokens_seen": 681498080, "step": 15585, "train_runtime": 120532.1304, "train_tokens_per_second": 5654.078 }, { "epoch": 1.0496902774037167, "grad_norm": 0.7558163128951925, "learning_rate": 4.610656833086912e-06, "loss": 0.31702475547790526, "num_input_tokens_seen": 681707736, "step": 15590, "train_runtime": 120571.1677, "train_tokens_per_second": 5653.986 }, { "epoch": 1.0500269323996767, "grad_norm": 0.8628106650373581, "learning_rate": 4.60802083391032e-06, "loss": 0.3515254259109497, "num_input_tokens_seen": 681929096, "step": 15595, "train_runtime": 120607.6322, "train_tokens_per_second": 5654.112 }, { "epoch": 1.050363587395637, "grad_norm": 0.8187294344342202, "learning_rate": 4.605384944349454e-06, "loss": 0.29188697338104247, "num_input_tokens_seen": 682138848, "step": 15600, "train_runtime": 120643.9645, "train_tokens_per_second": 5654.148 }, { "epoch": 1.050700242391597, "grad_norm": 0.762024230166568, "learning_rate": 4.602749165141429e-06, "loss": 0.2967026948928833, "num_input_tokens_seen": 682341504, "step": 15605, "train_runtime": 120680.7614, "train_tokens_per_second": 5654.103 }, { "epoch": 1.0510368973875572, "grad_norm": 0.770669064131956, "learning_rate": 4.600113497023333e-06, "loss": 0.3200972080230713, "num_input_tokens_seen": 682558744, "step": 15610, "train_runtime": 120718.1512, "train_tokens_per_second": 5654.152 }, { "epoch": 1.0513735523835175, "grad_norm": 0.8428983487418248, "learning_rate": 4.597477940732222e-06, "loss": 0.2950571537017822, "num_input_tokens_seen": 682762744, "step": 15615, "train_runtime": 120758.4342, "train_tokens_per_second": 5653.955 }, { "epoch": 1.0517102073794775, "grad_norm": 0.8298281512031902, "learning_rate": 4.594842497005124e-06, "loss": 0.2987983226776123, "num_input_tokens_seen": 682994336, "step": 15620, "train_runtime": 120791.1567, "train_tokens_per_second": 5654.341 }, { "epoch": 1.0520468623754375, "grad_norm": 0.6720517085495755, "learning_rate": 4.5922071665790264e-06, "loss": 0.3123783111572266, "num_input_tokens_seen": 683207456, "step": 15625, "train_runtime": 120830.8588, "train_tokens_per_second": 5654.246 }, { "epoch": 1.0523835173713978, "grad_norm": 0.719767612563415, "learning_rate": 4.589571950190897e-06, "loss": 0.3103508949279785, "num_input_tokens_seen": 683437384, "step": 15630, "train_runtime": 120873.1823, "train_tokens_per_second": 5654.169 }, { "epoch": 1.052720172367358, "grad_norm": 0.7097307825735949, "learning_rate": 4.586936848577661e-06, "loss": 0.3118293285369873, "num_input_tokens_seen": 683657552, "step": 15635, "train_runtime": 120907.5119, "train_tokens_per_second": 5654.384 }, { "epoch": 1.053056827363318, "grad_norm": 0.7044277499214124, "learning_rate": 4.584301862476219e-06, "loss": 0.30995869636535645, "num_input_tokens_seen": 683876008, "step": 15640, "train_runtime": 120944.8259, "train_tokens_per_second": 5654.446 }, { "epoch": 1.053393482359278, "grad_norm": 0.7010017324067445, "learning_rate": 4.581666992623435e-06, "loss": 0.2860646963119507, "num_input_tokens_seen": 684104824, "step": 15645, "train_runtime": 120984.5659, "train_tokens_per_second": 5654.48 }, { "epoch": 1.0537301373552383, "grad_norm": 0.7902236702010951, "learning_rate": 4.579032239756144e-06, "loss": 0.3144806146621704, "num_input_tokens_seen": 684326216, "step": 15650, "train_runtime": 121026.0735, "train_tokens_per_second": 5654.37 }, { "epoch": 1.0540667923511986, "grad_norm": 0.7099398655983817, "learning_rate": 4.576397604611143e-06, "loss": 0.29763078689575195, "num_input_tokens_seen": 684548424, "step": 15655, "train_runtime": 121060.9714, "train_tokens_per_second": 5654.576 }, { "epoch": 1.0544034473471586, "grad_norm": 0.7151110990015658, "learning_rate": 4.573763087925202e-06, "loss": 0.30714902877807615, "num_input_tokens_seen": 684772760, "step": 15660, "train_runtime": 121105.9773, "train_tokens_per_second": 5654.327 }, { "epoch": 1.0547401023431189, "grad_norm": 0.7472326006657539, "learning_rate": 4.571128690435053e-06, "loss": 0.3167744159698486, "num_input_tokens_seen": 684995472, "step": 15665, "train_runtime": 121149.0474, "train_tokens_per_second": 5654.155 }, { "epoch": 1.055076757339079, "grad_norm": 0.8728278378658701, "learning_rate": 4.568494412877401e-06, "loss": 0.31170904636383057, "num_input_tokens_seen": 685198200, "step": 15670, "train_runtime": 121178.4485, "train_tokens_per_second": 5654.456 }, { "epoch": 1.0554134123350392, "grad_norm": 0.7744504434630247, "learning_rate": 4.565860255988908e-06, "loss": 0.31058855056762696, "num_input_tokens_seen": 685420416, "step": 15675, "train_runtime": 121210.5142, "train_tokens_per_second": 5654.793 }, { "epoch": 1.0557500673309992, "grad_norm": 0.7252974178645615, "learning_rate": 4.563226220506212e-06, "loss": 0.31565635204315184, "num_input_tokens_seen": 685659776, "step": 15680, "train_runtime": 121247.6601, "train_tokens_per_second": 5655.035 }, { "epoch": 1.0560867223269594, "grad_norm": 0.6919225790448248, "learning_rate": 4.5605923071659085e-06, "loss": 0.3112238645553589, "num_input_tokens_seen": 685871672, "step": 15685, "train_runtime": 121283.9917, "train_tokens_per_second": 5655.088 }, { "epoch": 1.0564233773229195, "grad_norm": 0.7233596710854652, "learning_rate": 4.557958516704566e-06, "loss": 0.2988229990005493, "num_input_tokens_seen": 686092808, "step": 15690, "train_runtime": 121330.4161, "train_tokens_per_second": 5654.747 }, { "epoch": 1.0567600323188797, "grad_norm": 0.8148391336751524, "learning_rate": 4.5553248498587144e-06, "loss": 0.3125143051147461, "num_input_tokens_seen": 686309592, "step": 15695, "train_runtime": 121360.8019, "train_tokens_per_second": 5655.117 }, { "epoch": 1.0570966873148397, "grad_norm": 0.8471401120479854, "learning_rate": 4.552691307364853e-06, "loss": 0.31246707439422605, "num_input_tokens_seen": 686520592, "step": 15700, "train_runtime": 121401.4752, "train_tokens_per_second": 5654.961 }, { "epoch": 1.0574333423108, "grad_norm": 0.8240701136904154, "learning_rate": 4.5500578899594375e-06, "loss": 0.33534066677093505, "num_input_tokens_seen": 686743480, "step": 15705, "train_runtime": 121443.4876, "train_tokens_per_second": 5654.84 }, { "epoch": 1.05776999730676, "grad_norm": 0.7338513258395319, "learning_rate": 4.5474245983789e-06, "loss": 0.3143591403961182, "num_input_tokens_seen": 686964184, "step": 15710, "train_runtime": 121482.8751, "train_tokens_per_second": 5654.823 }, { "epoch": 1.0581066523027203, "grad_norm": 0.7196154099105955, "learning_rate": 4.54479143335963e-06, "loss": 0.29776525497436523, "num_input_tokens_seen": 687183192, "step": 15715, "train_runtime": 121528.6289, "train_tokens_per_second": 5654.496 }, { "epoch": 1.0584433072986803, "grad_norm": 0.8284203342820305, "learning_rate": 4.5421583956379855e-06, "loss": 0.32465856075286864, "num_input_tokens_seen": 687394088, "step": 15720, "train_runtime": 121563.9668, "train_tokens_per_second": 5654.588 }, { "epoch": 1.0587799622946406, "grad_norm": 0.7128364600635472, "learning_rate": 4.539525485950284e-06, "loss": 0.29742043018341063, "num_input_tokens_seen": 687621296, "step": 15725, "train_runtime": 121603.4696, "train_tokens_per_second": 5654.619 }, { "epoch": 1.0591166172906006, "grad_norm": 0.8468437589127955, "learning_rate": 4.536892705032815e-06, "loss": 0.3188284397125244, "num_input_tokens_seen": 687846312, "step": 15730, "train_runtime": 121637.3598, "train_tokens_per_second": 5654.893 }, { "epoch": 1.0594532722865608, "grad_norm": 0.7689731083753425, "learning_rate": 4.534260053621821e-06, "loss": 0.29900522232055665, "num_input_tokens_seen": 688062864, "step": 15735, "train_runtime": 121671.2264, "train_tokens_per_second": 5655.099 }, { "epoch": 1.0597899272825209, "grad_norm": 0.7661666075190292, "learning_rate": 4.531627532453519e-06, "loss": 0.2740945816040039, "num_input_tokens_seen": 688281760, "step": 15740, "train_runtime": 121719.5434, "train_tokens_per_second": 5654.653 }, { "epoch": 1.0601265822784811, "grad_norm": 0.7197588574824276, "learning_rate": 4.5289951422640826e-06, "loss": 0.3090967655181885, "num_input_tokens_seen": 688482288, "step": 15745, "train_runtime": 121757.3536, "train_tokens_per_second": 5654.544 }, { "epoch": 1.0604632372744411, "grad_norm": 0.7581368758886011, "learning_rate": 4.526362883789655e-06, "loss": 0.29933021068572996, "num_input_tokens_seen": 688706904, "step": 15750, "train_runtime": 121799.5328, "train_tokens_per_second": 5654.43 }, { "epoch": 1.0607998922704014, "grad_norm": 0.7999491894487345, "learning_rate": 4.5237307577663345e-06, "loss": 0.32481019496917723, "num_input_tokens_seen": 688934432, "step": 15755, "train_runtime": 121838.9872, "train_tokens_per_second": 5654.466 }, { "epoch": 1.0611365472663614, "grad_norm": 0.668582256136596, "learning_rate": 4.52109876493019e-06, "loss": 0.3126739501953125, "num_input_tokens_seen": 689154176, "step": 15760, "train_runtime": 121881.6703, "train_tokens_per_second": 5654.289 }, { "epoch": 1.0614732022623217, "grad_norm": 0.7253320849615243, "learning_rate": 4.518466906017249e-06, "loss": 0.3287156343460083, "num_input_tokens_seen": 689365536, "step": 15765, "train_runtime": 121920.7449, "train_tokens_per_second": 5654.21 }, { "epoch": 1.0618098572582817, "grad_norm": 0.9312066051011625, "learning_rate": 4.515835181763503e-06, "loss": 0.29747960567474363, "num_input_tokens_seen": 689584480, "step": 15770, "train_runtime": 121960.8859, "train_tokens_per_second": 5654.145 }, { "epoch": 1.062146512254242, "grad_norm": 0.779107627410124, "learning_rate": 4.513203592904903e-06, "loss": 0.3129979848861694, "num_input_tokens_seen": 689802248, "step": 15775, "train_runtime": 121996.8975, "train_tokens_per_second": 5654.261 }, { "epoch": 1.062483167250202, "grad_norm": 0.7066715035398882, "learning_rate": 4.510572140177368e-06, "loss": 0.3110002040863037, "num_input_tokens_seen": 690027296, "step": 15780, "train_runtime": 122041.4381, "train_tokens_per_second": 5654.041 }, { "epoch": 1.0628198222461622, "grad_norm": 0.7657323857261208, "learning_rate": 4.507940824316771e-06, "loss": 0.31113996505737307, "num_input_tokens_seen": 690244872, "step": 15785, "train_runtime": 122082.9515, "train_tokens_per_second": 5653.901 }, { "epoch": 1.0631564772421223, "grad_norm": 0.778188387346321, "learning_rate": 4.505309646058954e-06, "loss": 0.306329345703125, "num_input_tokens_seen": 690457904, "step": 15790, "train_runtime": 122123.6242, "train_tokens_per_second": 5653.762 }, { "epoch": 1.0634931322380825, "grad_norm": 0.8721432879238993, "learning_rate": 4.502678606139716e-06, "loss": 0.290619421005249, "num_input_tokens_seen": 690669592, "step": 15795, "train_runtime": 122161.8006, "train_tokens_per_second": 5653.728 }, { "epoch": 1.0638297872340425, "grad_norm": 0.6919291628903627, "learning_rate": 4.500047705294823e-06, "loss": 0.28872241973876955, "num_input_tokens_seen": 690892416, "step": 15800, "train_runtime": 122194.5033, "train_tokens_per_second": 5654.038 }, { "epoch": 1.0641664422300028, "grad_norm": 0.7336900413158081, "learning_rate": 4.497416944259993e-06, "loss": 0.3109187364578247, "num_input_tokens_seen": 691111312, "step": 15805, "train_runtime": 122227.6554, "train_tokens_per_second": 5654.296 }, { "epoch": 1.0645030972259628, "grad_norm": 0.766581872834498, "learning_rate": 4.494786323770912e-06, "loss": 0.3253108263015747, "num_input_tokens_seen": 691322056, "step": 15810, "train_runtime": 122271.3236, "train_tokens_per_second": 5654.0 }, { "epoch": 1.064839752221923, "grad_norm": 0.6778315955670481, "learning_rate": 4.492155844563224e-06, "loss": 0.30454020500183104, "num_input_tokens_seen": 691548176, "step": 15815, "train_runtime": 122307.168, "train_tokens_per_second": 5654.192 }, { "epoch": 1.065176407217883, "grad_norm": 0.7604711413614016, "learning_rate": 4.489525507372537e-06, "loss": 0.3255009651184082, "num_input_tokens_seen": 691767320, "step": 15820, "train_runtime": 122349.9913, "train_tokens_per_second": 5654.004 }, { "epoch": 1.0655130622138433, "grad_norm": 0.7292388149896591, "learning_rate": 4.486895312934411e-06, "loss": 0.3073612689971924, "num_input_tokens_seen": 691981536, "step": 15825, "train_runtime": 122391.6825, "train_tokens_per_second": 5653.828 }, { "epoch": 1.0658497172098034, "grad_norm": 0.799787823954383, "learning_rate": 4.484265261984378e-06, "loss": 0.3512305974960327, "num_input_tokens_seen": 692199872, "step": 15830, "train_runtime": 122434.3321, "train_tokens_per_second": 5653.642 }, { "epoch": 1.0661863722057636, "grad_norm": 0.7027476090234593, "learning_rate": 4.4816353552579165e-06, "loss": 0.292151141166687, "num_input_tokens_seen": 692412728, "step": 15835, "train_runtime": 122476.3937, "train_tokens_per_second": 5653.438 }, { "epoch": 1.0665230272017237, "grad_norm": 0.8159747493895196, "learning_rate": 4.479005593490477e-06, "loss": 0.3161210536956787, "num_input_tokens_seen": 692630960, "step": 15840, "train_runtime": 122513.6448, "train_tokens_per_second": 5653.501 }, { "epoch": 1.066859682197684, "grad_norm": 0.7411839574837649, "learning_rate": 4.476375977417461e-06, "loss": 0.28519272804260254, "num_input_tokens_seen": 692854048, "step": 15845, "train_runtime": 122555.3496, "train_tokens_per_second": 5653.397 }, { "epoch": 1.067196337193644, "grad_norm": 0.7780714296454672, "learning_rate": 4.473746507774235e-06, "loss": 0.3064600944519043, "num_input_tokens_seen": 693081408, "step": 15850, "train_runtime": 122591.5693, "train_tokens_per_second": 5653.581 }, { "epoch": 1.0675329921896042, "grad_norm": 0.6762102135441501, "learning_rate": 4.471117185296117e-06, "loss": 0.28726582527160643, "num_input_tokens_seen": 693299008, "step": 15855, "train_runtime": 122633.3438, "train_tokens_per_second": 5653.43 }, { "epoch": 1.0678696471855642, "grad_norm": 0.6740157289152823, "learning_rate": 4.468488010718394e-06, "loss": 0.2859110593795776, "num_input_tokens_seen": 693503552, "step": 15860, "train_runtime": 122669.1306, "train_tokens_per_second": 5653.448 }, { "epoch": 1.0682063021815245, "grad_norm": 0.8206292602575027, "learning_rate": 4.465858984776302e-06, "loss": 0.31541666984558103, "num_input_tokens_seen": 693719200, "step": 15865, "train_runtime": 122705.5825, "train_tokens_per_second": 5653.526 }, { "epoch": 1.0685429571774845, "grad_norm": 0.8178983469469215, "learning_rate": 4.463230108205044e-06, "loss": 0.30719547271728515, "num_input_tokens_seen": 693910832, "step": 15870, "train_runtime": 122745.905, "train_tokens_per_second": 5653.23 }, { "epoch": 1.0688796121734447, "grad_norm": 0.7105445134284586, "learning_rate": 4.460601381739772e-06, "loss": 0.3158994674682617, "num_input_tokens_seen": 694130912, "step": 15875, "train_runtime": 122784.3767, "train_tokens_per_second": 5653.251 }, { "epoch": 1.0692162671694048, "grad_norm": 0.8182490674352466, "learning_rate": 4.457972806115607e-06, "loss": 0.33564248085021975, "num_input_tokens_seen": 694345664, "step": 15880, "train_runtime": 122826.7003, "train_tokens_per_second": 5653.052 }, { "epoch": 1.069552922165365, "grad_norm": 0.6520703883013584, "learning_rate": 4.455344382067616e-06, "loss": 0.31251869201660154, "num_input_tokens_seen": 694563184, "step": 15885, "train_runtime": 122869.8883, "train_tokens_per_second": 5652.835 }, { "epoch": 1.069889577161325, "grad_norm": 0.7437291287192324, "learning_rate": 4.452716110330832e-06, "loss": 0.3079527378082275, "num_input_tokens_seen": 694784912, "step": 15890, "train_runtime": 122904.1033, "train_tokens_per_second": 5653.065 }, { "epoch": 1.0702262321572853, "grad_norm": 0.8863362961200022, "learning_rate": 4.450087991640242e-06, "loss": 0.31774344444274905, "num_input_tokens_seen": 694988912, "step": 15895, "train_runtime": 122939.5922, "train_tokens_per_second": 5653.093 }, { "epoch": 1.0705628871532453, "grad_norm": 0.7816781374609185, "learning_rate": 4.447460026730794e-06, "loss": 0.3184868812561035, "num_input_tokens_seen": 695201352, "step": 15900, "train_runtime": 122980.7158, "train_tokens_per_second": 5652.93 }, { "epoch": 1.0708995421492056, "grad_norm": 0.7651374199427906, "learning_rate": 4.444832216337384e-06, "loss": 0.30800135135650636, "num_input_tokens_seen": 695423576, "step": 15905, "train_runtime": 123019.1946, "train_tokens_per_second": 5652.968 }, { "epoch": 1.0712361971451656, "grad_norm": 0.9298545556387856, "learning_rate": 4.442204561194877e-06, "loss": 0.29862637519836427, "num_input_tokens_seen": 695642552, "step": 15910, "train_runtime": 123054.9881, "train_tokens_per_second": 5653.103 }, { "epoch": 1.0715728521411259, "grad_norm": 0.679838258169619, "learning_rate": 4.439577062038085e-06, "loss": 0.29393310546875, "num_input_tokens_seen": 695878256, "step": 15915, "train_runtime": 123095.8131, "train_tokens_per_second": 5653.143 }, { "epoch": 1.0719095071370859, "grad_norm": 0.7450262188866336, "learning_rate": 4.436949719601782e-06, "loss": 0.3315741062164307, "num_input_tokens_seen": 696096832, "step": 15920, "train_runtime": 123128.696, "train_tokens_per_second": 5653.409 }, { "epoch": 1.0722461621330461, "grad_norm": 0.9095527446118012, "learning_rate": 4.434322534620692e-06, "loss": 0.3238795757293701, "num_input_tokens_seen": 696300144, "step": 15925, "train_runtime": 123165.6915, "train_tokens_per_second": 5653.361 }, { "epoch": 1.0725828171290062, "grad_norm": 0.6843805205148538, "learning_rate": 4.431695507829504e-06, "loss": 0.2765275716781616, "num_input_tokens_seen": 696521264, "step": 15930, "train_runtime": 123205.1311, "train_tokens_per_second": 5653.346 }, { "epoch": 1.0729194721249664, "grad_norm": 0.7473289414033233, "learning_rate": 4.429068639962853e-06, "loss": 0.3107874870300293, "num_input_tokens_seen": 696737432, "step": 15935, "train_runtime": 123245.4597, "train_tokens_per_second": 5653.25 }, { "epoch": 1.0732561271209264, "grad_norm": 0.7774027394469076, "learning_rate": 4.426441931755337e-06, "loss": 0.3024940490722656, "num_input_tokens_seen": 696961616, "step": 15940, "train_runtime": 123286.7421, "train_tokens_per_second": 5653.176 }, { "epoch": 1.0735927821168867, "grad_norm": 0.706587053052343, "learning_rate": 4.4238153839415045e-06, "loss": 0.32619800567626955, "num_input_tokens_seen": 697193784, "step": 15945, "train_runtime": 123322.6979, "train_tokens_per_second": 5653.41 }, { "epoch": 1.0739294371128467, "grad_norm": 0.8216197763150708, "learning_rate": 4.421188997255865e-06, "loss": 0.3372673749923706, "num_input_tokens_seen": 697403080, "step": 15950, "train_runtime": 123358.9718, "train_tokens_per_second": 5653.444 }, { "epoch": 1.074266092108807, "grad_norm": 0.7673913799601232, "learning_rate": 4.418562772432874e-06, "loss": 0.310252046585083, "num_input_tokens_seen": 697621144, "step": 15955, "train_runtime": 123396.4433, "train_tokens_per_second": 5653.495 }, { "epoch": 1.074602747104767, "grad_norm": 0.7842485455879602, "learning_rate": 4.415936710206952e-06, "loss": 0.31459197998046873, "num_input_tokens_seen": 697855736, "step": 15960, "train_runtime": 123434.5672, "train_tokens_per_second": 5653.649 }, { "epoch": 1.0749394021007272, "grad_norm": 0.8604702018619234, "learning_rate": 4.413310811312465e-06, "loss": 0.31325018405914307, "num_input_tokens_seen": 698071128, "step": 15965, "train_runtime": 123468.5762, "train_tokens_per_second": 5653.836 }, { "epoch": 1.0752760570966873, "grad_norm": 0.746270251899186, "learning_rate": 4.41068507648374e-06, "loss": 0.2819394826889038, "num_input_tokens_seen": 698297384, "step": 15970, "train_runtime": 123503.2252, "train_tokens_per_second": 5654.082 }, { "epoch": 1.0756127120926475, "grad_norm": 0.7078829630924763, "learning_rate": 4.408059506455053e-06, "loss": 0.29783015251159667, "num_input_tokens_seen": 698536768, "step": 15975, "train_runtime": 123541.9583, "train_tokens_per_second": 5654.247 }, { "epoch": 1.0759493670886076, "grad_norm": 0.6756334175310369, "learning_rate": 4.40543410196064e-06, "loss": 0.3107433795928955, "num_input_tokens_seen": 698759848, "step": 15980, "train_runtime": 123579.0597, "train_tokens_per_second": 5654.355 }, { "epoch": 1.0762860220845678, "grad_norm": 0.8743925394845493, "learning_rate": 4.402808863734681e-06, "loss": 0.32532343864440916, "num_input_tokens_seen": 698978376, "step": 15985, "train_runtime": 123625.0383, "train_tokens_per_second": 5654.019 }, { "epoch": 1.0766226770805278, "grad_norm": 0.7689380089547567, "learning_rate": 4.40018379251132e-06, "loss": 0.3170433044433594, "num_input_tokens_seen": 699198368, "step": 15990, "train_runtime": 123668.6043, "train_tokens_per_second": 5653.807 }, { "epoch": 1.076959332076488, "grad_norm": 0.8662735325666648, "learning_rate": 4.397558889024649e-06, "loss": 0.350922966003418, "num_input_tokens_seen": 699398432, "step": 15995, "train_runtime": 123704.5755, "train_tokens_per_second": 5653.78 }, { "epoch": 1.0772959870724481, "grad_norm": 0.6339471211052848, "learning_rate": 4.394934154008715e-06, "loss": 0.3178732395172119, "num_input_tokens_seen": 699622136, "step": 16000, "train_runtime": 123751.9275, "train_tokens_per_second": 5653.424 }, { "epoch": 1.0776326420684084, "grad_norm": 0.7488843367203586, "learning_rate": 4.392309588197514e-06, "loss": 0.3029392957687378, "num_input_tokens_seen": 699844832, "step": 16005, "train_runtime": 123789.2847, "train_tokens_per_second": 5653.517 }, { "epoch": 1.0779692970643684, "grad_norm": 0.7019722238512428, "learning_rate": 4.389685192324999e-06, "loss": 0.30281388759613037, "num_input_tokens_seen": 700062776, "step": 16010, "train_runtime": 123831.9289, "train_tokens_per_second": 5653.33 }, { "epoch": 1.0783059520603286, "grad_norm": 0.6922589184425343, "learning_rate": 4.387060967125073e-06, "loss": 0.3248000144958496, "num_input_tokens_seen": 700270472, "step": 16015, "train_runtime": 123866.5766, "train_tokens_per_second": 5653.426 }, { "epoch": 1.0786426070562887, "grad_norm": 0.8480144418378566, "learning_rate": 4.384436913331596e-06, "loss": 0.3387366533279419, "num_input_tokens_seen": 700490600, "step": 16020, "train_runtime": 123908.611, "train_tokens_per_second": 5653.284 }, { "epoch": 1.078979262052249, "grad_norm": 0.7822749047395506, "learning_rate": 4.38181303167837e-06, "loss": 0.3053700923919678, "num_input_tokens_seen": 700708944, "step": 16025, "train_runtime": 123949.1805, "train_tokens_per_second": 5653.195 }, { "epoch": 1.079315917048209, "grad_norm": 0.7151897163772738, "learning_rate": 4.379189322899159e-06, "loss": 0.29577248096466063, "num_input_tokens_seen": 700917296, "step": 16030, "train_runtime": 123988.781, "train_tokens_per_second": 5653.07 }, { "epoch": 1.0796525720441692, "grad_norm": 0.6994370560748215, "learning_rate": 4.376565787727676e-06, "loss": 0.30431132316589354, "num_input_tokens_seen": 701140832, "step": 16035, "train_runtime": 124020.3139, "train_tokens_per_second": 5653.435 }, { "epoch": 1.0799892270401292, "grad_norm": 0.7403775219598513, "learning_rate": 4.373942426897581e-06, "loss": 0.30581619739532473, "num_input_tokens_seen": 701344984, "step": 16040, "train_runtime": 124056.6795, "train_tokens_per_second": 5653.424 }, { "epoch": 1.0803258820360895, "grad_norm": 0.8197194371899179, "learning_rate": 4.37131924114249e-06, "loss": 0.32230820655822756, "num_input_tokens_seen": 701550320, "step": 16045, "train_runtime": 124096.2964, "train_tokens_per_second": 5653.274 }, { "epoch": 1.0806625370320495, "grad_norm": 0.7798066192591843, "learning_rate": 4.368696231195968e-06, "loss": 0.3164224624633789, "num_input_tokens_seen": 701773408, "step": 16050, "train_runtime": 124133.9174, "train_tokens_per_second": 5653.357 }, { "epoch": 1.0809991920280098, "grad_norm": 0.8232305871133864, "learning_rate": 4.366073397791534e-06, "loss": 0.29906353950500486, "num_input_tokens_seen": 701989056, "step": 16055, "train_runtime": 124171.9449, "train_tokens_per_second": 5653.363 }, { "epoch": 1.0813358470239698, "grad_norm": 0.6949559219075683, "learning_rate": 4.363450741662651e-06, "loss": 0.28748531341552735, "num_input_tokens_seen": 702206288, "step": 16060, "train_runtime": 124208.7109, "train_tokens_per_second": 5653.438 }, { "epoch": 1.08167250201993, "grad_norm": 0.7364548266367604, "learning_rate": 4.360828263542739e-06, "loss": 0.2912368059158325, "num_input_tokens_seen": 702427720, "step": 16065, "train_runtime": 124248.5519, "train_tokens_per_second": 5653.408 }, { "epoch": 1.08200915701589, "grad_norm": 0.7936024878904875, "learning_rate": 4.358205964165164e-06, "loss": 0.3195831298828125, "num_input_tokens_seen": 702647704, "step": 16070, "train_runtime": 124288.6557, "train_tokens_per_second": 5653.353 }, { "epoch": 1.0823458120118503, "grad_norm": 0.7229626629457014, "learning_rate": 4.355583844263247e-06, "loss": 0.32871217727661134, "num_input_tokens_seen": 702872568, "step": 16075, "train_runtime": 124334.326, "train_tokens_per_second": 5653.085 }, { "epoch": 1.0826824670078103, "grad_norm": 0.8615005299982201, "learning_rate": 4.352961904570251e-06, "loss": 0.3125025272369385, "num_input_tokens_seen": 703089672, "step": 16080, "train_runtime": 124374.4941, "train_tokens_per_second": 5653.005 }, { "epoch": 1.0830191220037706, "grad_norm": 0.7771590178180461, "learning_rate": 4.350340145819397e-06, "loss": 0.31962432861328127, "num_input_tokens_seen": 703303976, "step": 16085, "train_runtime": 124407.3656, "train_tokens_per_second": 5653.234 }, { "epoch": 1.0833557769997306, "grad_norm": 0.7052567726864358, "learning_rate": 4.347718568743847e-06, "loss": 0.31935825347900393, "num_input_tokens_seen": 703525192, "step": 16090, "train_runtime": 124447.9997, "train_tokens_per_second": 5653.166 }, { "epoch": 1.0836924319956909, "grad_norm": 0.6884996142175045, "learning_rate": 4.34509717407672e-06, "loss": 0.32219245433807375, "num_input_tokens_seen": 703758184, "step": 16095, "train_runtime": 124485.0197, "train_tokens_per_second": 5653.356 }, { "epoch": 1.084029086991651, "grad_norm": 0.7945771259917277, "learning_rate": 4.342475962551081e-06, "loss": 0.3197646141052246, "num_input_tokens_seen": 703976600, "step": 16100, "train_runtime": 124520.4953, "train_tokens_per_second": 5653.5 }, { "epoch": 1.0843657419876112, "grad_norm": 0.7193933737753864, "learning_rate": 4.339854934899943e-06, "loss": 0.2914067268371582, "num_input_tokens_seen": 704189712, "step": 16105, "train_runtime": 124558.1197, "train_tokens_per_second": 5653.503 }, { "epoch": 1.0847023969835712, "grad_norm": 0.6245767712435051, "learning_rate": 4.337234091856265e-06, "loss": 0.2758800983428955, "num_input_tokens_seen": 704420104, "step": 16110, "train_runtime": 124598.8261, "train_tokens_per_second": 5653.505 }, { "epoch": 1.0850390519795314, "grad_norm": 0.7731352613680776, "learning_rate": 4.334613434152961e-06, "loss": 0.3056293249130249, "num_input_tokens_seen": 704628384, "step": 16115, "train_runtime": 124633.8287, "train_tokens_per_second": 5653.589 }, { "epoch": 1.0853757069754915, "grad_norm": 0.8100290972348857, "learning_rate": 4.331992962522888e-06, "loss": 0.3311766147613525, "num_input_tokens_seen": 704848816, "step": 16120, "train_runtime": 124667.6455, "train_tokens_per_second": 5653.823 }, { "epoch": 1.0857123619714517, "grad_norm": 0.7302554603263116, "learning_rate": 4.329372677698854e-06, "loss": 0.3087399244308472, "num_input_tokens_seen": 705076168, "step": 16125, "train_runtime": 124705.2351, "train_tokens_per_second": 5653.942 }, { "epoch": 1.0860490169674117, "grad_norm": 0.7471321256250719, "learning_rate": 4.3267525804136114e-06, "loss": 0.3147927761077881, "num_input_tokens_seen": 705296784, "step": 16130, "train_runtime": 124743.6802, "train_tokens_per_second": 5653.968 }, { "epoch": 1.086385671963372, "grad_norm": 0.795048965234782, "learning_rate": 4.324132671399864e-06, "loss": 0.3137171268463135, "num_input_tokens_seen": 705500048, "step": 16135, "train_runtime": 124785.7851, "train_tokens_per_second": 5653.689 }, { "epoch": 1.086722326959332, "grad_norm": 0.7470988295180053, "learning_rate": 4.321512951390258e-06, "loss": 0.3282973289489746, "num_input_tokens_seen": 705720120, "step": 16140, "train_runtime": 124823.8383, "train_tokens_per_second": 5653.729 }, { "epoch": 1.0870589819552923, "grad_norm": 0.7567687111417263, "learning_rate": 4.318893421117393e-06, "loss": 0.3061366081237793, "num_input_tokens_seen": 705941352, "step": 16145, "train_runtime": 124862.2769, "train_tokens_per_second": 5653.76 }, { "epoch": 1.0873956369512523, "grad_norm": 0.7636628451001315, "learning_rate": 4.31627408131381e-06, "loss": 0.2968632698059082, "num_input_tokens_seen": 706150776, "step": 16150, "train_runtime": 124908.0524, "train_tokens_per_second": 5653.365 }, { "epoch": 1.0877322919472125, "grad_norm": 0.7225164738453893, "learning_rate": 4.313654932712001e-06, "loss": 0.2813676357269287, "num_input_tokens_seen": 706367696, "step": 16155, "train_runtime": 124945.3002, "train_tokens_per_second": 5653.415 }, { "epoch": 1.0880689469431726, "grad_norm": 0.7624100309618296, "learning_rate": 4.3110359760444e-06, "loss": 0.3084303617477417, "num_input_tokens_seen": 706598168, "step": 16160, "train_runtime": 124977.2044, "train_tokens_per_second": 5653.816 }, { "epoch": 1.0884056019391328, "grad_norm": 0.8194505401549996, "learning_rate": 4.308417212043392e-06, "loss": 0.2846923589706421, "num_input_tokens_seen": 706810256, "step": 16165, "train_runtime": 125015.2796, "train_tokens_per_second": 5653.791 }, { "epoch": 1.0887422569350929, "grad_norm": 1.0425941904759917, "learning_rate": 4.305798641441304e-06, "loss": 0.2945555210113525, "num_input_tokens_seen": 707037952, "step": 16170, "train_runtime": 125057.1296, "train_tokens_per_second": 5653.72 }, { "epoch": 1.089078911931053, "grad_norm": 0.7001009592549052, "learning_rate": 4.303180264970416e-06, "loss": 0.3075662851333618, "num_input_tokens_seen": 707251272, "step": 16175, "train_runtime": 125103.0693, "train_tokens_per_second": 5653.349 }, { "epoch": 1.0894155669270131, "grad_norm": 0.6728629250761784, "learning_rate": 4.3005620833629415e-06, "loss": 0.2843637466430664, "num_input_tokens_seen": 707466896, "step": 16180, "train_runtime": 125144.1227, "train_tokens_per_second": 5653.217 }, { "epoch": 1.0897522219229734, "grad_norm": 0.8207014522019808, "learning_rate": 4.297944097351053e-06, "loss": 0.3128535270690918, "num_input_tokens_seen": 707669312, "step": 16185, "train_runtime": 125187.0812, "train_tokens_per_second": 5652.894 }, { "epoch": 1.0900888769189334, "grad_norm": 0.7403515636473879, "learning_rate": 4.295326307666856e-06, "loss": 0.32403197288513186, "num_input_tokens_seen": 707901856, "step": 16190, "train_runtime": 125223.3339, "train_tokens_per_second": 5653.115 }, { "epoch": 1.0904255319148937, "grad_norm": 0.7331845978184556, "learning_rate": 4.292708715042411e-06, "loss": 0.3054851531982422, "num_input_tokens_seen": 708121472, "step": 16195, "train_runtime": 125262.4718, "train_tokens_per_second": 5653.102 }, { "epoch": 1.0907621869108537, "grad_norm": 0.8734471364431988, "learning_rate": 4.290091320209718e-06, "loss": 0.32215137481689454, "num_input_tokens_seen": 708352952, "step": 16200, "train_runtime": 125297.9813, "train_tokens_per_second": 5653.347 }, { "epoch": 1.091098841906814, "grad_norm": 0.814424549291456, "learning_rate": 4.287474123900726e-06, "loss": 0.3153803825378418, "num_input_tokens_seen": 708559152, "step": 16205, "train_runtime": 125333.9985, "train_tokens_per_second": 5653.367 }, { "epoch": 1.091435496902774, "grad_norm": 0.7017503991057531, "learning_rate": 4.284857126847321e-06, "loss": 0.3124639272689819, "num_input_tokens_seen": 708773424, "step": 16210, "train_runtime": 125375.3591, "train_tokens_per_second": 5653.212 }, { "epoch": 1.0917721518987342, "grad_norm": 0.7054843976620787, "learning_rate": 4.28224032978134e-06, "loss": 0.32616453170776366, "num_input_tokens_seen": 709001032, "step": 16215, "train_runtime": 125415.5584, "train_tokens_per_second": 5653.214 }, { "epoch": 1.0921088068946943, "grad_norm": 0.6285131408838311, "learning_rate": 4.279623733434561e-06, "loss": 0.29432287216186526, "num_input_tokens_seen": 709220648, "step": 16220, "train_runtime": 125453.1068, "train_tokens_per_second": 5653.273 }, { "epoch": 1.0924454618906545, "grad_norm": 0.7070132737008057, "learning_rate": 4.277007338538711e-06, "loss": 0.28021812438964844, "num_input_tokens_seen": 709458880, "step": 16225, "train_runtime": 125489.4284, "train_tokens_per_second": 5653.535 }, { "epoch": 1.0927821168866145, "grad_norm": 0.6568772287438737, "learning_rate": 4.27439114582545e-06, "loss": 0.278457498550415, "num_input_tokens_seen": 709678888, "step": 16230, "train_runtime": 125528.1241, "train_tokens_per_second": 5653.545 }, { "epoch": 1.0931187718825748, "grad_norm": 0.7614047551407584, "learning_rate": 4.271775156026395e-06, "loss": 0.3240532636642456, "num_input_tokens_seen": 709881120, "step": 16235, "train_runtime": 125570.4013, "train_tokens_per_second": 5653.252 }, { "epoch": 1.0934554268785348, "grad_norm": 0.6948637574677056, "learning_rate": 4.269159369873093e-06, "loss": 0.30025343894958495, "num_input_tokens_seen": 710087584, "step": 16240, "train_runtime": 125608.5048, "train_tokens_per_second": 5653.181 }, { "epoch": 1.093792081874495, "grad_norm": 0.6766287089415108, "learning_rate": 4.266543788097043e-06, "loss": 0.30265159606933595, "num_input_tokens_seen": 710323016, "step": 16245, "train_runtime": 125642.5699, "train_tokens_per_second": 5653.522 }, { "epoch": 1.094128736870455, "grad_norm": 0.775588372137403, "learning_rate": 4.263928411429683e-06, "loss": 0.34309751987457277, "num_input_tokens_seen": 710535008, "step": 16250, "train_runtime": 125685.9241, "train_tokens_per_second": 5653.258 }, { "epoch": 1.0944653918664153, "grad_norm": 0.7548771221924332, "learning_rate": 4.261313240602398e-06, "loss": 0.32427158355712893, "num_input_tokens_seen": 710748160, "step": 16255, "train_runtime": 125721.4997, "train_tokens_per_second": 5653.354 }, { "epoch": 1.0948020468623754, "grad_norm": 0.7250716525242203, "learning_rate": 4.2586982763465064e-06, "loss": 0.3176891326904297, "num_input_tokens_seen": 710976808, "step": 16260, "train_runtime": 125755.3891, "train_tokens_per_second": 5653.649 }, { "epoch": 1.0951387018583356, "grad_norm": 0.7160308232765491, "learning_rate": 4.256083519393281e-06, "loss": 0.30221972465515134, "num_input_tokens_seen": 711195160, "step": 16265, "train_runtime": 125791.4899, "train_tokens_per_second": 5653.762 }, { "epoch": 1.0954753568542956, "grad_norm": 0.7399122315680735, "learning_rate": 4.253468970473925e-06, "loss": 0.32169513702392577, "num_input_tokens_seen": 711418152, "step": 16270, "train_runtime": 125823.4265, "train_tokens_per_second": 5654.099 }, { "epoch": 1.095812011850256, "grad_norm": 0.7365264997369239, "learning_rate": 4.250854630319593e-06, "loss": 0.345171594619751, "num_input_tokens_seen": 711640424, "step": 16275, "train_runtime": 125864.4895, "train_tokens_per_second": 5654.021 }, { "epoch": 1.096148666846216, "grad_norm": 0.7088190228061766, "learning_rate": 4.248240499661373e-06, "loss": 0.3070409059524536, "num_input_tokens_seen": 711848088, "step": 16280, "train_runtime": 125903.3761, "train_tokens_per_second": 5653.924 }, { "epoch": 1.0964853218421762, "grad_norm": 0.7753388506945056, "learning_rate": 4.245626579230302e-06, "loss": 0.2884035587310791, "num_input_tokens_seen": 712069664, "step": 16285, "train_runtime": 125935.0217, "train_tokens_per_second": 5654.262 }, { "epoch": 1.0968219768381362, "grad_norm": 0.898320442866567, "learning_rate": 4.243012869757351e-06, "loss": 0.296952223777771, "num_input_tokens_seen": 712306208, "step": 16290, "train_runtime": 125975.6337, "train_tokens_per_second": 5654.317 }, { "epoch": 1.0971586318340965, "grad_norm": 0.6948335232020322, "learning_rate": 4.240399371973438e-06, "loss": 0.31108913421630857, "num_input_tokens_seen": 712536912, "step": 16295, "train_runtime": 126015.4524, "train_tokens_per_second": 5654.361 }, { "epoch": 1.0974952868300565, "grad_norm": 0.7536053030674238, "learning_rate": 4.2377860866094165e-06, "loss": 0.3221109390258789, "num_input_tokens_seen": 712758800, "step": 16300, "train_runtime": 126050.8307, "train_tokens_per_second": 5654.535 }, { "epoch": 1.0978319418260167, "grad_norm": 0.757140397293046, "learning_rate": 4.235173014396088e-06, "loss": 0.3079149007797241, "num_input_tokens_seen": 712977904, "step": 16305, "train_runtime": 126086.8838, "train_tokens_per_second": 5654.656 }, { "epoch": 1.0981685968219768, "grad_norm": 0.7077551119296236, "learning_rate": 4.2325601560641854e-06, "loss": 0.3280055046081543, "num_input_tokens_seen": 713204864, "step": 16310, "train_runtime": 126127.6082, "train_tokens_per_second": 5654.629 }, { "epoch": 1.098505251817937, "grad_norm": 0.742995716486435, "learning_rate": 4.229947512344389e-06, "loss": 0.3023355484008789, "num_input_tokens_seen": 713422520, "step": 16315, "train_runtime": 126168.2023, "train_tokens_per_second": 5654.535 }, { "epoch": 1.098841906813897, "grad_norm": 0.7574565860803252, "learning_rate": 4.227335083967314e-06, "loss": 0.3024130344390869, "num_input_tokens_seen": 713640344, "step": 16320, "train_runtime": 126208.7161, "train_tokens_per_second": 5654.446 }, { "epoch": 1.0991785618098573, "grad_norm": 0.6713642233636719, "learning_rate": 4.224722871663522e-06, "loss": 0.3010653018951416, "num_input_tokens_seen": 713862120, "step": 16325, "train_runtime": 126241.4058, "train_tokens_per_second": 5654.738 }, { "epoch": 1.0995152168058173, "grad_norm": 0.7224131004458003, "learning_rate": 4.222110876163503e-06, "loss": 0.3363258600234985, "num_input_tokens_seen": 714091328, "step": 16330, "train_runtime": 126279.2124, "train_tokens_per_second": 5654.86 }, { "epoch": 1.0998518718017776, "grad_norm": 0.788806961337755, "learning_rate": 4.2194990981977e-06, "loss": 0.2941534757614136, "num_input_tokens_seen": 714318104, "step": 16335, "train_runtime": 126315.8939, "train_tokens_per_second": 5655.014 }, { "epoch": 1.1001885267977376, "grad_norm": 0.7340574826834825, "learning_rate": 4.216887538496482e-06, "loss": 0.2995609760284424, "num_input_tokens_seen": 714533544, "step": 16340, "train_runtime": 126356.39, "train_tokens_per_second": 5654.906 }, { "epoch": 1.1005251817936978, "grad_norm": 0.7563051863525939, "learning_rate": 4.2142761977901695e-06, "loss": 0.3597081184387207, "num_input_tokens_seen": 714751432, "step": 16345, "train_runtime": 126392.7269, "train_tokens_per_second": 5655.004 }, { "epoch": 1.1008618367896579, "grad_norm": 0.7088542234512013, "learning_rate": 4.21166507680901e-06, "loss": 0.3166736364364624, "num_input_tokens_seen": 714962360, "step": 16350, "train_runtime": 126422.3158, "train_tokens_per_second": 5655.349 }, { "epoch": 1.1011984917856181, "grad_norm": 0.7396624505443076, "learning_rate": 4.209054176283202e-06, "loss": 0.31155028343200686, "num_input_tokens_seen": 715172784, "step": 16355, "train_runtime": 126456.1758, "train_tokens_per_second": 5655.499 }, { "epoch": 1.1015351467815782, "grad_norm": 0.762754435287207, "learning_rate": 4.206443496942868e-06, "loss": 0.3161408185958862, "num_input_tokens_seen": 715390344, "step": 16360, "train_runtime": 126495.2215, "train_tokens_per_second": 5655.473 }, { "epoch": 1.1018718017775384, "grad_norm": 0.976771706771798, "learning_rate": 4.203833039518081e-06, "loss": 0.2889822006225586, "num_input_tokens_seen": 715601072, "step": 16365, "train_runtime": 126533.131, "train_tokens_per_second": 5655.444 }, { "epoch": 1.1022084567734984, "grad_norm": 0.7390990491778792, "learning_rate": 4.201222804738845e-06, "loss": 0.29911801815032957, "num_input_tokens_seen": 715832864, "step": 16370, "train_runtime": 126567.5723, "train_tokens_per_second": 5655.737 }, { "epoch": 1.1025451117694587, "grad_norm": 0.7688021513330408, "learning_rate": 4.198612793335107e-06, "loss": 0.28797073364257814, "num_input_tokens_seen": 716055080, "step": 16375, "train_runtime": 126611.3125, "train_tokens_per_second": 5655.538 }, { "epoch": 1.1028817667654187, "grad_norm": 0.6787164905475817, "learning_rate": 4.196003006036743e-06, "loss": 0.3057976722717285, "num_input_tokens_seen": 716266872, "step": 16380, "train_runtime": 126648.5655, "train_tokens_per_second": 5655.547 }, { "epoch": 1.103218421761379, "grad_norm": 0.7945554316956748, "learning_rate": 4.193393443573576e-06, "loss": 0.3109589576721191, "num_input_tokens_seen": 716490328, "step": 16385, "train_runtime": 126684.476, "train_tokens_per_second": 5655.707 }, { "epoch": 1.103555076757339, "grad_norm": 0.7930645433989376, "learning_rate": 4.19078410667536e-06, "loss": 0.3338963985443115, "num_input_tokens_seen": 716702856, "step": 16390, "train_runtime": 126724.8797, "train_tokens_per_second": 5655.581 }, { "epoch": 1.1038917317532992, "grad_norm": 0.8073944896858126, "learning_rate": 4.188174996071788e-06, "loss": 0.32840120792388916, "num_input_tokens_seen": 716893944, "step": 16395, "train_runtime": 126758.4514, "train_tokens_per_second": 5655.591 }, { "epoch": 1.1042283867492593, "grad_norm": 0.7471631872859732, "learning_rate": 4.18556611249249e-06, "loss": 0.30612549781799314, "num_input_tokens_seen": 717111816, "step": 16400, "train_runtime": 126792.6813, "train_tokens_per_second": 5655.782 }, { "epoch": 1.1045650417452195, "grad_norm": 0.8308844608789487, "learning_rate": 4.182957456667032e-06, "loss": 0.3163015127182007, "num_input_tokens_seen": 717335736, "step": 16405, "train_runtime": 126836.6466, "train_tokens_per_second": 5655.587 }, { "epoch": 1.1049016967411796, "grad_norm": 0.7689707726304607, "learning_rate": 4.1803490293249145e-06, "loss": 0.3357135057449341, "num_input_tokens_seen": 717557144, "step": 16410, "train_runtime": 126873.1786, "train_tokens_per_second": 5655.704 }, { "epoch": 1.1052383517371398, "grad_norm": 0.866900091357806, "learning_rate": 4.1777408311955785e-06, "loss": 0.3057410717010498, "num_input_tokens_seen": 717761472, "step": 16415, "train_runtime": 126909.3722, "train_tokens_per_second": 5655.701 }, { "epoch": 1.1055750067330998, "grad_norm": 0.7300512821916881, "learning_rate": 4.175132863008395e-06, "loss": 0.33652937412261963, "num_input_tokens_seen": 717986048, "step": 16420, "train_runtime": 126949.4267, "train_tokens_per_second": 5655.686 }, { "epoch": 1.10591166172906, "grad_norm": 0.9194268863297489, "learning_rate": 4.17252512549268e-06, "loss": 0.3076220273971558, "num_input_tokens_seen": 718179376, "step": 16425, "train_runtime": 126987.7182, "train_tokens_per_second": 5655.503 }, { "epoch": 1.10624831672502, "grad_norm": 0.7503337161594836, "learning_rate": 4.169917619377671e-06, "loss": 0.3038554906845093, "num_input_tokens_seen": 718392416, "step": 16430, "train_runtime": 127030.797, "train_tokens_per_second": 5655.262 }, { "epoch": 1.1065849717209804, "grad_norm": 0.8669099466716282, "learning_rate": 4.167310345392557e-06, "loss": 0.34373929500579836, "num_input_tokens_seen": 718606440, "step": 16435, "train_runtime": 127066.9236, "train_tokens_per_second": 5655.338 }, { "epoch": 1.1069216267169404, "grad_norm": 0.7525899229778, "learning_rate": 4.1647033042664455e-06, "loss": 0.3425747871398926, "num_input_tokens_seen": 718818792, "step": 16440, "train_runtime": 127105.1604, "train_tokens_per_second": 5655.308 }, { "epoch": 1.1072582817129006, "grad_norm": 0.7395303188295309, "learning_rate": 4.162096496728394e-06, "loss": 0.3010833263397217, "num_input_tokens_seen": 719039416, "step": 16445, "train_runtime": 127146.3098, "train_tokens_per_second": 5655.213 }, { "epoch": 1.1075949367088607, "grad_norm": 0.7264360847991507, "learning_rate": 4.1594899235073835e-06, "loss": 0.2992356300354004, "num_input_tokens_seen": 719268528, "step": 16450, "train_runtime": 127190.5278, "train_tokens_per_second": 5655.048 }, { "epoch": 1.107931591704821, "grad_norm": 0.7474728546722258, "learning_rate": 4.156883585332338e-06, "loss": 0.33159723281860354, "num_input_tokens_seen": 719497592, "step": 16455, "train_runtime": 127229.1668, "train_tokens_per_second": 5655.131 }, { "epoch": 1.108268246700781, "grad_norm": 0.6867746878864566, "learning_rate": 4.154277482932107e-06, "loss": 0.31698899269104003, "num_input_tokens_seen": 719703328, "step": 16460, "train_runtime": 127263.452, "train_tokens_per_second": 5655.224 }, { "epoch": 1.1086049016967412, "grad_norm": 0.7188428455380581, "learning_rate": 4.151671617035482e-06, "loss": 0.30119948387145995, "num_input_tokens_seen": 719915352, "step": 16465, "train_runtime": 127303.2856, "train_tokens_per_second": 5655.12 }, { "epoch": 1.1089415566927012, "grad_norm": 0.7701204509330969, "learning_rate": 4.149065988371184e-06, "loss": 0.2912993669509888, "num_input_tokens_seen": 720134040, "step": 16470, "train_runtime": 127336.2618, "train_tokens_per_second": 5655.373 }, { "epoch": 1.1092782116886615, "grad_norm": 0.7513429280225311, "learning_rate": 4.14646059766787e-06, "loss": 0.30213978290557864, "num_input_tokens_seen": 720337824, "step": 16475, "train_runtime": 127369.5743, "train_tokens_per_second": 5655.494 }, { "epoch": 1.1096148666846215, "grad_norm": 0.6711604996544339, "learning_rate": 4.143855445654127e-06, "loss": 0.29933414459228513, "num_input_tokens_seen": 720567936, "step": 16480, "train_runtime": 127409.6507, "train_tokens_per_second": 5655.521 }, { "epoch": 1.1099515216805818, "grad_norm": 0.8475234440498322, "learning_rate": 4.14125053305848e-06, "loss": 0.2931232213973999, "num_input_tokens_seen": 720770472, "step": 16485, "train_runtime": 127446.8624, "train_tokens_per_second": 5655.459 }, { "epoch": 1.1102881766765418, "grad_norm": 0.7010224781863986, "learning_rate": 4.1386458606093805e-06, "loss": 0.30602593421936036, "num_input_tokens_seen": 720990928, "step": 16490, "train_runtime": 127487.302, "train_tokens_per_second": 5655.394 }, { "epoch": 1.110624831672502, "grad_norm": 0.7499446880256623, "learning_rate": 4.1360414290352214e-06, "loss": 0.3390794038772583, "num_input_tokens_seen": 721222304, "step": 16495, "train_runtime": 127531.9109, "train_tokens_per_second": 5655.23 }, { "epoch": 1.110961486668462, "grad_norm": 0.7785896374993136, "learning_rate": 4.1334372390643205e-06, "loss": 0.30769715309143064, "num_input_tokens_seen": 721451296, "step": 16500, "train_runtime": 127572.4988, "train_tokens_per_second": 5655.226 }, { "epoch": 1.1112981416644223, "grad_norm": 0.6703802322842832, "learning_rate": 4.130833291424934e-06, "loss": 0.32526416778564454, "num_input_tokens_seen": 721672688, "step": 16505, "train_runtime": 127609.7092, "train_tokens_per_second": 5655.312 }, { "epoch": 1.1116347966603823, "grad_norm": 0.8080822522673832, "learning_rate": 4.128229586845244e-06, "loss": 0.30047011375427246, "num_input_tokens_seen": 721893296, "step": 16510, "train_runtime": 127652.4127, "train_tokens_per_second": 5655.148 }, { "epoch": 1.1119714516563426, "grad_norm": 0.6398810192890917, "learning_rate": 4.125626126053372e-06, "loss": 0.2854645013809204, "num_input_tokens_seen": 722117224, "step": 16515, "train_runtime": 127693.4791, "train_tokens_per_second": 5655.083 }, { "epoch": 1.1123081066523026, "grad_norm": 0.7428717458853391, "learning_rate": 4.123022909777364e-06, "loss": 0.31157827377319336, "num_input_tokens_seen": 722338424, "step": 16520, "train_runtime": 127724.0973, "train_tokens_per_second": 5655.459 }, { "epoch": 1.1126447616482629, "grad_norm": 0.8547681854868342, "learning_rate": 4.120419938745205e-06, "loss": 0.31059443950653076, "num_input_tokens_seen": 722572192, "step": 16525, "train_runtime": 127768.6413, "train_tokens_per_second": 5655.317 }, { "epoch": 1.112981416644223, "grad_norm": 0.8535266815266339, "learning_rate": 4.1178172136848035e-06, "loss": 0.30442132949829104, "num_input_tokens_seen": 722777960, "step": 16530, "train_runtime": 127805.8834, "train_tokens_per_second": 5655.279 }, { "epoch": 1.1133180716401831, "grad_norm": 0.7715289136002668, "learning_rate": 4.115214735324007e-06, "loss": 0.29233555793762206, "num_input_tokens_seen": 723011784, "step": 16535, "train_runtime": 127845.3251, "train_tokens_per_second": 5655.363 }, { "epoch": 1.1136547266361432, "grad_norm": 0.6308478276358274, "learning_rate": 4.112612504390586e-06, "loss": 0.2731541872024536, "num_input_tokens_seen": 723233976, "step": 16540, "train_runtime": 127887.594, "train_tokens_per_second": 5655.232 }, { "epoch": 1.1139913816321034, "grad_norm": 0.7595556917317189, "learning_rate": 4.11001052161225e-06, "loss": 0.3273204803466797, "num_input_tokens_seen": 723450040, "step": 16545, "train_runtime": 127924.3668, "train_tokens_per_second": 5655.295 }, { "epoch": 1.1143280366280637, "grad_norm": 0.7539458359188388, "learning_rate": 4.107408787716632e-06, "loss": 0.3083867788314819, "num_input_tokens_seen": 723674424, "step": 16550, "train_runtime": 127966.9008, "train_tokens_per_second": 5655.169 }, { "epoch": 1.1146646916240237, "grad_norm": 0.6933389096869937, "learning_rate": 4.104807303431303e-06, "loss": 0.30321598052978516, "num_input_tokens_seen": 723898176, "step": 16555, "train_runtime": 128013.6102, "train_tokens_per_second": 5654.853 }, { "epoch": 1.1150013466199837, "grad_norm": 0.8314161994474075, "learning_rate": 4.102206069483754e-06, "loss": 0.32450571060180666, "num_input_tokens_seen": 724110632, "step": 16560, "train_runtime": 128050.9045, "train_tokens_per_second": 5654.865 }, { "epoch": 1.115338001615944, "grad_norm": 0.7582409248110241, "learning_rate": 4.099605086601417e-06, "loss": 0.28465938568115234, "num_input_tokens_seen": 724312128, "step": 16565, "train_runtime": 128098.5725, "train_tokens_per_second": 5654.334 }, { "epoch": 1.1156746566119042, "grad_norm": 0.7723226944103582, "learning_rate": 4.097004355511645e-06, "loss": 0.2872473239898682, "num_input_tokens_seen": 724532224, "step": 16570, "train_runtime": 128135.0872, "train_tokens_per_second": 5654.44 }, { "epoch": 1.1160113116078643, "grad_norm": 0.80551126446832, "learning_rate": 4.094403876941728e-06, "loss": 0.2786348819732666, "num_input_tokens_seen": 724749712, "step": 16575, "train_runtime": 128172.2871, "train_tokens_per_second": 5654.496 }, { "epoch": 1.1163479666038243, "grad_norm": 0.7081089427677039, "learning_rate": 4.0918036516188755e-06, "loss": 0.3147793531417847, "num_input_tokens_seen": 724953832, "step": 16580, "train_runtime": 128215.8528, "train_tokens_per_second": 5654.167 }, { "epoch": 1.1166846215997845, "grad_norm": 0.7234281848413817, "learning_rate": 4.0892036802702395e-06, "loss": 0.3022450923919678, "num_input_tokens_seen": 725178424, "step": 16585, "train_runtime": 128258.0871, "train_tokens_per_second": 5654.056 }, { "epoch": 1.1170212765957448, "grad_norm": 0.6801507964833571, "learning_rate": 4.086603963622887e-06, "loss": 0.2855158090591431, "num_input_tokens_seen": 725402000, "step": 16590, "train_runtime": 128299.5805, "train_tokens_per_second": 5653.97 }, { "epoch": 1.1173579315917048, "grad_norm": 0.712093664671178, "learning_rate": 4.084004502403825e-06, "loss": 0.32064228057861327, "num_input_tokens_seen": 725622480, "step": 16595, "train_runtime": 128341.8001, "train_tokens_per_second": 5653.828 }, { "epoch": 1.1176945865876649, "grad_norm": 0.7068967114722002, "learning_rate": 4.081405297339982e-06, "loss": 0.30630931854248045, "num_input_tokens_seen": 725856392, "step": 16600, "train_runtime": 128375.2241, "train_tokens_per_second": 5654.178 }, { "epoch": 1.118031241583625, "grad_norm": 0.7257036824000926, "learning_rate": 4.0788063491582205e-06, "loss": 0.3028933048248291, "num_input_tokens_seen": 726063792, "step": 16605, "train_runtime": 128411.5161, "train_tokens_per_second": 5654.195 }, { "epoch": 1.1183678965795854, "grad_norm": 0.8569267027392826, "learning_rate": 4.076207658585323e-06, "loss": 0.3076032638549805, "num_input_tokens_seen": 726293720, "step": 16610, "train_runtime": 128453.0536, "train_tokens_per_second": 5654.157 }, { "epoch": 1.1187045515755454, "grad_norm": 0.6859953010109835, "learning_rate": 4.07360922634801e-06, "loss": 0.31174705028533933, "num_input_tokens_seen": 726522048, "step": 16615, "train_runtime": 128490.1199, "train_tokens_per_second": 5654.303 }, { "epoch": 1.1190412065715054, "grad_norm": 0.8064627601454211, "learning_rate": 4.071011053172922e-06, "loss": 0.3052211284637451, "num_input_tokens_seen": 726722760, "step": 16620, "train_runtime": 128528.4186, "train_tokens_per_second": 5654.18 }, { "epoch": 1.1193778615674657, "grad_norm": 0.7719182024204673, "learning_rate": 4.068413139786631e-06, "loss": 0.29850754737854, "num_input_tokens_seen": 726939496, "step": 16625, "train_runtime": 128567.5214, "train_tokens_per_second": 5654.146 }, { "epoch": 1.119714516563426, "grad_norm": 0.7949931481273091, "learning_rate": 4.065815486915635e-06, "loss": 0.30380845069885254, "num_input_tokens_seen": 727169648, "step": 16630, "train_runtime": 128605.7452, "train_tokens_per_second": 5654.255 }, { "epoch": 1.120051171559386, "grad_norm": 0.7231190372167858, "learning_rate": 4.063218095286359e-06, "loss": 0.31917145252227785, "num_input_tokens_seen": 727399600, "step": 16635, "train_runtime": 128642.9376, "train_tokens_per_second": 5654.408 }, { "epoch": 1.120387826555346, "grad_norm": 0.7667748207910186, "learning_rate": 4.0606209656251555e-06, "loss": 0.30777583122253416, "num_input_tokens_seen": 727623584, "step": 16640, "train_runtime": 128679.2099, "train_tokens_per_second": 5654.554 }, { "epoch": 1.1207244815513062, "grad_norm": 0.7358231463616071, "learning_rate": 4.058024098658304e-06, "loss": 0.32628979682922366, "num_input_tokens_seen": 727849768, "step": 16645, "train_runtime": 128721.1978, "train_tokens_per_second": 5654.467 }, { "epoch": 1.1210611365472665, "grad_norm": 0.7289574965983563, "learning_rate": 4.055427495112008e-06, "loss": 0.33713221549987793, "num_input_tokens_seen": 728072752, "step": 16650, "train_runtime": 128764.41, "train_tokens_per_second": 5654.301 }, { "epoch": 1.1213977915432265, "grad_norm": 0.7302453800120214, "learning_rate": 4.052831155712403e-06, "loss": 0.28829092979431153, "num_input_tokens_seen": 728297032, "step": 16655, "train_runtime": 128798.8316, "train_tokens_per_second": 5654.531 }, { "epoch": 1.1217344465391865, "grad_norm": 0.6736314639659831, "learning_rate": 4.050235081185544e-06, "loss": 0.27930502891540526, "num_input_tokens_seen": 728518648, "step": 16660, "train_runtime": 128837.9436, "train_tokens_per_second": 5654.535 }, { "epoch": 1.1220711015351468, "grad_norm": 0.778226843935622, "learning_rate": 4.047639272257415e-06, "loss": 0.31568381786346433, "num_input_tokens_seen": 728747776, "step": 16665, "train_runtime": 128881.478, "train_tokens_per_second": 5654.403 }, { "epoch": 1.122407756531107, "grad_norm": 0.616922697066709, "learning_rate": 4.045043729653927e-06, "loss": 0.2794900894165039, "num_input_tokens_seen": 728975240, "step": 16670, "train_runtime": 128920.0081, "train_tokens_per_second": 5654.477 }, { "epoch": 1.122744411527067, "grad_norm": 0.7407200139322001, "learning_rate": 4.0424484541009175e-06, "loss": 0.3211031436920166, "num_input_tokens_seen": 729207240, "step": 16675, "train_runtime": 128961.9626, "train_tokens_per_second": 5654.437 }, { "epoch": 1.1230810665230273, "grad_norm": 0.8208779512348747, "learning_rate": 4.039853446324141e-06, "loss": 0.2974057197570801, "num_input_tokens_seen": 729416088, "step": 16680, "train_runtime": 129004.1657, "train_tokens_per_second": 5654.206 }, { "epoch": 1.1234177215189873, "grad_norm": 0.7898967563608909, "learning_rate": 4.037258707049289e-06, "loss": 0.2974997043609619, "num_input_tokens_seen": 729633568, "step": 16685, "train_runtime": 129048.8248, "train_tokens_per_second": 5653.934 }, { "epoch": 1.1237543765149476, "grad_norm": 0.6741454248192755, "learning_rate": 4.034664237001969e-06, "loss": 0.29579739570617675, "num_input_tokens_seen": 729855424, "step": 16690, "train_runtime": 129087.6374, "train_tokens_per_second": 5653.953 }, { "epoch": 1.1240910315109076, "grad_norm": 0.8311896058049114, "learning_rate": 4.032070036907716e-06, "loss": 0.3193542003631592, "num_input_tokens_seen": 730062656, "step": 16695, "train_runtime": 129126.9171, "train_tokens_per_second": 5653.838 }, { "epoch": 1.1244276865068679, "grad_norm": 0.7991665442055015, "learning_rate": 4.029476107491991e-06, "loss": 0.3203211784362793, "num_input_tokens_seen": 730282736, "step": 16700, "train_runtime": 129171.6017, "train_tokens_per_second": 5653.586 }, { "epoch": 1.124764341502828, "grad_norm": 0.7190813419301547, "learning_rate": 4.0268824494801784e-06, "loss": 0.30711615085601807, "num_input_tokens_seen": 730503648, "step": 16705, "train_runtime": 129209.3295, "train_tokens_per_second": 5653.645 }, { "epoch": 1.1251009964987881, "grad_norm": 0.7285352578803672, "learning_rate": 4.024289063597585e-06, "loss": 0.31215999126434324, "num_input_tokens_seen": 730706704, "step": 16710, "train_runtime": 129251.1282, "train_tokens_per_second": 5653.387 }, { "epoch": 1.1254376514947482, "grad_norm": 0.7346612645471816, "learning_rate": 4.021695950569443e-06, "loss": 0.29782519340515134, "num_input_tokens_seen": 730929536, "step": 16715, "train_runtime": 129286.421, "train_tokens_per_second": 5653.568 }, { "epoch": 1.1257743064907082, "grad_norm": 0.7837756415475194, "learning_rate": 4.01910311112091e-06, "loss": 0.3227576017379761, "num_input_tokens_seen": 731146120, "step": 16720, "train_runtime": 129325.3701, "train_tokens_per_second": 5653.54 }, { "epoch": 1.1261109614866684, "grad_norm": 0.742625616948461, "learning_rate": 4.016510545977064e-06, "loss": 0.30303683280944826, "num_input_tokens_seen": 731374192, "step": 16725, "train_runtime": 129369.3334, "train_tokens_per_second": 5653.381 }, { "epoch": 1.1264476164826287, "grad_norm": 0.8331891535993596, "learning_rate": 4.013918255862908e-06, "loss": 0.3152627944946289, "num_input_tokens_seen": 731580072, "step": 16730, "train_runtime": 129413.4377, "train_tokens_per_second": 5653.046 }, { "epoch": 1.1267842714785887, "grad_norm": 0.8423878577043675, "learning_rate": 4.011326241503369e-06, "loss": 0.2968592643737793, "num_input_tokens_seen": 731789896, "step": 16735, "train_runtime": 129458.1727, "train_tokens_per_second": 5652.713 }, { "epoch": 1.127120926474549, "grad_norm": 0.8161928635173408, "learning_rate": 4.00873450362329e-06, "loss": 0.32601251602172854, "num_input_tokens_seen": 732012656, "step": 16740, "train_runtime": 129494.0456, "train_tokens_per_second": 5652.867 }, { "epoch": 1.127457581470509, "grad_norm": 0.7114507295708142, "learning_rate": 4.0061430429474476e-06, "loss": 0.31506369113922117, "num_input_tokens_seen": 732216280, "step": 16745, "train_runtime": 129530.2218, "train_tokens_per_second": 5652.861 }, { "epoch": 1.1277942364664693, "grad_norm": 0.6959294825982753, "learning_rate": 4.003551860200534e-06, "loss": 0.3079033851623535, "num_input_tokens_seen": 732421912, "step": 16750, "train_runtime": 129574.2624, "train_tokens_per_second": 5652.526 }, { "epoch": 1.1281308914624293, "grad_norm": 0.7729992928736847, "learning_rate": 4.000960956107167e-06, "loss": 0.3259746551513672, "num_input_tokens_seen": 732628200, "step": 16755, "train_runtime": 129616.0713, "train_tokens_per_second": 5652.294 }, { "epoch": 1.1284675464583895, "grad_norm": 0.7253296171356767, "learning_rate": 3.998370331391881e-06, "loss": 0.3024310111999512, "num_input_tokens_seen": 732828608, "step": 16760, "train_runtime": 129653.8465, "train_tokens_per_second": 5652.193 }, { "epoch": 1.1288042014543496, "grad_norm": 0.8768820968683303, "learning_rate": 3.995779986779139e-06, "loss": 0.3032145738601685, "num_input_tokens_seen": 733030240, "step": 16765, "train_runtime": 129696.2491, "train_tokens_per_second": 5651.9 }, { "epoch": 1.1291408564503098, "grad_norm": 0.7571543524283587, "learning_rate": 3.9931899229933204e-06, "loss": 0.32830450534820554, "num_input_tokens_seen": 733249296, "step": 16770, "train_runtime": 129729.1458, "train_tokens_per_second": 5652.155 }, { "epoch": 1.1294775114462698, "grad_norm": 0.7464218260015815, "learning_rate": 3.990600140758731e-06, "loss": 0.3006105422973633, "num_input_tokens_seen": 733474720, "step": 16775, "train_runtime": 129763.0451, "train_tokens_per_second": 5652.416 }, { "epoch": 1.12981416644223, "grad_norm": 0.6221590957693296, "learning_rate": 3.988010640799591e-06, "loss": 0.2877049922943115, "num_input_tokens_seen": 733694216, "step": 16780, "train_runtime": 129806.6164, "train_tokens_per_second": 5652.21 }, { "epoch": 1.1301508214381901, "grad_norm": 0.8483974664089013, "learning_rate": 3.985421423840051e-06, "loss": 0.33561320304870607, "num_input_tokens_seen": 733906352, "step": 16785, "train_runtime": 129844.4587, "train_tokens_per_second": 5652.196 }, { "epoch": 1.1304874764341504, "grad_norm": 0.7448892261292801, "learning_rate": 3.982832490604173e-06, "loss": 0.28998355865478515, "num_input_tokens_seen": 734133280, "step": 16790, "train_runtime": 129888.8092, "train_tokens_per_second": 5652.013 }, { "epoch": 1.1308241314301104, "grad_norm": 0.8527357235171165, "learning_rate": 3.9802438418159465e-06, "loss": 0.3185850143432617, "num_input_tokens_seen": 734371888, "step": 16795, "train_runtime": 129928.7672, "train_tokens_per_second": 5652.112 }, { "epoch": 1.1311607864260707, "grad_norm": 0.7819044120460309, "learning_rate": 3.977655478199275e-06, "loss": 0.32431769371032715, "num_input_tokens_seen": 734599608, "step": 16800, "train_runtime": 129969.4055, "train_tokens_per_second": 5652.096 }, { "epoch": 1.1314974414220307, "grad_norm": 0.7998665202892938, "learning_rate": 3.975067400477993e-06, "loss": 0.3372927188873291, "num_input_tokens_seen": 734795752, "step": 16805, "train_runtime": 130003.7743, "train_tokens_per_second": 5652.111 }, { "epoch": 1.131834096417991, "grad_norm": 0.7814987669774647, "learning_rate": 3.972479609375842e-06, "loss": 0.31949615478515625, "num_input_tokens_seen": 735021664, "step": 16810, "train_runtime": 130042.9188, "train_tokens_per_second": 5652.147 }, { "epoch": 1.132170751413951, "grad_norm": 0.7598227623059015, "learning_rate": 3.969892105616492e-06, "loss": 0.31243975162506105, "num_input_tokens_seen": 735246192, "step": 16815, "train_runtime": 130079.0722, "train_tokens_per_second": 5652.302 }, { "epoch": 1.1325074064099112, "grad_norm": 1.1084494733823549, "learning_rate": 3.967304889923529e-06, "loss": 0.30039591789245607, "num_input_tokens_seen": 735462560, "step": 16820, "train_runtime": 130118.6173, "train_tokens_per_second": 5652.247 }, { "epoch": 1.1328440614058712, "grad_norm": 0.8395955074548532, "learning_rate": 3.964717963020463e-06, "loss": 0.3070765256881714, "num_input_tokens_seen": 735678824, "step": 16825, "train_runtime": 130155.0309, "train_tokens_per_second": 5652.327 }, { "epoch": 1.1331807164018315, "grad_norm": 0.7687120040297668, "learning_rate": 3.962131325630715e-06, "loss": 0.29083225727081297, "num_input_tokens_seen": 735911416, "step": 16830, "train_runtime": 130203.9338, "train_tokens_per_second": 5651.991 }, { "epoch": 1.1335173713977915, "grad_norm": 0.8425980087790549, "learning_rate": 3.959544978477634e-06, "loss": 0.33116788864135743, "num_input_tokens_seen": 736118352, "step": 16835, "train_runtime": 130242.9795, "train_tokens_per_second": 5651.885 }, { "epoch": 1.1338540263937518, "grad_norm": 0.6639463454020782, "learning_rate": 3.9569589222844805e-06, "loss": 0.31282644271850585, "num_input_tokens_seen": 736333424, "step": 16840, "train_runtime": 130287.4137, "train_tokens_per_second": 5651.608 }, { "epoch": 1.1341906813897118, "grad_norm": 0.7757792448332916, "learning_rate": 3.954373157774439e-06, "loss": 0.3130516052246094, "num_input_tokens_seen": 736558888, "step": 16845, "train_runtime": 130324.2351, "train_tokens_per_second": 5651.742 }, { "epoch": 1.134527336385672, "grad_norm": 0.8187765783249485, "learning_rate": 3.951787685670609e-06, "loss": 0.3079373359680176, "num_input_tokens_seen": 736782672, "step": 16850, "train_runtime": 130363.4678, "train_tokens_per_second": 5651.757 }, { "epoch": 1.134863991381632, "grad_norm": 0.7794193428094371, "learning_rate": 3.949202506696012e-06, "loss": 0.315033483505249, "num_input_tokens_seen": 736994032, "step": 16855, "train_runtime": 130400.0871, "train_tokens_per_second": 5651.791 }, { "epoch": 1.1352006463775923, "grad_norm": 0.7253716724703653, "learning_rate": 3.946617621573581e-06, "loss": 0.3076453685760498, "num_input_tokens_seen": 737227128, "step": 16860, "train_runtime": 130441.2278, "train_tokens_per_second": 5651.795 }, { "epoch": 1.1355373013735524, "grad_norm": 0.8240959096061262, "learning_rate": 3.944033031026175e-06, "loss": 0.2819002628326416, "num_input_tokens_seen": 737425512, "step": 16865, "train_runtime": 130480.7005, "train_tokens_per_second": 5651.606 }, { "epoch": 1.1358739563695126, "grad_norm": 0.7359564971034284, "learning_rate": 3.941448735776563e-06, "loss": 0.3037100791931152, "num_input_tokens_seen": 737645856, "step": 16870, "train_runtime": 130515.6474, "train_tokens_per_second": 5651.781 }, { "epoch": 1.1362106113654726, "grad_norm": 0.7004505644549724, "learning_rate": 3.938864736547439e-06, "loss": 0.31839513778686523, "num_input_tokens_seen": 737874128, "step": 16875, "train_runtime": 130552.8691, "train_tokens_per_second": 5651.918 }, { "epoch": 1.1365472663614329, "grad_norm": 1.9350046761541768, "learning_rate": 3.936281034061405e-06, "loss": 0.2992375135421753, "num_input_tokens_seen": 738099488, "step": 16880, "train_runtime": 130593.8162, "train_tokens_per_second": 5651.872 }, { "epoch": 1.136883921357393, "grad_norm": 0.7114720599403541, "learning_rate": 3.93369762904099e-06, "loss": 0.3111462354660034, "num_input_tokens_seen": 738305920, "step": 16885, "train_runtime": 130639.1413, "train_tokens_per_second": 5651.491 }, { "epoch": 1.1372205763533532, "grad_norm": 0.7657629856292947, "learning_rate": 3.931114522208631e-06, "loss": 0.3166337251663208, "num_input_tokens_seen": 738508624, "step": 16890, "train_runtime": 130682.7388, "train_tokens_per_second": 5651.157 }, { "epoch": 1.1375572313493132, "grad_norm": 0.7692834919287869, "learning_rate": 3.928531714286689e-06, "loss": 0.30945444107055664, "num_input_tokens_seen": 738732992, "step": 16895, "train_runtime": 130719.4165, "train_tokens_per_second": 5651.287 }, { "epoch": 1.1378938863452734, "grad_norm": 0.8278288727680423, "learning_rate": 3.925949205997434e-06, "loss": 0.32941608428955077, "num_input_tokens_seen": 738942840, "step": 16900, "train_runtime": 130761.9137, "train_tokens_per_second": 5651.056 }, { "epoch": 1.1382305413412335, "grad_norm": 0.7724135944921471, "learning_rate": 3.923366998063062e-06, "loss": 0.2874737739562988, "num_input_tokens_seen": 739155240, "step": 16905, "train_runtime": 130801.6692, "train_tokens_per_second": 5650.962 }, { "epoch": 1.1385671963371937, "grad_norm": 0.6482256296875065, "learning_rate": 3.920785091205674e-06, "loss": 0.27861971855163575, "num_input_tokens_seen": 739385256, "step": 16910, "train_runtime": 130835.4441, "train_tokens_per_second": 5651.261 }, { "epoch": 1.1389038513331537, "grad_norm": 0.8189363341827849, "learning_rate": 3.918203486147294e-06, "loss": 0.34842791557312014, "num_input_tokens_seen": 739594936, "step": 16915, "train_runtime": 130876.0263, "train_tokens_per_second": 5651.111 }, { "epoch": 1.139240506329114, "grad_norm": 0.8291380348485267, "learning_rate": 3.9156221836098594e-06, "loss": 0.3238081455230713, "num_input_tokens_seen": 739819304, "step": 16920, "train_runtime": 130912.2289, "train_tokens_per_second": 5651.262 }, { "epoch": 1.139577161325074, "grad_norm": 0.7047778409887597, "learning_rate": 3.913041184315224e-06, "loss": 0.3074013710021973, "num_input_tokens_seen": 740033032, "step": 16925, "train_runtime": 130954.6922, "train_tokens_per_second": 5651.062 }, { "epoch": 1.1399138163210343, "grad_norm": 0.8050080201528949, "learning_rate": 3.910460488985154e-06, "loss": 0.3118597030639648, "num_input_tokens_seen": 740249656, "step": 16930, "train_runtime": 131003.4754, "train_tokens_per_second": 5650.611 }, { "epoch": 1.1402504713169943, "grad_norm": 0.727734150500772, "learning_rate": 3.9078800983413355e-06, "loss": 0.3097679138183594, "num_input_tokens_seen": 740474224, "step": 16935, "train_runtime": 131039.7311, "train_tokens_per_second": 5650.761 }, { "epoch": 1.1405871263129546, "grad_norm": 0.7396507242655731, "learning_rate": 3.905300013105365e-06, "loss": 0.2923974752426147, "num_input_tokens_seen": 740697112, "step": 16940, "train_runtime": 131079.5559, "train_tokens_per_second": 5650.745 }, { "epoch": 1.1409237813089146, "grad_norm": 0.8383241709134363, "learning_rate": 3.902720233998754e-06, "loss": 0.30002388954162595, "num_input_tokens_seen": 740910376, "step": 16945, "train_runtime": 131116.3686, "train_tokens_per_second": 5650.785 }, { "epoch": 1.1412604363048748, "grad_norm": 0.7028544654776611, "learning_rate": 3.90014076174293e-06, "loss": 0.31175391674041747, "num_input_tokens_seen": 741133216, "step": 16950, "train_runtime": 131156.2994, "train_tokens_per_second": 5650.763 }, { "epoch": 1.1415970913008349, "grad_norm": 0.6785576189006745, "learning_rate": 3.897561597059237e-06, "loss": 0.2938354253768921, "num_input_tokens_seen": 741357712, "step": 16955, "train_runtime": 131193.385, "train_tokens_per_second": 5650.877 }, { "epoch": 1.1419337462967951, "grad_norm": 0.720906429135837, "learning_rate": 3.894982740668927e-06, "loss": 0.29590883255004885, "num_input_tokens_seen": 741562560, "step": 16960, "train_runtime": 131227.1172, "train_tokens_per_second": 5650.986 }, { "epoch": 1.1422704012927551, "grad_norm": 0.7501425891472119, "learning_rate": 3.89240419329317e-06, "loss": 0.3243727207183838, "num_input_tokens_seen": 741804536, "step": 16965, "train_runtime": 131263.585, "train_tokens_per_second": 5651.259 }, { "epoch": 1.1426070562887154, "grad_norm": 0.7110651173816877, "learning_rate": 3.889825955653046e-06, "loss": 0.31747913360595703, "num_input_tokens_seen": 742023480, "step": 16970, "train_runtime": 131299.3451, "train_tokens_per_second": 5651.388 }, { "epoch": 1.1429437112846754, "grad_norm": 0.7195903483502709, "learning_rate": 3.887248028469558e-06, "loss": 0.2832490921020508, "num_input_tokens_seen": 742258408, "step": 16975, "train_runtime": 131333.0196, "train_tokens_per_second": 5651.727 }, { "epoch": 1.1432803662806357, "grad_norm": 1.0763044494541907, "learning_rate": 3.884670412463607e-06, "loss": 0.2930821657180786, "num_input_tokens_seen": 742474896, "step": 16980, "train_runtime": 131371.6188, "train_tokens_per_second": 5651.715 }, { "epoch": 1.1436170212765957, "grad_norm": 0.7486899797692392, "learning_rate": 3.8820931083560194e-06, "loss": 0.31524713039398194, "num_input_tokens_seen": 742680248, "step": 16985, "train_runtime": 131410.9057, "train_tokens_per_second": 5651.588 }, { "epoch": 1.143953676272556, "grad_norm": 0.7165743405717724, "learning_rate": 3.879516116867531e-06, "loss": 0.29150216579437255, "num_input_tokens_seen": 742894640, "step": 16990, "train_runtime": 131445.9029, "train_tokens_per_second": 5651.714 }, { "epoch": 1.144290331268516, "grad_norm": 0.8121082083066077, "learning_rate": 3.876939438718786e-06, "loss": 0.30789361000061033, "num_input_tokens_seen": 743112224, "step": 16995, "train_runtime": 131487.3253, "train_tokens_per_second": 5651.588 }, { "epoch": 1.1446269862644762, "grad_norm": 0.7621739149221717, "learning_rate": 3.874363074630345e-06, "loss": 0.28911523818969725, "num_input_tokens_seen": 743319176, "step": 17000, "train_runtime": 131524.9073, "train_tokens_per_second": 5651.547 }, { "epoch": 1.1449636412604363, "grad_norm": 0.7737775948010384, "learning_rate": 3.871787025322681e-06, "loss": 0.3129148006439209, "num_input_tokens_seen": 743545736, "step": 17005, "train_runtime": 131561.9387, "train_tokens_per_second": 5651.678 }, { "epoch": 1.1453002962563965, "grad_norm": 0.7555308668544749, "learning_rate": 3.86921129151618e-06, "loss": 0.3087345361709595, "num_input_tokens_seen": 743756824, "step": 17010, "train_runtime": 131596.877, "train_tokens_per_second": 5651.782 }, { "epoch": 1.1456369512523565, "grad_norm": 0.7822771296052244, "learning_rate": 3.866635873931133e-06, "loss": 0.3323315143585205, "num_input_tokens_seen": 743968848, "step": 17015, "train_runtime": 131635.333, "train_tokens_per_second": 5651.741 }, { "epoch": 1.1459736062483168, "grad_norm": 0.750133051806931, "learning_rate": 3.864060773287751e-06, "loss": 0.3157732725143433, "num_input_tokens_seen": 744191936, "step": 17020, "train_runtime": 131677.9874, "train_tokens_per_second": 5651.605 }, { "epoch": 1.1463102612442768, "grad_norm": 0.750658874065227, "learning_rate": 3.861485990306151e-06, "loss": 0.3161588191986084, "num_input_tokens_seen": 744416472, "step": 17025, "train_runtime": 131722.5155, "train_tokens_per_second": 5651.399 }, { "epoch": 1.146646916240237, "grad_norm": 0.7657095158045504, "learning_rate": 3.858911525706365e-06, "loss": 0.3021253108978271, "num_input_tokens_seen": 744645048, "step": 17030, "train_runtime": 131759.7192, "train_tokens_per_second": 5651.538 }, { "epoch": 1.146983571236197, "grad_norm": 0.8025594627650351, "learning_rate": 3.85633738020833e-06, "loss": 0.34988272190093994, "num_input_tokens_seen": 744878048, "step": 17035, "train_runtime": 131794.0086, "train_tokens_per_second": 5651.835 }, { "epoch": 1.1473202262321573, "grad_norm": 0.7709002150890326, "learning_rate": 3.853763554531902e-06, "loss": 0.3174929618835449, "num_input_tokens_seen": 745082920, "step": 17040, "train_runtime": 131829.24, "train_tokens_per_second": 5651.879 }, { "epoch": 1.1476568812281174, "grad_norm": 0.715665166170693, "learning_rate": 3.851190049396839e-06, "loss": 0.2886343479156494, "num_input_tokens_seen": 745302104, "step": 17045, "train_runtime": 131865.7716, "train_tokens_per_second": 5651.975 }, { "epoch": 1.1479935362240776, "grad_norm": 0.7364852648051009, "learning_rate": 3.848616865522815e-06, "loss": 0.31344852447509763, "num_input_tokens_seen": 745522704, "step": 17050, "train_runtime": 131907.8212, "train_tokens_per_second": 5651.846 }, { "epoch": 1.1483301912200377, "grad_norm": 0.7409016478894407, "learning_rate": 3.846044003629414e-06, "loss": 0.30931525230407714, "num_input_tokens_seen": 745742992, "step": 17055, "train_runtime": 131945.4567, "train_tokens_per_second": 5651.904 }, { "epoch": 1.148666846215998, "grad_norm": 0.7178354231276903, "learning_rate": 3.843471464436128e-06, "loss": 0.2803271055221558, "num_input_tokens_seen": 745942912, "step": 17060, "train_runtime": 131989.4344, "train_tokens_per_second": 5651.535 }, { "epoch": 1.149003501211958, "grad_norm": 0.787297382407357, "learning_rate": 3.840899248662358e-06, "loss": 0.33543803691864016, "num_input_tokens_seen": 746154376, "step": 17065, "train_runtime": 132025.9108, "train_tokens_per_second": 5651.575 }, { "epoch": 1.1493401562079182, "grad_norm": 0.7696262614580517, "learning_rate": 3.838327357027419e-06, "loss": 0.32558441162109375, "num_input_tokens_seen": 746367240, "step": 17070, "train_runtime": 132064.2315, "train_tokens_per_second": 5651.547 }, { "epoch": 1.1496768112038782, "grad_norm": 0.726552691405123, "learning_rate": 3.835755790250528e-06, "loss": 0.3117891550064087, "num_input_tokens_seen": 746592480, "step": 17075, "train_runtime": 132101.1976, "train_tokens_per_second": 5651.671 }, { "epoch": 1.1500134661998385, "grad_norm": 0.650793107544695, "learning_rate": 3.83318454905082e-06, "loss": 0.2934911251068115, "num_input_tokens_seen": 746818640, "step": 17080, "train_runtime": 132143.7046, "train_tokens_per_second": 5651.564 }, { "epoch": 1.1503501211957985, "grad_norm": 0.7704916837868131, "learning_rate": 3.830613634147331e-06, "loss": 0.32155680656433105, "num_input_tokens_seen": 747039496, "step": 17085, "train_runtime": 132184.8265, "train_tokens_per_second": 5651.477 }, { "epoch": 1.1506867761917587, "grad_norm": 0.720317163934302, "learning_rate": 3.82804304625901e-06, "loss": 0.3073138236999512, "num_input_tokens_seen": 747272792, "step": 17090, "train_runtime": 132220.525, "train_tokens_per_second": 5651.716 }, { "epoch": 1.1510234311877188, "grad_norm": 0.7743031429870126, "learning_rate": 3.825472786104715e-06, "loss": 0.2988899707794189, "num_input_tokens_seen": 747507048, "step": 17095, "train_runtime": 132256.7682, "train_tokens_per_second": 5651.938 }, { "epoch": 1.151360086183679, "grad_norm": 0.8974847495064373, "learning_rate": 3.8229028544032095e-06, "loss": 0.3167643308639526, "num_input_tokens_seen": 747707608, "step": 17100, "train_runtime": 132298.3666, "train_tokens_per_second": 5651.677 }, { "epoch": 1.151696741179639, "grad_norm": 0.8824423710352778, "learning_rate": 3.8203332518731666e-06, "loss": 0.3144956111907959, "num_input_tokens_seen": 747928560, "step": 17105, "train_runtime": 132333.3063, "train_tokens_per_second": 5651.854 }, { "epoch": 1.1520333961755993, "grad_norm": 0.6533415062560854, "learning_rate": 3.8177639792331695e-06, "loss": 0.3034801483154297, "num_input_tokens_seen": 748157856, "step": 17110, "train_runtime": 132372.8474, "train_tokens_per_second": 5651.898 }, { "epoch": 1.1523700511715593, "grad_norm": 0.9418120724183658, "learning_rate": 3.815195037201704e-06, "loss": 0.34812791347503663, "num_input_tokens_seen": 748364016, "step": 17115, "train_runtime": 132412.7976, "train_tokens_per_second": 5651.75 }, { "epoch": 1.1527067061675196, "grad_norm": 0.7569217027983804, "learning_rate": 3.8126264264971694e-06, "loss": 0.321405029296875, "num_input_tokens_seen": 748586232, "step": 17120, "train_runtime": 132454.6523, "train_tokens_per_second": 5651.642 }, { "epoch": 1.1530433611634796, "grad_norm": 0.7524862294811008, "learning_rate": 3.8100581478378673e-06, "loss": 0.3137218952178955, "num_input_tokens_seen": 748805128, "step": 17125, "train_runtime": 132492.9601, "train_tokens_per_second": 5651.66 }, { "epoch": 1.1533800161594399, "grad_norm": 0.7796331102294818, "learning_rate": 3.807490201942012e-06, "loss": 0.3160563468933105, "num_input_tokens_seen": 749027264, "step": 17130, "train_runtime": 132527.0569, "train_tokens_per_second": 5651.882 }, { "epoch": 1.1537166711553999, "grad_norm": 0.774378899106255, "learning_rate": 3.804922589527717e-06, "loss": 0.29862165451049805, "num_input_tokens_seen": 749243080, "step": 17135, "train_runtime": 132567.1494, "train_tokens_per_second": 5651.8 }, { "epoch": 1.1540533261513601, "grad_norm": 0.7096741310187692, "learning_rate": 3.8023553113130096e-06, "loss": 0.3242902040481567, "num_input_tokens_seen": 749478816, "step": 17140, "train_runtime": 132602.8293, "train_tokens_per_second": 5652.058 }, { "epoch": 1.1543899811473202, "grad_norm": 0.7242850071624176, "learning_rate": 3.799788368015821e-06, "loss": 0.28427910804748535, "num_input_tokens_seen": 749699336, "step": 17145, "train_runtime": 132642.0928, "train_tokens_per_second": 5652.047 }, { "epoch": 1.1547266361432804, "grad_norm": 0.8411805719100419, "learning_rate": 3.7972217603539873e-06, "loss": 0.30901274681091306, "num_input_tokens_seen": 749905168, "step": 17150, "train_runtime": 132681.4222, "train_tokens_per_second": 5651.923 }, { "epoch": 1.1550632911392404, "grad_norm": 0.7527979126590726, "learning_rate": 3.7946554890452524e-06, "loss": 0.3213947772979736, "num_input_tokens_seen": 750135464, "step": 17155, "train_runtime": 132719.6511, "train_tokens_per_second": 5652.03 }, { "epoch": 1.1553999461352007, "grad_norm": 0.7550688889586102, "learning_rate": 3.792089554807269e-06, "loss": 0.3054837226867676, "num_input_tokens_seen": 750362056, "step": 17160, "train_runtime": 132761.8356, "train_tokens_per_second": 5651.941 }, { "epoch": 1.1557366011311607, "grad_norm": 0.8245885062079921, "learning_rate": 3.789523958357587e-06, "loss": 0.3161867618560791, "num_input_tokens_seen": 750572160, "step": 17165, "train_runtime": 132802.089, "train_tokens_per_second": 5651.81 }, { "epoch": 1.156073256127121, "grad_norm": 0.700436201047616, "learning_rate": 3.7869587004136714e-06, "loss": 0.2760681390762329, "num_input_tokens_seen": 750802552, "step": 17170, "train_runtime": 132839.9318, "train_tokens_per_second": 5651.934 }, { "epoch": 1.156409911123081, "grad_norm": 0.7117777773350229, "learning_rate": 3.7843937816928864e-06, "loss": 0.3197911262512207, "num_input_tokens_seen": 751031672, "step": 17175, "train_runtime": 132884.5398, "train_tokens_per_second": 5651.761 }, { "epoch": 1.1567465661190413, "grad_norm": 0.7963520839657313, "learning_rate": 3.781829202912506e-06, "loss": 0.3260814666748047, "num_input_tokens_seen": 751243800, "step": 17180, "train_runtime": 132921.2705, "train_tokens_per_second": 5651.795 }, { "epoch": 1.1570832211150013, "grad_norm": 0.735123307982365, "learning_rate": 3.7792649647897023e-06, "loss": 0.3070995807647705, "num_input_tokens_seen": 751468240, "step": 17185, "train_runtime": 132963.3105, "train_tokens_per_second": 5651.696 }, { "epoch": 1.1574198761109615, "grad_norm": 0.7383532177231918, "learning_rate": 3.7767010680415595e-06, "loss": 0.30820441246032715, "num_input_tokens_seen": 751680248, "step": 17190, "train_runtime": 133002.5463, "train_tokens_per_second": 5651.623 }, { "epoch": 1.1577565311069216, "grad_norm": 0.8213108428390675, "learning_rate": 3.774137513385061e-06, "loss": 0.3007169008255005, "num_input_tokens_seen": 751897104, "step": 17195, "train_runtime": 133050.5633, "train_tokens_per_second": 5651.213 }, { "epoch": 1.1580931861028818, "grad_norm": 0.6991961330303099, "learning_rate": 3.7715743015371005e-06, "loss": 0.316827392578125, "num_input_tokens_seen": 752126600, "step": 17200, "train_runtime": 133089.0112, "train_tokens_per_second": 5651.305 }, { "epoch": 1.1584298410988418, "grad_norm": 0.6752546760035666, "learning_rate": 3.769011433214467e-06, "loss": 0.28647899627685547, "num_input_tokens_seen": 752350528, "step": 17205, "train_runtime": 133130.5351, "train_tokens_per_second": 5651.224 }, { "epoch": 1.158766496094802, "grad_norm": 0.7193811538704217, "learning_rate": 3.766448909133863e-06, "loss": 0.32767200469970703, "num_input_tokens_seen": 752583080, "step": 17210, "train_runtime": 133161.9958, "train_tokens_per_second": 5651.636 }, { "epoch": 1.1591031510907621, "grad_norm": 0.774174630991004, "learning_rate": 3.7638867300118864e-06, "loss": 0.29516313076019285, "num_input_tokens_seen": 752794792, "step": 17215, "train_runtime": 133198.9108, "train_tokens_per_second": 5651.659 }, { "epoch": 1.1594398060867224, "grad_norm": 0.810354987252184, "learning_rate": 3.7613248965650447e-06, "loss": 0.2927243709564209, "num_input_tokens_seen": 753018152, "step": 17220, "train_runtime": 133236.819, "train_tokens_per_second": 5651.727 }, { "epoch": 1.1597764610826824, "grad_norm": 0.7109008764685462, "learning_rate": 3.758763409509745e-06, "loss": 0.3014249324798584, "num_input_tokens_seen": 753245648, "step": 17225, "train_runtime": 133276.7031, "train_tokens_per_second": 5651.743 }, { "epoch": 1.1601131160786426, "grad_norm": 0.8029128503628568, "learning_rate": 3.7562022695623013e-06, "loss": 0.3143294334411621, "num_input_tokens_seen": 753463144, "step": 17230, "train_runtime": 133315.2382, "train_tokens_per_second": 5651.741 }, { "epoch": 1.1604497710746027, "grad_norm": 0.6493145264817488, "learning_rate": 3.7536414774389252e-06, "loss": 0.3114176273345947, "num_input_tokens_seen": 753687504, "step": 17235, "train_runtime": 133354.768, "train_tokens_per_second": 5651.748 }, { "epoch": 1.160786426070563, "grad_norm": 0.7972007226513281, "learning_rate": 3.7510810338557363e-06, "loss": 0.2993874788284302, "num_input_tokens_seen": 753893032, "step": 17240, "train_runtime": 133399.0853, "train_tokens_per_second": 5651.411 }, { "epoch": 1.161123081066523, "grad_norm": 0.7446879758207031, "learning_rate": 3.748520939528753e-06, "loss": 0.30895147323608396, "num_input_tokens_seen": 754112432, "step": 17245, "train_runtime": 133440.2549, "train_tokens_per_second": 5651.311 }, { "epoch": 1.1614597360624832, "grad_norm": 0.7281872851418484, "learning_rate": 3.7459611951739007e-06, "loss": 0.3002096891403198, "num_input_tokens_seen": 754338736, "step": 17250, "train_runtime": 133481.8765, "train_tokens_per_second": 5651.245 }, { "epoch": 1.1617963910584432, "grad_norm": 0.7431634131632837, "learning_rate": 3.7434018015069984e-06, "loss": 0.3243889093399048, "num_input_tokens_seen": 754559056, "step": 17255, "train_runtime": 133525.754, "train_tokens_per_second": 5651.038 }, { "epoch": 1.1621330460544035, "grad_norm": 0.8324688332558176, "learning_rate": 3.740842759243778e-06, "loss": 0.3150045871734619, "num_input_tokens_seen": 754778800, "step": 17260, "train_runtime": 133565.7133, "train_tokens_per_second": 5650.992 }, { "epoch": 1.1624697010503635, "grad_norm": 0.6921071488758873, "learning_rate": 3.738284069099862e-06, "loss": 0.28803367614746095, "num_input_tokens_seen": 755011760, "step": 17265, "train_runtime": 133605.0409, "train_tokens_per_second": 5651.072 }, { "epoch": 1.1628063560463238, "grad_norm": 0.7280978950943039, "learning_rate": 3.735725731790785e-06, "loss": 0.31182174682617186, "num_input_tokens_seen": 755236808, "step": 17270, "train_runtime": 133638.2275, "train_tokens_per_second": 5651.353 }, { "epoch": 1.1631430110422838, "grad_norm": 0.7658534531818101, "learning_rate": 3.733167748031974e-06, "loss": 0.3179009914398193, "num_input_tokens_seen": 755464248, "step": 17275, "train_runtime": 133676.324, "train_tokens_per_second": 5651.444 }, { "epoch": 1.163479666038244, "grad_norm": 0.7211234703667541, "learning_rate": 3.7306101185387646e-06, "loss": 0.3087700366973877, "num_input_tokens_seen": 755687464, "step": 17280, "train_runtime": 133717.1549, "train_tokens_per_second": 5651.388 }, { "epoch": 1.163816321034204, "grad_norm": 0.7824239357354816, "learning_rate": 3.728052844026386e-06, "loss": 0.3141305923461914, "num_input_tokens_seen": 755907672, "step": 17285, "train_runtime": 133760.0292, "train_tokens_per_second": 5651.222 }, { "epoch": 1.1641529760301643, "grad_norm": 0.7951750585384382, "learning_rate": 3.7254959252099745e-06, "loss": 0.3007349014282227, "num_input_tokens_seen": 756114320, "step": 17290, "train_runtime": 133800.4505, "train_tokens_per_second": 5651.06 }, { "epoch": 1.1644896310261243, "grad_norm": 0.7638584288959342, "learning_rate": 3.7229393628045617e-06, "loss": 0.2961156368255615, "num_input_tokens_seen": 756338136, "step": 17295, "train_runtime": 133836.5594, "train_tokens_per_second": 5651.207 }, { "epoch": 1.1648262860220846, "grad_norm": 0.7194065626433747, "learning_rate": 3.720383157525087e-06, "loss": 0.2917820453643799, "num_input_tokens_seen": 756556624, "step": 17300, "train_runtime": 133876.3071, "train_tokens_per_second": 5651.161 }, { "epoch": 1.1651629410180446, "grad_norm": 0.8023605053763685, "learning_rate": 3.717827310086379e-06, "loss": 0.3004648685455322, "num_input_tokens_seen": 756770512, "step": 17305, "train_runtime": 133914.1223, "train_tokens_per_second": 5651.163 }, { "epoch": 1.1654995960140049, "grad_norm": 0.778357180423363, "learning_rate": 3.7152718212031778e-06, "loss": 0.31314473152160643, "num_input_tokens_seen": 756987488, "step": 17310, "train_runtime": 133957.8798, "train_tokens_per_second": 5650.937 }, { "epoch": 1.165836251009965, "grad_norm": 0.8275289683679823, "learning_rate": 3.7127166915901123e-06, "loss": 0.33815641403198243, "num_input_tokens_seen": 757190888, "step": 17315, "train_runtime": 133995.0668, "train_tokens_per_second": 5650.886 }, { "epoch": 1.1661729060059252, "grad_norm": 0.8112349556897875, "learning_rate": 3.710161921961721e-06, "loss": 0.3213828086853027, "num_input_tokens_seen": 757406736, "step": 17320, "train_runtime": 134033.0013, "train_tokens_per_second": 5650.897 }, { "epoch": 1.1665095610018852, "grad_norm": 0.7412368352707359, "learning_rate": 3.707607513032434e-06, "loss": 0.29859418869018556, "num_input_tokens_seen": 757621448, "step": 17325, "train_runtime": 134070.8112, "train_tokens_per_second": 5650.905 }, { "epoch": 1.1668462159978454, "grad_norm": 0.8530421631271973, "learning_rate": 3.705053465516587e-06, "loss": 0.2971299171447754, "num_input_tokens_seen": 757842136, "step": 17330, "train_runtime": 134106.2945, "train_tokens_per_second": 5651.056 }, { "epoch": 1.1671828709938055, "grad_norm": 0.7217367075989789, "learning_rate": 3.702499780128407e-06, "loss": 0.2950276851654053, "num_input_tokens_seen": 758048560, "step": 17335, "train_runtime": 134146.644, "train_tokens_per_second": 5650.895 }, { "epoch": 1.1675195259897657, "grad_norm": 1.8887784795675984, "learning_rate": 3.6999464575820266e-06, "loss": 0.3086616277694702, "num_input_tokens_seen": 758266576, "step": 17340, "train_runtime": 134185.9605, "train_tokens_per_second": 5650.864 }, { "epoch": 1.1678561809857257, "grad_norm": 0.6843592201114646, "learning_rate": 3.697393498591473e-06, "loss": 0.3014980792999268, "num_input_tokens_seen": 758487384, "step": 17345, "train_runtime": 134230.8121, "train_tokens_per_second": 5650.621 }, { "epoch": 1.168192835981686, "grad_norm": 0.8394323507587605, "learning_rate": 3.694840903870676e-06, "loss": 0.32812952995300293, "num_input_tokens_seen": 758704816, "step": 17350, "train_runtime": 134266.4562, "train_tokens_per_second": 5650.74 }, { "epoch": 1.168529490977646, "grad_norm": 0.7479174116708699, "learning_rate": 3.6922886741334564e-06, "loss": 0.3267998695373535, "num_input_tokens_seen": 758924344, "step": 17355, "train_runtime": 134305.3103, "train_tokens_per_second": 5650.74 }, { "epoch": 1.1688661459736063, "grad_norm": 0.7136771552457577, "learning_rate": 3.689736810093541e-06, "loss": 0.2991864442825317, "num_input_tokens_seen": 759152032, "step": 17360, "train_runtime": 134342.9756, "train_tokens_per_second": 5650.85 }, { "epoch": 1.1692028009695663, "grad_norm": 0.850190780847832, "learning_rate": 3.6871853124645464e-06, "loss": 0.31711387634277344, "num_input_tokens_seen": 759378848, "step": 17365, "train_runtime": 134382.3965, "train_tokens_per_second": 5650.88 }, { "epoch": 1.1695394559655266, "grad_norm": 0.6756862427689906, "learning_rate": 3.684634181959994e-06, "loss": 0.30228276252746583, "num_input_tokens_seen": 759614152, "step": 17370, "train_runtime": 134422.1735, "train_tokens_per_second": 5650.959 }, { "epoch": 1.1698761109614866, "grad_norm": 0.9293848953693671, "learning_rate": 3.6820834192932974e-06, "loss": 0.3172401666641235, "num_input_tokens_seen": 759830040, "step": 17375, "train_runtime": 134460.803, "train_tokens_per_second": 5650.941 }, { "epoch": 1.1702127659574468, "grad_norm": 0.7492817955305227, "learning_rate": 3.679533025177772e-06, "loss": 0.3354950904846191, "num_input_tokens_seen": 760073280, "step": 17380, "train_runtime": 134496.7214, "train_tokens_per_second": 5651.24 }, { "epoch": 1.1705494209534069, "grad_norm": 0.7424725386974647, "learning_rate": 3.6769830003266234e-06, "loss": 0.31007990837097166, "num_input_tokens_seen": 760294432, "step": 17385, "train_runtime": 134528.7303, "train_tokens_per_second": 5651.539 }, { "epoch": 1.1708860759493671, "grad_norm": 0.7790858025441731, "learning_rate": 3.6744333454529607e-06, "loss": 0.3161858081817627, "num_input_tokens_seen": 760522824, "step": 17390, "train_runtime": 134571.7613, "train_tokens_per_second": 5651.43 }, { "epoch": 1.1712227309453271, "grad_norm": 0.6903404727708745, "learning_rate": 3.6718840612697847e-06, "loss": 0.3075212001800537, "num_input_tokens_seen": 760757728, "step": 17395, "train_runtime": 134611.0442, "train_tokens_per_second": 5651.525 }, { "epoch": 1.1715593859412874, "grad_norm": 0.7365357926688636, "learning_rate": 3.6693351484899986e-06, "loss": 0.3011133670806885, "num_input_tokens_seen": 760969040, "step": 17400, "train_runtime": 134643.3087, "train_tokens_per_second": 5651.74 }, { "epoch": 1.1718960409372474, "grad_norm": 1.0260127216999277, "learning_rate": 3.6667866078263937e-06, "loss": 0.30281815528869627, "num_input_tokens_seen": 761178944, "step": 17405, "train_runtime": 134680.0119, "train_tokens_per_second": 5651.759 }, { "epoch": 1.1722326959332077, "grad_norm": 0.8315108294093327, "learning_rate": 3.664238439991663e-06, "loss": 0.34009361267089844, "num_input_tokens_seen": 761396128, "step": 17410, "train_runtime": 134717.5677, "train_tokens_per_second": 5651.795 }, { "epoch": 1.1725693509291677, "grad_norm": 0.7676177184346961, "learning_rate": 3.6616906456983925e-06, "loss": 0.3160113334655762, "num_input_tokens_seen": 761617984, "step": 17415, "train_runtime": 134752.1162, "train_tokens_per_second": 5651.993 }, { "epoch": 1.172906005925128, "grad_norm": 0.7720738410000789, "learning_rate": 3.659143225659065e-06, "loss": 0.32563726902008056, "num_input_tokens_seen": 761835752, "step": 17420, "train_runtime": 134789.1882, "train_tokens_per_second": 5652.054 }, { "epoch": 1.173242660921088, "grad_norm": 0.6926475609016922, "learning_rate": 3.6565961805860595e-06, "loss": 0.30316720008850095, "num_input_tokens_seen": 762067720, "step": 17425, "train_runtime": 134833.4769, "train_tokens_per_second": 5651.918 }, { "epoch": 1.1735793159170482, "grad_norm": 0.6768651518731568, "learning_rate": 3.654049511191649e-06, "loss": 0.3012946605682373, "num_input_tokens_seen": 762275792, "step": 17430, "train_runtime": 134874.1565, "train_tokens_per_second": 5651.756 }, { "epoch": 1.1739159709130083, "grad_norm": 0.7655463622291874, "learning_rate": 3.6515032181879995e-06, "loss": 0.3098176956176758, "num_input_tokens_seen": 762491920, "step": 17435, "train_runtime": 134914.91, "train_tokens_per_second": 5651.651 }, { "epoch": 1.1742526259089685, "grad_norm": 0.7242442794388552, "learning_rate": 3.6489573022871755e-06, "loss": 0.28149569034576416, "num_input_tokens_seen": 762712840, "step": 17440, "train_runtime": 134952.0365, "train_tokens_per_second": 5651.733 }, { "epoch": 1.1745892809049285, "grad_norm": 0.6756916904062972, "learning_rate": 3.6464117642011333e-06, "loss": 0.31446964740753175, "num_input_tokens_seen": 762919536, "step": 17445, "train_runtime": 134991.2971, "train_tokens_per_second": 5651.62 }, { "epoch": 1.1749259359008888, "grad_norm": 0.7799367018501008, "learning_rate": 3.643866604641726e-06, "loss": 0.31410171985626223, "num_input_tokens_seen": 763152304, "step": 17450, "train_runtime": 135025.582, "train_tokens_per_second": 5651.909 }, { "epoch": 1.1752625908968488, "grad_norm": 0.7436018486594765, "learning_rate": 3.641321824320697e-06, "loss": 0.29862222671508787, "num_input_tokens_seen": 763371656, "step": 17455, "train_runtime": 135071.3304, "train_tokens_per_second": 5651.619 }, { "epoch": 1.175599245892809, "grad_norm": 0.6881929025831984, "learning_rate": 3.6387774239496893e-06, "loss": 0.2896681785583496, "num_input_tokens_seen": 763607368, "step": 17460, "train_runtime": 135110.4495, "train_tokens_per_second": 5651.727 }, { "epoch": 1.175935900888769, "grad_norm": 0.7211281131146224, "learning_rate": 3.6362334042402326e-06, "loss": 0.3099272012710571, "num_input_tokens_seen": 763825752, "step": 17465, "train_runtime": 135156.7264, "train_tokens_per_second": 5651.408 }, { "epoch": 1.1762725558847293, "grad_norm": 0.7082063726811787, "learning_rate": 3.6336897659037563e-06, "loss": 0.2802994966506958, "num_input_tokens_seen": 764035624, "step": 17470, "train_runtime": 135188.9582, "train_tokens_per_second": 5651.613 }, { "epoch": 1.1766092108806894, "grad_norm": 0.721477429769724, "learning_rate": 3.6311465096515787e-06, "loss": 0.29577035903930665, "num_input_tokens_seen": 764261488, "step": 17475, "train_runtime": 135224.5379, "train_tokens_per_second": 5651.796 }, { "epoch": 1.1769458658766496, "grad_norm": 0.7174604232091135, "learning_rate": 3.6286036361949175e-06, "loss": 0.2771427154541016, "num_input_tokens_seen": 764486984, "step": 17480, "train_runtime": 135262.7158, "train_tokens_per_second": 5651.868 }, { "epoch": 1.1772825208726099, "grad_norm": 0.6898907133835245, "learning_rate": 3.6260611462448736e-06, "loss": 0.2587808847427368, "num_input_tokens_seen": 764711328, "step": 17485, "train_runtime": 135302.057, "train_tokens_per_second": 5651.882 }, { "epoch": 1.17761917586857, "grad_norm": 0.9411699136352466, "learning_rate": 3.623519040512451e-06, "loss": 0.3395826816558838, "num_input_tokens_seen": 764916768, "step": 17490, "train_runtime": 135338.873, "train_tokens_per_second": 5651.863 }, { "epoch": 1.17795583086453, "grad_norm": 0.6299891222606505, "learning_rate": 3.6209773197085373e-06, "loss": 0.2713226556777954, "num_input_tokens_seen": 765139336, "step": 17495, "train_runtime": 135380.6388, "train_tokens_per_second": 5651.763 }, { "epoch": 1.1782924858604902, "grad_norm": 0.7488235191732048, "learning_rate": 3.6184359845439214e-06, "loss": 0.31320526599884035, "num_input_tokens_seen": 765373584, "step": 17500, "train_runtime": 135413.0388, "train_tokens_per_second": 5652.141 }, { "epoch": 1.1786291408564504, "grad_norm": 0.7715560770139029, "learning_rate": 3.615895035729275e-06, "loss": 0.32944774627685547, "num_input_tokens_seen": 765601768, "step": 17505, "train_runtime": 135459.3007, "train_tokens_per_second": 5651.895 }, { "epoch": 1.1789657958524105, "grad_norm": 0.7026976712835434, "learning_rate": 3.6133544739751703e-06, "loss": 0.2919255256652832, "num_input_tokens_seen": 765813632, "step": 17510, "train_runtime": 135499.1227, "train_tokens_per_second": 5651.798 }, { "epoch": 1.1793024508483705, "grad_norm": 0.7763204505182639, "learning_rate": 3.6108142999920633e-06, "loss": 0.3174884796142578, "num_input_tokens_seen": 766030160, "step": 17515, "train_runtime": 135540.5033, "train_tokens_per_second": 5651.67 }, { "epoch": 1.1796391058443307, "grad_norm": 0.7315888831681889, "learning_rate": 3.608274514490308e-06, "loss": 0.30716781616210936, "num_input_tokens_seen": 766254576, "step": 17520, "train_runtime": 135580.8511, "train_tokens_per_second": 5651.643 }, { "epoch": 1.179975760840291, "grad_norm": 0.8351647015979019, "learning_rate": 3.605735118180146e-06, "loss": 0.2879929542541504, "num_input_tokens_seen": 766474424, "step": 17525, "train_runtime": 135626.1303, "train_tokens_per_second": 5651.377 }, { "epoch": 1.180312415836251, "grad_norm": 0.7061934846953144, "learning_rate": 3.6031961117717144e-06, "loss": 0.2810915470123291, "num_input_tokens_seen": 766686368, "step": 17530, "train_runtime": 135665.2165, "train_tokens_per_second": 5651.311 }, { "epoch": 1.180649070832211, "grad_norm": 0.6723872835220442, "learning_rate": 3.600657495975034e-06, "loss": 0.29715049266815186, "num_input_tokens_seen": 766912752, "step": 17535, "train_runtime": 135706.1892, "train_tokens_per_second": 5651.273 }, { "epoch": 1.1809857258281713, "grad_norm": 0.7032026671628777, "learning_rate": 3.598119271500024e-06, "loss": 0.30086421966552734, "num_input_tokens_seen": 767131128, "step": 17540, "train_runtime": 135738.6404, "train_tokens_per_second": 5651.531 }, { "epoch": 1.1813223808241315, "grad_norm": 0.7440024692945637, "learning_rate": 3.5955814390564882e-06, "loss": 0.30273914337158203, "num_input_tokens_seen": 767352664, "step": 17545, "train_runtime": 135778.2276, "train_tokens_per_second": 5651.515 }, { "epoch": 1.1816590358200916, "grad_norm": 0.7568009197320091, "learning_rate": 3.5930439993541265e-06, "loss": 0.3133152961730957, "num_input_tokens_seen": 767564224, "step": 17550, "train_runtime": 135812.8257, "train_tokens_per_second": 5651.633 }, { "epoch": 1.1819956908160516, "grad_norm": 0.8131849513084429, "learning_rate": 3.590506953102522e-06, "loss": 0.3256534576416016, "num_input_tokens_seen": 767781400, "step": 17555, "train_runtime": 135853.5865, "train_tokens_per_second": 5651.536 }, { "epoch": 1.1823323458120119, "grad_norm": 0.7021756461446376, "learning_rate": 3.5879703010111554e-06, "loss": 0.3131730318069458, "num_input_tokens_seen": 767996072, "step": 17560, "train_runtime": 135897.3639, "train_tokens_per_second": 5651.295 }, { "epoch": 1.182669000807972, "grad_norm": 0.6947691337677638, "learning_rate": 3.5854340437893898e-06, "loss": 0.29679055213928224, "num_input_tokens_seen": 768218592, "step": 17565, "train_runtime": 135933.4998, "train_tokens_per_second": 5651.43 }, { "epoch": 1.1830056558039321, "grad_norm": 0.7588414880559752, "learning_rate": 3.5828981821464838e-06, "loss": 0.31975440979003905, "num_input_tokens_seen": 768427128, "step": 17570, "train_runtime": 135972.4916, "train_tokens_per_second": 5651.343 }, { "epoch": 1.1833423107998922, "grad_norm": 0.708470213652483, "learning_rate": 3.580362716791582e-06, "loss": 0.31680521965026853, "num_input_tokens_seen": 768660704, "step": 17575, "train_runtime": 136004.1836, "train_tokens_per_second": 5651.743 }, { "epoch": 1.1836789657958524, "grad_norm": 0.8012972832226694, "learning_rate": 3.5778276484337205e-06, "loss": 0.3270276069641113, "num_input_tokens_seen": 768871496, "step": 17580, "train_runtime": 136039.0476, "train_tokens_per_second": 5651.844 }, { "epoch": 1.1840156207918127, "grad_norm": 0.6791587926903686, "learning_rate": 3.575292977781821e-06, "loss": 0.2917544603347778, "num_input_tokens_seen": 769081176, "step": 17585, "train_runtime": 136078.1123, "train_tokens_per_second": 5651.763 }, { "epoch": 1.1843522757877727, "grad_norm": 0.774600266373974, "learning_rate": 3.5727587055446976e-06, "loss": 0.30277276039123535, "num_input_tokens_seen": 769310368, "step": 17590, "train_runtime": 136115.3881, "train_tokens_per_second": 5651.899 }, { "epoch": 1.1846889307837327, "grad_norm": 0.707413300444675, "learning_rate": 3.570224832431051e-06, "loss": 0.3234860420227051, "num_input_tokens_seen": 769534008, "step": 17595, "train_runtime": 136150.4904, "train_tokens_per_second": 5652.084 }, { "epoch": 1.185025585779693, "grad_norm": 0.8625892185888415, "learning_rate": 3.5676913591494715e-06, "loss": 0.3072806358337402, "num_input_tokens_seen": 769757384, "step": 17600, "train_runtime": 136188.6995, "train_tokens_per_second": 5652.138 }, { "epoch": 1.1853622407756532, "grad_norm": 0.6997799283337246, "learning_rate": 3.5651582864084345e-06, "loss": 0.32632970809936523, "num_input_tokens_seen": 769975064, "step": 17605, "train_runtime": 136230.7878, "train_tokens_per_second": 5651.99 }, { "epoch": 1.1856988957716132, "grad_norm": 0.7412339983103909, "learning_rate": 3.5626256149163096e-06, "loss": 0.3052994966506958, "num_input_tokens_seen": 770193168, "step": 17610, "train_runtime": 136266.0259, "train_tokens_per_second": 5652.129 }, { "epoch": 1.1860355507675733, "grad_norm": 0.7442659857634908, "learning_rate": 3.5600933453813464e-06, "loss": 0.3075841188430786, "num_input_tokens_seen": 770408384, "step": 17615, "train_runtime": 136300.5956, "train_tokens_per_second": 5652.275 }, { "epoch": 1.1863722057635335, "grad_norm": 0.7199031556232233, "learning_rate": 3.5575614785116886e-06, "loss": 0.28684291839599607, "num_input_tokens_seen": 770620728, "step": 17620, "train_runtime": 136345.9364, "train_tokens_per_second": 5651.952 }, { "epoch": 1.1867088607594938, "grad_norm": 0.8819942138485812, "learning_rate": 3.5550300150153618e-06, "loss": 0.3115447998046875, "num_input_tokens_seen": 770842752, "step": 17625, "train_runtime": 136383.5236, "train_tokens_per_second": 5652.023 }, { "epoch": 1.1870455157554538, "grad_norm": 0.7246608362400021, "learning_rate": 3.5524989556002863e-06, "loss": 0.29783077239990235, "num_input_tokens_seen": 771060848, "step": 17630, "train_runtime": 136428.5453, "train_tokens_per_second": 5651.756 }, { "epoch": 1.1873821707514138, "grad_norm": 0.7193175427066145, "learning_rate": 3.5499683009742604e-06, "loss": 0.30118565559387206, "num_input_tokens_seen": 771263296, "step": 17635, "train_runtime": 136462.119, "train_tokens_per_second": 5651.849 }, { "epoch": 1.187718825747374, "grad_norm": 0.7869452467124062, "learning_rate": 3.5474380518449757e-06, "loss": 0.2976966381072998, "num_input_tokens_seen": 771484736, "step": 17640, "train_runtime": 136496.9783, "train_tokens_per_second": 5652.028 }, { "epoch": 1.1880554807433343, "grad_norm": 0.7932366417755232, "learning_rate": 3.5449082089200072e-06, "loss": 0.301554536819458, "num_input_tokens_seen": 771704632, "step": 17645, "train_runtime": 136536.9073, "train_tokens_per_second": 5651.986 }, { "epoch": 1.1883921357392944, "grad_norm": 0.6938403571190614, "learning_rate": 3.5423787729068206e-06, "loss": 0.32130672931671145, "num_input_tokens_seen": 771927880, "step": 17650, "train_runtime": 136573.1716, "train_tokens_per_second": 5652.119 }, { "epoch": 1.1887287907352544, "grad_norm": 0.82729296746894, "learning_rate": 3.539849744512759e-06, "loss": 0.29790964126586916, "num_input_tokens_seen": 772137016, "step": 17655, "train_runtime": 136621.1016, "train_tokens_per_second": 5651.667 }, { "epoch": 1.1890654457312146, "grad_norm": 0.7549562336474883, "learning_rate": 3.5373211244450633e-06, "loss": 0.29845280647277833, "num_input_tokens_seen": 772361904, "step": 17660, "train_runtime": 136662.555, "train_tokens_per_second": 5651.599 }, { "epoch": 1.189402100727175, "grad_norm": 0.7357102335902723, "learning_rate": 3.5347929134108483e-06, "loss": 0.31483676433563235, "num_input_tokens_seen": 772575080, "step": 17665, "train_runtime": 136699.3985, "train_tokens_per_second": 5651.635 }, { "epoch": 1.189738755723135, "grad_norm": 0.8439288436808993, "learning_rate": 3.532265112117125e-06, "loss": 0.33406968116760255, "num_input_tokens_seen": 772803264, "step": 17670, "train_runtime": 136740.7168, "train_tokens_per_second": 5651.596 }, { "epoch": 1.190075410719095, "grad_norm": 0.7786740028253488, "learning_rate": 3.5297377212707805e-06, "loss": 0.2623422861099243, "num_input_tokens_seen": 773015632, "step": 17675, "train_runtime": 136775.9051, "train_tokens_per_second": 5651.695 }, { "epoch": 1.1904120657150552, "grad_norm": 0.7870032609519265, "learning_rate": 3.527210741578596e-06, "loss": 0.3026540279388428, "num_input_tokens_seen": 773239976, "step": 17680, "train_runtime": 136808.3986, "train_tokens_per_second": 5651.992 }, { "epoch": 1.1907487207110155, "grad_norm": 0.7671210970920903, "learning_rate": 3.5246841737472304e-06, "loss": 0.3219871520996094, "num_input_tokens_seen": 773448912, "step": 17685, "train_runtime": 136855.0232, "train_tokens_per_second": 5651.593 }, { "epoch": 1.1910853757069755, "grad_norm": 0.7580157770145218, "learning_rate": 3.522158018483231e-06, "loss": 0.2920974254608154, "num_input_tokens_seen": 773675944, "step": 17690, "train_runtime": 136891.1287, "train_tokens_per_second": 5651.761 }, { "epoch": 1.1914220307029355, "grad_norm": 0.7290657363390212, "learning_rate": 3.519632276493029e-06, "loss": 0.31039018630981446, "num_input_tokens_seen": 773894272, "step": 17695, "train_runtime": 136937.1303, "train_tokens_per_second": 5651.457 }, { "epoch": 1.1917586856988958, "grad_norm": 0.7233052465646747, "learning_rate": 3.5171069484829417e-06, "loss": 0.32564287185668944, "num_input_tokens_seen": 774110520, "step": 17700, "train_runtime": 136981.8929, "train_tokens_per_second": 5651.189 }, { "epoch": 1.192095340694856, "grad_norm": 0.8073757654663947, "learning_rate": 3.5145820351591663e-06, "loss": 0.28891453742980955, "num_input_tokens_seen": 774319632, "step": 17705, "train_runtime": 137022.015, "train_tokens_per_second": 5651.06 }, { "epoch": 1.192431995690816, "grad_norm": 0.7652622798191697, "learning_rate": 3.51205753722779e-06, "loss": 0.3185939073562622, "num_input_tokens_seen": 774550784, "step": 17710, "train_runtime": 137056.4812, "train_tokens_per_second": 5651.325 }, { "epoch": 1.1927686506867763, "grad_norm": 0.8416381367688279, "learning_rate": 3.5095334553947757e-06, "loss": 0.33892183303833007, "num_input_tokens_seen": 774781848, "step": 17715, "train_runtime": 137094.7795, "train_tokens_per_second": 5651.432 }, { "epoch": 1.1931053056827363, "grad_norm": 0.7454120054728669, "learning_rate": 3.50700979036598e-06, "loss": 0.2988421440124512, "num_input_tokens_seen": 774997592, "step": 17720, "train_runtime": 137134.1311, "train_tokens_per_second": 5651.384 }, { "epoch": 1.1934419606786966, "grad_norm": 0.7748610171469188, "learning_rate": 3.5044865428471343e-06, "loss": 0.28873891830444337, "num_input_tokens_seen": 775203648, "step": 17725, "train_runtime": 137170.5574, "train_tokens_per_second": 5651.385 }, { "epoch": 1.1937786156746566, "grad_norm": 0.7302857347443209, "learning_rate": 3.50196371354386e-06, "loss": 0.30784637928009034, "num_input_tokens_seen": 775418528, "step": 17730, "train_runtime": 137207.7458, "train_tokens_per_second": 5651.419 }, { "epoch": 1.1941152706706168, "grad_norm": 0.8321187550816316, "learning_rate": 3.499441303161655e-06, "loss": 0.3373323202133179, "num_input_tokens_seen": 775644000, "step": 17735, "train_runtime": 137243.8108, "train_tokens_per_second": 5651.577 }, { "epoch": 1.1944519256665769, "grad_norm": 0.6939534771748743, "learning_rate": 3.4969193124059042e-06, "loss": 0.29674830436706545, "num_input_tokens_seen": 775872464, "step": 17740, "train_runtime": 137280.866, "train_tokens_per_second": 5651.716 }, { "epoch": 1.1947885806625371, "grad_norm": 0.6781828643380845, "learning_rate": 3.4943977419818748e-06, "loss": 0.2963244438171387, "num_input_tokens_seen": 776107304, "step": 17745, "train_runtime": 137317.7425, "train_tokens_per_second": 5651.908 }, { "epoch": 1.1951252356584972, "grad_norm": 0.7205121541036261, "learning_rate": 3.4918765925947173e-06, "loss": 0.2947703838348389, "num_input_tokens_seen": 776333360, "step": 17750, "train_runtime": 137361.1596, "train_tokens_per_second": 5651.768 }, { "epoch": 1.1954618906544574, "grad_norm": 0.7958380388514483, "learning_rate": 3.4893558649494595e-06, "loss": 0.32445640563964845, "num_input_tokens_seen": 776565352, "step": 17755, "train_runtime": 137407.4556, "train_tokens_per_second": 5651.552 }, { "epoch": 1.1957985456504174, "grad_norm": 0.7848842866143078, "learning_rate": 3.4868355597510194e-06, "loss": 0.29216394424438474, "num_input_tokens_seen": 776782064, "step": 17760, "train_runtime": 137451.8285, "train_tokens_per_second": 5651.304 }, { "epoch": 1.1961352006463777, "grad_norm": 0.7869373477637197, "learning_rate": 3.4843156777041887e-06, "loss": 0.27714879512786866, "num_input_tokens_seen": 777006896, "step": 17765, "train_runtime": 137487.3294, "train_tokens_per_second": 5651.48 }, { "epoch": 1.1964718556423377, "grad_norm": 0.7742008308908815, "learning_rate": 3.4817962195136457e-06, "loss": 0.3087809085845947, "num_input_tokens_seen": 777222560, "step": 17770, "train_runtime": 137530.2067, "train_tokens_per_second": 5651.286 }, { "epoch": 1.196808510638298, "grad_norm": 0.8109631152985817, "learning_rate": 3.479277185883947e-06, "loss": 0.3070957183837891, "num_input_tokens_seen": 777436752, "step": 17775, "train_runtime": 137571.1937, "train_tokens_per_second": 5651.159 }, { "epoch": 1.197145165634258, "grad_norm": 0.956312966639188, "learning_rate": 3.476758577519537e-06, "loss": 0.29088459014892576, "num_input_tokens_seen": 777654880, "step": 17780, "train_runtime": 137605.082, "train_tokens_per_second": 5651.353 }, { "epoch": 1.1974818206302182, "grad_norm": 0.7882126606326822, "learning_rate": 3.4742403951247318e-06, "loss": 0.3081394672393799, "num_input_tokens_seen": 777876192, "step": 17785, "train_runtime": 137646.6579, "train_tokens_per_second": 5651.254 }, { "epoch": 1.1978184756261783, "grad_norm": 0.7275982569821285, "learning_rate": 3.471722639403735e-06, "loss": 0.29077887535095215, "num_input_tokens_seen": 778090376, "step": 17790, "train_runtime": 137688.0934, "train_tokens_per_second": 5651.109 }, { "epoch": 1.1981551306221385, "grad_norm": 0.7256020434598892, "learning_rate": 3.4692053110606277e-06, "loss": 0.2993917942047119, "num_input_tokens_seen": 778289376, "step": 17795, "train_runtime": 137728.124, "train_tokens_per_second": 5650.911 }, { "epoch": 1.1984917856180985, "grad_norm": 0.6738742049588294, "learning_rate": 3.4666884107993766e-06, "loss": 0.2942534923553467, "num_input_tokens_seen": 778502056, "step": 17800, "train_runtime": 137764.3256, "train_tokens_per_second": 5650.97 }, { "epoch": 1.1988284406140588, "grad_norm": 0.6924946642523322, "learning_rate": 3.464171939323819e-06, "loss": 0.30054686069488523, "num_input_tokens_seen": 778716688, "step": 17805, "train_runtime": 137804.6948, "train_tokens_per_second": 5650.872 }, { "epoch": 1.1991650956100188, "grad_norm": 0.7464221349536175, "learning_rate": 3.4616558973376848e-06, "loss": 0.3028707981109619, "num_input_tokens_seen": 778927512, "step": 17810, "train_runtime": 137840.357, "train_tokens_per_second": 5650.939 }, { "epoch": 1.199501750605979, "grad_norm": 0.8392280191250697, "learning_rate": 3.4591402855445697e-06, "loss": 0.30633254051208497, "num_input_tokens_seen": 779150112, "step": 17815, "train_runtime": 137873.0033, "train_tokens_per_second": 5651.216 }, { "epoch": 1.199838405601939, "grad_norm": 0.7385160748310561, "learning_rate": 3.4566251046479625e-06, "loss": 0.3079712152481079, "num_input_tokens_seen": 779369912, "step": 17820, "train_runtime": 137915.2772, "train_tokens_per_second": 5651.077 }, { "epoch": 1.2001750605978994, "grad_norm": 0.7785026542998826, "learning_rate": 3.454110355351221e-06, "loss": 0.3142574310302734, "num_input_tokens_seen": 779590624, "step": 17825, "train_runtime": 137954.41, "train_tokens_per_second": 5651.074 }, { "epoch": 1.2005117155938594, "grad_norm": 0.7070886799527935, "learning_rate": 3.451596038357593e-06, "loss": 0.3034769773483276, "num_input_tokens_seen": 779821712, "step": 17830, "train_runtime": 137993.4334, "train_tokens_per_second": 5651.151 }, { "epoch": 1.2008483705898196, "grad_norm": 0.8286609047748951, "learning_rate": 3.4490821543701924e-06, "loss": 0.32932286262512206, "num_input_tokens_seen": 780045176, "step": 17835, "train_runtime": 138029.8077, "train_tokens_per_second": 5651.281 }, { "epoch": 1.2011850255857797, "grad_norm": 0.7276434685048679, "learning_rate": 3.4465687040920227e-06, "loss": 0.30574448108673097, "num_input_tokens_seen": 780268064, "step": 17840, "train_runtime": 138072.0423, "train_tokens_per_second": 5651.166 }, { "epoch": 1.20152168058174, "grad_norm": 0.6824095105587578, "learning_rate": 3.44405568822596e-06, "loss": 0.278488302230835, "num_input_tokens_seen": 780486632, "step": 17845, "train_runtime": 138113.2062, "train_tokens_per_second": 5651.064 }, { "epoch": 1.2018583355777, "grad_norm": 0.833968026923619, "learning_rate": 3.441543107474765e-06, "loss": 0.3007037162780762, "num_input_tokens_seen": 780694864, "step": 17850, "train_runtime": 138148.5762, "train_tokens_per_second": 5651.125 }, { "epoch": 1.2021949905736602, "grad_norm": 0.7390135533381705, "learning_rate": 3.439030962541069e-06, "loss": 0.293853759765625, "num_input_tokens_seen": 780910776, "step": 17855, "train_runtime": 138187.3343, "train_tokens_per_second": 5651.102 }, { "epoch": 1.2025316455696202, "grad_norm": 0.7449577348762936, "learning_rate": 3.4365192541273885e-06, "loss": 0.30453169345855713, "num_input_tokens_seen": 781111576, "step": 17860, "train_runtime": 138223.1035, "train_tokens_per_second": 5651.093 }, { "epoch": 1.2028683005655805, "grad_norm": 0.7209045215476029, "learning_rate": 3.4340079829361108e-06, "loss": 0.3177401304244995, "num_input_tokens_seen": 781317608, "step": 17865, "train_runtime": 138256.2897, "train_tokens_per_second": 5651.226 }, { "epoch": 1.2032049555615405, "grad_norm": 0.7033530226860483, "learning_rate": 3.4314971496695078e-06, "loss": 0.31711881160736083, "num_input_tokens_seen": 781545368, "step": 17870, "train_runtime": 138290.4596, "train_tokens_per_second": 5651.477 }, { "epoch": 1.2035416105575008, "grad_norm": 0.7085516748330253, "learning_rate": 3.428986755029724e-06, "loss": 0.2896330118179321, "num_input_tokens_seen": 781774192, "step": 17875, "train_runtime": 138336.6049, "train_tokens_per_second": 5651.246 }, { "epoch": 1.2038782655534608, "grad_norm": 0.7125099135090971, "learning_rate": 3.4264767997187874e-06, "loss": 0.2978813171386719, "num_input_tokens_seen": 782004920, "step": 17880, "train_runtime": 138372.9121, "train_tokens_per_second": 5651.431 }, { "epoch": 1.204214920549421, "grad_norm": 0.7572580628329799, "learning_rate": 3.423967284438594e-06, "loss": 0.3156701326370239, "num_input_tokens_seen": 782217384, "step": 17885, "train_runtime": 138408.8011, "train_tokens_per_second": 5651.5 }, { "epoch": 1.204551575545381, "grad_norm": 0.6615339386741577, "learning_rate": 3.421458209890925e-06, "loss": 0.2962948799133301, "num_input_tokens_seen": 782450248, "step": 17890, "train_runtime": 138443.1781, "train_tokens_per_second": 5651.779 }, { "epoch": 1.2048882305413413, "grad_norm": 0.700079916053248, "learning_rate": 3.418949576777433e-06, "loss": 0.28663947582244875, "num_input_tokens_seen": 782681456, "step": 17895, "train_runtime": 138480.6285, "train_tokens_per_second": 5651.92 }, { "epoch": 1.2052248855373013, "grad_norm": 0.775430671158068, "learning_rate": 3.4164413857996513e-06, "loss": 0.30020842552185056, "num_input_tokens_seen": 782891192, "step": 17900, "train_runtime": 138522.9513, "train_tokens_per_second": 5651.707 }, { "epoch": 1.2055615405332616, "grad_norm": 0.7147718137595105, "learning_rate": 3.4139336376589853e-06, "loss": 0.291434121131897, "num_input_tokens_seen": 783119112, "step": 17905, "train_runtime": 138554.6985, "train_tokens_per_second": 5652.057 }, { "epoch": 1.2058981955292216, "grad_norm": 0.8762127003247577, "learning_rate": 3.411426333056722e-06, "loss": 0.30569398403167725, "num_input_tokens_seen": 783321392, "step": 17910, "train_runtime": 138597.0294, "train_tokens_per_second": 5651.791 }, { "epoch": 1.2062348505251819, "grad_norm": 0.7685183853693496, "learning_rate": 3.408919472694017e-06, "loss": 0.321109676361084, "num_input_tokens_seen": 783543848, "step": 17915, "train_runtime": 138637.4131, "train_tokens_per_second": 5651.749 }, { "epoch": 1.206571505521142, "grad_norm": 0.7046016721897478, "learning_rate": 3.406413057271909e-06, "loss": 0.30394299030303956, "num_input_tokens_seen": 783758592, "step": 17920, "train_runtime": 138676.5892, "train_tokens_per_second": 5651.701 }, { "epoch": 1.2069081605171021, "grad_norm": 0.7508302781476457, "learning_rate": 3.403907087491306e-06, "loss": 0.303491997718811, "num_input_tokens_seen": 783976568, "step": 17925, "train_runtime": 138712.5584, "train_tokens_per_second": 5651.807 }, { "epoch": 1.2072448155130622, "grad_norm": 0.7413375117669119, "learning_rate": 3.4014015640529996e-06, "loss": 0.30534958839416504, "num_input_tokens_seen": 784193960, "step": 17930, "train_runtime": 138748.3843, "train_tokens_per_second": 5651.914 }, { "epoch": 1.2075814705090224, "grad_norm": 0.7576411855768873, "learning_rate": 3.398896487657646e-06, "loss": 0.31456284523010253, "num_input_tokens_seen": 784414136, "step": 17935, "train_runtime": 138791.0719, "train_tokens_per_second": 5651.762 }, { "epoch": 1.2079181255049825, "grad_norm": 0.7960278015173246, "learning_rate": 3.396391859005785e-06, "loss": 0.2981652975082397, "num_input_tokens_seen": 784638336, "step": 17940, "train_runtime": 138825.2652, "train_tokens_per_second": 5651.985 }, { "epoch": 1.2082547805009427, "grad_norm": 0.6970907266821021, "learning_rate": 3.393887678797826e-06, "loss": 0.3018413305282593, "num_input_tokens_seen": 784844856, "step": 17945, "train_runtime": 138863.6497, "train_tokens_per_second": 5651.91 }, { "epoch": 1.2085914354969027, "grad_norm": 0.7592630519307038, "learning_rate": 3.3913839477340575e-06, "loss": 0.30618746280670167, "num_input_tokens_seen": 785058936, "step": 17950, "train_runtime": 138902.6182, "train_tokens_per_second": 5651.866 }, { "epoch": 1.208928090492863, "grad_norm": 0.7766479409436013, "learning_rate": 3.388880666514637e-06, "loss": 0.28571882247924807, "num_input_tokens_seen": 785286832, "step": 17955, "train_runtime": 138937.3108, "train_tokens_per_second": 5652.095 }, { "epoch": 1.209264745488823, "grad_norm": 0.7267074307937196, "learning_rate": 3.3863778358396033e-06, "loss": 0.3155225276947021, "num_input_tokens_seen": 785504144, "step": 17960, "train_runtime": 138972.8709, "train_tokens_per_second": 5652.212 }, { "epoch": 1.2096014004847833, "grad_norm": 0.7097174073868221, "learning_rate": 3.3838754564088592e-06, "loss": 0.3005061149597168, "num_input_tokens_seen": 785729392, "step": 17965, "train_runtime": 139011.4611, "train_tokens_per_second": 5652.263 }, { "epoch": 1.2099380554807433, "grad_norm": 0.6597216885356778, "learning_rate": 3.3813735289221923e-06, "loss": 0.29288544654846194, "num_input_tokens_seen": 785948848, "step": 17970, "train_runtime": 139049.8184, "train_tokens_per_second": 5652.282 }, { "epoch": 1.2102747104767035, "grad_norm": 0.6269995153972749, "learning_rate": 3.378872054079255e-06, "loss": 0.29325079917907715, "num_input_tokens_seen": 786168672, "step": 17975, "train_runtime": 139089.6764, "train_tokens_per_second": 5652.243 }, { "epoch": 1.2106113654726636, "grad_norm": 0.7838620260591436, "learning_rate": 3.3763710325795784e-06, "loss": 0.3322885513305664, "num_input_tokens_seen": 786371976, "step": 17980, "train_runtime": 139126.705, "train_tokens_per_second": 5652.2 }, { "epoch": 1.2109480204686238, "grad_norm": 0.6771354234860218, "learning_rate": 3.3738704651225673e-06, "loss": 0.3040419340133667, "num_input_tokens_seen": 786600776, "step": 17985, "train_runtime": 139162.6054, "train_tokens_per_second": 5652.386 }, { "epoch": 1.2112846754645838, "grad_norm": 0.7878835736125291, "learning_rate": 3.3713703524074936e-06, "loss": 0.2779910326004028, "num_input_tokens_seen": 786804904, "step": 17990, "train_runtime": 139199.5468, "train_tokens_per_second": 5652.352 }, { "epoch": 1.211621330460544, "grad_norm": 0.8227585744222804, "learning_rate": 3.3688706951335082e-06, "loss": 0.31528596878051757, "num_input_tokens_seen": 787008024, "step": 17995, "train_runtime": 139235.8527, "train_tokens_per_second": 5652.337 }, { "epoch": 1.2119579854565041, "grad_norm": 0.7422262732589775, "learning_rate": 3.3663714939996305e-06, "loss": 0.30718555450439455, "num_input_tokens_seen": 787245096, "step": 18000, "train_runtime": 139272.1742, "train_tokens_per_second": 5652.566 }, { "epoch": 1.2122946404524644, "grad_norm": 0.7541583112520067, "learning_rate": 3.3638727497047575e-06, "loss": 0.2900678634643555, "num_input_tokens_seen": 787449376, "step": 18005, "train_runtime": 139315.1398, "train_tokens_per_second": 5652.289 }, { "epoch": 1.2126312954484244, "grad_norm": 0.7220759362847328, "learning_rate": 3.3613744629476507e-06, "loss": 0.29748926162719724, "num_input_tokens_seen": 787661624, "step": 18010, "train_runtime": 139356.0904, "train_tokens_per_second": 5652.151 }, { "epoch": 1.2129679504443847, "grad_norm": 0.7372103337616008, "learning_rate": 3.358876634426952e-06, "loss": 0.2816985845565796, "num_input_tokens_seen": 787888360, "step": 18015, "train_runtime": 139393.2354, "train_tokens_per_second": 5652.271 }, { "epoch": 1.2133046054403447, "grad_norm": 0.6737993858813106, "learning_rate": 3.3563792648411676e-06, "loss": 0.32491137981414797, "num_input_tokens_seen": 788091136, "step": 18020, "train_runtime": 139429.8296, "train_tokens_per_second": 5652.242 }, { "epoch": 1.213641260436305, "grad_norm": 0.7236596806287144, "learning_rate": 3.353882354888681e-06, "loss": 0.288041353225708, "num_input_tokens_seen": 788312048, "step": 18025, "train_runtime": 139470.5579, "train_tokens_per_second": 5652.175 }, { "epoch": 1.213977915432265, "grad_norm": 0.7377693831933381, "learning_rate": 3.3513859052677444e-06, "loss": 0.2752676486968994, "num_input_tokens_seen": 788512224, "step": 18030, "train_runtime": 139508.9565, "train_tokens_per_second": 5652.054 }, { "epoch": 1.2143145704282252, "grad_norm": 0.7799869819088461, "learning_rate": 3.3488899166764842e-06, "loss": 0.3178478479385376, "num_input_tokens_seen": 788737240, "step": 18035, "train_runtime": 139542.6128, "train_tokens_per_second": 5652.304 }, { "epoch": 1.2146512254241852, "grad_norm": 0.8463476604239449, "learning_rate": 3.346394389812892e-06, "loss": 0.3054813385009766, "num_input_tokens_seen": 788959120, "step": 18040, "train_runtime": 139577.1377, "train_tokens_per_second": 5652.495 }, { "epoch": 1.2149878804201455, "grad_norm": 0.7048797167467936, "learning_rate": 3.3438993253748365e-06, "loss": 0.2954627752304077, "num_input_tokens_seen": 789168384, "step": 18045, "train_runtime": 139620.335, "train_tokens_per_second": 5652.245 }, { "epoch": 1.2153245354161055, "grad_norm": 0.7007505922657411, "learning_rate": 3.3414047240600526e-06, "loss": 0.3028736591339111, "num_input_tokens_seen": 789390496, "step": 18050, "train_runtime": 139660.3558, "train_tokens_per_second": 5652.216 }, { "epoch": 1.2156611904120658, "grad_norm": 0.8100526851783998, "learning_rate": 3.338910586566151e-06, "loss": 0.3098297119140625, "num_input_tokens_seen": 789600216, "step": 18055, "train_runtime": 139695.7464, "train_tokens_per_second": 5652.285 }, { "epoch": 1.2159978454080258, "grad_norm": 0.7531507425187864, "learning_rate": 3.336416913590605e-06, "loss": 0.3021399974822998, "num_input_tokens_seen": 789807928, "step": 18060, "train_runtime": 139731.0332, "train_tokens_per_second": 5652.344 }, { "epoch": 1.216334500403986, "grad_norm": 0.8809448489320266, "learning_rate": 3.333923705830766e-06, "loss": 0.3216712474822998, "num_input_tokens_seen": 790032400, "step": 18065, "train_runtime": 139770.9889, "train_tokens_per_second": 5652.335 }, { "epoch": 1.216671155399946, "grad_norm": 0.7668922416234147, "learning_rate": 3.3314309639838484e-06, "loss": 0.3249736547470093, "num_input_tokens_seen": 790253040, "step": 18070, "train_runtime": 139801.8412, "train_tokens_per_second": 5652.665 }, { "epoch": 1.2170078103959063, "grad_norm": 0.7501530270251235, "learning_rate": 3.328938688746942e-06, "loss": 0.30673856735229493, "num_input_tokens_seen": 790481600, "step": 18075, "train_runtime": 139848.0026, "train_tokens_per_second": 5652.434 }, { "epoch": 1.2173444653918664, "grad_norm": 0.7405483975043581, "learning_rate": 3.3264468808170012e-06, "loss": 0.3439304828643799, "num_input_tokens_seen": 790707832, "step": 18080, "train_runtime": 139884.7103, "train_tokens_per_second": 5652.568 }, { "epoch": 1.2176811203878266, "grad_norm": 0.7461154895905937, "learning_rate": 3.3239555408908562e-06, "loss": 0.3145643711090088, "num_input_tokens_seen": 790904072, "step": 18085, "train_runtime": 139927.9767, "train_tokens_per_second": 5652.223 }, { "epoch": 1.2180177753837866, "grad_norm": 0.7450961063246211, "learning_rate": 3.3214646696651974e-06, "loss": 0.2987529277801514, "num_input_tokens_seen": 791119712, "step": 18090, "train_runtime": 139967.4008, "train_tokens_per_second": 5652.171 }, { "epoch": 1.2183544303797469, "grad_norm": 0.7553620001734184, "learning_rate": 3.3189742678365923e-06, "loss": 0.31772985458374026, "num_input_tokens_seen": 791340456, "step": 18095, "train_runtime": 140002.9288, "train_tokens_per_second": 5652.314 }, { "epoch": 1.218691085375707, "grad_norm": 0.6740962905213788, "learning_rate": 3.316484336101472e-06, "loss": 0.28296403884887694, "num_input_tokens_seen": 791546784, "step": 18100, "train_runtime": 140038.0985, "train_tokens_per_second": 5652.367 }, { "epoch": 1.2190277403716672, "grad_norm": 0.7648105865576331, "learning_rate": 3.313994875156141e-06, "loss": 0.31280903816223143, "num_input_tokens_seen": 791764024, "step": 18105, "train_runtime": 140081.5209, "train_tokens_per_second": 5652.166 }, { "epoch": 1.2193643953676272, "grad_norm": 0.7674425963272242, "learning_rate": 3.3115058856967643e-06, "loss": 0.31598572731018065, "num_input_tokens_seen": 791993616, "step": 18110, "train_runtime": 140122.4895, "train_tokens_per_second": 5652.152 }, { "epoch": 1.2197010503635874, "grad_norm": 0.7813158906447104, "learning_rate": 3.3090173684193845e-06, "loss": 0.27434990406036375, "num_input_tokens_seen": 792207856, "step": 18115, "train_runtime": 140159.8456, "train_tokens_per_second": 5652.174 }, { "epoch": 1.2200377053595475, "grad_norm": 0.7015793012796032, "learning_rate": 3.3065293240199037e-06, "loss": 0.31843407154083253, "num_input_tokens_seen": 792431928, "step": 18120, "train_runtime": 140202.8473, "train_tokens_per_second": 5652.039 }, { "epoch": 1.2203743603555077, "grad_norm": 0.8362321813673071, "learning_rate": 3.3040417531940982e-06, "loss": 0.3226888179779053, "num_input_tokens_seen": 792655832, "step": 18125, "train_runtime": 140238.3502, "train_tokens_per_second": 5652.204 }, { "epoch": 1.2207110153514678, "grad_norm": 0.691317135330766, "learning_rate": 3.301554656637607e-06, "loss": 0.2980408906936646, "num_input_tokens_seen": 792868664, "step": 18130, "train_runtime": 140271.1305, "train_tokens_per_second": 5652.401 }, { "epoch": 1.221047670347428, "grad_norm": 0.7033787564345391, "learning_rate": 3.2990680350459427e-06, "loss": 0.29863677024841306, "num_input_tokens_seen": 793080312, "step": 18135, "train_runtime": 140311.0004, "train_tokens_per_second": 5652.303 }, { "epoch": 1.221384325343388, "grad_norm": 0.7340650029847289, "learning_rate": 3.2965818891144763e-06, "loss": 0.3160408020019531, "num_input_tokens_seen": 793303920, "step": 18140, "train_runtime": 140340.856, "train_tokens_per_second": 5652.694 }, { "epoch": 1.2217209803393483, "grad_norm": 0.7408714024481081, "learning_rate": 3.294096219538454e-06, "loss": 0.322130012512207, "num_input_tokens_seen": 793536920, "step": 18145, "train_runtime": 140387.2152, "train_tokens_per_second": 5652.487 }, { "epoch": 1.2220576353353083, "grad_norm": 0.725033878974291, "learning_rate": 3.291611027012983e-06, "loss": 0.3116767406463623, "num_input_tokens_seen": 793761088, "step": 18150, "train_runtime": 140429.0399, "train_tokens_per_second": 5652.4 }, { "epoch": 1.2223942903312686, "grad_norm": 0.8302224573076524, "learning_rate": 3.289126312233043e-06, "loss": 0.29644060134887695, "num_input_tokens_seen": 793993376, "step": 18155, "train_runtime": 140469.6701, "train_tokens_per_second": 5652.419 }, { "epoch": 1.2227309453272286, "grad_norm": 0.6981694762570436, "learning_rate": 3.2866420758934714e-06, "loss": 0.3092994213104248, "num_input_tokens_seen": 794216288, "step": 18160, "train_runtime": 140503.4652, "train_tokens_per_second": 5652.646 }, { "epoch": 1.2230676003231888, "grad_norm": 0.6856222569708069, "learning_rate": 3.2841583186889826e-06, "loss": 0.30644276142120364, "num_input_tokens_seen": 794442800, "step": 18165, "train_runtime": 140540.8201, "train_tokens_per_second": 5652.755 }, { "epoch": 1.2234042553191489, "grad_norm": 0.76204653073967, "learning_rate": 3.281675041314146e-06, "loss": 0.2917419195175171, "num_input_tokens_seen": 794656160, "step": 18170, "train_runtime": 140583.221, "train_tokens_per_second": 5652.568 }, { "epoch": 1.2237409103151091, "grad_norm": 0.7110260250075573, "learning_rate": 3.279192244463406e-06, "loss": 0.29529433250427245, "num_input_tokens_seen": 794869448, "step": 18175, "train_runtime": 140624.4232, "train_tokens_per_second": 5652.428 }, { "epoch": 1.2240775653110691, "grad_norm": 0.7343704316676943, "learning_rate": 3.2767099288310667e-06, "loss": 0.29960105419158933, "num_input_tokens_seen": 795093624, "step": 18180, "train_runtime": 140664.5318, "train_tokens_per_second": 5652.41 }, { "epoch": 1.2244142203070294, "grad_norm": 0.639609983163744, "learning_rate": 3.2742280951113025e-06, "loss": 0.2962838888168335, "num_input_tokens_seen": 795322792, "step": 18185, "train_runtime": 140702.7441, "train_tokens_per_second": 5652.504 }, { "epoch": 1.2247508753029894, "grad_norm": 0.743438894841407, "learning_rate": 3.2717467439981464e-06, "loss": 0.30564584732055666, "num_input_tokens_seen": 795532552, "step": 18190, "train_runtime": 140745.8939, "train_tokens_per_second": 5652.261 }, { "epoch": 1.2250875302989497, "grad_norm": 0.7489547177708321, "learning_rate": 3.2692658761855033e-06, "loss": 0.27375977039337157, "num_input_tokens_seen": 795735568, "step": 18195, "train_runtime": 140781.1568, "train_tokens_per_second": 5652.287 }, { "epoch": 1.2254241852949097, "grad_norm": 0.6829987732324682, "learning_rate": 3.266785492367138e-06, "loss": 0.2808785915374756, "num_input_tokens_seen": 795955960, "step": 18200, "train_runtime": 140815.8619, "train_tokens_per_second": 5652.46 }, { "epoch": 1.22576084029087, "grad_norm": 0.7035746454375664, "learning_rate": 3.2643055932366852e-06, "loss": 0.28676323890686034, "num_input_tokens_seen": 796165624, "step": 18205, "train_runtime": 140854.0679, "train_tokens_per_second": 5652.415 }, { "epoch": 1.22609749528683, "grad_norm": 0.8214707476930566, "learning_rate": 3.2618261794876365e-06, "loss": 0.3010567665100098, "num_input_tokens_seen": 796395392, "step": 18210, "train_runtime": 140889.0235, "train_tokens_per_second": 5652.643 }, { "epoch": 1.2264341502827902, "grad_norm": 0.6985742460828861, "learning_rate": 3.259347251813356e-06, "loss": 0.2966732978820801, "num_input_tokens_seen": 796617856, "step": 18215, "train_runtime": 140927.9467, "train_tokens_per_second": 5652.661 }, { "epoch": 1.2267708052787503, "grad_norm": 0.727228038188911, "learning_rate": 3.256868810907064e-06, "loss": 0.3215049982070923, "num_input_tokens_seen": 796852648, "step": 18220, "train_runtime": 140967.9622, "train_tokens_per_second": 5652.722 }, { "epoch": 1.2271074602747105, "grad_norm": 0.7512872700129827, "learning_rate": 3.2543908574618514e-06, "loss": 0.3135005712509155, "num_input_tokens_seen": 797070736, "step": 18225, "train_runtime": 141012.3331, "train_tokens_per_second": 5652.49 }, { "epoch": 1.2274441152706705, "grad_norm": 0.6464160299656531, "learning_rate": 3.251913392170668e-06, "loss": 0.2944124460220337, "num_input_tokens_seen": 797290688, "step": 18230, "train_runtime": 141057.431, "train_tokens_per_second": 5652.242 }, { "epoch": 1.2277807702666308, "grad_norm": 0.7214923202638721, "learning_rate": 3.249436415726333e-06, "loss": 0.29227581024169924, "num_input_tokens_seen": 797516256, "step": 18235, "train_runtime": 141095.1719, "train_tokens_per_second": 5652.328 }, { "epoch": 1.2281174252625908, "grad_norm": 0.8506838334171156, "learning_rate": 3.24695992882152e-06, "loss": 0.3139004707336426, "num_input_tokens_seen": 797725232, "step": 18240, "train_runtime": 141134.7796, "train_tokens_per_second": 5652.223 }, { "epoch": 1.228454080258551, "grad_norm": 0.6887059927032259, "learning_rate": 3.244483932148773e-06, "loss": 0.3086080551147461, "num_input_tokens_seen": 797943968, "step": 18245, "train_runtime": 141166.1, "train_tokens_per_second": 5652.518 }, { "epoch": 1.228790735254511, "grad_norm": 0.7231712696156054, "learning_rate": 3.2420084264004966e-06, "loss": 0.30695390701293945, "num_input_tokens_seen": 798161800, "step": 18250, "train_runtime": 141201.6515, "train_tokens_per_second": 5652.638 }, { "epoch": 1.2291273902504714, "grad_norm": 0.7340695565349038, "learning_rate": 3.2395334122689594e-06, "loss": 0.30524253845214844, "num_input_tokens_seen": 798379968, "step": 18255, "train_runtime": 141240.9452, "train_tokens_per_second": 5652.61 }, { "epoch": 1.2294640452464314, "grad_norm": 0.8802102442010598, "learning_rate": 3.2370588904462873e-06, "loss": 0.3120718955993652, "num_input_tokens_seen": 798609312, "step": 18260, "train_runtime": 141276.169, "train_tokens_per_second": 5652.824 }, { "epoch": 1.2298007002423916, "grad_norm": 0.7640356901782597, "learning_rate": 3.2345848616244775e-06, "loss": 0.3038747549057007, "num_input_tokens_seen": 798804840, "step": 18265, "train_runtime": 141315.8853, "train_tokens_per_second": 5652.619 }, { "epoch": 1.2301373552383517, "grad_norm": 0.8040217158342741, "learning_rate": 3.2321113264953797e-06, "loss": 0.307041072845459, "num_input_tokens_seen": 799027080, "step": 18270, "train_runtime": 141347.3832, "train_tokens_per_second": 5652.932 }, { "epoch": 1.230474010234312, "grad_norm": 0.8528931267954475, "learning_rate": 3.2296382857507124e-06, "loss": 0.2948000431060791, "num_input_tokens_seen": 799238584, "step": 18275, "train_runtime": 141386.4656, "train_tokens_per_second": 5652.865 }, { "epoch": 1.230810665230272, "grad_norm": 0.7187404855989243, "learning_rate": 3.227165740082053e-06, "loss": 0.31221818923950195, "num_input_tokens_seen": 799452544, "step": 18280, "train_runtime": 141428.6252, "train_tokens_per_second": 5652.693 }, { "epoch": 1.2311473202262322, "grad_norm": 0.762382560173622, "learning_rate": 3.2246936901808424e-06, "loss": 0.2914170980453491, "num_input_tokens_seen": 799675552, "step": 18285, "train_runtime": 141467.594, "train_tokens_per_second": 5652.712 }, { "epoch": 1.2314839752221922, "grad_norm": 0.7606748879884372, "learning_rate": 3.2222221367383786e-06, "loss": 0.32509727478027345, "num_input_tokens_seen": 799898272, "step": 18290, "train_runtime": 141515.3162, "train_tokens_per_second": 5652.379 }, { "epoch": 1.2318206302181525, "grad_norm": 0.7608834756975011, "learning_rate": 3.2197510804458265e-06, "loss": 0.30308525562286376, "num_input_tokens_seen": 800105152, "step": 18295, "train_runtime": 141554.2953, "train_tokens_per_second": 5652.285 }, { "epoch": 1.2321572852141125, "grad_norm": 0.6370726326925514, "learning_rate": 3.217280521994207e-06, "loss": 0.2986292362213135, "num_input_tokens_seen": 800331312, "step": 18300, "train_runtime": 141590.2519, "train_tokens_per_second": 5652.446 }, { "epoch": 1.2324939402100727, "grad_norm": 0.7624529476398764, "learning_rate": 3.214810462074407e-06, "loss": 0.3016390562057495, "num_input_tokens_seen": 800551688, "step": 18305, "train_runtime": 141623.377, "train_tokens_per_second": 5652.68 }, { "epoch": 1.2328305952060328, "grad_norm": 0.7693052320987479, "learning_rate": 3.2123409013771666e-06, "loss": 0.30267770290374757, "num_input_tokens_seen": 800777344, "step": 18310, "train_runtime": 141660.7953, "train_tokens_per_second": 5652.78 }, { "epoch": 1.233167250201993, "grad_norm": 0.6772837658060004, "learning_rate": 3.209871840593095e-06, "loss": 0.31267609596252444, "num_input_tokens_seen": 801009256, "step": 18315, "train_runtime": 141706.1002, "train_tokens_per_second": 5652.61 }, { "epoch": 1.233503905197953, "grad_norm": 0.7125458851611337, "learning_rate": 3.207403280412652e-06, "loss": 0.30893242359161377, "num_input_tokens_seen": 801228256, "step": 18320, "train_runtime": 141743.076, "train_tokens_per_second": 5652.68 }, { "epoch": 1.2338405601939133, "grad_norm": 0.6945330021115061, "learning_rate": 3.2049352215261677e-06, "loss": 0.28535709381103513, "num_input_tokens_seen": 801458800, "step": 18325, "train_runtime": 141780.6123, "train_tokens_per_second": 5652.81 }, { "epoch": 1.2341772151898733, "grad_norm": 0.6960194289052382, "learning_rate": 3.2024676646238222e-06, "loss": 0.29358530044555664, "num_input_tokens_seen": 801679448, "step": 18330, "train_runtime": 141816.9621, "train_tokens_per_second": 5652.917 }, { "epoch": 1.2345138701858336, "grad_norm": 0.8171703953778717, "learning_rate": 3.2000006103956653e-06, "loss": 0.3098346948623657, "num_input_tokens_seen": 801900976, "step": 18335, "train_runtime": 141857.1454, "train_tokens_per_second": 5652.877 }, { "epoch": 1.2348505251817936, "grad_norm": 0.7299590696983723, "learning_rate": 3.1975340595315956e-06, "loss": 0.28231058120727537, "num_input_tokens_seen": 802111128, "step": 18340, "train_runtime": 141893.2475, "train_tokens_per_second": 5652.92 }, { "epoch": 1.2351871801777539, "grad_norm": 0.7644787058330598, "learning_rate": 3.1950680127213796e-06, "loss": 0.2976810455322266, "num_input_tokens_seen": 802330912, "step": 18345, "train_runtime": 141932.7239, "train_tokens_per_second": 5652.896 }, { "epoch": 1.235523835173714, "grad_norm": 0.7526412783611733, "learning_rate": 3.192602470654638e-06, "loss": 0.32010388374328613, "num_input_tokens_seen": 802544448, "step": 18350, "train_runtime": 141974.2746, "train_tokens_per_second": 5652.746 }, { "epoch": 1.2358604901696741, "grad_norm": 0.7865649130269652, "learning_rate": 3.190137434020853e-06, "loss": 0.2869425296783447, "num_input_tokens_seen": 802766184, "step": 18355, "train_runtime": 142021.1129, "train_tokens_per_second": 5652.443 }, { "epoch": 1.2361971451656342, "grad_norm": 0.8600627915587952, "learning_rate": 3.1876729035093616e-06, "loss": 0.29856894016265867, "num_input_tokens_seen": 802986112, "step": 18360, "train_runtime": 142056.2119, "train_tokens_per_second": 5652.594 }, { "epoch": 1.2365338001615944, "grad_norm": 0.7568409452496826, "learning_rate": 3.185208879809366e-06, "loss": 0.29802355766296384, "num_input_tokens_seen": 803214056, "step": 18365, "train_runtime": 142100.6909, "train_tokens_per_second": 5652.429 }, { "epoch": 1.2368704551575544, "grad_norm": 0.7529248541722069, "learning_rate": 3.1827453636099183e-06, "loss": 0.3028829574584961, "num_input_tokens_seen": 803449464, "step": 18370, "train_runtime": 142136.647, "train_tokens_per_second": 5652.655 }, { "epoch": 1.2372071101535147, "grad_norm": 0.9260284783600946, "learning_rate": 3.1802823555999356e-06, "loss": 0.2902355194091797, "num_input_tokens_seen": 803675088, "step": 18375, "train_runtime": 142173.9871, "train_tokens_per_second": 5652.758 }, { "epoch": 1.2375437651494747, "grad_norm": 0.7733188398886425, "learning_rate": 3.1778198564681885e-06, "loss": 0.32343668937683107, "num_input_tokens_seen": 803903288, "step": 18380, "train_runtime": 142205.7209, "train_tokens_per_second": 5653.101 }, { "epoch": 1.237880420145435, "grad_norm": 0.7192786766579897, "learning_rate": 3.17535786690331e-06, "loss": 0.30882773399353025, "num_input_tokens_seen": 804121616, "step": 18385, "train_runtime": 142246.3225, "train_tokens_per_second": 5653.022 }, { "epoch": 1.238217075141395, "grad_norm": 0.7729011461174, "learning_rate": 3.172896387593784e-06, "loss": 0.304299521446228, "num_input_tokens_seen": 804348264, "step": 18390, "train_runtime": 142288.5576, "train_tokens_per_second": 5652.937 }, { "epoch": 1.2385537301373553, "grad_norm": 0.8194549580251287, "learning_rate": 3.1704354192279573e-06, "loss": 0.31928482055664065, "num_input_tokens_seen": 804564656, "step": 18395, "train_runtime": 142323.8728, "train_tokens_per_second": 5653.055 }, { "epoch": 1.2388903851333153, "grad_norm": 0.7962633908276077, "learning_rate": 3.1679749624940316e-06, "loss": 0.318212103843689, "num_input_tokens_seen": 804786400, "step": 18400, "train_runtime": 142360.3102, "train_tokens_per_second": 5653.166 }, { "epoch": 1.2392270401292755, "grad_norm": 0.7855805493097535, "learning_rate": 3.165515018080067e-06, "loss": 0.3026642084121704, "num_input_tokens_seen": 805005768, "step": 18405, "train_runtime": 142394.1464, "train_tokens_per_second": 5653.363 }, { "epoch": 1.2395636951252356, "grad_norm": 0.938130030820677, "learning_rate": 3.163055586673976e-06, "loss": 0.29436650276184084, "num_input_tokens_seen": 805226016, "step": 18410, "train_runtime": 142427.7333, "train_tokens_per_second": 5653.576 }, { "epoch": 1.2399003501211958, "grad_norm": 0.7559775139780297, "learning_rate": 3.1605966689635348e-06, "loss": 0.32002964019775393, "num_input_tokens_seen": 805453752, "step": 18415, "train_runtime": 142464.7236, "train_tokens_per_second": 5653.707 }, { "epoch": 1.2402370051171558, "grad_norm": 0.8613984382442207, "learning_rate": 3.1581382656363666e-06, "loss": 0.30423684120178224, "num_input_tokens_seen": 805658856, "step": 18420, "train_runtime": 142494.9465, "train_tokens_per_second": 5653.947 }, { "epoch": 1.240573660113116, "grad_norm": 0.8697803980165589, "learning_rate": 3.1556803773799616e-06, "loss": 0.3185387372970581, "num_input_tokens_seen": 805880136, "step": 18425, "train_runtime": 142536.9031, "train_tokens_per_second": 5653.835 }, { "epoch": 1.2409103151090761, "grad_norm": 0.7422635875140698, "learning_rate": 3.1532230048816564e-06, "loss": 0.3022879123687744, "num_input_tokens_seen": 806097056, "step": 18430, "train_runtime": 142575.9432, "train_tokens_per_second": 5653.808 }, { "epoch": 1.2412469701050364, "grad_norm": 0.6776328969826404, "learning_rate": 3.150766148828651e-06, "loss": 0.3036804676055908, "num_input_tokens_seen": 806315480, "step": 18435, "train_runtime": 142613.0736, "train_tokens_per_second": 5653.868 }, { "epoch": 1.2415836251009964, "grad_norm": 0.7561483870082674, "learning_rate": 3.1483098099079934e-06, "loss": 0.2874735116958618, "num_input_tokens_seen": 806538456, "step": 18440, "train_runtime": 142661.6297, "train_tokens_per_second": 5653.507 }, { "epoch": 1.2419202800969567, "grad_norm": 0.7257415829423263, "learning_rate": 3.1458539888065937e-06, "loss": 0.3029060363769531, "num_input_tokens_seen": 806750424, "step": 18445, "train_runtime": 142702.778, "train_tokens_per_second": 5653.362 }, { "epoch": 1.2422569350929167, "grad_norm": 0.84249717889109, "learning_rate": 3.143398686211212e-06, "loss": 0.29645981788635256, "num_input_tokens_seen": 806958552, "step": 18450, "train_runtime": 142740.2229, "train_tokens_per_second": 5653.337 }, { "epoch": 1.242593590088877, "grad_norm": 0.7359383150490025, "learning_rate": 3.1409439028084706e-06, "loss": 0.3129459857940674, "num_input_tokens_seen": 807178464, "step": 18455, "train_runtime": 142779.9615, "train_tokens_per_second": 5653.304 }, { "epoch": 1.2429302450848372, "grad_norm": 0.7356032513359525, "learning_rate": 3.1384896392848363e-06, "loss": 0.28752105236053466, "num_input_tokens_seen": 807397576, "step": 18460, "train_runtime": 142821.147, "train_tokens_per_second": 5653.207 }, { "epoch": 1.2432669000807972, "grad_norm": 0.7330504631691293, "learning_rate": 3.1360358963266404e-06, "loss": 0.32807331085205077, "num_input_tokens_seen": 807624936, "step": 18465, "train_runtime": 142852.5383, "train_tokens_per_second": 5653.557 }, { "epoch": 1.2436035550767572, "grad_norm": 0.7686799242262236, "learning_rate": 3.1335826746200594e-06, "loss": 0.3099084377288818, "num_input_tokens_seen": 807820280, "step": 18470, "train_runtime": 142890.1797, "train_tokens_per_second": 5653.435 }, { "epoch": 1.2439402100727175, "grad_norm": 0.7644480228425453, "learning_rate": 3.1311299748511335e-06, "loss": 0.32409205436706545, "num_input_tokens_seen": 808042832, "step": 18475, "train_runtime": 142931.8612, "train_tokens_per_second": 5653.343 }, { "epoch": 1.2442768650686777, "grad_norm": 0.7485842376379487, "learning_rate": 3.1286777977057504e-06, "loss": 0.29155697822570803, "num_input_tokens_seen": 808252592, "step": 18480, "train_runtime": 142970.1026, "train_tokens_per_second": 5653.298 }, { "epoch": 1.2446135200646378, "grad_norm": 0.8186958870732818, "learning_rate": 3.126226143869655e-06, "loss": 0.3249779224395752, "num_input_tokens_seen": 808465720, "step": 18485, "train_runtime": 143009.3714, "train_tokens_per_second": 5653.236 }, { "epoch": 1.2449501750605978, "grad_norm": 0.6799895472703079, "learning_rate": 3.1237750140284424e-06, "loss": 0.27743706703186033, "num_input_tokens_seen": 808678680, "step": 18490, "train_runtime": 143043.1574, "train_tokens_per_second": 5653.389 }, { "epoch": 1.245286830056558, "grad_norm": 0.8374856400249484, "learning_rate": 3.1213244088675647e-06, "loss": 0.30376696586608887, "num_input_tokens_seen": 808892656, "step": 18495, "train_runtime": 143081.3078, "train_tokens_per_second": 5653.378 }, { "epoch": 1.2456234850525183, "grad_norm": 0.7662091689060238, "learning_rate": 3.1188743290723246e-06, "loss": 0.317877197265625, "num_input_tokens_seen": 809111464, "step": 18500, "train_runtime": 143125.016, "train_tokens_per_second": 5653.18 }, { "epoch": 1.2459601400484783, "grad_norm": 0.8647091169854892, "learning_rate": 3.116424775327882e-06, "loss": 0.3008237361907959, "num_input_tokens_seen": 809328360, "step": 18505, "train_runtime": 143173.0534, "train_tokens_per_second": 5652.798 }, { "epoch": 1.2462967950444384, "grad_norm": 0.6945551074504395, "learning_rate": 3.1139757483192423e-06, "loss": 0.3034308433532715, "num_input_tokens_seen": 809557648, "step": 18510, "train_runtime": 143207.7193, "train_tokens_per_second": 5653.031 }, { "epoch": 1.2466334500403986, "grad_norm": 0.8318013387227233, "learning_rate": 3.1115272487312727e-06, "loss": 0.29793879985809324, "num_input_tokens_seen": 809766040, "step": 18515, "train_runtime": 143239.1385, "train_tokens_per_second": 5653.246 }, { "epoch": 1.2469701050363589, "grad_norm": 0.8696915186885799, "learning_rate": 3.109079277248684e-06, "loss": 0.29328839778900145, "num_input_tokens_seen": 809972912, "step": 18520, "train_runtime": 143278.4616, "train_tokens_per_second": 5653.138 }, { "epoch": 1.2473067600323189, "grad_norm": 0.7294833612317175, "learning_rate": 3.1066318345560463e-06, "loss": 0.32238657474517823, "num_input_tokens_seen": 810187728, "step": 18525, "train_runtime": 143312.263, "train_tokens_per_second": 5653.304 }, { "epoch": 1.247643415028279, "grad_norm": 0.7391236990985328, "learning_rate": 3.1041849213377782e-06, "loss": 0.3177293300628662, "num_input_tokens_seen": 810419880, "step": 18530, "train_runtime": 143347.6909, "train_tokens_per_second": 5653.526 }, { "epoch": 1.2479800700242392, "grad_norm": 0.7271664362688767, "learning_rate": 3.101738538278154e-06, "loss": 0.29890563488006594, "num_input_tokens_seen": 810642576, "step": 18535, "train_runtime": 143382.8102, "train_tokens_per_second": 5653.694 }, { "epoch": 1.2483167250201994, "grad_norm": 0.7689863894703435, "learning_rate": 3.0992926860612914e-06, "loss": 0.30640869140625, "num_input_tokens_seen": 810855296, "step": 18540, "train_runtime": 143422.92, "train_tokens_per_second": 5653.596 }, { "epoch": 1.2486533800161594, "grad_norm": 0.7776443662476371, "learning_rate": 3.0968473653711693e-06, "loss": 0.2990746259689331, "num_input_tokens_seen": 811094136, "step": 18545, "train_runtime": 143462.1432, "train_tokens_per_second": 5653.715 }, { "epoch": 1.2489900350121195, "grad_norm": 0.7266832056756357, "learning_rate": 3.094402576891613e-06, "loss": 0.3187594413757324, "num_input_tokens_seen": 811315008, "step": 18550, "train_runtime": 143497.5164, "train_tokens_per_second": 5653.861 }, { "epoch": 1.2493266900080797, "grad_norm": 0.6721184594034306, "learning_rate": 3.0919583213063004e-06, "loss": 0.3195340156555176, "num_input_tokens_seen": 811546128, "step": 18555, "train_runtime": 143531.9724, "train_tokens_per_second": 5654.114 }, { "epoch": 1.24966334500404, "grad_norm": 0.75584993986847, "learning_rate": 3.0895145992987574e-06, "loss": 0.30277261734008787, "num_input_tokens_seen": 811776888, "step": 18560, "train_runtime": 143569.4998, "train_tokens_per_second": 5654.243 }, { "epoch": 1.25, "grad_norm": 0.8137422225809046, "learning_rate": 3.087071411552366e-06, "loss": 0.2947868824005127, "num_input_tokens_seen": 811992848, "step": 18565, "train_runtime": 143605.6285, "train_tokens_per_second": 5654.325 }, { "epoch": 1.25033665499596, "grad_norm": 0.7305460030824085, "learning_rate": 3.084628758750353e-06, "loss": 0.31966290473937986, "num_input_tokens_seen": 812211480, "step": 18570, "train_runtime": 143644.3856, "train_tokens_per_second": 5654.321 }, { "epoch": 1.2506733099919203, "grad_norm": 0.9296238525143283, "learning_rate": 3.082186641575801e-06, "loss": 0.3240236759185791, "num_input_tokens_seen": 812427616, "step": 18575, "train_runtime": 143686.3373, "train_tokens_per_second": 5654.174 }, { "epoch": 1.2510099649878805, "grad_norm": 0.7503570194002699, "learning_rate": 3.0797450607116384e-06, "loss": 0.30055992603302, "num_input_tokens_seen": 812646144, "step": 18580, "train_runtime": 143727.8546, "train_tokens_per_second": 5654.062 }, { "epoch": 1.2513466199838406, "grad_norm": 0.7124035622045924, "learning_rate": 3.0773040168406475e-06, "loss": 0.31271209716796877, "num_input_tokens_seen": 812878472, "step": 18585, "train_runtime": 143761.8158, "train_tokens_per_second": 5654.342 }, { "epoch": 1.2516832749798006, "grad_norm": 0.7943563134878205, "learning_rate": 3.074863510645456e-06, "loss": 0.31382598876953127, "num_input_tokens_seen": 813099832, "step": 18590, "train_runtime": 143801.9795, "train_tokens_per_second": 5654.302 }, { "epoch": 1.2520199299757608, "grad_norm": 0.6636865747124504, "learning_rate": 3.072423542808546e-06, "loss": 0.30039525032043457, "num_input_tokens_seen": 813316560, "step": 18595, "train_runtime": 143835.7935, "train_tokens_per_second": 5654.48 }, { "epoch": 1.252356584971721, "grad_norm": 0.7917515381442752, "learning_rate": 3.0699841140122443e-06, "loss": 0.3078362464904785, "num_input_tokens_seen": 813538248, "step": 18600, "train_runtime": 143877.45, "train_tokens_per_second": 5654.383 }, { "epoch": 1.2526932399676811, "grad_norm": 0.7542366254079307, "learning_rate": 3.0675452249387327e-06, "loss": 0.2891314744949341, "num_input_tokens_seen": 813765928, "step": 18605, "train_runtime": 143916.9674, "train_tokens_per_second": 5654.413 }, { "epoch": 1.2530298949636411, "grad_norm": 0.769680983787988, "learning_rate": 3.0651068762700354e-06, "loss": 0.3373257637023926, "num_input_tokens_seen": 813974344, "step": 18610, "train_runtime": 143956.4928, "train_tokens_per_second": 5654.308 }, { "epoch": 1.2533665499596014, "grad_norm": 0.7698186645906399, "learning_rate": 3.0626690686880313e-06, "loss": 0.32206950187683103, "num_input_tokens_seen": 814211744, "step": 18615, "train_runtime": 143994.9815, "train_tokens_per_second": 5654.445 }, { "epoch": 1.2537032049555616, "grad_norm": 0.7376028562088249, "learning_rate": 3.060231802874443e-06, "loss": 0.3022738218307495, "num_input_tokens_seen": 814438872, "step": 18620, "train_runtime": 144031.2128, "train_tokens_per_second": 5654.6 }, { "epoch": 1.2540398599515217, "grad_norm": 0.7155062346403165, "learning_rate": 3.0577950795108462e-06, "loss": 0.30109267234802245, "num_input_tokens_seen": 814661808, "step": 18625, "train_runtime": 144071.0237, "train_tokens_per_second": 5654.585 }, { "epoch": 1.2543765149474817, "grad_norm": 0.7986947159381109, "learning_rate": 3.055358899278662e-06, "loss": 0.2987940788269043, "num_input_tokens_seen": 814871016, "step": 18630, "train_runtime": 144109.5084, "train_tokens_per_second": 5654.526 }, { "epoch": 1.254713169943442, "grad_norm": 0.8209503548573042, "learning_rate": 3.052923262859162e-06, "loss": 0.3024166107177734, "num_input_tokens_seen": 815098200, "step": 18635, "train_runtime": 144149.6967, "train_tokens_per_second": 5654.526 }, { "epoch": 1.2550498249394022, "grad_norm": 0.7146717304289526, "learning_rate": 3.0504881709334603e-06, "loss": 0.29818005561828614, "num_input_tokens_seen": 815319256, "step": 18640, "train_runtime": 144189.1823, "train_tokens_per_second": 5654.511 }, { "epoch": 1.2553864799353622, "grad_norm": 0.7132265699815106, "learning_rate": 3.0480536241825263e-06, "loss": 0.28137338161468506, "num_input_tokens_seen": 815537448, "step": 18645, "train_runtime": 144230.2973, "train_tokens_per_second": 5654.411 }, { "epoch": 1.2557231349313223, "grad_norm": 0.7429234432398791, "learning_rate": 3.0456196232871715e-06, "loss": 0.31012353897094724, "num_input_tokens_seen": 815749224, "step": 18650, "train_runtime": 144268.7463, "train_tokens_per_second": 5654.372 }, { "epoch": 1.2560597899272825, "grad_norm": 0.8026609003022944, "learning_rate": 3.043186168928059e-06, "loss": 0.30425825119018557, "num_input_tokens_seen": 815954440, "step": 18655, "train_runtime": 144316.2977, "train_tokens_per_second": 5653.931 }, { "epoch": 1.2563964449232428, "grad_norm": 0.9158794619186253, "learning_rate": 3.040753261785692e-06, "loss": 0.2835689067840576, "num_input_tokens_seen": 816164248, "step": 18660, "train_runtime": 144353.3412, "train_tokens_per_second": 5653.934 }, { "epoch": 1.2567330999192028, "grad_norm": 0.7533631787720405, "learning_rate": 3.038320902540429e-06, "loss": 0.28765387535095216, "num_input_tokens_seen": 816379936, "step": 18665, "train_runtime": 144394.4225, "train_tokens_per_second": 5653.819 }, { "epoch": 1.2570697549151628, "grad_norm": 0.7215132949101682, "learning_rate": 3.0358890918724706e-06, "loss": 0.303347110748291, "num_input_tokens_seen": 816611832, "step": 18670, "train_runtime": 144441.5414, "train_tokens_per_second": 5653.58 }, { "epoch": 1.257406409911123, "grad_norm": 0.8254057548339484, "learning_rate": 3.0334578304618646e-06, "loss": 0.30634298324584963, "num_input_tokens_seen": 816814520, "step": 18675, "train_runtime": 144483.9095, "train_tokens_per_second": 5653.325 }, { "epoch": 1.2577430649070833, "grad_norm": 0.7191371330865693, "learning_rate": 3.0310271189885037e-06, "loss": 0.3063030481338501, "num_input_tokens_seen": 817024696, "step": 18680, "train_runtime": 144517.3756, "train_tokens_per_second": 5653.47 }, { "epoch": 1.2580797199030433, "grad_norm": 0.7073217630646664, "learning_rate": 3.0285969581321328e-06, "loss": 0.296706485748291, "num_input_tokens_seen": 817244872, "step": 18685, "train_runtime": 144554.5892, "train_tokens_per_second": 5653.538 }, { "epoch": 1.2584163748990034, "grad_norm": 0.7607230653856618, "learning_rate": 3.0261673485723343e-06, "loss": 0.3513062000274658, "num_input_tokens_seen": 817456408, "step": 18690, "train_runtime": 144592.758, "train_tokens_per_second": 5653.509 }, { "epoch": 1.2587530298949636, "grad_norm": 0.7009162874744629, "learning_rate": 3.023738290988544e-06, "loss": 0.28501205444335936, "num_input_tokens_seen": 817681112, "step": 18695, "train_runtime": 144634.3333, "train_tokens_per_second": 5653.437 }, { "epoch": 1.2590896848909239, "grad_norm": 0.8160907857921498, "learning_rate": 3.021309786060037e-06, "loss": 0.30846569538116453, "num_input_tokens_seen": 817885488, "step": 18700, "train_runtime": 144674.0076, "train_tokens_per_second": 5653.299 }, { "epoch": 1.259426339886884, "grad_norm": 0.7466687057656971, "learning_rate": 3.018881834465941e-06, "loss": 0.290647029876709, "num_input_tokens_seen": 818098808, "step": 18705, "train_runtime": 144712.1439, "train_tokens_per_second": 5653.284 }, { "epoch": 1.259762994882844, "grad_norm": 0.7496967934224382, "learning_rate": 3.016454436885221e-06, "loss": 0.3127418041229248, "num_input_tokens_seen": 818317480, "step": 18710, "train_runtime": 144748.3739, "train_tokens_per_second": 5653.379 }, { "epoch": 1.2600996498788042, "grad_norm": 0.7415188653692539, "learning_rate": 3.0140275939966934e-06, "loss": 0.3062695026397705, "num_input_tokens_seen": 818539128, "step": 18715, "train_runtime": 144789.8872, "train_tokens_per_second": 5653.289 }, { "epoch": 1.2604363048747644, "grad_norm": 0.7926838386125326, "learning_rate": 3.0116013064790166e-06, "loss": 0.3510124921798706, "num_input_tokens_seen": 818770136, "step": 18720, "train_runtime": 144822.5073, "train_tokens_per_second": 5653.611 }, { "epoch": 1.2607729598707245, "grad_norm": 0.838754094026344, "learning_rate": 3.0091755750106937e-06, "loss": 0.31281888484954834, "num_input_tokens_seen": 818987192, "step": 18725, "train_runtime": 144857.9964, "train_tokens_per_second": 5653.724 }, { "epoch": 1.2611096148666845, "grad_norm": 0.7065966064188791, "learning_rate": 3.006750400270072e-06, "loss": 0.2828061580657959, "num_input_tokens_seen": 819201568, "step": 18730, "train_runtime": 144893.0397, "train_tokens_per_second": 5653.837 }, { "epoch": 1.2614462698626447, "grad_norm": 0.6761766202190553, "learning_rate": 3.0043257829353466e-06, "loss": 0.2915013790130615, "num_input_tokens_seen": 819423736, "step": 18735, "train_runtime": 144932.2044, "train_tokens_per_second": 5653.842 }, { "epoch": 1.261782924858605, "grad_norm": 0.7399210906210721, "learning_rate": 3.0019017236845504e-06, "loss": 0.3179666042327881, "num_input_tokens_seen": 819640880, "step": 18740, "train_runtime": 144969.2626, "train_tokens_per_second": 5653.894 }, { "epoch": 1.262119579854565, "grad_norm": 1.0185583570035832, "learning_rate": 2.9994782231955673e-06, "loss": 0.3084989547729492, "num_input_tokens_seen": 819858960, "step": 18745, "train_runtime": 145006.0911, "train_tokens_per_second": 5653.962 }, { "epoch": 1.262456234850525, "grad_norm": 0.6872092978916245, "learning_rate": 2.9970552821461185e-06, "loss": 0.28854634761810305, "num_input_tokens_seen": 820070184, "step": 18750, "train_runtime": 145045.6889, "train_tokens_per_second": 5653.875 }, { "epoch": 1.2627928898464853, "grad_norm": 0.8684996226363714, "learning_rate": 2.994632901213775e-06, "loss": 0.2994524955749512, "num_input_tokens_seen": 820280600, "step": 18755, "train_runtime": 145083.5094, "train_tokens_per_second": 5653.851 }, { "epoch": 1.2631295448424456, "grad_norm": 0.8319193699909638, "learning_rate": 2.9922110810759443e-06, "loss": 0.3167592763900757, "num_input_tokens_seen": 820492832, "step": 18760, "train_runtime": 145127.9985, "train_tokens_per_second": 5653.581 }, { "epoch": 1.2634661998384056, "grad_norm": 0.7753044461490659, "learning_rate": 2.989789822409883e-06, "loss": 0.3189209461212158, "num_input_tokens_seen": 820717400, "step": 18765, "train_runtime": 145162.0094, "train_tokens_per_second": 5653.803 }, { "epoch": 1.2638028548343656, "grad_norm": 0.7322817419625537, "learning_rate": 2.9873691258926864e-06, "loss": 0.3269504547119141, "num_input_tokens_seen": 820956960, "step": 18770, "train_runtime": 145198.2506, "train_tokens_per_second": 5654.042 }, { "epoch": 1.2641395098303259, "grad_norm": 0.696541167423223, "learning_rate": 2.9849489922012985e-06, "loss": 0.3042433261871338, "num_input_tokens_seen": 821165096, "step": 18775, "train_runtime": 145239.0804, "train_tokens_per_second": 5653.885 }, { "epoch": 1.264476164826286, "grad_norm": 0.7452468533447384, "learning_rate": 2.982529422012498e-06, "loss": 0.338847017288208, "num_input_tokens_seen": 821398992, "step": 18780, "train_runtime": 145277.8958, "train_tokens_per_second": 5653.985 }, { "epoch": 1.2648128198222461, "grad_norm": 0.7815954898874985, "learning_rate": 2.9801104160029127e-06, "loss": 0.2665702819824219, "num_input_tokens_seen": 821606024, "step": 18785, "train_runtime": 145319.4203, "train_tokens_per_second": 5653.794 }, { "epoch": 1.2651494748182062, "grad_norm": 0.7521512397733022, "learning_rate": 2.9776919748490063e-06, "loss": 0.31261477470397947, "num_input_tokens_seen": 821822040, "step": 18790, "train_runtime": 145359.9037, "train_tokens_per_second": 5653.705 }, { "epoch": 1.2654861298141664, "grad_norm": 0.8383923854339487, "learning_rate": 2.975274099227092e-06, "loss": 0.32703323364257814, "num_input_tokens_seen": 822027760, "step": 18795, "train_runtime": 145403.5301, "train_tokens_per_second": 5653.424 }, { "epoch": 1.2658227848101267, "grad_norm": 0.8931253914400595, "learning_rate": 2.9728567898133183e-06, "loss": 0.31384882926940916, "num_input_tokens_seen": 822249072, "step": 18800, "train_runtime": 145447.7238, "train_tokens_per_second": 5653.227 }, { "epoch": 1.2661594398060867, "grad_norm": 0.7239471432554654, "learning_rate": 2.9704400472836816e-06, "loss": 0.3009427309036255, "num_input_tokens_seen": 822468088, "step": 18805, "train_runtime": 145491.919, "train_tokens_per_second": 5653.016 }, { "epoch": 1.266496094802047, "grad_norm": 0.8248452170258889, "learning_rate": 2.9680238723140108e-06, "loss": 0.33100879192352295, "num_input_tokens_seen": 822682520, "step": 18810, "train_runtime": 145531.6555, "train_tokens_per_second": 5652.946 }, { "epoch": 1.266832749798007, "grad_norm": 0.7312225706048872, "learning_rate": 2.9656082655799866e-06, "loss": 0.3179032325744629, "num_input_tokens_seen": 822894336, "step": 18815, "train_runtime": 145569.5437, "train_tokens_per_second": 5652.929 }, { "epoch": 1.2671694047939672, "grad_norm": 0.8914282863081362, "learning_rate": 2.9631932277571225e-06, "loss": 0.31571259498596194, "num_input_tokens_seen": 823116688, "step": 18820, "train_runtime": 145602.2926, "train_tokens_per_second": 5653.185 }, { "epoch": 1.2675060597899273, "grad_norm": 0.7436639756998058, "learning_rate": 2.9607787595207794e-06, "loss": 0.2941970109939575, "num_input_tokens_seen": 823334680, "step": 18825, "train_runtime": 145642.6854, "train_tokens_per_second": 5653.114 }, { "epoch": 1.2678427147858875, "grad_norm": 0.6064296816907161, "learning_rate": 2.9583648615461514e-06, "loss": 0.2951462507247925, "num_input_tokens_seen": 823548976, "step": 18830, "train_runtime": 145684.7379, "train_tokens_per_second": 5652.953 }, { "epoch": 1.2681793697818475, "grad_norm": 0.8015900434605868, "learning_rate": 2.955951534508281e-06, "loss": 0.32911660671234133, "num_input_tokens_seen": 823759784, "step": 18835, "train_runtime": 145720.3213, "train_tokens_per_second": 5653.019 }, { "epoch": 1.2685160247778078, "grad_norm": 0.6806231841224424, "learning_rate": 2.9535387790820452e-06, "loss": 0.3123172283172607, "num_input_tokens_seen": 823989856, "step": 18840, "train_runtime": 145763.7657, "train_tokens_per_second": 5652.913 }, { "epoch": 1.2688526797737678, "grad_norm": 0.827759809808618, "learning_rate": 2.951126595942165e-06, "loss": 0.29312863349914553, "num_input_tokens_seen": 824217960, "step": 18845, "train_runtime": 145800.553, "train_tokens_per_second": 5653.051 }, { "epoch": 1.269189334769728, "grad_norm": 0.7164470604004327, "learning_rate": 2.948714985763197e-06, "loss": 0.2757392883300781, "num_input_tokens_seen": 824421568, "step": 18850, "train_runtime": 145841.8634, "train_tokens_per_second": 5652.846 }, { "epoch": 1.269525989765688, "grad_norm": 0.8496090603821623, "learning_rate": 2.9463039492195445e-06, "loss": 0.3131323575973511, "num_input_tokens_seen": 824655760, "step": 18855, "train_runtime": 145880.5542, "train_tokens_per_second": 5652.952 }, { "epoch": 1.2698626447616483, "grad_norm": 0.7352726813474353, "learning_rate": 2.9438934869854417e-06, "loss": 0.2902811527252197, "num_input_tokens_seen": 824879032, "step": 18860, "train_runtime": 145923.738, "train_tokens_per_second": 5652.809 }, { "epoch": 1.2701992997576084, "grad_norm": 0.7811715951881948, "learning_rate": 2.9414835997349705e-06, "loss": 0.2894813060760498, "num_input_tokens_seen": 825095288, "step": 18865, "train_runtime": 145960.032, "train_tokens_per_second": 5652.885 }, { "epoch": 1.2705359547535686, "grad_norm": 0.6562307917959052, "learning_rate": 2.939074288142045e-06, "loss": 0.32269885540008547, "num_input_tokens_seen": 825326376, "step": 18870, "train_runtime": 145998.5987, "train_tokens_per_second": 5652.975 }, { "epoch": 1.2708726097495286, "grad_norm": 0.7677795002971816, "learning_rate": 2.9366655528804257e-06, "loss": 0.29350924491882324, "num_input_tokens_seen": 825544816, "step": 18875, "train_runtime": 146042.0539, "train_tokens_per_second": 5652.788 }, { "epoch": 1.271209264745489, "grad_norm": 0.6905930617244008, "learning_rate": 2.934257394623702e-06, "loss": 0.2879796504974365, "num_input_tokens_seen": 825768752, "step": 18880, "train_runtime": 146079.3121, "train_tokens_per_second": 5652.88 }, { "epoch": 1.271545919741449, "grad_norm": 0.7151332172339365, "learning_rate": 2.9318498140453134e-06, "loss": 0.32280969619750977, "num_input_tokens_seen": 825987712, "step": 18885, "train_runtime": 146122.0243, "train_tokens_per_second": 5652.726 }, { "epoch": 1.2718825747374092, "grad_norm": 0.8504766443077242, "learning_rate": 2.929442811818527e-06, "loss": 0.3143021106719971, "num_input_tokens_seen": 826196048, "step": 18890, "train_runtime": 146161.5263, "train_tokens_per_second": 5652.623 }, { "epoch": 1.2722192297333692, "grad_norm": 0.797394168026311, "learning_rate": 2.927036388616457e-06, "loss": 0.29908573627471924, "num_input_tokens_seen": 826399384, "step": 18895, "train_runtime": 146195.9133, "train_tokens_per_second": 5652.685 }, { "epoch": 1.2725558847293295, "grad_norm": 0.8320805975958718, "learning_rate": 2.9246305451120494e-06, "loss": 0.3228297233581543, "num_input_tokens_seen": 826603896, "step": 18900, "train_runtime": 146234.1471, "train_tokens_per_second": 5652.605 }, { "epoch": 1.2728925397252895, "grad_norm": 0.7307797880302476, "learning_rate": 2.922225281978095e-06, "loss": 0.3007101058959961, "num_input_tokens_seen": 826821328, "step": 18905, "train_runtime": 146279.6181, "train_tokens_per_second": 5652.334 }, { "epoch": 1.2732291947212497, "grad_norm": 0.7406348258598292, "learning_rate": 2.919820599887212e-06, "loss": 0.3024411916732788, "num_input_tokens_seen": 827039792, "step": 18910, "train_runtime": 146321.5475, "train_tokens_per_second": 5652.208 }, { "epoch": 1.2735658497172098, "grad_norm": 0.8447453780821402, "learning_rate": 2.917416499511866e-06, "loss": 0.30447540283203123, "num_input_tokens_seen": 827242576, "step": 18915, "train_runtime": 146363.2378, "train_tokens_per_second": 5651.983 }, { "epoch": 1.27390250471317, "grad_norm": 0.7936589269610094, "learning_rate": 2.9150129815243553e-06, "loss": 0.288972806930542, "num_input_tokens_seen": 827457896, "step": 18920, "train_runtime": 146404.1905, "train_tokens_per_second": 5651.873 }, { "epoch": 1.27423915970913, "grad_norm": 0.850907349149432, "learning_rate": 2.912610046596816e-06, "loss": 0.2999333620071411, "num_input_tokens_seen": 827666848, "step": 18925, "train_runtime": 146446.094, "train_tokens_per_second": 5651.683 }, { "epoch": 1.2745758147050903, "grad_norm": 0.6871438604531044, "learning_rate": 2.91020769540122e-06, "loss": 0.3152765274047852, "num_input_tokens_seen": 827866000, "step": 18930, "train_runtime": 146485.6336, "train_tokens_per_second": 5651.517 }, { "epoch": 1.2749124697010503, "grad_norm": 0.679666459947843, "learning_rate": 2.9078059286093795e-06, "loss": 0.2963433027267456, "num_input_tokens_seen": 828072488, "step": 18935, "train_runtime": 146524.0873, "train_tokens_per_second": 5651.443 }, { "epoch": 1.2752491246970106, "grad_norm": 0.6861610947075387, "learning_rate": 2.905404746892937e-06, "loss": 0.28579273223876955, "num_input_tokens_seen": 828287296, "step": 18940, "train_runtime": 146560.9928, "train_tokens_per_second": 5651.485 }, { "epoch": 1.2755857796929706, "grad_norm": 0.7154785961890833, "learning_rate": 2.903004150923382e-06, "loss": 0.3039486169815063, "num_input_tokens_seen": 828510696, "step": 18945, "train_runtime": 146598.3451, "train_tokens_per_second": 5651.569 }, { "epoch": 1.2759224346889309, "grad_norm": 0.7669932436785718, "learning_rate": 2.9006041413720252e-06, "loss": 0.3282867431640625, "num_input_tokens_seen": 828734304, "step": 18950, "train_runtime": 146645.3601, "train_tokens_per_second": 5651.282 }, { "epoch": 1.2762590896848909, "grad_norm": 0.6719242223720826, "learning_rate": 2.8982047189100276e-06, "loss": 0.30024127960205077, "num_input_tokens_seen": 828967864, "step": 18955, "train_runtime": 146680.0954, "train_tokens_per_second": 5651.536 }, { "epoch": 1.2765957446808511, "grad_norm": 0.7852643316945973, "learning_rate": 2.895805884208378e-06, "loss": 0.3082295894622803, "num_input_tokens_seen": 829167224, "step": 18960, "train_runtime": 146717.6947, "train_tokens_per_second": 5651.447 }, { "epoch": 1.2769323996768112, "grad_norm": 0.8516866669455334, "learning_rate": 2.8934076379379016e-06, "loss": 0.31248860359191893, "num_input_tokens_seen": 829396808, "step": 18965, "train_runtime": 146755.3528, "train_tokens_per_second": 5651.561 }, { "epoch": 1.2772690546727714, "grad_norm": 0.7752902430798366, "learning_rate": 2.891009980769266e-06, "loss": 0.3060382127761841, "num_input_tokens_seen": 829619304, "step": 18970, "train_runtime": 146798.1501, "train_tokens_per_second": 5651.429 }, { "epoch": 1.2776057096687314, "grad_norm": 0.8744465210673298, "learning_rate": 2.88861291337296e-06, "loss": 0.29961209297180175, "num_input_tokens_seen": 829837784, "step": 18975, "train_runtime": 146836.9106, "train_tokens_per_second": 5651.425 }, { "epoch": 1.2779423646646917, "grad_norm": 0.7351797146412703, "learning_rate": 2.8862164364193236e-06, "loss": 0.2904377460479736, "num_input_tokens_seen": 830058208, "step": 18980, "train_runtime": 146873.1011, "train_tokens_per_second": 5651.533 }, { "epoch": 1.2782790196606517, "grad_norm": 0.7312431717294958, "learning_rate": 2.8838205505785168e-06, "loss": 0.3134331703186035, "num_input_tokens_seen": 830283008, "step": 18985, "train_runtime": 146914.2968, "train_tokens_per_second": 5651.479 }, { "epoch": 1.278615674656612, "grad_norm": 0.663622797522999, "learning_rate": 2.881425256520547e-06, "loss": 0.2921187400817871, "num_input_tokens_seen": 830500192, "step": 18990, "train_runtime": 146951.0522, "train_tokens_per_second": 5651.543 }, { "epoch": 1.278952329652572, "grad_norm": 0.7237194461676807, "learning_rate": 2.8790305549152487e-06, "loss": 0.26155910491943357, "num_input_tokens_seen": 830725544, "step": 18995, "train_runtime": 146990.9253, "train_tokens_per_second": 5651.543 }, { "epoch": 1.2792889846485322, "grad_norm": 0.7631364393415948, "learning_rate": 2.876636446432292e-06, "loss": 0.3240873098373413, "num_input_tokens_seen": 830948824, "step": 19000, "train_runtime": 147025.5963, "train_tokens_per_second": 5651.729 }, { "epoch": 1.2796256396444923, "grad_norm": 0.7251110163689186, "learning_rate": 2.8742429317411826e-06, "loss": 0.30750136375427245, "num_input_tokens_seen": 831173768, "step": 19005, "train_runtime": 147062.3862, "train_tokens_per_second": 5651.845 }, { "epoch": 1.2799622946404525, "grad_norm": 0.9679509381325586, "learning_rate": 2.8718500115112585e-06, "loss": 0.30974340438842773, "num_input_tokens_seen": 831380944, "step": 19010, "train_runtime": 147096.7442, "train_tokens_per_second": 5651.933 }, { "epoch": 1.2802989496364126, "grad_norm": 0.7640168557000633, "learning_rate": 2.869457686411691e-06, "loss": 0.33095221519470214, "num_input_tokens_seen": 831589040, "step": 19015, "train_runtime": 147137.7505, "train_tokens_per_second": 5651.772 }, { "epoch": 1.2806356046323728, "grad_norm": 0.7459470398332059, "learning_rate": 2.8670659571114912e-06, "loss": 0.30541186332702636, "num_input_tokens_seen": 831816448, "step": 19020, "train_runtime": 147176.0251, "train_tokens_per_second": 5651.847 }, { "epoch": 1.2809722596283328, "grad_norm": 0.6423476554873053, "learning_rate": 2.864674824279491e-06, "loss": 0.2939921855926514, "num_input_tokens_seen": 832035736, "step": 19025, "train_runtime": 147213.464, "train_tokens_per_second": 5651.9 }, { "epoch": 1.281308914624293, "grad_norm": 0.7355078108437945, "learning_rate": 2.862284288584371e-06, "loss": 0.2885020971298218, "num_input_tokens_seen": 832264232, "step": 19030, "train_runtime": 147251.1103, "train_tokens_per_second": 5652.006 }, { "epoch": 1.2816455696202531, "grad_norm": 0.8373034806587798, "learning_rate": 2.8598943506946297e-06, "loss": 0.300329327583313, "num_input_tokens_seen": 832482744, "step": 19035, "train_runtime": 147288.7273, "train_tokens_per_second": 5652.047 }, { "epoch": 1.2819822246162134, "grad_norm": 0.7138141742816384, "learning_rate": 2.85750501127861e-06, "loss": 0.277694034576416, "num_input_tokens_seen": 832697464, "step": 19040, "train_runtime": 147329.6861, "train_tokens_per_second": 5651.933 }, { "epoch": 1.2823188796121734, "grad_norm": 0.6608599560904919, "learning_rate": 2.8551162710044827e-06, "loss": 0.30247793197631834, "num_input_tokens_seen": 832912640, "step": 19045, "train_runtime": 147365.9859, "train_tokens_per_second": 5652.001 }, { "epoch": 1.2826555346081336, "grad_norm": 0.7589903744520924, "learning_rate": 2.8527281305402503e-06, "loss": 0.32385740280151365, "num_input_tokens_seen": 833133224, "step": 19050, "train_runtime": 147403.1332, "train_tokens_per_second": 5652.073 }, { "epoch": 1.2829921896040937, "grad_norm": 0.8057473648914902, "learning_rate": 2.8503405905537496e-06, "loss": 0.29269657135009763, "num_input_tokens_seen": 833346936, "step": 19055, "train_runtime": 147442.1312, "train_tokens_per_second": 5652.027 }, { "epoch": 1.283328844600054, "grad_norm": 0.7212257083936001, "learning_rate": 2.847953651712647e-06, "loss": 0.3061253309249878, "num_input_tokens_seen": 833581464, "step": 19060, "train_runtime": 147477.4905, "train_tokens_per_second": 5652.262 }, { "epoch": 1.283665499596014, "grad_norm": 0.8465650818228247, "learning_rate": 2.8455673146844426e-06, "loss": 0.30112695693969727, "num_input_tokens_seen": 833784496, "step": 19065, "train_runtime": 147521.4424, "train_tokens_per_second": 5651.955 }, { "epoch": 1.2840021545919742, "grad_norm": 0.7588100951853031, "learning_rate": 2.8431815801364717e-06, "loss": 0.3190593719482422, "num_input_tokens_seen": 834001896, "step": 19070, "train_runtime": 147563.6694, "train_tokens_per_second": 5651.811 }, { "epoch": 1.2843388095879342, "grad_norm": 0.8096844572768415, "learning_rate": 2.8407964487358906e-06, "loss": 0.3083981513977051, "num_input_tokens_seen": 834226528, "step": 19075, "train_runtime": 147606.1012, "train_tokens_per_second": 5651.708 }, { "epoch": 1.2846754645838945, "grad_norm": 0.8121583620232876, "learning_rate": 2.838411921149702e-06, "loss": 0.30108425617218015, "num_input_tokens_seen": 834428112, "step": 19080, "train_runtime": 147643.2603, "train_tokens_per_second": 5651.651 }, { "epoch": 1.2850121195798545, "grad_norm": 0.7654588268965005, "learning_rate": 2.836027998044722e-06, "loss": 0.3017698287963867, "num_input_tokens_seen": 834638200, "step": 19085, "train_runtime": 147687.2931, "train_tokens_per_second": 5651.388 }, { "epoch": 1.2853487745758148, "grad_norm": 0.7769786248168525, "learning_rate": 2.8336446800876143e-06, "loss": 0.3067366600036621, "num_input_tokens_seen": 834833144, "step": 19090, "train_runtime": 147722.5693, "train_tokens_per_second": 5651.358 }, { "epoch": 1.2856854295717748, "grad_norm": 0.8520512402767025, "learning_rate": 2.8312619679448637e-06, "loss": 0.2865460872650146, "num_input_tokens_seen": 835055128, "step": 19095, "train_runtime": 147762.1093, "train_tokens_per_second": 5651.348 }, { "epoch": 1.286022084567735, "grad_norm": 0.8168300340689107, "learning_rate": 2.8288798622827884e-06, "loss": 0.31798462867736815, "num_input_tokens_seen": 835252248, "step": 19100, "train_runtime": 147802.5202, "train_tokens_per_second": 5651.137 }, { "epoch": 1.286358739563695, "grad_norm": 0.9604203872867969, "learning_rate": 2.826498363767536e-06, "loss": 0.316135311126709, "num_input_tokens_seen": 835451680, "step": 19105, "train_runtime": 147840.3751, "train_tokens_per_second": 5651.039 }, { "epoch": 1.2866953945596553, "grad_norm": 0.8232657359064803, "learning_rate": 2.8241174730650855e-06, "loss": 0.3065540313720703, "num_input_tokens_seen": 835675080, "step": 19110, "train_runtime": 147880.4439, "train_tokens_per_second": 5651.018 }, { "epoch": 1.2870320495556153, "grad_norm": 0.7796058041196822, "learning_rate": 2.821737190841244e-06, "loss": 0.29743661880493166, "num_input_tokens_seen": 835891040, "step": 19115, "train_runtime": 147915.5543, "train_tokens_per_second": 5651.137 }, { "epoch": 1.2873687045515756, "grad_norm": 0.7312714159541509, "learning_rate": 2.8193575177616537e-06, "loss": 0.2965965986251831, "num_input_tokens_seen": 836111592, "step": 19120, "train_runtime": 147959.8125, "train_tokens_per_second": 5650.937 }, { "epoch": 1.2877053595475356, "grad_norm": 0.7000449200994382, "learning_rate": 2.816978454491777e-06, "loss": 0.2831472396850586, "num_input_tokens_seen": 836342224, "step": 19125, "train_runtime": 147994.2807, "train_tokens_per_second": 5651.179 }, { "epoch": 1.2880420145434959, "grad_norm": 0.8484575372461595, "learning_rate": 2.814600001696919e-06, "loss": 0.31551055908203124, "num_input_tokens_seen": 836555312, "step": 19130, "train_runtime": 148030.887, "train_tokens_per_second": 5651.221 }, { "epoch": 1.288378669539456, "grad_norm": 0.7939086544066017, "learning_rate": 2.812222160042196e-06, "loss": 0.3081847906112671, "num_input_tokens_seen": 836781384, "step": 19135, "train_runtime": 148071.8667, "train_tokens_per_second": 5651.184 }, { "epoch": 1.2887153245354162, "grad_norm": 0.7293883099186741, "learning_rate": 2.809844930192573e-06, "loss": 0.31632413864135744, "num_input_tokens_seen": 836996448, "step": 19140, "train_runtime": 148110.3971, "train_tokens_per_second": 5651.166 }, { "epoch": 1.2890519795313762, "grad_norm": 0.7845647411236363, "learning_rate": 2.807468312812831e-06, "loss": 0.3241159677505493, "num_input_tokens_seen": 837211800, "step": 19145, "train_runtime": 148145.8757, "train_tokens_per_second": 5651.266 }, { "epoch": 1.2893886345273364, "grad_norm": 0.7305402054857416, "learning_rate": 2.805092308567584e-06, "loss": 0.2902689933776855, "num_input_tokens_seen": 837439120, "step": 19150, "train_runtime": 148177.9274, "train_tokens_per_second": 5651.578 }, { "epoch": 1.2897252895232965, "grad_norm": 0.706253740316737, "learning_rate": 2.802716918121273e-06, "loss": 0.2991164207458496, "num_input_tokens_seen": 837665040, "step": 19155, "train_runtime": 148222.7975, "train_tokens_per_second": 5651.391 }, { "epoch": 1.2900619445192567, "grad_norm": 0.7258823029517253, "learning_rate": 2.8003421421381704e-06, "loss": 0.29270741939544676, "num_input_tokens_seen": 837893216, "step": 19160, "train_runtime": 148255.3261, "train_tokens_per_second": 5651.69 }, { "epoch": 1.2903985995152167, "grad_norm": 0.7437197036098059, "learning_rate": 2.797967981282371e-06, "loss": 0.3194019317626953, "num_input_tokens_seen": 838115864, "step": 19165, "train_runtime": 148297.7873, "train_tokens_per_second": 5651.574 }, { "epoch": 1.290735254511177, "grad_norm": 0.7205908995167096, "learning_rate": 2.795594436217808e-06, "loss": 0.29573659896850585, "num_input_tokens_seen": 838332696, "step": 19170, "train_runtime": 148338.6228, "train_tokens_per_second": 5651.48 }, { "epoch": 1.291071909507137, "grad_norm": 0.6798097348635077, "learning_rate": 2.7932215076082277e-06, "loss": 0.29705004692077636, "num_input_tokens_seen": 838541408, "step": 19175, "train_runtime": 148382.7784, "train_tokens_per_second": 5651.204 }, { "epoch": 1.2914085645030973, "grad_norm": 0.7142148877160069, "learning_rate": 2.790849196117219e-06, "loss": 0.30868139266967776, "num_input_tokens_seen": 838777616, "step": 19180, "train_runtime": 148425.245, "train_tokens_per_second": 5651.179 }, { "epoch": 1.2917452194990573, "grad_norm": 0.7147263101151003, "learning_rate": 2.7884775024081856e-06, "loss": 0.30340185165405276, "num_input_tokens_seen": 838994528, "step": 19185, "train_runtime": 148461.9522, "train_tokens_per_second": 5651.243 }, { "epoch": 1.2920818744950175, "grad_norm": 0.7411183792886813, "learning_rate": 2.786106427144367e-06, "loss": 0.292337703704834, "num_input_tokens_seen": 839211816, "step": 19190, "train_runtime": 148497.1246, "train_tokens_per_second": 5651.367 }, { "epoch": 1.2924185294909776, "grad_norm": 0.784444211412864, "learning_rate": 2.783735970988828e-06, "loss": 0.27770419120788575, "num_input_tokens_seen": 839425992, "step": 19195, "train_runtime": 148536.5284, "train_tokens_per_second": 5651.31 }, { "epoch": 1.2927551844869378, "grad_norm": 0.7627571829537649, "learning_rate": 2.7813661346044566e-06, "loss": 0.31344926357269287, "num_input_tokens_seen": 839639736, "step": 19200, "train_runtime": 148570.4019, "train_tokens_per_second": 5651.46 }, { "epoch": 1.2930918394828979, "grad_norm": 0.8342081884001865, "learning_rate": 2.7789969186539713e-06, "loss": 0.30696806907653806, "num_input_tokens_seen": 839843624, "step": 19205, "train_runtime": 148611.1575, "train_tokens_per_second": 5651.282 }, { "epoch": 1.293428494478858, "grad_norm": 0.7673215752721638, "learning_rate": 2.776628323799915e-06, "loss": 0.32203989028930663, "num_input_tokens_seen": 840061080, "step": 19210, "train_runtime": 148644.4524, "train_tokens_per_second": 5651.48 }, { "epoch": 1.2937651494748181, "grad_norm": 0.8083666833563818, "learning_rate": 2.774260350704657e-06, "loss": 0.3181305408477783, "num_input_tokens_seen": 840276920, "step": 19215, "train_runtime": 148679.4894, "train_tokens_per_second": 5651.599 }, { "epoch": 1.2941018044707784, "grad_norm": 0.7678745273221902, "learning_rate": 2.771893000030398e-06, "loss": 0.3186459541320801, "num_input_tokens_seen": 840489952, "step": 19220, "train_runtime": 148716.8291, "train_tokens_per_second": 5651.613 }, { "epoch": 1.2944384594667384, "grad_norm": 0.7272017085399577, "learning_rate": 2.7695262724391526e-06, "loss": 0.29137458801269533, "num_input_tokens_seen": 840702144, "step": 19225, "train_runtime": 148759.5159, "train_tokens_per_second": 5651.418 }, { "epoch": 1.2947751144626987, "grad_norm": 0.7630834988917379, "learning_rate": 2.767160168592777e-06, "loss": 0.33965349197387695, "num_input_tokens_seen": 840931688, "step": 19230, "train_runtime": 148806.4026, "train_tokens_per_second": 5651.179 }, { "epoch": 1.2951117694586587, "grad_norm": 0.7684748875099028, "learning_rate": 2.7647946891529355e-06, "loss": 0.3225222110748291, "num_input_tokens_seen": 841129968, "step": 19235, "train_runtime": 148842.7883, "train_tokens_per_second": 5651.13 }, { "epoch": 1.295448424454619, "grad_norm": 0.728042153912699, "learning_rate": 2.7624298347811342e-06, "loss": 0.3056331157684326, "num_input_tokens_seen": 841331904, "step": 19240, "train_runtime": 148884.4042, "train_tokens_per_second": 5650.907 }, { "epoch": 1.295785079450579, "grad_norm": 0.7854514457019474, "learning_rate": 2.7600656061386945e-06, "loss": 0.31122641563415526, "num_input_tokens_seen": 841562064, "step": 19245, "train_runtime": 148919.1545, "train_tokens_per_second": 5651.134 }, { "epoch": 1.2961217344465392, "grad_norm": 0.7775133786016957, "learning_rate": 2.757702003886765e-06, "loss": 0.2915956974029541, "num_input_tokens_seen": 841780328, "step": 19250, "train_runtime": 148953.299, "train_tokens_per_second": 5651.304 }, { "epoch": 1.2964583894424992, "grad_norm": 1.058051599935181, "learning_rate": 2.7553390286863205e-06, "loss": 0.29277448654174804, "num_input_tokens_seen": 841982320, "step": 19255, "train_runtime": 148990.52, "train_tokens_per_second": 5651.248 }, { "epoch": 1.2967950444384595, "grad_norm": 0.7544624265455544, "learning_rate": 2.752976681198159e-06, "loss": 0.3195603609085083, "num_input_tokens_seen": 842210920, "step": 19260, "train_runtime": 149028.3612, "train_tokens_per_second": 5651.347 }, { "epoch": 1.2971316994344195, "grad_norm": 0.8113254179825854, "learning_rate": 2.750614962082901e-06, "loss": 0.28080661296844484, "num_input_tokens_seen": 842433856, "step": 19265, "train_runtime": 149066.4868, "train_tokens_per_second": 5651.397 }, { "epoch": 1.2974683544303798, "grad_norm": 0.7219059530126368, "learning_rate": 2.748253872001e-06, "loss": 0.3025611162185669, "num_input_tokens_seen": 842651984, "step": 19270, "train_runtime": 149103.7773, "train_tokens_per_second": 5651.446 }, { "epoch": 1.2978050094263398, "grad_norm": 0.7933392458748796, "learning_rate": 2.74589341161272e-06, "loss": 0.30447611808776853, "num_input_tokens_seen": 842849968, "step": 19275, "train_runtime": 149143.5367, "train_tokens_per_second": 5651.267 }, { "epoch": 1.2981416644223, "grad_norm": 0.8775197487075084, "learning_rate": 2.743533581578163e-06, "loss": 0.31205015182495116, "num_input_tokens_seen": 843059320, "step": 19280, "train_runtime": 149180.2644, "train_tokens_per_second": 5651.279 }, { "epoch": 1.29847831941826, "grad_norm": 0.7923357381559762, "learning_rate": 2.7411743825572407e-06, "loss": 0.3455479145050049, "num_input_tokens_seen": 843291856, "step": 19285, "train_runtime": 149215.3246, "train_tokens_per_second": 5651.51 }, { "epoch": 1.2988149744142203, "grad_norm": 0.7093696654952529, "learning_rate": 2.7388158152097015e-06, "loss": 0.30530009269714353, "num_input_tokens_seen": 843521128, "step": 19290, "train_runtime": 149245.9801, "train_tokens_per_second": 5651.885 }, { "epoch": 1.2991516294101804, "grad_norm": 0.7343455792050803, "learning_rate": 2.736457880195109e-06, "loss": 0.3188295841217041, "num_input_tokens_seen": 843733872, "step": 19295, "train_runtime": 149283.513, "train_tokens_per_second": 5651.889 }, { "epoch": 1.2994882844061406, "grad_norm": 0.7396876861043844, "learning_rate": 2.7341005781728523e-06, "loss": 0.3281911849975586, "num_input_tokens_seen": 843964944, "step": 19300, "train_runtime": 149329.5165, "train_tokens_per_second": 5651.695 }, { "epoch": 1.2998249394021006, "grad_norm": 0.752304677269571, "learning_rate": 2.7317439098021444e-06, "loss": 0.3072381496429443, "num_input_tokens_seen": 844183152, "step": 19305, "train_runtime": 149373.377, "train_tokens_per_second": 5651.497 }, { "epoch": 1.300161594398061, "grad_norm": 0.7866331506852371, "learning_rate": 2.7293878757420185e-06, "loss": 0.32221331596374514, "num_input_tokens_seen": 844400152, "step": 19310, "train_runtime": 149415.5476, "train_tokens_per_second": 5651.354 }, { "epoch": 1.3004982493940211, "grad_norm": 0.7241103171317756, "learning_rate": 2.7270324766513306e-06, "loss": 0.3104707717895508, "num_input_tokens_seen": 844631680, "step": 19315, "train_runtime": 149454.6137, "train_tokens_per_second": 5651.426 }, { "epoch": 1.3008349043899812, "grad_norm": 0.7716528370818122, "learning_rate": 2.724677713188767e-06, "loss": 0.3056204795837402, "num_input_tokens_seen": 844836448, "step": 19320, "train_runtime": 149496.2843, "train_tokens_per_second": 5651.22 }, { "epoch": 1.3011715593859412, "grad_norm": 0.7945005896939524, "learning_rate": 2.722323586012821e-06, "loss": 0.313628101348877, "num_input_tokens_seen": 845053136, "step": 19325, "train_runtime": 149533.6826, "train_tokens_per_second": 5651.256 }, { "epoch": 1.3015082143819015, "grad_norm": 0.7917610556705151, "learning_rate": 2.7199700957818252e-06, "loss": 0.3013652801513672, "num_input_tokens_seen": 845276504, "step": 19330, "train_runtime": 149575.9646, "train_tokens_per_second": 5651.152 }, { "epoch": 1.3018448693778617, "grad_norm": 0.8720139344385164, "learning_rate": 2.717617243153918e-06, "loss": 0.3019449710845947, "num_input_tokens_seen": 845488208, "step": 19335, "train_runtime": 149622.3515, "train_tokens_per_second": 5650.815 }, { "epoch": 1.3021815243738217, "grad_norm": 0.7397233088744621, "learning_rate": 2.715265028787073e-06, "loss": 0.31660406589508056, "num_input_tokens_seen": 845695240, "step": 19340, "train_runtime": 149660.9196, "train_tokens_per_second": 5650.742 }, { "epoch": 1.3025181793697818, "grad_norm": 0.8121569406562228, "learning_rate": 2.7129134533390765e-06, "loss": 0.33323040008544924, "num_input_tokens_seen": 845925768, "step": 19345, "train_runtime": 149697.7788, "train_tokens_per_second": 5650.891 }, { "epoch": 1.302854834365742, "grad_norm": 0.7696563717601685, "learning_rate": 2.7105625174675404e-06, "loss": 0.2952426433563232, "num_input_tokens_seen": 846155368, "step": 19350, "train_runtime": 149736.5358, "train_tokens_per_second": 5650.961 }, { "epoch": 1.3031914893617023, "grad_norm": 0.7453975160800163, "learning_rate": 2.7082122218298957e-06, "loss": 0.2969479560852051, "num_input_tokens_seen": 846367080, "step": 19355, "train_runtime": 149773.8436, "train_tokens_per_second": 5650.967 }, { "epoch": 1.3035281443576623, "grad_norm": 0.7913525098809976, "learning_rate": 2.7058625670833947e-06, "loss": 0.3046135902404785, "num_input_tokens_seen": 846584096, "step": 19360, "train_runtime": 149810.105, "train_tokens_per_second": 5651.048 }, { "epoch": 1.3038647993536223, "grad_norm": 0.7456322958807796, "learning_rate": 2.70351355388511e-06, "loss": 0.306339168548584, "num_input_tokens_seen": 846800416, "step": 19365, "train_runtime": 149844.731, "train_tokens_per_second": 5651.186 }, { "epoch": 1.3042014543495826, "grad_norm": 0.7705924730860086, "learning_rate": 2.7011651828919407e-06, "loss": 0.30881786346435547, "num_input_tokens_seen": 847024880, "step": 19370, "train_runtime": 149886.5908, "train_tokens_per_second": 5651.105 }, { "epoch": 1.3045381093455428, "grad_norm": 0.7634554372376511, "learning_rate": 2.698817454760593e-06, "loss": 0.305006217956543, "num_input_tokens_seen": 847244184, "step": 19375, "train_runtime": 149919.4984, "train_tokens_per_second": 5651.327 }, { "epoch": 1.3048747643415028, "grad_norm": 0.7420517594807788, "learning_rate": 2.696470370147611e-06, "loss": 0.3149790048599243, "num_input_tokens_seen": 847461096, "step": 19380, "train_runtime": 149955.0762, "train_tokens_per_second": 5651.433 }, { "epoch": 1.3052114193374629, "grad_norm": 0.7739344518736725, "learning_rate": 2.69412392970934e-06, "loss": 0.3325794219970703, "num_input_tokens_seen": 847680648, "step": 19385, "train_runtime": 149993.1514, "train_tokens_per_second": 5651.462 }, { "epoch": 1.3055480743334231, "grad_norm": 0.6530513267019178, "learning_rate": 2.6917781341019615e-06, "loss": 0.2991641044616699, "num_input_tokens_seen": 847901040, "step": 19390, "train_runtime": 150031.3101, "train_tokens_per_second": 5651.494 }, { "epoch": 1.3058847293293834, "grad_norm": 0.8035047874324559, "learning_rate": 2.689432983981467e-06, "loss": 0.2986927032470703, "num_input_tokens_seen": 848128768, "step": 19395, "train_runtime": 150080.1123, "train_tokens_per_second": 5651.174 }, { "epoch": 1.3062213843253434, "grad_norm": 0.7325503260453592, "learning_rate": 2.6870884800036713e-06, "loss": 0.3080791234970093, "num_input_tokens_seen": 848340072, "step": 19400, "train_runtime": 150113.6518, "train_tokens_per_second": 5651.319 }, { "epoch": 1.3065580393213034, "grad_norm": 0.948401336461252, "learning_rate": 2.684744622824207e-06, "loss": 0.32254228591918943, "num_input_tokens_seen": 848548544, "step": 19405, "train_runtime": 150152.8491, "train_tokens_per_second": 5651.232 }, { "epoch": 1.3068946943172637, "grad_norm": 0.7795604426950599, "learning_rate": 2.6824014130985255e-06, "loss": 0.31671667098999023, "num_input_tokens_seen": 848765608, "step": 19410, "train_runtime": 150190.0674, "train_tokens_per_second": 5651.277 }, { "epoch": 1.307231349313224, "grad_norm": 0.7275328657604889, "learning_rate": 2.680058851481896e-06, "loss": 0.2992823600769043, "num_input_tokens_seen": 848984336, "step": 19415, "train_runtime": 150225.1677, "train_tokens_per_second": 5651.412 }, { "epoch": 1.307568004309184, "grad_norm": 0.8231036715155717, "learning_rate": 2.6777169386294154e-06, "loss": 0.3124098777770996, "num_input_tokens_seen": 849202320, "step": 19420, "train_runtime": 150263.4801, "train_tokens_per_second": 5651.422 }, { "epoch": 1.307904659305144, "grad_norm": 0.784487047120117, "learning_rate": 2.6753756751959846e-06, "loss": 0.30565834045410156, "num_input_tokens_seen": 849432016, "step": 19425, "train_runtime": 150304.88, "train_tokens_per_second": 5651.393 }, { "epoch": 1.3082413143011042, "grad_norm": 0.7160689409622006, "learning_rate": 2.6730350618363367e-06, "loss": 0.3007196426391602, "num_input_tokens_seen": 849652096, "step": 19430, "train_runtime": 150339.418, "train_tokens_per_second": 5651.559 }, { "epoch": 1.3085779692970645, "grad_norm": 1.0693121673231818, "learning_rate": 2.6706950992050097e-06, "loss": 0.2976806640625, "num_input_tokens_seen": 849873624, "step": 19435, "train_runtime": 150377.7065, "train_tokens_per_second": 5651.593 }, { "epoch": 1.3089146242930245, "grad_norm": 0.7521055380512028, "learning_rate": 2.6683557879563726e-06, "loss": 0.3227806091308594, "num_input_tokens_seen": 850094824, "step": 19440, "train_runtime": 150411.5882, "train_tokens_per_second": 5651.791 }, { "epoch": 1.3092512792889845, "grad_norm": 0.7577610588393768, "learning_rate": 2.6660171287446045e-06, "loss": 0.33275818824768066, "num_input_tokens_seen": 850318184, "step": 19445, "train_runtime": 150448.3342, "train_tokens_per_second": 5651.895 }, { "epoch": 1.3095879342849448, "grad_norm": 0.7044234887744943, "learning_rate": 2.6636791222237034e-06, "loss": 0.3194304943084717, "num_input_tokens_seen": 850537512, "step": 19450, "train_runtime": 150485.0966, "train_tokens_per_second": 5651.972 }, { "epoch": 1.309924589280905, "grad_norm": 0.7351419738193509, "learning_rate": 2.6613417690474864e-06, "loss": 0.3084381580352783, "num_input_tokens_seen": 850762520, "step": 19455, "train_runtime": 150516.0117, "train_tokens_per_second": 5652.306 }, { "epoch": 1.310261244276865, "grad_norm": 0.6957251747847025, "learning_rate": 2.6590050698695856e-06, "loss": 0.30487637519836425, "num_input_tokens_seen": 850980888, "step": 19460, "train_runtime": 150552.8661, "train_tokens_per_second": 5652.373 }, { "epoch": 1.310597899272825, "grad_norm": 0.7124189387924086, "learning_rate": 2.6566690253434508e-06, "loss": 0.31617035865783694, "num_input_tokens_seen": 851212384, "step": 19465, "train_runtime": 150591.0113, "train_tokens_per_second": 5652.478 }, { "epoch": 1.3109345542687854, "grad_norm": 0.7885036457021949, "learning_rate": 2.654333636122354e-06, "loss": 0.29657797813415526, "num_input_tokens_seen": 851438520, "step": 19470, "train_runtime": 150631.5054, "train_tokens_per_second": 5652.46 }, { "epoch": 1.3112712092647456, "grad_norm": 0.7024735867575697, "learning_rate": 2.6519989028593728e-06, "loss": 0.3158660173416138, "num_input_tokens_seen": 851666592, "step": 19475, "train_runtime": 150671.4222, "train_tokens_per_second": 5652.476 }, { "epoch": 1.3116078642607056, "grad_norm": 0.8346584854469274, "learning_rate": 2.649664826207414e-06, "loss": 0.31950523853302004, "num_input_tokens_seen": 851881728, "step": 19480, "train_runtime": 150710.0418, "train_tokens_per_second": 5652.455 }, { "epoch": 1.3119445192566657, "grad_norm": 0.8221325321759024, "learning_rate": 2.647331406819189e-06, "loss": 0.3350534915924072, "num_input_tokens_seen": 852092288, "step": 19485, "train_runtime": 150747.5697, "train_tokens_per_second": 5652.445 }, { "epoch": 1.312281174252626, "grad_norm": 0.7024744149478919, "learning_rate": 2.644998645347236e-06, "loss": 0.29921770095825195, "num_input_tokens_seen": 852306504, "step": 19490, "train_runtime": 150791.8993, "train_tokens_per_second": 5652.204 }, { "epoch": 1.3126178292485862, "grad_norm": 0.7284467267787711, "learning_rate": 2.6426665424439025e-06, "loss": 0.316993260383606, "num_input_tokens_seen": 852532944, "step": 19495, "train_runtime": 150836.5301, "train_tokens_per_second": 5652.032 }, { "epoch": 1.3129544842445462, "grad_norm": 0.8271670284793109, "learning_rate": 2.6403350987613526e-06, "loss": 0.31356039047241213, "num_input_tokens_seen": 852756160, "step": 19500, "train_runtime": 150879.3547, "train_tokens_per_second": 5651.908 }, { "epoch": 1.3132911392405062, "grad_norm": 0.7670722817590104, "learning_rate": 2.6380043149515676e-06, "loss": 0.3076605796813965, "num_input_tokens_seen": 852971624, "step": 19505, "train_runtime": 150913.3012, "train_tokens_per_second": 5652.064 }, { "epoch": 1.3136277942364665, "grad_norm": 0.7538754898846585, "learning_rate": 2.6356741916663453e-06, "loss": 0.3078343868255615, "num_input_tokens_seen": 853194624, "step": 19510, "train_runtime": 150952.8524, "train_tokens_per_second": 5652.06 }, { "epoch": 1.3139644492324267, "grad_norm": 0.8299463216741857, "learning_rate": 2.6333447295572933e-06, "loss": 0.310660195350647, "num_input_tokens_seen": 853414920, "step": 19515, "train_runtime": 150985.9986, "train_tokens_per_second": 5652.279 }, { "epoch": 1.3143011042283868, "grad_norm": 0.7460970673432722, "learning_rate": 2.631015929275845e-06, "loss": 0.3059165239334106, "num_input_tokens_seen": 853622712, "step": 19520, "train_runtime": 151026.6956, "train_tokens_per_second": 5652.131 }, { "epoch": 1.3146377592243468, "grad_norm": 0.770739755897705, "learning_rate": 2.628687791473234e-06, "loss": 0.29071602821350095, "num_input_tokens_seen": 853853296, "step": 19525, "train_runtime": 151057.0111, "train_tokens_per_second": 5652.523 }, { "epoch": 1.314974414220307, "grad_norm": 0.8302523376916937, "learning_rate": 2.6263603168005224e-06, "loss": 0.2854055643081665, "num_input_tokens_seen": 854070296, "step": 19530, "train_runtime": 151102.3064, "train_tokens_per_second": 5652.265 }, { "epoch": 1.3153110692162673, "grad_norm": 0.6658939434607352, "learning_rate": 2.6240335059085797e-06, "loss": 0.30446481704711914, "num_input_tokens_seen": 854298216, "step": 19535, "train_runtime": 151143.3911, "train_tokens_per_second": 5652.237 }, { "epoch": 1.3156477242122273, "grad_norm": 0.7452286529155747, "learning_rate": 2.62170735944809e-06, "loss": 0.3120380163192749, "num_input_tokens_seen": 854517360, "step": 19540, "train_runtime": 151180.803, "train_tokens_per_second": 5652.287 }, { "epoch": 1.3159843792081873, "grad_norm": 0.7794163551487556, "learning_rate": 2.6193818780695537e-06, "loss": 0.298751163482666, "num_input_tokens_seen": 854745560, "step": 19545, "train_runtime": 151214.1843, "train_tokens_per_second": 5652.549 }, { "epoch": 1.3163210342041476, "grad_norm": 0.7606004553161916, "learning_rate": 2.6170570624232837e-06, "loss": 0.3143803119659424, "num_input_tokens_seen": 854941592, "step": 19550, "train_runtime": 151257.5538, "train_tokens_per_second": 5652.224 }, { "epoch": 1.3166576892001078, "grad_norm": 0.7540362996447706, "learning_rate": 2.6147329131594078e-06, "loss": 0.2849498510360718, "num_input_tokens_seen": 855170576, "step": 19555, "train_runtime": 151298.4772, "train_tokens_per_second": 5652.209 }, { "epoch": 1.3169943441960679, "grad_norm": 0.6379893471729663, "learning_rate": 2.612409430927867e-06, "loss": 0.2712059020996094, "num_input_tokens_seen": 855390328, "step": 19560, "train_runtime": 151335.988, "train_tokens_per_second": 5652.26 }, { "epoch": 1.317330999192028, "grad_norm": 1.705002769226515, "learning_rate": 2.610086616378413e-06, "loss": 0.29099502563476565, "num_input_tokens_seen": 855599680, "step": 19565, "train_runtime": 151369.3355, "train_tokens_per_second": 5652.398 }, { "epoch": 1.3176676541879881, "grad_norm": 0.6619066534695688, "learning_rate": 2.60776447016062e-06, "loss": 0.3147557497024536, "num_input_tokens_seen": 855821216, "step": 19570, "train_runtime": 151406.8413, "train_tokens_per_second": 5652.461 }, { "epoch": 1.3180043091839484, "grad_norm": 0.7847891473320998, "learning_rate": 2.6054429929238607e-06, "loss": 0.31384851932525637, "num_input_tokens_seen": 856037064, "step": 19575, "train_runtime": 151440.0977, "train_tokens_per_second": 5652.645 }, { "epoch": 1.3183409641799084, "grad_norm": 0.6462398801805597, "learning_rate": 2.603122185317335e-06, "loss": 0.29209444522857664, "num_input_tokens_seen": 856240856, "step": 19580, "train_runtime": 151475.745, "train_tokens_per_second": 5652.66 }, { "epoch": 1.3186776191758685, "grad_norm": 0.7747243284477985, "learning_rate": 2.6008020479900465e-06, "loss": 0.2708132743835449, "num_input_tokens_seen": 856453280, "step": 19585, "train_runtime": 151515.0863, "train_tokens_per_second": 5652.594 }, { "epoch": 1.3190142741718287, "grad_norm": 0.6709060817752821, "learning_rate": 2.598482581590815e-06, "loss": 0.30856051445007326, "num_input_tokens_seen": 856685160, "step": 19590, "train_runtime": 151550.6826, "train_tokens_per_second": 5652.796 }, { "epoch": 1.319350929167789, "grad_norm": 0.698540481486877, "learning_rate": 2.5961637867682715e-06, "loss": 0.280717658996582, "num_input_tokens_seen": 856916440, "step": 19595, "train_runtime": 151591.3298, "train_tokens_per_second": 5652.806 }, { "epoch": 1.319687584163749, "grad_norm": 0.6957573651733252, "learning_rate": 2.5938456641708598e-06, "loss": 0.28789021968841555, "num_input_tokens_seen": 857134672, "step": 19600, "train_runtime": 151620.8055, "train_tokens_per_second": 5653.147 }, { "epoch": 1.320024239159709, "grad_norm": 0.772599706020318, "learning_rate": 2.591528214446836e-06, "loss": 0.3085463523864746, "num_input_tokens_seen": 857366576, "step": 19605, "train_runtime": 151656.731, "train_tokens_per_second": 5653.337 }, { "epoch": 1.3203608941556693, "grad_norm": 0.7024918619799805, "learning_rate": 2.5892114382442664e-06, "loss": 0.3224550724029541, "num_input_tokens_seen": 857583784, "step": 19610, "train_runtime": 151693.8363, "train_tokens_per_second": 5653.386 }, { "epoch": 1.3206975491516295, "grad_norm": 0.632625020427823, "learning_rate": 2.5868953362110287e-06, "loss": 0.29941411018371583, "num_input_tokens_seen": 857806240, "step": 19615, "train_runtime": 151729.7798, "train_tokens_per_second": 5653.513 }, { "epoch": 1.3210342041475895, "grad_norm": 0.6986436139568517, "learning_rate": 2.5845799089948196e-06, "loss": 0.29595515727996824, "num_input_tokens_seen": 858015600, "step": 19620, "train_runtime": 151767.663, "train_tokens_per_second": 5653.481 }, { "epoch": 1.3213708591435496, "grad_norm": 0.7085148449641908, "learning_rate": 2.5822651572431323e-06, "loss": 0.30276174545288087, "num_input_tokens_seen": 858241536, "step": 19625, "train_runtime": 151807.9703, "train_tokens_per_second": 5653.468 }, { "epoch": 1.3217075141395098, "grad_norm": 0.7897947876767634, "learning_rate": 2.5799510816032867e-06, "loss": 0.3044028043746948, "num_input_tokens_seen": 858431176, "step": 19630, "train_runtime": 151849.2654, "train_tokens_per_second": 5653.18 }, { "epoch": 1.32204416913547, "grad_norm": 0.7421651364229699, "learning_rate": 2.577637682722404e-06, "loss": 0.31405105590820315, "num_input_tokens_seen": 858649160, "step": 19635, "train_runtime": 151893.2046, "train_tokens_per_second": 5652.979 }, { "epoch": 1.32238082413143, "grad_norm": 0.9243365365036531, "learning_rate": 2.5753249612474195e-06, "loss": 0.3185321807861328, "num_input_tokens_seen": 858864688, "step": 19640, "train_runtime": 151935.4081, "train_tokens_per_second": 5652.828 }, { "epoch": 1.3227174791273901, "grad_norm": 0.714378409765336, "learning_rate": 2.5730129178250774e-06, "loss": 0.3150054693222046, "num_input_tokens_seen": 859090984, "step": 19645, "train_runtime": 151973.3637, "train_tokens_per_second": 5652.905 }, { "epoch": 1.3230541341233504, "grad_norm": 0.7478713199114753, "learning_rate": 2.570701553101933e-06, "loss": 0.3087807893753052, "num_input_tokens_seen": 859303816, "step": 19650, "train_runtime": 152016.815, "train_tokens_per_second": 5652.689 }, { "epoch": 1.3233907891193106, "grad_norm": 0.7180167108657562, "learning_rate": 2.568390867724354e-06, "loss": 0.3278617858886719, "num_input_tokens_seen": 859526840, "step": 19655, "train_runtime": 152059.4571, "train_tokens_per_second": 5652.571 }, { "epoch": 1.3237274441152707, "grad_norm": 0.8472549748110341, "learning_rate": 2.5660808623385143e-06, "loss": 0.3053846836090088, "num_input_tokens_seen": 859736800, "step": 19660, "train_runtime": 152097.7055, "train_tokens_per_second": 5652.53 }, { "epoch": 1.3240640991112307, "grad_norm": 0.6854888856572094, "learning_rate": 2.5637715375903984e-06, "loss": 0.2824453830718994, "num_input_tokens_seen": 859955360, "step": 19665, "train_runtime": 152139.8395, "train_tokens_per_second": 5652.401 }, { "epoch": 1.324400754107191, "grad_norm": 0.8425691445759216, "learning_rate": 2.5614628941258075e-06, "loss": 0.3014561176300049, "num_input_tokens_seen": 860163408, "step": 19670, "train_runtime": 152179.5969, "train_tokens_per_second": 5652.291 }, { "epoch": 1.3247374091031512, "grad_norm": 0.785890365158059, "learning_rate": 2.5591549325903388e-06, "loss": 0.3199615478515625, "num_input_tokens_seen": 860403016, "step": 19675, "train_runtime": 152220.8565, "train_tokens_per_second": 5652.333 }, { "epoch": 1.3250740640991112, "grad_norm": 0.7049194900739367, "learning_rate": 2.5568476536294105e-06, "loss": 0.3173452615737915, "num_input_tokens_seen": 860626712, "step": 19680, "train_runtime": 152253.5963, "train_tokens_per_second": 5652.587 }, { "epoch": 1.3254107190950712, "grad_norm": 0.7458641790263951, "learning_rate": 2.5545410578882466e-06, "loss": 0.2950143814086914, "num_input_tokens_seen": 860857936, "step": 19685, "train_runtime": 152289.1953, "train_tokens_per_second": 5652.784 }, { "epoch": 1.3257473740910315, "grad_norm": 0.8429589187979019, "learning_rate": 2.5522351460118776e-06, "loss": 0.2903186321258545, "num_input_tokens_seen": 861063800, "step": 19690, "train_runtime": 152319.4076, "train_tokens_per_second": 5653.014 }, { "epoch": 1.3260840290869917, "grad_norm": 0.6773218912537953, "learning_rate": 2.549929918645144e-06, "loss": 0.31392974853515626, "num_input_tokens_seen": 861297432, "step": 19695, "train_runtime": 152355.3898, "train_tokens_per_second": 5653.213 }, { "epoch": 1.3264206840829518, "grad_norm": 0.7356765211271618, "learning_rate": 2.5476253764326963e-06, "loss": 0.2875689506530762, "num_input_tokens_seen": 861503656, "step": 19700, "train_runtime": 152391.6663, "train_tokens_per_second": 5653.22 }, { "epoch": 1.3267573390789118, "grad_norm": 0.7016223117638092, "learning_rate": 2.5453215200189927e-06, "loss": 0.2943393707275391, "num_input_tokens_seen": 861717016, "step": 19705, "train_runtime": 152429.9059, "train_tokens_per_second": 5653.202 }, { "epoch": 1.327093994074872, "grad_norm": 0.7845624304921898, "learning_rate": 2.543018350048298e-06, "loss": 0.29305644035339357, "num_input_tokens_seen": 861937640, "step": 19710, "train_runtime": 152468.0419, "train_tokens_per_second": 5653.235 }, { "epoch": 1.3274306490708323, "grad_norm": 0.7711375220547478, "learning_rate": 2.540715867164685e-06, "loss": 0.3149756908416748, "num_input_tokens_seen": 862156848, "step": 19715, "train_runtime": 152506.2922, "train_tokens_per_second": 5653.254 }, { "epoch": 1.3277673040667923, "grad_norm": 0.8404428785990262, "learning_rate": 2.538414072012042e-06, "loss": 0.30890326499938964, "num_input_tokens_seen": 862362672, "step": 19720, "train_runtime": 152547.9973, "train_tokens_per_second": 5653.058 }, { "epoch": 1.3281039590627524, "grad_norm": 0.8169832466518516, "learning_rate": 2.53611296523405e-06, "loss": 0.3164846420288086, "num_input_tokens_seen": 862573904, "step": 19725, "train_runtime": 152580.4337, "train_tokens_per_second": 5653.241 }, { "epoch": 1.3284406140587126, "grad_norm": 0.793059236401201, "learning_rate": 2.5338125474742127e-06, "loss": 0.2981910228729248, "num_input_tokens_seen": 862787064, "step": 19730, "train_runtime": 152618.0709, "train_tokens_per_second": 5653.243 }, { "epoch": 1.3287772690546729, "grad_norm": 0.6549096029319272, "learning_rate": 2.531512819375832e-06, "loss": 0.2908968448638916, "num_input_tokens_seen": 863007040, "step": 19735, "train_runtime": 152662.0691, "train_tokens_per_second": 5653.055 }, { "epoch": 1.3291139240506329, "grad_norm": 0.7643581112810446, "learning_rate": 2.52921378158202e-06, "loss": 0.2935811996459961, "num_input_tokens_seen": 863219112, "step": 19740, "train_runtime": 152697.5407, "train_tokens_per_second": 5653.13 }, { "epoch": 1.329450579046593, "grad_norm": 0.8140047984203814, "learning_rate": 2.5269154347356957e-06, "loss": 0.2813416957855225, "num_input_tokens_seen": 863441536, "step": 19745, "train_runtime": 152736.5725, "train_tokens_per_second": 5653.142 }, { "epoch": 1.3297872340425532, "grad_norm": 0.8712638461066203, "learning_rate": 2.5246177794795834e-06, "loss": 0.30994884967803954, "num_input_tokens_seen": 863641736, "step": 19750, "train_runtime": 152783.7657, "train_tokens_per_second": 5652.706 }, { "epoch": 1.3301238890385134, "grad_norm": 0.6601157103213744, "learning_rate": 2.5223208164562163e-06, "loss": 0.30829753875732424, "num_input_tokens_seen": 863857152, "step": 19755, "train_runtime": 152823.124, "train_tokens_per_second": 5652.66 }, { "epoch": 1.3304605440344734, "grad_norm": 0.7196822514488103, "learning_rate": 2.5200245463079315e-06, "loss": 0.31928205490112305, "num_input_tokens_seen": 864070800, "step": 19760, "train_runtime": 152859.6114, "train_tokens_per_second": 5652.708 }, { "epoch": 1.3307971990304335, "grad_norm": 0.7776014244495211, "learning_rate": 2.5177289696768725e-06, "loss": 0.32152862548828126, "num_input_tokens_seen": 864291928, "step": 19765, "train_runtime": 152893.0449, "train_tokens_per_second": 5652.919 }, { "epoch": 1.3311338540263937, "grad_norm": 0.7457812155053926, "learning_rate": 2.515434087204996e-06, "loss": 0.29552688598632815, "num_input_tokens_seen": 864526144, "step": 19770, "train_runtime": 152933.1454, "train_tokens_per_second": 5652.968 }, { "epoch": 1.331470509022354, "grad_norm": 0.628218974067636, "learning_rate": 2.51313989953405e-06, "loss": 0.3004995107650757, "num_input_tokens_seen": 864756000, "step": 19775, "train_runtime": 152967.0366, "train_tokens_per_second": 5653.218 }, { "epoch": 1.331807164018314, "grad_norm": 0.7135273557700192, "learning_rate": 2.510846407305603e-06, "loss": 0.298743748664856, "num_input_tokens_seen": 864976528, "step": 19780, "train_runtime": 153002.9046, "train_tokens_per_second": 5653.334 }, { "epoch": 1.332143819014274, "grad_norm": 0.678096834485325, "learning_rate": 2.508553611161021e-06, "loss": 0.3048709392547607, "num_input_tokens_seen": 865197968, "step": 19785, "train_runtime": 153045.6277, "train_tokens_per_second": 5653.203 }, { "epoch": 1.3324804740102343, "grad_norm": 0.7272471213502572, "learning_rate": 2.5062615117414773e-06, "loss": 0.3029000759124756, "num_input_tokens_seen": 865431584, "step": 19790, "train_runtime": 153089.6551, "train_tokens_per_second": 5653.103 }, { "epoch": 1.3328171290061945, "grad_norm": 0.7477356879857912, "learning_rate": 2.50397010968795e-06, "loss": 0.2859670400619507, "num_input_tokens_seen": 865646552, "step": 19795, "train_runtime": 153133.4962, "train_tokens_per_second": 5652.888 }, { "epoch": 1.3331537840021546, "grad_norm": 0.7549750199167686, "learning_rate": 2.501679405641222e-06, "loss": 0.32290475368499755, "num_input_tokens_seen": 865868968, "step": 19800, "train_runtime": 153168.7301, "train_tokens_per_second": 5653.04 }, { "epoch": 1.3334904389981148, "grad_norm": 0.7654205877160946, "learning_rate": 2.499389400241881e-06, "loss": 0.30891990661621094, "num_input_tokens_seen": 866072568, "step": 19805, "train_runtime": 153205.9089, "train_tokens_per_second": 5652.997 }, { "epoch": 1.3338270939940748, "grad_norm": 0.6968224775968341, "learning_rate": 2.497100094130321e-06, "loss": 0.27096853256225584, "num_input_tokens_seen": 866291048, "step": 19810, "train_runtime": 153242.9077, "train_tokens_per_second": 5653.058 }, { "epoch": 1.334163748990035, "grad_norm": 0.6748296546699505, "learning_rate": 2.494811487946737e-06, "loss": 0.2911532402038574, "num_input_tokens_seen": 866515272, "step": 19815, "train_runtime": 153277.1916, "train_tokens_per_second": 5653.256 }, { "epoch": 1.3345004039859951, "grad_norm": 0.7534075118050922, "learning_rate": 2.492523582331135e-06, "loss": 0.3089088201522827, "num_input_tokens_seen": 866738320, "step": 19820, "train_runtime": 153318.6584, "train_tokens_per_second": 5653.182 }, { "epoch": 1.3348370589819554, "grad_norm": 0.7981812627641985, "learning_rate": 2.4902363779233134e-06, "loss": 0.29610767364501955, "num_input_tokens_seen": 866959032, "step": 19825, "train_runtime": 153358.9779, "train_tokens_per_second": 5653.135 }, { "epoch": 1.3351737139779154, "grad_norm": 0.7457013614340272, "learning_rate": 2.4879498753628885e-06, "loss": 0.31332998275756835, "num_input_tokens_seen": 867155816, "step": 19830, "train_runtime": 153400.6658, "train_tokens_per_second": 5652.882 }, { "epoch": 1.3355103689738757, "grad_norm": 0.6543399547857148, "learning_rate": 2.4856640752892702e-06, "loss": 0.27421958446502687, "num_input_tokens_seen": 867382880, "step": 19835, "train_runtime": 153438.0486, "train_tokens_per_second": 5652.984 }, { "epoch": 1.3358470239698357, "grad_norm": 0.7540236121688988, "learning_rate": 2.4833789783416757e-06, "loss": 0.28227849006652833, "num_input_tokens_seen": 867604504, "step": 19840, "train_runtime": 153478.0421, "train_tokens_per_second": 5652.955 }, { "epoch": 1.336183678965796, "grad_norm": 0.7797596388766936, "learning_rate": 2.4810945851591245e-06, "loss": 0.3176878452301025, "num_input_tokens_seen": 867810880, "step": 19845, "train_runtime": 153514.5274, "train_tokens_per_second": 5652.956 }, { "epoch": 1.336520333961756, "grad_norm": 0.7762325041420014, "learning_rate": 2.4788108963804406e-06, "loss": 0.2944268941879272, "num_input_tokens_seen": 868031240, "step": 19850, "train_runtime": 153555.0069, "train_tokens_per_second": 5652.901 }, { "epoch": 1.3368569889577162, "grad_norm": 0.7515387143609674, "learning_rate": 2.4765279126442502e-06, "loss": 0.30596926212310793, "num_input_tokens_seen": 868253728, "step": 19855, "train_runtime": 153594.4952, "train_tokens_per_second": 5652.896 }, { "epoch": 1.3371936439536762, "grad_norm": 0.7609490688259355, "learning_rate": 2.4742456345889828e-06, "loss": 0.3069468975067139, "num_input_tokens_seen": 868466312, "step": 19860, "train_runtime": 153633.742, "train_tokens_per_second": 5652.836 }, { "epoch": 1.3375302989496365, "grad_norm": 0.7746964460091734, "learning_rate": 2.471964062852867e-06, "loss": 0.30750603675842286, "num_input_tokens_seen": 868689096, "step": 19865, "train_runtime": 153665.3062, "train_tokens_per_second": 5653.124 }, { "epoch": 1.3378669539455965, "grad_norm": 0.6717681437842503, "learning_rate": 2.469683198073943e-06, "loss": 0.29093983173370364, "num_input_tokens_seen": 868917088, "step": 19870, "train_runtime": 153696.1235, "train_tokens_per_second": 5653.474 }, { "epoch": 1.3382036089415568, "grad_norm": 0.9244971353347443, "learning_rate": 2.4674030408900414e-06, "loss": 0.2891664505004883, "num_input_tokens_seen": 869105376, "step": 19875, "train_runtime": 153735.3162, "train_tokens_per_second": 5653.258 }, { "epoch": 1.3385402639375168, "grad_norm": 0.8136223037135817, "learning_rate": 2.465123591938805e-06, "loss": 0.3123000144958496, "num_input_tokens_seen": 869319584, "step": 19880, "train_runtime": 153771.8119, "train_tokens_per_second": 5653.309 }, { "epoch": 1.338876918933477, "grad_norm": 0.73409884799906, "learning_rate": 2.462844851857673e-06, "loss": 0.31596615314483645, "num_input_tokens_seen": 869526576, "step": 19885, "train_runtime": 153815.0765, "train_tokens_per_second": 5653.065 }, { "epoch": 1.339213573929437, "grad_norm": 0.7895572970153802, "learning_rate": 2.4605668212838878e-06, "loss": 0.31440134048461915, "num_input_tokens_seen": 869742096, "step": 19890, "train_runtime": 153855.5507, "train_tokens_per_second": 5652.978 }, { "epoch": 1.3395502289253973, "grad_norm": 0.786706111069309, "learning_rate": 2.458289500854493e-06, "loss": 0.34726858139038086, "num_input_tokens_seen": 869961536, "step": 19895, "train_runtime": 153890.7632, "train_tokens_per_second": 5653.111 }, { "epoch": 1.3398868839213574, "grad_norm": 0.7370468195124786, "learning_rate": 2.4560128912063353e-06, "loss": 0.3165955305099487, "num_input_tokens_seen": 870165224, "step": 19900, "train_runtime": 153932.5225, "train_tokens_per_second": 5652.9 }, { "epoch": 1.3402235389173176, "grad_norm": 0.7650689001742789, "learning_rate": 2.4537369929760596e-06, "loss": 0.34606313705444336, "num_input_tokens_seen": 870396672, "step": 19905, "train_runtime": 153969.9255, "train_tokens_per_second": 5653.03 }, { "epoch": 1.3405601939132776, "grad_norm": 0.7725397454862113, "learning_rate": 2.4514618068001144e-06, "loss": 0.305745005607605, "num_input_tokens_seen": 870610560, "step": 19910, "train_runtime": 154008.56, "train_tokens_per_second": 5653.001 }, { "epoch": 1.3408968489092379, "grad_norm": 0.7591073107632155, "learning_rate": 2.4491873333147463e-06, "loss": 0.29233665466308595, "num_input_tokens_seen": 870825304, "step": 19915, "train_runtime": 154050.5577, "train_tokens_per_second": 5652.854 }, { "epoch": 1.341233503905198, "grad_norm": 0.8155190700964781, "learning_rate": 2.4469135731560106e-06, "loss": 0.2776491641998291, "num_input_tokens_seen": 871033624, "step": 19920, "train_runtime": 154088.9114, "train_tokens_per_second": 5652.799 }, { "epoch": 1.3415701589011582, "grad_norm": 0.7835805613524144, "learning_rate": 2.4446405269597494e-06, "loss": 0.31336369514465334, "num_input_tokens_seen": 871261480, "step": 19925, "train_runtime": 154138.0941, "train_tokens_per_second": 5652.473 }, { "epoch": 1.3419068138971182, "grad_norm": 0.7131677555675145, "learning_rate": 2.442368195361618e-06, "loss": 0.27323174476623535, "num_input_tokens_seen": 871484784, "step": 19930, "train_runtime": 154175.5255, "train_tokens_per_second": 5652.549 }, { "epoch": 1.3422434688930784, "grad_norm": 0.7614586629617044, "learning_rate": 2.4400965789970647e-06, "loss": 0.2858338594436646, "num_input_tokens_seen": 871694432, "step": 19935, "train_runtime": 154214.3119, "train_tokens_per_second": 5652.487 }, { "epoch": 1.3425801238890385, "grad_norm": 0.7849206092021981, "learning_rate": 2.437825678501339e-06, "loss": 0.3141868352890015, "num_input_tokens_seen": 871916776, "step": 19940, "train_runtime": 154256.1387, "train_tokens_per_second": 5652.396 }, { "epoch": 1.3429167788849987, "grad_norm": 0.6972967949553635, "learning_rate": 2.4355554945094956e-06, "loss": 0.3040180683135986, "num_input_tokens_seen": 872136592, "step": 19945, "train_runtime": 154298.8906, "train_tokens_per_second": 5652.254 }, { "epoch": 1.3432534338809587, "grad_norm": 0.7860171584750419, "learning_rate": 2.4332860276563763e-06, "loss": 0.2974998950958252, "num_input_tokens_seen": 872357128, "step": 19950, "train_runtime": 154335.8822, "train_tokens_per_second": 5652.329 }, { "epoch": 1.343590088876919, "grad_norm": 0.678809783107802, "learning_rate": 2.4310172785766396e-06, "loss": 0.30943219661712645, "num_input_tokens_seen": 872573624, "step": 19955, "train_runtime": 154378.2017, "train_tokens_per_second": 5652.182 }, { "epoch": 1.343926743872879, "grad_norm": 0.8435675441786462, "learning_rate": 2.428749247904724e-06, "loss": 0.31881489753723147, "num_input_tokens_seen": 872789824, "step": 19960, "train_runtime": 154415.7323, "train_tokens_per_second": 5652.208 }, { "epoch": 1.3442633988688393, "grad_norm": 0.7510529942793552, "learning_rate": 2.4264819362748856e-06, "loss": 0.3125936031341553, "num_input_tokens_seen": 873009864, "step": 19965, "train_runtime": 154452.1402, "train_tokens_per_second": 5652.3 }, { "epoch": 1.3446000538647993, "grad_norm": 0.8178579575509619, "learning_rate": 2.4242153443211663e-06, "loss": 0.3280599594116211, "num_input_tokens_seen": 873230264, "step": 19970, "train_runtime": 154483.7052, "train_tokens_per_second": 5652.572 }, { "epoch": 1.3449367088607596, "grad_norm": 0.7189596121215553, "learning_rate": 2.4219494726774124e-06, "loss": 0.2943082809448242, "num_input_tokens_seen": 873453312, "step": 19975, "train_runtime": 154519.1177, "train_tokens_per_second": 5652.72 }, { "epoch": 1.3452733638567196, "grad_norm": 0.7355041064223901, "learning_rate": 2.419684321977268e-06, "loss": 0.2926133632659912, "num_input_tokens_seen": 873660984, "step": 19980, "train_runtime": 154553.7989, "train_tokens_per_second": 5652.795 }, { "epoch": 1.3456100188526798, "grad_norm": 0.6865570643674106, "learning_rate": 2.417419892854175e-06, "loss": 0.29560866355896, "num_input_tokens_seen": 873892712, "step": 19985, "train_runtime": 154598.2899, "train_tokens_per_second": 5652.667 }, { "epoch": 1.3459466738486399, "grad_norm": 0.885274027016748, "learning_rate": 2.415156185941371e-06, "loss": 0.29713964462280273, "num_input_tokens_seen": 874102984, "step": 19990, "train_runtime": 154633.4222, "train_tokens_per_second": 5652.743 }, { "epoch": 1.3462833288446001, "grad_norm": 0.7645675693693532, "learning_rate": 2.412893201871902e-06, "loss": 0.30781164169311526, "num_input_tokens_seen": 874317048, "step": 19995, "train_runtime": 154674.4314, "train_tokens_per_second": 5652.628 }, { "epoch": 1.3466199838405601, "grad_norm": 0.7929208093171044, "learning_rate": 2.410630941278595e-06, "loss": 0.31746225357055663, "num_input_tokens_seen": 874537536, "step": 20000, "train_runtime": 154717.3345, "train_tokens_per_second": 5652.486 }, { "epoch": 1.3469566388365204, "grad_norm": 0.8665886750624643, "learning_rate": 2.408369404794092e-06, "loss": 0.3095715045928955, "num_input_tokens_seen": 874752264, "step": 20005, "train_runtime": 154752.6238, "train_tokens_per_second": 5652.584 }, { "epoch": 1.3472932938324804, "grad_norm": 0.7516875018971654, "learning_rate": 2.4061085930508176e-06, "loss": 0.30551714897155763, "num_input_tokens_seen": 874964968, "step": 20010, "train_runtime": 154789.9589, "train_tokens_per_second": 5652.595 }, { "epoch": 1.3476299488284407, "grad_norm": 0.8041861814830855, "learning_rate": 2.4038485066810058e-06, "loss": 0.3143286228179932, "num_input_tokens_seen": 875176368, "step": 20015, "train_runtime": 154836.4632, "train_tokens_per_second": 5652.263 }, { "epoch": 1.3479666038244007, "grad_norm": 0.7821727058895627, "learning_rate": 2.40158914631668e-06, "loss": 0.276894736289978, "num_input_tokens_seen": 875385288, "step": 20020, "train_runtime": 154870.1836, "train_tokens_per_second": 5652.381 }, { "epoch": 1.348303258820361, "grad_norm": 0.723635333292079, "learning_rate": 2.399330512589664e-06, "loss": 0.29750776290893555, "num_input_tokens_seen": 875609880, "step": 20025, "train_runtime": 154911.8697, "train_tokens_per_second": 5652.31 }, { "epoch": 1.348639913816321, "grad_norm": 0.7243913395939594, "learning_rate": 2.3970726061315775e-06, "loss": 0.30971436500549315, "num_input_tokens_seen": 875831888, "step": 20030, "train_runtime": 154948.8908, "train_tokens_per_second": 5652.392 }, { "epoch": 1.3489765688122812, "grad_norm": 0.7399215488091135, "learning_rate": 2.394815427573836e-06, "loss": 0.30228476524353026, "num_input_tokens_seen": 876061376, "step": 20035, "train_runtime": 154992.8431, "train_tokens_per_second": 5652.27 }, { "epoch": 1.3493132238082413, "grad_norm": 0.7012240220598052, "learning_rate": 2.3925589775476516e-06, "loss": 0.2862797021865845, "num_input_tokens_seen": 876272016, "step": 20040, "train_runtime": 155032.043, "train_tokens_per_second": 5652.199 }, { "epoch": 1.3496498788042015, "grad_norm": 0.7194801409568423, "learning_rate": 2.3903032566840377e-06, "loss": 0.31173529624938967, "num_input_tokens_seen": 876494336, "step": 20045, "train_runtime": 155073.9927, "train_tokens_per_second": 5652.104 }, { "epoch": 1.3499865338001615, "grad_norm": 0.7007455859084586, "learning_rate": 2.3880482656137926e-06, "loss": 0.31239540576934816, "num_input_tokens_seen": 876727136, "step": 20050, "train_runtime": 155114.2632, "train_tokens_per_second": 5652.137 }, { "epoch": 1.3503231887961218, "grad_norm": 0.7248173637285731, "learning_rate": 2.3857940049675254e-06, "loss": 0.3017667055130005, "num_input_tokens_seen": 876951616, "step": 20055, "train_runtime": 155154.1439, "train_tokens_per_second": 5652.131 }, { "epoch": 1.3506598437920818, "grad_norm": 0.7421571706340755, "learning_rate": 2.383540475375625e-06, "loss": 0.2906331062316895, "num_input_tokens_seen": 877172960, "step": 20060, "train_runtime": 155195.6002, "train_tokens_per_second": 5652.048 }, { "epoch": 1.350996498788042, "grad_norm": 0.7848990495009128, "learning_rate": 2.3812876774682886e-06, "loss": 0.30210440158843993, "num_input_tokens_seen": 877405296, "step": 20065, "train_runtime": 155229.0295, "train_tokens_per_second": 5652.327 }, { "epoch": 1.351333153784002, "grad_norm": 0.7518085342917976, "learning_rate": 2.379035611875503e-06, "loss": 0.3308712959289551, "num_input_tokens_seen": 877636392, "step": 20070, "train_runtime": 155261.3122, "train_tokens_per_second": 5652.641 }, { "epoch": 1.3516698087799623, "grad_norm": 0.7278323335362945, "learning_rate": 2.376784279227051e-06, "loss": 0.2974379062652588, "num_input_tokens_seen": 877871256, "step": 20075, "train_runtime": 155301.2047, "train_tokens_per_second": 5652.701 }, { "epoch": 1.3520064637759224, "grad_norm": 0.7168837215922106, "learning_rate": 2.3745336801525105e-06, "loss": 0.3024725437164307, "num_input_tokens_seen": 878104688, "step": 20080, "train_runtime": 155345.4421, "train_tokens_per_second": 5652.594 }, { "epoch": 1.3523431187718826, "grad_norm": 0.7794337072066637, "learning_rate": 2.3722838152812543e-06, "loss": 0.3230156898498535, "num_input_tokens_seen": 878325104, "step": 20085, "train_runtime": 155391.9834, "train_tokens_per_second": 5652.319 }, { "epoch": 1.3526797737678427, "grad_norm": 0.607568547988963, "learning_rate": 2.3700346852424485e-06, "loss": 0.2935077428817749, "num_input_tokens_seen": 878541320, "step": 20090, "train_runtime": 155423.8708, "train_tokens_per_second": 5652.551 }, { "epoch": 1.353016428763803, "grad_norm": 0.7909886746041502, "learning_rate": 2.3677862906650594e-06, "loss": 0.3263228416442871, "num_input_tokens_seen": 878755824, "step": 20095, "train_runtime": 155457.5114, "train_tokens_per_second": 5652.707 }, { "epoch": 1.353353083759763, "grad_norm": 0.8833083944310808, "learning_rate": 2.365538632177837e-06, "loss": 0.3379992961883545, "num_input_tokens_seen": 878961448, "step": 20100, "train_runtime": 155499.7479, "train_tokens_per_second": 5652.494 }, { "epoch": 1.3536897387557232, "grad_norm": 0.7244128821181046, "learning_rate": 2.36329171040934e-06, "loss": 0.3040963649749756, "num_input_tokens_seen": 879189696, "step": 20105, "train_runtime": 155531.2684, "train_tokens_per_second": 5652.816 }, { "epoch": 1.3540263937516832, "grad_norm": 0.7531385915612084, "learning_rate": 2.3610455259879045e-06, "loss": 0.2924042224884033, "num_input_tokens_seen": 879399600, "step": 20110, "train_runtime": 155567.1802, "train_tokens_per_second": 5652.861 }, { "epoch": 1.3543630487476435, "grad_norm": 0.8365089742949873, "learning_rate": 2.358800079541674e-06, "loss": 0.3243632078170776, "num_input_tokens_seen": 879611920, "step": 20115, "train_runtime": 155607.878, "train_tokens_per_second": 5652.747 }, { "epoch": 1.3546997037436035, "grad_norm": 0.8166182835087867, "learning_rate": 2.3565553716985794e-06, "loss": 0.3272987365722656, "num_input_tokens_seen": 879834920, "step": 20120, "train_runtime": 155641.8573, "train_tokens_per_second": 5652.945 }, { "epoch": 1.3550363587395637, "grad_norm": 0.8219130483551738, "learning_rate": 2.3543114030863457e-06, "loss": 0.2879811763763428, "num_input_tokens_seen": 880035976, "step": 20125, "train_runtime": 155679.3392, "train_tokens_per_second": 5652.876 }, { "epoch": 1.3553730137355238, "grad_norm": 0.778830195040845, "learning_rate": 2.352068174332491e-06, "loss": 0.2902420997619629, "num_input_tokens_seen": 880240280, "step": 20130, "train_runtime": 155721.9307, "train_tokens_per_second": 5652.642 }, { "epoch": 1.355709668731484, "grad_norm": 0.7246075057224634, "learning_rate": 2.349825686064329e-06, "loss": 0.2633873462677002, "num_input_tokens_seen": 880457816, "step": 20135, "train_runtime": 155760.9984, "train_tokens_per_second": 5652.621 }, { "epoch": 1.356046323727444, "grad_norm": 0.7082973857821522, "learning_rate": 2.3475839389089605e-06, "loss": 0.31766154766082766, "num_input_tokens_seen": 880688632, "step": 20140, "train_runtime": 155802.16, "train_tokens_per_second": 5652.609 }, { "epoch": 1.3563829787234043, "grad_norm": 0.7717628495827882, "learning_rate": 2.345342933493289e-06, "loss": 0.3041571617126465, "num_input_tokens_seen": 880900704, "step": 20145, "train_runtime": 155842.8065, "train_tokens_per_second": 5652.495 }, { "epoch": 1.3567196337193643, "grad_norm": 0.6914688947775744, "learning_rate": 2.343102670443998e-06, "loss": 0.2988900661468506, "num_input_tokens_seen": 881116800, "step": 20150, "train_runtime": 155885.0508, "train_tokens_per_second": 5652.35 }, { "epoch": 1.3570562887153246, "grad_norm": 0.742550661860349, "learning_rate": 2.3408631503875763e-06, "loss": 0.32421116828918456, "num_input_tokens_seen": 881349184, "step": 20155, "train_runtime": 155925.098, "train_tokens_per_second": 5652.388 }, { "epoch": 1.3573929437112846, "grad_norm": 0.878343673750393, "learning_rate": 2.338624373950291e-06, "loss": 0.2701118946075439, "num_input_tokens_seen": 881566872, "step": 20160, "train_runtime": 155957.1429, "train_tokens_per_second": 5652.623 }, { "epoch": 1.3577295987072449, "grad_norm": 0.755841373165112, "learning_rate": 2.336386341758216e-06, "loss": 0.30777089595794677, "num_input_tokens_seen": 881802424, "step": 20165, "train_runtime": 155994.1426, "train_tokens_per_second": 5652.792 }, { "epoch": 1.3580662537032049, "grad_norm": 0.8144086492913879, "learning_rate": 2.3341490544372063e-06, "loss": 0.3082592964172363, "num_input_tokens_seen": 882020264, "step": 20170, "train_runtime": 156033.3282, "train_tokens_per_second": 5652.768 }, { "epoch": 1.3584029086991651, "grad_norm": 0.7512527703728554, "learning_rate": 2.3319125126129128e-06, "loss": 0.3048335790634155, "num_input_tokens_seen": 882240304, "step": 20175, "train_runtime": 156070.3454, "train_tokens_per_second": 5652.838 }, { "epoch": 1.3587395636951252, "grad_norm": 0.7584329932938183, "learning_rate": 2.329676716910777e-06, "loss": 0.32310731410980226, "num_input_tokens_seen": 882456760, "step": 20180, "train_runtime": 156107.9369, "train_tokens_per_second": 5652.863 }, { "epoch": 1.3590762186910854, "grad_norm": 0.791075197267678, "learning_rate": 2.3274416679560325e-06, "loss": 0.3185749053955078, "num_input_tokens_seen": 882677128, "step": 20185, "train_runtime": 156139.8506, "train_tokens_per_second": 5653.119 }, { "epoch": 1.3594128736870454, "grad_norm": 0.789149126017219, "learning_rate": 2.3252073663737016e-06, "loss": 0.31891803741455077, "num_input_tokens_seen": 882909016, "step": 20190, "train_runtime": 156176.5363, "train_tokens_per_second": 5653.276 }, { "epoch": 1.3597495286830057, "grad_norm": 0.8825428696038273, "learning_rate": 2.3229738127886054e-06, "loss": 0.312581205368042, "num_input_tokens_seen": 883114832, "step": 20195, "train_runtime": 156221.1973, "train_tokens_per_second": 5652.977 }, { "epoch": 1.3600861836789657, "grad_norm": 0.666411052579731, "learning_rate": 2.3207410078253416e-06, "loss": 0.30325491428375245, "num_input_tokens_seen": 883339080, "step": 20200, "train_runtime": 156268.3408, "train_tokens_per_second": 5652.707 }, { "epoch": 1.360422838674926, "grad_norm": 0.7726612121097549, "learning_rate": 2.3185089521083154e-06, "loss": 0.3062901496887207, "num_input_tokens_seen": 883551600, "step": 20205, "train_runtime": 156305.042, "train_tokens_per_second": 5652.739 }, { "epoch": 1.360759493670886, "grad_norm": 0.7956523367599065, "learning_rate": 2.3162776462617067e-06, "loss": 0.3058837175369263, "num_input_tokens_seen": 883769552, "step": 20210, "train_runtime": 156351.0682, "train_tokens_per_second": 5652.469 }, { "epoch": 1.3610961486668463, "grad_norm": 0.8171843690979657, "learning_rate": 2.314047090909498e-06, "loss": 0.28980307579040526, "num_input_tokens_seen": 883987024, "step": 20215, "train_runtime": 156388.3039, "train_tokens_per_second": 5652.514 }, { "epoch": 1.3614328036628063, "grad_norm": 0.7366060863576702, "learning_rate": 2.3118172866754557e-06, "loss": 0.289400577545166, "num_input_tokens_seen": 884204584, "step": 20220, "train_runtime": 156436.651, "train_tokens_per_second": 5652.157 }, { "epoch": 1.3617694586587665, "grad_norm": 0.8418632778595053, "learning_rate": 2.309588234183137e-06, "loss": 0.29900097846984863, "num_input_tokens_seen": 884430104, "step": 20225, "train_runtime": 156479.2021, "train_tokens_per_second": 5652.062 }, { "epoch": 1.3621061136547266, "grad_norm": 0.7596247998423821, "learning_rate": 2.3073599340558896e-06, "loss": 0.3193103313446045, "num_input_tokens_seen": 884638136, "step": 20230, "train_runtime": 156513.4901, "train_tokens_per_second": 5652.153 }, { "epoch": 1.3624427686506868, "grad_norm": 0.794889195242685, "learning_rate": 2.3051323869168506e-06, "loss": 0.31695847511291503, "num_input_tokens_seen": 884867312, "step": 20235, "train_runtime": 156552.9308, "train_tokens_per_second": 5652.193 }, { "epoch": 1.3627794236466468, "grad_norm": 0.6894100091265923, "learning_rate": 2.3029055933889443e-06, "loss": 0.299372124671936, "num_input_tokens_seen": 885078648, "step": 20240, "train_runtime": 156591.403, "train_tokens_per_second": 5652.154 }, { "epoch": 1.363116078642607, "grad_norm": 0.679829103468669, "learning_rate": 2.300679554094892e-06, "loss": 0.27194240093231203, "num_input_tokens_seen": 885288824, "step": 20245, "train_runtime": 156624.8066, "train_tokens_per_second": 5652.29 }, { "epoch": 1.3634527336385671, "grad_norm": 0.7428557022690266, "learning_rate": 2.298454269657191e-06, "loss": 0.2977342367172241, "num_input_tokens_seen": 885509192, "step": 20250, "train_runtime": 156665.816, "train_tokens_per_second": 5652.217 }, { "epoch": 1.3637893886345274, "grad_norm": 0.7495727549443245, "learning_rate": 2.2962297406981432e-06, "loss": 0.30438592433929446, "num_input_tokens_seen": 885728368, "step": 20255, "train_runtime": 156704.8388, "train_tokens_per_second": 5652.208 }, { "epoch": 1.3641260436304874, "grad_norm": 0.7491077517728351, "learning_rate": 2.2940059678398223e-06, "loss": 0.2986233949661255, "num_input_tokens_seen": 885946024, "step": 20260, "train_runtime": 156744.7021, "train_tokens_per_second": 5652.159 }, { "epoch": 1.3644626986264476, "grad_norm": 0.7341728818382711, "learning_rate": 2.291782951704106e-06, "loss": 0.30042304992675783, "num_input_tokens_seen": 886159456, "step": 20265, "train_runtime": 156781.0468, "train_tokens_per_second": 5652.21 }, { "epoch": 1.3647993536224077, "grad_norm": 0.7856616622328413, "learning_rate": 2.289560692912651e-06, "loss": 0.30829734802246095, "num_input_tokens_seen": 886378184, "step": 20270, "train_runtime": 156822.443, "train_tokens_per_second": 5652.113 }, { "epoch": 1.365136008618368, "grad_norm": 0.722302764482047, "learning_rate": 2.287339192086906e-06, "loss": 0.30705411434173585, "num_input_tokens_seen": 886596912, "step": 20275, "train_runtime": 156862.8796, "train_tokens_per_second": 5652.05 }, { "epoch": 1.365472663614328, "grad_norm": 0.7818607969471453, "learning_rate": 2.2851184498481056e-06, "loss": 0.30739502906799315, "num_input_tokens_seen": 886810320, "step": 20280, "train_runtime": 156900.5368, "train_tokens_per_second": 5652.054 }, { "epoch": 1.3658093186102882, "grad_norm": 0.8017159372977292, "learning_rate": 2.2828984668172732e-06, "loss": 0.29115149974822996, "num_input_tokens_seen": 887018752, "step": 20285, "train_runtime": 156938.5878, "train_tokens_per_second": 5652.012 }, { "epoch": 1.3661459736062485, "grad_norm": 0.8305588542630102, "learning_rate": 2.2806792436152185e-06, "loss": 0.3051044464111328, "num_input_tokens_seen": 887236112, "step": 20290, "train_runtime": 156975.4855, "train_tokens_per_second": 5652.068 }, { "epoch": 1.3664826286022085, "grad_norm": 0.80831246019114, "learning_rate": 2.2784607808625463e-06, "loss": 0.30942864418029786, "num_input_tokens_seen": 887448744, "step": 20295, "train_runtime": 157014.5677, "train_tokens_per_second": 5652.015 }, { "epoch": 1.3668192835981685, "grad_norm": 0.7675600985733588, "learning_rate": 2.276243079179634e-06, "loss": 0.2999575138092041, "num_input_tokens_seen": 887665496, "step": 20300, "train_runtime": 157053.8678, "train_tokens_per_second": 5651.981 }, { "epoch": 1.3671559385941288, "grad_norm": 0.811512893486603, "learning_rate": 2.2740261391866634e-06, "loss": 0.31462917327880857, "num_input_tokens_seen": 887885544, "step": 20305, "train_runtime": 157085.2659, "train_tokens_per_second": 5652.252 }, { "epoch": 1.367492593590089, "grad_norm": 0.7496759995290464, "learning_rate": 2.2718099615035865e-06, "loss": 0.2609941720962524, "num_input_tokens_seen": 888107128, "step": 20310, "train_runtime": 157126.9618, "train_tokens_per_second": 5652.163 }, { "epoch": 1.367829248586049, "grad_norm": 0.6960078882906409, "learning_rate": 2.2695945467501567e-06, "loss": 0.3140725612640381, "num_input_tokens_seen": 888330336, "step": 20315, "train_runtime": 157165.5698, "train_tokens_per_second": 5652.194 }, { "epoch": 1.368165903582009, "grad_norm": 0.736910787731632, "learning_rate": 2.267379895545905e-06, "loss": 0.2964684009552002, "num_input_tokens_seen": 888549184, "step": 20320, "train_runtime": 157205.25, "train_tokens_per_second": 5652.16 }, { "epoch": 1.3685025585779693, "grad_norm": 0.6504305837119558, "learning_rate": 2.2651660085101513e-06, "loss": 0.3142958641052246, "num_input_tokens_seen": 888773632, "step": 20325, "train_runtime": 157243.6633, "train_tokens_per_second": 5652.206 }, { "epoch": 1.3688392135739296, "grad_norm": 0.7317039701175643, "learning_rate": 2.262952886262003e-06, "loss": 0.30502166748046877, "num_input_tokens_seen": 889003680, "step": 20330, "train_runtime": 157285.4107, "train_tokens_per_second": 5652.169 }, { "epoch": 1.3691758685698896, "grad_norm": 0.6676476248897819, "learning_rate": 2.260740529420352e-06, "loss": 0.29352798461914065, "num_input_tokens_seen": 889224368, "step": 20335, "train_runtime": 157329.8859, "train_tokens_per_second": 5651.974 }, { "epoch": 1.3695125235658496, "grad_norm": 0.8139919345906689, "learning_rate": 2.2585289386038754e-06, "loss": 0.29394705295562745, "num_input_tokens_seen": 889456760, "step": 20340, "train_runtime": 157369.7584, "train_tokens_per_second": 5652.018 }, { "epoch": 1.3698491785618099, "grad_norm": 0.6922241241359759, "learning_rate": 2.256318114431043e-06, "loss": 0.3354970932006836, "num_input_tokens_seen": 889693056, "step": 20345, "train_runtime": 157404.9626, "train_tokens_per_second": 5652.255 }, { "epoch": 1.3701858335577701, "grad_norm": 0.8121467144758657, "learning_rate": 2.2541080575200973e-06, "loss": 0.2972100734710693, "num_input_tokens_seen": 889902256, "step": 20350, "train_runtime": 157447.764, "train_tokens_per_second": 5652.048 }, { "epoch": 1.3705224885537302, "grad_norm": 0.7645000522207971, "learning_rate": 2.251898768489081e-06, "loss": 0.3170339822769165, "num_input_tokens_seen": 890133696, "step": 20355, "train_runtime": 157481.0705, "train_tokens_per_second": 5652.322 }, { "epoch": 1.3708591435496902, "grad_norm": 0.7817916261633198, "learning_rate": 2.249690247955807e-06, "loss": 0.31004133224487307, "num_input_tokens_seen": 890349704, "step": 20360, "train_runtime": 157525.1026, "train_tokens_per_second": 5652.113 }, { "epoch": 1.3711957985456504, "grad_norm": 1.0121499916406171, "learning_rate": 2.247482496537887e-06, "loss": 0.32703423500061035, "num_input_tokens_seen": 890570904, "step": 20365, "train_runtime": 157561.604, "train_tokens_per_second": 5652.208 }, { "epoch": 1.3715324535416107, "grad_norm": 0.7908431166811735, "learning_rate": 2.24527551485271e-06, "loss": 0.3082599639892578, "num_input_tokens_seen": 890789232, "step": 20370, "train_runtime": 157598.6794, "train_tokens_per_second": 5652.263 }, { "epoch": 1.3718691085375707, "grad_norm": 0.739831014749458, "learning_rate": 2.243069303517451e-06, "loss": 0.3278525352478027, "num_input_tokens_seen": 891003792, "step": 20375, "train_runtime": 157631.5929, "train_tokens_per_second": 5652.444 }, { "epoch": 1.3722057635335307, "grad_norm": 0.6731804830965303, "learning_rate": 2.2408638631490696e-06, "loss": 0.2803332328796387, "num_input_tokens_seen": 891222136, "step": 20380, "train_runtime": 157671.5132, "train_tokens_per_second": 5652.398 }, { "epoch": 1.372542418529491, "grad_norm": 0.7577807518738551, "learning_rate": 2.2386591943643117e-06, "loss": 0.2959303617477417, "num_input_tokens_seen": 891447208, "step": 20385, "train_runtime": 157709.6607, "train_tokens_per_second": 5652.458 }, { "epoch": 1.3728790735254512, "grad_norm": 0.740650904611458, "learning_rate": 2.2364552977797023e-06, "loss": 0.3103938579559326, "num_input_tokens_seen": 891668296, "step": 20390, "train_runtime": 157751.8454, "train_tokens_per_second": 5652.348 }, { "epoch": 1.3732157285214113, "grad_norm": 0.8801339361162619, "learning_rate": 2.23425217401156e-06, "loss": 0.3227031707763672, "num_input_tokens_seen": 891888096, "step": 20395, "train_runtime": 157787.2294, "train_tokens_per_second": 5652.473 }, { "epoch": 1.3735523835173713, "grad_norm": 0.766299417789016, "learning_rate": 2.2320498236759746e-06, "loss": 0.2954218864440918, "num_input_tokens_seen": 892110048, "step": 20400, "train_runtime": 157817.9321, "train_tokens_per_second": 5652.78 }, { "epoch": 1.3738890385133316, "grad_norm": 0.6837353560545685, "learning_rate": 2.2298482473888335e-06, "loss": 0.2996779441833496, "num_input_tokens_seen": 892325640, "step": 20405, "train_runtime": 157859.5289, "train_tokens_per_second": 5652.656 }, { "epoch": 1.3742256935092918, "grad_norm": 0.7214654235542152, "learning_rate": 2.227647445765792e-06, "loss": 0.3093862533569336, "num_input_tokens_seen": 892551144, "step": 20410, "train_runtime": 157899.5496, "train_tokens_per_second": 5652.652 }, { "epoch": 1.3745623485052518, "grad_norm": 0.9006378011875812, "learning_rate": 2.225447419422305e-06, "loss": 0.2831476926803589, "num_input_tokens_seen": 892763912, "step": 20415, "train_runtime": 157937.9848, "train_tokens_per_second": 5652.623 }, { "epoch": 1.3748990035012119, "grad_norm": 0.751847783359078, "learning_rate": 2.223248168973599e-06, "loss": 0.29417757987976073, "num_input_tokens_seen": 892984176, "step": 20420, "train_runtime": 157976.464, "train_tokens_per_second": 5652.641 }, { "epoch": 1.375235658497172, "grad_norm": 0.762461921564537, "learning_rate": 2.221049695034688e-06, "loss": 0.2913064479827881, "num_input_tokens_seen": 893210312, "step": 20425, "train_runtime": 158009.5129, "train_tokens_per_second": 5652.889 }, { "epoch": 1.3755723134931324, "grad_norm": 0.7837668271345243, "learning_rate": 2.218851998220369e-06, "loss": 0.3103857755661011, "num_input_tokens_seen": 893433344, "step": 20430, "train_runtime": 158043.6487, "train_tokens_per_second": 5653.08 }, { "epoch": 1.3759089684890924, "grad_norm": 0.7225824849007935, "learning_rate": 2.21665507914522e-06, "loss": 0.2799984931945801, "num_input_tokens_seen": 893630528, "step": 20435, "train_runtime": 158082.8071, "train_tokens_per_second": 5652.927 }, { "epoch": 1.3762456234850524, "grad_norm": 0.7975885820333312, "learning_rate": 2.214458938423601e-06, "loss": 0.311299204826355, "num_input_tokens_seen": 893854672, "step": 20440, "train_runtime": 158125.2748, "train_tokens_per_second": 5652.826 }, { "epoch": 1.3765822784810127, "grad_norm": 0.6830394522468479, "learning_rate": 2.212263576669661e-06, "loss": 0.2979740142822266, "num_input_tokens_seen": 894084224, "step": 20445, "train_runtime": 158169.3177, "train_tokens_per_second": 5652.703 }, { "epoch": 1.376918933476973, "grad_norm": 0.8072743303598326, "learning_rate": 2.2100689944973182e-06, "loss": 0.3165121555328369, "num_input_tokens_seen": 894311056, "step": 20450, "train_runtime": 158215.4891, "train_tokens_per_second": 5652.487 }, { "epoch": 1.377255588472933, "grad_norm": 0.7485842516852395, "learning_rate": 2.2078751925202886e-06, "loss": 0.34031267166137696, "num_input_tokens_seen": 894543864, "step": 20455, "train_runtime": 158263.0938, "train_tokens_per_second": 5652.258 }, { "epoch": 1.377592243468893, "grad_norm": 0.878465392483748, "learning_rate": 2.205682171352054e-06, "loss": 0.30671300888061526, "num_input_tokens_seen": 894767288, "step": 20460, "train_runtime": 158302.6816, "train_tokens_per_second": 5652.256 }, { "epoch": 1.3779288984648532, "grad_norm": 0.7614994645886192, "learning_rate": 2.2034899316058926e-06, "loss": 0.287479043006897, "num_input_tokens_seen": 894979648, "step": 20465, "train_runtime": 158343.8582, "train_tokens_per_second": 5652.127 }, { "epoch": 1.3782655534608135, "grad_norm": 0.7877267867305047, "learning_rate": 2.201298473894854e-06, "loss": 0.29344854354858396, "num_input_tokens_seen": 895182680, "step": 20470, "train_runtime": 158380.2408, "train_tokens_per_second": 5652.111 }, { "epoch": 1.3786022084567735, "grad_norm": 0.7361412279331169, "learning_rate": 2.1991077988317723e-06, "loss": 0.30328798294067383, "num_input_tokens_seen": 895414024, "step": 20475, "train_runtime": 158422.7502, "train_tokens_per_second": 5652.055 }, { "epoch": 1.3789388634527335, "grad_norm": 0.751463034805612, "learning_rate": 2.1969179070292637e-06, "loss": 0.2803157329559326, "num_input_tokens_seen": 895624392, "step": 20480, "train_runtime": 158463.0376, "train_tokens_per_second": 5651.945 }, { "epoch": 1.3792755184486938, "grad_norm": 0.7411499573407221, "learning_rate": 2.1947287990997236e-06, "loss": 0.3004035711288452, "num_input_tokens_seen": 895840912, "step": 20485, "train_runtime": 158494.4467, "train_tokens_per_second": 5652.191 }, { "epoch": 1.379612173444654, "grad_norm": 0.7715375986241239, "learning_rate": 2.192540475655328e-06, "loss": 0.299238920211792, "num_input_tokens_seen": 896053216, "step": 20490, "train_runtime": 158532.5086, "train_tokens_per_second": 5652.173 }, { "epoch": 1.379948828440614, "grad_norm": 0.8053384795009297, "learning_rate": 2.1903529373080397e-06, "loss": 0.3175162076950073, "num_input_tokens_seen": 896270408, "step": 20495, "train_runtime": 158571.7359, "train_tokens_per_second": 5652.145 }, { "epoch": 1.380285483436574, "grad_norm": 0.8121078413056436, "learning_rate": 2.1881661846695895e-06, "loss": 0.2798121452331543, "num_input_tokens_seen": 896464640, "step": 20500, "train_runtime": 158604.3337, "train_tokens_per_second": 5652.208 }, { "epoch": 1.3806221384325343, "grad_norm": 0.8616911766005805, "learning_rate": 2.185980218351503e-06, "loss": 0.31658909320831297, "num_input_tokens_seen": 896678032, "step": 20505, "train_runtime": 158643.7892, "train_tokens_per_second": 5652.147 }, { "epoch": 1.3809587934284946, "grad_norm": 0.7365179371963805, "learning_rate": 2.1837950389650714e-06, "loss": 0.3018453598022461, "num_input_tokens_seen": 896910472, "step": 20510, "train_runtime": 158684.9601, "train_tokens_per_second": 5652.145 }, { "epoch": 1.3812954484244546, "grad_norm": 0.6736956456373172, "learning_rate": 2.1816106471213787e-06, "loss": 0.30421650409698486, "num_input_tokens_seen": 897142376, "step": 20515, "train_runtime": 158727.7032, "train_tokens_per_second": 5652.084 }, { "epoch": 1.3816321034204146, "grad_norm": 0.747870924932963, "learning_rate": 2.179427043431282e-06, "loss": 0.32655086517333987, "num_input_tokens_seen": 897368312, "step": 20520, "train_runtime": 158760.2315, "train_tokens_per_second": 5652.349 }, { "epoch": 1.381968758416375, "grad_norm": 0.697584938785786, "learning_rate": 2.177244228505418e-06, "loss": 0.32046022415161135, "num_input_tokens_seen": 897570856, "step": 20525, "train_runtime": 158800.7072, "train_tokens_per_second": 5652.184 }, { "epoch": 1.3823054134123351, "grad_norm": 0.8926152387651795, "learning_rate": 2.1750622029542047e-06, "loss": 0.2898330926895142, "num_input_tokens_seen": 897801520, "step": 20530, "train_runtime": 158836.9929, "train_tokens_per_second": 5652.345 }, { "epoch": 1.3826420684082952, "grad_norm": 0.8132938665366518, "learning_rate": 2.1728809673878374e-06, "loss": 0.31139211654663085, "num_input_tokens_seen": 898013200, "step": 20535, "train_runtime": 158877.4038, "train_tokens_per_second": 5652.24 }, { "epoch": 1.3829787234042552, "grad_norm": 0.7797244695242583, "learning_rate": 2.1707005224162915e-06, "loss": 0.2919374227523804, "num_input_tokens_seen": 898234880, "step": 20540, "train_runtime": 158916.8206, "train_tokens_per_second": 5652.233 }, { "epoch": 1.3833153784002155, "grad_norm": 0.7364923903516897, "learning_rate": 2.1685208686493257e-06, "loss": 0.30305407047271726, "num_input_tokens_seen": 898436912, "step": 20545, "train_runtime": 158958.896, "train_tokens_per_second": 5652.008 }, { "epoch": 1.3836520333961757, "grad_norm": 0.735813175372172, "learning_rate": 2.166342006696467e-06, "loss": 0.30848112106323244, "num_input_tokens_seen": 898651112, "step": 20550, "train_runtime": 158991.467, "train_tokens_per_second": 5652.197 }, { "epoch": 1.3839886883921357, "grad_norm": 0.7637368092940925, "learning_rate": 2.1641639371670335e-06, "loss": 0.3011596202850342, "num_input_tokens_seen": 898866064, "step": 20555, "train_runtime": 159024.145, "train_tokens_per_second": 5652.387 }, { "epoch": 1.3843253433880958, "grad_norm": 0.9110668442903609, "learning_rate": 2.161986660670109e-06, "loss": 0.3262584686279297, "num_input_tokens_seen": 899090152, "step": 20560, "train_runtime": 159055.0547, "train_tokens_per_second": 5652.698 }, { "epoch": 1.384661998384056, "grad_norm": 0.6343085979931745, "learning_rate": 2.159810177814566e-06, "loss": 0.2925774574279785, "num_input_tokens_seen": 899299560, "step": 20565, "train_runtime": 159088.6315, "train_tokens_per_second": 5652.821 }, { "epoch": 1.3849986533800163, "grad_norm": 0.7193981263314468, "learning_rate": 2.1576344892090507e-06, "loss": 0.3194908618927002, "num_input_tokens_seen": 899514728, "step": 20570, "train_runtime": 159127.1256, "train_tokens_per_second": 5652.806 }, { "epoch": 1.3853353083759763, "grad_norm": 0.7312989213302724, "learning_rate": 2.1554595954619866e-06, "loss": 0.30469086170196535, "num_input_tokens_seen": 899730168, "step": 20575, "train_runtime": 159168.3547, "train_tokens_per_second": 5652.695 }, { "epoch": 1.3856719633719363, "grad_norm": 0.7885283712306526, "learning_rate": 2.1532854971815763e-06, "loss": 0.30314340591430666, "num_input_tokens_seen": 899940496, "step": 20580, "train_runtime": 159210.4856, "train_tokens_per_second": 5652.52 }, { "epoch": 1.3860086183678966, "grad_norm": 0.7120887950890258, "learning_rate": 2.151112194975799e-06, "loss": 0.2792366504669189, "num_input_tokens_seen": 900163032, "step": 20585, "train_runtime": 159256.144, "train_tokens_per_second": 5652.297 }, { "epoch": 1.3863452733638568, "grad_norm": 0.6730346420964233, "learning_rate": 2.1489396894524106e-06, "loss": 0.2858273506164551, "num_input_tokens_seen": 900392200, "step": 20590, "train_runtime": 159303.4591, "train_tokens_per_second": 5652.057 }, { "epoch": 1.3866819283598169, "grad_norm": 0.6233675139772793, "learning_rate": 2.1467679812189497e-06, "loss": 0.3015708923339844, "num_input_tokens_seen": 900610928, "step": 20595, "train_runtime": 159340.5828, "train_tokens_per_second": 5652.113 }, { "epoch": 1.3870185833557769, "grad_norm": 1.0595463617660366, "learning_rate": 2.1445970708827213e-06, "loss": 0.30586059093475343, "num_input_tokens_seen": 900814704, "step": 20600, "train_runtime": 159380.6541, "train_tokens_per_second": 5651.97 }, { "epoch": 1.3873552383517371, "grad_norm": 0.6602500948938497, "learning_rate": 2.14242695905082e-06, "loss": 0.289659309387207, "num_input_tokens_seen": 901036328, "step": 20605, "train_runtime": 159412.9764, "train_tokens_per_second": 5652.214 }, { "epoch": 1.3876918933476974, "grad_norm": 0.7593497019073732, "learning_rate": 2.1402576463301044e-06, "loss": 0.3204467535018921, "num_input_tokens_seen": 901271056, "step": 20610, "train_runtime": 159456.2832, "train_tokens_per_second": 5652.151 }, { "epoch": 1.3880285483436574, "grad_norm": 0.8198802661040533, "learning_rate": 2.13808913332722e-06, "loss": 0.28775959014892577, "num_input_tokens_seen": 901485976, "step": 20615, "train_runtime": 159494.9253, "train_tokens_per_second": 5652.13 }, { "epoch": 1.3883652033396174, "grad_norm": 0.7717803821263688, "learning_rate": 2.1359214206485845e-06, "loss": 0.32880635261535646, "num_input_tokens_seen": 901703104, "step": 20620, "train_runtime": 159533.389, "train_tokens_per_second": 5652.128 }, { "epoch": 1.3887018583355777, "grad_norm": 0.7172069769325149, "learning_rate": 2.1337545089003905e-06, "loss": 0.2626586675643921, "num_input_tokens_seen": 901902224, "step": 20625, "train_runtime": 159566.5463, "train_tokens_per_second": 5652.201 }, { "epoch": 1.389038513331538, "grad_norm": 0.764053491586925, "learning_rate": 2.131588398688608e-06, "loss": 0.31684534549713134, "num_input_tokens_seen": 902125584, "step": 20630, "train_runtime": 159611.5339, "train_tokens_per_second": 5652.007 }, { "epoch": 1.389375168327498, "grad_norm": 0.7374395690303461, "learning_rate": 2.1294230906189833e-06, "loss": 0.28316431045532225, "num_input_tokens_seen": 902333832, "step": 20635, "train_runtime": 159653.8037, "train_tokens_per_second": 5651.815 }, { "epoch": 1.389711823323458, "grad_norm": 0.7355709013834859, "learning_rate": 2.1272585852970358e-06, "loss": 0.29244768619537354, "num_input_tokens_seen": 902541064, "step": 20640, "train_runtime": 159692.4958, "train_tokens_per_second": 5651.744 }, { "epoch": 1.3900484783194182, "grad_norm": 0.7160331969470104, "learning_rate": 2.125094883328068e-06, "loss": 0.2933189392089844, "num_input_tokens_seen": 902745264, "step": 20645, "train_runtime": 159733.1324, "train_tokens_per_second": 5651.584 }, { "epoch": 1.3903851333153785, "grad_norm": 0.8057277953126102, "learning_rate": 2.1229319853171447e-06, "loss": 0.2766158103942871, "num_input_tokens_seen": 902957784, "step": 20650, "train_runtime": 159767.4906, "train_tokens_per_second": 5651.699 }, { "epoch": 1.3907217883113385, "grad_norm": 0.8447973197859374, "learning_rate": 2.1207698918691217e-06, "loss": 0.3175971508026123, "num_input_tokens_seen": 903176368, "step": 20655, "train_runtime": 159809.1069, "train_tokens_per_second": 5651.595 }, { "epoch": 1.3910584433072986, "grad_norm": 0.7509364554421408, "learning_rate": 2.1186086035886133e-06, "loss": 0.28777422904968264, "num_input_tokens_seen": 903403424, "step": 20660, "train_runtime": 159847.5357, "train_tokens_per_second": 5651.657 }, { "epoch": 1.3913950983032588, "grad_norm": 0.7719727435620117, "learning_rate": 2.116448121080023e-06, "loss": 0.309741735458374, "num_input_tokens_seen": 903643016, "step": 20665, "train_runtime": 159888.1841, "train_tokens_per_second": 5651.719 }, { "epoch": 1.391731753299219, "grad_norm": 0.7650108977382473, "learning_rate": 2.1142884449475205e-06, "loss": 0.30854334831237795, "num_input_tokens_seen": 903861496, "step": 20670, "train_runtime": 159925.9335, "train_tokens_per_second": 5651.751 }, { "epoch": 1.392068408295179, "grad_norm": 0.8857585605046503, "learning_rate": 2.112129575795052e-06, "loss": 0.2980179309844971, "num_input_tokens_seen": 904082696, "step": 20675, "train_runtime": 159970.8097, "train_tokens_per_second": 5651.548 }, { "epoch": 1.3924050632911391, "grad_norm": 0.6579126875016472, "learning_rate": 2.1099715142263394e-06, "loss": 0.2740116357803345, "num_input_tokens_seen": 904295832, "step": 20680, "train_runtime": 160012.6441, "train_tokens_per_second": 5651.402 }, { "epoch": 1.3927417182870994, "grad_norm": 0.7692183867198543, "learning_rate": 2.1078142608448773e-06, "loss": 0.28600759506225587, "num_input_tokens_seen": 904516064, "step": 20685, "train_runtime": 160046.5372, "train_tokens_per_second": 5651.582 }, { "epoch": 1.3930783732830596, "grad_norm": 0.8142763298016777, "learning_rate": 2.1056578162539327e-06, "loss": 0.32352604866027834, "num_input_tokens_seen": 904737152, "step": 20690, "train_runtime": 160088.4432, "train_tokens_per_second": 5651.483 }, { "epoch": 1.3934150282790196, "grad_norm": 0.871875644642827, "learning_rate": 2.103502181056554e-06, "loss": 0.30927181243896484, "num_input_tokens_seen": 904951984, "step": 20695, "train_runtime": 160130.5591, "train_tokens_per_second": 5651.338 }, { "epoch": 1.3937516832749797, "grad_norm": 0.704322984008134, "learning_rate": 2.1013473558555503e-06, "loss": 0.2932461738586426, "num_input_tokens_seen": 905188432, "step": 20700, "train_runtime": 160177.8633, "train_tokens_per_second": 5651.146 }, { "epoch": 1.39408833827094, "grad_norm": 0.7189726909358929, "learning_rate": 2.099193341253519e-06, "loss": 0.29349417686462403, "num_input_tokens_seen": 905395280, "step": 20705, "train_runtime": 160214.1418, "train_tokens_per_second": 5651.157 }, { "epoch": 1.3944249932669002, "grad_norm": 0.6639597772905609, "learning_rate": 2.0970401378528167e-06, "loss": 0.286403751373291, "num_input_tokens_seen": 905601488, "step": 20710, "train_runtime": 160261.6101, "train_tokens_per_second": 5650.77 }, { "epoch": 1.3947616482628602, "grad_norm": 0.702286400471809, "learning_rate": 2.0948877462555844e-06, "loss": 0.2749554872512817, "num_input_tokens_seen": 905827264, "step": 20715, "train_runtime": 160304.5265, "train_tokens_per_second": 5650.666 }, { "epoch": 1.3950983032588202, "grad_norm": 0.7033676607004119, "learning_rate": 2.09273616706373e-06, "loss": 0.32062878608703616, "num_input_tokens_seen": 906057568, "step": 20720, "train_runtime": 160337.276, "train_tokens_per_second": 5650.948 }, { "epoch": 1.3954349582547805, "grad_norm": 0.8756497939875741, "learning_rate": 2.090585400878936e-06, "loss": 0.3149780035018921, "num_input_tokens_seen": 906277360, "step": 20725, "train_runtime": 160380.6002, "train_tokens_per_second": 5650.792 }, { "epoch": 1.3957716132507407, "grad_norm": 0.7980623610419325, "learning_rate": 2.0884354483026576e-06, "loss": 0.3101172924041748, "num_input_tokens_seen": 906499640, "step": 20730, "train_runtime": 160413.5552, "train_tokens_per_second": 5651.016 }, { "epoch": 1.3961082682467008, "grad_norm": 0.6980186229936438, "learning_rate": 2.0862863099361214e-06, "loss": 0.30629117488861085, "num_input_tokens_seen": 906734072, "step": 20735, "train_runtime": 160445.4472, "train_tokens_per_second": 5651.354 }, { "epoch": 1.3964449232426608, "grad_norm": 0.7214735662789337, "learning_rate": 2.084137986380326e-06, "loss": 0.3239948272705078, "num_input_tokens_seen": 906945840, "step": 20740, "train_runtime": 160486.1913, "train_tokens_per_second": 5651.239 }, { "epoch": 1.396781578238621, "grad_norm": 0.7503921044839111, "learning_rate": 2.081990478236048e-06, "loss": 0.28044352531433103, "num_input_tokens_seen": 907146456, "step": 20745, "train_runtime": 160522.0232, "train_tokens_per_second": 5651.227 }, { "epoch": 1.3971182332345813, "grad_norm": 0.7170605848167944, "learning_rate": 2.079843786103824e-06, "loss": 0.2951197624206543, "num_input_tokens_seen": 907356536, "step": 20750, "train_runtime": 160565.1412, "train_tokens_per_second": 5651.018 }, { "epoch": 1.3974548882305413, "grad_norm": 0.7858210180931035, "learning_rate": 2.0776979105839774e-06, "loss": 0.31067094802856443, "num_input_tokens_seen": 907585320, "step": 20755, "train_runtime": 160605.9994, "train_tokens_per_second": 5651.005 }, { "epoch": 1.3977915432265013, "grad_norm": 0.811518268399912, "learning_rate": 2.075552852276588e-06, "loss": 0.33663692474365237, "num_input_tokens_seen": 907812376, "step": 20760, "train_runtime": 160647.5068, "train_tokens_per_second": 5650.958 }, { "epoch": 1.3981281982224616, "grad_norm": 0.843500732222522, "learning_rate": 2.07340861178152e-06, "loss": 0.3083709716796875, "num_input_tokens_seen": 908030480, "step": 20765, "train_runtime": 160684.2393, "train_tokens_per_second": 5651.024 }, { "epoch": 1.3984648532184218, "grad_norm": 0.7409888586409921, "learning_rate": 2.0712651896984013e-06, "loss": 0.30435686111450194, "num_input_tokens_seen": 908257064, "step": 20770, "train_runtime": 160718.9627, "train_tokens_per_second": 5651.213 }, { "epoch": 1.3988015082143819, "grad_norm": 0.7528366267193225, "learning_rate": 2.0691225866266335e-06, "loss": 0.3061100244522095, "num_input_tokens_seen": 908466856, "step": 20775, "train_runtime": 160758.0637, "train_tokens_per_second": 5651.143 }, { "epoch": 1.3991381632103421, "grad_norm": 0.8274013015791201, "learning_rate": 2.066980803165388e-06, "loss": 0.3086406707763672, "num_input_tokens_seen": 908690664, "step": 20780, "train_runtime": 160789.4191, "train_tokens_per_second": 5651.433 }, { "epoch": 1.3994748182063022, "grad_norm": 0.7972254073123841, "learning_rate": 2.0648398399136088e-06, "loss": 0.30843343734741213, "num_input_tokens_seen": 908916400, "step": 20785, "train_runtime": 160833.2267, "train_tokens_per_second": 5651.297 }, { "epoch": 1.3998114732022624, "grad_norm": 0.7390702899298262, "learning_rate": 2.062699697470007e-06, "loss": 0.295151948928833, "num_input_tokens_seen": 909128960, "step": 20790, "train_runtime": 160877.6756, "train_tokens_per_second": 5651.057 }, { "epoch": 1.4001481281982224, "grad_norm": 0.6966665870930083, "learning_rate": 2.060560376433072e-06, "loss": 0.33457579612731936, "num_input_tokens_seen": 909357768, "step": 20795, "train_runtime": 160920.3143, "train_tokens_per_second": 5650.982 }, { "epoch": 1.4004847831941827, "grad_norm": 0.6567105821545446, "learning_rate": 2.05842187740105e-06, "loss": 0.3098001956939697, "num_input_tokens_seen": 909572480, "step": 20800, "train_runtime": 160963.4825, "train_tokens_per_second": 5650.8 }, { "epoch": 1.4008214381901427, "grad_norm": 0.8379053674392297, "learning_rate": 2.0562842009719745e-06, "loss": 0.2820146560668945, "num_input_tokens_seen": 909757296, "step": 20805, "train_runtime": 161008.9129, "train_tokens_per_second": 5650.354 }, { "epoch": 1.401158093186103, "grad_norm": 0.8065231699303244, "learning_rate": 2.0541473477436317e-06, "loss": 0.2844945669174194, "num_input_tokens_seen": 909975984, "step": 20810, "train_runtime": 161043.343, "train_tokens_per_second": 5650.504 }, { "epoch": 1.401494748182063, "grad_norm": 0.7694176813911128, "learning_rate": 2.052011318313591e-06, "loss": 0.28799991607666015, "num_input_tokens_seen": 910199280, "step": 20815, "train_runtime": 161080.8517, "train_tokens_per_second": 5650.574 }, { "epoch": 1.4018314031780232, "grad_norm": 0.7254285849515797, "learning_rate": 2.049876113279185e-06, "loss": 0.32419145107269287, "num_input_tokens_seen": 910419968, "step": 20820, "train_runtime": 161115.1641, "train_tokens_per_second": 5650.74 }, { "epoch": 1.4021680581739833, "grad_norm": 0.663299004599166, "learning_rate": 2.0477417332375165e-06, "loss": 0.28672337532043457, "num_input_tokens_seen": 910648216, "step": 20825, "train_runtime": 161146.0692, "train_tokens_per_second": 5651.073 }, { "epoch": 1.4025047131699435, "grad_norm": 0.7218766432038832, "learning_rate": 2.045608178785458e-06, "loss": 0.29271349906921384, "num_input_tokens_seen": 910871288, "step": 20830, "train_runtime": 161185.4894, "train_tokens_per_second": 5651.075 }, { "epoch": 1.4028413681659035, "grad_norm": 0.670423396219908, "learning_rate": 2.043475450519652e-06, "loss": 0.29650259017944336, "num_input_tokens_seen": 911087016, "step": 20835, "train_runtime": 161217.0941, "train_tokens_per_second": 5651.305 }, { "epoch": 1.4031780231618638, "grad_norm": 0.7755384152878778, "learning_rate": 2.0413435490365064e-06, "loss": 0.31277635097503664, "num_input_tokens_seen": 911295624, "step": 20840, "train_runtime": 161255.7945, "train_tokens_per_second": 5651.243 }, { "epoch": 1.4035146781578238, "grad_norm": 0.7431255146543578, "learning_rate": 2.0392124749322064e-06, "loss": 0.31907684803009034, "num_input_tokens_seen": 911522672, "step": 20845, "train_runtime": 161298.269, "train_tokens_per_second": 5651.162 }, { "epoch": 1.403851333153784, "grad_norm": 0.8355426134565388, "learning_rate": 2.037082228802693e-06, "loss": 0.28636276721954346, "num_input_tokens_seen": 911742024, "step": 20850, "train_runtime": 161332.2795, "train_tokens_per_second": 5651.33 }, { "epoch": 1.404187988149744, "grad_norm": 0.7290848719366411, "learning_rate": 2.03495281124369e-06, "loss": 0.279879093170166, "num_input_tokens_seen": 911958464, "step": 20855, "train_runtime": 161371.514, "train_tokens_per_second": 5651.298 }, { "epoch": 1.4045246431457044, "grad_norm": 0.7216593366596518, "learning_rate": 2.0328242228506746e-06, "loss": 0.28923535346984863, "num_input_tokens_seen": 912172576, "step": 20860, "train_runtime": 161410.452, "train_tokens_per_second": 5651.261 }, { "epoch": 1.4048612981416644, "grad_norm": 0.7898442019168748, "learning_rate": 2.0306964642189053e-06, "loss": 0.3036557674407959, "num_input_tokens_seen": 912389440, "step": 20865, "train_runtime": 161449.3775, "train_tokens_per_second": 5651.242 }, { "epoch": 1.4051979531376246, "grad_norm": 0.7311964977804852, "learning_rate": 2.028569535943402e-06, "loss": 0.2902818202972412, "num_input_tokens_seen": 912599400, "step": 20870, "train_runtime": 161487.5229, "train_tokens_per_second": 5651.207 }, { "epoch": 1.4055346081335847, "grad_norm": 0.7771281147529382, "learning_rate": 2.0264434386189524e-06, "loss": 0.30182933807373047, "num_input_tokens_seen": 912816512, "step": 20875, "train_runtime": 161522.8112, "train_tokens_per_second": 5651.316 }, { "epoch": 1.405871263129545, "grad_norm": 0.6711489743793063, "learning_rate": 2.0243181728401136e-06, "loss": 0.29143590927124025, "num_input_tokens_seen": 913038160, "step": 20880, "train_runtime": 161565.9228, "train_tokens_per_second": 5651.18 }, { "epoch": 1.406207918125505, "grad_norm": 0.7946566060485273, "learning_rate": 2.022193739201208e-06, "loss": 0.31396236419677737, "num_input_tokens_seen": 913238344, "step": 20885, "train_runtime": 161599.9418, "train_tokens_per_second": 5651.229 }, { "epoch": 1.4065445731214652, "grad_norm": 0.7053560827598276, "learning_rate": 2.0200701382963267e-06, "loss": 0.2820024013519287, "num_input_tokens_seen": 913456008, "step": 20890, "train_runtime": 161640.9986, "train_tokens_per_second": 5651.141 }, { "epoch": 1.4068812281174252, "grad_norm": 0.8293767478590064, "learning_rate": 2.0179473707193324e-06, "loss": 0.2967421531677246, "num_input_tokens_seen": 913682016, "step": 20895, "train_runtime": 161681.1903, "train_tokens_per_second": 5651.134 }, { "epoch": 1.4072178831133855, "grad_norm": 0.681242664001568, "learning_rate": 2.0158254370638435e-06, "loss": 0.30292630195617676, "num_input_tokens_seen": 913903464, "step": 20900, "train_runtime": 161723.6924, "train_tokens_per_second": 5651.018 }, { "epoch": 1.4075545381093455, "grad_norm": 0.6662676288835188, "learning_rate": 2.0137043379232585e-06, "loss": 0.3011344909667969, "num_input_tokens_seen": 914128144, "step": 20905, "train_runtime": 161765.7508, "train_tokens_per_second": 5650.937 }, { "epoch": 1.4078911931053057, "grad_norm": 0.7275678076333139, "learning_rate": 2.0115840738907293e-06, "loss": 0.2961131572723389, "num_input_tokens_seen": 914332560, "step": 20910, "train_runtime": 161803.517, "train_tokens_per_second": 5650.882 }, { "epoch": 1.4082278481012658, "grad_norm": 0.8438338939411848, "learning_rate": 2.0094646455591865e-06, "loss": 0.31174521446228026, "num_input_tokens_seen": 914554936, "step": 20915, "train_runtime": 161846.6205, "train_tokens_per_second": 5650.751 }, { "epoch": 1.408564503097226, "grad_norm": 0.7029690243486251, "learning_rate": 2.007346053521319e-06, "loss": 0.3245561599731445, "num_input_tokens_seen": 914776376, "step": 20920, "train_runtime": 161885.6534, "train_tokens_per_second": 5650.756 }, { "epoch": 1.408901158093186, "grad_norm": 0.7673612026423596, "learning_rate": 2.005228298369583e-06, "loss": 0.3163960695266724, "num_input_tokens_seen": 914979152, "step": 20925, "train_runtime": 161924.9473, "train_tokens_per_second": 5650.637 }, { "epoch": 1.4092378130891463, "grad_norm": 0.8203680546301054, "learning_rate": 2.003111380696208e-06, "loss": 0.282145619392395, "num_input_tokens_seen": 915204416, "step": 20930, "train_runtime": 161972.9634, "train_tokens_per_second": 5650.353 }, { "epoch": 1.4095744680851063, "grad_norm": 0.826854532975397, "learning_rate": 2.0009953010931747e-06, "loss": 0.2879758834838867, "num_input_tokens_seen": 915424616, "step": 20935, "train_runtime": 162018.6585, "train_tokens_per_second": 5650.118 }, { "epoch": 1.4099111230810666, "grad_norm": 0.8165582356041448, "learning_rate": 1.998880060152244e-06, "loss": 0.32476277351379396, "num_input_tokens_seen": 915651288, "step": 20940, "train_runtime": 162057.5342, "train_tokens_per_second": 5650.162 }, { "epoch": 1.4102477780770266, "grad_norm": 0.7599467895290581, "learning_rate": 1.9967656584649354e-06, "loss": 0.3187078952789307, "num_input_tokens_seen": 915870040, "step": 20945, "train_runtime": 162094.7907, "train_tokens_per_second": 5650.213 }, { "epoch": 1.4105844330729869, "grad_norm": 0.7168782752872359, "learning_rate": 1.994652096622533e-06, "loss": 0.3237470149993896, "num_input_tokens_seen": 916090120, "step": 20950, "train_runtime": 162135.1509, "train_tokens_per_second": 5650.164 }, { "epoch": 1.410921088068947, "grad_norm": 0.8403414065661872, "learning_rate": 1.992539375216089e-06, "loss": 0.3227944612503052, "num_input_tokens_seen": 916315064, "step": 20955, "train_runtime": 162172.94, "train_tokens_per_second": 5650.234 }, { "epoch": 1.4112577430649071, "grad_norm": 0.7048786926884193, "learning_rate": 1.9904274948364184e-06, "loss": 0.30767481327056884, "num_input_tokens_seen": 916539152, "step": 20960, "train_runtime": 162213.0654, "train_tokens_per_second": 5650.218 }, { "epoch": 1.4115943980608672, "grad_norm": 0.7655887084377769, "learning_rate": 1.988316456074102e-06, "loss": 0.30903284549713134, "num_input_tokens_seen": 916766256, "step": 20965, "train_runtime": 162250.1786, "train_tokens_per_second": 5650.325 }, { "epoch": 1.4119310530568274, "grad_norm": 0.7205405993664067, "learning_rate": 1.9862062595194854e-06, "loss": 0.31888184547424314, "num_input_tokens_seen": 916978512, "step": 20970, "train_runtime": 162288.8233, "train_tokens_per_second": 5650.288 }, { "epoch": 1.4122677080527875, "grad_norm": 0.8681175003128851, "learning_rate": 1.984096905762676e-06, "loss": 0.2966637372970581, "num_input_tokens_seen": 917190424, "step": 20975, "train_runtime": 162331.7616, "train_tokens_per_second": 5650.098 }, { "epoch": 1.4126043630487477, "grad_norm": 0.7477822351336473, "learning_rate": 1.9819883953935533e-06, "loss": 0.3042705535888672, "num_input_tokens_seen": 917420304, "step": 20980, "train_runtime": 162368.0639, "train_tokens_per_second": 5650.251 }, { "epoch": 1.4129410180447077, "grad_norm": 0.8100441236586595, "learning_rate": 1.9798807290017485e-06, "loss": 0.2959493637084961, "num_input_tokens_seen": 917628664, "step": 20985, "train_runtime": 162403.0968, "train_tokens_per_second": 5650.315 }, { "epoch": 1.413277673040668, "grad_norm": 0.7188686347683017, "learning_rate": 1.9777739071766693e-06, "loss": 0.30003719329833983, "num_input_tokens_seen": 917841064, "step": 20990, "train_runtime": 162445.3947, "train_tokens_per_second": 5650.151 }, { "epoch": 1.413614328036628, "grad_norm": 0.7153354531724283, "learning_rate": 1.97566793050748e-06, "loss": 0.2987996578216553, "num_input_tokens_seen": 918043080, "step": 20995, "train_runtime": 162480.8482, "train_tokens_per_second": 5650.162 }, { "epoch": 1.4139509830325883, "grad_norm": 0.8260680916935863, "learning_rate": 1.9735627995831096e-06, "loss": 0.2807154178619385, "num_input_tokens_seen": 918268936, "step": 21000, "train_runtime": 162511.5804, "train_tokens_per_second": 5650.483 }, { "epoch": 1.4142876380285483, "grad_norm": 0.8413087670817464, "learning_rate": 1.9714585149922523e-06, "loss": 0.322419261932373, "num_input_tokens_seen": 918495704, "step": 21005, "train_runtime": 162548.3519, "train_tokens_per_second": 5650.6 }, { "epoch": 1.4146242930245085, "grad_norm": 0.7701984865141125, "learning_rate": 1.9693550773233634e-06, "loss": 0.2878579139709473, "num_input_tokens_seen": 918721536, "step": 21010, "train_runtime": 162584.2427, "train_tokens_per_second": 5650.742 }, { "epoch": 1.4149609480204686, "grad_norm": 0.7629047291809269, "learning_rate": 1.967252487164663e-06, "loss": 0.27617802619934084, "num_input_tokens_seen": 918949576, "step": 21015, "train_runtime": 162625.7531, "train_tokens_per_second": 5650.701 }, { "epoch": 1.4152976030164288, "grad_norm": 0.8987812118267688, "learning_rate": 1.9651507451041344e-06, "loss": 0.31108310222625735, "num_input_tokens_seen": 919161544, "step": 21020, "train_runtime": 162664.4459, "train_tokens_per_second": 5650.66 }, { "epoch": 1.4156342580123888, "grad_norm": 0.7347239736627051, "learning_rate": 1.9630498517295204e-06, "loss": 0.3056536436080933, "num_input_tokens_seen": 919390784, "step": 21025, "train_runtime": 162697.0609, "train_tokens_per_second": 5650.937 }, { "epoch": 1.415970913008349, "grad_norm": 0.7770976786280579, "learning_rate": 1.960949807628335e-06, "loss": 0.31153440475463867, "num_input_tokens_seen": 919610680, "step": 21030, "train_runtime": 162731.7215, "train_tokens_per_second": 5651.084 }, { "epoch": 1.4163075680043091, "grad_norm": 0.797661242102853, "learning_rate": 1.9588506133878415e-06, "loss": 0.33806021213531495, "num_input_tokens_seen": 919830696, "step": 21035, "train_runtime": 162768.2447, "train_tokens_per_second": 5651.168 }, { "epoch": 1.4166442230002694, "grad_norm": 0.7171305458599561, "learning_rate": 1.956752269595078e-06, "loss": 0.31885838508605957, "num_input_tokens_seen": 920055416, "step": 21040, "train_runtime": 162811.2347, "train_tokens_per_second": 5651.056 }, { "epoch": 1.4169808779962294, "grad_norm": 0.795769696712416, "learning_rate": 1.9546547768368384e-06, "loss": 0.3016183853149414, "num_input_tokens_seen": 920286312, "step": 21045, "train_runtime": 162846.1897, "train_tokens_per_second": 5651.261 }, { "epoch": 1.4173175329921897, "grad_norm": 0.9186674926118773, "learning_rate": 1.9525581356996793e-06, "loss": 0.28722732067108153, "num_input_tokens_seen": 920500576, "step": 21050, "train_runtime": 162885.5207, "train_tokens_per_second": 5651.212 }, { "epoch": 1.4176541879881497, "grad_norm": 0.7889483479656868, "learning_rate": 1.95046234676992e-06, "loss": 0.30141215324401854, "num_input_tokens_seen": 920738648, "step": 21055, "train_runtime": 162931.4756, "train_tokens_per_second": 5651.079 }, { "epoch": 1.41799084298411, "grad_norm": 0.8574903736733213, "learning_rate": 1.9483674106336416e-06, "loss": 0.2801323413848877, "num_input_tokens_seen": 920949800, "step": 21060, "train_runtime": 162973.0326, "train_tokens_per_second": 5650.934 }, { "epoch": 1.41832749798007, "grad_norm": 0.7178113150312732, "learning_rate": 1.9462733278766853e-06, "loss": 0.2972491025924683, "num_input_tokens_seen": 921159152, "step": 21065, "train_runtime": 163013.3989, "train_tokens_per_second": 5650.819 }, { "epoch": 1.4186641529760302, "grad_norm": 0.704039276053053, "learning_rate": 1.9441800990846553e-06, "loss": 0.29517397880554197, "num_input_tokens_seen": 921390072, "step": 21070, "train_runtime": 163044.8203, "train_tokens_per_second": 5651.146 }, { "epoch": 1.4190008079719902, "grad_norm": 0.9714518989901114, "learning_rate": 1.942087724842915e-06, "loss": 0.3248338460922241, "num_input_tokens_seen": 921598928, "step": 21075, "train_runtime": 163079.8467, "train_tokens_per_second": 5651.213 }, { "epoch": 1.4193374629679505, "grad_norm": 0.8145914643998322, "learning_rate": 1.9399962057365944e-06, "loss": 0.30252177715301515, "num_input_tokens_seen": 921803544, "step": 21080, "train_runtime": 163114.8336, "train_tokens_per_second": 5651.255 }, { "epoch": 1.4196741179639105, "grad_norm": 0.7419159789443908, "learning_rate": 1.937905542350574e-06, "loss": 0.32372136116027833, "num_input_tokens_seen": 922027736, "step": 21085, "train_runtime": 163156.4557, "train_tokens_per_second": 5651.188 }, { "epoch": 1.4200107729598708, "grad_norm": 0.7910617461936362, "learning_rate": 1.935815735269506e-06, "loss": 0.30223875045776366, "num_input_tokens_seen": 922247592, "step": 21090, "train_runtime": 163190.2127, "train_tokens_per_second": 5651.366 }, { "epoch": 1.4203474279558308, "grad_norm": 0.8193345009678259, "learning_rate": 1.933726785077797e-06, "loss": 0.3228907108306885, "num_input_tokens_seen": 922462256, "step": 21095, "train_runtime": 163230.7674, "train_tokens_per_second": 5651.277 }, { "epoch": 1.420684082951791, "grad_norm": 0.8060301943601257, "learning_rate": 1.9316386923596146e-06, "loss": 0.3193122386932373, "num_input_tokens_seen": 922683024, "step": 21100, "train_runtime": 163264.9379, "train_tokens_per_second": 5651.446 }, { "epoch": 1.421020737947751, "grad_norm": 0.9170237047964257, "learning_rate": 1.929551457698888e-06, "loss": 0.31147422790527346, "num_input_tokens_seen": 922907808, "step": 21105, "train_runtime": 163294.9124, "train_tokens_per_second": 5651.785 }, { "epoch": 1.4213573929437113, "grad_norm": 0.7054636815045637, "learning_rate": 1.9274650816793044e-06, "loss": 0.3035153388977051, "num_input_tokens_seen": 923140672, "step": 21110, "train_runtime": 163327.9489, "train_tokens_per_second": 5652.068 }, { "epoch": 1.4216940479396714, "grad_norm": 0.7667361817429569, "learning_rate": 1.9253795648843136e-06, "loss": 0.3144373893737793, "num_input_tokens_seen": 923369128, "step": 21115, "train_runtime": 163362.795, "train_tokens_per_second": 5652.261 }, { "epoch": 1.4220307029356316, "grad_norm": 0.8143437243469857, "learning_rate": 1.9232949078971236e-06, "loss": 0.3086548805236816, "num_input_tokens_seen": 923585136, "step": 21120, "train_runtime": 163401.3138, "train_tokens_per_second": 5652.25 }, { "epoch": 1.4223673579315916, "grad_norm": 0.6659717947233721, "learning_rate": 1.9212111113006998e-06, "loss": 0.28868756294250486, "num_input_tokens_seen": 923819592, "step": 21125, "train_runtime": 163444.6265, "train_tokens_per_second": 5652.187 }, { "epoch": 1.4227040129275519, "grad_norm": 0.8511283738043982, "learning_rate": 1.919128175677775e-06, "loss": 0.2978044986724854, "num_input_tokens_seen": 924024304, "step": 21130, "train_runtime": 163482.4066, "train_tokens_per_second": 5652.133 }, { "epoch": 1.423040667923512, "grad_norm": 0.7092905997999482, "learning_rate": 1.917046101610827e-06, "loss": 0.30063571929931643, "num_input_tokens_seen": 924252928, "step": 21135, "train_runtime": 163517.7525, "train_tokens_per_second": 5652.309 }, { "epoch": 1.4233773229194722, "grad_norm": 0.6893485352461994, "learning_rate": 1.9149648896821087e-06, "loss": 0.3125055551528931, "num_input_tokens_seen": 924467024, "step": 21140, "train_runtime": 163562.0209, "train_tokens_per_second": 5652.089 }, { "epoch": 1.4237139779154322, "grad_norm": 0.8321835207068441, "learning_rate": 1.912884540473621e-06, "loss": 0.2941263675689697, "num_input_tokens_seen": 924669616, "step": 21145, "train_runtime": 163600.3041, "train_tokens_per_second": 5652.004 }, { "epoch": 1.4240506329113924, "grad_norm": 0.8081464869797703, "learning_rate": 1.9108050545671283e-06, "loss": 0.27542452812194823, "num_input_tokens_seen": 924875728, "step": 21150, "train_runtime": 163635.3214, "train_tokens_per_second": 5652.054 }, { "epoch": 1.4243872879073525, "grad_norm": 0.787738441929922, "learning_rate": 1.9087264325441507e-06, "loss": 0.27084195613861084, "num_input_tokens_seen": 925083640, "step": 21155, "train_runtime": 163676.6739, "train_tokens_per_second": 5651.897 }, { "epoch": 1.4247239429033127, "grad_norm": 0.7323327553262341, "learning_rate": 1.9066486749859686e-06, "loss": 0.3030634880065918, "num_input_tokens_seen": 925295656, "step": 21160, "train_runtime": 163710.5311, "train_tokens_per_second": 5652.023 }, { "epoch": 1.4250605978992728, "grad_norm": 0.6814532189083007, "learning_rate": 1.9045717824736209e-06, "loss": 0.3159012794494629, "num_input_tokens_seen": 925523192, "step": 21165, "train_runtime": 163748.7467, "train_tokens_per_second": 5652.093 }, { "epoch": 1.425397252895233, "grad_norm": 0.7944933793290381, "learning_rate": 1.9024957555879037e-06, "loss": 0.30693175792694094, "num_input_tokens_seen": 925733280, "step": 21170, "train_runtime": 163785.8609, "train_tokens_per_second": 5652.095 }, { "epoch": 1.425733907891193, "grad_norm": 0.7669788666621243, "learning_rate": 1.9004205949093695e-06, "loss": 0.31174449920654296, "num_input_tokens_seen": 925952408, "step": 21175, "train_runtime": 163819.8869, "train_tokens_per_second": 5652.259 }, { "epoch": 1.4260705628871533, "grad_norm": 0.686815248193178, "learning_rate": 1.8983463010183355e-06, "loss": 0.3182375907897949, "num_input_tokens_seen": 926166584, "step": 21180, "train_runtime": 163852.9598, "train_tokens_per_second": 5652.425 }, { "epoch": 1.4264072178831133, "grad_norm": 0.7134163125741153, "learning_rate": 1.8962728744948644e-06, "loss": 0.30806000232696534, "num_input_tokens_seen": 926394392, "step": 21185, "train_runtime": 163892.3417, "train_tokens_per_second": 5652.457 }, { "epoch": 1.4267438728790736, "grad_norm": 0.7517845683613481, "learning_rate": 1.894200315918789e-06, "loss": 0.3054067850112915, "num_input_tokens_seen": 926630992, "step": 21190, "train_runtime": 163926.2105, "train_tokens_per_second": 5652.732 }, { "epoch": 1.4270805278750336, "grad_norm": 0.8347312289874191, "learning_rate": 1.8921286258696913e-06, "loss": 0.2958783388137817, "num_input_tokens_seen": 926834656, "step": 21195, "train_runtime": 163965.1465, "train_tokens_per_second": 5652.632 }, { "epoch": 1.4274171828709938, "grad_norm": 0.695621933573107, "learning_rate": 1.890057804926913e-06, "loss": 0.2869250297546387, "num_input_tokens_seen": 927061800, "step": 21200, "train_runtime": 164003.1629, "train_tokens_per_second": 5652.707 }, { "epoch": 1.4277538378669539, "grad_norm": 0.6966348686251759, "learning_rate": 1.887987853669553e-06, "loss": 0.2620058536529541, "num_input_tokens_seen": 927286432, "step": 21205, "train_runtime": 164046.6271, "train_tokens_per_second": 5652.578 }, { "epoch": 1.4280904928629141, "grad_norm": 0.830983696417087, "learning_rate": 1.8859187726764654e-06, "loss": 0.3177152633666992, "num_input_tokens_seen": 927512824, "step": 21210, "train_runtime": 164084.865, "train_tokens_per_second": 5652.641 }, { "epoch": 1.4284271478588741, "grad_norm": 0.7634247104794691, "learning_rate": 1.8838505625262638e-06, "loss": 0.29890553951263427, "num_input_tokens_seen": 927741616, "step": 21215, "train_runtime": 164125.1634, "train_tokens_per_second": 5652.647 }, { "epoch": 1.4287638028548344, "grad_norm": 0.8416951428048186, "learning_rate": 1.8817832237973154e-06, "loss": 0.2987877368927002, "num_input_tokens_seen": 927959432, "step": 21220, "train_runtime": 164164.0626, "train_tokens_per_second": 5652.634 }, { "epoch": 1.4291004578507944, "grad_norm": 0.7473862936478309, "learning_rate": 1.8797167570677439e-06, "loss": 0.28604328632354736, "num_input_tokens_seen": 928181056, "step": 21225, "train_runtime": 164213.2671, "train_tokens_per_second": 5652.29 }, { "epoch": 1.4294371128467547, "grad_norm": 0.7676020809790378, "learning_rate": 1.8776511629154342e-06, "loss": 0.3128670215606689, "num_input_tokens_seen": 928412792, "step": 21230, "train_runtime": 164257.191, "train_tokens_per_second": 5652.19 }, { "epoch": 1.4297737678427147, "grad_norm": 0.7060907183473086, "learning_rate": 1.8755864419180176e-06, "loss": 0.30298452377319335, "num_input_tokens_seen": 928637368, "step": 21235, "train_runtime": 164304.219, "train_tokens_per_second": 5651.939 }, { "epoch": 1.430110422838675, "grad_norm": 0.7454649225429147, "learning_rate": 1.8735225946528906e-06, "loss": 0.3099356174468994, "num_input_tokens_seen": 928865136, "step": 21240, "train_runtime": 164340.2939, "train_tokens_per_second": 5652.084 }, { "epoch": 1.430447077834635, "grad_norm": 0.8028586780145847, "learning_rate": 1.8714596216972008e-06, "loss": 0.3137706518173218, "num_input_tokens_seen": 929082920, "step": 21245, "train_runtime": 164371.8405, "train_tokens_per_second": 5652.324 }, { "epoch": 1.4307837328305952, "grad_norm": 0.7853913811139581, "learning_rate": 1.8693975236278512e-06, "loss": 0.29973363876342773, "num_input_tokens_seen": 929295744, "step": 21250, "train_runtime": 164413.6617, "train_tokens_per_second": 5652.181 }, { "epoch": 1.4311203878265553, "grad_norm": 0.8450932910736807, "learning_rate": 1.8673363010215017e-06, "loss": 0.32357001304626465, "num_input_tokens_seen": 929509608, "step": 21255, "train_runtime": 164454.4421, "train_tokens_per_second": 5652.08 }, { "epoch": 1.4314570428225155, "grad_norm": 0.9839403436936655, "learning_rate": 1.8652759544545661e-06, "loss": 0.3077038288116455, "num_input_tokens_seen": 929730176, "step": 21260, "train_runtime": 164491.0098, "train_tokens_per_second": 5652.164 }, { "epoch": 1.4317936978184758, "grad_norm": 0.7604757449953816, "learning_rate": 1.863216484503214e-06, "loss": 0.31038436889648435, "num_input_tokens_seen": 929946784, "step": 21265, "train_runtime": 164534.2411, "train_tokens_per_second": 5651.995 }, { "epoch": 1.4321303528144358, "grad_norm": 0.7883194464998438, "learning_rate": 1.8611578917433698e-06, "loss": 0.3216505527496338, "num_input_tokens_seen": 930172032, "step": 21270, "train_runtime": 164567.2868, "train_tokens_per_second": 5652.229 }, { "epoch": 1.4324670078103958, "grad_norm": 0.7899893399884377, "learning_rate": 1.85910017675071e-06, "loss": 0.32173566818237304, "num_input_tokens_seen": 930388552, "step": 21275, "train_runtime": 164609.009, "train_tokens_per_second": 5652.112 }, { "epoch": 1.432803662806356, "grad_norm": 0.7217767584914241, "learning_rate": 1.8570433401006737e-06, "loss": 0.2714304208755493, "num_input_tokens_seen": 930614664, "step": 21280, "train_runtime": 164643.9676, "train_tokens_per_second": 5652.285 }, { "epoch": 1.4331403178023163, "grad_norm": 0.6750386059644308, "learning_rate": 1.8549873823684418e-06, "loss": 0.2765933990478516, "num_input_tokens_seen": 930827792, "step": 21285, "train_runtime": 164684.8033, "train_tokens_per_second": 5652.178 }, { "epoch": 1.4334769727982763, "grad_norm": 0.6817317088910789, "learning_rate": 1.8529323041289616e-06, "loss": 0.32932586669921876, "num_input_tokens_seen": 931052808, "step": 21290, "train_runtime": 164719.7957, "train_tokens_per_second": 5652.343 }, { "epoch": 1.4338136277942364, "grad_norm": 0.7091930055386446, "learning_rate": 1.850878105956927e-06, "loss": 0.30021870136260986, "num_input_tokens_seen": 931280240, "step": 21295, "train_runtime": 164748.8947, "train_tokens_per_second": 5652.725 }, { "epoch": 1.4341502827901966, "grad_norm": 0.7271899404201645, "learning_rate": 1.8488247884267885e-06, "loss": 0.29010815620422364, "num_input_tokens_seen": 931510352, "step": 21300, "train_runtime": 164786.0486, "train_tokens_per_second": 5652.847 }, { "epoch": 1.4344869377861569, "grad_norm": 0.7528962182100777, "learning_rate": 1.8467723521127495e-06, "loss": 0.31166844367980956, "num_input_tokens_seen": 931718464, "step": 21305, "train_runtime": 164828.9311, "train_tokens_per_second": 5652.639 }, { "epoch": 1.434823592782117, "grad_norm": 0.7144128400418023, "learning_rate": 1.8447207975887671e-06, "loss": 0.28693480491638185, "num_input_tokens_seen": 931935064, "step": 21310, "train_runtime": 164871.6945, "train_tokens_per_second": 5652.487 }, { "epoch": 1.435160247778077, "grad_norm": 0.7690115630964821, "learning_rate": 1.8426701254285522e-06, "loss": 0.3131574630737305, "num_input_tokens_seen": 932161648, "step": 21315, "train_runtime": 164919.0598, "train_tokens_per_second": 5652.237 }, { "epoch": 1.4354969027740372, "grad_norm": 0.7673435561570116, "learning_rate": 1.840620336205569e-06, "loss": 0.3200539588928223, "num_input_tokens_seen": 932386520, "step": 21320, "train_runtime": 164962.3028, "train_tokens_per_second": 5652.119 }, { "epoch": 1.4358335577699974, "grad_norm": 0.7307859186284956, "learning_rate": 1.8385714304930324e-06, "loss": 0.2745990753173828, "num_input_tokens_seen": 932614272, "step": 21325, "train_runtime": 164999.3023, "train_tokens_per_second": 5652.232 }, { "epoch": 1.4361702127659575, "grad_norm": 0.6957468061230739, "learning_rate": 1.8365234088639178e-06, "loss": 0.2942768096923828, "num_input_tokens_seen": 932835368, "step": 21330, "train_runtime": 165036.968, "train_tokens_per_second": 5652.281 }, { "epoch": 1.4365068677619175, "grad_norm": 0.7649094984689576, "learning_rate": 1.834476271890941e-06, "loss": 0.2779007196426392, "num_input_tokens_seen": 933035248, "step": 21335, "train_runtime": 165075.7307, "train_tokens_per_second": 5652.165 }, { "epoch": 1.4368435227578777, "grad_norm": 0.8467030298955615, "learning_rate": 1.8324300201465823e-06, "loss": 0.28595268726348877, "num_input_tokens_seen": 933258792, "step": 21340, "train_runtime": 165110.7752, "train_tokens_per_second": 5652.319 }, { "epoch": 1.437180177753838, "grad_norm": 0.9120057814047616, "learning_rate": 1.8303846542030674e-06, "loss": 0.3224499225616455, "num_input_tokens_seen": 933469416, "step": 21345, "train_runtime": 165149.1219, "train_tokens_per_second": 5652.282 }, { "epoch": 1.437516832749798, "grad_norm": 0.6674633214236769, "learning_rate": 1.828340174632377e-06, "loss": 0.28315880298614504, "num_input_tokens_seen": 933691024, "step": 21350, "train_runtime": 165182.0127, "train_tokens_per_second": 5652.498 }, { "epoch": 1.437853487745758, "grad_norm": 0.8225297648308803, "learning_rate": 1.8262965820062434e-06, "loss": 0.29636235237121583, "num_input_tokens_seen": 933911248, "step": 21355, "train_runtime": 165216.2714, "train_tokens_per_second": 5652.659 }, { "epoch": 1.4381901427417183, "grad_norm": 0.6767595245186808, "learning_rate": 1.8242538768961499e-06, "loss": 0.2795313835144043, "num_input_tokens_seen": 934130456, "step": 21360, "train_runtime": 165249.3613, "train_tokens_per_second": 5652.854 }, { "epoch": 1.4385267977376786, "grad_norm": 0.7672480972220348, "learning_rate": 1.8222120598733317e-06, "loss": 0.28819353580474855, "num_input_tokens_seen": 934359280, "step": 21365, "train_runtime": 165289.8341, "train_tokens_per_second": 5652.854 }, { "epoch": 1.4388634527336386, "grad_norm": 0.6461035328546648, "learning_rate": 1.820171131508781e-06, "loss": 0.32363121509552, "num_input_tokens_seen": 934570728, "step": 21370, "train_runtime": 165324.9001, "train_tokens_per_second": 5652.934 }, { "epoch": 1.4392001077295986, "grad_norm": 0.7231126098153248, "learning_rate": 1.8181310923732304e-06, "loss": 0.2775664091110229, "num_input_tokens_seen": 934787104, "step": 21375, "train_runtime": 165367.2208, "train_tokens_per_second": 5652.796 }, { "epoch": 1.4395367627255589, "grad_norm": 0.7398980756791921, "learning_rate": 1.8160919430371764e-06, "loss": 0.3209282875061035, "num_input_tokens_seen": 934994512, "step": 21380, "train_runtime": 165407.8952, "train_tokens_per_second": 5652.66 }, { "epoch": 1.439873417721519, "grad_norm": 0.7357422737413674, "learning_rate": 1.814053684070855e-06, "loss": 0.29017982482910154, "num_input_tokens_seen": 935221480, "step": 21385, "train_runtime": 165444.6956, "train_tokens_per_second": 5652.774 }, { "epoch": 1.4402100727174791, "grad_norm": 0.6759617094745846, "learning_rate": 1.8120163160442633e-06, "loss": 0.28193049430847167, "num_input_tokens_seen": 935448880, "step": 21390, "train_runtime": 165481.2265, "train_tokens_per_second": 5652.9 }, { "epoch": 1.4405467277134392, "grad_norm": 0.7834824232339231, "learning_rate": 1.8099798395271428e-06, "loss": 0.31296658515930176, "num_input_tokens_seen": 935684528, "step": 21395, "train_runtime": 165519.1626, "train_tokens_per_second": 5653.028 }, { "epoch": 1.4408833827093994, "grad_norm": 0.8498195490700376, "learning_rate": 1.807944255088988e-06, "loss": 0.28637051582336426, "num_input_tokens_seen": 935896728, "step": 21400, "train_runtime": 165555.3887, "train_tokens_per_second": 5653.073 }, { "epoch": 1.4412200377053597, "grad_norm": 0.748373198382384, "learning_rate": 1.8059095632990437e-06, "loss": 0.29571921825408937, "num_input_tokens_seen": 936114728, "step": 21405, "train_runtime": 165587.8193, "train_tokens_per_second": 5653.283 }, { "epoch": 1.4415566927013197, "grad_norm": 0.7727984893995797, "learning_rate": 1.8038757647263045e-06, "loss": 0.312378978729248, "num_input_tokens_seen": 936331896, "step": 21410, "train_runtime": 165625.2428, "train_tokens_per_second": 5653.316 }, { "epoch": 1.4418933476972797, "grad_norm": 0.7518266240149807, "learning_rate": 1.8018428599395143e-06, "loss": 0.28726487159729003, "num_input_tokens_seen": 936563512, "step": 21415, "train_runtime": 165667.7133, "train_tokens_per_second": 5653.265 }, { "epoch": 1.44223000269324, "grad_norm": 0.7820091979263111, "learning_rate": 1.7998108495071743e-06, "loss": 0.2904759645462036, "num_input_tokens_seen": 936786872, "step": 21420, "train_runtime": 165709.7298, "train_tokens_per_second": 5653.18 }, { "epoch": 1.4425666576892002, "grad_norm": 0.6751633930702853, "learning_rate": 1.797779733997521e-06, "loss": 0.2962934970855713, "num_input_tokens_seen": 937007176, "step": 21425, "train_runtime": 165749.8126, "train_tokens_per_second": 5653.142 }, { "epoch": 1.4429033126851603, "grad_norm": 0.8092929943597413, "learning_rate": 1.7957495139785585e-06, "loss": 0.3217646837234497, "num_input_tokens_seen": 937228952, "step": 21430, "train_runtime": 165788.6583, "train_tokens_per_second": 5653.155 }, { "epoch": 1.4432399676811203, "grad_norm": 0.7953086319181529, "learning_rate": 1.7937201900180228e-06, "loss": 0.3023351192474365, "num_input_tokens_seen": 937432152, "step": 21435, "train_runtime": 165829.5232, "train_tokens_per_second": 5652.987 }, { "epoch": 1.4435766226770805, "grad_norm": 0.779971454215353, "learning_rate": 1.7916917626834134e-06, "loss": 0.339884877204895, "num_input_tokens_seen": 937653160, "step": 21440, "train_runtime": 165865.7943, "train_tokens_per_second": 5653.083 }, { "epoch": 1.4439132776730408, "grad_norm": 0.7683843965957411, "learning_rate": 1.7896642325419722e-06, "loss": 0.31574015617370604, "num_input_tokens_seen": 937871808, "step": 21445, "train_runtime": 165902.9614, "train_tokens_per_second": 5653.135 }, { "epoch": 1.4442499326690008, "grad_norm": 0.8231498052304078, "learning_rate": 1.7876376001606915e-06, "loss": 0.30422613620758054, "num_input_tokens_seen": 938077432, "step": 21450, "train_runtime": 165937.6243, "train_tokens_per_second": 5653.193 }, { "epoch": 1.4445865876649608, "grad_norm": 0.7326842394414514, "learning_rate": 1.7856118661063128e-06, "loss": 0.2780045747756958, "num_input_tokens_seen": 938306192, "step": 21455, "train_runtime": 165979.0063, "train_tokens_per_second": 5653.162 }, { "epoch": 1.444923242660921, "grad_norm": 0.7610326872210833, "learning_rate": 1.7835870309453251e-06, "loss": 0.3040392637252808, "num_input_tokens_seen": 938518824, "step": 21460, "train_runtime": 166016.1945, "train_tokens_per_second": 5653.176 }, { "epoch": 1.4452598976568813, "grad_norm": 0.8223404953379267, "learning_rate": 1.7815630952439667e-06, "loss": 0.29809937477111814, "num_input_tokens_seen": 938731144, "step": 21465, "train_runtime": 166055.7098, "train_tokens_per_second": 5653.11 }, { "epoch": 1.4455965526528414, "grad_norm": 0.6879100802906614, "learning_rate": 1.7795400595682289e-06, "loss": 0.2990201473236084, "num_input_tokens_seen": 938939520, "step": 21470, "train_runtime": 166093.1609, "train_tokens_per_second": 5653.09 }, { "epoch": 1.4459332076488014, "grad_norm": 0.813015218983521, "learning_rate": 1.7775179244838408e-06, "loss": 0.342014741897583, "num_input_tokens_seen": 939148712, "step": 21475, "train_runtime": 166128.378, "train_tokens_per_second": 5653.15 }, { "epoch": 1.4462698626447617, "grad_norm": 0.9260324228291221, "learning_rate": 1.7754966905562925e-06, "loss": 0.29918684959411623, "num_input_tokens_seen": 939352016, "step": 21480, "train_runtime": 166162.1908, "train_tokens_per_second": 5653.224 }, { "epoch": 1.446606517640722, "grad_norm": 0.8748856406745196, "learning_rate": 1.7734763583508098e-06, "loss": 0.29963269233703616, "num_input_tokens_seen": 939569112, "step": 21485, "train_runtime": 166205.207, "train_tokens_per_second": 5653.067 }, { "epoch": 1.446943172636682, "grad_norm": 0.7627386667181976, "learning_rate": 1.7714569284323757e-06, "loss": 0.31328535079956055, "num_input_tokens_seen": 939800608, "step": 21490, "train_runtime": 166243.8986, "train_tokens_per_second": 5653.143 }, { "epoch": 1.447279827632642, "grad_norm": 0.8015396995375884, "learning_rate": 1.7694384013657173e-06, "loss": 0.29224376678466796, "num_input_tokens_seen": 940016152, "step": 21495, "train_runtime": 166286.6326, "train_tokens_per_second": 5652.987 }, { "epoch": 1.4476164826286022, "grad_norm": 0.8776810745850877, "learning_rate": 1.767420777715308e-06, "loss": 0.31572024822235106, "num_input_tokens_seen": 940248920, "step": 21500, "train_runtime": 166324.4801, "train_tokens_per_second": 5653.1 }, { "epoch": 1.4479531376245625, "grad_norm": 0.7580449081333255, "learning_rate": 1.7654040580453702e-06, "loss": 0.2916224241256714, "num_input_tokens_seen": 940476808, "step": 21505, "train_runtime": 166359.4179, "train_tokens_per_second": 5653.283 }, { "epoch": 1.4482897926205225, "grad_norm": 0.639413137355145, "learning_rate": 1.7633882429198734e-06, "loss": 0.3200731039047241, "num_input_tokens_seen": 940704272, "step": 21510, "train_runtime": 166400.2408, "train_tokens_per_second": 5653.263 }, { "epoch": 1.4486264476164825, "grad_norm": 0.7602925689681508, "learning_rate": 1.7613733329025318e-06, "loss": 0.29833736419677737, "num_input_tokens_seen": 940937904, "step": 21515, "train_runtime": 166440.5197, "train_tokens_per_second": 5653.298 }, { "epoch": 1.4489631026124428, "grad_norm": 0.7097451959902662, "learning_rate": 1.759359328556814e-06, "loss": 0.3069751739501953, "num_input_tokens_seen": 941164048, "step": 21520, "train_runtime": 166482.7242, "train_tokens_per_second": 5653.223 }, { "epoch": 1.449299757608403, "grad_norm": 0.710759458078187, "learning_rate": 1.7573462304459227e-06, "loss": 0.3017618179321289, "num_input_tokens_seen": 941384664, "step": 21525, "train_runtime": 166515.4855, "train_tokens_per_second": 5653.436 }, { "epoch": 1.449636412604363, "grad_norm": 0.7685693129079793, "learning_rate": 1.7553340391328216e-06, "loss": 0.28963470458984375, "num_input_tokens_seen": 941603416, "step": 21530, "train_runtime": 166553.5695, "train_tokens_per_second": 5653.457 }, { "epoch": 1.449973067600323, "grad_norm": 0.738257634670664, "learning_rate": 1.7533227551802068e-06, "loss": 0.3050259590148926, "num_input_tokens_seen": 941831232, "step": 21535, "train_runtime": 166590.2874, "train_tokens_per_second": 5653.578 }, { "epoch": 1.4503097225962833, "grad_norm": 0.754114134507954, "learning_rate": 1.7513123791505321e-06, "loss": 0.32262425422668456, "num_input_tokens_seen": 942039264, "step": 21540, "train_runtime": 166635.0494, "train_tokens_per_second": 5653.308 }, { "epoch": 1.4506463775922436, "grad_norm": 0.7204342650845901, "learning_rate": 1.7493029116059913e-06, "loss": 0.3137768268585205, "num_input_tokens_seen": 942254168, "step": 21545, "train_runtime": 166675.6352, "train_tokens_per_second": 5653.221 }, { "epoch": 1.4509830325882036, "grad_norm": 0.697936428942608, "learning_rate": 1.7472943531085252e-06, "loss": 0.29879701137542725, "num_input_tokens_seen": 942479744, "step": 21550, "train_runtime": 166714.327, "train_tokens_per_second": 5653.262 }, { "epoch": 1.4513196875841636, "grad_norm": 0.7740871394950247, "learning_rate": 1.7452867042198212e-06, "loss": 0.28659663200378416, "num_input_tokens_seen": 942691224, "step": 21555, "train_runtime": 166751.6931, "train_tokens_per_second": 5653.263 }, { "epoch": 1.4516563425801239, "grad_norm": 0.6502354382689284, "learning_rate": 1.7432799655013122e-06, "loss": 0.2767528533935547, "num_input_tokens_seen": 942915144, "step": 21560, "train_runtime": 166790.4888, "train_tokens_per_second": 5653.291 }, { "epoch": 1.4519929975760841, "grad_norm": 0.779285918218484, "learning_rate": 1.741274137514174e-06, "loss": 0.31976196765899656, "num_input_tokens_seen": 943124816, "step": 21565, "train_runtime": 166827.7671, "train_tokens_per_second": 5653.284 }, { "epoch": 1.4523296525720442, "grad_norm": 0.730492770357248, "learning_rate": 1.7392692208193351e-06, "loss": 0.28882317543029784, "num_input_tokens_seen": 943341696, "step": 21570, "train_runtime": 166874.6737, "train_tokens_per_second": 5652.995 }, { "epoch": 1.4526663075680042, "grad_norm": 0.7541365898746943, "learning_rate": 1.7372652159774578e-06, "loss": 0.27709264755249025, "num_input_tokens_seen": 943566704, "step": 21575, "train_runtime": 166921.1117, "train_tokens_per_second": 5652.77 }, { "epoch": 1.4530029625639644, "grad_norm": 0.7928699130255181, "learning_rate": 1.7352621235489625e-06, "loss": 0.2953044414520264, "num_input_tokens_seen": 943783040, "step": 21580, "train_runtime": 166963.3208, "train_tokens_per_second": 5652.637 }, { "epoch": 1.4533396175599247, "grad_norm": 0.9056536373531542, "learning_rate": 1.733259944094e-06, "loss": 0.3123426914215088, "num_input_tokens_seen": 944002144, "step": 21585, "train_runtime": 167004.2159, "train_tokens_per_second": 5652.565 }, { "epoch": 1.4536762725558847, "grad_norm": 0.8189634122392393, "learning_rate": 1.7312586781724789e-06, "loss": 0.2972878456115723, "num_input_tokens_seen": 944220536, "step": 21590, "train_runtime": 167035.0784, "train_tokens_per_second": 5652.828 }, { "epoch": 1.4540129275518447, "grad_norm": 0.732986430525691, "learning_rate": 1.7292583263440454e-06, "loss": 0.31235198974609374, "num_input_tokens_seen": 944434048, "step": 21595, "train_runtime": 167074.9914, "train_tokens_per_second": 5652.755 }, { "epoch": 1.454349582547805, "grad_norm": 0.7844415288989635, "learning_rate": 1.7272588891680914e-06, "loss": 0.28976993560791015, "num_input_tokens_seen": 944637656, "step": 21600, "train_runtime": 167114.3019, "train_tokens_per_second": 5652.644 }, { "epoch": 1.4546862375437652, "grad_norm": 0.7510452926746763, "learning_rate": 1.7252603672037527e-06, "loss": 0.29179136753082274, "num_input_tokens_seen": 944849080, "step": 21605, "train_runtime": 167151.8596, "train_tokens_per_second": 5652.639 }, { "epoch": 1.4550228925397253, "grad_norm": 0.7069433117953492, "learning_rate": 1.72326276100991e-06, "loss": 0.2792097568511963, "num_input_tokens_seen": 945079208, "step": 21610, "train_runtime": 167188.5022, "train_tokens_per_second": 5652.776 }, { "epoch": 1.4553595475356853, "grad_norm": 0.7362903218179828, "learning_rate": 1.721266071145186e-06, "loss": 0.3040107250213623, "num_input_tokens_seen": 945305216, "step": 21615, "train_runtime": 167227.9102, "train_tokens_per_second": 5652.796 }, { "epoch": 1.4556962025316456, "grad_norm": 0.6951834691585765, "learning_rate": 1.7192702981679531e-06, "loss": 0.30785455703735354, "num_input_tokens_seen": 945532656, "step": 21620, "train_runtime": 167262.6432, "train_tokens_per_second": 5652.982 }, { "epoch": 1.4560328575276058, "grad_norm": 0.821045679169631, "learning_rate": 1.717275442636317e-06, "loss": 0.27479963302612304, "num_input_tokens_seen": 945753800, "step": 21625, "train_runtime": 167298.9162, "train_tokens_per_second": 5653.078 }, { "epoch": 1.4563695125235658, "grad_norm": 0.8193382447695793, "learning_rate": 1.7152815051081384e-06, "loss": 0.30873837471008303, "num_input_tokens_seen": 945972456, "step": 21630, "train_runtime": 167336.3125, "train_tokens_per_second": 5653.121 }, { "epoch": 1.4567061675195259, "grad_norm": 0.638886315430458, "learning_rate": 1.7132884861410093e-06, "loss": 0.3021131753921509, "num_input_tokens_seen": 946181664, "step": 21635, "train_runtime": 167372.1705, "train_tokens_per_second": 5653.16 }, { "epoch": 1.4570428225154861, "grad_norm": 0.718262205464768, "learning_rate": 1.7112963862922766e-06, "loss": 0.28493921756744384, "num_input_tokens_seen": 946392928, "step": 21640, "train_runtime": 167406.6012, "train_tokens_per_second": 5653.259 }, { "epoch": 1.4573794775114464, "grad_norm": 0.7426374869134673, "learning_rate": 1.7093052061190224e-06, "loss": 0.30887959003448484, "num_input_tokens_seen": 946623584, "step": 21645, "train_runtime": 167442.3926, "train_tokens_per_second": 5653.428 }, { "epoch": 1.4577161325074064, "grad_norm": 0.772847955691719, "learning_rate": 1.7073149461780742e-06, "loss": 0.3057863712310791, "num_input_tokens_seen": 946857512, "step": 21650, "train_runtime": 167480.3097, "train_tokens_per_second": 5653.545 }, { "epoch": 1.4580527875033664, "grad_norm": 0.8197339025409829, "learning_rate": 1.705325607026001e-06, "loss": 0.31071517467498777, "num_input_tokens_seen": 947062648, "step": 21655, "train_runtime": 167515.2805, "train_tokens_per_second": 5653.59 }, { "epoch": 1.4583894424993267, "grad_norm": 0.8087443650582465, "learning_rate": 1.7033371892191164e-06, "loss": 0.30583949089050294, "num_input_tokens_seen": 947284464, "step": 21660, "train_runtime": 167551.6527, "train_tokens_per_second": 5653.686 }, { "epoch": 1.458726097495287, "grad_norm": 0.8458934309863756, "learning_rate": 1.7013496933134726e-06, "loss": 0.3118964433670044, "num_input_tokens_seen": 947494920, "step": 21665, "train_runtime": 167591.8547, "train_tokens_per_second": 5653.586 }, { "epoch": 1.459062752491247, "grad_norm": 0.7530131041192967, "learning_rate": 1.6993631198648724e-06, "loss": 0.34239089488983154, "num_input_tokens_seen": 947716632, "step": 21670, "train_runtime": 167625.9367, "train_tokens_per_second": 5653.759 }, { "epoch": 1.459399407487207, "grad_norm": 0.7606267649483974, "learning_rate": 1.697377469428847e-06, "loss": 0.29693849086761476, "num_input_tokens_seen": 947941544, "step": 21675, "train_runtime": 167662.1721, "train_tokens_per_second": 5653.878 }, { "epoch": 1.4597360624831672, "grad_norm": 0.759611478078839, "learning_rate": 1.6953927425606842e-06, "loss": 0.32032740116119385, "num_input_tokens_seen": 948159704, "step": 21680, "train_runtime": 167706.2866, "train_tokens_per_second": 5653.692 }, { "epoch": 1.4600727174791275, "grad_norm": 0.6996571917020317, "learning_rate": 1.6934089398154002e-06, "loss": 0.2828591585159302, "num_input_tokens_seen": 948375840, "step": 21685, "train_runtime": 167745.1778, "train_tokens_per_second": 5653.67 }, { "epoch": 1.4604093724750875, "grad_norm": 0.6597372627621453, "learning_rate": 1.6914260617477634e-06, "loss": 0.284234356880188, "num_input_tokens_seen": 948601288, "step": 21690, "train_runtime": 167778.0303, "train_tokens_per_second": 5653.906 }, { "epoch": 1.4607460274710475, "grad_norm": 0.630497034262492, "learning_rate": 1.6894441089122788e-06, "loss": 0.2686470985412598, "num_input_tokens_seen": 948816664, "step": 21695, "train_runtime": 167813.8414, "train_tokens_per_second": 5653.983 }, { "epoch": 1.4610826824670078, "grad_norm": 0.8999505558321718, "learning_rate": 1.6874630818631926e-06, "loss": 0.31239607334136965, "num_input_tokens_seen": 949036440, "step": 21700, "train_runtime": 167856.1735, "train_tokens_per_second": 5653.867 }, { "epoch": 1.461419337462968, "grad_norm": 0.7748359789057865, "learning_rate": 1.685482981154492e-06, "loss": 0.31434266567230223, "num_input_tokens_seen": 949257872, "step": 21705, "train_runtime": 167886.9016, "train_tokens_per_second": 5654.151 }, { "epoch": 1.461755992458928, "grad_norm": 0.6957529322275174, "learning_rate": 1.683503807339907e-06, "loss": 0.29442682266235354, "num_input_tokens_seen": 949486984, "step": 21710, "train_runtime": 167930.9226, "train_tokens_per_second": 5654.033 }, { "epoch": 1.462092647454888, "grad_norm": 0.7012919327076385, "learning_rate": 1.6815255609729047e-06, "loss": 0.3005738496780396, "num_input_tokens_seen": 949713336, "step": 21715, "train_runtime": 167966.4841, "train_tokens_per_second": 5654.184 }, { "epoch": 1.4624293024508483, "grad_norm": 0.8858327435153073, "learning_rate": 1.6795482426067012e-06, "loss": 0.30016207695007324, "num_input_tokens_seen": 949920736, "step": 21720, "train_runtime": 168001.7371, "train_tokens_per_second": 5654.232 }, { "epoch": 1.4627659574468086, "grad_norm": 0.8206508131279838, "learning_rate": 1.6775718527942403e-06, "loss": 0.2928857564926147, "num_input_tokens_seen": 950115240, "step": 21725, "train_runtime": 168039.1435, "train_tokens_per_second": 5654.13 }, { "epoch": 1.4631026124427686, "grad_norm": 0.8111515519361249, "learning_rate": 1.675596392088219e-06, "loss": 0.3051966667175293, "num_input_tokens_seen": 950343040, "step": 21730, "train_runtime": 168073.7856, "train_tokens_per_second": 5654.32 }, { "epoch": 1.4634392674387287, "grad_norm": 0.68703851940888, "learning_rate": 1.6736218610410633e-06, "loss": 0.28461332321166993, "num_input_tokens_seen": 950576064, "step": 21735, "train_runtime": 168112.6372, "train_tokens_per_second": 5654.4 }, { "epoch": 1.463775922434689, "grad_norm": 0.7370612171362331, "learning_rate": 1.6716482602049483e-06, "loss": 0.30020885467529296, "num_input_tokens_seen": 950795848, "step": 21740, "train_runtime": 168149.267, "train_tokens_per_second": 5654.475 }, { "epoch": 1.4641125774306492, "grad_norm": 0.8143604362673187, "learning_rate": 1.669675590131784e-06, "loss": 0.3058682203292847, "num_input_tokens_seen": 950999432, "step": 21745, "train_runtime": 168183.0542, "train_tokens_per_second": 5654.55 }, { "epoch": 1.4644492324266092, "grad_norm": 0.8042094006923218, "learning_rate": 1.6677038513732214e-06, "loss": 0.29998371601104734, "num_input_tokens_seen": 951224688, "step": 21750, "train_runtime": 168221.299, "train_tokens_per_second": 5654.603 }, { "epoch": 1.4647858874225694, "grad_norm": 0.7585438265622613, "learning_rate": 1.6657330444806508e-06, "loss": 0.3094784259796143, "num_input_tokens_seen": 951438456, "step": 21755, "train_runtime": 168256.7081, "train_tokens_per_second": 5654.684 }, { "epoch": 1.4651225424185295, "grad_norm": 0.7062718544616226, "learning_rate": 1.6637631700052021e-06, "loss": 0.29812400341033934, "num_input_tokens_seen": 951670352, "step": 21760, "train_runtime": 168294.5166, "train_tokens_per_second": 5654.791 }, { "epoch": 1.4654591974144897, "grad_norm": 0.7939195773072991, "learning_rate": 1.6617942284977428e-06, "loss": 0.2911461591720581, "num_input_tokens_seen": 951904024, "step": 21765, "train_runtime": 168329.8691, "train_tokens_per_second": 5654.992 }, { "epoch": 1.4657958524104497, "grad_norm": 0.8580033189722117, "learning_rate": 1.6598262205088862e-06, "loss": 0.3206942081451416, "num_input_tokens_seen": 952128864, "step": 21770, "train_runtime": 168367.7998, "train_tokens_per_second": 5655.053 }, { "epoch": 1.46613250740641, "grad_norm": 0.8326314241061893, "learning_rate": 1.6578591465889722e-06, "loss": 0.306864070892334, "num_input_tokens_seen": 952357128, "step": 21775, "train_runtime": 168407.1966, "train_tokens_per_second": 5655.086 }, { "epoch": 1.46646916240237, "grad_norm": 0.788622072145791, "learning_rate": 1.6558930072880942e-06, "loss": 0.3149855136871338, "num_input_tokens_seen": 952581712, "step": 21780, "train_runtime": 168443.31, "train_tokens_per_second": 5655.207 }, { "epoch": 1.4668058173983303, "grad_norm": 0.7690789166422503, "learning_rate": 1.6539278031560695e-06, "loss": 0.3216851234436035, "num_input_tokens_seen": 952795432, "step": 21785, "train_runtime": 168482.8899, "train_tokens_per_second": 5655.147 }, { "epoch": 1.4671424723942903, "grad_norm": 0.8893746538486333, "learning_rate": 1.6519635347424672e-06, "loss": 0.29906625747680665, "num_input_tokens_seen": 953010928, "step": 21790, "train_runtime": 168519.6074, "train_tokens_per_second": 5655.193 }, { "epoch": 1.4674791273902505, "grad_norm": 0.8072532370811785, "learning_rate": 1.650000202596586e-06, "loss": 0.3279500246047974, "num_input_tokens_seen": 953243200, "step": 21795, "train_runtime": 168562.3622, "train_tokens_per_second": 5655.137 }, { "epoch": 1.4678157823862106, "grad_norm": 0.7974849910062847, "learning_rate": 1.6480378072674659e-06, "loss": 0.3130605220794678, "num_input_tokens_seen": 953466792, "step": 21800, "train_runtime": 168598.3186, "train_tokens_per_second": 5655.257 }, { "epoch": 1.4681524373821708, "grad_norm": 0.7397056696771876, "learning_rate": 1.646076349303884e-06, "loss": 0.29395854473114014, "num_input_tokens_seen": 953688232, "step": 21805, "train_runtime": 168638.0597, "train_tokens_per_second": 5655.237 }, { "epoch": 1.4684890923781309, "grad_norm": 0.8246357078420278, "learning_rate": 1.6441158292543557e-06, "loss": 0.29840645790100095, "num_input_tokens_seen": 953899232, "step": 21810, "train_runtime": 168676.8656, "train_tokens_per_second": 5655.187 }, { "epoch": 1.468825747374091, "grad_norm": 0.6910590596780838, "learning_rate": 1.6421562476671339e-06, "loss": 0.325870156288147, "num_input_tokens_seen": 954116752, "step": 21815, "train_runtime": 168714.8794, "train_tokens_per_second": 5655.202 }, { "epoch": 1.4691624023700511, "grad_norm": 0.6572349294585963, "learning_rate": 1.640197605090213e-06, "loss": 0.27675824165344237, "num_input_tokens_seen": 954338024, "step": 21820, "train_runtime": 168751.1585, "train_tokens_per_second": 5655.298 }, { "epoch": 1.4694990573660114, "grad_norm": 0.7330863432474112, "learning_rate": 1.6382399020713146e-06, "loss": 0.29128522872924806, "num_input_tokens_seen": 954538472, "step": 21825, "train_runtime": 168789.4804, "train_tokens_per_second": 5655.201 }, { "epoch": 1.4698357123619714, "grad_norm": 0.8821884108200732, "learning_rate": 1.6362831391579115e-06, "loss": 0.2947737455368042, "num_input_tokens_seen": 954753480, "step": 21830, "train_runtime": 168828.8811, "train_tokens_per_second": 5655.155 }, { "epoch": 1.4701723673579317, "grad_norm": 0.7790169887599169, "learning_rate": 1.634327316897199e-06, "loss": 0.3025893926620483, "num_input_tokens_seen": 954963128, "step": 21835, "train_runtime": 168866.0318, "train_tokens_per_second": 5655.152 }, { "epoch": 1.4705090223538917, "grad_norm": 0.7612078391890548, "learning_rate": 1.6323724358361216e-06, "loss": 0.2903714656829834, "num_input_tokens_seen": 955171016, "step": 21840, "train_runtime": 168904.9902, "train_tokens_per_second": 5655.079 }, { "epoch": 1.470845677349852, "grad_norm": 0.740158711633362, "learning_rate": 1.6304184965213537e-06, "loss": 0.29531302452087405, "num_input_tokens_seen": 955381568, "step": 21845, "train_runtime": 168943.7731, "train_tokens_per_second": 5655.027 }, { "epoch": 1.471182332345812, "grad_norm": 0.7896656186315674, "learning_rate": 1.6284654994993088e-06, "loss": 0.30909888744354247, "num_input_tokens_seen": 955612384, "step": 21850, "train_runtime": 168982.4971, "train_tokens_per_second": 5655.097 }, { "epoch": 1.4715189873417722, "grad_norm": 0.6615277768870618, "learning_rate": 1.6265134453161358e-06, "loss": 0.29757180213928225, "num_input_tokens_seen": 955824680, "step": 21855, "train_runtime": 169021.4477, "train_tokens_per_second": 5655.05 }, { "epoch": 1.4718556423377323, "grad_norm": 0.8019048450650291, "learning_rate": 1.6245623345177203e-06, "loss": 0.3056344985961914, "num_input_tokens_seen": 956030528, "step": 21860, "train_runtime": 169060.2008, "train_tokens_per_second": 5654.971 }, { "epoch": 1.4721922973336925, "grad_norm": 0.6742658933683465, "learning_rate": 1.622612167649683e-06, "loss": 0.28513193130493164, "num_input_tokens_seen": 956238824, "step": 21865, "train_runtime": 169094.7819, "train_tokens_per_second": 5655.046 }, { "epoch": 1.4725289523296525, "grad_norm": 0.6663845283359301, "learning_rate": 1.6206629452573868e-06, "loss": 0.2704298496246338, "num_input_tokens_seen": 956461272, "step": 21870, "train_runtime": 169128.5661, "train_tokens_per_second": 5655.232 }, { "epoch": 1.4728656073256128, "grad_norm": 0.719412564793699, "learning_rate": 1.618714667885919e-06, "loss": 0.2946579933166504, "num_input_tokens_seen": 956679360, "step": 21875, "train_runtime": 169169.36, "train_tokens_per_second": 5655.157 }, { "epoch": 1.4732022623215728, "grad_norm": 0.7215311614958766, "learning_rate": 1.6167673360801151e-06, "loss": 0.29600162506103517, "num_input_tokens_seen": 956909072, "step": 21880, "train_runtime": 169211.1899, "train_tokens_per_second": 5655.117 }, { "epoch": 1.473538917317533, "grad_norm": 0.8145724755385428, "learning_rate": 1.6148209503845336e-06, "loss": 0.33778862953186034, "num_input_tokens_seen": 957127864, "step": 21885, "train_runtime": 169247.483, "train_tokens_per_second": 5655.197 }, { "epoch": 1.473875572313493, "grad_norm": 0.831154654556167, "learning_rate": 1.6128755113434808e-06, "loss": 0.2987597703933716, "num_input_tokens_seen": 957342536, "step": 21890, "train_runtime": 169286.3383, "train_tokens_per_second": 5655.167 }, { "epoch": 1.4742122273094533, "grad_norm": 0.6930146071437139, "learning_rate": 1.6109310195009908e-06, "loss": 0.303321099281311, "num_input_tokens_seen": 957573936, "step": 21895, "train_runtime": 169325.1989, "train_tokens_per_second": 5655.236 }, { "epoch": 1.4745488823054134, "grad_norm": 0.8269128549821896, "learning_rate": 1.6089874754008323e-06, "loss": 0.29223430156707764, "num_input_tokens_seen": 957779504, "step": 21900, "train_runtime": 169360.8254, "train_tokens_per_second": 5655.26 }, { "epoch": 1.4748855373013736, "grad_norm": 0.9691951191701637, "learning_rate": 1.6070448795865162e-06, "loss": 0.3116729974746704, "num_input_tokens_seen": 957995792, "step": 21905, "train_runtime": 169396.4164, "train_tokens_per_second": 5655.349 }, { "epoch": 1.4752221922973336, "grad_norm": 0.7309284982091603, "learning_rate": 1.605103232601277e-06, "loss": 0.29828710556030275, "num_input_tokens_seen": 958213080, "step": 21910, "train_runtime": 169439.4719, "train_tokens_per_second": 5655.194 }, { "epoch": 1.475558847293294, "grad_norm": 0.716113695585292, "learning_rate": 1.603162534988096e-06, "loss": 0.2677397966384888, "num_input_tokens_seen": 958431216, "step": 21915, "train_runtime": 169477.1448, "train_tokens_per_second": 5655.224 }, { "epoch": 1.475895502289254, "grad_norm": 0.6939181157623007, "learning_rate": 1.6012227872896791e-06, "loss": 0.28536086082458495, "num_input_tokens_seen": 958642264, "step": 21920, "train_runtime": 169510.665, "train_tokens_per_second": 5655.351 }, { "epoch": 1.4762321572852142, "grad_norm": 0.7628495263736654, "learning_rate": 1.599283990048472e-06, "loss": 0.2980980396270752, "num_input_tokens_seen": 958850528, "step": 21925, "train_runtime": 169545.9545, "train_tokens_per_second": 5655.402 }, { "epoch": 1.4765688122811742, "grad_norm": 0.7345760703144733, "learning_rate": 1.5973461438066533e-06, "loss": 0.2987915754318237, "num_input_tokens_seen": 959072368, "step": 21930, "train_runtime": 169591.6892, "train_tokens_per_second": 5655.185 }, { "epoch": 1.4769054672771345, "grad_norm": 0.7604661278462718, "learning_rate": 1.5954092491061351e-06, "loss": 0.28679566383361815, "num_input_tokens_seen": 959287640, "step": 21935, "train_runtime": 169633.6673, "train_tokens_per_second": 5655.055 }, { "epoch": 1.4772421222730945, "grad_norm": 0.6981553171592313, "learning_rate": 1.5934733064885637e-06, "loss": 0.30909249782562254, "num_input_tokens_seen": 959515464, "step": 21940, "train_runtime": 169674.7339, "train_tokens_per_second": 5655.029 }, { "epoch": 1.4775787772690547, "grad_norm": 0.7357160098109768, "learning_rate": 1.5915383164953203e-06, "loss": 0.3021413803100586, "num_input_tokens_seen": 959722168, "step": 21945, "train_runtime": 169712.7213, "train_tokens_per_second": 5654.981 }, { "epoch": 1.4779154322650148, "grad_norm": 0.8743355744735111, "learning_rate": 1.5896042796675155e-06, "loss": 0.2926707983016968, "num_input_tokens_seen": 959926384, "step": 21950, "train_runtime": 169749.0885, "train_tokens_per_second": 5654.972 }, { "epoch": 1.478252087260975, "grad_norm": 0.7663596131904904, "learning_rate": 1.5876711965460023e-06, "loss": 0.3000811576843262, "num_input_tokens_seen": 960147848, "step": 21955, "train_runtime": 169793.9752, "train_tokens_per_second": 5654.782 }, { "epoch": 1.478588742256935, "grad_norm": 0.7506605855075004, "learning_rate": 1.5857390676713546e-06, "loss": 0.3030038118362427, "num_input_tokens_seen": 960354248, "step": 21960, "train_runtime": 169826.7418, "train_tokens_per_second": 5654.906 }, { "epoch": 1.4789253972528953, "grad_norm": 0.6893712500395903, "learning_rate": 1.5838078935838913e-06, "loss": 0.2610928058624268, "num_input_tokens_seen": 960559904, "step": 21965, "train_runtime": 169865.4378, "train_tokens_per_second": 5654.828 }, { "epoch": 1.4792620522488553, "grad_norm": 0.7970970921801804, "learning_rate": 1.581877674823657e-06, "loss": 0.286395788192749, "num_input_tokens_seen": 960763880, "step": 21970, "train_runtime": 169904.7926, "train_tokens_per_second": 5654.719 }, { "epoch": 1.4795987072448156, "grad_norm": 0.7469532730634993, "learning_rate": 1.5799484119304308e-06, "loss": 0.3111164093017578, "num_input_tokens_seen": 960983256, "step": 21975, "train_runtime": 169948.1325, "train_tokens_per_second": 5654.568 }, { "epoch": 1.4799353622407756, "grad_norm": 0.7131812605057424, "learning_rate": 1.578020105443726e-06, "loss": 0.2867883205413818, "num_input_tokens_seen": 961204296, "step": 21980, "train_runtime": 169989.5356, "train_tokens_per_second": 5654.491 }, { "epoch": 1.4802720172367358, "grad_norm": 0.8560168052021411, "learning_rate": 1.576092755902787e-06, "loss": 0.3115290641784668, "num_input_tokens_seen": 961419104, "step": 21985, "train_runtime": 170025.6173, "train_tokens_per_second": 5654.554 }, { "epoch": 1.4806086722326959, "grad_norm": 0.7910019975942408, "learning_rate": 1.5741663638465903e-06, "loss": 0.32115159034729, "num_input_tokens_seen": 961624552, "step": 21990, "train_runtime": 170059.2178, "train_tokens_per_second": 5654.645 }, { "epoch": 1.4809453272286561, "grad_norm": 0.7740362774361383, "learning_rate": 1.5722409298138463e-06, "loss": 0.2831075668334961, "num_input_tokens_seen": 961828112, "step": 21995, "train_runtime": 170097.4303, "train_tokens_per_second": 5654.572 }, { "epoch": 1.4812819822246162, "grad_norm": 0.887435473761687, "learning_rate": 1.570316454342994e-06, "loss": 0.3216114044189453, "num_input_tokens_seen": 962043280, "step": 22000, "train_runtime": 170135.4044, "train_tokens_per_second": 5654.574 }, { "epoch": 1.4816186372205764, "grad_norm": 0.7331141791279817, "learning_rate": 1.568392937972212e-06, "loss": 0.30264816284179685, "num_input_tokens_seen": 962277624, "step": 22005, "train_runtime": 170177.2637, "train_tokens_per_second": 5654.56 }, { "epoch": 1.4819552922165364, "grad_norm": 0.7730593120342526, "learning_rate": 1.5664703812393988e-06, "loss": 0.30075869560241697, "num_input_tokens_seen": 962510352, "step": 22010, "train_runtime": 170215.2224, "train_tokens_per_second": 5654.667 }, { "epoch": 1.4822919472124967, "grad_norm": 0.7777724901976949, "learning_rate": 1.5645487846821967e-06, "loss": 0.2980914831161499, "num_input_tokens_seen": 962736264, "step": 22015, "train_runtime": 170256.3094, "train_tokens_per_second": 5654.629 }, { "epoch": 1.4826286022084567, "grad_norm": 0.7843674786251581, "learning_rate": 1.5626281488379724e-06, "loss": 0.30644855499267576, "num_input_tokens_seen": 962954856, "step": 22020, "train_runtime": 170290.947, "train_tokens_per_second": 5654.762 }, { "epoch": 1.482965257204417, "grad_norm": 0.7409514511968761, "learning_rate": 1.560708474243825e-06, "loss": 0.28392848968505857, "num_input_tokens_seen": 963172840, "step": 22025, "train_runtime": 170330.7319, "train_tokens_per_second": 5654.721 }, { "epoch": 1.483301912200377, "grad_norm": 0.8527324584193815, "learning_rate": 1.5587897614365854e-06, "loss": 0.3137376070022583, "num_input_tokens_seen": 963402704, "step": 22030, "train_runtime": 170363.8783, "train_tokens_per_second": 5654.97 }, { "epoch": 1.4836385671963372, "grad_norm": 0.817954831707004, "learning_rate": 1.5568720109528163e-06, "loss": 0.29897422790527345, "num_input_tokens_seen": 963622656, "step": 22035, "train_runtime": 170407.9186, "train_tokens_per_second": 5654.8 }, { "epoch": 1.4839752221922973, "grad_norm": 0.9090048918137543, "learning_rate": 1.5549552233288095e-06, "loss": 0.32768850326538085, "num_input_tokens_seen": 963839112, "step": 22040, "train_runtime": 170444.0634, "train_tokens_per_second": 5654.871 }, { "epoch": 1.4843118771882575, "grad_norm": 0.7108214887496512, "learning_rate": 1.5530393991005893e-06, "loss": 0.2966951370239258, "num_input_tokens_seen": 964056312, "step": 22045, "train_runtime": 170495.1004, "train_tokens_per_second": 5654.452 }, { "epoch": 1.4846485321842176, "grad_norm": 0.7628438783439455, "learning_rate": 1.551124538803908e-06, "loss": 0.3010308265686035, "num_input_tokens_seen": 964282488, "step": 22050, "train_runtime": 170534.3626, "train_tokens_per_second": 5654.476 }, { "epoch": 1.4849851871801778, "grad_norm": 0.766886301451967, "learning_rate": 1.5492106429742547e-06, "loss": 0.30379014015197753, "num_input_tokens_seen": 964505592, "step": 22055, "train_runtime": 170574.175, "train_tokens_per_second": 5654.464 }, { "epoch": 1.4853218421761378, "grad_norm": 0.8077546385043058, "learning_rate": 1.5472977121468386e-06, "loss": 0.3085505962371826, "num_input_tokens_seen": 964734320, "step": 22060, "train_runtime": 170605.4495, "train_tokens_per_second": 5654.768 }, { "epoch": 1.485658497172098, "grad_norm": 0.8224102700502363, "learning_rate": 1.545385746856609e-06, "loss": 0.2914187669754028, "num_input_tokens_seen": 964946888, "step": 22065, "train_runtime": 170641.0717, "train_tokens_per_second": 5654.834 }, { "epoch": 1.485995152168058, "grad_norm": 0.73340844909282, "learning_rate": 1.5434747476382388e-06, "loss": 0.2726666212081909, "num_input_tokens_seen": 965178856, "step": 22070, "train_runtime": 170676.1913, "train_tokens_per_second": 5655.029 }, { "epoch": 1.4863318071640184, "grad_norm": 0.8499683640218707, "learning_rate": 1.5415647150261337e-06, "loss": 0.2993777751922607, "num_input_tokens_seen": 965382264, "step": 22075, "train_runtime": 170714.8439, "train_tokens_per_second": 5654.94 }, { "epoch": 1.4866684621599784, "grad_norm": 0.8088856371624081, "learning_rate": 1.539655649554428e-06, "loss": 0.2940176010131836, "num_input_tokens_seen": 965597136, "step": 22080, "train_runtime": 170755.1927, "train_tokens_per_second": 5654.862 }, { "epoch": 1.4870051171559386, "grad_norm": 0.7548642358843536, "learning_rate": 1.5377475517569856e-06, "loss": 0.29267857074737547, "num_input_tokens_seen": 965803184, "step": 22085, "train_runtime": 170791.9589, "train_tokens_per_second": 5654.852 }, { "epoch": 1.4873417721518987, "grad_norm": 0.765784318943008, "learning_rate": 1.5358404221674e-06, "loss": 0.30087296962738036, "num_input_tokens_seen": 966009728, "step": 22090, "train_runtime": 170831.4433, "train_tokens_per_second": 5654.754 }, { "epoch": 1.487678427147859, "grad_norm": 0.7556445487670026, "learning_rate": 1.533934261318994e-06, "loss": 0.30022130012512205, "num_input_tokens_seen": 966233096, "step": 22095, "train_runtime": 170870.3846, "train_tokens_per_second": 5654.772 }, { "epoch": 1.488015082143819, "grad_norm": 0.7251976781164082, "learning_rate": 1.5320290697448177e-06, "loss": 0.2852438449859619, "num_input_tokens_seen": 966445288, "step": 22100, "train_runtime": 170911.1982, "train_tokens_per_second": 5654.663 }, { "epoch": 1.4883517371397792, "grad_norm": 0.859114292106197, "learning_rate": 1.530124847977657e-06, "loss": 0.320376992225647, "num_input_tokens_seen": 966659272, "step": 22105, "train_runtime": 170948.93, "train_tokens_per_second": 5654.667 }, { "epoch": 1.4886883921357392, "grad_norm": 0.7697511007972789, "learning_rate": 1.528221596550014e-06, "loss": 0.2888146638870239, "num_input_tokens_seen": 966874112, "step": 22110, "train_runtime": 170988.9473, "train_tokens_per_second": 5654.6 }, { "epoch": 1.4890250471316995, "grad_norm": 0.7792399302642892, "learning_rate": 1.5263193159941331e-06, "loss": 0.2921769618988037, "num_input_tokens_seen": 967092032, "step": 22115, "train_runtime": 171028.9685, "train_tokens_per_second": 5654.551 }, { "epoch": 1.4893617021276595, "grad_norm": 0.7804399534999346, "learning_rate": 1.5244180068419783e-06, "loss": 0.28116235733032224, "num_input_tokens_seen": 967308280, "step": 22120, "train_runtime": 171077.0397, "train_tokens_per_second": 5654.226 }, { "epoch": 1.4896983571236198, "grad_norm": 0.8657428518226007, "learning_rate": 1.5225176696252453e-06, "loss": 0.32404913902282717, "num_input_tokens_seen": 967517656, "step": 22125, "train_runtime": 171124.2522, "train_tokens_per_second": 5653.89 }, { "epoch": 1.4900350121195798, "grad_norm": 0.7792695604281658, "learning_rate": 1.5206183048753575e-06, "loss": 0.30272302627563474, "num_input_tokens_seen": 967731128, "step": 22130, "train_runtime": 171161.8669, "train_tokens_per_second": 5653.894 }, { "epoch": 1.49037166711554, "grad_norm": 0.8874127014480637, "learning_rate": 1.5187199131234653e-06, "loss": 0.34148373603820803, "num_input_tokens_seen": 967953912, "step": 22135, "train_runtime": 171197.9915, "train_tokens_per_second": 5654.003 }, { "epoch": 1.4907083221115, "grad_norm": 0.8158011732743956, "learning_rate": 1.5168224949004484e-06, "loss": 0.2946127653121948, "num_input_tokens_seen": 968163840, "step": 22140, "train_runtime": 171239.0138, "train_tokens_per_second": 5653.874 }, { "epoch": 1.4910449771074603, "grad_norm": 0.7094644713372431, "learning_rate": 1.514926050736914e-06, "loss": 0.2730919361114502, "num_input_tokens_seen": 968387800, "step": 22145, "train_runtime": 171288.0971, "train_tokens_per_second": 5653.562 }, { "epoch": 1.4913816321034203, "grad_norm": 0.7887316321901531, "learning_rate": 1.5130305811631945e-06, "loss": 0.3045715570449829, "num_input_tokens_seen": 968613216, "step": 22150, "train_runtime": 171326.4957, "train_tokens_per_second": 5653.61 }, { "epoch": 1.4917182870993806, "grad_norm": 0.8209012844760429, "learning_rate": 1.5111360867093571e-06, "loss": 0.3100686550140381, "num_input_tokens_seen": 968837880, "step": 22155, "train_runtime": 171360.4409, "train_tokens_per_second": 5653.801 }, { "epoch": 1.4920549420953406, "grad_norm": 0.7096360424168036, "learning_rate": 1.5092425679051848e-06, "loss": 0.2817687511444092, "num_input_tokens_seen": 969060560, "step": 22160, "train_runtime": 171394.8343, "train_tokens_per_second": 5653.966 }, { "epoch": 1.4923915970913009, "grad_norm": 0.74898568213781, "learning_rate": 1.5073500252801988e-06, "loss": 0.31572632789611815, "num_input_tokens_seen": 969287272, "step": 22165, "train_runtime": 171423.1343, "train_tokens_per_second": 5654.355 }, { "epoch": 1.492728252087261, "grad_norm": 0.7194688541867551, "learning_rate": 1.5054584593636412e-06, "loss": 0.2992145776748657, "num_input_tokens_seen": 969517872, "step": 22170, "train_runtime": 171459.1961, "train_tokens_per_second": 5654.511 }, { "epoch": 1.4930649070832211, "grad_norm": 0.8380897247829227, "learning_rate": 1.5035678706844814e-06, "loss": 0.3096607208251953, "num_input_tokens_seen": 969734072, "step": 22175, "train_runtime": 171496.6903, "train_tokens_per_second": 5654.535 }, { "epoch": 1.4934015620791812, "grad_norm": 0.719052290185219, "learning_rate": 1.501678259771418e-06, "loss": 0.311397123336792, "num_input_tokens_seen": 969956280, "step": 22180, "train_runtime": 171541.9334, "train_tokens_per_second": 5654.339 }, { "epoch": 1.4937382170751414, "grad_norm": 0.8005847376324827, "learning_rate": 1.499789627152874e-06, "loss": 0.3107875108718872, "num_input_tokens_seen": 970180640, "step": 22185, "train_runtime": 171584.1364, "train_tokens_per_second": 5654.256 }, { "epoch": 1.4940748720711015, "grad_norm": 0.7488870093377558, "learning_rate": 1.497901973356999e-06, "loss": 0.26401643753051757, "num_input_tokens_seen": 970405336, "step": 22190, "train_runtime": 171621.5048, "train_tokens_per_second": 5654.334 }, { "epoch": 1.4944115270670617, "grad_norm": 0.6586409758641915, "learning_rate": 1.4960152989116694e-06, "loss": 0.29029550552368166, "num_input_tokens_seen": 970628528, "step": 22195, "train_runtime": 171659.7512, "train_tokens_per_second": 5654.375 }, { "epoch": 1.4947481820630217, "grad_norm": 0.7846315012803541, "learning_rate": 1.4941296043444869e-06, "loss": 0.31101787090301514, "num_input_tokens_seen": 970833256, "step": 22200, "train_runtime": 171700.279, "train_tokens_per_second": 5654.232 }, { "epoch": 1.495084837058982, "grad_norm": 0.6807750672867574, "learning_rate": 1.4922448901827847e-06, "loss": 0.2868825912475586, "num_input_tokens_seen": 971056192, "step": 22205, "train_runtime": 171746.7294, "train_tokens_per_second": 5654.001 }, { "epoch": 1.495421492054942, "grad_norm": 0.9017046482285462, "learning_rate": 1.4903611569536103e-06, "loss": 0.27285065650939944, "num_input_tokens_seen": 971251664, "step": 22210, "train_runtime": 171784.3198, "train_tokens_per_second": 5653.902 }, { "epoch": 1.4957581470509023, "grad_norm": 0.7546903370960244, "learning_rate": 1.488478405183748e-06, "loss": 0.3076265096664429, "num_input_tokens_seen": 971461824, "step": 22215, "train_runtime": 171819.829, "train_tokens_per_second": 5653.956 }, { "epoch": 1.4960948020468623, "grad_norm": 0.7286152762441251, "learning_rate": 1.4865966353997024e-06, "loss": 0.2991771221160889, "num_input_tokens_seen": 971691984, "step": 22220, "train_runtime": 171853.9282, "train_tokens_per_second": 5654.174 }, { "epoch": 1.4964314570428225, "grad_norm": 0.6811343761957527, "learning_rate": 1.4847158481277047e-06, "loss": 0.27810006141662597, "num_input_tokens_seen": 971910752, "step": 22225, "train_runtime": 171892.8709, "train_tokens_per_second": 5654.166 }, { "epoch": 1.4967681120387826, "grad_norm": 0.8778824220267035, "learning_rate": 1.48283604389371e-06, "loss": 0.274126935005188, "num_input_tokens_seen": 972116168, "step": 22230, "train_runtime": 171929.1838, "train_tokens_per_second": 5654.166 }, { "epoch": 1.4971047670347428, "grad_norm": 0.6703777252052292, "learning_rate": 1.480957223223401e-06, "loss": 0.28500995635986326, "num_input_tokens_seen": 972336272, "step": 22235, "train_runtime": 171966.7609, "train_tokens_per_second": 5654.211 }, { "epoch": 1.497441422030703, "grad_norm": 0.8037319519905057, "learning_rate": 1.4790793866421826e-06, "loss": 0.32386600971221924, "num_input_tokens_seen": 972548536, "step": 22240, "train_runtime": 172003.2466, "train_tokens_per_second": 5654.245 }, { "epoch": 1.497778077026663, "grad_norm": 0.8609976203519863, "learning_rate": 1.4772025346751862e-06, "loss": 0.30510640144348145, "num_input_tokens_seen": 972767336, "step": 22245, "train_runtime": 172035.4661, "train_tokens_per_second": 5654.458 }, { "epoch": 1.4981147320226231, "grad_norm": 0.6833659788420334, "learning_rate": 1.475326667847266e-06, "loss": 0.3076331615447998, "num_input_tokens_seen": 972987240, "step": 22250, "train_runtime": 172073.245, "train_tokens_per_second": 5654.495 }, { "epoch": 1.4984513870185834, "grad_norm": 0.7212227153724603, "learning_rate": 1.4734517866830073e-06, "loss": 0.30481748580932616, "num_input_tokens_seen": 973215336, "step": 22255, "train_runtime": 172107.067, "train_tokens_per_second": 5654.709 }, { "epoch": 1.4987880420145436, "grad_norm": 0.7269815306579177, "learning_rate": 1.4715778917067081e-06, "loss": 0.303895378112793, "num_input_tokens_seen": 973425600, "step": 22260, "train_runtime": 172149.3633, "train_tokens_per_second": 5654.541 }, { "epoch": 1.4991246970105037, "grad_norm": 0.6350255641888927, "learning_rate": 1.4697049834424016e-06, "loss": 0.29153730869293215, "num_input_tokens_seen": 973643560, "step": 22265, "train_runtime": 172188.7254, "train_tokens_per_second": 5654.514 }, { "epoch": 1.4994613520064637, "grad_norm": 0.9326241952838099, "learning_rate": 1.4678330624138387e-06, "loss": 0.285983943939209, "num_input_tokens_seen": 973854824, "step": 22270, "train_runtime": 172221.8921, "train_tokens_per_second": 5654.652 }, { "epoch": 1.499798007002424, "grad_norm": 0.6824859115358656, "learning_rate": 1.465962129144497e-06, "loss": 0.2954267978668213, "num_input_tokens_seen": 974073608, "step": 22275, "train_runtime": 172256.0105, "train_tokens_per_second": 5654.802 }, { "epoch": 1.5001346619983842, "grad_norm": 0.8186629815319795, "learning_rate": 1.4640921841575766e-06, "loss": 0.32407686710357664, "num_input_tokens_seen": 974307744, "step": 22280, "train_runtime": 172292.4565, "train_tokens_per_second": 5654.965 }, { "epoch": 1.5004713169943442, "grad_norm": 0.6972447701320164, "learning_rate": 1.4622232279760018e-06, "loss": 0.29003033638000486, "num_input_tokens_seen": 974527448, "step": 22285, "train_runtime": 172326.5609, "train_tokens_per_second": 5655.12 }, { "epoch": 1.5008079719903042, "grad_norm": 0.8003233393761351, "learning_rate": 1.4603552611224202e-06, "loss": 0.3260036468505859, "num_input_tokens_seen": 974732192, "step": 22290, "train_runtime": 172364.9722, "train_tokens_per_second": 5655.048 }, { "epoch": 1.5011446269862645, "grad_norm": 0.7801634179627978, "learning_rate": 1.4584882841192027e-06, "loss": 0.3202426195144653, "num_input_tokens_seen": 974950184, "step": 22295, "train_runtime": 172402.4948, "train_tokens_per_second": 5655.082 }, { "epoch": 1.5014812819822247, "grad_norm": 0.7560222588514484, "learning_rate": 1.456622297488442e-06, "loss": 0.2875128030776978, "num_input_tokens_seen": 975160280, "step": 22300, "train_runtime": 172436.8178, "train_tokens_per_second": 5655.174 }, { "epoch": 1.5018179369781848, "grad_norm": 0.8392814865686347, "learning_rate": 1.4547573017519595e-06, "loss": 0.29420223236083987, "num_input_tokens_seen": 975368840, "step": 22305, "train_runtime": 172476.8287, "train_tokens_per_second": 5655.072 }, { "epoch": 1.5021545919741448, "grad_norm": 0.7889313036819893, "learning_rate": 1.4528932974312897e-06, "loss": 0.28504467010498047, "num_input_tokens_seen": 975600768, "step": 22310, "train_runtime": 172519.0021, "train_tokens_per_second": 5655.034 }, { "epoch": 1.502491246970105, "grad_norm": 0.8405102432636552, "learning_rate": 1.4510302850477005e-06, "loss": 0.29707143306732176, "num_input_tokens_seen": 975818888, "step": 22315, "train_runtime": 172557.3322, "train_tokens_per_second": 5655.042 }, { "epoch": 1.5028279019660653, "grad_norm": 0.7839583808405233, "learning_rate": 1.4491682651221746e-06, "loss": 0.289170503616333, "num_input_tokens_seen": 976024992, "step": 22320, "train_runtime": 172593.7247, "train_tokens_per_second": 5655.043 }, { "epoch": 1.5031645569620253, "grad_norm": 0.7899317516379861, "learning_rate": 1.447307238175421e-06, "loss": 0.298907732963562, "num_input_tokens_seen": 976231792, "step": 22325, "train_runtime": 172634.9012, "train_tokens_per_second": 5654.892 }, { "epoch": 1.5035012119579854, "grad_norm": 0.7367720389125396, "learning_rate": 1.4454472047278688e-06, "loss": 0.29713735580444334, "num_input_tokens_seen": 976442768, "step": 22330, "train_runtime": 172676.2447, "train_tokens_per_second": 5654.76 }, { "epoch": 1.5038378669539456, "grad_norm": 0.7850128485368816, "learning_rate": 1.443588165299672e-06, "loss": 0.2721333265304565, "num_input_tokens_seen": 976670000, "step": 22335, "train_runtime": 172721.7292, "train_tokens_per_second": 5654.587 }, { "epoch": 1.5041745219499059, "grad_norm": 0.7958028090619667, "learning_rate": 1.4417301204107037e-06, "loss": 0.31305713653564454, "num_input_tokens_seen": 976892192, "step": 22340, "train_runtime": 172757.5302, "train_tokens_per_second": 5654.701 }, { "epoch": 1.504511176945866, "grad_norm": 0.7865067258558222, "learning_rate": 1.4398730705805607e-06, "loss": 0.3005058288574219, "num_input_tokens_seen": 977116432, "step": 22345, "train_runtime": 172795.4681, "train_tokens_per_second": 5654.757 }, { "epoch": 1.504847831941826, "grad_norm": 0.6971438552549611, "learning_rate": 1.43801701632856e-06, "loss": 0.3000321388244629, "num_input_tokens_seen": 977343248, "step": 22350, "train_runtime": 172831.4992, "train_tokens_per_second": 5654.891 }, { "epoch": 1.5051844869377862, "grad_norm": 0.7852554320922348, "learning_rate": 1.436161958173745e-06, "loss": 0.32420189380645753, "num_input_tokens_seen": 977567152, "step": 22355, "train_runtime": 172868.2683, "train_tokens_per_second": 5654.983 }, { "epoch": 1.5055211419337464, "grad_norm": 0.7387859896989003, "learning_rate": 1.4343078966348718e-06, "loss": 0.3067188262939453, "num_input_tokens_seen": 977777560, "step": 22360, "train_runtime": 172910.0558, "train_tokens_per_second": 5654.833 }, { "epoch": 1.5058577969297064, "grad_norm": 0.7529457682896904, "learning_rate": 1.432454832230426e-06, "loss": 0.28587291240692136, "num_input_tokens_seen": 978009320, "step": 22365, "train_runtime": 172953.4465, "train_tokens_per_second": 5654.755 }, { "epoch": 1.5061944519256665, "grad_norm": 0.6792382751676833, "learning_rate": 1.4306027654786103e-06, "loss": 0.28476083278656006, "num_input_tokens_seen": 978236352, "step": 22370, "train_runtime": 172991.2837, "train_tokens_per_second": 5654.83 }, { "epoch": 1.5065311069216267, "grad_norm": 0.7207520305966407, "learning_rate": 1.4287516968973491e-06, "loss": 0.3085874080657959, "num_input_tokens_seen": 978453896, "step": 22375, "train_runtime": 173028.6858, "train_tokens_per_second": 5654.865 }, { "epoch": 1.506867761917587, "grad_norm": 0.816106376696343, "learning_rate": 1.4269016270042884e-06, "loss": 0.3164313077926636, "num_input_tokens_seen": 978673624, "step": 22380, "train_runtime": 173069.187, "train_tokens_per_second": 5654.811 }, { "epoch": 1.507204416913547, "grad_norm": 0.7895982117278676, "learning_rate": 1.425052556316794e-06, "loss": 0.2872413873672485, "num_input_tokens_seen": 978891952, "step": 22385, "train_runtime": 173110.0103, "train_tokens_per_second": 5654.739 }, { "epoch": 1.507541071909507, "grad_norm": 0.9301659133996552, "learning_rate": 1.4232044853519522e-06, "loss": 0.3223658323287964, "num_input_tokens_seen": 979097208, "step": 22390, "train_runtime": 173149.0058, "train_tokens_per_second": 5654.651 }, { "epoch": 1.5078777269054673, "grad_norm": 0.6813929579263441, "learning_rate": 1.4213574146265708e-06, "loss": 0.28975491523742675, "num_input_tokens_seen": 979304416, "step": 22395, "train_runtime": 173184.2372, "train_tokens_per_second": 5654.697 }, { "epoch": 1.5082143819014275, "grad_norm": 0.7646303429188873, "learning_rate": 1.4195113446571752e-06, "loss": 0.32438082695007325, "num_input_tokens_seen": 979527856, "step": 22400, "train_runtime": 173219.7965, "train_tokens_per_second": 5654.826 }, { "epoch": 1.5085510368973876, "grad_norm": 0.7391053441959036, "learning_rate": 1.417666275960018e-06, "loss": 0.2848972797393799, "num_input_tokens_seen": 979761880, "step": 22405, "train_runtime": 173250.7995, "train_tokens_per_second": 5655.165 }, { "epoch": 1.5088876918933476, "grad_norm": 0.6903765320662747, "learning_rate": 1.4158222090510605e-06, "loss": 0.27116708755493163, "num_input_tokens_seen": 979990616, "step": 22410, "train_runtime": 173289.5475, "train_tokens_per_second": 5655.221 }, { "epoch": 1.5092243468893078, "grad_norm": 0.7236456392467262, "learning_rate": 1.4139791444459945e-06, "loss": 0.3101805686950684, "num_input_tokens_seen": 980209928, "step": 22415, "train_runtime": 173323.1137, "train_tokens_per_second": 5655.391 }, { "epoch": 1.509561001885268, "grad_norm": 0.8526682680286438, "learning_rate": 1.4121370826602254e-06, "loss": 0.3069303512573242, "num_input_tokens_seen": 980417304, "step": 22420, "train_runtime": 173363.0188, "train_tokens_per_second": 5655.285 }, { "epoch": 1.5098976568812281, "grad_norm": 0.7042288015488988, "learning_rate": 1.4102960242088803e-06, "loss": 0.3054825782775879, "num_input_tokens_seen": 980633968, "step": 22425, "train_runtime": 173407.4082, "train_tokens_per_second": 5655.087 }, { "epoch": 1.5102343118771882, "grad_norm": 0.7504743822892517, "learning_rate": 1.4084559696068057e-06, "loss": 0.28913288116455077, "num_input_tokens_seen": 980850136, "step": 22430, "train_runtime": 173445.4607, "train_tokens_per_second": 5655.093 }, { "epoch": 1.5105709668731484, "grad_norm": 0.7252926106988145, "learning_rate": 1.406616919368567e-06, "loss": 0.2985984325408936, "num_input_tokens_seen": 981066808, "step": 22435, "train_runtime": 173488.0196, "train_tokens_per_second": 5654.954 }, { "epoch": 1.5109076218691087, "grad_norm": 0.801327813808047, "learning_rate": 1.4047788740084474e-06, "loss": 0.29711313247680665, "num_input_tokens_seen": 981290632, "step": 22440, "train_runtime": 173530.0228, "train_tokens_per_second": 5654.875 }, { "epoch": 1.5112442768650687, "grad_norm": 0.6984253644671601, "learning_rate": 1.402941834040452e-06, "loss": 0.2857701539993286, "num_input_tokens_seen": 981524520, "step": 22445, "train_runtime": 173571.2058, "train_tokens_per_second": 5654.881 }, { "epoch": 1.5115809318610287, "grad_norm": 0.7193805868113159, "learning_rate": 1.4011057999783006e-06, "loss": 0.28029732704162597, "num_input_tokens_seen": 981733352, "step": 22450, "train_runtime": 173613.2142, "train_tokens_per_second": 5654.716 }, { "epoch": 1.511917586856989, "grad_norm": 0.7608894196010775, "learning_rate": 1.3992707723354398e-06, "loss": 0.3050365924835205, "num_input_tokens_seen": 981955216, "step": 22455, "train_runtime": 173651.5688, "train_tokens_per_second": 5654.744 }, { "epoch": 1.5122542418529492, "grad_norm": 0.7183358803573994, "learning_rate": 1.397436751625022e-06, "loss": 0.2846760988235474, "num_input_tokens_seen": 982166184, "step": 22460, "train_runtime": 173692.0688, "train_tokens_per_second": 5654.64 }, { "epoch": 1.5125908968489092, "grad_norm": 0.8684762367144154, "learning_rate": 1.3956037383599308e-06, "loss": 0.2913294792175293, "num_input_tokens_seen": 982385952, "step": 22465, "train_runtime": 173731.1563, "train_tokens_per_second": 5654.633 }, { "epoch": 1.5129275518448693, "grad_norm": 0.7292786314768155, "learning_rate": 1.39377173305276e-06, "loss": 0.27708570957183837, "num_input_tokens_seen": 982592624, "step": 22470, "train_runtime": 173769.1128, "train_tokens_per_second": 5654.587 }, { "epoch": 1.5132642068408295, "grad_norm": 0.7362638583219614, "learning_rate": 1.3919407362158254e-06, "loss": 0.3209893465042114, "num_input_tokens_seen": 982825112, "step": 22475, "train_runtime": 173806.2328, "train_tokens_per_second": 5654.717 }, { "epoch": 1.5136008618367898, "grad_norm": 0.8685451291862974, "learning_rate": 1.3901107483611582e-06, "loss": 0.2871732711791992, "num_input_tokens_seen": 983031648, "step": 22480, "train_runtime": 173844.6509, "train_tokens_per_second": 5654.656 }, { "epoch": 1.5139375168327498, "grad_norm": 0.7432181034545295, "learning_rate": 1.3882817700005091e-06, "loss": 0.2984759330749512, "num_input_tokens_seen": 983247128, "step": 22485, "train_runtime": 173892.4519, "train_tokens_per_second": 5654.34 }, { "epoch": 1.5142741718287098, "grad_norm": 0.7851212386445382, "learning_rate": 1.3864538016453466e-06, "loss": 0.3003609418869019, "num_input_tokens_seen": 983445264, "step": 22490, "train_runtime": 173929.1801, "train_tokens_per_second": 5654.286 }, { "epoch": 1.51461082682467, "grad_norm": 0.929685801907135, "learning_rate": 1.384626843806855e-06, "loss": 0.304855489730835, "num_input_tokens_seen": 983646472, "step": 22495, "train_runtime": 173969.1302, "train_tokens_per_second": 5654.144 }, { "epoch": 1.5149474818206303, "grad_norm": 0.7557647415601482, "learning_rate": 1.3828008969959367e-06, "loss": 0.31099758148193357, "num_input_tokens_seen": 983875960, "step": 22500, "train_runtime": 174009.2793, "train_tokens_per_second": 5654.158 }, { "epoch": 1.5152841368165904, "grad_norm": 0.850008061053931, "learning_rate": 1.3809759617232166e-06, "loss": 0.2885129928588867, "num_input_tokens_seen": 984089952, "step": 22505, "train_runtime": 174050.4492, "train_tokens_per_second": 5654.05 }, { "epoch": 1.5156207918125504, "grad_norm": 0.7124328658676645, "learning_rate": 1.3791520384990247e-06, "loss": 0.29050498008728026, "num_input_tokens_seen": 984303984, "step": 22510, "train_runtime": 174085.4118, "train_tokens_per_second": 5654.144 }, { "epoch": 1.5159574468085106, "grad_norm": 0.6783534298885123, "learning_rate": 1.3773291278334216e-06, "loss": 0.2980940818786621, "num_input_tokens_seen": 984518832, "step": 22515, "train_runtime": 174122.6841, "train_tokens_per_second": 5654.168 }, { "epoch": 1.5162941018044709, "grad_norm": 0.772415132712806, "learning_rate": 1.3755072302361754e-06, "loss": 0.3086568355560303, "num_input_tokens_seen": 984751312, "step": 22520, "train_runtime": 174163.3837, "train_tokens_per_second": 5654.181 }, { "epoch": 1.516630756800431, "grad_norm": 0.7777502241934342, "learning_rate": 1.3736863462167749e-06, "loss": 0.28640379905700686, "num_input_tokens_seen": 984953136, "step": 22525, "train_runtime": 174203.7264, "train_tokens_per_second": 5654.03 }, { "epoch": 1.516967411796391, "grad_norm": 0.7811964811897554, "learning_rate": 1.3718664762844242e-06, "loss": 0.28820300102233887, "num_input_tokens_seen": 985162064, "step": 22530, "train_runtime": 174238.0664, "train_tokens_per_second": 5654.115 }, { "epoch": 1.5173040667923512, "grad_norm": 0.7667814818121892, "learning_rate": 1.370047620948044e-06, "loss": 0.2942743062973022, "num_input_tokens_seen": 985382480, "step": 22535, "train_runtime": 174279.1667, "train_tokens_per_second": 5654.046 }, { "epoch": 1.5176407217883114, "grad_norm": 0.7745949128302583, "learning_rate": 1.368229780716272e-06, "loss": 0.3100618839263916, "num_input_tokens_seen": 985602688, "step": 22540, "train_runtime": 174310.4991, "train_tokens_per_second": 5654.293 }, { "epoch": 1.5179773767842715, "grad_norm": 0.8932217604026287, "learning_rate": 1.3664129560974604e-06, "loss": 0.2899731397628784, "num_input_tokens_seen": 985820032, "step": 22545, "train_runtime": 174346.7623, "train_tokens_per_second": 5654.364 }, { "epoch": 1.5183140317802315, "grad_norm": 0.7820206063355695, "learning_rate": 1.3645971475996777e-06, "loss": 0.29310288429260256, "num_input_tokens_seen": 986025552, "step": 22550, "train_runtime": 174382.5794, "train_tokens_per_second": 5654.381 }, { "epoch": 1.5186506867761917, "grad_norm": 0.8104637399237582, "learning_rate": 1.3627823557307135e-06, "loss": 0.29608545303344724, "num_input_tokens_seen": 986257600, "step": 22555, "train_runtime": 174424.2399, "train_tokens_per_second": 5654.361 }, { "epoch": 1.518987341772152, "grad_norm": 0.7046023346650935, "learning_rate": 1.3609685809980616e-06, "loss": 0.3058366298675537, "num_input_tokens_seen": 986486440, "step": 22560, "train_runtime": 174466.7289, "train_tokens_per_second": 5654.295 }, { "epoch": 1.519323996768112, "grad_norm": 0.7418847854253624, "learning_rate": 1.3591558239089443e-06, "loss": 0.2807319164276123, "num_input_tokens_seen": 986707576, "step": 22565, "train_runtime": 174512.4598, "train_tokens_per_second": 5654.081 }, { "epoch": 1.519660651764072, "grad_norm": 0.8450682344923751, "learning_rate": 1.3573440849702902e-06, "loss": 0.317004919052124, "num_input_tokens_seen": 986937912, "step": 22570, "train_runtime": 174554.2288, "train_tokens_per_second": 5654.048 }, { "epoch": 1.5199973067600323, "grad_norm": 0.7386948536050674, "learning_rate": 1.3555333646887476e-06, "loss": 0.3014618635177612, "num_input_tokens_seen": 987163824, "step": 22575, "train_runtime": 174589.7315, "train_tokens_per_second": 5654.192 }, { "epoch": 1.5203339617559926, "grad_norm": 0.7377369303219051, "learning_rate": 1.3537236635706779e-06, "loss": 0.29477739334106445, "num_input_tokens_seen": 987396616, "step": 22580, "train_runtime": 174623.2763, "train_tokens_per_second": 5654.439 }, { "epoch": 1.5206706167519526, "grad_norm": 0.8578989985964252, "learning_rate": 1.351914982122159e-06, "loss": 0.27982220649719236, "num_input_tokens_seen": 987623048, "step": 22585, "train_runtime": 174659.6001, "train_tokens_per_second": 5654.559 }, { "epoch": 1.5210072717479126, "grad_norm": 0.7750049777273713, "learning_rate": 1.3501073208489823e-06, "loss": 0.3012231349945068, "num_input_tokens_seen": 987842064, "step": 22590, "train_runtime": 174696.8944, "train_tokens_per_second": 5654.606 }, { "epoch": 1.5213439267438729, "grad_norm": 0.7792774723783644, "learning_rate": 1.3483006802566546e-06, "loss": 0.29522716999053955, "num_input_tokens_seen": 988065680, "step": 22595, "train_runtime": 174733.3309, "train_tokens_per_second": 5654.706 }, { "epoch": 1.5216805817398331, "grad_norm": 0.8105588967824191, "learning_rate": 1.3464950608503957e-06, "loss": 0.3093279838562012, "num_input_tokens_seen": 988279680, "step": 22600, "train_runtime": 174772.1153, "train_tokens_per_second": 5654.676 }, { "epoch": 1.5220172367357931, "grad_norm": 0.8485409938047664, "learning_rate": 1.344690463135146e-06, "loss": 0.30634384155273436, "num_input_tokens_seen": 988495592, "step": 22605, "train_runtime": 174817.3086, "train_tokens_per_second": 5654.449 }, { "epoch": 1.5223538917317532, "grad_norm": 0.7715064487874997, "learning_rate": 1.3428868876155493e-06, "loss": 0.3291673183441162, "num_input_tokens_seen": 988698000, "step": 22610, "train_runtime": 174853.7041, "train_tokens_per_second": 5654.43 }, { "epoch": 1.5226905467277134, "grad_norm": 0.6665959654227848, "learning_rate": 1.3410843347959745e-06, "loss": 0.2833380699157715, "num_input_tokens_seen": 988914088, "step": 22615, "train_runtime": 174891.5132, "train_tokens_per_second": 5654.443 }, { "epoch": 1.5230272017236737, "grad_norm": 0.7178804958210366, "learning_rate": 1.3392828051804979e-06, "loss": 0.3043062686920166, "num_input_tokens_seen": 989141848, "step": 22620, "train_runtime": 174934.5815, "train_tokens_per_second": 5654.353 }, { "epoch": 1.5233638567196337, "grad_norm": 0.7316276122750418, "learning_rate": 1.3374822992729114e-06, "loss": 0.3176832437515259, "num_input_tokens_seen": 989359560, "step": 22625, "train_runtime": 174977.0909, "train_tokens_per_second": 5654.223 }, { "epoch": 1.5237005117155937, "grad_norm": 0.8151737151768202, "learning_rate": 1.3356828175767212e-06, "loss": 0.30327634811401366, "num_input_tokens_seen": 989566784, "step": 22630, "train_runtime": 175016.0102, "train_tokens_per_second": 5654.15 }, { "epoch": 1.524037166711554, "grad_norm": 0.7458938184161533, "learning_rate": 1.3338843605951462e-06, "loss": 0.27550592422485354, "num_input_tokens_seen": 989793688, "step": 22635, "train_runtime": 175058.1324, "train_tokens_per_second": 5654.086 }, { "epoch": 1.5243738217075142, "grad_norm": 0.7254475228515918, "learning_rate": 1.33208692883112e-06, "loss": 0.2927609205245972, "num_input_tokens_seen": 990030416, "step": 22640, "train_runtime": 175099.372, "train_tokens_per_second": 5654.106 }, { "epoch": 1.5247104767034743, "grad_norm": 0.6451473463172038, "learning_rate": 1.3302905227872876e-06, "loss": 0.2735952377319336, "num_input_tokens_seen": 990266880, "step": 22645, "train_runtime": 175138.0414, "train_tokens_per_second": 5654.208 }, { "epoch": 1.5250471316994343, "grad_norm": 0.7523183374053246, "learning_rate": 1.328495142966007e-06, "loss": 0.3053655862808228, "num_input_tokens_seen": 990479584, "step": 22650, "train_runtime": 175176.6743, "train_tokens_per_second": 5654.175 }, { "epoch": 1.5253837866953945, "grad_norm": 0.7119868993623765, "learning_rate": 1.3267007898693552e-06, "loss": 0.29980125427246096, "num_input_tokens_seen": 990712176, "step": 22655, "train_runtime": 175223.5228, "train_tokens_per_second": 5653.991 }, { "epoch": 1.5257204416913548, "grad_norm": 0.7695418964162357, "learning_rate": 1.324907463999111e-06, "loss": 0.3055927276611328, "num_input_tokens_seen": 990938448, "step": 22660, "train_runtime": 175261.0683, "train_tokens_per_second": 5654.071 }, { "epoch": 1.5260570966873148, "grad_norm": 0.750866798684191, "learning_rate": 1.3231151658567776e-06, "loss": 0.3090615510940552, "num_input_tokens_seen": 991152664, "step": 22665, "train_runtime": 175294.7905, "train_tokens_per_second": 5654.205 }, { "epoch": 1.5263937516832748, "grad_norm": 0.7700423401788759, "learning_rate": 1.321323895943563e-06, "loss": 0.3019981861114502, "num_input_tokens_seen": 991370424, "step": 22670, "train_runtime": 175335.3762, "train_tokens_per_second": 5654.138 }, { "epoch": 1.526730406679235, "grad_norm": 0.6944631282349509, "learning_rate": 1.3195336547603905e-06, "loss": 0.31381664276123045, "num_input_tokens_seen": 991588192, "step": 22675, "train_runtime": 175378.1626, "train_tokens_per_second": 5654.0 }, { "epoch": 1.5270670616751953, "grad_norm": 0.711842537575573, "learning_rate": 1.3177444428078951e-06, "loss": 0.28606882095336916, "num_input_tokens_seen": 991798856, "step": 22680, "train_runtime": 175413.7546, "train_tokens_per_second": 5654.054 }, { "epoch": 1.5274037166711554, "grad_norm": 0.815411302830813, "learning_rate": 1.3159562605864245e-06, "loss": 0.30185737609863283, "num_input_tokens_seen": 992026624, "step": 22685, "train_runtime": 175457.606, "train_tokens_per_second": 5653.939 }, { "epoch": 1.5277403716671154, "grad_norm": 0.7981498875678553, "learning_rate": 1.3141691085960385e-06, "loss": 0.29338903427124025, "num_input_tokens_seen": 992265864, "step": 22690, "train_runtime": 175496.9155, "train_tokens_per_second": 5654.036 }, { "epoch": 1.5280770266630757, "grad_norm": 0.7568915202824599, "learning_rate": 1.3123829873365073e-06, "loss": 0.2825155258178711, "num_input_tokens_seen": 992478536, "step": 22695, "train_runtime": 175535.4671, "train_tokens_per_second": 5654.006 }, { "epoch": 1.528413681659036, "grad_norm": 0.7962079639131174, "learning_rate": 1.3105978973073136e-06, "loss": 0.2889784097671509, "num_input_tokens_seen": 992692016, "step": 22700, "train_runtime": 175577.4777, "train_tokens_per_second": 5653.869 }, { "epoch": 1.528750336654996, "grad_norm": 0.7986814122905842, "learning_rate": 1.3088138390076565e-06, "loss": 0.3144156694412231, "num_input_tokens_seen": 992915000, "step": 22705, "train_runtime": 175610.667, "train_tokens_per_second": 5654.07 }, { "epoch": 1.529086991650956, "grad_norm": 0.784101134617306, "learning_rate": 1.3070308129364357e-06, "loss": 0.28853483200073243, "num_input_tokens_seen": 993131448, "step": 22710, "train_runtime": 175653.2502, "train_tokens_per_second": 5653.932 }, { "epoch": 1.5294236466469162, "grad_norm": 0.8613062066807416, "learning_rate": 1.3052488195922736e-06, "loss": 0.28805036544799806, "num_input_tokens_seen": 993337608, "step": 22715, "train_runtime": 175693.4521, "train_tokens_per_second": 5653.811 }, { "epoch": 1.5297603016428765, "grad_norm": 0.7554420455835269, "learning_rate": 1.3034678594734972e-06, "loss": 0.2852388620376587, "num_input_tokens_seen": 993560896, "step": 22720, "train_runtime": 175731.737, "train_tokens_per_second": 5653.85 }, { "epoch": 1.5300969566388365, "grad_norm": 0.8715494762310279, "learning_rate": 1.3016879330781468e-06, "loss": 0.30547394752502444, "num_input_tokens_seen": 993766904, "step": 22725, "train_runtime": 175768.7081, "train_tokens_per_second": 5653.833 }, { "epoch": 1.5304336116347965, "grad_norm": 0.7476831667764691, "learning_rate": 1.2999090409039728e-06, "loss": 0.29537832736968994, "num_input_tokens_seen": 993988440, "step": 22730, "train_runtime": 175806.2319, "train_tokens_per_second": 5653.886 }, { "epoch": 1.5307702666307568, "grad_norm": 0.7728242495534967, "learning_rate": 1.2981311834484367e-06, "loss": 0.30858845710754396, "num_input_tokens_seen": 994207440, "step": 22735, "train_runtime": 175851.9938, "train_tokens_per_second": 5653.66 }, { "epoch": 1.531106921626717, "grad_norm": 0.7739386600524095, "learning_rate": 1.296354361208711e-06, "loss": 0.28605356216430666, "num_input_tokens_seen": 994421664, "step": 22740, "train_runtime": 175891.4348, "train_tokens_per_second": 5653.611 }, { "epoch": 1.531443576622677, "grad_norm": 0.8012741513918233, "learning_rate": 1.294578574681678e-06, "loss": 0.3216970920562744, "num_input_tokens_seen": 994629248, "step": 22745, "train_runtime": 175928.8973, "train_tokens_per_second": 5653.587 }, { "epoch": 1.531780231618637, "grad_norm": 0.7817355354702294, "learning_rate": 1.292803824363929e-06, "loss": 0.28469209671020507, "num_input_tokens_seen": 994850920, "step": 22750, "train_runtime": 175967.4254, "train_tokens_per_second": 5653.608 }, { "epoch": 1.5321168866145973, "grad_norm": 0.767294892049272, "learning_rate": 1.2910301107517726e-06, "loss": 0.3232132434844971, "num_input_tokens_seen": 995074552, "step": 22755, "train_runtime": 176008.5181, "train_tokens_per_second": 5653.559 }, { "epoch": 1.5324535416105576, "grad_norm": 0.8124734532106183, "learning_rate": 1.2892574343412156e-06, "loss": 0.319903826713562, "num_input_tokens_seen": 995294736, "step": 22760, "train_runtime": 176043.0639, "train_tokens_per_second": 5653.7 }, { "epoch": 1.5327901966065176, "grad_norm": 0.7450430227623678, "learning_rate": 1.2874857956279858e-06, "loss": 0.3038845777511597, "num_input_tokens_seen": 995505008, "step": 22765, "train_runtime": 176081.1467, "train_tokens_per_second": 5653.672 }, { "epoch": 1.5331268516024776, "grad_norm": 0.7872978056072006, "learning_rate": 1.2857151951075147e-06, "loss": 0.3022770404815674, "num_input_tokens_seen": 995729520, "step": 22770, "train_runtime": 176120.5406, "train_tokens_per_second": 5653.682 }, { "epoch": 1.5334635065984379, "grad_norm": 0.7298470919630958, "learning_rate": 1.2839456332749456e-06, "loss": 0.2998102903366089, "num_input_tokens_seen": 995943808, "step": 22775, "train_runtime": 176158.1432, "train_tokens_per_second": 5653.692 }, { "epoch": 1.5338001615943981, "grad_norm": 0.8031049157762769, "learning_rate": 1.2821771106251308e-06, "loss": 0.2987299919128418, "num_input_tokens_seen": 996160472, "step": 22780, "train_runtime": 176194.5973, "train_tokens_per_second": 5653.752 }, { "epoch": 1.5341368165903582, "grad_norm": 0.7596275846497683, "learning_rate": 1.2804096276526312e-06, "loss": 0.27775073051452637, "num_input_tokens_seen": 996378168, "step": 22785, "train_runtime": 176231.0577, "train_tokens_per_second": 5653.817 }, { "epoch": 1.5344734715863182, "grad_norm": 0.8239381536070142, "learning_rate": 1.2786431848517184e-06, "loss": 0.2855050086975098, "num_input_tokens_seen": 996584112, "step": 22790, "train_runtime": 176267.1349, "train_tokens_per_second": 5653.828 }, { "epoch": 1.5348101265822784, "grad_norm": 0.7589447815362402, "learning_rate": 1.2768777827163725e-06, "loss": 0.29274682998657225, "num_input_tokens_seen": 996797912, "step": 22795, "train_runtime": 176305.2925, "train_tokens_per_second": 5653.817 }, { "epoch": 1.5351467815782387, "grad_norm": 0.8140404323951491, "learning_rate": 1.2751134217402811e-06, "loss": 0.29671099185943606, "num_input_tokens_seen": 997003488, "step": 22800, "train_runtime": 176347.2741, "train_tokens_per_second": 5653.637 }, { "epoch": 1.5354834365741987, "grad_norm": 0.7258016591513569, "learning_rate": 1.2733501024168465e-06, "loss": 0.2848902940750122, "num_input_tokens_seen": 997225312, "step": 22805, "train_runtime": 176381.4588, "train_tokens_per_second": 5653.799 }, { "epoch": 1.5358200915701588, "grad_norm": 0.8298549659043899, "learning_rate": 1.2715878252391695e-06, "loss": 0.30264275074005126, "num_input_tokens_seen": 997430736, "step": 22810, "train_runtime": 176421.3628, "train_tokens_per_second": 5653.685 }, { "epoch": 1.536156746566119, "grad_norm": 0.7905575392804943, "learning_rate": 1.269826590700069e-06, "loss": 0.3026357412338257, "num_input_tokens_seen": 997650400, "step": 22815, "train_runtime": 176454.177, "train_tokens_per_second": 5653.878 }, { "epoch": 1.5364934015620793, "grad_norm": 0.7167147078330245, "learning_rate": 1.2680663992920684e-06, "loss": 0.2799959659576416, "num_input_tokens_seen": 997872240, "step": 22820, "train_runtime": 176495.7097, "train_tokens_per_second": 5653.805 }, { "epoch": 1.5368300565580393, "grad_norm": 0.8394660285508826, "learning_rate": 1.2663072515073988e-06, "loss": 0.30673794746398925, "num_input_tokens_seen": 998084992, "step": 22825, "train_runtime": 176535.1094, "train_tokens_per_second": 5653.748 }, { "epoch": 1.5371667115539993, "grad_norm": 0.819012798672818, "learning_rate": 1.2645491478380002e-06, "loss": 0.29927687644958495, "num_input_tokens_seen": 998297904, "step": 22830, "train_runtime": 176577.7119, "train_tokens_per_second": 5653.59 }, { "epoch": 1.5375033665499596, "grad_norm": 0.8389462503007052, "learning_rate": 1.2627920887755212e-06, "loss": 0.3054951190948486, "num_input_tokens_seen": 998508592, "step": 22835, "train_runtime": 176613.3774, "train_tokens_per_second": 5653.641 }, { "epoch": 1.5378400215459198, "grad_norm": 0.7157688346659142, "learning_rate": 1.261036074811317e-06, "loss": 0.3088068962097168, "num_input_tokens_seen": 998733664, "step": 22840, "train_runtime": 176645.3708, "train_tokens_per_second": 5653.891 }, { "epoch": 1.5381766765418798, "grad_norm": 0.7683443200543241, "learning_rate": 1.2592811064364524e-06, "loss": 0.2938983917236328, "num_input_tokens_seen": 998954872, "step": 22845, "train_runtime": 176689.3099, "train_tokens_per_second": 5653.737 }, { "epoch": 1.5385133315378399, "grad_norm": 1.0039919983392351, "learning_rate": 1.2575271841416963e-06, "loss": 0.3196579456329346, "num_input_tokens_seen": 999145416, "step": 22850, "train_runtime": 176727.2813, "train_tokens_per_second": 5653.6 }, { "epoch": 1.5388499865338001, "grad_norm": 0.7489841192691534, "learning_rate": 1.2557743084175327e-06, "loss": 0.27573988437652586, "num_input_tokens_seen": 999360320, "step": 22855, "train_runtime": 176762.6012, "train_tokens_per_second": 5653.686 }, { "epoch": 1.5391866415297604, "grad_norm": 0.7473129975200795, "learning_rate": 1.254022479754141e-06, "loss": 0.2842655420303345, "num_input_tokens_seen": 999588440, "step": 22860, "train_runtime": 176797.2452, "train_tokens_per_second": 5653.869 }, { "epoch": 1.5395232965257204, "grad_norm": 0.7459689277622236, "learning_rate": 1.252271698641419e-06, "loss": 0.28894410133361814, "num_input_tokens_seen": 999804216, "step": 22865, "train_runtime": 176835.9913, "train_tokens_per_second": 5653.85 }, { "epoch": 1.5398599515216804, "grad_norm": 0.7252321531655411, "learning_rate": 1.2505219655689659e-06, "loss": 0.310650110244751, "num_input_tokens_seen": 1000033680, "step": 22870, "train_runtime": 176868.215, "train_tokens_per_second": 5654.118 }, { "epoch": 1.5401966065176407, "grad_norm": 0.7797088059008812, "learning_rate": 1.2487732810260877e-06, "loss": 0.3046865701675415, "num_input_tokens_seen": 1000253168, "step": 22875, "train_runtime": 176907.967, "train_tokens_per_second": 5654.088 }, { "epoch": 1.540533261513601, "grad_norm": 0.6927104452813211, "learning_rate": 1.2470256455018027e-06, "loss": 0.2814844846725464, "num_input_tokens_seen": 1000469584, "step": 22880, "train_runtime": 176948.9419, "train_tokens_per_second": 5654.002 }, { "epoch": 1.540869916509561, "grad_norm": 0.7567591660729376, "learning_rate": 1.2452790594848257e-06, "loss": 0.28022444248199463, "num_input_tokens_seen": 1000680152, "step": 22885, "train_runtime": 176994.3264, "train_tokens_per_second": 5653.741 }, { "epoch": 1.541206571505521, "grad_norm": 0.8836138624724967, "learning_rate": 1.2435335234635892e-06, "loss": 0.3237956762313843, "num_input_tokens_seen": 1000898768, "step": 22890, "train_runtime": 177031.9969, "train_tokens_per_second": 5653.773 }, { "epoch": 1.5415432265014812, "grad_norm": 0.8098774986288102, "learning_rate": 1.2417890379262221e-06, "loss": 0.29699585437774656, "num_input_tokens_seen": 1001118440, "step": 22895, "train_runtime": 177077.1356, "train_tokens_per_second": 5653.573 }, { "epoch": 1.5418798814974415, "grad_norm": 0.7965414488198174, "learning_rate": 1.2400456033605672e-06, "loss": 0.26516332626342776, "num_input_tokens_seen": 1001331680, "step": 22900, "train_runtime": 177118.7589, "train_tokens_per_second": 5653.448 }, { "epoch": 1.5422165364934015, "grad_norm": 0.6817693862207875, "learning_rate": 1.2383032202541706e-06, "loss": 0.3010143756866455, "num_input_tokens_seen": 1001546592, "step": 22905, "train_runtime": 177156.0589, "train_tokens_per_second": 5653.471 }, { "epoch": 1.5425531914893615, "grad_norm": 0.7874018271811691, "learning_rate": 1.2365618890942827e-06, "loss": 0.32308430671691896, "num_input_tokens_seen": 1001766568, "step": 22910, "train_runtime": 177191.6126, "train_tokens_per_second": 5653.578 }, { "epoch": 1.5428898464853218, "grad_norm": 0.7366938406257898, "learning_rate": 1.2348216103678618e-06, "loss": 0.3221110820770264, "num_input_tokens_seen": 1001986120, "step": 22915, "train_runtime": 177222.995, "train_tokens_per_second": 5653.816 }, { "epoch": 1.543226501481282, "grad_norm": 0.8883683471081493, "learning_rate": 1.2330823845615713e-06, "loss": 0.2979999780654907, "num_input_tokens_seen": 1002184920, "step": 22920, "train_runtime": 177260.8843, "train_tokens_per_second": 5653.729 }, { "epoch": 1.543563156477242, "grad_norm": 0.7325915491270013, "learning_rate": 1.2313442121617785e-06, "loss": 0.29711506366729734, "num_input_tokens_seen": 1002416768, "step": 22925, "train_runtime": 177301.116, "train_tokens_per_second": 5653.753 }, { "epoch": 1.543899811473202, "grad_norm": 0.7697827606669048, "learning_rate": 1.229607093654563e-06, "loss": 0.2836009502410889, "num_input_tokens_seen": 1002644952, "step": 22930, "train_runtime": 177333.8735, "train_tokens_per_second": 5653.996 }, { "epoch": 1.5442364664691623, "grad_norm": 0.6685394671070748, "learning_rate": 1.2278710295256974e-06, "loss": 0.30063090324401853, "num_input_tokens_seen": 1002875328, "step": 22935, "train_runtime": 177368.0874, "train_tokens_per_second": 5654.204 }, { "epoch": 1.5445731214651226, "grad_norm": 0.707781339272189, "learning_rate": 1.2261360202606725e-06, "loss": 0.2941617965698242, "num_input_tokens_seen": 1003108632, "step": 22940, "train_runtime": 177406.2713, "train_tokens_per_second": 5654.302 }, { "epoch": 1.5449097764610826, "grad_norm": 0.7708196807094642, "learning_rate": 1.2244020663446731e-06, "loss": 0.3176748752593994, "num_input_tokens_seen": 1003320896, "step": 22945, "train_runtime": 177449.0984, "train_tokens_per_second": 5654.134 }, { "epoch": 1.5452464314570427, "grad_norm": 0.9256755732496396, "learning_rate": 1.222669168262598e-06, "loss": 0.29861812591552733, "num_input_tokens_seen": 1003542056, "step": 22950, "train_runtime": 177486.5774, "train_tokens_per_second": 5654.186 }, { "epoch": 1.545583086453003, "grad_norm": 0.7130093827585298, "learning_rate": 1.2209373264990448e-06, "loss": 0.29040777683258057, "num_input_tokens_seen": 1003762224, "step": 22955, "train_runtime": 177519.7915, "train_tokens_per_second": 5654.368 }, { "epoch": 1.5459197414489632, "grad_norm": 0.807014861280199, "learning_rate": 1.2192065415383176e-06, "loss": 0.29322617053985595, "num_input_tokens_seen": 1003976720, "step": 22960, "train_runtime": 177559.4075, "train_tokens_per_second": 5654.314 }, { "epoch": 1.5462563964449232, "grad_norm": 0.7816291079417402, "learning_rate": 1.217476813864425e-06, "loss": 0.3234560966491699, "num_input_tokens_seen": 1004209864, "step": 22965, "train_runtime": 177604.7394, "train_tokens_per_second": 5654.184 }, { "epoch": 1.5465930514408834, "grad_norm": 0.7404020286277221, "learning_rate": 1.2157481439610801e-06, "loss": 0.27009384632110595, "num_input_tokens_seen": 1004428792, "step": 22970, "train_runtime": 177647.5783, "train_tokens_per_second": 5654.053 }, { "epoch": 1.5469297064368437, "grad_norm": 0.8293778191938409, "learning_rate": 1.2140205323116976e-06, "loss": 0.2998237609863281, "num_input_tokens_seen": 1004626616, "step": 22975, "train_runtime": 177682.0158, "train_tokens_per_second": 5654.07 }, { "epoch": 1.5472663614328037, "grad_norm": 0.8562313154245355, "learning_rate": 1.2122939793994043e-06, "loss": 0.2867993116378784, "num_input_tokens_seen": 1004841312, "step": 22980, "train_runtime": 177716.4916, "train_tokens_per_second": 5654.182 }, { "epoch": 1.5476030164287637, "grad_norm": 0.7604165950877463, "learning_rate": 1.2105684857070182e-06, "loss": 0.292344331741333, "num_input_tokens_seen": 1005062880, "step": 22985, "train_runtime": 177754.2016, "train_tokens_per_second": 5654.229 }, { "epoch": 1.547939671424724, "grad_norm": 0.7094120408682225, "learning_rate": 1.2088440517170729e-06, "loss": 0.30412988662719725, "num_input_tokens_seen": 1005287360, "step": 22990, "train_runtime": 177790.0242, "train_tokens_per_second": 5654.352 }, { "epoch": 1.5482763264206842, "grad_norm": 0.8682158123872002, "learning_rate": 1.2071206779117994e-06, "loss": 0.3056650161743164, "num_input_tokens_seen": 1005509112, "step": 22995, "train_runtime": 177827.549, "train_tokens_per_second": 5654.406 }, { "epoch": 1.5486129814166443, "grad_norm": 0.7363938814599378, "learning_rate": 1.2053983647731337e-06, "loss": 0.29947643280029296, "num_input_tokens_seen": 1005742432, "step": 23000, "train_runtime": 177862.3567, "train_tokens_per_second": 5654.611 }, { "epoch": 1.5489496364126043, "grad_norm": 0.818386721631332, "learning_rate": 1.2036771127827152e-06, "loss": 0.3036951541900635, "num_input_tokens_seen": 1005948408, "step": 23005, "train_runtime": 177896.9071, "train_tokens_per_second": 5654.671 }, { "epoch": 1.5492862914085646, "grad_norm": 0.7210690822091025, "learning_rate": 1.2019569224218869e-06, "loss": 0.3014035224914551, "num_input_tokens_seen": 1006184672, "step": 23010, "train_runtime": 177940.4278, "train_tokens_per_second": 5654.615 }, { "epoch": 1.5496229464045248, "grad_norm": 0.7336526052679622, "learning_rate": 1.2002377941716936e-06, "loss": 0.27741825580596924, "num_input_tokens_seen": 1006397816, "step": 23015, "train_runtime": 177978.0712, "train_tokens_per_second": 5654.617 }, { "epoch": 1.5499596014004848, "grad_norm": 0.8612322343025608, "learning_rate": 1.1985197285128853e-06, "loss": 0.30047073364257815, "num_input_tokens_seen": 1006606872, "step": 23020, "train_runtime": 178024.3698, "train_tokens_per_second": 5654.321 }, { "epoch": 1.5502962563964449, "grad_norm": 0.7706187528021623, "learning_rate": 1.1968027259259107e-06, "loss": 0.29756712913513184, "num_input_tokens_seen": 1006810960, "step": 23025, "train_runtime": 178061.8932, "train_tokens_per_second": 5654.275 }, { "epoch": 1.5506329113924051, "grad_norm": 0.7669195811239113, "learning_rate": 1.1950867868909293e-06, "loss": 0.27481400966644287, "num_input_tokens_seen": 1007021520, "step": 23030, "train_runtime": 178104.3, "train_tokens_per_second": 5654.111 }, { "epoch": 1.5509695663883654, "grad_norm": 0.8825553327883765, "learning_rate": 1.1933719118877923e-06, "loss": 0.30696120262146, "num_input_tokens_seen": 1007265144, "step": 23035, "train_runtime": 178134.9312, "train_tokens_per_second": 5654.507 }, { "epoch": 1.5513062213843254, "grad_norm": 0.6530163696183422, "learning_rate": 1.1916581013960632e-06, "loss": 0.2742566347122192, "num_input_tokens_seen": 1007502816, "step": 23040, "train_runtime": 178176.3835, "train_tokens_per_second": 5654.525 }, { "epoch": 1.5516428763802854, "grad_norm": 0.8012588977520706, "learning_rate": 1.189945355895002e-06, "loss": 0.31151793003082273, "num_input_tokens_seen": 1007718880, "step": 23045, "train_runtime": 178217.168, "train_tokens_per_second": 5654.443 }, { "epoch": 1.5519795313762457, "grad_norm": 0.7331978765364463, "learning_rate": 1.1882336758635727e-06, "loss": 0.27026982307434083, "num_input_tokens_seen": 1007951160, "step": 23050, "train_runtime": 178252.7434, "train_tokens_per_second": 5654.618 }, { "epoch": 1.552316186372206, "grad_norm": 0.8000089411786985, "learning_rate": 1.1865230617804412e-06, "loss": 0.32370221614837646, "num_input_tokens_seen": 1008186432, "step": 23055, "train_runtime": 178288.4347, "train_tokens_per_second": 5654.806 }, { "epoch": 1.552652841368166, "grad_norm": 0.7285802544354917, "learning_rate": 1.1848135141239753e-06, "loss": 0.2949348211288452, "num_input_tokens_seen": 1008403400, "step": 23060, "train_runtime": 178329.6018, "train_tokens_per_second": 5654.717 }, { "epoch": 1.552989496364126, "grad_norm": 0.8133624441552181, "learning_rate": 1.1831050333722438e-06, "loss": 0.3110039710998535, "num_input_tokens_seen": 1008619128, "step": 23065, "train_runtime": 178364.4191, "train_tokens_per_second": 5654.822 }, { "epoch": 1.5533261513600862, "grad_norm": 0.7041630401525898, "learning_rate": 1.1813976200030191e-06, "loss": 0.29149832725524905, "num_input_tokens_seen": 1008834768, "step": 23070, "train_runtime": 178400.3205, "train_tokens_per_second": 5654.893 }, { "epoch": 1.5536628063560465, "grad_norm": 0.7088406276262311, "learning_rate": 1.1796912744937717e-06, "loss": 0.31109683513641356, "num_input_tokens_seen": 1009058816, "step": 23075, "train_runtime": 178437.2135, "train_tokens_per_second": 5654.98 }, { "epoch": 1.5539994613520065, "grad_norm": 0.8006442613984758, "learning_rate": 1.1779859973216802e-06, "loss": 0.2948103904724121, "num_input_tokens_seen": 1009270824, "step": 23080, "train_runtime": 178479.8877, "train_tokens_per_second": 5654.815 }, { "epoch": 1.5543361163479665, "grad_norm": 0.8721550220509111, "learning_rate": 1.1762817889636142e-06, "loss": 0.29932336807250975, "num_input_tokens_seen": 1009470192, "step": 23085, "train_runtime": 178518.382, "train_tokens_per_second": 5654.713 }, { "epoch": 1.5546727713439268, "grad_norm": 0.7952095441240394, "learning_rate": 1.1745786498961542e-06, "loss": 0.31789186000823977, "num_input_tokens_seen": 1009708792, "step": 23090, "train_runtime": 178557.7116, "train_tokens_per_second": 5654.804 }, { "epoch": 1.555009426339887, "grad_norm": 0.7311486152172996, "learning_rate": 1.1728765805955766e-06, "loss": 0.2769877195358276, "num_input_tokens_seen": 1009922120, "step": 23095, "train_runtime": 178592.2137, "train_tokens_per_second": 5654.906 }, { "epoch": 1.555346081335847, "grad_norm": 0.8415310169008027, "learning_rate": 1.1711755815378595e-06, "loss": 0.32232234477996824, "num_input_tokens_seen": 1010130920, "step": 23100, "train_runtime": 178626.0283, "train_tokens_per_second": 5655.004 }, { "epoch": 1.555682736331807, "grad_norm": 0.6963455165526707, "learning_rate": 1.1694756531986818e-06, "loss": 0.293909478187561, "num_input_tokens_seen": 1010358016, "step": 23105, "train_runtime": 178670.1633, "train_tokens_per_second": 5654.878 }, { "epoch": 1.5560193913277673, "grad_norm": 0.7864173646107584, "learning_rate": 1.1677767960534232e-06, "loss": 0.3079185962677002, "num_input_tokens_seen": 1010578448, "step": 23110, "train_runtime": 178714.6961, "train_tokens_per_second": 5654.703 }, { "epoch": 1.5563560463237276, "grad_norm": 0.7334560465799055, "learning_rate": 1.166079010577163e-06, "loss": 0.31560115814208983, "num_input_tokens_seen": 1010787032, "step": 23115, "train_runtime": 178752.3631, "train_tokens_per_second": 5654.678 }, { "epoch": 1.5566927013196876, "grad_norm": 0.8841111887561086, "learning_rate": 1.1643822972446823e-06, "loss": 0.3215439796447754, "num_input_tokens_seen": 1011011240, "step": 23120, "train_runtime": 178786.2102, "train_tokens_per_second": 5654.861 }, { "epoch": 1.5570293563156477, "grad_norm": 0.7142397763016451, "learning_rate": 1.1626866565304594e-06, "loss": 0.2977125883102417, "num_input_tokens_seen": 1011244280, "step": 23125, "train_runtime": 178828.8659, "train_tokens_per_second": 5654.816 }, { "epoch": 1.557366011311608, "grad_norm": 0.7277792379867785, "learning_rate": 1.16099208890868e-06, "loss": 0.2924909830093384, "num_input_tokens_seen": 1011459816, "step": 23130, "train_runtime": 178867.1737, "train_tokens_per_second": 5654.81 }, { "epoch": 1.5577026663075682, "grad_norm": 0.7072278904651554, "learning_rate": 1.1592985948532187e-06, "loss": 0.29182374477386475, "num_input_tokens_seen": 1011668760, "step": 23135, "train_runtime": 178901.1993, "train_tokens_per_second": 5654.902 }, { "epoch": 1.5580393213035282, "grad_norm": 0.7122762244099401, "learning_rate": 1.1576061748376594e-06, "loss": 0.28834197521209715, "num_input_tokens_seen": 1011885552, "step": 23140, "train_runtime": 178941.129, "train_tokens_per_second": 5654.852 }, { "epoch": 1.5583759762994882, "grad_norm": 0.7581459438101124, "learning_rate": 1.1559148293352805e-06, "loss": 0.293502950668335, "num_input_tokens_seen": 1012108496, "step": 23145, "train_runtime": 178981.2231, "train_tokens_per_second": 5654.831 }, { "epoch": 1.5587126312954485, "grad_norm": 0.6988252432908294, "learning_rate": 1.154224558819062e-06, "loss": 0.2947830677032471, "num_input_tokens_seen": 1012331792, "step": 23150, "train_runtime": 179021.8936, "train_tokens_per_second": 5654.793 }, { "epoch": 1.5590492862914087, "grad_norm": 0.7771507807990884, "learning_rate": 1.1525353637616821e-06, "loss": 0.29758148193359374, "num_input_tokens_seen": 1012552976, "step": 23155, "train_runtime": 179058.4207, "train_tokens_per_second": 5654.875 }, { "epoch": 1.5593859412873687, "grad_norm": 0.7491488781107557, "learning_rate": 1.1508472446355196e-06, "loss": 0.3053610324859619, "num_input_tokens_seen": 1012785584, "step": 23160, "train_runtime": 179099.292, "train_tokens_per_second": 5654.883 }, { "epoch": 1.5597225962833288, "grad_norm": 0.697759562324447, "learning_rate": 1.1491602019126501e-06, "loss": 0.2998149871826172, "num_input_tokens_seen": 1013018136, "step": 23165, "train_runtime": 179129.3593, "train_tokens_per_second": 5655.232 }, { "epoch": 1.560059251279289, "grad_norm": 0.7568078853356832, "learning_rate": 1.1474742360648515e-06, "loss": 0.31585729122161865, "num_input_tokens_seen": 1013244520, "step": 23170, "train_runtime": 179174.5036, "train_tokens_per_second": 5655.071 }, { "epoch": 1.5603959062752493, "grad_norm": 0.8520933038767174, "learning_rate": 1.1457893475635968e-06, "loss": 0.3203889846801758, "num_input_tokens_seen": 1013457472, "step": 23175, "train_runtime": 179219.5043, "train_tokens_per_second": 5654.839 }, { "epoch": 1.5607325612712093, "grad_norm": 0.6916094191053404, "learning_rate": 1.144105536880063e-06, "loss": 0.2820396900177002, "num_input_tokens_seen": 1013672336, "step": 23180, "train_runtime": 179252.287, "train_tokens_per_second": 5655.004 }, { "epoch": 1.5610692162671693, "grad_norm": 0.7609947532948533, "learning_rate": 1.1424228044851176e-06, "loss": 0.29037587642669677, "num_input_tokens_seen": 1013859016, "step": 23185, "train_runtime": 179288.0236, "train_tokens_per_second": 5654.918 }, { "epoch": 1.5614058712631296, "grad_norm": 0.6991374139098863, "learning_rate": 1.1407411508493355e-06, "loss": 0.3020007133483887, "num_input_tokens_seen": 1014067352, "step": 23190, "train_runtime": 179325.7985, "train_tokens_per_second": 5654.888 }, { "epoch": 1.5617425262590898, "grad_norm": 0.7525302404327049, "learning_rate": 1.1390605764429846e-06, "loss": 0.2727111101150513, "num_input_tokens_seen": 1014277952, "step": 23195, "train_runtime": 179365.198, "train_tokens_per_second": 5654.82 }, { "epoch": 1.5620791812550499, "grad_norm": 0.755912903107464, "learning_rate": 1.1373810817360314e-06, "loss": 0.29233598709106445, "num_input_tokens_seen": 1014509144, "step": 23200, "train_runtime": 179403.2626, "train_tokens_per_second": 5654.909 }, { "epoch": 1.5624158362510099, "grad_norm": 0.8490364171656128, "learning_rate": 1.135702667198142e-06, "loss": 0.3186174392700195, "num_input_tokens_seen": 1014733760, "step": 23205, "train_runtime": 179436.0347, "train_tokens_per_second": 5655.128 }, { "epoch": 1.5627524912469701, "grad_norm": 0.7833432896868294, "learning_rate": 1.134025333298679e-06, "loss": 0.2658507823944092, "num_input_tokens_seen": 1014933448, "step": 23210, "train_runtime": 179473.8421, "train_tokens_per_second": 5655.049 }, { "epoch": 1.5630891462429304, "grad_norm": 0.6767171989222308, "learning_rate": 1.1323490805067045e-06, "loss": 0.27293944358825684, "num_input_tokens_seen": 1015151416, "step": 23215, "train_runtime": 179514.1502, "train_tokens_per_second": 5654.994 }, { "epoch": 1.5634258012388904, "grad_norm": 0.7564520547243825, "learning_rate": 1.1306739092909757e-06, "loss": 0.27212421894073485, "num_input_tokens_seen": 1015357104, "step": 23220, "train_runtime": 179558.059, "train_tokens_per_second": 5654.757 }, { "epoch": 1.5637624562348504, "grad_norm": 0.7556836048466959, "learning_rate": 1.1289998201199493e-06, "loss": 0.28475046157836914, "num_input_tokens_seen": 1015578216, "step": 23225, "train_runtime": 179598.1851, "train_tokens_per_second": 5654.724 }, { "epoch": 1.5640991112308107, "grad_norm": 0.7771413672780467, "learning_rate": 1.1273268134617816e-06, "loss": 0.3049982786178589, "num_input_tokens_seen": 1015803864, "step": 23230, "train_runtime": 179637.2745, "train_tokens_per_second": 5654.75 }, { "epoch": 1.564435766226771, "grad_norm": 0.6387132976491532, "learning_rate": 1.1256548897843189e-06, "loss": 0.2998204708099365, "num_input_tokens_seen": 1016035144, "step": 23235, "train_runtime": 179676.6807, "train_tokens_per_second": 5654.797 }, { "epoch": 1.564772421222731, "grad_norm": 0.677517945115812, "learning_rate": 1.1239840495551136e-06, "loss": 0.2948010921478271, "num_input_tokens_seen": 1016256464, "step": 23240, "train_runtime": 179716.2122, "train_tokens_per_second": 5654.785 }, { "epoch": 1.565109076218691, "grad_norm": 0.8189763586455887, "learning_rate": 1.1223142932414087e-06, "loss": 0.3241511583328247, "num_input_tokens_seen": 1016483368, "step": 23245, "train_runtime": 179758.4552, "train_tokens_per_second": 5654.718 }, { "epoch": 1.5654457312146512, "grad_norm": 0.6822186571021763, "learning_rate": 1.120645621310147e-06, "loss": 0.2887975454330444, "num_input_tokens_seen": 1016700976, "step": 23250, "train_runtime": 179800.864, "train_tokens_per_second": 5654.594 }, { "epoch": 1.5657823862106115, "grad_norm": 0.8030985846370237, "learning_rate": 1.1189780342279666e-06, "loss": 0.2927762508392334, "num_input_tokens_seen": 1016907680, "step": 23255, "train_runtime": 179835.7597, "train_tokens_per_second": 5654.647 }, { "epoch": 1.5661190412065715, "grad_norm": 0.7041599888250881, "learning_rate": 1.1173115324612033e-06, "loss": 0.30506865978240966, "num_input_tokens_seen": 1017110400, "step": 23260, "train_runtime": 179876.7454, "train_tokens_per_second": 5654.485 }, { "epoch": 1.5664556962025316, "grad_norm": 0.8207082370707505, "learning_rate": 1.1156461164758891e-06, "loss": 0.3330164909362793, "num_input_tokens_seen": 1017339120, "step": 23265, "train_runtime": 179913.8123, "train_tokens_per_second": 5654.592 }, { "epoch": 1.5667923511984918, "grad_norm": 0.6985440775195174, "learning_rate": 1.1139817867377522e-06, "loss": 0.2630832433700562, "num_input_tokens_seen": 1017568520, "step": 23270, "train_runtime": 179951.8501, "train_tokens_per_second": 5654.671 }, { "epoch": 1.567129006194452, "grad_norm": 0.7538202300333461, "learning_rate": 1.1123185437122153e-06, "loss": 0.29378499984741213, "num_input_tokens_seen": 1017797256, "step": 23275, "train_runtime": 179995.1502, "train_tokens_per_second": 5654.582 }, { "epoch": 1.567465661190412, "grad_norm": 0.8033728394499458, "learning_rate": 1.1106563878644038e-06, "loss": 0.30549144744873047, "num_input_tokens_seen": 1018024880, "step": 23280, "train_runtime": 180035.9497, "train_tokens_per_second": 5654.564 }, { "epoch": 1.5678023161863721, "grad_norm": 0.7853141000994098, "learning_rate": 1.1089953196591286e-06, "loss": 0.30190200805664064, "num_input_tokens_seen": 1018241712, "step": 23285, "train_runtime": 180077.9944, "train_tokens_per_second": 5654.448 }, { "epoch": 1.5681389711823324, "grad_norm": 0.7859724149410223, "learning_rate": 1.107335339560906e-06, "loss": 0.3117091417312622, "num_input_tokens_seen": 1018448032, "step": 23290, "train_runtime": 180115.2413, "train_tokens_per_second": 5654.424 }, { "epoch": 1.5684756261782926, "grad_norm": 0.7863228372315338, "learning_rate": 1.1056764480339427e-06, "loss": 0.3014981269836426, "num_input_tokens_seen": 1018674080, "step": 23295, "train_runtime": 180158.4273, "train_tokens_per_second": 5654.324 }, { "epoch": 1.5688122811742526, "grad_norm": 0.7789425478674455, "learning_rate": 1.1040186455421425e-06, "loss": 0.33310580253601074, "num_input_tokens_seen": 1018908720, "step": 23300, "train_runtime": 180194.8091, "train_tokens_per_second": 5654.484 }, { "epoch": 1.5691489361702127, "grad_norm": 0.8291198693575462, "learning_rate": 1.1023619325491052e-06, "loss": 0.310105037689209, "num_input_tokens_seen": 1019122152, "step": 23305, "train_runtime": 180234.0997, "train_tokens_per_second": 5654.436 }, { "epoch": 1.569485591166173, "grad_norm": 0.6253815970834292, "learning_rate": 1.1007063095181248e-06, "loss": 0.27553586959838866, "num_input_tokens_seen": 1019342832, "step": 23310, "train_runtime": 180278.8765, "train_tokens_per_second": 5654.256 }, { "epoch": 1.5698222461621332, "grad_norm": 0.8786406413208016, "learning_rate": 1.0990517769121905e-06, "loss": 0.29708888530731203, "num_input_tokens_seen": 1019546240, "step": 23315, "train_runtime": 180314.3153, "train_tokens_per_second": 5654.272 }, { "epoch": 1.5701589011580932, "grad_norm": 0.8222072276717016, "learning_rate": 1.0973983351939876e-06, "loss": 0.3073767900466919, "num_input_tokens_seen": 1019767384, "step": 23320, "train_runtime": 180352.2362, "train_tokens_per_second": 5654.31 }, { "epoch": 1.5704955561540532, "grad_norm": 0.7054404712911847, "learning_rate": 1.095745984825895e-06, "loss": 0.2895050048828125, "num_input_tokens_seen": 1019996880, "step": 23325, "train_runtime": 180386.2267, "train_tokens_per_second": 5654.516 }, { "epoch": 1.5708322111500135, "grad_norm": 0.8092139157721354, "learning_rate": 1.0940947262699902e-06, "loss": 0.30101957321166994, "num_input_tokens_seen": 1020200320, "step": 23330, "train_runtime": 180428.7048, "train_tokens_per_second": 5654.313 }, { "epoch": 1.5711688661459737, "grad_norm": 0.7111960834790324, "learning_rate": 1.092444559988038e-06, "loss": 0.28864340782165526, "num_input_tokens_seen": 1020417768, "step": 23335, "train_runtime": 180466.2384, "train_tokens_per_second": 5654.342 }, { "epoch": 1.5715055211419338, "grad_norm": 0.660638688067613, "learning_rate": 1.0907954864415048e-06, "loss": 0.29140138626098633, "num_input_tokens_seen": 1020645240, "step": 23340, "train_runtime": 180507.8532, "train_tokens_per_second": 5654.298 }, { "epoch": 1.5718421761378938, "grad_norm": 0.8672767958383719, "learning_rate": 1.089147506091549e-06, "loss": 0.28663978576660154, "num_input_tokens_seen": 1020864992, "step": 23345, "train_runtime": 180542.9652, "train_tokens_per_second": 5654.416 }, { "epoch": 1.572178831133854, "grad_norm": 0.8719743776750728, "learning_rate": 1.0875006193990217e-06, "loss": 0.3154577732086182, "num_input_tokens_seen": 1021076760, "step": 23350, "train_runtime": 180584.1055, "train_tokens_per_second": 5654.3 }, { "epoch": 1.5725154861298143, "grad_norm": 0.7880930108374784, "learning_rate": 1.0858548268244706e-06, "loss": 0.2915508270263672, "num_input_tokens_seen": 1021295960, "step": 23355, "train_runtime": 180623.241, "train_tokens_per_second": 5654.289 }, { "epoch": 1.5728521411257743, "grad_norm": 0.8007349258213046, "learning_rate": 1.0842101288281359e-06, "loss": 0.293584418296814, "num_input_tokens_seen": 1021516488, "step": 23360, "train_runtime": 180662.7604, "train_tokens_per_second": 5654.273 }, { "epoch": 1.5731887961217343, "grad_norm": 0.7656889523789541, "learning_rate": 1.082566525869952e-06, "loss": 0.28592419624328613, "num_input_tokens_seen": 1021745864, "step": 23365, "train_runtime": 180702.808, "train_tokens_per_second": 5654.289 }, { "epoch": 1.5735254511176946, "grad_norm": 0.8722272978728876, "learning_rate": 1.0809240184095476e-06, "loss": 0.3062607288360596, "num_input_tokens_seen": 1021959216, "step": 23370, "train_runtime": 180737.0204, "train_tokens_per_second": 5654.399 }, { "epoch": 1.5738621061136548, "grad_norm": 0.6745653891846737, "learning_rate": 1.0792826069062429e-06, "loss": 0.26804351806640625, "num_input_tokens_seen": 1022178816, "step": 23375, "train_runtime": 180775.1712, "train_tokens_per_second": 5654.42 }, { "epoch": 1.5741987611096149, "grad_norm": 0.6985205733037011, "learning_rate": 1.0776422918190576e-06, "loss": 0.31443793773651124, "num_input_tokens_seen": 1022402224, "step": 23380, "train_runtime": 180806.1938, "train_tokens_per_second": 5654.686 }, { "epoch": 1.574535416105575, "grad_norm": 0.8000413255647302, "learning_rate": 1.0760030736066952e-06, "loss": 0.28395633697509765, "num_input_tokens_seen": 1022607104, "step": 23385, "train_runtime": 180846.4339, "train_tokens_per_second": 5654.561 }, { "epoch": 1.5748720711015352, "grad_norm": 0.7301802635358972, "learning_rate": 1.0743649527275619e-06, "loss": 0.3159285068511963, "num_input_tokens_seen": 1022834416, "step": 23390, "train_runtime": 180888.2807, "train_tokens_per_second": 5654.509 }, { "epoch": 1.5752087260974954, "grad_norm": 0.8194485612881878, "learning_rate": 1.0727279296397514e-06, "loss": 0.3103215456008911, "num_input_tokens_seen": 1023064384, "step": 23395, "train_runtime": 180932.3993, "train_tokens_per_second": 5654.401 }, { "epoch": 1.5755453810934554, "grad_norm": 0.8975237265847585, "learning_rate": 1.0710920048010526e-06, "loss": 0.3091814279556274, "num_input_tokens_seen": 1023286312, "step": 23400, "train_runtime": 180973.834, "train_tokens_per_second": 5654.333 }, { "epoch": 1.5758820360894155, "grad_norm": 0.7551422109604019, "learning_rate": 1.0694571786689462e-06, "loss": 0.29776315689086913, "num_input_tokens_seen": 1023528528, "step": 23405, "train_runtime": 181012.8344, "train_tokens_per_second": 5654.453 }, { "epoch": 1.5762186910853757, "grad_norm": 0.7923202761413153, "learning_rate": 1.067823451700606e-06, "loss": 0.29261269569396975, "num_input_tokens_seen": 1023748656, "step": 23410, "train_runtime": 181047.5433, "train_tokens_per_second": 5654.585 }, { "epoch": 1.576555346081336, "grad_norm": 0.7616310783411705, "learning_rate": 1.066190824352899e-06, "loss": 0.29994802474975585, "num_input_tokens_seen": 1023974480, "step": 23415, "train_runtime": 181087.6631, "train_tokens_per_second": 5654.579 }, { "epoch": 1.576892001077296, "grad_norm": 0.6523336414139479, "learning_rate": 1.0645592970823837e-06, "loss": 0.27131869792938235, "num_input_tokens_seen": 1024177832, "step": 23420, "train_runtime": 181123.7413, "train_tokens_per_second": 5654.575 }, { "epoch": 1.577228656073256, "grad_norm": 0.6772527419522956, "learning_rate": 1.0629288703453105e-06, "loss": 0.3091407299041748, "num_input_tokens_seen": 1024403608, "step": 23425, "train_runtime": 181163.8389, "train_tokens_per_second": 5654.57 }, { "epoch": 1.5775653110692163, "grad_norm": 0.8870052312783957, "learning_rate": 1.061299544597627e-06, "loss": 0.29852406978607177, "num_input_tokens_seen": 1024608360, "step": 23430, "train_runtime": 181201.9913, "train_tokens_per_second": 5654.509 }, { "epoch": 1.5779019660651765, "grad_norm": 0.7385143164519493, "learning_rate": 1.0596713202949637e-06, "loss": 0.3082388162612915, "num_input_tokens_seen": 1024836472, "step": 23435, "train_runtime": 181244.3758, "train_tokens_per_second": 5654.446 }, { "epoch": 1.5782386210611365, "grad_norm": 0.7117628849410049, "learning_rate": 1.0580441978926527e-06, "loss": 0.3000252485275269, "num_input_tokens_seen": 1025047408, "step": 23440, "train_runtime": 181284.1102, "train_tokens_per_second": 5654.37 }, { "epoch": 1.5785752760570966, "grad_norm": 0.8021413628123183, "learning_rate": 1.056418177845711e-06, "loss": 0.2908348083496094, "num_input_tokens_seen": 1025252528, "step": 23445, "train_runtime": 181326.465, "train_tokens_per_second": 5654.18 }, { "epoch": 1.5789119310530568, "grad_norm": 0.7083241483136948, "learning_rate": 1.0547932606088506e-06, "loss": 0.3012411594390869, "num_input_tokens_seen": 1025462120, "step": 23450, "train_runtime": 181365.3534, "train_tokens_per_second": 5654.124 }, { "epoch": 1.579248586049017, "grad_norm": 0.749765463777595, "learning_rate": 1.053169446636475e-06, "loss": 0.29930336475372316, "num_input_tokens_seen": 1025676472, "step": 23455, "train_runtime": 181402.7027, "train_tokens_per_second": 5654.141 }, { "epoch": 1.579585241044977, "grad_norm": 0.870290848746088, "learning_rate": 1.0515467363826782e-06, "loss": 0.3104248046875, "num_input_tokens_seen": 1025904840, "step": 23460, "train_runtime": 181436.5696, "train_tokens_per_second": 5654.344 }, { "epoch": 1.5799218960409371, "grad_norm": 0.7377471679217029, "learning_rate": 1.0499251303012454e-06, "loss": 0.2840702533721924, "num_input_tokens_seen": 1026129016, "step": 23465, "train_runtime": 181472.8949, "train_tokens_per_second": 5654.448 }, { "epoch": 1.5802585510368974, "grad_norm": 0.7923429690046462, "learning_rate": 1.0483046288456544e-06, "loss": 0.30331013202667234, "num_input_tokens_seen": 1026336600, "step": 23470, "train_runtime": 181508.7471, "train_tokens_per_second": 5654.475 }, { "epoch": 1.5805952060328576, "grad_norm": 0.7779123855214451, "learning_rate": 1.0466852324690719e-06, "loss": 0.30037317276000974, "num_input_tokens_seen": 1026549792, "step": 23475, "train_runtime": 181547.6766, "train_tokens_per_second": 5654.436 }, { "epoch": 1.5809318610288177, "grad_norm": 0.812157038252082, "learning_rate": 1.0450669416243596e-06, "loss": 0.2942227363586426, "num_input_tokens_seen": 1026774584, "step": 23480, "train_runtime": 181585.7621, "train_tokens_per_second": 5654.488 }, { "epoch": 1.5812685160247777, "grad_norm": 0.7370282264500914, "learning_rate": 1.0434497567640639e-06, "loss": 0.3083514213562012, "num_input_tokens_seen": 1026996640, "step": 23485, "train_runtime": 181622.5429, "train_tokens_per_second": 5654.566 }, { "epoch": 1.581605171020738, "grad_norm": 0.8340284951059088, "learning_rate": 1.0418336783404282e-06, "loss": 0.3067812204360962, "num_input_tokens_seen": 1027217736, "step": 23490, "train_runtime": 181660.7149, "train_tokens_per_second": 5654.595 }, { "epoch": 1.5819418260166982, "grad_norm": 0.694715006207709, "learning_rate": 1.0402187068053825e-06, "loss": 0.3050783395767212, "num_input_tokens_seen": 1027433032, "step": 23495, "train_runtime": 181694.8222, "train_tokens_per_second": 5654.718 }, { "epoch": 1.5822784810126582, "grad_norm": 0.6925827695690472, "learning_rate": 1.0386048426105495e-06, "loss": 0.28964962959289553, "num_input_tokens_seen": 1027649992, "step": 23500, "train_runtime": 181732.3475, "train_tokens_per_second": 5654.744 }, { "epoch": 1.5826151360086183, "grad_norm": 0.7154905995519729, "learning_rate": 1.0369920862072396e-06, "loss": 0.28251526355743406, "num_input_tokens_seen": 1027858824, "step": 23505, "train_runtime": 181776.3615, "train_tokens_per_second": 5654.524 }, { "epoch": 1.5829517910045785, "grad_norm": 0.7732969474103675, "learning_rate": 1.0353804380464556e-06, "loss": 0.28255496025085447, "num_input_tokens_seen": 1028079384, "step": 23510, "train_runtime": 181818.5723, "train_tokens_per_second": 5654.424 }, { "epoch": 1.5832884460005388, "grad_norm": 0.7444357762125697, "learning_rate": 1.0337698985788903e-06, "loss": 0.2897408246994019, "num_input_tokens_seen": 1028306808, "step": 23515, "train_runtime": 181859.8638, "train_tokens_per_second": 5654.391 }, { "epoch": 1.5836251009964988, "grad_norm": 0.7396832464568777, "learning_rate": 1.0321604682549247e-06, "loss": 0.27561049461364745, "num_input_tokens_seen": 1028540048, "step": 23520, "train_runtime": 181903.878, "train_tokens_per_second": 5654.305 }, { "epoch": 1.5839617559924588, "grad_norm": 0.7843713186397172, "learning_rate": 1.0305521475246311e-06, "loss": 0.3138261318206787, "num_input_tokens_seen": 1028749872, "step": 23525, "train_runtime": 181940.9808, "train_tokens_per_second": 5654.305 }, { "epoch": 1.584298410988419, "grad_norm": 0.811370185654451, "learning_rate": 1.028944936837774e-06, "loss": 0.31621651649475097, "num_input_tokens_seen": 1028951280, "step": 23530, "train_runtime": 181974.7241, "train_tokens_per_second": 5654.364 }, { "epoch": 1.5846350659843793, "grad_norm": 0.7315538832578915, "learning_rate": 1.0273388366438003e-06, "loss": 0.30298333168029784, "num_input_tokens_seen": 1029175832, "step": 23535, "train_runtime": 182014.8854, "train_tokens_per_second": 5654.35 }, { "epoch": 1.5849717209803393, "grad_norm": 0.6822526332510949, "learning_rate": 1.0257338473918538e-06, "loss": 0.2973572015762329, "num_input_tokens_seen": 1029399728, "step": 23540, "train_runtime": 182052.6379, "train_tokens_per_second": 5654.407 }, { "epoch": 1.5853083759762994, "grad_norm": 0.7092783516071793, "learning_rate": 1.0241299695307644e-06, "loss": 0.3015413761138916, "num_input_tokens_seen": 1029616800, "step": 23545, "train_runtime": 182093.0118, "train_tokens_per_second": 5654.345 }, { "epoch": 1.5856450309722596, "grad_norm": 0.6440724656411346, "learning_rate": 1.0225272035090506e-06, "loss": 0.282063889503479, "num_input_tokens_seen": 1029848952, "step": 23550, "train_runtime": 182128.0658, "train_tokens_per_second": 5654.532 }, { "epoch": 1.5859816859682199, "grad_norm": 0.7978640593248636, "learning_rate": 1.0209255497749209e-06, "loss": 0.30583910942077636, "num_input_tokens_seen": 1030073088, "step": 23555, "train_runtime": 182170.9808, "train_tokens_per_second": 5654.43 }, { "epoch": 1.58631834096418, "grad_norm": 0.7044002037356724, "learning_rate": 1.0193250087762735e-06, "loss": 0.28136019706726073, "num_input_tokens_seen": 1030294120, "step": 23560, "train_runtime": 182212.5582, "train_tokens_per_second": 5654.353 }, { "epoch": 1.58665499596014, "grad_norm": 0.626174961728994, "learning_rate": 1.0177255809606934e-06, "loss": 0.29512906074523926, "num_input_tokens_seen": 1030518512, "step": 23565, "train_runtime": 182245.4993, "train_tokens_per_second": 5654.562 }, { "epoch": 1.5869916509561002, "grad_norm": 0.7958252805077025, "learning_rate": 1.0161272667754562e-06, "loss": 0.2986447334289551, "num_input_tokens_seen": 1030753488, "step": 23570, "train_runtime": 182291.1583, "train_tokens_per_second": 5654.435 }, { "epoch": 1.5873283059520604, "grad_norm": 0.6503902978361567, "learning_rate": 1.014530066667524e-06, "loss": 0.2920704364776611, "num_input_tokens_seen": 1030980864, "step": 23575, "train_runtime": 182338.3663, "train_tokens_per_second": 5654.218 }, { "epoch": 1.5876649609480205, "grad_norm": 0.7822423572349132, "learning_rate": 1.0129339810835526e-06, "loss": 0.26558356285095214, "num_input_tokens_seen": 1031184200, "step": 23580, "train_runtime": 182380.0639, "train_tokens_per_second": 5654.04 }, { "epoch": 1.5880016159439805, "grad_norm": 0.7740865888482027, "learning_rate": 1.0113390104698767e-06, "loss": 0.2880537986755371, "num_input_tokens_seen": 1031415416, "step": 23585, "train_runtime": 182415.6709, "train_tokens_per_second": 5654.204 }, { "epoch": 1.5883382709399407, "grad_norm": 0.6444406633812003, "learning_rate": 1.009745155272529e-06, "loss": 0.32445645332336426, "num_input_tokens_seen": 1031642064, "step": 23590, "train_runtime": 182452.8245, "train_tokens_per_second": 5654.295 }, { "epoch": 1.588674925935901, "grad_norm": 0.716940757316124, "learning_rate": 1.0081524159372246e-06, "loss": 0.30813934803009035, "num_input_tokens_seen": 1031852072, "step": 23595, "train_runtime": 182489.063, "train_tokens_per_second": 5654.323 }, { "epoch": 1.589011580931861, "grad_norm": 0.7929537083603673, "learning_rate": 1.0065607929093685e-06, "loss": 0.2949239253997803, "num_input_tokens_seen": 1032066320, "step": 23600, "train_runtime": 182530.2797, "train_tokens_per_second": 5654.22 }, { "epoch": 1.589348235927821, "grad_norm": 0.7144421636045533, "learning_rate": 1.0049702866340521e-06, "loss": 0.2600874423980713, "num_input_tokens_seen": 1032291736, "step": 23605, "train_runtime": 182571.9611, "train_tokens_per_second": 5654.164 }, { "epoch": 1.5896848909237813, "grad_norm": 0.7689607902349916, "learning_rate": 1.0033808975560556e-06, "loss": 0.28646035194396974, "num_input_tokens_seen": 1032506240, "step": 23610, "train_runtime": 182609.5452, "train_tokens_per_second": 5654.175 }, { "epoch": 1.5900215459197415, "grad_norm": 0.7558437464479234, "learning_rate": 1.0017926261198473e-06, "loss": 0.29119462966918946, "num_input_tokens_seen": 1032720936, "step": 23615, "train_runtime": 182649.2323, "train_tokens_per_second": 5654.121 }, { "epoch": 1.5903582009157016, "grad_norm": 0.8842680705984803, "learning_rate": 1.0002054727695814e-06, "loss": 0.30643343925476074, "num_input_tokens_seen": 1032929224, "step": 23620, "train_runtime": 182690.3573, "train_tokens_per_second": 5653.989 }, { "epoch": 1.5906948559116616, "grad_norm": 0.6572152521341675, "learning_rate": 9.986194379490993e-07, "loss": 0.29436190128326417, "num_input_tokens_seen": 1033140248, "step": 23625, "train_runtime": 182726.5478, "train_tokens_per_second": 5654.024 }, { "epoch": 1.5910315109076218, "grad_norm": 0.7264405013312064, "learning_rate": 9.970345221019345e-07, "loss": 0.30518579483032227, "num_input_tokens_seen": 1033354080, "step": 23630, "train_runtime": 182768.4987, "train_tokens_per_second": 5653.896 }, { "epoch": 1.591368165903582, "grad_norm": 0.9173611218409357, "learning_rate": 9.954507256712987e-07, "loss": 0.30224905014038084, "num_input_tokens_seen": 1033566992, "step": 23635, "train_runtime": 182805.0001, "train_tokens_per_second": 5653.932 }, { "epoch": 1.5917048208995421, "grad_norm": 0.9443978197431155, "learning_rate": 9.938680491000991e-07, "loss": 0.3042686700820923, "num_input_tokens_seen": 1033777624, "step": 23640, "train_runtime": 182847.8991, "train_tokens_per_second": 5653.757 }, { "epoch": 1.5920414758955022, "grad_norm": 0.7432434366050173, "learning_rate": 9.92286492830925e-07, "loss": 0.2958357810974121, "num_input_tokens_seen": 1034004184, "step": 23645, "train_runtime": 182887.2125, "train_tokens_per_second": 5653.781 }, { "epoch": 1.5923781308914624, "grad_norm": 0.7076131103520957, "learning_rate": 9.907060573060535e-07, "loss": 0.31322293281555175, "num_input_tokens_seen": 1034231736, "step": 23650, "train_runtime": 182921.8257, "train_tokens_per_second": 5653.955 }, { "epoch": 1.5927147858874227, "grad_norm": 0.7877155616601498, "learning_rate": 9.891267429674484e-07, "loss": 0.3153421401977539, "num_input_tokens_seen": 1034440472, "step": 23655, "train_runtime": 182960.1809, "train_tokens_per_second": 5653.91 }, { "epoch": 1.5930514408833827, "grad_norm": 0.7335260153611561, "learning_rate": 9.8754855025676e-07, "loss": 0.28733248710632325, "num_input_tokens_seen": 1034659216, "step": 23660, "train_runtime": 182996.9749, "train_tokens_per_second": 5653.969 }, { "epoch": 1.5933880958793427, "grad_norm": 0.7659546851429526, "learning_rate": 9.85971479615324e-07, "loss": 0.29557249546051023, "num_input_tokens_seen": 1034888536, "step": 23665, "train_runtime": 183037.5139, "train_tokens_per_second": 5653.97 }, { "epoch": 1.593724750875303, "grad_norm": 0.7118609901015792, "learning_rate": 9.843955314841647e-07, "loss": 0.28273298740386965, "num_input_tokens_seen": 1035112904, "step": 23670, "train_runtime": 183070.8286, "train_tokens_per_second": 5654.166 }, { "epoch": 1.5940614058712632, "grad_norm": 0.7513624785773189, "learning_rate": 9.82820706303989e-07, "loss": 0.29895691871643065, "num_input_tokens_seen": 1035338280, "step": 23675, "train_runtime": 183114.0185, "train_tokens_per_second": 5654.063 }, { "epoch": 1.5943980608672232, "grad_norm": 0.8383529935018983, "learning_rate": 9.812470045151952e-07, "loss": 0.3054283618927002, "num_input_tokens_seen": 1035542816, "step": 23680, "train_runtime": 183151.8635, "train_tokens_per_second": 5654.012 }, { "epoch": 1.5947347158631833, "grad_norm": 0.7538875645456946, "learning_rate": 9.79674426557859e-07, "loss": 0.29663498401641847, "num_input_tokens_seen": 1035752536, "step": 23685, "train_runtime": 183193.8197, "train_tokens_per_second": 5653.862 }, { "epoch": 1.5950713708591435, "grad_norm": 0.6945464407471583, "learning_rate": 9.781029728717513e-07, "loss": 0.2824697732925415, "num_input_tokens_seen": 1035967072, "step": 23690, "train_runtime": 183231.5083, "train_tokens_per_second": 5653.87 }, { "epoch": 1.5954080258551038, "grad_norm": 0.7148723682038612, "learning_rate": 9.765326438963218e-07, "loss": 0.31726827621459963, "num_input_tokens_seen": 1036183056, "step": 23695, "train_runtime": 183268.6587, "train_tokens_per_second": 5653.902 }, { "epoch": 1.5957446808510638, "grad_norm": 0.7520572590185046, "learning_rate": 9.749634400707087e-07, "loss": 0.29088969230651857, "num_input_tokens_seen": 1036386224, "step": 23700, "train_runtime": 183304.0574, "train_tokens_per_second": 5653.919 }, { "epoch": 1.5960813358470238, "grad_norm": 0.691989732417355, "learning_rate": 9.733953618337344e-07, "loss": 0.3045504570007324, "num_input_tokens_seen": 1036590880, "step": 23705, "train_runtime": 183345.8827, "train_tokens_per_second": 5653.745 }, { "epoch": 1.596417990842984, "grad_norm": 0.7360691080511433, "learning_rate": 9.718284096239077e-07, "loss": 0.315799617767334, "num_input_tokens_seen": 1036831896, "step": 23710, "train_runtime": 183384.7735, "train_tokens_per_second": 5653.86 }, { "epoch": 1.5967546458389443, "grad_norm": 0.780467411583108, "learning_rate": 9.702625838794215e-07, "loss": 0.28366994857788086, "num_input_tokens_seen": 1037051528, "step": 23715, "train_runtime": 183424.345, "train_tokens_per_second": 5653.838 }, { "epoch": 1.5970913008349044, "grad_norm": 0.7083055249265116, "learning_rate": 9.686978850381535e-07, "loss": 0.28309922218322753, "num_input_tokens_seen": 1037274432, "step": 23720, "train_runtime": 183463.0678, "train_tokens_per_second": 5653.86 }, { "epoch": 1.5974279558308644, "grad_norm": 0.7040502210402872, "learning_rate": 9.67134313537666e-07, "loss": 0.28775806427001954, "num_input_tokens_seen": 1037487448, "step": 23725, "train_runtime": 183498.8739, "train_tokens_per_second": 5653.917 }, { "epoch": 1.5977646108268246, "grad_norm": 0.7648445160032851, "learning_rate": 9.6557186981521e-07, "loss": 0.2938704013824463, "num_input_tokens_seen": 1037711184, "step": 23730, "train_runtime": 183532.5183, "train_tokens_per_second": 5654.1 }, { "epoch": 1.5981012658227849, "grad_norm": 0.7590116723636553, "learning_rate": 9.640105543077133e-07, "loss": 0.29409012794494627, "num_input_tokens_seen": 1037930696, "step": 23735, "train_runtime": 183569.9815, "train_tokens_per_second": 5654.142 }, { "epoch": 1.598437920818745, "grad_norm": 0.6999829490635439, "learning_rate": 9.624503674517972e-07, "loss": 0.31141953468322753, "num_input_tokens_seen": 1038151728, "step": 23740, "train_runtime": 183616.0849, "train_tokens_per_second": 5653.926 }, { "epoch": 1.598774575814705, "grad_norm": 0.6931872830922609, "learning_rate": 9.608913096837603e-07, "loss": 0.2785954475402832, "num_input_tokens_seen": 1038375320, "step": 23745, "train_runtime": 183658.3574, "train_tokens_per_second": 5653.842 }, { "epoch": 1.5991112308106652, "grad_norm": 0.7826269007767029, "learning_rate": 9.593333814395889e-07, "loss": 0.30640616416931155, "num_input_tokens_seen": 1038579600, "step": 23750, "train_runtime": 183690.2536, "train_tokens_per_second": 5653.972 }, { "epoch": 1.5994478858066254, "grad_norm": 0.659801248076501, "learning_rate": 9.577765831549529e-07, "loss": 0.29427356719970704, "num_input_tokens_seen": 1038803840, "step": 23755, "train_runtime": 183723.8696, "train_tokens_per_second": 5654.158 }, { "epoch": 1.5997845408025855, "grad_norm": 0.7271704349083015, "learning_rate": 9.562209152652058e-07, "loss": 0.30373120307922363, "num_input_tokens_seen": 1039013760, "step": 23760, "train_runtime": 183766.5421, "train_tokens_per_second": 5653.988 }, { "epoch": 1.6001211957985455, "grad_norm": 0.8875347712272086, "learning_rate": 9.54666378205385e-07, "loss": 0.3227171182632446, "num_input_tokens_seen": 1039242488, "step": 23765, "train_runtime": 183813.6297, "train_tokens_per_second": 5653.784 }, { "epoch": 1.6004578507945058, "grad_norm": 0.8111840363520786, "learning_rate": 9.531129724102117e-07, "loss": 0.2936609983444214, "num_input_tokens_seen": 1039454848, "step": 23770, "train_runtime": 183852.3211, "train_tokens_per_second": 5653.749 }, { "epoch": 1.600794505790466, "grad_norm": 0.7937834563085631, "learning_rate": 9.515606983140896e-07, "loss": 0.2982936859130859, "num_input_tokens_seen": 1039677264, "step": 23775, "train_runtime": 183886.8713, "train_tokens_per_second": 5653.896 }, { "epoch": 1.601131160786426, "grad_norm": 0.7845551974583694, "learning_rate": 9.500095563511119e-07, "loss": 0.3003803253173828, "num_input_tokens_seen": 1039906360, "step": 23780, "train_runtime": 183931.0004, "train_tokens_per_second": 5653.785 }, { "epoch": 1.601467815782386, "grad_norm": 0.6656969784743623, "learning_rate": 9.484595469550445e-07, "loss": 0.28896503448486327, "num_input_tokens_seen": 1040131192, "step": 23785, "train_runtime": 183970.5264, "train_tokens_per_second": 5653.793 }, { "epoch": 1.6018044707783463, "grad_norm": 0.6946762642734486, "learning_rate": 9.469106705593462e-07, "loss": 0.27666046619415285, "num_input_tokens_seen": 1040333032, "step": 23790, "train_runtime": 184009.1267, "train_tokens_per_second": 5653.703 }, { "epoch": 1.6021411257743066, "grad_norm": 0.7736179336799578, "learning_rate": 9.453629275971549e-07, "loss": 0.29598097801208495, "num_input_tokens_seen": 1040552408, "step": 23795, "train_runtime": 184047.3995, "train_tokens_per_second": 5653.72 }, { "epoch": 1.6024777807702666, "grad_norm": 0.6664557365960093, "learning_rate": 9.438163185012916e-07, "loss": 0.28930160999298093, "num_input_tokens_seen": 1040764544, "step": 23800, "train_runtime": 184091.6726, "train_tokens_per_second": 5653.512 }, { "epoch": 1.6028144357662266, "grad_norm": 0.7303797761962147, "learning_rate": 9.422708437042604e-07, "loss": 0.2819626808166504, "num_input_tokens_seen": 1040990752, "step": 23805, "train_runtime": 184135.0608, "train_tokens_per_second": 5653.409 }, { "epoch": 1.6031510907621869, "grad_norm": 0.7712489855582633, "learning_rate": 9.40726503638249e-07, "loss": 0.31176731586456297, "num_input_tokens_seen": 1041206528, "step": 23810, "train_runtime": 184167.4154, "train_tokens_per_second": 5653.587 }, { "epoch": 1.6034877457581471, "grad_norm": 0.8231902257626785, "learning_rate": 9.391832987351268e-07, "loss": 0.29704809188842773, "num_input_tokens_seen": 1041421728, "step": 23815, "train_runtime": 184202.3075, "train_tokens_per_second": 5653.684 }, { "epoch": 1.6038244007541071, "grad_norm": 0.8241864917839168, "learning_rate": 9.376412294264458e-07, "loss": 0.29626688957214353, "num_input_tokens_seen": 1041643056, "step": 23820, "train_runtime": 184245.0385, "train_tokens_per_second": 5653.575 }, { "epoch": 1.6041610557500672, "grad_norm": 0.6892308812819989, "learning_rate": 9.361002961434401e-07, "loss": 0.29646663665771483, "num_input_tokens_seen": 1041859688, "step": 23825, "train_runtime": 184286.6378, "train_tokens_per_second": 5653.474 }, { "epoch": 1.6044977107460274, "grad_norm": 0.8147077105803181, "learning_rate": 9.345604993170299e-07, "loss": 0.31340832710266114, "num_input_tokens_seen": 1042088840, "step": 23830, "train_runtime": 184324.2778, "train_tokens_per_second": 5653.563 }, { "epoch": 1.6048343657419877, "grad_norm": 0.7853709628304697, "learning_rate": 9.330218393778101e-07, "loss": 0.29099485874176023, "num_input_tokens_seen": 1042295560, "step": 23835, "train_runtime": 184359.1879, "train_tokens_per_second": 5653.613 }, { "epoch": 1.6051710207379477, "grad_norm": 0.8167824477623031, "learning_rate": 9.314843167560656e-07, "loss": 0.2913378715515137, "num_input_tokens_seen": 1042510744, "step": 23840, "train_runtime": 184393.2673, "train_tokens_per_second": 5653.735 }, { "epoch": 1.6055076757339077, "grad_norm": 0.7205357729428846, "learning_rate": 9.299479318817578e-07, "loss": 0.29028098583221434, "num_input_tokens_seen": 1042725176, "step": 23845, "train_runtime": 184433.6182, "train_tokens_per_second": 5653.661 }, { "epoch": 1.605844330729868, "grad_norm": 0.766245897972215, "learning_rate": 9.284126851845316e-07, "loss": 0.2781973361968994, "num_input_tokens_seen": 1042960480, "step": 23850, "train_runtime": 184473.0014, "train_tokens_per_second": 5653.73 }, { "epoch": 1.6061809857258282, "grad_norm": 0.7749016859550374, "learning_rate": 9.268785770937172e-07, "loss": 0.3008106231689453, "num_input_tokens_seen": 1043174632, "step": 23855, "train_runtime": 184513.6412, "train_tokens_per_second": 5653.645 }, { "epoch": 1.6065176407217883, "grad_norm": 0.8470162466279486, "learning_rate": 9.253456080383178e-07, "loss": 0.3095564842224121, "num_input_tokens_seen": 1043395416, "step": 23860, "train_runtime": 184550.3827, "train_tokens_per_second": 5653.716 }, { "epoch": 1.6068542957177483, "grad_norm": 0.806209780755035, "learning_rate": 9.238137784470286e-07, "loss": 0.32625675201416016, "num_input_tokens_seen": 1043602960, "step": 23865, "train_runtime": 184582.4698, "train_tokens_per_second": 5653.857 }, { "epoch": 1.6071909507137085, "grad_norm": 0.7896528179568558, "learning_rate": 9.222830887482153e-07, "loss": 0.2661672353744507, "num_input_tokens_seen": 1043826208, "step": 23870, "train_runtime": 184619.7546, "train_tokens_per_second": 5653.925 }, { "epoch": 1.6075276057096688, "grad_norm": 0.8946960868592196, "learning_rate": 9.207535393699351e-07, "loss": 0.3128221035003662, "num_input_tokens_seen": 1044034312, "step": 23875, "train_runtime": 184658.2466, "train_tokens_per_second": 5653.873 }, { "epoch": 1.6078642607056288, "grad_norm": 0.8295488010306658, "learning_rate": 9.192251307399197e-07, "loss": 0.29769034385681153, "num_input_tokens_seen": 1044252784, "step": 23880, "train_runtime": 184694.2905, "train_tokens_per_second": 5653.953 }, { "epoch": 1.6082009157015889, "grad_norm": 0.7652692381284338, "learning_rate": 9.176978632855842e-07, "loss": 0.2840586185455322, "num_input_tokens_seen": 1044471704, "step": 23885, "train_runtime": 184732.0494, "train_tokens_per_second": 5653.982 }, { "epoch": 1.608537570697549, "grad_norm": 0.7068737921677537, "learning_rate": 9.161717374340235e-07, "loss": 0.2887522459030151, "num_input_tokens_seen": 1044709256, "step": 23890, "train_runtime": 184770.2163, "train_tokens_per_second": 5654.1 }, { "epoch": 1.6088742256935094, "grad_norm": 0.865885020527099, "learning_rate": 9.14646753612014e-07, "loss": 0.3057317495346069, "num_input_tokens_seen": 1044932856, "step": 23895, "train_runtime": 184802.9042, "train_tokens_per_second": 5654.31 }, { "epoch": 1.6092108806894694, "grad_norm": 0.7260701569352984, "learning_rate": 9.131229122460112e-07, "loss": 0.29195594787597656, "num_input_tokens_seen": 1045169176, "step": 23900, "train_runtime": 184847.6389, "train_tokens_per_second": 5654.22 }, { "epoch": 1.6095475356854294, "grad_norm": 0.7232801129725709, "learning_rate": 9.116002137621566e-07, "loss": 0.30215911865234374, "num_input_tokens_seen": 1045388344, "step": 23905, "train_runtime": 184888.5248, "train_tokens_per_second": 5654.155 }, { "epoch": 1.6098841906813897, "grad_norm": 0.8623009349911321, "learning_rate": 9.100786585862626e-07, "loss": 0.33268914222717283, "num_input_tokens_seen": 1045590472, "step": 23910, "train_runtime": 184932.0284, "train_tokens_per_second": 5653.918 }, { "epoch": 1.61022084567735, "grad_norm": 0.8126716994808482, "learning_rate": 9.085582471438326e-07, "loss": 0.3007976531982422, "num_input_tokens_seen": 1045807448, "step": 23915, "train_runtime": 184968.2847, "train_tokens_per_second": 5653.983 }, { "epoch": 1.61055750067331, "grad_norm": 0.9161097317548726, "learning_rate": 9.070389798600394e-07, "loss": 0.3141302585601807, "num_input_tokens_seen": 1046022008, "step": 23920, "train_runtime": 185008.228, "train_tokens_per_second": 5653.922 }, { "epoch": 1.61089415566927, "grad_norm": 0.7937859830875522, "learning_rate": 9.055208571597451e-07, "loss": 0.3039546489715576, "num_input_tokens_seen": 1046240136, "step": 23925, "train_runtime": 185046.349, "train_tokens_per_second": 5653.936 }, { "epoch": 1.6112308106652302, "grad_norm": 0.7922862286264548, "learning_rate": 9.040038794674872e-07, "loss": 0.30896403789520266, "num_input_tokens_seen": 1046460096, "step": 23930, "train_runtime": 185087.8953, "train_tokens_per_second": 5653.855 }, { "epoch": 1.6115674656611905, "grad_norm": 0.7338711700679107, "learning_rate": 9.024880472074831e-07, "loss": 0.28701066970825195, "num_input_tokens_seen": 1046662408, "step": 23935, "train_runtime": 185132.2278, "train_tokens_per_second": 5653.594 }, { "epoch": 1.6119041206571505, "grad_norm": 0.7141524995931083, "learning_rate": 9.009733608036308e-07, "loss": 0.30707645416259766, "num_input_tokens_seen": 1046889064, "step": 23940, "train_runtime": 185169.7651, "train_tokens_per_second": 5653.672 }, { "epoch": 1.6122407756531107, "grad_norm": 0.7277986509792717, "learning_rate": 8.994598206795068e-07, "loss": 0.29622645378112794, "num_input_tokens_seen": 1047104032, "step": 23945, "train_runtime": 185205.0679, "train_tokens_per_second": 5653.755 }, { "epoch": 1.612577430649071, "grad_norm": 0.735906736712434, "learning_rate": 8.979474272583672e-07, "loss": 0.28798418045043944, "num_input_tokens_seen": 1047312440, "step": 23950, "train_runtime": 185247.3251, "train_tokens_per_second": 5653.59 }, { "epoch": 1.612914085645031, "grad_norm": 0.7572638632134422, "learning_rate": 8.964361809631517e-07, "loss": 0.3181246280670166, "num_input_tokens_seen": 1047539480, "step": 23955, "train_runtime": 185289.8341, "train_tokens_per_second": 5653.518 }, { "epoch": 1.613250740640991, "grad_norm": 0.8041739758256639, "learning_rate": 8.949260822164707e-07, "loss": 0.31255478858947755, "num_input_tokens_seen": 1047761560, "step": 23960, "train_runtime": 185326.4519, "train_tokens_per_second": 5653.6 }, { "epoch": 1.6135873956369513, "grad_norm": 0.7237860013192642, "learning_rate": 8.934171314406226e-07, "loss": 0.2988784074783325, "num_input_tokens_seen": 1047987312, "step": 23965, "train_runtime": 185361.8266, "train_tokens_per_second": 5653.739 }, { "epoch": 1.6139240506329116, "grad_norm": 0.7942034276838248, "learning_rate": 8.919093290575765e-07, "loss": 0.30140008926391604, "num_input_tokens_seen": 1048194320, "step": 23970, "train_runtime": 185405.0815, "train_tokens_per_second": 5653.536 }, { "epoch": 1.6142607056288716, "grad_norm": 0.8222295997811078, "learning_rate": 8.904026754889877e-07, "loss": 0.30414538383483886, "num_input_tokens_seen": 1048404056, "step": 23975, "train_runtime": 185444.5814, "train_tokens_per_second": 5653.463 }, { "epoch": 1.6145973606248316, "grad_norm": 0.8609222631961138, "learning_rate": 8.888971711561867e-07, "loss": 0.32020394802093505, "num_input_tokens_seen": 1048613480, "step": 23980, "train_runtime": 185486.5715, "train_tokens_per_second": 5653.312 }, { "epoch": 1.6149340156207919, "grad_norm": 0.8930736881841469, "learning_rate": 8.873928164801821e-07, "loss": 0.32930703163146974, "num_input_tokens_seen": 1048836768, "step": 23985, "train_runtime": 185525.6042, "train_tokens_per_second": 5653.326 }, { "epoch": 1.6152706706167521, "grad_norm": 0.7714631943477365, "learning_rate": 8.858896118816624e-07, "loss": 0.2910914421081543, "num_input_tokens_seen": 1049026440, "step": 23990, "train_runtime": 185568.2914, "train_tokens_per_second": 5653.048 }, { "epoch": 1.6156073256127121, "grad_norm": 0.759228215290319, "learning_rate": 8.84387557780994e-07, "loss": 0.2792020797729492, "num_input_tokens_seen": 1049235720, "step": 23995, "train_runtime": 185611.4217, "train_tokens_per_second": 5652.862 }, { "epoch": 1.6159439806086722, "grad_norm": 0.7757710745934641, "learning_rate": 8.828866545982196e-07, "loss": 0.2844292163848877, "num_input_tokens_seen": 1049455984, "step": 24000, "train_runtime": 185652.6171, "train_tokens_per_second": 5652.794 }, { "epoch": 1.6162806356046324, "grad_norm": 0.7617714598274377, "learning_rate": 8.813869027530664e-07, "loss": 0.28838918209075926, "num_input_tokens_seen": 1049680856, "step": 24005, "train_runtime": 185698.9704, "train_tokens_per_second": 5652.594 }, { "epoch": 1.6166172906005927, "grad_norm": 0.7142148786302278, "learning_rate": 8.798883026649302e-07, "loss": 0.31560914516448973, "num_input_tokens_seen": 1049914184, "step": 24010, "train_runtime": 185735.3739, "train_tokens_per_second": 5652.742 }, { "epoch": 1.6169539455965527, "grad_norm": 0.6136150732667002, "learning_rate": 8.783908547528947e-07, "loss": 0.2625638246536255, "num_input_tokens_seen": 1050126648, "step": 24015, "train_runtime": 185774.3978, "train_tokens_per_second": 5652.698 }, { "epoch": 1.6172906005925127, "grad_norm": 0.7756733989123253, "learning_rate": 8.768945594357109e-07, "loss": 0.29282054901123045, "num_input_tokens_seen": 1050339456, "step": 24020, "train_runtime": 185813.7393, "train_tokens_per_second": 5652.647 }, { "epoch": 1.617627255588473, "grad_norm": 0.900598117098456, "learning_rate": 8.753994171318175e-07, "loss": 0.3160220146179199, "num_input_tokens_seen": 1050547328, "step": 24025, "train_runtime": 185851.1561, "train_tokens_per_second": 5652.627 }, { "epoch": 1.6179639105844332, "grad_norm": 0.7405411228891803, "learning_rate": 8.739054282593245e-07, "loss": 0.3164478063583374, "num_input_tokens_seen": 1050771952, "step": 24030, "train_runtime": 185890.3938, "train_tokens_per_second": 5652.643 }, { "epoch": 1.6183005655803933, "grad_norm": 0.835344576020692, "learning_rate": 8.724125932360217e-07, "loss": 0.3083709716796875, "num_input_tokens_seen": 1050984192, "step": 24035, "train_runtime": 185929.4023, "train_tokens_per_second": 5652.598 }, { "epoch": 1.6186372205763533, "grad_norm": 0.7799187017517342, "learning_rate": 8.70920912479375e-07, "loss": 0.3174473762512207, "num_input_tokens_seen": 1051196368, "step": 24040, "train_runtime": 185964.2309, "train_tokens_per_second": 5652.68 }, { "epoch": 1.6189738755723135, "grad_norm": 0.7850184374405595, "learning_rate": 8.694303864065285e-07, "loss": 0.29400835037231443, "num_input_tokens_seen": 1051425808, "step": 24045, "train_runtime": 186005.0047, "train_tokens_per_second": 5652.675 }, { "epoch": 1.6193105305682738, "grad_norm": 0.7182128587421389, "learning_rate": 8.679410154343015e-07, "loss": 0.29439725875854494, "num_input_tokens_seen": 1051646216, "step": 24050, "train_runtime": 186042.8773, "train_tokens_per_second": 5652.709 }, { "epoch": 1.6196471855642338, "grad_norm": 0.7969951778334732, "learning_rate": 8.664527999791961e-07, "loss": 0.3235488414764404, "num_input_tokens_seen": 1051864880, "step": 24055, "train_runtime": 186082.635, "train_tokens_per_second": 5652.676 }, { "epoch": 1.6199838405601938, "grad_norm": 0.7800713274850012, "learning_rate": 8.649657404573819e-07, "loss": 0.29723272323608396, "num_input_tokens_seen": 1052093008, "step": 24060, "train_runtime": 186126.3919, "train_tokens_per_second": 5652.573 }, { "epoch": 1.620320495556154, "grad_norm": 0.8274231375759122, "learning_rate": 8.634798372847148e-07, "loss": 0.317378568649292, "num_input_tokens_seen": 1052316944, "step": 24065, "train_runtime": 186162.2307, "train_tokens_per_second": 5652.688 }, { "epoch": 1.6206571505521143, "grad_norm": 0.8056126386548218, "learning_rate": 8.619950908767189e-07, "loss": 0.2666431665420532, "num_input_tokens_seen": 1052516136, "step": 24070, "train_runtime": 186205.2929, "train_tokens_per_second": 5652.45 }, { "epoch": 1.6209938055480744, "grad_norm": 0.6724696382638301, "learning_rate": 8.605115016486016e-07, "loss": 0.2880539894104004, "num_input_tokens_seen": 1052748400, "step": 24075, "train_runtime": 186243.1874, "train_tokens_per_second": 5652.547 }, { "epoch": 1.6213304605440344, "grad_norm": 0.9066394567633849, "learning_rate": 8.590290700152426e-07, "loss": 0.2833811044692993, "num_input_tokens_seen": 1052963936, "step": 24080, "train_runtime": 186289.0516, "train_tokens_per_second": 5652.313 }, { "epoch": 1.6216671155399947, "grad_norm": 0.799201189010084, "learning_rate": 8.575477963912005e-07, "loss": 0.29882135391235354, "num_input_tokens_seen": 1053188096, "step": 24085, "train_runtime": 186329.9225, "train_tokens_per_second": 5652.276 }, { "epoch": 1.622003770535955, "grad_norm": 0.8755519590986088, "learning_rate": 8.560676811907071e-07, "loss": 0.3093993663787842, "num_input_tokens_seen": 1053409680, "step": 24090, "train_runtime": 186370.6512, "train_tokens_per_second": 5652.229 }, { "epoch": 1.622340425531915, "grad_norm": 1.5513430020002343, "learning_rate": 8.54588724827673e-07, "loss": 0.29143998622894285, "num_input_tokens_seen": 1053604304, "step": 24095, "train_runtime": 186412.1977, "train_tokens_per_second": 5652.014 }, { "epoch": 1.622677080527875, "grad_norm": 0.7491596315112452, "learning_rate": 8.531109277156818e-07, "loss": 0.2952460050582886, "num_input_tokens_seen": 1053836472, "step": 24100, "train_runtime": 186445.3192, "train_tokens_per_second": 5652.255 }, { "epoch": 1.6230137355238352, "grad_norm": 0.6130646121890772, "learning_rate": 8.516342902679986e-07, "loss": 0.26687233448028563, "num_input_tokens_seen": 1054042928, "step": 24105, "train_runtime": 186487.115, "train_tokens_per_second": 5652.095 }, { "epoch": 1.6233503905197955, "grad_norm": 0.7118183132847752, "learning_rate": 8.501588128975557e-07, "loss": 0.274417781829834, "num_input_tokens_seen": 1054266256, "step": 24110, "train_runtime": 186525.4577, "train_tokens_per_second": 5652.131 }, { "epoch": 1.6236870455157555, "grad_norm": 0.7790848429598987, "learning_rate": 8.486844960169704e-07, "loss": 0.28249123096466067, "num_input_tokens_seen": 1054484008, "step": 24115, "train_runtime": 186565.9108, "train_tokens_per_second": 5652.072 }, { "epoch": 1.6240237005117155, "grad_norm": 0.7894998002519212, "learning_rate": 8.472113400385257e-07, "loss": 0.2758941650390625, "num_input_tokens_seen": 1054711848, "step": 24120, "train_runtime": 186605.8621, "train_tokens_per_second": 5652.083 }, { "epoch": 1.6243603555076758, "grad_norm": 0.7543857092013571, "learning_rate": 8.457393453741886e-07, "loss": 0.3019557476043701, "num_input_tokens_seen": 1054923912, "step": 24125, "train_runtime": 186648.2364, "train_tokens_per_second": 5651.936 }, { "epoch": 1.624697010503636, "grad_norm": 0.7442690058985666, "learning_rate": 8.442685124355965e-07, "loss": 0.28956966400146483, "num_input_tokens_seen": 1055138184, "step": 24130, "train_runtime": 186689.7766, "train_tokens_per_second": 5651.826 }, { "epoch": 1.625033665499596, "grad_norm": 0.7707121718508636, "learning_rate": 8.427988416340633e-07, "loss": 0.31919891834259034, "num_input_tokens_seen": 1055341616, "step": 24135, "train_runtime": 186736.5031, "train_tokens_per_second": 5651.501 }, { "epoch": 1.625370320495556, "grad_norm": 0.8345320866926412, "learning_rate": 8.413303333805777e-07, "loss": 0.2868987560272217, "num_input_tokens_seen": 1055555328, "step": 24140, "train_runtime": 186778.9844, "train_tokens_per_second": 5651.36 }, { "epoch": 1.6257069754915163, "grad_norm": 0.832357010463937, "learning_rate": 8.398629880858034e-07, "loss": 0.3065673589706421, "num_input_tokens_seen": 1055788776, "step": 24145, "train_runtime": 186814.9017, "train_tokens_per_second": 5651.523 }, { "epoch": 1.6260436304874766, "grad_norm": 0.7264477849943358, "learning_rate": 8.383968061600778e-07, "loss": 0.30824875831604004, "num_input_tokens_seen": 1055998904, "step": 24150, "train_runtime": 186851.2697, "train_tokens_per_second": 5651.548 }, { "epoch": 1.6263802854834366, "grad_norm": 0.6983483917587298, "learning_rate": 8.36931788013417e-07, "loss": 0.2875575304031372, "num_input_tokens_seen": 1056224128, "step": 24155, "train_runtime": 186885.9871, "train_tokens_per_second": 5651.703 }, { "epoch": 1.6267169404793966, "grad_norm": 0.8238457852516533, "learning_rate": 8.354679340555044e-07, "loss": 0.30007798671722413, "num_input_tokens_seen": 1056436296, "step": 24160, "train_runtime": 186918.9055, "train_tokens_per_second": 5651.843 }, { "epoch": 1.6270535954753569, "grad_norm": 0.7716224609530045, "learning_rate": 8.34005244695707e-07, "loss": 0.28886971473693845, "num_input_tokens_seen": 1056648824, "step": 24165, "train_runtime": 186953.1199, "train_tokens_per_second": 5651.945 }, { "epoch": 1.6273902504713171, "grad_norm": 0.6680421386267813, "learning_rate": 8.325437203430558e-07, "loss": 0.29457979202270507, "num_input_tokens_seen": 1056867768, "step": 24170, "train_runtime": 186995.0671, "train_tokens_per_second": 5651.848 }, { "epoch": 1.6277269054672772, "grad_norm": 0.7051397648416529, "learning_rate": 8.310833614062652e-07, "loss": 0.295581316947937, "num_input_tokens_seen": 1057083272, "step": 24175, "train_runtime": 187032.373, "train_tokens_per_second": 5651.873 }, { "epoch": 1.6280635604632372, "grad_norm": 0.8804185228424846, "learning_rate": 8.296241682937189e-07, "loss": 0.2983792543411255, "num_input_tokens_seen": 1057309512, "step": 24180, "train_runtime": 187074.9311, "train_tokens_per_second": 5651.797 }, { "epoch": 1.6284002154591974, "grad_norm": 0.7277060223716454, "learning_rate": 8.281661414134761e-07, "loss": 0.2972233295440674, "num_input_tokens_seen": 1057522792, "step": 24185, "train_runtime": 187108.976, "train_tokens_per_second": 5651.908 }, { "epoch": 1.6287368704551577, "grad_norm": 0.7892086033151113, "learning_rate": 8.267092811732686e-07, "loss": 0.31084840297698973, "num_input_tokens_seen": 1057745072, "step": 24190, "train_runtime": 187148.6775, "train_tokens_per_second": 5651.897 }, { "epoch": 1.6290735254511177, "grad_norm": 0.730388450752643, "learning_rate": 8.252535879805029e-07, "loss": 0.2759894847869873, "num_input_tokens_seen": 1057972008, "step": 24195, "train_runtime": 187187.3763, "train_tokens_per_second": 5651.941 }, { "epoch": 1.6294101804470777, "grad_norm": 0.863594940750271, "learning_rate": 8.237990622422576e-07, "loss": 0.289616322517395, "num_input_tokens_seen": 1058191104, "step": 24200, "train_runtime": 187223.8174, "train_tokens_per_second": 5652.011 }, { "epoch": 1.629746835443038, "grad_norm": 0.7266468720434132, "learning_rate": 8.223457043652905e-07, "loss": 0.3101085662841797, "num_input_tokens_seen": 1058412784, "step": 24205, "train_runtime": 187256.143, "train_tokens_per_second": 5652.219 }, { "epoch": 1.6300834904389983, "grad_norm": 0.9420820301682334, "learning_rate": 8.208935147560227e-07, "loss": 0.2965271472930908, "num_input_tokens_seen": 1058609720, "step": 24210, "train_runtime": 187288.1131, "train_tokens_per_second": 5652.306 }, { "epoch": 1.6304201454349583, "grad_norm": 0.7345571411845794, "learning_rate": 8.194424938205597e-07, "loss": 0.3259326696395874, "num_input_tokens_seen": 1058845344, "step": 24215, "train_runtime": 187328.0703, "train_tokens_per_second": 5652.358 }, { "epoch": 1.6307568004309183, "grad_norm": 0.7486771661318714, "learning_rate": 8.179926419646705e-07, "loss": 0.28400454521179197, "num_input_tokens_seen": 1059062096, "step": 24220, "train_runtime": 187371.6715, "train_tokens_per_second": 5652.2 }, { "epoch": 1.6310934554268786, "grad_norm": 0.8281741934458996, "learning_rate": 8.165439595938047e-07, "loss": 0.32569429874420164, "num_input_tokens_seen": 1059262648, "step": 24225, "train_runtime": 187414.9864, "train_tokens_per_second": 5651.963 }, { "epoch": 1.6314301104228388, "grad_norm": 0.8133179081823259, "learning_rate": 8.150964471130801e-07, "loss": 0.2735768795013428, "num_input_tokens_seen": 1059491256, "step": 24230, "train_runtime": 187448.4434, "train_tokens_per_second": 5652.174 }, { "epoch": 1.6317667654187988, "grad_norm": 0.7466167890530678, "learning_rate": 8.136501049272899e-07, "loss": 0.30480170249938965, "num_input_tokens_seen": 1059706760, "step": 24235, "train_runtime": 187485.3647, "train_tokens_per_second": 5652.211 }, { "epoch": 1.6321034204147589, "grad_norm": 0.7655169967068027, "learning_rate": 8.122049334408983e-07, "loss": 0.29867599010467527, "num_input_tokens_seen": 1059920888, "step": 24240, "train_runtime": 187522.586, "train_tokens_per_second": 5652.231 }, { "epoch": 1.6324400754107191, "grad_norm": 0.7048483211838898, "learning_rate": 8.107609330580429e-07, "loss": 0.29615049362182616, "num_input_tokens_seen": 1060137784, "step": 24245, "train_runtime": 187563.0743, "train_tokens_per_second": 5652.167 }, { "epoch": 1.6327767304066794, "grad_norm": 0.7788326112043563, "learning_rate": 8.093181041825332e-07, "loss": 0.3028998613357544, "num_input_tokens_seen": 1060360840, "step": 24250, "train_runtime": 187603.6663, "train_tokens_per_second": 5652.133 }, { "epoch": 1.6331133854026394, "grad_norm": 0.8246354271264723, "learning_rate": 8.078764472178552e-07, "loss": 0.29851455688476564, "num_input_tokens_seen": 1060573408, "step": 24255, "train_runtime": 187643.6101, "train_tokens_per_second": 5652.062 }, { "epoch": 1.6334500403985994, "grad_norm": 0.7136275615926145, "learning_rate": 8.06435962567158e-07, "loss": 0.32530434131622316, "num_input_tokens_seen": 1060766968, "step": 24260, "train_runtime": 187685.5425, "train_tokens_per_second": 5651.831 }, { "epoch": 1.6337866953945597, "grad_norm": 0.7353400312549586, "learning_rate": 8.049966506332746e-07, "loss": 0.26018400192260743, "num_input_tokens_seen": 1060985712, "step": 24265, "train_runtime": 187718.4957, "train_tokens_per_second": 5652.004 }, { "epoch": 1.63412335039052, "grad_norm": 0.736074674468452, "learning_rate": 8.035585118186984e-07, "loss": 0.2798137664794922, "num_input_tokens_seen": 1061195896, "step": 24270, "train_runtime": 187751.2703, "train_tokens_per_second": 5652.137 }, { "epoch": 1.63446000538648, "grad_norm": 0.7545879942996399, "learning_rate": 8.021215465256038e-07, "loss": 0.2788818836212158, "num_input_tokens_seen": 1061420544, "step": 24275, "train_runtime": 187795.6161, "train_tokens_per_second": 5651.999 }, { "epoch": 1.63479666038244, "grad_norm": 0.7515197813453762, "learning_rate": 8.006857551558328e-07, "loss": 0.30008883476257325, "num_input_tokens_seen": 1061636496, "step": 24280, "train_runtime": 187842.4419, "train_tokens_per_second": 5651.739 }, { "epoch": 1.6351333153784002, "grad_norm": 0.8049426928966876, "learning_rate": 7.992511381108997e-07, "loss": 0.3101008415222168, "num_input_tokens_seen": 1061878752, "step": 24285, "train_runtime": 187875.4149, "train_tokens_per_second": 5652.037 }, { "epoch": 1.6354699703743605, "grad_norm": 0.7928126374708939, "learning_rate": 7.978176957919909e-07, "loss": 0.3050835132598877, "num_input_tokens_seen": 1062088984, "step": 24290, "train_runtime": 187921.6004, "train_tokens_per_second": 5651.766 }, { "epoch": 1.6358066253703205, "grad_norm": 0.660553687086565, "learning_rate": 7.963854285999634e-07, "loss": 0.27643623352050783, "num_input_tokens_seen": 1062308496, "step": 24295, "train_runtime": 187966.5083, "train_tokens_per_second": 5651.584 }, { "epoch": 1.6361432803662805, "grad_norm": 0.8664436436523667, "learning_rate": 7.949543369353452e-07, "loss": 0.30392279624938967, "num_input_tokens_seen": 1062508472, "step": 24300, "train_runtime": 188008.6162, "train_tokens_per_second": 5651.382 }, { "epoch": 1.6364799353622408, "grad_norm": 0.7681401573545563, "learning_rate": 7.9352442119834e-07, "loss": 0.3222590446472168, "num_input_tokens_seen": 1062721224, "step": 24305, "train_runtime": 188049.5257, "train_tokens_per_second": 5651.284 }, { "epoch": 1.636816590358201, "grad_norm": 0.7578044675754301, "learning_rate": 7.920956817888148e-07, "loss": 0.3079147577285767, "num_input_tokens_seen": 1062938784, "step": 24310, "train_runtime": 188085.9323, "train_tokens_per_second": 5651.347 }, { "epoch": 1.637153245354161, "grad_norm": 0.8771063708461605, "learning_rate": 7.906681191063165e-07, "loss": 0.2923039436340332, "num_input_tokens_seen": 1063160648, "step": 24315, "train_runtime": 188122.7957, "train_tokens_per_second": 5651.418 }, { "epoch": 1.637489900350121, "grad_norm": 0.7603147520393745, "learning_rate": 7.892417335500541e-07, "loss": 0.3094671964645386, "num_input_tokens_seen": 1063371504, "step": 24320, "train_runtime": 188158.9471, "train_tokens_per_second": 5651.453 }, { "epoch": 1.6378265553460813, "grad_norm": 0.828515228743802, "learning_rate": 7.878165255189146e-07, "loss": 0.32140753269195554, "num_input_tokens_seen": 1063574440, "step": 24325, "train_runtime": 188196.1254, "train_tokens_per_second": 5651.415 }, { "epoch": 1.6381632103420416, "grad_norm": 0.8506425251973367, "learning_rate": 7.863924954114522e-07, "loss": 0.28619048595428465, "num_input_tokens_seen": 1063782584, "step": 24330, "train_runtime": 188232.3371, "train_tokens_per_second": 5651.434 }, { "epoch": 1.6384998653380016, "grad_norm": 0.6750210682265397, "learning_rate": 7.849696436258919e-07, "loss": 0.2759582042694092, "num_input_tokens_seen": 1063995392, "step": 24335, "train_runtime": 188272.2346, "train_tokens_per_second": 5651.366 }, { "epoch": 1.6388365203339617, "grad_norm": 0.71118679601102, "learning_rate": 7.835479705601307e-07, "loss": 0.30858869552612306, "num_input_tokens_seen": 1064201992, "step": 24340, "train_runtime": 188310.5847, "train_tokens_per_second": 5651.313 }, { "epoch": 1.639173175329922, "grad_norm": 0.7067326301637101, "learning_rate": 7.821274766117337e-07, "loss": 0.3018312692642212, "num_input_tokens_seen": 1064418504, "step": 24345, "train_runtime": 188354.2732, "train_tokens_per_second": 5651.151 }, { "epoch": 1.6395098303258822, "grad_norm": 0.7701230824468515, "learning_rate": 7.807081621779367e-07, "loss": 0.3180276393890381, "num_input_tokens_seen": 1064640776, "step": 24350, "train_runtime": 188396.5704, "train_tokens_per_second": 5651.062 }, { "epoch": 1.6398464853218422, "grad_norm": 0.7453739839923318, "learning_rate": 7.792900276556509e-07, "loss": 0.30577759742736815, "num_input_tokens_seen": 1064866144, "step": 24355, "train_runtime": 188437.6782, "train_tokens_per_second": 5651.026 }, { "epoch": 1.6401831403178022, "grad_norm": 0.7840785820426818, "learning_rate": 7.778730734414469e-07, "loss": 0.3030556201934814, "num_input_tokens_seen": 1065082080, "step": 24360, "train_runtime": 188478.6851, "train_tokens_per_second": 5650.942 }, { "epoch": 1.6405197953137625, "grad_norm": 0.7537497153937553, "learning_rate": 7.764572999315772e-07, "loss": 0.2959816217422485, "num_input_tokens_seen": 1065308184, "step": 24365, "train_runtime": 188514.0839, "train_tokens_per_second": 5651.08 }, { "epoch": 1.6408564503097227, "grad_norm": 0.7520641802122896, "learning_rate": 7.750427075219536e-07, "loss": 0.3010838031768799, "num_input_tokens_seen": 1065519384, "step": 24370, "train_runtime": 188554.9706, "train_tokens_per_second": 5650.975 }, { "epoch": 1.6411931053056827, "grad_norm": 0.8548907262270895, "learning_rate": 7.736292966081655e-07, "loss": 0.28882603645324706, "num_input_tokens_seen": 1065712464, "step": 24375, "train_runtime": 188592.4974, "train_tokens_per_second": 5650.874 }, { "epoch": 1.6415297603016428, "grad_norm": 0.6533945003956135, "learning_rate": 7.722170675854673e-07, "loss": 0.26800405979156494, "num_input_tokens_seen": 1065939064, "step": 24380, "train_runtime": 188629.38, "train_tokens_per_second": 5650.971 }, { "epoch": 1.641866415297603, "grad_norm": 0.7624504132460348, "learning_rate": 7.70806020848785e-07, "loss": 0.2844860076904297, "num_input_tokens_seen": 1066159000, "step": 24385, "train_runtime": 188660.9475, "train_tokens_per_second": 5651.191 }, { "epoch": 1.6422030702935633, "grad_norm": 0.7515316499838955, "learning_rate": 7.693961567927133e-07, "loss": 0.2823920726776123, "num_input_tokens_seen": 1066381848, "step": 24390, "train_runtime": 188700.2202, "train_tokens_per_second": 5651.196 }, { "epoch": 1.6425397252895233, "grad_norm": 0.7063503273233152, "learning_rate": 7.679874758115153e-07, "loss": 0.2843328475952148, "num_input_tokens_seen": 1066612256, "step": 24395, "train_runtime": 188738.2146, "train_tokens_per_second": 5651.279 }, { "epoch": 1.6428763802854833, "grad_norm": 0.697327098375531, "learning_rate": 7.66579978299124e-07, "loss": 0.30366389751434325, "num_input_tokens_seen": 1066840032, "step": 24400, "train_runtime": 188775.3375, "train_tokens_per_second": 5651.374 }, { "epoch": 1.6432130352814436, "grad_norm": 1.0022326064476843, "learning_rate": 7.651736646491447e-07, "loss": 0.32686214447021483, "num_input_tokens_seen": 1067042480, "step": 24405, "train_runtime": 188812.9262, "train_tokens_per_second": 5651.321 }, { "epoch": 1.6435496902774038, "grad_norm": 0.623590025551479, "learning_rate": 7.63768535254844e-07, "loss": 0.27104051113128663, "num_input_tokens_seen": 1067263472, "step": 24410, "train_runtime": 188849.6348, "train_tokens_per_second": 5651.393 }, { "epoch": 1.6438863452733639, "grad_norm": 0.830785224698193, "learning_rate": 7.623645905091664e-07, "loss": 0.3036444902420044, "num_input_tokens_seen": 1067483856, "step": 24415, "train_runtime": 188892.9648, "train_tokens_per_second": 5651.263 }, { "epoch": 1.6442230002693239, "grad_norm": 0.8051008708219101, "learning_rate": 7.609618308047156e-07, "loss": 0.3053473472595215, "num_input_tokens_seen": 1067700112, "step": 24420, "train_runtime": 188925.2763, "train_tokens_per_second": 5651.441 }, { "epoch": 1.6445596552652841, "grad_norm": 0.7189604815408457, "learning_rate": 7.595602565337729e-07, "loss": 0.29787912368774416, "num_input_tokens_seen": 1067928768, "step": 24425, "train_runtime": 188973.0073, "train_tokens_per_second": 5651.224 }, { "epoch": 1.6448963102612444, "grad_norm": 0.8282739062629259, "learning_rate": 7.581598680882829e-07, "loss": 0.31963634490966797, "num_input_tokens_seen": 1068150624, "step": 24430, "train_runtime": 189012.1223, "train_tokens_per_second": 5651.228 }, { "epoch": 1.6452329652572044, "grad_norm": 0.8570504742841146, "learning_rate": 7.567606658598592e-07, "loss": 0.29708251953125, "num_input_tokens_seen": 1068367600, "step": 24435, "train_runtime": 189050.0223, "train_tokens_per_second": 5651.243 }, { "epoch": 1.6455696202531644, "grad_norm": 0.7274203559032685, "learning_rate": 7.553626502397848e-07, "loss": 0.3157409906387329, "num_input_tokens_seen": 1068589480, "step": 24440, "train_runtime": 189094.3938, "train_tokens_per_second": 5651.09 }, { "epoch": 1.6459062752491247, "grad_norm": 0.7307127250711936, "learning_rate": 7.539658216190099e-07, "loss": 0.2788280248641968, "num_input_tokens_seen": 1068810256, "step": 24445, "train_runtime": 189133.9599, "train_tokens_per_second": 5651.075 }, { "epoch": 1.646242930245085, "grad_norm": 0.8440106593735498, "learning_rate": 7.525701803881525e-07, "loss": 0.305745792388916, "num_input_tokens_seen": 1069020600, "step": 24450, "train_runtime": 189174.0585, "train_tokens_per_second": 5650.989 }, { "epoch": 1.646579585241045, "grad_norm": 0.9140651733358113, "learning_rate": 7.511757269375019e-07, "loss": 0.2875369548797607, "num_input_tokens_seen": 1069228640, "step": 24455, "train_runtime": 189220.4481, "train_tokens_per_second": 5650.703 }, { "epoch": 1.646916240237005, "grad_norm": 0.767638448585773, "learning_rate": 7.497824616570087e-07, "loss": 0.31629951000213624, "num_input_tokens_seen": 1069428344, "step": 24460, "train_runtime": 189254.1834, "train_tokens_per_second": 5650.751 }, { "epoch": 1.6472528952329653, "grad_norm": 0.7331009881607108, "learning_rate": 7.483903849362995e-07, "loss": 0.3073263168334961, "num_input_tokens_seen": 1069649936, "step": 24465, "train_runtime": 189293.0368, "train_tokens_per_second": 5650.762 }, { "epoch": 1.6475895502289255, "grad_norm": 0.7388708195492701, "learning_rate": 7.469994971646594e-07, "loss": 0.3005094289779663, "num_input_tokens_seen": 1069880992, "step": 24470, "train_runtime": 189337.0814, "train_tokens_per_second": 5650.668 }, { "epoch": 1.6479262052248855, "grad_norm": 0.7085554942280863, "learning_rate": 7.456097987310495e-07, "loss": 0.3060446262359619, "num_input_tokens_seen": 1070091864, "step": 24475, "train_runtime": 189375.3021, "train_tokens_per_second": 5650.641 }, { "epoch": 1.6482628602208456, "grad_norm": 0.9191804958073158, "learning_rate": 7.442212900240931e-07, "loss": 0.3100743770599365, "num_input_tokens_seen": 1070303776, "step": 24480, "train_runtime": 189415.09, "train_tokens_per_second": 5650.573 }, { "epoch": 1.6485995152168058, "grad_norm": 0.7298994648086058, "learning_rate": 7.42833971432082e-07, "loss": 0.2700855255126953, "num_input_tokens_seen": 1070514192, "step": 24485, "train_runtime": 189447.1005, "train_tokens_per_second": 5650.729 }, { "epoch": 1.648936170212766, "grad_norm": 0.7999546159714445, "learning_rate": 7.414478433429756e-07, "loss": 0.3064833641052246, "num_input_tokens_seen": 1070735968, "step": 24490, "train_runtime": 189484.8803, "train_tokens_per_second": 5650.773 }, { "epoch": 1.649272825208726, "grad_norm": 0.7881065041204545, "learning_rate": 7.400629061444003e-07, "loss": 0.29147264957427976, "num_input_tokens_seen": 1070953008, "step": 24495, "train_runtime": 189528.9666, "train_tokens_per_second": 5650.603 }, { "epoch": 1.6496094802046861, "grad_norm": 0.6964365331001868, "learning_rate": 7.386791602236482e-07, "loss": 0.32079496383666994, "num_input_tokens_seen": 1071182864, "step": 24500, "train_runtime": 189563.7574, "train_tokens_per_second": 5650.779 }, { "epoch": 1.6499461352006464, "grad_norm": 0.7757976985222431, "learning_rate": 7.372966059676834e-07, "loss": 0.34608256816864014, "num_input_tokens_seen": 1071404416, "step": 24505, "train_runtime": 189604.7721, "train_tokens_per_second": 5650.725 }, { "epoch": 1.6502827901966066, "grad_norm": 0.7009325679276259, "learning_rate": 7.359152437631273e-07, "loss": 0.31566901206970216, "num_input_tokens_seen": 1071628384, "step": 24510, "train_runtime": 189642.0172, "train_tokens_per_second": 5650.796 }, { "epoch": 1.6506194451925666, "grad_norm": 0.7512626090141364, "learning_rate": 7.345350739962781e-07, "loss": 0.29537224769592285, "num_input_tokens_seen": 1071849024, "step": 24515, "train_runtime": 189682.4667, "train_tokens_per_second": 5650.754 }, { "epoch": 1.6509561001885267, "grad_norm": 0.7652445412623243, "learning_rate": 7.331560970530921e-07, "loss": 0.29905951023101807, "num_input_tokens_seen": 1072071032, "step": 24520, "train_runtime": 189724.0471, "train_tokens_per_second": 5650.686 }, { "epoch": 1.651292755184487, "grad_norm": 0.6948758340555818, "learning_rate": 7.317783133191986e-07, "loss": 0.30941028594970704, "num_input_tokens_seen": 1072293992, "step": 24525, "train_runtime": 189754.0392, "train_tokens_per_second": 5650.968 }, { "epoch": 1.6516294101804472, "grad_norm": 0.7212176612484024, "learning_rate": 7.304017231798893e-07, "loss": 0.2879075050354004, "num_input_tokens_seen": 1072519464, "step": 24530, "train_runtime": 189793.2385, "train_tokens_per_second": 5650.989 }, { "epoch": 1.6519660651764072, "grad_norm": 0.8807710558741058, "learning_rate": 7.290263270201231e-07, "loss": 0.29528236389160156, "num_input_tokens_seen": 1072738280, "step": 24535, "train_runtime": 189830.8758, "train_tokens_per_second": 5651.021 }, { "epoch": 1.6523027201723672, "grad_norm": 0.7720732199868177, "learning_rate": 7.276521252245261e-07, "loss": 0.28215551376342773, "num_input_tokens_seen": 1072948632, "step": 24540, "train_runtime": 189866.7872, "train_tokens_per_second": 5651.06 }, { "epoch": 1.6526393751683275, "grad_norm": 0.8981368488565471, "learning_rate": 7.262791181773882e-07, "loss": 0.29338951110839845, "num_input_tokens_seen": 1073174384, "step": 24545, "train_runtime": 189911.0819, "train_tokens_per_second": 5650.931 }, { "epoch": 1.6529760301642877, "grad_norm": 0.8332745819366663, "learning_rate": 7.24907306262666e-07, "loss": 0.30844817161560056, "num_input_tokens_seen": 1073386448, "step": 24550, "train_runtime": 189955.2277, "train_tokens_per_second": 5650.734 }, { "epoch": 1.6533126851602478, "grad_norm": 0.7405815929469131, "learning_rate": 7.235366898639856e-07, "loss": 0.3130614995956421, "num_input_tokens_seen": 1073610192, "step": 24555, "train_runtime": 189996.8678, "train_tokens_per_second": 5650.673 }, { "epoch": 1.6536493401562078, "grad_norm": 0.7968518861817051, "learning_rate": 7.221672693646309e-07, "loss": 0.3168208122253418, "num_input_tokens_seen": 1073834968, "step": 24560, "train_runtime": 190036.3942, "train_tokens_per_second": 5650.681 }, { "epoch": 1.653985995152168, "grad_norm": 0.7509915696488056, "learning_rate": 7.207990451475594e-07, "loss": 0.30944645404815674, "num_input_tokens_seen": 1074068032, "step": 24565, "train_runtime": 190069.3229, "train_tokens_per_second": 5650.928 }, { "epoch": 1.6543226501481283, "grad_norm": 0.8218450305806543, "learning_rate": 7.194320175953901e-07, "loss": 0.3064124584197998, "num_input_tokens_seen": 1074280488, "step": 24570, "train_runtime": 190114.2338, "train_tokens_per_second": 5650.71 }, { "epoch": 1.6546593051440883, "grad_norm": 0.7421711436175688, "learning_rate": 7.180661870904066e-07, "loss": 0.285313081741333, "num_input_tokens_seen": 1074502024, "step": 24575, "train_runtime": 190155.2205, "train_tokens_per_second": 5650.658 }, { "epoch": 1.6549959601400483, "grad_norm": 0.7026987080451035, "learning_rate": 7.167015540145599e-07, "loss": 0.2826228618621826, "num_input_tokens_seen": 1074710072, "step": 24580, "train_runtime": 190194.1052, "train_tokens_per_second": 5650.596 }, { "epoch": 1.6553326151360086, "grad_norm": 0.7787998439821507, "learning_rate": 7.153381187494657e-07, "loss": 0.3077234745025635, "num_input_tokens_seen": 1074926392, "step": 24585, "train_runtime": 190228.7504, "train_tokens_per_second": 5650.704 }, { "epoch": 1.6556692701319689, "grad_norm": 0.7756508425427905, "learning_rate": 7.139758816764036e-07, "loss": 0.28848824501037595, "num_input_tokens_seen": 1075131776, "step": 24590, "train_runtime": 190266.2138, "train_tokens_per_second": 5650.671 }, { "epoch": 1.6560059251279289, "grad_norm": 0.6980517503857505, "learning_rate": 7.126148431763191e-07, "loss": 0.28489990234375, "num_input_tokens_seen": 1075362760, "step": 24595, "train_runtime": 190301.6247, "train_tokens_per_second": 5650.833 }, { "epoch": 1.656342580123889, "grad_norm": 0.7359183935227057, "learning_rate": 7.11255003629821e-07, "loss": 0.30712342262268066, "num_input_tokens_seen": 1075591552, "step": 24600, "train_runtime": 190339.4831, "train_tokens_per_second": 5650.911 }, { "epoch": 1.6566792351198492, "grad_norm": 0.7209263296219092, "learning_rate": 7.098963634171874e-07, "loss": 0.3017916679382324, "num_input_tokens_seen": 1075828544, "step": 24605, "train_runtime": 190376.2279, "train_tokens_per_second": 5651.066 }, { "epoch": 1.6570158901158094, "grad_norm": 0.8863531557142312, "learning_rate": 7.085389229183537e-07, "loss": 0.3059419631958008, "num_input_tokens_seen": 1076024056, "step": 24610, "train_runtime": 190418.8793, "train_tokens_per_second": 5650.827 }, { "epoch": 1.6573525451117694, "grad_norm": 0.812027087160403, "learning_rate": 7.071826825129264e-07, "loss": 0.28927106857299806, "num_input_tokens_seen": 1076235696, "step": 24615, "train_runtime": 190461.2181, "train_tokens_per_second": 5650.682 }, { "epoch": 1.6576892001077295, "grad_norm": 0.7711258281303948, "learning_rate": 7.058276425801735e-07, "loss": 0.30096821784973143, "num_input_tokens_seen": 1076456872, "step": 24620, "train_runtime": 190502.0918, "train_tokens_per_second": 5650.63 }, { "epoch": 1.6580258551036897, "grad_norm": 0.7870890841283721, "learning_rate": 7.044738034990273e-07, "loss": 0.29817709922790525, "num_input_tokens_seen": 1076662016, "step": 24625, "train_runtime": 190533.526, "train_tokens_per_second": 5650.775 }, { "epoch": 1.65836251009965, "grad_norm": 0.7826364707728534, "learning_rate": 7.031211656480841e-07, "loss": 0.3162134885787964, "num_input_tokens_seen": 1076875184, "step": 24630, "train_runtime": 190573.3113, "train_tokens_per_second": 5650.714 }, { "epoch": 1.65869916509561, "grad_norm": 0.7671703072883405, "learning_rate": 7.017697294056058e-07, "loss": 0.27853074073791506, "num_input_tokens_seen": 1077089776, "step": 24635, "train_runtime": 190615.0578, "train_tokens_per_second": 5650.602 }, { "epoch": 1.65903582009157, "grad_norm": 0.8067540848795106, "learning_rate": 7.004194951495163e-07, "loss": 0.3217106819152832, "num_input_tokens_seen": 1077318536, "step": 24640, "train_runtime": 190649.8372, "train_tokens_per_second": 5650.771 }, { "epoch": 1.6593724750875303, "grad_norm": 0.7719725402304747, "learning_rate": 6.990704632574046e-07, "loss": 0.29686970710754396, "num_input_tokens_seen": 1077547440, "step": 24645, "train_runtime": 190685.7981, "train_tokens_per_second": 5650.906 }, { "epoch": 1.6597091300834905, "grad_norm": 0.8088510895933726, "learning_rate": 6.977226341065219e-07, "loss": 0.299147891998291, "num_input_tokens_seen": 1077764672, "step": 24650, "train_runtime": 190723.2912, "train_tokens_per_second": 5650.934 }, { "epoch": 1.6600457850794506, "grad_norm": 0.7515417585035541, "learning_rate": 6.96376008073788e-07, "loss": 0.3067599296569824, "num_input_tokens_seen": 1077969096, "step": 24655, "train_runtime": 190758.1707, "train_tokens_per_second": 5650.972 }, { "epoch": 1.6603824400754106, "grad_norm": 0.7301895968368473, "learning_rate": 6.950305855357781e-07, "loss": 0.27429049015045165, "num_input_tokens_seen": 1078181392, "step": 24660, "train_runtime": 190792.7332, "train_tokens_per_second": 5651.061 }, { "epoch": 1.6607190950713708, "grad_norm": 0.7577040604392636, "learning_rate": 6.936863668687383e-07, "loss": 0.30942230224609374, "num_input_tokens_seen": 1078397824, "step": 24665, "train_runtime": 190830.5609, "train_tokens_per_second": 5651.075 }, { "epoch": 1.661055750067331, "grad_norm": 0.7766234601269146, "learning_rate": 6.923433524485745e-07, "loss": 0.323834753036499, "num_input_tokens_seen": 1078622016, "step": 24670, "train_runtime": 190872.8273, "train_tokens_per_second": 5650.998 }, { "epoch": 1.6613924050632911, "grad_norm": 0.7623394697980529, "learning_rate": 6.910015426508554e-07, "loss": 0.296146297454834, "num_input_tokens_seen": 1078847744, "step": 24675, "train_runtime": 190912.4664, "train_tokens_per_second": 5651.007 }, { "epoch": 1.6617290600592511, "grad_norm": 0.7664054805943663, "learning_rate": 6.896609378508152e-07, "loss": 0.309325647354126, "num_input_tokens_seen": 1079050512, "step": 24680, "train_runtime": 190950.4474, "train_tokens_per_second": 5650.945 }, { "epoch": 1.6620657150552114, "grad_norm": 0.7252601816921024, "learning_rate": 6.883215384233488e-07, "loss": 0.2978062629699707, "num_input_tokens_seen": 1079282736, "step": 24685, "train_runtime": 190991.7978, "train_tokens_per_second": 5650.938 }, { "epoch": 1.6624023700511716, "grad_norm": 0.8104244979601277, "learning_rate": 6.869833447430152e-07, "loss": 0.28819808959960935, "num_input_tokens_seen": 1079488008, "step": 24690, "train_runtime": 191037.7882, "train_tokens_per_second": 5650.652 }, { "epoch": 1.6627390250471317, "grad_norm": 0.7648578275299457, "learning_rate": 6.856463571840361e-07, "loss": 0.2954545021057129, "num_input_tokens_seen": 1079693528, "step": 24695, "train_runtime": 191074.9276, "train_tokens_per_second": 5650.629 }, { "epoch": 1.6630756800430917, "grad_norm": 0.7776160702348354, "learning_rate": 6.843105761202945e-07, "loss": 0.3160905599594116, "num_input_tokens_seen": 1079922112, "step": 24700, "train_runtime": 191116.2384, "train_tokens_per_second": 5650.604 }, { "epoch": 1.663412335039052, "grad_norm": 0.795996876323385, "learning_rate": 6.829760019253412e-07, "loss": 0.3114809513092041, "num_input_tokens_seen": 1080138072, "step": 24705, "train_runtime": 191153.6294, "train_tokens_per_second": 5650.628 }, { "epoch": 1.6637489900350122, "grad_norm": 0.7322911069723348, "learning_rate": 6.816426349723804e-07, "loss": 0.30275850296020507, "num_input_tokens_seen": 1080349800, "step": 24710, "train_runtime": 191191.3873, "train_tokens_per_second": 5650.62 }, { "epoch": 1.6640856450309722, "grad_norm": 0.6721252860586514, "learning_rate": 6.803104756342877e-07, "loss": 0.2700210094451904, "num_input_tokens_seen": 1080576104, "step": 24715, "train_runtime": 191227.8925, "train_tokens_per_second": 5650.724 }, { "epoch": 1.6644223000269323, "grad_norm": 0.7184313716768772, "learning_rate": 6.789795242835962e-07, "loss": 0.26948862075805663, "num_input_tokens_seen": 1080793368, "step": 24720, "train_runtime": 191269.297, "train_tokens_per_second": 5650.637 }, { "epoch": 1.6647589550228925, "grad_norm": 0.7596106189238437, "learning_rate": 6.776497812925015e-07, "loss": 0.3047426700592041, "num_input_tokens_seen": 1081001160, "step": 24725, "train_runtime": 191307.1705, "train_tokens_per_second": 5650.605 }, { "epoch": 1.6650956100188528, "grad_norm": 0.8078999876649536, "learning_rate": 6.763212470328628e-07, "loss": 0.3334406614303589, "num_input_tokens_seen": 1081221944, "step": 24730, "train_runtime": 191348.8888, "train_tokens_per_second": 5650.526 }, { "epoch": 1.6654322650148128, "grad_norm": 0.7785010647558146, "learning_rate": 6.749939218762003e-07, "loss": 0.2895099878311157, "num_input_tokens_seen": 1081439048, "step": 24735, "train_runtime": 191390.3574, "train_tokens_per_second": 5650.436 }, { "epoch": 1.6657689200107728, "grad_norm": 0.7473396001618127, "learning_rate": 6.736678061936958e-07, "loss": 0.3205715656280518, "num_input_tokens_seen": 1081670648, "step": 24740, "train_runtime": 191432.0544, "train_tokens_per_second": 5650.416 }, { "epoch": 1.666105575006733, "grad_norm": 0.8395952302334243, "learning_rate": 6.723429003561937e-07, "loss": 0.325761604309082, "num_input_tokens_seen": 1081907840, "step": 24745, "train_runtime": 191466.0452, "train_tokens_per_second": 5650.651 }, { "epoch": 1.6664422300026933, "grad_norm": 0.7553522775373878, "learning_rate": 6.710192047341984e-07, "loss": 0.2971907615661621, "num_input_tokens_seen": 1082129744, "step": 24750, "train_runtime": 191505.5101, "train_tokens_per_second": 5650.645 }, { "epoch": 1.6667788849986533, "grad_norm": 0.7670068129458077, "learning_rate": 6.69696719697881e-07, "loss": 0.29376702308654784, "num_input_tokens_seen": 1082352688, "step": 24755, "train_runtime": 191544.0035, "train_tokens_per_second": 5650.674 }, { "epoch": 1.6671155399946134, "grad_norm": 0.7937246542094001, "learning_rate": 6.683754456170655e-07, "loss": 0.27995355129241944, "num_input_tokens_seen": 1082568000, "step": 24760, "train_runtime": 191576.7889, "train_tokens_per_second": 5650.831 }, { "epoch": 1.6674521949905736, "grad_norm": 0.7863716640239266, "learning_rate": 6.670553828612448e-07, "loss": 0.28558523654937745, "num_input_tokens_seen": 1082762664, "step": 24765, "train_runtime": 191615.9134, "train_tokens_per_second": 5650.693 }, { "epoch": 1.6677888499865339, "grad_norm": 0.6755324668287188, "learning_rate": 6.657365317995696e-07, "loss": 0.2899418592453003, "num_input_tokens_seen": 1082980808, "step": 24770, "train_runtime": 191656.4559, "train_tokens_per_second": 5650.636 }, { "epoch": 1.668125504982494, "grad_norm": 0.7089937331683779, "learning_rate": 6.644188928008521e-07, "loss": 0.31790828704833984, "num_input_tokens_seen": 1083191992, "step": 24775, "train_runtime": 191696.5978, "train_tokens_per_second": 5650.554 }, { "epoch": 1.668462159978454, "grad_norm": 0.8389878605630636, "learning_rate": 6.631024662335667e-07, "loss": 0.31216111183166506, "num_input_tokens_seen": 1083409256, "step": 24780, "train_runtime": 191745.9321, "train_tokens_per_second": 5650.233 }, { "epoch": 1.6687988149744142, "grad_norm": 0.7518345608186, "learning_rate": 6.617872524658469e-07, "loss": 0.29103267192840576, "num_input_tokens_seen": 1083638560, "step": 24785, "train_runtime": 191781.1772, "train_tokens_per_second": 5650.391 }, { "epoch": 1.6691354699703744, "grad_norm": 0.8193494154451724, "learning_rate": 6.604732518654882e-07, "loss": 0.3304905414581299, "num_input_tokens_seen": 1083853344, "step": 24790, "train_runtime": 191823.5191, "train_tokens_per_second": 5650.263 }, { "epoch": 1.6694721249663345, "grad_norm": 0.8968284580615762, "learning_rate": 6.591604647999473e-07, "loss": 0.32892765998840334, "num_input_tokens_seen": 1084083632, "step": 24795, "train_runtime": 191860.6602, "train_tokens_per_second": 5650.37 }, { "epoch": 1.6698087799622945, "grad_norm": 0.6910607916103046, "learning_rate": 6.57848891636339e-07, "loss": 0.2843611478805542, "num_input_tokens_seen": 1084309072, "step": 24800, "train_runtime": 191903.5578, "train_tokens_per_second": 5650.281 }, { "epoch": 1.6701454349582547, "grad_norm": 0.7582706445392589, "learning_rate": 6.565385327414441e-07, "loss": 0.30639631748199464, "num_input_tokens_seen": 1084535760, "step": 24805, "train_runtime": 191937.737, "train_tokens_per_second": 5650.456 }, { "epoch": 1.670482089954215, "grad_norm": 0.8230500682984503, "learning_rate": 6.552293884816968e-07, "loss": 0.2900113582611084, "num_input_tokens_seen": 1084761472, "step": 24810, "train_runtime": 191977.452, "train_tokens_per_second": 5650.463 }, { "epoch": 1.670818744950175, "grad_norm": 0.6579326078890422, "learning_rate": 6.539214592231968e-07, "loss": 0.29627652168273927, "num_input_tokens_seen": 1084987552, "step": 24815, "train_runtime": 192018.4764, "train_tokens_per_second": 5650.433 }, { "epoch": 1.671155399946135, "grad_norm": 0.7194038569880106, "learning_rate": 6.526147453317028e-07, "loss": 0.26366333961486815, "num_input_tokens_seen": 1085201944, "step": 24820, "train_runtime": 192058.3704, "train_tokens_per_second": 5650.376 }, { "epoch": 1.6714920549420953, "grad_norm": 0.7597781908310334, "learning_rate": 6.513092471726307e-07, "loss": 0.299773645401001, "num_input_tokens_seen": 1085434936, "step": 24825, "train_runtime": 192099.0636, "train_tokens_per_second": 5650.392 }, { "epoch": 1.6718287099380555, "grad_norm": 0.7278296909083918, "learning_rate": 6.500049651110635e-07, "loss": 0.2928581714630127, "num_input_tokens_seen": 1085656760, "step": 24830, "train_runtime": 192139.5855, "train_tokens_per_second": 5650.354 }, { "epoch": 1.6721653649340156, "grad_norm": 0.7587076551124298, "learning_rate": 6.487018995117339e-07, "loss": 0.2924539089202881, "num_input_tokens_seen": 1085894200, "step": 24835, "train_runtime": 192174.6364, "train_tokens_per_second": 5650.559 }, { "epoch": 1.6725020199299756, "grad_norm": 0.7823318054145896, "learning_rate": 6.474000507390455e-07, "loss": 0.2911822319030762, "num_input_tokens_seen": 1086112280, "step": 24840, "train_runtime": 192208.7768, "train_tokens_per_second": 5650.69 }, { "epoch": 1.6728386749259359, "grad_norm": 0.7008110558611228, "learning_rate": 6.460994191570513e-07, "loss": 0.3034616470336914, "num_input_tokens_seen": 1086334184, "step": 24845, "train_runtime": 192246.1123, "train_tokens_per_second": 5650.747 }, { "epoch": 1.673175329921896, "grad_norm": 0.7292792811187331, "learning_rate": 6.448000051294717e-07, "loss": 0.2885445594787598, "num_input_tokens_seen": 1086553800, "step": 24850, "train_runtime": 192284.9452, "train_tokens_per_second": 5650.748 }, { "epoch": 1.6735119849178561, "grad_norm": 0.6923122611597387, "learning_rate": 6.435018090196832e-07, "loss": 0.30068202018737794, "num_input_tokens_seen": 1086783696, "step": 24855, "train_runtime": 192321.9072, "train_tokens_per_second": 5650.858 }, { "epoch": 1.6738486399138162, "grad_norm": 1.2221971616080631, "learning_rate": 6.42204831190722e-07, "loss": 0.2921877861022949, "num_input_tokens_seen": 1087006792, "step": 24860, "train_runtime": 192356.0704, "train_tokens_per_second": 5651.014 }, { "epoch": 1.6741852949097764, "grad_norm": 0.7759288823452887, "learning_rate": 6.409090720052835e-07, "loss": 0.30269834995269773, "num_input_tokens_seen": 1087221944, "step": 24865, "train_runtime": 192396.3099, "train_tokens_per_second": 5650.95 }, { "epoch": 1.6745219499057367, "grad_norm": 0.7489484593312903, "learning_rate": 6.396145318257229e-07, "loss": 0.27388882637023926, "num_input_tokens_seen": 1087443824, "step": 24870, "train_runtime": 192433.614, "train_tokens_per_second": 5651.008 }, { "epoch": 1.6748586049016967, "grad_norm": 0.7471747560717638, "learning_rate": 6.383212110140535e-07, "loss": 0.31777362823486327, "num_input_tokens_seen": 1087659568, "step": 24875, "train_runtime": 192469.464, "train_tokens_per_second": 5651.076 }, { "epoch": 1.6751952598976567, "grad_norm": 0.9939208015357779, "learning_rate": 6.370291099319509e-07, "loss": 0.3115004301071167, "num_input_tokens_seen": 1087852096, "step": 24880, "train_runtime": 192505.3832, "train_tokens_per_second": 5651.022 }, { "epoch": 1.675531914893617, "grad_norm": 0.7589414568505637, "learning_rate": 6.357382289407433e-07, "loss": 0.29903695583343504, "num_input_tokens_seen": 1088082304, "step": 24885, "train_runtime": 192540.2873, "train_tokens_per_second": 5651.193 }, { "epoch": 1.6758685698895772, "grad_norm": 0.7522829988493125, "learning_rate": 6.344485684014251e-07, "loss": 0.3122910499572754, "num_input_tokens_seen": 1088296296, "step": 24890, "train_runtime": 192578.9655, "train_tokens_per_second": 5651.169 }, { "epoch": 1.6762052248855372, "grad_norm": 0.7718700735790412, "learning_rate": 6.33160128674642e-07, "loss": 0.31540684700012206, "num_input_tokens_seen": 1088501864, "step": 24895, "train_runtime": 192615.6028, "train_tokens_per_second": 5651.161 }, { "epoch": 1.6765418798814973, "grad_norm": 0.7172203437810806, "learning_rate": 6.318729101207055e-07, "loss": 0.2925147533416748, "num_input_tokens_seen": 1088727288, "step": 24900, "train_runtime": 192657.5288, "train_tokens_per_second": 5651.102 }, { "epoch": 1.6768785348774575, "grad_norm": 0.6793461071435637, "learning_rate": 6.305869130995807e-07, "loss": 0.30594768524169924, "num_input_tokens_seen": 1088947848, "step": 24905, "train_runtime": 192692.2858, "train_tokens_per_second": 5651.227 }, { "epoch": 1.6772151898734178, "grad_norm": 0.8065807442493926, "learning_rate": 6.293021379708924e-07, "loss": 0.30313916206359864, "num_input_tokens_seen": 1089171240, "step": 24910, "train_runtime": 192732.2584, "train_tokens_per_second": 5651.214 }, { "epoch": 1.6775518448693778, "grad_norm": 0.812051527961556, "learning_rate": 6.280185850939241e-07, "loss": 0.31810295581817627, "num_input_tokens_seen": 1089387216, "step": 24915, "train_runtime": 192774.0539, "train_tokens_per_second": 5651.109 }, { "epoch": 1.677888499865338, "grad_norm": 0.8171798449848718, "learning_rate": 6.267362548276173e-07, "loss": 0.30693349838256834, "num_input_tokens_seen": 1089597552, "step": 24920, "train_runtime": 192811.4332, "train_tokens_per_second": 5651.104 }, { "epoch": 1.6782251548612983, "grad_norm": 0.9137416038709986, "learning_rate": 6.254551475305703e-07, "loss": 0.30268676280975343, "num_input_tokens_seen": 1089790616, "step": 24925, "train_runtime": 192849.8209, "train_tokens_per_second": 5650.981 }, { "epoch": 1.6785618098572583, "grad_norm": 0.80355688108705, "learning_rate": 6.241752635610443e-07, "loss": 0.31978979110717776, "num_input_tokens_seen": 1090007856, "step": 24930, "train_runtime": 192886.1002, "train_tokens_per_second": 5651.044 }, { "epoch": 1.6788984648532184, "grad_norm": 0.9368900433932702, "learning_rate": 6.228966032769496e-07, "loss": 0.31137659549713137, "num_input_tokens_seen": 1090222152, "step": 24935, "train_runtime": 192922.3211, "train_tokens_per_second": 5651.094 }, { "epoch": 1.6792351198491786, "grad_norm": 0.8015786582216125, "learning_rate": 6.216191670358651e-07, "loss": 0.29123806953430176, "num_input_tokens_seen": 1090437952, "step": 24940, "train_runtime": 192965.473, "train_tokens_per_second": 5650.949 }, { "epoch": 1.6795717748451389, "grad_norm": 0.7556404800034242, "learning_rate": 6.203429551950163e-07, "loss": 0.32757062911987306, "num_input_tokens_seen": 1090662752, "step": 24945, "train_runtime": 193011.4944, "train_tokens_per_second": 5650.766 }, { "epoch": 1.679908429841099, "grad_norm": 0.8290622091556459, "learning_rate": 6.19067968111296e-07, "loss": 0.28361237049102783, "num_input_tokens_seen": 1090869792, "step": 24950, "train_runtime": 193048.7244, "train_tokens_per_second": 5650.749 }, { "epoch": 1.680245084837059, "grad_norm": 0.7116384964210178, "learning_rate": 6.177942061412478e-07, "loss": 0.2768688678741455, "num_input_tokens_seen": 1091083944, "step": 24955, "train_runtime": 193088.2417, "train_tokens_per_second": 5650.701 }, { "epoch": 1.6805817398330192, "grad_norm": 0.7009278311455667, "learning_rate": 6.16521669641077e-07, "loss": 0.2864533424377441, "num_input_tokens_seen": 1091313248, "step": 24960, "train_runtime": 193120.829, "train_tokens_per_second": 5650.935 }, { "epoch": 1.6809183948289794, "grad_norm": 0.7261926667581532, "learning_rate": 6.152503589666426e-07, "loss": 0.30624988079071047, "num_input_tokens_seen": 1091544272, "step": 24965, "train_runtime": 193157.6847, "train_tokens_per_second": 5651.053 }, { "epoch": 1.6812550498249395, "grad_norm": 0.7142592236914898, "learning_rate": 6.139802744734636e-07, "loss": 0.26999435424804685, "num_input_tokens_seen": 1091761648, "step": 24970, "train_runtime": 193193.4372, "train_tokens_per_second": 5651.132 }, { "epoch": 1.6815917048208995, "grad_norm": 0.8017434808157823, "learning_rate": 6.127114165167142e-07, "loss": 0.26949467658996584, "num_input_tokens_seen": 1091969864, "step": 24975, "train_runtime": 193228.9139, "train_tokens_per_second": 5651.172 }, { "epoch": 1.6819283598168597, "grad_norm": 0.8597502504635929, "learning_rate": 6.11443785451229e-07, "loss": 0.30141243934631345, "num_input_tokens_seen": 1092190952, "step": 24980, "train_runtime": 193269.634, "train_tokens_per_second": 5651.125 }, { "epoch": 1.68226501481282, "grad_norm": 0.7558509297387581, "learning_rate": 6.101773816314926e-07, "loss": 0.29298968315124513, "num_input_tokens_seen": 1092417104, "step": 24985, "train_runtime": 193306.8721, "train_tokens_per_second": 5651.207 }, { "epoch": 1.68260166980878, "grad_norm": 0.7852414890479306, "learning_rate": 6.089122054116558e-07, "loss": 0.3086401462554932, "num_input_tokens_seen": 1092645416, "step": 24990, "train_runtime": 193342.0721, "train_tokens_per_second": 5651.359 }, { "epoch": 1.68293832480474, "grad_norm": 0.8486422869311524, "learning_rate": 6.076482571455161e-07, "loss": 0.2916858196258545, "num_input_tokens_seen": 1092868304, "step": 24995, "train_runtime": 193383.0382, "train_tokens_per_second": 5651.314 }, { "epoch": 1.6832749798007003, "grad_norm": 0.8736609060726518, "learning_rate": 6.063855371865369e-07, "loss": 0.30973148345947266, "num_input_tokens_seen": 1093073112, "step": 25000, "train_runtime": 193420.2455, "train_tokens_per_second": 5651.286 }, { "epoch": 1.6836116347966605, "grad_norm": 0.8270587506153307, "learning_rate": 6.051240458878316e-07, "loss": 0.3318582057952881, "num_input_tokens_seen": 1093292280, "step": 25005, "train_runtime": 193460.4002, "train_tokens_per_second": 5651.246 }, { "epoch": 1.6839482897926206, "grad_norm": 0.7861426638271823, "learning_rate": 6.038637836021721e-07, "loss": 0.30891571044921873, "num_input_tokens_seen": 1093512488, "step": 25010, "train_runtime": 193500.033, "train_tokens_per_second": 5651.226 }, { "epoch": 1.6842849447885806, "grad_norm": 0.7570592424235427, "learning_rate": 6.026047506819882e-07, "loss": 0.29696998596191404, "num_input_tokens_seen": 1093724280, "step": 25015, "train_runtime": 193535.9844, "train_tokens_per_second": 5651.271 }, { "epoch": 1.6846215997845408, "grad_norm": 0.8023108005761309, "learning_rate": 6.013469474793632e-07, "loss": 0.2949728012084961, "num_input_tokens_seen": 1093945480, "step": 25020, "train_runtime": 193575.5488, "train_tokens_per_second": 5651.259 }, { "epoch": 1.684958254780501, "grad_norm": 0.792969947232272, "learning_rate": 6.000903743460368e-07, "loss": 0.2946459770202637, "num_input_tokens_seen": 1094164496, "step": 25025, "train_runtime": 193619.1001, "train_tokens_per_second": 5651.119 }, { "epoch": 1.6852949097764611, "grad_norm": 0.7249873667459386, "learning_rate": 5.98835031633409e-07, "loss": 0.296980881690979, "num_input_tokens_seen": 1094387696, "step": 25030, "train_runtime": 193658.0253, "train_tokens_per_second": 5651.135 }, { "epoch": 1.6856315647724212, "grad_norm": 0.7187877526122118, "learning_rate": 5.97580919692528e-07, "loss": 0.30903480052947996, "num_input_tokens_seen": 1094621216, "step": 25035, "train_runtime": 193690.3611, "train_tokens_per_second": 5651.397 }, { "epoch": 1.6859682197683814, "grad_norm": 0.7738587622533499, "learning_rate": 5.963280388741072e-07, "loss": 0.2778623104095459, "num_input_tokens_seen": 1094843312, "step": 25040, "train_runtime": 193726.0711, "train_tokens_per_second": 5651.502 }, { "epoch": 1.6863048747643417, "grad_norm": 0.8921293625641102, "learning_rate": 5.950763895285055e-07, "loss": 0.3040936946868896, "num_input_tokens_seen": 1095048760, "step": 25045, "train_runtime": 193766.9375, "train_tokens_per_second": 5651.371 }, { "epoch": 1.6866415297603017, "grad_norm": 0.6626481867816244, "learning_rate": 5.938259720057465e-07, "loss": 0.29845240116119387, "num_input_tokens_seen": 1095275144, "step": 25050, "train_runtime": 193803.6462, "train_tokens_per_second": 5651.468 }, { "epoch": 1.6869781847562617, "grad_norm": 0.7608946538453196, "learning_rate": 5.925767866555043e-07, "loss": 0.28672802448272705, "num_input_tokens_seen": 1095488208, "step": 25055, "train_runtime": 193846.2174, "train_tokens_per_second": 5651.326 }, { "epoch": 1.687314839752222, "grad_norm": 0.8656369475130261, "learning_rate": 5.913288338271095e-07, "loss": 0.31831324100494385, "num_input_tokens_seen": 1095711504, "step": 25060, "train_runtime": 193884.7583, "train_tokens_per_second": 5651.355 }, { "epoch": 1.6876514947481822, "grad_norm": 0.7023811573666321, "learning_rate": 5.900821138695478e-07, "loss": 0.29593048095703123, "num_input_tokens_seen": 1095931728, "step": 25065, "train_runtime": 193924.6678, "train_tokens_per_second": 5651.327 }, { "epoch": 1.6879881497441422, "grad_norm": 0.760116486923957, "learning_rate": 5.888366271314605e-07, "loss": 0.2997978448867798, "num_input_tokens_seen": 1096158920, "step": 25070, "train_runtime": 193970.5562, "train_tokens_per_second": 5651.161 }, { "epoch": 1.6883248047401023, "grad_norm": 0.6921190819902673, "learning_rate": 5.875923739611439e-07, "loss": 0.3102496385574341, "num_input_tokens_seen": 1096386400, "step": 25075, "train_runtime": 194005.6003, "train_tokens_per_second": 5651.313 }, { "epoch": 1.6886614597360625, "grad_norm": 0.708393747684828, "learning_rate": 5.863493547065513e-07, "loss": 0.288178825378418, "num_input_tokens_seen": 1096598208, "step": 25080, "train_runtime": 194046.4638, "train_tokens_per_second": 5651.215 }, { "epoch": 1.6889981147320228, "grad_norm": 0.7325173487118091, "learning_rate": 5.851075697152858e-07, "loss": 0.2890732765197754, "num_input_tokens_seen": 1096830840, "step": 25085, "train_runtime": 194089.2226, "train_tokens_per_second": 5651.168 }, { "epoch": 1.6893347697279828, "grad_norm": 1.084295866928116, "learning_rate": 5.838670193346118e-07, "loss": 0.3075998067855835, "num_input_tokens_seen": 1097042768, "step": 25090, "train_runtime": 194131.2034, "train_tokens_per_second": 5651.038 }, { "epoch": 1.6896714247239428, "grad_norm": 0.708754132607845, "learning_rate": 5.826277039114426e-07, "loss": 0.2823533773422241, "num_input_tokens_seen": 1097258936, "step": 25095, "train_runtime": 194173.4531, "train_tokens_per_second": 5650.921 }, { "epoch": 1.690008079719903, "grad_norm": 0.6971867426568854, "learning_rate": 5.813896237923505e-07, "loss": 0.33135075569152833, "num_input_tokens_seen": 1097479600, "step": 25100, "train_runtime": 194218.3152, "train_tokens_per_second": 5650.752 }, { "epoch": 1.6903447347158633, "grad_norm": 0.7270149386031489, "learning_rate": 5.801527793235606e-07, "loss": 0.2957238912582397, "num_input_tokens_seen": 1097708984, "step": 25105, "train_runtime": 194258.1829, "train_tokens_per_second": 5650.773 }, { "epoch": 1.6906813897118234, "grad_norm": 0.882744897146511, "learning_rate": 5.789171708509516e-07, "loss": 0.28771932125091554, "num_input_tokens_seen": 1097906256, "step": 25110, "train_runtime": 194299.2332, "train_tokens_per_second": 5650.595 }, { "epoch": 1.6910180447077834, "grad_norm": 0.7410230789420439, "learning_rate": 5.776827987200584e-07, "loss": 0.30194315910339353, "num_input_tokens_seen": 1098128136, "step": 25115, "train_runtime": 194336.6611, "train_tokens_per_second": 5650.648 }, { "epoch": 1.6913546997037436, "grad_norm": 0.7896654861282312, "learning_rate": 5.764496632760691e-07, "loss": 0.2923448085784912, "num_input_tokens_seen": 1098334664, "step": 25120, "train_runtime": 194373.4203, "train_tokens_per_second": 5650.642 }, { "epoch": 1.6916913546997039, "grad_norm": 0.7314826062008781, "learning_rate": 5.752177648638241e-07, "loss": 0.27889845371246336, "num_input_tokens_seen": 1098559728, "step": 25125, "train_runtime": 194408.4815, "train_tokens_per_second": 5650.781 }, { "epoch": 1.692028009695664, "grad_norm": 0.8906343966024878, "learning_rate": 5.739871038278239e-07, "loss": 0.3101338863372803, "num_input_tokens_seen": 1098782712, "step": 25130, "train_runtime": 194440.3466, "train_tokens_per_second": 5651.002 }, { "epoch": 1.692364664691624, "grad_norm": 0.7281493386147246, "learning_rate": 5.727576805122142e-07, "loss": 0.28267052173614504, "num_input_tokens_seen": 1098991872, "step": 25135, "train_runtime": 194480.4862, "train_tokens_per_second": 5650.911 }, { "epoch": 1.6927013196875842, "grad_norm": 0.6893488772809538, "learning_rate": 5.715294952608041e-07, "loss": 0.30869436264038086, "num_input_tokens_seen": 1099224528, "step": 25140, "train_runtime": 194512.1799, "train_tokens_per_second": 5651.186 }, { "epoch": 1.6930379746835444, "grad_norm": 0.8413021899719699, "learning_rate": 5.703025484170471e-07, "loss": 0.3042963981628418, "num_input_tokens_seen": 1099455640, "step": 25145, "train_runtime": 194548.5571, "train_tokens_per_second": 5651.317 }, { "epoch": 1.6933746296795045, "grad_norm": 0.760681189560044, "learning_rate": 5.690768403240587e-07, "loss": 0.3153714656829834, "num_input_tokens_seen": 1099676720, "step": 25150, "train_runtime": 194585.4115, "train_tokens_per_second": 5651.383 }, { "epoch": 1.6937112846754645, "grad_norm": 0.7173964449350725, "learning_rate": 5.67852371324602e-07, "loss": 0.30834920406341554, "num_input_tokens_seen": 1099907704, "step": 25155, "train_runtime": 194620.3712, "train_tokens_per_second": 5651.555 }, { "epoch": 1.6940479396714248, "grad_norm": 0.7329549717993644, "learning_rate": 5.66629141761097e-07, "loss": 0.2930551528930664, "num_input_tokens_seen": 1100142256, "step": 25160, "train_runtime": 194657.3311, "train_tokens_per_second": 5651.687 }, { "epoch": 1.694384594667385, "grad_norm": 0.7342138353588805, "learning_rate": 5.654071519756154e-07, "loss": 0.30519957542419435, "num_input_tokens_seen": 1100366192, "step": 25165, "train_runtime": 194704.0482, "train_tokens_per_second": 5651.481 }, { "epoch": 1.694721249663345, "grad_norm": 0.7791350168211661, "learning_rate": 5.641864023098831e-07, "loss": 0.33337717056274413, "num_input_tokens_seen": 1100584800, "step": 25170, "train_runtime": 194745.9485, "train_tokens_per_second": 5651.387 }, { "epoch": 1.695057904659305, "grad_norm": 0.7179815820915966, "learning_rate": 5.629668931052773e-07, "loss": 0.29319195747375487, "num_input_tokens_seen": 1100817816, "step": 25175, "train_runtime": 194785.1895, "train_tokens_per_second": 5651.445 }, { "epoch": 1.6953945596552653, "grad_norm": 0.73809182276721, "learning_rate": 5.61748624702833e-07, "loss": 0.31841015815734863, "num_input_tokens_seen": 1101043616, "step": 25180, "train_runtime": 194820.4275, "train_tokens_per_second": 5651.582 }, { "epoch": 1.6957312146512256, "grad_norm": 0.7597610918234663, "learning_rate": 5.605315974432313e-07, "loss": 0.29940404891967776, "num_input_tokens_seen": 1101262632, "step": 25185, "train_runtime": 194863.2161, "train_tokens_per_second": 5651.465 }, { "epoch": 1.6960678696471856, "grad_norm": 0.7151694523792368, "learning_rate": 5.593158116668146e-07, "loss": 0.2952594757080078, "num_input_tokens_seen": 1101502480, "step": 25190, "train_runtime": 194904.3942, "train_tokens_per_second": 5651.502 }, { "epoch": 1.6964045246431456, "grad_norm": 0.8157887300040912, "learning_rate": 5.581012677135683e-07, "loss": 0.2999080181121826, "num_input_tokens_seen": 1101706720, "step": 25195, "train_runtime": 194939.3381, "train_tokens_per_second": 5651.536 }, { "epoch": 1.6967411796391059, "grad_norm": 0.7188880993897309, "learning_rate": 5.56887965923139e-07, "loss": 0.30147387981414797, "num_input_tokens_seen": 1101936320, "step": 25200, "train_runtime": 194980.9761, "train_tokens_per_second": 5651.507 }, { "epoch": 1.6970778346350661, "grad_norm": 0.8551105269669304, "learning_rate": 5.556759066348227e-07, "loss": 0.29673826694488525, "num_input_tokens_seen": 1102155368, "step": 25205, "train_runtime": 195018.2983, "train_tokens_per_second": 5651.548 }, { "epoch": 1.6974144896310261, "grad_norm": 0.7898708049199309, "learning_rate": 5.54465090187567e-07, "loss": 0.3003216743469238, "num_input_tokens_seen": 1102367352, "step": 25210, "train_runtime": 195053.3847, "train_tokens_per_second": 5651.619 }, { "epoch": 1.6977511446269862, "grad_norm": 0.7892657487617118, "learning_rate": 5.532555169199727e-07, "loss": 0.29103655815124513, "num_input_tokens_seen": 1102583040, "step": 25215, "train_runtime": 195087.2838, "train_tokens_per_second": 5651.742 }, { "epoch": 1.6980877996229464, "grad_norm": 0.729451521498232, "learning_rate": 5.520471871702937e-07, "loss": 0.28641371726989745, "num_input_tokens_seen": 1102810576, "step": 25220, "train_runtime": 195127.6822, "train_tokens_per_second": 5651.738 }, { "epoch": 1.6984244546189067, "grad_norm": 0.8574198765928966, "learning_rate": 5.508401012764341e-07, "loss": 0.2999880313873291, "num_input_tokens_seen": 1103028192, "step": 25225, "train_runtime": 195157.8665, "train_tokens_per_second": 5651.979 }, { "epoch": 1.6987611096148667, "grad_norm": 0.7201969737459759, "learning_rate": 5.496342595759552e-07, "loss": 0.28559165000915526, "num_input_tokens_seen": 1103256944, "step": 25230, "train_runtime": 195204.2497, "train_tokens_per_second": 5651.808 }, { "epoch": 1.6990977646108267, "grad_norm": 0.719407135820255, "learning_rate": 5.484296624060626e-07, "loss": 0.2883117198944092, "num_input_tokens_seen": 1103482616, "step": 25235, "train_runtime": 195249.5833, "train_tokens_per_second": 5651.652 }, { "epoch": 1.699434419606787, "grad_norm": 0.8370197571942842, "learning_rate": 5.472263101036212e-07, "loss": 0.29885265827178953, "num_input_tokens_seen": 1103706952, "step": 25240, "train_runtime": 195285.64, "train_tokens_per_second": 5651.757 }, { "epoch": 1.6997710746027472, "grad_norm": 0.839267857665248, "learning_rate": 5.460242030051421e-07, "loss": 0.3131263732910156, "num_input_tokens_seen": 1103918168, "step": 25245, "train_runtime": 195322.8829, "train_tokens_per_second": 5651.761 }, { "epoch": 1.7001077295987073, "grad_norm": 0.7353115375828058, "learning_rate": 5.448233414467924e-07, "loss": 0.3075102806091309, "num_input_tokens_seen": 1104153064, "step": 25250, "train_runtime": 195358.9751, "train_tokens_per_second": 5651.919 }, { "epoch": 1.7004443845946673, "grad_norm": 0.73339929516101, "learning_rate": 5.43623725764389e-07, "loss": 0.3154341697692871, "num_input_tokens_seen": 1104367200, "step": 25255, "train_runtime": 195396.1799, "train_tokens_per_second": 5651.939 }, { "epoch": 1.7007810395906275, "grad_norm": 0.7555499440673459, "learning_rate": 5.424253562934001e-07, "loss": 0.29883978366851804, "num_input_tokens_seen": 1104597088, "step": 25260, "train_runtime": 195441.1857, "train_tokens_per_second": 5651.813 }, { "epoch": 1.7011176945865878, "grad_norm": 0.7445236468484644, "learning_rate": 5.412282333689461e-07, "loss": 0.29061620235443114, "num_input_tokens_seen": 1104824056, "step": 25265, "train_runtime": 195480.4688, "train_tokens_per_second": 5651.839 }, { "epoch": 1.7014543495825478, "grad_norm": 0.7030179795843015, "learning_rate": 5.400323573257987e-07, "loss": 0.29516527652740476, "num_input_tokens_seen": 1105049880, "step": 25270, "train_runtime": 195517.0208, "train_tokens_per_second": 5651.937 }, { "epoch": 1.7017910045785078, "grad_norm": 0.7158916904045084, "learning_rate": 5.388377284983803e-07, "loss": 0.287148642539978, "num_input_tokens_seen": 1105277608, "step": 25275, "train_runtime": 195553.5443, "train_tokens_per_second": 5652.046 }, { "epoch": 1.702127659574468, "grad_norm": 0.7855552714949071, "learning_rate": 5.37644347220767e-07, "loss": 0.2909886360168457, "num_input_tokens_seen": 1105492920, "step": 25280, "train_runtime": 195593.7926, "train_tokens_per_second": 5651.984 }, { "epoch": 1.7024643145704283, "grad_norm": 0.7992003312183278, "learning_rate": 5.364522138266809e-07, "loss": 0.30830817222595214, "num_input_tokens_seen": 1105725216, "step": 25285, "train_runtime": 195629.7512, "train_tokens_per_second": 5652.132 }, { "epoch": 1.7028009695663884, "grad_norm": 0.7548214170551567, "learning_rate": 5.352613286495018e-07, "loss": 0.2986649990081787, "num_input_tokens_seen": 1105936272, "step": 25290, "train_runtime": 195672.9754, "train_tokens_per_second": 5651.962 }, { "epoch": 1.7031376245623484, "grad_norm": 0.6650218012220956, "learning_rate": 5.340716920222527e-07, "loss": 0.28066387176513674, "num_input_tokens_seen": 1106155736, "step": 25295, "train_runtime": 195711.2334, "train_tokens_per_second": 5651.979 }, { "epoch": 1.7034742795583087, "grad_norm": 0.8192022199015255, "learning_rate": 5.32883304277616e-07, "loss": 0.3220468521118164, "num_input_tokens_seen": 1106367880, "step": 25300, "train_runtime": 195754.2351, "train_tokens_per_second": 5651.821 }, { "epoch": 1.703810934554269, "grad_norm": 0.8220156836674571, "learning_rate": 5.31696165747918e-07, "loss": 0.2808229446411133, "num_input_tokens_seen": 1106591160, "step": 25305, "train_runtime": 195793.8848, "train_tokens_per_second": 5651.817 }, { "epoch": 1.704147589550229, "grad_norm": 0.7943490070647735, "learning_rate": 5.305102767651393e-07, "loss": 0.28664450645446776, "num_input_tokens_seen": 1106820392, "step": 25310, "train_runtime": 195840.7495, "train_tokens_per_second": 5651.635 }, { "epoch": 1.704484244546189, "grad_norm": 0.7913194850774943, "learning_rate": 5.293256376609091e-07, "loss": 0.30523157119750977, "num_input_tokens_seen": 1107043152, "step": 25315, "train_runtime": 195882.9879, "train_tokens_per_second": 5651.553 }, { "epoch": 1.7048208995421492, "grad_norm": 0.7081852025829084, "learning_rate": 5.281422487665089e-07, "loss": 0.27099974155426027, "num_input_tokens_seen": 1107273600, "step": 25320, "train_runtime": 195922.0686, "train_tokens_per_second": 5651.602 }, { "epoch": 1.7051575545381095, "grad_norm": 0.7673688868553783, "learning_rate": 5.269601104128674e-07, "loss": 0.2887356042861938, "num_input_tokens_seen": 1107500568, "step": 25325, "train_runtime": 195968.4871, "train_tokens_per_second": 5651.422 }, { "epoch": 1.7054942095340695, "grad_norm": 0.7390671103279993, "learning_rate": 5.257792229305702e-07, "loss": 0.3096314430236816, "num_input_tokens_seen": 1107721408, "step": 25330, "train_runtime": 196009.11, "train_tokens_per_second": 5651.377 }, { "epoch": 1.7058308645300295, "grad_norm": 0.9154523312754923, "learning_rate": 5.245995866498438e-07, "loss": 0.27949187755584715, "num_input_tokens_seen": 1107927904, "step": 25335, "train_runtime": 196050.2257, "train_tokens_per_second": 5651.245 }, { "epoch": 1.7061675195259898, "grad_norm": 0.779691321745416, "learning_rate": 5.234212019005741e-07, "loss": 0.3069715738296509, "num_input_tokens_seen": 1108137040, "step": 25340, "train_runtime": 196092.6734, "train_tokens_per_second": 5651.088 }, { "epoch": 1.70650417452195, "grad_norm": 0.7743911753132502, "learning_rate": 5.222440690122882e-07, "loss": 0.3008026838302612, "num_input_tokens_seen": 1108352000, "step": 25345, "train_runtime": 196133.018, "train_tokens_per_second": 5651.022 }, { "epoch": 1.70684082951791, "grad_norm": 0.771105877517414, "learning_rate": 5.210681883141716e-07, "loss": 0.2749685764312744, "num_input_tokens_seen": 1108571744, "step": 25350, "train_runtime": 196169.374, "train_tokens_per_second": 5651.095 }, { "epoch": 1.70717748451387, "grad_norm": 0.7792881082810094, "learning_rate": 5.19893560135053e-07, "loss": 0.3137876749038696, "num_input_tokens_seen": 1108803560, "step": 25355, "train_runtime": 196203.8165, "train_tokens_per_second": 5651.284 }, { "epoch": 1.7075141395098303, "grad_norm": 0.7995549624581778, "learning_rate": 5.187201848034146e-07, "loss": 0.3042750835418701, "num_input_tokens_seen": 1109023488, "step": 25360, "train_runtime": 196245.4211, "train_tokens_per_second": 5651.207 }, { "epoch": 1.7078507945057906, "grad_norm": 0.7706690517207955, "learning_rate": 5.175480626473873e-07, "loss": 0.290797758102417, "num_input_tokens_seen": 1109234112, "step": 25365, "train_runtime": 196284.3763, "train_tokens_per_second": 5651.158 }, { "epoch": 1.7081874495017506, "grad_norm": 0.888485346761317, "learning_rate": 5.163771939947504e-07, "loss": 0.30904016494750974, "num_input_tokens_seen": 1109454048, "step": 25370, "train_runtime": 196324.1237, "train_tokens_per_second": 5651.135 }, { "epoch": 1.7085241044977106, "grad_norm": 0.6868307931042189, "learning_rate": 5.152075791729327e-07, "loss": 0.3244988203048706, "num_input_tokens_seen": 1109687648, "step": 25375, "train_runtime": 196364.0378, "train_tokens_per_second": 5651.176 }, { "epoch": 1.7088607594936709, "grad_norm": 0.7101255126564905, "learning_rate": 5.140392185090165e-07, "loss": 0.2983409881591797, "num_input_tokens_seen": 1109893064, "step": 25380, "train_runtime": 196405.8629, "train_tokens_per_second": 5651.018 }, { "epoch": 1.7091974144896311, "grad_norm": 0.8655143566241545, "learning_rate": 5.128721123297265e-07, "loss": 0.3025853157043457, "num_input_tokens_seen": 1110127392, "step": 25385, "train_runtime": 196448.4648, "train_tokens_per_second": 5650.985 }, { "epoch": 1.7095340694855912, "grad_norm": 0.7765483897971529, "learning_rate": 5.117062609614438e-07, "loss": 0.2883389949798584, "num_input_tokens_seen": 1110349016, "step": 25390, "train_runtime": 196484.3558, "train_tokens_per_second": 5651.081 }, { "epoch": 1.7098707244815512, "grad_norm": 0.8068466453475462, "learning_rate": 5.105416647301909e-07, "loss": 0.2935046195983887, "num_input_tokens_seen": 1110572696, "step": 25395, "train_runtime": 196527.8258, "train_tokens_per_second": 5650.969 }, { "epoch": 1.7102073794775114, "grad_norm": 0.8272038940843907, "learning_rate": 5.093783239616468e-07, "loss": 0.26650362014770507, "num_input_tokens_seen": 1110779632, "step": 25400, "train_runtime": 196565.2985, "train_tokens_per_second": 5650.945 }, { "epoch": 1.7105440344734717, "grad_norm": 0.8912009620998278, "learning_rate": 5.082162389811352e-07, "loss": 0.28749451637268064, "num_input_tokens_seen": 1110997128, "step": 25405, "train_runtime": 196600.4482, "train_tokens_per_second": 5651.041 }, { "epoch": 1.7108806894694317, "grad_norm": 0.8227134244564941, "learning_rate": 5.070554101136288e-07, "loss": 0.2878044605255127, "num_input_tokens_seen": 1111200552, "step": 25410, "train_runtime": 196637.1184, "train_tokens_per_second": 5651.021 }, { "epoch": 1.7112173444653918, "grad_norm": 0.6957933161324612, "learning_rate": 5.058958376837497e-07, "loss": 0.2986098289489746, "num_input_tokens_seen": 1111427560, "step": 25415, "train_runtime": 196678.1193, "train_tokens_per_second": 5650.997 }, { "epoch": 1.711553999461352, "grad_norm": 0.7375797617626252, "learning_rate": 5.047375220157691e-07, "loss": 0.3050894021987915, "num_input_tokens_seen": 1111652600, "step": 25420, "train_runtime": 196718.6261, "train_tokens_per_second": 5650.978 }, { "epoch": 1.7118906544573123, "grad_norm": 0.7728802385790842, "learning_rate": 5.035804634336056e-07, "loss": 0.3212940216064453, "num_input_tokens_seen": 1111871248, "step": 25425, "train_runtime": 196760.4219, "train_tokens_per_second": 5650.889 }, { "epoch": 1.7122273094532723, "grad_norm": 0.7147851806060915, "learning_rate": 5.024246622608292e-07, "loss": 0.293403172492981, "num_input_tokens_seen": 1112108600, "step": 25430, "train_runtime": 196799.535, "train_tokens_per_second": 5650.972 }, { "epoch": 1.7125639644492323, "grad_norm": 0.8753202500856931, "learning_rate": 5.01270118820652e-07, "loss": 0.3186427354812622, "num_input_tokens_seen": 1112335328, "step": 25435, "train_runtime": 196834.1465, "train_tokens_per_second": 5651.13 }, { "epoch": 1.7129006194451926, "grad_norm": 0.8169092701177705, "learning_rate": 5.001168334359429e-07, "loss": 0.3163825511932373, "num_input_tokens_seen": 1112566808, "step": 25440, "train_runtime": 196867.059, "train_tokens_per_second": 5651.361 }, { "epoch": 1.7132372744411528, "grad_norm": 0.7130198658873356, "learning_rate": 4.989648064292102e-07, "loss": 0.3128488540649414, "num_input_tokens_seen": 1112795792, "step": 25445, "train_runtime": 196905.6927, "train_tokens_per_second": 5651.415 }, { "epoch": 1.7135739294371128, "grad_norm": 0.8272498786011496, "learning_rate": 4.978140381226177e-07, "loss": 0.31338427066802976, "num_input_tokens_seen": 1113015816, "step": 25450, "train_runtime": 196950.2891, "train_tokens_per_second": 5651.253 }, { "epoch": 1.7139105844330729, "grad_norm": 0.6817930969478092, "learning_rate": 4.966645288379729e-07, "loss": 0.2886411428451538, "num_input_tokens_seen": 1113242208, "step": 25455, "train_runtime": 196986.8049, "train_tokens_per_second": 5651.354 }, { "epoch": 1.7142472394290331, "grad_norm": 0.8193216088135635, "learning_rate": 4.955162788967327e-07, "loss": 0.3108631134033203, "num_input_tokens_seen": 1113433336, "step": 25460, "train_runtime": 197028.9568, "train_tokens_per_second": 5651.115 }, { "epoch": 1.7145838944249934, "grad_norm": 0.7410886402030697, "learning_rate": 4.943692886200013e-07, "loss": 0.30652599334716796, "num_input_tokens_seen": 1113646408, "step": 25465, "train_runtime": 197065.6766, "train_tokens_per_second": 5651.143 }, { "epoch": 1.7149205494209534, "grad_norm": 0.7490199419500515, "learning_rate": 4.932235583285305e-07, "loss": 0.31150734424591064, "num_input_tokens_seen": 1113881008, "step": 25470, "train_runtime": 197104.2655, "train_tokens_per_second": 5651.227 }, { "epoch": 1.7152572044169134, "grad_norm": 0.8168471127164367, "learning_rate": 4.920790883427201e-07, "loss": 0.2943288326263428, "num_input_tokens_seen": 1114079888, "step": 25475, "train_runtime": 197148.0427, "train_tokens_per_second": 5650.981 }, { "epoch": 1.7155938594128737, "grad_norm": 0.8217572900775035, "learning_rate": 4.909358789826196e-07, "loss": 0.3120744228363037, "num_input_tokens_seen": 1114268728, "step": 25480, "train_runtime": 197186.0762, "train_tokens_per_second": 5650.849 }, { "epoch": 1.715930514408834, "grad_norm": 0.842144785636648, "learning_rate": 4.897939305679206e-07, "loss": 0.30831499099731446, "num_input_tokens_seen": 1114498760, "step": 25485, "train_runtime": 197217.8311, "train_tokens_per_second": 5651.105 }, { "epoch": 1.716267169404794, "grad_norm": 0.7113758542252159, "learning_rate": 4.886532434179686e-07, "loss": 0.2864993572235107, "num_input_tokens_seen": 1114714920, "step": 25490, "train_runtime": 197261.5876, "train_tokens_per_second": 5650.948 }, { "epoch": 1.716603824400754, "grad_norm": 0.7070024392396191, "learning_rate": 4.875138178517497e-07, "loss": 0.2663728713989258, "num_input_tokens_seen": 1114931832, "step": 25495, "train_runtime": 197300.3097, "train_tokens_per_second": 5650.938 }, { "epoch": 1.7169404793967142, "grad_norm": 0.8884464092351633, "learning_rate": 4.863756541879028e-07, "loss": 0.31972756385803225, "num_input_tokens_seen": 1115156536, "step": 25500, "train_runtime": 197338.9855, "train_tokens_per_second": 5650.969 }, { "epoch": 1.7172771343926745, "grad_norm": 0.693402281770043, "learning_rate": 4.852387527447117e-07, "loss": 0.2761407375335693, "num_input_tokens_seen": 1115391624, "step": 25505, "train_runtime": 197375.3791, "train_tokens_per_second": 5651.118 }, { "epoch": 1.7176137893886345, "grad_norm": 0.7175083758215528, "learning_rate": 4.84103113840107e-07, "loss": 0.2971747398376465, "num_input_tokens_seen": 1115621104, "step": 25510, "train_runtime": 197410.3395, "train_tokens_per_second": 5651.28 }, { "epoch": 1.7179504443845945, "grad_norm": 0.7429321287522253, "learning_rate": 4.829687377916664e-07, "loss": 0.2947702407836914, "num_input_tokens_seen": 1115833104, "step": 25515, "train_runtime": 197441.5837, "train_tokens_per_second": 5651.459 }, { "epoch": 1.7182870993805548, "grad_norm": 0.8107818792796975, "learning_rate": 4.81835624916614e-07, "loss": 0.2821854591369629, "num_input_tokens_seen": 1116048240, "step": 25520, "train_runtime": 197479.0855, "train_tokens_per_second": 5651.476 }, { "epoch": 1.718623754376515, "grad_norm": 0.802522255622259, "learning_rate": 4.807037755318211e-07, "loss": 0.28911077976226807, "num_input_tokens_seen": 1116280624, "step": 25525, "train_runtime": 197512.9072, "train_tokens_per_second": 5651.684 }, { "epoch": 1.718960409372475, "grad_norm": 0.6592568584202634, "learning_rate": 4.795731899538086e-07, "loss": 0.3094839096069336, "num_input_tokens_seen": 1116492320, "step": 25530, "train_runtime": 197560.5492, "train_tokens_per_second": 5651.393 }, { "epoch": 1.719297064368435, "grad_norm": 0.7237886999876593, "learning_rate": 4.78443868498737e-07, "loss": 0.2828222274780273, "num_input_tokens_seen": 1116713608, "step": 25535, "train_runtime": 197596.8732, "train_tokens_per_second": 5651.474 }, { "epoch": 1.7196337193643954, "grad_norm": 0.7185713199478717, "learning_rate": 4.773158114824206e-07, "loss": 0.28137338161468506, "num_input_tokens_seen": 1116938536, "step": 25540, "train_runtime": 197632.4385, "train_tokens_per_second": 5651.595 }, { "epoch": 1.7199703743603556, "grad_norm": 1.1879567747502189, "learning_rate": 4.7618901922031445e-07, "loss": 0.2812469959259033, "num_input_tokens_seen": 1117161488, "step": 25545, "train_runtime": 197670.8796, "train_tokens_per_second": 5651.624 }, { "epoch": 1.7203070293563156, "grad_norm": 0.8094448913417437, "learning_rate": 4.750634920275243e-07, "loss": 0.3022423267364502, "num_input_tokens_seen": 1117374592, "step": 25550, "train_runtime": 197712.1996, "train_tokens_per_second": 5651.521 }, { "epoch": 1.7206436843522757, "grad_norm": 0.752864591432035, "learning_rate": 4.739392302188001e-07, "loss": 0.319273042678833, "num_input_tokens_seen": 1117603384, "step": 25555, "train_runtime": 197750.9243, "train_tokens_per_second": 5651.571 }, { "epoch": 1.720980339348236, "grad_norm": 0.8294658057367533, "learning_rate": 4.728162341085368e-07, "loss": 0.31023268699645995, "num_input_tokens_seen": 1117820784, "step": 25560, "train_runtime": 197793.1161, "train_tokens_per_second": 5651.465 }, { "epoch": 1.7213169943441962, "grad_norm": 0.7053663821231337, "learning_rate": 4.7169450401077843e-07, "loss": 0.312652063369751, "num_input_tokens_seen": 1118048160, "step": 25565, "train_runtime": 197836.8692, "train_tokens_per_second": 5651.364 }, { "epoch": 1.7216536493401562, "grad_norm": 0.7700362624042942, "learning_rate": 4.7057404023921174e-07, "loss": 0.3073885440826416, "num_input_tokens_seen": 1118274672, "step": 25570, "train_runtime": 197872.3987, "train_tokens_per_second": 5651.494 }, { "epoch": 1.7219903043361162, "grad_norm": 0.8048237014417249, "learning_rate": 4.694548431071705e-07, "loss": 0.31366183757781985, "num_input_tokens_seen": 1118492208, "step": 25575, "train_runtime": 197919.5839, "train_tokens_per_second": 5651.246 }, { "epoch": 1.7223269593320765, "grad_norm": 0.7167405150431256, "learning_rate": 4.683369129276377e-07, "loss": 0.3049338340759277, "num_input_tokens_seen": 1118716936, "step": 25580, "train_runtime": 197953.2698, "train_tokens_per_second": 5651.419 }, { "epoch": 1.7226636143280367, "grad_norm": 0.663480470579991, "learning_rate": 4.6722025001323444e-07, "loss": 0.2772920846939087, "num_input_tokens_seen": 1118917560, "step": 25585, "train_runtime": 197998.4722, "train_tokens_per_second": 5651.142 }, { "epoch": 1.7230002693239967, "grad_norm": 0.8472714336560921, "learning_rate": 4.6610485467623643e-07, "loss": 0.3002648830413818, "num_input_tokens_seen": 1119122208, "step": 25590, "train_runtime": 198037.4639, "train_tokens_per_second": 5651.063 }, { "epoch": 1.7233369243199568, "grad_norm": 0.73662714701174, "learning_rate": 4.649907272285564e-07, "loss": 0.29230647087097167, "num_input_tokens_seen": 1119341064, "step": 25595, "train_runtime": 198077.5592, "train_tokens_per_second": 5651.024 }, { "epoch": 1.723673579315917, "grad_norm": 0.7420030033003574, "learning_rate": 4.638778679817596e-07, "loss": 0.28714590072631835, "num_input_tokens_seen": 1119570192, "step": 25600, "train_runtime": 198120.1877, "train_tokens_per_second": 5650.965 }, { "epoch": 1.7240102343118773, "grad_norm": 0.824030176081278, "learning_rate": 4.6276627724705204e-07, "loss": 0.3071947813034058, "num_input_tokens_seen": 1119786040, "step": 25605, "train_runtime": 198161.3927, "train_tokens_per_second": 5650.879 }, { "epoch": 1.7243468893078373, "grad_norm": 0.7154654354680215, "learning_rate": 4.616559553352873e-07, "loss": 0.2772822380065918, "num_input_tokens_seen": 1120003688, "step": 25610, "train_runtime": 198197.9173, "train_tokens_per_second": 5650.936 }, { "epoch": 1.7246835443037973, "grad_norm": 0.7332839778498565, "learning_rate": 4.6054690255696256e-07, "loss": 0.3121823310852051, "num_input_tokens_seen": 1120225000, "step": 25615, "train_runtime": 198232.3778, "train_tokens_per_second": 5651.07 }, { "epoch": 1.7250201992997576, "grad_norm": 0.8304618732220158, "learning_rate": 4.594391192222214e-07, "loss": 0.299558162689209, "num_input_tokens_seen": 1120436736, "step": 25620, "train_runtime": 198275.4196, "train_tokens_per_second": 5650.911 }, { "epoch": 1.7253568542957178, "grad_norm": 0.7210943628722162, "learning_rate": 4.583326056408505e-07, "loss": 0.2828629732131958, "num_input_tokens_seen": 1120656400, "step": 25625, "train_runtime": 198318.2954, "train_tokens_per_second": 5650.797 }, { "epoch": 1.7256935092916779, "grad_norm": 0.8701484329791821, "learning_rate": 4.5722736212228613e-07, "loss": 0.3062956094741821, "num_input_tokens_seen": 1120853112, "step": 25630, "train_runtime": 198360.6419, "train_tokens_per_second": 5650.582 }, { "epoch": 1.726030164287638, "grad_norm": 0.7789016257709495, "learning_rate": 4.5612338897560227e-07, "loss": 0.3126507759094238, "num_input_tokens_seen": 1121085288, "step": 25635, "train_runtime": 198403.9135, "train_tokens_per_second": 5650.52 }, { "epoch": 1.7263668192835981, "grad_norm": 0.8101928313460407, "learning_rate": 4.5502068650952527e-07, "loss": 0.31250529289245604, "num_input_tokens_seen": 1121299992, "step": 25640, "train_runtime": 198443.451, "train_tokens_per_second": 5650.476 }, { "epoch": 1.7267034742795584, "grad_norm": 0.8289277705819492, "learning_rate": 4.5391925503241894e-07, "loss": 0.2995558023452759, "num_input_tokens_seen": 1121526960, "step": 25645, "train_runtime": 198482.6522, "train_tokens_per_second": 5650.504 }, { "epoch": 1.7270401292755184, "grad_norm": 0.7957658163232814, "learning_rate": 4.5281909485229704e-07, "loss": 0.29502243995666505, "num_input_tokens_seen": 1121740648, "step": 25650, "train_runtime": 198523.6274, "train_tokens_per_second": 5650.414 }, { "epoch": 1.7273767842714784, "grad_norm": 0.8283561928306208, "learning_rate": 4.51720206276815e-07, "loss": 0.27261307239532473, "num_input_tokens_seen": 1121954360, "step": 25655, "train_runtime": 198559.855, "train_tokens_per_second": 5650.459 }, { "epoch": 1.7277134392674387, "grad_norm": 0.7838264977883859, "learning_rate": 4.506225896132743e-07, "loss": 0.2796020984649658, "num_input_tokens_seen": 1122168368, "step": 25660, "train_runtime": 198597.1547, "train_tokens_per_second": 5650.476 }, { "epoch": 1.728050094263399, "grad_norm": 0.7911207040134044, "learning_rate": 4.4952624516861944e-07, "loss": 0.2953200101852417, "num_input_tokens_seen": 1122372424, "step": 25665, "train_runtime": 198632.1048, "train_tokens_per_second": 5650.509 }, { "epoch": 1.728386749259359, "grad_norm": 0.7188871555974835, "learning_rate": 4.4843117324944005e-07, "loss": 0.2733217716217041, "num_input_tokens_seen": 1122608584, "step": 25670, "train_runtime": 198671.3821, "train_tokens_per_second": 5650.58 }, { "epoch": 1.728723404255319, "grad_norm": 0.8236529240166243, "learning_rate": 4.4733737416196745e-07, "loss": 0.2921212911605835, "num_input_tokens_seen": 1122786752, "step": 25675, "train_runtime": 198705.9189, "train_tokens_per_second": 5650.495 }, { "epoch": 1.7290600592512793, "grad_norm": 0.6891675836585306, "learning_rate": 4.4624484821208346e-07, "loss": 0.29300737380981445, "num_input_tokens_seen": 1123000352, "step": 25680, "train_runtime": 198743.7451, "train_tokens_per_second": 5650.494 }, { "epoch": 1.7293967142472395, "grad_norm": 0.7600535970631421, "learning_rate": 4.451535957053044e-07, "loss": 0.26680479049682615, "num_input_tokens_seen": 1123218520, "step": 25685, "train_runtime": 198786.9925, "train_tokens_per_second": 5650.362 }, { "epoch": 1.7297333692431995, "grad_norm": 0.7452499443166702, "learning_rate": 4.440636169467999e-07, "loss": 0.28789448738098145, "num_input_tokens_seen": 1123429840, "step": 25690, "train_runtime": 198828.3828, "train_tokens_per_second": 5650.249 }, { "epoch": 1.7300700242391596, "grad_norm": 0.801697711689962, "learning_rate": 4.429749122413757e-07, "loss": 0.2902831077575684, "num_input_tokens_seen": 1123644168, "step": 25695, "train_runtime": 198871.0647, "train_tokens_per_second": 5650.114 }, { "epoch": 1.7304066792351198, "grad_norm": 0.7857956805272411, "learning_rate": 4.418874818934865e-07, "loss": 0.29162254333496096, "num_input_tokens_seen": 1123867240, "step": 25700, "train_runtime": 198907.5425, "train_tokens_per_second": 5650.199 }, { "epoch": 1.73074333423108, "grad_norm": 0.829177173381663, "learning_rate": 4.4080132620722806e-07, "loss": 0.30682687759399413, "num_input_tokens_seen": 1124064016, "step": 25705, "train_runtime": 198944.8498, "train_tokens_per_second": 5650.129 }, { "epoch": 1.73107998922704, "grad_norm": 0.7300356398237123, "learning_rate": 4.3971644548634116e-07, "loss": 0.30285561084747314, "num_input_tokens_seen": 1124276384, "step": 25710, "train_runtime": 198983.4747, "train_tokens_per_second": 5650.099 }, { "epoch": 1.7314166442230001, "grad_norm": 1.020129891409066, "learning_rate": 4.3863284003420826e-07, "loss": 0.3177463531494141, "num_input_tokens_seen": 1124494424, "step": 25715, "train_runtime": 199023.7261, "train_tokens_per_second": 5650.052 }, { "epoch": 1.7317532992189604, "grad_norm": 0.7523401828963102, "learning_rate": 4.375505101538563e-07, "loss": 0.2902905702590942, "num_input_tokens_seen": 1124712920, "step": 25720, "train_runtime": 199061.3982, "train_tokens_per_second": 5650.08 }, { "epoch": 1.7320899542149206, "grad_norm": 0.8005644638652999, "learning_rate": 4.3646945614795487e-07, "loss": 0.3163978099822998, "num_input_tokens_seen": 1124936520, "step": 25725, "train_runtime": 199095.1882, "train_tokens_per_second": 5650.245 }, { "epoch": 1.7324266092108807, "grad_norm": 0.7714782744078659, "learning_rate": 4.3538967831881995e-07, "loss": 0.31358091831207274, "num_input_tokens_seen": 1125167472, "step": 25730, "train_runtime": 199132.5807, "train_tokens_per_second": 5650.343 }, { "epoch": 1.7327632642068407, "grad_norm": 0.7624866372005362, "learning_rate": 4.343111769684039e-07, "loss": 0.29058811664581297, "num_input_tokens_seen": 1125373784, "step": 25735, "train_runtime": 199172.4308, "train_tokens_per_second": 5650.249 }, { "epoch": 1.733099919202801, "grad_norm": 0.6799023332475078, "learning_rate": 4.332339523983103e-07, "loss": 0.27836108207702637, "num_input_tokens_seen": 1125601280, "step": 25740, "train_runtime": 199212.9839, "train_tokens_per_second": 5650.241 }, { "epoch": 1.7334365741987612, "grad_norm": 0.7561206882286643, "learning_rate": 4.321580049097773e-07, "loss": 0.28482909202575685, "num_input_tokens_seen": 1125825176, "step": 25745, "train_runtime": 199246.8335, "train_tokens_per_second": 5650.404 }, { "epoch": 1.7337732291947212, "grad_norm": 0.8118236999029766, "learning_rate": 4.310833348036941e-07, "loss": 0.27461097240447996, "num_input_tokens_seen": 1126041128, "step": 25750, "train_runtime": 199290.7549, "train_tokens_per_second": 5650.243 }, { "epoch": 1.7341098841906812, "grad_norm": 0.7118638487915145, "learning_rate": 4.300099423805865e-07, "loss": 0.2958423614501953, "num_input_tokens_seen": 1126244560, "step": 25755, "train_runtime": 199333.5162, "train_tokens_per_second": 5650.051 }, { "epoch": 1.7344465391866415, "grad_norm": 0.7506783418387937, "learning_rate": 4.289378279406264e-07, "loss": 0.2995717525482178, "num_input_tokens_seen": 1126468312, "step": 25760, "train_runtime": 199366.8538, "train_tokens_per_second": 5650.229 }, { "epoch": 1.7347831941826017, "grad_norm": 0.8246621666903383, "learning_rate": 4.2786699178362647e-07, "loss": 0.30245399475097656, "num_input_tokens_seen": 1126689568, "step": 25765, "train_runtime": 199407.3048, "train_tokens_per_second": 5650.192 }, { "epoch": 1.7351198491785618, "grad_norm": 0.8135304755844003, "learning_rate": 4.2679743420904254e-07, "loss": 0.3159316539764404, "num_input_tokens_seen": 1126917656, "step": 25770, "train_runtime": 199441.5657, "train_tokens_per_second": 5650.365 }, { "epoch": 1.7354565041745218, "grad_norm": 0.8164341987242794, "learning_rate": 4.257291555159726e-07, "loss": 0.26204819679260255, "num_input_tokens_seen": 1127132592, "step": 25775, "train_runtime": 199474.9349, "train_tokens_per_second": 5650.497 }, { "epoch": 1.735793159170482, "grad_norm": 0.7634016130973207, "learning_rate": 4.246621560031594e-07, "loss": 0.2924259424209595, "num_input_tokens_seen": 1127339712, "step": 25780, "train_runtime": 199509.5428, "train_tokens_per_second": 5650.555 }, { "epoch": 1.7361298141664423, "grad_norm": 0.7910333110781415, "learning_rate": 4.235964359689837e-07, "loss": 0.27674455642700196, "num_input_tokens_seen": 1127566704, "step": 25785, "train_runtime": 199548.866, "train_tokens_per_second": 5650.579 }, { "epoch": 1.7364664691624023, "grad_norm": 0.8840197427923319, "learning_rate": 4.225319957114726e-07, "loss": 0.3013903617858887, "num_input_tokens_seen": 1127772128, "step": 25790, "train_runtime": 199588.6729, "train_tokens_per_second": 5650.482 }, { "epoch": 1.7368031241583624, "grad_norm": 0.7325596847908312, "learning_rate": 4.214688355282909e-07, "loss": 0.28219919204711913, "num_input_tokens_seen": 1127988664, "step": 25795, "train_runtime": 199631.9302, "train_tokens_per_second": 5650.342 }, { "epoch": 1.7371397791543226, "grad_norm": 0.8173650460918741, "learning_rate": 4.204069557167506e-07, "loss": 0.2839889764785767, "num_input_tokens_seen": 1128202648, "step": 25800, "train_runtime": 199667.9001, "train_tokens_per_second": 5650.396 }, { "epoch": 1.7374764341502829, "grad_norm": 0.876625098531604, "learning_rate": 4.1934635657380153e-07, "loss": 0.304730224609375, "num_input_tokens_seen": 1128423984, "step": 25805, "train_runtime": 199702.6037, "train_tokens_per_second": 5650.522 }, { "epoch": 1.7378130891462429, "grad_norm": 0.7480060231681754, "learning_rate": 4.1828703839603637e-07, "loss": 0.2796186447143555, "num_input_tokens_seen": 1128651136, "step": 25810, "train_runtime": 199740.7074, "train_tokens_per_second": 5650.581 }, { "epoch": 1.738149744142203, "grad_norm": 0.8165869116083727, "learning_rate": 4.172290014796926e-07, "loss": 0.32165372371673584, "num_input_tokens_seen": 1128867360, "step": 25815, "train_runtime": 199775.1172, "train_tokens_per_second": 5650.691 }, { "epoch": 1.7384863991381632, "grad_norm": 0.8122569762079913, "learning_rate": 4.1617224612064353e-07, "loss": 0.29702818393707275, "num_input_tokens_seen": 1129077456, "step": 25820, "train_runtime": 199815.7373, "train_tokens_per_second": 5650.593 }, { "epoch": 1.7388230541341234, "grad_norm": 0.7151797283997641, "learning_rate": 4.151167726144101e-07, "loss": 0.2909691333770752, "num_input_tokens_seen": 1129312768, "step": 25825, "train_runtime": 199850.2397, "train_tokens_per_second": 5650.795 }, { "epoch": 1.7391597091300834, "grad_norm": 0.7870049200470505, "learning_rate": 4.1406258125615106e-07, "loss": 0.3070362567901611, "num_input_tokens_seen": 1129537904, "step": 25830, "train_runtime": 199880.6637, "train_tokens_per_second": 5651.061 }, { "epoch": 1.7394963641260435, "grad_norm": 0.6937152886038869, "learning_rate": 4.130096723406674e-07, "loss": 0.29037325382232665, "num_input_tokens_seen": 1129757208, "step": 25835, "train_runtime": 199915.4723, "train_tokens_per_second": 5651.174 }, { "epoch": 1.7398330191220037, "grad_norm": 0.8109854430003198, "learning_rate": 4.119580461624023e-07, "loss": 0.3026682615280151, "num_input_tokens_seen": 1129966384, "step": 25840, "train_runtime": 199951.9393, "train_tokens_per_second": 5651.19 }, { "epoch": 1.740169674117964, "grad_norm": 0.77895028602625, "learning_rate": 4.109077030154396e-07, "loss": 0.30320086479187014, "num_input_tokens_seen": 1130186152, "step": 25845, "train_runtime": 199986.3251, "train_tokens_per_second": 5651.317 }, { "epoch": 1.740506329113924, "grad_norm": 0.7121386019107564, "learning_rate": 4.0985864319350366e-07, "loss": 0.3050692081451416, "num_input_tokens_seen": 1130406368, "step": 25850, "train_runtime": 200030.0945, "train_tokens_per_second": 5651.181 }, { "epoch": 1.740842984109884, "grad_norm": 0.8089630935847927, "learning_rate": 4.0881086698996154e-07, "loss": 0.2959964513778687, "num_input_tokens_seen": 1130629712, "step": 25855, "train_runtime": 200072.2089, "train_tokens_per_second": 5651.108 }, { "epoch": 1.7411796391058443, "grad_norm": 0.6596855615199905, "learning_rate": 4.077643746978194e-07, "loss": 0.2970879316329956, "num_input_tokens_seen": 1130854672, "step": 25860, "train_runtime": 200107.7191, "train_tokens_per_second": 5651.23 }, { "epoch": 1.7415162941018045, "grad_norm": 0.7016863080677025, "learning_rate": 4.067191666097281e-07, "loss": 0.29431335926055907, "num_input_tokens_seen": 1131071712, "step": 25865, "train_runtime": 200143.6703, "train_tokens_per_second": 5651.299 }, { "epoch": 1.7418529490977646, "grad_norm": 0.721345869315641, "learning_rate": 4.056752430179728e-07, "loss": 0.28345699310302735, "num_input_tokens_seen": 1131294176, "step": 25870, "train_runtime": 200187.8959, "train_tokens_per_second": 5651.162 }, { "epoch": 1.7421896040937246, "grad_norm": 0.7756187950368285, "learning_rate": 4.046326042144866e-07, "loss": 0.2875986576080322, "num_input_tokens_seen": 1131517072, "step": 25875, "train_runtime": 200228.1281, "train_tokens_per_second": 5651.139 }, { "epoch": 1.7425262590896848, "grad_norm": 0.6831782860497421, "learning_rate": 4.0359125049083956e-07, "loss": 0.2836933135986328, "num_input_tokens_seen": 1131734008, "step": 25880, "train_runtime": 200260.4735, "train_tokens_per_second": 5651.31 }, { "epoch": 1.742862914085645, "grad_norm": 0.7787460128342357, "learning_rate": 4.025511821382422e-07, "loss": 0.30028643608093264, "num_input_tokens_seen": 1131948944, "step": 25885, "train_runtime": 200306.9879, "train_tokens_per_second": 5651.071 }, { "epoch": 1.7431995690816051, "grad_norm": 0.7541542349539324, "learning_rate": 4.015123994475462e-07, "loss": 0.28558173179626467, "num_input_tokens_seen": 1132155112, "step": 25890, "train_runtime": 200346.4536, "train_tokens_per_second": 5650.987 }, { "epoch": 1.7435362240775654, "grad_norm": 0.7540947221379003, "learning_rate": 4.0047490270924417e-07, "loss": 0.29801325798034667, "num_input_tokens_seen": 1132391904, "step": 25895, "train_runtime": 200377.6526, "train_tokens_per_second": 5651.288 }, { "epoch": 1.7438728790735256, "grad_norm": 0.7097292901302847, "learning_rate": 3.994386922134691e-07, "loss": 0.2968616247177124, "num_input_tokens_seen": 1132613664, "step": 25900, "train_runtime": 200410.4186, "train_tokens_per_second": 5651.471 }, { "epoch": 1.7442095340694856, "grad_norm": 0.6871287862369735, "learning_rate": 3.984037682499936e-07, "loss": 0.2899972438812256, "num_input_tokens_seen": 1132836560, "step": 25905, "train_runtime": 200448.2196, "train_tokens_per_second": 5651.517 }, { "epoch": 1.7445461890654457, "grad_norm": 0.7897783179799106, "learning_rate": 3.973701311082301e-07, "loss": 0.31725754737854006, "num_input_tokens_seen": 1133050712, "step": 25910, "train_runtime": 200489.2159, "train_tokens_per_second": 5651.43 }, { "epoch": 1.744882844061406, "grad_norm": 0.8896464404276014, "learning_rate": 3.9633778107723454e-07, "loss": 0.2900426387786865, "num_input_tokens_seen": 1133254224, "step": 25915, "train_runtime": 200526.2526, "train_tokens_per_second": 5651.401 }, { "epoch": 1.7452194990573662, "grad_norm": 0.7236782781112409, "learning_rate": 3.953067184456966e-07, "loss": 0.3090181350708008, "num_input_tokens_seen": 1133470824, "step": 25920, "train_runtime": 200564.9033, "train_tokens_per_second": 5651.392 }, { "epoch": 1.7455561540533262, "grad_norm": 0.8647141709585514, "learning_rate": 3.9427694350195224e-07, "loss": 0.31003541946411134, "num_input_tokens_seen": 1133700592, "step": 25925, "train_runtime": 200601.8067, "train_tokens_per_second": 5651.497 }, { "epoch": 1.7458928090492862, "grad_norm": 0.7588158649781692, "learning_rate": 3.9324845653397446e-07, "loss": 0.3075569152832031, "num_input_tokens_seen": 1133925704, "step": 25930, "train_runtime": 200639.6339, "train_tokens_per_second": 5651.554 }, { "epoch": 1.7462294640452465, "grad_norm": 0.7340500241842518, "learning_rate": 3.922212578293755e-07, "loss": 0.2702242374420166, "num_input_tokens_seen": 1134140200, "step": 25935, "train_runtime": 200682.8182, "train_tokens_per_second": 5651.407 }, { "epoch": 1.7465661190412067, "grad_norm": 0.82037212018234, "learning_rate": 3.911953476754088e-07, "loss": 0.2941112518310547, "num_input_tokens_seen": 1134363752, "step": 25940, "train_runtime": 200715.6542, "train_tokens_per_second": 5651.596 }, { "epoch": 1.7469027740371668, "grad_norm": 0.8812494234102816, "learning_rate": 3.9017072635896716e-07, "loss": 0.31668860912323, "num_input_tokens_seen": 1134590888, "step": 25945, "train_runtime": 200756.942, "train_tokens_per_second": 5651.565 }, { "epoch": 1.7472394290331268, "grad_norm": 0.76480797109403, "learning_rate": 3.891473941665819e-07, "loss": 0.3079123020172119, "num_input_tokens_seen": 1134821944, "step": 25950, "train_runtime": 200795.9315, "train_tokens_per_second": 5651.618 }, { "epoch": 1.747576084029087, "grad_norm": 0.8623020733146947, "learning_rate": 3.881253513844246e-07, "loss": 0.30869007110595703, "num_input_tokens_seen": 1135026112, "step": 25955, "train_runtime": 200836.4857, "train_tokens_per_second": 5651.494 }, { "epoch": 1.7479127390250473, "grad_norm": 0.7551876844288087, "learning_rate": 3.871045982983063e-07, "loss": 0.29468765258789065, "num_input_tokens_seen": 1135250784, "step": 25960, "train_runtime": 200877.5576, "train_tokens_per_second": 5651.457 }, { "epoch": 1.7482493940210073, "grad_norm": 0.7546664443489978, "learning_rate": 3.8608513519367897e-07, "loss": 0.2700496673583984, "num_input_tokens_seen": 1135481416, "step": 25965, "train_runtime": 200922.6162, "train_tokens_per_second": 5651.337 }, { "epoch": 1.7485860490169673, "grad_norm": 0.9863347976919302, "learning_rate": 3.8506696235562915e-07, "loss": 0.2968393087387085, "num_input_tokens_seen": 1135693800, "step": 25970, "train_runtime": 200960.332, "train_tokens_per_second": 5651.333 }, { "epoch": 1.7489227040129276, "grad_norm": 0.7481085355968223, "learning_rate": 3.840500800688884e-07, "loss": 0.2980025768280029, "num_input_tokens_seen": 1135925744, "step": 25975, "train_runtime": 201006.8964, "train_tokens_per_second": 5651.178 }, { "epoch": 1.7492593590088878, "grad_norm": 0.8214495132803978, "learning_rate": 3.8303448861782333e-07, "loss": 0.2952871322631836, "num_input_tokens_seen": 1136130424, "step": 25980, "train_runtime": 201040.8482, "train_tokens_per_second": 5651.242 }, { "epoch": 1.7495960140048479, "grad_norm": 0.8019257337743148, "learning_rate": 3.8202018828644105e-07, "loss": 0.27895636558532716, "num_input_tokens_seen": 1136347560, "step": 25985, "train_runtime": 201079.8679, "train_tokens_per_second": 5651.225 }, { "epoch": 1.749932669000808, "grad_norm": 0.9034770504035424, "learning_rate": 3.8100717935838804e-07, "loss": 0.32080807685852053, "num_input_tokens_seen": 1136562648, "step": 25990, "train_runtime": 201121.1998, "train_tokens_per_second": 5651.133 }, { "epoch": 1.7502693239967682, "grad_norm": 0.7869916616338762, "learning_rate": 3.799954621169477e-07, "loss": 0.27611637115478516, "num_input_tokens_seen": 1136781352, "step": 25995, "train_runtime": 201160.3173, "train_tokens_per_second": 5651.121 }, { "epoch": 1.7506059789927284, "grad_norm": 0.7949557024166627, "learning_rate": 3.7898503684504483e-07, "loss": 0.29705018997192384, "num_input_tokens_seen": 1136994720, "step": 26000, "train_runtime": 201200.2712, "train_tokens_per_second": 5651.06 }, { "epoch": 1.7509426339886884, "grad_norm": 0.7027696556054698, "learning_rate": 3.7797590382524066e-07, "loss": 0.28871927261352537, "num_input_tokens_seen": 1137197696, "step": 26005, "train_runtime": 201242.4798, "train_tokens_per_second": 5650.883 }, { "epoch": 1.7512792889846485, "grad_norm": 0.7864204996333114, "learning_rate": 3.76968063339736e-07, "loss": 0.3024580955505371, "num_input_tokens_seen": 1137430488, "step": 26010, "train_runtime": 201274.5947, "train_tokens_per_second": 5651.138 }, { "epoch": 1.7516159439806087, "grad_norm": 0.8310573898266609, "learning_rate": 3.759615156703722e-07, "loss": 0.28331038951873777, "num_input_tokens_seen": 1137644120, "step": 26015, "train_runtime": 201312.2778, "train_tokens_per_second": 5651.141 }, { "epoch": 1.751952598976569, "grad_norm": 0.7194041093377634, "learning_rate": 3.749562610986235e-07, "loss": 0.3102069854736328, "num_input_tokens_seen": 1137861320, "step": 26020, "train_runtime": 201348.9701, "train_tokens_per_second": 5651.19 }, { "epoch": 1.752289253972529, "grad_norm": 0.7426038956707869, "learning_rate": 3.739522999056094e-07, "loss": 0.28222415447235105, "num_input_tokens_seen": 1138066152, "step": 26025, "train_runtime": 201385.6107, "train_tokens_per_second": 5651.179 }, { "epoch": 1.752625908968489, "grad_norm": 0.7686985240205324, "learning_rate": 3.7294963237208326e-07, "loss": 0.3015716552734375, "num_input_tokens_seen": 1138288896, "step": 26030, "train_runtime": 201430.5418, "train_tokens_per_second": 5651.024 }, { "epoch": 1.7529625639644493, "grad_norm": 0.7939046805197044, "learning_rate": 3.7194825877843786e-07, "loss": 0.2880394458770752, "num_input_tokens_seen": 1138513200, "step": 26035, "train_runtime": 201479.5121, "train_tokens_per_second": 5650.764 }, { "epoch": 1.7532992189604095, "grad_norm": 0.7428618998986647, "learning_rate": 3.7094817940470375e-07, "loss": 0.30432782173156736, "num_input_tokens_seen": 1138721632, "step": 26040, "train_runtime": 201520.1099, "train_tokens_per_second": 5650.66 }, { "epoch": 1.7536358739563696, "grad_norm": 0.738527693119671, "learning_rate": 3.6994939453055044e-07, "loss": 0.2994675159454346, "num_input_tokens_seen": 1138951136, "step": 26045, "train_runtime": 201561.9244, "train_tokens_per_second": 5650.626 }, { "epoch": 1.7539725289523296, "grad_norm": 0.9322929614127222, "learning_rate": 3.6895190443528515e-07, "loss": 0.2943981170654297, "num_input_tokens_seen": 1139175408, "step": 26050, "train_runtime": 201601.723, "train_tokens_per_second": 5650.623 }, { "epoch": 1.7543091839482898, "grad_norm": 0.7070168137348763, "learning_rate": 3.679557093978525e-07, "loss": 0.312309193611145, "num_input_tokens_seen": 1139396600, "step": 26055, "train_runtime": 201638.5926, "train_tokens_per_second": 5650.687 }, { "epoch": 1.75464583894425, "grad_norm": 0.7986110214626218, "learning_rate": 3.669608096968341e-07, "loss": 0.29059772491455077, "num_input_tokens_seen": 1139603752, "step": 26060, "train_runtime": 201681.4232, "train_tokens_per_second": 5650.514 }, { "epoch": 1.75498249394021, "grad_norm": 0.8095452658769865, "learning_rate": 3.6596720561045295e-07, "loss": 0.2955317974090576, "num_input_tokens_seen": 1139829360, "step": 26065, "train_runtime": 201718.99, "train_tokens_per_second": 5650.58 }, { "epoch": 1.7553191489361701, "grad_norm": 0.791001274129923, "learning_rate": 3.6497489741656455e-07, "loss": 0.2989501476287842, "num_input_tokens_seen": 1140053168, "step": 26070, "train_runtime": 201754.5113, "train_tokens_per_second": 5650.695 }, { "epoch": 1.7556558039321304, "grad_norm": 0.6815029838821709, "learning_rate": 3.639838853926669e-07, "loss": 0.29015383720397947, "num_input_tokens_seen": 1140284016, "step": 26075, "train_runtime": 201793.6507, "train_tokens_per_second": 5650.743 }, { "epoch": 1.7559924589280906, "grad_norm": 0.7697158876317151, "learning_rate": 3.629941698158923e-07, "loss": 0.3135251998901367, "num_input_tokens_seen": 1140503592, "step": 26080, "train_runtime": 201837.3895, "train_tokens_per_second": 5650.606 }, { "epoch": 1.7563291139240507, "grad_norm": 0.6797973936849687, "learning_rate": 3.6200575096301207e-07, "loss": 0.2774399757385254, "num_input_tokens_seen": 1140721216, "step": 26085, "train_runtime": 201873.4172, "train_tokens_per_second": 5650.676 }, { "epoch": 1.7566657689200107, "grad_norm": 0.8393124553061458, "learning_rate": 3.61018629110434e-07, "loss": 0.32251529693603515, "num_input_tokens_seen": 1140946680, "step": 26090, "train_runtime": 201907.6529, "train_tokens_per_second": 5650.834 }, { "epoch": 1.757002423915971, "grad_norm": 0.7056858714134263, "learning_rate": 3.6003280453420386e-07, "loss": 0.2859219551086426, "num_input_tokens_seen": 1141168176, "step": 26095, "train_runtime": 201940.7733, "train_tokens_per_second": 5651.004 }, { "epoch": 1.7573390789119312, "grad_norm": 0.7740995437255472, "learning_rate": 3.59048277510004e-07, "loss": 0.28550260066986083, "num_input_tokens_seen": 1141389904, "step": 26100, "train_runtime": 201981.2605, "train_tokens_per_second": 5650.969 }, { "epoch": 1.7576757339078912, "grad_norm": 0.7658978202078977, "learning_rate": 3.5806504831315423e-07, "loss": 0.28779993057250974, "num_input_tokens_seen": 1141608056, "step": 26105, "train_runtime": 202020.9745, "train_tokens_per_second": 5650.938 }, { "epoch": 1.7580123889038513, "grad_norm": 0.7409514848212948, "learning_rate": 3.570831172186112e-07, "loss": 0.3048838138580322, "num_input_tokens_seen": 1141832104, "step": 26110, "train_runtime": 202059.9812, "train_tokens_per_second": 5650.956 }, { "epoch": 1.7583490438998115, "grad_norm": 0.7982423185812808, "learning_rate": 3.5610248450097084e-07, "loss": 0.30502030849456785, "num_input_tokens_seen": 1142049928, "step": 26115, "train_runtime": 202100.022, "train_tokens_per_second": 5650.914 }, { "epoch": 1.7586856988957718, "grad_norm": 0.7105646801738283, "learning_rate": 3.551231504344604e-07, "loss": 0.2915775775909424, "num_input_tokens_seen": 1142270008, "step": 26120, "train_runtime": 202138.5884, "train_tokens_per_second": 5650.925 }, { "epoch": 1.7590223538917318, "grad_norm": 0.6784969862052538, "learning_rate": 3.5414511529295036e-07, "loss": 0.30109832286834715, "num_input_tokens_seen": 1142484296, "step": 26125, "train_runtime": 202171.0989, "train_tokens_per_second": 5651.076 }, { "epoch": 1.7593590088876918, "grad_norm": 0.8313599079016897, "learning_rate": 3.5316837934994465e-07, "loss": 0.3126358509063721, "num_input_tokens_seen": 1142703184, "step": 26130, "train_runtime": 202211.0287, "train_tokens_per_second": 5651.043 }, { "epoch": 1.759695663883652, "grad_norm": 0.7462437378743789, "learning_rate": 3.521929428785836e-07, "loss": 0.3012665271759033, "num_input_tokens_seen": 1142932000, "step": 26135, "train_runtime": 202249.327, "train_tokens_per_second": 5651.104 }, { "epoch": 1.7600323188796123, "grad_norm": 0.7707749450724266, "learning_rate": 3.5121880615164584e-07, "loss": 0.3177218198776245, "num_input_tokens_seen": 1143147936, "step": 26140, "train_runtime": 202288.9562, "train_tokens_per_second": 5651.064 }, { "epoch": 1.7603689738755723, "grad_norm": 0.7201463000961772, "learning_rate": 3.5024596944154445e-07, "loss": 0.30140066146850586, "num_input_tokens_seen": 1143365592, "step": 26145, "train_runtime": 202327.958, "train_tokens_per_second": 5651.051 }, { "epoch": 1.7607056288715324, "grad_norm": 0.7940935130035773, "learning_rate": 3.4927443302033127e-07, "loss": 0.2727382659912109, "num_input_tokens_seen": 1143591488, "step": 26150, "train_runtime": 202375.4812, "train_tokens_per_second": 5650.84 }, { "epoch": 1.7610422838674926, "grad_norm": 0.7992454946312759, "learning_rate": 3.4830419715969233e-07, "loss": 0.2696976900100708, "num_input_tokens_seen": 1143804104, "step": 26155, "train_runtime": 202410.9519, "train_tokens_per_second": 5650.9 }, { "epoch": 1.7613789388634529, "grad_norm": 0.8375508909384706, "learning_rate": 3.4733526213095114e-07, "loss": 0.30320181846618655, "num_input_tokens_seen": 1144024536, "step": 26160, "train_runtime": 202453.0452, "train_tokens_per_second": 5650.814 }, { "epoch": 1.761715593859413, "grad_norm": 0.8560064029859269, "learning_rate": 3.4636762820506876e-07, "loss": 0.3035079002380371, "num_input_tokens_seen": 1144244512, "step": 26165, "train_runtime": 202492.5015, "train_tokens_per_second": 5650.799 }, { "epoch": 1.762052248855373, "grad_norm": 0.8794486904268961, "learning_rate": 3.4540129565263867e-07, "loss": 0.30885040760040283, "num_input_tokens_seen": 1144457424, "step": 26170, "train_runtime": 202528.6337, "train_tokens_per_second": 5650.843 }, { "epoch": 1.7623889038513332, "grad_norm": 0.7747667521193755, "learning_rate": 3.444362647438942e-07, "loss": 0.30580987930297854, "num_input_tokens_seen": 1144685136, "step": 26175, "train_runtime": 202566.2912, "train_tokens_per_second": 5650.916 }, { "epoch": 1.7627255588472934, "grad_norm": 0.749987526461497, "learning_rate": 3.434725357487029e-07, "loss": 0.29648699760437014, "num_input_tokens_seen": 1144912488, "step": 26180, "train_runtime": 202608.8203, "train_tokens_per_second": 5650.852 }, { "epoch": 1.7630622138432535, "grad_norm": 0.7973029748008016, "learning_rate": 3.4251010893656844e-07, "loss": 0.3241448402404785, "num_input_tokens_seen": 1145132240, "step": 26185, "train_runtime": 202646.9809, "train_tokens_per_second": 5650.872 }, { "epoch": 1.7633988688392135, "grad_norm": 0.8079881889044294, "learning_rate": 3.4154898457663065e-07, "loss": 0.2964663505554199, "num_input_tokens_seen": 1145339072, "step": 26190, "train_runtime": 202684.9934, "train_tokens_per_second": 5650.833 }, { "epoch": 1.7637355238351737, "grad_norm": 0.74358995342413, "learning_rate": 3.40589162937664e-07, "loss": 0.2934283256530762, "num_input_tokens_seen": 1145537280, "step": 26195, "train_runtime": 202723.2034, "train_tokens_per_second": 5650.746 }, { "epoch": 1.764072178831134, "grad_norm": 0.7784930364611832, "learning_rate": 3.3963064428808034e-07, "loss": 0.2671190738677979, "num_input_tokens_seen": 1145744432, "step": 26200, "train_runtime": 202765.8103, "train_tokens_per_second": 5650.58 }, { "epoch": 1.764408833827094, "grad_norm": 0.6964223743604306, "learning_rate": 3.386734288959265e-07, "loss": 0.29965527057647706, "num_input_tokens_seen": 1145941000, "step": 26205, "train_runtime": 202807.8719, "train_tokens_per_second": 5650.377 }, { "epoch": 1.764745488823054, "grad_norm": 0.7356574014692101, "learning_rate": 3.377175170288838e-07, "loss": 0.3009481430053711, "num_input_tokens_seen": 1146164576, "step": 26210, "train_runtime": 202841.3847, "train_tokens_per_second": 5650.546 }, { "epoch": 1.7650821438190143, "grad_norm": 0.7941269061669325, "learning_rate": 3.367629089542712e-07, "loss": 0.2912009239196777, "num_input_tokens_seen": 1146397144, "step": 26215, "train_runtime": 202889.1986, "train_tokens_per_second": 5650.361 }, { "epoch": 1.7654187988149745, "grad_norm": 0.7636350648934562, "learning_rate": 3.3580960493904024e-07, "loss": 0.3059426546096802, "num_input_tokens_seen": 1146616808, "step": 26220, "train_runtime": 202930.3093, "train_tokens_per_second": 5650.298 }, { "epoch": 1.7657554538109346, "grad_norm": 0.7999400483263438, "learning_rate": 3.3485760524978093e-07, "loss": 0.31472842693328856, "num_input_tokens_seen": 1146822992, "step": 26225, "train_runtime": 202962.5617, "train_tokens_per_second": 5650.416 }, { "epoch": 1.7660921088068946, "grad_norm": 0.826503171384712, "learning_rate": 3.3390691015271646e-07, "loss": 0.29501938819885254, "num_input_tokens_seen": 1147041408, "step": 26230, "train_runtime": 202998.4752, "train_tokens_per_second": 5650.493 }, { "epoch": 1.7664287638028549, "grad_norm": 0.7752263216759548, "learning_rate": 3.329575199137053e-07, "loss": 0.2826894521713257, "num_input_tokens_seen": 1147263888, "step": 26235, "train_runtime": 203037.2378, "train_tokens_per_second": 5650.51 }, { "epoch": 1.766765418798815, "grad_norm": 0.8585013195673774, "learning_rate": 3.3200943479824113e-07, "loss": 0.327055025100708, "num_input_tokens_seen": 1147480536, "step": 26240, "train_runtime": 203079.6569, "train_tokens_per_second": 5650.396 }, { "epoch": 1.7671020737947751, "grad_norm": 0.6517474645162997, "learning_rate": 3.3106265507145406e-07, "loss": 0.2585421562194824, "num_input_tokens_seen": 1147695160, "step": 26245, "train_runtime": 203115.9008, "train_tokens_per_second": 5650.445 }, { "epoch": 1.7674387287907352, "grad_norm": 0.7376728837137707, "learning_rate": 3.3011718099810687e-07, "loss": 0.28537108898162844, "num_input_tokens_seen": 1147904984, "step": 26250, "train_runtime": 203155.1468, "train_tokens_per_second": 5650.386 }, { "epoch": 1.7677753837866954, "grad_norm": 0.7607253054674292, "learning_rate": 3.2917301284259904e-07, "loss": 0.3015407085418701, "num_input_tokens_seen": 1148133136, "step": 26255, "train_runtime": 203195.8171, "train_tokens_per_second": 5650.378 }, { "epoch": 1.7681120387826557, "grad_norm": 0.7368433932513038, "learning_rate": 3.2823015086896335e-07, "loss": 0.31117079257965086, "num_input_tokens_seen": 1148351808, "step": 26260, "train_runtime": 203231.7124, "train_tokens_per_second": 5650.456 }, { "epoch": 1.7684486937786157, "grad_norm": 0.7455974069716451, "learning_rate": 3.2728859534087e-07, "loss": 0.28980340957641604, "num_input_tokens_seen": 1148578048, "step": 26265, "train_runtime": 203270.0794, "train_tokens_per_second": 5650.502 }, { "epoch": 1.7687853487745757, "grad_norm": 0.726415832314535, "learning_rate": 3.263483465216194e-07, "loss": 0.30661208629608155, "num_input_tokens_seen": 1148808400, "step": 26270, "train_runtime": 203304.8486, "train_tokens_per_second": 5650.669 }, { "epoch": 1.769122003770536, "grad_norm": 0.7198274225186322, "learning_rate": 3.2540940467415126e-07, "loss": 0.29364948272705077, "num_input_tokens_seen": 1149026320, "step": 26275, "train_runtime": 203344.2573, "train_tokens_per_second": 5650.646 }, { "epoch": 1.7694586587664962, "grad_norm": 0.675379666160097, "learning_rate": 3.2447177006103726e-07, "loss": 0.29972095489501954, "num_input_tokens_seen": 1149241504, "step": 26280, "train_runtime": 203385.3582, "train_tokens_per_second": 5650.562 }, { "epoch": 1.7697953137624562, "grad_norm": 0.7180951826553738, "learning_rate": 3.235354429444831e-07, "loss": 0.29863905906677246, "num_input_tokens_seen": 1149442960, "step": 26285, "train_runtime": 203420.2428, "train_tokens_per_second": 5650.583 }, { "epoch": 1.7701319687584163, "grad_norm": 0.7550877294810541, "learning_rate": 3.226004235863306e-07, "loss": 0.3004556655883789, "num_input_tokens_seen": 1149664768, "step": 26290, "train_runtime": 203464.2499, "train_tokens_per_second": 5650.451 }, { "epoch": 1.7704686237543765, "grad_norm": 0.7735355193352721, "learning_rate": 3.2166671224805437e-07, "loss": 0.2912909984588623, "num_input_tokens_seen": 1149894072, "step": 26295, "train_runtime": 203504.8957, "train_tokens_per_second": 5650.449 }, { "epoch": 1.7708052787503368, "grad_norm": 0.7860723514589903, "learning_rate": 3.207343091907633e-07, "loss": 0.28990769386291504, "num_input_tokens_seen": 1150100408, "step": 26300, "train_runtime": 203547.7921, "train_tokens_per_second": 5650.272 }, { "epoch": 1.7711419337462968, "grad_norm": 0.8144219098196478, "learning_rate": 3.1980321467520226e-07, "loss": 0.30245256423950195, "num_input_tokens_seen": 1150300712, "step": 26305, "train_runtime": 203587.3111, "train_tokens_per_second": 5650.159 }, { "epoch": 1.7714785887422568, "grad_norm": 0.8081994567096525, "learning_rate": 3.1887342896174735e-07, "loss": 0.31411175727844237, "num_input_tokens_seen": 1150501592, "step": 26310, "train_runtime": 203630.5459, "train_tokens_per_second": 5649.946 }, { "epoch": 1.771815243738217, "grad_norm": 0.6657629683425634, "learning_rate": 3.1794495231041276e-07, "loss": 0.28406760692596433, "num_input_tokens_seen": 1150727232, "step": 26315, "train_runtime": 203671.5283, "train_tokens_per_second": 5649.917 }, { "epoch": 1.7721518987341773, "grad_norm": 0.7568239836133204, "learning_rate": 3.1701778498084035e-07, "loss": 0.3084291458129883, "num_input_tokens_seen": 1150932320, "step": 26320, "train_runtime": 203712.8008, "train_tokens_per_second": 5649.779 }, { "epoch": 1.7724885537301374, "grad_norm": 0.7723629219802286, "learning_rate": 3.160919272323121e-07, "loss": 0.3075510263442993, "num_input_tokens_seen": 1151162984, "step": 26325, "train_runtime": 203750.2121, "train_tokens_per_second": 5649.874 }, { "epoch": 1.7728252087260974, "grad_norm": 0.7180286793509041, "learning_rate": 3.1516737932374087e-07, "loss": 0.30257492065429686, "num_input_tokens_seen": 1151371272, "step": 26330, "train_runtime": 203784.7687, "train_tokens_per_second": 5649.938 }, { "epoch": 1.7731618637220576, "grad_norm": 0.7988698082761704, "learning_rate": 3.142441415136727e-07, "loss": 0.29022831916809083, "num_input_tokens_seen": 1151601408, "step": 26335, "train_runtime": 203817.7911, "train_tokens_per_second": 5650.152 }, { "epoch": 1.773498518718018, "grad_norm": 0.7403905711500696, "learning_rate": 3.133222140602893e-07, "loss": 0.2794740438461304, "num_input_tokens_seen": 1151807024, "step": 26340, "train_runtime": 203851.848, "train_tokens_per_second": 5650.216 }, { "epoch": 1.773835173713978, "grad_norm": 0.7358244297636568, "learning_rate": 3.124015972214034e-07, "loss": 0.30714993476867675, "num_input_tokens_seen": 1152030904, "step": 26345, "train_runtime": 203880.8052, "train_tokens_per_second": 5650.512 }, { "epoch": 1.774171828709938, "grad_norm": 0.7987243174003847, "learning_rate": 3.114822912544635e-07, "loss": 0.31725311279296875, "num_input_tokens_seen": 1152240824, "step": 26350, "train_runtime": 203921.8118, "train_tokens_per_second": 5650.405 }, { "epoch": 1.7745084837058982, "grad_norm": 0.7884531597674449, "learning_rate": 3.1056429641655007e-07, "loss": 0.2949615716934204, "num_input_tokens_seen": 1152447328, "step": 26355, "train_runtime": 203963.8804, "train_tokens_per_second": 5650.252 }, { "epoch": 1.7748451387018584, "grad_norm": 0.8631624259760383, "learning_rate": 3.0964761296437665e-07, "loss": 0.2921284198760986, "num_input_tokens_seen": 1152671024, "step": 26360, "train_runtime": 204005.1311, "train_tokens_per_second": 5650.206 }, { "epoch": 1.7751817936978185, "grad_norm": 0.7806230963793127, "learning_rate": 3.087322411542937e-07, "loss": 0.3069296836853027, "num_input_tokens_seen": 1152898216, "step": 26365, "train_runtime": 204043.7868, "train_tokens_per_second": 5650.249 }, { "epoch": 1.7755184486937785, "grad_norm": 0.8045496935454175, "learning_rate": 3.0781818124227867e-07, "loss": 0.27917664051055907, "num_input_tokens_seen": 1153109064, "step": 26370, "train_runtime": 204083.2918, "train_tokens_per_second": 5650.188 }, { "epoch": 1.7758551036897388, "grad_norm": 0.7628962650971699, "learning_rate": 3.0690543348394776e-07, "loss": 0.2973165988922119, "num_input_tokens_seen": 1153332104, "step": 26375, "train_runtime": 204124.6151, "train_tokens_per_second": 5650.137 }, { "epoch": 1.776191758685699, "grad_norm": 0.735769438564152, "learning_rate": 3.059939981345467e-07, "loss": 0.2835052490234375, "num_input_tokens_seen": 1153547680, "step": 26380, "train_runtime": 204153.8046, "train_tokens_per_second": 5650.385 }, { "epoch": 1.776528413681659, "grad_norm": 0.7910223938595813, "learning_rate": 3.050838754489566e-07, "loss": 0.28968124389648436, "num_input_tokens_seen": 1153764144, "step": 26385, "train_runtime": 204197.8486, "train_tokens_per_second": 5650.227 }, { "epoch": 1.776865068677619, "grad_norm": 0.7189107694256088, "learning_rate": 3.041750656816894e-07, "loss": 0.29620354175567626, "num_input_tokens_seen": 1153982600, "step": 26390, "train_runtime": 204235.7042, "train_tokens_per_second": 5650.249 }, { "epoch": 1.7772017236735793, "grad_norm": 0.8335040707060406, "learning_rate": 3.0326756908689135e-07, "loss": 0.3176565647125244, "num_input_tokens_seen": 1154204320, "step": 26395, "train_runtime": 204274.2047, "train_tokens_per_second": 5650.27 }, { "epoch": 1.7775383786695396, "grad_norm": 0.687809411831832, "learning_rate": 3.0236138591833995e-07, "loss": 0.2815841197967529, "num_input_tokens_seen": 1154426800, "step": 26400, "train_runtime": 204312.8632, "train_tokens_per_second": 5650.289 }, { "epoch": 1.7778750336654996, "grad_norm": 0.7809149749160714, "learning_rate": 3.0145651642944863e-07, "loss": 0.31723904609680176, "num_input_tokens_seen": 1154656600, "step": 26405, "train_runtime": 204357.2069, "train_tokens_per_second": 5650.188 }, { "epoch": 1.7782116886614596, "grad_norm": 0.739025964030064, "learning_rate": 3.005529608732588e-07, "loss": 0.26880898475646975, "num_input_tokens_seen": 1154869552, "step": 26410, "train_runtime": 204394.2963, "train_tokens_per_second": 5650.204 }, { "epoch": 1.7785483436574199, "grad_norm": 0.7646452369868884, "learning_rate": 2.996507195024495e-07, "loss": 0.322553014755249, "num_input_tokens_seen": 1155101520, "step": 26415, "train_runtime": 204435.1594, "train_tokens_per_second": 5650.21 }, { "epoch": 1.7788849986533801, "grad_norm": 0.8474473108460225, "learning_rate": 2.9874979256932614e-07, "loss": 0.2975711107254028, "num_input_tokens_seen": 1155322552, "step": 26420, "train_runtime": 204473.0585, "train_tokens_per_second": 5650.243 }, { "epoch": 1.7792216536493402, "grad_norm": 0.8062221329371094, "learning_rate": 2.9785018032583325e-07, "loss": 0.3099265813827515, "num_input_tokens_seen": 1155544168, "step": 26425, "train_runtime": 204516.1566, "train_tokens_per_second": 5650.136 }, { "epoch": 1.7795583086453002, "grad_norm": 0.8324573418937758, "learning_rate": 2.969518830235435e-07, "loss": 0.298630952835083, "num_input_tokens_seen": 1155762856, "step": 26430, "train_runtime": 204549.2337, "train_tokens_per_second": 5650.292 }, { "epoch": 1.7798949636412604, "grad_norm": 0.7975157170801572, "learning_rate": 2.960549009136626e-07, "loss": 0.30402772426605223, "num_input_tokens_seen": 1155983360, "step": 26435, "train_runtime": 204590.4666, "train_tokens_per_second": 5650.231 }, { "epoch": 1.7802316186372207, "grad_norm": 0.8344419171870143, "learning_rate": 2.951592342470289e-07, "loss": 0.33509268760681155, "num_input_tokens_seen": 1156211056, "step": 26440, "train_runtime": 204625.1719, "train_tokens_per_second": 5650.385 }, { "epoch": 1.7805682736331807, "grad_norm": 0.7399401765355089, "learning_rate": 2.942648832741124e-07, "loss": 0.28286046981811525, "num_input_tokens_seen": 1156416184, "step": 26445, "train_runtime": 204663.2394, "train_tokens_per_second": 5650.337 }, { "epoch": 1.7809049286291407, "grad_norm": 0.6734864094384185, "learning_rate": 2.933718482450154e-07, "loss": 0.2894281387329102, "num_input_tokens_seen": 1156635048, "step": 26450, "train_runtime": 204698.0899, "train_tokens_per_second": 5650.444 }, { "epoch": 1.781241583625101, "grad_norm": 0.8706400424083963, "learning_rate": 2.9248012940947423e-07, "loss": 0.3163520097732544, "num_input_tokens_seen": 1156864984, "step": 26455, "train_runtime": 204729.4569, "train_tokens_per_second": 5650.701 }, { "epoch": 1.7815782386210612, "grad_norm": 0.7638164398502649, "learning_rate": 2.915897270168522e-07, "loss": 0.2976935625076294, "num_input_tokens_seen": 1157071688, "step": 26460, "train_runtime": 204767.7005, "train_tokens_per_second": 5650.655 }, { "epoch": 1.7819148936170213, "grad_norm": 0.8606236851862529, "learning_rate": 2.9070064131615004e-07, "loss": 0.30093798637390134, "num_input_tokens_seen": 1157281584, "step": 26465, "train_runtime": 204809.9681, "train_tokens_per_second": 5650.514 }, { "epoch": 1.7822515486129813, "grad_norm": 0.8072069252667485, "learning_rate": 2.8981287255599567e-07, "loss": 0.291579532623291, "num_input_tokens_seen": 1157474720, "step": 26470, "train_runtime": 204843.9736, "train_tokens_per_second": 5650.519 }, { "epoch": 1.7825882036089415, "grad_norm": 0.7787592014629802, "learning_rate": 2.8892642098465205e-07, "loss": 0.2964937210083008, "num_input_tokens_seen": 1157694912, "step": 26475, "train_runtime": 204887.0752, "train_tokens_per_second": 5650.405 }, { "epoch": 1.7829248586049018, "grad_norm": 0.741114575623905, "learning_rate": 2.8804128685001263e-07, "loss": 0.29356560707092283, "num_input_tokens_seen": 1157923424, "step": 26480, "train_runtime": 204930.4827, "train_tokens_per_second": 5650.323 }, { "epoch": 1.7832615136008618, "grad_norm": 0.8320550507276643, "learning_rate": 2.8715747039960216e-07, "loss": 0.2721066474914551, "num_input_tokens_seen": 1158134336, "step": 26485, "train_runtime": 204962.95, "train_tokens_per_second": 5650.457 }, { "epoch": 1.7835981685968219, "grad_norm": 0.8218511157843951, "learning_rate": 2.8627497188057684e-07, "loss": 0.30223267078399657, "num_input_tokens_seen": 1158358632, "step": 26490, "train_runtime": 205002.9913, "train_tokens_per_second": 5650.447 }, { "epoch": 1.783934823592782, "grad_norm": 0.7711493227331807, "learning_rate": 2.853937915397248e-07, "loss": 0.32183716297149656, "num_input_tokens_seen": 1158575032, "step": 26495, "train_runtime": 205041.1723, "train_tokens_per_second": 5650.451 }, { "epoch": 1.7842714785887424, "grad_norm": 0.7845009644246281, "learning_rate": 2.845139296234639e-07, "loss": 0.28379087448120116, "num_input_tokens_seen": 1158803496, "step": 26500, "train_runtime": 205077.698, "train_tokens_per_second": 5650.558 }, { "epoch": 1.7846081335847024, "grad_norm": 0.6932426732560467, "learning_rate": 2.836353863778479e-07, "loss": 0.29067995548248293, "num_input_tokens_seen": 1159023072, "step": 26505, "train_runtime": 205114.9773, "train_tokens_per_second": 5650.602 }, { "epoch": 1.7849447885806624, "grad_norm": 0.66733187111737, "learning_rate": 2.8275816204855534e-07, "loss": 0.3040937900543213, "num_input_tokens_seen": 1159239184, "step": 26510, "train_runtime": 205163.8168, "train_tokens_per_second": 5650.31 }, { "epoch": 1.7852814435766227, "grad_norm": 0.8094709155559127, "learning_rate": 2.818822568809015e-07, "loss": 0.31920318603515624, "num_input_tokens_seen": 1159445280, "step": 26515, "train_runtime": 205199.8163, "train_tokens_per_second": 5650.323 }, { "epoch": 1.785618098572583, "grad_norm": 0.7397186499607165, "learning_rate": 2.810076711198284e-07, "loss": 0.2857333183288574, "num_input_tokens_seen": 1159658816, "step": 26520, "train_runtime": 205238.5515, "train_tokens_per_second": 5650.297 }, { "epoch": 1.785954753568543, "grad_norm": 0.7573212272405271, "learning_rate": 2.801344050099131e-07, "loss": 0.3130965709686279, "num_input_tokens_seen": 1159896520, "step": 26525, "train_runtime": 205275.2217, "train_tokens_per_second": 5650.446 }, { "epoch": 1.786291408564503, "grad_norm": 0.7444021852294227, "learning_rate": 2.7926245879536076e-07, "loss": 0.3018080711364746, "num_input_tokens_seen": 1160116400, "step": 26530, "train_runtime": 205318.3954, "train_tokens_per_second": 5650.329 }, { "epoch": 1.7866280635604632, "grad_norm": 0.7159851006520612, "learning_rate": 2.7839183272000857e-07, "loss": 0.28679165840148924, "num_input_tokens_seen": 1160350120, "step": 26535, "train_runtime": 205353.8407, "train_tokens_per_second": 5650.491 }, { "epoch": 1.7869647185564235, "grad_norm": 0.9695258135131855, "learning_rate": 2.775225270273241e-07, "loss": 0.30443391799926756, "num_input_tokens_seen": 1160577328, "step": 26540, "train_runtime": 205388.8223, "train_tokens_per_second": 5650.635 }, { "epoch": 1.7873013735523835, "grad_norm": 0.6888517858579661, "learning_rate": 2.7665454196040665e-07, "loss": 0.2736891508102417, "num_input_tokens_seen": 1160803320, "step": 26545, "train_runtime": 205426.5857, "train_tokens_per_second": 5650.697 }, { "epoch": 1.7876380285483435, "grad_norm": 0.8050232282526216, "learning_rate": 2.7578787776198325e-07, "loss": 0.31282496452331543, "num_input_tokens_seen": 1161013768, "step": 26550, "train_runtime": 205464.4875, "train_tokens_per_second": 5650.679 }, { "epoch": 1.7879746835443038, "grad_norm": 0.7051417852744916, "learning_rate": 2.7492253467441775e-07, "loss": 0.2743107318878174, "num_input_tokens_seen": 1161234120, "step": 26555, "train_runtime": 205500.8557, "train_tokens_per_second": 5650.751 }, { "epoch": 1.788311338540264, "grad_norm": 0.7282394673289367, "learning_rate": 2.740585129396961e-07, "loss": 0.30170412063598634, "num_input_tokens_seen": 1161458560, "step": 26560, "train_runtime": 205545.0743, "train_tokens_per_second": 5650.627 }, { "epoch": 1.788647993536224, "grad_norm": 0.7602917600626389, "learning_rate": 2.731958127994433e-07, "loss": 0.2769881248474121, "num_input_tokens_seen": 1161674768, "step": 26565, "train_runtime": 205586.7314, "train_tokens_per_second": 5650.534 }, { "epoch": 1.788984648532184, "grad_norm": 0.8213091294594603, "learning_rate": 2.7233443449490695e-07, "loss": 0.307672905921936, "num_input_tokens_seen": 1161890360, "step": 26570, "train_runtime": 205630.1097, "train_tokens_per_second": 5650.39 }, { "epoch": 1.7893213035281443, "grad_norm": 0.7931628273831316, "learning_rate": 2.7147437826697153e-07, "loss": 0.29656333923339845, "num_input_tokens_seen": 1162107656, "step": 26575, "train_runtime": 205671.7811, "train_tokens_per_second": 5650.302 }, { "epoch": 1.7896579585241046, "grad_norm": 1.1103372341248579, "learning_rate": 2.706156443561481e-07, "loss": 0.3016365528106689, "num_input_tokens_seen": 1162338136, "step": 26580, "train_runtime": 205709.1075, "train_tokens_per_second": 5650.397 }, { "epoch": 1.7899946135200646, "grad_norm": 0.7165987576366394, "learning_rate": 2.6975823300257884e-07, "loss": 0.29532361030578613, "num_input_tokens_seen": 1162551688, "step": 26585, "train_runtime": 205742.7144, "train_tokens_per_second": 5650.512 }, { "epoch": 1.7903312685160246, "grad_norm": 0.6849565677358419, "learning_rate": 2.6890214444603604e-07, "loss": 0.29342079162597656, "num_input_tokens_seen": 1162773064, "step": 26590, "train_runtime": 205775.5364, "train_tokens_per_second": 5650.687 }, { "epoch": 1.790667923511985, "grad_norm": 0.8242687417078883, "learning_rate": 2.6804737892592193e-07, "loss": 0.30418787002563474, "num_input_tokens_seen": 1162987848, "step": 26595, "train_runtime": 205824.7685, "train_tokens_per_second": 5650.379 }, { "epoch": 1.7910045785079451, "grad_norm": 0.8268380789860988, "learning_rate": 2.671939366812687e-07, "loss": 0.30772976875305175, "num_input_tokens_seen": 1163202312, "step": 26600, "train_runtime": 205862.7926, "train_tokens_per_second": 5650.377 }, { "epoch": 1.7913412335039052, "grad_norm": 0.767877157549208, "learning_rate": 2.66341817950741e-07, "loss": 0.29974985122680664, "num_input_tokens_seen": 1163438080, "step": 26605, "train_runtime": 205898.0882, "train_tokens_per_second": 5650.553 }, { "epoch": 1.7916778884998652, "grad_norm": 0.7009232602836326, "learning_rate": 2.6549102297262764e-07, "loss": 0.29571521282196045, "num_input_tokens_seen": 1163660200, "step": 26610, "train_runtime": 205939.8237, "train_tokens_per_second": 5650.487 }, { "epoch": 1.7920145434958255, "grad_norm": 0.871322486063614, "learning_rate": 2.6464155198485387e-07, "loss": 0.30173745155334475, "num_input_tokens_seen": 1163887248, "step": 26615, "train_runtime": 205979.0591, "train_tokens_per_second": 5650.512 }, { "epoch": 1.7923511984917857, "grad_norm": 0.803169204691401, "learning_rate": 2.6379340522496853e-07, "loss": 0.29706802368164065, "num_input_tokens_seen": 1164110704, "step": 26620, "train_runtime": 206013.7386, "train_tokens_per_second": 5650.646 }, { "epoch": 1.7926878534877457, "grad_norm": 0.7782352100729737, "learning_rate": 2.6294658293015584e-07, "loss": 0.3205864429473877, "num_input_tokens_seen": 1164337200, "step": 26625, "train_runtime": 206050.8157, "train_tokens_per_second": 5650.728 }, { "epoch": 1.7930245084837058, "grad_norm": 0.8588354428150048, "learning_rate": 2.621010853372258e-07, "loss": 0.31758651733398435, "num_input_tokens_seen": 1164544968, "step": 26630, "train_runtime": 206091.8464, "train_tokens_per_second": 5650.612 }, { "epoch": 1.793361163479666, "grad_norm": 0.8321453808487478, "learning_rate": 2.612569126826187e-07, "loss": 0.3288443088531494, "num_input_tokens_seen": 1164763392, "step": 26635, "train_runtime": 206129.4651, "train_tokens_per_second": 5650.64 }, { "epoch": 1.7936978184756263, "grad_norm": 0.7646490512058014, "learning_rate": 2.6041406520240563e-07, "loss": 0.3208475589752197, "num_input_tokens_seen": 1164996760, "step": 26640, "train_runtime": 206162.845, "train_tokens_per_second": 5650.857 }, { "epoch": 1.7940344734715863, "grad_norm": 0.9618962883016744, "learning_rate": 2.5957254313228595e-07, "loss": 0.3083490371704102, "num_input_tokens_seen": 1165209184, "step": 26645, "train_runtime": 206203.1869, "train_tokens_per_second": 5650.782 }, { "epoch": 1.7943711284675463, "grad_norm": 0.6865797037478947, "learning_rate": 2.5873234670758753e-07, "loss": 0.2793558597564697, "num_input_tokens_seen": 1165437296, "step": 26650, "train_runtime": 206245.195, "train_tokens_per_second": 5650.737 }, { "epoch": 1.7947077834635066, "grad_norm": 0.743249619367278, "learning_rate": 2.578934761632712e-07, "loss": 0.29536702632904055, "num_input_tokens_seen": 1165668480, "step": 26655, "train_runtime": 206276.3477, "train_tokens_per_second": 5651.004 }, { "epoch": 1.7950444384594668, "grad_norm": 0.775356540520281, "learning_rate": 2.570559317339211e-07, "loss": 0.30143041610717775, "num_input_tokens_seen": 1165893536, "step": 26660, "train_runtime": 206318.3881, "train_tokens_per_second": 5650.943 }, { "epoch": 1.7953810934554268, "grad_norm": 0.6994994001366991, "learning_rate": 2.56219713653757e-07, "loss": 0.2995075941085815, "num_input_tokens_seen": 1166122240, "step": 26665, "train_runtime": 206352.7461, "train_tokens_per_second": 5651.111 }, { "epoch": 1.7957177484513869, "grad_norm": 0.8569243475539816, "learning_rate": 2.5538482215662187e-07, "loss": 0.3236057758331299, "num_input_tokens_seen": 1166338248, "step": 26670, "train_runtime": 206386.7169, "train_tokens_per_second": 5651.227 }, { "epoch": 1.7960544034473471, "grad_norm": 0.766892273093451, "learning_rate": 2.545512574759923e-07, "loss": 0.2701665163040161, "num_input_tokens_seen": 1166555592, "step": 26675, "train_runtime": 206433.7742, "train_tokens_per_second": 5650.992 }, { "epoch": 1.7963910584433074, "grad_norm": 0.7756837374057447, "learning_rate": 2.537190198449713e-07, "loss": 0.31007416248321534, "num_input_tokens_seen": 1166772216, "step": 26680, "train_runtime": 206467.3628, "train_tokens_per_second": 5651.122 }, { "epoch": 1.7967277134392674, "grad_norm": 0.7601571953732823, "learning_rate": 2.5288810949629207e-07, "loss": 0.3006875991821289, "num_input_tokens_seen": 1166996856, "step": 26685, "train_runtime": 206509.338, "train_tokens_per_second": 5651.061 }, { "epoch": 1.7970643684352274, "grad_norm": 0.7713983757495535, "learning_rate": 2.5205852666231544e-07, "loss": 0.2778863668441772, "num_input_tokens_seen": 1167208832, "step": 26690, "train_runtime": 206552.5087, "train_tokens_per_second": 5650.906 }, { "epoch": 1.7974010234311877, "grad_norm": 0.8187900042183005, "learning_rate": 2.5123027157503144e-07, "loss": 0.28261337280273435, "num_input_tokens_seen": 1167408464, "step": 26695, "train_runtime": 206590.339, "train_tokens_per_second": 5650.838 }, { "epoch": 1.797737678427148, "grad_norm": 0.7565722539390317, "learning_rate": 2.504033444660592e-07, "loss": 0.3025941848754883, "num_input_tokens_seen": 1167643608, "step": 26700, "train_runtime": 206627.1922, "train_tokens_per_second": 5650.968 }, { "epoch": 1.798074333423108, "grad_norm": 0.6833026230882182, "learning_rate": 2.4957774556664706e-07, "loss": 0.28271756172180174, "num_input_tokens_seen": 1167868528, "step": 26705, "train_runtime": 206670.4456, "train_tokens_per_second": 5650.873 }, { "epoch": 1.798410988419068, "grad_norm": 0.8308124821063052, "learning_rate": 2.487534751076692e-07, "loss": 0.29103024005889894, "num_input_tokens_seen": 1168090128, "step": 26710, "train_runtime": 206715.3981, "train_tokens_per_second": 5650.717 }, { "epoch": 1.7987476434150282, "grad_norm": 0.7543688224419066, "learning_rate": 2.47930533319633e-07, "loss": 0.2806957721710205, "num_input_tokens_seen": 1168302824, "step": 26715, "train_runtime": 206757.8975, "train_tokens_per_second": 5650.584 }, { "epoch": 1.7990842984109885, "grad_norm": 0.8079691544469572, "learning_rate": 2.4710892043266823e-07, "loss": 0.3256166219711304, "num_input_tokens_seen": 1168526496, "step": 26720, "train_runtime": 206793.1384, "train_tokens_per_second": 5650.702 }, { "epoch": 1.7994209534069485, "grad_norm": 0.7709686680304173, "learning_rate": 2.462886366765388e-07, "loss": 0.2893906354904175, "num_input_tokens_seen": 1168747720, "step": 26725, "train_runtime": 206834.9728, "train_tokens_per_second": 5650.629 }, { "epoch": 1.7997576084029085, "grad_norm": 0.861388639740031, "learning_rate": 2.454696822806341e-07, "loss": 0.3119854211807251, "num_input_tokens_seen": 1168955928, "step": 26730, "train_runtime": 206876.7703, "train_tokens_per_second": 5650.494 }, { "epoch": 1.8000942633988688, "grad_norm": 0.7333451652936307, "learning_rate": 2.446520574739708e-07, "loss": 0.2833410739898682, "num_input_tokens_seen": 1169181640, "step": 26735, "train_runtime": 206910.3727, "train_tokens_per_second": 5650.667 }, { "epoch": 1.800430918394829, "grad_norm": 0.8244240692612769, "learning_rate": 2.438357624851967e-07, "loss": 0.265745735168457, "num_input_tokens_seen": 1169399504, "step": 26740, "train_runtime": 206944.8765, "train_tokens_per_second": 5650.778 }, { "epoch": 1.800767573390789, "grad_norm": 0.7646663892198701, "learning_rate": 2.430207975425847e-07, "loss": 0.30634517669677735, "num_input_tokens_seen": 1169627072, "step": 26745, "train_runtime": 206986.9735, "train_tokens_per_second": 5650.728 }, { "epoch": 1.801104228386749, "grad_norm": 0.7977131343420332, "learning_rate": 2.4220716287403744e-07, "loss": 0.306353759765625, "num_input_tokens_seen": 1169859232, "step": 26750, "train_runtime": 207024.3013, "train_tokens_per_second": 5650.83 }, { "epoch": 1.8014408833827094, "grad_norm": 0.7225010612739647, "learning_rate": 2.413948587070869e-07, "loss": 0.2988481044769287, "num_input_tokens_seen": 1170041408, "step": 26755, "train_runtime": 207063.8036, "train_tokens_per_second": 5650.632 }, { "epoch": 1.8017775383786696, "grad_norm": 0.775593581305895, "learning_rate": 2.405838852688891e-07, "loss": 0.3097994327545166, "num_input_tokens_seen": 1170267480, "step": 26760, "train_runtime": 207095.0651, "train_tokens_per_second": 5650.871 }, { "epoch": 1.8021141933746296, "grad_norm": 0.8152686402481596, "learning_rate": 2.397742427862315e-07, "loss": 0.2666957378387451, "num_input_tokens_seen": 1170495840, "step": 26765, "train_runtime": 207129.3856, "train_tokens_per_second": 5651.037 }, { "epoch": 1.8024508483705897, "grad_norm": 0.7668475732368676, "learning_rate": 2.3896593148552695e-07, "loss": 0.3030317544937134, "num_input_tokens_seen": 1170707968, "step": 26770, "train_runtime": 207164.983, "train_tokens_per_second": 5651.09 }, { "epoch": 1.80278750336655, "grad_norm": 0.7115287772275755, "learning_rate": 2.3815895159281844e-07, "loss": 0.28127307891845704, "num_input_tokens_seen": 1170932136, "step": 26775, "train_runtime": 207201.4624, "train_tokens_per_second": 5651.177 }, { "epoch": 1.8031241583625102, "grad_norm": 0.7814253275211129, "learning_rate": 2.3735330333377493e-07, "loss": 0.2792118310928345, "num_input_tokens_seen": 1171162408, "step": 26780, "train_runtime": 207238.2441, "train_tokens_per_second": 5651.285 }, { "epoch": 1.8034608133584702, "grad_norm": 0.8200002096055589, "learning_rate": 2.3654898693369232e-07, "loss": 0.29738240242004393, "num_input_tokens_seen": 1171377408, "step": 26785, "train_runtime": 207281.7346, "train_tokens_per_second": 5651.137 }, { "epoch": 1.8037974683544302, "grad_norm": 0.7884729475059873, "learning_rate": 2.3574600261749735e-07, "loss": 0.30119688510894777, "num_input_tokens_seen": 1171597216, "step": 26790, "train_runtime": 207321.2969, "train_tokens_per_second": 5651.118 }, { "epoch": 1.8041341233503905, "grad_norm": 0.8577997537906676, "learning_rate": 2.3494435060973875e-07, "loss": 0.3168250322341919, "num_input_tokens_seen": 1171822008, "step": 26795, "train_runtime": 207355.9199, "train_tokens_per_second": 5651.259 }, { "epoch": 1.8044707783463507, "grad_norm": 0.9036192566903659, "learning_rate": 2.3414403113459937e-07, "loss": 0.30097527503967286, "num_input_tokens_seen": 1172040272, "step": 26800, "train_runtime": 207392.3163, "train_tokens_per_second": 5651.32 }, { "epoch": 1.8048074333423108, "grad_norm": 0.7489283622158472, "learning_rate": 2.3334504441588413e-07, "loss": 0.2781896352767944, "num_input_tokens_seen": 1172260704, "step": 26805, "train_runtime": 207432.2609, "train_tokens_per_second": 5651.294 }, { "epoch": 1.8051440883382708, "grad_norm": 0.7236248733853186, "learning_rate": 2.3254739067702704e-07, "loss": 0.2797673225402832, "num_input_tokens_seen": 1172485680, "step": 26810, "train_runtime": 207469.9941, "train_tokens_per_second": 5651.351 }, { "epoch": 1.805480743334231, "grad_norm": 0.8892645318062625, "learning_rate": 2.3175107014109077e-07, "loss": 0.2838028907775879, "num_input_tokens_seen": 1172707720, "step": 26815, "train_runtime": 207507.3876, "train_tokens_per_second": 5651.402 }, { "epoch": 1.8058173983301913, "grad_norm": 0.7651063250427357, "learning_rate": 2.3095608303076223e-07, "loss": 0.311909818649292, "num_input_tokens_seen": 1172928712, "step": 26820, "train_runtime": 207551.5584, "train_tokens_per_second": 5651.264 }, { "epoch": 1.8061540533261513, "grad_norm": 0.734890627438004, "learning_rate": 2.3016242956835798e-07, "loss": 0.31490211486816405, "num_input_tokens_seen": 1173154336, "step": 26825, "train_runtime": 207594.3613, "train_tokens_per_second": 5651.186 }, { "epoch": 1.8064907083221113, "grad_norm": 0.7733770590852225, "learning_rate": 2.2937010997581999e-07, "loss": 0.284251070022583, "num_input_tokens_seen": 1173384008, "step": 26830, "train_runtime": 207634.0828, "train_tokens_per_second": 5651.211 }, { "epoch": 1.8068273633180716, "grad_norm": 0.9236592739480588, "learning_rate": 2.2857912447471818e-07, "loss": 0.2854511260986328, "num_input_tokens_seen": 1173591424, "step": 26835, "train_runtime": 207670.999, "train_tokens_per_second": 5651.205 }, { "epoch": 1.8071640183140318, "grad_norm": 0.709148295682169, "learning_rate": 2.2778947328625012e-07, "loss": 0.2829423427581787, "num_input_tokens_seen": 1173795056, "step": 26840, "train_runtime": 207707.7029, "train_tokens_per_second": 5651.187 }, { "epoch": 1.8075006733099919, "grad_norm": 0.9439136755079099, "learning_rate": 2.2700115663123745e-07, "loss": 0.3229234218597412, "num_input_tokens_seen": 1174010232, "step": 26845, "train_runtime": 207744.5589, "train_tokens_per_second": 5651.22 }, { "epoch": 1.807837328305952, "grad_norm": 0.9241155338367218, "learning_rate": 2.2621417473013164e-07, "loss": 0.28131952285766604, "num_input_tokens_seen": 1174230336, "step": 26850, "train_runtime": 207785.5145, "train_tokens_per_second": 5651.166 }, { "epoch": 1.8081739833019121, "grad_norm": 0.8397274812785074, "learning_rate": 2.254285278030094e-07, "loss": 0.30530600547790526, "num_input_tokens_seen": 1174459216, "step": 26855, "train_runtime": 207819.3658, "train_tokens_per_second": 5651.346 }, { "epoch": 1.8085106382978724, "grad_norm": 0.8065249949734656, "learning_rate": 2.24644216069575e-07, "loss": 0.30002517700195314, "num_input_tokens_seen": 1174667136, "step": 26860, "train_runtime": 207866.2773, "train_tokens_per_second": 5651.071 }, { "epoch": 1.8088472932938324, "grad_norm": 0.6707793753515161, "learning_rate": 2.238612397491574e-07, "loss": 0.2729137420654297, "num_input_tokens_seen": 1174893104, "step": 26865, "train_runtime": 207905.4724, "train_tokens_per_second": 5651.093 }, { "epoch": 1.8091839482897925, "grad_norm": 0.7616275632457961, "learning_rate": 2.230795990607143e-07, "loss": 0.29819502830505373, "num_input_tokens_seen": 1175120424, "step": 26870, "train_runtime": 207946.3976, "train_tokens_per_second": 5651.074 }, { "epoch": 1.809520603285753, "grad_norm": 0.7786936080708119, "learning_rate": 2.2229929422282915e-07, "loss": 0.27527265548706054, "num_input_tokens_seen": 1175334208, "step": 26875, "train_runtime": 207982.2651, "train_tokens_per_second": 5651.127 }, { "epoch": 1.809857258281713, "grad_norm": 0.7904035393585753, "learning_rate": 2.215203254537107e-07, "loss": 0.3183107614517212, "num_input_tokens_seen": 1175555296, "step": 26880, "train_runtime": 208022.7623, "train_tokens_per_second": 5651.09 }, { "epoch": 1.810193913277673, "grad_norm": 0.7604104589550896, "learning_rate": 2.2074269297119588e-07, "loss": 0.3029907464981079, "num_input_tokens_seen": 1175780944, "step": 26885, "train_runtime": 208056.1021, "train_tokens_per_second": 5651.269 }, { "epoch": 1.8105305682736332, "grad_norm": 0.8292516099336918, "learning_rate": 2.199663969927479e-07, "loss": 0.29438438415527346, "num_input_tokens_seen": 1175996056, "step": 26890, "train_runtime": 208096.3568, "train_tokens_per_second": 5651.209 }, { "epoch": 1.8108672232695935, "grad_norm": 0.8271865279223709, "learning_rate": 2.1919143773545316e-07, "loss": 0.29373531341552733, "num_input_tokens_seen": 1176219504, "step": 26895, "train_runtime": 208134.3303, "train_tokens_per_second": 5651.252 }, { "epoch": 1.8112038782655535, "grad_norm": 0.9028884805515789, "learning_rate": 2.184178154160288e-07, "loss": 0.29395351409912107, "num_input_tokens_seen": 1176436808, "step": 26900, "train_runtime": 208170.4974, "train_tokens_per_second": 5651.314 }, { "epoch": 1.8115405332615135, "grad_norm": 0.7863867287916279, "learning_rate": 2.1764553025081514e-07, "loss": 0.2931424379348755, "num_input_tokens_seen": 1176656768, "step": 26905, "train_runtime": 208207.3522, "train_tokens_per_second": 5651.37 }, { "epoch": 1.8118771882574738, "grad_norm": 0.8798746009059921, "learning_rate": 2.168745824557794e-07, "loss": 0.28325557708740234, "num_input_tokens_seen": 1176871952, "step": 26910, "train_runtime": 208250.7917, "train_tokens_per_second": 5651.224 }, { "epoch": 1.812213843253434, "grad_norm": 0.8072441204009388, "learning_rate": 2.161049722465136e-07, "loss": 0.28316502571105956, "num_input_tokens_seen": 1177088104, "step": 26915, "train_runtime": 208293.9071, "train_tokens_per_second": 5651.092 }, { "epoch": 1.812550498249394, "grad_norm": 0.7553112409241435, "learning_rate": 2.1533669983823835e-07, "loss": 0.29533112049102783, "num_input_tokens_seen": 1177320360, "step": 26920, "train_runtime": 208336.7997, "train_tokens_per_second": 5651.044 }, { "epoch": 1.812887153245354, "grad_norm": 0.6386036144723565, "learning_rate": 2.1456976544579732e-07, "loss": 0.2751606464385986, "num_input_tokens_seen": 1177560024, "step": 26925, "train_runtime": 208382.272, "train_tokens_per_second": 5650.961 }, { "epoch": 1.8132238082413143, "grad_norm": 0.7537084466037821, "learning_rate": 2.138041692836623e-07, "loss": 0.29282474517822266, "num_input_tokens_seen": 1177776744, "step": 26930, "train_runtime": 208414.4067, "train_tokens_per_second": 5651.129 }, { "epoch": 1.8135604632372746, "grad_norm": 0.766246409563199, "learning_rate": 2.1303991156592818e-07, "loss": 0.29790616035461426, "num_input_tokens_seen": 1177986848, "step": 26935, "train_runtime": 208452.677, "train_tokens_per_second": 5651.1 }, { "epoch": 1.8138971182332346, "grad_norm": 0.7584006159785801, "learning_rate": 2.122769925063195e-07, "loss": 0.2797182559967041, "num_input_tokens_seen": 1178200832, "step": 26940, "train_runtime": 208493.3034, "train_tokens_per_second": 5651.025 }, { "epoch": 1.8142337732291947, "grad_norm": 0.8751221362570611, "learning_rate": 2.1151541231818174e-07, "loss": 0.2855216503143311, "num_input_tokens_seen": 1178415944, "step": 26945, "train_runtime": 208536.0031, "train_tokens_per_second": 5650.899 }, { "epoch": 1.814570428225155, "grad_norm": 0.8086208091486383, "learning_rate": 2.1075517121449063e-07, "loss": 0.31327362060546876, "num_input_tokens_seen": 1178637904, "step": 26950, "train_runtime": 208579.4059, "train_tokens_per_second": 5650.788 }, { "epoch": 1.8149070832211152, "grad_norm": 0.8301036812650167, "learning_rate": 2.0999626940784334e-07, "loss": 0.27339811325073243, "num_input_tokens_seen": 1178843008, "step": 26955, "train_runtime": 208615.5879, "train_tokens_per_second": 5650.791 }, { "epoch": 1.8152437382170752, "grad_norm": 0.8710877367090695, "learning_rate": 2.0923870711046568e-07, "loss": 0.2946287155151367, "num_input_tokens_seen": 1179067688, "step": 26960, "train_runtime": 208653.4478, "train_tokens_per_second": 5650.842 }, { "epoch": 1.8155803932130352, "grad_norm": 0.6554427095056514, "learning_rate": 2.0848248453420704e-07, "loss": 0.2847181797027588, "num_input_tokens_seen": 1179293168, "step": 26965, "train_runtime": 208690.2441, "train_tokens_per_second": 5650.926 }, { "epoch": 1.8159170482089955, "grad_norm": 0.8746736454560675, "learning_rate": 2.077276018905422e-07, "loss": 0.2915675163269043, "num_input_tokens_seen": 1179511568, "step": 26970, "train_runtime": 208729.2372, "train_tokens_per_second": 5650.917 }, { "epoch": 1.8162537032049557, "grad_norm": 0.7805453963758747, "learning_rate": 2.0697405939057225e-07, "loss": 0.3022061824798584, "num_input_tokens_seen": 1179708384, "step": 26975, "train_runtime": 208763.205, "train_tokens_per_second": 5650.94 }, { "epoch": 1.8165903582009157, "grad_norm": 0.6389930066356448, "learning_rate": 2.0622185724502253e-07, "loss": 0.27937405109405516, "num_input_tokens_seen": 1179925616, "step": 26980, "train_runtime": 208797.998, "train_tokens_per_second": 5651.039 }, { "epoch": 1.8169270131968758, "grad_norm": 0.8421462718448113, "learning_rate": 2.0547099566424367e-07, "loss": 0.2782083511352539, "num_input_tokens_seen": 1180142704, "step": 26985, "train_runtime": 208842.2398, "train_tokens_per_second": 5650.881 }, { "epoch": 1.817263668192836, "grad_norm": 0.8420718246560043, "learning_rate": 2.0472147485821325e-07, "loss": 0.27927365303039553, "num_input_tokens_seen": 1180348248, "step": 26990, "train_runtime": 208879.8268, "train_tokens_per_second": 5650.848 }, { "epoch": 1.8176003231887963, "grad_norm": 0.7460943379350691, "learning_rate": 2.0397329503653084e-07, "loss": 0.2773773670196533, "num_input_tokens_seen": 1180563544, "step": 26995, "train_runtime": 208916.8282, "train_tokens_per_second": 5650.878 }, { "epoch": 1.8179369781847563, "grad_norm": 0.8475284436859102, "learning_rate": 2.03226456408423e-07, "loss": 0.3106630802154541, "num_input_tokens_seen": 1180762848, "step": 27000, "train_runtime": 208960.3449, "train_tokens_per_second": 5650.655 }, { "epoch": 1.8182736331807163, "grad_norm": 0.7183644291988805, "learning_rate": 2.024809591827409e-07, "loss": 0.30523037910461426, "num_input_tokens_seen": 1180988840, "step": 27005, "train_runtime": 209002.5667, "train_tokens_per_second": 5650.595 }, { "epoch": 1.8186102881766766, "grad_norm": 0.801765388255765, "learning_rate": 2.0173680356796066e-07, "loss": 0.26985788345336914, "num_input_tokens_seen": 1181189432, "step": 27010, "train_runtime": 209041.262, "train_tokens_per_second": 5650.509 }, { "epoch": 1.8189469431726368, "grad_norm": 0.8150765259723309, "learning_rate": 2.00993989772183e-07, "loss": 0.2943392515182495, "num_input_tokens_seen": 1181407992, "step": 27015, "train_runtime": 209073.5583, "train_tokens_per_second": 5650.681 }, { "epoch": 1.8192835981685969, "grad_norm": 0.7914385589041727, "learning_rate": 2.0025251800313284e-07, "loss": 0.3112603187561035, "num_input_tokens_seen": 1181622192, "step": 27020, "train_runtime": 209120.2047, "train_tokens_per_second": 5650.445 }, { "epoch": 1.8196202531645569, "grad_norm": 0.7561624538382505, "learning_rate": 1.9951238846816045e-07, "loss": 0.3185489892959595, "num_input_tokens_seen": 1181854088, "step": 27025, "train_runtime": 209152.1413, "train_tokens_per_second": 5650.691 }, { "epoch": 1.8199569081605171, "grad_norm": 0.7921686074062922, "learning_rate": 1.987736013742414e-07, "loss": 0.3113109111785889, "num_input_tokens_seen": 1182065984, "step": 27030, "train_runtime": 209191.0211, "train_tokens_per_second": 5650.654 }, { "epoch": 1.8202935631564774, "grad_norm": 0.7653273331531749, "learning_rate": 1.9803615692797375e-07, "loss": 0.27271738052368166, "num_input_tokens_seen": 1182287536, "step": 27035, "train_runtime": 209228.5228, "train_tokens_per_second": 5650.7 }, { "epoch": 1.8206302181524374, "grad_norm": 0.7068384362133963, "learning_rate": 1.9730005533558417e-07, "loss": 0.29187893867492676, "num_input_tokens_seen": 1182520232, "step": 27040, "train_runtime": 209272.9747, "train_tokens_per_second": 5650.611 }, { "epoch": 1.8209668731483974, "grad_norm": 0.7399705032741323, "learning_rate": 1.9656529680291802e-07, "loss": 0.27612121105194093, "num_input_tokens_seen": 1182742904, "step": 27045, "train_runtime": 209312.4766, "train_tokens_per_second": 5650.609 }, { "epoch": 1.8213035281443577, "grad_norm": 0.7369131913718883, "learning_rate": 1.9583188153544986e-07, "loss": 0.28553037643432616, "num_input_tokens_seen": 1182945672, "step": 27050, "train_runtime": 209347.8795, "train_tokens_per_second": 5650.622 }, { "epoch": 1.821640183140318, "grad_norm": 1.1539568423391955, "learning_rate": 1.9509980973827724e-07, "loss": 0.2979405641555786, "num_input_tokens_seen": 1183165608, "step": 27055, "train_runtime": 209386.946, "train_tokens_per_second": 5650.618 }, { "epoch": 1.821976838136278, "grad_norm": 0.7640565156115381, "learning_rate": 1.943690816161209e-07, "loss": 0.3077999114990234, "num_input_tokens_seen": 1183395432, "step": 27060, "train_runtime": 209424.1043, "train_tokens_per_second": 5650.713 }, { "epoch": 1.822313493132238, "grad_norm": 0.7149421204366606, "learning_rate": 1.9363969737332677e-07, "loss": 0.2753284454345703, "num_input_tokens_seen": 1183617608, "step": 27065, "train_runtime": 209460.0325, "train_tokens_per_second": 5650.804 }, { "epoch": 1.8226501481281983, "grad_norm": 0.652062441800595, "learning_rate": 1.9291165721386507e-07, "loss": 0.27479655742645265, "num_input_tokens_seen": 1183826768, "step": 27070, "train_runtime": 209495.4576, "train_tokens_per_second": 5650.847 }, { "epoch": 1.8229868031241585, "grad_norm": 0.9271372389885489, "learning_rate": 1.9218496134132957e-07, "loss": 0.3049477100372314, "num_input_tokens_seen": 1184052800, "step": 27075, "train_runtime": 209531.6276, "train_tokens_per_second": 5650.95 }, { "epoch": 1.8233234581201185, "grad_norm": 0.6911714020764224, "learning_rate": 1.9145960995893831e-07, "loss": 0.282161283493042, "num_input_tokens_seen": 1184270392, "step": 27080, "train_runtime": 209567.2517, "train_tokens_per_second": 5651.028 }, { "epoch": 1.8236601131160786, "grad_norm": 0.7018056304999722, "learning_rate": 1.9073560326953344e-07, "loss": 0.3012186050415039, "num_input_tokens_seen": 1184494848, "step": 27085, "train_runtime": 209601.3891, "train_tokens_per_second": 5651.178 }, { "epoch": 1.8239967681120388, "grad_norm": 0.7756023060864273, "learning_rate": 1.9001294147558303e-07, "loss": 0.3109905242919922, "num_input_tokens_seen": 1184709808, "step": 27090, "train_runtime": 209641.9441, "train_tokens_per_second": 5651.111 }, { "epoch": 1.824333423107999, "grad_norm": 0.8354480678136353, "learning_rate": 1.892916247791743e-07, "loss": 0.3057056188583374, "num_input_tokens_seen": 1184920824, "step": 27095, "train_runtime": 209678.6955, "train_tokens_per_second": 5651.126 }, { "epoch": 1.824670078103959, "grad_norm": 0.7450481139042144, "learning_rate": 1.885716533820231e-07, "loss": 0.2988601207733154, "num_input_tokens_seen": 1185141448, "step": 27100, "train_runtime": 209721.9756, "train_tokens_per_second": 5651.012 }, { "epoch": 1.8250067330999191, "grad_norm": 0.7070713398300131, "learning_rate": 1.878530274854662e-07, "loss": 0.2867612838745117, "num_input_tokens_seen": 1185358376, "step": 27105, "train_runtime": 209757.3918, "train_tokens_per_second": 5651.092 }, { "epoch": 1.8253433880958794, "grad_norm": 0.7229583190371239, "learning_rate": 1.8713574729046557e-07, "loss": 0.3091785669326782, "num_input_tokens_seen": 1185587344, "step": 27110, "train_runtime": 209793.505, "train_tokens_per_second": 5651.211 }, { "epoch": 1.8256800430918396, "grad_norm": 0.7520860741774413, "learning_rate": 1.8641981299760582e-07, "loss": 0.29340548515319825, "num_input_tokens_seen": 1185795904, "step": 27115, "train_runtime": 209826.9024, "train_tokens_per_second": 5651.305 }, { "epoch": 1.8260166980877997, "grad_norm": 0.7995613128971399, "learning_rate": 1.857052248070962e-07, "loss": 0.30235800743103025, "num_input_tokens_seen": 1186003992, "step": 27120, "train_runtime": 209868.1712, "train_tokens_per_second": 5651.186 }, { "epoch": 1.8263533530837597, "grad_norm": 0.8063565780315961, "learning_rate": 1.8499198291876907e-07, "loss": 0.2838723659515381, "num_input_tokens_seen": 1186206928, "step": 27125, "train_runtime": 209908.8621, "train_tokens_per_second": 5651.057 }, { "epoch": 1.82669000807972, "grad_norm": 0.659822757313705, "learning_rate": 1.8428008753207937e-07, "loss": 0.3044004440307617, "num_input_tokens_seen": 1186430512, "step": 27130, "train_runtime": 209952.433, "train_tokens_per_second": 5650.949 }, { "epoch": 1.8270266630756802, "grad_norm": 0.7534355877635904, "learning_rate": 1.8356953884610673e-07, "loss": 0.3086956262588501, "num_input_tokens_seen": 1186652392, "step": 27135, "train_runtime": 209996.3146, "train_tokens_per_second": 5650.825 }, { "epoch": 1.8273633180716402, "grad_norm": 0.7536622469259906, "learning_rate": 1.8286033705955554e-07, "loss": 0.2920703411102295, "num_input_tokens_seen": 1186878432, "step": 27140, "train_runtime": 210028.5754, "train_tokens_per_second": 5651.033 }, { "epoch": 1.8276999730676002, "grad_norm": 0.8189703081756119, "learning_rate": 1.8215248237074879e-07, "loss": 0.2958489656448364, "num_input_tokens_seen": 1187100664, "step": 27145, "train_runtime": 210067.8385, "train_tokens_per_second": 5651.035 }, { "epoch": 1.8280366280635605, "grad_norm": 0.6908418891259124, "learning_rate": 1.8144597497763816e-07, "loss": 0.2915064334869385, "num_input_tokens_seen": 1187314688, "step": 27150, "train_runtime": 210105.6707, "train_tokens_per_second": 5651.036 }, { "epoch": 1.8283732830595207, "grad_norm": 0.7771306934508, "learning_rate": 1.8074081507779506e-07, "loss": 0.2950667142868042, "num_input_tokens_seen": 1187543272, "step": 27155, "train_runtime": 210145.1035, "train_tokens_per_second": 5651.063 }, { "epoch": 1.8287099380554808, "grad_norm": 0.7951975641517514, "learning_rate": 1.8003700286841563e-07, "loss": 0.3046703815460205, "num_input_tokens_seen": 1187764808, "step": 27160, "train_runtime": 210185.6937, "train_tokens_per_second": 5651.026 }, { "epoch": 1.8290465930514408, "grad_norm": 0.8247212903362624, "learning_rate": 1.793345385463191e-07, "loss": 0.2969427824020386, "num_input_tokens_seen": 1187985984, "step": 27165, "train_runtime": 210225.4532, "train_tokens_per_second": 5651.009 }, { "epoch": 1.829383248047401, "grad_norm": 0.8389229794347001, "learning_rate": 1.7863342230794667e-07, "loss": 0.306946849822998, "num_input_tokens_seen": 1188205016, "step": 27170, "train_runtime": 210256.0102, "train_tokens_per_second": 5651.23 }, { "epoch": 1.8297199030433613, "grad_norm": 0.6995002304359613, "learning_rate": 1.7793365434936316e-07, "loss": 0.2987263917922974, "num_input_tokens_seen": 1188436064, "step": 27175, "train_runtime": 210296.1751, "train_tokens_per_second": 5651.249 }, { "epoch": 1.8300565580393213, "grad_norm": 0.8195984422353864, "learning_rate": 1.7723523486625704e-07, "loss": 0.29759798049926756, "num_input_tokens_seen": 1188648440, "step": 27180, "train_runtime": 210337.9552, "train_tokens_per_second": 5651.136 }, { "epoch": 1.8303932130352814, "grad_norm": 0.7388330413443034, "learning_rate": 1.7653816405393766e-07, "loss": 0.3033345937728882, "num_input_tokens_seen": 1188864712, "step": 27185, "train_runtime": 210377.2381, "train_tokens_per_second": 5651.109 }, { "epoch": 1.8307298680312416, "grad_norm": 0.8567770406651678, "learning_rate": 1.758424421073418e-07, "loss": 0.308400821685791, "num_input_tokens_seen": 1189093376, "step": 27190, "train_runtime": 210414.6866, "train_tokens_per_second": 5651.19 }, { "epoch": 1.8310665230272019, "grad_norm": 0.7475393949595193, "learning_rate": 1.7514806922102222e-07, "loss": 0.2787260293960571, "num_input_tokens_seen": 1189290992, "step": 27195, "train_runtime": 210452.2542, "train_tokens_per_second": 5651.12 }, { "epoch": 1.8314031780231619, "grad_norm": 0.7779392879208484, "learning_rate": 1.7445504558916027e-07, "loss": 0.2868196964263916, "num_input_tokens_seen": 1189504064, "step": 27200, "train_runtime": 210482.3919, "train_tokens_per_second": 5651.323 }, { "epoch": 1.831739833019122, "grad_norm": 0.7793252529447385, "learning_rate": 1.7376337140555754e-07, "loss": 0.283552360534668, "num_input_tokens_seen": 1189712800, "step": 27205, "train_runtime": 210518.9894, "train_tokens_per_second": 5651.332 }, { "epoch": 1.8320764880150822, "grad_norm": 0.7136774949097324, "learning_rate": 1.7307304686363825e-07, "loss": 0.30210127830505373, "num_input_tokens_seen": 1189932032, "step": 27210, "train_runtime": 210557.2729, "train_tokens_per_second": 5651.346 }, { "epoch": 1.8324131430110424, "grad_norm": 0.6733587332513272, "learning_rate": 1.723840721564496e-07, "loss": 0.2896436214447021, "num_input_tokens_seen": 1190162824, "step": 27215, "train_runtime": 210596.5269, "train_tokens_per_second": 5651.389 }, { "epoch": 1.8327497980070024, "grad_norm": 0.7975602822015874, "learning_rate": 1.7169644747666081e-07, "loss": 0.29418466091156004, "num_input_tokens_seen": 1190392976, "step": 27220, "train_runtime": 210635.9714, "train_tokens_per_second": 5651.423 }, { "epoch": 1.8330864530029625, "grad_norm": 0.6803205298907224, "learning_rate": 1.710101730165642e-07, "loss": 0.30214219093322753, "num_input_tokens_seen": 1190618688, "step": 27225, "train_runtime": 210673.7247, "train_tokens_per_second": 5651.482 }, { "epoch": 1.8334231079989227, "grad_norm": 0.7468300724636248, "learning_rate": 1.7032524896807402e-07, "loss": 0.27968459129333495, "num_input_tokens_seen": 1190825912, "step": 27230, "train_runtime": 210712.9044, "train_tokens_per_second": 5651.414 }, { "epoch": 1.833759762994883, "grad_norm": 0.75132763867745, "learning_rate": 1.6964167552272702e-07, "loss": 0.3041102647781372, "num_input_tokens_seen": 1191031648, "step": 27235, "train_runtime": 210750.2864, "train_tokens_per_second": 5651.388 }, { "epoch": 1.834096417990843, "grad_norm": 0.8236438444986357, "learning_rate": 1.6895945287168314e-07, "loss": 0.30144453048706055, "num_input_tokens_seen": 1191243504, "step": 27240, "train_runtime": 210787.0749, "train_tokens_per_second": 5651.407 }, { "epoch": 1.834433072986803, "grad_norm": 0.8116073242293598, "learning_rate": 1.682785812057225e-07, "loss": 0.31502351760864256, "num_input_tokens_seen": 1191444928, "step": 27245, "train_runtime": 210818.024, "train_tokens_per_second": 5651.533 }, { "epoch": 1.8347697279827633, "grad_norm": 0.7705506997654222, "learning_rate": 1.6759906071525e-07, "loss": 0.2920320987701416, "num_input_tokens_seen": 1191662640, "step": 27250, "train_runtime": 210862.0161, "train_tokens_per_second": 5651.386 }, { "epoch": 1.8351063829787235, "grad_norm": 0.7712074370148209, "learning_rate": 1.669208915902909e-07, "loss": 0.33261871337890625, "num_input_tokens_seen": 1191900592, "step": 27255, "train_runtime": 210897.8718, "train_tokens_per_second": 5651.553 }, { "epoch": 1.8354430379746836, "grad_norm": 0.7737113976334139, "learning_rate": 1.6624407402049237e-07, "loss": 0.2747644901275635, "num_input_tokens_seen": 1192112584, "step": 27260, "train_runtime": 210931.9902, "train_tokens_per_second": 5651.644 }, { "epoch": 1.8357796929706436, "grad_norm": 0.7765514097289985, "learning_rate": 1.655686081951252e-07, "loss": 0.28942217826843264, "num_input_tokens_seen": 1192328048, "step": 27265, "train_runtime": 210962.6642, "train_tokens_per_second": 5651.844 }, { "epoch": 1.8361163479666038, "grad_norm": 0.7986187558729846, "learning_rate": 1.6489449430308058e-07, "loss": 0.32457714080810546, "num_input_tokens_seen": 1192555872, "step": 27270, "train_runtime": 211006.3008, "train_tokens_per_second": 5651.755 }, { "epoch": 1.836453002962564, "grad_norm": 0.7814336439979509, "learning_rate": 1.6422173253287323e-07, "loss": 0.31779980659484863, "num_input_tokens_seen": 1192784792, "step": 27275, "train_runtime": 211044.4069, "train_tokens_per_second": 5651.819 }, { "epoch": 1.8367896579585241, "grad_norm": 0.8231817333366194, "learning_rate": 1.6355032307263764e-07, "loss": 0.2909559726715088, "num_input_tokens_seen": 1193008024, "step": 27280, "train_runtime": 211087.1712, "train_tokens_per_second": 5651.732 }, { "epoch": 1.8371263129544841, "grad_norm": 0.7297603518728784, "learning_rate": 1.628802661101314e-07, "loss": 0.27639720439910886, "num_input_tokens_seen": 1193222040, "step": 27285, "train_runtime": 211126.1642, "train_tokens_per_second": 5651.701 }, { "epoch": 1.8374629679504444, "grad_norm": 0.7393851625213684, "learning_rate": 1.6221156183273524e-07, "loss": 0.2929367542266846, "num_input_tokens_seen": 1193445752, "step": 27290, "train_runtime": 211166.2819, "train_tokens_per_second": 5651.687 }, { "epoch": 1.8377996229464046, "grad_norm": 0.8626095075985437, "learning_rate": 1.615442104274484e-07, "loss": 0.2990311622619629, "num_input_tokens_seen": 1193676024, "step": 27295, "train_runtime": 211203.0891, "train_tokens_per_second": 5651.792 }, { "epoch": 1.8381362779423647, "grad_norm": 0.7989960018689986, "learning_rate": 1.6087821208089492e-07, "loss": 0.2992110252380371, "num_input_tokens_seen": 1193898896, "step": 27300, "train_runtime": 211239.9537, "train_tokens_per_second": 5651.861 }, { "epoch": 1.8384729329383247, "grad_norm": 0.675694068212015, "learning_rate": 1.6021356697931866e-07, "loss": 0.2737618684768677, "num_input_tokens_seen": 1194124640, "step": 27305, "train_runtime": 211274.8199, "train_tokens_per_second": 5651.997 }, { "epoch": 1.838809587934285, "grad_norm": 0.7414825082624487, "learning_rate": 1.5955027530858537e-07, "loss": 0.27455065250396726, "num_input_tokens_seen": 1194345288, "step": 27310, "train_runtime": 211311.0878, "train_tokens_per_second": 5652.071 }, { "epoch": 1.8391462429302452, "grad_norm": 0.6826873569949812, "learning_rate": 1.5888833725418275e-07, "loss": 0.2740659236907959, "num_input_tokens_seen": 1194562672, "step": 27315, "train_runtime": 211347.4146, "train_tokens_per_second": 5652.128 }, { "epoch": 1.8394828979262052, "grad_norm": 0.7227868616604537, "learning_rate": 1.582277530012194e-07, "loss": 0.26207771301269533, "num_input_tokens_seen": 1194797416, "step": 27320, "train_runtime": 211380.4831, "train_tokens_per_second": 5652.354 }, { "epoch": 1.8398195529221653, "grad_norm": 0.8448912125013232, "learning_rate": 1.5756852273442536e-07, "loss": 0.29030356407165525, "num_input_tokens_seen": 1195005200, "step": 27325, "train_runtime": 211422.3023, "train_tokens_per_second": 5652.219 }, { "epoch": 1.8401562079181255, "grad_norm": 0.697440308697788, "learning_rate": 1.569106466381526e-07, "loss": 0.3182931900024414, "num_input_tokens_seen": 1195227200, "step": 27330, "train_runtime": 211462.6591, "train_tokens_per_second": 5652.19 }, { "epoch": 1.8404928629140858, "grad_norm": 0.7422044369619762, "learning_rate": 1.5625412489637337e-07, "loss": 0.27002391815185545, "num_input_tokens_seen": 1195454536, "step": 27335, "train_runtime": 211507.1847, "train_tokens_per_second": 5652.075 }, { "epoch": 1.8408295179100458, "grad_norm": 0.7443593742932311, "learning_rate": 1.555989576926842e-07, "loss": 0.2888377904891968, "num_input_tokens_seen": 1195681944, "step": 27340, "train_runtime": 211549.0676, "train_tokens_per_second": 5652.031 }, { "epoch": 1.8411661729060058, "grad_norm": 0.801773457702004, "learning_rate": 1.5494514521029736e-07, "loss": 0.29750452041625974, "num_input_tokens_seen": 1195905376, "step": 27345, "train_runtime": 211588.7755, "train_tokens_per_second": 5652.027 }, { "epoch": 1.841502827901966, "grad_norm": 0.7523395284692173, "learning_rate": 1.5429268763205108e-07, "loss": 0.2998412370681763, "num_input_tokens_seen": 1196127744, "step": 27350, "train_runtime": 211635.9655, "train_tokens_per_second": 5651.817 }, { "epoch": 1.8418394828979263, "grad_norm": 0.8119149425227684, "learning_rate": 1.5364158514040328e-07, "loss": 0.3214261531829834, "num_input_tokens_seen": 1196344424, "step": 27355, "train_runtime": 211676.2418, "train_tokens_per_second": 5651.765 }, { "epoch": 1.8421761378938863, "grad_norm": 0.9267135845555328, "learning_rate": 1.5299183791743223e-07, "loss": 0.30311391353607176, "num_input_tokens_seen": 1196551984, "step": 27360, "train_runtime": 211712.3977, "train_tokens_per_second": 5651.78 }, { "epoch": 1.8425127928898464, "grad_norm": 0.79776476761183, "learning_rate": 1.523434461448381e-07, "loss": 0.31781580448150637, "num_input_tokens_seen": 1196784808, "step": 27365, "train_runtime": 211750.7126, "train_tokens_per_second": 5651.857 }, { "epoch": 1.8428494478858066, "grad_norm": 0.7201171985633329, "learning_rate": 1.5169641000394086e-07, "loss": 0.29927232265472414, "num_input_tokens_seen": 1197018080, "step": 27370, "train_runtime": 211789.2549, "train_tokens_per_second": 5651.93 }, { "epoch": 1.8431861028817669, "grad_norm": 0.730174194835056, "learning_rate": 1.5105072967568246e-07, "loss": 0.2902745246887207, "num_input_tokens_seen": 1197229392, "step": 27375, "train_runtime": 211827.3609, "train_tokens_per_second": 5651.911 }, { "epoch": 1.843522757877727, "grad_norm": 0.6910545329116042, "learning_rate": 1.504064053406251e-07, "loss": 0.29667439460754397, "num_input_tokens_seen": 1197443992, "step": 27380, "train_runtime": 211869.9495, "train_tokens_per_second": 5651.788 }, { "epoch": 1.843859412873687, "grad_norm": 0.7540793648170933, "learning_rate": 1.4976343717895192e-07, "loss": 0.3001372814178467, "num_input_tokens_seen": 1197673640, "step": 27385, "train_runtime": 211902.7264, "train_tokens_per_second": 5651.997 }, { "epoch": 1.8441960678696472, "grad_norm": 0.7814817716047526, "learning_rate": 1.491218253704685e-07, "loss": 0.30607056617736816, "num_input_tokens_seen": 1197898760, "step": 27390, "train_runtime": 211943.3379, "train_tokens_per_second": 5651.976 }, { "epoch": 1.8445327228656074, "grad_norm": 0.7515118407147103, "learning_rate": 1.484815700945974e-07, "loss": 0.30979294776916505, "num_input_tokens_seen": 1198115856, "step": 27395, "train_runtime": 211982.4794, "train_tokens_per_second": 5651.957 }, { "epoch": 1.8448693778615675, "grad_norm": 0.7192859496811161, "learning_rate": 1.478426715303849e-07, "loss": 0.2884451150894165, "num_input_tokens_seen": 1198320608, "step": 27400, "train_runtime": 212021.1992, "train_tokens_per_second": 5651.891 }, { "epoch": 1.8452060328575275, "grad_norm": 0.7754550279674132, "learning_rate": 1.4720512985649694e-07, "loss": 0.29123849868774415, "num_input_tokens_seen": 1198532416, "step": 27405, "train_runtime": 212063.5064, "train_tokens_per_second": 5651.762 }, { "epoch": 1.8455426878534877, "grad_norm": 0.9501576369289315, "learning_rate": 1.4656894525122034e-07, "loss": 0.30306599140167234, "num_input_tokens_seen": 1198734552, "step": 27410, "train_runtime": 212105.602, "train_tokens_per_second": 5651.593 }, { "epoch": 1.845879342849448, "grad_norm": 0.7974261229774522, "learning_rate": 1.459341178924617e-07, "loss": 0.30881667137145996, "num_input_tokens_seen": 1198955512, "step": 27415, "train_runtime": 212144.96, "train_tokens_per_second": 5651.586 }, { "epoch": 1.846215997845408, "grad_norm": 0.7988079730512095, "learning_rate": 1.453006479577479e-07, "loss": 0.28842964172363283, "num_input_tokens_seen": 1199167896, "step": 27420, "train_runtime": 212180.9912, "train_tokens_per_second": 5651.627 }, { "epoch": 1.846552652841368, "grad_norm": 0.7202060611505903, "learning_rate": 1.4466853562422778e-07, "loss": 0.3094759464263916, "num_input_tokens_seen": 1199366136, "step": 27425, "train_runtime": 212214.506, "train_tokens_per_second": 5651.669 }, { "epoch": 1.8468893078373283, "grad_norm": 0.8214802158441638, "learning_rate": 1.440377810686694e-07, "loss": 0.294615650177002, "num_input_tokens_seen": 1199589824, "step": 27430, "train_runtime": 212247.8835, "train_tokens_per_second": 5651.834 }, { "epoch": 1.8472259628332885, "grad_norm": 0.7935797505217701, "learning_rate": 1.4340838446746052e-07, "loss": 0.2963638067245483, "num_input_tokens_seen": 1199816200, "step": 27435, "train_runtime": 212284.2378, "train_tokens_per_second": 5651.933 }, { "epoch": 1.8475626178292486, "grad_norm": 0.7255235631748863, "learning_rate": 1.4278034599661094e-07, "loss": 0.2769758701324463, "num_input_tokens_seen": 1200031328, "step": 27440, "train_runtime": 212314.5115, "train_tokens_per_second": 5652.14 }, { "epoch": 1.8478992728252086, "grad_norm": 0.78374561254918, "learning_rate": 1.421536658317485e-07, "loss": 0.2689784288406372, "num_input_tokens_seen": 1200227096, "step": 27445, "train_runtime": 212349.6526, "train_tokens_per_second": 5652.126 }, { "epoch": 1.8482359278211689, "grad_norm": 0.7784687447417672, "learning_rate": 1.41528344148123e-07, "loss": 0.28493242263793944, "num_input_tokens_seen": 1200462264, "step": 27450, "train_runtime": 212386.6742, "train_tokens_per_second": 5652.249 }, { "epoch": 1.848572582817129, "grad_norm": 0.8647273624224125, "learning_rate": 1.40904381120604e-07, "loss": 0.2554482936859131, "num_input_tokens_seen": 1200679968, "step": 27455, "train_runtime": 212417.8431, "train_tokens_per_second": 5652.444 }, { "epoch": 1.8489092378130891, "grad_norm": 0.7867893330661792, "learning_rate": 1.4028177692367973e-07, "loss": 0.2979857921600342, "num_input_tokens_seen": 1200888896, "step": 27460, "train_runtime": 212455.3142, "train_tokens_per_second": 5652.43 }, { "epoch": 1.8492458928090492, "grad_norm": 0.9388552543962256, "learning_rate": 1.3966053173146032e-07, "loss": 0.29952003955841067, "num_input_tokens_seen": 1201115544, "step": 27465, "train_runtime": 212489.4425, "train_tokens_per_second": 5652.589 }, { "epoch": 1.8495825478050094, "grad_norm": 0.6831577223182406, "learning_rate": 1.3904064571767462e-07, "loss": 0.29733192920684814, "num_input_tokens_seen": 1201343992, "step": 27470, "train_runtime": 212529.6948, "train_tokens_per_second": 5652.594 }, { "epoch": 1.8499192028009697, "grad_norm": 0.7057151389200952, "learning_rate": 1.3842211905567227e-07, "loss": 0.2762616157531738, "num_input_tokens_seen": 1201569224, "step": 27475, "train_runtime": 212561.6614, "train_tokens_per_second": 5652.803 }, { "epoch": 1.8502558577969297, "grad_norm": 0.8452116887810223, "learning_rate": 1.378049519184216e-07, "loss": 0.2911623239517212, "num_input_tokens_seen": 1201779840, "step": 27480, "train_runtime": 212599.5548, "train_tokens_per_second": 5652.786 }, { "epoch": 1.8505925127928897, "grad_norm": 0.7069439995002406, "learning_rate": 1.3718914447851116e-07, "loss": 0.2653970718383789, "num_input_tokens_seen": 1202007472, "step": 27485, "train_runtime": 212638.9418, "train_tokens_per_second": 5652.81 }, { "epoch": 1.85092916778885, "grad_norm": 0.767853195090442, "learning_rate": 1.3657469690815106e-07, "loss": 0.28401851654052734, "num_input_tokens_seen": 1202246288, "step": 27490, "train_runtime": 212671.529, "train_tokens_per_second": 5653.066 }, { "epoch": 1.8512658227848102, "grad_norm": 0.7219513957308681, "learning_rate": 1.359616093791677e-07, "loss": 0.3170768737792969, "num_input_tokens_seen": 1202478016, "step": 27495, "train_runtime": 212715.4107, "train_tokens_per_second": 5652.99 }, { "epoch": 1.8516024777807703, "grad_norm": 0.7333849781257291, "learning_rate": 1.353498820630106e-07, "loss": 0.29583718776702883, "num_input_tokens_seen": 1202698624, "step": 27500, "train_runtime": 212754.0646, "train_tokens_per_second": 5653.0 }, { "epoch": 1.8519391327767303, "grad_norm": 0.7743102457437921, "learning_rate": 1.3473951513074625e-07, "loss": 0.31031112670898436, "num_input_tokens_seen": 1202918504, "step": 27505, "train_runtime": 212795.3126, "train_tokens_per_second": 5652.937 }, { "epoch": 1.8522757877726905, "grad_norm": 0.9893994757413681, "learning_rate": 1.341305087530631e-07, "loss": 0.29344775676727297, "num_input_tokens_seen": 1203135384, "step": 27510, "train_runtime": 212826.4122, "train_tokens_per_second": 5653.13 }, { "epoch": 1.8526124427686508, "grad_norm": 0.8824830489862262, "learning_rate": 1.3352286310026663e-07, "loss": 0.3105172634124756, "num_input_tokens_seen": 1203348136, "step": 27515, "train_runtime": 212864.5316, "train_tokens_per_second": 5653.117 }, { "epoch": 1.8529490977646108, "grad_norm": 0.8177611033215039, "learning_rate": 1.329165783422831e-07, "loss": 0.31962890625, "num_input_tokens_seen": 1203560776, "step": 27520, "train_runtime": 212898.9135, "train_tokens_per_second": 5653.203 }, { "epoch": 1.8532857527605708, "grad_norm": 0.8203874085361618, "learning_rate": 1.3231165464865914e-07, "loss": 0.29946393966674806, "num_input_tokens_seen": 1203778736, "step": 27525, "train_runtime": 212929.6442, "train_tokens_per_second": 5653.411 }, { "epoch": 1.853622407756531, "grad_norm": 0.6941728137863973, "learning_rate": 1.3170809218855884e-07, "loss": 0.29173548221588136, "num_input_tokens_seen": 1204009952, "step": 27530, "train_runtime": 212966.9944, "train_tokens_per_second": 5653.505 }, { "epoch": 1.8539590627524913, "grad_norm": 0.7342203887402693, "learning_rate": 1.3110589113076554e-07, "loss": 0.2878772258758545, "num_input_tokens_seen": 1204230200, "step": 27535, "train_runtime": 213008.2192, "train_tokens_per_second": 5653.445 }, { "epoch": 1.8542957177484514, "grad_norm": 0.7315091280926438, "learning_rate": 1.3050505164368566e-07, "loss": 0.29323248863220214, "num_input_tokens_seen": 1204451192, "step": 27540, "train_runtime": 213039.3969, "train_tokens_per_second": 5653.655 }, { "epoch": 1.8546323727444114, "grad_norm": 0.8014357486751242, "learning_rate": 1.299055738953392e-07, "loss": 0.2807599067687988, "num_input_tokens_seen": 1204650768, "step": 27545, "train_runtime": 213080.939, "train_tokens_per_second": 5653.489 }, { "epoch": 1.8549690277403716, "grad_norm": 0.7816529327087509, "learning_rate": 1.293074580533704e-07, "loss": 0.28776376247406005, "num_input_tokens_seen": 1204864152, "step": 27550, "train_runtime": 213127.338, "train_tokens_per_second": 5653.26 }, { "epoch": 1.855305682736332, "grad_norm": 0.7431632363177251, "learning_rate": 1.2871070428503885e-07, "loss": 0.3120842456817627, "num_input_tokens_seen": 1205072184, "step": 27555, "train_runtime": 213166.7662, "train_tokens_per_second": 5653.19 }, { "epoch": 1.855642337732292, "grad_norm": 0.6740193343425465, "learning_rate": 1.2811531275722543e-07, "loss": 0.3159989595413208, "num_input_tokens_seen": 1205302840, "step": 27560, "train_runtime": 213202.2706, "train_tokens_per_second": 5653.33 }, { "epoch": 1.855978992728252, "grad_norm": 0.850999270296055, "learning_rate": 1.275212836364298e-07, "loss": 0.30814902782440184, "num_input_tokens_seen": 1205521608, "step": 27565, "train_runtime": 213246.1453, "train_tokens_per_second": 5653.193 }, { "epoch": 1.8563156477242122, "grad_norm": 0.7919555393902858, "learning_rate": 1.2692861708877014e-07, "loss": 0.28333234786987305, "num_input_tokens_seen": 1205730248, "step": 27570, "train_runtime": 213289.0034, "train_tokens_per_second": 5653.035 }, { "epoch": 1.8566523027201725, "grad_norm": 0.7321483909457048, "learning_rate": 1.2633731327998332e-07, "loss": 0.2803944110870361, "num_input_tokens_seen": 1205950784, "step": 27575, "train_runtime": 213322.9311, "train_tokens_per_second": 5653.17 }, { "epoch": 1.8569889577161325, "grad_norm": 0.9024845578541033, "learning_rate": 1.25747372375426e-07, "loss": 0.2885521411895752, "num_input_tokens_seen": 1206159224, "step": 27580, "train_runtime": 213368.2449, "train_tokens_per_second": 5652.946 }, { "epoch": 1.8573256127120925, "grad_norm": 0.8389667628017906, "learning_rate": 1.251587945400723e-07, "loss": 0.3000046253204346, "num_input_tokens_seen": 1206379280, "step": 27585, "train_runtime": 213408.9939, "train_tokens_per_second": 5652.898 }, { "epoch": 1.8576622677080528, "grad_norm": 0.7189413123955991, "learning_rate": 1.2457157993851832e-07, "loss": 0.2905135154724121, "num_input_tokens_seen": 1206604064, "step": 27590, "train_runtime": 213446.507, "train_tokens_per_second": 5652.958 }, { "epoch": 1.857998922704013, "grad_norm": 0.756958619394132, "learning_rate": 1.2398572873497438e-07, "loss": 0.2975008487701416, "num_input_tokens_seen": 1206821040, "step": 27595, "train_runtime": 213487.2557, "train_tokens_per_second": 5652.895 }, { "epoch": 1.858335577699973, "grad_norm": 0.7936162080166628, "learning_rate": 1.2340124109327334e-07, "loss": 0.2905877590179443, "num_input_tokens_seen": 1207029960, "step": 27600, "train_runtime": 213526.3845, "train_tokens_per_second": 5652.838 }, { "epoch": 1.858672232695933, "grad_norm": 0.7617351149236978, "learning_rate": 1.22818117176865e-07, "loss": 0.3129683494567871, "num_input_tokens_seen": 1207251408, "step": 27605, "train_runtime": 213571.4503, "train_tokens_per_second": 5652.682 }, { "epoch": 1.8590088876918933, "grad_norm": 0.6863825753058197, "learning_rate": 1.2223635714881777e-07, "loss": 0.30173707008361816, "num_input_tokens_seen": 1207460752, "step": 27610, "train_runtime": 213606.2956, "train_tokens_per_second": 5652.74 }, { "epoch": 1.8593455426878536, "grad_norm": 0.6602683521069512, "learning_rate": 1.2165596117181931e-07, "loss": 0.28788735866546633, "num_input_tokens_seen": 1207688200, "step": 27615, "train_runtime": 213640.7332, "train_tokens_per_second": 5652.893 }, { "epoch": 1.8596821976838136, "grad_norm": 0.7244916772239959, "learning_rate": 1.2107692940817594e-07, "loss": 0.30665135383605957, "num_input_tokens_seen": 1207904320, "step": 27620, "train_runtime": 213682.5989, "train_tokens_per_second": 5652.797 }, { "epoch": 1.8600188526797736, "grad_norm": 0.8628325975987942, "learning_rate": 1.2049926201981088e-07, "loss": 0.2934282302856445, "num_input_tokens_seen": 1208124344, "step": 27625, "train_runtime": 213723.4491, "train_tokens_per_second": 5652.746 }, { "epoch": 1.8603555076757339, "grad_norm": 0.719201813819039, "learning_rate": 1.199229591682677e-07, "loss": 0.3092188835144043, "num_input_tokens_seen": 1208348632, "step": 27630, "train_runtime": 213757.6689, "train_tokens_per_second": 5652.89 }, { "epoch": 1.8606921626716941, "grad_norm": 0.8213286351201897, "learning_rate": 1.193480210147069e-07, "loss": 0.3101773262023926, "num_input_tokens_seen": 1208576560, "step": 27635, "train_runtime": 213793.1342, "train_tokens_per_second": 5653.019 }, { "epoch": 1.8610288176676542, "grad_norm": 0.7546904535243726, "learning_rate": 1.1877444771991042e-07, "loss": 0.2830918788909912, "num_input_tokens_seen": 1208805448, "step": 27640, "train_runtime": 213830.9044, "train_tokens_per_second": 5653.09 }, { "epoch": 1.8613654726636142, "grad_norm": 0.7654042884672665, "learning_rate": 1.1820223944427279e-07, "loss": 0.28035907745361327, "num_input_tokens_seen": 1209015368, "step": 27645, "train_runtime": 213873.433, "train_tokens_per_second": 5652.948 }, { "epoch": 1.8617021276595744, "grad_norm": 0.7531392542074884, "learning_rate": 1.1763139634781262e-07, "loss": 0.29651951789855957, "num_input_tokens_seen": 1209240952, "step": 27650, "train_runtime": 213911.0698, "train_tokens_per_second": 5653.008 }, { "epoch": 1.8620387826555347, "grad_norm": 0.7502735387914459, "learning_rate": 1.1706191859016392e-07, "loss": 0.3263824224472046, "num_input_tokens_seen": 1209461064, "step": 27655, "train_runtime": 213953.9938, "train_tokens_per_second": 5652.902 }, { "epoch": 1.8623754376514947, "grad_norm": 0.8331137280204224, "learning_rate": 1.1649380633057927e-07, "loss": 0.3037287950515747, "num_input_tokens_seen": 1209677248, "step": 27660, "train_runtime": 213997.5656, "train_tokens_per_second": 5652.762 }, { "epoch": 1.8627120926474547, "grad_norm": 0.7575852346311494, "learning_rate": 1.1592705972792939e-07, "loss": 0.27420315742492674, "num_input_tokens_seen": 1209892576, "step": 27665, "train_runtime": 214039.3874, "train_tokens_per_second": 5652.663 }, { "epoch": 1.863048747643415, "grad_norm": 0.7320879410064924, "learning_rate": 1.1536167894070249e-07, "loss": 0.3063500165939331, "num_input_tokens_seen": 1210118104, "step": 27670, "train_runtime": 214082.5531, "train_tokens_per_second": 5652.577 }, { "epoch": 1.8633854026393752, "grad_norm": 0.7458641244137307, "learning_rate": 1.1479766412700655e-07, "loss": 0.33033363819122313, "num_input_tokens_seen": 1210345472, "step": 27675, "train_runtime": 214121.2922, "train_tokens_per_second": 5652.616 }, { "epoch": 1.8637220576353353, "grad_norm": 0.7595248981178473, "learning_rate": 1.1423501544456595e-07, "loss": 0.31739757061004636, "num_input_tokens_seen": 1210558512, "step": 27680, "train_runtime": 214156.2124, "train_tokens_per_second": 5652.689 }, { "epoch": 1.8640587126312953, "grad_norm": 0.7625771638849843, "learning_rate": 1.1367373305072315e-07, "loss": 0.2853879451751709, "num_input_tokens_seen": 1210779944, "step": 27685, "train_runtime": 214192.52, "train_tokens_per_second": 5652.765 }, { "epoch": 1.8643953676272556, "grad_norm": 0.7246559600061148, "learning_rate": 1.1311381710244096e-07, "loss": 0.2670130729675293, "num_input_tokens_seen": 1211003328, "step": 27690, "train_runtime": 214233.2878, "train_tokens_per_second": 5652.732 }, { "epoch": 1.8647320226232158, "grad_norm": 0.8080414702851416, "learning_rate": 1.1255526775629521e-07, "loss": 0.27195014953613283, "num_input_tokens_seen": 1211215040, "step": 27695, "train_runtime": 214278.5375, "train_tokens_per_second": 5652.526 }, { "epoch": 1.8650686776191758, "grad_norm": 0.7987137339242992, "learning_rate": 1.1199808516848487e-07, "loss": 0.30287680625915525, "num_input_tokens_seen": 1211429152, "step": 27700, "train_runtime": 214324.0073, "train_tokens_per_second": 5652.326 }, { "epoch": 1.8654053326151359, "grad_norm": 0.7407863475801888, "learning_rate": 1.1144226949482306e-07, "loss": 0.28324642181396487, "num_input_tokens_seen": 1211638376, "step": 27705, "train_runtime": 214360.0889, "train_tokens_per_second": 5652.351 }, { "epoch": 1.865741987611096, "grad_norm": 0.6793586684952472, "learning_rate": 1.1088782089074157e-07, "loss": 0.27295451164245604, "num_input_tokens_seen": 1211854440, "step": 27710, "train_runtime": 214400.1883, "train_tokens_per_second": 5652.301 }, { "epoch": 1.8660786426070564, "grad_norm": 0.8291474455329964, "learning_rate": 1.1033473951129137e-07, "loss": 0.3024445056915283, "num_input_tokens_seen": 1212077896, "step": 27715, "train_runtime": 214434.9545, "train_tokens_per_second": 5652.427 }, { "epoch": 1.8664152976030164, "grad_norm": 0.7458532162025366, "learning_rate": 1.0978302551113929e-07, "loss": 0.3134200096130371, "num_input_tokens_seen": 1212305392, "step": 27720, "train_runtime": 214476.0312, "train_tokens_per_second": 5652.405 }, { "epoch": 1.8667519525989764, "grad_norm": 0.7681313743079988, "learning_rate": 1.0923267904457025e-07, "loss": 0.30133209228515623, "num_input_tokens_seen": 1212533032, "step": 27725, "train_runtime": 214516.8657, "train_tokens_per_second": 5652.39 }, { "epoch": 1.8670886075949367, "grad_norm": 0.7916528062724383, "learning_rate": 1.086837002654867e-07, "loss": 0.30214452743530273, "num_input_tokens_seen": 1212743440, "step": 27730, "train_runtime": 214558.688, "train_tokens_per_second": 5652.269 }, { "epoch": 1.867425262590897, "grad_norm": 0.7468188583517545, "learning_rate": 1.0813608932740915e-07, "loss": 0.3034868001937866, "num_input_tokens_seen": 1212977168, "step": 27735, "train_runtime": 214594.7214, "train_tokens_per_second": 5652.409 }, { "epoch": 1.867761917586857, "grad_norm": 0.7831956841711861, "learning_rate": 1.0758984638347569e-07, "loss": 0.2956989765167236, "num_input_tokens_seen": 1213207904, "step": 27740, "train_runtime": 214629.3326, "train_tokens_per_second": 5652.573 }, { "epoch": 1.868098572582817, "grad_norm": 0.7955988160557622, "learning_rate": 1.0704497158644022e-07, "loss": 0.32259302139282225, "num_input_tokens_seen": 1213425128, "step": 27745, "train_runtime": 214673.9293, "train_tokens_per_second": 5652.41 }, { "epoch": 1.8684352275787772, "grad_norm": 0.6842277034050441, "learning_rate": 1.0650146508867642e-07, "loss": 0.2915182590484619, "num_input_tokens_seen": 1213645624, "step": 27750, "train_runtime": 214712.349, "train_tokens_per_second": 5652.426 }, { "epoch": 1.8687718825747375, "grad_norm": 0.7772804158541299, "learning_rate": 1.0595932704217327e-07, "loss": 0.2860418796539307, "num_input_tokens_seen": 1213868720, "step": 27755, "train_runtime": 214747.403, "train_tokens_per_second": 5652.542 }, { "epoch": 1.8691085375706975, "grad_norm": 0.7387951063630381, "learning_rate": 1.0541855759853837e-07, "loss": 0.2798731327056885, "num_input_tokens_seen": 1214099608, "step": 27760, "train_runtime": 214776.3703, "train_tokens_per_second": 5652.855 }, { "epoch": 1.8694451925666575, "grad_norm": 0.6909728784946527, "learning_rate": 1.0487915690899685e-07, "loss": 0.29963858127593995, "num_input_tokens_seen": 1214319216, "step": 27765, "train_runtime": 214814.2285, "train_tokens_per_second": 5652.881 }, { "epoch": 1.8697818475626178, "grad_norm": 0.7184706301388402, "learning_rate": 1.0434112512438921e-07, "loss": 0.29176318645477295, "num_input_tokens_seen": 1214533368, "step": 27770, "train_runtime": 214852.4866, "train_tokens_per_second": 5652.871 }, { "epoch": 1.870118502558578, "grad_norm": 0.8307447666812611, "learning_rate": 1.0380446239517506e-07, "loss": 0.2727836608886719, "num_input_tokens_seen": 1214730928, "step": 27775, "train_runtime": 214893.9185, "train_tokens_per_second": 5652.7 }, { "epoch": 1.870455157554538, "grad_norm": 0.8916967588803947, "learning_rate": 1.032691688714299e-07, "loss": 0.2895357608795166, "num_input_tokens_seen": 1214918680, "step": 27780, "train_runtime": 214939.4108, "train_tokens_per_second": 5652.377 }, { "epoch": 1.870791812550498, "grad_norm": 0.7913603727738847, "learning_rate": 1.0273524470284734e-07, "loss": 0.3172266483306885, "num_input_tokens_seen": 1215146136, "step": 27785, "train_runtime": 214976.005, "train_tokens_per_second": 5652.473 }, { "epoch": 1.8711284675464583, "grad_norm": 0.9142096797553524, "learning_rate": 1.0220269003873739e-07, "loss": 0.29100470542907714, "num_input_tokens_seen": 1215365024, "step": 27790, "train_runtime": 215011.3451, "train_tokens_per_second": 5652.562 }, { "epoch": 1.8714651225424186, "grad_norm": 0.8041418730532507, "learning_rate": 1.0167150502802703e-07, "loss": 0.2920061111450195, "num_input_tokens_seen": 1215587488, "step": 27795, "train_runtime": 215049.5211, "train_tokens_per_second": 5652.593 }, { "epoch": 1.8718017775383786, "grad_norm": 0.7464357375845391, "learning_rate": 1.0114168981926075e-07, "loss": 0.31276350021362304, "num_input_tokens_seen": 1215810000, "step": 27800, "train_runtime": 215091.2811, "train_tokens_per_second": 5652.53 }, { "epoch": 1.8721384325343386, "grad_norm": 0.7898446735642499, "learning_rate": 1.006132445605995e-07, "loss": 0.3080112457275391, "num_input_tokens_seen": 1216014256, "step": 27805, "train_runtime": 215124.1859, "train_tokens_per_second": 5652.615 }, { "epoch": 1.872475087530299, "grad_norm": 0.7329730105281138, "learning_rate": 1.0008616939982118e-07, "loss": 0.28853521347045896, "num_input_tokens_seen": 1216231488, "step": 27810, "train_runtime": 215162.2144, "train_tokens_per_second": 5652.626 }, { "epoch": 1.8728117425262591, "grad_norm": 0.7289363854898081, "learning_rate": 9.956046448432177e-08, "loss": 0.283016300201416, "num_input_tokens_seen": 1216451408, "step": 27815, "train_runtime": 215198.9756, "train_tokens_per_second": 5652.682 }, { "epoch": 1.8731483975222192, "grad_norm": 0.7391182483442761, "learning_rate": 9.90361299611109e-08, "loss": 0.30707416534423826, "num_input_tokens_seen": 1216680872, "step": 27820, "train_runtime": 215231.7273, "train_tokens_per_second": 5652.888 }, { "epoch": 1.8734850525181792, "grad_norm": 0.8057353688260167, "learning_rate": 9.851316597681959e-08, "loss": 0.3057239055633545, "num_input_tokens_seen": 1216892024, "step": 27825, "train_runtime": 215268.9874, "train_tokens_per_second": 5652.891 }, { "epoch": 1.8738217075141395, "grad_norm": 0.8107611348319113, "learning_rate": 9.799157267769088e-08, "loss": 0.3025531768798828, "num_input_tokens_seen": 1217114336, "step": 27830, "train_runtime": 215300.5052, "train_tokens_per_second": 5653.096 }, { "epoch": 1.8741583625100997, "grad_norm": 0.6867341450134844, "learning_rate": 9.747135020958753e-08, "loss": 0.2927044153213501, "num_input_tokens_seen": 1217335976, "step": 27835, "train_runtime": 215340.9059, "train_tokens_per_second": 5653.064 }, { "epoch": 1.8744950175060597, "grad_norm": 0.7604489307015202, "learning_rate": 9.695249871798818e-08, "loss": 0.2803203582763672, "num_input_tokens_seen": 1217552464, "step": 27840, "train_runtime": 215388.9005, "train_tokens_per_second": 5652.81 }, { "epoch": 1.8748316725020198, "grad_norm": 0.7584373162773101, "learning_rate": 9.643501834798786e-08, "loss": 0.30305957794189453, "num_input_tokens_seen": 1217765392, "step": 27845, "train_runtime": 215429.0423, "train_tokens_per_second": 5652.745 }, { "epoch": 1.8751683274979802, "grad_norm": 0.7728951165449691, "learning_rate": 9.591890924429858e-08, "loss": 0.2971980094909668, "num_input_tokens_seen": 1218000984, "step": 27850, "train_runtime": 215470.184, "train_tokens_per_second": 5652.759 }, { "epoch": 1.8755049824939403, "grad_norm": 0.7960632667781874, "learning_rate": 9.540417155124826e-08, "loss": 0.278977370262146, "num_input_tokens_seen": 1218198848, "step": 27855, "train_runtime": 215509.0395, "train_tokens_per_second": 5652.658 }, { "epoch": 1.8758416374899003, "grad_norm": 0.73841359058749, "learning_rate": 9.489080541278117e-08, "loss": 0.2986736536026001, "num_input_tokens_seen": 1218407032, "step": 27860, "train_runtime": 215554.3706, "train_tokens_per_second": 5652.435 }, { "epoch": 1.8761782924858605, "grad_norm": 0.7691921305890641, "learning_rate": 9.437881097246026e-08, "loss": 0.3069639205932617, "num_input_tokens_seen": 1218632248, "step": 27865, "train_runtime": 215593.7195, "train_tokens_per_second": 5652.448 }, { "epoch": 1.8765149474818208, "grad_norm": 0.7084528384556897, "learning_rate": 9.3868188373461e-08, "loss": 0.2972809076309204, "num_input_tokens_seen": 1218846656, "step": 27870, "train_runtime": 215628.931, "train_tokens_per_second": 5652.519 }, { "epoch": 1.8768516024777808, "grad_norm": 0.8347410289645919, "learning_rate": 9.335893775857918e-08, "loss": 0.3106103420257568, "num_input_tokens_seen": 1219056688, "step": 27875, "train_runtime": 215663.948, "train_tokens_per_second": 5652.575 }, { "epoch": 1.8771882574737409, "grad_norm": 0.7646297115981436, "learning_rate": 9.285105927022309e-08, "loss": 0.28227670192718507, "num_input_tokens_seen": 1219278728, "step": 27880, "train_runtime": 215702.0527, "train_tokens_per_second": 5652.606 }, { "epoch": 1.877524912469701, "grad_norm": 0.8949871913293714, "learning_rate": 9.234455305042133e-08, "loss": 0.2822525978088379, "num_input_tokens_seen": 1219485440, "step": 27885, "train_runtime": 215750.0835, "train_tokens_per_second": 5652.306 }, { "epoch": 1.8778615674656614, "grad_norm": 0.8356384310040774, "learning_rate": 9.183941924081563e-08, "loss": 0.2904726266860962, "num_input_tokens_seen": 1219702416, "step": 27890, "train_runtime": 215787.36, "train_tokens_per_second": 5652.335 }, { "epoch": 1.8781982224616214, "grad_norm": 0.7934445345932645, "learning_rate": 9.133565798266574e-08, "loss": 0.2883297443389893, "num_input_tokens_seen": 1219921880, "step": 27895, "train_runtime": 215820.3228, "train_tokens_per_second": 5652.488 }, { "epoch": 1.8785348774575814, "grad_norm": 0.783421786892747, "learning_rate": 9.083326941684622e-08, "loss": 0.3204617500305176, "num_input_tokens_seen": 1220148280, "step": 27900, "train_runtime": 215855.8328, "train_tokens_per_second": 5652.607 }, { "epoch": 1.8788715324535417, "grad_norm": 0.7556141302042848, "learning_rate": 9.033225368384912e-08, "loss": 0.3104442358016968, "num_input_tokens_seen": 1220358200, "step": 27905, "train_runtime": 215897.0384, "train_tokens_per_second": 5652.501 }, { "epoch": 1.879208187449502, "grad_norm": 0.6646972540097822, "learning_rate": 8.98326109237807e-08, "loss": 0.27222867012023927, "num_input_tokens_seen": 1220576488, "step": 27910, "train_runtime": 215939.5159, "train_tokens_per_second": 5652.4 }, { "epoch": 1.879544842445462, "grad_norm": 0.73208942270682, "learning_rate": 8.933434127636586e-08, "loss": 0.31929314136505127, "num_input_tokens_seen": 1220801344, "step": 27915, "train_runtime": 215983.142, "train_tokens_per_second": 5652.299 }, { "epoch": 1.879881497441422, "grad_norm": 0.7379086364893702, "learning_rate": 8.883744488094314e-08, "loss": 0.3021604061126709, "num_input_tokens_seen": 1221012952, "step": 27920, "train_runtime": 216020.1906, "train_tokens_per_second": 5652.309 }, { "epoch": 1.8802181524373822, "grad_norm": 0.7315736019754095, "learning_rate": 8.834192187646917e-08, "loss": 0.30646262168884275, "num_input_tokens_seen": 1221243752, "step": 27925, "train_runtime": 216054.4565, "train_tokens_per_second": 5652.481 }, { "epoch": 1.8805548074333425, "grad_norm": 0.8178242002248947, "learning_rate": 8.784777240151365e-08, "loss": 0.30849490165710447, "num_input_tokens_seen": 1221469512, "step": 27930, "train_runtime": 216085.3674, "train_tokens_per_second": 5652.717 }, { "epoch": 1.8808914624293025, "grad_norm": 0.745298782226071, "learning_rate": 8.73549965942655e-08, "loss": 0.3049221754074097, "num_input_tokens_seen": 1221695328, "step": 27935, "train_runtime": 216123.8064, "train_tokens_per_second": 5652.757 }, { "epoch": 1.8812281174252625, "grad_norm": 0.7296969049019549, "learning_rate": 8.686359459252725e-08, "loss": 0.29515538215637205, "num_input_tokens_seen": 1221906744, "step": 27940, "train_runtime": 216162.3363, "train_tokens_per_second": 5652.727 }, { "epoch": 1.8815647724212228, "grad_norm": 0.6723805170647249, "learning_rate": 8.637356653371787e-08, "loss": 0.28774356842041016, "num_input_tokens_seen": 1222134512, "step": 27945, "train_runtime": 216197.844, "train_tokens_per_second": 5652.852 }, { "epoch": 1.881901427417183, "grad_norm": 0.8473708457816271, "learning_rate": 8.588491255487163e-08, "loss": 0.2720442056655884, "num_input_tokens_seen": 1222344728, "step": 27950, "train_runtime": 216239.4622, "train_tokens_per_second": 5652.737 }, { "epoch": 1.882238082413143, "grad_norm": 0.7624946480602264, "learning_rate": 8.539763279264035e-08, "loss": 0.2836963176727295, "num_input_tokens_seen": 1222560856, "step": 27955, "train_runtime": 216284.8082, "train_tokens_per_second": 5652.551 }, { "epoch": 1.882574737409103, "grad_norm": 0.7053326289175388, "learning_rate": 8.49117273832889e-08, "loss": 0.3163050651550293, "num_input_tokens_seen": 1222789864, "step": 27960, "train_runtime": 216318.1103, "train_tokens_per_second": 5652.739 }, { "epoch": 1.8829113924050633, "grad_norm": 0.6499749519322318, "learning_rate": 8.442719646270082e-08, "loss": 0.28265206813812255, "num_input_tokens_seen": 1223005096, "step": 27965, "train_runtime": 216357.5685, "train_tokens_per_second": 5652.703 }, { "epoch": 1.8832480474010236, "grad_norm": 0.7141334939696597, "learning_rate": 8.394404016637159e-08, "loss": 0.28957691192626955, "num_input_tokens_seen": 1223223864, "step": 27970, "train_runtime": 216399.1348, "train_tokens_per_second": 5652.628 }, { "epoch": 1.8835847023969836, "grad_norm": 0.7972265729262933, "learning_rate": 8.346225862941592e-08, "loss": 0.28935163021087645, "num_input_tokens_seen": 1223430136, "step": 27975, "train_runtime": 216434.0905, "train_tokens_per_second": 5652.668 }, { "epoch": 1.8839213573929436, "grad_norm": 0.8292085959022567, "learning_rate": 8.298185198656161e-08, "loss": 0.31040134429931643, "num_input_tokens_seen": 1223661888, "step": 27980, "train_runtime": 216475.8962, "train_tokens_per_second": 5652.647 }, { "epoch": 1.884258012388904, "grad_norm": 0.7497952405897995, "learning_rate": 8.25028203721534e-08, "loss": 0.2839097023010254, "num_input_tokens_seen": 1223872392, "step": 27985, "train_runtime": 216516.2523, "train_tokens_per_second": 5652.566 }, { "epoch": 1.8845946673848641, "grad_norm": 0.8204275222628281, "learning_rate": 8.202516392015081e-08, "loss": 0.30760276317596436, "num_input_tokens_seen": 1224095496, "step": 27990, "train_runtime": 216553.2529, "train_tokens_per_second": 5652.63 }, { "epoch": 1.8849313223808242, "grad_norm": 0.9261868943922493, "learning_rate": 8.154888276412865e-08, "loss": 0.31410627365112304, "num_input_tokens_seen": 1224301616, "step": 27995, "train_runtime": 216587.9714, "train_tokens_per_second": 5652.676 }, { "epoch": 1.8852679773767842, "grad_norm": 0.7105028791923415, "learning_rate": 8.10739770372776e-08, "loss": 0.2736332416534424, "num_input_tokens_seen": 1224525064, "step": 28000, "train_runtime": 216624.6668, "train_tokens_per_second": 5652.75 }, { "epoch": 1.8856046323727444, "grad_norm": 0.6544014559458133, "learning_rate": 8.060044687240365e-08, "loss": 0.2702982425689697, "num_input_tokens_seen": 1224764712, "step": 28005, "train_runtime": 216655.2066, "train_tokens_per_second": 5653.059 }, { "epoch": 1.8859412873687047, "grad_norm": 0.7293503705566087, "learning_rate": 8.012829240192754e-08, "loss": 0.31306607723236085, "num_input_tokens_seen": 1224979848, "step": 28010, "train_runtime": 216695.9204, "train_tokens_per_second": 5652.99 }, { "epoch": 1.8862779423646647, "grad_norm": 0.7181373637032492, "learning_rate": 7.9657513757887e-08, "loss": 0.2802762985229492, "num_input_tokens_seen": 1225200744, "step": 28015, "train_runtime": 216735.8221, "train_tokens_per_second": 5652.968 }, { "epoch": 1.8866145973606248, "grad_norm": 0.753661015701672, "learning_rate": 7.918811107193225e-08, "loss": 0.28357934951782227, "num_input_tokens_seen": 1225430328, "step": 28020, "train_runtime": 216771.4604, "train_tokens_per_second": 5653.098 }, { "epoch": 1.886951252356585, "grad_norm": 0.8998847487777263, "learning_rate": 7.872008447533109e-08, "loss": 0.3160097122192383, "num_input_tokens_seen": 1225648792, "step": 28025, "train_runtime": 216808.3453, "train_tokens_per_second": 5653.144 }, { "epoch": 1.8872879073525453, "grad_norm": 0.7934211783590108, "learning_rate": 7.825343409896547e-08, "loss": 0.3094397306442261, "num_input_tokens_seen": 1225864272, "step": 28030, "train_runtime": 216844.6438, "train_tokens_per_second": 5653.191 }, { "epoch": 1.8876245623485053, "grad_norm": 0.7748967589073342, "learning_rate": 7.778816007333268e-08, "loss": 0.3081014156341553, "num_input_tokens_seen": 1226087184, "step": 28035, "train_runtime": 216887.2541, "train_tokens_per_second": 5653.109 }, { "epoch": 1.8879612173444653, "grad_norm": 0.8144894017280363, "learning_rate": 7.73242625285453e-08, "loss": 0.29062952995300295, "num_input_tokens_seen": 1226306464, "step": 28040, "train_runtime": 216925.8357, "train_tokens_per_second": 5653.114 }, { "epoch": 1.8882978723404256, "grad_norm": 0.7574566262911345, "learning_rate": 7.686174159433069e-08, "loss": 0.3064660787582397, "num_input_tokens_seen": 1226520296, "step": 28045, "train_runtime": 216966.9693, "train_tokens_per_second": 5653.028 }, { "epoch": 1.8886345273363858, "grad_norm": 0.627537289336894, "learning_rate": 7.640059740003091e-08, "loss": 0.2722774982452393, "num_input_tokens_seen": 1226746648, "step": 28050, "train_runtime": 217006.2516, "train_tokens_per_second": 5653.047 }, { "epoch": 1.8889711823323458, "grad_norm": 0.7705422901820207, "learning_rate": 7.594083007460396e-08, "loss": 0.29419803619384766, "num_input_tokens_seen": 1226953312, "step": 28055, "train_runtime": 217048.1468, "train_tokens_per_second": 5652.908 }, { "epoch": 1.8893078373283059, "grad_norm": 0.7044024327241764, "learning_rate": 7.54824397466225e-08, "loss": 0.2896998167037964, "num_input_tokens_seen": 1227175648, "step": 28060, "train_runtime": 217084.5331, "train_tokens_per_second": 5652.985 }, { "epoch": 1.8896444923242661, "grad_norm": 0.715442564314742, "learning_rate": 7.502542654427347e-08, "loss": 0.28265087604522704, "num_input_tokens_seen": 1227383304, "step": 28065, "train_runtime": 217116.2593, "train_tokens_per_second": 5653.116 }, { "epoch": 1.8899811473202264, "grad_norm": 0.7174922222370509, "learning_rate": 7.456979059535907e-08, "loss": 0.29991984367370605, "num_input_tokens_seen": 1227603976, "step": 28070, "train_runtime": 217161.5657, "train_tokens_per_second": 5652.952 }, { "epoch": 1.8903178023161864, "grad_norm": 0.8821755978176467, "learning_rate": 7.411553202729682e-08, "loss": 0.2972327470779419, "num_input_tokens_seen": 1227795992, "step": 28075, "train_runtime": 217202.7149, "train_tokens_per_second": 5652.765 }, { "epoch": 1.8906544573121464, "grad_norm": 0.7547240032942905, "learning_rate": 7.3662650967119e-08, "loss": 0.2765605926513672, "num_input_tokens_seen": 1228009920, "step": 28080, "train_runtime": 217242.1532, "train_tokens_per_second": 5652.724 }, { "epoch": 1.8909911123081067, "grad_norm": 0.7381759970020896, "learning_rate": 7.321114754147151e-08, "loss": 0.28570716381072997, "num_input_tokens_seen": 1228232816, "step": 28085, "train_runtime": 217280.844, "train_tokens_per_second": 5652.743 }, { "epoch": 1.891327767304067, "grad_norm": 0.9586290374485588, "learning_rate": 7.276102187661615e-08, "loss": 0.31825072765350343, "num_input_tokens_seen": 1228448704, "step": 28090, "train_runtime": 217319.8127, "train_tokens_per_second": 5652.723 }, { "epoch": 1.891664422300027, "grad_norm": 0.7106822110807806, "learning_rate": 7.231227409842944e-08, "loss": 0.30093338489532473, "num_input_tokens_seen": 1228675704, "step": 28095, "train_runtime": 217355.8762, "train_tokens_per_second": 5652.829 }, { "epoch": 1.892001077295987, "grad_norm": 0.7479457461633977, "learning_rate": 7.186490433240156e-08, "loss": 0.30986011028289795, "num_input_tokens_seen": 1228877808, "step": 28100, "train_runtime": 217390.778, "train_tokens_per_second": 5652.852 }, { "epoch": 1.8923377322919472, "grad_norm": 0.7862198031676131, "learning_rate": 7.14189127036391e-08, "loss": 0.2832916259765625, "num_input_tokens_seen": 1229095280, "step": 28105, "train_runtime": 217425.4702, "train_tokens_per_second": 5652.95 }, { "epoch": 1.8926743872879075, "grad_norm": 0.7610693134796771, "learning_rate": 7.097429933686118e-08, "loss": 0.3074744701385498, "num_input_tokens_seen": 1229309216, "step": 28110, "train_runtime": 217466.3238, "train_tokens_per_second": 5652.872 }, { "epoch": 1.8930110422838675, "grad_norm": 0.9062932954935005, "learning_rate": 7.053106435640333e-08, "loss": 0.31830539703369143, "num_input_tokens_seen": 1229541912, "step": 28115, "train_runtime": 217504.1355, "train_tokens_per_second": 5652.959 }, { "epoch": 1.8933476972798275, "grad_norm": 0.7426318413849856, "learning_rate": 7.008920788621366e-08, "loss": 0.299678635597229, "num_input_tokens_seen": 1229758840, "step": 28120, "train_runtime": 217545.4661, "train_tokens_per_second": 5652.882 }, { "epoch": 1.8936843522757878, "grad_norm": 0.7413896799320939, "learning_rate": 6.964873004985717e-08, "loss": 0.3041519641876221, "num_input_tokens_seen": 1229975280, "step": 28125, "train_runtime": 217582.095, "train_tokens_per_second": 5652.925 }, { "epoch": 1.894021007271748, "grad_norm": 0.8140877400473608, "learning_rate": 6.920963097051148e-08, "loss": 0.3081005096435547, "num_input_tokens_seen": 1230195248, "step": 28130, "train_runtime": 217622.0274, "train_tokens_per_second": 5652.899 }, { "epoch": 1.894357662267708, "grad_norm": 0.8171774682734737, "learning_rate": 6.877191077096945e-08, "loss": 0.28580417633056643, "num_input_tokens_seen": 1230403720, "step": 28135, "train_runtime": 217663.6137, "train_tokens_per_second": 5652.776 }, { "epoch": 1.894694317263668, "grad_norm": 0.7796944173521188, "learning_rate": 6.833556957363818e-08, "loss": 0.31174564361572266, "num_input_tokens_seen": 1230619400, "step": 28140, "train_runtime": 217701.7663, "train_tokens_per_second": 5652.776 }, { "epoch": 1.8950309722596284, "grad_norm": 0.7394530047484759, "learning_rate": 6.790060750053895e-08, "loss": 0.2922555446624756, "num_input_tokens_seen": 1230833368, "step": 28145, "train_runtime": 217738.7294, "train_tokens_per_second": 5652.799 }, { "epoch": 1.8953676272555886, "grad_norm": 0.6213839509137753, "learning_rate": 6.746702467330723e-08, "loss": 0.2662560701370239, "num_input_tokens_seen": 1231064032, "step": 28150, "train_runtime": 217778.1192, "train_tokens_per_second": 5652.836 }, { "epoch": 1.8957042822515486, "grad_norm": 0.7209769414897946, "learning_rate": 6.703482121319383e-08, "loss": 0.2952676296234131, "num_input_tokens_seen": 1231282944, "step": 28155, "train_runtime": 217815.4664, "train_tokens_per_second": 5652.872 }, { "epoch": 1.8960409372475087, "grad_norm": 0.7719176273534697, "learning_rate": 6.660399724106204e-08, "loss": 0.31438963413238524, "num_input_tokens_seen": 1231513400, "step": 28160, "train_runtime": 217855.297, "train_tokens_per_second": 5652.896 }, { "epoch": 1.896377592243469, "grad_norm": 0.7554115178407177, "learning_rate": 6.617455287739161e-08, "loss": 0.28926453590393064, "num_input_tokens_seen": 1231738296, "step": 28165, "train_runtime": 217889.6272, "train_tokens_per_second": 5653.038 }, { "epoch": 1.8967142472394292, "grad_norm": 0.7869091031125452, "learning_rate": 6.574648824227369e-08, "loss": 0.29925999641418455, "num_input_tokens_seen": 1231961800, "step": 28170, "train_runtime": 217924.705, "train_tokens_per_second": 5653.153 }, { "epoch": 1.8970509022353892, "grad_norm": 0.7908040273802075, "learning_rate": 6.5319803455417e-08, "loss": 0.3044144153594971, "num_input_tokens_seen": 1232184856, "step": 28175, "train_runtime": 217965.4264, "train_tokens_per_second": 5653.121 }, { "epoch": 1.8973875572313492, "grad_norm": 0.7737887474560637, "learning_rate": 6.489449863614106e-08, "loss": 0.3226012706756592, "num_input_tokens_seen": 1232404696, "step": 28180, "train_runtime": 218003.5275, "train_tokens_per_second": 5653.141 }, { "epoch": 1.8977242122273095, "grad_norm": 0.7245308841502345, "learning_rate": 6.44705739033824e-08, "loss": 0.29819202423095703, "num_input_tokens_seen": 1232620728, "step": 28185, "train_runtime": 218043.0047, "train_tokens_per_second": 5653.108 }, { "epoch": 1.8980608672232697, "grad_norm": 0.883569648340652, "learning_rate": 6.404802937568899e-08, "loss": 0.283476448059082, "num_input_tokens_seen": 1232822576, "step": 28190, "train_runtime": 218076.1787, "train_tokens_per_second": 5653.174 }, { "epoch": 1.8983975222192297, "grad_norm": 0.6097934961985845, "learning_rate": 6.362686517122463e-08, "loss": 0.276761531829834, "num_input_tokens_seen": 1233038648, "step": 28195, "train_runtime": 218115.3719, "train_tokens_per_second": 5653.149 }, { "epoch": 1.8987341772151898, "grad_norm": 0.7436026418824351, "learning_rate": 6.320708140776676e-08, "loss": 0.28359341621398926, "num_input_tokens_seen": 1233258352, "step": 28200, "train_runtime": 218158.6419, "train_tokens_per_second": 5653.035 }, { "epoch": 1.89907083221115, "grad_norm": 0.7681913781823284, "learning_rate": 6.278867820270596e-08, "loss": 0.299153208732605, "num_input_tokens_seen": 1233480288, "step": 28205, "train_runtime": 218195.6989, "train_tokens_per_second": 5653.092 }, { "epoch": 1.8994074872071103, "grad_norm": 0.7830138695146227, "learning_rate": 6.237165567304749e-08, "loss": 0.29818384647369384, "num_input_tokens_seen": 1233691368, "step": 28210, "train_runtime": 218237.5859, "train_tokens_per_second": 5652.974 }, { "epoch": 1.8997441422030703, "grad_norm": 0.7003448488149383, "learning_rate": 6.19560139354114e-08, "loss": 0.30460848808288576, "num_input_tokens_seen": 1233930016, "step": 28215, "train_runtime": 218270.3105, "train_tokens_per_second": 5653.22 }, { "epoch": 1.9000807971990303, "grad_norm": 0.7370403299032923, "learning_rate": 6.154175310602916e-08, "loss": 0.30403151512146, "num_input_tokens_seen": 1234154432, "step": 28220, "train_runtime": 218302.9228, "train_tokens_per_second": 5653.403 }, { "epoch": 1.9004174521949906, "grad_norm": 0.7562586977964543, "learning_rate": 6.112887330074812e-08, "loss": 0.2886775255203247, "num_input_tokens_seen": 1234363888, "step": 28225, "train_runtime": 218340.6417, "train_tokens_per_second": 5653.386 }, { "epoch": 1.9007541071909508, "grad_norm": 0.8023435948804223, "learning_rate": 6.07173746350287e-08, "loss": 0.3039447069168091, "num_input_tokens_seen": 1234586704, "step": 28230, "train_runtime": 218377.1498, "train_tokens_per_second": 5653.461 }, { "epoch": 1.9010907621869109, "grad_norm": 0.7102448231458076, "learning_rate": 6.030725722394548e-08, "loss": 0.30956282615661623, "num_input_tokens_seen": 1234811984, "step": 28235, "train_runtime": 218419.5266, "train_tokens_per_second": 5653.396 }, { "epoch": 1.901427417182871, "grad_norm": 0.8917953406376619, "learning_rate": 5.98985211821862e-08, "loss": 0.31682801246643066, "num_input_tokens_seen": 1235026864, "step": 28240, "train_runtime": 218463.2255, "train_tokens_per_second": 5653.248 }, { "epoch": 1.9017640721788311, "grad_norm": 3.1213239281278913, "learning_rate": 5.9491166624052185e-08, "loss": 0.29059295654296874, "num_input_tokens_seen": 1235257424, "step": 28245, "train_runtime": 218502.1071, "train_tokens_per_second": 5653.298 }, { "epoch": 1.9021007271747914, "grad_norm": 0.800370397152095, "learning_rate": 5.908519366345955e-08, "loss": 0.2929649829864502, "num_input_tokens_seen": 1235465968, "step": 28250, "train_runtime": 218531.1775, "train_tokens_per_second": 5653.5 }, { "epoch": 1.9024373821707514, "grad_norm": 0.7899542839676547, "learning_rate": 5.868060241393747e-08, "loss": 0.32121825218200684, "num_input_tokens_seen": 1235701752, "step": 28255, "train_runtime": 218574.1157, "train_tokens_per_second": 5653.468 }, { "epoch": 1.9027740371667115, "grad_norm": 0.8945208045237926, "learning_rate": 5.8277392988627665e-08, "loss": 0.30273237228393557, "num_input_tokens_seen": 1235918048, "step": 28260, "train_runtime": 218613.0158, "train_tokens_per_second": 5653.451 }, { "epoch": 1.9031106921626717, "grad_norm": 1.0956824749607716, "learning_rate": 5.787556550028772e-08, "loss": 0.2830909967422485, "num_input_tokens_seen": 1236133248, "step": 28265, "train_runtime": 218655.8574, "train_tokens_per_second": 5653.328 }, { "epoch": 1.903447347158632, "grad_norm": 0.7232891426044542, "learning_rate": 5.747512006128553e-08, "loss": 0.3094156265258789, "num_input_tokens_seen": 1236365056, "step": 28270, "train_runtime": 218690.6793, "train_tokens_per_second": 5653.488 }, { "epoch": 1.903784002154592, "grad_norm": 0.825207510049438, "learning_rate": 5.707605678360595e-08, "loss": 0.30304322242736814, "num_input_tokens_seen": 1236586568, "step": 28275, "train_runtime": 218729.618, "train_tokens_per_second": 5653.494 }, { "epoch": 1.904120657150552, "grad_norm": 0.6746156299713596, "learning_rate": 5.6678375778845276e-08, "loss": 0.2991356611251831, "num_input_tokens_seen": 1236816112, "step": 28280, "train_runtime": 218761.9014, "train_tokens_per_second": 5653.709 }, { "epoch": 1.9044573121465123, "grad_norm": 0.7102199653388521, "learning_rate": 5.6282077158213435e-08, "loss": 0.29000029563903806, "num_input_tokens_seen": 1237040088, "step": 28285, "train_runtime": 218799.9174, "train_tokens_per_second": 5653.75 }, { "epoch": 1.9047939671424725, "grad_norm": 0.8451189106225591, "learning_rate": 5.588716103253511e-08, "loss": 0.29954440593719484, "num_input_tokens_seen": 1237269408, "step": 28290, "train_runtime": 218845.6994, "train_tokens_per_second": 5653.615 }, { "epoch": 1.9051306221384325, "grad_norm": 0.8190739439948348, "learning_rate": 5.549362751224585e-08, "loss": 0.31754138469696047, "num_input_tokens_seen": 1237476144, "step": 28295, "train_runtime": 218883.6501, "train_tokens_per_second": 5653.58 }, { "epoch": 1.9054672771343926, "grad_norm": 0.7766937595152473, "learning_rate": 5.5101476707397075e-08, "loss": 0.2879055976867676, "num_input_tokens_seen": 1237699056, "step": 28300, "train_runtime": 218922.8288, "train_tokens_per_second": 5653.586 }, { "epoch": 1.9058039321303528, "grad_norm": 0.6581310767139287, "learning_rate": 5.471070872765216e-08, "loss": 0.31143577098846437, "num_input_tokens_seen": 1237922344, "step": 28305, "train_runtime": 218962.3366, "train_tokens_per_second": 5653.586 }, { "epoch": 1.906140587126313, "grad_norm": 0.8595902577669746, "learning_rate": 5.432132368228815e-08, "loss": 0.3075572490692139, "num_input_tokens_seen": 1238144360, "step": 28310, "train_runtime": 218996.6769, "train_tokens_per_second": 5653.713 }, { "epoch": 1.906477242122273, "grad_norm": 0.7260821752374543, "learning_rate": 5.393332168019572e-08, "loss": 0.29381508827209474, "num_input_tokens_seen": 1238376024, "step": 28315, "train_runtime": 219038.2854, "train_tokens_per_second": 5653.697 }, { "epoch": 1.9068138971182331, "grad_norm": 0.7695214541702009, "learning_rate": 5.354670282987695e-08, "loss": 0.31864123344421386, "num_input_tokens_seen": 1238615352, "step": 28320, "train_runtime": 219071.5756, "train_tokens_per_second": 5653.93 }, { "epoch": 1.9071505521141934, "grad_norm": 0.7626491001109459, "learning_rate": 5.316146723945037e-08, "loss": 0.3147014379501343, "num_input_tokens_seen": 1238839600, "step": 28325, "train_runtime": 219109.8816, "train_tokens_per_second": 5653.965 }, { "epoch": 1.9074872071101536, "grad_norm": 0.7542385697702055, "learning_rate": 5.277761501664535e-08, "loss": 0.28926112651824953, "num_input_tokens_seen": 1239055736, "step": 28330, "train_runtime": 219151.3861, "train_tokens_per_second": 5653.88 }, { "epoch": 1.9078238621061137, "grad_norm": 0.8539701413858525, "learning_rate": 5.2395146268804934e-08, "loss": 0.3053768157958984, "num_input_tokens_seen": 1239282360, "step": 28335, "train_runtime": 219183.9605, "train_tokens_per_second": 5654.074 }, { "epoch": 1.9081605171020737, "grad_norm": 0.6987538717491121, "learning_rate": 5.201406110288465e-08, "loss": 0.2954925537109375, "num_input_tokens_seen": 1239505344, "step": 28340, "train_runtime": 219222.4201, "train_tokens_per_second": 5654.099 }, { "epoch": 1.908497172098034, "grad_norm": 0.7258797958708753, "learning_rate": 5.1634359625454266e-08, "loss": 0.26157379150390625, "num_input_tokens_seen": 1239718552, "step": 28345, "train_runtime": 219261.4852, "train_tokens_per_second": 5654.064 }, { "epoch": 1.9088338270939942, "grad_norm": 0.833392494175178, "learning_rate": 5.125604194269606e-08, "loss": 0.32343695163726804, "num_input_tokens_seen": 1239933464, "step": 28350, "train_runtime": 219303.7788, "train_tokens_per_second": 5653.954 }, { "epoch": 1.9091704820899542, "grad_norm": 0.8588011467833099, "learning_rate": 5.087910816040542e-08, "loss": 0.32165529727935793, "num_input_tokens_seen": 1240153424, "step": 28355, "train_runtime": 219348.9617, "train_tokens_per_second": 5653.792 }, { "epoch": 1.9095071370859142, "grad_norm": 0.7170515438107391, "learning_rate": 5.0503558383990235e-08, "loss": 0.29596068859100344, "num_input_tokens_seen": 1240382984, "step": 28360, "train_runtime": 219391.3692, "train_tokens_per_second": 5653.746 }, { "epoch": 1.9098437920818745, "grad_norm": 0.9056425664871629, "learning_rate": 5.0129392718472614e-08, "loss": 0.29495375156402587, "num_input_tokens_seen": 1240602456, "step": 28365, "train_runtime": 219428.0549, "train_tokens_per_second": 5653.801 }, { "epoch": 1.9101804470778347, "grad_norm": 0.7683712573518254, "learning_rate": 4.9756611268486077e-08, "loss": 0.3231898307800293, "num_input_tokens_seen": 1240834056, "step": 28370, "train_runtime": 219470.1885, "train_tokens_per_second": 5653.77 }, { "epoch": 1.9105171020737948, "grad_norm": 0.8473839083939165, "learning_rate": 4.9385214138277795e-08, "loss": 0.3085433006286621, "num_input_tokens_seen": 1241053560, "step": 28375, "train_runtime": 219515.4349, "train_tokens_per_second": 5653.605 }, { "epoch": 1.9108537570697548, "grad_norm": 0.7530840258849333, "learning_rate": 4.901520143170857e-08, "loss": 0.31458406448364257, "num_input_tokens_seen": 1241278752, "step": 28380, "train_runtime": 219551.5142, "train_tokens_per_second": 5653.702 }, { "epoch": 1.911190412065715, "grad_norm": 0.8440231962915516, "learning_rate": 4.864657325225064e-08, "loss": 0.2959612846374512, "num_input_tokens_seen": 1241501272, "step": 28385, "train_runtime": 219592.0284, "train_tokens_per_second": 5653.672 }, { "epoch": 1.9115270670616753, "grad_norm": 0.7788969789388622, "learning_rate": 4.827932970298932e-08, "loss": 0.28577983379364014, "num_input_tokens_seen": 1241706992, "step": 28390, "train_runtime": 219631.7102, "train_tokens_per_second": 5653.587 }, { "epoch": 1.9118637220576353, "grad_norm": 0.7570563184078223, "learning_rate": 4.7913470886624125e-08, "loss": 0.30133938789367676, "num_input_tokens_seen": 1241929008, "step": 28395, "train_runtime": 219667.8047, "train_tokens_per_second": 5653.669 }, { "epoch": 1.9122003770535954, "grad_norm": 0.7674867971456765, "learning_rate": 4.754899690546544e-08, "loss": 0.2801696538925171, "num_input_tokens_seen": 1242147848, "step": 28400, "train_runtime": 219701.4788, "train_tokens_per_second": 5653.798 }, { "epoch": 1.9125370320495556, "grad_norm": 0.7214457077784336, "learning_rate": 4.718590786143729e-08, "loss": 0.3026761531829834, "num_input_tokens_seen": 1242368696, "step": 28405, "train_runtime": 219734.8895, "train_tokens_per_second": 5653.944 }, { "epoch": 1.9128736870455159, "grad_norm": 0.7424922888900161, "learning_rate": 4.6824203856076776e-08, "loss": 0.3060077905654907, "num_input_tokens_seen": 1242605672, "step": 28410, "train_runtime": 219770.358, "train_tokens_per_second": 5654.11 }, { "epoch": 1.9132103420414759, "grad_norm": 0.7488946195290975, "learning_rate": 4.646388499053356e-08, "loss": 0.2775508642196655, "num_input_tokens_seen": 1242816568, "step": 28415, "train_runtime": 219806.033, "train_tokens_per_second": 5654.151 }, { "epoch": 1.913546997037436, "grad_norm": 0.7402940285995784, "learning_rate": 4.6104951365568696e-08, "loss": 0.2732607126235962, "num_input_tokens_seen": 1243037664, "step": 28420, "train_runtime": 219842.7305, "train_tokens_per_second": 5654.213 }, { "epoch": 1.9138836520333962, "grad_norm": 0.8182194298111709, "learning_rate": 4.574740308155801e-08, "loss": 0.2992802858352661, "num_input_tokens_seen": 1243248672, "step": 28425, "train_runtime": 219884.9, "train_tokens_per_second": 5654.088 }, { "epoch": 1.9142203070293564, "grad_norm": 0.7646860170343411, "learning_rate": 4.539124023848762e-08, "loss": 0.2957939624786377, "num_input_tokens_seen": 1243481672, "step": 28430, "train_runtime": 219924.6589, "train_tokens_per_second": 5654.126 }, { "epoch": 1.9145569620253164, "grad_norm": 0.7725331026025192, "learning_rate": 4.503646293595787e-08, "loss": 0.32006833553314207, "num_input_tokens_seen": 1243698024, "step": 28435, "train_runtime": 219958.6796, "train_tokens_per_second": 5654.235 }, { "epoch": 1.9148936170212765, "grad_norm": 0.7967463881139475, "learning_rate": 4.468307127318105e-08, "loss": 0.2883774280548096, "num_input_tokens_seen": 1243923240, "step": 28440, "train_runtime": 219994.0164, "train_tokens_per_second": 5654.35 }, { "epoch": 1.9152302720172367, "grad_norm": 0.8721239693546312, "learning_rate": 4.4331065348982014e-08, "loss": 0.2830281496047974, "num_input_tokens_seen": 1244140864, "step": 28445, "train_runtime": 220025.1373, "train_tokens_per_second": 5654.54 }, { "epoch": 1.915566927013197, "grad_norm": 0.7395255680690924, "learning_rate": 4.3980445261798125e-08, "loss": 0.3066460371017456, "num_input_tokens_seen": 1244363064, "step": 28450, "train_runtime": 220071.6297, "train_tokens_per_second": 5654.355 }, { "epoch": 1.915903582009157, "grad_norm": 0.8552277238547642, "learning_rate": 4.363121110967927e-08, "loss": 0.2869099140167236, "num_input_tokens_seen": 1244567184, "step": 28455, "train_runtime": 220111.9824, "train_tokens_per_second": 5654.245 }, { "epoch": 1.916240237005117, "grad_norm": 0.7565359558538893, "learning_rate": 4.328336299028735e-08, "loss": 0.27414395809173586, "num_input_tokens_seen": 1244775824, "step": 28460, "train_runtime": 220156.5249, "train_tokens_per_second": 5654.049 }, { "epoch": 1.9165768920010773, "grad_norm": 0.8537030065422263, "learning_rate": 4.293690100089731e-08, "loss": 0.30220975875854494, "num_input_tokens_seen": 1244988464, "step": 28465, "train_runtime": 220195.8129, "train_tokens_per_second": 5654.006 }, { "epoch": 1.9169135469970375, "grad_norm": 0.8148234793335632, "learning_rate": 4.259182523839556e-08, "loss": 0.29154458045959475, "num_input_tokens_seen": 1245214008, "step": 28470, "train_runtime": 220234.437, "train_tokens_per_second": 5654.039 }, { "epoch": 1.9172502019929976, "grad_norm": 0.7939908369257882, "learning_rate": 4.224813579928211e-08, "loss": 0.3210744857788086, "num_input_tokens_seen": 1245434864, "step": 28475, "train_runtime": 220278.6573, "train_tokens_per_second": 5653.906 }, { "epoch": 1.9175868569889576, "grad_norm": 0.7166123345087314, "learning_rate": 4.190583277966842e-08, "loss": 0.29584832191467286, "num_input_tokens_seen": 1245653840, "step": 28480, "train_runtime": 220319.9507, "train_tokens_per_second": 5653.84 }, { "epoch": 1.9179235119849178, "grad_norm": 0.7696523687780278, "learning_rate": 4.1564916275278477e-08, "loss": 0.2821512699127197, "num_input_tokens_seen": 1245862296, "step": 28485, "train_runtime": 220358.5767, "train_tokens_per_second": 5653.795 }, { "epoch": 1.918260166980878, "grad_norm": 0.7811203217746909, "learning_rate": 4.122538638144824e-08, "loss": 0.2951045989990234, "num_input_tokens_seen": 1246082824, "step": 28490, "train_runtime": 220395.6576, "train_tokens_per_second": 5653.845 }, { "epoch": 1.9185968219768381, "grad_norm": 0.7044342809522225, "learning_rate": 4.08872431931262e-08, "loss": 0.2757328271865845, "num_input_tokens_seen": 1246295392, "step": 28495, "train_runtime": 220435.9021, "train_tokens_per_second": 5653.777 }, { "epoch": 1.9189334769727981, "grad_norm": 0.8062793001735447, "learning_rate": 4.055048680487339e-08, "loss": 0.29179792404174804, "num_input_tokens_seen": 1246522464, "step": 28500, "train_runtime": 220473.702, "train_tokens_per_second": 5653.837 }, { "epoch": 1.9192701319687584, "grad_norm": 0.7448550831538739, "learning_rate": 4.0215117310862806e-08, "loss": 0.3171137809753418, "num_input_tokens_seen": 1246721184, "step": 28505, "train_runtime": 220514.8027, "train_tokens_per_second": 5653.685 }, { "epoch": 1.9196067869647186, "grad_norm": 0.8454561648217672, "learning_rate": 3.9881134804878316e-08, "loss": 0.3017882347106934, "num_input_tokens_seen": 1246923736, "step": 28510, "train_runtime": 220555.7088, "train_tokens_per_second": 5653.555 }, { "epoch": 1.9199434419606787, "grad_norm": 0.818261031372424, "learning_rate": 3.9548539380318e-08, "loss": 0.3179955005645752, "num_input_tokens_seen": 1247152480, "step": 28515, "train_runtime": 220588.4295, "train_tokens_per_second": 5653.753 }, { "epoch": 1.9202800969566387, "grad_norm": 0.7797530065110128, "learning_rate": 3.921733113019077e-08, "loss": 0.3016833305358887, "num_input_tokens_seen": 1247354448, "step": 28520, "train_runtime": 220628.9625, "train_tokens_per_second": 5653.63 }, { "epoch": 1.920616751952599, "grad_norm": 0.7210084261051174, "learning_rate": 3.888751014711867e-08, "loss": 0.3128508567810059, "num_input_tokens_seen": 1247557312, "step": 28525, "train_runtime": 220662.2317, "train_tokens_per_second": 5653.697 }, { "epoch": 1.9209534069485592, "grad_norm": 0.6727498501097389, "learning_rate": 3.855907652333402e-08, "loss": 0.28232321739196775, "num_input_tokens_seen": 1247776920, "step": 28530, "train_runtime": 220702.1687, "train_tokens_per_second": 5653.669 }, { "epoch": 1.9212900619445192, "grad_norm": 0.7326711637458728, "learning_rate": 3.8232030350683344e-08, "loss": 0.2884651184082031, "num_input_tokens_seen": 1248006808, "step": 28535, "train_runtime": 220743.7071, "train_tokens_per_second": 5653.646 }, { "epoch": 1.9216267169404793, "grad_norm": 0.749333938315018, "learning_rate": 3.7906371720622946e-08, "loss": 0.2990164041519165, "num_input_tokens_seen": 1248234992, "step": 28540, "train_runtime": 220782.3848, "train_tokens_per_second": 5653.689 }, { "epoch": 1.9219633719364395, "grad_norm": 0.7532923064142389, "learning_rate": 3.758210072422275e-08, "loss": 0.28374738693237306, "num_input_tokens_seen": 1248453088, "step": 28545, "train_runtime": 220818.7593, "train_tokens_per_second": 5653.746 }, { "epoch": 1.9223000269323998, "grad_norm": 0.8243046568432454, "learning_rate": 3.72592174521641e-08, "loss": 0.30987684726715087, "num_input_tokens_seen": 1248674912, "step": 28550, "train_runtime": 220861.5131, "train_tokens_per_second": 5653.656 }, { "epoch": 1.9226366819283598, "grad_norm": 0.7456873109655421, "learning_rate": 3.693772199474033e-08, "loss": 0.30152506828308107, "num_input_tokens_seen": 1248896320, "step": 28555, "train_runtime": 220899.3543, "train_tokens_per_second": 5653.689 }, { "epoch": 1.9229733369243198, "grad_norm": 0.8268089260806681, "learning_rate": 3.661761444185674e-08, "loss": 0.30233216285705566, "num_input_tokens_seen": 1249110256, "step": 28560, "train_runtime": 220941.1918, "train_tokens_per_second": 5653.587 }, { "epoch": 1.92330999192028, "grad_norm": 0.7596988638251234, "learning_rate": 3.6298894883030066e-08, "loss": 0.3038165807723999, "num_input_tokens_seen": 1249337408, "step": 28565, "train_runtime": 220975.0974, "train_tokens_per_second": 5653.748 }, { "epoch": 1.9236466469162403, "grad_norm": 0.8230343694103864, "learning_rate": 3.5981563407389007e-08, "loss": 0.3213151454925537, "num_input_tokens_seen": 1249559176, "step": 28570, "train_runtime": 221018.9022, "train_tokens_per_second": 5653.63 }, { "epoch": 1.9239833019122003, "grad_norm": 0.8032414208109102, "learning_rate": 3.566562010367536e-08, "loss": 0.2826304197311401, "num_input_tokens_seen": 1249766312, "step": 28575, "train_runtime": 221051.4492, "train_tokens_per_second": 5653.735 }, { "epoch": 1.9243199569081604, "grad_norm": 0.6984009548103529, "learning_rate": 3.535106506024011e-08, "loss": 0.2978407621383667, "num_input_tokens_seen": 1249983696, "step": 28580, "train_runtime": 221088.9385, "train_tokens_per_second": 5653.76 }, { "epoch": 1.9246566119041206, "grad_norm": 0.7453143461192999, "learning_rate": 3.5037898365049005e-08, "loss": 0.2644341230392456, "num_input_tokens_seen": 1250204168, "step": 28585, "train_runtime": 221131.5643, "train_tokens_per_second": 5653.667 }, { "epoch": 1.9249932669000809, "grad_norm": 0.8872235907895941, "learning_rate": 3.472612010567755e-08, "loss": 0.29390702247619627, "num_input_tokens_seen": 1250412232, "step": 28590, "train_runtime": 221167.7612, "train_tokens_per_second": 5653.682 }, { "epoch": 1.925329921896041, "grad_norm": 0.7629679742085492, "learning_rate": 3.441573036931323e-08, "loss": 0.3093965291976929, "num_input_tokens_seen": 1250638880, "step": 28595, "train_runtime": 221205.5961, "train_tokens_per_second": 5653.74 }, { "epoch": 1.925666576892001, "grad_norm": 0.9764963685352374, "learning_rate": 3.410672924275604e-08, "loss": 0.273404598236084, "num_input_tokens_seen": 1250870096, "step": 28600, "train_runtime": 221249.308, "train_tokens_per_second": 5653.668 }, { "epoch": 1.9260032318879612, "grad_norm": 0.8128740784863975, "learning_rate": 3.3799116812416876e-08, "loss": 0.3114511489868164, "num_input_tokens_seen": 1251082376, "step": 28605, "train_runtime": 221285.4439, "train_tokens_per_second": 5653.704 }, { "epoch": 1.9263398868839214, "grad_norm": 0.8683827269674369, "learning_rate": 3.349289316431803e-08, "loss": 0.31067667007446287, "num_input_tokens_seen": 1251307384, "step": 28610, "train_runtime": 221322.0142, "train_tokens_per_second": 5653.786 }, { "epoch": 1.9266765418798815, "grad_norm": 0.7478140934985664, "learning_rate": 3.3188058384095446e-08, "loss": 0.29280407428741456, "num_input_tokens_seen": 1251525400, "step": 28615, "train_runtime": 221360.0032, "train_tokens_per_second": 5653.801 }, { "epoch": 1.9270131968758415, "grad_norm": 0.8025594638672747, "learning_rate": 3.2884612556993714e-08, "loss": 0.32468104362487793, "num_input_tokens_seen": 1251744936, "step": 28620, "train_runtime": 221403.9081, "train_tokens_per_second": 5653.671 }, { "epoch": 1.9273498518718017, "grad_norm": 0.8491439802692531, "learning_rate": 3.258255576787161e-08, "loss": 0.3124075174331665, "num_input_tokens_seen": 1251958328, "step": 28625, "train_runtime": 221443.8187, "train_tokens_per_second": 5653.616 }, { "epoch": 1.927686506867762, "grad_norm": 0.8546654392090276, "learning_rate": 3.22818881011977e-08, "loss": 0.31823225021362306, "num_input_tokens_seen": 1252192752, "step": 28630, "train_runtime": 221481.8825, "train_tokens_per_second": 5653.703 }, { "epoch": 1.928023161863722, "grad_norm": 0.7973579543913553, "learning_rate": 3.198260964105249e-08, "loss": 0.27967541217803954, "num_input_tokens_seen": 1252407792, "step": 28635, "train_runtime": 221519.1612, "train_tokens_per_second": 5653.722 }, { "epoch": 1.928359816859682, "grad_norm": 0.7954284380902052, "learning_rate": 3.168472047112903e-08, "loss": 0.2996687412261963, "num_input_tokens_seen": 1252623280, "step": 28640, "train_runtime": 221566.1063, "train_tokens_per_second": 5653.497 }, { "epoch": 1.9286964718556423, "grad_norm": 0.7984207095399551, "learning_rate": 3.138822067473068e-08, "loss": 0.28585450649261473, "num_input_tokens_seen": 1252835408, "step": 28645, "train_runtime": 221604.288, "train_tokens_per_second": 5653.48 }, { "epoch": 1.9290331268516026, "grad_norm": 0.7748173909126452, "learning_rate": 3.10931103347728e-08, "loss": 0.30099103450775144, "num_input_tokens_seen": 1253057512, "step": 28650, "train_runtime": 221646.7214, "train_tokens_per_second": 5653.4 }, { "epoch": 1.9293697818475626, "grad_norm": 0.7586349259346754, "learning_rate": 3.0799389533781587e-08, "loss": 0.3233338356018066, "num_input_tokens_seen": 1253285920, "step": 28655, "train_runtime": 221683.9501, "train_tokens_per_second": 5653.481 }, { "epoch": 1.9297064368435226, "grad_norm": 0.7596388594233524, "learning_rate": 3.050705835389578e-08, "loss": 0.28039982318878176, "num_input_tokens_seen": 1253502504, "step": 28660, "train_runtime": 221722.1476, "train_tokens_per_second": 5653.484 }, { "epoch": 1.9300430918394829, "grad_norm": 0.8761598764006204, "learning_rate": 3.021611687686443e-08, "loss": 0.2949859380722046, "num_input_tokens_seen": 1253714448, "step": 28665, "train_runtime": 221759.6137, "train_tokens_per_second": 5653.484 }, { "epoch": 1.9303797468354431, "grad_norm": 0.8219444240328218, "learning_rate": 2.992656518404857e-08, "loss": 0.3135673999786377, "num_input_tokens_seen": 1253921528, "step": 28670, "train_runtime": 221798.9051, "train_tokens_per_second": 5653.416 }, { "epoch": 1.9307164018314031, "grad_norm": 0.661270135482443, "learning_rate": 2.96384033564201e-08, "loss": 0.28868966102600097, "num_input_tokens_seen": 1254137480, "step": 28675, "train_runtime": 221835.7558, "train_tokens_per_second": 5653.451 }, { "epoch": 1.9310530568273632, "grad_norm": 0.767415898484409, "learning_rate": 2.935163147456288e-08, "loss": 0.27773294448852537, "num_input_tokens_seen": 1254360912, "step": 28680, "train_runtime": 221876.4785, "train_tokens_per_second": 5653.42 }, { "epoch": 1.9313897118233234, "grad_norm": 0.8423049211038874, "learning_rate": 2.906624961867166e-08, "loss": 0.3049351215362549, "num_input_tokens_seen": 1254581976, "step": 28685, "train_runtime": 221913.3786, "train_tokens_per_second": 5653.476 }, { "epoch": 1.9317263668192837, "grad_norm": 0.8039083333559773, "learning_rate": 2.8782257868553154e-08, "loss": 0.2789355754852295, "num_input_tokens_seen": 1254798040, "step": 28690, "train_runtime": 221950.8121, "train_tokens_per_second": 5653.496 }, { "epoch": 1.9320630218152437, "grad_norm": 0.7939203667614896, "learning_rate": 2.849965630362328e-08, "loss": 0.2943142890930176, "num_input_tokens_seen": 1255008552, "step": 28695, "train_runtime": 221991.6931, "train_tokens_per_second": 5653.403 }, { "epoch": 1.9323996768112037, "grad_norm": 1.040825902674123, "learning_rate": 2.8218445002912153e-08, "loss": 0.2914332389831543, "num_input_tokens_seen": 1255234552, "step": 28700, "train_runtime": 222032.4922, "train_tokens_per_second": 5653.382 }, { "epoch": 1.932736331807164, "grad_norm": 0.7879730035255785, "learning_rate": 2.7938624045059094e-08, "loss": 0.2954190731048584, "num_input_tokens_seen": 1255459816, "step": 28705, "train_runtime": 222067.1659, "train_tokens_per_second": 5653.514 }, { "epoch": 1.9330729868031242, "grad_norm": 0.8446326753294154, "learning_rate": 2.766019350831428e-08, "loss": 0.3093540668487549, "num_input_tokens_seen": 1255699664, "step": 28710, "train_runtime": 222106.7303, "train_tokens_per_second": 5653.587 }, { "epoch": 1.9334096417990843, "grad_norm": 0.7880511342051334, "learning_rate": 2.7383153470541546e-08, "loss": 0.3093677282333374, "num_input_tokens_seen": 1255930096, "step": 28715, "train_runtime": 222139.5127, "train_tokens_per_second": 5653.79 }, { "epoch": 1.9337462967950443, "grad_norm": 0.7912632326756309, "learning_rate": 2.710750400921336e-08, "loss": 0.2810804843902588, "num_input_tokens_seen": 1256129960, "step": 28720, "train_runtime": 222179.3382, "train_tokens_per_second": 5653.676 }, { "epoch": 1.9340829517910045, "grad_norm": 0.7097484635650013, "learning_rate": 2.683324520141417e-08, "loss": 0.29244356155395507, "num_input_tokens_seen": 1256355072, "step": 28725, "train_runtime": 222220.9674, "train_tokens_per_second": 5653.63 }, { "epoch": 1.9344196067869648, "grad_norm": 0.8119430664301859, "learning_rate": 2.65603771238393e-08, "loss": 0.3020967483520508, "num_input_tokens_seen": 1256563176, "step": 28730, "train_runtime": 222266.5769, "train_tokens_per_second": 5653.406 }, { "epoch": 1.9347562617829248, "grad_norm": 0.7459006681748622, "learning_rate": 2.6288899852796036e-08, "loss": 0.2978071689605713, "num_input_tokens_seen": 1256797928, "step": 28735, "train_runtime": 222306.2836, "train_tokens_per_second": 5653.452 }, { "epoch": 1.9350929167788848, "grad_norm": 0.8087885741576003, "learning_rate": 2.6018813464202543e-08, "loss": 0.302975058555603, "num_input_tokens_seen": 1257009296, "step": 28740, "train_runtime": 222341.5433, "train_tokens_per_second": 5653.506 }, { "epoch": 1.935429571774845, "grad_norm": 0.727456579862242, "learning_rate": 2.575011803358618e-08, "loss": 0.29305691719055177, "num_input_tokens_seen": 1257233712, "step": 28745, "train_runtime": 222380.0158, "train_tokens_per_second": 5653.537 }, { "epoch": 1.9357662267708053, "grad_norm": 0.6572939384489086, "learning_rate": 2.5482813636087955e-08, "loss": 0.27554895877838137, "num_input_tokens_seen": 1257442168, "step": 28750, "train_runtime": 222423.441, "train_tokens_per_second": 5653.371 }, { "epoch": 1.9361028817667654, "grad_norm": 0.7993380569308158, "learning_rate": 2.5216900346458073e-08, "loss": 0.2871532678604126, "num_input_tokens_seen": 1257660464, "step": 28755, "train_runtime": 222466.1845, "train_tokens_per_second": 5653.266 }, { "epoch": 1.9364395367627254, "grad_norm": 0.766816269617841, "learning_rate": 2.4952378239058716e-08, "loss": 0.29356064796447756, "num_input_tokens_seen": 1257889496, "step": 28760, "train_runtime": 222499.466, "train_tokens_per_second": 5653.45 }, { "epoch": 1.9367761917586857, "grad_norm": 0.7954103166328962, "learning_rate": 2.4689247387862934e-08, "loss": 0.2963290214538574, "num_input_tokens_seen": 1258103416, "step": 28765, "train_runtime": 222532.7425, "train_tokens_per_second": 5653.565 }, { "epoch": 1.937112846754646, "grad_norm": 0.7997832806288906, "learning_rate": 2.4427507866453537e-08, "loss": 0.28399271965026857, "num_input_tokens_seen": 1258294944, "step": 28770, "train_runtime": 222573.7553, "train_tokens_per_second": 5653.384 }, { "epoch": 1.937449501750606, "grad_norm": 0.885443863513371, "learning_rate": 2.416715974802586e-08, "loss": 0.2864212989807129, "num_input_tokens_seen": 1258505472, "step": 28775, "train_runtime": 222608.5067, "train_tokens_per_second": 5653.447 }, { "epoch": 1.937786156746566, "grad_norm": 0.7164017486860768, "learning_rate": 2.3908203105384997e-08, "loss": 0.30834760665893557, "num_input_tokens_seen": 1258727136, "step": 28780, "train_runtime": 222642.3336, "train_tokens_per_second": 5653.584 }, { "epoch": 1.9381228117425262, "grad_norm": 0.7587198432537924, "learning_rate": 2.365063801094747e-08, "loss": 0.2865851402282715, "num_input_tokens_seen": 1258942528, "step": 28785, "train_runtime": 222676.6074, "train_tokens_per_second": 5653.681 }, { "epoch": 1.9384594667384865, "grad_norm": 0.706256825592826, "learning_rate": 2.3394464536740658e-08, "loss": 0.30954954624176023, "num_input_tokens_seen": 1259175632, "step": 28790, "train_runtime": 222718.1525, "train_tokens_per_second": 5653.673 }, { "epoch": 1.9387961217344465, "grad_norm": 0.8885250264575596, "learning_rate": 2.3139682754402816e-08, "loss": 0.3149877548217773, "num_input_tokens_seen": 1259405216, "step": 28795, "train_runtime": 222755.681, "train_tokens_per_second": 5653.751 }, { "epoch": 1.9391327767304065, "grad_norm": 0.7626354653879915, "learning_rate": 2.2886292735182502e-08, "loss": 0.2907993316650391, "num_input_tokens_seen": 1259637856, "step": 28800, "train_runtime": 222792.0279, "train_tokens_per_second": 5653.873 }, { "epoch": 1.9394694317263668, "grad_norm": 0.7549952496575574, "learning_rate": 2.2634294549939705e-08, "loss": 0.2934614896774292, "num_input_tokens_seen": 1259866088, "step": 28805, "train_runtime": 222833.3252, "train_tokens_per_second": 5653.85 }, { "epoch": 1.939806086722327, "grad_norm": 0.7716438013359953, "learning_rate": 2.2383688269144723e-08, "loss": 0.3583078145980835, "num_input_tokens_seen": 1260088088, "step": 28810, "train_runtime": 222873.4346, "train_tokens_per_second": 5653.828 }, { "epoch": 1.940142741718287, "grad_norm": 0.7760006769888061, "learning_rate": 2.2134473962878712e-08, "loss": 0.2929667949676514, "num_input_tokens_seen": 1260302240, "step": 28815, "train_runtime": 222909.5666, "train_tokens_per_second": 5653.872 }, { "epoch": 1.940479396714247, "grad_norm": 0.9788787208283655, "learning_rate": 2.1886651700833705e-08, "loss": 0.28723697662353515, "num_input_tokens_seen": 1260489696, "step": 28820, "train_runtime": 222944.9358, "train_tokens_per_second": 5653.816 }, { "epoch": 1.9408160517102075, "grad_norm": 0.6725253717418324, "learning_rate": 2.1640221552312603e-08, "loss": 0.3041691780090332, "num_input_tokens_seen": 1260707328, "step": 28825, "train_runtime": 222983.6272, "train_tokens_per_second": 5653.811 }, { "epoch": 1.9411527067061676, "grad_norm": 1.0073697163500734, "learning_rate": 2.1395183586229163e-08, "loss": 0.30638680458068845, "num_input_tokens_seen": 1260942368, "step": 28830, "train_runtime": 223022.3981, "train_tokens_per_second": 5653.882 }, { "epoch": 1.9414893617021276, "grad_norm": 0.7599893500344853, "learning_rate": 2.1151537871106353e-08, "loss": 0.28965296745300295, "num_input_tokens_seen": 1261152728, "step": 28835, "train_runtime": 223058.9354, "train_tokens_per_second": 5653.899 }, { "epoch": 1.9418260166980879, "grad_norm": 0.7939541327760055, "learning_rate": 2.0909284475080226e-08, "loss": 0.285279655456543, "num_input_tokens_seen": 1261373808, "step": 28840, "train_runtime": 223107.3758, "train_tokens_per_second": 5653.663 }, { "epoch": 1.942162671694048, "grad_norm": 0.8217446318942616, "learning_rate": 2.0668423465894928e-08, "loss": 0.2754975318908691, "num_input_tokens_seen": 1261592168, "step": 28845, "train_runtime": 223148.9614, "train_tokens_per_second": 5653.587 }, { "epoch": 1.9424993266900081, "grad_norm": 0.7874416991261182, "learning_rate": 2.0428954910907684e-08, "loss": 0.28652522563934324, "num_input_tokens_seen": 1261787104, "step": 28850, "train_runtime": 223186.7342, "train_tokens_per_second": 5653.504 }, { "epoch": 1.9428359816859682, "grad_norm": 0.8264865579012179, "learning_rate": 2.019087887708382e-08, "loss": 0.3006443977355957, "num_input_tokens_seen": 1262007728, "step": 28855, "train_runtime": 223227.7335, "train_tokens_per_second": 5653.454 }, { "epoch": 1.9431726366819284, "grad_norm": 0.7815316131606884, "learning_rate": 1.9954195431001744e-08, "loss": 0.29778175354003905, "num_input_tokens_seen": 1262233872, "step": 28860, "train_runtime": 223262.3109, "train_tokens_per_second": 5653.591 }, { "epoch": 1.9435092916778887, "grad_norm": 0.7625140991861158, "learning_rate": 1.9718904638848513e-08, "loss": 0.2813864231109619, "num_input_tokens_seen": 1262445256, "step": 28865, "train_runtime": 223305.0134, "train_tokens_per_second": 5653.457 }, { "epoch": 1.9438459466738487, "grad_norm": 0.819180819579518, "learning_rate": 1.9485006566422602e-08, "loss": 0.2955453395843506, "num_input_tokens_seen": 1262680216, "step": 28870, "train_runtime": 223347.1343, "train_tokens_per_second": 5653.443 }, { "epoch": 1.9441826016698087, "grad_norm": 0.7141341923837556, "learning_rate": 1.9252501279132806e-08, "loss": 0.3031654357910156, "num_input_tokens_seen": 1262895920, "step": 28875, "train_runtime": 223391.4022, "train_tokens_per_second": 5653.288 }, { "epoch": 1.944519256665769, "grad_norm": 0.7599819750131713, "learning_rate": 1.902138884199878e-08, "loss": 0.2994793176651001, "num_input_tokens_seen": 1263122360, "step": 28880, "train_runtime": 223427.1868, "train_tokens_per_second": 5653.396 }, { "epoch": 1.9448559116617292, "grad_norm": 0.7754812262214777, "learning_rate": 1.879166931964993e-08, "loss": 0.30690946578979494, "num_input_tokens_seen": 1263337688, "step": 28885, "train_runtime": 223467.6117, "train_tokens_per_second": 5653.337 }, { "epoch": 1.9451925666576892, "grad_norm": 0.7766593010208253, "learning_rate": 1.856334277632765e-08, "loss": 0.29476094245910645, "num_input_tokens_seen": 1263574904, "step": 28890, "train_runtime": 223506.8009, "train_tokens_per_second": 5653.407 }, { "epoch": 1.9455292216536493, "grad_norm": 0.6831350388874682, "learning_rate": 1.8336409275880872e-08, "loss": 0.3002762794494629, "num_input_tokens_seen": 1263807760, "step": 28895, "train_runtime": 223552.6379, "train_tokens_per_second": 5653.289 }, { "epoch": 1.9458658766496095, "grad_norm": 0.7320234419132584, "learning_rate": 1.8110868881772713e-08, "loss": 0.2916655302047729, "num_input_tokens_seen": 1264016568, "step": 28900, "train_runtime": 223592.718, "train_tokens_per_second": 5653.21 }, { "epoch": 1.9462025316455698, "grad_norm": 0.7177337064879638, "learning_rate": 1.788672165707328e-08, "loss": 0.2689183712005615, "num_input_tokens_seen": 1264236144, "step": 28905, "train_runtime": 223637.4105, "train_tokens_per_second": 5653.062 }, { "epoch": 1.9465391866415298, "grad_norm": 0.7335996504510445, "learning_rate": 1.7663967664465763e-08, "loss": 0.2718139886856079, "num_input_tokens_seen": 1264443160, "step": 28910, "train_runtime": 223677.4438, "train_tokens_per_second": 5652.976 }, { "epoch": 1.9468758416374898, "grad_norm": 0.7751823359014647, "learning_rate": 1.7442606966242005e-08, "loss": 0.3149592399597168, "num_input_tokens_seen": 1264681216, "step": 28915, "train_runtime": 223720.453, "train_tokens_per_second": 5652.953 }, { "epoch": 1.94721249663345, "grad_norm": 0.7519570365655589, "learning_rate": 1.722263962430526e-08, "loss": 0.3035134315490723, "num_input_tokens_seen": 1264904128, "step": 28920, "train_runtime": 223755.8381, "train_tokens_per_second": 5653.055 }, { "epoch": 1.9475491516294103, "grad_norm": 0.828398864844539, "learning_rate": 1.7004065700168547e-08, "loss": 0.28637185096740725, "num_input_tokens_seen": 1265126560, "step": 28925, "train_runtime": 223788.0098, "train_tokens_per_second": 5653.237 }, { "epoch": 1.9478858066253704, "grad_norm": 0.700009166031884, "learning_rate": 1.6786885254954644e-08, "loss": 0.3050400733947754, "num_input_tokens_seen": 1265361040, "step": 28930, "train_runtime": 223824.3291, "train_tokens_per_second": 5653.367 }, { "epoch": 1.9482224616213304, "grad_norm": 0.8369964157697908, "learning_rate": 1.6571098349398296e-08, "loss": 0.2956183910369873, "num_input_tokens_seen": 1265565976, "step": 28935, "train_runtime": 223863.4274, "train_tokens_per_second": 5653.295 }, { "epoch": 1.9485591166172906, "grad_norm": 0.8754073900671024, "learning_rate": 1.635670504384346e-08, "loss": 0.31615753173828126, "num_input_tokens_seen": 1265765816, "step": 28940, "train_runtime": 223908.9438, "train_tokens_per_second": 5653.038 }, { "epoch": 1.948895771613251, "grad_norm": 0.941511353921259, "learning_rate": 1.6143705398243837e-08, "loss": 0.29006495475769045, "num_input_tokens_seen": 1265969312, "step": 28945, "train_runtime": 223952.0727, "train_tokens_per_second": 5652.858 }, { "epoch": 1.949232426609211, "grad_norm": 0.7913567769706255, "learning_rate": 1.5932099472165674e-08, "loss": 0.29108805656433107, "num_input_tokens_seen": 1266179488, "step": 28950, "train_runtime": 223990.7097, "train_tokens_per_second": 5652.821 }, { "epoch": 1.949569081605171, "grad_norm": 0.7310227670184213, "learning_rate": 1.572188732478164e-08, "loss": 0.2916900157928467, "num_input_tokens_seen": 1266409776, "step": 28955, "train_runtime": 224030.8188, "train_tokens_per_second": 5652.837 }, { "epoch": 1.9499057366011312, "grad_norm": 0.7938589935789288, "learning_rate": 1.551306901487859e-08, "loss": 0.3035112857818604, "num_input_tokens_seen": 1266624136, "step": 28960, "train_runtime": 224074.3669, "train_tokens_per_second": 5652.695 }, { "epoch": 1.9502423915970915, "grad_norm": 0.6920718267717534, "learning_rate": 1.5305644600852043e-08, "loss": 0.2758214473724365, "num_input_tokens_seen": 1266855056, "step": 28965, "train_runtime": 224114.5981, "train_tokens_per_second": 5652.711 }, { "epoch": 1.9505790465930515, "grad_norm": 0.7554921758498927, "learning_rate": 1.5099614140706154e-08, "loss": 0.2854607105255127, "num_input_tokens_seen": 1267072344, "step": 28970, "train_runtime": 224158.7838, "train_tokens_per_second": 5652.566 }, { "epoch": 1.9509157015890115, "grad_norm": 0.8000972769551457, "learning_rate": 1.489497769205761e-08, "loss": 0.31021819114685056, "num_input_tokens_seen": 1267277496, "step": 28975, "train_runtime": 224199.1913, "train_tokens_per_second": 5652.462 }, { "epoch": 1.9512523565849718, "grad_norm": 0.7228114152004868, "learning_rate": 1.4691735312132304e-08, "loss": 0.2921774864196777, "num_input_tokens_seen": 1267506744, "step": 28980, "train_runtime": 224237.6676, "train_tokens_per_second": 5652.515 }, { "epoch": 1.951589011580932, "grad_norm": 0.7982672860216988, "learning_rate": 1.4489887057766439e-08, "loss": 0.30820393562316895, "num_input_tokens_seen": 1267724224, "step": 28985, "train_runtime": 224272.862, "train_tokens_per_second": 5652.598 }, { "epoch": 1.951925666576892, "grad_norm": 0.7019172612562962, "learning_rate": 1.428943298540597e-08, "loss": 0.29095611572265623, "num_input_tokens_seen": 1267950120, "step": 28990, "train_runtime": 224309.6136, "train_tokens_per_second": 5652.678 }, { "epoch": 1.952262321572852, "grad_norm": 0.6605820071712591, "learning_rate": 1.4090373151107173e-08, "loss": 0.3069890022277832, "num_input_tokens_seen": 1268176376, "step": 28995, "train_runtime": 224342.3845, "train_tokens_per_second": 5652.861 }, { "epoch": 1.9525989765688123, "grad_norm": 0.7607077702464043, "learning_rate": 1.3892707610536627e-08, "loss": 0.2565622329711914, "num_input_tokens_seen": 1268384472, "step": 29000, "train_runtime": 224386.5442, "train_tokens_per_second": 5652.676 }, { "epoch": 1.9529356315647726, "grad_norm": 0.806764475508148, "learning_rate": 1.3696436418970672e-08, "loss": 0.2830059051513672, "num_input_tokens_seen": 1268601536, "step": 29005, "train_runtime": 224428.0534, "train_tokens_per_second": 5652.598 }, { "epoch": 1.9532722865607326, "grad_norm": 0.8503139141015114, "learning_rate": 1.3501559631296512e-08, "loss": 0.31444830894470216, "num_input_tokens_seen": 1268805592, "step": 29010, "train_runtime": 224471.139, "train_tokens_per_second": 5652.422 }, { "epoch": 1.9536089415566926, "grad_norm": 0.7710744016084916, "learning_rate": 1.3308077302010557e-08, "loss": 0.31547060012817385, "num_input_tokens_seen": 1269039096, "step": 29015, "train_runtime": 224509.2303, "train_tokens_per_second": 5652.503 }, { "epoch": 1.9539455965526529, "grad_norm": 0.8026179441993274, "learning_rate": 1.3115989485218972e-08, "loss": 0.2989495754241943, "num_input_tokens_seen": 1269246368, "step": 29020, "train_runtime": 224543.5644, "train_tokens_per_second": 5652.562 }, { "epoch": 1.9542822515486131, "grad_norm": 0.805001102582023, "learning_rate": 1.2925296234638784e-08, "loss": 0.2807016849517822, "num_input_tokens_seen": 1269464104, "step": 29025, "train_runtime": 224584.5623, "train_tokens_per_second": 5652.499 }, { "epoch": 1.9546189065445732, "grad_norm": 0.6954871573935902, "learning_rate": 1.2735997603597339e-08, "loss": 0.29611780643463137, "num_input_tokens_seen": 1269699728, "step": 29030, "train_runtime": 224616.5365, "train_tokens_per_second": 5652.744 }, { "epoch": 1.9549555615405332, "grad_norm": 0.857067719947332, "learning_rate": 1.2548093645030623e-08, "loss": 0.2928828001022339, "num_input_tokens_seen": 1269928480, "step": 29035, "train_runtime": 224656.3805, "train_tokens_per_second": 5652.759 }, { "epoch": 1.9552922165364934, "grad_norm": 0.7481342627141493, "learning_rate": 1.236158441148605e-08, "loss": 0.28606395721435546, "num_input_tokens_seen": 1270155816, "step": 29040, "train_runtime": 224692.812, "train_tokens_per_second": 5652.855 }, { "epoch": 1.9556288715324537, "grad_norm": 0.8112388374034099, "learning_rate": 1.2176469955119119e-08, "loss": 0.32508511543273927, "num_input_tokens_seen": 1270385632, "step": 29045, "train_runtime": 224733.026, "train_tokens_per_second": 5652.866 }, { "epoch": 1.9559655265284137, "grad_norm": 0.8038650607300725, "learning_rate": 1.199275032769842e-08, "loss": 0.3148582696914673, "num_input_tokens_seen": 1270610312, "step": 29050, "train_runtime": 224776.4013, "train_tokens_per_second": 5652.775 }, { "epoch": 1.9563021815243737, "grad_norm": 0.8038054887828693, "learning_rate": 1.1810425580598971e-08, "loss": 0.32245888710021975, "num_input_tokens_seen": 1270844152, "step": 29055, "train_runtime": 224817.2922, "train_tokens_per_second": 5652.786 }, { "epoch": 1.956638836520334, "grad_norm": 0.8285772488267888, "learning_rate": 1.1629495764807763e-08, "loss": 0.29970650672912597, "num_input_tokens_seen": 1271079472, "step": 29060, "train_runtime": 224861.1966, "train_tokens_per_second": 5652.729 }, { "epoch": 1.9569754915162942, "grad_norm": 0.7500252998485927, "learning_rate": 1.1449960930921544e-08, "loss": 0.29777934551239016, "num_input_tokens_seen": 1271292624, "step": 29065, "train_runtime": 224898.4968, "train_tokens_per_second": 5652.74 }, { "epoch": 1.9573121465122543, "grad_norm": 0.7492263033388418, "learning_rate": 1.1271821129146266e-08, "loss": 0.28283419609069826, "num_input_tokens_seen": 1271514960, "step": 29070, "train_runtime": 224932.5444, "train_tokens_per_second": 5652.872 }, { "epoch": 1.9576488015082143, "grad_norm": 0.794721710026827, "learning_rate": 1.1095076409298189e-08, "loss": 0.28227386474609373, "num_input_tokens_seen": 1271727712, "step": 29075, "train_runtime": 224970.8077, "train_tokens_per_second": 5652.857 }, { "epoch": 1.9579854565041745, "grad_norm": 0.8361082033343284, "learning_rate": 1.0919726820803889e-08, "loss": 0.2864542484283447, "num_input_tokens_seen": 1271937480, "step": 29080, "train_runtime": 225007.7296, "train_tokens_per_second": 5652.861 }, { "epoch": 1.9583221115001348, "grad_norm": 0.7529640945800179, "learning_rate": 1.0745772412698585e-08, "loss": 0.2920374870300293, "num_input_tokens_seen": 1272150888, "step": 29085, "train_runtime": 225047.2154, "train_tokens_per_second": 5652.818 }, { "epoch": 1.9586587664960948, "grad_norm": 0.7725658212667705, "learning_rate": 1.057321323362892e-08, "loss": 0.28984389305114744, "num_input_tokens_seen": 1272385000, "step": 29090, "train_runtime": 225088.6801, "train_tokens_per_second": 5652.816 }, { "epoch": 1.9589954214920549, "grad_norm": 0.7321569817209439, "learning_rate": 1.0402049331849629e-08, "loss": 0.2945473432540894, "num_input_tokens_seen": 1272608520, "step": 29095, "train_runtime": 225120.0817, "train_tokens_per_second": 5653.021 }, { "epoch": 1.959332076488015, "grad_norm": 0.7684463547894764, "learning_rate": 1.0232280755226865e-08, "loss": 0.30609171390533446, "num_input_tokens_seen": 1272824152, "step": 29100, "train_runtime": 225164.1788, "train_tokens_per_second": 5652.871 }, { "epoch": 1.9596687314839754, "grad_norm": 0.6970891800486236, "learning_rate": 1.006390755123543e-08, "loss": 0.2889437675476074, "num_input_tokens_seen": 1273039232, "step": 29105, "train_runtime": 225204.746, "train_tokens_per_second": 5652.808 }, { "epoch": 1.9600053864799354, "grad_norm": 0.8951268014858879, "learning_rate": 9.89692976696044e-09, "loss": 0.3118439674377441, "num_input_tokens_seen": 1273253968, "step": 29110, "train_runtime": 225250.2013, "train_tokens_per_second": 5652.621 }, { "epoch": 1.9603420414758954, "grad_norm": 0.7116868073327594, "learning_rate": 9.731347449097316e-09, "loss": 0.31283159255981446, "num_input_tokens_seen": 1273474224, "step": 29115, "train_runtime": 225292.9511, "train_tokens_per_second": 5652.526 }, { "epoch": 1.9606786964718557, "grad_norm": 0.7624467705283283, "learning_rate": 9.56716064394958e-09, "loss": 0.30971055030822753, "num_input_tokens_seen": 1273701776, "step": 29120, "train_runtime": 225324.6547, "train_tokens_per_second": 5652.74 }, { "epoch": 1.961015351467816, "grad_norm": 0.8807522971861178, "learning_rate": 9.404369397432166e-09, "loss": 0.287065315246582, "num_input_tokens_seen": 1273920400, "step": 29125, "train_runtime": 225360.8369, "train_tokens_per_second": 5652.803 }, { "epoch": 1.961352006463776, "grad_norm": 0.766183012473875, "learning_rate": 9.242973755068663e-09, "loss": 0.2945993900299072, "num_input_tokens_seen": 1274143544, "step": 29130, "train_runtime": 225396.198, "train_tokens_per_second": 5652.906 }, { "epoch": 1.961688661459736, "grad_norm": 0.8619210725642108, "learning_rate": 9.082973761993518e-09, "loss": 0.2969123363494873, "num_input_tokens_seen": 1274356376, "step": 29135, "train_runtime": 225437.914, "train_tokens_per_second": 5652.804 }, { "epoch": 1.9620253164556962, "grad_norm": 0.878826623744484, "learning_rate": 8.924369462949834e-09, "loss": 0.3293659448623657, "num_input_tokens_seen": 1274559280, "step": 29140, "train_runtime": 225478.4148, "train_tokens_per_second": 5652.689 }, { "epoch": 1.9623619714516565, "grad_norm": 0.795997521175958, "learning_rate": 8.767160902291016e-09, "loss": 0.2915841817855835, "num_input_tokens_seen": 1274776792, "step": 29145, "train_runtime": 225514.841, "train_tokens_per_second": 5652.74 }, { "epoch": 1.9626986264476165, "grad_norm": 0.7676235515949815, "learning_rate": 8.61134812397968e-09, "loss": 0.30088181495666505, "num_input_tokens_seen": 1274996960, "step": 29150, "train_runtime": 225551.2935, "train_tokens_per_second": 5652.803 }, { "epoch": 1.9630352814435765, "grad_norm": 0.7939420108805821, "learning_rate": 8.45693117158819e-09, "loss": 0.2771022796630859, "num_input_tokens_seen": 1275203528, "step": 29155, "train_runtime": 225587.6966, "train_tokens_per_second": 5652.806 }, { "epoch": 1.9633719364395368, "grad_norm": 0.8267377385515322, "learning_rate": 8.303910088299228e-09, "loss": 0.2890202045440674, "num_input_tokens_seen": 1275420104, "step": 29160, "train_runtime": 225627.9039, "train_tokens_per_second": 5652.759 }, { "epoch": 1.963708591435497, "grad_norm": 0.7872969059306067, "learning_rate": 8.152284916904674e-09, "loss": 0.297850513458252, "num_input_tokens_seen": 1275648864, "step": 29165, "train_runtime": 225665.3758, "train_tokens_per_second": 5652.834 }, { "epoch": 1.964045246431457, "grad_norm": 0.7526544096353636, "learning_rate": 8.002055699805612e-09, "loss": 0.2845508098602295, "num_input_tokens_seen": 1275859328, "step": 29170, "train_runtime": 225711.406, "train_tokens_per_second": 5652.613 }, { "epoch": 1.964381901427417, "grad_norm": 0.7307972307788215, "learning_rate": 7.853222479013434e-09, "loss": 0.28490164279937746, "num_input_tokens_seen": 1276098304, "step": 29175, "train_runtime": 225747.3603, "train_tokens_per_second": 5652.772 }, { "epoch": 1.9647185564233773, "grad_norm": 0.7126777979052846, "learning_rate": 7.705785296148737e-09, "loss": 0.29223477840423584, "num_input_tokens_seen": 1276313944, "step": 29180, "train_runtime": 225782.9902, "train_tokens_per_second": 5652.835 }, { "epoch": 1.9650552114193376, "grad_norm": 0.7780760910871221, "learning_rate": 7.55974419244132e-09, "loss": 0.3048643350601196, "num_input_tokens_seen": 1276534976, "step": 29185, "train_runtime": 225815.2561, "train_tokens_per_second": 5653.006 }, { "epoch": 1.9653918664152976, "grad_norm": 0.7124335281108779, "learning_rate": 7.415099208732402e-09, "loss": 0.2795270919799805, "num_input_tokens_seen": 1276756464, "step": 29190, "train_runtime": 225850.916, "train_tokens_per_second": 5653.094 }, { "epoch": 1.9657285214112576, "grad_norm": 0.7090900998979741, "learning_rate": 7.2718503854707355e-09, "loss": 0.3065217971801758, "num_input_tokens_seen": 1276983008, "step": 29195, "train_runtime": 225891.8245, "train_tokens_per_second": 5653.073 }, { "epoch": 1.966065176407218, "grad_norm": 0.8593525853790884, "learning_rate": 7.129997762715391e-09, "loss": 0.26297545433044434, "num_input_tokens_seen": 1277205144, "step": 29200, "train_runtime": 225929.616, "train_tokens_per_second": 5653.111 }, { "epoch": 1.9664018314031781, "grad_norm": 0.8188907230159181, "learning_rate": 6.98954138013519e-09, "loss": 0.2864915132522583, "num_input_tokens_seen": 1277414784, "step": 29205, "train_runtime": 225967.4368, "train_tokens_per_second": 5653.092 }, { "epoch": 1.9667384863991382, "grad_norm": 0.7346378968927514, "learning_rate": 6.850481277008159e-09, "loss": 0.3049713373184204, "num_input_tokens_seen": 1277643008, "step": 29210, "train_runtime": 226014.3298, "train_tokens_per_second": 5652.929 }, { "epoch": 1.9670751413950982, "grad_norm": 0.7674532896602834, "learning_rate": 6.712817492222079e-09, "loss": 0.32462234497070314, "num_input_tokens_seen": 1277862488, "step": 29215, "train_runtime": 226054.1024, "train_tokens_per_second": 5652.906 }, { "epoch": 1.9674117963910585, "grad_norm": 0.6823823423034494, "learning_rate": 6.576550064273934e-09, "loss": 0.29960381984710693, "num_input_tokens_seen": 1278083144, "step": 29220, "train_runtime": 226087.3475, "train_tokens_per_second": 5653.05 }, { "epoch": 1.9677484513870187, "grad_norm": 0.6768114788982357, "learning_rate": 6.44167903127102e-09, "loss": 0.30608859062194826, "num_input_tokens_seen": 1278306920, "step": 29225, "train_runtime": 226128.6262, "train_tokens_per_second": 5653.008 }, { "epoch": 1.9680851063829787, "grad_norm": 0.7867457093292909, "learning_rate": 6.3082044309287215e-09, "loss": 0.2798271656036377, "num_input_tokens_seen": 1278530936, "step": 29230, "train_runtime": 226163.2382, "train_tokens_per_second": 5653.133 }, { "epoch": 1.9684217613789388, "grad_norm": 0.7363218232718188, "learning_rate": 6.176126300573848e-09, "loss": 0.29613399505615234, "num_input_tokens_seen": 1278747232, "step": 29235, "train_runtime": 226204.0451, "train_tokens_per_second": 5653.07 }, { "epoch": 1.968758416374899, "grad_norm": 0.772729635299263, "learning_rate": 6.045444677140744e-09, "loss": 0.28275036811828613, "num_input_tokens_seen": 1278973944, "step": 29240, "train_runtime": 226241.1384, "train_tokens_per_second": 5653.145 }, { "epoch": 1.9690950713708593, "grad_norm": 0.7892151646300906, "learning_rate": 5.91615959717462e-09, "loss": 0.2926478385925293, "num_input_tokens_seen": 1279195664, "step": 29245, "train_runtime": 226280.1718, "train_tokens_per_second": 5653.15 }, { "epoch": 1.9694317263668193, "grad_norm": 0.6905193077369461, "learning_rate": 5.78827109682989e-09, "loss": 0.27014522552490233, "num_input_tokens_seen": 1279416864, "step": 29250, "train_runtime": 226314.3102, "train_tokens_per_second": 5653.274 }, { "epoch": 1.9697683813627793, "grad_norm": 0.7987578510711066, "learning_rate": 5.661779211869056e-09, "loss": 0.2848729848861694, "num_input_tokens_seen": 1279631848, "step": 29255, "train_runtime": 226352.8714, "train_tokens_per_second": 5653.261 }, { "epoch": 1.9701050363587396, "grad_norm": 0.7803335673063395, "learning_rate": 5.536683977666601e-09, "loss": 0.3105973243713379, "num_input_tokens_seen": 1279865120, "step": 29260, "train_runtime": 226385.8852, "train_tokens_per_second": 5653.467 }, { "epoch": 1.9704416913546998, "grad_norm": 0.6890074934726101, "learning_rate": 5.412985429203988e-09, "loss": 0.28957743644714357, "num_input_tokens_seen": 1280078376, "step": 29265, "train_runtime": 226423.2957, "train_tokens_per_second": 5653.475 }, { "epoch": 1.9707783463506598, "grad_norm": 0.7625841866074922, "learning_rate": 5.290683601073543e-09, "loss": 0.2784770965576172, "num_input_tokens_seen": 1280304192, "step": 29270, "train_runtime": 226459.6491, "train_tokens_per_second": 5653.564 }, { "epoch": 1.9711150013466199, "grad_norm": 0.7840668749162247, "learning_rate": 5.169778527476243e-09, "loss": 0.299863862991333, "num_input_tokens_seen": 1280532272, "step": 29275, "train_runtime": 226498.8885, "train_tokens_per_second": 5653.592 }, { "epoch": 1.9714516563425801, "grad_norm": 0.8729160388891067, "learning_rate": 5.050270242222821e-09, "loss": 0.31504406929016116, "num_input_tokens_seen": 1280731456, "step": 29280, "train_runtime": 226536.9074, "train_tokens_per_second": 5653.522 }, { "epoch": 1.9717883113385404, "grad_norm": 0.8134946456239271, "learning_rate": 4.932158778733765e-09, "loss": 0.2948625087738037, "num_input_tokens_seen": 1280954184, "step": 29285, "train_runtime": 226580.571, "train_tokens_per_second": 5653.416 }, { "epoch": 1.9721249663345004, "grad_norm": 0.9015410062046074, "learning_rate": 4.8154441700387636e-09, "loss": 0.3150008201599121, "num_input_tokens_seen": 1281153920, "step": 29290, "train_runtime": 226613.4169, "train_tokens_per_second": 5653.478 }, { "epoch": 1.9724616213304604, "grad_norm": 0.7835120290516451, "learning_rate": 4.7001264487761545e-09, "loss": 0.31816887855529785, "num_input_tokens_seen": 1281377960, "step": 29295, "train_runtime": 226653.002, "train_tokens_per_second": 5653.479 }, { "epoch": 1.9727982763264207, "grad_norm": 0.7177281483739487, "learning_rate": 4.586205647194031e-09, "loss": 0.3077888250350952, "num_input_tokens_seen": 1281598760, "step": 29300, "train_runtime": 226691.7054, "train_tokens_per_second": 5653.488 }, { "epoch": 1.973134931322381, "grad_norm": 0.8554091191816099, "learning_rate": 4.4736817971507974e-09, "loss": 0.3019340991973877, "num_input_tokens_seen": 1281813592, "step": 29305, "train_runtime": 226737.7122, "train_tokens_per_second": 5653.288 }, { "epoch": 1.973471586318341, "grad_norm": 0.7693611386783255, "learning_rate": 4.362554930112395e-09, "loss": 0.30186340808868406, "num_input_tokens_seen": 1282029480, "step": 29310, "train_runtime": 226775.6925, "train_tokens_per_second": 5653.293 }, { "epoch": 1.973808241314301, "grad_norm": 0.7405776360693889, "learning_rate": 4.252825077155631e-09, "loss": 0.2891343593597412, "num_input_tokens_seen": 1282250600, "step": 29315, "train_runtime": 226814.7389, "train_tokens_per_second": 5653.295 }, { "epoch": 1.9741448963102612, "grad_norm": 0.7831694807451932, "learning_rate": 4.1444922689665156e-09, "loss": 0.29642043113708494, "num_input_tokens_seen": 1282463216, "step": 29320, "train_runtime": 226855.4258, "train_tokens_per_second": 5653.218 }, { "epoch": 1.9744815513062215, "grad_norm": 0.8733709826420818, "learning_rate": 4.037556535839149e-09, "loss": 0.2692773103713989, "num_input_tokens_seen": 1282685880, "step": 29325, "train_runtime": 226887.8468, "train_tokens_per_second": 5653.392 }, { "epoch": 1.9748182063021815, "grad_norm": 0.7090978050641338, "learning_rate": 3.932017907677943e-09, "loss": 0.28195557594299314, "num_input_tokens_seen": 1282915496, "step": 29330, "train_runtime": 226931.5302, "train_tokens_per_second": 5653.315 }, { "epoch": 1.9751548612981416, "grad_norm": 0.7330650828079108, "learning_rate": 3.827876413997067e-09, "loss": 0.310672664642334, "num_input_tokens_seen": 1283112440, "step": 29335, "train_runtime": 226962.5074, "train_tokens_per_second": 5653.411 }, { "epoch": 1.9754915162941018, "grad_norm": 0.8645271417610324, "learning_rate": 3.725132083918781e-09, "loss": 0.2937079668045044, "num_input_tokens_seen": 1283319208, "step": 29340, "train_runtime": 227004.0095, "train_tokens_per_second": 5653.289 }, { "epoch": 1.975828171290062, "grad_norm": 0.7553494839592546, "learning_rate": 3.623784946175102e-09, "loss": 0.3103309631347656, "num_input_tokens_seen": 1283519312, "step": 29345, "train_runtime": 227044.1149, "train_tokens_per_second": 5653.171 }, { "epoch": 1.976164826286022, "grad_norm": 0.7711706358606312, "learning_rate": 3.5238350291083577e-09, "loss": 0.28435301780700684, "num_input_tokens_seen": 1283726744, "step": 29350, "train_runtime": 227085.1855, "train_tokens_per_second": 5653.062 }, { "epoch": 1.976501481281982, "grad_norm": 0.7233862194158842, "learning_rate": 3.4252823606678588e-09, "loss": 0.31540963649749754, "num_input_tokens_seen": 1283952928, "step": 29355, "train_runtime": 227118.6155, "train_tokens_per_second": 5653.226 }, { "epoch": 1.9768381362779424, "grad_norm": 0.7946045825578855, "learning_rate": 3.328126968414336e-09, "loss": 0.3130497455596924, "num_input_tokens_seen": 1284147936, "step": 29360, "train_runtime": 227154.485, "train_tokens_per_second": 5653.192 }, { "epoch": 1.9771747912739026, "grad_norm": 0.7860291343433327, "learning_rate": 3.232368879517167e-09, "loss": 0.31641981601715086, "num_input_tokens_seen": 1284366488, "step": 29365, "train_runtime": 227200.0074, "train_tokens_per_second": 5653.021 }, { "epoch": 1.9775114462698626, "grad_norm": 0.7901349246218392, "learning_rate": 3.1380081207543766e-09, "loss": 0.27493464946746826, "num_input_tokens_seen": 1284580288, "step": 29370, "train_runtime": 227236.8347, "train_tokens_per_second": 5653.046 }, { "epoch": 1.9778481012658227, "grad_norm": 0.7901988601043518, "learning_rate": 3.0450447185137454e-09, "loss": 0.300215482711792, "num_input_tokens_seen": 1284790176, "step": 29375, "train_runtime": 227276.5524, "train_tokens_per_second": 5652.982 }, { "epoch": 1.978184756261783, "grad_norm": 0.7905431031827841, "learning_rate": 2.953478698792256e-09, "loss": 0.29309883117675783, "num_input_tokens_seen": 1285019536, "step": 29380, "train_runtime": 227311.7967, "train_tokens_per_second": 5653.114 }, { "epoch": 1.9785214112577432, "grad_norm": 0.8196057690436338, "learning_rate": 2.8633100871960917e-09, "loss": 0.28349852561950684, "num_input_tokens_seen": 1285225968, "step": 29385, "train_runtime": 227354.1237, "train_tokens_per_second": 5652.97 }, { "epoch": 1.9788580662537032, "grad_norm": 0.8115546785952105, "learning_rate": 2.774538908940638e-09, "loss": 0.3020082950592041, "num_input_tokens_seen": 1285433856, "step": 29390, "train_runtime": 227391.991, "train_tokens_per_second": 5652.943 }, { "epoch": 1.9791947212496632, "grad_norm": 0.8333323595696321, "learning_rate": 2.687165188849927e-09, "loss": 0.2933856248855591, "num_input_tokens_seen": 1285662136, "step": 29395, "train_runtime": 227423.7759, "train_tokens_per_second": 5653.156 }, { "epoch": 1.9795313762456235, "grad_norm": 0.7761984521860247, "learning_rate": 2.6011889513588574e-09, "loss": 0.29178383350372317, "num_input_tokens_seen": 1285879472, "step": 29400, "train_runtime": 227461.1494, "train_tokens_per_second": 5653.183 }, { "epoch": 1.9798680312415837, "grad_norm": 0.7709375069582487, "learning_rate": 2.5166102205093077e-09, "loss": 0.31009225845336913, "num_input_tokens_seen": 1286104184, "step": 29405, "train_runtime": 227495.7175, "train_tokens_per_second": 5653.312 }, { "epoch": 1.9802046862375438, "grad_norm": 0.7529670231526651, "learning_rate": 2.4334290199540254e-09, "loss": 0.2966364860534668, "num_input_tokens_seen": 1286326480, "step": 29410, "train_runtime": 227533.9984, "train_tokens_per_second": 5653.337 }, { "epoch": 1.9805413412335038, "grad_norm": 0.7423799860118283, "learning_rate": 2.351645372953848e-09, "loss": 0.27869043350219724, "num_input_tokens_seen": 1286539544, "step": 29415, "train_runtime": 227574.621, "train_tokens_per_second": 5653.265 }, { "epoch": 1.980877996229464, "grad_norm": 0.830934035934882, "learning_rate": 2.2712593023804795e-09, "loss": 0.292054557800293, "num_input_tokens_seen": 1286749296, "step": 29420, "train_runtime": 227603.0505, "train_tokens_per_second": 5653.48 }, { "epoch": 1.9812146512254243, "grad_norm": 0.776340332148109, "learning_rate": 2.1922708307120512e-09, "loss": 0.3023597240447998, "num_input_tokens_seen": 1286966040, "step": 29425, "train_runtime": 227646.316, "train_tokens_per_second": 5653.358 }, { "epoch": 1.9815513062213843, "grad_norm": 0.7541577609267867, "learning_rate": 2.1146799800386698e-09, "loss": 0.3239266872406006, "num_input_tokens_seen": 1287186672, "step": 29430, "train_runtime": 227678.08, "train_tokens_per_second": 5653.538 }, { "epoch": 1.9818879612173443, "grad_norm": 0.8192940550401582, "learning_rate": 2.0384867720579794e-09, "loss": 0.278280234336853, "num_input_tokens_seen": 1287391672, "step": 29435, "train_runtime": 227717.0952, "train_tokens_per_second": 5653.47 }, { "epoch": 1.9822246162133046, "grad_norm": 0.7527540217103025, "learning_rate": 1.96369122807738e-09, "loss": 0.30411410331726074, "num_input_tokens_seen": 1287620424, "step": 29440, "train_runtime": 227752.8072, "train_tokens_per_second": 5653.588 }, { "epoch": 1.9825612712092648, "grad_norm": 0.8768248029758434, "learning_rate": 1.8902933690123637e-09, "loss": 0.2814857721328735, "num_input_tokens_seen": 1287839296, "step": 29445, "train_runtime": 227783.5419, "train_tokens_per_second": 5653.786 }, { "epoch": 1.9828979262052249, "grad_norm": 0.7931820825672209, "learning_rate": 1.8182932153892884e-09, "loss": 0.3011634826660156, "num_input_tokens_seen": 1288057400, "step": 29450, "train_runtime": 227821.3297, "train_tokens_per_second": 5653.805 }, { "epoch": 1.983234581201185, "grad_norm": 0.8278654551866558, "learning_rate": 1.7476907873426041e-09, "loss": 0.29094853401184084, "num_input_tokens_seen": 1288283336, "step": 29455, "train_runtime": 227858.4256, "train_tokens_per_second": 5653.876 }, { "epoch": 1.9835712361971451, "grad_norm": 0.7009932914918141, "learning_rate": 1.6784861046159617e-09, "loss": 0.29619736671447755, "num_input_tokens_seen": 1288507000, "step": 29460, "train_runtime": 227904.983, "train_tokens_per_second": 5653.703 }, { "epoch": 1.9839078911931054, "grad_norm": 0.696357225779694, "learning_rate": 1.610679186561659e-09, "loss": 0.3063995599746704, "num_input_tokens_seen": 1288727264, "step": 29465, "train_runtime": 227944.9622, "train_tokens_per_second": 5653.677 }, { "epoch": 1.9842445461890654, "grad_norm": 0.6754486614043711, "learning_rate": 1.5442700521428599e-09, "loss": 0.2689430952072144, "num_input_tokens_seen": 1288937368, "step": 29470, "train_runtime": 227983.4782, "train_tokens_per_second": 5653.644 }, { "epoch": 1.9845812011850255, "grad_norm": 0.7807038119601082, "learning_rate": 1.4792587199297103e-09, "loss": 0.29396581649780273, "num_input_tokens_seen": 1289161136, "step": 29475, "train_runtime": 228025.749, "train_tokens_per_second": 5653.577 }, { "epoch": 1.9849178561809857, "grad_norm": 0.8625253120569166, "learning_rate": 1.4156452081026672e-09, "loss": 0.310637903213501, "num_input_tokens_seen": 1289388008, "step": 29480, "train_runtime": 228066.1418, "train_tokens_per_second": 5653.57 }, { "epoch": 1.985254511176946, "grad_norm": 0.8386731246211869, "learning_rate": 1.3534295344513893e-09, "loss": 0.29576449394226073, "num_input_tokens_seen": 1289614784, "step": 29485, "train_runtime": 228110.4974, "train_tokens_per_second": 5653.465 }, { "epoch": 1.985591166172906, "grad_norm": 0.8448203849362906, "learning_rate": 1.2926117163741813e-09, "loss": 0.2955544710159302, "num_input_tokens_seen": 1289834936, "step": 29490, "train_runtime": 228149.3127, "train_tokens_per_second": 5653.468 }, { "epoch": 1.985927821168866, "grad_norm": 0.7551993663361088, "learning_rate": 1.233191770877995e-09, "loss": 0.3009219169616699, "num_input_tokens_seen": 1290054672, "step": 29495, "train_runtime": 228188.1429, "train_tokens_per_second": 5653.469 }, { "epoch": 1.9862644761648263, "grad_norm": 0.7385225987005458, "learning_rate": 1.1751697145800934e-09, "loss": 0.2817996978759766, "num_input_tokens_seen": 1290281064, "step": 29500, "train_runtime": 228224.0221, "train_tokens_per_second": 5653.573 }, { "epoch": 1.9866011311607865, "grad_norm": 0.8551674733846094, "learning_rate": 1.1185455637052756e-09, "loss": 0.3367082357406616, "num_input_tokens_seen": 1290509624, "step": 29505, "train_runtime": 228265.6636, "train_tokens_per_second": 5653.542 }, { "epoch": 1.9869377861567465, "grad_norm": 0.8607951663242355, "learning_rate": 1.063319334089763e-09, "loss": 0.3116638660430908, "num_input_tokens_seen": 1290724632, "step": 29510, "train_runtime": 228308.5459, "train_tokens_per_second": 5653.422 }, { "epoch": 1.9872744411527066, "grad_norm": 0.7586696985053731, "learning_rate": 1.0094910411762027e-09, "loss": 0.2789448261260986, "num_input_tokens_seen": 1290947232, "step": 29515, "train_runtime": 228353.3345, "train_tokens_per_second": 5653.288 }, { "epoch": 1.9876110961486668, "grad_norm": 0.8786362198012819, "learning_rate": 9.570607000175536e-10, "loss": 0.31690254211425783, "num_input_tokens_seen": 1291165048, "step": 29520, "train_runtime": 228396.0938, "train_tokens_per_second": 5653.184 }, { "epoch": 1.987947751144627, "grad_norm": 0.867401433919585, "learning_rate": 9.060283252765311e-10, "loss": 0.29549479484558105, "num_input_tokens_seen": 1291376632, "step": 29525, "train_runtime": 228437.0857, "train_tokens_per_second": 5653.095 }, { "epoch": 1.988284406140587, "grad_norm": 0.7283183527191147, "learning_rate": 8.563939312233871e-10, "loss": 0.2834463357925415, "num_input_tokens_seen": 1291592160, "step": 29530, "train_runtime": 228475.8857, "train_tokens_per_second": 5653.079 }, { "epoch": 1.9886210611365471, "grad_norm": 0.780933918989674, "learning_rate": 8.081575317386847e-10, "loss": 0.29933602809906007, "num_input_tokens_seen": 1291812360, "step": 29535, "train_runtime": 228512.8712, "train_tokens_per_second": 5653.127 }, { "epoch": 1.9889577161325074, "grad_norm": 0.7275658389704259, "learning_rate": 7.613191403116338e-10, "loss": 0.30489234924316405, "num_input_tokens_seen": 1292039232, "step": 29540, "train_runtime": 228545.6355, "train_tokens_per_second": 5653.31 }, { "epoch": 1.9892943711284676, "grad_norm": 0.7546810071907879, "learning_rate": 7.158787700400905e-10, "loss": 0.3050061225891113, "num_input_tokens_seen": 1292268968, "step": 29545, "train_runtime": 228588.7605, "train_tokens_per_second": 5653.248 }, { "epoch": 1.9896310261244277, "grad_norm": 0.7400073186881632, "learning_rate": 6.718364336316674e-10, "loss": 0.2916685104370117, "num_input_tokens_seen": 1292491832, "step": 29550, "train_runtime": 228627.3323, "train_tokens_per_second": 5653.269 }, { "epoch": 1.9899676811203877, "grad_norm": 0.8064188223143873, "learning_rate": 6.291921434026238e-10, "loss": 0.29037137031555177, "num_input_tokens_seen": 1292713384, "step": 29555, "train_runtime": 228664.2829, "train_tokens_per_second": 5653.324 }, { "epoch": 1.990304336116348, "grad_norm": 0.6299629051575274, "learning_rate": 5.879459112778651e-10, "loss": 0.26992483139038087, "num_input_tokens_seen": 1292916816, "step": 29560, "train_runtime": 228707.5074, "train_tokens_per_second": 5653.145 }, { "epoch": 1.9906409911123082, "grad_norm": 0.7057723847440374, "learning_rate": 5.480977487920536e-10, "loss": 0.3113460302352905, "num_input_tokens_seen": 1293152760, "step": 29565, "train_runtime": 228744.4402, "train_tokens_per_second": 5653.264 }, { "epoch": 1.9909776461082682, "grad_norm": 0.6985242431575329, "learning_rate": 5.096476670890526e-10, "loss": 0.29065916538238523, "num_input_tokens_seen": 1293370744, "step": 29570, "train_runtime": 228786.0909, "train_tokens_per_second": 5653.188 }, { "epoch": 1.9913143011042282, "grad_norm": 0.8726876861778484, "learning_rate": 4.725956769202622e-10, "loss": 0.3043833255767822, "num_input_tokens_seen": 1293580568, "step": 29575, "train_runtime": 228821.7096, "train_tokens_per_second": 5653.225 }, { "epoch": 1.9916509561001885, "grad_norm": 0.7789301695690733, "learning_rate": 4.369417886485039e-10, "loss": 0.3031582832336426, "num_input_tokens_seen": 1293788160, "step": 29580, "train_runtime": 228859.1238, "train_tokens_per_second": 5653.208 }, { "epoch": 1.9919876110961487, "grad_norm": 0.7445218059693559, "learning_rate": 4.026860122430254e-10, "loss": 0.293507981300354, "num_input_tokens_seen": 1294011512, "step": 29585, "train_runtime": 228891.545, "train_tokens_per_second": 5653.383 }, { "epoch": 1.9923242660921088, "grad_norm": 0.776822247685104, "learning_rate": 3.698283572839412e-10, "loss": 0.29284181594848635, "num_input_tokens_seen": 1294233288, "step": 29590, "train_runtime": 228930.2438, "train_tokens_per_second": 5653.396 }, { "epoch": 1.9926609210880688, "grad_norm": 0.8637476385715652, "learning_rate": 3.38368832959457e-10, "loss": 0.2951065540313721, "num_input_tokens_seen": 1294439056, "step": 29595, "train_runtime": 228966.3788, "train_tokens_per_second": 5653.402 }, { "epoch": 1.992997576084029, "grad_norm": 0.8185926706066555, "learning_rate": 3.0830744806753523e-10, "loss": 0.30010027885437013, "num_input_tokens_seen": 1294656608, "step": 29600, "train_runtime": 229002.6257, "train_tokens_per_second": 5653.457 }, { "epoch": 1.9933342310799893, "grad_norm": 0.7968229979488, "learning_rate": 2.7964421101478457e-10, "loss": 0.29233975410461427, "num_input_tokens_seen": 1294866112, "step": 29605, "train_runtime": 229033.3425, "train_tokens_per_second": 5653.614 }, { "epoch": 1.9936708860759493, "grad_norm": 0.6760975642489492, "learning_rate": 2.5237912981646016e-10, "loss": 0.3044607162475586, "num_input_tokens_seen": 1295082752, "step": 29610, "train_runtime": 229068.0198, "train_tokens_per_second": 5653.704 }, { "epoch": 1.9940075410719094, "grad_norm": 0.8833991167375352, "learning_rate": 2.265122120975738e-10, "loss": 0.2928770542144775, "num_input_tokens_seen": 1295294464, "step": 29615, "train_runtime": 229108.5875, "train_tokens_per_second": 5653.627 }, { "epoch": 1.9943441960678696, "grad_norm": 0.7026921457755877, "learning_rate": 2.020434650906733e-10, "loss": 0.2951038360595703, "num_input_tokens_seen": 1295518440, "step": 29620, "train_runtime": 229144.7225, "train_tokens_per_second": 5653.713 }, { "epoch": 1.9946808510638299, "grad_norm": 0.735480223574441, "learning_rate": 1.7897289563972854e-10, "loss": 0.28854942321777344, "num_input_tokens_seen": 1295752200, "step": 29625, "train_runtime": 229181.9465, "train_tokens_per_second": 5653.814 }, { "epoch": 1.99501750605979, "grad_norm": 0.7785852910887519, "learning_rate": 1.5730051019569037e-10, "loss": 0.28860130310058596, "num_input_tokens_seen": 1295966672, "step": 29630, "train_runtime": 229217.582, "train_tokens_per_second": 5653.871 }, { "epoch": 1.99535416105575, "grad_norm": 0.7483503409930179, "learning_rate": 1.3702631481926633e-10, "loss": 0.29309055805206297, "num_input_tokens_seen": 1296186448, "step": 29635, "train_runtime": 229253.3432, "train_tokens_per_second": 5653.948 }, { "epoch": 1.9956908160517102, "grad_norm": 0.8075255441882612, "learning_rate": 1.1815031517981023e-10, "loss": 0.28788046836853026, "num_input_tokens_seen": 1296387216, "step": 29640, "train_runtime": 229284.8545, "train_tokens_per_second": 5654.046 }, { "epoch": 1.9960274710476704, "grad_norm": 0.7216194041021678, "learning_rate": 1.0067251655643262e-10, "loss": 0.28290114402770994, "num_input_tokens_seen": 1296614056, "step": 29645, "train_runtime": 229320.1711, "train_tokens_per_second": 5654.165 }, { "epoch": 1.9963641260436304, "grad_norm": 0.8745531907030398, "learning_rate": 8.459292383633522e-11, "loss": 0.2950653076171875, "num_input_tokens_seen": 1296815776, "step": 29650, "train_runtime": 229363.6026, "train_tokens_per_second": 5653.974 }, { "epoch": 1.9967007810395905, "grad_norm": 0.8156583509555599, "learning_rate": 6.991154151592128e-11, "loss": 0.2833098888397217, "num_input_tokens_seen": 1297021184, "step": 29655, "train_runtime": 229403.9752, "train_tokens_per_second": 5653.874 }, { "epoch": 1.9970374360355507, "grad_norm": 0.734921335121816, "learning_rate": 5.662837370135066e-11, "loss": 0.3091259956359863, "num_input_tokens_seen": 1297247832, "step": 29660, "train_runtime": 229441.4684, "train_tokens_per_second": 5653.938 }, { "epoch": 1.997374091031511, "grad_norm": 0.8453937499810635, "learning_rate": 4.47434241074296e-11, "loss": 0.3012515068054199, "num_input_tokens_seen": 1297458968, "step": 29665, "train_runtime": 229478.4365, "train_tokens_per_second": 5653.947 }, { "epoch": 1.997710746027471, "grad_norm": 0.8579563343326696, "learning_rate": 3.4256696057055615e-11, "loss": 0.3033904552459717, "num_input_tokens_seen": 1297673200, "step": 29670, "train_runtime": 229522.3122, "train_tokens_per_second": 5653.8 }, { "epoch": 1.998047401023431, "grad_norm": 0.804937600894727, "learning_rate": 2.5168192482882824e-11, "loss": 0.30843775272369384, "num_input_tokens_seen": 1297896616, "step": 29675, "train_runtime": 229556.9513, "train_tokens_per_second": 5653.92 }, { "epoch": 1.9983840560193913, "grad_norm": 0.8014462539211099, "learning_rate": 1.747791592676684e-11, "loss": 0.27484722137451173, "num_input_tokens_seen": 1298137256, "step": 29680, "train_runtime": 229589.775, "train_tokens_per_second": 5654.16 }, { "epoch": 1.9987207110153515, "grad_norm": 0.7667553211393875, "learning_rate": 1.1185868539209665e-11, "loss": 0.3029062032699585, "num_input_tokens_seen": 1298347688, "step": 29685, "train_runtime": 229623.1373, "train_tokens_per_second": 5654.255 }, { "epoch": 1.9990573660113116, "grad_norm": 0.7997172260231348, "learning_rate": 6.29205207991479e-12, "loss": 0.30252552032470703, "num_input_tokens_seen": 1298551880, "step": 29690, "train_runtime": 229659.802, "train_tokens_per_second": 5654.241 }, { "epoch": 1.9993940210072716, "grad_norm": 0.8058607018219679, "learning_rate": 2.7964679166769815e-12, "loss": 0.2877742528915405, "num_input_tokens_seen": 1298772440, "step": 29695, "train_runtime": 229699.7546, "train_tokens_per_second": 5654.218 }, { "epoch": 1.9997306760032318, "grad_norm": 0.897980038082396, "learning_rate": 6.991170281578364e-13, "loss": 0.26116390228271485, "num_input_tokens_seen": 1298981184, "step": 29700, "train_runtime": 229737.0922, "train_tokens_per_second": 5654.207 }, { "epoch": 2.0, "num_input_tokens_seen": 1299153424, "step": 29704, "total_flos": 2402581590032384.0, "train_loss": 0.34685841939968143, "train_runtime": 229818.4762, "train_samples_per_second": 0.517, "train_steps_per_second": 0.129 } ], "logging_steps": 5, "max_steps": 29704, "num_input_tokens_seen": 1299153424, "num_train_epochs": 2, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2402581590032384.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }