{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 14852, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.00033665499596014, "grad_norm": 1.7158506568336664, "learning_rate": 9.999999552565099e-06, "loss": 0.8321187973022461, "num_input_tokens_seen": 213976, "step": 5, "train_runtime": 48.5386, "train_tokens_per_second": 4408.369 }, { "epoch": 0.00067330999192028, "grad_norm": 1.4989508496023307, "learning_rate": 9.999997734860948e-06, "loss": 0.6714894294738769, "num_input_tokens_seen": 418192, "step": 10, "train_runtime": 79.1759, "train_tokens_per_second": 5281.811 }, { "epoch": 0.0010099649878804202, "grad_norm": 1.3987943897146944, "learning_rate": 9.999994518923374e-06, "loss": 0.6414656162261962, "num_input_tokens_seen": 631760, "step": 15, "train_runtime": 116.8887, "train_tokens_per_second": 5404.799 }, { "epoch": 0.00134661998384056, "grad_norm": 1.3594234171992137, "learning_rate": 9.999989904753278e-06, "loss": 0.6119038105010987, "num_input_tokens_seen": 847240, "step": 20, "train_runtime": 160.5101, "train_tokens_per_second": 5278.422 }, { "epoch": 0.0016832749798007002, "grad_norm": 1.1837151081821848, "learning_rate": 9.999983892351947e-06, "loss": 0.5918544292449951, "num_input_tokens_seen": 1067560, "step": 25, "train_runtime": 197.4905, "train_tokens_per_second": 5405.628 }, { "epoch": 0.0020199299757608404, "grad_norm": 1.1504621450496095, "learning_rate": 9.999976481721066e-06, "loss": 0.5148830890655518, "num_input_tokens_seen": 1288760, "step": 30, "train_runtime": 231.3357, "train_tokens_per_second": 5570.951 }, { "epoch": 0.0023565849717209803, "grad_norm": 1.0663060499576293, "learning_rate": 9.999967672862704e-06, "loss": 0.554470157623291, "num_input_tokens_seen": 1501896, "step": 35, "train_runtime": 271.9258, "train_tokens_per_second": 5523.183 }, { "epoch": 0.00269323996768112, "grad_norm": 1.1179858029742544, "learning_rate": 9.999957465779326e-06, "loss": 0.5239121437072753, "num_input_tokens_seen": 1716792, "step": 40, "train_runtime": 319.9491, "train_tokens_per_second": 5365.829 }, { "epoch": 0.0030298949636412605, "grad_norm": 1.1555971967505698, "learning_rate": 9.999945860473788e-06, "loss": 0.5400435924530029, "num_input_tokens_seen": 1920760, "step": 45, "train_runtime": 364.1591, "train_tokens_per_second": 5274.507 }, { "epoch": 0.0033665499596014004, "grad_norm": 0.9321994843580264, "learning_rate": 9.999932856949333e-06, "loss": 0.5238595008850098, "num_input_tokens_seen": 2140344, "step": 50, "train_runtime": 402.577, "train_tokens_per_second": 5316.608 }, { "epoch": 0.0037032049555615404, "grad_norm": 1.1572766450172172, "learning_rate": 9.999918455209599e-06, "loss": 0.5059286117553711, "num_input_tokens_seen": 2368296, "step": 55, "train_runtime": 438.0431, "train_tokens_per_second": 5406.536 }, { "epoch": 0.004039859951521681, "grad_norm": 1.1277411399750283, "learning_rate": 9.99990265525861e-06, "loss": 0.5235630989074707, "num_input_tokens_seen": 2589544, "step": 60, "train_runtime": 475.1915, "train_tokens_per_second": 5449.474 }, { "epoch": 0.004376514947481821, "grad_norm": 1.233348290191874, "learning_rate": 9.999885457100789e-06, "loss": 0.5595571517944335, "num_input_tokens_seen": 2809432, "step": 65, "train_runtime": 503.8866, "train_tokens_per_second": 5575.524 }, { "epoch": 0.0047131699434419605, "grad_norm": 1.2298135105742523, "learning_rate": 9.999866860740943e-06, "loss": 0.5092310428619384, "num_input_tokens_seen": 3020248, "step": 70, "train_runtime": 543.5456, "train_tokens_per_second": 5556.568 }, { "epoch": 0.005049824939402101, "grad_norm": 0.9679470345624956, "learning_rate": 9.999846866184274e-06, "loss": 0.5114652633666992, "num_input_tokens_seen": 3249600, "step": 75, "train_runtime": 585.283, "train_tokens_per_second": 5552.186 }, { "epoch": 0.00538647993536224, "grad_norm": 0.979469640417179, "learning_rate": 9.99982547343637e-06, "loss": 0.5040130615234375, "num_input_tokens_seen": 3443864, "step": 80, "train_runtime": 626.1684, "train_tokens_per_second": 5499.901 }, { "epoch": 0.005723134931322381, "grad_norm": 1.078786163056917, "learning_rate": 9.999802682503217e-06, "loss": 0.4742586612701416, "num_input_tokens_seen": 3661032, "step": 85, "train_runtime": 663.7311, "train_tokens_per_second": 5515.836 }, { "epoch": 0.006059789927282521, "grad_norm": 0.9113383787124433, "learning_rate": 9.999778493391186e-06, "loss": 0.5044189453125, "num_input_tokens_seen": 3888680, "step": 90, "train_runtime": 707.589, "train_tokens_per_second": 5495.676 }, { "epoch": 0.0063964449232426605, "grad_norm": 1.0192977781689194, "learning_rate": 9.999752906107043e-06, "loss": 0.5348274230957031, "num_input_tokens_seen": 4114248, "step": 95, "train_runtime": 744.4001, "train_tokens_per_second": 5526.931 }, { "epoch": 0.006733099919202801, "grad_norm": 1.046539367979976, "learning_rate": 9.999725920657944e-06, "loss": 0.5229468822479248, "num_input_tokens_seen": 4329256, "step": 100, "train_runtime": 790.5278, "train_tokens_per_second": 5476.412 }, { "epoch": 0.007069754915162941, "grad_norm": 1.0823101637799084, "learning_rate": 9.999697537051432e-06, "loss": 0.4990852355957031, "num_input_tokens_seen": 4533832, "step": 105, "train_runtime": 828.8033, "train_tokens_per_second": 5470.335 }, { "epoch": 0.007406409911123081, "grad_norm": 1.0579674272002448, "learning_rate": 9.999667755295449e-06, "loss": 0.48107209205627444, "num_input_tokens_seen": 4749088, "step": 110, "train_runtime": 864.874, "train_tokens_per_second": 5491.075 }, { "epoch": 0.007743064907083221, "grad_norm": 1.2773224732968154, "learning_rate": 9.999636575398319e-06, "loss": 0.4919854164123535, "num_input_tokens_seen": 4960752, "step": 115, "train_runtime": 904.8595, "train_tokens_per_second": 5482.345 }, { "epoch": 0.008079719903043361, "grad_norm": 1.0488778079229073, "learning_rate": 9.999603997368766e-06, "loss": 0.4375304222106934, "num_input_tokens_seen": 5167864, "step": 120, "train_runtime": 939.3678, "train_tokens_per_second": 5501.428 }, { "epoch": 0.008416374899003501, "grad_norm": 1.1229102076855217, "learning_rate": 9.999570021215895e-06, "loss": 0.4794501304626465, "num_input_tokens_seen": 5384648, "step": 125, "train_runtime": 973.7305, "train_tokens_per_second": 5529.916 }, { "epoch": 0.008753029894963642, "grad_norm": 1.0387093548265027, "learning_rate": 9.99953464694921e-06, "loss": 0.5004319667816162, "num_input_tokens_seen": 5590392, "step": 130, "train_runtime": 1013.6767, "train_tokens_per_second": 5514.965 }, { "epoch": 0.009089684890923782, "grad_norm": 1.0508132347808834, "learning_rate": 9.999497874578606e-06, "loss": 0.495189905166626, "num_input_tokens_seen": 5819224, "step": 135, "train_runtime": 1052.6891, "train_tokens_per_second": 5527.961 }, { "epoch": 0.009426339886883921, "grad_norm": 1.0896002910221911, "learning_rate": 9.999459704114361e-06, "loss": 0.5080117225646973, "num_input_tokens_seen": 6037808, "step": 140, "train_runtime": 1094.5671, "train_tokens_per_second": 5516.161 }, { "epoch": 0.00976299488284406, "grad_norm": 1.034914657869065, "learning_rate": 9.999420135567153e-06, "loss": 0.526894474029541, "num_input_tokens_seen": 6252752, "step": 145, "train_runtime": 1135.4311, "train_tokens_per_second": 5506.941 }, { "epoch": 0.010099649878804202, "grad_norm": 1.164626155534281, "learning_rate": 9.999379168948047e-06, "loss": 0.5105450630187989, "num_input_tokens_seen": 6476720, "step": 150, "train_runtime": 1172.7989, "train_tokens_per_second": 5522.447 }, { "epoch": 0.010436304874764341, "grad_norm": 1.2400950788317526, "learning_rate": 9.999336804268496e-06, "loss": 0.47139749526977537, "num_input_tokens_seen": 6698024, "step": 155, "train_runtime": 1217.419, "train_tokens_per_second": 5501.823 }, { "epoch": 0.01077295987072448, "grad_norm": 1.0587023212526414, "learning_rate": 9.999293041540351e-06, "loss": 0.5010284900665283, "num_input_tokens_seen": 6910784, "step": 160, "train_runtime": 1258.4852, "train_tokens_per_second": 5491.351 }, { "epoch": 0.011109614866684622, "grad_norm": 1.0126894215000632, "learning_rate": 9.999247880775849e-06, "loss": 0.49982900619506837, "num_input_tokens_seen": 7115568, "step": 165, "train_runtime": 1295.6174, "train_tokens_per_second": 5492.029 }, { "epoch": 0.011446269862644761, "grad_norm": 1.198929638798561, "learning_rate": 9.999201321987617e-06, "loss": 0.46059427261352537, "num_input_tokens_seen": 7329488, "step": 170, "train_runtime": 1337.1094, "train_tokens_per_second": 5481.592 }, { "epoch": 0.011782924858604901, "grad_norm": 1.0114658976479987, "learning_rate": 9.999153365188676e-06, "loss": 0.5039016723632812, "num_input_tokens_seen": 7547880, "step": 175, "train_runtime": 1383.6734, "train_tokens_per_second": 5454.958 }, { "epoch": 0.012119579854565042, "grad_norm": 1.0579154349493107, "learning_rate": 9.99910401039244e-06, "loss": 0.4546662330627441, "num_input_tokens_seen": 7757728, "step": 180, "train_runtime": 1424.6608, "train_tokens_per_second": 5445.316 }, { "epoch": 0.012456234850525182, "grad_norm": 1.1327328565153654, "learning_rate": 9.999053257612708e-06, "loss": 0.464589786529541, "num_input_tokens_seen": 7984416, "step": 185, "train_runtime": 1468.0361, "train_tokens_per_second": 5438.842 }, { "epoch": 0.012792889846485321, "grad_norm": 1.0695885705791155, "learning_rate": 9.999001106863672e-06, "loss": 0.5309792518615722, "num_input_tokens_seen": 8204976, "step": 190, "train_runtime": 1506.2271, "train_tokens_per_second": 5447.37 }, { "epoch": 0.013129544842445462, "grad_norm": 1.129268767285916, "learning_rate": 9.998947558159916e-06, "loss": 0.4964266300201416, "num_input_tokens_seen": 8428800, "step": 195, "train_runtime": 1546.2799, "train_tokens_per_second": 5451.018 }, { "epoch": 0.013466199838405602, "grad_norm": 1.0645176443218387, "learning_rate": 9.99889261151642e-06, "loss": 0.44077634811401367, "num_input_tokens_seen": 8642192, "step": 200, "train_runtime": 1586.0871, "train_tokens_per_second": 5448.75 }, { "epoch": 0.013802854834365741, "grad_norm": 1.0273158071004191, "learning_rate": 9.998836266948542e-06, "loss": 0.47046546936035155, "num_input_tokens_seen": 8852840, "step": 205, "train_runtime": 1618.9934, "train_tokens_per_second": 5468.114 }, { "epoch": 0.014139509830325882, "grad_norm": 1.2260591863245542, "learning_rate": 9.998778524472043e-06, "loss": 0.4429631233215332, "num_input_tokens_seen": 9059368, "step": 210, "train_runtime": 1658.2941, "train_tokens_per_second": 5463.065 }, { "epoch": 0.014476164826286022, "grad_norm": 1.1035215533216065, "learning_rate": 9.99871938410307e-06, "loss": 0.46187715530395507, "num_input_tokens_seen": 9273936, "step": 215, "train_runtime": 1690.8398, "train_tokens_per_second": 5484.811 }, { "epoch": 0.014812819822246161, "grad_norm": 1.500582938758766, "learning_rate": 9.99865884585816e-06, "loss": 0.5123334407806397, "num_input_tokens_seen": 9489816, "step": 220, "train_runtime": 1724.7509, "train_tokens_per_second": 5502.137 }, { "epoch": 0.015149474818206303, "grad_norm": 1.1104716846300207, "learning_rate": 9.998596909754245e-06, "loss": 0.4839674949645996, "num_input_tokens_seen": 9710720, "step": 225, "train_runtime": 1769.0601, "train_tokens_per_second": 5489.197 }, { "epoch": 0.015486129814166442, "grad_norm": 1.1763018457719354, "learning_rate": 9.998533575808642e-06, "loss": 0.455305290222168, "num_input_tokens_seen": 9922160, "step": 230, "train_runtime": 1804.4173, "train_tokens_per_second": 5498.817 }, { "epoch": 0.015822784810126583, "grad_norm": 0.9508268973242634, "learning_rate": 9.998468844039064e-06, "loss": 0.4588268280029297, "num_input_tokens_seen": 10132480, "step": 235, "train_runtime": 1843.1618, "train_tokens_per_second": 5497.336 }, { "epoch": 0.016159439806086723, "grad_norm": 0.982580320370019, "learning_rate": 9.998402714463613e-06, "loss": 0.49381322860717775, "num_input_tokens_seen": 10356032, "step": 240, "train_runtime": 1886.9781, "train_tokens_per_second": 5488.157 }, { "epoch": 0.016496094802046862, "grad_norm": 0.9967583322638394, "learning_rate": 9.998335187100782e-06, "loss": 0.4929532051086426, "num_input_tokens_seen": 10571688, "step": 245, "train_runtime": 1931.0773, "train_tokens_per_second": 5474.503 }, { "epoch": 0.016832749798007002, "grad_norm": 1.0005940352447382, "learning_rate": 9.998266261969453e-06, "loss": 0.488722038269043, "num_input_tokens_seen": 10787736, "step": 250, "train_runtime": 1967.3657, "train_tokens_per_second": 5483.341 }, { "epoch": 0.01716940479396714, "grad_norm": 0.9740927827374989, "learning_rate": 9.998195939088905e-06, "loss": 0.46301860809326173, "num_input_tokens_seen": 11014240, "step": 255, "train_runtime": 1995.3214, "train_tokens_per_second": 5520.033 }, { "epoch": 0.017506059789927284, "grad_norm": 1.0005631289772583, "learning_rate": 9.998124218478797e-06, "loss": 0.4852250099182129, "num_input_tokens_seen": 11227928, "step": 260, "train_runtime": 2040.8305, "train_tokens_per_second": 5501.646 }, { "epoch": 0.017842714785887424, "grad_norm": 3.2898314540824733, "learning_rate": 9.998051100159192e-06, "loss": 0.4806126594543457, "num_input_tokens_seen": 11457336, "step": 265, "train_runtime": 2073.3223, "train_tokens_per_second": 5526.076 }, { "epoch": 0.018179369781847563, "grad_norm": 1.0137684438609407, "learning_rate": 9.997976584150533e-06, "loss": 0.4908778667449951, "num_input_tokens_seen": 11669408, "step": 270, "train_runtime": 2105.6176, "train_tokens_per_second": 5542.036 }, { "epoch": 0.018516024777807703, "grad_norm": 0.882254713488144, "learning_rate": 9.997900670473662e-06, "loss": 0.4400303840637207, "num_input_tokens_seen": 11900376, "step": 275, "train_runtime": 2145.8648, "train_tokens_per_second": 5545.725 }, { "epoch": 0.018852679773767842, "grad_norm": 1.0103112069849245, "learning_rate": 9.997823359149804e-06, "loss": 0.47128896713256835, "num_input_tokens_seen": 12115296, "step": 280, "train_runtime": 2180.0754, "train_tokens_per_second": 5557.283 }, { "epoch": 0.01918933476972798, "grad_norm": 2.383562470887594, "learning_rate": 9.997744650200579e-06, "loss": 0.5039300441741943, "num_input_tokens_seen": 12335296, "step": 285, "train_runtime": 2224.7672, "train_tokens_per_second": 5544.533 }, { "epoch": 0.01952598976568812, "grad_norm": 1.012511096525962, "learning_rate": 9.997664543648e-06, "loss": 0.47290778160095215, "num_input_tokens_seen": 12550016, "step": 290, "train_runtime": 2269.2912, "train_tokens_per_second": 5530.368 }, { "epoch": 0.019862644761648264, "grad_norm": 0.9200150844694661, "learning_rate": 9.997583039514469e-06, "loss": 0.47549943923950194, "num_input_tokens_seen": 12769944, "step": 295, "train_runtime": 2310.0213, "train_tokens_per_second": 5528.063 }, { "epoch": 0.020199299757608404, "grad_norm": 1.0603122997620704, "learning_rate": 9.997500137822776e-06, "loss": 0.48865842819213867, "num_input_tokens_seen": 12994152, "step": 300, "train_runtime": 2347.3612, "train_tokens_per_second": 5535.642 }, { "epoch": 0.020535954753568543, "grad_norm": 1.1560224095031963, "learning_rate": 9.997415838596106e-06, "loss": 0.46552267074584963, "num_input_tokens_seen": 13206104, "step": 305, "train_runtime": 2390.8704, "train_tokens_per_second": 5523.555 }, { "epoch": 0.020872609749528682, "grad_norm": 0.9496962272740035, "learning_rate": 9.997330141858032e-06, "loss": 0.4945693492889404, "num_input_tokens_seen": 13423544, "step": 310, "train_runtime": 2429.9223, "train_tokens_per_second": 5524.269 }, { "epoch": 0.021209264745488822, "grad_norm": 1.1164280869632712, "learning_rate": 9.997243047632519e-06, "loss": 0.47294368743896487, "num_input_tokens_seen": 13640584, "step": 315, "train_runtime": 2463.856, "train_tokens_per_second": 5536.275 }, { "epoch": 0.02154591974144896, "grad_norm": 0.9211260067991657, "learning_rate": 9.997154555943923e-06, "loss": 0.43665332794189454, "num_input_tokens_seen": 13858888, "step": 320, "train_runtime": 2506.1, "train_tokens_per_second": 5530.062 }, { "epoch": 0.021882574737409104, "grad_norm": 1.0719268322873283, "learning_rate": 9.997064666816992e-06, "loss": 0.4625236034393311, "num_input_tokens_seen": 14076648, "step": 325, "train_runtime": 2544.8417, "train_tokens_per_second": 5531.443 }, { "epoch": 0.022219229733369244, "grad_norm": 1.146001730574971, "learning_rate": 9.996973380276858e-06, "loss": 0.5440494060516358, "num_input_tokens_seen": 14299864, "step": 330, "train_runtime": 2575.9234, "train_tokens_per_second": 5551.355 }, { "epoch": 0.022555884729329383, "grad_norm": 1.1489261273369993, "learning_rate": 9.996880696349053e-06, "loss": 0.45033721923828124, "num_input_tokens_seen": 14522560, "step": 335, "train_runtime": 2614.1655, "train_tokens_per_second": 5555.333 }, { "epoch": 0.022892539725289523, "grad_norm": 1.0606322220744733, "learning_rate": 9.996786615059497e-06, "loss": 0.5329171180725097, "num_input_tokens_seen": 14746648, "step": 340, "train_runtime": 2655.6018, "train_tokens_per_second": 5553.034 }, { "epoch": 0.023229194721249662, "grad_norm": 0.9692502297767218, "learning_rate": 9.996691136434498e-06, "loss": 0.4342483997344971, "num_input_tokens_seen": 14969080, "step": 345, "train_runtime": 2690.8338, "train_tokens_per_second": 5562.989 }, { "epoch": 0.023565849717209802, "grad_norm": 0.8994912857959015, "learning_rate": 9.996594260500753e-06, "loss": 0.507387924194336, "num_input_tokens_seen": 15193912, "step": 350, "train_runtime": 2729.4748, "train_tokens_per_second": 5566.606 }, { "epoch": 0.023902504713169945, "grad_norm": 0.9930018613669586, "learning_rate": 9.996495987285358e-06, "loss": 0.4612261772155762, "num_input_tokens_seen": 15411408, "step": 355, "train_runtime": 2773.0354, "train_tokens_per_second": 5557.595 }, { "epoch": 0.024239159709130084, "grad_norm": 1.0882060582433957, "learning_rate": 9.996396316815793e-06, "loss": 0.4673755645751953, "num_input_tokens_seen": 15630480, "step": 360, "train_runtime": 2815.6019, "train_tokens_per_second": 5551.381 }, { "epoch": 0.024575814705090224, "grad_norm": 1.1223066651934839, "learning_rate": 9.99629524911993e-06, "loss": 0.4566653251647949, "num_input_tokens_seen": 15847552, "step": 365, "train_runtime": 2852.9783, "train_tokens_per_second": 5554.74 }, { "epoch": 0.024912469701050363, "grad_norm": 1.0964642711464192, "learning_rate": 9.996192784226033e-06, "loss": 0.440608549118042, "num_input_tokens_seen": 16049488, "step": 370, "train_runtime": 2887.3093, "train_tokens_per_second": 5558.631 }, { "epoch": 0.025249124697010503, "grad_norm": 0.9458333109972462, "learning_rate": 9.996088922162755e-06, "loss": 0.4601402759552002, "num_input_tokens_seen": 16283544, "step": 375, "train_runtime": 2920.1965, "train_tokens_per_second": 5576.181 }, { "epoch": 0.025585779692970642, "grad_norm": 0.9639187009881571, "learning_rate": 9.995983662959141e-06, "loss": 0.4678368091583252, "num_input_tokens_seen": 16507176, "step": 380, "train_runtime": 2959.819, "train_tokens_per_second": 5577.09 }, { "epoch": 0.025922434688930785, "grad_norm": 0.9786802993443171, "learning_rate": 9.995877006644627e-06, "loss": 0.4893208026885986, "num_input_tokens_seen": 16739664, "step": 385, "train_runtime": 3003.5655, "train_tokens_per_second": 5573.264 }, { "epoch": 0.026259089684890925, "grad_norm": 0.9983372688388842, "learning_rate": 9.995768953249038e-06, "loss": 0.4782050132751465, "num_input_tokens_seen": 16966112, "step": 390, "train_runtime": 3042.5667, "train_tokens_per_second": 5576.25 }, { "epoch": 0.026595744680851064, "grad_norm": 0.9763900936703368, "learning_rate": 9.995659502802594e-06, "loss": 0.4591067314147949, "num_input_tokens_seen": 17184144, "step": 395, "train_runtime": 3081.608, "train_tokens_per_second": 5576.356 }, { "epoch": 0.026932399676811204, "grad_norm": 1.1889179128899698, "learning_rate": 9.995548655335899e-06, "loss": 0.4847611427307129, "num_input_tokens_seen": 17393504, "step": 400, "train_runtime": 3119.919, "train_tokens_per_second": 5574.986 }, { "epoch": 0.027269054672771343, "grad_norm": 1.0385231933952215, "learning_rate": 9.995436410879951e-06, "loss": 0.5011202812194824, "num_input_tokens_seen": 17618352, "step": 405, "train_runtime": 3158.5186, "train_tokens_per_second": 5578.043 }, { "epoch": 0.027605709668731482, "grad_norm": 1.0315411320040826, "learning_rate": 9.99532276946614e-06, "loss": 0.4390664577484131, "num_input_tokens_seen": 17833504, "step": 410, "train_runtime": 3197.1139, "train_tokens_per_second": 5578.001 }, { "epoch": 0.027942364664691625, "grad_norm": 0.9798271051589648, "learning_rate": 9.995207731126246e-06, "loss": 0.48116722106933596, "num_input_tokens_seen": 18060040, "step": 415, "train_runtime": 3233.4074, "train_tokens_per_second": 5585.451 }, { "epoch": 0.028279019660651765, "grad_norm": 0.9349852018887401, "learning_rate": 9.99509129589244e-06, "loss": 0.4614968776702881, "num_input_tokens_seen": 18273536, "step": 420, "train_runtime": 3276.2797, "train_tokens_per_second": 5577.526 }, { "epoch": 0.028615674656611904, "grad_norm": 1.1608131463568248, "learning_rate": 9.994973463797279e-06, "loss": 0.4571842193603516, "num_input_tokens_seen": 18501288, "step": 425, "train_runtime": 3312.0947, "train_tokens_per_second": 5585.978 }, { "epoch": 0.028952329652572044, "grad_norm": 0.9117559518264567, "learning_rate": 9.99485423487372e-06, "loss": 0.42873506546020507, "num_input_tokens_seen": 18713400, "step": 430, "train_runtime": 3354.8456, "train_tokens_per_second": 5578.021 }, { "epoch": 0.029288984648532183, "grad_norm": 1.0351008634262573, "learning_rate": 9.994733609155097e-06, "loss": 0.46686439514160155, "num_input_tokens_seen": 18927424, "step": 435, "train_runtime": 3390.8404, "train_tokens_per_second": 5581.927 }, { "epoch": 0.029625639644492323, "grad_norm": 0.9515109413699648, "learning_rate": 9.994611586675149e-06, "loss": 0.4384657382965088, "num_input_tokens_seen": 19153848, "step": 440, "train_runtime": 3427.1383, "train_tokens_per_second": 5588.875 }, { "epoch": 0.029962294640452466, "grad_norm": 2.170654371130382, "learning_rate": 9.994488167468e-06, "loss": 0.457914924621582, "num_input_tokens_seen": 19367752, "step": 445, "train_runtime": 3463.4205, "train_tokens_per_second": 5592.088 }, { "epoch": 0.030298949636412605, "grad_norm": 0.9213402764770521, "learning_rate": 9.994363351568158e-06, "loss": 0.49051642417907715, "num_input_tokens_seen": 19581376, "step": 450, "train_runtime": 3507.0672, "train_tokens_per_second": 5583.405 }, { "epoch": 0.030635604632372745, "grad_norm": 1.0129019967889514, "learning_rate": 9.994237139010532e-06, "loss": 0.4277812480926514, "num_input_tokens_seen": 19787728, "step": 455, "train_runtime": 3546.6942, "train_tokens_per_second": 5579.203 }, { "epoch": 0.030972259628332884, "grad_norm": 0.9251976717430972, "learning_rate": 9.994109529830414e-06, "loss": 0.4721639633178711, "num_input_tokens_seen": 20024672, "step": 460, "train_runtime": 3585.3338, "train_tokens_per_second": 5585.163 }, { "epoch": 0.03130891462429303, "grad_norm": 0.8419132637197803, "learning_rate": 9.993980524063494e-06, "loss": 0.44678316116333006, "num_input_tokens_seen": 20247816, "step": 465, "train_runtime": 3622.8878, "train_tokens_per_second": 5588.861 }, { "epoch": 0.03164556962025317, "grad_norm": 0.8727373261991417, "learning_rate": 9.993850121745842e-06, "loss": 0.448548698425293, "num_input_tokens_seen": 20469008, "step": 470, "train_runtime": 3663.8929, "train_tokens_per_second": 5586.683 }, { "epoch": 0.031982224616213306, "grad_norm": 0.9661829335825901, "learning_rate": 9.99371832291393e-06, "loss": 0.44652185440063474, "num_input_tokens_seen": 20684368, "step": 475, "train_runtime": 3702.3594, "train_tokens_per_second": 5586.807 }, { "epoch": 0.032318879612173446, "grad_norm": 1.052144245514416, "learning_rate": 9.993585127604612e-06, "loss": 0.4458156108856201, "num_input_tokens_seen": 20888824, "step": 480, "train_runtime": 3737.8839, "train_tokens_per_second": 5588.409 }, { "epoch": 0.032655534608133585, "grad_norm": 0.8727464499212149, "learning_rate": 9.993450535855136e-06, "loss": 0.4528946876525879, "num_input_tokens_seen": 21093776, "step": 485, "train_runtime": 3771.0576, "train_tokens_per_second": 5593.597 }, { "epoch": 0.032992189604093725, "grad_norm": 1.4490470715769006, "learning_rate": 9.993314547703142e-06, "loss": 0.43402805328369143, "num_input_tokens_seen": 21314528, "step": 490, "train_runtime": 3810.8049, "train_tokens_per_second": 5593.183 }, { "epoch": 0.033328844600053864, "grad_norm": 0.913157610231942, "learning_rate": 9.993177163186655e-06, "loss": 0.44025378227233886, "num_input_tokens_seen": 21529648, "step": 495, "train_runtime": 3846.3087, "train_tokens_per_second": 5597.483 }, { "epoch": 0.033665499596014004, "grad_norm": 1.0732207036056458, "learning_rate": 9.993038382344097e-06, "loss": 0.43718814849853516, "num_input_tokens_seen": 21744008, "step": 500, "train_runtime": 3886.9027, "train_tokens_per_second": 5594.174 }, { "epoch": 0.03400215459197414, "grad_norm": 0.9385843989678325, "learning_rate": 9.992898205214279e-06, "loss": 0.44336519241333006, "num_input_tokens_seen": 21963168, "step": 505, "train_runtime": 3919.9586, "train_tokens_per_second": 5602.908 }, { "epoch": 0.03433880958793428, "grad_norm": 0.9966215411858433, "learning_rate": 9.992756631836397e-06, "loss": 0.4398432731628418, "num_input_tokens_seen": 22181088, "step": 510, "train_runtime": 3967.3085, "train_tokens_per_second": 5590.966 }, { "epoch": 0.03467546458389442, "grad_norm": 0.8920648260369749, "learning_rate": 9.992613662250044e-06, "loss": 0.4598443031311035, "num_input_tokens_seen": 22402688, "step": 515, "train_runtime": 4007.4675, "train_tokens_per_second": 5590.236 }, { "epoch": 0.03501211957985457, "grad_norm": 0.9290820640509749, "learning_rate": 9.992469296495201e-06, "loss": 0.4575651168823242, "num_input_tokens_seen": 22628840, "step": 520, "train_runtime": 4042.7584, "train_tokens_per_second": 5597.376 }, { "epoch": 0.03534877457581471, "grad_norm": 0.9109745499097042, "learning_rate": 9.992323534612238e-06, "loss": 0.414502477645874, "num_input_tokens_seen": 22848504, "step": 525, "train_runtime": 4082.2649, "train_tokens_per_second": 5597.017 }, { "epoch": 0.03568542957177485, "grad_norm": 1.1344769076017303, "learning_rate": 9.99217637664192e-06, "loss": 0.45860743522644043, "num_input_tokens_seen": 23072192, "step": 530, "train_runtime": 4119.8107, "train_tokens_per_second": 5600.304 }, { "epoch": 0.03602208456773499, "grad_norm": 0.940449394205852, "learning_rate": 9.992027822625397e-06, "loss": 0.45654983520507814, "num_input_tokens_seen": 23281952, "step": 535, "train_runtime": 4161.0794, "train_tokens_per_second": 5595.171 }, { "epoch": 0.036358739563695126, "grad_norm": 1.0036660879417987, "learning_rate": 9.99187787260421e-06, "loss": 0.46324939727783204, "num_input_tokens_seen": 23492592, "step": 540, "train_runtime": 4199.7934, "train_tokens_per_second": 5593.749 }, { "epoch": 0.036695394559655266, "grad_norm": 0.9529512682682689, "learning_rate": 9.991726526620294e-06, "loss": 0.4310856819152832, "num_input_tokens_seen": 23724784, "step": 545, "train_runtime": 4235.651, "train_tokens_per_second": 5601.213 }, { "epoch": 0.037032049555615405, "grad_norm": 1.0092720255970657, "learning_rate": 9.991573784715973e-06, "loss": 0.4721970081329346, "num_input_tokens_seen": 23941816, "step": 550, "train_runtime": 4278.956, "train_tokens_per_second": 5595.247 }, { "epoch": 0.037368704551575545, "grad_norm": 1.0108753586712804, "learning_rate": 9.99141964693396e-06, "loss": 0.48006014823913573, "num_input_tokens_seen": 24165232, "step": 555, "train_runtime": 4315.3047, "train_tokens_per_second": 5599.89 }, { "epoch": 0.037705359547535684, "grad_norm": 1.0343909095504493, "learning_rate": 9.99126411331736e-06, "loss": 0.4417973518371582, "num_input_tokens_seen": 24389896, "step": 560, "train_runtime": 4359.1735, "train_tokens_per_second": 5595.074 }, { "epoch": 0.038042014543495824, "grad_norm": 1.0113397276422895, "learning_rate": 9.991107183909665e-06, "loss": 0.4680752754211426, "num_input_tokens_seen": 24614992, "step": 565, "train_runtime": 4391.4505, "train_tokens_per_second": 5605.208 }, { "epoch": 0.03837866953945596, "grad_norm": 0.9954842488566088, "learning_rate": 9.990948858754763e-06, "loss": 0.4640792369842529, "num_input_tokens_seen": 24823080, "step": 570, "train_runtime": 4434.0745, "train_tokens_per_second": 5598.255 }, { "epoch": 0.0387153245354161, "grad_norm": 0.9153320849806976, "learning_rate": 9.990789137896927e-06, "loss": 0.4609560966491699, "num_input_tokens_seen": 25044784, "step": 575, "train_runtime": 4471.0247, "train_tokens_per_second": 5601.576 }, { "epoch": 0.03905197953137624, "grad_norm": 0.9718791869837801, "learning_rate": 9.990628021380823e-06, "loss": 0.47663059234619143, "num_input_tokens_seen": 25262200, "step": 580, "train_runtime": 4509.6496, "train_tokens_per_second": 5601.81 }, { "epoch": 0.03938863452733639, "grad_norm": 1.218415508866825, "learning_rate": 9.990465509251508e-06, "loss": 0.46056556701660156, "num_input_tokens_seen": 25473136, "step": 585, "train_runtime": 4541.7073, "train_tokens_per_second": 5608.714 }, { "epoch": 0.03972528952329653, "grad_norm": 1.0200294193913204, "learning_rate": 9.990301601554425e-06, "loss": 0.48001799583435056, "num_input_tokens_seen": 25671088, "step": 590, "train_runtime": 4581.4528, "train_tokens_per_second": 5603.264 }, { "epoch": 0.04006194451925667, "grad_norm": 1.0450169479009095, "learning_rate": 9.990136298335414e-06, "loss": 0.40839109420776365, "num_input_tokens_seen": 25887472, "step": 595, "train_runtime": 4618.2668, "train_tokens_per_second": 5605.452 }, { "epoch": 0.04039859951521681, "grad_norm": 0.9533941163271269, "learning_rate": 9.989969599640698e-06, "loss": 0.4223615646362305, "num_input_tokens_seen": 26117456, "step": 600, "train_runtime": 4650.9664, "train_tokens_per_second": 5615.49 }, { "epoch": 0.040735254511176947, "grad_norm": 0.9258754840147914, "learning_rate": 9.989801505516895e-06, "loss": 0.505678129196167, "num_input_tokens_seen": 26348056, "step": 605, "train_runtime": 4690.0532, "train_tokens_per_second": 5617.859 }, { "epoch": 0.041071909507137086, "grad_norm": 0.9866589002080994, "learning_rate": 9.989632016011012e-06, "loss": 0.47707581520080566, "num_input_tokens_seen": 26572040, "step": 610, "train_runtime": 4721.6631, "train_tokens_per_second": 5627.687 }, { "epoch": 0.041408564503097225, "grad_norm": 1.0374837134071888, "learning_rate": 9.989461131170448e-06, "loss": 0.4833499908447266, "num_input_tokens_seen": 26769320, "step": 615, "train_runtime": 4762.2337, "train_tokens_per_second": 5621.169 }, { "epoch": 0.041745219499057365, "grad_norm": 0.8823212064118572, "learning_rate": 9.98928885104299e-06, "loss": 0.4514059543609619, "num_input_tokens_seen": 26988024, "step": 620, "train_runtime": 4795.3541, "train_tokens_per_second": 5627.952 }, { "epoch": 0.042081874495017504, "grad_norm": 0.8780469782436839, "learning_rate": 9.989115175676812e-06, "loss": 0.4226998329162598, "num_input_tokens_seen": 27212624, "step": 625, "train_runtime": 4834.4544, "train_tokens_per_second": 5628.892 }, { "epoch": 0.042418529490977644, "grad_norm": 0.9554506078310793, "learning_rate": 9.988940105120483e-06, "loss": 0.47803831100463867, "num_input_tokens_seen": 27422208, "step": 630, "train_runtime": 4877.5946, "train_tokens_per_second": 5622.076 }, { "epoch": 0.04275518448693778, "grad_norm": 0.93348166885423, "learning_rate": 9.988763639422965e-06, "loss": 0.4802694797515869, "num_input_tokens_seen": 27650384, "step": 635, "train_runtime": 4915.966, "train_tokens_per_second": 5624.608 }, { "epoch": 0.04309183948289792, "grad_norm": 0.9769454728471132, "learning_rate": 9.988585778633604e-06, "loss": 0.4367190361022949, "num_input_tokens_seen": 27851424, "step": 640, "train_runtime": 4948.8643, "train_tokens_per_second": 5627.841 }, { "epoch": 0.04342849447885807, "grad_norm": 0.9848655689806975, "learning_rate": 9.988406522802134e-06, "loss": 0.45001683235168455, "num_input_tokens_seen": 28060088, "step": 645, "train_runtime": 4991.2246, "train_tokens_per_second": 5621.884 }, { "epoch": 0.04376514947481821, "grad_norm": 0.9626370029590127, "learning_rate": 9.98822587197869e-06, "loss": 0.41652770042419435, "num_input_tokens_seen": 28274912, "step": 650, "train_runtime": 5025.7373, "train_tokens_per_second": 5626.023 }, { "epoch": 0.04410180447077835, "grad_norm": 0.9983674144400133, "learning_rate": 9.988043826213785e-06, "loss": 0.4282545566558838, "num_input_tokens_seen": 28481968, "step": 655, "train_runtime": 5062.1603, "train_tokens_per_second": 5626.445 }, { "epoch": 0.04443845946673849, "grad_norm": 2.4559661675719884, "learning_rate": 9.98786038555833e-06, "loss": 0.4085527420043945, "num_input_tokens_seen": 28702472, "step": 660, "train_runtime": 5099.8424, "train_tokens_per_second": 5628.11 }, { "epoch": 0.04477511446269863, "grad_norm": 0.8332845163143295, "learning_rate": 9.987675550063625e-06, "loss": 0.44841432571411133, "num_input_tokens_seen": 28932512, "step": 665, "train_runtime": 5135.2428, "train_tokens_per_second": 5634.108 }, { "epoch": 0.04511176945865877, "grad_norm": 1.0017265357539382, "learning_rate": 9.987489319781355e-06, "loss": 0.4431906223297119, "num_input_tokens_seen": 29153640, "step": 670, "train_runtime": 5165.908, "train_tokens_per_second": 5643.469 }, { "epoch": 0.045448424454618906, "grad_norm": 0.8381101119904498, "learning_rate": 9.987301694763602e-06, "loss": 0.4798222541809082, "num_input_tokens_seen": 29368992, "step": 675, "train_runtime": 5201.341, "train_tokens_per_second": 5646.427 }, { "epoch": 0.045785079450579046, "grad_norm": 0.9739030010713555, "learning_rate": 9.987112675062834e-06, "loss": 0.4200302600860596, "num_input_tokens_seen": 29582872, "step": 680, "train_runtime": 5240.8223, "train_tokens_per_second": 5644.7 }, { "epoch": 0.046121734446539185, "grad_norm": 0.9923641076223235, "learning_rate": 9.986922260731908e-06, "loss": 0.42931652069091797, "num_input_tokens_seen": 29791056, "step": 685, "train_runtime": 5280.43, "train_tokens_per_second": 5641.786 }, { "epoch": 0.046458389442499325, "grad_norm": 0.8786561915980274, "learning_rate": 9.986730451824073e-06, "loss": 0.4656373977661133, "num_input_tokens_seen": 30001648, "step": 690, "train_runtime": 5325.5768, "train_tokens_per_second": 5633.502 }, { "epoch": 0.046795044438459464, "grad_norm": 0.9155252116619295, "learning_rate": 9.986537248392969e-06, "loss": 0.4756736755371094, "num_input_tokens_seen": 30223896, "step": 695, "train_runtime": 5365.8859, "train_tokens_per_second": 5632.601 }, { "epoch": 0.047131699434419604, "grad_norm": 1.0345486643678798, "learning_rate": 9.986342650492626e-06, "loss": 0.4506352424621582, "num_input_tokens_seen": 30445352, "step": 700, "train_runtime": 5399.4485, "train_tokens_per_second": 5638.604 }, { "epoch": 0.04746835443037975, "grad_norm": 0.919553088389443, "learning_rate": 9.98614665817746e-06, "loss": 0.42203187942504883, "num_input_tokens_seen": 30642128, "step": 705, "train_runtime": 5439.3583, "train_tokens_per_second": 5633.409 }, { "epoch": 0.04780500942633989, "grad_norm": 0.9271703985798777, "learning_rate": 9.98594927150228e-06, "loss": 0.427701473236084, "num_input_tokens_seen": 30873224, "step": 710, "train_runtime": 5478.7451, "train_tokens_per_second": 5635.09 }, { "epoch": 0.04814166442230003, "grad_norm": 0.9508538400970585, "learning_rate": 9.985750490522286e-06, "loss": 0.39564857482910154, "num_input_tokens_seen": 31087512, "step": 715, "train_runtime": 5521.2724, "train_tokens_per_second": 5630.498 }, { "epoch": 0.04847831941826017, "grad_norm": 0.9372110505017411, "learning_rate": 9.985550315293066e-06, "loss": 0.4636754035949707, "num_input_tokens_seen": 31318912, "step": 720, "train_runtime": 5557.4337, "train_tokens_per_second": 5635.499 }, { "epoch": 0.04881497441422031, "grad_norm": 0.9970520932843633, "learning_rate": 9.985348745870598e-06, "loss": 0.4597306728363037, "num_input_tokens_seen": 31546096, "step": 725, "train_runtime": 5592.8911, "train_tokens_per_second": 5640.392 }, { "epoch": 0.04915162941018045, "grad_norm": 0.8271247348731543, "learning_rate": 9.98514578231125e-06, "loss": 0.4194610595703125, "num_input_tokens_seen": 31774968, "step": 730, "train_runtime": 5630.8722, "train_tokens_per_second": 5642.992 }, { "epoch": 0.04948828440614059, "grad_norm": 0.9452005671897916, "learning_rate": 9.984941424671781e-06, "loss": 0.4705995559692383, "num_input_tokens_seen": 31991384, "step": 735, "train_runtime": 5672.8388, "train_tokens_per_second": 5639.396 }, { "epoch": 0.049824939402100726, "grad_norm": 0.9711026791829106, "learning_rate": 9.984735673009337e-06, "loss": 0.43364248275756834, "num_input_tokens_seen": 32211232, "step": 740, "train_runtime": 5717.5318, "train_tokens_per_second": 5633.765 }, { "epoch": 0.050161594398060866, "grad_norm": 0.8583208108971163, "learning_rate": 9.984528527381458e-06, "loss": 0.4496613502502441, "num_input_tokens_seen": 32432504, "step": 745, "train_runtime": 5758.1136, "train_tokens_per_second": 5632.488 }, { "epoch": 0.050498249394021005, "grad_norm": 1.0983008551303333, "learning_rate": 9.984319987846072e-06, "loss": 0.4476910591125488, "num_input_tokens_seen": 32644184, "step": 750, "train_runtime": 5795.8989, "train_tokens_per_second": 5632.29 }, { "epoch": 0.050834904389981145, "grad_norm": 0.9341698177556362, "learning_rate": 9.984110054461495e-06, "loss": 0.4494589328765869, "num_input_tokens_seen": 32883080, "step": 755, "train_runtime": 5831.2135, "train_tokens_per_second": 5639.149 }, { "epoch": 0.051171559385941284, "grad_norm": 2.9705690058280205, "learning_rate": 9.983898727286435e-06, "loss": 0.44231281280517576, "num_input_tokens_seen": 33102688, "step": 760, "train_runtime": 5864.3725, "train_tokens_per_second": 5644.711 }, { "epoch": 0.05150821438190143, "grad_norm": 0.9183883314753698, "learning_rate": 9.983686006379985e-06, "loss": 0.45505475997924805, "num_input_tokens_seen": 33319336, "step": 765, "train_runtime": 5901.491, "train_tokens_per_second": 5645.918 }, { "epoch": 0.05184486937786157, "grad_norm": 0.9313957301525887, "learning_rate": 9.983471891801638e-06, "loss": 0.437741756439209, "num_input_tokens_seen": 33545192, "step": 770, "train_runtime": 5938.7864, "train_tokens_per_second": 5648.493 }, { "epoch": 0.05218152437382171, "grad_norm": 0.8973015582826919, "learning_rate": 9.983256383611267e-06, "loss": 0.441961669921875, "num_input_tokens_seen": 33767136, "step": 775, "train_runtime": 5974.9184, "train_tokens_per_second": 5651.481 }, { "epoch": 0.05251817936978185, "grad_norm": 1.380873298582274, "learning_rate": 9.983039481869138e-06, "loss": 0.42367143630981446, "num_input_tokens_seen": 33985712, "step": 780, "train_runtime": 6009.8556, "train_tokens_per_second": 5654.996 }, { "epoch": 0.05285483436574199, "grad_norm": 0.9605495456782687, "learning_rate": 9.98282118663591e-06, "loss": 0.4347693920135498, "num_input_tokens_seen": 34208000, "step": 785, "train_runtime": 6046.7667, "train_tokens_per_second": 5657.238 }, { "epoch": 0.05319148936170213, "grad_norm": 0.9570184798319451, "learning_rate": 9.982601497972624e-06, "loss": 0.4524986267089844, "num_input_tokens_seen": 34425040, "step": 790, "train_runtime": 6085.7762, "train_tokens_per_second": 5656.639 }, { "epoch": 0.05352814435766227, "grad_norm": 1.293632659414026, "learning_rate": 9.982380415940717e-06, "loss": 0.4259688377380371, "num_input_tokens_seen": 34634712, "step": 795, "train_runtime": 6120.1944, "train_tokens_per_second": 5659.087 }, { "epoch": 0.05386479935362241, "grad_norm": 0.9262120217395047, "learning_rate": 9.982157940602015e-06, "loss": 0.46526622772216797, "num_input_tokens_seen": 34865376, "step": 800, "train_runtime": 6156.1798, "train_tokens_per_second": 5663.476 }, { "epoch": 0.05420145434958255, "grad_norm": 0.892992639712076, "learning_rate": 9.981934072018732e-06, "loss": 0.44102907180786133, "num_input_tokens_seen": 35098448, "step": 805, "train_runtime": 6189.6138, "train_tokens_per_second": 5670.539 }, { "epoch": 0.054538109345542686, "grad_norm": 0.8797013169732244, "learning_rate": 9.981708810253472e-06, "loss": 0.4654733657836914, "num_input_tokens_seen": 35317184, "step": 810, "train_runtime": 6223.9712, "train_tokens_per_second": 5674.381 }, { "epoch": 0.054874764341502826, "grad_norm": 1.1385550766773516, "learning_rate": 9.981482155369229e-06, "loss": 0.4581299781799316, "num_input_tokens_seen": 35543024, "step": 815, "train_runtime": 6264.1777, "train_tokens_per_second": 5674.013 }, { "epoch": 0.055211419337462965, "grad_norm": 1.0108160361368144, "learning_rate": 9.981254107429385e-06, "loss": 0.4073037147521973, "num_input_tokens_seen": 35752976, "step": 820, "train_runtime": 6301.9605, "train_tokens_per_second": 5673.31 }, { "epoch": 0.05554807433342311, "grad_norm": 0.8271492373593813, "learning_rate": 9.981024666497716e-06, "loss": 0.4087496757507324, "num_input_tokens_seen": 35970808, "step": 825, "train_runtime": 6336.9136, "train_tokens_per_second": 5676.392 }, { "epoch": 0.05588472932938325, "grad_norm": 1.2448406201928153, "learning_rate": 9.98079383263838e-06, "loss": 0.451265811920166, "num_input_tokens_seen": 36175264, "step": 830, "train_runtime": 6372.1661, "train_tokens_per_second": 5677.075 }, { "epoch": 0.05622138432534339, "grad_norm": 1.0960090803895477, "learning_rate": 9.980561605915932e-06, "loss": 0.43454971313476565, "num_input_tokens_seen": 36399968, "step": 835, "train_runtime": 6409.522, "train_tokens_per_second": 5679.046 }, { "epoch": 0.05655803932130353, "grad_norm": 0.865350004624438, "learning_rate": 9.980327986395316e-06, "loss": 0.44866161346435546, "num_input_tokens_seen": 36614352, "step": 840, "train_runtime": 6450.8502, "train_tokens_per_second": 5675.896 }, { "epoch": 0.05689469431726367, "grad_norm": 0.9132401043618537, "learning_rate": 9.980092974141855e-06, "loss": 0.43543548583984376, "num_input_tokens_seen": 36842440, "step": 845, "train_runtime": 6489.8829, "train_tokens_per_second": 5676.904 }, { "epoch": 0.05723134931322381, "grad_norm": 0.9515826536482608, "learning_rate": 9.979856569221276e-06, "loss": 0.434114933013916, "num_input_tokens_seen": 37064928, "step": 850, "train_runtime": 6535.3585, "train_tokens_per_second": 5671.445 }, { "epoch": 0.05756800430918395, "grad_norm": 0.905243476379667, "learning_rate": 9.979618771699688e-06, "loss": 0.47480268478393556, "num_input_tokens_seen": 37286696, "step": 855, "train_runtime": 6571.3163, "train_tokens_per_second": 5674.159 }, { "epoch": 0.05790465930514409, "grad_norm": 0.9973188371129253, "learning_rate": 9.979379581643588e-06, "loss": 0.4271403312683105, "num_input_tokens_seen": 37505104, "step": 860, "train_runtime": 6612.0758, "train_tokens_per_second": 5672.213 }, { "epoch": 0.05824131430110423, "grad_norm": 0.891663822548588, "learning_rate": 9.979138999119866e-06, "loss": 0.46260747909545896, "num_input_tokens_seen": 37721104, "step": 865, "train_runtime": 6657.2054, "train_tokens_per_second": 5666.207 }, { "epoch": 0.05857796929706437, "grad_norm": 0.8193884764682856, "learning_rate": 9.978897024195801e-06, "loss": 0.43666720390319824, "num_input_tokens_seen": 37959848, "step": 870, "train_runtime": 6692.9435, "train_tokens_per_second": 5671.622 }, { "epoch": 0.058914624293024506, "grad_norm": 1.1669037394876847, "learning_rate": 9.978653656939058e-06, "loss": 0.4272760391235352, "num_input_tokens_seen": 38179560, "step": 875, "train_runtime": 6736.655, "train_tokens_per_second": 5667.436 }, { "epoch": 0.059251279288984646, "grad_norm": 1.0468766117182693, "learning_rate": 9.978408897417699e-06, "loss": 0.4613694190979004, "num_input_tokens_seen": 38405040, "step": 880, "train_runtime": 6776.3735, "train_tokens_per_second": 5667.492 }, { "epoch": 0.059587934284944785, "grad_norm": 0.8352176899590911, "learning_rate": 9.978162745700165e-06, "loss": 0.4417067527770996, "num_input_tokens_seen": 38631232, "step": 885, "train_runtime": 6814.8051, "train_tokens_per_second": 5668.721 }, { "epoch": 0.05992458928090493, "grad_norm": 1.0696188249598721, "learning_rate": 9.977915201855293e-06, "loss": 0.42413697242736814, "num_input_tokens_seen": 38849712, "step": 890, "train_runtime": 6850.9387, "train_tokens_per_second": 5670.714 }, { "epoch": 0.06026124427686507, "grad_norm": 0.9281445460422576, "learning_rate": 9.977666265952309e-06, "loss": 0.4329718589782715, "num_input_tokens_seen": 39067416, "step": 895, "train_runtime": 6890.6802, "train_tokens_per_second": 5669.602 }, { "epoch": 0.06059789927282521, "grad_norm": 0.8685965904886482, "learning_rate": 9.977415938060823e-06, "loss": 0.4434166431427002, "num_input_tokens_seen": 39288624, "step": 900, "train_runtime": 6926.1271, "train_tokens_per_second": 5672.524 }, { "epoch": 0.06093455426878535, "grad_norm": 0.9417641978342199, "learning_rate": 9.977164218250846e-06, "loss": 0.444110107421875, "num_input_tokens_seen": 39505328, "step": 905, "train_runtime": 6968.8615, "train_tokens_per_second": 5668.835 }, { "epoch": 0.06127120926474549, "grad_norm": 0.8557175345597763, "learning_rate": 9.976911106592765e-06, "loss": 0.4071072578430176, "num_input_tokens_seen": 39717144, "step": 910, "train_runtime": 7009.1269, "train_tokens_per_second": 5666.49 }, { "epoch": 0.06160786426070563, "grad_norm": 1.1399112064858985, "learning_rate": 9.976656603157363e-06, "loss": 0.4384052276611328, "num_input_tokens_seen": 39933000, "step": 915, "train_runtime": 7045.7591, "train_tokens_per_second": 5667.665 }, { "epoch": 0.06194451925666577, "grad_norm": 0.9115769460735773, "learning_rate": 9.976400708015811e-06, "loss": 0.42393884658813474, "num_input_tokens_seen": 40145168, "step": 920, "train_runtime": 7079.4173, "train_tokens_per_second": 5670.688 }, { "epoch": 0.06228117425262591, "grad_norm": 0.8414795692849011, "learning_rate": 9.97614342123967e-06, "loss": 0.4269254684448242, "num_input_tokens_seen": 40379264, "step": 925, "train_runtime": 7111.1373, "train_tokens_per_second": 5678.313 }, { "epoch": 0.06261782924858605, "grad_norm": 0.9352365482641929, "learning_rate": 9.97588474290089e-06, "loss": 0.4331661224365234, "num_input_tokens_seen": 40594944, "step": 930, "train_runtime": 7152.76, "train_tokens_per_second": 5675.424 }, { "epoch": 0.0629544842445462, "grad_norm": 1.0614310774414917, "learning_rate": 9.975624673071806e-06, "loss": 0.4371979236602783, "num_input_tokens_seen": 40808856, "step": 935, "train_runtime": 7197.718, "train_tokens_per_second": 5669.694 }, { "epoch": 0.06329113924050633, "grad_norm": 1.0079121416060646, "learning_rate": 9.97536321182515e-06, "loss": 0.4044677734375, "num_input_tokens_seen": 41018224, "step": 940, "train_runtime": 7227.9115, "train_tokens_per_second": 5674.976 }, { "epoch": 0.06362779423646647, "grad_norm": 0.9987688379119654, "learning_rate": 9.975100359234037e-06, "loss": 0.4564094066619873, "num_input_tokens_seen": 41239392, "step": 945, "train_runtime": 7265.9862, "train_tokens_per_second": 5675.677 }, { "epoch": 0.06396444923242661, "grad_norm": 0.9165255721069369, "learning_rate": 9.974836115371972e-06, "loss": 0.46511135101318357, "num_input_tokens_seen": 41454352, "step": 950, "train_runtime": 7304.5238, "train_tokens_per_second": 5675.161 }, { "epoch": 0.06430110422838675, "grad_norm": 0.9087923038014859, "learning_rate": 9.974570480312852e-06, "loss": 0.40421581268310547, "num_input_tokens_seen": 41680576, "step": 955, "train_runtime": 7346.7849, "train_tokens_per_second": 5673.308 }, { "epoch": 0.06463775922434689, "grad_norm": 1.0231903244202105, "learning_rate": 9.974303454130962e-06, "loss": 0.4464391231536865, "num_input_tokens_seen": 41882360, "step": 960, "train_runtime": 7380.8428, "train_tokens_per_second": 5674.469 }, { "epoch": 0.06497441422030703, "grad_norm": 0.8595399990273458, "learning_rate": 9.97403503690097e-06, "loss": 0.42637953758239744, "num_input_tokens_seen": 42103128, "step": 965, "train_runtime": 7415.439, "train_tokens_per_second": 5677.766 }, { "epoch": 0.06531106921626717, "grad_norm": 0.8422231085957664, "learning_rate": 9.973765228697942e-06, "loss": 0.39764556884765623, "num_input_tokens_seen": 42328192, "step": 970, "train_runtime": 7453.2347, "train_tokens_per_second": 5679.171 }, { "epoch": 0.06564772421222731, "grad_norm": 0.9247166172844082, "learning_rate": 9.973494029597327e-06, "loss": 0.43375320434570314, "num_input_tokens_seen": 42531664, "step": 975, "train_runtime": 7487.6836, "train_tokens_per_second": 5680.217 }, { "epoch": 0.06598437920818745, "grad_norm": 1.0151970555059149, "learning_rate": 9.973221439674968e-06, "loss": 0.4309089660644531, "num_input_tokens_seen": 42740856, "step": 980, "train_runtime": 7527.1188, "train_tokens_per_second": 5678.249 }, { "epoch": 0.06632103420414759, "grad_norm": 0.882649641197766, "learning_rate": 9.972947459007089e-06, "loss": 0.45548033714294434, "num_input_tokens_seen": 42956288, "step": 985, "train_runtime": 7562.7131, "train_tokens_per_second": 5680.01 }, { "epoch": 0.06665768920010773, "grad_norm": 0.9104741890803707, "learning_rate": 9.972672087670313e-06, "loss": 0.4385095119476318, "num_input_tokens_seen": 43177272, "step": 990, "train_runtime": 7599.4941, "train_tokens_per_second": 5681.598 }, { "epoch": 0.06699434419606787, "grad_norm": 0.8108451361340878, "learning_rate": 9.972395325741644e-06, "loss": 0.413985538482666, "num_input_tokens_seen": 43400152, "step": 995, "train_runtime": 7640.1047, "train_tokens_per_second": 5680.57 }, { "epoch": 0.06733099919202801, "grad_norm": 0.9025973522517067, "learning_rate": 9.972117173298476e-06, "loss": 0.38621523380279543, "num_input_tokens_seen": 43614968, "step": 1000, "train_runtime": 7674.2806, "train_tokens_per_second": 5683.265 }, { "epoch": 0.06766765418798815, "grad_norm": 0.971243318554936, "learning_rate": 9.971837630418597e-06, "loss": 0.42676420211791993, "num_input_tokens_seen": 43835904, "step": 1005, "train_runtime": 7717.1168, "train_tokens_per_second": 5680.347 }, { "epoch": 0.06800430918394829, "grad_norm": 0.9278937330533324, "learning_rate": 9.971556697180179e-06, "loss": 0.44001970291137693, "num_input_tokens_seen": 44048512, "step": 1010, "train_runtime": 7756.4813, "train_tokens_per_second": 5678.93 }, { "epoch": 0.06834096417990843, "grad_norm": 0.9429692040194982, "learning_rate": 9.971274373661784e-06, "loss": 0.4194046974182129, "num_input_tokens_seen": 44271000, "step": 1015, "train_runtime": 7787.4236, "train_tokens_per_second": 5684.935 }, { "epoch": 0.06867761917586857, "grad_norm": 1.111228553028809, "learning_rate": 9.97099065994236e-06, "loss": 0.39097912311553956, "num_input_tokens_seen": 44499576, "step": 1020, "train_runtime": 7822.0558, "train_tokens_per_second": 5688.987 }, { "epoch": 0.0690142741718287, "grad_norm": 1.0049309947436895, "learning_rate": 9.970705556101253e-06, "loss": 0.43691391944885255, "num_input_tokens_seen": 44702000, "step": 1025, "train_runtime": 7857.7887, "train_tokens_per_second": 5688.878 }, { "epoch": 0.06935092916778884, "grad_norm": 0.8982051488791603, "learning_rate": 9.970419062218186e-06, "loss": 0.45786590576171876, "num_input_tokens_seen": 44936832, "step": 1030, "train_runtime": 7899.821, "train_tokens_per_second": 5688.336 }, { "epoch": 0.06968758416374898, "grad_norm": 0.9779591960140872, "learning_rate": 9.970131178373276e-06, "loss": 0.4594112396240234, "num_input_tokens_seen": 45166720, "step": 1035, "train_runtime": 7937.6344, "train_tokens_per_second": 5690.199 }, { "epoch": 0.07002423915970914, "grad_norm": 0.9403137936019832, "learning_rate": 9.969841904647033e-06, "loss": 0.48036918640136717, "num_input_tokens_seen": 45386112, "step": 1040, "train_runtime": 7975.3873, "train_tokens_per_second": 5690.772 }, { "epoch": 0.07036089415566928, "grad_norm": 0.9489869208797291, "learning_rate": 9.969551241120349e-06, "loss": 0.4358417510986328, "num_input_tokens_seen": 45615968, "step": 1045, "train_runtime": 8008.3857, "train_tokens_per_second": 5696.025 }, { "epoch": 0.07069754915162942, "grad_norm": 0.8565455428368292, "learning_rate": 9.969259187874507e-06, "loss": 0.40404400825500486, "num_input_tokens_seen": 45846704, "step": 1050, "train_runtime": 8044.3345, "train_tokens_per_second": 5699.254 }, { "epoch": 0.07103420414758956, "grad_norm": 0.9631616045121916, "learning_rate": 9.968965744991178e-06, "loss": 0.43367910385131836, "num_input_tokens_seen": 46069384, "step": 1055, "train_runtime": 8075.3735, "train_tokens_per_second": 5704.923 }, { "epoch": 0.0713708591435497, "grad_norm": 0.923891258768515, "learning_rate": 9.968670912552422e-06, "loss": 0.41605100631713865, "num_input_tokens_seen": 46289280, "step": 1060, "train_runtime": 8110.2287, "train_tokens_per_second": 5707.518 }, { "epoch": 0.07170751413950983, "grad_norm": 0.9199449654930428, "learning_rate": 9.968374690640692e-06, "loss": 0.4259674072265625, "num_input_tokens_seen": 46513832, "step": 1065, "train_runtime": 8149.1273, "train_tokens_per_second": 5707.83 }, { "epoch": 0.07204416913546997, "grad_norm": 0.9349037827416551, "learning_rate": 9.968077079338822e-06, "loss": 0.44624719619750974, "num_input_tokens_seen": 46732528, "step": 1070, "train_runtime": 8183.763, "train_tokens_per_second": 5710.396 }, { "epoch": 0.07238082413143011, "grad_norm": 0.9411351171686876, "learning_rate": 9.967778078730038e-06, "loss": 0.4426886558532715, "num_input_tokens_seen": 46948464, "step": 1075, "train_runtime": 8220.2593, "train_tokens_per_second": 5711.312 }, { "epoch": 0.07271747912739025, "grad_norm": 0.9433124357981822, "learning_rate": 9.967477688897957e-06, "loss": 0.44336910247802735, "num_input_tokens_seen": 47171032, "step": 1080, "train_runtime": 8259.7389, "train_tokens_per_second": 5710.959 }, { "epoch": 0.07305413412335039, "grad_norm": 0.8570101786695654, "learning_rate": 9.967175909926578e-06, "loss": 0.46260600090026854, "num_input_tokens_seen": 47402968, "step": 1085, "train_runtime": 8293.6887, "train_tokens_per_second": 5715.547 }, { "epoch": 0.07339078911931053, "grad_norm": 0.967581695257143, "learning_rate": 9.966872741900296e-06, "loss": 0.4760030746459961, "num_input_tokens_seen": 47634040, "step": 1090, "train_runtime": 8342.26, "train_tokens_per_second": 5709.968 }, { "epoch": 0.07372744411527067, "grad_norm": 1.3602823694752813, "learning_rate": 9.96656818490389e-06, "loss": 0.4523357391357422, "num_input_tokens_seen": 47849424, "step": 1095, "train_runtime": 8378.4116, "train_tokens_per_second": 5711.038 }, { "epoch": 0.07406409911123081, "grad_norm": 0.8798163617081339, "learning_rate": 9.966262239022529e-06, "loss": 0.48172898292541505, "num_input_tokens_seen": 48074544, "step": 1100, "train_runtime": 8414.2774, "train_tokens_per_second": 5713.449 }, { "epoch": 0.07440075410719095, "grad_norm": 0.8689729621566785, "learning_rate": 9.965954904341768e-06, "loss": 0.4594748497009277, "num_input_tokens_seen": 48294808, "step": 1105, "train_runtime": 8453.2631, "train_tokens_per_second": 5713.156 }, { "epoch": 0.07473740910315109, "grad_norm": 0.9298500312875317, "learning_rate": 9.965646180947555e-06, "loss": 0.44074625968933107, "num_input_tokens_seen": 48509312, "step": 1110, "train_runtime": 8496.7093, "train_tokens_per_second": 5709.188 }, { "epoch": 0.07507406409911123, "grad_norm": 0.9049700587066084, "learning_rate": 9.96533606892622e-06, "loss": 0.42275848388671877, "num_input_tokens_seen": 48715504, "step": 1115, "train_runtime": 8533.5132, "train_tokens_per_second": 5708.728 }, { "epoch": 0.07541071909507137, "grad_norm": 0.882919522521347, "learning_rate": 9.965024568364487e-06, "loss": 0.4448400497436523, "num_input_tokens_seen": 48944392, "step": 1120, "train_runtime": 8571.3237, "train_tokens_per_second": 5710.249 }, { "epoch": 0.07574737409103151, "grad_norm": 0.9374688066893563, "learning_rate": 9.964711679349467e-06, "loss": 0.41461782455444335, "num_input_tokens_seen": 49155824, "step": 1125, "train_runtime": 8611.0892, "train_tokens_per_second": 5708.433 }, { "epoch": 0.07608402908699165, "grad_norm": 0.7995128542211772, "learning_rate": 9.964397401968656e-06, "loss": 0.46135854721069336, "num_input_tokens_seen": 49380912, "step": 1130, "train_runtime": 8650.8346, "train_tokens_per_second": 5708.225 }, { "epoch": 0.07642068408295179, "grad_norm": 0.8607214899503258, "learning_rate": 9.964081736309942e-06, "loss": 0.41400885581970215, "num_input_tokens_seen": 49617456, "step": 1135, "train_runtime": 8688.4749, "train_tokens_per_second": 5710.721 }, { "epoch": 0.07675733907891193, "grad_norm": 0.8715957366665356, "learning_rate": 9.963764682461599e-06, "loss": 0.4346445083618164, "num_input_tokens_seen": 49848584, "step": 1140, "train_runtime": 8722.1234, "train_tokens_per_second": 5715.189 }, { "epoch": 0.07709399407487207, "grad_norm": 0.8561235152822287, "learning_rate": 9.96344624051229e-06, "loss": 0.4340538501739502, "num_input_tokens_seen": 50065696, "step": 1145, "train_runtime": 8762.0281, "train_tokens_per_second": 5713.939 }, { "epoch": 0.0774306490708322, "grad_norm": 0.929804620150381, "learning_rate": 9.96312641055107e-06, "loss": 0.4169576644897461, "num_input_tokens_seen": 50283968, "step": 1150, "train_runtime": 8801.5092, "train_tokens_per_second": 5713.107 }, { "epoch": 0.07776730406679234, "grad_norm": 0.752419655730966, "learning_rate": 9.962805192667375e-06, "loss": 0.41555070877075195, "num_input_tokens_seen": 50500904, "step": 1155, "train_runtime": 8848.2982, "train_tokens_per_second": 5707.414 }, { "epoch": 0.07810395906275248, "grad_norm": 1.0612801529163063, "learning_rate": 9.962482586951033e-06, "loss": 0.4202773094177246, "num_input_tokens_seen": 50733408, "step": 1160, "train_runtime": 8889.0849, "train_tokens_per_second": 5707.383 }, { "epoch": 0.07844061405871264, "grad_norm": 0.9990837210097588, "learning_rate": 9.962158593492258e-06, "loss": 0.442533016204834, "num_input_tokens_seen": 50939416, "step": 1165, "train_runtime": 8930.0327, "train_tokens_per_second": 5704.281 }, { "epoch": 0.07877726905467278, "grad_norm": 0.8491329656110541, "learning_rate": 9.961833212381657e-06, "loss": 0.4386699676513672, "num_input_tokens_seen": 51160880, "step": 1170, "train_runtime": 8967.7862, "train_tokens_per_second": 5704.962 }, { "epoch": 0.07911392405063292, "grad_norm": 0.8233317233024117, "learning_rate": 9.961506443710221e-06, "loss": 0.4202608108520508, "num_input_tokens_seen": 51382192, "step": 1175, "train_runtime": 9009.4779, "train_tokens_per_second": 5703.126 }, { "epoch": 0.07945057904659306, "grad_norm": 1.1740908151711091, "learning_rate": 9.961178287569326e-06, "loss": 0.4113266944885254, "num_input_tokens_seen": 51610400, "step": 1180, "train_runtime": 9043.5038, "train_tokens_per_second": 5706.903 }, { "epoch": 0.0797872340425532, "grad_norm": 0.9683671789990694, "learning_rate": 9.960848744050747e-06, "loss": 0.44871106147766116, "num_input_tokens_seen": 51828672, "step": 1185, "train_runtime": 9085.7121, "train_tokens_per_second": 5704.415 }, { "epoch": 0.08012388903851334, "grad_norm": 0.7384402440175095, "learning_rate": 9.960517813246633e-06, "loss": 0.44126176834106445, "num_input_tokens_seen": 52038752, "step": 1190, "train_runtime": 9126.3974, "train_tokens_per_second": 5702.004 }, { "epoch": 0.08046054403447347, "grad_norm": 0.9518446142368773, "learning_rate": 9.96018549524953e-06, "loss": 0.4168846607208252, "num_input_tokens_seen": 52257272, "step": 1195, "train_runtime": 9165.705, "train_tokens_per_second": 5701.391 }, { "epoch": 0.08079719903043361, "grad_norm": 0.9426346640072512, "learning_rate": 9.959851790152371e-06, "loss": 0.41556696891784667, "num_input_tokens_seen": 52478032, "step": 1200, "train_runtime": 9204.8312, "train_tokens_per_second": 5701.14 }, { "epoch": 0.08113385402639375, "grad_norm": 0.8462737285766736, "learning_rate": 9.959516698048475e-06, "loss": 0.3835282325744629, "num_input_tokens_seen": 52684592, "step": 1205, "train_runtime": 9245.4602, "train_tokens_per_second": 5698.428 }, { "epoch": 0.08147050902235389, "grad_norm": 0.8765077742279136, "learning_rate": 9.959180219031551e-06, "loss": 0.4106024742126465, "num_input_tokens_seen": 52895048, "step": 1210, "train_runtime": 9284.6342, "train_tokens_per_second": 5697.052 }, { "epoch": 0.08180716401831403, "grad_norm": 0.8799539327811132, "learning_rate": 9.958842353195688e-06, "loss": 0.4241660118103027, "num_input_tokens_seen": 53122496, "step": 1215, "train_runtime": 9323.4499, "train_tokens_per_second": 5697.73 }, { "epoch": 0.08214381901427417, "grad_norm": 0.8851017529748658, "learning_rate": 9.958503100635377e-06, "loss": 0.43586392402648927, "num_input_tokens_seen": 53331344, "step": 1220, "train_runtime": 9359.4211, "train_tokens_per_second": 5698.146 }, { "epoch": 0.08248047401023431, "grad_norm": 0.9611985454606802, "learning_rate": 9.958162461445484e-06, "loss": 0.4607269287109375, "num_input_tokens_seen": 53560160, "step": 1225, "train_runtime": 9398.2675, "train_tokens_per_second": 5698.94 }, { "epoch": 0.08281712900619445, "grad_norm": 0.9067497311826802, "learning_rate": 9.957820435721271e-06, "loss": 0.4349203586578369, "num_input_tokens_seen": 53775560, "step": 1230, "train_runtime": 9435.4003, "train_tokens_per_second": 5699.341 }, { "epoch": 0.08315378400215459, "grad_norm": 0.963108721688269, "learning_rate": 9.95747702355838e-06, "loss": 0.45670351982116697, "num_input_tokens_seen": 54000808, "step": 1235, "train_runtime": 9470.0321, "train_tokens_per_second": 5702.284 }, { "epoch": 0.08349043899811473, "grad_norm": 0.8513390607173822, "learning_rate": 9.957132225052848e-06, "loss": 0.4656820297241211, "num_input_tokens_seen": 54218336, "step": 1240, "train_runtime": 9509.4298, "train_tokens_per_second": 5701.534 }, { "epoch": 0.08382709399407487, "grad_norm": 0.8033639657062732, "learning_rate": 9.956786040301098e-06, "loss": 0.407243537902832, "num_input_tokens_seen": 54435576, "step": 1245, "train_runtime": 9549.0218, "train_tokens_per_second": 5700.644 }, { "epoch": 0.08416374899003501, "grad_norm": 0.9112338258739832, "learning_rate": 9.956438469399936e-06, "loss": 0.42780628204345705, "num_input_tokens_seen": 54646448, "step": 1250, "train_runtime": 9584.5449, "train_tokens_per_second": 5701.517 }, { "epoch": 0.08450040398599515, "grad_norm": 0.898524764750954, "learning_rate": 9.956089512446562e-06, "loss": 0.4281005859375, "num_input_tokens_seen": 54849384, "step": 1255, "train_runtime": 9624.8869, "train_tokens_per_second": 5698.704 }, { "epoch": 0.08483705898195529, "grad_norm": 0.9393978257221618, "learning_rate": 9.955739169538559e-06, "loss": 0.43431816101074217, "num_input_tokens_seen": 55062944, "step": 1260, "train_runtime": 9664.3501, "train_tokens_per_second": 5697.532 }, { "epoch": 0.08517371397791543, "grad_norm": 0.9086736133443781, "learning_rate": 9.955387440773902e-06, "loss": 0.4328322887420654, "num_input_tokens_seen": 55267032, "step": 1265, "train_runtime": 9704.5196, "train_tokens_per_second": 5694.979 }, { "epoch": 0.08551036897387557, "grad_norm": 1.1824810596928264, "learning_rate": 9.955034326250947e-06, "loss": 0.42726478576660154, "num_input_tokens_seen": 55485176, "step": 1270, "train_runtime": 9740.2982, "train_tokens_per_second": 5696.456 }, { "epoch": 0.0858470239698357, "grad_norm": 0.981019269531651, "learning_rate": 9.954679826068444e-06, "loss": 0.431905460357666, "num_input_tokens_seen": 55697472, "step": 1275, "train_runtime": 9778.2861, "train_tokens_per_second": 5696.036 }, { "epoch": 0.08618367896579585, "grad_norm": 0.9167947068742166, "learning_rate": 9.954323940325526e-06, "loss": 0.4367355823516846, "num_input_tokens_seen": 55909208, "step": 1280, "train_runtime": 9815.8422, "train_tokens_per_second": 5695.814 }, { "epoch": 0.086520333961756, "grad_norm": 0.8284962122347568, "learning_rate": 9.953966669121715e-06, "loss": 0.4562966346740723, "num_input_tokens_seen": 56144336, "step": 1285, "train_runtime": 9855.4694, "train_tokens_per_second": 5696.769 }, { "epoch": 0.08685698895771614, "grad_norm": 0.9908373153090002, "learning_rate": 9.953608012556924e-06, "loss": 0.4428553581237793, "num_input_tokens_seen": 56370632, "step": 1290, "train_runtime": 9900.5066, "train_tokens_per_second": 5693.712 }, { "epoch": 0.08719364395367628, "grad_norm": 0.8603920936193332, "learning_rate": 9.953247970731449e-06, "loss": 0.4518705368041992, "num_input_tokens_seen": 56581824, "step": 1295, "train_runtime": 9941.9268, "train_tokens_per_second": 5691.233 }, { "epoch": 0.08753029894963642, "grad_norm": 1.0065353834353872, "learning_rate": 9.952886543745973e-06, "loss": 0.45711684226989746, "num_input_tokens_seen": 56797912, "step": 1300, "train_runtime": 9983.8473, "train_tokens_per_second": 5688.98 }, { "epoch": 0.08786695394559656, "grad_norm": 0.9704989049669684, "learning_rate": 9.952523731701566e-06, "loss": 0.43997964859008787, "num_input_tokens_seen": 57028400, "step": 1305, "train_runtime": 10023.0235, "train_tokens_per_second": 5689.74 }, { "epoch": 0.0882036089415567, "grad_norm": 0.7746848672115061, "learning_rate": 9.952159534699693e-06, "loss": 0.39839365482330324, "num_input_tokens_seen": 57239112, "step": 1310, "train_runtime": 10060.0427, "train_tokens_per_second": 5689.748 }, { "epoch": 0.08854026393751684, "grad_norm": 0.8703667437003134, "learning_rate": 9.951793952842197e-06, "loss": 0.46162776947021483, "num_input_tokens_seen": 57451840, "step": 1315, "train_runtime": 10090.9799, "train_tokens_per_second": 5693.386 }, { "epoch": 0.08887691893347698, "grad_norm": 0.9970523155610451, "learning_rate": 9.95142698623131e-06, "loss": 0.4125502109527588, "num_input_tokens_seen": 57649616, "step": 1320, "train_runtime": 10134.3943, "train_tokens_per_second": 5688.511 }, { "epoch": 0.08921357392943711, "grad_norm": 0.8982754367798736, "learning_rate": 9.951058634969657e-06, "loss": 0.4594625473022461, "num_input_tokens_seen": 57859504, "step": 1325, "train_runtime": 10173.3422, "train_tokens_per_second": 5687.364 }, { "epoch": 0.08955022892539725, "grad_norm": 0.8441984007212928, "learning_rate": 9.950688899160244e-06, "loss": 0.42917823791503906, "num_input_tokens_seen": 58092104, "step": 1330, "train_runtime": 10208.5539, "train_tokens_per_second": 5690.532 }, { "epoch": 0.0898868839213574, "grad_norm": 0.8326739767212783, "learning_rate": 9.950317778906469e-06, "loss": 0.4345374584197998, "num_input_tokens_seen": 58319256, "step": 1335, "train_runtime": 10249.3358, "train_tokens_per_second": 5690.052 }, { "epoch": 0.09022353891731753, "grad_norm": 0.8294890352349942, "learning_rate": 9.949945274312109e-06, "loss": 0.40816512107849123, "num_input_tokens_seen": 58540424, "step": 1340, "train_runtime": 10287.6498, "train_tokens_per_second": 5690.359 }, { "epoch": 0.09056019391327767, "grad_norm": 0.968521031703479, "learning_rate": 9.94957138548134e-06, "loss": 0.4445356369018555, "num_input_tokens_seen": 58736800, "step": 1345, "train_runtime": 10326.024, "train_tokens_per_second": 5688.23 }, { "epoch": 0.09089684890923781, "grad_norm": 1.007040150938243, "learning_rate": 9.949196112518715e-06, "loss": 0.41266183853149413, "num_input_tokens_seen": 58963840, "step": 1350, "train_runtime": 10361.3193, "train_tokens_per_second": 5690.766 }, { "epoch": 0.09123350390519795, "grad_norm": 0.8518178617284553, "learning_rate": 9.94881945552918e-06, "loss": 0.43543500900268556, "num_input_tokens_seen": 59186072, "step": 1355, "train_runtime": 10406.6964, "train_tokens_per_second": 5687.307 }, { "epoch": 0.09157015890115809, "grad_norm": 0.9351761092832128, "learning_rate": 9.948441414618064e-06, "loss": 0.45530238151550295, "num_input_tokens_seen": 59396096, "step": 1360, "train_runtime": 10448.5625, "train_tokens_per_second": 5684.619 }, { "epoch": 0.09190681389711823, "grad_norm": 0.976556409327906, "learning_rate": 9.948061989891085e-06, "loss": 0.41725835800170896, "num_input_tokens_seen": 59621960, "step": 1365, "train_runtime": 10484.4296, "train_tokens_per_second": 5686.715 }, { "epoch": 0.09224346889307837, "grad_norm": 0.9413072947091584, "learning_rate": 9.94768118145435e-06, "loss": 0.4238771438598633, "num_input_tokens_seen": 59834688, "step": 1370, "train_runtime": 10521.7898, "train_tokens_per_second": 5686.74 }, { "epoch": 0.09258012388903851, "grad_norm": 0.8072753824687519, "learning_rate": 9.947298989414349e-06, "loss": 0.4197520732879639, "num_input_tokens_seen": 60061512, "step": 1375, "train_runtime": 10562.6863, "train_tokens_per_second": 5686.197 }, { "epoch": 0.09291677888499865, "grad_norm": 0.8243851964827824, "learning_rate": 9.946915413877963e-06, "loss": 0.4294243812561035, "num_input_tokens_seen": 60289152, "step": 1380, "train_runtime": 10608.7449, "train_tokens_per_second": 5682.967 }, { "epoch": 0.09325343388095879, "grad_norm": 0.8639433441786879, "learning_rate": 9.946530454952454e-06, "loss": 0.44629898071289065, "num_input_tokens_seen": 60516576, "step": 1385, "train_runtime": 10649.4064, "train_tokens_per_second": 5682.624 }, { "epoch": 0.09359008887691893, "grad_norm": 0.9381874141159465, "learning_rate": 9.946144112745477e-06, "loss": 0.4549723625183105, "num_input_tokens_seen": 60744096, "step": 1390, "train_runtime": 10690.6621, "train_tokens_per_second": 5681.977 }, { "epoch": 0.09392674387287907, "grad_norm": 0.9598970905259178, "learning_rate": 9.94575638736507e-06, "loss": 0.4265571594238281, "num_input_tokens_seen": 60970464, "step": 1395, "train_runtime": 10730.6636, "train_tokens_per_second": 5681.891 }, { "epoch": 0.09426339886883921, "grad_norm": 0.8882564184072146, "learning_rate": 9.945367278919662e-06, "loss": 0.469175910949707, "num_input_tokens_seen": 61195536, "step": 1400, "train_runtime": 10771.6796, "train_tokens_per_second": 5681.151 }, { "epoch": 0.09460005386479936, "grad_norm": 0.8345645071811238, "learning_rate": 9.944976787518064e-06, "loss": 0.43855986595153806, "num_input_tokens_seen": 61415400, "step": 1405, "train_runtime": 10804.9607, "train_tokens_per_second": 5684.0 }, { "epoch": 0.0949367088607595, "grad_norm": 1.0139184695279284, "learning_rate": 9.944584913269474e-06, "loss": 0.43834495544433594, "num_input_tokens_seen": 61645440, "step": 1410, "train_runtime": 10846.1692, "train_tokens_per_second": 5683.614 }, { "epoch": 0.09527336385671964, "grad_norm": 0.8171057323619708, "learning_rate": 9.944191656283481e-06, "loss": 0.41381168365478516, "num_input_tokens_seen": 61868952, "step": 1415, "train_runtime": 10885.6156, "train_tokens_per_second": 5683.551 }, { "epoch": 0.09561001885267978, "grad_norm": 0.8671727475302144, "learning_rate": 9.943797016670059e-06, "loss": 0.41778225898742677, "num_input_tokens_seen": 62081744, "step": 1420, "train_runtime": 10924.1913, "train_tokens_per_second": 5682.96 }, { "epoch": 0.09594667384863992, "grad_norm": 0.9139643587899275, "learning_rate": 9.943400994539565e-06, "loss": 0.41177783012390134, "num_input_tokens_seen": 62299552, "step": 1425, "train_runtime": 10963.2034, "train_tokens_per_second": 5682.605 }, { "epoch": 0.09628332884460006, "grad_norm": 0.8942790678032806, "learning_rate": 9.943003590002744e-06, "loss": 0.4324612617492676, "num_input_tokens_seen": 62524424, "step": 1430, "train_runtime": 11003.5976, "train_tokens_per_second": 5682.18 }, { "epoch": 0.0966199838405602, "grad_norm": 0.9134672447344226, "learning_rate": 9.942604803170733e-06, "loss": 0.4207320690155029, "num_input_tokens_seen": 62736736, "step": 1435, "train_runtime": 11041.0071, "train_tokens_per_second": 5682.157 }, { "epoch": 0.09695663883652034, "grad_norm": 1.078284335277287, "learning_rate": 9.94220463415505e-06, "loss": 0.4587702751159668, "num_input_tokens_seen": 62950552, "step": 1440, "train_runtime": 11082.5134, "train_tokens_per_second": 5680.169 }, { "epoch": 0.09729329383248048, "grad_norm": 0.8211105532018887, "learning_rate": 9.9418030830676e-06, "loss": 0.4369199752807617, "num_input_tokens_seen": 63173304, "step": 1445, "train_runtime": 11119.7396, "train_tokens_per_second": 5681.186 }, { "epoch": 0.09762994882844062, "grad_norm": 0.9975227482376734, "learning_rate": 9.941400150020676e-06, "loss": 0.45250940322875977, "num_input_tokens_seen": 63376456, "step": 1450, "train_runtime": 11153.3434, "train_tokens_per_second": 5682.283 }, { "epoch": 0.09796660382440076, "grad_norm": 0.875023853319168, "learning_rate": 9.940995835126957e-06, "loss": 0.4510367393493652, "num_input_tokens_seen": 63598704, "step": 1455, "train_runtime": 11190.4484, "train_tokens_per_second": 5683.303 }, { "epoch": 0.0983032588203609, "grad_norm": 0.7795257917882069, "learning_rate": 9.940590138499508e-06, "loss": 0.4070897102355957, "num_input_tokens_seen": 63824984, "step": 1460, "train_runtime": 11228.0323, "train_tokens_per_second": 5684.432 }, { "epoch": 0.09863991381632103, "grad_norm": 0.9802634486624268, "learning_rate": 9.940183060251783e-06, "loss": 0.424533748626709, "num_input_tokens_seen": 64020440, "step": 1465, "train_runtime": 11269.0538, "train_tokens_per_second": 5681.084 }, { "epoch": 0.09897656881228117, "grad_norm": 0.8129225031494536, "learning_rate": 9.939774600497616e-06, "loss": 0.3772727489471436, "num_input_tokens_seen": 64237912, "step": 1470, "train_runtime": 11305.1846, "train_tokens_per_second": 5682.164 }, { "epoch": 0.09931322380824131, "grad_norm": 0.876095085095231, "learning_rate": 9.939364759351236e-06, "loss": 0.43614888191223145, "num_input_tokens_seen": 64452808, "step": 1475, "train_runtime": 11342.3271, "train_tokens_per_second": 5682.503 }, { "epoch": 0.09964987880420145, "grad_norm": 0.8249502349163025, "learning_rate": 9.938953536927249e-06, "loss": 0.4052250862121582, "num_input_tokens_seen": 64679536, "step": 1480, "train_runtime": 11380.8832, "train_tokens_per_second": 5683.174 }, { "epoch": 0.09998653380016159, "grad_norm": 0.8004037055954487, "learning_rate": 9.938540933340657e-06, "loss": 0.43981304168701174, "num_input_tokens_seen": 64907672, "step": 1485, "train_runtime": 11414.3496, "train_tokens_per_second": 5686.498 }, { "epoch": 0.10032318879612173, "grad_norm": 0.7556539983829699, "learning_rate": 9.938126948706839e-06, "loss": 0.4235081195831299, "num_input_tokens_seen": 65134656, "step": 1490, "train_runtime": 11451.1493, "train_tokens_per_second": 5688.045 }, { "epoch": 0.10065984379208187, "grad_norm": 0.7974202081471553, "learning_rate": 9.937711583141567e-06, "loss": 0.41340045928955077, "num_input_tokens_seen": 65353344, "step": 1495, "train_runtime": 11488.8753, "train_tokens_per_second": 5688.402 }, { "epoch": 0.10099649878804201, "grad_norm": 0.9113055103223531, "learning_rate": 9.937294836760995e-06, "loss": 0.43211612701416013, "num_input_tokens_seen": 65570904, "step": 1500, "train_runtime": 11525.754, "train_tokens_per_second": 5689.077 }, { "epoch": 0.10133315378400215, "grad_norm": 0.9362482868425025, "learning_rate": 9.936876709681668e-06, "loss": 0.4765140533447266, "num_input_tokens_seen": 65784200, "step": 1505, "train_runtime": 11567.0824, "train_tokens_per_second": 5687.19 }, { "epoch": 0.10166980877996229, "grad_norm": 0.7345279591609306, "learning_rate": 9.93645720202051e-06, "loss": 0.3693789005279541, "num_input_tokens_seen": 66002240, "step": 1510, "train_runtime": 11603.3588, "train_tokens_per_second": 5688.201 }, { "epoch": 0.10200646377592243, "grad_norm": 0.8440448421494396, "learning_rate": 9.936036313894836e-06, "loss": 0.46529722213745117, "num_input_tokens_seen": 66217160, "step": 1515, "train_runtime": 11637.8846, "train_tokens_per_second": 5689.793 }, { "epoch": 0.10234311877188257, "grad_norm": 0.9288537021329782, "learning_rate": 9.935614045422349e-06, "loss": 0.4474299907684326, "num_input_tokens_seen": 66437216, "step": 1520, "train_runtime": 11674.3858, "train_tokens_per_second": 5690.853 }, { "epoch": 0.10267977376784271, "grad_norm": 0.7816250239377797, "learning_rate": 9.935190396721132e-06, "loss": 0.4093039035797119, "num_input_tokens_seen": 66659632, "step": 1525, "train_runtime": 11714.7321, "train_tokens_per_second": 5690.24 }, { "epoch": 0.10301642876380286, "grad_norm": 0.868350723790852, "learning_rate": 9.934765367909658e-06, "loss": 0.442030143737793, "num_input_tokens_seen": 66874200, "step": 1530, "train_runtime": 11751.0775, "train_tokens_per_second": 5690.899 }, { "epoch": 0.103353083759763, "grad_norm": 0.9654553160320544, "learning_rate": 9.934338959106783e-06, "loss": 0.4125958442687988, "num_input_tokens_seen": 67096584, "step": 1535, "train_runtime": 11787.6988, "train_tokens_per_second": 5692.085 }, { "epoch": 0.10368973875572314, "grad_norm": 1.0001250180683936, "learning_rate": 9.933911170431753e-06, "loss": 0.45245895385742185, "num_input_tokens_seen": 67300344, "step": 1540, "train_runtime": 11825.444, "train_tokens_per_second": 5691.147 }, { "epoch": 0.10402639375168328, "grad_norm": 0.9480950052674862, "learning_rate": 9.933482002004198e-06, "loss": 0.4369757652282715, "num_input_tokens_seen": 67528208, "step": 1545, "train_runtime": 11868.3124, "train_tokens_per_second": 5689.79 }, { "epoch": 0.10436304874764342, "grad_norm": 1.049191818835591, "learning_rate": 9.933051453944134e-06, "loss": 0.47658519744873046, "num_input_tokens_seen": 67752368, "step": 1550, "train_runtime": 11899.3433, "train_tokens_per_second": 5693.791 }, { "epoch": 0.10469970374360356, "grad_norm": 0.8519840991796084, "learning_rate": 9.932619526371958e-06, "loss": 0.4100327014923096, "num_input_tokens_seen": 67972272, "step": 1555, "train_runtime": 11933.0537, "train_tokens_per_second": 5696.134 }, { "epoch": 0.1050363587395637, "grad_norm": 0.8587262694316211, "learning_rate": 9.932186219408463e-06, "loss": 0.40094866752624514, "num_input_tokens_seen": 68182312, "step": 1560, "train_runtime": 11973.5123, "train_tokens_per_second": 5694.429 }, { "epoch": 0.10537301373552384, "grad_norm": 0.9397299864907294, "learning_rate": 9.931751533174819e-06, "loss": 0.44454145431518555, "num_input_tokens_seen": 68389480, "step": 1565, "train_runtime": 12014.0801, "train_tokens_per_second": 5692.444 }, { "epoch": 0.10570966873148398, "grad_norm": 0.9745376383539546, "learning_rate": 9.931315467792584e-06, "loss": 0.45273237228393554, "num_input_tokens_seen": 68625472, "step": 1570, "train_runtime": 12045.9213, "train_tokens_per_second": 5696.988 }, { "epoch": 0.10604632372744412, "grad_norm": 0.796989168878711, "learning_rate": 9.930878023383705e-06, "loss": 0.4475082874298096, "num_input_tokens_seen": 68842256, "step": 1575, "train_runtime": 12081.8379, "train_tokens_per_second": 5697.995 }, { "epoch": 0.10638297872340426, "grad_norm": 0.7777899346165759, "learning_rate": 9.93043920007051e-06, "loss": 0.39358346462249755, "num_input_tokens_seen": 69063336, "step": 1580, "train_runtime": 12120.9279, "train_tokens_per_second": 5697.859 }, { "epoch": 0.1067196337193644, "grad_norm": 0.856296656865995, "learning_rate": 9.929998997975712e-06, "loss": 0.40912957191467286, "num_input_tokens_seen": 69297392, "step": 1585, "train_runtime": 12157.5274, "train_tokens_per_second": 5699.958 }, { "epoch": 0.10705628871532454, "grad_norm": 0.8406798760366443, "learning_rate": 9.929557417222417e-06, "loss": 0.4154947280883789, "num_input_tokens_seen": 69502272, "step": 1590, "train_runtime": 12195.0467, "train_tokens_per_second": 5699.221 }, { "epoch": 0.10739294371128467, "grad_norm": 0.8506547801105618, "learning_rate": 9.929114457934109e-06, "loss": 0.433414888381958, "num_input_tokens_seen": 69718712, "step": 1595, "train_runtime": 12235.8524, "train_tokens_per_second": 5697.904 }, { "epoch": 0.10772959870724481, "grad_norm": 0.8306444786085215, "learning_rate": 9.92867012023466e-06, "loss": 0.429976749420166, "num_input_tokens_seen": 69942920, "step": 1600, "train_runtime": 12275.1053, "train_tokens_per_second": 5697.949 }, { "epoch": 0.10806625370320495, "grad_norm": 0.8083632874129185, "learning_rate": 9.92822440424833e-06, "loss": 0.465771484375, "num_input_tokens_seen": 70167408, "step": 1605, "train_runtime": 12311.856, "train_tokens_per_second": 5699.174 }, { "epoch": 0.1084029086991651, "grad_norm": 0.8623025104703945, "learning_rate": 9.927777310099759e-06, "loss": 0.4795114040374756, "num_input_tokens_seen": 70398096, "step": 1610, "train_runtime": 12355.4012, "train_tokens_per_second": 5697.759 }, { "epoch": 0.10873956369512523, "grad_norm": 0.8734280942811361, "learning_rate": 9.927328837913976e-06, "loss": 0.42298336029052735, "num_input_tokens_seen": 70621368, "step": 1615, "train_runtime": 12392.0717, "train_tokens_per_second": 5698.915 }, { "epoch": 0.10907621869108537, "grad_norm": 0.8755533500883431, "learning_rate": 9.926878987816397e-06, "loss": 0.4128897666931152, "num_input_tokens_seen": 70850496, "step": 1620, "train_runtime": 12432.0003, "train_tokens_per_second": 5699.042 }, { "epoch": 0.10941287368704551, "grad_norm": 0.7849562344468639, "learning_rate": 9.92642775993282e-06, "loss": 0.40384368896484374, "num_input_tokens_seen": 71078912, "step": 1625, "train_runtime": 12472.6839, "train_tokens_per_second": 5698.766 }, { "epoch": 0.10974952868300565, "grad_norm": 0.8314524460612794, "learning_rate": 9.925975154389428e-06, "loss": 0.39646482467651367, "num_input_tokens_seen": 71291944, "step": 1630, "train_runtime": 12512.7857, "train_tokens_per_second": 5697.528 }, { "epoch": 0.11008618367896579, "grad_norm": 0.8397438217714046, "learning_rate": 9.925521171312792e-06, "loss": 0.41344375610351564, "num_input_tokens_seen": 71513056, "step": 1635, "train_runtime": 12552.1031, "train_tokens_per_second": 5697.297 }, { "epoch": 0.11042283867492593, "grad_norm": 0.8717786503893655, "learning_rate": 9.925065810829868e-06, "loss": 0.43964757919311526, "num_input_tokens_seen": 71712776, "step": 1640, "train_runtime": 12592.8232, "train_tokens_per_second": 5694.734 }, { "epoch": 0.11075949367088607, "grad_norm": 0.8466265387114118, "learning_rate": 9.924609073067994e-06, "loss": 0.45009913444519045, "num_input_tokens_seen": 71918888, "step": 1645, "train_runtime": 12637.095, "train_tokens_per_second": 5691.093 }, { "epoch": 0.11109614866684622, "grad_norm": 0.8202088060176734, "learning_rate": 9.924150958154897e-06, "loss": 0.43289871215820314, "num_input_tokens_seen": 72144880, "step": 1650, "train_runtime": 12679.4137, "train_tokens_per_second": 5689.922 }, { "epoch": 0.11143280366280636, "grad_norm": 0.8241473767552461, "learning_rate": 9.923691466218686e-06, "loss": 0.4033914566040039, "num_input_tokens_seen": 72368424, "step": 1655, "train_runtime": 12722.761, "train_tokens_per_second": 5688.107 }, { "epoch": 0.1117694586587665, "grad_norm": 0.9179601239629808, "learning_rate": 9.923230597387856e-06, "loss": 0.4340330123901367, "num_input_tokens_seen": 72604440, "step": 1660, "train_runtime": 12760.3543, "train_tokens_per_second": 5689.845 }, { "epoch": 0.11210611365472664, "grad_norm": 0.9667829858136964, "learning_rate": 9.922768351791289e-06, "loss": 0.45328373908996583, "num_input_tokens_seen": 72822440, "step": 1665, "train_runtime": 12804.6293, "train_tokens_per_second": 5687.196 }, { "epoch": 0.11244276865068678, "grad_norm": 0.9239911563296863, "learning_rate": 9.92230472955825e-06, "loss": 0.41826558113098145, "num_input_tokens_seen": 73042800, "step": 1670, "train_runtime": 12838.5402, "train_tokens_per_second": 5689.338 }, { "epoch": 0.11277942364664692, "grad_norm": 0.8636254640310012, "learning_rate": 9.92183973081839e-06, "loss": 0.3946269750595093, "num_input_tokens_seen": 73268056, "step": 1675, "train_runtime": 12882.6482, "train_tokens_per_second": 5687.344 }, { "epoch": 0.11311607864260706, "grad_norm": 0.7861261803530913, "learning_rate": 9.921373355701743e-06, "loss": 0.46369400024414065, "num_input_tokens_seen": 73499832, "step": 1680, "train_runtime": 12924.32, "train_tokens_per_second": 5686.94 }, { "epoch": 0.1134527336385672, "grad_norm": 0.8384955151965564, "learning_rate": 9.920905604338732e-06, "loss": 0.45543785095214845, "num_input_tokens_seen": 73720264, "step": 1685, "train_runtime": 12963.3961, "train_tokens_per_second": 5686.802 }, { "epoch": 0.11378938863452734, "grad_norm": 1.0833650625320947, "learning_rate": 9.920436476860158e-06, "loss": 0.38962454795837403, "num_input_tokens_seen": 73931824, "step": 1690, "train_runtime": 13004.1451, "train_tokens_per_second": 5685.251 }, { "epoch": 0.11412604363048748, "grad_norm": 0.8250025055357804, "learning_rate": 9.919965973397214e-06, "loss": 0.40491409301757814, "num_input_tokens_seen": 74150736, "step": 1695, "train_runtime": 13037.0352, "train_tokens_per_second": 5687.699 }, { "epoch": 0.11446269862644762, "grad_norm": 0.841239081826391, "learning_rate": 9.919494094081475e-06, "loss": 0.45804147720336913, "num_input_tokens_seen": 74352136, "step": 1700, "train_runtime": 13073.6778, "train_tokens_per_second": 5687.163 }, { "epoch": 0.11479935362240776, "grad_norm": 0.9629476764947537, "learning_rate": 9.919020839044899e-06, "loss": 0.4247718334197998, "num_input_tokens_seen": 74588328, "step": 1705, "train_runtime": 13108.3031, "train_tokens_per_second": 5690.159 }, { "epoch": 0.1151360086183679, "grad_norm": 0.8166202703347624, "learning_rate": 9.918546208419832e-06, "loss": 0.4040073394775391, "num_input_tokens_seen": 74810232, "step": 1710, "train_runtime": 13152.6429, "train_tokens_per_second": 5687.848 }, { "epoch": 0.11547266361432804, "grad_norm": 0.9143911353222378, "learning_rate": 9.918070202339e-06, "loss": 0.41643967628479006, "num_input_tokens_seen": 75038248, "step": 1715, "train_runtime": 13188.009, "train_tokens_per_second": 5689.885 }, { "epoch": 0.11580931861028818, "grad_norm": 0.854163675009985, "learning_rate": 9.91759282093552e-06, "loss": 0.4160469532012939, "num_input_tokens_seen": 75259984, "step": 1720, "train_runtime": 13221.5917, "train_tokens_per_second": 5692.203 }, { "epoch": 0.11614597360624832, "grad_norm": 0.9111231961657891, "learning_rate": 9.917114064342888e-06, "loss": 0.38855648040771484, "num_input_tokens_seen": 75468520, "step": 1725, "train_runtime": 13264.901, "train_tokens_per_second": 5689.339 }, { "epoch": 0.11648262860220845, "grad_norm": 0.8667773958295081, "learning_rate": 9.916633932694988e-06, "loss": 0.3962873458862305, "num_input_tokens_seen": 75690392, "step": 1730, "train_runtime": 13301.6754, "train_tokens_per_second": 5690.29 }, { "epoch": 0.1168192835981686, "grad_norm": 0.8572351568987933, "learning_rate": 9.916152426126086e-06, "loss": 0.3940844774246216, "num_input_tokens_seen": 75908632, "step": 1735, "train_runtime": 13340.3356, "train_tokens_per_second": 5690.159 }, { "epoch": 0.11715593859412873, "grad_norm": 0.8920380227031728, "learning_rate": 9.915669544770837e-06, "loss": 0.41963586807250974, "num_input_tokens_seen": 76143760, "step": 1740, "train_runtime": 13373.7492, "train_tokens_per_second": 5693.524 }, { "epoch": 0.11749259359008887, "grad_norm": 0.8151573693579499, "learning_rate": 9.915185288764272e-06, "loss": 0.4006998062133789, "num_input_tokens_seen": 76381464, "step": 1745, "train_runtime": 13411.6709, "train_tokens_per_second": 5695.149 }, { "epoch": 0.11782924858604901, "grad_norm": 0.7823689731999574, "learning_rate": 9.914699658241815e-06, "loss": 0.39071149826049806, "num_input_tokens_seen": 76607736, "step": 1750, "train_runtime": 13455.8214, "train_tokens_per_second": 5693.278 }, { "epoch": 0.11816590358200915, "grad_norm": 0.9650032542802038, "learning_rate": 9.91421265333927e-06, "loss": 0.44945535659790037, "num_input_tokens_seen": 76836152, "step": 1755, "train_runtime": 13495.7655, "train_tokens_per_second": 5693.353 }, { "epoch": 0.11850255857796929, "grad_norm": 0.8293434376681832, "learning_rate": 9.913724274192829e-06, "loss": 0.4147852897644043, "num_input_tokens_seen": 77069784, "step": 1760, "train_runtime": 13537.8959, "train_tokens_per_second": 5692.892 }, { "epoch": 0.11883921357392943, "grad_norm": 0.9258862128909312, "learning_rate": 9.91323452093906e-06, "loss": 0.41230435371398927, "num_input_tokens_seen": 77288624, "step": 1765, "train_runtime": 13574.917, "train_tokens_per_second": 5693.488 }, { "epoch": 0.11917586856988957, "grad_norm": 0.848930776896082, "learning_rate": 9.912743393714927e-06, "loss": 0.3945260286331177, "num_input_tokens_seen": 77519384, "step": 1770, "train_runtime": 13605.814, "train_tokens_per_second": 5697.519 }, { "epoch": 0.11951252356584972, "grad_norm": 0.8278888004348279, "learning_rate": 9.912250892657769e-06, "loss": 0.40961732864379885, "num_input_tokens_seen": 77735336, "step": 1775, "train_runtime": 13644.1096, "train_tokens_per_second": 5697.355 }, { "epoch": 0.11984917856180986, "grad_norm": 0.9501953857186206, "learning_rate": 9.911757017905312e-06, "loss": 0.41979494094848635, "num_input_tokens_seen": 77943944, "step": 1780, "train_runtime": 13675.7254, "train_tokens_per_second": 5699.438 }, { "epoch": 0.12018583355777, "grad_norm": 0.8175400797161728, "learning_rate": 9.911261769595668e-06, "loss": 0.4165688991546631, "num_input_tokens_seen": 78176688, "step": 1785, "train_runtime": 13720.1102, "train_tokens_per_second": 5697.964 }, { "epoch": 0.12052248855373014, "grad_norm": 0.9695481492778111, "learning_rate": 9.910765147867332e-06, "loss": 0.4288275718688965, "num_input_tokens_seen": 78398920, "step": 1790, "train_runtime": 13754.606, "train_tokens_per_second": 5699.83 }, { "epoch": 0.12085914354969028, "grad_norm": 0.9043853969674001, "learning_rate": 9.91026715285918e-06, "loss": 0.42678542137145997, "num_input_tokens_seen": 78617400, "step": 1795, "train_runtime": 13795.7712, "train_tokens_per_second": 5698.659 }, { "epoch": 0.12119579854565042, "grad_norm": 0.9643745725188065, "learning_rate": 9.909767784710476e-06, "loss": 0.4547886371612549, "num_input_tokens_seen": 78858720, "step": 1800, "train_runtime": 13832.1459, "train_tokens_per_second": 5701.12 }, { "epoch": 0.12153245354161056, "grad_norm": 0.8832616111060988, "learning_rate": 9.909267043560868e-06, "loss": 0.4295345783233643, "num_input_tokens_seen": 79081264, "step": 1805, "train_runtime": 13867.5931, "train_tokens_per_second": 5702.595 }, { "epoch": 0.1218691085375707, "grad_norm": 0.8001666467072275, "learning_rate": 9.908764929550388e-06, "loss": 0.4215728759765625, "num_input_tokens_seen": 79301792, "step": 1810, "train_runtime": 13907.1584, "train_tokens_per_second": 5702.228 }, { "epoch": 0.12220576353353084, "grad_norm": 0.9182690866647383, "learning_rate": 9.908261442819444e-06, "loss": 0.4215451717376709, "num_input_tokens_seen": 79503840, "step": 1815, "train_runtime": 13955.1411, "train_tokens_per_second": 5697.1 }, { "epoch": 0.12254241852949098, "grad_norm": 0.7856797264096972, "learning_rate": 9.907756583508842e-06, "loss": 0.3922400951385498, "num_input_tokens_seen": 79740056, "step": 1820, "train_runtime": 13995.629, "train_tokens_per_second": 5697.497 }, { "epoch": 0.12287907352545112, "grad_norm": 0.791802883681199, "learning_rate": 9.907250351759761e-06, "loss": 0.40973472595214844, "num_input_tokens_seen": 79961848, "step": 1825, "train_runtime": 14035.6538, "train_tokens_per_second": 5697.052 }, { "epoch": 0.12321572852141126, "grad_norm": 1.0344260725436623, "learning_rate": 9.906742747713766e-06, "loss": 0.4293796539306641, "num_input_tokens_seen": 80180448, "step": 1830, "train_runtime": 14071.4195, "train_tokens_per_second": 5698.107 }, { "epoch": 0.1235523835173714, "grad_norm": 1.0115683734845813, "learning_rate": 9.906233771512808e-06, "loss": 0.4379068374633789, "num_input_tokens_seen": 80391288, "step": 1835, "train_runtime": 14108.8045, "train_tokens_per_second": 5697.952 }, { "epoch": 0.12388903851333154, "grad_norm": 0.9113985281993394, "learning_rate": 9.905723423299222e-06, "loss": 0.44842100143432617, "num_input_tokens_seen": 80619704, "step": 1840, "train_runtime": 14148.1364, "train_tokens_per_second": 5698.256 }, { "epoch": 0.12422569350929168, "grad_norm": 0.8655689498703674, "learning_rate": 9.905211703215723e-06, "loss": 0.402877140045166, "num_input_tokens_seen": 80832568, "step": 1845, "train_runtime": 14183.917, "train_tokens_per_second": 5698.889 }, { "epoch": 0.12456234850525182, "grad_norm": 0.8753972943680609, "learning_rate": 9.904698611405412e-06, "loss": 0.4264510631561279, "num_input_tokens_seen": 81058296, "step": 1850, "train_runtime": 14223.3173, "train_tokens_per_second": 5698.973 }, { "epoch": 0.12489900350121196, "grad_norm": 0.7688694545812488, "learning_rate": 9.904184148011774e-06, "loss": 0.438901424407959, "num_input_tokens_seen": 81274840, "step": 1855, "train_runtime": 14263.055, "train_tokens_per_second": 5698.277 }, { "epoch": 0.1252356584971721, "grad_norm": 0.9233391292188109, "learning_rate": 9.903668313178681e-06, "loss": 0.44609222412109373, "num_input_tokens_seen": 81500576, "step": 1860, "train_runtime": 14299.671, "train_tokens_per_second": 5699.472 }, { "epoch": 0.12557231349313225, "grad_norm": 1.0943906900012805, "learning_rate": 9.903151107050377e-06, "loss": 0.396915864944458, "num_input_tokens_seen": 81707648, "step": 1865, "train_runtime": 14337.8178, "train_tokens_per_second": 5698.751 }, { "epoch": 0.1259089684890924, "grad_norm": 0.7168785500619042, "learning_rate": 9.902632529771502e-06, "loss": 0.42331228256225584, "num_input_tokens_seen": 81926600, "step": 1870, "train_runtime": 14376.4633, "train_tokens_per_second": 5698.662 }, { "epoch": 0.12624562348505253, "grad_norm": 1.0835704108533986, "learning_rate": 9.902112581487074e-06, "loss": 0.42675061225891114, "num_input_tokens_seen": 82148216, "step": 1875, "train_runtime": 14416.4946, "train_tokens_per_second": 5698.21 }, { "epoch": 0.12658227848101267, "grad_norm": 0.9867817197311566, "learning_rate": 9.901591262342494e-06, "loss": 0.4384635925292969, "num_input_tokens_seen": 82358848, "step": 1880, "train_runtime": 14459.8702, "train_tokens_per_second": 5695.684 }, { "epoch": 0.1269189334769728, "grad_norm": 0.9106268020914177, "learning_rate": 9.901068572483548e-06, "loss": 0.4060489654541016, "num_input_tokens_seen": 82576440, "step": 1885, "train_runtime": 14497.7161, "train_tokens_per_second": 5695.824 }, { "epoch": 0.12725558847293295, "grad_norm": 0.9009980190191491, "learning_rate": 9.900544512056402e-06, "loss": 0.47153472900390625, "num_input_tokens_seen": 82807688, "step": 1890, "train_runtime": 14534.4393, "train_tokens_per_second": 5697.343 }, { "epoch": 0.12759224346889309, "grad_norm": 0.8549638938689581, "learning_rate": 9.900019081207612e-06, "loss": 0.4209029197692871, "num_input_tokens_seen": 83038168, "step": 1895, "train_runtime": 14569.2093, "train_tokens_per_second": 5699.566 }, { "epoch": 0.12792889846485322, "grad_norm": 0.8968781974119465, "learning_rate": 9.89949228008411e-06, "loss": 0.42281227111816405, "num_input_tokens_seen": 83267720, "step": 1900, "train_runtime": 14606.2305, "train_tokens_per_second": 5700.836 }, { "epoch": 0.12826555346081336, "grad_norm": 0.8595709799025085, "learning_rate": 9.898964108833216e-06, "loss": 0.42650370597839354, "num_input_tokens_seen": 83492616, "step": 1905, "train_runtime": 14646.7617, "train_tokens_per_second": 5700.415 }, { "epoch": 0.1286022084567735, "grad_norm": 0.8815455063429253, "learning_rate": 9.898434567602629e-06, "loss": 0.4016720771789551, "num_input_tokens_seen": 83715840, "step": 1910, "train_runtime": 14686.2575, "train_tokens_per_second": 5700.284 }, { "epoch": 0.12893886345273364, "grad_norm": 0.9694766961124608, "learning_rate": 9.897903656540437e-06, "loss": 0.4289149284362793, "num_input_tokens_seen": 83934184, "step": 1915, "train_runtime": 14724.9891, "train_tokens_per_second": 5700.119 }, { "epoch": 0.12927551844869378, "grad_norm": 0.9823894967580632, "learning_rate": 9.897371375795103e-06, "loss": 0.43784418106079104, "num_input_tokens_seen": 84150312, "step": 1920, "train_runtime": 14759.5087, "train_tokens_per_second": 5701.43 }, { "epoch": 0.12961217344465392, "grad_norm": 0.8194539046535433, "learning_rate": 9.896837725515484e-06, "loss": 0.44328908920288085, "num_input_tokens_seen": 84361600, "step": 1925, "train_runtime": 14805.8899, "train_tokens_per_second": 5697.841 }, { "epoch": 0.12994882844061406, "grad_norm": 0.7081955649991436, "learning_rate": 9.89630270585081e-06, "loss": 0.39231128692626954, "num_input_tokens_seen": 84577168, "step": 1930, "train_runtime": 14842.2012, "train_tokens_per_second": 5698.425 }, { "epoch": 0.1302854834365742, "grad_norm": 0.8873554761311145, "learning_rate": 9.895766316950694e-06, "loss": 0.4394209384918213, "num_input_tokens_seen": 84796464, "step": 1935, "train_runtime": 14876.8277, "train_tokens_per_second": 5699.902 }, { "epoch": 0.13062213843253434, "grad_norm": 0.8262969710012915, "learning_rate": 9.89522855896514e-06, "loss": 0.41849603652954104, "num_input_tokens_seen": 85025304, "step": 1940, "train_runtime": 14919.7496, "train_tokens_per_second": 5698.843 }, { "epoch": 0.13095879342849448, "grad_norm": 0.9120986383703955, "learning_rate": 9.89468943204453e-06, "loss": 0.4164949893951416, "num_input_tokens_seen": 85239728, "step": 1945, "train_runtime": 14964.5159, "train_tokens_per_second": 5696.123 }, { "epoch": 0.13129544842445462, "grad_norm": 1.0478669869240167, "learning_rate": 9.89414893633963e-06, "loss": 0.41168971061706544, "num_input_tokens_seen": 85451488, "step": 1950, "train_runtime": 14998.4779, "train_tokens_per_second": 5697.344 }, { "epoch": 0.13163210342041476, "grad_norm": 0.8072074904847002, "learning_rate": 9.893607072001584e-06, "loss": 0.42524333000183107, "num_input_tokens_seen": 85681416, "step": 1955, "train_runtime": 15045.5899, "train_tokens_per_second": 5694.786 }, { "epoch": 0.1319687584163749, "grad_norm": 0.7884630260384243, "learning_rate": 9.893063839181925e-06, "loss": 0.41834263801574706, "num_input_tokens_seen": 85897864, "step": 1960, "train_runtime": 15086.3562, "train_tokens_per_second": 5693.745 }, { "epoch": 0.13230541341233504, "grad_norm": 0.8242479851716092, "learning_rate": 9.892519238032566e-06, "loss": 0.4272817611694336, "num_input_tokens_seen": 86126184, "step": 1965, "train_runtime": 15130.1067, "train_tokens_per_second": 5692.371 }, { "epoch": 0.13264206840829518, "grad_norm": 0.8883896038795247, "learning_rate": 9.891973268705804e-06, "loss": 0.45201525688171384, "num_input_tokens_seen": 86340160, "step": 1970, "train_runtime": 15166.855, "train_tokens_per_second": 5692.687 }, { "epoch": 0.13297872340425532, "grad_norm": 0.7899276150283895, "learning_rate": 9.891425931354316e-06, "loss": 0.4250628471374512, "num_input_tokens_seen": 86565168, "step": 1975, "train_runtime": 15203.4839, "train_tokens_per_second": 5693.772 }, { "epoch": 0.13331537840021546, "grad_norm": 0.8879719340880936, "learning_rate": 9.890877226131165e-06, "loss": 0.41506524085998536, "num_input_tokens_seen": 86796552, "step": 1980, "train_runtime": 15247.3097, "train_tokens_per_second": 5692.581 }, { "epoch": 0.1336520333961756, "grad_norm": 0.916769222493085, "learning_rate": 9.890327153189793e-06, "loss": 0.4300036907196045, "num_input_tokens_seen": 87016968, "step": 1985, "train_runtime": 15292.8026, "train_tokens_per_second": 5690.06 }, { "epoch": 0.13398868839213574, "grad_norm": 0.9050174324296295, "learning_rate": 9.889775712684026e-06, "loss": 0.4278897285461426, "num_input_tokens_seen": 87240744, "step": 1990, "train_runtime": 15335.4097, "train_tokens_per_second": 5688.843 }, { "epoch": 0.13432534338809587, "grad_norm": 0.8780717724520911, "learning_rate": 9.889222904768074e-06, "loss": 0.42691898345947266, "num_input_tokens_seen": 87458888, "step": 1995, "train_runtime": 15375.168, "train_tokens_per_second": 5688.321 }, { "epoch": 0.13466199838405601, "grad_norm": 0.8749943321506966, "learning_rate": 9.888668729596528e-06, "loss": 0.41673784255981444, "num_input_tokens_seen": 87661224, "step": 2000, "train_runtime": 15417.6729, "train_tokens_per_second": 5685.762 }, { "epoch": 0.13499865338001615, "grad_norm": 0.9429761954235121, "learning_rate": 9.88811318732436e-06, "loss": 0.4196599006652832, "num_input_tokens_seen": 87871224, "step": 2005, "train_runtime": 15454.7159, "train_tokens_per_second": 5685.722 }, { "epoch": 0.1353353083759763, "grad_norm": 0.8303836661224822, "learning_rate": 9.887556278106927e-06, "loss": 0.43319454193115237, "num_input_tokens_seen": 88101424, "step": 2010, "train_runtime": 15492.7733, "train_tokens_per_second": 5686.614 }, { "epoch": 0.13567196337193643, "grad_norm": 1.2988017888943026, "learning_rate": 9.886998002099964e-06, "loss": 0.42733011245727537, "num_input_tokens_seen": 88331320, "step": 2015, "train_runtime": 15533.3637, "train_tokens_per_second": 5686.555 }, { "epoch": 0.13600861836789657, "grad_norm": 0.926333904941965, "learning_rate": 9.886438359459595e-06, "loss": 0.4501063346862793, "num_input_tokens_seen": 88546592, "step": 2020, "train_runtime": 15572.5905, "train_tokens_per_second": 5686.054 }, { "epoch": 0.1363452733638567, "grad_norm": 0.8812830943715737, "learning_rate": 9.885877350342319e-06, "loss": 0.3861879587173462, "num_input_tokens_seen": 88774480, "step": 2025, "train_runtime": 15611.197, "train_tokens_per_second": 5686.59 }, { "epoch": 0.13668192835981685, "grad_norm": 0.8007094863514034, "learning_rate": 9.885314974905024e-06, "loss": 0.3875585556030273, "num_input_tokens_seen": 89011576, "step": 2030, "train_runtime": 15652.3238, "train_tokens_per_second": 5686.796 }, { "epoch": 0.137018583355777, "grad_norm": 0.9125014304117678, "learning_rate": 9.884751233304973e-06, "loss": 0.39730267524719237, "num_input_tokens_seen": 89217520, "step": 2035, "train_runtime": 15686.075, "train_tokens_per_second": 5687.689 }, { "epoch": 0.13735523835173713, "grad_norm": 0.8474671445937998, "learning_rate": 9.884186125699816e-06, "loss": 0.42992243766784666, "num_input_tokens_seen": 89431816, "step": 2040, "train_runtime": 15726.6605, "train_tokens_per_second": 5686.637 }, { "epoch": 0.13769189334769727, "grad_norm": 0.9102001150203423, "learning_rate": 9.883619652247584e-06, "loss": 0.4123133659362793, "num_input_tokens_seen": 89651968, "step": 2045, "train_runtime": 15768.4222, "train_tokens_per_second": 5685.538 }, { "epoch": 0.1380285483436574, "grad_norm": 0.6804193522827889, "learning_rate": 9.883051813106687e-06, "loss": 0.3782381296157837, "num_input_tokens_seen": 89874624, "step": 2050, "train_runtime": 15813.3958, "train_tokens_per_second": 5683.449 }, { "epoch": 0.13836520333961755, "grad_norm": 0.8989541162037309, "learning_rate": 9.882482608435924e-06, "loss": 0.43795013427734375, "num_input_tokens_seen": 90097216, "step": 2055, "train_runtime": 15851.8211, "train_tokens_per_second": 5683.714 }, { "epoch": 0.1387018583355777, "grad_norm": 0.8434117541493056, "learning_rate": 9.881912038394468e-06, "loss": 0.42223529815673827, "num_input_tokens_seen": 90317784, "step": 2060, "train_runtime": 15897.2071, "train_tokens_per_second": 5681.362 }, { "epoch": 0.13903851333153783, "grad_norm": 0.7960282493279416, "learning_rate": 9.881340103141878e-06, "loss": 0.4242293357849121, "num_input_tokens_seen": 90546968, "step": 2065, "train_runtime": 15940.8703, "train_tokens_per_second": 5680.177 }, { "epoch": 0.13937516832749797, "grad_norm": 0.8413026941754382, "learning_rate": 9.880766802838092e-06, "loss": 0.4057013511657715, "num_input_tokens_seen": 90762816, "step": 2070, "train_runtime": 15983.7133, "train_tokens_per_second": 5678.456 }, { "epoch": 0.1397118233234581, "grad_norm": 0.7350898878720474, "learning_rate": 9.880192137643434e-06, "loss": 0.4075471878051758, "num_input_tokens_seen": 90979408, "step": 2075, "train_runtime": 16017.6972, "train_tokens_per_second": 5679.931 }, { "epoch": 0.14004847831941827, "grad_norm": 0.9141607370838677, "learning_rate": 9.879616107718608e-06, "loss": 0.4198787689208984, "num_input_tokens_seen": 91197560, "step": 2080, "train_runtime": 16051.0779, "train_tokens_per_second": 5681.709 }, { "epoch": 0.1403851333153784, "grad_norm": 0.7897438400002121, "learning_rate": 9.879038713224695e-06, "loss": 0.4208370685577393, "num_input_tokens_seen": 91421872, "step": 2085, "train_runtime": 16093.9488, "train_tokens_per_second": 5680.512 }, { "epoch": 0.14072178831133855, "grad_norm": 0.8205504842451986, "learning_rate": 9.878459954323165e-06, "loss": 0.4030628204345703, "num_input_tokens_seen": 91647112, "step": 2090, "train_runtime": 16126.4411, "train_tokens_per_second": 5683.034 }, { "epoch": 0.1410584433072987, "grad_norm": 0.8325253458879384, "learning_rate": 9.877879831175865e-06, "loss": 0.39506003856658933, "num_input_tokens_seen": 91871896, "step": 2095, "train_runtime": 16160.6707, "train_tokens_per_second": 5684.906 }, { "epoch": 0.14139509830325883, "grad_norm": 0.821317865316409, "learning_rate": 9.877298343945025e-06, "loss": 0.41777982711791994, "num_input_tokens_seen": 92094456, "step": 2100, "train_runtime": 16203.3038, "train_tokens_per_second": 5683.684 }, { "epoch": 0.14173175329921897, "grad_norm": 0.7872012950426368, "learning_rate": 9.876715492793256e-06, "loss": 0.41480426788330077, "num_input_tokens_seen": 92315440, "step": 2105, "train_runtime": 16242.0831, "train_tokens_per_second": 5683.719 }, { "epoch": 0.1420684082951791, "grad_norm": 0.8092561101034788, "learning_rate": 9.87613127788355e-06, "loss": 0.389608097076416, "num_input_tokens_seen": 92527368, "step": 2110, "train_runtime": 16278.4874, "train_tokens_per_second": 5684.027 }, { "epoch": 0.14240506329113925, "grad_norm": 0.8850860821410723, "learning_rate": 9.87554569937928e-06, "loss": 0.4558421611785889, "num_input_tokens_seen": 92759672, "step": 2115, "train_runtime": 16314.9617, "train_tokens_per_second": 5685.559 }, { "epoch": 0.1427417182870994, "grad_norm": 0.8891822985539864, "learning_rate": 9.874958757444203e-06, "loss": 0.45552263259887693, "num_input_tokens_seen": 92995096, "step": 2120, "train_runtime": 16350.6171, "train_tokens_per_second": 5687.559 }, { "epoch": 0.14307837328305953, "grad_norm": 0.8780645983704002, "learning_rate": 9.874370452242454e-06, "loss": 0.43328495025634767, "num_input_tokens_seen": 93229944, "step": 2125, "train_runtime": 16384.0995, "train_tokens_per_second": 5690.27 }, { "epoch": 0.14341502827901967, "grad_norm": 0.9402959761478824, "learning_rate": 9.873780783938553e-06, "loss": 0.4462221622467041, "num_input_tokens_seen": 93450480, "step": 2130, "train_runtime": 16417.1629, "train_tokens_per_second": 5692.243 }, { "epoch": 0.1437516832749798, "grad_norm": 0.8574770635812221, "learning_rate": 9.873189752697396e-06, "loss": 0.3947939395904541, "num_input_tokens_seen": 93670472, "step": 2135, "train_runtime": 16459.3253, "train_tokens_per_second": 5691.027 }, { "epoch": 0.14408833827093995, "grad_norm": 0.8947319210921507, "learning_rate": 9.872597358684265e-06, "loss": 0.458558464050293, "num_input_tokens_seen": 93883544, "step": 2140, "train_runtime": 16489.5195, "train_tokens_per_second": 5693.528 }, { "epoch": 0.1444249932669001, "grad_norm": 0.8538177526814695, "learning_rate": 9.872003602064816e-06, "loss": 0.4299613475799561, "num_input_tokens_seen": 94116824, "step": 2145, "train_runtime": 16523.1274, "train_tokens_per_second": 5696.066 }, { "epoch": 0.14476164826286023, "grad_norm": 0.7471306795366713, "learning_rate": 9.8714084830051e-06, "loss": 0.4079564571380615, "num_input_tokens_seen": 94349480, "step": 2150, "train_runtime": 16564.7452, "train_tokens_per_second": 5695.8 }, { "epoch": 0.14509830325882037, "grad_norm": 0.8218664635099376, "learning_rate": 9.870812001671533e-06, "loss": 0.40776524543762205, "num_input_tokens_seen": 94577624, "step": 2155, "train_runtime": 16600.9249, "train_tokens_per_second": 5697.13 }, { "epoch": 0.1454349582547805, "grad_norm": 1.0737295934493194, "learning_rate": 9.870214158230922e-06, "loss": 0.4177376747131348, "num_input_tokens_seen": 94804128, "step": 2160, "train_runtime": 16635.1905, "train_tokens_per_second": 5699.011 }, { "epoch": 0.14577161325074064, "grad_norm": 0.786781014793927, "learning_rate": 9.869614952850454e-06, "loss": 0.40900435447692873, "num_input_tokens_seen": 95026192, "step": 2165, "train_runtime": 16669.2594, "train_tokens_per_second": 5700.685 }, { "epoch": 0.14610826824670078, "grad_norm": 0.8360055927785602, "learning_rate": 9.86901438569769e-06, "loss": 0.42821083068847654, "num_input_tokens_seen": 95254672, "step": 2170, "train_runtime": 16706.7948, "train_tokens_per_second": 5701.553 }, { "epoch": 0.14644492324266092, "grad_norm": 0.8933164074109287, "learning_rate": 9.86841245694058e-06, "loss": 0.425125789642334, "num_input_tokens_seen": 95450280, "step": 2175, "train_runtime": 16746.2086, "train_tokens_per_second": 5699.814 }, { "epoch": 0.14678157823862106, "grad_norm": 0.8906147805897214, "learning_rate": 9.86780916674745e-06, "loss": 0.45731253623962403, "num_input_tokens_seen": 95651304, "step": 2180, "train_runtime": 16783.8632, "train_tokens_per_second": 5699.004 }, { "epoch": 0.1471182332345812, "grad_norm": 1.0525327714019657, "learning_rate": 9.86720451528701e-06, "loss": 0.40560040473937986, "num_input_tokens_seen": 95859952, "step": 2185, "train_runtime": 16822.6242, "train_tokens_per_second": 5698.276 }, { "epoch": 0.14745488823054134, "grad_norm": 0.816498968853468, "learning_rate": 9.866598502728348e-06, "loss": 0.43126611709594725, "num_input_tokens_seen": 96069168, "step": 2190, "train_runtime": 16862.6901, "train_tokens_per_second": 5697.144 }, { "epoch": 0.14779154322650148, "grad_norm": 0.841739118951704, "learning_rate": 9.865991129240931e-06, "loss": 0.41145782470703124, "num_input_tokens_seen": 96283672, "step": 2195, "train_runtime": 16896.2709, "train_tokens_per_second": 5698.516 }, { "epoch": 0.14812819822246162, "grad_norm": 0.878868960575425, "learning_rate": 9.865382394994614e-06, "loss": 0.40999040603637693, "num_input_tokens_seen": 96502528, "step": 2200, "train_runtime": 16939.3291, "train_tokens_per_second": 5696.951 }, { "epoch": 0.14846485321842176, "grad_norm": 0.6967776248464405, "learning_rate": 9.864772300159622e-06, "loss": 0.3990957021713257, "num_input_tokens_seen": 96720064, "step": 2205, "train_runtime": 16973.4551, "train_tokens_per_second": 5698.313 }, { "epoch": 0.1488015082143819, "grad_norm": 0.9032740614218077, "learning_rate": 9.864160844906571e-06, "loss": 0.43683781623840334, "num_input_tokens_seen": 96941160, "step": 2210, "train_runtime": 17009.3974, "train_tokens_per_second": 5699.271 }, { "epoch": 0.14913816321034204, "grad_norm": 0.8444434220131386, "learning_rate": 9.863548029406449e-06, "loss": 0.419160795211792, "num_input_tokens_seen": 97161584, "step": 2215, "train_runtime": 17050.6002, "train_tokens_per_second": 5698.426 }, { "epoch": 0.14947481820630218, "grad_norm": 0.7872642768120427, "learning_rate": 9.86293385383063e-06, "loss": 0.3916934490203857, "num_input_tokens_seen": 97372312, "step": 2220, "train_runtime": 17095.7206, "train_tokens_per_second": 5695.713 }, { "epoch": 0.14981147320226232, "grad_norm": 0.9092720440628393, "learning_rate": 9.862318318350865e-06, "loss": 0.4371610641479492, "num_input_tokens_seen": 97594144, "step": 2225, "train_runtime": 17132.445, "train_tokens_per_second": 5696.452 }, { "epoch": 0.15014812819822246, "grad_norm": 0.7914448222714119, "learning_rate": 9.861701423139287e-06, "loss": 0.39911181926727296, "num_input_tokens_seen": 97820888, "step": 2230, "train_runtime": 17165.9269, "train_tokens_per_second": 5698.55 }, { "epoch": 0.1504847831941826, "grad_norm": 0.8316284130963478, "learning_rate": 9.861083168368411e-06, "loss": 0.41806850433349607, "num_input_tokens_seen": 98045776, "step": 2235, "train_runtime": 17204.7719, "train_tokens_per_second": 5698.755 }, { "epoch": 0.15082143819014274, "grad_norm": 0.9088287061584689, "learning_rate": 9.860463554211125e-06, "loss": 0.3891399383544922, "num_input_tokens_seen": 98268344, "step": 2240, "train_runtime": 17246.0796, "train_tokens_per_second": 5698.011 }, { "epoch": 0.15115809318610288, "grad_norm": 0.9381951784290052, "learning_rate": 9.859842580840706e-06, "loss": 0.4640520095825195, "num_input_tokens_seen": 98493000, "step": 2245, "train_runtime": 17289.4391, "train_tokens_per_second": 5696.715 }, { "epoch": 0.15149474818206302, "grad_norm": 0.7432535531903158, "learning_rate": 9.859220248430806e-06, "loss": 0.41865386962890627, "num_input_tokens_seen": 98731240, "step": 2250, "train_runtime": 17329.2789, "train_tokens_per_second": 5697.366 }, { "epoch": 0.15183140317802316, "grad_norm": 0.7752690728179633, "learning_rate": 9.85859655715546e-06, "loss": 0.39298291206359864, "num_input_tokens_seen": 98953224, "step": 2255, "train_runtime": 17375.0272, "train_tokens_per_second": 5695.141 }, { "epoch": 0.1521680581739833, "grad_norm": 0.8610212435397341, "learning_rate": 9.857971507189077e-06, "loss": 0.41016359329223634, "num_input_tokens_seen": 99171512, "step": 2260, "train_runtime": 17414.0463, "train_tokens_per_second": 5694.915 }, { "epoch": 0.15250471316994343, "grad_norm": 0.8902354817859172, "learning_rate": 9.857345098706455e-06, "loss": 0.4255502700805664, "num_input_tokens_seen": 99402080, "step": 2265, "train_runtime": 17451.574, "train_tokens_per_second": 5695.88 }, { "epoch": 0.15284136816590357, "grad_norm": 0.9086587862733272, "learning_rate": 9.856717331882765e-06, "loss": 0.4265317440032959, "num_input_tokens_seen": 99607944, "step": 2270, "train_runtime": 17486.7082, "train_tokens_per_second": 5696.209 }, { "epoch": 0.1531780231618637, "grad_norm": 0.9432280136780563, "learning_rate": 9.85608820689356e-06, "loss": 0.39440102577209474, "num_input_tokens_seen": 99830656, "step": 2275, "train_runtime": 17528.0918, "train_tokens_per_second": 5695.466 }, { "epoch": 0.15351467815782385, "grad_norm": 0.84487279707662, "learning_rate": 9.855457723914772e-06, "loss": 0.4084943771362305, "num_input_tokens_seen": 100050880, "step": 2280, "train_runtime": 17562.2543, "train_tokens_per_second": 5696.927 }, { "epoch": 0.153851333153784, "grad_norm": 0.9062843980819959, "learning_rate": 9.854825883122713e-06, "loss": 0.4020846366882324, "num_input_tokens_seen": 100260608, "step": 2285, "train_runtime": 17602.1432, "train_tokens_per_second": 5695.932 }, { "epoch": 0.15418798814974413, "grad_norm": 0.765345818981944, "learning_rate": 9.85419268469408e-06, "loss": 0.39870567321777345, "num_input_tokens_seen": 100466752, "step": 2290, "train_runtime": 17638.1952, "train_tokens_per_second": 5695.977 }, { "epoch": 0.15452464314570427, "grad_norm": 0.8051620604928534, "learning_rate": 9.85355812880594e-06, "loss": 0.3938899517059326, "num_input_tokens_seen": 100686544, "step": 2295, "train_runtime": 17677.5734, "train_tokens_per_second": 5695.722 }, { "epoch": 0.1548612981416644, "grad_norm": 0.7457579703786071, "learning_rate": 9.852922215635747e-06, "loss": 0.37209017276763917, "num_input_tokens_seen": 100908792, "step": 2300, "train_runtime": 17719.4452, "train_tokens_per_second": 5694.805 }, { "epoch": 0.15519795313762455, "grad_norm": 0.8179184151627187, "learning_rate": 9.85228494536133e-06, "loss": 0.4363281726837158, "num_input_tokens_seen": 101132472, "step": 2305, "train_runtime": 17753.0155, "train_tokens_per_second": 5696.636 }, { "epoch": 0.1555346081335847, "grad_norm": 0.8389619253246731, "learning_rate": 9.851646318160901e-06, "loss": 0.41831111907958984, "num_input_tokens_seen": 101349024, "step": 2310, "train_runtime": 17793.8083, "train_tokens_per_second": 5695.747 }, { "epoch": 0.15587126312954483, "grad_norm": 0.7507564820666337, "learning_rate": 9.85100633421305e-06, "loss": 0.39124910831451415, "num_input_tokens_seen": 101558936, "step": 2315, "train_runtime": 17835.905, "train_tokens_per_second": 5694.072 }, { "epoch": 0.15620791812550497, "grad_norm": 0.8895097039801884, "learning_rate": 9.850364993696749e-06, "loss": 0.42600722312927247, "num_input_tokens_seen": 101772184, "step": 2320, "train_runtime": 17875.446, "train_tokens_per_second": 5693.407 }, { "epoch": 0.15654457312146514, "grad_norm": 0.9520687878700897, "learning_rate": 9.849722296791339e-06, "loss": 0.4083821773529053, "num_input_tokens_seen": 101982520, "step": 2325, "train_runtime": 17909.3087, "train_tokens_per_second": 5694.386 }, { "epoch": 0.15688122811742528, "grad_norm": 0.9282345518369051, "learning_rate": 9.849078243676558e-06, "loss": 0.4323273658752441, "num_input_tokens_seen": 102196704, "step": 2330, "train_runtime": 17950.3047, "train_tokens_per_second": 5693.313 }, { "epoch": 0.15721788311338541, "grad_norm": 0.7571706215220008, "learning_rate": 9.848432834532506e-06, "loss": 0.3904409885406494, "num_input_tokens_seen": 102413872, "step": 2335, "train_runtime": 17990.1951, "train_tokens_per_second": 5692.76 }, { "epoch": 0.15755453810934555, "grad_norm": 0.7812435917007698, "learning_rate": 9.847786069539673e-06, "loss": 0.42157392501831054, "num_input_tokens_seen": 102636848, "step": 2340, "train_runtime": 18027.5652, "train_tokens_per_second": 5693.328 }, { "epoch": 0.1578911931053057, "grad_norm": 0.8268032160233915, "learning_rate": 9.847137948878926e-06, "loss": 0.4385071277618408, "num_input_tokens_seen": 102861544, "step": 2345, "train_runtime": 18065.377, "train_tokens_per_second": 5693.85 }, { "epoch": 0.15822784810126583, "grad_norm": 0.9872902684937591, "learning_rate": 9.846488472731505e-06, "loss": 0.46036734580993655, "num_input_tokens_seen": 103092600, "step": 2350, "train_runtime": 18100.6003, "train_tokens_per_second": 5695.535 }, { "epoch": 0.15856450309722597, "grad_norm": 0.8069383596278824, "learning_rate": 9.845837641279038e-06, "loss": 0.4151791572570801, "num_input_tokens_seen": 103323896, "step": 2355, "train_runtime": 18131.0861, "train_tokens_per_second": 5698.715 }, { "epoch": 0.1589011580931861, "grad_norm": 0.918784982161899, "learning_rate": 9.845185454703528e-06, "loss": 0.42508544921875, "num_input_tokens_seen": 103541848, "step": 2360, "train_runtime": 18171.0294, "train_tokens_per_second": 5698.183 }, { "epoch": 0.15923781308914625, "grad_norm": 0.817441107070197, "learning_rate": 9.844531913187356e-06, "loss": 0.3977517604827881, "num_input_tokens_seen": 103759048, "step": 2365, "train_runtime": 18209.2359, "train_tokens_per_second": 5698.155 }, { "epoch": 0.1595744680851064, "grad_norm": 0.8849599843025514, "learning_rate": 9.84387701691328e-06, "loss": 0.41399388313293456, "num_input_tokens_seen": 103958648, "step": 2370, "train_runtime": 18252.5289, "train_tokens_per_second": 5695.575 }, { "epoch": 0.15991112308106653, "grad_norm": 0.9775050084644975, "learning_rate": 9.843220766064443e-06, "loss": 0.4396827697753906, "num_input_tokens_seen": 104164280, "step": 2375, "train_runtime": 18287.1992, "train_tokens_per_second": 5696.022 }, { "epoch": 0.16024777807702667, "grad_norm": 1.026818097492493, "learning_rate": 9.842563160824364e-06, "loss": 0.4241004943847656, "num_input_tokens_seen": 104376504, "step": 2380, "train_runtime": 18322.4835, "train_tokens_per_second": 5696.635 }, { "epoch": 0.1605844330729868, "grad_norm": 0.8310388237023464, "learning_rate": 9.841904201376939e-06, "loss": 0.44525814056396484, "num_input_tokens_seen": 104607616, "step": 2385, "train_runtime": 18361.4521, "train_tokens_per_second": 5697.132 }, { "epoch": 0.16092108806894695, "grad_norm": 0.8107352807912601, "learning_rate": 9.841243887906443e-06, "loss": 0.3924037218093872, "num_input_tokens_seen": 104827648, "step": 2390, "train_runtime": 18397.6205, "train_tokens_per_second": 5697.892 }, { "epoch": 0.1612577430649071, "grad_norm": 0.8255737690801053, "learning_rate": 9.840582220597532e-06, "loss": 0.38776795864105223, "num_input_tokens_seen": 105048616, "step": 2395, "train_runtime": 18437.9099, "train_tokens_per_second": 5697.425 }, { "epoch": 0.16159439806086723, "grad_norm": 1.0393091287356393, "learning_rate": 9.839919199635238e-06, "loss": 0.44150123596191404, "num_input_tokens_seen": 105271480, "step": 2400, "train_runtime": 18481.0333, "train_tokens_per_second": 5696.19 }, { "epoch": 0.16193105305682737, "grad_norm": 1.778936138437422, "learning_rate": 9.839254825204973e-06, "loss": 0.4216805934906006, "num_input_tokens_seen": 105497528, "step": 2405, "train_runtime": 18522.7039, "train_tokens_per_second": 5695.579 }, { "epoch": 0.1622677080527875, "grad_norm": 0.8730955239731051, "learning_rate": 9.838589097492527e-06, "loss": 0.4195371627807617, "num_input_tokens_seen": 105713952, "step": 2410, "train_runtime": 18562.2885, "train_tokens_per_second": 5695.093 }, { "epoch": 0.16260436304874765, "grad_norm": 1.003318291974337, "learning_rate": 9.83792201668407e-06, "loss": 0.4166804313659668, "num_input_tokens_seen": 105940976, "step": 2415, "train_runtime": 18598.4307, "train_tokens_per_second": 5696.232 }, { "epoch": 0.16294101804470779, "grad_norm": 0.9882562378903975, "learning_rate": 9.837253582966146e-06, "loss": 0.4339381217956543, "num_input_tokens_seen": 106165352, "step": 2420, "train_runtime": 18633.1302, "train_tokens_per_second": 5697.666 }, { "epoch": 0.16327767304066793, "grad_norm": 0.8141828153275021, "learning_rate": 9.836583796525686e-06, "loss": 0.3936171531677246, "num_input_tokens_seen": 106364536, "step": 2425, "train_runtime": 18675.1796, "train_tokens_per_second": 5695.503 }, { "epoch": 0.16361432803662807, "grad_norm": 0.861811860528164, "learning_rate": 9.835912657549986e-06, "loss": 0.4514013290405273, "num_input_tokens_seen": 106587560, "step": 2430, "train_runtime": 18717.8406, "train_tokens_per_second": 5694.437 }, { "epoch": 0.1639509830325882, "grad_norm": 0.8811857541516364, "learning_rate": 9.835240166226734e-06, "loss": 0.39427995681762695, "num_input_tokens_seen": 106799528, "step": 2435, "train_runtime": 18761.1279, "train_tokens_per_second": 5692.596 }, { "epoch": 0.16428763802854834, "grad_norm": 0.8015505121470864, "learning_rate": 9.834566322743987e-06, "loss": 0.43557186126708985, "num_input_tokens_seen": 107012480, "step": 2440, "train_runtime": 18795.981, "train_tokens_per_second": 5693.37 }, { "epoch": 0.16462429302450848, "grad_norm": 0.8088311122015132, "learning_rate": 9.833891127290186e-06, "loss": 0.4289062976837158, "num_input_tokens_seen": 107250496, "step": 2445, "train_runtime": 18827.4248, "train_tokens_per_second": 5696.504 }, { "epoch": 0.16496094802046862, "grad_norm": 0.7483438381257065, "learning_rate": 9.833214580054145e-06, "loss": 0.3959768295288086, "num_input_tokens_seen": 107469136, "step": 2450, "train_runtime": 18863.1469, "train_tokens_per_second": 5697.307 }, { "epoch": 0.16529760301642876, "grad_norm": 0.8277673951140269, "learning_rate": 9.832536681225058e-06, "loss": 0.44450016021728517, "num_input_tokens_seen": 107691864, "step": 2455, "train_runtime": 18898.3354, "train_tokens_per_second": 5698.484 }, { "epoch": 0.1656342580123889, "grad_norm": 0.8054080794016197, "learning_rate": 9.831857430992497e-06, "loss": 0.3906950235366821, "num_input_tokens_seen": 107905928, "step": 2460, "train_runtime": 18933.5537, "train_tokens_per_second": 5699.19 }, { "epoch": 0.16597091300834904, "grad_norm": 0.8380957144167158, "learning_rate": 9.831176829546416e-06, "loss": 0.41658635139465333, "num_input_tokens_seen": 108126176, "step": 2465, "train_runtime": 18970.3816, "train_tokens_per_second": 5699.736 }, { "epoch": 0.16630756800430918, "grad_norm": 0.9452365824285418, "learning_rate": 9.830494877077137e-06, "loss": 0.46334171295166016, "num_input_tokens_seen": 108358872, "step": 2470, "train_runtime": 19004.9571, "train_tokens_per_second": 5701.611 }, { "epoch": 0.16664422300026932, "grad_norm": 1.1889597050506375, "learning_rate": 9.82981157377537e-06, "loss": 0.4094019889831543, "num_input_tokens_seen": 108572432, "step": 2475, "train_runtime": 19047.273, "train_tokens_per_second": 5700.156 }, { "epoch": 0.16698087799622946, "grad_norm": 0.8308872657286545, "learning_rate": 9.829126919832198e-06, "loss": 0.3822948455810547, "num_input_tokens_seen": 108789616, "step": 2480, "train_runtime": 19086.2476, "train_tokens_per_second": 5699.895 }, { "epoch": 0.1673175329921896, "grad_norm": 0.7290133116509023, "learning_rate": 9.82844091543908e-06, "loss": 0.4369968414306641, "num_input_tokens_seen": 109023616, "step": 2485, "train_runtime": 19125.718, "train_tokens_per_second": 5700.367 }, { "epoch": 0.16765418798814974, "grad_norm": 0.7990719470039959, "learning_rate": 9.82775356078786e-06, "loss": 0.4084890842437744, "num_input_tokens_seen": 109238536, "step": 2490, "train_runtime": 19167.2805, "train_tokens_per_second": 5699.219 }, { "epoch": 0.16799084298410988, "grad_norm": 0.7393931696314984, "learning_rate": 9.82706485607075e-06, "loss": 0.3479023456573486, "num_input_tokens_seen": 109448064, "step": 2495, "train_runtime": 19202.9034, "train_tokens_per_second": 5699.558 }, { "epoch": 0.16832749798007002, "grad_norm": 0.8223012662270877, "learning_rate": 9.826374801480346e-06, "loss": 0.4044170379638672, "num_input_tokens_seen": 109654600, "step": 2500, "train_runtime": 19240.4274, "train_tokens_per_second": 5699.177 }, { "epoch": 0.16866415297603016, "grad_norm": 0.7578035444329189, "learning_rate": 9.825683397209617e-06, "loss": 0.4128159999847412, "num_input_tokens_seen": 109844880, "step": 2505, "train_runtime": 19277.0081, "train_tokens_per_second": 5698.233 }, { "epoch": 0.1690008079719903, "grad_norm": 0.7754496384426975, "learning_rate": 9.824990643451915e-06, "loss": 0.40271682739257814, "num_input_tokens_seen": 110072368, "step": 2510, "train_runtime": 19317.0275, "train_tokens_per_second": 5698.204 }, { "epoch": 0.16933746296795044, "grad_norm": 0.7630225519369642, "learning_rate": 9.824296540400965e-06, "loss": 0.4032273769378662, "num_input_tokens_seen": 110306168, "step": 2515, "train_runtime": 19359.4719, "train_tokens_per_second": 5697.788 }, { "epoch": 0.16967411796391058, "grad_norm": 0.9445770110284926, "learning_rate": 9.823601088250872e-06, "loss": 0.43148112297058105, "num_input_tokens_seen": 110517392, "step": 2520, "train_runtime": 19399.6091, "train_tokens_per_second": 5696.888 }, { "epoch": 0.17001077295987072, "grad_norm": 0.8318843666554462, "learning_rate": 9.822904287196114e-06, "loss": 0.4280102729797363, "num_input_tokens_seen": 110729000, "step": 2525, "train_runtime": 19437.1917, "train_tokens_per_second": 5696.759 }, { "epoch": 0.17034742795583085, "grad_norm": 0.8164720266895754, "learning_rate": 9.822206137431553e-06, "loss": 0.4008312702178955, "num_input_tokens_seen": 110951576, "step": 2530, "train_runtime": 19473.1465, "train_tokens_per_second": 5697.671 }, { "epoch": 0.170684082951791, "grad_norm": 0.7906437056018215, "learning_rate": 9.821506639152421e-06, "loss": 0.42267236709594724, "num_input_tokens_seen": 111165912, "step": 2535, "train_runtime": 19511.9498, "train_tokens_per_second": 5697.325 }, { "epoch": 0.17102073794775113, "grad_norm": 0.8027232200064034, "learning_rate": 9.820805792554334e-06, "loss": 0.3978217124938965, "num_input_tokens_seen": 111390648, "step": 2540, "train_runtime": 19548.9277, "train_tokens_per_second": 5698.044 }, { "epoch": 0.17135739294371127, "grad_norm": 0.9732933783691021, "learning_rate": 9.820103597833278e-06, "loss": 0.40553808212280273, "num_input_tokens_seen": 111613680, "step": 2545, "train_runtime": 19588.8813, "train_tokens_per_second": 5697.808 }, { "epoch": 0.1716940479396714, "grad_norm": 0.82729851843596, "learning_rate": 9.819400055185622e-06, "loss": 0.3968106031417847, "num_input_tokens_seen": 111830672, "step": 2550, "train_runtime": 19624.1494, "train_tokens_per_second": 5698.625 }, { "epoch": 0.17203070293563155, "grad_norm": 0.8468905353541687, "learning_rate": 9.818695164808108e-06, "loss": 0.40885286331176757, "num_input_tokens_seen": 112047832, "step": 2555, "train_runtime": 19668.7374, "train_tokens_per_second": 5696.748 }, { "epoch": 0.1723673579315917, "grad_norm": 0.7939112227025558, "learning_rate": 9.817988926897856e-06, "loss": 0.39391307830810546, "num_input_tokens_seen": 112267160, "step": 2560, "train_runtime": 19710.9584, "train_tokens_per_second": 5695.672 }, { "epoch": 0.17270401292755186, "grad_norm": 0.8639441951747879, "learning_rate": 9.817281341652367e-06, "loss": 0.4082347869873047, "num_input_tokens_seen": 112491800, "step": 2565, "train_runtime": 19749.2522, "train_tokens_per_second": 5696.003 }, { "epoch": 0.173040667923512, "grad_norm": 0.716613288966692, "learning_rate": 9.816572409269508e-06, "loss": 0.3824393033981323, "num_input_tokens_seen": 112719560, "step": 2570, "train_runtime": 19784.3744, "train_tokens_per_second": 5697.403 }, { "epoch": 0.17337732291947214, "grad_norm": 0.7563163756690298, "learning_rate": 9.815862129947537e-06, "loss": 0.4002216339111328, "num_input_tokens_seen": 112940512, "step": 2575, "train_runtime": 19821.7603, "train_tokens_per_second": 5697.804 }, { "epoch": 0.17371397791543228, "grad_norm": 0.8087466973345561, "learning_rate": 9.815150503885078e-06, "loss": 0.37178959846496584, "num_input_tokens_seen": 113165624, "step": 2580, "train_runtime": 19858.1999, "train_tokens_per_second": 5698.685 }, { "epoch": 0.17405063291139242, "grad_norm": 0.8994912714777122, "learning_rate": 9.814437531281133e-06, "loss": 0.40114603042602537, "num_input_tokens_seen": 113386744, "step": 2585, "train_runtime": 19903.4827, "train_tokens_per_second": 5696.829 }, { "epoch": 0.17438728790735256, "grad_norm": 0.9269225867551159, "learning_rate": 9.813723212335085e-06, "loss": 0.43936843872070314, "num_input_tokens_seen": 113593688, "step": 2590, "train_runtime": 19940.3903, "train_tokens_per_second": 5696.663 }, { "epoch": 0.1747239429033127, "grad_norm": 0.8457918670255721, "learning_rate": 9.813007547246691e-06, "loss": 0.39149506092071534, "num_input_tokens_seen": 113810536, "step": 2595, "train_runtime": 19976.29, "train_tokens_per_second": 5697.281 }, { "epoch": 0.17506059789927284, "grad_norm": 0.8422559964504273, "learning_rate": 9.812290536216083e-06, "loss": 0.4519649982452393, "num_input_tokens_seen": 114012584, "step": 2600, "train_runtime": 20014.4208, "train_tokens_per_second": 5696.522 }, { "epoch": 0.17539725289523297, "grad_norm": 0.7614963966994434, "learning_rate": 9.811572179443773e-06, "loss": 0.3978102445602417, "num_input_tokens_seen": 114240040, "step": 2605, "train_runtime": 20049.8879, "train_tokens_per_second": 5697.789 }, { "epoch": 0.17573390789119311, "grad_norm": 0.7655048641611386, "learning_rate": 9.810852477130645e-06, "loss": 0.40557031631469725, "num_input_tokens_seen": 114449696, "step": 2610, "train_runtime": 20089.5257, "train_tokens_per_second": 5696.983 }, { "epoch": 0.17607056288715325, "grad_norm": 0.8093163549967093, "learning_rate": 9.810131429477964e-06, "loss": 0.38374016284942625, "num_input_tokens_seen": 114677776, "step": 2615, "train_runtime": 20121.5227, "train_tokens_per_second": 5699.259 }, { "epoch": 0.1764072178831134, "grad_norm": 0.8258310946925135, "learning_rate": 9.809409036687364e-06, "loss": 0.396789026260376, "num_input_tokens_seen": 114896336, "step": 2620, "train_runtime": 20158.9581, "train_tokens_per_second": 5699.518 }, { "epoch": 0.17674387287907353, "grad_norm": 0.7382001307664883, "learning_rate": 9.808685298960867e-06, "loss": 0.4137075424194336, "num_input_tokens_seen": 115125264, "step": 2625, "train_runtime": 20201.5972, "train_tokens_per_second": 5698.82 }, { "epoch": 0.17708052787503367, "grad_norm": 0.7663556283529158, "learning_rate": 9.807960216500858e-06, "loss": 0.4165202617645264, "num_input_tokens_seen": 115343304, "step": 2630, "train_runtime": 20236.3656, "train_tokens_per_second": 5699.803 }, { "epoch": 0.1774171828709938, "grad_norm": 0.7884797087616878, "learning_rate": 9.807233789510106e-06, "loss": 0.38329482078552246, "num_input_tokens_seen": 115555208, "step": 2635, "train_runtime": 20279.8657, "train_tokens_per_second": 5698.026 }, { "epoch": 0.17775383786695395, "grad_norm": 0.7323486746827084, "learning_rate": 9.806506018191754e-06, "loss": 0.39183108806610106, "num_input_tokens_seen": 115777312, "step": 2640, "train_runtime": 20317.1207, "train_tokens_per_second": 5698.51 }, { "epoch": 0.1780904928629141, "grad_norm": 0.8712184035601627, "learning_rate": 9.80577690274932e-06, "loss": 0.39883904457092284, "num_input_tokens_seen": 116000320, "step": 2645, "train_runtime": 20353.9248, "train_tokens_per_second": 5699.162 }, { "epoch": 0.17842714785887423, "grad_norm": 0.6517931345598202, "learning_rate": 9.8050464433867e-06, "loss": 0.3788264751434326, "num_input_tokens_seen": 116228264, "step": 2650, "train_runtime": 20388.2032, "train_tokens_per_second": 5700.761 }, { "epoch": 0.17876380285483437, "grad_norm": 0.8947080972086597, "learning_rate": 9.804314640308165e-06, "loss": 0.43610692024230957, "num_input_tokens_seen": 116459784, "step": 2655, "train_runtime": 20433.6777, "train_tokens_per_second": 5699.404 }, { "epoch": 0.1791004578507945, "grad_norm": 0.8316768119557644, "learning_rate": 9.803581493718361e-06, "loss": 0.4152191162109375, "num_input_tokens_seen": 116677976, "step": 2660, "train_runtime": 20471.066, "train_tokens_per_second": 5699.653 }, { "epoch": 0.17943711284675465, "grad_norm": 0.7694745863442054, "learning_rate": 9.80284700382231e-06, "loss": 0.4158869743347168, "num_input_tokens_seen": 116913096, "step": 2665, "train_runtime": 20513.9974, "train_tokens_per_second": 5699.186 }, { "epoch": 0.1797737678427148, "grad_norm": 0.7759018142960451, "learning_rate": 9.802111170825408e-06, "loss": 0.40905094146728516, "num_input_tokens_seen": 117139040, "step": 2670, "train_runtime": 20555.3803, "train_tokens_per_second": 5698.705 }, { "epoch": 0.18011042283867493, "grad_norm": 0.7209579007108823, "learning_rate": 9.80137399493343e-06, "loss": 0.4070711135864258, "num_input_tokens_seen": 117354016, "step": 2675, "train_runtime": 20594.1226, "train_tokens_per_second": 5698.423 }, { "epoch": 0.18044707783463507, "grad_norm": 0.7855863516525835, "learning_rate": 9.800635476352525e-06, "loss": 0.39305026531219484, "num_input_tokens_seen": 117552920, "step": 2680, "train_runtime": 20636.4809, "train_tokens_per_second": 5696.365 }, { "epoch": 0.1807837328305952, "grad_norm": 0.8011882919088659, "learning_rate": 9.799895615289218e-06, "loss": 0.38626153469085694, "num_input_tokens_seen": 117762232, "step": 2685, "train_runtime": 20677.4885, "train_tokens_per_second": 5695.19 }, { "epoch": 0.18112038782655535, "grad_norm": 0.7959442838200258, "learning_rate": 9.799154411950407e-06, "loss": 0.44461402893066404, "num_input_tokens_seen": 117998240, "step": 2690, "train_runtime": 20716.7034, "train_tokens_per_second": 5695.802 }, { "epoch": 0.18145704282251549, "grad_norm": 0.7750011575792003, "learning_rate": 9.79841186654337e-06, "loss": 0.4056252479553223, "num_input_tokens_seen": 118211832, "step": 2695, "train_runtime": 20752.9555, "train_tokens_per_second": 5696.144 }, { "epoch": 0.18179369781847562, "grad_norm": 0.8899930605283304, "learning_rate": 9.797667979275752e-06, "loss": 0.43903465270996095, "num_input_tokens_seen": 118421416, "step": 2700, "train_runtime": 20785.8453, "train_tokens_per_second": 5697.214 }, { "epoch": 0.18213035281443576, "grad_norm": 0.7964676861353408, "learning_rate": 9.796922750355584e-06, "loss": 0.3816461801528931, "num_input_tokens_seen": 118635408, "step": 2705, "train_runtime": 20823.8564, "train_tokens_per_second": 5697.091 }, { "epoch": 0.1824670078103959, "grad_norm": 0.8627424628290897, "learning_rate": 9.796176179991266e-06, "loss": 0.4243772029876709, "num_input_tokens_seen": 118853520, "step": 2710, "train_runtime": 20861.0922, "train_tokens_per_second": 5697.378 }, { "epoch": 0.18280366280635604, "grad_norm": 0.8313804598527397, "learning_rate": 9.795428268391572e-06, "loss": 0.39929049015045165, "num_input_tokens_seen": 119057464, "step": 2715, "train_runtime": 20899.2219, "train_tokens_per_second": 5696.741 }, { "epoch": 0.18314031780231618, "grad_norm": 0.9224656362131587, "learning_rate": 9.794679015765655e-06, "loss": 0.4025382995605469, "num_input_tokens_seen": 119270504, "step": 2720, "train_runtime": 20936.4359, "train_tokens_per_second": 5696.791 }, { "epoch": 0.18347697279827632, "grad_norm": 0.8830106782970203, "learning_rate": 9.793928422323041e-06, "loss": 0.40293426513671876, "num_input_tokens_seen": 119494864, "step": 2725, "train_runtime": 20982.2238, "train_tokens_per_second": 5695.052 }, { "epoch": 0.18381362779423646, "grad_norm": 0.9585116874337107, "learning_rate": 9.793176488273629e-06, "loss": 0.40497751235961915, "num_input_tokens_seen": 119700000, "step": 2730, "train_runtime": 21018.3132, "train_tokens_per_second": 5695.034 }, { "epoch": 0.1841502827901966, "grad_norm": 0.9047740005031505, "learning_rate": 9.792423213827697e-06, "loss": 0.3891148567199707, "num_input_tokens_seen": 119916696, "step": 2735, "train_runtime": 21057.8627, "train_tokens_per_second": 5694.628 }, { "epoch": 0.18448693778615674, "grad_norm": 0.8310766014320071, "learning_rate": 9.791668599195897e-06, "loss": 0.3831428289413452, "num_input_tokens_seen": 120142080, "step": 2740, "train_runtime": 21101.6665, "train_tokens_per_second": 5693.488 }, { "epoch": 0.18482359278211688, "grad_norm": 0.7855666850049595, "learning_rate": 9.790912644589248e-06, "loss": 0.42138309478759767, "num_input_tokens_seen": 120348496, "step": 2745, "train_runtime": 21146.0201, "train_tokens_per_second": 5691.307 }, { "epoch": 0.18516024777807702, "grad_norm": 0.7620864321495552, "learning_rate": 9.790155350219159e-06, "loss": 0.3965245246887207, "num_input_tokens_seen": 120570160, "step": 2750, "train_runtime": 21186.6351, "train_tokens_per_second": 5690.859 }, { "epoch": 0.18549690277403716, "grad_norm": 0.7543478062618101, "learning_rate": 9.789396716297399e-06, "loss": 0.4091955661773682, "num_input_tokens_seen": 120800688, "step": 2755, "train_runtime": 21220.0669, "train_tokens_per_second": 5692.757 }, { "epoch": 0.1858335577699973, "grad_norm": 0.8640772187026432, "learning_rate": 9.788636743036122e-06, "loss": 0.38339416980743407, "num_input_tokens_seen": 121012328, "step": 2760, "train_runtime": 21257.8451, "train_tokens_per_second": 5692.596 }, { "epoch": 0.18617021276595744, "grad_norm": 0.7868554451548372, "learning_rate": 9.787875430647847e-06, "loss": 0.3950460195541382, "num_input_tokens_seen": 121232032, "step": 2765, "train_runtime": 21294.5091, "train_tokens_per_second": 5693.112 }, { "epoch": 0.18650686776191758, "grad_norm": 0.8537247075271003, "learning_rate": 9.787112779345477e-06, "loss": 0.39361560344696045, "num_input_tokens_seen": 121436200, "step": 2770, "train_runtime": 21331.5416, "train_tokens_per_second": 5692.8 }, { "epoch": 0.18684352275787772, "grad_norm": 0.8358704371476329, "learning_rate": 9.786348789342283e-06, "loss": 0.4345618724822998, "num_input_tokens_seen": 121656544, "step": 2775, "train_runtime": 21370.3261, "train_tokens_per_second": 5692.779 }, { "epoch": 0.18718017775383786, "grad_norm": 0.7754752799232651, "learning_rate": 9.785583460851912e-06, "loss": 0.39746851921081544, "num_input_tokens_seen": 121881368, "step": 2780, "train_runtime": 21412.528, "train_tokens_per_second": 5692.059 }, { "epoch": 0.187516832749798, "grad_norm": 0.7537619511207324, "learning_rate": 9.784816794088386e-06, "loss": 0.4182771682739258, "num_input_tokens_seen": 122116272, "step": 2785, "train_runtime": 21450.3054, "train_tokens_per_second": 5692.985 }, { "epoch": 0.18785348774575814, "grad_norm": 0.86793765719075, "learning_rate": 9.784048789266101e-06, "loss": 0.4000124931335449, "num_input_tokens_seen": 122324024, "step": 2790, "train_runtime": 21493.8907, "train_tokens_per_second": 5691.107 }, { "epoch": 0.18819014274171827, "grad_norm": 0.7757014341183018, "learning_rate": 9.78327944659983e-06, "loss": 0.411564302444458, "num_input_tokens_seen": 122539808, "step": 2795, "train_runtime": 21541.5867, "train_tokens_per_second": 5688.523 }, { "epoch": 0.18852679773767841, "grad_norm": 0.8345683649256179, "learning_rate": 9.78250876630471e-06, "loss": 0.40423192977905276, "num_input_tokens_seen": 122747320, "step": 2800, "train_runtime": 21579.8161, "train_tokens_per_second": 5688.061 }, { "epoch": 0.18886345273363855, "grad_norm": 0.8512506107699013, "learning_rate": 9.781736748596267e-06, "loss": 0.39595718383789064, "num_input_tokens_seen": 122957984, "step": 2805, "train_runtime": 21616.5661, "train_tokens_per_second": 5688.137 }, { "epoch": 0.18920010772959872, "grad_norm": 0.8124112022835439, "learning_rate": 9.78096339369039e-06, "loss": 0.3889493942260742, "num_input_tokens_seen": 123167712, "step": 2810, "train_runtime": 21651.6405, "train_tokens_per_second": 5688.609 }, { "epoch": 0.18953676272555886, "grad_norm": 0.7367215294516509, "learning_rate": 9.780188701803345e-06, "loss": 0.42559328079223635, "num_input_tokens_seen": 123386632, "step": 2815, "train_runtime": 21694.1793, "train_tokens_per_second": 5687.546 }, { "epoch": 0.189873417721519, "grad_norm": 0.7954578075141111, "learning_rate": 9.779412673151772e-06, "loss": 0.40504965782165525, "num_input_tokens_seen": 123614712, "step": 2820, "train_runtime": 21735.5555, "train_tokens_per_second": 5687.212 }, { "epoch": 0.19021007271747914, "grad_norm": 0.7248412230311774, "learning_rate": 9.778635307952686e-06, "loss": 0.4043741703033447, "num_input_tokens_seen": 123839728, "step": 2825, "train_runtime": 21777.9441, "train_tokens_per_second": 5686.475 }, { "epoch": 0.19054672771343928, "grad_norm": 0.9358958553909015, "learning_rate": 9.777856606423472e-06, "loss": 0.403910493850708, "num_input_tokens_seen": 124065288, "step": 2830, "train_runtime": 21817.8593, "train_tokens_per_second": 5686.41 }, { "epoch": 0.19088338270939942, "grad_norm": 0.8463489849936312, "learning_rate": 9.777076568781897e-06, "loss": 0.43606057167053225, "num_input_tokens_seen": 124264360, "step": 2835, "train_runtime": 21855.3285, "train_tokens_per_second": 5685.769 }, { "epoch": 0.19122003770535956, "grad_norm": 0.9165712627873297, "learning_rate": 9.77629519524609e-06, "loss": 0.3660429954528809, "num_input_tokens_seen": 124479288, "step": 2840, "train_runtime": 21894.9089, "train_tokens_per_second": 5685.307 }, { "epoch": 0.1915566927013197, "grad_norm": 0.7656937544219163, "learning_rate": 9.775512486034564e-06, "loss": 0.4081143379211426, "num_input_tokens_seen": 124692848, "step": 2845, "train_runtime": 21938.4076, "train_tokens_per_second": 5683.769 }, { "epoch": 0.19189334769727984, "grad_norm": 0.867416455867072, "learning_rate": 9.774728441366197e-06, "loss": 0.4261101245880127, "num_input_tokens_seen": 124899520, "step": 2850, "train_runtime": 21975.3012, "train_tokens_per_second": 5683.632 }, { "epoch": 0.19223000269323998, "grad_norm": 0.760427761575941, "learning_rate": 9.773943061460249e-06, "loss": 0.39615979194641116, "num_input_tokens_seen": 125109776, "step": 2855, "train_runtime": 22015.122, "train_tokens_per_second": 5682.902 }, { "epoch": 0.19256665768920012, "grad_norm": 0.8768768754679016, "learning_rate": 9.773156346536345e-06, "loss": 0.42858476638793946, "num_input_tokens_seen": 125326624, "step": 2860, "train_runtime": 22054.6435, "train_tokens_per_second": 5682.55 }, { "epoch": 0.19290331268516026, "grad_norm": 0.7656261692386461, "learning_rate": 9.772368296814489e-06, "loss": 0.3920739650726318, "num_input_tokens_seen": 125545392, "step": 2865, "train_runtime": 22088.3487, "train_tokens_per_second": 5683.784 }, { "epoch": 0.1932399676811204, "grad_norm": 0.7687451750642236, "learning_rate": 9.771578912515058e-06, "loss": 0.439731502532959, "num_input_tokens_seen": 125763512, "step": 2870, "train_runtime": 22123.8551, "train_tokens_per_second": 5684.521 }, { "epoch": 0.19357662267708053, "grad_norm": 3.7881124274468654, "learning_rate": 9.7707881938588e-06, "loss": 0.3899986743927002, "num_input_tokens_seen": 125983312, "step": 2875, "train_runtime": 22166.3825, "train_tokens_per_second": 5683.531 }, { "epoch": 0.19391327767304067, "grad_norm": 0.7637738370885714, "learning_rate": 9.769996141066836e-06, "loss": 0.4218841552734375, "num_input_tokens_seen": 126221208, "step": 2880, "train_runtime": 22196.5764, "train_tokens_per_second": 5686.517 }, { "epoch": 0.1942499326690008, "grad_norm": 0.7196684362616566, "learning_rate": 9.76920275436066e-06, "loss": 0.41857566833496096, "num_input_tokens_seen": 126460024, "step": 2885, "train_runtime": 22232.6411, "train_tokens_per_second": 5688.034 }, { "epoch": 0.19458658766496095, "grad_norm": 0.7681501572608938, "learning_rate": 9.768408033962145e-06, "loss": 0.4293510437011719, "num_input_tokens_seen": 126682488, "step": 2890, "train_runtime": 22274.9037, "train_tokens_per_second": 5687.229 }, { "epoch": 0.1949232426609211, "grad_norm": 0.7776932982886595, "learning_rate": 9.767611980093525e-06, "loss": 0.40836372375488283, "num_input_tokens_seen": 126903552, "step": 2895, "train_runtime": 22315.0672, "train_tokens_per_second": 5686.9 }, { "epoch": 0.19525989765688123, "grad_norm": 0.7725164291944147, "learning_rate": 9.76681459297742e-06, "loss": 0.41483469009399415, "num_input_tokens_seen": 127124488, "step": 2900, "train_runtime": 22361.1218, "train_tokens_per_second": 5685.068 }, { "epoch": 0.19559655265284137, "grad_norm": 1.0523171028632952, "learning_rate": 9.766015872836814e-06, "loss": 0.4586020469665527, "num_input_tokens_seen": 127351272, "step": 2905, "train_runtime": 22403.7587, "train_tokens_per_second": 5684.371 }, { "epoch": 0.1959332076488015, "grad_norm": 0.981785930598382, "learning_rate": 9.765215819895066e-06, "loss": 0.4265925407409668, "num_input_tokens_seen": 127584848, "step": 2910, "train_runtime": 22435.5709, "train_tokens_per_second": 5686.722 }, { "epoch": 0.19626986264476165, "grad_norm": 0.7598810830140263, "learning_rate": 9.76441443437591e-06, "loss": 0.3775201320648193, "num_input_tokens_seen": 127815392, "step": 2915, "train_runtime": 22468.3308, "train_tokens_per_second": 5688.691 }, { "epoch": 0.1966065176407218, "grad_norm": 0.8036869153351719, "learning_rate": 9.76361171650345e-06, "loss": 0.4249995708465576, "num_input_tokens_seen": 128025072, "step": 2920, "train_runtime": 22508.1392, "train_tokens_per_second": 5687.946 }, { "epoch": 0.19694317263668193, "grad_norm": 0.8854228803465163, "learning_rate": 9.762807666502164e-06, "loss": 0.41265301704406737, "num_input_tokens_seen": 128236720, "step": 2925, "train_runtime": 22548.1044, "train_tokens_per_second": 5687.251 }, { "epoch": 0.19727982763264207, "grad_norm": 1.302088487080232, "learning_rate": 9.762002284596898e-06, "loss": 0.4183157444000244, "num_input_tokens_seen": 128448432, "step": 2930, "train_runtime": 22591.5125, "train_tokens_per_second": 5685.694 }, { "epoch": 0.1976164826286022, "grad_norm": 0.8232254317537885, "learning_rate": 9.761195571012882e-06, "loss": 0.4257832050323486, "num_input_tokens_seen": 128657896, "step": 2935, "train_runtime": 22629.0733, "train_tokens_per_second": 5685.513 }, { "epoch": 0.19795313762456235, "grad_norm": 0.8172096711574582, "learning_rate": 9.760387525975705e-06, "loss": 0.395475172996521, "num_input_tokens_seen": 128883360, "step": 2940, "train_runtime": 22662.7742, "train_tokens_per_second": 5687.007 }, { "epoch": 0.1982897926205225, "grad_norm": 0.7517384205877706, "learning_rate": 9.759578149711337e-06, "loss": 0.35533039569854735, "num_input_tokens_seen": 129112664, "step": 2945, "train_runtime": 22703.1966, "train_tokens_per_second": 5686.982 }, { "epoch": 0.19862644761648263, "grad_norm": 0.7164265548546924, "learning_rate": 9.758767442446117e-06, "loss": 0.38588006496429444, "num_input_tokens_seen": 129342864, "step": 2950, "train_runtime": 22748.3032, "train_tokens_per_second": 5685.825 }, { "epoch": 0.19896310261244277, "grad_norm": 0.733779366224309, "learning_rate": 9.757955404406755e-06, "loss": 0.38382346630096437, "num_input_tokens_seen": 129566032, "step": 2955, "train_runtime": 22786.3627, "train_tokens_per_second": 5686.122 }, { "epoch": 0.1992997576084029, "grad_norm": 0.9448244412990339, "learning_rate": 9.757142035820337e-06, "loss": 0.3917106628417969, "num_input_tokens_seen": 129766056, "step": 2960, "train_runtime": 22824.9574, "train_tokens_per_second": 5685.27 }, { "epoch": 0.19963641260436304, "grad_norm": 0.9552752355322248, "learning_rate": 9.756327336914318e-06, "loss": 0.4134823322296143, "num_input_tokens_seen": 129977048, "step": 2965, "train_runtime": 22868.2844, "train_tokens_per_second": 5683.725 }, { "epoch": 0.19997306760032318, "grad_norm": 1.0910385569978054, "learning_rate": 9.755511307916526e-06, "loss": 0.4055294990539551, "num_input_tokens_seen": 130194224, "step": 2970, "train_runtime": 22901.3701, "train_tokens_per_second": 5684.997 }, { "epoch": 0.20030972259628332, "grad_norm": 0.8363361731098393, "learning_rate": 9.754693949055161e-06, "loss": 0.4119466781616211, "num_input_tokens_seen": 130423144, "step": 2975, "train_runtime": 22941.2287, "train_tokens_per_second": 5685.098 }, { "epoch": 0.20064637759224346, "grad_norm": 0.8509098752743555, "learning_rate": 9.753875260558795e-06, "loss": 0.43303780555725097, "num_input_tokens_seen": 130623168, "step": 2980, "train_runtime": 22977.1333, "train_tokens_per_second": 5684.92 }, { "epoch": 0.2009830325882036, "grad_norm": 0.7851629802721982, "learning_rate": 9.75305524265637e-06, "loss": 0.39323015213012696, "num_input_tokens_seen": 130853536, "step": 2985, "train_runtime": 23010.865, "train_tokens_per_second": 5686.598 }, { "epoch": 0.20131968758416374, "grad_norm": 0.8423251979034995, "learning_rate": 9.752233895577205e-06, "loss": 0.4042644023895264, "num_input_tokens_seen": 131059592, "step": 2990, "train_runtime": 23047.2444, "train_tokens_per_second": 5686.562 }, { "epoch": 0.20165634258012388, "grad_norm": 0.7311264203424918, "learning_rate": 9.751411219550984e-06, "loss": 0.40361328125, "num_input_tokens_seen": 131276760, "step": 2995, "train_runtime": 23082.7777, "train_tokens_per_second": 5687.217 }, { "epoch": 0.20199299757608402, "grad_norm": 0.9307523548267392, "learning_rate": 9.750587214807766e-06, "loss": 0.39671123027801514, "num_input_tokens_seen": 131486248, "step": 3000, "train_runtime": 23124.9978, "train_tokens_per_second": 5685.892 }, { "epoch": 0.20232965257204416, "grad_norm": 0.8339744148987415, "learning_rate": 9.749761881577981e-06, "loss": 0.42069306373596194, "num_input_tokens_seen": 131716280, "step": 3005, "train_runtime": 23166.3136, "train_tokens_per_second": 5685.681 }, { "epoch": 0.2026663075680043, "grad_norm": 0.7849226835237555, "learning_rate": 9.748935220092434e-06, "loss": 0.39777138233184817, "num_input_tokens_seen": 131935832, "step": 3010, "train_runtime": 23202.4925, "train_tokens_per_second": 5686.278 }, { "epoch": 0.20300296256396444, "grad_norm": 0.8473889903914309, "learning_rate": 9.748107230582295e-06, "loss": 0.39002056121826173, "num_input_tokens_seen": 132140024, "step": 3015, "train_runtime": 23239.8205, "train_tokens_per_second": 5685.931 }, { "epoch": 0.20333961755992458, "grad_norm": 0.7565501165020906, "learning_rate": 9.747277913279109e-06, "loss": 0.4608659267425537, "num_input_tokens_seen": 132358504, "step": 3020, "train_runtime": 23285.5396, "train_tokens_per_second": 5684.15 }, { "epoch": 0.20367627255588472, "grad_norm": 0.71921389289753, "learning_rate": 9.746447268414794e-06, "loss": 0.44081912040710447, "num_input_tokens_seen": 132589576, "step": 3025, "train_runtime": 23324.3416, "train_tokens_per_second": 5684.601 }, { "epoch": 0.20401292755184486, "grad_norm": 0.8592739422898477, "learning_rate": 9.745615296221635e-06, "loss": 0.40747461318969724, "num_input_tokens_seen": 132819496, "step": 3030, "train_runtime": 23358.8471, "train_tokens_per_second": 5686.047 }, { "epoch": 0.204349582547805, "grad_norm": 0.7375243033673482, "learning_rate": 9.74478199693229e-06, "loss": 0.42429242134094236, "num_input_tokens_seen": 133045880, "step": 3035, "train_runtime": 23401.9716, "train_tokens_per_second": 5685.242 }, { "epoch": 0.20468623754376514, "grad_norm": 0.7984195828599883, "learning_rate": 9.743947370779791e-06, "loss": 0.4262086391448975, "num_input_tokens_seen": 133273848, "step": 3040, "train_runtime": 23442.6366, "train_tokens_per_second": 5685.105 }, { "epoch": 0.20502289253972528, "grad_norm": 0.7817233028800991, "learning_rate": 9.743111417997536e-06, "loss": 0.41955132484436036, "num_input_tokens_seen": 133500640, "step": 3045, "train_runtime": 23481.7864, "train_tokens_per_second": 5685.285 }, { "epoch": 0.20535954753568542, "grad_norm": 0.8413661304916547, "learning_rate": 9.742274138819298e-06, "loss": 0.416639518737793, "num_input_tokens_seen": 133719848, "step": 3050, "train_runtime": 23518.5528, "train_tokens_per_second": 5685.718 }, { "epoch": 0.20569620253164558, "grad_norm": 0.8835193289624108, "learning_rate": 9.74143553347922e-06, "loss": 0.45115389823913576, "num_input_tokens_seen": 133944240, "step": 3055, "train_runtime": 23558.0231, "train_tokens_per_second": 5685.716 }, { "epoch": 0.20603285752760572, "grad_norm": 0.7584811920041505, "learning_rate": 9.740595602211814e-06, "loss": 0.395220947265625, "num_input_tokens_seen": 134166880, "step": 3060, "train_runtime": 23594.0834, "train_tokens_per_second": 5686.463 }, { "epoch": 0.20636951252356586, "grad_norm": 0.779533118470965, "learning_rate": 9.739754345251963e-06, "loss": 0.3915586471557617, "num_input_tokens_seen": 134373184, "step": 3065, "train_runtime": 23633.4149, "train_tokens_per_second": 5685.729 }, { "epoch": 0.206706167519526, "grad_norm": 0.752085146799199, "learning_rate": 9.738911762834924e-06, "loss": 0.36250555515289307, "num_input_tokens_seen": 134594840, "step": 3070, "train_runtime": 23669.854, "train_tokens_per_second": 5686.34 }, { "epoch": 0.20704282251548614, "grad_norm": 0.9101615257113173, "learning_rate": 9.738067855196323e-06, "loss": 0.40388903617858884, "num_input_tokens_seen": 134814144, "step": 3075, "train_runtime": 23702.4871, "train_tokens_per_second": 5687.764 }, { "epoch": 0.20737947751144628, "grad_norm": 0.937886524311701, "learning_rate": 9.737222622572153e-06, "loss": 0.4489736557006836, "num_input_tokens_seen": 135025088, "step": 3080, "train_runtime": 23747.5708, "train_tokens_per_second": 5685.848 }, { "epoch": 0.20771613250740642, "grad_norm": 0.939422935382809, "learning_rate": 9.736376065198784e-06, "loss": 0.4101541519165039, "num_input_tokens_seen": 135253064, "step": 3085, "train_runtime": 23786.6187, "train_tokens_per_second": 5686.099 }, { "epoch": 0.20805278750336656, "grad_norm": 0.8449440163538374, "learning_rate": 9.735528183312951e-06, "loss": 0.39399616718292235, "num_input_tokens_seen": 135486752, "step": 3090, "train_runtime": 23827.8882, "train_tokens_per_second": 5686.058 }, { "epoch": 0.2083894424993267, "grad_norm": 0.7846090848755455, "learning_rate": 9.734678977151762e-06, "loss": 0.3820789098739624, "num_input_tokens_seen": 135702632, "step": 3095, "train_runtime": 23868.8149, "train_tokens_per_second": 5685.353 }, { "epoch": 0.20872609749528684, "grad_norm": 0.7998350921308711, "learning_rate": 9.733828446952696e-06, "loss": 0.40059328079223633, "num_input_tokens_seen": 135925976, "step": 3100, "train_runtime": 23904.8211, "train_tokens_per_second": 5686.132 }, { "epoch": 0.20906275249124698, "grad_norm": 0.7794995917456119, "learning_rate": 9.732976592953598e-06, "loss": 0.3992907524108887, "num_input_tokens_seen": 136155256, "step": 3105, "train_runtime": 23947.0473, "train_tokens_per_second": 5685.68 }, { "epoch": 0.20939940748720712, "grad_norm": 0.8028611006413868, "learning_rate": 9.73212341539269e-06, "loss": 0.40617761611938474, "num_input_tokens_seen": 136377968, "step": 3110, "train_runtime": 23995.829, "train_tokens_per_second": 5683.403 }, { "epoch": 0.20973606248316726, "grad_norm": 0.7679301554806387, "learning_rate": 9.731268914508556e-06, "loss": 0.39726805686950684, "num_input_tokens_seen": 136595144, "step": 3115, "train_runtime": 24037.8732, "train_tokens_per_second": 5682.497 }, { "epoch": 0.2100727174791274, "grad_norm": 0.7757940100269232, "learning_rate": 9.730413090540158e-06, "loss": 0.3819112777709961, "num_input_tokens_seen": 136818256, "step": 3120, "train_runtime": 24075.9596, "train_tokens_per_second": 5682.775 }, { "epoch": 0.21040937247508754, "grad_norm": 0.7507007143030089, "learning_rate": 9.729555943726825e-06, "loss": 0.40000243186950685, "num_input_tokens_seen": 137031872, "step": 3125, "train_runtime": 24120.3223, "train_tokens_per_second": 5681.179 }, { "epoch": 0.21074602747104768, "grad_norm": 0.8053852599963457, "learning_rate": 9.728697474308253e-06, "loss": 0.40857748985290526, "num_input_tokens_seen": 137246200, "step": 3130, "train_runtime": 24159.6984, "train_tokens_per_second": 5680.791 }, { "epoch": 0.21108268246700782, "grad_norm": 0.8178855876896101, "learning_rate": 9.72783768252451e-06, "loss": 0.38510382175445557, "num_input_tokens_seen": 137454056, "step": 3135, "train_runtime": 24197.6049, "train_tokens_per_second": 5680.482 }, { "epoch": 0.21141933746296795, "grad_norm": 0.7840878331434453, "learning_rate": 9.726976568616036e-06, "loss": 0.40147695541381834, "num_input_tokens_seen": 137663648, "step": 3140, "train_runtime": 24241.393, "train_tokens_per_second": 5678.867 }, { "epoch": 0.2117559924589281, "grad_norm": 0.9228616942450966, "learning_rate": 9.726114132823638e-06, "loss": 0.389466381072998, "num_input_tokens_seen": 137882432, "step": 3145, "train_runtime": 24280.2706, "train_tokens_per_second": 5678.785 }, { "epoch": 0.21209264745488823, "grad_norm": 0.6934203083016008, "learning_rate": 9.725250375388493e-06, "loss": 0.4213107109069824, "num_input_tokens_seen": 138093344, "step": 3150, "train_runtime": 24320.3928, "train_tokens_per_second": 5678.089 }, { "epoch": 0.21242930245084837, "grad_norm": 0.8669084820101542, "learning_rate": 9.724385296552147e-06, "loss": 0.43596372604370115, "num_input_tokens_seen": 138316336, "step": 3155, "train_runtime": 24362.0648, "train_tokens_per_second": 5677.529 }, { "epoch": 0.2127659574468085, "grad_norm": 0.9337337457982863, "learning_rate": 9.72351889655652e-06, "loss": 0.4109373092651367, "num_input_tokens_seen": 138541888, "step": 3160, "train_runtime": 24397.2747, "train_tokens_per_second": 5678.58 }, { "epoch": 0.21310261244276865, "grad_norm": 0.8342554979170712, "learning_rate": 9.722651175643895e-06, "loss": 0.40399460792541503, "num_input_tokens_seen": 138760928, "step": 3165, "train_runtime": 24436.674, "train_tokens_per_second": 5678.388 }, { "epoch": 0.2134392674387288, "grad_norm": 0.7886653586812639, "learning_rate": 9.721782134056928e-06, "loss": 0.36252574920654296, "num_input_tokens_seen": 138982088, "step": 3170, "train_runtime": 24480.3769, "train_tokens_per_second": 5677.285 }, { "epoch": 0.21377592243468893, "grad_norm": 0.7172325919553721, "learning_rate": 9.720911772038645e-06, "loss": 0.4204305648803711, "num_input_tokens_seen": 139208968, "step": 3175, "train_runtime": 24514.7644, "train_tokens_per_second": 5678.577 }, { "epoch": 0.21411257743064907, "grad_norm": 0.8184330706813875, "learning_rate": 9.720040089832436e-06, "loss": 0.4118339538574219, "num_input_tokens_seen": 139404296, "step": 3180, "train_runtime": 24555.2547, "train_tokens_per_second": 5677.168 }, { "epoch": 0.2144492324266092, "grad_norm": 0.7810238480356294, "learning_rate": 9.719167087682069e-06, "loss": 0.38251235485076907, "num_input_tokens_seen": 139626528, "step": 3185, "train_runtime": 24596.095, "train_tokens_per_second": 5676.776 }, { "epoch": 0.21478588742256935, "grad_norm": 0.8237949114328076, "learning_rate": 9.718292765831673e-06, "loss": 0.39778890609741213, "num_input_tokens_seen": 139852040, "step": 3190, "train_runtime": 24636.5885, "train_tokens_per_second": 5676.599 }, { "epoch": 0.2151225424185295, "grad_norm": 0.823181949661376, "learning_rate": 9.71741712452575e-06, "loss": 0.4149151802062988, "num_input_tokens_seen": 140074344, "step": 3195, "train_runtime": 24669.1536, "train_tokens_per_second": 5678.117 }, { "epoch": 0.21545919741448963, "grad_norm": 0.7987011374780209, "learning_rate": 9.716540164009174e-06, "loss": 0.3865767478942871, "num_input_tokens_seen": 140277680, "step": 3200, "train_runtime": 24707.2868, "train_tokens_per_second": 5677.583 }, { "epoch": 0.21579585241044977, "grad_norm": 0.9131858261391301, "learning_rate": 9.715661884527178e-06, "loss": 0.4173252582550049, "num_input_tokens_seen": 140503936, "step": 3205, "train_runtime": 24750.0835, "train_tokens_per_second": 5676.908 }, { "epoch": 0.2161325074064099, "grad_norm": 0.9283199650974979, "learning_rate": 9.714782286325374e-06, "loss": 0.4102613925933838, "num_input_tokens_seen": 140723000, "step": 3210, "train_runtime": 24793.1175, "train_tokens_per_second": 5675.89 }, { "epoch": 0.21646916240237005, "grad_norm": 0.9449783149453059, "learning_rate": 9.713901369649738e-06, "loss": 0.3924571990966797, "num_input_tokens_seen": 140943200, "step": 3215, "train_runtime": 24831.5013, "train_tokens_per_second": 5675.984 }, { "epoch": 0.2168058173983302, "grad_norm": 0.7571957619819966, "learning_rate": 9.713019134746618e-06, "loss": 0.38917341232299807, "num_input_tokens_seen": 141178808, "step": 3220, "train_runtime": 24867.52, "train_tokens_per_second": 5677.237 }, { "epoch": 0.21714247239429033, "grad_norm": 0.8569813128796843, "learning_rate": 9.712135581862722e-06, "loss": 0.39778847694396974, "num_input_tokens_seen": 141410600, "step": 3225, "train_runtime": 24909.1487, "train_tokens_per_second": 5677.055 }, { "epoch": 0.21747912739025047, "grad_norm": 0.7957771696921552, "learning_rate": 9.711250711245139e-06, "loss": 0.41150903701782227, "num_input_tokens_seen": 141622744, "step": 3230, "train_runtime": 24947.3479, "train_tokens_per_second": 5676.866 }, { "epoch": 0.2178157823862106, "grad_norm": 0.7674615378265653, "learning_rate": 9.710364523141317e-06, "loss": 0.4173532009124756, "num_input_tokens_seen": 141845232, "step": 3235, "train_runtime": 24990.9712, "train_tokens_per_second": 5675.859 }, { "epoch": 0.21815243738217074, "grad_norm": 0.881520768069259, "learning_rate": 9.709477017799076e-06, "loss": 0.4302227973937988, "num_input_tokens_seen": 142068920, "step": 3240, "train_runtime": 25022.7411, "train_tokens_per_second": 5677.592 }, { "epoch": 0.21848909237813088, "grad_norm": 0.9412217646326109, "learning_rate": 9.708588195466604e-06, "loss": 0.4126433849334717, "num_input_tokens_seen": 142289600, "step": 3245, "train_runtime": 25054.9859, "train_tokens_per_second": 5679.093 }, { "epoch": 0.21882574737409102, "grad_norm": 0.7430440131191046, "learning_rate": 9.707698056392458e-06, "loss": 0.4167231559753418, "num_input_tokens_seen": 142506920, "step": 3250, "train_runtime": 25090.3796, "train_tokens_per_second": 5679.743 }, { "epoch": 0.21916240237005116, "grad_norm": 0.8971811831202605, "learning_rate": 9.706806600825562e-06, "loss": 0.4131289005279541, "num_input_tokens_seen": 142719992, "step": 3255, "train_runtime": 25133.8043, "train_tokens_per_second": 5678.408 }, { "epoch": 0.2194990573660113, "grad_norm": 0.9964244321532095, "learning_rate": 9.70591382901521e-06, "loss": 0.42434329986572267, "num_input_tokens_seen": 142935376, "step": 3260, "train_runtime": 25170.1091, "train_tokens_per_second": 5678.775 }, { "epoch": 0.21983571236197144, "grad_norm": 0.7540863225432197, "learning_rate": 9.705019741211061e-06, "loss": 0.39461374282836914, "num_input_tokens_seen": 143155712, "step": 3265, "train_runtime": 25208.8229, "train_tokens_per_second": 5678.794 }, { "epoch": 0.22017236735793158, "grad_norm": 0.8596938023198728, "learning_rate": 9.704124337663145e-06, "loss": 0.38963048458099364, "num_input_tokens_seen": 143381832, "step": 3270, "train_runtime": 25243.421, "train_tokens_per_second": 5679.968 }, { "epoch": 0.22050902235389172, "grad_norm": 0.8540309395774371, "learning_rate": 9.703227618621859e-06, "loss": 0.4044978618621826, "num_input_tokens_seen": 143607328, "step": 3275, "train_runtime": 25284.0238, "train_tokens_per_second": 5679.766 }, { "epoch": 0.22084567734985186, "grad_norm": 0.8072539756195105, "learning_rate": 9.702329584337965e-06, "loss": 0.41426868438720704, "num_input_tokens_seen": 143809000, "step": 3280, "train_runtime": 25326.637, "train_tokens_per_second": 5678.172 }, { "epoch": 0.221182332345812, "grad_norm": 0.9295650810498607, "learning_rate": 9.701430235062599e-06, "loss": 0.43207788467407227, "num_input_tokens_seen": 144023696, "step": 3285, "train_runtime": 25366.0897, "train_tokens_per_second": 5677.804 }, { "epoch": 0.22151898734177214, "grad_norm": 0.9183012776415354, "learning_rate": 9.700529571047259e-06, "loss": 0.4370114803314209, "num_input_tokens_seen": 144236616, "step": 3290, "train_runtime": 25403.6973, "train_tokens_per_second": 5677.78 }, { "epoch": 0.22185564233773228, "grad_norm": 0.8676275172270271, "learning_rate": 9.699627592543814e-06, "loss": 0.3935758829116821, "num_input_tokens_seen": 144451272, "step": 3295, "train_runtime": 25449.4742, "train_tokens_per_second": 5676.002 }, { "epoch": 0.22219229733369245, "grad_norm": 0.7791903636055438, "learning_rate": 9.698724299804498e-06, "loss": 0.41451497077941896, "num_input_tokens_seen": 144675240, "step": 3300, "train_runtime": 25489.8713, "train_tokens_per_second": 5675.793 }, { "epoch": 0.22252895232965259, "grad_norm": 0.8026534486815711, "learning_rate": 9.697819693081915e-06, "loss": 0.40555124282836913, "num_input_tokens_seen": 144894992, "step": 3305, "train_runtime": 25526.7574, "train_tokens_per_second": 5676.2 }, { "epoch": 0.22286560732561272, "grad_norm": 0.7189128013140877, "learning_rate": 9.696913772629034e-06, "loss": 0.38943185806274416, "num_input_tokens_seen": 145119152, "step": 3310, "train_runtime": 25563.6911, "train_tokens_per_second": 5676.768 }, { "epoch": 0.22320226232157286, "grad_norm": 0.788476880680751, "learning_rate": 9.696006538699195e-06, "loss": 0.42933268547058107, "num_input_tokens_seen": 145340576, "step": 3315, "train_runtime": 25595.5361, "train_tokens_per_second": 5678.356 }, { "epoch": 0.223538917317533, "grad_norm": 0.9173858981265539, "learning_rate": 9.695097991546102e-06, "loss": 0.41726884841918943, "num_input_tokens_seen": 145536392, "step": 3320, "train_runtime": 25635.2268, "train_tokens_per_second": 5677.203 }, { "epoch": 0.22387557231349314, "grad_norm": 0.85644319812075, "learning_rate": 9.694188131423828e-06, "loss": 0.38661761283874513, "num_input_tokens_seen": 145752592, "step": 3325, "train_runtime": 25675.7087, "train_tokens_per_second": 5676.673 }, { "epoch": 0.22421222730945328, "grad_norm": 0.8283061394820891, "learning_rate": 9.693276958586809e-06, "loss": 0.4395936965942383, "num_input_tokens_seen": 145975632, "step": 3330, "train_runtime": 25717.6903, "train_tokens_per_second": 5676.079 }, { "epoch": 0.22454888230541342, "grad_norm": 1.107175434088717, "learning_rate": 9.692364473289856e-06, "loss": 0.37718255519866944, "num_input_tokens_seen": 146190016, "step": 3335, "train_runtime": 25758.607, "train_tokens_per_second": 5675.385 }, { "epoch": 0.22488553730137356, "grad_norm": 0.8144408251561523, "learning_rate": 9.69145067578814e-06, "loss": 0.38504073619842527, "num_input_tokens_seen": 146415880, "step": 3340, "train_runtime": 25799.3872, "train_tokens_per_second": 5675.169 }, { "epoch": 0.2252221922973337, "grad_norm": 0.7888334595920984, "learning_rate": 9.690535566337205e-06, "loss": 0.44390153884887695, "num_input_tokens_seen": 146637056, "step": 3345, "train_runtime": 25841.4558, "train_tokens_per_second": 5674.489 }, { "epoch": 0.22555884729329384, "grad_norm": 0.8121918469969017, "learning_rate": 9.689619145192955e-06, "loss": 0.4186522960662842, "num_input_tokens_seen": 146858960, "step": 3350, "train_runtime": 25884.465, "train_tokens_per_second": 5673.633 }, { "epoch": 0.22589550228925398, "grad_norm": 0.7357528337250359, "learning_rate": 9.688701412611663e-06, "loss": 0.39981067180633545, "num_input_tokens_seen": 147088760, "step": 3355, "train_runtime": 25924.1782, "train_tokens_per_second": 5673.806 }, { "epoch": 0.22623215728521412, "grad_norm": 0.8039258104050244, "learning_rate": 9.687782368849973e-06, "loss": 0.40915794372558595, "num_input_tokens_seen": 147306920, "step": 3360, "train_runtime": 25967.0787, "train_tokens_per_second": 5672.834 }, { "epoch": 0.22656881228117426, "grad_norm": 0.8366828009872761, "learning_rate": 9.686862014164893e-06, "loss": 0.3879998207092285, "num_input_tokens_seen": 147534144, "step": 3365, "train_runtime": 26004.3358, "train_tokens_per_second": 5673.444 }, { "epoch": 0.2269054672771344, "grad_norm": 0.8583728877321222, "learning_rate": 9.685940348813795e-06, "loss": 0.3802268266677856, "num_input_tokens_seen": 147751544, "step": 3370, "train_runtime": 26042.4838, "train_tokens_per_second": 5673.481 }, { "epoch": 0.22724212227309454, "grad_norm": 0.8211994293131717, "learning_rate": 9.685017373054421e-06, "loss": 0.39569883346557616, "num_input_tokens_seen": 147971208, "step": 3375, "train_runtime": 26081.1089, "train_tokens_per_second": 5673.501 }, { "epoch": 0.22757877726905468, "grad_norm": 0.7908688808511072, "learning_rate": 9.68409308714488e-06, "loss": 0.3963681697845459, "num_input_tokens_seen": 148186648, "step": 3380, "train_runtime": 26119.5816, "train_tokens_per_second": 5673.393 }, { "epoch": 0.22791543226501482, "grad_norm": 0.7696519906828798, "learning_rate": 9.68316749134364e-06, "loss": 0.4038090705871582, "num_input_tokens_seen": 148417752, "step": 3385, "train_runtime": 26162.0325, "train_tokens_per_second": 5673.021 }, { "epoch": 0.22825208726097496, "grad_norm": 0.7784468571247383, "learning_rate": 9.682240585909545e-06, "loss": 0.38401403427124026, "num_input_tokens_seen": 148628520, "step": 3390, "train_runtime": 26201.9074, "train_tokens_per_second": 5672.431 }, { "epoch": 0.2285887422569351, "grad_norm": 0.7682945918583601, "learning_rate": 9.681312371101803e-06, "loss": 0.36235072612762453, "num_input_tokens_seen": 148860120, "step": 3395, "train_runtime": 26235.4949, "train_tokens_per_second": 5673.997 }, { "epoch": 0.22892539725289524, "grad_norm": 0.7562252932302131, "learning_rate": 9.680382847179984e-06, "loss": 0.4153308868408203, "num_input_tokens_seen": 149075360, "step": 3400, "train_runtime": 26279.0336, "train_tokens_per_second": 5672.787 }, { "epoch": 0.22926205224885537, "grad_norm": 0.8026900227545827, "learning_rate": 9.679452014404025e-06, "loss": 0.39875361919403074, "num_input_tokens_seen": 149283904, "step": 3405, "train_runtime": 26318.8542, "train_tokens_per_second": 5672.128 }, { "epoch": 0.22959870724481551, "grad_norm": 0.8571181299293755, "learning_rate": 9.678519873034234e-06, "loss": 0.435106086730957, "num_input_tokens_seen": 149511344, "step": 3410, "train_runtime": 26357.0843, "train_tokens_per_second": 5672.53 }, { "epoch": 0.22993536224077565, "grad_norm": 0.9132428672371381, "learning_rate": 9.677586423331277e-06, "loss": 0.42625818252563474, "num_input_tokens_seen": 149734672, "step": 3415, "train_runtime": 26396.1327, "train_tokens_per_second": 5672.599 }, { "epoch": 0.2302720172367358, "grad_norm": 0.7227848772197648, "learning_rate": 9.676651665556194e-06, "loss": 0.3853285312652588, "num_input_tokens_seen": 149966984, "step": 3420, "train_runtime": 26437.1674, "train_tokens_per_second": 5672.581 }, { "epoch": 0.23060867223269593, "grad_norm": 0.9758464763691787, "learning_rate": 9.675715599970383e-06, "loss": 0.39388408660888674, "num_input_tokens_seen": 150173312, "step": 3425, "train_runtime": 26476.8347, "train_tokens_per_second": 5671.876 }, { "epoch": 0.23094532722865607, "grad_norm": 0.8789640499008409, "learning_rate": 9.674778226835617e-06, "loss": 0.43226184844970705, "num_input_tokens_seen": 150378728, "step": 3430, "train_runtime": 26514.5982, "train_tokens_per_second": 5671.545 }, { "epoch": 0.2312819822246162, "grad_norm": 0.8223781330799458, "learning_rate": 9.673839546414026e-06, "loss": 0.4151242733001709, "num_input_tokens_seen": 150589928, "step": 3435, "train_runtime": 26555.5388, "train_tokens_per_second": 5670.754 }, { "epoch": 0.23161863722057635, "grad_norm": 0.6819707841325117, "learning_rate": 9.672899558968107e-06, "loss": 0.39006340503692627, "num_input_tokens_seen": 150802664, "step": 3440, "train_runtime": 26599.7743, "train_tokens_per_second": 5669.321 }, { "epoch": 0.2319552922165365, "grad_norm": 0.8192017234463131, "learning_rate": 9.67195826476073e-06, "loss": 0.44136791229248046, "num_input_tokens_seen": 151027880, "step": 3445, "train_runtime": 26637.6563, "train_tokens_per_second": 5669.714 }, { "epoch": 0.23229194721249663, "grad_norm": 0.8137299353827566, "learning_rate": 9.671015664055122e-06, "loss": 0.3967195749282837, "num_input_tokens_seen": 151239928, "step": 3450, "train_runtime": 26671.0692, "train_tokens_per_second": 5670.561 }, { "epoch": 0.23262860220845677, "grad_norm": 0.819274273484707, "learning_rate": 9.670071757114877e-06, "loss": 0.4030034065246582, "num_input_tokens_seen": 151459832, "step": 3455, "train_runtime": 26710.598, "train_tokens_per_second": 5670.402 }, { "epoch": 0.2329652572044169, "grad_norm": 0.8052967688256787, "learning_rate": 9.669126544203957e-06, "loss": 0.38636322021484376, "num_input_tokens_seen": 151667896, "step": 3460, "train_runtime": 26749.1234, "train_tokens_per_second": 5670.014 }, { "epoch": 0.23330191220037705, "grad_norm": 0.8630240510385624, "learning_rate": 9.668180025586689e-06, "loss": 0.4077507972717285, "num_input_tokens_seen": 151902352, "step": 3465, "train_runtime": 26791.3212, "train_tokens_per_second": 5669.834 }, { "epoch": 0.2336385671963372, "grad_norm": 0.7786921906276983, "learning_rate": 9.667232201527761e-06, "loss": 0.3916687250137329, "num_input_tokens_seen": 152102680, "step": 3470, "train_runtime": 26827.5433, "train_tokens_per_second": 5669.646 }, { "epoch": 0.23397522219229733, "grad_norm": 0.8593939179148706, "learning_rate": 9.666283072292234e-06, "loss": 0.41549954414367674, "num_input_tokens_seen": 152303592, "step": 3475, "train_runtime": 26864.7416, "train_tokens_per_second": 5669.274 }, { "epoch": 0.23431187718825747, "grad_norm": 0.7173015967840941, "learning_rate": 9.665332638145522e-06, "loss": 0.40798091888427734, "num_input_tokens_seen": 152526320, "step": 3480, "train_runtime": 26904.6608, "train_tokens_per_second": 5669.141 }, { "epoch": 0.2346485321842176, "grad_norm": 0.7787780767474121, "learning_rate": 9.664380899353414e-06, "loss": 0.44217610359191895, "num_input_tokens_seen": 152747800, "step": 3485, "train_runtime": 26938.7633, "train_tokens_per_second": 5670.186 }, { "epoch": 0.23498518718017775, "grad_norm": 0.875181117161752, "learning_rate": 9.663427856182062e-06, "loss": 0.418949556350708, "num_input_tokens_seen": 152978904, "step": 3490, "train_runtime": 26976.7683, "train_tokens_per_second": 5670.765 }, { "epoch": 0.23532184217613789, "grad_norm": 0.8234151432189463, "learning_rate": 9.662473508897981e-06, "loss": 0.41005191802978513, "num_input_tokens_seen": 153200600, "step": 3495, "train_runtime": 27021.1553, "train_tokens_per_second": 5669.654 }, { "epoch": 0.23565849717209802, "grad_norm": 0.9381121440419455, "learning_rate": 9.661517857768052e-06, "loss": 0.43746633529663087, "num_input_tokens_seen": 153413320, "step": 3500, "train_runtime": 27058.2447, "train_tokens_per_second": 5669.744 }, { "epoch": 0.23599515216805816, "grad_norm": 0.9159040524887876, "learning_rate": 9.660560903059517e-06, "loss": 0.4074262619018555, "num_input_tokens_seen": 153619928, "step": 3505, "train_runtime": 27099.4693, "train_tokens_per_second": 5668.743 }, { "epoch": 0.2363318071640183, "grad_norm": 0.7088057637221193, "learning_rate": 9.659602645039988e-06, "loss": 0.4169961929321289, "num_input_tokens_seen": 153844808, "step": 3510, "train_runtime": 27137.4232, "train_tokens_per_second": 5669.102 }, { "epoch": 0.23666846215997844, "grad_norm": 0.7425326417567343, "learning_rate": 9.658643083977435e-06, "loss": 0.37222681045532224, "num_input_tokens_seen": 154057008, "step": 3515, "train_runtime": 27172.217, "train_tokens_per_second": 5669.652 }, { "epoch": 0.23700511715593858, "grad_norm": 0.7835915209475461, "learning_rate": 9.657682220140202e-06, "loss": 0.3870618104934692, "num_input_tokens_seen": 154257952, "step": 3520, "train_runtime": 27216.0159, "train_tokens_per_second": 5667.911 }, { "epoch": 0.23734177215189872, "grad_norm": 0.944898207115128, "learning_rate": 9.656720053796987e-06, "loss": 0.4269230365753174, "num_input_tokens_seen": 154468968, "step": 3525, "train_runtime": 27253.774, "train_tokens_per_second": 5667.801 }, { "epoch": 0.23767842714785886, "grad_norm": 0.964924059220392, "learning_rate": 9.655756585216859e-06, "loss": 0.39426770210266116, "num_input_tokens_seen": 154679920, "step": 3530, "train_runtime": 27297.8899, "train_tokens_per_second": 5666.369 }, { "epoch": 0.238015082143819, "grad_norm": 0.8389859916982031, "learning_rate": 9.654791814669246e-06, "loss": 0.41727919578552247, "num_input_tokens_seen": 154894088, "step": 3535, "train_runtime": 27338.9009, "train_tokens_per_second": 5665.703 }, { "epoch": 0.23835173713977914, "grad_norm": 0.7799448759874524, "learning_rate": 9.653825742423949e-06, "loss": 0.36776251792907716, "num_input_tokens_seen": 155118416, "step": 3540, "train_runtime": 27380.1523, "train_tokens_per_second": 5665.36 }, { "epoch": 0.2386883921357393, "grad_norm": 0.7611172988563449, "learning_rate": 9.652858368751118e-06, "loss": 0.38267481327056885, "num_input_tokens_seen": 155325944, "step": 3545, "train_runtime": 27419.2328, "train_tokens_per_second": 5664.854 }, { "epoch": 0.23902504713169945, "grad_norm": 0.849616732171608, "learning_rate": 9.651889693921284e-06, "loss": 0.39499473571777344, "num_input_tokens_seen": 155553936, "step": 3550, "train_runtime": 27453.0014, "train_tokens_per_second": 5666.191 }, { "epoch": 0.2393617021276596, "grad_norm": 0.8290842696777342, "learning_rate": 9.650919718205331e-06, "loss": 0.46364564895629884, "num_input_tokens_seen": 155767440, "step": 3555, "train_runtime": 27489.7425, "train_tokens_per_second": 5666.384 }, { "epoch": 0.23969835712361973, "grad_norm": 0.6972330732061462, "learning_rate": 9.649948441874509e-06, "loss": 0.41176652908325195, "num_input_tokens_seen": 155991432, "step": 3560, "train_runtime": 27533.7281, "train_tokens_per_second": 5665.467 }, { "epoch": 0.24003501211957987, "grad_norm": 0.8232987599322095, "learning_rate": 9.648975865200434e-06, "loss": 0.3719303607940674, "num_input_tokens_seen": 156200840, "step": 3565, "train_runtime": 27572.2717, "train_tokens_per_second": 5665.142 }, { "epoch": 0.24037166711554, "grad_norm": 0.7784058710951964, "learning_rate": 9.648001988455082e-06, "loss": 0.42696056365966795, "num_input_tokens_seen": 156423232, "step": 3570, "train_runtime": 27611.0095, "train_tokens_per_second": 5665.249 }, { "epoch": 0.24070832211150014, "grad_norm": 0.8101799377558996, "learning_rate": 9.647026811910794e-06, "loss": 0.42109375, "num_input_tokens_seen": 156638144, "step": 3575, "train_runtime": 27652.042, "train_tokens_per_second": 5664.614 }, { "epoch": 0.24104497710746028, "grad_norm": 0.7776435744711748, "learning_rate": 9.646050335840279e-06, "loss": 0.440277624130249, "num_input_tokens_seen": 156867440, "step": 3580, "train_runtime": 27693.6123, "train_tokens_per_second": 5664.391 }, { "epoch": 0.24138163210342042, "grad_norm": 0.8251722449916711, "learning_rate": 9.6450725605166e-06, "loss": 0.4013186454772949, "num_input_tokens_seen": 157079728, "step": 3585, "train_runtime": 27726.0789, "train_tokens_per_second": 5665.414 }, { "epoch": 0.24171828709938056, "grad_norm": 0.8433224749813183, "learning_rate": 9.644093486213192e-06, "loss": 0.4329217910766602, "num_input_tokens_seen": 157312856, "step": 3590, "train_runtime": 27767.0627, "train_tokens_per_second": 5665.448 }, { "epoch": 0.2420549420953407, "grad_norm": 0.8662917363975451, "learning_rate": 9.64311311320385e-06, "loss": 0.4125063896179199, "num_input_tokens_seen": 157536824, "step": 3595, "train_runtime": 27801.6779, "train_tokens_per_second": 5666.45 }, { "epoch": 0.24239159709130084, "grad_norm": 0.8971134461583352, "learning_rate": 9.642131441762732e-06, "loss": 0.39645483493804934, "num_input_tokens_seen": 157744672, "step": 3600, "train_runtime": 27838.8811, "train_tokens_per_second": 5666.344 }, { "epoch": 0.24272825208726098, "grad_norm": 0.8431994851395936, "learning_rate": 9.641148472164359e-06, "loss": 0.3727452516555786, "num_input_tokens_seen": 157957176, "step": 3605, "train_runtime": 27875.6937, "train_tokens_per_second": 5666.484 }, { "epoch": 0.24306490708322112, "grad_norm": 0.8088195809393041, "learning_rate": 9.640164204683616e-06, "loss": 0.39656991958618165, "num_input_tokens_seen": 158185920, "step": 3610, "train_runtime": 27916.062, "train_tokens_per_second": 5666.484 }, { "epoch": 0.24340156207918126, "grad_norm": 0.8326446982063453, "learning_rate": 9.639178639595748e-06, "loss": 0.43434457778930663, "num_input_tokens_seen": 158410048, "step": 3615, "train_runtime": 27944.4625, "train_tokens_per_second": 5668.746 }, { "epoch": 0.2437382170751414, "grad_norm": 0.7829852555366933, "learning_rate": 9.638191777176367e-06, "loss": 0.40036301612854003, "num_input_tokens_seen": 158632248, "step": 3620, "train_runtime": 27978.7949, "train_tokens_per_second": 5669.731 }, { "epoch": 0.24407487207110154, "grad_norm": 0.7554602216351339, "learning_rate": 9.637203617701446e-06, "loss": 0.41867575645446775, "num_input_tokens_seen": 158861832, "step": 3625, "train_runtime": 28021.0376, "train_tokens_per_second": 5669.377 }, { "epoch": 0.24441152706706168, "grad_norm": 0.7700724836949714, "learning_rate": 9.63621416144732e-06, "loss": 0.3974162578582764, "num_input_tokens_seen": 159076104, "step": 3630, "train_runtime": 28057.1542, "train_tokens_per_second": 5669.716 }, { "epoch": 0.24474818206302182, "grad_norm": 0.819901947145382, "learning_rate": 9.635223408690688e-06, "loss": 0.39289240837097167, "num_input_tokens_seen": 159275688, "step": 3635, "train_runtime": 28092.5481, "train_tokens_per_second": 5669.678 }, { "epoch": 0.24508483705898196, "grad_norm": 0.74792422760683, "learning_rate": 9.63423135970861e-06, "loss": 0.4178638935089111, "num_input_tokens_seen": 159506232, "step": 3640, "train_runtime": 28131.9808, "train_tokens_per_second": 5669.925 }, { "epoch": 0.2454214920549421, "grad_norm": 0.8690926777352274, "learning_rate": 9.633238014778511e-06, "loss": 0.4228395462036133, "num_input_tokens_seen": 159735712, "step": 3645, "train_runtime": 28164.6263, "train_tokens_per_second": 5671.501 }, { "epoch": 0.24575814705090224, "grad_norm": 0.8408876506004788, "learning_rate": 9.632243374178173e-06, "loss": 0.3977930784225464, "num_input_tokens_seen": 159959000, "step": 3650, "train_runtime": 28206.3804, "train_tokens_per_second": 5671.022 }, { "epoch": 0.24609480204686238, "grad_norm": 0.8178577594154023, "learning_rate": 9.63124743818575e-06, "loss": 0.42597079277038574, "num_input_tokens_seen": 160183304, "step": 3655, "train_runtime": 28242.8523, "train_tokens_per_second": 5671.64 }, { "epoch": 0.24643145704282252, "grad_norm": 0.7174819842350753, "learning_rate": 9.630250207079745e-06, "loss": 0.385437536239624, "num_input_tokens_seen": 160396208, "step": 3660, "train_runtime": 28279.1927, "train_tokens_per_second": 5671.881 }, { "epoch": 0.24676811203878266, "grad_norm": 0.9558291181876568, "learning_rate": 9.629251681139038e-06, "loss": 0.41692662239074707, "num_input_tokens_seen": 160619648, "step": 3665, "train_runtime": 28315.8408, "train_tokens_per_second": 5672.431 }, { "epoch": 0.2471047670347428, "grad_norm": 0.7393493036785912, "learning_rate": 9.628251860642857e-06, "loss": 0.40501389503479, "num_input_tokens_seen": 160832936, "step": 3670, "train_runtime": 28358.3536, "train_tokens_per_second": 5671.448 }, { "epoch": 0.24744142203070293, "grad_norm": 1.3913304565406266, "learning_rate": 9.627250745870805e-06, "loss": 0.4110020637512207, "num_input_tokens_seen": 161045560, "step": 3675, "train_runtime": 28395.0175, "train_tokens_per_second": 5671.613 }, { "epoch": 0.24777807702666307, "grad_norm": 0.7989443375204172, "learning_rate": 9.626248337102834e-06, "loss": 0.4464590072631836, "num_input_tokens_seen": 161267264, "step": 3680, "train_runtime": 28433.9863, "train_tokens_per_second": 5671.638 }, { "epoch": 0.2481147320226232, "grad_norm": 0.8100743623465356, "learning_rate": 9.625244634619269e-06, "loss": 0.42216014862060547, "num_input_tokens_seen": 161484928, "step": 3685, "train_runtime": 28470.6875, "train_tokens_per_second": 5671.971 }, { "epoch": 0.24845138701858335, "grad_norm": 0.8140092686493631, "learning_rate": 9.62423963870079e-06, "loss": 0.4016411781311035, "num_input_tokens_seen": 161695760, "step": 3690, "train_runtime": 28513.9311, "train_tokens_per_second": 5670.764 }, { "epoch": 0.2487880420145435, "grad_norm": 0.7547948701222302, "learning_rate": 9.623233349628441e-06, "loss": 0.36588501930236816, "num_input_tokens_seen": 161906344, "step": 3695, "train_runtime": 28554.4813, "train_tokens_per_second": 5670.085 }, { "epoch": 0.24912469701050363, "grad_norm": 0.7855444375692547, "learning_rate": 9.62222576768363e-06, "loss": 0.37874155044555663, "num_input_tokens_seen": 162121952, "step": 3700, "train_runtime": 28593.7113, "train_tokens_per_second": 5669.846 }, { "epoch": 0.24946135200646377, "grad_norm": 0.8013508326751752, "learning_rate": 9.62121689314812e-06, "loss": 0.4508801460266113, "num_input_tokens_seen": 162339592, "step": 3705, "train_runtime": 28637.9282, "train_tokens_per_second": 5668.692 }, { "epoch": 0.2497980070024239, "grad_norm": 0.8341179639748463, "learning_rate": 9.620206726304045e-06, "loss": 0.4121876239776611, "num_input_tokens_seen": 162551488, "step": 3710, "train_runtime": 28677.3311, "train_tokens_per_second": 5668.292 }, { "epoch": 0.2501346619983841, "grad_norm": 0.7606955484077755, "learning_rate": 9.61919526743389e-06, "loss": 0.4007285118103027, "num_input_tokens_seen": 162775296, "step": 3715, "train_runtime": 28717.1122, "train_tokens_per_second": 5668.233 }, { "epoch": 0.2504713169943442, "grad_norm": 0.7586767868766064, "learning_rate": 9.618182516820507e-06, "loss": 0.4169614315032959, "num_input_tokens_seen": 163004008, "step": 3720, "train_runtime": 28752.7905, "train_tokens_per_second": 5669.154 }, { "epoch": 0.25080797199030436, "grad_norm": 0.7958372407148936, "learning_rate": 9.61716847474711e-06, "loss": 0.38545975685119627, "num_input_tokens_seen": 163216408, "step": 3725, "train_runtime": 28788.1056, "train_tokens_per_second": 5669.578 }, { "epoch": 0.2511446269862645, "grad_norm": 0.7821165797023588, "learning_rate": 9.616153141497273e-06, "loss": 0.41805257797241213, "num_input_tokens_seen": 163430088, "step": 3730, "train_runtime": 28827.4553, "train_tokens_per_second": 5669.251 }, { "epoch": 0.25148128198222464, "grad_norm": 0.8340007896342425, "learning_rate": 9.61513651735493e-06, "loss": 0.37319297790527345, "num_input_tokens_seen": 163642328, "step": 3735, "train_runtime": 28865.8432, "train_tokens_per_second": 5669.065 }, { "epoch": 0.2518179369781848, "grad_norm": 0.8830424913719485, "learning_rate": 9.614118602604376e-06, "loss": 0.3945745944976807, "num_input_tokens_seen": 163838104, "step": 3740, "train_runtime": 28903.991, "train_tokens_per_second": 5668.356 }, { "epoch": 0.2521545919741449, "grad_norm": 0.8052297510787393, "learning_rate": 9.613099397530267e-06, "loss": 0.3722787380218506, "num_input_tokens_seen": 164064200, "step": 3745, "train_runtime": 28947.9133, "train_tokens_per_second": 5667.566 }, { "epoch": 0.25249124697010505, "grad_norm": 0.7862742185087508, "learning_rate": 9.612078902417623e-06, "loss": 0.4092113018035889, "num_input_tokens_seen": 164293832, "step": 3750, "train_runtime": 28984.6022, "train_tokens_per_second": 5668.314 }, { "epoch": 0.2528279019660652, "grad_norm": 0.917777159281807, "learning_rate": 9.611057117551821e-06, "loss": 0.4049520492553711, "num_input_tokens_seen": 164494120, "step": 3755, "train_runtime": 29022.09, "train_tokens_per_second": 5667.894 }, { "epoch": 0.25316455696202533, "grad_norm": 0.7487164986896401, "learning_rate": 9.610034043218598e-06, "loss": 0.41929073333740235, "num_input_tokens_seen": 164721320, "step": 3760, "train_runtime": 29064.6791, "train_tokens_per_second": 5667.405 }, { "epoch": 0.2535012119579855, "grad_norm": 0.8821854609765899, "learning_rate": 9.609009679704057e-06, "loss": 0.4089076995849609, "num_input_tokens_seen": 164941328, "step": 3765, "train_runtime": 29100.0265, "train_tokens_per_second": 5668.082 }, { "epoch": 0.2538378669539456, "grad_norm": 0.8451569510904378, "learning_rate": 9.607984027294654e-06, "loss": 0.4017925262451172, "num_input_tokens_seen": 165148144, "step": 3770, "train_runtime": 29142.825, "train_tokens_per_second": 5666.854 }, { "epoch": 0.25417452194990575, "grad_norm": 0.7139702054990582, "learning_rate": 9.606957086277213e-06, "loss": 0.4037941455841064, "num_input_tokens_seen": 165372064, "step": 3775, "train_runtime": 29183.2104, "train_tokens_per_second": 5666.685 }, { "epoch": 0.2545111769458659, "grad_norm": 0.8399965732594856, "learning_rate": 9.605928856938913e-06, "loss": 0.4064283847808838, "num_input_tokens_seen": 165589000, "step": 3780, "train_runtime": 29221.4526, "train_tokens_per_second": 5666.693 }, { "epoch": 0.25484783194182603, "grad_norm": 0.7840999876703054, "learning_rate": 9.604899339567298e-06, "loss": 0.3694040060043335, "num_input_tokens_seen": 165806496, "step": 3785, "train_runtime": 29262.2531, "train_tokens_per_second": 5666.225 }, { "epoch": 0.25518448693778617, "grad_norm": 0.8254996088572744, "learning_rate": 9.603868534450263e-06, "loss": 0.370687198638916, "num_input_tokens_seen": 166040152, "step": 3790, "train_runtime": 29297.3995, "train_tokens_per_second": 5667.402 }, { "epoch": 0.2555211419337463, "grad_norm": 0.8205302355074221, "learning_rate": 9.602836441876074e-06, "loss": 0.3572968006134033, "num_input_tokens_seen": 166264712, "step": 3795, "train_runtime": 29337.7818, "train_tokens_per_second": 5667.256 }, { "epoch": 0.25585779692970645, "grad_norm": 0.9811797993807015, "learning_rate": 9.601803062133353e-06, "loss": 0.3995164394378662, "num_input_tokens_seen": 166486544, "step": 3800, "train_runtime": 29381.5758, "train_tokens_per_second": 5666.359 }, { "epoch": 0.2561944519256666, "grad_norm": 0.7702336235429141, "learning_rate": 9.600768395511078e-06, "loss": 0.3709728717803955, "num_input_tokens_seen": 166705432, "step": 3805, "train_runtime": 29417.1853, "train_tokens_per_second": 5666.94 }, { "epoch": 0.25653110692162673, "grad_norm": 0.8067121262918427, "learning_rate": 9.599732442298592e-06, "loss": 0.39358603954315186, "num_input_tokens_seen": 166928072, "step": 3810, "train_runtime": 29453.7851, "train_tokens_per_second": 5667.457 }, { "epoch": 0.25686776191758687, "grad_norm": 0.8388091751069785, "learning_rate": 9.598695202785596e-06, "loss": 0.3980567216873169, "num_input_tokens_seen": 167135336, "step": 3815, "train_runtime": 29489.9025, "train_tokens_per_second": 5667.545 }, { "epoch": 0.257204416913547, "grad_norm": 0.7655332462464155, "learning_rate": 9.59765667726215e-06, "loss": 0.3841102600097656, "num_input_tokens_seen": 167356664, "step": 3820, "train_runtime": 29526.6684, "train_tokens_per_second": 5667.983 }, { "epoch": 0.25754107190950715, "grad_norm": 0.8418059528589851, "learning_rate": 9.596616866018677e-06, "loss": 0.46039524078369143, "num_input_tokens_seen": 167568600, "step": 3825, "train_runtime": 29568.9722, "train_tokens_per_second": 5667.042 }, { "epoch": 0.2578777269054673, "grad_norm": 0.87917393714771, "learning_rate": 9.595575769345955e-06, "loss": 0.3880587100982666, "num_input_tokens_seen": 167766736, "step": 3830, "train_runtime": 29608.4677, "train_tokens_per_second": 5666.174 }, { "epoch": 0.2582143819014274, "grad_norm": 0.7766137760871757, "learning_rate": 9.594533387535122e-06, "loss": 0.41129217147827146, "num_input_tokens_seen": 167995600, "step": 3835, "train_runtime": 29647.1244, "train_tokens_per_second": 5666.506 }, { "epoch": 0.25855103689738757, "grad_norm": 0.7405296564338093, "learning_rate": 9.593489720877678e-06, "loss": 0.4008028984069824, "num_input_tokens_seen": 168214488, "step": 3840, "train_runtime": 29683.6625, "train_tokens_per_second": 5666.905 }, { "epoch": 0.2588876918933477, "grad_norm": 0.8634330150776178, "learning_rate": 9.592444769665482e-06, "loss": 0.37677698135375975, "num_input_tokens_seen": 168446672, "step": 3845, "train_runtime": 29726.006, "train_tokens_per_second": 5666.643 }, { "epoch": 0.25922434688930784, "grad_norm": 0.967218365398896, "learning_rate": 9.59139853419075e-06, "loss": 0.3776779413223267, "num_input_tokens_seen": 168649368, "step": 3850, "train_runtime": 29767.8639, "train_tokens_per_second": 5665.484 }, { "epoch": 0.259561001885268, "grad_norm": 0.7776571735726057, "learning_rate": 9.590351014746059e-06, "loss": 0.40406084060668945, "num_input_tokens_seen": 168875024, "step": 3855, "train_runtime": 29804.1223, "train_tokens_per_second": 5666.163 }, { "epoch": 0.2598976568812281, "grad_norm": 1.1756300159580646, "learning_rate": 9.589302211624343e-06, "loss": 0.39687304496765136, "num_input_tokens_seen": 169090984, "step": 3860, "train_runtime": 29840.2711, "train_tokens_per_second": 5666.536 }, { "epoch": 0.26023431187718826, "grad_norm": 0.819456740850995, "learning_rate": 9.5882521251189e-06, "loss": 0.3968550682067871, "num_input_tokens_seen": 169310120, "step": 3865, "train_runtime": 29877.9357, "train_tokens_per_second": 5666.728 }, { "epoch": 0.2605709668731484, "grad_norm": 0.8515658291218985, "learning_rate": 9.58720075552338e-06, "loss": 0.42056074142456057, "num_input_tokens_seen": 169524504, "step": 3870, "train_runtime": 29909.434, "train_tokens_per_second": 5667.928 }, { "epoch": 0.26090762186910854, "grad_norm": 0.8783050270072679, "learning_rate": 9.586148103131797e-06, "loss": 0.40169625282287597, "num_input_tokens_seen": 169733248, "step": 3875, "train_runtime": 29944.6725, "train_tokens_per_second": 5668.229 }, { "epoch": 0.2612442768650687, "grad_norm": 0.857473518999431, "learning_rate": 9.585094168238518e-06, "loss": 0.4272635459899902, "num_input_tokens_seen": 169943480, "step": 3880, "train_runtime": 29983.9133, "train_tokens_per_second": 5667.822 }, { "epoch": 0.2615809318610288, "grad_norm": 0.8162084475991911, "learning_rate": 9.58403895113828e-06, "loss": 0.39615912437438966, "num_input_tokens_seen": 170164936, "step": 3885, "train_runtime": 30023.2923, "train_tokens_per_second": 5667.764 }, { "epoch": 0.26191758685698896, "grad_norm": 0.773095299777449, "learning_rate": 9.582982452126164e-06, "loss": 0.380422306060791, "num_input_tokens_seen": 170380728, "step": 3890, "train_runtime": 30061.2728, "train_tokens_per_second": 5667.782 }, { "epoch": 0.2622542418529491, "grad_norm": 0.7250445142657057, "learning_rate": 9.58192467149762e-06, "loss": 0.3720268726348877, "num_input_tokens_seen": 170591568, "step": 3895, "train_runtime": 30102.8751, "train_tokens_per_second": 5666.953 }, { "epoch": 0.26259089684890924, "grad_norm": 0.8455822434092976, "learning_rate": 9.580865609548452e-06, "loss": 0.4109041213989258, "num_input_tokens_seen": 170793416, "step": 3900, "train_runtime": 30139.1143, "train_tokens_per_second": 5666.836 }, { "epoch": 0.2629275518448694, "grad_norm": 0.669931714570705, "learning_rate": 9.579805266574824e-06, "loss": 0.3842399835586548, "num_input_tokens_seen": 171006328, "step": 3905, "train_runtime": 30178.5838, "train_tokens_per_second": 5666.48 }, { "epoch": 0.2632642068408295, "grad_norm": 0.6870277390309487, "learning_rate": 9.578743642873258e-06, "loss": 0.40047216415405273, "num_input_tokens_seen": 171209880, "step": 3910, "train_runtime": 30217.8046, "train_tokens_per_second": 5665.861 }, { "epoch": 0.26360086183678966, "grad_norm": 0.7479204866431858, "learning_rate": 9.57768073874063e-06, "loss": 0.40533103942871096, "num_input_tokens_seen": 171434584, "step": 3915, "train_runtime": 30250.4257, "train_tokens_per_second": 5667.179 }, { "epoch": 0.2639375168327498, "grad_norm": 0.822857586143697, "learning_rate": 9.576616554474182e-06, "loss": 0.41611337661743164, "num_input_tokens_seen": 171637768, "step": 3920, "train_runtime": 30287.808, "train_tokens_per_second": 5666.893 }, { "epoch": 0.26427417182870994, "grad_norm": 0.7335208763069258, "learning_rate": 9.575551090371512e-06, "loss": 0.39514660835266113, "num_input_tokens_seen": 171845072, "step": 3925, "train_runtime": 30328.6771, "train_tokens_per_second": 5666.092 }, { "epoch": 0.2646108268246701, "grad_norm": 0.7927281370222846, "learning_rate": 9.574484346730564e-06, "loss": 0.4031528472900391, "num_input_tokens_seen": 172066528, "step": 3930, "train_runtime": 30370.1573, "train_tokens_per_second": 5665.645 }, { "epoch": 0.2649474818206302, "grad_norm": 0.7830404478638062, "learning_rate": 9.573416323849658e-06, "loss": 0.4126886367797852, "num_input_tokens_seen": 172285504, "step": 3935, "train_runtime": 30411.2446, "train_tokens_per_second": 5665.191 }, { "epoch": 0.26528413681659035, "grad_norm": 0.7639494210600385, "learning_rate": 9.572347022027461e-06, "loss": 0.3947685718536377, "num_input_tokens_seen": 172512448, "step": 3940, "train_runtime": 30452.9824, "train_tokens_per_second": 5664.879 }, { "epoch": 0.2656207918125505, "grad_norm": 0.7465504294757535, "learning_rate": 9.571276441563e-06, "loss": 0.40018043518066404, "num_input_tokens_seen": 172712640, "step": 3945, "train_runtime": 30484.642, "train_tokens_per_second": 5665.562 }, { "epoch": 0.26595744680851063, "grad_norm": 0.79021748664721, "learning_rate": 9.570204582755659e-06, "loss": 0.38366117477416994, "num_input_tokens_seen": 172934512, "step": 3950, "train_runtime": 30524.2614, "train_tokens_per_second": 5665.477 }, { "epoch": 0.2662941018044708, "grad_norm": 0.9006277156621565, "learning_rate": 9.569131445905178e-06, "loss": 0.4079860210418701, "num_input_tokens_seen": 173148536, "step": 3955, "train_runtime": 30557.4244, "train_tokens_per_second": 5666.333 }, { "epoch": 0.2666307568004309, "grad_norm": 0.8299161339057768, "learning_rate": 9.568057031311659e-06, "loss": 0.41454520225524905, "num_input_tokens_seen": 173357456, "step": 3960, "train_runtime": 30592.1621, "train_tokens_per_second": 5666.728 }, { "epoch": 0.26696741179639105, "grad_norm": 0.9401299888719756, "learning_rate": 9.566981339275557e-06, "loss": 0.43401298522949217, "num_input_tokens_seen": 173565960, "step": 3965, "train_runtime": 30636.8629, "train_tokens_per_second": 5665.265 }, { "epoch": 0.2673040667923512, "grad_norm": 0.7744089765372347, "learning_rate": 9.565904370097687e-06, "loss": 0.4027921199798584, "num_input_tokens_seen": 173765184, "step": 3970, "train_runtime": 30675.2756, "train_tokens_per_second": 5664.666 }, { "epoch": 0.26764072178831133, "grad_norm": 1.1387875256699147, "learning_rate": 9.564826124079219e-06, "loss": 0.3860454082489014, "num_input_tokens_seen": 173982664, "step": 3975, "train_runtime": 30722.6571, "train_tokens_per_second": 5663.008 }, { "epoch": 0.26797737678427147, "grad_norm": 0.7717245266267511, "learning_rate": 9.563746601521681e-06, "loss": 0.37142066955566405, "num_input_tokens_seen": 174207720, "step": 3980, "train_runtime": 30764.4205, "train_tokens_per_second": 5662.636 }, { "epoch": 0.2683140317802316, "grad_norm": 0.8633313009939835, "learning_rate": 9.562665802726961e-06, "loss": 0.39812779426574707, "num_input_tokens_seen": 174437200, "step": 3985, "train_runtime": 30809.6747, "train_tokens_per_second": 5661.767 }, { "epoch": 0.26865068677619175, "grad_norm": 0.79235769535237, "learning_rate": 9.561583727997297e-06, "loss": 0.3973848819732666, "num_input_tokens_seen": 174649000, "step": 3990, "train_runtime": 30852.8543, "train_tokens_per_second": 5660.708 }, { "epoch": 0.2689873417721519, "grad_norm": 0.866887420036326, "learning_rate": 9.560500377635288e-06, "loss": 0.4132582664489746, "num_input_tokens_seen": 174869968, "step": 3995, "train_runtime": 30894.8991, "train_tokens_per_second": 5660.157 }, { "epoch": 0.26932399676811203, "grad_norm": 0.8490880534158571, "learning_rate": 9.559415751943893e-06, "loss": 0.4121055603027344, "num_input_tokens_seen": 175087088, "step": 4000, "train_runtime": 30928.2656, "train_tokens_per_second": 5661.07 }, { "epoch": 0.26966065176407217, "grad_norm": 0.7247750937341004, "learning_rate": 9.558329851226422e-06, "loss": 0.3906848430633545, "num_input_tokens_seen": 175314216, "step": 4005, "train_runtime": 30967.3219, "train_tokens_per_second": 5661.265 }, { "epoch": 0.2699973067600323, "grad_norm": 0.8575764814098764, "learning_rate": 9.557242675786542e-06, "loss": 0.4193889141082764, "num_input_tokens_seen": 175541064, "step": 4010, "train_runtime": 31013.366, "train_tokens_per_second": 5660.175 }, { "epoch": 0.27033396175599245, "grad_norm": 0.7331252032970815, "learning_rate": 9.55615422592828e-06, "loss": 0.4430998802185059, "num_input_tokens_seen": 175770592, "step": 4015, "train_runtime": 31053.1239, "train_tokens_per_second": 5660.319 }, { "epoch": 0.2706706167519526, "grad_norm": 0.8233208505066181, "learning_rate": 9.555064501956018e-06, "loss": 0.4185193061828613, "num_input_tokens_seen": 175988096, "step": 4020, "train_runtime": 31090.813, "train_tokens_per_second": 5660.453 }, { "epoch": 0.2710072717479127, "grad_norm": 0.7929784850811431, "learning_rate": 9.553973504174493e-06, "loss": 0.3700920581817627, "num_input_tokens_seen": 176213488, "step": 4025, "train_runtime": 31131.4846, "train_tokens_per_second": 5660.298 }, { "epoch": 0.27134392674387287, "grad_norm": 0.8802925347262501, "learning_rate": 9.5528812328888e-06, "loss": 0.41269850730895996, "num_input_tokens_seen": 176420144, "step": 4030, "train_runtime": 31173.5245, "train_tokens_per_second": 5659.294 }, { "epoch": 0.271680581739833, "grad_norm": 0.7894741861959437, "learning_rate": 9.551787688404386e-06, "loss": 0.3877572536468506, "num_input_tokens_seen": 176635200, "step": 4035, "train_runtime": 31218.475, "train_tokens_per_second": 5658.034 }, { "epoch": 0.27201723673579314, "grad_norm": 0.7609981119661086, "learning_rate": 9.550692871027061e-06, "loss": 0.3883471727371216, "num_input_tokens_seen": 176856552, "step": 4040, "train_runtime": 31261.3151, "train_tokens_per_second": 5657.361 }, { "epoch": 0.2723538917317533, "grad_norm": 0.7842118778601046, "learning_rate": 9.549596781062984e-06, "loss": 0.37834415435791013, "num_input_tokens_seen": 177085864, "step": 4045, "train_runtime": 31299.8686, "train_tokens_per_second": 5657.719 }, { "epoch": 0.2726905467277134, "grad_norm": 0.8324923888304009, "learning_rate": 9.548499418818677e-06, "loss": 0.3912312984466553, "num_input_tokens_seen": 177292800, "step": 4050, "train_runtime": 31343.6672, "train_tokens_per_second": 5656.415 }, { "epoch": 0.27302720172367356, "grad_norm": 0.886343399880937, "learning_rate": 9.547400784601011e-06, "loss": 0.448984956741333, "num_input_tokens_seen": 177509120, "step": 4055, "train_runtime": 31388.1483, "train_tokens_per_second": 5655.291 }, { "epoch": 0.2733638567196337, "grad_norm": 0.7611731029617864, "learning_rate": 9.546300878717216e-06, "loss": 0.41724767684936526, "num_input_tokens_seen": 177737192, "step": 4060, "train_runtime": 31419.4811, "train_tokens_per_second": 5656.91 }, { "epoch": 0.27370051171559384, "grad_norm": 0.7391294054271582, "learning_rate": 9.545199701474877e-06, "loss": 0.3876931667327881, "num_input_tokens_seen": 177955528, "step": 4065, "train_runtime": 31460.3252, "train_tokens_per_second": 5656.506 }, { "epoch": 0.274037166711554, "grad_norm": 0.8122534322473342, "learning_rate": 9.544097253181935e-06, "loss": 0.37918825149536134, "num_input_tokens_seen": 178168688, "step": 4070, "train_runtime": 31501.2931, "train_tokens_per_second": 5655.917 }, { "epoch": 0.2743738217075141, "grad_norm": 0.7594531409775707, "learning_rate": 9.542993534146687e-06, "loss": 0.41271028518676756, "num_input_tokens_seen": 178382216, "step": 4075, "train_runtime": 31548.6623, "train_tokens_per_second": 5654.193 }, { "epoch": 0.27471047670347426, "grad_norm": 0.813877169259893, "learning_rate": 9.541888544677784e-06, "loss": 0.4018410682678223, "num_input_tokens_seen": 178601400, "step": 4080, "train_runtime": 31583.5769, "train_tokens_per_second": 5654.882 }, { "epoch": 0.2750471316994344, "grad_norm": 0.8060293108187504, "learning_rate": 9.540782285084232e-06, "loss": 0.36272602081298827, "num_input_tokens_seen": 178815704, "step": 4085, "train_runtime": 31624.6421, "train_tokens_per_second": 5654.316 }, { "epoch": 0.27538378669539454, "grad_norm": 0.7676915231843366, "learning_rate": 9.539674755675392e-06, "loss": 0.39566807746887206, "num_input_tokens_seen": 179033752, "step": 4090, "train_runtime": 31667.4816, "train_tokens_per_second": 5653.552 }, { "epoch": 0.2757204416913547, "grad_norm": 0.6913331471393089, "learning_rate": 9.538565956760983e-06, "loss": 0.35824832916259763, "num_input_tokens_seen": 179269312, "step": 4095, "train_runtime": 31701.6169, "train_tokens_per_second": 5654.895 }, { "epoch": 0.2760570966873148, "grad_norm": 0.7630923484514573, "learning_rate": 9.537455888651078e-06, "loss": 0.3908623933792114, "num_input_tokens_seen": 179500456, "step": 4100, "train_runtime": 31737.6882, "train_tokens_per_second": 5655.751 }, { "epoch": 0.27639375168327496, "grad_norm": 0.8057751017404143, "learning_rate": 9.536344551656103e-06, "loss": 0.4113442420959473, "num_input_tokens_seen": 179727568, "step": 4105, "train_runtime": 31778.3965, "train_tokens_per_second": 5655.653 }, { "epoch": 0.2767304066792351, "grad_norm": 0.7452483379248684, "learning_rate": 9.535231946086838e-06, "loss": 0.392077112197876, "num_input_tokens_seen": 179947920, "step": 4110, "train_runtime": 31810.5777, "train_tokens_per_second": 5656.858 }, { "epoch": 0.27706706167519524, "grad_norm": 0.7935004896667632, "learning_rate": 9.534118072254421e-06, "loss": 0.41229848861694335, "num_input_tokens_seen": 180172368, "step": 4115, "train_runtime": 31849.5051, "train_tokens_per_second": 5656.991 }, { "epoch": 0.2774037166711554, "grad_norm": 0.782426266760514, "learning_rate": 9.533002930470345e-06, "loss": 0.38343167304992676, "num_input_tokens_seen": 180392712, "step": 4120, "train_runtime": 31893.6268, "train_tokens_per_second": 5656.074 }, { "epoch": 0.2777403716671155, "grad_norm": 0.6585746266135624, "learning_rate": 9.531886521046452e-06, "loss": 0.38598432540893557, "num_input_tokens_seen": 180594944, "step": 4125, "train_runtime": 31934.9141, "train_tokens_per_second": 5655.094 }, { "epoch": 0.27807702666307565, "grad_norm": 0.8150349479481921, "learning_rate": 9.530768844294947e-06, "loss": 0.41448087692260743, "num_input_tokens_seen": 180816024, "step": 4130, "train_runtime": 31975.4857, "train_tokens_per_second": 5654.833 }, { "epoch": 0.2784136816590358, "grad_norm": 0.8985901076929287, "learning_rate": 9.52964990052838e-06, "loss": 0.41909160614013674, "num_input_tokens_seen": 181035024, "step": 4135, "train_runtime": 32014.2767, "train_tokens_per_second": 5654.822 }, { "epoch": 0.27875033665499593, "grad_norm": 0.7912879897563827, "learning_rate": 9.528529690059663e-06, "loss": 0.3741894245147705, "num_input_tokens_seen": 181258672, "step": 4140, "train_runtime": 32055.2042, "train_tokens_per_second": 5654.579 }, { "epoch": 0.2790869916509561, "grad_norm": 0.9153777980141117, "learning_rate": 9.52740821320206e-06, "loss": 0.4044219970703125, "num_input_tokens_seen": 181475056, "step": 4145, "train_runtime": 32086.7668, "train_tokens_per_second": 5655.76 }, { "epoch": 0.2794236466469162, "grad_norm": 0.7181310809160721, "learning_rate": 9.526285470269185e-06, "loss": 0.4395021915435791, "num_input_tokens_seen": 181701504, "step": 4150, "train_runtime": 32121.2174, "train_tokens_per_second": 5656.744 }, { "epoch": 0.2797603016428764, "grad_norm": 0.833451101611962, "learning_rate": 9.525161461575012e-06, "loss": 0.4143718719482422, "num_input_tokens_seen": 181905448, "step": 4155, "train_runtime": 32162.0174, "train_tokens_per_second": 5655.909 }, { "epoch": 0.28009695663883655, "grad_norm": 0.9347376730252263, "learning_rate": 9.524036187433867e-06, "loss": 0.38724517822265625, "num_input_tokens_seen": 182111832, "step": 4160, "train_runtime": 32199.5756, "train_tokens_per_second": 5655.722 }, { "epoch": 0.2804336116347967, "grad_norm": 0.7395436682357247, "learning_rate": 9.522909648160427e-06, "loss": 0.38469388484954836, "num_input_tokens_seen": 182331456, "step": 4165, "train_runtime": 32237.7321, "train_tokens_per_second": 5655.84 }, { "epoch": 0.2807702666307568, "grad_norm": 0.9082810498252065, "learning_rate": 9.521781844069727e-06, "loss": 0.4097011566162109, "num_input_tokens_seen": 182555536, "step": 4170, "train_runtime": 32282.4632, "train_tokens_per_second": 5654.944 }, { "epoch": 0.28110692162671697, "grad_norm": 0.8211424225834406, "learning_rate": 9.520652775477154e-06, "loss": 0.38606297969818115, "num_input_tokens_seen": 182776104, "step": 4175, "train_runtime": 32324.1374, "train_tokens_per_second": 5654.477 }, { "epoch": 0.2814435766226771, "grad_norm": 0.6834380753616917, "learning_rate": 9.519522442698447e-06, "loss": 0.36697864532470703, "num_input_tokens_seen": 182986640, "step": 4180, "train_runtime": 32354.2522, "train_tokens_per_second": 5655.722 }, { "epoch": 0.28178023161863724, "grad_norm": 0.8351889375982321, "learning_rate": 9.518390846049699e-06, "loss": 0.4045860290527344, "num_input_tokens_seen": 183200160, "step": 4185, "train_runtime": 32398.1959, "train_tokens_per_second": 5654.641 }, { "epoch": 0.2821168866145974, "grad_norm": 0.7607561247725104, "learning_rate": 9.517257985847361e-06, "loss": 0.42084197998046874, "num_input_tokens_seen": 183411672, "step": 4190, "train_runtime": 32441.1387, "train_tokens_per_second": 5653.676 }, { "epoch": 0.2824535416105575, "grad_norm": 0.7318149860850908, "learning_rate": 9.516123862408232e-06, "loss": 0.4293764591217041, "num_input_tokens_seen": 183636784, "step": 4195, "train_runtime": 32485.1985, "train_tokens_per_second": 5652.937 }, { "epoch": 0.28279019660651766, "grad_norm": 1.0902481858366875, "learning_rate": 9.514988476049466e-06, "loss": 0.3744691848754883, "num_input_tokens_seen": 183850024, "step": 4200, "train_runtime": 32521.0388, "train_tokens_per_second": 5653.264 }, { "epoch": 0.2831268516024778, "grad_norm": 0.7196863893637454, "learning_rate": 9.513851827088567e-06, "loss": 0.39441556930541993, "num_input_tokens_seen": 184055312, "step": 4205, "train_runtime": 32558.0875, "train_tokens_per_second": 5653.136 }, { "epoch": 0.28346350659843794, "grad_norm": 0.901667167722795, "learning_rate": 9.512713915843402e-06, "loss": 0.399395227432251, "num_input_tokens_seen": 184280840, "step": 4210, "train_runtime": 32591.1094, "train_tokens_per_second": 5654.329 }, { "epoch": 0.2838001615943981, "grad_norm": 0.7871649191207917, "learning_rate": 9.511574742632177e-06, "loss": 0.38000011444091797, "num_input_tokens_seen": 184499800, "step": 4215, "train_runtime": 32635.0953, "train_tokens_per_second": 5653.417 }, { "epoch": 0.2841368165903582, "grad_norm": 0.7805206391000944, "learning_rate": 9.510434307773464e-06, "loss": 0.45735921859741213, "num_input_tokens_seen": 184725080, "step": 4220, "train_runtime": 32673.8214, "train_tokens_per_second": 5653.611 }, { "epoch": 0.28447347158631836, "grad_norm": 0.6332223820184592, "learning_rate": 9.509292611586179e-06, "loss": 0.35365097522735595, "num_input_tokens_seen": 184912768, "step": 4225, "train_runtime": 32714.0896, "train_tokens_per_second": 5652.389 }, { "epoch": 0.2848101265822785, "grad_norm": 0.8305072132980625, "learning_rate": 9.508149654389592e-06, "loss": 0.40491819381713867, "num_input_tokens_seen": 185136408, "step": 4230, "train_runtime": 32755.4509, "train_tokens_per_second": 5652.079 }, { "epoch": 0.28514678157823864, "grad_norm": 0.6650135309711892, "learning_rate": 9.507005436503331e-06, "loss": 0.3746334552764893, "num_input_tokens_seen": 185367152, "step": 4235, "train_runtime": 32798.7805, "train_tokens_per_second": 5651.648 }, { "epoch": 0.2854834365741988, "grad_norm": 0.8834317004719436, "learning_rate": 9.505859958247373e-06, "loss": 0.4024499893188477, "num_input_tokens_seen": 185580528, "step": 4240, "train_runtime": 32837.3509, "train_tokens_per_second": 5651.507 }, { "epoch": 0.2858200915701589, "grad_norm": 0.703931424320413, "learning_rate": 9.504713219942045e-06, "loss": 0.3693699359893799, "num_input_tokens_seen": 185800152, "step": 4245, "train_runtime": 32873.2494, "train_tokens_per_second": 5652.017 }, { "epoch": 0.28615674656611906, "grad_norm": 0.7673763574951983, "learning_rate": 9.503565221908029e-06, "loss": 0.3989689350128174, "num_input_tokens_seen": 186023072, "step": 4250, "train_runtime": 32908.5929, "train_tokens_per_second": 5652.72 }, { "epoch": 0.2864934015620792, "grad_norm": 0.7942180767418593, "learning_rate": 9.50241596446636e-06, "loss": 0.41822104454040526, "num_input_tokens_seen": 186251344, "step": 4255, "train_runtime": 32948.6784, "train_tokens_per_second": 5652.771 }, { "epoch": 0.28683005655803934, "grad_norm": 0.8790228905730333, "learning_rate": 9.501265447938423e-06, "loss": 0.40343165397644043, "num_input_tokens_seen": 186459392, "step": 4260, "train_runtime": 32985.9245, "train_tokens_per_second": 5652.696 }, { "epoch": 0.2871667115539995, "grad_norm": 0.8360538773951802, "learning_rate": 9.500113672645958e-06, "loss": 0.41559224128723143, "num_input_tokens_seen": 186674536, "step": 4265, "train_runtime": 33020.78, "train_tokens_per_second": 5653.244 }, { "epoch": 0.2875033665499596, "grad_norm": 0.8611168073988301, "learning_rate": 9.498960638911054e-06, "loss": 0.3698106288909912, "num_input_tokens_seen": 186883568, "step": 4270, "train_runtime": 33066.6343, "train_tokens_per_second": 5651.726 }, { "epoch": 0.28784002154591976, "grad_norm": 0.7947411629350094, "learning_rate": 9.497806347056153e-06, "loss": 0.394811749458313, "num_input_tokens_seen": 187101448, "step": 4275, "train_runtime": 33108.0971, "train_tokens_per_second": 5651.229 }, { "epoch": 0.2881766765418799, "grad_norm": 0.8271288744866215, "learning_rate": 9.49665079740405e-06, "loss": 0.41505231857299807, "num_input_tokens_seen": 187323568, "step": 4280, "train_runtime": 33144.1133, "train_tokens_per_second": 5651.79 }, { "epoch": 0.28851333153784003, "grad_norm": 0.8870087883370243, "learning_rate": 9.495493990277889e-06, "loss": 0.41215314865112307, "num_input_tokens_seen": 187536768, "step": 4285, "train_runtime": 33177.0201, "train_tokens_per_second": 5652.61 }, { "epoch": 0.2888499865338002, "grad_norm": 0.7416815526876334, "learning_rate": 9.49433592600117e-06, "loss": 0.39543790817260743, "num_input_tokens_seen": 187761936, "step": 4290, "train_runtime": 33218.3652, "train_tokens_per_second": 5652.353 }, { "epoch": 0.2891866415297603, "grad_norm": 0.8456820374140082, "learning_rate": 9.49317660489774e-06, "loss": 0.38694300651550295, "num_input_tokens_seen": 187989768, "step": 4295, "train_runtime": 33254.7613, "train_tokens_per_second": 5653.018 }, { "epoch": 0.28952329652572045, "grad_norm": 0.7340597270803788, "learning_rate": 9.4920160272918e-06, "loss": 0.39570274353027346, "num_input_tokens_seen": 188221328, "step": 4300, "train_runtime": 33292.1232, "train_tokens_per_second": 5653.629 }, { "epoch": 0.2898599515216806, "grad_norm": 0.9417045729052645, "learning_rate": 9.490854193507904e-06, "loss": 0.40100975036621095, "num_input_tokens_seen": 188436984, "step": 4305, "train_runtime": 33333.4329, "train_tokens_per_second": 5653.093 }, { "epoch": 0.29019660651764073, "grad_norm": 0.8307091778797395, "learning_rate": 9.489691103870951e-06, "loss": 0.4165069580078125, "num_input_tokens_seen": 188666800, "step": 4310, "train_runtime": 33370.0506, "train_tokens_per_second": 5653.776 }, { "epoch": 0.29053326151360087, "grad_norm": 0.6898420962550031, "learning_rate": 9.488526758706198e-06, "loss": 0.3968646764755249, "num_input_tokens_seen": 188890864, "step": 4315, "train_runtime": 33408.9132, "train_tokens_per_second": 5653.906 }, { "epoch": 0.290869916509561, "grad_norm": 0.9744166501910104, "learning_rate": 9.48736115833925e-06, "loss": 0.42871532440185545, "num_input_tokens_seen": 189097152, "step": 4320, "train_runtime": 33444.6308, "train_tokens_per_second": 5654.036 }, { "epoch": 0.29120657150552115, "grad_norm": 0.7709225593851357, "learning_rate": 9.486194303096062e-06, "loss": 0.388767147064209, "num_input_tokens_seen": 189319032, "step": 4325, "train_runtime": 33480.301, "train_tokens_per_second": 5654.639 }, { "epoch": 0.2915432265014813, "grad_norm": 0.6810949642678763, "learning_rate": 9.485026193302945e-06, "loss": 0.37795631885528563, "num_input_tokens_seen": 189540056, "step": 4330, "train_runtime": 33515.0635, "train_tokens_per_second": 5655.369 }, { "epoch": 0.29187988149744143, "grad_norm": 0.6374851744198567, "learning_rate": 9.483856829286552e-06, "loss": 0.43641042709350586, "num_input_tokens_seen": 189765816, "step": 4335, "train_runtime": 33556.7326, "train_tokens_per_second": 5655.074 }, { "epoch": 0.29221653649340157, "grad_norm": 0.8345515619506504, "learning_rate": 9.482686211373896e-06, "loss": 0.4038511276245117, "num_input_tokens_seen": 189992032, "step": 4340, "train_runtime": 33597.0529, "train_tokens_per_second": 5655.021 }, { "epoch": 0.2925531914893617, "grad_norm": 0.8775359668232541, "learning_rate": 9.481514339892335e-06, "loss": 0.4172847747802734, "num_input_tokens_seen": 190224704, "step": 4345, "train_runtime": 33633.3907, "train_tokens_per_second": 5655.829 }, { "epoch": 0.29288984648532185, "grad_norm": 0.7728830127459773, "learning_rate": 9.48034121516958e-06, "loss": 0.41391868591308595, "num_input_tokens_seen": 190437840, "step": 4350, "train_runtime": 33671.0816, "train_tokens_per_second": 5655.828 }, { "epoch": 0.293226501481282, "grad_norm": 0.7347575506312092, "learning_rate": 9.47916683753369e-06, "loss": 0.38980252742767335, "num_input_tokens_seen": 190656112, "step": 4355, "train_runtime": 33713.543, "train_tokens_per_second": 5655.179 }, { "epoch": 0.2935631564772421, "grad_norm": 0.7225462237696316, "learning_rate": 9.477991207313077e-06, "loss": 0.4024055480957031, "num_input_tokens_seen": 190883776, "step": 4360, "train_runtime": 33754.4757, "train_tokens_per_second": 5655.066 }, { "epoch": 0.29389981147320227, "grad_norm": 0.7312109916350326, "learning_rate": 9.476814324836504e-06, "loss": 0.38675341606140134, "num_input_tokens_seen": 191111960, "step": 4365, "train_runtime": 33789.2531, "train_tokens_per_second": 5655.998 }, { "epoch": 0.2942364664691624, "grad_norm": 0.7752639421468126, "learning_rate": 9.475636190433078e-06, "loss": 0.44519591331481934, "num_input_tokens_seen": 191343016, "step": 4370, "train_runtime": 33827.4824, "train_tokens_per_second": 5656.437 }, { "epoch": 0.29457312146512254, "grad_norm": 0.7480674780381356, "learning_rate": 9.474456804432264e-06, "loss": 0.3989989995956421, "num_input_tokens_seen": 191572600, "step": 4375, "train_runtime": 33864.2914, "train_tokens_per_second": 5657.068 }, { "epoch": 0.2949097764610827, "grad_norm": 0.7492609939786371, "learning_rate": 9.473276167163872e-06, "loss": 0.41669330596923826, "num_input_tokens_seen": 191802056, "step": 4380, "train_runtime": 33903.6008, "train_tokens_per_second": 5657.277 }, { "epoch": 0.2952464314570428, "grad_norm": 0.7254851965917017, "learning_rate": 9.472094278958066e-06, "loss": 0.41675920486450196, "num_input_tokens_seen": 192033856, "step": 4385, "train_runtime": 33947.504, "train_tokens_per_second": 5656.789 }, { "epoch": 0.29558308645300296, "grad_norm": 0.7301224106455536, "learning_rate": 9.470911140145353e-06, "loss": 0.3885148763656616, "num_input_tokens_seen": 192244376, "step": 4390, "train_runtime": 33990.9485, "train_tokens_per_second": 5655.752 }, { "epoch": 0.2959197414489631, "grad_norm": 0.8599934571941987, "learning_rate": 9.469726751056599e-06, "loss": 0.3994889736175537, "num_input_tokens_seen": 192466432, "step": 4395, "train_runtime": 34031.0021, "train_tokens_per_second": 5655.62 }, { "epoch": 0.29625639644492324, "grad_norm": 0.8672385958944913, "learning_rate": 9.468541112023009e-06, "loss": 0.42194247245788574, "num_input_tokens_seen": 192676720, "step": 4400, "train_runtime": 34068.9438, "train_tokens_per_second": 5655.494 }, { "epoch": 0.2965930514408834, "grad_norm": 0.8654785396115573, "learning_rate": 9.467354223376149e-06, "loss": 0.4138471603393555, "num_input_tokens_seen": 192867824, "step": 4405, "train_runtime": 34101.5758, "train_tokens_per_second": 5655.687 }, { "epoch": 0.2969297064368435, "grad_norm": 0.7586880855501626, "learning_rate": 9.466166085447923e-06, "loss": 0.4040337562561035, "num_input_tokens_seen": 193079552, "step": 4410, "train_runtime": 34144.2523, "train_tokens_per_second": 5654.819 }, { "epoch": 0.29726636143280366, "grad_norm": 0.8413204922562729, "learning_rate": 9.464976698570595e-06, "loss": 0.3852673053741455, "num_input_tokens_seen": 193274704, "step": 4415, "train_runtime": 34179.0678, "train_tokens_per_second": 5654.768 }, { "epoch": 0.2976030164287638, "grad_norm": 0.8227530497102407, "learning_rate": 9.463786063076769e-06, "loss": 0.42119736671447755, "num_input_tokens_seen": 193494016, "step": 4420, "train_runtime": 34217.4917, "train_tokens_per_second": 5654.828 }, { "epoch": 0.29793967142472394, "grad_norm": 0.8498857055875949, "learning_rate": 9.462594179299408e-06, "loss": 0.34813380241394043, "num_input_tokens_seen": 193708944, "step": 4425, "train_runtime": 34255.6112, "train_tokens_per_second": 5654.809 }, { "epoch": 0.2982763264206841, "grad_norm": 0.7591384035910306, "learning_rate": 9.461401047571811e-06, "loss": 0.39094252586364747, "num_input_tokens_seen": 193940712, "step": 4430, "train_runtime": 34291.0594, "train_tokens_per_second": 5655.722 }, { "epoch": 0.2986129814166442, "grad_norm": 0.8057409790041082, "learning_rate": 9.460206668227639e-06, "loss": 0.4155745983123779, "num_input_tokens_seen": 194168936, "step": 4435, "train_runtime": 34330.974, "train_tokens_per_second": 5655.795 }, { "epoch": 0.29894963641260436, "grad_norm": 0.7522439279097726, "learning_rate": 9.459011041600895e-06, "loss": 0.39428043365478516, "num_input_tokens_seen": 194397872, "step": 4440, "train_runtime": 34371.2051, "train_tokens_per_second": 5655.835 }, { "epoch": 0.2992862914085645, "grad_norm": 0.8885125640048409, "learning_rate": 9.457814168025932e-06, "loss": 0.3819078207015991, "num_input_tokens_seen": 194618856, "step": 4445, "train_runtime": 34409.2545, "train_tokens_per_second": 5656.003 }, { "epoch": 0.29962294640452464, "grad_norm": 0.8798594554422206, "learning_rate": 9.456616047837452e-06, "loss": 0.4244089603424072, "num_input_tokens_seen": 194815632, "step": 4450, "train_runtime": 34451.3067, "train_tokens_per_second": 5654.811 }, { "epoch": 0.2999596014004848, "grad_norm": 0.7140830042785486, "learning_rate": 9.455416681370506e-06, "loss": 0.43105688095092776, "num_input_tokens_seen": 195043320, "step": 4455, "train_runtime": 34491.908, "train_tokens_per_second": 5654.756 }, { "epoch": 0.3002962563964449, "grad_norm": 0.7933555904953391, "learning_rate": 9.45421606896049e-06, "loss": 0.4107870101928711, "num_input_tokens_seen": 195273800, "step": 4460, "train_runtime": 34532.6899, "train_tokens_per_second": 5654.752 }, { "epoch": 0.30063291139240506, "grad_norm": 0.7656195298280324, "learning_rate": 9.453014210943155e-06, "loss": 0.39834353923797605, "num_input_tokens_seen": 195492912, "step": 4465, "train_runtime": 34574.8621, "train_tokens_per_second": 5654.192 }, { "epoch": 0.3009695663883652, "grad_norm": 0.7817448952040295, "learning_rate": 9.451811107654596e-06, "loss": 0.39757986068725587, "num_input_tokens_seen": 195716896, "step": 4470, "train_runtime": 34621.7737, "train_tokens_per_second": 5653.0 }, { "epoch": 0.30130622138432533, "grad_norm": 0.7841726368249392, "learning_rate": 9.450606759431255e-06, "loss": 0.40091800689697266, "num_input_tokens_seen": 195945064, "step": 4475, "train_runtime": 34656.1692, "train_tokens_per_second": 5653.974 }, { "epoch": 0.3016428763802855, "grad_norm": 0.8817669510853672, "learning_rate": 9.449401166609928e-06, "loss": 0.42542014122009275, "num_input_tokens_seen": 196155296, "step": 4480, "train_runtime": 34691.0919, "train_tokens_per_second": 5654.342 }, { "epoch": 0.3019795313762456, "grad_norm": 0.958339871121062, "learning_rate": 9.448194329527752e-06, "loss": 0.40885372161865235, "num_input_tokens_seen": 196367168, "step": 4485, "train_runtime": 34725.1749, "train_tokens_per_second": 5654.894 }, { "epoch": 0.30231618637220575, "grad_norm": 0.7219539133285781, "learning_rate": 9.446986248522216e-06, "loss": 0.38100175857543944, "num_input_tokens_seen": 196585760, "step": 4490, "train_runtime": 34763.5979, "train_tokens_per_second": 5654.931 }, { "epoch": 0.3026528413681659, "grad_norm": 0.7623511745984738, "learning_rate": 9.445776923931157e-06, "loss": 0.3696560859680176, "num_input_tokens_seen": 196799296, "step": 4495, "train_runtime": 34801.3851, "train_tokens_per_second": 5654.927 }, { "epoch": 0.30298949636412603, "grad_norm": 0.7900772624336759, "learning_rate": 9.444566356092754e-06, "loss": 0.3985780715942383, "num_input_tokens_seen": 197027464, "step": 4500, "train_runtime": 34835.2173, "train_tokens_per_second": 5655.985 }, { "epoch": 0.30332615136008617, "grad_norm": 0.8352145795658186, "learning_rate": 9.443354545345545e-06, "loss": 0.36351020336151124, "num_input_tokens_seen": 197246488, "step": 4505, "train_runtime": 34872.1679, "train_tokens_per_second": 5656.273 }, { "epoch": 0.3036628063560463, "grad_norm": 0.7235873259829829, "learning_rate": 9.442141492028406e-06, "loss": 0.3931256294250488, "num_input_tokens_seen": 197464240, "step": 4510, "train_runtime": 34916.8698, "train_tokens_per_second": 5655.268 }, { "epoch": 0.30399946135200645, "grad_norm": 0.7287455155410504, "learning_rate": 9.440927196480563e-06, "loss": 0.3859192609786987, "num_input_tokens_seen": 197693416, "step": 4515, "train_runtime": 34952.6701, "train_tokens_per_second": 5656.032 }, { "epoch": 0.3043361163479666, "grad_norm": 0.7124742821058738, "learning_rate": 9.439711659041593e-06, "loss": 0.3971871376037598, "num_input_tokens_seen": 197908880, "step": 4520, "train_runtime": 34995.5331, "train_tokens_per_second": 5655.261 }, { "epoch": 0.30467277134392673, "grad_norm": 0.8049967305897996, "learning_rate": 9.438494880051413e-06, "loss": 0.4050449371337891, "num_input_tokens_seen": 198130240, "step": 4525, "train_runtime": 35031.404, "train_tokens_per_second": 5655.789 }, { "epoch": 0.30500942633988687, "grad_norm": 0.8167232313014808, "learning_rate": 9.437276859850293e-06, "loss": 0.39906351566314696, "num_input_tokens_seen": 198354624, "step": 4530, "train_runtime": 35070.2405, "train_tokens_per_second": 5655.924 }, { "epoch": 0.305346081335847, "grad_norm": 0.8219257479433354, "learning_rate": 9.436057598778848e-06, "loss": 0.41982173919677734, "num_input_tokens_seen": 198569592, "step": 4535, "train_runtime": 35103.488, "train_tokens_per_second": 5656.691 }, { "epoch": 0.30568273633180715, "grad_norm": 0.8373417043715061, "learning_rate": 9.434837097178043e-06, "loss": 0.44964447021484377, "num_input_tokens_seen": 198790848, "step": 4540, "train_runtime": 35136.0232, "train_tokens_per_second": 5657.75 }, { "epoch": 0.3060193913277673, "grad_norm": 0.8551654564560078, "learning_rate": 9.433615355389183e-06, "loss": 0.4145000457763672, "num_input_tokens_seen": 198995864, "step": 4545, "train_runtime": 35171.0896, "train_tokens_per_second": 5657.939 }, { "epoch": 0.3063560463237274, "grad_norm": 0.8539775390580207, "learning_rate": 9.432392373753926e-06, "loss": 0.38867299556732177, "num_input_tokens_seen": 199228112, "step": 4550, "train_runtime": 35204.7853, "train_tokens_per_second": 5659.12 }, { "epoch": 0.30669270131968757, "grad_norm": 0.7417346548045687, "learning_rate": 9.431168152614278e-06, "loss": 0.398314380645752, "num_input_tokens_seen": 199444448, "step": 4555, "train_runtime": 35246.8496, "train_tokens_per_second": 5658.504 }, { "epoch": 0.3070293563156477, "grad_norm": 0.7867984496679544, "learning_rate": 9.429942692312585e-06, "loss": 0.36063923835754397, "num_input_tokens_seen": 199665776, "step": 4560, "train_runtime": 35277.6142, "train_tokens_per_second": 5659.844 }, { "epoch": 0.30736601131160785, "grad_norm": 0.6064626251289161, "learning_rate": 9.428715993191546e-06, "loss": 0.38531041145324707, "num_input_tokens_seen": 199888952, "step": 4565, "train_runtime": 35318.7352, "train_tokens_per_second": 5659.573 }, { "epoch": 0.307702666307568, "grad_norm": 0.7823320659003977, "learning_rate": 9.427488055594199e-06, "loss": 0.4015589714050293, "num_input_tokens_seen": 200094448, "step": 4570, "train_runtime": 35356.6905, "train_tokens_per_second": 5659.309 }, { "epoch": 0.3080393213035281, "grad_norm": 0.7797326812244397, "learning_rate": 9.426258879863937e-06, "loss": 0.40995278358459475, "num_input_tokens_seen": 200330936, "step": 4575, "train_runtime": 35388.9695, "train_tokens_per_second": 5660.83 }, { "epoch": 0.30837597629948826, "grad_norm": 0.6558180029153803, "learning_rate": 9.425028466344494e-06, "loss": 0.35400965213775637, "num_input_tokens_seen": 200550336, "step": 4580, "train_runtime": 35423.4598, "train_tokens_per_second": 5661.512 }, { "epoch": 0.3087126312954484, "grad_norm": 0.9357449426999332, "learning_rate": 9.42379681537995e-06, "loss": 0.40514564514160156, "num_input_tokens_seen": 200767584, "step": 4585, "train_runtime": 35466.8621, "train_tokens_per_second": 5660.709 }, { "epoch": 0.30904928629140854, "grad_norm": 1.1029634658189478, "learning_rate": 9.422563927314732e-06, "loss": 0.39676432609558104, "num_input_tokens_seen": 200990368, "step": 4590, "train_runtime": 35503.267, "train_tokens_per_second": 5661.18 }, { "epoch": 0.3093859412873687, "grad_norm": 0.7960058470606449, "learning_rate": 9.421329802493615e-06, "loss": 0.3798659801483154, "num_input_tokens_seen": 201213136, "step": 4595, "train_runtime": 35545.6953, "train_tokens_per_second": 5660.689 }, { "epoch": 0.3097225962833288, "grad_norm": 0.7764466461774601, "learning_rate": 9.420094441261717e-06, "loss": 0.4128886222839355, "num_input_tokens_seen": 201436008, "step": 4600, "train_runtime": 35591.0272, "train_tokens_per_second": 5659.741 }, { "epoch": 0.31005925127928896, "grad_norm": 0.8514809314658448, "learning_rate": 9.418857843964506e-06, "loss": 0.3874027252197266, "num_input_tokens_seen": 201651024, "step": 4605, "train_runtime": 35633.1312, "train_tokens_per_second": 5659.088 }, { "epoch": 0.3103959062752491, "grad_norm": 0.791242525351627, "learning_rate": 9.417620010947786e-06, "loss": 0.41231350898742675, "num_input_tokens_seen": 201862568, "step": 4610, "train_runtime": 35672.8097, "train_tokens_per_second": 5658.724 }, { "epoch": 0.31073256127120924, "grad_norm": 0.8196831043483923, "learning_rate": 9.416380942557719e-06, "loss": 0.3759624719619751, "num_input_tokens_seen": 202081848, "step": 4615, "train_runtime": 35711.7461, "train_tokens_per_second": 5658.694 }, { "epoch": 0.3110692162671694, "grad_norm": 0.814113401127112, "learning_rate": 9.415140639140803e-06, "loss": 0.40959873199462893, "num_input_tokens_seen": 202288416, "step": 4620, "train_runtime": 35748.2065, "train_tokens_per_second": 5658.701 }, { "epoch": 0.3114058712631295, "grad_norm": 0.6867352095609621, "learning_rate": 9.413899101043887e-06, "loss": 0.4299426555633545, "num_input_tokens_seen": 202507280, "step": 4625, "train_runtime": 35787.2021, "train_tokens_per_second": 5658.651 }, { "epoch": 0.31174252625908966, "grad_norm": 0.9127540749426457, "learning_rate": 9.412656328614162e-06, "loss": 0.4051331043243408, "num_input_tokens_seen": 202708520, "step": 4630, "train_runtime": 35826.4689, "train_tokens_per_second": 5658.066 }, { "epoch": 0.3120791812550498, "grad_norm": 0.7769819809945303, "learning_rate": 9.411412322199165e-06, "loss": 0.40700321197509765, "num_input_tokens_seen": 202938288, "step": 4635, "train_runtime": 35860.2769, "train_tokens_per_second": 5659.139 }, { "epoch": 0.31241583625100994, "grad_norm": 0.7763840440333488, "learning_rate": 9.41016708214678e-06, "loss": 0.397929310798645, "num_input_tokens_seen": 203140768, "step": 4640, "train_runtime": 35900.8969, "train_tokens_per_second": 5658.376 }, { "epoch": 0.31275249124697013, "grad_norm": 0.838793433476314, "learning_rate": 9.408920608805233e-06, "loss": 0.3729093074798584, "num_input_tokens_seen": 203353200, "step": 4645, "train_runtime": 35943.6665, "train_tokens_per_second": 5657.553 }, { "epoch": 0.31308914624293027, "grad_norm": 0.759403553618091, "learning_rate": 9.407672902523097e-06, "loss": 0.42061967849731446, "num_input_tokens_seen": 203576960, "step": 4650, "train_runtime": 35989.9311, "train_tokens_per_second": 5656.498 }, { "epoch": 0.3134258012388904, "grad_norm": 0.8516208752301061, "learning_rate": 9.406423963649287e-06, "loss": 0.39535982608795167, "num_input_tokens_seen": 203780664, "step": 4655, "train_runtime": 36033.4005, "train_tokens_per_second": 5655.327 }, { "epoch": 0.31376245623485055, "grad_norm": 0.6661646334234551, "learning_rate": 9.405173792533069e-06, "loss": 0.3896958827972412, "num_input_tokens_seen": 204002504, "step": 4660, "train_runtime": 36071.9272, "train_tokens_per_second": 5655.437 }, { "epoch": 0.3140991112308107, "grad_norm": 0.802128758388854, "learning_rate": 9.403922389524045e-06, "loss": 0.383258056640625, "num_input_tokens_seen": 204219216, "step": 4665, "train_runtime": 36107.3083, "train_tokens_per_second": 5655.897 }, { "epoch": 0.31443576622677083, "grad_norm": 0.8311848290104593, "learning_rate": 9.40266975497217e-06, "loss": 0.41370835304260256, "num_input_tokens_seen": 204435080, "step": 4670, "train_runtime": 36146.1312, "train_tokens_per_second": 5655.794 }, { "epoch": 0.31477242122273097, "grad_norm": 0.7524391894573029, "learning_rate": 9.401415889227736e-06, "loss": 0.4065183162689209, "num_input_tokens_seen": 204665984, "step": 4675, "train_runtime": 36189.9551, "train_tokens_per_second": 5655.326 }, { "epoch": 0.3151090762186911, "grad_norm": 0.6516968499884368, "learning_rate": 9.400160792641385e-06, "loss": 0.40553603172302244, "num_input_tokens_seen": 204900584, "step": 4680, "train_runtime": 36230.3148, "train_tokens_per_second": 5655.501 }, { "epoch": 0.31544573121465125, "grad_norm": 0.713149562707507, "learning_rate": 9.398904465564097e-06, "loss": 0.3963156700134277, "num_input_tokens_seen": 205121896, "step": 4685, "train_runtime": 36261.5038, "train_tokens_per_second": 5656.74 }, { "epoch": 0.3157823862106114, "grad_norm": 0.7445101762458055, "learning_rate": 9.397646908347203e-06, "loss": 0.3701439142227173, "num_input_tokens_seen": 205337424, "step": 4690, "train_runtime": 36299.7979, "train_tokens_per_second": 5656.71 }, { "epoch": 0.3161190412065715, "grad_norm": 0.7876242336850148, "learning_rate": 9.396388121342375e-06, "loss": 0.37079999446868894, "num_input_tokens_seen": 205566880, "step": 4695, "train_runtime": 36337.2628, "train_tokens_per_second": 5657.192 }, { "epoch": 0.31645569620253167, "grad_norm": 0.8752489859691854, "learning_rate": 9.395128104901628e-06, "loss": 0.382697606086731, "num_input_tokens_seen": 205780336, "step": 4700, "train_runtime": 36373.0101, "train_tokens_per_second": 5657.501 }, { "epoch": 0.3167923511984918, "grad_norm": 0.6981702689866264, "learning_rate": 9.393866859377321e-06, "loss": 0.4276883125305176, "num_input_tokens_seen": 206004992, "step": 4705, "train_runtime": 36409.7995, "train_tokens_per_second": 5657.955 }, { "epoch": 0.31712900619445195, "grad_norm": 0.7289408984257015, "learning_rate": 9.392604385122157e-06, "loss": 0.39430766105651854, "num_input_tokens_seen": 206237344, "step": 4710, "train_runtime": 36441.1815, "train_tokens_per_second": 5659.458 }, { "epoch": 0.3174656611904121, "grad_norm": 0.7707325345782555, "learning_rate": 9.391340682489185e-06, "loss": 0.3808866024017334, "num_input_tokens_seen": 206449496, "step": 4715, "train_runtime": 36480.1405, "train_tokens_per_second": 5659.23 }, { "epoch": 0.3178023161863722, "grad_norm": 0.8379775589672267, "learning_rate": 9.390075751831794e-06, "loss": 0.39603471755981445, "num_input_tokens_seen": 206677304, "step": 4720, "train_runtime": 36513.5133, "train_tokens_per_second": 5660.296 }, { "epoch": 0.31813897118233236, "grad_norm": 1.1929541297616924, "learning_rate": 9.388809593503718e-06, "loss": 0.41028714179992676, "num_input_tokens_seen": 206901904, "step": 4725, "train_runtime": 36554.4289, "train_tokens_per_second": 5660.105 }, { "epoch": 0.3184756261782925, "grad_norm": 0.8413335424516502, "learning_rate": 9.387542207859034e-06, "loss": 0.428537654876709, "num_input_tokens_seen": 207122320, "step": 4730, "train_runtime": 36584.6009, "train_tokens_per_second": 5661.462 }, { "epoch": 0.31881228117425264, "grad_norm": 0.7898247112897376, "learning_rate": 9.386273595252161e-06, "loss": 0.41155662536621096, "num_input_tokens_seen": 207352296, "step": 4735, "train_runtime": 36620.4486, "train_tokens_per_second": 5662.2 }, { "epoch": 0.3191489361702128, "grad_norm": 0.8389868484209729, "learning_rate": 9.385003756037865e-06, "loss": 0.4223154067993164, "num_input_tokens_seen": 207575072, "step": 4740, "train_runtime": 36662.9004, "train_tokens_per_second": 5661.72 }, { "epoch": 0.3194855911661729, "grad_norm": 0.827214827358242, "learning_rate": 9.383732690571253e-06, "loss": 0.40798358917236327, "num_input_tokens_seen": 207817360, "step": 4745, "train_runtime": 36697.2613, "train_tokens_per_second": 5663.021 }, { "epoch": 0.31982224616213306, "grad_norm": 0.8033752581626638, "learning_rate": 9.382460399207769e-06, "loss": 0.40032100677490234, "num_input_tokens_seen": 208045464, "step": 4750, "train_runtime": 36739.6396, "train_tokens_per_second": 5662.697 }, { "epoch": 0.3201589011580932, "grad_norm": 0.7745249893682031, "learning_rate": 9.381186882303212e-06, "loss": 0.3821758985519409, "num_input_tokens_seen": 208245512, "step": 4755, "train_runtime": 36775.3408, "train_tokens_per_second": 5662.64 }, { "epoch": 0.32049555615405334, "grad_norm": 0.7835752828676862, "learning_rate": 9.379912140213713e-06, "loss": 0.38662168979644773, "num_input_tokens_seen": 208458376, "step": 4760, "train_runtime": 36810.474, "train_tokens_per_second": 5663.018 }, { "epoch": 0.3208322111500135, "grad_norm": 0.7427789671372642, "learning_rate": 9.37863617329575e-06, "loss": 0.37845721244812014, "num_input_tokens_seen": 208662464, "step": 4765, "train_runtime": 36848.709, "train_tokens_per_second": 5662.68 }, { "epoch": 0.3211688661459736, "grad_norm": 0.7906549867893844, "learning_rate": 9.377358981906145e-06, "loss": 0.3855098485946655, "num_input_tokens_seen": 208883752, "step": 4770, "train_runtime": 36885.8469, "train_tokens_per_second": 5662.978 }, { "epoch": 0.32150552114193376, "grad_norm": 0.7000304206526682, "learning_rate": 9.376080566402059e-06, "loss": 0.41453986167907714, "num_input_tokens_seen": 209114544, "step": 4775, "train_runtime": 36923.9104, "train_tokens_per_second": 5663.391 }, { "epoch": 0.3218421761378939, "grad_norm": 0.7569304220647727, "learning_rate": 9.374800927140994e-06, "loss": 0.33689126968383787, "num_input_tokens_seen": 209342880, "step": 4780, "train_runtime": 36959.0708, "train_tokens_per_second": 5664.181 }, { "epoch": 0.32217883113385404, "grad_norm": 0.7693618085921944, "learning_rate": 9.373520064480804e-06, "loss": 0.3944025278091431, "num_input_tokens_seen": 209567016, "step": 4785, "train_runtime": 36999.5953, "train_tokens_per_second": 5664.035 }, { "epoch": 0.3225154861298142, "grad_norm": 0.7545108220793344, "learning_rate": 9.372237978779672e-06, "loss": 0.3935252666473389, "num_input_tokens_seen": 209798224, "step": 4790, "train_runtime": 37035.8347, "train_tokens_per_second": 5664.736 }, { "epoch": 0.3228521411257743, "grad_norm": 0.7487128271214056, "learning_rate": 9.37095467039613e-06, "loss": 0.3892039775848389, "num_input_tokens_seen": 209998416, "step": 4795, "train_runtime": 37074.0037, "train_tokens_per_second": 5664.304 }, { "epoch": 0.32318879612173446, "grad_norm": 0.7480661049890698, "learning_rate": 9.369670139689056e-06, "loss": 0.3860762119293213, "num_input_tokens_seen": 210212136, "step": 4800, "train_runtime": 37113.4829, "train_tokens_per_second": 5664.037 }, { "epoch": 0.3235254511176946, "grad_norm": 0.7846044101372698, "learning_rate": 9.368384387017659e-06, "loss": 0.377323055267334, "num_input_tokens_seen": 210412912, "step": 4805, "train_runtime": 37150.0136, "train_tokens_per_second": 5663.872 }, { "epoch": 0.32386210611365474, "grad_norm": 0.77183510086721, "learning_rate": 9.367097412741497e-06, "loss": 0.3832876443862915, "num_input_tokens_seen": 210626632, "step": 4810, "train_runtime": 37185.5052, "train_tokens_per_second": 5664.213 }, { "epoch": 0.3241987611096149, "grad_norm": 0.9148498149260199, "learning_rate": 9.36580921722047e-06, "loss": 0.41832733154296875, "num_input_tokens_seen": 210847304, "step": 4815, "train_runtime": 37226.3372, "train_tokens_per_second": 5663.928 }, { "epoch": 0.324535416105575, "grad_norm": 0.6839164180369833, "learning_rate": 9.364519800814818e-06, "loss": 0.3626012563705444, "num_input_tokens_seen": 211071840, "step": 4820, "train_runtime": 37269.7466, "train_tokens_per_second": 5663.356 }, { "epoch": 0.32487207110153515, "grad_norm": 0.6658908418064057, "learning_rate": 9.36322916388512e-06, "loss": 0.3882687330245972, "num_input_tokens_seen": 211297288, "step": 4825, "train_runtime": 37311.4159, "train_tokens_per_second": 5663.073 }, { "epoch": 0.3252087260974953, "grad_norm": 0.7420928499905488, "learning_rate": 9.3619373067923e-06, "loss": 0.3612262487411499, "num_input_tokens_seen": 211529896, "step": 4830, "train_runtime": 37348.4533, "train_tokens_per_second": 5663.686 }, { "epoch": 0.32554538109345543, "grad_norm": 0.7491528413015758, "learning_rate": 9.360644229897622e-06, "loss": 0.39133119583129883, "num_input_tokens_seen": 211744104, "step": 4835, "train_runtime": 37390.6137, "train_tokens_per_second": 5663.028 }, { "epoch": 0.32588203608941557, "grad_norm": 0.8362580597115173, "learning_rate": 9.35934993356269e-06, "loss": 0.4070117950439453, "num_input_tokens_seen": 211960664, "step": 4840, "train_runtime": 37434.3008, "train_tokens_per_second": 5662.204 }, { "epoch": 0.3262186910853757, "grad_norm": 0.8872020316370295, "learning_rate": 9.35805441814945e-06, "loss": 0.37361793518066405, "num_input_tokens_seen": 212184888, "step": 4845, "train_runtime": 37481.2897, "train_tokens_per_second": 5661.088 }, { "epoch": 0.32655534608133585, "grad_norm": 0.7655564350170675, "learning_rate": 9.356757684020188e-06, "loss": 0.40865292549133303, "num_input_tokens_seen": 212387000, "step": 4850, "train_runtime": 37521.1842, "train_tokens_per_second": 5660.456 }, { "epoch": 0.326892001077296, "grad_norm": 0.9840119081755966, "learning_rate": 9.355459731537533e-06, "loss": 0.37503221035003664, "num_input_tokens_seen": 212602240, "step": 4855, "train_runtime": 37563.6776, "train_tokens_per_second": 5659.782 }, { "epoch": 0.32722865607325613, "grad_norm": 0.8416963207567933, "learning_rate": 9.354160561064451e-06, "loss": 0.4150728225708008, "num_input_tokens_seen": 212829424, "step": 4860, "train_runtime": 37600.8083, "train_tokens_per_second": 5660.235 }, { "epoch": 0.32756531106921627, "grad_norm": 0.6549002669311522, "learning_rate": 9.352860172964254e-06, "loss": 0.41104774475097655, "num_input_tokens_seen": 213059616, "step": 4865, "train_runtime": 37639.635, "train_tokens_per_second": 5660.512 }, { "epoch": 0.3279019660651764, "grad_norm": 0.7662647212420475, "learning_rate": 9.35155856760059e-06, "loss": 0.37230610847473145, "num_input_tokens_seen": 213291344, "step": 4870, "train_runtime": 37683.6107, "train_tokens_per_second": 5660.056 }, { "epoch": 0.32823862106113655, "grad_norm": 0.8032964428930659, "learning_rate": 9.35025574533745e-06, "loss": 0.4028165817260742, "num_input_tokens_seen": 213518768, "step": 4875, "train_runtime": 37716.795, "train_tokens_per_second": 5661.106 }, { "epoch": 0.3285752760570967, "grad_norm": 0.709809886638744, "learning_rate": 9.34895170653916e-06, "loss": 0.37210307121276853, "num_input_tokens_seen": 213742008, "step": 4880, "train_runtime": 37761.13, "train_tokens_per_second": 5660.371 }, { "epoch": 0.3289119310530568, "grad_norm": 1.0245077977220034, "learning_rate": 9.347646451570394e-06, "loss": 0.3780977725982666, "num_input_tokens_seen": 213967120, "step": 4885, "train_runtime": 37795.7217, "train_tokens_per_second": 5661.147 }, { "epoch": 0.32924858604901697, "grad_norm": 0.7783625701111361, "learning_rate": 9.346339980796162e-06, "loss": 0.44457039833068845, "num_input_tokens_seen": 214204152, "step": 4890, "train_runtime": 37830.001, "train_tokens_per_second": 5662.282 }, { "epoch": 0.3295852410449771, "grad_norm": 0.7619788379384177, "learning_rate": 9.345032294581813e-06, "loss": 0.3991098403930664, "num_input_tokens_seen": 214426328, "step": 4895, "train_runtime": 37861.0229, "train_tokens_per_second": 5663.511 }, { "epoch": 0.32992189604093725, "grad_norm": 0.7063552896906414, "learning_rate": 9.343723393293038e-06, "loss": 0.37960023880004884, "num_input_tokens_seen": 214641400, "step": 4900, "train_runtime": 37900.5478, "train_tokens_per_second": 5663.28 }, { "epoch": 0.3302585510368974, "grad_norm": 0.9300418965561537, "learning_rate": 9.342413277295869e-06, "loss": 0.3947901725769043, "num_input_tokens_seen": 214865368, "step": 4905, "train_runtime": 37941.8194, "train_tokens_per_second": 5663.022 }, { "epoch": 0.3305952060328575, "grad_norm": 0.660978808262332, "learning_rate": 9.341101946956672e-06, "loss": 0.39415407180786133, "num_input_tokens_seen": 215077016, "step": 4910, "train_runtime": 37976.1785, "train_tokens_per_second": 5663.472 }, { "epoch": 0.33093186102881766, "grad_norm": 0.7480448807625937, "learning_rate": 9.33978940264216e-06, "loss": 0.4069984436035156, "num_input_tokens_seen": 215281168, "step": 4915, "train_runtime": 38020.9215, "train_tokens_per_second": 5662.176 }, { "epoch": 0.3312685160247778, "grad_norm": 0.9363661586418124, "learning_rate": 9.338475644719377e-06, "loss": 0.396682071685791, "num_input_tokens_seen": 215508928, "step": 4920, "train_runtime": 38060.6534, "train_tokens_per_second": 5662.25 }, { "epoch": 0.33160517102073794, "grad_norm": 0.7522573238030015, "learning_rate": 9.337160673555719e-06, "loss": 0.3950789451599121, "num_input_tokens_seen": 215730176, "step": 4925, "train_runtime": 38096.6721, "train_tokens_per_second": 5662.704 }, { "epoch": 0.3319418260166981, "grad_norm": 0.7866963830157505, "learning_rate": 9.335844489518905e-06, "loss": 0.3960768222808838, "num_input_tokens_seen": 215941544, "step": 4930, "train_runtime": 38135.6021, "train_tokens_per_second": 5662.466 }, { "epoch": 0.3322784810126582, "grad_norm": 0.7771252275599534, "learning_rate": 9.334527092977008e-06, "loss": 0.3927053928375244, "num_input_tokens_seen": 216139784, "step": 4935, "train_runtime": 38172.7334, "train_tokens_per_second": 5662.151 }, { "epoch": 0.33261513600861836, "grad_norm": 0.7031312284914388, "learning_rate": 9.33320848429843e-06, "loss": 0.3905383825302124, "num_input_tokens_seen": 216376872, "step": 4940, "train_runtime": 38213.8052, "train_tokens_per_second": 5662.27 }, { "epoch": 0.3329517910045785, "grad_norm": 0.7992397342780773, "learning_rate": 9.331888663851917e-06, "loss": 0.41385631561279296, "num_input_tokens_seen": 216602432, "step": 4945, "train_runtime": 38247.7905, "train_tokens_per_second": 5663.136 }, { "epoch": 0.33328844600053864, "grad_norm": 0.8325843513269255, "learning_rate": 9.330567632006552e-06, "loss": 0.402661657333374, "num_input_tokens_seen": 216820040, "step": 4950, "train_runtime": 38282.5886, "train_tokens_per_second": 5663.672 }, { "epoch": 0.3336251009964988, "grad_norm": 0.8157610005939018, "learning_rate": 9.329245389131759e-06, "loss": 0.4041293144226074, "num_input_tokens_seen": 217040648, "step": 4955, "train_runtime": 38321.0859, "train_tokens_per_second": 5663.74 }, { "epoch": 0.3339617559924589, "grad_norm": 0.7514981142846812, "learning_rate": 9.327921935597298e-06, "loss": 0.373291015625, "num_input_tokens_seen": 217253544, "step": 4960, "train_runtime": 38362.9141, "train_tokens_per_second": 5663.114 }, { "epoch": 0.33429841098841906, "grad_norm": 0.9584412932125773, "learning_rate": 9.326597271773267e-06, "loss": 0.39936108589172364, "num_input_tokens_seen": 217452896, "step": 4965, "train_runtime": 38404.9607, "train_tokens_per_second": 5662.104 }, { "epoch": 0.3346350659843792, "grad_norm": 0.7914463925442367, "learning_rate": 9.325271398030107e-06, "loss": 0.3928532600402832, "num_input_tokens_seen": 217666152, "step": 4970, "train_runtime": 38441.97, "train_tokens_per_second": 5662.201 }, { "epoch": 0.33497172098033934, "grad_norm": 0.8843279935185989, "learning_rate": 9.323944314738591e-06, "loss": 0.40926666259765626, "num_input_tokens_seen": 217886336, "step": 4975, "train_runtime": 38486.6001, "train_tokens_per_second": 5661.356 }, { "epoch": 0.3353083759762995, "grad_norm": 0.7413319586045699, "learning_rate": 9.322616022269838e-06, "loss": 0.3675239562988281, "num_input_tokens_seen": 218092776, "step": 4980, "train_runtime": 38523.0427, "train_tokens_per_second": 5661.359 }, { "epoch": 0.3356450309722596, "grad_norm": 0.8050536335877444, "learning_rate": 9.321286520995297e-06, "loss": 0.40448784828186035, "num_input_tokens_seen": 218303136, "step": 4985, "train_runtime": 38563.0671, "train_tokens_per_second": 5660.938 }, { "epoch": 0.33598168596821976, "grad_norm": 0.8220117119004713, "learning_rate": 9.319955811286758e-06, "loss": 0.38973236083984375, "num_input_tokens_seen": 218521848, "step": 4990, "train_runtime": 38606.842, "train_tokens_per_second": 5660.184 }, { "epoch": 0.3363183409641799, "grad_norm": 0.724656690749584, "learning_rate": 9.318623893516354e-06, "loss": 0.38318960666656493, "num_input_tokens_seen": 218733712, "step": 4995, "train_runtime": 38643.6596, "train_tokens_per_second": 5660.274 }, { "epoch": 0.33665499596014004, "grad_norm": 0.777455286936359, "learning_rate": 9.317290768056548e-06, "loss": 0.3933337450027466, "num_input_tokens_seen": 218942384, "step": 5000, "train_runtime": 38685.6918, "train_tokens_per_second": 5659.518 }, { "epoch": 0.3369916509561002, "grad_norm": 0.7933540714498255, "learning_rate": 9.315956435280147e-06, "loss": 0.40426931381225584, "num_input_tokens_seen": 219148584, "step": 5005, "train_runtime": 38726.8749, "train_tokens_per_second": 5658.824 }, { "epoch": 0.3373283059520603, "grad_norm": 0.7310653600558, "learning_rate": 9.314620895560292e-06, "loss": 0.3823359251022339, "num_input_tokens_seen": 219366640, "step": 5010, "train_runtime": 38759.9606, "train_tokens_per_second": 5659.62 }, { "epoch": 0.33766496094802045, "grad_norm": 0.8607865029821252, "learning_rate": 9.313284149270459e-06, "loss": 0.4273562431335449, "num_input_tokens_seen": 219580136, "step": 5015, "train_runtime": 38797.085, "train_tokens_per_second": 5659.707 }, { "epoch": 0.3380016159439806, "grad_norm": 0.8291229922855889, "learning_rate": 9.311946196784469e-06, "loss": 0.396860933303833, "num_input_tokens_seen": 219795256, "step": 5020, "train_runtime": 38838.6299, "train_tokens_per_second": 5659.192 }, { "epoch": 0.33833827093994073, "grad_norm": 0.746756264356882, "learning_rate": 9.310607038476476e-06, "loss": 0.40080647468566893, "num_input_tokens_seen": 220007056, "step": 5025, "train_runtime": 38882.3681, "train_tokens_per_second": 5658.273 }, { "epoch": 0.3386749259359009, "grad_norm": 0.7715704037440936, "learning_rate": 9.30926667472097e-06, "loss": 0.3821887016296387, "num_input_tokens_seen": 220230040, "step": 5030, "train_runtime": 38929.962, "train_tokens_per_second": 5657.083 }, { "epoch": 0.339011580931861, "grad_norm": 0.695121253798547, "learning_rate": 9.307925105892779e-06, "loss": 0.4106111526489258, "num_input_tokens_seen": 220463304, "step": 5035, "train_runtime": 38964.7555, "train_tokens_per_second": 5658.018 }, { "epoch": 0.33934823592782115, "grad_norm": 0.7852274341067195, "learning_rate": 9.30658233236707e-06, "loss": 0.38834619522094727, "num_input_tokens_seen": 220695456, "step": 5040, "train_runtime": 39007.1954, "train_tokens_per_second": 5657.814 }, { "epoch": 0.3396848909237813, "grad_norm": 0.759484699190671, "learning_rate": 9.30523835451934e-06, "loss": 0.3923861265182495, "num_input_tokens_seen": 220915344, "step": 5045, "train_runtime": 39053.4813, "train_tokens_per_second": 5656.739 }, { "epoch": 0.34002154591974143, "grad_norm": 0.7964278768577083, "learning_rate": 9.303893172725437e-06, "loss": 0.4306797981262207, "num_input_tokens_seen": 221146072, "step": 5050, "train_runtime": 39091.2343, "train_tokens_per_second": 5657.178 }, { "epoch": 0.34035820091570157, "grad_norm": 0.7340454424901695, "learning_rate": 9.302546787361533e-06, "loss": 0.38288087844848634, "num_input_tokens_seen": 221371344, "step": 5055, "train_runtime": 39133.7258, "train_tokens_per_second": 5656.792 }, { "epoch": 0.3406948559116617, "grad_norm": 0.7383658204672374, "learning_rate": 9.301199198804139e-06, "loss": 0.37805628776550293, "num_input_tokens_seen": 221583280, "step": 5060, "train_runtime": 39172.7195, "train_tokens_per_second": 5656.571 }, { "epoch": 0.34103151090762185, "grad_norm": 0.8155446108957558, "learning_rate": 9.299850407430102e-06, "loss": 0.4092425346374512, "num_input_tokens_seen": 221808808, "step": 5065, "train_runtime": 39215.053, "train_tokens_per_second": 5656.216 }, { "epoch": 0.341368165903582, "grad_norm": 0.8253751293294798, "learning_rate": 9.298500413616613e-06, "loss": 0.3920405864715576, "num_input_tokens_seen": 222029984, "step": 5070, "train_runtime": 39251.0729, "train_tokens_per_second": 5656.66 }, { "epoch": 0.3417048208995421, "grad_norm": 0.7618503900471122, "learning_rate": 9.297149217741188e-06, "loss": 0.3707792043685913, "num_input_tokens_seen": 222251080, "step": 5075, "train_runtime": 39288.8528, "train_tokens_per_second": 5656.848 }, { "epoch": 0.34204147589550227, "grad_norm": 0.7834580864284257, "learning_rate": 9.295796820181688e-06, "loss": 0.4238715171813965, "num_input_tokens_seen": 222475224, "step": 5080, "train_runtime": 39326.0211, "train_tokens_per_second": 5657.201 }, { "epoch": 0.3423781308914624, "grad_norm": 0.7875688230457064, "learning_rate": 9.294443221316305e-06, "loss": 0.3979609727859497, "num_input_tokens_seen": 222689712, "step": 5085, "train_runtime": 39362.9107, "train_tokens_per_second": 5657.349 }, { "epoch": 0.34271478588742255, "grad_norm": 0.6945475678075447, "learning_rate": 9.293088421523569e-06, "loss": 0.41632776260375975, "num_input_tokens_seen": 222903112, "step": 5090, "train_runtime": 39399.1126, "train_tokens_per_second": 5657.567 }, { "epoch": 0.3430514408833827, "grad_norm": 0.8727362030270556, "learning_rate": 9.291732421182346e-06, "loss": 0.3804980754852295, "num_input_tokens_seen": 223116536, "step": 5095, "train_runtime": 39444.3485, "train_tokens_per_second": 5656.489 }, { "epoch": 0.3433880958793428, "grad_norm": 0.7868108132642002, "learning_rate": 9.290375220671837e-06, "loss": 0.3959723949432373, "num_input_tokens_seen": 223331328, "step": 5100, "train_runtime": 39483.2714, "train_tokens_per_second": 5656.353 }, { "epoch": 0.34372475087530296, "grad_norm": 0.8977037421010565, "learning_rate": 9.28901682037158e-06, "loss": 0.3575240135192871, "num_input_tokens_seen": 223545784, "step": 5105, "train_runtime": 39520.4864, "train_tokens_per_second": 5656.453 }, { "epoch": 0.3440614058712631, "grad_norm": 0.724529969116944, "learning_rate": 9.287657220661442e-06, "loss": 0.41797566413879395, "num_input_tokens_seen": 223772168, "step": 5110, "train_runtime": 39556.4135, "train_tokens_per_second": 5657.039 }, { "epoch": 0.34439806086722324, "grad_norm": 0.8314015078496961, "learning_rate": 9.286296421921636e-06, "loss": 0.3681803703308105, "num_input_tokens_seen": 223987880, "step": 5115, "train_runtime": 39597.3882, "train_tokens_per_second": 5656.633 }, { "epoch": 0.3447347158631834, "grad_norm": 0.8879862781401929, "learning_rate": 9.284934424532706e-06, "loss": 0.4501188278198242, "num_input_tokens_seen": 224197912, "step": 5120, "train_runtime": 39637.597, "train_tokens_per_second": 5656.193 }, { "epoch": 0.3450713708591435, "grad_norm": 0.7067262341475377, "learning_rate": 9.283571228875525e-06, "loss": 0.35322113037109376, "num_input_tokens_seen": 224398888, "step": 5125, "train_runtime": 39676.3313, "train_tokens_per_second": 5655.737 }, { "epoch": 0.3454080258551037, "grad_norm": 0.7651046532838097, "learning_rate": 9.282206835331311e-06, "loss": 0.4238561153411865, "num_input_tokens_seen": 224624840, "step": 5130, "train_runtime": 39714.5021, "train_tokens_per_second": 5655.99 }, { "epoch": 0.34574468085106386, "grad_norm": 1.0540025361763135, "learning_rate": 9.28084124428161e-06, "loss": 0.3581863880157471, "num_input_tokens_seen": 224840616, "step": 5135, "train_runtime": 39760.1229, "train_tokens_per_second": 5654.928 }, { "epoch": 0.346081335847024, "grad_norm": 0.712972521802771, "learning_rate": 9.279474456108305e-06, "loss": 0.37324137687683107, "num_input_tokens_seen": 225076296, "step": 5140, "train_runtime": 39795.5671, "train_tokens_per_second": 5655.813 }, { "epoch": 0.34641799084298414, "grad_norm": 0.7436296711193636, "learning_rate": 9.278106471193615e-06, "loss": 0.36896820068359376, "num_input_tokens_seen": 225294528, "step": 5145, "train_runtime": 39833.6798, "train_tokens_per_second": 5655.88 }, { "epoch": 0.3467546458389443, "grad_norm": 0.7808819136322714, "learning_rate": 9.276737289920093e-06, "loss": 0.4088866710662842, "num_input_tokens_seen": 225512648, "step": 5150, "train_runtime": 39875.84, "train_tokens_per_second": 5655.37 }, { "epoch": 0.3470913008349044, "grad_norm": 0.74354681758287, "learning_rate": 9.275366912670624e-06, "loss": 0.4070155143737793, "num_input_tokens_seen": 225724000, "step": 5155, "train_runtime": 39910.7695, "train_tokens_per_second": 5655.717 }, { "epoch": 0.34742795583086455, "grad_norm": 0.7443700356039168, "learning_rate": 9.273995339828432e-06, "loss": 0.3892085075378418, "num_input_tokens_seen": 225939192, "step": 5160, "train_runtime": 39950.0434, "train_tokens_per_second": 5655.543 }, { "epoch": 0.3477646108268247, "grad_norm": 0.8699331338781421, "learning_rate": 9.272622571777072e-06, "loss": 0.42869272232055666, "num_input_tokens_seen": 226161472, "step": 5165, "train_runtime": 39986.0253, "train_tokens_per_second": 5656.013 }, { "epoch": 0.34810126582278483, "grad_norm": 0.7946248476997148, "learning_rate": 9.271248608900434e-06, "loss": 0.3663766860961914, "num_input_tokens_seen": 226388672, "step": 5170, "train_runtime": 40022.8625, "train_tokens_per_second": 5656.484 }, { "epoch": 0.348437920818745, "grad_norm": 0.820181936155836, "learning_rate": 9.269873451582741e-06, "loss": 0.3990020275115967, "num_input_tokens_seen": 226604448, "step": 5175, "train_runtime": 40065.8484, "train_tokens_per_second": 5655.801 }, { "epoch": 0.3487745758147051, "grad_norm": 0.7865052705818104, "learning_rate": 9.268497100208556e-06, "loss": 0.40553035736083987, "num_input_tokens_seen": 226814192, "step": 5180, "train_runtime": 40108.7169, "train_tokens_per_second": 5654.985 }, { "epoch": 0.34911123081066525, "grad_norm": 0.8597790154802004, "learning_rate": 9.267119555162765e-06, "loss": 0.40463762283325194, "num_input_tokens_seen": 227044824, "step": 5185, "train_runtime": 40148.6974, "train_tokens_per_second": 5655.098 }, { "epoch": 0.3494478858066254, "grad_norm": 0.7383395894951612, "learning_rate": 9.2657408168306e-06, "loss": 0.3876547336578369, "num_input_tokens_seen": 227264048, "step": 5190, "train_runtime": 40181.6708, "train_tokens_per_second": 5655.913 }, { "epoch": 0.34978454080258553, "grad_norm": 0.8478101930950076, "learning_rate": 9.264360885597617e-06, "loss": 0.3948791027069092, "num_input_tokens_seen": 227482568, "step": 5195, "train_runtime": 40224.9641, "train_tokens_per_second": 5655.258 }, { "epoch": 0.35012119579854567, "grad_norm": 0.8312712862431509, "learning_rate": 9.262979761849709e-06, "loss": 0.3999017238616943, "num_input_tokens_seen": 227701672, "step": 5200, "train_runtime": 40265.2495, "train_tokens_per_second": 5655.042 }, { "epoch": 0.3504578507945058, "grad_norm": 0.8047649086754547, "learning_rate": 9.261597445973106e-06, "loss": 0.40303988456726075, "num_input_tokens_seen": 227930736, "step": 5205, "train_runtime": 40300.5889, "train_tokens_per_second": 5655.767 }, { "epoch": 0.35079450579046595, "grad_norm": 0.7279256779386029, "learning_rate": 9.260213938354365e-06, "loss": 0.38801677227020265, "num_input_tokens_seen": 228142248, "step": 5210, "train_runtime": 40339.465, "train_tokens_per_second": 5655.56 }, { "epoch": 0.3511311607864261, "grad_norm": 0.703365188592268, "learning_rate": 9.25882923938038e-06, "loss": 0.40598435401916505, "num_input_tokens_seen": 228355000, "step": 5215, "train_runtime": 40382.8232, "train_tokens_per_second": 5654.756 }, { "epoch": 0.35146781578238623, "grad_norm": 0.8641270145143162, "learning_rate": 9.257443349438382e-06, "loss": 0.42745413780212405, "num_input_tokens_seen": 228579256, "step": 5220, "train_runtime": 40419.0219, "train_tokens_per_second": 5655.24 }, { "epoch": 0.35180447077834637, "grad_norm": 0.8147972074351507, "learning_rate": 9.256056268915924e-06, "loss": 0.40657625198364256, "num_input_tokens_seen": 228801840, "step": 5225, "train_runtime": 40461.4517, "train_tokens_per_second": 5654.81 }, { "epoch": 0.3521411257743065, "grad_norm": 0.7053549338628146, "learning_rate": 9.254667998200906e-06, "loss": 0.4108288764953613, "num_input_tokens_seen": 229023432, "step": 5230, "train_runtime": 40502.8889, "train_tokens_per_second": 5654.496 }, { "epoch": 0.35247778077026665, "grad_norm": 0.8352493252466918, "learning_rate": 9.253278537681548e-06, "loss": 0.4314168930053711, "num_input_tokens_seen": 229259792, "step": 5235, "train_runtime": 40538.046, "train_tokens_per_second": 5655.423 }, { "epoch": 0.3528144357662268, "grad_norm": 0.7807713230559138, "learning_rate": 9.251887887746407e-06, "loss": 0.3931559085845947, "num_input_tokens_seen": 229485656, "step": 5240, "train_runtime": 40577.5224, "train_tokens_per_second": 5655.487 }, { "epoch": 0.3531510907621869, "grad_norm": 0.8636190729399873, "learning_rate": 9.25049604878438e-06, "loss": 0.38311750888824464, "num_input_tokens_seen": 229704840, "step": 5245, "train_runtime": 40615.5331, "train_tokens_per_second": 5655.591 }, { "epoch": 0.35348774575814707, "grad_norm": 0.8592849372799231, "learning_rate": 9.249103021184684e-06, "loss": 0.3960615634918213, "num_input_tokens_seen": 229920256, "step": 5250, "train_runtime": 40653.9984, "train_tokens_per_second": 5655.539 }, { "epoch": 0.3538244007541072, "grad_norm": 0.7502281989758054, "learning_rate": 9.24770880533688e-06, "loss": 0.4205930709838867, "num_input_tokens_seen": 230150768, "step": 5255, "train_runtime": 40691.9738, "train_tokens_per_second": 5655.925 }, { "epoch": 0.35416105575006734, "grad_norm": 0.9736374450794365, "learning_rate": 9.24631340163085e-06, "loss": 0.41542859077453614, "num_input_tokens_seen": 230338192, "step": 5260, "train_runtime": 40727.6217, "train_tokens_per_second": 5655.577 }, { "epoch": 0.3544977107460275, "grad_norm": 0.7629428550659803, "learning_rate": 9.244916810456822e-06, "loss": 0.3574668884277344, "num_input_tokens_seen": 230568472, "step": 5265, "train_runtime": 40758.3906, "train_tokens_per_second": 5656.957 }, { "epoch": 0.3548343657419876, "grad_norm": 0.7107248914856642, "learning_rate": 9.24351903220534e-06, "loss": 0.40234909057617185, "num_input_tokens_seen": 230793504, "step": 5270, "train_runtime": 40798.996, "train_tokens_per_second": 5656.843 }, { "epoch": 0.35517102073794776, "grad_norm": 0.8468122239159248, "learning_rate": 9.242120067267295e-06, "loss": 0.3589898347854614, "num_input_tokens_seen": 231011256, "step": 5275, "train_runtime": 40837.4422, "train_tokens_per_second": 5656.849 }, { "epoch": 0.3555076757339079, "grad_norm": 0.8384350564515061, "learning_rate": 9.2407199160339e-06, "loss": 0.3916470050811768, "num_input_tokens_seen": 231224304, "step": 5280, "train_runtime": 40879.0573, "train_tokens_per_second": 5656.302 }, { "epoch": 0.35584433072986804, "grad_norm": 0.7878128731634584, "learning_rate": 9.239318578896701e-06, "loss": 0.3869880199432373, "num_input_tokens_seen": 231440576, "step": 5285, "train_runtime": 40917.8128, "train_tokens_per_second": 5656.23 }, { "epoch": 0.3561809857258282, "grad_norm": 0.9404923069120379, "learning_rate": 9.237916056247583e-06, "loss": 0.40935673713684084, "num_input_tokens_seen": 231653280, "step": 5290, "train_runtime": 40955.4085, "train_tokens_per_second": 5656.232 }, { "epoch": 0.3565176407217883, "grad_norm": 0.790253055764951, "learning_rate": 9.23651234847875e-06, "loss": 0.4153427600860596, "num_input_tokens_seen": 231867296, "step": 5295, "train_runtime": 40993.5671, "train_tokens_per_second": 5656.187 }, { "epoch": 0.35685429571774846, "grad_norm": 0.8209369098367891, "learning_rate": 9.23510745598275e-06, "loss": 0.3877981185913086, "num_input_tokens_seen": 232073536, "step": 5300, "train_runtime": 41032.3162, "train_tokens_per_second": 5655.872 }, { "epoch": 0.3571909507137086, "grad_norm": 0.6660402351658175, "learning_rate": 9.233701379152456e-06, "loss": 0.3829216957092285, "num_input_tokens_seen": 232295728, "step": 5305, "train_runtime": 41070.6587, "train_tokens_per_second": 5656.002 }, { "epoch": 0.35752760570966874, "grad_norm": 0.7635535443595722, "learning_rate": 9.232294118381069e-06, "loss": 0.41249933242797854, "num_input_tokens_seen": 232520456, "step": 5310, "train_runtime": 41107.4158, "train_tokens_per_second": 5656.411 }, { "epoch": 0.3578642607056289, "grad_norm": 0.7665309192538949, "learning_rate": 9.230885674062129e-06, "loss": 0.3704015493392944, "num_input_tokens_seen": 232740384, "step": 5315, "train_runtime": 41146.5227, "train_tokens_per_second": 5656.38 }, { "epoch": 0.358200915701589, "grad_norm": 0.805325429526549, "learning_rate": 9.2294760465895e-06, "loss": 0.4049508094787598, "num_input_tokens_seen": 232969144, "step": 5320, "train_runtime": 41180.0542, "train_tokens_per_second": 5657.33 }, { "epoch": 0.35853757069754916, "grad_norm": 0.8309484529457033, "learning_rate": 9.228065236357383e-06, "loss": 0.39788720607757566, "num_input_tokens_seen": 233196464, "step": 5325, "train_runtime": 41217.3194, "train_tokens_per_second": 5657.73 }, { "epoch": 0.3588742256935093, "grad_norm": 0.7008865285408351, "learning_rate": 9.226653243760304e-06, "loss": 0.3763267993927002, "num_input_tokens_seen": 233413024, "step": 5330, "train_runtime": 41251.2257, "train_tokens_per_second": 5658.329 }, { "epoch": 0.35921088068946944, "grad_norm": 0.7229398353747315, "learning_rate": 9.225240069193124e-06, "loss": 0.4120461463928223, "num_input_tokens_seen": 233629584, "step": 5335, "train_runtime": 41295.9805, "train_tokens_per_second": 5657.441 }, { "epoch": 0.3595475356854296, "grad_norm": 0.854235630422482, "learning_rate": 9.223825713051034e-06, "loss": 0.4018904685974121, "num_input_tokens_seen": 233844536, "step": 5340, "train_runtime": 41326.7978, "train_tokens_per_second": 5658.424 }, { "epoch": 0.3598841906813897, "grad_norm": 0.8244749095839433, "learning_rate": 9.222410175729549e-06, "loss": 0.38492045402526853, "num_input_tokens_seen": 234063096, "step": 5345, "train_runtime": 41367.4954, "train_tokens_per_second": 5658.14 }, { "epoch": 0.36022084567734985, "grad_norm": 0.7424522527415252, "learning_rate": 9.220993457624523e-06, "loss": 0.3723012924194336, "num_input_tokens_seen": 234279256, "step": 5350, "train_runtime": 41414.7783, "train_tokens_per_second": 5656.9 }, { "epoch": 0.36055750067331, "grad_norm": 0.8296218729091308, "learning_rate": 9.219575559132136e-06, "loss": 0.4064267635345459, "num_input_tokens_seen": 234496160, "step": 5355, "train_runtime": 41454.7573, "train_tokens_per_second": 5656.677 }, { "epoch": 0.36089415566927013, "grad_norm": 0.8270954179905022, "learning_rate": 9.2181564806489e-06, "loss": 0.3711550235748291, "num_input_tokens_seen": 234705872, "step": 5360, "train_runtime": 41488.3956, "train_tokens_per_second": 5657.145 }, { "epoch": 0.3612308106652303, "grad_norm": 0.7010804881835582, "learning_rate": 9.216736222571655e-06, "loss": 0.36968867778778075, "num_input_tokens_seen": 234928056, "step": 5365, "train_runtime": 41528.5306, "train_tokens_per_second": 5657.028 }, { "epoch": 0.3615674656611904, "grad_norm": 0.7909884318309988, "learning_rate": 9.215314785297572e-06, "loss": 0.4384300708770752, "num_input_tokens_seen": 235127224, "step": 5370, "train_runtime": 41566.5449, "train_tokens_per_second": 5656.646 }, { "epoch": 0.36190412065715055, "grad_norm": 0.7730294782111428, "learning_rate": 9.21389216922415e-06, "loss": 0.3896491527557373, "num_input_tokens_seen": 235350232, "step": 5375, "train_runtime": 41604.4719, "train_tokens_per_second": 5656.849 }, { "epoch": 0.3622407756531107, "grad_norm": 1.5247558034207205, "learning_rate": 9.212468374749222e-06, "loss": 0.4335320949554443, "num_input_tokens_seen": 235570704, "step": 5380, "train_runtime": 41642.8804, "train_tokens_per_second": 5656.926 }, { "epoch": 0.36257743064907083, "grad_norm": 0.7761987245970543, "learning_rate": 9.211043402270942e-06, "loss": 0.39116473197937013, "num_input_tokens_seen": 235785280, "step": 5385, "train_runtime": 41679.7538, "train_tokens_per_second": 5657.07 }, { "epoch": 0.36291408564503097, "grad_norm": 0.7417904936648765, "learning_rate": 9.209617252187806e-06, "loss": 0.3792844533920288, "num_input_tokens_seen": 235999696, "step": 5390, "train_runtime": 41717.5624, "train_tokens_per_second": 5657.083 }, { "epoch": 0.3632507406409911, "grad_norm": 0.8168071916778651, "learning_rate": 9.208189924898627e-06, "loss": 0.3464975833892822, "num_input_tokens_seen": 236210480, "step": 5395, "train_runtime": 41760.5338, "train_tokens_per_second": 5656.309 }, { "epoch": 0.36358739563695125, "grad_norm": 0.7857550769816507, "learning_rate": 9.206761420802554e-06, "loss": 0.4210227966308594, "num_input_tokens_seen": 236432304, "step": 5400, "train_runtime": 41802.7339, "train_tokens_per_second": 5655.905 }, { "epoch": 0.3639240506329114, "grad_norm": 0.724781136378123, "learning_rate": 9.205331740299065e-06, "loss": 0.3803566932678223, "num_input_tokens_seen": 236642552, "step": 5405, "train_runtime": 41844.665, "train_tokens_per_second": 5655.262 }, { "epoch": 0.36426070562887153, "grad_norm": 0.7382233662482024, "learning_rate": 9.203900883787967e-06, "loss": 0.4222862243652344, "num_input_tokens_seen": 236866080, "step": 5410, "train_runtime": 41880.1302, "train_tokens_per_second": 5655.811 }, { "epoch": 0.36459736062483167, "grad_norm": 0.7707623946075276, "learning_rate": 9.202468851669388e-06, "loss": 0.42064590454101564, "num_input_tokens_seen": 237084656, "step": 5415, "train_runtime": 41922.4674, "train_tokens_per_second": 5655.313 }, { "epoch": 0.3649340156207918, "grad_norm": 0.7505014032426987, "learning_rate": 9.201035644343797e-06, "loss": 0.40491809844970705, "num_input_tokens_seen": 237299088, "step": 5420, "train_runtime": 41963.0407, "train_tokens_per_second": 5654.955 }, { "epoch": 0.36527067061675195, "grad_norm": 0.8419562349359976, "learning_rate": 9.199601262211985e-06, "loss": 0.3938578128814697, "num_input_tokens_seen": 237505024, "step": 5425, "train_runtime": 41999.6624, "train_tokens_per_second": 5654.927 }, { "epoch": 0.3656073256127121, "grad_norm": 0.7844116167185397, "learning_rate": 9.19816570567507e-06, "loss": 0.4014750480651855, "num_input_tokens_seen": 237729312, "step": 5430, "train_runtime": 42038.7844, "train_tokens_per_second": 5655.0 }, { "epoch": 0.3659439806086722, "grad_norm": 0.8709777369310681, "learning_rate": 9.196728975134503e-06, "loss": 0.41324663162231445, "num_input_tokens_seen": 237937544, "step": 5435, "train_runtime": 42082.2656, "train_tokens_per_second": 5654.105 }, { "epoch": 0.36628063560463237, "grad_norm": 0.943067660878324, "learning_rate": 9.195291070992061e-06, "loss": 0.39972093105316164, "num_input_tokens_seen": 238144328, "step": 5440, "train_runtime": 42119.7987, "train_tokens_per_second": 5653.976 }, { "epoch": 0.3666172906005925, "grad_norm": 0.7866408242613544, "learning_rate": 9.193851993649849e-06, "loss": 0.36598644256591795, "num_input_tokens_seen": 238371752, "step": 5445, "train_runtime": 42157.0955, "train_tokens_per_second": 5654.368 }, { "epoch": 0.36695394559655264, "grad_norm": 0.7572508667451172, "learning_rate": 9.1924117435103e-06, "loss": 0.3939794063568115, "num_input_tokens_seen": 238586128, "step": 5450, "train_runtime": 42198.1981, "train_tokens_per_second": 5653.941 }, { "epoch": 0.3672906005925128, "grad_norm": 0.885004223430614, "learning_rate": 9.190970320976176e-06, "loss": 0.3719717264175415, "num_input_tokens_seen": 238811344, "step": 5455, "train_runtime": 42232.691, "train_tokens_per_second": 5654.656 }, { "epoch": 0.3676272555884729, "grad_norm": 0.8940362227103387, "learning_rate": 9.189527726450565e-06, "loss": 0.4350133895874023, "num_input_tokens_seen": 239003208, "step": 5460, "train_runtime": 42266.5178, "train_tokens_per_second": 5654.67 }, { "epoch": 0.36796391058443306, "grad_norm": 0.6837019733666716, "learning_rate": 9.188083960336885e-06, "loss": 0.3788605213165283, "num_input_tokens_seen": 239225040, "step": 5465, "train_runtime": 42305.7631, "train_tokens_per_second": 5654.668 }, { "epoch": 0.3683005655803932, "grad_norm": 0.7278725929539929, "learning_rate": 9.186639023038879e-06, "loss": 0.4101285934448242, "num_input_tokens_seen": 239445688, "step": 5470, "train_runtime": 42345.9353, "train_tokens_per_second": 5654.514 }, { "epoch": 0.36863722057635334, "grad_norm": 0.8240745816268156, "learning_rate": 9.185192914960622e-06, "loss": 0.43002777099609374, "num_input_tokens_seen": 239660856, "step": 5475, "train_runtime": 42383.8589, "train_tokens_per_second": 5654.531 }, { "epoch": 0.3689738755723135, "grad_norm": 0.7561111927294512, "learning_rate": 9.183745636506511e-06, "loss": 0.400468635559082, "num_input_tokens_seen": 239863160, "step": 5480, "train_runtime": 42415.6347, "train_tokens_per_second": 5655.065 }, { "epoch": 0.3693105305682736, "grad_norm": 0.6657976994723397, "learning_rate": 9.182297188081274e-06, "loss": 0.39147305488586426, "num_input_tokens_seen": 240088504, "step": 5485, "train_runtime": 42445.5983, "train_tokens_per_second": 5656.382 }, { "epoch": 0.36964718556423376, "grad_norm": 0.7438674827381799, "learning_rate": 9.180847570089964e-06, "loss": 0.38025264739990233, "num_input_tokens_seen": 240285080, "step": 5490, "train_runtime": 42487.4443, "train_tokens_per_second": 5655.437 }, { "epoch": 0.3699838405601939, "grad_norm": 0.7687571314606845, "learning_rate": 9.179396782937965e-06, "loss": 0.4285304546356201, "num_input_tokens_seen": 240518464, "step": 5495, "train_runtime": 42522.1167, "train_tokens_per_second": 5656.314 }, { "epoch": 0.37032049555615404, "grad_norm": 0.8258932109796826, "learning_rate": 9.17794482703098e-06, "loss": 0.41852726936340334, "num_input_tokens_seen": 240737112, "step": 5500, "train_runtime": 42561.0578, "train_tokens_per_second": 5656.277 }, { "epoch": 0.3706571505521142, "grad_norm": 0.7712097331858169, "learning_rate": 9.176491702775049e-06, "loss": 0.4076284408569336, "num_input_tokens_seen": 240940632, "step": 5505, "train_runtime": 42605.8265, "train_tokens_per_second": 5655.11 }, { "epoch": 0.3709938055480743, "grad_norm": 0.7293507629162065, "learning_rate": 9.17503741057653e-06, "loss": 0.42336077690124513, "num_input_tokens_seen": 241163512, "step": 5510, "train_runtime": 42641.1976, "train_tokens_per_second": 5655.646 }, { "epoch": 0.37133046054403446, "grad_norm": 0.7873802897373652, "learning_rate": 9.173581950842111e-06, "loss": 0.3858926773071289, "num_input_tokens_seen": 241380280, "step": 5515, "train_runtime": 42677.1161, "train_tokens_per_second": 5655.965 }, { "epoch": 0.3716671155399946, "grad_norm": 0.833898462602849, "learning_rate": 9.172125323978811e-06, "loss": 0.39653089046478274, "num_input_tokens_seen": 241601112, "step": 5520, "train_runtime": 42713.21, "train_tokens_per_second": 5656.356 }, { "epoch": 0.37200377053595474, "grad_norm": 0.7933645694043111, "learning_rate": 9.170667530393966e-06, "loss": 0.4098936080932617, "num_input_tokens_seen": 241828432, "step": 5525, "train_runtime": 42747.8553, "train_tokens_per_second": 5657.089 }, { "epoch": 0.3723404255319149, "grad_norm": 0.724581396473804, "learning_rate": 9.169208570495247e-06, "loss": 0.3672953605651855, "num_input_tokens_seen": 242051344, "step": 5530, "train_runtime": 42787.8177, "train_tokens_per_second": 5657.015 }, { "epoch": 0.372677080527875, "grad_norm": 0.720329801926469, "learning_rate": 9.167748444690646e-06, "loss": 0.3897575855255127, "num_input_tokens_seen": 242250584, "step": 5535, "train_runtime": 42826.4052, "train_tokens_per_second": 5656.571 }, { "epoch": 0.37301373552383515, "grad_norm": 0.7934647008536321, "learning_rate": 9.16628715338848e-06, "loss": 0.3871308326721191, "num_input_tokens_seen": 242459936, "step": 5540, "train_runtime": 42859.1014, "train_tokens_per_second": 5657.14 }, { "epoch": 0.3733503905197953, "grad_norm": 0.7931279904448103, "learning_rate": 9.164824696997398e-06, "loss": 0.37985944747924805, "num_input_tokens_seen": 242665952, "step": 5545, "train_runtime": 42896.1293, "train_tokens_per_second": 5657.059 }, { "epoch": 0.37368704551575543, "grad_norm": 0.7548635507515563, "learning_rate": 9.163361075926371e-06, "loss": 0.4154071807861328, "num_input_tokens_seen": 242885960, "step": 5550, "train_runtime": 42932.7348, "train_tokens_per_second": 5657.361 }, { "epoch": 0.3740237005117156, "grad_norm": 0.824128032145257, "learning_rate": 9.161896290584695e-06, "loss": 0.37793383598327634, "num_input_tokens_seen": 243108432, "step": 5555, "train_runtime": 42974.4088, "train_tokens_per_second": 5657.051 }, { "epoch": 0.3743603555076757, "grad_norm": 0.755788883617862, "learning_rate": 9.160430341381991e-06, "loss": 0.3929650545120239, "num_input_tokens_seen": 243321200, "step": 5560, "train_runtime": 43020.7871, "train_tokens_per_second": 5655.898 }, { "epoch": 0.37469701050363585, "grad_norm": 0.8046945349779168, "learning_rate": 9.15896322872821e-06, "loss": 0.39426612854003906, "num_input_tokens_seen": 243541160, "step": 5565, "train_runtime": 43065.6274, "train_tokens_per_second": 5655.117 }, { "epoch": 0.375033665499596, "grad_norm": 0.8408220299669169, "learning_rate": 9.157494953033625e-06, "loss": 0.4226834297180176, "num_input_tokens_seen": 243766296, "step": 5570, "train_runtime": 43100.4977, "train_tokens_per_second": 5655.765 }, { "epoch": 0.37537032049555613, "grad_norm": 0.7701423462069609, "learning_rate": 9.156025514708832e-06, "loss": 0.40192432403564454, "num_input_tokens_seen": 244002616, "step": 5575, "train_runtime": 43146.2968, "train_tokens_per_second": 5655.239 }, { "epoch": 0.37570697549151627, "grad_norm": 0.7773289349591549, "learning_rate": 9.154554914164757e-06, "loss": 0.38442695140838623, "num_input_tokens_seen": 244237240, "step": 5580, "train_runtime": 43188.3958, "train_tokens_per_second": 5655.159 }, { "epoch": 0.3760436304874764, "grad_norm": 0.6847338403952183, "learning_rate": 9.153083151812649e-06, "loss": 0.377176308631897, "num_input_tokens_seen": 244463576, "step": 5585, "train_runtime": 43225.3626, "train_tokens_per_second": 5655.559 }, { "epoch": 0.37638028548343655, "grad_norm": 0.780657947894897, "learning_rate": 9.151610228064078e-06, "loss": 0.40382232666015627, "num_input_tokens_seen": 244685816, "step": 5590, "train_runtime": 43264.9573, "train_tokens_per_second": 5655.52 }, { "epoch": 0.3767169404793967, "grad_norm": 0.7617598851673253, "learning_rate": 9.150136143330949e-06, "loss": 0.42247867584228516, "num_input_tokens_seen": 244901992, "step": 5595, "train_runtime": 43305.9839, "train_tokens_per_second": 5655.154 }, { "epoch": 0.37705359547535683, "grad_norm": 0.6965545191686713, "learning_rate": 9.14866089802548e-06, "loss": 0.3760505676269531, "num_input_tokens_seen": 245127560, "step": 5600, "train_runtime": 43348.427, "train_tokens_per_second": 5654.82 }, { "epoch": 0.37739025047131697, "grad_norm": 0.8578077401564244, "learning_rate": 9.147184492560219e-06, "loss": 0.3698588848114014, "num_input_tokens_seen": 245339952, "step": 5605, "train_runtime": 43388.8794, "train_tokens_per_second": 5654.443 }, { "epoch": 0.3777269054672771, "grad_norm": 1.0507318076347205, "learning_rate": 9.14570692734804e-06, "loss": 0.3787434816360474, "num_input_tokens_seen": 245565672, "step": 5610, "train_runtime": 43425.1962, "train_tokens_per_second": 5654.912 }, { "epoch": 0.37806356046323725, "grad_norm": 0.8234417174719115, "learning_rate": 9.144228202802137e-06, "loss": 0.41345486640930174, "num_input_tokens_seen": 245793416, "step": 5615, "train_runtime": 43457.0254, "train_tokens_per_second": 5656.011 }, { "epoch": 0.37840021545919744, "grad_norm": 0.8147806646148233, "learning_rate": 9.142748319336033e-06, "loss": 0.39602549076080323, "num_input_tokens_seen": 246014600, "step": 5620, "train_runtime": 43495.3144, "train_tokens_per_second": 5656.117 }, { "epoch": 0.3787368704551576, "grad_norm": 0.8294007935657565, "learning_rate": 9.141267277363573e-06, "loss": 0.3865189552307129, "num_input_tokens_seen": 246209040, "step": 5625, "train_runtime": 43530.2862, "train_tokens_per_second": 5656.04 }, { "epoch": 0.3790735254511177, "grad_norm": 0.8057103649691175, "learning_rate": 9.139785077298921e-06, "loss": 0.3669655084609985, "num_input_tokens_seen": 246435304, "step": 5630, "train_runtime": 43570.2665, "train_tokens_per_second": 5656.043 }, { "epoch": 0.37941018044707786, "grad_norm": 0.7570731119383132, "learning_rate": 9.138301719556577e-06, "loss": 0.3826982736587524, "num_input_tokens_seen": 246652712, "step": 5635, "train_runtime": 43609.2254, "train_tokens_per_second": 5655.976 }, { "epoch": 0.379746835443038, "grad_norm": 0.7474769926348979, "learning_rate": 9.136817204551352e-06, "loss": 0.386492919921875, "num_input_tokens_seen": 246882568, "step": 5640, "train_runtime": 43646.3585, "train_tokens_per_second": 5656.43 }, { "epoch": 0.38008349043899814, "grad_norm": 0.7350249063601988, "learning_rate": 9.135331532698385e-06, "loss": 0.3880929470062256, "num_input_tokens_seen": 247094472, "step": 5645, "train_runtime": 43685.4708, "train_tokens_per_second": 5656.216 }, { "epoch": 0.3804201454349583, "grad_norm": 0.7440003142918237, "learning_rate": 9.133844704413144e-06, "loss": 0.37475876808166503, "num_input_tokens_seen": 247305056, "step": 5650, "train_runtime": 43724.0377, "train_tokens_per_second": 5656.043 }, { "epoch": 0.3807568004309184, "grad_norm": 0.829580642455565, "learning_rate": 9.132356720111413e-06, "loss": 0.40270652770996096, "num_input_tokens_seen": 247521856, "step": 5655, "train_runtime": 43766.9087, "train_tokens_per_second": 5655.457 }, { "epoch": 0.38109345542687856, "grad_norm": 0.7890155830011499, "learning_rate": 9.1308675802093e-06, "loss": 0.3874132394790649, "num_input_tokens_seen": 247735120, "step": 5660, "train_runtime": 43801.888, "train_tokens_per_second": 5655.809 }, { "epoch": 0.3814301104228387, "grad_norm": 0.7482568242628747, "learning_rate": 9.129377285123241e-06, "loss": 0.3984661102294922, "num_input_tokens_seen": 247949328, "step": 5665, "train_runtime": 43845.4472, "train_tokens_per_second": 5655.076 }, { "epoch": 0.38176676541879884, "grad_norm": 0.7947458109924397, "learning_rate": 9.127885835269996e-06, "loss": 0.4090867519378662, "num_input_tokens_seen": 248174032, "step": 5670, "train_runtime": 43879.3187, "train_tokens_per_second": 5655.831 }, { "epoch": 0.382103420414759, "grad_norm": 0.726446478217637, "learning_rate": 9.126393231066636e-06, "loss": 0.3848613977432251, "num_input_tokens_seen": 248384368, "step": 5675, "train_runtime": 43917.9285, "train_tokens_per_second": 5655.649 }, { "epoch": 0.3824400754107191, "grad_norm": 0.7750970581531168, "learning_rate": 9.124899472930568e-06, "loss": 0.4047283172607422, "num_input_tokens_seen": 248607600, "step": 5680, "train_runtime": 43961.6528, "train_tokens_per_second": 5655.101 }, { "epoch": 0.38277673040667926, "grad_norm": 1.9536806017675672, "learning_rate": 9.123404561279517e-06, "loss": 0.41053128242492676, "num_input_tokens_seen": 248811928, "step": 5685, "train_runtime": 44006.8302, "train_tokens_per_second": 5653.939 }, { "epoch": 0.3831133854026394, "grad_norm": 0.7123153967912388, "learning_rate": 9.121908496531527e-06, "loss": 0.3802008867263794, "num_input_tokens_seen": 249035424, "step": 5690, "train_runtime": 44040.1743, "train_tokens_per_second": 5654.733 }, { "epoch": 0.38345004039859953, "grad_norm": 0.7190654994858774, "learning_rate": 9.120411279104971e-06, "loss": 0.3904706954956055, "num_input_tokens_seen": 249254456, "step": 5695, "train_runtime": 44083.466, "train_tokens_per_second": 5654.148 }, { "epoch": 0.3837866953945597, "grad_norm": 0.9187897813904784, "learning_rate": 9.118912909418538e-06, "loss": 0.39504170417785645, "num_input_tokens_seen": 249477272, "step": 5700, "train_runtime": 44127.086, "train_tokens_per_second": 5653.609 }, { "epoch": 0.3841233503905198, "grad_norm": 0.7651587963325609, "learning_rate": 9.117413387891246e-06, "loss": 0.4095571041107178, "num_input_tokens_seen": 249693520, "step": 5705, "train_runtime": 44170.6884, "train_tokens_per_second": 5652.923 }, { "epoch": 0.38446000538647995, "grad_norm": 0.7879046146044965, "learning_rate": 9.11591271494243e-06, "loss": 0.39027183055877684, "num_input_tokens_seen": 249909984, "step": 5710, "train_runtime": 44209.3015, "train_tokens_per_second": 5652.882 }, { "epoch": 0.3847966603824401, "grad_norm": 0.7861690179999627, "learning_rate": 9.114410890991748e-06, "loss": 0.40212602615356446, "num_input_tokens_seen": 250124664, "step": 5715, "train_runtime": 44250.9806, "train_tokens_per_second": 5652.41 }, { "epoch": 0.38513331537840023, "grad_norm": 0.7798159280525913, "learning_rate": 9.112907916459177e-06, "loss": 0.37251665592193606, "num_input_tokens_seen": 250317264, "step": 5720, "train_runtime": 44293.6615, "train_tokens_per_second": 5651.311 }, { "epoch": 0.38546997037436037, "grad_norm": 0.7886435715633883, "learning_rate": 9.111403791765025e-06, "loss": 0.38798794746398924, "num_input_tokens_seen": 250544576, "step": 5725, "train_runtime": 44329.9756, "train_tokens_per_second": 5651.809 }, { "epoch": 0.3858066253703205, "grad_norm": 0.7210916045331931, "learning_rate": 9.109898517329914e-06, "loss": 0.3711621046066284, "num_input_tokens_seen": 250774080, "step": 5730, "train_runtime": 44362.0555, "train_tokens_per_second": 5652.896 }, { "epoch": 0.38614328036628065, "grad_norm": 0.757278528605975, "learning_rate": 9.108392093574785e-06, "loss": 0.3934319972991943, "num_input_tokens_seen": 250992112, "step": 5735, "train_runtime": 44396.0233, "train_tokens_per_second": 5653.482 }, { "epoch": 0.3864799353622408, "grad_norm": 0.7725316475525575, "learning_rate": 9.10688452092091e-06, "loss": 0.36261420249938964, "num_input_tokens_seen": 251210912, "step": 5740, "train_runtime": 44426.4194, "train_tokens_per_second": 5654.539 }, { "epoch": 0.38681659035820093, "grad_norm": 0.8668597404685281, "learning_rate": 9.105375799789874e-06, "loss": 0.39951817989349364, "num_input_tokens_seen": 251426584, "step": 5745, "train_runtime": 44475.8422, "train_tokens_per_second": 5653.105 }, { "epoch": 0.38715324535416107, "grad_norm": 0.8168129882131703, "learning_rate": 9.103865930603586e-06, "loss": 0.3850820064544678, "num_input_tokens_seen": 251633720, "step": 5750, "train_runtime": 44516.691, "train_tokens_per_second": 5652.57 }, { "epoch": 0.3874899003501212, "grad_norm": 0.7659015613854286, "learning_rate": 9.102354913784279e-06, "loss": 0.3853774070739746, "num_input_tokens_seen": 251855296, "step": 5755, "train_runtime": 44559.5986, "train_tokens_per_second": 5652.1 }, { "epoch": 0.38782655534608135, "grad_norm": 0.7966891158323898, "learning_rate": 9.100842749754499e-06, "loss": 0.3578346252441406, "num_input_tokens_seen": 252080400, "step": 5760, "train_runtime": 44605.3404, "train_tokens_per_second": 5651.35 }, { "epoch": 0.3881632103420415, "grad_norm": 1.3427031718401212, "learning_rate": 9.099329438937122e-06, "loss": 0.40854997634887696, "num_input_tokens_seen": 252296312, "step": 5765, "train_runtime": 44649.458, "train_tokens_per_second": 5650.602 }, { "epoch": 0.3884998653380016, "grad_norm": 0.6230050104908084, "learning_rate": 9.09781498175534e-06, "loss": 0.3587602138519287, "num_input_tokens_seen": 252509656, "step": 5770, "train_runtime": 44685.4879, "train_tokens_per_second": 5650.82 }, { "epoch": 0.38883652033396177, "grad_norm": 0.6750080511665485, "learning_rate": 9.096299378632666e-06, "loss": 0.37611684799194334, "num_input_tokens_seen": 252740072, "step": 5775, "train_runtime": 44727.054, "train_tokens_per_second": 5650.72 }, { "epoch": 0.3891731753299219, "grad_norm": 0.7734243231158888, "learning_rate": 9.09478262999293e-06, "loss": 0.4280585289001465, "num_input_tokens_seen": 252973392, "step": 5780, "train_runtime": 44771.0866, "train_tokens_per_second": 5650.374 }, { "epoch": 0.38950983032588204, "grad_norm": 0.8173587277273618, "learning_rate": 9.09326473626029e-06, "loss": 0.38141813278198244, "num_input_tokens_seen": 253184320, "step": 5785, "train_runtime": 44809.6538, "train_tokens_per_second": 5650.218 }, { "epoch": 0.3898464853218422, "grad_norm": 0.7487752402423106, "learning_rate": 9.091745697859218e-06, "loss": 0.41326370239257815, "num_input_tokens_seen": 253411776, "step": 5790, "train_runtime": 44845.5045, "train_tokens_per_second": 5650.773 }, { "epoch": 0.3901831403178023, "grad_norm": 0.8197406274404395, "learning_rate": 9.090225515214512e-06, "loss": 0.4117950439453125, "num_input_tokens_seen": 253627512, "step": 5795, "train_runtime": 44885.8047, "train_tokens_per_second": 5650.506 }, { "epoch": 0.39051979531376246, "grad_norm": 0.8857575262398083, "learning_rate": 9.088704188751281e-06, "loss": 0.4129201889038086, "num_input_tokens_seen": 253840400, "step": 5800, "train_runtime": 44924.1283, "train_tokens_per_second": 5650.425 }, { "epoch": 0.3908564503097226, "grad_norm": 0.85730454063038, "learning_rate": 9.087181718894963e-06, "loss": 0.39529869556427, "num_input_tokens_seen": 254064096, "step": 5805, "train_runtime": 44968.4154, "train_tokens_per_second": 5649.834 }, { "epoch": 0.39119310530568274, "grad_norm": 0.7118238052198951, "learning_rate": 9.085658106071309e-06, "loss": 0.39313058853149413, "num_input_tokens_seen": 254281632, "step": 5810, "train_runtime": 45005.0615, "train_tokens_per_second": 5650.067 }, { "epoch": 0.3915297603016429, "grad_norm": 0.7349746949660144, "learning_rate": 9.084133350706394e-06, "loss": 0.3712653398513794, "num_input_tokens_seen": 254493944, "step": 5815, "train_runtime": 45042.1578, "train_tokens_per_second": 5650.128 }, { "epoch": 0.391866415297603, "grad_norm": 0.7166943198737387, "learning_rate": 9.082607453226613e-06, "loss": 0.38478312492370603, "num_input_tokens_seen": 254715712, "step": 5820, "train_runtime": 45077.3472, "train_tokens_per_second": 5650.637 }, { "epoch": 0.39220307029356316, "grad_norm": 0.7543487043231831, "learning_rate": 9.081080414058674e-06, "loss": 0.3994553565979004, "num_input_tokens_seen": 254927592, "step": 5825, "train_runtime": 45113.9999, "train_tokens_per_second": 5650.742 }, { "epoch": 0.3925397252895233, "grad_norm": 0.7896679447300116, "learning_rate": 9.079552233629612e-06, "loss": 0.3710631847381592, "num_input_tokens_seen": 255138464, "step": 5830, "train_runtime": 45152.0089, "train_tokens_per_second": 5650.656 }, { "epoch": 0.39287638028548344, "grad_norm": 0.815361722369787, "learning_rate": 9.078022912366776e-06, "loss": 0.3914163827896118, "num_input_tokens_seen": 255367048, "step": 5835, "train_runtime": 45192.1775, "train_tokens_per_second": 5650.691 }, { "epoch": 0.3932130352814436, "grad_norm": 0.8005773109782048, "learning_rate": 9.076492450697835e-06, "loss": 0.40029544830322267, "num_input_tokens_seen": 255598184, "step": 5840, "train_runtime": 45232.9765, "train_tokens_per_second": 5650.704 }, { "epoch": 0.3935496902774037, "grad_norm": 0.849726633762188, "learning_rate": 9.074960849050782e-06, "loss": 0.3852508068084717, "num_input_tokens_seen": 255819944, "step": 5845, "train_runtime": 45272.8634, "train_tokens_per_second": 5650.624 }, { "epoch": 0.39388634527336386, "grad_norm": 0.7762826196998844, "learning_rate": 9.07342810785392e-06, "loss": 0.37957100868225097, "num_input_tokens_seen": 256019616, "step": 5850, "train_runtime": 45311.4802, "train_tokens_per_second": 5650.215 }, { "epoch": 0.394223000269324, "grad_norm": 0.7731972533551551, "learning_rate": 9.071894227535878e-06, "loss": 0.38977823257446287, "num_input_tokens_seen": 256237256, "step": 5855, "train_runtime": 45352.5452, "train_tokens_per_second": 5649.898 }, { "epoch": 0.39455965526528414, "grad_norm": 0.8423525268519388, "learning_rate": 9.070359208525598e-06, "loss": 0.406312084197998, "num_input_tokens_seen": 256464368, "step": 5860, "train_runtime": 45388.423, "train_tokens_per_second": 5650.436 }, { "epoch": 0.3948963102612443, "grad_norm": 0.8527879610056384, "learning_rate": 9.068823051252346e-06, "loss": 0.3981436491012573, "num_input_tokens_seen": 256688032, "step": 5865, "train_runtime": 45429.2415, "train_tokens_per_second": 5650.282 }, { "epoch": 0.3952329652572044, "grad_norm": 0.8385538303650153, "learning_rate": 9.067285756145702e-06, "loss": 0.3921481132507324, "num_input_tokens_seen": 256917840, "step": 5870, "train_runtime": 45462.4848, "train_tokens_per_second": 5651.205 }, { "epoch": 0.39556962025316456, "grad_norm": 0.8390456887457934, "learning_rate": 9.065747323635565e-06, "loss": 0.3327157020568848, "num_input_tokens_seen": 257101736, "step": 5875, "train_runtime": 45501.4164, "train_tokens_per_second": 5650.412 }, { "epoch": 0.3959062752491247, "grad_norm": 0.7851013810213687, "learning_rate": 9.064207754152154e-06, "loss": 0.3997276782989502, "num_input_tokens_seen": 257317696, "step": 5880, "train_runtime": 45545.2236, "train_tokens_per_second": 5649.719 }, { "epoch": 0.39624293024508483, "grad_norm": 0.7365128564544189, "learning_rate": 9.062667048126005e-06, "loss": 0.3864887714385986, "num_input_tokens_seen": 257547392, "step": 5885, "train_runtime": 45589.9837, "train_tokens_per_second": 5649.21 }, { "epoch": 0.396579585241045, "grad_norm": 0.8935927015959244, "learning_rate": 9.061125205987971e-06, "loss": 0.4157553672790527, "num_input_tokens_seen": 257761408, "step": 5890, "train_runtime": 45630.8437, "train_tokens_per_second": 5648.842 }, { "epoch": 0.3969162402370051, "grad_norm": 0.7876564044642139, "learning_rate": 9.059582228169222e-06, "loss": 0.37337889671325686, "num_input_tokens_seen": 257963800, "step": 5895, "train_runtime": 45664.7, "train_tokens_per_second": 5649.086 }, { "epoch": 0.39725289523296525, "grad_norm": 0.7288959690931758, "learning_rate": 9.058038115101248e-06, "loss": 0.4037358283996582, "num_input_tokens_seen": 258195648, "step": 5900, "train_runtime": 45702.5616, "train_tokens_per_second": 5649.479 }, { "epoch": 0.3975895502289254, "grad_norm": 0.7904683688779008, "learning_rate": 9.056492867215857e-06, "loss": 0.3476010084152222, "num_input_tokens_seen": 258400784, "step": 5905, "train_runtime": 45748.63, "train_tokens_per_second": 5648.274 }, { "epoch": 0.39792620522488553, "grad_norm": 0.6759275337501953, "learning_rate": 9.05494648494517e-06, "loss": 0.3933530330657959, "num_input_tokens_seen": 258606968, "step": 5910, "train_runtime": 45786.7698, "train_tokens_per_second": 5648.072 }, { "epoch": 0.39826286022084567, "grad_norm": 0.6825204404349337, "learning_rate": 9.053398968721629e-06, "loss": 0.37357821464538576, "num_input_tokens_seen": 258832840, "step": 5915, "train_runtime": 45827.0425, "train_tokens_per_second": 5648.037 }, { "epoch": 0.3985995152168058, "grad_norm": 0.7549266235464368, "learning_rate": 9.05185031897799e-06, "loss": 0.4264666080474854, "num_input_tokens_seen": 259049920, "step": 5920, "train_runtime": 45860.4564, "train_tokens_per_second": 5648.656 }, { "epoch": 0.39893617021276595, "grad_norm": 0.8046151442540065, "learning_rate": 9.050300536147331e-06, "loss": 0.42224712371826173, "num_input_tokens_seen": 259285872, "step": 5925, "train_runtime": 45898.8286, "train_tokens_per_second": 5649.074 }, { "epoch": 0.3992728252087261, "grad_norm": 0.8013279899857307, "learning_rate": 9.048749620663044e-06, "loss": 0.36397323608398435, "num_input_tokens_seen": 259520536, "step": 5930, "train_runtime": 45935.2903, "train_tokens_per_second": 5649.698 }, { "epoch": 0.39960948020468623, "grad_norm": 0.7188029194424288, "learning_rate": 9.047197572958834e-06, "loss": 0.37349615097045896, "num_input_tokens_seen": 259742248, "step": 5935, "train_runtime": 45973.4138, "train_tokens_per_second": 5649.836 }, { "epoch": 0.39994613520064637, "grad_norm": 0.8120677037958034, "learning_rate": 9.04564439346873e-06, "loss": 0.3917673110961914, "num_input_tokens_seen": 259952080, "step": 5940, "train_runtime": 46008.964, "train_tokens_per_second": 5650.031 }, { "epoch": 0.4002827901966065, "grad_norm": 0.8737926960149425, "learning_rate": 9.044090082627071e-06, "loss": 0.39895708560943605, "num_input_tokens_seen": 260160320, "step": 5945, "train_runtime": 46045.9436, "train_tokens_per_second": 5650.016 }, { "epoch": 0.40061944519256665, "grad_norm": 0.7302283729471113, "learning_rate": 9.042534640868514e-06, "loss": 0.4021873950958252, "num_input_tokens_seen": 260368008, "step": 5950, "train_runtime": 46081.9071, "train_tokens_per_second": 5650.114 }, { "epoch": 0.4009561001885268, "grad_norm": 0.749168823407156, "learning_rate": 9.04097806862804e-06, "loss": 0.40214033126831056, "num_input_tokens_seen": 260592824, "step": 5955, "train_runtime": 46117.1368, "train_tokens_per_second": 5650.672 }, { "epoch": 0.4012927551844869, "grad_norm": 0.723288812952783, "learning_rate": 9.03942036634093e-06, "loss": 0.4055626392364502, "num_input_tokens_seen": 260810288, "step": 5960, "train_runtime": 46156.4921, "train_tokens_per_second": 5650.566 }, { "epoch": 0.40162941018044707, "grad_norm": 0.7518699289987396, "learning_rate": 9.037861534442797e-06, "loss": 0.3734895706176758, "num_input_tokens_seen": 261038312, "step": 5965, "train_runtime": 46198.2126, "train_tokens_per_second": 5650.399 }, { "epoch": 0.4019660651764072, "grad_norm": 1.0026827049870985, "learning_rate": 9.036301573369563e-06, "loss": 0.40189208984375, "num_input_tokens_seen": 261266152, "step": 5970, "train_runtime": 46239.4807, "train_tokens_per_second": 5650.283 }, { "epoch": 0.40230272017236735, "grad_norm": 0.8605436747902855, "learning_rate": 9.034740483557465e-06, "loss": 0.3900024175643921, "num_input_tokens_seen": 261483152, "step": 5975, "train_runtime": 46274.8434, "train_tokens_per_second": 5650.655 }, { "epoch": 0.4026393751683275, "grad_norm": 0.7213971067668634, "learning_rate": 9.033178265443055e-06, "loss": 0.38559999465942385, "num_input_tokens_seen": 261703416, "step": 5980, "train_runtime": 46306.9931, "train_tokens_per_second": 5651.488 }, { "epoch": 0.4029760301642876, "grad_norm": 0.7467717729146578, "learning_rate": 9.031614919463206e-06, "loss": 0.3772167682647705, "num_input_tokens_seen": 261926896, "step": 5985, "train_runtime": 46342.877, "train_tokens_per_second": 5651.934 }, { "epoch": 0.40331268516024776, "grad_norm": 0.8052956550974576, "learning_rate": 9.030050446055099e-06, "loss": 0.3684276342391968, "num_input_tokens_seen": 262143080, "step": 5990, "train_runtime": 46380.2479, "train_tokens_per_second": 5652.041 }, { "epoch": 0.4036493401562079, "grad_norm": 0.6725874955047775, "learning_rate": 9.028484845656235e-06, "loss": 0.3965585231781006, "num_input_tokens_seen": 262378952, "step": 5995, "train_runtime": 46413.7998, "train_tokens_per_second": 5653.038 }, { "epoch": 0.40398599515216804, "grad_norm": 0.8065835959924061, "learning_rate": 9.026918118704431e-06, "loss": 0.42124166488647463, "num_input_tokens_seen": 262599696, "step": 6000, "train_runtime": 46454.2053, "train_tokens_per_second": 5652.872 }, { "epoch": 0.4043226501481282, "grad_norm": 0.6374762319564959, "learning_rate": 9.025350265637816e-06, "loss": 0.3700655221939087, "num_input_tokens_seen": 262830992, "step": 6005, "train_runtime": 46490.7965, "train_tokens_per_second": 5653.398 }, { "epoch": 0.4046593051440883, "grad_norm": 0.7573194160968504, "learning_rate": 9.023781286894834e-06, "loss": 0.38486456871032715, "num_input_tokens_seen": 263044288, "step": 6010, "train_runtime": 46526.3581, "train_tokens_per_second": 5653.662 }, { "epoch": 0.40499596014004846, "grad_norm": 0.8562717514351039, "learning_rate": 9.022211182914247e-06, "loss": 0.3843253135681152, "num_input_tokens_seen": 263264800, "step": 6015, "train_runtime": 46564.9415, "train_tokens_per_second": 5653.713 }, { "epoch": 0.4053326151360086, "grad_norm": 0.7322028797978756, "learning_rate": 9.020639954135128e-06, "loss": 0.3804231405258179, "num_input_tokens_seen": 263476880, "step": 6020, "train_runtime": 46608.1754, "train_tokens_per_second": 5653.019 }, { "epoch": 0.40566927013196874, "grad_norm": 0.7924756161102612, "learning_rate": 9.019067600996867e-06, "loss": 0.32609758377075193, "num_input_tokens_seen": 263676440, "step": 6025, "train_runtime": 46647.9449, "train_tokens_per_second": 5652.477 }, { "epoch": 0.4060059251279289, "grad_norm": 0.7406207884260587, "learning_rate": 9.017494123939169e-06, "loss": 0.3878431558609009, "num_input_tokens_seen": 263891832, "step": 6030, "train_runtime": 46686.4579, "train_tokens_per_second": 5652.428 }, { "epoch": 0.406342580123889, "grad_norm": 0.6859816815928503, "learning_rate": 9.015919523402048e-06, "loss": 0.38746066093444825, "num_input_tokens_seen": 264108024, "step": 6035, "train_runtime": 46723.9959, "train_tokens_per_second": 5652.514 }, { "epoch": 0.40667923511984916, "grad_norm": 1.0398516753802722, "learning_rate": 9.014343799825838e-06, "loss": 0.3903219699859619, "num_input_tokens_seen": 264311560, "step": 6040, "train_runtime": 46758.4333, "train_tokens_per_second": 5652.704 }, { "epoch": 0.4070158901158093, "grad_norm": 0.6954397754211817, "learning_rate": 9.012766953651186e-06, "loss": 0.42699203491210935, "num_input_tokens_seen": 264536928, "step": 6045, "train_runtime": 46800.6106, "train_tokens_per_second": 5652.425 }, { "epoch": 0.40735254511176944, "grad_norm": 0.6848650266078808, "learning_rate": 9.01118898531905e-06, "loss": 0.4040683746337891, "num_input_tokens_seen": 264744560, "step": 6050, "train_runtime": 46841.7035, "train_tokens_per_second": 5651.899 }, { "epoch": 0.4076892001077296, "grad_norm": 0.7157357093690987, "learning_rate": 9.009609895270708e-06, "loss": 0.3655755043029785, "num_input_tokens_seen": 264973096, "step": 6055, "train_runtime": 46881.3659, "train_tokens_per_second": 5651.992 }, { "epoch": 0.4080258551036897, "grad_norm": 0.8098322622781278, "learning_rate": 9.008029683947743e-06, "loss": 0.42575840950012206, "num_input_tokens_seen": 265197544, "step": 6060, "train_runtime": 46917.7458, "train_tokens_per_second": 5652.393 }, { "epoch": 0.40836251009964986, "grad_norm": 0.7104130729995994, "learning_rate": 9.006448351792057e-06, "loss": 0.3974879741668701, "num_input_tokens_seen": 265418944, "step": 6065, "train_runtime": 46962.89, "train_tokens_per_second": 5651.674 }, { "epoch": 0.40869916509561, "grad_norm": 0.6632525596263023, "learning_rate": 9.004865899245864e-06, "loss": 0.38395133018493655, "num_input_tokens_seen": 265636776, "step": 6070, "train_runtime": 46999.967, "train_tokens_per_second": 5651.85 }, { "epoch": 0.40903582009157013, "grad_norm": 0.7043912136666165, "learning_rate": 9.003282326751694e-06, "loss": 0.4008152961730957, "num_input_tokens_seen": 265857800, "step": 6075, "train_runtime": 47039.3368, "train_tokens_per_second": 5651.819 }, { "epoch": 0.4093724750875303, "grad_norm": 0.9655541200247993, "learning_rate": 9.001697634752387e-06, "loss": 0.40933728218078613, "num_input_tokens_seen": 266070448, "step": 6080, "train_runtime": 47074.6096, "train_tokens_per_second": 5652.101 }, { "epoch": 0.4097091300834904, "grad_norm": 0.683185307022826, "learning_rate": 9.000111823691097e-06, "loss": 0.37639498710632324, "num_input_tokens_seen": 266291816, "step": 6085, "train_runtime": 47112.3669, "train_tokens_per_second": 5652.27 }, { "epoch": 0.41004578507945055, "grad_norm": 0.8219233379550768, "learning_rate": 8.99852489401129e-06, "loss": 0.40433249473571775, "num_input_tokens_seen": 266517904, "step": 6090, "train_runtime": 47148.2501, "train_tokens_per_second": 5652.763 }, { "epoch": 0.4103824400754107, "grad_norm": 0.7423675573693415, "learning_rate": 8.996936846156748e-06, "loss": 0.3635870456695557, "num_input_tokens_seen": 266736992, "step": 6095, "train_runtime": 47183.3361, "train_tokens_per_second": 5653.203 }, { "epoch": 0.41071909507137083, "grad_norm": 0.8008363109798308, "learning_rate": 8.995347680571563e-06, "loss": 0.41033496856689455, "num_input_tokens_seen": 266959272, "step": 6100, "train_runtime": 47217.625, "train_tokens_per_second": 5653.806 }, { "epoch": 0.41105575006733097, "grad_norm": 0.6633014625775752, "learning_rate": 8.993757397700137e-06, "loss": 0.38593282699584963, "num_input_tokens_seen": 267178696, "step": 6105, "train_runtime": 47254.1693, "train_tokens_per_second": 5654.077 }, { "epoch": 0.41139240506329117, "grad_norm": 0.7915805562051228, "learning_rate": 8.99216599798719e-06, "loss": 0.42214293479919435, "num_input_tokens_seen": 267415152, "step": 6110, "train_runtime": 47290.6934, "train_tokens_per_second": 5654.71 }, { "epoch": 0.4117290600592513, "grad_norm": 0.7917765167657784, "learning_rate": 8.990573481877753e-06, "loss": 0.3639373779296875, "num_input_tokens_seen": 267618552, "step": 6115, "train_runtime": 47325.6204, "train_tokens_per_second": 5654.835 }, { "epoch": 0.41206571505521145, "grad_norm": 0.694124505400035, "learning_rate": 8.988979849817167e-06, "loss": 0.36659536361694334, "num_input_tokens_seen": 267814904, "step": 6120, "train_runtime": 47366.4119, "train_tokens_per_second": 5654.11 }, { "epoch": 0.4124023700511716, "grad_norm": 0.8642974554518021, "learning_rate": 8.987385102251085e-06, "loss": 0.3810924291610718, "num_input_tokens_seen": 268015432, "step": 6125, "train_runtime": 47405.0635, "train_tokens_per_second": 5653.73 }, { "epoch": 0.4127390250471317, "grad_norm": 0.7416982400357927, "learning_rate": 8.985789239625475e-06, "loss": 0.3897581100463867, "num_input_tokens_seen": 268235696, "step": 6130, "train_runtime": 47449.5896, "train_tokens_per_second": 5653.067 }, { "epoch": 0.41307568004309186, "grad_norm": 0.7586989342588731, "learning_rate": 8.984192262386613e-06, "loss": 0.36377105712890623, "num_input_tokens_seen": 268454176, "step": 6135, "train_runtime": 47483.2101, "train_tokens_per_second": 5653.665 }, { "epoch": 0.413412335039052, "grad_norm": 0.7553176125857815, "learning_rate": 8.98259417098109e-06, "loss": 0.3994285583496094, "num_input_tokens_seen": 268685424, "step": 6140, "train_runtime": 47523.5954, "train_tokens_per_second": 5653.727 }, { "epoch": 0.41374899003501214, "grad_norm": 0.7619380388493862, "learning_rate": 8.980994965855808e-06, "loss": 0.39436161518096924, "num_input_tokens_seen": 268906160, "step": 6145, "train_runtime": 47557.2625, "train_tokens_per_second": 5654.366 }, { "epoch": 0.4140856450309723, "grad_norm": 0.7194190068295008, "learning_rate": 8.979394647457976e-06, "loss": 0.3927819490432739, "num_input_tokens_seen": 269128016, "step": 6150, "train_runtime": 47600.5297, "train_tokens_per_second": 5653.887 }, { "epoch": 0.4144223000269324, "grad_norm": 0.741178107175373, "learning_rate": 8.97779321623512e-06, "loss": 0.35940072536468504, "num_input_tokens_seen": 269333048, "step": 6155, "train_runtime": 47638.7497, "train_tokens_per_second": 5653.655 }, { "epoch": 0.41475895502289256, "grad_norm": 0.7334172734354966, "learning_rate": 8.976190672635077e-06, "loss": 0.400145435333252, "num_input_tokens_seen": 269557248, "step": 6160, "train_runtime": 47679.304, "train_tokens_per_second": 5653.548 }, { "epoch": 0.4150956100188527, "grad_norm": 0.7612088304227586, "learning_rate": 8.974587017105991e-06, "loss": 0.41222319602966306, "num_input_tokens_seen": 269768408, "step": 6165, "train_runtime": 47713.1048, "train_tokens_per_second": 5653.969 }, { "epoch": 0.41543226501481284, "grad_norm": 0.7344591815245108, "learning_rate": 8.97298225009632e-06, "loss": 0.3931986570358276, "num_input_tokens_seen": 269990368, "step": 6170, "train_runtime": 47754.3241, "train_tokens_per_second": 5653.737 }, { "epoch": 0.415768920010773, "grad_norm": 0.7575071698285096, "learning_rate": 8.971376372054829e-06, "loss": 0.3943799495697021, "num_input_tokens_seen": 270208056, "step": 6175, "train_runtime": 47794.7334, "train_tokens_per_second": 5653.511 }, { "epoch": 0.4161055750067331, "grad_norm": 0.6823047182780082, "learning_rate": 8.969769383430602e-06, "loss": 0.3858570337295532, "num_input_tokens_seen": 270432152, "step": 6180, "train_runtime": 47829.7321, "train_tokens_per_second": 5654.06 }, { "epoch": 0.41644223000269326, "grad_norm": 0.7476934311068052, "learning_rate": 8.968161284673027e-06, "loss": 0.37152729034423826, "num_input_tokens_seen": 270661216, "step": 6185, "train_runtime": 47868.2088, "train_tokens_per_second": 5654.3 }, { "epoch": 0.4167788849986534, "grad_norm": 0.7528325409155248, "learning_rate": 8.9665520762318e-06, "loss": 0.37863969802856445, "num_input_tokens_seen": 270875256, "step": 6190, "train_runtime": 47904.4792, "train_tokens_per_second": 5654.487 }, { "epoch": 0.41711553999461354, "grad_norm": 0.7282239751820792, "learning_rate": 8.964941758556934e-06, "loss": 0.3976884126663208, "num_input_tokens_seen": 271088288, "step": 6195, "train_runtime": 47948.7488, "train_tokens_per_second": 5653.709 }, { "epoch": 0.4174521949905737, "grad_norm": 0.755222562109598, "learning_rate": 8.963330332098747e-06, "loss": 0.3814378261566162, "num_input_tokens_seen": 271296528, "step": 6200, "train_runtime": 47985.6256, "train_tokens_per_second": 5653.704 }, { "epoch": 0.4177888499865338, "grad_norm": 0.7830273045211564, "learning_rate": 8.961717797307872e-06, "loss": 0.37258970737457275, "num_input_tokens_seen": 271515568, "step": 6205, "train_runtime": 48019.4934, "train_tokens_per_second": 5654.278 }, { "epoch": 0.41812550498249396, "grad_norm": 0.7683395292659414, "learning_rate": 8.960104154635248e-06, "loss": 0.4039943695068359, "num_input_tokens_seen": 271733704, "step": 6210, "train_runtime": 48057.6768, "train_tokens_per_second": 5654.325 }, { "epoch": 0.4184621599784541, "grad_norm": 0.7964266950242961, "learning_rate": 8.958489404532125e-06, "loss": 0.4006314277648926, "num_input_tokens_seen": 271941040, "step": 6215, "train_runtime": 48094.9785, "train_tokens_per_second": 5654.25 }, { "epoch": 0.41879881497441424, "grad_norm": 0.7229961706218653, "learning_rate": 8.956873547450062e-06, "loss": 0.3996126651763916, "num_input_tokens_seen": 272155560, "step": 6220, "train_runtime": 48135.1561, "train_tokens_per_second": 5653.987 }, { "epoch": 0.4191354699703744, "grad_norm": 0.8692942989729212, "learning_rate": 8.95525658384093e-06, "loss": 0.4290035247802734, "num_input_tokens_seen": 272369192, "step": 6225, "train_runtime": 48171.8576, "train_tokens_per_second": 5654.114 }, { "epoch": 0.4194721249663345, "grad_norm": 0.7600990815023999, "learning_rate": 8.953638514156908e-06, "loss": 0.3810266494750977, "num_input_tokens_seen": 272591248, "step": 6230, "train_runtime": 48208.9238, "train_tokens_per_second": 5654.373 }, { "epoch": 0.41980877996229465, "grad_norm": 0.7355727181513495, "learning_rate": 8.952019338850481e-06, "loss": 0.3950758695602417, "num_input_tokens_seen": 272810616, "step": 6235, "train_runtime": 48248.4869, "train_tokens_per_second": 5654.283 }, { "epoch": 0.4201454349582548, "grad_norm": 0.7644200111226909, "learning_rate": 8.950399058374447e-06, "loss": 0.377358603477478, "num_input_tokens_seen": 273036976, "step": 6240, "train_runtime": 48285.7901, "train_tokens_per_second": 5654.603 }, { "epoch": 0.42048208995421493, "grad_norm": 0.7918087336685585, "learning_rate": 8.948777673181913e-06, "loss": 0.389499831199646, "num_input_tokens_seen": 273260832, "step": 6245, "train_runtime": 48322.4015, "train_tokens_per_second": 5654.951 }, { "epoch": 0.42081874495017507, "grad_norm": 0.7765030452628453, "learning_rate": 8.947155183726296e-06, "loss": 0.35937402248382566, "num_input_tokens_seen": 273488360, "step": 6250, "train_runtime": 48361.4271, "train_tokens_per_second": 5655.093 }, { "epoch": 0.4211553999461352, "grad_norm": 0.7014097499994082, "learning_rate": 8.94553159046132e-06, "loss": 0.3715068817138672, "num_input_tokens_seen": 273707472, "step": 6255, "train_runtime": 48401.1614, "train_tokens_per_second": 5654.977 }, { "epoch": 0.42149205494209535, "grad_norm": 0.6408398788945804, "learning_rate": 8.943906893841015e-06, "loss": 0.36748714447021485, "num_input_tokens_seen": 273928544, "step": 6260, "train_runtime": 48433.3616, "train_tokens_per_second": 5655.782 }, { "epoch": 0.4218287099380555, "grad_norm": 0.754509294899034, "learning_rate": 8.942281094319721e-06, "loss": 0.4157464027404785, "num_input_tokens_seen": 274141592, "step": 6265, "train_runtime": 48468.7848, "train_tokens_per_second": 5656.044 }, { "epoch": 0.42216536493401563, "grad_norm": 0.7840590763768849, "learning_rate": 8.940654192352092e-06, "loss": 0.40111403465270995, "num_input_tokens_seen": 274349792, "step": 6270, "train_runtime": 48510.3168, "train_tokens_per_second": 5655.494 }, { "epoch": 0.42250201992997577, "grad_norm": 0.8213882192132025, "learning_rate": 8.939026188393083e-06, "loss": 0.3853888034820557, "num_input_tokens_seen": 274569104, "step": 6275, "train_runtime": 48556.531, "train_tokens_per_second": 5654.628 }, { "epoch": 0.4228386749259359, "grad_norm": 0.8791839426260795, "learning_rate": 8.937397082897963e-06, "loss": 0.40306596755981444, "num_input_tokens_seen": 274796616, "step": 6280, "train_runtime": 48596.7026, "train_tokens_per_second": 5654.635 }, { "epoch": 0.42317532992189605, "grad_norm": 0.7843983011163462, "learning_rate": 8.935766876322303e-06, "loss": 0.4140591621398926, "num_input_tokens_seen": 275015624, "step": 6285, "train_runtime": 48635.2618, "train_tokens_per_second": 5654.655 }, { "epoch": 0.4235119849178562, "grad_norm": 0.7007974546940894, "learning_rate": 8.934135569121985e-06, "loss": 0.3959988832473755, "num_input_tokens_seen": 275242840, "step": 6290, "train_runtime": 48673.0052, "train_tokens_per_second": 5654.938 }, { "epoch": 0.4238486399138163, "grad_norm": 0.7078146309363205, "learning_rate": 8.932503161753202e-06, "loss": 0.38456072807312014, "num_input_tokens_seen": 275462504, "step": 6295, "train_runtime": 48709.4026, "train_tokens_per_second": 5655.222 }, { "epoch": 0.42418529490977647, "grad_norm": 1.0351275568049705, "learning_rate": 8.930869654672449e-06, "loss": 0.38416409492492676, "num_input_tokens_seen": 275681808, "step": 6300, "train_runtime": 48747.6893, "train_tokens_per_second": 5655.279 }, { "epoch": 0.4245219499057366, "grad_norm": 0.8236989821133165, "learning_rate": 8.929235048336531e-06, "loss": 0.37823896408081054, "num_input_tokens_seen": 275903576, "step": 6305, "train_runtime": 48788.5888, "train_tokens_per_second": 5655.084 }, { "epoch": 0.42485860490169675, "grad_norm": 0.8519274837856372, "learning_rate": 8.927599343202563e-06, "loss": 0.4197996139526367, "num_input_tokens_seen": 276132792, "step": 6310, "train_runtime": 48821.7451, "train_tokens_per_second": 5655.939 }, { "epoch": 0.4251952598976569, "grad_norm": 0.7601906981584227, "learning_rate": 8.92596253972796e-06, "loss": 0.39647321701049804, "num_input_tokens_seen": 276373576, "step": 6315, "train_runtime": 48856.0141, "train_tokens_per_second": 5656.9 }, { "epoch": 0.425531914893617, "grad_norm": 0.7436129276391935, "learning_rate": 8.924324638370454e-06, "loss": 0.4159084320068359, "num_input_tokens_seen": 276601344, "step": 6320, "train_runtime": 48892.2285, "train_tokens_per_second": 5657.368 }, { "epoch": 0.42586856988957716, "grad_norm": 0.619825666948129, "learning_rate": 8.922685639588076e-06, "loss": 0.3394161701202393, "num_input_tokens_seen": 276801216, "step": 6325, "train_runtime": 48929.4586, "train_tokens_per_second": 5657.149 }, { "epoch": 0.4262052248855373, "grad_norm": 0.7566990752584487, "learning_rate": 8.921045543839167e-06, "loss": 0.412354850769043, "num_input_tokens_seen": 277025984, "step": 6330, "train_runtime": 48964.4429, "train_tokens_per_second": 5657.697 }, { "epoch": 0.42654187988149744, "grad_norm": 0.7706529692481164, "learning_rate": 8.919404351582376e-06, "loss": 0.37722196578979494, "num_input_tokens_seen": 277234256, "step": 6335, "train_runtime": 49000.4277, "train_tokens_per_second": 5657.793 }, { "epoch": 0.4268785348774576, "grad_norm": 0.7056105235159689, "learning_rate": 8.917762063276657e-06, "loss": 0.38721909523010256, "num_input_tokens_seen": 277448936, "step": 6340, "train_runtime": 49039.3589, "train_tokens_per_second": 5657.679 }, { "epoch": 0.4272151898734177, "grad_norm": 0.7187047540510013, "learning_rate": 8.916118679381268e-06, "loss": 0.3728447198867798, "num_input_tokens_seen": 277667920, "step": 6345, "train_runtime": 49076.9224, "train_tokens_per_second": 5657.81 }, { "epoch": 0.42755184486937786, "grad_norm": 0.8958354766388671, "learning_rate": 8.914474200355777e-06, "loss": 0.39159350395202636, "num_input_tokens_seen": 277885288, "step": 6350, "train_runtime": 49121.5781, "train_tokens_per_second": 5657.092 }, { "epoch": 0.427888499865338, "grad_norm": 0.8411282788940809, "learning_rate": 8.912828626660059e-06, "loss": 0.4010343074798584, "num_input_tokens_seen": 278112192, "step": 6355, "train_runtime": 49161.2354, "train_tokens_per_second": 5657.144 }, { "epoch": 0.42822515486129814, "grad_norm": 0.7895834565221768, "learning_rate": 8.911181958754294e-06, "loss": 0.4207916259765625, "num_input_tokens_seen": 278332088, "step": 6360, "train_runtime": 49198.4506, "train_tokens_per_second": 5657.334 }, { "epoch": 0.4285618098572583, "grad_norm": 0.6974429090218124, "learning_rate": 8.909534197098966e-06, "loss": 0.4089661121368408, "num_input_tokens_seen": 278560320, "step": 6365, "train_runtime": 49240.3447, "train_tokens_per_second": 5657.156 }, { "epoch": 0.4288984648532184, "grad_norm": 0.7879065723514492, "learning_rate": 8.907885342154865e-06, "loss": 0.3871757507324219, "num_input_tokens_seen": 278780408, "step": 6370, "train_runtime": 49273.5524, "train_tokens_per_second": 5657.81 }, { "epoch": 0.42923511984917856, "grad_norm": 0.809098238394157, "learning_rate": 8.906235394383089e-06, "loss": 0.3723259925842285, "num_input_tokens_seen": 278977576, "step": 6375, "train_runtime": 49314.5399, "train_tokens_per_second": 5657.106 }, { "epoch": 0.4295717748451387, "grad_norm": 0.7788656469697295, "learning_rate": 8.904584354245042e-06, "loss": 0.38217949867248535, "num_input_tokens_seen": 279198056, "step": 6380, "train_runtime": 49349.1158, "train_tokens_per_second": 5657.61 }, { "epoch": 0.42990842984109884, "grad_norm": 0.7480156005511179, "learning_rate": 8.902932222202433e-06, "loss": 0.39810030460357665, "num_input_tokens_seen": 279431128, "step": 6385, "train_runtime": 49390.7865, "train_tokens_per_second": 5657.556 }, { "epoch": 0.430245084837059, "grad_norm": 0.7111926102410158, "learning_rate": 8.901278998717272e-06, "loss": 0.37800168991088867, "num_input_tokens_seen": 279655568, "step": 6390, "train_runtime": 49420.9322, "train_tokens_per_second": 5658.646 }, { "epoch": 0.4305817398330191, "grad_norm": 0.8127379256774018, "learning_rate": 8.899624684251878e-06, "loss": 0.38466432094573977, "num_input_tokens_seen": 279872920, "step": 6395, "train_runtime": 49461.0295, "train_tokens_per_second": 5658.453 }, { "epoch": 0.43091839482897926, "grad_norm": 0.7440397221517976, "learning_rate": 8.897969279268877e-06, "loss": 0.37961535453796386, "num_input_tokens_seen": 280093688, "step": 6400, "train_runtime": 49494.6401, "train_tokens_per_second": 5659.071 }, { "epoch": 0.4312550498249394, "grad_norm": 0.7095617451331785, "learning_rate": 8.896312784231196e-06, "loss": 0.3712193012237549, "num_input_tokens_seen": 280305104, "step": 6405, "train_runtime": 49529.3102, "train_tokens_per_second": 5659.378 }, { "epoch": 0.43159170482089954, "grad_norm": 0.8249055107614544, "learning_rate": 8.89465519960207e-06, "loss": 0.42307000160217284, "num_input_tokens_seen": 280534896, "step": 6410, "train_runtime": 49562.7367, "train_tokens_per_second": 5660.198 }, { "epoch": 0.4319283598168597, "grad_norm": 0.7044078667504021, "learning_rate": 8.892996525845037e-06, "loss": 0.39340283870697024, "num_input_tokens_seen": 280760536, "step": 6415, "train_runtime": 49609.124, "train_tokens_per_second": 5659.454 }, { "epoch": 0.4322650148128198, "grad_norm": 0.8758617954616612, "learning_rate": 8.89133676342394e-06, "loss": 0.4034512996673584, "num_input_tokens_seen": 280959600, "step": 6420, "train_runtime": 49647.7511, "train_tokens_per_second": 5659.06 }, { "epoch": 0.43260166980877995, "grad_norm": 0.7612824097484856, "learning_rate": 8.889675912802923e-06, "loss": 0.38754520416259763, "num_input_tokens_seen": 281173760, "step": 6425, "train_runtime": 49684.4958, "train_tokens_per_second": 5659.185 }, { "epoch": 0.4329383248047401, "grad_norm": 0.8243557630186539, "learning_rate": 8.888013974446443e-06, "loss": 0.4189424514770508, "num_input_tokens_seen": 281395808, "step": 6430, "train_runtime": 49725.5827, "train_tokens_per_second": 5658.975 }, { "epoch": 0.43327497980070023, "grad_norm": 0.8439524750777101, "learning_rate": 8.886350948819253e-06, "loss": 0.38129727840423583, "num_input_tokens_seen": 281606072, "step": 6435, "train_runtime": 49758.4427, "train_tokens_per_second": 5659.463 }, { "epoch": 0.4336116347966604, "grad_norm": 0.8007298009088516, "learning_rate": 8.884686836386412e-06, "loss": 0.38291594982147215, "num_input_tokens_seen": 281822424, "step": 6440, "train_runtime": 49799.792, "train_tokens_per_second": 5659.108 }, { "epoch": 0.4339482897926205, "grad_norm": 0.7881388654599728, "learning_rate": 8.883021637613286e-06, "loss": 0.4050453662872314, "num_input_tokens_seen": 282049648, "step": 6445, "train_runtime": 49835.0256, "train_tokens_per_second": 5659.667 }, { "epoch": 0.43428494478858065, "grad_norm": 0.6887341883009596, "learning_rate": 8.881355352965537e-06, "loss": 0.38397510051727296, "num_input_tokens_seen": 282264512, "step": 6450, "train_runtime": 49867.6041, "train_tokens_per_second": 5660.278 }, { "epoch": 0.4346215997845408, "grad_norm": 0.672101432469643, "learning_rate": 8.879687982909145e-06, "loss": 0.3574419736862183, "num_input_tokens_seen": 282465912, "step": 6455, "train_runtime": 49905.6117, "train_tokens_per_second": 5660.003 }, { "epoch": 0.43495825478050093, "grad_norm": 0.8916903644937464, "learning_rate": 8.878019527910378e-06, "loss": 0.41092991828918457, "num_input_tokens_seen": 282670240, "step": 6460, "train_runtime": 49945.0146, "train_tokens_per_second": 5659.629 }, { "epoch": 0.43529490977646107, "grad_norm": 0.8298316229675538, "learning_rate": 8.876349988435815e-06, "loss": 0.44412593841552733, "num_input_tokens_seen": 282887856, "step": 6465, "train_runtime": 49983.0629, "train_tokens_per_second": 5659.674 }, { "epoch": 0.4356315647724212, "grad_norm": 0.6431274180779993, "learning_rate": 8.874679364952339e-06, "loss": 0.38706722259521487, "num_input_tokens_seen": 283127040, "step": 6470, "train_runtime": 50021.3951, "train_tokens_per_second": 5660.119 }, { "epoch": 0.43596821976838135, "grad_norm": 0.7656387607672229, "learning_rate": 8.873007657927135e-06, "loss": 0.3893885135650635, "num_input_tokens_seen": 283357232, "step": 6475, "train_runtime": 50062.5333, "train_tokens_per_second": 5660.066 }, { "epoch": 0.4363048747643415, "grad_norm": 0.7096570879969786, "learning_rate": 8.87133486782769e-06, "loss": 0.35058715343475344, "num_input_tokens_seen": 283558232, "step": 6480, "train_runtime": 50096.5148, "train_tokens_per_second": 5660.239 }, { "epoch": 0.4366415297603016, "grad_norm": 0.8761505694419173, "learning_rate": 8.869660995121792e-06, "loss": 0.3999923229217529, "num_input_tokens_seen": 283777800, "step": 6485, "train_runtime": 50131.8591, "train_tokens_per_second": 5660.628 }, { "epoch": 0.43697818475626177, "grad_norm": 0.7555798070151492, "learning_rate": 8.867986040277537e-06, "loss": 0.4016421318054199, "num_input_tokens_seen": 283985824, "step": 6490, "train_runtime": 50172.9, "train_tokens_per_second": 5660.144 }, { "epoch": 0.4373148397522219, "grad_norm": 0.7001554230524034, "learning_rate": 8.86631000376332e-06, "loss": 0.4068891525268555, "num_input_tokens_seen": 284193496, "step": 6495, "train_runtime": 50210.1755, "train_tokens_per_second": 5660.078 }, { "epoch": 0.43765149474818205, "grad_norm": 0.809001796546686, "learning_rate": 8.864632886047841e-06, "loss": 0.3719168186187744, "num_input_tokens_seen": 284406672, "step": 6500, "train_runtime": 50246.2209, "train_tokens_per_second": 5660.26 }, { "epoch": 0.4379881497441422, "grad_norm": 0.8525357252115519, "learning_rate": 8.862954687600097e-06, "loss": 0.4161073684692383, "num_input_tokens_seen": 284620064, "step": 6505, "train_runtime": 50283.9357, "train_tokens_per_second": 5660.258 }, { "epoch": 0.4383248047401023, "grad_norm": 0.818348330515836, "learning_rate": 8.861275408889393e-06, "loss": 0.4044035911560059, "num_input_tokens_seen": 284827680, "step": 6510, "train_runtime": 50319.756, "train_tokens_per_second": 5660.355 }, { "epoch": 0.43866145973606246, "grad_norm": 0.8194841529764723, "learning_rate": 8.859595050385332e-06, "loss": 0.40093269348144533, "num_input_tokens_seen": 285050288, "step": 6515, "train_runtime": 50356.7378, "train_tokens_per_second": 5660.619 }, { "epoch": 0.4389981147320226, "grad_norm": 0.7603950111901223, "learning_rate": 8.857913612557825e-06, "loss": 0.39177913665771485, "num_input_tokens_seen": 285275776, "step": 6520, "train_runtime": 50399.864, "train_tokens_per_second": 5660.249 }, { "epoch": 0.43933476972798274, "grad_norm": 0.9171110192985658, "learning_rate": 8.856231095877077e-06, "loss": 0.37299246788024903, "num_input_tokens_seen": 285483840, "step": 6525, "train_runtime": 50437.6759, "train_tokens_per_second": 5660.131 }, { "epoch": 0.4396714247239429, "grad_norm": 0.6722265713323919, "learning_rate": 8.8545475008136e-06, "loss": 0.3728148937225342, "num_input_tokens_seen": 285708616, "step": 6530, "train_runtime": 50478.218, "train_tokens_per_second": 5660.038 }, { "epoch": 0.440008079719903, "grad_norm": 0.8225035496811262, "learning_rate": 8.852862827838207e-06, "loss": 0.37645254135131834, "num_input_tokens_seen": 285914952, "step": 6535, "train_runtime": 50513.9654, "train_tokens_per_second": 5660.117 }, { "epoch": 0.44034473471586316, "grad_norm": 0.672139181444301, "learning_rate": 8.851177077422008e-06, "loss": 0.4013407230377197, "num_input_tokens_seen": 286146336, "step": 6540, "train_runtime": 50553.4611, "train_tokens_per_second": 5660.272 }, { "epoch": 0.4406813897118233, "grad_norm": 0.7644327948595142, "learning_rate": 8.849490250036421e-06, "loss": 0.4249086380004883, "num_input_tokens_seen": 286362088, "step": 6545, "train_runtime": 50590.1862, "train_tokens_per_second": 5660.428 }, { "epoch": 0.44101804470778344, "grad_norm": 0.8087430911202192, "learning_rate": 8.847802346153159e-06, "loss": 0.3778714895248413, "num_input_tokens_seen": 286576504, "step": 6550, "train_runtime": 50623.1732, "train_tokens_per_second": 5660.975 }, { "epoch": 0.4413546997037436, "grad_norm": 0.822277412759685, "learning_rate": 8.846113366244241e-06, "loss": 0.40006532669067385, "num_input_tokens_seen": 286802512, "step": 6555, "train_runtime": 50653.7568, "train_tokens_per_second": 5662.019 }, { "epoch": 0.4416913546997037, "grad_norm": 0.7788883116407057, "learning_rate": 8.844423310781986e-06, "loss": 0.3659277677536011, "num_input_tokens_seen": 287019968, "step": 6560, "train_runtime": 50693.4968, "train_tokens_per_second": 5661.87 }, { "epoch": 0.44202800969566386, "grad_norm": 0.8189856612851919, "learning_rate": 8.842732180239011e-06, "loss": 0.417068338394165, "num_input_tokens_seen": 287233880, "step": 6565, "train_runtime": 50732.9626, "train_tokens_per_second": 5661.682 }, { "epoch": 0.442364664691624, "grad_norm": 0.7955988955008321, "learning_rate": 8.841039975088234e-06, "loss": 0.37861127853393556, "num_input_tokens_seen": 287450920, "step": 6570, "train_runtime": 50770.9895, "train_tokens_per_second": 5661.716 }, { "epoch": 0.44270131968758414, "grad_norm": 0.7673850184930923, "learning_rate": 8.839346695802878e-06, "loss": 0.44512476921081545, "num_input_tokens_seen": 287680008, "step": 6575, "train_runtime": 50808.7713, "train_tokens_per_second": 5662.015 }, { "epoch": 0.4430379746835443, "grad_norm": 0.707236454889657, "learning_rate": 8.837652342856459e-06, "loss": 0.4026740550994873, "num_input_tokens_seen": 287904440, "step": 6580, "train_runtime": 50842.5258, "train_tokens_per_second": 5662.67 }, { "epoch": 0.4433746296795044, "grad_norm": 0.7131491003211293, "learning_rate": 8.835956916722803e-06, "loss": 0.37171001434326173, "num_input_tokens_seen": 288123072, "step": 6585, "train_runtime": 50884.3886, "train_tokens_per_second": 5662.308 }, { "epoch": 0.44371128467546456, "grad_norm": 0.7279859643678576, "learning_rate": 8.834260417876024e-06, "loss": 0.39625725746154783, "num_input_tokens_seen": 288337792, "step": 6590, "train_runtime": 50922.6708, "train_tokens_per_second": 5662.268 }, { "epoch": 0.4440479396714247, "grad_norm": 0.6822187993121582, "learning_rate": 8.832562846790549e-06, "loss": 0.4032885074615479, "num_input_tokens_seen": 288562504, "step": 6595, "train_runtime": 50958.16, "train_tokens_per_second": 5662.734 }, { "epoch": 0.4443845946673849, "grad_norm": 0.7696796062355198, "learning_rate": 8.830864203941092e-06, "loss": 0.4127056121826172, "num_input_tokens_seen": 288783304, "step": 6600, "train_runtime": 50994.9294, "train_tokens_per_second": 5662.981 }, { "epoch": 0.44472124966334503, "grad_norm": 0.796046357490389, "learning_rate": 8.829164489802677e-06, "loss": 0.37214198112487795, "num_input_tokens_seen": 288995032, "step": 6605, "train_runtime": 51030.6262, "train_tokens_per_second": 5663.168 }, { "epoch": 0.44505790465930517, "grad_norm": 0.8194054840462127, "learning_rate": 8.827463704850622e-06, "loss": 0.3779730796813965, "num_input_tokens_seen": 289211784, "step": 6610, "train_runtime": 51065.1791, "train_tokens_per_second": 5663.581 }, { "epoch": 0.4453945596552653, "grad_norm": 0.853917923414557, "learning_rate": 8.825761849560547e-06, "loss": 0.3779446125030518, "num_input_tokens_seen": 289426496, "step": 6615, "train_runtime": 51104.5336, "train_tokens_per_second": 5663.421 }, { "epoch": 0.44573121465122545, "grad_norm": 0.8243805829529494, "learning_rate": 8.824058924408371e-06, "loss": 0.3913204431533813, "num_input_tokens_seen": 289642104, "step": 6620, "train_runtime": 51148.3439, "train_tokens_per_second": 5662.786 }, { "epoch": 0.4460678696471856, "grad_norm": 0.6977791985037581, "learning_rate": 8.822354929870311e-06, "loss": 0.3713568687438965, "num_input_tokens_seen": 289855080, "step": 6625, "train_runtime": 51186.4829, "train_tokens_per_second": 5662.727 }, { "epoch": 0.44640452464314573, "grad_norm": 0.6544439461875585, "learning_rate": 8.820649866422884e-06, "loss": 0.3891900539398193, "num_input_tokens_seen": 290080272, "step": 6630, "train_runtime": 51221.0131, "train_tokens_per_second": 5663.306 }, { "epoch": 0.44674117963910587, "grad_norm": 0.7628155627258327, "learning_rate": 8.818943734542905e-06, "loss": 0.38543388843536375, "num_input_tokens_seen": 290310296, "step": 6635, "train_runtime": 51260.636, "train_tokens_per_second": 5663.416 }, { "epoch": 0.447077834635066, "grad_norm": 0.7154748015782274, "learning_rate": 8.817236534707486e-06, "loss": 0.38082070350646974, "num_input_tokens_seen": 290530408, "step": 6640, "train_runtime": 51298.209, "train_tokens_per_second": 5663.559 }, { "epoch": 0.44741448963102615, "grad_norm": 0.719435209044012, "learning_rate": 8.815528267394045e-06, "loss": 0.38055622577667236, "num_input_tokens_seen": 290752096, "step": 6645, "train_runtime": 51339.4277, "train_tokens_per_second": 5663.33 }, { "epoch": 0.4477511446269863, "grad_norm": 0.8130810621777962, "learning_rate": 8.81381893308029e-06, "loss": 0.42238750457763674, "num_input_tokens_seen": 290976696, "step": 6650, "train_runtime": 51376.6803, "train_tokens_per_second": 5663.595 }, { "epoch": 0.4480877996229464, "grad_norm": 0.6802969800260558, "learning_rate": 8.81210853224423e-06, "loss": 0.397933292388916, "num_input_tokens_seen": 291195128, "step": 6655, "train_runtime": 51416.0644, "train_tokens_per_second": 5663.505 }, { "epoch": 0.44842445461890656, "grad_norm": 0.7683337052075077, "learning_rate": 8.810397065364177e-06, "loss": 0.3660165309906006, "num_input_tokens_seen": 291397432, "step": 6660, "train_runtime": 51460.1895, "train_tokens_per_second": 5662.58 }, { "epoch": 0.4487611096148667, "grad_norm": 0.7385595517387719, "learning_rate": 8.808684532918735e-06, "loss": 0.4035042762756348, "num_input_tokens_seen": 291611984, "step": 6665, "train_runtime": 51497.2825, "train_tokens_per_second": 5662.667 }, { "epoch": 0.44909776461082684, "grad_norm": 0.8670076691450054, "learning_rate": 8.806970935386807e-06, "loss": 0.37046058177948, "num_input_tokens_seen": 291817952, "step": 6670, "train_runtime": 51539.7964, "train_tokens_per_second": 5661.993 }, { "epoch": 0.449434419606787, "grad_norm": 0.845351499495225, "learning_rate": 8.805256273247597e-06, "loss": 0.3828955411911011, "num_input_tokens_seen": 292030296, "step": 6675, "train_runtime": 51585.7162, "train_tokens_per_second": 5661.069 }, { "epoch": 0.4497710746027471, "grad_norm": 0.7558486825710268, "learning_rate": 8.803540546980605e-06, "loss": 0.3911006450653076, "num_input_tokens_seen": 292240392, "step": 6680, "train_runtime": 51625.5292, "train_tokens_per_second": 5660.773 }, { "epoch": 0.45010772959870726, "grad_norm": 0.7143473072799023, "learning_rate": 8.801823757065628e-06, "loss": 0.39244418144226073, "num_input_tokens_seen": 292456784, "step": 6685, "train_runtime": 51661.3439, "train_tokens_per_second": 5661.037 }, { "epoch": 0.4504443845946674, "grad_norm": 0.7046306873714272, "learning_rate": 8.800105903982758e-06, "loss": 0.37194869518280027, "num_input_tokens_seen": 292669672, "step": 6690, "train_runtime": 51695.7982, "train_tokens_per_second": 5661.382 }, { "epoch": 0.45078103959062754, "grad_norm": 0.9038260012464076, "learning_rate": 8.798386988212393e-06, "loss": 0.36289196014404296, "num_input_tokens_seen": 292866896, "step": 6695, "train_runtime": 51737.8021, "train_tokens_per_second": 5660.598 }, { "epoch": 0.4511176945865877, "grad_norm": 0.7097725989673881, "learning_rate": 8.796667010235216e-06, "loss": 0.4039313793182373, "num_input_tokens_seen": 293088104, "step": 6700, "train_runtime": 51775.0194, "train_tokens_per_second": 5660.801 }, { "epoch": 0.4514543495825478, "grad_norm": 0.6983233354591538, "learning_rate": 8.794945970532219e-06, "loss": 0.38548543453216555, "num_input_tokens_seen": 293312720, "step": 6705, "train_runtime": 51819.136, "train_tokens_per_second": 5660.317 }, { "epoch": 0.45179100457850796, "grad_norm": 0.7715442099717464, "learning_rate": 8.79322386958468e-06, "loss": 0.42191410064697266, "num_input_tokens_seen": 293540040, "step": 6710, "train_runtime": 51850.4773, "train_tokens_per_second": 5661.279 }, { "epoch": 0.4521276595744681, "grad_norm": 0.8667322084375894, "learning_rate": 8.791500707874183e-06, "loss": 0.3590597152709961, "num_input_tokens_seen": 293753504, "step": 6715, "train_runtime": 51887.9851, "train_tokens_per_second": 5661.301 }, { "epoch": 0.45246431457042824, "grad_norm": 0.7001275719009605, "learning_rate": 8.789776485882601e-06, "loss": 0.40479679107666017, "num_input_tokens_seen": 293980328, "step": 6720, "train_runtime": 51930.6229, "train_tokens_per_second": 5661.021 }, { "epoch": 0.4528009695663884, "grad_norm": 0.7486619231659534, "learning_rate": 8.788051204092112e-06, "loss": 0.380597448348999, "num_input_tokens_seen": 294201288, "step": 6725, "train_runtime": 51969.1487, "train_tokens_per_second": 5661.076 }, { "epoch": 0.4531376245623485, "grad_norm": 0.837803412390275, "learning_rate": 8.786324862985183e-06, "loss": 0.39116497039794923, "num_input_tokens_seen": 294414792, "step": 6730, "train_runtime": 52007.4528, "train_tokens_per_second": 5661.012 }, { "epoch": 0.45347427955830866, "grad_norm": 0.7989569302827977, "learning_rate": 8.78459746304458e-06, "loss": 0.37044734954833985, "num_input_tokens_seen": 294593136, "step": 6735, "train_runtime": 52048.2566, "train_tokens_per_second": 5660.0 }, { "epoch": 0.4538109345542688, "grad_norm": 0.7910699073925987, "learning_rate": 8.782869004753363e-06, "loss": 0.40142025947570803, "num_input_tokens_seen": 294808392, "step": 6740, "train_runtime": 52084.1003, "train_tokens_per_second": 5660.238 }, { "epoch": 0.45414758955022894, "grad_norm": 0.7578062648097129, "learning_rate": 8.781139488594892e-06, "loss": 0.39638261795043944, "num_input_tokens_seen": 295032712, "step": 6745, "train_runtime": 52116.6196, "train_tokens_per_second": 5661.01 }, { "epoch": 0.4544842445461891, "grad_norm": 0.7479401557774803, "learning_rate": 8.779408915052821e-06, "loss": 0.3619338274002075, "num_input_tokens_seen": 295250848, "step": 6750, "train_runtime": 52158.5344, "train_tokens_per_second": 5660.643 }, { "epoch": 0.4548208995421492, "grad_norm": 0.7929634941210536, "learning_rate": 8.777677284611096e-06, "loss": 0.36865906715393065, "num_input_tokens_seen": 295444808, "step": 6755, "train_runtime": 52194.881, "train_tokens_per_second": 5660.417 }, { "epoch": 0.45515755453810935, "grad_norm": 0.7977612087147963, "learning_rate": 8.775944597753969e-06, "loss": 0.3817254304885864, "num_input_tokens_seen": 295651640, "step": 6760, "train_runtime": 52235.5188, "train_tokens_per_second": 5659.973 }, { "epoch": 0.4554942095340695, "grad_norm": 0.7276333392461809, "learning_rate": 8.774210854965972e-06, "loss": 0.4110917568206787, "num_input_tokens_seen": 295872600, "step": 6765, "train_runtime": 52282.5363, "train_tokens_per_second": 5659.11 }, { "epoch": 0.45583086453002963, "grad_norm": 0.7743347789370404, "learning_rate": 8.772476056731946e-06, "loss": 0.3540276050567627, "num_input_tokens_seen": 296100760, "step": 6770, "train_runtime": 52321.5826, "train_tokens_per_second": 5659.247 }, { "epoch": 0.4561675195259898, "grad_norm": 0.8417565391365261, "learning_rate": 8.77074020353702e-06, "loss": 0.37112271785736084, "num_input_tokens_seen": 296310112, "step": 6775, "train_runtime": 52364.5089, "train_tokens_per_second": 5658.606 }, { "epoch": 0.4565041745219499, "grad_norm": 0.8971045549426276, "learning_rate": 8.76900329586662e-06, "loss": 0.416597318649292, "num_input_tokens_seen": 296529072, "step": 6780, "train_runtime": 52408.4219, "train_tokens_per_second": 5658.042 }, { "epoch": 0.45684082951791005, "grad_norm": 0.7289171592528997, "learning_rate": 8.767265334206467e-06, "loss": 0.38317620754241943, "num_input_tokens_seen": 296750896, "step": 6785, "train_runtime": 52453.3014, "train_tokens_per_second": 5657.43 }, { "epoch": 0.4571774845138702, "grad_norm": 0.742990584892427, "learning_rate": 8.765526319042577e-06, "loss": 0.38066811561584474, "num_input_tokens_seen": 296973576, "step": 6790, "train_runtime": 52484.833, "train_tokens_per_second": 5658.274 }, { "epoch": 0.45751413950983033, "grad_norm": 0.7941387596625845, "learning_rate": 8.763786250861258e-06, "loss": 0.35711822509765623, "num_input_tokens_seen": 297198488, "step": 6795, "train_runtime": 52525.9579, "train_tokens_per_second": 5658.126 }, { "epoch": 0.45785079450579047, "grad_norm": 0.7637071617244607, "learning_rate": 8.762045130149114e-06, "loss": 0.37547504901885986, "num_input_tokens_seen": 297424408, "step": 6800, "train_runtime": 52568.1627, "train_tokens_per_second": 5657.881 }, { "epoch": 0.4581874495017506, "grad_norm": 0.7114371063573226, "learning_rate": 8.76030295739305e-06, "loss": 0.391666579246521, "num_input_tokens_seen": 297652664, "step": 6805, "train_runtime": 52605.904, "train_tokens_per_second": 5658.161 }, { "epoch": 0.45852410449771075, "grad_norm": 0.7263315072433297, "learning_rate": 8.758559733080252e-06, "loss": 0.4111741065979004, "num_input_tokens_seen": 297874936, "step": 6810, "train_runtime": 52637.0942, "train_tokens_per_second": 5659.031 }, { "epoch": 0.4588607594936709, "grad_norm": 0.7359316103796298, "learning_rate": 8.75681545769821e-06, "loss": 0.38690164089202883, "num_input_tokens_seen": 298107584, "step": 6815, "train_runtime": 52669.678, "train_tokens_per_second": 5659.947 }, { "epoch": 0.45919741448963103, "grad_norm": 0.8032263081480874, "learning_rate": 8.755070131734706e-06, "loss": 0.3867367744445801, "num_input_tokens_seen": 298320208, "step": 6820, "train_runtime": 52707.8474, "train_tokens_per_second": 5659.882 }, { "epoch": 0.45953406948559117, "grad_norm": 0.7833333891541101, "learning_rate": 8.753323755677812e-06, "loss": 0.4013802528381348, "num_input_tokens_seen": 298533552, "step": 6825, "train_runtime": 52749.6034, "train_tokens_per_second": 5659.446 }, { "epoch": 0.4598707244815513, "grad_norm": 0.7609318114113853, "learning_rate": 8.7515763300159e-06, "loss": 0.3463205575942993, "num_input_tokens_seen": 298746696, "step": 6830, "train_runtime": 52789.3591, "train_tokens_per_second": 5659.222 }, { "epoch": 0.46020737947751145, "grad_norm": 0.6930204184723102, "learning_rate": 8.74982785523763e-06, "loss": 0.40210418701171874, "num_input_tokens_seen": 298972384, "step": 6835, "train_runtime": 52827.2223, "train_tokens_per_second": 5659.438 }, { "epoch": 0.4605440344734716, "grad_norm": 0.7026299121313064, "learning_rate": 8.748078331831957e-06, "loss": 0.3934351682662964, "num_input_tokens_seen": 299200112, "step": 6840, "train_runtime": 52862.9542, "train_tokens_per_second": 5659.92 }, { "epoch": 0.4608806894694317, "grad_norm": 0.7019416941915204, "learning_rate": 8.746327760288129e-06, "loss": 0.3836989164352417, "num_input_tokens_seen": 299437024, "step": 6845, "train_runtime": 52894.4779, "train_tokens_per_second": 5661.026 }, { "epoch": 0.46121734446539187, "grad_norm": 0.8234006493355744, "learning_rate": 8.744576141095691e-06, "loss": 0.39553108215332033, "num_input_tokens_seen": 299641752, "step": 6850, "train_runtime": 52932.8412, "train_tokens_per_second": 5660.791 }, { "epoch": 0.461553999461352, "grad_norm": 0.846531534553998, "learning_rate": 8.742823474744476e-06, "loss": 0.39920735359191895, "num_input_tokens_seen": 299852504, "step": 6855, "train_runtime": 52970.3403, "train_tokens_per_second": 5660.762 }, { "epoch": 0.46189065445731214, "grad_norm": 0.7339872597188516, "learning_rate": 8.74106976172461e-06, "loss": 0.40232462882995607, "num_input_tokens_seen": 300073192, "step": 6860, "train_runtime": 53013.6318, "train_tokens_per_second": 5660.302 }, { "epoch": 0.4622273094532723, "grad_norm": 0.8137834490765111, "learning_rate": 8.739315002526513e-06, "loss": 0.40238103866577146, "num_input_tokens_seen": 300287552, "step": 6865, "train_runtime": 53055.019, "train_tokens_per_second": 5659.927 }, { "epoch": 0.4625639644492324, "grad_norm": 0.7042015061046794, "learning_rate": 8.737559197640902e-06, "loss": 0.3717548131942749, "num_input_tokens_seen": 300496376, "step": 6870, "train_runtime": 53091.6564, "train_tokens_per_second": 5659.955 }, { "epoch": 0.46290061944519256, "grad_norm": 0.7325334644495457, "learning_rate": 8.735802347558778e-06, "loss": 0.4027840614318848, "num_input_tokens_seen": 300709416, "step": 6875, "train_runtime": 53135.1809, "train_tokens_per_second": 5659.328 }, { "epoch": 0.4632372744411527, "grad_norm": 0.7655214239764673, "learning_rate": 8.734044452771442e-06, "loss": 0.38804852962493896, "num_input_tokens_seen": 300918752, "step": 6880, "train_runtime": 53179.1079, "train_tokens_per_second": 5658.59 }, { "epoch": 0.46357392943711284, "grad_norm": 0.8904799503928702, "learning_rate": 8.73228551377048e-06, "loss": 0.40845584869384766, "num_input_tokens_seen": 301139720, "step": 6885, "train_runtime": 53208.9509, "train_tokens_per_second": 5659.569 }, { "epoch": 0.463910584433073, "grad_norm": 0.6748289632604044, "learning_rate": 8.730525531047776e-06, "loss": 0.4137433052062988, "num_input_tokens_seen": 301362752, "step": 6890, "train_runtime": 53254.1898, "train_tokens_per_second": 5658.949 }, { "epoch": 0.4642472394290331, "grad_norm": 0.7035224245591345, "learning_rate": 8.728764505095503e-06, "loss": 0.4120682716369629, "num_input_tokens_seen": 301587944, "step": 6895, "train_runtime": 53291.4984, "train_tokens_per_second": 5659.213 }, { "epoch": 0.46458389442499326, "grad_norm": 0.6435345300249111, "learning_rate": 8.727002436406126e-06, "loss": 0.3724491834640503, "num_input_tokens_seen": 301823392, "step": 6900, "train_runtime": 53331.8202, "train_tokens_per_second": 5659.349 }, { "epoch": 0.4649205494209534, "grad_norm": 0.7100192481355228, "learning_rate": 8.725239325472404e-06, "loss": 0.4057363510131836, "num_input_tokens_seen": 302046392, "step": 6905, "train_runtime": 53370.503, "train_tokens_per_second": 5659.426 }, { "epoch": 0.46525720441691354, "grad_norm": 0.7998034880411997, "learning_rate": 8.723475172787381e-06, "loss": 0.3984755277633667, "num_input_tokens_seen": 302270848, "step": 6910, "train_runtime": 53413.2206, "train_tokens_per_second": 5659.102 }, { "epoch": 0.4655938594128737, "grad_norm": 0.9282661770223051, "learning_rate": 8.7217099788444e-06, "loss": 0.38761351108551023, "num_input_tokens_seen": 302484424, "step": 6915, "train_runtime": 53452.6504, "train_tokens_per_second": 5658.923 }, { "epoch": 0.4659305144088338, "grad_norm": 0.6829252086088465, "learning_rate": 8.719943744137091e-06, "loss": 0.3843079566955566, "num_input_tokens_seen": 302706608, "step": 6920, "train_runtime": 53494.2752, "train_tokens_per_second": 5658.673 }, { "epoch": 0.46626716940479396, "grad_norm": 0.7370197158639645, "learning_rate": 8.718176469159378e-06, "loss": 0.40040907859802244, "num_input_tokens_seen": 302946080, "step": 6925, "train_runtime": 53527.8006, "train_tokens_per_second": 5659.603 }, { "epoch": 0.4666038244007541, "grad_norm": 0.7744303086322805, "learning_rate": 8.716408154405469e-06, "loss": 0.370440411567688, "num_input_tokens_seen": 303172472, "step": 6930, "train_runtime": 53558.5862, "train_tokens_per_second": 5660.576 }, { "epoch": 0.46694047939671424, "grad_norm": 0.9149869901290688, "learning_rate": 8.714638800369872e-06, "loss": 0.4163699150085449, "num_input_tokens_seen": 303374536, "step": 6935, "train_runtime": 53596.9127, "train_tokens_per_second": 5660.299 }, { "epoch": 0.4672771343926744, "grad_norm": 0.6478644031670531, "learning_rate": 8.712868407547378e-06, "loss": 0.41262283325195315, "num_input_tokens_seen": 303604704, "step": 6940, "train_runtime": 53634.4097, "train_tokens_per_second": 5660.633 }, { "epoch": 0.4676137893886345, "grad_norm": 0.8540394960614904, "learning_rate": 8.711096976433076e-06, "loss": 0.40007991790771485, "num_input_tokens_seen": 303830584, "step": 6945, "train_runtime": 53675.8336, "train_tokens_per_second": 5660.473 }, { "epoch": 0.46795044438459465, "grad_norm": 0.6854573080771246, "learning_rate": 8.709324507522337e-06, "loss": 0.3609914779663086, "num_input_tokens_seen": 304051832, "step": 6950, "train_runtime": 53710.0276, "train_tokens_per_second": 5660.988 }, { "epoch": 0.4682870993805548, "grad_norm": 0.74529061138361, "learning_rate": 8.707551001310828e-06, "loss": 0.3842365264892578, "num_input_tokens_seen": 304279352, "step": 6955, "train_runtime": 53749.8544, "train_tokens_per_second": 5661.027 }, { "epoch": 0.46862375437651493, "grad_norm": 0.7026982064246363, "learning_rate": 8.705776458294503e-06, "loss": 0.387627911567688, "num_input_tokens_seen": 304487200, "step": 6960, "train_runtime": 53785.1129, "train_tokens_per_second": 5661.18 }, { "epoch": 0.4689604093724751, "grad_norm": 0.7214247021583069, "learning_rate": 8.704000878969608e-06, "loss": 0.37026023864746094, "num_input_tokens_seen": 304693840, "step": 6965, "train_runtime": 53822.9634, "train_tokens_per_second": 5661.038 }, { "epoch": 0.4692970643684352, "grad_norm": 0.6979359178232242, "learning_rate": 8.702224263832679e-06, "loss": 0.3628101825714111, "num_input_tokens_seen": 304921392, "step": 6970, "train_runtime": 53861.4766, "train_tokens_per_second": 5661.215 }, { "epoch": 0.46963371936439535, "grad_norm": 0.7813572135644429, "learning_rate": 8.700446613380542e-06, "loss": 0.4275547504425049, "num_input_tokens_seen": 305149136, "step": 6975, "train_runtime": 53899.1275, "train_tokens_per_second": 5661.486 }, { "epoch": 0.4699703743603555, "grad_norm": 0.800833875206026, "learning_rate": 8.698667928110307e-06, "loss": 0.373789119720459, "num_input_tokens_seen": 305369336, "step": 6980, "train_runtime": 53936.8451, "train_tokens_per_second": 5661.609 }, { "epoch": 0.47030702935631563, "grad_norm": 0.8980829202572613, "learning_rate": 8.696888208519381e-06, "loss": 0.3973226070404053, "num_input_tokens_seen": 305581504, "step": 6985, "train_runtime": 53973.4435, "train_tokens_per_second": 5661.701 }, { "epoch": 0.47064368435227577, "grad_norm": 0.7351189903914839, "learning_rate": 8.695107455105454e-06, "loss": 0.34683785438537595, "num_input_tokens_seen": 305790632, "step": 6990, "train_runtime": 54006.1459, "train_tokens_per_second": 5662.145 }, { "epoch": 0.4709803393482359, "grad_norm": 0.7928821233878864, "learning_rate": 8.693325668366513e-06, "loss": 0.39075660705566406, "num_input_tokens_seen": 306004232, "step": 6995, "train_runtime": 54042.3536, "train_tokens_per_second": 5662.304 }, { "epoch": 0.47131699434419605, "grad_norm": 0.8527776847132168, "learning_rate": 8.691542848800825e-06, "loss": 0.39600386619567873, "num_input_tokens_seen": 306212208, "step": 7000, "train_runtime": 54084.5742, "train_tokens_per_second": 5661.729 }, { "epoch": 0.4716536493401562, "grad_norm": 0.8808374134194763, "learning_rate": 8.68975899690695e-06, "loss": 0.38110928535461425, "num_input_tokens_seen": 306437744, "step": 7005, "train_runtime": 54125.0428, "train_tokens_per_second": 5661.663 }, { "epoch": 0.47199030433611633, "grad_norm": 0.7423709319863485, "learning_rate": 8.687974113183738e-06, "loss": 0.37776660919189453, "num_input_tokens_seen": 306667400, "step": 7010, "train_runtime": 54160.5555, "train_tokens_per_second": 5662.191 }, { "epoch": 0.47232695933207647, "grad_norm": 0.8031207862343954, "learning_rate": 8.686188198130326e-06, "loss": 0.3893289089202881, "num_input_tokens_seen": 306891232, "step": 7015, "train_runtime": 54195.218, "train_tokens_per_second": 5662.699 }, { "epoch": 0.4726636143280366, "grad_norm": 0.716418279114708, "learning_rate": 8.684401252246138e-06, "loss": 0.3991250038146973, "num_input_tokens_seen": 307116336, "step": 7020, "train_runtime": 54233.7853, "train_tokens_per_second": 5662.823 }, { "epoch": 0.47300026932399675, "grad_norm": 0.7731462314856246, "learning_rate": 8.68261327603089e-06, "loss": 0.42037010192871094, "num_input_tokens_seen": 307328112, "step": 7025, "train_runtime": 54273.3793, "train_tokens_per_second": 5662.594 }, { "epoch": 0.4733369243199569, "grad_norm": 0.7619151144650879, "learning_rate": 8.68082426998458e-06, "loss": 0.42117109298706057, "num_input_tokens_seen": 307558384, "step": 7030, "train_runtime": 54315.1352, "train_tokens_per_second": 5662.48 }, { "epoch": 0.473673579315917, "grad_norm": 0.8366328207039446, "learning_rate": 8.6790342346075e-06, "loss": 0.355437707901001, "num_input_tokens_seen": 307757832, "step": 7035, "train_runtime": 54355.0453, "train_tokens_per_second": 5661.992 }, { "epoch": 0.47401023431187717, "grad_norm": 0.694627660462694, "learning_rate": 8.677243170400228e-06, "loss": 0.3744319438934326, "num_input_tokens_seen": 307964848, "step": 7040, "train_runtime": 54392.4804, "train_tokens_per_second": 5661.901 }, { "epoch": 0.4743468893078373, "grad_norm": 0.7593548972261533, "learning_rate": 8.675451077863632e-06, "loss": 0.40117859840393066, "num_input_tokens_seen": 308180176, "step": 7045, "train_runtime": 54429.867, "train_tokens_per_second": 5661.968 }, { "epoch": 0.47468354430379744, "grad_norm": 0.7788878005901869, "learning_rate": 8.67365795749886e-06, "loss": 0.37619283199310305, "num_input_tokens_seen": 308393256, "step": 7050, "train_runtime": 54475.6142, "train_tokens_per_second": 5661.125 }, { "epoch": 0.4750201992997576, "grad_norm": 0.6935999303413757, "learning_rate": 8.671863809807355e-06, "loss": 0.36246466636657715, "num_input_tokens_seen": 308598120, "step": 7055, "train_runtime": 54512.6696, "train_tokens_per_second": 5661.035 }, { "epoch": 0.4753568542957177, "grad_norm": 0.7796482197914519, "learning_rate": 8.670068635290844e-06, "loss": 0.3815620899200439, "num_input_tokens_seen": 308814312, "step": 7060, "train_runtime": 54553.6102, "train_tokens_per_second": 5660.749 }, { "epoch": 0.47569350929167786, "grad_norm": 0.6394547128504924, "learning_rate": 8.668272434451343e-06, "loss": 0.3547971725463867, "num_input_tokens_seen": 309036648, "step": 7065, "train_runtime": 54589.1907, "train_tokens_per_second": 5661.133 }, { "epoch": 0.476030164287638, "grad_norm": 0.8424232555426785, "learning_rate": 8.666475207791154e-06, "loss": 0.3938549518585205, "num_input_tokens_seen": 309237312, "step": 7070, "train_runtime": 54626.0249, "train_tokens_per_second": 5660.989 }, { "epoch": 0.47636681928359814, "grad_norm": 0.7156676868042459, "learning_rate": 8.664676955812863e-06, "loss": 0.3805175065994263, "num_input_tokens_seen": 309461072, "step": 7075, "train_runtime": 54665.5373, "train_tokens_per_second": 5660.99 }, { "epoch": 0.4767034742795583, "grad_norm": 0.7803230987384645, "learning_rate": 8.662877679019348e-06, "loss": 0.38736543655395506, "num_input_tokens_seen": 309676264, "step": 7080, "train_runtime": 54702.5852, "train_tokens_per_second": 5661.09 }, { "epoch": 0.4770401292755185, "grad_norm": 0.811046251111573, "learning_rate": 8.66107737791377e-06, "loss": 0.40035252571105956, "num_input_tokens_seen": 309908584, "step": 7085, "train_runtime": 54739.8422, "train_tokens_per_second": 5661.481 }, { "epoch": 0.4773767842714786, "grad_norm": 0.8088100128547995, "learning_rate": 8.659276052999574e-06, "loss": 0.37158200740814207, "num_input_tokens_seen": 310109536, "step": 7090, "train_runtime": 54784.3231, "train_tokens_per_second": 5660.552 }, { "epoch": 0.47771343926743876, "grad_norm": 0.6607865351139958, "learning_rate": 8.657473704780504e-06, "loss": 0.3958035707473755, "num_input_tokens_seen": 310316416, "step": 7095, "train_runtime": 54823.0111, "train_tokens_per_second": 5660.331 }, { "epoch": 0.4780500942633989, "grad_norm": 0.7508776157927014, "learning_rate": 8.65567033376057e-06, "loss": 0.3861806392669678, "num_input_tokens_seen": 310543280, "step": 7100, "train_runtime": 54858.1842, "train_tokens_per_second": 5660.838 }, { "epoch": 0.47838674925935903, "grad_norm": 0.6796527894531441, "learning_rate": 8.65386594044409e-06, "loss": 0.38321571350097655, "num_input_tokens_seen": 310767656, "step": 7105, "train_runtime": 54899.3833, "train_tokens_per_second": 5660.677 }, { "epoch": 0.4787234042553192, "grad_norm": 0.7839875292722721, "learning_rate": 8.652060525335647e-06, "loss": 0.35958447456359866, "num_input_tokens_seen": 310977648, "step": 7110, "train_runtime": 54935.0727, "train_tokens_per_second": 5660.822 }, { "epoch": 0.4790600592512793, "grad_norm": 0.6805039530532168, "learning_rate": 8.650254088940125e-06, "loss": 0.37933621406555174, "num_input_tokens_seen": 311184472, "step": 7115, "train_runtime": 54970.8187, "train_tokens_per_second": 5660.903 }, { "epoch": 0.47939671424723945, "grad_norm": 0.8690524861477827, "learning_rate": 8.648446631762686e-06, "loss": 0.3870699882507324, "num_input_tokens_seen": 311386608, "step": 7120, "train_runtime": 55007.3848, "train_tokens_per_second": 5660.815 }, { "epoch": 0.4797333692431996, "grad_norm": 0.7834933561721031, "learning_rate": 8.646638154308781e-06, "loss": 0.3672234296798706, "num_input_tokens_seen": 311600392, "step": 7125, "train_runtime": 55045.8437, "train_tokens_per_second": 5660.743 }, { "epoch": 0.48007002423915973, "grad_norm": 0.6821280974528945, "learning_rate": 8.644828657084144e-06, "loss": 0.3536520004272461, "num_input_tokens_seen": 311826176, "step": 7130, "train_runtime": 55086.3186, "train_tokens_per_second": 5660.683 }, { "epoch": 0.48040667923511987, "grad_norm": 0.7090523007119766, "learning_rate": 8.643018140594797e-06, "loss": 0.35062260627746583, "num_input_tokens_seen": 312040616, "step": 7135, "train_runtime": 55118.7948, "train_tokens_per_second": 5661.238 }, { "epoch": 0.48074333423108, "grad_norm": 0.7694829828758608, "learning_rate": 8.641206605347042e-06, "loss": 0.3680727958679199, "num_input_tokens_seen": 312250776, "step": 7140, "train_runtime": 55154.654, "train_tokens_per_second": 5661.368 }, { "epoch": 0.48107998922704015, "grad_norm": 0.7834141310420747, "learning_rate": 8.639394051847472e-06, "loss": 0.3820206642150879, "num_input_tokens_seen": 312469768, "step": 7145, "train_runtime": 55194.213, "train_tokens_per_second": 5661.278 }, { "epoch": 0.4814166442230003, "grad_norm": 0.8086494042960466, "learning_rate": 8.63758048060296e-06, "loss": 0.3749295473098755, "num_input_tokens_seen": 312686816, "step": 7150, "train_runtime": 55234.7643, "train_tokens_per_second": 5661.051 }, { "epoch": 0.48175329921896043, "grad_norm": 1.146252827120329, "learning_rate": 8.635765892120666e-06, "loss": 0.35863730907440183, "num_input_tokens_seen": 312928240, "step": 7155, "train_runtime": 55276.3406, "train_tokens_per_second": 5661.161 }, { "epoch": 0.48208995421492057, "grad_norm": 0.6322723599846541, "learning_rate": 8.633950286908032e-06, "loss": 0.3957623243331909, "num_input_tokens_seen": 313146400, "step": 7160, "train_runtime": 55318.9273, "train_tokens_per_second": 5660.746 }, { "epoch": 0.4824266092108807, "grad_norm": 0.8242447392294052, "learning_rate": 8.63213366547279e-06, "loss": 0.41290960311889646, "num_input_tokens_seen": 313353080, "step": 7165, "train_runtime": 55354.3316, "train_tokens_per_second": 5660.859 }, { "epoch": 0.48276326420684085, "grad_norm": 0.8189218668862145, "learning_rate": 8.630316028322952e-06, "loss": 0.3599478960037231, "num_input_tokens_seen": 313556520, "step": 7170, "train_runtime": 55393.1558, "train_tokens_per_second": 5660.564 }, { "epoch": 0.483099919202801, "grad_norm": 0.8049613617878884, "learning_rate": 8.628497375966811e-06, "loss": 0.3688513278961182, "num_input_tokens_seen": 313791304, "step": 7175, "train_runtime": 55433.9631, "train_tokens_per_second": 5660.633 }, { "epoch": 0.4834365741987611, "grad_norm": 0.7403145334116261, "learning_rate": 8.62667770891295e-06, "loss": 0.4179924488067627, "num_input_tokens_seen": 314025432, "step": 7180, "train_runtime": 55479.2927, "train_tokens_per_second": 5660.228 }, { "epoch": 0.48377322919472127, "grad_norm": 0.6161204381365467, "learning_rate": 8.624857027670232e-06, "loss": 0.3718327522277832, "num_input_tokens_seen": 314253744, "step": 7185, "train_runtime": 55518.1876, "train_tokens_per_second": 5660.375 }, { "epoch": 0.4841098841906814, "grad_norm": 0.6673541170021607, "learning_rate": 8.623035332747804e-06, "loss": 0.4232837677001953, "num_input_tokens_seen": 314457360, "step": 7190, "train_runtime": 55555.7684, "train_tokens_per_second": 5660.211 }, { "epoch": 0.48444653918664154, "grad_norm": 0.8639989632411573, "learning_rate": 8.6212126246551e-06, "loss": 0.35295858383178713, "num_input_tokens_seen": 314659296, "step": 7195, "train_runtime": 55590.9252, "train_tokens_per_second": 5660.264 }, { "epoch": 0.4847831941826017, "grad_norm": 0.7194371682580046, "learning_rate": 8.619388903901833e-06, "loss": 0.397071385383606, "num_input_tokens_seen": 314886400, "step": 7200, "train_runtime": 55632.7504, "train_tokens_per_second": 5660.09 }, { "epoch": 0.4851198491785618, "grad_norm": 0.7895653948671645, "learning_rate": 8.617564170997998e-06, "loss": 0.393186354637146, "num_input_tokens_seen": 315113560, "step": 7205, "train_runtime": 55665.6693, "train_tokens_per_second": 5660.824 }, { "epoch": 0.48545650417452196, "grad_norm": 0.6916492568995722, "learning_rate": 8.61573842645388e-06, "loss": 0.38975393772125244, "num_input_tokens_seen": 315339760, "step": 7210, "train_runtime": 55701.6461, "train_tokens_per_second": 5661.229 }, { "epoch": 0.4857931591704821, "grad_norm": 0.7125114232933183, "learning_rate": 8.61391167078004e-06, "loss": 0.3773904085159302, "num_input_tokens_seen": 315564560, "step": 7215, "train_runtime": 55739.932, "train_tokens_per_second": 5661.373 }, { "epoch": 0.48612981416644224, "grad_norm": 0.7816578333674177, "learning_rate": 8.612083904487324e-06, "loss": 0.4223905563354492, "num_input_tokens_seen": 315780664, "step": 7220, "train_runtime": 55782.1816, "train_tokens_per_second": 5660.959 }, { "epoch": 0.4864664691624024, "grad_norm": 0.8225392117617899, "learning_rate": 8.610255128086867e-06, "loss": 0.39981255531311033, "num_input_tokens_seen": 315985224, "step": 7225, "train_runtime": 55817.5809, "train_tokens_per_second": 5661.034 }, { "epoch": 0.4868031241583625, "grad_norm": 0.7192041520493799, "learning_rate": 8.60842534209007e-06, "loss": 0.35159389972686766, "num_input_tokens_seen": 316206120, "step": 7230, "train_runtime": 55856.1823, "train_tokens_per_second": 5661.076 }, { "epoch": 0.48713977915432266, "grad_norm": 0.7538381499748801, "learning_rate": 8.606594547008636e-06, "loss": 0.33089404106140136, "num_input_tokens_seen": 316428112, "step": 7235, "train_runtime": 55889.528, "train_tokens_per_second": 5661.671 }, { "epoch": 0.4874764341502828, "grad_norm": 0.7734857420248509, "learning_rate": 8.604762743354536e-06, "loss": 0.39783239364624023, "num_input_tokens_seen": 316666376, "step": 7240, "train_runtime": 55922.8766, "train_tokens_per_second": 5662.555 }, { "epoch": 0.48781308914624294, "grad_norm": 0.7475280321551805, "learning_rate": 8.602929931640029e-06, "loss": 0.3995728254318237, "num_input_tokens_seen": 316868832, "step": 7245, "train_runtime": 55959.5907, "train_tokens_per_second": 5662.458 }, { "epoch": 0.4881497441422031, "grad_norm": 0.8349680082803242, "learning_rate": 8.601096112377659e-06, "loss": 0.4125559329986572, "num_input_tokens_seen": 317082248, "step": 7250, "train_runtime": 56002.6917, "train_tokens_per_second": 5661.911 }, { "epoch": 0.4884863991381632, "grad_norm": 0.6943776304621931, "learning_rate": 8.59926128608024e-06, "loss": 0.3738250255584717, "num_input_tokens_seen": 317303120, "step": 7255, "train_runtime": 56039.6874, "train_tokens_per_second": 5662.114 }, { "epoch": 0.48882305413412336, "grad_norm": 0.7789443419004642, "learning_rate": 8.597425453260881e-06, "loss": 0.3914709806442261, "num_input_tokens_seen": 317515672, "step": 7260, "train_runtime": 56082.3268, "train_tokens_per_second": 5661.599 }, { "epoch": 0.4891597091300835, "grad_norm": 0.8422191416131971, "learning_rate": 8.595588614432967e-06, "loss": 0.3669420719146729, "num_input_tokens_seen": 317720352, "step": 7265, "train_runtime": 56128.1181, "train_tokens_per_second": 5660.627 }, { "epoch": 0.48949636412604364, "grad_norm": 0.7163712412405564, "learning_rate": 8.59375077011016e-06, "loss": 0.36806163787841795, "num_input_tokens_seen": 317948384, "step": 7270, "train_runtime": 56167.6356, "train_tokens_per_second": 5660.704 }, { "epoch": 0.4898330191220038, "grad_norm": 0.8174970324207671, "learning_rate": 8.591911920806412e-06, "loss": 0.39014444351196287, "num_input_tokens_seen": 318179072, "step": 7275, "train_runtime": 56213.9579, "train_tokens_per_second": 5660.144 }, { "epoch": 0.4901696741179639, "grad_norm": 0.6974694369606549, "learning_rate": 8.590072067035947e-06, "loss": 0.38969347476959226, "num_input_tokens_seen": 318410480, "step": 7280, "train_runtime": 56255.4338, "train_tokens_per_second": 5660.084 }, { "epoch": 0.49050632911392406, "grad_norm": 0.6692328837890084, "learning_rate": 8.588231209313278e-06, "loss": 0.37391541004180906, "num_input_tokens_seen": 318654632, "step": 7285, "train_runtime": 56291.6831, "train_tokens_per_second": 5660.776 }, { "epoch": 0.4908429841098842, "grad_norm": 0.7608072412958533, "learning_rate": 8.586389348153192e-06, "loss": 0.3896606206893921, "num_input_tokens_seen": 318874824, "step": 7290, "train_runtime": 56326.4539, "train_tokens_per_second": 5661.191 }, { "epoch": 0.49117963910584433, "grad_norm": 0.7736109340706484, "learning_rate": 8.584546484070762e-06, "loss": 0.40265254974365233, "num_input_tokens_seen": 319084200, "step": 7295, "train_runtime": 56365.3177, "train_tokens_per_second": 5661.002 }, { "epoch": 0.4915162941018045, "grad_norm": 0.7875873984707813, "learning_rate": 8.582702617581338e-06, "loss": 0.37858309745788576, "num_input_tokens_seen": 319307784, "step": 7300, "train_runtime": 56403.5288, "train_tokens_per_second": 5661.131 }, { "epoch": 0.4918529490977646, "grad_norm": 0.7183058860492505, "learning_rate": 8.58085774920055e-06, "loss": 0.38918490409851075, "num_input_tokens_seen": 319513304, "step": 7305, "train_runtime": 56438.5945, "train_tokens_per_second": 5661.256 }, { "epoch": 0.49218960409372475, "grad_norm": 0.7356534041270457, "learning_rate": 8.579011879444313e-06, "loss": 0.414321231842041, "num_input_tokens_seen": 319743560, "step": 7310, "train_runtime": 56483.4424, "train_tokens_per_second": 5660.837 }, { "epoch": 0.4925262590896849, "grad_norm": 0.6584093897897996, "learning_rate": 8.577165008828817e-06, "loss": 0.34825422763824465, "num_input_tokens_seen": 319947112, "step": 7315, "train_runtime": 56521.6053, "train_tokens_per_second": 5660.616 }, { "epoch": 0.49286291408564503, "grad_norm": 0.7722746099858304, "learning_rate": 8.57531713787053e-06, "loss": 0.3858429193496704, "num_input_tokens_seen": 320155920, "step": 7320, "train_runtime": 56558.1587, "train_tokens_per_second": 5660.65 }, { "epoch": 0.49319956908160517, "grad_norm": 0.8389191394295502, "learning_rate": 8.573468267086208e-06, "loss": 0.40245862007141114, "num_input_tokens_seen": 320372792, "step": 7325, "train_runtime": 56592.9849, "train_tokens_per_second": 5660.998 }, { "epoch": 0.4935362240775653, "grad_norm": 0.7633923302039957, "learning_rate": 8.57161839699288e-06, "loss": 0.36266283988952636, "num_input_tokens_seen": 320592160, "step": 7330, "train_runtime": 56631.6072, "train_tokens_per_second": 5661.011 }, { "epoch": 0.49387287907352545, "grad_norm": 0.8780389979845686, "learning_rate": 8.569767528107857e-06, "loss": 0.3856183052062988, "num_input_tokens_seen": 320807512, "step": 7335, "train_runtime": 56669.1815, "train_tokens_per_second": 5661.058 }, { "epoch": 0.4942095340694856, "grad_norm": 0.6800471334043537, "learning_rate": 8.567915660948727e-06, "loss": 0.3747032880783081, "num_input_tokens_seen": 321031440, "step": 7340, "train_runtime": 56709.5179, "train_tokens_per_second": 5660.98 }, { "epoch": 0.49454618906544573, "grad_norm": 0.8334581237618652, "learning_rate": 8.566062796033358e-06, "loss": 0.4063011646270752, "num_input_tokens_seen": 321244008, "step": 7345, "train_runtime": 56746.898, "train_tokens_per_second": 5660.997 }, { "epoch": 0.49488284406140587, "grad_norm": 0.7667199760691221, "learning_rate": 8.564208933879903e-06, "loss": 0.37364883422851564, "num_input_tokens_seen": 321456992, "step": 7350, "train_runtime": 56787.18, "train_tokens_per_second": 5660.732 }, { "epoch": 0.495219499057366, "grad_norm": 0.7580149996088524, "learning_rate": 8.562354075006782e-06, "loss": 0.3439052104949951, "num_input_tokens_seen": 321675512, "step": 7355, "train_runtime": 56825.1931, "train_tokens_per_second": 5660.79 }, { "epoch": 0.49555615405332615, "grad_norm": 0.6724287776480686, "learning_rate": 8.560498219932706e-06, "loss": 0.4257340431213379, "num_input_tokens_seen": 321898448, "step": 7360, "train_runtime": 56859.2761, "train_tokens_per_second": 5661.318 }, { "epoch": 0.4958928090492863, "grad_norm": 0.735779732523222, "learning_rate": 8.558641369176654e-06, "loss": 0.33791351318359375, "num_input_tokens_seen": 322099904, "step": 7365, "train_runtime": 56892.2085, "train_tokens_per_second": 5661.582 }, { "epoch": 0.4962294640452464, "grad_norm": 0.7979574200557189, "learning_rate": 8.556783523257892e-06, "loss": 0.3972716569900513, "num_input_tokens_seen": 322310456, "step": 7370, "train_runtime": 56935.1565, "train_tokens_per_second": 5661.009 }, { "epoch": 0.49656611904120657, "grad_norm": 0.7637866611420476, "learning_rate": 8.554924682695959e-06, "loss": 0.3530308246612549, "num_input_tokens_seen": 322518744, "step": 7375, "train_runtime": 56971.9645, "train_tokens_per_second": 5661.008 }, { "epoch": 0.4969027740371667, "grad_norm": 0.7640709256586813, "learning_rate": 8.553064848010677e-06, "loss": 0.3955545902252197, "num_input_tokens_seen": 322725520, "step": 7380, "train_runtime": 57007.6953, "train_tokens_per_second": 5661.087 }, { "epoch": 0.49723942903312685, "grad_norm": 0.8082539381866035, "learning_rate": 8.551204019722137e-06, "loss": 0.37126519680023196, "num_input_tokens_seen": 322938184, "step": 7385, "train_runtime": 57046.2643, "train_tokens_per_second": 5660.987 }, { "epoch": 0.497576084029087, "grad_norm": 0.7610367285948725, "learning_rate": 8.549342198350718e-06, "loss": 0.40738329887390134, "num_input_tokens_seen": 323160704, "step": 7390, "train_runtime": 57086.0056, "train_tokens_per_second": 5660.944 }, { "epoch": 0.4979127390250471, "grad_norm": 0.7004854714973048, "learning_rate": 8.54747938441707e-06, "loss": 0.36683225631713867, "num_input_tokens_seen": 323382024, "step": 7395, "train_runtime": 57128.4646, "train_tokens_per_second": 5660.611 }, { "epoch": 0.49824939402100726, "grad_norm": 0.6981945654130406, "learning_rate": 8.545615578442126e-06, "loss": 0.35772018432617186, "num_input_tokens_seen": 323601056, "step": 7400, "train_runtime": 57166.4275, "train_tokens_per_second": 5660.684 }, { "epoch": 0.4985860490169674, "grad_norm": 0.8538725530295028, "learning_rate": 8.54375078094709e-06, "loss": 0.3746786117553711, "num_input_tokens_seen": 323824464, "step": 7405, "train_runtime": 57216.1649, "train_tokens_per_second": 5659.667 }, { "epoch": 0.49892270401292754, "grad_norm": 0.6772326544260556, "learning_rate": 8.541884992453449e-06, "loss": 0.3711742401123047, "num_input_tokens_seen": 324047472, "step": 7410, "train_runtime": 57254.2655, "train_tokens_per_second": 5659.796 }, { "epoch": 0.4992593590088877, "grad_norm": 0.6789887270206421, "learning_rate": 8.540018213482966e-06, "loss": 0.37660138607025145, "num_input_tokens_seen": 324280688, "step": 7415, "train_runtime": 57294.4005, "train_tokens_per_second": 5659.902 }, { "epoch": 0.4995960140048478, "grad_norm": 0.7605591952463279, "learning_rate": 8.538150444557676e-06, "loss": 0.3920082330703735, "num_input_tokens_seen": 324488104, "step": 7420, "train_runtime": 57333.8655, "train_tokens_per_second": 5659.624 }, { "epoch": 0.49993266900080796, "grad_norm": 0.826315107413246, "learning_rate": 8.536281686199896e-06, "loss": 0.385677433013916, "num_input_tokens_seen": 324711216, "step": 7425, "train_runtime": 57366.6278, "train_tokens_per_second": 5660.281 }, { "epoch": 0.5002693239967682, "grad_norm": 0.6877893318576644, "learning_rate": 8.534411938932218e-06, "loss": 0.3787369728088379, "num_input_tokens_seen": 324939096, "step": 7430, "train_runtime": 57400.8374, "train_tokens_per_second": 5660.877 }, { "epoch": 0.5006059789927283, "grad_norm": 0.7206196203304496, "learning_rate": 8.532541203277515e-06, "loss": 0.3697648525238037, "num_input_tokens_seen": 325163640, "step": 7435, "train_runtime": 57437.2769, "train_tokens_per_second": 5661.195 }, { "epoch": 0.5009426339886884, "grad_norm": 0.8219400190681228, "learning_rate": 8.530669479758926e-06, "loss": 0.37598912715911864, "num_input_tokens_seen": 325383192, "step": 7440, "train_runtime": 57475.956, "train_tokens_per_second": 5661.205 }, { "epoch": 0.5012792889846486, "grad_norm": 0.8185284831231338, "learning_rate": 8.528796768899878e-06, "loss": 0.39255619049072266, "num_input_tokens_seen": 325585216, "step": 7445, "train_runtime": 57516.4354, "train_tokens_per_second": 5660.734 }, { "epoch": 0.5016159439806087, "grad_norm": 0.748875770223375, "learning_rate": 8.526923071224064e-06, "loss": 0.39842636585235597, "num_input_tokens_seen": 325810472, "step": 7450, "train_runtime": 57549.4748, "train_tokens_per_second": 5661.398 }, { "epoch": 0.5019525989765689, "grad_norm": 0.7148185230181737, "learning_rate": 8.525048387255461e-06, "loss": 0.3887434482574463, "num_input_tokens_seen": 326034504, "step": 7455, "train_runtime": 57590.0671, "train_tokens_per_second": 5661.298 }, { "epoch": 0.502289253972529, "grad_norm": 0.7229968516896057, "learning_rate": 8.523172717518315e-06, "loss": 0.3696585178375244, "num_input_tokens_seen": 326245696, "step": 7460, "train_runtime": 57627.1988, "train_tokens_per_second": 5661.314 }, { "epoch": 0.5026259089684891, "grad_norm": 0.7305037275102111, "learning_rate": 8.521296062537156e-06, "loss": 0.37876601219177247, "num_input_tokens_seen": 326460104, "step": 7465, "train_runtime": 57664.9318, "train_tokens_per_second": 5661.328 }, { "epoch": 0.5029625639644493, "grad_norm": 0.7847466467811594, "learning_rate": 8.51941842283678e-06, "loss": 0.36045174598693847, "num_input_tokens_seen": 326673104, "step": 7470, "train_runtime": 57704.8246, "train_tokens_per_second": 5661.106 }, { "epoch": 0.5032992189604094, "grad_norm": 0.991284631688998, "learning_rate": 8.517539798942265e-06, "loss": 0.3735339641571045, "num_input_tokens_seen": 326906960, "step": 7475, "train_runtime": 57737.7344, "train_tokens_per_second": 5661.929 }, { "epoch": 0.5036358739563696, "grad_norm": 0.6872665714663292, "learning_rate": 8.515660191378962e-06, "loss": 0.39676947593688966, "num_input_tokens_seen": 327128416, "step": 7480, "train_runtime": 57776.877, "train_tokens_per_second": 5661.926 }, { "epoch": 0.5039725289523297, "grad_norm": 0.6751937767879514, "learning_rate": 8.513779600672495e-06, "loss": 0.3535287380218506, "num_input_tokens_seen": 327364152, "step": 7485, "train_runtime": 57811.2991, "train_tokens_per_second": 5662.633 }, { "epoch": 0.5043091839482898, "grad_norm": 0.7000671921171517, "learning_rate": 8.511898027348771e-06, "loss": 0.37773268222808837, "num_input_tokens_seen": 327568048, "step": 7490, "train_runtime": 57853.1955, "train_tokens_per_second": 5662.056 }, { "epoch": 0.50464583894425, "grad_norm": 0.6936107754040254, "learning_rate": 8.51001547193396e-06, "loss": 0.3704256296157837, "num_input_tokens_seen": 327792152, "step": 7495, "train_runtime": 57893.3414, "train_tokens_per_second": 5662.001 }, { "epoch": 0.5049824939402101, "grad_norm": 0.7889020414532445, "learning_rate": 8.508131934954515e-06, "loss": 0.36852757930755614, "num_input_tokens_seen": 327994400, "step": 7500, "train_runtime": 57932.8569, "train_tokens_per_second": 5661.63 }, { "epoch": 0.5053191489361702, "grad_norm": 0.715078307452266, "learning_rate": 8.50624741693716e-06, "loss": 0.3951726913452148, "num_input_tokens_seen": 328200448, "step": 7505, "train_runtime": 57971.7531, "train_tokens_per_second": 5661.386 }, { "epoch": 0.5056558039321304, "grad_norm": 1.068005291058121, "learning_rate": 8.5043619184089e-06, "loss": 0.4119250297546387, "num_input_tokens_seen": 328421224, "step": 7510, "train_runtime": 58005.869, "train_tokens_per_second": 5661.862 }, { "epoch": 0.5059924589280905, "grad_norm": 1.638455940254133, "learning_rate": 8.502475439897e-06, "loss": 0.4078369140625, "num_input_tokens_seen": 328646192, "step": 7515, "train_runtime": 58043.9094, "train_tokens_per_second": 5662.027 }, { "epoch": 0.5063291139240507, "grad_norm": 0.7358398144623932, "learning_rate": 8.500587981929013e-06, "loss": 0.3898489475250244, "num_input_tokens_seen": 328867064, "step": 7520, "train_runtime": 58088.0612, "train_tokens_per_second": 5661.526 }, { "epoch": 0.5066657689200108, "grad_norm": 0.7487957564819914, "learning_rate": 8.498699545032758e-06, "loss": 0.38454551696777345, "num_input_tokens_seen": 329103168, "step": 7525, "train_runtime": 58124.1106, "train_tokens_per_second": 5662.077 }, { "epoch": 0.507002423915971, "grad_norm": 0.7172633060502269, "learning_rate": 8.496810129736334e-06, "loss": 0.3850215435028076, "num_input_tokens_seen": 329322920, "step": 7530, "train_runtime": 58166.9838, "train_tokens_per_second": 5661.681 }, { "epoch": 0.5073390789119311, "grad_norm": 0.7747557646585903, "learning_rate": 8.494919736568105e-06, "loss": 0.3788848638534546, "num_input_tokens_seen": 329533896, "step": 7535, "train_runtime": 58210.0232, "train_tokens_per_second": 5661.119 }, { "epoch": 0.5076757339078912, "grad_norm": 0.7933496638959117, "learning_rate": 8.49302836605672e-06, "loss": 0.37194099426269533, "num_input_tokens_seen": 329760624, "step": 7540, "train_runtime": 58246.3752, "train_tokens_per_second": 5661.479 }, { "epoch": 0.5080123889038514, "grad_norm": 0.7365707403857205, "learning_rate": 8.491136018731088e-06, "loss": 0.3646608114242554, "num_input_tokens_seen": 329984728, "step": 7545, "train_runtime": 58287.6488, "train_tokens_per_second": 5661.315 }, { "epoch": 0.5083490438998115, "grad_norm": 0.8956737633683735, "learning_rate": 8.4892426951204e-06, "loss": 0.3987517118453979, "num_input_tokens_seen": 330206096, "step": 7550, "train_runtime": 58316.2366, "train_tokens_per_second": 5662.335 }, { "epoch": 0.5086856988957716, "grad_norm": 0.7170163461314129, "learning_rate": 8.48734839575412e-06, "loss": 0.3717711687088013, "num_input_tokens_seen": 330437336, "step": 7555, "train_runtime": 58351.3409, "train_tokens_per_second": 5662.892 }, { "epoch": 0.5090223538917318, "grad_norm": 0.6630558999546488, "learning_rate": 8.485453121161983e-06, "loss": 0.37380030155181887, "num_input_tokens_seen": 330653616, "step": 7560, "train_runtime": 58392.093, "train_tokens_per_second": 5662.644 }, { "epoch": 0.5093590088876919, "grad_norm": 0.7845896930720607, "learning_rate": 8.483556871873993e-06, "loss": 0.42113819122314455, "num_input_tokens_seen": 330875672, "step": 7565, "train_runtime": 58433.2419, "train_tokens_per_second": 5662.456 }, { "epoch": 0.5096956638836521, "grad_norm": 0.760051472590646, "learning_rate": 8.481659648420433e-06, "loss": 0.3786670207977295, "num_input_tokens_seen": 331096488, "step": 7570, "train_runtime": 58475.0649, "train_tokens_per_second": 5662.182 }, { "epoch": 0.5100323188796122, "grad_norm": 0.8835596263525625, "learning_rate": 8.479761451331855e-06, "loss": 0.3809337615966797, "num_input_tokens_seen": 331285184, "step": 7575, "train_runtime": 58515.9798, "train_tokens_per_second": 5661.448 }, { "epoch": 0.5103689738755723, "grad_norm": 0.9301429501501213, "learning_rate": 8.477862281139082e-06, "loss": 0.3540458917617798, "num_input_tokens_seen": 331501760, "step": 7580, "train_runtime": 58558.4957, "train_tokens_per_second": 5661.036 }, { "epoch": 0.5107056288715325, "grad_norm": 0.7609757852463125, "learning_rate": 8.475962138373212e-06, "loss": 0.3986123323440552, "num_input_tokens_seen": 331702152, "step": 7585, "train_runtime": 58591.7614, "train_tokens_per_second": 5661.242 }, { "epoch": 0.5110422838674926, "grad_norm": 0.6930333171792868, "learning_rate": 8.474061023565614e-06, "loss": 0.3940688371658325, "num_input_tokens_seen": 331929992, "step": 7590, "train_runtime": 58631.4664, "train_tokens_per_second": 5661.294 }, { "epoch": 0.5113789388634528, "grad_norm": 0.7801001592101691, "learning_rate": 8.472158937247931e-06, "loss": 0.40605816841125486, "num_input_tokens_seen": 332148472, "step": 7595, "train_runtime": 58666.3698, "train_tokens_per_second": 5661.65 }, { "epoch": 0.5117155938594129, "grad_norm": 0.7185541728168203, "learning_rate": 8.47025587995207e-06, "loss": 0.38570313453674315, "num_input_tokens_seen": 332362728, "step": 7600, "train_runtime": 58704.4102, "train_tokens_per_second": 5661.631 }, { "epoch": 0.512052248855373, "grad_norm": 0.7887783994842774, "learning_rate": 8.46835185221022e-06, "loss": 0.39829018115997317, "num_input_tokens_seen": 332569544, "step": 7605, "train_runtime": 58743.9844, "train_tokens_per_second": 5661.338 }, { "epoch": 0.5123889038513332, "grad_norm": 0.8602264236155862, "learning_rate": 8.466446854554835e-06, "loss": 0.3549684762954712, "num_input_tokens_seen": 332778920, "step": 7610, "train_runtime": 58780.8818, "train_tokens_per_second": 5661.346 }, { "epoch": 0.5127255588472933, "grad_norm": 0.7228150824538518, "learning_rate": 8.464540887518638e-06, "loss": 0.37906813621520996, "num_input_tokens_seen": 332984080, "step": 7615, "train_runtime": 58823.2164, "train_tokens_per_second": 5660.759 }, { "epoch": 0.5130622138432535, "grad_norm": 0.7996970703617401, "learning_rate": 8.462633951634631e-06, "loss": 0.3685762405395508, "num_input_tokens_seen": 333202640, "step": 7620, "train_runtime": 58868.3048, "train_tokens_per_second": 5660.136 }, { "epoch": 0.5133988688392136, "grad_norm": 0.6901634902422549, "learning_rate": 8.46072604743608e-06, "loss": 0.35547614097595215, "num_input_tokens_seen": 333413904, "step": 7625, "train_runtime": 58905.0124, "train_tokens_per_second": 5660.196 }, { "epoch": 0.5137355238351737, "grad_norm": 0.9033857052689097, "learning_rate": 8.458817175456528e-06, "loss": 0.3930670261383057, "num_input_tokens_seen": 333630616, "step": 7630, "train_runtime": 58947.1829, "train_tokens_per_second": 5659.823 }, { "epoch": 0.5140721788311339, "grad_norm": 0.7781771666334231, "learning_rate": 8.45690733622978e-06, "loss": 0.35927329063415525, "num_input_tokens_seen": 333854600, "step": 7635, "train_runtime": 58986.6913, "train_tokens_per_second": 5659.829 }, { "epoch": 0.514408833827094, "grad_norm": 0.8455368762157274, "learning_rate": 8.45499653028992e-06, "loss": 0.36787919998168944, "num_input_tokens_seen": 334071192, "step": 7640, "train_runtime": 59022.2041, "train_tokens_per_second": 5660.093 }, { "epoch": 0.5147454888230542, "grad_norm": 0.7586644939540588, "learning_rate": 8.453084758171297e-06, "loss": 0.37957746982574464, "num_input_tokens_seen": 334291888, "step": 7645, "train_runtime": 59067.1738, "train_tokens_per_second": 5659.521 }, { "epoch": 0.5150821438190143, "grad_norm": 0.7524816129003911, "learning_rate": 8.451172020408532e-06, "loss": 0.38945965766906737, "num_input_tokens_seen": 334516424, "step": 7650, "train_runtime": 59101.459, "train_tokens_per_second": 5660.037 }, { "epoch": 0.5154187988149744, "grad_norm": 0.7137520182282876, "learning_rate": 8.449258317536517e-06, "loss": 0.35926315784454343, "num_input_tokens_seen": 334732808, "step": 7655, "train_runtime": 59134.7468, "train_tokens_per_second": 5660.51 }, { "epoch": 0.5157554538109346, "grad_norm": 0.7129464795573726, "learning_rate": 8.447343650090412e-06, "loss": 0.35725347995758056, "num_input_tokens_seen": 334954280, "step": 7660, "train_runtime": 59172.9555, "train_tokens_per_second": 5660.597 }, { "epoch": 0.5160921088068947, "grad_norm": 0.7272448686794939, "learning_rate": 8.445428018605647e-06, "loss": 0.406490421295166, "num_input_tokens_seen": 335178568, "step": 7665, "train_runtime": 59210.2513, "train_tokens_per_second": 5660.82 }, { "epoch": 0.5164287638028549, "grad_norm": 0.6593329295977397, "learning_rate": 8.443511423617924e-06, "loss": 0.34410724639892576, "num_input_tokens_seen": 335398608, "step": 7670, "train_runtime": 59246.6136, "train_tokens_per_second": 5661.06 }, { "epoch": 0.516765418798815, "grad_norm": 0.7054753575271266, "learning_rate": 8.441593865663213e-06, "loss": 0.39874303340911865, "num_input_tokens_seen": 335621696, "step": 7675, "train_runtime": 59285.0684, "train_tokens_per_second": 5661.151 }, { "epoch": 0.5171020737947751, "grad_norm": 0.7429064696844442, "learning_rate": 8.439675345277751e-06, "loss": 0.40140485763549805, "num_input_tokens_seen": 335839504, "step": 7680, "train_runtime": 59327.3379, "train_tokens_per_second": 5660.788 }, { "epoch": 0.5174387287907353, "grad_norm": 0.6392657750321254, "learning_rate": 8.437755862998047e-06, "loss": 0.3619039297103882, "num_input_tokens_seen": 336062080, "step": 7685, "train_runtime": 59362.2516, "train_tokens_per_second": 5661.208 }, { "epoch": 0.5177753837866954, "grad_norm": 0.6333778064119364, "learning_rate": 8.435835419360878e-06, "loss": 0.3882591247558594, "num_input_tokens_seen": 336299944, "step": 7690, "train_runtime": 59398.7224, "train_tokens_per_second": 5661.737 }, { "epoch": 0.5181120387826555, "grad_norm": 0.7397126752113882, "learning_rate": 8.433914014903291e-06, "loss": 0.42388019561767576, "num_input_tokens_seen": 336514968, "step": 7695, "train_runtime": 59437.773, "train_tokens_per_second": 5661.635 }, { "epoch": 0.5184486937786157, "grad_norm": 0.6888095905405301, "learning_rate": 8.431991650162599e-06, "loss": 0.37606000900268555, "num_input_tokens_seen": 336732600, "step": 7700, "train_runtime": 59483.4411, "train_tokens_per_second": 5660.947 }, { "epoch": 0.5187853487745758, "grad_norm": 0.6980617402046243, "learning_rate": 8.430068325676386e-06, "loss": 0.39625885486602785, "num_input_tokens_seen": 336948776, "step": 7705, "train_runtime": 59521.0447, "train_tokens_per_second": 5661.002 }, { "epoch": 0.519122003770536, "grad_norm": 0.732968462897192, "learning_rate": 8.428144041982502e-06, "loss": 0.39479496479034426, "num_input_tokens_seen": 337163520, "step": 7710, "train_runtime": 59556.4, "train_tokens_per_second": 5661.247 }, { "epoch": 0.5194586587664961, "grad_norm": 0.6401198443952045, "learning_rate": 8.42621879961907e-06, "loss": 0.38160171508789065, "num_input_tokens_seen": 337382992, "step": 7715, "train_runtime": 59597.2808, "train_tokens_per_second": 5661.047 }, { "epoch": 0.5197953137624562, "grad_norm": 0.7011673418789361, "learning_rate": 8.424292599124476e-06, "loss": 0.3532627820968628, "num_input_tokens_seen": 337609304, "step": 7720, "train_runtime": 59636.4965, "train_tokens_per_second": 5661.119 }, { "epoch": 0.5201319687584164, "grad_norm": 0.7609717187854771, "learning_rate": 8.422365441037374e-06, "loss": 0.39478967189788816, "num_input_tokens_seen": 337838072, "step": 7725, "train_runtime": 59669.1056, "train_tokens_per_second": 5661.859 }, { "epoch": 0.5204686237543765, "grad_norm": 0.743645872276741, "learning_rate": 8.420437325896692e-06, "loss": 0.3906223297119141, "num_input_tokens_seen": 338067512, "step": 7730, "train_runtime": 59705.1498, "train_tokens_per_second": 5662.284 }, { "epoch": 0.5208052787503367, "grad_norm": 0.7586775310938808, "learning_rate": 8.418508254241617e-06, "loss": 0.3925325870513916, "num_input_tokens_seen": 338284504, "step": 7735, "train_runtime": 59748.0729, "train_tokens_per_second": 5661.848 }, { "epoch": 0.5211419337462968, "grad_norm": 0.8223238925961407, "learning_rate": 8.416578226611612e-06, "loss": 0.35642185211181643, "num_input_tokens_seen": 338495440, "step": 7740, "train_runtime": 59783.2802, "train_tokens_per_second": 5662.042 }, { "epoch": 0.5214785887422569, "grad_norm": 0.8532576047124709, "learning_rate": 8.414647243546398e-06, "loss": 0.38446238040924074, "num_input_tokens_seen": 338717192, "step": 7745, "train_runtime": 59821.3869, "train_tokens_per_second": 5662.142 }, { "epoch": 0.5218152437382171, "grad_norm": 0.6899241307861492, "learning_rate": 8.412715305585973e-06, "loss": 0.367059588432312, "num_input_tokens_seen": 338946888, "step": 7750, "train_runtime": 59859.9792, "train_tokens_per_second": 5662.329 }, { "epoch": 0.5221518987341772, "grad_norm": 0.7311441327867719, "learning_rate": 8.410782413270594e-06, "loss": 0.3799006462097168, "num_input_tokens_seen": 339172224, "step": 7755, "train_runtime": 59900.1807, "train_tokens_per_second": 5662.29 }, { "epoch": 0.5224885537301374, "grad_norm": 0.9420308727064326, "learning_rate": 8.408848567140787e-06, "loss": 0.37287948131561277, "num_input_tokens_seen": 339364672, "step": 7760, "train_runtime": 59941.0763, "train_tokens_per_second": 5661.638 }, { "epoch": 0.5228252087260975, "grad_norm": 0.7245874800766633, "learning_rate": 8.406913767737353e-06, "loss": 0.37642457485198977, "num_input_tokens_seen": 339579064, "step": 7765, "train_runtime": 59982.2891, "train_tokens_per_second": 5661.322 }, { "epoch": 0.5231618637220576, "grad_norm": 0.7199997285512201, "learning_rate": 8.404978015601344e-06, "loss": 0.3964075565338135, "num_input_tokens_seen": 339801840, "step": 7770, "train_runtime": 60029.6628, "train_tokens_per_second": 5660.566 }, { "epoch": 0.5234985187180178, "grad_norm": 0.697918705663631, "learning_rate": 8.403041311274091e-06, "loss": 0.39160215854644775, "num_input_tokens_seen": 340025832, "step": 7775, "train_runtime": 60071.2747, "train_tokens_per_second": 5660.373 }, { "epoch": 0.5238351737139779, "grad_norm": 0.8157700767931442, "learning_rate": 8.401103655297188e-06, "loss": 0.3895624876022339, "num_input_tokens_seen": 340239616, "step": 7780, "train_runtime": 60105.9113, "train_tokens_per_second": 5660.668 }, { "epoch": 0.5241718287099381, "grad_norm": 0.838923642880136, "learning_rate": 8.399165048212494e-06, "loss": 0.3589164257049561, "num_input_tokens_seen": 340454984, "step": 7785, "train_runtime": 60145.3789, "train_tokens_per_second": 5660.534 }, { "epoch": 0.5245084837058982, "grad_norm": 0.7246920315479125, "learning_rate": 8.397225490562131e-06, "loss": 0.4032485008239746, "num_input_tokens_seen": 340684288, "step": 7790, "train_runtime": 60180.0663, "train_tokens_per_second": 5661.082 }, { "epoch": 0.5248451387018583, "grad_norm": 0.7826576263190983, "learning_rate": 8.395284982888494e-06, "loss": 0.3588679313659668, "num_input_tokens_seen": 340904512, "step": 7795, "train_runtime": 60216.628, "train_tokens_per_second": 5661.302 }, { "epoch": 0.5251817936978185, "grad_norm": 0.7381573756482819, "learning_rate": 8.393343525734239e-06, "loss": 0.39098711013793946, "num_input_tokens_seen": 341128688, "step": 7800, "train_runtime": 60254.8697, "train_tokens_per_second": 5661.429 }, { "epoch": 0.5255184486937786, "grad_norm": 0.9510438503863269, "learning_rate": 8.391401119642286e-06, "loss": 0.39932818412780763, "num_input_tokens_seen": 341326256, "step": 7805, "train_runtime": 60302.5843, "train_tokens_per_second": 5660.226 }, { "epoch": 0.5258551036897388, "grad_norm": 0.7551888581389101, "learning_rate": 8.389457765155824e-06, "loss": 0.40273380279541016, "num_input_tokens_seen": 341526840, "step": 7810, "train_runtime": 60347.108, "train_tokens_per_second": 5659.374 }, { "epoch": 0.5261917586856989, "grad_norm": 0.7817537228902953, "learning_rate": 8.387513462818309e-06, "loss": 0.36842942237854004, "num_input_tokens_seen": 341747720, "step": 7815, "train_runtime": 60388.0509, "train_tokens_per_second": 5659.194 }, { "epoch": 0.526528413681659, "grad_norm": 0.76396158135225, "learning_rate": 8.385568213173453e-06, "loss": 0.3687218427658081, "num_input_tokens_seen": 341961736, "step": 7820, "train_runtime": 60430.695, "train_tokens_per_second": 5658.742 }, { "epoch": 0.5268650686776192, "grad_norm": 1.0538784566401151, "learning_rate": 8.383622016765242e-06, "loss": 0.3595340013504028, "num_input_tokens_seen": 342180688, "step": 7825, "train_runtime": 60474.2774, "train_tokens_per_second": 5658.285 }, { "epoch": 0.5272017236735793, "grad_norm": 0.7683842178996437, "learning_rate": 8.381674874137926e-06, "loss": 0.4014129638671875, "num_input_tokens_seen": 342390504, "step": 7830, "train_runtime": 60507.7742, "train_tokens_per_second": 5658.62 }, { "epoch": 0.5275383786695395, "grad_norm": 0.7767541075637882, "learning_rate": 8.379726785836013e-06, "loss": 0.3654167652130127, "num_input_tokens_seen": 342602080, "step": 7835, "train_runtime": 60550.4658, "train_tokens_per_second": 5658.125 }, { "epoch": 0.5278750336654996, "grad_norm": 0.6734458895156976, "learning_rate": 8.377777752404283e-06, "loss": 0.36977086067199705, "num_input_tokens_seen": 342831800, "step": 7840, "train_runtime": 60591.1256, "train_tokens_per_second": 5658.119 }, { "epoch": 0.5282116886614597, "grad_norm": 0.8168160522078569, "learning_rate": 8.375827774387774e-06, "loss": 0.34728164672851564, "num_input_tokens_seen": 343029568, "step": 7845, "train_runtime": 60633.6042, "train_tokens_per_second": 5657.417 }, { "epoch": 0.5285483436574199, "grad_norm": 0.6622532156086101, "learning_rate": 8.373876852331793e-06, "loss": 0.3438518762588501, "num_input_tokens_seen": 343254472, "step": 7850, "train_runtime": 60671.9643, "train_tokens_per_second": 5657.547 }, { "epoch": 0.52888499865338, "grad_norm": 0.7502437558347258, "learning_rate": 8.371924986781909e-06, "loss": 0.38301682472229004, "num_input_tokens_seen": 343470008, "step": 7855, "train_runtime": 60709.3414, "train_tokens_per_second": 5657.614 }, { "epoch": 0.5292216536493402, "grad_norm": 0.7587114327145728, "learning_rate": 8.369972178283955e-06, "loss": 0.36738762855529783, "num_input_tokens_seen": 343698072, "step": 7860, "train_runtime": 60747.59, "train_tokens_per_second": 5657.806 }, { "epoch": 0.5295583086453003, "grad_norm": 0.6881092460250557, "learning_rate": 8.368018427384027e-06, "loss": 0.38115482330322265, "num_input_tokens_seen": 343919960, "step": 7865, "train_runtime": 60791.0097, "train_tokens_per_second": 5657.415 }, { "epoch": 0.5298949636412604, "grad_norm": 0.8355237541845086, "learning_rate": 8.366063734628485e-06, "loss": 0.38156135082244874, "num_input_tokens_seen": 344123568, "step": 7870, "train_runtime": 60827.6415, "train_tokens_per_second": 5657.355 }, { "epoch": 0.5302316186372206, "grad_norm": 0.8303838221096392, "learning_rate": 8.364108100563955e-06, "loss": 0.4007874011993408, "num_input_tokens_seen": 344341784, "step": 7875, "train_runtime": 60864.4296, "train_tokens_per_second": 5657.521 }, { "epoch": 0.5305682736331807, "grad_norm": 0.7925795609225155, "learning_rate": 8.362151525737321e-06, "loss": 0.4212652206420898, "num_input_tokens_seen": 344562552, "step": 7880, "train_runtime": 60901.6398, "train_tokens_per_second": 5657.689 }, { "epoch": 0.5309049286291408, "grad_norm": 0.7468959848481416, "learning_rate": 8.360194010695733e-06, "loss": 0.3570136547088623, "num_input_tokens_seen": 344782336, "step": 7885, "train_runtime": 60942.4135, "train_tokens_per_second": 5657.51 }, { "epoch": 0.531241583625101, "grad_norm": 0.7105479533553207, "learning_rate": 8.358235555986607e-06, "loss": 0.39661598205566406, "num_input_tokens_seen": 345008672, "step": 7890, "train_runtime": 60976.8653, "train_tokens_per_second": 5658.026 }, { "epoch": 0.5315782386210611, "grad_norm": 0.768825896681359, "learning_rate": 8.356276162157613e-06, "loss": 0.3597188234329224, "num_input_tokens_seen": 345216360, "step": 7895, "train_runtime": 61021.9355, "train_tokens_per_second": 5657.25 }, { "epoch": 0.5319148936170213, "grad_norm": 0.711887791776799, "learning_rate": 8.354315829756696e-06, "loss": 0.37782256603240966, "num_input_tokens_seen": 345442968, "step": 7900, "train_runtime": 61056.926, "train_tokens_per_second": 5657.72 }, { "epoch": 0.5322515486129814, "grad_norm": 0.7271488313267995, "learning_rate": 8.352354559332053e-06, "loss": 0.36695542335510256, "num_input_tokens_seen": 345663248, "step": 7905, "train_runtime": 61093.5998, "train_tokens_per_second": 5657.929 }, { "epoch": 0.5325882036089415, "grad_norm": 0.7790624119649752, "learning_rate": 8.350392351432146e-06, "loss": 0.3877138376235962, "num_input_tokens_seen": 345877640, "step": 7910, "train_runtime": 61125.7433, "train_tokens_per_second": 5658.461 }, { "epoch": 0.5329248586049017, "grad_norm": 0.652480198172122, "learning_rate": 8.348429206605702e-06, "loss": 0.3623414754867554, "num_input_tokens_seen": 346113080, "step": 7915, "train_runtime": 61170.1897, "train_tokens_per_second": 5658.199 }, { "epoch": 0.5332615136008618, "grad_norm": 0.8166602948279773, "learning_rate": 8.346465125401706e-06, "loss": 0.41824941635131835, "num_input_tokens_seen": 346331632, "step": 7920, "train_runtime": 61213.7632, "train_tokens_per_second": 5657.741 }, { "epoch": 0.533598168596822, "grad_norm": 0.7338720699869766, "learning_rate": 8.344500108369412e-06, "loss": 0.3689335107803345, "num_input_tokens_seen": 346540104, "step": 7925, "train_runtime": 61254.7218, "train_tokens_per_second": 5657.361 }, { "epoch": 0.5339348235927821, "grad_norm": 0.7241659753104186, "learning_rate": 8.342534156058326e-06, "loss": 0.3848552942276001, "num_input_tokens_seen": 346759048, "step": 7930, "train_runtime": 61293.0183, "train_tokens_per_second": 5657.399 }, { "epoch": 0.5342714785887422, "grad_norm": 0.7284900345851684, "learning_rate": 8.34056726901822e-06, "loss": 0.39329664707183837, "num_input_tokens_seen": 346971992, "step": 7935, "train_runtime": 61333.9961, "train_tokens_per_second": 5657.091 }, { "epoch": 0.5346081335847024, "grad_norm": 0.9343840115025148, "learning_rate": 8.338599447799132e-06, "loss": 0.37961349487304685, "num_input_tokens_seen": 347176784, "step": 7940, "train_runtime": 61367.1004, "train_tokens_per_second": 5657.376 }, { "epoch": 0.5349447885806625, "grad_norm": 0.7650504516817562, "learning_rate": 8.336630692951353e-06, "loss": 0.3706023931503296, "num_input_tokens_seen": 347396336, "step": 7945, "train_runtime": 61405.4086, "train_tokens_per_second": 5657.422 }, { "epoch": 0.5352814435766227, "grad_norm": 0.7809182592661493, "learning_rate": 8.334661005025441e-06, "loss": 0.3996375560760498, "num_input_tokens_seen": 347612392, "step": 7950, "train_runtime": 61443.353, "train_tokens_per_second": 5657.445 }, { "epoch": 0.5356180985725828, "grad_norm": 1.0173782664960012, "learning_rate": 8.332690384572213e-06, "loss": 0.4039102077484131, "num_input_tokens_seen": 347827352, "step": 7955, "train_runtime": 61481.7721, "train_tokens_per_second": 5657.406 }, { "epoch": 0.5359547535685429, "grad_norm": 0.7319934278286511, "learning_rate": 8.330718832142746e-06, "loss": 0.3981315612792969, "num_input_tokens_seen": 348060432, "step": 7960, "train_runtime": 61520.2514, "train_tokens_per_second": 5657.656 }, { "epoch": 0.5362914085645031, "grad_norm": 0.6935185521555359, "learning_rate": 8.328746348288379e-06, "loss": 0.3804043769836426, "num_input_tokens_seen": 348266616, "step": 7965, "train_runtime": 61562.5177, "train_tokens_per_second": 5657.121 }, { "epoch": 0.5366280635604632, "grad_norm": 0.7663090177174399, "learning_rate": 8.32677293356071e-06, "loss": 0.42568235397338866, "num_input_tokens_seen": 348498272, "step": 7970, "train_runtime": 61598.1572, "train_tokens_per_second": 5657.609 }, { "epoch": 0.5369647185564234, "grad_norm": 0.8375018048980476, "learning_rate": 8.324798588511598e-06, "loss": 0.3702836275100708, "num_input_tokens_seen": 348696416, "step": 7975, "train_runtime": 61635.4226, "train_tokens_per_second": 5657.403 }, { "epoch": 0.5373013735523835, "grad_norm": 0.8187637529093583, "learning_rate": 8.322823313693162e-06, "loss": 0.38841800689697265, "num_input_tokens_seen": 348910592, "step": 7980, "train_runtime": 61671.4891, "train_tokens_per_second": 5657.567 }, { "epoch": 0.5376380285483436, "grad_norm": 0.7918621668094143, "learning_rate": 8.320847109657782e-06, "loss": 0.3783905506134033, "num_input_tokens_seen": 349120256, "step": 7985, "train_runtime": 61712.9559, "train_tokens_per_second": 5657.163 }, { "epoch": 0.5379746835443038, "grad_norm": 0.7362861473446518, "learning_rate": 8.318869976958099e-06, "loss": 0.3449576377868652, "num_input_tokens_seen": 349340688, "step": 7990, "train_runtime": 61755.9567, "train_tokens_per_second": 5656.793 }, { "epoch": 0.5383113385402639, "grad_norm": 0.7351144206496397, "learning_rate": 8.316891916147007e-06, "loss": 0.40518803596496583, "num_input_tokens_seen": 349557408, "step": 7995, "train_runtime": 61795.1163, "train_tokens_per_second": 5656.716 }, { "epoch": 0.5386479935362241, "grad_norm": 0.8155814621488839, "learning_rate": 8.314912927777671e-06, "loss": 0.3914914608001709, "num_input_tokens_seen": 349776936, "step": 8000, "train_runtime": 61829.5854, "train_tokens_per_second": 5657.113 }, { "epoch": 0.5389846485321842, "grad_norm": 0.7399640627157749, "learning_rate": 8.312933012403503e-06, "loss": 0.3830781698226929, "num_input_tokens_seen": 349981944, "step": 8005, "train_runtime": 61870.1471, "train_tokens_per_second": 5656.718 }, { "epoch": 0.5393213035281443, "grad_norm": 0.6837705266722391, "learning_rate": 8.310952170578184e-06, "loss": 0.3917949676513672, "num_input_tokens_seen": 350196560, "step": 8010, "train_runtime": 61910.9608, "train_tokens_per_second": 5656.455 }, { "epoch": 0.5396579585241045, "grad_norm": 0.8108035687999815, "learning_rate": 8.308970402855647e-06, "loss": 0.35423126220703127, "num_input_tokens_seen": 350407320, "step": 8015, "train_runtime": 61942.9362, "train_tokens_per_second": 5656.938 }, { "epoch": 0.5399946135200646, "grad_norm": 0.7391585249859578, "learning_rate": 8.306987709790087e-06, "loss": 0.36304192543029784, "num_input_tokens_seen": 350621920, "step": 8020, "train_runtime": 61974.5184, "train_tokens_per_second": 5657.517 }, { "epoch": 0.5403312685160248, "grad_norm": 0.8297400381885977, "learning_rate": 8.305004091935962e-06, "loss": 0.3827538013458252, "num_input_tokens_seen": 350840936, "step": 8025, "train_runtime": 62010.6476, "train_tokens_per_second": 5657.753 }, { "epoch": 0.5406679235119849, "grad_norm": 0.8790917583658322, "learning_rate": 8.303019549847979e-06, "loss": 0.40552120208740233, "num_input_tokens_seen": 351057864, "step": 8030, "train_runtime": 62051.8481, "train_tokens_per_second": 5657.492 }, { "epoch": 0.541004578507945, "grad_norm": 0.7794541942972262, "learning_rate": 8.301034084081114e-06, "loss": 0.38002500534057615, "num_input_tokens_seen": 351285720, "step": 8035, "train_runtime": 62090.6336, "train_tokens_per_second": 5657.628 }, { "epoch": 0.5413412335039052, "grad_norm": 0.8524170296510677, "learning_rate": 8.299047695190592e-06, "loss": 0.408983850479126, "num_input_tokens_seen": 351491576, "step": 8040, "train_runtime": 62127.0664, "train_tokens_per_second": 5657.624 }, { "epoch": 0.5416778884998653, "grad_norm": 0.8835316549178089, "learning_rate": 8.297060383731903e-06, "loss": 0.38953261375427245, "num_input_tokens_seen": 351706376, "step": 8045, "train_runtime": 62162.9599, "train_tokens_per_second": 5657.813 }, { "epoch": 0.5420145434958255, "grad_norm": 0.8130215721187897, "learning_rate": 8.29507215026079e-06, "loss": 0.3989473819732666, "num_input_tokens_seen": 351925296, "step": 8050, "train_runtime": 62194.3013, "train_tokens_per_second": 5658.481 }, { "epoch": 0.5423511984917856, "grad_norm": 0.7698865553206388, "learning_rate": 8.293082995333257e-06, "loss": 0.3805055618286133, "num_input_tokens_seen": 352152728, "step": 8055, "train_runtime": 62235.2959, "train_tokens_per_second": 5658.409 }, { "epoch": 0.5426878534877457, "grad_norm": 0.7925089143300325, "learning_rate": 8.291092919505568e-06, "loss": 0.359727144241333, "num_input_tokens_seen": 352368040, "step": 8060, "train_runtime": 62272.5239, "train_tokens_per_second": 5658.483 }, { "epoch": 0.5430245084837059, "grad_norm": 0.7473619474168591, "learning_rate": 8.289101923334237e-06, "loss": 0.3927903175354004, "num_input_tokens_seen": 352592456, "step": 8065, "train_runtime": 62314.1115, "train_tokens_per_second": 5658.308 }, { "epoch": 0.543361163479666, "grad_norm": 0.8359023777365873, "learning_rate": 8.28711000737604e-06, "loss": 0.37551441192626955, "num_input_tokens_seen": 352801680, "step": 8070, "train_runtime": 62352.2218, "train_tokens_per_second": 5658.205 }, { "epoch": 0.5436978184756261, "grad_norm": 0.8077808908921092, "learning_rate": 8.285117172188013e-06, "loss": 0.3938951253890991, "num_input_tokens_seen": 353025760, "step": 8075, "train_runtime": 62386.0037, "train_tokens_per_second": 5658.733 }, { "epoch": 0.5440344734715863, "grad_norm": 0.8228182913825491, "learning_rate": 8.283123418327443e-06, "loss": 0.4004195213317871, "num_input_tokens_seen": 353244352, "step": 8080, "train_runtime": 62419.1441, "train_tokens_per_second": 5659.231 }, { "epoch": 0.5443711284675464, "grad_norm": 0.693682105218099, "learning_rate": 8.281128746351878e-06, "loss": 0.3595161437988281, "num_input_tokens_seen": 353475168, "step": 8085, "train_runtime": 62453.3189, "train_tokens_per_second": 5659.83 }, { "epoch": 0.5447077834635066, "grad_norm": 0.7187659246186631, "learning_rate": 8.279133156819123e-06, "loss": 0.40300402641296384, "num_input_tokens_seen": 353691088, "step": 8090, "train_runtime": 62496.7209, "train_tokens_per_second": 5659.354 }, { "epoch": 0.5450444384594667, "grad_norm": 0.725512834705303, "learning_rate": 8.277136650287237e-06, "loss": 0.3694662570953369, "num_input_tokens_seen": 353917984, "step": 8095, "train_runtime": 62536.3526, "train_tokens_per_second": 5659.396 }, { "epoch": 0.5453810934554268, "grad_norm": 0.8301428582075541, "learning_rate": 8.275139227314537e-06, "loss": 0.3757363557815552, "num_input_tokens_seen": 354125952, "step": 8100, "train_runtime": 62575.4142, "train_tokens_per_second": 5659.187 }, { "epoch": 0.545717748451387, "grad_norm": 0.7999915594881919, "learning_rate": 8.273140888459594e-06, "loss": 0.4242837905883789, "num_input_tokens_seen": 354358280, "step": 8105, "train_runtime": 62606.4679, "train_tokens_per_second": 5660.091 }, { "epoch": 0.5460544034473471, "grad_norm": 0.9175431453565677, "learning_rate": 8.27114163428124e-06, "loss": 0.3934792518615723, "num_input_tokens_seen": 354575664, "step": 8110, "train_runtime": 62642.1464, "train_tokens_per_second": 5660.337 }, { "epoch": 0.5463910584433073, "grad_norm": 0.7408300214764466, "learning_rate": 8.26914146533856e-06, "loss": 0.38090806007385253, "num_input_tokens_seen": 354808384, "step": 8115, "train_runtime": 62681.8186, "train_tokens_per_second": 5660.467 }, { "epoch": 0.5467277134392674, "grad_norm": 0.7033405910036602, "learning_rate": 8.267140382190892e-06, "loss": 0.3828258037567139, "num_input_tokens_seen": 355026976, "step": 8120, "train_runtime": 62720.5013, "train_tokens_per_second": 5660.461 }, { "epoch": 0.5470643684352275, "grad_norm": 0.6635248689946966, "learning_rate": 8.265138385397835e-06, "loss": 0.3777566432952881, "num_input_tokens_seen": 355244064, "step": 8125, "train_runtime": 62758.0924, "train_tokens_per_second": 5660.53 }, { "epoch": 0.5474010234311877, "grad_norm": 0.6184317548675163, "learning_rate": 8.263135475519241e-06, "loss": 0.34886605739593507, "num_input_tokens_seen": 355483272, "step": 8130, "train_runtime": 62794.3565, "train_tokens_per_second": 5661.07 }, { "epoch": 0.5477376784271478, "grad_norm": 0.7287895081916465, "learning_rate": 8.261131653115216e-06, "loss": 0.42696261405944824, "num_input_tokens_seen": 355711240, "step": 8135, "train_runtime": 62834.333, "train_tokens_per_second": 5661.097 }, { "epoch": 0.548074333423108, "grad_norm": 0.7794435545394348, "learning_rate": 8.259126918746122e-06, "loss": 0.36356501579284667, "num_input_tokens_seen": 355930576, "step": 8140, "train_runtime": 62868.698, "train_tokens_per_second": 5661.491 }, { "epoch": 0.5484109884190681, "grad_norm": 0.6736849599162793, "learning_rate": 8.25712127297258e-06, "loss": 0.3778836250305176, "num_input_tokens_seen": 356150816, "step": 8145, "train_runtime": 62904.5449, "train_tokens_per_second": 5661.766 }, { "epoch": 0.5487476434150282, "grad_norm": 0.7082862793695406, "learning_rate": 8.255114716355459e-06, "loss": 0.4094264507293701, "num_input_tokens_seen": 356382088, "step": 8150, "train_runtime": 62942.0397, "train_tokens_per_second": 5662.068 }, { "epoch": 0.5490842984109884, "grad_norm": 0.6051005207909932, "learning_rate": 8.253107249455887e-06, "loss": 0.3917287826538086, "num_input_tokens_seen": 356602352, "step": 8155, "train_runtime": 62975.3252, "train_tokens_per_second": 5662.573 }, { "epoch": 0.5494209534069485, "grad_norm": 0.7713641151309204, "learning_rate": 8.251098872835247e-06, "loss": 0.39372997283935546, "num_input_tokens_seen": 356825280, "step": 8160, "train_runtime": 63017.9451, "train_tokens_per_second": 5662.28 }, { "epoch": 0.5497576084029087, "grad_norm": 0.6787537110984104, "learning_rate": 8.249089587055175e-06, "loss": 0.3526461601257324, "num_input_tokens_seen": 357037664, "step": 8165, "train_runtime": 63059.5973, "train_tokens_per_second": 5661.908 }, { "epoch": 0.5500942633988688, "grad_norm": 0.6748882087262432, "learning_rate": 8.247079392677558e-06, "loss": 0.3740200996398926, "num_input_tokens_seen": 357257424, "step": 8170, "train_runtime": 63101.2168, "train_tokens_per_second": 5661.657 }, { "epoch": 0.5504309183948289, "grad_norm": 0.7274044025423265, "learning_rate": 8.245068290264544e-06, "loss": 0.3697060108184814, "num_input_tokens_seen": 357480144, "step": 8175, "train_runtime": 63140.8867, "train_tokens_per_second": 5661.627 }, { "epoch": 0.5507675733907891, "grad_norm": 0.7084601443387462, "learning_rate": 8.243056280378531e-06, "loss": 0.37436251640319823, "num_input_tokens_seen": 357699472, "step": 8180, "train_runtime": 63181.8065, "train_tokens_per_second": 5661.432 }, { "epoch": 0.5511042283867492, "grad_norm": 0.7481357333059493, "learning_rate": 8.241043363582171e-06, "loss": 0.36437788009643557, "num_input_tokens_seen": 357926808, "step": 8185, "train_runtime": 63218.2393, "train_tokens_per_second": 5661.765 }, { "epoch": 0.5514408833827094, "grad_norm": 1.0989196799559033, "learning_rate": 8.239029540438369e-06, "loss": 0.3505790948867798, "num_input_tokens_seen": 358145064, "step": 8190, "train_runtime": 63257.3639, "train_tokens_per_second": 5661.713 }, { "epoch": 0.5517775383786695, "grad_norm": 0.7305407817056846, "learning_rate": 8.237014811510284e-06, "loss": 0.3656752109527588, "num_input_tokens_seen": 358369824, "step": 8195, "train_runtime": 63304.7711, "train_tokens_per_second": 5661.024 }, { "epoch": 0.5521141933746296, "grad_norm": 0.6472079948654392, "learning_rate": 8.234999177361329e-06, "loss": 0.3714550018310547, "num_input_tokens_seen": 358596784, "step": 8200, "train_runtime": 63340.7687, "train_tokens_per_second": 5661.39 }, { "epoch": 0.5524508483705898, "grad_norm": 0.7398046092203671, "learning_rate": 8.232982638555169e-06, "loss": 0.40174274444580077, "num_input_tokens_seen": 358820312, "step": 8205, "train_runtime": 63372.9424, "train_tokens_per_second": 5662.043 }, { "epoch": 0.5527875033665499, "grad_norm": 0.7062238114257713, "learning_rate": 8.230965195655724e-06, "loss": 0.39043726921081545, "num_input_tokens_seen": 359055496, "step": 8210, "train_runtime": 63412.4919, "train_tokens_per_second": 5662.22 }, { "epoch": 0.55312415836251, "grad_norm": 0.8164987537109517, "learning_rate": 8.228946849227167e-06, "loss": 0.3990142345428467, "num_input_tokens_seen": 359287376, "step": 8215, "train_runtime": 63449.3085, "train_tokens_per_second": 5662.589 }, { "epoch": 0.5534608133584702, "grad_norm": 0.6938755136640083, "learning_rate": 8.226927599833916e-06, "loss": 0.386507511138916, "num_input_tokens_seen": 359514576, "step": 8220, "train_runtime": 63481.4052, "train_tokens_per_second": 5663.305 }, { "epoch": 0.5537974683544303, "grad_norm": 0.6819170611796698, "learning_rate": 8.224907448040655e-06, "loss": 0.37993340492248534, "num_input_tokens_seen": 359745160, "step": 8225, "train_runtime": 63513.0016, "train_tokens_per_second": 5664.118 }, { "epoch": 0.5541341233503905, "grad_norm": 0.7464665475450891, "learning_rate": 8.222886394412309e-06, "loss": 0.4058523178100586, "num_input_tokens_seen": 359965008, "step": 8230, "train_runtime": 63553.6566, "train_tokens_per_second": 5663.954 }, { "epoch": 0.5544707783463506, "grad_norm": 0.6722302273522195, "learning_rate": 8.220864439514057e-06, "loss": 0.384306526184082, "num_input_tokens_seen": 360194040, "step": 8235, "train_runtime": 63592.1988, "train_tokens_per_second": 5664.123 }, { "epoch": 0.5548074333423108, "grad_norm": 0.6641141478245969, "learning_rate": 8.218841583911338e-06, "loss": 0.3680997848510742, "num_input_tokens_seen": 360409248, "step": 8240, "train_runtime": 63634.667, "train_tokens_per_second": 5663.725 }, { "epoch": 0.5551440883382709, "grad_norm": 0.7528778151335748, "learning_rate": 8.216817828169834e-06, "loss": 0.413088321685791, "num_input_tokens_seen": 360624480, "step": 8245, "train_runtime": 63670.5285, "train_tokens_per_second": 5663.915 }, { "epoch": 0.555480743334231, "grad_norm": 0.8364309542706772, "learning_rate": 8.214793172855481e-06, "loss": 0.36465370655059814, "num_input_tokens_seen": 360837048, "step": 8250, "train_runtime": 63711.1159, "train_tokens_per_second": 5663.644 }, { "epoch": 0.5558173983301912, "grad_norm": 0.6793083765205596, "learning_rate": 8.21276761853447e-06, "loss": 0.36249728202819825, "num_input_tokens_seen": 361060272, "step": 8255, "train_runtime": 63754.6776, "train_tokens_per_second": 5663.275 }, { "epoch": 0.5561540533261513, "grad_norm": 0.8280046723618791, "learning_rate": 8.210741165773238e-06, "loss": 0.39040985107421877, "num_input_tokens_seen": 361294192, "step": 8260, "train_runtime": 63785.4799, "train_tokens_per_second": 5664.207 }, { "epoch": 0.5564907083221114, "grad_norm": 0.7577410939409384, "learning_rate": 8.208713815138476e-06, "loss": 0.36567642688751223, "num_input_tokens_seen": 361524240, "step": 8265, "train_runtime": 63826.3741, "train_tokens_per_second": 5664.183 }, { "epoch": 0.5568273633180716, "grad_norm": 0.6700074247940968, "learning_rate": 8.20668556719713e-06, "loss": 0.35714569091796877, "num_input_tokens_seen": 361732392, "step": 8270, "train_runtime": 63860.1654, "train_tokens_per_second": 5664.445 }, { "epoch": 0.5571640183140317, "grad_norm": 0.7602580503776288, "learning_rate": 8.204656422516388e-06, "loss": 0.3372737646102905, "num_input_tokens_seen": 361946008, "step": 8275, "train_runtime": 63901.2504, "train_tokens_per_second": 5664.146 }, { "epoch": 0.5575006733099919, "grad_norm": 0.8510184000147942, "learning_rate": 8.2026263816637e-06, "loss": 0.38366384506225587, "num_input_tokens_seen": 362152248, "step": 8280, "train_runtime": 63938.3717, "train_tokens_per_second": 5664.083 }, { "epoch": 0.557837328305952, "grad_norm": 0.7613111925807169, "learning_rate": 8.200595445206753e-06, "loss": 0.37342875003814696, "num_input_tokens_seen": 362371096, "step": 8285, "train_runtime": 63979.792, "train_tokens_per_second": 5663.837 }, { "epoch": 0.5581739833019121, "grad_norm": 1.256734854809266, "learning_rate": 8.198563613713497e-06, "loss": 0.37401297092437746, "num_input_tokens_seen": 362579576, "step": 8290, "train_runtime": 64020.2056, "train_tokens_per_second": 5663.518 }, { "epoch": 0.5585106382978723, "grad_norm": 0.7385210193529426, "learning_rate": 8.196530887752127e-06, "loss": 0.3654287338256836, "num_input_tokens_seen": 362803720, "step": 8295, "train_runtime": 64054.0322, "train_tokens_per_second": 5664.026 }, { "epoch": 0.5588472932938324, "grad_norm": 0.8102882370091832, "learning_rate": 8.194497267891086e-06, "loss": 0.37125024795532224, "num_input_tokens_seen": 363027432, "step": 8300, "train_runtime": 64092.3585, "train_tokens_per_second": 5664.13 }, { "epoch": 0.5591839482897926, "grad_norm": 0.7432402409233543, "learning_rate": 8.19246275469907e-06, "loss": 0.3796513795852661, "num_input_tokens_seen": 363254432, "step": 8305, "train_runtime": 64136.3098, "train_tokens_per_second": 5663.788 }, { "epoch": 0.5595206032857528, "grad_norm": 0.6849455308836975, "learning_rate": 8.190427348745027e-06, "loss": 0.36992511749267576, "num_input_tokens_seen": 363479976, "step": 8310, "train_runtime": 64171.4185, "train_tokens_per_second": 5664.204 }, { "epoch": 0.559857258281713, "grad_norm": 0.6998379838638995, "learning_rate": 8.188391050598146e-06, "loss": 0.3632178544998169, "num_input_tokens_seen": 363712504, "step": 8315, "train_runtime": 64216.5044, "train_tokens_per_second": 5663.848 }, { "epoch": 0.5601939132776731, "grad_norm": 0.7737605990707936, "learning_rate": 8.186353860827878e-06, "loss": 0.37043955326080324, "num_input_tokens_seen": 363919784, "step": 8320, "train_runtime": 64256.872, "train_tokens_per_second": 5663.515 }, { "epoch": 0.5605305682736332, "grad_norm": 0.6957700417795362, "learning_rate": 8.184315780003911e-06, "loss": 0.3709959745407104, "num_input_tokens_seen": 364140736, "step": 8325, "train_runtime": 64302.6454, "train_tokens_per_second": 5662.92 }, { "epoch": 0.5608672232695934, "grad_norm": 0.64141155335251, "learning_rate": 8.182276808696193e-06, "loss": 0.40601282119750975, "num_input_tokens_seen": 364348280, "step": 8330, "train_runtime": 64347.1042, "train_tokens_per_second": 5662.233 }, { "epoch": 0.5612038782655535, "grad_norm": 0.6158998839242338, "learning_rate": 8.18023694747491e-06, "loss": 0.3827899694442749, "num_input_tokens_seen": 364574968, "step": 8335, "train_runtime": 64381.872, "train_tokens_per_second": 5662.696 }, { "epoch": 0.5615405332615137, "grad_norm": 0.7883261214385181, "learning_rate": 8.178196196910508e-06, "loss": 0.3656409740447998, "num_input_tokens_seen": 364803736, "step": 8340, "train_runtime": 64421.7397, "train_tokens_per_second": 5662.743 }, { "epoch": 0.5618771882574738, "grad_norm": 0.7366395620437122, "learning_rate": 8.176154557573672e-06, "loss": 0.4000543594360352, "num_input_tokens_seen": 365037240, "step": 8345, "train_runtime": 64459.3416, "train_tokens_per_second": 5663.062 }, { "epoch": 0.5622138432534339, "grad_norm": 0.6985009938577207, "learning_rate": 8.174112030035344e-06, "loss": 0.3629467010498047, "num_input_tokens_seen": 365268200, "step": 8350, "train_runtime": 64493.078, "train_tokens_per_second": 5663.681 }, { "epoch": 0.5625504982493941, "grad_norm": 0.7274783538197038, "learning_rate": 8.172068614866707e-06, "loss": 0.36340205669403075, "num_input_tokens_seen": 365477184, "step": 8355, "train_runtime": 64531.8006, "train_tokens_per_second": 5663.521 }, { "epoch": 0.5628871532453542, "grad_norm": 0.7368665647506253, "learning_rate": 8.170024312639197e-06, "loss": 0.39545679092407227, "num_input_tokens_seen": 365707680, "step": 8360, "train_runtime": 64570.9604, "train_tokens_per_second": 5663.656 }, { "epoch": 0.5632238082413143, "grad_norm": 0.7340645583889084, "learning_rate": 8.167979123924496e-06, "loss": 0.3859426498413086, "num_input_tokens_seen": 365930048, "step": 8365, "train_runtime": 64604.6699, "train_tokens_per_second": 5664.142 }, { "epoch": 0.5635604632372745, "grad_norm": 0.7462104536621238, "learning_rate": 8.165933049294537e-06, "loss": 0.4087996482849121, "num_input_tokens_seen": 366147352, "step": 8370, "train_runtime": 64646.3443, "train_tokens_per_second": 5663.852 }, { "epoch": 0.5638971182332346, "grad_norm": 0.7582565637830365, "learning_rate": 8.163886089321493e-06, "loss": 0.37345223426818847, "num_input_tokens_seen": 366377160, "step": 8375, "train_runtime": 64688.6158, "train_tokens_per_second": 5663.704 }, { "epoch": 0.5642337732291948, "grad_norm": 0.6581884199846296, "learning_rate": 8.161838244577795e-06, "loss": 0.3573953151702881, "num_input_tokens_seen": 366596264, "step": 8380, "train_runtime": 64726.1749, "train_tokens_per_second": 5663.802 }, { "epoch": 0.5645704282251549, "grad_norm": 0.7540331450420041, "learning_rate": 8.159789515636114e-06, "loss": 0.3621669769287109, "num_input_tokens_seen": 366814672, "step": 8385, "train_runtime": 64768.6142, "train_tokens_per_second": 5663.463 }, { "epoch": 0.564907083221115, "grad_norm": 0.7846236965599341, "learning_rate": 8.15773990306937e-06, "loss": 0.39387807846069334, "num_input_tokens_seen": 367010840, "step": 8390, "train_runtime": 64803.6605, "train_tokens_per_second": 5663.428 }, { "epoch": 0.5652437382170752, "grad_norm": 0.8105957793723372, "learning_rate": 8.155689407450732e-06, "loss": 0.37447366714477537, "num_input_tokens_seen": 367235664, "step": 8395, "train_runtime": 64840.3814, "train_tokens_per_second": 5663.688 }, { "epoch": 0.5655803932130353, "grad_norm": 0.7593251086886306, "learning_rate": 8.153638029353615e-06, "loss": 0.3721097707748413, "num_input_tokens_seen": 367439472, "step": 8400, "train_runtime": 64880.3333, "train_tokens_per_second": 5663.341 }, { "epoch": 0.5659170482089955, "grad_norm": 0.7080065499934168, "learning_rate": 8.151585769351678e-06, "loss": 0.416213321685791, "num_input_tokens_seen": 367665000, "step": 8405, "train_runtime": 64915.8566, "train_tokens_per_second": 5663.716 }, { "epoch": 0.5662537032049556, "grad_norm": 0.8290526825274906, "learning_rate": 8.149532628018833e-06, "loss": 0.3906120538711548, "num_input_tokens_seen": 367873544, "step": 8410, "train_runtime": 64954.7801, "train_tokens_per_second": 5663.533 }, { "epoch": 0.5665903582009157, "grad_norm": 0.7887226131302195, "learning_rate": 8.147478605929228e-06, "loss": 0.36734464168548586, "num_input_tokens_seen": 368106424, "step": 8415, "train_runtime": 64988.7811, "train_tokens_per_second": 5664.153 }, { "epoch": 0.5669270131968759, "grad_norm": 0.7105615187211392, "learning_rate": 8.145423703657269e-06, "loss": 0.3696259021759033, "num_input_tokens_seen": 368329816, "step": 8420, "train_runtime": 65035.2437, "train_tokens_per_second": 5663.542 }, { "epoch": 0.567263668192836, "grad_norm": 0.7106675383557719, "learning_rate": 8.143367921777601e-06, "loss": 0.3901944637298584, "num_input_tokens_seen": 368556080, "step": 8425, "train_runtime": 65073.1284, "train_tokens_per_second": 5663.722 }, { "epoch": 0.5676003231887962, "grad_norm": 0.7158037922920018, "learning_rate": 8.141311260865117e-06, "loss": 0.42763843536376955, "num_input_tokens_seen": 368786216, "step": 8430, "train_runtime": 65107.0411, "train_tokens_per_second": 5664.306 }, { "epoch": 0.5679369781847563, "grad_norm": 0.7147505710629092, "learning_rate": 8.139253721494956e-06, "loss": 0.4124480724334717, "num_input_tokens_seen": 368998320, "step": 8435, "train_runtime": 65143.6774, "train_tokens_per_second": 5664.377 }, { "epoch": 0.5682736331807164, "grad_norm": 0.690454346302624, "learning_rate": 8.137195304242502e-06, "loss": 0.3694611549377441, "num_input_tokens_seen": 369221808, "step": 8440, "train_runtime": 65180.1258, "train_tokens_per_second": 5664.638 }, { "epoch": 0.5686102881766766, "grad_norm": 0.6647768706585024, "learning_rate": 8.135136009683387e-06, "loss": 0.3659370899200439, "num_input_tokens_seen": 369439952, "step": 8445, "train_runtime": 65214.1207, "train_tokens_per_second": 5665.03 }, { "epoch": 0.5689469431726367, "grad_norm": 0.7123577020124194, "learning_rate": 8.13307583839348e-06, "loss": 0.37821600437164304, "num_input_tokens_seen": 369665384, "step": 8450, "train_runtime": 65253.9634, "train_tokens_per_second": 5665.026 }, { "epoch": 0.5692835981685969, "grad_norm": 0.7080847091486382, "learning_rate": 8.131014790948908e-06, "loss": 0.3932258367538452, "num_input_tokens_seen": 369885352, "step": 8455, "train_runtime": 65292.5756, "train_tokens_per_second": 5665.045 }, { "epoch": 0.569620253164557, "grad_norm": 0.8175401785926597, "learning_rate": 8.128952867926035e-06, "loss": 0.42728986740112307, "num_input_tokens_seen": 370102168, "step": 8460, "train_runtime": 65326.5467, "train_tokens_per_second": 5665.418 }, { "epoch": 0.5699569081605171, "grad_norm": 0.7636022480938197, "learning_rate": 8.126890069901468e-06, "loss": 0.3966690540313721, "num_input_tokens_seen": 370323328, "step": 8465, "train_runtime": 65365.5452, "train_tokens_per_second": 5665.421 }, { "epoch": 0.5702935631564773, "grad_norm": 0.8306888968108936, "learning_rate": 8.124826397452064e-06, "loss": 0.3729779005050659, "num_input_tokens_seen": 370551792, "step": 8470, "train_runtime": 65403.3941, "train_tokens_per_second": 5665.636 }, { "epoch": 0.5706302181524374, "grad_norm": 0.6975418197600278, "learning_rate": 8.122761851154923e-06, "loss": 0.37224202156066893, "num_input_tokens_seen": 370769584, "step": 8475, "train_runtime": 65437.1957, "train_tokens_per_second": 5666.037 }, { "epoch": 0.5709668731483976, "grad_norm": 0.7691847068239698, "learning_rate": 8.120696431587387e-06, "loss": 0.3793643474578857, "num_input_tokens_seen": 370986856, "step": 8480, "train_runtime": 65477.4237, "train_tokens_per_second": 5665.874 }, { "epoch": 0.5713035281443577, "grad_norm": 0.653136501814857, "learning_rate": 8.118630139327046e-06, "loss": 0.36144418716430665, "num_input_tokens_seen": 371203736, "step": 8485, "train_runtime": 65520.6447, "train_tokens_per_second": 5665.447 }, { "epoch": 0.5716401831403178, "grad_norm": 0.6688068417437787, "learning_rate": 8.116562974951731e-06, "loss": 0.3969851016998291, "num_input_tokens_seen": 371433168, "step": 8490, "train_runtime": 65562.0835, "train_tokens_per_second": 5665.366 }, { "epoch": 0.571976838136278, "grad_norm": 0.6693856135821081, "learning_rate": 8.11449493903952e-06, "loss": 0.37904407978057864, "num_input_tokens_seen": 371661928, "step": 8495, "train_runtime": 65600.9804, "train_tokens_per_second": 5665.494 }, { "epoch": 0.5723134931322381, "grad_norm": 0.6989787293355911, "learning_rate": 8.112426032168727e-06, "loss": 0.39436898231506345, "num_input_tokens_seen": 371877904, "step": 8500, "train_runtime": 65639.9628, "train_tokens_per_second": 5665.419 }, { "epoch": 0.5726501481281983, "grad_norm": 0.6921966447452655, "learning_rate": 8.11035625491792e-06, "loss": 0.35653374195098875, "num_input_tokens_seen": 372083344, "step": 8505, "train_runtime": 65673.4132, "train_tokens_per_second": 5665.662 }, { "epoch": 0.5729868031241584, "grad_norm": 0.7863535213377899, "learning_rate": 8.108285607865907e-06, "loss": 0.3748607158660889, "num_input_tokens_seen": 372296008, "step": 8510, "train_runtime": 65709.8413, "train_tokens_per_second": 5665.757 }, { "epoch": 0.5733234581201185, "grad_norm": 0.7103469377120155, "learning_rate": 8.106214091591731e-06, "loss": 0.36768136024475095, "num_input_tokens_seen": 372517376, "step": 8515, "train_runtime": 65747.0301, "train_tokens_per_second": 5665.919 }, { "epoch": 0.5736601131160787, "grad_norm": 0.8043097859632866, "learning_rate": 8.104141706674693e-06, "loss": 0.3505872249603271, "num_input_tokens_seen": 372744072, "step": 8520, "train_runtime": 65786.4844, "train_tokens_per_second": 5665.967 }, { "epoch": 0.5739967681120388, "grad_norm": 0.7899542715564848, "learning_rate": 8.102068453694324e-06, "loss": 0.39815869331359866, "num_input_tokens_seen": 372965496, "step": 8525, "train_runtime": 65827.1156, "train_tokens_per_second": 5665.834 }, { "epoch": 0.574333423107999, "grad_norm": 0.7007321773126729, "learning_rate": 8.099994333230404e-06, "loss": 0.39165263175964354, "num_input_tokens_seen": 373176000, "step": 8530, "train_runtime": 65869.8446, "train_tokens_per_second": 5665.354 }, { "epoch": 0.5746700781039591, "grad_norm": 0.8059453918533225, "learning_rate": 8.097919345862952e-06, "loss": 0.387595534324646, "num_input_tokens_seen": 373375616, "step": 8535, "train_runtime": 65901.6062, "train_tokens_per_second": 5665.653 }, { "epoch": 0.5750067330999192, "grad_norm": 0.7748964359890478, "learning_rate": 8.095843492172235e-06, "loss": 0.3876967906951904, "num_input_tokens_seen": 373591328, "step": 8540, "train_runtime": 65941.7008, "train_tokens_per_second": 5665.479 }, { "epoch": 0.5753433880958794, "grad_norm": 0.773534060871464, "learning_rate": 8.093766772738758e-06, "loss": 0.3301082611083984, "num_input_tokens_seen": 373805712, "step": 8545, "train_runtime": 65984.3171, "train_tokens_per_second": 5665.069 }, { "epoch": 0.5756800430918395, "grad_norm": 0.7746351168910522, "learning_rate": 8.091689188143267e-06, "loss": 0.3910914659500122, "num_input_tokens_seen": 374017824, "step": 8550, "train_runtime": 66030.3105, "train_tokens_per_second": 5664.335 }, { "epoch": 0.5760166980877997, "grad_norm": 0.7771670247365485, "learning_rate": 8.089610738966754e-06, "loss": 0.3839992046356201, "num_input_tokens_seen": 374221088, "step": 8555, "train_runtime": 66067.2485, "train_tokens_per_second": 5664.245 }, { "epoch": 0.5763533530837598, "grad_norm": 0.8314883209793272, "learning_rate": 8.08753142579045e-06, "loss": 0.41312179565429685, "num_input_tokens_seen": 374438784, "step": 8560, "train_runtime": 66103.0863, "train_tokens_per_second": 5664.468 }, { "epoch": 0.5766900080797199, "grad_norm": 0.7070329659969831, "learning_rate": 8.085451249195828e-06, "loss": 0.369646692276001, "num_input_tokens_seen": 374674400, "step": 8565, "train_runtime": 66144.5198, "train_tokens_per_second": 5664.481 }, { "epoch": 0.5770266630756801, "grad_norm": 0.728101829102978, "learning_rate": 8.083370209764603e-06, "loss": 0.38304858207702636, "num_input_tokens_seen": 374895048, "step": 8570, "train_runtime": 66187.4516, "train_tokens_per_second": 5664.141 }, { "epoch": 0.5773633180716402, "grad_norm": 0.7613212980235913, "learning_rate": 8.081288308078731e-06, "loss": 0.39395363330841066, "num_input_tokens_seen": 375130432, "step": 8575, "train_runtime": 66220.5986, "train_tokens_per_second": 5664.86 }, { "epoch": 0.5776999730676003, "grad_norm": 0.6846318822730251, "learning_rate": 8.07920554472041e-06, "loss": 0.35710582733154295, "num_input_tokens_seen": 375356416, "step": 8580, "train_runtime": 66266.8733, "train_tokens_per_second": 5664.315 }, { "epoch": 0.5780366280635605, "grad_norm": 0.791144672174043, "learning_rate": 8.077121920272075e-06, "loss": 0.3807799816131592, "num_input_tokens_seen": 375586768, "step": 8585, "train_runtime": 66303.4383, "train_tokens_per_second": 5664.665 }, { "epoch": 0.5783732830595206, "grad_norm": 0.6749521518269885, "learning_rate": 8.07503743531641e-06, "loss": 0.3493949890136719, "num_input_tokens_seen": 375796816, "step": 8590, "train_runtime": 66347.6746, "train_tokens_per_second": 5664.054 }, { "epoch": 0.5787099380554808, "grad_norm": 0.7233256642537537, "learning_rate": 8.072952090436328e-06, "loss": 0.34188032150268555, "num_input_tokens_seen": 376025856, "step": 8595, "train_runtime": 66379.0077, "train_tokens_per_second": 5664.831 }, { "epoch": 0.5790465930514409, "grad_norm": 0.8183957573318358, "learning_rate": 8.070865886214996e-06, "loss": 0.378603458404541, "num_input_tokens_seen": 376248416, "step": 8600, "train_runtime": 66412.9945, "train_tokens_per_second": 5665.283 }, { "epoch": 0.579383248047401, "grad_norm": 0.8303736324901154, "learning_rate": 8.06877882323581e-06, "loss": 0.3776103496551514, "num_input_tokens_seen": 376468952, "step": 8605, "train_runtime": 66445.0637, "train_tokens_per_second": 5665.868 }, { "epoch": 0.5797199030433612, "grad_norm": 0.6628257697173621, "learning_rate": 8.066690902082413e-06, "loss": 0.35461578369140623, "num_input_tokens_seen": 376690720, "step": 8610, "train_runtime": 66482.3424, "train_tokens_per_second": 5666.027 }, { "epoch": 0.5800565580393213, "grad_norm": 0.6914119662414026, "learning_rate": 8.064602123338683e-06, "loss": 0.4189821720123291, "num_input_tokens_seen": 376926952, "step": 8615, "train_runtime": 66523.5883, "train_tokens_per_second": 5666.065 }, { "epoch": 0.5803932130352815, "grad_norm": 0.7255952843828343, "learning_rate": 8.06251248758874e-06, "loss": 0.3706305980682373, "num_input_tokens_seen": 377137424, "step": 8620, "train_runtime": 66560.9464, "train_tokens_per_second": 5666.047 }, { "epoch": 0.5807298680312416, "grad_norm": 0.7888860114164491, "learning_rate": 8.060421995416949e-06, "loss": 0.4162487030029297, "num_input_tokens_seen": 377341792, "step": 8625, "train_runtime": 66601.9228, "train_tokens_per_second": 5665.629 }, { "epoch": 0.5810665230272017, "grad_norm": 0.8097744521376653, "learning_rate": 8.058330647407904e-06, "loss": 0.3742199420928955, "num_input_tokens_seen": 377553480, "step": 8630, "train_runtime": 66640.7232, "train_tokens_per_second": 5665.507 }, { "epoch": 0.5814031780231619, "grad_norm": 0.9311380768738048, "learning_rate": 8.056238444146445e-06, "loss": 0.4032620429992676, "num_input_tokens_seen": 377768576, "step": 8635, "train_runtime": 66676.5105, "train_tokens_per_second": 5665.692 }, { "epoch": 0.581739833019122, "grad_norm": 0.7908376307807878, "learning_rate": 8.054145386217652e-06, "loss": 0.35233349800109864, "num_input_tokens_seen": 377990912, "step": 8640, "train_runtime": 66709.357, "train_tokens_per_second": 5666.235 }, { "epoch": 0.5820764880150822, "grad_norm": 0.7544609324314604, "learning_rate": 8.05205147420684e-06, "loss": 0.36639404296875, "num_input_tokens_seen": 378205832, "step": 8645, "train_runtime": 66742.4566, "train_tokens_per_second": 5666.645 }, { "epoch": 0.5824131430110423, "grad_norm": 0.8852523330609511, "learning_rate": 8.049956708699567e-06, "loss": 0.41215500831604, "num_input_tokens_seen": 378422632, "step": 8650, "train_runtime": 66779.3643, "train_tokens_per_second": 5666.76 }, { "epoch": 0.5827497980070024, "grad_norm": 0.7748134898838014, "learning_rate": 8.047861090281623e-06, "loss": 0.4017993450164795, "num_input_tokens_seen": 378636312, "step": 8655, "train_runtime": 66817.0207, "train_tokens_per_second": 5666.764 }, { "epoch": 0.5830864530029626, "grad_norm": 0.7174936151093502, "learning_rate": 8.045764619539047e-06, "loss": 0.36281633377075195, "num_input_tokens_seen": 378862480, "step": 8660, "train_runtime": 66859.5287, "train_tokens_per_second": 5666.544 }, { "epoch": 0.5834231079989227, "grad_norm": 0.7177129776779663, "learning_rate": 8.043667297058106e-06, "loss": 0.3568310022354126, "num_input_tokens_seen": 379073648, "step": 8665, "train_runtime": 66894.7683, "train_tokens_per_second": 5666.716 }, { "epoch": 0.5837597629948829, "grad_norm": 0.671557492383721, "learning_rate": 8.04156912342531e-06, "loss": 0.3924489259719849, "num_input_tokens_seen": 379296048, "step": 8670, "train_runtime": 66930.6354, "train_tokens_per_second": 5667.002 }, { "epoch": 0.584096417990843, "grad_norm": 0.8338696138817213, "learning_rate": 8.03947009922741e-06, "loss": 0.3730125904083252, "num_input_tokens_seen": 379514216, "step": 8675, "train_runtime": 66971.0506, "train_tokens_per_second": 5666.84 }, { "epoch": 0.5844330729868031, "grad_norm": 0.8046977070640711, "learning_rate": 8.037370225051387e-06, "loss": 0.4212483406066895, "num_input_tokens_seen": 379726496, "step": 8680, "train_runtime": 67011.5775, "train_tokens_per_second": 5666.58 }, { "epoch": 0.5847697279827633, "grad_norm": 0.747137316814288, "learning_rate": 8.035269501484467e-06, "loss": 0.3820772886276245, "num_input_tokens_seen": 379952664, "step": 8685, "train_runtime": 67045.976, "train_tokens_per_second": 5667.047 }, { "epoch": 0.5851063829787234, "grad_norm": 0.7779439978184742, "learning_rate": 8.03316792911411e-06, "loss": 0.41135897636413576, "num_input_tokens_seen": 380168720, "step": 8690, "train_runtime": 67086.3352, "train_tokens_per_second": 5666.858 }, { "epoch": 0.5854430379746836, "grad_norm": 0.6815474179189787, "learning_rate": 8.031065508528011e-06, "loss": 0.35835254192352295, "num_input_tokens_seen": 380396160, "step": 8695, "train_runtime": 67124.515, "train_tokens_per_second": 5667.023 }, { "epoch": 0.5857796929706437, "grad_norm": 0.7133086557979279, "learning_rate": 8.028962240314111e-06, "loss": 0.3686984539031982, "num_input_tokens_seen": 380620472, "step": 8700, "train_runtime": 67161.6095, "train_tokens_per_second": 5667.233 }, { "epoch": 0.5861163479666038, "grad_norm": 0.7088226284029326, "learning_rate": 8.026858125060577e-06, "loss": 0.3879531383514404, "num_input_tokens_seen": 380837592, "step": 8705, "train_runtime": 67201.0534, "train_tokens_per_second": 5667.137 }, { "epoch": 0.586453002962564, "grad_norm": 0.7612804968151702, "learning_rate": 8.024753163355821e-06, "loss": 0.4247321128845215, "num_input_tokens_seen": 381061216, "step": 8710, "train_runtime": 67242.9084, "train_tokens_per_second": 5666.935 }, { "epoch": 0.5867896579585241, "grad_norm": 0.7005358220776335, "learning_rate": 8.022647355788489e-06, "loss": 0.3679481029510498, "num_input_tokens_seen": 381280288, "step": 8715, "train_runtime": 67281.4067, "train_tokens_per_second": 5666.949 }, { "epoch": 0.5871263129544843, "grad_norm": 0.728044784671465, "learning_rate": 8.02054070294746e-06, "loss": 0.40247626304626466, "num_input_tokens_seen": 381496992, "step": 8720, "train_runtime": 67319.4589, "train_tokens_per_second": 5666.965 }, { "epoch": 0.5874629679504444, "grad_norm": 0.7052792472604399, "learning_rate": 8.018433205421859e-06, "loss": 0.36869523525238035, "num_input_tokens_seen": 381727008, "step": 8725, "train_runtime": 67359.8794, "train_tokens_per_second": 5666.979 }, { "epoch": 0.5877996229464045, "grad_norm": 0.8148613184034657, "learning_rate": 8.016324863801036e-06, "loss": 0.3896385669708252, "num_input_tokens_seen": 381950608, "step": 8730, "train_runtime": 67395.2795, "train_tokens_per_second": 5667.32 }, { "epoch": 0.5881362779423647, "grad_norm": 0.7008873936428064, "learning_rate": 8.014215678674581e-06, "loss": 0.397304368019104, "num_input_tokens_seen": 382173664, "step": 8735, "train_runtime": 67436.6612, "train_tokens_per_second": 5667.15 }, { "epoch": 0.5884729329383248, "grad_norm": 0.6667026328000061, "learning_rate": 8.012105650632325e-06, "loss": 0.37210235595703123, "num_input_tokens_seen": 382388568, "step": 8740, "train_runtime": 67476.723, "train_tokens_per_second": 5666.97 }, { "epoch": 0.588809587934285, "grad_norm": 0.7893753618716253, "learning_rate": 8.009994780264328e-06, "loss": 0.38750429153442384, "num_input_tokens_seen": 382584944, "step": 8745, "train_runtime": 67517.8366, "train_tokens_per_second": 5666.428 }, { "epoch": 0.5891462429302451, "grad_norm": 0.7520095638811525, "learning_rate": 8.00788306816089e-06, "loss": 0.38128883838653566, "num_input_tokens_seen": 382801808, "step": 8750, "train_runtime": 67554.4917, "train_tokens_per_second": 5666.563 }, { "epoch": 0.5894828979262052, "grad_norm": 0.7841152997217926, "learning_rate": 8.005770514912543e-06, "loss": 0.39379191398620605, "num_input_tokens_seen": 383025832, "step": 8755, "train_runtime": 67593.0084, "train_tokens_per_second": 5666.649 }, { "epoch": 0.5898195529221654, "grad_norm": 0.728445499817985, "learning_rate": 8.003657121110055e-06, "loss": 0.3845071792602539, "num_input_tokens_seen": 383260728, "step": 8760, "train_runtime": 67628.415, "train_tokens_per_second": 5667.155 }, { "epoch": 0.5901562079181255, "grad_norm": 0.7109388567699519, "learning_rate": 8.001542887344432e-06, "loss": 0.36870722770690917, "num_input_tokens_seen": 383481016, "step": 8765, "train_runtime": 67663.424, "train_tokens_per_second": 5667.479 }, { "epoch": 0.5904928629140856, "grad_norm": 0.7379119456141738, "learning_rate": 7.999427814206911e-06, "loss": 0.38972065448760984, "num_input_tokens_seen": 383699928, "step": 8770, "train_runtime": 67698.1314, "train_tokens_per_second": 5667.807 }, { "epoch": 0.5908295179100458, "grad_norm": 0.7977299068456677, "learning_rate": 7.997311902288968e-06, "loss": 0.3479362964630127, "num_input_tokens_seen": 383923208, "step": 8775, "train_runtime": 67735.622, "train_tokens_per_second": 5667.966 }, { "epoch": 0.5911661729060059, "grad_norm": 0.6927052461533478, "learning_rate": 7.995195152182307e-06, "loss": 0.35241219997406004, "num_input_tokens_seen": 384124912, "step": 8780, "train_runtime": 67775.1001, "train_tokens_per_second": 5667.641 }, { "epoch": 0.5915028279019661, "grad_norm": 1.8520827992951523, "learning_rate": 7.993077564478875e-06, "loss": 0.367362380027771, "num_input_tokens_seen": 384352936, "step": 8785, "train_runtime": 67813.9355, "train_tokens_per_second": 5667.757 }, { "epoch": 0.5918394828979262, "grad_norm": 0.8136091755899332, "learning_rate": 7.990959139770844e-06, "loss": 0.3980868339538574, "num_input_tokens_seen": 384586952, "step": 8790, "train_runtime": 67855.5637, "train_tokens_per_second": 5667.729 }, { "epoch": 0.5921761378938863, "grad_norm": 0.7689488310801835, "learning_rate": 7.988839878650628e-06, "loss": 0.3829834461212158, "num_input_tokens_seen": 384813912, "step": 8795, "train_runtime": 67899.407, "train_tokens_per_second": 5667.412 }, { "epoch": 0.5925127928898465, "grad_norm": 0.7981067639524714, "learning_rate": 7.986719781710872e-06, "loss": 0.3936153411865234, "num_input_tokens_seen": 385040600, "step": 8800, "train_runtime": 67941.2356, "train_tokens_per_second": 5667.259 }, { "epoch": 0.5928494478858066, "grad_norm": 0.7888638773984543, "learning_rate": 7.984598849544452e-06, "loss": 0.37601919174194337, "num_input_tokens_seen": 385256736, "step": 8805, "train_runtime": 67980.1555, "train_tokens_per_second": 5667.194 }, { "epoch": 0.5931861028817668, "grad_norm": 0.8141275660860262, "learning_rate": 7.98247708274448e-06, "loss": 0.3897037744522095, "num_input_tokens_seen": 385471192, "step": 8810, "train_runtime": 68015.2704, "train_tokens_per_second": 5667.421 }, { "epoch": 0.5935227578777269, "grad_norm": 0.7312305067797448, "learning_rate": 7.980354481904303e-06, "loss": 0.4111155033111572, "num_input_tokens_seen": 385695968, "step": 8815, "train_runtime": 68053.7353, "train_tokens_per_second": 5667.521 }, { "epoch": 0.593859412873687, "grad_norm": 0.8597141063820571, "learning_rate": 7.978231047617498e-06, "loss": 0.41021156311035156, "num_input_tokens_seen": 385910576, "step": 8820, "train_runtime": 68091.813, "train_tokens_per_second": 5667.503 }, { "epoch": 0.5941960678696472, "grad_norm": 0.7977576371807428, "learning_rate": 7.976106780477878e-06, "loss": 0.4051943778991699, "num_input_tokens_seen": 386135568, "step": 8825, "train_runtime": 68134.8361, "train_tokens_per_second": 5667.227 }, { "epoch": 0.5945327228656073, "grad_norm": 0.7369358873224232, "learning_rate": 7.973981681079487e-06, "loss": 0.3718585729598999, "num_input_tokens_seen": 386344944, "step": 8830, "train_runtime": 68175.9892, "train_tokens_per_second": 5666.877 }, { "epoch": 0.5948693778615675, "grad_norm": 0.7361018680183479, "learning_rate": 7.971855750016603e-06, "loss": 0.37234504222869874, "num_input_tokens_seen": 386561056, "step": 8835, "train_runtime": 68210.534, "train_tokens_per_second": 5667.175 }, { "epoch": 0.5952060328575276, "grad_norm": 0.7646438523333068, "learning_rate": 7.969728987883734e-06, "loss": 0.386487340927124, "num_input_tokens_seen": 386782376, "step": 8840, "train_runtime": 68250.0947, "train_tokens_per_second": 5667.133 }, { "epoch": 0.5955426878534877, "grad_norm": 0.8191747882763178, "learning_rate": 7.967601395275624e-06, "loss": 0.38187594413757325, "num_input_tokens_seen": 386999696, "step": 8845, "train_runtime": 68291.3193, "train_tokens_per_second": 5666.894 }, { "epoch": 0.5958793428494479, "grad_norm": 0.6459146656871505, "learning_rate": 7.965472972787247e-06, "loss": 0.35875325202941893, "num_input_tokens_seen": 387220408, "step": 8850, "train_runtime": 68328.0647, "train_tokens_per_second": 5667.077 }, { "epoch": 0.596215997845408, "grad_norm": 0.7549464702278598, "learning_rate": 7.963343721013808e-06, "loss": 0.3718303680419922, "num_input_tokens_seen": 387455840, "step": 8855, "train_runtime": 68366.913, "train_tokens_per_second": 5667.3 }, { "epoch": 0.5965526528413682, "grad_norm": 0.7558527061932778, "learning_rate": 7.961213640550748e-06, "loss": 0.3902780771255493, "num_input_tokens_seen": 387678720, "step": 8860, "train_runtime": 68410.3443, "train_tokens_per_second": 5666.961 }, { "epoch": 0.5968893078373283, "grad_norm": 0.7082248157089, "learning_rate": 7.959082731993736e-06, "loss": 0.3638461589813232, "num_input_tokens_seen": 387897464, "step": 8865, "train_runtime": 68443.0142, "train_tokens_per_second": 5667.452 }, { "epoch": 0.5972259628332884, "grad_norm": 0.9079660049109616, "learning_rate": 7.956950995938673e-06, "loss": 0.3705005168914795, "num_input_tokens_seen": 388107624, "step": 8870, "train_runtime": 68486.4151, "train_tokens_per_second": 5666.929 }, { "epoch": 0.5975626178292486, "grad_norm": 0.7984526639513112, "learning_rate": 7.954818432981694e-06, "loss": 0.3910086631774902, "num_input_tokens_seen": 388310680, "step": 8875, "train_runtime": 68525.481, "train_tokens_per_second": 5666.661 }, { "epoch": 0.5978992728252087, "grad_norm": 0.7147181194308313, "learning_rate": 7.952685043719162e-06, "loss": 0.3656719923019409, "num_input_tokens_seen": 388533832, "step": 8880, "train_runtime": 68568.5855, "train_tokens_per_second": 5666.353 }, { "epoch": 0.5982359278211689, "grad_norm": 0.7782537183487828, "learning_rate": 7.950550828747672e-06, "loss": 0.37486002445220945, "num_input_tokens_seen": 388754728, "step": 8885, "train_runtime": 68608.906, "train_tokens_per_second": 5666.243 }, { "epoch": 0.598572582817129, "grad_norm": 0.6958894420319796, "learning_rate": 7.948415788664052e-06, "loss": 0.40519165992736816, "num_input_tokens_seen": 388977056, "step": 8890, "train_runtime": 68641.9616, "train_tokens_per_second": 5666.753 }, { "epoch": 0.5989092378130891, "grad_norm": 0.8244159660705994, "learning_rate": 7.946279924065359e-06, "loss": 0.3696116924285889, "num_input_tokens_seen": 389195368, "step": 8895, "train_runtime": 68676.2104, "train_tokens_per_second": 5667.106 }, { "epoch": 0.5992458928090493, "grad_norm": 0.7624772559058, "learning_rate": 7.94414323554888e-06, "loss": 0.3721637725830078, "num_input_tokens_seen": 389424256, "step": 8900, "train_runtime": 68707.9383, "train_tokens_per_second": 5667.82 }, { "epoch": 0.5995825478050094, "grad_norm": 0.7421871285525378, "learning_rate": 7.942005723712135e-06, "loss": 0.3689994812011719, "num_input_tokens_seen": 389659456, "step": 8905, "train_runtime": 68742.7631, "train_tokens_per_second": 5668.371 }, { "epoch": 0.5999192028009696, "grad_norm": 0.7598715011111157, "learning_rate": 7.939867389152868e-06, "loss": 0.36181044578552246, "num_input_tokens_seen": 389878008, "step": 8910, "train_runtime": 68782.9286, "train_tokens_per_second": 5668.238 }, { "epoch": 0.6002558577969297, "grad_norm": 0.7642969305957489, "learning_rate": 7.937728232469062e-06, "loss": 0.3904815435409546, "num_input_tokens_seen": 390090680, "step": 8915, "train_runtime": 68823.5271, "train_tokens_per_second": 5667.984 }, { "epoch": 0.6005925127928898, "grad_norm": 0.7743252489033806, "learning_rate": 7.935588254258921e-06, "loss": 0.407269811630249, "num_input_tokens_seen": 390298200, "step": 8920, "train_runtime": 68859.6954, "train_tokens_per_second": 5668.021 }, { "epoch": 0.60092916778885, "grad_norm": 0.7626396676106256, "learning_rate": 7.933447455120889e-06, "loss": 0.3707296848297119, "num_input_tokens_seen": 390513112, "step": 8925, "train_runtime": 68906.8163, "train_tokens_per_second": 5667.264 }, { "epoch": 0.6012658227848101, "grad_norm": 0.9270450940086636, "learning_rate": 7.931305835653629e-06, "loss": 0.34468765258789064, "num_input_tokens_seen": 390741944, "step": 8930, "train_runtime": 68945.5046, "train_tokens_per_second": 5667.403 }, { "epoch": 0.6016024777807703, "grad_norm": 0.7523711200271979, "learning_rate": 7.929163396456038e-06, "loss": 0.39664325714111326, "num_input_tokens_seen": 390950400, "step": 8935, "train_runtime": 68982.333, "train_tokens_per_second": 5667.399 }, { "epoch": 0.6019391327767304, "grad_norm": 0.7743378155770866, "learning_rate": 7.927020138127245e-06, "loss": 0.369353199005127, "num_input_tokens_seen": 391172832, "step": 8940, "train_runtime": 69022.2251, "train_tokens_per_second": 5667.346 }, { "epoch": 0.6022757877726905, "grad_norm": 0.6649737691389936, "learning_rate": 7.924876061266603e-06, "loss": 0.3477231502532959, "num_input_tokens_seen": 391403392, "step": 8945, "train_runtime": 69060.7271, "train_tokens_per_second": 5667.525 }, { "epoch": 0.6026124427686507, "grad_norm": 0.8428633382608517, "learning_rate": 7.922731166473698e-06, "loss": 0.40044050216674804, "num_input_tokens_seen": 391619536, "step": 8950, "train_runtime": 69095.3564, "train_tokens_per_second": 5667.813 }, { "epoch": 0.6029490977646108, "grad_norm": 0.7797139187172423, "learning_rate": 7.920585454348341e-06, "loss": 0.35779447555541993, "num_input_tokens_seen": 391832424, "step": 8955, "train_runtime": 69130.8816, "train_tokens_per_second": 5667.98 }, { "epoch": 0.603285752760571, "grad_norm": 0.6454426330600102, "learning_rate": 7.918438925490578e-06, "loss": 0.35099799633026124, "num_input_tokens_seen": 392057736, "step": 8960, "train_runtime": 69168.5952, "train_tokens_per_second": 5668.147 }, { "epoch": 0.6036224077565311, "grad_norm": 0.9240196513971288, "learning_rate": 7.916291580500672e-06, "loss": 0.37104010581970215, "num_input_tokens_seen": 392274152, "step": 8965, "train_runtime": 69209.1039, "train_tokens_per_second": 5667.956 }, { "epoch": 0.6039590627524912, "grad_norm": 0.753245828305525, "learning_rate": 7.914143419979127e-06, "loss": 0.36745285987854004, "num_input_tokens_seen": 392499120, "step": 8970, "train_runtime": 69247.1372, "train_tokens_per_second": 5668.092 }, { "epoch": 0.6042957177484514, "grad_norm": 0.6569111554819693, "learning_rate": 7.911994444526667e-06, "loss": 0.34250531196594236, "num_input_tokens_seen": 392720016, "step": 8975, "train_runtime": 69281.6006, "train_tokens_per_second": 5668.46 }, { "epoch": 0.6046323727444115, "grad_norm": 0.6710386941472357, "learning_rate": 7.909844654744246e-06, "loss": 0.3526078939437866, "num_input_tokens_seen": 392945160, "step": 8980, "train_runtime": 69318.5011, "train_tokens_per_second": 5668.691 }, { "epoch": 0.6049690277403716, "grad_norm": 0.7627659966441698, "learning_rate": 7.907694051233044e-06, "loss": 0.38707795143127444, "num_input_tokens_seen": 393164952, "step": 8985, "train_runtime": 69355.9491, "train_tokens_per_second": 5668.799 }, { "epoch": 0.6053056827363318, "grad_norm": 0.6996994069888867, "learning_rate": 7.905542634594476e-06, "loss": 0.3759605884552002, "num_input_tokens_seen": 393392000, "step": 8990, "train_runtime": 69403.0227, "train_tokens_per_second": 5668.226 }, { "epoch": 0.6056423377322919, "grad_norm": 0.7505686616004086, "learning_rate": 7.903390405430174e-06, "loss": 0.36977381706237794, "num_input_tokens_seen": 393611632, "step": 8995, "train_runtime": 69443.7718, "train_tokens_per_second": 5668.062 }, { "epoch": 0.6059789927282521, "grad_norm": 0.7461690774426525, "learning_rate": 7.901237364342003e-06, "loss": 0.3545074939727783, "num_input_tokens_seen": 393813184, "step": 9000, "train_runtime": 69478.2997, "train_tokens_per_second": 5668.147 }, { "epoch": 0.6063156477242122, "grad_norm": 0.692733389183626, "learning_rate": 7.899083511932053e-06, "loss": 0.3470455646514893, "num_input_tokens_seen": 394027272, "step": 9005, "train_runtime": 69518.7288, "train_tokens_per_second": 5667.93 }, { "epoch": 0.6066523027201723, "grad_norm": 0.7055838759339507, "learning_rate": 7.896928848802645e-06, "loss": 0.372318959236145, "num_input_tokens_seen": 394252480, "step": 9010, "train_runtime": 69553.6455, "train_tokens_per_second": 5668.322 }, { "epoch": 0.6069889577161325, "grad_norm": 0.7576301760274441, "learning_rate": 7.894773375556322e-06, "loss": 0.39665966033935546, "num_input_tokens_seen": 394449024, "step": 9015, "train_runtime": 69593.8001, "train_tokens_per_second": 5667.876 }, { "epoch": 0.6073256127120926, "grad_norm": 0.8095166727188953, "learning_rate": 7.892617092795855e-06, "loss": 0.38990225791931155, "num_input_tokens_seen": 394672680, "step": 9020, "train_runtime": 69632.6302, "train_tokens_per_second": 5667.927 }, { "epoch": 0.6076622677080528, "grad_norm": 0.6966710594837849, "learning_rate": 7.890460001124242e-06, "loss": 0.3693479061126709, "num_input_tokens_seen": 394882720, "step": 9025, "train_runtime": 69668.2129, "train_tokens_per_second": 5668.047 }, { "epoch": 0.6079989227040129, "grad_norm": 0.7467966463857733, "learning_rate": 7.888302101144707e-06, "loss": 0.3727553367614746, "num_input_tokens_seen": 395096336, "step": 9030, "train_runtime": 69710.5053, "train_tokens_per_second": 5667.673 }, { "epoch": 0.608335577699973, "grad_norm": 0.7033388740227385, "learning_rate": 7.886143393460699e-06, "loss": 0.38645596504211427, "num_input_tokens_seen": 395327104, "step": 9035, "train_runtime": 69746.6807, "train_tokens_per_second": 5668.042 }, { "epoch": 0.6086722326959332, "grad_norm": 0.717725417977876, "learning_rate": 7.883983878675895e-06, "loss": 0.3641960620880127, "num_input_tokens_seen": 395561000, "step": 9040, "train_runtime": 69794.3801, "train_tokens_per_second": 5667.519 }, { "epoch": 0.6090088876918933, "grad_norm": 0.737338173324883, "learning_rate": 7.881823557394194e-06, "loss": 0.3701021194458008, "num_input_tokens_seen": 395790544, "step": 9045, "train_runtime": 69832.741, "train_tokens_per_second": 5667.693 }, { "epoch": 0.6093455426878535, "grad_norm": 0.7527693128608011, "learning_rate": 7.879662430219728e-06, "loss": 0.35156404972076416, "num_input_tokens_seen": 395987680, "step": 9050, "train_runtime": 69873.2033, "train_tokens_per_second": 5667.232 }, { "epoch": 0.6096821976838136, "grad_norm": 0.8175940814840023, "learning_rate": 7.877500497756843e-06, "loss": 0.4006368637084961, "num_input_tokens_seen": 396207224, "step": 9055, "train_runtime": 69914.8014, "train_tokens_per_second": 5667.001 }, { "epoch": 0.6100188526797737, "grad_norm": 1.0466330679614098, "learning_rate": 7.87533776061012e-06, "loss": 0.3919075012207031, "num_input_tokens_seen": 396431144, "step": 9060, "train_runtime": 69954.8331, "train_tokens_per_second": 5666.959 }, { "epoch": 0.6103555076757339, "grad_norm": 0.7304596174173837, "learning_rate": 7.873174219384362e-06, "loss": 0.3918348789215088, "num_input_tokens_seen": 396647760, "step": 9065, "train_runtime": 69996.3796, "train_tokens_per_second": 5666.69 }, { "epoch": 0.610692162671694, "grad_norm": 0.7556787705072924, "learning_rate": 7.871009874684595e-06, "loss": 0.3941289186477661, "num_input_tokens_seen": 396880640, "step": 9070, "train_runtime": 70028.8034, "train_tokens_per_second": 5667.391 }, { "epoch": 0.6110288176676542, "grad_norm": 0.8397284206623034, "learning_rate": 7.868844727116072e-06, "loss": 0.3926485300064087, "num_input_tokens_seen": 397103976, "step": 9075, "train_runtime": 70068.2945, "train_tokens_per_second": 5667.385 }, { "epoch": 0.6113654726636143, "grad_norm": 0.6869244210168536, "learning_rate": 7.866678777284267e-06, "loss": 0.3840303897857666, "num_input_tokens_seen": 397331160, "step": 9080, "train_runtime": 70102.9706, "train_tokens_per_second": 5667.822 }, { "epoch": 0.6117021276595744, "grad_norm": 0.6366270970878026, "learning_rate": 7.864512025794886e-06, "loss": 0.3659891843795776, "num_input_tokens_seen": 397555992, "step": 9085, "train_runtime": 70142.9573, "train_tokens_per_second": 5667.796 }, { "epoch": 0.6120387826555346, "grad_norm": 0.7702173454778595, "learning_rate": 7.86234447325385e-06, "loss": 0.36196537017822267, "num_input_tokens_seen": 397769720, "step": 9090, "train_runtime": 70185.3981, "train_tokens_per_second": 5667.414 }, { "epoch": 0.6123754376514947, "grad_norm": 0.6638241416823153, "learning_rate": 7.860176120267309e-06, "loss": 0.4144433498382568, "num_input_tokens_seen": 398006352, "step": 9095, "train_runtime": 70227.0746, "train_tokens_per_second": 5667.42 }, { "epoch": 0.6127120926474549, "grad_norm": 0.7106604037911711, "learning_rate": 7.858006967441637e-06, "loss": 0.3602044105529785, "num_input_tokens_seen": 398216992, "step": 9100, "train_runtime": 70268.2952, "train_tokens_per_second": 5667.093 }, { "epoch": 0.613048747643415, "grad_norm": 0.8013079858059877, "learning_rate": 7.85583701538343e-06, "loss": 0.40687074661254885, "num_input_tokens_seen": 398447240, "step": 9105, "train_runtime": 70313.64, "train_tokens_per_second": 5666.713 }, { "epoch": 0.6133854026393751, "grad_norm": 0.8363243678158666, "learning_rate": 7.853666264699506e-06, "loss": 0.3638491153717041, "num_input_tokens_seen": 398656928, "step": 9110, "train_runtime": 70355.8426, "train_tokens_per_second": 5666.295 }, { "epoch": 0.6137220576353353, "grad_norm": 0.6855947504133412, "learning_rate": 7.851494715996914e-06, "loss": 0.41129069328308104, "num_input_tokens_seen": 398870368, "step": 9115, "train_runtime": 70395.581, "train_tokens_per_second": 5666.128 }, { "epoch": 0.6140587126312954, "grad_norm": 0.7613022857869545, "learning_rate": 7.849322369882915e-06, "loss": 0.3685478687286377, "num_input_tokens_seen": 399088536, "step": 9120, "train_runtime": 70444.8636, "train_tokens_per_second": 5665.261 }, { "epoch": 0.6143953676272556, "grad_norm": 0.6988300008519205, "learning_rate": 7.847149226965003e-06, "loss": 0.34872984886169434, "num_input_tokens_seen": 399301232, "step": 9125, "train_runtime": 70485.0506, "train_tokens_per_second": 5665.049 }, { "epoch": 0.6147320226232157, "grad_norm": 0.8477724491109673, "learning_rate": 7.844975287850886e-06, "loss": 0.35025968551635744, "num_input_tokens_seen": 399523504, "step": 9130, "train_runtime": 70522.5255, "train_tokens_per_second": 5665.19 }, { "epoch": 0.6150686776191758, "grad_norm": 0.7692634619323344, "learning_rate": 7.842800553148506e-06, "loss": 0.3998849630355835, "num_input_tokens_seen": 399735256, "step": 9135, "train_runtime": 70558.7444, "train_tokens_per_second": 5665.283 }, { "epoch": 0.615405332615136, "grad_norm": 0.7313920740237436, "learning_rate": 7.840625023466014e-06, "loss": 0.3812243938446045, "num_input_tokens_seen": 399958824, "step": 9140, "train_runtime": 70598.2086, "train_tokens_per_second": 5665.283 }, { "epoch": 0.6157419876110961, "grad_norm": 0.7274387978674163, "learning_rate": 7.838448699411792e-06, "loss": 0.3413673400878906, "num_input_tokens_seen": 400181528, "step": 9145, "train_runtime": 70641.2437, "train_tokens_per_second": 5664.984 }, { "epoch": 0.6160786426070562, "grad_norm": 0.7006449570449917, "learning_rate": 7.836271581594442e-06, "loss": 0.4210306167602539, "num_input_tokens_seen": 400404728, "step": 9150, "train_runtime": 70677.6291, "train_tokens_per_second": 5665.226 }, { "epoch": 0.6164152976030164, "grad_norm": 0.8552267430665972, "learning_rate": 7.834093670622789e-06, "loss": 0.3944708824157715, "num_input_tokens_seen": 400620128, "step": 9155, "train_runtime": 70718.8549, "train_tokens_per_second": 5664.969 }, { "epoch": 0.6167519525989765, "grad_norm": 0.7631479691553084, "learning_rate": 7.831914967105878e-06, "loss": 0.4071969985961914, "num_input_tokens_seen": 400851832, "step": 9160, "train_runtime": 70759.3063, "train_tokens_per_second": 5665.005 }, { "epoch": 0.6170886075949367, "grad_norm": 0.6980894707116475, "learning_rate": 7.829735471652978e-06, "loss": 0.3579000234603882, "num_input_tokens_seen": 401070744, "step": 9165, "train_runtime": 70799.3413, "train_tokens_per_second": 5664.894 }, { "epoch": 0.6174252625908968, "grad_norm": 0.8778577602385942, "learning_rate": 7.827555184873575e-06, "loss": 0.38968710899353026, "num_input_tokens_seen": 401294816, "step": 9170, "train_runtime": 70831.4898, "train_tokens_per_second": 5665.486 }, { "epoch": 0.617761917586857, "grad_norm": 0.6780563561113029, "learning_rate": 7.825374107377381e-06, "loss": 0.35830237865448, "num_input_tokens_seen": 401509200, "step": 9175, "train_runtime": 70873.5987, "train_tokens_per_second": 5665.145 }, { "epoch": 0.6180985725828171, "grad_norm": 0.7956649065370722, "learning_rate": 7.823192239774327e-06, "loss": 0.3784201145172119, "num_input_tokens_seen": 401720584, "step": 9180, "train_runtime": 70913.365, "train_tokens_per_second": 5664.949 }, { "epoch": 0.6184352275787772, "grad_norm": 0.689595538429294, "learning_rate": 7.821009582674567e-06, "loss": 0.3932128667831421, "num_input_tokens_seen": 401937000, "step": 9185, "train_runtime": 70950.5951, "train_tokens_per_second": 5665.026 }, { "epoch": 0.6187718825747374, "grad_norm": 0.7661957206566802, "learning_rate": 7.818826136688473e-06, "loss": 0.41967573165893557, "num_input_tokens_seen": 402163016, "step": 9190, "train_runtime": 70988.3051, "train_tokens_per_second": 5665.201 }, { "epoch": 0.6191085375706975, "grad_norm": 1.24632241828128, "learning_rate": 7.816641902426638e-06, "loss": 0.3871551513671875, "num_input_tokens_seen": 402390608, "step": 9195, "train_runtime": 71026.2689, "train_tokens_per_second": 5665.377 }, { "epoch": 0.6194451925666576, "grad_norm": 0.7754009003596685, "learning_rate": 7.814456880499877e-06, "loss": 0.39989705085754396, "num_input_tokens_seen": 402608440, "step": 9200, "train_runtime": 71059.0686, "train_tokens_per_second": 5665.828 }, { "epoch": 0.6197818475626178, "grad_norm": 0.8050073203615641, "learning_rate": 7.812271071519222e-06, "loss": 0.40456953048706057, "num_input_tokens_seen": 402830072, "step": 9205, "train_runtime": 71092.5653, "train_tokens_per_second": 5666.276 }, { "epoch": 0.6201185025585779, "grad_norm": 0.636871155540424, "learning_rate": 7.810084476095932e-06, "loss": 0.3537304401397705, "num_input_tokens_seen": 403051544, "step": 9210, "train_runtime": 71132.4539, "train_tokens_per_second": 5666.212 }, { "epoch": 0.6204551575545381, "grad_norm": 0.7771337802144807, "learning_rate": 7.807897094841476e-06, "loss": 0.3726407527923584, "num_input_tokens_seen": 403260152, "step": 9215, "train_runtime": 71171.5092, "train_tokens_per_second": 5666.033 }, { "epoch": 0.6207918125504982, "grad_norm": 0.8018367108579978, "learning_rate": 7.805708928367555e-06, "loss": 0.3734896183013916, "num_input_tokens_seen": 403468824, "step": 9220, "train_runtime": 71211.2179, "train_tokens_per_second": 5665.804 }, { "epoch": 0.6211284675464583, "grad_norm": 0.7409189256900955, "learning_rate": 7.803519977286075e-06, "loss": 0.4021895885467529, "num_input_tokens_seen": 403677704, "step": 9225, "train_runtime": 71249.4495, "train_tokens_per_second": 5665.696 }, { "epoch": 0.6214651225424185, "grad_norm": 0.7435590926911755, "learning_rate": 7.801330242209176e-06, "loss": 0.38091113567352297, "num_input_tokens_seen": 403883200, "step": 9230, "train_runtime": 71290.1392, "train_tokens_per_second": 5665.345 }, { "epoch": 0.6218017775383786, "grad_norm": 0.7623979983718003, "learning_rate": 7.799139723749207e-06, "loss": 0.3860699415206909, "num_input_tokens_seen": 404093128, "step": 9235, "train_runtime": 71328.4839, "train_tokens_per_second": 5665.242 }, { "epoch": 0.6221384325343388, "grad_norm": 0.752221691602039, "learning_rate": 7.79694842251874e-06, "loss": 0.3864139080047607, "num_input_tokens_seen": 404319728, "step": 9240, "train_runtime": 71368.1022, "train_tokens_per_second": 5665.272 }, { "epoch": 0.6224750875302989, "grad_norm": 0.669956786900923, "learning_rate": 7.794756339130565e-06, "loss": 0.3734030485153198, "num_input_tokens_seen": 404541968, "step": 9245, "train_runtime": 71411.2121, "train_tokens_per_second": 5664.964 }, { "epoch": 0.622811742526259, "grad_norm": 0.6983661416716165, "learning_rate": 7.792563474197692e-06, "loss": 0.3814718008041382, "num_input_tokens_seen": 404754312, "step": 9250, "train_runtime": 71448.6745, "train_tokens_per_second": 5664.966 }, { "epoch": 0.6231483975222192, "grad_norm": 0.7124131828610318, "learning_rate": 7.79036982833335e-06, "loss": 0.4030300617218018, "num_input_tokens_seen": 404985704, "step": 9255, "train_runtime": 71479.1768, "train_tokens_per_second": 5665.786 }, { "epoch": 0.6234850525181793, "grad_norm": 0.7886397068317147, "learning_rate": 7.78817540215098e-06, "loss": 0.3688653469085693, "num_input_tokens_seen": 405208848, "step": 9260, "train_runtime": 71523.5445, "train_tokens_per_second": 5665.391 }, { "epoch": 0.6238217075141395, "grad_norm": 0.7219385997208987, "learning_rate": 7.78598019626425e-06, "loss": 0.37583611011505125, "num_input_tokens_seen": 405447552, "step": 9265, "train_runtime": 71555.7936, "train_tokens_per_second": 5666.174 }, { "epoch": 0.6241583625100996, "grad_norm": 0.7695265603997767, "learning_rate": 7.783784211287044e-06, "loss": 0.4006516456604004, "num_input_tokens_seen": 405651112, "step": 9270, "train_runtime": 71597.6416, "train_tokens_per_second": 5665.705 }, { "epoch": 0.6244950175060597, "grad_norm": 0.9194045285642082, "learning_rate": 7.78158744783346e-06, "loss": 0.408467960357666, "num_input_tokens_seen": 405873152, "step": 9275, "train_runtime": 71636.7797, "train_tokens_per_second": 5665.709 }, { "epoch": 0.6248316725020199, "grad_norm": 0.7515447419413074, "learning_rate": 7.779389906517813e-06, "loss": 0.35638930797576907, "num_input_tokens_seen": 406086632, "step": 9280, "train_runtime": 71670.2143, "train_tokens_per_second": 5666.045 }, { "epoch": 0.6251683274979801, "grad_norm": 0.7184945703842209, "learning_rate": 7.777191587954645e-06, "loss": 0.3749531745910645, "num_input_tokens_seen": 406298704, "step": 9285, "train_runtime": 71712.7407, "train_tokens_per_second": 5665.642 }, { "epoch": 0.6255049824939403, "grad_norm": 0.8027326683853181, "learning_rate": 7.774992492758704e-06, "loss": 0.36041698455810545, "num_input_tokens_seen": 406502360, "step": 9290, "train_runtime": 71750.3732, "train_tokens_per_second": 5665.509 }, { "epoch": 0.6258416374899004, "grad_norm": 0.7186651340067036, "learning_rate": 7.77279262154496e-06, "loss": 0.38366947174072263, "num_input_tokens_seen": 406727224, "step": 9295, "train_runtime": 71789.6701, "train_tokens_per_second": 5665.54 }, { "epoch": 0.6261782924858605, "grad_norm": 0.8295991455328212, "learning_rate": 7.770591974928604e-06, "loss": 0.3997042655944824, "num_input_tokens_seen": 406958480, "step": 9300, "train_runtime": 71824.8324, "train_tokens_per_second": 5665.986 }, { "epoch": 0.6265149474818207, "grad_norm": 0.7658676057217327, "learning_rate": 7.768390553525034e-06, "loss": 0.3705620527267456, "num_input_tokens_seen": 407186440, "step": 9305, "train_runtime": 71865.0099, "train_tokens_per_second": 5665.99 }, { "epoch": 0.6268516024777808, "grad_norm": 0.7085619378845062, "learning_rate": 7.766188357949875e-06, "loss": 0.3714077711105347, "num_input_tokens_seen": 407407560, "step": 9310, "train_runtime": 71909.2798, "train_tokens_per_second": 5665.577 }, { "epoch": 0.627188257473741, "grad_norm": 0.8341480094252892, "learning_rate": 7.763985388818963e-06, "loss": 0.36980538368225097, "num_input_tokens_seen": 407628232, "step": 9315, "train_runtime": 71949.141, "train_tokens_per_second": 5665.505 }, { "epoch": 0.6275249124697011, "grad_norm": 0.8636262815852889, "learning_rate": 7.76178164674835e-06, "loss": 0.3548977613449097, "num_input_tokens_seen": 407838184, "step": 9320, "train_runtime": 71979.0743, "train_tokens_per_second": 5666.066 }, { "epoch": 0.6278615674656612, "grad_norm": 0.7192127713238392, "learning_rate": 7.759577132354305e-06, "loss": 0.3763836622238159, "num_input_tokens_seen": 408065528, "step": 9325, "train_runtime": 72013.1228, "train_tokens_per_second": 5666.544 }, { "epoch": 0.6281982224616214, "grad_norm": 0.7987348676964026, "learning_rate": 7.757371846253315e-06, "loss": 0.3501241683959961, "num_input_tokens_seen": 408275816, "step": 9330, "train_runtime": 72052.1024, "train_tokens_per_second": 5666.397 }, { "epoch": 0.6285348774575815, "grad_norm": 0.7470954183186648, "learning_rate": 7.755165789062083e-06, "loss": 0.4022618293762207, "num_input_tokens_seen": 408498408, "step": 9335, "train_runtime": 72090.7302, "train_tokens_per_second": 5666.448 }, { "epoch": 0.6288715324535417, "grad_norm": 0.7151603552727446, "learning_rate": 7.752958961397522e-06, "loss": 0.3877957105636597, "num_input_tokens_seen": 408733352, "step": 9340, "train_runtime": 72120.5104, "train_tokens_per_second": 5667.366 }, { "epoch": 0.6292081874495018, "grad_norm": 0.7351213604942984, "learning_rate": 7.750751363876765e-06, "loss": 0.39035401344299314, "num_input_tokens_seen": 408941920, "step": 9345, "train_runtime": 72164.8249, "train_tokens_per_second": 5666.776 }, { "epoch": 0.6295448424454619, "grad_norm": 0.8453874832584365, "learning_rate": 7.748542997117162e-06, "loss": 0.3737621307373047, "num_input_tokens_seen": 409162768, "step": 9350, "train_runtime": 72196.2605, "train_tokens_per_second": 5667.368 }, { "epoch": 0.6298814974414221, "grad_norm": 0.7429854652224369, "learning_rate": 7.746333861736275e-06, "loss": 0.37030327320098877, "num_input_tokens_seen": 409372800, "step": 9355, "train_runtime": 72230.736, "train_tokens_per_second": 5667.571 }, { "epoch": 0.6302181524373822, "grad_norm": 0.8081848245845143, "learning_rate": 7.74412395835188e-06, "loss": 0.3631394386291504, "num_input_tokens_seen": 409583128, "step": 9360, "train_runtime": 72272.2265, "train_tokens_per_second": 5667.227 }, { "epoch": 0.6305548074333424, "grad_norm": 0.6576701373107874, "learning_rate": 7.74191328758197e-06, "loss": 0.37232241630554197, "num_input_tokens_seen": 409794192, "step": 9365, "train_runtime": 72313.6306, "train_tokens_per_second": 5666.901 }, { "epoch": 0.6308914624293025, "grad_norm": 0.735743623178803, "learning_rate": 7.739701850044752e-06, "loss": 0.4075340270996094, "num_input_tokens_seen": 410020536, "step": 9370, "train_runtime": 72350.0803, "train_tokens_per_second": 5667.175 }, { "epoch": 0.6312281174252626, "grad_norm": 0.8241305453975977, "learning_rate": 7.73748964635865e-06, "loss": 0.3718372583389282, "num_input_tokens_seen": 410241072, "step": 9375, "train_runtime": 72387.3064, "train_tokens_per_second": 5667.307 }, { "epoch": 0.6315647724212228, "grad_norm": 0.6824612940355289, "learning_rate": 7.735276677142297e-06, "loss": 0.35228054523468016, "num_input_tokens_seen": 410443760, "step": 9380, "train_runtime": 72423.3738, "train_tokens_per_second": 5667.283 }, { "epoch": 0.6319014274171829, "grad_norm": 0.7420817513182338, "learning_rate": 7.733062943014542e-06, "loss": 0.3992206573486328, "num_input_tokens_seen": 410670656, "step": 9385, "train_runtime": 72463.1943, "train_tokens_per_second": 5667.3 }, { "epoch": 0.632238082413143, "grad_norm": 0.7090881615954795, "learning_rate": 7.730848444594452e-06, "loss": 0.3573267698287964, "num_input_tokens_seen": 410903448, "step": 9390, "train_runtime": 72497.2497, "train_tokens_per_second": 5667.849 }, { "epoch": 0.6325747374091032, "grad_norm": 0.7269251761731511, "learning_rate": 7.7286331825013e-06, "loss": 0.37146763801574706, "num_input_tokens_seen": 411126128, "step": 9395, "train_runtime": 72531.5005, "train_tokens_per_second": 5668.242 }, { "epoch": 0.6329113924050633, "grad_norm": 0.8641784035147556, "learning_rate": 7.72641715735458e-06, "loss": 0.3655902624130249, "num_input_tokens_seen": 411336720, "step": 9400, "train_runtime": 72578.3797, "train_tokens_per_second": 5667.483 }, { "epoch": 0.6332480474010235, "grad_norm": 0.7283249670371048, "learning_rate": 7.724200369773998e-06, "loss": 0.38719449043273924, "num_input_tokens_seen": 411563872, "step": 9405, "train_runtime": 72618.0679, "train_tokens_per_second": 5667.513 }, { "epoch": 0.6335847023969836, "grad_norm": 0.6863677356579423, "learning_rate": 7.721982820379467e-06, "loss": 0.37484476566314695, "num_input_tokens_seen": 411787952, "step": 9410, "train_runtime": 72652.1342, "train_tokens_per_second": 5667.94 }, { "epoch": 0.6339213573929438, "grad_norm": 0.7975234970060876, "learning_rate": 7.719764509791123e-06, "loss": 0.3741923332214355, "num_input_tokens_seen": 411975928, "step": 9415, "train_runtime": 72685.292, "train_tokens_per_second": 5667.941 }, { "epoch": 0.6342580123889039, "grad_norm": 0.735648228811728, "learning_rate": 7.717545438629303e-06, "loss": 0.43533172607421877, "num_input_tokens_seen": 412214368, "step": 9420, "train_runtime": 72721.9474, "train_tokens_per_second": 5668.363 }, { "epoch": 0.634594667384864, "grad_norm": 0.6852408582111305, "learning_rate": 7.71532560751457e-06, "loss": 0.3732184410095215, "num_input_tokens_seen": 412434712, "step": 9425, "train_runtime": 72757.9756, "train_tokens_per_second": 5668.584 }, { "epoch": 0.6349313223808242, "grad_norm": 0.7315681955128508, "learning_rate": 7.713105017067686e-06, "loss": 0.38740081787109376, "num_input_tokens_seen": 412668752, "step": 9430, "train_runtime": 72791.6587, "train_tokens_per_second": 5669.176 }, { "epoch": 0.6352679773767843, "grad_norm": 0.840365118006204, "learning_rate": 7.710883667909639e-06, "loss": 0.37178239822387693, "num_input_tokens_seen": 412886888, "step": 9435, "train_runtime": 72827.5502, "train_tokens_per_second": 5669.378 }, { "epoch": 0.6356046323727444, "grad_norm": 0.7096620735032497, "learning_rate": 7.708661560661617e-06, "loss": 0.3967950105667114, "num_input_tokens_seen": 413111704, "step": 9440, "train_runtime": 72863.4631, "train_tokens_per_second": 5669.669 }, { "epoch": 0.6359412873687046, "grad_norm": 0.7646005775520524, "learning_rate": 7.706438695945026e-06, "loss": 0.39545307159423826, "num_input_tokens_seen": 413330656, "step": 9445, "train_runtime": 72901.529, "train_tokens_per_second": 5669.712 }, { "epoch": 0.6362779423646647, "grad_norm": 0.7774443776922321, "learning_rate": 7.704215074381484e-06, "loss": 0.3966789960861206, "num_input_tokens_seen": 413537792, "step": 9450, "train_runtime": 72937.8522, "train_tokens_per_second": 5669.728 }, { "epoch": 0.6366145973606249, "grad_norm": 0.7509437079381308, "learning_rate": 7.70199069659282e-06, "loss": 0.38933987617492677, "num_input_tokens_seen": 413751760, "step": 9455, "train_runtime": 72973.609, "train_tokens_per_second": 5669.882 }, { "epoch": 0.636951252356585, "grad_norm": 0.7325824670692431, "learning_rate": 7.699765563201075e-06, "loss": 0.3942718982696533, "num_input_tokens_seen": 413978016, "step": 9460, "train_runtime": 73003.9087, "train_tokens_per_second": 5670.628 }, { "epoch": 0.6372879073525451, "grad_norm": 1.211650286474132, "learning_rate": 7.697539674828498e-06, "loss": 0.36391506195068357, "num_input_tokens_seen": 414211120, "step": 9465, "train_runtime": 73043.0392, "train_tokens_per_second": 5670.782 }, { "epoch": 0.6376245623485053, "grad_norm": 0.7046659464816453, "learning_rate": 7.695313032097554e-06, "loss": 0.35442147254943845, "num_input_tokens_seen": 414430048, "step": 9470, "train_runtime": 73079.8991, "train_tokens_per_second": 5670.917 }, { "epoch": 0.6379612173444654, "grad_norm": 0.6947182191976057, "learning_rate": 7.693085635630913e-06, "loss": 0.37603862285614015, "num_input_tokens_seen": 414632320, "step": 9475, "train_runtime": 73126.3077, "train_tokens_per_second": 5670.084 }, { "epoch": 0.6382978723404256, "grad_norm": 0.7520528416471214, "learning_rate": 7.690857486051463e-06, "loss": 0.3694300174713135, "num_input_tokens_seen": 414859816, "step": 9480, "train_runtime": 73166.4344, "train_tokens_per_second": 5670.084 }, { "epoch": 0.6386345273363857, "grad_norm": 0.7317534743877758, "learning_rate": 7.688628583982298e-06, "loss": 0.3734642267227173, "num_input_tokens_seen": 415071856, "step": 9485, "train_runtime": 73208.2652, "train_tokens_per_second": 5669.74 }, { "epoch": 0.6389711823323458, "grad_norm": 0.7042485073751668, "learning_rate": 7.68639893004672e-06, "loss": 0.3597568035125732, "num_input_tokens_seen": 415294888, "step": 9490, "train_runtime": 73249.0074, "train_tokens_per_second": 5669.632 }, { "epoch": 0.639307837328306, "grad_norm": 0.7092737777153273, "learning_rate": 7.684168524868253e-06, "loss": 0.3566474437713623, "num_input_tokens_seen": 415526408, "step": 9495, "train_runtime": 73288.7331, "train_tokens_per_second": 5669.717 }, { "epoch": 0.6396444923242661, "grad_norm": 0.788876930336864, "learning_rate": 7.681937369070612e-06, "loss": 0.37108328342437746, "num_input_tokens_seen": 415741912, "step": 9500, "train_runtime": 73321.3834, "train_tokens_per_second": 5670.132 }, { "epoch": 0.6399811473202263, "grad_norm": 0.7482496645801756, "learning_rate": 7.67970546327774e-06, "loss": 0.3800150156021118, "num_input_tokens_seen": 415962440, "step": 9505, "train_runtime": 73359.2213, "train_tokens_per_second": 5670.213 }, { "epoch": 0.6403178023161864, "grad_norm": 0.7003781550580643, "learning_rate": 7.67747280811378e-06, "loss": 0.3659864902496338, "num_input_tokens_seen": 416179208, "step": 9510, "train_runtime": 73399.2881, "train_tokens_per_second": 5670.071 }, { "epoch": 0.6406544573121465, "grad_norm": 0.6823118163683989, "learning_rate": 7.675239404203088e-06, "loss": 0.35662126541137695, "num_input_tokens_seen": 416394640, "step": 9515, "train_runtime": 73439.5055, "train_tokens_per_second": 5669.9 }, { "epoch": 0.6409911123081067, "grad_norm": 0.7167030632794295, "learning_rate": 7.673005252170226e-06, "loss": 0.3727959156036377, "num_input_tokens_seen": 416620784, "step": 9520, "train_runtime": 73484.0265, "train_tokens_per_second": 5669.542 }, { "epoch": 0.6413277673040668, "grad_norm": 0.7593758397546905, "learning_rate": 7.670770352639968e-06, "loss": 0.3673388957977295, "num_input_tokens_seen": 416826168, "step": 9525, "train_runtime": 73525.2289, "train_tokens_per_second": 5669.158 }, { "epoch": 0.641664422300027, "grad_norm": 0.7362340230809692, "learning_rate": 7.668534706237299e-06, "loss": 0.37580122947692873, "num_input_tokens_seen": 417047480, "step": 9530, "train_runtime": 73556.9783, "train_tokens_per_second": 5669.72 }, { "epoch": 0.6420010772959871, "grad_norm": 0.7543938330712561, "learning_rate": 7.666298313587409e-06, "loss": 0.4170052528381348, "num_input_tokens_seen": 417268504, "step": 9535, "train_runtime": 73597.5716, "train_tokens_per_second": 5669.596 }, { "epoch": 0.6423377322919472, "grad_norm": 0.8008472981307811, "learning_rate": 7.664061175315696e-06, "loss": 0.3715662956237793, "num_input_tokens_seen": 417464000, "step": 9540, "train_runtime": 73631.8047, "train_tokens_per_second": 5669.615 }, { "epoch": 0.6426743872879074, "grad_norm": 0.7188017157103265, "learning_rate": 7.661823292047771e-06, "loss": 0.3764479160308838, "num_input_tokens_seen": 417683920, "step": 9545, "train_runtime": 73672.7623, "train_tokens_per_second": 5669.448 }, { "epoch": 0.6430110422838675, "grad_norm": 0.8895228408009356, "learning_rate": 7.659584664409452e-06, "loss": 0.3806633949279785, "num_input_tokens_seen": 417910080, "step": 9550, "train_runtime": 73714.3818, "train_tokens_per_second": 5669.315 }, { "epoch": 0.6433476972798277, "grad_norm": 0.7813418710468062, "learning_rate": 7.65734529302676e-06, "loss": 0.33327679634094237, "num_input_tokens_seen": 418114864, "step": 9555, "train_runtime": 73751.4559, "train_tokens_per_second": 5669.242 }, { "epoch": 0.6436843522757878, "grad_norm": 0.7440032604844485, "learning_rate": 7.655105178525932e-06, "loss": 0.36725008487701416, "num_input_tokens_seen": 418331608, "step": 9560, "train_runtime": 73789.4942, "train_tokens_per_second": 5669.257 }, { "epoch": 0.6440210072717479, "grad_norm": 0.7428051543591697, "learning_rate": 7.652864321533406e-06, "loss": 0.37874999046325686, "num_input_tokens_seen": 418542736, "step": 9565, "train_runtime": 73827.1886, "train_tokens_per_second": 5669.222 }, { "epoch": 0.6443576622677081, "grad_norm": 0.6906490664289745, "learning_rate": 7.650622722675833e-06, "loss": 0.39217414855957033, "num_input_tokens_seen": 418769104, "step": 9570, "train_runtime": 73869.6555, "train_tokens_per_second": 5669.027 }, { "epoch": 0.6446943172636682, "grad_norm": 0.7836457733135137, "learning_rate": 7.648380382580067e-06, "loss": 0.3911130428314209, "num_input_tokens_seen": 418983272, "step": 9575, "train_runtime": 73911.9877, "train_tokens_per_second": 5668.678 }, { "epoch": 0.6450309722596284, "grad_norm": 0.7191438751807192, "learning_rate": 7.646137301873173e-06, "loss": 0.3877583026885986, "num_input_tokens_seen": 419193152, "step": 9580, "train_runtime": 73952.718, "train_tokens_per_second": 5668.394 }, { "epoch": 0.6453676272555885, "grad_norm": 0.8722963532886264, "learning_rate": 7.643893481182421e-06, "loss": 0.35512332916259765, "num_input_tokens_seen": 419415144, "step": 9585, "train_runtime": 73990.0513, "train_tokens_per_second": 5668.534 }, { "epoch": 0.6457042822515486, "grad_norm": 0.7893095386452317, "learning_rate": 7.641648921135287e-06, "loss": 0.4030734062194824, "num_input_tokens_seen": 419642840, "step": 9590, "train_runtime": 74032.6519, "train_tokens_per_second": 5668.348 }, { "epoch": 0.6460409372475088, "grad_norm": 0.8691991766270082, "learning_rate": 7.639403622359455e-06, "loss": 0.38401873111724855, "num_input_tokens_seen": 419851960, "step": 9595, "train_runtime": 74068.9663, "train_tokens_per_second": 5668.392 }, { "epoch": 0.6463775922434689, "grad_norm": 0.7669041161649485, "learning_rate": 7.637157585482817e-06, "loss": 0.3698650598526001, "num_input_tokens_seen": 420069368, "step": 9600, "train_runtime": 74113.2241, "train_tokens_per_second": 5667.941 }, { "epoch": 0.646714247239429, "grad_norm": 0.6764016385660067, "learning_rate": 7.63491081113347e-06, "loss": 0.3979948043823242, "num_input_tokens_seen": 420301264, "step": 9605, "train_runtime": 74149.7053, "train_tokens_per_second": 5668.28 }, { "epoch": 0.6470509022353892, "grad_norm": 0.7632828915951216, "learning_rate": 7.632663299939718e-06, "loss": 0.4009084701538086, "num_input_tokens_seen": 420528480, "step": 9610, "train_runtime": 74191.7204, "train_tokens_per_second": 5668.132 }, { "epoch": 0.6473875572313493, "grad_norm": 0.7759849429505897, "learning_rate": 7.630415052530066e-06, "loss": 0.37017059326171875, "num_input_tokens_seen": 420744352, "step": 9615, "train_runtime": 74228.9204, "train_tokens_per_second": 5668.2 }, { "epoch": 0.6477242122273095, "grad_norm": 0.7521586068543743, "learning_rate": 7.628166069533235e-06, "loss": 0.3800983905792236, "num_input_tokens_seen": 420951552, "step": 9620, "train_runtime": 74264.9231, "train_tokens_per_second": 5668.242 }, { "epoch": 0.6480608672232696, "grad_norm": 0.8746614520646498, "learning_rate": 7.625916351578141e-06, "loss": 0.4101721286773682, "num_input_tokens_seen": 421168904, "step": 9625, "train_runtime": 74302.0251, "train_tokens_per_second": 5668.337 }, { "epoch": 0.6483975222192297, "grad_norm": 0.645310594782184, "learning_rate": 7.623665899293914e-06, "loss": 0.35078365802764894, "num_input_tokens_seen": 421386640, "step": 9630, "train_runtime": 74343.6656, "train_tokens_per_second": 5668.091 }, { "epoch": 0.6487341772151899, "grad_norm": 0.709824008157462, "learning_rate": 7.621414713309885e-06, "loss": 0.3464890241622925, "num_input_tokens_seen": 421604504, "step": 9635, "train_runtime": 74380.7993, "train_tokens_per_second": 5668.19 }, { "epoch": 0.64907083221115, "grad_norm": 0.6987475287759364, "learning_rate": 7.61916279425559e-06, "loss": 0.38260612487792967, "num_input_tokens_seen": 421833672, "step": 9640, "train_runtime": 74422.4312, "train_tokens_per_second": 5668.099 }, { "epoch": 0.6494074872071102, "grad_norm": 0.727875668145333, "learning_rate": 7.6169101427607716e-06, "loss": 0.38509573936462405, "num_input_tokens_seen": 422067496, "step": 9645, "train_runtime": 74456.6368, "train_tokens_per_second": 5668.635 }, { "epoch": 0.6497441422030703, "grad_norm": 0.7549567194100304, "learning_rate": 7.614656759455375e-06, "loss": 0.38222179412841795, "num_input_tokens_seen": 422289144, "step": 9650, "train_runtime": 74495.8893, "train_tokens_per_second": 5668.623 }, { "epoch": 0.6500807971990304, "grad_norm": 0.8363753913347584, "learning_rate": 7.612402644969555e-06, "loss": 0.38720729351043703, "num_input_tokens_seen": 422500848, "step": 9655, "train_runtime": 74537.09, "train_tokens_per_second": 5668.33 }, { "epoch": 0.6504174521949906, "grad_norm": 0.718216642211442, "learning_rate": 7.6101477999336646e-06, "loss": 0.37707133293151857, "num_input_tokens_seen": 422718672, "step": 9660, "train_runtime": 74584.7849, "train_tokens_per_second": 5667.626 }, { "epoch": 0.6507541071909507, "grad_norm": 0.8872821374211818, "learning_rate": 7.607892224978266e-06, "loss": 0.3739673376083374, "num_input_tokens_seen": 422929480, "step": 9665, "train_runtime": 74620.552, "train_tokens_per_second": 5667.735 }, { "epoch": 0.6510907621869109, "grad_norm": 0.691277480453269, "learning_rate": 7.605635920734122e-06, "loss": 0.3418617010116577, "num_input_tokens_seen": 423142128, "step": 9670, "train_runtime": 74655.9636, "train_tokens_per_second": 5667.895 }, { "epoch": 0.651427417182871, "grad_norm": 0.9025153211455825, "learning_rate": 7.603378887832202e-06, "loss": 0.3855189561843872, "num_input_tokens_seen": 423349056, "step": 9675, "train_runtime": 74695.4667, "train_tokens_per_second": 5667.667 }, { "epoch": 0.6517640721788311, "grad_norm": 0.7073570329177757, "learning_rate": 7.601121126903676e-06, "loss": 0.3803261280059814, "num_input_tokens_seen": 423573240, "step": 9680, "train_runtime": 74738.2061, "train_tokens_per_second": 5667.426 }, { "epoch": 0.6521007271747913, "grad_norm": 0.7609618594052814, "learning_rate": 7.598862638579922e-06, "loss": 0.3738381385803223, "num_input_tokens_seen": 423809440, "step": 9685, "train_runtime": 74781.8146, "train_tokens_per_second": 5667.279 }, { "epoch": 0.6524373821707514, "grad_norm": 0.6698743309851123, "learning_rate": 7.5966034234925205e-06, "loss": 0.3761345624923706, "num_input_tokens_seen": 424041528, "step": 9690, "train_runtime": 74821.3132, "train_tokens_per_second": 5667.39 }, { "epoch": 0.6527740371667116, "grad_norm": 0.7414693193437045, "learning_rate": 7.59434348227325e-06, "loss": 0.43105735778808596, "num_input_tokens_seen": 424268184, "step": 9695, "train_runtime": 74855.3245, "train_tokens_per_second": 5667.842 }, { "epoch": 0.6531106921626717, "grad_norm": 0.8237582570303243, "learning_rate": 7.592082815554098e-06, "loss": 0.40675368309021, "num_input_tokens_seen": 424492616, "step": 9700, "train_runtime": 74894.094, "train_tokens_per_second": 5667.905 }, { "epoch": 0.6534473471586318, "grad_norm": 0.9212376319324829, "learning_rate": 7.58982142396725e-06, "loss": 0.419390869140625, "num_input_tokens_seen": 424686848, "step": 9705, "train_runtime": 74939.3759, "train_tokens_per_second": 5667.072 }, { "epoch": 0.653784002154592, "grad_norm": 0.7691414977900423, "learning_rate": 7.5875593081451e-06, "loss": 0.3695266008377075, "num_input_tokens_seen": 424913632, "step": 9710, "train_runtime": 74985.8205, "train_tokens_per_second": 5666.586 }, { "epoch": 0.6541206571505521, "grad_norm": 0.7263975698689714, "learning_rate": 7.585296468720243e-06, "loss": 0.3619475126266479, "num_input_tokens_seen": 425139040, "step": 9715, "train_runtime": 75026.5575, "train_tokens_per_second": 5666.514 }, { "epoch": 0.6544573121465123, "grad_norm": 0.712706963298683, "learning_rate": 7.5830329063254705e-06, "loss": 0.38277277946472166, "num_input_tokens_seen": 425352824, "step": 9720, "train_runtime": 75065.2226, "train_tokens_per_second": 5666.443 }, { "epoch": 0.6547939671424724, "grad_norm": 0.6764513937336157, "learning_rate": 7.5807686215937835e-06, "loss": 0.38765199184417726, "num_input_tokens_seen": 425565784, "step": 9725, "train_runtime": 75105.3744, "train_tokens_per_second": 5666.249 }, { "epoch": 0.6551306221384325, "grad_norm": 0.7196173883927505, "learning_rate": 7.578503615158379e-06, "loss": 0.3398409366607666, "num_input_tokens_seen": 425778128, "step": 9730, "train_runtime": 75149.2065, "train_tokens_per_second": 5665.77 }, { "epoch": 0.6554672771343927, "grad_norm": 0.646960134820036, "learning_rate": 7.576237887652662e-06, "loss": 0.38698830604553225, "num_input_tokens_seen": 426007040, "step": 9735, "train_runtime": 75188.2698, "train_tokens_per_second": 5665.871 }, { "epoch": 0.6558039321303528, "grad_norm": 0.8063318146524463, "learning_rate": 7.573971439710235e-06, "loss": 0.34668645858764646, "num_input_tokens_seen": 426223488, "step": 9740, "train_runtime": 75225.1526, "train_tokens_per_second": 5665.97 }, { "epoch": 0.656140587126313, "grad_norm": 0.8258091202754753, "learning_rate": 7.571704271964902e-06, "loss": 0.3675506591796875, "num_input_tokens_seen": 426433528, "step": 9745, "train_runtime": 75260.6499, "train_tokens_per_second": 5666.089 }, { "epoch": 0.6564772421222731, "grad_norm": 0.8027675726296949, "learning_rate": 7.56943638505067e-06, "loss": 0.3636334419250488, "num_input_tokens_seen": 426658696, "step": 9750, "train_runtime": 75296.5611, "train_tokens_per_second": 5666.377 }, { "epoch": 0.6568138971182332, "grad_norm": 0.7190477185688757, "learning_rate": 7.567167779601746e-06, "loss": 0.39123508930206297, "num_input_tokens_seen": 426886792, "step": 9755, "train_runtime": 75338.0495, "train_tokens_per_second": 5666.284 }, { "epoch": 0.6571505521141934, "grad_norm": 0.7906692823017727, "learning_rate": 7.56489845625254e-06, "loss": 0.413257360458374, "num_input_tokens_seen": 427104192, "step": 9760, "train_runtime": 75386.2254, "train_tokens_per_second": 5665.547 }, { "epoch": 0.6574872071101535, "grad_norm": 0.7301115269654299, "learning_rate": 7.562628415637659e-06, "loss": 0.369996976852417, "num_input_tokens_seen": 427312504, "step": 9765, "train_runtime": 75426.5577, "train_tokens_per_second": 5665.279 }, { "epoch": 0.6578238621061137, "grad_norm": 0.7224806256488935, "learning_rate": 7.560357658391913e-06, "loss": 0.4071043491363525, "num_input_tokens_seen": 427533792, "step": 9770, "train_runtime": 75465.4869, "train_tokens_per_second": 5665.289 }, { "epoch": 0.6581605171020738, "grad_norm": 0.7268098674561758, "learning_rate": 7.558086185150311e-06, "loss": 0.3804465770721436, "num_input_tokens_seen": 427747608, "step": 9775, "train_runtime": 75507.0805, "train_tokens_per_second": 5665.0 }, { "epoch": 0.6584971720980339, "grad_norm": 0.7850729912855515, "learning_rate": 7.555813996548065e-06, "loss": 0.40397090911865235, "num_input_tokens_seen": 427972008, "step": 9780, "train_runtime": 75543.708, "train_tokens_per_second": 5665.224 }, { "epoch": 0.6588338270939941, "grad_norm": 0.7662329566093665, "learning_rate": 7.553541093220586e-06, "loss": 0.3842537641525269, "num_input_tokens_seen": 428186312, "step": 9785, "train_runtime": 75579.4178, "train_tokens_per_second": 5665.383 }, { "epoch": 0.6591704820899542, "grad_norm": 0.70627363493871, "learning_rate": 7.551267475803481e-06, "loss": 0.37559702396392824, "num_input_tokens_seen": 428413952, "step": 9790, "train_runtime": 75619.0124, "train_tokens_per_second": 5665.426 }, { "epoch": 0.6595071370859144, "grad_norm": 0.7354101668176468, "learning_rate": 7.5489931449325635e-06, "loss": 0.3736457347869873, "num_input_tokens_seen": 428630728, "step": 9795, "train_runtime": 75658.6215, "train_tokens_per_second": 5665.326 }, { "epoch": 0.6598437920818745, "grad_norm": 0.7892531883838505, "learning_rate": 7.546718101243842e-06, "loss": 0.39138045310974123, "num_input_tokens_seen": 428842760, "step": 9800, "train_runtime": 75693.8787, "train_tokens_per_second": 5665.488 }, { "epoch": 0.6601804470778346, "grad_norm": 0.8775677410278766, "learning_rate": 7.544442345373522e-06, "loss": 0.3698113918304443, "num_input_tokens_seen": 429051072, "step": 9805, "train_runtime": 75734.5916, "train_tokens_per_second": 5665.193 }, { "epoch": 0.6605171020737948, "grad_norm": 0.6944135512445987, "learning_rate": 7.542165877958014e-06, "loss": 0.3717064380645752, "num_input_tokens_seen": 429266232, "step": 9810, "train_runtime": 75771.7628, "train_tokens_per_second": 5665.253 }, { "epoch": 0.6608537570697549, "grad_norm": 0.7361334690779209, "learning_rate": 7.539888699633926e-06, "loss": 0.38160529136657717, "num_input_tokens_seen": 429495032, "step": 9815, "train_runtime": 75808.8176, "train_tokens_per_second": 5665.502 }, { "epoch": 0.661190412065715, "grad_norm": 0.8126000202476551, "learning_rate": 7.5376108110380606e-06, "loss": 0.34899187088012695, "num_input_tokens_seen": 429723384, "step": 9820, "train_runtime": 75847.4225, "train_tokens_per_second": 5665.629 }, { "epoch": 0.6615270670616752, "grad_norm": 0.6957748548678448, "learning_rate": 7.535332212807426e-06, "loss": 0.3428369998931885, "num_input_tokens_seen": 429924744, "step": 9825, "train_runtime": 75886.3897, "train_tokens_per_second": 5665.374 }, { "epoch": 0.6618637220576353, "grad_norm": 0.7233083648231398, "learning_rate": 7.53305290557922e-06, "loss": 0.39725618362426757, "num_input_tokens_seen": 430154928, "step": 9830, "train_runtime": 75925.3068, "train_tokens_per_second": 5665.501 }, { "epoch": 0.6622003770535955, "grad_norm": 0.7049996354735961, "learning_rate": 7.530772889990848e-06, "loss": 0.3740149974822998, "num_input_tokens_seen": 430386800, "step": 9835, "train_runtime": 75959.5503, "train_tokens_per_second": 5666.0 }, { "epoch": 0.6625370320495556, "grad_norm": 0.6720383481048683, "learning_rate": 7.528492166679907e-06, "loss": 0.35007429122924805, "num_input_tokens_seen": 430616592, "step": 9840, "train_runtime": 76001.567, "train_tokens_per_second": 5665.891 }, { "epoch": 0.6628736870455157, "grad_norm": 0.6809307882652357, "learning_rate": 7.526210736284194e-06, "loss": 0.38547792434692385, "num_input_tokens_seen": 430820368, "step": 9845, "train_runtime": 76036.0252, "train_tokens_per_second": 5666.003 }, { "epoch": 0.6632103420414759, "grad_norm": 0.7241468747622457, "learning_rate": 7.523928599441706e-06, "loss": 0.3851293087005615, "num_input_tokens_seen": 431045232, "step": 9850, "train_runtime": 76076.642, "train_tokens_per_second": 5665.934 }, { "epoch": 0.663546997037436, "grad_norm": 0.8065697031009399, "learning_rate": 7.5216457567906295e-06, "loss": 0.3921393632888794, "num_input_tokens_seen": 431272728, "step": 9855, "train_runtime": 76119.1303, "train_tokens_per_second": 5665.76 }, { "epoch": 0.6638836520333962, "grad_norm": 0.7363581812525671, "learning_rate": 7.519362208969362e-06, "loss": 0.3589025974273682, "num_input_tokens_seen": 431497576, "step": 9860, "train_runtime": 76164.9303, "train_tokens_per_second": 5665.305 }, { "epoch": 0.6642203070293563, "grad_norm": 0.7028175355387544, "learning_rate": 7.5170779566164855e-06, "loss": 0.39649462699890137, "num_input_tokens_seen": 431716768, "step": 9865, "train_runtime": 76207.7038, "train_tokens_per_second": 5665.002 }, { "epoch": 0.6645569620253164, "grad_norm": 0.8083377822452007, "learning_rate": 7.514793000370783e-06, "loss": 0.39783761501312254, "num_input_tokens_seen": 431927680, "step": 9870, "train_runtime": 76252.3393, "train_tokens_per_second": 5664.452 }, { "epoch": 0.6648936170212766, "grad_norm": 0.7361462900334614, "learning_rate": 7.512507340871239e-06, "loss": 0.3664602756500244, "num_input_tokens_seen": 432144784, "step": 9875, "train_runtime": 76293.2197, "train_tokens_per_second": 5664.262 }, { "epoch": 0.6652302720172367, "grad_norm": 0.7771322596278541, "learning_rate": 7.510220978757028e-06, "loss": 0.39647390842437746, "num_input_tokens_seen": 432361504, "step": 9880, "train_runtime": 76335.1474, "train_tokens_per_second": 5663.99 }, { "epoch": 0.6655669270131969, "grad_norm": 0.9351257512839886, "learning_rate": 7.507933914667524e-06, "loss": 0.4201164722442627, "num_input_tokens_seen": 432586992, "step": 9885, "train_runtime": 76375.8314, "train_tokens_per_second": 5663.925 }, { "epoch": 0.665903582009157, "grad_norm": 0.7531976870702812, "learning_rate": 7.505646149242299e-06, "loss": 0.37460851669311523, "num_input_tokens_seen": 432809080, "step": 9890, "train_runtime": 76415.9118, "train_tokens_per_second": 5663.861 }, { "epoch": 0.6662402370051171, "grad_norm": 0.719734237163997, "learning_rate": 7.503357683121119e-06, "loss": 0.34871246814727785, "num_input_tokens_seen": 433035120, "step": 9895, "train_runtime": 76462.7297, "train_tokens_per_second": 5663.349 }, { "epoch": 0.6665768920010773, "grad_norm": 0.7130561120719486, "learning_rate": 7.501068516943944e-06, "loss": 0.3231820583343506, "num_input_tokens_seen": 433248272, "step": 9900, "train_runtime": 76502.2615, "train_tokens_per_second": 5663.209 }, { "epoch": 0.6669135469970374, "grad_norm": 0.6874890275442226, "learning_rate": 7.498778651350934e-06, "loss": 0.3865694284439087, "num_input_tokens_seen": 433472920, "step": 9905, "train_runtime": 76539.0929, "train_tokens_per_second": 5663.419 }, { "epoch": 0.6672502019929976, "grad_norm": 0.6837593508656135, "learning_rate": 7.496488086982443e-06, "loss": 0.3751338720321655, "num_input_tokens_seen": 433694440, "step": 9910, "train_runtime": 76582.0454, "train_tokens_per_second": 5663.135 }, { "epoch": 0.6675868569889577, "grad_norm": 0.834960347653905, "learning_rate": 7.494196824479019e-06, "loss": 0.37354316711425783, "num_input_tokens_seen": 433909064, "step": 9915, "train_runtime": 76619.6521, "train_tokens_per_second": 5663.156 }, { "epoch": 0.6679235119849178, "grad_norm": 0.6905943083082271, "learning_rate": 7.491904864481406e-06, "loss": 0.3818557024002075, "num_input_tokens_seen": 434122768, "step": 9920, "train_runtime": 76661.7307, "train_tokens_per_second": 5662.835 }, { "epoch": 0.668260166980878, "grad_norm": 0.6608540738794552, "learning_rate": 7.489612207630543e-06, "loss": 0.34175124168396, "num_input_tokens_seen": 434354528, "step": 9925, "train_runtime": 76695.5171, "train_tokens_per_second": 5663.363 }, { "epoch": 0.6685968219768381, "grad_norm": 0.747448764956391, "learning_rate": 7.487318854567566e-06, "loss": 0.37988905906677245, "num_input_tokens_seen": 434564096, "step": 9930, "train_runtime": 76729.4177, "train_tokens_per_second": 5663.592 }, { "epoch": 0.6689334769727983, "grad_norm": 0.7551042289550628, "learning_rate": 7.485024805933803e-06, "loss": 0.3599559307098389, "num_input_tokens_seen": 434767584, "step": 9935, "train_runtime": 76765.8819, "train_tokens_per_second": 5663.552 }, { "epoch": 0.6692701319687584, "grad_norm": 0.6631253047912142, "learning_rate": 7.482730062370776e-06, "loss": 0.3699958086013794, "num_input_tokens_seen": 434981392, "step": 9940, "train_runtime": 76810.3453, "train_tokens_per_second": 5663.057 }, { "epoch": 0.6696067869647185, "grad_norm": 0.7419282684235264, "learning_rate": 7.480434624520205e-06, "loss": 0.3593663215637207, "num_input_tokens_seen": 435217648, "step": 9945, "train_runtime": 76843.0552, "train_tokens_per_second": 5663.721 }, { "epoch": 0.6699434419606787, "grad_norm": 0.7057608866633803, "learning_rate": 7.478138493024001e-06, "loss": 0.3879536151885986, "num_input_tokens_seen": 435444608, "step": 9950, "train_runtime": 76882.5546, "train_tokens_per_second": 5663.764 }, { "epoch": 0.6702800969566388, "grad_norm": 0.740329239724491, "learning_rate": 7.475841668524268e-06, "loss": 0.34809188842773436, "num_input_tokens_seen": 435656280, "step": 9955, "train_runtime": 76923.9627, "train_tokens_per_second": 5663.466 }, { "epoch": 0.670616751952599, "grad_norm": 0.8121045332443452, "learning_rate": 7.473544151663309e-06, "loss": 0.4048673152923584, "num_input_tokens_seen": 435875456, "step": 9960, "train_runtime": 76958.8069, "train_tokens_per_second": 5663.75 }, { "epoch": 0.6709534069485591, "grad_norm": 0.8149107981141157, "learning_rate": 7.471245943083615e-06, "loss": 0.3677277326583862, "num_input_tokens_seen": 436097568, "step": 9965, "train_runtime": 76998.2656, "train_tokens_per_second": 5663.732 }, { "epoch": 0.6712900619445192, "grad_norm": 0.7104981842358721, "learning_rate": 7.468947043427873e-06, "loss": 0.3423744201660156, "num_input_tokens_seen": 436314872, "step": 9970, "train_runtime": 77032.0267, "train_tokens_per_second": 5664.071 }, { "epoch": 0.6716267169404794, "grad_norm": 0.8060621663622469, "learning_rate": 7.466647453338965e-06, "loss": 0.38165833950042727, "num_input_tokens_seen": 436524088, "step": 9975, "train_runtime": 77070.1105, "train_tokens_per_second": 5663.987 }, { "epoch": 0.6719633719364395, "grad_norm": 0.6817255880743095, "learning_rate": 7.464347173459958e-06, "loss": 0.3900636911392212, "num_input_tokens_seen": 436763792, "step": 9980, "train_runtime": 77108.4939, "train_tokens_per_second": 5664.276 }, { "epoch": 0.6723000269323997, "grad_norm": 0.5849966120883113, "learning_rate": 7.462046204434126e-06, "loss": 0.35174126625061036, "num_input_tokens_seen": 437001592, "step": 9985, "train_runtime": 77143.495, "train_tokens_per_second": 5664.789 }, { "epoch": 0.6726366819283598, "grad_norm": 0.819711833914903, "learning_rate": 7.459744546904922e-06, "loss": 0.37253947257995607, "num_input_tokens_seen": 437217472, "step": 9990, "train_runtime": 77177.4484, "train_tokens_per_second": 5665.094 }, { "epoch": 0.6729733369243199, "grad_norm": 0.7103670160362342, "learning_rate": 7.457442201516001e-06, "loss": 0.34635467529296876, "num_input_tokens_seen": 437432256, "step": 9995, "train_runtime": 77222.7561, "train_tokens_per_second": 5664.551 }, { "epoch": 0.6733099919202801, "grad_norm": 0.7772791959365979, "learning_rate": 7.455139168911203e-06, "loss": 0.3714813232421875, "num_input_tokens_seen": 437632184, "step": 10000, "train_runtime": 77259.692, "train_tokens_per_second": 5664.431 }, { "epoch": 0.6736466469162402, "grad_norm": 0.8663644820452563, "learning_rate": 7.452835449734564e-06, "loss": 0.37085671424865724, "num_input_tokens_seen": 437852448, "step": 10005, "train_runtime": 77297.557, "train_tokens_per_second": 5664.506 }, { "epoch": 0.6739833019122003, "grad_norm": 0.6628154115799231, "learning_rate": 7.450531044630315e-06, "loss": 0.35476658344268797, "num_input_tokens_seen": 438072720, "step": 10010, "train_runtime": 77330.8077, "train_tokens_per_second": 5664.918 }, { "epoch": 0.6743199569081605, "grad_norm": 0.7435766802454172, "learning_rate": 7.448225954242874e-06, "loss": 0.3909281253814697, "num_input_tokens_seen": 438300752, "step": 10015, "train_runtime": 77372.9883, "train_tokens_per_second": 5664.777 }, { "epoch": 0.6746566119041206, "grad_norm": 0.7076966807661021, "learning_rate": 7.44592017921685e-06, "loss": 0.37700977325439455, "num_input_tokens_seen": 438521952, "step": 10020, "train_runtime": 77408.1985, "train_tokens_per_second": 5665.058 }, { "epoch": 0.6749932669000808, "grad_norm": 0.7283120289124543, "learning_rate": 7.443613720197048e-06, "loss": 0.39572868347167967, "num_input_tokens_seen": 438742144, "step": 10025, "train_runtime": 77451.6366, "train_tokens_per_second": 5664.724 }, { "epoch": 0.6753299218960409, "grad_norm": 0.8184114176248545, "learning_rate": 7.44130657782846e-06, "loss": 0.35796802043914794, "num_input_tokens_seen": 438946944, "step": 10030, "train_runtime": 77487.5196, "train_tokens_per_second": 5664.744 }, { "epoch": 0.675666576892001, "grad_norm": 0.7168914852518904, "learning_rate": 7.438998752756274e-06, "loss": 0.3807486057281494, "num_input_tokens_seen": 439164968, "step": 10035, "train_runtime": 77530.1548, "train_tokens_per_second": 5664.441 }, { "epoch": 0.6760032318879612, "grad_norm": 0.7003642669524813, "learning_rate": 7.436690245625864e-06, "loss": 0.36953206062316896, "num_input_tokens_seen": 439382032, "step": 10040, "train_runtime": 77568.57, "train_tokens_per_second": 5664.434 }, { "epoch": 0.6763398868839213, "grad_norm": 0.8332693301417188, "learning_rate": 7.434381057082797e-06, "loss": 0.369028639793396, "num_input_tokens_seen": 439590072, "step": 10045, "train_runtime": 77608.9784, "train_tokens_per_second": 5664.165 }, { "epoch": 0.6766765418798815, "grad_norm": 0.7659413901414965, "learning_rate": 7.4320711877728305e-06, "loss": 0.3970766067504883, "num_input_tokens_seen": 439814224, "step": 10050, "train_runtime": 77655.5893, "train_tokens_per_second": 5663.652 }, { "epoch": 0.6770131968758416, "grad_norm": 0.7616766803709787, "learning_rate": 7.429760638341909e-06, "loss": 0.34726481437683104, "num_input_tokens_seen": 440013360, "step": 10055, "train_runtime": 77694.3971, "train_tokens_per_second": 5663.386 }, { "epoch": 0.6773498518718017, "grad_norm": 0.7214303745868783, "learning_rate": 7.427449409436176e-06, "loss": 0.42118000984191895, "num_input_tokens_seen": 440232216, "step": 10060, "train_runtime": 77735.8693, "train_tokens_per_second": 5663.18 }, { "epoch": 0.6776865068677619, "grad_norm": 0.6480309395843215, "learning_rate": 7.425137501701955e-06, "loss": 0.35333929061889646, "num_input_tokens_seen": 440465120, "step": 10065, "train_runtime": 77778.1439, "train_tokens_per_second": 5663.096 }, { "epoch": 0.678023161863722, "grad_norm": 0.8425975984479226, "learning_rate": 7.422824915785765e-06, "loss": 0.3732592582702637, "num_input_tokens_seen": 440684520, "step": 10070, "train_runtime": 77813.6788, "train_tokens_per_second": 5663.33 }, { "epoch": 0.6783598168596822, "grad_norm": 0.7751732244738783, "learning_rate": 7.420511652334313e-06, "loss": 0.3922509431838989, "num_input_tokens_seen": 440888096, "step": 10075, "train_runtime": 77856.5574, "train_tokens_per_second": 5662.825 }, { "epoch": 0.6786964718556423, "grad_norm": 0.746917656110605, "learning_rate": 7.418197711994495e-06, "loss": 0.3609792947769165, "num_input_tokens_seen": 441099168, "step": 10080, "train_runtime": 77896.5389, "train_tokens_per_second": 5662.629 }, { "epoch": 0.6790331268516024, "grad_norm": 0.7979148491415948, "learning_rate": 7.4158830954133984e-06, "loss": 0.37356295585632326, "num_input_tokens_seen": 441329664, "step": 10085, "train_runtime": 77936.3536, "train_tokens_per_second": 5662.693 }, { "epoch": 0.6793697818475626, "grad_norm": 0.7047169214626602, "learning_rate": 7.413567803238298e-06, "loss": 0.36446294784545896, "num_input_tokens_seen": 441545160, "step": 10090, "train_runtime": 77973.8265, "train_tokens_per_second": 5662.736 }, { "epoch": 0.6797064368435227, "grad_norm": 0.6385696916431561, "learning_rate": 7.411251836116658e-06, "loss": 0.3654582977294922, "num_input_tokens_seen": 441770600, "step": 10095, "train_runtime": 78021.2974, "train_tokens_per_second": 5662.18 }, { "epoch": 0.6800430918394829, "grad_norm": 0.675501708680357, "learning_rate": 7.408935194696132e-06, "loss": 0.38489809036254885, "num_input_tokens_seen": 441989608, "step": 10100, "train_runtime": 78062.7748, "train_tokens_per_second": 5661.977 }, { "epoch": 0.680379746835443, "grad_norm": 0.6976086448861777, "learning_rate": 7.406617879624558e-06, "loss": 0.39519965648651123, "num_input_tokens_seen": 442219464, "step": 10105, "train_runtime": 78104.0438, "train_tokens_per_second": 5661.928 }, { "epoch": 0.6807164018314031, "grad_norm": 0.6737767286617782, "learning_rate": 7.40429989154997e-06, "loss": 0.35456171035766604, "num_input_tokens_seen": 442434504, "step": 10110, "train_runtime": 78146.9907, "train_tokens_per_second": 5661.568 }, { "epoch": 0.6810530568273633, "grad_norm": 0.6824592254845565, "learning_rate": 7.4019812311205826e-06, "loss": 0.396740984916687, "num_input_tokens_seen": 442663960, "step": 10115, "train_runtime": 78186.9172, "train_tokens_per_second": 5661.612 }, { "epoch": 0.6813897118233234, "grad_norm": 0.6995329567504307, "learning_rate": 7.399661898984805e-06, "loss": 0.39820547103881837, "num_input_tokens_seen": 442904544, "step": 10120, "train_runtime": 78228.9374, "train_tokens_per_second": 5661.646 }, { "epoch": 0.6817263668192836, "grad_norm": 0.7146974067721376, "learning_rate": 7.397341895791228e-06, "loss": 0.3785873889923096, "num_input_tokens_seen": 443119656, "step": 10125, "train_runtime": 78271.2656, "train_tokens_per_second": 5661.332 }, { "epoch": 0.6820630218152437, "grad_norm": 0.7979315787216683, "learning_rate": 7.395021222188634e-06, "loss": 0.37588326930999755, "num_input_tokens_seen": 443345048, "step": 10130, "train_runtime": 78307.7048, "train_tokens_per_second": 5661.576 }, { "epoch": 0.6823996768112038, "grad_norm": 0.8569372783831029, "learning_rate": 7.392699878825993e-06, "loss": 0.4026289939880371, "num_input_tokens_seen": 443550416, "step": 10135, "train_runtime": 78348.8182, "train_tokens_per_second": 5661.227 }, { "epoch": 0.682736331807164, "grad_norm": 0.6799351048003278, "learning_rate": 7.390377866352462e-06, "loss": 0.3739679574966431, "num_input_tokens_seen": 443760728, "step": 10140, "train_runtime": 78391.1203, "train_tokens_per_second": 5660.855 }, { "epoch": 0.6830729868031241, "grad_norm": 0.7679162845866374, "learning_rate": 7.388055185417382e-06, "loss": 0.36473128795623777, "num_input_tokens_seen": 443986040, "step": 10145, "train_runtime": 78429.781, "train_tokens_per_second": 5660.937 }, { "epoch": 0.6834096417990843, "grad_norm": 0.7045812738235366, "learning_rate": 7.3857318366702844e-06, "loss": 0.35809712409973143, "num_input_tokens_seen": 444206480, "step": 10150, "train_runtime": 78472.8507, "train_tokens_per_second": 5660.639 }, { "epoch": 0.6837462967950444, "grad_norm": 0.7004993125342208, "learning_rate": 7.383407820760885e-06, "loss": 0.3713981151580811, "num_input_tokens_seen": 444432096, "step": 10155, "train_runtime": 78515.6453, "train_tokens_per_second": 5660.427 }, { "epoch": 0.6840829517910045, "grad_norm": 0.7774580479484972, "learning_rate": 7.381083138339089e-06, "loss": 0.38779325485229493, "num_input_tokens_seen": 444643008, "step": 10160, "train_runtime": 78555.8979, "train_tokens_per_second": 5660.212 }, { "epoch": 0.6844196067869647, "grad_norm": 0.7163976333149118, "learning_rate": 7.378757790054988e-06, "loss": 0.39658608436584475, "num_input_tokens_seen": 444875528, "step": 10165, "train_runtime": 78592.4434, "train_tokens_per_second": 5660.538 }, { "epoch": 0.6847562617829248, "grad_norm": 0.7470536381083663, "learning_rate": 7.376431776558855e-06, "loss": 0.3956130504608154, "num_input_tokens_seen": 445097312, "step": 10170, "train_runtime": 78630.7483, "train_tokens_per_second": 5660.601 }, { "epoch": 0.685092916778885, "grad_norm": 0.7408806601027974, "learning_rate": 7.3741050985011546e-06, "loss": 0.3585235118865967, "num_input_tokens_seen": 445319152, "step": 10175, "train_runtime": 78670.4341, "train_tokens_per_second": 5660.566 }, { "epoch": 0.6854295717748451, "grad_norm": 0.7086975222942481, "learning_rate": 7.371777756532531e-06, "loss": 0.34885153770446775, "num_input_tokens_seen": 445544848, "step": 10180, "train_runtime": 78704.6359, "train_tokens_per_second": 5660.973 }, { "epoch": 0.6857662267708052, "grad_norm": 0.7956956482990667, "learning_rate": 7.369449751303823e-06, "loss": 0.3933322191238403, "num_input_tokens_seen": 445764768, "step": 10185, "train_runtime": 78741.4834, "train_tokens_per_second": 5661.117 }, { "epoch": 0.6861028817667654, "grad_norm": 0.5998016401864463, "learning_rate": 7.367121083466048e-06, "loss": 0.3657109498977661, "num_input_tokens_seen": 445988536, "step": 10190, "train_runtime": 78776.8049, "train_tokens_per_second": 5661.419 }, { "epoch": 0.6864395367627255, "grad_norm": 0.8579022323586973, "learning_rate": 7.364791753670409e-06, "loss": 0.3847865104675293, "num_input_tokens_seen": 446213600, "step": 10195, "train_runtime": 78810.0378, "train_tokens_per_second": 5661.888 }, { "epoch": 0.6867761917586857, "grad_norm": 0.729478615131132, "learning_rate": 7.362461762568298e-06, "loss": 0.372448205947876, "num_input_tokens_seen": 446432912, "step": 10200, "train_runtime": 78848.3501, "train_tokens_per_second": 5661.918 }, { "epoch": 0.6871128467546458, "grad_norm": 0.67715047966365, "learning_rate": 7.360131110811287e-06, "loss": 0.3532183408737183, "num_input_tokens_seen": 446656416, "step": 10205, "train_runtime": 78888.3323, "train_tokens_per_second": 5661.882 }, { "epoch": 0.6874495017506059, "grad_norm": 0.7095724500319497, "learning_rate": 7.357799799051138e-06, "loss": 0.3632460355758667, "num_input_tokens_seen": 446871712, "step": 10210, "train_runtime": 78927.4603, "train_tokens_per_second": 5661.803 }, { "epoch": 0.6877861567465661, "grad_norm": 0.9476488222825441, "learning_rate": 7.355467827939794e-06, "loss": 0.38349783420562744, "num_input_tokens_seen": 447082192, "step": 10215, "train_runtime": 78967.9316, "train_tokens_per_second": 5661.566 }, { "epoch": 0.6881228117425262, "grad_norm": 0.7980347922355381, "learning_rate": 7.353135198129382e-06, "loss": 0.3912900686264038, "num_input_tokens_seen": 447291168, "step": 10220, "train_runtime": 79002.7871, "train_tokens_per_second": 5661.714 }, { "epoch": 0.6884594667384863, "grad_norm": 0.796413758238857, "learning_rate": 7.350801910272216e-06, "loss": 0.38165950775146484, "num_input_tokens_seen": 447512392, "step": 10225, "train_runtime": 79046.6142, "train_tokens_per_second": 5661.373 }, { "epoch": 0.6887961217344465, "grad_norm": 0.7746118196960639, "learning_rate": 7.348467965020791e-06, "loss": 0.34427103996276853, "num_input_tokens_seen": 447731304, "step": 10230, "train_runtime": 79082.2762, "train_tokens_per_second": 5661.588 }, { "epoch": 0.6891327767304066, "grad_norm": 0.8166556060856294, "learning_rate": 7.3461333630277885e-06, "loss": 0.3613192081451416, "num_input_tokens_seen": 447922416, "step": 10235, "train_runtime": 79117.4476, "train_tokens_per_second": 5661.487 }, { "epoch": 0.6894694317263668, "grad_norm": 0.6976640506234788, "learning_rate": 7.343798104946074e-06, "loss": 0.3512859344482422, "num_input_tokens_seen": 448148520, "step": 10240, "train_runtime": 79156.1315, "train_tokens_per_second": 5661.577 }, { "epoch": 0.6898060867223269, "grad_norm": 0.74195160383717, "learning_rate": 7.341462191428692e-06, "loss": 0.381636905670166, "num_input_tokens_seen": 448364664, "step": 10245, "train_runtime": 79199.1829, "train_tokens_per_second": 5661.228 }, { "epoch": 0.690142741718287, "grad_norm": 0.7527010867181296, "learning_rate": 7.339125623128874e-06, "loss": 0.3913971662521362, "num_input_tokens_seen": 448587016, "step": 10250, "train_runtime": 79248.9634, "train_tokens_per_second": 5660.478 }, { "epoch": 0.6904793967142472, "grad_norm": 0.7210165301469443, "learning_rate": 7.336788400700035e-06, "loss": 0.36610395908355714, "num_input_tokens_seen": 448798728, "step": 10255, "train_runtime": 79292.6113, "train_tokens_per_second": 5660.032 }, { "epoch": 0.6908160517102074, "grad_norm": 0.9096784607094398, "learning_rate": 7.334450524795771e-06, "loss": 0.408566951751709, "num_input_tokens_seen": 449023728, "step": 10260, "train_runtime": 79333.8153, "train_tokens_per_second": 5659.929 }, { "epoch": 0.6911527067061676, "grad_norm": 0.6784070074683265, "learning_rate": 7.332111996069863e-06, "loss": 0.3746421575546265, "num_input_tokens_seen": 449245560, "step": 10265, "train_runtime": 79370.4334, "train_tokens_per_second": 5660.112 }, { "epoch": 0.6914893617021277, "grad_norm": 0.8780985630278836, "learning_rate": 7.32977281517627e-06, "loss": 0.39997851848602295, "num_input_tokens_seen": 449446632, "step": 10270, "train_runtime": 79406.7923, "train_tokens_per_second": 5660.053 }, { "epoch": 0.6918260166980879, "grad_norm": 0.7238138438393178, "learning_rate": 7.3274329827691406e-06, "loss": 0.3859497308731079, "num_input_tokens_seen": 449659944, "step": 10275, "train_runtime": 79449.7577, "train_tokens_per_second": 5659.677 }, { "epoch": 0.692162671694048, "grad_norm": 0.6417831874350313, "learning_rate": 7.325092499502796e-06, "loss": 0.35598082542419435, "num_input_tokens_seen": 449892656, "step": 10280, "train_runtime": 79489.514, "train_tokens_per_second": 5659.774 }, { "epoch": 0.6924993266900081, "grad_norm": 0.6886975793380838, "learning_rate": 7.322751366031751e-06, "loss": 0.3739547967910767, "num_input_tokens_seen": 450115160, "step": 10285, "train_runtime": 79528.7582, "train_tokens_per_second": 5659.779 }, { "epoch": 0.6928359816859683, "grad_norm": 0.8067129855431404, "learning_rate": 7.320409583010691e-06, "loss": 0.3593981027603149, "num_input_tokens_seen": 450339952, "step": 10290, "train_runtime": 79567.7249, "train_tokens_per_second": 5659.832 }, { "epoch": 0.6931726366819284, "grad_norm": 0.720222949795357, "learning_rate": 7.318067151094493e-06, "loss": 0.4208518981933594, "num_input_tokens_seen": 450562568, "step": 10295, "train_runtime": 79603.3438, "train_tokens_per_second": 5660.096 }, { "epoch": 0.6935092916778886, "grad_norm": 0.6662609649687479, "learning_rate": 7.3157240709382046e-06, "loss": 0.3863611936569214, "num_input_tokens_seen": 450794024, "step": 10300, "train_runtime": 79634.484, "train_tokens_per_second": 5660.789 }, { "epoch": 0.6938459466738487, "grad_norm": 0.7343868155686462, "learning_rate": 7.313380343197066e-06, "loss": 0.3639280080795288, "num_input_tokens_seen": 451027856, "step": 10305, "train_runtime": 79674.0903, "train_tokens_per_second": 5660.91 }, { "epoch": 0.6941826016698088, "grad_norm": 0.7926474138155267, "learning_rate": 7.311035968526492e-06, "loss": 0.3794968605041504, "num_input_tokens_seen": 451247432, "step": 10310, "train_runtime": 79715.3108, "train_tokens_per_second": 5660.737 }, { "epoch": 0.694519256665769, "grad_norm": 0.8428213530948624, "learning_rate": 7.308690947582078e-06, "loss": 0.38078649044036866, "num_input_tokens_seen": 451456696, "step": 10315, "train_runtime": 79750.434, "train_tokens_per_second": 5660.868 }, { "epoch": 0.6948559116617291, "grad_norm": 0.7185545573840266, "learning_rate": 7.306345281019602e-06, "loss": 0.37413511276245115, "num_input_tokens_seen": 451677704, "step": 10320, "train_runtime": 79790.1325, "train_tokens_per_second": 5660.822 }, { "epoch": 0.6951925666576892, "grad_norm": 0.7678020136994413, "learning_rate": 7.303998969495023e-06, "loss": 0.40517454147338866, "num_input_tokens_seen": 451892384, "step": 10325, "train_runtime": 79832.0377, "train_tokens_per_second": 5660.539 }, { "epoch": 0.6955292216536494, "grad_norm": 0.7116247415151229, "learning_rate": 7.301652013664479e-06, "loss": 0.39863314628601076, "num_input_tokens_seen": 452118752, "step": 10330, "train_runtime": 79868.7262, "train_tokens_per_second": 5660.773 }, { "epoch": 0.6958658766496095, "grad_norm": 0.7656084452706404, "learning_rate": 7.299304414184288e-06, "loss": 0.40618147850036623, "num_input_tokens_seen": 452338552, "step": 10335, "train_runtime": 79909.7465, "train_tokens_per_second": 5660.618 }, { "epoch": 0.6962025316455697, "grad_norm": 0.6668364749984544, "learning_rate": 7.296956171710951e-06, "loss": 0.3879892587661743, "num_input_tokens_seen": 452573592, "step": 10340, "train_runtime": 79946.2615, "train_tokens_per_second": 5660.973 }, { "epoch": 0.6965391866415298, "grad_norm": 0.8038854323996706, "learning_rate": 7.294607286901146e-06, "loss": 0.3926121711730957, "num_input_tokens_seen": 452795696, "step": 10345, "train_runtime": 79987.6707, "train_tokens_per_second": 5660.819 }, { "epoch": 0.69687584163749, "grad_norm": 0.7769622893093939, "learning_rate": 7.292257760411726e-06, "loss": 0.3886493444442749, "num_input_tokens_seen": 453009328, "step": 10350, "train_runtime": 80023.6895, "train_tokens_per_second": 5660.94 }, { "epoch": 0.6972124966334501, "grad_norm": 0.7478012896643832, "learning_rate": 7.289907592899737e-06, "loss": 0.37845487594604493, "num_input_tokens_seen": 453214464, "step": 10355, "train_runtime": 80062.9601, "train_tokens_per_second": 5660.726 }, { "epoch": 0.6975491516294102, "grad_norm": 0.7047299342802962, "learning_rate": 7.287556785022389e-06, "loss": 0.3894767761230469, "num_input_tokens_seen": 453437368, "step": 10360, "train_runtime": 80102.9256, "train_tokens_per_second": 5660.684 }, { "epoch": 0.6978858066253704, "grad_norm": 0.7604979984461925, "learning_rate": 7.285205337437082e-06, "loss": 0.3892651557922363, "num_input_tokens_seen": 453647680, "step": 10365, "train_runtime": 80141.1595, "train_tokens_per_second": 5660.608 }, { "epoch": 0.6982224616213305, "grad_norm": 0.7970440490683166, "learning_rate": 7.2828532508013895e-06, "loss": 0.399712347984314, "num_input_tokens_seen": 453867592, "step": 10370, "train_runtime": 80178.1608, "train_tokens_per_second": 5660.738 }, { "epoch": 0.6985591166172906, "grad_norm": 0.7584286596844286, "learning_rate": 7.2805005257730625e-06, "loss": 0.3772284030914307, "num_input_tokens_seen": 454087008, "step": 10375, "train_runtime": 80211.2544, "train_tokens_per_second": 5661.138 }, { "epoch": 0.6988957716132508, "grad_norm": 0.6810825697097003, "learning_rate": 7.278147163010037e-06, "loss": 0.36341052055358886, "num_input_tokens_seen": 454313224, "step": 10380, "train_runtime": 80250.7125, "train_tokens_per_second": 5661.174 }, { "epoch": 0.6992324266092109, "grad_norm": 0.7849426670217893, "learning_rate": 7.275793163170423e-06, "loss": 0.36755235195159913, "num_input_tokens_seen": 454539992, "step": 10385, "train_runtime": 80288.0816, "train_tokens_per_second": 5661.363 }, { "epoch": 0.6995690816051711, "grad_norm": 0.7022327990344984, "learning_rate": 7.273438526912506e-06, "loss": 0.3956979990005493, "num_input_tokens_seen": 454748824, "step": 10390, "train_runtime": 80325.0195, "train_tokens_per_second": 5661.36 }, { "epoch": 0.6999057366011312, "grad_norm": 0.7244301627454164, "learning_rate": 7.271083254894757e-06, "loss": 0.36125593185424804, "num_input_tokens_seen": 454962456, "step": 10395, "train_runtime": 80364.6433, "train_tokens_per_second": 5661.227 }, { "epoch": 0.7002423915970913, "grad_norm": 0.7856991901608305, "learning_rate": 7.268727347775815e-06, "loss": 0.3766735076904297, "num_input_tokens_seen": 455189544, "step": 10400, "train_runtime": 80398.3718, "train_tokens_per_second": 5661.676 }, { "epoch": 0.7005790465930515, "grad_norm": 0.7076340782949039, "learning_rate": 7.266370806214506e-06, "loss": 0.32742795944213865, "num_input_tokens_seen": 455409928, "step": 10405, "train_runtime": 80446.5155, "train_tokens_per_second": 5661.027 }, { "epoch": 0.7009157015890116, "grad_norm": 0.6900523877236565, "learning_rate": 7.264013630869827e-06, "loss": 0.37685844898223875, "num_input_tokens_seen": 455626104, "step": 10410, "train_runtime": 80491.2258, "train_tokens_per_second": 5660.569 }, { "epoch": 0.7012523565849718, "grad_norm": 0.6710950318779684, "learning_rate": 7.261655822400957e-06, "loss": 0.39275636672973635, "num_input_tokens_seen": 455857232, "step": 10415, "train_runtime": 80526.04, "train_tokens_per_second": 5660.992 }, { "epoch": 0.7015890115809319, "grad_norm": 0.7198657361358307, "learning_rate": 7.259297381467248e-06, "loss": 0.38013458251953125, "num_input_tokens_seen": 456077832, "step": 10420, "train_runtime": 80569.4365, "train_tokens_per_second": 5660.68 }, { "epoch": 0.701925666576892, "grad_norm": 0.7005819646574629, "learning_rate": 7.2569383087282285e-06, "loss": 0.34854826927185056, "num_input_tokens_seen": 456272960, "step": 10425, "train_runtime": 80611.1139, "train_tokens_per_second": 5660.174 }, { "epoch": 0.7022623215728522, "grad_norm": 0.7072800232396435, "learning_rate": 7.25457860484361e-06, "loss": 0.39771556854248047, "num_input_tokens_seen": 456493600, "step": 10430, "train_runtime": 80651.8402, "train_tokens_per_second": 5660.052 }, { "epoch": 0.7025989765688123, "grad_norm": 0.7445696785976343, "learning_rate": 7.252218270473274e-06, "loss": 0.3760495662689209, "num_input_tokens_seen": 456704912, "step": 10435, "train_runtime": 80692.0569, "train_tokens_per_second": 5659.85 }, { "epoch": 0.7029356315647725, "grad_norm": 0.7457222056984448, "learning_rate": 7.249857306277279e-06, "loss": 0.369310188293457, "num_input_tokens_seen": 456921864, "step": 10440, "train_runtime": 80726.6828, "train_tokens_per_second": 5660.109 }, { "epoch": 0.7032722865607326, "grad_norm": 0.9221604408221112, "learning_rate": 7.247495712915864e-06, "loss": 0.35996944904327394, "num_input_tokens_seen": 457143032, "step": 10445, "train_runtime": 80760.6102, "train_tokens_per_second": 5660.47 }, { "epoch": 0.7036089415566927, "grad_norm": 0.6862985079879047, "learning_rate": 7.245133491049439e-06, "loss": 0.3736717939376831, "num_input_tokens_seen": 457363400, "step": 10450, "train_runtime": 80799.8061, "train_tokens_per_second": 5660.452 }, { "epoch": 0.7039455965526529, "grad_norm": 0.6935497313758425, "learning_rate": 7.242770641338592e-06, "loss": 0.4129630088806152, "num_input_tokens_seen": 457584008, "step": 10455, "train_runtime": 80841.1453, "train_tokens_per_second": 5660.286 }, { "epoch": 0.704282251548613, "grad_norm": 0.7202390162158359, "learning_rate": 7.240407164444088e-06, "loss": 0.36982312202453616, "num_input_tokens_seen": 457798528, "step": 10460, "train_runtime": 80879.602, "train_tokens_per_second": 5660.247 }, { "epoch": 0.7046189065445732, "grad_norm": 0.7863736874260931, "learning_rate": 7.238043061026862e-06, "loss": 0.34938392639160154, "num_input_tokens_seen": 458006080, "step": 10465, "train_runtime": 80921.1996, "train_tokens_per_second": 5659.902 }, { "epoch": 0.7049555615405333, "grad_norm": 0.7013473236004093, "learning_rate": 7.235678331748034e-06, "loss": 0.3546873092651367, "num_input_tokens_seen": 458203208, "step": 10470, "train_runtime": 80956.6805, "train_tokens_per_second": 5659.857 }, { "epoch": 0.7052922165364934, "grad_norm": 0.7707435582118967, "learning_rate": 7.233312977268887e-06, "loss": 0.40183773040771487, "num_input_tokens_seen": 458427952, "step": 10475, "train_runtime": 80993.4895, "train_tokens_per_second": 5660.059 }, { "epoch": 0.7056288715324536, "grad_norm": 0.7366337541289394, "learning_rate": 7.230946998250889e-06, "loss": 0.36978516578674314, "num_input_tokens_seen": 458631504, "step": 10480, "train_runtime": 81028.6939, "train_tokens_per_second": 5660.112 }, { "epoch": 0.7059655265284137, "grad_norm": 0.7121052684917011, "learning_rate": 7.228580395355676e-06, "loss": 0.34577772617340086, "num_input_tokens_seen": 458845056, "step": 10485, "train_runtime": 81072.1146, "train_tokens_per_second": 5659.715 }, { "epoch": 0.7063021815243739, "grad_norm": 0.7741334918584597, "learning_rate": 7.226213169245062e-06, "loss": 0.38037862777709963, "num_input_tokens_seen": 459063872, "step": 10490, "train_runtime": 81113.0274, "train_tokens_per_second": 5659.558 }, { "epoch": 0.706638836520334, "grad_norm": 0.7871663193272351, "learning_rate": 7.223845320581035e-06, "loss": 0.3649828672409058, "num_input_tokens_seen": 459276768, "step": 10495, "train_runtime": 81158.0461, "train_tokens_per_second": 5659.042 }, { "epoch": 0.7069754915162941, "grad_norm": 0.8550643751341503, "learning_rate": 7.221476850025754e-06, "loss": 0.3691579818725586, "num_input_tokens_seen": 459504320, "step": 10500, "train_runtime": 81197.4298, "train_tokens_per_second": 5659.099 }, { "epoch": 0.7073121465122543, "grad_norm": 0.6802216728098077, "learning_rate": 7.219107758241557e-06, "loss": 0.381423807144165, "num_input_tokens_seen": 459726544, "step": 10505, "train_runtime": 81239.3131, "train_tokens_per_second": 5658.917 }, { "epoch": 0.7076488015082144, "grad_norm": 0.7476015422415041, "learning_rate": 7.2167380458909505e-06, "loss": 0.3745572090148926, "num_input_tokens_seen": 459949656, "step": 10510, "train_runtime": 81274.379, "train_tokens_per_second": 5659.221 }, { "epoch": 0.7079854565041745, "grad_norm": 0.6742333237089346, "learning_rate": 7.214367713636619e-06, "loss": 0.375703763961792, "num_input_tokens_seen": 460172128, "step": 10515, "train_runtime": 81312.8461, "train_tokens_per_second": 5659.28 }, { "epoch": 0.7083221115001347, "grad_norm": 0.6954522791161296, "learning_rate": 7.211996762141418e-06, "loss": 0.37557039260864256, "num_input_tokens_seen": 460390848, "step": 10520, "train_runtime": 81345.9866, "train_tokens_per_second": 5659.663 }, { "epoch": 0.7086587664960948, "grad_norm": 0.7339967212433919, "learning_rate": 7.209625192068374e-06, "loss": 0.4028931617736816, "num_input_tokens_seen": 460611832, "step": 10525, "train_runtime": 81379.8389, "train_tokens_per_second": 5660.024 }, { "epoch": 0.708995421492055, "grad_norm": 0.701987120656059, "learning_rate": 7.207253004080692e-06, "loss": 0.37696285247802735, "num_input_tokens_seen": 460844344, "step": 10530, "train_runtime": 81418.5196, "train_tokens_per_second": 5660.191 }, { "epoch": 0.7093320764880151, "grad_norm": 0.7755594445584074, "learning_rate": 7.204880198841746e-06, "loss": 0.34694790840148926, "num_input_tokens_seen": 461058504, "step": 10535, "train_runtime": 81453.7678, "train_tokens_per_second": 5660.37 }, { "epoch": 0.7096687314839752, "grad_norm": 0.8426741622679441, "learning_rate": 7.2025067770150835e-06, "loss": 0.4015054225921631, "num_input_tokens_seen": 461286472, "step": 10540, "train_runtime": 81493.9088, "train_tokens_per_second": 5660.38 }, { "epoch": 0.7100053864799354, "grad_norm": 0.7557428415974053, "learning_rate": 7.2001327392644235e-06, "loss": 0.3497929573059082, "num_input_tokens_seen": 461515496, "step": 10545, "train_runtime": 81528.2463, "train_tokens_per_second": 5660.805 }, { "epoch": 0.7103420414758955, "grad_norm": 0.7845759323690452, "learning_rate": 7.197758086253659e-06, "loss": 0.39971365928649905, "num_input_tokens_seen": 461738504, "step": 10550, "train_runtime": 81568.9369, "train_tokens_per_second": 5660.715 }, { "epoch": 0.7106786964718557, "grad_norm": 0.7112358056324952, "learning_rate": 7.195382818646854e-06, "loss": 0.39182677268981936, "num_input_tokens_seen": 461947016, "step": 10555, "train_runtime": 81608.3983, "train_tokens_per_second": 5660.533 }, { "epoch": 0.7110153514678158, "grad_norm": 0.772603293296723, "learning_rate": 7.1930069371082445e-06, "loss": 0.36522927284240725, "num_input_tokens_seen": 462152784, "step": 10560, "train_runtime": 81652.6367, "train_tokens_per_second": 5659.986 }, { "epoch": 0.7113520064637759, "grad_norm": 0.7156871566744746, "learning_rate": 7.190630442302238e-06, "loss": 0.3833275079727173, "num_input_tokens_seen": 462379128, "step": 10565, "train_runtime": 81694.2563, "train_tokens_per_second": 5659.873 }, { "epoch": 0.7116886614597361, "grad_norm": 0.7033879162554953, "learning_rate": 7.188253334893414e-06, "loss": 0.3999313831329346, "num_input_tokens_seen": 462598648, "step": 10570, "train_runtime": 81730.3714, "train_tokens_per_second": 5660.058 }, { "epoch": 0.7120253164556962, "grad_norm": 0.8834420627247958, "learning_rate": 7.18587561554652e-06, "loss": 0.3910887956619263, "num_input_tokens_seen": 462807208, "step": 10575, "train_runtime": 81771.4349, "train_tokens_per_second": 5659.766 }, { "epoch": 0.7123619714516564, "grad_norm": 0.6918016219416666, "learning_rate": 7.183497284926483e-06, "loss": 0.36777448654174805, "num_input_tokens_seen": 463042928, "step": 10580, "train_runtime": 81807.4141, "train_tokens_per_second": 5660.158 }, { "epoch": 0.7126986264476165, "grad_norm": 0.7599277759479904, "learning_rate": 7.181118343698392e-06, "loss": 0.36260690689086916, "num_input_tokens_seen": 463252424, "step": 10585, "train_runtime": 81851.2205, "train_tokens_per_second": 5659.689 }, { "epoch": 0.7130352814435766, "grad_norm": 0.7224431307545425, "learning_rate": 7.178738792527512e-06, "loss": 0.39423255920410155, "num_input_tokens_seen": 463469984, "step": 10590, "train_runtime": 81891.039, "train_tokens_per_second": 5659.593 }, { "epoch": 0.7133719364395368, "grad_norm": 0.7536526351492208, "learning_rate": 7.176358632079277e-06, "loss": 0.37251434326171873, "num_input_tokens_seen": 463682208, "step": 10595, "train_runtime": 81929.5391, "train_tokens_per_second": 5659.524 }, { "epoch": 0.7137085914354969, "grad_norm": 0.6793493050362683, "learning_rate": 7.173977863019288e-06, "loss": 0.37181549072265624, "num_input_tokens_seen": 463907464, "step": 10600, "train_runtime": 81970.1484, "train_tokens_per_second": 5659.468 }, { "epoch": 0.7140452464314571, "grad_norm": 0.6822436534253042, "learning_rate": 7.171596486013323e-06, "loss": 0.34790878295898436, "num_input_tokens_seen": 464138256, "step": 10605, "train_runtime": 82007.4481, "train_tokens_per_second": 5659.709 }, { "epoch": 0.7143819014274172, "grad_norm": 0.8051213804159209, "learning_rate": 7.169214501727326e-06, "loss": 0.37795867919921877, "num_input_tokens_seen": 464338936, "step": 10610, "train_runtime": 82043.2488, "train_tokens_per_second": 5659.685 }, { "epoch": 0.7147185564233773, "grad_norm": 0.686749483511892, "learning_rate": 7.16683191082741e-06, "loss": 0.36943345069885253, "num_input_tokens_seen": 464560144, "step": 10615, "train_runtime": 82079.0859, "train_tokens_per_second": 5659.909 }, { "epoch": 0.7150552114193375, "grad_norm": 0.8746419009334871, "learning_rate": 7.16444871397986e-06, "loss": 0.368468713760376, "num_input_tokens_seen": 464765496, "step": 10620, "train_runtime": 82117.3295, "train_tokens_per_second": 5659.774 }, { "epoch": 0.7153918664152976, "grad_norm": 1.042013296164164, "learning_rate": 7.162064911851129e-06, "loss": 0.36743860244750975, "num_input_tokens_seen": 464978408, "step": 10625, "train_runtime": 82160.6887, "train_tokens_per_second": 5659.378 }, { "epoch": 0.7157285214112578, "grad_norm": 0.7321276232893942, "learning_rate": 7.15968050510784e-06, "loss": 0.40234060287475587, "num_input_tokens_seen": 465192704, "step": 10630, "train_runtime": 82198.1606, "train_tokens_per_second": 5659.405 }, { "epoch": 0.7160651764072179, "grad_norm": 0.8428920187826066, "learning_rate": 7.1572954944167834e-06, "loss": 0.3755232810974121, "num_input_tokens_seen": 465408616, "step": 10635, "train_runtime": 82239.586, "train_tokens_per_second": 5659.18 }, { "epoch": 0.716401831403178, "grad_norm": 0.679996578354662, "learning_rate": 7.154909880444922e-06, "loss": 0.3969583988189697, "num_input_tokens_seen": 465633232, "step": 10640, "train_runtime": 82282.7769, "train_tokens_per_second": 5658.939 }, { "epoch": 0.7167384863991382, "grad_norm": 1.5740350922344166, "learning_rate": 7.152523663859384e-06, "loss": 0.37885403633117676, "num_input_tokens_seen": 465845256, "step": 10645, "train_runtime": 82324.9766, "train_tokens_per_second": 5658.614 }, { "epoch": 0.7170751413950983, "grad_norm": 0.8328362306471117, "learning_rate": 7.150136845327466e-06, "loss": 0.3639181613922119, "num_input_tokens_seen": 466056584, "step": 10650, "train_runtime": 82369.823, "train_tokens_per_second": 5658.099 }, { "epoch": 0.7174117963910585, "grad_norm": 0.737238654335971, "learning_rate": 7.147749425516637e-06, "loss": 0.3720954418182373, "num_input_tokens_seen": 466287992, "step": 10655, "train_runtime": 82407.102, "train_tokens_per_second": 5658.347 }, { "epoch": 0.7177484513870186, "grad_norm": 0.7078523897720794, "learning_rate": 7.145361405094529e-06, "loss": 0.3578562021255493, "num_input_tokens_seen": 466523176, "step": 10660, "train_runtime": 82439.2799, "train_tokens_per_second": 5658.991 }, { "epoch": 0.7180851063829787, "grad_norm": 0.7362901383213949, "learning_rate": 7.142972784728945e-06, "loss": 0.3409886360168457, "num_input_tokens_seen": 466734112, "step": 10665, "train_runtime": 82483.0478, "train_tokens_per_second": 5658.546 }, { "epoch": 0.7184217613789389, "grad_norm": 0.8146924235270421, "learning_rate": 7.140583565087856e-06, "loss": 0.35494747161865237, "num_input_tokens_seen": 466952312, "step": 10670, "train_runtime": 82519.1924, "train_tokens_per_second": 5658.712 }, { "epoch": 0.718758416374899, "grad_norm": 0.7593849226158301, "learning_rate": 7.138193746839399e-06, "loss": 0.3933510065078735, "num_input_tokens_seen": 467185248, "step": 10675, "train_runtime": 82565.1418, "train_tokens_per_second": 5658.384 }, { "epoch": 0.7190950713708592, "grad_norm": 0.7169033125551184, "learning_rate": 7.135803330651878e-06, "loss": 0.37902536392211916, "num_input_tokens_seen": 467421448, "step": 10680, "train_runtime": 82599.409, "train_tokens_per_second": 5658.896 }, { "epoch": 0.7194317263668193, "grad_norm": 0.6927480355842544, "learning_rate": 7.133412317193766e-06, "loss": 0.3649748802185059, "num_input_tokens_seen": 467648088, "step": 10685, "train_runtime": 82647.9029, "train_tokens_per_second": 5658.318 }, { "epoch": 0.7197683813627794, "grad_norm": 0.8368737935217295, "learning_rate": 7.131020707133703e-06, "loss": 0.39012324810028076, "num_input_tokens_seen": 467852784, "step": 10690, "train_runtime": 82685.2143, "train_tokens_per_second": 5658.24 }, { "epoch": 0.7201050363587396, "grad_norm": 0.7246874489536738, "learning_rate": 7.128628501140495e-06, "loss": 0.3994007587432861, "num_input_tokens_seen": 468062360, "step": 10695, "train_runtime": 82719.4298, "train_tokens_per_second": 5658.433 }, { "epoch": 0.7204416913546997, "grad_norm": 0.7034507707765917, "learning_rate": 7.126235699883115e-06, "loss": 0.3543556213378906, "num_input_tokens_seen": 468260752, "step": 10700, "train_runtime": 82762.0259, "train_tokens_per_second": 5657.918 }, { "epoch": 0.7207783463506598, "grad_norm": 0.6713729985803661, "learning_rate": 7.1238423040306995e-06, "loss": 0.3659778594970703, "num_input_tokens_seen": 468480296, "step": 10705, "train_runtime": 82807.3194, "train_tokens_per_second": 5657.474 }, { "epoch": 0.72111500134662, "grad_norm": 0.6714547248755331, "learning_rate": 7.121448314252557e-06, "loss": 0.33471217155456545, "num_input_tokens_seen": 468714640, "step": 10710, "train_runtime": 82849.0161, "train_tokens_per_second": 5657.456 }, { "epoch": 0.7214516563425801, "grad_norm": 0.7542079623814812, "learning_rate": 7.1190537312181586e-06, "loss": 0.3590662479400635, "num_input_tokens_seen": 468920200, "step": 10715, "train_runtime": 82883.6718, "train_tokens_per_second": 5657.57 }, { "epoch": 0.7217883113385403, "grad_norm": 0.788689096156777, "learning_rate": 7.116658555597141e-06, "loss": 0.35546276569366453, "num_input_tokens_seen": 469105088, "step": 10720, "train_runtime": 82920.6765, "train_tokens_per_second": 5657.275 }, { "epoch": 0.7221249663345004, "grad_norm": 0.7720777482295464, "learning_rate": 7.114262788059308e-06, "loss": 0.36028232574462893, "num_input_tokens_seen": 469316144, "step": 10725, "train_runtime": 82956.2558, "train_tokens_per_second": 5657.393 }, { "epoch": 0.7224616213304605, "grad_norm": 0.7595426301739953, "learning_rate": 7.111866429274627e-06, "loss": 0.3734895706176758, "num_input_tokens_seen": 469533344, "step": 10730, "train_runtime": 82995.9693, "train_tokens_per_second": 5657.303 }, { "epoch": 0.7227982763264207, "grad_norm": 0.7895201856991956, "learning_rate": 7.1094694799132356e-06, "loss": 0.38394627571105955, "num_input_tokens_seen": 469757776, "step": 10735, "train_runtime": 83039.5254, "train_tokens_per_second": 5657.038 }, { "epoch": 0.7231349313223808, "grad_norm": 0.7170404350301777, "learning_rate": 7.10707194064543e-06, "loss": 0.355570125579834, "num_input_tokens_seen": 469973048, "step": 10740, "train_runtime": 83082.4999, "train_tokens_per_second": 5656.703 }, { "epoch": 0.723471586318341, "grad_norm": 0.751527765717788, "learning_rate": 7.104673812141676e-06, "loss": 0.4048286437988281, "num_input_tokens_seen": 470200352, "step": 10745, "train_runtime": 83123.5825, "train_tokens_per_second": 5656.642 }, { "epoch": 0.7238082413143011, "grad_norm": 0.7209513181054711, "learning_rate": 7.102275095072601e-06, "loss": 0.3921640157699585, "num_input_tokens_seen": 470434416, "step": 10750, "train_runtime": 83170.1972, "train_tokens_per_second": 5656.286 }, { "epoch": 0.7241448963102612, "grad_norm": 0.7141189337990387, "learning_rate": 7.099875790108998e-06, "loss": 0.36566712856292727, "num_input_tokens_seen": 470662208, "step": 10755, "train_runtime": 83219.7805, "train_tokens_per_second": 5655.653 }, { "epoch": 0.7244815513062214, "grad_norm": 0.6677452072067016, "learning_rate": 7.097475897921827e-06, "loss": 0.37137765884399415, "num_input_tokens_seen": 470876192, "step": 10760, "train_runtime": 83259.577, "train_tokens_per_second": 5655.52 }, { "epoch": 0.7248182063021815, "grad_norm": 0.8654836254283663, "learning_rate": 7.09507541918221e-06, "loss": 0.3979093790054321, "num_input_tokens_seen": 471091920, "step": 10765, "train_runtime": 83298.0964, "train_tokens_per_second": 5655.494 }, { "epoch": 0.7251548612981417, "grad_norm": 0.6072122160998616, "learning_rate": 7.092674354561433e-06, "loss": 0.3879514217376709, "num_input_tokens_seen": 471316336, "step": 10770, "train_runtime": 83339.0663, "train_tokens_per_second": 5655.407 }, { "epoch": 0.7254915162941018, "grad_norm": 0.753636374019264, "learning_rate": 7.090272704730945e-06, "loss": 0.3511503219604492, "num_input_tokens_seen": 471518800, "step": 10775, "train_runtime": 83375.4431, "train_tokens_per_second": 5655.368 }, { "epoch": 0.7258281712900619, "grad_norm": 0.7575044992088539, "learning_rate": 7.08787047036236e-06, "loss": 0.35472354888916013, "num_input_tokens_seen": 471754616, "step": 10780, "train_runtime": 83418.0251, "train_tokens_per_second": 5655.308 }, { "epoch": 0.7261648262860221, "grad_norm": 0.822516802699336, "learning_rate": 7.085467652127457e-06, "loss": 0.3795314788818359, "num_input_tokens_seen": 471981872, "step": 10785, "train_runtime": 83450.133, "train_tokens_per_second": 5655.855 }, { "epoch": 0.7265014812819822, "grad_norm": 0.6385132066085284, "learning_rate": 7.083064250698175e-06, "loss": 0.3529500961303711, "num_input_tokens_seen": 472213144, "step": 10790, "train_runtime": 83491.9091, "train_tokens_per_second": 5655.795 }, { "epoch": 0.7268381362779424, "grad_norm": 0.6595130665327932, "learning_rate": 7.0806602667466175e-06, "loss": 0.37914767265319826, "num_input_tokens_seen": 472443584, "step": 10795, "train_runtime": 83534.7223, "train_tokens_per_second": 5655.655 }, { "epoch": 0.7271747912739025, "grad_norm": 0.6988131699183094, "learning_rate": 7.078255700945051e-06, "loss": 0.38105590343475343, "num_input_tokens_seen": 472655528, "step": 10800, "train_runtime": 83566.9737, "train_tokens_per_second": 5656.009 }, { "epoch": 0.7275114462698626, "grad_norm": 0.7284700984007974, "learning_rate": 7.075850553965904e-06, "loss": 0.366654634475708, "num_input_tokens_seen": 472863848, "step": 10805, "train_runtime": 83605.9871, "train_tokens_per_second": 5655.861 }, { "epoch": 0.7278481012658228, "grad_norm": 0.7093309792405998, "learning_rate": 7.07344482648177e-06, "loss": 0.3818976879119873, "num_input_tokens_seen": 473087584, "step": 10810, "train_runtime": 83637.9528, "train_tokens_per_second": 5656.375 }, { "epoch": 0.7281847562617829, "grad_norm": 0.7655242160543194, "learning_rate": 7.071038519165402e-06, "loss": 0.3804640293121338, "num_input_tokens_seen": 473302440, "step": 10815, "train_runtime": 83680.6746, "train_tokens_per_second": 5656.054 }, { "epoch": 0.7285214112577431, "grad_norm": 0.7319764295438455, "learning_rate": 7.068631632689716e-06, "loss": 0.3819848299026489, "num_input_tokens_seen": 473528888, "step": 10820, "train_runtime": 83719.4607, "train_tokens_per_second": 5656.139 }, { "epoch": 0.7288580662537032, "grad_norm": 9.329714081971986, "learning_rate": 7.066224167727791e-06, "loss": 0.3868781566619873, "num_input_tokens_seen": 473749232, "step": 10825, "train_runtime": 83753.7938, "train_tokens_per_second": 5656.451 }, { "epoch": 0.7291947212496633, "grad_norm": 0.841160080727543, "learning_rate": 7.063816124952865e-06, "loss": 0.36863956451416013, "num_input_tokens_seen": 473966688, "step": 10830, "train_runtime": 83791.8425, "train_tokens_per_second": 5656.478 }, { "epoch": 0.7295313762456235, "grad_norm": 0.6549972032651611, "learning_rate": 7.061407505038341e-06, "loss": 0.3608518362045288, "num_input_tokens_seen": 474183856, "step": 10835, "train_runtime": 83830.8355, "train_tokens_per_second": 5656.437 }, { "epoch": 0.7298680312415836, "grad_norm": 0.6949899381534901, "learning_rate": 7.058998308657782e-06, "loss": 0.3866151809692383, "num_input_tokens_seen": 474414672, "step": 10840, "train_runtime": 83863.1172, "train_tokens_per_second": 5657.012 }, { "epoch": 0.7302046862375438, "grad_norm": 0.6794084004266899, "learning_rate": 7.056588536484912e-06, "loss": 0.35731284618377684, "num_input_tokens_seen": 474622840, "step": 10845, "train_runtime": 83892.8777, "train_tokens_per_second": 5657.487 }, { "epoch": 0.7305413412335039, "grad_norm": 1.3762092654034057, "learning_rate": 7.0541781891936145e-06, "loss": 0.35231194496154783, "num_input_tokens_seen": 474842808, "step": 10850, "train_runtime": 83931.0911, "train_tokens_per_second": 5657.532 }, { "epoch": 0.730877996229464, "grad_norm": 0.8182830044909798, "learning_rate": 7.0517672674579364e-06, "loss": 0.3739452838897705, "num_input_tokens_seen": 475060040, "step": 10855, "train_runtime": 83971.3377, "train_tokens_per_second": 5657.407 }, { "epoch": 0.7312146512254242, "grad_norm": 0.7405063263799381, "learning_rate": 7.049355771952087e-06, "loss": 0.367911171913147, "num_input_tokens_seen": 475270960, "step": 10860, "train_runtime": 84012.5713, "train_tokens_per_second": 5657.141 }, { "epoch": 0.7315513062213843, "grad_norm": 0.743519981806223, "learning_rate": 7.046943703350429e-06, "loss": 0.3706895112991333, "num_input_tokens_seen": 475496232, "step": 10865, "train_runtime": 84056.0111, "train_tokens_per_second": 5656.897 }, { "epoch": 0.7318879612173445, "grad_norm": 0.6596197156889615, "learning_rate": 7.044531062327492e-06, "loss": 0.356654691696167, "num_input_tokens_seen": 475709832, "step": 10870, "train_runtime": 84089.5859, "train_tokens_per_second": 5657.179 }, { "epoch": 0.7322246162133046, "grad_norm": 0.6526147436786898, "learning_rate": 7.042117849557963e-06, "loss": 0.3708888053894043, "num_input_tokens_seen": 475932072, "step": 10875, "train_runtime": 84133.6504, "train_tokens_per_second": 5656.858 }, { "epoch": 0.7325612712092647, "grad_norm": 0.744802883666199, "learning_rate": 7.0397040657166885e-06, "loss": 0.36887059211730955, "num_input_tokens_seen": 476162776, "step": 10880, "train_runtime": 84169.2025, "train_tokens_per_second": 5657.209 }, { "epoch": 0.7328979262052249, "grad_norm": 0.7068220775813847, "learning_rate": 7.037289711478676e-06, "loss": 0.34908170700073243, "num_input_tokens_seen": 476376384, "step": 10885, "train_runtime": 84204.347, "train_tokens_per_second": 5657.385 }, { "epoch": 0.733234581201185, "grad_norm": 0.7211408903358524, "learning_rate": 7.034874787519095e-06, "loss": 0.3759069204330444, "num_input_tokens_seen": 476599400, "step": 10890, "train_runtime": 84242.2013, "train_tokens_per_second": 5657.49 }, { "epoch": 0.7335712361971451, "grad_norm": 0.6965350386219624, "learning_rate": 7.0324592945132655e-06, "loss": 0.4069540023803711, "num_input_tokens_seen": 476821304, "step": 10895, "train_runtime": 84276.594, "train_tokens_per_second": 5657.814 }, { "epoch": 0.7339078911931053, "grad_norm": 0.7259339581846704, "learning_rate": 7.0300432331366764e-06, "loss": 0.3802814245223999, "num_input_tokens_seen": 477036424, "step": 10900, "train_runtime": 84309.7162, "train_tokens_per_second": 5658.143 }, { "epoch": 0.7342445461890654, "grad_norm": 0.726630192334144, "learning_rate": 7.02762660406497e-06, "loss": 0.3741856813430786, "num_input_tokens_seen": 477257288, "step": 10905, "train_runtime": 84348.0236, "train_tokens_per_second": 5658.192 }, { "epoch": 0.7345812011850256, "grad_norm": 0.6353064783947603, "learning_rate": 7.02520940797395e-06, "loss": 0.3721340179443359, "num_input_tokens_seen": 477464672, "step": 10910, "train_runtime": 84385.7451, "train_tokens_per_second": 5658.12 }, { "epoch": 0.7349178561809857, "grad_norm": 0.6280488461396918, "learning_rate": 7.022791645539576e-06, "loss": 0.37077898979187013, "num_input_tokens_seen": 477670600, "step": 10915, "train_runtime": 84423.4019, "train_tokens_per_second": 5658.035 }, { "epoch": 0.7352545111769458, "grad_norm": 0.7582582970874048, "learning_rate": 7.02037331743797e-06, "loss": 0.4068927764892578, "num_input_tokens_seen": 477891112, "step": 10920, "train_runtime": 84461.3924, "train_tokens_per_second": 5658.101 }, { "epoch": 0.735591166172906, "grad_norm": 0.6908837097564919, "learning_rate": 7.0179544243454076e-06, "loss": 0.3525757551193237, "num_input_tokens_seen": 478120960, "step": 10925, "train_runtime": 84493.3059, "train_tokens_per_second": 5658.684 }, { "epoch": 0.7359278211688661, "grad_norm": 0.8025906131360969, "learning_rate": 7.0155349669383245e-06, "loss": 0.36997184753417967, "num_input_tokens_seen": 478344240, "step": 10930, "train_runtime": 84534.5442, "train_tokens_per_second": 5658.565 }, { "epoch": 0.7362644761648263, "grad_norm": 0.691884724659927, "learning_rate": 7.013114945893316e-06, "loss": 0.36500933170318606, "num_input_tokens_seen": 478567880, "step": 10935, "train_runtime": 84579.7591, "train_tokens_per_second": 5658.184 }, { "epoch": 0.7366011311607864, "grad_norm": 0.7278702815389843, "learning_rate": 7.010694361887131e-06, "loss": 0.3656963109970093, "num_input_tokens_seen": 478795792, "step": 10940, "train_runtime": 84624.1001, "train_tokens_per_second": 5657.913 }, { "epoch": 0.7369377861567465, "grad_norm": 0.6970616747051929, "learning_rate": 7.008273215596681e-06, "loss": 0.3773782253265381, "num_input_tokens_seen": 479014424, "step": 10945, "train_runtime": 84661.672, "train_tokens_per_second": 5657.984 }, { "epoch": 0.7372744411527067, "grad_norm": 0.7390738693319422, "learning_rate": 7.005851507699029e-06, "loss": 0.3759654760360718, "num_input_tokens_seen": 479243632, "step": 10950, "train_runtime": 84694.665, "train_tokens_per_second": 5658.487 }, { "epoch": 0.7376110961486668, "grad_norm": 0.6808946119767743, "learning_rate": 7.003429238871399e-06, "loss": 0.3657572031021118, "num_input_tokens_seen": 479473192, "step": 10955, "train_runtime": 84738.238, "train_tokens_per_second": 5658.286 }, { "epoch": 0.737947751144627, "grad_norm": 0.7178504014412501, "learning_rate": 7.001006409791171e-06, "loss": 0.40654420852661133, "num_input_tokens_seen": 479687920, "step": 10960, "train_runtime": 84776.0398, "train_tokens_per_second": 5658.296 }, { "epoch": 0.7382844061405871, "grad_norm": 0.7628213758613887, "learning_rate": 6.998583021135882e-06, "loss": 0.3780509948730469, "num_input_tokens_seen": 479906096, "step": 10965, "train_runtime": 84815.2532, "train_tokens_per_second": 5658.252 }, { "epoch": 0.7386210611365472, "grad_norm": 0.8356715268382896, "learning_rate": 6.996159073583224e-06, "loss": 0.36737675666809083, "num_input_tokens_seen": 480125696, "step": 10970, "train_runtime": 84852.9815, "train_tokens_per_second": 5658.324 }, { "epoch": 0.7389577161325074, "grad_norm": 0.8055302742937802, "learning_rate": 6.993734567811046e-06, "loss": 0.34843399524688723, "num_input_tokens_seen": 480343296, "step": 10975, "train_runtime": 84896.1427, "train_tokens_per_second": 5658.011 }, { "epoch": 0.7392943711284675, "grad_norm": 0.6594571098967035, "learning_rate": 6.991309504497352e-06, "loss": 0.37664797306060793, "num_input_tokens_seen": 480566544, "step": 10980, "train_runtime": 84934.0218, "train_tokens_per_second": 5658.116 }, { "epoch": 0.7396310261244277, "grad_norm": 0.7694992058673898, "learning_rate": 6.988883884320307e-06, "loss": 0.3457742214202881, "num_input_tokens_seen": 480774232, "step": 10985, "train_runtime": 84970.4518, "train_tokens_per_second": 5658.134 }, { "epoch": 0.7399676811203878, "grad_norm": 0.7402878857378402, "learning_rate": 6.9864577079582254e-06, "loss": 0.39705471992492675, "num_input_tokens_seen": 481000200, "step": 10990, "train_runtime": 85008.5973, "train_tokens_per_second": 5658.254 }, { "epoch": 0.7403043361163479, "grad_norm": 0.8393816654846036, "learning_rate": 6.984030976089581e-06, "loss": 0.3594042301177979, "num_input_tokens_seen": 481219544, "step": 10995, "train_runtime": 85043.9927, "train_tokens_per_second": 5658.478 }, { "epoch": 0.7406409911123081, "grad_norm": 0.7035982175377999, "learning_rate": 6.981603689392999e-06, "loss": 0.3729727745056152, "num_input_tokens_seen": 481433184, "step": 11000, "train_runtime": 85091.999, "train_tokens_per_second": 5657.796 }, { "epoch": 0.7409776461082682, "grad_norm": 0.7063885505049592, "learning_rate": 6.979175848547263e-06, "loss": 0.3587386131286621, "num_input_tokens_seen": 481648384, "step": 11005, "train_runtime": 85133.4023, "train_tokens_per_second": 5657.572 }, { "epoch": 0.7413143011042284, "grad_norm": 0.818479059925005, "learning_rate": 6.976747454231316e-06, "loss": 0.36256041526794436, "num_input_tokens_seen": 481853600, "step": 11010, "train_runtime": 85175.3796, "train_tokens_per_second": 5657.193 }, { "epoch": 0.7416509561001885, "grad_norm": 0.7213537892974411, "learning_rate": 6.974318507124245e-06, "loss": 0.37796127796173096, "num_input_tokens_seen": 482067848, "step": 11015, "train_runtime": 85211.3126, "train_tokens_per_second": 5657.322 }, { "epoch": 0.7419876110961486, "grad_norm": 0.9553094338809663, "learning_rate": 6.971889007905299e-06, "loss": 0.38568458557128904, "num_input_tokens_seen": 482272608, "step": 11020, "train_runtime": 85242.7243, "train_tokens_per_second": 5657.64 }, { "epoch": 0.7423242660921088, "grad_norm": 0.6954588658200586, "learning_rate": 6.9694589572538795e-06, "loss": 0.4131626605987549, "num_input_tokens_seen": 482500568, "step": 11025, "train_runtime": 85279.0869, "train_tokens_per_second": 5657.9 }, { "epoch": 0.7426609210880689, "grad_norm": 0.6724190701417789, "learning_rate": 6.9670283558495436e-06, "loss": 0.3677205085754395, "num_input_tokens_seen": 482727520, "step": 11030, "train_runtime": 85315.8408, "train_tokens_per_second": 5658.123 }, { "epoch": 0.742997576084029, "grad_norm": 0.7736013776309341, "learning_rate": 6.964597204371999e-06, "loss": 0.3734050035476685, "num_input_tokens_seen": 482943600, "step": 11035, "train_runtime": 85349.9838, "train_tokens_per_second": 5658.391 }, { "epoch": 0.7433342310799892, "grad_norm": 0.7557593534274823, "learning_rate": 6.962165503501111e-06, "loss": 0.3419958591461182, "num_input_tokens_seen": 483163040, "step": 11040, "train_runtime": 85392.7525, "train_tokens_per_second": 5658.127 }, { "epoch": 0.7436708860759493, "grad_norm": 0.786614283633, "learning_rate": 6.959733253916899e-06, "loss": 0.39629015922546384, "num_input_tokens_seen": 483387400, "step": 11045, "train_runtime": 85430.316, "train_tokens_per_second": 5658.265 }, { "epoch": 0.7440075410719095, "grad_norm": 0.7118679551230915, "learning_rate": 6.95730045629953e-06, "loss": 0.3637987613677979, "num_input_tokens_seen": 483586168, "step": 11050, "train_runtime": 85469.2598, "train_tokens_per_second": 5658.013 }, { "epoch": 0.7443441960678696, "grad_norm": 0.775880823500199, "learning_rate": 6.954867111329329e-06, "loss": 0.3997496604919434, "num_input_tokens_seen": 483812040, "step": 11055, "train_runtime": 85501.004, "train_tokens_per_second": 5658.554 }, { "epoch": 0.7446808510638298, "grad_norm": 0.8104111912789507, "learning_rate": 6.952433219686775e-06, "loss": 0.36485040187835693, "num_input_tokens_seen": 484033200, "step": 11060, "train_runtime": 85544.4427, "train_tokens_per_second": 5658.266 }, { "epoch": 0.7450175060597899, "grad_norm": 0.745606714965393, "learning_rate": 6.949998782052497e-06, "loss": 0.38755149841308595, "num_input_tokens_seen": 484251832, "step": 11065, "train_runtime": 85584.405, "train_tokens_per_second": 5658.178 }, { "epoch": 0.74535416105575, "grad_norm": 0.7941311038883269, "learning_rate": 6.947563799107277e-06, "loss": 0.36263265609741213, "num_input_tokens_seen": 484460952, "step": 11070, "train_runtime": 85617.994, "train_tokens_per_second": 5658.401 }, { "epoch": 0.7456908160517102, "grad_norm": 0.795109174361431, "learning_rate": 6.945128271532052e-06, "loss": 0.37139124870300294, "num_input_tokens_seen": 484696168, "step": 11075, "train_runtime": 85658.1904, "train_tokens_per_second": 5658.492 }, { "epoch": 0.7460274710476703, "grad_norm": 0.7555629636652617, "learning_rate": 6.942692200007908e-06, "loss": 0.37421250343322754, "num_input_tokens_seen": 484914304, "step": 11080, "train_runtime": 85693.7663, "train_tokens_per_second": 5658.688 }, { "epoch": 0.7463641260436304, "grad_norm": 0.7710680161258006, "learning_rate": 6.9402555852160845e-06, "loss": 0.3868663787841797, "num_input_tokens_seen": 485140952, "step": 11085, "train_runtime": 85733.9493, "train_tokens_per_second": 5658.68 }, { "epoch": 0.7467007810395906, "grad_norm": 0.6618662744692935, "learning_rate": 6.937818427837975e-06, "loss": 0.35773367881774903, "num_input_tokens_seen": 485364088, "step": 11090, "train_runtime": 85775.7043, "train_tokens_per_second": 5658.526 }, { "epoch": 0.7470374360355507, "grad_norm": 0.8138674839150098, "learning_rate": 6.93538072855512e-06, "loss": 0.40668773651123047, "num_input_tokens_seen": 485585456, "step": 11095, "train_runtime": 85811.2509, "train_tokens_per_second": 5658.762 }, { "epoch": 0.7473740910315109, "grad_norm": 0.7237738810724516, "learning_rate": 6.932942488049217e-06, "loss": 0.3412586212158203, "num_input_tokens_seen": 485799760, "step": 11100, "train_runtime": 85848.9089, "train_tokens_per_second": 5658.776 }, { "epoch": 0.747710746027471, "grad_norm": 0.7192380582338419, "learning_rate": 6.930503707002108e-06, "loss": 0.39055523872375486, "num_input_tokens_seen": 486017000, "step": 11105, "train_runtime": 85893.6142, "train_tokens_per_second": 5658.36 }, { "epoch": 0.7480474010234311, "grad_norm": 0.7129551106844463, "learning_rate": 6.928064386095796e-06, "loss": 0.3696824789047241, "num_input_tokens_seen": 486243416, "step": 11110, "train_runtime": 85934.5192, "train_tokens_per_second": 5658.301 }, { "epoch": 0.7483840560193913, "grad_norm": 0.8296106328518675, "learning_rate": 6.9256245260124264e-06, "loss": 0.369446325302124, "num_input_tokens_seen": 486469728, "step": 11115, "train_runtime": 85966.8967, "train_tokens_per_second": 5658.803 }, { "epoch": 0.7487207110153514, "grad_norm": 0.8112267099332857, "learning_rate": 6.923184127434298e-06, "loss": 0.3864800453186035, "num_input_tokens_seen": 486670960, "step": 11120, "train_runtime": 86001.8182, "train_tokens_per_second": 5658.845 }, { "epoch": 0.7490573660113116, "grad_norm": 0.8933045922508607, "learning_rate": 6.920743191043861e-06, "loss": 0.35923840999603274, "num_input_tokens_seen": 486881136, "step": 11125, "train_runtime": 86039.0507, "train_tokens_per_second": 5658.839 }, { "epoch": 0.7493940210072717, "grad_norm": 0.6534193785965624, "learning_rate": 6.918301717523714e-06, "loss": 0.3482653617858887, "num_input_tokens_seen": 487095072, "step": 11130, "train_runtime": 86077.5734, "train_tokens_per_second": 5658.792 }, { "epoch": 0.7497306760032318, "grad_norm": 0.7160660990648459, "learning_rate": 6.915859707556611e-06, "loss": 0.3809635639190674, "num_input_tokens_seen": 487312640, "step": 11135, "train_runtime": 86112.0956, "train_tokens_per_second": 5659.05 }, { "epoch": 0.750067330999192, "grad_norm": 0.7880329367953478, "learning_rate": 6.913417161825449e-06, "loss": 0.40050134658813474, "num_input_tokens_seen": 487525824, "step": 11140, "train_runtime": 86145.5605, "train_tokens_per_second": 5659.326 }, { "epoch": 0.7504039859951521, "grad_norm": 0.7445156362898442, "learning_rate": 6.91097408101328e-06, "loss": 0.3789609432220459, "num_input_tokens_seen": 487742328, "step": 11145, "train_runtime": 86186.4755, "train_tokens_per_second": 5659.152 }, { "epoch": 0.7507406409911123, "grad_norm": 0.8940165351109152, "learning_rate": 6.908530465803302e-06, "loss": 0.370347785949707, "num_input_tokens_seen": 487949632, "step": 11150, "train_runtime": 86217.4676, "train_tokens_per_second": 5659.522 }, { "epoch": 0.7510772959870724, "grad_norm": 0.8568185419619945, "learning_rate": 6.906086316878865e-06, "loss": 0.3664633989334106, "num_input_tokens_seen": 488152136, "step": 11155, "train_runtime": 86258.4672, "train_tokens_per_second": 5659.179 }, { "epoch": 0.7514139509830325, "grad_norm": 0.6561053217546615, "learning_rate": 6.903641634923468e-06, "loss": 0.3477164268493652, "num_input_tokens_seen": 488367048, "step": 11160, "train_runtime": 86297.7659, "train_tokens_per_second": 5659.093 }, { "epoch": 0.7517506059789927, "grad_norm": 0.7394466907995108, "learning_rate": 6.9011964206207585e-06, "loss": 0.3994622230529785, "num_input_tokens_seen": 488567560, "step": 11165, "train_runtime": 86330.4394, "train_tokens_per_second": 5659.273 }, { "epoch": 0.7520872609749528, "grad_norm": 0.7890852129954726, "learning_rate": 6.898750674654531e-06, "loss": 0.36271369457244873, "num_input_tokens_seen": 488788328, "step": 11170, "train_runtime": 86369.9487, "train_tokens_per_second": 5659.241 }, { "epoch": 0.752423915970913, "grad_norm": 0.6327317994824692, "learning_rate": 6.896304397708733e-06, "loss": 0.35087008476257325, "num_input_tokens_seen": 488995192, "step": 11175, "train_runtime": 86408.8053, "train_tokens_per_second": 5659.09 }, { "epoch": 0.7527605709668731, "grad_norm": 0.7895910131617881, "learning_rate": 6.893857590467456e-06, "loss": 0.3524162292480469, "num_input_tokens_seen": 489213016, "step": 11180, "train_runtime": 86445.1307, "train_tokens_per_second": 5659.232 }, { "epoch": 0.7530972259628332, "grad_norm": 0.7380392223605537, "learning_rate": 6.891410253614944e-06, "loss": 0.34860227108001707, "num_input_tokens_seen": 489418272, "step": 11185, "train_runtime": 86484.3079, "train_tokens_per_second": 5659.041 }, { "epoch": 0.7534338809587934, "grad_norm": 0.702987221857376, "learning_rate": 6.888962387835586e-06, "loss": 0.384684419631958, "num_input_tokens_seen": 489652568, "step": 11190, "train_runtime": 86517.2831, "train_tokens_per_second": 5659.593 }, { "epoch": 0.7537705359547535, "grad_norm": 0.7485124246366612, "learning_rate": 6.886513993813919e-06, "loss": 0.38306422233581544, "num_input_tokens_seen": 489864096, "step": 11195, "train_runtime": 86557.4583, "train_tokens_per_second": 5659.409 }, { "epoch": 0.7541071909507137, "grad_norm": 0.7067279867145273, "learning_rate": 6.88406507223463e-06, "loss": 0.36569690704345703, "num_input_tokens_seen": 490092880, "step": 11200, "train_runtime": 86594.5272, "train_tokens_per_second": 5659.629 }, { "epoch": 0.7544438459466738, "grad_norm": 0.7595465228382173, "learning_rate": 6.881615623782551e-06, "loss": 0.35335478782653806, "num_input_tokens_seen": 490301440, "step": 11205, "train_runtime": 86631.5997, "train_tokens_per_second": 5659.614 }, { "epoch": 0.7547805009426339, "grad_norm": 0.7480898301661179, "learning_rate": 6.879165649142663e-06, "loss": 0.3659096956253052, "num_input_tokens_seen": 490500792, "step": 11210, "train_runtime": 86669.1193, "train_tokens_per_second": 5659.464 }, { "epoch": 0.7551171559385941, "grad_norm": 0.6467936248180215, "learning_rate": 6.876715149000093e-06, "loss": 0.36233794689178467, "num_input_tokens_seen": 490705136, "step": 11215, "train_runtime": 86708.2047, "train_tokens_per_second": 5659.27 }, { "epoch": 0.7554538109345542, "grad_norm": 0.7242780017786447, "learning_rate": 6.874264124040117e-06, "loss": 0.3791798114776611, "num_input_tokens_seen": 490930904, "step": 11220, "train_runtime": 86744.2352, "train_tokens_per_second": 5659.522 }, { "epoch": 0.7557904659305144, "grad_norm": 0.7534511874997005, "learning_rate": 6.871812574948154e-06, "loss": 0.394960880279541, "num_input_tokens_seen": 491158544, "step": 11225, "train_runtime": 86777.1348, "train_tokens_per_second": 5660.0 }, { "epoch": 0.7561271209264745, "grad_norm": 0.7151778561469025, "learning_rate": 6.869360502409773e-06, "loss": 0.3845766544342041, "num_input_tokens_seen": 491385232, "step": 11230, "train_runtime": 86814.8579, "train_tokens_per_second": 5660.151 }, { "epoch": 0.7564637759224346, "grad_norm": 0.7179238868789197, "learning_rate": 6.866907907110689e-06, "loss": 0.351468563079834, "num_input_tokens_seen": 491593976, "step": 11235, "train_runtime": 86852.7406, "train_tokens_per_second": 5660.086 }, { "epoch": 0.7568004309183949, "grad_norm": 0.6534240517661798, "learning_rate": 6.864454789736763e-06, "loss": 0.3472340822219849, "num_input_tokens_seen": 491827504, "step": 11240, "train_runtime": 86890.0801, "train_tokens_per_second": 5660.341 }, { "epoch": 0.757137085914355, "grad_norm": 0.6984388211704616, "learning_rate": 6.8620011509740005e-06, "loss": 0.3707188844680786, "num_input_tokens_seen": 492042264, "step": 11245, "train_runtime": 86929.2774, "train_tokens_per_second": 5660.259 }, { "epoch": 0.7574737409103152, "grad_norm": 0.8438964758084152, "learning_rate": 6.859546991508552e-06, "loss": 0.3541130542755127, "num_input_tokens_seen": 492261592, "step": 11250, "train_runtime": 86971.6043, "train_tokens_per_second": 5660.027 }, { "epoch": 0.7578103959062753, "grad_norm": 0.6972841594933251, "learning_rate": 6.857092312026716e-06, "loss": 0.3816833972930908, "num_input_tokens_seen": 492495240, "step": 11255, "train_runtime": 87006.7607, "train_tokens_per_second": 5660.425 }, { "epoch": 0.7581470509022354, "grad_norm": 0.7161736954331712, "learning_rate": 6.8546371132149395e-06, "loss": 0.39476380348205564, "num_input_tokens_seen": 492712328, "step": 11260, "train_runtime": 87046.3192, "train_tokens_per_second": 5660.346 }, { "epoch": 0.7584837058981956, "grad_norm": 0.7348844948766989, "learning_rate": 6.852181395759807e-06, "loss": 0.39330875873565674, "num_input_tokens_seen": 492943248, "step": 11265, "train_runtime": 87087.1631, "train_tokens_per_second": 5660.343 }, { "epoch": 0.7588203608941557, "grad_norm": 0.5683273529508269, "learning_rate": 6.849725160348054e-06, "loss": 0.3455686330795288, "num_input_tokens_seen": 493152344, "step": 11270, "train_runtime": 87127.3625, "train_tokens_per_second": 5660.132 }, { "epoch": 0.7591570158901159, "grad_norm": 0.7258002012386351, "learning_rate": 6.847268407666557e-06, "loss": 0.35138664245605467, "num_input_tokens_seen": 493375584, "step": 11275, "train_runtime": 87171.3314, "train_tokens_per_second": 5659.838 }, { "epoch": 0.759493670886076, "grad_norm": 0.7379175392341268, "learning_rate": 6.844811138402341e-06, "loss": 0.37623722553253175, "num_input_tokens_seen": 493594016, "step": 11280, "train_runtime": 87212.4908, "train_tokens_per_second": 5659.671 }, { "epoch": 0.7598303258820361, "grad_norm": 0.7131462906095328, "learning_rate": 6.842353353242574e-06, "loss": 0.36553401947021485, "num_input_tokens_seen": 493803080, "step": 11285, "train_runtime": 87254.8113, "train_tokens_per_second": 5659.322 }, { "epoch": 0.7601669808779963, "grad_norm": 0.7404989121841616, "learning_rate": 6.839895052874565e-06, "loss": 0.3759953737258911, "num_input_tokens_seen": 494027672, "step": 11290, "train_runtime": 87290.4517, "train_tokens_per_second": 5659.584 }, { "epoch": 0.7605036358739564, "grad_norm": 0.6838203757609232, "learning_rate": 6.837436237985772e-06, "loss": 0.3641194343566895, "num_input_tokens_seen": 494238208, "step": 11295, "train_runtime": 87333.9419, "train_tokens_per_second": 5659.177 }, { "epoch": 0.7608402908699166, "grad_norm": 0.850634796737577, "learning_rate": 6.834976909263794e-06, "loss": 0.37904021739959715, "num_input_tokens_seen": 494450104, "step": 11300, "train_runtime": 87372.8846, "train_tokens_per_second": 5659.08 }, { "epoch": 0.7611769458658767, "grad_norm": 0.7504214621662669, "learning_rate": 6.832517067396374e-06, "loss": 0.3586588859558105, "num_input_tokens_seen": 494683264, "step": 11305, "train_runtime": 87416.6251, "train_tokens_per_second": 5658.915 }, { "epoch": 0.7615136008618368, "grad_norm": 0.7181780717405477, "learning_rate": 6.8300567130714e-06, "loss": 0.39732561111450193, "num_input_tokens_seen": 494912080, "step": 11310, "train_runtime": 87455.7279, "train_tokens_per_second": 5659.001 }, { "epoch": 0.761850255857797, "grad_norm": 0.8326466499790485, "learning_rate": 6.8275958469769035e-06, "loss": 0.38528354167938234, "num_input_tokens_seen": 495143768, "step": 11315, "train_runtime": 87496.2946, "train_tokens_per_second": 5659.026 }, { "epoch": 0.7621869108537571, "grad_norm": 0.8043440720773757, "learning_rate": 6.825134469801055e-06, "loss": 0.3580173969268799, "num_input_tokens_seen": 495373776, "step": 11320, "train_runtime": 87536.7056, "train_tokens_per_second": 5659.041 }, { "epoch": 0.7625235658497173, "grad_norm": 0.7612366109464449, "learning_rate": 6.8226725822321715e-06, "loss": 0.4001301765441895, "num_input_tokens_seen": 495581360, "step": 11325, "train_runtime": 87574.6303, "train_tokens_per_second": 5658.96 }, { "epoch": 0.7628602208456774, "grad_norm": 0.7254035816528333, "learning_rate": 6.820210184958712e-06, "loss": 0.38148252964019774, "num_input_tokens_seen": 495805664, "step": 11330, "train_runtime": 87611.2812, "train_tokens_per_second": 5659.153 }, { "epoch": 0.7631968758416375, "grad_norm": 0.7816370531432046, "learning_rate": 6.81774727866928e-06, "loss": 0.38228158950805663, "num_input_tokens_seen": 496015888, "step": 11335, "train_runtime": 87647.9698, "train_tokens_per_second": 5659.183 }, { "epoch": 0.7635335308375977, "grad_norm": 0.9719681651052307, "learning_rate": 6.815283864052617e-06, "loss": 0.3840935468673706, "num_input_tokens_seen": 496237176, "step": 11340, "train_runtime": 87687.7469, "train_tokens_per_second": 5659.139 }, { "epoch": 0.7638701858335578, "grad_norm": 0.7821628809832356, "learning_rate": 6.812819941797611e-06, "loss": 0.38556504249572754, "num_input_tokens_seen": 496442520, "step": 11345, "train_runtime": 87730.1254, "train_tokens_per_second": 5658.746 }, { "epoch": 0.764206840829518, "grad_norm": 0.7793739338464833, "learning_rate": 6.810355512593288e-06, "loss": 0.3861824035644531, "num_input_tokens_seen": 496669864, "step": 11350, "train_runtime": 87767.0891, "train_tokens_per_second": 5658.953 }, { "epoch": 0.7645434958254781, "grad_norm": 0.7769049083652588, "learning_rate": 6.807890577128817e-06, "loss": 0.33897886276245115, "num_input_tokens_seen": 496892112, "step": 11355, "train_runtime": 87813.3112, "train_tokens_per_second": 5658.506 }, { "epoch": 0.7648801508214382, "grad_norm": 0.8235786764795517, "learning_rate": 6.805425136093513e-06, "loss": 0.3582730531692505, "num_input_tokens_seen": 497111304, "step": 11360, "train_runtime": 87847.6951, "train_tokens_per_second": 5658.786 }, { "epoch": 0.7652168058173984, "grad_norm": 0.825724303695909, "learning_rate": 6.802959190176827e-06, "loss": 0.38888885974884035, "num_input_tokens_seen": 497318752, "step": 11365, "train_runtime": 87886.6126, "train_tokens_per_second": 5658.641 }, { "epoch": 0.7655534608133585, "grad_norm": 0.7692237966789585, "learning_rate": 6.800492740068352e-06, "loss": 0.3655484676361084, "num_input_tokens_seen": 497523256, "step": 11370, "train_runtime": 87923.25, "train_tokens_per_second": 5658.609 }, { "epoch": 0.7658901158093187, "grad_norm": 0.8501602672533506, "learning_rate": 6.798025786457825e-06, "loss": 0.35955286026000977, "num_input_tokens_seen": 497749392, "step": 11375, "train_runtime": 87963.9631, "train_tokens_per_second": 5658.56 }, { "epoch": 0.7662267708052788, "grad_norm": 0.6654629734284263, "learning_rate": 6.795558330035118e-06, "loss": 0.3689566612243652, "num_input_tokens_seen": 497978632, "step": 11380, "train_runtime": 88010.5357, "train_tokens_per_second": 5658.171 }, { "epoch": 0.7665634258012389, "grad_norm": 0.571714653501898, "learning_rate": 6.793090371490251e-06, "loss": 0.37029447555541994, "num_input_tokens_seen": 498211416, "step": 11385, "train_runtime": 88043.3102, "train_tokens_per_second": 5658.708 }, { "epoch": 0.7669000807971991, "grad_norm": 0.6562894791866329, "learning_rate": 6.790621911513378e-06, "loss": 0.36082067489624026, "num_input_tokens_seen": 498430376, "step": 11390, "train_runtime": 88076.9318, "train_tokens_per_second": 5659.034 }, { "epoch": 0.7672367357931592, "grad_norm": 0.6830456569016362, "learning_rate": 6.788152950794799e-06, "loss": 0.3912408113479614, "num_input_tokens_seen": 498646776, "step": 11395, "train_runtime": 88113.1004, "train_tokens_per_second": 5659.167 }, { "epoch": 0.7675733907891193, "grad_norm": 0.8063375531181857, "learning_rate": 6.7856834900249495e-06, "loss": 0.3919992208480835, "num_input_tokens_seen": 498865144, "step": 11400, "train_runtime": 88157.9923, "train_tokens_per_second": 5658.763 }, { "epoch": 0.7679100457850795, "grad_norm": 0.7488462821998634, "learning_rate": 6.783213529894405e-06, "loss": 0.3473628044128418, "num_input_tokens_seen": 499082328, "step": 11405, "train_runtime": 88202.6214, "train_tokens_per_second": 5658.362 }, { "epoch": 0.7682467007810396, "grad_norm": 0.7845757383023176, "learning_rate": 6.780743071093883e-06, "loss": 0.35947589874267577, "num_input_tokens_seen": 499306216, "step": 11410, "train_runtime": 88242.1656, "train_tokens_per_second": 5658.363 }, { "epoch": 0.7685833557769998, "grad_norm": 1.4808480239457869, "learning_rate": 6.77827211431424e-06, "loss": 0.36936905384063723, "num_input_tokens_seen": 499532072, "step": 11415, "train_runtime": 88280.0767, "train_tokens_per_second": 5658.492 }, { "epoch": 0.7689200107729599, "grad_norm": 0.7193580497484903, "learning_rate": 6.775800660246471e-06, "loss": 0.36505095958709716, "num_input_tokens_seen": 499732272, "step": 11420, "train_runtime": 88316.7765, "train_tokens_per_second": 5658.407 }, { "epoch": 0.76925666576892, "grad_norm": 0.7225028793880158, "learning_rate": 6.77332870958171e-06, "loss": 0.3719770908355713, "num_input_tokens_seen": 499963848, "step": 11425, "train_runtime": 88361.2969, "train_tokens_per_second": 5658.177 }, { "epoch": 0.7695933207648802, "grad_norm": 0.7310175751597672, "learning_rate": 6.770856263011229e-06, "loss": 0.3673600196838379, "num_input_tokens_seen": 500175216, "step": 11430, "train_runtime": 88394.2396, "train_tokens_per_second": 5658.459 }, { "epoch": 0.7699299757608403, "grad_norm": 0.8011531340232532, "learning_rate": 6.768383321226442e-06, "loss": 0.38931114673614503, "num_input_tokens_seen": 500380304, "step": 11435, "train_runtime": 88432.6121, "train_tokens_per_second": 5658.323 }, { "epoch": 0.7702666307568005, "grad_norm": 1.540406850238615, "learning_rate": 6.765909884918898e-06, "loss": 0.3583209753036499, "num_input_tokens_seen": 500590256, "step": 11440, "train_runtime": 88469.3611, "train_tokens_per_second": 5658.346 }, { "epoch": 0.7706032857527606, "grad_norm": 0.6645503979893219, "learning_rate": 6.763435954780286e-06, "loss": 0.3920794725418091, "num_input_tokens_seen": 500810896, "step": 11445, "train_runtime": 88504.9842, "train_tokens_per_second": 5658.561 }, { "epoch": 0.7709399407487207, "grad_norm": 0.7669134143397409, "learning_rate": 6.7609615315024325e-06, "loss": 0.37000212669372556, "num_input_tokens_seen": 501027440, "step": 11450, "train_runtime": 88543.2243, "train_tokens_per_second": 5658.563 }, { "epoch": 0.7712765957446809, "grad_norm": 0.7415266590401455, "learning_rate": 6.758486615777301e-06, "loss": 0.37416849136352537, "num_input_tokens_seen": 501241576, "step": 11455, "train_runtime": 88583.8287, "train_tokens_per_second": 5658.387 }, { "epoch": 0.771613250740641, "grad_norm": 0.8407214839390016, "learning_rate": 6.756011208296995e-06, "loss": 0.3626854419708252, "num_input_tokens_seen": 501454696, "step": 11460, "train_runtime": 88621.4278, "train_tokens_per_second": 5658.391 }, { "epoch": 0.7719499057366012, "grad_norm": 0.7461388799032196, "learning_rate": 6.753535309753755e-06, "loss": 0.35544500350952146, "num_input_tokens_seen": 501658528, "step": 11465, "train_runtime": 88662.546, "train_tokens_per_second": 5658.066 }, { "epoch": 0.7722865607325613, "grad_norm": 0.6919457018289741, "learning_rate": 6.7510589208399565e-06, "loss": 0.3747244119644165, "num_input_tokens_seen": 501877728, "step": 11470, "train_runtime": 88703.6872, "train_tokens_per_second": 5657.913 }, { "epoch": 0.7726232157285214, "grad_norm": 0.7585317880232398, "learning_rate": 6.748582042248115e-06, "loss": 0.35962686538696287, "num_input_tokens_seen": 502089032, "step": 11475, "train_runtime": 88740.6334, "train_tokens_per_second": 5657.938 }, { "epoch": 0.7729598707244816, "grad_norm": 0.7198688949375671, "learning_rate": 6.746104674670882e-06, "loss": 0.38360817432403566, "num_input_tokens_seen": 502313408, "step": 11480, "train_runtime": 88777.3916, "train_tokens_per_second": 5658.123 }, { "epoch": 0.7732965257204417, "grad_norm": 0.6976205058667109, "learning_rate": 6.743626818801042e-06, "loss": 0.39516823291778563, "num_input_tokens_seen": 502534360, "step": 11485, "train_runtime": 88818.4462, "train_tokens_per_second": 5657.995 }, { "epoch": 0.7736331807164019, "grad_norm": 0.6984390114365983, "learning_rate": 6.741148475331525e-06, "loss": 0.37048795223236086, "num_input_tokens_seen": 502757200, "step": 11490, "train_runtime": 88854.2343, "train_tokens_per_second": 5658.224 }, { "epoch": 0.773969835712362, "grad_norm": 0.6953225919926989, "learning_rate": 6.738669644955388e-06, "loss": 0.3468164443969727, "num_input_tokens_seen": 502970848, "step": 11495, "train_runtime": 88897.1339, "train_tokens_per_second": 5657.897 }, { "epoch": 0.7743064907083221, "grad_norm": 0.7656686554212365, "learning_rate": 6.736190328365828e-06, "loss": 0.3672001838684082, "num_input_tokens_seen": 503195432, "step": 11500, "train_runtime": 88938.4411, "train_tokens_per_second": 5657.795 }, { "epoch": 0.7746431457042823, "grad_norm": 0.743345653178439, "learning_rate": 6.73371052625618e-06, "loss": 0.37738971710205077, "num_input_tokens_seen": 503417816, "step": 11505, "train_runtime": 88979.7242, "train_tokens_per_second": 5657.669 }, { "epoch": 0.7749798007002424, "grad_norm": 0.7491341805650183, "learning_rate": 6.731230239319912e-06, "loss": 0.37387096881866455, "num_input_tokens_seen": 503642040, "step": 11510, "train_runtime": 89021.4956, "train_tokens_per_second": 5657.533 }, { "epoch": 0.7753164556962026, "grad_norm": 0.6256746258505268, "learning_rate": 6.728749468250627e-06, "loss": 0.38176569938659666, "num_input_tokens_seen": 503870440, "step": 11515, "train_runtime": 89058.3538, "train_tokens_per_second": 5657.756 }, { "epoch": 0.7756531106921627, "grad_norm": 0.8527701221713213, "learning_rate": 6.726268213742066e-06, "loss": 0.375903582572937, "num_input_tokens_seen": 504076280, "step": 11520, "train_runtime": 89100.0272, "train_tokens_per_second": 5657.42 }, { "epoch": 0.7759897656881228, "grad_norm": 0.7746670396544606, "learning_rate": 6.723786476488105e-06, "loss": 0.38536639213562013, "num_input_tokens_seen": 504303624, "step": 11525, "train_runtime": 89134.096, "train_tokens_per_second": 5657.808 }, { "epoch": 0.776326420684083, "grad_norm": 0.6906699278173198, "learning_rate": 6.72130425718275e-06, "loss": 0.3504000186920166, "num_input_tokens_seen": 504511120, "step": 11530, "train_runtime": 89170.4494, "train_tokens_per_second": 5657.829 }, { "epoch": 0.7766630756800431, "grad_norm": 0.7640134079354167, "learning_rate": 6.718821556520151e-06, "loss": 0.3902331829071045, "num_input_tokens_seen": 504720744, "step": 11535, "train_runtime": 89203.783, "train_tokens_per_second": 5658.064 }, { "epoch": 0.7769997306760033, "grad_norm": 0.676852860064436, "learning_rate": 6.716338375194583e-06, "loss": 0.3558895826339722, "num_input_tokens_seen": 504945672, "step": 11540, "train_runtime": 89239.0086, "train_tokens_per_second": 5658.351 }, { "epoch": 0.7773363856719634, "grad_norm": 0.7081316231079949, "learning_rate": 6.713854713900463e-06, "loss": 0.39481263160705565, "num_input_tokens_seen": 505168112, "step": 11545, "train_runtime": 89280.0653, "train_tokens_per_second": 5658.241 }, { "epoch": 0.7776730406679235, "grad_norm": 0.7771142918437934, "learning_rate": 6.7113705733323365e-06, "loss": 0.3915176153182983, "num_input_tokens_seen": 505373904, "step": 11550, "train_runtime": 89321.9305, "train_tokens_per_second": 5657.893 }, { "epoch": 0.7780096956638837, "grad_norm": 0.7862100764061776, "learning_rate": 6.708885954184885e-06, "loss": 0.36997599601745607, "num_input_tokens_seen": 505592960, "step": 11555, "train_runtime": 89362.1395, "train_tokens_per_second": 5657.798 }, { "epoch": 0.7783463506598438, "grad_norm": 0.8044048640519208, "learning_rate": 6.7064008571529275e-06, "loss": 0.3574796199798584, "num_input_tokens_seen": 505815992, "step": 11560, "train_runtime": 89407.5364, "train_tokens_per_second": 5657.42 }, { "epoch": 0.778683005655804, "grad_norm": 0.63451019489799, "learning_rate": 6.703915282931411e-06, "loss": 0.37357444763183595, "num_input_tokens_seen": 506041792, "step": 11565, "train_runtime": 89452.1107, "train_tokens_per_second": 5657.125 }, { "epoch": 0.7790196606517641, "grad_norm": 0.7400296332193441, "learning_rate": 6.701429232215418e-06, "loss": 0.3822374105453491, "num_input_tokens_seen": 506244224, "step": 11570, "train_runtime": 89491.3476, "train_tokens_per_second": 5656.907 }, { "epoch": 0.7793563156477242, "grad_norm": 0.8414435559233742, "learning_rate": 6.6989427057001665e-06, "loss": 0.3804741144180298, "num_input_tokens_seen": 506470096, "step": 11575, "train_runtime": 89532.7906, "train_tokens_per_second": 5656.811 }, { "epoch": 0.7796929706436844, "grad_norm": 0.6787888680159854, "learning_rate": 6.696455704081006e-06, "loss": 0.3787699699401855, "num_input_tokens_seen": 506688376, "step": 11580, "train_runtime": 89574.3736, "train_tokens_per_second": 5656.622 }, { "epoch": 0.7800296256396445, "grad_norm": 0.711221275891421, "learning_rate": 6.693968228053416e-06, "loss": 0.38877334594726565, "num_input_tokens_seen": 506908432, "step": 11585, "train_runtime": 89609.8238, "train_tokens_per_second": 5656.84 }, { "epoch": 0.7803662806356046, "grad_norm": 0.7045284132631514, "learning_rate": 6.691480278313013e-06, "loss": 0.37210679054260254, "num_input_tokens_seen": 507123272, "step": 11590, "train_runtime": 89650.9072, "train_tokens_per_second": 5656.644 }, { "epoch": 0.7807029356315648, "grad_norm": 0.718080559096589, "learning_rate": 6.688991855555545e-06, "loss": 0.35350847244262695, "num_input_tokens_seen": 507339456, "step": 11595, "train_runtime": 89694.1289, "train_tokens_per_second": 5656.328 }, { "epoch": 0.7810395906275249, "grad_norm": 0.692068019249801, "learning_rate": 6.686502960476888e-06, "loss": 0.3558246612548828, "num_input_tokens_seen": 507577136, "step": 11600, "train_runtime": 89731.2991, "train_tokens_per_second": 5656.634 }, { "epoch": 0.7813762456234851, "grad_norm": 0.7053421542399363, "learning_rate": 6.684013593773058e-06, "loss": 0.3307861089706421, "num_input_tokens_seen": 507811288, "step": 11605, "train_runtime": 89766.4366, "train_tokens_per_second": 5657.028 }, { "epoch": 0.7817129006194452, "grad_norm": 0.7619528494233906, "learning_rate": 6.6815237561401955e-06, "loss": 0.33051750659942625, "num_input_tokens_seen": 508006304, "step": 11610, "train_runtime": 89802.2646, "train_tokens_per_second": 5656.943 }, { "epoch": 0.7820495556154053, "grad_norm": 0.8056101436691785, "learning_rate": 6.679033448274577e-06, "loss": 0.35503997802734377, "num_input_tokens_seen": 508223832, "step": 11615, "train_runtime": 89850.1477, "train_tokens_per_second": 5656.349 }, { "epoch": 0.7823862106113655, "grad_norm": 0.6611022339527542, "learning_rate": 6.676542670872609e-06, "loss": 0.3701477527618408, "num_input_tokens_seen": 508440024, "step": 11620, "train_runtime": 89890.5249, "train_tokens_per_second": 5656.214 }, { "epoch": 0.7827228656073256, "grad_norm": 0.6851834640607047, "learning_rate": 6.674051424630829e-06, "loss": 0.36185245513916015, "num_input_tokens_seen": 508666440, "step": 11625, "train_runtime": 89924.4436, "train_tokens_per_second": 5656.598 }, { "epoch": 0.7830595206032858, "grad_norm": 0.7081381172789725, "learning_rate": 6.671559710245905e-06, "loss": 0.36898825168609617, "num_input_tokens_seen": 508892304, "step": 11630, "train_runtime": 89970.0326, "train_tokens_per_second": 5656.242 }, { "epoch": 0.7833961755992459, "grad_norm": 0.7864088827874502, "learning_rate": 6.669067528414639e-06, "loss": 0.36539783477783205, "num_input_tokens_seen": 509118040, "step": 11635, "train_runtime": 90012.286, "train_tokens_per_second": 5656.095 }, { "epoch": 0.783732830595206, "grad_norm": 0.7072947789302337, "learning_rate": 6.6665748798339606e-06, "loss": 0.39262051582336427, "num_input_tokens_seen": 509346248, "step": 11640, "train_runtime": 90050.1585, "train_tokens_per_second": 5656.25 }, { "epoch": 0.7840694855911662, "grad_norm": 0.7696238239442139, "learning_rate": 6.664081765200932e-06, "loss": 0.38922972679138185, "num_input_tokens_seen": 509547192, "step": 11645, "train_runtime": 90082.5361, "train_tokens_per_second": 5656.448 }, { "epoch": 0.7844061405871263, "grad_norm": 0.9564255408577432, "learning_rate": 6.661588185212745e-06, "loss": 0.38661224842071534, "num_input_tokens_seen": 509767456, "step": 11650, "train_runtime": 90124.0819, "train_tokens_per_second": 5656.285 }, { "epoch": 0.7847427955830865, "grad_norm": 0.6920498506689123, "learning_rate": 6.65909414056672e-06, "loss": 0.37398757934570315, "num_input_tokens_seen": 509978544, "step": 11655, "train_runtime": 90162.88, "train_tokens_per_second": 5656.192 }, { "epoch": 0.7850794505790466, "grad_norm": 0.7983355414544516, "learning_rate": 6.6565996319603075e-06, "loss": 0.36649136543273925, "num_input_tokens_seen": 510194488, "step": 11660, "train_runtime": 90205.1793, "train_tokens_per_second": 5655.933 }, { "epoch": 0.7854161055750067, "grad_norm": 0.705582165882806, "learning_rate": 6.6541046600910915e-06, "loss": 0.35945792198181153, "num_input_tokens_seen": 510408368, "step": 11665, "train_runtime": 90242.6397, "train_tokens_per_second": 5655.956 }, { "epoch": 0.7857527605709669, "grad_norm": 0.7659229146292734, "learning_rate": 6.6516092256567824e-06, "loss": 0.36875619888305666, "num_input_tokens_seen": 510635536, "step": 11670, "train_runtime": 90279.7373, "train_tokens_per_second": 5656.148 }, { "epoch": 0.786089415566927, "grad_norm": 0.8578375495363305, "learning_rate": 6.64911332935522e-06, "loss": 0.39651241302490237, "num_input_tokens_seen": 510860904, "step": 11675, "train_runtime": 90320.5501, "train_tokens_per_second": 5656.087 }, { "epoch": 0.7864260705628872, "grad_norm": 0.7134409162325845, "learning_rate": 6.646616971884373e-06, "loss": 0.3647106885910034, "num_input_tokens_seen": 511085760, "step": 11680, "train_runtime": 90359.7652, "train_tokens_per_second": 5656.121 }, { "epoch": 0.7867627255588473, "grad_norm": 0.6706622363930574, "learning_rate": 6.64412015394234e-06, "loss": 0.35194456577301025, "num_input_tokens_seen": 511285624, "step": 11685, "train_runtime": 90397.4925, "train_tokens_per_second": 5655.971 }, { "epoch": 0.7870993805548074, "grad_norm": 0.8444783042140578, "learning_rate": 6.641622876227349e-06, "loss": 0.3812446594238281, "num_input_tokens_seen": 511491128, "step": 11690, "train_runtime": 90439.6501, "train_tokens_per_second": 5655.607 }, { "epoch": 0.7874360355507676, "grad_norm": 0.7494745665567035, "learning_rate": 6.639125139437756e-06, "loss": 0.3623605012893677, "num_input_tokens_seen": 511707944, "step": 11695, "train_runtime": 90482.4407, "train_tokens_per_second": 5655.329 }, { "epoch": 0.7877726905467277, "grad_norm": 0.7902023749862866, "learning_rate": 6.6366269442720446e-06, "loss": 0.36579647064208987, "num_input_tokens_seen": 511918704, "step": 11700, "train_runtime": 90522.6671, "train_tokens_per_second": 5655.144 }, { "epoch": 0.7881093455426879, "grad_norm": 0.7084908330150312, "learning_rate": 6.634128291428827e-06, "loss": 0.4204265594482422, "num_input_tokens_seen": 512130360, "step": 11705, "train_runtime": 90561.121, "train_tokens_per_second": 5655.08 }, { "epoch": 0.788446000538648, "grad_norm": 0.7463863432263244, "learning_rate": 6.631629181606842e-06, "loss": 0.37847514152526857, "num_input_tokens_seen": 512353072, "step": 11710, "train_runtime": 90604.8421, "train_tokens_per_second": 5654.809 }, { "epoch": 0.7887826555346081, "grad_norm": 0.7252447688219217, "learning_rate": 6.629129615504961e-06, "loss": 0.3778711795806885, "num_input_tokens_seen": 512578040, "step": 11715, "train_runtime": 90644.5653, "train_tokens_per_second": 5654.813 }, { "epoch": 0.7891193105305683, "grad_norm": 0.6877935716049668, "learning_rate": 6.626629593822178e-06, "loss": 0.349456787109375, "num_input_tokens_seen": 512795568, "step": 11720, "train_runtime": 90683.8764, "train_tokens_per_second": 5654.76 }, { "epoch": 0.7894559655265284, "grad_norm": 0.7159875503391986, "learning_rate": 6.624129117257616e-06, "loss": 0.3877539157867432, "num_input_tokens_seen": 513020704, "step": 11725, "train_runtime": 90721.6257, "train_tokens_per_second": 5654.889 }, { "epoch": 0.7897926205224886, "grad_norm": 0.8198647095115159, "learning_rate": 6.621628186510524e-06, "loss": 0.37906270027160643, "num_input_tokens_seen": 513238728, "step": 11730, "train_runtime": 90763.6807, "train_tokens_per_second": 5654.671 }, { "epoch": 0.7901292755184487, "grad_norm": 0.6710230144644209, "learning_rate": 6.619126802280281e-06, "loss": 0.35970292091369627, "num_input_tokens_seen": 513454240, "step": 11735, "train_runtime": 90806.8266, "train_tokens_per_second": 5654.357 }, { "epoch": 0.7904659305144088, "grad_norm": 0.6839883499284557, "learning_rate": 6.616624965266392e-06, "loss": 0.3722025632858276, "num_input_tokens_seen": 513674120, "step": 11740, "train_runtime": 90845.0403, "train_tokens_per_second": 5654.399 }, { "epoch": 0.790802585510369, "grad_norm": 0.7422766392719585, "learning_rate": 6.614122676168486e-06, "loss": 0.39596946239471437, "num_input_tokens_seen": 513889520, "step": 11745, "train_runtime": 90889.19, "train_tokens_per_second": 5654.022 }, { "epoch": 0.7911392405063291, "grad_norm": 0.8574462720949246, "learning_rate": 6.611619935686321e-06, "loss": 0.34925665855407717, "num_input_tokens_seen": 514094568, "step": 11750, "train_runtime": 90923.7862, "train_tokens_per_second": 5654.126 }, { "epoch": 0.7914758955022893, "grad_norm": 0.7396446955629874, "learning_rate": 6.609116744519779e-06, "loss": 0.3882757663726807, "num_input_tokens_seen": 514319376, "step": 11755, "train_runtime": 90961.7449, "train_tokens_per_second": 5654.238 }, { "epoch": 0.7918125504982494, "grad_norm": 0.8047711473168563, "learning_rate": 6.60661310336887e-06, "loss": 0.3384627103805542, "num_input_tokens_seen": 514527584, "step": 11760, "train_runtime": 91008.8104, "train_tokens_per_second": 5653.602 }, { "epoch": 0.7921492054942095, "grad_norm": 0.7981581690317775, "learning_rate": 6.604109012933732e-06, "loss": 0.37465848922729494, "num_input_tokens_seen": 514729464, "step": 11765, "train_runtime": 91040.9107, "train_tokens_per_second": 5653.826 }, { "epoch": 0.7924858604901697, "grad_norm": 0.7333032087882904, "learning_rate": 6.601604473914622e-06, "loss": 0.39129223823547366, "num_input_tokens_seen": 514948712, "step": 11770, "train_runtime": 91080.7609, "train_tokens_per_second": 5653.759 }, { "epoch": 0.7928225154861298, "grad_norm": 0.8203529810583842, "learning_rate": 6.599099487011928e-06, "loss": 0.3703568458557129, "num_input_tokens_seen": 515174152, "step": 11775, "train_runtime": 91123.7113, "train_tokens_per_second": 5653.569 }, { "epoch": 0.79315917048209, "grad_norm": 0.7692920757506985, "learning_rate": 6.596594052926163e-06, "loss": 0.37824716567993166, "num_input_tokens_seen": 515398616, "step": 11780, "train_runtime": 91161.9049, "train_tokens_per_second": 5653.662 }, { "epoch": 0.7934958254780501, "grad_norm": 0.6620821907912957, "learning_rate": 6.5940881723579595e-06, "loss": 0.36647372245788573, "num_input_tokens_seen": 515618208, "step": 11785, "train_runtime": 91199.6136, "train_tokens_per_second": 5653.732 }, { "epoch": 0.7938324804740102, "grad_norm": 0.7308558763801775, "learning_rate": 6.591581846008085e-06, "loss": 0.34111249446868896, "num_input_tokens_seen": 515838000, "step": 11790, "train_runtime": 91242.8853, "train_tokens_per_second": 5653.46 }, { "epoch": 0.7941691354699704, "grad_norm": 0.7510405382733509, "learning_rate": 6.589075074577421e-06, "loss": 0.3614863634109497, "num_input_tokens_seen": 516058872, "step": 11795, "train_runtime": 91288.1701, "train_tokens_per_second": 5653.075 }, { "epoch": 0.7945057904659305, "grad_norm": 0.682167345785408, "learning_rate": 6.5865678587669805e-06, "loss": 0.35341219902038573, "num_input_tokens_seen": 516288480, "step": 11800, "train_runtime": 91324.6105, "train_tokens_per_second": 5653.334 }, { "epoch": 0.7948424454618906, "grad_norm": 0.8727392399581251, "learning_rate": 6.584060199277897e-06, "loss": 0.3922135829925537, "num_input_tokens_seen": 516500456, "step": 11805, "train_runtime": 91356.4687, "train_tokens_per_second": 5653.682 }, { "epoch": 0.7951791004578508, "grad_norm": 0.7263526124399556, "learning_rate": 6.581552096811428e-06, "loss": 0.3736285209655762, "num_input_tokens_seen": 516717184, "step": 11810, "train_runtime": 91391.2945, "train_tokens_per_second": 5653.899 }, { "epoch": 0.7955157554538109, "grad_norm": 0.7483107004591556, "learning_rate": 6.57904355206896e-06, "loss": 0.3753064632415771, "num_input_tokens_seen": 516937256, "step": 11815, "train_runtime": 91433.3951, "train_tokens_per_second": 5653.703 }, { "epoch": 0.7958524104497711, "grad_norm": 0.741351883349472, "learning_rate": 6.576534565751997e-06, "loss": 0.35328757762908936, "num_input_tokens_seen": 517155784, "step": 11820, "train_runtime": 91472.4934, "train_tokens_per_second": 5653.675 }, { "epoch": 0.7961890654457312, "grad_norm": 0.7392430177231608, "learning_rate": 6.574025138562172e-06, "loss": 0.3843714475631714, "num_input_tokens_seen": 517361632, "step": 11825, "train_runtime": 91507.0999, "train_tokens_per_second": 5653.787 }, { "epoch": 0.7965257204416913, "grad_norm": 0.6186336035373811, "learning_rate": 6.571515271201234e-06, "loss": 0.3463775634765625, "num_input_tokens_seen": 517585680, "step": 11830, "train_runtime": 91547.5139, "train_tokens_per_second": 5653.738 }, { "epoch": 0.7968623754376515, "grad_norm": 0.6495706347541744, "learning_rate": 6.569004964371062e-06, "loss": 0.3861451864242554, "num_input_tokens_seen": 517810808, "step": 11835, "train_runtime": 91580.6678, "train_tokens_per_second": 5654.15 }, { "epoch": 0.7971990304336116, "grad_norm": 0.7143293886304013, "learning_rate": 6.566494218773656e-06, "loss": 0.3636291265487671, "num_input_tokens_seen": 518036944, "step": 11840, "train_runtime": 91623.7035, "train_tokens_per_second": 5653.962 }, { "epoch": 0.7975356854295718, "grad_norm": 0.7702610503844717, "learning_rate": 6.563983035111136e-06, "loss": 0.376003098487854, "num_input_tokens_seen": 518266216, "step": 11845, "train_runtime": 91660.207, "train_tokens_per_second": 5654.212 }, { "epoch": 0.7978723404255319, "grad_norm": 0.7600176188341217, "learning_rate": 6.561471414085748e-06, "loss": 0.36989893913269045, "num_input_tokens_seen": 518477336, "step": 11850, "train_runtime": 91696.4011, "train_tokens_per_second": 5654.282 }, { "epoch": 0.798208995421492, "grad_norm": 0.7119305326521156, "learning_rate": 6.558959356399859e-06, "loss": 0.3683455944061279, "num_input_tokens_seen": 518691120, "step": 11855, "train_runtime": 91735.153, "train_tokens_per_second": 5654.224 }, { "epoch": 0.7985456504174522, "grad_norm": 0.6724381741463443, "learning_rate": 6.5564468627559544e-06, "loss": 0.3579908609390259, "num_input_tokens_seen": 518897696, "step": 11860, "train_runtime": 91775.8953, "train_tokens_per_second": 5653.965 }, { "epoch": 0.7988823054134123, "grad_norm": 0.7387321689727897, "learning_rate": 6.5539339338566495e-06, "loss": 0.38613746166229246, "num_input_tokens_seen": 519112712, "step": 11865, "train_runtime": 91816.066, "train_tokens_per_second": 5653.833 }, { "epoch": 0.7992189604093725, "grad_norm": 0.8155036594396956, "learning_rate": 6.5514205704046754e-06, "loss": 0.34462246894836424, "num_input_tokens_seen": 519326360, "step": 11870, "train_runtime": 91857.9272, "train_tokens_per_second": 5653.582 }, { "epoch": 0.7995556154053326, "grad_norm": 0.7554873227873684, "learning_rate": 6.548906773102886e-06, "loss": 0.34732234477996826, "num_input_tokens_seen": 519538040, "step": 11875, "train_runtime": 91892.7088, "train_tokens_per_second": 5653.746 }, { "epoch": 0.7998922704012927, "grad_norm": 0.6865110717768457, "learning_rate": 6.546392542654257e-06, "loss": 0.3555797576904297, "num_input_tokens_seen": 519754440, "step": 11880, "train_runtime": 91931.8443, "train_tokens_per_second": 5653.693 }, { "epoch": 0.8002289253972529, "grad_norm": 0.7775168324740175, "learning_rate": 6.543877879761882e-06, "loss": 0.39305408000946046, "num_input_tokens_seen": 519971256, "step": 11885, "train_runtime": 91972.3549, "train_tokens_per_second": 5653.56 }, { "epoch": 0.800565580393213, "grad_norm": 0.6425158999557459, "learning_rate": 6.5413627851289825e-06, "loss": 0.3501169681549072, "num_input_tokens_seen": 520197464, "step": 11890, "train_runtime": 92010.0574, "train_tokens_per_second": 5653.702 }, { "epoch": 0.8009022353891732, "grad_norm": 0.7227536117889709, "learning_rate": 6.538847259458896e-06, "loss": 0.3551483631134033, "num_input_tokens_seen": 520422616, "step": 11895, "train_runtime": 92042.9843, "train_tokens_per_second": 5654.126 }, { "epoch": 0.8012388903851333, "grad_norm": 0.7042669271875746, "learning_rate": 6.5363313034550805e-06, "loss": 0.34134459495544434, "num_input_tokens_seen": 520633392, "step": 11900, "train_runtime": 92087.6293, "train_tokens_per_second": 5653.674 }, { "epoch": 0.8015755453810934, "grad_norm": 0.739311915732445, "learning_rate": 6.533814917821114e-06, "loss": 0.3754891395568848, "num_input_tokens_seen": 520855784, "step": 11905, "train_runtime": 92127.8168, "train_tokens_per_second": 5653.621 }, { "epoch": 0.8019122003770536, "grad_norm": 0.6302684231473084, "learning_rate": 6.531298103260696e-06, "loss": 0.3585964202880859, "num_input_tokens_seen": 521066736, "step": 11910, "train_runtime": 92163.5443, "train_tokens_per_second": 5653.719 }, { "epoch": 0.8022488553730137, "grad_norm": 0.7417671721607515, "learning_rate": 6.528780860477648e-06, "loss": 0.3797733783721924, "num_input_tokens_seen": 521300416, "step": 11915, "train_runtime": 92200.3318, "train_tokens_per_second": 5653.997 }, { "epoch": 0.8025855103689739, "grad_norm": 0.6890068438400968, "learning_rate": 6.526263190175907e-06, "loss": 0.3375946044921875, "num_input_tokens_seen": 521532280, "step": 11920, "train_runtime": 92234.4047, "train_tokens_per_second": 5654.422 }, { "epoch": 0.802922165364934, "grad_norm": 0.6823445253166819, "learning_rate": 6.523745093059531e-06, "loss": 0.3637096643447876, "num_input_tokens_seen": 521751944, "step": 11925, "train_runtime": 92276.588, "train_tokens_per_second": 5654.218 }, { "epoch": 0.8032588203608941, "grad_norm": 0.8198308621507191, "learning_rate": 6.521226569832699e-06, "loss": 0.3677360057830811, "num_input_tokens_seen": 521974016, "step": 11930, "train_runtime": 92311.2607, "train_tokens_per_second": 5654.5 }, { "epoch": 0.8035954753568543, "grad_norm": 0.7478623966170844, "learning_rate": 6.518707621199707e-06, "loss": 0.355226993560791, "num_input_tokens_seen": 522190040, "step": 11935, "train_runtime": 92353.1434, "train_tokens_per_second": 5654.275 }, { "epoch": 0.8039321303528144, "grad_norm": 0.7995961908090801, "learning_rate": 6.516188247864972e-06, "loss": 0.3752752304077148, "num_input_tokens_seen": 522418072, "step": 11940, "train_runtime": 92392.9504, "train_tokens_per_second": 5654.307 }, { "epoch": 0.8042687853487746, "grad_norm": 0.8084497458000778, "learning_rate": 6.513668450533028e-06, "loss": 0.3633857250213623, "num_input_tokens_seen": 522645296, "step": 11945, "train_runtime": 92428.2209, "train_tokens_per_second": 5654.607 }, { "epoch": 0.8046054403447347, "grad_norm": 0.7480700245413793, "learning_rate": 6.511148229908531e-06, "loss": 0.39172661304473877, "num_input_tokens_seen": 522868752, "step": 11950, "train_runtime": 92461.7106, "train_tokens_per_second": 5654.976 }, { "epoch": 0.8049420953406948, "grad_norm": 0.8708977640452219, "learning_rate": 6.508627586696248e-06, "loss": 0.3619298696517944, "num_input_tokens_seen": 523082504, "step": 11955, "train_runtime": 92499.8318, "train_tokens_per_second": 5654.956 }, { "epoch": 0.805278750336655, "grad_norm": 0.7261115677502934, "learning_rate": 6.5061065216010695e-06, "loss": 0.3667879581451416, "num_input_tokens_seen": 523299872, "step": 11960, "train_runtime": 92542.5023, "train_tokens_per_second": 5654.698 }, { "epoch": 0.8056154053326151, "grad_norm": 0.7422593678216647, "learning_rate": 6.5035850353280075e-06, "loss": 0.3360764503479004, "num_input_tokens_seen": 523516992, "step": 11965, "train_runtime": 92581.276, "train_tokens_per_second": 5654.675 }, { "epoch": 0.8059520603285752, "grad_norm": 0.7763633318074254, "learning_rate": 6.501063128582183e-06, "loss": 0.35983996391296386, "num_input_tokens_seen": 523724536, "step": 11970, "train_runtime": 92615.6401, "train_tokens_per_second": 5654.817 }, { "epoch": 0.8062887153245354, "grad_norm": 0.8599327424362851, "learning_rate": 6.498540802068843e-06, "loss": 0.36988580226898193, "num_input_tokens_seen": 523941648, "step": 11975, "train_runtime": 92650.751, "train_tokens_per_second": 5655.018 }, { "epoch": 0.8066253703204955, "grad_norm": 0.7313407988142705, "learning_rate": 6.4960180564933454e-06, "loss": 0.3595852851867676, "num_input_tokens_seen": 524162560, "step": 11980, "train_runtime": 92691.1408, "train_tokens_per_second": 5654.937 }, { "epoch": 0.8069620253164557, "grad_norm": 0.7521095206194225, "learning_rate": 6.493494892561167e-06, "loss": 0.3594093084335327, "num_input_tokens_seen": 524374312, "step": 11985, "train_runtime": 92728.3173, "train_tokens_per_second": 5654.953 }, { "epoch": 0.8072986803124158, "grad_norm": 0.8430159653893533, "learning_rate": 6.490971310977907e-06, "loss": 0.3831813812255859, "num_input_tokens_seen": 524596088, "step": 11990, "train_runtime": 92765.8417, "train_tokens_per_second": 5655.057 }, { "epoch": 0.807635335308376, "grad_norm": 0.7203196408716581, "learning_rate": 6.488447312449273e-06, "loss": 0.384428596496582, "num_input_tokens_seen": 524821680, "step": 11995, "train_runtime": 92796.5099, "train_tokens_per_second": 5655.619 }, { "epoch": 0.8079719903043361, "grad_norm": 0.7501646695656614, "learning_rate": 6.485922897681095e-06, "loss": 0.3725404739379883, "num_input_tokens_seen": 525045696, "step": 12000, "train_runtime": 92832.3227, "train_tokens_per_second": 5655.85 }, { "epoch": 0.8083086453002962, "grad_norm": 0.6490994037223768, "learning_rate": 6.483398067379316e-06, "loss": 0.4056462287902832, "num_input_tokens_seen": 525279952, "step": 12005, "train_runtime": 92862.4479, "train_tokens_per_second": 5656.538 }, { "epoch": 0.8086453002962564, "grad_norm": 0.719666275525647, "learning_rate": 6.480872822249998e-06, "loss": 0.3556082248687744, "num_input_tokens_seen": 525506864, "step": 12010, "train_runtime": 92904.5673, "train_tokens_per_second": 5656.416 }, { "epoch": 0.8089819552922165, "grad_norm": 0.764344635124093, "learning_rate": 6.478347162999318e-06, "loss": 0.3839968919754028, "num_input_tokens_seen": 525719016, "step": 12015, "train_runtime": 92947.2954, "train_tokens_per_second": 5656.098 }, { "epoch": 0.8093186102881766, "grad_norm": 0.6701860780093635, "learning_rate": 6.475821090333568e-06, "loss": 0.3664535999298096, "num_input_tokens_seen": 525939808, "step": 12020, "train_runtime": 92994.8165, "train_tokens_per_second": 5655.582 }, { "epoch": 0.8096552652841368, "grad_norm": 0.7604615691324128, "learning_rate": 6.473294604959156e-06, "loss": 0.38412063121795653, "num_input_tokens_seen": 526150200, "step": 12025, "train_runtime": 93031.4012, "train_tokens_per_second": 5655.619 }, { "epoch": 0.8099919202800969, "grad_norm": 0.7314264087625333, "learning_rate": 6.470767707582605e-06, "loss": 0.3502906322479248, "num_input_tokens_seen": 526371776, "step": 12030, "train_runtime": 93073.7526, "train_tokens_per_second": 5655.427 }, { "epoch": 0.8103285752760571, "grad_norm": 0.8031066646434316, "learning_rate": 6.468240398910555e-06, "loss": 0.36304702758789065, "num_input_tokens_seen": 526566912, "step": 12035, "train_runtime": 93113.568, "train_tokens_per_second": 5655.104 }, { "epoch": 0.8106652302720172, "grad_norm": 0.7056043206827206, "learning_rate": 6.4657126796497595e-06, "loss": 0.3545745849609375, "num_input_tokens_seen": 526798856, "step": 12040, "train_runtime": 93156.2331, "train_tokens_per_second": 5655.004 }, { "epoch": 0.8110018852679773, "grad_norm": 0.8107764954705456, "learning_rate": 6.463184550507087e-06, "loss": 0.37404961585998536, "num_input_tokens_seen": 527012296, "step": 12045, "train_runtime": 93201.4479, "train_tokens_per_second": 5654.551 }, { "epoch": 0.8113385402639375, "grad_norm": 0.6987203165103377, "learning_rate": 6.46065601218952e-06, "loss": 0.34106624126434326, "num_input_tokens_seen": 527230672, "step": 12050, "train_runtime": 93238.6997, "train_tokens_per_second": 5654.633 }, { "epoch": 0.8116751952598976, "grad_norm": 0.6797008656627719, "learning_rate": 6.458127065404156e-06, "loss": 0.3812570095062256, "num_input_tokens_seen": 527453272, "step": 12055, "train_runtime": 93278.2031, "train_tokens_per_second": 5654.625 }, { "epoch": 0.8120118502558578, "grad_norm": 0.6832021023137033, "learning_rate": 6.45559771085821e-06, "loss": 0.35934345722198485, "num_input_tokens_seen": 527679752, "step": 12060, "train_runtime": 93316.0381, "train_tokens_per_second": 5654.759 }, { "epoch": 0.8123485052518179, "grad_norm": 0.7280405860607188, "learning_rate": 6.453067949259005e-06, "loss": 0.35833373069763186, "num_input_tokens_seen": 527905280, "step": 12065, "train_runtime": 93350.8689, "train_tokens_per_second": 5655.066 }, { "epoch": 0.812685160247778, "grad_norm": 0.7042450928577643, "learning_rate": 6.450537781313982e-06, "loss": 0.33934841156005857, "num_input_tokens_seen": 528118504, "step": 12070, "train_runtime": 93398.5502, "train_tokens_per_second": 5654.461 }, { "epoch": 0.8130218152437382, "grad_norm": 0.8291985738023927, "learning_rate": 6.448007207730693e-06, "loss": 0.3756300926208496, "num_input_tokens_seen": 528340504, "step": 12075, "train_runtime": 93436.5515, "train_tokens_per_second": 5654.538 }, { "epoch": 0.8133584702396983, "grad_norm": 0.7204057314942438, "learning_rate": 6.445476229216805e-06, "loss": 0.35174586772918703, "num_input_tokens_seen": 528575776, "step": 12080, "train_runtime": 93474.5152, "train_tokens_per_second": 5654.758 }, { "epoch": 0.8136951252356585, "grad_norm": 0.7511444963498415, "learning_rate": 6.442944846480099e-06, "loss": 0.39254226684570315, "num_input_tokens_seen": 528786904, "step": 12085, "train_runtime": 93515.4145, "train_tokens_per_second": 5654.543 }, { "epoch": 0.8140317802316186, "grad_norm": 0.7816657648101096, "learning_rate": 6.44041306022847e-06, "loss": 0.39618897438049316, "num_input_tokens_seen": 529015944, "step": 12090, "train_runtime": 93554.4561, "train_tokens_per_second": 5654.631 }, { "epoch": 0.8143684352275787, "grad_norm": 0.8141588683065977, "learning_rate": 6.43788087116992e-06, "loss": 0.39859035015106203, "num_input_tokens_seen": 529246224, "step": 12095, "train_runtime": 93595.1858, "train_tokens_per_second": 5654.631 }, { "epoch": 0.8147050902235389, "grad_norm": 0.7932908932160116, "learning_rate": 6.43534828001257e-06, "loss": 0.3658564567565918, "num_input_tokens_seen": 529476248, "step": 12100, "train_runtime": 93626.3021, "train_tokens_per_second": 5655.208 }, { "epoch": 0.815041745219499, "grad_norm": 0.79019755327484, "learning_rate": 6.43281528746465e-06, "loss": 0.372475266456604, "num_input_tokens_seen": 529683080, "step": 12105, "train_runtime": 93660.6895, "train_tokens_per_second": 5655.34 }, { "epoch": 0.8153784002154592, "grad_norm": 0.6339454129210152, "learning_rate": 6.430281894234504e-06, "loss": 0.36925411224365234, "num_input_tokens_seen": 529906632, "step": 12110, "train_runtime": 93709.4206, "train_tokens_per_second": 5654.785 }, { "epoch": 0.8157150552114193, "grad_norm": 0.8085146313091093, "learning_rate": 6.427748101030587e-06, "loss": 0.3794065237045288, "num_input_tokens_seen": 530122608, "step": 12115, "train_runtime": 93746.5407, "train_tokens_per_second": 5654.85 }, { "epoch": 0.8160517102073794, "grad_norm": 0.7189030374735652, "learning_rate": 6.425213908561468e-06, "loss": 0.3644280433654785, "num_input_tokens_seen": 530344760, "step": 12120, "train_runtime": 93782.6096, "train_tokens_per_second": 5655.044 }, { "epoch": 0.8163883652033396, "grad_norm": 0.7379513095206941, "learning_rate": 6.422679317535823e-06, "loss": 0.3801795721054077, "num_input_tokens_seen": 530554320, "step": 12125, "train_runtime": 93818.6237, "train_tokens_per_second": 5655.107 }, { "epoch": 0.8167250201992997, "grad_norm": 0.7361384056056562, "learning_rate": 6.420144328662441e-06, "loss": 0.4110711097717285, "num_input_tokens_seen": 530784216, "step": 12130, "train_runtime": 93858.9763, "train_tokens_per_second": 5655.125 }, { "epoch": 0.8170616751952599, "grad_norm": 0.6984222353139848, "learning_rate": 6.417608942650229e-06, "loss": 0.36923315525054934, "num_input_tokens_seen": 530985400, "step": 12135, "train_runtime": 93900.3001, "train_tokens_per_second": 5654.779 }, { "epoch": 0.81739833019122, "grad_norm": 0.7696394382831785, "learning_rate": 6.415073160208196e-06, "loss": 0.368359637260437, "num_input_tokens_seen": 531219992, "step": 12140, "train_runtime": 93938.5272, "train_tokens_per_second": 5654.975 }, { "epoch": 0.8177349851871801, "grad_norm": 0.8778188370382649, "learning_rate": 6.412536982045465e-06, "loss": 0.38031327724456787, "num_input_tokens_seen": 531416856, "step": 12145, "train_runtime": 93975.0195, "train_tokens_per_second": 5654.874 }, { "epoch": 0.8180716401831403, "grad_norm": 0.7668958438378366, "learning_rate": 6.410000408871273e-06, "loss": 0.3821054458618164, "num_input_tokens_seen": 531631960, "step": 12150, "train_runtime": 94010.159, "train_tokens_per_second": 5655.048 }, { "epoch": 0.8184082951791004, "grad_norm": 0.7888864971284683, "learning_rate": 6.407463441394961e-06, "loss": 0.37601168155670167, "num_input_tokens_seen": 531859288, "step": 12155, "train_runtime": 94046.1948, "train_tokens_per_second": 5655.298 }, { "epoch": 0.8187449501750605, "grad_norm": 0.8191097049266588, "learning_rate": 6.4049260803259874e-06, "loss": 0.38929071426391604, "num_input_tokens_seen": 532082152, "step": 12160, "train_runtime": 94088.2586, "train_tokens_per_second": 5655.139 }, { "epoch": 0.8190816051710207, "grad_norm": 0.8221152177897472, "learning_rate": 6.402388326373914e-06, "loss": 0.3606018304824829, "num_input_tokens_seen": 532304432, "step": 12165, "train_runtime": 94128.8133, "train_tokens_per_second": 5655.064 }, { "epoch": 0.8194182601669808, "grad_norm": 0.6644138882185266, "learning_rate": 6.399850180248418e-06, "loss": 0.4054881572723389, "num_input_tokens_seen": 532538000, "step": 12170, "train_runtime": 94167.2148, "train_tokens_per_second": 5655.238 }, { "epoch": 0.819754915162941, "grad_norm": 0.7674282579500541, "learning_rate": 6.397311642659283e-06, "loss": 0.3806436538696289, "num_input_tokens_seen": 532749856, "step": 12175, "train_runtime": 94203.2208, "train_tokens_per_second": 5655.325 }, { "epoch": 0.8200915701589011, "grad_norm": 0.7532047074504019, "learning_rate": 6.394772714316402e-06, "loss": 0.3875831842422485, "num_input_tokens_seen": 532981096, "step": 12180, "train_runtime": 94238.5397, "train_tokens_per_second": 5655.66 }, { "epoch": 0.8204282251548612, "grad_norm": 0.691733853853237, "learning_rate": 6.392233395929779e-06, "loss": 0.34835638999938967, "num_input_tokens_seen": 533193808, "step": 12185, "train_runtime": 94267.7706, "train_tokens_per_second": 5656.162 }, { "epoch": 0.8207648801508214, "grad_norm": 0.6752837485492823, "learning_rate": 6.389693688209526e-06, "loss": 0.362264609336853, "num_input_tokens_seen": 533413896, "step": 12190, "train_runtime": 94307.5026, "train_tokens_per_second": 5656.113 }, { "epoch": 0.8211015351467815, "grad_norm": 0.6640861040569711, "learning_rate": 6.387153591865867e-06, "loss": 0.3703956604003906, "num_input_tokens_seen": 533642648, "step": 12195, "train_runtime": 94351.3757, "train_tokens_per_second": 5655.907 }, { "epoch": 0.8214381901427417, "grad_norm": 0.8639133957294087, "learning_rate": 6.384613107609127e-06, "loss": 0.38781538009643557, "num_input_tokens_seen": 533855672, "step": 12200, "train_runtime": 94388.037, "train_tokens_per_second": 5655.968 }, { "epoch": 0.8217748451387018, "grad_norm": 0.6461164084347707, "learning_rate": 6.382072236149747e-06, "loss": 0.3636336326599121, "num_input_tokens_seen": 534086688, "step": 12205, "train_runtime": 94418.101, "train_tokens_per_second": 5656.613 }, { "epoch": 0.8221115001346619, "grad_norm": 1.259849346653607, "learning_rate": 6.379530978198273e-06, "loss": 0.33962430953979494, "num_input_tokens_seen": 534295064, "step": 12210, "train_runtime": 94452.6928, "train_tokens_per_second": 5656.748 }, { "epoch": 0.8224481551306222, "grad_norm": 0.6840892751944132, "learning_rate": 6.376989334465361e-06, "loss": 0.34957318305969237, "num_input_tokens_seen": 534518376, "step": 12215, "train_runtime": 94487.4762, "train_tokens_per_second": 5657.029 }, { "epoch": 0.8227848101265823, "grad_norm": 0.7080671395957931, "learning_rate": 6.374447305661772e-06, "loss": 0.359330415725708, "num_input_tokens_seen": 534753352, "step": 12220, "train_runtime": 94526.7452, "train_tokens_per_second": 5657.165 }, { "epoch": 0.8231214651225425, "grad_norm": 0.7000813266501178, "learning_rate": 6.3719048924983776e-06, "loss": 0.3536032199859619, "num_input_tokens_seen": 534959200, "step": 12225, "train_runtime": 94565.9434, "train_tokens_per_second": 5656.996 }, { "epoch": 0.8234581201185026, "grad_norm": 0.7684419131244044, "learning_rate": 6.369362095686152e-06, "loss": 0.3803597688674927, "num_input_tokens_seen": 535175808, "step": 12230, "train_runtime": 94601.305, "train_tokens_per_second": 5657.172 }, { "epoch": 0.8237947751144628, "grad_norm": 0.6924107525351223, "learning_rate": 6.366818915936185e-06, "loss": 0.34799120426177976, "num_input_tokens_seen": 535394008, "step": 12235, "train_runtime": 94637.8962, "train_tokens_per_second": 5657.29 }, { "epoch": 0.8241314301104229, "grad_norm": 0.7585078799576096, "learning_rate": 6.364275353959667e-06, "loss": 0.3779747486114502, "num_input_tokens_seen": 535603560, "step": 12240, "train_runtime": 94679.4987, "train_tokens_per_second": 5657.017 }, { "epoch": 0.824468085106383, "grad_norm": 0.7685591544772424, "learning_rate": 6.3617314104678966e-06, "loss": 0.36225066184997556, "num_input_tokens_seen": 535838080, "step": 12245, "train_runtime": 94720.1071, "train_tokens_per_second": 5657.068 }, { "epoch": 0.8248047401023432, "grad_norm": 0.76161666147799, "learning_rate": 6.359187086172278e-06, "loss": 0.3977229118347168, "num_input_tokens_seen": 536041408, "step": 12250, "train_runtime": 94755.4024, "train_tokens_per_second": 5657.107 }, { "epoch": 0.8251413950983033, "grad_norm": 0.6732965305210872, "learning_rate": 6.356642381784326e-06, "loss": 0.3828271389007568, "num_input_tokens_seen": 536255712, "step": 12255, "train_runtime": 94789.5374, "train_tokens_per_second": 5657.33 }, { "epoch": 0.8254780500942634, "grad_norm": 0.9216909752320883, "learning_rate": 6.354097298015658e-06, "loss": 0.3526939392089844, "num_input_tokens_seen": 536450456, "step": 12260, "train_runtime": 94828.1952, "train_tokens_per_second": 5657.078 }, { "epoch": 0.8258147050902236, "grad_norm": 0.7392662084519794, "learning_rate": 6.3515518355779985e-06, "loss": 0.3932209014892578, "num_input_tokens_seen": 536655032, "step": 12265, "train_runtime": 94865.9619, "train_tokens_per_second": 5656.982 }, { "epoch": 0.8261513600861837, "grad_norm": 0.630920453324516, "learning_rate": 6.349005995183177e-06, "loss": 0.3485422134399414, "num_input_tokens_seen": 536883576, "step": 12270, "train_runtime": 94899.668, "train_tokens_per_second": 5657.381 }, { "epoch": 0.8264880150821439, "grad_norm": 0.6584126043910694, "learning_rate": 6.346459777543131e-06, "loss": 0.3577850341796875, "num_input_tokens_seen": 537102112, "step": 12275, "train_runtime": 94933.4199, "train_tokens_per_second": 5657.672 }, { "epoch": 0.826824670078104, "grad_norm": 0.69670427508635, "learning_rate": 6.343913183369902e-06, "loss": 0.3586315155029297, "num_input_tokens_seen": 537306360, "step": 12280, "train_runtime": 94970.6969, "train_tokens_per_second": 5657.602 }, { "epoch": 0.8271613250740641, "grad_norm": 0.6795435309811332, "learning_rate": 6.341366213375637e-06, "loss": 0.3537776231765747, "num_input_tokens_seen": 537534592, "step": 12285, "train_runtime": 95003.3121, "train_tokens_per_second": 5658.062 }, { "epoch": 0.8274979800700243, "grad_norm": 0.7334092343426839, "learning_rate": 6.338818868272587e-06, "loss": 0.3713988780975342, "num_input_tokens_seen": 537747240, "step": 12290, "train_runtime": 95041.1213, "train_tokens_per_second": 5658.048 }, { "epoch": 0.8278346350659844, "grad_norm": 0.7029457386112722, "learning_rate": 6.336271148773111e-06, "loss": 0.3642918109893799, "num_input_tokens_seen": 537982080, "step": 12295, "train_runtime": 95085.5253, "train_tokens_per_second": 5657.876 }, { "epoch": 0.8281712900619446, "grad_norm": 0.664085080042037, "learning_rate": 6.333723055589669e-06, "loss": 0.4124462127685547, "num_input_tokens_seen": 538202248, "step": 12300, "train_runtime": 95123.8409, "train_tokens_per_second": 5657.911 }, { "epoch": 0.8285079450579047, "grad_norm": 0.7689236487654127, "learning_rate": 6.331174589434826e-06, "loss": 0.3763313293457031, "num_input_tokens_seen": 538420056, "step": 12305, "train_runtime": 95170.7251, "train_tokens_per_second": 5657.413 }, { "epoch": 0.8288446000538648, "grad_norm": 0.7341729953622874, "learning_rate": 6.328625751021254e-06, "loss": 0.35441150665283205, "num_input_tokens_seen": 538627360, "step": 12310, "train_runtime": 95214.1667, "train_tokens_per_second": 5657.009 }, { "epoch": 0.829181255049825, "grad_norm": 0.7056989368636907, "learning_rate": 6.326076541061729e-06, "loss": 0.334460711479187, "num_input_tokens_seen": 538844328, "step": 12315, "train_runtime": 95255.2861, "train_tokens_per_second": 5656.844 }, { "epoch": 0.8295179100457851, "grad_norm": 0.7430926488416755, "learning_rate": 6.323526960269127e-06, "loss": 0.3949697971343994, "num_input_tokens_seen": 539054992, "step": 12320, "train_runtime": 95291.3412, "train_tokens_per_second": 5656.915 }, { "epoch": 0.8298545650417453, "grad_norm": 0.7296769222033309, "learning_rate": 6.3209770093564315e-06, "loss": 0.3561330556869507, "num_input_tokens_seen": 539280216, "step": 12325, "train_runtime": 95332.3002, "train_tokens_per_second": 5656.847 }, { "epoch": 0.8301912200377054, "grad_norm": 0.8506709358501154, "learning_rate": 6.318426689036727e-06, "loss": 0.3534719705581665, "num_input_tokens_seen": 539494040, "step": 12330, "train_runtime": 95376.0518, "train_tokens_per_second": 5656.494 }, { "epoch": 0.8305278750336655, "grad_norm": 0.7341499431044767, "learning_rate": 6.315876000023202e-06, "loss": 0.37946810722351076, "num_input_tokens_seen": 539706008, "step": 12335, "train_runtime": 95416.5574, "train_tokens_per_second": 5656.314 }, { "epoch": 0.8308645300296257, "grad_norm": 3.744199811122827, "learning_rate": 6.313324943029151e-06, "loss": 0.3778734922409058, "num_input_tokens_seen": 539917272, "step": 12340, "train_runtime": 95460.2877, "train_tokens_per_second": 5655.936 }, { "epoch": 0.8312011850255858, "grad_norm": 0.742412638594704, "learning_rate": 6.310773518767967e-06, "loss": 0.35590362548828125, "num_input_tokens_seen": 540130136, "step": 12345, "train_runtime": 95493.567, "train_tokens_per_second": 5656.194 }, { "epoch": 0.831537840021546, "grad_norm": 0.702835896250019, "learning_rate": 6.30822172795315e-06, "loss": 0.36078743934631347, "num_input_tokens_seen": 540336200, "step": 12350, "train_runtime": 95528.2473, "train_tokens_per_second": 5656.298 }, { "epoch": 0.8318744950175061, "grad_norm": 0.7843017900068701, "learning_rate": 6.3056695712982965e-06, "loss": 0.4154792785644531, "num_input_tokens_seen": 540561200, "step": 12355, "train_runtime": 95559.8481, "train_tokens_per_second": 5656.782 }, { "epoch": 0.8322111500134662, "grad_norm": 0.6757106331074613, "learning_rate": 6.303117049517111e-06, "loss": 0.3399226427078247, "num_input_tokens_seen": 540776592, "step": 12360, "train_runtime": 95600.3642, "train_tokens_per_second": 5656.637 }, { "epoch": 0.8325478050094264, "grad_norm": 0.7135184795154971, "learning_rate": 6.300564163323398e-06, "loss": 0.35541400909423826, "num_input_tokens_seen": 540989568, "step": 12365, "train_runtime": 95640.6371, "train_tokens_per_second": 5656.482 }, { "epoch": 0.8328844600053865, "grad_norm": 0.7511263678823955, "learning_rate": 6.298010913431065e-06, "loss": 0.36992754936218264, "num_input_tokens_seen": 541205456, "step": 12370, "train_runtime": 95679.064, "train_tokens_per_second": 5656.467 }, { "epoch": 0.8332211150013467, "grad_norm": 0.735359416996797, "learning_rate": 6.295457300554119e-06, "loss": 0.3586021184921265, "num_input_tokens_seen": 541434640, "step": 12375, "train_runtime": 95717.4462, "train_tokens_per_second": 5656.593 }, { "epoch": 0.8335577699973068, "grad_norm": 0.8567636961499998, "learning_rate": 6.292903325406668e-06, "loss": 0.38977057933807374, "num_input_tokens_seen": 541635304, "step": 12380, "train_runtime": 95751.5012, "train_tokens_per_second": 5656.677 }, { "epoch": 0.8338944249932669, "grad_norm": 0.7502505399469903, "learning_rate": 6.2903489887029255e-06, "loss": 0.34544246196746825, "num_input_tokens_seen": 541858656, "step": 12385, "train_runtime": 95786.9128, "train_tokens_per_second": 5656.917 }, { "epoch": 0.8342310799892271, "grad_norm": 0.6987916307726929, "learning_rate": 6.287794291157204e-06, "loss": 0.36299178600311277, "num_input_tokens_seen": 542076592, "step": 12390, "train_runtime": 95820.7633, "train_tokens_per_second": 5657.193 }, { "epoch": 0.8345677349851872, "grad_norm": 0.8150952905885787, "learning_rate": 6.285239233483915e-06, "loss": 0.36720116138458253, "num_input_tokens_seen": 542309048, "step": 12395, "train_runtime": 95859.9652, "train_tokens_per_second": 5657.305 }, { "epoch": 0.8349043899811474, "grad_norm": 0.683112485827057, "learning_rate": 6.2826838163975724e-06, "loss": 0.3783855438232422, "num_input_tokens_seen": 542526280, "step": 12400, "train_runtime": 95898.4045, "train_tokens_per_second": 5657.302 }, { "epoch": 0.8352410449771075, "grad_norm": 0.8138279320478745, "learning_rate": 6.2801280406127905e-06, "loss": 0.35349900722503663, "num_input_tokens_seen": 542750064, "step": 12405, "train_runtime": 95934.8168, "train_tokens_per_second": 5657.488 }, { "epoch": 0.8355776999730676, "grad_norm": 0.7615550252521133, "learning_rate": 6.2775719068442845e-06, "loss": 0.36704421043395996, "num_input_tokens_seen": 542968240, "step": 12410, "train_runtime": 95972.339, "train_tokens_per_second": 5657.549 }, { "epoch": 0.8359143549690278, "grad_norm": 0.7219105847794507, "learning_rate": 6.275015415806869e-06, "loss": 0.3532416343688965, "num_input_tokens_seen": 543175408, "step": 12415, "train_runtime": 96016.4623, "train_tokens_per_second": 5657.107 }, { "epoch": 0.8362510099649879, "grad_norm": 0.6790545597022978, "learning_rate": 6.272458568215458e-06, "loss": 0.3773714303970337, "num_input_tokens_seen": 543389992, "step": 12420, "train_runtime": 96057.0753, "train_tokens_per_second": 5656.949 }, { "epoch": 0.836587664960948, "grad_norm": 0.758978760003948, "learning_rate": 6.269901364785066e-06, "loss": 0.37525081634521484, "num_input_tokens_seen": 543616944, "step": 12425, "train_runtime": 96095.6171, "train_tokens_per_second": 5657.042 }, { "epoch": 0.8369243199569082, "grad_norm": 0.6823393482935673, "learning_rate": 6.2673438062308055e-06, "loss": 0.37595961093902586, "num_input_tokens_seen": 543859984, "step": 12430, "train_runtime": 96131.3734, "train_tokens_per_second": 5657.466 }, { "epoch": 0.8372609749528683, "grad_norm": 0.9689604562670696, "learning_rate": 6.264785893267892e-06, "loss": 0.3472005367279053, "num_input_tokens_seen": 544063976, "step": 12435, "train_runtime": 96162.9294, "train_tokens_per_second": 5657.731 }, { "epoch": 0.8375976299488285, "grad_norm": 0.7213840812199924, "learning_rate": 6.2622276266116366e-06, "loss": 0.36200590133666993, "num_input_tokens_seen": 544288640, "step": 12440, "train_runtime": 96199.7795, "train_tokens_per_second": 5657.899 }, { "epoch": 0.8379342849447886, "grad_norm": 0.6737267934047665, "learning_rate": 6.25966900697745e-06, "loss": 0.37799394130706787, "num_input_tokens_seen": 544514152, "step": 12445, "train_runtime": 96237.3914, "train_tokens_per_second": 5658.031 }, { "epoch": 0.8382709399407487, "grad_norm": 0.6929403643911132, "learning_rate": 6.257110035080843e-06, "loss": 0.3491935729980469, "num_input_tokens_seen": 544741824, "step": 12450, "train_runtime": 96274.7948, "train_tokens_per_second": 5658.198 }, { "epoch": 0.8386075949367089, "grad_norm": 0.6942505611698238, "learning_rate": 6.254550711637422e-06, "loss": 0.40814781188964844, "num_input_tokens_seen": 544950448, "step": 12455, "train_runtime": 96314.5199, "train_tokens_per_second": 5658.03 }, { "epoch": 0.838944249932669, "grad_norm": 0.7575909904692931, "learning_rate": 6.251991037362897e-06, "loss": 0.38295414447784426, "num_input_tokens_seen": 545159072, "step": 12460, "train_runtime": 96349.3253, "train_tokens_per_second": 5658.151 }, { "epoch": 0.8392809049286292, "grad_norm": 0.7581123803912536, "learning_rate": 6.249431012973068e-06, "loss": 0.37713871002197263, "num_input_tokens_seen": 545367120, "step": 12465, "train_runtime": 96388.6672, "train_tokens_per_second": 5658.0 }, { "epoch": 0.8396175599245893, "grad_norm": 0.7683081862438146, "learning_rate": 6.246870639183843e-06, "loss": 0.37398107051849366, "num_input_tokens_seen": 545578664, "step": 12470, "train_runtime": 96426.5472, "train_tokens_per_second": 5657.972 }, { "epoch": 0.8399542149205494, "grad_norm": 0.8223266832633437, "learning_rate": 6.2443099167112185e-06, "loss": 0.39701476097106936, "num_input_tokens_seen": 545803912, "step": 12475, "train_runtime": 96462.5666, "train_tokens_per_second": 5658.194 }, { "epoch": 0.8402908699165096, "grad_norm": 0.6969953488947742, "learning_rate": 6.241748846271293e-06, "loss": 0.3778507709503174, "num_input_tokens_seen": 546030536, "step": 12480, "train_runtime": 96496.5077, "train_tokens_per_second": 5658.552 }, { "epoch": 0.8406275249124697, "grad_norm": 0.7778677325039889, "learning_rate": 6.239187428580263e-06, "loss": 0.37636547088623046, "num_input_tokens_seen": 546236768, "step": 12485, "train_runtime": 96538.6051, "train_tokens_per_second": 5658.221 }, { "epoch": 0.8409641799084299, "grad_norm": 0.8059997970084556, "learning_rate": 6.236625664354421e-06, "loss": 0.3784951686859131, "num_input_tokens_seen": 546462096, "step": 12490, "train_runtime": 96574.6617, "train_tokens_per_second": 5658.442 }, { "epoch": 0.84130083490439, "grad_norm": 0.8520532583827878, "learning_rate": 6.2340635543101545e-06, "loss": 0.3676713466644287, "num_input_tokens_seen": 546657168, "step": 12495, "train_runtime": 96614.4259, "train_tokens_per_second": 5658.132 }, { "epoch": 0.8416374899003501, "grad_norm": 0.6539078891022843, "learning_rate": 6.23150109916395e-06, "loss": 0.33987085819244384, "num_input_tokens_seen": 546881208, "step": 12500, "train_runtime": 96655.3189, "train_tokens_per_second": 5658.056 }, { "epoch": 0.8419741448963103, "grad_norm": 0.6624040098906347, "learning_rate": 6.22893829963239e-06, "loss": 0.3859384059906006, "num_input_tokens_seen": 547092816, "step": 12505, "train_runtime": 96691.3494, "train_tokens_per_second": 5658.136 }, { "epoch": 0.8423107998922704, "grad_norm": 0.7298942090178581, "learning_rate": 6.226375156432153e-06, "loss": 0.357137393951416, "num_input_tokens_seen": 547322656, "step": 12510, "train_runtime": 96731.546, "train_tokens_per_second": 5658.161 }, { "epoch": 0.8426474548882306, "grad_norm": 0.7316486599091492, "learning_rate": 6.2238116702800145e-06, "loss": 0.3710299491882324, "num_input_tokens_seen": 547537944, "step": 12515, "train_runtime": 96762.4833, "train_tokens_per_second": 5658.577 }, { "epoch": 0.8429841098841907, "grad_norm": 0.7998109937320629, "learning_rate": 6.221247841892846e-06, "loss": 0.3879734992980957, "num_input_tokens_seen": 547746624, "step": 12520, "train_runtime": 96805.6441, "train_tokens_per_second": 5658.21 }, { "epoch": 0.8433207648801508, "grad_norm": 0.7307238083679223, "learning_rate": 6.218683671987611e-06, "loss": 0.3691586971282959, "num_input_tokens_seen": 547983928, "step": 12525, "train_runtime": 96840.3547, "train_tokens_per_second": 5658.632 }, { "epoch": 0.843657419876111, "grad_norm": 0.7271187490915773, "learning_rate": 6.216119161281373e-06, "loss": 0.37589943408966064, "num_input_tokens_seen": 548209600, "step": 12530, "train_runtime": 96879.0798, "train_tokens_per_second": 5658.699 }, { "epoch": 0.8439940748720711, "grad_norm": 0.7311632772691732, "learning_rate": 6.213554310491291e-06, "loss": 0.3672966003417969, "num_input_tokens_seen": 548421688, "step": 12535, "train_runtime": 96928.6015, "train_tokens_per_second": 5657.996 }, { "epoch": 0.8443307298680313, "grad_norm": 0.7450184498891292, "learning_rate": 6.210989120334616e-06, "loss": 0.362609338760376, "num_input_tokens_seen": 548644072, "step": 12540, "train_runtime": 96971.5458, "train_tokens_per_second": 5657.784 }, { "epoch": 0.8446673848639914, "grad_norm": 0.7758427572495085, "learning_rate": 6.208423591528694e-06, "loss": 0.38643317222595214, "num_input_tokens_seen": 548854336, "step": 12545, "train_runtime": 97009.7887, "train_tokens_per_second": 5657.721 }, { "epoch": 0.8450040398599515, "grad_norm": 0.688742133220875, "learning_rate": 6.205857724790969e-06, "loss": 0.3612468481063843, "num_input_tokens_seen": 549072600, "step": 12550, "train_runtime": 97048.5889, "train_tokens_per_second": 5657.708 }, { "epoch": 0.8453406948559117, "grad_norm": 0.7926232068697935, "learning_rate": 6.203291520838974e-06, "loss": 0.409790563583374, "num_input_tokens_seen": 549303984, "step": 12555, "train_runtime": 97086.2605, "train_tokens_per_second": 5657.896 }, { "epoch": 0.8456773498518718, "grad_norm": 0.7041401739211672, "learning_rate": 6.200724980390344e-06, "loss": 0.34305951595306394, "num_input_tokens_seen": 549497696, "step": 12560, "train_runtime": 97125.3875, "train_tokens_per_second": 5657.611 }, { "epoch": 0.846014004847832, "grad_norm": 0.6959581809215943, "learning_rate": 6.198158104162804e-06, "loss": 0.3178701400756836, "num_input_tokens_seen": 549713600, "step": 12565, "train_runtime": 97158.9336, "train_tokens_per_second": 5657.88 }, { "epoch": 0.8463506598437921, "grad_norm": 0.6766745725154476, "learning_rate": 6.1955908928741685e-06, "loss": 0.37602977752685546, "num_input_tokens_seen": 549953184, "step": 12570, "train_runtime": 97195.8557, "train_tokens_per_second": 5658.196 }, { "epoch": 0.8466873148397522, "grad_norm": 0.6881093744203187, "learning_rate": 6.193023347242353e-06, "loss": 0.38083457946777344, "num_input_tokens_seen": 550184352, "step": 12575, "train_runtime": 97232.314, "train_tokens_per_second": 5658.452 }, { "epoch": 0.8470239698357124, "grad_norm": 0.741931440728507, "learning_rate": 6.190455467985361e-06, "loss": 0.3633177042007446, "num_input_tokens_seen": 550405552, "step": 12580, "train_runtime": 97272.8862, "train_tokens_per_second": 5658.366 }, { "epoch": 0.8473606248316725, "grad_norm": 0.7792859259983645, "learning_rate": 6.187887255821295e-06, "loss": 0.3954836368560791, "num_input_tokens_seen": 550625896, "step": 12585, "train_runtime": 97305.8601, "train_tokens_per_second": 5658.713 }, { "epoch": 0.8476972798276327, "grad_norm": 0.7394004400669401, "learning_rate": 6.185318711468345e-06, "loss": 0.3501850128173828, "num_input_tokens_seen": 550827088, "step": 12590, "train_runtime": 97346.1248, "train_tokens_per_second": 5658.439 }, { "epoch": 0.8480339348235928, "grad_norm": 0.7906419360212633, "learning_rate": 6.182749835644799e-06, "loss": 0.3587897777557373, "num_input_tokens_seen": 551036712, "step": 12595, "train_runtime": 97378.9075, "train_tokens_per_second": 5658.687 }, { "epoch": 0.8483705898195529, "grad_norm": 0.6720676543784547, "learning_rate": 6.180180629069031e-06, "loss": 0.3534966468811035, "num_input_tokens_seen": 551269008, "step": 12600, "train_runtime": 97416.9713, "train_tokens_per_second": 5658.86 }, { "epoch": 0.8487072448155131, "grad_norm": 1.0844161686609408, "learning_rate": 6.177611092459514e-06, "loss": 0.3404214859008789, "num_input_tokens_seen": 551486584, "step": 12605, "train_runtime": 97454.9229, "train_tokens_per_second": 5658.889 }, { "epoch": 0.8490438998114732, "grad_norm": 0.8339846261840644, "learning_rate": 6.175041226534809e-06, "loss": 0.3584805965423584, "num_input_tokens_seen": 551707952, "step": 12610, "train_runtime": 97487.377, "train_tokens_per_second": 5659.276 }, { "epoch": 0.8493805548074334, "grad_norm": 0.688269893800755, "learning_rate": 6.172471032013574e-06, "loss": 0.327656888961792, "num_input_tokens_seen": 551932560, "step": 12615, "train_runtime": 97526.9729, "train_tokens_per_second": 5659.281 }, { "epoch": 0.8497172098033935, "grad_norm": 0.6595384550469138, "learning_rate": 6.169900509614553e-06, "loss": 0.3601629972457886, "num_input_tokens_seen": 552163800, "step": 12620, "train_runtime": 97577.6237, "train_tokens_per_second": 5658.713 }, { "epoch": 0.8500538647993536, "grad_norm": 0.8030731667400421, "learning_rate": 6.167329660056585e-06, "loss": 0.36720144748687744, "num_input_tokens_seen": 552375472, "step": 12625, "train_runtime": 97617.7309, "train_tokens_per_second": 5658.557 }, { "epoch": 0.8503905197953138, "grad_norm": 0.6580730799233167, "learning_rate": 6.1647584840586e-06, "loss": 0.36503446102142334, "num_input_tokens_seen": 552599576, "step": 12630, "train_runtime": 97665.6991, "train_tokens_per_second": 5658.072 }, { "epoch": 0.8507271747912739, "grad_norm": 0.7006154386468065, "learning_rate": 6.1621869823396175e-06, "loss": 0.37128496170043945, "num_input_tokens_seen": 552832696, "step": 12635, "train_runtime": 97703.9353, "train_tokens_per_second": 5658.244 }, { "epoch": 0.851063829787234, "grad_norm": 0.7225238597915238, "learning_rate": 6.159615155618752e-06, "loss": 0.37408173084259033, "num_input_tokens_seen": 553059920, "step": 12640, "train_runtime": 97737.0325, "train_tokens_per_second": 5658.653 }, { "epoch": 0.8514004847831942, "grad_norm": 0.8136467242343185, "learning_rate": 6.157043004615207e-06, "loss": 0.38596835136413576, "num_input_tokens_seen": 553300640, "step": 12645, "train_runtime": 97780.3263, "train_tokens_per_second": 5658.609 }, { "epoch": 0.8517371397791543, "grad_norm": 0.7939080541143891, "learning_rate": 6.1544705300482755e-06, "loss": 0.3616677761077881, "num_input_tokens_seen": 553532032, "step": 12650, "train_runtime": 97820.9636, "train_tokens_per_second": 5658.624 }, { "epoch": 0.8520737947751145, "grad_norm": 0.6610977560801387, "learning_rate": 6.151897732637341e-06, "loss": 0.3330955982208252, "num_input_tokens_seen": 553739416, "step": 12655, "train_runtime": 97857.6515, "train_tokens_per_second": 5658.622 }, { "epoch": 0.8524104497710746, "grad_norm": 0.8508497854348367, "learning_rate": 6.149324613101877e-06, "loss": 0.37527806758880616, "num_input_tokens_seen": 553959976, "step": 12660, "train_runtime": 97897.0387, "train_tokens_per_second": 5658.598 }, { "epoch": 0.8527471047670347, "grad_norm": 0.6193562313644957, "learning_rate": 6.146751172161453e-06, "loss": 0.33863201141357424, "num_input_tokens_seen": 554189776, "step": 12665, "train_runtime": 97940.3461, "train_tokens_per_second": 5658.442 }, { "epoch": 0.8530837597629949, "grad_norm": 0.7796518940843955, "learning_rate": 6.144177410535719e-06, "loss": 0.3652313470840454, "num_input_tokens_seen": 554414232, "step": 12670, "train_runtime": 97979.2461, "train_tokens_per_second": 5658.486 }, { "epoch": 0.853420414758955, "grad_norm": 0.7186651171193743, "learning_rate": 6.14160332894442e-06, "loss": 0.3651700973510742, "num_input_tokens_seen": 554625192, "step": 12675, "train_runtime": 98015.4768, "train_tokens_per_second": 5658.547 }, { "epoch": 0.8537570697549152, "grad_norm": 0.724709697937217, "learning_rate": 6.139028928107391e-06, "loss": 0.36736459732055665, "num_input_tokens_seen": 554842240, "step": 12680, "train_runtime": 98056.2763, "train_tokens_per_second": 5658.406 }, { "epoch": 0.8540937247508753, "grad_norm": 0.7018554477013618, "learning_rate": 6.136454208744553e-06, "loss": 0.3479247808456421, "num_input_tokens_seen": 555060144, "step": 12685, "train_runtime": 98097.7581, "train_tokens_per_second": 5658.235 }, { "epoch": 0.8544303797468354, "grad_norm": 0.7210589341441987, "learning_rate": 6.133879171575921e-06, "loss": 0.3790309906005859, "num_input_tokens_seen": 555276648, "step": 12690, "train_runtime": 98135.4374, "train_tokens_per_second": 5658.268 }, { "epoch": 0.8547670347427956, "grad_norm": 0.8012051731436295, "learning_rate": 6.131303817321595e-06, "loss": 0.3976943254470825, "num_input_tokens_seen": 555506600, "step": 12695, "train_runtime": 98173.0099, "train_tokens_per_second": 5658.445 }, { "epoch": 0.8551036897387557, "grad_norm": 0.6686702415410488, "learning_rate": 6.128728146701763e-06, "loss": 0.3907043933868408, "num_input_tokens_seen": 555735640, "step": 12700, "train_runtime": 98208.5683, "train_tokens_per_second": 5658.729 }, { "epoch": 0.8554403447347159, "grad_norm": 0.6745127609405563, "learning_rate": 6.126152160436705e-06, "loss": 0.3401200294494629, "num_input_tokens_seen": 555954936, "step": 12705, "train_runtime": 98247.4191, "train_tokens_per_second": 5658.723 }, { "epoch": 0.855776999730676, "grad_norm": 0.9952487891058109, "learning_rate": 6.123575859246784e-06, "loss": 0.3820429801940918, "num_input_tokens_seen": 556162568, "step": 12710, "train_runtime": 98285.6421, "train_tokens_per_second": 5658.635 }, { "epoch": 0.8561136547266361, "grad_norm": 0.7343846388254841, "learning_rate": 6.120999243852459e-06, "loss": 0.3488877773284912, "num_input_tokens_seen": 556374088, "step": 12715, "train_runtime": 98325.3673, "train_tokens_per_second": 5658.5 }, { "epoch": 0.8564503097225963, "grad_norm": 0.8403978577775663, "learning_rate": 6.118422314974269e-06, "loss": 0.3801596164703369, "num_input_tokens_seen": 556596000, "step": 12720, "train_runtime": 98368.0103, "train_tokens_per_second": 5658.303 }, { "epoch": 0.8567869647185564, "grad_norm": 0.7544062671681226, "learning_rate": 6.115845073332845e-06, "loss": 0.36686029434204104, "num_input_tokens_seen": 556828456, "step": 12725, "train_runtime": 98413.3452, "train_tokens_per_second": 5658.058 }, { "epoch": 0.8571236197145166, "grad_norm": 0.8566960890477198, "learning_rate": 6.113267519648905e-06, "loss": 0.39199421405792234, "num_input_tokens_seen": 557067040, "step": 12730, "train_runtime": 98457.4483, "train_tokens_per_second": 5657.947 }, { "epoch": 0.8574602747104767, "grad_norm": 0.6753240704632734, "learning_rate": 6.110689654643253e-06, "loss": 0.36382412910461426, "num_input_tokens_seen": 557274264, "step": 12735, "train_runtime": 98497.8079, "train_tokens_per_second": 5657.733 }, { "epoch": 0.8577969297064368, "grad_norm": 0.7623447924884228, "learning_rate": 6.1081114790367805e-06, "loss": 0.37306723594665525, "num_input_tokens_seen": 557484064, "step": 12740, "train_runtime": 98531.9864, "train_tokens_per_second": 5657.899 }, { "epoch": 0.858133584702397, "grad_norm": 0.7690727585148884, "learning_rate": 6.105532993550467e-06, "loss": 0.37079343795776365, "num_input_tokens_seen": 557707168, "step": 12745, "train_runtime": 98570.6779, "train_tokens_per_second": 5657.942 }, { "epoch": 0.8584702396983571, "grad_norm": 0.7227829734774792, "learning_rate": 6.1029541989053765e-06, "loss": 0.3675063610076904, "num_input_tokens_seen": 557923328, "step": 12750, "train_runtime": 98611.8723, "train_tokens_per_second": 5657.77 }, { "epoch": 0.8588068946943173, "grad_norm": 0.6216338336006675, "learning_rate": 6.100375095822661e-06, "loss": 0.3660135746002197, "num_input_tokens_seen": 558141912, "step": 12755, "train_runtime": 98653.6004, "train_tokens_per_second": 5657.593 }, { "epoch": 0.8591435496902774, "grad_norm": 0.7752180098632147, "learning_rate": 6.097795685023558e-06, "loss": 0.3654344081878662, "num_input_tokens_seen": 558363664, "step": 12760, "train_runtime": 98689.3362, "train_tokens_per_second": 5657.791 }, { "epoch": 0.8594802046862375, "grad_norm": 0.7139656897700937, "learning_rate": 6.095215967229396e-06, "loss": 0.3468952655792236, "num_input_tokens_seen": 558569128, "step": 12765, "train_runtime": 98726.8939, "train_tokens_per_second": 5657.72 }, { "epoch": 0.8598168596821977, "grad_norm": 0.6751611340302733, "learning_rate": 6.092635943161578e-06, "loss": 0.37009525299072266, "num_input_tokens_seen": 558798144, "step": 12770, "train_runtime": 98770.45, "train_tokens_per_second": 5657.544 }, { "epoch": 0.8601535146781578, "grad_norm": 0.7202350000001299, "learning_rate": 6.090055613541603e-06, "loss": 0.34846246242523193, "num_input_tokens_seen": 559026000, "step": 12775, "train_runtime": 98813.4858, "train_tokens_per_second": 5657.386 }, { "epoch": 0.860490169674118, "grad_norm": 0.7513541698981121, "learning_rate": 6.087474979091052e-06, "loss": 0.3586388111114502, "num_input_tokens_seen": 559233040, "step": 12780, "train_runtime": 98860.409, "train_tokens_per_second": 5656.795 }, { "epoch": 0.8608268246700781, "grad_norm": 0.7207910613458428, "learning_rate": 6.084894040531591e-06, "loss": 0.3598465919494629, "num_input_tokens_seen": 559456240, "step": 12785, "train_runtime": 98903.5566, "train_tokens_per_second": 5656.584 }, { "epoch": 0.8611634796660382, "grad_norm": 0.7450858357428686, "learning_rate": 6.0823127985849705e-06, "loss": 0.35327887535095215, "num_input_tokens_seen": 559662696, "step": 12790, "train_runtime": 98942.3562, "train_tokens_per_second": 5656.452 }, { "epoch": 0.8615001346619984, "grad_norm": 0.7413157970110851, "learning_rate": 6.079731253973028e-06, "loss": 0.3576143741607666, "num_input_tokens_seen": 559886624, "step": 12795, "train_runtime": 98988.6398, "train_tokens_per_second": 5656.069 }, { "epoch": 0.8618367896579585, "grad_norm": 0.7990871684605166, "learning_rate": 6.077149407417683e-06, "loss": 0.36043851375579833, "num_input_tokens_seen": 560101432, "step": 12800, "train_runtime": 99024.1718, "train_tokens_per_second": 5656.209 }, { "epoch": 0.8621734446539187, "grad_norm": 0.7364962437233615, "learning_rate": 6.07456725964094e-06, "loss": 0.3793959617614746, "num_input_tokens_seen": 560309472, "step": 12805, "train_runtime": 99059.299, "train_tokens_per_second": 5656.304 }, { "epoch": 0.8625100996498788, "grad_norm": 0.680598341183089, "learning_rate": 6.07198481136489e-06, "loss": 0.3436178684234619, "num_input_tokens_seen": 560520408, "step": 12810, "train_runtime": 99092.681, "train_tokens_per_second": 5656.527 }, { "epoch": 0.8628467546458389, "grad_norm": 0.765274818340009, "learning_rate": 6.069402063311706e-06, "loss": 0.3549325704574585, "num_input_tokens_seen": 560731064, "step": 12815, "train_runtime": 99135.7209, "train_tokens_per_second": 5656.196 }, { "epoch": 0.8631834096417991, "grad_norm": 0.8395744171280569, "learning_rate": 6.066819016203646e-06, "loss": 0.36306018829345704, "num_input_tokens_seen": 560944360, "step": 12820, "train_runtime": 99173.0123, "train_tokens_per_second": 5656.22 }, { "epoch": 0.8635200646377592, "grad_norm": 0.7436029507337527, "learning_rate": 6.064235670763048e-06, "loss": 0.36905884742736816, "num_input_tokens_seen": 561164928, "step": 12825, "train_runtime": 99209.242, "train_tokens_per_second": 5656.378 }, { "epoch": 0.8638567196337193, "grad_norm": 0.6763369772275482, "learning_rate": 6.06165202771234e-06, "loss": 0.3765472412109375, "num_input_tokens_seen": 561394056, "step": 12830, "train_runtime": 99250.4089, "train_tokens_per_second": 5656.34 }, { "epoch": 0.8641933746296795, "grad_norm": 0.6931570065850123, "learning_rate": 6.059068087774026e-06, "loss": 0.34474341869354247, "num_input_tokens_seen": 561593424, "step": 12835, "train_runtime": 99291.1127, "train_tokens_per_second": 5656.029 }, { "epoch": 0.8645300296256396, "grad_norm": 0.7306127243942253, "learning_rate": 6.0564838516707005e-06, "loss": 0.38959674835205077, "num_input_tokens_seen": 561821784, "step": 12840, "train_runtime": 99328.0768, "train_tokens_per_second": 5656.223 }, { "epoch": 0.8648666846215998, "grad_norm": 0.6692585369253214, "learning_rate": 6.053899320125033e-06, "loss": 0.34748311042785646, "num_input_tokens_seen": 562042168, "step": 12845, "train_runtime": 99368.2816, "train_tokens_per_second": 5656.153 }, { "epoch": 0.8652033396175599, "grad_norm": 0.731387810949299, "learning_rate": 6.051314493859782e-06, "loss": 0.37701342105865476, "num_input_tokens_seen": 562268616, "step": 12850, "train_runtime": 99405.5774, "train_tokens_per_second": 5656.309 }, { "epoch": 0.86553999461352, "grad_norm": 0.744983156104233, "learning_rate": 6.048729373597786e-06, "loss": 0.36400351524353025, "num_input_tokens_seen": 562488728, "step": 12855, "train_runtime": 99441.1097, "train_tokens_per_second": 5656.501 }, { "epoch": 0.8658766496094802, "grad_norm": 0.7052968569468162, "learning_rate": 6.046143960061963e-06, "loss": 0.38647964000701907, "num_input_tokens_seen": 562715632, "step": 12860, "train_runtime": 99479.679, "train_tokens_per_second": 5656.589 }, { "epoch": 0.8662133046054403, "grad_norm": 0.8490020320396742, "learning_rate": 6.043558253975319e-06, "loss": 0.3893282413482666, "num_input_tokens_seen": 562949544, "step": 12865, "train_runtime": 99522.1085, "train_tokens_per_second": 5656.528 }, { "epoch": 0.8665499596014005, "grad_norm": 0.7443300106386931, "learning_rate": 6.040972256060936e-06, "loss": 0.35498225688934326, "num_input_tokens_seen": 563161168, "step": 12870, "train_runtime": 99567.3086, "train_tokens_per_second": 5656.085 }, { "epoch": 0.8668866145973606, "grad_norm": 0.6849806622056446, "learning_rate": 6.038385967041982e-06, "loss": 0.3538069248199463, "num_input_tokens_seen": 563369656, "step": 12875, "train_runtime": 99613.8289, "train_tokens_per_second": 5655.537 }, { "epoch": 0.8672232695933207, "grad_norm": 0.6384169452977918, "learning_rate": 6.035799387641703e-06, "loss": 0.36878552436828616, "num_input_tokens_seen": 563594552, "step": 12880, "train_runtime": 99655.4177, "train_tokens_per_second": 5655.433 }, { "epoch": 0.8675599245892809, "grad_norm": 0.7636357717419208, "learning_rate": 6.033212518583427e-06, "loss": 0.3786178112030029, "num_input_tokens_seen": 563803512, "step": 12885, "train_runtime": 99695.3116, "train_tokens_per_second": 5655.266 }, { "epoch": 0.867896579585241, "grad_norm": 0.8323239828663773, "learning_rate": 6.030625360590567e-06, "loss": 0.35876643657684326, "num_input_tokens_seen": 564030520, "step": 12890, "train_runtime": 99734.3991, "train_tokens_per_second": 5655.326 }, { "epoch": 0.8682332345812012, "grad_norm": 0.7006071245579706, "learning_rate": 6.028037914386609e-06, "loss": 0.3620233297348022, "num_input_tokens_seen": 564252688, "step": 12895, "train_runtime": 99773.9473, "train_tokens_per_second": 5655.311 }, { "epoch": 0.8685698895771613, "grad_norm": 0.7617834642572114, "learning_rate": 6.025450180695128e-06, "loss": 0.38210210800170896, "num_input_tokens_seen": 564471472, "step": 12900, "train_runtime": 99808.9271, "train_tokens_per_second": 5655.521 }, { "epoch": 0.8689065445731214, "grad_norm": 0.8560111437943349, "learning_rate": 6.022862160239774e-06, "loss": 0.3630260467529297, "num_input_tokens_seen": 564683208, "step": 12905, "train_runtime": 99850.9033, "train_tokens_per_second": 5655.264 }, { "epoch": 0.8692431995690816, "grad_norm": 0.6306746195476955, "learning_rate": 6.020273853744277e-06, "loss": 0.3535295009613037, "num_input_tokens_seen": 564903760, "step": 12910, "train_runtime": 99888.6442, "train_tokens_per_second": 5655.335 }, { "epoch": 0.8695798545650417, "grad_norm": 0.6756821029513189, "learning_rate": 6.017685261932452e-06, "loss": 0.35518722534179686, "num_input_tokens_seen": 565105760, "step": 12915, "train_runtime": 99923.6252, "train_tokens_per_second": 5655.377 }, { "epoch": 0.8699165095610019, "grad_norm": 0.75004570307814, "learning_rate": 6.015096385528189e-06, "loss": 0.37440195083618166, "num_input_tokens_seen": 565318768, "step": 12920, "train_runtime": 99960.4635, "train_tokens_per_second": 5655.424 }, { "epoch": 0.870253164556962, "grad_norm": 0.725287349099034, "learning_rate": 6.012507225255457e-06, "loss": 0.3945824146270752, "num_input_tokens_seen": 565515560, "step": 12925, "train_runtime": 99995.6077, "train_tokens_per_second": 5655.404 }, { "epoch": 0.8705898195529221, "grad_norm": 0.6923174837526764, "learning_rate": 6.009917781838309e-06, "loss": 0.3706216812133789, "num_input_tokens_seen": 565736648, "step": 12930, "train_runtime": 100027.8477, "train_tokens_per_second": 5655.791 }, { "epoch": 0.8709264745488823, "grad_norm": 0.6934584410887805, "learning_rate": 6.007328056000873e-06, "loss": 0.37667386531829833, "num_input_tokens_seen": 565960800, "step": 12935, "train_runtime": 100063.8699, "train_tokens_per_second": 5655.996 }, { "epoch": 0.8712631295448424, "grad_norm": 0.7940274414990574, "learning_rate": 6.004738048467359e-06, "loss": 0.379984712600708, "num_input_tokens_seen": 566180672, "step": 12940, "train_runtime": 100101.3217, "train_tokens_per_second": 5656.076 }, { "epoch": 0.8715997845408026, "grad_norm": 0.7344390394871104, "learning_rate": 6.002147759962054e-06, "loss": 0.37138075828552247, "num_input_tokens_seen": 566401496, "step": 12945, "train_runtime": 100139.2781, "train_tokens_per_second": 5656.137 }, { "epoch": 0.8719364395367627, "grad_norm": 0.7421475803173249, "learning_rate": 5.999557191209323e-06, "loss": 0.39212737083435056, "num_input_tokens_seen": 566630216, "step": 12950, "train_runtime": 100175.2546, "train_tokens_per_second": 5656.389 }, { "epoch": 0.8722730945327228, "grad_norm": 0.8003491943698586, "learning_rate": 5.996966342933611e-06, "loss": 0.33372251987457274, "num_input_tokens_seen": 566848176, "step": 12955, "train_runtime": 100212.8634, "train_tokens_per_second": 5656.441 }, { "epoch": 0.872609749528683, "grad_norm": 0.7450010892993638, "learning_rate": 5.99437521585944e-06, "loss": 0.37457475662231443, "num_input_tokens_seen": 567056408, "step": 12960, "train_runtime": 100250.1105, "train_tokens_per_second": 5656.417 }, { "epoch": 0.8729464045246431, "grad_norm": 0.7217432409540151, "learning_rate": 5.99178381071141e-06, "loss": 0.3829956531524658, "num_input_tokens_seen": 567275168, "step": 12965, "train_runtime": 100287.1326, "train_tokens_per_second": 5656.51 }, { "epoch": 0.8732830595206033, "grad_norm": 0.8055483175054227, "learning_rate": 5.989192128214201e-06, "loss": 0.36388020515441893, "num_input_tokens_seen": 567493544, "step": 12970, "train_runtime": 100327.3129, "train_tokens_per_second": 5656.421 }, { "epoch": 0.8736197145165634, "grad_norm": 0.7033510804995021, "learning_rate": 5.986600169092568e-06, "loss": 0.350065803527832, "num_input_tokens_seen": 567708176, "step": 12975, "train_runtime": 100364.1125, "train_tokens_per_second": 5656.486 }, { "epoch": 0.8739563695125235, "grad_norm": 0.7167335785321889, "learning_rate": 5.984007934071343e-06, "loss": 0.3742049217224121, "num_input_tokens_seen": 567941160, "step": 12980, "train_runtime": 100407.0573, "train_tokens_per_second": 5656.387 }, { "epoch": 0.8742930245084837, "grad_norm": 0.7554361554619513, "learning_rate": 5.981415423875436e-06, "loss": 0.36548290252685545, "num_input_tokens_seen": 568166040, "step": 12985, "train_runtime": 100442.582, "train_tokens_per_second": 5656.625 }, { "epoch": 0.8746296795044438, "grad_norm": 0.9815756056409435, "learning_rate": 5.978822639229836e-06, "loss": 0.3484132528305054, "num_input_tokens_seen": 568367984, "step": 12990, "train_runtime": 100479.4893, "train_tokens_per_second": 5656.557 }, { "epoch": 0.874966334500404, "grad_norm": 0.6864898867694621, "learning_rate": 5.976229580859607e-06, "loss": 0.36139798164367676, "num_input_tokens_seen": 568596000, "step": 12995, "train_runtime": 100516.4986, "train_tokens_per_second": 5656.743 }, { "epoch": 0.8753029894963641, "grad_norm": 0.7186739597846133, "learning_rate": 5.9736362494898895e-06, "loss": 0.3539880275726318, "num_input_tokens_seen": 568814440, "step": 13000, "train_runtime": 100555.0904, "train_tokens_per_second": 5656.744 }, { "epoch": 0.8756396444923242, "grad_norm": 0.6506103454572264, "learning_rate": 5.971042645845897e-06, "loss": 0.3666597843170166, "num_input_tokens_seen": 569029824, "step": 13005, "train_runtime": 100595.3102, "train_tokens_per_second": 5656.624 }, { "epoch": 0.8759762994882844, "grad_norm": 0.7706124062857171, "learning_rate": 5.968448770652926e-06, "loss": 0.36510615348815917, "num_input_tokens_seen": 569265096, "step": 13010, "train_runtime": 100627.6528, "train_tokens_per_second": 5657.144 }, { "epoch": 0.8763129544842445, "grad_norm": 0.7419816582789281, "learning_rate": 5.965854624636345e-06, "loss": 0.3825402736663818, "num_input_tokens_seen": 569479936, "step": 13015, "train_runtime": 100669.5038, "train_tokens_per_second": 5656.926 }, { "epoch": 0.8766496094802047, "grad_norm": 0.7717112571968371, "learning_rate": 5.963260208521598e-06, "loss": 0.3698084354400635, "num_input_tokens_seen": 569691888, "step": 13020, "train_runtime": 100708.4391, "train_tokens_per_second": 5656.844 }, { "epoch": 0.8769862644761648, "grad_norm": 0.6761324100161831, "learning_rate": 5.960665523034205e-06, "loss": 0.38090927600860597, "num_input_tokens_seen": 569901576, "step": 13025, "train_runtime": 100749.3523, "train_tokens_per_second": 5656.628 }, { "epoch": 0.8773229194721249, "grad_norm": 0.7359973742678347, "learning_rate": 5.958070568899762e-06, "loss": 0.33312511444091797, "num_input_tokens_seen": 570123424, "step": 13030, "train_runtime": 100790.5444, "train_tokens_per_second": 5656.517 }, { "epoch": 0.8776595744680851, "grad_norm": 1.2136155199409513, "learning_rate": 5.955475346843939e-06, "loss": 0.3555187225341797, "num_input_tokens_seen": 570337248, "step": 13035, "train_runtime": 100824.0572, "train_tokens_per_second": 5656.758 }, { "epoch": 0.8779962294640452, "grad_norm": 0.6546063737811157, "learning_rate": 5.952879857592482e-06, "loss": 0.3440871000289917, "num_input_tokens_seen": 570549824, "step": 13040, "train_runtime": 100867.9537, "train_tokens_per_second": 5656.403 }, { "epoch": 0.8783328844600053, "grad_norm": 0.6844892975959102, "learning_rate": 5.950284101871212e-06, "loss": 0.38202319145202634, "num_input_tokens_seen": 570757152, "step": 13045, "train_runtime": 100906.3146, "train_tokens_per_second": 5656.308 }, { "epoch": 0.8786695394559655, "grad_norm": 0.747172974034045, "learning_rate": 5.947688080406023e-06, "loss": 0.3463796615600586, "num_input_tokens_seen": 570960928, "step": 13050, "train_runtime": 100940.5074, "train_tokens_per_second": 5656.41 }, { "epoch": 0.8790061944519256, "grad_norm": 0.7561590864609555, "learning_rate": 5.945091793922885e-06, "loss": 0.3679834842681885, "num_input_tokens_seen": 571177360, "step": 13055, "train_runtime": 100974.1104, "train_tokens_per_second": 5656.671 }, { "epoch": 0.8793428494478858, "grad_norm": 0.6782284385723677, "learning_rate": 5.942495243147839e-06, "loss": 0.3929899215698242, "num_input_tokens_seen": 571399192, "step": 13060, "train_runtime": 101005.759, "train_tokens_per_second": 5657.095 }, { "epoch": 0.8796795044438459, "grad_norm": 0.7143338491446609, "learning_rate": 5.939898428807004e-06, "loss": 0.3815101146697998, "num_input_tokens_seen": 571612808, "step": 13065, "train_runtime": 101043.3454, "train_tokens_per_second": 5657.105 }, { "epoch": 0.880016159439806, "grad_norm": 0.8449030830666151, "learning_rate": 5.937301351626571e-06, "loss": 0.379590368270874, "num_input_tokens_seen": 571824200, "step": 13070, "train_runtime": 101081.8232, "train_tokens_per_second": 5657.043 }, { "epoch": 0.8803528144357662, "grad_norm": 0.6830378970909649, "learning_rate": 5.934704012332803e-06, "loss": 0.35865001678466796, "num_input_tokens_seen": 572052552, "step": 13075, "train_runtime": 101122.8991, "train_tokens_per_second": 5657.003 }, { "epoch": 0.8806894694317263, "grad_norm": 0.8010624909706995, "learning_rate": 5.93210641165204e-06, "loss": 0.4059410095214844, "num_input_tokens_seen": 572274280, "step": 13080, "train_runtime": 101165.6483, "train_tokens_per_second": 5656.804 }, { "epoch": 0.8810261244276865, "grad_norm": 0.7989521029331256, "learning_rate": 5.92950855031069e-06, "loss": 0.36967930793762205, "num_input_tokens_seen": 572493808, "step": 13085, "train_runtime": 101202.3764, "train_tokens_per_second": 5656.921 }, { "epoch": 0.8813627794236466, "grad_norm": 0.8258054867788488, "learning_rate": 5.926910429035239e-06, "loss": 0.36150131225585935, "num_input_tokens_seen": 572706072, "step": 13090, "train_runtime": 101239.3964, "train_tokens_per_second": 5656.949 }, { "epoch": 0.8816994344196067, "grad_norm": 0.7636365729370889, "learning_rate": 5.924312048552241e-06, "loss": 0.3525059223175049, "num_input_tokens_seen": 572932096, "step": 13095, "train_runtime": 101273.4837, "train_tokens_per_second": 5657.276 }, { "epoch": 0.8820360894155669, "grad_norm": 0.7191821908315644, "learning_rate": 5.9217134095883265e-06, "loss": 0.3641670227050781, "num_input_tokens_seen": 573150384, "step": 13100, "train_runtime": 101314.4917, "train_tokens_per_second": 5657.141 }, { "epoch": 0.882372744411527, "grad_norm": 0.7363436743411855, "learning_rate": 5.919114512870197e-06, "loss": 0.3603955268859863, "num_input_tokens_seen": 573381144, "step": 13105, "train_runtime": 101359.314, "train_tokens_per_second": 5656.916 }, { "epoch": 0.8827093994074872, "grad_norm": 0.7568233135879606, "learning_rate": 5.916515359124623e-06, "loss": 0.3425842046737671, "num_input_tokens_seen": 573581832, "step": 13110, "train_runtime": 101399.4218, "train_tokens_per_second": 5656.658 }, { "epoch": 0.8830460544034473, "grad_norm": 0.7215795683330004, "learning_rate": 5.913915949078453e-06, "loss": 0.36979331970214846, "num_input_tokens_seen": 573801512, "step": 13115, "train_runtime": 101438.6834, "train_tokens_per_second": 5656.634 }, { "epoch": 0.8833827093994074, "grad_norm": 0.7764516396496984, "learning_rate": 5.911316283458601e-06, "loss": 0.3616600513458252, "num_input_tokens_seen": 574007544, "step": 13120, "train_runtime": 101478.4371, "train_tokens_per_second": 5656.448 }, { "epoch": 0.8837193643953676, "grad_norm": 0.7391044514688772, "learning_rate": 5.908716362992057e-06, "loss": 0.36803760528564455, "num_input_tokens_seen": 574215752, "step": 13125, "train_runtime": 101514.9279, "train_tokens_per_second": 5656.466 }, { "epoch": 0.8840560193913277, "grad_norm": 0.6863603049824145, "learning_rate": 5.90611618840588e-06, "loss": 0.379679536819458, "num_input_tokens_seen": 574434272, "step": 13130, "train_runtime": 101554.971, "train_tokens_per_second": 5656.388 }, { "epoch": 0.8843926743872879, "grad_norm": 0.9353489354148398, "learning_rate": 5.903515760427198e-06, "loss": 0.4000962257385254, "num_input_tokens_seen": 574653864, "step": 13135, "train_runtime": 101588.2234, "train_tokens_per_second": 5656.698 }, { "epoch": 0.884729329383248, "grad_norm": 0.732273202002582, "learning_rate": 5.900915079783218e-06, "loss": 0.3558906316757202, "num_input_tokens_seen": 574887384, "step": 13140, "train_runtime": 101622.3485, "train_tokens_per_second": 5657.096 }, { "epoch": 0.8850659843792081, "grad_norm": 0.7460917342917756, "learning_rate": 5.898314147201207e-06, "loss": 0.3416097640991211, "num_input_tokens_seen": 575101544, "step": 13145, "train_runtime": 101664.6483, "train_tokens_per_second": 5656.849 }, { "epoch": 0.8854026393751683, "grad_norm": 1.0430878064810838, "learning_rate": 5.895712963408511e-06, "loss": 0.3921904325485229, "num_input_tokens_seen": 575309032, "step": 13150, "train_runtime": 101704.7114, "train_tokens_per_second": 5656.661 }, { "epoch": 0.8857392943711284, "grad_norm": 0.7135808350871835, "learning_rate": 5.893111529132539e-06, "loss": 0.38542513847351073, "num_input_tokens_seen": 575518184, "step": 13155, "train_runtime": 101742.2738, "train_tokens_per_second": 5656.628 }, { "epoch": 0.8860759493670886, "grad_norm": 0.7661970012022706, "learning_rate": 5.8905098451007755e-06, "loss": 0.37914443016052246, "num_input_tokens_seen": 575721848, "step": 13160, "train_runtime": 101781.9439, "train_tokens_per_second": 5656.424 }, { "epoch": 0.8864126043630487, "grad_norm": 0.7203329040983677, "learning_rate": 5.887907912040774e-06, "loss": 0.3751526355743408, "num_input_tokens_seen": 575946104, "step": 13165, "train_runtime": 101814.7009, "train_tokens_per_second": 5656.807 }, { "epoch": 0.8867492593590088, "grad_norm": 0.7424424433197104, "learning_rate": 5.885305730680158e-06, "loss": 0.3788419723510742, "num_input_tokens_seen": 576173784, "step": 13170, "train_runtime": 101847.3914, "train_tokens_per_second": 5657.227 }, { "epoch": 0.887085914354969, "grad_norm": 0.7289665105864628, "learning_rate": 5.882703301746616e-06, "loss": 0.36290099620819094, "num_input_tokens_seen": 576389120, "step": 13175, "train_runtime": 101889.8836, "train_tokens_per_second": 5656.981 }, { "epoch": 0.8874225693509291, "grad_norm": 0.7262294984371385, "learning_rate": 5.88010062596791e-06, "loss": 0.35980806350708006, "num_input_tokens_seen": 576598016, "step": 13180, "train_runtime": 101930.8807, "train_tokens_per_second": 5656.755 }, { "epoch": 0.8877592243468893, "grad_norm": 0.601051210488872, "learning_rate": 5.877497704071871e-06, "loss": 0.3475220203399658, "num_input_tokens_seen": 576831392, "step": 13185, "train_runtime": 101969.0556, "train_tokens_per_second": 5656.926 }, { "epoch": 0.8880958793428494, "grad_norm": 0.7662456138801742, "learning_rate": 5.874894536786396e-06, "loss": 0.3340578079223633, "num_input_tokens_seen": 577044568, "step": 13190, "train_runtime": 102009.2868, "train_tokens_per_second": 5656.785 }, { "epoch": 0.8884325343388096, "grad_norm": 0.7991035565617537, "learning_rate": 5.8722911248394555e-06, "loss": 0.33777599334716796, "num_input_tokens_seen": 577243936, "step": 13195, "train_runtime": 102050.722, "train_tokens_per_second": 5656.441 }, { "epoch": 0.8887691893347698, "grad_norm": 0.7706395477682242, "learning_rate": 5.8696874689590824e-06, "loss": 0.3437623977661133, "num_input_tokens_seen": 577453888, "step": 13200, "train_runtime": 102083.4149, "train_tokens_per_second": 5656.687 }, { "epoch": 0.8891058443307299, "grad_norm": 0.8134775525528564, "learning_rate": 5.867083569873383e-06, "loss": 0.3634350776672363, "num_input_tokens_seen": 577679688, "step": 13205, "train_runtime": 102117.5448, "train_tokens_per_second": 5657.007 }, { "epoch": 0.8894424993266901, "grad_norm": 0.7673260905685215, "learning_rate": 5.8644794283105255e-06, "loss": 0.36774277687072754, "num_input_tokens_seen": 577900960, "step": 13210, "train_runtime": 102155.9766, "train_tokens_per_second": 5657.045 }, { "epoch": 0.8897791543226502, "grad_norm": 0.7882719202387701, "learning_rate": 5.861875044998755e-06, "loss": 0.40239391326904295, "num_input_tokens_seen": 578125704, "step": 13215, "train_runtime": 102190.4444, "train_tokens_per_second": 5657.336 }, { "epoch": 0.8901158093186103, "grad_norm": 0.7563037927913291, "learning_rate": 5.859270420666377e-06, "loss": 0.36860146522521975, "num_input_tokens_seen": 578343816, "step": 13220, "train_runtime": 102228.533, "train_tokens_per_second": 5657.362 }, { "epoch": 0.8904524643145705, "grad_norm": 0.7756762347173053, "learning_rate": 5.856665556041764e-06, "loss": 0.3481595993041992, "num_input_tokens_seen": 578548144, "step": 13225, "train_runtime": 102265.8667, "train_tokens_per_second": 5657.295 }, { "epoch": 0.8907891193105306, "grad_norm": 0.7183886665375777, "learning_rate": 5.8540604518533605e-06, "loss": 0.3859154224395752, "num_input_tokens_seen": 578772776, "step": 13230, "train_runtime": 102299.6045, "train_tokens_per_second": 5657.625 }, { "epoch": 0.8911257743064908, "grad_norm": 1.4271805656006054, "learning_rate": 5.851455108829675e-06, "loss": 0.34519567489624026, "num_input_tokens_seen": 578981024, "step": 13235, "train_runtime": 102340.8563, "train_tokens_per_second": 5657.379 }, { "epoch": 0.8914624293024509, "grad_norm": 0.6789149460339803, "learning_rate": 5.848849527699283e-06, "loss": 0.3698782205581665, "num_input_tokens_seen": 579201768, "step": 13240, "train_runtime": 102379.4065, "train_tokens_per_second": 5657.405 }, { "epoch": 0.891799084298411, "grad_norm": 0.7639170132777864, "learning_rate": 5.846243709190827e-06, "loss": 0.35757324695587156, "num_input_tokens_seen": 579419880, "step": 13245, "train_runtime": 102417.7033, "train_tokens_per_second": 5657.419 }, { "epoch": 0.8921357392943712, "grad_norm": 0.8837562529973417, "learning_rate": 5.843637654033019e-06, "loss": 0.37553791999816893, "num_input_tokens_seen": 579620760, "step": 13250, "train_runtime": 102459.8571, "train_tokens_per_second": 5657.052 }, { "epoch": 0.8924723942903313, "grad_norm": 0.676305723344451, "learning_rate": 5.841031362954629e-06, "loss": 0.39575533866882323, "num_input_tokens_seen": 579849048, "step": 13255, "train_runtime": 102495.0631, "train_tokens_per_second": 5657.336 }, { "epoch": 0.8928090492862915, "grad_norm": 0.6628658100615732, "learning_rate": 5.8384248366845e-06, "loss": 0.37047085762023924, "num_input_tokens_seen": 580077352, "step": 13260, "train_runtime": 102540.1881, "train_tokens_per_second": 5657.073 }, { "epoch": 0.8931457042822516, "grad_norm": 0.6825809402512039, "learning_rate": 5.8358180759515396e-06, "loss": 0.37846667766571046, "num_input_tokens_seen": 580288200, "step": 13265, "train_runtime": 102577.1371, "train_tokens_per_second": 5657.091 }, { "epoch": 0.8934823592782117, "grad_norm": 0.7471824938587698, "learning_rate": 5.833211081484719e-06, "loss": 0.37510037422180176, "num_input_tokens_seen": 580506904, "step": 13270, "train_runtime": 102618.782, "train_tokens_per_second": 5656.926 }, { "epoch": 0.8938190142741719, "grad_norm": 0.641717053888179, "learning_rate": 5.830603854013077e-06, "loss": 0.3673901081085205, "num_input_tokens_seen": 580723408, "step": 13275, "train_runtime": 102660.3376, "train_tokens_per_second": 5656.746 }, { "epoch": 0.894155669270132, "grad_norm": 0.8523312033525736, "learning_rate": 5.827996394265716e-06, "loss": 0.35067110061645507, "num_input_tokens_seen": 580935112, "step": 13280, "train_runtime": 102701.6639, "train_tokens_per_second": 5656.531 }, { "epoch": 0.8944923242660922, "grad_norm": 0.7794670905441262, "learning_rate": 5.825388702971802e-06, "loss": 0.35003342628479006, "num_input_tokens_seen": 581151304, "step": 13285, "train_runtime": 102733.2999, "train_tokens_per_second": 5656.893 }, { "epoch": 0.8948289792620523, "grad_norm": 0.7697508084044369, "learning_rate": 5.822780780860571e-06, "loss": 0.36042060852050783, "num_input_tokens_seen": 581367952, "step": 13290, "train_runtime": 102770.8878, "train_tokens_per_second": 5656.932 }, { "epoch": 0.8951656342580124, "grad_norm": 0.7094962387963322, "learning_rate": 5.820172628661317e-06, "loss": 0.3688685178756714, "num_input_tokens_seen": 581603552, "step": 13295, "train_runtime": 102804.4905, "train_tokens_per_second": 5657.375 }, { "epoch": 0.8955022892539726, "grad_norm": 0.7277970714037896, "learning_rate": 5.8175642471034045e-06, "loss": 0.34978251457214354, "num_input_tokens_seen": 581823928, "step": 13300, "train_runtime": 102838.1084, "train_tokens_per_second": 5657.669 }, { "epoch": 0.8958389442499327, "grad_norm": 0.7417598590201532, "learning_rate": 5.8149556369162565e-06, "loss": 0.3728696346282959, "num_input_tokens_seen": 582031800, "step": 13305, "train_runtime": 102877.0099, "train_tokens_per_second": 5657.55 }, { "epoch": 0.8961755992458929, "grad_norm": 0.7192634087406454, "learning_rate": 5.812346798829361e-06, "loss": 0.37227132320404055, "num_input_tokens_seen": 582257072, "step": 13310, "train_runtime": 102918.7234, "train_tokens_per_second": 5657.446 }, { "epoch": 0.896512254241853, "grad_norm": 0.7396821495476227, "learning_rate": 5.809737733572276e-06, "loss": 0.35695157051086424, "num_input_tokens_seen": 582470280, "step": 13315, "train_runtime": 102957.1094, "train_tokens_per_second": 5657.407 }, { "epoch": 0.8968489092378131, "grad_norm": 0.8286698107403867, "learning_rate": 5.8071284418746166e-06, "loss": 0.3608556747436523, "num_input_tokens_seen": 582689968, "step": 13320, "train_runtime": 102997.8183, "train_tokens_per_second": 5657.304 }, { "epoch": 0.8971855642337733, "grad_norm": 0.7429942677291922, "learning_rate": 5.80451892446606e-06, "loss": 0.38565864562988283, "num_input_tokens_seen": 582917944, "step": 13325, "train_runtime": 103036.6727, "train_tokens_per_second": 5657.383 }, { "epoch": 0.8975222192297334, "grad_norm": 0.6807484219365846, "learning_rate": 5.801909182076354e-06, "loss": 0.3657494068145752, "num_input_tokens_seen": 583143528, "step": 13330, "train_runtime": 103071.4117, "train_tokens_per_second": 5657.665 }, { "epoch": 0.8978588742256935, "grad_norm": 0.7911812244430602, "learning_rate": 5.7992992154353e-06, "loss": 0.3965157985687256, "num_input_tokens_seen": 583360120, "step": 13335, "train_runtime": 103106.3833, "train_tokens_per_second": 5657.847 }, { "epoch": 0.8981955292216537, "grad_norm": 0.7134344977635636, "learning_rate": 5.79668902527277e-06, "loss": 0.3728632926940918, "num_input_tokens_seen": 583576392, "step": 13340, "train_runtime": 103143.3779, "train_tokens_per_second": 5657.914 }, { "epoch": 0.8985321842176138, "grad_norm": 0.7068010881578768, "learning_rate": 5.794078612318695e-06, "loss": 0.36152513027191163, "num_input_tokens_seen": 583793888, "step": 13345, "train_runtime": 103187.6757, "train_tokens_per_second": 5657.593 }, { "epoch": 0.898868839213574, "grad_norm": 1.018985024468395, "learning_rate": 5.791467977303068e-06, "loss": 0.3539185285568237, "num_input_tokens_seen": 584007880, "step": 13350, "train_runtime": 103221.6694, "train_tokens_per_second": 5657.803 }, { "epoch": 0.8992054942095341, "grad_norm": 0.8787085802082749, "learning_rate": 5.788857120955945e-06, "loss": 0.3753284692764282, "num_input_tokens_seen": 584222720, "step": 13355, "train_runtime": 103259.3517, "train_tokens_per_second": 5657.819 }, { "epoch": 0.8995421492054942, "grad_norm": 0.7526792175486189, "learning_rate": 5.786246044007443e-06, "loss": 0.3408811092376709, "num_input_tokens_seen": 584430032, "step": 13360, "train_runtime": 103303.2518, "train_tokens_per_second": 5657.421 }, { "epoch": 0.8998788042014544, "grad_norm": 0.7042471293534047, "learning_rate": 5.783634747187743e-06, "loss": 0.38433132171630857, "num_input_tokens_seen": 584657272, "step": 13365, "train_runtime": 103336.5354, "train_tokens_per_second": 5657.798 }, { "epoch": 0.9002154591974145, "grad_norm": 0.7283278180613847, "learning_rate": 5.781023231227084e-06, "loss": 0.3663713693618774, "num_input_tokens_seen": 584873064, "step": 13370, "train_runtime": 103383.5959, "train_tokens_per_second": 5657.31 }, { "epoch": 0.9005521141933747, "grad_norm": 0.6987374788445736, "learning_rate": 5.778411496855769e-06, "loss": 0.3779282093048096, "num_input_tokens_seen": 585095664, "step": 13375, "train_runtime": 103422.1497, "train_tokens_per_second": 5657.354 }, { "epoch": 0.9008887691893348, "grad_norm": 0.7973255027303662, "learning_rate": 5.775799544804161e-06, "loss": 0.3911623477935791, "num_input_tokens_seen": 585323224, "step": 13380, "train_runtime": 103458.2471, "train_tokens_per_second": 5657.579 }, { "epoch": 0.9012254241852949, "grad_norm": 0.7376867678943736, "learning_rate": 5.7731873758026845e-06, "loss": 0.3567417860031128, "num_input_tokens_seen": 585539800, "step": 13385, "train_runtime": 103499.6202, "train_tokens_per_second": 5657.41 }, { "epoch": 0.9015620791812551, "grad_norm": 0.8164983344754712, "learning_rate": 5.770574990581823e-06, "loss": 0.3617391109466553, "num_input_tokens_seen": 585756160, "step": 13390, "train_runtime": 103538.5541, "train_tokens_per_second": 5657.372 }, { "epoch": 0.9018987341772152, "grad_norm": 0.7386008524112068, "learning_rate": 5.767962389872124e-06, "loss": 0.34462101459503175, "num_input_tokens_seen": 585972312, "step": 13395, "train_runtime": 103578.7054, "train_tokens_per_second": 5657.266 }, { "epoch": 0.9022353891731754, "grad_norm": 0.7749458765170661, "learning_rate": 5.765349574404191e-06, "loss": 0.3628375053405762, "num_input_tokens_seen": 586175624, "step": 13400, "train_runtime": 103611.757, "train_tokens_per_second": 5657.424 }, { "epoch": 0.9025720441691355, "grad_norm": 0.7292901746189114, "learning_rate": 5.7627365449086905e-06, "loss": 0.364549446105957, "num_input_tokens_seen": 586370072, "step": 13405, "train_runtime": 103645.7307, "train_tokens_per_second": 5657.445 }, { "epoch": 0.9029086991650956, "grad_norm": 0.7620757507465177, "learning_rate": 5.760123302116345e-06, "loss": 0.3901118040084839, "num_input_tokens_seen": 586593560, "step": 13410, "train_runtime": 103677.957, "train_tokens_per_second": 5657.843 }, { "epoch": 0.9032453541610558, "grad_norm": 0.7598225601483857, "learning_rate": 5.757509846757945e-06, "loss": 0.36999359130859377, "num_input_tokens_seen": 586819408, "step": 13415, "train_runtime": 103716.3963, "train_tokens_per_second": 5657.923 }, { "epoch": 0.9035820091570159, "grad_norm": 1.147309642657896, "learning_rate": 5.75489617956433e-06, "loss": 0.3971453428268433, "num_input_tokens_seen": 587040712, "step": 13420, "train_runtime": 103762.395, "train_tokens_per_second": 5657.548 }, { "epoch": 0.9039186641529761, "grad_norm": 0.6772540219988885, "learning_rate": 5.752282301266406e-06, "loss": 0.37274601459503176, "num_input_tokens_seen": 587260024, "step": 13425, "train_runtime": 103799.3896, "train_tokens_per_second": 5657.644 }, { "epoch": 0.9042553191489362, "grad_norm": 0.6865687048122345, "learning_rate": 5.749668212595136e-06, "loss": 0.36958420276641846, "num_input_tokens_seen": 587475152, "step": 13430, "train_runtime": 103838.2234, "train_tokens_per_second": 5657.6 }, { "epoch": 0.9045919741448963, "grad_norm": 0.7480660958831125, "learning_rate": 5.747053914281539e-06, "loss": 0.36184403896331785, "num_input_tokens_seen": 587679656, "step": 13435, "train_runtime": 103881.14, "train_tokens_per_second": 5657.231 }, { "epoch": 0.9049286291408565, "grad_norm": 0.7323661070573674, "learning_rate": 5.744439407056699e-06, "loss": 0.3511162757873535, "num_input_tokens_seen": 587888648, "step": 13440, "train_runtime": 103918.9245, "train_tokens_per_second": 5657.186 }, { "epoch": 0.9052652841368166, "grad_norm": 0.6204712137626076, "learning_rate": 5.741824691651752e-06, "loss": 0.3408759832382202, "num_input_tokens_seen": 588114264, "step": 13445, "train_runtime": 103954.7773, "train_tokens_per_second": 5657.405 }, { "epoch": 0.9056019391327768, "grad_norm": 0.8116090187953918, "learning_rate": 5.739209768797896e-06, "loss": 0.36322770118713377, "num_input_tokens_seen": 588322904, "step": 13450, "train_runtime": 103991.6356, "train_tokens_per_second": 5657.406 }, { "epoch": 0.9059385941287369, "grad_norm": 0.7146086921110422, "learning_rate": 5.736594639226385e-06, "loss": 0.32691378593444825, "num_input_tokens_seen": 588542624, "step": 13455, "train_runtime": 104026.9412, "train_tokens_per_second": 5657.598 }, { "epoch": 0.906275249124697, "grad_norm": 0.6758364668603787, "learning_rate": 5.7339793036685306e-06, "loss": 0.3772242546081543, "num_input_tokens_seen": 588766448, "step": 13460, "train_runtime": 104068.0394, "train_tokens_per_second": 5657.515 }, { "epoch": 0.9066119041206572, "grad_norm": 0.7332497573577879, "learning_rate": 5.731363762855706e-06, "loss": 0.3471216678619385, "num_input_tokens_seen": 588981896, "step": 13465, "train_runtime": 104109.0854, "train_tokens_per_second": 5657.353 }, { "epoch": 0.9069485591166173, "grad_norm": 0.8052750996260324, "learning_rate": 5.728748017519337e-06, "loss": 0.3998070001602173, "num_input_tokens_seen": 589199016, "step": 13470, "train_runtime": 104146.4665, "train_tokens_per_second": 5657.408 }, { "epoch": 0.9072852141125775, "grad_norm": 0.7072206601280142, "learning_rate": 5.726132068390908e-06, "loss": 0.3687425136566162, "num_input_tokens_seen": 589402952, "step": 13475, "train_runtime": 104180.5112, "train_tokens_per_second": 5657.516 }, { "epoch": 0.9076218691085376, "grad_norm": 0.7386177069645364, "learning_rate": 5.723515916201962e-06, "loss": 0.4100666046142578, "num_input_tokens_seen": 589630440, "step": 13480, "train_runtime": 104218.7952, "train_tokens_per_second": 5657.621 }, { "epoch": 0.9079585241044977, "grad_norm": 0.6255645042824444, "learning_rate": 5.720899561684098e-06, "loss": 0.3434640645980835, "num_input_tokens_seen": 589849368, "step": 13485, "train_runtime": 104262.0828, "train_tokens_per_second": 5657.372 }, { "epoch": 0.9082951791004579, "grad_norm": 0.7488072842696437, "learning_rate": 5.71828300556897e-06, "loss": 0.36190190315246584, "num_input_tokens_seen": 590075552, "step": 13490, "train_runtime": 104304.1746, "train_tokens_per_second": 5657.257 }, { "epoch": 0.908631834096418, "grad_norm": 0.595597879983287, "learning_rate": 5.715666248588289e-06, "loss": 0.3661900520324707, "num_input_tokens_seen": 590300848, "step": 13495, "train_runtime": 104350.0273, "train_tokens_per_second": 5656.93 }, { "epoch": 0.9089684890923782, "grad_norm": 0.7843852676552852, "learning_rate": 5.713049291473825e-06, "loss": 0.39053096771240237, "num_input_tokens_seen": 590529208, "step": 13500, "train_runtime": 104390.3684, "train_tokens_per_second": 5656.932 }, { "epoch": 0.9093051440883383, "grad_norm": 0.7754635800602863, "learning_rate": 5.710432134957399e-06, "loss": 0.3421627998352051, "num_input_tokens_seen": 590729424, "step": 13505, "train_runtime": 104437.8595, "train_tokens_per_second": 5656.277 }, { "epoch": 0.9096417990842984, "grad_norm": 0.7329858480957279, "learning_rate": 5.707814779770892e-06, "loss": 0.34261083602905273, "num_input_tokens_seen": 590940928, "step": 13510, "train_runtime": 104484.5885, "train_tokens_per_second": 5655.771 }, { "epoch": 0.9099784540802586, "grad_norm": 0.7345589839622834, "learning_rate": 5.7051972266462395e-06, "loss": 0.35787391662597656, "num_input_tokens_seen": 591158192, "step": 13515, "train_runtime": 104521.8258, "train_tokens_per_second": 5655.835 }, { "epoch": 0.9103151090762187, "grad_norm": 0.8008449716401149, "learning_rate": 5.702579476315431e-06, "loss": 0.3310979127883911, "num_input_tokens_seen": 591376656, "step": 13520, "train_runtime": 104566.7223, "train_tokens_per_second": 5655.496 }, { "epoch": 0.9106517640721788, "grad_norm": 0.7423340401003228, "learning_rate": 5.699961529510513e-06, "loss": 0.3578958988189697, "num_input_tokens_seen": 591581336, "step": 13525, "train_runtime": 104607.1051, "train_tokens_per_second": 5655.269 }, { "epoch": 0.910988419068139, "grad_norm": 0.7857402111034575, "learning_rate": 5.697343386963586e-06, "loss": 0.3766601800918579, "num_input_tokens_seen": 591797696, "step": 13530, "train_runtime": 104651.9901, "train_tokens_per_second": 5654.911 }, { "epoch": 0.9113250740640991, "grad_norm": 0.6657292352842593, "learning_rate": 5.694725049406801e-06, "loss": 0.3710474967956543, "num_input_tokens_seen": 592014888, "step": 13535, "train_runtime": 104697.3063, "train_tokens_per_second": 5654.538 }, { "epoch": 0.9116617290600593, "grad_norm": 0.6966081276914712, "learning_rate": 5.692106517572373e-06, "loss": 0.38451037406921384, "num_input_tokens_seen": 592229672, "step": 13540, "train_runtime": 104731.9456, "train_tokens_per_second": 5654.719 }, { "epoch": 0.9119983840560194, "grad_norm": 0.7724805146942423, "learning_rate": 5.689487792192566e-06, "loss": 0.3990262746810913, "num_input_tokens_seen": 592451696, "step": 13545, "train_runtime": 104773.5682, "train_tokens_per_second": 5654.591 }, { "epoch": 0.9123350390519795, "grad_norm": 0.7342026376072939, "learning_rate": 5.686868873999696e-06, "loss": 0.3797611236572266, "num_input_tokens_seen": 592668960, "step": 13550, "train_runtime": 104816.4545, "train_tokens_per_second": 5654.35 }, { "epoch": 0.9126716940479397, "grad_norm": 0.666648695750785, "learning_rate": 5.684249763726135e-06, "loss": 0.3764026641845703, "num_input_tokens_seen": 592890144, "step": 13555, "train_runtime": 104853.017, "train_tokens_per_second": 5654.488 }, { "epoch": 0.9130083490438998, "grad_norm": 0.796183302090131, "learning_rate": 5.681630462104308e-06, "loss": 0.3508880615234375, "num_input_tokens_seen": 593092200, "step": 13560, "train_runtime": 104890.6314, "train_tokens_per_second": 5654.387 }, { "epoch": 0.91334500403986, "grad_norm": 0.6941135923026022, "learning_rate": 5.679010969866697e-06, "loss": 0.3628666877746582, "num_input_tokens_seen": 593304400, "step": 13565, "train_runtime": 104927.8794, "train_tokens_per_second": 5654.402 }, { "epoch": 0.9136816590358201, "grad_norm": 0.7543532537354826, "learning_rate": 5.676391287745835e-06, "loss": 0.35071396827697754, "num_input_tokens_seen": 593537816, "step": 13570, "train_runtime": 104959.059, "train_tokens_per_second": 5654.946 }, { "epoch": 0.9140183140317802, "grad_norm": 0.6731321122510332, "learning_rate": 5.673771416474305e-06, "loss": 0.3439845085144043, "num_input_tokens_seen": 593761520, "step": 13575, "train_runtime": 104997.0967, "train_tokens_per_second": 5655.028 }, { "epoch": 0.9143549690277404, "grad_norm": 0.7587431284561748, "learning_rate": 5.671151356784747e-06, "loss": 0.3460673809051514, "num_input_tokens_seen": 593970768, "step": 13580, "train_runtime": 105034.4592, "train_tokens_per_second": 5655.009 }, { "epoch": 0.9146916240237005, "grad_norm": 0.6614026194133914, "learning_rate": 5.668531109409851e-06, "loss": 0.3715926170349121, "num_input_tokens_seen": 594193064, "step": 13585, "train_runtime": 105071.7331, "train_tokens_per_second": 5655.118 }, { "epoch": 0.9150282790196607, "grad_norm": 0.7852840297073502, "learning_rate": 5.665910675082362e-06, "loss": 0.36374545097351074, "num_input_tokens_seen": 594409288, "step": 13590, "train_runtime": 105109.8348, "train_tokens_per_second": 5655.125 }, { "epoch": 0.9153649340156208, "grad_norm": 0.7103415655589641, "learning_rate": 5.663290054535078e-06, "loss": 0.34845700263977053, "num_input_tokens_seen": 594620336, "step": 13595, "train_runtime": 105150.7645, "train_tokens_per_second": 5654.931 }, { "epoch": 0.9157015890115809, "grad_norm": 0.8295807713349123, "learning_rate": 5.660669248500846e-06, "loss": 0.39510331153869627, "num_input_tokens_seen": 594838312, "step": 13600, "train_runtime": 105189.0392, "train_tokens_per_second": 5654.946 }, { "epoch": 0.9160382440075411, "grad_norm": 0.7158029671235298, "learning_rate": 5.658048257712563e-06, "loss": 0.3466895818710327, "num_input_tokens_seen": 595060816, "step": 13605, "train_runtime": 105234.3634, "train_tokens_per_second": 5654.625 }, { "epoch": 0.9163748990035012, "grad_norm": 0.7282803359887597, "learning_rate": 5.655427082903184e-06, "loss": 0.3633090019226074, "num_input_tokens_seen": 595279584, "step": 13610, "train_runtime": 105277.1838, "train_tokens_per_second": 5654.403 }, { "epoch": 0.9167115539994614, "grad_norm": 0.6738750845313296, "learning_rate": 5.652805724805711e-06, "loss": 0.35727887153625487, "num_input_tokens_seen": 595499192, "step": 13615, "train_runtime": 105314.5327, "train_tokens_per_second": 5654.483 }, { "epoch": 0.9170482089954215, "grad_norm": 0.8264756955958018, "learning_rate": 5.650184184153199e-06, "loss": 0.3687946319580078, "num_input_tokens_seen": 595723264, "step": 13620, "train_runtime": 105352.1128, "train_tokens_per_second": 5654.592 }, { "epoch": 0.9173848639913816, "grad_norm": 0.7363635027786596, "learning_rate": 5.647562461678754e-06, "loss": 0.39588251113891604, "num_input_tokens_seen": 595947688, "step": 13625, "train_runtime": 105388.882, "train_tokens_per_second": 5654.749 }, { "epoch": 0.9177215189873418, "grad_norm": 0.7671112595712233, "learning_rate": 5.64494055811553e-06, "loss": 0.35439510345458985, "num_input_tokens_seen": 596167280, "step": 13630, "train_runtime": 105432.2515, "train_tokens_per_second": 5654.506 }, { "epoch": 0.9180581739833019, "grad_norm": 0.7391097804364258, "learning_rate": 5.642318474196737e-06, "loss": 0.3450098991394043, "num_input_tokens_seen": 596389280, "step": 13635, "train_runtime": 105470.2709, "train_tokens_per_second": 5654.572 }, { "epoch": 0.9183948289792621, "grad_norm": 0.7394314350713648, "learning_rate": 5.63969621065563e-06, "loss": 0.36347208023071287, "num_input_tokens_seen": 596603992, "step": 13640, "train_runtime": 105510.1258, "train_tokens_per_second": 5654.471 }, { "epoch": 0.9187314839752222, "grad_norm": 0.6523195737553367, "learning_rate": 5.637073768225517e-06, "loss": 0.3404127836227417, "num_input_tokens_seen": 596814560, "step": 13645, "train_runtime": 105555.5698, "train_tokens_per_second": 5654.032 }, { "epoch": 0.9190681389711823, "grad_norm": 0.7286950960994242, "learning_rate": 5.634451147639758e-06, "loss": 0.3368164300918579, "num_input_tokens_seen": 597016352, "step": 13650, "train_runtime": 105596.0923, "train_tokens_per_second": 5653.773 }, { "epoch": 0.9194047939671425, "grad_norm": 0.7381840389633337, "learning_rate": 5.631828349631757e-06, "loss": 0.34926304817199705, "num_input_tokens_seen": 597241424, "step": 13655, "train_runtime": 105633.1844, "train_tokens_per_second": 5653.919 }, { "epoch": 0.9197414489631026, "grad_norm": 0.7377168394438081, "learning_rate": 5.629205374934974e-06, "loss": 0.3418566703796387, "num_input_tokens_seen": 597449976, "step": 13660, "train_runtime": 105670.7222, "train_tokens_per_second": 5653.884 }, { "epoch": 0.9200781039590628, "grad_norm": 0.7062836493823704, "learning_rate": 5.626582224282913e-06, "loss": 0.36661295890808104, "num_input_tokens_seen": 597675264, "step": 13665, "train_runtime": 105714.0467, "train_tokens_per_second": 5653.698 }, { "epoch": 0.9204147589550229, "grad_norm": 0.7520494279886026, "learning_rate": 5.623958898409132e-06, "loss": 0.39702858924865725, "num_input_tokens_seen": 597900752, "step": 13670, "train_runtime": 105743.9982, "train_tokens_per_second": 5654.229 }, { "epoch": 0.920751413950983, "grad_norm": 0.6987426458318066, "learning_rate": 5.621335398047234e-06, "loss": 0.3848641157150269, "num_input_tokens_seen": 598115680, "step": 13675, "train_runtime": 105787.0252, "train_tokens_per_second": 5653.961 }, { "epoch": 0.9210880689469432, "grad_norm": 0.7307345712178913, "learning_rate": 5.618711723930874e-06, "loss": 0.36865854263305664, "num_input_tokens_seen": 598333664, "step": 13680, "train_runtime": 105817.9321, "train_tokens_per_second": 5654.369 }, { "epoch": 0.9214247239429033, "grad_norm": 0.7963356189127992, "learning_rate": 5.616087876793753e-06, "loss": 0.3818777561187744, "num_input_tokens_seen": 598560984, "step": 13685, "train_runtime": 105853.2283, "train_tokens_per_second": 5654.631 }, { "epoch": 0.9217613789388635, "grad_norm": 0.6658404353690085, "learning_rate": 5.613463857369621e-06, "loss": 0.3648639678955078, "num_input_tokens_seen": 598784192, "step": 13690, "train_runtime": 105895.3239, "train_tokens_per_second": 5654.491 }, { "epoch": 0.9220980339348236, "grad_norm": 0.7245035749434348, "learning_rate": 5.610839666392278e-06, "loss": 0.35527966022491453, "num_input_tokens_seen": 599005456, "step": 13695, "train_runtime": 105941.0406, "train_tokens_per_second": 5654.14 }, { "epoch": 0.9224346889307837, "grad_norm": 0.7564271755937382, "learning_rate": 5.608215304595571e-06, "loss": 0.3818879842758179, "num_input_tokens_seen": 599222856, "step": 13700, "train_runtime": 105987.7905, "train_tokens_per_second": 5653.697 }, { "epoch": 0.9227713439267439, "grad_norm": 0.71469916144582, "learning_rate": 5.605590772713393e-06, "loss": 0.35137481689453126, "num_input_tokens_seen": 599421784, "step": 13705, "train_runtime": 106025.2333, "train_tokens_per_second": 5653.577 }, { "epoch": 0.923107998922704, "grad_norm": 0.8680683000673615, "learning_rate": 5.602966071479687e-06, "loss": 0.3719889402389526, "num_input_tokens_seen": 599626912, "step": 13710, "train_runtime": 106057.3995, "train_tokens_per_second": 5653.796 }, { "epoch": 0.9234446539186641, "grad_norm": 0.7763025193380707, "learning_rate": 5.600341201628439e-06, "loss": 0.37358889579772947, "num_input_tokens_seen": 599854192, "step": 13715, "train_runtime": 106090.67, "train_tokens_per_second": 5654.165 }, { "epoch": 0.9237813089146243, "grad_norm": 0.6656080663010198, "learning_rate": 5.597716163893692e-06, "loss": 0.31069388389587405, "num_input_tokens_seen": 600085080, "step": 13720, "train_runtime": 106134.8208, "train_tokens_per_second": 5653.989 }, { "epoch": 0.9241179639105844, "grad_norm": 0.7327001774115326, "learning_rate": 5.595090959009525e-06, "loss": 0.34327847957611085, "num_input_tokens_seen": 600310096, "step": 13725, "train_runtime": 106180.1722, "train_tokens_per_second": 5653.693 }, { "epoch": 0.9244546189065446, "grad_norm": 0.6125120195863898, "learning_rate": 5.592465587710068e-06, "loss": 0.34142630100250243, "num_input_tokens_seen": 600545032, "step": 13730, "train_runtime": 106218.5007, "train_tokens_per_second": 5653.865 }, { "epoch": 0.9247912739025047, "grad_norm": 0.6167159170504363, "learning_rate": 5.589840050729498e-06, "loss": 0.3286783218383789, "num_input_tokens_seen": 600768064, "step": 13735, "train_runtime": 106258.0895, "train_tokens_per_second": 5653.857 }, { "epoch": 0.9251279288984648, "grad_norm": 0.7881839614694872, "learning_rate": 5.587214348802039e-06, "loss": 0.3909108638763428, "num_input_tokens_seen": 600980632, "step": 13740, "train_runtime": 106298.4773, "train_tokens_per_second": 5653.709 }, { "epoch": 0.925464583894425, "grad_norm": 0.7022898228386897, "learning_rate": 5.5845884826619615e-06, "loss": 0.36343495845794677, "num_input_tokens_seen": 601207448, "step": 13745, "train_runtime": 106333.7277, "train_tokens_per_second": 5653.968 }, { "epoch": 0.9258012388903851, "grad_norm": 0.6378832684361027, "learning_rate": 5.5819624530435775e-06, "loss": 0.3585641622543335, "num_input_tokens_seen": 601419704, "step": 13750, "train_runtime": 106373.8251, "train_tokens_per_second": 5653.832 }, { "epoch": 0.9261378938863453, "grad_norm": 0.7242428710010252, "learning_rate": 5.57933626068125e-06, "loss": 0.3933718681335449, "num_input_tokens_seen": 601639824, "step": 13755, "train_runtime": 106414.6703, "train_tokens_per_second": 5653.73 }, { "epoch": 0.9264745488823054, "grad_norm": 0.7473031695779977, "learning_rate": 5.5767099063093835e-06, "loss": 0.3709197998046875, "num_input_tokens_seen": 601868536, "step": 13760, "train_runtime": 106452.2637, "train_tokens_per_second": 5653.882 }, { "epoch": 0.9268112038782655, "grad_norm": 0.803164002917514, "learning_rate": 5.574083390662431e-06, "loss": 0.373383617401123, "num_input_tokens_seen": 602098696, "step": 13765, "train_runtime": 106489.0364, "train_tokens_per_second": 5654.091 }, { "epoch": 0.9271478588742257, "grad_norm": 0.7108278884261701, "learning_rate": 5.57145671447489e-06, "loss": 0.3655261993408203, "num_input_tokens_seen": 602302480, "step": 13770, "train_runtime": 106525.8625, "train_tokens_per_second": 5654.049 }, { "epoch": 0.9274845138701858, "grad_norm": 0.7613900230491544, "learning_rate": 5.5688298784813e-06, "loss": 0.3984712600708008, "num_input_tokens_seen": 602522208, "step": 13775, "train_runtime": 106564.2964, "train_tokens_per_second": 5654.072 }, { "epoch": 0.927821168866146, "grad_norm": 0.6708141182451115, "learning_rate": 5.566202883416249e-06, "loss": 0.3970597743988037, "num_input_tokens_seen": 602750424, "step": 13780, "train_runtime": 106606.7053, "train_tokens_per_second": 5653.964 }, { "epoch": 0.9281578238621061, "grad_norm": 0.7821647487746413, "learning_rate": 5.563575730014366e-06, "loss": 0.39171276092529295, "num_input_tokens_seen": 602965320, "step": 13785, "train_runtime": 106643.4726, "train_tokens_per_second": 5654.029 }, { "epoch": 0.9284944788580662, "grad_norm": 0.7438040498615117, "learning_rate": 5.560948419010328e-06, "loss": 0.3737471342086792, "num_input_tokens_seen": 603186136, "step": 13790, "train_runtime": 106681.291, "train_tokens_per_second": 5654.095 }, { "epoch": 0.9288311338540264, "grad_norm": 0.7446914306967766, "learning_rate": 5.558320951138853e-06, "loss": 0.34050416946411133, "num_input_tokens_seen": 603397288, "step": 13795, "train_runtime": 106722.5651, "train_tokens_per_second": 5653.887 }, { "epoch": 0.9291677888499865, "grad_norm": 0.7759821070900785, "learning_rate": 5.5556933271347046e-06, "loss": 0.3723226308822632, "num_input_tokens_seen": 603606088, "step": 13800, "train_runtime": 106763.5139, "train_tokens_per_second": 5653.674 }, { "epoch": 0.9295044438459467, "grad_norm": 0.7098216673132232, "learning_rate": 5.55306554773269e-06, "loss": 0.3821061611175537, "num_input_tokens_seen": 603816144, "step": 13805, "train_runtime": 106805.761, "train_tokens_per_second": 5653.404 }, { "epoch": 0.9298410988419068, "grad_norm": 0.9275669407149835, "learning_rate": 5.550437613667658e-06, "loss": 0.3593113660812378, "num_input_tokens_seen": 604004552, "step": 13810, "train_runtime": 106836.865, "train_tokens_per_second": 5653.522 }, { "epoch": 0.9301777538378669, "grad_norm": 0.6896177858346889, "learning_rate": 5.547809525674501e-06, "loss": 0.35454933643341063, "num_input_tokens_seen": 604212440, "step": 13815, "train_runtime": 106875.1406, "train_tokens_per_second": 5653.442 }, { "epoch": 0.9305144088338271, "grad_norm": 0.7927279590495904, "learning_rate": 5.545181284488159e-06, "loss": 0.38926100730895996, "num_input_tokens_seen": 604439792, "step": 13820, "train_runtime": 106917.4476, "train_tokens_per_second": 5653.332 }, { "epoch": 0.9308510638297872, "grad_norm": 0.8386569241979678, "learning_rate": 5.5425528908436085e-06, "loss": 0.35577256679534913, "num_input_tokens_seen": 604643600, "step": 13825, "train_runtime": 106953.2903, "train_tokens_per_second": 5653.343 }, { "epoch": 0.9311877188257474, "grad_norm": 0.7592336539171605, "learning_rate": 5.539924345475873e-06, "loss": 0.3907893180847168, "num_input_tokens_seen": 604839736, "step": 13830, "train_runtime": 106988.9857, "train_tokens_per_second": 5653.29 }, { "epoch": 0.9315243738217075, "grad_norm": 0.8126152719075438, "learning_rate": 5.5372956491200145e-06, "loss": 0.37813870906829833, "num_input_tokens_seen": 605051728, "step": 13835, "train_runtime": 107025.6706, "train_tokens_per_second": 5653.333 }, { "epoch": 0.9318610288176676, "grad_norm": 0.7879475237888696, "learning_rate": 5.534666802511143e-06, "loss": 0.36364994049072263, "num_input_tokens_seen": 605251488, "step": 13840, "train_runtime": 107062.9642, "train_tokens_per_second": 5653.229 }, { "epoch": 0.9321976838136278, "grad_norm": 0.6977984667014386, "learning_rate": 5.532037806384404e-06, "loss": 0.372878885269165, "num_input_tokens_seen": 605478256, "step": 13845, "train_runtime": 107101.7476, "train_tokens_per_second": 5653.299 }, { "epoch": 0.9325343388095879, "grad_norm": 0.7377782721135303, "learning_rate": 5.529408661474989e-06, "loss": 0.33782191276550294, "num_input_tokens_seen": 605678152, "step": 13850, "train_runtime": 107140.4741, "train_tokens_per_second": 5653.122 }, { "epoch": 0.932870993805548, "grad_norm": 0.7120793619791788, "learning_rate": 5.526779368518129e-06, "loss": 0.3900485038757324, "num_input_tokens_seen": 605902976, "step": 13855, "train_runtime": 107174.2345, "train_tokens_per_second": 5653.439 }, { "epoch": 0.9332076488015082, "grad_norm": 0.7800631196768846, "learning_rate": 5.5241499282491e-06, "loss": 0.35591723918914797, "num_input_tokens_seen": 606103560, "step": 13860, "train_runtime": 107212.7655, "train_tokens_per_second": 5653.278 }, { "epoch": 0.9335443037974683, "grad_norm": 0.6995200522098299, "learning_rate": 5.5215203414032135e-06, "loss": 0.3359647274017334, "num_input_tokens_seen": 606332784, "step": 13865, "train_runtime": 107261.2791, "train_tokens_per_second": 5652.858 }, { "epoch": 0.9338809587934285, "grad_norm": 0.7315710239059265, "learning_rate": 5.518890608715828e-06, "loss": 0.3636192798614502, "num_input_tokens_seen": 606549080, "step": 13870, "train_runtime": 107306.9882, "train_tokens_per_second": 5652.466 }, { "epoch": 0.9342176137893886, "grad_norm": 0.8443286259971129, "learning_rate": 5.516260730922337e-06, "loss": 0.3732717275619507, "num_input_tokens_seen": 606754664, "step": 13875, "train_runtime": 107344.4184, "train_tokens_per_second": 5652.41 }, { "epoch": 0.9345542687853488, "grad_norm": 0.7163150661251769, "learning_rate": 5.51363070875818e-06, "loss": 0.3665364503860474, "num_input_tokens_seen": 606971336, "step": 13880, "train_runtime": 107380.8754, "train_tokens_per_second": 5652.509 }, { "epoch": 0.9348909237813089, "grad_norm": 0.7826404929432437, "learning_rate": 5.511000542958832e-06, "loss": 0.3829598903656006, "num_input_tokens_seen": 607182888, "step": 13885, "train_runtime": 107425.4489, "train_tokens_per_second": 5652.133 }, { "epoch": 0.935227578777269, "grad_norm": 0.7974161880488172, "learning_rate": 5.508370234259812e-06, "loss": 0.3617416858673096, "num_input_tokens_seen": 607395376, "step": 13890, "train_runtime": 107467.1083, "train_tokens_per_second": 5651.919 }, { "epoch": 0.9355642337732292, "grad_norm": 0.7468198908899866, "learning_rate": 5.505739783396678e-06, "loss": 0.4197434425354004, "num_input_tokens_seen": 607606560, "step": 13895, "train_runtime": 107501.3365, "train_tokens_per_second": 5652.084 }, { "epoch": 0.9359008887691893, "grad_norm": 0.8018465922168921, "learning_rate": 5.503109191105026e-06, "loss": 0.368869423866272, "num_input_tokens_seen": 607818184, "step": 13900, "train_runtime": 107542.256, "train_tokens_per_second": 5651.901 }, { "epoch": 0.9362375437651494, "grad_norm": 0.6896918447153622, "learning_rate": 5.500478458120493e-06, "loss": 0.3878501892089844, "num_input_tokens_seen": 608046144, "step": 13905, "train_runtime": 107578.9863, "train_tokens_per_second": 5652.09 }, { "epoch": 0.9365741987611096, "grad_norm": 0.6502629376388114, "learning_rate": 5.497847585178754e-06, "loss": 0.37720532417297364, "num_input_tokens_seen": 608274496, "step": 13910, "train_runtime": 107614.2489, "train_tokens_per_second": 5652.36 }, { "epoch": 0.9369108537570697, "grad_norm": 0.671150617120138, "learning_rate": 5.495216573015526e-06, "loss": 0.34202401638031005, "num_input_tokens_seen": 608487072, "step": 13915, "train_runtime": 107649.7272, "train_tokens_per_second": 5652.472 }, { "epoch": 0.9372475087530299, "grad_norm": 0.7302905322159697, "learning_rate": 5.492585422366562e-06, "loss": 0.3395219802856445, "num_input_tokens_seen": 608702136, "step": 13920, "train_runtime": 107690.4313, "train_tokens_per_second": 5652.333 }, { "epoch": 0.93758416374899, "grad_norm": 0.7232012493162839, "learning_rate": 5.489954133967657e-06, "loss": 0.3353360652923584, "num_input_tokens_seen": 608907648, "step": 13925, "train_runtime": 107730.6462, "train_tokens_per_second": 5652.13 }, { "epoch": 0.9379208187449501, "grad_norm": 0.6700324546008681, "learning_rate": 5.48732270855464e-06, "loss": 0.3447211027145386, "num_input_tokens_seen": 609137704, "step": 13930, "train_runtime": 107770.2254, "train_tokens_per_second": 5652.189 }, { "epoch": 0.9382574737409103, "grad_norm": 0.744553222908747, "learning_rate": 5.48469114686338e-06, "loss": 0.36331336498260497, "num_input_tokens_seen": 609342520, "step": 13935, "train_runtime": 107808.8795, "train_tokens_per_second": 5652.062 }, { "epoch": 0.9385941287368704, "grad_norm": 0.7229277790841906, "learning_rate": 5.482059449629788e-06, "loss": 0.3539914131164551, "num_input_tokens_seen": 609571440, "step": 13940, "train_runtime": 107847.7103, "train_tokens_per_second": 5652.15 }, { "epoch": 0.9389307837328306, "grad_norm": 0.7003088104586751, "learning_rate": 5.479427617589808e-06, "loss": 0.3414954662322998, "num_input_tokens_seen": 609787136, "step": 13945, "train_runtime": 107885.5574, "train_tokens_per_second": 5652.167 }, { "epoch": 0.9392674387287907, "grad_norm": 0.6891150838884817, "learning_rate": 5.4767956514794226e-06, "loss": 0.3689284801483154, "num_input_tokens_seen": 610015912, "step": 13950, "train_runtime": 107918.1469, "train_tokens_per_second": 5652.58 }, { "epoch": 0.9396040937247508, "grad_norm": 0.8843526225142938, "learning_rate": 5.474163552034655e-06, "loss": 0.3568282127380371, "num_input_tokens_seen": 610224872, "step": 13955, "train_runtime": 107958.8593, "train_tokens_per_second": 5652.383 }, { "epoch": 0.939940748720711, "grad_norm": 0.7953669523701649, "learning_rate": 5.4715313199915595e-06, "loss": 0.33748788833618165, "num_input_tokens_seen": 610433896, "step": 13960, "train_runtime": 107998.8796, "train_tokens_per_second": 5652.224 }, { "epoch": 0.9402774037166711, "grad_norm": 0.8436524922865566, "learning_rate": 5.468898956086236e-06, "loss": 0.36934537887573243, "num_input_tokens_seen": 610657928, "step": 13965, "train_runtime": 108037.0093, "train_tokens_per_second": 5652.303 }, { "epoch": 0.9406140587126313, "grad_norm": 0.7062142551000551, "learning_rate": 5.466266461054815e-06, "loss": 0.3693251132965088, "num_input_tokens_seen": 610879072, "step": 13970, "train_runtime": 108078.9259, "train_tokens_per_second": 5652.157 }, { "epoch": 0.9409507137085914, "grad_norm": 0.7405368560790437, "learning_rate": 5.463633835633464e-06, "loss": 0.38323063850402833, "num_input_tokens_seen": 611111488, "step": 13975, "train_runtime": 108116.6852, "train_tokens_per_second": 5652.333 }, { "epoch": 0.9412873687045515, "grad_norm": 0.6906471137787829, "learning_rate": 5.46100108055839e-06, "loss": 0.37401399612426756, "num_input_tokens_seen": 611338984, "step": 13980, "train_runtime": 108153.7009, "train_tokens_per_second": 5652.502 }, { "epoch": 0.9416240237005117, "grad_norm": 0.699157303658586, "learning_rate": 5.458368196565833e-06, "loss": 0.34747042655944826, "num_input_tokens_seen": 611557384, "step": 13985, "train_runtime": 108187.4002, "train_tokens_per_second": 5652.76 }, { "epoch": 0.9419606786964718, "grad_norm": 0.6950434602213443, "learning_rate": 5.455735184392073e-06, "loss": 0.39068779945373533, "num_input_tokens_seen": 611785288, "step": 13990, "train_runtime": 108222.1017, "train_tokens_per_second": 5653.053 }, { "epoch": 0.942297333692432, "grad_norm": 0.8222775495837801, "learning_rate": 5.4531020447734204e-06, "loss": 0.3776577949523926, "num_input_tokens_seen": 611999096, "step": 13995, "train_runtime": 108255.2451, "train_tokens_per_second": 5653.297 }, { "epoch": 0.9426339886883921, "grad_norm": 0.6942977966354065, "learning_rate": 5.450468778446226e-06, "loss": 0.38014535903930663, "num_input_tokens_seen": 612229616, "step": 14000, "train_runtime": 108302.2562, "train_tokens_per_second": 5652.972 }, { "epoch": 0.9429706436843522, "grad_norm": 0.8181331571770365, "learning_rate": 5.447835386146875e-06, "loss": 0.3620244264602661, "num_input_tokens_seen": 612457288, "step": 14005, "train_runtime": 108339.7787, "train_tokens_per_second": 5653.116 }, { "epoch": 0.9433072986803124, "grad_norm": 0.7249133494502058, "learning_rate": 5.445201868611784e-06, "loss": 0.4034558296203613, "num_input_tokens_seen": 612668352, "step": 14010, "train_runtime": 108376.897, "train_tokens_per_second": 5653.127 }, { "epoch": 0.9436439536762725, "grad_norm": 0.7004943272407984, "learning_rate": 5.442568226577413e-06, "loss": 0.37315356731414795, "num_input_tokens_seen": 612885272, "step": 14015, "train_runtime": 108415.5424, "train_tokens_per_second": 5653.113 }, { "epoch": 0.9439806086722327, "grad_norm": 0.6490441295997635, "learning_rate": 5.439934460780247e-06, "loss": 0.3591346740722656, "num_input_tokens_seen": 613107944, "step": 14020, "train_runtime": 108453.9122, "train_tokens_per_second": 5653.166 }, { "epoch": 0.9443172636681928, "grad_norm": 0.6918392163792407, "learning_rate": 5.437300571956813e-06, "loss": 0.3745762586593628, "num_input_tokens_seen": 613308168, "step": 14025, "train_runtime": 108489.5473, "train_tokens_per_second": 5653.154 }, { "epoch": 0.9446539186641529, "grad_norm": 0.654742109915237, "learning_rate": 5.434666560843667e-06, "loss": 0.3551823616027832, "num_input_tokens_seen": 613516376, "step": 14030, "train_runtime": 108525.2798, "train_tokens_per_second": 5653.212 }, { "epoch": 0.9449905736601131, "grad_norm": 0.7025947454416406, "learning_rate": 5.432032428177405e-06, "loss": 0.3733973979949951, "num_input_tokens_seen": 613743992, "step": 14035, "train_runtime": 108565.1399, "train_tokens_per_second": 5653.233 }, { "epoch": 0.9453272286560732, "grad_norm": 0.7446809227599923, "learning_rate": 5.429398174694651e-06, "loss": 0.35695390701293944, "num_input_tokens_seen": 613975032, "step": 14040, "train_runtime": 108600.6982, "train_tokens_per_second": 5653.509 }, { "epoch": 0.9456638836520334, "grad_norm": 0.6898581042276205, "learning_rate": 5.426763801132067e-06, "loss": 0.3617269039154053, "num_input_tokens_seen": 614162568, "step": 14045, "train_runtime": 108637.4509, "train_tokens_per_second": 5653.323 }, { "epoch": 0.9460005386479935, "grad_norm": 0.7678862695446375, "learning_rate": 5.424129308226347e-06, "loss": 0.3843861103057861, "num_input_tokens_seen": 614370656, "step": 14050, "train_runtime": 108675.5655, "train_tokens_per_second": 5653.255 }, { "epoch": 0.9463371936439536, "grad_norm": 0.7654766109095031, "learning_rate": 5.421494696714219e-06, "loss": 0.3902265548706055, "num_input_tokens_seen": 614608864, "step": 14055, "train_runtime": 108715.2383, "train_tokens_per_second": 5653.383 }, { "epoch": 0.9466738486399138, "grad_norm": 0.7609882464523344, "learning_rate": 5.418859967332442e-06, "loss": 0.3707080841064453, "num_input_tokens_seen": 614836608, "step": 14060, "train_runtime": 108755.1102, "train_tokens_per_second": 5653.404 }, { "epoch": 0.9470105036358739, "grad_norm": 0.9394544427990754, "learning_rate": 5.416225120817811e-06, "loss": 0.3681238412857056, "num_input_tokens_seen": 615027064, "step": 14065, "train_runtime": 108790.9955, "train_tokens_per_second": 5653.29 }, { "epoch": 0.947347158631834, "grad_norm": 0.6539346876126566, "learning_rate": 5.413590157907153e-06, "loss": 0.3346075534820557, "num_input_tokens_seen": 615270632, "step": 14070, "train_runtime": 108826.6066, "train_tokens_per_second": 5653.678 }, { "epoch": 0.9476838136277942, "grad_norm": 0.7338889594818504, "learning_rate": 5.4109550793373255e-06, "loss": 0.355800724029541, "num_input_tokens_seen": 615493608, "step": 14075, "train_runtime": 108868.2257, "train_tokens_per_second": 5653.565 }, { "epoch": 0.9480204686237543, "grad_norm": 0.7464991259586956, "learning_rate": 5.40831988584522e-06, "loss": 0.38836262226104734, "num_input_tokens_seen": 615719216, "step": 14080, "train_runtime": 108904.0303, "train_tokens_per_second": 5653.778 }, { "epoch": 0.9483571236197145, "grad_norm": 0.7069248942260824, "learning_rate": 5.40568457816776e-06, "loss": 0.37587385177612304, "num_input_tokens_seen": 615951848, "step": 14085, "train_runtime": 108947.057, "train_tokens_per_second": 5653.68 }, { "epoch": 0.9486937786156746, "grad_norm": 0.6655009611716466, "learning_rate": 5.403049157041903e-06, "loss": 0.35560946464538573, "num_input_tokens_seen": 616172928, "step": 14090, "train_runtime": 108984.6239, "train_tokens_per_second": 5653.76 }, { "epoch": 0.9490304336116347, "grad_norm": 0.7730572202934075, "learning_rate": 5.400413623204635e-06, "loss": 0.35712380409240724, "num_input_tokens_seen": 616390224, "step": 14095, "train_runtime": 109023.2559, "train_tokens_per_second": 5653.75 }, { "epoch": 0.9493670886075949, "grad_norm": 0.7946160574063879, "learning_rate": 5.397777977392973e-06, "loss": 0.39092726707458497, "num_input_tokens_seen": 616612064, "step": 14100, "train_runtime": 109071.1955, "train_tokens_per_second": 5653.299 }, { "epoch": 0.949703743603555, "grad_norm": 0.7261331777714058, "learning_rate": 5.395142220343967e-06, "loss": 0.37581348419189453, "num_input_tokens_seen": 616835560, "step": 14105, "train_runtime": 109114.6463, "train_tokens_per_second": 5653.096 }, { "epoch": 0.9500403985995152, "grad_norm": 0.7685617426175168, "learning_rate": 5.3925063527947e-06, "loss": 0.34862990379333497, "num_input_tokens_seen": 617051200, "step": 14110, "train_runtime": 109161.8492, "train_tokens_per_second": 5652.627 }, { "epoch": 0.9503770535954753, "grad_norm": 0.771130071661086, "learning_rate": 5.389870375482283e-06, "loss": 0.37904350757598876, "num_input_tokens_seen": 617248976, "step": 14115, "train_runtime": 109194.634, "train_tokens_per_second": 5652.741 }, { "epoch": 0.9507137085914354, "grad_norm": 0.7205683359655156, "learning_rate": 5.387234289143859e-06, "loss": 0.331813383102417, "num_input_tokens_seen": 617469104, "step": 14120, "train_runtime": 109226.9679, "train_tokens_per_second": 5653.083 }, { "epoch": 0.9510503635873956, "grad_norm": 0.7693964177160706, "learning_rate": 5.384598094516601e-06, "loss": 0.3729023218154907, "num_input_tokens_seen": 617692328, "step": 14125, "train_runtime": 109271.6235, "train_tokens_per_second": 5652.816 }, { "epoch": 0.9513870185833557, "grad_norm": 0.6640672951882179, "learning_rate": 5.381961792337712e-06, "loss": 0.3759523153305054, "num_input_tokens_seen": 617921872, "step": 14130, "train_runtime": 109307.5627, "train_tokens_per_second": 5653.057 }, { "epoch": 0.9517236735793159, "grad_norm": 0.6678437973528463, "learning_rate": 5.3793253833444245e-06, "loss": 0.3401124715805054, "num_input_tokens_seen": 618147624, "step": 14135, "train_runtime": 109342.9092, "train_tokens_per_second": 5653.294 }, { "epoch": 0.952060328575276, "grad_norm": 0.6761734645912748, "learning_rate": 5.3766888682740045e-06, "loss": 0.3542716264724731, "num_input_tokens_seen": 618375336, "step": 14140, "train_runtime": 109378.6235, "train_tokens_per_second": 5653.53 }, { "epoch": 0.9523969835712361, "grad_norm": 0.7917338745636189, "learning_rate": 5.374052247863745e-06, "loss": 0.3719951152801514, "num_input_tokens_seen": 618588568, "step": 14145, "train_runtime": 109412.8524, "train_tokens_per_second": 5653.71 }, { "epoch": 0.9527336385671963, "grad_norm": 0.7643089958554735, "learning_rate": 5.371415522850966e-06, "loss": 0.34739990234375, "num_input_tokens_seen": 618807136, "step": 14150, "train_runtime": 109455.6515, "train_tokens_per_second": 5653.496 }, { "epoch": 0.9530702935631564, "grad_norm": 0.7334076755125779, "learning_rate": 5.368778693973019e-06, "loss": 0.35079226493835447, "num_input_tokens_seen": 619020192, "step": 14155, "train_runtime": 109497.2351, "train_tokens_per_second": 5653.295 }, { "epoch": 0.9534069485591166, "grad_norm": 0.6518007663729203, "learning_rate": 5.366141761967287e-06, "loss": 0.3731173753738403, "num_input_tokens_seen": 619234312, "step": 14160, "train_runtime": 109535.8084, "train_tokens_per_second": 5653.259 }, { "epoch": 0.9537436035550767, "grad_norm": 0.884684695372941, "learning_rate": 5.363504727571179e-06, "loss": 0.38480224609375, "num_input_tokens_seen": 619455112, "step": 14165, "train_runtime": 109574.3358, "train_tokens_per_second": 5653.286 }, { "epoch": 0.954080258551037, "grad_norm": 0.7444612393985186, "learning_rate": 5.360867591522133e-06, "loss": 0.4258725166320801, "num_input_tokens_seen": 619686368, "step": 14170, "train_runtime": 109614.4844, "train_tokens_per_second": 5653.326 }, { "epoch": 0.9544169135469971, "grad_norm": 0.766088989031395, "learning_rate": 5.358230354557617e-06, "loss": 0.34602572917938235, "num_input_tokens_seen": 619912184, "step": 14175, "train_runtime": 109647.5189, "train_tokens_per_second": 5653.682 }, { "epoch": 0.9547535685429572, "grad_norm": 0.8426997667284004, "learning_rate": 5.355593017415123e-06, "loss": 0.39844369888305664, "num_input_tokens_seen": 620138400, "step": 14180, "train_runtime": 109681.0251, "train_tokens_per_second": 5654.017 }, { "epoch": 0.9550902235389174, "grad_norm": 0.6855456694998082, "learning_rate": 5.352955580832176e-06, "loss": 0.36531069278717043, "num_input_tokens_seen": 620363336, "step": 14185, "train_runtime": 109720.9773, "train_tokens_per_second": 5654.008 }, { "epoch": 0.9554268785348775, "grad_norm": 0.6489568473620863, "learning_rate": 5.350318045546326e-06, "loss": 0.378409218788147, "num_input_tokens_seen": 620586608, "step": 14190, "train_runtime": 109762.864, "train_tokens_per_second": 5653.885 }, { "epoch": 0.9557635335308377, "grad_norm": 0.690203133783407, "learning_rate": 5.347680412295152e-06, "loss": 0.3777376413345337, "num_input_tokens_seen": 620803016, "step": 14195, "train_runtime": 109803.0202, "train_tokens_per_second": 5653.788 }, { "epoch": 0.9561001885267978, "grad_norm": 0.8763898868581147, "learning_rate": 5.34504268181626e-06, "loss": 0.37516131401062014, "num_input_tokens_seen": 621009712, "step": 14200, "train_runtime": 109842.1757, "train_tokens_per_second": 5653.655 }, { "epoch": 0.9564368435227579, "grad_norm": 0.8351648882525854, "learning_rate": 5.342404854847282e-06, "loss": 0.36751456260681153, "num_input_tokens_seen": 621209912, "step": 14205, "train_runtime": 109878.6528, "train_tokens_per_second": 5653.6 }, { "epoch": 0.9567734985187181, "grad_norm": 0.695513608466477, "learning_rate": 5.3397669321258776e-06, "loss": 0.3533796310424805, "num_input_tokens_seen": 621439136, "step": 14210, "train_runtime": 109913.5419, "train_tokens_per_second": 5653.891 }, { "epoch": 0.9571101535146782, "grad_norm": 0.7212650216714175, "learning_rate": 5.337128914389734e-06, "loss": 0.3940083980560303, "num_input_tokens_seen": 621670256, "step": 14215, "train_runtime": 109948.6255, "train_tokens_per_second": 5654.189 }, { "epoch": 0.9574468085106383, "grad_norm": 0.7045386935112185, "learning_rate": 5.334490802376565e-06, "loss": 0.3630239009857178, "num_input_tokens_seen": 621896344, "step": 14220, "train_runtime": 109992.4071, "train_tokens_per_second": 5653.993 }, { "epoch": 0.9577834635065985, "grad_norm": 1.0648426671565956, "learning_rate": 5.33185259682411e-06, "loss": 0.38904123306274413, "num_input_tokens_seen": 622111488, "step": 14225, "train_runtime": 110028.3421, "train_tokens_per_second": 5654.102 }, { "epoch": 0.9581201185025586, "grad_norm": 0.6854092676166333, "learning_rate": 5.329214298470134e-06, "loss": 0.3952740907669067, "num_input_tokens_seen": 622335752, "step": 14230, "train_runtime": 110067.3201, "train_tokens_per_second": 5654.137 }, { "epoch": 0.9584567734985188, "grad_norm": 0.6504683472772627, "learning_rate": 5.326575908052428e-06, "loss": 0.34938879013061525, "num_input_tokens_seen": 622563512, "step": 14235, "train_runtime": 110103.0055, "train_tokens_per_second": 5654.373 }, { "epoch": 0.9587934284944789, "grad_norm": 0.8743571550942602, "learning_rate": 5.323937426308813e-06, "loss": 0.4064329147338867, "num_input_tokens_seen": 622789680, "step": 14240, "train_runtime": 110140.2833, "train_tokens_per_second": 5654.513 }, { "epoch": 0.959130083490439, "grad_norm": 0.7364135099684984, "learning_rate": 5.321298853977128e-06, "loss": 0.3482068538665771, "num_input_tokens_seen": 623030288, "step": 14245, "train_runtime": 110172.6755, "train_tokens_per_second": 5655.035 }, { "epoch": 0.9594667384863992, "grad_norm": 1.04514521012973, "learning_rate": 5.318660191795244e-06, "loss": 0.35120339393615724, "num_input_tokens_seen": 623250248, "step": 14250, "train_runtime": 110210.2613, "train_tokens_per_second": 5655.102 }, { "epoch": 0.9598033934823593, "grad_norm": 0.6859815669971231, "learning_rate": 5.316021440501053e-06, "loss": 0.32753448486328124, "num_input_tokens_seen": 623468032, "step": 14255, "train_runtime": 110254.6316, "train_tokens_per_second": 5654.801 }, { "epoch": 0.9601400484783195, "grad_norm": 0.6696719492054304, "learning_rate": 5.313382600832474e-06, "loss": 0.32216849327087405, "num_input_tokens_seen": 623687536, "step": 14260, "train_runtime": 110295.1281, "train_tokens_per_second": 5654.715 }, { "epoch": 0.9604767034742796, "grad_norm": 0.6796334454419847, "learning_rate": 5.310743673527451e-06, "loss": 0.3820059776306152, "num_input_tokens_seen": 623916888, "step": 14265, "train_runtime": 110337.4663, "train_tokens_per_second": 5654.624 }, { "epoch": 0.9608133584702397, "grad_norm": 0.7257174247083755, "learning_rate": 5.3081046593239496e-06, "loss": 0.38223018646240237, "num_input_tokens_seen": 624136416, "step": 14270, "train_runtime": 110378.6302, "train_tokens_per_second": 5654.504 }, { "epoch": 0.9611500134661999, "grad_norm": 0.7285256715224561, "learning_rate": 5.305465558959964e-06, "loss": 0.366811728477478, "num_input_tokens_seen": 624349152, "step": 14275, "train_runtime": 110421.354, "train_tokens_per_second": 5654.243 }, { "epoch": 0.96148666846216, "grad_norm": 0.7064345566990189, "learning_rate": 5.302826373173506e-06, "loss": 0.3593759536743164, "num_input_tokens_seen": 624577352, "step": 14280, "train_runtime": 110460.1396, "train_tokens_per_second": 5654.323 }, { "epoch": 0.9618233234581202, "grad_norm": 0.7256414932456383, "learning_rate": 5.3001871027026194e-06, "loss": 0.3493657112121582, "num_input_tokens_seen": 624788664, "step": 14285, "train_runtime": 110502.0095, "train_tokens_per_second": 5654.093 }, { "epoch": 0.9621599784540803, "grad_norm": 0.7017567146140217, "learning_rate": 5.2975477482853685e-06, "loss": 0.3475620746612549, "num_input_tokens_seen": 625013976, "step": 14290, "train_runtime": 110543.2223, "train_tokens_per_second": 5654.023 }, { "epoch": 0.9624966334500404, "grad_norm": 0.8025787225363398, "learning_rate": 5.294908310659838e-06, "loss": 0.3636843204498291, "num_input_tokens_seen": 625243416, "step": 14295, "train_runtime": 110579.9936, "train_tokens_per_second": 5654.218 }, { "epoch": 0.9628332884460006, "grad_norm": 0.796752899535943, "learning_rate": 5.292268790564138e-06, "loss": 0.3458188772201538, "num_input_tokens_seen": 625456472, "step": 14300, "train_runtime": 110621.9221, "train_tokens_per_second": 5654.001 }, { "epoch": 0.9631699434419607, "grad_norm": 0.7622734681695542, "learning_rate": 5.289629188736403e-06, "loss": 0.39026923179626466, "num_input_tokens_seen": 625676128, "step": 14305, "train_runtime": 110667.8056, "train_tokens_per_second": 5653.642 }, { "epoch": 0.9635065984379209, "grad_norm": 0.973852297067902, "learning_rate": 5.286989505914788e-06, "loss": 0.38088412284851075, "num_input_tokens_seen": 625904384, "step": 14310, "train_runtime": 110702.6608, "train_tokens_per_second": 5653.924 }, { "epoch": 0.963843253433881, "grad_norm": 0.8147025206812348, "learning_rate": 5.284349742837475e-06, "loss": 0.3758919954299927, "num_input_tokens_seen": 626134784, "step": 14315, "train_runtime": 110744.3819, "train_tokens_per_second": 5653.874 }, { "epoch": 0.9641799084298411, "grad_norm": 0.8865610211887707, "learning_rate": 5.281709900242662e-06, "loss": 0.35522916316986086, "num_input_tokens_seen": 626357296, "step": 14320, "train_runtime": 110789.1337, "train_tokens_per_second": 5653.599 }, { "epoch": 0.9645165634258013, "grad_norm": 0.7685303095133553, "learning_rate": 5.279069978868574e-06, "loss": 0.3454322099685669, "num_input_tokens_seen": 626576680, "step": 14325, "train_runtime": 110823.2787, "train_tokens_per_second": 5653.836 }, { "epoch": 0.9648532184217614, "grad_norm": 0.7582279578264484, "learning_rate": 5.276429979453455e-06, "loss": 0.36722531318664553, "num_input_tokens_seen": 626795800, "step": 14330, "train_runtime": 110855.2605, "train_tokens_per_second": 5654.182 }, { "epoch": 0.9651898734177216, "grad_norm": 0.6609643186180265, "learning_rate": 5.273789902735575e-06, "loss": 0.36404809951782224, "num_input_tokens_seen": 627011600, "step": 14335, "train_runtime": 110890.1684, "train_tokens_per_second": 5654.348 }, { "epoch": 0.9655265284136817, "grad_norm": 0.7160660322102089, "learning_rate": 5.27114974945322e-06, "loss": 0.33545889854431155, "num_input_tokens_seen": 627226888, "step": 14340, "train_runtime": 110937.4224, "train_tokens_per_second": 5653.88 }, { "epoch": 0.9658631834096418, "grad_norm": 0.7371545286431122, "learning_rate": 5.2685095203447046e-06, "loss": 0.3596933841705322, "num_input_tokens_seen": 627453768, "step": 14345, "train_runtime": 110976.5578, "train_tokens_per_second": 5653.931 }, { "epoch": 0.966199838405602, "grad_norm": 0.6944067783154944, "learning_rate": 5.265869216148357e-06, "loss": 0.352811861038208, "num_input_tokens_seen": 627673216, "step": 14350, "train_runtime": 111014.9066, "train_tokens_per_second": 5653.954 }, { "epoch": 0.9665364934015621, "grad_norm": 0.7335669224993876, "learning_rate": 5.263228837602532e-06, "loss": 0.42299542427062986, "num_input_tokens_seen": 627887552, "step": 14355, "train_runtime": 111050.8572, "train_tokens_per_second": 5654.054 }, { "epoch": 0.9668731483975223, "grad_norm": 0.83794134450925, "learning_rate": 5.2605883854456e-06, "loss": 0.3737421989440918, "num_input_tokens_seen": 628108328, "step": 14360, "train_runtime": 111089.5086, "train_tokens_per_second": 5654.074 }, { "epoch": 0.9672098033934824, "grad_norm": 0.6342873275404923, "learning_rate": 5.257947860415957e-06, "loss": 0.3357997894287109, "num_input_tokens_seen": 628335808, "step": 14365, "train_runtime": 111122.6788, "train_tokens_per_second": 5654.434 }, { "epoch": 0.9675464583894425, "grad_norm": 0.8822334071658794, "learning_rate": 5.255307263252019e-06, "loss": 0.3541123867034912, "num_input_tokens_seen": 628566792, "step": 14370, "train_runtime": 111156.9119, "train_tokens_per_second": 5654.77 }, { "epoch": 0.9678831133854027, "grad_norm": 0.674709973682241, "learning_rate": 5.2526665946922185e-06, "loss": 0.3823538303375244, "num_input_tokens_seen": 628784336, "step": 14375, "train_runtime": 111196.5312, "train_tokens_per_second": 5654.712 }, { "epoch": 0.9682197683813628, "grad_norm": 0.658823173011451, "learning_rate": 5.25002585547501e-06, "loss": 0.35442066192626953, "num_input_tokens_seen": 629008320, "step": 14380, "train_runtime": 111234.2162, "train_tokens_per_second": 5654.81 }, { "epoch": 0.968556423377323, "grad_norm": 0.723111666266317, "learning_rate": 5.2473850463388675e-06, "loss": 0.3943564176559448, "num_input_tokens_seen": 629232256, "step": 14385, "train_runtime": 111274.7039, "train_tokens_per_second": 5654.765 }, { "epoch": 0.9688930783732831, "grad_norm": 0.6809256630686321, "learning_rate": 5.244744168022288e-06, "loss": 0.3620326995849609, "num_input_tokens_seen": 629455456, "step": 14390, "train_runtime": 111314.9521, "train_tokens_per_second": 5654.725 }, { "epoch": 0.9692297333692432, "grad_norm": 0.6956920321641313, "learning_rate": 5.24210322126378e-06, "loss": 0.36865873336791993, "num_input_tokens_seen": 629691848, "step": 14395, "train_runtime": 111353.3824, "train_tokens_per_second": 5654.896 }, { "epoch": 0.9695663883652034, "grad_norm": 0.7152647788363251, "learning_rate": 5.23946220680188e-06, "loss": 0.3680101871490479, "num_input_tokens_seen": 629928368, "step": 14400, "train_runtime": 111391.3207, "train_tokens_per_second": 5655.094 }, { "epoch": 0.9699030433611635, "grad_norm": 0.7371345942960084, "learning_rate": 5.236821125375136e-06, "loss": 0.3584733486175537, "num_input_tokens_seen": 630150304, "step": 14405, "train_runtime": 111429.6066, "train_tokens_per_second": 5655.142 }, { "epoch": 0.9702396983571236, "grad_norm": 0.6525643955944114, "learning_rate": 5.234179977722119e-06, "loss": 0.31973896026611326, "num_input_tokens_seen": 630389640, "step": 14410, "train_runtime": 111465.3624, "train_tokens_per_second": 5655.476 }, { "epoch": 0.9705763533530838, "grad_norm": 0.6728032683654267, "learning_rate": 5.23153876458142e-06, "loss": 0.36993358135223386, "num_input_tokens_seen": 630599464, "step": 14415, "train_runtime": 111509.2822, "train_tokens_per_second": 5655.13 }, { "epoch": 0.9709130083490439, "grad_norm": 0.7435706382156235, "learning_rate": 5.2288974866916435e-06, "loss": 0.36161553859710693, "num_input_tokens_seen": 630794912, "step": 14420, "train_runtime": 111547.8849, "train_tokens_per_second": 5654.925 }, { "epoch": 0.9712496633450041, "grad_norm": 0.702712902975055, "learning_rate": 5.226256144791414e-06, "loss": 0.36026706695556643, "num_input_tokens_seen": 631000992, "step": 14425, "train_runtime": 111582.5203, "train_tokens_per_second": 5655.016 }, { "epoch": 0.9715863183409642, "grad_norm": 0.7340375348827854, "learning_rate": 5.223614739619375e-06, "loss": 0.37513973712921145, "num_input_tokens_seen": 631202192, "step": 14430, "train_runtime": 111620.6231, "train_tokens_per_second": 5654.889 }, { "epoch": 0.9719229733369243, "grad_norm": 0.6505020134915022, "learning_rate": 5.2209732719141855e-06, "loss": 0.33454012870788574, "num_input_tokens_seen": 631411712, "step": 14435, "train_runtime": 111660.3902, "train_tokens_per_second": 5654.751 }, { "epoch": 0.9722596283328845, "grad_norm": 0.6834948719980648, "learning_rate": 5.218331742414528e-06, "loss": 0.3455739736557007, "num_input_tokens_seen": 631641904, "step": 14440, "train_runtime": 111694.5696, "train_tokens_per_second": 5655.082 }, { "epoch": 0.9725962833288446, "grad_norm": 0.7031614396342304, "learning_rate": 5.215690151859094e-06, "loss": 0.3380829572677612, "num_input_tokens_seen": 631848056, "step": 14445, "train_runtime": 111733.8193, "train_tokens_per_second": 5654.94 }, { "epoch": 0.9729329383248048, "grad_norm": 0.737272924329504, "learning_rate": 5.213048500986597e-06, "loss": 0.3667490243911743, "num_input_tokens_seen": 632068664, "step": 14450, "train_runtime": 111782.1877, "train_tokens_per_second": 5654.467 }, { "epoch": 0.9732695933207649, "grad_norm": 0.8384823634165054, "learning_rate": 5.210406790535766e-06, "loss": 0.3663896083831787, "num_input_tokens_seen": 632279544, "step": 14455, "train_runtime": 111817.1549, "train_tokens_per_second": 5654.584 }, { "epoch": 0.973606248316725, "grad_norm": 0.7339723372461647, "learning_rate": 5.207765021245346e-06, "loss": 0.3660223722457886, "num_input_tokens_seen": 632492984, "step": 14460, "train_runtime": 111858.5212, "train_tokens_per_second": 5654.401 }, { "epoch": 0.9739429033126852, "grad_norm": 0.7329956341586107, "learning_rate": 5.2051231938541015e-06, "loss": 0.3708993911743164, "num_input_tokens_seen": 632694568, "step": 14465, "train_runtime": 111894.0881, "train_tokens_per_second": 5654.406 }, { "epoch": 0.9742795583086453, "grad_norm": 0.7751460530884079, "learning_rate": 5.202481309100808e-06, "loss": 0.3687734127044678, "num_input_tokens_seen": 632904360, "step": 14470, "train_runtime": 111935.2636, "train_tokens_per_second": 5654.2 }, { "epoch": 0.9746162133046055, "grad_norm": 0.6898579692907033, "learning_rate": 5.199839367724266e-06, "loss": 0.3596921920776367, "num_input_tokens_seen": 633132800, "step": 14475, "train_runtime": 111976.0175, "train_tokens_per_second": 5654.182 }, { "epoch": 0.9749528683005656, "grad_norm": 0.7400137611963173, "learning_rate": 5.197197370463278e-06, "loss": 0.343227481842041, "num_input_tokens_seen": 633370648, "step": 14480, "train_runtime": 112017.4444, "train_tokens_per_second": 5654.214 }, { "epoch": 0.9752895232965257, "grad_norm": 0.6958590027819616, "learning_rate": 5.194555318056675e-06, "loss": 0.39154577255249023, "num_input_tokens_seen": 633605816, "step": 14485, "train_runtime": 112050.1996, "train_tokens_per_second": 5654.66 }, { "epoch": 0.9756261782924859, "grad_norm": 0.9461003642017359, "learning_rate": 5.191913211243299e-06, "loss": 0.37716875076293943, "num_input_tokens_seen": 633832456, "step": 14490, "train_runtime": 112095.5877, "train_tokens_per_second": 5654.393 }, { "epoch": 0.975962833288446, "grad_norm": 0.7296195050735405, "learning_rate": 5.1892710507620055e-06, "loss": 0.36735081672668457, "num_input_tokens_seen": 634052208, "step": 14495, "train_runtime": 112132.123, "train_tokens_per_second": 5654.51 }, { "epoch": 0.9762994882844062, "grad_norm": 0.713237266588106, "learning_rate": 5.186628837351666e-06, "loss": 0.3544626235961914, "num_input_tokens_seen": 634282120, "step": 14500, "train_runtime": 112168.6707, "train_tokens_per_second": 5654.717 }, { "epoch": 0.9766361432803663, "grad_norm": 0.7152784729674379, "learning_rate": 5.183986571751167e-06, "loss": 0.3681643962860107, "num_input_tokens_seen": 634503040, "step": 14505, "train_runtime": 112208.6433, "train_tokens_per_second": 5654.672 }, { "epoch": 0.9769727982763264, "grad_norm": 0.7143902821508025, "learning_rate": 5.181344254699408e-06, "loss": 0.384121036529541, "num_input_tokens_seen": 634718224, "step": 14510, "train_runtime": 112246.9754, "train_tokens_per_second": 5654.658 }, { "epoch": 0.9773094532722866, "grad_norm": 0.7563338962960594, "learning_rate": 5.178701886935309e-06, "loss": 0.3466785907745361, "num_input_tokens_seen": 634926976, "step": 14515, "train_runtime": 112283.3188, "train_tokens_per_second": 5654.687 }, { "epoch": 0.9776461082682467, "grad_norm": 0.6709897911941165, "learning_rate": 5.176059469197796e-06, "loss": 0.3563254356384277, "num_input_tokens_seen": 635147104, "step": 14520, "train_runtime": 112318.4084, "train_tokens_per_second": 5654.88 }, { "epoch": 0.9779827632642069, "grad_norm": 0.84998527536875, "learning_rate": 5.173417002225815e-06, "loss": 0.3569037914276123, "num_input_tokens_seen": 635366792, "step": 14525, "train_runtime": 112357.718, "train_tokens_per_second": 5654.857 }, { "epoch": 0.978319418260167, "grad_norm": 0.7892134632795219, "learning_rate": 5.170774486758322e-06, "loss": 0.36590094566345216, "num_input_tokens_seen": 635560568, "step": 14530, "train_runtime": 112393.8137, "train_tokens_per_second": 5654.765 }, { "epoch": 0.9786560732561271, "grad_norm": 0.6842756660337252, "learning_rate": 5.168131923534287e-06, "loss": 0.38362579345703124, "num_input_tokens_seen": 635787144, "step": 14535, "train_runtime": 112428.7709, "train_tokens_per_second": 5655.022 }, { "epoch": 0.9789927282520873, "grad_norm": 0.6691518942357926, "learning_rate": 5.165489313292696e-06, "loss": 0.35508084297180176, "num_input_tokens_seen": 636000120, "step": 14540, "train_runtime": 112469.9454, "train_tokens_per_second": 5654.845 }, { "epoch": 0.9793293832480474, "grad_norm": 0.7564357234909826, "learning_rate": 5.162846656772548e-06, "loss": 0.35072224140167235, "num_input_tokens_seen": 636214280, "step": 14545, "train_runtime": 112512.921, "train_tokens_per_second": 5654.589 }, { "epoch": 0.9796660382440076, "grad_norm": 0.7450101360653049, "learning_rate": 5.16020395471285e-06, "loss": 0.3438509464263916, "num_input_tokens_seen": 636435816, "step": 14550, "train_runtime": 112554.2979, "train_tokens_per_second": 5654.478 }, { "epoch": 0.9800026932399677, "grad_norm": 0.8137120525286944, "learning_rate": 5.157561207852628e-06, "loss": 0.3831623077392578, "num_input_tokens_seen": 636640224, "step": 14555, "train_runtime": 112591.2086, "train_tokens_per_second": 5654.44 }, { "epoch": 0.9803393482359278, "grad_norm": 0.7297592438951429, "learning_rate": 5.154918416930915e-06, "loss": 0.3411484479904175, "num_input_tokens_seen": 636858520, "step": 14560, "train_runtime": 112629.598, "train_tokens_per_second": 5654.451 }, { "epoch": 0.980676003231888, "grad_norm": 0.760019959304734, "learning_rate": 5.152275582686761e-06, "loss": 0.3839298486709595, "num_input_tokens_seen": 637073856, "step": 14565, "train_runtime": 112666.3482, "train_tokens_per_second": 5654.518 }, { "epoch": 0.9810126582278481, "grad_norm": 0.6959300895402221, "learning_rate": 5.149632705859227e-06, "loss": 0.36935174465179443, "num_input_tokens_seen": 637299440, "step": 14570, "train_runtime": 112707.9899, "train_tokens_per_second": 5654.43 }, { "epoch": 0.9813493132238083, "grad_norm": 0.7586977280516466, "learning_rate": 5.146989787187383e-06, "loss": 0.37570605278015134, "num_input_tokens_seen": 637529440, "step": 14575, "train_runtime": 112743.4679, "train_tokens_per_second": 5654.691 }, { "epoch": 0.9816859682197684, "grad_norm": 0.6825264977223254, "learning_rate": 5.144346827410314e-06, "loss": 0.3703890562057495, "num_input_tokens_seen": 637754408, "step": 14580, "train_runtime": 112773.1649, "train_tokens_per_second": 5655.197 }, { "epoch": 0.9820226232157285, "grad_norm": 0.826290290377258, "learning_rate": 5.141703827267117e-06, "loss": 0.3702056646347046, "num_input_tokens_seen": 637982336, "step": 14585, "train_runtime": 112804.5446, "train_tokens_per_second": 5655.644 }, { "epoch": 0.9823592782116887, "grad_norm": 0.7212214874544945, "learning_rate": 5.139060787496893e-06, "loss": 0.3754692077636719, "num_input_tokens_seen": 638203872, "step": 14590, "train_runtime": 112841.7495, "train_tokens_per_second": 5655.742 }, { "epoch": 0.9826959332076488, "grad_norm": 0.6942239873292527, "learning_rate": 5.136417708838766e-06, "loss": 0.3775701284408569, "num_input_tokens_seen": 638407968, "step": 14595, "train_runtime": 112885.1355, "train_tokens_per_second": 5655.377 }, { "epoch": 0.983032588203609, "grad_norm": 0.7575191844718635, "learning_rate": 5.13377459203186e-06, "loss": 0.3628222465515137, "num_input_tokens_seen": 638616040, "step": 14600, "train_runtime": 112923.0341, "train_tokens_per_second": 5655.321 }, { "epoch": 0.9833692431995691, "grad_norm": 0.7100885514863359, "learning_rate": 5.131131437815318e-06, "loss": 0.3371574401855469, "num_input_tokens_seen": 638837176, "step": 14605, "train_runtime": 112963.1632, "train_tokens_per_second": 5655.27 }, { "epoch": 0.9837058981955292, "grad_norm": 0.7208738472250812, "learning_rate": 5.128488246928287e-06, "loss": 0.36636881828308104, "num_input_tokens_seen": 639065552, "step": 14610, "train_runtime": 113000.1458, "train_tokens_per_second": 5655.44 }, { "epoch": 0.9840425531914894, "grad_norm": 0.7630145727500303, "learning_rate": 5.125845020109925e-06, "loss": 0.37039480209350584, "num_input_tokens_seen": 639285272, "step": 14615, "train_runtime": 113047.3523, "train_tokens_per_second": 5655.022 }, { "epoch": 0.9843792081874495, "grad_norm": 0.7720868800544706, "learning_rate": 5.123201758099406e-06, "loss": 0.36545164585113527, "num_input_tokens_seen": 639499208, "step": 14620, "train_runtime": 113085.6686, "train_tokens_per_second": 5654.998 }, { "epoch": 0.9847158631834096, "grad_norm": 0.7035125490360992, "learning_rate": 5.12055846163591e-06, "loss": 0.37010979652404785, "num_input_tokens_seen": 639714312, "step": 14625, "train_runtime": 113123.7227, "train_tokens_per_second": 5654.997 }, { "epoch": 0.9850525181793698, "grad_norm": 0.6519589735545973, "learning_rate": 5.117915131458623e-06, "loss": 0.3291551828384399, "num_input_tokens_seen": 639938488, "step": 14630, "train_runtime": 113162.111, "train_tokens_per_second": 5655.06 }, { "epoch": 0.9853891731753299, "grad_norm": 0.8145405370454951, "learning_rate": 5.115271768306745e-06, "loss": 0.36716470718383787, "num_input_tokens_seen": 640152840, "step": 14635, "train_runtime": 113199.5845, "train_tokens_per_second": 5655.081 }, { "epoch": 0.9857258281712901, "grad_norm": 0.790933823693933, "learning_rate": 5.112628372919485e-06, "loss": 0.3815732717514038, "num_input_tokens_seen": 640369952, "step": 14640, "train_runtime": 113234.1823, "train_tokens_per_second": 5655.271 }, { "epoch": 0.9860624831672502, "grad_norm": 0.9699782510514777, "learning_rate": 5.1099849460360595e-06, "loss": 0.34613332748413084, "num_input_tokens_seen": 640567240, "step": 14645, "train_runtime": 113271.7361, "train_tokens_per_second": 5655.137 }, { "epoch": 0.9863991381632103, "grad_norm": 0.6723948378020855, "learning_rate": 5.107341488395695e-06, "loss": 0.3379997730255127, "num_input_tokens_seen": 640788384, "step": 14650, "train_runtime": 113310.4257, "train_tokens_per_second": 5655.158 }, { "epoch": 0.9867357931591705, "grad_norm": 0.7000157996530737, "learning_rate": 5.104698000737626e-06, "loss": 0.37780165672302246, "num_input_tokens_seen": 641011792, "step": 14655, "train_runtime": 113351.4983, "train_tokens_per_second": 5655.08 }, { "epoch": 0.9870724481551306, "grad_norm": 0.7543705648632995, "learning_rate": 5.102054483801094e-06, "loss": 0.38533506393432615, "num_input_tokens_seen": 641239984, "step": 14660, "train_runtime": 113390.3486, "train_tokens_per_second": 5655.155 }, { "epoch": 0.9874091031510908, "grad_norm": 0.7193117605335543, "learning_rate": 5.099410938325351e-06, "loss": 0.3746023178100586, "num_input_tokens_seen": 641468200, "step": 14665, "train_runtime": 113424.7218, "train_tokens_per_second": 5655.453 }, { "epoch": 0.9877457581470509, "grad_norm": 0.8146622438199124, "learning_rate": 5.096767365049657e-06, "loss": 0.3502329111099243, "num_input_tokens_seen": 641672792, "step": 14670, "train_runtime": 113464.964, "train_tokens_per_second": 5655.25 }, { "epoch": 0.988082413143011, "grad_norm": 0.6875126263724606, "learning_rate": 5.094123764713277e-06, "loss": 0.3421436309814453, "num_input_tokens_seen": 641904736, "step": 14675, "train_runtime": 113500.904, "train_tokens_per_second": 5655.503 }, { "epoch": 0.9884190681389712, "grad_norm": 0.7258139194348168, "learning_rate": 5.091480138055487e-06, "loss": 0.36416258811950686, "num_input_tokens_seen": 642136592, "step": 14680, "train_runtime": 113531.8425, "train_tokens_per_second": 5656.004 }, { "epoch": 0.9887557231349313, "grad_norm": 0.7250476516557031, "learning_rate": 5.088836485815568e-06, "loss": 0.35428576469421386, "num_input_tokens_seen": 642334648, "step": 14685, "train_runtime": 113566.8784, "train_tokens_per_second": 5656.003 }, { "epoch": 0.9890923781308915, "grad_norm": 0.7385563837095339, "learning_rate": 5.086192808732809e-06, "loss": 0.35656602382659913, "num_input_tokens_seen": 642538480, "step": 14690, "train_runtime": 113608.5759, "train_tokens_per_second": 5655.722 }, { "epoch": 0.9894290331268516, "grad_norm": 0.7946980704838973, "learning_rate": 5.083549107546505e-06, "loss": 0.36766040325164795, "num_input_tokens_seen": 642744792, "step": 14695, "train_runtime": 113647.6019, "train_tokens_per_second": 5655.595 }, { "epoch": 0.9897656881228117, "grad_norm": 0.771038431226611, "learning_rate": 5.080905382995961e-06, "loss": 0.38895292282104493, "num_input_tokens_seen": 642974608, "step": 14700, "train_runtime": 113683.9469, "train_tokens_per_second": 5655.808 }, { "epoch": 0.9901023431187719, "grad_norm": 0.7343676499490034, "learning_rate": 5.0782616358204835e-06, "loss": 0.37378993034362795, "num_input_tokens_seen": 643191928, "step": 14705, "train_runtime": 113723.5317, "train_tokens_per_second": 5655.751 }, { "epoch": 0.990438998114732, "grad_norm": 0.8524692289540274, "learning_rate": 5.075617866759389e-06, "loss": 0.33492867946624755, "num_input_tokens_seen": 643403376, "step": 14710, "train_runtime": 113766.092, "train_tokens_per_second": 5655.493 }, { "epoch": 0.9907756531106922, "grad_norm": 0.7901150595595263, "learning_rate": 5.0729740765519995e-06, "loss": 0.4053798675537109, "num_input_tokens_seen": 643617760, "step": 14715, "train_runtime": 113802.6369, "train_tokens_per_second": 5655.561 }, { "epoch": 0.9911123081066523, "grad_norm": 0.7850703195564729, "learning_rate": 5.070330265937643e-06, "loss": 0.3686873435974121, "num_input_tokens_seen": 643827376, "step": 14720, "train_runtime": 113838.4716, "train_tokens_per_second": 5655.622 }, { "epoch": 0.9914489631026124, "grad_norm": 0.7339072075707702, "learning_rate": 5.067686435655651e-06, "loss": 0.3935819625854492, "num_input_tokens_seen": 644051992, "step": 14725, "train_runtime": 113875.0085, "train_tokens_per_second": 5655.78 }, { "epoch": 0.9917856180985726, "grad_norm": 0.7717913369926017, "learning_rate": 5.065042586445363e-06, "loss": 0.39838461875915526, "num_input_tokens_seen": 644255512, "step": 14730, "train_runtime": 113907.4094, "train_tokens_per_second": 5655.958 }, { "epoch": 0.9921222730945327, "grad_norm": 0.7852173126276834, "learning_rate": 5.0623987190461245e-06, "loss": 0.30464193820953367, "num_input_tokens_seen": 644460824, "step": 14735, "train_runtime": 113944.9392, "train_tokens_per_second": 5655.897 }, { "epoch": 0.9924589280904929, "grad_norm": 0.7913343599249734, "learning_rate": 5.059754834197281e-06, "loss": 0.3790989875793457, "num_input_tokens_seen": 644675152, "step": 14740, "train_runtime": 113988.6481, "train_tokens_per_second": 5655.608 }, { "epoch": 0.992795583086453, "grad_norm": 0.6313018834314664, "learning_rate": 5.05711093263819e-06, "loss": 0.32619643211364746, "num_input_tokens_seen": 644890856, "step": 14745, "train_runtime": 114026.2898, "train_tokens_per_second": 5655.633 }, { "epoch": 0.9931322380824131, "grad_norm": 0.7700737076224284, "learning_rate": 5.054467015108208e-06, "loss": 0.37743263244628905, "num_input_tokens_seen": 645124328, "step": 14750, "train_runtime": 114061.9307, "train_tokens_per_second": 5655.913 }, { "epoch": 0.9934688930783733, "grad_norm": 0.8548358470170475, "learning_rate": 5.051823082346701e-06, "loss": 0.37684605121612547, "num_input_tokens_seen": 645342896, "step": 14755, "train_runtime": 114095.225, "train_tokens_per_second": 5656.178 }, { "epoch": 0.9938055480743334, "grad_norm": 0.7487000463516748, "learning_rate": 5.049179135093033e-06, "loss": 0.3667085409164429, "num_input_tokens_seen": 645572616, "step": 14760, "train_runtime": 114128.9739, "train_tokens_per_second": 5656.518 }, { "epoch": 0.9941422030702936, "grad_norm": 0.7554586359729867, "learning_rate": 5.046535174086575e-06, "loss": 0.37410502433776854, "num_input_tokens_seen": 645784112, "step": 14765, "train_runtime": 114171.4105, "train_tokens_per_second": 5656.268 }, { "epoch": 0.9944788580662537, "grad_norm": 0.806201449115856, "learning_rate": 5.043891200066706e-06, "loss": 0.35855536460876464, "num_input_tokens_seen": 646000480, "step": 14770, "train_runtime": 114211.5644, "train_tokens_per_second": 5656.174 }, { "epoch": 0.9948155130622138, "grad_norm": 0.7970070550101245, "learning_rate": 5.041247213772802e-06, "loss": 0.3647798538208008, "num_input_tokens_seen": 646228928, "step": 14775, "train_runtime": 114248.8453, "train_tokens_per_second": 5656.328 }, { "epoch": 0.995152168058174, "grad_norm": 0.9274665922453337, "learning_rate": 5.038603215944247e-06, "loss": 0.3697342872619629, "num_input_tokens_seen": 646427096, "step": 14780, "train_runtime": 114283.9377, "train_tokens_per_second": 5656.325 }, { "epoch": 0.9954888230541341, "grad_norm": 0.7200893083392556, "learning_rate": 5.0359592073204254e-06, "loss": 0.34227933883666994, "num_input_tokens_seen": 646643272, "step": 14785, "train_runtime": 114327.3802, "train_tokens_per_second": 5656.067 }, { "epoch": 0.9958254780500942, "grad_norm": 1.0261926014877596, "learning_rate": 5.033315188640725e-06, "loss": 0.3627659797668457, "num_input_tokens_seen": 646872200, "step": 14790, "train_runtime": 114366.7864, "train_tokens_per_second": 5656.119 }, { "epoch": 0.9961621330460544, "grad_norm": 0.6681278213263397, "learning_rate": 5.03067116064454e-06, "loss": 0.3450484752655029, "num_input_tokens_seen": 647094832, "step": 14795, "train_runtime": 114408.9697, "train_tokens_per_second": 5655.98 }, { "epoch": 0.9964987880420145, "grad_norm": 0.6613774299958016, "learning_rate": 5.028027124071262e-06, "loss": 0.36185712814331056, "num_input_tokens_seen": 647301568, "step": 14800, "train_runtime": 114449.8831, "train_tokens_per_second": 5655.764 }, { "epoch": 0.9968354430379747, "grad_norm": 0.7005897120089515, "learning_rate": 5.025383079660289e-06, "loss": 0.3468491554260254, "num_input_tokens_seen": 647531264, "step": 14805, "train_runtime": 114488.5353, "train_tokens_per_second": 5655.861 }, { "epoch": 0.9971720980339348, "grad_norm": 0.7061938748348358, "learning_rate": 5.0227390281510166e-06, "loss": 0.3663314342498779, "num_input_tokens_seen": 647753976, "step": 14810, "train_runtime": 114526.0357, "train_tokens_per_second": 5655.954 }, { "epoch": 0.997508753029895, "grad_norm": 0.7212945140660744, "learning_rate": 5.020094970282849e-06, "loss": 0.3663675308227539, "num_input_tokens_seen": 647955768, "step": 14815, "train_runtime": 114566.6744, "train_tokens_per_second": 5655.709 }, { "epoch": 0.9978454080258551, "grad_norm": 0.7579147457391882, "learning_rate": 5.017450906795187e-06, "loss": 0.36784412860870364, "num_input_tokens_seen": 648181384, "step": 14820, "train_runtime": 114601.4001, "train_tokens_per_second": 5655.964 }, { "epoch": 0.9981820630218152, "grad_norm": 0.7496488759479608, "learning_rate": 5.014806838427434e-06, "loss": 0.36796035766601565, "num_input_tokens_seen": 648382672, "step": 14825, "train_runtime": 114646.9011, "train_tokens_per_second": 5655.475 }, { "epoch": 0.9985187180177754, "grad_norm": 0.6851905965880742, "learning_rate": 5.0121627659189964e-06, "loss": 0.3591431140899658, "num_input_tokens_seen": 648612168, "step": 14830, "train_runtime": 114682.2822, "train_tokens_per_second": 5655.731 }, { "epoch": 0.9988553730137355, "grad_norm": 0.6696970669236173, "learning_rate": 5.009518690009281e-06, "loss": 0.3566739082336426, "num_input_tokens_seen": 648821208, "step": 14835, "train_runtime": 114724.3707, "train_tokens_per_second": 5655.478 }, { "epoch": 0.9991920280096956, "grad_norm": 0.7614065048649256, "learning_rate": 5.006874611437692e-06, "loss": 0.3776280879974365, "num_input_tokens_seen": 649046288, "step": 14840, "train_runtime": 114764.8122, "train_tokens_per_second": 5655.447 }, { "epoch": 0.9995286830056558, "grad_norm": 0.6492499944472357, "learning_rate": 5.004230530943641e-06, "loss": 0.35755281448364257, "num_input_tokens_seen": 649262232, "step": 14845, "train_runtime": 114804.5614, "train_tokens_per_second": 5655.37 }, { "epoch": 0.9998653380016159, "grad_norm": 0.7184203567667401, "learning_rate": 5.001586449266536e-06, "loss": 0.3260646343231201, "num_input_tokens_seen": 649487024, "step": 14850, "train_runtime": 114845.5757, "train_tokens_per_second": 5655.307 } ], "logging_steps": 5, "max_steps": 29704, "num_input_tokens_seen": 649573848, "num_train_epochs": 2, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1201285497962496.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }