{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0, "eval_steps": 198, "global_step": 1980, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0010108668182966893, "grad_norm": 11.463725090026855, "learning_rate": 0.0, "loss": 0.27058643102645874, "num_input_tokens_seen": 2014, "step": 1, "train_runtime": 30.365, "train_tokens_per_second": 66.326 }, { "epoch": 0.0020217336365933787, "grad_norm": 9.243507385253906, "learning_rate": 4.000000000000001e-06, "loss": 0.2549106180667877, "num_input_tokens_seen": 4302, "step": 2, "train_runtime": 32.7112, "train_tokens_per_second": 131.515 }, { "epoch": 0.003032600454890068, "grad_norm": 8.196733474731445, "learning_rate": 8.000000000000001e-06, "loss": 0.22403164207935333, "num_input_tokens_seen": 6256, "step": 3, "train_runtime": 35.0243, "train_tokens_per_second": 178.619 }, { "epoch": 0.004043467273186757, "grad_norm": 5.648019313812256, "learning_rate": 1.2e-05, "loss": 0.16279545426368713, "num_input_tokens_seen": 8140, "step": 4, "train_runtime": 37.2324, "train_tokens_per_second": 218.627 }, { "epoch": 0.005054334091483447, "grad_norm": 4.784319877624512, "learning_rate": 1.6000000000000003e-05, "loss": 0.16342008113861084, "num_input_tokens_seen": 9800, "step": 5, "train_runtime": 39.4406, "train_tokens_per_second": 248.475 }, { "epoch": 0.006065200909780136, "grad_norm": 4.195488929748535, "learning_rate": 2e-05, "loss": 0.18118953704833984, "num_input_tokens_seen": 11810, "step": 6, "train_runtime": 41.6807, "train_tokens_per_second": 283.345 }, { "epoch": 0.0070760677280768255, "grad_norm": 3.3543472290039062, "learning_rate": 1.998987341772152e-05, "loss": 0.15088146924972534, "num_input_tokens_seen": 13386, "step": 7, "train_runtime": 43.8323, "train_tokens_per_second": 305.391 }, { "epoch": 0.008086934546373515, "grad_norm": 3.685063362121582, "learning_rate": 1.997974683544304e-05, "loss": 0.12043247371912003, "num_input_tokens_seen": 15448, "step": 8, "train_runtime": 46.1166, "train_tokens_per_second": 334.977 }, { "epoch": 0.009097801364670205, "grad_norm": 2.9997713565826416, "learning_rate": 1.996962025316456e-05, "loss": 0.136856809258461, "num_input_tokens_seen": 17280, "step": 9, "train_runtime": 48.3393, "train_tokens_per_second": 357.473 }, { "epoch": 0.010108668182966895, "grad_norm": 2.9768412113189697, "learning_rate": 1.9959493670886078e-05, "loss": 0.15534675121307373, "num_input_tokens_seen": 19228, "step": 10, "train_runtime": 50.6127, "train_tokens_per_second": 379.905 }, { "epoch": 0.011119535001263583, "grad_norm": 2.748751163482666, "learning_rate": 1.9949367088607597e-05, "loss": 0.144414022564888, "num_input_tokens_seen": 21282, "step": 11, "train_runtime": 52.9193, "train_tokens_per_second": 402.16 }, { "epoch": 0.012130401819560273, "grad_norm": 2.0463802814483643, "learning_rate": 1.9939240506329116e-05, "loss": 0.11977019906044006, "num_input_tokens_seen": 23866, "step": 12, "train_runtime": 55.2931, "train_tokens_per_second": 431.627 }, { "epoch": 0.013141268637856963, "grad_norm": 3.2663321495056152, "learning_rate": 1.9929113924050635e-05, "loss": 0.17596785724163055, "num_input_tokens_seen": 25162, "step": 13, "train_runtime": 57.3569, "train_tokens_per_second": 438.692 }, { "epoch": 0.014152135456153651, "grad_norm": 2.8759734630584717, "learning_rate": 1.9918987341772154e-05, "loss": 0.1420745849609375, "num_input_tokens_seen": 27000, "step": 14, "train_runtime": 59.5626, "train_tokens_per_second": 453.305 }, { "epoch": 0.015163002274450341, "grad_norm": 2.3515286445617676, "learning_rate": 1.9908860759493673e-05, "loss": 0.1690654456615448, "num_input_tokens_seen": 29284, "step": 15, "train_runtime": 61.9399, "train_tokens_per_second": 472.781 }, { "epoch": 0.01617386909274703, "grad_norm": 2.069561243057251, "learning_rate": 1.9898734177215192e-05, "loss": 0.11181537806987762, "num_input_tokens_seen": 30880, "step": 16, "train_runtime": 64.1141, "train_tokens_per_second": 481.642 }, { "epoch": 0.01718473591104372, "grad_norm": 2.4530253410339355, "learning_rate": 1.988860759493671e-05, "loss": 0.14298129081726074, "num_input_tokens_seen": 32636, "step": 17, "train_runtime": 66.333, "train_tokens_per_second": 492.002 }, { "epoch": 0.01819560272934041, "grad_norm": 2.4296536445617676, "learning_rate": 1.9878481012658227e-05, "loss": 0.1248965710401535, "num_input_tokens_seen": 34086, "step": 18, "train_runtime": 68.5037, "train_tokens_per_second": 497.579 }, { "epoch": 0.0192064695476371, "grad_norm": 2.3326025009155273, "learning_rate": 1.986835443037975e-05, "loss": 0.14833924174308777, "num_input_tokens_seen": 35890, "step": 19, "train_runtime": 70.7199, "train_tokens_per_second": 507.495 }, { "epoch": 0.02021733636593379, "grad_norm": 2.302140712738037, "learning_rate": 1.985822784810127e-05, "loss": 0.13441942632198334, "num_input_tokens_seen": 37808, "step": 20, "train_runtime": 73.1196, "train_tokens_per_second": 517.071 }, { "epoch": 0.02122820318423048, "grad_norm": 2.6388118267059326, "learning_rate": 1.9848101265822785e-05, "loss": 0.1305861622095108, "num_input_tokens_seen": 39772, "step": 21, "train_runtime": 75.3868, "train_tokens_per_second": 527.572 }, { "epoch": 0.022239070002527166, "grad_norm": 2.6078476905822754, "learning_rate": 1.9837974683544307e-05, "loss": 0.1466171145439148, "num_input_tokens_seen": 41968, "step": 22, "train_runtime": 77.6477, "train_tokens_per_second": 540.492 }, { "epoch": 0.023249936820823856, "grad_norm": 2.4036481380462646, "learning_rate": 1.9827848101265826e-05, "loss": 0.14058755338191986, "num_input_tokens_seen": 43884, "step": 23, "train_runtime": 79.8842, "train_tokens_per_second": 549.345 }, { "epoch": 0.024260803639120546, "grad_norm": 2.364380359649658, "learning_rate": 1.9817721518987342e-05, "loss": 0.1120375543832779, "num_input_tokens_seen": 45820, "step": 24, "train_runtime": 82.0906, "train_tokens_per_second": 558.163 }, { "epoch": 0.025271670457417236, "grad_norm": 2.6477315425872803, "learning_rate": 1.9807594936708864e-05, "loss": 0.14213895797729492, "num_input_tokens_seen": 47302, "step": 25, "train_runtime": 84.253, "train_tokens_per_second": 561.428 }, { "epoch": 0.026282537275713926, "grad_norm": 2.5072643756866455, "learning_rate": 1.979746835443038e-05, "loss": 0.13167902827262878, "num_input_tokens_seen": 48978, "step": 26, "train_runtime": 86.3872, "train_tokens_per_second": 566.959 }, { "epoch": 0.027293404094010616, "grad_norm": 2.603252649307251, "learning_rate": 1.97873417721519e-05, "loss": 0.1659485399723053, "num_input_tokens_seen": 50812, "step": 27, "train_runtime": 88.5512, "train_tokens_per_second": 573.815 }, { "epoch": 0.028304270912307302, "grad_norm": 2.4532132148742676, "learning_rate": 1.977721518987342e-05, "loss": 0.12353596091270447, "num_input_tokens_seen": 52666, "step": 28, "train_runtime": 90.7873, "train_tokens_per_second": 580.103 }, { "epoch": 0.029315137730603992, "grad_norm": 3.3822824954986572, "learning_rate": 1.9767088607594937e-05, "loss": 0.16516587138175964, "num_input_tokens_seen": 54330, "step": 29, "train_runtime": 92.9164, "train_tokens_per_second": 584.719 }, { "epoch": 0.030326004548900682, "grad_norm": 2.7512779235839844, "learning_rate": 1.9756962025316456e-05, "loss": 0.13730409741401672, "num_input_tokens_seen": 55990, "step": 30, "train_runtime": 95.0721, "train_tokens_per_second": 588.921 }, { "epoch": 0.03133687136719737, "grad_norm": 2.2253849506378174, "learning_rate": 1.974683544303798e-05, "loss": 0.10745520144701004, "num_input_tokens_seen": 57646, "step": 31, "train_runtime": 103.8486, "train_tokens_per_second": 555.096 }, { "epoch": 0.03234773818549406, "grad_norm": 2.0792880058288574, "learning_rate": 1.9736708860759494e-05, "loss": 0.11148789525032043, "num_input_tokens_seen": 59978, "step": 32, "train_runtime": 106.1404, "train_tokens_per_second": 565.082 }, { "epoch": 0.03335860500379075, "grad_norm": 2.7239630222320557, "learning_rate": 1.9726582278481014e-05, "loss": 0.1380208283662796, "num_input_tokens_seen": 61296, "step": 33, "train_runtime": 108.2579, "train_tokens_per_second": 566.204 }, { "epoch": 0.03436947182208744, "grad_norm": 2.196681499481201, "learning_rate": 1.9716455696202533e-05, "loss": 0.14132940769195557, "num_input_tokens_seen": 63650, "step": 34, "train_runtime": 110.5755, "train_tokens_per_second": 575.625 }, { "epoch": 0.03538033864038413, "grad_norm": 2.128329277038574, "learning_rate": 1.970632911392405e-05, "loss": 0.14076243340969086, "num_input_tokens_seen": 65694, "step": 35, "train_runtime": 112.8447, "train_tokens_per_second": 582.163 }, { "epoch": 0.03639120545868082, "grad_norm": 2.418405055999756, "learning_rate": 1.969620253164557e-05, "loss": 0.11391866207122803, "num_input_tokens_seen": 67306, "step": 36, "train_runtime": 115.0694, "train_tokens_per_second": 584.917 }, { "epoch": 0.037402072276977505, "grad_norm": 2.734203338623047, "learning_rate": 1.968607594936709e-05, "loss": 0.16631358861923218, "num_input_tokens_seen": 69350, "step": 37, "train_runtime": 117.2859, "train_tokens_per_second": 591.29 }, { "epoch": 0.0384129390952742, "grad_norm": 2.8153579235076904, "learning_rate": 1.967594936708861e-05, "loss": 0.1615174114704132, "num_input_tokens_seen": 71108, "step": 38, "train_runtime": 119.4274, "train_tokens_per_second": 595.408 }, { "epoch": 0.039423805913570885, "grad_norm": 2.186095952987671, "learning_rate": 1.9665822784810128e-05, "loss": 0.142922043800354, "num_input_tokens_seen": 72894, "step": 39, "train_runtime": 121.6064, "train_tokens_per_second": 599.426 }, { "epoch": 0.04043467273186758, "grad_norm": 1.8680264949798584, "learning_rate": 1.9655696202531647e-05, "loss": 0.11134858429431915, "num_input_tokens_seen": 74832, "step": 40, "train_runtime": 124.0373, "train_tokens_per_second": 603.302 }, { "epoch": 0.041445539550164265, "grad_norm": 2.2168729305267334, "learning_rate": 1.9645569620253166e-05, "loss": 0.14616534113883972, "num_input_tokens_seen": 76986, "step": 41, "train_runtime": 126.2916, "train_tokens_per_second": 609.589 }, { "epoch": 0.04245640636846096, "grad_norm": 3.064636707305908, "learning_rate": 1.9635443037974685e-05, "loss": 0.12268605083227158, "num_input_tokens_seen": 78728, "step": 42, "train_runtime": 128.4709, "train_tokens_per_second": 612.808 }, { "epoch": 0.043467273186757645, "grad_norm": 1.8882980346679688, "learning_rate": 1.9625316455696204e-05, "loss": 0.09156373143196106, "num_input_tokens_seen": 80352, "step": 43, "train_runtime": 130.6461, "train_tokens_per_second": 615.035 }, { "epoch": 0.04447814000505433, "grad_norm": 2.0294580459594727, "learning_rate": 1.9615189873417723e-05, "loss": 0.11838850378990173, "num_input_tokens_seen": 82186, "step": 44, "train_runtime": 132.8638, "train_tokens_per_second": 618.573 }, { "epoch": 0.045489006823351025, "grad_norm": 2.3659250736236572, "learning_rate": 1.9605063291139243e-05, "loss": 0.1352626085281372, "num_input_tokens_seen": 84134, "step": 45, "train_runtime": 135.0895, "train_tokens_per_second": 622.802 }, { "epoch": 0.04649987364164771, "grad_norm": 1.9668437242507935, "learning_rate": 1.959493670886076e-05, "loss": 0.13398335874080658, "num_input_tokens_seen": 86412, "step": 46, "train_runtime": 137.3768, "train_tokens_per_second": 629.014 }, { "epoch": 0.047510740459944405, "grad_norm": 2.4079082012176514, "learning_rate": 1.958481012658228e-05, "loss": 0.12897895276546478, "num_input_tokens_seen": 88426, "step": 47, "train_runtime": 139.6247, "train_tokens_per_second": 633.312 }, { "epoch": 0.04852160727824109, "grad_norm": 2.137667655944824, "learning_rate": 1.95746835443038e-05, "loss": 0.12803080677986145, "num_input_tokens_seen": 90310, "step": 48, "train_runtime": 141.8482, "train_tokens_per_second": 636.667 }, { "epoch": 0.04953247409653778, "grad_norm": 2.125237226486206, "learning_rate": 1.956455696202532e-05, "loss": 0.12782883644104004, "num_input_tokens_seen": 92530, "step": 49, "train_runtime": 144.1353, "train_tokens_per_second": 641.966 }, { "epoch": 0.05054334091483447, "grad_norm": 1.9926167726516724, "learning_rate": 1.9554430379746835e-05, "loss": 0.11848489195108414, "num_input_tokens_seen": 94718, "step": 50, "train_runtime": 146.4533, "train_tokens_per_second": 646.745 }, { "epoch": 0.05155420773313116, "grad_norm": 2.0517542362213135, "learning_rate": 1.9544303797468357e-05, "loss": 0.11716699600219727, "num_input_tokens_seen": 96530, "step": 51, "train_runtime": 148.6661, "train_tokens_per_second": 649.307 }, { "epoch": 0.05256507455142785, "grad_norm": 2.127108573913574, "learning_rate": 1.9534177215189876e-05, "loss": 0.11858700960874557, "num_input_tokens_seen": 98434, "step": 52, "train_runtime": 150.8912, "train_tokens_per_second": 652.351 }, { "epoch": 0.05357594136972454, "grad_norm": 2.1097190380096436, "learning_rate": 1.9524050632911392e-05, "loss": 0.11988560855388641, "num_input_tokens_seen": 100400, "step": 53, "train_runtime": 153.0729, "train_tokens_per_second": 655.897 }, { "epoch": 0.05458680818802123, "grad_norm": 2.1106865406036377, "learning_rate": 1.9513924050632914e-05, "loss": 0.10115162283182144, "num_input_tokens_seen": 101800, "step": 54, "train_runtime": 155.1902, "train_tokens_per_second": 655.969 }, { "epoch": 0.05559767500631792, "grad_norm": 2.2258450984954834, "learning_rate": 1.9503797468354433e-05, "loss": 0.12345483899116516, "num_input_tokens_seen": 103632, "step": 55, "train_runtime": 157.3676, "train_tokens_per_second": 658.535 }, { "epoch": 0.056608541824614604, "grad_norm": 2.647247552871704, "learning_rate": 1.949367088607595e-05, "loss": 0.15581361949443817, "num_input_tokens_seen": 105654, "step": 56, "train_runtime": 159.6032, "train_tokens_per_second": 661.979 }, { "epoch": 0.0576194086429113, "grad_norm": 3.035010814666748, "learning_rate": 1.948354430379747e-05, "loss": 0.14977982640266418, "num_input_tokens_seen": 107452, "step": 57, "train_runtime": 161.7704, "train_tokens_per_second": 664.225 }, { "epoch": 0.058630275461207984, "grad_norm": 1.9288145303726196, "learning_rate": 1.9473417721518987e-05, "loss": 0.0957871675491333, "num_input_tokens_seen": 109702, "step": 58, "train_runtime": 164.0524, "train_tokens_per_second": 668.701 }, { "epoch": 0.05964114227950468, "grad_norm": 2.5870797634124756, "learning_rate": 1.9463291139240506e-05, "loss": 0.13609547913074493, "num_input_tokens_seen": 111458, "step": 59, "train_runtime": 166.2055, "train_tokens_per_second": 670.604 }, { "epoch": 0.060652009097801364, "grad_norm": 2.4269790649414062, "learning_rate": 1.945316455696203e-05, "loss": 0.11794693022966385, "num_input_tokens_seen": 112866, "step": 60, "train_runtime": 168.2716, "train_tokens_per_second": 670.737 }, { "epoch": 0.06166287591609806, "grad_norm": 2.5546016693115234, "learning_rate": 1.9443037974683544e-05, "loss": 0.15975920855998993, "num_input_tokens_seen": 115128, "step": 61, "train_runtime": 176.8429, "train_tokens_per_second": 651.019 }, { "epoch": 0.06267374273439474, "grad_norm": 2.4380621910095215, "learning_rate": 1.9432911392405064e-05, "loss": 0.12921664118766785, "num_input_tokens_seen": 117058, "step": 62, "train_runtime": 179.0428, "train_tokens_per_second": 653.799 }, { "epoch": 0.06368460955269144, "grad_norm": 2.1433351039886475, "learning_rate": 1.9422784810126586e-05, "loss": 0.11755329370498657, "num_input_tokens_seen": 119258, "step": 63, "train_runtime": 181.3383, "train_tokens_per_second": 657.655 }, { "epoch": 0.06469547637098812, "grad_norm": 1.960486888885498, "learning_rate": 1.9412658227848102e-05, "loss": 0.10061006247997284, "num_input_tokens_seen": 121276, "step": 64, "train_runtime": 183.5726, "train_tokens_per_second": 660.643 }, { "epoch": 0.06570634318928481, "grad_norm": 2.0249807834625244, "learning_rate": 1.940253164556962e-05, "loss": 0.1087707057595253, "num_input_tokens_seen": 122996, "step": 65, "train_runtime": 185.7202, "train_tokens_per_second": 662.265 }, { "epoch": 0.0667172100075815, "grad_norm": 1.7995734214782715, "learning_rate": 1.939240506329114e-05, "loss": 0.12001064419746399, "num_input_tokens_seen": 125242, "step": 66, "train_runtime": 188.0206, "train_tokens_per_second": 666.108 }, { "epoch": 0.0677280768258782, "grad_norm": 2.116785764694214, "learning_rate": 1.938227848101266e-05, "loss": 0.11175717413425446, "num_input_tokens_seen": 127580, "step": 67, "train_runtime": 190.3261, "train_tokens_per_second": 670.323 }, { "epoch": 0.06873894364417488, "grad_norm": 2.242112874984741, "learning_rate": 1.9372151898734178e-05, "loss": 0.1137399822473526, "num_input_tokens_seen": 129804, "step": 68, "train_runtime": 192.5895, "train_tokens_per_second": 673.993 }, { "epoch": 0.06974981046247157, "grad_norm": 2.366602897644043, "learning_rate": 1.9362025316455697e-05, "loss": 0.17228052020072937, "num_input_tokens_seen": 131960, "step": 69, "train_runtime": 194.8769, "train_tokens_per_second": 677.145 }, { "epoch": 0.07076067728076826, "grad_norm": 2.067042589187622, "learning_rate": 1.9351898734177216e-05, "loss": 0.12803220748901367, "num_input_tokens_seen": 133790, "step": 70, "train_runtime": 197.0985, "train_tokens_per_second": 678.798 }, { "epoch": 0.07177154409906494, "grad_norm": 1.8924226760864258, "learning_rate": 1.9341772151898735e-05, "loss": 0.10274340957403183, "num_input_tokens_seen": 135344, "step": 71, "train_runtime": 199.2604, "train_tokens_per_second": 679.232 }, { "epoch": 0.07278241091736164, "grad_norm": 2.0558054447174072, "learning_rate": 1.9331645569620254e-05, "loss": 0.09446454793214798, "num_input_tokens_seen": 136974, "step": 72, "train_runtime": 201.387, "train_tokens_per_second": 680.153 }, { "epoch": 0.07379327773565833, "grad_norm": 1.939015507698059, "learning_rate": 1.9321518987341774e-05, "loss": 0.11452166736125946, "num_input_tokens_seen": 138742, "step": 73, "train_runtime": 203.5894, "train_tokens_per_second": 681.48 }, { "epoch": 0.07480414455395501, "grad_norm": 2.055706262588501, "learning_rate": 1.9311392405063293e-05, "loss": 0.11065662652254105, "num_input_tokens_seen": 140352, "step": 74, "train_runtime": 205.7367, "train_tokens_per_second": 682.192 }, { "epoch": 0.0758150113722517, "grad_norm": 1.903029441833496, "learning_rate": 1.930126582278481e-05, "loss": 0.08838392049074173, "num_input_tokens_seen": 142278, "step": 75, "train_runtime": 207.9342, "train_tokens_per_second": 684.245 }, { "epoch": 0.0768258781905484, "grad_norm": 2.230924606323242, "learning_rate": 1.929113924050633e-05, "loss": 0.11504680663347244, "num_input_tokens_seen": 144160, "step": 76, "train_runtime": 210.1283, "train_tokens_per_second": 686.057 }, { "epoch": 0.07783674500884509, "grad_norm": 1.9158000946044922, "learning_rate": 1.928101265822785e-05, "loss": 0.119988813996315, "num_input_tokens_seen": 146444, "step": 77, "train_runtime": 212.4393, "train_tokens_per_second": 689.345 }, { "epoch": 0.07884761182714177, "grad_norm": 2.004648447036743, "learning_rate": 1.927088607594937e-05, "loss": 0.10192504525184631, "num_input_tokens_seen": 148724, "step": 78, "train_runtime": 214.7221, "train_tokens_per_second": 692.635 }, { "epoch": 0.07985847864543846, "grad_norm": 2.0876219272613525, "learning_rate": 1.9260759493670888e-05, "loss": 0.12379962205886841, "num_input_tokens_seen": 150364, "step": 79, "train_runtime": 216.8343, "train_tokens_per_second": 693.451 }, { "epoch": 0.08086934546373516, "grad_norm": 2.624312400817871, "learning_rate": 1.9250632911392407e-05, "loss": 0.15576514601707458, "num_input_tokens_seen": 152144, "step": 80, "train_runtime": 219.0266, "train_tokens_per_second": 694.637 }, { "epoch": 0.08188021228203184, "grad_norm": 2.4926764965057373, "learning_rate": 1.9240506329113926e-05, "loss": 0.12395478785037994, "num_input_tokens_seen": 153538, "step": 81, "train_runtime": 221.128, "train_tokens_per_second": 694.34 }, { "epoch": 0.08289107910032853, "grad_norm": 2.0212905406951904, "learning_rate": 1.9230379746835445e-05, "loss": 0.11995596438646317, "num_input_tokens_seen": 155578, "step": 82, "train_runtime": 223.3235, "train_tokens_per_second": 696.648 }, { "epoch": 0.08390194591862522, "grad_norm": 2.133254051208496, "learning_rate": 1.9220253164556964e-05, "loss": 0.11523745954036713, "num_input_tokens_seen": 157254, "step": 83, "train_runtime": 225.4919, "train_tokens_per_second": 697.382 }, { "epoch": 0.08491281273692192, "grad_norm": 1.5193694829940796, "learning_rate": 1.9210126582278483e-05, "loss": 0.07533153146505356, "num_input_tokens_seen": 158702, "step": 84, "train_runtime": 227.5792, "train_tokens_per_second": 697.348 }, { "epoch": 0.0859236795552186, "grad_norm": 2.067779064178467, "learning_rate": 1.9200000000000003e-05, "loss": 0.11896681040525436, "num_input_tokens_seen": 160346, "step": 85, "train_runtime": 229.7672, "train_tokens_per_second": 697.863 }, { "epoch": 0.08693454637351529, "grad_norm": 2.41981840133667, "learning_rate": 1.918987341772152e-05, "loss": 0.15256190299987793, "num_input_tokens_seen": 162460, "step": 86, "train_runtime": 231.9979, "train_tokens_per_second": 700.265 }, { "epoch": 0.08794541319181198, "grad_norm": 1.9438633918762207, "learning_rate": 1.917974683544304e-05, "loss": 0.11282727122306824, "num_input_tokens_seen": 164650, "step": 87, "train_runtime": 234.2839, "train_tokens_per_second": 702.78 }, { "epoch": 0.08895628001010866, "grad_norm": 2.2633562088012695, "learning_rate": 1.916962025316456e-05, "loss": 0.1142498329281807, "num_input_tokens_seen": 166154, "step": 88, "train_runtime": 236.3963, "train_tokens_per_second": 702.862 }, { "epoch": 0.08996714682840536, "grad_norm": 2.4861838817596436, "learning_rate": 1.915949367088608e-05, "loss": 0.13935230672359467, "num_input_tokens_seen": 167978, "step": 89, "train_runtime": 238.6332, "train_tokens_per_second": 703.917 }, { "epoch": 0.09097801364670205, "grad_norm": 2.1855666637420654, "learning_rate": 1.9149367088607595e-05, "loss": 0.13527220487594604, "num_input_tokens_seen": 169662, "step": 90, "train_runtime": 240.7981, "train_tokens_per_second": 704.582 }, { "epoch": 0.09198888046499874, "grad_norm": 1.859151005744934, "learning_rate": 1.9139240506329117e-05, "loss": 0.12460088729858398, "num_input_tokens_seen": 171702, "step": 91, "train_runtime": 249.1994, "train_tokens_per_second": 689.015 }, { "epoch": 0.09299974728329542, "grad_norm": 1.901003122329712, "learning_rate": 1.9129113924050636e-05, "loss": 0.10142221301794052, "num_input_tokens_seen": 173154, "step": 92, "train_runtime": 251.3454, "train_tokens_per_second": 688.909 }, { "epoch": 0.09401061410159212, "grad_norm": 2.418314218521118, "learning_rate": 1.9118987341772152e-05, "loss": 0.1140369400382042, "num_input_tokens_seen": 175074, "step": 93, "train_runtime": 253.5251, "train_tokens_per_second": 690.559 }, { "epoch": 0.09502148091988881, "grad_norm": 1.9275882244110107, "learning_rate": 1.9108860759493674e-05, "loss": 0.09216680377721786, "num_input_tokens_seen": 177174, "step": 94, "train_runtime": 255.7891, "train_tokens_per_second": 692.656 }, { "epoch": 0.09603234773818549, "grad_norm": 2.2098522186279297, "learning_rate": 1.9098734177215193e-05, "loss": 0.10576708614826202, "num_input_tokens_seen": 178894, "step": 95, "train_runtime": 258.024, "train_tokens_per_second": 693.323 }, { "epoch": 0.09704321455648218, "grad_norm": 2.2304112911224365, "learning_rate": 1.908860759493671e-05, "loss": 0.10691983997821808, "num_input_tokens_seen": 180318, "step": 96, "train_runtime": 260.0918, "train_tokens_per_second": 693.286 }, { "epoch": 0.09805408137477888, "grad_norm": 2.067747116088867, "learning_rate": 1.9078481012658228e-05, "loss": 0.12733067572116852, "num_input_tokens_seen": 182496, "step": 97, "train_runtime": 262.3363, "train_tokens_per_second": 695.657 }, { "epoch": 0.09906494819307556, "grad_norm": 2.1281158924102783, "learning_rate": 1.9068354430379747e-05, "loss": 0.1434943974018097, "num_input_tokens_seen": 184870, "step": 98, "train_runtime": 264.6362, "train_tokens_per_second": 698.582 }, { "epoch": 0.10007581501137225, "grad_norm": 2.0052590370178223, "learning_rate": 1.9058227848101266e-05, "loss": 0.135469451546669, "num_input_tokens_seen": 187088, "step": 99, "train_runtime": 266.8744, "train_tokens_per_second": 701.034 }, { "epoch": 0.10108668182966894, "grad_norm": 2.2457380294799805, "learning_rate": 1.9048101265822785e-05, "loss": 0.13284868001937866, "num_input_tokens_seen": 188710, "step": 100, "train_runtime": 269.029, "train_tokens_per_second": 701.449 }, { "epoch": 0.10209754864796564, "grad_norm": 2.324469804763794, "learning_rate": 1.9037974683544304e-05, "loss": 0.15497452020645142, "num_input_tokens_seen": 190694, "step": 101, "train_runtime": 271.2959, "train_tokens_per_second": 702.9 }, { "epoch": 0.10310841546626232, "grad_norm": 2.3468329906463623, "learning_rate": 1.9027848101265824e-05, "loss": 0.13803139328956604, "num_input_tokens_seen": 192500, "step": 102, "train_runtime": 273.4579, "train_tokens_per_second": 703.948 }, { "epoch": 0.10411928228455901, "grad_norm": 2.050370454788208, "learning_rate": 1.9017721518987343e-05, "loss": 0.13963785767555237, "num_input_tokens_seen": 194224, "step": 103, "train_runtime": 275.6199, "train_tokens_per_second": 704.681 }, { "epoch": 0.1051301491028557, "grad_norm": 1.9895809888839722, "learning_rate": 1.9007594936708862e-05, "loss": 0.1277201622724533, "num_input_tokens_seen": 196598, "step": 104, "train_runtime": 277.9629, "train_tokens_per_second": 707.282 }, { "epoch": 0.10614101592115238, "grad_norm": 1.9515326023101807, "learning_rate": 1.899746835443038e-05, "loss": 0.1383090615272522, "num_input_tokens_seen": 199018, "step": 105, "train_runtime": 280.2932, "train_tokens_per_second": 710.035 }, { "epoch": 0.10715188273944908, "grad_norm": 2.397286891937256, "learning_rate": 1.89873417721519e-05, "loss": 0.12805454432964325, "num_input_tokens_seen": 200604, "step": 106, "train_runtime": 282.4289, "train_tokens_per_second": 710.281 }, { "epoch": 0.10816274955774577, "grad_norm": 2.6728909015655518, "learning_rate": 1.897721518987342e-05, "loss": 0.13824018836021423, "num_input_tokens_seen": 202286, "step": 107, "train_runtime": 284.5635, "train_tokens_per_second": 710.864 }, { "epoch": 0.10917361637604246, "grad_norm": 1.9050586223602295, "learning_rate": 1.8967088607594938e-05, "loss": 0.1345207244157791, "num_input_tokens_seen": 204376, "step": 108, "train_runtime": 286.8111, "train_tokens_per_second": 712.58 }, { "epoch": 0.11018448319433914, "grad_norm": 2.118673324584961, "learning_rate": 1.8956962025316457e-05, "loss": 0.1226341724395752, "num_input_tokens_seen": 206010, "step": 109, "train_runtime": 288.953, "train_tokens_per_second": 712.953 }, { "epoch": 0.11119535001263584, "grad_norm": 2.150815010070801, "learning_rate": 1.8946835443037976e-05, "loss": 0.16867713630199432, "num_input_tokens_seen": 207814, "step": 110, "train_runtime": 291.0932, "train_tokens_per_second": 713.909 }, { "epoch": 0.11220621683093253, "grad_norm": 2.179553747177124, "learning_rate": 1.8936708860759495e-05, "loss": 0.1012715995311737, "num_input_tokens_seen": 209512, "step": 111, "train_runtime": 293.2347, "train_tokens_per_second": 714.486 }, { "epoch": 0.11321708364922921, "grad_norm": 1.9366041421890259, "learning_rate": 1.8926582278481014e-05, "loss": 0.12508518993854523, "num_input_tokens_seen": 211092, "step": 112, "train_runtime": 295.3477, "train_tokens_per_second": 714.724 }, { "epoch": 0.1142279504675259, "grad_norm": 2.329840898513794, "learning_rate": 1.8916455696202533e-05, "loss": 0.13535994291305542, "num_input_tokens_seen": 212812, "step": 113, "train_runtime": 297.5256, "train_tokens_per_second": 715.273 }, { "epoch": 0.1152388172858226, "grad_norm": 2.201944589614868, "learning_rate": 1.8906329113924053e-05, "loss": 0.14602535963058472, "num_input_tokens_seen": 214682, "step": 114, "train_runtime": 299.704, "train_tokens_per_second": 716.313 }, { "epoch": 0.11624968410411929, "grad_norm": 2.1417429447174072, "learning_rate": 1.889620253164557e-05, "loss": 0.15375256538391113, "num_input_tokens_seen": 216826, "step": 115, "train_runtime": 301.9396, "train_tokens_per_second": 718.11 }, { "epoch": 0.11726055092241597, "grad_norm": 2.452090263366699, "learning_rate": 1.888607594936709e-05, "loss": 0.138523668050766, "num_input_tokens_seen": 218824, "step": 116, "train_runtime": 304.1672, "train_tokens_per_second": 719.42 }, { "epoch": 0.11827141774071266, "grad_norm": 2.308642625808716, "learning_rate": 1.887594936708861e-05, "loss": 0.13310624659061432, "num_input_tokens_seen": 220542, "step": 117, "train_runtime": 306.3643, "train_tokens_per_second": 719.869 }, { "epoch": 0.11928228455900936, "grad_norm": 2.0640058517456055, "learning_rate": 1.886582278481013e-05, "loss": 0.10749287158250809, "num_input_tokens_seen": 222116, "step": 118, "train_runtime": 308.5377, "train_tokens_per_second": 719.899 }, { "epoch": 0.12029315137730603, "grad_norm": 1.9837942123413086, "learning_rate": 1.8855696202531648e-05, "loss": 0.09972156584262848, "num_input_tokens_seen": 224040, "step": 119, "train_runtime": 310.774, "train_tokens_per_second": 720.91 }, { "epoch": 0.12130401819560273, "grad_norm": 2.2541520595550537, "learning_rate": 1.8845569620253167e-05, "loss": 0.12161248922348022, "num_input_tokens_seen": 225810, "step": 120, "train_runtime": 313.0174, "train_tokens_per_second": 721.398 }, { "epoch": 0.12231488501389942, "grad_norm": 2.0319716930389404, "learning_rate": 1.8835443037974686e-05, "loss": 0.08204134553670883, "num_input_tokens_seen": 227214, "step": 121, "train_runtime": 321.393, "train_tokens_per_second": 706.966 }, { "epoch": 0.12332575183219611, "grad_norm": 1.7932884693145752, "learning_rate": 1.8825316455696202e-05, "loss": 0.11774466186761856, "num_input_tokens_seen": 229020, "step": 122, "train_runtime": 323.5627, "train_tokens_per_second": 707.807 }, { "epoch": 0.1243366186504928, "grad_norm": 2.3838610649108887, "learning_rate": 1.8815189873417724e-05, "loss": 0.10385432839393616, "num_input_tokens_seen": 230962, "step": 123, "train_runtime": 325.8582, "train_tokens_per_second": 708.781 }, { "epoch": 0.1253474854687895, "grad_norm": 2.066030979156494, "learning_rate": 1.8805063291139243e-05, "loss": 0.12360858917236328, "num_input_tokens_seen": 232580, "step": 124, "train_runtime": 328.0183, "train_tokens_per_second": 709.046 }, { "epoch": 0.12635835228708617, "grad_norm": 2.22601318359375, "learning_rate": 1.879493670886076e-05, "loss": 0.12216442823410034, "num_input_tokens_seen": 234272, "step": 125, "train_runtime": 330.1693, "train_tokens_per_second": 709.551 }, { "epoch": 0.12736921910538287, "grad_norm": 1.7348881959915161, "learning_rate": 1.878481012658228e-05, "loss": 0.1055573970079422, "num_input_tokens_seen": 236512, "step": 126, "train_runtime": 332.4399, "train_tokens_per_second": 711.443 }, { "epoch": 0.12838008592367955, "grad_norm": 2.1512677669525146, "learning_rate": 1.87746835443038e-05, "loss": 0.1608087718486786, "num_input_tokens_seen": 238912, "step": 127, "train_runtime": 334.7416, "train_tokens_per_second": 713.721 }, { "epoch": 0.12939095274197623, "grad_norm": 2.6692278385162354, "learning_rate": 1.8764556962025316e-05, "loss": 0.14802397787570953, "num_input_tokens_seen": 241040, "step": 128, "train_runtime": 336.9632, "train_tokens_per_second": 715.33 }, { "epoch": 0.13040181956027294, "grad_norm": 2.1903557777404785, "learning_rate": 1.875443037974684e-05, "loss": 0.11743307113647461, "num_input_tokens_seen": 242810, "step": 129, "train_runtime": 339.1213, "train_tokens_per_second": 715.997 }, { "epoch": 0.13141268637856962, "grad_norm": 2.448732376098633, "learning_rate": 1.8744303797468355e-05, "loss": 0.14015504717826843, "num_input_tokens_seen": 244636, "step": 130, "train_runtime": 341.3609, "train_tokens_per_second": 716.649 }, { "epoch": 0.1324235531968663, "grad_norm": 2.160809278488159, "learning_rate": 1.8734177215189874e-05, "loss": 0.11315175145864487, "num_input_tokens_seen": 246324, "step": 131, "train_runtime": 343.5356, "train_tokens_per_second": 717.026 }, { "epoch": 0.133434420015163, "grad_norm": 2.168117046356201, "learning_rate": 1.8724050632911396e-05, "loss": 0.15828710794448853, "num_input_tokens_seen": 248122, "step": 132, "train_runtime": 345.7053, "train_tokens_per_second": 717.727 }, { "epoch": 0.1344452868334597, "grad_norm": 1.9508112668991089, "learning_rate": 1.8713924050632912e-05, "loss": 0.10569241642951965, "num_input_tokens_seen": 250064, "step": 133, "train_runtime": 347.9078, "train_tokens_per_second": 718.765 }, { "epoch": 0.1354561536517564, "grad_norm": 1.8830527067184448, "learning_rate": 1.870379746835443e-05, "loss": 0.10407204926013947, "num_input_tokens_seen": 251986, "step": 134, "train_runtime": 350.1121, "train_tokens_per_second": 719.729 }, { "epoch": 0.13646702047005307, "grad_norm": 2.082061529159546, "learning_rate": 1.8693670886075953e-05, "loss": 0.12073522061109543, "num_input_tokens_seen": 253914, "step": 135, "train_runtime": 352.3735, "train_tokens_per_second": 720.582 }, { "epoch": 0.13747788728834975, "grad_norm": 1.9986214637756348, "learning_rate": 1.868354430379747e-05, "loss": 0.10742796212434769, "num_input_tokens_seen": 255648, "step": 136, "train_runtime": 354.5771, "train_tokens_per_second": 720.994 }, { "epoch": 0.13848875410664646, "grad_norm": 1.891079068183899, "learning_rate": 1.8673417721518988e-05, "loss": 0.0955931767821312, "num_input_tokens_seen": 257298, "step": 137, "train_runtime": 356.6809, "train_tokens_per_second": 721.368 }, { "epoch": 0.13949962092494314, "grad_norm": 1.8957778215408325, "learning_rate": 1.8663291139240507e-05, "loss": 0.13465729355812073, "num_input_tokens_seen": 258954, "step": 138, "train_runtime": 358.8164, "train_tokens_per_second": 721.689 }, { "epoch": 0.14051048774323982, "grad_norm": 1.7684844732284546, "learning_rate": 1.8653164556962026e-05, "loss": 0.09110158681869507, "num_input_tokens_seen": 260652, "step": 139, "train_runtime": 360.9554, "train_tokens_per_second": 722.117 }, { "epoch": 0.14152135456153653, "grad_norm": 1.9227099418640137, "learning_rate": 1.8643037974683545e-05, "loss": 0.1080639511346817, "num_input_tokens_seen": 262534, "step": 140, "train_runtime": 363.1569, "train_tokens_per_second": 722.922 }, { "epoch": 0.1425322213798332, "grad_norm": 2.15092396736145, "learning_rate": 1.8632911392405064e-05, "loss": 0.09261924773454666, "num_input_tokens_seen": 264060, "step": 141, "train_runtime": 365.298, "train_tokens_per_second": 722.862 }, { "epoch": 0.1435430881981299, "grad_norm": 1.72467839717865, "learning_rate": 1.8622784810126584e-05, "loss": 0.08849076926708221, "num_input_tokens_seen": 265636, "step": 142, "train_runtime": 367.4008, "train_tokens_per_second": 723.014 }, { "epoch": 0.1445539550164266, "grad_norm": 2.267878532409668, "learning_rate": 1.8612658227848103e-05, "loss": 0.14270317554473877, "num_input_tokens_seen": 267074, "step": 143, "train_runtime": 369.471, "train_tokens_per_second": 722.855 }, { "epoch": 0.14556482183472327, "grad_norm": 1.9942142963409424, "learning_rate": 1.8602531645569622e-05, "loss": 0.10361195355653763, "num_input_tokens_seen": 269338, "step": 144, "train_runtime": 371.722, "train_tokens_per_second": 724.568 }, { "epoch": 0.14657568865301995, "grad_norm": 2.2510604858398438, "learning_rate": 1.859240506329114e-05, "loss": 0.12056334316730499, "num_input_tokens_seen": 271342, "step": 145, "train_runtime": 374.0016, "train_tokens_per_second": 725.51 }, { "epoch": 0.14758655547131666, "grad_norm": 2.6158652305603027, "learning_rate": 1.858227848101266e-05, "loss": 0.09602270275354385, "num_input_tokens_seen": 273232, "step": 146, "train_runtime": 376.2174, "train_tokens_per_second": 726.261 }, { "epoch": 0.14859742228961334, "grad_norm": 1.971649169921875, "learning_rate": 1.857215189873418e-05, "loss": 0.10333852469921112, "num_input_tokens_seen": 275106, "step": 147, "train_runtime": 378.462, "train_tokens_per_second": 726.905 }, { "epoch": 0.14960828910791002, "grad_norm": 1.993793249130249, "learning_rate": 1.8562025316455698e-05, "loss": 0.1353556513786316, "num_input_tokens_seen": 276940, "step": 148, "train_runtime": 380.6533, "train_tokens_per_second": 727.539 }, { "epoch": 0.15061915592620673, "grad_norm": 2.2878053188323975, "learning_rate": 1.8551898734177217e-05, "loss": 0.12384504079818726, "num_input_tokens_seen": 278862, "step": 149, "train_runtime": 382.9396, "train_tokens_per_second": 728.214 }, { "epoch": 0.1516300227445034, "grad_norm": 2.2018866539001465, "learning_rate": 1.8541772151898736e-05, "loss": 0.13707488775253296, "num_input_tokens_seen": 280454, "step": 150, "train_runtime": 385.055, "train_tokens_per_second": 728.348 }, { "epoch": 0.15264088956280011, "grad_norm": 2.000457763671875, "learning_rate": 1.8531645569620255e-05, "loss": 0.1024542897939682, "num_input_tokens_seen": 282348, "step": 151, "train_runtime": 393.534, "train_tokens_per_second": 717.468 }, { "epoch": 0.1536517563810968, "grad_norm": 1.7988492250442505, "learning_rate": 1.8521518987341774e-05, "loss": 0.09222530573606491, "num_input_tokens_seen": 284070, "step": 152, "train_runtime": 395.7276, "train_tokens_per_second": 717.842 }, { "epoch": 0.15466262319939347, "grad_norm": 2.2877094745635986, "learning_rate": 1.8511392405063293e-05, "loss": 0.145292267203331, "num_input_tokens_seen": 285946, "step": 153, "train_runtime": 397.9166, "train_tokens_per_second": 718.608 }, { "epoch": 0.15567349001769018, "grad_norm": 1.8731293678283691, "learning_rate": 1.850126582278481e-05, "loss": 0.12294542789459229, "num_input_tokens_seen": 287824, "step": 154, "train_runtime": 400.1086, "train_tokens_per_second": 719.365 }, { "epoch": 0.15668435683598686, "grad_norm": 1.6725560426712036, "learning_rate": 1.849113924050633e-05, "loss": 0.11795242875814438, "num_input_tokens_seen": 290194, "step": 155, "train_runtime": 402.4241, "train_tokens_per_second": 721.115 }, { "epoch": 0.15769522365428354, "grad_norm": 1.795425534248352, "learning_rate": 1.848101265822785e-05, "loss": 0.11238373816013336, "num_input_tokens_seen": 292346, "step": 156, "train_runtime": 404.6764, "train_tokens_per_second": 722.419 }, { "epoch": 0.15870609047258025, "grad_norm": 1.83493971824646, "learning_rate": 1.8470886075949366e-05, "loss": 0.13390424847602844, "num_input_tokens_seen": 294520, "step": 157, "train_runtime": 406.9315, "train_tokens_per_second": 723.758 }, { "epoch": 0.15971695729087693, "grad_norm": 2.047924041748047, "learning_rate": 1.846075949367089e-05, "loss": 0.12073490023612976, "num_input_tokens_seen": 296632, "step": 158, "train_runtime": 409.2316, "train_tokens_per_second": 724.851 }, { "epoch": 0.1607278241091736, "grad_norm": 1.8737225532531738, "learning_rate": 1.8450632911392408e-05, "loss": 0.10665791481733322, "num_input_tokens_seen": 298670, "step": 159, "train_runtime": 411.5096, "train_tokens_per_second": 725.791 }, { "epoch": 0.1617386909274703, "grad_norm": 2.387766122817993, "learning_rate": 1.8440506329113924e-05, "loss": 0.13044655323028564, "num_input_tokens_seen": 300156, "step": 160, "train_runtime": 413.6019, "train_tokens_per_second": 725.712 }, { "epoch": 0.162749557745767, "grad_norm": 1.9572023153305054, "learning_rate": 1.8430379746835446e-05, "loss": 0.1392357498407364, "num_input_tokens_seen": 301862, "step": 161, "train_runtime": 415.7351, "train_tokens_per_second": 726.092 }, { "epoch": 0.16376042456406367, "grad_norm": 1.8741393089294434, "learning_rate": 1.8420253164556962e-05, "loss": 0.10934767872095108, "num_input_tokens_seen": 303282, "step": 162, "train_runtime": 417.8117, "train_tokens_per_second": 725.882 }, { "epoch": 0.16477129138236038, "grad_norm": 1.9068574905395508, "learning_rate": 1.841012658227848e-05, "loss": 0.11664220690727234, "num_input_tokens_seen": 304986, "step": 163, "train_runtime": 419.9562, "train_tokens_per_second": 726.233 }, { "epoch": 0.16578215820065706, "grad_norm": 2.239553213119507, "learning_rate": 1.8400000000000003e-05, "loss": 0.10898025333881378, "num_input_tokens_seen": 306760, "step": 164, "train_runtime": 422.106, "train_tokens_per_second": 726.737 }, { "epoch": 0.16679302501895377, "grad_norm": 2.0420379638671875, "learning_rate": 1.838987341772152e-05, "loss": 0.12377582490444183, "num_input_tokens_seen": 308746, "step": 165, "train_runtime": 424.3356, "train_tokens_per_second": 727.599 }, { "epoch": 0.16780389183725045, "grad_norm": 2.119110345840454, "learning_rate": 1.8379746835443038e-05, "loss": 0.12563012540340424, "num_input_tokens_seen": 310382, "step": 166, "train_runtime": 426.5045, "train_tokens_per_second": 727.734 }, { "epoch": 0.16881475865554713, "grad_norm": 2.29335355758667, "learning_rate": 1.836962025316456e-05, "loss": 0.14566722512245178, "num_input_tokens_seen": 312192, "step": 167, "train_runtime": 428.7343, "train_tokens_per_second": 728.171 }, { "epoch": 0.16982562547384383, "grad_norm": 2.2466704845428467, "learning_rate": 1.8359493670886076e-05, "loss": 0.12062112987041473, "num_input_tokens_seen": 313830, "step": 168, "train_runtime": 431.0223, "train_tokens_per_second": 728.106 }, { "epoch": 0.1708364922921405, "grad_norm": 1.407857894897461, "learning_rate": 1.8349367088607595e-05, "loss": 0.08882243931293488, "num_input_tokens_seen": 316264, "step": 169, "train_runtime": 433.3712, "train_tokens_per_second": 729.776 }, { "epoch": 0.1718473591104372, "grad_norm": 1.7413135766983032, "learning_rate": 1.8339240506329115e-05, "loss": 0.1120813861489296, "num_input_tokens_seen": 318554, "step": 170, "train_runtime": 435.6513, "train_tokens_per_second": 731.213 }, { "epoch": 0.1728582259287339, "grad_norm": 2.6182568073272705, "learning_rate": 1.8329113924050634e-05, "loss": 0.13866037130355835, "num_input_tokens_seen": 320016, "step": 171, "train_runtime": 437.7569, "train_tokens_per_second": 731.036 }, { "epoch": 0.17386909274703058, "grad_norm": 1.7372453212738037, "learning_rate": 1.8318987341772153e-05, "loss": 0.1048712432384491, "num_input_tokens_seen": 321488, "step": 172, "train_runtime": 439.8334, "train_tokens_per_second": 730.931 }, { "epoch": 0.17487995956532726, "grad_norm": 1.8864858150482178, "learning_rate": 1.8308860759493672e-05, "loss": 0.12409922480583191, "num_input_tokens_seen": 323296, "step": 173, "train_runtime": 442.0048, "train_tokens_per_second": 731.431 }, { "epoch": 0.17589082638362397, "grad_norm": 2.2926132678985596, "learning_rate": 1.829873417721519e-05, "loss": 0.1726934313774109, "num_input_tokens_seen": 325238, "step": 174, "train_runtime": 444.2036, "train_tokens_per_second": 732.182 }, { "epoch": 0.17690169320192065, "grad_norm": 1.8553584814071655, "learning_rate": 1.828860759493671e-05, "loss": 0.11418695002794266, "num_input_tokens_seen": 327534, "step": 175, "train_runtime": 446.4571, "train_tokens_per_second": 733.629 }, { "epoch": 0.17791256002021733, "grad_norm": 1.7055572271347046, "learning_rate": 1.827848101265823e-05, "loss": 0.11833525449037552, "num_input_tokens_seen": 329454, "step": 176, "train_runtime": 448.6672, "train_tokens_per_second": 734.295 }, { "epoch": 0.17892342683851403, "grad_norm": 2.196890115737915, "learning_rate": 1.8268354430379748e-05, "loss": 0.12118027359247208, "num_input_tokens_seen": 331260, "step": 177, "train_runtime": 450.8396, "train_tokens_per_second": 734.762 }, { "epoch": 0.1799342936568107, "grad_norm": 2.3438303470611572, "learning_rate": 1.8258227848101267e-05, "loss": 0.1293737292289734, "num_input_tokens_seen": 333080, "step": 178, "train_runtime": 453.0017, "train_tokens_per_second": 735.273 }, { "epoch": 0.1809451604751074, "grad_norm": 2.1183717250823975, "learning_rate": 1.8248101265822786e-05, "loss": 0.10332482308149338, "num_input_tokens_seen": 334598, "step": 179, "train_runtime": 455.1101, "train_tokens_per_second": 735.202 }, { "epoch": 0.1819560272934041, "grad_norm": 1.9094011783599854, "learning_rate": 1.8237974683544305e-05, "loss": 0.08359847217798233, "num_input_tokens_seen": 336020, "step": 180, "train_runtime": 457.1868, "train_tokens_per_second": 734.973 }, { "epoch": 0.18296689411170078, "grad_norm": 2.663269281387329, "learning_rate": 1.8227848101265824e-05, "loss": 0.16630926728248596, "num_input_tokens_seen": 337744, "step": 181, "train_runtime": 465.7958, "train_tokens_per_second": 725.09 }, { "epoch": 0.18397776092999749, "grad_norm": 1.7838853597640991, "learning_rate": 1.8217721518987344e-05, "loss": 0.07612158358097076, "num_input_tokens_seen": 339166, "step": 182, "train_runtime": 467.9651, "train_tokens_per_second": 724.768 }, { "epoch": 0.18498862774829417, "grad_norm": 1.6300352811813354, "learning_rate": 1.8207594936708863e-05, "loss": 0.09971845149993896, "num_input_tokens_seen": 341148, "step": 183, "train_runtime": 470.2221, "train_tokens_per_second": 725.504 }, { "epoch": 0.18599949456659085, "grad_norm": 1.958196759223938, "learning_rate": 1.8197468354430382e-05, "loss": 0.1093597486615181, "num_input_tokens_seen": 342926, "step": 184, "train_runtime": 472.4691, "train_tokens_per_second": 725.817 }, { "epoch": 0.18701036138488755, "grad_norm": 1.9625788927078247, "learning_rate": 1.81873417721519e-05, "loss": 0.11427070200443268, "num_input_tokens_seen": 344884, "step": 185, "train_runtime": 474.6876, "train_tokens_per_second": 726.549 }, { "epoch": 0.18802122820318423, "grad_norm": 1.9605315923690796, "learning_rate": 1.817721518987342e-05, "loss": 0.1473732888698578, "num_input_tokens_seen": 346828, "step": 186, "train_runtime": 476.9824, "train_tokens_per_second": 727.129 }, { "epoch": 0.1890320950214809, "grad_norm": 1.6448954343795776, "learning_rate": 1.816708860759494e-05, "loss": 0.08606156706809998, "num_input_tokens_seen": 348858, "step": 187, "train_runtime": 479.2114, "train_tokens_per_second": 727.983 }, { "epoch": 0.19004296183977762, "grad_norm": 2.2308266162872314, "learning_rate": 1.8156962025316458e-05, "loss": 0.14672282338142395, "num_input_tokens_seen": 350544, "step": 188, "train_runtime": 481.3553, "train_tokens_per_second": 728.244 }, { "epoch": 0.1910538286580743, "grad_norm": 2.008155584335327, "learning_rate": 1.8146835443037977e-05, "loss": 0.13131436705589294, "num_input_tokens_seen": 352694, "step": 189, "train_runtime": 483.6153, "train_tokens_per_second": 729.286 }, { "epoch": 0.19206469547637098, "grad_norm": 1.6257904767990112, "learning_rate": 1.8136708860759496e-05, "loss": 0.11618009209632874, "num_input_tokens_seen": 354786, "step": 190, "train_runtime": 485.8682, "train_tokens_per_second": 730.21 }, { "epoch": 0.19307556229466769, "grad_norm": 2.078596830368042, "learning_rate": 1.8126582278481012e-05, "loss": 0.14265677332878113, "num_input_tokens_seen": 356610, "step": 191, "train_runtime": 488.0785, "train_tokens_per_second": 730.641 }, { "epoch": 0.19408642911296436, "grad_norm": 2.4707674980163574, "learning_rate": 1.8116455696202534e-05, "loss": 0.16185879707336426, "num_input_tokens_seen": 358904, "step": 192, "train_runtime": 490.3884, "train_tokens_per_second": 731.877 }, { "epoch": 0.19509729593126104, "grad_norm": 2.3911948204040527, "learning_rate": 1.8106329113924053e-05, "loss": 0.14641645550727844, "num_input_tokens_seen": 360522, "step": 193, "train_runtime": 492.5371, "train_tokens_per_second": 731.969 }, { "epoch": 0.19610816274955775, "grad_norm": 2.293113946914673, "learning_rate": 1.809620253164557e-05, "loss": 0.11854423582553864, "num_input_tokens_seen": 362594, "step": 194, "train_runtime": 494.7953, "train_tokens_per_second": 732.816 }, { "epoch": 0.19711902956785443, "grad_norm": 2.041398286819458, "learning_rate": 1.808607594936709e-05, "loss": 0.08841122686862946, "num_input_tokens_seen": 364210, "step": 195, "train_runtime": 496.965, "train_tokens_per_second": 732.868 }, { "epoch": 0.1981298963861511, "grad_norm": 1.735707402229309, "learning_rate": 1.807594936708861e-05, "loss": 0.10502967983484268, "num_input_tokens_seen": 366304, "step": 196, "train_runtime": 499.1902, "train_tokens_per_second": 733.796 }, { "epoch": 0.19914076320444782, "grad_norm": 1.6637848615646362, "learning_rate": 1.8065822784810126e-05, "loss": 0.10303906351327896, "num_input_tokens_seen": 368402, "step": 197, "train_runtime": 501.48, "train_tokens_per_second": 734.629 }, { "epoch": 0.2001516300227445, "grad_norm": 2.36517071723938, "learning_rate": 1.805569620253165e-05, "loss": 0.1280064731836319, "num_input_tokens_seen": 370366, "step": 198, "train_runtime": 503.6868, "train_tokens_per_second": 735.31 }, { "epoch": 0.2001516300227445, "eval_loss": 0.44587889313697815, "eval_runtime": 62.2769, "eval_samples_per_second": 14.114, "eval_steps_per_second": 7.065, "num_input_tokens_seen": 370366, "step": 198 }, { "epoch": 0.2011624968410412, "grad_norm": 2.617011547088623, "learning_rate": 1.8045569620253165e-05, "loss": 0.1196804791688919, "num_input_tokens_seen": 371792, "step": 199, "train_runtime": 569.0247, "train_tokens_per_second": 653.385 }, { "epoch": 0.20217336365933788, "grad_norm": 1.9300251007080078, "learning_rate": 1.8035443037974684e-05, "loss": 0.10957969725131989, "num_input_tokens_seen": 373630, "step": 200, "train_runtime": 571.262, "train_tokens_per_second": 654.043 }, { "epoch": 0.20318423047763456, "grad_norm": 2.0042214393615723, "learning_rate": 1.8025316455696206e-05, "loss": 0.09827364236116409, "num_input_tokens_seen": 375662, "step": 201, "train_runtime": 573.5096, "train_tokens_per_second": 655.023 }, { "epoch": 0.20419509729593127, "grad_norm": 2.0204923152923584, "learning_rate": 1.8015189873417722e-05, "loss": 0.09973488748073578, "num_input_tokens_seen": 377436, "step": 202, "train_runtime": 575.6869, "train_tokens_per_second": 655.627 }, { "epoch": 0.20520596411422795, "grad_norm": 2.118560791015625, "learning_rate": 1.800506329113924e-05, "loss": 0.13264839351177216, "num_input_tokens_seen": 379004, "step": 203, "train_runtime": 577.8081, "train_tokens_per_second": 655.934 }, { "epoch": 0.20621683093252463, "grad_norm": 2.4744246006011963, "learning_rate": 1.7994936708860763e-05, "loss": 0.12377555668354034, "num_input_tokens_seen": 380828, "step": 204, "train_runtime": 580.0246, "train_tokens_per_second": 656.572 }, { "epoch": 0.20722769775082134, "grad_norm": 1.9765815734863281, "learning_rate": 1.798481012658228e-05, "loss": 0.09765441715717316, "num_input_tokens_seen": 382788, "step": 205, "train_runtime": 582.2576, "train_tokens_per_second": 657.42 }, { "epoch": 0.20823856456911802, "grad_norm": 2.1058332920074463, "learning_rate": 1.7974683544303798e-05, "loss": 0.11945100128650665, "num_input_tokens_seen": 384470, "step": 206, "train_runtime": 584.4355, "train_tokens_per_second": 657.848 }, { "epoch": 0.2092494313874147, "grad_norm": 1.6983367204666138, "learning_rate": 1.7964556962025317e-05, "loss": 0.09330539405345917, "num_input_tokens_seen": 386452, "step": 207, "train_runtime": 586.6725, "train_tokens_per_second": 658.718 }, { "epoch": 0.2102602982057114, "grad_norm": 1.8551362752914429, "learning_rate": 1.7954430379746836e-05, "loss": 0.11788757890462875, "num_input_tokens_seen": 388504, "step": 208, "train_runtime": 588.9246, "train_tokens_per_second": 659.684 }, { "epoch": 0.21127116502400808, "grad_norm": 2.1599807739257812, "learning_rate": 1.7944303797468355e-05, "loss": 0.1124764159321785, "num_input_tokens_seen": 390166, "step": 209, "train_runtime": 591.0736, "train_tokens_per_second": 660.097 }, { "epoch": 0.21228203184230476, "grad_norm": 1.961949348449707, "learning_rate": 1.7934177215189875e-05, "loss": 0.10842674970626831, "num_input_tokens_seen": 391552, "step": 210, "train_runtime": 593.1879, "train_tokens_per_second": 660.081 }, { "epoch": 0.21329289866060147, "grad_norm": 1.7553244829177856, "learning_rate": 1.7924050632911394e-05, "loss": 0.12177146971225739, "num_input_tokens_seen": 393310, "step": 211, "train_runtime": 601.6506, "train_tokens_per_second": 653.718 }, { "epoch": 0.21430376547889815, "grad_norm": 1.8308024406433105, "learning_rate": 1.7913924050632913e-05, "loss": 0.1084492951631546, "num_input_tokens_seen": 395432, "step": 212, "train_runtime": 603.882, "train_tokens_per_second": 654.817 }, { "epoch": 0.21531463229719486, "grad_norm": 1.9430619478225708, "learning_rate": 1.7903797468354432e-05, "loss": 0.09723185002803802, "num_input_tokens_seen": 397112, "step": 213, "train_runtime": 606.0291, "train_tokens_per_second": 655.269 }, { "epoch": 0.21632549911549154, "grad_norm": 1.5587821006774902, "learning_rate": 1.789367088607595e-05, "loss": 0.08421872556209564, "num_input_tokens_seen": 399078, "step": 214, "train_runtime": 608.224, "train_tokens_per_second": 656.137 }, { "epoch": 0.21733636593378822, "grad_norm": 1.7721914052963257, "learning_rate": 1.788354430379747e-05, "loss": 0.10960154235363007, "num_input_tokens_seen": 401186, "step": 215, "train_runtime": 610.4651, "train_tokens_per_second": 657.181 }, { "epoch": 0.21834723275208492, "grad_norm": 2.3418967723846436, "learning_rate": 1.787341772151899e-05, "loss": 0.1320759654045105, "num_input_tokens_seen": 402874, "step": 216, "train_runtime": 612.6218, "train_tokens_per_second": 657.623 }, { "epoch": 0.2193580995703816, "grad_norm": 1.7354557514190674, "learning_rate": 1.7863291139240508e-05, "loss": 0.09888164699077606, "num_input_tokens_seen": 404962, "step": 217, "train_runtime": 614.8703, "train_tokens_per_second": 658.614 }, { "epoch": 0.22036896638867828, "grad_norm": 1.5967291593551636, "learning_rate": 1.7853164556962027e-05, "loss": 0.10974611341953278, "num_input_tokens_seen": 407460, "step": 218, "train_runtime": 617.2313, "train_tokens_per_second": 660.142 }, { "epoch": 0.221379833206975, "grad_norm": 1.9726117849349976, "learning_rate": 1.7843037974683546e-05, "loss": 0.12994709610939026, "num_input_tokens_seen": 409224, "step": 219, "train_runtime": 619.385, "train_tokens_per_second": 660.694 }, { "epoch": 0.22239070002527167, "grad_norm": 1.8002862930297852, "learning_rate": 1.7832911392405065e-05, "loss": 0.0879456102848053, "num_input_tokens_seen": 411000, "step": 220, "train_runtime": 621.5693, "train_tokens_per_second": 661.23 }, { "epoch": 0.22340156684356835, "grad_norm": 2.091977596282959, "learning_rate": 1.7822784810126584e-05, "loss": 0.13014501333236694, "num_input_tokens_seen": 412552, "step": 221, "train_runtime": 623.7077, "train_tokens_per_second": 661.451 }, { "epoch": 0.22441243366186506, "grad_norm": 2.036530017852783, "learning_rate": 1.7812658227848104e-05, "loss": 0.0972268208861351, "num_input_tokens_seen": 414648, "step": 222, "train_runtime": 625.9457, "train_tokens_per_second": 662.434 }, { "epoch": 0.22542330048016174, "grad_norm": 1.4234565496444702, "learning_rate": 1.780253164556962e-05, "loss": 0.09172986447811127, "num_input_tokens_seen": 416936, "step": 223, "train_runtime": 628.2903, "train_tokens_per_second": 663.604 }, { "epoch": 0.22643416729845842, "grad_norm": 1.8967690467834473, "learning_rate": 1.779240506329114e-05, "loss": 0.1082121804356575, "num_input_tokens_seen": 418750, "step": 224, "train_runtime": 630.4816, "train_tokens_per_second": 664.175 }, { "epoch": 0.22744503411675512, "grad_norm": 1.5741974115371704, "learning_rate": 1.778227848101266e-05, "loss": 0.10154334455728531, "num_input_tokens_seen": 420940, "step": 225, "train_runtime": 632.7984, "train_tokens_per_second": 665.204 }, { "epoch": 0.2284559009350518, "grad_norm": 2.162623643875122, "learning_rate": 1.7772151898734176e-05, "loss": 0.10570146888494492, "num_input_tokens_seen": 422712, "step": 226, "train_runtime": 634.9789, "train_tokens_per_second": 665.71 }, { "epoch": 0.22946676775334848, "grad_norm": 1.799513339996338, "learning_rate": 1.77620253164557e-05, "loss": 0.11576129496097565, "num_input_tokens_seen": 424832, "step": 227, "train_runtime": 637.2459, "train_tokens_per_second": 666.669 }, { "epoch": 0.2304776345716452, "grad_norm": 2.410942792892456, "learning_rate": 1.7751898734177218e-05, "loss": 0.13010409474372864, "num_input_tokens_seen": 426646, "step": 228, "train_runtime": 639.4501, "train_tokens_per_second": 667.208 }, { "epoch": 0.23148850138994187, "grad_norm": 1.8130074739456177, "learning_rate": 1.7741772151898734e-05, "loss": 0.12471440434455872, "num_input_tokens_seen": 428700, "step": 229, "train_runtime": 641.6914, "train_tokens_per_second": 668.078 }, { "epoch": 0.23249936820823858, "grad_norm": 2.150529384613037, "learning_rate": 1.7731645569620256e-05, "loss": 0.14512759447097778, "num_input_tokens_seen": 430232, "step": 230, "train_runtime": 643.8152, "train_tokens_per_second": 668.254 }, { "epoch": 0.23351023502653526, "grad_norm": 1.7570277452468872, "learning_rate": 1.7721518987341772e-05, "loss": 0.10100769251585007, "num_input_tokens_seen": 431962, "step": 231, "train_runtime": 645.9925, "train_tokens_per_second": 668.68 }, { "epoch": 0.23452110184483194, "grad_norm": 1.8429783582687378, "learning_rate": 1.771139240506329e-05, "loss": 0.12079241871833801, "num_input_tokens_seen": 434320, "step": 232, "train_runtime": 648.288, "train_tokens_per_second": 669.949 }, { "epoch": 0.23553196866312864, "grad_norm": 1.4480996131896973, "learning_rate": 1.7701265822784813e-05, "loss": 0.08419619500637054, "num_input_tokens_seen": 436184, "step": 233, "train_runtime": 650.4646, "train_tokens_per_second": 670.573 }, { "epoch": 0.23654283548142532, "grad_norm": 2.275111436843872, "learning_rate": 1.769113924050633e-05, "loss": 0.15849897265434265, "num_input_tokens_seen": 438052, "step": 234, "train_runtime": 652.6707, "train_tokens_per_second": 671.168 }, { "epoch": 0.237553702299722, "grad_norm": 1.7819358110427856, "learning_rate": 1.7681012658227848e-05, "loss": 0.12310174107551575, "num_input_tokens_seen": 440310, "step": 235, "train_runtime": 654.9677, "train_tokens_per_second": 672.262 }, { "epoch": 0.2385645691180187, "grad_norm": 2.355914354324341, "learning_rate": 1.767088607594937e-05, "loss": 0.1537615805864334, "num_input_tokens_seen": 442282, "step": 236, "train_runtime": 657.2043, "train_tokens_per_second": 672.975 }, { "epoch": 0.2395754359363154, "grad_norm": 2.181678056716919, "learning_rate": 1.7660759493670886e-05, "loss": 0.16061922907829285, "num_input_tokens_seen": 444134, "step": 237, "train_runtime": 659.4017, "train_tokens_per_second": 673.541 }, { "epoch": 0.24058630275461207, "grad_norm": 2.0904757976531982, "learning_rate": 1.7650632911392405e-05, "loss": 0.11011753976345062, "num_input_tokens_seen": 445702, "step": 238, "train_runtime": 661.5091, "train_tokens_per_second": 673.765 }, { "epoch": 0.24159716957290878, "grad_norm": 1.9311637878417969, "learning_rate": 1.7640506329113925e-05, "loss": 0.14344699680805206, "num_input_tokens_seen": 447646, "step": 239, "train_runtime": 663.7396, "train_tokens_per_second": 674.43 }, { "epoch": 0.24260803639120546, "grad_norm": 2.2915382385253906, "learning_rate": 1.7630379746835444e-05, "loss": 0.10493789613246918, "num_input_tokens_seen": 448988, "step": 240, "train_runtime": 665.8128, "train_tokens_per_second": 674.346 }, { "epoch": 0.24361890320950214, "grad_norm": 2.1953468322753906, "learning_rate": 1.7620253164556963e-05, "loss": 0.10852991789579391, "num_input_tokens_seen": 450462, "step": 241, "train_runtime": 674.1803, "train_tokens_per_second": 668.163 }, { "epoch": 0.24462977002779884, "grad_norm": 2.380145788192749, "learning_rate": 1.7610126582278482e-05, "loss": 0.10469101369380951, "num_input_tokens_seen": 451978, "step": 242, "train_runtime": 676.2928, "train_tokens_per_second": 668.317 }, { "epoch": 0.24564063684609552, "grad_norm": 2.1115336418151855, "learning_rate": 1.76e-05, "loss": 0.09177637100219727, "num_input_tokens_seen": 453610, "step": 243, "train_runtime": 678.4436, "train_tokens_per_second": 668.604 }, { "epoch": 0.24665150366439223, "grad_norm": 1.653169870376587, "learning_rate": 1.758987341772152e-05, "loss": 0.11477974057197571, "num_input_tokens_seen": 455582, "step": 244, "train_runtime": 680.6526, "train_tokens_per_second": 669.331 }, { "epoch": 0.2476623704826889, "grad_norm": 1.7820411920547485, "learning_rate": 1.757974683544304e-05, "loss": 0.07974696159362793, "num_input_tokens_seen": 457100, "step": 245, "train_runtime": 682.7487, "train_tokens_per_second": 669.5 }, { "epoch": 0.2486732373009856, "grad_norm": 1.890511155128479, "learning_rate": 1.7569620253164558e-05, "loss": 0.12120610475540161, "num_input_tokens_seen": 459110, "step": 246, "train_runtime": 684.9928, "train_tokens_per_second": 670.241 }, { "epoch": 0.2496841041192823, "grad_norm": 2.860581159591675, "learning_rate": 1.7559493670886077e-05, "loss": 0.15575653314590454, "num_input_tokens_seen": 460896, "step": 247, "train_runtime": 687.2072, "train_tokens_per_second": 670.68 }, { "epoch": 0.250694970937579, "grad_norm": 1.8721354007720947, "learning_rate": 1.7549367088607596e-05, "loss": 0.09407229721546173, "num_input_tokens_seen": 462456, "step": 248, "train_runtime": 689.3281, "train_tokens_per_second": 670.879 }, { "epoch": 0.2517058377558757, "grad_norm": 1.8691226243972778, "learning_rate": 1.7539240506329115e-05, "loss": 0.09890297055244446, "num_input_tokens_seen": 464000, "step": 249, "train_runtime": 691.4529, "train_tokens_per_second": 671.051 }, { "epoch": 0.25271670457417234, "grad_norm": 1.9749469757080078, "learning_rate": 1.7529113924050634e-05, "loss": 0.09291301667690277, "num_input_tokens_seen": 465810, "step": 250, "train_runtime": 693.6414, "train_tokens_per_second": 671.543 }, { "epoch": 0.25372757139246904, "grad_norm": 2.137969732284546, "learning_rate": 1.7518987341772154e-05, "loss": 0.12524446845054626, "num_input_tokens_seen": 468190, "step": 251, "train_runtime": 696.0274, "train_tokens_per_second": 672.66 }, { "epoch": 0.25473843821076575, "grad_norm": 1.6700412034988403, "learning_rate": 1.7508860759493673e-05, "loss": 0.09336793422698975, "num_input_tokens_seen": 470162, "step": 252, "train_runtime": 698.3222, "train_tokens_per_second": 673.274 }, { "epoch": 0.2557493050290624, "grad_norm": 2.4621388912200928, "learning_rate": 1.7498734177215192e-05, "loss": 0.14584292471408844, "num_input_tokens_seen": 472040, "step": 253, "train_runtime": 700.6228, "train_tokens_per_second": 673.743 }, { "epoch": 0.2567601718473591, "grad_norm": 2.0203704833984375, "learning_rate": 1.748860759493671e-05, "loss": 0.11945211887359619, "num_input_tokens_seen": 474150, "step": 254, "train_runtime": 702.8545, "train_tokens_per_second": 674.606 }, { "epoch": 0.2577710386656558, "grad_norm": 1.7765873670578003, "learning_rate": 1.747848101265823e-05, "loss": 0.0990256667137146, "num_input_tokens_seen": 476552, "step": 255, "train_runtime": 705.1809, "train_tokens_per_second": 675.787 }, { "epoch": 0.25878190548395247, "grad_norm": 2.020219087600708, "learning_rate": 1.746835443037975e-05, "loss": 0.11051210016012192, "num_input_tokens_seen": 478316, "step": 256, "train_runtime": 707.3766, "train_tokens_per_second": 676.183 }, { "epoch": 0.2597927723022492, "grad_norm": 1.8801995515823364, "learning_rate": 1.7458227848101268e-05, "loss": 0.12179265916347504, "num_input_tokens_seen": 480664, "step": 257, "train_runtime": 709.6671, "train_tokens_per_second": 677.309 }, { "epoch": 0.2608036391205459, "grad_norm": 2.045766592025757, "learning_rate": 1.7448101265822787e-05, "loss": 0.10970637202262878, "num_input_tokens_seen": 482522, "step": 258, "train_runtime": 711.8696, "train_tokens_per_second": 677.824 }, { "epoch": 0.26181450593884253, "grad_norm": 1.6100939512252808, "learning_rate": 1.7437974683544306e-05, "loss": 0.13290613889694214, "num_input_tokens_seen": 484608, "step": 259, "train_runtime": 714.1242, "train_tokens_per_second": 678.605 }, { "epoch": 0.26282537275713924, "grad_norm": 1.9544614553451538, "learning_rate": 1.7427848101265825e-05, "loss": 0.12113123387098312, "num_input_tokens_seen": 486676, "step": 260, "train_runtime": 716.3455, "train_tokens_per_second": 679.387 }, { "epoch": 0.26383623957543595, "grad_norm": 2.5813403129577637, "learning_rate": 1.7417721518987344e-05, "loss": 0.1483939290046692, "num_input_tokens_seen": 488252, "step": 261, "train_runtime": 718.4497, "train_tokens_per_second": 679.591 }, { "epoch": 0.2648471063937326, "grad_norm": 1.8588289022445679, "learning_rate": 1.7407594936708863e-05, "loss": 0.13005565106868744, "num_input_tokens_seen": 490056, "step": 262, "train_runtime": 720.6284, "train_tokens_per_second": 680.04 }, { "epoch": 0.2658579732120293, "grad_norm": 2.1340038776397705, "learning_rate": 1.739746835443038e-05, "loss": 0.14259295165538788, "num_input_tokens_seen": 492050, "step": 263, "train_runtime": 722.9093, "train_tokens_per_second": 680.653 }, { "epoch": 0.266868840030326, "grad_norm": 1.7459964752197266, "learning_rate": 1.73873417721519e-05, "loss": 0.10176543891429901, "num_input_tokens_seen": 494088, "step": 264, "train_runtime": 725.2014, "train_tokens_per_second": 681.311 }, { "epoch": 0.26787970684862267, "grad_norm": 1.9116030931472778, "learning_rate": 1.737721518987342e-05, "loss": 0.14606161415576935, "num_input_tokens_seen": 496250, "step": 265, "train_runtime": 727.4671, "train_tokens_per_second": 682.161 }, { "epoch": 0.2688905736669194, "grad_norm": 1.8587530851364136, "learning_rate": 1.7367088607594936e-05, "loss": 0.1209803968667984, "num_input_tokens_seen": 498554, "step": 266, "train_runtime": 729.8733, "train_tokens_per_second": 683.069 }, { "epoch": 0.2699014404852161, "grad_norm": 2.1367876529693604, "learning_rate": 1.735696202531646e-05, "loss": 0.12396949529647827, "num_input_tokens_seen": 500336, "step": 267, "train_runtime": 732.0551, "train_tokens_per_second": 683.468 }, { "epoch": 0.2709123073035128, "grad_norm": 1.9846808910369873, "learning_rate": 1.7346835443037978e-05, "loss": 0.1330546736717224, "num_input_tokens_seen": 502388, "step": 268, "train_runtime": 734.2692, "train_tokens_per_second": 684.201 }, { "epoch": 0.27192317412180944, "grad_norm": 1.9799429178237915, "learning_rate": 1.7336708860759494e-05, "loss": 0.09931035339832306, "num_input_tokens_seen": 504016, "step": 269, "train_runtime": 736.4641, "train_tokens_per_second": 684.373 }, { "epoch": 0.27293404094010615, "grad_norm": 1.8704789876937866, "learning_rate": 1.7326582278481016e-05, "loss": 0.14354629814624786, "num_input_tokens_seen": 506228, "step": 270, "train_runtime": 738.8562, "train_tokens_per_second": 685.151 }, { "epoch": 0.27394490775840286, "grad_norm": 2.032816171646118, "learning_rate": 1.7316455696202532e-05, "loss": 0.09989900141954422, "num_input_tokens_seen": 507924, "step": 271, "train_runtime": 746.8839, "train_tokens_per_second": 680.058 }, { "epoch": 0.2749557745766995, "grad_norm": 1.7375068664550781, "learning_rate": 1.730632911392405e-05, "loss": 0.1109226867556572, "num_input_tokens_seen": 509700, "step": 272, "train_runtime": 749.0842, "train_tokens_per_second": 680.431 }, { "epoch": 0.2759666413949962, "grad_norm": 2.1660964488983154, "learning_rate": 1.729620253164557e-05, "loss": 0.11639153957366943, "num_input_tokens_seen": 511482, "step": 273, "train_runtime": 751.2666, "train_tokens_per_second": 680.826 }, { "epoch": 0.2769775082132929, "grad_norm": 1.8768203258514404, "learning_rate": 1.728607594936709e-05, "loss": 0.12145338207483292, "num_input_tokens_seen": 513976, "step": 274, "train_runtime": 753.6298, "train_tokens_per_second": 682.001 }, { "epoch": 0.2779883750315896, "grad_norm": 1.9955626726150513, "learning_rate": 1.7275949367088608e-05, "loss": 0.11777406185865402, "num_input_tokens_seen": 515382, "step": 275, "train_runtime": 755.7224, "train_tokens_per_second": 681.973 }, { "epoch": 0.2789992418498863, "grad_norm": 1.6571555137634277, "learning_rate": 1.7265822784810127e-05, "loss": 0.09360526502132416, "num_input_tokens_seen": 517038, "step": 276, "train_runtime": 757.9178, "train_tokens_per_second": 682.182 }, { "epoch": 0.280010108668183, "grad_norm": 1.8501170873641968, "learning_rate": 1.7255696202531646e-05, "loss": 0.12285037338733673, "num_input_tokens_seen": 519080, "step": 277, "train_runtime": 760.171, "train_tokens_per_second": 682.846 }, { "epoch": 0.28102097548647964, "grad_norm": 1.668231725692749, "learning_rate": 1.7245569620253165e-05, "loss": 0.12230192869901657, "num_input_tokens_seen": 520804, "step": 278, "train_runtime": 762.3715, "train_tokens_per_second": 683.137 }, { "epoch": 0.28203184230477635, "grad_norm": 1.6942402124404907, "learning_rate": 1.7235443037974685e-05, "loss": 0.1275428831577301, "num_input_tokens_seen": 523082, "step": 279, "train_runtime": 764.6501, "train_tokens_per_second": 684.08 }, { "epoch": 0.28304270912307306, "grad_norm": 1.873801827430725, "learning_rate": 1.7225316455696204e-05, "loss": 0.12711967527866364, "num_input_tokens_seen": 524988, "step": 280, "train_runtime": 766.8679, "train_tokens_per_second": 684.587 }, { "epoch": 0.2840535759413697, "grad_norm": 2.6262946128845215, "learning_rate": 1.7215189873417723e-05, "loss": 0.11261977255344391, "num_input_tokens_seen": 526770, "step": 281, "train_runtime": 769.0193, "train_tokens_per_second": 684.989 }, { "epoch": 0.2850644427596664, "grad_norm": 1.857487440109253, "learning_rate": 1.7205063291139242e-05, "loss": 0.10549350827932358, "num_input_tokens_seen": 528400, "step": 282, "train_runtime": 771.1449, "train_tokens_per_second": 685.215 }, { "epoch": 0.2860753095779631, "grad_norm": 1.779315710067749, "learning_rate": 1.719493670886076e-05, "loss": 0.09796726703643799, "num_input_tokens_seen": 530224, "step": 283, "train_runtime": 773.3346, "train_tokens_per_second": 685.633 }, { "epoch": 0.2870861763962598, "grad_norm": 1.9219661951065063, "learning_rate": 1.718481012658228e-05, "loss": 0.11788786947727203, "num_input_tokens_seen": 532286, "step": 284, "train_runtime": 775.5473, "train_tokens_per_second": 686.336 }, { "epoch": 0.2880970432145565, "grad_norm": 1.5746098756790161, "learning_rate": 1.71746835443038e-05, "loss": 0.08101858198642731, "num_input_tokens_seen": 534178, "step": 285, "train_runtime": 777.738, "train_tokens_per_second": 686.835 }, { "epoch": 0.2891079100328532, "grad_norm": 1.6413177251815796, "learning_rate": 1.7164556962025318e-05, "loss": 0.10468021035194397, "num_input_tokens_seen": 535870, "step": 286, "train_runtime": 779.8662, "train_tokens_per_second": 687.131 }, { "epoch": 0.29011877685114984, "grad_norm": 1.7688888311386108, "learning_rate": 1.7154430379746837e-05, "loss": 0.12281863391399384, "num_input_tokens_seen": 537938, "step": 287, "train_runtime": 782.0896, "train_tokens_per_second": 687.821 }, { "epoch": 0.29112964366944655, "grad_norm": 1.9296395778656006, "learning_rate": 1.7144303797468356e-05, "loss": 0.10115273296833038, "num_input_tokens_seen": 540342, "step": 288, "train_runtime": 784.4024, "train_tokens_per_second": 688.858 }, { "epoch": 0.29214051048774325, "grad_norm": 1.7572964429855347, "learning_rate": 1.7134177215189875e-05, "loss": 0.10689762234687805, "num_input_tokens_seen": 542224, "step": 289, "train_runtime": 786.6099, "train_tokens_per_second": 689.318 }, { "epoch": 0.2931513773060399, "grad_norm": 2.1670010089874268, "learning_rate": 1.7124050632911394e-05, "loss": 0.10287714004516602, "num_input_tokens_seen": 544196, "step": 290, "train_runtime": 788.8264, "train_tokens_per_second": 689.881 }, { "epoch": 0.2941622441243366, "grad_norm": 1.8853284120559692, "learning_rate": 1.7113924050632914e-05, "loss": 0.10559524595737457, "num_input_tokens_seen": 546366, "step": 291, "train_runtime": 791.1216, "train_tokens_per_second": 690.622 }, { "epoch": 0.2951731109426333, "grad_norm": 2.108994960784912, "learning_rate": 1.7103797468354433e-05, "loss": 0.10349194705486298, "num_input_tokens_seen": 548322, "step": 292, "train_runtime": 793.3614, "train_tokens_per_second": 691.138 }, { "epoch": 0.29618397776093, "grad_norm": 1.8746708631515503, "learning_rate": 1.7093670886075952e-05, "loss": 0.0990857183933258, "num_input_tokens_seen": 550206, "step": 293, "train_runtime": 795.6021, "train_tokens_per_second": 691.559 }, { "epoch": 0.2971948445792267, "grad_norm": 1.834490418434143, "learning_rate": 1.708354430379747e-05, "loss": 0.10397559404373169, "num_input_tokens_seen": 552534, "step": 294, "train_runtime": 797.8938, "train_tokens_per_second": 692.491 }, { "epoch": 0.2982057113975234, "grad_norm": 2.039677858352661, "learning_rate": 1.7073417721518987e-05, "loss": 0.13525766134262085, "num_input_tokens_seen": 554498, "step": 295, "train_runtime": 800.1127, "train_tokens_per_second": 693.025 }, { "epoch": 0.29921657821582004, "grad_norm": 2.3371741771698, "learning_rate": 1.706329113924051e-05, "loss": 0.09204934537410736, "num_input_tokens_seen": 555778, "step": 296, "train_runtime": 802.1777, "train_tokens_per_second": 692.836 }, { "epoch": 0.30022744503411675, "grad_norm": 2.206113338470459, "learning_rate": 1.7053164556962028e-05, "loss": 0.09678886830806732, "num_input_tokens_seen": 557814, "step": 297, "train_runtime": 804.415, "train_tokens_per_second": 693.441 }, { "epoch": 0.30123831185241345, "grad_norm": 1.7425931692123413, "learning_rate": 1.7043037974683544e-05, "loss": 0.10033717751502991, "num_input_tokens_seen": 560236, "step": 298, "train_runtime": 806.7918, "train_tokens_per_second": 694.4 }, { "epoch": 0.30224917867071016, "grad_norm": 1.9114035367965698, "learning_rate": 1.7032911392405066e-05, "loss": 0.08700454980134964, "num_input_tokens_seen": 561910, "step": 299, "train_runtime": 808.9448, "train_tokens_per_second": 694.621 }, { "epoch": 0.3032600454890068, "grad_norm": 1.9057053327560425, "learning_rate": 1.7022784810126585e-05, "loss": 0.08345802128314972, "num_input_tokens_seen": 563520, "step": 300, "train_runtime": 811.0375, "train_tokens_per_second": 694.814 }, { "epoch": 0.3042709123073035, "grad_norm": 2.048941135406494, "learning_rate": 1.70126582278481e-05, "loss": 0.1329759657382965, "num_input_tokens_seen": 565432, "step": 301, "train_runtime": 819.6872, "train_tokens_per_second": 689.814 }, { "epoch": 0.30528177912560023, "grad_norm": 1.8706474304199219, "learning_rate": 1.7002531645569623e-05, "loss": 0.09542995691299438, "num_input_tokens_seen": 567426, "step": 302, "train_runtime": 821.8921, "train_tokens_per_second": 690.39 }, { "epoch": 0.3062926459438969, "grad_norm": 1.629620909690857, "learning_rate": 1.699240506329114e-05, "loss": 0.08246508240699768, "num_input_tokens_seen": 569566, "step": 303, "train_runtime": 824.1375, "train_tokens_per_second": 691.106 }, { "epoch": 0.3073035127621936, "grad_norm": 2.172229766845703, "learning_rate": 1.6982278481012658e-05, "loss": 0.10861508548259735, "num_input_tokens_seen": 570788, "step": 304, "train_runtime": 826.1683, "train_tokens_per_second": 690.886 }, { "epoch": 0.3083143795804903, "grad_norm": 2.2898049354553223, "learning_rate": 1.697215189873418e-05, "loss": 0.13094933331012726, "num_input_tokens_seen": 572294, "step": 305, "train_runtime": 828.2848, "train_tokens_per_second": 690.939 }, { "epoch": 0.30932524639878695, "grad_norm": 1.6969938278198242, "learning_rate": 1.6962025316455696e-05, "loss": 0.143634632229805, "num_input_tokens_seen": 574604, "step": 306, "train_runtime": 830.5725, "train_tokens_per_second": 691.817 }, { "epoch": 0.31033611321708365, "grad_norm": 2.207098960876465, "learning_rate": 1.6951898734177216e-05, "loss": 0.11941751837730408, "num_input_tokens_seen": 576448, "step": 307, "train_runtime": 832.7564, "train_tokens_per_second": 692.217 }, { "epoch": 0.31134698003538036, "grad_norm": 2.441063404083252, "learning_rate": 1.6941772151898738e-05, "loss": 0.11468060314655304, "num_input_tokens_seen": 578256, "step": 308, "train_runtime": 834.9513, "train_tokens_per_second": 692.563 }, { "epoch": 0.312357846853677, "grad_norm": 2.1768319606781006, "learning_rate": 1.6931645569620254e-05, "loss": 0.14340467751026154, "num_input_tokens_seen": 580722, "step": 309, "train_runtime": 837.2782, "train_tokens_per_second": 693.583 }, { "epoch": 0.3133687136719737, "grad_norm": 1.9249969720840454, "learning_rate": 1.6921518987341773e-05, "loss": 0.11373825371265411, "num_input_tokens_seen": 582702, "step": 310, "train_runtime": 839.5223, "train_tokens_per_second": 694.088 }, { "epoch": 0.3143795804902704, "grad_norm": 2.24229097366333, "learning_rate": 1.6911392405063292e-05, "loss": 0.14747795462608337, "num_input_tokens_seen": 584540, "step": 311, "train_runtime": 841.7412, "train_tokens_per_second": 694.441 }, { "epoch": 0.3153904473085671, "grad_norm": 1.6668611764907837, "learning_rate": 1.690126582278481e-05, "loss": 0.10077495127916336, "num_input_tokens_seen": 586196, "step": 312, "train_runtime": 843.9087, "train_tokens_per_second": 694.62 }, { "epoch": 0.3164013141268638, "grad_norm": 1.5944832563400269, "learning_rate": 1.689113924050633e-05, "loss": 0.09194497764110565, "num_input_tokens_seen": 588350, "step": 313, "train_runtime": 846.338, "train_tokens_per_second": 695.171 }, { "epoch": 0.3174121809451605, "grad_norm": 1.9241758584976196, "learning_rate": 1.688101265822785e-05, "loss": 0.12003136426210403, "num_input_tokens_seen": 590494, "step": 314, "train_runtime": 848.5843, "train_tokens_per_second": 695.858 }, { "epoch": 0.31842304776345715, "grad_norm": 1.8242048025131226, "learning_rate": 1.6870886075949368e-05, "loss": 0.09342741966247559, "num_input_tokens_seen": 592296, "step": 315, "train_runtime": 850.8026, "train_tokens_per_second": 696.162 }, { "epoch": 0.31943391458175385, "grad_norm": 2.2841227054595947, "learning_rate": 1.6860759493670887e-05, "loss": 0.15476250648498535, "num_input_tokens_seen": 594442, "step": 316, "train_runtime": 853.081, "train_tokens_per_second": 696.818 }, { "epoch": 0.32044478140005056, "grad_norm": 1.6433976888656616, "learning_rate": 1.6850632911392406e-05, "loss": 0.1078416258096695, "num_input_tokens_seen": 596700, "step": 317, "train_runtime": 855.3709, "train_tokens_per_second": 697.592 }, { "epoch": 0.3214556482183472, "grad_norm": 1.7912700176239014, "learning_rate": 1.6840506329113925e-05, "loss": 0.11561059951782227, "num_input_tokens_seen": 598890, "step": 318, "train_runtime": 857.663, "train_tokens_per_second": 698.281 }, { "epoch": 0.3224665150366439, "grad_norm": 2.0721402168273926, "learning_rate": 1.6830379746835445e-05, "loss": 0.1092069149017334, "num_input_tokens_seen": 600748, "step": 319, "train_runtime": 859.9051, "train_tokens_per_second": 698.621 }, { "epoch": 0.3234773818549406, "grad_norm": 1.9189189672470093, "learning_rate": 1.6820253164556964e-05, "loss": 0.11300531029701233, "num_input_tokens_seen": 602598, "step": 320, "train_runtime": 862.0918, "train_tokens_per_second": 698.995 }, { "epoch": 0.3244882486732373, "grad_norm": 1.9352511167526245, "learning_rate": 1.6810126582278483e-05, "loss": 0.09355691075325012, "num_input_tokens_seen": 604068, "step": 321, "train_runtime": 864.2542, "train_tokens_per_second": 698.947 }, { "epoch": 0.325499115491534, "grad_norm": 1.7809242010116577, "learning_rate": 1.6800000000000002e-05, "loss": 0.09653531014919281, "num_input_tokens_seen": 605770, "step": 322, "train_runtime": 866.55, "train_tokens_per_second": 699.059 }, { "epoch": 0.3265099823098307, "grad_norm": 1.8602415323257446, "learning_rate": 1.678987341772152e-05, "loss": 0.12133066356182098, "num_input_tokens_seen": 607382, "step": 323, "train_runtime": 868.6691, "train_tokens_per_second": 699.21 }, { "epoch": 0.32752084912812734, "grad_norm": 2.417227268218994, "learning_rate": 1.677974683544304e-05, "loss": 0.13102781772613525, "num_input_tokens_seen": 609506, "step": 324, "train_runtime": 870.9771, "train_tokens_per_second": 699.796 }, { "epoch": 0.32853171594642405, "grad_norm": 1.4471842050552368, "learning_rate": 1.676962025316456e-05, "loss": 0.07626676559448242, "num_input_tokens_seen": 611400, "step": 325, "train_runtime": 873.1927, "train_tokens_per_second": 700.189 }, { "epoch": 0.32954258276472076, "grad_norm": 2.1252057552337646, "learning_rate": 1.6759493670886078e-05, "loss": 0.11368009448051453, "num_input_tokens_seen": 612836, "step": 326, "train_runtime": 875.2885, "train_tokens_per_second": 700.153 }, { "epoch": 0.3305534495830174, "grad_norm": 2.1375629901885986, "learning_rate": 1.6749367088607594e-05, "loss": 0.11263997852802277, "num_input_tokens_seen": 614146, "step": 327, "train_runtime": 877.3972, "train_tokens_per_second": 699.964 }, { "epoch": 0.3315643164013141, "grad_norm": 2.3300492763519287, "learning_rate": 1.6739240506329116e-05, "loss": 0.09814397245645523, "num_input_tokens_seen": 615256, "step": 328, "train_runtime": 879.4229, "train_tokens_per_second": 699.613 }, { "epoch": 0.3325751832196108, "grad_norm": 2.4924209117889404, "learning_rate": 1.6729113924050635e-05, "loss": 0.10129263997077942, "num_input_tokens_seen": 617376, "step": 329, "train_runtime": 881.6906, "train_tokens_per_second": 700.218 }, { "epoch": 0.33358605003790753, "grad_norm": 2.1257572174072266, "learning_rate": 1.671898734177215e-05, "loss": 0.13214707374572754, "num_input_tokens_seen": 619276, "step": 330, "train_runtime": 883.9211, "train_tokens_per_second": 700.601 }, { "epoch": 0.3345969168562042, "grad_norm": 1.9464322328567505, "learning_rate": 1.6708860759493674e-05, "loss": 0.1226983368396759, "num_input_tokens_seen": 621170, "step": 331, "train_runtime": 892.4949, "train_tokens_per_second": 695.993 }, { "epoch": 0.3356077836745009, "grad_norm": 2.048203945159912, "learning_rate": 1.6698734177215193e-05, "loss": 0.12150146812200546, "num_input_tokens_seen": 623702, "step": 332, "train_runtime": 894.9049, "train_tokens_per_second": 696.948 }, { "epoch": 0.3366186504927976, "grad_norm": 1.6402168273925781, "learning_rate": 1.668860759493671e-05, "loss": 0.08297025412321091, "num_input_tokens_seen": 625398, "step": 333, "train_runtime": 897.098, "train_tokens_per_second": 697.135 }, { "epoch": 0.33762951731109425, "grad_norm": 2.152194023132324, "learning_rate": 1.667848101265823e-05, "loss": 0.10354448854923248, "num_input_tokens_seen": 627014, "step": 334, "train_runtime": 899.2842, "train_tokens_per_second": 697.237 }, { "epoch": 0.33864038412939096, "grad_norm": 2.082301378250122, "learning_rate": 1.6668354430379746e-05, "loss": 0.10761665552854538, "num_input_tokens_seen": 628980, "step": 335, "train_runtime": 901.5443, "train_tokens_per_second": 697.67 }, { "epoch": 0.33965125094768767, "grad_norm": 2.3863511085510254, "learning_rate": 1.6658227848101266e-05, "loss": 0.12909376621246338, "num_input_tokens_seen": 630750, "step": 336, "train_runtime": 903.735, "train_tokens_per_second": 697.937 }, { "epoch": 0.3406621177659843, "grad_norm": 1.8604240417480469, "learning_rate": 1.6648101265822788e-05, "loss": 0.12805582582950592, "num_input_tokens_seen": 632848, "step": 337, "train_runtime": 906.0208, "train_tokens_per_second": 698.492 }, { "epoch": 0.341672984584281, "grad_norm": 2.243178367614746, "learning_rate": 1.6637974683544304e-05, "loss": 0.14108015596866608, "num_input_tokens_seen": 634710, "step": 338, "train_runtime": 908.2705, "train_tokens_per_second": 698.812 }, { "epoch": 0.34268385140257773, "grad_norm": 1.607914924621582, "learning_rate": 1.6627848101265823e-05, "loss": 0.08600659668445587, "num_input_tokens_seen": 636400, "step": 339, "train_runtime": 910.456, "train_tokens_per_second": 698.99 }, { "epoch": 0.3436947182208744, "grad_norm": 1.5468930006027222, "learning_rate": 1.6617721518987345e-05, "loss": 0.0988999679684639, "num_input_tokens_seen": 638424, "step": 340, "train_runtime": 912.7372, "train_tokens_per_second": 699.461 }, { "epoch": 0.3447055850391711, "grad_norm": 1.8652654886245728, "learning_rate": 1.660759493670886e-05, "loss": 0.11248230189085007, "num_input_tokens_seen": 639900, "step": 341, "train_runtime": 914.8966, "train_tokens_per_second": 699.423 }, { "epoch": 0.3457164518574678, "grad_norm": 1.8457918167114258, "learning_rate": 1.659746835443038e-05, "loss": 0.1206580251455307, "num_input_tokens_seen": 641800, "step": 342, "train_runtime": 917.1389, "train_tokens_per_second": 699.785 }, { "epoch": 0.34672731867576445, "grad_norm": 2.133465528488159, "learning_rate": 1.65873417721519e-05, "loss": 0.12648454308509827, "num_input_tokens_seen": 644028, "step": 343, "train_runtime": 919.5273, "train_tokens_per_second": 700.39 }, { "epoch": 0.34773818549406116, "grad_norm": 1.5376352071762085, "learning_rate": 1.6577215189873418e-05, "loss": 0.09699879586696625, "num_input_tokens_seen": 645904, "step": 344, "train_runtime": 921.7298, "train_tokens_per_second": 700.752 }, { "epoch": 0.34874905231235787, "grad_norm": 1.5410926342010498, "learning_rate": 1.6567088607594937e-05, "loss": 0.07477487623691559, "num_input_tokens_seen": 647174, "step": 345, "train_runtime": 923.8135, "train_tokens_per_second": 700.546 }, { "epoch": 0.3497599191306545, "grad_norm": 2.047024726867676, "learning_rate": 1.6556962025316456e-05, "loss": 0.13444937765598297, "num_input_tokens_seen": 648866, "step": 346, "train_runtime": 925.9563, "train_tokens_per_second": 700.752 }, { "epoch": 0.3507707859489512, "grad_norm": 1.7477526664733887, "learning_rate": 1.6546835443037976e-05, "loss": 0.11890025436878204, "num_input_tokens_seen": 651554, "step": 347, "train_runtime": 928.4416, "train_tokens_per_second": 701.772 }, { "epoch": 0.35178165276724793, "grad_norm": 2.191701889038086, "learning_rate": 1.6536708860759495e-05, "loss": 0.09472803771495819, "num_input_tokens_seen": 652762, "step": 348, "train_runtime": 930.5478, "train_tokens_per_second": 701.481 }, { "epoch": 0.3527925195855446, "grad_norm": 1.7229115962982178, "learning_rate": 1.6526582278481014e-05, "loss": 0.07826320827007294, "num_input_tokens_seen": 654322, "step": 349, "train_runtime": 932.6701, "train_tokens_per_second": 701.558 }, { "epoch": 0.3538033864038413, "grad_norm": 2.0089187622070312, "learning_rate": 1.6516455696202533e-05, "loss": 0.0905705913901329, "num_input_tokens_seen": 656156, "step": 350, "train_runtime": 934.8694, "train_tokens_per_second": 701.869 }, { "epoch": 0.354814253222138, "grad_norm": 1.7794486284255981, "learning_rate": 1.6506329113924052e-05, "loss": 0.10507946461439133, "num_input_tokens_seen": 657980, "step": 351, "train_runtime": 937.0891, "train_tokens_per_second": 702.153 }, { "epoch": 0.35582512004043465, "grad_norm": 2.046496629714966, "learning_rate": 1.649620253164557e-05, "loss": 0.12119658291339874, "num_input_tokens_seen": 659612, "step": 352, "train_runtime": 939.2753, "train_tokens_per_second": 702.256 }, { "epoch": 0.35683598685873136, "grad_norm": 2.325549364089966, "learning_rate": 1.648607594936709e-05, "loss": 0.13412690162658691, "num_input_tokens_seen": 661560, "step": 353, "train_runtime": 941.462, "train_tokens_per_second": 702.694 }, { "epoch": 0.35784685367702807, "grad_norm": 1.989941954612732, "learning_rate": 1.647594936708861e-05, "loss": 0.11104798316955566, "num_input_tokens_seen": 663524, "step": 354, "train_runtime": 943.7074, "train_tokens_per_second": 703.103 }, { "epoch": 0.3588577204953247, "grad_norm": 1.5388857126235962, "learning_rate": 1.6465822784810128e-05, "loss": 0.08549122512340546, "num_input_tokens_seen": 666486, "step": 355, "train_runtime": 946.1973, "train_tokens_per_second": 704.384 }, { "epoch": 0.3598685873136214, "grad_norm": 1.8720457553863525, "learning_rate": 1.6455696202531647e-05, "loss": 0.08153025060892105, "num_input_tokens_seen": 667976, "step": 356, "train_runtime": 948.3255, "train_tokens_per_second": 704.374 }, { "epoch": 0.36087945413191813, "grad_norm": 1.9136314392089844, "learning_rate": 1.6445569620253166e-05, "loss": 0.1059972494840622, "num_input_tokens_seen": 670104, "step": 357, "train_runtime": 950.605, "train_tokens_per_second": 704.924 }, { "epoch": 0.3618903209502148, "grad_norm": 2.0467233657836914, "learning_rate": 1.6435443037974685e-05, "loss": 0.08577902615070343, "num_input_tokens_seen": 671812, "step": 358, "train_runtime": 952.7626, "train_tokens_per_second": 705.12 }, { "epoch": 0.3629011877685115, "grad_norm": 2.021350145339966, "learning_rate": 1.6425316455696205e-05, "loss": 0.1395326554775238, "num_input_tokens_seen": 673840, "step": 359, "train_runtime": 955.0312, "train_tokens_per_second": 705.569 }, { "epoch": 0.3639120545868082, "grad_norm": 1.7927876710891724, "learning_rate": 1.6415189873417724e-05, "loss": 0.11609095335006714, "num_input_tokens_seen": 675820, "step": 360, "train_runtime": 957.2431, "train_tokens_per_second": 706.007 }, { "epoch": 0.36492292140510485, "grad_norm": 1.5044299364089966, "learning_rate": 1.6405063291139243e-05, "loss": 0.08769774436950684, "num_input_tokens_seen": 677590, "step": 361, "train_runtime": 965.8041, "train_tokens_per_second": 701.581 }, { "epoch": 0.36593378822340156, "grad_norm": 1.9887616634368896, "learning_rate": 1.6394936708860762e-05, "loss": 0.1319042146205902, "num_input_tokens_seen": 679656, "step": 362, "train_runtime": 968.1531, "train_tokens_per_second": 702.013 }, { "epoch": 0.36694465504169826, "grad_norm": 1.77889883518219, "learning_rate": 1.638481012658228e-05, "loss": 0.11687910556793213, "num_input_tokens_seen": 681542, "step": 363, "train_runtime": 970.4173, "train_tokens_per_second": 702.318 }, { "epoch": 0.36795552185999497, "grad_norm": 1.5798107385635376, "learning_rate": 1.63746835443038e-05, "loss": 0.08784738183021545, "num_input_tokens_seen": 683072, "step": 364, "train_runtime": 972.5466, "train_tokens_per_second": 702.354 }, { "epoch": 0.3689663886782916, "grad_norm": 1.9086544513702393, "learning_rate": 1.636455696202532e-05, "loss": 0.11384311318397522, "num_input_tokens_seen": 684780, "step": 365, "train_runtime": 974.7033, "train_tokens_per_second": 702.552 }, { "epoch": 0.36997725549658833, "grad_norm": 1.795804738998413, "learning_rate": 1.6354430379746838e-05, "loss": 0.14664557576179504, "num_input_tokens_seen": 687052, "step": 366, "train_runtime": 976.998, "train_tokens_per_second": 703.228 }, { "epoch": 0.37098812231488504, "grad_norm": 1.6334198713302612, "learning_rate": 1.6344303797468354e-05, "loss": 0.11831093579530716, "num_input_tokens_seen": 689058, "step": 367, "train_runtime": 979.2153, "train_tokens_per_second": 703.684 }, { "epoch": 0.3719989891331817, "grad_norm": 1.8755356073379517, "learning_rate": 1.6334177215189876e-05, "loss": 0.12714678049087524, "num_input_tokens_seen": 690736, "step": 368, "train_runtime": 981.383, "train_tokens_per_second": 703.839 }, { "epoch": 0.3730098559514784, "grad_norm": 1.7126693725585938, "learning_rate": 1.6324050632911395e-05, "loss": 0.1069984883069992, "num_input_tokens_seen": 692596, "step": 369, "train_runtime": 983.6119, "train_tokens_per_second": 704.135 }, { "epoch": 0.3740207227697751, "grad_norm": 2.0715458393096924, "learning_rate": 1.631392405063291e-05, "loss": 0.12520043551921844, "num_input_tokens_seen": 694712, "step": 370, "train_runtime": 985.8509, "train_tokens_per_second": 704.683 }, { "epoch": 0.37503158958807176, "grad_norm": 1.7266870737075806, "learning_rate": 1.6303797468354434e-05, "loss": 0.08129256218671799, "num_input_tokens_seen": 696466, "step": 371, "train_runtime": 987.9997, "train_tokens_per_second": 704.925 }, { "epoch": 0.37604245640636846, "grad_norm": 1.6928164958953857, "learning_rate": 1.629367088607595e-05, "loss": 0.06832411140203476, "num_input_tokens_seen": 697804, "step": 372, "train_runtime": 990.1476, "train_tokens_per_second": 704.747 }, { "epoch": 0.37705332322466517, "grad_norm": 1.93890380859375, "learning_rate": 1.6283544303797468e-05, "loss": 0.1151122972369194, "num_input_tokens_seen": 699614, "step": 373, "train_runtime": 992.383, "train_tokens_per_second": 704.984 }, { "epoch": 0.3780641900429618, "grad_norm": 2.2426564693450928, "learning_rate": 1.627341772151899e-05, "loss": 0.1247732862830162, "num_input_tokens_seen": 700990, "step": 374, "train_runtime": 994.4776, "train_tokens_per_second": 704.883 }, { "epoch": 0.37907505686125853, "grad_norm": 1.6789480447769165, "learning_rate": 1.6263291139240506e-05, "loss": 0.1177583634853363, "num_input_tokens_seen": 703404, "step": 375, "train_runtime": 996.8104, "train_tokens_per_second": 705.655 }, { "epoch": 0.38008592367955524, "grad_norm": 2.000699996948242, "learning_rate": 1.6253164556962026e-05, "loss": 0.11292397230863571, "num_input_tokens_seen": 705094, "step": 376, "train_runtime": 998.969, "train_tokens_per_second": 705.822 }, { "epoch": 0.3810967904978519, "grad_norm": 2.2312796115875244, "learning_rate": 1.6243037974683548e-05, "loss": 0.13240455090999603, "num_input_tokens_seen": 706698, "step": 377, "train_runtime": 1001.102, "train_tokens_per_second": 705.92 }, { "epoch": 0.3821076573161486, "grad_norm": 1.6221849918365479, "learning_rate": 1.6232911392405064e-05, "loss": 0.0768461525440216, "num_input_tokens_seen": 708394, "step": 378, "train_runtime": 1003.2784, "train_tokens_per_second": 706.079 }, { "epoch": 0.3831185241344453, "grad_norm": 1.7459332942962646, "learning_rate": 1.6222784810126583e-05, "loss": 0.09541502594947815, "num_input_tokens_seen": 710096, "step": 379, "train_runtime": 1005.4229, "train_tokens_per_second": 706.266 }, { "epoch": 0.38412939095274196, "grad_norm": 1.5383440256118774, "learning_rate": 1.6212658227848102e-05, "loss": 0.07174061238765717, "num_input_tokens_seen": 711458, "step": 380, "train_runtime": 1007.5411, "train_tokens_per_second": 706.133 }, { "epoch": 0.38514025777103866, "grad_norm": 2.028183698654175, "learning_rate": 1.620253164556962e-05, "loss": 0.13594409823417664, "num_input_tokens_seen": 713746, "step": 381, "train_runtime": 1009.8843, "train_tokens_per_second": 706.76 }, { "epoch": 0.38615112458933537, "grad_norm": 1.3330520391464233, "learning_rate": 1.619240506329114e-05, "loss": 0.07100304961204529, "num_input_tokens_seen": 715434, "step": 382, "train_runtime": 1012.0256, "train_tokens_per_second": 706.933 }, { "epoch": 0.387161991407632, "grad_norm": 1.972743034362793, "learning_rate": 1.618227848101266e-05, "loss": 0.09860429167747498, "num_input_tokens_seen": 717224, "step": 383, "train_runtime": 1014.1947, "train_tokens_per_second": 707.186 }, { "epoch": 0.38817285822592873, "grad_norm": 2.5587127208709717, "learning_rate": 1.6172151898734178e-05, "loss": 0.13275621831417084, "num_input_tokens_seen": 718734, "step": 384, "train_runtime": 1016.3047, "train_tokens_per_second": 707.203 }, { "epoch": 0.38918372504422544, "grad_norm": 1.4623247385025024, "learning_rate": 1.6162025316455697e-05, "loss": 0.08318155258893967, "num_input_tokens_seen": 720200, "step": 385, "train_runtime": 1018.4238, "train_tokens_per_second": 707.171 }, { "epoch": 0.3901945918625221, "grad_norm": 1.7298856973648071, "learning_rate": 1.6151898734177216e-05, "loss": 0.11590967327356339, "num_input_tokens_seen": 722210, "step": 386, "train_runtime": 1020.6689, "train_tokens_per_second": 707.585 }, { "epoch": 0.3912054586808188, "grad_norm": 2.266411066055298, "learning_rate": 1.6141772151898735e-05, "loss": 0.11143288761377335, "num_input_tokens_seen": 724340, "step": 387, "train_runtime": 1022.9451, "train_tokens_per_second": 708.093 }, { "epoch": 0.3922163254991155, "grad_norm": 2.060002565383911, "learning_rate": 1.6131645569620255e-05, "loss": 0.1141839399933815, "num_input_tokens_seen": 725928, "step": 388, "train_runtime": 1025.0836, "train_tokens_per_second": 708.165 }, { "epoch": 0.39322719231741216, "grad_norm": 1.9606693983078003, "learning_rate": 1.6121518987341774e-05, "loss": 0.1146438866853714, "num_input_tokens_seen": 728306, "step": 389, "train_runtime": 1027.4277, "train_tokens_per_second": 708.864 }, { "epoch": 0.39423805913570886, "grad_norm": 1.9957023859024048, "learning_rate": 1.6111392405063293e-05, "loss": 0.12976482510566711, "num_input_tokens_seen": 730248, "step": 390, "train_runtime": 1029.6729, "train_tokens_per_second": 709.204 }, { "epoch": 0.39524892595400557, "grad_norm": 1.8542495965957642, "learning_rate": 1.6101265822784812e-05, "loss": 0.08730176091194153, "num_input_tokens_seen": 732022, "step": 391, "train_runtime": 1038.1427, "train_tokens_per_second": 705.127 }, { "epoch": 0.3962597927723022, "grad_norm": 1.9549685716629028, "learning_rate": 1.609113924050633e-05, "loss": 0.1409481018781662, "num_input_tokens_seen": 734084, "step": 392, "train_runtime": 1040.4066, "train_tokens_per_second": 705.574 }, { "epoch": 0.39727065959059893, "grad_norm": 1.9346776008605957, "learning_rate": 1.608101265822785e-05, "loss": 0.12512962520122528, "num_input_tokens_seen": 735922, "step": 393, "train_runtime": 1042.767, "train_tokens_per_second": 705.74 }, { "epoch": 0.39828152640889564, "grad_norm": 1.7594246864318848, "learning_rate": 1.607088607594937e-05, "loss": 0.11548963189125061, "num_input_tokens_seen": 737962, "step": 394, "train_runtime": 1044.9739, "train_tokens_per_second": 706.201 }, { "epoch": 0.39929239322719234, "grad_norm": 2.4287121295928955, "learning_rate": 1.6060759493670888e-05, "loss": 0.13242198526859283, "num_input_tokens_seen": 739550, "step": 395, "train_runtime": 1047.1342, "train_tokens_per_second": 706.261 }, { "epoch": 0.400303260045489, "grad_norm": 1.869313359260559, "learning_rate": 1.6050632911392404e-05, "loss": 0.10317026078701019, "num_input_tokens_seen": 741172, "step": 396, "train_runtime": 1049.292, "train_tokens_per_second": 706.354 }, { "epoch": 0.400303260045489, "eval_loss": 0.42201629281044006, "eval_runtime": 52.301, "eval_samples_per_second": 16.807, "eval_steps_per_second": 8.413, "num_input_tokens_seen": 741172, "step": 396 }, { "epoch": 0.4013141268637857, "grad_norm": 1.8665021657943726, "learning_rate": 1.6040506329113926e-05, "loss": 0.09587148576974869, "num_input_tokens_seen": 743004, "step": 397, "train_runtime": 1103.7991, "train_tokens_per_second": 673.133 }, { "epoch": 0.4023249936820824, "grad_norm": 1.5042665004730225, "learning_rate": 1.6030379746835445e-05, "loss": 0.10045738518238068, "num_input_tokens_seen": 744848, "step": 398, "train_runtime": 1105.9857, "train_tokens_per_second": 673.47 }, { "epoch": 0.40333586050037906, "grad_norm": 1.6995333433151245, "learning_rate": 1.602025316455696e-05, "loss": 0.09934995323419571, "num_input_tokens_seen": 746680, "step": 399, "train_runtime": 1108.1595, "train_tokens_per_second": 673.802 }, { "epoch": 0.40434672731867577, "grad_norm": 1.9656271934509277, "learning_rate": 1.6010126582278484e-05, "loss": 0.11542671918869019, "num_input_tokens_seen": 748696, "step": 400, "train_runtime": 1110.3632, "train_tokens_per_second": 674.28 }, { "epoch": 0.4053575941369725, "grad_norm": 1.6320098638534546, "learning_rate": 1.6000000000000003e-05, "loss": 0.09155505895614624, "num_input_tokens_seen": 750616, "step": 401, "train_runtime": 1112.5727, "train_tokens_per_second": 674.667 }, { "epoch": 0.40636846095526913, "grad_norm": 2.454561948776245, "learning_rate": 1.598987341772152e-05, "loss": 0.13649535179138184, "num_input_tokens_seen": 752420, "step": 402, "train_runtime": 1114.7875, "train_tokens_per_second": 674.945 }, { "epoch": 0.40737932777356584, "grad_norm": 2.0516269207000732, "learning_rate": 1.597974683544304e-05, "loss": 0.1292344033718109, "num_input_tokens_seen": 754336, "step": 403, "train_runtime": 1117.0455, "train_tokens_per_second": 675.296 }, { "epoch": 0.40839019459186254, "grad_norm": 2.109393835067749, "learning_rate": 1.5969620253164557e-05, "loss": 0.10809981822967529, "num_input_tokens_seen": 756468, "step": 404, "train_runtime": 1119.3543, "train_tokens_per_second": 675.807 }, { "epoch": 0.4094010614101592, "grad_norm": 1.70687735080719, "learning_rate": 1.5959493670886076e-05, "loss": 0.11761138588190079, "num_input_tokens_seen": 758516, "step": 405, "train_runtime": 1121.6274, "train_tokens_per_second": 676.264 }, { "epoch": 0.4104119282284559, "grad_norm": 1.7862193584442139, "learning_rate": 1.5949367088607598e-05, "loss": 0.10888718068599701, "num_input_tokens_seen": 760364, "step": 406, "train_runtime": 1123.8172, "train_tokens_per_second": 676.59 }, { "epoch": 0.4114227950467526, "grad_norm": 1.822191596031189, "learning_rate": 1.5939240506329114e-05, "loss": 0.11547520756721497, "num_input_tokens_seen": 762296, "step": 407, "train_runtime": 1126.0691, "train_tokens_per_second": 676.953 }, { "epoch": 0.41243366186504926, "grad_norm": 1.9484902620315552, "learning_rate": 1.5929113924050633e-05, "loss": 0.09211841225624084, "num_input_tokens_seen": 764002, "step": 408, "train_runtime": 1128.2247, "train_tokens_per_second": 677.172 }, { "epoch": 0.41344452868334597, "grad_norm": 1.9491668939590454, "learning_rate": 1.5918987341772155e-05, "loss": 0.144774928689003, "num_input_tokens_seen": 766318, "step": 409, "train_runtime": 1130.5753, "train_tokens_per_second": 677.812 }, { "epoch": 0.4144553955016427, "grad_norm": 1.5557540655136108, "learning_rate": 1.590886075949367e-05, "loss": 0.09754966199398041, "num_input_tokens_seen": 768542, "step": 410, "train_runtime": 1132.8389, "train_tokens_per_second": 678.421 }, { "epoch": 0.41546626231993933, "grad_norm": 1.9235962629318237, "learning_rate": 1.589873417721519e-05, "loss": 0.09587027132511139, "num_input_tokens_seen": 770400, "step": 411, "train_runtime": 1135.0152, "train_tokens_per_second": 678.757 }, { "epoch": 0.41647712913823604, "grad_norm": 1.5368192195892334, "learning_rate": 1.588860759493671e-05, "loss": 0.08561362326145172, "num_input_tokens_seen": 773532, "step": 412, "train_runtime": 1137.5146, "train_tokens_per_second": 680.019 }, { "epoch": 0.41748799595653274, "grad_norm": 1.5619041919708252, "learning_rate": 1.5878481012658228e-05, "loss": 0.08629076182842255, "num_input_tokens_seen": 775576, "step": 413, "train_runtime": 1139.7497, "train_tokens_per_second": 680.479 }, { "epoch": 0.4184988627748294, "grad_norm": 1.8506624698638916, "learning_rate": 1.5868354430379747e-05, "loss": 0.11986834555864334, "num_input_tokens_seen": 777670, "step": 414, "train_runtime": 1142.0165, "train_tokens_per_second": 680.962 }, { "epoch": 0.4195097295931261, "grad_norm": 2.1654317378997803, "learning_rate": 1.5858227848101266e-05, "loss": 0.11728420853614807, "num_input_tokens_seen": 779290, "step": 415, "train_runtime": 1144.2012, "train_tokens_per_second": 681.078 }, { "epoch": 0.4205205964114228, "grad_norm": 2.0820565223693848, "learning_rate": 1.5848101265822786e-05, "loss": 0.1193307489156723, "num_input_tokens_seen": 781116, "step": 416, "train_runtime": 1146.3847, "train_tokens_per_second": 681.373 }, { "epoch": 0.42153146322971946, "grad_norm": 1.7809218168258667, "learning_rate": 1.5837974683544305e-05, "loss": 0.1084236353635788, "num_input_tokens_seen": 783262, "step": 417, "train_runtime": 1148.6239, "train_tokens_per_second": 681.913 }, { "epoch": 0.42254233004801617, "grad_norm": 1.6279551982879639, "learning_rate": 1.5827848101265824e-05, "loss": 0.09959094971418381, "num_input_tokens_seen": 785110, "step": 418, "train_runtime": 1150.8261, "train_tokens_per_second": 682.214 }, { "epoch": 0.4235531968663129, "grad_norm": 1.692862868309021, "learning_rate": 1.5817721518987343e-05, "loss": 0.11396458745002747, "num_input_tokens_seen": 787038, "step": 419, "train_runtime": 1153.0624, "train_tokens_per_second": 682.563 }, { "epoch": 0.4245640636846095, "grad_norm": 1.6826294660568237, "learning_rate": 1.5807594936708862e-05, "loss": 0.11504846066236496, "num_input_tokens_seen": 788866, "step": 420, "train_runtime": 1155.2779, "train_tokens_per_second": 682.837 }, { "epoch": 0.42557493050290623, "grad_norm": 2.1463863849639893, "learning_rate": 1.579746835443038e-05, "loss": 0.09922569990158081, "num_input_tokens_seen": 790578, "step": 421, "train_runtime": 1164.0445, "train_tokens_per_second": 679.165 }, { "epoch": 0.42658579732120294, "grad_norm": 1.575871467590332, "learning_rate": 1.57873417721519e-05, "loss": 0.10171511769294739, "num_input_tokens_seen": 792632, "step": 422, "train_runtime": 1166.3793, "train_tokens_per_second": 679.566 }, { "epoch": 0.4275966641394996, "grad_norm": 1.4514565467834473, "learning_rate": 1.577721518987342e-05, "loss": 0.0752696841955185, "num_input_tokens_seen": 794344, "step": 423, "train_runtime": 1168.567, "train_tokens_per_second": 679.759 }, { "epoch": 0.4286075309577963, "grad_norm": 1.4515169858932495, "learning_rate": 1.5767088607594938e-05, "loss": 0.0848160907626152, "num_input_tokens_seen": 796212, "step": 424, "train_runtime": 1170.7731, "train_tokens_per_second": 680.074 }, { "epoch": 0.429618397776093, "grad_norm": 1.5068243741989136, "learning_rate": 1.5756962025316457e-05, "loss": 0.10230260342359543, "num_input_tokens_seen": 798458, "step": 425, "train_runtime": 1173.0971, "train_tokens_per_second": 680.641 }, { "epoch": 0.4306292645943897, "grad_norm": 1.7472387552261353, "learning_rate": 1.5746835443037976e-05, "loss": 0.12000877410173416, "num_input_tokens_seen": 800190, "step": 426, "train_runtime": 1175.3301, "train_tokens_per_second": 680.821 }, { "epoch": 0.43164013141268637, "grad_norm": 1.6070133447647095, "learning_rate": 1.5736708860759495e-05, "loss": 0.08834629505872726, "num_input_tokens_seen": 801656, "step": 427, "train_runtime": 1177.4292, "train_tokens_per_second": 680.853 }, { "epoch": 0.4326509982309831, "grad_norm": 1.5826572179794312, "learning_rate": 1.5726582278481015e-05, "loss": 0.07955733686685562, "num_input_tokens_seen": 803426, "step": 428, "train_runtime": 1179.6092, "train_tokens_per_second": 681.095 }, { "epoch": 0.4336618650492798, "grad_norm": 1.5440285205841064, "learning_rate": 1.5716455696202534e-05, "loss": 0.0863671600818634, "num_input_tokens_seen": 805396, "step": 429, "train_runtime": 1181.7924, "train_tokens_per_second": 681.504 }, { "epoch": 0.43467273186757643, "grad_norm": 1.633183479309082, "learning_rate": 1.5706329113924053e-05, "loss": 0.11554452031850815, "num_input_tokens_seen": 807228, "step": 430, "train_runtime": 1183.9752, "train_tokens_per_second": 681.795 }, { "epoch": 0.43568359868587314, "grad_norm": 2.0593886375427246, "learning_rate": 1.5696202531645572e-05, "loss": 0.12381618469953537, "num_input_tokens_seen": 808880, "step": 431, "train_runtime": 1186.1214, "train_tokens_per_second": 681.954 }, { "epoch": 0.43669446550416985, "grad_norm": 1.516738772392273, "learning_rate": 1.568607594936709e-05, "loss": 0.10749244689941406, "num_input_tokens_seen": 811672, "step": 432, "train_runtime": 1188.561, "train_tokens_per_second": 682.903 }, { "epoch": 0.4377053323224665, "grad_norm": 1.5923534631729126, "learning_rate": 1.567594936708861e-05, "loss": 0.09094808995723724, "num_input_tokens_seen": 813512, "step": 433, "train_runtime": 1190.7375, "train_tokens_per_second": 683.2 }, { "epoch": 0.4387161991407632, "grad_norm": 1.855827808380127, "learning_rate": 1.566582278481013e-05, "loss": 0.10945839434862137, "num_input_tokens_seen": 815038, "step": 434, "train_runtime": 1192.8699, "train_tokens_per_second": 683.258 }, { "epoch": 0.4397270659590599, "grad_norm": 1.7897955179214478, "learning_rate": 1.5655696202531648e-05, "loss": 0.11381515115499496, "num_input_tokens_seen": 816976, "step": 435, "train_runtime": 1195.0553, "train_tokens_per_second": 683.63 }, { "epoch": 0.44073793277735657, "grad_norm": 1.8408046960830688, "learning_rate": 1.5645569620253164e-05, "loss": 0.09024758636951447, "num_input_tokens_seen": 818870, "step": 436, "train_runtime": 1197.2687, "train_tokens_per_second": 683.948 }, { "epoch": 0.4417487995956533, "grad_norm": 1.8731918334960938, "learning_rate": 1.5635443037974686e-05, "loss": 0.12296129763126373, "num_input_tokens_seen": 821004, "step": 437, "train_runtime": 1199.5552, "train_tokens_per_second": 684.424 }, { "epoch": 0.44275966641395, "grad_norm": 1.323952317237854, "learning_rate": 1.5625316455696205e-05, "loss": 0.080072320997715, "num_input_tokens_seen": 823306, "step": 438, "train_runtime": 1201.8619, "train_tokens_per_second": 685.025 }, { "epoch": 0.44377053323224663, "grad_norm": 1.9585412740707397, "learning_rate": 1.561518987341772e-05, "loss": 0.13973820209503174, "num_input_tokens_seen": 825712, "step": 439, "train_runtime": 1204.2047, "train_tokens_per_second": 685.691 }, { "epoch": 0.44478140005054334, "grad_norm": 1.9043835401535034, "learning_rate": 1.5605063291139244e-05, "loss": 0.10461394488811493, "num_input_tokens_seen": 827680, "step": 440, "train_runtime": 1206.4511, "train_tokens_per_second": 686.045 }, { "epoch": 0.44579226686884005, "grad_norm": 1.8181251287460327, "learning_rate": 1.5594936708860763e-05, "loss": 0.11697743833065033, "num_input_tokens_seen": 829328, "step": 441, "train_runtime": 1208.5951, "train_tokens_per_second": 686.192 }, { "epoch": 0.4468031336871367, "grad_norm": 1.7808847427368164, "learning_rate": 1.558481012658228e-05, "loss": 0.10102672129869461, "num_input_tokens_seen": 831254, "step": 442, "train_runtime": 1210.8, "train_tokens_per_second": 686.533 }, { "epoch": 0.4478140005054334, "grad_norm": 1.8276588916778564, "learning_rate": 1.55746835443038e-05, "loss": 0.12833836674690247, "num_input_tokens_seen": 833076, "step": 443, "train_runtime": 1213.0006, "train_tokens_per_second": 686.789 }, { "epoch": 0.4488248673237301, "grad_norm": 1.671140193939209, "learning_rate": 1.5564556962025317e-05, "loss": 0.11130937933921814, "num_input_tokens_seen": 835272, "step": 444, "train_runtime": 1215.3353, "train_tokens_per_second": 687.277 }, { "epoch": 0.44983573414202677, "grad_norm": 1.6901848316192627, "learning_rate": 1.5554430379746836e-05, "loss": 0.11136844754219055, "num_input_tokens_seen": 837422, "step": 445, "train_runtime": 1217.5852, "train_tokens_per_second": 687.773 }, { "epoch": 0.4508466009603235, "grad_norm": 1.4702390432357788, "learning_rate": 1.5544303797468358e-05, "loss": 0.08984880149364471, "num_input_tokens_seen": 839660, "step": 446, "train_runtime": 1219.848, "train_tokens_per_second": 688.332 }, { "epoch": 0.4518574677786202, "grad_norm": 2.1821863651275635, "learning_rate": 1.5534177215189874e-05, "loss": 0.14034874737262726, "num_input_tokens_seen": 841170, "step": 447, "train_runtime": 1221.9606, "train_tokens_per_second": 688.377 }, { "epoch": 0.45286833459691683, "grad_norm": 2.0638959407806396, "learning_rate": 1.5524050632911393e-05, "loss": 0.14524506032466888, "num_input_tokens_seen": 843086, "step": 448, "train_runtime": 1224.1944, "train_tokens_per_second": 688.686 }, { "epoch": 0.45387920141521354, "grad_norm": 1.34815514087677, "learning_rate": 1.5513924050632912e-05, "loss": 0.07662313431501389, "num_input_tokens_seen": 845328, "step": 449, "train_runtime": 1226.4751, "train_tokens_per_second": 689.234 }, { "epoch": 0.45489006823351025, "grad_norm": 2.104788064956665, "learning_rate": 1.550379746835443e-05, "loss": 0.12482360005378723, "num_input_tokens_seen": 847832, "step": 450, "train_runtime": 1228.9051, "train_tokens_per_second": 689.908 }, { "epoch": 0.4559009350518069, "grad_norm": 1.55012047290802, "learning_rate": 1.549367088607595e-05, "loss": 0.06931520998477936, "num_input_tokens_seen": 849910, "step": 451, "train_runtime": 1237.5726, "train_tokens_per_second": 686.756 }, { "epoch": 0.4569118018701036, "grad_norm": 1.5841842889785767, "learning_rate": 1.548354430379747e-05, "loss": 0.1137673556804657, "num_input_tokens_seen": 852294, "step": 452, "train_runtime": 1239.936, "train_tokens_per_second": 687.369 }, { "epoch": 0.4579226686884003, "grad_norm": 1.9309735298156738, "learning_rate": 1.5473417721518988e-05, "loss": 0.10654686391353607, "num_input_tokens_seen": 854262, "step": 453, "train_runtime": 1242.1737, "train_tokens_per_second": 687.715 }, { "epoch": 0.45893353550669697, "grad_norm": 2.4330663681030273, "learning_rate": 1.5463291139240507e-05, "loss": 0.1234653890132904, "num_input_tokens_seen": 856256, "step": 454, "train_runtime": 1244.3796, "train_tokens_per_second": 688.099 }, { "epoch": 0.4599444023249937, "grad_norm": 1.5877577066421509, "learning_rate": 1.5453164556962026e-05, "loss": 0.09403739124536514, "num_input_tokens_seen": 857960, "step": 455, "train_runtime": 1246.5842, "train_tokens_per_second": 688.249 }, { "epoch": 0.4609552691432904, "grad_norm": 1.748447060585022, "learning_rate": 1.5443037974683546e-05, "loss": 0.0888945460319519, "num_input_tokens_seen": 859844, "step": 456, "train_runtime": 1248.8123, "train_tokens_per_second": 688.529 }, { "epoch": 0.4619661359615871, "grad_norm": 1.9015161991119385, "learning_rate": 1.5432911392405065e-05, "loss": 0.13397936522960663, "num_input_tokens_seen": 862234, "step": 457, "train_runtime": 1251.1803, "train_tokens_per_second": 689.136 }, { "epoch": 0.46297700277988374, "grad_norm": 1.9944270849227905, "learning_rate": 1.5422784810126584e-05, "loss": 0.17752207815647125, "num_input_tokens_seen": 864526, "step": 458, "train_runtime": 1253.5349, "train_tokens_per_second": 689.67 }, { "epoch": 0.46398786959818045, "grad_norm": 1.6891884803771973, "learning_rate": 1.5412658227848103e-05, "loss": 0.0922621637582779, "num_input_tokens_seen": 866254, "step": 459, "train_runtime": 1255.7202, "train_tokens_per_second": 689.846 }, { "epoch": 0.46499873641647715, "grad_norm": 2.05324649810791, "learning_rate": 1.5402531645569622e-05, "loss": 0.12507976591587067, "num_input_tokens_seen": 868044, "step": 460, "train_runtime": 1257.9077, "train_tokens_per_second": 690.07 }, { "epoch": 0.4660096032347738, "grad_norm": 1.9538702964782715, "learning_rate": 1.539240506329114e-05, "loss": 0.13201306760311127, "num_input_tokens_seen": 869820, "step": 461, "train_runtime": 1260.0664, "train_tokens_per_second": 690.297 }, { "epoch": 0.4670204700530705, "grad_norm": 1.5424325466156006, "learning_rate": 1.538227848101266e-05, "loss": 0.07851071655750275, "num_input_tokens_seen": 871334, "step": 462, "train_runtime": 1262.1907, "train_tokens_per_second": 690.335 }, { "epoch": 0.4680313368713672, "grad_norm": 1.6234872341156006, "learning_rate": 1.537215189873418e-05, "loss": 0.11618975549936295, "num_input_tokens_seen": 873256, "step": 463, "train_runtime": 1264.4267, "train_tokens_per_second": 690.634 }, { "epoch": 0.4690422036896639, "grad_norm": 1.761287808418274, "learning_rate": 1.5362025316455698e-05, "loss": 0.11727702617645264, "num_input_tokens_seen": 875286, "step": 464, "train_runtime": 1266.6396, "train_tokens_per_second": 691.03 }, { "epoch": 0.4700530705079606, "grad_norm": 1.9724807739257812, "learning_rate": 1.5351898734177217e-05, "loss": 0.10613028705120087, "num_input_tokens_seen": 876870, "step": 465, "train_runtime": 1268.7845, "train_tokens_per_second": 691.11 }, { "epoch": 0.4710639373262573, "grad_norm": 1.6279855966567993, "learning_rate": 1.5341772151898736e-05, "loss": 0.1028311476111412, "num_input_tokens_seen": 878840, "step": 466, "train_runtime": 1271.0233, "train_tokens_per_second": 691.443 }, { "epoch": 0.47207480414455394, "grad_norm": 1.61843740940094, "learning_rate": 1.5331645569620255e-05, "loss": 0.08738434314727783, "num_input_tokens_seen": 880468, "step": 467, "train_runtime": 1273.1698, "train_tokens_per_second": 691.556 }, { "epoch": 0.47308567096285065, "grad_norm": 1.5544933080673218, "learning_rate": 1.532151898734177e-05, "loss": 0.09057053923606873, "num_input_tokens_seen": 882314, "step": 468, "train_runtime": 1275.3465, "train_tokens_per_second": 691.823 }, { "epoch": 0.47409653778114735, "grad_norm": 1.851883053779602, "learning_rate": 1.5311392405063294e-05, "loss": 0.10593780875205994, "num_input_tokens_seen": 884162, "step": 469, "train_runtime": 1277.5257, "train_tokens_per_second": 692.089 }, { "epoch": 0.475107404599444, "grad_norm": 1.8330367803573608, "learning_rate": 1.5301265822784813e-05, "loss": 0.09430311620235443, "num_input_tokens_seen": 885872, "step": 470, "train_runtime": 1279.6991, "train_tokens_per_second": 692.25 }, { "epoch": 0.4761182714177407, "grad_norm": 1.7879048585891724, "learning_rate": 1.529113924050633e-05, "loss": 0.10557078570127487, "num_input_tokens_seen": 887478, "step": 471, "train_runtime": 1281.8474, "train_tokens_per_second": 692.343 }, { "epoch": 0.4771291382360374, "grad_norm": 2.0346546173095703, "learning_rate": 1.528101265822785e-05, "loss": 0.11926902830600739, "num_input_tokens_seen": 889464, "step": 472, "train_runtime": 1284.0791, "train_tokens_per_second": 692.686 }, { "epoch": 0.47814000505433407, "grad_norm": 1.7213999032974243, "learning_rate": 1.527088607594937e-05, "loss": 0.09899803251028061, "num_input_tokens_seen": 890990, "step": 473, "train_runtime": 1286.1848, "train_tokens_per_second": 692.739 }, { "epoch": 0.4791508718726308, "grad_norm": 1.8353174924850464, "learning_rate": 1.5260759493670886e-05, "loss": 0.09149063378572464, "num_input_tokens_seen": 892672, "step": 474, "train_runtime": 1288.3919, "train_tokens_per_second": 692.857 }, { "epoch": 0.4801617386909275, "grad_norm": 1.7517122030258179, "learning_rate": 1.5250632911392406e-05, "loss": 0.10418742150068283, "num_input_tokens_seen": 894660, "step": 475, "train_runtime": 1290.6374, "train_tokens_per_second": 693.192 }, { "epoch": 0.48117260550922414, "grad_norm": 1.8344651460647583, "learning_rate": 1.5240506329113924e-05, "loss": 0.11346778273582458, "num_input_tokens_seen": 896764, "step": 476, "train_runtime": 1292.8751, "train_tokens_per_second": 693.62 }, { "epoch": 0.48218347232752085, "grad_norm": 2.2210395336151123, "learning_rate": 1.5230379746835445e-05, "loss": 0.10573138296604156, "num_input_tokens_seen": 898270, "step": 477, "train_runtime": 1295.0283, "train_tokens_per_second": 693.63 }, { "epoch": 0.48319433914581755, "grad_norm": 1.4662727117538452, "learning_rate": 1.5220253164556964e-05, "loss": 0.11092646420001984, "num_input_tokens_seen": 900776, "step": 478, "train_runtime": 1297.3784, "train_tokens_per_second": 694.305 }, { "epoch": 0.4842052059641142, "grad_norm": 2.1169073581695557, "learning_rate": 1.5210126582278481e-05, "loss": 0.09660357236862183, "num_input_tokens_seen": 902464, "step": 479, "train_runtime": 1299.5258, "train_tokens_per_second": 694.456 }, { "epoch": 0.4852160727824109, "grad_norm": 2.007495403289795, "learning_rate": 1.5200000000000002e-05, "loss": 0.11861640959978104, "num_input_tokens_seen": 904536, "step": 480, "train_runtime": 1301.7942, "train_tokens_per_second": 694.838 }, { "epoch": 0.4862269396007076, "grad_norm": 1.7178399562835693, "learning_rate": 1.5189873417721521e-05, "loss": 0.11039911210536957, "num_input_tokens_seen": 906342, "step": 481, "train_runtime": 1310.239, "train_tokens_per_second": 691.738 }, { "epoch": 0.48723780641900427, "grad_norm": 1.519370198249817, "learning_rate": 1.5179746835443038e-05, "loss": 0.08855210989713669, "num_input_tokens_seen": 908624, "step": 482, "train_runtime": 1312.565, "train_tokens_per_second": 692.251 }, { "epoch": 0.488248673237301, "grad_norm": 1.793309211730957, "learning_rate": 1.5169620253164559e-05, "loss": 0.09917984157800674, "num_input_tokens_seen": 910822, "step": 483, "train_runtime": 1314.84, "train_tokens_per_second": 692.725 }, { "epoch": 0.4892595400555977, "grad_norm": 2.017210006713867, "learning_rate": 1.5159493670886076e-05, "loss": 0.12656812369823456, "num_input_tokens_seen": 912538, "step": 484, "train_runtime": 1317.0247, "train_tokens_per_second": 692.878 }, { "epoch": 0.49027040687389434, "grad_norm": 1.6859157085418701, "learning_rate": 1.5149367088607596e-05, "loss": 0.08337490260601044, "num_input_tokens_seen": 914398, "step": 485, "train_runtime": 1319.2571, "train_tokens_per_second": 693.116 }, { "epoch": 0.49128127369219105, "grad_norm": 1.7310889959335327, "learning_rate": 1.5139240506329116e-05, "loss": 0.09235775470733643, "num_input_tokens_seen": 915784, "step": 486, "train_runtime": 1321.3648, "train_tokens_per_second": 693.059 }, { "epoch": 0.49229214051048775, "grad_norm": 1.7842894792556763, "learning_rate": 1.5129113924050634e-05, "loss": 0.1012832522392273, "num_input_tokens_seen": 917832, "step": 487, "train_runtime": 1323.5975, "train_tokens_per_second": 693.437 }, { "epoch": 0.49330300732878446, "grad_norm": 1.850504994392395, "learning_rate": 1.5118987341772153e-05, "loss": 0.14272227883338928, "num_input_tokens_seen": 919822, "step": 488, "train_runtime": 1325.8314, "train_tokens_per_second": 693.77 }, { "epoch": 0.4943138741470811, "grad_norm": 1.1433686017990112, "learning_rate": 1.5108860759493674e-05, "loss": 0.06848733127117157, "num_input_tokens_seen": 921798, "step": 489, "train_runtime": 1328.0818, "train_tokens_per_second": 694.082 }, { "epoch": 0.4953247409653778, "grad_norm": 2.013387441635132, "learning_rate": 1.5098734177215191e-05, "loss": 0.09337301552295685, "num_input_tokens_seen": 923560, "step": 490, "train_runtime": 1330.2725, "train_tokens_per_second": 694.264 }, { "epoch": 0.4963356077836745, "grad_norm": 2.0009877681732178, "learning_rate": 1.508860759493671e-05, "loss": 0.08730406314134598, "num_input_tokens_seen": 925226, "step": 491, "train_runtime": 1332.4696, "train_tokens_per_second": 694.369 }, { "epoch": 0.4973464746019712, "grad_norm": 1.698068618774414, "learning_rate": 1.5078481012658227e-05, "loss": 0.10106261819601059, "num_input_tokens_seen": 926804, "step": 492, "train_runtime": 1334.597, "train_tokens_per_second": 694.445 }, { "epoch": 0.4983573414202679, "grad_norm": 1.6992688179016113, "learning_rate": 1.5068354430379748e-05, "loss": 0.11859212070703506, "num_input_tokens_seen": 928740, "step": 493, "train_runtime": 1336.8252, "train_tokens_per_second": 694.736 }, { "epoch": 0.4993682082385646, "grad_norm": 2.515361785888672, "learning_rate": 1.5058227848101267e-05, "loss": 0.11421169340610504, "num_input_tokens_seen": 930264, "step": 494, "train_runtime": 1338.9348, "train_tokens_per_second": 694.779 }, { "epoch": 0.5003790750568613, "grad_norm": 2.014190196990967, "learning_rate": 1.5048101265822785e-05, "loss": 0.10539563000202179, "num_input_tokens_seen": 931754, "step": 495, "train_runtime": 1341.1158, "train_tokens_per_second": 694.76 }, { "epoch": 0.501389941875158, "grad_norm": 1.7498775720596313, "learning_rate": 1.5037974683544306e-05, "loss": 0.13124173879623413, "num_input_tokens_seen": 933608, "step": 496, "train_runtime": 1343.3599, "train_tokens_per_second": 694.98 }, { "epoch": 0.5024008086934546, "grad_norm": 1.7500488758087158, "learning_rate": 1.5027848101265825e-05, "loss": 0.11794276535511017, "num_input_tokens_seen": 935584, "step": 497, "train_runtime": 1345.5841, "train_tokens_per_second": 695.3 }, { "epoch": 0.5034116755117514, "grad_norm": 2.0071139335632324, "learning_rate": 1.5017721518987342e-05, "loss": 0.098157599568367, "num_input_tokens_seen": 937248, "step": 498, "train_runtime": 1347.7816, "train_tokens_per_second": 695.401 }, { "epoch": 0.504422542330048, "grad_norm": 1.5707734823226929, "learning_rate": 1.5007594936708863e-05, "loss": 0.09266889840364456, "num_input_tokens_seen": 939192, "step": 499, "train_runtime": 1350.0337, "train_tokens_per_second": 695.68 }, { "epoch": 0.5054334091483447, "grad_norm": 1.875820279121399, "learning_rate": 1.499746835443038e-05, "loss": 0.10333205759525299, "num_input_tokens_seen": 941142, "step": 500, "train_runtime": 1352.2952, "train_tokens_per_second": 695.959 }, { "epoch": 0.5064442759666414, "grad_norm": 1.783033013343811, "learning_rate": 1.49873417721519e-05, "loss": 0.0842694416642189, "num_input_tokens_seen": 942764, "step": 501, "train_runtime": 1354.5035, "train_tokens_per_second": 696.022 }, { "epoch": 0.5074551427849381, "grad_norm": 1.964139461517334, "learning_rate": 1.497721518987342e-05, "loss": 0.12120130658149719, "num_input_tokens_seen": 944456, "step": 502, "train_runtime": 1356.6572, "train_tokens_per_second": 696.164 }, { "epoch": 0.5084660096032347, "grad_norm": 1.8904763460159302, "learning_rate": 1.4967088607594937e-05, "loss": 0.1054663211107254, "num_input_tokens_seen": 946438, "step": 503, "train_runtime": 1358.8965, "train_tokens_per_second": 696.475 }, { "epoch": 0.5094768764215315, "grad_norm": 2.0818839073181152, "learning_rate": 1.4956962025316456e-05, "loss": 0.09397480636835098, "num_input_tokens_seen": 947942, "step": 504, "train_runtime": 1361.0449, "train_tokens_per_second": 696.481 }, { "epoch": 0.5104877432398282, "grad_norm": 2.1881535053253174, "learning_rate": 1.4946835443037977e-05, "loss": 0.08975251019001007, "num_input_tokens_seen": 950170, "step": 505, "train_runtime": 1363.3241, "train_tokens_per_second": 696.951 }, { "epoch": 0.5114986100581248, "grad_norm": 1.7329323291778564, "learning_rate": 1.4936708860759495e-05, "loss": 0.1096678152680397, "num_input_tokens_seen": 952068, "step": 506, "train_runtime": 1365.5013, "train_tokens_per_second": 697.23 }, { "epoch": 0.5125094768764216, "grad_norm": 1.7487717866897583, "learning_rate": 1.4926582278481014e-05, "loss": 0.08918820321559906, "num_input_tokens_seen": 954106, "step": 507, "train_runtime": 1367.7081, "train_tokens_per_second": 697.595 }, { "epoch": 0.5135203436947182, "grad_norm": 1.7221266031265259, "learning_rate": 1.4916455696202531e-05, "loss": 0.10318662226200104, "num_input_tokens_seen": 956278, "step": 508, "train_runtime": 1369.9429, "train_tokens_per_second": 698.042 }, { "epoch": 0.5145312105130149, "grad_norm": 1.8457298278808594, "learning_rate": 1.4906329113924052e-05, "loss": 0.13894438743591309, "num_input_tokens_seen": 957986, "step": 509, "train_runtime": 1372.1068, "train_tokens_per_second": 698.186 }, { "epoch": 0.5155420773313116, "grad_norm": 1.6781812906265259, "learning_rate": 1.4896202531645571e-05, "loss": 0.07831525057554245, "num_input_tokens_seen": 960114, "step": 510, "train_runtime": 1374.3639, "train_tokens_per_second": 698.588 }, { "epoch": 0.5165529441496083, "grad_norm": 1.417349100112915, "learning_rate": 1.4886075949367088e-05, "loss": 0.08226348459720612, "num_input_tokens_seen": 961990, "step": 511, "train_runtime": 1383.0206, "train_tokens_per_second": 695.572 }, { "epoch": 0.5175638109679049, "grad_norm": 1.7875341176986694, "learning_rate": 1.487594936708861e-05, "loss": 0.09959499537944794, "num_input_tokens_seen": 964296, "step": 512, "train_runtime": 1385.3328, "train_tokens_per_second": 696.075 }, { "epoch": 0.5185746777862017, "grad_norm": 1.9528840780258179, "learning_rate": 1.4865822784810128e-05, "loss": 0.1227521002292633, "num_input_tokens_seen": 965920, "step": 513, "train_runtime": 1387.5031, "train_tokens_per_second": 696.157 }, { "epoch": 0.5195855446044984, "grad_norm": 1.9798704385757446, "learning_rate": 1.4855696202531646e-05, "loss": 0.11006204038858414, "num_input_tokens_seen": 967894, "step": 514, "train_runtime": 1389.7419, "train_tokens_per_second": 696.456 }, { "epoch": 0.520596411422795, "grad_norm": 1.7312660217285156, "learning_rate": 1.4845569620253166e-05, "loss": 0.10807745158672333, "num_input_tokens_seen": 970006, "step": 515, "train_runtime": 1392.0082, "train_tokens_per_second": 696.839 }, { "epoch": 0.5216072782410918, "grad_norm": 1.6591758728027344, "learning_rate": 1.4835443037974684e-05, "loss": 0.09685654193162918, "num_input_tokens_seen": 971940, "step": 516, "train_runtime": 1394.222, "train_tokens_per_second": 697.12 }, { "epoch": 0.5226181450593884, "grad_norm": 1.5925546884536743, "learning_rate": 1.4825316455696203e-05, "loss": 0.10817191749811172, "num_input_tokens_seen": 973842, "step": 517, "train_runtime": 1396.4262, "train_tokens_per_second": 697.382 }, { "epoch": 0.5236290118776851, "grad_norm": 2.093906879425049, "learning_rate": 1.4815189873417724e-05, "loss": 0.14283540844917297, "num_input_tokens_seen": 975408, "step": 518, "train_runtime": 1398.548, "train_tokens_per_second": 697.443 }, { "epoch": 0.5246398786959818, "grad_norm": 2.173994779586792, "learning_rate": 1.4805063291139241e-05, "loss": 0.11630765348672867, "num_input_tokens_seen": 976992, "step": 519, "train_runtime": 1400.704, "train_tokens_per_second": 697.501 }, { "epoch": 0.5256507455142785, "grad_norm": 1.920044183731079, "learning_rate": 1.479493670886076e-05, "loss": 0.11933885514736176, "num_input_tokens_seen": 979234, "step": 520, "train_runtime": 1402.9703, "train_tokens_per_second": 697.972 }, { "epoch": 0.5266616123325751, "grad_norm": 2.08705997467041, "learning_rate": 1.4784810126582281e-05, "loss": 0.09583388268947601, "num_input_tokens_seen": 980844, "step": 521, "train_runtime": 1405.1419, "train_tokens_per_second": 698.039 }, { "epoch": 0.5276724791508719, "grad_norm": 1.824843406677246, "learning_rate": 1.4774683544303798e-05, "loss": 0.1340876817703247, "num_input_tokens_seen": 982764, "step": 522, "train_runtime": 1407.4225, "train_tokens_per_second": 698.272 }, { "epoch": 0.5286833459691685, "grad_norm": 1.854954481124878, "learning_rate": 1.4764556962025317e-05, "loss": 0.1237156018614769, "num_input_tokens_seen": 984420, "step": 523, "train_runtime": 1409.6078, "train_tokens_per_second": 698.364 }, { "epoch": 0.5296942127874652, "grad_norm": 2.0649797916412354, "learning_rate": 1.4754430379746836e-05, "loss": 0.13949503004550934, "num_input_tokens_seen": 986348, "step": 524, "train_runtime": 1411.8723, "train_tokens_per_second": 698.61 }, { "epoch": 0.530705079605762, "grad_norm": 1.5614497661590576, "learning_rate": 1.4744303797468356e-05, "loss": 0.09315375983715057, "num_input_tokens_seen": 988886, "step": 525, "train_runtime": 1414.2887, "train_tokens_per_second": 699.211 }, { "epoch": 0.5317159464240586, "grad_norm": 1.839135766029358, "learning_rate": 1.4734177215189875e-05, "loss": 0.1236603781580925, "num_input_tokens_seen": 991078, "step": 526, "train_runtime": 1416.5703, "train_tokens_per_second": 699.632 }, { "epoch": 0.5327268132423553, "grad_norm": 1.7902334928512573, "learning_rate": 1.4724050632911394e-05, "loss": 0.07974381744861603, "num_input_tokens_seen": 992786, "step": 527, "train_runtime": 1418.7559, "train_tokens_per_second": 699.758 }, { "epoch": 0.533737680060652, "grad_norm": 1.4455580711364746, "learning_rate": 1.4713924050632913e-05, "loss": 0.07908736169338226, "num_input_tokens_seen": 994364, "step": 528, "train_runtime": 1420.9037, "train_tokens_per_second": 699.811 }, { "epoch": 0.5347485468789487, "grad_norm": 1.8058191537857056, "learning_rate": 1.4703797468354432e-05, "loss": 0.08228744566440582, "num_input_tokens_seen": 996310, "step": 529, "train_runtime": 1423.126, "train_tokens_per_second": 700.086 }, { "epoch": 0.5357594136972453, "grad_norm": 1.8447226285934448, "learning_rate": 1.4693670886075951e-05, "loss": 0.11537911742925644, "num_input_tokens_seen": 998072, "step": 530, "train_runtime": 1425.3353, "train_tokens_per_second": 700.237 }, { "epoch": 0.5367702805155421, "grad_norm": 2.0417678356170654, "learning_rate": 1.468354430379747e-05, "loss": 0.09737853705883026, "num_input_tokens_seen": 999422, "step": 531, "train_runtime": 1427.434, "train_tokens_per_second": 700.153 }, { "epoch": 0.5377811473338387, "grad_norm": 2.273249864578247, "learning_rate": 1.4673417721518987e-05, "loss": 0.1221286803483963, "num_input_tokens_seen": 1001204, "step": 532, "train_runtime": 1429.6, "train_tokens_per_second": 700.339 }, { "epoch": 0.5387920141521354, "grad_norm": 2.3385322093963623, "learning_rate": 1.4663291139240508e-05, "loss": 0.09718027710914612, "num_input_tokens_seen": 1002712, "step": 533, "train_runtime": 1431.7801, "train_tokens_per_second": 700.325 }, { "epoch": 0.5398028809704322, "grad_norm": 2.52339506149292, "learning_rate": 1.4653164556962027e-05, "loss": 0.15465357899665833, "num_input_tokens_seen": 1004918, "step": 534, "train_runtime": 1434.1426, "train_tokens_per_second": 700.71 }, { "epoch": 0.5408137477887288, "grad_norm": 1.8176788091659546, "learning_rate": 1.4643037974683545e-05, "loss": 0.08890235424041748, "num_input_tokens_seen": 1006830, "step": 535, "train_runtime": 1436.3976, "train_tokens_per_second": 700.941 }, { "epoch": 0.5418246146070256, "grad_norm": 1.8820675611495972, "learning_rate": 1.4632911392405065e-05, "loss": 0.09948692470788956, "num_input_tokens_seen": 1008674, "step": 536, "train_runtime": 1438.6146, "train_tokens_per_second": 701.143 }, { "epoch": 0.5428354814253222, "grad_norm": 1.618376612663269, "learning_rate": 1.4622784810126585e-05, "loss": 0.10095593333244324, "num_input_tokens_seen": 1010454, "step": 537, "train_runtime": 1440.8478, "train_tokens_per_second": 701.291 }, { "epoch": 0.5438463482436189, "grad_norm": 1.6165224313735962, "learning_rate": 1.4612658227848102e-05, "loss": 0.09104248136281967, "num_input_tokens_seen": 1012450, "step": 538, "train_runtime": 1443.0792, "train_tokens_per_second": 701.59 }, { "epoch": 0.5448572150619156, "grad_norm": 1.7190626859664917, "learning_rate": 1.4602531645569623e-05, "loss": 0.10027013719081879, "num_input_tokens_seen": 1014482, "step": 539, "train_runtime": 1445.3367, "train_tokens_per_second": 701.9 }, { "epoch": 0.5458680818802123, "grad_norm": 1.9768813848495483, "learning_rate": 1.459240506329114e-05, "loss": 0.1081099808216095, "num_input_tokens_seen": 1016358, "step": 540, "train_runtime": 1447.5243, "train_tokens_per_second": 702.135 }, { "epoch": 0.546878948698509, "grad_norm": 1.793695092201233, "learning_rate": 1.458227848101266e-05, "loss": 0.10678578913211823, "num_input_tokens_seen": 1018128, "step": 541, "train_runtime": 1456.5568, "train_tokens_per_second": 698.996 }, { "epoch": 0.5478898155168057, "grad_norm": 1.36508309841156, "learning_rate": 1.457215189873418e-05, "loss": 0.09679611772298813, "num_input_tokens_seen": 1020734, "step": 542, "train_runtime": 1458.9916, "train_tokens_per_second": 699.616 }, { "epoch": 0.5489006823351024, "grad_norm": 2.0271501541137695, "learning_rate": 1.4562025316455697e-05, "loss": 0.1297168731689453, "num_input_tokens_seen": 1022694, "step": 543, "train_runtime": 1461.2267, "train_tokens_per_second": 699.887 }, { "epoch": 0.549911549153399, "grad_norm": 1.5494493246078491, "learning_rate": 1.4551898734177216e-05, "loss": 0.08901668339967728, "num_input_tokens_seen": 1024474, "step": 544, "train_runtime": 1463.401, "train_tokens_per_second": 700.064 }, { "epoch": 0.5509224159716958, "grad_norm": 1.9661540985107422, "learning_rate": 1.4541772151898734e-05, "loss": 0.12233540415763855, "num_input_tokens_seen": 1026564, "step": 545, "train_runtime": 1465.6521, "train_tokens_per_second": 700.414 }, { "epoch": 0.5519332827899924, "grad_norm": 1.566672921180725, "learning_rate": 1.4531645569620255e-05, "loss": 0.09095793217420578, "num_input_tokens_seen": 1028902, "step": 546, "train_runtime": 1467.9763, "train_tokens_per_second": 700.898 }, { "epoch": 0.5529441496082891, "grad_norm": 1.8163119554519653, "learning_rate": 1.4521518987341774e-05, "loss": 0.1103871688246727, "num_input_tokens_seen": 1030790, "step": 547, "train_runtime": 1470.162, "train_tokens_per_second": 701.14 }, { "epoch": 0.5539550164265858, "grad_norm": 2.0378549098968506, "learning_rate": 1.4511392405063291e-05, "loss": 0.1106257289648056, "num_input_tokens_seen": 1032664, "step": 548, "train_runtime": 1472.374, "train_tokens_per_second": 701.36 }, { "epoch": 0.5549658832448825, "grad_norm": 1.6189203262329102, "learning_rate": 1.4501265822784812e-05, "loss": 0.10852859914302826, "num_input_tokens_seen": 1035148, "step": 549, "train_runtime": 1474.6956, "train_tokens_per_second": 701.94 }, { "epoch": 0.5559767500631791, "grad_norm": 2.446418046951294, "learning_rate": 1.4491139240506331e-05, "loss": 0.1286158263683319, "num_input_tokens_seen": 1037144, "step": 550, "train_runtime": 1476.9385, "train_tokens_per_second": 702.226 }, { "epoch": 0.5569876168814759, "grad_norm": 1.8347103595733643, "learning_rate": 1.4481012658227848e-05, "loss": 0.09553838521242142, "num_input_tokens_seen": 1038914, "step": 551, "train_runtime": 1479.1227, "train_tokens_per_second": 702.385 }, { "epoch": 0.5579984836997726, "grad_norm": 1.836276888847351, "learning_rate": 1.4470886075949369e-05, "loss": 0.08587778359651566, "num_input_tokens_seen": 1040926, "step": 552, "train_runtime": 1481.4253, "train_tokens_per_second": 702.652 }, { "epoch": 0.5590093505180692, "grad_norm": 1.637007713317871, "learning_rate": 1.4460759493670887e-05, "loss": 0.08323580026626587, "num_input_tokens_seen": 1042626, "step": 553, "train_runtime": 1483.6596, "train_tokens_per_second": 702.739 }, { "epoch": 0.560020217336366, "grad_norm": 1.7831929922103882, "learning_rate": 1.4450632911392406e-05, "loss": 0.09477714449167252, "num_input_tokens_seen": 1044082, "step": 554, "train_runtime": 1485.7933, "train_tokens_per_second": 702.71 }, { "epoch": 0.5610310841546626, "grad_norm": 1.4510189294815063, "learning_rate": 1.4440506329113926e-05, "loss": 0.08061984181404114, "num_input_tokens_seen": 1045858, "step": 555, "train_runtime": 1487.9774, "train_tokens_per_second": 702.872 }, { "epoch": 0.5620419509729593, "grad_norm": 1.6569571495056152, "learning_rate": 1.4430379746835444e-05, "loss": 0.09726974368095398, "num_input_tokens_seen": 1047734, "step": 556, "train_runtime": 1490.1929, "train_tokens_per_second": 703.086 }, { "epoch": 0.563052817791256, "grad_norm": 1.685828447341919, "learning_rate": 1.4420253164556963e-05, "loss": 0.08759375661611557, "num_input_tokens_seen": 1049074, "step": 557, "train_runtime": 1492.2888, "train_tokens_per_second": 702.997 }, { "epoch": 0.5640636846095527, "grad_norm": 1.9097645282745361, "learning_rate": 1.4410126582278484e-05, "loss": 0.1268608123064041, "num_input_tokens_seen": 1050914, "step": 558, "train_runtime": 1494.4527, "train_tokens_per_second": 703.21 }, { "epoch": 0.5650745514278493, "grad_norm": 1.92098069190979, "learning_rate": 1.4400000000000001e-05, "loss": 0.11083795130252838, "num_input_tokens_seen": 1052764, "step": 559, "train_runtime": 1496.6575, "train_tokens_per_second": 703.41 }, { "epoch": 0.5660854182461461, "grad_norm": 1.5865694284439087, "learning_rate": 1.438987341772152e-05, "loss": 0.10960868746042252, "num_input_tokens_seen": 1054490, "step": 560, "train_runtime": 1498.858, "train_tokens_per_second": 703.529 }, { "epoch": 0.5670962850644428, "grad_norm": 1.6917788982391357, "learning_rate": 1.4379746835443038e-05, "loss": 0.09427762776613235, "num_input_tokens_seen": 1056460, "step": 561, "train_runtime": 1501.1064, "train_tokens_per_second": 703.788 }, { "epoch": 0.5681071518827394, "grad_norm": 1.9456087350845337, "learning_rate": 1.4369620253164558e-05, "loss": 0.12319564819335938, "num_input_tokens_seen": 1058084, "step": 562, "train_runtime": 1503.2658, "train_tokens_per_second": 703.857 }, { "epoch": 0.5691180187010362, "grad_norm": 1.8830398321151733, "learning_rate": 1.4359493670886077e-05, "loss": 0.11210659891366959, "num_input_tokens_seen": 1060308, "step": 563, "train_runtime": 1505.5587, "train_tokens_per_second": 704.262 }, { "epoch": 0.5701288855193328, "grad_norm": 1.7035287618637085, "learning_rate": 1.4349367088607595e-05, "loss": 0.09595833718776703, "num_input_tokens_seen": 1061998, "step": 564, "train_runtime": 1507.7226, "train_tokens_per_second": 704.372 }, { "epoch": 0.5711397523376295, "grad_norm": 2.0166547298431396, "learning_rate": 1.4339240506329116e-05, "loss": 0.12182815372943878, "num_input_tokens_seen": 1063624, "step": 565, "train_runtime": 1509.8871, "train_tokens_per_second": 704.439 }, { "epoch": 0.5721506191559262, "grad_norm": 1.8745771646499634, "learning_rate": 1.4329113924050635e-05, "loss": 0.0933096632361412, "num_input_tokens_seen": 1065408, "step": 566, "train_runtime": 1512.1608, "train_tokens_per_second": 704.56 }, { "epoch": 0.5731614859742229, "grad_norm": 1.516402006149292, "learning_rate": 1.4318987341772152e-05, "loss": 0.1060028076171875, "num_input_tokens_seen": 1067676, "step": 567, "train_runtime": 1514.5027, "train_tokens_per_second": 704.968 }, { "epoch": 0.5741723527925195, "grad_norm": 1.649111270904541, "learning_rate": 1.4308860759493673e-05, "loss": 0.09301664680242538, "num_input_tokens_seen": 1069738, "step": 568, "train_runtime": 1516.7405, "train_tokens_per_second": 705.287 }, { "epoch": 0.5751832196108163, "grad_norm": 2.101097822189331, "learning_rate": 1.429873417721519e-05, "loss": 0.09789851307868958, "num_input_tokens_seen": 1071286, "step": 569, "train_runtime": 1518.884, "train_tokens_per_second": 705.311 }, { "epoch": 0.576194086429113, "grad_norm": 1.9389387369155884, "learning_rate": 1.428860759493671e-05, "loss": 0.09537738561630249, "num_input_tokens_seen": 1073526, "step": 570, "train_runtime": 1521.1483, "train_tokens_per_second": 705.734 }, { "epoch": 0.5772049532474096, "grad_norm": 1.776051640510559, "learning_rate": 1.427848101265823e-05, "loss": 0.14023849368095398, "num_input_tokens_seen": 1076090, "step": 571, "train_runtime": 1531.0194, "train_tokens_per_second": 702.859 }, { "epoch": 0.5782158200657064, "grad_norm": 1.9601185321807861, "learning_rate": 1.4268354430379747e-05, "loss": 0.125863716006279, "num_input_tokens_seen": 1078008, "step": 572, "train_runtime": 1533.2106, "train_tokens_per_second": 703.105 }, { "epoch": 0.579226686884003, "grad_norm": 2.311521053314209, "learning_rate": 1.4258227848101267e-05, "loss": 0.1442338079214096, "num_input_tokens_seen": 1079674, "step": 573, "train_runtime": 1535.3805, "train_tokens_per_second": 703.196 }, { "epoch": 0.5802375537022997, "grad_norm": 1.456743597984314, "learning_rate": 1.4248101265822787e-05, "loss": 0.09219858050346375, "num_input_tokens_seen": 1081812, "step": 574, "train_runtime": 1537.6609, "train_tokens_per_second": 703.544 }, { "epoch": 0.5812484205205964, "grad_norm": 1.5369138717651367, "learning_rate": 1.4237974683544305e-05, "loss": 0.07453219592571259, "num_input_tokens_seen": 1084224, "step": 575, "train_runtime": 1539.9672, "train_tokens_per_second": 704.057 }, { "epoch": 0.5822592873388931, "grad_norm": 2.125049114227295, "learning_rate": 1.4227848101265824e-05, "loss": 0.10877341032028198, "num_input_tokens_seen": 1085852, "step": 576, "train_runtime": 1542.1179, "train_tokens_per_second": 704.13 }, { "epoch": 0.5832701541571897, "grad_norm": 1.5754179954528809, "learning_rate": 1.4217721518987341e-05, "loss": 0.09778103232383728, "num_input_tokens_seen": 1088162, "step": 577, "train_runtime": 1544.4524, "train_tokens_per_second": 704.562 }, { "epoch": 0.5842810209754865, "grad_norm": 1.6735082864761353, "learning_rate": 1.4207594936708862e-05, "loss": 0.08625233918428421, "num_input_tokens_seen": 1089830, "step": 578, "train_runtime": 1546.6006, "train_tokens_per_second": 704.662 }, { "epoch": 0.5852918877937832, "grad_norm": 1.7386170625686646, "learning_rate": 1.4197468354430381e-05, "loss": 0.099061518907547, "num_input_tokens_seen": 1091450, "step": 579, "train_runtime": 1548.7146, "train_tokens_per_second": 704.746 }, { "epoch": 0.5863027546120798, "grad_norm": 1.5631988048553467, "learning_rate": 1.4187341772151898e-05, "loss": 0.10082489997148514, "num_input_tokens_seen": 1093596, "step": 580, "train_runtime": 1550.9634, "train_tokens_per_second": 705.108 }, { "epoch": 0.5873136214303766, "grad_norm": 1.7483549118041992, "learning_rate": 1.417721518987342e-05, "loss": 0.11064396798610687, "num_input_tokens_seen": 1095482, "step": 581, "train_runtime": 1553.1398, "train_tokens_per_second": 705.334 }, { "epoch": 0.5883244882486732, "grad_norm": 1.8992518186569214, "learning_rate": 1.4167088607594938e-05, "loss": 0.11621041595935822, "num_input_tokens_seen": 1097222, "step": 582, "train_runtime": 1555.3131, "train_tokens_per_second": 705.467 }, { "epoch": 0.5893353550669699, "grad_norm": 1.825927734375, "learning_rate": 1.4156962025316456e-05, "loss": 0.10483191162347794, "num_input_tokens_seen": 1099366, "step": 583, "train_runtime": 1557.5525, "train_tokens_per_second": 705.829 }, { "epoch": 0.5903462218852666, "grad_norm": 1.885602355003357, "learning_rate": 1.4146835443037976e-05, "loss": 0.12778542935848236, "num_input_tokens_seen": 1101232, "step": 584, "train_runtime": 1559.7249, "train_tokens_per_second": 706.042 }, { "epoch": 0.5913570887035633, "grad_norm": 2.019209623336792, "learning_rate": 1.4136708860759494e-05, "loss": 0.14271020889282227, "num_input_tokens_seen": 1103144, "step": 585, "train_runtime": 1561.9296, "train_tokens_per_second": 706.27 }, { "epoch": 0.59236795552186, "grad_norm": 1.578254222869873, "learning_rate": 1.4126582278481013e-05, "loss": 0.099541574716568, "num_input_tokens_seen": 1105134, "step": 586, "train_runtime": 1564.1348, "train_tokens_per_second": 706.547 }, { "epoch": 0.5933788223401567, "grad_norm": 1.7057363986968994, "learning_rate": 1.4116455696202534e-05, "loss": 0.11436079442501068, "num_input_tokens_seen": 1106752, "step": 587, "train_runtime": 1566.3434, "train_tokens_per_second": 706.583 }, { "epoch": 0.5943896891584534, "grad_norm": 2.0448598861694336, "learning_rate": 1.4106329113924051e-05, "loss": 0.09593261778354645, "num_input_tokens_seen": 1108152, "step": 588, "train_runtime": 1568.4306, "train_tokens_per_second": 706.536 }, { "epoch": 0.59540055597675, "grad_norm": 1.9079177379608154, "learning_rate": 1.409620253164557e-05, "loss": 0.09666799008846283, "num_input_tokens_seen": 1109994, "step": 589, "train_runtime": 1570.6073, "train_tokens_per_second": 706.729 }, { "epoch": 0.5964114227950468, "grad_norm": 1.7336835861206055, "learning_rate": 1.4086075949367091e-05, "loss": 0.10393904149532318, "num_input_tokens_seen": 1112366, "step": 590, "train_runtime": 1572.9235, "train_tokens_per_second": 707.197 }, { "epoch": 0.5974222896133434, "grad_norm": 1.9441266059875488, "learning_rate": 1.4075949367088608e-05, "loss": 0.11883354932069778, "num_input_tokens_seen": 1114230, "step": 591, "train_runtime": 1575.1086, "train_tokens_per_second": 707.399 }, { "epoch": 0.5984331564316401, "grad_norm": 2.1221354007720947, "learning_rate": 1.4065822784810127e-05, "loss": 0.11868761479854584, "num_input_tokens_seen": 1115886, "step": 592, "train_runtime": 1577.2972, "train_tokens_per_second": 707.467 }, { "epoch": 0.5994440232499368, "grad_norm": 1.576833724975586, "learning_rate": 1.4055696202531647e-05, "loss": 0.08950021117925644, "num_input_tokens_seen": 1117622, "step": 593, "train_runtime": 1579.4803, "train_tokens_per_second": 707.588 }, { "epoch": 0.6004548900682335, "grad_norm": 1.7010703086853027, "learning_rate": 1.4045569620253166e-05, "loss": 0.0935027077794075, "num_input_tokens_seen": 1119962, "step": 594, "train_runtime": 1581.7795, "train_tokens_per_second": 708.039 }, { "epoch": 0.6004548900682335, "eval_loss": 0.40808728337287903, "eval_runtime": 51.7638, "eval_samples_per_second": 16.981, "eval_steps_per_second": 8.5, "num_input_tokens_seen": 1119962, "step": 594 }, { "epoch": 0.6014657568865301, "grad_norm": 2.1104953289031982, "learning_rate": 1.4035443037974685e-05, "loss": 0.1295463591814041, "num_input_tokens_seen": 1121502, "step": 595, "train_runtime": 1635.6536, "train_tokens_per_second": 685.66 }, { "epoch": 0.6024766237048269, "grad_norm": 1.6768834590911865, "learning_rate": 1.4025316455696202e-05, "loss": 0.09007760137319565, "num_input_tokens_seen": 1123712, "step": 596, "train_runtime": 1637.8906, "train_tokens_per_second": 686.073 }, { "epoch": 0.6034874905231236, "grad_norm": 1.860482931137085, "learning_rate": 1.4015189873417723e-05, "loss": 0.09720242768526077, "num_input_tokens_seen": 1125700, "step": 597, "train_runtime": 1640.1269, "train_tokens_per_second": 686.349 }, { "epoch": 0.6044983573414203, "grad_norm": 1.9982037544250488, "learning_rate": 1.4005063291139242e-05, "loss": 0.13862156867980957, "num_input_tokens_seen": 1127428, "step": 598, "train_runtime": 1642.2882, "train_tokens_per_second": 686.498 }, { "epoch": 0.605509224159717, "grad_norm": 3.5887558460235596, "learning_rate": 1.399493670886076e-05, "loss": 0.11241520941257477, "num_input_tokens_seen": 1128956, "step": 599, "train_runtime": 1644.4132, "train_tokens_per_second": 686.54 }, { "epoch": 0.6065200909780136, "grad_norm": 1.8000441789627075, "learning_rate": 1.398481012658228e-05, "loss": 0.1194303035736084, "num_input_tokens_seen": 1130624, "step": 600, "train_runtime": 1646.5699, "train_tokens_per_second": 686.654 }, { "epoch": 0.6075309577963104, "grad_norm": 1.8652498722076416, "learning_rate": 1.3974683544303798e-05, "loss": 0.11491431295871735, "num_input_tokens_seen": 1132692, "step": 601, "train_runtime": 1656.0443, "train_tokens_per_second": 683.974 }, { "epoch": 0.608541824614607, "grad_norm": 2.5798568725585938, "learning_rate": 1.3964556962025317e-05, "loss": 0.1649254560470581, "num_input_tokens_seen": 1134506, "step": 602, "train_runtime": 1658.4002, "train_tokens_per_second": 684.097 }, { "epoch": 0.6095526914329037, "grad_norm": 1.4901211261749268, "learning_rate": 1.3954430379746837e-05, "loss": 0.08390946686267853, "num_input_tokens_seen": 1136336, "step": 603, "train_runtime": 1660.5878, "train_tokens_per_second": 684.297 }, { "epoch": 0.6105635582512005, "grad_norm": 1.8414229154586792, "learning_rate": 1.3944303797468355e-05, "loss": 0.08612199127674103, "num_input_tokens_seen": 1138190, "step": 604, "train_runtime": 1662.8355, "train_tokens_per_second": 684.487 }, { "epoch": 0.6115744250694971, "grad_norm": 2.048098087310791, "learning_rate": 1.3934177215189874e-05, "loss": 0.1272742748260498, "num_input_tokens_seen": 1140056, "step": 605, "train_runtime": 1665.0136, "train_tokens_per_second": 684.713 }, { "epoch": 0.6125852918877938, "grad_norm": 1.5180420875549316, "learning_rate": 1.3924050632911395e-05, "loss": 0.0807880088686943, "num_input_tokens_seen": 1141870, "step": 606, "train_runtime": 1667.2241, "train_tokens_per_second": 684.893 }, { "epoch": 0.6135961587060905, "grad_norm": 1.9689815044403076, "learning_rate": 1.3913924050632912e-05, "loss": 0.11715269088745117, "num_input_tokens_seen": 1143626, "step": 607, "train_runtime": 1669.4342, "train_tokens_per_second": 685.038 }, { "epoch": 0.6146070255243872, "grad_norm": 1.6542195081710815, "learning_rate": 1.3903797468354431e-05, "loss": 0.1243257075548172, "num_input_tokens_seen": 1145798, "step": 608, "train_runtime": 1671.6778, "train_tokens_per_second": 685.418 }, { "epoch": 0.6156178923426838, "grad_norm": 1.7163242101669312, "learning_rate": 1.389367088607595e-05, "loss": 0.09878333657979965, "num_input_tokens_seen": 1147482, "step": 609, "train_runtime": 1673.8422, "train_tokens_per_second": 685.538 }, { "epoch": 0.6166287591609806, "grad_norm": 1.6032116413116455, "learning_rate": 1.388354430379747e-05, "loss": 0.09439636766910553, "num_input_tokens_seen": 1149396, "step": 610, "train_runtime": 1676.0515, "train_tokens_per_second": 685.776 }, { "epoch": 0.6176396259792772, "grad_norm": 1.5943632125854492, "learning_rate": 1.3873417721518988e-05, "loss": 0.07847783714532852, "num_input_tokens_seen": 1150896, "step": 611, "train_runtime": 1678.1657, "train_tokens_per_second": 685.806 }, { "epoch": 0.6186504927975739, "grad_norm": 1.8938099145889282, "learning_rate": 1.3863291139240507e-05, "loss": 0.1550203561782837, "num_input_tokens_seen": 1153316, "step": 612, "train_runtime": 1680.4594, "train_tokens_per_second": 686.31 }, { "epoch": 0.6196613596158707, "grad_norm": 2.2747018337249756, "learning_rate": 1.3853164556962027e-05, "loss": 0.10700055956840515, "num_input_tokens_seen": 1155122, "step": 613, "train_runtime": 1682.6449, "train_tokens_per_second": 686.492 }, { "epoch": 0.6206722264341673, "grad_norm": 1.7282172441482544, "learning_rate": 1.3843037974683546e-05, "loss": 0.08904734998941422, "num_input_tokens_seen": 1156720, "step": 614, "train_runtime": 1684.7665, "train_tokens_per_second": 686.576 }, { "epoch": 0.621683093252464, "grad_norm": 1.474847435951233, "learning_rate": 1.3832911392405065e-05, "loss": 0.08788709342479706, "num_input_tokens_seen": 1158748, "step": 615, "train_runtime": 1686.9879, "train_tokens_per_second": 686.874 }, { "epoch": 0.6226939600707607, "grad_norm": 1.943629503250122, "learning_rate": 1.3822784810126584e-05, "loss": 0.13403654098510742, "num_input_tokens_seen": 1160814, "step": 616, "train_runtime": 1689.1839, "train_tokens_per_second": 687.204 }, { "epoch": 0.6237048268890574, "grad_norm": 1.8858280181884766, "learning_rate": 1.3812658227848101e-05, "loss": 0.14593029022216797, "num_input_tokens_seen": 1162850, "step": 617, "train_runtime": 1691.4292, "train_tokens_per_second": 687.496 }, { "epoch": 0.624715693707354, "grad_norm": 1.5736969709396362, "learning_rate": 1.3802531645569622e-05, "loss": 0.098531574010849, "num_input_tokens_seen": 1165406, "step": 618, "train_runtime": 1693.7998, "train_tokens_per_second": 688.042 }, { "epoch": 0.6257265605256508, "grad_norm": 2.322218894958496, "learning_rate": 1.3792405063291141e-05, "loss": 0.12939922511577606, "num_input_tokens_seen": 1167150, "step": 619, "train_runtime": 1695.9924, "train_tokens_per_second": 688.181 }, { "epoch": 0.6267374273439474, "grad_norm": 1.5616765022277832, "learning_rate": 1.3782278481012658e-05, "loss": 0.11167999356985092, "num_input_tokens_seen": 1169178, "step": 620, "train_runtime": 1698.2538, "train_tokens_per_second": 688.459 }, { "epoch": 0.6277482941622441, "grad_norm": 1.7037088871002197, "learning_rate": 1.377215189873418e-05, "loss": 0.10070261359214783, "num_input_tokens_seen": 1170776, "step": 621, "train_runtime": 1700.4086, "train_tokens_per_second": 688.526 }, { "epoch": 0.6287591609805409, "grad_norm": 1.8399248123168945, "learning_rate": 1.3762025316455698e-05, "loss": 0.08328185230493546, "num_input_tokens_seen": 1172508, "step": 622, "train_runtime": 1702.5938, "train_tokens_per_second": 688.66 }, { "epoch": 0.6297700277988375, "grad_norm": 1.5935235023498535, "learning_rate": 1.3751898734177216e-05, "loss": 0.10739567875862122, "num_input_tokens_seen": 1174694, "step": 623, "train_runtime": 1704.893, "train_tokens_per_second": 689.013 }, { "epoch": 0.6307808946171342, "grad_norm": 1.9569668769836426, "learning_rate": 1.3741772151898736e-05, "loss": 0.09974449872970581, "num_input_tokens_seen": 1176490, "step": 624, "train_runtime": 1707.1196, "train_tokens_per_second": 689.167 }, { "epoch": 0.6317917614354309, "grad_norm": 1.612789511680603, "learning_rate": 1.3731645569620254e-05, "loss": 0.08718269318342209, "num_input_tokens_seen": 1178784, "step": 625, "train_runtime": 1709.3876, "train_tokens_per_second": 689.594 }, { "epoch": 0.6328026282537276, "grad_norm": 1.868043065071106, "learning_rate": 1.3721518987341773e-05, "loss": 0.10843443125486374, "num_input_tokens_seen": 1180080, "step": 626, "train_runtime": 1711.5052, "train_tokens_per_second": 689.498 }, { "epoch": 0.6338134950720242, "grad_norm": 1.8122128248214722, "learning_rate": 1.3711392405063294e-05, "loss": 0.08479487895965576, "num_input_tokens_seen": 1181322, "step": 627, "train_runtime": 1713.538, "train_tokens_per_second": 689.405 }, { "epoch": 0.634824361890321, "grad_norm": 1.8465759754180908, "learning_rate": 1.3701265822784811e-05, "loss": 0.14208438992500305, "num_input_tokens_seen": 1183382, "step": 628, "train_runtime": 1715.7791, "train_tokens_per_second": 689.705 }, { "epoch": 0.6358352287086176, "grad_norm": 1.786992073059082, "learning_rate": 1.369113924050633e-05, "loss": 0.11269376426935196, "num_input_tokens_seen": 1185392, "step": 629, "train_runtime": 1717.9893, "train_tokens_per_second": 689.988 }, { "epoch": 0.6368460955269143, "grad_norm": 1.9114515781402588, "learning_rate": 1.3681012658227851e-05, "loss": 0.13633716106414795, "num_input_tokens_seen": 1187446, "step": 630, "train_runtime": 1720.2564, "train_tokens_per_second": 690.273 }, { "epoch": 0.637856962345211, "grad_norm": 1.664825201034546, "learning_rate": 1.3670886075949368e-05, "loss": 0.1060963124036789, "num_input_tokens_seen": 1189472, "step": 631, "train_runtime": 1729.7407, "train_tokens_per_second": 687.659 }, { "epoch": 0.6388678291635077, "grad_norm": 1.6935018301010132, "learning_rate": 1.3660759493670887e-05, "loss": 0.11799652874469757, "num_input_tokens_seen": 1191462, "step": 632, "train_runtime": 1731.9926, "train_tokens_per_second": 687.914 }, { "epoch": 0.6398786959818044, "grad_norm": 1.6820141077041626, "learning_rate": 1.3650632911392405e-05, "loss": 0.11976519227027893, "num_input_tokens_seen": 1193630, "step": 633, "train_runtime": 1734.3499, "train_tokens_per_second": 688.229 }, { "epoch": 0.6408895628001011, "grad_norm": 1.840476155281067, "learning_rate": 1.3640506329113926e-05, "loss": 0.10967463999986649, "num_input_tokens_seen": 1195248, "step": 634, "train_runtime": 1736.5188, "train_tokens_per_second": 688.301 }, { "epoch": 0.6419004296183978, "grad_norm": 1.674445629119873, "learning_rate": 1.3630379746835445e-05, "loss": 0.1125248521566391, "num_input_tokens_seen": 1197508, "step": 635, "train_runtime": 1738.8871, "train_tokens_per_second": 688.663 }, { "epoch": 0.6429112964366944, "grad_norm": 1.5510694980621338, "learning_rate": 1.3620253164556962e-05, "loss": 0.10820190608501434, "num_input_tokens_seen": 1199538, "step": 636, "train_runtime": 1741.1192, "train_tokens_per_second": 688.947 }, { "epoch": 0.6439221632549912, "grad_norm": 1.8009198904037476, "learning_rate": 1.3610126582278483e-05, "loss": 0.11245355755090714, "num_input_tokens_seen": 1201214, "step": 637, "train_runtime": 1743.3326, "train_tokens_per_second": 689.033 }, { "epoch": 0.6449330300732878, "grad_norm": 1.7082339525222778, "learning_rate": 1.3600000000000002e-05, "loss": 0.10139073431491852, "num_input_tokens_seen": 1202928, "step": 638, "train_runtime": 1745.5632, "train_tokens_per_second": 689.135 }, { "epoch": 0.6459438968915845, "grad_norm": 1.6657874584197998, "learning_rate": 1.358987341772152e-05, "loss": 0.09136809408664703, "num_input_tokens_seen": 1205536, "step": 639, "train_runtime": 1747.9084, "train_tokens_per_second": 689.702 }, { "epoch": 0.6469547637098813, "grad_norm": 1.4045131206512451, "learning_rate": 1.357974683544304e-05, "loss": 0.10315302014350891, "num_input_tokens_seen": 1208210, "step": 640, "train_runtime": 1750.2476, "train_tokens_per_second": 690.308 }, { "epoch": 0.6479656305281779, "grad_norm": 1.7283861637115479, "learning_rate": 1.3569620253164557e-05, "loss": 0.10815608501434326, "num_input_tokens_seen": 1209926, "step": 641, "train_runtime": 1752.433, "train_tokens_per_second": 690.426 }, { "epoch": 0.6489764973464746, "grad_norm": 2.3188953399658203, "learning_rate": 1.3559493670886077e-05, "loss": 0.1732199639081955, "num_input_tokens_seen": 1211520, "step": 642, "train_runtime": 1754.5886, "train_tokens_per_second": 690.487 }, { "epoch": 0.6499873641647713, "grad_norm": 1.921383023262024, "learning_rate": 1.3549367088607597e-05, "loss": 0.10076595842838287, "num_input_tokens_seen": 1213840, "step": 643, "train_runtime": 1756.9758, "train_tokens_per_second": 690.869 }, { "epoch": 0.650998230983068, "grad_norm": 2.255113363265991, "learning_rate": 1.3539240506329115e-05, "loss": 0.15450282394886017, "num_input_tokens_seen": 1215450, "step": 644, "train_runtime": 1759.1032, "train_tokens_per_second": 690.949 }, { "epoch": 0.6520090978013646, "grad_norm": 1.5902783870697021, "learning_rate": 1.3529113924050634e-05, "loss": 0.11672405898571014, "num_input_tokens_seen": 1217814, "step": 645, "train_runtime": 1761.4052, "train_tokens_per_second": 691.388 }, { "epoch": 0.6530199646196614, "grad_norm": 1.8295010328292847, "learning_rate": 1.3518987341772155e-05, "loss": 0.12819403409957886, "num_input_tokens_seen": 1220000, "step": 646, "train_runtime": 1763.6971, "train_tokens_per_second": 691.729 }, { "epoch": 0.654030831437958, "grad_norm": 1.8442647457122803, "learning_rate": 1.3508860759493672e-05, "loss": 0.10710816830396652, "num_input_tokens_seen": 1221386, "step": 647, "train_runtime": 1765.8024, "train_tokens_per_second": 691.689 }, { "epoch": 0.6550416982562547, "grad_norm": 1.8489795923233032, "learning_rate": 1.3498734177215191e-05, "loss": 0.09648443013429642, "num_input_tokens_seen": 1222972, "step": 648, "train_runtime": 1767.9622, "train_tokens_per_second": 691.741 }, { "epoch": 0.6560525650745515, "grad_norm": 1.423836350440979, "learning_rate": 1.3488607594936708e-05, "loss": 0.08564922958612442, "num_input_tokens_seen": 1224776, "step": 649, "train_runtime": 1770.1922, "train_tokens_per_second": 691.889 }, { "epoch": 0.6570634318928481, "grad_norm": 1.779313087463379, "learning_rate": 1.347848101265823e-05, "loss": 0.11435481905937195, "num_input_tokens_seen": 1226784, "step": 650, "train_runtime": 1772.4521, "train_tokens_per_second": 692.139 }, { "epoch": 0.6580742987111448, "grad_norm": 1.8369637727737427, "learning_rate": 1.3468354430379748e-05, "loss": 0.11493565142154694, "num_input_tokens_seen": 1228484, "step": 651, "train_runtime": 1774.7013, "train_tokens_per_second": 692.22 }, { "epoch": 0.6590851655294415, "grad_norm": 1.5541417598724365, "learning_rate": 1.3458227848101266e-05, "loss": 0.09260427206754684, "num_input_tokens_seen": 1230210, "step": 652, "train_runtime": 1776.8983, "train_tokens_per_second": 692.336 }, { "epoch": 0.6600960323477382, "grad_norm": 2.0325305461883545, "learning_rate": 1.3448101265822786e-05, "loss": 0.15358027815818787, "num_input_tokens_seen": 1232078, "step": 653, "train_runtime": 1779.1357, "train_tokens_per_second": 692.515 }, { "epoch": 0.6611068991660348, "grad_norm": 1.5942155122756958, "learning_rate": 1.3437974683544306e-05, "loss": 0.104779914021492, "num_input_tokens_seen": 1233970, "step": 654, "train_runtime": 1781.3051, "train_tokens_per_second": 692.734 }, { "epoch": 0.6621177659843316, "grad_norm": 1.6773817539215088, "learning_rate": 1.3427848101265823e-05, "loss": 0.1102675199508667, "num_input_tokens_seen": 1235770, "step": 655, "train_runtime": 1783.5556, "train_tokens_per_second": 692.869 }, { "epoch": 0.6631286328026282, "grad_norm": 1.7004425525665283, "learning_rate": 1.3417721518987344e-05, "loss": 0.09976387023925781, "num_input_tokens_seen": 1237816, "step": 656, "train_runtime": 1785.807, "train_tokens_per_second": 693.141 }, { "epoch": 0.6641394996209249, "grad_norm": 1.7719749212265015, "learning_rate": 1.3407594936708861e-05, "loss": 0.09984132647514343, "num_input_tokens_seen": 1240466, "step": 657, "train_runtime": 1788.2125, "train_tokens_per_second": 693.69 }, { "epoch": 0.6651503664392217, "grad_norm": 1.3475958108901978, "learning_rate": 1.339746835443038e-05, "loss": 0.09303415566682816, "num_input_tokens_seen": 1242766, "step": 658, "train_runtime": 1790.5161, "train_tokens_per_second": 694.083 }, { "epoch": 0.6661612332575183, "grad_norm": 1.8140196800231934, "learning_rate": 1.3387341772151901e-05, "loss": 0.0961821973323822, "num_input_tokens_seen": 1244288, "step": 659, "train_runtime": 1792.6296, "train_tokens_per_second": 694.113 }, { "epoch": 0.6671721000758151, "grad_norm": 1.5088071823120117, "learning_rate": 1.3377215189873418e-05, "loss": 0.07277616858482361, "num_input_tokens_seen": 1245836, "step": 660, "train_runtime": 1794.7355, "train_tokens_per_second": 694.161 }, { "epoch": 0.6681829668941117, "grad_norm": 1.5696074962615967, "learning_rate": 1.3367088607594937e-05, "loss": 0.08693429082632065, "num_input_tokens_seen": 1247956, "step": 661, "train_runtime": 1804.2071, "train_tokens_per_second": 691.692 }, { "epoch": 0.6691938337124084, "grad_norm": 1.8871132135391235, "learning_rate": 1.3356962025316458e-05, "loss": 0.10091319680213928, "num_input_tokens_seen": 1249858, "step": 662, "train_runtime": 1806.4483, "train_tokens_per_second": 691.887 }, { "epoch": 0.6702047005307051, "grad_norm": 1.6133759021759033, "learning_rate": 1.3346835443037976e-05, "loss": 0.11935020238161087, "num_input_tokens_seen": 1252000, "step": 663, "train_runtime": 1808.7267, "train_tokens_per_second": 692.2 }, { "epoch": 0.6712155673490018, "grad_norm": 1.6783758401870728, "learning_rate": 1.3336708860759495e-05, "loss": 0.07670894265174866, "num_input_tokens_seen": 1253574, "step": 664, "train_runtime": 1810.8889, "train_tokens_per_second": 692.242 }, { "epoch": 0.6722264341672984, "grad_norm": 1.9245914220809937, "learning_rate": 1.3326582278481012e-05, "loss": 0.08715176582336426, "num_input_tokens_seen": 1255260, "step": 665, "train_runtime": 1813.0689, "train_tokens_per_second": 692.34 }, { "epoch": 0.6732373009855952, "grad_norm": 1.4565939903259277, "learning_rate": 1.3316455696202533e-05, "loss": 0.11130739748477936, "num_input_tokens_seen": 1257338, "step": 666, "train_runtime": 1815.3233, "train_tokens_per_second": 692.625 }, { "epoch": 0.6742481678038919, "grad_norm": 2.1480889320373535, "learning_rate": 1.3306329113924052e-05, "loss": 0.11984491348266602, "num_input_tokens_seen": 1259314, "step": 667, "train_runtime": 1817.5696, "train_tokens_per_second": 692.856 }, { "epoch": 0.6752590346221885, "grad_norm": 1.7935190200805664, "learning_rate": 1.329620253164557e-05, "loss": 0.09027568250894547, "num_input_tokens_seen": 1261426, "step": 668, "train_runtime": 1819.7888, "train_tokens_per_second": 693.172 }, { "epoch": 0.6762699014404853, "grad_norm": 1.55329167842865, "learning_rate": 1.328607594936709e-05, "loss": 0.09494169056415558, "num_input_tokens_seen": 1263376, "step": 669, "train_runtime": 1822.0588, "train_tokens_per_second": 693.378 }, { "epoch": 0.6772807682587819, "grad_norm": 1.898910641670227, "learning_rate": 1.327594936708861e-05, "loss": 0.10689137876033783, "num_input_tokens_seen": 1265248, "step": 670, "train_runtime": 1824.2729, "train_tokens_per_second": 693.563 }, { "epoch": 0.6782916350770786, "grad_norm": 2.039963483810425, "learning_rate": 1.3265822784810127e-05, "loss": 0.08548976480960846, "num_input_tokens_seen": 1267244, "step": 671, "train_runtime": 1826.4885, "train_tokens_per_second": 693.814 }, { "epoch": 0.6793025018953753, "grad_norm": 1.8944624662399292, "learning_rate": 1.3255696202531647e-05, "loss": 0.11550843715667725, "num_input_tokens_seen": 1269154, "step": 672, "train_runtime": 1828.6718, "train_tokens_per_second": 694.031 }, { "epoch": 0.680313368713672, "grad_norm": 1.735344648361206, "learning_rate": 1.3245569620253165e-05, "loss": 0.06827060878276825, "num_input_tokens_seen": 1270498, "step": 673, "train_runtime": 1830.7549, "train_tokens_per_second": 693.975 }, { "epoch": 0.6813242355319686, "grad_norm": 2.0431125164031982, "learning_rate": 1.3235443037974684e-05, "loss": 0.1385970413684845, "num_input_tokens_seen": 1272808, "step": 674, "train_runtime": 1833.0853, "train_tokens_per_second": 694.353 }, { "epoch": 0.6823351023502654, "grad_norm": 1.8650518655776978, "learning_rate": 1.3225316455696205e-05, "loss": 0.09701419621706009, "num_input_tokens_seen": 1274488, "step": 675, "train_runtime": 1835.2786, "train_tokens_per_second": 694.438 }, { "epoch": 0.683345969168562, "grad_norm": 2.133262872695923, "learning_rate": 1.3215189873417722e-05, "loss": 0.10070274770259857, "num_input_tokens_seen": 1275734, "step": 676, "train_runtime": 1837.312, "train_tokens_per_second": 694.348 }, { "epoch": 0.6843568359868587, "grad_norm": 1.8701945543289185, "learning_rate": 1.3205063291139241e-05, "loss": 0.10083901882171631, "num_input_tokens_seen": 1278096, "step": 677, "train_runtime": 1839.63, "train_tokens_per_second": 694.757 }, { "epoch": 0.6853677028051555, "grad_norm": 2.1649763584136963, "learning_rate": 1.3194936708860762e-05, "loss": 0.10348096489906311, "num_input_tokens_seen": 1279612, "step": 678, "train_runtime": 1841.7237, "train_tokens_per_second": 694.79 }, { "epoch": 0.6863785696234521, "grad_norm": 2.2240641117095947, "learning_rate": 1.318481012658228e-05, "loss": 0.14250193536281586, "num_input_tokens_seen": 1281712, "step": 679, "train_runtime": 1843.9929, "train_tokens_per_second": 695.074 }, { "epoch": 0.6873894364417488, "grad_norm": 1.875397801399231, "learning_rate": 1.3174683544303798e-05, "loss": 0.12258376181125641, "num_input_tokens_seen": 1284012, "step": 680, "train_runtime": 1846.2983, "train_tokens_per_second": 695.452 }, { "epoch": 0.6884003032600455, "grad_norm": 1.5993077754974365, "learning_rate": 1.3164556962025317e-05, "loss": 0.07303463667631149, "num_input_tokens_seen": 1285832, "step": 681, "train_runtime": 1848.5111, "train_tokens_per_second": 695.604 }, { "epoch": 0.6894111700783422, "grad_norm": 1.8077025413513184, "learning_rate": 1.3154430379746837e-05, "loss": 0.12092280387878418, "num_input_tokens_seen": 1287984, "step": 682, "train_runtime": 1850.78, "train_tokens_per_second": 695.914 }, { "epoch": 0.6904220368966388, "grad_norm": 2.380758285522461, "learning_rate": 1.3144303797468356e-05, "loss": 0.15384668111801147, "num_input_tokens_seen": 1289848, "step": 683, "train_runtime": 1852.9968, "train_tokens_per_second": 696.088 }, { "epoch": 0.6914329037149356, "grad_norm": 2.1788816452026367, "learning_rate": 1.3134177215189875e-05, "loss": 0.12366777658462524, "num_input_tokens_seen": 1291486, "step": 684, "train_runtime": 1855.2049, "train_tokens_per_second": 696.142 }, { "epoch": 0.6924437705332323, "grad_norm": 1.907159447669983, "learning_rate": 1.3124050632911394e-05, "loss": 0.12734639644622803, "num_input_tokens_seen": 1293226, "step": 685, "train_runtime": 1857.4282, "train_tokens_per_second": 696.245 }, { "epoch": 0.6934546373515289, "grad_norm": 1.6104480028152466, "learning_rate": 1.3113924050632913e-05, "loss": 0.0874997153878212, "num_input_tokens_seen": 1294980, "step": 686, "train_runtime": 1859.6324, "train_tokens_per_second": 696.363 }, { "epoch": 0.6944655041698257, "grad_norm": 1.7767722606658936, "learning_rate": 1.310379746835443e-05, "loss": 0.08478476107120514, "num_input_tokens_seen": 1296604, "step": 687, "train_runtime": 1861.77, "train_tokens_per_second": 696.436 }, { "epoch": 0.6954763709881223, "grad_norm": 1.8747044801712036, "learning_rate": 1.3093670886075951e-05, "loss": 0.09321515262126923, "num_input_tokens_seen": 1298266, "step": 688, "train_runtime": 1863.8942, "train_tokens_per_second": 696.534 }, { "epoch": 0.696487237806419, "grad_norm": 1.5795440673828125, "learning_rate": 1.3083544303797468e-05, "loss": 0.0884488895535469, "num_input_tokens_seen": 1300102, "step": 689, "train_runtime": 1866.1114, "train_tokens_per_second": 696.69 }, { "epoch": 0.6974981046247157, "grad_norm": 1.7722744941711426, "learning_rate": 1.3073417721518988e-05, "loss": 0.11583846807479858, "num_input_tokens_seen": 1301776, "step": 690, "train_runtime": 1868.2577, "train_tokens_per_second": 696.786 }, { "epoch": 0.6985089714430124, "grad_norm": 2.364607810974121, "learning_rate": 1.3063291139240508e-05, "loss": 0.08460243046283722, "num_input_tokens_seen": 1303442, "step": 691, "train_runtime": 1877.5728, "train_tokens_per_second": 694.216 }, { "epoch": 0.699519838261309, "grad_norm": 2.0333120822906494, "learning_rate": 1.3053164556962026e-05, "loss": 0.12729576230049133, "num_input_tokens_seen": 1305156, "step": 692, "train_runtime": 1879.7593, "train_tokens_per_second": 694.321 }, { "epoch": 0.7005307050796058, "grad_norm": 1.848425030708313, "learning_rate": 1.3043037974683545e-05, "loss": 0.1383374184370041, "num_input_tokens_seen": 1306902, "step": 693, "train_runtime": 1881.9951, "train_tokens_per_second": 694.424 }, { "epoch": 0.7015415718979024, "grad_norm": 1.8356151580810547, "learning_rate": 1.3032911392405066e-05, "loss": 0.10371893644332886, "num_input_tokens_seen": 1308664, "step": 694, "train_runtime": 1884.1682, "train_tokens_per_second": 694.558 }, { "epoch": 0.7025524387161991, "grad_norm": 1.4701520204544067, "learning_rate": 1.3022784810126583e-05, "loss": 0.10076653957366943, "num_input_tokens_seen": 1310814, "step": 695, "train_runtime": 1886.4556, "train_tokens_per_second": 694.855 }, { "epoch": 0.7035633055344959, "grad_norm": 2.1058008670806885, "learning_rate": 1.3012658227848102e-05, "loss": 0.11140087246894836, "num_input_tokens_seen": 1312786, "step": 696, "train_runtime": 1888.7239, "train_tokens_per_second": 695.065 }, { "epoch": 0.7045741723527925, "grad_norm": 1.3815808296203613, "learning_rate": 1.3002531645569621e-05, "loss": 0.07784861326217651, "num_input_tokens_seen": 1315162, "step": 697, "train_runtime": 1891.0169, "train_tokens_per_second": 695.479 }, { "epoch": 0.7055850391710892, "grad_norm": 1.7595512866973877, "learning_rate": 1.299240506329114e-05, "loss": 0.1133749857544899, "num_input_tokens_seen": 1316704, "step": 698, "train_runtime": 1893.1302, "train_tokens_per_second": 695.517 }, { "epoch": 0.7065959059893859, "grad_norm": 2.2063496112823486, "learning_rate": 1.298227848101266e-05, "loss": 0.10239047557115555, "num_input_tokens_seen": 1318362, "step": 699, "train_runtime": 1895.2615, "train_tokens_per_second": 695.61 }, { "epoch": 0.7076067728076826, "grad_norm": 2.041888952255249, "learning_rate": 1.2972151898734178e-05, "loss": 0.12548968195915222, "num_input_tokens_seen": 1319922, "step": 700, "train_runtime": 1897.3866, "train_tokens_per_second": 695.653 }, { "epoch": 0.7086176396259792, "grad_norm": 1.497320294380188, "learning_rate": 1.2962025316455697e-05, "loss": 0.0973314642906189, "num_input_tokens_seen": 1322010, "step": 701, "train_runtime": 1899.6352, "train_tokens_per_second": 695.928 }, { "epoch": 0.709628506444276, "grad_norm": 1.729615330696106, "learning_rate": 1.2951898734177217e-05, "loss": 0.12024053931236267, "num_input_tokens_seen": 1324172, "step": 702, "train_runtime": 1901.9102, "train_tokens_per_second": 696.233 }, { "epoch": 0.7106393732625726, "grad_norm": 1.5231678485870361, "learning_rate": 1.2941772151898736e-05, "loss": 0.07961850613355637, "num_input_tokens_seen": 1325838, "step": 703, "train_runtime": 1904.0819, "train_tokens_per_second": 696.314 }, { "epoch": 0.7116502400808693, "grad_norm": 2.207820415496826, "learning_rate": 1.2931645569620255e-05, "loss": 0.11461731791496277, "num_input_tokens_seen": 1327436, "step": 704, "train_runtime": 1906.1964, "train_tokens_per_second": 696.379 }, { "epoch": 0.7126611068991661, "grad_norm": 1.5595227479934692, "learning_rate": 1.2921518987341772e-05, "loss": 0.08717923611402512, "num_input_tokens_seen": 1329294, "step": 705, "train_runtime": 1908.4102, "train_tokens_per_second": 696.545 }, { "epoch": 0.7136719737174627, "grad_norm": 1.8853257894515991, "learning_rate": 1.2911392405063293e-05, "loss": 0.09264266490936279, "num_input_tokens_seen": 1331232, "step": 706, "train_runtime": 1910.6381, "train_tokens_per_second": 696.747 }, { "epoch": 0.7146828405357594, "grad_norm": 1.9685697555541992, "learning_rate": 1.2901265822784812e-05, "loss": 0.13390126824378967, "num_input_tokens_seen": 1333056, "step": 707, "train_runtime": 1912.8921, "train_tokens_per_second": 696.88 }, { "epoch": 0.7156937073540561, "grad_norm": 1.809499979019165, "learning_rate": 1.289113924050633e-05, "loss": 0.12011405825614929, "num_input_tokens_seen": 1334582, "step": 708, "train_runtime": 1915.0501, "train_tokens_per_second": 696.891 }, { "epoch": 0.7167045741723528, "grad_norm": 1.5666016340255737, "learning_rate": 1.288101265822785e-05, "loss": 0.08794930577278137, "num_input_tokens_seen": 1336404, "step": 709, "train_runtime": 1917.3004, "train_tokens_per_second": 697.024 }, { "epoch": 0.7177154409906494, "grad_norm": 1.8679513931274414, "learning_rate": 1.287088607594937e-05, "loss": 0.1294182687997818, "num_input_tokens_seen": 1338188, "step": 710, "train_runtime": 1919.4672, "train_tokens_per_second": 697.166 }, { "epoch": 0.7187263078089462, "grad_norm": 1.5189850330352783, "learning_rate": 1.2860759493670887e-05, "loss": 0.09942683577537537, "num_input_tokens_seen": 1340470, "step": 711, "train_runtime": 1921.7736, "train_tokens_per_second": 697.517 }, { "epoch": 0.7197371746272428, "grad_norm": 2.1296935081481934, "learning_rate": 1.2850632911392407e-05, "loss": 0.11390013992786407, "num_input_tokens_seen": 1342374, "step": 712, "train_runtime": 1923.9525, "train_tokens_per_second": 697.717 }, { "epoch": 0.7207480414455395, "grad_norm": 1.7226743698120117, "learning_rate": 1.2840506329113925e-05, "loss": 0.08570823073387146, "num_input_tokens_seen": 1344294, "step": 713, "train_runtime": 1926.1609, "train_tokens_per_second": 697.914 }, { "epoch": 0.7217589082638363, "grad_norm": 1.4276052713394165, "learning_rate": 1.2830379746835444e-05, "loss": 0.08571764081716537, "num_input_tokens_seen": 1346268, "step": 714, "train_runtime": 1928.3676, "train_tokens_per_second": 698.139 }, { "epoch": 0.7227697750821329, "grad_norm": 1.7173999547958374, "learning_rate": 1.2820253164556965e-05, "loss": 0.09007744491100311, "num_input_tokens_seen": 1347826, "step": 715, "train_runtime": 1930.5239, "train_tokens_per_second": 698.166 }, { "epoch": 0.7237806419004296, "grad_norm": 1.850311279296875, "learning_rate": 1.2810126582278482e-05, "loss": 0.10102897882461548, "num_input_tokens_seen": 1349612, "step": 716, "train_runtime": 1932.706, "train_tokens_per_second": 698.302 }, { "epoch": 0.7247915087187263, "grad_norm": 1.758142113685608, "learning_rate": 1.2800000000000001e-05, "loss": 0.10980450361967087, "num_input_tokens_seen": 1351630, "step": 717, "train_runtime": 1934.9169, "train_tokens_per_second": 698.547 }, { "epoch": 0.725802375537023, "grad_norm": 1.403580904006958, "learning_rate": 1.2789873417721522e-05, "loss": 0.09110099077224731, "num_input_tokens_seen": 1353802, "step": 718, "train_runtime": 1937.221, "train_tokens_per_second": 698.837 }, { "epoch": 0.7268132423553196, "grad_norm": 1.5719237327575684, "learning_rate": 1.277974683544304e-05, "loss": 0.08539742976427078, "num_input_tokens_seen": 1355654, "step": 719, "train_runtime": 1939.4297, "train_tokens_per_second": 698.996 }, { "epoch": 0.7278241091736164, "grad_norm": 2.1756863594055176, "learning_rate": 1.2769620253164558e-05, "loss": 0.15095317363739014, "num_input_tokens_seen": 1357500, "step": 720, "train_runtime": 1941.654, "train_tokens_per_second": 699.146 }, { "epoch": 0.728834975991913, "grad_norm": 1.7486422061920166, "learning_rate": 1.2759493670886076e-05, "loss": 0.10526642203330994, "num_input_tokens_seen": 1359508, "step": 721, "train_runtime": 1951.0673, "train_tokens_per_second": 696.802 }, { "epoch": 0.7298458428102097, "grad_norm": 1.548586130142212, "learning_rate": 1.2749367088607597e-05, "loss": 0.09513578563928604, "num_input_tokens_seen": 1361332, "step": 722, "train_runtime": 1953.3023, "train_tokens_per_second": 696.939 }, { "epoch": 0.7308567096285065, "grad_norm": 1.6462899446487427, "learning_rate": 1.2739240506329116e-05, "loss": 0.10609134286642075, "num_input_tokens_seen": 1363258, "step": 723, "train_runtime": 1955.588, "train_tokens_per_second": 697.109 }, { "epoch": 0.7318675764468031, "grad_norm": 1.4377866983413696, "learning_rate": 1.2729113924050633e-05, "loss": 0.07567666471004486, "num_input_tokens_seen": 1365702, "step": 724, "train_runtime": 1957.9287, "train_tokens_per_second": 697.524 }, { "epoch": 0.7328784432650999, "grad_norm": 1.8099792003631592, "learning_rate": 1.2718987341772154e-05, "loss": 0.08297598361968994, "num_input_tokens_seen": 1367666, "step": 725, "train_runtime": 1960.1522, "train_tokens_per_second": 697.735 }, { "epoch": 0.7338893100833965, "grad_norm": 1.7828843593597412, "learning_rate": 1.2708860759493671e-05, "loss": 0.09248098731040955, "num_input_tokens_seen": 1369268, "step": 726, "train_runtime": 1962.2784, "train_tokens_per_second": 697.795 }, { "epoch": 0.7349001769016932, "grad_norm": 2.007511615753174, "learning_rate": 1.269873417721519e-05, "loss": 0.09541449695825577, "num_input_tokens_seen": 1370694, "step": 727, "train_runtime": 1964.3707, "train_tokens_per_second": 697.778 }, { "epoch": 0.7359110437199899, "grad_norm": 1.7251880168914795, "learning_rate": 1.2688607594936711e-05, "loss": 0.11526394635438919, "num_input_tokens_seen": 1372434, "step": 728, "train_runtime": 1966.5293, "train_tokens_per_second": 697.897 }, { "epoch": 0.7369219105382866, "grad_norm": 1.4944250583648682, "learning_rate": 1.2678481012658228e-05, "loss": 0.0895615816116333, "num_input_tokens_seen": 1374256, "step": 729, "train_runtime": 1968.7071, "train_tokens_per_second": 698.05 }, { "epoch": 0.7379327773565832, "grad_norm": 1.6431430578231812, "learning_rate": 1.2668354430379748e-05, "loss": 0.09937413781881332, "num_input_tokens_seen": 1376118, "step": 730, "train_runtime": 1970.9224, "train_tokens_per_second": 698.21 }, { "epoch": 0.73894364417488, "grad_norm": 1.801094889640808, "learning_rate": 1.2658227848101268e-05, "loss": 0.09845241904258728, "num_input_tokens_seen": 1377884, "step": 731, "train_runtime": 1973.077, "train_tokens_per_second": 698.343 }, { "epoch": 0.7399545109931767, "grad_norm": 1.6009243726730347, "learning_rate": 1.2648101265822786e-05, "loss": 0.09818520396947861, "num_input_tokens_seen": 1379496, "step": 732, "train_runtime": 1975.2218, "train_tokens_per_second": 698.401 }, { "epoch": 0.7409653778114733, "grad_norm": 1.6257437467575073, "learning_rate": 1.2637974683544305e-05, "loss": 0.08480114489793777, "num_input_tokens_seen": 1381244, "step": 733, "train_runtime": 1977.4021, "train_tokens_per_second": 698.514 }, { "epoch": 0.7419762446297701, "grad_norm": 1.7684394121170044, "learning_rate": 1.2627848101265822e-05, "loss": 0.10317234694957733, "num_input_tokens_seen": 1383306, "step": 734, "train_runtime": 1979.6733, "train_tokens_per_second": 698.755 }, { "epoch": 0.7429871114480667, "grad_norm": 1.490909457206726, "learning_rate": 1.2617721518987343e-05, "loss": 0.0988856852054596, "num_input_tokens_seen": 1385492, "step": 735, "train_runtime": 1981.9417, "train_tokens_per_second": 699.058 }, { "epoch": 0.7439979782663634, "grad_norm": 2.0628840923309326, "learning_rate": 1.2607594936708862e-05, "loss": 0.12445077300071716, "num_input_tokens_seen": 1387608, "step": 736, "train_runtime": 1984.1985, "train_tokens_per_second": 699.329 }, { "epoch": 0.7450088450846601, "grad_norm": 1.647877812385559, "learning_rate": 1.259746835443038e-05, "loss": 0.11410157382488251, "num_input_tokens_seen": 1389814, "step": 737, "train_runtime": 1986.5101, "train_tokens_per_second": 699.626 }, { "epoch": 0.7460197119029568, "grad_norm": 1.7574702501296997, "learning_rate": 1.25873417721519e-05, "loss": 0.12652677297592163, "num_input_tokens_seen": 1391662, "step": 738, "train_runtime": 1988.7121, "train_tokens_per_second": 699.781 }, { "epoch": 0.7470305787212534, "grad_norm": 1.6824933290481567, "learning_rate": 1.257721518987342e-05, "loss": 0.10845467448234558, "num_input_tokens_seen": 1393230, "step": 739, "train_runtime": 1990.8369, "train_tokens_per_second": 699.821 }, { "epoch": 0.7480414455395502, "grad_norm": 1.4367671012878418, "learning_rate": 1.2567088607594937e-05, "loss": 0.07859230786561966, "num_input_tokens_seen": 1395328, "step": 740, "train_runtime": 1993.0943, "train_tokens_per_second": 700.081 }, { "epoch": 0.7490523123578469, "grad_norm": 1.9502897262573242, "learning_rate": 1.2556962025316457e-05, "loss": 0.13023243844509125, "num_input_tokens_seen": 1397110, "step": 741, "train_runtime": 1995.2831, "train_tokens_per_second": 700.206 }, { "epoch": 0.7500631791761435, "grad_norm": 2.0860912799835205, "learning_rate": 1.2546835443037975e-05, "loss": 0.11763650923967361, "num_input_tokens_seen": 1399078, "step": 742, "train_runtime": 1997.5185, "train_tokens_per_second": 700.408 }, { "epoch": 0.7510740459944403, "grad_norm": 1.8446928262710571, "learning_rate": 1.2536708860759494e-05, "loss": 0.08820986747741699, "num_input_tokens_seen": 1400736, "step": 743, "train_runtime": 1999.6882, "train_tokens_per_second": 700.477 }, { "epoch": 0.7520849128127369, "grad_norm": 1.6179382801055908, "learning_rate": 1.2526582278481015e-05, "loss": 0.10503236204385757, "num_input_tokens_seen": 1403160, "step": 744, "train_runtime": 2002.0174, "train_tokens_per_second": 700.873 }, { "epoch": 0.7530957796310336, "grad_norm": 1.6173311471939087, "learning_rate": 1.2516455696202532e-05, "loss": 0.09356211125850677, "num_input_tokens_seen": 1405066, "step": 745, "train_runtime": 2004.19, "train_tokens_per_second": 701.064 }, { "epoch": 0.7541066464493303, "grad_norm": 1.9140892028808594, "learning_rate": 1.2506329113924051e-05, "loss": 0.1226038932800293, "num_input_tokens_seen": 1406536, "step": 746, "train_runtime": 2006.2952, "train_tokens_per_second": 701.061 }, { "epoch": 0.755117513267627, "grad_norm": 1.3898205757141113, "learning_rate": 1.2496202531645572e-05, "loss": 0.07656963169574738, "num_input_tokens_seen": 1408360, "step": 747, "train_runtime": 2008.4951, "train_tokens_per_second": 701.202 }, { "epoch": 0.7561283800859236, "grad_norm": 1.4517537355422974, "learning_rate": 1.248607594936709e-05, "loss": 0.08344630151987076, "num_input_tokens_seen": 1410444, "step": 748, "train_runtime": 2010.7305, "train_tokens_per_second": 701.459 }, { "epoch": 0.7571392469042204, "grad_norm": 1.534968376159668, "learning_rate": 1.2475949367088608e-05, "loss": 0.08581095188856125, "num_input_tokens_seen": 1412882, "step": 749, "train_runtime": 2013.0799, "train_tokens_per_second": 701.851 }, { "epoch": 0.7581501137225171, "grad_norm": 1.670307993888855, "learning_rate": 1.2465822784810126e-05, "loss": 0.10169275104999542, "num_input_tokens_seen": 1415136, "step": 750, "train_runtime": 2015.3603, "train_tokens_per_second": 702.175 }, { "epoch": 0.7591609805408137, "grad_norm": 2.2500455379486084, "learning_rate": 1.2455696202531647e-05, "loss": 0.09628786146640778, "num_input_tokens_seen": 1416954, "step": 751, "train_runtime": 2024.8329, "train_tokens_per_second": 699.788 }, { "epoch": 0.7601718473591105, "grad_norm": 1.824182391166687, "learning_rate": 1.2445569620253166e-05, "loss": 0.09869734197854996, "num_input_tokens_seen": 1419028, "step": 752, "train_runtime": 2027.1807, "train_tokens_per_second": 700.001 }, { "epoch": 0.7611827141774071, "grad_norm": 1.7404752969741821, "learning_rate": 1.2435443037974683e-05, "loss": 0.13448429107666016, "num_input_tokens_seen": 1421050, "step": 753, "train_runtime": 2029.4385, "train_tokens_per_second": 700.218 }, { "epoch": 0.7621935809957038, "grad_norm": 1.6820043325424194, "learning_rate": 1.2425316455696204e-05, "loss": 0.08861427009105682, "num_input_tokens_seen": 1422814, "step": 754, "train_runtime": 2031.6095, "train_tokens_per_second": 700.338 }, { "epoch": 0.7632044478140005, "grad_norm": 1.8669121265411377, "learning_rate": 1.2415189873417723e-05, "loss": 0.10285475850105286, "num_input_tokens_seen": 1424398, "step": 755, "train_runtime": 2033.7218, "train_tokens_per_second": 700.39 }, { "epoch": 0.7642153146322972, "grad_norm": 1.5383599996566772, "learning_rate": 1.240506329113924e-05, "loss": 0.09902352839708328, "num_input_tokens_seen": 1426688, "step": 756, "train_runtime": 2036.033, "train_tokens_per_second": 700.719 }, { "epoch": 0.7652261814505938, "grad_norm": 1.8109301328659058, "learning_rate": 1.2394936708860761e-05, "loss": 0.1470569372177124, "num_input_tokens_seen": 1428828, "step": 757, "train_runtime": 2038.3818, "train_tokens_per_second": 700.962 }, { "epoch": 0.7662370482688906, "grad_norm": 1.5089824199676514, "learning_rate": 1.2384810126582278e-05, "loss": 0.0822841078042984, "num_input_tokens_seen": 1430676, "step": 758, "train_runtime": 2040.5503, "train_tokens_per_second": 701.123 }, { "epoch": 0.7672479150871873, "grad_norm": 1.8709169626235962, "learning_rate": 1.2374683544303798e-05, "loss": 0.1347963511943817, "num_input_tokens_seen": 1432730, "step": 759, "train_runtime": 2042.7856, "train_tokens_per_second": 701.361 }, { "epoch": 0.7682587819054839, "grad_norm": 1.6669872999191284, "learning_rate": 1.2364556962025318e-05, "loss": 0.10360300540924072, "num_input_tokens_seen": 1434948, "step": 760, "train_runtime": 2045.0728, "train_tokens_per_second": 701.661 }, { "epoch": 0.7692696487237807, "grad_norm": 1.7485250234603882, "learning_rate": 1.2354430379746836e-05, "loss": 0.10558325052261353, "num_input_tokens_seen": 1436938, "step": 761, "train_runtime": 2047.2884, "train_tokens_per_second": 701.874 }, { "epoch": 0.7702805155420773, "grad_norm": 1.4305222034454346, "learning_rate": 1.2344303797468355e-05, "loss": 0.07555848360061646, "num_input_tokens_seen": 1439072, "step": 762, "train_runtime": 2049.5636, "train_tokens_per_second": 702.136 }, { "epoch": 0.771291382360374, "grad_norm": 1.8085486888885498, "learning_rate": 1.2334177215189876e-05, "loss": 0.09838170558214188, "num_input_tokens_seen": 1440696, "step": 763, "train_runtime": 2051.7249, "train_tokens_per_second": 702.188 }, { "epoch": 0.7723022491786707, "grad_norm": 1.6283233165740967, "learning_rate": 1.2324050632911393e-05, "loss": 0.09942428767681122, "num_input_tokens_seen": 1442820, "step": 764, "train_runtime": 2054.0258, "train_tokens_per_second": 702.435 }, { "epoch": 0.7733131159969674, "grad_norm": 1.8893804550170898, "learning_rate": 1.2313924050632912e-05, "loss": 0.10178426653146744, "num_input_tokens_seen": 1445002, "step": 765, "train_runtime": 2056.3714, "train_tokens_per_second": 702.695 }, { "epoch": 0.774323982815264, "grad_norm": 1.7042813301086426, "learning_rate": 1.2303797468354431e-05, "loss": 0.09114382416009903, "num_input_tokens_seen": 1446852, "step": 766, "train_runtime": 2058.7022, "train_tokens_per_second": 702.798 }, { "epoch": 0.7753348496335608, "grad_norm": 1.401929259300232, "learning_rate": 1.229367088607595e-05, "loss": 0.058845121413469315, "num_input_tokens_seen": 1448588, "step": 767, "train_runtime": 2060.9668, "train_tokens_per_second": 702.868 }, { "epoch": 0.7763457164518575, "grad_norm": 1.7265045642852783, "learning_rate": 1.228354430379747e-05, "loss": 0.11025261878967285, "num_input_tokens_seen": 1450580, "step": 768, "train_runtime": 2063.1969, "train_tokens_per_second": 703.074 }, { "epoch": 0.7773565832701541, "grad_norm": 1.5884586572647095, "learning_rate": 1.2273417721518988e-05, "loss": 0.09003075212240219, "num_input_tokens_seen": 1452580, "step": 769, "train_runtime": 2065.5002, "train_tokens_per_second": 703.258 }, { "epoch": 0.7783674500884509, "grad_norm": 1.795130729675293, "learning_rate": 1.2263291139240508e-05, "loss": 0.13106182217597961, "num_input_tokens_seen": 1454246, "step": 770, "train_runtime": 2067.7271, "train_tokens_per_second": 703.307 }, { "epoch": 0.7793783169067475, "grad_norm": 1.8099521398544312, "learning_rate": 1.2253164556962027e-05, "loss": 0.10356763750314713, "num_input_tokens_seen": 1456172, "step": 771, "train_runtime": 2069.9755, "train_tokens_per_second": 703.473 }, { "epoch": 0.7803891837250442, "grad_norm": 1.536196231842041, "learning_rate": 1.2243037974683546e-05, "loss": 0.10875052213668823, "num_input_tokens_seen": 1458110, "step": 772, "train_runtime": 2072.1982, "train_tokens_per_second": 703.654 }, { "epoch": 0.7814000505433409, "grad_norm": 1.8153913021087646, "learning_rate": 1.2232911392405065e-05, "loss": 0.12295549362897873, "num_input_tokens_seen": 1459878, "step": 773, "train_runtime": 2074.3954, "train_tokens_per_second": 703.761 }, { "epoch": 0.7824109173616376, "grad_norm": 1.9409207105636597, "learning_rate": 1.2222784810126582e-05, "loss": 0.10511298477649689, "num_input_tokens_seen": 1461484, "step": 774, "train_runtime": 2076.601, "train_tokens_per_second": 703.787 }, { "epoch": 0.7834217841799342, "grad_norm": 1.710295557975769, "learning_rate": 1.2212658227848101e-05, "loss": 0.10304154455661774, "num_input_tokens_seen": 1463336, "step": 775, "train_runtime": 2078.8189, "train_tokens_per_second": 703.927 }, { "epoch": 0.784432650998231, "grad_norm": 1.9755862951278687, "learning_rate": 1.2202531645569622e-05, "loss": 0.08260329812765121, "num_input_tokens_seen": 1464984, "step": 776, "train_runtime": 2080.9981, "train_tokens_per_second": 703.981 }, { "epoch": 0.7854435178165277, "grad_norm": 2.2708795070648193, "learning_rate": 1.219240506329114e-05, "loss": 0.1592435985803604, "num_input_tokens_seen": 1466894, "step": 777, "train_runtime": 2083.1873, "train_tokens_per_second": 704.158 }, { "epoch": 0.7864543846348243, "grad_norm": 1.8243274688720703, "learning_rate": 1.2182278481012658e-05, "loss": 0.10652625560760498, "num_input_tokens_seen": 1468682, "step": 778, "train_runtime": 2085.3698, "train_tokens_per_second": 704.279 }, { "epoch": 0.7874652514531211, "grad_norm": 1.468176007270813, "learning_rate": 1.217215189873418e-05, "loss": 0.08889875560998917, "num_input_tokens_seen": 1470236, "step": 779, "train_runtime": 2087.492, "train_tokens_per_second": 704.307 }, { "epoch": 0.7884761182714177, "grad_norm": 1.6787092685699463, "learning_rate": 1.2162025316455697e-05, "loss": 0.08062463998794556, "num_input_tokens_seen": 1472040, "step": 780, "train_runtime": 2089.691, "train_tokens_per_second": 704.43 }, { "epoch": 0.7894869850897144, "grad_norm": 1.847848653793335, "learning_rate": 1.2151898734177216e-05, "loss": 0.0998370349407196, "num_input_tokens_seen": 1474404, "step": 781, "train_runtime": 2099.3086, "train_tokens_per_second": 702.328 }, { "epoch": 0.7904978519080111, "grad_norm": 1.9789323806762695, "learning_rate": 1.2141772151898735e-05, "loss": 0.13471730053424835, "num_input_tokens_seen": 1476702, "step": 782, "train_runtime": 2101.6403, "train_tokens_per_second": 702.643 }, { "epoch": 0.7915087187263078, "grad_norm": 1.543714165687561, "learning_rate": 1.2131645569620254e-05, "loss": 0.10380326211452484, "num_input_tokens_seen": 1478698, "step": 783, "train_runtime": 2103.8482, "train_tokens_per_second": 702.854 }, { "epoch": 0.7925195855446044, "grad_norm": 1.6039838790893555, "learning_rate": 1.2121518987341773e-05, "loss": 0.10127082467079163, "num_input_tokens_seen": 1480804, "step": 784, "train_runtime": 2106.0975, "train_tokens_per_second": 703.103 }, { "epoch": 0.7935304523629012, "grad_norm": 1.8809661865234375, "learning_rate": 1.2111392405063292e-05, "loss": 0.14595478773117065, "num_input_tokens_seen": 1482470, "step": 785, "train_runtime": 2108.248, "train_tokens_per_second": 703.176 }, { "epoch": 0.7945413191811979, "grad_norm": 1.524720549583435, "learning_rate": 1.2101265822784811e-05, "loss": 0.09433682262897491, "num_input_tokens_seen": 1484010, "step": 786, "train_runtime": 2110.3496, "train_tokens_per_second": 703.206 }, { "epoch": 0.7955521859994946, "grad_norm": 1.9089356660842896, "learning_rate": 1.209113924050633e-05, "loss": 0.12183887511491776, "num_input_tokens_seen": 1485590, "step": 787, "train_runtime": 2112.484, "train_tokens_per_second": 703.243 }, { "epoch": 0.7965630528177913, "grad_norm": 1.9138861894607544, "learning_rate": 1.208101265822785e-05, "loss": 0.11920693516731262, "num_input_tokens_seen": 1487662, "step": 788, "train_runtime": 2114.7519, "train_tokens_per_second": 703.469 }, { "epoch": 0.7975739196360879, "grad_norm": 1.7757669687271118, "learning_rate": 1.2070886075949368e-05, "loss": 0.15390071272850037, "num_input_tokens_seen": 1490132, "step": 789, "train_runtime": 2117.0738, "train_tokens_per_second": 703.864 }, { "epoch": 0.7985847864543847, "grad_norm": 1.7771114110946655, "learning_rate": 1.2060759493670886e-05, "loss": 0.09804435074329376, "num_input_tokens_seen": 1491952, "step": 790, "train_runtime": 2119.2554, "train_tokens_per_second": 703.998 }, { "epoch": 0.7995956532726813, "grad_norm": 1.7257702350616455, "learning_rate": 1.2050632911392407e-05, "loss": 0.09261702746152878, "num_input_tokens_seen": 1493938, "step": 791, "train_runtime": 2121.4735, "train_tokens_per_second": 704.198 }, { "epoch": 0.800606520090978, "grad_norm": 2.043962001800537, "learning_rate": 1.2040506329113926e-05, "loss": 0.11694172024726868, "num_input_tokens_seen": 1495656, "step": 792, "train_runtime": 2123.7914, "train_tokens_per_second": 704.239 }, { "epoch": 0.800606520090978, "eval_loss": 0.3946111798286438, "eval_runtime": 52.1824, "eval_samples_per_second": 16.845, "eval_steps_per_second": 8.432, "num_input_tokens_seen": 1495656, "step": 792 }, { "epoch": 0.8016173869092748, "grad_norm": 2.063417673110962, "learning_rate": 1.2030379746835443e-05, "loss": 0.12162243574857712, "num_input_tokens_seen": 1497184, "step": 793, "train_runtime": 2178.1274, "train_tokens_per_second": 687.372 }, { "epoch": 0.8026282537275714, "grad_norm": 1.5715523958206177, "learning_rate": 1.2020253164556964e-05, "loss": 0.06807722896337509, "num_input_tokens_seen": 1498650, "step": 794, "train_runtime": 2180.2449, "train_tokens_per_second": 687.377 }, { "epoch": 0.8036391205458681, "grad_norm": 1.8881858587265015, "learning_rate": 1.2010126582278483e-05, "loss": 0.1074509546160698, "num_input_tokens_seen": 1500418, "step": 795, "train_runtime": 2182.4027, "train_tokens_per_second": 687.507 }, { "epoch": 0.8046499873641648, "grad_norm": 1.501157283782959, "learning_rate": 1.2e-05, "loss": 0.09269465506076813, "num_input_tokens_seen": 1502404, "step": 796, "train_runtime": 2184.6473, "train_tokens_per_second": 687.71 }, { "epoch": 0.8056608541824615, "grad_norm": 1.39267098903656, "learning_rate": 1.1989873417721521e-05, "loss": 0.08595585823059082, "num_input_tokens_seen": 1504506, "step": 797, "train_runtime": 2186.885, "train_tokens_per_second": 687.968 }, { "epoch": 0.8066717210007581, "grad_norm": 1.6402462720870972, "learning_rate": 1.1979746835443038e-05, "loss": 0.09339673072099686, "num_input_tokens_seen": 1506334, "step": 798, "train_runtime": 2189.0674, "train_tokens_per_second": 688.117 }, { "epoch": 0.8076825878190549, "grad_norm": 1.8428109884262085, "learning_rate": 1.1969620253164558e-05, "loss": 0.1302780658006668, "num_input_tokens_seen": 1508208, "step": 799, "train_runtime": 2191.2815, "train_tokens_per_second": 688.277 }, { "epoch": 0.8086934546373515, "grad_norm": 1.6349430084228516, "learning_rate": 1.1959493670886078e-05, "loss": 0.09174898266792297, "num_input_tokens_seen": 1509974, "step": 800, "train_runtime": 2193.483, "train_tokens_per_second": 688.391 }, { "epoch": 0.8097043214556482, "grad_norm": 2.0324203968048096, "learning_rate": 1.1949367088607596e-05, "loss": 0.1389024704694748, "num_input_tokens_seen": 1511792, "step": 801, "train_runtime": 2195.6667, "train_tokens_per_second": 688.534 }, { "epoch": 0.810715188273945, "grad_norm": 1.9356026649475098, "learning_rate": 1.1939240506329115e-05, "loss": 0.11095651239156723, "num_input_tokens_seen": 1513666, "step": 802, "train_runtime": 2197.8771, "train_tokens_per_second": 688.695 }, { "epoch": 0.8117260550922416, "grad_norm": 1.6426819562911987, "learning_rate": 1.1929113924050636e-05, "loss": 0.10243912041187286, "num_input_tokens_seen": 1516078, "step": 803, "train_runtime": 2200.1985, "train_tokens_per_second": 689.064 }, { "epoch": 0.8127369219105383, "grad_norm": 1.7166860103607178, "learning_rate": 1.1918987341772153e-05, "loss": 0.08783088624477386, "num_input_tokens_seen": 1517678, "step": 804, "train_runtime": 2202.3235, "train_tokens_per_second": 689.126 }, { "epoch": 0.813747788728835, "grad_norm": 1.8186951875686646, "learning_rate": 1.1908860759493672e-05, "loss": 0.11066818237304688, "num_input_tokens_seen": 1519652, "step": 805, "train_runtime": 2204.5375, "train_tokens_per_second": 689.329 }, { "epoch": 0.8147586555471317, "grad_norm": 1.9489704370498657, "learning_rate": 1.189873417721519e-05, "loss": 0.10720035433769226, "num_input_tokens_seen": 1521208, "step": 806, "train_runtime": 2206.6554, "train_tokens_per_second": 689.373 }, { "epoch": 0.8157695223654283, "grad_norm": 1.7648284435272217, "learning_rate": 1.188860759493671e-05, "loss": 0.07367865741252899, "num_input_tokens_seen": 1523202, "step": 807, "train_runtime": 2208.87, "train_tokens_per_second": 689.584 }, { "epoch": 0.8167803891837251, "grad_norm": 2.136040449142456, "learning_rate": 1.187848101265823e-05, "loss": 0.13560248911380768, "num_input_tokens_seen": 1524950, "step": 808, "train_runtime": 2211.0494, "train_tokens_per_second": 689.695 }, { "epoch": 0.8177912560020217, "grad_norm": 1.6972389221191406, "learning_rate": 1.1868354430379747e-05, "loss": 0.08793585002422333, "num_input_tokens_seen": 1526390, "step": 809, "train_runtime": 2213.1484, "train_tokens_per_second": 689.692 }, { "epoch": 0.8188021228203184, "grad_norm": 1.5497407913208008, "learning_rate": 1.1858227848101267e-05, "loss": 0.10550501942634583, "num_input_tokens_seen": 1528232, "step": 810, "train_runtime": 2215.4065, "train_tokens_per_second": 689.82 }, { "epoch": 0.8198129896386152, "grad_norm": 1.8824611902236938, "learning_rate": 1.1848101265822787e-05, "loss": 0.11529868841171265, "num_input_tokens_seen": 1530056, "step": 811, "train_runtime": 2224.8161, "train_tokens_per_second": 687.722 }, { "epoch": 0.8208238564569118, "grad_norm": 1.964501976966858, "learning_rate": 1.1837974683544304e-05, "loss": 0.13124974071979523, "num_input_tokens_seen": 1532250, "step": 812, "train_runtime": 2227.1965, "train_tokens_per_second": 687.973 }, { "epoch": 0.8218347232752085, "grad_norm": 1.4976140260696411, "learning_rate": 1.1827848101265825e-05, "loss": 0.07861673831939697, "num_input_tokens_seen": 1534102, "step": 813, "train_runtime": 2229.4008, "train_tokens_per_second": 688.123 }, { "epoch": 0.8228455900935052, "grad_norm": 1.904380202293396, "learning_rate": 1.1817721518987342e-05, "loss": 0.09402893483638763, "num_input_tokens_seen": 1535648, "step": 814, "train_runtime": 2231.5509, "train_tokens_per_second": 688.153 }, { "epoch": 0.8238564569118019, "grad_norm": 1.507312297821045, "learning_rate": 1.1807594936708861e-05, "loss": 0.09126953780651093, "num_input_tokens_seen": 1537408, "step": 815, "train_runtime": 2233.8027, "train_tokens_per_second": 688.247 }, { "epoch": 0.8248673237300985, "grad_norm": 1.3340409994125366, "learning_rate": 1.1797468354430382e-05, "loss": 0.06178020313382149, "num_input_tokens_seen": 1539398, "step": 816, "train_runtime": 2236.0572, "train_tokens_per_second": 688.443 }, { "epoch": 0.8258781905483953, "grad_norm": 1.8956761360168457, "learning_rate": 1.17873417721519e-05, "loss": 0.10389361530542374, "num_input_tokens_seen": 1541054, "step": 817, "train_runtime": 2238.2117, "train_tokens_per_second": 688.52 }, { "epoch": 0.8268890573666919, "grad_norm": 1.2940924167633057, "learning_rate": 1.1777215189873418e-05, "loss": 0.0874934196472168, "num_input_tokens_seen": 1543138, "step": 818, "train_runtime": 2240.4517, "train_tokens_per_second": 688.762 }, { "epoch": 0.8278999241849886, "grad_norm": 1.4896349906921387, "learning_rate": 1.176708860759494e-05, "loss": 0.08060645312070847, "num_input_tokens_seen": 1544674, "step": 819, "train_runtime": 2242.603, "train_tokens_per_second": 688.786 }, { "epoch": 0.8289107910032854, "grad_norm": 1.979724407196045, "learning_rate": 1.1756962025316457e-05, "loss": 0.1410706639289856, "num_input_tokens_seen": 1546470, "step": 820, "train_runtime": 2244.7967, "train_tokens_per_second": 688.913 }, { "epoch": 0.829921657821582, "grad_norm": 1.7215502262115479, "learning_rate": 1.1746835443037976e-05, "loss": 0.11855530738830566, "num_input_tokens_seen": 1548530, "step": 821, "train_runtime": 2247.0656, "train_tokens_per_second": 689.134 }, { "epoch": 0.8309325246398787, "grad_norm": 1.9731192588806152, "learning_rate": 1.1736708860759493e-05, "loss": 0.1129259392619133, "num_input_tokens_seen": 1549984, "step": 822, "train_runtime": 2249.1843, "train_tokens_per_second": 689.132 }, { "epoch": 0.8319433914581754, "grad_norm": 1.5840198993682861, "learning_rate": 1.1726582278481014e-05, "loss": 0.07799205183982849, "num_input_tokens_seen": 1552118, "step": 823, "train_runtime": 2251.4513, "train_tokens_per_second": 689.386 }, { "epoch": 0.8329542582764721, "grad_norm": 1.7128299474716187, "learning_rate": 1.1716455696202533e-05, "loss": 0.12098036706447601, "num_input_tokens_seen": 1554850, "step": 824, "train_runtime": 2253.8871, "train_tokens_per_second": 689.853 }, { "epoch": 0.8339651250947687, "grad_norm": 1.6522421836853027, "learning_rate": 1.170632911392405e-05, "loss": 0.10111503303050995, "num_input_tokens_seen": 1556788, "step": 825, "train_runtime": 2256.1549, "train_tokens_per_second": 690.018 }, { "epoch": 0.8349759919130655, "grad_norm": 1.9402137994766235, "learning_rate": 1.1696202531645571e-05, "loss": 0.13037458062171936, "num_input_tokens_seen": 1558446, "step": 826, "train_runtime": 2258.3077, "train_tokens_per_second": 690.095 }, { "epoch": 0.8359868587313621, "grad_norm": 1.9426116943359375, "learning_rate": 1.168607594936709e-05, "loss": 0.12384985387325287, "num_input_tokens_seen": 1560354, "step": 827, "train_runtime": 2260.5189, "train_tokens_per_second": 690.264 }, { "epoch": 0.8369977255496588, "grad_norm": 2.1715128421783447, "learning_rate": 1.1675949367088608e-05, "loss": 0.15766561031341553, "num_input_tokens_seen": 1562322, "step": 828, "train_runtime": 2262.7235, "train_tokens_per_second": 690.461 }, { "epoch": 0.8380085923679556, "grad_norm": 2.079145908355713, "learning_rate": 1.1665822784810128e-05, "loss": 0.10856711119413376, "num_input_tokens_seen": 1564184, "step": 829, "train_runtime": 2264.9465, "train_tokens_per_second": 690.605 }, { "epoch": 0.8390194591862522, "grad_norm": 2.0513410568237305, "learning_rate": 1.1655696202531646e-05, "loss": 0.12570130825042725, "num_input_tokens_seen": 1565994, "step": 830, "train_runtime": 2267.1186, "train_tokens_per_second": 690.742 }, { "epoch": 0.8400303260045489, "grad_norm": 1.5659273862838745, "learning_rate": 1.1645569620253165e-05, "loss": 0.09665076434612274, "num_input_tokens_seen": 1567916, "step": 831, "train_runtime": 2269.2946, "train_tokens_per_second": 690.927 }, { "epoch": 0.8410411928228456, "grad_norm": 1.7730907201766968, "learning_rate": 1.1635443037974686e-05, "loss": 0.10670483112335205, "num_input_tokens_seen": 1569890, "step": 832, "train_runtime": 2271.5691, "train_tokens_per_second": 691.104 }, { "epoch": 0.8420520596411423, "grad_norm": 1.9787683486938477, "learning_rate": 1.1625316455696203e-05, "loss": 0.12965239584445953, "num_input_tokens_seen": 1572012, "step": 833, "train_runtime": 2273.8198, "train_tokens_per_second": 691.353 }, { "epoch": 0.8430629264594389, "grad_norm": 1.4029730558395386, "learning_rate": 1.1615189873417722e-05, "loss": 0.06591518968343735, "num_input_tokens_seen": 1573832, "step": 834, "train_runtime": 2276.0364, "train_tokens_per_second": 691.479 }, { "epoch": 0.8440737932777357, "grad_norm": 1.5094635486602783, "learning_rate": 1.1605063291139243e-05, "loss": 0.09049294143915176, "num_input_tokens_seen": 1575922, "step": 835, "train_runtime": 2278.2906, "train_tokens_per_second": 691.712 }, { "epoch": 0.8450846600960323, "grad_norm": 1.7904154062271118, "learning_rate": 1.159493670886076e-05, "loss": 0.12147239595651627, "num_input_tokens_seen": 1577630, "step": 836, "train_runtime": 2280.4466, "train_tokens_per_second": 691.807 }, { "epoch": 0.846095526914329, "grad_norm": 1.8628566265106201, "learning_rate": 1.158481012658228e-05, "loss": 0.08792897313833237, "num_input_tokens_seen": 1579326, "step": 837, "train_runtime": 2282.6114, "train_tokens_per_second": 691.894 }, { "epoch": 0.8471063937326258, "grad_norm": 1.6908202171325684, "learning_rate": 1.1574683544303797e-05, "loss": 0.09818118065595627, "num_input_tokens_seen": 1581406, "step": 838, "train_runtime": 2284.8464, "train_tokens_per_second": 692.128 }, { "epoch": 0.8481172605509224, "grad_norm": 1.7988734245300293, "learning_rate": 1.1564556962025318e-05, "loss": 0.10540547966957092, "num_input_tokens_seen": 1583126, "step": 839, "train_runtime": 2286.9908, "train_tokens_per_second": 692.231 }, { "epoch": 0.849128127369219, "grad_norm": 1.7324339151382446, "learning_rate": 1.1554430379746837e-05, "loss": 0.11427002400159836, "num_input_tokens_seen": 1585318, "step": 840, "train_runtime": 2289.309, "train_tokens_per_second": 692.488 }, { "epoch": 0.8501389941875158, "grad_norm": 1.4927492141723633, "learning_rate": 1.1544303797468354e-05, "loss": 0.06348370015621185, "num_input_tokens_seen": 1586846, "step": 841, "train_runtime": 2298.5765, "train_tokens_per_second": 690.36 }, { "epoch": 0.8511498610058125, "grad_norm": 2.1162431240081787, "learning_rate": 1.1534177215189875e-05, "loss": 0.09501577168703079, "num_input_tokens_seen": 1588624, "step": 842, "train_runtime": 2300.7384, "train_tokens_per_second": 690.484 }, { "epoch": 0.8521607278241091, "grad_norm": 1.9396066665649414, "learning_rate": 1.1524050632911394e-05, "loss": 0.10647747665643692, "num_input_tokens_seen": 1590574, "step": 843, "train_runtime": 2303.0593, "train_tokens_per_second": 690.635 }, { "epoch": 0.8531715946424059, "grad_norm": 2.0144662857055664, "learning_rate": 1.1513924050632911e-05, "loss": 0.09945391118526459, "num_input_tokens_seen": 1592676, "step": 844, "train_runtime": 2305.2867, "train_tokens_per_second": 690.88 }, { "epoch": 0.8541824614607025, "grad_norm": 1.7529017925262451, "learning_rate": 1.1503797468354432e-05, "loss": 0.09879845380783081, "num_input_tokens_seen": 1594634, "step": 845, "train_runtime": 2307.5112, "train_tokens_per_second": 691.062 }, { "epoch": 0.8551933282789992, "grad_norm": 2.058156967163086, "learning_rate": 1.149367088607595e-05, "loss": 0.0892823114991188, "num_input_tokens_seen": 1596328, "step": 846, "train_runtime": 2309.6959, "train_tokens_per_second": 691.142 }, { "epoch": 0.856204195097296, "grad_norm": 1.6276295185089111, "learning_rate": 1.1483544303797469e-05, "loss": 0.12782657146453857, "num_input_tokens_seen": 1598918, "step": 847, "train_runtime": 2312.0539, "train_tokens_per_second": 691.557 }, { "epoch": 0.8572150619155926, "grad_norm": 1.9061850309371948, "learning_rate": 1.147341772151899e-05, "loss": 0.13704827427864075, "num_input_tokens_seen": 1600810, "step": 848, "train_runtime": 2314.2804, "train_tokens_per_second": 691.71 }, { "epoch": 0.8582259287338894, "grad_norm": 1.7898938655853271, "learning_rate": 1.1463291139240507e-05, "loss": 0.1129920706152916, "num_input_tokens_seen": 1602868, "step": 849, "train_runtime": 2316.4976, "train_tokens_per_second": 691.936 }, { "epoch": 0.859236795552186, "grad_norm": 1.886339783668518, "learning_rate": 1.1453164556962026e-05, "loss": 0.09292490035295486, "num_input_tokens_seen": 1604334, "step": 850, "train_runtime": 2318.6179, "train_tokens_per_second": 691.935 }, { "epoch": 0.8602476623704827, "grad_norm": 2.0642142295837402, "learning_rate": 1.1443037974683547e-05, "loss": 0.13143715262413025, "num_input_tokens_seen": 1606456, "step": 851, "train_runtime": 2320.8556, "train_tokens_per_second": 692.183 }, { "epoch": 0.8612585291887794, "grad_norm": 1.727893352508545, "learning_rate": 1.1432911392405064e-05, "loss": 0.10075180232524872, "num_input_tokens_seen": 1608280, "step": 852, "train_runtime": 2323.0335, "train_tokens_per_second": 692.319 }, { "epoch": 0.8622693960070761, "grad_norm": 1.4375556707382202, "learning_rate": 1.1422784810126583e-05, "loss": 0.0873575434088707, "num_input_tokens_seen": 1609990, "step": 853, "train_runtime": 2325.2215, "train_tokens_per_second": 692.403 }, { "epoch": 0.8632802628253727, "grad_norm": 1.7615019083023071, "learning_rate": 1.1412658227848102e-05, "loss": 0.1255250871181488, "num_input_tokens_seen": 1611726, "step": 854, "train_runtime": 2327.4046, "train_tokens_per_second": 692.499 }, { "epoch": 0.8642911296436695, "grad_norm": 1.795871615409851, "learning_rate": 1.1402531645569621e-05, "loss": 0.11938530951738358, "num_input_tokens_seen": 1613962, "step": 855, "train_runtime": 2329.7183, "train_tokens_per_second": 692.771 }, { "epoch": 0.8653019964619661, "grad_norm": 1.8448328971862793, "learning_rate": 1.139240506329114e-05, "loss": 0.09347003698348999, "num_input_tokens_seen": 1615632, "step": 856, "train_runtime": 2331.8939, "train_tokens_per_second": 692.841 }, { "epoch": 0.8663128632802628, "grad_norm": 2.698441505432129, "learning_rate": 1.138227848101266e-05, "loss": 0.09510399401187897, "num_input_tokens_seen": 1617550, "step": 857, "train_runtime": 2334.1389, "train_tokens_per_second": 692.996 }, { "epoch": 0.8673237300985596, "grad_norm": 1.5858604907989502, "learning_rate": 1.1372151898734178e-05, "loss": 0.10066479444503784, "num_input_tokens_seen": 1619282, "step": 858, "train_runtime": 2336.3435, "train_tokens_per_second": 693.084 }, { "epoch": 0.8683345969168562, "grad_norm": 1.9796504974365234, "learning_rate": 1.1362025316455698e-05, "loss": 0.11774136871099472, "num_input_tokens_seen": 1620816, "step": 859, "train_runtime": 2338.5267, "train_tokens_per_second": 693.093 }, { "epoch": 0.8693454637351529, "grad_norm": 1.4962421655654907, "learning_rate": 1.1351898734177217e-05, "loss": 0.10000722110271454, "num_input_tokens_seen": 1622940, "step": 860, "train_runtime": 2340.8249, "train_tokens_per_second": 693.32 }, { "epoch": 0.8703563305534496, "grad_norm": 1.5053681135177612, "learning_rate": 1.1341772151898736e-05, "loss": 0.09694317728281021, "num_input_tokens_seen": 1624928, "step": 861, "train_runtime": 2343.0777, "train_tokens_per_second": 693.502 }, { "epoch": 0.8713671973717463, "grad_norm": 1.6079481840133667, "learning_rate": 1.1331645569620253e-05, "loss": 0.1144719272851944, "num_input_tokens_seen": 1626842, "step": 862, "train_runtime": 2345.2893, "train_tokens_per_second": 693.664 }, { "epoch": 0.8723780641900429, "grad_norm": 1.7395708560943604, "learning_rate": 1.1321518987341772e-05, "loss": 0.10291267931461334, "num_input_tokens_seen": 1628466, "step": 863, "train_runtime": 2347.6038, "train_tokens_per_second": 693.672 }, { "epoch": 0.8733889310083397, "grad_norm": 1.8408080339431763, "learning_rate": 1.1311392405063293e-05, "loss": 0.09824563562870026, "num_input_tokens_seen": 1630404, "step": 864, "train_runtime": 2349.8853, "train_tokens_per_second": 693.823 }, { "epoch": 0.8743997978266363, "grad_norm": 1.6320384740829468, "learning_rate": 1.130126582278481e-05, "loss": 0.10983906686306, "num_input_tokens_seen": 1632534, "step": 865, "train_runtime": 2352.2028, "train_tokens_per_second": 694.045 }, { "epoch": 0.875410664644933, "grad_norm": 2.0745017528533936, "learning_rate": 1.129113924050633e-05, "loss": 0.09887329488992691, "num_input_tokens_seen": 1634250, "step": 866, "train_runtime": 2354.4418, "train_tokens_per_second": 694.114 }, { "epoch": 0.8764215314632298, "grad_norm": 1.4929437637329102, "learning_rate": 1.128101265822785e-05, "loss": 0.09026893973350525, "num_input_tokens_seen": 1636256, "step": 867, "train_runtime": 2356.6751, "train_tokens_per_second": 694.307 }, { "epoch": 0.8774323982815264, "grad_norm": 1.5981075763702393, "learning_rate": 1.1270886075949368e-05, "loss": 0.11353608220815659, "num_input_tokens_seen": 1638308, "step": 868, "train_runtime": 2358.9372, "train_tokens_per_second": 694.511 }, { "epoch": 0.8784432650998231, "grad_norm": 1.4297696352005005, "learning_rate": 1.1260759493670887e-05, "loss": 0.06749273836612701, "num_input_tokens_seen": 1639966, "step": 869, "train_runtime": 2361.116, "train_tokens_per_second": 694.572 }, { "epoch": 0.8794541319181198, "grad_norm": 1.5817461013793945, "learning_rate": 1.1250632911392406e-05, "loss": 0.10096173733472824, "num_input_tokens_seen": 1642326, "step": 870, "train_runtime": 2363.4636, "train_tokens_per_second": 694.881 }, { "epoch": 0.8804649987364165, "grad_norm": 1.586337924003601, "learning_rate": 1.1240506329113925e-05, "loss": 0.07885732501745224, "num_input_tokens_seen": 1643814, "step": 871, "train_runtime": 2372.7965, "train_tokens_per_second": 692.775 }, { "epoch": 0.8814758655547131, "grad_norm": 1.8464782238006592, "learning_rate": 1.1230379746835444e-05, "loss": 0.09361685067415237, "num_input_tokens_seen": 1645608, "step": 872, "train_runtime": 2375.1096, "train_tokens_per_second": 692.856 }, { "epoch": 0.8824867323730099, "grad_norm": 2.068006992340088, "learning_rate": 1.1220253164556963e-05, "loss": 0.13546811044216156, "num_input_tokens_seen": 1647372, "step": 873, "train_runtime": 2377.3765, "train_tokens_per_second": 692.937 }, { "epoch": 0.8834975991913065, "grad_norm": 2.653832197189331, "learning_rate": 1.1210126582278482e-05, "loss": 0.13507585227489471, "num_input_tokens_seen": 1649480, "step": 874, "train_runtime": 2379.7096, "train_tokens_per_second": 693.143 }, { "epoch": 0.8845084660096032, "grad_norm": 1.9615648984909058, "learning_rate": 1.1200000000000001e-05, "loss": 0.1325993537902832, "num_input_tokens_seen": 1651222, "step": 875, "train_runtime": 2381.9222, "train_tokens_per_second": 693.231 }, { "epoch": 0.8855193328279, "grad_norm": 1.3614580631256104, "learning_rate": 1.118987341772152e-05, "loss": 0.08537785708904266, "num_input_tokens_seen": 1653380, "step": 876, "train_runtime": 2384.2121, "train_tokens_per_second": 693.47 }, { "epoch": 0.8865301996461966, "grad_norm": 2.209545612335205, "learning_rate": 1.117974683544304e-05, "loss": 0.12375745922327042, "num_input_tokens_seen": 1654968, "step": 877, "train_runtime": 2386.3402, "train_tokens_per_second": 693.517 }, { "epoch": 0.8875410664644933, "grad_norm": 1.984891414642334, "learning_rate": 1.1169620253164557e-05, "loss": 0.10398299992084503, "num_input_tokens_seen": 1656582, "step": 878, "train_runtime": 2388.4894, "train_tokens_per_second": 693.569 }, { "epoch": 0.88855193328279, "grad_norm": 1.7964671850204468, "learning_rate": 1.1159493670886078e-05, "loss": 0.09898118674755096, "num_input_tokens_seen": 1658438, "step": 879, "train_runtime": 2390.7287, "train_tokens_per_second": 693.696 }, { "epoch": 0.8895628001010867, "grad_norm": 1.7326607704162598, "learning_rate": 1.1149367088607597e-05, "loss": 0.12106341868638992, "num_input_tokens_seen": 1660068, "step": 880, "train_runtime": 2392.871, "train_tokens_per_second": 693.756 }, { "epoch": 0.8905736669193833, "grad_norm": 1.5902682542800903, "learning_rate": 1.1139240506329114e-05, "loss": 0.09547918289899826, "num_input_tokens_seen": 1661494, "step": 881, "train_runtime": 2395.0434, "train_tokens_per_second": 693.722 }, { "epoch": 0.8915845337376801, "grad_norm": 1.4557594060897827, "learning_rate": 1.1129113924050635e-05, "loss": 0.05885666236281395, "num_input_tokens_seen": 1663150, "step": 882, "train_runtime": 2397.2304, "train_tokens_per_second": 693.78 }, { "epoch": 0.8925954005559767, "grad_norm": 1.624995470046997, "learning_rate": 1.1118987341772154e-05, "loss": 0.089319609105587, "num_input_tokens_seen": 1664702, "step": 883, "train_runtime": 2399.3751, "train_tokens_per_second": 693.806 }, { "epoch": 0.8936062673742734, "grad_norm": 1.4931955337524414, "learning_rate": 1.1108860759493671e-05, "loss": 0.09750652313232422, "num_input_tokens_seen": 1667500, "step": 884, "train_runtime": 2401.7873, "train_tokens_per_second": 694.275 }, { "epoch": 0.8946171341925702, "grad_norm": 1.4132208824157715, "learning_rate": 1.1098734177215192e-05, "loss": 0.08524797856807709, "num_input_tokens_seen": 1669594, "step": 885, "train_runtime": 2404.0569, "train_tokens_per_second": 694.49 }, { "epoch": 0.8956280010108668, "grad_norm": 2.098870038986206, "learning_rate": 1.108860759493671e-05, "loss": 0.10673464834690094, "num_input_tokens_seen": 1671040, "step": 886, "train_runtime": 2406.1485, "train_tokens_per_second": 694.487 }, { "epoch": 0.8966388678291635, "grad_norm": 1.7068244218826294, "learning_rate": 1.1078481012658229e-05, "loss": 0.09890075027942657, "num_input_tokens_seen": 1672500, "step": 887, "train_runtime": 2408.3028, "train_tokens_per_second": 694.472 }, { "epoch": 0.8976497346474602, "grad_norm": 1.5627840757369995, "learning_rate": 1.106835443037975e-05, "loss": 0.08412830531597137, "num_input_tokens_seen": 1674008, "step": 888, "train_runtime": 2410.4956, "train_tokens_per_second": 694.466 }, { "epoch": 0.8986606014657569, "grad_norm": 1.4462611675262451, "learning_rate": 1.1058227848101267e-05, "loss": 0.07267887145280838, "num_input_tokens_seen": 1676148, "step": 889, "train_runtime": 2412.8538, "train_tokens_per_second": 694.674 }, { "epoch": 0.8996714682840535, "grad_norm": 2.0984222888946533, "learning_rate": 1.1048101265822786e-05, "loss": 0.14878182113170624, "num_input_tokens_seen": 1677864, "step": 890, "train_runtime": 2415.0363, "train_tokens_per_second": 694.757 }, { "epoch": 0.9006823351023503, "grad_norm": 1.4134807586669922, "learning_rate": 1.1037974683544307e-05, "loss": 0.06635203212499619, "num_input_tokens_seen": 1679694, "step": 891, "train_runtime": 2417.2867, "train_tokens_per_second": 694.868 }, { "epoch": 0.901693201920647, "grad_norm": 1.820233702659607, "learning_rate": 1.1027848101265824e-05, "loss": 0.12284374982118607, "num_input_tokens_seen": 1681590, "step": 892, "train_runtime": 2419.5393, "train_tokens_per_second": 695.004 }, { "epoch": 0.9027040687389436, "grad_norm": 1.402327299118042, "learning_rate": 1.1017721518987343e-05, "loss": 0.06556926667690277, "num_input_tokens_seen": 1683350, "step": 893, "train_runtime": 2421.7277, "train_tokens_per_second": 695.103 }, { "epoch": 0.9037149355572404, "grad_norm": 1.325697422027588, "learning_rate": 1.100759493670886e-05, "loss": 0.06861738860607147, "num_input_tokens_seen": 1685174, "step": 894, "train_runtime": 2423.919, "train_tokens_per_second": 695.227 }, { "epoch": 0.904725802375537, "grad_norm": 1.6240726709365845, "learning_rate": 1.0997468354430381e-05, "loss": 0.10145942866802216, "num_input_tokens_seen": 1687326, "step": 895, "train_runtime": 2426.1683, "train_tokens_per_second": 695.469 }, { "epoch": 0.9057366691938337, "grad_norm": 1.628271222114563, "learning_rate": 1.09873417721519e-05, "loss": 0.09534229338169098, "num_input_tokens_seen": 1689160, "step": 896, "train_runtime": 2428.3708, "train_tokens_per_second": 695.594 }, { "epoch": 0.9067475360121304, "grad_norm": 2.222989797592163, "learning_rate": 1.0977215189873418e-05, "loss": 0.08482712507247925, "num_input_tokens_seen": 1690894, "step": 897, "train_runtime": 2430.5452, "train_tokens_per_second": 695.685 }, { "epoch": 0.9077584028304271, "grad_norm": 1.6820749044418335, "learning_rate": 1.0967088607594938e-05, "loss": 0.09884992986917496, "num_input_tokens_seen": 1692400, "step": 898, "train_runtime": 2432.691, "train_tokens_per_second": 695.69 }, { "epoch": 0.9087692696487237, "grad_norm": 1.7538076639175415, "learning_rate": 1.0956962025316458e-05, "loss": 0.10634830594062805, "num_input_tokens_seen": 1694112, "step": 899, "train_runtime": 2434.8546, "train_tokens_per_second": 695.775 }, { "epoch": 0.9097801364670205, "grad_norm": 1.9143922328948975, "learning_rate": 1.0946835443037975e-05, "loss": 0.13174308836460114, "num_input_tokens_seen": 1695600, "step": 900, "train_runtime": 2436.9476, "train_tokens_per_second": 695.788 }, { "epoch": 0.9107910032853171, "grad_norm": 1.4580113887786865, "learning_rate": 1.0936708860759496e-05, "loss": 0.10258884727954865, "num_input_tokens_seen": 1697734, "step": 901, "train_runtime": 2446.3717, "train_tokens_per_second": 693.98 }, { "epoch": 0.9118018701036138, "grad_norm": 1.4541841745376587, "learning_rate": 1.0926582278481013e-05, "loss": 0.08640728145837784, "num_input_tokens_seen": 1699566, "step": 902, "train_runtime": 2448.5989, "train_tokens_per_second": 694.097 }, { "epoch": 0.9128127369219106, "grad_norm": 1.6778219938278198, "learning_rate": 1.0916455696202532e-05, "loss": 0.08899082988500595, "num_input_tokens_seen": 1701632, "step": 903, "train_runtime": 2450.8212, "train_tokens_per_second": 694.311 }, { "epoch": 0.9138236037402072, "grad_norm": 1.7936662435531616, "learning_rate": 1.0906329113924053e-05, "loss": 0.09717955440282822, "num_input_tokens_seen": 1703610, "step": 904, "train_runtime": 2453.057, "train_tokens_per_second": 694.484 }, { "epoch": 0.9148344705585039, "grad_norm": 1.6489940881729126, "learning_rate": 1.089620253164557e-05, "loss": 0.09587058424949646, "num_input_tokens_seen": 1705760, "step": 905, "train_runtime": 2455.2887, "train_tokens_per_second": 694.729 }, { "epoch": 0.9158453373768006, "grad_norm": 1.867157220840454, "learning_rate": 1.088607594936709e-05, "loss": 0.1219547688961029, "num_input_tokens_seen": 1708032, "step": 906, "train_runtime": 2457.5743, "train_tokens_per_second": 695.007 }, { "epoch": 0.9168562041950973, "grad_norm": 2.6823201179504395, "learning_rate": 1.0875949367088607e-05, "loss": 0.15664678812026978, "num_input_tokens_seen": 1709656, "step": 907, "train_runtime": 2459.7658, "train_tokens_per_second": 695.048 }, { "epoch": 0.9178670710133939, "grad_norm": 1.6702855825424194, "learning_rate": 1.0865822784810128e-05, "loss": 0.09947992861270905, "num_input_tokens_seen": 1711488, "step": 908, "train_runtime": 2461.9467, "train_tokens_per_second": 695.177 }, { "epoch": 0.9188779378316907, "grad_norm": 1.5098493099212646, "learning_rate": 1.0855696202531647e-05, "loss": 0.07601018249988556, "num_input_tokens_seen": 1713238, "step": 909, "train_runtime": 2464.1187, "train_tokens_per_second": 695.274 }, { "epoch": 0.9198888046499873, "grad_norm": 1.5049681663513184, "learning_rate": 1.0845569620253164e-05, "loss": 0.08372560143470764, "num_input_tokens_seen": 1714968, "step": 910, "train_runtime": 2466.2875, "train_tokens_per_second": 695.364 }, { "epoch": 0.9208996714682841, "grad_norm": 1.6285735368728638, "learning_rate": 1.0835443037974685e-05, "loss": 0.07884393632411957, "num_input_tokens_seen": 1716480, "step": 911, "train_runtime": 2468.4271, "train_tokens_per_second": 695.374 }, { "epoch": 0.9219105382865808, "grad_norm": 1.430666208267212, "learning_rate": 1.0825316455696204e-05, "loss": 0.06769224256277084, "num_input_tokens_seen": 1718392, "step": 912, "train_runtime": 2470.7027, "train_tokens_per_second": 695.507 }, { "epoch": 0.9229214051048774, "grad_norm": 1.9251612424850464, "learning_rate": 1.0815189873417721e-05, "loss": 0.11051812767982483, "num_input_tokens_seen": 1720378, "step": 913, "train_runtime": 2473.1359, "train_tokens_per_second": 695.626 }, { "epoch": 0.9239322719231742, "grad_norm": 1.7929903268814087, "learning_rate": 1.0805063291139242e-05, "loss": 0.12665323913097382, "num_input_tokens_seen": 1722602, "step": 914, "train_runtime": 2475.4055, "train_tokens_per_second": 695.887 }, { "epoch": 0.9249431387414708, "grad_norm": 1.718106985092163, "learning_rate": 1.079493670886076e-05, "loss": 0.0947490707039833, "num_input_tokens_seen": 1724174, "step": 915, "train_runtime": 2477.5849, "train_tokens_per_second": 695.909 }, { "epoch": 0.9259540055597675, "grad_norm": 1.8282264471054077, "learning_rate": 1.0784810126582279e-05, "loss": 0.11499021202325821, "num_input_tokens_seen": 1726094, "step": 916, "train_runtime": 2479.8114, "train_tokens_per_second": 696.059 }, { "epoch": 0.9269648723780642, "grad_norm": 1.7916219234466553, "learning_rate": 1.07746835443038e-05, "loss": 0.12264146655797958, "num_input_tokens_seen": 1728142, "step": 917, "train_runtime": 2482.0531, "train_tokens_per_second": 696.255 }, { "epoch": 0.9279757391963609, "grad_norm": 1.693138599395752, "learning_rate": 1.0764556962025317e-05, "loss": 0.09038832783699036, "num_input_tokens_seen": 1729944, "step": 918, "train_runtime": 2484.2402, "train_tokens_per_second": 696.367 }, { "epoch": 0.9289866060146575, "grad_norm": 1.6037993431091309, "learning_rate": 1.0754430379746836e-05, "loss": 0.08162438869476318, "num_input_tokens_seen": 1731584, "step": 919, "train_runtime": 2486.4928, "train_tokens_per_second": 696.396 }, { "epoch": 0.9299974728329543, "grad_norm": 1.5550346374511719, "learning_rate": 1.0744303797468357e-05, "loss": 0.08870391547679901, "num_input_tokens_seen": 1733392, "step": 920, "train_runtime": 2488.711, "train_tokens_per_second": 696.502 }, { "epoch": 0.931008339651251, "grad_norm": 1.3631558418273926, "learning_rate": 1.0734177215189874e-05, "loss": 0.07918770611286163, "num_input_tokens_seen": 1735478, "step": 921, "train_runtime": 2491.0273, "train_tokens_per_second": 696.692 }, { "epoch": 0.9320192064695476, "grad_norm": 1.8613494634628296, "learning_rate": 1.0724050632911393e-05, "loss": 0.11431507766246796, "num_input_tokens_seen": 1737024, "step": 922, "train_runtime": 2493.1602, "train_tokens_per_second": 696.716 }, { "epoch": 0.9330300732878444, "grad_norm": 1.7264175415039062, "learning_rate": 1.071392405063291e-05, "loss": 0.0920799970626831, "num_input_tokens_seen": 1738466, "step": 923, "train_runtime": 2495.2574, "train_tokens_per_second": 696.708 }, { "epoch": 0.934040940106141, "grad_norm": 1.6748762130737305, "learning_rate": 1.0703797468354431e-05, "loss": 0.09041954576969147, "num_input_tokens_seen": 1740182, "step": 924, "train_runtime": 2497.4465, "train_tokens_per_second": 696.785 }, { "epoch": 0.9350518069244377, "grad_norm": 1.7656514644622803, "learning_rate": 1.069367088607595e-05, "loss": 0.09037000685930252, "num_input_tokens_seen": 1742024, "step": 925, "train_runtime": 2499.6331, "train_tokens_per_second": 696.912 }, { "epoch": 0.9360626737427344, "grad_norm": 1.6852999925613403, "learning_rate": 1.0683544303797468e-05, "loss": 0.08460486680269241, "num_input_tokens_seen": 1744238, "step": 926, "train_runtime": 2501.912, "train_tokens_per_second": 697.162 }, { "epoch": 0.9370735405610311, "grad_norm": 2.154926300048828, "learning_rate": 1.0673417721518988e-05, "loss": 0.11571793258190155, "num_input_tokens_seen": 1746118, "step": 927, "train_runtime": 2504.0921, "train_tokens_per_second": 697.306 }, { "epoch": 0.9380844073793277, "grad_norm": 1.6266175508499146, "learning_rate": 1.0663291139240508e-05, "loss": 0.0903712585568428, "num_input_tokens_seen": 1748128, "step": 928, "train_runtime": 2506.3025, "train_tokens_per_second": 697.493 }, { "epoch": 0.9390952741976245, "grad_norm": 1.5624279975891113, "learning_rate": 1.0653164556962025e-05, "loss": 0.08536509424448013, "num_input_tokens_seen": 1749964, "step": 929, "train_runtime": 2508.4779, "train_tokens_per_second": 697.62 }, { "epoch": 0.9401061410159212, "grad_norm": 2.820284605026245, "learning_rate": 1.0643037974683546e-05, "loss": 0.1169944703578949, "num_input_tokens_seen": 1752108, "step": 930, "train_runtime": 2510.7292, "train_tokens_per_second": 697.848 }, { "epoch": 0.9411170078342178, "grad_norm": 1.3601627349853516, "learning_rate": 1.0632911392405063e-05, "loss": 0.06507647782564163, "num_input_tokens_seen": 1753674, "step": 931, "train_runtime": 2520.0221, "train_tokens_per_second": 695.896 }, { "epoch": 0.9421278746525146, "grad_norm": 2.0614519119262695, "learning_rate": 1.0622784810126582e-05, "loss": 0.14873051643371582, "num_input_tokens_seen": 1755348, "step": 932, "train_runtime": 2522.189, "train_tokens_per_second": 695.962 }, { "epoch": 0.9431387414708112, "grad_norm": 1.4850870370864868, "learning_rate": 1.0612658227848103e-05, "loss": 0.07789217680692673, "num_input_tokens_seen": 1757138, "step": 933, "train_runtime": 2524.3834, "train_tokens_per_second": 696.066 }, { "epoch": 0.9441496082891079, "grad_norm": 1.842126488685608, "learning_rate": 1.060253164556962e-05, "loss": 0.12018195539712906, "num_input_tokens_seen": 1759246, "step": 934, "train_runtime": 2526.6456, "train_tokens_per_second": 696.277 }, { "epoch": 0.9451604751074046, "grad_norm": 1.6177433729171753, "learning_rate": 1.059240506329114e-05, "loss": 0.10012046992778778, "num_input_tokens_seen": 1760924, "step": 935, "train_runtime": 2528.8352, "train_tokens_per_second": 696.338 }, { "epoch": 0.9461713419257013, "grad_norm": 1.530370831489563, "learning_rate": 1.058227848101266e-05, "loss": 0.10050593316555023, "num_input_tokens_seen": 1762612, "step": 936, "train_runtime": 2531.0299, "train_tokens_per_second": 696.401 }, { "epoch": 0.9471822087439979, "grad_norm": 2.1758036613464355, "learning_rate": 1.0572151898734178e-05, "loss": 0.10238852351903915, "num_input_tokens_seen": 1764110, "step": 937, "train_runtime": 2533.1454, "train_tokens_per_second": 696.411 }, { "epoch": 0.9481930755622947, "grad_norm": 1.4356797933578491, "learning_rate": 1.0562025316455697e-05, "loss": 0.07690879702568054, "num_input_tokens_seen": 1765750, "step": 938, "train_runtime": 2535.2657, "train_tokens_per_second": 696.475 }, { "epoch": 0.9492039423805914, "grad_norm": 1.4490258693695068, "learning_rate": 1.0551898734177216e-05, "loss": 0.0861949697136879, "num_input_tokens_seen": 1768042, "step": 939, "train_runtime": 2537.5346, "train_tokens_per_second": 696.756 }, { "epoch": 0.950214809198888, "grad_norm": 1.7231247425079346, "learning_rate": 1.0541772151898735e-05, "loss": 0.09950204193592072, "num_input_tokens_seen": 1769708, "step": 940, "train_runtime": 2539.653, "train_tokens_per_second": 696.831 }, { "epoch": 0.9512256760171848, "grad_norm": 1.4435205459594727, "learning_rate": 1.0531645569620254e-05, "loss": 0.07849620282649994, "num_input_tokens_seen": 1771470, "step": 941, "train_runtime": 2541.8041, "train_tokens_per_second": 696.934 }, { "epoch": 0.9522365428354814, "grad_norm": 1.6984418630599976, "learning_rate": 1.0521518987341773e-05, "loss": 0.11402212083339691, "num_input_tokens_seen": 1773556, "step": 942, "train_runtime": 2544.0973, "train_tokens_per_second": 697.126 }, { "epoch": 0.9532474096537781, "grad_norm": 1.6391994953155518, "learning_rate": 1.0511392405063292e-05, "loss": 0.10636426508426666, "num_input_tokens_seen": 1775544, "step": 943, "train_runtime": 2546.3665, "train_tokens_per_second": 697.285 }, { "epoch": 0.9542582764720748, "grad_norm": 1.7203863859176636, "learning_rate": 1.0501265822784811e-05, "loss": 0.09291623532772064, "num_input_tokens_seen": 1777788, "step": 944, "train_runtime": 2548.6243, "train_tokens_per_second": 697.548 }, { "epoch": 0.9552691432903715, "grad_norm": 2.124809980392456, "learning_rate": 1.049113924050633e-05, "loss": 0.125258207321167, "num_input_tokens_seen": 1779460, "step": 945, "train_runtime": 2550.7651, "train_tokens_per_second": 697.618 }, { "epoch": 0.9562800101086681, "grad_norm": 1.8077716827392578, "learning_rate": 1.048101265822785e-05, "loss": 0.11999374628067017, "num_input_tokens_seen": 1781276, "step": 946, "train_runtime": 2552.975, "train_tokens_per_second": 697.726 }, { "epoch": 0.9572908769269649, "grad_norm": 1.5265414714813232, "learning_rate": 1.0470886075949367e-05, "loss": 0.08729196339845657, "num_input_tokens_seen": 1783112, "step": 947, "train_runtime": 2555.1893, "train_tokens_per_second": 697.839 }, { "epoch": 0.9583017437452616, "grad_norm": 1.4505257606506348, "learning_rate": 1.0460759493670888e-05, "loss": 0.07770172506570816, "num_input_tokens_seen": 1784986, "step": 948, "train_runtime": 2557.4548, "train_tokens_per_second": 697.954 }, { "epoch": 0.9593126105635582, "grad_norm": 1.8700900077819824, "learning_rate": 1.0450632911392407e-05, "loss": 0.13766318559646606, "num_input_tokens_seen": 1787244, "step": 949, "train_runtime": 2559.7514, "train_tokens_per_second": 698.21 }, { "epoch": 0.960323477381855, "grad_norm": 1.7047700881958008, "learning_rate": 1.0440506329113924e-05, "loss": 0.09592680633068085, "num_input_tokens_seen": 1788888, "step": 950, "train_runtime": 2561.9143, "train_tokens_per_second": 698.262 }, { "epoch": 0.9613343442001516, "grad_norm": 2.1990907192230225, "learning_rate": 1.0430379746835443e-05, "loss": 0.09640653431415558, "num_input_tokens_seen": 1790766, "step": 951, "train_runtime": 2564.2404, "train_tokens_per_second": 698.361 }, { "epoch": 0.9623452110184483, "grad_norm": 1.5744006633758545, "learning_rate": 1.0420253164556964e-05, "loss": 0.09867499768733978, "num_input_tokens_seen": 1792828, "step": 952, "train_runtime": 2566.5341, "train_tokens_per_second": 698.54 }, { "epoch": 0.963356077836745, "grad_norm": 2.293447971343994, "learning_rate": 1.0410126582278481e-05, "loss": 0.10601398348808289, "num_input_tokens_seen": 1794592, "step": 953, "train_runtime": 2568.7134, "train_tokens_per_second": 698.635 }, { "epoch": 0.9643669446550417, "grad_norm": 1.9407451152801514, "learning_rate": 1.04e-05, "loss": 0.10499546676874161, "num_input_tokens_seen": 1796582, "step": 954, "train_runtime": 2570.8862, "train_tokens_per_second": 698.818 }, { "epoch": 0.9653778114733383, "grad_norm": 1.9761666059494019, "learning_rate": 1.038987341772152e-05, "loss": 0.10242647677659988, "num_input_tokens_seen": 1798762, "step": 955, "train_runtime": 2573.1185, "train_tokens_per_second": 699.059 }, { "epoch": 0.9663886782916351, "grad_norm": 2.1975674629211426, "learning_rate": 1.0379746835443039e-05, "loss": 0.10388092696666718, "num_input_tokens_seen": 1800326, "step": 956, "train_runtime": 2575.2121, "train_tokens_per_second": 699.098 }, { "epoch": 0.9673995451099318, "grad_norm": 1.1983399391174316, "learning_rate": 1.0369620253164558e-05, "loss": 0.06608706712722778, "num_input_tokens_seen": 1802300, "step": 957, "train_runtime": 2577.4185, "train_tokens_per_second": 699.266 }, { "epoch": 0.9684104119282284, "grad_norm": 1.9207825660705566, "learning_rate": 1.0359493670886077e-05, "loss": 0.11018344014883041, "num_input_tokens_seen": 1804308, "step": 958, "train_runtime": 2579.651, "train_tokens_per_second": 699.439 }, { "epoch": 0.9694212787465252, "grad_norm": 1.5126341581344604, "learning_rate": 1.0349367088607596e-05, "loss": 0.09055756777524948, "num_input_tokens_seen": 1806076, "step": 959, "train_runtime": 2581.8815, "train_tokens_per_second": 699.519 }, { "epoch": 0.9704321455648218, "grad_norm": 1.6882377862930298, "learning_rate": 1.0339240506329115e-05, "loss": 0.07870013266801834, "num_input_tokens_seen": 1807730, "step": 960, "train_runtime": 2584.0348, "train_tokens_per_second": 699.577 }, { "epoch": 0.9714430123831185, "grad_norm": 1.9891482591629028, "learning_rate": 1.0329113924050634e-05, "loss": 0.10766452550888062, "num_input_tokens_seen": 1809348, "step": 961, "train_runtime": 2593.2073, "train_tokens_per_second": 697.726 }, { "epoch": 0.9724538792014152, "grad_norm": 2.0645711421966553, "learning_rate": 1.0318987341772153e-05, "loss": 0.11320405453443527, "num_input_tokens_seen": 1811064, "step": 962, "train_runtime": 2595.4138, "train_tokens_per_second": 697.794 }, { "epoch": 0.9734647460197119, "grad_norm": 1.7952691316604614, "learning_rate": 1.030886075949367e-05, "loss": 0.1397959589958191, "num_input_tokens_seen": 1813668, "step": 963, "train_runtime": 2597.7892, "train_tokens_per_second": 698.158 }, { "epoch": 0.9744756128380085, "grad_norm": 1.5612289905548096, "learning_rate": 1.0298734177215191e-05, "loss": 0.08474574983119965, "num_input_tokens_seen": 1815248, "step": 964, "train_runtime": 2599.8867, "train_tokens_per_second": 698.203 }, { "epoch": 0.9754864796563053, "grad_norm": 1.7819595336914062, "learning_rate": 1.028860759493671e-05, "loss": 0.08624096214771271, "num_input_tokens_seen": 1816818, "step": 965, "train_runtime": 2602.011, "train_tokens_per_second": 698.236 }, { "epoch": 0.976497346474602, "grad_norm": 1.9061187505722046, "learning_rate": 1.0278481012658228e-05, "loss": 0.09254920482635498, "num_input_tokens_seen": 1818406, "step": 966, "train_runtime": 2604.1729, "train_tokens_per_second": 698.266 }, { "epoch": 0.9775082132928986, "grad_norm": 1.5857383012771606, "learning_rate": 1.0268354430379748e-05, "loss": 0.09439010918140411, "num_input_tokens_seen": 1820820, "step": 967, "train_runtime": 2606.4961, "train_tokens_per_second": 698.57 }, { "epoch": 0.9785190801111954, "grad_norm": 2.2102553844451904, "learning_rate": 1.0258227848101268e-05, "loss": 0.10842249542474747, "num_input_tokens_seen": 1822530, "step": 968, "train_runtime": 2608.6957, "train_tokens_per_second": 698.636 }, { "epoch": 0.979529946929492, "grad_norm": 1.7259248495101929, "learning_rate": 1.0248101265822785e-05, "loss": 0.07752262055873871, "num_input_tokens_seen": 1824318, "step": 969, "train_runtime": 2610.8761, "train_tokens_per_second": 698.738 }, { "epoch": 0.9805408137477887, "grad_norm": 1.5594508647918701, "learning_rate": 1.0237974683544306e-05, "loss": 0.08729353547096252, "num_input_tokens_seen": 1826020, "step": 970, "train_runtime": 2613.0343, "train_tokens_per_second": 698.812 }, { "epoch": 0.9815516805660854, "grad_norm": 1.7379978895187378, "learning_rate": 1.0227848101265823e-05, "loss": 0.11745233088731766, "num_input_tokens_seen": 1827850, "step": 971, "train_runtime": 2615.2119, "train_tokens_per_second": 698.93 }, { "epoch": 0.9825625473843821, "grad_norm": 1.4099138975143433, "learning_rate": 1.0217721518987342e-05, "loss": 0.091756671667099, "num_input_tokens_seen": 1829772, "step": 972, "train_runtime": 2617.4338, "train_tokens_per_second": 699.071 }, { "epoch": 0.9835734142026787, "grad_norm": 1.8185721635818481, "learning_rate": 1.0207594936708863e-05, "loss": 0.09723731875419617, "num_input_tokens_seen": 1831816, "step": 973, "train_runtime": 2619.7458, "train_tokens_per_second": 699.234 }, { "epoch": 0.9845842810209755, "grad_norm": 1.6812020540237427, "learning_rate": 1.019746835443038e-05, "loss": 0.10204876214265823, "num_input_tokens_seen": 1833678, "step": 974, "train_runtime": 2621.9666, "train_tokens_per_second": 699.352 }, { "epoch": 0.9855951478392722, "grad_norm": 1.5610170364379883, "learning_rate": 1.01873417721519e-05, "loss": 0.060523878782987595, "num_input_tokens_seen": 1835588, "step": 975, "train_runtime": 2624.1735, "train_tokens_per_second": 699.492 }, { "epoch": 0.9866060146575689, "grad_norm": 1.766232967376709, "learning_rate": 1.017721518987342e-05, "loss": 0.0874742791056633, "num_input_tokens_seen": 1837268, "step": 976, "train_runtime": 2626.3732, "train_tokens_per_second": 699.546 }, { "epoch": 0.9876168814758656, "grad_norm": 1.7839418649673462, "learning_rate": 1.0167088607594938e-05, "loss": 0.10308610647916794, "num_input_tokens_seen": 1839268, "step": 977, "train_runtime": 2628.5998, "train_tokens_per_second": 699.714 }, { "epoch": 0.9886277482941622, "grad_norm": 1.7231510877609253, "learning_rate": 1.0156962025316457e-05, "loss": 0.12159512937068939, "num_input_tokens_seen": 1841210, "step": 978, "train_runtime": 2630.8425, "train_tokens_per_second": 699.856 }, { "epoch": 0.989638615112459, "grad_norm": 2.347747325897217, "learning_rate": 1.0146835443037974e-05, "loss": 0.09375277906656265, "num_input_tokens_seen": 1842680, "step": 979, "train_runtime": 2632.9526, "train_tokens_per_second": 699.853 }, { "epoch": 0.9906494819307556, "grad_norm": 2.045182466506958, "learning_rate": 1.0136708860759495e-05, "loss": 0.12371169030666351, "num_input_tokens_seen": 1844666, "step": 980, "train_runtime": 2635.1939, "train_tokens_per_second": 700.011 }, { "epoch": 0.9916603487490523, "grad_norm": 1.5627561807632446, "learning_rate": 1.0126582278481014e-05, "loss": 0.0825665146112442, "num_input_tokens_seen": 1846488, "step": 981, "train_runtime": 2637.3771, "train_tokens_per_second": 700.123 }, { "epoch": 0.992671215567349, "grad_norm": 1.7864357233047485, "learning_rate": 1.0116455696202531e-05, "loss": 0.08284065872430801, "num_input_tokens_seen": 1847874, "step": 982, "train_runtime": 2639.5478, "train_tokens_per_second": 700.072 }, { "epoch": 0.9936820823856457, "grad_norm": 2.170645236968994, "learning_rate": 1.0106329113924052e-05, "loss": 0.13837072253227234, "num_input_tokens_seen": 1850558, "step": 983, "train_runtime": 2641.967, "train_tokens_per_second": 700.447 }, { "epoch": 0.9946929492039424, "grad_norm": 1.9412685632705688, "learning_rate": 1.0096202531645571e-05, "loss": 0.11869412660598755, "num_input_tokens_seen": 1852386, "step": 984, "train_runtime": 2644.2438, "train_tokens_per_second": 700.535 }, { "epoch": 0.9957038160222391, "grad_norm": 1.5198384523391724, "learning_rate": 1.0086075949367089e-05, "loss": 0.07557395100593567, "num_input_tokens_seen": 1853996, "step": 985, "train_runtime": 2646.4346, "train_tokens_per_second": 700.564 }, { "epoch": 0.9967146828405358, "grad_norm": 1.7301899194717407, "learning_rate": 1.007594936708861e-05, "loss": 0.09189169108867645, "num_input_tokens_seen": 1855850, "step": 986, "train_runtime": 2648.6551, "train_tokens_per_second": 700.676 }, { "epoch": 0.9977255496588324, "grad_norm": 1.65177583694458, "learning_rate": 1.0065822784810127e-05, "loss": 0.07830586284399033, "num_input_tokens_seen": 1857768, "step": 987, "train_runtime": 2650.8683, "train_tokens_per_second": 700.815 }, { "epoch": 0.9987364164771292, "grad_norm": 1.5787363052368164, "learning_rate": 1.0055696202531646e-05, "loss": 0.08452092856168747, "num_input_tokens_seen": 1859650, "step": 988, "train_runtime": 2653.0899, "train_tokens_per_second": 700.937 }, { "epoch": 0.9997472832954258, "grad_norm": 2.041066884994507, "learning_rate": 1.0045569620253167e-05, "loss": 0.1346156895160675, "num_input_tokens_seen": 1861366, "step": 989, "train_runtime": 2655.2932, "train_tokens_per_second": 701.002 }, { "epoch": 1.0, "grad_norm": 23.19478416442871, "learning_rate": 1.0035443037974684e-05, "loss": 0.34900957345962524, "num_input_tokens_seen": 1861552, "step": 990, "train_runtime": 2665.3394, "train_tokens_per_second": 698.43 }, { "epoch": 1.0, "eval_loss": 0.3873527944087982, "eval_runtime": 52.9081, "eval_samples_per_second": 16.614, "eval_steps_per_second": 8.316, "num_input_tokens_seen": 1861552, "step": 990 }, { "epoch": 1.0010108668182967, "grad_norm": 1.6322622299194336, "learning_rate": 1.0025316455696203e-05, "loss": 0.07481811940670013, "num_input_tokens_seen": 1863014, "step": 991, "train_runtime": 2727.6173, "train_tokens_per_second": 683.019 }, { "epoch": 1.0020217336365933, "grad_norm": 1.3781479597091675, "learning_rate": 1.0015189873417724e-05, "loss": 0.1042320504784584, "num_input_tokens_seen": 1865072, "step": 992, "train_runtime": 2730.0183, "train_tokens_per_second": 683.172 }, { "epoch": 1.0030326004548902, "grad_norm": 1.300392508506775, "learning_rate": 1.0005063291139241e-05, "loss": 0.08801354467868805, "num_input_tokens_seen": 1867012, "step": 993, "train_runtime": 2732.239, "train_tokens_per_second": 683.327 }, { "epoch": 1.0040434672731868, "grad_norm": 1.5778790712356567, "learning_rate": 9.99493670886076e-06, "loss": 0.09628298133611679, "num_input_tokens_seen": 1868564, "step": 994, "train_runtime": 2734.3721, "train_tokens_per_second": 683.361 }, { "epoch": 1.0050543340914835, "grad_norm": 1.264314889907837, "learning_rate": 9.98481012658228e-06, "loss": 0.06317774206399918, "num_input_tokens_seen": 1870560, "step": 995, "train_runtime": 2736.5927, "train_tokens_per_second": 683.536 }, { "epoch": 1.0060652009097801, "grad_norm": 1.314989447593689, "learning_rate": 9.974683544303799e-06, "loss": 0.06444258987903595, "num_input_tokens_seen": 1872450, "step": 996, "train_runtime": 2738.8083, "train_tokens_per_second": 683.673 }, { "epoch": 1.0070760677280768, "grad_norm": 1.285747766494751, "learning_rate": 9.964556962025318e-06, "loss": 0.0854601040482521, "num_input_tokens_seen": 1874370, "step": 997, "train_runtime": 2741.0467, "train_tokens_per_second": 683.815 }, { "epoch": 1.0080869345463734, "grad_norm": 1.5861116647720337, "learning_rate": 9.954430379746837e-06, "loss": 0.09532982110977173, "num_input_tokens_seen": 1876216, "step": 998, "train_runtime": 2743.2362, "train_tokens_per_second": 683.943 }, { "epoch": 1.0090978013646703, "grad_norm": 1.652181625366211, "learning_rate": 9.944303797468356e-06, "loss": 0.05342147499322891, "num_input_tokens_seen": 1878082, "step": 999, "train_runtime": 2745.453, "train_tokens_per_second": 684.07 }, { "epoch": 1.010108668182967, "grad_norm": 1.6445740461349487, "learning_rate": 9.934177215189875e-06, "loss": 0.0853542909026146, "num_input_tokens_seen": 1879650, "step": 1000, "train_runtime": 2747.5812, "train_tokens_per_second": 684.111 }, { "epoch": 1.0111195350012636, "grad_norm": 1.2546181678771973, "learning_rate": 9.924050632911392e-06, "loss": 0.06549844145774841, "num_input_tokens_seen": 1881368, "step": 1001, "train_runtime": 2749.7809, "train_tokens_per_second": 684.188 }, { "epoch": 1.0121304018195603, "grad_norm": 1.8068426847457886, "learning_rate": 9.913924050632913e-06, "loss": 0.06808516383171082, "num_input_tokens_seen": 1882806, "step": 1002, "train_runtime": 2751.8812, "train_tokens_per_second": 684.189 }, { "epoch": 1.013141268637857, "grad_norm": 1.35905921459198, "learning_rate": 9.903797468354432e-06, "loss": 0.06314563751220703, "num_input_tokens_seen": 1884588, "step": 1003, "train_runtime": 2754.0677, "train_tokens_per_second": 684.293 }, { "epoch": 1.0141521354561536, "grad_norm": 1.603310227394104, "learning_rate": 9.89367088607595e-06, "loss": 0.08736512064933777, "num_input_tokens_seen": 1886554, "step": 1004, "train_runtime": 2756.2612, "train_tokens_per_second": 684.461 }, { "epoch": 1.0151630022744504, "grad_norm": 1.5805072784423828, "learning_rate": 9.883544303797469e-06, "loss": 0.0734487920999527, "num_input_tokens_seen": 1888610, "step": 1005, "train_runtime": 2758.5089, "train_tokens_per_second": 684.649 }, { "epoch": 1.016173869092747, "grad_norm": 1.6719231605529785, "learning_rate": 9.87341772151899e-06, "loss": 0.06566613167524338, "num_input_tokens_seen": 1890282, "step": 1006, "train_runtime": 2760.6988, "train_tokens_per_second": 684.711 }, { "epoch": 1.0171847359110437, "grad_norm": 1.2021580934524536, "learning_rate": 9.863291139240507e-06, "loss": 0.044181108474731445, "num_input_tokens_seen": 1891916, "step": 1007, "train_runtime": 2762.8328, "train_tokens_per_second": 684.774 }, { "epoch": 1.0181956027293404, "grad_norm": 1.5920672416687012, "learning_rate": 9.853164556962026e-06, "loss": 0.07045289129018784, "num_input_tokens_seen": 1893622, "step": 1008, "train_runtime": 2765.0175, "train_tokens_per_second": 684.85 }, { "epoch": 1.019206469547637, "grad_norm": 1.6282637119293213, "learning_rate": 9.843037974683545e-06, "loss": 0.07991328835487366, "num_input_tokens_seen": 1895592, "step": 1009, "train_runtime": 2767.2855, "train_tokens_per_second": 685.001 }, { "epoch": 1.0202173363659337, "grad_norm": 1.5714997053146362, "learning_rate": 9.832911392405064e-06, "loss": 0.06446757912635803, "num_input_tokens_seen": 1897352, "step": 1010, "train_runtime": 2769.4968, "train_tokens_per_second": 685.089 }, { "epoch": 1.0212282031842306, "grad_norm": 1.7102954387664795, "learning_rate": 9.822784810126583e-06, "loss": 0.07787447422742844, "num_input_tokens_seen": 1898760, "step": 1011, "train_runtime": 2771.6213, "train_tokens_per_second": 685.072 }, { "epoch": 1.0222390700025272, "grad_norm": 1.3697980642318726, "learning_rate": 9.812658227848102e-06, "loss": 0.06436234712600708, "num_input_tokens_seen": 1900986, "step": 1012, "train_runtime": 2773.9398, "train_tokens_per_second": 685.302 }, { "epoch": 1.0232499368208239, "grad_norm": 1.313659906387329, "learning_rate": 9.802531645569621e-06, "loss": 0.0565519705414772, "num_input_tokens_seen": 1902980, "step": 1013, "train_runtime": 2776.2302, "train_tokens_per_second": 685.455 }, { "epoch": 1.0242608036391205, "grad_norm": 1.8654744625091553, "learning_rate": 9.79240506329114e-06, "loss": 0.0803845077753067, "num_input_tokens_seen": 1904582, "step": 1014, "train_runtime": 2778.3688, "train_tokens_per_second": 685.504 }, { "epoch": 1.0252716704574172, "grad_norm": 1.4783668518066406, "learning_rate": 9.78227848101266e-06, "loss": 0.07052680850028992, "num_input_tokens_seen": 1906454, "step": 1015, "train_runtime": 2780.5654, "train_tokens_per_second": 685.635 }, { "epoch": 1.0262825372757138, "grad_norm": 1.5979278087615967, "learning_rate": 9.772151898734179e-06, "loss": 0.07049822062253952, "num_input_tokens_seen": 1908566, "step": 1016, "train_runtime": 2782.9208, "train_tokens_per_second": 685.814 }, { "epoch": 1.0272934040940107, "grad_norm": 1.6667790412902832, "learning_rate": 9.762025316455696e-06, "loss": 0.06343676149845123, "num_input_tokens_seen": 1910098, "step": 1017, "train_runtime": 2785.0856, "train_tokens_per_second": 685.831 }, { "epoch": 1.0283042709123074, "grad_norm": 2.0874030590057373, "learning_rate": 9.751898734177217e-06, "loss": 0.044850949198007584, "num_input_tokens_seen": 1911660, "step": 1018, "train_runtime": 2787.2563, "train_tokens_per_second": 685.857 }, { "epoch": 1.029315137730604, "grad_norm": 1.7865285873413086, "learning_rate": 9.741772151898736e-06, "loss": 0.1001095250248909, "num_input_tokens_seen": 1914106, "step": 1019, "train_runtime": 2789.6004, "train_tokens_per_second": 686.158 }, { "epoch": 1.0303260045489007, "grad_norm": 1.8012917041778564, "learning_rate": 9.731645569620253e-06, "loss": 0.06644564867019653, "num_input_tokens_seen": 1916250, "step": 1020, "train_runtime": 2791.8907, "train_tokens_per_second": 686.363 }, { "epoch": 1.0313368713671973, "grad_norm": 1.9052693843841553, "learning_rate": 9.721518987341772e-06, "loss": 0.05830027908086777, "num_input_tokens_seen": 1918076, "step": 1021, "train_runtime": 2801.4615, "train_tokens_per_second": 684.67 }, { "epoch": 1.032347738185494, "grad_norm": 1.31282377243042, "learning_rate": 9.711392405063293e-06, "loss": 0.06762159615755081, "num_input_tokens_seen": 1919904, "step": 1022, "train_runtime": 2803.7334, "train_tokens_per_second": 684.767 }, { "epoch": 1.0333586050037908, "grad_norm": 1.3395659923553467, "learning_rate": 9.70126582278481e-06, "loss": 0.059425726532936096, "num_input_tokens_seen": 1921690, "step": 1023, "train_runtime": 2805.9302, "train_tokens_per_second": 684.867 }, { "epoch": 1.0343694718220875, "grad_norm": 1.5222976207733154, "learning_rate": 9.69113924050633e-06, "loss": 0.07078788429498672, "num_input_tokens_seen": 1923734, "step": 1024, "train_runtime": 2808.1879, "train_tokens_per_second": 685.045 }, { "epoch": 1.0353803386403841, "grad_norm": 1.51506507396698, "learning_rate": 9.681012658227849e-06, "loss": 0.05457054823637009, "num_input_tokens_seen": 1925552, "step": 1025, "train_runtime": 2810.3814, "train_tokens_per_second": 685.157 }, { "epoch": 1.0363912054586808, "grad_norm": 1.5985889434814453, "learning_rate": 9.670886075949368e-06, "loss": 0.09114349633455276, "num_input_tokens_seen": 1927862, "step": 1026, "train_runtime": 2812.6927, "train_tokens_per_second": 685.415 }, { "epoch": 1.0374020722769774, "grad_norm": 1.4708911180496216, "learning_rate": 9.660759493670887e-06, "loss": 0.07649514824151993, "num_input_tokens_seen": 1930110, "step": 1027, "train_runtime": 2814.9914, "train_tokens_per_second": 685.654 }, { "epoch": 1.038412939095274, "grad_norm": 1.7000125646591187, "learning_rate": 9.650632911392406e-06, "loss": 0.08282623440027237, "num_input_tokens_seen": 1932032, "step": 1028, "train_runtime": 2817.2083, "train_tokens_per_second": 685.797 }, { "epoch": 1.039423805913571, "grad_norm": 1.353649616241455, "learning_rate": 9.640506329113925e-06, "loss": 0.0568917952477932, "num_input_tokens_seen": 1934146, "step": 1029, "train_runtime": 2819.4586, "train_tokens_per_second": 685.999 }, { "epoch": 1.0404346727318676, "grad_norm": 1.6784396171569824, "learning_rate": 9.630379746835444e-06, "loss": 0.0890979915857315, "num_input_tokens_seen": 1936018, "step": 1030, "train_runtime": 2821.6579, "train_tokens_per_second": 686.128 }, { "epoch": 1.0414455395501643, "grad_norm": 1.769243597984314, "learning_rate": 9.620253164556963e-06, "loss": 0.08021090924739838, "num_input_tokens_seen": 1937840, "step": 1031, "train_runtime": 2823.894, "train_tokens_per_second": 686.23 }, { "epoch": 1.042456406368461, "grad_norm": 1.3696779012680054, "learning_rate": 9.610126582278482e-06, "loss": 0.07308374345302582, "num_input_tokens_seen": 1939736, "step": 1032, "train_runtime": 2826.2732, "train_tokens_per_second": 686.323 }, { "epoch": 1.0434672731867576, "grad_norm": 1.5478060245513916, "learning_rate": 9.600000000000001e-06, "loss": 0.07152532041072845, "num_input_tokens_seen": 1941232, "step": 1033, "train_runtime": 2828.4997, "train_tokens_per_second": 686.312 }, { "epoch": 1.0444781400050542, "grad_norm": 1.4040976762771606, "learning_rate": 9.58987341772152e-06, "loss": 0.07309073954820633, "num_input_tokens_seen": 1943502, "step": 1034, "train_runtime": 2830.8529, "train_tokens_per_second": 686.543 }, { "epoch": 1.045489006823351, "grad_norm": 1.8501466512680054, "learning_rate": 9.57974683544304e-06, "loss": 0.09751475602388382, "num_input_tokens_seen": 1945588, "step": 1035, "train_runtime": 2833.18, "train_tokens_per_second": 686.715 }, { "epoch": 1.0464998736416478, "grad_norm": 1.5903476476669312, "learning_rate": 9.569620253164559e-06, "loss": 0.07216263562440872, "num_input_tokens_seen": 1947762, "step": 1036, "train_runtime": 2835.4648, "train_tokens_per_second": 686.929 }, { "epoch": 1.0475107404599444, "grad_norm": 1.4771184921264648, "learning_rate": 9.559493670886076e-06, "loss": 0.06384822726249695, "num_input_tokens_seen": 1949644, "step": 1037, "train_runtime": 2837.686, "train_tokens_per_second": 687.054 }, { "epoch": 1.048521607278241, "grad_norm": 1.484239935874939, "learning_rate": 9.549367088607597e-06, "loss": 0.0580734945833683, "num_input_tokens_seen": 1951800, "step": 1038, "train_runtime": 2839.9898, "train_tokens_per_second": 687.256 }, { "epoch": 1.0495324740965377, "grad_norm": 1.7439597845077515, "learning_rate": 9.539240506329114e-06, "loss": 0.08965416252613068, "num_input_tokens_seen": 1953690, "step": 1039, "train_runtime": 2842.2368, "train_tokens_per_second": 687.378 }, { "epoch": 1.0505433409148344, "grad_norm": 1.3571206331253052, "learning_rate": 9.529113924050633e-06, "loss": 0.06396070867776871, "num_input_tokens_seen": 1955684, "step": 1040, "train_runtime": 2844.5003, "train_tokens_per_second": 687.532 }, { "epoch": 1.0515542077331312, "grad_norm": 2.0411770343780518, "learning_rate": 9.518987341772152e-06, "loss": 0.09158805012702942, "num_input_tokens_seen": 1957194, "step": 1041, "train_runtime": 2846.6497, "train_tokens_per_second": 687.543 }, { "epoch": 1.052565074551428, "grad_norm": 1.2673745155334473, "learning_rate": 9.508860759493671e-06, "loss": 0.0589744858443737, "num_input_tokens_seen": 1959200, "step": 1042, "train_runtime": 2848.9349, "train_tokens_per_second": 687.696 }, { "epoch": 1.0535759413697245, "grad_norm": 1.4214316606521606, "learning_rate": 9.49873417721519e-06, "loss": 0.07307812571525574, "num_input_tokens_seen": 1960834, "step": 1043, "train_runtime": 2851.119, "train_tokens_per_second": 687.742 }, { "epoch": 1.0545868081880212, "grad_norm": 1.6550146341323853, "learning_rate": 9.48860759493671e-06, "loss": 0.07903876900672913, "num_input_tokens_seen": 1962374, "step": 1044, "train_runtime": 2853.294, "train_tokens_per_second": 687.757 }, { "epoch": 1.0555976750063178, "grad_norm": 2.3695287704467773, "learning_rate": 9.478481012658229e-06, "loss": 0.07892453670501709, "num_input_tokens_seen": 1964462, "step": 1045, "train_runtime": 2855.5391, "train_tokens_per_second": 687.948 }, { "epoch": 1.0566085418246145, "grad_norm": 1.7488689422607422, "learning_rate": 9.468354430379748e-06, "loss": 0.09015250205993652, "num_input_tokens_seen": 1966108, "step": 1046, "train_runtime": 2857.7028, "train_tokens_per_second": 688.003 }, { "epoch": 1.0576194086429114, "grad_norm": 1.7064481973648071, "learning_rate": 9.458227848101267e-06, "loss": 0.0758054330945015, "num_input_tokens_seen": 1968492, "step": 1047, "train_runtime": 2860.1156, "train_tokens_per_second": 688.256 }, { "epoch": 1.058630275461208, "grad_norm": 1.639689326286316, "learning_rate": 9.448101265822786e-06, "loss": 0.07452461123466492, "num_input_tokens_seen": 1970174, "step": 1048, "train_runtime": 2862.2955, "train_tokens_per_second": 688.32 }, { "epoch": 1.0596411422795047, "grad_norm": 1.6180789470672607, "learning_rate": 9.437974683544305e-06, "loss": 0.06205502152442932, "num_input_tokens_seen": 1972186, "step": 1049, "train_runtime": 2864.5241, "train_tokens_per_second": 688.486 }, { "epoch": 1.0606520090978013, "grad_norm": 1.6575864553451538, "learning_rate": 9.427848101265824e-06, "loss": 0.09482153505086899, "num_input_tokens_seen": 1974348, "step": 1050, "train_runtime": 2866.8507, "train_tokens_per_second": 688.682 }, { "epoch": 1.061662875916098, "grad_norm": 1.3664395809173584, "learning_rate": 9.417721518987343e-06, "loss": 0.038909636437892914, "num_input_tokens_seen": 1976044, "step": 1051, "train_runtime": 2876.283, "train_tokens_per_second": 687.013 }, { "epoch": 1.0626737427343946, "grad_norm": 1.5591120719909668, "learning_rate": 9.407594936708862e-06, "loss": 0.0615665502846241, "num_input_tokens_seen": 1977710, "step": 1052, "train_runtime": 2878.4783, "train_tokens_per_second": 687.068 }, { "epoch": 1.0636846095526915, "grad_norm": 1.8644870519638062, "learning_rate": 9.39746835443038e-06, "loss": 0.08972452580928802, "num_input_tokens_seen": 1979460, "step": 1053, "train_runtime": 2880.7661, "train_tokens_per_second": 687.13 }, { "epoch": 1.0646954763709882, "grad_norm": 2.219061851501465, "learning_rate": 9.3873417721519e-06, "loss": 0.07273946702480316, "num_input_tokens_seen": 1981128, "step": 1054, "train_runtime": 2882.9032, "train_tokens_per_second": 687.199 }, { "epoch": 1.0657063431892848, "grad_norm": 1.6209571361541748, "learning_rate": 9.37721518987342e-06, "loss": 0.09259951114654541, "num_input_tokens_seen": 1983712, "step": 1055, "train_runtime": 2885.3055, "train_tokens_per_second": 687.522 }, { "epoch": 1.0667172100075815, "grad_norm": 1.4539138078689575, "learning_rate": 9.367088607594937e-06, "loss": 0.062339551746845245, "num_input_tokens_seen": 1985418, "step": 1056, "train_runtime": 2887.5571, "train_tokens_per_second": 687.577 }, { "epoch": 1.0677280768258781, "grad_norm": 1.4814327955245972, "learning_rate": 9.356962025316456e-06, "loss": 0.07369458675384521, "num_input_tokens_seen": 1987526, "step": 1057, "train_runtime": 2889.9762, "train_tokens_per_second": 687.731 }, { "epoch": 1.068738943644175, "grad_norm": 1.6171040534973145, "learning_rate": 9.346835443037977e-06, "loss": 0.06056630611419678, "num_input_tokens_seen": 1989352, "step": 1058, "train_runtime": 2892.3176, "train_tokens_per_second": 687.806 }, { "epoch": 1.0697498104624716, "grad_norm": 1.803268551826477, "learning_rate": 9.336708860759494e-06, "loss": 0.0810079425573349, "num_input_tokens_seen": 1991022, "step": 1059, "train_runtime": 2894.5673, "train_tokens_per_second": 687.848 }, { "epoch": 1.0707606772807683, "grad_norm": 1.46821129322052, "learning_rate": 9.326582278481013e-06, "loss": 0.07994016259908676, "num_input_tokens_seen": 1992680, "step": 1060, "train_runtime": 2896.7319, "train_tokens_per_second": 687.906 }, { "epoch": 1.071771544099065, "grad_norm": 1.612409234046936, "learning_rate": 9.316455696202532e-06, "loss": 0.07581929862499237, "num_input_tokens_seen": 1995068, "step": 1061, "train_runtime": 2899.0779, "train_tokens_per_second": 688.173 }, { "epoch": 1.0727824109173616, "grad_norm": 1.5073354244232178, "learning_rate": 9.306329113924051e-06, "loss": 0.0688956081867218, "num_input_tokens_seen": 1996926, "step": 1062, "train_runtime": 2901.3747, "train_tokens_per_second": 688.269 }, { "epoch": 1.0737932777356582, "grad_norm": 1.8344887495040894, "learning_rate": 9.29620253164557e-06, "loss": 0.05343888700008392, "num_input_tokens_seen": 1998294, "step": 1063, "train_runtime": 2903.5353, "train_tokens_per_second": 688.228 }, { "epoch": 1.074804144553955, "grad_norm": 2.1024980545043945, "learning_rate": 9.28607594936709e-06, "loss": 0.0953790545463562, "num_input_tokens_seen": 2000332, "step": 1064, "train_runtime": 2905.8605, "train_tokens_per_second": 688.379 }, { "epoch": 1.0758150113722518, "grad_norm": 1.8216012716293335, "learning_rate": 9.275949367088609e-06, "loss": 0.07662083953619003, "num_input_tokens_seen": 2002028, "step": 1065, "train_runtime": 2907.9888, "train_tokens_per_second": 688.458 }, { "epoch": 1.0768258781905484, "grad_norm": 1.4832439422607422, "learning_rate": 9.265822784810128e-06, "loss": 0.06126931309700012, "num_input_tokens_seen": 2004148, "step": 1066, "train_runtime": 2910.2692, "train_tokens_per_second": 688.647 }, { "epoch": 1.077836745008845, "grad_norm": 1.6016371250152588, "learning_rate": 9.255696202531647e-06, "loss": 0.07705452293157578, "num_input_tokens_seen": 2006290, "step": 1067, "train_runtime": 2912.5295, "train_tokens_per_second": 688.848 }, { "epoch": 1.0788476118271417, "grad_norm": 1.9054425954818726, "learning_rate": 9.245569620253166e-06, "loss": 0.07443057000637054, "num_input_tokens_seen": 2008128, "step": 1068, "train_runtime": 2914.7102, "train_tokens_per_second": 688.963 }, { "epoch": 1.0798584786454384, "grad_norm": 1.7080419063568115, "learning_rate": 9.235443037974683e-06, "loss": 0.06730297952890396, "num_input_tokens_seen": 2010360, "step": 1069, "train_runtime": 2917.0117, "train_tokens_per_second": 689.185 }, { "epoch": 1.0808693454637353, "grad_norm": 1.4211933612823486, "learning_rate": 9.225316455696204e-06, "loss": 0.06265653669834137, "num_input_tokens_seen": 2012614, "step": 1070, "train_runtime": 2919.3097, "train_tokens_per_second": 689.414 }, { "epoch": 1.081880212282032, "grad_norm": 1.900034785270691, "learning_rate": 9.215189873417723e-06, "loss": 0.06608742475509644, "num_input_tokens_seen": 2014350, "step": 1071, "train_runtime": 2921.5228, "train_tokens_per_second": 689.486 }, { "epoch": 1.0828910791003286, "grad_norm": 1.803638219833374, "learning_rate": 9.20506329113924e-06, "loss": 0.0830145925283432, "num_input_tokens_seen": 2016280, "step": 1072, "train_runtime": 2923.7565, "train_tokens_per_second": 689.62 }, { "epoch": 1.0839019459186252, "grad_norm": 1.8618730306625366, "learning_rate": 9.19493670886076e-06, "loss": 0.08237496018409729, "num_input_tokens_seen": 2018160, "step": 1073, "train_runtime": 2925.9549, "train_tokens_per_second": 689.744 }, { "epoch": 1.0849128127369219, "grad_norm": 1.6639076471328735, "learning_rate": 9.18481012658228e-06, "loss": 0.07322726398706436, "num_input_tokens_seen": 2020416, "step": 1074, "train_runtime": 2928.3337, "train_tokens_per_second": 689.954 }, { "epoch": 1.0859236795552185, "grad_norm": 1.3883980512619019, "learning_rate": 9.174683544303798e-06, "loss": 0.07084261626005173, "num_input_tokens_seen": 2022348, "step": 1075, "train_runtime": 2930.5483, "train_tokens_per_second": 690.092 }, { "epoch": 1.0869345463735154, "grad_norm": 1.5835883617401123, "learning_rate": 9.164556962025317e-06, "loss": 0.06844441592693329, "num_input_tokens_seen": 2024030, "step": 1076, "train_runtime": 2932.7211, "train_tokens_per_second": 690.154 }, { "epoch": 1.087945413191812, "grad_norm": 1.8336513042449951, "learning_rate": 9.154430379746836e-06, "loss": 0.08951697498559952, "num_input_tokens_seen": 2025526, "step": 1077, "train_runtime": 2934.8198, "train_tokens_per_second": 690.17 }, { "epoch": 1.0889562800101087, "grad_norm": 1.4816232919692993, "learning_rate": 9.144303797468355e-06, "loss": 0.05875733122229576, "num_input_tokens_seen": 2027310, "step": 1078, "train_runtime": 2937.003, "train_tokens_per_second": 690.265 }, { "epoch": 1.0899671468284053, "grad_norm": 1.3453950881958008, "learning_rate": 9.134177215189874e-06, "loss": 0.057678379118442535, "num_input_tokens_seen": 2029130, "step": 1079, "train_runtime": 2939.2305, "train_tokens_per_second": 690.361 }, { "epoch": 1.090978013646702, "grad_norm": 1.2752723693847656, "learning_rate": 9.124050632911393e-06, "loss": 0.06412097811698914, "num_input_tokens_seen": 2031392, "step": 1080, "train_runtime": 2941.5368, "train_tokens_per_second": 690.589 }, { "epoch": 1.0919888804649986, "grad_norm": 1.6641526222229004, "learning_rate": 9.113924050632912e-06, "loss": 0.08673028647899628, "num_input_tokens_seen": 2033048, "step": 1081, "train_runtime": 2950.9052, "train_tokens_per_second": 688.957 }, { "epoch": 1.0929997472832955, "grad_norm": 1.4624192714691162, "learning_rate": 9.103797468354431e-06, "loss": 0.052173640578985214, "num_input_tokens_seen": 2034860, "step": 1082, "train_runtime": 2953.1111, "train_tokens_per_second": 689.056 }, { "epoch": 1.0940106141015922, "grad_norm": 1.6662530899047852, "learning_rate": 9.09367088607595e-06, "loss": 0.0618804469704628, "num_input_tokens_seen": 2036578, "step": 1083, "train_runtime": 2955.334, "train_tokens_per_second": 689.119 }, { "epoch": 1.0950214809198888, "grad_norm": 1.7030669450759888, "learning_rate": 9.08354430379747e-06, "loss": 0.06165473163127899, "num_input_tokens_seen": 2038364, "step": 1084, "train_runtime": 2957.5348, "train_tokens_per_second": 689.21 }, { "epoch": 1.0960323477381855, "grad_norm": 1.3679355382919312, "learning_rate": 9.073417721518989e-06, "loss": 0.03944582864642143, "num_input_tokens_seen": 2040330, "step": 1085, "train_runtime": 2959.7266, "train_tokens_per_second": 689.364 }, { "epoch": 1.0970432145564821, "grad_norm": 1.2052851915359497, "learning_rate": 9.063291139240506e-06, "loss": 0.04675544425845146, "num_input_tokens_seen": 2042242, "step": 1086, "train_runtime": 2961.9984, "train_tokens_per_second": 689.481 }, { "epoch": 1.0980540813747788, "grad_norm": 1.8082427978515625, "learning_rate": 9.053164556962027e-06, "loss": 0.08575178682804108, "num_input_tokens_seen": 2044062, "step": 1087, "train_runtime": 2964.2939, "train_tokens_per_second": 689.561 }, { "epoch": 1.0990649481930757, "grad_norm": 1.5417779684066772, "learning_rate": 9.043037974683546e-06, "loss": 0.06239135563373566, "num_input_tokens_seen": 2045578, "step": 1088, "train_runtime": 2966.457, "train_tokens_per_second": 689.569 }, { "epoch": 1.1000758150113723, "grad_norm": 1.6572215557098389, "learning_rate": 9.032911392405063e-06, "loss": 0.07030152529478073, "num_input_tokens_seen": 2047120, "step": 1089, "train_runtime": 2968.6522, "train_tokens_per_second": 689.579 }, { "epoch": 1.101086681829669, "grad_norm": 2.1292786598205566, "learning_rate": 9.022784810126582e-06, "loss": 0.08384208381175995, "num_input_tokens_seen": 2048692, "step": 1090, "train_runtime": 2970.8242, "train_tokens_per_second": 689.604 }, { "epoch": 1.1020975486479656, "grad_norm": 1.7668535709381104, "learning_rate": 9.012658227848103e-06, "loss": 0.0798768550157547, "num_input_tokens_seen": 2050836, "step": 1091, "train_runtime": 2973.1606, "train_tokens_per_second": 689.783 }, { "epoch": 1.1031084154662623, "grad_norm": 1.7629799842834473, "learning_rate": 9.00253164556962e-06, "loss": 0.09637036919593811, "num_input_tokens_seen": 2052972, "step": 1092, "train_runtime": 2975.4611, "train_tokens_per_second": 689.968 }, { "epoch": 1.104119282284559, "grad_norm": 1.5138276815414429, "learning_rate": 8.99240506329114e-06, "loss": 0.06796854734420776, "num_input_tokens_seen": 2055178, "step": 1093, "train_runtime": 2977.8406, "train_tokens_per_second": 690.157 }, { "epoch": 1.1051301491028558, "grad_norm": 1.6930639743804932, "learning_rate": 8.982278481012659e-06, "loss": 0.07748739421367645, "num_input_tokens_seen": 2056806, "step": 1094, "train_runtime": 2980.0242, "train_tokens_per_second": 690.198 }, { "epoch": 1.1061410159211524, "grad_norm": 1.4320027828216553, "learning_rate": 8.972151898734178e-06, "loss": 0.06378726661205292, "num_input_tokens_seen": 2059252, "step": 1095, "train_runtime": 2982.3803, "train_tokens_per_second": 690.473 }, { "epoch": 1.107151882739449, "grad_norm": 1.3486897945404053, "learning_rate": 8.962025316455697e-06, "loss": 0.04433378204703331, "num_input_tokens_seen": 2061036, "step": 1096, "train_runtime": 2984.5739, "train_tokens_per_second": 690.563 }, { "epoch": 1.1081627495577457, "grad_norm": 1.6590334177017212, "learning_rate": 8.951898734177216e-06, "loss": 0.06255605816841125, "num_input_tokens_seen": 2063098, "step": 1097, "train_runtime": 2986.846, "train_tokens_per_second": 690.728 }, { "epoch": 1.1091736163760424, "grad_norm": 1.7285943031311035, "learning_rate": 8.941772151898735e-06, "loss": 0.08358632773160934, "num_input_tokens_seen": 2065018, "step": 1098, "train_runtime": 2989.0721, "train_tokens_per_second": 690.856 }, { "epoch": 1.110184483194339, "grad_norm": 1.3904027938842773, "learning_rate": 8.931645569620254e-06, "loss": 0.0616244338452816, "num_input_tokens_seen": 2067042, "step": 1099, "train_runtime": 2991.2846, "train_tokens_per_second": 691.022 }, { "epoch": 1.111195350012636, "grad_norm": 1.6543943881988525, "learning_rate": 8.921518987341773e-06, "loss": 0.06925375759601593, "num_input_tokens_seen": 2068762, "step": 1100, "train_runtime": 2993.4889, "train_tokens_per_second": 691.087 }, { "epoch": 1.1122062168309326, "grad_norm": 1.649613618850708, "learning_rate": 8.911392405063292e-06, "loss": 0.07829856872558594, "num_input_tokens_seen": 2070476, "step": 1101, "train_runtime": 2995.6911, "train_tokens_per_second": 691.151 }, { "epoch": 1.1132170836492292, "grad_norm": 1.4735194444656372, "learning_rate": 8.90126582278481e-06, "loss": 0.06881175190210342, "num_input_tokens_seen": 2072284, "step": 1102, "train_runtime": 2997.8727, "train_tokens_per_second": 691.252 }, { "epoch": 1.1142279504675259, "grad_norm": 1.8341642618179321, "learning_rate": 8.89113924050633e-06, "loss": 0.0606992207467556, "num_input_tokens_seen": 2074296, "step": 1103, "train_runtime": 3000.1202, "train_tokens_per_second": 691.404 }, { "epoch": 1.1152388172858225, "grad_norm": 1.4089767932891846, "learning_rate": 8.88101265822785e-06, "loss": 0.053868427872657776, "num_input_tokens_seen": 2076596, "step": 1104, "train_runtime": 3002.4244, "train_tokens_per_second": 691.64 }, { "epoch": 1.1162496841041194, "grad_norm": 1.8250232934951782, "learning_rate": 8.870886075949367e-06, "loss": 0.06492453813552856, "num_input_tokens_seen": 2078276, "step": 1105, "train_runtime": 3004.5811, "train_tokens_per_second": 691.702 }, { "epoch": 1.117260550922416, "grad_norm": 1.3938127756118774, "learning_rate": 8.860759493670886e-06, "loss": 0.07209944725036621, "num_input_tokens_seen": 2080060, "step": 1106, "train_runtime": 3006.7729, "train_tokens_per_second": 691.792 }, { "epoch": 1.1182714177407127, "grad_norm": 1.645253300666809, "learning_rate": 8.850632911392407e-06, "loss": 0.08678440749645233, "num_input_tokens_seen": 2082446, "step": 1107, "train_runtime": 3009.074, "train_tokens_per_second": 692.055 }, { "epoch": 1.1192822845590094, "grad_norm": 1.487198829650879, "learning_rate": 8.840506329113924e-06, "loss": 0.06331930309534073, "num_input_tokens_seen": 2083832, "step": 1108, "train_runtime": 3011.2099, "train_tokens_per_second": 692.025 }, { "epoch": 1.120293151377306, "grad_norm": 1.535788655281067, "learning_rate": 8.830379746835443e-06, "loss": 0.08061740547418594, "num_input_tokens_seen": 2086060, "step": 1109, "train_runtime": 3013.493, "train_tokens_per_second": 692.24 }, { "epoch": 1.1213040181956027, "grad_norm": 1.3998849391937256, "learning_rate": 8.820253164556962e-06, "loss": 0.04212111234664917, "num_input_tokens_seen": 2087998, "step": 1110, "train_runtime": 3015.7254, "train_tokens_per_second": 692.37 }, { "epoch": 1.1223148850138993, "grad_norm": 1.6482014656066895, "learning_rate": 8.810126582278481e-06, "loss": 0.06838325411081314, "num_input_tokens_seen": 2090364, "step": 1111, "train_runtime": 3024.8933, "train_tokens_per_second": 691.054 }, { "epoch": 1.1233257518321962, "grad_norm": 1.3028661012649536, "learning_rate": 8.8e-06, "loss": 0.045957691967487335, "num_input_tokens_seen": 2092166, "step": 1112, "train_runtime": 3027.1036, "train_tokens_per_second": 691.144 }, { "epoch": 1.1243366186504928, "grad_norm": 1.5552278757095337, "learning_rate": 8.78987341772152e-06, "loss": 0.05935283750295639, "num_input_tokens_seen": 2094464, "step": 1113, "train_runtime": 3029.3872, "train_tokens_per_second": 691.382 }, { "epoch": 1.1253474854687895, "grad_norm": 2.1640241146087646, "learning_rate": 8.779746835443039e-06, "loss": 0.13538388907909393, "num_input_tokens_seen": 2096704, "step": 1114, "train_runtime": 3031.6688, "train_tokens_per_second": 691.601 }, { "epoch": 1.1263583522870861, "grad_norm": 1.8794739246368408, "learning_rate": 8.769620253164558e-06, "loss": 0.08418547362089157, "num_input_tokens_seen": 2098626, "step": 1115, "train_runtime": 3033.9238, "train_tokens_per_second": 691.72 }, { "epoch": 1.1273692191053828, "grad_norm": 1.6963447332382202, "learning_rate": 8.759493670886077e-06, "loss": 0.07459042966365814, "num_input_tokens_seen": 2100258, "step": 1116, "train_runtime": 3036.0944, "train_tokens_per_second": 691.763 }, { "epoch": 1.1283800859236797, "grad_norm": 1.5021796226501465, "learning_rate": 8.749367088607596e-06, "loss": 0.05739009380340576, "num_input_tokens_seen": 2102152, "step": 1117, "train_runtime": 3038.3378, "train_tokens_per_second": 691.876 }, { "epoch": 1.1293909527419763, "grad_norm": 1.7058435678482056, "learning_rate": 8.739240506329115e-06, "loss": 0.10165772587060928, "num_input_tokens_seen": 2104124, "step": 1118, "train_runtime": 3040.5956, "train_tokens_per_second": 692.01 }, { "epoch": 1.130401819560273, "grad_norm": 1.438440203666687, "learning_rate": 8.729113924050634e-06, "loss": 0.08349044620990753, "num_input_tokens_seen": 2106328, "step": 1119, "train_runtime": 3042.8964, "train_tokens_per_second": 692.212 }, { "epoch": 1.1314126863785696, "grad_norm": 1.3999005556106567, "learning_rate": 8.718987341772153e-06, "loss": 0.06760846078395844, "num_input_tokens_seen": 2108402, "step": 1120, "train_runtime": 3045.1684, "train_tokens_per_second": 692.376 }, { "epoch": 1.1324235531968663, "grad_norm": 1.9466845989227295, "learning_rate": 8.708860759493672e-06, "loss": 0.06737107783555984, "num_input_tokens_seen": 2110132, "step": 1121, "train_runtime": 3047.4391, "train_tokens_per_second": 692.428 }, { "epoch": 1.133434420015163, "grad_norm": 1.329634189605713, "learning_rate": 8.69873417721519e-06, "loss": 0.06647045165300369, "num_input_tokens_seen": 2112090, "step": 1122, "train_runtime": 3049.7361, "train_tokens_per_second": 692.548 }, { "epoch": 1.1344452868334596, "grad_norm": 1.5675692558288574, "learning_rate": 8.68860759493671e-06, "loss": 0.06497927010059357, "num_input_tokens_seen": 2113744, "step": 1123, "train_runtime": 3051.8992, "train_tokens_per_second": 692.6 }, { "epoch": 1.1354561536517565, "grad_norm": 1.6912192106246948, "learning_rate": 8.67848101265823e-06, "loss": 0.08475741744041443, "num_input_tokens_seen": 2115786, "step": 1124, "train_runtime": 3054.1829, "train_tokens_per_second": 692.75 }, { "epoch": 1.136467020470053, "grad_norm": 1.5909514427185059, "learning_rate": 8.668354430379747e-06, "loss": 0.06388218700885773, "num_input_tokens_seen": 2117714, "step": 1125, "train_runtime": 3056.4061, "train_tokens_per_second": 692.877 }, { "epoch": 1.1374778872883498, "grad_norm": 2.9671549797058105, "learning_rate": 8.658227848101266e-06, "loss": 0.0821935385465622, "num_input_tokens_seen": 2119428, "step": 1126, "train_runtime": 3058.562, "train_tokens_per_second": 692.949 }, { "epoch": 1.1384887541066464, "grad_norm": 1.879675030708313, "learning_rate": 8.648101265822785e-06, "loss": 0.08488821983337402, "num_input_tokens_seen": 2121072, "step": 1127, "train_runtime": 3060.7569, "train_tokens_per_second": 692.989 }, { "epoch": 1.139499620924943, "grad_norm": 1.5213686227798462, "learning_rate": 8.637974683544304e-06, "loss": 0.08338913321495056, "num_input_tokens_seen": 2123588, "step": 1128, "train_runtime": 3063.1233, "train_tokens_per_second": 693.275 }, { "epoch": 1.14051048774324, "grad_norm": 1.3064101934432983, "learning_rate": 8.627848101265823e-06, "loss": 0.06499403715133667, "num_input_tokens_seen": 2125496, "step": 1129, "train_runtime": 3065.3746, "train_tokens_per_second": 693.389 }, { "epoch": 1.1415213545615366, "grad_norm": 1.5557777881622314, "learning_rate": 8.617721518987342e-06, "loss": 0.0621199756860733, "num_input_tokens_seen": 2127294, "step": 1130, "train_runtime": 3067.5581, "train_tokens_per_second": 693.481 }, { "epoch": 1.1425322213798332, "grad_norm": 1.6157169342041016, "learning_rate": 8.607594936708861e-06, "loss": 0.09719564765691757, "num_input_tokens_seen": 2130054, "step": 1131, "train_runtime": 3070.1017, "train_tokens_per_second": 693.806 }, { "epoch": 1.1435430881981299, "grad_norm": 1.687367558479309, "learning_rate": 8.59746835443038e-06, "loss": 0.08943184465169907, "num_input_tokens_seen": 2131806, "step": 1132, "train_runtime": 3072.2596, "train_tokens_per_second": 693.889 }, { "epoch": 1.1445539550164265, "grad_norm": 1.8464778661727905, "learning_rate": 8.5873417721519e-06, "loss": 0.06853809952735901, "num_input_tokens_seen": 2133332, "step": 1133, "train_runtime": 3074.4136, "train_tokens_per_second": 693.899 }, { "epoch": 1.1455648218347232, "grad_norm": 1.7622979879379272, "learning_rate": 8.577215189873419e-06, "loss": 0.07444445788860321, "num_input_tokens_seen": 2134852, "step": 1134, "train_runtime": 3076.6215, "train_tokens_per_second": 693.895 }, { "epoch": 1.1465756886530198, "grad_norm": 1.74332594871521, "learning_rate": 8.567088607594938e-06, "loss": 0.07678605616092682, "num_input_tokens_seen": 2136526, "step": 1135, "train_runtime": 3078.7916, "train_tokens_per_second": 693.95 }, { "epoch": 1.1475865554713167, "grad_norm": 1.6526131629943848, "learning_rate": 8.556962025316457e-06, "loss": 0.07518184930086136, "num_input_tokens_seen": 2138368, "step": 1136, "train_runtime": 3080.9896, "train_tokens_per_second": 694.052 }, { "epoch": 1.1485974222896134, "grad_norm": 1.5729053020477295, "learning_rate": 8.546835443037976e-06, "loss": 0.08650077879428864, "num_input_tokens_seen": 2140978, "step": 1137, "train_runtime": 3083.3943, "train_tokens_per_second": 694.358 }, { "epoch": 1.14960828910791, "grad_norm": 1.495152473449707, "learning_rate": 8.536708860759493e-06, "loss": 0.06230098009109497, "num_input_tokens_seen": 2143190, "step": 1138, "train_runtime": 3085.7032, "train_tokens_per_second": 694.555 }, { "epoch": 1.1506191559262067, "grad_norm": 1.5127619504928589, "learning_rate": 8.526582278481014e-06, "loss": 0.055189043283462524, "num_input_tokens_seen": 2144560, "step": 1139, "train_runtime": 3087.7746, "train_tokens_per_second": 694.533 }, { "epoch": 1.1516300227445033, "grad_norm": 1.6251533031463623, "learning_rate": 8.516455696202533e-06, "loss": 0.06701746582984924, "num_input_tokens_seen": 2146132, "step": 1140, "train_runtime": 3089.9262, "train_tokens_per_second": 694.558 }, { "epoch": 1.1526408895628002, "grad_norm": 1.6752350330352783, "learning_rate": 8.50632911392405e-06, "loss": 0.07148720324039459, "num_input_tokens_seen": 2148060, "step": 1141, "train_runtime": 3098.6284, "train_tokens_per_second": 693.229 }, { "epoch": 1.1536517563810968, "grad_norm": 2.347093105316162, "learning_rate": 8.49620253164557e-06, "loss": 0.1034323126077652, "num_input_tokens_seen": 2149560, "step": 1142, "train_runtime": 3100.7289, "train_tokens_per_second": 693.243 }, { "epoch": 1.1546626231993935, "grad_norm": 1.5739468336105347, "learning_rate": 8.48607594936709e-06, "loss": 0.0766829252243042, "num_input_tokens_seen": 2151656, "step": 1143, "train_runtime": 3102.9973, "train_tokens_per_second": 693.412 }, { "epoch": 1.1556734900176902, "grad_norm": 1.3017951250076294, "learning_rate": 8.475949367088608e-06, "loss": 0.06286372244358063, "num_input_tokens_seen": 2153778, "step": 1144, "train_runtime": 3105.2836, "train_tokens_per_second": 693.585 }, { "epoch": 1.1566843568359868, "grad_norm": 1.3676447868347168, "learning_rate": 8.465822784810127e-06, "loss": 0.059599995613098145, "num_input_tokens_seen": 2156104, "step": 1145, "train_runtime": 3107.5775, "train_tokens_per_second": 693.821 }, { "epoch": 1.1576952236542835, "grad_norm": 1.4337157011032104, "learning_rate": 8.455696202531646e-06, "loss": 0.06387347728013992, "num_input_tokens_seen": 2158052, "step": 1146, "train_runtime": 3109.803, "train_tokens_per_second": 693.951 }, { "epoch": 1.1587060904725803, "grad_norm": 1.5866986513137817, "learning_rate": 8.445569620253165e-06, "loss": 0.07430361956357956, "num_input_tokens_seen": 2159532, "step": 1147, "train_runtime": 3111.914, "train_tokens_per_second": 693.956 }, { "epoch": 1.159716957290877, "grad_norm": 1.9716557264328003, "learning_rate": 8.435443037974684e-06, "loss": 0.10540448874235153, "num_input_tokens_seen": 2161148, "step": 1148, "train_runtime": 3114.0679, "train_tokens_per_second": 693.995 }, { "epoch": 1.1607278241091736, "grad_norm": 1.620793104171753, "learning_rate": 8.425316455696203e-06, "loss": 0.07015478610992432, "num_input_tokens_seen": 2163152, "step": 1149, "train_runtime": 3116.3359, "train_tokens_per_second": 694.133 }, { "epoch": 1.1617386909274703, "grad_norm": 1.8051007986068726, "learning_rate": 8.415189873417722e-06, "loss": 0.06369549036026001, "num_input_tokens_seen": 2165346, "step": 1150, "train_runtime": 3118.6247, "train_tokens_per_second": 694.327 }, { "epoch": 1.162749557745767, "grad_norm": 1.872153878211975, "learning_rate": 8.405063291139241e-06, "loss": 0.08213125169277191, "num_input_tokens_seen": 2167748, "step": 1151, "train_runtime": 3120.9913, "train_tokens_per_second": 694.57 }, { "epoch": 1.1637604245640636, "grad_norm": 1.3431483507156372, "learning_rate": 8.39493670886076e-06, "loss": 0.0798673927783966, "num_input_tokens_seen": 2169900, "step": 1152, "train_runtime": 3123.2422, "train_tokens_per_second": 694.759 }, { "epoch": 1.1647712913823605, "grad_norm": 1.8245978355407715, "learning_rate": 8.38481012658228e-06, "loss": 0.08059132844209671, "num_input_tokens_seen": 2171650, "step": 1153, "train_runtime": 3125.4608, "train_tokens_per_second": 694.826 }, { "epoch": 1.1657821582006571, "grad_norm": 1.4516791105270386, "learning_rate": 8.374683544303797e-06, "loss": 0.0558345727622509, "num_input_tokens_seen": 2173872, "step": 1154, "train_runtime": 3127.7393, "train_tokens_per_second": 695.03 }, { "epoch": 1.1667930250189538, "grad_norm": 1.4005495309829712, "learning_rate": 8.364556962025318e-06, "loss": 0.0451105460524559, "num_input_tokens_seen": 2175528, "step": 1155, "train_runtime": 3129.9274, "train_tokens_per_second": 695.073 }, { "epoch": 1.1678038918372504, "grad_norm": 1.5774210691452026, "learning_rate": 8.354430379746837e-06, "loss": 0.07367590069770813, "num_input_tokens_seen": 2177430, "step": 1156, "train_runtime": 3132.1179, "train_tokens_per_second": 695.194 }, { "epoch": 1.168814758655547, "grad_norm": 1.8974392414093018, "learning_rate": 8.344303797468354e-06, "loss": 0.06681827455759048, "num_input_tokens_seen": 2178862, "step": 1157, "train_runtime": 3134.2574, "train_tokens_per_second": 695.176 }, { "epoch": 1.1698256254738437, "grad_norm": 1.4887057542800903, "learning_rate": 8.334177215189873e-06, "loss": 0.06238287687301636, "num_input_tokens_seen": 2180700, "step": 1158, "train_runtime": 3136.4886, "train_tokens_per_second": 695.268 }, { "epoch": 1.1708364922921406, "grad_norm": 1.715378761291504, "learning_rate": 8.324050632911394e-06, "loss": 0.08617313206195831, "num_input_tokens_seen": 2182790, "step": 1159, "train_runtime": 3138.7448, "train_tokens_per_second": 695.434 }, { "epoch": 1.1718473591104372, "grad_norm": 2.034440755844116, "learning_rate": 8.313924050632911e-06, "loss": 0.1255088746547699, "num_input_tokens_seen": 2184616, "step": 1160, "train_runtime": 3140.9391, "train_tokens_per_second": 695.53 }, { "epoch": 1.172858225928734, "grad_norm": 1.7983278036117554, "learning_rate": 8.30379746835443e-06, "loss": 0.07602868229150772, "num_input_tokens_seen": 2186642, "step": 1161, "train_runtime": 3143.1914, "train_tokens_per_second": 695.676 }, { "epoch": 1.1738690927470306, "grad_norm": 2.0422070026397705, "learning_rate": 8.29367088607595e-06, "loss": 0.06293034553527832, "num_input_tokens_seen": 2188852, "step": 1162, "train_runtime": 3145.5159, "train_tokens_per_second": 695.864 }, { "epoch": 1.1748799595653272, "grad_norm": 1.6136746406555176, "learning_rate": 8.283544303797469e-06, "loss": 0.07936811447143555, "num_input_tokens_seen": 2190730, "step": 1163, "train_runtime": 3147.7689, "train_tokens_per_second": 695.963 }, { "epoch": 1.175890826383624, "grad_norm": 1.4614843130111694, "learning_rate": 8.273417721518988e-06, "loss": 0.04913468658924103, "num_input_tokens_seen": 2192420, "step": 1164, "train_runtime": 3150.0158, "train_tokens_per_second": 696.003 }, { "epoch": 1.1769016932019207, "grad_norm": 1.6033903360366821, "learning_rate": 8.263291139240507e-06, "loss": 0.048490870743989944, "num_input_tokens_seen": 2194292, "step": 1165, "train_runtime": 3152.2455, "train_tokens_per_second": 696.104 }, { "epoch": 1.1779125600202174, "grad_norm": 1.5246518850326538, "learning_rate": 8.253164556962026e-06, "loss": 0.04833872616291046, "num_input_tokens_seen": 2196356, "step": 1166, "train_runtime": 3154.5205, "train_tokens_per_second": 696.257 }, { "epoch": 1.178923426838514, "grad_norm": 1.6408116817474365, "learning_rate": 8.243037974683545e-06, "loss": 0.09846121072769165, "num_input_tokens_seen": 2198536, "step": 1167, "train_runtime": 3156.8459, "train_tokens_per_second": 696.434 }, { "epoch": 1.1799342936568107, "grad_norm": 1.8436825275421143, "learning_rate": 8.232911392405064e-06, "loss": 0.06969211995601654, "num_input_tokens_seen": 2200490, "step": 1168, "train_runtime": 3159.1275, "train_tokens_per_second": 696.55 }, { "epoch": 1.1809451604751073, "grad_norm": 1.651782512664795, "learning_rate": 8.222784810126583e-06, "loss": 0.06236081197857857, "num_input_tokens_seen": 2202402, "step": 1169, "train_runtime": 3161.3711, "train_tokens_per_second": 696.66 }, { "epoch": 1.181956027293404, "grad_norm": 1.5295475721359253, "learning_rate": 8.212658227848102e-06, "loss": 0.05375359207391739, "num_input_tokens_seen": 2204174, "step": 1170, "train_runtime": 3163.5712, "train_tokens_per_second": 696.736 }, { "epoch": 1.1829668941117009, "grad_norm": 1.7514253854751587, "learning_rate": 8.202531645569621e-06, "loss": 0.07153820246458054, "num_input_tokens_seen": 2206006, "step": 1171, "train_runtime": 3172.0097, "train_tokens_per_second": 695.46 }, { "epoch": 1.1839777609299975, "grad_norm": 1.4838099479675293, "learning_rate": 8.19240506329114e-06, "loss": 0.06446850299835205, "num_input_tokens_seen": 2207678, "step": 1172, "train_runtime": 3174.251, "train_tokens_per_second": 695.496 }, { "epoch": 1.1849886277482942, "grad_norm": 1.6390488147735596, "learning_rate": 8.18227848101266e-06, "loss": 0.06537766754627228, "num_input_tokens_seen": 2209704, "step": 1173, "train_runtime": 3176.5177, "train_tokens_per_second": 695.637 }, { "epoch": 1.1859994945665908, "grad_norm": 1.5963364839553833, "learning_rate": 8.172151898734177e-06, "loss": 0.07196581363677979, "num_input_tokens_seen": 2211704, "step": 1174, "train_runtime": 3178.7396, "train_tokens_per_second": 695.78 }, { "epoch": 1.1870103613848875, "grad_norm": 1.6719778776168823, "learning_rate": 8.162025316455698e-06, "loss": 0.07993964850902557, "num_input_tokens_seen": 2213624, "step": 1175, "train_runtime": 3180.9662, "train_tokens_per_second": 695.897 }, { "epoch": 1.1880212282031843, "grad_norm": 1.875149130821228, "learning_rate": 8.151898734177217e-06, "loss": 0.0808754414319992, "num_input_tokens_seen": 2215790, "step": 1176, "train_runtime": 3183.2524, "train_tokens_per_second": 696.077 }, { "epoch": 1.189032095021481, "grad_norm": 1.675183892250061, "learning_rate": 8.141772151898734e-06, "loss": 0.07747514545917511, "num_input_tokens_seen": 2217462, "step": 1177, "train_runtime": 3185.388, "train_tokens_per_second": 696.136 }, { "epoch": 1.1900429618397776, "grad_norm": 1.878333330154419, "learning_rate": 8.131645569620253e-06, "loss": 0.08744428306818008, "num_input_tokens_seen": 2219292, "step": 1178, "train_runtime": 3187.5866, "train_tokens_per_second": 696.23 }, { "epoch": 1.1910538286580743, "grad_norm": 2.005580186843872, "learning_rate": 8.121518987341774e-06, "loss": 0.07720157504081726, "num_input_tokens_seen": 2221190, "step": 1179, "train_runtime": 3189.8116, "train_tokens_per_second": 696.339 }, { "epoch": 1.192064695476371, "grad_norm": 2.0327203273773193, "learning_rate": 8.111392405063291e-06, "loss": 0.09617538005113602, "num_input_tokens_seen": 2223196, "step": 1180, "train_runtime": 3192.0674, "train_tokens_per_second": 696.475 }, { "epoch": 1.1930755622946676, "grad_norm": 1.6846823692321777, "learning_rate": 8.10126582278481e-06, "loss": 0.06675636768341064, "num_input_tokens_seen": 2224970, "step": 1181, "train_runtime": 3194.2609, "train_tokens_per_second": 696.552 }, { "epoch": 1.1940864291129643, "grad_norm": 2.134172201156616, "learning_rate": 8.09113924050633e-06, "loss": 0.1031813770532608, "num_input_tokens_seen": 2227122, "step": 1182, "train_runtime": 3196.5133, "train_tokens_per_second": 696.735 }, { "epoch": 1.1950972959312611, "grad_norm": 1.6644850969314575, "learning_rate": 8.081012658227849e-06, "loss": 0.053227800875902176, "num_input_tokens_seen": 2229118, "step": 1183, "train_runtime": 3198.7373, "train_tokens_per_second": 696.874 }, { "epoch": 1.1961081627495578, "grad_norm": 1.7365634441375732, "learning_rate": 8.070886075949368e-06, "loss": 0.05617215484380722, "num_input_tokens_seen": 2230492, "step": 1184, "train_runtime": 3200.8117, "train_tokens_per_second": 696.852 }, { "epoch": 1.1971190295678544, "grad_norm": 1.5770543813705444, "learning_rate": 8.060759493670887e-06, "loss": 0.07203859090805054, "num_input_tokens_seen": 2232598, "step": 1185, "train_runtime": 3203.0823, "train_tokens_per_second": 697.016 }, { "epoch": 1.198129896386151, "grad_norm": 1.6365536451339722, "learning_rate": 8.050632911392406e-06, "loss": 0.05470001697540283, "num_input_tokens_seen": 2234364, "step": 1186, "train_runtime": 3205.2707, "train_tokens_per_second": 697.091 }, { "epoch": 1.1991407632044477, "grad_norm": 1.6714481115341187, "learning_rate": 8.040506329113925e-06, "loss": 0.08494721353054047, "num_input_tokens_seen": 2236454, "step": 1187, "train_runtime": 3207.5649, "train_tokens_per_second": 697.244 }, { "epoch": 1.2001516300227446, "grad_norm": 2.886770248413086, "learning_rate": 8.030379746835444e-06, "loss": 0.10024242103099823, "num_input_tokens_seen": 2237934, "step": 1188, "train_runtime": 3209.6917, "train_tokens_per_second": 697.243 }, { "epoch": 1.2001516300227446, "eval_loss": 0.39543792605400085, "eval_runtime": 52.3082, "eval_samples_per_second": 16.804, "eval_steps_per_second": 8.412, "num_input_tokens_seen": 2237934, "step": 1188 }, { "epoch": 1.2011624968410413, "grad_norm": 1.674844741821289, "learning_rate": 8.020253164556963e-06, "loss": 0.0708998516201973, "num_input_tokens_seen": 2239668, "step": 1189, "train_runtime": 3264.2019, "train_tokens_per_second": 686.13 }, { "epoch": 1.202173363659338, "grad_norm": 1.280044674873352, "learning_rate": 8.01012658227848e-06, "loss": 0.06288723647594452, "num_input_tokens_seen": 2241998, "step": 1190, "train_runtime": 3266.5422, "train_tokens_per_second": 686.352 }, { "epoch": 1.2031842304776346, "grad_norm": 2.1572518348693848, "learning_rate": 8.000000000000001e-06, "loss": 0.07750942558050156, "num_input_tokens_seen": 2243886, "step": 1191, "train_runtime": 3268.7357, "train_tokens_per_second": 686.469 }, { "epoch": 1.2041950972959312, "grad_norm": 1.4469211101531982, "learning_rate": 7.98987341772152e-06, "loss": 0.05743473768234253, "num_input_tokens_seen": 2245630, "step": 1192, "train_runtime": 3270.9389, "train_tokens_per_second": 686.54 }, { "epoch": 1.2052059641142279, "grad_norm": 1.8174983263015747, "learning_rate": 7.979746835443038e-06, "loss": 0.08593261986970901, "num_input_tokens_seen": 2247608, "step": 1193, "train_runtime": 3273.2755, "train_tokens_per_second": 686.654 }, { "epoch": 1.2062168309325245, "grad_norm": 1.115770936012268, "learning_rate": 7.969620253164557e-06, "loss": 0.04833998158574104, "num_input_tokens_seen": 2249956, "step": 1194, "train_runtime": 3275.6114, "train_tokens_per_second": 686.881 }, { "epoch": 1.2072276977508214, "grad_norm": 1.8248049020767212, "learning_rate": 7.959493670886078e-06, "loss": 0.08127608895301819, "num_input_tokens_seen": 2251722, "step": 1195, "train_runtime": 3277.8099, "train_tokens_per_second": 686.959 }, { "epoch": 1.208238564569118, "grad_norm": 1.9218639135360718, "learning_rate": 7.949367088607595e-06, "loss": 0.0896994099020958, "num_input_tokens_seen": 2253246, "step": 1196, "train_runtime": 3279.9467, "train_tokens_per_second": 686.976 }, { "epoch": 1.2092494313874147, "grad_norm": 1.6879656314849854, "learning_rate": 7.939240506329114e-06, "loss": 0.06548882275819778, "num_input_tokens_seen": 2254870, "step": 1197, "train_runtime": 3282.1331, "train_tokens_per_second": 687.014 }, { "epoch": 1.2102602982057113, "grad_norm": 1.4788695573806763, "learning_rate": 7.929113924050633e-06, "loss": 0.05680616945028305, "num_input_tokens_seen": 2256480, "step": 1198, "train_runtime": 3284.3035, "train_tokens_per_second": 687.05 }, { "epoch": 1.211271165024008, "grad_norm": 1.8426119089126587, "learning_rate": 7.918987341772152e-06, "loss": 0.061318475753068924, "num_input_tokens_seen": 2257978, "step": 1199, "train_runtime": 3286.4056, "train_tokens_per_second": 687.066 }, { "epoch": 1.2122820318423049, "grad_norm": 2.1089558601379395, "learning_rate": 7.908860759493671e-06, "loss": 0.09348195791244507, "num_input_tokens_seen": 2259402, "step": 1200, "train_runtime": 3288.5173, "train_tokens_per_second": 687.058 }, { "epoch": 1.2132928986606015, "grad_norm": 1.671409010887146, "learning_rate": 7.89873417721519e-06, "loss": 0.060666583478450775, "num_input_tokens_seen": 2260964, "step": 1201, "train_runtime": 3296.9542, "train_tokens_per_second": 685.774 }, { "epoch": 1.2143037654788982, "grad_norm": 1.1846647262573242, "learning_rate": 7.88860759493671e-06, "loss": 0.04691457003355026, "num_input_tokens_seen": 2262478, "step": 1202, "train_runtime": 3299.137, "train_tokens_per_second": 685.779 }, { "epoch": 1.2153146322971948, "grad_norm": 1.8600661754608154, "learning_rate": 7.878481012658229e-06, "loss": 0.06159030646085739, "num_input_tokens_seen": 2263914, "step": 1203, "train_runtime": 3301.234, "train_tokens_per_second": 685.778 }, { "epoch": 1.2163254991154915, "grad_norm": 1.452722191810608, "learning_rate": 7.868354430379748e-06, "loss": 0.06574209034442902, "num_input_tokens_seen": 2266010, "step": 1204, "train_runtime": 3303.5207, "train_tokens_per_second": 685.938 }, { "epoch": 1.2173363659337881, "grad_norm": 1.654717206954956, "learning_rate": 7.858227848101267e-06, "loss": 0.08449318259954453, "num_input_tokens_seen": 2267862, "step": 1205, "train_runtime": 3305.6955, "train_tokens_per_second": 686.047 }, { "epoch": 1.218347232752085, "grad_norm": 1.8064467906951904, "learning_rate": 7.848101265822786e-06, "loss": 0.06694860756397247, "num_input_tokens_seen": 2269564, "step": 1206, "train_runtime": 3307.9064, "train_tokens_per_second": 686.103 }, { "epoch": 1.2193580995703817, "grad_norm": 1.4400807619094849, "learning_rate": 7.837974683544305e-06, "loss": 0.07201480865478516, "num_input_tokens_seen": 2272080, "step": 1207, "train_runtime": 3310.337, "train_tokens_per_second": 686.359 }, { "epoch": 1.2203689663886783, "grad_norm": 1.7585588693618774, "learning_rate": 7.827848101265824e-06, "loss": 0.06069216877222061, "num_input_tokens_seen": 2273334, "step": 1208, "train_runtime": 3312.3935, "train_tokens_per_second": 686.312 }, { "epoch": 1.221379833206975, "grad_norm": 1.5639764070510864, "learning_rate": 7.817721518987343e-06, "loss": 0.0779055655002594, "num_input_tokens_seen": 2275454, "step": 1209, "train_runtime": 3314.6832, "train_tokens_per_second": 686.477 }, { "epoch": 1.2223907000252716, "grad_norm": 2.509942054748535, "learning_rate": 7.80759493670886e-06, "loss": 0.05721501260995865, "num_input_tokens_seen": 2277052, "step": 1210, "train_runtime": 3316.906, "train_tokens_per_second": 686.499 }, { "epoch": 1.2234015668435683, "grad_norm": 1.4947055578231812, "learning_rate": 7.797468354430381e-06, "loss": 0.048078425228595734, "num_input_tokens_seen": 2278706, "step": 1211, "train_runtime": 3319.0757, "train_tokens_per_second": 686.548 }, { "epoch": 1.2244124336618651, "grad_norm": 2.03582501411438, "learning_rate": 7.7873417721519e-06, "loss": 0.07997502386569977, "num_input_tokens_seen": 2280384, "step": 1212, "train_runtime": 3321.2464, "train_tokens_per_second": 686.605 }, { "epoch": 1.2254233004801618, "grad_norm": 1.7681838274002075, "learning_rate": 7.777215189873418e-06, "loss": 0.07857958227396011, "num_input_tokens_seen": 2282836, "step": 1213, "train_runtime": 3323.6181, "train_tokens_per_second": 686.853 }, { "epoch": 1.2264341672984584, "grad_norm": 1.890169620513916, "learning_rate": 7.767088607594937e-06, "loss": 0.07384022325277328, "num_input_tokens_seen": 2284726, "step": 1214, "train_runtime": 3325.8392, "train_tokens_per_second": 686.962 }, { "epoch": 1.227445034116755, "grad_norm": 1.5807586908340454, "learning_rate": 7.756962025316456e-06, "loss": 0.07555880397558212, "num_input_tokens_seen": 2287752, "step": 1215, "train_runtime": 3328.3809, "train_tokens_per_second": 687.347 }, { "epoch": 1.2284559009350517, "grad_norm": 1.5621229410171509, "learning_rate": 7.746835443037975e-06, "loss": 0.05525794252753258, "num_input_tokens_seen": 2289266, "step": 1216, "train_runtime": 3330.5221, "train_tokens_per_second": 687.359 }, { "epoch": 1.2294667677533484, "grad_norm": 3.0601284503936768, "learning_rate": 7.736708860759494e-06, "loss": 0.06457633525133133, "num_input_tokens_seen": 2291274, "step": 1217, "train_runtime": 3332.7689, "train_tokens_per_second": 687.499 }, { "epoch": 1.2304776345716453, "grad_norm": 1.5983930826187134, "learning_rate": 7.726582278481013e-06, "loss": 0.06922073662281036, "num_input_tokens_seen": 2293442, "step": 1218, "train_runtime": 3335.0849, "train_tokens_per_second": 687.671 }, { "epoch": 1.231488501389942, "grad_norm": 1.310104489326477, "learning_rate": 7.716455696202532e-06, "loss": 0.06207498908042908, "num_input_tokens_seen": 2295438, "step": 1219, "train_runtime": 3337.3263, "train_tokens_per_second": 687.807 }, { "epoch": 1.2324993682082386, "grad_norm": 1.3984287977218628, "learning_rate": 7.706329113924051e-06, "loss": 0.053548961877822876, "num_input_tokens_seen": 2297814, "step": 1220, "train_runtime": 3339.6966, "train_tokens_per_second": 688.031 }, { "epoch": 1.2335102350265352, "grad_norm": 1.6000895500183105, "learning_rate": 7.69620253164557e-06, "loss": 0.06268253922462463, "num_input_tokens_seen": 2299686, "step": 1221, "train_runtime": 3341.9541, "train_tokens_per_second": 688.126 }, { "epoch": 1.2345211018448319, "grad_norm": 1.686050534248352, "learning_rate": 7.68607594936709e-06, "loss": 0.05675904080271721, "num_input_tokens_seen": 2301578, "step": 1222, "train_runtime": 3344.1509, "train_tokens_per_second": 688.24 }, { "epoch": 1.2355319686631288, "grad_norm": 1.8062411546707153, "learning_rate": 7.675949367088609e-06, "loss": 0.074558787047863, "num_input_tokens_seen": 2303610, "step": 1223, "train_runtime": 3346.3795, "train_tokens_per_second": 688.389 }, { "epoch": 1.2365428354814254, "grad_norm": 1.4807677268981934, "learning_rate": 7.665822784810128e-06, "loss": 0.05706555023789406, "num_input_tokens_seen": 2305512, "step": 1224, "train_runtime": 3348.5706, "train_tokens_per_second": 688.506 }, { "epoch": 1.237553702299722, "grad_norm": 1.8867607116699219, "learning_rate": 7.655696202531647e-06, "loss": 0.06920222193002701, "num_input_tokens_seen": 2307674, "step": 1225, "train_runtime": 3350.8528, "train_tokens_per_second": 688.683 }, { "epoch": 1.2385645691180187, "grad_norm": 2.331836462020874, "learning_rate": 7.645569620253164e-06, "loss": 0.07282140105962753, "num_input_tokens_seen": 2309670, "step": 1226, "train_runtime": 3353.0765, "train_tokens_per_second": 688.821 }, { "epoch": 1.2395754359363154, "grad_norm": 1.5728611946105957, "learning_rate": 7.635443037974685e-06, "loss": 0.05360238626599312, "num_input_tokens_seen": 2311322, "step": 1227, "train_runtime": 3355.2675, "train_tokens_per_second": 688.864 }, { "epoch": 1.240586302754612, "grad_norm": 2.0821712017059326, "learning_rate": 7.625316455696203e-06, "loss": 0.06303103268146515, "num_input_tokens_seen": 2312726, "step": 1228, "train_runtime": 3357.3611, "train_tokens_per_second": 688.852 }, { "epoch": 1.2415971695729087, "grad_norm": 1.519388198852539, "learning_rate": 7.615189873417722e-06, "loss": 0.06824515759944916, "num_input_tokens_seen": 2314644, "step": 1229, "train_runtime": 3359.5486, "train_tokens_per_second": 688.975 }, { "epoch": 1.2426080363912055, "grad_norm": 1.7579048871994019, "learning_rate": 7.6050632911392405e-06, "loss": 0.06210828199982643, "num_input_tokens_seen": 2316536, "step": 1230, "train_runtime": 3361.7631, "train_tokens_per_second": 689.084 }, { "epoch": 1.2436189032095022, "grad_norm": 2.1102397441864014, "learning_rate": 7.5949367088607605e-06, "loss": 0.06933826208114624, "num_input_tokens_seen": 2318024, "step": 1231, "train_runtime": 3370.5171, "train_tokens_per_second": 687.735 }, { "epoch": 1.2446297700277988, "grad_norm": 2.117542028427124, "learning_rate": 7.5848101265822796e-06, "loss": 0.09398352354764938, "num_input_tokens_seen": 2320428, "step": 1232, "train_runtime": 3372.8486, "train_tokens_per_second": 687.973 }, { "epoch": 1.2456406368460955, "grad_norm": 1.7313145399093628, "learning_rate": 7.574683544303798e-06, "loss": 0.080222949385643, "num_input_tokens_seen": 2322182, "step": 1233, "train_runtime": 3375.063, "train_tokens_per_second": 688.041 }, { "epoch": 1.2466515036643921, "grad_norm": 1.8148479461669922, "learning_rate": 7.564556962025317e-06, "loss": 0.07266001403331757, "num_input_tokens_seen": 2323616, "step": 1234, "train_runtime": 3377.1932, "train_tokens_per_second": 688.032 }, { "epoch": 1.247662370482689, "grad_norm": 1.7799381017684937, "learning_rate": 7.554430379746837e-06, "loss": 0.09345235675573349, "num_input_tokens_seen": 2325408, "step": 1235, "train_runtime": 3379.3963, "train_tokens_per_second": 688.113 }, { "epoch": 1.2486732373009857, "grad_norm": 1.1585361957550049, "learning_rate": 7.544303797468355e-06, "loss": 0.05592569708824158, "num_input_tokens_seen": 2327858, "step": 1236, "train_runtime": 3381.7409, "train_tokens_per_second": 688.361 }, { "epoch": 1.2496841041192823, "grad_norm": 1.718593716621399, "learning_rate": 7.534177215189874e-06, "loss": 0.05969762057065964, "num_input_tokens_seen": 2329798, "step": 1237, "train_runtime": 3383.9627, "train_tokens_per_second": 688.482 }, { "epoch": 1.250694970937579, "grad_norm": 1.499233365058899, "learning_rate": 7.524050632911392e-06, "loss": 0.06824598461389542, "num_input_tokens_seen": 2332188, "step": 1238, "train_runtime": 3386.3049, "train_tokens_per_second": 688.712 }, { "epoch": 1.2517058377558756, "grad_norm": 1.586361050605774, "learning_rate": 7.513924050632912e-06, "loss": 0.07227626442909241, "num_input_tokens_seen": 2334310, "step": 1239, "train_runtime": 3388.5468, "train_tokens_per_second": 688.882 }, { "epoch": 1.2527167045741723, "grad_norm": 1.6351972818374634, "learning_rate": 7.503797468354431e-06, "loss": 0.06726763397455215, "num_input_tokens_seen": 2336354, "step": 1240, "train_runtime": 3390.7876, "train_tokens_per_second": 689.03 }, { "epoch": 1.253727571392469, "grad_norm": 1.3885319232940674, "learning_rate": 7.49367088607595e-06, "loss": 0.05118235945701599, "num_input_tokens_seen": 2338472, "step": 1241, "train_runtime": 3393.1025, "train_tokens_per_second": 689.184 }, { "epoch": 1.2547384382107658, "grad_norm": 1.7103335857391357, "learning_rate": 7.483544303797469e-06, "loss": 0.07767714560031891, "num_input_tokens_seen": 2340730, "step": 1242, "train_runtime": 3395.3934, "train_tokens_per_second": 689.384 }, { "epoch": 1.2557493050290625, "grad_norm": 1.4612255096435547, "learning_rate": 7.473417721518989e-06, "loss": 0.07450965791940689, "num_input_tokens_seen": 2342948, "step": 1243, "train_runtime": 3397.6933, "train_tokens_per_second": 689.57 }, { "epoch": 1.256760171847359, "grad_norm": 1.659128189086914, "learning_rate": 7.463291139240507e-06, "loss": 0.06260944157838821, "num_input_tokens_seen": 2345132, "step": 1244, "train_runtime": 3399.999, "train_tokens_per_second": 689.745 }, { "epoch": 1.2577710386656558, "grad_norm": 1.879957675933838, "learning_rate": 7.453164556962026e-06, "loss": 0.08181922882795334, "num_input_tokens_seen": 2346772, "step": 1245, "train_runtime": 3402.1789, "train_tokens_per_second": 689.785 }, { "epoch": 1.2587819054839524, "grad_norm": 1.8026577234268188, "learning_rate": 7.443037974683544e-06, "loss": 0.07521645724773407, "num_input_tokens_seen": 2348770, "step": 1246, "train_runtime": 3404.4302, "train_tokens_per_second": 689.916 }, { "epoch": 1.2597927723022493, "grad_norm": 1.6696979999542236, "learning_rate": 7.432911392405064e-06, "loss": 0.08103272318840027, "num_input_tokens_seen": 2350794, "step": 1247, "train_runtime": 3406.6848, "train_tokens_per_second": 690.053 }, { "epoch": 1.260803639120546, "grad_norm": 1.6551284790039062, "learning_rate": 7.422784810126583e-06, "loss": 0.06993693858385086, "num_input_tokens_seen": 2352492, "step": 1248, "train_runtime": 3408.8427, "train_tokens_per_second": 690.115 }, { "epoch": 1.2618145059388426, "grad_norm": 2.096829891204834, "learning_rate": 7.4126582278481014e-06, "loss": 0.09812723100185394, "num_input_tokens_seen": 2354176, "step": 1249, "train_runtime": 3411.0168, "train_tokens_per_second": 690.168 }, { "epoch": 1.2628253727571392, "grad_norm": 1.4124011993408203, "learning_rate": 7.4025316455696205e-06, "loss": 0.06310103833675385, "num_input_tokens_seen": 2356116, "step": 1250, "train_runtime": 3413.2703, "train_tokens_per_second": 690.281 }, { "epoch": 1.263836239575436, "grad_norm": 2.1522560119628906, "learning_rate": 7.3924050632911405e-06, "loss": 0.1018192321062088, "num_input_tokens_seen": 2357662, "step": 1251, "train_runtime": 3415.4392, "train_tokens_per_second": 690.295 }, { "epoch": 1.2648471063937325, "grad_norm": 1.7819515466690063, "learning_rate": 7.382278481012659e-06, "loss": 0.06440679728984833, "num_input_tokens_seen": 2359266, "step": 1252, "train_runtime": 3417.5953, "train_tokens_per_second": 690.329 }, { "epoch": 1.2658579732120292, "grad_norm": 1.6107395887374878, "learning_rate": 7.372151898734178e-06, "loss": 0.05555751174688339, "num_input_tokens_seen": 2361054, "step": 1253, "train_runtime": 3419.8092, "train_tokens_per_second": 690.405 }, { "epoch": 1.266868840030326, "grad_norm": 1.7699815034866333, "learning_rate": 7.362025316455697e-06, "loss": 0.07139113545417786, "num_input_tokens_seen": 2362734, "step": 1254, "train_runtime": 3421.9669, "train_tokens_per_second": 690.461 }, { "epoch": 1.2678797068486227, "grad_norm": 1.6306917667388916, "learning_rate": 7.351898734177216e-06, "loss": 0.08092683553695679, "num_input_tokens_seen": 2364500, "step": 1255, "train_runtime": 3424.1596, "train_tokens_per_second": 690.534 }, { "epoch": 1.2688905736669194, "grad_norm": 1.4850523471832275, "learning_rate": 7.341772151898735e-06, "loss": 0.05796663090586662, "num_input_tokens_seen": 2366698, "step": 1256, "train_runtime": 3426.4319, "train_tokens_per_second": 690.718 }, { "epoch": 1.269901440485216, "grad_norm": 2.2261545658111572, "learning_rate": 7.331645569620254e-06, "loss": 0.06608270108699799, "num_input_tokens_seen": 2368722, "step": 1257, "train_runtime": 3428.6924, "train_tokens_per_second": 690.853 }, { "epoch": 1.270912307303513, "grad_norm": 1.7036511898040771, "learning_rate": 7.321518987341772e-06, "loss": 0.07144436240196228, "num_input_tokens_seen": 2370806, "step": 1258, "train_runtime": 3430.9664, "train_tokens_per_second": 691.002 }, { "epoch": 1.2719231741218096, "grad_norm": 1.2830642461776733, "learning_rate": 7.311392405063292e-06, "loss": 0.05315488949418068, "num_input_tokens_seen": 2372522, "step": 1259, "train_runtime": 3433.1884, "train_tokens_per_second": 691.055 }, { "epoch": 1.2729340409401062, "grad_norm": 1.4549801349639893, "learning_rate": 7.301265822784811e-06, "loss": 0.056591495871543884, "num_input_tokens_seen": 2374258, "step": 1260, "train_runtime": 3435.3868, "train_tokens_per_second": 691.118 }, { "epoch": 1.2739449077584029, "grad_norm": 1.6096266508102417, "learning_rate": 7.29113924050633e-06, "loss": 0.05757144093513489, "num_input_tokens_seen": 2375890, "step": 1261, "train_runtime": 3444.0821, "train_tokens_per_second": 689.847 }, { "epoch": 1.2749557745766995, "grad_norm": 1.963739037513733, "learning_rate": 7.281012658227849e-06, "loss": 0.04849129542708397, "num_input_tokens_seen": 2377974, "step": 1262, "train_runtime": 3446.4063, "train_tokens_per_second": 689.987 }, { "epoch": 1.2759666413949962, "grad_norm": 1.474272608757019, "learning_rate": 7.270886075949367e-06, "loss": 0.06390251219272614, "num_input_tokens_seen": 2379908, "step": 1263, "train_runtime": 3448.6525, "train_tokens_per_second": 690.098 }, { "epoch": 1.2769775082132928, "grad_norm": 1.9414095878601074, "learning_rate": 7.260759493670887e-06, "loss": 0.08182346820831299, "num_input_tokens_seen": 2382120, "step": 1264, "train_runtime": 3450.9357, "train_tokens_per_second": 690.282 }, { "epoch": 1.2779883750315895, "grad_norm": 1.2520118951797485, "learning_rate": 7.250632911392406e-06, "loss": 0.049603234976530075, "num_input_tokens_seen": 2383738, "step": 1265, "train_runtime": 3453.0761, "train_tokens_per_second": 690.323 }, { "epoch": 1.2789992418498863, "grad_norm": 1.4932117462158203, "learning_rate": 7.240506329113924e-06, "loss": 0.06469394266605377, "num_input_tokens_seen": 2385874, "step": 1266, "train_runtime": 3455.3244, "train_tokens_per_second": 690.492 }, { "epoch": 1.280010108668183, "grad_norm": 1.7077187299728394, "learning_rate": 7.230379746835443e-06, "loss": 0.0767069011926651, "num_input_tokens_seen": 2388636, "step": 1267, "train_runtime": 3457.7679, "train_tokens_per_second": 690.803 }, { "epoch": 1.2810209754864796, "grad_norm": 1.7286819219589233, "learning_rate": 7.220253164556963e-06, "loss": 0.0681333988904953, "num_input_tokens_seen": 2390426, "step": 1268, "train_runtime": 3459.9379, "train_tokens_per_second": 690.887 }, { "epoch": 1.2820318423047763, "grad_norm": 1.715703010559082, "learning_rate": 7.2101265822784814e-06, "loss": 0.08162987977266312, "num_input_tokens_seen": 2392536, "step": 1269, "train_runtime": 3462.1887, "train_tokens_per_second": 691.047 }, { "epoch": 1.2830427091230732, "grad_norm": 2.2412264347076416, "learning_rate": 7.2000000000000005e-06, "loss": 0.06202499195933342, "num_input_tokens_seen": 2394276, "step": 1270, "train_runtime": 3464.3776, "train_tokens_per_second": 691.113 }, { "epoch": 1.2840535759413698, "grad_norm": 1.5789408683776855, "learning_rate": 7.189873417721519e-06, "loss": 0.07125669717788696, "num_input_tokens_seen": 2396094, "step": 1271, "train_runtime": 3466.5662, "train_tokens_per_second": 691.201 }, { "epoch": 1.2850644427596665, "grad_norm": 1.8839894533157349, "learning_rate": 7.179746835443039e-06, "loss": 0.10887087136507034, "num_input_tokens_seen": 2398042, "step": 1272, "train_runtime": 3468.7489, "train_tokens_per_second": 691.328 }, { "epoch": 1.2860753095779631, "grad_norm": 1.8170326948165894, "learning_rate": 7.169620253164558e-06, "loss": 0.0829956978559494, "num_input_tokens_seen": 2400290, "step": 1273, "train_runtime": 3471.0668, "train_tokens_per_second": 691.514 }, { "epoch": 1.2870861763962598, "grad_norm": 1.7981148958206177, "learning_rate": 7.159493670886076e-06, "loss": 0.06110212579369545, "num_input_tokens_seen": 2402024, "step": 1274, "train_runtime": 3473.2338, "train_tokens_per_second": 691.581 }, { "epoch": 1.2880970432145564, "grad_norm": 1.662429928779602, "learning_rate": 7.149367088607595e-06, "loss": 0.07427185028791428, "num_input_tokens_seen": 2403846, "step": 1275, "train_runtime": 3475.4589, "train_tokens_per_second": 691.663 }, { "epoch": 1.289107910032853, "grad_norm": 1.905470371246338, "learning_rate": 7.139240506329115e-06, "loss": 0.07187589257955551, "num_input_tokens_seen": 2405930, "step": 1276, "train_runtime": 3477.7463, "train_tokens_per_second": 691.807 }, { "epoch": 1.2901187768511497, "grad_norm": 1.6884658336639404, "learning_rate": 7.129113924050633e-06, "loss": 0.07680030167102814, "num_input_tokens_seen": 2407904, "step": 1277, "train_runtime": 3479.9972, "train_tokens_per_second": 691.927 }, { "epoch": 1.2911296436694466, "grad_norm": 1.6698951721191406, "learning_rate": 7.118987341772152e-06, "loss": 0.0777999758720398, "num_input_tokens_seen": 2410116, "step": 1278, "train_runtime": 3482.2895, "train_tokens_per_second": 692.107 }, { "epoch": 1.2921405104877433, "grad_norm": 1.534956932067871, "learning_rate": 7.108860759493671e-06, "loss": 0.07324867695569992, "num_input_tokens_seen": 2412480, "step": 1279, "train_runtime": 3484.6353, "train_tokens_per_second": 692.319 }, { "epoch": 1.29315137730604, "grad_norm": 2.1732232570648193, "learning_rate": 7.0987341772151905e-06, "loss": 0.07079564034938812, "num_input_tokens_seen": 2413934, "step": 1280, "train_runtime": 3486.712, "train_tokens_per_second": 692.324 }, { "epoch": 1.2941622441243366, "grad_norm": 1.7259658575057983, "learning_rate": 7.08860759493671e-06, "loss": 0.0802023857831955, "num_input_tokens_seen": 2415538, "step": 1281, "train_runtime": 3488.8518, "train_tokens_per_second": 692.359 }, { "epoch": 1.2951731109426334, "grad_norm": 1.2600252628326416, "learning_rate": 7.078481012658228e-06, "loss": 0.05568865314126015, "num_input_tokens_seen": 2418354, "step": 1282, "train_runtime": 3491.3211, "train_tokens_per_second": 692.676 }, { "epoch": 1.29618397776093, "grad_norm": 1.670655369758606, "learning_rate": 7.068354430379747e-06, "loss": 0.0647815465927124, "num_input_tokens_seen": 2420410, "step": 1283, "train_runtime": 3493.5914, "train_tokens_per_second": 692.814 }, { "epoch": 1.2971948445792267, "grad_norm": 1.5092346668243408, "learning_rate": 7.058227848101267e-06, "loss": 0.053298354148864746, "num_input_tokens_seen": 2422074, "step": 1284, "train_runtime": 3495.7382, "train_tokens_per_second": 692.865 }, { "epoch": 1.2982057113975234, "grad_norm": 1.9336142539978027, "learning_rate": 7.048101265822785e-06, "loss": 0.061506543308496475, "num_input_tokens_seen": 2423840, "step": 1285, "train_runtime": 3497.9079, "train_tokens_per_second": 692.94 }, { "epoch": 1.29921657821582, "grad_norm": 1.463113784790039, "learning_rate": 7.037974683544304e-06, "loss": 0.06923742592334747, "num_input_tokens_seen": 2425850, "step": 1286, "train_runtime": 3500.1456, "train_tokens_per_second": 693.071 }, { "epoch": 1.3002274450341167, "grad_norm": 1.5164885520935059, "learning_rate": 7.027848101265823e-06, "loss": 0.06922876834869385, "num_input_tokens_seen": 2428110, "step": 1287, "train_runtime": 3502.4778, "train_tokens_per_second": 693.255 }, { "epoch": 1.3012383118524133, "grad_norm": 1.9097461700439453, "learning_rate": 7.017721518987342e-06, "loss": 0.06577549129724503, "num_input_tokens_seen": 2430236, "step": 1288, "train_runtime": 3504.7619, "train_tokens_per_second": 693.41 }, { "epoch": 1.3022491786707102, "grad_norm": 1.7521017789840698, "learning_rate": 7.0075949367088614e-06, "loss": 0.06287643313407898, "num_input_tokens_seen": 2432132, "step": 1289, "train_runtime": 3507.026, "train_tokens_per_second": 693.503 }, { "epoch": 1.3032600454890069, "grad_norm": 2.0503952503204346, "learning_rate": 6.99746835443038e-06, "loss": 0.0946616381406784, "num_input_tokens_seen": 2433912, "step": 1290, "train_runtime": 3509.2411, "train_tokens_per_second": 693.572 }, { "epoch": 1.3042709123073035, "grad_norm": 1.9230647087097168, "learning_rate": 6.987341772151899e-06, "loss": 0.07685060054063797, "num_input_tokens_seen": 2435450, "step": 1291, "train_runtime": 3517.8879, "train_tokens_per_second": 692.305 }, { "epoch": 1.3052817791256002, "grad_norm": 1.7252345085144043, "learning_rate": 6.977215189873419e-06, "loss": 0.0595974363386631, "num_input_tokens_seen": 2437190, "step": 1292, "train_runtime": 3520.0929, "train_tokens_per_second": 692.365 }, { "epoch": 1.3062926459438968, "grad_norm": 1.6326429843902588, "learning_rate": 6.967088607594937e-06, "loss": 0.06852579861879349, "num_input_tokens_seen": 2439320, "step": 1293, "train_runtime": 3522.3841, "train_tokens_per_second": 692.52 }, { "epoch": 1.3073035127621937, "grad_norm": 1.673790693283081, "learning_rate": 6.956962025316456e-06, "loss": 0.06482592970132828, "num_input_tokens_seen": 2440856, "step": 1294, "train_runtime": 3524.5478, "train_tokens_per_second": 692.53 }, { "epoch": 1.3083143795804903, "grad_norm": 1.5817533731460571, "learning_rate": 6.946835443037975e-06, "loss": 0.060081928968429565, "num_input_tokens_seen": 2442592, "step": 1295, "train_runtime": 3526.7066, "train_tokens_per_second": 692.599 }, { "epoch": 1.309325246398787, "grad_norm": 1.8944607973098755, "learning_rate": 6.936708860759494e-06, "loss": 0.08795922249555588, "num_input_tokens_seen": 2444864, "step": 1296, "train_runtime": 3529.0064, "train_tokens_per_second": 692.791 }, { "epoch": 1.3103361132170837, "grad_norm": 2.002056360244751, "learning_rate": 6.926582278481013e-06, "loss": 0.06857173889875412, "num_input_tokens_seen": 2446738, "step": 1297, "train_runtime": 3531.2228, "train_tokens_per_second": 692.887 }, { "epoch": 1.3113469800353803, "grad_norm": 1.8821349143981934, "learning_rate": 6.916455696202532e-06, "loss": 0.08960074186325073, "num_input_tokens_seen": 2448408, "step": 1298, "train_runtime": 3533.4319, "train_tokens_per_second": 692.926 }, { "epoch": 1.312357846853677, "grad_norm": 1.921169400215149, "learning_rate": 6.906329113924051e-06, "loss": 0.0884164348244667, "num_input_tokens_seen": 2450152, "step": 1299, "train_runtime": 3535.6275, "train_tokens_per_second": 692.989 }, { "epoch": 1.3133687136719736, "grad_norm": 1.53725266456604, "learning_rate": 6.8962025316455705e-06, "loss": 0.07701297849416733, "num_input_tokens_seen": 2451912, "step": 1300, "train_runtime": 3537.8871, "train_tokens_per_second": 693.044 }, { "epoch": 1.3143795804902705, "grad_norm": 1.5910474061965942, "learning_rate": 6.88607594936709e-06, "loss": 0.05664290860295296, "num_input_tokens_seen": 2453816, "step": 1301, "train_runtime": 3540.0618, "train_tokens_per_second": 693.156 }, { "epoch": 1.3153904473085671, "grad_norm": 1.616972804069519, "learning_rate": 6.875949367088608e-06, "loss": 0.060027364641427994, "num_input_tokens_seen": 2455718, "step": 1302, "train_runtime": 3542.2769, "train_tokens_per_second": 693.26 }, { "epoch": 1.3164013141268638, "grad_norm": 1.8863670825958252, "learning_rate": 6.865822784810127e-06, "loss": 0.08367598056793213, "num_input_tokens_seen": 2457762, "step": 1303, "train_runtime": 3544.6403, "train_tokens_per_second": 693.374 }, { "epoch": 1.3174121809451604, "grad_norm": 1.5819474458694458, "learning_rate": 6.855696202531647e-06, "loss": 0.07555770874023438, "num_input_tokens_seen": 2460088, "step": 1304, "train_runtime": 3546.9737, "train_tokens_per_second": 693.574 }, { "epoch": 1.318423047763457, "grad_norm": 2.4805030822753906, "learning_rate": 6.845569620253165e-06, "loss": 0.0664629191160202, "num_input_tokens_seen": 2461942, "step": 1305, "train_runtime": 3549.1875, "train_tokens_per_second": 693.664 }, { "epoch": 1.319433914581754, "grad_norm": 1.8425042629241943, "learning_rate": 6.835443037974684e-06, "loss": 0.06088273227214813, "num_input_tokens_seen": 2463904, "step": 1306, "train_runtime": 3551.3947, "train_tokens_per_second": 693.785 }, { "epoch": 1.3204447814000506, "grad_norm": 1.5949352979660034, "learning_rate": 6.825316455696202e-06, "loss": 0.0695766881108284, "num_input_tokens_seen": 2465722, "step": 1307, "train_runtime": 3553.6971, "train_tokens_per_second": 693.847 }, { "epoch": 1.3214556482183473, "grad_norm": 1.667921781539917, "learning_rate": 6.815189873417722e-06, "loss": 0.07278577983379364, "num_input_tokens_seen": 2467266, "step": 1308, "train_runtime": 3555.8491, "train_tokens_per_second": 693.861 }, { "epoch": 1.322466515036644, "grad_norm": 1.9061810970306396, "learning_rate": 6.805063291139241e-06, "loss": 0.0660230740904808, "num_input_tokens_seen": 2469430, "step": 1309, "train_runtime": 3558.1521, "train_tokens_per_second": 694.02 }, { "epoch": 1.3234773818549406, "grad_norm": 1.5027179718017578, "learning_rate": 6.79493670886076e-06, "loss": 0.0616331472992897, "num_input_tokens_seen": 2471652, "step": 1310, "train_runtime": 3560.4394, "train_tokens_per_second": 694.199 }, { "epoch": 1.3244882486732372, "grad_norm": 2.2625632286071777, "learning_rate": 6.784810126582279e-06, "loss": 0.10223156958818436, "num_input_tokens_seen": 2473280, "step": 1311, "train_runtime": 3562.6105, "train_tokens_per_second": 694.233 }, { "epoch": 1.3254991154915339, "grad_norm": 1.7246503829956055, "learning_rate": 6.774683544303799e-06, "loss": 0.08304357528686523, "num_input_tokens_seen": 2475394, "step": 1312, "train_runtime": 3564.8679, "train_tokens_per_second": 694.386 }, { "epoch": 1.3265099823098307, "grad_norm": 1.77495276927948, "learning_rate": 6.764556962025317e-06, "loss": 0.0816446989774704, "num_input_tokens_seen": 2477104, "step": 1313, "train_runtime": 3567.0099, "train_tokens_per_second": 694.448 }, { "epoch": 1.3275208491281274, "grad_norm": 1.6261802911758423, "learning_rate": 6.754430379746836e-06, "loss": 0.08167357742786407, "num_input_tokens_seen": 2479042, "step": 1314, "train_runtime": 3569.2658, "train_tokens_per_second": 694.552 }, { "epoch": 1.328531715946424, "grad_norm": 1.394997239112854, "learning_rate": 6.744303797468354e-06, "loss": 0.049304425716400146, "num_input_tokens_seen": 2480676, "step": 1315, "train_runtime": 3571.4288, "train_tokens_per_second": 694.589 }, { "epoch": 1.3295425827647207, "grad_norm": 1.8155115842819214, "learning_rate": 6.734177215189874e-06, "loss": 0.08127808570861816, "num_input_tokens_seen": 2482858, "step": 1316, "train_runtime": 3573.7371, "train_tokens_per_second": 694.751 }, { "epoch": 1.3305534495830174, "grad_norm": 1.8929851055145264, "learning_rate": 6.724050632911393e-06, "loss": 0.09120990335941315, "num_input_tokens_seen": 2484364, "step": 1317, "train_runtime": 3575.8688, "train_tokens_per_second": 694.758 }, { "epoch": 1.3315643164013142, "grad_norm": 2.3512346744537354, "learning_rate": 6.7139240506329115e-06, "loss": 0.06979864835739136, "num_input_tokens_seen": 2486306, "step": 1318, "train_runtime": 3578.0879, "train_tokens_per_second": 694.87 }, { "epoch": 1.3325751832196109, "grad_norm": 1.641466736793518, "learning_rate": 6.7037974683544306e-06, "loss": 0.07956226170063019, "num_input_tokens_seen": 2488390, "step": 1319, "train_runtime": 3580.3288, "train_tokens_per_second": 695.017 }, { "epoch": 1.3335860500379075, "grad_norm": 2.02421498298645, "learning_rate": 6.6936708860759505e-06, "loss": 0.06039831042289734, "num_input_tokens_seen": 2490366, "step": 1320, "train_runtime": 3582.5373, "train_tokens_per_second": 695.14 }, { "epoch": 1.3345969168562042, "grad_norm": 1.466762900352478, "learning_rate": 6.683544303797469e-06, "loss": 0.0662161186337471, "num_input_tokens_seen": 2492082, "step": 1321, "train_runtime": 3591.314, "train_tokens_per_second": 693.919 }, { "epoch": 1.3356077836745008, "grad_norm": 1.5865466594696045, "learning_rate": 6.673417721518988e-06, "loss": 0.05934914946556091, "num_input_tokens_seen": 2493558, "step": 1322, "train_runtime": 3593.4424, "train_tokens_per_second": 693.919 }, { "epoch": 1.3366186504927975, "grad_norm": 1.7458940744400024, "learning_rate": 6.663291139240506e-06, "loss": 0.06001710519194603, "num_input_tokens_seen": 2494988, "step": 1323, "train_runtime": 3595.5422, "train_tokens_per_second": 693.911 }, { "epoch": 1.3376295173110941, "grad_norm": 2.575479745864868, "learning_rate": 6.653164556962026e-06, "loss": 0.09432195127010345, "num_input_tokens_seen": 2496558, "step": 1324, "train_runtime": 3597.6891, "train_tokens_per_second": 693.934 }, { "epoch": 1.338640384129391, "grad_norm": 1.7372066974639893, "learning_rate": 6.643037974683545e-06, "loss": 0.06360140442848206, "num_input_tokens_seen": 2498468, "step": 1325, "train_runtime": 3599.8724, "train_tokens_per_second": 694.043 }, { "epoch": 1.3396512509476877, "grad_norm": 1.9188385009765625, "learning_rate": 6.632911392405063e-06, "loss": 0.05561995506286621, "num_input_tokens_seen": 2500298, "step": 1326, "train_runtime": 3602.0588, "train_tokens_per_second": 694.13 }, { "epoch": 1.3406621177659843, "grad_norm": 1.9363172054290771, "learning_rate": 6.622784810126582e-06, "loss": 0.08968325704336166, "num_input_tokens_seen": 2502174, "step": 1327, "train_runtime": 3604.2697, "train_tokens_per_second": 694.225 }, { "epoch": 1.341672984584281, "grad_norm": 1.533034086227417, "learning_rate": 6.612658227848102e-06, "loss": 0.06440269201993942, "num_input_tokens_seen": 2503952, "step": 1328, "train_runtime": 3606.4535, "train_tokens_per_second": 694.298 }, { "epoch": 1.3426838514025778, "grad_norm": 1.565432071685791, "learning_rate": 6.6025316455696206e-06, "loss": 0.06231357902288437, "num_input_tokens_seen": 2505714, "step": 1329, "train_runtime": 3608.632, "train_tokens_per_second": 694.367 }, { "epoch": 1.3436947182208745, "grad_norm": 1.802560567855835, "learning_rate": 6.59240506329114e-06, "loss": 0.08845368027687073, "num_input_tokens_seen": 2507846, "step": 1330, "train_runtime": 3610.9019, "train_tokens_per_second": 694.521 }, { "epoch": 1.3447055850391711, "grad_norm": 1.2985501289367676, "learning_rate": 6.582278481012659e-06, "loss": 0.04512377083301544, "num_input_tokens_seen": 2510048, "step": 1331, "train_runtime": 3613.1795, "train_tokens_per_second": 694.692 }, { "epoch": 1.3457164518574678, "grad_norm": 1.8165048360824585, "learning_rate": 6.572151898734178e-06, "loss": 0.06979278475046158, "num_input_tokens_seen": 2511812, "step": 1332, "train_runtime": 3615.3637, "train_tokens_per_second": 694.761 }, { "epoch": 1.3467273186757645, "grad_norm": 1.9429415464401245, "learning_rate": 6.562025316455697e-06, "loss": 0.0932060182094574, "num_input_tokens_seen": 2514084, "step": 1333, "train_runtime": 3617.6711, "train_tokens_per_second": 694.945 }, { "epoch": 1.347738185494061, "grad_norm": 1.7487316131591797, "learning_rate": 6.551898734177215e-06, "loss": 0.05620608851313591, "num_input_tokens_seen": 2515838, "step": 1334, "train_runtime": 3619.8105, "train_tokens_per_second": 695.019 }, { "epoch": 1.3487490523123578, "grad_norm": 1.5573967695236206, "learning_rate": 6.541772151898734e-06, "loss": 0.0643301010131836, "num_input_tokens_seen": 2517778, "step": 1335, "train_runtime": 3622.0203, "train_tokens_per_second": 695.131 }, { "epoch": 1.3497599191306544, "grad_norm": 1.9148838520050049, "learning_rate": 6.531645569620254e-06, "loss": 0.08032730966806412, "num_input_tokens_seen": 2519282, "step": 1336, "train_runtime": 3624.163, "train_tokens_per_second": 695.135 }, { "epoch": 1.3507707859489513, "grad_norm": 1.922243356704712, "learning_rate": 6.521518987341772e-06, "loss": 0.08460190147161484, "num_input_tokens_seen": 2520964, "step": 1337, "train_runtime": 3626.3483, "train_tokens_per_second": 695.18 }, { "epoch": 1.351781652767248, "grad_norm": 1.753213882446289, "learning_rate": 6.5113924050632915e-06, "loss": 0.08410866558551788, "num_input_tokens_seen": 2523034, "step": 1338, "train_runtime": 3628.6016, "train_tokens_per_second": 695.319 }, { "epoch": 1.3527925195855446, "grad_norm": 2.136439561843872, "learning_rate": 6.5012658227848106e-06, "loss": 0.06710030138492584, "num_input_tokens_seen": 2525260, "step": 1339, "train_runtime": 3630.8881, "train_tokens_per_second": 695.494 }, { "epoch": 1.3538033864038412, "grad_norm": 1.7677026987075806, "learning_rate": 6.49113924050633e-06, "loss": 0.07365815341472626, "num_input_tokens_seen": 2527338, "step": 1340, "train_runtime": 3633.1378, "train_tokens_per_second": 695.635 }, { "epoch": 1.354814253222138, "grad_norm": 2.025024175643921, "learning_rate": 6.481012658227849e-06, "loss": 0.08970008045434952, "num_input_tokens_seen": 2529494, "step": 1341, "train_runtime": 3635.3922, "train_tokens_per_second": 695.797 }, { "epoch": 1.3558251200404348, "grad_norm": 1.9314972162246704, "learning_rate": 6.470886075949368e-06, "loss": 0.0951140820980072, "num_input_tokens_seen": 2531304, "step": 1342, "train_runtime": 3637.5845, "train_tokens_per_second": 695.875 }, { "epoch": 1.3568359868587314, "grad_norm": 1.8306108713150024, "learning_rate": 6.460759493670886e-06, "loss": 0.08341541886329651, "num_input_tokens_seen": 2533062, "step": 1343, "train_runtime": 3639.7713, "train_tokens_per_second": 695.94 }, { "epoch": 1.357846853677028, "grad_norm": 1.7333952188491821, "learning_rate": 6.450632911392406e-06, "loss": 0.0747184231877327, "num_input_tokens_seen": 2535360, "step": 1344, "train_runtime": 3642.1202, "train_tokens_per_second": 696.122 }, { "epoch": 1.3588577204953247, "grad_norm": 1.6327425241470337, "learning_rate": 6.440506329113925e-06, "loss": 0.07438857108354568, "num_input_tokens_seen": 2537128, "step": 1345, "train_runtime": 3644.3497, "train_tokens_per_second": 696.181 }, { "epoch": 1.3598685873136214, "grad_norm": 1.8790346384048462, "learning_rate": 6.430379746835443e-06, "loss": 0.08983723819255829, "num_input_tokens_seen": 2539182, "step": 1346, "train_runtime": 3646.6345, "train_tokens_per_second": 696.308 }, { "epoch": 1.360879454131918, "grad_norm": 1.5209429264068604, "learning_rate": 6.420253164556962e-06, "loss": 0.05216553434729576, "num_input_tokens_seen": 2541200, "step": 1347, "train_runtime": 3648.9454, "train_tokens_per_second": 696.42 }, { "epoch": 1.3618903209502147, "grad_norm": 1.7687582969665527, "learning_rate": 6.410126582278482e-06, "loss": 0.06282483041286469, "num_input_tokens_seen": 2543378, "step": 1348, "train_runtime": 3651.2595, "train_tokens_per_second": 696.576 }, { "epoch": 1.3629011877685115, "grad_norm": 1.3695815801620483, "learning_rate": 6.4000000000000006e-06, "loss": 0.060868073254823685, "num_input_tokens_seen": 2545350, "step": 1349, "train_runtime": 3653.5067, "train_tokens_per_second": 696.687 }, { "epoch": 1.3639120545868082, "grad_norm": 1.8668866157531738, "learning_rate": 6.38987341772152e-06, "loss": 0.07853592187166214, "num_input_tokens_seen": 2547356, "step": 1350, "train_runtime": 3655.8199, "train_tokens_per_second": 696.795 }, { "epoch": 1.3649229214051048, "grad_norm": 1.8764808177947998, "learning_rate": 6.379746835443038e-06, "loss": 0.06392718851566315, "num_input_tokens_seen": 2549126, "step": 1351, "train_runtime": 3664.4397, "train_tokens_per_second": 695.639 }, { "epoch": 1.3659337882234015, "grad_norm": 1.7786204814910889, "learning_rate": 6.369620253164558e-06, "loss": 0.07574222981929779, "num_input_tokens_seen": 2551066, "step": 1352, "train_runtime": 3666.6883, "train_tokens_per_second": 695.741 }, { "epoch": 1.3669446550416984, "grad_norm": 1.7288459539413452, "learning_rate": 6.359493670886077e-06, "loss": 0.08671493828296661, "num_input_tokens_seen": 2553038, "step": 1353, "train_runtime": 3668.9424, "train_tokens_per_second": 695.851 }, { "epoch": 1.367955521859995, "grad_norm": 1.5520856380462646, "learning_rate": 6.349367088607595e-06, "loss": 0.06124834716320038, "num_input_tokens_seen": 2555022, "step": 1354, "train_runtime": 3671.1643, "train_tokens_per_second": 695.97 }, { "epoch": 1.3689663886782917, "grad_norm": 1.3783342838287354, "learning_rate": 6.339240506329114e-06, "loss": 0.041727203875780106, "num_input_tokens_seen": 2556426, "step": 1355, "train_runtime": 3673.2581, "train_tokens_per_second": 695.956 }, { "epoch": 1.3699772554965883, "grad_norm": 1.722110390663147, "learning_rate": 6.329113924050634e-06, "loss": 0.0781174823641777, "num_input_tokens_seen": 2558122, "step": 1356, "train_runtime": 3675.4245, "train_tokens_per_second": 696.007 }, { "epoch": 1.370988122314885, "grad_norm": 1.9059115648269653, "learning_rate": 6.318987341772152e-06, "loss": 0.0744543969631195, "num_input_tokens_seen": 2560308, "step": 1357, "train_runtime": 3677.6823, "train_tokens_per_second": 696.174 }, { "epoch": 1.3719989891331816, "grad_norm": 1.7189818620681763, "learning_rate": 6.3088607594936715e-06, "loss": 0.06220090016722679, "num_input_tokens_seen": 2562338, "step": 1358, "train_runtime": 3679.8975, "train_tokens_per_second": 696.307 }, { "epoch": 1.3730098559514783, "grad_norm": 2.0385119915008545, "learning_rate": 6.29873417721519e-06, "loss": 0.07487086951732635, "num_input_tokens_seen": 2563842, "step": 1359, "train_runtime": 3682.0149, "train_tokens_per_second": 696.315 }, { "epoch": 1.3740207227697752, "grad_norm": 1.7844659090042114, "learning_rate": 6.28860759493671e-06, "loss": 0.06827859580516815, "num_input_tokens_seen": 2565870, "step": 1360, "train_runtime": 3684.262, "train_tokens_per_second": 696.441 }, { "epoch": 1.3750315895880718, "grad_norm": 1.8249586820602417, "learning_rate": 6.278481012658229e-06, "loss": 0.07555392384529114, "num_input_tokens_seen": 2567614, "step": 1361, "train_runtime": 3686.4585, "train_tokens_per_second": 696.499 }, { "epoch": 1.3760424564063685, "grad_norm": 1.5155221223831177, "learning_rate": 6.268354430379747e-06, "loss": 0.06685218214988708, "num_input_tokens_seen": 2569486, "step": 1362, "train_runtime": 3688.6845, "train_tokens_per_second": 696.586 }, { "epoch": 1.3770533232246651, "grad_norm": 1.4058446884155273, "learning_rate": 6.258227848101266e-06, "loss": 0.054429881274700165, "num_input_tokens_seen": 2571478, "step": 1363, "train_runtime": 3690.9048, "train_tokens_per_second": 696.707 }, { "epoch": 1.3780641900429618, "grad_norm": 1.9558351039886475, "learning_rate": 6.248101265822786e-06, "loss": 0.07545759528875351, "num_input_tokens_seen": 2573162, "step": 1364, "train_runtime": 3693.1254, "train_tokens_per_second": 696.744 }, { "epoch": 1.3790750568612586, "grad_norm": 1.8815573453903198, "learning_rate": 6.237974683544304e-06, "loss": 0.05953256040811539, "num_input_tokens_seen": 2574666, "step": 1365, "train_runtime": 3695.2583, "train_tokens_per_second": 696.749 }, { "epoch": 1.3800859236795553, "grad_norm": 1.5381945371627808, "learning_rate": 6.227848101265823e-06, "loss": 0.06057102233171463, "num_input_tokens_seen": 2576094, "step": 1366, "train_runtime": 3697.36, "train_tokens_per_second": 696.739 }, { "epoch": 1.381096790497852, "grad_norm": 2.591580867767334, "learning_rate": 6.2177215189873415e-06, "loss": 0.05954180657863617, "num_input_tokens_seen": 2577802, "step": 1367, "train_runtime": 3699.5495, "train_tokens_per_second": 696.788 }, { "epoch": 1.3821076573161486, "grad_norm": 1.715431809425354, "learning_rate": 6.2075949367088615e-06, "loss": 0.07338304817676544, "num_input_tokens_seen": 2580078, "step": 1368, "train_runtime": 3701.8612, "train_tokens_per_second": 696.968 }, { "epoch": 1.3831185241344452, "grad_norm": 1.794058918952942, "learning_rate": 6.1974683544303805e-06, "loss": 0.06370040029287338, "num_input_tokens_seen": 2581822, "step": 1369, "train_runtime": 3704.0847, "train_tokens_per_second": 697.02 }, { "epoch": 1.384129390952742, "grad_norm": 1.4786248207092285, "learning_rate": 6.187341772151899e-06, "loss": 0.06929203867912292, "num_input_tokens_seen": 2584068, "step": 1370, "train_runtime": 3706.4385, "train_tokens_per_second": 697.184 }, { "epoch": 1.3851402577710386, "grad_norm": 1.4867762327194214, "learning_rate": 6.177215189873418e-06, "loss": 0.04443085193634033, "num_input_tokens_seen": 2585860, "step": 1371, "train_runtime": 3708.6663, "train_tokens_per_second": 697.248 }, { "epoch": 1.3861511245893354, "grad_norm": 1.640121579170227, "learning_rate": 6.167088607594938e-06, "loss": 0.07376250624656677, "num_input_tokens_seen": 2587634, "step": 1372, "train_runtime": 3710.8687, "train_tokens_per_second": 697.312 }, { "epoch": 1.387161991407632, "grad_norm": 1.3839681148529053, "learning_rate": 6.156962025316456e-06, "loss": 0.0596800222992897, "num_input_tokens_seen": 2589498, "step": 1373, "train_runtime": 3713.1099, "train_tokens_per_second": 697.393 }, { "epoch": 1.3881728582259287, "grad_norm": 1.494248867034912, "learning_rate": 6.146835443037975e-06, "loss": 0.05772831290960312, "num_input_tokens_seen": 2591676, "step": 1374, "train_runtime": 3715.3991, "train_tokens_per_second": 697.55 }, { "epoch": 1.3891837250442254, "grad_norm": 1.8152834177017212, "learning_rate": 6.136708860759494e-06, "loss": 0.05584399402141571, "num_input_tokens_seen": 2593544, "step": 1375, "train_runtime": 3717.6242, "train_tokens_per_second": 697.635 }, { "epoch": 1.390194591862522, "grad_norm": 1.642403483390808, "learning_rate": 6.126582278481013e-06, "loss": 0.06559552252292633, "num_input_tokens_seen": 2595692, "step": 1376, "train_runtime": 3719.913, "train_tokens_per_second": 697.783 }, { "epoch": 1.391205458680819, "grad_norm": 2.095770835876465, "learning_rate": 6.116455696202532e-06, "loss": 0.10935665667057037, "num_input_tokens_seen": 2597534, "step": 1377, "train_runtime": 3722.1085, "train_tokens_per_second": 697.866 }, { "epoch": 1.3922163254991156, "grad_norm": 1.8721085786819458, "learning_rate": 6.106329113924051e-06, "loss": 0.08921398222446442, "num_input_tokens_seen": 2600018, "step": 1378, "train_runtime": 3724.4617, "train_tokens_per_second": 698.092 }, { "epoch": 1.3932271923174122, "grad_norm": 1.6955461502075195, "learning_rate": 6.09620253164557e-06, "loss": 0.06785810738801956, "num_input_tokens_seen": 2602052, "step": 1379, "train_runtime": 3726.6847, "train_tokens_per_second": 698.222 }, { "epoch": 1.3942380591357089, "grad_norm": 1.7655616998672485, "learning_rate": 6.08607594936709e-06, "loss": 0.06537257879972458, "num_input_tokens_seen": 2603758, "step": 1380, "train_runtime": 3728.8324, "train_tokens_per_second": 698.277 }, { "epoch": 1.3952489259540055, "grad_norm": 1.4429453611373901, "learning_rate": 6.075949367088608e-06, "loss": 0.052360452711582184, "num_input_tokens_seen": 2605644, "step": 1381, "train_runtime": 3737.6123, "train_tokens_per_second": 697.141 }, { "epoch": 1.3962597927723022, "grad_norm": 1.580642580986023, "learning_rate": 6.065822784810127e-06, "loss": 0.0596926175057888, "num_input_tokens_seen": 2607354, "step": 1382, "train_runtime": 3739.8068, "train_tokens_per_second": 697.189 }, { "epoch": 1.3972706595905988, "grad_norm": 1.4305837154388428, "learning_rate": 6.055696202531646e-06, "loss": 0.050742533057928085, "num_input_tokens_seen": 2609280, "step": 1383, "train_runtime": 3742.0436, "train_tokens_per_second": 697.287 }, { "epoch": 1.3982815264088957, "grad_norm": 2.0289719104766846, "learning_rate": 6.045569620253165e-06, "loss": 0.10896015167236328, "num_input_tokens_seen": 2611402, "step": 1384, "train_runtime": 3744.3117, "train_tokens_per_second": 697.432 }, { "epoch": 1.3992923932271923, "grad_norm": 2.4022905826568604, "learning_rate": 6.035443037974684e-06, "loss": 0.07937447726726532, "num_input_tokens_seen": 2612776, "step": 1385, "train_runtime": 3746.3747, "train_tokens_per_second": 697.414 }, { "epoch": 1.400303260045489, "grad_norm": 1.754387617111206, "learning_rate": 6.025316455696203e-06, "loss": 0.08007083833217621, "num_input_tokens_seen": 2614562, "step": 1386, "train_runtime": 3748.5569, "train_tokens_per_second": 697.485 }, { "epoch": 1.400303260045489, "eval_loss": 0.3937505781650543, "eval_runtime": 52.57, "eval_samples_per_second": 16.721, "eval_steps_per_second": 8.37, "num_input_tokens_seen": 2614562, "step": 1386 }, { "epoch": 1.4013141268637856, "grad_norm": 1.4994029998779297, "learning_rate": 6.0151898734177215e-06, "loss": 0.05978060141205788, "num_input_tokens_seen": 2616790, "step": 1387, "train_runtime": 3803.4318, "train_tokens_per_second": 688.008 }, { "epoch": 1.4023249936820825, "grad_norm": 1.4958637952804565, "learning_rate": 6.0050632911392415e-06, "loss": 0.056719157844781876, "num_input_tokens_seen": 2618498, "step": 1388, "train_runtime": 3805.6325, "train_tokens_per_second": 688.059 }, { "epoch": 1.4033358605003792, "grad_norm": 1.4207665920257568, "learning_rate": 5.9949367088607605e-06, "loss": 0.06697021424770355, "num_input_tokens_seen": 2620730, "step": 1389, "train_runtime": 3807.9158, "train_tokens_per_second": 688.232 }, { "epoch": 1.4043467273186758, "grad_norm": 1.6702016592025757, "learning_rate": 5.984810126582279e-06, "loss": 0.06788940727710724, "num_input_tokens_seen": 2622210, "step": 1390, "train_runtime": 3810.0515, "train_tokens_per_second": 688.235 }, { "epoch": 1.4053575941369725, "grad_norm": 1.6265910863876343, "learning_rate": 5.974683544303798e-06, "loss": 0.06827136129140854, "num_input_tokens_seen": 2623708, "step": 1391, "train_runtime": 3812.1554, "train_tokens_per_second": 688.248 }, { "epoch": 1.4063684609552691, "grad_norm": 1.6982901096343994, "learning_rate": 5.964556962025318e-06, "loss": 0.08324596285820007, "num_input_tokens_seen": 2625760, "step": 1392, "train_runtime": 3814.4253, "train_tokens_per_second": 688.376 }, { "epoch": 1.4073793277735658, "grad_norm": 1.9044620990753174, "learning_rate": 5.954430379746836e-06, "loss": 0.07309594750404358, "num_input_tokens_seen": 2627750, "step": 1393, "train_runtime": 3816.6739, "train_tokens_per_second": 688.492 }, { "epoch": 1.4083901945918624, "grad_norm": 1.7940040826797485, "learning_rate": 5.944303797468355e-06, "loss": 0.07906541228294373, "num_input_tokens_seen": 2630024, "step": 1394, "train_runtime": 3819.0094, "train_tokens_per_second": 688.667 }, { "epoch": 1.409401061410159, "grad_norm": 1.5503826141357422, "learning_rate": 5.934177215189873e-06, "loss": 0.055062007158994675, "num_input_tokens_seen": 2631576, "step": 1395, "train_runtime": 3821.1292, "train_tokens_per_second": 688.691 }, { "epoch": 1.410411928228456, "grad_norm": 1.3000690937042236, "learning_rate": 5.924050632911393e-06, "loss": 0.06002321466803551, "num_input_tokens_seen": 2633758, "step": 1396, "train_runtime": 3823.3741, "train_tokens_per_second": 688.857 }, { "epoch": 1.4114227950467526, "grad_norm": 1.722181797027588, "learning_rate": 5.913924050632912e-06, "loss": 0.06877709925174713, "num_input_tokens_seen": 2635928, "step": 1397, "train_runtime": 3825.6248, "train_tokens_per_second": 689.019 }, { "epoch": 1.4124336618650493, "grad_norm": 1.6934517621994019, "learning_rate": 5.903797468354431e-06, "loss": 0.06084431707859039, "num_input_tokens_seen": 2637284, "step": 1398, "train_runtime": 3827.7022, "train_tokens_per_second": 688.999 }, { "epoch": 1.413444528683346, "grad_norm": 2.1336758136749268, "learning_rate": 5.89367088607595e-06, "loss": 0.08002732694149017, "num_input_tokens_seen": 2639002, "step": 1399, "train_runtime": 3829.9005, "train_tokens_per_second": 689.052 }, { "epoch": 1.4144553955016428, "grad_norm": 1.7232083082199097, "learning_rate": 5.88354430379747e-06, "loss": 0.06252460181713104, "num_input_tokens_seen": 2640572, "step": 1400, "train_runtime": 3832.0309, "train_tokens_per_second": 689.079 }, { "epoch": 1.4154662623199394, "grad_norm": 1.6357442140579224, "learning_rate": 5.873417721518988e-06, "loss": 0.07521212100982666, "num_input_tokens_seen": 2642784, "step": 1401, "train_runtime": 3834.3821, "train_tokens_per_second": 689.233 }, { "epoch": 1.416477129138236, "grad_norm": 1.3101296424865723, "learning_rate": 5.863291139240507e-06, "loss": 0.04918498545885086, "num_input_tokens_seen": 2645018, "step": 1402, "train_runtime": 3836.6691, "train_tokens_per_second": 689.405 }, { "epoch": 1.4174879959565327, "grad_norm": 2.26466703414917, "learning_rate": 5.853164556962025e-06, "loss": 0.06629481911659241, "num_input_tokens_seen": 2646966, "step": 1403, "train_runtime": 3838.9682, "train_tokens_per_second": 689.499 }, { "epoch": 1.4184988627748294, "grad_norm": 1.6053820848464966, "learning_rate": 5.843037974683545e-06, "loss": 0.0732828676700592, "num_input_tokens_seen": 2649610, "step": 1404, "train_runtime": 3841.3732, "train_tokens_per_second": 689.756 }, { "epoch": 1.419509729593126, "grad_norm": 1.8432995080947876, "learning_rate": 5.832911392405064e-06, "loss": 0.07649111747741699, "num_input_tokens_seen": 2651580, "step": 1405, "train_runtime": 3843.6649, "train_tokens_per_second": 689.857 }, { "epoch": 1.4205205964114227, "grad_norm": 1.5591950416564941, "learning_rate": 5.8227848101265824e-06, "loss": 0.06862519681453705, "num_input_tokens_seen": 2653682, "step": 1406, "train_runtime": 3845.9135, "train_tokens_per_second": 690.0 }, { "epoch": 1.4215314632297193, "grad_norm": 1.5466194152832031, "learning_rate": 5.8126582278481015e-06, "loss": 0.05616164579987526, "num_input_tokens_seen": 2655742, "step": 1407, "train_runtime": 3848.1953, "train_tokens_per_second": 690.127 }, { "epoch": 1.4225423300480162, "grad_norm": 1.8269500732421875, "learning_rate": 5.8025316455696214e-06, "loss": 0.0843963474035263, "num_input_tokens_seen": 2658112, "step": 1408, "train_runtime": 3850.5147, "train_tokens_per_second": 690.326 }, { "epoch": 1.4235531968663129, "grad_norm": 1.3943942785263062, "learning_rate": 5.79240506329114e-06, "loss": 0.04282160475850105, "num_input_tokens_seen": 2659640, "step": 1409, "train_runtime": 3852.6641, "train_tokens_per_second": 690.338 }, { "epoch": 1.4245640636846095, "grad_norm": 1.5564720630645752, "learning_rate": 5.782278481012659e-06, "loss": 0.06570545583963394, "num_input_tokens_seen": 2661468, "step": 1410, "train_runtime": 3854.9127, "train_tokens_per_second": 690.409 }, { "epoch": 1.4255749305029062, "grad_norm": 1.5751513242721558, "learning_rate": 5.772151898734177e-06, "loss": 0.059860941022634506, "num_input_tokens_seen": 2663680, "step": 1411, "train_runtime": 3863.6955, "train_tokens_per_second": 689.413 }, { "epoch": 1.426585797321203, "grad_norm": 1.4742987155914307, "learning_rate": 5.762025316455697e-06, "loss": 0.07407383620738983, "num_input_tokens_seen": 2666480, "step": 1412, "train_runtime": 3866.1418, "train_tokens_per_second": 689.701 }, { "epoch": 1.4275966641394997, "grad_norm": 1.8826227188110352, "learning_rate": 5.751898734177216e-06, "loss": 0.08610516041517258, "num_input_tokens_seen": 2668490, "step": 1413, "train_runtime": 3868.3845, "train_tokens_per_second": 689.82 }, { "epoch": 1.4286075309577964, "grad_norm": 2.008103847503662, "learning_rate": 5.741772151898734e-06, "loss": 0.0816655233502388, "num_input_tokens_seen": 2670236, "step": 1414, "train_runtime": 3870.5652, "train_tokens_per_second": 689.883 }, { "epoch": 1.429618397776093, "grad_norm": 1.6061736345291138, "learning_rate": 5.731645569620253e-06, "loss": 0.08215966075658798, "num_input_tokens_seen": 2672264, "step": 1415, "train_runtime": 3872.8982, "train_tokens_per_second": 689.991 }, { "epoch": 1.4306292645943897, "grad_norm": 1.6165075302124023, "learning_rate": 5.721518987341773e-06, "loss": 0.06657277792692184, "num_input_tokens_seen": 2674302, "step": 1416, "train_runtime": 3875.2026, "train_tokens_per_second": 690.106 }, { "epoch": 1.4316401314126863, "grad_norm": 1.482926845550537, "learning_rate": 5.7113924050632915e-06, "loss": 0.0545504130423069, "num_input_tokens_seen": 2676036, "step": 1417, "train_runtime": 3877.386, "train_tokens_per_second": 690.165 }, { "epoch": 1.432650998230983, "grad_norm": 1.6906814575195312, "learning_rate": 5.701265822784811e-06, "loss": 0.09162657707929611, "num_input_tokens_seen": 2678014, "step": 1418, "train_runtime": 3879.8251, "train_tokens_per_second": 690.241 }, { "epoch": 1.4336618650492798, "grad_norm": 1.653327465057373, "learning_rate": 5.69113924050633e-06, "loss": 0.061128970235586166, "num_input_tokens_seen": 2679970, "step": 1419, "train_runtime": 3882.0345, "train_tokens_per_second": 690.352 }, { "epoch": 1.4346727318675765, "grad_norm": 1.8733450174331665, "learning_rate": 5.681012658227849e-06, "loss": 0.08715441077947617, "num_input_tokens_seen": 2681874, "step": 1420, "train_runtime": 3884.3075, "train_tokens_per_second": 690.438 }, { "epoch": 1.4356835986858731, "grad_norm": 1.596731185913086, "learning_rate": 5.670886075949368e-06, "loss": 0.058932047337293625, "num_input_tokens_seen": 2683802, "step": 1421, "train_runtime": 3886.5173, "train_tokens_per_second": 690.542 }, { "epoch": 1.4366944655041698, "grad_norm": 2.342883586883545, "learning_rate": 5.660759493670886e-06, "loss": 0.08989928662776947, "num_input_tokens_seen": 2685204, "step": 1422, "train_runtime": 3888.6005, "train_tokens_per_second": 690.532 }, { "epoch": 1.4377053323224664, "grad_norm": 1.5533877611160278, "learning_rate": 5.650632911392405e-06, "loss": 0.08014171570539474, "num_input_tokens_seen": 2687734, "step": 1423, "train_runtime": 3891.0027, "train_tokens_per_second": 690.756 }, { "epoch": 1.4387161991407633, "grad_norm": 1.75212824344635, "learning_rate": 5.640506329113925e-06, "loss": 0.074334055185318, "num_input_tokens_seen": 2689396, "step": 1424, "train_runtime": 3893.2317, "train_tokens_per_second": 690.788 }, { "epoch": 1.43972706595906, "grad_norm": 1.780698537826538, "learning_rate": 5.630379746835443e-06, "loss": 0.09270895272493362, "num_input_tokens_seen": 2691060, "step": 1425, "train_runtime": 3895.4469, "train_tokens_per_second": 690.822 }, { "epoch": 1.4407379327773566, "grad_norm": 1.399304986000061, "learning_rate": 5.6202531645569624e-06, "loss": 0.04954908788204193, "num_input_tokens_seen": 2692586, "step": 1426, "train_runtime": 3897.6832, "train_tokens_per_second": 690.817 }, { "epoch": 1.4417487995956533, "grad_norm": 1.6596004962921143, "learning_rate": 5.6101265822784815e-06, "loss": 0.08171042054891586, "num_input_tokens_seen": 2694948, "step": 1427, "train_runtime": 3900.0356, "train_tokens_per_second": 691.006 }, { "epoch": 1.44275966641395, "grad_norm": 1.5269056558609009, "learning_rate": 5.600000000000001e-06, "loss": 0.07041347026824951, "num_input_tokens_seen": 2697050, "step": 1428, "train_runtime": 3902.2756, "train_tokens_per_second": 691.148 }, { "epoch": 1.4437705332322466, "grad_norm": 1.4953557252883911, "learning_rate": 5.58987341772152e-06, "loss": 0.06814124435186386, "num_input_tokens_seen": 2699474, "step": 1429, "train_runtime": 3904.6004, "train_tokens_per_second": 691.357 }, { "epoch": 1.4447814000505432, "grad_norm": 2.0349628925323486, "learning_rate": 5.579746835443039e-06, "loss": 0.08178409934043884, "num_input_tokens_seen": 2701090, "step": 1430, "train_runtime": 3906.7502, "train_tokens_per_second": 691.391 }, { "epoch": 1.44579226686884, "grad_norm": 1.6497156620025635, "learning_rate": 5.569620253164557e-06, "loss": 0.06791052967309952, "num_input_tokens_seen": 2702828, "step": 1431, "train_runtime": 3908.9029, "train_tokens_per_second": 691.454 }, { "epoch": 1.4468031336871368, "grad_norm": 1.7280336618423462, "learning_rate": 5.559493670886077e-06, "loss": 0.07457365095615387, "num_input_tokens_seen": 2704850, "step": 1432, "train_runtime": 3911.1117, "train_tokens_per_second": 691.581 }, { "epoch": 1.4478140005054334, "grad_norm": 1.5326509475708008, "learning_rate": 5.549367088607596e-06, "loss": 0.050631217658519745, "num_input_tokens_seen": 2706554, "step": 1433, "train_runtime": 3913.2965, "train_tokens_per_second": 691.63 }, { "epoch": 1.44882486732373, "grad_norm": 2.0489110946655273, "learning_rate": 5.539240506329114e-06, "loss": 0.08721400797367096, "num_input_tokens_seen": 2708422, "step": 1434, "train_runtime": 3915.5314, "train_tokens_per_second": 691.713 }, { "epoch": 1.4498357341420267, "grad_norm": 2.0255892276763916, "learning_rate": 5.529113924050633e-06, "loss": 0.08184416592121124, "num_input_tokens_seen": 2710138, "step": 1435, "train_runtime": 3917.7093, "train_tokens_per_second": 691.766 }, { "epoch": 1.4508466009603236, "grad_norm": 1.8512778282165527, "learning_rate": 5.518987341772153e-06, "loss": 0.10774432867765427, "num_input_tokens_seen": 2712362, "step": 1436, "train_runtime": 3920.0078, "train_tokens_per_second": 691.928 }, { "epoch": 1.4518574677786202, "grad_norm": 1.8451319932937622, "learning_rate": 5.5088607594936715e-06, "loss": 0.09010189026594162, "num_input_tokens_seen": 2714324, "step": 1437, "train_runtime": 3922.2595, "train_tokens_per_second": 692.031 }, { "epoch": 1.4528683345969169, "grad_norm": 1.6371424198150635, "learning_rate": 5.498734177215191e-06, "loss": 0.05427632853388786, "num_input_tokens_seen": 2716354, "step": 1438, "train_runtime": 3924.5002, "train_tokens_per_second": 692.153 }, { "epoch": 1.4538792014152135, "grad_norm": 1.239633321762085, "learning_rate": 5.488607594936709e-06, "loss": 0.043502919375896454, "num_input_tokens_seen": 2718476, "step": 1439, "train_runtime": 3926.7668, "train_tokens_per_second": 692.294 }, { "epoch": 1.4548900682335102, "grad_norm": 1.7125214338302612, "learning_rate": 5.478481012658229e-06, "loss": 0.060112956911325455, "num_input_tokens_seen": 2720324, "step": 1440, "train_runtime": 3928.9493, "train_tokens_per_second": 692.38 }, { "epoch": 1.4559009350518068, "grad_norm": 1.7435688972473145, "learning_rate": 5.468354430379748e-06, "loss": 0.06201600283384323, "num_input_tokens_seen": 2721974, "step": 1441, "train_runtime": 3937.5219, "train_tokens_per_second": 691.291 }, { "epoch": 1.4569118018701035, "grad_norm": 1.6306309700012207, "learning_rate": 5.458227848101266e-06, "loss": 0.07703009992837906, "num_input_tokens_seen": 2724214, "step": 1442, "train_runtime": 3939.8263, "train_tokens_per_second": 691.455 }, { "epoch": 1.4579226686884004, "grad_norm": 2.3203349113464355, "learning_rate": 5.448101265822785e-06, "loss": 0.11020687222480774, "num_input_tokens_seen": 2725932, "step": 1443, "train_runtime": 3941.9816, "train_tokens_per_second": 691.513 }, { "epoch": 1.458933535506697, "grad_norm": 1.8823951482772827, "learning_rate": 5.437974683544303e-06, "loss": 0.06746494770050049, "num_input_tokens_seen": 2727498, "step": 1444, "train_runtime": 3944.1288, "train_tokens_per_second": 691.534 }, { "epoch": 1.4599444023249937, "grad_norm": 1.5358587503433228, "learning_rate": 5.427848101265823e-06, "loss": 0.05518173426389694, "num_input_tokens_seen": 2729276, "step": 1445, "train_runtime": 3946.2782, "train_tokens_per_second": 691.608 }, { "epoch": 1.4609552691432903, "grad_norm": 1.3288687467575073, "learning_rate": 5.417721518987342e-06, "loss": 0.04659959301352501, "num_input_tokens_seen": 2731094, "step": 1446, "train_runtime": 3948.4866, "train_tokens_per_second": 691.681 }, { "epoch": 1.4619661359615872, "grad_norm": 1.4637774229049683, "learning_rate": 5.407594936708861e-06, "loss": 0.054771788418293, "num_input_tokens_seen": 2732632, "step": 1447, "train_runtime": 3950.6033, "train_tokens_per_second": 691.7 }, { "epoch": 1.4629770027798839, "grad_norm": 1.5719244480133057, "learning_rate": 5.39746835443038e-06, "loss": 0.07881119847297668, "num_input_tokens_seen": 2734660, "step": 1448, "train_runtime": 3952.8335, "train_tokens_per_second": 691.823 }, { "epoch": 1.4639878695981805, "grad_norm": 1.8760321140289307, "learning_rate": 5.3873417721519e-06, "loss": 0.08335188776254654, "num_input_tokens_seen": 2736088, "step": 1449, "train_runtime": 3954.9171, "train_tokens_per_second": 691.819 }, { "epoch": 1.4649987364164772, "grad_norm": 1.4611618518829346, "learning_rate": 5.377215189873418e-06, "loss": 0.0509427934885025, "num_input_tokens_seen": 2737516, "step": 1450, "train_runtime": 3956.974, "train_tokens_per_second": 691.821 }, { "epoch": 1.4660096032347738, "grad_norm": 1.4783076047897339, "learning_rate": 5.367088607594937e-06, "loss": 0.06264941394329071, "num_input_tokens_seen": 2740122, "step": 1451, "train_runtime": 3959.313, "train_tokens_per_second": 692.07 }, { "epoch": 1.4670204700530705, "grad_norm": 1.5367320775985718, "learning_rate": 5.356962025316455e-06, "loss": 0.06179020553827286, "num_input_tokens_seen": 2741914, "step": 1452, "train_runtime": 3961.5109, "train_tokens_per_second": 692.138 }, { "epoch": 1.468031336871367, "grad_norm": 1.5037331581115723, "learning_rate": 5.346835443037975e-06, "loss": 0.05475204810500145, "num_input_tokens_seen": 2743786, "step": 1453, "train_runtime": 3963.7768, "train_tokens_per_second": 692.215 }, { "epoch": 1.4690422036896638, "grad_norm": 1.5973622798919678, "learning_rate": 5.336708860759494e-06, "loss": 0.057547181844711304, "num_input_tokens_seen": 2745376, "step": 1454, "train_runtime": 3965.8905, "train_tokens_per_second": 692.247 }, { "epoch": 1.4700530705079606, "grad_norm": 1.4456324577331543, "learning_rate": 5.3265822784810125e-06, "loss": 0.056840915232896805, "num_input_tokens_seen": 2747474, "step": 1455, "train_runtime": 3968.1596, "train_tokens_per_second": 692.38 }, { "epoch": 1.4710639373262573, "grad_norm": 1.569125771522522, "learning_rate": 5.3164556962025316e-06, "loss": 0.06012757495045662, "num_input_tokens_seen": 2749496, "step": 1456, "train_runtime": 3970.434, "train_tokens_per_second": 692.493 }, { "epoch": 1.472074804144554, "grad_norm": 1.5364798307418823, "learning_rate": 5.3063291139240515e-06, "loss": 0.07710444182157516, "num_input_tokens_seen": 2751386, "step": 1457, "train_runtime": 3972.644, "train_tokens_per_second": 692.583 }, { "epoch": 1.4730856709628506, "grad_norm": 1.6436177492141724, "learning_rate": 5.29620253164557e-06, "loss": 0.06534931808710098, "num_input_tokens_seen": 2753164, "step": 1458, "train_runtime": 3974.8311, "train_tokens_per_second": 692.649 }, { "epoch": 1.4740965377811475, "grad_norm": 1.5389630794525146, "learning_rate": 5.286075949367089e-06, "loss": 0.06264296174049377, "num_input_tokens_seen": 2755032, "step": 1459, "train_runtime": 3977.0651, "train_tokens_per_second": 692.73 }, { "epoch": 1.4751074045994441, "grad_norm": 1.715559720993042, "learning_rate": 5.275949367088608e-06, "loss": 0.05479292944073677, "num_input_tokens_seen": 2756680, "step": 1460, "train_runtime": 3979.2082, "train_tokens_per_second": 692.771 }, { "epoch": 1.4761182714177408, "grad_norm": 1.5218862295150757, "learning_rate": 5.265822784810127e-06, "loss": 0.05441203713417053, "num_input_tokens_seen": 2758496, "step": 1461, "train_runtime": 3981.3814, "train_tokens_per_second": 692.849 }, { "epoch": 1.4771291382360374, "grad_norm": 1.719048261642456, "learning_rate": 5.255696202531646e-06, "loss": 0.06784654408693314, "num_input_tokens_seen": 2760264, "step": 1462, "train_runtime": 3983.5277, "train_tokens_per_second": 692.919 }, { "epoch": 1.478140005054334, "grad_norm": 1.5282814502716064, "learning_rate": 5.245569620253165e-06, "loss": 0.06325586140155792, "num_input_tokens_seen": 2762474, "step": 1463, "train_runtime": 3985.8251, "train_tokens_per_second": 693.075 }, { "epoch": 1.4791508718726307, "grad_norm": 1.684726357460022, "learning_rate": 5.235443037974683e-06, "loss": 0.09345227479934692, "num_input_tokens_seen": 2764950, "step": 1464, "train_runtime": 3988.1829, "train_tokens_per_second": 693.286 }, { "epoch": 1.4801617386909274, "grad_norm": 1.6782022714614868, "learning_rate": 5.225316455696203e-06, "loss": 0.05765301361680031, "num_input_tokens_seen": 2766558, "step": 1465, "train_runtime": 3990.2964, "train_tokens_per_second": 693.321 }, { "epoch": 1.481172605509224, "grad_norm": 1.8614157438278198, "learning_rate": 5.2151898734177216e-06, "loss": 0.05889071151614189, "num_input_tokens_seen": 2768498, "step": 1466, "train_runtime": 3992.5301, "train_tokens_per_second": 693.419 }, { "epoch": 1.482183472327521, "grad_norm": 2.2837564945220947, "learning_rate": 5.205063291139241e-06, "loss": 0.08481335639953613, "num_input_tokens_seen": 2770106, "step": 1467, "train_runtime": 3994.6696, "train_tokens_per_second": 693.451 }, { "epoch": 1.4831943391458176, "grad_norm": 1.754288673400879, "learning_rate": 5.19493670886076e-06, "loss": 0.08612794429063797, "num_input_tokens_seen": 2771954, "step": 1468, "train_runtime": 3996.8334, "train_tokens_per_second": 693.538 }, { "epoch": 1.4842052059641142, "grad_norm": 2.616823196411133, "learning_rate": 5.184810126582279e-06, "loss": 0.060365933924913406, "num_input_tokens_seen": 2773760, "step": 1469, "train_runtime": 3999.0241, "train_tokens_per_second": 693.609 }, { "epoch": 1.4852160727824109, "grad_norm": 1.5449236631393433, "learning_rate": 5.174683544303798e-06, "loss": 0.07536165416240692, "num_input_tokens_seen": 2776132, "step": 1470, "train_runtime": 4001.3085, "train_tokens_per_second": 693.806 }, { "epoch": 1.4862269396007077, "grad_norm": 1.879141926765442, "learning_rate": 5.164556962025317e-06, "loss": 0.056780196726322174, "num_input_tokens_seen": 2777870, "step": 1471, "train_runtime": 4009.5867, "train_tokens_per_second": 692.807 }, { "epoch": 1.4872378064190044, "grad_norm": 1.9275370836257935, "learning_rate": 5.154430379746835e-06, "loss": 0.07316268980503082, "num_input_tokens_seen": 2779626, "step": 1472, "train_runtime": 4011.8369, "train_tokens_per_second": 692.856 }, { "epoch": 1.488248673237301, "grad_norm": 1.7731972932815552, "learning_rate": 5.144303797468355e-06, "loss": 0.06532439589500427, "num_input_tokens_seen": 2780798, "step": 1473, "train_runtime": 4013.9479, "train_tokens_per_second": 692.784 }, { "epoch": 1.4892595400555977, "grad_norm": 1.7615017890930176, "learning_rate": 5.134177215189874e-06, "loss": 0.07552695274353027, "num_input_tokens_seen": 2782748, "step": 1474, "train_runtime": 4016.1319, "train_tokens_per_second": 692.893 }, { "epoch": 1.4902704068738943, "grad_norm": 2.1878254413604736, "learning_rate": 5.1240506329113925e-06, "loss": 0.05805474519729614, "num_input_tokens_seen": 2784756, "step": 1475, "train_runtime": 4018.3974, "train_tokens_per_second": 693.002 }, { "epoch": 1.491281273692191, "grad_norm": 1.5653693675994873, "learning_rate": 5.1139240506329116e-06, "loss": 0.05668792873620987, "num_input_tokens_seen": 2786760, "step": 1476, "train_runtime": 4020.6413, "train_tokens_per_second": 693.113 }, { "epoch": 1.4922921405104876, "grad_norm": 1.833175539970398, "learning_rate": 5.1037974683544315e-06, "loss": 0.08333535492420197, "num_input_tokens_seen": 2788472, "step": 1477, "train_runtime": 4022.7867, "train_tokens_per_second": 693.169 }, { "epoch": 1.4933030073287845, "grad_norm": 1.3737703561782837, "learning_rate": 5.09367088607595e-06, "loss": 0.05029531568288803, "num_input_tokens_seen": 2790172, "step": 1478, "train_runtime": 4024.956, "train_tokens_per_second": 693.218 }, { "epoch": 1.4943138741470812, "grad_norm": 1.6074210405349731, "learning_rate": 5.083544303797469e-06, "loss": 0.05395309627056122, "num_input_tokens_seen": 2791846, "step": 1479, "train_runtime": 4027.1609, "train_tokens_per_second": 693.254 }, { "epoch": 1.4953247409653778, "grad_norm": 1.667372465133667, "learning_rate": 5.073417721518987e-06, "loss": 0.0809595137834549, "num_input_tokens_seen": 2793818, "step": 1480, "train_runtime": 4029.3947, "train_tokens_per_second": 693.359 }, { "epoch": 1.4963356077836745, "grad_norm": 1.7782727479934692, "learning_rate": 5.063291139240507e-06, "loss": 0.060248326510190964, "num_input_tokens_seen": 2795626, "step": 1481, "train_runtime": 4031.5828, "train_tokens_per_second": 693.431 }, { "epoch": 1.4973464746019711, "grad_norm": 2.026197671890259, "learning_rate": 5.053164556962026e-06, "loss": 0.08361667394638062, "num_input_tokens_seen": 2797286, "step": 1482, "train_runtime": 4033.733, "train_tokens_per_second": 693.473 }, { "epoch": 1.498357341420268, "grad_norm": 2.1825647354125977, "learning_rate": 5.043037974683544e-06, "loss": 0.07168866693973541, "num_input_tokens_seen": 2798946, "step": 1483, "train_runtime": 4035.8867, "train_tokens_per_second": 693.515 }, { "epoch": 1.4993682082385646, "grad_norm": 1.9255553483963013, "learning_rate": 5.032911392405063e-06, "loss": 0.08370400965213776, "num_input_tokens_seen": 2800864, "step": 1484, "train_runtime": 4038.1086, "train_tokens_per_second": 693.608 }, { "epoch": 1.5003790750568613, "grad_norm": 1.5774973630905151, "learning_rate": 5.022784810126583e-06, "loss": 0.06282275170087814, "num_input_tokens_seen": 2802846, "step": 1485, "train_runtime": 4040.3976, "train_tokens_per_second": 693.705 }, { "epoch": 1.501389941875158, "grad_norm": 2.2015116214752197, "learning_rate": 5.0126582278481016e-06, "loss": 0.0942520946264267, "num_input_tokens_seen": 2804606, "step": 1486, "train_runtime": 4042.5864, "train_tokens_per_second": 693.765 }, { "epoch": 1.5024008086934546, "grad_norm": 1.7354520559310913, "learning_rate": 5.002531645569621e-06, "loss": 0.06485570967197418, "num_input_tokens_seen": 2806254, "step": 1487, "train_runtime": 4044.7431, "train_tokens_per_second": 693.803 }, { "epoch": 1.5034116755117513, "grad_norm": 1.662319540977478, "learning_rate": 4.99240506329114e-06, "loss": 0.06699532270431519, "num_input_tokens_seen": 2807812, "step": 1488, "train_runtime": 4046.8851, "train_tokens_per_second": 693.821 }, { "epoch": 1.504422542330048, "grad_norm": 1.3281782865524292, "learning_rate": 4.982278481012659e-06, "loss": 0.052544791251420975, "num_input_tokens_seen": 2809866, "step": 1489, "train_runtime": 4049.0936, "train_tokens_per_second": 693.949 }, { "epoch": 1.5054334091483446, "grad_norm": 1.7143620252609253, "learning_rate": 4.972151898734178e-06, "loss": 0.06422758847475052, "num_input_tokens_seen": 2811744, "step": 1490, "train_runtime": 4051.2866, "train_tokens_per_second": 694.037 }, { "epoch": 1.5064442759666414, "grad_norm": 1.552291750907898, "learning_rate": 4.962025316455696e-06, "loss": 0.07418136298656464, "num_input_tokens_seen": 2814384, "step": 1491, "train_runtime": 4053.6381, "train_tokens_per_second": 694.286 }, { "epoch": 1.507455142784938, "grad_norm": 1.4776345491409302, "learning_rate": 4.951898734177216e-06, "loss": 0.06440728902816772, "num_input_tokens_seen": 2816184, "step": 1492, "train_runtime": 4055.8897, "train_tokens_per_second": 694.344 }, { "epoch": 1.5084660096032347, "grad_norm": 1.6045451164245605, "learning_rate": 4.941772151898734e-06, "loss": 0.06612151861190796, "num_input_tokens_seen": 2818180, "step": 1493, "train_runtime": 4058.1291, "train_tokens_per_second": 694.453 }, { "epoch": 1.5094768764215316, "grad_norm": 1.7005598545074463, "learning_rate": 4.931645569620253e-06, "loss": 0.07076660543680191, "num_input_tokens_seen": 2820102, "step": 1494, "train_runtime": 4060.3338, "train_tokens_per_second": 694.549 }, { "epoch": 1.5104877432398283, "grad_norm": 1.6715127229690552, "learning_rate": 4.9215189873417725e-06, "loss": 0.05914783850312233, "num_input_tokens_seen": 2821580, "step": 1495, "train_runtime": 4062.4516, "train_tokens_per_second": 694.551 }, { "epoch": 1.511498610058125, "grad_norm": 1.5523298978805542, "learning_rate": 4.9113924050632915e-06, "loss": 0.057301413267850876, "num_input_tokens_seen": 2824202, "step": 1496, "train_runtime": 4064.866, "train_tokens_per_second": 694.784 }, { "epoch": 1.5125094768764216, "grad_norm": 1.474369764328003, "learning_rate": 4.901265822784811e-06, "loss": 0.06793700903654099, "num_input_tokens_seen": 2826432, "step": 1497, "train_runtime": 4067.1398, "train_tokens_per_second": 694.943 }, { "epoch": 1.5135203436947182, "grad_norm": 1.3737822771072388, "learning_rate": 4.89113924050633e-06, "loss": 0.05869380757212639, "num_input_tokens_seen": 2828690, "step": 1498, "train_runtime": 4069.436, "train_tokens_per_second": 695.106 }, { "epoch": 1.5145312105130149, "grad_norm": 1.8771203756332397, "learning_rate": 4.881012658227848e-06, "loss": 0.07134260982275009, "num_input_tokens_seen": 2830248, "step": 1499, "train_runtime": 4071.5527, "train_tokens_per_second": 695.127 }, { "epoch": 1.5155420773313115, "grad_norm": 1.5327411890029907, "learning_rate": 4.870886075949368e-06, "loss": 0.06758476048707962, "num_input_tokens_seen": 2832522, "step": 1500, "train_runtime": 4073.8616, "train_tokens_per_second": 695.292 }, { "epoch": 1.5165529441496082, "grad_norm": 1.4994726181030273, "learning_rate": 4.860759493670886e-06, "loss": 0.06690610945224762, "num_input_tokens_seen": 2834288, "step": 1501, "train_runtime": 4082.459, "train_tokens_per_second": 694.26 }, { "epoch": 1.5175638109679048, "grad_norm": 1.600295066833496, "learning_rate": 4.850632911392405e-06, "loss": 0.06315764784812927, "num_input_tokens_seen": 2836114, "step": 1502, "train_runtime": 4084.7241, "train_tokens_per_second": 694.322 }, { "epoch": 1.5185746777862017, "grad_norm": 1.817538857460022, "learning_rate": 4.840506329113924e-06, "loss": 0.08383622020483017, "num_input_tokens_seen": 2838072, "step": 1503, "train_runtime": 4087.1024, "train_tokens_per_second": 694.397 }, { "epoch": 1.5195855446044984, "grad_norm": 1.6323297023773193, "learning_rate": 4.830379746835443e-06, "loss": 0.05724768713116646, "num_input_tokens_seen": 2840010, "step": 1504, "train_runtime": 4089.3052, "train_tokens_per_second": 694.497 }, { "epoch": 1.520596411422795, "grad_norm": 1.6135390996932983, "learning_rate": 4.8202531645569625e-06, "loss": 0.05224788933992386, "num_input_tokens_seen": 2841990, "step": 1505, "train_runtime": 4091.5168, "train_tokens_per_second": 694.605 }, { "epoch": 1.5216072782410919, "grad_norm": 1.7678437232971191, "learning_rate": 4.8101265822784815e-06, "loss": 0.06881388276815414, "num_input_tokens_seen": 2843498, "step": 1506, "train_runtime": 4093.6093, "train_tokens_per_second": 694.619 }, { "epoch": 1.5226181450593885, "grad_norm": 1.913795828819275, "learning_rate": 4.800000000000001e-06, "loss": 0.0925389900803566, "num_input_tokens_seen": 2845090, "step": 1507, "train_runtime": 4095.7249, "train_tokens_per_second": 694.649 }, { "epoch": 1.5236290118776852, "grad_norm": 1.9918967485427856, "learning_rate": 4.78987341772152e-06, "loss": 0.08005580306053162, "num_input_tokens_seen": 2846700, "step": 1508, "train_runtime": 4098.0559, "train_tokens_per_second": 694.646 }, { "epoch": 1.5246398786959818, "grad_norm": 1.7330108880996704, "learning_rate": 4.779746835443038e-06, "loss": 0.05722786486148834, "num_input_tokens_seen": 2848114, "step": 1509, "train_runtime": 4100.1429, "train_tokens_per_second": 694.638 }, { "epoch": 1.5256507455142785, "grad_norm": 1.9117228984832764, "learning_rate": 4.769620253164557e-06, "loss": 0.09200979769229889, "num_input_tokens_seen": 2849846, "step": 1510, "train_runtime": 4102.3037, "train_tokens_per_second": 694.694 }, { "epoch": 1.5266616123325751, "grad_norm": 1.6707384586334229, "learning_rate": 4.759493670886076e-06, "loss": 0.07151450216770172, "num_input_tokens_seen": 2851468, "step": 1511, "train_runtime": 4104.4497, "train_tokens_per_second": 694.726 }, { "epoch": 1.5276724791508718, "grad_norm": 1.771851658821106, "learning_rate": 4.749367088607595e-06, "loss": 0.08380179107189178, "num_input_tokens_seen": 2853370, "step": 1512, "train_runtime": 4106.6563, "train_tokens_per_second": 694.816 }, { "epoch": 1.5286833459691684, "grad_norm": 1.8305950164794922, "learning_rate": 4.739240506329114e-06, "loss": 0.08426954597234726, "num_input_tokens_seen": 2855182, "step": 1513, "train_runtime": 4108.8379, "train_tokens_per_second": 694.888 }, { "epoch": 1.529694212787465, "grad_norm": 2.3114895820617676, "learning_rate": 4.729113924050633e-06, "loss": 0.08215209096670151, "num_input_tokens_seen": 2857214, "step": 1514, "train_runtime": 4111.0775, "train_tokens_per_second": 695.004 }, { "epoch": 1.530705079605762, "grad_norm": 1.875800609588623, "learning_rate": 4.7189873417721525e-06, "loss": 0.07074695080518723, "num_input_tokens_seen": 2859046, "step": 1515, "train_runtime": 4113.2816, "train_tokens_per_second": 695.077 }, { "epoch": 1.5317159464240586, "grad_norm": 1.830914855003357, "learning_rate": 4.7088607594936715e-06, "loss": 0.07563849538564682, "num_input_tokens_seen": 2861014, "step": 1516, "train_runtime": 4115.5223, "train_tokens_per_second": 695.176 }, { "epoch": 1.5327268132423553, "grad_norm": 1.6784169673919678, "learning_rate": 4.69873417721519e-06, "loss": 0.07204784452915192, "num_input_tokens_seen": 2862968, "step": 1517, "train_runtime": 4117.7335, "train_tokens_per_second": 695.278 }, { "epoch": 1.5337376800606521, "grad_norm": 1.5273574590682983, "learning_rate": 4.68860759493671e-06, "loss": 0.05450946092605591, "num_input_tokens_seen": 2864930, "step": 1518, "train_runtime": 4119.9373, "train_tokens_per_second": 695.382 }, { "epoch": 1.5347485468789488, "grad_norm": 1.5135360956192017, "learning_rate": 4.678481012658228e-06, "loss": 0.059337448328733444, "num_input_tokens_seen": 2867000, "step": 1519, "train_runtime": 4122.1856, "train_tokens_per_second": 695.505 }, { "epoch": 1.5357594136972454, "grad_norm": 1.509782314300537, "learning_rate": 4.668354430379747e-06, "loss": 0.0536489337682724, "num_input_tokens_seen": 2869152, "step": 1520, "train_runtime": 4124.4506, "train_tokens_per_second": 695.645 }, { "epoch": 1.536770280515542, "grad_norm": 2.1016454696655273, "learning_rate": 4.658227848101266e-06, "loss": 0.07627323269844055, "num_input_tokens_seen": 2870778, "step": 1521, "train_runtime": 4126.6768, "train_tokens_per_second": 695.663 }, { "epoch": 1.5377811473338387, "grad_norm": 1.5608389377593994, "learning_rate": 4.648101265822785e-06, "loss": 0.07444711029529572, "num_input_tokens_seen": 2872896, "step": 1522, "train_runtime": 4128.9836, "train_tokens_per_second": 695.788 }, { "epoch": 1.5387920141521354, "grad_norm": 1.8106434345245361, "learning_rate": 4.637974683544304e-06, "loss": 0.06342519074678421, "num_input_tokens_seen": 2874902, "step": 1523, "train_runtime": 4131.2116, "train_tokens_per_second": 695.898 }, { "epoch": 1.539802880970432, "grad_norm": 1.6673105955123901, "learning_rate": 4.627848101265823e-06, "loss": 0.06298794597387314, "num_input_tokens_seen": 2876462, "step": 1524, "train_runtime": 4133.3725, "train_tokens_per_second": 695.912 }, { "epoch": 1.5408137477887287, "grad_norm": 1.5623661279678345, "learning_rate": 4.617721518987342e-06, "loss": 0.07657312601804733, "num_input_tokens_seen": 2878202, "step": 1525, "train_runtime": 4135.5681, "train_tokens_per_second": 695.963 }, { "epoch": 1.5418246146070256, "grad_norm": 1.5652337074279785, "learning_rate": 4.6075949367088615e-06, "loss": 0.07076507806777954, "num_input_tokens_seen": 2880316, "step": 1526, "train_runtime": 4137.8502, "train_tokens_per_second": 696.09 }, { "epoch": 1.5428354814253222, "grad_norm": 1.7186670303344727, "learning_rate": 4.59746835443038e-06, "loss": 0.07635582238435745, "num_input_tokens_seen": 2881992, "step": 1527, "train_runtime": 4140.0128, "train_tokens_per_second": 696.131 }, { "epoch": 1.5438463482436189, "grad_norm": 1.3687337636947632, "learning_rate": 4.587341772151899e-06, "loss": 0.05123043805360794, "num_input_tokens_seen": 2883762, "step": 1528, "train_runtime": 4142.2782, "train_tokens_per_second": 696.178 }, { "epoch": 1.5448572150619158, "grad_norm": 2.1513876914978027, "learning_rate": 4.577215189873418e-06, "loss": 0.06788188219070435, "num_input_tokens_seen": 2886030, "step": 1529, "train_runtime": 4144.7615, "train_tokens_per_second": 696.308 }, { "epoch": 1.5458680818802124, "grad_norm": 1.595686435699463, "learning_rate": 4.567088607594937e-06, "loss": 0.0664450153708458, "num_input_tokens_seen": 2887852, "step": 1530, "train_runtime": 4146.9505, "train_tokens_per_second": 696.38 }, { "epoch": 1.546878948698509, "grad_norm": 1.803052306175232, "learning_rate": 4.556962025316456e-06, "loss": 0.07884696125984192, "num_input_tokens_seen": 2889610, "step": 1531, "train_runtime": 4155.6233, "train_tokens_per_second": 695.349 }, { "epoch": 1.5478898155168057, "grad_norm": 1.6938878297805786, "learning_rate": 4.546835443037975e-06, "loss": 0.06919347494840622, "num_input_tokens_seen": 2891706, "step": 1532, "train_runtime": 4157.8654, "train_tokens_per_second": 695.479 }, { "epoch": 1.5489006823351024, "grad_norm": 1.9805231094360352, "learning_rate": 4.536708860759494e-06, "loss": 0.08436493575572968, "num_input_tokens_seen": 2893848, "step": 1533, "train_runtime": 4160.1334, "train_tokens_per_second": 695.614 }, { "epoch": 1.549911549153399, "grad_norm": 1.4778332710266113, "learning_rate": 4.526582278481013e-06, "loss": 0.05188169330358505, "num_input_tokens_seen": 2895582, "step": 1534, "train_runtime": 4162.3948, "train_tokens_per_second": 695.653 }, { "epoch": 1.5509224159716957, "grad_norm": 1.6248661279678345, "learning_rate": 4.516455696202532e-06, "loss": 0.0605023130774498, "num_input_tokens_seen": 2897422, "step": 1535, "train_runtime": 4164.5631, "train_tokens_per_second": 695.733 }, { "epoch": 1.5519332827899923, "grad_norm": 1.6457431316375732, "learning_rate": 4.5063291139240515e-06, "loss": 0.048475056886672974, "num_input_tokens_seen": 2898578, "step": 1536, "train_runtime": 4166.5701, "train_tokens_per_second": 695.675 }, { "epoch": 1.552944149608289, "grad_norm": 1.3036322593688965, "learning_rate": 4.49620253164557e-06, "loss": 0.061688873916864395, "num_input_tokens_seen": 2900830, "step": 1537, "train_runtime": 4168.908, "train_tokens_per_second": 695.825 }, { "epoch": 1.5539550164265858, "grad_norm": 1.6548831462860107, "learning_rate": 4.486075949367089e-06, "loss": 0.06499501317739487, "num_input_tokens_seen": 2902758, "step": 1538, "train_runtime": 4171.1733, "train_tokens_per_second": 695.909 }, { "epoch": 1.5549658832448825, "grad_norm": 1.465171456336975, "learning_rate": 4.475949367088608e-06, "loss": 0.06906162202358246, "num_input_tokens_seen": 2904738, "step": 1539, "train_runtime": 4173.3907, "train_tokens_per_second": 696.014 }, { "epoch": 1.5559767500631791, "grad_norm": 1.5636467933654785, "learning_rate": 4.465822784810127e-06, "loss": 0.0834270566701889, "num_input_tokens_seen": 2907096, "step": 1540, "train_runtime": 4175.7625, "train_tokens_per_second": 696.183 }, { "epoch": 1.556987616881476, "grad_norm": 1.7297980785369873, "learning_rate": 4.455696202531646e-06, "loss": 0.07621173560619354, "num_input_tokens_seen": 2908836, "step": 1541, "train_runtime": 4177.9427, "train_tokens_per_second": 696.236 }, { "epoch": 1.5579984836997727, "grad_norm": 1.9271103143692017, "learning_rate": 4.445569620253165e-06, "loss": 0.07846500724554062, "num_input_tokens_seen": 2910510, "step": 1542, "train_runtime": 4180.1229, "train_tokens_per_second": 696.274 }, { "epoch": 1.5590093505180693, "grad_norm": 1.575373888015747, "learning_rate": 4.4354430379746834e-06, "loss": 0.05334926396608353, "num_input_tokens_seen": 2912316, "step": 1543, "train_runtime": 4182.3641, "train_tokens_per_second": 696.332 }, { "epoch": 1.560020217336366, "grad_norm": 1.826368808746338, "learning_rate": 4.425316455696203e-06, "loss": 0.09432559460401535, "num_input_tokens_seen": 2914070, "step": 1544, "train_runtime": 4184.5555, "train_tokens_per_second": 696.387 }, { "epoch": 1.5610310841546626, "grad_norm": 1.9886971712112427, "learning_rate": 4.415189873417722e-06, "loss": 0.10036467760801315, "num_input_tokens_seen": 2916386, "step": 1545, "train_runtime": 4186.8955, "train_tokens_per_second": 696.551 }, { "epoch": 1.5620419509729593, "grad_norm": 1.8595750331878662, "learning_rate": 4.405063291139241e-06, "loss": 0.07906724512577057, "num_input_tokens_seen": 2918148, "step": 1546, "train_runtime": 4189.0786, "train_tokens_per_second": 696.609 }, { "epoch": 1.563052817791256, "grad_norm": 1.4908061027526855, "learning_rate": 4.39493670886076e-06, "loss": 0.07332147657871246, "num_input_tokens_seen": 2920642, "step": 1547, "train_runtime": 4191.4473, "train_tokens_per_second": 696.81 }, { "epoch": 1.5640636846095526, "grad_norm": 1.8409886360168457, "learning_rate": 4.384810126582279e-06, "loss": 0.07795832306146622, "num_input_tokens_seen": 2922254, "step": 1548, "train_runtime": 4193.6605, "train_tokens_per_second": 696.827 }, { "epoch": 1.5650745514278492, "grad_norm": 1.5730971097946167, "learning_rate": 4.374683544303798e-06, "loss": 0.0563131645321846, "num_input_tokens_seen": 2924156, "step": 1549, "train_runtime": 4195.9226, "train_tokens_per_second": 696.904 }, { "epoch": 1.566085418246146, "grad_norm": 2.096383810043335, "learning_rate": 4.364556962025317e-06, "loss": 0.09253260493278503, "num_input_tokens_seen": 2926290, "step": 1550, "train_runtime": 4198.1958, "train_tokens_per_second": 697.035 }, { "epoch": 1.5670962850644428, "grad_norm": 1.662731409072876, "learning_rate": 4.354430379746836e-06, "loss": 0.06166689097881317, "num_input_tokens_seen": 2928344, "step": 1551, "train_runtime": 4200.4667, "train_tokens_per_second": 697.147 }, { "epoch": 1.5681071518827394, "grad_norm": 1.193656325340271, "learning_rate": 4.344303797468355e-06, "loss": 0.04309312254190445, "num_input_tokens_seen": 2930198, "step": 1552, "train_runtime": 4202.6776, "train_tokens_per_second": 697.222 }, { "epoch": 1.5691180187010363, "grad_norm": 1.6584079265594482, "learning_rate": 4.3341772151898734e-06, "loss": 0.0468953512609005, "num_input_tokens_seen": 2931694, "step": 1553, "train_runtime": 4204.7669, "train_tokens_per_second": 697.231 }, { "epoch": 1.570128885519333, "grad_norm": 1.9389419555664062, "learning_rate": 4.3240506329113925e-06, "loss": 0.09267403930425644, "num_input_tokens_seen": 2933774, "step": 1554, "train_runtime": 4207.0499, "train_tokens_per_second": 697.347 }, { "epoch": 1.5711397523376296, "grad_norm": 1.7845357656478882, "learning_rate": 4.313924050632912e-06, "loss": 0.08263450860977173, "num_input_tokens_seen": 2935584, "step": 1555, "train_runtime": 4209.2304, "train_tokens_per_second": 697.416 }, { "epoch": 1.5721506191559262, "grad_norm": 2.0508620738983154, "learning_rate": 4.303797468354431e-06, "loss": 0.07426123321056366, "num_input_tokens_seen": 2937110, "step": 1556, "train_runtime": 4211.4416, "train_tokens_per_second": 697.412 }, { "epoch": 1.573161485974223, "grad_norm": 1.685733437538147, "learning_rate": 4.29367088607595e-06, "loss": 0.05370761454105377, "num_input_tokens_seen": 2938708, "step": 1557, "train_runtime": 4213.6474, "train_tokens_per_second": 697.426 }, { "epoch": 1.5741723527925195, "grad_norm": 1.7071869373321533, "learning_rate": 4.283544303797469e-06, "loss": 0.0799432173371315, "num_input_tokens_seen": 2941278, "step": 1558, "train_runtime": 4216.021, "train_tokens_per_second": 697.643 }, { "epoch": 1.5751832196108162, "grad_norm": 1.7251238822937012, "learning_rate": 4.273417721518988e-06, "loss": 0.07716953009366989, "num_input_tokens_seen": 2942738, "step": 1559, "train_runtime": 4218.1611, "train_tokens_per_second": 697.635 }, { "epoch": 1.5761940864291129, "grad_norm": 1.7671867609024048, "learning_rate": 4.263291139240507e-06, "loss": 0.07282590121030807, "num_input_tokens_seen": 2944420, "step": 1560, "train_runtime": 4220.2998, "train_tokens_per_second": 697.68 }, { "epoch": 1.5772049532474095, "grad_norm": 1.8977595567703247, "learning_rate": 4.253164556962025e-06, "loss": 0.08582794666290283, "num_input_tokens_seen": 2946336, "step": 1561, "train_runtime": 4229.2752, "train_tokens_per_second": 696.653 }, { "epoch": 1.5782158200657064, "grad_norm": 1.7306803464889526, "learning_rate": 4.243037974683545e-06, "loss": 0.07706762105226517, "num_input_tokens_seen": 2947836, "step": 1562, "train_runtime": 4231.482, "train_tokens_per_second": 696.644 }, { "epoch": 1.579226686884003, "grad_norm": 1.5827447175979614, "learning_rate": 4.232911392405063e-06, "loss": 0.07217445969581604, "num_input_tokens_seen": 2950112, "step": 1563, "train_runtime": 4233.7765, "train_tokens_per_second": 696.804 }, { "epoch": 1.5802375537022997, "grad_norm": 2.0294995307922363, "learning_rate": 4.2227848101265825e-06, "loss": 0.08813823014497757, "num_input_tokens_seen": 2952126, "step": 1564, "train_runtime": 4236.0123, "train_tokens_per_second": 696.912 }, { "epoch": 1.5812484205205966, "grad_norm": 1.4940035343170166, "learning_rate": 4.212658227848102e-06, "loss": 0.0729675441980362, "num_input_tokens_seen": 2953936, "step": 1565, "train_runtime": 4238.2175, "train_tokens_per_second": 696.976 }, { "epoch": 1.5822592873388932, "grad_norm": 1.6191201210021973, "learning_rate": 4.202531645569621e-06, "loss": 0.07353523373603821, "num_input_tokens_seen": 2955706, "step": 1566, "train_runtime": 4240.402, "train_tokens_per_second": 697.034 }, { "epoch": 1.5832701541571899, "grad_norm": 1.9050995111465454, "learning_rate": 4.19240506329114e-06, "loss": 0.08147936314344406, "num_input_tokens_seen": 2957292, "step": 1567, "train_runtime": 4242.5713, "train_tokens_per_second": 697.052 }, { "epoch": 1.5842810209754865, "grad_norm": 1.478128433227539, "learning_rate": 4.182278481012659e-06, "loss": 0.06900140643119812, "num_input_tokens_seen": 2959516, "step": 1568, "train_runtime": 4244.9261, "train_tokens_per_second": 697.189 }, { "epoch": 1.5852918877937832, "grad_norm": 1.4391906261444092, "learning_rate": 4.172151898734177e-06, "loss": 0.06270866096019745, "num_input_tokens_seen": 2961496, "step": 1569, "train_runtime": 4247.1968, "train_tokens_per_second": 697.282 }, { "epoch": 1.5863027546120798, "grad_norm": 1.5638253688812256, "learning_rate": 4.162025316455697e-06, "loss": 0.05708848685026169, "num_input_tokens_seen": 2963170, "step": 1570, "train_runtime": 4249.383, "train_tokens_per_second": 697.318 }, { "epoch": 1.5873136214303765, "grad_norm": 1.6085665225982666, "learning_rate": 4.151898734177215e-06, "loss": 0.06098378449678421, "num_input_tokens_seen": 2965072, "step": 1571, "train_runtime": 4251.6007, "train_tokens_per_second": 697.401 }, { "epoch": 1.5883244882486731, "grad_norm": 1.5476840734481812, "learning_rate": 4.141772151898734e-06, "loss": 0.07203972339630127, "num_input_tokens_seen": 2967136, "step": 1572, "train_runtime": 4253.8611, "train_tokens_per_second": 697.516 }, { "epoch": 1.5893353550669698, "grad_norm": 1.5056819915771484, "learning_rate": 4.131645569620253e-06, "loss": 0.05791059881448746, "num_input_tokens_seen": 2968980, "step": 1573, "train_runtime": 4256.0918, "train_tokens_per_second": 697.584 }, { "epoch": 1.5903462218852666, "grad_norm": 1.7315961122512817, "learning_rate": 4.1215189873417725e-06, "loss": 0.07439381629228592, "num_input_tokens_seen": 2970630, "step": 1574, "train_runtime": 4258.2375, "train_tokens_per_second": 697.62 }, { "epoch": 1.5913570887035633, "grad_norm": 1.4721879959106445, "learning_rate": 4.111392405063292e-06, "loss": 0.060391560196876526, "num_input_tokens_seen": 2972686, "step": 1575, "train_runtime": 4260.5192, "train_tokens_per_second": 697.729 }, { "epoch": 1.59236795552186, "grad_norm": 1.6085623502731323, "learning_rate": 4.101265822784811e-06, "loss": 0.0684574544429779, "num_input_tokens_seen": 2974526, "step": 1576, "train_runtime": 4262.7479, "train_tokens_per_second": 697.795 }, { "epoch": 1.5933788223401568, "grad_norm": 1.4107952117919922, "learning_rate": 4.09113924050633e-06, "loss": 0.05432877317070961, "num_input_tokens_seen": 2976356, "step": 1577, "train_runtime": 4264.9605, "train_tokens_per_second": 697.862 }, { "epoch": 1.5943896891584535, "grad_norm": 1.934281587600708, "learning_rate": 4.081012658227849e-06, "loss": 0.07048742473125458, "num_input_tokens_seen": 2977998, "step": 1578, "train_runtime": 4267.1758, "train_tokens_per_second": 697.885 }, { "epoch": 1.5954005559767501, "grad_norm": 1.5795378684997559, "learning_rate": 4.070886075949367e-06, "loss": 0.06708382070064545, "num_input_tokens_seen": 2979636, "step": 1579, "train_runtime": 4269.2968, "train_tokens_per_second": 697.922 }, { "epoch": 1.5964114227950468, "grad_norm": 1.7154045104980469, "learning_rate": 4.060759493670887e-06, "loss": 0.07803279906511307, "num_input_tokens_seen": 2981328, "step": 1580, "train_runtime": 4271.5225, "train_tokens_per_second": 697.954 }, { "epoch": 1.5974222896133434, "grad_norm": 1.827027440071106, "learning_rate": 4.050632911392405e-06, "loss": 0.07495563477277756, "num_input_tokens_seen": 2982932, "step": 1581, "train_runtime": 4273.6507, "train_tokens_per_second": 697.982 }, { "epoch": 1.59843315643164, "grad_norm": 1.8193178176879883, "learning_rate": 4.040506329113924e-06, "loss": 0.07988477498292923, "num_input_tokens_seen": 2985058, "step": 1582, "train_runtime": 4275.92, "train_tokens_per_second": 698.109 }, { "epoch": 1.5994440232499367, "grad_norm": 1.5274325609207153, "learning_rate": 4.030379746835443e-06, "loss": 0.057682231068611145, "num_input_tokens_seen": 2987304, "step": 1583, "train_runtime": 4278.2365, "train_tokens_per_second": 698.256 }, { "epoch": 1.6004548900682334, "grad_norm": 1.6576076745986938, "learning_rate": 4.0202531645569625e-06, "loss": 0.07831859588623047, "num_input_tokens_seen": 2989272, "step": 1584, "train_runtime": 4280.5089, "train_tokens_per_second": 698.345 }, { "epoch": 1.6004548900682334, "eval_loss": 0.39059677720069885, "eval_runtime": 52.2929, "eval_samples_per_second": 16.809, "eval_steps_per_second": 8.414, "num_input_tokens_seen": 2989272, "step": 1584 }, { "epoch": 1.60146575688653, "grad_norm": 1.6437644958496094, "learning_rate": 4.010126582278482e-06, "loss": 0.05386246368288994, "num_input_tokens_seen": 2991142, "step": 1585, "train_runtime": 4335.0405, "train_tokens_per_second": 689.992 }, { "epoch": 1.602476623704827, "grad_norm": 1.8074007034301758, "learning_rate": 4.000000000000001e-06, "loss": 0.0719929188489914, "num_input_tokens_seen": 2992704, "step": 1586, "train_runtime": 4337.1586, "train_tokens_per_second": 690.015 }, { "epoch": 1.6034874905231236, "grad_norm": 1.7193204164505005, "learning_rate": 3.989873417721519e-06, "loss": 0.069422647356987, "num_input_tokens_seen": 2994422, "step": 1587, "train_runtime": 4339.3055, "train_tokens_per_second": 690.069 }, { "epoch": 1.6044983573414204, "grad_norm": 2.030726909637451, "learning_rate": 3.979746835443039e-06, "loss": 0.09575729072093964, "num_input_tokens_seen": 2996456, "step": 1588, "train_runtime": 4341.5585, "train_tokens_per_second": 690.18 }, { "epoch": 1.605509224159717, "grad_norm": 1.33951735496521, "learning_rate": 3.969620253164557e-06, "loss": 0.05319521203637123, "num_input_tokens_seen": 2998580, "step": 1589, "train_runtime": 4343.8351, "train_tokens_per_second": 690.307 }, { "epoch": 1.6065200909780137, "grad_norm": 1.704698920249939, "learning_rate": 3.959493670886076e-06, "loss": 0.06892026215791702, "num_input_tokens_seen": 3000296, "step": 1590, "train_runtime": 4346.0234, "train_tokens_per_second": 690.354 }, { "epoch": 1.6075309577963104, "grad_norm": 1.8045384883880615, "learning_rate": 3.949367088607595e-06, "loss": 0.07704678177833557, "num_input_tokens_seen": 3002560, "step": 1591, "train_runtime": 4354.8159, "train_tokens_per_second": 689.48 }, { "epoch": 1.608541824614607, "grad_norm": 1.6605801582336426, "learning_rate": 3.939240506329114e-06, "loss": 0.059775568544864655, "num_input_tokens_seen": 3004104, "step": 1592, "train_runtime": 4356.9849, "train_tokens_per_second": 689.491 }, { "epoch": 1.6095526914329037, "grad_norm": 1.8942264318466187, "learning_rate": 3.929113924050633e-06, "loss": 0.05962919443845749, "num_input_tokens_seen": 3005420, "step": 1593, "train_runtime": 4359.0408, "train_tokens_per_second": 689.468 }, { "epoch": 1.6105635582512003, "grad_norm": 2.2421839237213135, "learning_rate": 3.9189873417721525e-06, "loss": 0.11422710865736008, "num_input_tokens_seen": 3006926, "step": 1594, "train_runtime": 4361.1646, "train_tokens_per_second": 689.478 }, { "epoch": 1.611574425069497, "grad_norm": 1.8324493169784546, "learning_rate": 3.908860759493672e-06, "loss": 0.06773149222135544, "num_input_tokens_seen": 3008578, "step": 1595, "train_runtime": 4363.313, "train_tokens_per_second": 689.517 }, { "epoch": 1.6125852918877936, "grad_norm": 1.7596731185913086, "learning_rate": 3.898734177215191e-06, "loss": 0.08236124366521835, "num_input_tokens_seen": 3010530, "step": 1596, "train_runtime": 4365.5348, "train_tokens_per_second": 689.613 }, { "epoch": 1.6135961587060905, "grad_norm": 1.3826698064804077, "learning_rate": 3.888607594936709e-06, "loss": 0.06851591914892197, "num_input_tokens_seen": 3012808, "step": 1597, "train_runtime": 4367.8733, "train_tokens_per_second": 689.765 }, { "epoch": 1.6146070255243872, "grad_norm": 1.873353362083435, "learning_rate": 3.878481012658228e-06, "loss": 0.09259966760873795, "num_input_tokens_seen": 3014468, "step": 1598, "train_runtime": 4369.9937, "train_tokens_per_second": 689.811 }, { "epoch": 1.6156178923426838, "grad_norm": 1.746298909187317, "learning_rate": 3.868354430379747e-06, "loss": 0.06972785294055939, "num_input_tokens_seen": 3015760, "step": 1599, "train_runtime": 4372.0915, "train_tokens_per_second": 689.775 }, { "epoch": 1.6166287591609807, "grad_norm": 1.7015008926391602, "learning_rate": 3.858227848101266e-06, "loss": 0.06295757740736008, "num_input_tokens_seen": 3017286, "step": 1600, "train_runtime": 4374.2064, "train_tokens_per_second": 689.79 }, { "epoch": 1.6176396259792774, "grad_norm": 2.12400221824646, "learning_rate": 3.848101265822785e-06, "loss": 0.10723674297332764, "num_input_tokens_seen": 3019240, "step": 1601, "train_runtime": 4376.504, "train_tokens_per_second": 689.875 }, { "epoch": 1.618650492797574, "grad_norm": 1.5593434572219849, "learning_rate": 3.837974683544304e-06, "loss": 0.07614826411008835, "num_input_tokens_seen": 3021418, "step": 1602, "train_runtime": 4378.8848, "train_tokens_per_second": 689.997 }, { "epoch": 1.6196613596158707, "grad_norm": 1.7512574195861816, "learning_rate": 3.827848101265823e-06, "loss": 0.06531091034412384, "num_input_tokens_seen": 3023596, "step": 1603, "train_runtime": 4381.2168, "train_tokens_per_second": 690.127 }, { "epoch": 1.6206722264341673, "grad_norm": 1.5757083892822266, "learning_rate": 3.8177215189873425e-06, "loss": 0.06421954929828644, "num_input_tokens_seen": 3025522, "step": 1604, "train_runtime": 4383.5067, "train_tokens_per_second": 690.206 }, { "epoch": 1.621683093252464, "grad_norm": 1.5954736471176147, "learning_rate": 3.807594936708861e-06, "loss": 0.06996570527553558, "num_input_tokens_seen": 3027840, "step": 1605, "train_runtime": 4385.8104, "train_tokens_per_second": 690.372 }, { "epoch": 1.6226939600707606, "grad_norm": 1.5947481393814087, "learning_rate": 3.7974683544303802e-06, "loss": 0.07503378391265869, "num_input_tokens_seen": 3029608, "step": 1606, "train_runtime": 4387.99, "train_tokens_per_second": 690.432 }, { "epoch": 1.6237048268890573, "grad_norm": 1.5519132614135742, "learning_rate": 3.787341772151899e-06, "loss": 0.05764038860797882, "num_input_tokens_seen": 3031396, "step": 1607, "train_runtime": 4390.2205, "train_tokens_per_second": 690.488 }, { "epoch": 1.624715693707354, "grad_norm": 1.7704308032989502, "learning_rate": 3.7772151898734184e-06, "loss": 0.07108024507761002, "num_input_tokens_seen": 3033048, "step": 1608, "train_runtime": 4392.4485, "train_tokens_per_second": 690.514 }, { "epoch": 1.6257265605256508, "grad_norm": 1.584835410118103, "learning_rate": 3.767088607594937e-06, "loss": 0.07015027105808258, "num_input_tokens_seen": 3035034, "step": 1609, "train_runtime": 4394.7266, "train_tokens_per_second": 690.608 }, { "epoch": 1.6267374273439474, "grad_norm": 1.7231712341308594, "learning_rate": 3.756962025316456e-06, "loss": 0.07047292590141296, "num_input_tokens_seen": 3036868, "step": 1610, "train_runtime": 4396.9995, "train_tokens_per_second": 690.668 }, { "epoch": 1.627748294162244, "grad_norm": 1.724179744720459, "learning_rate": 3.746835443037975e-06, "loss": 0.07304114103317261, "num_input_tokens_seen": 3038720, "step": 1611, "train_runtime": 4399.2715, "train_tokens_per_second": 690.733 }, { "epoch": 1.628759160980541, "grad_norm": 2.4093263149261475, "learning_rate": 3.7367088607594943e-06, "loss": 0.09261861443519592, "num_input_tokens_seen": 3040610, "step": 1612, "train_runtime": 4401.5036, "train_tokens_per_second": 690.812 }, { "epoch": 1.6297700277988376, "grad_norm": 1.445542573928833, "learning_rate": 3.726582278481013e-06, "loss": 0.057139504700899124, "num_input_tokens_seen": 3042618, "step": 1613, "train_runtime": 4403.7229, "train_tokens_per_second": 690.919 }, { "epoch": 1.6307808946171343, "grad_norm": 1.726773738861084, "learning_rate": 3.716455696202532e-06, "loss": 0.07488808780908585, "num_input_tokens_seen": 3044814, "step": 1614, "train_runtime": 4406.0114, "train_tokens_per_second": 691.059 }, { "epoch": 1.631791761435431, "grad_norm": 2.161237955093384, "learning_rate": 3.7063291139240507e-06, "loss": 0.07743383944034576, "num_input_tokens_seen": 3046482, "step": 1615, "train_runtime": 4408.1552, "train_tokens_per_second": 691.101 }, { "epoch": 1.6328026282537276, "grad_norm": 1.8333536386489868, "learning_rate": 3.6962025316455702e-06, "loss": 0.07610010355710983, "num_input_tokens_seen": 3048240, "step": 1616, "train_runtime": 4410.3365, "train_tokens_per_second": 691.158 }, { "epoch": 1.6338134950720242, "grad_norm": 1.3004517555236816, "learning_rate": 3.686075949367089e-06, "loss": 0.0713384598493576, "num_input_tokens_seen": 3050738, "step": 1617, "train_runtime": 4412.6996, "train_tokens_per_second": 691.354 }, { "epoch": 1.6348243618903209, "grad_norm": 1.4625111818313599, "learning_rate": 3.675949367088608e-06, "loss": 0.06168478727340698, "num_input_tokens_seen": 3052798, "step": 1618, "train_runtime": 4414.9383, "train_tokens_per_second": 691.47 }, { "epoch": 1.6358352287086175, "grad_norm": 1.6302261352539062, "learning_rate": 3.665822784810127e-06, "loss": 0.05223661661148071, "num_input_tokens_seen": 3054350, "step": 1619, "train_runtime": 4417.153, "train_tokens_per_second": 691.475 }, { "epoch": 1.6368460955269142, "grad_norm": 1.4504172801971436, "learning_rate": 3.655696202531646e-06, "loss": 0.05241897702217102, "num_input_tokens_seen": 3056636, "step": 1620, "train_runtime": 4419.4538, "train_tokens_per_second": 691.632 }, { "epoch": 1.637856962345211, "grad_norm": 1.685484766960144, "learning_rate": 3.645569620253165e-06, "loss": 0.06576771289110184, "num_input_tokens_seen": 3058180, "step": 1621, "train_runtime": 4428.1924, "train_tokens_per_second": 690.616 }, { "epoch": 1.6388678291635077, "grad_norm": 1.4740047454833984, "learning_rate": 3.6354430379746835e-06, "loss": 0.05852600559592247, "num_input_tokens_seen": 3059906, "step": 1622, "train_runtime": 4430.4169, "train_tokens_per_second": 690.659 }, { "epoch": 1.6398786959818044, "grad_norm": 1.201348900794983, "learning_rate": 3.625316455696203e-06, "loss": 0.042996060103178024, "num_input_tokens_seen": 3062134, "step": 1623, "train_runtime": 4432.7694, "train_tokens_per_second": 690.795 }, { "epoch": 1.6408895628001012, "grad_norm": 1.4870134592056274, "learning_rate": 3.6151898734177216e-06, "loss": 0.059534698724746704, "num_input_tokens_seen": 3063896, "step": 1624, "train_runtime": 4435.0148, "train_tokens_per_second": 690.842 }, { "epoch": 1.6419004296183979, "grad_norm": 1.9917396306991577, "learning_rate": 3.6050632911392407e-06, "loss": 0.08953356742858887, "num_input_tokens_seen": 3065622, "step": 1625, "train_runtime": 4437.2786, "train_tokens_per_second": 690.879 }, { "epoch": 1.6429112964366945, "grad_norm": 1.9785447120666504, "learning_rate": 3.5949367088607594e-06, "loss": 0.06318928301334381, "num_input_tokens_seen": 3067090, "step": 1626, "train_runtime": 4439.3804, "train_tokens_per_second": 690.882 }, { "epoch": 1.6439221632549912, "grad_norm": 1.4886456727981567, "learning_rate": 3.584810126582279e-06, "loss": 0.06752782315015793, "num_input_tokens_seen": 3069452, "step": 1627, "train_runtime": 4441.6769, "train_tokens_per_second": 691.057 }, { "epoch": 1.6449330300732878, "grad_norm": 1.9452000856399536, "learning_rate": 3.5746835443037975e-06, "loss": 0.06755784898996353, "num_input_tokens_seen": 3071050, "step": 1628, "train_runtime": 4443.8489, "train_tokens_per_second": 691.079 }, { "epoch": 1.6459438968915845, "grad_norm": 2.1163554191589355, "learning_rate": 3.5645569620253166e-06, "loss": 0.08850133419036865, "num_input_tokens_seen": 3072606, "step": 1629, "train_runtime": 4445.9685, "train_tokens_per_second": 691.099 }, { "epoch": 1.6469547637098811, "grad_norm": 2.0030453205108643, "learning_rate": 3.5544303797468353e-06, "loss": 0.06304336339235306, "num_input_tokens_seen": 3074244, "step": 1630, "train_runtime": 4448.1109, "train_tokens_per_second": 691.135 }, { "epoch": 1.6479656305281778, "grad_norm": 1.8989089727401733, "learning_rate": 3.544303797468355e-06, "loss": 0.08454688638448715, "num_input_tokens_seen": 3075800, "step": 1631, "train_runtime": 4450.3088, "train_tokens_per_second": 691.143 }, { "epoch": 1.6489764973464744, "grad_norm": 1.5028738975524902, "learning_rate": 3.5341772151898735e-06, "loss": 0.04924144223332405, "num_input_tokens_seen": 3077748, "step": 1632, "train_runtime": 4452.5601, "train_tokens_per_second": 691.231 }, { "epoch": 1.6499873641647713, "grad_norm": 1.6033862829208374, "learning_rate": 3.5240506329113925e-06, "loss": 0.06796707212924957, "num_input_tokens_seen": 3079672, "step": 1633, "train_runtime": 4454.7921, "train_tokens_per_second": 691.317 }, { "epoch": 1.650998230983068, "grad_norm": 1.9249001741409302, "learning_rate": 3.5139240506329116e-06, "loss": 0.08959044516086578, "num_input_tokens_seen": 3081838, "step": 1634, "train_runtime": 4457.0619, "train_tokens_per_second": 691.451 }, { "epoch": 1.6520090978013646, "grad_norm": 2.064527750015259, "learning_rate": 3.5037974683544307e-06, "loss": 0.09661225974559784, "num_input_tokens_seen": 3084034, "step": 1635, "train_runtime": 4459.3265, "train_tokens_per_second": 691.592 }, { "epoch": 1.6530199646196615, "grad_norm": 1.7836114168167114, "learning_rate": 3.4936708860759494e-06, "loss": 0.08342694491147995, "num_input_tokens_seen": 3085876, "step": 1636, "train_runtime": 4461.5649, "train_tokens_per_second": 691.658 }, { "epoch": 1.6540308314379581, "grad_norm": 1.934723138809204, "learning_rate": 3.4835443037974685e-06, "loss": 0.09056703746318817, "num_input_tokens_seen": 3087968, "step": 1637, "train_runtime": 4463.8005, "train_tokens_per_second": 691.78 }, { "epoch": 1.6550416982562548, "grad_norm": 1.387448787689209, "learning_rate": 3.4734177215189875e-06, "loss": 0.0635710060596466, "num_input_tokens_seen": 3089862, "step": 1638, "train_runtime": 4466.0482, "train_tokens_per_second": 691.856 }, { "epoch": 1.6560525650745515, "grad_norm": 1.956931233406067, "learning_rate": 3.4632911392405066e-06, "loss": 0.08530846238136292, "num_input_tokens_seen": 3091530, "step": 1639, "train_runtime": 4468.1598, "train_tokens_per_second": 691.902 }, { "epoch": 1.657063431892848, "grad_norm": 1.7151684761047363, "learning_rate": 3.4531645569620253e-06, "loss": 0.06122661754488945, "num_input_tokens_seen": 3093300, "step": 1640, "train_runtime": 4470.3079, "train_tokens_per_second": 691.966 }, { "epoch": 1.6580742987111448, "grad_norm": 1.5635318756103516, "learning_rate": 3.443037974683545e-06, "loss": 0.08052826672792435, "num_input_tokens_seen": 3095484, "step": 1641, "train_runtime": 4472.5779, "train_tokens_per_second": 692.103 }, { "epoch": 1.6590851655294414, "grad_norm": 1.4197895526885986, "learning_rate": 3.4329113924050635e-06, "loss": 0.05699260160326958, "num_input_tokens_seen": 3097440, "step": 1642, "train_runtime": 4474.7916, "train_tokens_per_second": 692.198 }, { "epoch": 1.660096032347738, "grad_norm": 1.5599781274795532, "learning_rate": 3.4227848101265825e-06, "loss": 0.062324777245521545, "num_input_tokens_seen": 3099356, "step": 1643, "train_runtime": 4476.9946, "train_tokens_per_second": 692.285 }, { "epoch": 1.6611068991660347, "grad_norm": 1.7807284593582153, "learning_rate": 3.412658227848101e-06, "loss": 0.08422867953777313, "num_input_tokens_seen": 3101190, "step": 1644, "train_runtime": 4479.1684, "train_tokens_per_second": 692.358 }, { "epoch": 1.6621177659843316, "grad_norm": 1.3435440063476562, "learning_rate": 3.4025316455696207e-06, "loss": 0.06103749945759773, "num_input_tokens_seen": 3103408, "step": 1645, "train_runtime": 4481.4558, "train_tokens_per_second": 692.5 }, { "epoch": 1.6631286328026282, "grad_norm": 1.5479793548583984, "learning_rate": 3.3924050632911394e-06, "loss": 0.0730970948934555, "num_input_tokens_seen": 3105644, "step": 1646, "train_runtime": 4483.7199, "train_tokens_per_second": 692.649 }, { "epoch": 1.664139499620925, "grad_norm": 1.6312743425369263, "learning_rate": 3.3822784810126585e-06, "loss": 0.06483624875545502, "num_input_tokens_seen": 3107626, "step": 1647, "train_runtime": 4485.9265, "train_tokens_per_second": 692.75 }, { "epoch": 1.6651503664392218, "grad_norm": 1.7495090961456299, "learning_rate": 3.372151898734177e-06, "loss": 0.07979393005371094, "num_input_tokens_seen": 3109686, "step": 1648, "train_runtime": 4488.168, "train_tokens_per_second": 692.863 }, { "epoch": 1.6661612332575184, "grad_norm": 1.8143082857131958, "learning_rate": 3.3620253164556966e-06, "loss": 0.08356431871652603, "num_input_tokens_seen": 3111442, "step": 1649, "train_runtime": 4490.3453, "train_tokens_per_second": 692.918 }, { "epoch": 1.667172100075815, "grad_norm": 1.535099744796753, "learning_rate": 3.3518987341772153e-06, "loss": 0.06810334324836731, "num_input_tokens_seen": 3113542, "step": 1650, "train_runtime": 4492.6074, "train_tokens_per_second": 693.037 }, { "epoch": 1.6681829668941117, "grad_norm": 1.5244773626327515, "learning_rate": 3.3417721518987344e-06, "loss": 0.06630674004554749, "num_input_tokens_seen": 3115364, "step": 1651, "train_runtime": 4501.4263, "train_tokens_per_second": 692.084 }, { "epoch": 1.6691938337124084, "grad_norm": 1.589932918548584, "learning_rate": 3.331645569620253e-06, "loss": 0.06367498636245728, "num_input_tokens_seen": 3117738, "step": 1652, "train_runtime": 4503.7675, "train_tokens_per_second": 692.251 }, { "epoch": 1.670204700530705, "grad_norm": 1.299252986907959, "learning_rate": 3.3215189873417725e-06, "loss": 0.05266419053077698, "num_input_tokens_seen": 3119876, "step": 1653, "train_runtime": 4506.0313, "train_tokens_per_second": 692.378 }, { "epoch": 1.6712155673490017, "grad_norm": 1.5991474390029907, "learning_rate": 3.311392405063291e-06, "loss": 0.059744007885456085, "num_input_tokens_seen": 3121986, "step": 1654, "train_runtime": 4508.2753, "train_tokens_per_second": 692.501 }, { "epoch": 1.6722264341672983, "grad_norm": 1.7557860612869263, "learning_rate": 3.3012658227848103e-06, "loss": 0.09023163467645645, "num_input_tokens_seen": 3123822, "step": 1655, "train_runtime": 4510.4883, "train_tokens_per_second": 692.568 }, { "epoch": 1.6732373009855952, "grad_norm": 1.4985078573226929, "learning_rate": 3.2911392405063294e-06, "loss": 0.049209535121917725, "num_input_tokens_seen": 3125864, "step": 1656, "train_runtime": 4512.7028, "train_tokens_per_second": 692.681 }, { "epoch": 1.6742481678038919, "grad_norm": 1.7229870557785034, "learning_rate": 3.2810126582278485e-06, "loss": 0.04763895273208618, "num_input_tokens_seen": 3127242, "step": 1657, "train_runtime": 4514.7677, "train_tokens_per_second": 692.67 }, { "epoch": 1.6752590346221885, "grad_norm": 1.9979041814804077, "learning_rate": 3.270886075949367e-06, "loss": 0.07513368129730225, "num_input_tokens_seen": 3128716, "step": 1658, "train_runtime": 4516.8916, "train_tokens_per_second": 692.67 }, { "epoch": 1.6762699014404854, "grad_norm": 2.3191444873809814, "learning_rate": 3.260759493670886e-06, "loss": 0.0995558649301529, "num_input_tokens_seen": 3130486, "step": 1659, "train_runtime": 4519.0803, "train_tokens_per_second": 692.726 }, { "epoch": 1.677280768258782, "grad_norm": 1.8650801181793213, "learning_rate": 3.2506329113924053e-06, "loss": 0.05107400566339493, "num_input_tokens_seen": 3132030, "step": 1660, "train_runtime": 4521.2069, "train_tokens_per_second": 692.742 }, { "epoch": 1.6782916350770787, "grad_norm": 1.7372885942459106, "learning_rate": 3.2405063291139244e-06, "loss": 0.06642575562000275, "num_input_tokens_seen": 3133638, "step": 1661, "train_runtime": 4523.358, "train_tokens_per_second": 692.768 }, { "epoch": 1.6793025018953753, "grad_norm": 2.25758957862854, "learning_rate": 3.230379746835443e-06, "loss": 0.0813010036945343, "num_input_tokens_seen": 3135314, "step": 1662, "train_runtime": 4525.5291, "train_tokens_per_second": 692.806 }, { "epoch": 1.680313368713672, "grad_norm": 1.727011799812317, "learning_rate": 3.2202531645569625e-06, "loss": 0.08289699256420135, "num_input_tokens_seen": 3137340, "step": 1663, "train_runtime": 4527.7888, "train_tokens_per_second": 692.908 }, { "epoch": 1.6813242355319686, "grad_norm": 1.6658594608306885, "learning_rate": 3.210126582278481e-06, "loss": 0.0790754035115242, "num_input_tokens_seen": 3139916, "step": 1664, "train_runtime": 4530.1336, "train_tokens_per_second": 693.118 }, { "epoch": 1.6823351023502653, "grad_norm": 1.7198365926742554, "learning_rate": 3.2000000000000003e-06, "loss": 0.07097277790307999, "num_input_tokens_seen": 3141946, "step": 1665, "train_runtime": 4532.3675, "train_tokens_per_second": 693.224 }, { "epoch": 1.683345969168562, "grad_norm": 1.7861515283584595, "learning_rate": 3.189873417721519e-06, "loss": 0.06614462286233902, "num_input_tokens_seen": 3143520, "step": 1666, "train_runtime": 4534.4948, "train_tokens_per_second": 693.246 }, { "epoch": 1.6843568359868586, "grad_norm": 1.7967497110366821, "learning_rate": 3.1797468354430384e-06, "loss": 0.05091815069317818, "num_input_tokens_seen": 3145024, "step": 1667, "train_runtime": 4536.6193, "train_tokens_per_second": 693.253 }, { "epoch": 1.6853677028051555, "grad_norm": 2.064927101135254, "learning_rate": 3.169620253164557e-06, "loss": 0.09674140065908432, "num_input_tokens_seen": 3146530, "step": 1668, "train_runtime": 4538.7116, "train_tokens_per_second": 693.265 }, { "epoch": 1.6863785696234521, "grad_norm": 1.603570818901062, "learning_rate": 3.159493670886076e-06, "loss": 0.06721428036689758, "num_input_tokens_seen": 3148500, "step": 1669, "train_runtime": 4540.9123, "train_tokens_per_second": 693.363 }, { "epoch": 1.6873894364417488, "grad_norm": 1.5717071294784546, "learning_rate": 3.149367088607595e-06, "loss": 0.07083986699581146, "num_input_tokens_seen": 3150822, "step": 1670, "train_runtime": 4543.2038, "train_tokens_per_second": 693.524 }, { "epoch": 1.6884003032600456, "grad_norm": 2.09252667427063, "learning_rate": 3.1392405063291144e-06, "loss": 0.07435572892427444, "num_input_tokens_seen": 3152442, "step": 1671, "train_runtime": 4545.3557, "train_tokens_per_second": 693.552 }, { "epoch": 1.6894111700783423, "grad_norm": 1.8658822774887085, "learning_rate": 3.129113924050633e-06, "loss": 0.08821466565132141, "num_input_tokens_seen": 3154712, "step": 1672, "train_runtime": 4547.6472, "train_tokens_per_second": 693.702 }, { "epoch": 1.690422036896639, "grad_norm": 2.1665990352630615, "learning_rate": 3.118987341772152e-06, "loss": 0.057355549186468124, "num_input_tokens_seen": 3156586, "step": 1673, "train_runtime": 4549.8184, "train_tokens_per_second": 693.783 }, { "epoch": 1.6914329037149356, "grad_norm": 1.779031753540039, "learning_rate": 3.1088607594936708e-06, "loss": 0.08638505637645721, "num_input_tokens_seen": 3158526, "step": 1674, "train_runtime": 4552.0236, "train_tokens_per_second": 693.873 }, { "epoch": 1.6924437705332323, "grad_norm": 1.9613770246505737, "learning_rate": 3.0987341772151903e-06, "loss": 0.08512400090694427, "num_input_tokens_seen": 3160372, "step": 1675, "train_runtime": 4554.2366, "train_tokens_per_second": 693.941 }, { "epoch": 1.693454637351529, "grad_norm": 1.8615342378616333, "learning_rate": 3.088607594936709e-06, "loss": 0.07008308172225952, "num_input_tokens_seen": 3162204, "step": 1676, "train_runtime": 4556.4188, "train_tokens_per_second": 694.011 }, { "epoch": 1.6944655041698256, "grad_norm": 1.9587600231170654, "learning_rate": 3.078481012658228e-06, "loss": 0.07925236970186234, "num_input_tokens_seen": 3164144, "step": 1677, "train_runtime": 4558.6777, "train_tokens_per_second": 694.092 }, { "epoch": 1.6954763709881222, "grad_norm": 2.0435128211975098, "learning_rate": 3.068354430379747e-06, "loss": 0.05458016321063042, "num_input_tokens_seen": 3165916, "step": 1678, "train_runtime": 4560.8526, "train_tokens_per_second": 694.15 }, { "epoch": 1.6964872378064189, "grad_norm": 1.8596713542938232, "learning_rate": 3.058227848101266e-06, "loss": 0.0700383260846138, "num_input_tokens_seen": 3167602, "step": 1679, "train_runtime": 4562.9963, "train_tokens_per_second": 694.193 }, { "epoch": 1.6974981046247157, "grad_norm": 1.6042331457138062, "learning_rate": 3.048101265822785e-06, "loss": 0.07046147435903549, "num_input_tokens_seen": 3169826, "step": 1680, "train_runtime": 4565.2614, "train_tokens_per_second": 694.336 }, { "epoch": 1.6985089714430124, "grad_norm": 1.3264026641845703, "learning_rate": 3.037974683544304e-06, "loss": 0.043173111975193024, "num_input_tokens_seen": 3171628, "step": 1681, "train_runtime": 4574.0294, "train_tokens_per_second": 693.399 }, { "epoch": 1.699519838261309, "grad_norm": 1.794228434562683, "learning_rate": 3.027848101265823e-06, "loss": 0.07822631299495697, "num_input_tokens_seen": 3173482, "step": 1682, "train_runtime": 4576.2654, "train_tokens_per_second": 693.465 }, { "epoch": 1.700530705079606, "grad_norm": 1.9968194961547852, "learning_rate": 3.017721518987342e-06, "loss": 0.08686088770627975, "num_input_tokens_seen": 3175088, "step": 1683, "train_runtime": 4578.4004, "train_tokens_per_second": 693.493 }, { "epoch": 1.7015415718979026, "grad_norm": 1.5558940172195435, "learning_rate": 3.0075949367088608e-06, "loss": 0.07532624900341034, "num_input_tokens_seen": 3177244, "step": 1684, "train_runtime": 4580.6711, "train_tokens_per_second": 693.62 }, { "epoch": 1.7025524387161992, "grad_norm": 1.4439938068389893, "learning_rate": 2.9974683544303803e-06, "loss": 0.051425449550151825, "num_input_tokens_seen": 3178878, "step": 1685, "train_runtime": 4582.8741, "train_tokens_per_second": 693.643 }, { "epoch": 1.7035633055344959, "grad_norm": 1.6569932699203491, "learning_rate": 2.987341772151899e-06, "loss": 0.07870493829250336, "num_input_tokens_seen": 3181054, "step": 1686, "train_runtime": 4585.1513, "train_tokens_per_second": 693.773 }, { "epoch": 1.7045741723527925, "grad_norm": 1.6693202257156372, "learning_rate": 2.977215189873418e-06, "loss": 0.08688843250274658, "num_input_tokens_seen": 3182894, "step": 1687, "train_runtime": 4587.3665, "train_tokens_per_second": 693.839 }, { "epoch": 1.7055850391710892, "grad_norm": 1.738955020904541, "learning_rate": 2.9670886075949367e-06, "loss": 0.07897424697875977, "num_input_tokens_seen": 3185000, "step": 1688, "train_runtime": 4589.6253, "train_tokens_per_second": 693.956 }, { "epoch": 1.7065959059893858, "grad_norm": 1.9710723161697388, "learning_rate": 2.956962025316456e-06, "loss": 0.06945981830358505, "num_input_tokens_seen": 3186718, "step": 1689, "train_runtime": 4591.8036, "train_tokens_per_second": 694.001 }, { "epoch": 1.7076067728076825, "grad_norm": 2.2010416984558105, "learning_rate": 2.946835443037975e-06, "loss": 0.077201247215271, "num_input_tokens_seen": 3188424, "step": 1690, "train_runtime": 4593.9774, "train_tokens_per_second": 694.044 }, { "epoch": 1.7086176396259791, "grad_norm": 1.2872505187988281, "learning_rate": 2.936708860759494e-06, "loss": 0.050885725766420364, "num_input_tokens_seen": 3190914, "step": 1691, "train_runtime": 4596.3587, "train_tokens_per_second": 694.226 }, { "epoch": 1.709628506444276, "grad_norm": 1.5386303663253784, "learning_rate": 2.9265822784810126e-06, "loss": 0.06214267387986183, "num_input_tokens_seen": 3192874, "step": 1692, "train_runtime": 4598.6118, "train_tokens_per_second": 694.313 }, { "epoch": 1.7106393732625726, "grad_norm": 1.4623299837112427, "learning_rate": 2.916455696202532e-06, "loss": 0.06471185386180878, "num_input_tokens_seen": 3194340, "step": 1693, "train_runtime": 4600.727, "train_tokens_per_second": 694.312 }, { "epoch": 1.7116502400808693, "grad_norm": 1.3713880777359009, "learning_rate": 2.9063291139240508e-06, "loss": 0.052813608199357986, "num_input_tokens_seen": 3196300, "step": 1694, "train_runtime": 4602.9378, "train_tokens_per_second": 694.404 }, { "epoch": 1.7126611068991662, "grad_norm": 1.6384897232055664, "learning_rate": 2.89620253164557e-06, "loss": 0.07733742892742157, "num_input_tokens_seen": 3198282, "step": 1695, "train_runtime": 4605.1528, "train_tokens_per_second": 694.501 }, { "epoch": 1.7136719737174628, "grad_norm": 2.3512582778930664, "learning_rate": 2.8860759493670885e-06, "loss": 0.09398391842842102, "num_input_tokens_seen": 3199958, "step": 1696, "train_runtime": 4607.2801, "train_tokens_per_second": 694.544 }, { "epoch": 1.7146828405357595, "grad_norm": 1.9150465726852417, "learning_rate": 2.875949367088608e-06, "loss": 0.0935385674238205, "num_input_tokens_seen": 3201796, "step": 1697, "train_runtime": 4609.4598, "train_tokens_per_second": 694.614 }, { "epoch": 1.7156937073540561, "grad_norm": 1.784387230873108, "learning_rate": 2.8658227848101267e-06, "loss": 0.07881203293800354, "num_input_tokens_seen": 3203628, "step": 1698, "train_runtime": 4611.7597, "train_tokens_per_second": 694.665 }, { "epoch": 1.7167045741723528, "grad_norm": 1.836754322052002, "learning_rate": 2.8556962025316458e-06, "loss": 0.08432598412036896, "num_input_tokens_seen": 3205424, "step": 1699, "train_runtime": 4613.9619, "train_tokens_per_second": 694.723 }, { "epoch": 1.7177154409906494, "grad_norm": 1.6243864297866821, "learning_rate": 2.845569620253165e-06, "loss": 0.07003642618656158, "num_input_tokens_seen": 3207514, "step": 1700, "train_runtime": 4616.1911, "train_tokens_per_second": 694.84 }, { "epoch": 1.718726307808946, "grad_norm": 2.060173988342285, "learning_rate": 2.835443037974684e-06, "loss": 0.09881354123353958, "num_input_tokens_seen": 3209430, "step": 1701, "train_runtime": 4618.3895, "train_tokens_per_second": 694.924 }, { "epoch": 1.7197371746272427, "grad_norm": 1.5945155620574951, "learning_rate": 2.8253164556962026e-06, "loss": 0.06285209953784943, "num_input_tokens_seen": 3211230, "step": 1702, "train_runtime": 4620.5583, "train_tokens_per_second": 694.987 }, { "epoch": 1.7207480414455394, "grad_norm": 1.4761182069778442, "learning_rate": 2.8151898734177217e-06, "loss": 0.07465441524982452, "num_input_tokens_seen": 3213296, "step": 1703, "train_runtime": 4622.7663, "train_tokens_per_second": 695.102 }, { "epoch": 1.7217589082638363, "grad_norm": 1.878750205039978, "learning_rate": 2.8050632911392408e-06, "loss": 0.08725883066654205, "num_input_tokens_seen": 3215426, "step": 1704, "train_runtime": 4625.0287, "train_tokens_per_second": 695.223 }, { "epoch": 1.722769775082133, "grad_norm": 1.9042385816574097, "learning_rate": 2.79493670886076e-06, "loss": 0.07090901583433151, "num_input_tokens_seen": 3217030, "step": 1705, "train_runtime": 4627.15, "train_tokens_per_second": 695.251 }, { "epoch": 1.7237806419004296, "grad_norm": 1.5664784908294678, "learning_rate": 2.7848101265822785e-06, "loss": 0.06554043292999268, "num_input_tokens_seen": 3219282, "step": 1706, "train_runtime": 4629.4175, "train_tokens_per_second": 695.397 }, { "epoch": 1.7247915087187264, "grad_norm": 2.254207134246826, "learning_rate": 2.774683544303798e-06, "loss": 0.06345508992671967, "num_input_tokens_seen": 3221324, "step": 1707, "train_runtime": 4631.7041, "train_tokens_per_second": 695.494 }, { "epoch": 1.725802375537023, "grad_norm": 1.6412838697433472, "learning_rate": 2.7645569620253167e-06, "loss": 0.05187619850039482, "num_input_tokens_seen": 3223002, "step": 1708, "train_runtime": 4633.8926, "train_tokens_per_second": 695.528 }, { "epoch": 1.7268132423553197, "grad_norm": 1.8688623905181885, "learning_rate": 2.7544303797468358e-06, "loss": 0.08315165340900421, "num_input_tokens_seen": 3224970, "step": 1709, "train_runtime": 4636.1099, "train_tokens_per_second": 695.62 }, { "epoch": 1.7278241091736164, "grad_norm": 1.593793511390686, "learning_rate": 2.7443037974683544e-06, "loss": 0.05407699942588806, "num_input_tokens_seen": 3226402, "step": 1710, "train_runtime": 4638.2018, "train_tokens_per_second": 695.615 }, { "epoch": 1.728834975991913, "grad_norm": 1.5109833478927612, "learning_rate": 2.734177215189874e-06, "loss": 0.05802329257130623, "num_input_tokens_seen": 3228294, "step": 1711, "train_runtime": 4646.8163, "train_tokens_per_second": 694.732 }, { "epoch": 1.7298458428102097, "grad_norm": 1.7301241159439087, "learning_rate": 2.7240506329113926e-06, "loss": 0.08108571171760559, "num_input_tokens_seen": 3230478, "step": 1712, "train_runtime": 4649.2404, "train_tokens_per_second": 694.84 }, { "epoch": 1.7308567096285064, "grad_norm": 1.6756778955459595, "learning_rate": 2.7139240506329117e-06, "loss": 0.060624442994594574, "num_input_tokens_seen": 3232430, "step": 1713, "train_runtime": 4651.4335, "train_tokens_per_second": 694.932 }, { "epoch": 1.731867576446803, "grad_norm": 1.9304794073104858, "learning_rate": 2.7037974683544303e-06, "loss": 0.09782436490058899, "num_input_tokens_seen": 3234332, "step": 1714, "train_runtime": 4653.6634, "train_tokens_per_second": 695.008 }, { "epoch": 1.7328784432650999, "grad_norm": 1.450645923614502, "learning_rate": 2.69367088607595e-06, "loss": 0.06790439039468765, "num_input_tokens_seen": 3236438, "step": 1715, "train_runtime": 4655.8586, "train_tokens_per_second": 695.132 }, { "epoch": 1.7338893100833965, "grad_norm": 1.8678185939788818, "learning_rate": 2.6835443037974685e-06, "loss": 0.061199259012937546, "num_input_tokens_seen": 3238184, "step": 1716, "train_runtime": 4658.0395, "train_tokens_per_second": 695.182 }, { "epoch": 1.7349001769016932, "grad_norm": 1.601326823234558, "learning_rate": 2.6734177215189876e-06, "loss": 0.052972547709941864, "num_input_tokens_seen": 3239792, "step": 1717, "train_runtime": 4660.2039, "train_tokens_per_second": 695.204 }, { "epoch": 1.73591104371999, "grad_norm": 1.6289334297180176, "learning_rate": 2.6632911392405062e-06, "loss": 0.07092973589897156, "num_input_tokens_seen": 3241846, "step": 1718, "train_runtime": 4662.4344, "train_tokens_per_second": 695.312 }, { "epoch": 1.7369219105382867, "grad_norm": 1.7682119607925415, "learning_rate": 2.6531645569620257e-06, "loss": 0.059664398431777954, "num_input_tokens_seen": 3243330, "step": 1719, "train_runtime": 4664.5205, "train_tokens_per_second": 695.319 }, { "epoch": 1.7379327773565834, "grad_norm": 1.7986894845962524, "learning_rate": 2.6430379746835444e-06, "loss": 0.05744286626577377, "num_input_tokens_seen": 3244718, "step": 1720, "train_runtime": 4666.6681, "train_tokens_per_second": 695.297 }, { "epoch": 1.73894364417488, "grad_norm": 1.805665373802185, "learning_rate": 2.6329113924050635e-06, "loss": 0.07611143589019775, "num_input_tokens_seen": 3246278, "step": 1721, "train_runtime": 4668.7493, "train_tokens_per_second": 695.321 }, { "epoch": 1.7399545109931767, "grad_norm": 2.240658760070801, "learning_rate": 2.6227848101265826e-06, "loss": 0.10359307378530502, "num_input_tokens_seen": 3248164, "step": 1722, "train_runtime": 4670.9573, "train_tokens_per_second": 695.396 }, { "epoch": 1.7409653778114733, "grad_norm": 1.5116084814071655, "learning_rate": 2.6126582278481017e-06, "loss": 0.06377623975276947, "num_input_tokens_seen": 3249786, "step": 1723, "train_runtime": 4673.1407, "train_tokens_per_second": 695.418 }, { "epoch": 1.74197624462977, "grad_norm": 1.8039082288742065, "learning_rate": 2.6025316455696203e-06, "loss": 0.06861607730388641, "num_input_tokens_seen": 3251246, "step": 1724, "train_runtime": 4675.2583, "train_tokens_per_second": 695.415 }, { "epoch": 1.7429871114480666, "grad_norm": 1.8272242546081543, "learning_rate": 2.5924050632911394e-06, "loss": 0.07011061906814575, "num_input_tokens_seen": 3252628, "step": 1725, "train_runtime": 4677.3422, "train_tokens_per_second": 695.401 }, { "epoch": 1.7439979782663633, "grad_norm": 1.44402015209198, "learning_rate": 2.5822784810126585e-06, "loss": 0.05340193957090378, "num_input_tokens_seen": 3254830, "step": 1726, "train_runtime": 4679.6964, "train_tokens_per_second": 695.522 }, { "epoch": 1.7450088450846601, "grad_norm": 1.5405900478363037, "learning_rate": 2.5721518987341776e-06, "loss": 0.06300503760576248, "num_input_tokens_seen": 3256576, "step": 1727, "train_runtime": 4681.8873, "train_tokens_per_second": 695.569 }, { "epoch": 1.7460197119029568, "grad_norm": 1.3495336771011353, "learning_rate": 2.5620253164556962e-06, "loss": 0.05233839899301529, "num_input_tokens_seen": 3258778, "step": 1728, "train_runtime": 4684.1474, "train_tokens_per_second": 695.704 }, { "epoch": 1.7470305787212534, "grad_norm": 1.8360068798065186, "learning_rate": 2.5518987341772157e-06, "loss": 0.07781828939914703, "num_input_tokens_seen": 3260680, "step": 1729, "train_runtime": 4686.3573, "train_tokens_per_second": 695.781 }, { "epoch": 1.7480414455395503, "grad_norm": 1.5859555006027222, "learning_rate": 2.5417721518987344e-06, "loss": 0.053702931851148605, "num_input_tokens_seen": 3262762, "step": 1730, "train_runtime": 4688.6701, "train_tokens_per_second": 695.882 }, { "epoch": 1.749052312357847, "grad_norm": 1.8131262063980103, "learning_rate": 2.5316455696202535e-06, "loss": 0.07879688590765, "num_input_tokens_seen": 3264636, "step": 1731, "train_runtime": 4690.8507, "train_tokens_per_second": 695.958 }, { "epoch": 1.7500631791761436, "grad_norm": 1.6486413478851318, "learning_rate": 2.521518987341772e-06, "loss": 0.06214247643947601, "num_input_tokens_seen": 3266290, "step": 1732, "train_runtime": 4693.1265, "train_tokens_per_second": 695.973 }, { "epoch": 1.7510740459944403, "grad_norm": 1.5044211149215698, "learning_rate": 2.5113924050632917e-06, "loss": 0.05706506222486496, "num_input_tokens_seen": 3268124, "step": 1733, "train_runtime": 4695.3399, "train_tokens_per_second": 696.036 }, { "epoch": 1.752084912812737, "grad_norm": 1.5830748081207275, "learning_rate": 2.5012658227848103e-06, "loss": 0.04672452062368393, "num_input_tokens_seen": 3269868, "step": 1734, "train_runtime": 4697.4884, "train_tokens_per_second": 696.089 }, { "epoch": 1.7530957796310336, "grad_norm": 1.5254648923873901, "learning_rate": 2.4911392405063294e-06, "loss": 0.04982186108827591, "num_input_tokens_seen": 3271730, "step": 1735, "train_runtime": 4699.6983, "train_tokens_per_second": 696.157 }, { "epoch": 1.7541066464493302, "grad_norm": 1.5697605609893799, "learning_rate": 2.481012658227848e-06, "loss": 0.058300647884607315, "num_input_tokens_seen": 3273410, "step": 1736, "train_runtime": 4701.8422, "train_tokens_per_second": 696.197 }, { "epoch": 1.7551175132676269, "grad_norm": 1.98488187789917, "learning_rate": 2.470886075949367e-06, "loss": 0.05246957391500473, "num_input_tokens_seen": 3274634, "step": 1737, "train_runtime": 4703.9654, "train_tokens_per_second": 696.143 }, { "epoch": 1.7561283800859235, "grad_norm": 1.7348859310150146, "learning_rate": 2.4607594936708862e-06, "loss": 0.06733670830726624, "num_input_tokens_seen": 3276240, "step": 1738, "train_runtime": 4706.1358, "train_tokens_per_second": 696.164 }, { "epoch": 1.7571392469042204, "grad_norm": 2.027111768722534, "learning_rate": 2.4506329113924053e-06, "loss": 0.08496301621198654, "num_input_tokens_seen": 3278222, "step": 1739, "train_runtime": 4708.3428, "train_tokens_per_second": 696.258 }, { "epoch": 1.758150113722517, "grad_norm": 1.8352309465408325, "learning_rate": 2.440506329113924e-06, "loss": 0.07484448701143265, "num_input_tokens_seen": 3279978, "step": 1740, "train_runtime": 4710.5559, "train_tokens_per_second": 696.304 }, { "epoch": 1.7591609805408137, "grad_norm": 1.4469865560531616, "learning_rate": 2.430379746835443e-06, "loss": 0.056457456201314926, "num_input_tokens_seen": 3282112, "step": 1741, "train_runtime": 4719.5913, "train_tokens_per_second": 695.423 }, { "epoch": 1.7601718473591106, "grad_norm": 1.6029822826385498, "learning_rate": 2.420253164556962e-06, "loss": 0.06924290210008621, "num_input_tokens_seen": 3284090, "step": 1742, "train_runtime": 4721.8856, "train_tokens_per_second": 695.504 }, { "epoch": 1.7611827141774072, "grad_norm": 1.4457576274871826, "learning_rate": 2.4101265822784812e-06, "loss": 0.05837494134902954, "num_input_tokens_seen": 3285966, "step": 1743, "train_runtime": 4724.1435, "train_tokens_per_second": 695.569 }, { "epoch": 1.762193580995704, "grad_norm": 1.6344085931777954, "learning_rate": 2.4000000000000003e-06, "loss": 0.07796967774629593, "num_input_tokens_seen": 3287836, "step": 1744, "train_runtime": 4726.4068, "train_tokens_per_second": 695.631 }, { "epoch": 1.7632044478140005, "grad_norm": 1.641486406326294, "learning_rate": 2.389873417721519e-06, "loss": 0.07068021595478058, "num_input_tokens_seen": 3289794, "step": 1745, "train_runtime": 4728.6524, "train_tokens_per_second": 695.715 }, { "epoch": 1.7642153146322972, "grad_norm": 1.5976099967956543, "learning_rate": 2.379746835443038e-06, "loss": 0.05329452455043793, "num_input_tokens_seen": 3291814, "step": 1746, "train_runtime": 4730.9261, "train_tokens_per_second": 695.808 }, { "epoch": 1.7652261814505938, "grad_norm": 1.4337458610534668, "learning_rate": 2.369620253164557e-06, "loss": 0.06847281754016876, "num_input_tokens_seen": 3293728, "step": 1747, "train_runtime": 4733.1414, "train_tokens_per_second": 695.886 }, { "epoch": 1.7662370482688905, "grad_norm": 1.8719747066497803, "learning_rate": 2.3594936708860762e-06, "loss": 0.07044140994548798, "num_input_tokens_seen": 3295612, "step": 1748, "train_runtime": 4735.3261, "train_tokens_per_second": 695.963 }, { "epoch": 1.7672479150871871, "grad_norm": 1.7119461297988892, "learning_rate": 2.349367088607595e-06, "loss": 0.08578880876302719, "num_input_tokens_seen": 3297530, "step": 1749, "train_runtime": 4737.5433, "train_tokens_per_second": 696.042 }, { "epoch": 1.7682587819054838, "grad_norm": 1.3110840320587158, "learning_rate": 2.339240506329114e-06, "loss": 0.051098622381687164, "num_input_tokens_seen": 3299672, "step": 1750, "train_runtime": 4739.8124, "train_tokens_per_second": 696.161 }, { "epoch": 1.7692696487237807, "grad_norm": 2.289757251739502, "learning_rate": 2.329113924050633e-06, "loss": 0.08187605440616608, "num_input_tokens_seen": 3301324, "step": 1751, "train_runtime": 4742.0031, "train_tokens_per_second": 696.188 }, { "epoch": 1.7702805155420773, "grad_norm": 1.4145066738128662, "learning_rate": 2.318987341772152e-06, "loss": 0.06139783933758736, "num_input_tokens_seen": 3303024, "step": 1752, "train_runtime": 4744.1954, "train_tokens_per_second": 696.224 }, { "epoch": 1.771291382360374, "grad_norm": 1.6471421718597412, "learning_rate": 2.308860759493671e-06, "loss": 0.05509607493877411, "num_input_tokens_seen": 3304390, "step": 1753, "train_runtime": 4746.2525, "train_tokens_per_second": 696.21 }, { "epoch": 1.7723022491786709, "grad_norm": 1.8534189462661743, "learning_rate": 2.29873417721519e-06, "loss": 0.07779213786125183, "num_input_tokens_seen": 3306056, "step": 1754, "train_runtime": 4748.4236, "train_tokens_per_second": 696.243 }, { "epoch": 1.7733131159969675, "grad_norm": 1.6584595441818237, "learning_rate": 2.288607594936709e-06, "loss": 0.05281475931406021, "num_input_tokens_seen": 3308636, "step": 1755, "train_runtime": 4750.8198, "train_tokens_per_second": 696.435 }, { "epoch": 1.7743239828152642, "grad_norm": 1.6571482419967651, "learning_rate": 2.278481012658228e-06, "loss": 0.056524455547332764, "num_input_tokens_seen": 3310440, "step": 1756, "train_runtime": 4753.0233, "train_tokens_per_second": 696.491 }, { "epoch": 1.7753348496335608, "grad_norm": 1.9512845277786255, "learning_rate": 2.268354430379747e-06, "loss": 0.06879110634326935, "num_input_tokens_seen": 3312156, "step": 1757, "train_runtime": 4755.2561, "train_tokens_per_second": 696.525 }, { "epoch": 1.7763457164518575, "grad_norm": 1.4111546277999878, "learning_rate": 2.258227848101266e-06, "loss": 0.04614604637026787, "num_input_tokens_seen": 3314202, "step": 1758, "train_runtime": 4757.5207, "train_tokens_per_second": 696.624 }, { "epoch": 1.7773565832701541, "grad_norm": 1.5941832065582275, "learning_rate": 2.248101265822785e-06, "loss": 0.0545719638466835, "num_input_tokens_seen": 3315796, "step": 1759, "train_runtime": 4759.6459, "train_tokens_per_second": 696.648 }, { "epoch": 1.7783674500884508, "grad_norm": 1.647290825843811, "learning_rate": 2.237974683544304e-06, "loss": 0.06566182523965836, "num_input_tokens_seen": 3317610, "step": 1760, "train_runtime": 4761.8744, "train_tokens_per_second": 696.703 }, { "epoch": 1.7793783169067474, "grad_norm": 1.487747311592102, "learning_rate": 2.227848101265823e-06, "loss": 0.07319916784763336, "num_input_tokens_seen": 3319370, "step": 1761, "train_runtime": 4764.1199, "train_tokens_per_second": 696.744 }, { "epoch": 1.780389183725044, "grad_norm": 1.6492506265640259, "learning_rate": 2.2177215189873417e-06, "loss": 0.06596957892179489, "num_input_tokens_seen": 3321328, "step": 1762, "train_runtime": 4766.368, "train_tokens_per_second": 696.826 }, { "epoch": 1.781400050543341, "grad_norm": 1.9240431785583496, "learning_rate": 2.207594936708861e-06, "loss": 0.0817854031920433, "num_input_tokens_seen": 3322902, "step": 1763, "train_runtime": 4768.4628, "train_tokens_per_second": 696.85 }, { "epoch": 1.7824109173616376, "grad_norm": 1.530824065208435, "learning_rate": 2.19746835443038e-06, "loss": 0.07161606103181839, "num_input_tokens_seen": 3324686, "step": 1764, "train_runtime": 4770.6171, "train_tokens_per_second": 696.909 }, { "epoch": 1.7834217841799342, "grad_norm": 1.5622555017471313, "learning_rate": 2.187341772151899e-06, "loss": 0.07548850774765015, "num_input_tokens_seen": 3327138, "step": 1765, "train_runtime": 4772.9491, "train_tokens_per_second": 697.082 }, { "epoch": 1.7844326509982311, "grad_norm": 1.4703495502471924, "learning_rate": 2.177215189873418e-06, "loss": 0.07107003033161163, "num_input_tokens_seen": 3329122, "step": 1766, "train_runtime": 4775.1946, "train_tokens_per_second": 697.17 }, { "epoch": 1.7854435178165278, "grad_norm": 1.4259532690048218, "learning_rate": 2.1670886075949367e-06, "loss": 0.05702789127826691, "num_input_tokens_seen": 3330766, "step": 1767, "train_runtime": 4777.391, "train_tokens_per_second": 697.194 }, { "epoch": 1.7864543846348244, "grad_norm": 1.676520586013794, "learning_rate": 2.156962025316456e-06, "loss": 0.06703896820545197, "num_input_tokens_seen": 3332672, "step": 1768, "train_runtime": 4779.572, "train_tokens_per_second": 697.274 }, { "epoch": 1.787465251453121, "grad_norm": 1.47948157787323, "learning_rate": 2.146835443037975e-06, "loss": 0.06247759610414505, "num_input_tokens_seen": 3334644, "step": 1769, "train_runtime": 4781.8088, "train_tokens_per_second": 697.36 }, { "epoch": 1.7884761182714177, "grad_norm": 1.456027865409851, "learning_rate": 2.136708860759494e-06, "loss": 0.05956772714853287, "num_input_tokens_seen": 3336452, "step": 1770, "train_runtime": 4783.9683, "train_tokens_per_second": 697.424 }, { "epoch": 1.7894869850897144, "grad_norm": 1.5981473922729492, "learning_rate": 2.1265822784810126e-06, "loss": 0.07002440094947815, "num_input_tokens_seen": 3338456, "step": 1771, "train_runtime": 4792.7152, "train_tokens_per_second": 696.569 }, { "epoch": 1.790497851908011, "grad_norm": 2.0481436252593994, "learning_rate": 2.1164556962025317e-06, "loss": 0.08195114880800247, "num_input_tokens_seen": 3340018, "step": 1772, "train_runtime": 4794.9511, "train_tokens_per_second": 696.57 }, { "epoch": 1.7915087187263077, "grad_norm": 1.4928512573242188, "learning_rate": 2.106329113924051e-06, "loss": 0.05744026601314545, "num_input_tokens_seen": 3342170, "step": 1773, "train_runtime": 4797.3743, "train_tokens_per_second": 696.667 }, { "epoch": 1.7925195855446043, "grad_norm": 1.6322563886642456, "learning_rate": 2.09620253164557e-06, "loss": 0.06046850234270096, "num_input_tokens_seen": 3343816, "step": 1774, "train_runtime": 4799.7204, "train_tokens_per_second": 696.669 }, { "epoch": 1.7935304523629012, "grad_norm": 1.6751173734664917, "learning_rate": 2.0860759493670885e-06, "loss": 0.057147130370140076, "num_input_tokens_seen": 3345358, "step": 1775, "train_runtime": 4802.1459, "train_tokens_per_second": 696.638 }, { "epoch": 1.7945413191811979, "grad_norm": 1.7018221616744995, "learning_rate": 2.0759493670886076e-06, "loss": 0.07538791000843048, "num_input_tokens_seen": 3347366, "step": 1776, "train_runtime": 4804.6966, "train_tokens_per_second": 696.686 }, { "epoch": 1.7955521859994947, "grad_norm": 1.5675290822982788, "learning_rate": 2.0658227848101267e-06, "loss": 0.06920869648456573, "num_input_tokens_seen": 3349976, "step": 1777, "train_runtime": 4807.2503, "train_tokens_per_second": 696.859 }, { "epoch": 1.7965630528177914, "grad_norm": 1.8330793380737305, "learning_rate": 2.055696202531646e-06, "loss": 0.08451933413743973, "num_input_tokens_seen": 3351784, "step": 1778, "train_runtime": 4809.6388, "train_tokens_per_second": 696.889 }, { "epoch": 1.797573919636088, "grad_norm": 1.486541509628296, "learning_rate": 2.045569620253165e-06, "loss": 0.07506123930215836, "num_input_tokens_seen": 3353932, "step": 1779, "train_runtime": 4812.0519, "train_tokens_per_second": 696.986 }, { "epoch": 1.7985847864543847, "grad_norm": 2.7654199600219727, "learning_rate": 2.0354430379746835e-06, "loss": 0.0834086686372757, "num_input_tokens_seen": 3355726, "step": 1780, "train_runtime": 4814.2263, "train_tokens_per_second": 697.044 }, { "epoch": 1.7995956532726813, "grad_norm": 1.4466283321380615, "learning_rate": 2.0253164556962026e-06, "loss": 0.06209476292133331, "num_input_tokens_seen": 3358448, "step": 1781, "train_runtime": 4816.6352, "train_tokens_per_second": 697.26 }, { "epoch": 1.800606520090978, "grad_norm": 1.5030364990234375, "learning_rate": 2.0151898734177217e-06, "loss": 0.07335429638624191, "num_input_tokens_seen": 3360568, "step": 1782, "train_runtime": 4818.8755, "train_tokens_per_second": 697.376 }, { "epoch": 1.800606520090978, "eval_loss": 0.3904574513435364, "eval_runtime": 52.5525, "eval_samples_per_second": 16.726, "eval_steps_per_second": 8.373, "num_input_tokens_seen": 3360568, "step": 1782 }, { "epoch": 1.8016173869092746, "grad_norm": 1.8171679973602295, "learning_rate": 2.005063291139241e-06, "loss": 0.08095956593751907, "num_input_tokens_seen": 3362796, "step": 1783, "train_runtime": 4873.7509, "train_tokens_per_second": 689.981 }, { "epoch": 1.8026282537275713, "grad_norm": 1.6126306056976318, "learning_rate": 1.9949367088607595e-06, "loss": 0.07605712860822678, "num_input_tokens_seen": 3364652, "step": 1784, "train_runtime": 4876.0926, "train_tokens_per_second": 690.03 }, { "epoch": 1.803639120545868, "grad_norm": 2.00726580619812, "learning_rate": 1.9848101265822785e-06, "loss": 0.0651559978723526, "num_input_tokens_seen": 3366096, "step": 1785, "train_runtime": 4878.2623, "train_tokens_per_second": 690.019 }, { "epoch": 1.8046499873641648, "grad_norm": 1.4736859798431396, "learning_rate": 1.9746835443037976e-06, "loss": 0.0557970367372036, "num_input_tokens_seen": 3368244, "step": 1786, "train_runtime": 4880.6843, "train_tokens_per_second": 690.117 }, { "epoch": 1.8056608541824615, "grad_norm": 1.845827579498291, "learning_rate": 1.9645569620253167e-06, "loss": 0.09264189004898071, "num_input_tokens_seen": 3369938, "step": 1787, "train_runtime": 4882.8735, "train_tokens_per_second": 690.155 }, { "epoch": 1.8066717210007581, "grad_norm": 1.808158278465271, "learning_rate": 1.954430379746836e-06, "loss": 0.06721871346235275, "num_input_tokens_seen": 3371544, "step": 1788, "train_runtime": 4884.9635, "train_tokens_per_second": 690.188 }, { "epoch": 1.807682587819055, "grad_norm": 1.875516653060913, "learning_rate": 1.9443037974683544e-06, "loss": 0.05865068733692169, "num_input_tokens_seen": 3372914, "step": 1789, "train_runtime": 4887.0357, "train_tokens_per_second": 690.176 }, { "epoch": 1.8086934546373516, "grad_norm": 1.557678461074829, "learning_rate": 1.9341772151898735e-06, "loss": 0.06890945136547089, "num_input_tokens_seen": 3374998, "step": 1790, "train_runtime": 4889.2849, "train_tokens_per_second": 690.285 }, { "epoch": 1.8097043214556483, "grad_norm": 1.3954472541809082, "learning_rate": 1.9240506329113926e-06, "loss": 0.062456563115119934, "num_input_tokens_seen": 3376898, "step": 1791, "train_runtime": 4891.5463, "train_tokens_per_second": 690.354 }, { "epoch": 1.810715188273945, "grad_norm": 1.6728461980819702, "learning_rate": 1.9139240506329117e-06, "loss": 0.070929154753685, "num_input_tokens_seen": 3379128, "step": 1792, "train_runtime": 4893.8304, "train_tokens_per_second": 690.487 }, { "epoch": 1.8117260550922416, "grad_norm": 1.968773365020752, "learning_rate": 1.9037974683544306e-06, "loss": 0.06813179701566696, "num_input_tokens_seen": 3380466, "step": 1793, "train_runtime": 4895.9043, "train_tokens_per_second": 690.468 }, { "epoch": 1.8127369219105383, "grad_norm": 1.569763422012329, "learning_rate": 1.8936708860759494e-06, "loss": 0.06483528763055801, "num_input_tokens_seen": 3381916, "step": 1794, "train_runtime": 4898.0221, "train_tokens_per_second": 690.466 }, { "epoch": 1.813747788728835, "grad_norm": 1.5195773839950562, "learning_rate": 1.8835443037974685e-06, "loss": 0.06212960183620453, "num_input_tokens_seen": 3384378, "step": 1795, "train_runtime": 4900.3322, "train_tokens_per_second": 690.643 }, { "epoch": 1.8147586555471316, "grad_norm": 1.8203085660934448, "learning_rate": 1.8734177215189874e-06, "loss": 0.09631272405385971, "num_input_tokens_seen": 3386200, "step": 1796, "train_runtime": 4902.4921, "train_tokens_per_second": 690.71 }, { "epoch": 1.8157695223654282, "grad_norm": 1.3569339513778687, "learning_rate": 1.8632911392405065e-06, "loss": 0.04996223375201225, "num_input_tokens_seen": 3388380, "step": 1797, "train_runtime": 4904.7428, "train_tokens_per_second": 690.837 }, { "epoch": 1.816780389183725, "grad_norm": 1.7530453205108643, "learning_rate": 1.8531645569620254e-06, "loss": 0.049221381545066833, "num_input_tokens_seen": 3390244, "step": 1798, "train_runtime": 4906.9329, "train_tokens_per_second": 690.909 }, { "epoch": 1.8177912560020217, "grad_norm": 2.0620510578155518, "learning_rate": 1.8430379746835444e-06, "loss": 0.08164380490779877, "num_input_tokens_seen": 3392044, "step": 1799, "train_runtime": 4909.1442, "train_tokens_per_second": 690.964 }, { "epoch": 1.8188021228203184, "grad_norm": 1.41123628616333, "learning_rate": 1.8329113924050635e-06, "loss": 0.052159473299980164, "num_input_tokens_seen": 3394136, "step": 1800, "train_runtime": 4911.3918, "train_tokens_per_second": 691.074 }, { "epoch": 1.8198129896386153, "grad_norm": 1.3010928630828857, "learning_rate": 1.8227848101265824e-06, "loss": 0.06299445778131485, "num_input_tokens_seen": 3396196, "step": 1801, "train_runtime": 4920.1333, "train_tokens_per_second": 690.265 }, { "epoch": 1.820823856456912, "grad_norm": 1.6793879270553589, "learning_rate": 1.8126582278481015e-06, "loss": 0.05772136151790619, "num_input_tokens_seen": 3398414, "step": 1802, "train_runtime": 4922.3972, "train_tokens_per_second": 690.398 }, { "epoch": 1.8218347232752086, "grad_norm": 1.858668565750122, "learning_rate": 1.8025316455696204e-06, "loss": 0.07672533392906189, "num_input_tokens_seen": 3400244, "step": 1803, "train_runtime": 4924.5831, "train_tokens_per_second": 690.463 }, { "epoch": 1.8228455900935052, "grad_norm": 1.902227520942688, "learning_rate": 1.7924050632911394e-06, "loss": 0.08474107831716537, "num_input_tokens_seen": 3401862, "step": 1804, "train_runtime": 4926.7568, "train_tokens_per_second": 690.487 }, { "epoch": 1.8238564569118019, "grad_norm": 1.6770691871643066, "learning_rate": 1.7822784810126583e-06, "loss": 0.0702476054430008, "num_input_tokens_seen": 3403396, "step": 1805, "train_runtime": 4928.8713, "train_tokens_per_second": 690.502 }, { "epoch": 1.8248673237300985, "grad_norm": 1.501683235168457, "learning_rate": 1.7721518987341774e-06, "loss": 0.058430809527635574, "num_input_tokens_seen": 3405348, "step": 1806, "train_runtime": 4931.1975, "train_tokens_per_second": 690.572 }, { "epoch": 1.8258781905483952, "grad_norm": 1.3843590021133423, "learning_rate": 1.7620253164556963e-06, "loss": 0.053882379084825516, "num_input_tokens_seen": 3407222, "step": 1807, "train_runtime": 4933.4259, "train_tokens_per_second": 690.64 }, { "epoch": 1.8268890573666918, "grad_norm": 1.9313164949417114, "learning_rate": 1.7518987341772154e-06, "loss": 0.060391172766685486, "num_input_tokens_seen": 3408828, "step": 1808, "train_runtime": 4935.5799, "train_tokens_per_second": 690.664 }, { "epoch": 1.8278999241849885, "grad_norm": 1.171385645866394, "learning_rate": 1.7417721518987342e-06, "loss": 0.039266109466552734, "num_input_tokens_seen": 3410766, "step": 1809, "train_runtime": 4937.7982, "train_tokens_per_second": 690.746 }, { "epoch": 1.8289107910032854, "grad_norm": 2.3054921627044678, "learning_rate": 1.7316455696202533e-06, "loss": 0.04750610888004303, "num_input_tokens_seen": 3412244, "step": 1810, "train_runtime": 4939.9203, "train_tokens_per_second": 690.749 }, { "epoch": 1.829921657821582, "grad_norm": 1.761833667755127, "learning_rate": 1.7215189873417724e-06, "loss": 0.06808142364025116, "num_input_tokens_seen": 3413644, "step": 1811, "train_runtime": 4942.0062, "train_tokens_per_second": 690.741 }, { "epoch": 1.8309325246398787, "grad_norm": 1.678519606590271, "learning_rate": 1.7113924050632913e-06, "loss": 0.078433096408844, "num_input_tokens_seen": 3415632, "step": 1812, "train_runtime": 4944.2397, "train_tokens_per_second": 690.831 }, { "epoch": 1.8319433914581755, "grad_norm": 1.8285229206085205, "learning_rate": 1.7012658227848104e-06, "loss": 0.0811389610171318, "num_input_tokens_seen": 3417608, "step": 1813, "train_runtime": 4946.5695, "train_tokens_per_second": 690.905 }, { "epoch": 1.8329542582764722, "grad_norm": 1.7586532831192017, "learning_rate": 1.6911392405063292e-06, "loss": 0.10236801952123642, "num_input_tokens_seen": 3419590, "step": 1814, "train_runtime": 4948.8475, "train_tokens_per_second": 690.987 }, { "epoch": 1.8339651250947688, "grad_norm": 1.28721022605896, "learning_rate": 1.6810126582278483e-06, "loss": 0.055602312088012695, "num_input_tokens_seen": 3421706, "step": 1815, "train_runtime": 4951.1041, "train_tokens_per_second": 691.1 }, { "epoch": 1.8349759919130655, "grad_norm": 1.5468133687973022, "learning_rate": 1.6708860759493672e-06, "loss": 0.0795050710439682, "num_input_tokens_seen": 3423888, "step": 1816, "train_runtime": 4953.3492, "train_tokens_per_second": 691.227 }, { "epoch": 1.8359868587313621, "grad_norm": 2.1119022369384766, "learning_rate": 1.6607594936708863e-06, "loss": 0.08815045654773712, "num_input_tokens_seen": 3425318, "step": 1817, "train_runtime": 4955.459, "train_tokens_per_second": 691.221 }, { "epoch": 1.8369977255496588, "grad_norm": 1.8005280494689941, "learning_rate": 1.6506329113924051e-06, "loss": 0.06341415643692017, "num_input_tokens_seen": 3426994, "step": 1818, "train_runtime": 4957.6288, "train_tokens_per_second": 691.257 }, { "epoch": 1.8380085923679554, "grad_norm": 2.0441479682922363, "learning_rate": 1.6405063291139242e-06, "loss": 0.07308895885944366, "num_input_tokens_seen": 3428430, "step": 1819, "train_runtime": 4959.7122, "train_tokens_per_second": 691.256 }, { "epoch": 1.839019459186252, "grad_norm": 2.1781206130981445, "learning_rate": 1.630379746835443e-06, "loss": 0.06979721784591675, "num_input_tokens_seen": 3429958, "step": 1820, "train_runtime": 4961.8539, "train_tokens_per_second": 691.265 }, { "epoch": 1.8400303260045487, "grad_norm": 1.9482448101043701, "learning_rate": 1.6202531645569622e-06, "loss": 0.08638764917850494, "num_input_tokens_seen": 3431730, "step": 1821, "train_runtime": 4964.0503, "train_tokens_per_second": 691.317 }, { "epoch": 1.8410411928228456, "grad_norm": 2.3552582263946533, "learning_rate": 1.6101265822784813e-06, "loss": 0.08728457987308502, "num_input_tokens_seen": 3433280, "step": 1822, "train_runtime": 4966.1523, "train_tokens_per_second": 691.336 }, { "epoch": 1.8420520596411423, "grad_norm": 1.7918983697891235, "learning_rate": 1.6000000000000001e-06, "loss": 0.0671626627445221, "num_input_tokens_seen": 3435124, "step": 1823, "train_runtime": 4968.3949, "train_tokens_per_second": 691.395 }, { "epoch": 1.843062926459439, "grad_norm": 2.1483774185180664, "learning_rate": 1.5898734177215192e-06, "loss": 0.09187205135822296, "num_input_tokens_seen": 3436512, "step": 1824, "train_runtime": 4970.4961, "train_tokens_per_second": 691.382 }, { "epoch": 1.8440737932777358, "grad_norm": 2.024263858795166, "learning_rate": 1.579746835443038e-06, "loss": 0.061750929802656174, "num_input_tokens_seen": 3437948, "step": 1825, "train_runtime": 4972.5933, "train_tokens_per_second": 691.379 }, { "epoch": 1.8450846600960324, "grad_norm": 1.584208607673645, "learning_rate": 1.5696202531645572e-06, "loss": 0.07746241241693497, "num_input_tokens_seen": 3439876, "step": 1826, "train_runtime": 4974.8569, "train_tokens_per_second": 691.452 }, { "epoch": 1.846095526914329, "grad_norm": 1.7835091352462769, "learning_rate": 1.559493670886076e-06, "loss": 0.08446493744850159, "num_input_tokens_seen": 3441730, "step": 1827, "train_runtime": 4977.0636, "train_tokens_per_second": 691.518 }, { "epoch": 1.8471063937326258, "grad_norm": 1.7341301441192627, "learning_rate": 1.5493670886075951e-06, "loss": 0.05569569021463394, "num_input_tokens_seen": 3443580, "step": 1828, "train_runtime": 4979.2187, "train_tokens_per_second": 691.59 }, { "epoch": 1.8481172605509224, "grad_norm": 1.8013854026794434, "learning_rate": 1.539240506329114e-06, "loss": 0.05938012897968292, "num_input_tokens_seen": 3445306, "step": 1829, "train_runtime": 4981.4066, "train_tokens_per_second": 691.633 }, { "epoch": 1.849128127369219, "grad_norm": 1.6440705060958862, "learning_rate": 1.529113924050633e-06, "loss": 0.08171625435352325, "num_input_tokens_seen": 3447488, "step": 1830, "train_runtime": 4983.7382, "train_tokens_per_second": 691.747 }, { "epoch": 1.8501389941875157, "grad_norm": 2.135153293609619, "learning_rate": 1.518987341772152e-06, "loss": 0.09053754806518555, "num_input_tokens_seen": 3449220, "step": 1831, "train_runtime": 4992.5622, "train_tokens_per_second": 690.872 }, { "epoch": 1.8511498610058124, "grad_norm": 1.5982813835144043, "learning_rate": 1.508860759493671e-06, "loss": 0.07078617811203003, "num_input_tokens_seen": 3451032, "step": 1832, "train_runtime": 4994.7765, "train_tokens_per_second": 690.928 }, { "epoch": 1.852160727824109, "grad_norm": 1.5052188634872437, "learning_rate": 1.4987341772151901e-06, "loss": 0.050244953483343124, "num_input_tokens_seen": 3452824, "step": 1833, "train_runtime": 4997.0024, "train_tokens_per_second": 690.979 }, { "epoch": 1.8531715946424059, "grad_norm": 1.3054684400558472, "learning_rate": 1.488607594936709e-06, "loss": 0.045286163687705994, "num_input_tokens_seen": 3454654, "step": 1834, "train_runtime": 4999.2124, "train_tokens_per_second": 691.04 }, { "epoch": 1.8541824614607025, "grad_norm": 1.6632694005966187, "learning_rate": 1.478481012658228e-06, "loss": 0.04870486631989479, "num_input_tokens_seen": 3456194, "step": 1835, "train_runtime": 5001.421, "train_tokens_per_second": 691.042 }, { "epoch": 1.8551933282789992, "grad_norm": 1.638814926147461, "learning_rate": 1.468354430379747e-06, "loss": 0.04414809122681618, "num_input_tokens_seen": 3458628, "step": 1836, "train_runtime": 5003.8432, "train_tokens_per_second": 691.194 }, { "epoch": 1.856204195097296, "grad_norm": 1.8952370882034302, "learning_rate": 1.458227848101266e-06, "loss": 0.08647635579109192, "num_input_tokens_seen": 3460506, "step": 1837, "train_runtime": 5006.0602, "train_tokens_per_second": 691.263 }, { "epoch": 1.8572150619155927, "grad_norm": 1.6776092052459717, "learning_rate": 1.448101265822785e-06, "loss": 0.06300491839647293, "num_input_tokens_seen": 3462502, "step": 1838, "train_runtime": 5008.3496, "train_tokens_per_second": 691.346 }, { "epoch": 1.8582259287338894, "grad_norm": 1.5861340761184692, "learning_rate": 1.437974683544304e-06, "loss": 0.05638999491930008, "num_input_tokens_seen": 3464010, "step": 1839, "train_runtime": 5010.5477, "train_tokens_per_second": 691.344 }, { "epoch": 1.859236795552186, "grad_norm": 1.8318597078323364, "learning_rate": 1.4278481012658229e-06, "loss": 0.05801784247159958, "num_input_tokens_seen": 3465982, "step": 1840, "train_runtime": 5012.9244, "train_tokens_per_second": 691.409 }, { "epoch": 1.8602476623704827, "grad_norm": 1.6301965713500977, "learning_rate": 1.417721518987342e-06, "loss": 0.08084286004304886, "num_input_tokens_seen": 3468036, "step": 1841, "train_runtime": 5015.2036, "train_tokens_per_second": 691.505 }, { "epoch": 1.8612585291887793, "grad_norm": 2.134197950363159, "learning_rate": 1.4075949367088608e-06, "loss": 0.07081994414329529, "num_input_tokens_seen": 3469660, "step": 1842, "train_runtime": 5017.3585, "train_tokens_per_second": 691.531 }, { "epoch": 1.862269396007076, "grad_norm": 2.1300292015075684, "learning_rate": 1.39746835443038e-06, "loss": 0.09027338027954102, "num_input_tokens_seen": 3471300, "step": 1843, "train_runtime": 5019.5769, "train_tokens_per_second": 691.552 }, { "epoch": 1.8632802628253726, "grad_norm": 2.171847343444824, "learning_rate": 1.387341772151899e-06, "loss": 0.07858128100633621, "num_input_tokens_seen": 3472838, "step": 1844, "train_runtime": 5021.725, "train_tokens_per_second": 691.563 }, { "epoch": 1.8642911296436695, "grad_norm": 1.9706461429595947, "learning_rate": 1.3772151898734179e-06, "loss": 0.08030667901039124, "num_input_tokens_seen": 3474660, "step": 1845, "train_runtime": 5023.9119, "train_tokens_per_second": 691.624 }, { "epoch": 1.8653019964619661, "grad_norm": 1.915985345840454, "learning_rate": 1.367088607594937e-06, "loss": 0.07971419394016266, "num_input_tokens_seen": 3476294, "step": 1846, "train_runtime": 5026.0838, "train_tokens_per_second": 691.651 }, { "epoch": 1.8663128632802628, "grad_norm": 1.6336525678634644, "learning_rate": 1.3569620253164558e-06, "loss": 0.05157170072197914, "num_input_tokens_seen": 3477836, "step": 1847, "train_runtime": 5028.2093, "train_tokens_per_second": 691.665 }, { "epoch": 1.8673237300985597, "grad_norm": 1.8403663635253906, "learning_rate": 1.346835443037975e-06, "loss": 0.07300272583961487, "num_input_tokens_seen": 3479554, "step": 1848, "train_runtime": 5030.4055, "train_tokens_per_second": 691.704 }, { "epoch": 1.8683345969168563, "grad_norm": 1.7771477699279785, "learning_rate": 1.3367088607594938e-06, "loss": 0.07321541011333466, "num_input_tokens_seen": 3481364, "step": 1849, "train_runtime": 5032.6183, "train_tokens_per_second": 691.76 }, { "epoch": 1.869345463735153, "grad_norm": 1.665406346321106, "learning_rate": 1.3265822784810129e-06, "loss": 0.09364591538906097, "num_input_tokens_seen": 3483210, "step": 1850, "train_runtime": 5034.8219, "train_tokens_per_second": 691.824 }, { "epoch": 1.8703563305534496, "grad_norm": 1.1183644533157349, "learning_rate": 1.3164556962025317e-06, "loss": 0.04247704893350601, "num_input_tokens_seen": 3484998, "step": 1851, "train_runtime": 5037.0281, "train_tokens_per_second": 691.876 }, { "epoch": 1.8713671973717463, "grad_norm": 1.6386619806289673, "learning_rate": 1.3063291139240508e-06, "loss": 0.04744293540716171, "num_input_tokens_seen": 3486614, "step": 1852, "train_runtime": 5039.1912, "train_tokens_per_second": 691.9 }, { "epoch": 1.872378064190043, "grad_norm": 1.7003967761993408, "learning_rate": 1.2962025316455697e-06, "loss": 0.06002739444375038, "num_input_tokens_seen": 3488406, "step": 1853, "train_runtime": 5041.3562, "train_tokens_per_second": 691.958 }, { "epoch": 1.8733889310083396, "grad_norm": 2.393953800201416, "learning_rate": 1.2860759493670888e-06, "loss": 0.09052784740924835, "num_input_tokens_seen": 3489924, "step": 1854, "train_runtime": 5043.5327, "train_tokens_per_second": 691.96 }, { "epoch": 1.8743997978266362, "grad_norm": 1.5386276245117188, "learning_rate": 1.2759493670886079e-06, "loss": 0.05487651377916336, "num_input_tokens_seen": 3492204, "step": 1855, "train_runtime": 5045.8265, "train_tokens_per_second": 692.098 }, { "epoch": 1.875410664644933, "grad_norm": 1.4505112171173096, "learning_rate": 1.2658227848101267e-06, "loss": 0.04382224380970001, "num_input_tokens_seen": 3493908, "step": 1856, "train_runtime": 5048.0202, "train_tokens_per_second": 692.134 }, { "epoch": 1.8764215314632298, "grad_norm": 1.3902812004089355, "learning_rate": 1.2556962025316458e-06, "loss": 0.06371606141328812, "num_input_tokens_seen": 3495948, "step": 1857, "train_runtime": 5050.2433, "train_tokens_per_second": 692.234 }, { "epoch": 1.8774323982815264, "grad_norm": 1.582065224647522, "learning_rate": 1.2455696202531647e-06, "loss": 0.06060520187020302, "num_input_tokens_seen": 3498066, "step": 1858, "train_runtime": 5052.5335, "train_tokens_per_second": 692.339 }, { "epoch": 1.878443265099823, "grad_norm": 1.4478693008422852, "learning_rate": 1.2354430379746836e-06, "loss": 0.06082356348633766, "num_input_tokens_seen": 3500240, "step": 1859, "train_runtime": 5054.808, "train_tokens_per_second": 692.458 }, { "epoch": 1.87945413191812, "grad_norm": 1.8662803173065186, "learning_rate": 1.2253164556962027e-06, "loss": 0.08540136367082596, "num_input_tokens_seen": 3502098, "step": 1860, "train_runtime": 5057.0231, "train_tokens_per_second": 692.522 }, { "epoch": 1.8804649987364166, "grad_norm": 1.6401348114013672, "learning_rate": 1.2151898734177215e-06, "loss": 0.05659695714712143, "num_input_tokens_seen": 3504010, "step": 1861, "train_runtime": 5065.6998, "train_tokens_per_second": 691.713 }, { "epoch": 1.8814758655547132, "grad_norm": 1.8000669479370117, "learning_rate": 1.2050632911392406e-06, "loss": 0.0997447595000267, "num_input_tokens_seen": 3506308, "step": 1862, "train_runtime": 5067.9939, "train_tokens_per_second": 691.853 }, { "epoch": 1.88248673237301, "grad_norm": 1.4725761413574219, "learning_rate": 1.1949367088607595e-06, "loss": 0.05516906827688217, "num_input_tokens_seen": 3508312, "step": 1863, "train_runtime": 5070.2737, "train_tokens_per_second": 691.937 }, { "epoch": 1.8834975991913065, "grad_norm": 1.6513181924819946, "learning_rate": 1.1848101265822786e-06, "loss": 0.06855172663927078, "num_input_tokens_seen": 3510196, "step": 1864, "train_runtime": 5072.4809, "train_tokens_per_second": 692.008 }, { "epoch": 1.8845084660096032, "grad_norm": 1.6698564291000366, "learning_rate": 1.1746835443037974e-06, "loss": 0.05972818285226822, "num_input_tokens_seen": 3511816, "step": 1865, "train_runtime": 5074.6547, "train_tokens_per_second": 692.031 }, { "epoch": 1.8855193328278999, "grad_norm": 1.4553149938583374, "learning_rate": 1.1645569620253165e-06, "loss": 0.05890914425253868, "num_input_tokens_seen": 3513736, "step": 1866, "train_runtime": 5076.8634, "train_tokens_per_second": 692.108 }, { "epoch": 1.8865301996461965, "grad_norm": 1.9039795398712158, "learning_rate": 1.1544303797468354e-06, "loss": 0.06471452116966248, "num_input_tokens_seen": 3515274, "step": 1867, "train_runtime": 5078.9868, "train_tokens_per_second": 692.121 }, { "epoch": 1.8875410664644932, "grad_norm": 1.6786473989486694, "learning_rate": 1.1443037974683545e-06, "loss": 0.07185996323823929, "num_input_tokens_seen": 3517364, "step": 1868, "train_runtime": 5081.271, "train_tokens_per_second": 692.221 }, { "epoch": 1.88855193328279, "grad_norm": 1.8660085201263428, "learning_rate": 1.1341772151898736e-06, "loss": 0.07593970000743866, "num_input_tokens_seen": 3519344, "step": 1869, "train_runtime": 5083.6076, "train_tokens_per_second": 692.293 }, { "epoch": 1.8895628001010867, "grad_norm": 1.8927536010742188, "learning_rate": 1.1240506329113924e-06, "loss": 0.0532231330871582, "num_input_tokens_seen": 3521038, "step": 1870, "train_runtime": 5085.7955, "train_tokens_per_second": 692.328 }, { "epoch": 1.8905736669193833, "grad_norm": 1.4850199222564697, "learning_rate": 1.1139240506329115e-06, "loss": 0.06374198943376541, "num_input_tokens_seen": 3522880, "step": 1871, "train_runtime": 5088.0351, "train_tokens_per_second": 692.385 }, { "epoch": 1.8915845337376802, "grad_norm": 1.70200777053833, "learning_rate": 1.1037974683544304e-06, "loss": 0.07828419655561447, "num_input_tokens_seen": 3525122, "step": 1872, "train_runtime": 5090.367, "train_tokens_per_second": 692.508 }, { "epoch": 1.8925954005559769, "grad_norm": 2.2650492191314697, "learning_rate": 1.0936708860759495e-06, "loss": 0.07213446497917175, "num_input_tokens_seen": 3526860, "step": 1873, "train_runtime": 5092.5173, "train_tokens_per_second": 692.557 }, { "epoch": 1.8936062673742735, "grad_norm": 1.9589587450027466, "learning_rate": 1.0835443037974684e-06, "loss": 0.07544541358947754, "num_input_tokens_seen": 3528716, "step": 1874, "train_runtime": 5094.7493, "train_tokens_per_second": 692.618 }, { "epoch": 1.8946171341925702, "grad_norm": 2.1888937950134277, "learning_rate": 1.0734177215189874e-06, "loss": 0.08355741947889328, "num_input_tokens_seen": 3530244, "step": 1875, "train_runtime": 5096.9047, "train_tokens_per_second": 692.625 }, { "epoch": 1.8956280010108668, "grad_norm": 2.0891592502593994, "learning_rate": 1.0632911392405063e-06, "loss": 0.07398049533367157, "num_input_tokens_seen": 3531840, "step": 1876, "train_runtime": 5099.1005, "train_tokens_per_second": 692.64 }, { "epoch": 1.8966388678291635, "grad_norm": 1.6804112195968628, "learning_rate": 1.0531645569620254e-06, "loss": 0.0694270059466362, "num_input_tokens_seen": 3533806, "step": 1877, "train_runtime": 5101.3349, "train_tokens_per_second": 692.722 }, { "epoch": 1.8976497346474601, "grad_norm": 2.4839885234832764, "learning_rate": 1.0430379746835443e-06, "loss": 0.08326879888772964, "num_input_tokens_seen": 3535284, "step": 1878, "train_runtime": 5103.4445, "train_tokens_per_second": 692.725 }, { "epoch": 1.8986606014657568, "grad_norm": 1.8496500253677368, "learning_rate": 1.0329113924050634e-06, "loss": 0.10120419412851334, "num_input_tokens_seen": 3537260, "step": 1879, "train_runtime": 5105.6793, "train_tokens_per_second": 692.809 }, { "epoch": 1.8996714682840534, "grad_norm": 1.635189414024353, "learning_rate": 1.0227848101265824e-06, "loss": 0.05759390443563461, "num_input_tokens_seen": 3539170, "step": 1880, "train_runtime": 5107.956, "train_tokens_per_second": 692.874 }, { "epoch": 1.9006823351023503, "grad_norm": 1.5812994241714478, "learning_rate": 1.0126582278481013e-06, "loss": 0.06326553225517273, "num_input_tokens_seen": 3540982, "step": 1881, "train_runtime": 5110.2669, "train_tokens_per_second": 692.915 }, { "epoch": 1.901693201920647, "grad_norm": 1.7322474718093872, "learning_rate": 1.0025316455696204e-06, "loss": 0.08316643536090851, "num_input_tokens_seen": 3543062, "step": 1882, "train_runtime": 5112.5532, "train_tokens_per_second": 693.012 }, { "epoch": 1.9027040687389436, "grad_norm": 1.5347411632537842, "learning_rate": 9.924050632911393e-07, "loss": 0.0600912943482399, "num_input_tokens_seen": 3545132, "step": 1883, "train_runtime": 5114.7691, "train_tokens_per_second": 693.117 }, { "epoch": 1.9037149355572405, "grad_norm": 1.78092622756958, "learning_rate": 9.822784810126584e-07, "loss": 0.06544648110866547, "num_input_tokens_seen": 3546714, "step": 1884, "train_runtime": 5116.9727, "train_tokens_per_second": 693.127 }, { "epoch": 1.9047258023755371, "grad_norm": 1.6052136421203613, "learning_rate": 9.721518987341772e-07, "loss": 0.06100933626294136, "num_input_tokens_seen": 3548604, "step": 1885, "train_runtime": 5119.1822, "train_tokens_per_second": 693.197 }, { "epoch": 1.9057366691938338, "grad_norm": 2.2423882484436035, "learning_rate": 9.620253164556963e-07, "loss": 0.09639609605073929, "num_input_tokens_seen": 3550542, "step": 1886, "train_runtime": 5121.3875, "train_tokens_per_second": 693.277 }, { "epoch": 1.9067475360121304, "grad_norm": 1.7005420923233032, "learning_rate": 9.518987341772153e-07, "loss": 0.06617413461208344, "num_input_tokens_seen": 3552096, "step": 1887, "train_runtime": 5123.5454, "train_tokens_per_second": 693.289 }, { "epoch": 1.907758402830427, "grad_norm": 1.886470079421997, "learning_rate": 9.417721518987343e-07, "loss": 0.0866304561495781, "num_input_tokens_seen": 3553786, "step": 1888, "train_runtime": 5125.7007, "train_tokens_per_second": 693.327 }, { "epoch": 1.9087692696487237, "grad_norm": 1.8155748844146729, "learning_rate": 9.316455696202532e-07, "loss": 0.08397430181503296, "num_input_tokens_seen": 3555838, "step": 1889, "train_runtime": 5127.9423, "train_tokens_per_second": 693.424 }, { "epoch": 1.9097801364670204, "grad_norm": 1.4033902883529663, "learning_rate": 9.215189873417722e-07, "loss": 0.06193836033344269, "num_input_tokens_seen": 3557936, "step": 1890, "train_runtime": 5130.2064, "train_tokens_per_second": 693.527 }, { "epoch": 1.910791003285317, "grad_norm": 1.5796843767166138, "learning_rate": 9.113924050632912e-07, "loss": 0.06924757361412048, "num_input_tokens_seen": 3559842, "step": 1891, "train_runtime": 5138.9183, "train_tokens_per_second": 692.722 }, { "epoch": 1.9118018701036137, "grad_norm": 1.8680285215377808, "learning_rate": 9.012658227848102e-07, "loss": 0.07084711641073227, "num_input_tokens_seen": 3561686, "step": 1892, "train_runtime": 5141.1268, "train_tokens_per_second": 692.783 }, { "epoch": 1.9128127369219106, "grad_norm": 1.7338470220565796, "learning_rate": 8.911392405063292e-07, "loss": 0.07172862440347672, "num_input_tokens_seen": 3563160, "step": 1893, "train_runtime": 5143.2457, "train_tokens_per_second": 692.784 }, { "epoch": 1.9138236037402072, "grad_norm": 1.7504284381866455, "learning_rate": 8.810126582278481e-07, "loss": 0.077755868434906, "num_input_tokens_seen": 3564766, "step": 1894, "train_runtime": 5145.3647, "train_tokens_per_second": 692.811 }, { "epoch": 1.9148344705585039, "grad_norm": 1.5047736167907715, "learning_rate": 8.708860759493671e-07, "loss": 0.05209915712475777, "num_input_tokens_seen": 3566548, "step": 1895, "train_runtime": 5147.5382, "train_tokens_per_second": 692.865 }, { "epoch": 1.9158453373768007, "grad_norm": 1.5364779233932495, "learning_rate": 8.607594936708862e-07, "loss": 0.06482240557670593, "num_input_tokens_seen": 3568356, "step": 1896, "train_runtime": 5149.8071, "train_tokens_per_second": 692.911 }, { "epoch": 1.9168562041950974, "grad_norm": 2.100857734680176, "learning_rate": 8.506329113924052e-07, "loss": 0.08881665766239166, "num_input_tokens_seen": 3570256, "step": 1897, "train_runtime": 5152.0468, "train_tokens_per_second": 692.978 }, { "epoch": 1.917867071013394, "grad_norm": 1.7566105127334595, "learning_rate": 8.405063291139242e-07, "loss": 0.08907251060009003, "num_input_tokens_seen": 3572150, "step": 1898, "train_runtime": 5154.3416, "train_tokens_per_second": 693.037 }, { "epoch": 1.9188779378316907, "grad_norm": 1.6315668821334839, "learning_rate": 8.303797468354431e-07, "loss": 0.08250783383846283, "num_input_tokens_seen": 3574394, "step": 1899, "train_runtime": 5156.7541, "train_tokens_per_second": 693.148 }, { "epoch": 1.9198888046499873, "grad_norm": 1.550088882446289, "learning_rate": 8.202531645569621e-07, "loss": 0.060801491141319275, "num_input_tokens_seen": 3576864, "step": 1900, "train_runtime": 5159.1141, "train_tokens_per_second": 693.31 }, { "epoch": 1.920899671468284, "grad_norm": 1.800826907157898, "learning_rate": 8.101265822784811e-07, "loss": 0.07329748570919037, "num_input_tokens_seen": 3578852, "step": 1901, "train_runtime": 5161.3988, "train_tokens_per_second": 693.388 }, { "epoch": 1.9219105382865806, "grad_norm": 2.830747365951538, "learning_rate": 8.000000000000001e-07, "loss": 0.0832766741514206, "num_input_tokens_seen": 3580110, "step": 1902, "train_runtime": 5163.4533, "train_tokens_per_second": 693.356 }, { "epoch": 1.9229214051048773, "grad_norm": 1.718701958656311, "learning_rate": 7.89873417721519e-07, "loss": 0.07386311143636703, "num_input_tokens_seen": 3582264, "step": 1903, "train_runtime": 5165.7572, "train_tokens_per_second": 693.463 }, { "epoch": 1.9239322719231742, "grad_norm": 1.9136043787002563, "learning_rate": 7.79746835443038e-07, "loss": 0.08677150309085846, "num_input_tokens_seen": 3583906, "step": 1904, "train_runtime": 5167.9118, "train_tokens_per_second": 693.492 }, { "epoch": 1.9249431387414708, "grad_norm": 1.894005537033081, "learning_rate": 7.69620253164557e-07, "loss": 0.09352187067270279, "num_input_tokens_seen": 3585726, "step": 1905, "train_runtime": 5170.1254, "train_tokens_per_second": 693.547 }, { "epoch": 1.9259540055597675, "grad_norm": 2.1736397743225098, "learning_rate": 7.59493670886076e-07, "loss": 0.06525714695453644, "num_input_tokens_seen": 3587382, "step": 1906, "train_runtime": 5172.3277, "train_tokens_per_second": 693.572 }, { "epoch": 1.9269648723780644, "grad_norm": 1.7275938987731934, "learning_rate": 7.493670886075951e-07, "loss": 0.06097712367773056, "num_input_tokens_seen": 3589402, "step": 1907, "train_runtime": 5174.6275, "train_tokens_per_second": 693.654 }, { "epoch": 1.927975739196361, "grad_norm": 1.5570915937423706, "learning_rate": 7.39240506329114e-07, "loss": 0.05133200064301491, "num_input_tokens_seen": 3590808, "step": 1908, "train_runtime": 5176.7731, "train_tokens_per_second": 693.638 }, { "epoch": 1.9289866060146577, "grad_norm": 1.765472173690796, "learning_rate": 7.29113924050633e-07, "loss": 0.07087323814630508, "num_input_tokens_seen": 3593456, "step": 1909, "train_runtime": 5179.1694, "train_tokens_per_second": 693.829 }, { "epoch": 1.9299974728329543, "grad_norm": 1.6926285028457642, "learning_rate": 7.18987341772152e-07, "loss": 0.07390089333057404, "num_input_tokens_seen": 3595598, "step": 1910, "train_runtime": 5181.4103, "train_tokens_per_second": 693.942 }, { "epoch": 1.931008339651251, "grad_norm": 1.7235076427459717, "learning_rate": 7.08860759493671e-07, "loss": 0.06663314253091812, "num_input_tokens_seen": 3597450, "step": 1911, "train_runtime": 5183.6001, "train_tokens_per_second": 694.006 }, { "epoch": 1.9320192064695476, "grad_norm": 1.5091921091079712, "learning_rate": 6.9873417721519e-07, "loss": 0.06591759622097015, "num_input_tokens_seen": 3599768, "step": 1912, "train_runtime": 5185.8958, "train_tokens_per_second": 694.146 }, { "epoch": 1.9330300732878443, "grad_norm": 1.685353398323059, "learning_rate": 6.886075949367089e-07, "loss": 0.06985824555158615, "num_input_tokens_seen": 3601768, "step": 1913, "train_runtime": 5188.1358, "train_tokens_per_second": 694.232 }, { "epoch": 1.934040940106141, "grad_norm": 1.5597984790802002, "learning_rate": 6.784810126582279e-07, "loss": 0.0746968686580658, "num_input_tokens_seen": 3604040, "step": 1914, "train_runtime": 5190.4279, "train_tokens_per_second": 694.363 }, { "epoch": 1.9350518069244376, "grad_norm": 1.6250715255737305, "learning_rate": 6.683544303797469e-07, "loss": 0.058975815773010254, "num_input_tokens_seen": 3605882, "step": 1915, "train_runtime": 5192.6106, "train_tokens_per_second": 694.426 }, { "epoch": 1.9360626737427344, "grad_norm": 1.5663336515426636, "learning_rate": 6.582278481012659e-07, "loss": 0.06764580309391022, "num_input_tokens_seen": 3607992, "step": 1916, "train_runtime": 5194.8791, "train_tokens_per_second": 694.529 }, { "epoch": 1.937073540561031, "grad_norm": 2.1358561515808105, "learning_rate": 6.481012658227849e-07, "loss": 0.06255315244197845, "num_input_tokens_seen": 3609462, "step": 1917, "train_runtime": 5196.9891, "train_tokens_per_second": 694.529 }, { "epoch": 1.9380844073793277, "grad_norm": 1.297664999961853, "learning_rate": 6.379746835443039e-07, "loss": 0.05662040412425995, "num_input_tokens_seen": 3611516, "step": 1918, "train_runtime": 5199.2181, "train_tokens_per_second": 694.627 }, { "epoch": 1.9390952741976246, "grad_norm": 1.4330904483795166, "learning_rate": 6.278481012658229e-07, "loss": 0.05363224446773529, "num_input_tokens_seen": 3613642, "step": 1919, "train_runtime": 5201.4994, "train_tokens_per_second": 694.731 }, { "epoch": 1.9401061410159213, "grad_norm": 1.6165391206741333, "learning_rate": 6.177215189873418e-07, "loss": 0.08508194237947464, "num_input_tokens_seen": 3615978, "step": 1920, "train_runtime": 5203.8046, "train_tokens_per_second": 694.872 }, { "epoch": 1.941117007834218, "grad_norm": 2.0775704383850098, "learning_rate": 6.075949367088608e-07, "loss": 0.07671953737735748, "num_input_tokens_seen": 3617712, "step": 1921, "train_runtime": 5212.5709, "train_tokens_per_second": 694.036 }, { "epoch": 1.9421278746525146, "grad_norm": 1.7379590272903442, "learning_rate": 5.974683544303797e-07, "loss": 0.07785919308662415, "num_input_tokens_seen": 3619592, "step": 1922, "train_runtime": 5214.7871, "train_tokens_per_second": 694.102 }, { "epoch": 1.9431387414708112, "grad_norm": 1.744384765625, "learning_rate": 5.873417721518987e-07, "loss": 0.0654076486825943, "num_input_tokens_seen": 3621670, "step": 1923, "train_runtime": 5217.0521, "train_tokens_per_second": 694.199 }, { "epoch": 1.9441496082891079, "grad_norm": 2.063349962234497, "learning_rate": 5.772151898734177e-07, "loss": 0.08102155476808548, "num_input_tokens_seen": 3623864, "step": 1924, "train_runtime": 5219.3159, "train_tokens_per_second": 694.318 }, { "epoch": 1.9451604751074045, "grad_norm": 1.8299205303192139, "learning_rate": 5.670886075949368e-07, "loss": 0.08363678306341171, "num_input_tokens_seen": 3625582, "step": 1925, "train_runtime": 5221.5195, "train_tokens_per_second": 694.354 }, { "epoch": 1.9461713419257012, "grad_norm": 1.599539041519165, "learning_rate": 5.569620253164558e-07, "loss": 0.05633139610290527, "num_input_tokens_seen": 3627172, "step": 1926, "train_runtime": 5223.689, "train_tokens_per_second": 694.37 }, { "epoch": 1.9471822087439978, "grad_norm": 1.3668630123138428, "learning_rate": 5.468354430379747e-07, "loss": 0.04236835986375809, "num_input_tokens_seen": 3628574, "step": 1927, "train_runtime": 5225.7862, "train_tokens_per_second": 694.359 }, { "epoch": 1.9481930755622947, "grad_norm": 1.6555768251419067, "learning_rate": 5.367088607594937e-07, "loss": 0.057802464812994, "num_input_tokens_seen": 3630570, "step": 1928, "train_runtime": 5228.0254, "train_tokens_per_second": 694.444 }, { "epoch": 1.9492039423805914, "grad_norm": 1.4538333415985107, "learning_rate": 5.265822784810127e-07, "loss": 0.044277213513851166, "num_input_tokens_seen": 3632622, "step": 1929, "train_runtime": 5230.2967, "train_tokens_per_second": 694.535 }, { "epoch": 1.950214809198888, "grad_norm": 1.9167815446853638, "learning_rate": 5.164556962025317e-07, "loss": 0.05408067628741264, "num_input_tokens_seen": 3634376, "step": 1930, "train_runtime": 5232.4821, "train_tokens_per_second": 694.58 }, { "epoch": 1.9512256760171849, "grad_norm": 1.5377455949783325, "learning_rate": 5.063291139240507e-07, "loss": 0.0610002763569355, "num_input_tokens_seen": 3636136, "step": 1931, "train_runtime": 5234.6709, "train_tokens_per_second": 694.626 }, { "epoch": 1.9522365428354815, "grad_norm": 1.8254579305648804, "learning_rate": 4.962025316455696e-07, "loss": 0.05765355005860329, "num_input_tokens_seen": 3637648, "step": 1932, "train_runtime": 5236.7901, "train_tokens_per_second": 694.633 }, { "epoch": 1.9532474096537782, "grad_norm": 1.6161350011825562, "learning_rate": 4.860759493670886e-07, "loss": 0.05342883989214897, "num_input_tokens_seen": 3639374, "step": 1933, "train_runtime": 5239.0551, "train_tokens_per_second": 694.662 }, { "epoch": 1.9542582764720748, "grad_norm": 1.8346822261810303, "learning_rate": 4.7594936708860764e-07, "loss": 0.05740257352590561, "num_input_tokens_seen": 3640998, "step": 1934, "train_runtime": 5241.2028, "train_tokens_per_second": 694.687 }, { "epoch": 1.9552691432903715, "grad_norm": 1.5896601676940918, "learning_rate": 4.658227848101266e-07, "loss": 0.05597972497344017, "num_input_tokens_seen": 3643372, "step": 1935, "train_runtime": 5243.4973, "train_tokens_per_second": 694.836 }, { "epoch": 1.9562800101086681, "grad_norm": 1.9486325979232788, "learning_rate": 4.556962025316456e-07, "loss": 0.07691022008657455, "num_input_tokens_seen": 3645376, "step": 1936, "train_runtime": 5245.7323, "train_tokens_per_second": 694.922 }, { "epoch": 1.9572908769269648, "grad_norm": 1.4963641166687012, "learning_rate": 4.455696202531646e-07, "loss": 0.07239636778831482, "num_input_tokens_seen": 3647236, "step": 1937, "train_runtime": 5247.9063, "train_tokens_per_second": 694.989 }, { "epoch": 1.9583017437452614, "grad_norm": 3.195930004119873, "learning_rate": 4.3544303797468356e-07, "loss": 0.08541422337293625, "num_input_tokens_seen": 3649178, "step": 1938, "train_runtime": 5250.1139, "train_tokens_per_second": 695.066 }, { "epoch": 1.959312610563558, "grad_norm": 1.5451648235321045, "learning_rate": 4.253164556962026e-07, "loss": 0.07356944680213928, "num_input_tokens_seen": 3651538, "step": 1939, "train_runtime": 5252.4399, "train_tokens_per_second": 695.208 }, { "epoch": 1.960323477381855, "grad_norm": 1.2501071691513062, "learning_rate": 4.1518987341772157e-07, "loss": 0.04627997800707817, "num_input_tokens_seen": 3653874, "step": 1940, "train_runtime": 5254.7628, "train_tokens_per_second": 695.345 }, { "epoch": 1.9613343442001516, "grad_norm": 2.022702217102051, "learning_rate": 4.0506329113924055e-07, "loss": 0.06978513300418854, "num_input_tokens_seen": 3655382, "step": 1941, "train_runtime": 5256.8885, "train_tokens_per_second": 695.351 }, { "epoch": 1.9623452110184483, "grad_norm": 1.7374645471572876, "learning_rate": 3.949367088607595e-07, "loss": 0.05413699895143509, "num_input_tokens_seen": 3656910, "step": 1942, "train_runtime": 5259.0068, "train_tokens_per_second": 695.361 }, { "epoch": 1.9633560778367452, "grad_norm": 1.7338082790374756, "learning_rate": 3.848101265822785e-07, "loss": 0.09035466611385345, "num_input_tokens_seen": 3658812, "step": 1943, "train_runtime": 5261.2642, "train_tokens_per_second": 695.424 }, { "epoch": 1.9643669446550418, "grad_norm": 1.4846956729888916, "learning_rate": 3.7468354430379753e-07, "loss": 0.054786644876003265, "num_input_tokens_seen": 3660618, "step": 1944, "train_runtime": 5263.5313, "train_tokens_per_second": 695.468 }, { "epoch": 1.9653778114733385, "grad_norm": 1.4887983798980713, "learning_rate": 3.645569620253165e-07, "loss": 0.04669232666492462, "num_input_tokens_seen": 3662816, "step": 1945, "train_runtime": 5265.7803, "train_tokens_per_second": 695.588 }, { "epoch": 1.966388678291635, "grad_norm": 1.803263783454895, "learning_rate": 3.544303797468355e-07, "loss": 0.062312956899404526, "num_input_tokens_seen": 3664510, "step": 1946, "train_runtime": 5267.9362, "train_tokens_per_second": 695.625 }, { "epoch": 1.9673995451099318, "grad_norm": 1.7119450569152832, "learning_rate": 3.4430379746835447e-07, "loss": 0.06583711504936218, "num_input_tokens_seen": 3666856, "step": 1947, "train_runtime": 5270.2745, "train_tokens_per_second": 695.762 }, { "epoch": 1.9684104119282284, "grad_norm": 1.9299792051315308, "learning_rate": 3.3417721518987345e-07, "loss": 0.06862461566925049, "num_input_tokens_seen": 3668630, "step": 1948, "train_runtime": 5272.4543, "train_tokens_per_second": 695.811 }, { "epoch": 1.969421278746525, "grad_norm": 1.6741821765899658, "learning_rate": 3.240506329113924e-07, "loss": 0.08114917576313019, "num_input_tokens_seen": 3670330, "step": 1949, "train_runtime": 5274.6507, "train_tokens_per_second": 695.843 }, { "epoch": 1.9704321455648217, "grad_norm": 1.4921934604644775, "learning_rate": 3.1392405063291146e-07, "loss": 0.0565418004989624, "num_input_tokens_seen": 3672008, "step": 1950, "train_runtime": 5276.7825, "train_tokens_per_second": 695.88 }, { "epoch": 1.9714430123831184, "grad_norm": 1.5650644302368164, "learning_rate": 3.037974683544304e-07, "loss": 0.07059604674577713, "num_input_tokens_seen": 3674074, "step": 1951, "train_runtime": 5285.7158, "train_tokens_per_second": 695.095 }, { "epoch": 1.9724538792014152, "grad_norm": 2.0831124782562256, "learning_rate": 2.9367088607594936e-07, "loss": 0.08382274210453033, "num_input_tokens_seen": 3676084, "step": 1952, "train_runtime": 5288.0106, "train_tokens_per_second": 695.173 }, { "epoch": 1.973464746019712, "grad_norm": 1.6316579580307007, "learning_rate": 2.835443037974684e-07, "loss": 0.06200099736452103, "num_input_tokens_seen": 3678154, "step": 1953, "train_runtime": 5290.2474, "train_tokens_per_second": 695.271 }, { "epoch": 1.9744756128380085, "grad_norm": 1.8981103897094727, "learning_rate": 2.7341772151898737e-07, "loss": 0.09692534059286118, "num_input_tokens_seen": 3680106, "step": 1954, "train_runtime": 5292.4631, "train_tokens_per_second": 695.348 }, { "epoch": 1.9754864796563054, "grad_norm": 1.4167271852493286, "learning_rate": 2.6329113924050635e-07, "loss": 0.03817079961299896, "num_input_tokens_seen": 3682152, "step": 1955, "train_runtime": 5294.7623, "train_tokens_per_second": 695.433 }, { "epoch": 1.976497346474602, "grad_norm": 1.6415997743606567, "learning_rate": 2.5316455696202533e-07, "loss": 0.05982155352830887, "num_input_tokens_seen": 3683756, "step": 1956, "train_runtime": 5296.9371, "train_tokens_per_second": 695.45 }, { "epoch": 1.9775082132928987, "grad_norm": 2.153597831726074, "learning_rate": 2.430379746835443e-07, "loss": 0.08247441798448563, "num_input_tokens_seen": 3685400, "step": 1957, "train_runtime": 5299.0824, "train_tokens_per_second": 695.479 }, { "epoch": 1.9785190801111954, "grad_norm": 2.303065776824951, "learning_rate": 2.329113924050633e-07, "loss": 0.09317882359027863, "num_input_tokens_seen": 3687110, "step": 1958, "train_runtime": 5301.2213, "train_tokens_per_second": 695.521 }, { "epoch": 1.979529946929492, "grad_norm": 1.790480136871338, "learning_rate": 2.227848101265823e-07, "loss": 0.05739545449614525, "num_input_tokens_seen": 3688784, "step": 1959, "train_runtime": 5303.3326, "train_tokens_per_second": 695.56 }, { "epoch": 1.9805408137477887, "grad_norm": 1.775923490524292, "learning_rate": 2.126582278481013e-07, "loss": 0.09501507878303528, "num_input_tokens_seen": 3690750, "step": 1960, "train_runtime": 5305.5403, "train_tokens_per_second": 695.641 }, { "epoch": 1.9815516805660853, "grad_norm": 1.9084643125534058, "learning_rate": 2.0253164556962027e-07, "loss": 0.07032062858343124, "num_input_tokens_seen": 3692700, "step": 1961, "train_runtime": 5307.7393, "train_tokens_per_second": 695.72 }, { "epoch": 1.982562547384382, "grad_norm": 1.9343383312225342, "learning_rate": 1.9240506329113925e-07, "loss": 0.06499311327934265, "num_input_tokens_seen": 3694398, "step": 1962, "train_runtime": 5309.9181, "train_tokens_per_second": 695.754 }, { "epoch": 1.9835734142026786, "grad_norm": 2.3557677268981934, "learning_rate": 1.8227848101265826e-07, "loss": 0.09849251061677933, "num_input_tokens_seen": 3695908, "step": 1963, "train_runtime": 5312.0324, "train_tokens_per_second": 695.762 }, { "epoch": 1.9845842810209755, "grad_norm": 1.6780991554260254, "learning_rate": 1.7215189873417723e-07, "loss": 0.07726100087165833, "num_input_tokens_seen": 3698094, "step": 1964, "train_runtime": 5314.302, "train_tokens_per_second": 695.876 }, { "epoch": 1.9855951478392722, "grad_norm": 1.810806155204773, "learning_rate": 1.620253164556962e-07, "loss": 0.08548904210329056, "num_input_tokens_seen": 3700184, "step": 1965, "train_runtime": 5316.6599, "train_tokens_per_second": 695.96 }, { "epoch": 1.986606014657569, "grad_norm": 1.9527696371078491, "learning_rate": 1.518987341772152e-07, "loss": 0.06699540466070175, "num_input_tokens_seen": 3701876, "step": 1966, "train_runtime": 5318.882, "train_tokens_per_second": 695.988 }, { "epoch": 1.9876168814758657, "grad_norm": 1.7017799615859985, "learning_rate": 1.417721518987342e-07, "loss": 0.06659930944442749, "num_input_tokens_seen": 3703512, "step": 1967, "train_runtime": 5321.0459, "train_tokens_per_second": 696.012 }, { "epoch": 1.9886277482941623, "grad_norm": 1.539168119430542, "learning_rate": 1.3164556962025317e-07, "loss": 0.0572090670466423, "num_input_tokens_seen": 3705336, "step": 1968, "train_runtime": 5323.2245, "train_tokens_per_second": 696.07 }, { "epoch": 1.989638615112459, "grad_norm": 2.168595790863037, "learning_rate": 1.2151898734177215e-07, "loss": 0.07186886668205261, "num_input_tokens_seen": 3707076, "step": 1969, "train_runtime": 5325.4064, "train_tokens_per_second": 696.111 }, { "epoch": 1.9906494819307556, "grad_norm": 1.9676153659820557, "learning_rate": 1.1139240506329114e-07, "loss": 0.08913262188434601, "num_input_tokens_seen": 3708656, "step": 1970, "train_runtime": 5327.5351, "train_tokens_per_second": 696.13 }, { "epoch": 1.9916603487490523, "grad_norm": 1.9166979789733887, "learning_rate": 1.0126582278481014e-07, "loss": 0.07388445734977722, "num_input_tokens_seen": 3710238, "step": 1971, "train_runtime": 5329.6526, "train_tokens_per_second": 696.15 }, { "epoch": 1.992671215567349, "grad_norm": 1.543239951133728, "learning_rate": 9.113924050632913e-08, "loss": 0.06998427212238312, "num_input_tokens_seen": 3712330, "step": 1972, "train_runtime": 5331.8629, "train_tokens_per_second": 696.254 }, { "epoch": 1.9936820823856456, "grad_norm": 2.1475512981414795, "learning_rate": 8.10126582278481e-08, "loss": 0.07976119220256805, "num_input_tokens_seen": 3713826, "step": 1973, "train_runtime": 5333.9966, "train_tokens_per_second": 696.256 }, { "epoch": 1.9946929492039422, "grad_norm": 1.6464298963546753, "learning_rate": 7.08860759493671e-08, "loss": 0.06630692631006241, "num_input_tokens_seen": 3716112, "step": 1974, "train_runtime": 5336.2694, "train_tokens_per_second": 696.388 }, { "epoch": 1.9957038160222391, "grad_norm": 1.7383606433868408, "learning_rate": 6.075949367088608e-08, "loss": 0.07431012392044067, "num_input_tokens_seen": 3717602, "step": 1975, "train_runtime": 5338.396, "train_tokens_per_second": 696.389 }, { "epoch": 1.9967146828405358, "grad_norm": 1.1304759979248047, "learning_rate": 5.063291139240507e-08, "loss": 0.03536690026521683, "num_input_tokens_seen": 3719202, "step": 1976, "train_runtime": 5340.5275, "train_tokens_per_second": 696.411 }, { "epoch": 1.9977255496588324, "grad_norm": 1.9554280042648315, "learning_rate": 4.050632911392405e-08, "loss": 0.07763595134019852, "num_input_tokens_seen": 3720932, "step": 1977, "train_runtime": 5342.7, "train_tokens_per_second": 696.452 }, { "epoch": 1.9987364164771293, "grad_norm": 1.8227564096450806, "learning_rate": 3.037974683544304e-08, "loss": 0.06695139408111572, "num_input_tokens_seen": 3722462, "step": 1978, "train_runtime": 5344.7916, "train_tokens_per_second": 696.465 }, { "epoch": 1.999747283295426, "grad_norm": 1.4120136499404907, "learning_rate": 2.0253164556962027e-08, "loss": 0.07311323285102844, "num_input_tokens_seen": 3724864, "step": 1979, "train_runtime": 5347.1284, "train_tokens_per_second": 696.61 }, { "epoch": 2.0, "grad_norm": 18.52170181274414, "learning_rate": 1.0126582278481013e-08, "loss": 0.13481095433235168, "num_input_tokens_seen": 3724995, "step": 1980, "train_runtime": 5347.6879, "train_tokens_per_second": 696.562 }, { "epoch": 2.0, "eval_loss": 0.39007651805877686, "eval_runtime": 52.4712, "eval_samples_per_second": 16.752, "eval_steps_per_second": 8.386, "num_input_tokens_seen": 3724995, "step": 1980 } ], "logging_steps": 1, "max_steps": 1980, "num_input_tokens_seen": 3724995, "num_train_epochs": 2, "save_steps": 30, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.334151885669696e+16, "train_batch_size": 2, "trial_name": null, "trial_params": null }